AI 功能上线不是终点。模型行为会随着数据、提示词、工具、业务规则和用户习惯变化而变化。没有评估与治理,系统会悄悄漂移,直到用户用一次严重错误提醒你。
评估指标要分层
不要把所有问题都压缩成一个“准确率”。建议至少分成六类:任务完成度、事实忠实度、格式合规性、安全合规性、响应成本、用户满意度。不同场景可以给不同权重。
建立黄金样例集
黄金样例集来自真实业务问题,包含标准答案、必要依据、拒答条件和评分说明。它不需要一开始很大,但必须持续维护。每次模型、提示词或检索策略改动,都应该跑回归。
把日志设计成产品能力
日志不只是排障文件。它应该记录输入、上下文来源、模型版本、工具调用、输出、用户反馈和安全命中规则。只有这些信息齐全,团队才能把一次错误变成下一轮改进。
治理流程要清楚
当用户反馈错误答案时,谁判断严重性?谁修复样例?谁批准上线?谁通知相关业务方?AI 系统越接近核心流程,这些责任越需要明确。
上线检查表
- 是否有覆盖高频和高风险场景的样例集。
- 是否能追踪每个答案的上下文和模型版本。
- 是否有敏感信息、越权访问和危险动作拦截。
- 是否定义了人工接管、回滚和用户反馈入口。
- 是否监控成本、延迟、错误率和拒答率。
治理不是一次审批
很多团队会在上线前做一次安全评审,但上线后缺少日常治理。更合理的做法是把治理融入运营节奏:每周看失败案例,每月复盘指标变化,每次模型升级都跑回归,每个严重反馈都进入问题库。
让指标服务决策
如果拒答率上升,可能是安全规则过紧,也可能是检索结果不足;如果成本上升,可能是上下文太长,也可能是工具调用重复。指标本身不解决问题,但能帮助团队定位该调哪一层。
评估不是为了证明模型完美,而是为了让团队知道什么时候可以信任它,什么时候必须介入。