传统软件上线后,输入输出大多可预测。AI 应用不同:模型版本会变,提示词会变,检索资料会变,用户问法也会变。LLMOps 的核心不是把服务跑起来,而是让团队知道系统为什么变好或变差。
日志要能复盘一次回答
一次 AI 输出至少要记录用户输入、系统提示、检索上下文、模型版本、工具调用、输出结果、耗时、成本和安全规则命中情况。没有这些信息,错误只能靠猜。
评估要进入发布流程
提示词、模型、检索参数、工具 schema 的每次改动,都应该跑固定样例集。评估结果要和变更记录绑定,方便回看“为什么当时决定上线”。
反馈要变成数据资产
用户点踩、人工纠错、客服转人工、审核退回,都应该进入问题库。问题库不是抱怨集合,而是下一轮样例集、规则和产品改进的来源。
回滚能力很重要
AI 系统的退化可能很隐蔽。上线新模型后,如果拒答率、投诉率或成本异常,需要能快速切回旧版本。模型、提示词和检索配置都要有版本号。
LLMOps 基础设施
- 统一记录 prompt、context、model、tools 和 output。
- 固定样例集和人工抽检流程。
- 配置版本管理和快速回滚。
- 面向业务的效果看板。
- 用户反馈到样例集的处理流程。