AI 功能能不能长期使用,常常取决于两件事:用户等不等得起,业务付不付得起。成本和延迟不是上线后的优化项,而应该在架构设计时就进入决策。
分层使用模型
不是所有任务都需要最强模型。分类、路由、去重、格式校验可以用更轻的模型;复杂推理、关键答案和高风险决策再使用强模型。分层策略能显著降低成本。
缓存重复工作
知识库检索、文档摘要、常见问题答案、工具查询结果,都可能被缓存。缓存要注意有效期和权限,不能把一个用户的私有结果复用给另一个用户。
流式输出改善等待感
如果任务本身需要较长时间,流式输出可以先给用户反馈,让等待变得可感知。对工具调用链路,还可以展示当前步骤和预计下一步。
压缩上下文
上下文越长,成本和延迟通常越高。通过检索重排、摘要状态、去重和字段化输入,可以把真正必要的信息留给模型。
优化清单
- 按任务复杂度选择不同模型。
- 缓存稳定且权限安全的中间结果。
- 对长任务使用流式输出和步骤提示。
- 压缩历史上下文,保留关键事实。
- 监控每类任务的平均成本和 P95 延迟。