Cost & Latency

成本与延迟优化:让 AI 功能真正可用

体验优化 · 9 分钟阅读 · 更新于 2026-06-30

AI 功能能不能长期使用,常常取决于两件事:用户等不等得起,业务付不付得起。成本和延迟不是上线后的优化项,而应该在架构设计时就进入决策。

分层使用模型

不是所有任务都需要最强模型。分类、路由、去重、格式校验可以用更轻的模型;复杂推理、关键答案和高风险决策再使用强模型。分层策略能显著降低成本。

缓存重复工作

知识库检索、文档摘要、常见问题答案、工具查询结果,都可能被缓存。缓存要注意有效期和权限,不能把一个用户的私有结果复用给另一个用户。

流式输出改善等待感

如果任务本身需要较长时间,流式输出可以先给用户反馈,让等待变得可感知。对工具调用链路,还可以展示当前步骤和预计下一步。

压缩上下文

上下文越长,成本和延迟通常越高。通过检索重排、摘要状态、去重和字段化输入,可以把真正必要的信息留给模型。

优化清单

  • 按任务复杂度选择不同模型。
  • 缓存稳定且权限安全的中间结果。
  • 对长任务使用流式输出和步骤提示。
  • 压缩历史上下文,保留关键事实。
  • 监控每类任务的平均成本和 P95 延迟。
Keep Reading

继续阅读

← 返回全部文章