核心结论
AI 客服的成败很少败在模型能力上,多数败在链路工程:延迟、打断、噪声、并发。本报告把实时语音链路拆成四段逐一评估,并给出一套按「一通电话」计算的成本模型与混合坐席的临界点判断。
01 · 实时语音链路的四个环节
一通 AI 电话由四段组成:语音识别(ASR)、对话理解与大模型生成、语音合成(TTS)、音视频传输。任何一段出现延迟或断点,用户都会把它算在「AI 不好用」头上。
~1s端到端响应延迟(流式 + 打断)
<300ms传输环节可压到的量级
4 段需要联调的环节数
1 套统一编排比分散拼接更好维护
实测中最大的延迟来源往往不是模型本身,而是非流式调用与串行等待。把 ASR、LLM、TTS 全部改成流式并允许用户随时打断,体感差异远大于换一个更强的模型。
02 · 选型对比:自建、拼装与一体化
| 方案 | 上手成本 | 延迟可控性 | 运维负担 | 适合场景 |
|---|---|---|---|---|
| 完全自建 | 高 | 高 | 高 | 有专门媒体团队、规模极大 |
| 多家云服务拼装 | 中 | 中 | 中 | 已有既有技术栈,愿意自己联调 |
| 一体化实时语音方案 | 低 | 高 | 低 | 业务优先、想快速上线 |
选型建议:先确认团队有没有能力长期维护一条实时媒体链路。如果没有,一体化方案省下的不只是工期,还有上线后每一通异常电话的排查时间。
03 · 单次会话成本拆解
成本要按「一通电话」来算,而不是按「一次调用」。把四段费用相加,再叠上并发峰值与重试损耗,才是真实成本。
4 项需计入的计费项
峰值并发按峰值而非均值预留
静音检测最有效的降本开关
缓存话术合成成本可显著下降
降本顺序:先做静音检测与按需唤醒,再做话术缓存,最后才考虑换更便宜的模型——顺序反过来,通常要返工。
04 · AI 与人工坐席的临界点
- 短时、意图明确(查询 / 通知 / 确认):AI 坐席单位成本更低
- 长尾协商、情绪安抚、复杂投诉:人工介入性价比更高
- 推荐形态:AI 首接 + 人工兜底,按意图复杂度动态路由
- 评估指标不要只看成本,还要看一次解决率与满意度
写在最后
AI 客服的成败很少败在模型能力上,多数败在链路工程:延迟、打断、噪声、并发。任何方案在纸面上都成立,建议拿试用额度用你自己的话术跑一遍真实通话,再决定选谁。
