AI
面向客户的 AI 智能体为什么需要备用模型
模型提供方出了一个小时的故障,您的 WhatsApp 智能体就会沉默,客户只能干等。备用模型是应对这种情况最便宜的保险。本文介绍备用机制如何工作、如何挑选备用模型,以及它与快速模型和预算如何配合。
MonoChat 团队 更新于: 1 分钟阅读
本页内容
面向客户的 AI 智能体需要备用模型,因为每个模型迟早都会在最糟糕的时刻出问题:提供方发生中断、您的账户触发速率限制、请求超时,或者某场不寻常的会话消耗的 token 超出计划。没有备用模型,智能体就会沉默,客户只能等待;有了备用模型,第二个模型接手,会话得以继续。在 MonoChat 的 Agent Harness 中,每个 AI 智能体节点都有主模型、备用模型和快速模型,以及每次运行的预算限制。
本文将说明为什么模型故障在客户消息场景中比其他任何地方都更要紧、备用机制如何工作、如何选择备用模型,以及它与快速模型、预算和转人工如何配合。
为什么模型故障在客户会话中危害更大
在内部工具中,AI 请求失败只是个小麻烦:点一下重试即可。但在 WhatsApp 上的客户会话中,这是一次失约。客户提了问题,看到了蓝色对勾,正在等待答复。
有几点使客户消息场景尤其敏感:
- 客户不会重试。 他们会再发一条,而且更加不耐烦,或者直接离开。
- 流量波动剧烈。 一次营销活动、一次配送延误或一次促销,可能在几分钟内让会话成倍增加,而这恰恰是速率限制发挥作用的时候。
- 智能体会进行大量调用。 智能体 Harness 会循环运行模型,每条客户消息往往要调用多次。一次调用失败就可能让整个运行停滞。
- WhatsApp 上时间很关键。 只有在客户最后一条消息后的 24 小时内才允许自由回复。长时间停滞可能让回复落到窗口之外,此时您就需要已获批准的模板。
这一切都不是说某个提供方不可靠。每个提供方都会有事故、维护和容量限制。问题只在于,您的智能体是否对此有预案。
可能出什么问题
提供方中断。 部分或全部,短暂或持久。即使每月 99.9% 的可用性,也允许超过 40 分钟的停机。
速率限制。 您的账户可能每分钟只允许一定数量的请求或 token。即使提供方本身一切正常,繁忙的一小时也可能触及这个上限。
超时和响应缓慢。 平时两秒内作答的模型,在高负载下可能需要二十秒。对手机上的客户来说,这感觉就像什么都没发生。
失控的运行。 智能体在一个令人困惑的请求上陷入循环,或者会话不断变长,消耗的资源可能远超正常运行。
模型变更。 提供方会更新和淘汰模型。您依赖的某种行为可能在几乎没有预警的情况下改变。
智能体中的备用机制如何工作
思路很简单:当主模型无法完成任务时,第二个模型接手。在 MonoChat 中,备用模型会在达到软限制或主模型失败后接手。会话、工具和指令保持不变,变化的只是执行工作的模型。
每个 AI 智能体节点中有三种角色协同工作:
| 角色 | 作用 |
|---|---|
| 主模型 | 负责推理、决策并撰写回复 |
| 备用模型 | 在达到软限制或失败后接手 |
| 快速模型 | 处理后台工作 |
在这些角色之外,每次运行的预算限制为单场会话的花费设定上限。
如何选择备用模型
优先选择不同的提供方
来自同一提供方的备用模型可以防范某一个模型表现异常,但无法防范提供方整体事故,或您在该提供方账户上的速率限制。来自第二个提供方的模型则两者都能覆盖。MonoChat 允许您通过自定义 LLM 连接多个提供方,所以这只是一个配置选择,而不是一个项目。
足够好即可,不必完全相同
备用模型不必是可用的最佳模型。它需要遵循您的指令、正确调用您的工具,并写出像样的回复。在依赖它之前,请像对待主模型那样,用您真实的会话单独测试它。
确认它能处理您的工具
智能体依赖工具调用:查询订单、检查时段、创建工单。有些模型在结构化工具调用上比其他模型强得多。文字写得漂亮但工具调用出错的备用模型,还不如没有。
留意您服务的语言
如果您的客户使用土耳其语、阿拉伯语或西班牙语,请确保备用模型书写这些语言的水平与主模型一样好。质量或语气的突然变化会被察觉。
两个方向都要考虑成本
较便宜的备用模型可以降低超出软限制的长时间或不寻常运行的成本。如果它只处理罕见的故障,较昂贵的备用模型也未尝不可。请决定您希望备用模型承担什么工作。
快速模型:可靠性的另一半
并非每一步都需要您最好的模型。后台工作,即围绕会话而非回复本身的任务,可以交给更小、更快的模型。这样可以把主模型的容量和预算留给客户真正看到的内容,并降低繁忙时段主模型触及速率限制的几率。
实际做法是:把推理能力最强的模型作为主模型,把来自第二个提供方的可靠模型作为备用模型,并用一个快速、廉价的模型处理后台工作。
预算:保险之下的安全网
备用模型让智能体持续工作,预算则让它花费可控。每次运行的预算限制意味着无论会话多么奇怪,单场会话的花费都不会超出您的计划。再结合达到软限制后由备用模型接手的机制,您就得到一种可预期的模式:正常会话在主模型上运行,较长会话在备用模型上继续,一切不会失控。
使用您自己的提供方密钥时,MonoChat 不对 AI 加价,因此您预算多少,就是您的提供方收取多少。
备用模型不等于转人工
人们很容易把备用模型当作所有问题的答案。其实不是。备用模型解决的是技术故障:模型宕机、变慢或预算用尽。转人工解决的是判断力问题:投诉、法律问题、超出您额度的退款,或者客户干脆要求找真人。
在 MonoChat 中,智能体在流程内运行,因此随时都可以带着完整历史记录转交给您的共享团队收件箱。WhatsApp 也期望自动回复提供一条通往真人的清晰路径。请把两条路径都设计好:
- 主模型失败或达到软限制 → 备用模型继续。
- 案件需要真人 → 带着会话历史记录转交给合适的团队。
- 两者都失败 → 流程告知客户将有专人回复,并将会话路由到收件箱。
一份简单的检查清单
- 主模型根据您真实会话中的质量来选择。
- 备用模型来自第二个提供方,并已结合您的工具和语言单独测试。
- 快速模型用于后台工作。
- 每次运行的预算限制与您正常会话的成本相符,并留有一定余量。
- 在智能体的指令和流程中设置明确的转人工规则。
- 第一周之后抽查一批会话,包括任何在备用模型上运行的会话。
一次设置,适用于所有渠道
由于 AI 智能体节点位于 MonoChat 流程中,同样的主模型、备用模型和快速模型可以在 WhatsApp、Instagram、Messenger、TikTok、Telegram、网页聊天、短信和语音上保护您的智能体。而且由于 Agent Harness 允许您选择框架,无论您的智能体运行在 MonoChat 的内置 Harness、Claude Agent SDK、OpenAI Agents SDK、Pi,还是您自己的框架上,这一做法都同样适用。
请在 Agent Harness 页面了解各模型角色如何配合。
用 MonoChat 付诸实践