首页 / 文章 / 实时客户支持代理与后备路由
← 返回
IT技术

实时客户支持代理与后备路由

✍️ zhirenhun 📅 2026/8/6 👁 201 阅读 ⏱ 24 分钟
实时客户支持代理与后备路由

引言

客户支持是AI代理最强大的应用场景之一。它涉及重复性问题、时间压力、信息查找以及对准确答案的需求。每天有数百万家企业收到相同类型的问题和请求。我的订单在哪里?我想要退款。无法访问我的账户。这个功能如何工作?这与……兼容吗?这要多少钱?我对这个产品不满意。

理论上,一个经过适当训练的AI客户支持代理可以即时响应这些请求中的大部分,从而降低运营成本并让客户满意。然而,并非每个客户请求都具有相同的复杂程度。有些请求简单且风险低。其他请求则更为敏感、模糊或对业务至关重要。

这对于开发AI驱动的支持代理的企业来说是一个重大挑战。虽然一个快速且廉价的模型可能足以回答简单查询,但当客户的意图不明确、问题涉及情绪敏感、法律风险或需要高度专业技术知识时,它可能会导致代理出错。另一方面,使用更强大的模型来处理每条消息可能成本高昂并引入延迟,随着对话量的增长这会成为问题。更好的解决方案是设计一个带有回退路由的客户支持代理。

本文解释了如何构建这样的系统。它涵盖了支持代理的架构、路由器的角色、基于置信度的回退如何工作,以及如何在路由器配置中定义优先级和成本约束。

要点总结

  • 回退路由在速度、成本和答案质量之间取得平衡,将常规问题发送给快速模型,将复杂案例发送给更强的模型。
  • 置信度评分至关重要,因为系统需要明确的阈值来决定主要模型的答案何时足够安全和完整以进行发送。
  • 优先级类别改善业务决策,为敏感、高价值或升级的客户问题提供更高质量的处理。
  • 成本控制防止过度使用昂贵模型,通过设置每条消息、每次对话、每个客户层级以及整个平台的限制。
  • 最好的AI支持代理不仅仅是聊天机器人;它是一个智能工作流,在必要时结合了路由、检索、评估、升级和人工交接。

什么是回退路由?

回退路由是一种AI编排模式,其中请求首先被路由到主要模型(通常基于速度和成本考虑而选择)。然后评估答案质量。如果答案达到既定的置信度、安全性和策略阈值,则将其返回给客户。否则,请求将被路由到更强的模型、专业模型、人工代理或其他工作流。

图片

回退路由对许多客户支持用例很有用,因为客户支持工作负载往往非常不平衡。很大比例的工单可以路由到轻量级模型,因为它们完全是重复性的。较小比例的工单需要更高级的推理能力、更好的指令遵循、更谨慎的语气或访问高级工具。回退机制可以由多种信号触发:

  • 置信度得分低
  • 答案缺失或不完整
  • 客户不满
  • 敏感话题
  • 高价值客户
  • 复杂技术问题
  • 策略不确定性
  • 知识库检索失败
  • 矛盾信息
  • 用户反复表示不满

回退路由器充当AI支持系统的流量控制器。它决定每个请求应由哪个模型处理、何时需要升级,以及系统允许花费多少成本。

实时回退支持代理的核心架构

具有回退路由的实时客户支持代理通常包含多个组件。

图片

1. 客户通过某些客户支持渠道输入消息,如在线聊天、电子邮件、WhatsApp、网站聊天小部件、移动应用、帮助台软件等。

2. 意图分类器对此请求可能属于哪种类型进行分类(即账单、退款、技术支持、物流、账户访问、投诉等)。

3. 检索层查询相应的公司知识库。

这可以是常见问题解答存储库、产品文档、订单数据库、CRM或工单历史记录。模型在生成答案之前需要可靠的上下文。

4. 路由器检查请求并决定应由哪个模型来满足该请求。通常,默认或主要路由指向最便宜和最快的模型。但路由器也可能检查客户层级、请求的主题(某些主题可能敏感,需要高质量模型)、答案的预期难度、当前系统负载、可用的延迟预算以及可用的成本预算。

5. 如果允许响应请求,主要模型生成其答案。然后该答案可能会由某种置信度检查器进行评估。置信度可以使用置信度得分阈值、检索质量、策略合规性、检测不确定语言、答案完整性、客户情绪等来评估。

6. 最后,系统要么返回答案,要么升级到更强的模型,要么向客户请求澄清,要么将对话转移给人工支持代理。

主要路由:快速且廉价的模型

主模型是指客户支持代理使用的初始模型。该模型应非常快速、运行成本低,并且对于回答常规查询具有可接受的质量。将你的主模型用于以下任务:

  • 回答常见问题。
  • 总结简单的政策
  • 提供订单跟踪指导
  • 解释基本账户步骤
  • 收集缺失的信息
  • 确定客户意图
  • 起草简短的支持回复
  • 适当地路由工单

主模型不必处理所有情况。它应当能够自信地解决大多数简单请求。大多数客户支持对话都是直接了当的任务。它们不需要复杂推理;它们需要正确的检索、清晰的语言和快速的响应。

如果客户问:“我如何重置密码?”主模型应当能够检索密码政策,生成简洁的回复,并在无需升级的情况下结束对话。

图片

然而,如果客户问:“我被重复收费了,客户支持没有回应我,我现在要求退款。”该询问涉及账单问题、投诉跟进、潜在的客户不满以及退款政策。代理路由器可以判断主模型不具备处理这种复杂性的能力,并可以升级到更强的模型。

备用路由:用于低置信度案例的更强模型

备用模型应具备更强的能力,但通常以更慢和/或更昂贵为代价。启用备用模型可以实现更好的推理、更强的指令遵循能力、仔细的政策解读,以及更好地处理歧义。如果主模型的响应未通过所需的置信度检查,则可以在其响应后触发回退。另外,如果路由器认为该案例具有高优先级或高风险,也可以在生成之前选择备用模型。

备用模型可以帮忙处理的案例:

  • 复杂的故障排除
  • 需要多步推理的案例
  • 客户退款纠纷
  • 合同或定价解释
  • 企业客户问题
  • 愤怒/情绪化的客户
  • 不完整/矛盾的知识库结果
  • 涉及合规或法律敏感性的案例
  • 主模型表达不确定性的情况

回退过程不应被客户察觉。用户不应知道系统切换了模型。对话应正常进行。除了更好的响应之外,不应有任何迹象表明使用了回退系统。

一个好的回退系统还可以通过将主模型的草稿答案传递给更强的模型来工作。然后更强的模型可以编辑、验证或替换该草稿答案。这可以减少重复工作,并帮助回退模型了解其首次响应为何不充分。

路由器中的置信度评分

置信度评分是回退路由中最关键的组成部分之一。系统需要知道何时信任主答案,何时不信任。评分置信度的信号可以包括:

图片

  • 检索置信度。如果我们的知识库搜索返回了高度相关的文档,模型很可能能够正确回答。如果检索步骤没有结果或返回了相关性弱的文档,答案的可靠性就会降低。
  • 模型自我评估。可以提示模型在生成答案时同时生成结构化的置信度分数。自我评估分数不应单独使用,因为语言模型通常过度自信。最好与外部验证结合使用。
  • 答案验证。另一个模型可以充当安全评估器,评估答案是否遵循公司政策、是否使用检索到的上下文、是否没有未经支持的断言,以及是否解决了客户的问题。
  • 客户情绪。如果用户听起来愤怒、困惑或不满意,系统应提高升级概率。
  • 业务优先级。这是VIP客户吗?这是企业账户吗?该用户是否有支付问题?这些因素可能意味着你需要一个比平常用于看似简单请求的模型“更强”的模型。

在做出路由决策之前,可以创建一个考虑上述每个方面的实用置信度分数。

例如,让我们考虑以下内容:

confidence_policy:
 minimum_confidence: 0.78
 fallback_if:
   retrieval_score_below: 0.70
   answer_completeness_below: 0.75
   policy_risk_above: 0.40
   customer_sentiment: "angry"
   contains_sensitive_topic: true

在此配置中,答案在发送给客户之前必须通过多项检查。如果一项或多项检查失败,系统会自动使用备用路由。

在路由器配置中定义优先级

优先级应定义哪些请求获得更好的模型、更快的响应或人工升级。在现实的支持环境中,并非所有工单都具有同等的业务价值。对免费用户延迟回复可能没问题,但向企业客户发送糟糕的答案可能会损害业务关系。路由器配置应使优先级类别清晰明了。

例如:

priority_classes:
 low:
   examples:
     - general_faq
     - product_information
     - password_reset
   primary_model: fast_support_model
   fallback_model: standard_reasoning_model
   max_latency_ms: 2500
   max_cost_per_request_usd: 0.01

 medium:
   examples:
     - billing_question
     - subscription_change
     - technical_issue
   primary_model: fast_support_model
   fallback_model: advanced_support_model
   max_latency_ms: 5000
   max_cost_per_request_usd: 0.05

 high:
   examples:
     - refund_dispute
     - escalated_customer
     - enterprise_account
     - legal_or_compliance_topic
   primary_model: advanced_support_model
   escalation_target: human_agent
   max_latency_ms: 8000
   max_cost_per_request_usd: 0.20

配置显示,低优先级问题由快速模型处理,并设有严格的成本限制。中等优先级问题可以升级到更强的备用模型。高优先级问题则可以负担得起从更强的模型开始,并在必要时回退到人工处理。

目标不仅仅是降低AI成本。目标是智能地花费。路由器应该在业务风险更高的地方投入更多资源。

实时处理延迟

实时支持需要低延迟。客户期望立即得到响应,尤其是在实时聊天中。如果不仔细设计,备用路由可能会增加延迟,因为系统可能会先调用一个模型,评估答案,然后再调用另一个模型。为了减少延迟,路由器可以采用多种策略:

  • 预**路由**:路由器不必总是先尝试主模型,而是可以在生成之前分析传入请求并检测高风险请求。然后只将高风险请求发送给更强的模型。
  • 并行**评估**:当模型生成响应时,路由器可以同时执行检索检查、策略检查、情感分析等操作。
  • 流式传输:支持代理可以先发出一段简短的确认信息,而系统在同一请求流程的后台完成更深层次的推理。例如,代理可能会在给出最终答案之前说:“我现在正在检查您的账户详细信息。”
  • 缓存常见响应:对重复的常见问题式请求复用已批准的响应。
  • 在升级前提出澄清问题:如果客户的问题不明确,系统可以尝试先提出一个澄清问题,而不是立即将其发送给昂贵的模型。

定义成本约束

成本约束使您的AI支持系统保持可持续性。如果没有成本约束,备用路由或升级可能触发过于频繁,从而抵消主模型节省的成本。成本约束应在多个层面应用:

  • 每次请求:限制单个客户消息的支出。
  • 每段对话:管理冗长支持线程的整体费用。
  • 每天/每月:防止意外的使用高峰。
  • 每个客户层级:允许企业用户比免费用户拥有更高的支出。

一个实用的路由器配置可能如下所示:

cost_controls:
 default:
   max_cost_per_message_usd: 0.02
   max_cost_per_conversation_usd: 0.15
   max_fallbacks_per_conversation: 2

 customer_tiers:
   free:
     max_cost_per_conversation_usd: 0.05
     allow_human_escalation: false
     fallback_mode: cheapest
   pro:
     max_cost_per_conversation_usd: 0.20
     allow_human_escalation: true
     fallback_mode: balanced
   enterprise:
     max_cost_per_conversation_usd: 1.00
     allow_human_escalation: true
     fallback_mode: quality_first
     prefer_advanced_model: true

 global_budget:
   daily_limit_usd: 500
   action_when_limit_reached: degrade_to_primary_model
   output_length_policy: shorten
   escalation_policy: restrict_to_high_priority

cost_controls 指定了支持平台在每条消息和每个会话上如何消耗 AI 积分、如何平衡会话,以及全局每日预算。在本例中,每条消息最高花费 2 美分,每个会话最高花费 0.15 美元。我们允许每个会话有两次失败的回退尝试。

我们还为免费用户、专业版用户和企业版用户配置了分层限制。免费用户获得最低的会话预算(0.05 美元),不允许升级到人工客服,并使用最便宜的回退模式。专业版用户获得更大的预算,可以升级到人工客服,并使用均衡回退模式。企业版用户获得最大的预算,并可使用人工升级、质量优先路由以及对高级模型的偏好。

最后,我们为整个平台设置了每日预算。如果当天 AI 积分消耗达到 500 美元,我们将全面停止使用昂贵的功能。我们将只使用主模型、缩短输出,并禁止升级(高优先级案例除外)。

端到端场景示例

假设一位客户写道:“我为专业版计划付了款,但我的账户仍然显示免费版。我非常沮丧,因为我今天就需要用到。”

意图分类器将账单/账户访问识别为主要主题。情感检测器将这条评论识别为负面情绪,具体来说是沮丧。客户层级目前是免费版,但消息中提到了专业版付款。检索系统找到关于账单故障排查的帮助文章。

路由器判断这不是一个简单的常见问题解答。这可能是一个带有明显不满情绪、且可能存在付款失败的账单问题。由于策略允许对中等优先级的账单问题进行一次尝试,该请求被路由到主快速模型。

图片

主模型生成了一个答案,但置信度检查器显示该答案过于笼统,没有解释用户在付款成功但账户激活未发生时可以采取什么措施。置信度分数低于阈值。

路由器将请求升级到更强的模型。更强的模型将检索到的策略纳入考量,并生成了一个有用得多的答案。该模型道歉、解释可能的原因、在必要时询问交易 ID,并主动提出为客户创建支持工单以进行人工验证。

如果账户查询工具确认付款成功,则可以自动将请求升级到人工账单专员来处理激活。如果未找到付款记录,专员可以引导客户完成确认步骤。

常见问题解答

  • 什么是 AI 客户支持中的回退路由?

回退路由是一种 AI 编排方法,请求首先发送到快速、低成本的模型,当置信度、安全性或策略检查未通过时,升级到更强的模型或人工客服。

  • 为什么不将每个客户请求都发送给最强的模型?

对每个请求都使用最强的模型会提高质量,但也会增加成本和延迟。回退路由有助于将昂贵的模型保留给复杂、敏感或高风险的案例。

  • 支持请求何时应回退到更强的模型?

当主模型置信度低、给出的答案不完整、检测到客户沮丧情绪、面临策略不确定性,或处理账单、退款、法律问题或企业账户等敏感话题时,应触发回退。

  • 路由器如何决定使用哪个模型?

路由器会评估客户意图、检索质量、置信度分数、客户情绪、业务优先级、延迟预算和成本约束等因素。

  • 回退路由能否降低客户支持成本?

可以。它允许简单请求由较便宜的模型处理,同时将更强的模型或人工客服保留给质量和风险管理最为重要的案例。

结论

回退路由使 AI 客户支持变得实用、可靠且具有成本效益。回退路由并非将所有请求都通过最高成本的模型处理,或仅依赖最便宜的模型,而是根据置信度、风险阈值、案例复杂性、客户优先级及其他业务规则进行智能路由。简单请求可以立即路由到轻量级模型以获得快速响应时间。高风险、复杂、低置信度的请求可以路由到更强的模型或人工客服。这种方法使组织能够提高响应质量、降低运营成本、保护客户信任,并以负责任的方式扩展 AI 客户支持。

参考文献

——

🧑‍💻

zhirenhun

一个热爱技术的程序员,喜欢分享前沿AI知识和开发经验。

← 上一篇
无服务器 vs. 专用 vs. 自托管 LLM 推理:自托管何时真正更便宜
下一篇 →
连续批处理机制:vLLM、TGI和SGLang背后的调度器

📌 相关推荐

GraphRAG 是推理问题,而非数据库问题
2026/8/30
构建市场时光机:使用 Python 和 WebSocket 重放交易会话
2026/8/30
如何自行基准测试LLM推理:值得信赖的数字设计标准
2026/8/30
← 返回文章列表