客户支持是AI代理最强大的应用场景之一。它涉及重复性问题、时间压力、信息查找以及对准确答案的需求。每天有数百万家企业收到相同类型的问题和请求。我的订单在哪里?我想要退款。无法访问我的账户。这个功能如何工作?这与……兼容吗?这要多少钱?我对这个产品不满意。
理论上,一个经过适当训练的AI客户支持代理可以即时响应这些请求中的大部分,从而降低运营成本并让客户满意。然而,并非每个客户请求都具有相同的复杂程度。有些请求简单且风险低。其他请求则更为敏感、模糊或对业务至关重要。
这对于开发AI驱动的支持代理的企业来说是一个重大挑战。虽然一个快速且廉价的模型可能足以回答简单查询,但当客户的意图不明确、问题涉及情绪敏感、法律风险或需要高度专业技术知识时,它可能会导致代理出错。另一方面,使用更强大的模型来处理每条消息可能成本高昂并引入延迟,随着对话量的增长这会成为问题。更好的解决方案是设计一个带有回退路由的客户支持代理。
本文解释了如何构建这样的系统。它涵盖了支持代理的架构、路由器的角色、基于置信度的回退如何工作,以及如何在路由器配置中定义优先级和成本约束。
回退路由是一种AI编排模式,其中请求首先被路由到主要模型(通常基于速度和成本考虑而选择)。然后评估答案质量。如果答案达到既定的置信度、安全性和策略阈值,则将其返回给客户。否则,请求将被路由到更强的模型、专业模型、人工代理或其他工作流。

回退路由对许多客户支持用例很有用,因为客户支持工作负载往往非常不平衡。很大比例的工单可以路由到轻量级模型,因为它们完全是重复性的。较小比例的工单需要更高级的推理能力、更好的指令遵循、更谨慎的语气或访问高级工具。回退机制可以由多种信号触发:
回退路由器充当AI支持系统的流量控制器。它决定每个请求应由哪个模型处理、何时需要升级,以及系统允许花费多少成本。
具有回退路由的实时客户支持代理通常包含多个组件。

1. 客户通过某些客户支持渠道输入消息,如在线聊天、电子邮件、WhatsApp、网站聊天小部件、移动应用、帮助台软件等。
2. 意图分类器对此请求可能属于哪种类型进行分类(即账单、退款、技术支持、物流、账户访问、投诉等)。
3. 检索层查询相应的公司知识库。
这可以是常见问题解答存储库、产品文档、订单数据库、CRM或工单历史记录。模型在生成答案之前需要可靠的上下文。
4. 路由器检查请求并决定应由哪个模型来满足该请求。通常,默认或主要路由指向最便宜和最快的模型。但路由器也可能检查客户层级、请求的主题(某些主题可能敏感,需要高质量模型)、答案的预期难度、当前系统负载、可用的延迟预算以及可用的成本预算。
5. 如果允许响应请求,主要模型生成其答案。然后该答案可能会由某种置信度检查器进行评估。置信度可以使用置信度得分阈值、检索质量、策略合规性、检测不确定语言、答案完整性、客户情绪等来评估。
6. 最后,系统要么返回答案,要么升级到更强的模型,要么向客户请求澄清,要么将对话转移给人工支持代理。
主模型是指客户支持代理使用的初始模型。该模型应非常快速、运行成本低,并且对于回答常规查询具有可接受的质量。将你的主模型用于以下任务:
主模型不必处理所有情况。它应当能够自信地解决大多数简单请求。大多数客户支持对话都是直接了当的任务。它们不需要复杂推理;它们需要正确的检索、清晰的语言和快速的响应。
如果客户问:“我如何重置密码?”主模型应当能够检索密码政策,生成简洁的回复,并在无需升级的情况下结束对话。

然而,如果客户问:“我被重复收费了,客户支持没有回应我,我现在要求退款。”该询问涉及账单问题、投诉跟进、潜在的客户不满以及退款政策。代理路由器可以判断主模型不具备处理这种复杂性的能力,并可以升级到更强的模型。
备用模型应具备更强的能力,但通常以更慢和/或更昂贵为代价。启用备用模型可以实现更好的推理、更强的指令遵循能力、仔细的政策解读,以及更好地处理歧义。如果主模型的响应未通过所需的置信度检查,则可以在其响应后触发回退。另外,如果路由器认为该案例具有高优先级或高风险,也可以在生成之前选择备用模型。
备用模型可以帮忙处理的案例:
回退过程不应被客户察觉。用户不应知道系统切换了模型。对话应正常进行。除了更好的响应之外,不应有任何迹象表明使用了回退系统。
一个好的回退系统还可以通过将主模型的草稿答案传递给更强的模型来工作。然后更强的模型可以编辑、验证或替换该草稿答案。这可以减少重复工作,并帮助回退模型了解其首次响应为何不充分。
置信度评分是回退路由中最关键的组成部分之一。系统需要知道何时信任主答案,何时不信任。评分置信度的信号可以包括:

在做出路由决策之前,可以创建一个考虑上述每个方面的实用置信度分数。
例如,让我们考虑以下内容:
confidence_policy:
minimum_confidence: 0.78
fallback_if:
retrieval_score_below: 0.70
answer_completeness_below: 0.75
policy_risk_above: 0.40
customer_sentiment: "angry"
contains_sensitive_topic: true
在此配置中,答案在发送给客户之前必须通过多项检查。如果一项或多项检查失败,系统会自动使用备用路由。
优先级应定义哪些请求获得更好的模型、更快的响应或人工升级。在现实的支持环境中,并非所有工单都具有同等的业务价值。对免费用户延迟回复可能没问题,但向企业客户发送糟糕的答案可能会损害业务关系。路由器配置应使优先级类别清晰明了。
例如:
priority_classes:
low:
examples:
- general_faq
- product_information
- password_reset
primary_model: fast_support_model
fallback_model: standard_reasoning_model
max_latency_ms: 2500
max_cost_per_request_usd: 0.01
medium:
examples:
- billing_question
- subscription_change
- technical_issue
primary_model: fast_support_model
fallback_model: advanced_support_model
max_latency_ms: 5000
max_cost_per_request_usd: 0.05
high:
examples:
- refund_dispute
- escalated_customer
- enterprise_account
- legal_or_compliance_topic
primary_model: advanced_support_model
escalation_target: human_agent
max_latency_ms: 8000
max_cost_per_request_usd: 0.20
配置显示,低优先级问题由快速模型处理,并设有严格的成本限制。中等优先级问题可以升级到更强的备用模型。高优先级问题则可以负担得起从更强的模型开始,并在必要时回退到人工处理。
目标不仅仅是降低AI成本。目标是智能地花费。路由器应该在业务风险更高的地方投入更多资源。
实时支持需要低延迟。客户期望立即得到响应,尤其是在实时聊天中。如果不仔细设计,备用路由可能会增加延迟,因为系统可能会先调用一个模型,评估答案,然后再调用另一个模型。为了减少延迟,路由器可以采用多种策略:
成本约束使您的AI支持系统保持可持续性。如果没有成本约束,备用路由或升级可能触发过于频繁,从而抵消主模型节省的成本。成本约束应在多个层面应用:
一个实用的路由器配置可能如下所示:
cost_controls:
default:
max_cost_per_message_usd: 0.02
max_cost_per_conversation_usd: 0.15
max_fallbacks_per_conversation: 2
customer_tiers:
free:
max_cost_per_conversation_usd: 0.05
allow_human_escalation: false
fallback_mode: cheapest
pro:
max_cost_per_conversation_usd: 0.20
allow_human_escalation: true
fallback_mode: balanced
enterprise:
max_cost_per_conversation_usd: 1.00
allow_human_escalation: true
fallback_mode: quality_first
prefer_advanced_model: true
global_budget:
daily_limit_usd: 500
action_when_limit_reached: degrade_to_primary_model
output_length_policy: shorten
escalation_policy: restrict_to_high_priority
cost_controls 指定了支持平台在每条消息和每个会话上如何消耗 AI 积分、如何平衡会话,以及全局每日预算。在本例中,每条消息最高花费 2 美分,每个会话最高花费 0.15 美元。我们允许每个会话有两次失败的回退尝试。
我们还为免费用户、专业版用户和企业版用户配置了分层限制。免费用户获得最低的会话预算(0.05 美元),不允许升级到人工客服,并使用最便宜的回退模式。专业版用户获得更大的预算,可以升级到人工客服,并使用均衡回退模式。企业版用户获得最大的预算,并可使用人工升级、质量优先路由以及对高级模型的偏好。
最后,我们为整个平台设置了每日预算。如果当天 AI 积分消耗达到 500 美元,我们将全面停止使用昂贵的功能。我们将只使用主模型、缩短输出,并禁止升级(高优先级案例除外)。
假设一位客户写道:“我为专业版计划付了款,但我的账户仍然显示免费版。我非常沮丧,因为我今天就需要用到。”
意图分类器将账单/账户访问识别为主要主题。情感检测器将这条评论识别为负面情绪,具体来说是沮丧。客户层级目前是免费版,但消息中提到了专业版付款。检索系统找到关于账单故障排查的帮助文章。
路由器判断这不是一个简单的常见问题解答。这可能是一个带有明显不满情绪、且可能存在付款失败的账单问题。由于策略允许对中等优先级的账单问题进行一次尝试,该请求被路由到主快速模型。

主模型生成了一个答案,但置信度检查器显示该答案过于笼统,没有解释用户在付款成功但账户激活未发生时可以采取什么措施。置信度分数低于阈值。
路由器将请求升级到更强的模型。更强的模型将检索到的策略纳入考量,并生成了一个有用得多的答案。该模型道歉、解释可能的原因、在必要时询问交易 ID,并主动提出为客户创建支持工单以进行人工验证。
如果账户查询工具确认付款成功,则可以自动将请求升级到人工账单专员来处理激活。如果未找到付款记录,专员可以引导客户完成确认步骤。
回退路由是一种 AI 编排方法,请求首先发送到快速、低成本的模型,当置信度、安全性或策略检查未通过时,升级到更强的模型或人工客服。
对每个请求都使用最强的模型会提高质量,但也会增加成本和延迟。回退路由有助于将昂贵的模型保留给复杂、敏感或高风险的案例。
当主模型置信度低、给出的答案不完整、检测到客户沮丧情绪、面临策略不确定性,或处理账单、退款、法律问题或企业账户等敏感话题时,应触发回退。
路由器会评估客户意图、检索质量、置信度分数、客户情绪、业务优先级、延迟预算和成本约束等因素。
可以。它允许简单请求由较便宜的模型处理,同时将更强的模型或人工客服保留给质量和风险管理最为重要的案例。
回退路由使 AI 客户支持变得实用、可靠且具有成本效益。回退路由并非将所有请求都通过最高成本的模型处理,或仅依赖最便宜的模型,而是根据置信度、风险阈值、案例复杂性、客户优先级及其他业务规则进行智能路由。简单请求可以立即路由到轻量级模型以获得快速响应时间。高风险、复杂、低置信度的请求可以路由到更强的模型或人工客服。这种方法使组织能够提高响应质量、降低运营成本、保护客户信任,并以负责任的方式扩展 AI 客户支持。
——
一个热爱技术的程序员,喜欢分享前沿AI知识和开发经验。