首页 /文章 /AI 客服系统设计——意图识别与人工兜底

AI 客服系统设计——意图识别与人工兜底

AI 客服系统的设计方法。将 AI 客服定位为“分流与兜底”而非替代人工,按四段式流水线阐述意图识别、转人工、应答生成与评估闭环。

AI客服意图识别人工兜底设计
分类:行业与场景 › 客服与销售 发布于 2026-09-22 15 次浏览

一 定位:AI 客服不是"替代人工",是"分流 + 兜底"

AI 客服系统的工程目标不是"机器人 100% 解决率",而是"把可自动解决的请求自动化,把需要人的请求快而准地交给人"。这两个目标的优化方向截然相反:前者要"多答、答得准",后者要"别乱答、该转就转"。系统设计容错模式决定了它属于哪一类——答错的代价高(退款、改单、账号安全)的场景,兜底逻辑必须比应答逻辑更受重视。

核心指标框架:自动解决率(分母要正确,只算"可自动解决"的)+ 转人工成功率(该转的转了没)+ 解决时长 + 用户满意度。四个指标缺一不可,只看自动解决率会走向"宁可多答、不转人工"的过度自动化陷阱。

二 整体架构:四段式流水线

段职责技术选型常见组合
入口层身份识别(工单 / 账号)、会话状态管理、输入预处理(脱敏 / 截断 / 多语言检测)会话管理 + 正则 + 语言检测
理解层意图识别 + 实体抽取(订单号 / 时间 / 金额)+ 多轮上下文维护小模型分类 / LLM + 函数调用(结构化抽取)
执行层知识检索(RAG)/ 工具调用(查询订单 / 执行退款)/ 生成应答RAG + 函数调用(经 LLM 网关,见本站《LLM 网关架构》)
兜底层置信度评估、情绪检测、转人工路由、上下文交接规则 + 分类器 + 人工坐席协同平台

四段式的关键是理解层与执行层解耦:理解层输出的是结构化意图 + 实体,不是自由文本;执行层根据意图路由到"知识应答 / 工具操作 / 转人工"三个分支。这样每一段可独立评估、独立迭代——理解错了可以单独修理解层,不用动执行层。

三 意图识别:从小模型分类到 LLM 结构化

  • 意图体系先于模型:先设计意图分类法(一般 8-30 个一级意图,必要时二级细分),再选模型。意图体系与业务操作对应("查订单" / "申请退款" / "改地址" / "投诉" / "咨询政策"……),不能是"用户想问 A / B / C"这种伪分类。
  • 小模型分类优先:意图识别是封闭分类任务,Bert / 轻量 LLM(7B 级)+ 微调即可达到 90%+ 准确率,成本比大模型低一个数量级,延迟低两个数量级。路由、意图这类"判断型"任务是小模型的甜区。
  • LLM 做实体抽取:订单号 / 时间 / 金额 / 地址等结构化字段,用 LLM + 函数调用(JSON schema 约束,见本站《函数调用与结构化输出》)抽取,比传统 NER 对新格式(截图 / 消息混合)鲁棒得多。
  • 多轮上下文:会话状态显式化(当前意图 / 已确认槽位 / 待确认槽位),每一轮只更新状态而非全量重算。多轮消解("把这个退了"的"这个"指哪个订单)靠状态机解决,不靠模型"记住"。
  • 歧义与兜底:意图分类置信度 < 阈值(经验 0.7-0.8)时,不要猜——走"澄清反问"("是想查订单还是申请退款?");反问超过 2 轮仍不确定,转人工。

四 转人工:核心能力,常被忽略

触发条件典型场景转人工时交接的内容
意图不明多轮澄清仍无法确定用户目的完整对话 + 系统判断的候选意图
低置信度应答 / 操作置信度低于阈值对话 + 已识别实体 + 系统拟执行的动作
高敏感操作退款 > 金额阈值、封号 / 解封、账号安全相关操作记录 + 风险标记 + 需要的授权
情绪升级用户明确愤怒 / 威胁投诉 / 要求真人对话 + 情绪标记 + 建议补偿策略
重复失败同一问题 2 轮以上未解决(用户反复追问同一件事)对话 + 系统已尝试的方案
权限越界用户请求超出系统能力(超出知识 / 工具范围)对话 + 越界原因

转人工的工程要点:交接质量决定人工坐席效率。只把对话扔给坐席 = 坐席从零开始,体验比全人工还差(用户觉得"说了两遍")。标准交接包 = 对话全文 + 系统意图判断 + 已执行操作 + 未解决卡点 + 建议下一步。这个交接包要结构化存储,坐席端能看到"系统已经做了什么、用户还卡在哪"。

"假转人工"是最常见的坏账:系统反复给同一答案,用户说"找个真人"后系统继续回答——这比不转人工更伤害信任。用户显式要求人工,必须无条件转,且不能在同一会话里再次拦截。

五 应答生成:约束比能力重要

  • 只基于检索回答:知识类应答强制 RAG,提示词约束"未检索到依据则拒答并转人工",防止模型用"训练记忆"编造公司政策(这是客服场景最大的事故源)。
  • 操作类应答要"先查后说":涉及订单 / 账户状态的应答,必须经工具调用查到实际数据再生成,禁止"应该 / 大概 / 通常"类推测话术。
  • 承诺话术白名单:"已为您提交退款申请"这类承诺只能在实际执行成功后说;未执行成功时只能说"将为您提交申请"。承诺话术与操作状态绑定,不是模板变量能解决的——需要"操作回执"作为应答生成的前置条件。
  • 长度与语气约束:客服应答默认 3-8 句,过长用户读不完;语气匹配业务定位(严肃金融 ≠ 电商促销),写进提示词的语气规范并定期复审。
  • 敏感信息过滤:输出侧过敏感词 / 内部编号 / 模型名检查(模型名 / 内部项目编号绝不能出现在用户可见应答里,见采集标准 V1.1"内部信息不对外")。

六 评估与运营闭环

  • 自动解决率的分母:只算"可自动解决"的会话(基于意图体系标注),把"本来就该转人工"的排除出去,否则指标失真(真实解决率被"强行机器人解决"拉高,但用户满意度会暴露)。
  • 转人工率按意图拆:哪些意图的转人工率高 = 哪些意图的自动处理能力弱,是迭代优先级最高的信号。
  • bad case 周复盘:每周抽 50-100 条"低满意度 / 转人工"会话人工读,归类到具体环节(理解错 / 检索缺 / 生成编 / 该转没转),反哺意图体系与知识库存量。
  • 知识覆盖率监控:用户提问在知识库中无相关文档的比例("知识饥饿"指标),是知识库运营的核心 KPI——覆盖率低时再好的模型也救不了。
  • 回归测试集:高频意图(top-10)各建 20-50 条"输入 - 期望意图 - 期望应答要点"用例,每次提示词 / 模型 / 知识库变更后跑一遍,防止"修了 A 坏了 B"。

七 安全与合规边界

  • 操作权限最小化:客服 Agent 只挂"查询 + 低风险操作"(查询订单 / 修改联系方式),高风险操作(大额退款 / 销户 / 修改支付信息)强制人工。工具白名单 + 金额分级双控。
  • 身份与安全验证:涉及账户敏感信息的会话,先走既定验证流程(身份核实),再进入应答;验证不通过不进入业务处理。
  • 禁止越权承诺:提示词显式禁止"无条件 / 永远 / 保证"类承诺(赔偿时效 / 到达时间),这类承诺只能由人工坐席做出。
  • 全程留痕:每一轮应答、每一次工具调用、每一次转人工都落审计日志(含 prompt 版本 / 模型 / 参数),供合规审计与事故追溯。
  • 用户知情:用户在会话中应能知道"正在与 AI 对话"(合规要求 + 信任基础),并提供"随时转人工"的显式入口。

八 常见误区

误区问题
"模型越强越好,客服直接上大模型"意图 / 路由是判断型任务,小模型性价比碾压;大模型用在"生成 + 实体抽取"环节即可
"自动解决率是核心 KPI"唯解决率论会激励"该转不转",用户满意度与 NPS 会反向暴露;四指标并列才健康
"转人工 = 系统失败"转人工是设计出来的出口,不是故障;低质量转人工(交接差)才是失败
"知识库齐了就稳"知识库覆盖率 ≠ 知识检索质量;检索 / 重排 / 分块策略与知识库同等重要(见本站《RAG 系统评估》)
"话术模板越全越好"模板覆盖不了的长尾中,模型"自由发挥"的空间正是事故高发区;用约束(白名单 + 拒答兜底)替代"全模板"
"上线后就不用盯"业务问题分布会漂(新活动 / 新政策);周复盘 + 月度意图体系复审是常态化工作

九 落地清单

  • 第 1 周:意图体系设计(8-30 个一级意图 + 对应操作地图);标注集构建(每意图 100-300 条,含多轮 / 歧义 / 情绪子集)
  • 第 2 周:理解层(小模型分类 + LLM 实体抽取)跑通,置信度阈值用标注集标定(目标:准确率 ≥90%,召回 ≥95%——宁可多转,不可漏转)
  • 第 3 周:执行层(RAG + 函数调用)接入,承诺话术与操作回执绑定;兜底层规则上线
  • 第 4 周:灰度 10% 流量,四指标(自动解决 / 转人工成功 / 时长 / 满意度)监控上线;bad case 复盘通道跑通
  • 第 5-8 周:回归测试集建立;敏感操作白名单与金额分级固化;用户反馈闭环(赞踩 / 投诉率)进看板

一句话收束:AI 客服系统的成熟度不看"机器人答得多",看"该转的时候转得干净、不该转的时候答得可信"。意图体系是骨骼,转人工是安全网,约束生成是护栏——三者共同构成一个"不会乱来"的系统。

关键词 AI客服意图识别人工兜底设计 000058