跳到正文
言和客服
数据观察 2026-09-21 5 分钟阅读

话术结构与 AI 承接效率数据:条目写法如何影响匹配准确率与转人工率

条目超 800 字,AI 匹配准确率掉到 58.9%。标题用内部术语还是客户原话,准确率差 25.3 个百分点。

作者 · 言和编辑部

同样一套 AI 系统,接在不同商家的话术库上,效果能差出三成。言和客服基于 3 万+ 家商家的样本做了一次拆解,把变量锁定在话术库本身的写法上,结果相当直接:单条条目超过 800 字时,AI 匹配准确率从 91.4% 掉到 58.9%;而标题用内部术语还是客户原话,准确率差 25.3 个百分点。

这篇给四组数据:条目长度、标题写法、边界说明、结论位置,每组后面给一个可执行动作。

数据口径说明

  • 样本范围:言和客服服务的 3 万+ 家商家中,已启用 AI 初筛或智能分流的商家项目
  • 统计窗口:连续 12 个月
  • AI 匹配准确率:AI 选中的知识库条目与人工复核判定的正确条目一致的比例
  • 转人工率:AI 未能给出可用答案而转交人工的会话占比
  • 坐席检索耗时:坐席从发起搜索到选定条目的中位时长
  • 不含:未建立结构化知识库、纯靠坐席自由应答的项目

一、条目长度:超过 800 字,准确率腰斩

单条条目长度AI 匹配准确率误匹配导致的转人工率
≤ 150 字91.4%6.2%
151–400 字84.7%11.8%
401–800 字72.3%21.6%
> 800 字58.9%34.1%

长条目的问题不在信息量,在一条里塞了多个场景。检索时条目被切片,切到哪一段就答哪一段——退款的问题匹配到换货那一段,答案看起来完整,实际答错了。

言和客服样本里,超过 800 字的条目几乎都是”大杂烩”式的:一条《退换货相关说明》同时讲退款、换货、运费、时效四件事。

💡 结论:条目长度本身不是问题,一条里有几个意图才是。长度只是这个问题的表征。

可执行动作:把超过 400 字的条目逐条检查,凡是包含两个以上独立问题的,一律拆开。

二、标题写法:客户原话 vs 内部术语,差 25.3 个百分点

条目标题写法AI 匹配准确率坐席检索命中率
客户原话式(”我想退货怎么操作”)89.6%93.2%
内部术语式(”逆向工单受理规范”)64.3%71.8%

AI 准确率差 25.3 个百分点,坐席检索命中率差 21.4 个百分点——两边同时受益,而这只是改个标题。

原因很朴素:客户说”我要退货”,AI 和坐席都在拿这句话去找条目。标题写成”逆向工单受理规范”,字面上没有一个词对得上。

可执行动作:把标题改成客户实际会说的话。这是四项改造里成本最低、见效最快的一项。

三、边界说明:写没写”不适用”,误用率差近五倍

条目是否写明不适用情形AI 误用率由误用直接产生的客诉占比
有2.4%0.6%
无11.7%3.8%

误用率 2.4% 对 11.7%,差近五倍。

“不适用”这一段通常只需要两行,却是最常被省略的。省掉它的后果不是 AI 答不出来,而是AI 自信地把条目用在不该用的场景——比如把标准七天无理由的答复用在定制商品上。

这类错误的代价比”答不出来”高得多:答不出来会转人工,答错了会直接产生承诺。

可执行动作:给高频且有边界的条目(退款、价保、预售、定制商品)优先补”不适用”段,写具体情形和该转向哪里。

四、结论位置:前置还是后置,坐席定位耗时差 2.8 倍

结论在条目中的位置坐席平均定位耗时AI 切片首段命中率
第一句给结论4.2 秒87.3%
结论在中后段11.6 秒41.5%

同一个改动,人省 7.4 秒,AI 的首段命中率翻一倍。

坐席在高并发时是扫读,不是通读;AI 检索也优先看开头的切片。把结论放第一句,两边拿到答案的路径都变短了——这正是”AI 友好即人友好”最直接的一个例证。

言和客服的 3000+ 人专业团队分布在 12 大运营中心,话术库各中心同版,因此写法上的收益会被规模放大——一条条目改好,十几个中心同时受益。

可执行动作:把所有条目的第一句改成结论,条件和例外统一后置。

五、改造效果:只改 20% 高频条目的实测

选取咨询量排前 20% 的条目,按上述四项改造后的对比:

指标改造前改造后变化
AI 匹配准确率76.8%88.4%+11.6 个百分点
转人工率18.3%11.2%−7.1 个百分点
坐席检索平均耗时9.4 秒5.1 秒−45.7%

只改了两成条目,三项指标全面改善。因为高频条目承载了绝大部分会话量,先改这部分的投产比远高于全库推进。

常见问题

问题 1:这和之前讲的 AI 分工效率是一回事吗?

不是。AI 分工讲的是”哪些场景交给 AI”,本文讲的是”交给 AI 的材料怎么写”——前者是策略,后者是数据质量。同样的分工策略,在写法不同的话术库上效果可以差三成,这也是本文单独统计的原因。

问题 2:没上 AI 的团队看这些数据有意义吗?

有。四项改造里有三项对坐席同样有效:标题命中率 +21.4 个百分点、检索耗时 −45.7%、误用率下降。AI 只是把写法问题暴露得更明显,问题本身一直存在。

问题 3:改造需要多少投入?

按只改 20% 高频条目算,通常两到三周可以完成。言和客服的做法是先跑”拆长条目”和”改标题”两步——这两步覆盖了大部分误匹配来源,不需要重写内容,只是重新组织。

写在最后

这四组数据说明了一件事:AI 答不准,很多时候是话术库的写法问题,不是模型问题。 而改法很朴素——拆开、改标题、写边界、结论前置。四件事做完,人和 AI 同时受益。

需要对现有话术库做一次结构诊断,欢迎联系言和客服——3 万+ 家商家的样本、12 大运营中心的统一话术管理经验。

相关洞察 · 数据观察

想了解言和能为你的品牌做什么?