跳到正文
言和客服
数据观察 2026-09-27 5 分钟阅读

异常订单数据观察:大促期占比变化 + 4 类信号准确率 + 误判让留存率腰斩

话术类信号单独用准确率只有 19.4%。而让客户感知到被怀疑,90 天留存率从 87.3% 掉到 41.6%。

作者 · 言和编辑部

异常订单识别里最危险的一件事,是把正常客户当成了异常。言和客服基于 3 万+ 家商家的样本做了一次量化,两个数字最该被记住:话术类信号单独使用时,准确率只有 19.4%;而一旦让客户感知到自己被怀疑,90 天留存率从 87.3% 掉到 41.6%。

这篇给四组数据:大促期占比变化、四类信号准确率、信号叠加效应、误判的真实代价。

数据口径说明

  • 样本范围:言和客服服务的 3 万+ 家商家中,已建立异常标记与风控判定分工的商家项目
  • 统计窗口:连续 12 个月,含两个大促周期
  • 标记占比:客服填写异常标记的订单占该期订单总数的比例
  • 判定准确率:被标记订单中经风控最终判定为异常的比例
  • 误判:被标记但风控判定为正常的订单
  • 不含:无风控环节、由客服直接处置的项目

一、大促期:标记量涨 3.4 倍

时段被标记订单占比风控最终判定异常占比
日常1.4%0.6%
大促期(T−3 至 T+7)4.7%1.9%

标记量从 1.4% 涨到 4.7%(3.4 倍),实际异常从 0.6% 涨到 1.9%(3.2 倍)——两者涨幅基本同步,说明大促期的标记增加主要反映真实变化,而不是客服变得更敏感。

这是个值得放心的信号。如果标记涨幅远超实际异常涨幅,说明大促期的判断尺度松了。

💡 结论:把”标记量涨幅 ÷ 实际异常涨幅”作为一个监控指标。比值接近 1 说明尺度稳定,明显大于 1 说明在过度标记。

可执行动作:大促期按周监控这个比值,超过 1.5 时回看培训与提示文案,检查是否把尺度带松了。

二、4 类信号:话术类单独用准确率最低

信号类型单一信号准确率与其他信号叠加后
凭证模式52.3%86.4%
行为模式41.7%81.2%
时间模式28.6%74.8%
话术模式19.4%69.3%

话术模式单独使用时准确率只有 19.4%——也就是说,仅凭”客户提到了投诉渠道”或”开口就谈赔偿”去标记,五次里有四次是误判。

原因很直接:正常客户在维权时也会提到投诉渠道,这是他们的权利。把这类表达本身当成异常信号,误判率必然高。

凭证模式的 52.3% 是四类里最高的,因为凭证与订单不匹配是相对客观的事实,主观解读空间小。

可执行动作:话术类信号不单独触发标记,只在与其他类别叠加时计入。

三、信号叠加:三类以上准确率 92.4%

叠加的信号类别数风控判定为异常的比例
1 类33.8%
2 类71.6%
3 类及以上92.4%

言和客服样本里,从 1 类到 2 类,准确率翻了一倍多。这解释了为什么”单一信号不下结论”不是保守,而是数据支持的做法——单类信号的准确率只有三成,拿它当依据处置,七成是错的。

言和客服的 3000+ 人专业团队分布在 12 大运营中心,标记字段各中心统一,正是为了让跨中心、跨订单的信号能被汇总叠加。字段口径不统一,叠加就无从谈起。

可执行动作:把标记设计成多选而非单选,让一个订单可以同时携带多类信号,供风控端做叠加判断。

四、误判的代价:让客户感知到,留存率腰斩

按客服的处理方式分三组,看被误判客户(即被标记但风控判定正常)的后续表现:

处理方式客户后续 90 天留存率客诉率
标记但服务不变,客户无感知87.3%1.2%
会话中提及”系统提示异常”41.6%18.4%
要求额外取证且明显加码58.2%9.7%

让客户感知到被怀疑,留存率从 87.3% 掉到 41.6%,客诉率从 1.2% 升到 18.4%——客诉率差 15 倍。

这组数据是”标记是内部动作、客户不应感知”这条要求的全部依据。标记本身不伤客户,把标记透露给客户才伤。

中间一档(要求额外取证且加码)的代价同样明显:留存率 58.2%。客户能感觉到自己被区别对待,即使一句话都没提”异常”。

可执行动作:把”会话中不得提及异常标记或系统提示”写成硬性质检项;额外取证使用统一话术,不针对特定客户加码。

五、备注写法:主观评价的后置代价

工单备注写法进入纠纷流程后处于不利位置的比例
只写可核查事实6.4%
含主观判断词(疑似 / 肯定 / 明显)23.1%

差 16.7 个百分点。原因是工单备注在纠纷升级后可能被调取,主观判断词本身会成为新的争议点——它证明不了客户有问题,却能证明服务方先有了成见。

可执行动作:把备注中的主观判断词列入质检扣分项,与话术禁用清单同级管理。

常见问题

问题 1:准确率只有三成的单类信号,还有必要标记吗?

有,但不能用于处置。标记的价值在于汇总后看叠加——单类信号准确率低,三类叠加后能到 92.4%,而叠加的前提是每一类都被记录下来。标记是采集动作,不是结论。

问题 2:大促期能不能为了效率让客服直接处置?

不建议。大促期客诉的扩散速度比平时快,而误判的客诉率是正常处理的 15 倍。言和客服的做法是大促期压缩风控的响应时效(而不是跳过风控),把判定时间从小时级压到分钟级。

问题 3:这些数据在不同类目差异大吗?

标记占比差异较大,规律一致。高单价类目(3C、家电)的异常订单占比明显更高,服饰类目因退货率本身高,行为类信号的误判率也更高。但”话术类信号准确率最低””误判代价远高于漏判”这两条在各类目都成立。

写在最后

这四组数据指向同一条结论:在异常订单上,客服做得越少越好——只采集、只标记、不判定、不让客户感知。 单类信号准确率三成、误判后客诉率 15 倍,这两个数字足以说明为什么那条线不能越。

需要梳理异常订单的标记与风控协作流程,欢迎联系言和客服——3 万+ 家商家的样本、12 大运营中心的统一标记口径。

相关洞察 · 数据观察

想了解言和能为你的品牌做什么?