全自动接待「售前慢首问」归因分析
走售前应答链路的买家会话首问中,链路总耗时超过 10 秒的规模、分布与根因 | 数据窗口 2026-07-30 至 08-05(7 天) | 全量统计 + 9 条售前链路逐条诊断
内部分析 · 已脱敏全自动接待模式售前链路专项分析师版
日均走售前链路首问
56.4万条
7 天累计 395 万条,占全部全自动首问 60%
日均售前慢首问(>10 秒)
7.2万条
占比 12.8% | 辅助模式售前仅 4.3%
售前慢首问平均耗时
14.3秒
快首问平均 4.6 秒
慢首问的延迟大头
售前生成环节
贡献慢-快差距 9.7 秒中的 94%
一哪些行业慢:五个重点行业贡献了 77% 的售前慢首问
按慢首问量排序,快消(174,852 条)、大家电(81,724 条)、家居(64,904 条)、食品生鲜(34,763 条)、家装(32,034 条)五个行业合计 388,277 条/周(占全部售前慢首问 77%),快消一家占 34%。按占比排序,宠物(16.9%)、大家电(15.0%)、黄金饰品(15.0%)、快消(14.8%)最高——宠物占比第一但体量在第六位。
口径:走售前链路=该首问的售前答案生成环节实际执行(耗时>0);慢首问=链路总耗时>10 秒。橙色=售前慢首问量 Top5 重点行业;灰色=周慢首问不足 1,000 条的小样本行业,占比波动大仅供参考。
二慢到什么程度:70% 挤在 10–15 秒边缘区,尾部比全链路口径更重
走售前链路的全自动首问 P90 为 10.9 秒——刚好压在阈值上,意味着约十分之一的售前首问天然越线;P50 也有 6.4 秒,是辅助模式(2.8 秒)的 2.3 倍。慢首问内部:10–15 秒占 69.8%,但 15 秒以上占三成(全链路口径约两成),其中 30 秒以上 7,879 条/周——这一小撮的体验伤害最大(见第五节案例 7–9)。慢首问的售前环节自身 P50 就有 11.7 秒、P99 达 30.8 秒。
走售前链路首问耗时分位数:全自动 vs 辅助模式
售前慢首问耗时分桶(7 天累计)
分位数基于走售前链路的全部首问(含快首问)的链路总耗时计算;60 秒以上仅 1 条为链路等待异常个例。辅助模式=坐席在线、机器人辅助应答;两种模式的买家与商家结构不同,对比仅示意水位差。
三慢在哪个环节:94% 的差距来自售前答案生成
慢首问与快首问的分环节对照:9.7 秒差距里 9.1 秒来自售前答案生成环节本身(94.1%),任务执行只贡献 0.3 秒,前置子模块(意图分类/SOP 树/转人工判定/图片识别等)全部亚秒级、合计差距仅 0.24 秒。按耗时最高环节归类,98.7% 的售前慢首问由售前生成环节主导。另一个值得注意的信号:「首问先分给售后、售后转交售前后重新生成」的双链路形态在慢首问中占 6.0%(30,463 条/周),是快首问(0.6%)的 10 倍;珠宝文玩(16.6%)、酒旅(14.0%)、个性定制(13.2%)、玩具潮玩(10.2%)尤其突出。
各环节为均值、含未发生该环节的 0 值,故分段之和≈链路总耗时。「售后段」=走售前链路的首问中售后环节的耗时,对应「首问先分流给售后应答、售后再转交给售前重新生成答案」的双链路形态(双链路判定口径:售后段耗时>1 秒)。
四一条售前慢首问的解剖:串行链路把下限推到 8–10 秒
9 条售前抽样链路全部「跑完但慢」——所有子环节执行成功、没有任何一个模块超时中断,检索/排序/前置小模型全部亚秒到 2 秒量级。真正的时间都花在下面这条串行链上:
前置识别意图/商品/风险
0.5~1.5s
→
R1 判知识/反思思考模式
1.2~2.5s
→
知识/工具检索0.7~2s
未见击穿
→
R2 主答案生成大模型·思考模式
5~11s ★大头
→
反思/质检1.4~4.3s
可能触发重答+10~39s
→
后处理下发合规/替换/邀评
≈0.2s
耗时区间来自 9 条售前抽样链路实测。提示词前缀(系统规则+商品知识)实测 2 万~5 万字符,直接拉长 R1/R2 的首 token 时间。
五9 条售前链路逐条诊断:五类典型原因
按耗时分层定向抽样(边缘 2 条、中段 4 条、极端 3 条),逐条拉取链路时序诊断。案例 8/9 最值得警惕:质检打回后重写答案要 34~39 秒,刚好超过系统约 55 秒的等待上限——重写的答案作废,买家白等近 1 分钟,最后收到的只是一张通用保底卡片——算力与体验两头都亏。
| 案例 | 链路标识 | 耗时档 | 行业 | 总耗时 | 瓶颈形态(实测) | 根因类型 |
|---|
| 1 | 2106ea0d… | 边缘 10–15s | 大家电 | 10.3s | 两轮生成串行:反思判知识 2.3s(思考模式)+主生成 1.5s,重轮 4.3s 占 42%;反思后判定拒识 | A 结构性两轮串行 |
| 2 | 212b8cd5… | 边缘 10–15s | 大家电 | 10.8s | 单轮主生成 6.4s 占 59%(思考模式);系统提示词 2.1 万字符,而买家只发了「人工」两个字 | C 超大提示词前缀 |
| 3 | 213d245b… | 中段 15–30s | 大家电 | 24.5s | 3 轮生成(判知识→调工具→生成)11.9s + 反思 3.2s;提示词 5.0 万字符(思考模式) | A+C 多轮×大提示词 |
| 4 | 212b53ea… | 中段 15–30s | 家装* | 28.9s | 首答 10.2s → 反思判「需重写」→ 整轮重答 11.0s,两个重轮 21.2s 占 74% | B 反思触发整轮重答 |
| 5 | 2146affa… | 中段 15–30s | 家装 | 20.2s | 无单点故障:两轮生成 7.8s + 反思 4.3s + 排序 2.9s 层层累加到 20s | A 串行链路累加 |
| 6 | 2105818d… | 中段 15–30s | 家装 | 17.6s | 首问先分给售后应答 4.0s,售后转交售前后重新生成 12.2s,两段相加 | D 售后转交售前重新生成 |
| 7 | 2105a7d5… | 极端 60s+ | 大家电 | 67.8s | 生成+工具 25.7s 属正常,但另有 27.6s 链路上查不到任何执行记录、纯粹在空等;发保底卡片前的预查询也空跑了 6.3s | E 链路空等黑洞 |
| 8 | 21469cda… | 极端 55s+ | 快消 | 59.8s | 质检打回后第 3 轮重写答案花 38.9s,刚好超过 ≈55 秒等待上限——重写的答案作废,买家收到保底推荐卡片 答案作废 | B+E 重写超时被作废 |
| 9 | 213cbc2b… | 极端 55s+ | 快消 | 59.8s | 质检判「答案信息缺依据」→ 第 2 轮重写 34.0s,超过 ≈55 秒上限后改发保底卡片,46.8s 的生成全部白算 答案作废 | B+E 重写超时被作废 |
链路标识为内部追踪号前 8 位,供内部复核。案例 4 行业按链路实测为家装(底表行业映射标注宠物,以实测为准)。抽样为定向分层抽样、非概率样本,结论定性使用。
A
A|售前答案生成的结构性串行
售前主答案由大模型生成且多数开启思考模式,单个重轮 5~11 秒;再叠加「判是否查知识 → 检索 → 生成 → 反思」的 2~3 轮串行,链路下限天然被推到 8~10 秒。这解释了为什么 70% 的售前慢首问挤在 10–15 秒边缘区——它们不是故障,是架构预算的自然溢出。
证据:全量佐证:慢-快差距的 94% 来自售前答案生成环节;98.7% 的售前慢首问由该环节主导;抽样 9 条全部「跑完但慢」,检索、排序、前置小模型无一击穿
B
B|反思/质检触发整轮重答
首答生成后被反思或质检判「需重写」,再付一轮 10~39 秒。中段慢首问的头号推手;在极端 case 里重答耗时 34~39 秒,比首答贵 3 倍。用户实际是在为内部质检流程等待。
证据:案例 4:重答多付 11.0s;案例 8/9:重写 34~39s
C
C|超大提示词前缀
系统提示词+商品知识+转人工规则合计 2 万~5 万字符,显著拉长大模型首 token 时间。即便买家只发「人工」两个字,也要背全量上下文。
证据:案例 2:2.1 万字符;案例 3:5.0 万字符
D
D|首问先分给售后,转交售前后重新生成
部分首问一进来先被分流给售后应答;售后处理后发现这其实是售前问题,把会话转交给售前,售前再从头重新生成一遍答案。买家等的时间=售后那一段+售前完整一遍,两段相加。这种「转交重来」的双链路形态在售前慢首问中占 6.0%,是快首问(0.6%)的 10 倍。
证据:案例 6:售后段先跑 4.0s,转交后售前重新生成 12.2s;全量:慢首问双链路 30,463 条/周
E
E|等答案有 55 秒上限:超时后答案作废、买家只收到保底卡片
系统给每次回答设了约 55 秒的等待上限——到点还没拿到合格答案,就直接给买家发一张通用推荐卡片(保底话术)。问题在于:答案被质检打回后重写一遍要 30~40 秒,经常刚好在上限之后才写完。于是卡片先发了出去,认真重写的答案只能作废。买家白等近 1 分钟,等到的却是一句通用话术;机器白算 30 多秒,两头都亏。(55 秒上限为两条案例反推:截止时点只差 0.01 秒,具体配置待技术侧确认。)
证据:案例 8/9:重写 34~39 秒被作废、改发保底卡片;30 秒以上极端慢首问共 7,879 条/周