一句话结论:该周期这家店 100% 由人工接待,Max/agent 机器人版本仍是 sandbox、几乎没有承接流量,所以"Auto 机器人满意度提升空间"这个命题当前无法度量。人工满意度 94.9% 是一个健康的高水位,它就是未来机器人上线必须对齐的标杆。真正能立即抓、且不依赖版本的机会有两个:一是参评率只有 2.62%,绝大多数满意用户没被邀评,好评没沉淀;二是把这 333 条人工差评当作未来机器人上线的"必答清单和红线"——连人工都容易翻车的诉求,就是机器人最该防的地方。
先回答"现在多差、差在版本还是话术"。结论是:这家店根本没进入"版本"这一层——机器人没上量,满意度完全由人工决定。按 robot_version 分层,全周期只有一档:
| 版本档 | 接待 touch | 参评 | 好评(4-5) | 差评(1-3) | 满意度 | 参评率 |
|---|---|---|---|---|---|---|
| 人工 / 无 bot(robot_version NULL) | 249,105 | 6,524 | 6,191 | 333 | 94.9% | 2.62% |
| bot / agent 链路 | 0 | — | — | — | — | — |
对同一批 touch 用"是否有机器人自动应答/智能辅助"交叉验证,有机器人参与的 touch = 0。结合 PRO_AGENT 处于 sandbox 状态(体验期结束后自动升级、但 comVersion 为空),确认 Max agent 尚未真正对客承接。
这直接决定了分析框架:"Auto 差评 vs 人工好评同类对照"这一步在这家店无法执行(没有 Auto 一侧样本)。因此本报告把"人工满意度"作为标杆水位解读,并把差评归因转化为"未来机器人上线的风险清单"。
满意度分数结构高度两极:333 条差评里 1 分占 242 条(73%)、2 分 36 条、3 分 55 条——差评基本都是"极端不满",要按投诉级别对待;11 天内每天 18~43 条均匀分布,无单日事件型尖峰。
24.9 万次有效售前会话,只有 6,524 次拿到评价,参评率 2.62%,意味着 24.26 万次接待"沉默"了。人工邀评是手动动作,几乎没在用户说"谢谢/好的"后系统化触发。价值不在抬"满意度率"(好评率不变时率不动),而在把满意用户变成看得见的好评量——直接影响店铺权重、DSR 与流量,并反哺未来机器人样本。按当前 94.9% 好评率保守外推:
| 参评率目标 | 参评数 | 净增参评 | 预计增量好评/11天 | 折合每天 |
|---|---|---|---|---|
| 5%(温和优化) | 12,455 | +5,931 | ≈ +5,629 | ≈ +512 |
| 8%(较激进) | 19,928 | +13,404 | ≈ +12,720 | ≈ +1,156 |
| 10%(上限参照) | 24,910 | +18,386 | ≈ +17,448 | ≈ +1,586 |
对 333 条差评语聊逐条归因,诉求大类分布:
| 诉求大类 | 差评数 | 占比 |
|---|---|---|
| 售前-商品咨询 | 85 | 25% |
| 售后-退换退款 | 67 | 20% |
| 售前-价格优惠 | 50 | 15% |
| 售后-质量问题 | 42 | 12% |
| 其他 | 33 | 9% |
| 履约-送装安装 | 23 | 6% |
| 履约-物流发货 | 22 | 6% |
| 催单催发货 | 11 | 3% |
不满原因分布(一条差评归一个主因):
| 不满原因 | 差评数 | 占比 | 可控性 |
|---|---|---|---|
| 方案未能解决问题 | 95 | 28% | 灰色 部分流程可优化/部分硬约束 |
| 答非所问 / 未理解诉求 | 55 | 16% | 可优化 |
| 商品 / 库存无法满足 | 55 | 16% | 基本不可控 |
| 价格优惠不满足 | 40 | 12% | 基本不可控 |
| 承诺未兑现 | 23 | 7% | 灰色 |
| 规则不透明 | 22 | 7% | 可优化 |
| 用户主观情绪(客服无明显问题) | 21 | 6% | 基本不可控 |
| 响应慢 / 无人应答 | 12 | 4% | 可优化 |
| 态度生硬 / 敷衍 | 8 | 2% | 可优化 |
按可控性归拢:明确可优化 97 条(29%)、灰色 120 条(36%)、基本不可控 116 条(35%)。超过三分之一的差评(要更多优惠、要的货没库存、纯情绪宣泄)人工机器人都难扭转,不宜列入"提升空间"。
买家追问常带隐含诉求(环保/孕妇安全/材质本质),客服用卖点话术堆砌但没正面回答。这是未来机器人最难也最该啃的骨头——要求精准商品知识 + 听懂弦外之音,呼应此前"以图问品/选型"的多模态硬需求。
差价、保价、退换的规则死板 + 流程门槛,用户在流程里被劝退。规则透出与自助核价可优化,但退款政策本身是硬约束。
软体家具瑕疵、噪音、开裂等,本质是产品质量 + 售后政策,客服话术能安抚但难根治。
第三方安装师傅的服务与沟通(拿走旧件未告知、语气差、送装费争议),链路在店外,客服只能转达催促。
"其他"最初被当作杂项兜底(33 条),逐条拆开后发现它不是随机情绪,而是两个商家自己制造、且完全可控的问题:
| 「其他」内子类 | 条数 | 占比 | 性质 |
|---|---|---|---|
| A 主动营销推送骚扰 | 12 | 36% | 可优化 触达策略 |
| B 邀评话术反噬 | 9 | 27% | 可优化 邀评时机 |
| C 客服态度 / 情绪宣泄 | 7 | 21% | 灰色 |
| D 信息不足无法判断 | 5 | 15% | 剔除 |
"其他"里超过六成是营销骚扰 + 邀评反噬,此前被大模型笼统打成"用户主观情绪(客服无明显问题)"而误判为不可控。放到全量看,要把"骚扰"和"正常促销"分开,规模没有 20% 那么夸张:
全店 24.9 万 touch 里仅 1,692 条出现主动群发签名,规模很小。推送组满意度 86.8%(差评率 13.2%) vs 未推送组 94.9%(5.1%)——满意度低约 8pt、差评率约 2.6 倍。但推送组参评仅 38、差评分子仅 5,属小样本方向性信号,需扩样验证,不宜折算 GMV。
333 条差评 98% 都触发了邀评卡片;其中 56 条(占全部差评 16%)是在买家前几句处于负面情绪/投诉状态下被系统弹卡,且 50/56 是 1 分,横跨售后退换 14、其他 11、售后质量 8、售前商品 8 等大类。邀评熔断能规避的差评上限就是这 16%(需 AB)。比主动群发骚扰大一个量级、更该优先。
因为机器人未上量,本店"提升空间"要分两层:一层是现在就能做的人工侧改进 + 参评沉淀,另一层是为未来 Max agent 上线预置的必答清单。
| 抓手 | 对应差评 | 具体动作 | 预估满意度 |
|---|---|---|---|
| 补商品专业知识 | 售前答非所问 55 | 材质/环保/适用人群知识卡,先正面回答再带卖点 | — |
| 规则前置透出 + 自助核价 | 规则不透明 22 + 退换流程 | 价保/退差规则页面化前置,减少"拍新单核价"门槛 | — |
| 响应与态度基线 | 响应慢 12 + 态度 8 | 转人工无人接监控、话术情绪安抚模板 | — |
| 合计(仅明确可优化 97 条) | — | — | 94.9% → 96.4%(+1.5pt) |
| 合计(可优化 + 半数灰色流程) | — | — | 94.9% → 97.3%(+2.4pt) |
提升幅度只有 1.5~2.4pt,因人工基数已是 94.9% 高水位——再挤人工满意度率的边际收益不大。
参评率 2.62% → 5%~8% 是本店 ROI 最高的动作,预计每天多沉淀 500~1,100+ 条好评。它不抬满意度率,但直接放大好评绝对量、改善店铺权重、并为机器人积累样本。
但有一条硬前置(来自 2.4):现在问题不是"不邀评",而是"在错误时机邀评"——16% 的差评(56 条)是在买家负面情绪/投诉状态下被系统弹卡直接催出的。正确次序是:先做邀评熔断(对话出现"别再发/举报/骚扰/投诉"等负面信号、或转人工投诉未闭环时禁止弹卡),预计规避约 16% 差评(上限,需 AB);同时对已表达反感用户收敛主动群发;熔断到位后再对"轮次正常+已解答+正向表达"的会话定向冲量。跳过熔断直接冲量 = 把更多差评放进分母,提参评 = 提差评。
把这 333 条差评当机器人上线前的验收集:把"售前商品答非所问"40 条设为机器人必答清单(材质本质、环保安全、选型适配、以图问品);把"退换差价规则、软体瑕疵、送装履约"设为转人工红线(政策/产品/第三方履约类不硬答、直接转人工并透出规则)。机器人上线后用同口径复算 Auto vs 人工满意度,才是真正回答"机器人提升空间有多大"的时点。