2026/10/4

怎么给销售话术做 A/B 测试:50 条样本、四要素拆解与一张表跑完一轮

改话术之前先做一件事:把你要改的那句话单独拎出来,其他条件全部按住不动。做不到这一点,回复率涨了你也不知道是谁的功劳。

为什么凭感觉改话术,越改越差

周一你换了新开场白,发 30 条,8 个人回复,你觉得这句话管用。但周一上午 10 点本来就是客户在线高峰,这批名单又是上周展会刚加的高意向客户。回复率上升可能跟你改的那句话毫无关系。

三个陷阱几乎每个团队都踩过:

  • 样本量不足:只发 20 条就下结论。20 条里多回 2 条,回复率从 10% 跳到 20%,这大概率是随机波动。
  • 归因错误:客户成交了,你把功劳记在开场白上,真正起作用的是第三天那通电话。话术是敲门砖,跟进节奏才是临门一脚。
  • 幸存者偏差:你只记得那句“一发就回”的话,忘了同一句话发给另外 40 个人时石沉大海。

控制变量的具体做法:同一批客户分层(都是新询盘)、同一时间段发送(都在工作日上午 10 点)、同一产品,每次只改一个要素——要么改开场白,要么改 CTA,不要两处一起动。

先定义清楚你要测什么

话术不是一个整体,拆成四个可测要素:

  1. 开场白:第一句是“你好,在吗”,还是“看到你关注了 XX 产品,想确认下主要用在哪个场景”。
  2. 价值主张:强调价格、交期还是售后。
  3. 行动号召(CTA):结尾是“有兴趣回复我”,还是“方便发我目标数量,我帮你算到岸价”。
  4. 跟进节奏:隔一天还是隔三天跟进,跟进时带不带新信息。

每个要素写一个单一假设,例如“把‘你好’换成‘看到你关注了 XX 产品’能提升首回率”。不要写成“换开场白并加上报价能提升回复率”——两个变量一起动,测完还是不知道哪个起作用。

指标提前定死,避免事后挑对自己有利的数据:

  • 首回率:消息发出后 24 小时内客户回复的比例。
  • 有效对话率:客户回复且提出具体问题(问价格、问规格、问交期)的比例。
  • 成交率:这批客户最终下单的比例。

首回率是先行指标,成交率是终极指标。样本小时先看首回率,累积到上百条再对比成交率。

在 WhatsApp 里跑一轮测试的四个步骤

第一步:分组。 用 Excel 或 WhatsApp 标签把客户随机分成 A、B 两组,每组至少 50 人。一天发不了 50 条就累积多天,但两组客户来源必须一致——不能 A 组全是老客户、B 组全是新询盘。

第二步:发送。 同一时间段发两个版本,避免时间差影响打开率。比如上午 10 点发 A 版给第一组,10 点 15 分发 B 版给第二组。用“已发送/已读”状态记录客户是否看到,用聊天时间戳记录回复时间,方便算 24 小时首回率。

第三步:记录。 建一张表,每行一条发送记录,列包括:客户编号、分组(A/B)、话术版本、发送时间、是否 24 小时内回复、是否有效对话、是否成交。手动记或用工具记都行,关键是别漏。

第四步:判定。 A 组 50 人回 10 个,首回率 20%;B 组 50 人回 17 个,首回率 34%。两组样本各 50,差距 14 个百分点,这种差距值得把 B 版定为新标准,再进入下一轮。如果样本小于 30,比如 A 组 12 人回 3 个、B 组 12 人回 5 个,先别下结论,继续累积。

一个完整场景:现有开场白“你好,我们是做 XX 的”作 A 版;B 版改成“看到你关注了 XX 产品,你们主要用在哪个场景?”两组各发 50 条新询盘客户,同一时间段发送。一周后统计:A 组回复 9 条,首回率 18%;B 组回复 16 条,首回率 32%。两组客户来源一致,B 版首回率明显更高,定为新标准开场白,再测下一处。

用回复率和成交率迭代话术

建一个话术迭代看板,每周复盘一次。表格至少包含:话术版本、发送量、首回率、有效对话率、成交率、备注。新版本加进去,老版本保留,这样能看到话术随时间的演变,而不是每次从零开始。

优先优化高杠杆环节。开场白和 CTA 对回复率影响最直接,先测这两处;回复率不错但成交率低,说明问题出在价值主张或跟进话术,这时重点测“报价方式”和“跟进时是否带新信息”。

一个版本至少跑够 100 次发送再评估。发 20 条就换,数据波动会完全掩盖真实差异。

举个例子:B 版开场白首回率 32%,成交率只有 3%;A 版首回率 18%,成交率 5%。B 版能吸引人回复,但吸引来的客户意向不够精准。下一步不是换回 A 版,而是保留 B 版开场白,测不同的 CTA——从“有兴趣回复我”改成“方便发我目标数量,我帮你算到岸价”,看成交率能否提升。

小团队没有数据分析师怎么落地

用 Google Sheets 就够。建一个模板,列:发送日期、话术版本、客户分组、发送量、24 小时内回复数、有效对话数、成交数。用公式自动算首回率(回复数/发送量)和成交率(成交数/发送量)。每周把新数据粘进去,看板自动更新。

每周固定 30 分钟复盘会,只看两个指标:回复率变化和成交率变化。不纠结单条对话的成败,不讨论“这个客户为什么没回”,只看两组数据的整体差异。会议只产出一个结论:下周用哪个版本,测哪个新变量。

把测试结果写成内部话术库。高转化版本标注“已验证”,新成员入职直接复用,不用重新试错。话术库按场景分类:新询盘首触、报价后跟进、沉默客户激活、老客户复购。每个场景下列出已验证版本和测试中版本,保持更新。

手动表格最容易死在“漏记”上:销售同时聊 20 个客户,发完就进下一轮对话,很少有人回头标记“这条是 A 版、客户回了、算有效对话”。数据不全,测试就退回拍脑袋。有些团队会用叠加在 WhatsApp Web 上的工具自动归档每轮话术的回复与成交,省掉手动标记这一步,Sellenca 的定价 是 $19/席位/月、年付 $190/席位,可以先对比一下手动维护表格的时间成本再决定。

客户不回复的僵局怎么破

先查是否触发 WhatsApp 风控。同一话术高频发送可能被限流,表现为消息显示已发送但客户收不到,或回复率突然从 30% 掉到 5%。这时降低发送频率,把同一话术的日发送量压下来,或换一种表达方式。

用分层测试。新客、老客、询盘未成交客户对同一话术的反应完全不同。新客可能对“看到你关注了 XX 产品”有反应,老客更吃“上次你问的那款有现货了”这一套。按客户类型分别测试、分别记录,不要一刀切。

引入多语言变量。客户母语非英语时,测试翻译后的版本。西班牙语客户用机器翻译版和人工润色版分别发送,回复率可能明显不同。多语言测试变量更多,先固定话术内容,只改语言,看回复率差异。

从手动测试到系统化迭代

手动记录的最大问题是遗漏,数据不全测试就失效。系统化要解决的是三件事:记录不额外增加销售负担、数据能自动归到客户档案、高转化话术能反哺下一轮假设。

Sellenca 从真实成交对话中自动挖掘问答与话术,比如“客户问交期时哪句话最终促成了下单”,这些高转化话术可以直接变成下一轮测试的 B 版假设,不用凭空想。它还会生成今日跟进名单,告诉你今天该跟谁、为什么跟,让数据收集不额外占用销售时间。具体能力可以在功能页看到。

常见问题

A/B 测试话术需要多少样本量才可靠?

每个版本至少 50 次发送。日发送量小就累积一周数据,但两组客户来源一致、发送时间段一致。样本低于 30 时结果只能参考,不要据此做重大话术调整。100 次发送以上,结论相对稳定。

测试时如何避免 WhatsApp 封号?

控制发送频率,避免短时间内大量发送相同内容,不要群发垃圾信息。使用自动化工具时确保发送行为接近真人节奏——比如需要销售人工确认后才发送的 AI 建议回复,而不是无人值守机器人,被判定为垃圾消息的风险更低。

只测回复率够吗?还是必须看成交率?

两个都要看。回复率决定你有没有对话机会,成交率决定你赚不赚钱。优化顺序是先提升回复率,再优化成交率。回复率上去了但成交率没动,说明话术吸引了不精准的客户,需要调整价值主张或 CTA。

小团队没有历史数据,怎么开始第一次 A/B 测试?

从当前使用的话术作为 A 版,基于客户常见问题写一个改进版作为 B 版。比如客户经常问“交期多久”,B 版开场白就主动提“常规款 7 天出货,定制款 15 天”。两组各发 50 条,手动记录回复情况。第一次测试的目标不是找到完美话术,而是跑通流程。

话术测试不是一次性项目,而是每周循环的动作:定假设、分组发送、记录数据、判定、更新话术库。想看看实际怎么在 WhatsApp 里自动记录回复与成交、生成跟进名单,可以预约演示,用你自己的话术跑一轮 A/B 测试。