B2B官网如何做A/B测试?随机分流只是开始,业务结果才是判断
B2B官网A/B测试需要把访客稳定、随机地分到两个版本,只改变一个主要因素,并提前确定核心结果。本文说明如何分流、记录版本、比较数据,以及为什么不能只用按钮点击判断胜负。

B2B官网做A/B测试,基本方法是把同一时期的合格访客稳定、随机地分到A、B两个版本,只改变一个主要因素,再比较提前约定的核心结果。测试不仅要记录每位访客看到哪个版本,还要继续观察CTA、表单成功和有效线索。随机分流只是建立可比条件,真正决定哪个版本更好的是业务目标,而不是最容易上升的点击数字。
我在最初的文章中主要说明了怎样随机分配用户、保存A/B分群,再到事件分析中比较两个版本。后来又专门写过一篇提醒:A/B测试一定要注意两个群体的性质变化,也不能用短期点击代替最终结果。这两部分放在一起,才是更完整的B2B官网A/B测试思路。
先用一个场景理解A/B测试
假设企业想调整落地页第一屏的价值主张。
A版本继续使用原有表达,B版本使用一条更直接的问题型表达。访客进入页面时,被随机分配到其中一个版本,并在后续访问中尽量保持看到同一版本。系统记录版本标识,再比较两组访客的CTA点击、表单开始、提交成功和有效线索。
如果B版本点击率更高,却带来更多不符合服务范围的表单,它未必胜出;如果A版本点击少一点,但有效线索比例更高,也不能因为前端数字不够漂亮就判输。
测试开始前必须回答:这次改变希望影响什么,最终用哪一项结果判断,哪些指标用来防止局部优化伤害整体。
第一步不是分流,而是写清假设
“试试哪个版本好”还不是可执行假设。
更完整的写法是:我们观察到某类搜索流量进入落地页后,很少继续到表单;推测第一屏没有直接回应搜索问题;因此测试一版更明确的价值主张;预计目标访客进入表单的比例提高,同时有效线索率不下降。
这段描述包含观察、原因推测、改变内容、主要结果和保护边界。即使测试没有改善,团队也知道原来的判断没有获得支持,而不是只留下“B版不好”。
一次测试最好围绕一个主要因素。标题、配图、CTA、表单字段和页面结构同时变化,即使结果不同,也很难知道哪项改变产生作用。
怎样把访客分到A、B两个版本?
原文的方法是,在用户第一次到达网站或App时随机分配版本,并把A或B作为属性记录,再保存为两个用户分群进行分析。
这个原理没有变化:分配要随机,比例要按方案执行,同一访客应保持相对稳定,两个版本应处于相近时间和流量环境。
如果同一位访客今天看到A、明天看到B,他的行为会同时受到两个版本影响;如果上午全部进入A、下午全部进入B,渠道和时间变化也可能被误认为版本差异;如果把品牌词访客放进A、行业泛词访客放进B,两组人本来就不一样,无法只用页面解释结果。
所以,版本标识、分配时间和关键来源需要保留。测试期间如果广告预算、渠道结构或页面技术发生重大变化,也要记录,避免把环境变化算到版本上。
两个群体为什么必须保持可比?
A/B测试依赖一个基本前提:除了被测试因素,两组访客的整体性质尽量相近。
作者后来在文章中用一个很形象的例子提醒:如果A文案强调“有教养、努力”,B文案强调“很有钱”,只看“了解详情”点击,B可能明显更高;但如果真正目标是建立长期关系,点击并不是最终答案。
放到B2B官网也是一样。更刺激的承诺、更宽泛的标题可能带来更多点击和表单,却吸引不同类型的人。如果两个版本逐渐获得不同来源、设备或人群,看到的差异可能不只是页面造成的。
测试过程中要观察两组的来源、设备、新老访客和其他关键结构是否出现明显偏差。不是为了把所有数据切到没有样本,而是防止已知的人群变化被忽略。
用什么指标判断A/B测试结果?
指标要跟测试目标保持距离适中。
测试按钮文字,可以先看CTA点击,但不能只看到点击;还要继续看表单开始、提交成功和有效线索。测试表单字段,可以把完成率作为主要网站结果,同时观察线索信息是否足够、有效率是否变化。
太靠前的指标反馈快,却容易产生虚假繁荣;太靠后的成交结果最接近业务价值,但B2B周期长、样本少,也可能受到销售、价格、竞争和线下关系影响。
更实际的方法,是提前确定一个与改动直接相关的主要指标,再设置后续保护指标。页面CTA测试可以用“看到页面后进入表单”作为主要结果,用提交成功和有效线索率检查质量;渠道与页面整体方案测试,则需要把观察继续走到更后端。
不能在结果出来以后,从几十个数字中挑一个对自己有利的指标宣布成功。判断标准必须在测试前确定。
B2B官网流量不大,还适合做A/B测试吗?
不一定。
作者后来讨论TOB转化率优化时特别提醒:转化率优化需要一定数据量,也要考虑资金和人员投入的性价比。很多B2B官网到达关键表单页的访问有限,测试很长时间仍然难以获得稳定判断。
流量不足时,可以先做基础体验检查、热图与路径分析、销售反馈和少量用户观察,把明显问题直接修复。按钮被遮挡、表单无法提交、页面与关键词完全不匹配,不需要先分一半流量证明它有问题。
也可以采用小步迭代:一次修改一个有明确依据的问题,记录前后条件与结果,但把它称为“前后观察”,不要包装成严格A/B测试。前后比较会受到时间和人群变化影响,证据强度与同时随机测试不同。
是否开展测试,应考虑页面访问量、当前转化数量、希望识别的变化、测试周期和机会成本。不能因为工具可以分流,就认为每个页面都值得测试。
一次B2B官网A/B测试可以怎样执行?
先选择一个业务任务明确、访问相对集中的页面。核心落地页通常比低流量普通页面更适合。
然后记录当前问题和证据,写出假设,只确定一个主要变化。明确A是现有版本,B改变什么,其他关键内容保持一致。
接着确定分流对象、比例、稳定识别方式和测试周期。内部员工、机器人、测试流量和不相关地区是否排除,也要在开始前说清楚。
再确定主要指标和保护指标,检查所需事件是否已经正确采集。没有版本标识、页面曝光和成功结果,测试上线以后也无法复盘。
测试运行期间不要因为短期波动频繁切换版本,不要同时让另一场活动只进入其中一版,也不要临时修改判断指标。
结束以后,先确认两组数据完整、人群结构没有明显异常,再比较主要结果与后续质量。最后记录结论:支持假设、不支持假设,还是数据不足无法判断。无法判断也是有效结论,不必强行选出赢家。
A/B测试常见的四种错误
第一,只看按钮点击。点击更高不代表表单、有效线索和商机更好。
第二,两组人并不可比。不同时间、渠道和设备结构被混入版本差异。
第三,一次改变太多。结果变化以后无法知道是哪项修改产生影响。
第四,把转化率优化当成增长主干。页面实验可以改善网站的一环,却不能替代产品、服务、品牌、口碑与销售过程。
作者在后来的文章中说得很清楚:B2B网站可以为了线索量做一部分转化率优化,也可以在线索生命周期上努力,但不能认为动几个页面元素就能改变全部增长。
结论:A/B测试验证的是假设,不是寻找漂亮数字
B2B官网A/B测试要从明确假设开始,把同一时期的合格访客稳定、随机地分到两个版本,只改变一个主要因素,提前确定判断指标,再比较页面行为和后续业务结果。
测试时既要注意版本,也要注意两个群体的性质是否变化。点击率可以提供快速反馈,但有效线索和后续结果负责判断质量。流量和样本不足时,不必为了形式强行测试,先解决明显问题、积累数据和客户理解,可能更有价值。
作者与内容来源
- 作者:赵岩
- 原始文章:《(三十六)如何用UBA做AB测试(ABtest)》
- 首次发表于知乎:2019年8月7日;原文曾于2021年8月22日更新
- 本版更新:2026年8月25日
- 主要观点依据:《(六十一)AB测试,一定要注意群体的性质变化》、《TOB市场部应该考虑转化率优化么?》。
- 更新重点:保留作者关于随机分流、版本分群和事件对比的原始步骤,并合并作者后来对“群体性质变化、不能只看点击、B2B样本与投入产出、转化率优化不是增长主干”的补充判断;删除特定工具宣传。
- 编辑说明:AI仅承担作者历史文章归并、B2B场景重组、结构整理和语言校对,核心边界均来自作者原文,发布前由作者确认。
