设计 A/B 测试结果分析表

作者: AILesson9 分钟准备已测试:ChatGPT复核日期: 2026-08-28

直接回答

整理分组、曝光、结果、排除、不确定性和决策规则,避免夸大实验结论. 请提供: 实验设计、数据结构与数量、指标与分析规则. 预期成果: 包含指标定义、公式、平衡检查和决策说明的可审计实验工作簿.

1

补充你的背景

你填写的内容只保留在当前浏览器中,AILesson 提示语不会将其发送给模型或服务器。

2

生成的提示语

未填写的字段会保留为占位符,你仍然可以复制后自行编辑

请为所给 A/B 测试设计 Excel 工作簿,不要让关联结论超过实验设计能够支持的因果强度。

假设、版本、随机、资格、日期、停止、排除和负责人:
[design]

字段、粒度、ID、分组、曝光、结果、时间戳、缺失、重复、数量和样例:
[data]

指标、分母、分析人群、置信方法、实际阈值、分群、多重检验和复核限制:
[analysis]

分开实验计划和观察结果。定义每个随机单位一行,或从事件数据进行可复现聚合。主要意向治疗分析中,即使曝光失败也保留原分组;任何符合方案分析都标为次要。为分母、比例或连续结果、绝对/相对差异、不确定性和护栏指标指定公式。加入样本比例、资格、重复 ID、结果缺失、时间范围、污染和实验前平衡检查。不得只依据 p 值选胜者、在没有计划停止规则时反复偷看、从事件行推断用户层效果,或在分组非随机时声称因果。请返回:工作表结构;数据字典;指标登记表;使用所给单元格/表的公式;质量检查;结果表;分群策略;决策模板;限制;以及能重算小型已知案例的测试。
默认保护隐私提示语在浏览器本地组装。除非所在组织明确允许,否则不要把机密信息提交给任何 AI 服务。

从输入到成果

实际案例

看看具体背景如何通过这条配方转化为可使用的成果

实际输入

实验设计
面向符合资格的订阅者随机测试邮件主题。对照 A 为当前主题,B 为更短主题。随机单位是 Subscriber ID,2026 年 8 月 3 日发送前按 1:1 分组。每名合格订阅者一封邮件。主要假设:B 提高 72 小时内唯一点击率。对完整合格名单运行一次,不提前停止。只排除预先列明的内部/测试 ID,以及按批准指标规则处理的硬退信。营销负责人决策。
数据结构与数量
原始事件导出每名订阅者可有多行。字段 SubscriberID、AssignedVariant、Eligible、Sent、HardBounce、UniqueClick72h、Unsubscribe72h、Revenue72h、AssignmentTime、SendTime。聚合为每名 SubscriberID 一行。预期分组数 A=5,012、B=4,988。硬退信 A=102、B=98。唯一点击 A=421、B=455。退订 A=23、B=31。收入偏态,14 行因跟踪失败缺失。分组中 SubscriberID 重复无效。发送主题与分组不一致时可检测交叉曝光。
指标与分析规则
主指标唯一点击率分母为发送数减硬退信,按原分组;记录这与纯粹全部分组 ITT 不同,并提供全分组敏感性。主检验使用比例差的双侧 95% 置信区间。实际阈值为绝对 +0.5 个百分点。护栏退订率分母为发送数,非劣界限 +0.2 个百分点。收入仅作描述性次指标。分群为探索性,展示 n,不作胜者主张;未计划多重校正。

示例输出

工作簿:Plan(锁定假设、人群、停止和阈值)、UnitData(每个 SubscriberID 一行)、MetricRegistry、QualityChecks、Results、DecisionLog。UnitData 必须从事件按二元结果明确使用 MAX 等规则聚合,并在重复分组时停止;不得把点击事件当成独立样本。

主分母为 A 5,012−102=4,910,B 4,988−98=4,890。点击率 A 为 421/4,910=8.574%,B 为 455/4,890=9.305%;B−A 的绝对差为 0.731 个百分点,相对提升约 8.53%。Excel 比率可用 =SUMIFS(UnitData[UniqueClick72h],UnitData[AssignedVariant],A2)/SUMIFS(UnitData[PrimaryDenominatorFlag],UnitData[AssignedVariant],A2)。使用预先批准的双比例置信区间计算或经复核工具;不得在看到结果后临时选择统计方法。点估计超过 +0.5 个百分点实际阈值,但决定还取决于区间和护栏。

护栏:A 退订率 23/5,012=0.459%,B 为 31/4,988=0.622%,差 +0.163 个百分点,低于但接近 +0.2 个百分点非劣界限;称护栏通过前必须报告区间。质量检查:分组 50.12%/49.88%,用批准的样本比例检查与计划比较;重复分组为零;所有分组早于发送;按组列出交叉曝光、不合格、未发送、跟踪缺失和排除。全分组敏感性点击率为 8.400% 对 9.122%。收入仅带 n/缺失和中位数或分位数作描述,不作为因果成功主张。决策模板在推进、暂缓或拒绝间选择,并引用主区间、实际阈值、护栏区间、质量问题和分母定义差异。

为什么有效

  1. 1

    明确随机单位和分母,防止事件量冒充独立样本量。

  2. 2

    决策阈值和护栏让统计不确定性与实际后果保持连接。

检查结果

  • 每行是否代表随机单位,并且无论是否曝光都保留原分组?

  • 主指标、分母、不确定性方法、停止规则和实际阈值是否在读取结果前定义?

  • 不平衡、缺失、污染、多重检验和护栏是否与结果同时可见?

更有把握地使用

常见问题

了解这条配方何时适用、需要提供什么,以及哪些内容仍需人工复核

使用“设计 A/B 测试结果分析表”前需要准备什么?

使用“设计 A/B 测试结果分析表”前,请准备实验设计、数据结构与数量、指标与分析规则。只用可核实的信息替换占位符;如果某项未知,就明确保留未知状态,不要让模型自行推断。

“设计 A/B 测试结果分析表”的结果在什么情况下还不能使用?

如果结果还不能根据所给证据实现页面所述成果“包含指标定义、公式、平衡检查和决策说明的可审计实验工作簿”,或仍依赖未解决假设、缺失批准或编造细节,就不能使用。把检查项当作放行门槛:应修正来源输入,或指定有权限的复核者,而不是润色一个缺乏支持的输出。

“设计 A/B 测试结果分析表”记录过哪些 AI 工具测试?

截至 2026-08-28,“设计 A/B 测试结果分析表”的公开测试记录包含ChatGPT。这只表示存在已记录试跑,不保证后续产品版本仍兼容或得到相同结果。改用其他工具或版本时,应保留全部约束,并重新执行结果检查。

更多探索方式

这条配方出现在哪里

继续完成任务