ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

PM Skills 的 /analyze-test:以统计严谨性驱动 A/B 测试「Ship / Extend / Stop」决策的完整工作流

PM Skills 的 /analyze-test:以统计严谨性驱动 A/B 测试「Ship / Extend / Stop」决策的完整工作流 PM Skills 的 /analyze-test以统计严谨性驱动 A/B 测试「Ship / Extend / Stop」决策的完整工作流【免费下载链接】pm-skillsPM Skills Marketplace: 100 agentic skills, commands, and plugins — from discovery to strategy, execution, launch, and growth.项目地址: https://gitcode.com/GitHub_Trending/pm/pm-skills导读/analyze-test是 pm-data-analytics 插件中面向产品经理的 A/B 测试分析命令从汇总统计、原始 CSV、实验平台截图或自然语言描述中接收实验数据依次完成实验设计校验、统计显著性计算、效应量与置信区间评估最终产出包含明确产品决策Ship / Extend / Stop与业务影响估算的分析报告。读完本文你将掌握该命令的五步工作流、完整的报告模板、背后的样本量公式与统计检验实现以及如何利用仓库中的 ab-test-analysis 技能与 Python/scipy.stats 完成可复现的显著性计算。一、命令定位pm-data-analytics 插件中的实验决策入口在 pm-skills 仓库中pm-data-analytics 插件将「数据分析」能力拆分为三个命令与三个技能构成产品经理日常数据分析的完整工具箱命令/write-query自然语言生成 SQL、/analyze-cohorts留存与参与度队列分析、/analyze-testA/B 测试结果分析技能sql-queries、cohort-analysis、ab-test-analysis。其中/analyze-test是唯一直接面向实验决策的入口。其元数据pm-data-analytics/commands/analyze-test.md 的 YAML frontmatter明确了它的职责边界description: Analyze A/B test results — statistical significance, sample size validation, and ship/extend/stop recommendations argument-hint: test results as data, screenshot, or descriptionargument-hint表明该命令接受三种形态的输入结构化数据、实验平台截图或纯文字描述这也决定了 Step 1 的数据接收设计。从插件清单 pm-data-analytics/.claude-plugin/plugin.json 可以看到该插件版本为 2.0.0关键词覆盖 product-management、data-analytics、sql、cohort-analysis、retention而在 README.md 的插件总览中/analyze-test被定位为「Analyze A/B test results —— statistical significance, sample size validation, and ship/extend/stop recommendations」。命令与技能的绑定关系是仓库的显式设计/analyze-test在 Step 3 中调用ab-test-analysis技能见 pm-data-analytics/skills/ab-test-analysis/SKILL.md。仓库根目录的 validate_plugins.py 中validate_cross_references函数L289-L310会校验命令中引用的技能必须存在于同一插件内保证这种「命令链技能」的结构不悬空。二、Invocation三种调用姿势命令支持三种等价调用方式覆盖从「手上有原始数据」到「只有一段口头描述」的全部场景/analyze-test Control: 4.2% conversion (n5000), Variant: 4.8% conversion (n5100) /analyze-test [upload a CSV of test results] /analyze-test [screenshot from your experimentation platform]第一种直接内联汇总统计量对照组转化率 4.2%、样本 5000实验组转化率 4.8%、样本 5100适合数据已在手上、快速出结论的场景第二种与第三种面向原始事件数据与实验平台Optimizely、LaunchDarkly 等的导出结果命令会自动读取并解析。这与 ab-test-analysis 技能中的约定一致If the user provides data files (CSV, Excel, or analytics exports), read and analyze them directly. Generate Python scripts for statistical calculations when needed.三、五步工作流从数据输入到决策输出Step 1接受测试数据Accept Test Data命令以「格式无关」为设计原则接受的输入包括汇总统计各变体的转化率与样本量原始事件数据CSV要求包含user_id、variant、converted、timestamp等关键列实验平台截图Optimizely、LaunchDarkly 等平台的运行结果截图实验与结果的文字描述。CSV 这类原始数据会触发技能中的自动处理逻辑读取文件后生成 Python 脚本完成统计计算而不是依赖人眼估算。Step 2校验实验设计Validate Test Design这是命令强调「先校验、再分析」的关键一步——结果来自有缺陷的实验时再漂亮的显著性数字也具有误导性。四个校验维度样本量是否充足运行功效分析power analysis确认样本量能否支撑期望效应量的检测实验时长是否足够至少覆盖 1~2 个完整业务周期business cycles以捕获周度周期波动随机化是否干净检查样本比率失配Sample Ratio MismatchSRM——当实验组与对照组流量占比偏离预设比例时随机化很可能被破坏实验期间的外部因素季节性活动、市场事件、版本发布等是否污染了结果窗口。ab-test-analysis 技能为样本量校验提供了可直接套用的公式n (Z²α/2 × 2 × p × (1-p)) / MDE²其中 Zα/2 为 95% 置信水平下的双侧分位数约 1.96p 为基准转化率MDE 为最小可检测效应Minimum Detectable Effect。技能同时设定了一个硬性阈值功效低于 80% 即为 underpowered统计功效不足必须显式标记。Step 3分析结果Analyze ResultsStep 3 调用 ab-test-analysis 技能执行五个层面的统计评估统计显著性Statistical significance计算 p-value 与置信区间效应量Effect size变体间的绝对差与相对差实际显著性Practical significance效应是否大到对业务有意义——统计显著 ≠ 业务值得上线置信区间Confidence interval真实效应的合理取值范围分段分析Segment analysis数据允许时检查不同用户分段是否存在差异化效应。技能在Calculate statistical significance步骤中给出了具体的计算口径pm-data-analytics/skills/ab-test-analysis/SKILL.md L33-L41分别计算对照组与实验组的转化率相对提升Relative lift(variant - control) / control × 100p-value使用双尾 z 检验two-tailed z-test或卡方检验chi-squared test95% 置信区间针对组间差值计算统计显著性判定p 0.05实际显著性判定提升量对业务是否有意义。对于提供原始数据的场景技能要求生成并运行 Python 脚本完成上述全部计算仓库约定使用scipy.stats见命令 Notes 末尾。除主指标外技能还强制检查守卫指标guardrail metricsL43-L45如果收入、活跃度、页面加载时间等守卫指标在主指标提升的同时出现恶化那么「主指标获胜」可能并不是一个真正的胜利——这是 Step 4 决策时需要权衡的核心输入。Step 4生成分析报告Generate Analysis命令在 Step 4 输出一份结构化的完整报告模板命令执行时会按此骨架填充真实数据## A/B Test Analysis: [Test Name] **Date**: [today] **Test duration**: [X days/weeks] **Total sample**: [N users] ### Results Summary | Variant | Sample | Metric | Rate | 95% CI | |---------|--------|--------|------|--------| | Control | [n] | [metric] | [X%] | [X% - Y%] | | Variant | [n] | [metric] | [X%] | [X% - Y%] | ### Statistical Analysis - **Relative lift**: [X%] ([CI range]) - **P-value**: [X] - **Statistically significant**: [Yes/No] at 95% confidence - **Minimum detectable effect**: [X%] (what the test was powered to detect) ### Sample Size Check - **Required sample**: [N] per variant (for [X%] MDE at 80% power) - **Actual sample**: [N] per variant - **Verdict**: [Sufficiently powered / Underpowered / Overpowered] ### Decision **Recommendation: [SHIP / EXTEND / STOP]** [Clear explanation of why, considering both statistical and practical significance] ### Business Impact Estimate If shipped to 100% of users: - **Expected impact**: [metric change per month/quarter] - **Revenue impact**: [if applicable] - **Confidence**: [How certain we are about this estimate] ### Caveats - [Any concerns about the test validity] - [Segments where results differ] - [Novelty effects or other biases to consider] ### Follow-Up - [What to test next based on learnings] - [Monitoring plan if shipping the variant]报告设计上值得注意的几点Sample Size Check用「实际样本 vs 需求样本」直接给出 Sufficiently powered / Underpowered / Overpowered 判定与 Step 2 的功效分析首尾呼应Business Impact Estimate把统计结果翻译成月度/季度业务指标变化与收入影响并强制要求标注置信度避免把区间估计当确定值Caveats与Follow-Up则把实验的有效性疑虑、分段差异、新奇效应novelty effect和后续监控计划显式列出。技能侧还提供了一个更精简的结果摘要格式L58-L72适合快速汇报Hypothesis / Duration / Sample头信息 主指标与守卫指标对照表Metric | Control | Variant | Lift | p-value | Significant?Recommendation / Reasoning / Next steps三段式收尾。Step 5提供下一步行动建议Offer Next Steps分析完成并非终点命令在 Step 5 主动衔接后续工作流提供三类跟进选项Want me todesign a follow-up experimentbased on these findings?——基于本次发现设计后续实验Should Irun the analysis for specific segments?——针对特定用户分段深入分析Want me togenerate the SQLto monitor this metric post-launch?——生成上线后监控指标的 SQL。第三项直接与同插件的/write-query命令形成工作流衔接——这也呼应了 README.md 中「Commands are designed to flow into each other」的设计理念一条命令结束后建议的相关命令恰好是产品经理工作流的自然下一环。四、决策框架从统计结果到产品结论的映射表ab-test-analysis 技能给出了「实验结果 → 推荐动作」的完整映射表这是 Step 4 中 SHIP / EXTEND / STOP 决策的依据pm-data-analytics/skills/ab-test-analysis/SKILL.md L49-L55OutcomeRecommendationSignificant positive lift, no guardrail issuesShip it— roll out to 100%Significant positive lift, guardrail concernsInvestigate— understand trade-offs before shippingNot significant, positive trendExtend the test— need more data or larger effectNot significant, flatStop the test— no meaningful difference detectedSignificant negative liftDont ship— revert to control, analyze why这张表的精髓在于引入了第五种状态当主指标显著为正但守卫指标恶化时决策不是简单的 Ship 而是 Investigate——先理解权衡trade-off再决定是否全量。这与命令文档中「统计显著性 ≠ 实际显著性」的警示一脉相承。五、统计实现要点scipy.stats 与可复现计算当输入为 CSV 原始数据时命令与技能约定使用Python scipy.stats生成完整分析命令 Notes 第 5 条If data is provided as CSV, generate the full analysis using Python with scipy.stats。从技能的算法描述可以还原出实现路径转化率converted列按variant分组求均值相对提升(variant_rate - control_rate) / control_rate * 100显著性检验双尾 z 检验对比例可用 z-test for proportions或卡方检验scipy.stats.chi2_contingency得到 p-value置信区间基于比例的 Wald 区间或更稳健的 Wilson 区间输出 95% CI样本量/功效校验代入 Step 2 的公式n (Z²α/2 × 2 × p × (1-p)) / MDE²反推需求样本量并与实际样本对比给出 powered 判定。技能中Think step by step. Save as markdown. Generate Python scripts for calculations if raw data is provided.L74意味着完整分析脚本会被保存保证结论可复现、可随新数据重跑——这与/analyze-cohorts命令中「保存 Python 脚本以便用新数据重跑」的约定pm-data-analytics/commands/analyze-cohorts.md Notes是同一设计哲学。六、注意事项与常见陷阱Notes命令文档在 Notes 一节集中列出了实践中的关键警示这些是产品经理最容易踩坑的地方统计显著 ≠ 实际显著数据足够多时 0.1% 的提升也能显著但未必值得上线——决策必须同时看效应量的业务意义先查样本比率失配SRM在信任任何结果之前确认实验组/对照组流量比例符合预设新奇效应会虚高短期结果建议上线后持续监控 2~4 周让新奇效应消退后再下最终结论功效不足时正确答案通常是「延展」而非「无效果」Underpowered 实验无法区分「没有差异」和「差异太小测不出来」此时 EXTEND 比 STOP 更稳妥收入类指标要用置信区间估算影响用置信区间的上下界分别估算最好与最坏的业务影响而不是只报点估计CSV 数据走 Python scipy.stats保证计算的精确性与可复现性而非手工估算。七、在仓库中的实现结构与进一步阅读如果你希望深入理解该命令的工程实现与周边配套可以在仓库中按以下路径继续探索命令本体pm-data-analytics/commands/analyze-test.md —— 本文所基于的核心文档frontmatter 含description与argument-hint底层技能pm-data-analytics/skills/ab-test-analysis/SKILL.md —— 样本量公式、检验方法、决策映射表与结果摘要模板的完整定义插件清单pm-data-analytics/.claude-plugin/plugin.json —— 插件元数据、作者信息与关键词插件 READMEpm-data-analytics/README.md —— 三个技能与三个命令的索引安装方式在 README.md 中可查看claude plugin install pm-data-analyticspm-skills的安装命令Claude Code 与 Codex CLI 均支持质量保障validate_plugins.py —— 根目录的插件校验脚本validate_commandL232-L265检查命令 frontmatter 必填字段validate_cross_referencesL289-L310校验命令引用的技能存在性保证本文所述「命令 → 技能」链条的完整性。在 pm-data-analytics/skills/ab-test-analysis/SKILL.md 的 Further Reading 一节还列出了 A/B 测试基础、实验库与指标选择等延伸阅读原文为外部链接此处仅提示其存在。结合命令文档的完整工作流与技能层的统计实现/analyze-test为产品经理提供了一条从「拿到实验数据」到「做出有依据的产品决策」的标准化路径先校验实验设计、再计算统计量、最终在统计显著性与实际显著性之间做出权衡把 A/B 测试从「看谁的百分比高」升级为「用统计严谨性说话」。【免费下载链接】pm-skillsPM Skills Marketplace: 100 agentic skills, commands, and plugins — from discovery to strategy, execution, launch, and growth.项目地址: https://gitcode.com/GitHub_Trending/pm/pm-skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表