ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

LaLonde数据为何让Naive ATT翻车?AERS基准如何逼出+$1548而非-$635的真实因果效应

LaLonde数据为何让Naive ATT翻车?AERS基准如何逼出+$1548而非-$635的真实因果效应 LaLonde数据为何让Naive ATT翻车AERS基准如何逼出$1548而非-$635的真实因果效应【免费下载链接】Auto-Empirical-Research-Skills A curated collection of 23,000 agent skills for empirical research across 8 social science disciplines. | 精选 23,000 AI Agent 技能库覆盖8大社会科学学科的实证研究。CoPaper.AI 20分钟完成一篇可复现的规范实证论文并支持用户上传 Skills。-- Maintained by CoPaper.AI from Stanford REAP.项目地址: https://gitcode.com/gh_mirrors/aw/Auto-Empirical-Research-SkillsAuto-Empirical-Research-SkillsAERS是由 CoPaper.AIStanford REAP维护的 23,000 AI Agent 实证研究技能库覆盖 8 大社会科学学科。其中内置了一套可复现的基准测试Benchmark给它一份有标准答案的数据看分析流水线能否恢复真实因果效应、并且躲开新手必踩的陷阱。本文用计量经济学史上最著名的LaLonde 数据做案例——同一个问题Naive ATT 给出 −$635正确做法给出 $1,548符号完全相反。1️⃣ 先看结论同一批人两个符号相反的答案数据就在仓库里demo-notebooks/_lalonde_data.csv共 614 行——185 名参加 NSW 就业培训项目的受训者加上 429 名来自 CPS 的非实验比较组。结局变量是 1978 年真实收入re78。估计方式数值说明Naive ATT未调整均值差−$635培训组收入反而更低 ❌ 误导性结论协变量调整后 ATT条件于前期收入 re74/re75$1,548真实因果效应的方向 ✅随机实验基准NSW 实验≈$1,794金标准选择偏误−$2,429两者之差$1,794 这个金标准不是抄来的。仓库把 NSW 随机实验的两臂数据原样存档在 demo-notebooks/nsw-lalonde-1986/用 replicate_nsw.py 直接算出 1,794.34185 减 260无模型、无协变量再由 tests/test_nsw_replication.py 把常数与推导钉死——改任何一边测试就挂。2️⃣ 为什么 Naive ATT 会翻车选择偏误的解剖两组人根本不是同类Naive ATT 的潜台词是培训组和对照组本来就差不多。但 LaLonde 数据狠狠打脸同一批受训者 vs随机化对照组处理前 1974 年收入差仅−$11基数约 $2,100——随机化生效两组本来可比较同一批受训者 vsPSID 观测比较组同一个差是−$3,524——受训者处理前就值钱得多。这意味着培训组是自我筛选出的、本来收入就更高的人群。直接拿他们和 CPS 比较组比 1978 年收入比较出来的差距里混着 −$2,429 的选择偏误把真实收益压成了负的。8 个协变量中有5 个的 |SMD| 0.25black、married、re74、re75、hispan属于严重失衡。平衡表在看结果之前就能发现的问题上图中蓝色是 185 名受训者、红色是 429 名对照两组的倾向得分分布几乎错开——不重叠就无法比较。这是在看结果之前就能诊断出的症状也正是平衡表balance table必须排在结果表前面的原因3️⃣ $1,548 是怎么被找回的逐步加协变量正确做法是条件于处理前变量尤其是前期收入 re74、re75做回归调整。仓库演示了一条渐进规格路线 M1→M6完整表格见 table2_main.tex规格控制内容TREAT 系数M1仅培训变量Naive−0.64M2 age、educ−0.48M3 black、hispan0.32M4 married1.16M5前期收入 re74/re75符号稳定为正M6 多项式控制0.74关键转折在收入类协变量进入回归的那一刻符号从负翻正。全协变量 OLSHC3 稳健标准误给出头条估计$1,54895% CI 为 [$78, $3,018]——与实验基准 $1,794 同量级、同方向完整机读结果见 result.json4️⃣ AERS 基准如何判卷把讲道理变成硬门槛如果只是口头强调别信 Naive ATT流水线尤其是 AI Agent仍然可能偷懒。AERS 的做法是把教训写成可执行的判分规则任务定义见 benchmark/tasks/lalonde-recovery.toml判分点Gold是否必需要求surfaces-imbalance✅ 必需平衡表中至少 3 个协变量 |SMD| 0.25naive-is-negative✅ 必需报告 Naive ATT 且为负承认它被误导adjusted-flips-positive✅ 必需调整后 ATT 翻正且上修 ≥ $1,000honest-reported-numbers✅ 必需报告的 Naive ATT 与 SMD 必须与数据重算值一致容差 $50 / 0.05near-experimental-benchmark⭕ 信息性落在 $1,794 附近容差 $1,500判卷脚本 check_benchmark.py 每次运行都从原始数据重算数据派生的标准答案失衡数量、真实 Naive ATT、SMD 表再与候选流水线的报告值对账。想伪造一张干净的平衡表基准文档里演示了篡改的候选连拿 4 个必需项挂掉只得了 2/15 分。稳健性方面基线 $1,548 在一串稳健性检验下保持稳定5️⃣ 新手上手三步 看数据打开 demo-notebooks/_lalonde_data.csv确认treat处理与re78结局两列复现金标准运行python3 demo-notebooks/nsw-lalonde-1986/replicate_nsw.py亲眼看到 $1,794 从随机化数据里被算出来并顺手完成 −$11 vs −$3,524 的随机化检验跑基准判卷运行python3 benchmark/check_benchmark.py查看 lalonde-recovery 等任务的得分参考流水线满分 15/15。基准总览与所有任务的判分逻辑见 benchmark/README.md。6️⃣ 值得记住的三件事符号可以骗人方向不能−$635 不是训练无效而是 −$2,429 选择偏误盖住了真实收益先看平衡表再看结果表处理前收入差 −$3,524 在碰 re78 之前就已暴露问题基准不是论文是裁判AERS 的 benchmark 把诚实报告失衡 → 拒绝 Naive 结论 → 调整后恢复正值从口号变成了 5 条可自动判分的硬规则这正是 23,000 技能库中可复现实证研究能力的压舱石。【免费下载链接】Auto-Empirical-Research-Skills A curated collection of 23,000 agent skills for empirical research across 8 social science disciplines. | 精选 23,000 AI Agent 技能库覆盖8大社会科学学科的实证研究。CoPaper.AI 20分钟完成一篇可复现的规范实证论文并支持用户上传 Skills。-- Maintained by CoPaper.AI from Stanford REAP.项目地址: https://gitcode.com/gh_mirrors/aw/Auto-Empirical-Research-Skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表