
更多样本还是更多 token一次公平的数据规模实验——32 条训练池、64 条开发样本系列从最小复现到可检验的科研问题 · 第六轮日期2026-10-03读者研究生、科研新人和工程型研究者实验范围真实 SmolLM2-135M-Instruct、SST-2单种子、CPU 短预算微调未使用保留确认集。目录复现价值与论文边界核心思想数清三种预算官方代码阅读路线最小实验与评测协议实际结果与失败排查源码与复现入口可检验的研究问题总结与参考资料复现价值与论文边界089 已确认回答标签掩码正确但每组四步更新没有学会 JSON 格式。090 新增的问题是当训练量增加时应该优先增加独特样本还是重复已有样本冻结模型、模板、优化器和开发划分改变训练池大小及重复次数留下逐步预算账本和逐例输出。**论文报告**Muennighoff 等人在《Scaling Data-Constrained Language Models》研究预训练中的重复数据与计算预算指出重复数据的收益不能无限外推。[1] 本篇引用其问题意识不搬用其规模律系数也不把小型情感微调称为论文原实验复现。预训练的全文本目标与只监督八个回答 token 的任务有明显差别。**本次实际验证**继续使用已经过指令训练的 SmolLM2-135M-Instruct而非从零训练的语言模型。[2] SST-2 是英文影评情感数据训练行还可能是短语片段三十二个索引不等于三十二篇独立影评更不直接代表中文能力。[3][4]核心思想数清三种预算一个 token 是分词器处理文本的基本单位。SFT即监督微调让模型在给定上下文时提高正确回答的概率。设批次中第 (i) 行第 (t) 个目标的掩码为 (m_{it})回答位置取一提示与补齐位置取零L − ∑ i , t m i t log p θ ( x i t ∣ x i , t ) ∑ i , t m i t , B s u p ∑ u , i , t m u i t . L-\frac{\sum_{i,t}m_{it}\log p_\theta(x_{it}\mid x_{i,t})}{\sum_{i,t}m_{it}},\qquad B_{\mathrm{sup}}\sum_{u,i,t}m_{uit}.L−∑i,tmit∑i,tmitlogpθ(xit∣xi,t),Bsupu,i,t∑muit.(\theta) 是模型参数(x) 是 token(u) 遍历更新批次(B_{\mathrm{sup}}) 数的是所有更新中真正计入损失的目标包括重复见到的目标。标签交给模型时不提前移位当前位置的输出预测下一位置官方损失函数负责移位。[5]另记 (B_{\mathrm{in}}) 为非 padding 输入 token 总数(B_{\mathrm{pad}}) 为实际批张量位置总数。padding 是把同批不同长度序列补齐的占位符。只屏蔽提示的损失不会消除其前向计算因此“等监督 token”并不等于“等全部计算”。本篇所谓公平限定为监督量、更新数和每批类别相同输入长度差异仍须披露。图中两个模型各自从同一检查点初始化训练期间不共享已更新参数。预算括号覆盖两组虚线进入审计确认集保持隔离。图只画主对照短训练辅助组见下表。官方代码阅读路线先读模型固定版本的tokenizer_config.json核对消息模板、回答起点以及 EOS即结束标记再读 Transformers 的apply_chat_template确认没有重复添加特殊 token。本文common.py/build检查完整序列与生成前缀逐 ID 一致保留回答末尾真实 EOS移除模板额外换行。第二站是LlamaForCausalLM.forward和ForCausalLMLoss。本次逐批输入为[2,L]输出 logits 为[2,L,49152]最后一维是词表大小。prompt 与补齐处标签为-100模型跳过这些目标PAD 与 EOS 都是 ID 2必须按真实长度区分不能删除所有值为 2 的标签。独立移位交叉熵与官方 loss 最大差为 (1.19\times10^{-7})。最后读 PyTorchSGD.step和生成器的argmax分支前者执行梯度更新后者每步选概率最大的 token。源码地图固定 Transformers 4.49.0 和 PyTorch 2.6.0 的真实提交、具体行与许可证五份官方源码已重新下载与安装文件逐字节一致。自写调度与审计属于教学实现模型、损失、优化器和解码直接调用官方代码。最小实验与评测协议模型与 tokenizer revision 均为12fd25f77366fa6b3b4b768ec3050bf629380bac数据 revision 为8d51e7e4887a4caaa95b3fbebbf53c0490b58bbb。十七个资源文件的 SHA-256 写入锁文件缓存身份还包含模板、提示、解码、拆分及执行源码哈希。从官方 train 按SHA256(89:idx)在正负类别各选十六行再负正交替。每类前四行组成小训练池恰好沿用 089 的八条样本顺序改为每批类别平衡。三十二行无规范化完全重复与全部开发及确认样本无完全重合这项检查不能排除短语关联、近重复或上游预训练污染。开发集沿用 088 的六十四条随后的一百二十八条确认样本未推理。输出目标统一为情感 JSON实际分词后每条恰为八个监督 token含 EOS。最大长度二百五十六正式运行没有截断也没有将多条样本拼接打包。条件独特训练行轮数更新步数监督 token输入 token短训练辅助组84162562,736重复八条主对照816641,02410,944扩大三十二条主对照324641,02410,556后三列分别回答“更新几次”“学多少目标”“处理多少上下文”。主组都曝光一百二十八行每批两行、十六个有效目标但含 padding 的位置分别为 11,776 与 11,344注意力形状成本也不同。不能用这张表声称完全等 FLOPs。还要区分独特行数和有效信息量。两种情感标签虽然来自不同文本目标回答的大部分结构相同重复标点和键名也计入监督量。因此本文并未把一千零二十四个目标都当作新的情感知识。若以后改成长解释答案必须重新统计目标长度不能继续用样本数乘八计算预算。三组都从原权重重新加载全 134,515,008 个参数参与 SGD学习率 0.001无动量、无权重衰减梯度裁剪阈值一。固定 seed 90、CPU float32、四线程、eager attentioneval模式用于关闭随机模块仍保留自动求导。循环顺序不重洗牌不早停不按开发分数挑检查点。短训练组故意减少监督量只用于观察重复训练预算的变化。主指标是 JSON 联合正确率 (J)格式正确 (F) 且内容代理正确 (C)。格式要求仅含一个 sentiment 键、合法小写标签内容代理要求回答中唯一显式情感词匹配数据标签不是人工语义判定。普通单词约定作为诊断一并报告所有状态均贪心生成最多三十二个新 token。实际结果总分相同但代价不能省略状态普通回答正确数JSON 格式通过JSON 内容代理正确JSON 联合正确训练前57/640/6450/640/64短训练辅助组59/640/6453/640/64重复八条33/6464/6458/6458/64扩大三十二条33/6464/6458/6458/64主组之间不仅总分相等一百二十八个普通/JSON 回答文本也逐样本完全相同。主指标的配对胜、平、负为 0、64、0。这只说明当前开发点没有观察到行为差异不证明参数相同、总体等效或独特数据永远无用单种子和微小训练池限制了结论。对原小训练池使用正确前缀计算回答负对数似然即 NLL训练前 1.0283短训练后 0.6661两个主组分别为 0.1613、0.1720。它测的是正确答案在给定历史下被模型赋予的概率并不是自由生成的成功率。三十二条训练池上的同类测量也下降但它含有训练数据不能包装成未见泛化结果。失败更值得保存。两个主组在普通约定下生成六十二个 negative、两个 positive从短训练到重复八条内容配对为五胜、二十八平、三十一负。格式仍完全合法错误主要落在标签选择。仅展示 JSON 成功率会掩盖这种约定敏感性。失败排查与证据边界先排查预算逐步账本确认主组都是六十四步和一千零二十四个有效目标每批各一正一负。再排查泄漏验证标签来自官方 validation确认索引未进入生成。最后核对行为保留全部五百一十二条原始生成审计器重新解码并独立解析格式、标签及配对关系。未通过修改评分器来挽救负结果。复跑时还需检查模型状态而不只比较分数。三个最终检查点都真实保存首层注意力投影权重的变化非零参数总数保持不变。独立审计从原始训练索引重建重复日程防止两组误用了同一份样本。模型在两个组里给出相同文本只表明这些提示下的贪心决策一致并不意味着两份权重相同。**作者推断**相同 JSON 骨架可能让少量数据已足以学到输出方式而反复在一种约定下更新可能改变另一种约定的标签偏好。这是竞争解释之一类别词概率、提示敏感性和优化路径都可能参与。本次没有测出其中任何一项的独立因果贡献不把它直接称为灾难性遗忘。资源试跑先执行每组两步和两条开发样本峰值 RSS 2.62 GB按实测估算后才正式运行。正式端到端 118.54 秒峰值 RSS 2.76 GB三组训练分别约 5.45、20.42、20.71 秒。时间从第三方导入后计含校验、加载、训练、推理、NLL 和保存GPU 内存未测。不同批次的 loss 不能冒充固定验证集学习曲线。源码与复现入口源码已上传公开仓库固定提交源码目录、README 与运行说明、SOURCE_MAP 官方源码对应。固定版本为11c29a7deefe请使用该提交复现避免后续主分支变化。安装 README 中的固定依赖并运行资源准备后最小命令为python run.py --cache ./cache --out smoke-new --private ./private-new --smoke。预期得到逐步预算、原始回答、指标、环境和阶段记录私有目录保存检查点与输入 token。去掉试跑参数可执行本文全部实验再用audit.py独立核查。下载器复用已校验缓存不要求重新下载大文件。SST-2 数据卡许可标注 unknown公开包不含影评原句、可逆输入 token 或原始数据模型权重、环境和缓存也不分发。源码、锁文件、小型派生验证记录和许可证完整保留语法与解压入口单独验收跨平台位级一致性待人工核验。可检验的研究问题第一个假设是“当前预算主要学格式更多独特文本尚未改变可见行为”。反证可以来自冻结相同监督量后更换嵌套训练抽样种子出现稳定的逐例差异不能继续加数据直至赢一次才汇报。第二个假设是“普通回答偏置来自只训练 JSON 约定”。下一篇可预先固定总监督量改变普通与 JSON 数据比例同时测目标格式和保留约定。若混合后仍同样偏置单纯格式竞争解释就受到削弱。多比例只在开发集选择最终确认数据继续封存。总结本篇完成了一次真实、可审计但范围有限的等监督预算比较。独特样本扩大四倍没有改变当前输出增加重复训练量学会了 JSON却损害普通回答。研究进展不必表现为方法胜出明确哪一种预算相等、哪一种行为改善、哪一种能力受损才为后续可反驳的实验留下起点。参考资料检索与直接访问日期2026-10-03。论文报告、官方实现与本次实测分别标注未引用动态榜单。Niklas Muennighoff 等2023Scaling Data-Constrained Language ModelsarXiv v1官方项目。仅作为重复数据研究的问题来源。HuggingFaceTBSmolLM2-135M-Instruct 固定模型卡。确认模型身份、指令训练与许可。Richard Socher 等EMNLP 2013Recursive Deep Models for Semantic Compositionality Over a Sentiment Treebank。数据研究背景。StanfordNLPSST-2 固定数据卡。核对划分、标签、语言与许可。Hugging FaceTransformers 固定 causal lossPyTorch固定 SGD 实现。核对目标移位、分母及更新。