
同一份导出文件可能混着数周的教师答案。用文件创建日期做判断最省事也最容易误放行。每条样本都应分别比较资料生效日、教师生成日、人工审核日和目标训练批次冻结日。资料在生成时有效不代表它在训练冻结时仍有效上周通过的审核也不自动覆盖今天刚发布的规则。状态之外还应有原因码。SOURCE_MISSING进入待核SOURCE_EXPIRED进入隔离SCOPE_MISMATCH交业务复审ANSWER_UNSUPPORTED直接拒收。状态告诉流水线现在怎么处理原因码解释为什么这样处理。两者全写在一段备注里下一次只能重新读人话无法统计哪类问题在反复发生。规则变更可以产生一份影响声明写清主题、适用范围、生效时间和负责人。闸门用它筛出候选样本业务方再确认是否重标。自动化负责发现不负责宣布规则有效。最终放行记录应能重建当时的规则清单、样本 ID、排除清单、审核结论和测试集版本。不少训练流水线检查得很勤JSONL 能不能解析、字段是否齐全、样本数量够不够。但这些检查挡不住一个更麻烦的问题答案所依据的规则已经失效。文件格式正确内容也可能正在教学生回答昨天的业务。版本闸门不是检查“文件是不是最新版”而是在样本入训前问三个问题这条答案依据什么生成这份依据对当前任务是否有效答案有没有超出依据允许的范围三问说不清样本就不该进入当前训练集。先把状态设计对只有“通过”和“不通过”两个状态后面一定会乱。缺少来源的样本补证后可能恢复依据已失效的样本需要重标答案遗漏关键限制条件的样本可能直接拒收。建议至少区分待核、隔离、重标、拒收和放行并给每一种状态留下原因码。例如教师生成时资料有效但目标训练版本已经过期问题不在教师调用本身应该隔离并等待重标。若依据仍有效答案却自行补出了资料没有写的资格条件不能靠改时间戳修复应拒收入训。把两类问题都叫“数据不合格”团队只会在下一次返工时重复争论。技术通过不等于业务放行我会把闸门拆成两层。第一层由数据流程处理绑定来源、比对生效时间、检查字段、检测训练与测试近似重复。第二层由业务审核处理新规则是否已批准、答案是否适用于目标客户、对外承诺是否允许由学生给出。这两个层面必须都放行。技术上能继续不代表业务上已经允许教师输出有引用来源也不代表来源适用于今天的客户范围。把业务审批偷换成模型能力是蒸馏项目最常见的责任空洞。闸门的最小实现工程上不必一开始搭复杂平台。给每个样本稳定 ID绑定来源、生效时间、任务类型和目标数据集版本运行后导出一份批次清单记录输入文件、规则版本、样本总数、隔离数、拒收数和处理人。规则发布、提示变化、检索源切换或客户范围变化时重新运行再比较两份清单的差异。隔离数突然下降不一定是好消息可能是筛选条件失效隔离数突然上升也不一定代表模型退化可能只是规则影响范围扩大。闸门的结果必须回到具体原因不能只看一个比例。最后训练导出文件、审核清单和模型版本要能对应。独立测试发现学生还在复述旧条件时团队要能重新导出数据或回到上一版学生而不是临时在提示词上打补丁。版本闸门的价值不是增加一道表格而是让暂停、重标、重训和回退都有据可查。NVIDIA NeMo 的蒸馏教程将基础学生、蒸馏学生和测试分阶段比较这也提醒我们闸门通过只证明训练目标可能可用不证明学生已经完成任务。147AI可用于候选教师调用与消耗核对规则有效性、数据授权和最终放行仍属于项目方。