
学生模型效果不好原因可能来自教师、数据、训练配置、学生容量或部署环境。团队如果一开始只改学习率和训练轮数容易在错误方向上反复试验。判断数据有没有问题需要把训练前基线、数据版本、错误分布和独立测试放在一起看。先看训练前后发生了什么变化先保留未经蒸馏的学生模型作为基线用同一份独立测试集运行。训练完成后按任务比较新旧结果。所有任务都没有改善可能是数据与学生不匹配也可能是训练过程没有真正学习。部分任务提升、部分任务退化通常要检查数据比例和标签冲突。不要只看训练损失。损失下降说明模型在适应训练目标无法单独证明目标数据正确。学生在训练集上表现很好在新样本上失效应优先排查重复样本、测试泄漏和分布偏差。每次试验只改变一个主要变量。更换数据时保持学生和训练配置稳定调整训练参数时固定数据版本。多项同时变化结果改善后也无法判断是哪一项起作用。从错误分布找到可疑数据把错误分成任务理解、事实、格式、拒答、遗漏和过度回答等类别。若某种错误在训练后明显增加回看对应任务的数据。教师回答中可能反复出现相同倾向或者人工审核规则没有统一。严重错误要单独计算。平均表现提高却在退款、合同或权限相关输入上变差模型仍然不能上线。错误样本应能关联到教师版本、数据批次和训练版本这样团队才能沿着记录定位来源。人工修改也是数据问题的线索。审核人员经常删掉无关解释学生上线后仍然喜欢扩写说明修改后的数据可能没有被正确保存或者类似样本在其他批次中仍然存在。检查重复、冲突和集合泄漏完全相同的输入输出会放大某种模式近似重复则可能让测试结果虚高。同一模板只换少量字段需要按组划分集合。来自同一长文档的多个切片也可能高度相关不能随机打散后分到训练和测试两边。标签冲突常出现在规则变更或多教师合并时。同一种输入在不同批次中对应不同答案学生会收到相反信号。可以按业务规则版本分组保留当前有效数据旧版本进入归档不再参与训练。测试集必须在训练和数据选择之外。scikit-learn 的官方实践明确提醒测试信息参与预处理或模型选择会造成泄漏评估将偏向乐观。蒸馏项目选择教师和清洗规则时同样不能反复用最终测试集做决定。对照数据批次做小实验从可疑批次中抽出一组样本去掉重复、修正冲突再训练一个小版本。另一个版本保留原数据其他配置保持一致。两个学生在同一独立集上的差异能帮助判断清洗是否有效。如果项目通过多个模型生成教师数据可以用147AI作为统一 API 接入候选按不同密钥或项目记录调用情况便于把样本关联到模型与生成批次。平台记录不能代替内容质量审核企业仍需保存输入、输出、审核状态和数据版本。抽样时不要只选择已经知道会改善的样本。常见、边界和失败输入都要保留。小实验无法覆盖全部业务但可以排除一部分错误方向减少直接重做整批数据的成本。数据修好以后还要重新验收修订数据会改变任务分布原来表现稳定的类别也可能受到影响。每次清洗后重新统计任务比例、输入长度、标签和教师来源再跑完整回归测试。只检查发生问题的类别可能错过新的退化。若数据经过多轮处理仍然无法改善学生需要回头检查教师是否适合当前任务学生容量是否足够以及任务是否应该继续拆分。数据问题并非唯一答案证据不足时不要把所有失败都归因于“数据不够多”。能够定位问题的数据体系至少要做到样本有编号、生成有版本、审核有原因、训练有对应关系。记录完整以后即使结果不理想团队也知道下一轮该改哪里。数据排查还要检查生成过程是否稳定。同一提示在不同时间或不同线路下产生明显不同的结构样本混合后会增加学生的学习难度。团队可以固定一组探针样本教师版本或生成配置变化时重新运行确认格式、拒答和关键判断有没有变化。对于依赖外部知识的任务要区分教师知识错误和资料输入错误。教师拿到过期资料答案再流畅也不适合训练。样本记录中保留资料版本和引用可以帮助团队判断该更新知识来源还是更换教师或调整提示。数据修订完成后别只看新模型是否提高。还要检查旧任务有没有退化资源和人工审核是否增加。能够改善目标任务又没有引入新的严重错误才说明这次数据修订值得保留。