
1. 模型盲目自信的代价在工业质检场景中深度学习模型输出的置信度Confidence往往被当作可信度来使用——置信度高就认为模型判得准。但在跨面料场景下这个假设经常不成立。以纺织质检为例模型在深色面料上训练和验证置信度表现良好可信度高一旦换到浅色陌生面料模型经常输出很高的置信度但实际判错了。这就是典型的**置信度失准Mis-calibration**问题。更危险的是这种虚假高置信度在生产线上会直接触发自动化分拣、报警或放行逻辑一旦模型盲目自信就可能造成批量质量事故。2. 什么是置信度校准置信度校准Confidence Calibration是指让模型输出的置信度数值与真实正确率保持一致的过程。理想情况模型输出 90% 置信度时实际正确率也接近 90%。失准情况模型输出 90% 置信度时实际正确率只有 60%甚至更低。衡量校准质量的常用指标是ECEExpected Calibration Error期望校准误差数值越低代表校准越好。3. 跨面料场景下的校准难点不同面料深色、浅色、花纹、反光材质等在成像上差异巨大模型在不同面料域上的置信度分布并不一致深色面料模型见过大量样本置信度分布合理校准良好。浅色陌生面料属于分布外OOD样本模型容易过度自信输出虚高置信度。因此不能用一个全局校准模型覆盖所有面料域需要针对不同面料域单独校准置信度分布。4. 技术方案温度缩放 分域校准4.1 温度缩放Temperature Scaling温度缩放是最简单有效的校准方法之一。它在 softmax 层引入一个温度参数 T对 logits 进行缩放具体做法是在模型输出层之前把原始的 logits 数值除以一个温度参数 T再送入 softmax 归一化。当 T 大于 1 时概率分布会变得更平滑原本过高的置信度会被压低当 T 小于 1 时分布会更尖锐置信度会被抬高。T 1不改变原始输出。T 1分布更平滑降低高置信度适用于模型过度自信的场景。T 1分布更尖锐提高置信度适用于模型过于保守的场景。下表直观对比三种温度取值对置信度的影响温度取值置信度变化适用场景示例数值原始置信度 0.95T 1不改变原始输出置信度保持不变模型校准良好、无需调整时0.95T 1分布更平滑高置信度被压低模型过度自信如浅色陌生面料0.82T 1分布更尖锐置信度被抬高模型过于保守、置信度偏低0.98温度参数 T 通过在验证集上优化 NLL负对数似然或 ECE 来求解。4.2 分域校准策略针对不同面料域分别训练各自的温度参数具体流程是为每个面料域准备一份验证集在验证集上搜索该域最优的温度参数 T并记录下来。推理时先识别当前样本属于哪个面料域再取出该域对应的温度参数进行缩放如果遇到训练时没见过的未知面料域则默认不缩放相当于 T 1。4.3 未知面料域的兜底策略对于训练时未见过的新面料域无法直接套用已有温度参数。此时可以使用所有已知域温度参数的加权平均作为初始值或直接采用保守策略T 1宁可置信度偏低也不要虚高。5. 不确定区间触发复核机制校准之后置信度分布更加合理但依然存在中等置信度的模糊地带。此时应引入不确定区间Uncertainty Interval自动触发人工复核具体规则是设定一个低阈值和一个高阈值把置信度划分为三个区间。当校准后的置信度高于高阈值时判定为高置信度直接自动放行当置信度低于低阈值时判定为低置信度直接剔除当置信度落在两个阈值之间时属于不确定区间自动转交人工复核。通过这个机制把模型不确定的样本交给人工判断而不是让模型硬着头皮给结论从流程上杜绝盲目自信造成的批量质量事故。6. 落地流程总结已知域未知域高置信度低置信度不确定区间模型输出 logits面料域识别对应域温度缩放保守温度兜底校准后置信度置信度区间判断自动放行自动剔除触发人工复核7. 总结跨面料场景下的置信度失准是工业质检落地中的常见痛点。通过温度缩放 分域校准修正置信度分布再配合不确定区间自动复核机制可以有效防止模型盲目自信造成批量质量事故。核心要点不同面料域要单独校准不能共用一套参数未知面料域采用保守策略兜底校准后仍要保留人工复核通道覆盖中等置信度区间。