
1. 先还原一下“产能崩掉”的真实现场三种典型崩法上个月我去一家做3C零部件的客户现场做产线评估一进车间就看到外观检测工位旁边堆着三台重型周转车上面全是待复判的NG品。线长正拿着对讲机跟后道工序吵架原因是前道AI视觉检测系统上线后产线每小时产出从360件掉到了190件后道全部断料。这正是测试报告里写着“检测精度99.7%”的那套系统。我当时没急着看算法先看线体结构心里已经有了答案这不是算法问题是整条产线的制造容量被检测环节打穿了。类似的情况我这两年在不同工厂见了不下十次。AI视觉检测在实验室里跑得好好的一到产线就出幺蛾子而且问题高度一致可以归结成三种典型“崩法”。第一种是节拍崩。视觉检测设备标称节拍挺快但你把它放进产线后上下料、定位、分选、通讯这些环节全都要吃掉时间整线的CT被硬生生拉长产能自然跟着往下掉。第二种是过杀崩。过杀率失控会让大量良品被判成不良虽然每个工件只是被多看一眼但当堆积量超过复判工的消化能力时工序间就会产生积压进而反向逼停前道。第三种是数据崩。系统上线后产线数据没有形成回流迭代的闭环模型对新品、新批次、新光源环境的适应能力越来越差误判率从第一天的千分之几慢慢涨到百分之几产能和质量双双恶化。后两种情况往往比节拍问题更隐蔽因为它们是缓慢恶化的。要根治先得把这三层问题拆开来看。我先从最容易出账的节拍说起。2. 节拍账算不清楚是所有产能问题的总根源很多企业把AI视觉检测当成一个“独立设备”来买只看它“单次检测耗时多少毫秒”这是个非常危险的误区。检测设备是插在产线里的它的时间开销绝不仅仅是算法推理那几百毫秒。我拿一个实际的3C外壳产线举例计算过程你们可以自己照着推。改造前整线CT是15秒一片瓶颈在前道CNC。上视觉检测时厂商给的方案文档写着“检测节拍7秒”一个工位同时拍多个面看起来完全来得及。预算也批了方案也过了结果一上线傻眼了。我来拆一下这个7秒的构成。单个工件进站后机械手从传送带抓取到检测位需要1.2秒夹具定位夹紧要1.8秒多相机逐面拍摄加频闪光源稳定需要2.5秒本地推理加结果判定约1.2秒机械手把工件分送到OK/NG线需要0.3秒。还没算通信握手和MES上报的0.5秒。加起来至少7.5秒。这已经超过标称节拍更麻烦的是只要相机出现一次定位偏差导致重拍单个工件就要多花2.5秒。实际做下来单件平均耗时接近8秒直接变成整线新瓶颈CT从15秒被拉到15秒加上批量等待时间实际产能下降了百分之三十多。问题出在哪方案阶段只看“检测耗时”没算“进出站时间”。进出站时间在设备集成中极其容易被忽略机械手动作、夹具动作、传动响应、分选动作、数据交互每一项都是实打实的时间来源。我后来复盘时给客户做了个表格把每个动作的实际耗时全部列出来标注哪些是厂商数据、哪些是通过秒表实测的结论是实测总是比厂商数据多20%到30%。所以我的建议是在设备选型阶段不要只看样册上的检测速度而是要求供应商提供“整站节拍”数据最好提供一个带上下料机械手联动的动态演示。如果供应商没有条件做整套演示宁可自己带工件去现场实测拿秒表卡完整流程而不是只看算法卡出来的毫秒数。另外要注意节拍的统计口径。很多系统给的是“平均节拍”但产线真正受制约的是峰值节拍和P95节拍。当出现连续NG时分选机构要连续动作节拍会被额外拖慢当光源老化或工件来料位置偏斜时重拍率上升也会直接冲击节拍。评估时必须用满载连续跑一个小时的数据来看而不是用空载单件来估算。产线不是实验室稳态运行数据才是有意义的。还有一部分人忽略的是电气层面的同步逻辑。视觉系统跟PLC之间的握手协议如果设计得不好比如相机还没拍完但传送带已经在动了就会频繁触发安全互锁导致整线停顿。这种情况在线体集成调试时反复出现每停一次少说耽误一两分钟一天下来累计损失比算法误判还可怕。所以在节拍验证阶段要同样关注通讯握手频率和安全互锁触发的记录数如果一小时内互锁触发超过三五次就要排查同步逻辑。3. 模型指标的光环背刺99%的准确率换了产线停线休整节拍问题算是明的过一次线就能看到。真正让技术团队跟生产团队互相甩锅的是模型指标和产线体验之间的巨大落差。算法团队汇报的时候从来都喜欢说“准确率99.5%”“召回率98%”乍一听很高但产线根本不关心这些统计量产线关心的是每万件里有多少良品被误杀以及误杀的动作会带来什么后果。这里面涉及的指标叫过杀率。我来讲个真实的案例。某五金件外观检测项目模型在测试集上精确率Precision是99.1%也就是100个报警里只有0.9个是误报听起来相当不错。但产线一天出货4万件按千分之五左右的原始报警率来算一天报警200件其中误报就有接近40件。有人会说40件也不算多啊问题在于这40件误报不是均匀分布的基本都集中在某一个特定特征上反光面毛刺。因为机加工刀具磨损后期会出现规律性毛刺AI在训练时把“毛刺”和“材料纹路”的边界学得不够清晰结果把大量正常的刀具纹路也判成了毛刺。这些误杀件全部进入复判工位。复判工位原来只有一个人原本的职责是确认真正的毛刺缺陷现在他每天要额外看几十件良品而且这些良品和真实缺陷在成像上高度相似他需要把工件拿到放大镜下反复确认单件复判时间从30秒拉长到5分钟。复判工位堆料后面的包装段断料整线被迫降速运行直到晚上被误杀的良品经过二次确认回流产能损失反而比真缺陷造成的损失大得多。另一个被忽略的问题是召回率的代价。很多团队为了跟客户保证“漏杀少”把召回率压到99%以上这意味着模型会把所有疑似缺陷全部拦截下来。生产现场跟实验室不一样产线上的工件形态千奇百怪有油污、有磕碰、有料痕、有光照不均大量本来不影响使用的“脏特征”都会被模型当作缺陷拦截。你为了抓住那一两个真正的漏网缺陷付出的代价是拦截了海量可放行产品。在高节拍产线上过杀比漏杀更伤产能因为漏杀可以通过后端抽检和人工目检补救而过杀直接冲击复判流程。这里我特别想强调一个认知AI视觉检测在产线上真正要优化的指标不是模型精度而是“每万件的过杀件数”和“每万件的漏杀件数”这两个组合指标。单独看任何一个都不够。漏杀决定客户投诉风险过杀决定产线效率。两个要达到平衡点不是说越高越好而是要结合人工复判的产能来定。如果复判工位一天能消化200件系统每天误杀控制在50件以内是可以接受的如果复判只有半个人的产能那过杀率就得压到极低。实操上推荐在模型测试阶段做一张“过杀-漏杀曲线”跟模型团队明确宁可漏杀率放宽到0.5%也要把过杀率压到0.1%以内。这不是放纵缺陷而是从系统总成本考虑的务实选择。因为漏杀件可以在后端成品检验环节再抽一层而过杀件造成的复判人工成本和物料流转成本是每天都在烧钱的。4. 拦截策略是产能的分水岭硬剔除、软剔除与人工复判流模型指标达标了节拍也验证过了产线还是有可能崩问题出在拦截策略上。很多项目第一批上线的时候就要求做到全自动硬剔除检测结果一出来NG件直接由机械手拨到不合格线。这个方案听上去很酷但实际上对过杀率的要求极其苛刻。前面说了AI模型刚上线时跟产线实际数据的适配度一定存在gap哪怕前期采集了两万张图现场的光照、来料、批次差异都会带来模型没见过的新情况。在这个阶段直接开硬剔除就是让一个还在实习期的员工去做最终裁决出问题是必然的。我建议的实践路径是分三阶段走。第一阶段1到2周做仅标记模式。AI检测照常跑结果只做LED亮灯提示和MES记录不触发任何分选动作所有产品还是走原有的人工目检流程。这个阶段的目的有三个一是让产线员工观察AI的判断跟自己的判断有什么出入二是采集真实现场的通过/拦截数据用于量化过杀率和漏杀率三是让算法团队基于新数据做第一轮迭代。第二阶段1到2周做软剔除模式。AI判NG的工件自动分流到复判工位但复判结果如果判定为OK可以一键回流主线不需要走报废流程。同时要设定一个比例阈值如果某一天复判工位判定OK的比率超过30%就说明模型过杀率太高系统要自动报警提示切换到保守模式。第三阶段才是全自动硬剔除。这个阶段必须满足两个条件连续一周的过杀率低于1%且漏杀率为0同时复判工位确认效率已经稳定。即便如此我仍然建议保留一个“人工抽检确认”的物理旁路给系统留后路。拦截策略里还有一个极易被忽视的问题——信息流和物流的对应关系。系统判了NG机械手也把它拨走了但如果这条NG信息没能跟具体的物理工件绑定复判工位就不知道手里拿的到底为什么被拦截只能靠猜。尤其是当两条产线共用一台检测设备的时候追踪信息混乱是常态。处理办法是给每个工件打二维码或钢印码检测时扫码绑定结果复判时扫码即可调出AI的判定截图和置信度把“人找信息”变成“信息找人”。另外复判工位的缓存设计也要提前规划。每个NG件在复判台的停留时间设定多少缓存区放多少料架信号灯用什么颜色表示积压告警这些都会影响整线流动性。我的经验是NG缓存区容量按“两小时峰值NG量”来设计至少按正常量的一倍留冗余否则一旦过杀率异常缓存区直接爆掉产线只能停线搬运。这部分的底层逻辑其实是把AI系统当成一个需要训练和质量管理的员工来看待。你不会让一个刚来的新人独立做最终判定同理也不要让一个刚部署的模型直接拥有拦截权。用制度设计去对冲模型初期的不可靠是产线产能不崩的底线。5. 数据闭环转不起来视觉系统会越用越歪很多项目上线之后算法团队的交付就算完成了模型冻结在主机里再也不动。这是我看过的最多、也是后果最严重的问题。AI视觉检测不是一锤子买卖数据闭环不转系统的性能就一定会漂移早晚会漂到产能崩盘。我遇到过一个具体的漂移案例。某连接器产线AI系统上线第一个月质量表现非常好漏杀率0过杀率0.3%。两个月后过杀率悄悄涨到了2%而且集中在特定批次的端子划痕判定上。查来查去原因很简单那个月供应商换了新的冲压模具端子表面的微观纹路变了AI在没有重新训练的情况下把新纹路当成了缺陷。这就是典型的数据漂移。产线上影响成像的因素太多了光源LED用久了亮度衰减、机种切换、供应商批次更换、来料角度随机性、环境灰尘进入光学路径每一个都能让图像分布偏移。而模型一旦部署上线、处于冻结状态就没有任何自我修正能力。要让数据闭环转起来至少要建立三个机制。第一个机制是图像回流与分级。所有经过检测的工件图像都要自动存储系统至少要保留三个月。不是随便存而是按“确认缺陷”“确认良品”“待仲裁”分成三个桶每个桶的图都要有标签。尤其要保留“AI判NG但人工判OK”的图这是训练模型最珍贵的数据。第二个机制是周期性重训。我建议第一个月每周做一次增量训练第二、三个月每两周一次之后每月一次。增量训练不需要把全部历史数据重跑而是用新标注的数据微调原有模型训练成本不大但能持续压制漂移。还要注意在重训前做数据清洗把标注错误、重复帧、低质量帧全部筛掉否则就是垃圾进垃圾出模型会越训越歪。第三个机制是灰度发布。每次新模型训练完成不要直接覆盖线上的模型。我推荐的做法是新旧模型并行运行48小时对比同一批图像的判定结果差异计算两个模型的重合度和分歧度。只有分歧度低于3%且新模型在分歧样本上的表现明显优于旧模型才能切换。这就相当于给模型迭代做了个“AB测试”避免越改越差。这里我要说一个容易忽略的组织问题数据闭环需要现场人员配合标注但现场人员的KPI往往是产量不是数据质量如果品管和算法团队不在一个考核体系里回流标注就很难落地。所以数据闭环建设不能只靠技术手段还要在制度上明确谁负责标数据、谁负责回收模型反馈建议由品管牵头组织一个“AI运维小组”定期开复盘会拆分误判样本明确改进归属。这套流程一旦运转起来模型才能越用越准产能才能从“上线时的高峰”变成“稳定运行的高原”。6. 组织磨合和上线节奏别看算法先看人心最后一个维度的坑最容易被技术团队忽略——人的问题。一线操作工的抵触心理是真实存在的。很多质检员干了七八年靠眼睛和经验吃饭公司忽然上了AI他的第一反应不是“工具好用”而是“我的饭碗要不要被端走”。这个情绪如果没人管他会用脚投票故意把节奏放慢对复判工作消极怠工甚至明明系统判了OK他还要眼神示意后道再“手动检查一遍”。我见过一个工厂上线两周后AI系统被偷偷关掉了电源原因是夜班质检员觉得“机器判得不准还是我眼睛靠得住”。这种对立情绪很难通过说教解决更好的做法是在制度设计上给足过渡期并且把人放在“AI的上级”而不是“AI的下级”的位置。我在前面的章节里讲的双轨运行模式本质上也是在为这个问题服务——在过渡期内AI只是建议人做最终决定。你要让员工感受到“我用AI是多了个帮手不是被指挥”。复判工位的人工确认动作也是在保留人的话语权这个动作本身就是建立信任的过程。还有一个组织层面的问题上线节奏和考核指标必须解耦。很多工厂在上线第一周就把AI检测结果计入产能考核和一次良率统计结果算法还在调优产品就已经在背上“质量事故”的锅了。生产经理不是傻子他会立刻把人工目检的比例调高虽然这样保住了质量指标但经过人工加AI的双重检测产能直接腰斩。然后他会在周会上报告AI视觉检测上线导致产能下降建议退回人工。这套逻辑闭环下来AI项目被毙掉几乎是必然结果。我建议的上线节奏是这样的第1到2周AI检测结果只做记录不考核产能统计维持原口径第3到4周AI结果作为参考项计入质量日报但不直接触发批量停线或报废第5到6周AI自动拦截纳入正式考核但设置“AI置信度低于0.9的NG件必须人工复核”的保护机制只有在连续稳定运行一个月后再把AI判定作为唯一判定依据取消人工全检。这样既给了模型成长周期也给了现场人员适应周期还给了管理者建立信心的周期。按这个节奏走组织层面通常不会出太大问题反而会在第3周左右出现一个有趣的现象产线的老质检员开始主动给算法团队提“这个反光也能判吗”“这个凹坑为什么不拦”之类的建议。当一线人员开始帮AI改进说明这个项目已经在组织层面落地了这时候产能和良率指标才真正有了保障。我回想自己看过的那么多AI视觉检测项目凡是以“换掉人工”为目标上线的几乎都经历了痛苦的磨合期而凡是把“AI帮我减轻人工负担”作为定位来推的反而在中后期自然达到了减少人力的效果。这就是组织和人心层面的逻辑跟算法精度同等重要。最后说两句我个人的体会。AI视觉检测上线后产能崩掉真正的原因从来不是某一个单一的算法缺陷而是一整套系统在节拍、过杀、拦截、数据闭环和组织磨合五个维度上的连锁反应。它就像新员工入职指望他第一天就干满老员工一半的活那是管理者的预期问题不是新人的能力问题。所有准备上这套系统的工厂建议把本文提到的这五个环节当成一份上线前的自查清单逐项打钩之后再来谈产能提升。