
1. 那个让90%工业AI项目翻车的全产线覆盖我做了快十二年的工业视觉和上位机系统集成见过太多项目从立项到烂尾的全过程。如果让我总结一条最致命的死因老板拍脑袋要全产线覆盖绝对排第一。这不是技术问题是需求边界问题但最后背锅的永远是技术团队。先把这个场景说清楚。什么叫全产线覆盖一条服装代工产线从裁片、车缝、锁边、整烫到成衣质检十几个工位老板看完某家AI公司的演示视频觉得机器视觉检测这东西很神于是开会拍板整条线都上AI每个工位都要检测一个都不能漏。技术负责人当场脸就绿了但没人敢在会上说不。我接手过三个类似的项目两个死在了POC阶段一个勉强上线后三个月被拆掉。死法各不相同但根子都一样把AI能做什么和这条产线需要AI做什么混为一谈了。工业AI检测、机器视觉、上位机、大模型、Agent这些词现在太热热到老板们觉得不全面覆盖就是落后但工业现场的逻辑恰恰相反——能用一个工位解决的问题绝不要铺到十个工位。这篇东西我想聊的不是AI不行而是怎么把一个注定要翻车的全产线覆盖需求拆解成能落地、能验收、能活下来的分阶段方案。适合谁看正在被老板逼着做全产线AI覆盖的技术负责人、刚入行做机器视觉和上位机开发的工程师、以及那些想搞清楚工业AI到底用云还是单机、用什么大模型才够的从业者。我会把选型逻辑、参数计算、实操步骤、踩过的坑全部摊开讲你拿去就能对着自己的项目改。2. 先搞清楚工业AI到底跑在云上还是单机这个问题被问烂了但答案从来不是二选一。热搜里工业ai检测、服装检测这类ai用的是云联网还是单机的ai这个问题本质是在问推理算力放在哪。我的经验是产线现场用单机边缘推理云端只做训练、模型管理和数据回流。原因很实在不是技术洁癖。2.1 为什么现场必须单机算一笔延迟账服装检测这种场景产线速度大概是每分钟通过30到60件单件在检测工位的停留时间按1秒算。如果走云端推理一次往返的网络延迟保守估计80到200毫秒加上图片上传的带宽时间一件衣服的检测周期轻松超过500毫秒。产线不会等你超时的结果就是漏检或者产线停机。单机边缘推理的延迟可以压到30到80毫秒用一张中端推理卡比如算力在20到40 TOPS区间的边缘盒子就能扛住。我实测过一个服装瑕疵检测的模型输入分辨率1280x960用TensorRT量化到INT8之后单帧推理稳定在45毫秒左右加上预处理和后处理整条链路120毫秒以内完全跟得上产线节拍。注意边缘设备的散热和供电是隐形杀手。我见过一个项目边缘盒子塞在电控柜里夏天柜内温度到55度推理卡降频延迟从50毫秒飙到200毫秒产线直接报警。选边缘设备一定要看工作温度范围工业级至少要-20到60度。2.2 云端到底干什么别让它干脏活云端不是不用而是用在刀刃上。我的分工是这样的模型训练和微调这个必须放云端或者机房用大模型微调技术、大模型部署工具比如常见的开源推理框架来跑边缘设备扛不住训练。数据回流和难例挖掘现场检测出的可疑样本、误检样本定期回传到云端作为下一轮微调的素材。模型版本管理和下发云端管版本边缘设备定时拉取新模型灰度发布。报表和看板这个可以放云端不影响实时性。至于用什么大模型足够这里要泼盆冷水。工业检测的主干模型绝大多数不是大模型而是小模型。YOLO系列、分割网络、分类网络这些才是主力参数量从几M到几十M。大模型LLM在工业AI里的角色是辅助比如用Agent做检测结果的语义分析、生成质检报告、回答产线工人的问题。真正做像素级缺陷判定的还是那些专门训练的小模型。2.3 云边协同的架构长什么样我画不出图也不打算画但可以用文字把架构说清楚现场层是相机加光源加边缘推理盒子盒子跑量化后的小模型输出检测结果给上位机。上位机C#或者LabVIEW写的负责和PLC通信、控制剔除机构、显示界面、记录数据。上位机把结构化结果和可疑图片通过内网传到边缘服务器边缘服务器做初步聚合再定时同步到云端。云端跑训练流水线产出新模型通过OTA下发回边缘。这个架构里上位机是承上启下的关键。热搜里c#上位机上位机开发串口助手上位机这些词热度高不是没道理因为工业现场的设备通信、协议解析、界面交互全靠它。上位机写不好再好的AI模型也白搭。3. 把全产线覆盖拆成能验收的分阶段方案现在进入正题。老板要全产线覆盖你不能直接说不但你可以把它拆成三个阶段每个阶段都有明确的验收标准和退出机制。这套方法我用了三次两次成功把项目从死亡线上拉回来。3.1 第一阶段单点突破选一个高价值低难度工位不要一上来就挑最难的工位。什么叫高价值低难度缺陷特征明显、背景稳定、节拍宽松、人工检测容易疲劳的工位。服装产线里成衣外观质检比如污渍、破洞、明显色差就是典型。这个工位人工检测员一天看几千件眼睛都花了漏检率高AI替代的价值大而且缺陷特征相对好定义。反过来车缝工位的线迹检测就难得多线迹细、背景是布料纹理、光照变化大模型很难做稳。第一阶段千万别碰。第一阶段的验收标准要写死指标目标值说明检出率≥95%缺陷样本中被检出的比例误检率≤5%正常样本被误判的比例单件检测耗时≤300ms从触发到输出结果连续运行稳定性≥72小时无人工干预连续运行提示误检率比检出率更致命。检出率低一点人工复检能兜底误检率高了产线天天报警停机工人会直接把设备关掉。我吃过这个亏第一阶段误检率必须压到5%以下宁可漏检。3.2 第二阶段横向复制但只复制同构工位第一阶段跑通之后老板肯定想快速铺开。这时候要克制只复制同构工位——也就是相机安装方式、光照条件、检测逻辑高度相似的工位。比如成衣质检跑通了可以复制到半成品外观质检因为两者都是拍一张图判断表面缺陷。不同构的工位比如从外观检测跳到尺寸测量那是另一套逻辑相机标定、坐标系转换、精度要求全变了不能算复制要重新做POC。第二阶段的重点是工程化把第一阶段的代码、模型、上位机界面做成可配置的模板新工位只需要改配置文件和重新训练模型不用重写代码。这一步做扎实了后面扩展才快。3.3 第三阶段才谈全产线而且要有熔断机制到第三阶段技术上可能已经能覆盖大部分工位了但一定要给老板一个熔断机制任何一个工位如果连续一周误检率超过阈值自动降级为辅助模式只提示不剔除人工确认后再决定是否继续。这个机制是保命的它让项目不会因为某个工位拖垮整条线。我见过最惨的案例就是没有熔断机制一个工位模型漂移了没人发现误检率飙到30%产线停了两天最后老板一怒之下把整条线的AI全拆了。如果当时有熔断最多就是那个工位降级其他工位照常跑。4. 核心实操从相机选型到上位机联调这一节讲具体怎么做。我会按一个服装外观质检工位的完整落地流程来写你照着改就能用。4.1 相机和光源选型参数怎么算相机选型第一步是算视野和精度。假设要检测的最小缺陷是0.5毫米要求至少3个像素覆盖那么单像素精度就是0.5/3≈0.167毫米。如果视野是400毫米宽那么横向分辨率至少是400/0.167≈2400像素。所以选500万像素2592x1944的工业相机刚好够用留点余量。光源用条形光源加漫射板做暗场照明突出表面瑕疵。服装面料反光不均匀用同轴光容易过曝暗场更稳。光源控制器要能调亮度现场调试时根据面料颜色微调。镜头选定焦工业镜头焦距根据工作距离算。工作距离500毫米视野400毫米用1/1.8英寸靶面的相机焦距大概12毫米。这个用镜头选型公式算一下就行网上有现成的计算器。4.2 模型训练小模型微调才是主力主干网络我一般选YOLOv8的n或者s版本参数量小边缘设备跑得动。训练数据至少每个缺陷类别500张以上正常样本2000张以上。数据增强用旋转、亮度扰动、轻微模糊不要用太激进的增强工业图像不需要。训练完之后做INT8量化这一步是边缘部署的关键。量化后模型体积缩小到原来的四分之一推理速度提升2到3倍精度损失控制在1%以内。量化需要校准集用现场采集的200到500张代表性图片就行。至于大模型微调在这个环节用不上。大模型微调实战那套东西是用在质检报告生成和异常归因分析上的。比如检测到一批污渍缺陷用Agent调用大模型分析这批缺陷是否集中在某个时间段、是否和某批面料相关输出一段自然语言的分析结论给主管看。这个用免费大模型API或者私有化部署的开源模型都能做不需要微调提示词工程就够了。4.3 上位机开发C#是首选上位机我用C#写WinForm或者WPF都行WPF做界面更现代。核心模块有四个相机采集模块调用相机SDK用回调方式取图避免阻塞主线程。推理调用模块把图片传给边缘推理服务可以用gRPC或者HTTP拿回检测结果。PLC通信模块用Modbus TCP或者西门子S7协议把剔除信号发给PLC。数据记录模块把每件产品的检测结果、图片路径、时间戳写进数据库用SQLite就够。// 相机回调取图的简化示例 private void OnImageGrabbed(object sender, ImageGrabbedEventArgs e) { var image e.Image.Clone(); // 丢到线程池处理避免阻塞采集线程 ThreadPool.QueueUserWorkItem(_ ProcessImage(image)); } private void ProcessImage(Image image) { var result InferenceClient.Detect(image); if (result.HasDefect) { PlcClient.SendRejectSignal(); } DbLogger.Log(result); }注意上位机界面刷新频率不要太高检测结果用队列缓冲界面每秒刷新一次就行。我见过界面每帧都刷的CPU占用直接拉满推理都变慢了。4.4 联调阶段的时间分配联调是最耗时的我的经验是相机和光源调试占30%模型调优占40%上位机和PLC联调占30%。模型调优最花时间因为要反复采集难例、重新训练、重新量化。预留至少两周的联调时间别信一周上线的鬼话。5. 那些没人告诉你的坑和排查技巧这一节是干货中的干货都是我拿项目换来的。5.1 模型漂移最隐蔽的杀手模型上线后精度会慢慢下降这叫漂移。原因可能是面料批次变了、光源老化了、相机位置被碰了。排查方法每周抽检100件人工核对算检出率和误检率。如果连续两周下降超过3%就要重新采集数据微调模型。5.2 常见问题速查表现象可能原因排查方法解决误检率突然升高光源亮度变化检查光源控制器重新标定亮度推理延迟变大边缘设备过热降频查看设备温度改善散热上位机卡死相机回调阻塞主线程查看线程状态改异步处理PLC无响应网线松动或IP冲突ping测试检查网络模型加载失败量化模型和推理引擎版本不匹配查看日志统一版本5.3 和老板沟通的技巧技术问题好解决人的问题难。老板要全产线覆盖你要做的是把风险翻译成钱。不要说这个工位做不了要说这个工位如果强行上误检率会导致每天停机2小时按产线产值算一天损失X万。老板听得懂钱听不懂技术。另外每个阶段结束都要主动汇报用数据说话检出率多少、误检率多少、节省了多少人工。数据好看老板才愿意给你时间做下一阶段。6. 关于Agent和大模型别被概念带偏最后聊聊Agent。现在Agent很热agent开发、agent架构、ai agent搭建这些词满天飞。工业场景里Agent能干什么我的看法是Agent适合做检测之后的决策辅助不适合做检测本身。比如检测到一批缺陷Agent可以自动查询MES系统、查询面料批次、查询设备参数然后生成一份归因报告。这个用Agent框架比如常见的开源Agent框架加上大模型API就能做。但你要让Agent直接控制产线剔除那风险太大了模型幻觉一次就是一批废品。至于ai agent怎么扛并发工业场景并发不高一条线每秒最多几件用不上高并发架构。别把互联网那套高并发思维硬套到工业上工业要的是稳定和确定性不是吞吐量。大模型部署方面如果要做私有化用开源模型加推理框架部署在机房就行不用追求最大参数量的模型7B到14B的模型在质检报告生成这种任务上完全够用。免费大模型API可以用来做原型验证但生产环境建议私有化数据安全是一方面稳定性是另一方面。我在实际项目里的体会是工业AI的难点从来不是模型有多先进而是你能不能把需求边界划清楚、把工程细节做扎实、把老板的预期管理好。全产线覆盖不是不能做而是要分阶段做、有熔断地做、用数据说话地做。那些死在全产线覆盖上的项目90%不是技术不行是节奏错了。