
工业现场有个很微妙的分界线产线控制系统、PLC、SCADA 这些核心层常年稳定得像块石头而质检、排产、能耗分析、设备预测性维护这些外围层却一直在换新工具。过去几年大模型落地工业基本都扎堆在外围——做个知识库问答、生成个报表摘要、辅助写点工艺文档。但真正让一线工程师兴奋的是 AI 开始往核心控制逻辑里渗透。中工互联这次提的工业智能体协同说的就是这件事不是单个大模型在某个环节打辅助而是多个具备自主决策能力的智能体在工业软件体系里分工协作共同完成过去需要人盯着、跨系统协调才能干完的活。这篇文章不打算复述新闻稿。我想从一线落地的角度把工业智能体协同这件事拆开讲清楚它到底解决了工业软件体系里的什么结构性问题多智能体协同在工业场景下和通用场景有什么本质区别一个可运行的工业智能体系统需要哪些技术组件以及从外围走向核心这条路上真正卡脖子的地方在哪里。如果你正在做工业 AI 相关的选型、架构设计或者 PoC 验证这篇内容应该能帮你少走一些弯路。1. 工业软件体系里那条看不见的外围-核心分界线1.1 为什么 AI 过去只能在工业外围打转要理解从外围走向核心这句话的分量得先搞清楚工业软件的分层逻辑。一个典型的离散制造工厂软件体系大致可以分成四层最底层是设备控制层PLC、DCS、运动控制器在这里运行响应周期是毫秒级往上是数据采集与监控层SCADA、HMI 负责实时数据汇聚和可视化再往上是制造执行层MES、WMS、QMS 管生产调度、物料流转和质量追溯最上面是经营管理层ERP、PLM、SRM 这些系统管订单、供应链和产品全生命周期。AI 过去主要落在哪基本都在最上面两层以及第三层的非实时环节。原因很直接大模型的推理延迟摆在那里。一个 7B 参数的模型在消费级显卡上跑一次推理首 token 延迟通常在几百毫秒到一两秒之间而 PLC 的扫描周期可能是 10 毫秒甚至更短。你不可能让一个大模型直接去控制伺服电机的启停。所以早期工业 AI 的定位很清晰——做事后分析和辅助决策比如从历史数据里找质量问题的根因、根据订单和库存生成排产建议、把设备日志翻译成人能看懂的报告。这个定位本身没问题但它有个天花板AI 给出的建议最终还是要人去执行。人成了 AI 和核心系统之间的中间件这个中间件的带宽很低、延迟很高而且会疲劳、会犯错。这就是为什么很多工业 AI 项目做完之后客户觉得有用但不够有用——它确实省了分析的时间但没有真正改变生产系统的运行方式。1.2 智能体把建议变成了可执行的动作智能体Agent这个概念和普通大模型应用的核心区别在于它具备感知-规划-行动的闭环能力。普通大模型应用是你问它一个问题它给你一段文字。智能体是你给它一个目标它自己去调工具、查数据、做判断、执行动作、观察结果、调整策略直到目标达成或确认无法达成。放到工业场景里这个区别就变成了过去 AI 说建议把 3 号产线的温度设定值下调 2 度现在智能体可以直接调用 MES 的接口去改这个设定值改完之后监控温度曲线如果发现异常再调回来。中间不需要人点确认按钮——当然是否允许它自动执行取决于你给它多大的权限这是另一个话题。中工互联提的协同关键就在于单个智能体的能力边界是有限的。一个智能体可能只懂工艺参数优化另一个只懂设备健康管理还有一个只懂排产调度。但工业生产是个系统工程工艺、设备、排产三者是耦合的——你为了赶交期把设备开到极限设备磨损就快质量波动就大你为了保证质量把参数调保守产能就上不去。单个智能体只能看到自己那一亩三分地多个智能体协同才能处理这种跨域的权衡。1.3 工业智能体和通用智能体的本质差异这里必须说清楚一个容易被忽略的点工业智能体不是把通用智能体套个工业外壳就完事了。两者在几个关键维度上有本质差异。维度通用智能体工业智能体容错空间出错可以重试用户能容忍出错可能导致停线、废品、安全事故实时性要求秒级到分钟级可接受部分场景要求毫秒级响应数据特性以文本、图像为主时序数据、工况数据、工艺参数为主知识来源公开语料为主企业私有工艺知识、设备手册、历史工单决策可解释性黑盒可接受必须能追溯决策依据满足审计要求环境约束相对开放受物理规律、安全联锁、工艺窗口严格约束这个表格里最要命的是第一行和最后一行。通用智能体可以试错工业智能体试错的代价太高。所以工业智能体的设计哲学必须是保守优先——宁可少做不可做错。这就引出了一个核心设计原则工业智能体的行动空间必须被严格约束在安全边界内而这个边界是由工艺工程师和安全系统共同定义的不是模型自己学出来的。2. 多智能体协同在工业场景下的三种落地形态2.1 流水线式协同适合工序明确的场景这是最容易理解也最容易落地的一种协同形态。多个智能体按照工艺流程串行工作前一个的输出是后一个的输入。比如在注塑车间原料智能体负责根据订单和库存计算配料方案工艺智能体根据原料特性和模具状态生成注塑参数质量智能体根据历史缺陷数据预判可能的质量风险并给出调整建议设备智能体根据生产负荷安排模具保养计划。这种形态的好处是逻辑清晰、责任明确、容易调试。每个智能体只需要关注自己那一段接口定义清楚了就能独立开发和测试。但它的局限也很明显串行意味着延迟累加而且前一个环节的错误会一路传下去。所以在实际落地时通常会在关键节点加校验智能体专门负责检查上游输出的合理性不合理就打回去重来。我见过一个比较聪明的做法在流水线的每个环节之间加一个轻量级的规则引擎做快速校验只有规则引擎放行的结果才会进入下一个智能体。规则引擎用传统的 if-else 写响应快、可解释、不会幻觉。大模型智能体负责处理规则覆盖不到的复杂情况。这种规则兜底、模型增强的混合架构在工业场景里比纯智能体方案稳得多。2.2 黑板式协同适合需要全局优化的场景当问题变成多个目标同时优化的时候流水线就不够用了。比如一个工厂同时要满足交期、控制成本、保证质量、降低能耗这四个目标之间是相互冲突的。这时候更适合用黑板式协同所有智能体共享一块黑板可以理解为一个共享的状态空间每个智能体都能看到全局状态根据自己的专长往黑板上写建议由一个协调智能体负责综合所有建议做出最终决策。这种形态的技术难点在于冲突消解。工艺智能体说要把温度调高 5 度来改善流动性能耗智能体说温度调高能耗会增加 8%质量智能体说温度过高可能导致材料降解。三个建议都有道理听谁的这就需要协调智能体有一套明确的优先级规则和权衡逻辑。实践中这套逻辑通常不是让大模型自己悟出来的而是把工艺工程师的经验规则化之后作为协调智能体的决策依据。提示黑板式协同里黑板上写什么、不写什么是个需要仔细设计的工程问题。写太多智能体被无关信息干扰写太少智能体做不出正确判断。我的经验是黑板上的信息应该只包含当前决策必需的上下文而不是把所有数据都堆上去。2.3 层级式协同最接近工业组织架构的形态工业组织本身就是层级的班组、车间、工厂、集团。层级式协同直接映射这个结构底层智能体负责具体设备和工序的实时控制中层智能体负责车间级的协调优化顶层智能体负责工厂级的战略决策。底层向上汇报状态和异常顶层向下下达目标和约束。这种形态最大的好处是符合人的直觉工艺工程师和设备工程师能看懂每个层级在干什么出了问题也知道该找哪个层级。而且它天然支持权限隔离——底层智能体只能操作自己管辖的设备跨设备的操作必须由中层智能体发起。这在安全审计上非常重要。但层级式协同也有代价信息在层级间传递会有延迟和损耗底层看到的细节到顶层可能已经被抽象掉了。所以实际系统里通常会在层级之间加事件通道底层发现紧急异常可以直接越级上报不用一层层走流程。这个设计借鉴的是工业报警系统的思路——紧急报警永远优先于常规状态更新。3. 一个可运行的工业智能体系统需要哪些技术组件3.1 智能体运行时不只是跑个大模型那么简单很多人以为工业智能体就是大模型 工具调用实际落地时会发现远不止这些。一个完整的智能体运行时需要包含几个核心模块。首先是推理引擎。工业场景下推理引擎的选择要考虑三个因素延迟、成本、可控性。云端 API 延迟低但数据要出企业内网很多工厂不接受本地部署可控但需要 GPU 资源。目前比较务实的做法是混合部署对延迟不敏感的规划类任务走本地中等规模模型对响应速度要求高的实时判断走小模型或规则引擎只有特别复杂的推理才调用大模型。其次是工具层。智能体要能操作工业系统就必须有对应的工具接口。这些接口通常包括MES 的工单查询和状态更新接口、SCADA 的实时数据读取接口、PLC 的参数读写接口这个要极其谨慎、历史数据库的查询接口、工艺知识库的检索接口。每个工具都要定义清晰的输入输出格式、权限要求和调用频率限制。第三是记忆模块。工业智能体需要记住的东西和通用智能体不一样它需要记住当前工单的上下文、最近几次调整的效果、设备的当前状态和历史趋势。这些记忆不是简单的对话历史而是结构化的状态数据。实践中通常用短期记忆 长期记忆两层短期记忆存当前会话的状态长期记忆存历史决策和效果用向量数据库或时序数据库存储。3.2 协同调度层谁来决定听谁的协同调度层是多智能体系统的大脑它负责决定在什么情况下激活哪些智能体、如何汇总它们的输出、冲突时如何裁决。这个层的设计质量直接决定了整个系统是智能还是智障。一个实用的协同调度架构通常包含三个部分。任务分解器负责把上层目标拆解成子任务分派给对应的智能体。比如本班次产量提升 5%这个目标会被拆解成优化排产顺序调整工艺参数减少设备非计划停机等子任务。冲突检测器负责监控各智能体的输出发现矛盾时触发裁决流程。裁决器根据预设的优先级规则和约束条件做出最终决策。这里有个关键设计决策裁决器是用规则还是用模型我的建议是核心安全相关的裁决必须用规则非安全相关的优化类裁决可以用模型辅助。原因很简单规则可审计、可追溯、不会幻觉。当客户问你为什么系统做了这个决定的时候你能拿出一条条规则来解释而不是说模型觉得这样比较好。3.3 安全护栏工业智能体的生命线这是整个系统里最不能省的部分。工业智能体的安全护栏至少要包含三层。第一层是硬约束。这些是物理规律和安全联锁任何情况下都不能突破。比如温度不能超过材料分解温度、压力不能超过设备额定值、两个互斥的动作不能同时执行。这些约束通常以规则的形式硬编码在系统里智能体的任何输出都必须先通过这层校验。第二层是软约束。这些是工艺窗口和操作规范正常情况下应该遵守但特殊情况下可以申请突破。比如某个工艺参数的标准范围是 180-220 度智能体想设到 225 度系统会拦截并要求说明理由同时通知工艺工程师确认。第三层是行为约束。这层管的是智能体能做什么和不能做什么。比如质检智能体只能读质量数据、写质量报告不能改工艺参数排产智能体只能调整工单顺序不能取消工单。这层约束通过权限系统实现每个智能体有自己的身份和权限集。注意安全护栏的校验逻辑必须独立于智能体本身不能由智能体自己判断我这样做安不安全。智能体可能被对抗性输入诱导也可能因为模型幻觉做出错误判断。护栏必须是外部的、确定性的、不可绕过的。4. 从外围走向核心真正卡脖子的三个问题4.1 实时性大模型的延迟和工业控制的节拍怎么对齐这是最硬的技术约束。工业控制里PLC 的扫描周期是毫秒级运动控制的响应要求更高。大模型哪怕是最小的版本推理延迟也在几十毫秒到几百毫秒。直接让大模型参与实时控制目前不现实。那怎么办实践中比较可行的方案是分层响应。实时控制层仍然由传统 PLC 和控制器负责它们按照既定逻辑运行不依赖 AI。智能体工作在监督层它的职责是观察实时数据、发现异常模式、调整控制器的设定值和参数。设定值的调整频率通常是秒级到分钟级这个时间尺度上大模型的延迟是可以接受的。举个例子注塑机的保压压力曲线传统做法是工艺工程师调好之后固定不变。智能体可以每 30 秒根据当前模具温度、原料批次、环境温湿度微调下一模的保压压力设定值。这个调整频率下大模型完全跟得上而且调整效果可以通过下一模的质量数据来验证。4.2 数据质量工业数据比想象中脏得多做工业 AI 的人都有个共同体会数据清洗花的时间比建模多得多。工业现场的数据问题包括传感器漂移导致的数据偏移、通讯中断导致的数据缺失、不同系统之间时间戳不对齐、同一物理量在不同系统里的单位不一致、人工录入数据的错误和遗漏。多智能体协同对数据质量的要求更高因为智能体之间要交换数据一个智能体的输出是另一个的输入数据错误会被放大。所以工业智能体系统必须有一个专门的数据质量智能体负责在数据进入协同流程之前做校验和清洗。这个智能体的工作包括检查数据完整性、检测异常值、对齐时间戳、统一单位、标记不可信数据。我见过一个项目因为两个系统的时钟差了 3 秒导致排产智能体和设备智能体的判断总是对不上排查了两周才发现是 NTP 同步的问题。这种坑在通用 AI 场景里很少遇到但在工业场景里是家常便饭。4.3 信任建立让工艺工程师敢把权限交出去技术问题再难也有解信任问题才是真正的瓶颈。一个在工厂干了二十年的工艺工程师你告诉他这个 AI 系统可以自动调整工艺参数他的第一反应一定是出了事谁负责。建立信任没有捷径只能一步步来。比较有效的路径是影子模式 → 建议模式 → 审批模式 → 自动模式四阶段推进。影子模式下智能体只做决策但不执行它的决策和人的决策并行记录定期对比看谁更准。建议模式下智能体给出建议人决定是否采纳。审批模式下智能体可以执行但需要人点确认。自动模式下智能体在安全边界内自主执行人只监控异常。每个阶段至少跑够足够的生产周期用数据证明智能体的决策质量。当工艺工程师看到智能体连续三个月在某个参数上的调整效果都比自己手动调的好他自然会愿意把权限交出去。这个过程急不得跳过任何一个阶段都会埋下隐患。5. 工业智能体协同的工程落地清单5.1 选型阶段要问清楚的几个问题如果你正在评估工业智能体方案不管是自研还是采购有几个问题必须在选型阶段问清楚。模型部署在哪里是公有云 API、私有云部署还是边缘设备部署这直接决定了数据安全边界、延迟水平和运维成本。工业场景下涉及工艺参数和产品质量数据的通常要求私有化部署。智能体的行动空间有多大是只能读数据、只能给建议还是能直接写参数、下工单行动空间越大价值越高但风险也越大。要确认方案里有对应的权限管理和安全护栏。协同机制是硬编码的还是可配置的工厂的工艺和产线会变协同逻辑如果写死在代码里每次调整都要改代码、重新测试、重新上线成本太高。好的方案应该支持通过配置来调整智能体的协作关系和优先级规则。有没有可解释性支持当智能体做出一个决策时能不能追溯它是基于哪些数据、哪些规则、哪些历史案例做出的判断这在出问题排查和审计时至关重要。5.2 部署阶段容易踩的坑部署阶段有几个坑我踩过或者见别人踩过值得单独拎出来说。坑一低估了系统集成的复杂度。工业现场的系统往往是多年积累下来的接口五花八门有 OPC UA 的、有 Modbus 的、有私有协议的、还有只能通过数据库中间表交换数据的。智能体要跟这些系统对接集成工作量可能比智能体本身还大。建议在项目初期就做接口盘点把每个接口的协议、数据格式、调用频率、权限要求都摸清楚。坑二忽略了网络分区的影响。工厂的网络通常分生产网和管理网两者之间有防火墙隔离。智能体如果部署在管理网要访问生产网的数据就需要跨网段延迟和稳定性都会受影响。比较合理的做法是把实时性要求高的智能体部署在生产网边缘把分析类智能体部署在管理网两者通过消息队列异步通信。坑三没有设计降级方案。智能体系统依赖大模型服务如果模型服务挂了或者响应超时整个协同流程就卡住了。必须有降级方案模型不可用时自动切换到规则引擎的保守策略保证生产系统能继续运行。这个降级切换应该是自动的、秒级的不能等人来手动处理。5.3 运行阶段怎么持续优化系统上线只是开始持续优化才是长期工作。工业智能体的优化和通用 AI 不一样它不能只靠 A/B 测试和指标调优必须结合工艺知识。一个有效的做法是建立决策日志 效果回溯机制。智能体每次做决策都把决策依据、执行动作、执行结果完整记录下来。定期比如每周由工艺工程师和 AI 工程师一起复盘这些日志找出决策质量不高的案例分析原因是数据问题、规则问题还是模型问题然后针对性优化。另一个做法是让智能体从人的操作中学习。当工艺工程师手动调整了某个参数系统记录下调整前后的状态和调整后的效果这些数据可以作为智能体优化的训练样本。时间长了智能体就能学到老师傅的手感——那些写在操作手册里但很难用规则表达的经验。6. 关于工业智能体协同我的一些实际体会做工业 AI 这些年我最大的体会是工业场景里能用比先进重要得多。一个用规则引擎加小模型实现的、稳定运行两年的系统价值远大于一个用最新大模型搭的、三天两头出问题的系统。工业客户要的不是技术炫技是稳定、可靠、可维护。多智能体协同这个方向是对的因为工业生产本身就是多环节协同的单个智能体确实覆盖不了全局。但落地的时候一定要克制不要一上来就搞十几个智能体的大系统。从一个具体的、边界清晰的场景开始比如注塑工艺参数优化或者设备预测性维护把两三个智能体的协同跑通、跑稳再逐步扩展。每扩展一个智能体都要重新评估协同逻辑和安全边界不能想当然地认为多加一个肯定更好。还有一点工业智能体的价值最终要体现在可量化的指标上——良率提升了几个点、能耗降了几个点、非计划停机减少了多少小时。这些指标才是说服工厂继续投入的依据。技术团队容易陷入模型又升级了协同又优化了的自我感动但工厂老板只关心一件事这玩意儿到底帮我省了多少钱、赚了多少钱。把这个问题回答清楚比任何技术指标都有说服力。最后分享一个我在项目中总结的小经验在智能体系统的监控面板上除了常规的技术指标响应时间、成功率、调用量一定要加一个人工干预率指标——统计有多少次智能体的决策被人工推翻或修正。这个指标是系统成熟度的最直接反映。人工干预率持续下降说明智能体在变聪明、在赢得信任如果一直居高不下说明要么智能体的能力不够要么协同逻辑有问题需要回头检查。这个指标比任何模型评估分数都更贴近工业现场的真实需求。