
一句话总结上两篇讲了架构和踩坑这篇讲核心——Agent之间怎么通信、怎么自动派发任务、怎么自动测试闭环。从人工调度到全自动流转这条路走了三步。 前情回顾第一篇我用4个AI搭了一个虚拟开发团队——架构 overview第二篇AI虚拟团队跑了一个月我踩了这些坑——Agent撒谎、Gateway崩溃、任务卡死这一篇讲解决方案的核心怎么让4个Agent真正自动协作而不是靠人盯着调度。 核心问题Agent之间怎么说话最开始我以为用现成的多Agent框架就行。试了AutoGen、CrewAI发现它们假设所有Agent在同一个进程里我的Agent分布在不同机器上通信延迟、进程隔离、状态同步全是问题结论得自己造轮子。 第一步消息总线——给每个Agent一个收件箱目录结构inbox/xiaomi/← 小密的收件箱inbox/xiaoxia/← 小虾的收件箱inbox/xnew/← 小牛的收件箱inbox/xbai/← 小白的收件箱outbox/对应每个Agent的发件箱设计原则文件即消息每个任务就是一个JSON文件扔到对方的inbox三写入主目录 收件人inbox 发件人outbox三处同时写入兜底不丢.done标记任务完成后写一个空的.done文件用于状态同步24小时自动归档超过24小时的文件自动移到archive关键踩坑最初只写inbox结果NAS同步偶尔丢文件。三写入后从未丢过消息。 第二步即时唤醒——Agent不能靠心跳捡任务一开始用cron定时检查inbox类似心跳发现两个问题延迟高心跳间隔5-12分钟任务派发后等半天才处理漏检Agent可能在心跳间隙挂了任务石沉大海解法即时唤醒 心跳兜底派发任务后立即调用openclaw agent --agent xxx -m 检查收件箱...启动完整Agent会话处理任务。如果唤醒失败自动重启Gateway再试。心跳脚本作为最终兜底确保任何遗漏的任务都会被处理。关键发现openclaw agent --agent xxx -m ...是最可靠的唤醒方式比system event更直接。 第三步自动测试闭环——开发完自动派测试这是最有价值的部分。流程小虾完成开发 → 小密检测到 → 自动派发测试给小牛 → 小牛测试 → 有问题自动派回小虾检测开发完成小密通过扫描outbox中的小虾回复识别FIX-*/DEV-*任务完成状态自动创建测试待办文件立即通过send_task.py派发给小牛并wake。超时自动重试心跳脚本每次运行时检查所有进行中的任务超过5分钟未完成的自动重新wake对应Agent。这解决了之前wake了但Agent没响应的问题。测试失败自动重派小牛测试回复中包含⚠️标记时小密自动创建修复任务派回小虾形成闭环。️ 防护机制让系统不会死1. Gateway健康检查每次心跳用systemctl --user is-active检查Gateway进程挂了立即自动重启。2. 内存监控Gateway内存超6GB自动重启防止内存泄漏导致卡死。3. 任务卡死清理超过30分钟的RETEST任务自动清理防止垃圾文件积累。 实际效果跑了两周后的对比指标手动调度自动闭环任务平均完成时间2-3小时15-30分钟需要人工干预次数每个任务1-2次偶尔约10%任务丢失率~20%0%测试覆盖率人工决定100%自动最大的收益我可以同时推进多个任务不用盯着每一个。小虾做完一个系统自动派测试测试通过自动归档失败自动重派。我只看最终报告。 给想做类似系统的人的建议先跑通最小闭环2个Agent1开发1测试先别搞4个文件通信最稳别搞复杂的MQ文件系统就是最好的消息队列验证比信任重要Agent说完成了不算数必须grep确认心跳兜底不可少即时唤醒是锦上添花心跳才是保命的超时必须自动重试别等等就是死如果这篇文章对你有帮助欢迎点赞收藏。有问题可以在评论区交流。