ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

大模型总爱“假装完成“?我用 Boss-Worker 双智能体 + 客观 verifier 闸门治好了它

大模型总爱“假装完成“?我用 Boss-Worker 双智能体 + 客观 verifier 闸门治好了它 一、一个被很多人忽略的坑LLM 会假装完成任务写代码、做分析、跑流程——你给大模型一个任务它吭哧吭哧输出一大段看起来完成了。但你一检查要么关键步骤跳了要么结论是编的要么它自己觉得够了其实根本没达标。业界管这叫 hallucination幻觉但我觉着更准确的描述是虚假完成fake completion模型并没有能力判断我到底有没有真的做完只是顺着语言概率把回复填满。这不是小问题。一旦你把大模型接进自动化工作流比如自动写代码、自动跑实验、自动处理文件假装完成就会让整个系统silently 出错——你以为它干完了其实半路就翻车了。二、我的解法Boss-Worker 双智能体 客观 verifier 闸门我搭了一套双 Agent 架构来对抗这个问题核心就两层Worker 干活Boss 审查。不是单模型自我反思self-refine而是两个角色分离Worker 负责执行Boss 负责审核 Worker 的产出。客观 verifier 闸门作为收工的唯一判据。这是这套架构最关键的设计一个任务到底算不算完成不取决于 Boss 主观一句DONE也不依赖 Worker 自己说我搞定了而是由一个客观校验器verifier来裁定。verifier 通过了才允许收工verifier 不通过哪怕 Boss 想停也得继续。这个客观闸门是我想强调的创新点也是我个人研究阶段想深挖的方向用可解释、规则化的客观信号对抗 LLM 的虚假完成倾向。三、架构长什么样思路图┌─────────────┐ 任务 → │ CLARIFY │ Boss 先追问需求是什么完成标准是什么 └──────┬──────┘ ↓ ┌─────────────┐ │ WORKER │ 执行任务产出结果 └──────┬──────┘ ↓ ┌─────────────┐ │ VERIFIER │ 客观校验标准达成了吗 └──────┬──────┘ 通过 ↙ ↘ 不通过 ↓ ↓ ┌──────┐ ┌─────────────┐ │ 收工 │ │ BOSS 定位 │ → 指出问题 → WORKER 重做循环 └──────┘ └─────────────┘几个关键设计点权限委托Boss 持有完整权限让 Worker 不中断执行对应 WorkBuddy 子 agent 的 bypassPermissions 思路避免反复打断、来回确认。CLARIFY 阶段开工前 Boss 主动向用户追问澄清需求和完成标准——这直接决定了 verifier 用什么标准来判定做没做完。不中断循环任务没真正通过 verifier 前系统不会停下来从机制上杜绝假装完成。四、它和学术界的几个知名方案有什么不同我不是凭空造轮子。这个方向学术界已经有不少工作方案代表论文思路我的差异点自我反思循环Self-Refine (arXiv:2303.17651)单模型生成→批评→修改我的 Boss/Worker 角色分离更彻底审查者是独立实体而非自己审自己语言强化记忆Reflexion (arXiv:2303.11366)用语言做强化信号 情景记忆它靠 LLM主观自评无成功保证我用客观 verifier 给硬判定多智能体辩论Multi-Agent Debate (arXiv:2305.14325)多个对等实例多轮辩论降幻觉我是层级制Boss 指挥 Worker不是对等辩论过程奖励模型Lets Verify Step by Step (arXiv:2305.20050)逐步给推理过程打奖励PRM 需要额外训练一个模型我的 verifier 是规则化、轻量、可解释LLM 当裁判LLM-as-a-Judge (arXiv:2306.05685)用 LLM 评估 LLM我的 Boss 审查参考客观 verifier不完全依赖 LLM 主观判断一句话定位boss-worker 层级制多智能体协作 客观 verifier 闸门的完成判定。它不追求替代 PRM 那样的训练型裁判而是在轻量、可解释、即插即用的维度上提供一个补丁。五、诚实的局限也是我想继续研究的地方我必须说清楚它现在的问题不然就是自嗨verifier 的泛化性有限。规则化校验对代码能跑通文件生成了这类客观标准很有效但对文章写得好不好方案优不优这种主观标准verifier 仍然要借助 LLM 判断这时候客观优势就弱了。没有做大规模评测。目前是工程实践 小规模验证没有像 Reflexion 那样在 HumanEval 上给出 91% 这样的硬指标。这是我后续要补的。成本问题。多 Agent 循环天然比单模型贵如何控制来回轮次是工程痛点。六、为什么写这篇我在准备考研AI 方向这段时间在系统调研多智能体协作、持续学习相关的论文。我越来越觉得怎么判断一个 Agent 真的完成了任务是 multi-agent 系统落地最被低估的难题之一而客观 verifier 作为闸门是一个值得认真做下去的小切口。这篇是系列第一篇后面我会写技术拆解Reflexion 的自反思 vs 我的 verifier 闸门到底差在哪观点输出为什么LLM 当裁判不够可靠客观 verifier 的价值边界在哪如果你也在做 Agent / 多智能体 / 自动化工作流欢迎交流。也欢迎做相关方向的老师指正——我这边有一套能跑的工程实现想往可复现 有评测的方向补。
返回列表