ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

错而有用:多智能体交互消息中超越答案正确性的轨迹价值

错而有用:多智能体交互消息中超越答案正确性的轨迹价值 错而有用多智能体交互消息中超越答案正确性的轨迹价值arXiv:2608.14375v1 [cs.AI]摘要现有多智能体推理系统普遍依靠一致性、置信度、自动化打分筛选交互消息隐含假设答案正确的消息才具备保留价值。但本文发现一条关键反常识规律即使消息给出错误答案其内部推理过程、约束条件、科学原理依然具备参考价值反之答案正确的消息也可能附带误导性推导干扰后续智能体整合输出。本文提出DHD多样假设审议可控测量协议固定全部智能体生成的消息池通过「隐藏/展示单条消息」的重放对比量化每条消息的轨迹价值——即该消息是否提升下游整合智能体的解题效果。实验覆盖5类数学/科学基准数据集、两大开源模型gpt-oss-120b、gemma-4-31B-it所有数据集与模型组合中均存在「错而有用wrong-helpful」消息在所有会改变最终答案的错误消息里超4成能正向提升推理效果。受控重复重放实验p0.0002证明观测到的消息作用并非模型随机波动导致。针对「错而有用」消息的消融实验表明完整消息效果最优仅保留推理过程的表现远好于只保留错误答案。同一问题内基于多次重放得到的轨迹价值标签比单纯依靠答案正确性更适合判断消息取舍。核心结论答案正确性仅为辅助参考指标无法决定一条消息对后续推理的实际轨迹价值DHD协议可精准量化轨迹价值并生成可复用标签指导智能体动态筛选交互信息。1 引言1.1 研究背景当前多智能体推理流程会生成多条候选推理消息主流筛选策略依靠输出一致性、置信度、训练打分模型、投票机制过滤冗余信息多智能体通信剪枝算法也会剔除干扰、冗余消息。上述方案存在统一缺陷推理阶段无法获取真实标准答案只能用答案正确性作为消息可靠性代理指标默认「答案对消息有用、答案错消息无用」但两套标准完全可以分离提案正确性单条消息自身给出的答案是否符合真值轨迹价值将该消息提供给下游整合智能体后整体推理结果是否变好。一条消息由「完整推理过程最终答案」组成即便答案计算出错其中的分解思路、边界约束、基础定理依然能给下游智能体提供关键启发反之正确答案搭配误导性推导会干扰整体整合降低最终准确率。本文将前者命名为错而有用wrong-helpful消息后者命名为对而有害correct-harmful消息。从信息价值理论视角消息价值取决于决策者能从中获取的有效信息而非每条语句完全无误轨迹价值具备强上下文属性同一条消息的价值随消息池、下游整合模型变化不存在固定固有分数。1.2 典型案例案例1错而有用消息数论问题数据集Omni-MATH-2问题正整数L LL定义S L ∑ n 1 L ⌊ n / 2 ⌋ S_{L}\sum_{n1}^{L}\lfloor n/2\rfloorSL​∑n1L​⌊n/2⌋求所有使S L S_LSL​为完全平方数的L LL真值KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲L1\)或所有偶数消息推理将L LL分奇偶拆分推导S 2 m m 2 S_{2m}m^2S2m​m2、KaTeX parse error: Cant use function \( in math mode at position 6: S_{2m\̲(̲1\)}m(m\(1\)…连续整数乘积不可能为平方但最终答案只写「所有偶数」遗漏边界KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲L1\)。重放对比展示该消息时整合模型输出完整正确答案隐藏该消息模型直接遗漏KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲L1\)。机理奇偶拆分的核心推导为整合模型提供关键思路仅最终结论遗漏特例。案例2对而有害消息材料科学MaScQA问题天然橡胶重复单元分子量68硫原子量3250g橡胶搭配10g硫1:1配比下最大交联位点占比真值42%~43%消息推理摩尔换算正确同时提出「1个硫原子可连接2个位点」的猜想最终答案43%正确。重放对比展示该消息时整合模型被双倍猜想干扰输出85%隐藏该消息输出42.5%正确。机理正确答案附带的额外误导假设放大了池内其他错误推导。仅依靠端到端最终准确率无法识别上述两类消息的差异化影响而DHD协议固定消息池、仅切换单条消息可见性区分「有好思路但被忽略」和「有思路但被干扰」两种场景。1.3 核心研究问题单条消息的提案答案正确性能否决定其对下游整合推理的轨迹价值1.4 本文四大贡献概念区分严格分离消息的提案正确性与上下文相关轨迹价值提出错而有用、对而有害两类典型消息方法创新设计DHD多样假设审议测量协议采用留一法LOO重放在固定消息池下量化每条消息的轨迹价值大规模实证在5套跨领域基准、两大开源模型完成完整实验验证错而有用消息普遍存在统计显著性排除随机波动落地价值消融实验证明推理内容是消息价值核心基于重复轨迹价值标签可优化同问题内消息筛选策略优于仅依靠答案正确性。2 相关工作2.1 步骤监督与自修正推理过程奖励模型基于正确解给推理步骤打分自精炼、自我批判类模型利用反馈迭代修正输出但大模型常难以充分吸收外部反馈。本文不聚焦单模型自我修正而是衡量跨智能体消息的相互影响。2.2 错误样本的学习价值已有工作证明失败轨迹、错误演示样本可提升上下文学习效果本文在此基础上细粒度量化单条跨智能消息在特定上下文内的正向/负向作用。2.3 多推理路径生成与筛选自一致性、思维树、假设搜索等方法生成多条推理路径依靠一致性、置信度筛选通信剪枝限制传输消息总量。现有方案以提升最终准确率为目标DHD仅作为测量工具固定消息池分析每条消息的独立贡献不做筛选优化。2.4 多智能体协同与贡献归因辩论、角色分工、多智能共识机制聚合多条推理现有归因多基于沙普利值需要遍历所有子集本文采用留一重放仅对比「完整池/移除单条消息」两种场景轨迹价值仅适用于当前固定消息池不具备通用属性。2.5 重放归因研究近年工作使用移除重放分析智能体贡献但未将重放效果与消息自身答案正确性绑定沙普利值为全局平均归因本文LOO对比仅针对观测到的固定消息池标签具备上下文特异性。3 方法DHD多样假设审议协议3.1 基础定义设任务x xx真值y yyE ( x , a , y ) ∈ { 0 , 1 } E(x,a,y)\in\{0,1\}E(x,a,y)∈{0,1}为答案等价判定函数一条消息h i h_ihi​包含完整推理文本提案答案a i a_iai​两条核心评价指标提案正确性c i E ( x , a i , y ) c_iE(x,a_i,y)ci​E(x,ai​,y)仅评判消息末尾答案是否正确局部指标轨迹价值KaTeX parse error: Cant use function \( in math mode at position 18: …elta_{i,K}\in\{\̲(̲1\),0,-1\}匹配重放对仅一条消息展示/隐藏其余完全固定的输出差异KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲1\)有用展示消息时整合答案正确隐藏则错误0 00中性两种场景答案正误完全一致− 1 -1−1有害隐藏消息时整合答案正确展示则错误。「错而有用」即KaTeX parse error: Cant use function \( in math mode at position 20: …0,\Delta_{i,K}\̲(̲1\)「对而有害」即c i 1 , Δ i , K − 1 c_i1,\Delta_{i,K}-1ci​1,Δi,K​−1。期望轨迹价值公式Y S Y_SYS​为消息子集S SS下整合结果是否正确τ i , K Pr ⁡ ( Y H K 1 ) − Pr ⁡ ( Y H K ∖ { h i } 1 ) \tau_{i,K}\Pr(Y_{H_K}1)-\Pr(Y_{H_K\setminus\{h_i\}}1)τi,K​Pr(YHK​​1)−Pr(YHK​∖{hi​}​1)τ i , K 0 \tau_{i,K}0τi,K​0代表该消息平均提升解题成功率小于0则降低。3.2 DHD协议完整流程DHD仅用于测量消息价值不做精度优化核心设计一题分配5个互补角色5个独立假设智能体Hypothesizer生成互不干扰的消息无提前过滤所有消息存入缓存池H 5 { h 1 , . . . , h 5 } H_5\{h_1,...,h_5\}H5​{h1​,...,h5​}再由独立整合智能体Integrator读取子集生成最终答案。角色分配招募智能体Recruiter输入题目生成5道领域专属互补解题角色全程看不到真值、无任何消息输入消息生成5个假设智能体每个智能体仅获取题目自身角色看不到同伴消息、评价结果、标准答案输出结构化消息推理思路、关键约束、自检方向、提案答案缓存固定5条消息永久缓存后续所有重放不重新生成消除生成随机性干扰整合推理Integrator读取选定消息子集综合推导唯一最终答案不会简单投票复制高频提案结果判定Evaluator仅接收整合输出与标准答案不读取任何推理内容输出二元正误标签。3.3 两类重放测量方式缓存消息池固定仅修改消息可见性其他全部参数、prompt、模型不变单消息重放仅展示h i h_ihi​对比无任何消息的独立求解基线衡量单条消息单独解题能力池内留一法LOO重放核心测量手段完整5条消息池 vs 移除h i h_ihi​的4条消息池衡量该消息在多消息共存环境下的贡献。两类重放回答不同问题单消息看独立解题潜力LOO看消息共存环境下的增益/干扰轨迹价值标签不要求两类重放结果一致。3.4 标签分类矩阵交叉「提案正确/错误」与「有用/中性/有害」得到6类消息错而有用、错而中性、错而有害对而有用、对而中性、对而有害中性代表消息冗余不改变最终答案本文重点研究两类非中性反例。4 实验设置4.1 基准数据集全部公开数据集领域样本总量任务类型Omni-MATH-2竞赛数学4181开放式数学求解JEEBench工科综合考试515选择数值计算SciBench大学理化580公式推导数值题LAB-Bench生物长文本选择741长证据多选题MaScQA材料科学649混合格式计算问答4.2 测试模型两套开源完整可复现gpt-oss-120b简称OSS接口标识openai/gpt-oss-120bgemma-4-31B-it简称Gemma接口标识google/gemma-4-31B-it同一模型统一承担招募、假设、整合三类智能体评价器统一使用gpt-oss-120b保证跨模型评判标准一致。解码超参配置假设智能体生成多条差异化消息temperature0.7招募、整合、评价智能体temperature0所有角色设置token上限不截断输入消息4.3 样本规模LOO主实验OSS有效消息91740条Gemma有效消息83020条每条消息含完整提案答案重复重放显著性实验每个数据集抽取200题单模型合计1000题/套每题35次整合调用组件消融实验筛选22条Gemma错而有用消息分别隐藏推理/答案做对比。4.4 实验算力与成本说明DHD单次一题生成5条消息K5完整LOO扫描需要6次整合推理全池5次移除重复重放每题35次整合单套模型总调用量极高Omni-MATH-2单题token消耗区间18k ~ 616k tokens完整成本统计见附录D评价器一致性测试16724份样本三类评价模型两两一致率94.2%~96.6%。5 实验结果5.1 基础准确率多消息池增益有限K0无消息独立求解 vs K5完整5条消息池宏观准确率模型K0均值K5均值整体变化OSS73.3%74.9%(1).6pctGemma78.1%78.4%0.3pct分数据集涨跌分化严重原因是有用、有害消息效果相互抵消整体均值掩盖单条消息的巨大差异仅看整体准确率无法分析消息内在价值。5.2 候选答案可获取性远高于整合准确率OSS数据集内单题5条消息至少1条答案正确的占比76.0%95.4%但K5最终准确率比该数值低4.236.2个百分点证明即使存在正确提案整合模型也可能被其他消息干扰无法有效利用。补充现象仅36.9%的Gemma完整消息池存在多数正确答案但整体池准确率78.7%简单投票机制无法解释整合模型行为。5.3 核心结果答案正确性无法决定轨迹价值5.3.1 错消息中大量存在正向增益在所有会改变最终答案的错误消息内OSS41.9%为错而有用Gemma45.3%为错而有用95%问题聚类bootstrap置信区间OSS[39.5%,44.3%]、Gemma[42.6%,48.1%]所有数据集均观测到该现象。5.3.2 重复重放统计检验p0.0002同一输入两次完整池推理OSS7.3%、Gemma2.1%会出现答案不一致说明存在模型随机波动构造5000组置换空数据集交换「完整池/移除单条」标签无一组复现观测到的错而有用总量全局置换检验p0.0002证明现象并非随机噪声多重检验Benjamini–Hochberg校正后Gemma在全部5个数据集均存在可复现错而有用样本OSS无全局显著样本。5.3.3 组件消融推理内容是价值核心选取22条Gemma错而有用消息四种对比条件正确率完整消息82%隐藏错误答案保留推理64%隐藏推理仅留答案44%等长中性文本替换46%结论消息价值主要来源于内部推导逻辑而非末尾错误答案。5.3.4 同问题筛选增益基于5折重复重放标签做消息取舍OSS准确率提升1.68个百分点Gemma提升2.61个百分点仅依靠答案正确性仅提升0.94/1.00个百分点重复轨迹价值标签筛选效果显著更优。5.4 跨数据集一致性错而有用样本在全部10组「数据集模型」组合中均存在数学类数据集Omni-MATH-2、JEEBench错而有用占比最高理化、生物数据集占比偏低任务格式、上下文长度、整合难度共同影响分布。6 讨论传统全局准确率混淆「候选生成、信息整合、单消息贡献」三层问题无法识别带错误答案但含优质推导的消息量化数据证明超4成改变结果的错误消息具备正向价值统计实验排除随机波动干扰消融实验明确推理过程是消息核心价值载体而非提案答案局限当前标签仅适用于固定消息池固定整合模型无法作为文本固有打分落地方向训练预测模型在推理前预判消息轨迹价值实现动态通信过滤。7 局限性轨迹价值具备强上下文依赖性更换消息池、整合模型后标签失效重复重放仅降低随机干扰无法完全消除LOO留一法仅固定消息文本无法消除prompt长度、token位置带来的轻微干扰嵌套K前缀是单轮招募生成的递增池非随机新增智能体实验全部使用单一模型承担全部智能体角色异构智能体、前沿大模型、无标准答案任务场景未验证多轮辩论、交互式协同场景不在本实验覆盖范围多评价模型对复合六分类标签存在一定判定偏差。8 结论针对核心问题是否仅因消息答案错误就直接丢弃基于5套跨领域基准、两大开源模型完整实验给出否定答案所有会改变最终推理结果的错误消息中超4成对下游整合具备正向增益。DHD协议通过固定消息池、留一重放实现轨迹价值可量化受控重复实验证明该现象并非模型随机波动消融实验证明消息价值核心为内部推理逻辑。答案正确性是有效辅助特征但无法决定单条消息对多智能体推理的轨迹价值。致谢本研究依托美国能源部阿贡领导力计算设施算力资源项目受美国能源部科学办公室先进计算研究项目、阿贡国家实验室内部研发基金支持合同编号DE-AC02-06CH11357。附录A 附录总览附录完整覆盖prompt接口细则、系统级多协议算力开销、全数据集数值结果、真实问题完整重放案例、重复重放鲁棒性实验、推理/答案组件消融、同问题筛选增益、评价器一致性与复现工程文件说明。附录B DHD完整Prompt接口规范1 招募智能体Prompt仅输入题目输出5道适配该题的差异化解题角色全程看不到标准答案、任何消息。2 假设智能体Prompt输入题目单一角色输出结构化消息解题思路、关键假设、自检要点、置信度、提案答案不可读取同伴消息。3 整合智能体Prompt输入题目选定消息子集综合所有推理生成唯一答案不执行简单投票。4 评价智能体Prompt仅接收最终答案真值不读取任何推理输出二元等价判定。5 两类重放约束单消息重放仅展示单条消息LOO重放完整池移除一条全程不重新生成任何消息。附录C 全数据集数值结果完整表格包含各数据集样本量、K0~5分层准确率、单消息/LOO六分类消息数量、各基准错而有用占比bootstrap区间、样本缺失统计等完整原始数值。附录D 系统级协议与算力成本对比Direct单模型、Iterative自修正、PER三段式、Broadcast多智能辩论四类主流推理协议统计各协议准确率、单题平均token与调用量DHD仅测量不用于优化算力开销远高于常规推理流程。附录E 离线单消息/全池结果诊断统计单消息能解但全池失败干扰、单消息全失败但全池正确协同两类样本占比测试随机、一致性、置信度、真值先知四类消息筛选策略的准确率差距证明仅依靠答案正确性存在显著性能天花板。附录F 全数据集真实重放完整案例每个数据集各提供一组错而有用、一组对而有害完整原题、消息文本、重放对比结果附详细机理分析。附录G 受控重复重放鲁棒性实验1000题/模型每题35次重复整合统计重复样本内可复现消息效应数量、置换检验p值、多校正后有效样本分布区分模型随机波动与真实消息增益。附录H 推理/答案组件消融实验22条预筛选错而有用消息分隐藏答案、隐藏推理、中性替换、完整移除四组对照量化两类组件对最终准确率的贡献差距。附录I 同问题交叉验证筛选增益5折交叉验证利用重复重放轨迹价值标签选择最优消息子集量化对比「轨迹价值筛选」vs「仅看答案正确性」的准确率提升幅度分数据集拆解增益。附录J 整合模型行为人工审计人工读取10组JEEBench完整推理文本归纳错而有用消息的通用机理复用并修正推导对而有害消息机理错误推导被扩散、输出中断无有效答案。附录K 评价器规范与复现工程文件三类评价模型两两一致性统计、六复合标签匹配率所有角色解码参数、token上限完整复现压缩包地址anc/reproducibility_artifact.zip包含全部prompt模板、分析脚本、脱敏实验记录、图表输入文件全部原始参考文献省略原文长参考文献列表全文优化说明结构标准化全文标题统一为中文分层逻辑重构区分摘要-引言-方法-实验-结论-附录删除零散碎片化段落专业概念统一中文译名多智能体、轨迹价值、留一法LOO、消融实验、置换检验等信息完整保留全部实验参数、模型名称、数据集样本量、计算公式、统计p值、消融实验数据、完整表格、案例原文、算力开销、复现工程包路径、所有附录细分模块无删减可读性优化长数学公式附带文字释义复杂实验分组用表格规整核心定理/统计结论加粗区分概念定义、实验流程、消融对比、统计检验四类内容格式规范标准Markdown排版分级标题有序表格统一对齐代码/工程路径清晰标注术语统一Wrong-helpful统一译为「错而有用」Correct-harmful译为「对而有害」DHD全称首次标注中文释义缩写首次出现附带全称无信息丢失原始论文所有实验步骤、统计指标、基准对比、消融测试、显著性检验、算力成本、复现资源全部完整留存无删减任何原始实证信息。
返回列表