
OpenAI o1 和 DeepSeek R1 的路线是让单个模型深度思考本质上还是在同一个推理框架内扩展。TUMIX告诉我们通过多样化的Agent和工具混合可以用更低的成本达到更好的效果。谷歌 DeepMind 和 MIT 联合发了一篇论文名叫TUMIXTool-Use Mixture。大概就是说Multi-Agent 才是 test-time- scaling的终极打开方式可以以一半的成本在HLE上准确率从 21.6% 飙升到 34.1%超越 Gemini-2.5-Pro Deep Research。除此之外他们还做了一个彩蛋让Agent设计Agent效果比人工设计的更牛~一个反常识Agent多样性 疯狂采样目前主流的推理时扩展方法是什么重复采样同一个最强模型然后用多数投票选答案。感觉也没毛病但谷歌验证后说错了。他们做了个实验单Agent重复15次vs15个不同Agent各推理1次在相同的推理成本下15个不同Agent的准确率和覆盖率都明显更高为什么呢因为不同Agent采用不同的工具使用策略纯文本推理、代码执行、网页搜索、双工具混合等能探索更广阔的解空间。而单Agent重复采样本质上还是在同一个思维框架里打转。他们还对比了三种工具组合Code_Text只能用代码不能搜索Search_Text只能搜索不能用代码Code_Search_Text两者都能用结果双工具Agent组的覆盖率和准确率都显著高于单工具组。这说明什么Code Interpreter 和 Search 不是互相替代的关系而是互补的。文本推理擅长语义和常识代码擅长精确计算搜索擅长获取最新知识。只有三者混合才能发挥LLM的全部潜力。TUMIX的核心机制TUMIX的架构其实不复杂核心就三步第一轮15个不同Agent并行推理。每个Agent有自己的工具使用策略CoT、纯代码、搜索优先、代码搜索混合、引导式双工具等每个Agent最多可以调用工具5次生成15个初步答案第二轮及之后答案共享 迭代优化把上一轮所有Agent的答案拼接到原问题后面每个Agent基于原问题其他Agent的答案生成新答案。重复这个过程直到LLM判断答案已收敛。终止LLM-as-Judge用LLM自动判断何时停止迭代最少2轮最终通过多数投票选出答案这个设计既保留了多样性探索又通过迭代优化提升了答案质量。他们还发现了一个有趣的现象随着迭代轮次增加覆盖率至少有一个Agent答对会下降但平均准确率会上升。这说明Agent们在互相学习的过程中逐渐趋同但也会误删掉一些正确答案。所以关键是找到那个点——既充分迭代优化又不过度收敛。最后来看看TUMIX的实战表现在Gemini-2.5-Pro上HLE从21.6%提升到32.3%GPQA从84.6%提升到87.9% AIME 2425从87.3%提升到96.7%。对比其他Test-time Scaling方法Self-MoA、Symbolic-MoE、DEI、SciMaster、GSATUMIX在相同推理成本下平均准确率都有明显优势。LLM可以自动设计更强的Agent论文里还有个彩蛋他们尝试让 Gemini-2.5-Pro 自己设计新的Agent。做法很简单给LLM看现有的15个人工设计的Agent让它生成更多样、更高质量的Agent从生成的25个新Agent中筛选出表现最好的15个结果呢混合了人工设计和LLM生成的Agent组性能比纯人工设计的还要高1.2%。LLM生成的Agent长什么样比如Plan-Verify-Refine先规划、再执行代码或搜索、然后验证并优化SearchThenCode强制先搜索、再用代码Debate-CrossExam模拟提议者和怀疑者辩论引导工具使用这些策略和人工设计的完全不同说明LLM已经具备了一定的Meta-Agent设计能力。最后OpenAI o1 和 DeepSeek R1 的路线是让单个模型深度思考本质上还是在同一个推理框架内扩展。TUMIX告诉我们通过多样化的Agent和工具混合可以用更低的成本达到更好的效果。同时LLM可以设计更强的Agent架构这意味着未来的AI系统可能会自己优化自己的工作流而不需要人工调参。