ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

不再自己生成自己通过:AutoResearch Idea Forge多模型交叉评审机制深度拆解

不再自己生成自己通过:AutoResearch Idea Forge多模型交叉评审机制深度拆解 不再自己生成自己通过AutoResearch Idea Forge多模型交叉评审机制深度拆解【免费下载链接】AutoResearchAI/ML research agents from idea to paper-ready evidence. An EvoMap open-source project.项目地址: https://gitcode.com/gh_mirrors/autore/AutoResearchAutoResearch 是一个把 AI/ML 研究从想法推进到可写论文证据的开源智能体工作流。它的Idea Forge模块解决了研究智能体最大的隐患——多模型交叉评审至少 3 个不同模型的席位独立构思、互相当审稿人投票表决从机制上杜绝模型自己生成、自己通过。本文将完整拆解这套交叉评审的设计、投票规则与防误判细节。为什么单模型自审不可信 让同一个 LLM 先出主意再自己说不错就像让厨师自己给自己的菜评米其林——幻觉会被反复自我确认。AutoResearch 在 README.md 中把独立多模型评审列为核心能力评审阶段至少需要三个不同的底层模型同一模型换别名、换 endpoint 只算一票。这条硬性下限写在角色策略层 src/roles.pyMIN_INDEPENDENT_MODELS {ideator: 3}ideator构思席位是唯一的面板角色必须同时消费多个独立模型启动时若席位不足require_idea_panel()直接报错拒绝运行而不是悄悄降级成自审Idea Forge 三步流水线从研究信号到实验计划 Idea Forge 位于 src/idea_forge/forge.py把外部研究信号与本地知识库方向做交叉共三步Step 1每个席位独立深度构思每个席位模型拿到同一个 prompt 独立构思研究信号的核心机制 领域方向的知识文档 硬件约束。如果映射不合理模型只需输出NO_MATCH该席位本轮弃权。Step 2全员交叉评审多数票制这是整条流水线的心脏——包括生成者自己所有席位都要评审每一个候选 idea避免单一模型主导否决。规则是只看 D1机制深度/ D2方法简洁/ D3实验充分三个硬维度通过门槛 席位数的一半加一3 席时至少 2 票通过必须至少收到 3 个可解析的独立评审票数不足直接判负不降级放行D4 时新性只做软警告旧模型/数据可以在 Step 2.5 由 arXiv 搜索就地刷新不在此处击杀好方案Step 3只有幸存者才配拥有计划书通过交叉验证的 idea 还会经过时新性刷新和社区共识检查见下文最后才由 planner 角色写出第 1 周预实验 第 2-4 周完整实验的可执行计划书。被否决的 idea 连同每一票的原始评审文本一起落盘到data/idea_forge/事后可复核那几票是怎么投的。防一票误判判定解析器的较真之处 评审模型只输出一行自然语言verdict: 通过/不通过怎么保证不读错src/verdicts.py 用了几条相当较真的规则否定式优先不通过包含通过、不值得包含值得必须先消掉否定式再匹配否则一次不通过会被误读成两票只认最终判定行评审会对每个维度各写一行判定不通过若把最后一行当结论截断的响应会让 D1 一票定生死解析器从后往前找自称最终判定的行读不出就是读不出返回UNPARSED该票不计入分子也不计入分母——凭空造通过票或反对票都是造假每一票还单独存下解析器实际据以判定的那一行verdict_line供事后审计最后一道防线社区共识检查 ️交叉验证通过后还有 src/idea_forge/consensus_check.py 的撞共识检查让模型拿 idea 逐条对照知识库里的常见错误直觉和可行创新切入点清单——即使 idea 看起来新颖撞了业内公认的错误直觉也要果断否决。一个细节值得注意知识库缺失时检查结果是UNAVAILABLE未检查它不是否决idea 仍会前进但会被明确标记status: unchecked。查不了和查过了没问题是两回事不能混为一谈。知识库文档放在 knowledge_base/格式模板见 knowledge_base/TEMPLATE.md——你补上自己领域的常见误区清单共识检查才能真正生效。如何配置你的三个评审席位 ⚙️复制 config.example.json 为本机配置在idea_forge.idea_models中填 3 个不同模型如 gemini-pro / gpt-5.5 / claude-opus也可以用环境变量AR_MODEL_IDEATOR模型A,模型B,模型C整体替换席位名单运行scripts/preflight.py --live验证席位独立性——检查器与运行时读的是同一份配置不会出现报告说用 A、实际跑 B的分叉完整运行入口是 idea_generation.py架构总览见 ARCHITECTURE.md。小结 ✨AutoResearch 的 Idea Forge 用三条铁律换来了可信的 idea 产出独立席位多数票没有 3 个不同模型就不许跑、解析失败不计票宁可弃权不造票、共识检查独立于评审新颖不等于正确。对任何想在多智能体流水线里引入自我审批的开发者这套防自嗨机制都值得借鉴。【免费下载链接】AutoResearchAI/ML research agents from idea to paper-ready evidence. An EvoMap open-source project.项目地址: https://gitcode.com/gh_mirrors/autore/AutoResearch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表