ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AutoResearchClaw 自主研究流水线完全指南:23 阶段、HITL 副驾驶与跨运行学习

AutoResearchClaw 自主研究流水线完全指南:23 阶段、HITL 副驾驶与跨运行学习 AutoResearchClaw 自主研究流水线完全指南23 阶段、HITL 副驾驶与跨运行学习【免费下载链接】AutoResearchClawFully autonomous self-evolving research from idea to paper. Chat an Idea. Get a Paper. 项目地址: https://gitcode.com/gh_mirrors/au/AutoResearchClaw本篇技术指南以 AutoResearchClaw 项目官方日语版 READMEdocs/README_JA.md为核心骨架系统讲解从研究想法到会议级论文的全自动研究流水线一条命令启动、23 个阶段、8 个阶段的执行架构以及 v0.4.0 引入的 Human-in-the-LoopHITL副驾驶系统与 v0.5.0 引入的多领域实验智能体与 ARC-Bench 基准。读完本文你将掌握 AutoResearchClaw 的安装与最小配置、CLI 全部常用命令、六种 HITL 介入模式与配套配置、MetaClaw 跨运行知识转移、技能库加载方式以及如何将实验执行路由到高能物理、生物学、统计学等领域的专用智能体。AutoResearchClaw 的口号是アイデアを話す。論文を手に入れる。——你思考它写作你在关键决策点进行引导。其定位是完全自主、可协作、可自我进化的研究引擎输入一个研究主题即可产出包含真实文献来自 OpenAlex、Semantic Scholar、arXiv、硬件感知的沙盒实验自动检测 GPU/MPS/CPU、统计分析、多智能体评审以及面向 NeurIPS/ICML/ICLR 的会议级 LaTeX 论文。1. 这是什么从想法到论文的端到端闭环AutoResearchClaw 将一条研究流水线端到端地执行实验失败时自我修复假设不成立时转向PIVOT引用造假时删除需要你掌舵时暂停等待。核心设计原则包括文献真实性仅使用 OpenAlex、Semantic Scholar、arXiv 返回的真实论文幻觉引用会被 4 层验证自动剔除实验真实性代码在本地沙盒或 Docker 中真实执行产出结构化 JSON 指标论文中的数值必须通过 VerifiedRegistry 验证多级质量门控3 个需要人工审批或--auto-approve自动批准的 Gate 阶段配合哨兵Sentinel后台质量监控。每次运行结束后产物集中在artifacts/rc-YYYYMMDD-HHMMSS-hash/deliverables/目录产物说明paper_draft.md完整学术论文引言、相关工作、方法、实验、结果、结论paper.tex会议级 LaTeXNeurIPS / ICLR / ICML 模板references.bib来自 OpenAlex、Semantic Scholar 与 arXiv 的真实 BibTeX按正文引用自动裁剪verification_report.json4 层引用完整性与相关性验证报告arXiv、CrossRef、DataCite、LLMexperiment runs/生成的代码 沙盒运行结果 结构化 JSON 指标charts/带误差棒与置信区间的条件对比图reviews.md带方法-证据一致性检查的多智能体评审evolution/每次运行提炼的自我学习经验deliverables/全部最终产物汇总可直接在 Overleaf 编译2. 快速开始一条命令一篇论文# 完全自主 —— 无需人工介入 pip install -e . researchclaw setup researchclaw init researchclaw run --topic Your research idea here --auto-approve # 副驾驶模式 —— 在关键决策点与 AI 协作 researchclaw run --topic Your research idea here --mode co-pilot分步安装流程# 1. 克隆与安装 git clone https://github.com/aiming-lab/AutoResearchClaw.git cd AutoResearchClaw python3 -m venv .venv source .venv/bin/activate pip install -e . # 2. 环境设置交互式 —— 安装 OpenCode Beast Mode、检查 Docker/LaTeX researchclaw setup # 3. 配置 researchclaw init # 交互式选择 LLM 提供商生成 config.arc.yaml # 或手动cp config.researchclaw.example.yaml config.arc.yaml # 4. 运行 export OPENAI_API_KEYsk-... researchclaw run --config config.arc.yaml --topic Your research idea --auto-approve2.1 最小必要配置project: name: my-research research: topic: Your research topic here llm: base_url: https://api.openai.com/v1 api_key_env: OPENAI_API_KEY primary_model: gpt-4o fallback_models: [gpt-4o-mini] experiment: mode: sandbox sandbox: python_path: .venv/bin/python2.2 实验模式的真实性分级experiment.mode决定实验结果的真实性这一点在示例配置 config.researchclaw.example.yaml 中有明确注释sandbox在本地沙盒中实际执行生成的 Python 代码产出真实实验数据默认docker在 Docker 容器中执行支持 GPU 直通、依赖自动安装、内存隔离simulated不执行代码用公式生成假数据仅用于框架开发调试不应用于论文生成ssh_remote路由到远程 GPU 服务器支持SSH 上的 Docker最安全远程执行模式。3. 流水线架构23 个阶段、8 个阶段组23 个阶段的枚举定义在 researchclaw/pipeline/stages.py 中与文档描述一一对应阶段组 A: 研究范围界定 阶段组 E: 实验执行 1. TOPIC_INIT 12. EXPERIMENT_RUN 2. PROBLEM_DECOMPOSE 13. ITERATIVE_REFINE ← 自我修复 阶段组 B: 文献发现 阶段组 F: 分析与决策 3. SEARCH_STRATEGY 14. RESULT_ANALYSIS ← 多智能体 4. LITERATURE_COLLECT ← 真实 API 15. RESEARCH_DECISION ← PIVOT/REFINE 5. LITERATURE_SCREEN [Gate] 6. KNOWLEDGE_EXTRACT 阶段组 G: 论文写作 16. PAPER_OUTLINE 阶段组 C: 知识综合 17. PAPER_DRAFT 7. SYNTHESIS 18. PEER_REVIEW ← 证据检查 8. HYPOTHESIS_GEN ← 讨论 19. PAPER_REVISION 阶段组 D: 实验设计 阶段组 H: 最终处理 9. EXPERIMENT_DESIGN [Gate] 20. QUALITY_GATE [Gate] 10. CODE_GENERATION 21. KNOWLEDGE_ARCHIVE 11. RESOURCE_PLANNING 22. EXPORT_PUBLISH ← LaTeX 23. CITATION_VERIFY ← 相关性检查三个阶段组的行为约定Gate 阶段5、9、20暂停等待人工批准或通过--auto-approve自动批准被拒绝时流水线回滚。stages.py中的gate_required()与advance()负责裁决阶段转移与回滚目标副驾驶模式--mode co-pilot在第 7-8 阶段Idea Workshop 想法工坊、第 9 阶段Baseline Navigator 基线导航器、第 16-17 阶段Paper Co-Writer 论文合著者实现深度人机协作其余阶段在 SmartPause 监控下自动执行决策循环第 15 阶段可触发 REFINE回到第 13 阶段或 PIVOT回到第 8 阶段产物自动版本化。各阶段组的具体职责阶段组处理内容A: 范围界定LLM 将主题分解为带研究问题的结构化问题树A: 硬件感知自动检测 GPUNVIDIA CUDA / Apple MPS / 仅 CPU本地硬件受限时告警并自适应代码生成B: 文献多源检索OpenAlex → Semantic Scholar → arXiv获取真实论文按相关性筛选抽取知识卡片C: 综合聚类发现、识别研究空白、通过多智能体讨论生成可检验假设D: 设计设计实验方案生成硬件感知的可运行 PythonGPU 层级 → 包选择估算资源需求E: 执行在沙盒中运行实验检测 NaN/Inf 与运行时缺陷通过精准 LLM 修复实现自我修复F: 分析多智能体分析结果带依据的自主 PROCEED / REFINE / PIVOT 决策G: 写作大纲 → 分节起草5000-6500 词→ 评审含方法-证据一致性→ 带字数护栏的修订H: 最终处理质量门禁、知识归档、带会议模板的 LaTeX 导出、引用完整性与相关性验证对应的实现分散在 researchclaw/pipeline/stage_impls/ 目录中_topic.py阶段 1-2、_literature.py阶段 3-6、_synthesis.py阶段 7-8、_experiment_design.py阶段 9、_code_generation.py阶段 10含 Collider 方案生成、_execution.py阶段 11-13、_analysis.py阶段 14-15、_paper_writing.py阶段 16-17、_review_publish.py阶段 18-23。流水线执行器为 researchclaw/pipeline/runner.py支持断点续跑checkpoint 写入与resume_from_checkpoint。4. 差异化能力它和一般自动化有什么不同能力工作机制副驾驶模式6 种介入模式——从完全自主到逐步引导。在关键决策假设、基线、论文写作处引导 AI或任其自由运行SmartPause 自动检测人工输入会带来增益的时机PIVOT / REFINE 循环第 15 阶段自主裁决PROCEED、REFINE调参或 PIVOT转向新方向产物自动版本化多智能体讨论假设生成、结果分析、评审均采用结构化多视角讨论自我学习每次运行提炼经验决策依据、运行时告警、指标异常带 30 天时间衰减后续运行学习过往错误知识库每次运行构建覆盖 6 类决策、实验、发现、文献、问题、评审的结构化知识库Sentinel 看门狗后台质量监控NaN/Inf 检测、论文-证据一致性、引用相关性评分、反捏造护栏声明验证内联事实核查从 AI 生成文本中抽取声明并与收集的文献交叉核对标记无依据引用与捏造数字分支探索分叉流水线以并行探索多个研究方向并排比较结果合并最佳路径其中反捏造能力在源码中有完整闭环支撑verified_registry.py的VerifiedRegistry强制论文使用经过验证的实验数据paper_verifier.py的verify_paper()以容差匹配论文数值experiment_diagnosis.py与experiment_repair.py在写作前自动诊断并修复失败实验未经验证的数值会被_sanitize_fabricated_data()清洗。5. 运行方式OpenClaw、ACP 与 Python APIAutoResearchClaw 不锁定单一平台可经 CLI 独立运行、接入 OpenClaw或通过任意 ACP 兼容智能体驱动。5.1 OpenClaw 集成推荐AutoResearchClaw 是 OpenClaw 兼容服务。使用方式1. 将仓库 URL 分享给 OpenClaw 2. OpenClaw 自动读取 RESEARCHCLAW_AGENTS.md → 理解流水线 3. 说一句 Research [你的主题] 4. 完成 —— OpenClaw 自动完成克隆、安装、配置、运行并返回结果内部流程OpenClaw 读取 RESEARCHCLAW_AGENTS.md 学习研究编排者角色 → 读取 README 理解安装与流水线结构 → 复制config.researchclaw.example.yaml为config.yaml→ 请求 LLM API Key或用环境变量→ 执行pip install -e .researchclaw run→ 返回论文、LaTeX、实验与引用。5.2 OpenClaw Bridge 适配器进阶更深的集成需要 6 个可选能力的桥接适配器系统# config.arc.yaml openclaw_bridge: use_cron: true # 定时研究运行 use_message: true # 进度通知Discord/Slack/Telegram use_memory: true # 跨会话知识持久化 use_sessions_spawn: true # 生成并行子会话以并发执行阶段 use_web_fetch: true # 文献综述期间的实时 Web 搜索 use_browser: false # 基于浏览器的论文收集每个标志激活一个类型化适配器协议当 OpenClaw 提供这些能力时适配器无需改代码即可消费。完整细节见 docs/integration-guide.md。5.3 ACPAgent Client Protocol可将任意 ACP 兼容编码智能体用作 LLM 后端——无需 API Key。智能体经 acpx 通信在全部 23 个阶段维持单一持久会话。支持的智能体见 researchclaw/llm/acp_client.py 相关实现智能体命令备注Claude CodeclaudeAnthropicCodex CLIcodexOpenAICopilot CLIghGitHubGemini CLIgeminiGoogleOpenCodeopencodeSSTKimi CLIkimiMoonshot# config.yaml — ACP 示例 llm: provider: acp acp: agent: claude # 任意 ACP 兼容智能体 CLI 命令 cwd: . # 智能体工作目录 # 无需 base_url 或 api_key —— 智能体自行处理认证# 直接运行 —— 智能体使用自身凭据 researchclaw run --config config.yaml --topic Your research idea --auto-approve5.4 其他运行方式方式操作独立 CLIresearchclaw run --topic ... --auto-approve自主或--mode co-pilot协作Python APIfrom researchclaw.pipeline import Runner; Runner(config).run()Claude Code读取 RESEARCHCLAW_CLAUDE.md——只需说Run research on [topic]Copilot CLI使用llm.acp.agent: gh后执行researchclaw run --topic ...OpenCode读取.claude/skills/——同样的自然语言接口任意 AI CLI将 RESEARCHCLAW_AGENTS.md 作为上下文提供 → 智能体自动引导CLI 的子命令结构在 researchclaw/cli.py 中定义run子命令支持--topic/-t覆盖研究主题、--output/-o输出目录等参数。6. HITL 副驾驶六种介入模式与人机协作v0.4.0 引入完整的 Human-in-the-LoopHITL系统将流水线从纯自主执行转变为人机协作的研究引擎。相关模块集中在 researchclaw/hitl/ 目录含smart_pause.py、cost_guard.py、claim_verifier.py、learning.py、branching.py、escalation.py等。6.1 介入模式模式命令作用完全自动--auto-approve原始行为——无人工介入仅门禁--mode gate-only在 3 个门禁阶段5、9、20暂停等待批准检查点--mode checkpoint在每个阶段组边界暂停8 个检查点副驾驶--mode co-pilot在关键阶段深度协作其余自动执行逐步--mode step-by-step每个阶段后暂停——学习流水线快速--mode express快速评审——仅 3 个最关键门禁自定义--mode custom通过stage_policies配置定义逐阶段策略6.2 副驾驶工作流示例You: researchclaw run --topic Quantum noise as neural network regularization --mode co-pilot 流水线自动运行阶段 1-7 ... ┌─────────────────────────────────────────────────────────────┐ │ HITL | Stage 08: HYPOTHESIS_GEN │ │ Post-stage review │ │ │ │ Hypotheses mentioned: 3 │ │ Novelty score: 0.72 (moderate) │ │ │ │ [a] Approve [r] Reject [e] Edit [c] Collaborate │ │ [i] Inject guidance [v] View output [q] Abort │ └─────────────────────────────────────────────────────────────┘ You: c (开始协作聊天) You: Hypothesis 3 is interesting but needs Dropout/Label Smoothing as baselines AI: Updated — added Dropout, Label Smoothing, MixUp, CutMix as baselines... You: approve 流水线带着你精炼后的假设继续执行...该交互界面由 researchclaw/hitl/tui/ 的监控/面板组件与intervention.py的干预处理实现三个协作工作坊分别位于 researchclaw/hitl/workshops/idea.py、baseline.py、paper.py。6.3 CLI 命令# 以 HITL 模式启动 researchclaw run --topic ... --mode co-pilot # 挂接到暂停中的流水线从另一个终端 researchclaw attach artifacts/rc-2026-xxx # 查看流水线与 HITL 状态 researchclaw status artifacts/rc-2026-xxx # 从另一个终端或脚本批准/拒绝 researchclaw approve artifacts/rc-2026-xxx --message LGTM researchclaw reject artifacts/rc-2026-xxx --reason Missing key baseline # 为某阶段注入引导甚至可在其运行前 researchclaw guide artifacts/rc-2026-xxx --stage 9 --message Use ResNet-50 as primary baseline6.4 关键能力能力说明想法工坊协作头脑风暴、评估、精炼假设阶段 7-8基线导航器AI 建议基线 人工增删 可复现性清单阶段 9论文合著者分节起草中人工编辑与 AI 润色阶段 16-19SmartPause置信度驱动的动态暂停——自动检测人工输入有增益的时机声明验证对照收集的文献进行内联事实核查——标记无依据声明成本护栏50%/80%/100% 阈值告警的预算监控介入学习ALHF——从你的评审模式中学习以优化未来的暂停决策分支探索分叉流水线以探索多个假设、比较并合并最优升级策略无人值守时的分级通知终端 → Slack → 邮件 → 自动停机3 种适配器CLI终端、WebSocketWeb 仪表盘、MCP外部智能体6.5 HITL 配置# config.arc.yaml hitl: enabled: true mode: co-pilot # full-auto | gate-only | checkpoint | co-pilot | custom cost_budget_usd: 50.0 # 成本超预算时暂停0 无限制 notifications: on_pause: true on_quality_drop: true channels: [terminal] # terminal | slack | webhook timeouts: default_human_timeout_sec: 86400 # 默认等待 24 小时 auto_proceed_on_timeout: false collaboration: max_chat_turns: 50 save_chat_history: true # 逐阶段自定义策略可选用于 custom 模式 stage_policies: 8: { require_approval: true, enable_collaboration: true } 9: { require_approval: true, allow_edit_output: true }6.6 向后兼容性默认关闭没有hitl.enabled: true或--mode时流水线行为与之前完全一致--auto-approve仍然可用它覆盖 HITL 模式文档声称带 HITL 代码的既有 2,699 项测试全部通过对应 tests/ 下的test_hitl_*.py系列。7. MetaClaw 集成让流水线从每次运行中学习AutoResearchClaw MetaClaw 从每次运行学习的流水线。MetaClaw 为 AutoResearchClaw 增加跨运行知识转移启用后流水线自动从失败与告警中提取经验转换为可复用技能并在后续运行中注入全部 23 个阶段。实现位于 researchclaw/metaclaw_bridge/核心是lesson_to_skill.py的convert_lessons_to_skills()与prm_gate.py的进程奖励模型门禁。7.1 工作原理运行 N 执行 → 失败/告警被捕获为 Lessons ↓ MetaClaw Lesson → Skill 转换 ↓ arc-* Skill 文件存储在 ~/.metaclaw/skills/ ↓ 运行 N1 → build_overlay() 将技能注入每个 LLM 提示 ↓ LLM 规避已知陷阱 → 更高质量、更少重试7.2 快速设置# 1. 安装 MetaClaw如未安装 pip install metaclaw # 2. 在配置中启用# config.arc.yaml metaclaw_bridge: enabled: true proxy_url: http://localhost:30000 # MetaClaw 代理可选 skills_dir: ~/.metaclaw/skills # 技能存储位置 fallback_url: https://api.openai.com/v1 # 直接 LLM 回退 fallback_api_key: # 回退 URL 的 API 密钥 lesson_to_skill: enabled: true min_severity: warning # 转换 warning error max_skills_per_run: 3# 3. 照常运行 —— MetaClaw 透明工作 researchclaw run --config config.arc.yaml --topic Your idea --auto-approve每次运行后检查~/.metaclaw/skills/arc-*/SKILL.md查看流水线学到的技能。7.3 受控实验数据根据文档记载的对照 A/B 实验同一主题、同一 LLM、同一配置指标基线使用 MetaClaw改善阶段重试率10.5%7.9%-24.8%Refine 循环次数2.01.2-40.0%流水线阶段完成18/1919/195.3%综合鲁棒性评分0.7140.84518.3%综合鲁棒性评分是阶段完成率40%、重试减少30%与 Refine 循环效率30%的加权平均。7.4 向后兼容性默认关闭metaclaw_bridge缺失或enabled: false时行为与之前完全一致无新依赖MetaClaw 是可选项——核心流水线无需 MetaClaw 即可运行文档声称带集成代码的既有 2,699 项测试全部通过。8. 技能库内置与自定义技能加载AutoResearchClaw 支持加载开源与自定义技能并随包提供20 个预装内置技能科学写作、文献检索、化学、生物学等作为即用参考在技能 frontmatter 中添加enabled: false可禁用任意技能。技能加载、匹配、注册与校验的实现位于 researchclaw/skills/loader.py、registry.py、matcher.py、schema.py内置技能清单见 researchclaw/skills/builtin/。内置技能示例类别技能说明写作scientific-writingIMRAD 结构、引用格式、报告指南领域chemistry-rdkit分子分析、SMILES、指纹、药物发现实验literature-search系统综述、PRISMA 方法论用researchclaw skills list查看全部 20 个技能。加载自己的技能# 方式 1安装技能跨项目持久化 researchclaw skills install /path/to/my-skill/ # 方式 2在项目中放置 SKILL.md mkdir -p .claude/skills/my-custom-skill # 然后创建带 YAML frontmattername, description, trigger-keywords, applicable-stages的 SKILL.md # 方式 3在 config.arc.yaml 中配置共享技能目录 # skills: # custom_dirs: # - /path/to/team-shared-skills使用技能技能自动加载并注入 LLM 提示——无需手动激活。用 CLI 检查researchclaw skills list # 显示所有已加载技能及来源 researchclaw skills validate ./my-skill # 检查 SKILL.md 格式9. 完整配置参考以下为 docs/README_JA.md 中完整的配置参考与 config.researchclaw.example.yaml 基本一致后者还额外提供了 MiniMax、Ollama 本地模型与 SSH 远程执行的注释示例# 项目 project: name: my-research # 项目标识 mode: docs-first # docs-first | semi-auto | full-auto # 研究 research: topic: ... # 研究主题必填 domains: [ml, nlp] # 文献检索的研究领域 daily_paper_count: 8 # 每个检索查询的目标论文数 quality_threshold: 4.0 # 论文最低质量分 # 运行时 runtime: timezone: America/New_York # 时间戳时区 max_parallel_tasks: 3 # 并发实验上限 approval_timeout_hours: 12 # 门禁阶段超时 retry_limit: 2 # 阶段失败重试次数 # LLM llm: provider: openai-compatible # openai | openrouter | deepseek | minimax | acp | openai-compatible base_url: https://... # API 端点openai-compatible 必填 api_key_env: OPENAI_API_KEY # API 密钥环境变量openai-compatible 必填 api_key: # 或在此直接填写密钥 primary_model: gpt-4o # 主模型 fallback_models: [gpt-4o-mini] # 回退链 s2_api_key: # Semantic Scholar API 密钥可选提升速率限制 acp: # 仅 provider: acp 时使用 agent: claude # ACP 智能体 CLI 命令claude, codex, gemini 等 cwd: . # 智能体工作目录 # 文献检索 literature_search: sources: [openalex, semantic_scholar, arxiv] # 阶段 4 后端顺序 max_results_per_query: 40 # 去重前每查询结果数 inter_query_delay_sec: 1.5 # 扩展查询间延迟 openalex_email: researchclawusers.noreply.github.com openalex_api_key_env: OPENALEX_API_KEY openalex_api_key: # 可选优先环境变量 s2_api_key_env: S2_API_KEY s2_api_key: # 可选回退到 llm.s2_api_key # 实验 experiment: mode: sandbox # simulated | sandbox | docker | ssh_remote time_budget_sec: 300 # 每次运行最大执行时间默认300 秒 max_iterations: 10 # 最大优化迭代次数 metric_key: val_loss # 主指标名 metric_direction: minimize # minimize | maximize sandbox: python_path: .venv/bin/python gpu_required: false allowed_imports: [math, random, json, csv, numpy, torch, sklearn] max_memory_mb: 4096 docker: image: researchclaw/experiment:latest network_policy: setup_only # none | setup_only | pip_only | full gpu_enabled: true memory_limit_mb: 8192 auto_install_deps: true # 自动检测 import → requirements.txt ssh_remote: host: # GPU 服务器主机名 gpu_ids: [] # 可用 GPU ID remote_workdir: /tmp/researchclaw_experiments opencode: # OpenCode Beast Moderesearchclaw setup 自动安装 enabled: true # 主开关默认true auto: true # 无需确认自动触发默认true complexity_threshold: 0.2 # 0.0-1.0 —— 越高 仅复杂实验触发 model: # 模型覆盖空 使用 llm.primary_model timeout_sec: 600 # OpenCode 生成最大秒数 max_retries: 1 # 失败重试次数 workspace_cleanup: true # 收集后删除临时工作区 code_agent: # CodeAgent v2 —— 多阶段代码生成 enabled: true # 使用 CodeAgent 替代遗留单提示代码生成 architecture_planning: true # 编码前生成深度实现蓝图 sequential_generation: true # 按依赖 DAG 逐个生成文件 hard_validation: true # 基于 AST 的验证门禁拦截相同消融、硬编码指标 hard_validation_max_repairs: 2 # 验证失败时最大修复尝试 exec_fix_max_iterations: 3 # 执行循环内修复尝试次数 exec_fix_timeout_sec: 60 # 每次执行修复超时 benchmark_agent: # BenchmarkAgent —— 自动数据集与基线选择 enabled: true # 启用 4 智能体基准流水线Surveyor→Selector→Acquirer→Validator enable_hf_search: true # 搜索 HuggingFace Datasets enable_web_search: true # 搜索 Google Scholar 基准 tier_limit: 2 # 数据集层级过滤1小/缓存2中3大 min_benchmarks: 1 # 所需最少数据集数 min_baselines: 2 # 所需最少基线方法数 figure_agent: # FigureAgent —— 学术图表生成 enabled: true # 启用 5 智能体图表流水线Planner→CodeGen→Renderer→Critic→Integrator min_figures: 3 # 最少图表数 max_figures: 8 # 最大图表数 max_iterations: 3 # Critic 驱动的改进迭代数 dpi: 300 # 输出分辨率 strict_mode: false # 图表生成失败时是否中止流水线 repair: # 反捏造实验修复 enabled: true # 自动诊断并修复失败实验 max_cycles: 3 # 修复重试循环数 min_completion_rate: 0.5 # 需完成 50% 以上条件才能继续 min_conditions: 2 # 有效实验至少需 2 个条件 use_opencode: true # 修复经 OpenCode Beast Mode 路由 # Web 搜索可选 web_search: enabled: true # 启用 Web 增强文献检索 tavily_api_key_env: TAVILY_API_KEY # Tavily API 密钥环境变量可选 enable_scholar: true # Google Scholar 搜索 enable_pdf_extraction: true # 从 PDF 提取文本 max_web_results: 10 # 每查询最大 Web 搜索结果数 # 导出 export: target_conference: neurips_2025 # neurips_2025 | iclr_2026 | icml_2026 authors: Anonymous bib_file: references # 提示词 prompts: custom_file: # 自定义提示词 YAML 路径空 默认 # HITL 副驾驶v0.4.0 新增 hitl: enabled: false # 设为 true 以启用 HITL mode: co-pilot # full-auto | gate-only | checkpoint | step-by-step | co-pilot | custom cost_budget_usd: 0.0 # 美元成本限制0 无限制 notifications: on_pause: true # 流水线暂停时通知 on_quality_drop: true # 质量问题时通知 channels: [terminal] # terminal | slack | webhook timeouts: default_human_timeout_sec: 86400 # 等待人工输入最多 24 小时 auto_proceed_on_timeout: false # 为 true 时超时自动批准 collaboration: max_chat_turns: 50 # 每次协作会话最大轮数 save_chat_history: true # 持久化聊天记录 stage_policies: {} # 逐阶段覆盖用于 custom 模式 # 安全 security: hitl_required_stages: [5, 9, 20] # 需要人工批准的阶段 allow_publish_without_approval: false redact_sensitive_logs: true # 知识库 knowledge_base: backend: markdown # markdown | obsidian root: docs/kb # 通知 notifications: channel: console # console | discord | slack target: # MetaClaw Bridge可选 metaclaw_bridge: enabled: false # 设为 true 以启用跨运行学习 proxy_url: http://localhost:30000 # MetaClaw 代理 URL skills_dir: ~/.metaclaw/skills # arc-* 技能存储位置 fallback_url: # 代理不可用时的直接 LLM 回退 fallback_api_key: # 回退端点 API 密钥 lesson_to_skill: enabled: true # 自动将经验转换为技能 min_severity: warning # 转换的最低严重级别 max_skills_per_run: 3 # 每次流水线运行最大新技能数 prm: # 进程奖励模型质量门禁可选 enabled: false # 用 LLM-as-judge 评分阶段输出 model: gpt-5.4 # PRM 判定模型 votes: 3 # 多数决投票数 gate_stages: [5, 9, 15, 20] # 应用 PRM 门禁的阶段 # OpenClaw Bridge openclaw_bridge: use_cron: false # 定时研究运行 use_message: false # 进度通知 use_memory: false # 跨会话知识持久化 use_sessions_spawn: false # 生成并行子会话 use_web_fetch: false # 实时 Web 搜索 use_browser: false # 基于浏览器的论文收集要点说明llm.provider支持openai、openrouter、deepseek、minimax、acp、openai-compatible等示例配置中还注释了 MiniMax 与本地 Ollama 的写法experiment.mode直接决定实验数据真实性是反捏造防线的基础figure_agent在示例配置中有更丰富的字段output_formatpython用 Matplotlib/Seabornlatex用 TikZ/PGFPlots、nano_banana_enabledGemini 原生图像生成、render_timeout_sec等实现见 researchclaw/agents/figure_agent/prompts.extra_prompts允许按阶段注入额外指引例如code_generation: Favour MadGraph5 Pythia8 Delphes toolchains.或指向 markdown 文件路径这对高能物理等专业场景尤其有用。10. 多领域实验执行器与 ARC-Benchv0.5.0v0.5.0 引入两个头条更新1领域专用执行智能体实验阶段第 10-13 阶段不再局限于默认 ML 沙盒而是按领域路由到专用智能体——高能物理ColliderAgentLagrangian → FeynRules → MadGraph5 → Delphes、生物学COBRApy 基因组尺度代谢建模、统计学模拟研究智能体化学/材料由通用 Docker 执行器覆盖。流水线根据研究领域自动选择执行器。相关实现位于 researchclaw/experiment/collider_agent_sandbox.py、biology_agent_sandbox.py、stat_agent_sandbox.py与 researchclaw/domains/adapters/领域配置文件见 researchclaw/domains/profiles/覆盖hep_ph、biology_*、chemistry_*、ml_*、physics_*、statistics_general等 30 个配置文件。2ARC-Bench55 个主题的开放式自主研究基准覆盖 ML25、高能物理10、量子10、生物7、统计3每个主题附研究问题/条件/指标/数据集清单与评分 rubric全部位于 experiments/arc_bench/。评分与裁判脚本见 experiments/arc_bench/scripts/judge.py、judge_manual.py、evaluate.py等。10.1 高能物理模式collider_agent当project.profilehep_ph且experiment.modecollider_agent时第 12 阶段经 ColliderAgent 路由Lagrangian → FeynRules → MadGraph5 → 经 Magnus 云出图而非默认的 Python ML 沙盒。_code_generation.py中的_execute_collider_plan_generation()负责生成物理方案。阶段中 HITL第 10 阶段CODE_GENERATION成为 HITL 门禁。流水线暂停并在$EDITOR中打开collider_plan.md供你审阅或编辑物理提示词后再运行 ColliderAgent拒绝将控制权交回第 9 阶段EXPERIMENT_DESIGN第 8 阶段的假设保持不变。增量实验--incremental-experiment为已完成的运行添加新的质量点或分析而无需重做重型模拟可用--incremental-experiment配合--from-stage重新启动python -m researchclaw run --profile hep_ph --output artifacts/run_id \ --from-stage CODE_GENERATION --incremental-experiment第 12 阶段沙盒将快照现有stage-12/树为stage-12_v{N}/将旧collider_plan.md存为collider_plan.prev.md构建列出可复用产物的workspace_manifest.json向 ColliderAgent 发送三段式提示CONTINUATION CONTEXTPRIOR PLAN 新增量将新results.json与快照合并指标冲突时新值获胜、旧独有保留产物列表拼接 去重合并记录在incremental_merge.json。随后第 13 阶段照常将合并状态提升到experiment_final/。注意在 collider 模式下仅从第 13 阶段重入是空操作不会运行任何新物理——第 13 阶段是shutil.copy2直通阶段。PIVOT第 15 阶段决策刻意保持破坏性因为改变假设会使先前事件失效。11. 相关文档与测试完整 HITL 指南docs/HITL_GUIDE.md副驾驶快速上手指南docs/README_CN.md中文版 README集成指南docs/integration-guide.md领域集成指南docs/DOMAIN_INTEGRATION_GUIDE.md论文展示docs/showcase/SHOWCASE.md8 个领域 8 篇生成论文测试者指南docs/TESTER_GUIDE.md、docs/TESTER_GUIDE_CN.md、docs/TESTER_GUIDE_JA.md测试套件tests/含test_rc_*.py、test_hitl_*.py、test_metaclaw_bridge/等测试者可用researchclaw doctor等健康检查命令researchclaw/health.py诊断环境许可证LICENSEMIT如果你在 AutoResearchClaw 上完成了研究可在论文中引用AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI CollaborationarXiv 2605.20025作者列表见仓库文档。【免费下载链接】AutoResearchClawFully autonomous self-evolving research from idea to paper. Chat an Idea. Get a Paper. 项目地址: https://gitcode.com/gh_mirrors/au/AutoResearchClaw创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表