ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Harbor框架完全解析:Terminal-Bench团队打造的AI Agent评测与优化终极指南

Harbor框架完全解析:Terminal-Bench团队打造的AI Agent评测与优化终极指南 Harbor框架完全解析Terminal-Bench团队打造的AI Agent评测与优化终极指南【免费下载链接】harborFramework for evaluating and improving agents项目地址: https://gitcode.com/gh_mirrors/harbor17/harborHarbor是由 Terminal-Bench 团队推出的开源AI Agent 评测框架让你能够在一个统一平台上评估 Claude Code、Codex、OpenHands 等各类智能体构建自己的 AI Agent 评测基准并在数千个隔离环境中并行运行实验还为强化学习RL优化生成高质量的 rollout 数据。无论是评估模型、搭建 Agent 评测基准还是优化 Agent 能力Harbor 都能一站式搞定。 Harbor 是什么Harbor 是一个用于评测与优化 AI Agent 和大语言模型的框架核心工作方式是容器化环境——每个评测任务Task都在独立、隔离、可复现的沙箱中执行Agent 的表现由验证脚本Verifier客观打分最终聚合成可对比的评测分数。项目定位可以从 README.md 中的官方描述看到Harbor is a framework for the creators of Terminal-Bench for evaluating and optimizing agents and language models.它同时也是Terminal-Bench-2.0 的官方评测运行器并且已经适配了 SWE-Bench、Aider Polyglot 等主流第三方 AI Agent 评测基准。 Harbor 的 4 大核心能力1️⃣ 多 Agent 集成开箱即用Harbor 内置了 40 主流编码智能体适配器无需手动安装依赖通过-a参数即可切换包括Agent 类别代表编码助手claude-code、codex、gemini-cli、cursor-cli开源 Agentopenhands、swe-agent、goose、mimo云服务devin、computer-1特殊用途oracle、nop基线对照完整支持列表见 pre-integrated-agents.mdx。如果你的 Agent 不在列表中还可以接入 ACP 注册表或编写自定义 Agent。2️⃣ 任务即文件构建自己的 AI Agent 评测基准Harbor 的一个Task 指令 环境 测试脚本标准目录结构如下详见 overview.mdxinstruction.md # 任务指令 task.toml # 任务配置 environment/ # Dockerfile 等环境定义 solution/ # 参考解答用于验证任务本身可用 tests/ # 验证脚本产出奖励分数环境支持 Dockerfile、docker-compose多容器、Apptainer 等多种规格。任务相互独立、不依赖 Harbor 框架本身可以像软件包一样版本化、共享甚至拆分为多步骤任务来测试长程能力与持续学习。3️⃣ 云端并行数千环境同时跑实验通过--env参数Harbor 可将每次试验Trial调度到 Daytona、Modal、LangSmith、Blaxel、Novita Sandbox、Tensorlake 等云端沙箱实现大规模并行 AI Agent 评测彻底释放本地资源。4️⃣ 面向 RL 优化生成高质量 Rollout除了打分Harbor 还能生成用于强化学习优化的 rollout 轨迹数据并配套 packages/rewardkit/ 提供可编程的奖励设计工具让评测 → 发现短板 → 训练优化 → 再评测形成闭环。 快速上手3 步启动你的第一次 AI Agent 评测第一步安装 Harboruv tool install harbor # 或 pip install harbor若使用云端沙箱如 Daytonauv tool install harbor[daytona]。第二步配置模型密钥并运行export ANTHROPIC_API_KEYYOUR-KEY harbor run --dataset terminal-bench2.0 \ --agent claude-code \ --model anthropic/claude-opus-4-1 \ --n-concurrent 4该命令会在本地用 Docker 启动 Terminal-Bench-2.0 基准测试加上--env daytona和更大的--n-concurrent即可在云端并发上百个试验。第三步查看结果运行结束后Harbor 提供本地 Web 查看器可按 Agent、模型、Provider 过滤、排序和对比历次试验的结果还能下钻到单个 trial 的轨迹、日志与产物文件。 想发现更多可用基准执行harbor datasets list即可浏览 SWE-Bench、Aider Polyglot 等全部支持的 AI Agent 评测数据集adapters/ 目录下收录了 80 多个基准适配器的完整实现如 adapters/swebench/swebench.yaml是学习如何接入一个新基准的最佳示例库。 Harbor Hub发现与共享评测资源Harbor Hub是 Harbor 生态的共享中心你可以在其中发现数据集浏览 Terminal-Bench、SWE-Bench Verified、Frontier-Bench 等社区基准上传与下载将自己的 AI Agent 评测任务、数据集发布供他人复用托管运行在 Web 界面上配置组织密钥如OPENAI_API_KEY、选择 Agent 与模型后直接发起托管任务在托管模式下Agent 配置完全可视化 进阶玩法模拟用户测试多轮交互对于客服、订票等需要与用户多轮对话的 AgentHarbor 支持模拟用户Simulated User能力用另一个 LLM 扮演真实用户与被测 Agent 交流从而评测长程交互能力。其架构如下其中 User agent 对任务工作区只读而被测 Agent 可读写保证评测公平性。相关实现见 jobs 文档 与 rfcs/0002-simulated-users.md。 谁适合使用 Harbor你的角色你可以用 Harbor 做模型/Agent 开发者系统性评测自家 Agent对比不同模型表现研究团队自建 AI Agent 评测基准云端大规模并行实验RL 数据生成平台/企业用户通过 Harbor Hub 共享基准与结果托管运行统一评测新手学习者用 examples/ 中的 30 任务示例快速理解任务格式✅ 总结Harbor 框架以任务 指令 环境 测试的简洁抽象统一了 AI Agent 评测、基准构建、云端并行实验与 RL 优化四大场景。它由 Terminal-Bench 团队打造、生态成熟80 基准适配器、40 Agent 集成并且任务格式开放独立是目前做 Agent 评测与优化最值得关注的开源框架之一。上手路径建议先用 examples/tasks/ 里的示例任务跑通流程 → 查阅 examples/configs/ 学习配置写法 → 再阅读 docs-mintlify/core-concepts/ 深入核心概念最后参考 pyproject.toml 与 registry.json 了解框架自身的工程组织。【免费下载链接】harborFramework for evaluating and improving agents项目地址: https://gitcode.com/gh_mirrors/harbor17/harbor创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表