ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

深度解读 Ornith-1.5-397B 跑分:Terminal-Bench 86.1 与 SWE-bench 86 评测方法全拆解

深度解读 Ornith-1.5-397B 跑分:Terminal-Bench 86.1 与 SWE-bench 86 评测方法全拆解 深度解读 Ornith-1.5-397B 跑分Terminal-Bench 86.1 与 SWE-bench 86 评测方法全拆解【免费下载链接】Ornith-1.5-397B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-397BOrnith-1.5-397B 是 ornith-ai 发布的 397B 参数开源 MoE 大模型官方跑分在Terminal-Bench 2.1 拿到 86.1、SWE-bench Verified 拿到 86。这两个分数是怎么测出来的用了什么框架、什么采样参数、做了哪些防作弊处理本文逐条拆解评测方法帮你看懂这份跑分单的真实含金量。397B MoE 大模型速览先看模型本体在解读跑分前先明确被测对象是谁关键参数数值说明架构混合专家MoE512 个专家每 token 激活 10 个总参数量约 397Bbf16 权重大小约 807 GB上下文窗口262,144 tokens支持 YaRN 扩展至约 1M层数60 层每 4 层穿插一次全注意力模型类型推理模型输出前会先产生think思考块几个对跑分有直接影响的设定它是推理模型默认先输出思考内容再给答案评测框架需要专门的 reasoning 解析器才能正确计分。工具调用原生支持模型会输出规范的工具调用块服务侧可解析为标准tool_calls——这正是它擅长 Agent 类编码任务的底层原因。权重文件模型拆分为 122 个 safetensors 分片model-00001-of-00122.safetensors至model-00122-of-00122.safetensors另有独立的model-mtp.safetensors多 token 预测权重。架构与结构参数可在仓库的config.json中逐项查证采样默认值见generation_config.json。Terminal-Bench 86.1 跑分是怎么测出来的Terminal-Bench 2.1 考察模型在真实终端环境里完成系统工程任务的能力是衡量Agent 型编码能力的核心基准。Ornith-1.5-397B 在这个基准上提供了两组分数Terminus-2 框架下86.1主打分数Claude Code 框架下85.2官方给出的 Terminus-2 版评测细节如下每一条都值得注意框架与参数使用 Harbor/Terminus-2 框架parserjsontemperature1.0top_p1.0128K 上下文窗口。硬件与超时每次运行 4 小时超时32 CPU 核、48GB 内存的沙箱环境——这是跑分可复现性的关键。多次取平均所有结果均为5 次独立运行的平均值单次波动被抹平。训练-推理一致性团队专门调整了 Qwen 系 chat 模板见仓库内chat_template.jinja确保评测时的提示格式与训练阶段一致避免模板漂移压低分数。框架适配修改了 Harbor 框架以对齐 vLLM 的reasoning_content字段保证思考块不会被误判为正文。 划重点86.1 不是单次跑出来的而是 5 次平均且 temperature1.0 是复现跑分的设定与日常使用建议的 0.6 不同。SWE-bench Verified 86评测配置与防作弊机制SWE-bench Verified 考察模型解决真实 GitHub 仓库中开源项目 issue 的能力是目前修 Bug 能力的事实标准。Ornith-1.5-397B 在此项得分为86同套配置下 SWE-bench Pro 65.1、SWE-bench Multilingual 79.6。评测方法上有两个关键点① 统一 Harness 与参数使用 OpenHands 作为 Agent 框架temperature1.0top_p0.95256K 上下文窗口。与 Terminal-Bench 一样同样取 5 次运行平均值。② 双重防作弊anti-hacking设计⚠️删除 Git 历史评测用仓库镜像中抹掉了 git 历史模型无法从历史提交中偷看标准答案断网运行评测环境禁用网络访问模型无法检索外部资料或搜索答案。这两条措施直接排除了靠搜索和翻历史提交刷分的可能让 86 这个分数更接近模型真实的代码修复能力。同类防作弊思想也贯穿了其他评测例如 NL2Repo 评测中屏蔽了指定 GitHub 仓库与 pip 包的访问。完整跑分对比一次看懂各维度得分以下是官方模型卡中的核心跑分Ornith-1.5 均为 5 次运行平均评测基准Ornith-1.5-397BDeepSeek-V4-Flash-0731GLM-5.2Claude Opus 4.8Kimi K3Terminal-Bench 2.1 (Terminus-2)86.182.781.085.088.3Terminal-Bench 2.1 (Claude Code)85.281.882.778.9-SWE-bench Verified8681.683.085.886.2SWE-bench Pro65.164.462.168.0-DeepSWE56.054.446.259.067.5HLE (带工具)56.150.854.757.956.0GPQA Diamond92.891.491.293.693.5MCP-Atlas80.074.677.882.282.3BrowseComp86.684.885.684.391.2如何解读这张表编码与终端任务与 Claude Opus 4.885.0 / 59.0基本持平明显领先同量级开源模型 GLM-5.2 与 DeepSeek-V4-Flash-0731。推理能力GPQA Diamond 92.8与顶级闭源模型差距很小HLE 无工具 44.6 / 带工具 56.1用 Claude 4.6 Opus 担任评审模型。Agent 能力MCP-Atlas 80.0500 任务公开子集、thinking 模式、单任务 10 分钟超时、Claude 4.8 Opus 评审、Toolathlon-Verified 71.2、WideSearch 80.8、ClawEval 81.4整体处于第一梯队。短板Frontier-Bench v0.1 仅 13.5说明在极端难度的前沿任务上仍有提升空间这一点解读跑分时不应忽略。决定分数可信度的 5 个评测细节新手看跑分最容易只看数字以下 5 个细节才是分数的可信度来源5 次独立运行取平均——所有 Ornith-1.5 报告值均如此消除了单样本波动。明确的温度与框架版本——如 Claude Code 组使用 Claude Code 2.1.126、max_new_tokens131072框架版本固定才能对比。防奖励作弊reward hacking设计——删 git 历史、断网、屏蔽 pip 与指定仓库堵死抄答案路径。训练-推理模板对齐——评测前专门调整 chat 模板分数反映的是模型本身而非格式红利。统一的评审模型——HLE、MCP-Atlas 等主观/开放性任务均指定了固定的 Judge 模型避免评审标准漂移。看完跑分之后如何部署与调用分数之外实际使用 Ornith-1.5-397B 还有几点实操建议显存预算bf16 权重约 800 GB官方推荐单节点 8 卡张量并行如 8× H200小显存可换 FP8/INT4 量化版本。采样参数日常任务建议 temperature0.6、top_p0.95、top_k20若要复现跑分则用 temperature1.0——这正是评测分数与日常体验可能略有差异的原因之一。推理解析器部署时需开启 reasoning parser 与 tool-call parservLLM/SGLang 均有对应参数思考块会单独返回到reasoning_content字段。长上下文原生 262K tokens可用内置 YaRNfactor 4.0扩展到约 1M但静态缩放对普通长度请求略有损耗按需开启。Agent 框架OpenCode、Ollama、llama.cpp 等 OpenAI 兼容端点均可直接接入配合 Terminal-Bench 类终端 Agent 使用最能发挥其 86.1 的实力。小结Ornith-1.5-397B 的 Terminal-Bench 86.1 与 SWE-bench Verified 86建立在5 次平均、固定框架版本、删 git 历史 断网防作弊、训练-推理模板对齐的严格评测流程之上与 Claude Opus 4.8 基本持平、领先同量级开源模型属于有方法论支撑的分数。如果你需要终端 Agent 或大规模修 Bug 场景的开源大模型这份跑分单值得重点关注。【免费下载链接】Ornith-1.5-397B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-397B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表