ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

模型跑分到底怎么看? Gemini 4 Argon 发了一张官方对照表,除了跑鹈鹕, 我们应该怎么测试模型能力?

模型跑分到底怎么看? Gemini 4 Argon 发了一张官方对照表,除了跑鹈鹕, 我们应该怎么测试模型能力? 让鹈鹕骑自行车孙悟空开客机、秦始皇拧螺丝这种提示词测的是真本事但它不是跑分一、开篇大家都在自己出题考 AI先说一只鹈鹕。2024 年 10 月 25 日开发者 Simon Willison 在自己的博客上发了一篇短文宣布要搞一个「自己的大模型测试」让模型用 SVG 代码画一只骑自行车的鹈鹕。他用的提示词只有一句Generate an SVG of a pelican riding a bicycle。第一批他跑了 16 个模型。为什么偏偏是鹈鹕他给了两个理由一是他本人喜欢鹈鹕二是他很确定网上没有现成的「鹈鹕骑车」SVG 文件模型没法从训练数据里抄一份交差。这个理由很关键。文字模型本来就不会画画它只能一行行写出坐标和形状车架怎么连、鹈鹕的腿怎么踩到脚踏上全得靠它自己在脑子里摆好。画得像不像一眼就能看出来。这个半开玩笑的测试后来越传越广。2024 年 12 月这篇旧文被人贴上 Hacker News拿到了 102 分。到 2025 年 6 月Simon Willison 干脆用一只只鹈鹕回顾了过去半年的大模型。他在那篇文章结尾写了个小插曲几周前的 Google I/O 主题演讲里屏幕上一闪而过一只骑车的鹈鹕。他的反应是「他们发现我了。」这句玩笑背后有个严肃的问题一道题一旦出名就可能被人专门拿去练它也就不再能测出真本事了。最近各个微信群开始流行画鹈鹕骑自行车有的看着还行有的看着搞笑。鹈鹕之后民间出的题越来越难。现在网上流传着一段中文超级长提示词读起来像一部荒诞小说孙悟空坐在驾驶舱里开一架四发动机的大客机一只鹈鹕在机翼上骑自行车一只北极熊横跨在鹈鹕张开的两只翅膀上秦始皇穿着玄衣、戴着冕旒骑在熊背上右手拿电动螺丝刀拧螺丝。秦始皇头顶还要托一只乌龟乌龟背上站一头小象小象背着温室温室里的树上挂着沙漏沙漏上站着戴宇航头盔的章鱼章鱼头盔上顶着茶杯茶杯里有灯塔灯塔顶上有个玻璃球。玻璃球里要画出整幅画的简化版简化版的玻璃球里再画一层然后必须停下来用一个金色圆点收尾。这还没完。画面各处还藏着几十道题一道很绕的糖果盲取题答案要同时出现在鹈鹕的对话气泡、飞机尾部航班号和一块「最坏情况记录板」上自行车车架上写「strawberry」车铃上要写出这个词里有几个字母 r章鱼的黑板上要比较 9.11 和 9.9 谁大还特意提醒「不得按版本号比较」机身上画三扇门考经典的三门问题热气球下挂一个七层汉诺塔旁边写出最少要挪几步。提示词最后还要求同一个答案在画面好几个位置必须一模一样。图为 GPT-5.6 Sol 按超长提示词生成的一张推理测试图。拆开来看这段提示词其实在考五件事。第一空间关系谁托着谁、每样东西数得对不对比如四台发动机要能分别数清。第二属性绑定哪只企鹅戴红帽、哪只拿鱼不能串到别的动物身上。第三递归能不能按规则停下而不是无限套娃。第四几十条约束能不能同时满足、前后一致。第五经典陷阱题会不会顺着直觉答错。超级提示词像一层托一层的积木每层藏着不同考点示意图。这类测试很好玩也确实能看出模型的短板。但它有三个硬伤每个人出的题不一样打分全凭眼睛题目一出名还可能被专门训练。所以它没法用来横向比较。正式的跑分表倒是统一了题目和打分可普通读者往往只看得出「谁的数字大」。9 月 30 日Google 发布了 Gemini 4 Argon同时放出一张和 GPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5 的对照表一共 19 行成绩。拿它来练习怎么读正合适。Argon 是 9 月 30 日发布的先向部分用户开放。Google CEO Sundar Pichai 在自己的 X 账号上写Argon 带有「前沿级」的防护措施frontier safeguards首先给美国政府和一批受信任的网络防御方用Google 把这个项目叫 Fairwind Program其余人要等他写的是「会尽快、也会尽量安全地」开放没有给具体日期。Google 博客写随后会向付费 API 客户和 Google AI Ultra 订阅用户尽快开放。二、拿官方表练手先看谁测的再看缺什么、差多少先看这张表本身。9 月 30 日Google 发布 Gemini 4 Argon同时放出一张对照表对手是 GPT-6 Astra、Claude Fable 5.1 和 Claude Opus 5.5共 19 行成绩。表的页脚给了一个方法页deepmind.google/models/evals-methodology/gemini-4-argon说明每一行的数字从哪来。拿到一张官方对照表第一反应往往是看新模型那一列哪项最高、领先多少。其实应该先看页脚每一格是谁测的数字是谁测的决定了它能不能和旁边的数字比第三方榜单是统一条件厂商自报是各家自己的环境Google 自己跑的则要看方法页怎么写。读这种表具体做法分三步。第一步看方法页把每一行归类Google 自己跑的、取自第三方榜单的、厂商自己报的。第二步能回查的格去回查第三方榜单就去那个榜单页对厂商自报的去厂商发布页对。第三步看缺格和领先幅度表里有「—」的地方为什么缺领先几个点算不算在误差里。下面几个例子数字都是 10 月 1 日打开各家公开页面核过的凡是只有 Google 或厂商自己报、公开页面上查不到的文中都会写明。官方表逐格的来源标注蓝色是第三方榜单上核到的数橙色是 Google 自己跑的灰色是厂商自己报的虚线框是表上没有数橙色点线框是没核到可靠出处、不显示数字浅灰点线框是对应榜单上没有 Argon 这一行、同样不显示数字红圈是 Claude Opus 5.5 的 Terminal-Bench 4.0 一格。例子一同一行里混着两种口径。Terminal-Bench 4.0 这一行Argon 是 57.4%方法页写明是 Google 自己跑的GPT-6 Astra 是 58.2%Claude Fable 5.1 是 57.9%都和 Snorkel 网站上的公开榜镜像页一致Claude Opus 5.5 是 66.4%。我们在 10 月 1 日打开这个镜像页没有看到 Opus 5.5 这一行官方榜站点的表格是网页脚本生成的我们这次没能读到所以不敢说官方榜上一定没有。66.4% 与 Anthropic 9 月 22 日发布页上自己报的数一致xhigh 档标准误 ±2.6在 Anthropic 自己的环境里跑的。也就是说同一行里有的是公开榜上的数有的是厂商自报口径并不一样。Artificial AnalysisAA自己复测的 Opus 5.5 是 59.6%用的是 AA 统一的 mini-swe-agent 测试框架每道题跑三次取平均AA 页面写明全部评测由它独立运行。例子二Argon 这一列有不少格是 Google 自己跑的。方法页写明Argon 在 DeepSWE v1.1、Terminal-Bench 4.0、Agents Last Exam、OSWorld-2.0、LVBench、LABBench2、GraphWalks、PostTrainBench 等行上都是 Google 自己跑的Vals Index、Vals Finance Agent v2、Harvey 法律智能体、Vibe Code Bench 取自 Vals AIAutomationBench 取自 ZapierFrontierSWE 取自 ProximalCWE-bench 取自 Collinear。我们回查了后面这几家的榜单页Argon 在这几行上的数字都对得上。第三方榜单上的格能回查自己跑的格只能信方法页怎么写读的时候要分开看。例子三表里只有四个模型「领先」只是在这四个里领先。Vibe Code Bench 这一行Argon 是 91.9%比表里另外三个都高。但 Vals 榜单页上榜首是 Claude Sonnet 5.592.39%Argon 排第 2一共 106 个。Harvey 法律智能体这一行Argon 是 19.6%表里最高Vals 榜上榜首是 Muse Spark 1.225.42%Argon 排第 5一共 73 个。例子四领先几个点算不算有差。Vals Index 这一行Argon 68.9%Claude Opus 5.5 67.0%差 1.9 个点Vals 页给的误差大约是 ±0.97差的幅度约两倍误差算有一点领先但不大。FrontierSWE v2 这一行反过来Argon 是 55.0%±9.9GPT-6 Astra 是 65.5%±8.9差十个点左右但两边的误差也各有九到十个点区间大面积重叠别急着下结论。例子五缺格不是忘了写。表里有三格写着「—」Claude Fable 5.1 的 Agents Last Exam方法页说它不在公开榜上OSWorld-2.0 里 Claude 的两格方法页说 Anthropic 只报了在线和离线合起来的总分没法对上 Argon 用的离线子集。缺格背后是没有可比的数。例子六价格要写明是哪一种。Google 博客写的是Argon 现在是介绍期价格每百万 token 输入 2 美元、输出 10 美元介绍期结束后是 4 美元和 20 美元。博客没有写介绍期什么时候结束。Arena、Artificial Analysis 页面列的是介绍期价 2 美元 / 10 美元Vals 页列的是介绍期后的 4 美元 / 20 美元。引用价格时要写明是哪一种两种不能混着比。再回头看一个反面例子。Argon 发布前网上流传过一张列着 Gemini 4 Pro、Flash、Flash-Lite 的跑分截图下面简称旧网传截图里面不少数字和 Google 发布的官方表对不上。我们不知道那张截图是怎么来的只能说数字放错列、对不上官方页面的表不用看。它在这里只当反面例子下面这几处是我们拿官方页面一格一格对出来的Terminal-Bench 4.0在命令行里完成复杂任务的测试旧网传截图里 GPT-6 Astra 是 66.4%。OpenAI 官方发布页写 57.9%Snorkel 镜像页写 58.2%66.4% 是 Gemini 4 Argon 官方表里 Claude Opus 5.5 的数。DeepSWE v1.1软件工程测试官方写 GPT-6 Astra 是 74.1%旧网传截图写的是 86.9%。价格OpenAI 官方写 GPT-6 Astra 每百万 token 输入 10 美元、输出 50 美元旧网传截图写的是 12 美元和 60 美元。上下文长度Anthropic 官方文档写 Claude Fable 5.1 是 100 万 token1M旧网传截图写的是 200k。四处都对不上而且差得不小。这里要说清楚这是反面例子我们不知道那张截图是谁做的也不知道错在哪一步能确定的只是「它和官方数字对不上」。之前网传虚假的分数表这张图把旧网传截图里和官方对不上的四处并排列出来只用作反面例子。下表是旧网传截图里四处对不上的地方官方值都核对过官方页面。模型项目官方值旧网传截图上的值官方出处GPT-6 AstraTerminal-Bench 4.057.9%66.4%OpenAI 发布页 openai.com/index/gpt-6-astraGPT-6 AstraDeepSWE v1.174.1%86.9%OpenAI 发布页 openai.com/index/gpt-6-astraGPT-6 Astra价格每百万 token输入/输出10 美元 / 50 美元12 美元 / 60 美元OpenAI API 模型页 developers.openai.com/api/docs/models/gpt-6-astraClaude Fable 5.1上下文长度1M200kAnthropic 模型文档 platform.claude.com/docs/en/models/fable-5-1/overview三、看名字里的关键词认出考的是哪一类搞清了每一格是谁测的下一个难题是表里一行行的英文名到底在考什么跑分的名字五花八门但名字里的关键词基本就说明了它考的方向。记住下面几组大部分榜单都能对上号。名字里有 SWE、Terminal 的考写代码、改代码、在命令行里干活比如 DeepSWE v1.1、Terminal-Bench 4.0。名字里有 GDP、Finance、Legal 的考的是真实上班的活比如 GDPval-AA 用的是真实职业里的工作任务LAB 在 Artificial Analysis 的页面上指的是法律 AI 公司 Harvey 做的法律智能体测试。名字里有 OS、World、Browse 的考操作电脑和浏览器比如 OSWorld 2.0、BrowseComp。名字里有 Agent 或者希腊字母 τtau的考多步骤完成任务、中途调用工具比如 AutomationBench-AA以及 τ 系列里的金融客服测试。名字里有 HLE、GPQA、Math、ARC 的考难题、竞赛题和推理题。HLE 是 Humanitys Last Exam 的缩写其他例子还有 GPQA Diamond、FrontierMath、ARC-AGI 系列。名字里有 Char、MMMU、V 的考看图表、看图片和视频。名字里有 Omniscience 的考不知道的时候会不会乱编。比如 AA-Omniscience答对加分乱猜扣分所以老老实实说「不知道」反而比瞎猜划算。名字里有 Bio、Science 的考科研任务比如 LifeSciBench、GeneBench Pro。名字里有 Index、Arena 的是综合排名下一节细讲。回头看开篇那段超级提示词它考的数数、空间承托和陷阱推理大致落在「难题推理」和「看图」这两类里。区别在于正式榜单是一套固定的题、统一的打分方法题量从几十道到几千道不等。比如 Terminal-Bench 4.0 一共 66 道题AA-Omniscience 有 6000 道。每个模型做的是同一套卷子分数才能放在一起比。本节速览先认出这一行考的是什么再看它跟你关心的事有没有关系上面这张对照表可以存下来看到新榜单时对着查。四、两个常见的综合排名Arena 和 Artificial Analysis说到「综合排名」最常被引用的是两家Arena 和 Artificial Analysis下面简称 AA。一个是真人投票比谁更好用一个是第三方在统一条件下考试。两家的结果经常不一样这很正常因为它们回答的是不同的问题。下面的排名和分数都是 10 月 1 日打开页面看到的页面数据日期是 9 月 30 日随时会变。先说 Arena。它的核心玩法是真人盲评同一个问题同时交给两个匿名模型用户看完两个回答投票选更好的那个投完才揭晓是谁。Arena 再用 Bradley-Terry 方法把这些投票算成分数这个方法和国际象棋里的 Elo 积分是一个思路。按用途Arena 分成文字、代码、看图、文档、搜索、图片生成和编辑、视频生成等好几个榜。截至 10 月 1 日Arena 文字总榜页面数据日期 9 月 30 日排第一的是刚发布的 Gemini 4 ArgonHigh分数 1525±9。但它被标成「初步」Preliminary只有 4,942 票排第二的是 Claude Opus 4.6High1505±3有 7.7 万多票第 3 到第 6 名Claude Fable 5 High 1505、Claude Opus 5.5 High 1504、Claude Opus 4.7 High 1502、Claude Fable 5.1 Max 1501都在 1501 到 1505 之间和第二名最多差 4 分。「±9」和「初步」都在提醒别把名次看太死第五节会专门说误差。Arena 官方账号发的文字榜图Text Arena图源Arena 官方 X 帖页面数据日期 9 月 30 日。图上没有日期也没标「初步」和票数Gemini 4 ArgonHigh1,525初步4,942 票。Arena 的网页开发榜Code Arena WebDev页面数据日期 9 月 30 日上Gemini 4 ArgonHigh排第 81679±14同样标「初步」只有 2,184 票名次范围是第 6 到第 11 名榜首是 Claude Opus 5.5Max1818只有 1,976 票第二名是 GPT-6 AstraMax1789。Arena 官方账号发的网页开发榜图Code Arena WebDev图源Arena 官方 X 帖。图上没有日期也没标「初步」这里只看前 8 名Gemini 4 ArgonHigh第 81,679。Arena 还有一个 Agent 榜玩法完全不同它不靠投票而是看模型在真实使用中的表现。用户在 Arena 的 Agent 模式里真刀真枪地干活系统记录五种信号用户有没有确认任务完成用户是夸还是骂被用户纠正后能不能改对命令执行失败后能不能尽快恢复会不会调用根本不存在的工具。这五项合成一个 Net Improvement 分意思是「换成这个模型比平均水平好多少」正数表示高于平均负数表示低于平均。Agent 榜又按任务分成三类Code写代码、调 bug、自动化流程、分析数据、Chat创意写作、学习、日常查资料、生成媒体内容等和 Work写文档、专业调研、做计划、正式写作。截至 10 月 1 日页面数据日期 9 月 30 日Agent 总榜和 Code 类排第一的仍是 Claude Fable 5.1Max。Gemini 4 ArgonHigh在 Agent 总榜排第 87.92%名次范围是第 3 到第 15 名只有 3,417 次会话样本还不多它每任务的中位花费约 0.63 美元Arena 页面上这一项按最近 14 天滚动10 月 1 日早些时候显示过 0.62 美元会有小幅变动比同一榜上的 Fable 5.1、Opus 5.5、Astra 都低。有意思的是Arena 在 8 月 14 日的博客里写的还是另一番景象在它当时挑出来对比的一批主流模型里Agent 总榜第一是 Claude Opus 5HighCode 类第一是 GPT 5.6 SolxHigh。一个多月后头名已经换了人。所以引用排名时一定要带上日期。Arena 官方账号发的 Agent 总榜图图源Arena 官方 X 帖。图上没有日期页面数据日期 9 月 30 日。Gemini 4 ArgonHigh第 87.9%。Arena 官方账号发的 Agent 榜「分数对成本」图图源Arena 官方 X 帖。横轴是每任务的中位花费最近 14 天对数刻度越靠右越便宜纵轴是 Net Improvement绿线是最外沿连成的一条线线上的模型是同样的钱买不到更高分的。图上 Gemini 4 ArgonHigh的花费写 0.62 美元这一项按最近 14 天滚动页面后来显示 0.63 美元所以约 0.62–0.63 美元。再说 AA。它不搞投票而是自己在统一条件下把各家模型拉来考试。它的综合分叫 Intelligence Index目前是 v4.3.2 版分数在 0 到 100 之间由 10 门考试组成AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanitys Last Exam、GDP.pdf、CritPt、AA-Omniscience 和 AA-LCR v1.1。这些考试分成智能体、编程、通用能力、科学推理四类。截至 10 月 1 日得分最高的仍是 Claude Opus 5.5Max 档58 分。Gemini 4 ArgonHigh 档是 53 分与 Claude Fable 5.1Max和 GPT-6 AstraMax都是 53 分做完整套题平均每道题花 1.99 美元比 Fable 5.1 的 7.63 美元、Astra 的 3.26 美元便宜不少。要注意两点。一是 1.99 美元是介绍期的半价AA 在 9 月 30 日的 X 帖里写介绍期结束后每题约 3.98 美元AA 页面上没有这个数只有帖里这么说Google 还没公布介绍期何时结束。二是 AA 把 Argon 标成「尚未公开提供」Not publicly available也就是说榜上这个分是在只向部分用户开放的版本上测的对外开放后价格和可用档位可能变。AA 网站上的其他页面其实是同一批模型换个角度看每门考试的单项成绩、做一道题平均花多少钱、花多少时间、用了多少 token。其中最实用的是「分数对成本」散点图横轴是做一道题的平均花费纵轴是综合分。越靠左上角的模型越是又强又便宜。图上还有一条最外沿连成的线线上的模型意味着同样的钱已经买不到更高的分了。Artificial Analysis 官方 X 帖配图9 月 30 日发布图源Artificial Analysis 官方 X 帖。上半是综合指数 v4.3.2 的各模型得分下半是综合分对做一道指数题的平均花费横轴是对数刻度越靠左上越划算。绿色箭头是 AA 自己加的指向 Gemini 4 ArgonHigh格子纹表示尚未公开提供Argon 的 1.99 美元是介绍期价。图上没有日期正文数字以 10 月 1 日打开的页面为准。图保持原样、没有改动版权归 Artificial Analysis。同一个 Argon在 Arena 文字榜上排第一在 Arena Agent 榜上排第 8在 AA 的综合指数上和别的几个并列 53 分在 AA 的编程智能体指数上测的是「命令行工具加模型」的组合搭配 Google 自家的命令行工具排第 3这并不矛盾投票比的是谁更好用Agent 榜看的是真实干活AA 是统一考试。两家怎么搭配着用想看整体实力看 AA 的综合指数想知道用起来顺不顺手看 Arena写代码的人可以同时看 AA 的编程单项和 Arena 的 Code 榜要控制成本看 AA 的分数对成本图或者 Arena Agent 榜上的每任务花费。再把两种成绩单放在一起看。Google 的对照表是发布方自己挑的 19 项考试只有四个模型Artificial Analysis 的综合指数是另一种读法10 门固定的考试合成一个分Argon 是 53 分与 GPT-6 AstraMax、Claude Fable 5.1Max同在 53 分这一档榜首 Claude Opus 5.5Max是 58 分。两边并不矛盾一个回答「在发布方挑的这几项里谁更高」一个回答「在固定的一套考试合起来站哪里」。Arena 看用起来顺不顺手AA 看统一考试考得怎么样。本节速览Arena 看好不好用AA 看统一考试考得怎么样两家不一致很正常按你想问的问题选着看引用时记得带日期新模型刚上榜时票数和会话数都少名次看看就好官方发的图上大多没有日期数字以页面日期为准Argon 在 AA 上还被标成尚未公开提供。五、读分的四条规矩就算表的出处清楚、类别也认对了同一个分数换个角度看意义也可能完全不同。下面四条规矩读任何跑分都用得上。第一条先问谁测的。厂商自测、第三方复测、真人投票可信度和口径都不一样。还要看测试设置能不能用工具、试了几次、让模型想多久。举个例子同样是 GPT-6 Astra 考 Terminal-Bench 4.0OpenAI 官方发布页写的是 57.9%Terminal-Bench 4.0 公开榜在 Snorkel 网站上的镜像页写的是 58.2%。发布页的页面脚注说明这是各种推理档位里取的最高分在它自己的研究环境或 API 上跑出来的AA 自己复测的是 59.6%用的是 xhigh 档、AA 统一的 mini-swe-agent 测试框架每道题跑三次取平均AA 页面写明全部评测由它独立运行。两个数字不一样不代表谁错了而是测法不同。再看 Claude Fable 5.1 的同一项OpenAI 和 Anthropic 的发布页都写 55.8%Snorkel 镜像页写 57.9%AA 复测是 55.1%xhigh 档和 52.0%max 档四个数字四种测法。Gemini 4 Argon 的官方对照表里还有一个现成的教学例子Claude Opus 5.5 在这一项是 66.4%来自 Anthropic 9 月 22 日发布页的自报xhigh 档在它自己的环境里跑的Snorkel 镜像页上我们没有看到这一行官方榜站点的表格我们这次没能读到所以官方榜上有没有我们没核到AA 复测是 59.6%。这不是造假是口径不同同一行里的数字不一定是同一把尺子量出来的。所以看到一个分数先找它的测试设置写在哪。同一个 Claude Fable 5.1在同一门 Terminal-Bench 4.0 上四个来源给出四个数因为测法不同。还要问一句测的到底是什么。AA 还有一个「编程智能体指数」Coding Agent Indexv1.5测的不是模型本身而是「命令行工具加模型」这个组合DeepSWE v1.1、Terminal-Bench 4.0、SWE-Atlas-QnA 三项考试各占三分之一取平均。10 月 1 日页面上默认显示的 15 行里排第 1 的是 Claude Code 工具搭配 Claude Sonnet 5.5max 档68 分Gemini 4 Argon 是搭配 Google 自家的 Antigravity 命令行工具64 分排第 3。这和前面说的 Intelligence Index 是两套不同的指数分数不能混着比它里面的 Terminal-Bench 4.0 也只是三项之一而且是各家工具各自跑出来的不等于上面说的那几个 Terminal-Bench 4.0 单项分数。比如页面上 Claude Code 搭配 Claude Opus 5.5max 档的 Terminal-Bench 4.0 分量是 63.1%它既不是 Google 表里的 66.4%也不是 AA 统一框架复测的 59.6%同一套 66 道题谁来跑、用什么工具数就不同。同一个模型换一个工具分数可能不同所以看到「某模型多少分」先问它是在哪个工具里测的。AA 编程智能体指数Coding Agent Index v1.5页面截图默认显示的 15 行。它测的是「命令行工具加模型」的组合不是前面说的 Intelligence Index三项考试各占三分之一。截图上没有日期页面 10 月 1 日核对过。Claude Code 搭配 Fable 5.1 一行页面标「with fallback」遇到安全拒绝时工具会换成另一个模型把任务做完。第二条差一两点基本等于没差。题量有限每次跑的结果也会有波动小分差很可能落在误差里。Terminal-Bench 4.0 一共只有 66 道题多做对一道分数就差一个半百分点左右。AA 的复测里Claude Opus 5.5max 和 xhigh 两档和 GPT-6 Astraxhigh 档干脆同分都是 59.6%。Arena 更直接把误差写在了分数旁边页面上还给了一个「名次范围」在 Agent 总榜上Gemini 4 ArgonHigh排第 87.92%±3.24名次范围是第 3 到第 15 名文字榜上 Claude Opus 5.5High排第 41504±10名次范围是第 2 到第 14 名。换句话说按目前的数据排第 8 的真实可能排第 3也可能排第 15。遇到这种情况把前几名当成同一档就好。第三条大家都快考满分的考试分不出高低。一门考试刚出来时能拉开差距但模型进步快过一阵子大家都挤在满分附近再比就没意义了。OpenAI 在 GPT-6 Astra 的官方发布页上列了 ARC-AGI-1 的成绩GPT-6 Astra 98.5%GPT-5.6 Sol 97.5%Claude Fable 5.1 97.5%Claude Fable 5 98.5%Claude Opus 5 97.5%五个模型全挤在 97.5% 到 98.5% 之间。同一页上OpenAI 还说 GPT-6 Astra 在 ARC-AGI-3 上拿到 99.9%用的词就是「考满了」saturates。出题的人也知道这个问题Terminal-Bench 4.0 这一版就专门删掉了 8 道已经被大家考满、或者有其他问题的题。遇到分数挤在顶上的榜换一个更难的榜去看。ARC-AGI-1 上五个模型都挤在满分附近已经分不出高低。第四条价格要一起看。分数高一点、价格贵好几倍对多数任务不一定划算。而且只看每百万 token 的单价还不够还要看完成一次任务实际用了多少 token。Arena 的 Agent 榜就能看出这一点Claude Fable 5.1Max和 GPT 6 AstraMax的单价一样都是每百万 token 输入 10 美元、输出 50 美元但在真实使用中完成一次任务的中位花费10 月 1 日页面前者约 4.2 美元后者约 2.9 美元这一项按最近 14 天滚动会有小幅变动。单价一样实际花的钱可以差不少。再看 Gemini 4 ArgonHigh页面列的单价是介绍期价每百万 token 输入 2 美元、输出 10 美元Google 博客写介绍期结束后是 4 美元和 20 美元没有写介绍期何时结束两种价格不能混着比它在 Agent 榜上每任务的中位花费约 0.63 美元但名次是第 8。便宜不等于划算也不等于不划算要和分数放在一起看。第四节提到的 AA「分数对成本」图就是把这件事画成了一张图。本节速览先问谁测的、怎么测的小分差不当真快考满分的榜少看还要问测的是模型还是「工具加模型」价格和分数放在一起算还要算一次任务实际花多少。六、最准的是用自己的任务测公开跑分能帮你把候选范围缩小到两三个模型但最后选哪个最准的办法是拿你自己的真实任务去比。这又回到了开篇。那段超级提示词其实也是「自己测」只不过它测的是花样能不能在一张画里同时摆平几十条约束。你真正需要测的是你每天真在做的活比如写周报、改代码、整理表格、回客户邮件。做法很简单。挑 5 到 10 件你平时真做的事这个数量只是建议把同样的提示分别交给两三个模型记下每个模型做得对不对、花了多长时间、花了多少钱。做完一轮你对「哪个模型适合我」的判断会比看再多跑分表都靠谱。自测记录样表表中数字是编的示例只示范怎么记。
返回列表