
Claude Sonnet 5.5更快、更便宜的 Agent 模型机构Anthropic发布时间北京时间2026 年 9 月 29 日 02:00Anthropic 正式发布Claude Sonnet 5.5。这一代的重点并不是扩大模型规模而是提升 Agent 与 coding 任务中的执行效率更少的 token、更少的工具调用、更短的任务完成时间同时保持接近旗舰模型的能力。核心变化更快、更省相比 Sonnet 5输出速度提升30%典型任务成本最高降低约30%。API 单价保持为$2/M input tokens、$10/M output tokens。Agent / Coding 提升明显Terminal-Bench 4.0 从 Sonnet 5 的10.3%提升至70.6%CursorBench 4.0 从34.1%提升至55.5%。工具使用更高效模型更倾向于批量调用工具以更少的步骤、shell runs 和 tool calls 完成任务。安全能力同步增强Sonnet 5.5 首次引入接近旗舰模型级别的网络安全 safeguards并增加针对大规模 reasoning extraction / distillation 的防护。为什么重要Sonnet 5.5 更值得关注的不是单个 benchmark 分数而是旗舰级能力正在下沉到更低成本的模型档位。对于实际 Agent 系统限制规模化部署的往往不是一次推理能否答对而是长任务中的token 消耗、工具调用次数、执行延迟和总体成本。Sonnet 5.5 的改进方向正对准这些系统级瓶颈。与此前工作的关系Sonnet 5.5 是继Claude Opus 5.5后 Claude 5.5 系列的第二个模型。它并非取代 Opus而是把新一代 Agent、推理与安全能力下沉到更低成本的 Sonnet 档位。目前 Anthropic 没有披露新的底层 Transformer / MoE 架构因此更合理的判断是这次升级主要来自后训练、Agent policy、effort 控制以及推理/执行系统效率优化而不是公开的新基础架构突破。详细内容Anthropic 在 Claude Sonnet 5.5 的发布资料中对 Sonnet 5.5、上一代 Sonnet 5、旗舰模型 Opus 5.5以及 GPT-6 Sol 的多项能力进行了对比。能力方向评测指标Claude Sonnet 5.5Claude Sonnet 5Claude Opus 5.5GPT-6 Sol智能体式编程终端智能体能力评测Terminal-Bench 4.070.6%10.3%66.4%¹—智能体式编程前沿代码智能体评测·主集FrontierCode 1.1 Main46.2%最大推理强度 / 52.1%超高推理强度²42.4%54.4%49.3%智能体式编程真实代码库智能体评测CursorBench 4.055.5%34.1%57.8%—知识工作专业知识工作能力评测GDPval-AA v2.1³1844144918461487⁴知识工作综合知识工作任务评测AA-Briefcase v1.1³1811135918221483⁴跨学科推理“人类最后考试”综合推理评测Humanity’s Last Exam64.5%使用工具54.9%使用工具67.7%使用工具—计算机操作真实操作系统交互评测OSWorld 2.180.1%部分评测集57.0%部分评测集81.8%部分评测集—图表视觉理解图表理解评测Chartography61.6%不使用工具15.6%不使用工具64.4%不使用工具53.6%⁴不使用工具数据来源Anthropic 官方 Claude Sonnet 5.5 发布资料。粗体表示该行已公开结果中的最高值仅用于辅助阅读不代表模型整体能力排名。—表示 Anthropic 的官方对比中没有提供 GPT-6 Sol 对应成绩。表格标注信息Opus 5.5 的 Terminal-Bench 4.0 成绩为超高推理强度Xhigh effort设置下的结果。FrontierCode 中Sonnet 5.5 的最大推理强度Max effort反而低于超高推理强度Xhigh。Anthropic 的解释是更高设置会更频繁调用 code-review skill 和多个 sub-agent部分任务因此发生超时或产生超出任务范围的修改受到 benchmark 惩罚。GDPval-AA 与 AA-Briefcase 的 Sonnet 5.5 结果来自 Artificial Analysis 对预发布模型版本的测试。Anthropic 提醒GPT-6 Sol 的部分视觉相关成绩可能受到此前图像理解问题的影响因此应谨慎进行精确的横向比较。—表示 Anthropic 官方表格中没有提供对应的 GPT-6 Sol 结果而不是代表得分为 0。这张表最值得关注的并不是 Sonnet 5.5 在某一个 benchmark 上拿到了最高分而是它相较 Sonnet 5 出现了非常明显的跨任务代际提升。提升最集中的三个方向分别是智能体式编程、计算机操作和知识工作。首先智能体式编程是 Sonnet 5.5 最突出的升级方向。在终端智能体能力评测 Terminal-Bench 4.0 上Sonnet 5.5 从上一代的10.3% 提升到 70.6%增加了60.3 个百分点在真实代码库智能体评测 CursorBench 4.0 上则从34.1% 提升至 55.5%。FrontierCode 1.1 中在超高推理强度下也取得52.1%的成绩。这些 benchmark 与传统的“给一道编程题、生成一段代码”并不完全相同。它们更强调模型能否持续地理解代码库、运行命令、读取执行结果、调用工具、发现错误并继续修改。因此这组结果更能反映一个模型作为Coding Agent工作时的实际能力。换句话说Sonnet 5.5 的提升并不仅仅是“代码写得更好”而是更擅长在真实软件工程环境中持续行动并完成任务。第二个非常明显的信号是Sonnet 5.5 已经在大量任务上逼近旗舰级 Opus 5.5。例如在专业知识工作评测 GDPval-AA 中两者分别为Sonnet 5.51844Opus 5.51846只相差 2 分。综合知识工作任务 AA-Briefcase 中Sonnet 5.51811Opus 5.51822同样只有很小差距。在计算机操作方面OSWorld 2.1 为80.1% 对 81.8%在真实代码库智能体评测 CursorBench 上则为55.5% 对 57.8%。这意味着 Claude 产品线中原本比较清晰的“Sonnet 是中档模型、Opus 是能力旗舰”正在发生变化。至少在结构明确的代码、知识工作和计算机操作任务中Sonnet 5.5 已经能够达到非常接近 Opus 的水平。这也是 Sonnet 5.5 最重要的优势之一它不是通过成为新的最大模型来竞争而是在更低成本模型档位上压缩与旗舰模型之间的能力差距。另一个容易被忽略的变化是计算机操作能力。在 OSWorld 2.1 中Sonnet 5.5 从 Sonnet 5 的57.0% 提升到 80.1%增加23.1 个百分点并且已经十分接近 Opus 5.5 的 81.8%。OSWorld 主要测试模型能否像人一样与真实计算机界面进行交互例如操作桌面应用点击菜单与按钮输入内容浏览文件根据界面反馈调整下一步操作完成需要多步交互的任务。因此这组数据对 Claude Computer Use 以及更广义的 GUI Agent 很重要。它表明 Anthropic 对 Sonnet 5.5 的优化并没有局限在代码环境而是在向通用计算机操作 Agent扩展。视觉图表理解同样发生明显跃升Sonnet 5.5 在图表理解评测 Chartography 上取得61.6%而 Sonnet 5 只有15.6%。这里的提升幅度达到46 个百分点。更重要的是这项测试标注为“不使用工具”也就是说模型需要直接从视觉输入中理解图表而不是依赖代码、OCR 工具或外部计算。这说明 Sonnet 5.5 的升级并不局限于纯文本推理和 Agent 能力其视觉信息理解与结构化数据读取能力也出现了明显改善。从 Anthropic 提供的可直接比较项目来看Sonnet 5.5 在几项知识工作和视觉任务上取得了更高结果。例如评测Sonnet 5.5GPT-6 Sol前沿代码智能体评测 FrontierCode 1.152.1%超高推理强度49.3%专业知识工作评测 GDPval-AA18441487综合知识工作评测 AA-Briefcase18111483图表理解评测 Chartography61.6%53.6%这说明 Sonnet 5.5 在 Anthropic 公布的部分长程知识工作、Agent 编程与视觉图表理解任务中具有很强的竞争力。但这里不能进一步推导成“Sonnet 5.5 整体强于 GPT-6 Sol”。原因是 Anthropic 的表格没有提供 GPT-6 Sol 在 Terminal-Bench、CursorBench、Humanity’s Last Exam 和 OSWorld 等项目上的对应成绩因此两者并不存在一个完整的统一 benchmark 集合。此外不同模型使用的推理强度、工具配置和测试 harness 也可能不同。因此这些数字更适合用于观察特定任务上的表现差异而不是做简单的综合排名。Sonnet 5.5 真正的优势Agent 能力与执行效率同时提升如果只看 benchmarkSonnet 5.5 可以被理解成一个“接近 Opus 的新 Sonnet”。但从实际部署角度它更重要的变化是Anthropic 在提高任务成功率的同时还在努力降低完成一个任务所需要的计算量。Anthropic 表示新模型倾向于使用更少的 token减少不必要的工具调用减少 shell 命令执行次数更积极地并行或批量调用工具使用更少的 Agent 步骤完成相同任务。因此对于真实的 Coding Agent 或 Computer Use AgentSonnet 5.5 的改进并不只是“正确率提高”。更准确地说它是在同时优化任务成功率 × Token 消耗 × 工具调用次数 × 执行时间 × API 成本这也是为什么 Sonnet 5.5 对实际 Agent 产品的意义可能比单纯提高几个百分点的 benchmark 更大。新模型的优势可以概括为四点1. 智能体式编程能力出现代际提升。Terminal-Bench、CursorBench 和 FrontierCode 都显示Sonnet 5.5 更擅长执行长链条的软件工程任务而不仅仅是生成代码。2. Sonnet 与旗舰 Opus 之间的能力差距显著缩小。在知识工作、Computer Use、代码智能体和视觉理解任务中Sonnet 5.5 已经非常接近 Opus 5.5。这意味着大量原本可能需要旗舰模型完成的任务可以开始考虑使用成本更低的 Sonnet。3. Computer Use 与多模态能力同步增强。OSWorld 从 57.0% 提升到 80.1%Chartography 从 15.6% 提升到 61.6%说明这并不是一次只针对 Coding benchmark 的升级而是 Agent 与视觉能力的整体提升。4. 优势正在从“模型能力”转向“系统效率”。Sonnet 5.5 更重要的竞争力是以更少 token、更少工具调用和更短任务轨迹完成相同工作。对于需要执行几十甚至数百个步骤的 Agent这种效率提升会直接转化为更低延迟和更低运行成本。如果把 Claude Sonnet 5.5 简单理解成“Sonnet 5 的 benchmark 升级版”其实会低估这次发布。它真正释放出的信号是Anthropic 正在把原本属于旗舰模型的 Agent、知识工作、Computer Use 和多模态能力下沉到成本更低的 Sonnet 档位同时把竞争重点从单纯提高模型峰值能力转向提高真实长程任务中的执行效率。对于 Agent 应用而言这种“旗舰能力下沉 每任务成本下降”可能比单个 benchmark 第一名更加重要。5.5 sonnet 的定价如果只看 API 定价Claude Sonnet 5.5 看起来并没有发生明显变化。它与上一代 Sonnet 5 保持相同的输入和输出 token 单价但与旗舰模型 Opus 5.5 相比主要 token 价格只有后者的一半。计费项目每 100 万 TokenClaude Sonnet 5.5Claude Opus 5.5Sonnet 5.5 相对 Opus 5.5缓存读取Cache Read$0.20$0.20相同缓存写入Cache Write$2.50$5.00低 50%输入 Token$2.00$4.00低 50%输出 Token$10.00$20.00低 50%因此在输入、输出和缓存写入方面Sonnet 5.5 的单位 token 成本基本只有 Opus 5.5 的1/2缓存读取价格则完全相同。所以真正发生变化的是完成同一个任务所需要的 token、工具调用、Agent 步数和运行时间都在减少。Anthropic 表示在其测试中Sonnet 5.5 完成典型任务的成本相比 Sonnet 5最高降低约 30%。如果把 Sonnet 5 完成一个任务的成本标准化为但换一个更适合大规模 Agent 系统的角度来看如果原来 $1 能运行 1 个任务那么现在相同的 $1 可以运行1 / 0.70 ≈ 1.43即同样预算下理论任务吞吐量最高可以增加约 42.9%。Anthropic 给出的另一个核心数字是Sonnet 5.5 的输出速度相比 Sonnet 5 提高30% 以上。这里有一个经常被忽略的数学关系。假设 Sonnet 5 的生成速度为100 tokens/s提升 30% 后Sonnet 5.5 130 tokens/s对于相同长度的输出所需要的生成时间变成100 / 130 ≈ 76.9%因此如果 Anthropic 的“30% faster”指的是生成吞吐率那么对应的纯生成阶段耗时实际上至少下降约 23.1%。指标Sonnet 5Sonnet 5.5相对变化假设生成吞吐率100≥130≥ 30%相同输出长度所需时间100%≤76.9%≤ -23.1%Anthropic 公布的 Accuracy vs. Cost 曲线也值得关注。因为它衡量的是为了达到某个任务成功率模型实际上需要花多少钱。这也是 Sonnet 5.5 最明显的变化。在 Terminal-Bench 4.0 上Sonnet 5.5 使用 Medium effort 时成绩已经明显超过 Sonnet 5 的最佳成绩但成本不到后者的1/10。对应的成本降幅至少为1 - 1/10 90%也就是说在获得更高任务成功率的同时单任务成本下降超过 90%。反过来看同样预算理论上可以执行 10×数量的任务。这里出现的已经不是普通的“模型升级”而是明显的cost-performance frontier shift。CursorBench 上出现了几乎相同的现象。Sonnet 5.5 在Low effort下已经超过 Sonnet 5 的最高成绩但成本同样不到 Sonnet 5 的1/10因此对应成本下降 90%单位预算任务数量 10×同时 benchmark 成绩更高在长程知识工作 benchmark AA-Briefcase 上Sonnet 5.5 在 Medium effort 下超过 Sonnet 5 的最佳成绩而成本约为后者的1/9因此1 - 1/9 88.9%即完成同类知识工作任务的成本约降低 88.9%。或者从单位预算生产率来看每美元能够执行的任务数量约提高到 9 倍。对于 Research Agent、金融分析 Agent、企业知识检索和长程办公自动化而言这种变化的实际意义可能比 benchmark 分数本身更大。FrontierCode 的结果可能是 Sonnet 5.5 最值得关注的 cost-performance 数据。Anthropic 表示在相同的 High effort 设置下Sonnet 5.5 比 Sonnet 5 高约10 个百分点但每任务成本只有大约1/15。换算之后1 - 1/15 93.3%也就是说单任务成本约降低 93.3%。而单位预算能够完成的任务数量理论上变成15×更重要的是这并不是通过牺牲性能实现的。而是性能约 10 个百分点 成本-约 93.3%FrontierCode 上还有一个非常值得关注的对比。Anthropic 表示Sonnet 5.5 在 High effort 下可以达到与 GPT-6 Sol 最佳结果相当的成绩但每任务成本约为1/5因此成本差距约为1 - 1/5 80%即在相近 FrontierCode 性能下Sonnet 5.5 的任务成本约低 80%。换一个角度相同预算理论上可以执行约 5 倍数量的任务。因此这里真正值得关注的并不是“Sonnet 5.5 比 GPT-6 Sol 高了多少 benchmark 分数”而是在接近相同性能点时需要多少计算成本才能到达这个性能水平对于生产环境里的 Coding Agent这往往是比绝对 benchmark 第一名更重要的问题。定价总体数据分析场景对比对象Sonnet 5.5 的结果推导出的成本变化单位预算效率典型工作负载Sonnet 5单任务成本最高低 30%-30%最高 42.9%Terminal-Bench 4.0Sonnet 5 最佳结果更高性能成本 1/10 -90%10×CursorBench 4.0Sonnet 5 最佳结果更高性能成本 1/10 -90%10×AA-BriefcaseSonnet 5 最佳结果更高性能成本约 1/9约 -88.9%约 9×FrontierCode / HighSonnet 5 / High高约 10 个百分点成本约 1/15约 -93.3%约 15×FrontierCodeGPT-6 Sol 最佳结果近似性能成本约 1/5约 -80%约 5×这张表其实比 API 定价表更能说明 Sonnet 5.5 的意义。Token 单价没有发生革命性的变化真正发生变化的是完成单位工作的计算需求。Anthropic 官方发布中还披露了一些早期客户的实际测试结果。BalyasnyToken 消耗从 497k 降至 121kBalyasny Asset Management 在包含2,441 个金融任务的内部测试集上观察到Sonnet 5497k tokens / answer Sonnet 5.5121k tokens / answerToken 使用量下降(497 - 121) / 497 ≈ 75.7%即平均每个答案使用的 token 减少约 75.7%。反过来看497 / 121 ≈ 4.11Sonnet 5 使用的 token 数约是 Sonnet 5.5 的4.1 倍。如果两代模型输入/输出 token 的组成比例大致相似那么这种 token 缩减会直接转化为非常显著的推理成本下降。但这里需要注意官方没有公布输入、输出、cache token 的具体组成因此不能严谨地把“token 减少 75.7%”直接写成“API 费用减少 75.7%”。Box2.4× 更快同时减少 12% TokenBox 的内部测试显示Sonnet 5.5 相比此前模型速度达到2.4×总 token 使用量减少12%同时准确率提高如果这里的 2.4× 指吞吐速度则相同任务的执行时间约为1 / 2.4 ≈ 41.7%即理论上约减少 58.3% 的执行时间。而与此同时总 token 使用量还减少了 12%。这类结果尤其值得关注因为正常情况下增加推理速度可能会牺牲准确率而增加准确率又往往需要增加 reasoning token。这里则同时观察到了准确率 ↑ 速度 ↑ Token ↓Lovable工具调用减少约三分之一Lovable 在 coding eval 中观察到Tool calls 减少约1/3Shell runs 减少约1/2换算为比例Agent 操作相对 Sonnet 5 的变化Tool calls约 -33.3%Shell runs约 -50%这可能解释为什么 Sonnet 5.5 的 cost-per-task 改善幅度会远大于 token 单价本身。对于 Agent 而言成本并不仅来自语言模型生成还来自LLM inference Tool calls Shell execution Search API calls Retry Context accumulation如果模型在更早的步骤做出正确决策整个 trajectory 都会缩短。因此一个33% 的 tool-call reduction最终可能产生比 33% 更明显的端到端成本和延迟改善。参考资料Anthropic — Introducing Claude Sonnet 5.5Claude Platform — Claude Sonnet 5.5Anthropic — Claude Sonnet 5.5 System CardGitHub — Claude Sonnet 5.5 in GitHub Copilot