ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

FSR-Bench 榜单更新:Qwen3.8-Max 开工具配置位列第 5,双配置均进入前十

FSR-Bench 榜单更新:Qwen3.8-Max 开工具配置位列第 5,双配置均进入前十 评测背景随着大模型逐步具备联网搜索、代码执行等能力科学推理评测所考查的对象也开始从单一模型扩展到模型与工具组成的完整系统。模型不仅要理解问题还要判断何时检索资料、如何筛选证据以及怎样将工具返回的信息转化为可靠结论。前沿科学推理评测集Frontier Scientific Reasoning Benchmark简称 FSR-Bench正是围绕这一变化构建的高难度评测基准。它包含 867 道题覆盖化学、医疗、地理、天文、数学、物理、生物和金融 8 个学科其中纯文本题 425 道、多模态题 442 道。每道题分别在开启原生工具和不开启原生工具两种配置下评测并同时考察作答过程与最终答案。本次更新聚焦 Qwen3.8-Max 在 FSR-Bench 中的最新表现重点观察其在榜单中的相对位置以及过程分、题型和工具配置等不同维度下的表现。榜单概览本期结果显示Qwen3.8-Max 在 FSR-Bench 的两套配置中均进入前十。开启原生工具的 Qwen3.8-Maxw.Tool以 50.61 分位列第 5未开启工具时以 38.35 分位列第 8。注主榜将开启工具与不开启工具的配置放在同一张榜单中开启工具的模型以“w.Tool”标识同一模型的两种配置会被视为两个独立条目下表仅展示前 20 名。点击访问晓天衡宇评测社区查看完整榜单、排行榜规则、评测集详情、详细得分榜单。评测设计与方法FSR-BenchFrontier Scientific Reasoning Benchmark包含 867 道前沿科学问题覆盖化学、医疗、地理、天文、数学、物理、生物和金融 8 个学科其中纯文本题 425 道、多模态题 442 道。评测分别在不开原生工具和开启原生工具两种配置下进行两种配置合并在同一榜单开启工具的模型以 w.Tool 标识。由于各模型使用自身实际可用的原生工具体系该结果用于观察不同完整系统配置下的科学问题求解表现而非比较统一工具条件下的模型能力。FSR-Bench 对每道题的作答过程和最终结果分别评分均采用 100 分制其中过程分关注推理过程的完整性与合理性结果分关注最终答案的准确性及任务完成情况。每道题由 Qwen3.7-Max、GPT-5.6 Luna 和 Claude Sonnet 5 三个裁判模型独立评分最终取平均值。主榜按“所有题 · 结果分”排序过程分、纯文本题及开/不开工具等指标作为分项观察口径。详细评测规则、输入输出格式及判分标准请前往晓天衡宇垂直领域评测榜单查看。分析与结论Qwen3.8-Max 进入榜单前列与领先模型差距已缩小从“所有题·结果分”看Qwen3.8-Maxw.Tool以 50.61 分位列主榜第 5。与排名第 4 的 GPT-5.6 Sol (medium) 相差 7.59 分略高于第 6 名 Claude Fable 5w.Tool的 49.97 分领先 0.64 分。从 Qwen 系列内部看提升更加明显Qwen3.8-Maxw.Tool比 Qwen3.7-Plusw.Tool高 12.18 分也比 Qwen3.6-Plusw.Tool高 29.21 分。整体来看Qwen3.8-Max 在本期综合科学推理评测中已经进入榜单前列而不只是停留在中部梯队。纯文本科学推理表现更突出推理过程质量值得关注从细分成绩来看Qwen3.8-Maxw.Tool在纯文本题上的结果分达到 66.65过程分达到 74.93展现出较强的纯文本科学推理能力在以知识理解、问题拆解和逻辑推演为主的科学问题中Qwen3.8-Max 能够形成质量较高的分析与推理过程。在所有题中Qwen3.8-Maxw.Tool的过程分为 61.89同样高于 50.61 的结果分。过程分较高说明 Qwen3.8-Max 的表现不仅体现在最终作答结果上也体现在知识调用、证据组织和推理展开等解题环节为处理复杂科学问题提供了较为扎实的过程基础。不同工具配置下均保持较好表现原生工具进一步提升成绩Qwen3.8-Max 在两种配置下均进入榜单前十。未开启工具时得分为 38.35 分排名第 8开启原生工具后提升至 50.61 分排名升至第 5。即使未开启工具Qwen3.8-Max 仍保持在榜单前列在此基础上原生工具配置进一步提升了它的科学问题求解表现。由于 FSR-Bench 并非统一工具条件下的严格控制实验不同模型实际可使用的原生工具体系存在差异。因此这里的 12.26 分更适合用于描述 Qwen3.8-Max 两套完整系统配置之间的表现变化而不应直接解释成工具本身带来的净能力提升。综合判断Qwen3.8-Max 在本期综合科学推理评测中表现较为突出两种工具配置均进入榜单前十开启工具后进一步进入前五同时过程分也呈现出较好的表现。本次评测更值得关注的是 Qwen3.8-Max 的能力结构能够形成完整的科学问题分析过程并在原生工具参与下进一步提升整体表现。与此同时过程分与结果分、纯文本与多模态题之间仍存在一定差异说明模型在不同信息形态和任务环节中的表现并不完全一致。这些差异也为进一步观察模型的科学推理能力提供了更多维度。总体来看Qwen3.8-Max 已经展现出较强的综合科学问题求解能力尤其是在知识密集型任务和工具协同场景下表现突出而如何进一步缩小过程与结果、文本与多模态之间的差距将是其后续能力提升的重要方向。注本文结论基于晓天衡宇本期评测体系与样本反映模型在该评测框架下的相对表现不代表所有业务场景中的绝对优劣。写在最后最新垂类领域模型评测榜单已同步上线至晓天衡宇评测社区官网欢迎访问查看更详细的评测数据关注晓天衡宇•评测社区官方账号获取更多大模型相关知识~
返回列表