ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

ClinConsensus 中文医疗榜单发布:GPT-5.2 居首,跨过门槛只是第一步

ClinConsensus 中文医疗榜单发布:GPT-5.2 居首,跨过门槛只是第一步 评测背景大模型在健康科普、用药咨询等场景已经能给出像模像样的回答但面对真实的复杂病例模型究竟是在输出流畅的通用文本还是真的能完成安全、完整且临床合理的诊疗建议中文医疗场景正适合检验这种能力——诊断推理、治疗方案、随访管理环环相扣任何一处遗漏或不当表述都可能影响回答的临床可用性。ClinConsensus 是为检验这类能力而构建的大模型评测基准聚焦复杂临床问答、诊断推理、治疗建议与随访管理等关键能力。它以真实脱敏临床案例为题将评测重点从“回答是否合理”推进到“回答是否逐条满足临床要求”旨在检验模型在真实复杂医疗场景中的决策稳定性与输出合规性探索真实临床使用价值。本次晓天衡宇中文医疗榜单覆盖 11 款国内外主流大模型。每款模型都完成同一套 2500 个真实病例每个案例配有专家预先设定的 30 条评分准则从安全性与可执行性、临床合理性与完整性、沟通质量三个维度对回答提出要求以考查大模型在真实临床语境下的综合表现。榜单概览点击访问晓天衡宇评测社区查看完整榜单、排行榜规则、评测集详情、详细得分榜单。核心结论结论 1GPT-5.2 独自领先所有模型均未达到 33 分本期榜单中GPT-5.2 以 32.90 分位居第一领先第二名 Baichuan M3 5.08 分但整体分数仍处于低位。11 款参评模型平均分 24.14榜尾模型Grok 4.1 Fast 仅 17.76 分。结论 2榜单中部得分高度相近尾部断层清晰榜单中部呈现高度密集的格局第二梯队 Baichuan M3、Claude Opus 4.6、Qwen3.5 Plus 等三款模型排第二至第四名得分集中在 26.68—27.82 分其中 Claude Opus 4.6 与 Qwen3.5 Plus 仅差 0.18 分。排名第六的 Qwen3-Max 与排名第七的 DeepSeek V3.2 更是只差 0.04 分在这一区间内小数点层面的差异不具实质区分意义。与之对照的是榜尾明显断层第十名 20.05 分与第十一名 17.76 分差 2.29 分提示尾部模型与中部梯队之间存在明显差距。结论 3模型差距集中在复杂案例覆盖深度才是分水岭通过逐题分布可看出模型间真正的能力差距集中在复杂案例上GPT-5.2 命中准则不足 10 条该题记 0 分的题目仅占 11.48%约每 9 题才有 1 题完全未达门槛而榜尾 Grok 4.1 Fast 的这一比例达 32.28%约每 3 题就有 1 题记 0 分。同时GPT-5.2 命中 20 条以上准则的高覆盖题目占 22.64%明显高于其余十款模型。头部与尾部模型的差距不在于常规案例能否达到基本覆盖而在于复杂案例中能否在医生校准阈值之上保持持续覆盖。评测设计晓天衡宇本次评测基于 ClinConsensus 。该评测集包含 2500 个中文开放式医疗案例覆盖 36 个医学专科、12 类任务主题、多档难度以及面向普通用户和医疗专业人员的不同对话场景。每个案例均配有 30 条病例特定的评分准则整套评测共包含 75000 个评分判断点。采用 GPT-5.1 strict judge 作为主评分器对模型回答逐条给出命中判定再汇总计分。评测维度本评测采用基于专家 Rubric 的开放式问答判分方式每个案例的 30 条准则归入以下五个维度组十二类任务主题评测集覆盖的十二类任务主题按主榜单分项归为 4 大类另有医疗随访 1 类从任务分布看本评测集更强调真实临床使用价值其中“个性化方案生成”、“鉴别诊断”、“病历内容理解”等高价值任务占比较高能够较好反映模型在复杂医疗决策场景下的能力上限与短板。复杂度分层数据集按复杂度划分为三个等级以支持分层评测构建过程还采用两阶段质量控制以保证数据质量评测方法样本依据临床任务与专科跨度划分为 L1—L3 三级复杂度评分采用论文主指标 CACS10Clinician-Anchored Coverage Score阈值 k10每题命中少于 10 条 rubric 记 0 分达到 10 条后每多命中一条增加约 4.76 分。通过单例 30 条专家准则的全量覆盖严格量化模型在真实复杂医疗场景中的决策稳定性与输出合规性。Rubrics 总体命中率作为辅助参考指标不参与排名。整体评测流程包括三层样本构建与质控、评估标准设计、逐条判定与计分。第一层样本构建与质控样本由中国临床专家团队根据真实病例或临床经验构建并经过去标识化处理以保证医学真实性和场景复杂性。构建过程采用两阶段质量控制首先利用多个强模型筛除过于简单的案例其次由资深医生进行抽检审核确保案例内容、评估标准和参考答案的临床合理性与一致性。最终样本根据任务数量和涉及专科数量划分为 L1—L3 三级复杂度用于分层评测。第二层评估标准设计每个案例配有 30 条专家制定的评估标准整套评测累计 75000 个评分判断点覆盖安全性、完整性、临床合理性、可执行性、沟通质量五个维度。评测采用 GPT-5.1 strict judge 作为主评分器并使用经医生监督的 Qwen 3-8B judge 进行一致性、稳健性和本地部署验证来确保数据的准确性。第三层逐条判定与计分模型的回答逐条对照每个案例的 30 条标准每一条是否被满足都会被逐一判定再汇总计分。基准统计了 285 个医生的回答医生平均可满足 10 条准则因此把 10 条设为计分门槛模型在某一题上满足的准则少于 10 条该题目计 0 分达到 10 条后每多满足一条加约 4.76 分30 条全部满足记满分 100 分。榜单最终得分由模型在全部判定点上的评分结果汇总计算。分数越高表示模型回答整体满足专家准则的程度越高。详细评测规则与方法请前往晓天衡宇垂直领域评测榜单查看。分析与结论复杂医疗场景仍是大模型能力提升重点本次评测任务对模型的综合医疗推理能力提出了较高要求。除基础医学知识理解外评测还涉及病例信息分析、多步推理、医学文本理解以及高标准 rubric 对齐等能力。本次评测按照真实临床场景构建案例覆盖预防、治疗和长期管理三个医疗阶段并设置了面向普通用户和医疗专业人员的不同对话场景。评测结果显示多数模型在大部分案例上已经能够命中相当比例的专家准则给出基本可用的回答。但在复杂病例中实现深度、完整且稳定的准则覆盖仍是共性挑战。不同任务类型难度差异明显信息理解能力成为关键挑战根据 ClinConsensus 评测集的主题分类12 类任务主题呈现清晰的难度分化模型在常见疾病科普、病情跟踪随访、鉴别诊断、个性化方案生成等任务上相对更容易取得较高表现医学命名实体识别、临床文档摘要生成、医学信息抽取等任务则更具挑战性。这表明医疗大模型的能力提升不仅依赖知识覆盖更取决于复杂场景下的信息理解、组织与推理能力。尤其在长病历理解、复杂案例结构化组织及高标准要求下的稳定输出方面模型仍有进一步提升空间。综合判断本次评测结果表明当前大模型在中文医疗场景下已具备一定案例回答能力但整体覆盖深度仍然有限11 款参评模型中没有模型达到 33 分平均分仅 24.14。模型间差异主要体现在复杂案例处理能力上部分模型能够完成基础信息理解和部分准则覆盖但在高要求场景下持续保持完整、准确的回答仍存在挑战。从临床应用视角看跨过基础回答门槛只是第一步如何提升复杂病例中的高合规、高覆盖和稳定输出能力仍是医疗大模型进一步发展的关键方向。注本文结论基于晓天衡宇本期评测体系与样本反映模型在该评测框架下的相对表现不代表所有业务场景中的绝对优劣。写在最后最新垂类领域模型评测榜单已同步上线至晓天衡宇评测社区官网欢迎访问查看更详细的评测数据关注晓天衡宇•评测社区官方账号获取更多大模型相关知识~
返回列表