ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

晓天衡宇亮相 2026 云栖大会:迈向更可信的高质量评测

晓天衡宇亮相 2026 云栖大会:迈向更可信的高质量评测 当前大模型正加速进入真实应用场景。伴随模型能力提升模型评测也面临新的挑战部分高难度评测集存在题目或答案错误的情况。同时一些评测集上模型表现逐渐趋于稳定前沿模型能力差异难以得到有效区分。而长期固定的评测题目一旦被纳入训练数据模型取得高分也并不能准确反映其实际能力评测结果可能因此失真。行业需要的是更准确、更可信且能够持续区分模型能力的高质量评测基准。围绕这一挑战晓天衡宇亮相 2026 云栖大会分享了对“什么是好评测”的思考以及评测基准、裁判模型、真实任务评测及开放评测社区等实践成果。评模型之前也要评评测什么样的评测才是好评测晓天衡宇认为好评测要能准确、稳定、诚实地验证模型在真实任务中的能力。这意味着评测不能只停留在选择题和单轮问答更要走向真实任务交付在具体环境中考量模型的实际表现还应将任务耗时、成本和用户体验纳入考量。同时评分应尽可能做到可验证、可复现针对不同评测任务应在自动验证的基础上结合 Agent 裁判与人工复核减少主观判断带来的偏差。评测本身也需要经得起检验题目、答案和评分规则需持续复核主动识别数据污染与评测噪声等问题。评测还需要保持对前沿模型的区分能力避免评测结果饱和。基于上述关于好评测的思考晓天衡宇从两个层面展开探索一方面建立衡量评测集的可量化框架另一方面则通过对具体评测集的复核与修订将这些准则落实到实践中。在量化框架层面晓天衡宇提出评测集健康度Benchmark Health Index从能力区分度、抗饱和度与影响力三个维度对大模型评测基准进行量化分析衡量其分辨效力、结构耐久性和生态采纳度。在评测集可靠性层面晓天衡宇推出了 HLE-Verified 自建评测集对高难度、跨学科评测基准“Humanitys Last Exam”进行系统化复核先通过多模型诊断性求解定位疑似问题再由领域专家独立修订最后通过多模型交叉验证复核从而减少题目与参考答案错误对评测结果造成的干扰。评测结果显示纠错后多款模型得分平均提升 7-10 个百分点相关成果已被 Google、ByteDance 等多家模型厂商引用。截至目前晓天衡宇已构建 30 余个评测集形成 11 篇相关论文持续验证并完善评测方法。好评测更需要好裁判高质量的评测不仅要解决怎么测还要解决怎么判。文生图、图像编辑、语音合成、多步推理等开放式任务往往难以通过标准答案或固定规则验证而人工评审还面临成本高、周期长、主观判断存在偏差等问题。为此晓天衡宇上线了开源裁判模型矩阵为多类评测任务提供专业、开放的评测工具。在图像生成与编辑场景中SkyJM-Gen 和 SkyJM-Edit 两款生成式裁判模型可根据每条具体指令动态生成评分 Rubric分别从生成质量、指令对齐和内容保留等维度进行判断。文生图裁判模型 Q-Judger 则面向真实创作场景在画面质量、美学与图文对齐之外进一步加入真实世界还原与创意生成评判维度并通过 56 项细粒度标准自动诊断模型生成能力。其整体排序与人工专家判断高度一致。面向复杂推理任务全局视角过程奖励模型 GPRM-4B 则融合了细粒度评估与全局洞察力在判断单个步骤时同时考察历史过程、后续步骤和任务目标从而减少脱离完整推理链路进行孤立评分的情况。从动态评分标准、细粒度诊断到全局过程建模晓天衡宇不断提升自动评测工具在复杂任务中的判断力更有效地衡量模型表现。WorkEval衡量 Agent 真实工作能力当 Agent 走进职场有效的评测需要体系化回答一个关键问题它们是否真的能将一项工作做好而不仅仅是做完。WorkEval 正是晓天衡宇面向模型实际落地价值的一次具体实践。评测覆盖中国职场 29 个职业共 290 个真实任务。该评测基于自研 NAV 净可采用值衡量 Agent 的交付结果也将完成任务所需时间、资源与成本等效率指标纳入考虑观察 Agent 能否真正完成一项工作。评测结果显示更高的资源消耗并不必然带来更好的任务结果。评判 Agent 实际应用价值时比起单纯比较分数更值得关注的是模型与运行环境的组合、完成任务的效率以及负任务比例。晓天衡宇评测社区让评测结果更可感知专业的模型评测不能止步于榜单数字与模型名次更要成为理解模型能力、进行模型选型和应用决策的可靠依据。围绕这一目标晓天衡宇评测社区面向开发者、研究者及模型用户持续建设覆盖榜单、竞技场、评测集、评测工具与评测资讯的评测内容体系。榜单提供稳定、可比较的模型能力参照竞技场则将模型置于真实、开放的多样化动态任务中观察模型在不同场景下的实际表现评测集、评测工具与评测资讯补充了评测依据、方法与解读构成从结果到依据、从能力衡量到应用参考的完整价值链。晓天衡宇晓天衡宇评测社区海外版 skyeval.ai 也已正式上线进一步面向海外市场为全球用户提供模型评测与能力观察。结语从评测集质量的衡量与提升到评测方法与裁判工具的探索从真实任务中的模型能力验证到评测结果的应用转化晓天衡宇始终探索一个核心问题什么样的评测真正值得相信。未来晓天衡宇将持续完善评测基准、方法与应用体系为行业提供更加系统的模型能力参考与决策依据回应 AI 落地加速过程中不断涌现的新命题。【访问官网晓天衡宇评测社区】
返回列表