ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Qwen3-Coder 评测集解读:DevQualityEval v0.5.0 对 RWKV-5 World 3B 的测试生成能力评估报告

Qwen3-Coder 评测集解读:DevQualityEval v0.5.0 对 RWKV-5 World 3B 的测试生成能力评估报告 Qwen3-Coder 评测集解读DevQualityEval v0.5.0 对 RWKV-5 World 3B 的测试生成能力评估报告【免费下载链接】Qwen3-CoderQwen3-Coder is the code version of Qwen3, the large language model series developed by Qwen team.项目地址: https://gitcode.com/GitHub_Trending/co/Qwen3-Coder本篇围绕 Qwen3-Coder 仓库中收录的单模型评测报告 README 展开它是 DevQualityEval 基准 v0.5.0 对openrouter/rwkv/rwkv-5-world-3b的完整评估结果。读完本文你可以掌握该报告的七级结果分类体系、每个指标的计分含义并能够结合仓库内的 CSV 数据与基准框架源码独立复现和解读同类模型评估报告。报告定位与文件结构该报告由 DevQualityEval benchmarksymflower 出品的 LLM 代码生成质量评估框架在2024-06-19 11:29:39生成基准版本为version 0.5.0。DevQualityEval 的定位是为 LLM 开发者提供一套标准化基准来改进真实的软件开发场景能力同时为 LLM 用户提供可比较的指标来判断某个模型是否适用于自己的任务完整说明见 DevQualityEval README。报告目录docs/reports/v0.5.0/rwkv-5-world-3b/下包含以下产物文件文件作用README.md报告主体给出结果分类定义与模型归类categories.svg将所有被评估模型按类别归类的柱状图evaluation.csv逐任务语言 × 仓库 × 任务的完整打分明细golang-summed.csv / java-summed.csv按语言汇总的得分models-summed.csv按模型汇总的最终得分同一批次的 v0.5.0 全量对比数据覆盖 GPT-4、Claude、DeepSeek-Coder、Qwen 系列等数十个模型的 evaluation.csv、golang-summed.csv 与 java-summed.csv位于上一级目录可用于横向对照。七级结果分类体系报告将每个模型归入以下类别之一这是解读任何一份 DevQualityEval 单模型报告的核心框架category unknown模型无法被归入其他类别response error模型在推理时遇到了错误no code模型输出中没有产生代码invalid code模型产生了无效代码无法通过编译等验证executable code模型产生了可执行的代码statement coverage reached模型产生的代码达到了全量语句覆盖no excess response模型的响应没有超出任务要求的内容。分类并非单维度的“达标/不达标”而是从“响应是否成功 → 是否含代码 → 代码是否有效 → 是否可执行 → 是否达到覆盖”逐层递进同时叠加“响应是否有冗余”这一正交维度。分类逻辑在框架源码evaluate/metrics/目录下实现对应 category.go 与 assessment.go。RWKV-5 World 3B 的实测数据该模型被 OpenRouter 提供openrouter/rwkv/rwkv-5-world-3b参与 v0.5.0 评测的任务共 2 组golang / golang/plain / write-tests与java / java/plain / write-tests即分别为 Go 和 Java 的示例仓库生成单元测试。逐任务明细如下来自 evaluation.csv语言仓库任务得分覆盖率执行文件数被测文件字符数处理耗时响应字符数无错误无冗余含代码golanggolang/plainwrite-tests150051819347582555javajava/plainwrite-tests15001190328351260555两个语言各自汇总golang-summed.csv、java-summed.csv均为15 分模型总分models-summed.csv为30 分。为什么落在 category unknown 类别结合计分规则可以还原这份数据的含义每个任务中response-no-error、response-with-code、response-no-excess各得 5 分每个用例 1共 5 个用例合计 15 分但coverage与files-executed均为 0说明模型生成的测试没有一次通过编译/执行更谈不上达到语句覆盖。从 DevQualityEval README 的计分规则看statement-coverage-reached每个达成覆盖的覆盖对象 10 分与compiled相关的得分是模型进入 invalid code / executable code / statement coverage reached 这些更高级类别的依据。而该模型的行为特征是响应全部无错误、全部包含代码、全部无冗余却没有任何可执行结果——既不完全符合 “no code / invalid code” 的判定边界又没有可执行的代码因此报告将其归入category unknown无法归入其他类别。可以推断分类器要求“代码无效”与“响应无代码”等条件之间做互斥判定该模型卡在“有代码但从未通过执行验证”的灰色地带最终落入兜底类别。作为对照同批次的 GPT-4 在该基准上得到 18198 分240 个任务无错误、191 个任务无冗余、207 个文件被执行、覆盖 17320两者差距直观体现了 v0.5.0 基准对不同规模模型代码生成能力的区分度。DevQualityEval 的计分规则v0.5.0理解单模型报告离不开基准本身的奖励点体系。README 明确了当前版本的计分方式response-no-error响应未遇到错误1response-not-empty响应非空1response-with-code响应中包含源码1compiled源码成功编译1statement-coverage-reached每个被执行代码的覆盖对象10对transpile和code-repair任务禁用防止模型随意添加语句刷分no-excess响应没有超出要求的内容1passing-tests每个通过的测试10对write-tests任务禁用防止模型随意添加测试用例刷分。这套“过程分 结果分”的混合设计正是 RWKV-5 World 3B 只拿到“过程分”15 分/语言而拿不到任何“结果分”的原因。任务实现位于evaluate/task/目录测试生成任务见 task-write-test.go。基准的评估流程与任务定义DevQualityEval 回答两个问题哪些 LLM 能完成软件开发任务其结果质量如何其设计要点是多语言任务每个任务task是抽象挑战例如“为给定函数写单元测试”每个任务下有多个具体用例candidate来自真实仓库样例测试生成任务write-tests这是本报告的评测任务。基准要求模型为示例源码生成测试套件把响应存为文件后与原代码一起执行。之所以选测试生成是因为它易于自动判定正确性——必须能编译且提供 100% 语句覆盖能写出这样的测试意味着模型真正理解了源码因此隐含评估了模型的语言理解能力。v0.5.0 支持的用例包括 Javajava/plain、java/light、Gogolang/plain、golang/light与 Rubyruby/plain、ruby/light代码修复code-repair与转译transpile分别针对带编译错误的源码修复、以及跨语言转译均有独立的mistakes、transpile测试仓库。以 README 中的 Go 用例为例发给模型的提示词形如“给定 Go 文件 plain.go包名 plain请为该代码提供测试文件。测试必须达到 100% 代码覆盖且必须能编译响应只能包含测试代码。”随后基准通过symflower test --language golang --workspace ...在临时工作区执行生成的测试并采集覆盖。如何复现该评测以下命令均可在qwencoder-eval/instruct/eval-dev-quality/目录下执行完整参数可通过eval-dev-quality --help与eval-dev-quality evaluate --help查看。1. 安装需要 Git 与 Go 环境git clone https://github.com/symflower/eval-dev-quality.git cd eval-dev-quality go install -v github.com/symflower/eval-dev-quality/cmd/eval-dev-quality2. 配置推理提供商。本报告的模型经 OpenRouter 提供需将 key 保存为环境变量export PROVIDER_TOKENopenrouter:${your-key}框架同时支持 Ollamaollama/前缀默认监听 11434 端口与任何符合 OpenAI chat completion API 的自定义端点--urlscustom-${name}:${endpoint-url}加同名 token。3. 仅评估 RWKV-5 World 3B 单个模型--model可重复使用eval-dev-quality evaluate --modelopenrouter/rwkv/rwkv-5-world-3b4. 安全运行提醒基准默认不在沙箱中执行模型生成的代码务必在隔离环境中运行例如启用 Docker 运行时eval-dev-quality evaluate --runtime docker --model openrouter/rwkv/rwkv-5-world-3bDocker 镜像可用docker build . -t eval-dev-quality:dev本地构建或拉取ghcr.io/symflower/eval-dev-quality:main容器化运行时下--configuration暂不支持传入--testdata的路径存在性检查只在容器内强制。Kubernetes 部署方式见 docs/kubernetes/README.md。执行完成后结果写入evaluation.csv并生成含分类图与逐模型链接的REPORT.md报告报告渲染实现见 markdown.go、csv.go——本仓库docs/reports/v0.5.0/下按模型名归档的目录正是这一流程的批量产物。结果解读的注意事项报告原文特别提示LLM 是非确定性的结果只反映当前快照同模型多次运行分数会有波动。此外README 也指出选择“最佳”模型取决于算力、云推理单价、权重开放程度等因素不存在放之四海皆准的赢家。因此将本报告用于选型时建议以models-summed.csv的总分为主指标同时查看coverage、files-executed等质量维度而非仅看response-no-error等过程分结合 v0.5.0 全量批次数据docs/reports/v0.5.0/evaluation.csv做横向对比关注“category unknown”类模型如本例 RWKV-5 World 3B时需意识到其得分主要来自过程性指标代码有效性证据编译、覆盖为零。延伸阅读单模型报告rwkv-5-world-3b/README.md基准总览与安装运行eval-dev-quality/README.md指标与分类实现evaluate/metrics/任务实现evaluate/task/报告生成evaluate/report/同批次全量结果docs/reports/v0.5.0/【免费下载链接】Qwen3-CoderQwen3-Coder is the code version of Qwen3, the large language model series developed by Qwen team.项目地址: https://gitcode.com/GitHub_Trending/co/Qwen3-Coder创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表