Seed Evolving 深度测评:我用它造了一个 AI 出题工具 你好我是 Grant Liu独立开发者关注 AI 应用与效率工具。这篇文章是我用 Seed Evolving 做 AI 出题工具的真实测评所有数据都来自实际运行结果。先认识一下这个模型有人可能还不知道它。Seed-Evolving豆包的一张「模型卡片」永远在更新。它面向 Coding 与 Agent 场景多模态输入文本/图片/视频、深度思考、GUI Agent、视觉理解能做复杂任务编排、长程规划、代码生成和工具调用。一个 Model IDdoubao-seed-evolving到底升级自动生效不用管版本。8 月 3 日它做了第二次升级方向很明确Coding复杂仓库修复、跨文件修改、真实功能开发、长程任务执行更稳定Agent信息检索、缺失信息召回、搜索结果整合更好多工具并行调用更稳幻觉搜索幻觉、工具调用幻觉、抗误导、状态幻觉都明显改善接入也不麻烦。我直接买了火山的Agent Plan订阅来测一个订阅包覆盖了 Seed 系列加 GLM、MiniMax、DeepSeek、Kimi 这些国内主流模型可按需自由切换也可以开 Auto 模式让系统自动调度。文章里的所有实测都是在这个订阅下跑的。官方介绍写得很满。但深度测评不能只信官方于是我给自己出了道题怎么才能真的测出这三条到底行不行。从怎么测想到教育场景一开始没什么好办法。跑分榜单是别人测的参数对比是纸面的我要的是真实场景里的真实表现。后来想明白一个逻辑读取文档然后根据文档找资料。这是 Agent 最常见的干活方式也是最容易露馅的方式。顺着这个思路我想到一个项目EXAM-FORGE本地优先的 AI 出题工具。完整流程长这样导入教材 PDF → 四级目录提取 Chroma 向量索引Agent 检索 → 按题型/难度配比生成数学试卷Coding 工程 → 三层验证 失败自动修复幻觉控制 → 输出学生版/教师版/验证报告选教育场景不是随手挑的。做之前我在 GitHub 上翻了一圈AI 出题器不算少隔三差五就有人发一个新的Hacker News 上也时不时能看到同类项目。大家都在做说明这个需求是真的。但翻下来有个发现都在做生成没有一家做验证。AI 出题最大的问题从来不是出不出得来而是出的题答案敢不敢信。网上甚至有人专门发帖问如何保障 AI 生成试卷的内容准确性。所以我想做点不一样的让 AI 出题然后让代码验证它。AI 出题是幻觉控制最难的一类考场。为什么难具体来说数学没有差不多答案对就是对、错就是错幻觉零容忍编错题是模型的舒适区编一道看起来对的错题恰恰是它最擅长的幻觉能量化对错能用代码验证SymPy 符号等价幻觉第一次有了能测量的数字跑分测不出幻觉。把模型扔进教育场景错一题就是误人子弟。这里是幻觉最容易现形的地方。认识一下 EXAM-FORGE讲测评之前先让你知道我在测什么。EXAM-FORGE 是一个本地优先的 AI 出题锻造器。导入本地教材 PDF它自己学习目录和内容按需生成数学试卷并且用沙箱执行验证代码加 SymPy 符号校验给每道题一个可信的答案验证。三种使用方式方式命令适用场景Web UI默认exam-forge教材管理、可视化出题、试卷预览与历史终端 TUIexam-forge tui纯命令行环境的图形化操作命令行 CLIexam-forge generate ...脚本化、批量出题核心流程添加教材(PDF) → 学习教材(解析/分块/索引/目录) → 选择范围与配比 → 生成并验证 → 预览/下载/历史它主要做这几件事教材可以来自本地路径、HTTP 链接、GitHub 仓库简写或网页上传。进来之后 PyMuPDF 抽文本按章/节/段落切块并带页码建 Chroma 本地向量索引再做四级目录提取。出题时支持计算/填空/选择/开放四种题型open 应用题基础/中等/提高三档难度easy/medium/hard配比自动归一化。生成后走三层验证错题带精确错误信息回传模型自动修复最多修 3 次。每次生成留一个唯一 ID 入库随时切换、预览、删除。教材、解析、索引、历史全在本机不上传任何第三方服务。这个工具把模型出题这个高幻觉动作和代码验证这个零容忍动作绑在一起天生就是幻觉控制的压力测试场。怎么测先定四条规矩深度测评最怕凭感觉。我先给自己定了四条规矩选场景、设验证、定指标、建工程一条都不能少。选场景AI 出题幻觉高发又能量化设验证三层验证沙箱执行、SymPy 符号等价、LLM-as-judge、RAG 溯源定指标一次通过率、修复轮次、状态标签分布、置信度吻合率建工程71 项自动化测试兜底跑分看上限这个看底线。实测一幻觉控制看试卷的真实记录先看三层验证是怎么搭的① 沙箱执行AST 拦截危险调用 CPU/内存限制 SymPy 符号等价 → 答案对不对代码跑一遍就知道 ② LLM-as-judge开放题/证明题逻辑评审 → 标注置信度不假装已验证 ③ RAG 教材溯源章节/印刷页码 → 每个知识点都能回到教材第几页实际生成的试卷验证报告长这样真实产物我最想说的是第 1 题那个尝试 2 次。第一次生成的验证代码跑出来和答案对不上它带着精确的错误信息回传模型自动修复后第二次通过。这就是失败自动修复循环最多重试 3 次每次把stderr原样回传。开放题它也守规矩。逻辑评审通过就标已检查待复核“不承诺 100% 正确验证没通过就标✗”不删题、不掩盖。幻觉控制的真相不是模型自觉是工程强制验证。实测二Coding 工程看生成过程的全记录从零搭这个工具的过程就是 Coding 工程能力最诚实的展示。我挑了生成过程里几段最典型的片段。先说开发工具。这次 Vibe Coding 用的是Trae Work先切到 Work 模式让它输出方案分析报告对本地优先的 AI 出题锻造器从产品定位、技术架构、验证闭环、资源依赖、市场格局与落地路径六个维度做独立评审识别关键风险并给出可执行的修订建议。方案定了再切到 Code 模式开始开发。有意思的是这个工具不是一次成型是被用出来的。最开始只是个命令行 CLI用了几次发现不方便。我就在对话里提了一句能不能做成类似 opencode 那种终端界面的工具Trae Work 直接给了方案于是有了 TUI 版本。到这里工具已经有 CLI 和 TUI 两种用法了。但 TUI 用着用着问题又来了界面不够美观数学公式渲染也不对。那就继续提需求最终迭代成了现在的 Web UI教材库、出题参数、试卷预览一个页面全搞定。从 CLI 到 TUI 再到 Web UI三轮演进没有一次是我把代码写好了让它改全是它根据我的使用反馈自己迭代。这大概就是 Coding 工程能力在真实项目里的样子。还有一件让我印象深的事。开发到后期我让它整体复查一遍自己的代码它真的找出了问题章节目录提取在某些教材上会失败数学公式在特定写法下渲染错乱。它先是定位根因然后给出修复方案改完再回归验证。全程不需要我告诉它哪里有问题它自己把代码从头到尾过了一遍把坑填了。项目落地的时候71 项 pytest 测试全部通过是这个过程最后的质量证明。实测三Agent 检索教材变成知识库出题不能瞎出得从教材里来。这部分考验 Agent 检索四级目录提取Markdown 标题、PDF 书签、LLM 解析目录页、文本启发式层层兜底Chroma 本地向量索引教材内容切块建索引按章节或关键词范围检索RAG 溯源每个知识点都能回到教材的章节和印刷页码PDF 页码和印刷页码的偏移还能自动估算换算它记得每个知识点来自教材哪一章哪一页页码还能自动换算。Agent 检索的实战形态大概就是这样。量化汇总能力指标结果幻觉控制出题一次通过率2 份试卷全部 ✓10 题卷全过修复循环错误回传自动修复最多 3 次诚实标注○/△/✗ 不掩盖Coding 工程测试通过率71/71100%产品规模20 个模块 / 三端界面自我审计复查自己代码修复目录提取与公式渲染 BugAgent 检索目录提取四级策略兜底RAG 溯源知识点 → 章节/印刷页码结论幻觉控制的终极形态不是模型自觉是工程强制验证。我不信 AI 说的话我信代码跑出来的结果。这套思路可以复制到任何AI 输出必须可信的场景合同审核、医疗建议、财务数据。给 AI 的每个结论配一个验证器比相信它这次不会错可靠得多。8 月 3 日的升级不是虚的幻觉控制确实改善了。但真正让我放心的是验证闭环本身。而且这个思路越来越重要。最近 Agent 相关的工具迭代明显变快Claude Code 开始默认自动模式各种 Agent 浏览器、自动化 Agent 陆续出来。当 AI 从聊天变成干活输出的可信度就不再是加分项而是底线。谁先把验证做进流程里谁就先拿到这张入场券。结尾项目已开源github.com/chnjames/exam-forge本地安装即可用pipinstall-e.exportARK_API_KEY*** exam-forge# 启动 Web UI也可在界面里操作# 命令行批量出题先添加教材再学习再生成exam-forge libraryadd./教材.pdf--title七年级数学exam-forge learn1exam-forge generate1-n10--scope第一章 有理数家长、老师本地教材定制化试卷答案可验证开发者三层验证加沙箱安全是AI 输出必须可信的参考实现Agent 玩家检索、生成、验证、修复是一条可复用的流水线这套测评方法本身也可复用任何AI 生成但必须可信的场景都能用场景选择 验证设计 指标量化这个框架。