ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

小模型为何能胜过大模型?Ornith-1.5-35B-A3B端到端自我改进训练原理全解析

小模型为何能胜过大模型?Ornith-1.5-35B-A3B端到端自我改进训练原理全解析 小模型为何能胜过大模型Ornith-1.5-35B-A3B端到端自我改进训练原理全解析【免费下载链接】Ornith-1.5-35B-A3B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3BOrnith-1.5-35B-A3B 是一款 35B 总参数、每 token 仅激活约 3B 参数的 MoE 小模型。它最大的亮点不是参数规模而是一套端到端自我改进训练体系模型自己生成任务、自己搭建解题脚手架、自己产出解答再用强化学习闭环迭代最终在编程与智能体基准上全面超过更大、更密的模型。什么是 Ornith-1.5-35B-A3B一句话定位Ornith-1.5-35B-A3B 是面向编程与智能体Agentic场景的推理型 MoE 语言模型。命名中的A3B表示 Activated 3B——35B 总参数里每个 token 只激活约 3B 参数推理成本低bf16 权重约 70 GB2 张 80GB 显卡即可部署。它是 Ornith-1.5 家族的中型成员Ornith-1.0 基于 Qwen3.5 与 Gemma4 做了继续预训练、中期训练和后训练1.5 则把自我改进从脚手架与轨迹优化扩展到全链路联合优化。原生支持 256K 上下文配合 YaRN 扩展可达约 1M token内置视觉与视频模块也支持工具调用与推理链think块。架构细节可查阅模型配置config.json40 层隐藏层、每层 256 个专家、每 token 激活 8 个专家并采用线性注意力 全注意力交错布局每 4 层 1 次全注意力这也是它能兼顾长上下文与推理效率的关键。小模型胜过大模型的第一个秘密MoE 架构 传统稠密大模型每次前向都要动用全部参数而 MoE混合专家模型像一家大型医院——256 位专家坐诊但每个 token 只分诊给 8 位最对口的专家。特性Ornith-1.5-35B-A3B传统 35B 稠密模型总参数量约 35B约 35B每 token 激活参数约 3B全部 35B单 token 推理开销≈ 1/10100%256K 长上下文原生支持通常更贵配合每 4 层 1 个全注意力层、其余为线性注意力的混合结构见config.json中的layer_types模型在长文本上的注意力成本进一步下降。参数多不等于算得动激活少 注意力省就是小模型能打赢大模型的第一块基石。核心原理端到端自我改进训练闭环 这才是本文的重头戏。过去训练会用工具的智能体任务和评测脚手架基本靠人工设计人出题、人写评测脚本、模型负责做。Ornith-1.5 把这个闭环整体交给模型自己完成任务自生成Task Generation模型持续生成新的训练任务替代固定的人工题集。题库随模型能力自动扩容永远刚刚好难避免学完就过时。脚手架自搭建Scaffold Construction解题用的脚手架harness——如何调用工具、组织多步执行、验证结果——也由模型自己发现和优化而不是沿用人工写死的评测脚本。解答轨迹自优化Rollout Optimization模型在生成的任务上实际执行、产出完整解答轨迹轨迹质量作为强化学习的奖励信号。三者联合优化任务更难 → 逼出更好的解题策略 → 更好的策略反过来生成更有价值的任务。这是一个出题—解题—评分全自主的飞轮模型在整个过程中持续通过强化学习更新策略即官方所称从 Self-Scaffolding 走向 Self-Improvement。对新手来说可以这样理解传统训练是老师带着学生刷题自我改进训练是让学生自己当老师——自己出题、自己批卷、自己进步而模型在编程这类开放任务上的进步速度远快于静态题库能提供的上限。成绩单3B 激活参数 vs 更大模型 Ornith-1.5-35B-A3B 在全部编程与智能体基准上超过同尺寸竞品并在智能体编程上大幅领先 Gemma 4-31B、Muse Glimmer-30B 等稠密模型完整数据见 README.md 中的评测表格基准Ornith-1.5-35B-A3BQwen3.6-35B-A3BGemma-4-31B稠密SWE-bench Verified7973.452Terminal-Bench 2.167.852.542.1SWE-bench Pro59.649.535.7DeepSWE220—GPQA Diamond推理89.286.084.3几个值得注意的信号DeepSWE 上其他同尺寸模型几乎为 0它拿到 22——深度软件工程任务正是自我改进训练主攻的方向相比 1.0 版本SWE-bench Verified 75.6 → 79仅靠扩大自我改进闭环就带来明显提升甚至压过了参数多一个数量级的 Qwen3.5-397B 在多个智能体基准上的成绩——这回答了标题之问小模型靠每 token 更聪明的参数使用方式 更对口的自我改进训练取胜而不是单纯堆参数。如何快速上手 Ornith-1.5-35B-A3B 部署门槛并不高。以下是最小可用路径详细命令见 README.md准备 2 张 80GB 显卡安装 vLLM ≥ 0.19.1或 SGLang ≥ 0.5.9一条vllm serve ornith-ai/Ornith-1.5-35B-A3B命令起服务记得开启--enable-auto-tool-choice与--reasoning-parser qwen3工具调用会自动解析成 OpenAI 风格tool_calls推理链输出到reasoning_content字段任意 OpenAI 兼容客户端接入即可通用任务推荐temperature0.6, top_p0.95, top_k20见generation_config.json与 README 说明。作为智能体大脑它可直接对接 Ollama、OpenCode 等编程 CLI——ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF一行命令就能让本地终端 Agent 跑起来。模型权重按 16 个分片存放model-00001-of-00016.safetensors等分片索引在model.safetensors.index.json对话行为由chat_template.jinja定义复现官方评测时需按 README 提示调整模板以保证训练/推理一致。写在最后这套方法意味着什么 Ornith-1.5 给出的信号很明确下一代模型竞争的关键可能不是更大而是更会自我练习。当任务生成、脚手架构建、解答优化全部纳入同一强化学习闭环训练数据上限被彻底打开——静态数据集训练模型的上限是数据集自我改进训练模型的上限是它自己的想象力。对普通用户和开发者而言这意味着一台双卡工作站就能获得一个越用越懂你的编程智能体大脑对研究者而言Ornith-1.5 展示了从人工驱动到自主驱动的训练范式跃迁。Chirp Chirp! 【免费下载链接】Ornith-1.5-35B-A3B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表