ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Ornith-1.5-35B-A3B 部署与 Agent 化使用完全指南:从 vLLM/SGLang 服务到 256K 长上下文与工具调用

Ornith-1.5-35B-A3B 部署与 Agent 化使用完全指南:从 vLLM/SGLang 服务到 256K 长上下文与工具调用 大模型基础模型本地部署代码模型【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF点击查看免费下载本篇技术指南以 HuggingFace 镜像仓库 Ornith-1.5-35B-A3B-GGUF 中的模型卡README为主体完整讲解 Ornith-1.5-35B-A3B 这个约 35B 参数、单 token 仅激活约 3B 参数的 MoE 推理模型的背景、基准表现、部署方式与 Agent 化使用方案。读完本文你将掌握用 vLLM / SGLang 搭建 OpenAI 兼容服务、开启 reasoningthink思维链与工具调用tool_call解析、通过 YaRN 将有效窗口从 262,144 扩展到约 100 万 token、用 Python SDK 调用 Chat Completions API以及把模型接入 Ollama、llama.cpp、OpenClaw、OpenCode 等主流 Agent 与编码工具的具体配置。一、模型概览从 Ornith-1.0 到 Ornith-1.5 的自我改进路线Ornith-1.5是 ornith-ai 团队在端到端自我改进end-to-end self-improvement方向上的一次重大迭代。其前身 Ornith-1.0 基于 Qwen3.5 与 Gemma4 继续预训练continued pretraining、中期训练mid-training与后期训练post-training而来。Ornith-1.5 在此基础上把自我改进闭环从脚手架scaffold与 rollout 优化扩展为联合优化任务生成task generation、脚手架构建scaffold construction与解决方案 rollout三个环节——模型不再依赖固定的人工标注任务集与手工设计的 harness而是持续生成新的训练任务、发现解决这些任务的有效策略并通过强化学习reinforcement learning改进策略本身。本仓库聚焦的是该家族中的中尺寸 MoE 成员Ornith-1.5-35B-A3B总参数量约 35B每 token 仅激活约 3B 参数A3B 即 Activated ~3BBF16 精度下权重约 70GB在编程coding与 Agent 相关基准上显著优于同量级 peer 模型 Qwen 3.6-35B并在 Agent 编程上大幅领先 Gemma 4-31B、Muse Glimmer-30B 等稠密dense模型是一个推理模型reasoning model默认情况下助手的回答会先输出think … /think思维链块再给出最终答案。仓库内容GGUF 量化文件一览本 GGUF 镜像仓库除 README.md 外提供了多个可直接用于 llama.cpp 生态的量化文件均为 Git LFS 管理的指针拉取后即为完整权重文件说明Ornith-1.5-35B-BF16.ggufBF16 全精度转换版LFS 指针显示体积约 71GBOrnith-1.5-35B-Q8_0.gguf8-bit 量化质量最接近 BF16Ornith-1.5-35B-Q6_K.gguf6-bit K 量化质量/体积平衡点Ornith-1.5-35B-Q5_K_M.gguf5-bit K 量化中等主流本地部署选择Ornith-1.5-35B-Q4_K_M.gguf4-bit K 量化中等体积最小、显存门槛最低mmproj-Ornith-1.5-35B-BF16.gguf多模态投影MMProj文件用于视觉多模态推理.gitattributes中还登记了Ornith-1.5-35B.imatrix.gguf重要性矩阵量化版说明该模型在 llama.cpp 生态下具有完整的量化支持。这些 GGUF 文件可以直接被下文 Agent 章节中的llama-server -hf、Ollama 等工具加载使用。二、基准表现编程 / 推理 / Agent 三维度对比README 中给出了 Ornith-1.5-35B-A3B 与 Ornith-1.0-35B-A3B、Qwen3.6-35B-A3B、Gemma-4-31B、Muse-Glimmer-30B、Qwen3.5-397B 的对比数据。Ornith-1.5 的结果为 5 次独立运行的平均值- 表示原模型卡未报告该指标。下表完整继承了原文档的 18 项评测结果基准Ornith-1.5-35B-A3BOrnith-1.0-35B-A3BQwen3.6-35B-A3BGemma-4-31BMuse-Glimmer-30BQwen3.5-397BCodingTerminal-Bench 2.1 (Terminus-2)67.864.252.542.151.753.5Terminal-Bench 2.1 (Claude Code)68.562.849.2--48.6SWE-bench Verified7975.673.4527676.4SWE-bench Pro59.650.449.535.751.251.6SWE-bench Multilingual71.469.367.251.7-69.3DeepSWE2200--1Frontier-Bench v0.15.11.41.4--1.4NL2Repo46.234.629.415.5-36.8SWE Atlas - QnA39.837.115.5--20.4ReasoningHLE (no tools)25.620.821.419.52228.7HLE (with tools)33.430.128.926.5-48.3GPQA Diamond89.286.28684.383.588.4AgenticMCP-Atlas70.264.462.85575.572.3Toolathlon-Verified48.742.441.740.8-38.3WideSearch67.863.460.154.2-74BrowseComp67.663.562--78.6ClawEval72.569.868.748.5-70.7关键结论基于模型卡数据在 Coding 全部 9 项与 Agentic 的 Toolathlon-Verified、ClawEval 上Ornith-1.5-35B-A3B 均为对比组中的最高分DeepSWE 上更是取得 22 分对 0/1 分的代差优势。Reasoning 中 GPQA Diamond 达到 89.2HLE 在无工具/带工具场景均超过 Qwen3.6-35B-A3B。需要说明的是Qwen3.5-397B 是远超 35B 量级的巨模型在 HLE、WideSearch、BrowseComp 等项目上仍然领先这属于量级差异而非同档竞争。评测设置与防作弊说明可复现前提模型卡对每项基准都给出了明确的评估配置这是复现数据的关键前提Terminal-Bench 2.1Terminus-2使用 Harbor/Terminus-2 框架parserjson、temperature1.0、top_p1.0、128K 上下文窗口每次运行 4 小时超时、32 CPU 核 48GB RAM5 次平均。需要把 Qwen 聊天模板调整为与训练一致并修改 Harbor 以对齐 vLLM 的reasoning_contentkeyTerminal-Bench 2.1Claude CodeClaude Code 2.1.126parserjson、temperature1.0、top_p1.0、max_new_tokens1310725 次平均同样需要修改 Qwen 聊天模板SWE-Bench Verified / Pro / MultilingualOpenHands harnesstemp1.0、top_p0.95、256K 上下文全程启用防作弊anti-hacking——移除本地仓库镜像的 Git 历史防止读取既有提交禁用网络访问防止模型检索外部资源DeepSWEClaude Code harnesstemperature1.0、top_p0.95、256K 上下文SWE Atlas QnAmini SWE agent harnesstemp1.0、top_p0.95、128K 上下文5 次平均NL2Repotemperature1.0、top_p1.0、400K 上下文、48K 输出屏蔽指定的 GitHub 仓库与 pip 包访问以防 reward hackingHLE以 Claude 4.6 Opus 作为裁判judge模型MCP-Atlas500 任务公开子集、thinking 模式、每任务 10 分钟超时以 Claude 4.8 Opus 为裁判Toolathlon-Verified官方评测服务token 上限 128KClawEval真实用户任务分布的 Agent 编程基准temp0.6、256K 上下文。三、快速开始运行环境与采样参数在部署前先确认运行环境满足模型卡要求的版本门槛并遵循推荐的采样配置运行时版本要求运行时最低版本Transformers≥ 5.8.1vLLM≥ 0.19.1SGLang≥ 0.5.9推荐采样参数通用任务temperature0.6、top_p0.95、top_k20复现模型卡基准temperature1.0评测环境即按此执行。关于推理模型的特别提示Ornith-1.5-35B-A3B 是 reasoning 模型默认会在最终答案前输出think … /think块。下文所有部署配方都会开启 reasoning parser把思维链单独放到reasoning_content字段返回同时开启工具调用 parser把模型的tool_call块解析成 OpenAI 风格的tool_calls字段。四、部署服务vLLM 与 SGLang 配方Ornith-1.5-35B-A3B 在 BF16 下约占用 70GB 权重模型卡建议在2× 80GB GPU上部署为 256K 上下文预留 KV cache 空间并按实际硬件调整--tensor-parallel-size/--tp。vLLMvllm serve ornith-ai/Ornith-1.5-35B-A3B \ --served-model-name Ornith-1.5-35B-A3B \ --host 0.0.0.0 --port 8000 \ --tensor-parallel-size 2 \ --max-model-len 262144 \ --gpu-memory-utilization 0.90 \ --enable-prefix-caching \ --enable-auto-tool-choice --tool-call-parser qwen3_xml \ --reasoning-parser qwen3 \ --trust-remote-code关键参数说明--tensor-parallel-size 22 卡张量并行显存足够的单卡/多卡环境需按实际调整--max-model-len 262144对齐模型的 262,144 token 原生上下文上限--gpu-memory-utilization 0.90为权重与 KV cache 预留 90% 显存--enable-prefix-caching开启前缀缓存多轮 Agent 对话可复用系统提示与工具定义前缀--tool-call-parser qwen3_xml把模型输出的tool_callXML 块解析为 OpenAI 风格tool_calls--reasoning-parser qwen3把think思维链解析到reasoning_content字段--trust-remote-code信任远端仓库的自定义代码与 Qwen 系模板兼容。SGLangpython -m sglang.launch_server \ --model-path ornith-ai/Ornith-1.5-35B-A3B \ --served-model-name Ornith-1.5-35B-A3B \ --host 0.0.0.0 --port 8000 \ --tp 2 \ --context-length 262144 \ --mem-fraction-static 0.85 \ --tool-call-parser qwen3_coder \ --reasoning-parser qwen3SGLang 与 vLLM 的差异点使用--tp 2做张量并行、--mem-fraction-static 0.85设定显存占比、--context-length 262144设定上下文长度工具调用解析器在此配方中为qwen3_coder。两者均以0.0.0.0:8000对外暴露 OpenAI 兼容的/v1接口。五、长上下文扩展用 YaRN 把窗口扩到约 100 万 tokenOrnith-1.5-35B-A3B 原生支持262,144 token的上下文窗口。当任务的输入 输出总长需要超过该上限时模型卡建议用RoPE 缩放扩展有效窗口——其中YaRN是官方验证过的技术且已内置于 vLLM 与 SGLang。使用 4.0 的缩放因子时可用窗口大约扩大到100 万 token。开启 YaRN 有两条等价路径方式一修改 checkpoint 的config.json添加rope_scaling块{ rope_scaling: { rope_type: yarn, factor: 4.0, original_max_position_embeddings: 262144 } }方式二启动时覆盖不改动 checkpoint在服务命令中追加对应参数vLLM需要VLLM_ALLOW_LONG_MAX_MODEL_LEN1放开长度上限检查VLLM_ALLOW_LONG_MAX_MODEL_LEN1 vllm serve ornith-ai/Ornith-1.5-35B-A3B ... --hf-overrides {rope_scaling: {rope_type: yarn, factor: 4.0, original_max_position_embeddings: 262144}} --max-model-len 1000000SGLang需要SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN1SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN1 python -m sglang.launch_server ... --json-model-override-args {rope_scaling: {rope_type: yarn, factor: 4.0, original_max_position_embeddings: 262144}} --context-length 1000000重要注意事项模型卡原话开源运行时实现的 YaRN 是静态的——无论请求长短缩放因子都作用于每一次请求这会对普通长度输入的生成质量带来轻微损失。因此只有工作负载确实需要更长窗口时才开启rope_scalingfactor应与实际需求匹配目标窗口约等于factor × 262,144例如请求长度峰值在 524,288 token 左右时factor: 2.0是更合适的设置。六、通过 OpenAI 兼容 Chat Completions API 使用服务启动后可用任意 OpenAI 兼容客户端Python、Node.js SDK 或curl访问http://localhost:8000/v1/chat/completions。基础用法读取思维链与最终答案from openai import OpenAI client OpenAI( base_urlhttp://localhost:8000/v1, api_keyEMPTY, # 本地服务器任意非空字符串即可 ) response client.chat.completions.create( modelOrnith-1.5-35B-A3B, messages[ {role: user, content: Write a one-line Python lambda that squares a number.} ], temperature0.6, top_p0.95, max_tokens1024, ) message response.choices[0].message # reasoning_content 存放 think 思维链content 存放最终答案。 print(reasoning:, getattr(message, reasoning_content, None)) print(answer:, message.content)注意reasoning_content需要服务端开启 reasoning parser即上文 vLLM/SGLang 配方中的--reasoning-parser qwen3才会出现该字段用getattr读取以便兼容未开启的服务器。工具调用Function Calling模型会输出格式良好的函数调用由服务端解析为标准tool_calls字段。下面是一个天气查询工具的完整示例tools [ { type: function, function: { name: get_weather, description: Get the current weather for a city, parameters: { type: object, properties: {city: {type: string}}, required: [city], }, }, } ] response client.chat.completions.create( modelOrnith-1.5-35B-A3B, messages[{role: user, content: What is the weather in Paris right now?}], toolstools, tool_choiceauto, temperature0.6, max_tokens2048, ) tool_call response.choices[0].message.tool_calls[0] print(tool_call.function.name, tool_call.function.arguments) # - get_weather {city: Paris}拿到tool_call后按标准 Agent 循环执行函数、把结果以tool角色消息回传即可完成多轮工具调用。API 同样支持流式streamingtoken 输出。七、Agent 化使用接入主流 Agent 框架与编码 CLIOrnith-1.5-35B-A3B 在工具调用与 Agent 编程上表现突出模型卡给出了一系列开箱即用的接入方式。直接加载 GGUFOllama / llama.cppOllama 直接运行本仓库的 GGUF 构建ollama run hf.co/…-GGUF会按 LFS 拉取实际权重ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUFllama.cpp 以 OpenAI 兼容 API 在 8000 端口提供 262,144 token 上下文的服务Atomic.chat 也采用同样的 llama.cpp API 方案llama-server -hf ornith-ai/Ornith-1.5-35B-A3B-GGUF --port 8000 -c 262144-hf参数直接从 HuggingFace 拉取该 GGUF 仓库-c 262144对齐模型原生上下文长度。本地已有下载好的 GGUF 文件时也可改用本地路径加载。通过环境变量指向你的 Ornith 服务Hermes Agent 与 OpenClaw 均支持 OpenAI 兼容端点只需设置三个环境变量即可指向本地服务# Hermes export OPENAI_BASE_URLhttp://localhost:8000/v1 export OPENAI_API_KEYEMPTY export MODELornith-ai/Ornith-1.5-35B-A3B# OpenClaw export OPENAI_BASE_URLhttp://localhost:8000/v1 export OPENAI_API_KEYEMPTY export OPENAI_MODELornith-ai/Ornith-1.5-35B-A3BUnsloth Studio本地推理与微调pip install unsloth# Python 中加载 Ornith 进行快速本地推理或微调 # from unsloth import FastLanguageModel # model, tokenizer FastLanguageModel.from_pretrained( # ornith-ai/Ornith-1.5-35B-A3B, # max_seq_length262144, # load_in_4bitTrue, # )max_seq_length262144对齐原生上下文上限load_in_4bitTrue启用 4-bit 量化加载以降低显存需求。编码 CLIOpenCodeOrnith-1.5-35B-A3B 面向终端编码 Agent 优化可让任意 OpenAI 兼容编码 CLI设置OPENAI_BASE_URL与OPENAI_API_KEY接入本地端点用于理解大型代码库、自动化重复工作。OpenCode 需要在~/.config/opencode/opencode.json注册 provider{ $schema: https://opencode.ai/config.json, provider: { ornith: { npm: ai-sdk/openai-compatible, name: Ornith (local), options: { baseURL: http://localhost:8000/v1, apiKey: EMPTY }, models: { ornith-ai/Ornith-1.5-35B-A3B: { name: Ornith-1.5-35B-A3B } } } } }然后直接运行opencode即可在会话中选择 Ornith 模型。八、引用方式若你的工作使用了 Ornith-1.5模型卡建议按以下 BibTeX 条目引用misc{ornith_1_5, title {{Ornith-1.5}: From Self-Scaffolding to Self-Improvement}, url {https://ornith.ai/ornith_1_5.html}, author {{Ornith Team}}, year {2026} }九、实践要点速查版本先行Transformers ≥ 5.8.1、vLLM ≥ 0.19.1、SGLang ≥ 0.5.9旧版本可能无法正确解析 reasoning / tool-call显存规划BF16 权重约 70GB2× 80GB GPU 是模型卡的标准部署配置256K 上下文会占用大量 KV cache推理与工具默认开启--reasoning-parser qwen3与--tool-call-parservLLM 用qwen3_xml、SGLang 配方用qwen3_coder才能拿到reasoning_content与tool_calls长上下文YaRN 是官方验证的窗口扩展方案factor: 4.0≈ 1M token但静态缩放会轻微损失普通长度输入的质量非必要不开启并按峰值长度选 2.0 / 4.0复现基准统一使用temperature1.0并严格按照模型卡的 harness 与防作弊配置执行Agent 接入OPENAI_BASE_URLOPENAI_API_KEY环境变量是连接 Hermes、OpenClaw、OpenCode 等 OpenAI 兼容工具的统一入口。以上全部内容均直接取自 README.md模型卡所述事实GGUF 文件名、体积与.gitattributes登记信息来自本仓库实际文件可作为继续深入源码与权重细节的起点。赞分享大模型基础模型本地部署代码模型【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF点击查看免费下载相关推荐昇腾 Ascend NPU 上基于 vllm-ascend 部署 Qwen3.6-35B-A3B 推理服务全指南昇腾 Ascend NPU 上基于 vllm ascend 部署 Qwen3.6 35B A3B 推理服务全指南 Qwen3.6 35B A3B 是通义实验室发大模型人工智能教程本地部署微调Qwen3 与 vLLM 部署实战从 OpenAI 兼容 API 到 Thinking 模式、工具调用与长上下文配置Qwen3 与 vLLM 部署实战从 OpenAI 兼容 API 到 Thinking 模式、工具调用与长上下文配置 Qwen3 是阿里云 Qwen 团队推出人工智能大模型Qwen模型评测示例工程本地部署教程大麦抢票脚本把抢票从拼手速变成打接口大麦抢票脚本把抢票从拼手速变成打接口 本文拆解大麦抢票脚本 Automatic_ticket_purchase用 Selenium 登录一次之后直接打大麦网页爬虫工作流自动化创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表