
2026年10月3日ollama 发布 v0.35.1 版本。本次更新围绕决策模型能力展开重点带来了对 Clef 与 Clef Flash 两个开源决策模型的支持并通过/v1/systemone接口提供调用能力。除此之外v0.35.1 还提升了使用网页搜索的模型在单次响应中的搜索次数上限为 Modelfile 引入 CAPABILITY 声明并调整了决策模型在模型列表与模型信息中的能力展示方式。同时底层的 llama.cpp 与 MLX 引擎也完成更新。一、v0.35.1 核心更新一览ollama v0.35.1 的主要变化可以归纳为以下几项支持 Clef 与 Clef Flash 决策模型新增/v1/systemone调用入口决策请求支持文本状态与图片共同输入图片与文本状态会被所有问题共享并共同评分使用网页搜索的模型单次响应最多可进行十次搜索Modelfile 支持 CAPABILITY 声明CAPABILITY 声明可在多种模型创建、继承和导出流程中保留决策模型在ollama show与模型列表中仅显示decision能力更新 llama.cpp 与 MLX 引擎本次版本的重点并不是通用聊天能力的扩展而是对“决策模型”这一模型类型进行更明确的支持、调用和能力标识。二、支持 Clef 与 Clef Flash 决策模型ollama v0.35.1 现已支持 Clef 和 Clef Flash 两个开源决策模型并通过/v1/systemone提供访问入口。这两个模型分别为模型参数规模Clef27BClef Flash9BClef 与 Clef Flash 都属于多模态模型。也就是说在发起请求时不仅可以提供文本状态也可以同时传入图片。这一能力的关键点在于图片不是作为某一个独立问题的附加内容存在而是可以和文本状态一起作为共享上下文提供给请求中的所有问题使用。换句话说一次请求可以包含一段文本状态一张或多张图片一个或多个待判断的问题模型会基于共享的文本状态和共享图片对每一个问题分别进行判断与评分。这样的输入组织方式使得同一份状态信息可以被多个问题复用而无需针对每个问题重复传递相同的文本和图片内容。三、通过/v1/systemone调用决策模型v0.35.1 为 Clef 与 Clef Flash 提供了/v1/systemone接口。示例请求如下curlhttp://localhost:11434/v1/systemone-d{ model: clef-flash, state: The user took this screenshot., images: [base64-encoded image], questions: { has_ollama: {type: noul, instructions: Does this image contain Ollama?} } }从这个请求可以看出/v1/systemone的请求主体主要包含以下内容字段示例内容作用modelclef-flash指定要使用的决策模型state文本描述提供共享的文本状态imagesBase64 编码图片数组提供共享图片输入questions问题对象定义一个或多个需要模型判断的问题在示例中使用的是clef-flash模型。state字段中的文本为The user took this screenshot.这段内容作为请求的文本状态用于描述当前输入的背景。images字段接收的是图片数组图片采用 Base64 编码形式传入images:[base64-encoded image]questions字段则用于描述需要模型回答的决策问题。示例中的问题名称为has_ollama问题类型为noul并通过instructions提供了具体判断指令has_ollama:{type:noul,instructions:Does this image contain Ollama?}该问题的含义是判断图片中是否包含 Ollama。需要注意的是图片和文本状态都是共享输入。这意味着若questions中包含多个问题这些问题都可以基于同一个state和同一组images进行评分。四、多模态状态如何参与决策Clef 与 Clef Flash 的多模态能力是 v0.35.1 本次更新中的重点之一。在这个调用方式中请求可以同时携带文本与图片{state:The user took this screenshot.,images:[base64-encoded image]}文本状态用于提供语言层面的上下文信息图片用于提供视觉层面的输入信息。根据更新说明图片会与文本状态一起被所有问题共享并与文本状态共同参与评分。这意味着模型在处理问题时不是只根据文本也不是只根据图片而是结合请求中提供的文本状态和图片状态进行判断。以示例为例文本状态说明用户截取了一张截图图片字段提供实际截图内容问题要求判断图片中是否包含 Ollama模型会将文本状态与图片共同作为判断依据并对这一问题输出相应的分数。这种方式特别强调“状态共享”的概念。请求中的文本状态和图片并不需要在每一个问题中重复定义而是统一放在顶层字段中由所有问题共同使用。五、noul问题类型与返回分数示例中的问题类型是noultype:noul接口返回结果如下{model:clef-flash,answers:{has_ollama:{type:noul,noul:0.958}},usage:{input_tokens:548,output_tokens:0}}返回结果包含三个主要部分字段说明model本次请求实际使用的模型answers各个问题对应的答案结果usage本次请求的 token 使用信息在示例响应中model:clef-flash表明本次调用使用的是clef-flash。answers中包含与问题名称对应的结果answers:{has_ollama:{type:noul,noul:0.958}}这里的has_ollama与请求中的问题名称保持一致。返回结果中type:noul表示该答案对应的类型仍然是noul。同时模型给出了noul:0.958该数值是模型针对该问题输出的评分结果。从示例可以看到决策模型的输出重点不是生成一段自然语言回答而是针对定义好的问题返回相应类型的评分数据。这也与本次版本中对“决策模型”能力的定位保持一致。六、响应中的 token 使用信息示例响应还提供了usage字段usage:{input_tokens:548,output_tokens:0}其中字段示例值input_tokens548output_tokens0该响应中输入 token 数为 548输出 token 数为 0。这一结果与决策模型的调用形式相对应。请求主要由文本状态、图片内容以及问题定义构成而响应返回的是结构化的决策结果而不是传统聊天形式的文本生成内容。因此示例中显示的输出 token 数为 0。七、网页搜索次数从三次提升至十次v0.35.1 还提高了使用网页搜索的模型在每次响应中的搜索次数上限。此前使用网页搜索的模型在单次响应中最多可以进行三次搜索。更新后这一上限提升为十次。可以概括为能力更新前v0.35.1每次响应可进行的网页搜索次数3 次10 次这意味着使用网页搜索的模型在一次响应过程中可执行的搜索次数从三次增加到十次。此次调整直接改变的是单次响应内的搜索次数限制搜索能力的上限得到提高。八、Modelfile 新增 CAPABILITY 声明v0.35.1 为 Modelfile 增加了 CAPABILITY 声明支持。通过 CAPABILITY 声明模型创建者可以明确声明一个模型具备哪些能力。更新说明中强调模型创建者可以通过这一声明机制显式表达模型能够执行的功能。这意味着模型能力不再只能依赖默认判断或隐式推断而是可以在 Modelfile 中进行明确声明。CAPABILITY 的意义在于让模型能力具备更清晰的表达方式。当一个模型具备特定能力时模型创建者可以通过 CAPABILITY 对其进行标注当模型不具备某些能力时也可以避免客户端将其错误地当作支持对应功能的模型。九、CAPABILITY 声明可在多个流程中保留本次更新不仅新增了 CAPABILITY 声明还明确说明这些声明能够在多个模型流程中被保留。根据更新内容CAPABILITY 声明可以在以下场景中继续保留从 GGUF 创建模型从 safetensors 创建模型模型继承Modelfile 导出可以整理如下操作场景CAPABILITY 声明是否保留从 GGUF 创建保留从 safetensors 创建保留模型继承保留Modelfile 导出保留这意味着能力声明不会只停留在最初的 Modelfile 定义阶段。当模型从 GGUF 或 safetensors 创建时CAPABILITY 声明可以被保留当模型通过继承关系构建时声明也可以保留当模型被导出为 Modelfile 时相关声明同样能够继续存在。从模型创建、模型继承到 Modelfile 导出能力声明具备连续性。对于需要明确模型功能边界的场景而言这种保留机制能够使能力信息在不同操作流程中持续存在而不是在格式转换、继承或导出时丢失。十、决策模型只展示decision能力v0.35.1 还调整了决策模型的能力展示方式。现在ollama show和模型列表对于决策模型只会报告decision这一项能力。也就是说当模型属于决策模型时其能力展示会聚焦于decision而不会再让客户端将这类模型视为适用于通用聊天、工具调用或思考用途的模型。更新说明明确指出这一变化的目的是避免客户端将决策模型提供给以下用途通用聊天工具思考可以理解为决策模型在能力展示层面将拥有更清晰的定位。此前如果客户端仅根据模型列表或模型信息中的能力判断可用用途可能会将决策模型错误地作为聊天模型、工具模型或思考模型进行提供。v0.35.1 通过让ollama show和模型列表仅报告decision能力使客户端能够更准确地区分模型类型。对于决策模型而言其核心能力被明确标记为决策而不是通用聊天、工具调用或思考。十一、为什么只报告decision能力很重要本次能力展示调整与 Clef 和 Clef Flash 的接入形成了对应关系。Clef 与 Clef Flash 通过/v1/systemone用于处理决策请求。其请求形式由状态、图片和问题构成输出结果则是结构化答案与评分。例如answers:{has_ollama:{type:noul,noul:0.958}}这种返回形式与一般聊天模型直接生成自然语言回答的方式不同。因此决策模型在模型列表和模型信息中仅显示decision能力可以让客户端在模型选择时更准确地识别其用途。这一变化并不是为决策模型增加通用聊天、工具或思考能力而是明确限制客户端不要将其错误地归类到这些用途之中。通过能力声明与能力展示v0.35.1 对模型能做什么、客户端应如何使用模型提供了更加明确的边界。十二、llama.cpp 与 MLX 引擎更新除决策模型、多模态输入、网页搜索次数和 Modelfile 能力声明外v0.35.1 还更新了 llama.cpp 与 MLX 引擎。本次更新说明中列出的底层变化包括更新 llama.cpp更新 MLX 引擎这两项更新属于 v0.35.1 的版本变更内容之一。十三、v0.35.1 更新内容总结代码地址github.com/ollama/ollamaollama v0.35.1 的关键变化可以再次概括为以下内容更新方向具体变化决策模型支持支持 Clef 与 Clef Flash模型规模Clef 为 27BClef Flash 为 9B调用接口通过/v1/systemone使用多模态输入支持文本状态与图片同时输入状态共享图片与文本状态由所有问题共享联合评分图片与文本状态共同参与问题评分结构化结果通过answers返回问题结果使用统计通过usage返回输入与输出 token 信息网页搜索单次响应最多十次搜索原为三次Modelfile新增 CAPABILITY 声明声明保留GGUF、safetensors、继承、导出流程均可保留能力展示决策模型仅报告decision能力客户端行为不再将决策模型提供给通用聊天、工具或思考用途底层更新更新 llama.cpp 与 MLX 引擎整体来看v0.35.1 的重点是让决策模型拥有更明确的调用入口、更清晰的输入形式和更准确的能力标识。通过/v1/systemoneClef 与 Clef Flash 可以接收文本状态、图片以及多个问题通过共享状态与联合评分模型可以针对问题返回结构化的决策结果通过 CAPABILITY 声明及决策能力展示调整模型创建者与客户端也能够更明确地区分不同模型的能力边界。对于需要使用多模态决策模型、需要在模型定义中声明能力、需要提高单次响应网页搜索次数或需要让客户端正确识别决策模型用途的场景ollama v0.35.1 提供了对应更新。