
决策模型的崛起从Clef到Clef-FlashCloudflare正在如何重写企业AI应用的规则【免费下载链接】clef项目地址: https://ai.gitcode.com/hf_mirrors/Cloudflare/clefClef是 Cloudflare 开源的 27B 多模态决策模型它不写文章、不聊天而是把状态 类型化问题直接变成带置信度的决策结果其轻量版Clef-Flash将延迟压到 38.8ms正在为企业 AI 应用定义一套全新的工程规则。一句话理解如果说传统大模型是在做问答题Clef 做的就是选择题——而且每个选项都自带概率分。为什么决策模型是企业 AI 的关键一步用大模型处理业务时最常见的痛点不是答得不好而是答得不可控输出是自由文本需要正则/JSON 解析偶尔一个格式错误就全盘崩溃模型会幻觉出不存在的选项无法量化我有多确定风控和审计无从下手。Clef 的做法是从架构上消除这些问题定义见 joint_schema_model.py传统 LLM 工作流Clef 决策模型工作流生成自由文本 → 解析 → 校验单次前向传播直接输出每个选项的 logit可能答出选项之外的内容输出空间被限定为允许选项不可能跑偏置信度靠后处理估算每个选项天然带有 softmax 概率没有自由文本生成没有输出解析——这就是 README 中那句核心宣言There is no free-form text generation and no output parsing.见 README.mdClef 的核心架构27B 骨干 联合 Schema 头Clef 由两部分组成文件在仓库里一目了然组件文件作用骨干网络model-00001-of-00012.safetensors ~ model-00012-of-00012.safetensorsQwen3.8-27B 多模态骨干含视觉编码器标准分片 safetensors联合 Schema 头joint_head.safetensors读取骨干隐状态把证据路由到每个问题联合为所有选项打分头结构配置joint_head_config.json4 层解码 2 层证据路由16 注意力头推理逻辑joint_schema_model.py记录编码、批处理、模型加载与systemoneAPI联合joint是关键词头里有一组EvidenceRoutingLayer见 joint_schema_model.py先把状态中的证据路由给每个问题的每个选项再让所有问题一起打分。也就是说发票已逾期这个事实可以同时支撑状态overdue和金额1000两个问题的判断——这正是决策与分类的本质区别。它能看什么得益于 Qwen3.8-27B 的视觉编码器配置见 config.jsonClef 的输入state可以是纯文本如客服工单内容JSON 结构化数据如发票记录图片如收据照片经 processor_config.json 中的图像处理器视频帧序列如监控录像片段文本和多媒体记录还能混在同一个 batch里推理工程上非常友好。3 种问题类型noul / choice / scoreClef 用一套极简 schema 描述要做什么决定README.md类型含义典型场景输出noul是/否判断是否发生了服务中断true 的概率choice命名选项单选发票属于哪种状态每个选项的概率score有序刻度紧急程度可等待/本周/今天期望得分 各级概率拿 README 里的发票例子感受一下README.md状态一张 Acme 供应商、总额 1250 美元、已逾期的发票 问题 1choice发票状态是 paid / overdue / draft 中的哪一个 问题 2noul总额是否超过 1000 美元一次前向传播两个问题的概率分布全部到手output_tokens恒为 0——生成成本被压到了极限。从 Clef 到 Clef-Flash同一套 API 的两种规格Clef 家族提供两个规格API 完全兼容Jev / SystemOne 协议团队可以按场景平滑切换指标ClefClef-Flash定位精度优先速度优先中位延迟209.3 ms38.8 msp95 延迟238.6 ms122.4 ms从官方 Decision Index 0.2.1 基准来看完整数据见 README.md两者各有主场Clef 更稳BANKING77 意图分类 macro-F1 达94.2BFCL 工具调用 case exact 98.5RAGTruth 幻觉 F1 79.4Clef-Flash 更快且更准的地方更准MMLU 91.8、HellaSwag 98.6、ForecastBench Brier 10.6越低越好、家电模拟器 case exact 高达 97.7。更关键的是端到端业务表现Typesafe Evals 工作流README.md业务工作流ClefClef-Flash发票处理主操作准确率86.273.3客服工单完全动作匹配76.377.0安全事件完全动作匹配62.961.7选型建议离线批量、高价值决策发票、合同、风控选 Clef实时在线、高频调用客服路由、请求分派选 Clef-Flash。快速上手如何运行你的第一个 Clef 决策环境要求很明确torch2.11 transformers5.10.2单张 H200 GPU 即可跑通见 README.md处理图片/视频再装pillow。拉取模型权重git clone https://gitcode.com/hf_mirrors/Cloudflare/clef核心调用只有四步完整示例见 README.md加载模型 → 构造recordstatequestions可选images/videos→encode_record编码 → 前向推理拿到 logit逐问题softmax即得概率。如果团队已有 Jev / SystemOne 服务迁移成本几乎为零——仓库内置的systemone()函数joint_schema_model.py直接接收POST /v1/systemone请求体并返回标准响应choice答案带choice/confidence/probabilitiesscore答案带期望分与图例noul答案返回 true 概率。输入字段速查字段说明state任意字符串或 JSON描述待决策的场景images/videos可选图片列表或视频帧数组questions问题 ID → 问题的映射每题含type、instructions、criteriamax_length默认 16,384 tokens 上限防止输入爆炸为什么这会改变企业 AI 应用的规则可靠性来自架构而非提示词输出空间被 schema 锁定格式错误这类 bug 在物理上不可能发生概率是一等公民每个决策自带置信度可以设置低于 80% 转人工的阈值天然满足合规审计需求成本结构更优一次前向传播回答全部问题output_tokens为 0比多轮生成便宜且延迟可预测多模态开箱即用一张收据照片、一段监控视频就能进入决策链路无需再搭 OCR 前置管道开源可自托管Apache-2.0 协议LICENSE27B 权重公开可下载数据不出内网。常见问题QClef 能替代聊天机器人吗A不能也不必。它专精给定状态 → 做出决策的场景意图分类、路由、审批、监控判断。对话、创作、开放问答仍交给通用 LLM两者是互补关系。QClef-Flash 只是缩小版吗A定位上是更小更快的变体但在多个基准上MMLU、HellaSwag、预测精度并不逊色延迟却只有主模型的约 1/5。Q没有 GPU 集群能玩吗A官方测试基线是单张 H200README.md。想先熟悉概念可以先读懂 joint_schema_model.py 的编码逻辑——它不长却完整呈现了决策模型的全部设计思想。写在最后Clef 代表的是一条清晰的技术路线企业 AI 的战场正在从更会说话转向更会决策。当输出被限定在类型化选项内、置信度成为原生属性、延迟进入毫秒级AI 才能真正走进发票处理、客服路由、安全响应这些出错代价高昂的业务主链路。从 Clef 到 Clef-FlashCloudflare 已经展示了决策模型的完整形态精度与速度两档规格、与 Jev/SystemOne 兼容的 API、公开透明的基准数据。而开源的 Apache-2.0 许可意味着你完全可以现在就把它装进自己的生产流程验证属于你自己的那条决策曲线。【免费下载链接】clef项目地址: https://ai.gitcode.com/hf_mirrors/Cloudflare/clef创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考