ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Jev 之后,中国团队开始深挖 AI 的“直觉层”

Jev 之后,中国团队开始深挖 AI 的“直觉层” 大模型负责想小模型负责判断这门新生意中国团队不会缺席。9 月 15 日前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 发布了 Jev。这款模型不写一个字只做判断。两周之后整个行业都在做同一件事。OpenAI 在开发者日上推出 Decisions APICloudflare 在 10 月 1 日开源了 Clef亚马逊也放出了 Strands Decider。国内同样没闲着上海人工智能实验室开源了多模态决策模型 Intern-Decision。9 月 30 日一家成立不到五个月的上海公司 StartLux原点星辉发布了开源的 StartLux-Decision并宣称在公开评测中超过 Jev。一个新品类在两周内从「首发」走到「群战」这种速度在大模型行业也不多见。而 StartLux 背后的掌舵人是盛大网络联合创始人陈大年。被 Jev 点燃的「直觉」要理解这轮热潮得先说清楚决策模型到底在干什么。TypeSafe 把 Jev 称为「System One 模型」名字取自卡尼曼的《思考快与慢》。系统一是人快速、直觉的那部分思维系统二负责慢思考。过去两年的大模型几乎都在往系统二的方向卷推理链更长思考更深。但 Agent 真正跑起来之后情况不太一样。一个 Agent 任务里密集发生的往往不是深度推理而是大量琐碎判断。这张工单该分给哪个团队这条命令能不能放行页面上下一步该点哪个按钮任务到底完成没有。过去这些判断要么交给大模型「顺便」做生成一段文字再解析要么写死成规则覆盖不了长尾。前者又慢又贵后者不够聪明。Jev 的做法是只回答带预设选项的问题单选、打分或者是非题直接返回带概率的结构化结果。定价是每百万输入 token 0.042 美元输出免费。可以说Jev 把「判断」从「生成」里剥离出来做成了一种廉价、高频的基础设施。市场反应很直接。Vercel 披露Jev 上线 24 小时内其 AI Gateway 上 13% 的付费用户就用上了它是此前任何模型发布的两倍。TypeSafe 用经济学家杰文斯的名字给模型命名暗指那条著名的悖论一样东西越便宜需求反而越大。不过 Jev 有一个明显的缺口。它是闭源托管模型没有公开权重也不能本地部署只能调用 TypeSafe 自己的 API。这个缺口恰好成了后来者的入口。中国团队迅速跟进国内团队也在迅速跟进类 Jev 模型。上海人工智能实验室的 Intern-Decision 开源了 0.8B、2B、4B 三档主打多模态能看懂图像和界面再做决策团队给出的数据是推理速度比 Jev 快 2 到 3 倍。StartLux 这样的创业公司一口气拿出 0.8B 到 27B 五档规格配齐量化文件直接瞄准本地部署。StartLux 模型分数超过 Jev图片来源Github按 StartLux 公布的数据27B 版本在 Decision Index 0.2.1 的 38 项测试里有 31 项高于 Jev 1.13综合分 63.88 对 57.91。团队还展示了一组国际象棋对弈36 局赢下 35 局。StartLux 模型下国际象棋来源Github这些数字需要放在正确的位置看。它们是团队基于公开工具、对照 9 月 28 日榜单快照完成的自测。更重要的是「第一」在这个赛道的保质期极短StartLux 发布第二天Cloudflare 就宣称自家 Clef 在同一套榜单上领先。至于下棋本来就不是决策模型的主战场更像一个吸引眼球的演示。比起谁暂时排第一更值得注意的是中国团队几乎不约而同地选择了开源和本地化。这并非巧合。Jev 闭源、只能走云端对数据敏感、对跨境调用有顾虑的国内开发者来说本身就是一道门槛。开源权重、能在自己机器上跑正好补上了 Jev 留下的空位。还有一个细节。Cloudflare 的 Clef 基于 Qwen 后训练亚马逊的 Strands Decider 也用 Qwen 做底座APUS 的方案同样跑在 Qwen 上。这一轮决策模型热潮里中国开源基座已经成了全球玩家共用的「躯干」。为什么押注「本地」回到 StartLux 本身。这家公司今年才成立CEO 是陈大年CTO 是郭权玮博士。陈大年的履历中国互联网从业者都不陌生1998 年写出上网计费软件 ENCounter次年和陈天桥创办盛大后来又做了 WiFi 万能钥匙。StartLux 给自己的定位是「主打本地模型」让模型能力和数据留在用户自己的设备上。上一次引起关注是以 Qwen3.6-27B 为基座后训练的 StartLux-27B在中国信通院的 MCP 专项测试中得分 39.25超过了 284B 参数的DeepSeek-V4-Flash。需要说明的是这是一项聚焦工具调用的专项测试不代表通用能力全面领先。在 StartLux 的规划里「本地 AI」不是一个能下载到电脑上的小模型而是一整套个人 AI 系统。27B 模型承担通用能力决策模型负责高频判断上层是 Agent 和记忆底层是量化与推理系统。放进这张图里看决策模型对本地场景的意义比对云端更大。云端算力可以堆个人电脑的显存、内存和功耗却有硬上限。如果每个小判断都要动用 27B 模型本地 Agent 根本跑不动。按 StartLux 公布的数据4B 版本压到 Q4 量化后约 2.71GB与原始权重的决策一致率仍有 98.3%。对一家押注本地的公司来说决策模型不是追热点的新品类而是本地系统能否跑得动的关键零件。这也是 Jev 对 StartLux 真正的意义。准确地说Jev 并没有替 StartLux 选方向从时间线看StartLux 的决策模型立项明显晚于 Jev。Jev 证明的是另一件事「把智能拆成不同层级、各司其职」这条路被市场用真金白银投了票而这恰好是 StartLux 一直在讲的本地架构逻辑。那个「3 天」的数字也值得一提。StartLux 把它归功于自己的 Auto Research 体系让 AI 参与数据构造、训练、评测和失败分析。这套方法能否在不同模型品类之间反复复用比任何一次榜单都更能说明这家公司的成色。判断层会不会变成「白菜价」不过决策模型的护城河有多深现在下结论还太早。Jev 号称在隐身状态下研究了两年OpenAI 用两周基于自家小模型做出了 Decisions APIStartLux 用了 3 天Cloudflare 和亚马逊也都在半个月内跟上。Jev 发布时就有分析人士预判大厂会很快推出自己的决策模型Jev 最终要和「前沿版本的自己」打价格战。一个两周就能被复制的品类本身很难成为壁垒。对 StartLux 来说真正的考验也不在决策模型这一层。郭权玮自己也承认长任务稳定性、异常恢复、上下文管理和整体体验比单纯把模型跑起来难得多。按计划StartLux 首个面向公众的本地智能体验版本有望在年内推出。从按时计费的上网工具到 WiFi 万能钥匙陈大年过去做过的不少产品都是高频、底层、靠规模取胜的生意。决策模型同样是一件高频、底层的事。问题在于当「判断」便宜到人人都能做价值最终会落在模型身上还是落在把这些模型组装成产品的人手里原文链接Jev 之后中国团队开始深挖 AI 的“直觉层”-36氪我的专辑《人工智能生命体 新启点》CSDN平台https://blog.csdn.net/2501_91883294/article/details/147616608?sharetypeblogdetailshareId147616608sharereferAPPsharesource2501_91883294sharefromlink
返回列表