
MiniCPM5 那个 23 分厂商自己改了三遍你大概率在热搜或群里见过这句话MiniCPM5-2B海外一个评测榜圈里叫 AA上拿了 23 分4B 以下登顶。但有个细节几乎没人提这个分数厂商自己都改过三次。那个海外榜Artificial Analysis圈里叫 AA自己写明了v4.1.1 版本是23 分更新到 v4.2 降到15 分再到 v4.3 只有14 分已经和谷歌的 Gemma 4 12B打平而不是官方宣传的超越。AA 还专门声明两个版本的分不能直接比。也就是说你转的那条23 分登顶已经是过期版本号了。可中文媒体包括厂商自己的页面还在复读 23 分。MiniCPM5 没有官方 API也没有任何第三方托管服务能直接调想用现成的拉取命令比如 ollama pull库里根本没这个模型链接都是 404想用只能自己部署。云端调不了一手数据只能自己跑出来。于是我们干了。一、它到底是什么带口径的官方数据MiniCPM5 是面壁OpenBMB9 月初开源的、能跑在本地设备上的模型系列两个成员1B约 10.8 亿参数Apache 2.0 协议能直接商用2B约 25.2 亿参数同样 Apache 2.0 可商用它的骨架是标准 Llama 架构没有自己发明的奇怪算子42 层、2048 维、16 个提问头 2 个记忆头KV 头、13 万词表、原生支持 128K 长度的上下文。我们把参数从配置文件反推了一遍零误差和官方数字基本对得上手上是原版结构没缩水。官方自己测了 34 项基准平均53.9 分但那是对比题是厂商自己挑的。引用时请标厂商自测有第三方OrcaRouter指出其中 SWE-bench 那行 46.4 分、平均 53.9 这两行至今没人逐题复现过。下面这几句写文章时一条都别碰都是被实测打脸过的坑❌ 只写AA 23 分不带版本号那已经是旧版❌ 把512K 上下文当它的原生能力配置里写死的是 131072512K 是营销口径❌ 说它多模态能看图纯文本模型❌ ollama pull minicpm5 一键拉取库 404假命令❌ 超越 Gemma 4 12Bv4.3 下是持平二、别人测了什么谁的话能信这是本系列核心的差异化中文内容 9 成在复读通稿几乎没人做一手实测。盘点一下已有的测评按可信度分三档能直接引用AA 官方文章版本漂移23→15→14的出处有力第三方背书FlagOS 技术稿在苹果 M5 Pro 上用 W4A8 / W8A8 比 llama.cpp 的 Q4_0 / Q8_0读取速度 19% / 32%少有的条件完整的第三方性能对比日本 GIGAZINE引了 AA v4.3 14 分方法能学结论别引LM Studio 社区在 RTX 5080 上跑了三个带陷阱的用例结论全合格但没给量化指标、也没列失败案例logeshwaran.org老实承认没有 2B 的速度数据不会编一个态度好但给的是上界推测七牛 / 掘金部署命令是准的性能数字都是转述官方别信AI 洗稿号ai-cost-estimator至少 4 处硬伤说它多模态、8K 上下文、ollama 能拉、2.1B 参数全错某些 CSDN 稿参数表对但RTX 4090 上 Q4_K_M 50-100 t/s没任何实测出处三、我们测了什么接下来几篇测给你看我们把 MiniCPM5 在主力机R9-7900 处理器 RTX 3070 8G 显卡 64G 内存上跑了 200 轮全是本地一手数据测的什么规模回答的问题裸模型聊天59 题 × 4 档 × 2 种口径 × 3 轮 1416 轮能力水位在哪自动干活外壳opencode13 题 × 4 档 × 3 轮 156 轮1B 聊天能拿 49%放进外壳却 0/13长上下文 needle8k~112k实测天花板 12.3 万 token超时敏感性3 道长题 × 3 组对照 9 轮加超时能救活长任务吗答案是不能四、系列目录追更路线总纲本篇情报综述 我们的计划自动干活的地板是 2B1B 聊天 49%放进外壳直接归零文末附我们怎么测的12 万 token 能吃吗2 个记忆头给的红利和一道采集口径的坑实际建议能力边界与量化选择聊天 / 文档 / 代码 / 自动干活 / 写作 Q4 vs F16收尾对比MiniCPM5 vs 上一季的 SparkX25能耐差在哪数据口径本篇官方数据来自 openbmb.cn 官方页标注厂商自测版本漂移来自 AA 官方文章 GIGAZINE我们的实测都在 RTX3070-8G下完成后续 4 篇逐题展开。