
先报三个数。9 月 24 日,一个叫 Strata 的仓库在 GitHub 建号。到今天,9194 星。9 月 30 日到 10 月 3 日,四天发了 10 个版本。最新的 v0.1.34 是 10 月 2 日深夜出的,那一版把 AMD 一整条产品线拉进官方支持名单——RX 9070、9070 XT、7900 XT/XTX,连工作站的 R9700 都在列。它干的事一句话说得完:让一张 12GB 显存的游戏卡,跑一个平时要服务器才装得下的 1250 亿参数模型。官方速度表上,一张 RTX 5070(12GB)加 64GB 内存,跑 Qwen3.8-Flash-Next,量化到 Q2_0 是 93 token 每秒——比你读的速度快。24GB 的老 3090 估算能到 100 到 140。安装是一键的,Windows 和 Linux 都行。素材是抡锤者前几天的视频文稿,结论我都对着仓库核了一遍。大方向他都说对了,有一个技术细节说反了,后面讲。为什么一条内存条就够了先看这个模型长什么样。Qwen3.8-Flash-Next 是阿里 8 月底开源的混合专家模型:总参数 1250 亿,每个 token 真正用到的只有 60 亿。剩下 95% 的权重,绝大多数时间闲着。闲着的权重有个特点:不需要快,只需要放得下。Strata 整个就是围着这句话做的。最常被路由到的专家放进显存,次常用的放进内存,冷门的