ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AI 给自己设计了一块芯片,跑 10 个大模型:瓶颈居然不在算力

AI 给自己设计了一块芯片,跑 10 个大模型:瓶颈居然不在算力 AI 给自己设计了一块芯片跑 10 个大模型瓶颈居然不在算力大厂们正在把几百亿美元砸进 GPU 集群堆算力、堆电、堆带宽。而在 GitHub 上有个仓库走的是另一条路指令集、编译器、模拟器、SystemVerilog 硬件全由 AI 代理参与设计最后焊进一块真实的 PCIe 卡里跑 10 个模型。它叫 openTPU在 Hacker News 上拿了 251 分、308 条评论讨论帖仓库目前 248 颗 starGitHub。它的前身是同一个人做的 auto-arch-tournament那是一个让 AI 代理互相比赛做架构的 tournament。这个项目只问两个问题AI 代理在硬件设计上到底能走多远能不能造出一块跑自己推理的芯片。先看清楚它不是什么它不是一个 PPT也不是一个只跑仿真的玩具。整个加速器住在一个可以「从头读到尾」的 monorepo 里SystemVerilog 写的硬件、自己定义的指令集、比特级一致的 ISA 模拟器、一门内核语言和它的编译器以及驱动真实 PCIe 卡的主机程序。README 里的分层图很直白——上面是 Python 内核往下是编译器、ISA、模拟器与 RTL再往下是 FPGA 板卡最后是主机软件。它甚至刻意做得很简单没有缓存没有隐藏调度每一次数据搬运都是一条指令。所以一次运行的 trace 就能解释它为什么快——这在一个「性能玄学」满天飞的领域里反而稀有。成绩单一块 Kintex-7 卡10 个模型硬件是一块 Inspur YPCB-00338 卡Xilinx Kintex-7 xc7k480t两路 DDR3峰值 17.1 GB/s。跑的是真权重不是随机初始化。int8 权重下的解码速度挑几个看实测数据与测量方法:LFM2.5-230M59.0 tok/sQwen3-0.6B21.6 tok/sQwen3.5-2B8.02 tok/sSmolLM3-3B5.00 tok/s表下面有一句话比所有速度都值钱卡上产出的 token 和模拟器比特级一致。硬件和软件模型互相验证claim 才有底。Mixture-of-Experts 模型也能跑LFM2.5-8B-A1B85 亿参数、激活 17 亿10.6 tok/s专家不命中时从主机存储流式补进卡的 DRAM 槽位。瓶颈不在算力在内存带宽README 里最诚实的一句是解码是 DRAM 受限的。每生成一个 token就要把所有权重从内存里读一遍。卡上实测吃到了 DDR3 峰值的 82%–94%。也就是说这台机器大部分时间在等内存不是在算。于是最大的加速空间不在乘法器而在「少读点字节」。他们把 4-bit 权重一路做进了 ISA、模拟器和矩阵单元docs/quant.md格式是 FP4E2M1 两级块缩放每权重 4.25 bit。质量上接近 NVIDIA 的 NVFP44.5 bit明显好于 MXFP4在三个小模型上对 fp32 的平均 KL 是 0.19 / 0.16 / 0.12。代价也写清楚了0.2B–0.8B 这种小模型上4-bit 让困惑度从 23.5fp32 与 int8 一致涨到 28.3。省三分之一字节、解码快 40%–45%精度损失明码标价——这种「把代价摆在台面上」的写法比只报最好看的那一栏可靠得多。评论区在吵另一件事HN 上最热的那个问题来自一个自称「软件人」的网友为什么大厂不干脆把前沿模型烧进芯片回答相当现实模型 SOTA 迭代比芯片设计和流片快zdragnar你得锁定某个模型好几年才回本同时还得继续烧钱追新模型。拿掩模是真门槛thesz掩模开发常常要半年且产线产能紧张实验性项目很难排上队skeskinen。有人举反例ohaziTaalas官网就在做 model-on-a-chip8 个月前宣称第二代硅平台会是一款中等规模的推理 LLM后来据称被 AMD 收购slowin。也有人纠正误区voxelghostFPGA 并不是「更快」频率通常不高片上内存也比同价位 GPU 少快慢取决于你的布局设计。这场争论其实解释了 openTPU 的价值它不指望赢过 GPU。它把「从 Python 里的一次 matmul到板卡上的每一根线」整条路径摊开给你看还配了个 profilerLens可以在浏览器里回放一个 Qwen3 解码步把 floorplan 上每个单元在每个周期是在忙、在等 DRAM、还是在等另一条指令全画出来。写在最后看得越细越会发现这类项目的价值不在跑分。它把三样东西放上同一张桌子一套让 AI 参与硬件设计的流程、一份比特级可验证的实现、一台「慢但完全透明」的机器。对做推理优化的人来说最后一样可能比多 20% 的吞吐更有用——因为你清楚每个周期去哪了。想上手的话除了那块卡其余部分都能在笔记本上跑pip install -e .下个小模型otpu-chat --backend isa就能在模拟器里对话仓库。
返回列表