ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

ANE基准测试完全指南:社区提交数据解读与Apple Silicon硬件选型参考

ANE基准测试完全指南:社区提交数据解读与Apple Silicon硬件选型参考 ANE基准测试完全指南社区提交数据解读与Apple Silicon硬件选型参考【免费下载链接】ANETraining neural networks on Apple Neural Engine via reverse-engineered private APIs项目地址: https://gitcode.com/GitHub_Trending/ane2/ANEANE基准测试ANE Benchmark是开源项目 ANE 的核心产出之一该项目通过逆向私有 API 在 Apple Neural EngineANE上训练神经网络而社区成员在各自硬件上跑出的实测数据则构成了目前最完整的一份跨代 ANE 性能对照表。本文解读 benchmarks/ANE_BENCHMARK_REPORT.md 中来自 7 款芯片的提交数据并给出实用的 Apple Silicon 硬件选型建议。 测试基准所有数据都来自同一个模型为了让不同芯片的数据具有可比性ANE基准测试统一使用Stories110M—— 一个 109.5M 参数的 Llama2 架构 Transformer12 层、维度 768、序列长 256在 TinyStories 语料约 2000 万 token上训练。关键设定项目配置架构Llama2RoPE、SwiGLU、RMSNorm、GQA-ready总参数量109.53M精度ANE 端 FP16CPU 端 FP32每步内核72 个60 个权重承载 12 个静态 sdpaBwd2优化器Adamlr 1e-4 ~ 3e-4原始数据以 JSON 形式收录在 benchmarks/community_results.json每位贡献者都附带了芯片型号、macOS 版本和备注说明。 训练性能解读谁是最快的 ANE 训练平台静态训练流水线training/train_large.m在 7 款芯片上的实测结果如下ms/step越低越好ANE 训练速度 (ms/step, 越低越好) ══════════════════════════════════════════════════════════ M1 Pro ████████████████████████████████████████░░░░ 148-163 ms M1 Max ██████████████████████████████████████░░░░░░ 143-167 ms M3 Ultra ██████████████████░░░░░░░░░░░░░░░░░░░░░░░░░░░ 91 ms M4 Pro ██████████████░░░░░░░░░░░░░░░░░░░░░░░░░░░░░ 69-73 ms M4 Max ████████████░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░ 64 ms M5 ████████████████████████░░░░░░░░░░░░░░░░░░░ 101-120 ms 0 50 100 150 200芯片ms/stepANE 耗时ANE TFLOPS利用率贡献者M1 Pro148–16332–35 ms0.57–0.633.6–4.0%moriwangM1 Max143–16735–45 ms0.54–0.653.4–4.1%andyg5000M3 Ultra开发参考机91~10 ms0.885.6%仓库参考值M4 Pro69–738.9 ms1.288.1%srt54558M4 Max6410.2 ms1.459.2%SethBurkart123M5101–1209.1–9.8 ms0.77–0.914.9–5.8%GitBubble三个关键发现M4 系是训练性能冠军M4 Max 以 64 ms/step 领跑M4 Pro 紧随其后约为 M1 系的 2 倍速度M5 基础款回归 M3 Ultra 水平实测峰值与 M4 Pro 相当~12.2 TFLOPS属同一 H16 ANE 家族但训练速度反而落后 M4 MaxM5 Pro/Max 尚未有人提交数据利用率普遍偏低3–9%这是当前 ANE 训练的真实水位——瓶颈在软件栈重编译、CPU 回退而非硅片本身作者也在 README.md 中明确提示这一点。⚡ ANE 峰值吞吐官方 TOPS是个坑第二组基准用 inmem_peak.m 测量 ANE 纯算力128× conv、512 通道、sp64 配置ANE 峰值吞吐 (TFLOPS, 越高越好) ══════════════════════════════════════════════════════════ M3 Pro ████████████████████░░░░░░░░░░░░░░░░░░░░░░░░░░ 9.98 M4 Pro ██████████████████████████████████░░░░░░░░░░ 12.57 M4 Max ██████████████████████████░░░░░░░░░░░░░░░░░░░ 10.93 M5 ████████████████████████████░░░░░░░░░░░░░░░░░░ 12.17 M1 Pro/Max ✗ FAILMIL 兼容性问题⚠️选型避坑提示Apple 各代Rated TOPS的统计口径并不一致——M1/M3 按 FP16 计算M4 改为 INT8/混合精度峰值因此15.8 vs 38 TOPS 这种数字不能直接比较应以实测 FP16 TFLOPS 列为准。两个值得玩味的细节M3 Pro 的隐藏上限在 52 个通道值中只有 ch512 能编译但在空间维度拉大sp2048时峰值冲到16.77 TFLOPS5 秒持续测试保持15.04 TFLOPS95.2% 利用率——空间维度是释放 M3 ANE 性能的关键Max ≠ 更强 ANEM4 Max 与 M4 Pro 共享同一套 16 核 ANE二者 TFLOPS 差异只是运行波动仅 Ultra 版才有 32 核。 跨代兼容矩阵你的芯片能跑什么这是提交数据中含金量最高的一张表直接决定能不能跑特性M1M3M4M5program(1.3) / ios18部分支持✅✅✅单 blob 权重格式❌ 失败✅✅✅逐矩阵权重 blob✅✅✅✅通道灵活性?仅 ch512灵活灵活M1 系独立基准测试ane_mil_gen.h的单 blob 权重编译失败但训练可通过 training/stories_mil.h 的逐矩阵权重路径正常运行macOS 26.x 陷阱[MLModel compileModelAtURL:]在独立基准上损坏项目已改用内存内 MIL 编译绕过PR #27macOS 15.x 上各代 M 系均可正常工作。 硬件选型参考不同需求怎么选你的需求推荐选择依据ANE 训练/实验性能最强M4 Max64 ms/step或 M4 Pro社区实测最快利用率最高9.2%已有 M3 Pro 设备可用但注意 ch512 限制峰值潜力 16.77 TFLOPS利用率 95.2%预算有限的 M1 用户能跑训练别指望独立基准148–167 ms/step基准测试会 FAIL新购 M5基础款峰值不错训练暂逊 M4 MaxH16 家族M5 Pro/Max 数据待补充 补充阅读training/m5result.md 记录了 M5 上的 4 项探针实验权重热重载、QoS 扫描、性能计数器、链式请求其中发现权重在编译期被固化是静态流水线的核心瓶颈——这也是动态流水线 training/training_dynamic/train.m 存在的意义。 如何在自己硬件上复现 ANE 基准测试只需 macOS 15 与 Apple Silicon三步即可复现下载训练数据bash download_data.sh约 41MB 预分词 TinyStories脚本见 training/download_data.sh跑训练基准cd training make train_large后执行./train_large ane_stories110M_ckpt.bin 256 20 1e-4跑峰值基准直接编译运行 inmem_peak.m。程序结束时会输出Efficiency Report总步数、编译耗时占比、ANE TFLOPS可配合 training/dashboard.py 的实时仪表盘监控损失曲线与功耗。如果你用的是社区没有覆盖的芯片把芯片型号、macOS 版本和完整输出提交到项目 Issue 即可——这正是本文所有数据的来源。 核心结论M4 系是当前 ANE 训练的最优选M4 Max 64 ms/stepM1 系可用但受限M5 基础款性能介于 M3 Ultra 与 M4 之间对比芯片请只看实测 FP16 TFLOPS官方 TOPS 口径跨代不一致ANE 训练利用率目前仅 3–9%瓶颈在软件栈——这也是该研究项目最有价值的探索空间全部社区原始数据可在 benchmarks/community_results.json 中查证完整报告见 benchmarks/ANE_BENCHMARK_REPORT.md。【免费下载链接】ANETraining neural networks on Apple Neural Engine via reverse-engineered private APIs项目地址: https://gitcode.com/GitHub_Trending/ane2/ANE创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表