
AirLLM在 4GB 显卡上跑 70B 大模型的推理内存优化库无需量化、蒸馏或剪枝AirLLM 把 70B 大语言模型的推理内存需求压缩到单张 4GB 显卡即可运行405B 的 Llama 3.1 也能在 8GB 上跑671B 的 DeepSeek-V3 只需约 12GB。项目源码备份下载夸克网盘完整项目已同步备份到夸克网盘永久有效、无需提取码https://pan.quark.cn/s/f07260e96b53项目简介AirLLMlyogavin/airllm是 Gavin Li 开源的一款大语言模型推理内存优化库。它的宣传语非常直接“dramatically reduces inference memory usage, letting 70B large language models run on a single 4GB GPU card — without quantization, distillation, or pruning.”——核心思路是让模型以 layer-by-layer 流式加载的方式运行GPU 上始终只有一层权重从而实现极低的显存占用。它瞄准的是现有工具的痛点70B 级模型通常需要多卡或大显存才能跑普通人手里 4GB / 8GB 的消费级显卡根本无力承担而量化、蒸馏又往往牺牲精度。AirLLM 从架构层面彻底重构推理过程不改动模型本身即可让普通人用一张小显卡跑超大模型。为什么选 AirLLM 无需量化、蒸馏或剪枝直接在原始模型精度下运行不牺牲任何 accuracy。⚡ 极简使用方式一行代码AutoModel.from_pretrained(...)不区分模型类型自动检测并加载。 极低的显存门槛单次只加载一层到 GPU显存消耗取决于单层大小而非模型总量——671B 的 DeepSeek-V3 在 ~12GB 上跑405B 的 Llama 3.1 在 8GB 上跑。 支持 3x 推理加速内置基于 block-wise quantization 的压缩模式4bit / 8bit在不明显损失精度的前提下最高提速 3 倍。 跨平台支持macOSApple Silicon、Linux、Windows 均可运行CPU 推理也已支持。 持续跟进最新模型Llama 3.x、Qwen3、DeepSeek V2/V3、Kimi K32.8T等几乎发布当天即支持。核心特性Layer-by-layer 流式推理AirLLM 的核心 trick一次只在 GPU 上保留一层权重。这样显存需求取决于单层的大小而不是整个模型的参数量——这也是为什么 671B 模型能在 12GB 显存上跑起来。AutoModel 全自动检测无需指定模型架构类直接传入 HuggingFace repo ID 或本地路径AirLLM 自动检测模型类型并完成加载fromairllmimportAutoModel modelAutoModel.from_pretrained(Qwen/Qwen3-32B)模型压缩4x / 8bit 量化加速modelAutoModel.from_pretrained(garage-bAInd/Platypus2-70B-instruct,compression4bit)与常规量化不同AirLLM 只量化权重部分不量化 activation因为瓶颈在磁盘加载而非计算所以精度损失几乎可以忽略。预取机制重叠加载与计算默认开启的 prefetching 在加载下一层的同时进行当前层的推理计算带来约 10% 的速度提升。安装方式一pip 安装pipinstallairllm方式二从源码构建gitclone https://github.com/lyogavin/airllm.gitcdairllm pipinstall-e.方式三CPU 推理无 GPUmodelAutoModel.from_pretrained(Qwen/Qwen3-32B,device_mapcpu)上手运行第一个示例安装后只需三行代码即可运行 70B 模型fromairllmimportAutoModel modelAutoModel.from_pretrained(Qwen/Qwen3-32B)input_text[What is the capital of United States?]input_tokensmodel.tokenizer(input_text,return_tensorspt,return_attention_maskFalse,truncationTrue,max_length128,paddingFalse)outputmodel.generate(input_tokens[input_ids].cuda(),max_new_tokens20,use_cacheTrue,return_dict_in_generateTrue)print(model.tokenizer.decode(output.sequences[0]))支持的其他模型示例# Qwen 系列modelAutoModel.from_pretrained(Qwen/Qwen3.8-27B)# 27B dense VL, 3.33GBmodelAutoModel.from_pretrained(Qwen/Qwen3.8-Flash-Next)# 125B MoE 51B PLE, 5.95GBmodelAutoModel.from_pretrained(deepseek-ai/DeepSeek-V3)# 671B, ~12GBmodelAutoModel.from_pretrained(Qwen/Qwen3-235B-A22B)# 235B, ~3GB# Kimi K32.8T2026/07 支持modelAutoModel.from_pretrained(Kimi/Kimi-K3)# 2.8T 级4GB性能 / 对比可选模型参数量所需显存Qwen3 / Mistral / Phi≈8B~1–2 GBQwen3-30B / Mixtral (MoE)30–47B~1–3 GBQwen3.8-27B (dense VL)27B3.33 GBQwen3.8-Flash-Next (MoEPLE)~180B5.95 GBQwen3-235B (MoE)235B~3 GBLlama 3.x 70B (full precision)70B~4 GBLlama 3.1 405B405B~8 GBDeepSeek-V3671B~12 GB启用compression4bit后推理速度最高提升3x精度损失可忽略。适用场景消费级显卡用户只有 4GB / 8GB 显存却想用 70B 大模型。研究 / 教学环境需要快速跑大模型实验又不想申请昂贵 GPU 配额。边缘部署在资源受限的设备上部署大语言模型推理服务。AI Agent 本地后端本地跑 LLM 作为 Agent 的底层推理引擎无需云端 API 费用。结语AirLLM 用一种优雅的方式解决了大模型显存门槛的问题——不是通过牺牲精度的量化而是通过改变推理的加载方式。它让普通人的小显卡也能跑 671B 的模型这一点对本地 AI 生态的普及意义重大。如果你有一张 4GB / 8GB 的显卡却一直没跑过大模型AirLLM 值得 clone 下来跑一跑也能在 Discord 社区 里看看其他用户是怎么用的。资源备份夸克网盘完整源代码已同步备份到夸克网盘可直接下载夸克网盘分享链接https://pan.quark.cn/s/f07260e96b53永久有效无需提取码参考链接仓库地址https://github.com/lyogavin/airllm夸克网盘备份https://pan.quark.cn/s/f07260e96b53许可证Apache 2.0