ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AirLLM:4GB显存跑通70B大模型的量化推理优化方案

AirLLM:4GB显存跑通70B大模型的量化推理优化方案 AirLLM4GB显存跑通70B大模型的量化推理优化方案【免费下载链接】airllmAirLLM 70B inference with single 4GB GPU项目地址: https://gitcode.com/GitHub_Trending/ai/airllm直接加载一个70B大模型CUDA向你要596.04 GiB显存4GB的卡看到这个数字只能干瞪眼。而用AirLLM的块量化推理优化同一个任务的推理时间从449秒降到157秒70B级模型可以直接跑在4GB显存的卡上——这就是低显存大模型推理。一次真实的OOM现场你敲下model.generate回车终端卡了几秒然后蹦出这样一行红字报错很直白要分配596.04 GiB内存GPU总显存只有39.56 GiB差了十几倍对一张4GB的卡来说差距拉到140多倍。这不是调参问题怎么调权重也装不下。块量化把比特数砍下去块量化的思路不复杂整块权重不再共用一个缩放系数而是切成小block每个block用自己的scale把fp16权重压成4bit。70B模型的权重体积随之缩到约四分之一原本要几百GiB显存的权重变成4GB卡也能装下的样子。加载时只把当前用到的那层量化权重送进显存其余留在磁盘上。代价是推理时要反序列化权重但这个代价比想象中小。同一个任务、三条柱子无压缩449s8bit块量化237s4bit块量化157s——压得越狠跑得越快约2.9倍。支持哪些模型架构它不只跑LLaMA。翻一下 air_llm/airllm/ 目录LLaMA、Qwen、Qwen2、Mistral、Mixtral、InternLM、Baichuan、ChatGLM、Kimi K3各有一份实现文件你手头的架构大概率已经在里面把模型repo ID丢给 AutoModel 就行。如果每次都从磁盘现拆现加载用起来还是别扭——项目把权重拆层后做了持久化air_llm/airllm/persist/ 里有safetensors和MLX两套实现下次推理直接读不用重新切分。想接新模型的话examples/ 下的示例notebook可以直接抄从405B到2.8T MoE跑法都写在里面。两条命令跑通git clone https://gitcode.com/GitHub_Trending/ai/airllm pip install -r requirements.txt装完跟着README的Quickstart走第一次推理就能起来。做实验的研究者4GB显存足够你跑70B的消融和数据验证不用再排队等大卡想在本地部署的开发者它给了消费级显卡一条能落地的路要课堂演示的老师用自己的笔记本就能放出70B的真实推理过程OOM报错不会再打断你的课。【免费下载链接】airllmAirLLM 70B inference with single 4GB GPU项目地址: https://gitcode.com/GitHub_Trending/ai/airllm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表