AirLLM:在4GB显存的GPU上跑70B大模型,不需要量化
如果大模型推理被显存卡住也许不是硬件不够而是方法不对。读完本文你将了解AirLLM 的核心原理 | 安装与使用 | 支持的模型 | 与 vLLM/TensorRT-LLM 的对比这个项目解决什么问题70B 参数的大模型需要多少显存按照常规计算70B 模型在 FP16 下大约需要 140GB 显存。即使 4-bit 量化也需要 35GB 以上。这意味着你至少需要 4 张 A100 80GB 才能跑起来。AirLLM 给出的答案是一张 4GB 显存的消费级显卡就够了而且不需要量化、蒸馏或剪枝。这个项目的核心洞见是大模型的层间计算是高度时间解耦的。你不需要在推理时把整个模型加载到显存里——你可以一层一层地加载算完一层再加载下一层。就像读一本书不需要把整本书都摊在桌上。AirLLM 在 GitHub 上积累了 29K stars最近又因为支持了 Kimi K32.8T 参数在单卡 3.72GB 显存下运行而引发关注。核心亮点分层推理Layer-wise StreamingAirLLM 把模型加载拆成了两个阶段加载阶段只把当前需要计算的层加载到显存推理阶段一层一层地计算计算完成后释放显存加载下一层这个思路的本质是用时间换空间。相比传统方案一次性加载整个模型AirLLM 的显存占用峰值大约是常规方案的 1/10 到 1/20。压缩技术3x 加速AirLLM 的第二代引入了 prefetching预取机制在当前层计算的同时预先将下一层的数据加载到显存。这样计算和 IO 可以并行理论上有 10% 的性能提升。配合模型压缩Layer-wise Compression推理速度能达到传统方案的 3 倍。一行代码搞定fromairllmimportAutoModel modelAutoModel.from_pretrained(Qwen/Qwen3-32B)# 想跑更大的# model AutoModel.from_pretrained(Qwen/Qwen3-235B-A22B) # 235B, 约3GB显存AutoModel 会自动检测模型类型不需要手动指定。支持的模型包括 Llama3/3.1/3.2、DeepSeek V2/V3、Qwen2.5/3、Gemma、Phi-4、ChatGLM、Baichuan 等主流模型。快速上手pipinstallairllmMac 用户也能直接跑# macOS 也能运行 70B 模型modelAutoModel.from_pretrained(Qwen/Qwen3-32B)outputsmodel.generate(prompt你好,max_length128)print(outputs)官方还提供了 Colab 示例可以直接在免费的 T4 GPU 上运行 405B 模型。支持的模型与显存对比模型常规方案显存需求AirLLM 显存需求Llama 70B~140GB (4×A100)~4GB (单卡 RTX 3060)Llama 405B~810GB~8GB (单卡 RTX 3080)DeepSeek-V3 (671B)~1340GB~12GBKimi K3 (2.8T)~5600GB~3.72GB (稀疏MoE)Kimi K3 之所以能在如此小的显存下运行是因为它是稀疏 MoE 模型——每个 token 只激活一部分专家不需要整个层一起加载。我的评价AirLLM 的价值不在于让穷人也能跑大模型而在于降低了大模型推理的硬件门槛让更多研究者和开发者能在消费级硬件上做实验。相比 vLLM 和 TensorRT-LLM它们追求的是吞吐量和延迟AirLLM 的定位更偏向单机实验和开发。它不是生产环境的最优解但绝对是个人研究和快速原型的首选。竞品对比vLLM生产级推理框架追求吞吐量和低延迟但显存需求仍然是全模型加载TensorRT-LLMNVIDIA 官方推理优化性能最强但依赖 CUDA部署复杂AirLLM单机实验友好显存占用最低部署最简单如果你的场景是想在个人电脑上试一下某个新模型AirLLM 是目前最优的选择。