open-sourceLLMinference
开源项目第174期:AirLLM — 4GB 显存跑 70B,8GB 跑 405B,3.7GB 跑 2.8 万亿参数的 Kimi K3
AirLLM 用逐层推理打破显存壁垒:把模型按 Transformer 层拆分保存到磁盘,推理时每次只把一层加载进显存,用完立即释放。无需量化、蒸馏或剪枝,即可在消费级 GPU 上运行 70B 到 2.8T 参数的模型。支持 Llama、Qwen3、DeepSeek、Kimi K3,可选 4bit/8bit 权重压缩加速约 3 倍。25.8k Stars,Apache 2.0,pip install airllm 即开。
·约 10 分钟阅读