BLOG
知识分享
技术文章、实战教程、经验心得
共找到 2 篇文章
open-sourceLLMinference
开源项目第174期:AirLLM — 4GB 显存跑 70B,8GB 跑 405B,3.7GB 跑 2.8 万亿参数的 Kimi K3
AirLLM 用逐层推理打破显存壁垒:把模型按 Transformer 层拆分保存到磁盘,推理时每次只把一层加载进显存,用完立即释放。无需量化、蒸馏或剪枝,即可在消费级 GPU 上运行 70B 到 2.8T 参数的模型。支持 Llama、Qwen3、DeepSeek、Kimi K3,可选 4bit/8bit 权重压缩加速约 3 倍。25.8k Stars,Apache 2.0,pip install airllm 即开。
·约 10 分钟阅读
大模型LLM面试
阿里通义实验室大模型面试题汇总
整理阿里通义实验室(Qwen团队)大模型方向的三轮面试题目,涵盖模型架构、训练优化、推理加速、RAG等核心知识点
·约 5 分钟阅读