AirLLM 让 4GB 显存单卡直接运行 Llama 3 70B,8GB 跑 405B,12GB 跑 DeepSeek-V3,且无需量化、蒸馏或剪枝。项目核心是逐层流式加载技术,把模型参数按需从 CPU 或磁盘调入 GPU,推理完立即释放,显存占用被压到极低。 AirLLM 的出现直接改变了很多人对大模型硬件需求的认知。此前,70B 参数量级的……

阅读全文