AirLLM 用逐层流式加载让 4GB 显存跑通 Llama 3 70B
AirLLM 让 4GB 显存单卡直接运行 Llama 3 70B,8GB 跑 405B,12GB 跑 DeepSeek-V3,且无需量化、蒸馏或剪枝。项目核心是逐层流式加载技术,把模型参数按需从 CPU 或磁盘调入 GPU,推理完立即释放,显存占用被压到极低。 AirLLM 的出现直接改变了很多人对大模型硬件需求的认知。此前,70B 参数量级的……
专注于AIGC、Android、Java、Go语言(golang)、React、Next、Vue、移动互联网、项目管理、软件架构