RTX 4060 显卡运行 35B 模型达到每秒 39 token,这一结果来自伯克利与 MIT 联合开源的 FreeToken 框架。InfoQ 报道显示,该项目针对消费级硬件的量化与内核优化,让本地大模型推理首次在主流显卡上实现实用速度。 FreeToken 项目把注意力放在消费级 GPU 上。测试显示,在 RTX 4060 上运行 35B 参数模型时,生成速度达到每秒 39 Token。……

阅读全文