14MB 二进制塞进 45M 参数工具调用模型:Needle 2 如何跑在手机端
Needle 2 把 45M 参数的工具调用模型打包成 14MB 单一二进制,运行仅需 28MB 内存,在三星 A 系列手机上达到 300+ tok/s。Cactus Compute 开源的这个项目,直接把工具调用能力塞进端侧设备。 端侧 AI 部署一直面临内存、存储和功耗的三重限制。传统大语言模型参数量动辄几十亿甚至上千亿,量化后模型文件仍以 GB 计,普通手机……
专注于Android、Java、Go语言(golang)、移动互联网、项目管理、软件架构