Needle 2 把 45M 参数的工具调用模型打包成 14MB 单一二进制,运行仅需 28MB 内存,在三星 A 系列手机上达到 300+ tok/s。Cactus Compute 开源的这个项目,直接把工具调用能力塞进端侧设备。

端侧 AI 部署一直面临内存、存储和功耗的三重限制。传统大语言模型参数量动辄几十亿甚至上千亿,量化后模型文件仍以 GB 计,普通手机难以承载。云端调用虽然能提供强大能力,但依赖网络、产生延迟,还涉及隐私和费用问题。Needle 2 的出现提供了一种极端轻量化的解决方案,它把专注工具调用的能力浓缩到极致,让中低端设备也能本地运行。

这个项目由 Cactus Compute 团队开源,核心亮点在于体积和资源占用。整个模型最终以单一二进制形式分发,用户无需额外下载权重或依赖库,安装后即可直接执行。这样的设计极大简化了部署流程,尤其适合对安装包大小敏感的手机和物联网场景。

14MB 单一二进制如何装下 45M 参数

Needle 2 的模型参数规模为 45M,这里的 M 指百万级别参数。传统 FP32 精度下,每个参数占用 4 字节,45 百万参数理论上需要约 180MB 存储。但实际发布的二进制仅 14MB,压缩比接近 13 倍。

实现这种压缩主要依赖量化技术和专用打包格式。团队很可能将模型权重量化为 INT4 或更低比特,同时去除冗余元数据,只保留推理必需的核心计算图。单一二进制形式意味着所有权重被静态编译进可执行文件,避免了单独的 .bin 或 .gguf 文件,进一步减少了文件头和对齐开销。

这种打包方式牺牲了一定通用性,换来的是极致的体积控制。45M 参数本身已是极小规模,团队通过针对工具调用任务进行剪枝和蒸馏,只保留与函数选择、参数填充高度相关的权重。结果是整个模型不再需要加载外部 tokenizer 或大型 embedding 表,这些组件可能被高度优化或融合进二进制中。

从技术角度看,这种压缩路径与传统 LLM 部署完全不同。主流云端模型追求参数量带来的涌现能力,而 Needle 2 则聚焦特定任务,通过架构简化实现体积与性能的平衡。目前信号中未披露具体量化比特数和压缩算法细节,但 14MB 的最终体积已足够说明其在存储端的突破。

28MB 内存下的端侧推理门槛

除了存储体积,运行时内存占用是端侧部署的另一大瓶颈。Needle 2 宣称运行仅需 28MB 内存,这意味着即使在只有几百 MB 可用 RAM 的低端安卓设备上,也能轻松加载并推理。

低内存需求主要来自小参数量和高效的 KV 缓存管理。45M 参数模型在量化后激活值和中间状态占用极少,加上工具调用场景通常上下文较短,KV 缓存不会膨胀。团队可能采用了静态内存分配策略,避免动态申请带来的碎片化,进一步压低峰值占用。

对普通安卓手机而言,28MB 门槛几乎可以忽略不计。当前即使是入门级三星 A 系列或类似千元机,系统预留给单个应用的内存通常远超 100MB。开发者可以将 Needle 2 嵌入现有 App 中,作为本地智能助手模块,无需担心内存杀进程或影响其他应用运行。

这一特性直接降低了端侧 AI 的部署门槛。过去许多端侧模型虽号称轻量,但实际运行仍需 200MB 以上内存,且需要特定 NPU 支持。Needle 2 的 28MB 需求让 CPU 推理成为现实,兼容性大幅提升,适合没有高性能 AI 加速器的设备。

三星 A 系列 300+ tok/s 的真实表现

在三星 A 系列手机上,Needle 2 能达到 300 以上的 token 生成速度。这一数据表明,即使在消费级中低端 SoC 上,模型也能提供接近实时的交互体验。

300+ tok/s 的速度意味着生成一个典型工具调用响应(约 50-100 token)仅需不到 0.3 秒,用户几乎感觉不到延迟。这与云端模型通过网络传输的往返时间形成鲜明对比,云端调用通常在 500ms 到数秒之间,还受网络状况影响。

速度优势还体现在成本上。端侧运行完全免费,无需支付 API 调用费用。对于高频工具调用场景,如本地自动化脚本或 IoT 设备控制,累计成本差异会非常显著。同时本地运行避免了数据上传,天然保护隐私。

不过这一速度仅针对特定三星 A 系列机型得出,实际表现会随芯片架构、散热和后台负载变化。目前还不清楚在更低端设备或长时间运行下的稳定性,但 300+ tok/s 已足以证明小模型在消费级硬件上的实用性。

工具调用能力在小模型上的实现路径

工具调用要求模型不仅生成文本,还能准确判断何时调用外部函数、填充正确参数。传统云端 LLM 通过大规模预训练和指令微调获得这一能力,而 Needle 2 在 45M 参数和 14MB 体积内实现了类似功能。

实现路径很可能依赖高度针对性的训练数据和架构设计。团队专注于工具调用这一垂直任务,训练时大量使用包含函数定义、调用格式的合成数据,让小模型快速掌握模式识别。模型可能采用简化版的注意力机制或专用解码头,直接输出结构化调用指令,而不是通用文本。

与传统云端 LLM 的调用方式不同,云端模型通常先生成自然语言思考过程,再解析为 JSON 或特定格式调用。而 Needle 2 可能直接以二进制或紧凑格式输出调用结果,减少后处理开销。这种端到端的工具调用路径更适合资源受限环境,减少了中间步骤带来的内存和计算浪费。

目前信号未提供模型架构细节,但从体积和用途判断,它放弃了通用对话能力,专精于判断和执行工具调用。这是一种典型的「窄而深」路线,在有限参数内把工具调用准确率做到可用水平。

与主流云端工具调用模型的直接对比

与主流云端工具调用模型相比,Needle 2 在体积上处于绝对优势。云端模型如 GPT-4o 或 Claude 3 系列参数量以千亿计,部署成本高昂,需要强大 GPU 集群支持。而 Needle 2 仅 14MB 二进制,可直接复制到任何设备。

速度方面,云端模型单次调用延迟受网络和队列影响,通常在 1-3 秒,而 Needle 2 的 300+ tok/s 让本地调用几乎瞬时完成。部署成本上,云端依赖 API 付费,本地运行零边际成本。

适用场景差异明显。云端模型适合复杂、多跳推理和需要海量知识的场景,Needle 2 则更适合固定工具集的简单调用,如控制本地设备、查询传感器数据或执行预定义脚本。准确率上,云端大模型通常更高,但 Needle 2 在特定垂直任务上可能通过针对性优化达到接近水平。

总体看,Needle 2 不是要取代云端模型,而是提供一种补充方案。在网络不可用、隐私敏感或需要低延迟的场景中,它的优势更为突出。

对中国手机与物联网场景的落地价值

对中国手机厂商而言,Needle 2 提供了一种无需依赖高通 AI 引擎或昂贵 NPU 的本地智能方案。国内众多中低端机型搭载联发科或自研芯片,内存和算力有限,14MB/28MB 的规格能轻松适配。厂商可将其集成到系统级助手,实现离线工具调用,提升产品差异化。

物联网设备是另一大潜在市场。智能家居、工业传感器、可穿戴设备通常只有几十 MB 内存和极低功耗预算。Needle 2 的低资源占用让这些设备获得本地决策能力,无需时刻连云,降低延迟和流量消耗。例如智能摄像头可本地判断是否需要调用报警工具,智能电表可自主执行数据上报函数。

对本地开发者来说,开源特性意味着可以自由修改、针对中文工具集继续微调。国内丰富的手机和 IoT 生态为 Needle 2 提供了广阔测试场。但也存在限制:45M 参数规模决定了其知识容量和复杂推理能力有限,无法处理需要丰富世界知识的任务。目前还不清楚模型对中文工具描述的支持程度,实际落地仍需开发者进行适配训练。

总体而言,Needle 2 代表了端侧 AI 向极致轻量化发展的一个方向。它证明在专注任务下,小模型能提供实用价值,尤其适合中国庞大的中低端设备存量市场。未来若能结合更多垂直领域数据进一步优化,其落地空间会更加广阔。

参考来源