AI 快讯 编译自 marktechpost #模型发布#工具调用#边缘计算

Needle 2 发布:45M 参数工具调用模型,14MB 二进制文件,28MB 内存运行完整会话

Cactus Compute 推出开源模型 Needle 2,仅 45M 参数,以 14MB 二进制文件分发,28MB 内存即可运行完整会话,专为无 GPU/NPU 的硬件设计。本文解析其架构、性能与中文圈应用场景。

编译发布 2026/08/14 原文发布 2026/08/14

一句话看懂

Cactus Compute 发布开源模型 Needle 2,仅 45M 参数,以 14MB 二进制文件分发,28MB 内存即可运行完整会话,专为无 GPU/NPU 的硬件设计。

详细发生了什么

Cactus Compute 正式发布 Needle 2,一个面向工具调用(tool calling)、设备使用(device use)和结构化提取(structured extraction)的开源模型。整个模型打包为单个 14MB 的二进制文件,运行完整会话仅需约 28MB 内存。权重以 CQ2-bit 量化(Cactus Quants)训练和部署,并封装在自研 C++ 引擎中,无需安装运行时,推理时也无额外下载。

性能方面,在 Raspberry Pi 5 上解码吞吐达 500 tokens/sec,在 Meta Quest 3S 和 Apple Vision Pro 上为 400–1,500 tokens/sec,在低于 200 美元的手机上为 300–700 tokens/sec。设计理念是:将杂乱的句子映射到类型化函数签名无需世界知识或开放式文本,因此 45M 参数足够,且目标硬件无需 GPU 和 NPU。

Needle 2 支持 macOS、Linux(x86-64、ARM64、ARMv7、RISC-V、MIPS32el)、Windows、Android、iOS/watchOS/tvOS 和 WebAssembly。Cactus 表示 Pebble 已在 Index 01 应用中本地运行 Needle,用于离线语音操作。

架构上,Needle 2 采用 Simple Attention Network:用 Hadamard MLP 替换 FFN,保留 GQA 注意力,加入基于哈希 n-gram 表的 engram 键值记忆,并使用多通道超连接。网络为 27 层、512 宽度。预训练使用专有 115B token 语料库,后训练 38B token。每 token 消耗 70 MFLOPs,其中 35M 参数参与矩阵乘法。

引擎方面,权重从不解压到 RAM,2-bit 码在向量寄存器中展开并融合为整数点积。启动时探测 CPU 并选择内核层级(SDOT、NEON、AVX2、RISC-V vectors、wasm SIMD 或 scalar)。从 JSON schema 编译的字节级语法约束每个 token,结构 token 可跳过最多 98% 的词汇投影。注意力使用 256-token 滑动窗口,系统提示和工具声明固定为 KV sinks,内存稳定在 28MB。工具声明不超过五个时直接渲染,超过五个则通过对比检索头嵌入每个 schema,每轮评分并只取前五,未选工具不可达。每个响应附带置信度值,离题请求返回空调用 []。

评估方面,在五个公开函数调用基准上使用有序严格精确匹配。Needle 2 在 Seal-Tools 两个子集上领先,Mobile Actions 函数名准确率达 98.3%,但在 BFCL v4 上落后,归因于语料分布差异。

中文圈视角

对中文用户而言,Needle 2 的吸引力在于其极低的资源占用和离线能力。国内开发者常面临数据出境合规压力,Needle 2 的完全本地运行特性使其在智能家居、可穿戴设备、车载控制等场景具有天然优势,无需将音频或指令上传云端。

与国产模型相比,DeepSeek、Kimi 等大模型虽性能更强,但依赖云端 API,且对硬件要求高。Needle 2 的 14MB 体积和 28MB 内存占用,使其能运行在低端 IoT 设备上,这是国内许多边缘计算场景(如智能音箱、POS 机)的痛点。不过,Needle 2 的语料以英文为主,对中文指令的适配可能有限,国内团队需自行微调或评估。

此外,Needle 2 的开源特性允许本地化部署,但需注意其许可证和依赖的 C++ 引擎,国内开发者可能更倾向于 ModelScope 上的国产替代,但目前尚无类似定位的产品。

几条值得记住的细节

  • Needle 2 模型仅 45M 参数,二进制文件 14MB,运行内存约 28MB。
  • 解码速度:Raspberry Pi 5 上 500 tokens/sec,Quest 3S 上 400–1,500 tokens/sec。
  • 支持多种架构,包括 RISC-V 和 WebAssembly,覆盖广泛硬件。
  • 语法约束可跳过最多 98% 的词汇投影,提升效率。
  • 工具声明超过五个时,通过对比检索只取前五,未选工具不可达。

一句话总结

Needle 2 让离线工具调用在低端硬件上成为可能,中文开发者可探索其在 IoT 和隐私敏感场景的应用。