Show HN: Needle2:面向手机、可穿戴设备、智能家居和机器人的14MB智能体LLM

Hacker News Top 模型

摘要

Cactus Compute 发布 Needle 2,这是一个45M参数的智能体LLM,压缩为14MB二进制文件,适用于手机、可穿戴设备、智能家居和机器人,在树莓派5上实现每秒500+ tokens,运行内存仅28MB。

嘿,HN,<p>我是Cactus的Henry!<p>我们之前发布了Cactus Needle,一个14MB的智能体LLM,用于工具调用、设备使用以及针对手机、可穿戴设备、智能家居、小型机器人和微控制器的结构化提取。我们在这里收到了很好的反馈,现在已经采纳了这些建议,发布了Needle 2。<p>整个模型是一个14MB的二进制文件,在28MB RAM中即可运行完整会话;拥有4500万参数,采用2bit压缩。Needle在树莓派5上的解码速度达到500 tokens/秒,在Meta Quest 3S和Apple Vision Pro等VR设备上为400-1,500 tokens/秒,在三星A系列等200美元以下手机上为300-700 tokens/秒。<p>在工具调用和移动设备使用基准测试中,Needle 2与最接近的小型模型(如LFM2.5 230M和Apple Foundation Model)互有胜负,而体积小5倍到70倍,且它们都是f16精度,Needle 2仅为2bit。Needle基于我们论文中的简单注意力网络(<a href="https:&#x2F;&#x2F;arxiv.org&#x2F;abs&#x2F;2607.18363" rel="nofollow">https:&#x2F;&#x2F;arxiv.org&#x2F;abs&#x2F;2607.18363</a>)。<p>边缘AI近来往往意味着Mac和PC,但今天全球超过210亿台联网物联网设备中,这仅占15亿台。在新兴市场,大多数手机的售价低于200美元,没有NPU,GPU也很便宜。这些设备包括廉价手机、树莓派、微控制器、可穿戴设备、像Reachy Mini这样的小型机器人,以及联网家居设备。<p>一个与Needle宽度和深度相同的传统transformer每个token消耗164 MFLOPs,即使压缩到Needle的参数规模也需要87,而Needle只需70。即使在高端手机上,常驻助手也受功耗预算限制;每个MFLOP都是毫瓦时级别的能量。与最小的可用LLM相比,Needle每个token的能耗少7倍到85倍。更多架构细节请参见链接。<p>当我们把面向消费设备的人工智能结构化为带有类型参数的函数时,唯一困难的部分是将一个杂乱的句子映射到这些函数上:哪个函数,用哪些值。我们的研究发现,在这种框架下,问题不需要世界知识,也不需要开放式文本生成,这就是4500万参数就足够的原因。<p>Needle 2扩展了结构化提取功能,可以将schema作为工具传入,模型返回结构化输出。你可以将Needle用作带有枚举字段的文本分类模型,或通过提供提取关键字段的schema来作为摘要模型,几乎可以做任何事情,只是不能自由生成文本。<p>每个产品都有自己的工具词汇表,微调Needle可以帮助它在自定义任务上达到前沿性能。使用Python包(<a href="https:&#x2F;&#x2F;github.com&#x2F;cactus-compute&#x2F;needle" rel="nofollow">https:&#x2F;&#x2F;github.com&#x2F;cactus-compute&#x2F;needle</a>),只需提供几个示例,借助自动数据生成流水线,就可以在Mac/PC上在几分钟到几小时内完成对Needle的微调。<p>尽管如此,每次响应都会携带一个基于我们Cactus Hybrid技术学习到的置信度分数。如果高于你的阈值,就执行;如果低于,则升级到云端或更大的模型。将Needle 2与私有的DeepSeek-v4-Flash部署相结合,几乎零成本,尤其适用于企业级任务,我们可以帮助配置。<p>我们在Needle 2上投入了大量思考,但可能仍有很多不足。请使用所提供链接中的playground来测试Needle并分享你的想法,不胜感激!
查看原文
查看缓存全文

缓存时间: 2026/08/10 23:37

# Needle 2 - 面向微型设备的 14 MB Agentic LLM | Cactus 今天,我们发布 Needle 2:一个面向工具调用、设备使用和结构化抽取的开放**45M 参数**模型。整个模型是一个单一的 14MB 二进制文件,完整会话仅需 28MB RAM。它基于我们的 Simple Attention Network (https://arxiv.org/abs/2607.18363) 研究成果构建,采用 **Cactus Quants** 压缩至 **CQ2-bit**,并集成到其自研引擎中。 在工具调用和移动设备使用基准测试中,Needle 2 与 FunctionGemma 270M、LFM2.5 230M、Apple FM 等其他小模型互有胜负;它的体积小 5× 到 70×,且只有 2 bit,而它们是 f16。Needle 在 Raspberry Pi 5 上达到 **500 tokens/sec** 解码速度,在 Meta Quest 3S 和 Apple Vision Pro 等 VR 设备上为 400–1,500 tokens/sec,在三星 A 系列等 200 美元以下手机上为 300–700 tokens/sec。峰值会话内存约 28MB,因此 Needle 可以在 ESP32-S3 等新型微控制器上运行。 Playground 让你可以为可穿戴设备、机器人、智能家居、手机和汽车测试 Needle。Needle 采用 Apache 2.0 许可,权重已发布在 Hugging Face (https://huggingface.co/Cactus-Compute/needle-2);仓库 (https://github.com/cactus-compute/needle) 能让你快速上手。 45M 参数 800+ tok/s Pi5 预填充 500+ tok/s Pi5 解码 CQ2-bit 压缩 14 MB 文件大小 28 MB 会话内存 **图 1.** 在面向智能设备及更低端设备设计的最小模型中,Mobile-Actions(google/mobile-actions eval 划分,961 行)上的有序严格精确匹配与总参数量的对比。Needle 2 是通过随附二进制、以 CQ2-bit 部署精度、开启工具检索端到端测量的;基线在 vLLM 下运行发布的 checkpoint,Apple FM 在设备上运行。 ## 我们的赌注 **将端侧 AI 带到 200 美元以下的设备:** Edge AI 最近一直被等同于 Mac 和 PC,但边缘主要是廉价硬件:超过 210 亿台联网 IoT 设备,而 PC 约 15 亿台;在新兴市场,大多数手机的出货价低于 200 美元。算上平价手机、Raspberry Pi、微控制器、可穿戴设备、像 Reachy Mini 这样的小型机器人,以及智能家居设备,大约五分之四的边缘设备价格低于 200 美元。这就是 Needle 所瞄准的硬件:没有 GPU、没有 NPU、只有几百 MB RAM。 **函数调用与设备使用:** 开灯不需要一个前沿模型。手表、家居、机器人:每个都已经把自身能力暴露为带类型参数的函数,所以唯一困难的部分是将一句杂乱的话映射到这些函数上:哪个函数,用哪些值。这样定义后,问题就不再需要世界知识,也不需要开放式散文,这也就是为什么在对话需要数十亿参数的地方,4500 万参数就足够了。这个更小的表述方式,是其他一切赌注所依据的根基。 **抽取与结构化输出:** schema 即接口,同样的表述也适用于文档:一个 schema 加上一段文字,就能返回类型化字段;一个 enum 字段就是一个分类器;一个 array 字段则在一次调用中收集一个列表。我们用契约而非约定来强制这一点:每一轮都用调用信封(call envelope)回答,空调用就是拒绝,从声明 schema 编译出的字节级文法约束着每一个 token。文法承担了语法部分,因此全部 4500 万参数都用于选择函数并把参数锚定到用户的措辞中。 **端云协同:** 没有哪个小模型能覆盖一切,所以 Needle 会明确说不,而不是猜测:每个响应都带有学习到的置信度分数,离题请求则返回空调用。高于你的阈值,就执行;低于阈值,就再问一次或升级到云端。大多数设备请求是常规控制,所以升级很少发生,默认路径保持私密、即时、免费。 **无损 2bit 量化:** 小模型在事后量化(post-hoc quantization)下会崩坏,因此我们从不事后量化:Needle 2 从预训练到后训练都针对 Cactus Quants 进行训练,权重、激活值、KV cache 都一样。你部署的 2bit 模型就是被训练的那个模型。这正是把 4500 万参数塞进 14MB、且在我们的一组测试中毫无损失的原因。 **模型与推理协同设计:** 每一个架构选择在赢得它的参数之前,都在目标硬件上经过基准测试。交付物是这一对组合,而不仅仅是权重:一个无依赖的 C++ 二进制文件,启动时探测 CPU 并选择内核,模型、tokenizer 和文法编译器都封装在其中。一个工件就能从 Cortex-M 跑到 x86 再到 WebAssembly。无需安装任何东西,也无需下载任何东西。 **在 Mac/PC 上微调:** 每个产品都有自己的工具词汇表,而 4500 万参数的模型足够小,可以在

相似文章

Cactus-Compute/needle3

Hugging Face Models Trending

Needle 3 是一款针对移动设备和可穿戴设备等边缘设备优化的紧凑AI基础模型,在一个8-29 MB的文件中提供工具调用、结构化提取和文本嵌入功能。

Cactus-Compute/needle

Hugging Face Models Trending

Cactus-Compute 发布了 Needle,这是一个从 Gemini 3.1 蒸馏而来的 2600 万参数模型,采用纯注意力架构,针对设备端推理和本地微调进行了优化。