Needle 2:面向手机、可穿戴设备、智能家居和机器人的 14MB 智能体 LLM。

Reddit r/LocalLLaMA 模型

摘要

Cactus 发布了 Needle 2,这是一款面向手机、可穿戴设备、智能家居设备和机器人的 14MB 智能体 LLM,在低端硬件上实现快速推理,并支持结构化提取和微调。

嘿,LocalLlaMa,我是 Cactus 的 Henry!我们之前发布了 Cactus Needle,这是一个 14MB 的智能体 LLM,用于工具调用、设备使用,以及面向手机、可穿戴设备、智能家居、小型机器人和微控制器的结构化提取。我们在这里收到了非常好的反馈,现在已经采纳了这些建议,发布了 Needle 2。整个模型是一个 14MB 的单一二进制文件,可在 28MB RAM 中运行完整会话;4500 万参数,2bit 压缩。Needle 在 Raspberry Pi 5 上达到 500 tokens/秒的解码速度,在 Meta Quest 3S 和 Apple Vision Pro 等 VR 设备上为 400-1,500 tokens/秒,在 Samsung A 系列等 200 美元以下的手机上为 300-700 tokens/秒。在工具调用和移动设备使用基准测试中,Needle 2 与最接近的小模型(如 LFM2.5 230M 和 Apple Foundation Model)互有胜负,而体积小 5 到 70 倍;这两个模型都是 f16,而 Needle 2 是 2bit。Needle 基于我们论文中的简单注意力网络(Simple Attention Networks)(https://arxiv.org/abs/2607.18363)。最近,边缘 AI 似乎意味着 Mac 和 PC,但这只是当今全球超过 210 亿台互联物联网设备中的 15 亿台;而在新兴市场,大多数手机的售价低于 200 美元,没有 NPU,GPU 性能一般。这些设备包括经济型手机、Raspberry Pi、微控制器、可穿戴设备、像 Reachy Mini 这样的小型机器人,以及智能家居设备。一个与 Needle 同样宽度和深度的传统 transformer 每个 token 需要 164 MFLOPs,即使压缩到 Needle 的参数规模也需要 87,而 Needle 只需要 70。即使在高端手机上,常驻助手也受功耗预算限制;每个 MFLOP 都对应毫瓦时,而 Needle 每 token 的耗电量比最小可用的 LLM 少 7 到 85 倍。当面向消费设备的智能被结构化为带有类型化参数的函数时,唯一困难的部分就是将凌乱的句子映射到这些函数上:调用哪个函数,使用哪些值。我们的研究发现,当以这种方式构建时,该问题不需要世界知识,也不需要开放式文本生成,这就是 4500 万参数就足够的原因。Needle 2 扩展到了结构化提取,可以将 schema 作为工具的替代传入,模型返回结构化输出。你可以将 Needle 用作带有枚举字段的文本分类模型,或通过提供提取关键字段的 schema 来用作摘要模型——涵盖了除开放式生成以外的所有任务。每个产品都有自己的工具词汇表,微调 Needle 能帮助它在自定义任务上达到前沿水平。因此,使用 Python 包(https://github.com/cactus-compute/needle),只需提供几个样本,通过自动数据生成流水线,即可在 Mac/PC 上在几分钟到几小时内完成对 Needle 的微调。尽管如此,每个响应都带有基于我们 Cactus Hybrid 技术学习到的置信度分数。如果高于你的阈值,就执行;低于阈值,则升级到云端或更大的模型。快来看看:https://cactuscompute.com/needle
查看原文

相似文章

Cactus-Compute/needle3

Hugging Face Models Trending

Needle 3 是一款针对移动设备和可穿戴设备等边缘设备优化的紧凑AI基础模型,在一个8-29 MB的文件中提供工具调用、结构化提取和文本嵌入功能。

Cactus-Compute/needle

Hugging Face Models Trending

Cactus-Compute 发布了 Needle,这是一个从 Gemini 3.1 蒸馏而来的 2600 万参数模型,采用纯注意力架构,针对设备端推理和本地微调进行了优化。