@ramin_m_h: 大约一年前,我们发布了首批Liquid nanos实例。这些是我们销售给企业的产品:微小模型……
摘要
Liquid AI发布了Liquid Nanos,这是一系列小型基础模型(参数量350M–2.6B),能够在日常设备上运行,并在专业任务上提供前沿级别的性能。
查看缓存全文
缓存时间: 2026/09/02 11:53
大约一年前,我们发布了首批 Liquid Nanos 实例。这些是我们向企业销售的产品:微型模型加上定制平台,在专业用例上可达到前沿模型的质量水准。将模型递归定制到 90% 的生产质量很容易,但从 90% 提升到 100% 以满足企业可靠性和质量保证要求,则是一门艺术。这非常困难,但令人欣喜的是完全可以实现。
如今,这些 Liquid Nanos 实例已在 @Shopify 的大规模生产中全面投入使用!
https://liquid.ai/blog/introducing-liquid-nanos-frontier-grade-performance-on-everyday-devices…
介绍 Liquid Nanos——日常设备上的前沿级性能
来源:https://www.liquid.ai/blog/introducing-liquid-nanos-frontier-grade-performance-on-everyday-devices 我们推出 Liquid Nanos——一系列 350M 到 2.6B 参数的基础模型,在专业化的代理式任务上提供前沿模型的质量,同时可直接在手机、笔记本电脑和嵌入式设备上运行。在与合作伙伴的评估中,Nanos 的性能与规模大其数百倍的模型相媲美。其成果是:无需云端开销、可实现全球化规模部署的 AI 代理。
为什么是 Nanos,为什么是现在? 过去几年的 AI 进步一直由规模越来越大的模型和数据中心驱动。但现实世界存在诸多约束:成本、能耗、延迟和隐私。将每个 token 都发送到云端,使得许多用例难以规模化触达所有人。
Nanos 颠覆了部署模式。我们不是将所有数据移动到前沿模型,而是将紧凑而功能强大的智能直接交付到设备端。这释放了速度、韧性、隐私保护,以及最终实现规模化的成本优势。
什么是 Liquid Nanos? Liquid Nanos 是低延迟、任务特定的 Liquid 基础模型(LFM2 系列),其 RAM 占用介于 100MB 到 2GB 之间,通过先进的预训练和一种专门形式的后训练,为代理式 AI 的核心模块提供前沿级的结果:
- 精准的数据提取和结构化输出生成
- 多语言理解
- 长上下文的检索增强生成(RAG)
- 数学与推理
- 用于代理工作流的工具/函数调用
尽管它们的体积很小(数亿到约 10 亿参数),Nanos 在其设计的特定任务上,质量能够匹敌甚至接近规模远大于它们的通用模型,并且可以在现代手机和 PC 上完全在本地运行。
今天,我们发布了首批实验性的任务特定 Nanos 系列,更多型号即将推出:
- LFM2-Extract – 一个 350M 和 1.2B 的多语言模型,用于从非结构化文本中提取数据,例如将发票电子邮件转化为 JSON 对象。
- LFM2-350M-ENJP-MT – 一个 350M 模型,用于英语和日语之间的双向翻译。
- LFM2-1.2B-RAG – 一个 1.2B 模型,针对 RAG 流程中的长上下文问答进行了优化。
- LFM2-1.2B-Tool – 一个 1.2B 模型,专为函数调用和代理式工具使用而构建。
- LFM2-350M-Math – 一个 350M 推理模型,用于解决数学问题。
- Luth-LFM2 – 一个额外的、由社区驱动的法语微调系列,旨在为本地聊天提供通用助手功能。
Liquid Nanos
大多数边缘 AI 应用程序需要模型在特定任务(如翻译或函数调用)上表现出色。通常,这需要针对给定任务对通用模型进行微调。然而,由于缺乏时间、数据或算力,微调对许多用户来说仍然是一个挑战。为弥补这一差距,我们创建了一个模型库,包含一系列任务特定的 LFM2 模型。这些专用检查点以极小的内存占用提供非常高质量的输出。这个不断增长的库中所有模型均在 Hugging Face (https://huggingface.co/collections/LiquidAI/liquid-nanos-68b98d898414dd94d4d5f99a) 上提供,并与 LEAP (https://leap.liquid.ai/?utm_source=liquid&utm_medium=referral) 和 Liquid Apollo (https://www.liquid.ai/apollo) 直接兼容。
立即使用 LEAP 部署 (https://leap.liquid.ai/?utm_source=liquid&utm_medium=referral) 虽然 AI 领域正竞相追求规模越来越大的模型,但现实情况是,小型微调模型在特定任务上可以匹配甚至超越 >100B 模型的性能。这些小型专用模型在成本、延迟、隐私和连接性要求使得云模型不切实际或不可行的环境中,解锁了 AI 应用的可能性。
LFM2-350M-Extract (https://huggingface.co/LiquidAI/LFM2-350M-Extract) 和 LFM2-1.2B-Extract (https://huggingface.co/LiquidAI/LFM2-1.2B-Extract) 设计用于从各种非结构化文档(如文章、文字记录或报告)中提取重要信息,并输出为结构化的 JSON、XML 或 YAML 格式。它们兼容英语、阿拉伯语、中文、法语、德语、日语、韩语、葡萄牙语和西班牙语输入。
使用场景:
- 从电子邮件中提取发票详情并转换为结构化的 JSON。
- 将监管备案文件转换为 XML 用于合规系统。
- 将客户支持工单转换为 YAML 用于分析流程。
- 从非结构化报告中提取实体和属性来填充知识图谱。
使用 LFM2-Extract 只需要输入文档和一个可选的架构模板。我们建议将此架构模板提供在系统提示中以提高准确性,尤其是在处理特别长且复杂的文档时。
用于训练这些模型的数据主要是合成的,这使我们能够确保多样化的数据混合。我们使用了多种文档类型、领域、风格、长度和语言。我们还改变了文档中相关文本的密度和分布。在某些情况下,提取的信息集中在文档的某一部分;在其他情况下,则分散在整个文档中。我们在创建合成用户请求和设计模型输出结构时,也采用了确保多样性的相同方法。数据生成过程经历了多次迭代,融入了 Liquid AI 团队内外的思路和反馈。
我们在一个包含 5,000 份文档的数据集上评估了 LFM2-Extract,这些文档涵盖超过 100 个主题,混合了不同的写作风格、模糊性和格式。我们使用了五种指标的组合来全面评估语法、准确性和忠实度:
- **语法评分:**检查输出是否可干净地解析为有效的 JSON、XML 或 YAML。
- **格式准确性:**验证输出是否匹配请求的格式(例如,当请求 JSON 时输出 JSON)。
- **关键词忠实度:**衡量结构化输出中的值是否实际出现在输入文本中。
- **绝对评分:**一个评判型 LLM 按 1-5 分制对质量进行评分,评估提取的完整性和正确性。
- **相对评分:**我们要求评判型 LLM 在提取模型的输出和标准答案之间选择最佳答案。
我们的数据提取模型在有效性、准确性和忠实度方面提供了显著提升。例如,LFM2-1.2B-Extract 输出复杂对象的能力在多语言环境下,比 Gemma 3 27B(一个规模是其 22.5 倍的模型)还要高出一个水平。
LFM2-350M-ENJP-MT
LFM2-350M-ENJP-MT (https://huggingface.co/LiquidAI/LFM2-350M-ENJP-MT) 是一个 350M 参数模型,用于英语/日语双向翻译。其翻译质量优于规模比它大 10 倍以上的通用模型。
使用场景:
- 一个低延迟、低内存、私密且可离线的翻译模型,可在您的手机、平板电脑或笔记本电脑上本地运行。
- 作为高效代理式流程的一部分,需要高吞吐量的英语 ↔ 日语翻译。
使用 LFM2-350M-ENJP-MT 需要提供两种系统提示之一(“翻译成英语。”或“翻译成日语。”),并将要翻译的文本作为用户提示。
我们使用公开的 llm-jp-eval (https://github.com/llm-jp/llm-jp-eval) 基准测试评估了 LFM2-350M-ENJP-MT。该基准主要包含简短翻译,如来自维基百科的 1-2 句文章和单句新闻条目。我们的模型经过更广泛文本的训练,包括类似聊天的消息、多段落新闻文章、技术论文和正式写作。
得益于这种全面的训练,我们的模型开箱即用即可提供强大的通用翻译能力,可与 GPT-4o 竞争。
查看以下链接中的示例翻译:
- 英译日示例 (https://huggingface.co/LiquidAI/LFM2-350M-ENJP-MT#en-%E2%9E%A1%EF%B8%8F-jp)
- 日译英示例 (https://huggingface.co/LiquidAI/LFM2-350M-ENJP-MT#jp-%E2%9E%A1%EF%B8%8F-en)****
LFM2-1.2B-RAG
LFM2-1.2B-RAG 是一个 1.2B 的模型,专门用于根据提供的上下文文档回答问题,用于 RAG(检索增强生成)系统。
使用场景:
- 聊天机器人,用于询问关于特定产品文档的问题。
- 带有内部知识库的定制支持,提供有依据的回答。
- 学术研究助手,就研究论文和课程材料进行多轮对话。
RAG 系统使 AI 解决方案能够将新的、最新的、可能专有的信息纳入 LLM 回答中,而这些信息在训练数据中并不存在。当用户提问时,检索组件从知识库中定位并提供相关文档,然后 RAG 生成模型基于这些上下文文档中的事实来回答问题。
我们在一个包含 1M+ 样本的数据集上微调了 LFM2-1.2B-RAG 模型,这些样本包括多轮交互和多文档样本,混合了精选的开源文档和生成的合成文档。数据集涵盖 9 种不同语言:阿拉伯语、中文、英语、法语、德语、日语、韩语、葡萄牙语和西班牙语。
我们在一个内部基准测试上评估了该模型,该基准使用 LLM 作为评判器,考虑 3 个指标,并与 4 个规模类似的开源模型进行比较:
- 忠实度: 模型的响应是否完全由提供的上下文文档中的信息组成,并避免产生幻觉?
- 相关性: 模型是否简洁地回答用户的问题?响应的所有内容是否都对最终答案有贡献,而没有包含不必要的冗余信息?
- 帮助性: 总体而言,模型对用户查询的帮助程度如何?
LFM2-1.2B-RAG 在所有 3 个指标上均取得了与 Qwen3-1.7B、Gemma-3-1B-it、Llama-3.2-1B-Instruct 和 Pleias-1B-RAG 相媲美的性能。
LFM2-1.2B-Tool 是另一个任务特定的模型,专为简洁精准的工具调用而设计。关键挑战在于设计一个非思考模型,使其在工具使用方面优于同等规模的思考模型。
使用场景:
- 移动和边缘设备 需要即时 API 调用、数据库查询或系统集成,无需依赖云端。
- 汽车、IoT 设备或客户支持中的实时助手,其中响应延迟至关重要。
- 资源受限的环境,如嵌入式系统或电池供电设备,需要高效的工具执行。
对于边缘推理,延迟是提供无缝且令人满意用户体验的关键因素。因此,虽然测试时计算天然能提供更高的准确性,但它最终会因函数调用等待时间增加而损害用户体验。因此,目标是开发一个能与思考模型相媲美,但又无需任何内部思维链过程的工具调用模型。
我们在一个专门设计的专有基准测试上评估了每个模型,该基准旨在防止数据污染。该基准确保性能指标反映的是真实的工具调用能力,而非训练数据中记忆的模式。
LFM2-350M-Math
我们的 LFM2-350M-Math 是一个微小的推理模型,专门用于解决棘手的数学问题。推理使模型能更好地构建其思维过程,探索多种解决方案策略,并自我验证最终响应。通过这种方式为小模型增强大量的测试时计算,甚至可以解决具有挑战性的竞赛级数学问题。我们的基准评估表明,LFM2-350M-Math 对于其体量而言能力非常出色。
由于我们对边缘部署感到兴奋,我们的目标是限制内存消耗和延迟。我们的后训练方案利用强化学习来明确减少在不需要时回答的冗长性。为此,我们结合了明确的推理预算与难度感知的优势重加权。请参阅我们另一篇 博客文章 获取详细的后训练方案。
Luth-LFM2
我们还要突出介绍开源社区使用 Luth-LFM2-1.2B (https://huggingface.co/kurakurai/Luth-LFM2-1.2B)、Luth-LFM2-700M (https://huggingface.co/kurakurai/Luth-LFM2-700M) 和 Luth-LFM2-350M (https://huggingface.co/kurakurai/Luth-LFM2-350M) 制作的高质量模型。由 Sinoué Gad (https://www.linkedin.com/in/sinou%C3%A9-gad/) 和 Maxence Lasbordes (https://www.linkedin.com/in/maxence-lasbordes/) 开发,这些微调版本提供了保留英语能力的专用法语版本。
这些模型是通过在 Luth-SFT 数据集 (https://huggingface.co/datasets/kurakurai/luth-sft) 上进行完整微调而开发的,该数据集包含从法国高中毕业会考和大学校预科班(CPGE)考试题目(涵盖数学、物理和科学知识)创建的 Scholar 数据集。
使用场景:
- 在移动设备、平板电脑或笔记本电脑上本地运行的低延迟法语处理。
- 在数据分析系统和数据管道中处理法语文档的高吞吐量批处理。
- 用于隐私敏感应用的离线法语 AI 助手,在这些应用中云连接受到限制。
这些模型在法语基准测试上表现出显著的性能提升,同时保持或增强了英语能力。例如,Luth-LFM2-1.2B 将 MATH-500-fr 分数从 35.80 提高到 47.20,同时将英语数学性能从 44.60 提升到 50.20。这证实了通过模型合并实现有针对性的语言专业化,可以在不损害跨语言性能的情况下达到最先进的结果。
评估过程使用了 LightEval 以及自定义的法语基准任务,在 IFEval-fr、GPQA-fr、MMLU-fr 和 Hellaswag-fr 上显示出显著提升,同时保持了具有竞争力的英语性能。所有训练代码、评估脚本和 Luth-SFT 数据集(3.38 亿 token)均在 GitHub 上公开,以支持进一步的法语 NLP 研究。
可用性与许可
Liquid Nanos 如今已在 Liquid Edge AI 平台(LEAP) (https://leap.liquid.ai/?utm_source=liquid&utm_medium=referral) 上提供,适用于 iOS、Android 和笔记本电脑。开发者可以直接使用、通过 SDK 集成,或将它们组合成代理。模型也已在 Hugging Face (https://huggingface.co/collections/LiquidAI/liquid-nanos-68b98d898414dd94d4d5f99a) 上提供。我们正通过开放许可证使其广泛可供学术界、开发者和小型企业使用。我们已与多家财富 500 强公司合作,在消费电子、汽车、电子商务和金融领域提供定制的任务特定 Nanos。
使用 Nanos 构建应用
- 在 LEAP (https://leap.liquid.ai/?utm_source=liquid&utm_medium=referral)(iOS、Android 和桌面端)和 Hugging Face (https://huggingface.co/collections/LiquidAI/liquid-nanos-68b98d898414dd94d4d5f99a) 上探索和下载模型。
- 在您的工作流中试用 Extract、RAG 和 Tool 模型。
- 组合 Nanos 以构建具有前沿级性能和设备端成本/延迟的完整代理系统。
tobi lutke (@tobi):
相似文章
@liquidai:推出LFM2.5-230M:这是我们最小的模型,专为快速运行而设计,可在任何地方(CPU、NPU和GPU)上运行,以实现代理型任务…
Liquid AI发布了LFM2.5-230M,这是一个拥有230M参数的小型模型,针对CPU、NPU和GPU上的快速推理进行了优化,适用于手机和机器人等设备上的代理型任务。
Liquid AI 发布 Liquid Foundation Models 2.5 230M(3分钟阅读)
Liquid AI 发布 LFM2.5-230M,这是一款轻量级基础模型,可在从云端 GPU 到 CPU 乃至 Raspberry Pi 的设备上运行,在工具使用和数据提取任务上表现出色。
LiquidAI/LFM2.5-2.6B
Liquid AI released LFM2.5-2.6B, a 2.6B-parameter hybrid model optimized for on-device deployment with 128K context, agentic post-training, and fast inference (220 tok/s on Apple M5 Max) under 2.5GB memory.
Nano Banana 2 Lite(6分钟阅读)
Google DeepMind 发布 Nano Banana 2 Lite,这是其最快且最具成本效益的图像模型,以及用于视频生成和对话式编辑的 Gemini Omni Flash,现已在 Google AI Studio 和 API 中提供给开发者。
LiquidAI/LFM2.5-230M
Liquid AI发布了LFM2.5-230M,一款紧凑的230M参数混合模型,针对设备端部署进行了优化,边缘推理速度快(在Galaxy S25 Ultra上达到213 tok/s),并通过强化学习构建,适用于智能体任务。