Desert Ant Labs: 本地快速的设备端模型

Hacker News Top 模型

摘要

Desert Ant Labs,一家欧洲人工智能实验室,推出一套用于音频、视觉和文本的小型专用设备端模型,通过在设备本地运行,提供快速推理和隐私保护。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/09 12:46

# 每款产品的端侧智能 来源:https://desertant.com/blog/introducing-desert-ant-labs/ 今天,我们正式推出 Desert Ant Labs——一家专注于端侧智能开发的欧洲前沿人工智能实验室。我们坚信,实现高效智能的最佳路径始于设备本身。 我们正在构建针对音频、视觉和文本的小型专用模型。每个模型的响应时间仅需毫秒级,且运行成本为零。这意味着您可以为每一次产品交互赋予智能,无需受限于 token 成本或推理速度。这些模型小巧到足以在五年前的手机上运行,快速到足以应用于每一帧画面或每一次按键,且性能优于您正在付费使用的 API 调用。 首批18个模型现已上线(其中12个稳定版,6个测试版),可通过一个统一的 SDK 访问,支持 Swift、Kotlin 和 JavaScript。每个任务对应一个模型,每个模型都经过优化,旨在成为设备上完成该任务的最快方式: - Voz (https://desertant.com/models/voz/):在 iPhone 上,两秒钟内转录10分钟音频——比 Whisper 快4.7倍——并为每个词提供起止时间。 - Clear (https://desertant.com/models/clear/):一个仅 9MB 的模型,可在一秒内将五分钟的笔记本录音转换为录音室级音质。 - Redact (https://desertant.com/models/redact/):实时、跨27种语言,对姓名、地址和银行卡号进行掩码处理,确保它们永远不会到达您的服务器。 - Tongue (https://desertant.com/models/tongue/):仅用三个词、一个 2MB 的模型即可识别84种语言。 **语言识别准确率(输入三个词)** - Tongue · 2MB : 0.933 - 293MB 检测器 : 0.887 Tongue 仅用三个词识别语言,在 2MB 大小下得分 0.933,而一个 293MB 的检测器得分为 0.887。 这仅是冰山一角。其余十四个模型的完整规格和基准测试可在 desertant.com/models (https://desertant.com/models/) 和 Hugging Face (https://huggingface.co/desert-ant-labs) 上查阅。所有模型在每月10万活跃设备内完全免费。无需 token,无需登录。 **模型捕获的个人数据(文本)** - Redact · 12MB : 88.8% - GLiNER-PII · 2.3GB : 91.1% - Rampart · 14.7MB : 61.4% - OpenAI 过滤器 · 3GB : 60.2% Redact 从一个 12MB 的模型中捕获了文本中 88.8% 的个人数据,这与 2.3GB 的 GLiNER-PII 性能接近。 我们在欧洲构建这一切,因为“端侧”是这里的主权默认选择。数据永远不会离开用户的手,功能从不依赖于他人的云,而从未上传的数据永远无法被强制获取。 ## 我们是如何走到这一步的 五年来,我们一直以“端侧优先”的方式构建我们的视频应用 Detail (https://detail.co/)。但当我们引入像自动剪辑(Auto Edit)以创建短片,或为播客进行音频增强这样的功能时,我们不得不回退使用云端 API。随着 Detail (https://www.apple.com/newsroom/2025/12/apple-unveils-the-winners-of-the-2025-app-store-awards/) 知名度的增长,我们的基础设施账单也水涨船高。 每隔几个月,我都会寻找有用的端侧模型。我会在 Hugging Face (https://huggingface.co/) 上浏览,寻找能识别填充词或清理录音的模型。而每年六月,我们都能获得很棒的新工具来构建,但行业的步伐还不够快。基础已经奠定:芯片、Core ML (https://developer.apple.com/documentation/coreml/)、研究。缺失的是基础与在你的应用中实际实现功能之间的一切:一个你可以通过几行代码直接集成并发布的产品。 于是,我们亲自训练模型。事实证明,训练模型本身就是一个产品设计挑战,而这正是我们所擅长的。我们设计的模型和本地推理方案在速度、质量和成本上均优于云服务,并且在具体任务上,以远小于竞品的模型体积,超越了其他本地和云端模型。 我们使用 Clear (https://desertant.com/models/clear/) 替代了 Dolby,实现了更好、更快的音频增强;通过 Voz (https://desertant.com/models/voz/) 让我们的端侧转录速度提升了 5 倍。我们还用 Clips (https://desertant.com/models/clips/)——我们 284MB 的模型——替代了 Claude Sonnet,它能在 5 秒内将一段 10 分钟的视频转化为十几个片段——比 Sonnet 快 10 倍,能耗降低 470 倍 (https://desertant.com/about/),且质量相当。 **Clear 音频增强速度(处理5分钟音频)** - iPhone 16 Pro : 302x - MacBook Pro (M5) : 345x Clear 在设备上完成增强、母带处理和重新编码,最佳结果,基于一个 9MB 模型。在手机上达到 302 倍实时速度。 **转录速度(处理30分钟音频)** - Voz : 319x - Apple SpeechAnalyzer : 78x - Whisper large-v3-turbo : 50x 在 M3 Ultra 上,对30分钟连续音频的实时因子。Voz 在 iPhone 17 Pro 上达到 298 倍。 即将随 iOS 27 发布的 Detail 6 将用我们自己的模型替换所有云端 API,实现完全设备端运行。 我们所有人都在过去几年里使用大语言模型,仿佛它们只是另一个 API。在关于通用前沿“大脑”的炒作中,我们几乎忘记了它们并非唯一选择。 我与之交谈的每位开发者都有一个端侧模型愿望清单——如果成本不是问题,他们就会构建这些模型;或者他们正在为某个功能支付高昂的 token 费用,乐于用本地模型替换。每天运行十万次的同一类调用:清理录音、标记照片、从句子中提取日期、在文本到达服务器前捕获姓名。这些都不需要前沿模型。 NVIDIA 自己的研究人员 (https://arxiv.org/abs/2506.02153) 剖析了三个智能体系统,并估计其 40% 到 70% 的大模型调用可以转由小型专用模型处理。 ## 算力已预付 今年,行业将在数据中心上花费约 4500 亿美元 (https://introl.com/blog/hyperscaler-capex-600b-2026-ai-infrastructure-debt-january-2026)。与此同时,全球出货超过十亿 (https://my.idc.com/getdoc.jsp?containerId=prUS53965725) 部手机、平板电脑和笔记本电脑,其搭载的芯片能力日益强大,非常适合执行这类任务。人们手中的算力总量超过了全球所有人工智能数据中心的总和。 我们在免费推理方面拥有不公平的优势。没有单次调用成本,因此功能可以在每条消息上运行,而不仅仅是你能负担得起检查的那些。没有网络往返,用户的数据永不离开设备。当推理成本为零时,我们构建产品的方式将彻底改变。 ## 每款产品中的小脑 要使用本地模型构建产品,开发者体验必须大幅改善。你需要的是可商用的模型,在你的任务上于速度和质量上超越替代方案,可以通过几行代码集成到你的应用中,并且易于发现。 把前一百个模型想象成小脑 (https://www.ncbi.nlm.nih.gov/books/NBK538167/)。小脑负责处理那些持续运行的工作——平衡、计时、你从未思考过的技能,从而让大脑的其他部分得以自由思考。这正是我们首先构建的:快速、专用的模型,用于那些在设备上全天候运行、免费的工作。 接下来是皮层,即决定由哪个模型响应的层级。优先使用小型本地模型,当任务需要时使用更大的模型,仅在必须将工作移至设备外时才动用云端。随着开放研究的进步和设备芯片能力的增强,本地模型会不断成长,我们也会训练更大的模型。前沿智能,从微小处开始构建。 云实验室提供中立的模型,因为按 token 定价需要中立模型。每个 Desert Ant 模型都带有一个我们选择的默认设置,以及你需要改变该默认设置的控制项。我们优化模型和运行时:在 iPhone 上,Clear 和 Voz 在神经引擎上运行;在浏览器中,Clear 的相同权重通过 WebAssembly 运行。 ## SDK 准备好开始了吗?你可以通过我们的原生 Swift (https://desertant.com/swift/)、Kotlin (https://desertant.com/kotlin/) 和 JavaScript (https://desertant.com/js/) SDK 在你的应用中集成 Desert Ant 模型,SDK 可在 GitHub (https://github.com/Desert-Ant-Labs) 上获取。 我们的文档 (https://desertant.com/docs/) 专为开发者和智能体编写。你可以在 Mac 上通过命令行界面 (https://github.com/Desert-Ant-Labs/desert-ant-cli) 或在浏览器中通过 Hugging Face (https://huggingface.co/desert-ant-labs) 试用这些模型。 正在用我们的模型构建一些酷炫的东西,或者想与我们一起构建?联系我们 (https://desertant.com/contact/)。

相似文章

我们是否低估了小型边缘AI模型?[D]

Reddit r/MachineLearning

一位开发者认为,边缘AI社区忽视了那些可以在智能手机等设备上本地运行的小型专门模型,并以自建的离线摩尔斯电码识别功能为例。该项目使用了小于5MB的AI模型,基于TensorFlow/Keras和LiteRT,从数据生成到移动端集成的整个流程均为自建。