@googledevs:认识 LiteRT.js:@Google 的新网页端 Edge AI 运行时!我们已使从 PyTorch 转换到 #WebAI 变得更加容易…

X AI KOLs Timeline 工具

摘要

Google 发布了 LiteRT.js,这是一个高性能的 JavaScript 运行时,利用 WebAssembly 和硬件加速直接在浏览器中运行 AI 模型,是 TensorFlow.js 的演进。

认识 LiteRT.js:@Google 的新网页端 Edge AI 运行时!✨ 我们已使从 PyTorch 转换到 #WebAI 变得更加容易,使用通用的 LiteRT 模型格式。由 #WebGPU、WebAssembly 和 #WebNN 提供支持!是时候从 TensorFlow.js 升级,构建未来了。 了解更多 ➡️ https://t.co/M3gSDwr3zO
查看原文
查看缓存全文

缓存时间: 2026/07/10 14:14

认识 LiteRT.js:@Google 推出的全新 Web Edge AI 运行时!✨

我们让从 PyTorch 转换到 #WebAI 变得更简单——采用通用的 LiteRT 模型格式。由 #WebGPU、WebAssembly 和 #WebNN 驱动!是时候从 TensorFlow.js 升级,构建未来了。

了解更多 ➡️ https://t.co/M3gSDwr3zO


LiteRT.js:谷歌高性能 Web AI 推理工具

来源:https://developers.googleblog.com/litertjs-googles-high-performance-web-ai-inference/ 我们激动地宣布 LiteRT.js (https://developers.google.com/edge/litert/web) 正式发布——这是 LiteRT 的 JavaScript 绑定,用于直接在 Web 浏览器中运行 AI。通过将备受信赖的本地推理库 LiteRT (https://ai.google.dev/edge/litert) 引入 Web,Web 开发者现在可以完全在本地以最高性能运行机器学习和 AI 模型。这意味着更强的用户隐私、零服务器成本以及极低延迟的实时体验。对于已有 .tflite 模型的开发者来说,LiteRT.js 让部署到移动端和桌面端 Web 浏览器比以往更顺畅,成为从 TensorFlow.js 执行 .tflite 模型的强大进化。

虽然之前像 TensorFlow.js 这样的 Web AI 解决方案依赖性能较差的基于 JavaScript 的内核,但现在我们通过 WebAssembly 将原生跨平台运行时及其所有优化直接提供给 Web 开发者。LiteRT.js 通过在浏览器中直接运行您的 .tflite 模型,利用 LiteRT 最先进的硬件加速(包括用于 CPU 的 XNNPACK (https://github.com/google/XNNPACK)、用于 GPU 的 ML Drift (https://developers.googleblog.com/litert-maximum-performance-simplified/#:~:text=MLDrift%3A%20Best%20GPU%20Acceleration%20Yet) 以及即将推出的用于 NPU 的 WebNN),实现了令人赞叹的性能。

我们的初始版本提供了入门所需的所有工具,包括新的 LiteRT.js npm 包 (https://www.npmjs.com/package/@litertjs/core) 和一个展示实际实现的演示集合 (https://codepen.io/collection/PoJBoq)。

LiteRT.js 为 Web 开发者带来的优势

借助 LiteRT.js,Web 开发者可以将模型集成到用 JavaScript 或 TypeScript 编写的应用中,完全在客户端处理文本生成、目标检测、音频处理等复杂任务。由于 LiteRT.js 与 LiteRT 共享统一的跨平台堆栈,您的 Web 应用会自动受益于为 Android、iOS 和桌面端开发的最新性能升级、量化改进和硬件优化。

通过利用 LiteRT 的降流和运行时,您可以轻松地从各种 Python ML 框架转换模型,并在所有主要加速器(CPU/GPU/NPU)上获得原生硬件加速。为了帮助您轻松解锁这些 AI 能力,以下是 LiteRT.js 的主要亮点:

1. PyTorch 转换与定制量化

借助 LiteRT Torch (https://github.com/google-ai-edge/ai-edge-torch),PyTorch 模型可以单步转换,立即准备就绪以利用先进的基于浏览器的硬件加速。今天就开始,请遵循 LiteRT Torch 指南 (https://github.com/google-ai-edge/ai-edge-torch/blob/main/docs/pytorch_converter/getting_started.ipynb)。

为了进一步优化,AI Edge Quantizer (https://github.com/google-ai-edge/ai-edge-quantizer) 允许您在不同模型层上配置定制的量化方案。这可以在保持整体模型质量的同时,实现显著的大小缩减和性能提升。探索量化 Colab (https://github.com/google-ai-edge/ai-edge-quantizer/blob/main/colabs/selective_quantization_isnet.ipynb) 以查看实际效果。

2. CPU、GPU 和 NPU 的原生硬件加速

LiteRT.js 为各种不同的硬件后端实现了高性能 AI 推理。

  • CPU:利用 XNNPACK (https://github.com/google/XNNPACK),这是谷歌高度优化的本地 CPU 加速库,提供强大的多线程支持和宽松的 SIMD 构建以提升性能。
  • GPU:由 ML Drift (https://developers.googleblog.com/litert-maximum-performance-simplified/#:~:text=MLDrift%3A%20Best%20GPU%20Acceleration%20Yet) 驱动,这是谷歌领先的本地 GPU 加速解决方案。LiteRT.js 利用 WebGPU 在 Web 上实现最先进的 GPU 加速。
  • NPU:利用新兴的 WebNN API (https://webmachinelearning.github.io/webnn/)(目前在 Chrome 和 Edge 中处于实验阶段),针对专用 NPU 实现高效、超低延迟的推理。

准备好加速您的 Web 应用了吗?深入阅读 LiteRT.js 文档 (https://developers.google.com/edge/litert/web/get_started) 开始吧。

图1

LiteRT.js 架构概览

性能与实际影响

为了展示统一运行时和硬件加速后端的实际影响,我们将 LiteRT.js 与现有的 Web 解决方案进行了对比。在经典的计算机视觉和音频处理模型上,LiteRT.js 带来了显著的速度提升——在 CPU 和 GPU 推理上,性能比其他 Web 运行时高出 3 倍。

YOLO26n 1600x900 基准测试

注意:性能基准测试在受控浏览器环境中使用 2024 款 Apple MacBook Pro(M4 Apple Silicon)进行。个人用户性能可能因本地 GPU 能力、热节流和浏览器驱动程序优化而异。

为了将这些声称与实际效率联系起来,我们在三种不同的 Web 执行后端上使用 LiteRT.js 对热门 AI 模型进行了基准测试:CPU(通过 XNNPACK)WebGPUWebNN(通过 Apple CoreML)。对于目标跟踪、音频转录或图像处理等要求苛刻的实时应用,通过 WebGPU 或 WebNN 利用 GPU 或 NPU 可实现比标准 CPU 执行快 5-60 倍的速度,确保在不影响性能的情况下降低延迟。

经典模型性能(1)

注意:性能基准测试在受控浏览器环境中使用 2024 款 Apple MacBook Pro(M4 Apple Silicon)进行。个人用户性能可能因本地 GPU 能力、热节流和浏览器驱动程序优化而异。

实际演示

要查看 LiteRT.js 的实际运行,请探索我们的实时实现。LiteRT.js 演示源代码可在 LiteRT GitHub 仓库 (https://github.com/google-ai-edge/LiteRT/tree/main/litert/js) 和 Ultralytics (https://github.com/ultralytics/ultralytics) 上获取。

LiteRT Ultralytics YOLO 集成

Ultralytics 是一家专注于构建计算机视觉工具和模型的人工智能公司。它最著名的是 YOLO(You Only Look Once)框架的创建者,这是一系列实时目标检测和图像分割模型。

我们很高兴地分享官方 LiteRT 导出 (https://docs.ultralytics.com/integrations/litert) 支持已直接内置于 Ultralytics Python 包中。轻松将 Ultralytics YOLO (https://www.ultralytics.com/yolo/yolo26?utm_source=googlelitert&utm_medium=referral&utm_campaign=blog&utm_content=yolo26) 模型部署到移动端、边缘设备及浏览器——仅需几行代码即可从编译到运行。

抱歉,您的浏览器不支持播放此视频

演示:YOLO26,实时视觉模型系列

深度估计

Depth Anything - 单目深度估计 (https://goo.gle/depth3d) 展示了如何将标准网络摄像头实时转换为交互式 3D 点云。由 LiteRT.js 通过 WebGPU 驱动,它使用 Depth-Anything-V2 模型即时计算深度数据,并将视频像素映射到响应式 3D 空间。

抱歉,您的浏览器不支持播放此视频

演示:使用 DepthAnything 和 WebGPU 的单目深度估计。

图像放大

使用 Real-ESRGAN (https://github.com/xinntao/Real-ESRGAN) 模型和 LiteRT.js 在浏览器中将图像放大 4 倍,其工作原理是将 128x128 像素的图块放大到 512x512,然后重新组合成最终图像。

开始使用 LiteRT.js

将 LiteRT.js 集成到您的开发工作流中非常简单,无论您是启动新实现还是将现有应用迁移到我们的高性能运行时。LiteRT.js 抽象了硬件级别优化的复杂性,使您无需手动调整平台即可提供响应迅速、注重隐私的体验。

以下代码片段展示了使用 GPU 加速初始化、编译和运行 .tflite 模型的简化流程。使用清晰现代的 JavaScript,您可以加载模型、输入张量并实时捕获高速推理结果。有关更详细的说明、演示和指导,请参阅我们的文档 (https://developers.google.com/edge/litert/web/get_started)。

import { loadLiteRt, loadAndCompile, Tensor } from '@litertjs/core';

await loadLiteRt('path/to/wasm/directory/');

const model = await loadAndCompile('path/to/your/model.tflite',{ accelerator: webgpu });

const inputTypedArray = new Float32Array(1 * 3 * 244 * 244);

const inputTensor = new Tensor(inputTypedArray, [1, 3, 244, 244]);

const results = await model.run(inputTensor);

// results 是一个存储在 GPU 上的 Tensor。要将其移动到 CPU 并转换为 typedArray,我们使用
const resultArray = (await results[0].moveTo('wasm')).toTypedArray();

JavaScript

已复制

未来展望

我们致力于持续扩展 LiteRT.js 的性能、模型覆盖范围和开发者工具。展望未来,我们的开发路线图重点是推进 WebNN 集成以实现原生 NPU 性能,并提供高度优化的本地生成式 AI 支持。

  • 模型:在 Kaggle (https://www.kaggle.com/models?framework=tfLite) 或 LiteRT Hugging Face 社区 (https://huggingface.co/collections/litert-community/web-classical-models) 上查找预训练的 .tflite 模型。
  • 开始构建:探索 LiteRT.js 文档 (https://ai.google.dev/edge/litert/web)。
  • 获取包:在 npm 上下载 @litertjs/core (https://www.npmjs.com/package/@litertjs/core)。
  • 贡献:在 GitHub issues 页面 (https://github.com/google-ai-edge/LiteRT/issues) 上分享反馈、报告错误或贡献代码。
  • LLM 支持:LiteRT-LM.js (https://github.com/google-ai-edge/LiteRT-LM) 通过我们的 JavaScript API (https://ai.google.dev/edge/litert-lm/js) 增加了对 LLM 的浏览器支持。
  • TensorFlow.js 用户:查看这里 (https://developers.google.com/edge/litert/web#tensorflowjs) 了解如何在现有 TensorFlow.js 管道中利用 LiteRT.js 进行模型推理。

致谢

感谢 Ultralytics 提供 YOLO26 媒体和性能数据。感谢 Jason Mayes 提供 LiteRT.js 演示。

相似文章