webgpu

标签

Cards List
#webgpu

浏览器中的1位LLM

Hacker News Top · 2026-07-16 缓存

一款1位LLM(Bonsai)现在可以通过WebGPU在浏览器中运行,实现高效的设备端推理。

0 人收藏 0 人点赞
#webgpu

Bonsai 27B:使用自定义WebGPU内核在浏览器中本地运行的1比特密集型大语言模型

Reddit r/LocalLLaMA · 2026-07-14

Bonsai 27B是一个1比特密集型大语言模型,通过使用自定义WebGPU内核可以在浏览器中本地运行,实现高效的设备端推理。

0 人收藏 0 人点赞
#webgpu

@xenovacom: Bonsai 27B 彻底改变了本地 LLM 的游戏规则。1位量化将其从 54GB 缩小到仅 3.8GB(减少 93%),同时……

X AI KOLs Timeline · 2026-07-14 缓存

Bonsai 27B 通过 1 位量化实现了 93% 的体积缩减,同时保留了 90% 的智能,借助自定义 WebGPU 内核实现本地浏览器推理。

0 人收藏 0 人点赞
#webgpu

@googledevs:认识 LiteRT.js:@Google 的新网页端 Edge AI 运行时!我们已使从 PyTorch 转换到 #WebAI 变得更加容易…

X AI KOLs Timeline · 2026-07-09 缓存

Google 发布了 LiteRT.js,这是一个高性能的 JavaScript 运行时,利用 WebAssembly 和硬件加速直接在浏览器中运行 AI 模型,是 TensorFlow.js 的演进。

0 人收藏 0 人点赞
#webgpu

@dzhng: Fable 制作了我最喜欢的策略游戏之一《罗马全面战争》的网络版。大约有2万个单位,帧率不错。Star…

X AI KOLs Following · 2026-07-05 缓存

使用 Fable 和 Codex Rust 创建了《罗马全面战争》的网络版,编译为 WASM 并通过 WebGPU 渲染,支持约2万个单位,帧率流畅。

0 人收藏 0 人点赞
#webgpu

Fable创建了新颖的4D splat格式

Hacker News Top · 2026-07-04 缓存

一种名为.splat4d的新型4D高斯splat格式,具有可调误差边界,对原始splat的压缩比为16-58倍,并支持动态场景的原生HTTP Range流式传输,代码和演示已提供。

0 人收藏 0 人点赞
#webgpu

@dzhng: 前沿模型在一次性生成网页应用方面已经变得非常出色,以至于它不再出现在我的个人基准测试中。相反,一个……

X AI KOLs Timeline · 2026-07-02 缓存

前沿模型在生成网页应用方面已经变得非常熟练,以至于作者现在以从头构建WebGPU水渲染器为基准,比较了Opus-4.8和采用GPT-5.5实现器的Fable-5编排器。

0 人收藏 0 人点赞
#webgpu

@googlegemma:“代理内核优化是端侧推理的未来” @xenovacom 使用 Fable 5 编写内核,将……

X AI KOLs Timeline · 2026-07-01 缓存

Xenova 使用 Fable 5 编写优化内核,在 M4 上的 WebGPU 中为 Gemma 4 实现了每秒 255 个 token 的速度,展示了用于端侧推理的代理内核优化。

0 人收藏 0 人点赞
#webgpu

@tom_doerr: 基于 Rust 的模块化 GraphRAG 实现,支持 WebGPU 加速。https://github.com/automataIA/graphrag-rs…

X AI KOLs Timeline · 2026-06-27 缓存

一种模块化、高性能的 GraphRAG(基于图的检索增强生成)Rust 实现,支持 WebGPU 加速,并提供三种部署架构:仅服务器、仅 WASM(客户端)以及混合模式。

0 人收藏 0 人点赞
#webgpu

@victormustar: 移动端300 tok/s太疯狂了... 开源必须赢

X AI KOLs Following · 2026-06-26 缓存

开源AI推理在移动端达到300 tok/s,借助WebGPU框架,Liquid AI的LFM2.5 230M模型在浏览器中达到1,400 tok/s。

0 人收藏 0 人点赞
#webgpu

Kuma:将PyTorch模型编译为自包含的WebGPU可执行文件 [P]

Reddit r/MachineLearning · 2026-06-25

Kuma是一个编译器/运行时,它将导出的PyTorch模型编译成自包含的WebGPU可执行文件,从而实现无需Python或服务器依赖的直接浏览器推理。

0 人收藏 0 人点赞
#webgpu

LFM2.5 230M 使用自定义 WebGPU 内核在浏览器中以 1,400 tok/s 运行

Reddit r/LocalLLaMA · 2026-06-25

LFM2.5 230M 模型使用自定义 WebGPU 内核在浏览器中实现每秒 1,400 个 token,展示了高效的本地推理。

0 人收藏 0 人点赞
#webgpu

@yoheinakajima:谁想帮Eyal在这个方法上挑毛病——在浏览器中运行LLM推理?

X AI KOLs Following · 2026-06-25 缓存

Eyal Toledano 使用纯 WebGPU/WGSL 构建了一个LLM推理引擎,可在浏览器和Node中无API密钥地本地运行,并正寻求同行评审。

0 人收藏 0 人点赞
#webgpu

SDXL 在浏览器中本地运行于 WebGPU,开源

Reddit r/LocalLLaMA · 2026-06-24

Stable Diffusion XL (SDXL) 现在可以使用 WebGPU 在浏览器中本地运行,通过开源代码直接在设备上生成高质量 AI 图像。

0 人收藏 0 人点赞
#webgpu

在 Transformers.js 中尝试提议的跨源存储 API

Hugging Face Blog · 2026-06-23 缓存

这篇客座文章探讨了提议的跨源存储API,用于改进Transformers.js中AI模型资源的缓存,从而实现跨源的高效复用,同时保持浏览器内推理的隐私和完整性。

0 人收藏 0 人点赞
#webgpu

使用Claude Code将Moebius 0.2B图像修复模型移植到浏览器中运行

Simon Willison's Blog · 2026-06-22 缓存

Simon Willison借助Claude Code,将Moebius 0.2B图像修复模型移植到浏览器中运行,使用了WebGPU和ONNX Runtime。最终的演示允许用户上传图片并通过修复移除物体。

0 人收藏 0 人点赞
#webgpu

@rauchg:团队在http://vercel.com/home的性能上大显身手。'光照所及之处'都经过了Simba优化。绘制、布…

X AI KOLs Following · 2026-06-21 缓存

Vercel团队显著优化了其首页性能,使用了诸如WebGPU着色器等技术,并仔细检查每一帧,他们计划分享所学的经验。

0 人收藏 0 人点赞
#webgpu

@hank_aibtc: 猛啊!在浏览器里跑 Gemma 4,堪比 ChatGPT?! 完全零服务器、零数据上传、离线使用、纯WebGPU本地推理! Xenova把 Fable 5写的27个自定义WebGPU内核 全部开源了: - Gemma 4 E2B(23亿参…

X AI KOLs Timeline · 2026-06-18 缓存

文章介绍了Xenova开源了27个自定义WebGPU内核,使得Gemma 4模型可以在浏览器中完全离线、本地运行,性能达到255 tok/s,并讨论了隐私、离线使用等优势。同时也提到了FLUX.2的3D生成能力。

0 人收藏 0 人点赞
#webgpu

Gemma 4 E2B 在浏览器中运行,使用Fable 5编写的WebGPU内核,速度达255 tok/s

Reddit r/LocalLLaMA · 2026-06-17

Gemma 4被演示在浏览器中通过WebGPU以每秒255个token的速度运行,使用Fable 5生成的内核,展示了高效的设备端推理。

0 人收藏 0 人点赞
#webgpu

[browser-use-wasm] 我制作了一个在WASM中运行的零成本浏览器使用代理

Reddit r/LocalLLaMA · 2026-06-12

一位开发者构建了一个完全自包含的浏览器使用代理,完全在WASM/WebGPU中运行,零服务器成本,通过自然语言提示实现完整的网页控制。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈