offline-inference

标签

Cards List
#offline-inference

PTC-Decoder:迈向离线资源受限边缘设备上的智能SLMs

arXiv cs.AI ↗ · 2天前 缓存

PTC-Decoder是一个无需训练、即插即用的框架,通过在词元级约束强制执行计划遵守,提升在离线、资源受限的边缘设备上的小型语言模型性能,增强多步骤代理任务中的步骤级可靠性。

0 人收藏 0 人点赞
#offline-inference

@seclink: @grok 总结一下:这次有哪些新颖的开源能力出现?

X AI KOLs Timeline ↗ · 6天前 缓存

Google Antigravity SDK 引入了在本地 GPU 上完全离线运行像 Gemma 4 这样的开源 AI 模型的能力,确保零 API 成本和完全数据隐私。

0 人收藏 0 人点赞
#offline-inference

SHADOW 50M: 一个19.8 MB的模型,能精确计算并从磁盘记忆 [P]

Reddit r/MachineLearning ↗ · 2026-09-14

SHADOW 50M 是一个紧凑的44M参数AI模型,具有三元权重和固定的512位代码,在45B令牌上从头训练,能够在消费硬件上高速进行离线推理。

1 人收藏 1 人点赞
#offline-inference

@AlmustyFX: 这才是真正重要的本地AI测试。一个7.9B MoE模型在M4 Pro上以152 tok/s运行,配备64GB统一内存…

X AI KOLs Timeline ↗ · 2026-08-29 缓存

一个7.9B MoE模型在M4 Pro上以每秒152个令牌的速度运行,配备64GB统一内存,能够离线处理敏感合同数据,并展示了本地AI的实际应用。

0 人收藏 0 人点赞
#offline-inference

React Native ExecuTorch 现已支持 Gemma 4(Vulkan 和 MLX 加速)

Reddit r/LocalLLaMA ↗ · 2026-06-15

react-native-executorch 库现已集成 Google 的 Gemma 4 模型,可实现完全离线的 GPU 加速推理,在 Android 上使用 Vulkan 委托,在 Apple Silicon 上使用 MLX 委托。

0 人收藏 0 人点赞
#offline-inference

@danveloper: https://x.com/danveloper/status/2064387956387758206

X AI KOLs Timeline ↗ · 2026-06-09 缓存

一位开发者通过在NVMe SSD上流式传输模型权重,在树莓派5上运行了DeepSeek-V4-Flash,达到了1.3 tokens/秒的速率,功耗仅8瓦,证明了前沿级别的开放权重模型在低成本、离线硬件上的可行性。

0 人收藏 0 人点赞
#offline-inference

使用 Transformers.js 在 WebGPU 上完全离线运行 Gemma 4,并通过 WebSerial 控制 Reachy Mini

Reddit r/LocalLLaMA ↗ · 2026-05-11

演示了如何使用 WebGPU 和 Transformers.js 在浏览器中离线运行 Gemma 4,并通过 WebSerial 控制 Reachy Mini 机器人。

0 人收藏 0 人点赞
#offline-inference

是什么阻碍了 App 把用户设备当成服务器、本地跑 LLM?

Reddit r/singularity ↗ · 2026-04-22

一位用户思考为何更多 App 不在手机上直接跑本地 LLM,指出 Gemma 2-4B 模型已能离线运行,在接近 GPT-4o 质量的同时还能省掉服务器成本。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈