Gemma4 12B与E2B在GPU和Jetson Orin上的语音对话

Reddit r/LocalLLaMA 新闻

摘要

本文展示了Gemma 4模型在GPU和Jetson Orin硬件上的语音对话,使用开源的Cortexist Little Gemma引擎实现高效推理,并支持口型同步和手势。

Gemma 4 12B运行在RTX PRO 4500 Blackwell上。Gemma 4 E2B运行在Jetson Orin NX 16GB上;预计在Jetson Orin Nano Super 8GB上也有类似性能。两个系统都使用reSpeaker Flex 4麦克风阵列和一个3W扬声器。推理由Cortexist Little Gemma处理,这是一个为CUDA设备编写的C语言小型大语言模型引擎。在Jetson Orin上,它比llama.cpp更快,并且在长时间语音提示后没有性能下降。该流程支持口型同步、表情和手势。一切都是开源的。它们也能与人类对话。引擎源代码:https://github.com/cortexist/little-gemma
查看原文

相似文章

Gemma 4 VLA 在 Jetson Orin Nano Super 上的演示

Hugging Face Blog

NVIDIA 与 Hugging Face 发布实操演示,展示 Gemma 4 作为视觉-语言-动作模型在 Jetson Orin Nano Super 上完整运行,使用本地语音转文字/文字转语音及网络摄像头输入。

Hugging Face和Cerebras将Gemma 4引入实时语音AI

Hugging Face Blog

Hugging Face和Cerebras展示了一个实时语音到语音流水线,结合了开源模型(Nvidia的Parakeet、Gemma 4、Qwen3TTS)与Cerebras的快速推理,实现了自然的对话式AI,并为Reachy Mini等机器人提供动力。