Gemma4 12B与E2B在GPU和Jetson Orin上的语音对话
摘要
本文展示了Gemma 4模型在GPU和Jetson Orin硬件上的语音对话,使用开源的Cortexist Little Gemma引擎实现高效推理,并支持口型同步和手势。
Gemma 4 12B运行在RTX PRO 4500 Blackwell上。Gemma 4 E2B运行在Jetson Orin NX 16GB上;预计在Jetson Orin Nano Super 8GB上也有类似性能。两个系统都使用reSpeaker Flex 4麦克风阵列和一个3W扬声器。推理由Cortexist Little Gemma处理,这是一个为CUDA设备编写的C语言小型大语言模型引擎。在Jetson Orin上,它比llama.cpp更快,并且在长时间语音提示后没有性能下降。该流程支持口型同步、表情和手势。一切都是开源的。它们也能与人类对话。引擎源代码:https://github.com/cortexist/little-gemma
相似文章
Gemma 4 VLA 在 Jetson Orin Nano Super 上的演示
NVIDIA 与 Hugging Face 发布实操演示,展示 Gemma 4 作为视觉-语言-动作模型在 Jetson Orin Nano Super 上完整运行,使用本地语音转文字/文字转语音及网络摄像头输入。
Cerebras上的gemma-4-31B比ChatGPT语音模式更好
声称在Cerebras硬件上运行的Gemma-4-31B模型性能优于ChatGPT的语音模式,并通过Hugging Face Space展示了实时语音交互。
Hugging Face和Cerebras将Gemma 4引入实时语音AI
Hugging Face和Cerebras展示了一个实时语音到语音流水线,结合了开源模型(Nvidia的Parakeet、Gemma 4、Qwen3TTS)与Cerebras的快速推理,实现了自然的对话式AI,并为Reachy Mini等机器人提供动力。
@googlegemma: 无需等待的语音AI!感谢Hugging Face和Cerebras,开发者现在可以用Gemma 4 31B模型作为……
Google Gemma宣布,借助Hugging Face和Cerebras实现超快推理,开发者现在可以将Gemma 4 31B模型用作语音AI的大脑,这是开源级联语音到语音堆栈的一部分。
Gemma 4 12B 原生无编码器语音输入利用建议?
讨论利用 Gemma 4 12B 的无编码器架构实现原生语音输入,寻找现成的低延迟流式音频摄入解决方案。