基于Jetson Orin NX SUPER 16GB打造了一款完全离线运行的行李箱机器人。使用Gemma 4 E4B模型,缓存TTFT约200毫秒,搭载30多个传感器,无WiFi/蓝牙/蜂窝网络连接。它有自己的想法。

Reddit r/LocalLLaMA 新闻

摘要

一位开发者使用Jetson Orin NX和Gemma 4 E4B模型打造了一款名为Sparky的完全离线行李箱机器人,实现了约200毫秒的缓存TTFT和14-15 tok/s的处理速度,通过30多个传感器以自然语言形式将数据输入提示词,全程无网络连接。

Sparky 完全在 Jetson 上运行。Gemma 4 E4B 模型使用 Q4_K_M 量化,通过 llama.cpp 实现,配备 q8_0 键值缓存和 flash attention。12K 上下文长度,原生系统角色,采样器参数采用模型卡片默认值。缓存 TTFT 约 200 毫秒,稳定输出 14-15 tok/s。语音识别使用 SenseVoiceSmall,语音合成使用 Piper,支持 43Hz 口型同步,盖板显示屏上通过 PixiJS 显示面部表情。视觉和 OCR 功能现已集成到 Gemma 4 中,因此不再需要 BLIP 子进程。每轮对话中,30 多个传感器的数据以自然语言形式融入提示词。最大的改进之一是提示词结构的设计以保持缓存稳定性:角色和工具信息置于顶部,历史对话放在中间,而动态变化的传感器和视觉数据则放在最新用户轮次的末尾。将动态上下文移出系统块后,缓存 TTFT 从数秒降至约 200 毫秒。所有配置均通过设备上的按钮排、摇杆和模拟编码旋钮完成,无需任何网络接口。很好奇是否还有人在 Orin 级别的硬件上运行 E4B 模型。希望能对比 tok/s 以及如何在避免前缀缓存溢出的情况下处理传感器或工具上下文。
查看原文

相似文章

Gemma 4 VLA 在 Jetson Orin Nano Super 上的演示

Hugging Face Blog

NVIDIA 与 Hugging Face 发布实操演示,展示 Gemma 4 作为视觉-语言-动作模型在 Jetson Orin Nano Super 上完整运行,使用本地语音转文字/文字转语音及网络摄像头输入。