展示HN:InstinctFlash – 在Jetson Thor上实时运行5B世界动作模型
摘要
InstinctFlash是一个高性能的机器人模型服务框架,可在Jetson Thor上实现实时推理5B世界动作模型,据报道速度提升高达33.78倍。
查看缓存全文
缓存时间: 2026/09/22 18:58
General-Instinct/InstinctFlash
来源:https://github.com/General-Instinct/InstinctFlash
面向机器人模型的高性能服务框架。
许可证 (https://www.gnu.org/licenses/agpl-3.0)
网站 (https://general-instinct.com/)
YC (https://www.ycombinator.com/companies/general-instinct)
新闻动态 🔥
- [2026/09/17] RTX 5090 支持。 在工作站上部署,使用与 Jetson Thor 上相同的运行时 API。安装 · 复现。
- [2026/09/16] RTX 4090 支持。 桌面推理与 WebSocket 服务,提供专用安装配置。安装 · 复现。
- [2026/09/15] 全源代码发布。 八大机器人模型系列、加速内核,以及通过统一运行时提供的 Python / WebSocket 服务。开始使用。
- [2026/09/15] Jetson Thor 基准测试。 使用 LingBot-VA @2V/4A,通过 FP8 和更少采样步数,最高实现 33.78 倍加速。结果 · 复现。
性能结果
在 Jetson Thor 上的预测 p50 延迟(毫秒),测量于 2026 年 9 月 15 日。
在我们的实机测试中,观察到最高 33.78 倍加速,且任务性能未见损失。
| 模型 | 加速路线 | PyTorch | InstinctFlash | 加速比 |
|---|---|---|---|---|
| LingBot-VA | FP8 · 25V/50A | 15506.32 | 2891.74 | 5.36× |
| ↳ LingBot-VA | FP8 · 2V/4A | 2071.29 | 459.10 | 4.51× |
| LingBot-VLA-4B | FP8 | 624.22 | 221.53 | 2.82× |
| LingBot-VLA-V2-6B | FP8 | 734.56 | 394.11 | 1.86× |
| Cosmos3 Edge DROID | NUMERIC · UniPC4 / CFG3 | 3393.78 | 1048.01 | 3.24× |
| Cosmos3 Nano DROID | NUMERIC · UniPC4 / CFG3 | 10184.68 | 4772.38 | 2.13× |
| pi05 | FP8 | 408.58 | 51.85 | 7.88× |
| GR00T N1.7 | BITEXACT | 139.50 | 117.30 | 1.19× |
| DreamZero DROID | FP8 · 16 步 · 动态缓存 | 23563.08 | 11899.42 | 1.98× |
VA 衡量早期续写;每一行对比相同的调度方案。标题中的 33.78 倍加速包含了 25V/50A → 2V/4A 的变化。FP8 和采样变更是可选项。
协议与原始结果 · 原生 VA 2V/4A · 复现命令
安装
git clone https://github.com/General-Instinct/InstinctFlash && cd InstinctFlash
python3 -m venv .venv-core
source .venv-core/bin/activate
python -m pip install . uv==0.12.5
基于 Python 3.10+ 的核心部分在无需 PyTorch 或 GPU 的情况下,可检查检查点并规划。推理使用每个模型系列独立的、固定的环境。
针对 RTX 4090:
python3 scripts/bootstrap_vendor.py install pi05 --target rtx4090 \
--python python3.12 --root ~/ifl-pi05-4090 --ptxas /usr/local/cuda/bin/ptxas
source ~/ifl-pi05-4090/activate.sh
使用 va、vla4、vla2、pi05、groot、edge、nano 或 dreamzero。Edge 和 Nano 使用 Python 3.13;其他系列使用 Python 3.12。
引导程序会安装上游源码、兼容性补丁、核心及适配器。模型权重需单独下载。
请参阅 RTX 5090 安装、RTX 4090 安装 或 Jetson Thor 安装(后者选择 --target jetson_thor 并使用 Thor CUDA 后端构建)。
加载模型
您的微调检查点 —— 这是预期的使用场景。将 serve 指向训练输出;它将检测模型系列,根据检查点本身证明的内容生成小型的 instinctflash.json 声明文件,并启动服务。
一条命令搞定:
instinctflash serve /path/to/your/checkpoint
检查点无法证明的任何内容,都会被明确询问,而非猜测。声明文件一旦存在(serve 在首次运行时会写入),同一目录也可在 Python 中加载:
from instinctflash import Runtime
runtime = Runtime.from_pretrained("/path/to/your/checkpoint")
官方发布版本 —— 在安装该系列的环境后,使用其 Hub ID:
runtime = Runtime.from_pretrained("robbyant/lingbot-va-posttrain-robotwin")
| 系列 | 模型 ID |
|---|---|
| LingBot-VA (5B WAM) | robbyant/lingbot-va-posttrain-robotwin |
| LingBot-VLA-4B | robbyant/lingbot-vla-4b-posttrain-robotwin |
| LingBot-VLA-V2-6B | robbyant/lingbot-vla-v2-6b-robotwin |
| pi0.5 | lerobot/pi05_base · lerobot/pi05_libero_finetuned_v044 |
| GR00T-N1.7-3B | nvidia/GR00T-N1.7-3B |
| Cosmos3 策略 | nvidia/Cosmos3-Edge-Policy-DROID · nvidia/Cosmos3-Nano-Policy-DROID |
| DreamZero | GEAR-Dreams/DreamZero-DROID |
微调模型复用其系列的适配器;质量按检查点评估。相同的 Runtime 默认设置为 precision="native" 并具有 BITEXACT 转换上限。
使用 tier_ceiling="numeric" 允许数值变化,或使用 precision="fp8"(CLI:--fp8)显式启用 FP8。步进调度方案是单独选择的。
请参阅 精度策略 和 FP8 支持与验证。DreamZero 可选的动态步进缓存需要任一精度下都设置 tier_ceiling="behavioral"。
请参阅 Thor 测量结果。
获取动作
进程内 —— 这是完整的 Python API:
with runtime.episode(prompt="put the bottle in the dustbin") as episode:
while not done:
result = episode.predict(observation)
action = result["action"]
observation 是模型自有格式的字典;result["action"] 包含其动作数组。对于 LingBot-VA,当控制器更改预测的动作块时,传递 executed_action=...,以便下次预测使用实际执行的动作。
通过网络 —— 上述 serve 命令将相同的运行时托管在 pi0/openpi 生态系统已使用的基于 WebSocket 的 msgpack 线协议之后,因此现有的机器人端客户端无需修改即可连接(pip install openpi-client):
from openpi_client.websocket_client_policy import WebsocketClientPolicy
client = WebsocketClientPolicy("my-server", 8000)
result = client.infer(observation)
action = result["action"]
提示词包含在观测中;更改提示词会开始一个新的场景,客户端可以通过 {"reset": True, ...} 显式说明。四个标志涵盖其余功能:
--serve.dry_run—— 仅预检:设备、声明、计划。无权重,无 GPU。--serve.smoke—— 加载,产生一个动作,退出。--serve.seed—— 为成对比较设置原生执行的种子;FP8 服务拒绝此选项。--serve.viz—— 将观测、动作和延迟流式传输到 Rerun (https://rerun.io) 查看器。
第二个动词 instinctflash validate 检查检查点是否可发布;给定 --validate.teacher_outcomes/.student_outcomes/.margin,它还会认证非劣质性并将证书盖章到包中。
基准测试:加速与量化
在供应商和辅助资产准备之后,使用附带的输入和固定的检查点版本,复现成对的 eager/默认/选定运行时测量。Thor 还需要其原生后端。保持模型和资产环境激活。
针对 RTX 4090:
python -I -m benchmarks.regression.reproduce prepare --target rtx4090 \
--model pi05 --mode fp8 --output pi05-inputs
python -I -m benchmarks.regression.reproduce run --prepared pi05-inputs --output pi05-results
python -I -m benchmarks.regression.serve_smoke --prepared pi05-inputs --output pi05-serving
run 写入经过检查的 JSON/CSV 报告和完整的动作数组。serve_smoke 测试两个场景的实际 CLI 和 WebSocket 流水线。使用 --mode native 表示默认精度;FP8、数值编译和更改的调度方案是明确的选择。
复现指南。
有关其他框架比较,请使用固定比较方案。使用 instinctflash eval 比较原始模型和优化模型。报告分离延迟、动作一致性和模拟器任务成功率。
instinctflash eval adapters
instinctflash eval coverage --run /path/to/run
instinctflash eval --registry plan.registry.json report --run /path/to/run
请参阅评估指南创建和运行成对的 LIBERO / RoboTwin 实验,或参阅基准测试详情了解加速和量化协议。
结果:模拟器筛选 和 可重复性、检查点与边缘延迟。扩展的 V2 评估将延迟和质量证据绑定到执行配置文件,并检查显式控制预算。原生资格认证工作流为每个设备添加了全新启动准入、保留的失败案例和特定于检查点的证据。
LingBot-VA Hub ID 保留原生步数;2V/4A 需要显式 nfe 选择。9 月 9 日 Thor 对比分离了原生加速、FP8 运行时增益和成对任务结果;历史引擎控制隔离了额外的实现效果。共享 BF16 融合提供可选的 NUMERIC 路径,具有逐模型兼容性和成对 Thor 回归结果。共享张量缓存与预填充分离将原生 Cosmos 优化扩展到 Edge 和 Nano;精确缓存和 NUMERIC 编译仍是单独的选项。
框架概述
InstinctFlash 将模型声明、优化规划、运行时执行和证据保持在一个可检查的路径中,无论从 Python 还是命令行调用。
架构
检查点携带其自身的简短声明。运行时读取声明,决定哪些优化对于该权重是可证明有效的,应用它们,并展示其工作过程:
checkpoint ─▶ adapter ─▶ planner ─▶ engine passes ─▶ actions
declares what decides what apply and measure
the model is is valid (no GPU, each optimization
no weights needed)
优化分为六层,依据每层改变的内容:
| 层 | 改变的内容 | |
|---|---|---|
| 1 | 模型 | 计算什么 —— 蒸馏、步数缩减、检查点压缩(InstinctCompress、instinct-pdd) |
| 2 | 图 | 何时发布工作 —— 预填充提取、CUDA 图捕获、内存规划 |
| 3 | 缓存 | 重算什么 —— KV 复用、交叉注意力及场景缓存 |
| 4 | 注意力 | 标记如何混合 —— FlashAttention、混合及线性注意力 |
| 5 | 内核 | 内核如何编写 —— 后端与布局调度、融合 |
| 6 | 硬件 | 在何处执行 —— fp8/int8、TensorRT、Jetson 级边缘设备(serving/) |
第 1 层改变权重并产生检查点;它存在于伴侣仓库中。
第 2-6 层改变权重如何执行并产生计划;它们是本仓库中的运行时。
这些层并非优先顺序 —— 运行时测量实际时间消耗并从那里开始。
添加模型
要添加您自己的模型系列,请声明一个 instinctflash.adapters 入口点并 pip install 您的包 —— 参见 examples/external_plugin/。
路线图
- 少步蒸馏,按需 —— 仅在原生优化未能达到声明的边缘控制预算时使用;使用成对闭环评估将每个学生与其教师和匹配的未训练调度方案进行比较。
- 边缘引擎上的 LingBot-VA —— 在 Jetson Thor 上的原生和 FP8 服务,具有针对完整和 2V/4A 调度方案的成对推理和 WebSocket 检查。
- 注意力升级 —— 在 pi05 类模型的 BITEXACT 默认值旁边,提供更快的 NUMERIC 级注意力臂;用于长上下文世界模型的混合和线性注意力。
- Thor 上的 Cosmos3 和 DreamZero —— 固定安装、成对推理和已安装的 CLI/WebSocket 检查;任务质量仍是单独的评估。
- 设备特定的服务默认值 —— 测量每个系列和操作点;在调用者的精度约束内选择经过验证的路径。LingBot-VLA-V2 原生 Thor 捕获和 LingBot-VA 饱和分析已完成;选择性 VA 动作捕获未显示加速,仍处于实验阶段。结果与证据。执行绑定的预算选择可用;扩展的 V2 H100 评估仍为筛选中。
相似文章
Step 3.7 Flash
Step 3.7 Flash 是一款快速代理模型,旨在实时观察并采取行动。
@PrajwalTomar_: 大部分Flash模型止步于更便宜、更快。而这款模型被设计用来真正完成工作。我在一个...上运行了Step 3.7 Flash。
Step 3.7 Flash 是一款紧凑型模型,能够处理视觉、实时数据检索和代码生成,从一张截图开始,在几分钟内自主构建一个可用的仪表盘,每次会话成本约为50美分。
使用CUDA内核重写模型推理:瓶颈不仅仅是GEMM [P]
作者描述了构建FlashRT的过程,这是一个以CUDA为核心的推理运行时,通过使用C++/CUDA内核重写模型推理路径,来解决小批量/实时工作负载中超出GEMM的瓶颈,在Jetson Thor和RTX 5090上实现了显著的延迟改进。文章讨论了关于精度的经验(FP8有帮助,FP4好坏参半)以及绕过通用运行时进行实时推理的必要性。
@nathanhabib1011: 来自 @StepFun_ai 的 Step-3.7-Flash 是一个低调的赢家。效果极为惊艳,是HuggingFace排行榜上参数量低于500B的最佳模型……
Step-3.7-Flash(来自 StepFun_ai)被突出显示为 Hugging Face 排行榜上参数量低于500B的最佳模型,具有强大的多模态性能。
FlashDrive:面向自动驾驶的快速视觉-语言-动作推理
FlashDrive是一种算法-系统协同设计框架,通过流式KV缓存复用、非自回归扩散草稿和自适应步长缓存,将自动驾驶视觉-语言-动作模型的推理延迟降低4.7倍(在单块GPU上从717毫秒降至151毫秒),且精度损失可忽略不计。