展示HN:InstinctFlash – 在Jetson Thor上实时运行5B世界动作模型

Hacker News Top 工具

摘要

InstinctFlash是一个高性能的机器人模型服务框架,可在Jetson Thor上实现实时推理5B世界动作模型,据报道速度提升高达33.78倍。

<p>大家好HN,我是关明,General Instinct的联合创始人。我们刚刚发布了InstinctFlash,一个高性能的机器人模型服务框架。它基于AGPL-3.0许可证。</p><p>在Jetson Thor上,仅通过运行时优化,我们观察到大约1.2倍到7.9倍的速度提升,而对于LingBot-VA,结合这些运行时优化和蒸馏的少步扩散调度器,速度提升高达33.78倍,从原始的25个视觉步骤和50个动作步骤减少到2个和4个步骤。在50个Robotwin2.0任务中,每个配置评估了1,153个片段,使用InstinctFlash的LingBot-VA在2个视觉步骤和4个动作步骤下达到了90.5%的成功率,而基线在25个视觉步骤和50个动作步骤下的成功率为92.1%。</p><p>这是一个优化的5B世界动作模型,在Jetson Thor上实时运行: <a href="https:&#x2F;&#x2F;youtu.be&#x2F;nku65iyL5Fw" rel="nofollow">https:&#x2F;&#x2F;youtu.be&#x2F;nku65iyL5Fw</a></p><p>InstinctFlash目前支持8个VLA/世界动作模型家族,包括pi0.5和NVIDIA Cosmos Policy,覆盖RTX 4090/5090和Jetson Thor。</p><p>只需提供您的微调检查点,InstinctFlash会处理其余部分,通过Python运行时或兼容OpenPI的WebSocket服务器暴露加速模型。</p><p>我们开始这项工作是因为在部署机器人策略时,我们不断遇到相同的问题,模型变得更好,但推理对于实际控制循环来说往往太慢。</p><p>对于pi0.5,混合精度GEMMs和CUDA图加速计算并减少启动开销。对于Cosmos,缓存避免了跨扩散步骤的冗余计算。世界动作模型的扩散去噪步骤依赖于前一步,这促使我们进行了少步蒸馏的工作。</p><p>目前,InstinctFlash包含6个方面的优化。</p><p>- 图:CUDA图捕获、内存规划以及将预填充与重复执行分离。</p><p>- 缓存:跨扩散步骤和预测调用重用KV和条件状态。</p><p>- 注意力:针对不同模型架构的专用注意力路径。</p><p>- 内核:针对特定后端和张量布局的融合操作和内核。</p><p>- 精度:FP8和混合精度执行。</p><p>- 模型:用于扩散和动作生成的少步蒸馏。</p><p>Samsung、Siemens等公司的团队以及其他机器人初创公司已使用InstinctFlash在VLA、WAM和基于扩散的世界模型上进行模型加速。现在我们向您开放访问。</p><p>欢迎在此尝试: <a href="https:&#x2F;&#x2F;github.com&#x2F;General-Instinct&#x2F;InstinctFlash" rel="nofollow">https:&#x2F;&#x2F;github.com&#x2F;General-Instinct&#x2F;InstinctFlash</a></p><p>更多实现细节和基准测试: <a href="https:&#x2F;&#x2F;general-instinct.com&#x2F;blog&#x2F;instinctflash-edge-inference">https:&#x2F;&#x2F;general-instinct.com&#x2F;blog&#x2F;instinctflash-edge-inferen...</a></p><p>期待听到您的反馈!</p>
查看原文
查看缓存全文

缓存时间: 2026/09/22 18:58

General-Instinct/InstinctFlash

来源:https://github.com/General-Instinct/InstinctFlash

面向机器人模型的高性能服务框架。
许可证 (https://www.gnu.org/licenses/agpl-3.0)
网站 (https://general-instinct.com/)
YC (https://www.ycombinator.com/companies/general-instinct)


新闻动态 🔥

  • [2026/09/17] RTX 5090 支持。 在工作站上部署,使用与 Jetson Thor 上相同的运行时 API。安装 · 复现
  • [2026/09/16] RTX 4090 支持。 桌面推理与 WebSocket 服务,提供专用安装配置。安装 · 复现
  • [2026/09/15] 全源代码发布。 八大机器人模型系列、加速内核,以及通过统一运行时提供的 Python / WebSocket 服务。开始使用
  • [2026/09/15] Jetson Thor 基准测试。 使用 LingBot-VA @2V/4A,通过 FP8 和更少采样步数,最高实现 33.78 倍加速结果 · 复现

性能结果

Jetson Thor 上的预测 p50 延迟(毫秒),测量于 2026 年 9 月 15 日。
在我们的实机测试中,观察到最高 33.78 倍加速,且任务性能未见损失。

模型加速路线PyTorchInstinctFlash加速比
LingBot-VAFP8 · 25V/50A15506.322891.745.36×
↳ LingBot-VAFP8 · 2V/4A2071.29459.104.51×
LingBot-VLA-4BFP8624.22221.532.82×
LingBot-VLA-V2-6BFP8734.56394.111.86×
Cosmos3 Edge DROIDNUMERIC · UniPC4 / CFG33393.781048.013.24×
Cosmos3 Nano DROIDNUMERIC · UniPC4 / CFG310184.684772.382.13×
pi05FP8408.5851.857.88×
GR00T N1.7BITEXACT139.50117.301.19×
DreamZero DROIDFP8 · 16 步 · 动态缓存23563.0811899.421.98×

VA 衡量早期续写;每一行对比相同的调度方案。标题中的 33.78 倍加速包含了 25V/50A → 2V/4A 的变化。FP8 和采样变更是可选项。
协议与原始结果 · 原生 VA 2V/4A · 复现命令

安装

git clone https://github.com/General-Instinct/InstinctFlash && cd InstinctFlash  
python3 -m venv .venv-core  
source .venv-core/bin/activate  
python -m pip install . uv==0.12.5  

基于 Python 3.10+ 的核心部分在无需 PyTorch 或 GPU 的情况下,可检查检查点并规划。推理使用每个模型系列独立的、固定的环境。

针对 RTX 4090:

python3 scripts/bootstrap_vendor.py install pi05 --target rtx4090 \  
    --python python3.12 --root ~/ifl-pi05-4090 --ptxas /usr/local/cuda/bin/ptxas  
source ~/ifl-pi05-4090/activate.sh  

使用 vavla4vla2pi05grootedgenanodreamzero。Edge 和 Nano 使用 Python 3.13;其他系列使用 Python 3.12。
引导程序会安装上游源码、兼容性补丁、核心及适配器。模型权重需单独下载。
请参阅 RTX 5090 安装RTX 4090 安装Jetson Thor 安装(后者选择 --target jetson_thor 并使用 Thor CUDA 后端构建)。

加载模型

您的微调检查点 —— 这是预期的使用场景。将 serve 指向训练输出;它将检测模型系列,根据检查点本身证明的内容生成小型的 instinctflash.json 声明文件,并启动服务。
一条命令搞定:

instinctflash serve /path/to/your/checkpoint  

检查点无法证明的任何内容,都会被明确询问,而非猜测。声明文件一旦存在(serve 在首次运行时会写入),同一目录也可在 Python 中加载:

from instinctflash import Runtime  
runtime = Runtime.from_pretrained("/path/to/your/checkpoint")  

官方发布版本 —— 在安装该系列的环境后,使用其 Hub ID:

runtime = Runtime.from_pretrained("robbyant/lingbot-va-posttrain-robotwin")  
系列模型 ID
LingBot-VA (5B WAM)robbyant/lingbot-va-posttrain-robotwin
LingBot-VLA-4Brobbyant/lingbot-vla-4b-posttrain-robotwin
LingBot-VLA-V2-6Brobbyant/lingbot-vla-v2-6b-robotwin
pi0.5lerobot/pi05_base · lerobot/pi05_libero_finetuned_v044
GR00T-N1.7-3Bnvidia/GR00T-N1.7-3B
Cosmos3 策略nvidia/Cosmos3-Edge-Policy-DROID · nvidia/Cosmos3-Nano-Policy-DROID
DreamZeroGEAR-Dreams/DreamZero-DROID

微调模型复用其系列的适配器;质量按检查点评估。相同的 Runtime 默认设置为 precision="native" 并具有 BITEXACT 转换上限。
使用 tier_ceiling="numeric" 允许数值变化,或使用 precision="fp8"(CLI:--fp8)显式启用 FP8。步进调度方案是单独选择的。
请参阅 精度策略FP8 支持与验证。DreamZero 可选的动态步进缓存需要任一精度下都设置 tier_ceiling="behavioral"
请参阅 Thor 测量结果

获取动作

进程内 —— 这是完整的 Python API:

with runtime.episode(prompt="put the bottle in the dustbin") as episode:  
    while not done:  
        result = episode.predict(observation)  
        action = result["action"]  

observation 是模型自有格式的字典;result["action"] 包含其动作数组。对于 LingBot-VA,当控制器更改预测的动作块时,传递 executed_action=...,以便下次预测使用实际执行的动作。

通过网络 —— 上述 serve 命令将相同的运行时托管在 pi0/openpi 生态系统已使用的基于 WebSocket 的 msgpack 线协议之后,因此现有的机器人端客户端无需修改即可连接(pip install openpi-client):

from openpi_client.websocket_client_policy import WebsocketClientPolicy  
client = WebsocketClientPolicy("my-server", 8000)  
result = client.infer(observation)  
action = result["action"]  

提示词包含在观测中;更改提示词会开始一个新的场景,客户端可以通过 {"reset": True, ...} 显式说明。四个标志涵盖其余功能:

  • --serve.dry_run —— 仅预检:设备、声明、计划。无权重,无 GPU。
  • --serve.smoke —— 加载,产生一个动作,退出。
  • --serve.seed —— 为成对比较设置原生执行的种子;FP8 服务拒绝此选项。
  • --serve.viz —— 将观测、动作和延迟流式传输到 Rerun (https://rerun.io) 查看器。

第二个动词 instinctflash validate 检查检查点是否可发布;给定 --validate.teacher_outcomes/.student_outcomes/.margin,它还会认证非劣质性并将证书盖章到包中。

基准测试:加速与量化

供应商和辅助资产准备之后,使用附带的输入和固定的检查点版本,复现成对的 eager/默认/选定运行时测量。Thor 还需要其原生后端。保持模型和资产环境激活。

针对 RTX 4090:

python -I -m benchmarks.regression.reproduce prepare --target rtx4090 \  
    --model pi05 --mode fp8 --output pi05-inputs  
python -I -m benchmarks.regression.reproduce run --prepared pi05-inputs --output pi05-results  
python -I -m benchmarks.regression.serve_smoke --prepared pi05-inputs --output pi05-serving  

run 写入经过检查的 JSON/CSV 报告和完整的动作数组。serve_smoke 测试两个场景的实际 CLI 和 WebSocket 流水线。使用 --mode native 表示默认精度;FP8、数值编译和更改的调度方案是明确的选择。
复现指南
有关其他框架比较,请使用固定比较方案。使用 instinctflash eval 比较原始模型和优化模型。报告分离延迟、动作一致性和模拟器任务成功率。

instinctflash eval adapters  
instinctflash eval coverage --run /path/to/run  
instinctflash eval --registry plan.registry.json report --run /path/to/run  

请参阅评估指南创建和运行成对的 LIBERO / RoboTwin 实验,或参阅基准测试详情了解加速和量化协议。
结果:模拟器筛选可重复性、检查点与边缘延迟扩展的 V2 评估将延迟和质量证据绑定到执行配置文件,并检查显式控制预算。原生资格认证工作流为每个设备添加了全新启动准入、保留的失败案例和特定于检查点的证据。
LingBot-VA Hub ID 保留原生步数;2V/4A 需要显式 nfe 选择。9 月 9 日 Thor 对比分离了原生加速、FP8 运行时增益和成对任务结果;历史引擎控制隔离了额外的实现效果。共享 BF16 融合提供可选的 NUMERIC 路径,具有逐模型兼容性和成对 Thor 回归结果。共享张量缓存与预填充分离将原生 Cosmos 优化扩展到 Edge 和 Nano;精确缓存和 NUMERIC 编译仍是单独的选项。

框架概述

InstinctFlash 将模型声明、优化规划、运行时执行和证据保持在一个可检查的路径中,无论从 Python 还是命令行调用。

架构

检查点携带其自身的简短声明。运行时读取声明,决定哪些优化对于该权重是可证明有效的,应用它们,并展示其工作过程:

checkpoint ─▶ adapter ─▶ planner ─▶ engine passes ─▶ actions  
declares what decides what apply and measure  
the model is is valid (no GPU, each optimization  
no weights needed)  

优化分为六层,依据每层改变的内容:

改变的内容
1模型计算什么 —— 蒸馏、步数缩减、检查点压缩(InstinctCompressinstinct-pdd
2何时发布工作 —— 预填充提取、CUDA 图捕获、内存规划
3缓存重算什么 —— KV 复用、交叉注意力及场景缓存
4注意力标记如何混合 —— FlashAttention、混合及线性注意力
5内核内核如何编写 —— 后端与布局调度、融合
6硬件在何处执行 —— fp8/int8、TensorRT、Jetson 级边缘设备(serving/

第 1 层改变权重并产生检查点;它存在于伴侣仓库中。
第 2-6 层改变权重如何执行并产生计划;它们是本仓库中的运行时。
这些层并非优先顺序 —— 运行时测量实际时间消耗并从那里开始。

添加模型

要添加您自己的模型系列,请声明一个 instinctflash.adapters 入口点并 pip install 您的包 —— 参见 examples/external_plugin/

路线图

  • 少步蒸馏,按需 —— 仅在原生优化未能达到声明的边缘控制预算时使用;使用成对闭环评估将每个学生与其教师和匹配的未训练调度方案进行比较。
  • 边缘引擎上的 LingBot-VA —— 在 Jetson Thor 上的原生和 FP8 服务,具有针对完整和 2V/4A 调度方案的成对推理和 WebSocket 检查。
  • 注意力升级 —— 在 pi05 类模型的 BITEXACT 默认值旁边,提供更快的 NUMERIC 级注意力臂;用于长上下文世界模型的混合和线性注意力。
  • Thor 上的 Cosmos3 和 DreamZero —— 固定安装、成对推理和已安装的 CLI/WebSocket 检查;任务质量仍是单独的评估。
  • 设备特定的服务默认值 —— 测量每个系列和操作点;在调用者的精度约束内选择经过验证的路径。LingBot-VLA-V2 原生 Thor 捕获和 LingBot-VA 饱和分析已完成;选择性 VA 动作捕获未显示加速,仍处于实验阶段。结果与证据。执行绑定的预算选择可用;扩展的 V2 H100 评估仍为筛选中

相似文章

Step 3.7 Flash

Product Hunt

Step 3.7 Flash 是一款快速代理模型,旨在实时观察并采取行动。

使用CUDA内核重写模型推理:瓶颈不仅仅是GEMM [P]

Reddit r/MachineLearning

作者描述了构建FlashRT的过程,这是一个以CUDA为核心的推理运行时,通过使用C++/CUDA内核重写模型推理路径,来解决小批量/实时工作负载中超出GEMM的瓶颈,在Jetson Thor和RTX 5090上实现了显著的延迟改进。文章讨论了关于精度的经验(FP8有帮助,FP4好坏参半)以及绕过通用运行时进行实时推理的必要性。

FlashDrive:面向自动驾驶的快速视觉-语言-动作推理

arXiv cs.AI

FlashDrive是一种算法-系统协同设计框架,通过流式KV缓存复用、非自回归扩散草稿和自适应步长缓存,将自动驾驶视觉-语言-动作模型的推理延迟降低4.7倍(在单块GPU上从717毫秒降至151毫秒),且精度损失可忽略不计。