Launch HN: General Instinct (YC P26) – 在边缘设备上运行前沿模型

Hacker News Top 产品

摘要

General Instinct 推出 InstinctRazor,这是一款开源工具,可将 Qwen3.5-122B 等大型 MoE 模型压缩为 48GiB 的 GGUF 格式,从而在仅需 8GB VRAM 的边缘硬件上实现前沿模型性能。

<p>各位 Hacker News 的朋友们,我们是 General Instinct 的 Guanming 和 Bill(<a href="https://general-instinct.com/">https://general-instinct.com/</a>)。</p><p>经过多年在机器人领域的探索,我们反复遇到同一个问题:最好的模型永远无法适配我们实际可用的硬件。</p><p>性能最佳的模型通常基于数据中心假设设计:大型 GPU、高内存带宽、可靠的网络连接。然而,大多数物理系统却面临相反的约束条件。</p><p>这促使我们探索这样一个问题:在保持边缘硬件实用性的前提下,一个前沿模型究竟能保留多少能力。</p><p>作为这项工作的一部分,我们最近开源了 InstinctRazor(<a href="https://github.com/General-Instinct/InstinctRazor" rel="nofollow">https://github.com/General-Instinct/InstinctRazor</a>)。</p><p>其中一个令我们兴奋的成果是:将 Qwen3.5-122B-A10B(约 245 GB BF16 MoE 模型)压缩为 48 GiB 的 GGUF 格式。最终模型体积比 Gemma-4-26B-A4B 更小,但在 MMLU-Pro、GPQA-D 等基准测试中表现更优。我们保留了始终活跃的部分(路由器、归一化层、Gated-DeltaNet/SSM 层、视觉通路等),并对路由专家进行了更激进的量化。然后使用同策略蒸馏(on-policy distillation)来恢复量化过程中损失的能力。</p><p>该模型还可以在“小 GPU”配置下运行,即从系统 RAM 中流式传输专家层。在 8k 上下文窗口下,峰值 VRAM 占用约为 7.6–8 GB。</p><p>如果您对技术细节感兴趣,我们在此处详细介绍了方法(<a href="https://general-instinct.com/blog/frontier-moe-sub-4-bit">https://general-instinct.com/blog/frontier-moe-sub-4-bit</a>)。</p><p>我们特别期待听到将模型部署到机器人或其他边缘设备上的朋友们的反馈。您目前尝试在本地运行哪些模型?在将其投入生产的过程中,最大的瓶颈是什么?</p>
查看原文
查看缓存全文

缓存时间: 2026/06/05 17:09

# Launch HN: General Instinct (YC P26) – 在边缘设备上运行前沿模型 来源:https://news.ycombinator.com/item?id=48414869 大家好,我是 General Instinct 的 Guanming 和 Bill(https://general-instinct.com/)。 在机器人领域工作多年后,我们不断遇到同一个问题:最好的模型始终无法适配我们实际拥有的硬件。 表现最好的模型通常基于数据中心假设来设计:大型 GPU、大量内存带宽和可靠的网络连接。但大多数物理系统恰恰面临相反的约束条件。 这促使我们探索:在保持前沿模型核心能力的同时,如何使其能够在边缘硬件上实际运行。 作为这项工作的一部分,我们最近开源了 InstinctRazor(https://github.com/General-Instinct/InstinctRazor)。 我们感到兴奋的一个成果是:将 Qwen3.5-122B-A10B(一个约 245 GB 的 BF16 MoE 模型)压缩成 48 GiB 的 GGUF 格式。压缩后的模型体积甚至小于 Gemma-4-26B-A4B,而在 MMLU-Pro、GPQA-D 等基准测试中表现更优。我们保留了始终活跃的部件(路由器、归一化层、Gated-DeltaNet/SSM 层、视觉通路等),并对路由专家进行了更激进的量化。随后我们采用在线策略蒸馏来恢复量化过程中损失的能力。 该模型还可以在"小显存 GPU"配置下运行:专家模块从系统内存中流式加载。在 8k 上下文窗口下,峰值 VRAM 使用约为 7.6–8 GB。 如果你对技术细节感兴趣,我们在博客中详细介绍了这个方法(https://general-instinct.com/blog/frontier-moe-sub-4-bit)。 我们特别希望听取将模型部署到机器人或其他边缘设备的开发者的意见。你们目前在本地尝试运行哪些模型?将它们投入生产时遇到的最大瓶颈是什么?

相似文章

AMD的Instinct MI455X:志在巅峰

Hacker News Top

AMD推出了Instinct MI455X GPU,这是其首款专为机架级部署设计的AI加速器,基于全新的CDNA5架构,性能高达40.26 PFLOP,配备432 GB HBM4内存,以及Helios机架级解决方案支持72 GPU集群。

LiquidAI/LFM2.5-230M

Hugging Face Models Trending

Liquid AI发布了LFM2.5-230M,一款紧凑的230M参数混合模型,针对设备端部署进行了优化,边缘推理速度快(在Galaxy S25 Ultra上达到213 tok/s),并通过强化学习构建,适用于智能体任务。