@rohanpaul_ai:NVIDIA的非独占Groq许可协议8个月后,Groq技术终于出现在机架规模的……

X AI KOLs Timeline 产品

摘要

NVIDIA正在将Groq技术集成到机架规模的产品中,以通过跨专业处理器分配工作负载来增强代理AI性能,改善令牌生成延迟和整体响应性。

8个月后,NVIDIA的非独占Groq许可协议生效,Groq技术终于开始出现在机架规模的NVIDIA产品中。 Groq机架将于今年上线。 因此,NVIDIA正在将代理AI工作负载分配到专业处理器上,而不是将GPU视为整个机器。 Rubin GPU处理繁重的模型计算,Groq 3 LPX针对延迟敏感的令牌生成,而Vera CPU将运行代码、工具、数据处理和围绕模型的模拟。 代理使得令牌生成延迟比在普通聊天中更为关键,因为后续步骤通常需要等待前序步骤完成。 NVIDIA声称的4倍响应性提升(NVIDIA的Groq 3 LPX对比Cerebras的推理平台)因此可以在长任务中累积,而不仅仅是使单个响应看起来更快。这是推理硬件将按工作负载细分的一个重要原因。
查看原文
查看缓存全文

缓存时间: 2026/08/25 20:09

NVIDIA与Groq达成非独家授权协议仅8个月后,Groq技术现已融入NVIDIA的机架级产品。
Groq机架设备将于今年投入运行。

这意味着NVIDIA正将智能体AI工作负载分散到专用处理器上,而非仅依赖GPU承担全部任务。
其中Rubin GPU负责重型模型计算,Groq 3 LPX专攻低延迟的token生成,而Vera CPU将处理模型外围的代码执行、工具调用、数据处理与模拟仿真。

在智能体场景中,token生成延迟的影响远超普通对话模式——因为后续步骤往往需要等待前序任务完成。
NVIDIA宣称Groq 3 LPX相比Cerebras推理平台可实现4倍响应速度提升,这种优势将在长任务链中产生累积效应,而不仅仅是让单次响应显得更快。
正因为如此,推理硬件正开始按工作负载类型走向细分化发展。

相似文章

Groq如何筹集更多资金?

Hacker News Top

尽管Groq将其技术授权给Nvidia,但公司实体保留了其数据中心运营和推理API,专注于快速的小模型推理,因此正在筹集6.5亿美元。