标签
OpenAI预览Ultrafast,这是GPT-5.6 Sol的一个新服务层级,通过Cerebras运行速度提升高达14倍,在OpenAI API中每秒可生成多达750个token。
Google Gemma宣布,借助Hugging Face和Cerebras实现超快推理,开发者现在可以将Gemma 4 31B模型用作语音AI的大脑,这是开源级联语音到语音堆栈的一部分。
作者分享了 Hermes Mixture-of-Agents 实验中的发现,包括投票器升级、GPU 拓扑和缓存经济学,表明本地前缀缓存可以使长代理会话几乎免费,并且两个独立的 GPU 实例优于单个分区实例。
Thom Wolf 和 Cerebras 发布了一个完全开源、带有模型和代码的实时语音演示,展示了最先进的语音到语音能力。
声称在Cerebras硬件上运行的Gemma-4-31B模型性能优于ChatGPT的语音模式,并通过Hugging Face Space展示了实时语音交互。
Hugging Face和Cerebras展示了一个实时语音到语音流水线,结合了开源模型(Nvidia的Parakeet、Gemma 4、Qwen3TTS)与Cerebras的快速推理,实现了自然的对话式AI,并为Reachy Mini等机器人提供动力。
Cerebras 与 OpenAI 达成了一项价值 200 亿美元的芯片供应协议,该协议预分配了大部分的近期推理容量,导致其他寻求快速推理的初创公司的 API 等待列表实际上变得无限长。
Cerebras 和 Google DeepMind 将于6月28日至29日举办一场24小时黑客马拉松,采用 Gemma 4 模型,搭载超快的 Cerebras 推理,并提供5000美元奖金。
5.6 Sol 模型将于七月在 Cerebras 硬件上运行,提供每秒 750 token 的推理速度。
Cerebras Systems 股价下跌近20%,此前该公司预测毛利率将收窄,尽管第一季度业绩好于预期;CEO Andrew Feldman 表示,由于设备租赁成本,利润率展望被误解。
这是一条对晚点LateTask访谈的总结,回顾了百度美研在AI领域的早期布局,包括投资Cerebras、差点投资OpenAI和Anthropic,以及多位人才从百度流向这些公司等历史细节。
一个标记为“GPT 5.5”的模型出现在 Cerebras 通过 OpenRouter 的统计中,暗示可能有一个新 GPT 迭代的秘密发布或测试阶段。
在一条推文中,Sarah Hooker 指出 GPU 并不适合现实世界数据的长尾分布,并建议需要替代性 AI 硬件。
文章回顾了百度美研十年前投资Cerebras晶圆级芯片公司的故事,分析了AI芯片市场从训练到推理的转变,以及非共识投资的重要性。
Cerebras股票在其IPO以311美元开始交易后17天内下跌超过31%,并受到关于芯片限制和误导性说法的批评。
文章指出,Cerebras芯片针对LLM推理和训练进行了优化,而非通用AI工作负载,并提醒不要过度炒作其能在所有AI领域挑战NVIDIA的能力。
Cerebras 联合创始人解释了 WSE(晶圆级引擎)与 NVIDIA GPU 的根本区别:GPU 为图形设计通过堆叠核心和 NVLink 互联运行 AI,而 WSE 将整块晶圆做成单芯片,片上互联带宽和内存带宽远超 GPU 集群,推理速度大幅领先。
AI基础设施初创公司Modal、Cerebras、Exa、TurboPuffer在过去一周表现亮眼。
Cerebras 联合创始人解释其晶圆级引擎(WSE)相比传统 NVIDIA GPU 如何简化设计。