@no_stp_on_snek: 本周越来越好。
摘要
Molei Tao 介绍了 FLARE,这是一种扩散语言模型,其性能接近 GPT5,且推理速度显著更快。
本周越来越好。
查看缓存全文
缓存时间: 2026/08/14 17:52
这周真是越来越精彩了。
莫磊·陶 (@MoleiTaoMath): 今天正式介绍 FLARE——一款扩散语言模型,其性能接近 GPT5,速度却具有数量级优势。
领域内的朋友可能了解:
- LLaDA & Dream:开创者,被众多后续研究采用
- Mercury:首个商用模型,试过才知道!
- Nemotron Diffusion,
相似文章
@ying11231:在TPU上令人印象深刻的性能。
LMSYS Org 的一篇博客文章详细介绍了使用 SGLang-JAX 在 TPU v7x 上优化 Ling-2.6-1T(一个 1 万亿参数的混合 MoE 模型),通过单个 Pallas 内核将 MoE 数据移动隐藏在计算之后,从而实现高效的推理。
@SebastienBubeck: https://x.com/SebastienBubeck/status/2075596982622835006
GPT-5.6 在一个关于梯度流长度的基础数学问题上显著超越了已发布的最先进水平,实现了指数级的改进。这标志着人工智能在推理复杂数学问题能力上的重大进步。
介绍 celeris-1(2分钟阅读)
Celeris-1 是一种采用基于扩散的推理架构的新型语言模型,实现了接近 GPT-5 水平的智能,响应速度快 15 倍,吞吐量高。
面向开发者推出GPT-5.1
OpenAI发布了GPT-5.1,这是GPT-5系列中的一个新模型,它可以基于任务复杂度动态调整思考时间,在保持前沿智能的同时,性能比GPT-5快2-3倍。此次发布包括扩展的提示缓存(24小时保留)、新的编码工具(apply_patch和shell),以及针对延迟敏感应用的“无推理”模式。
@philipkiely: https://x.com/philipkiely/status/2069212319746506968
Baseten 宣布推出针对 GLM-5.2 开源模型的世界最快 API,通过 NVFP4 量化、分离式推理等优化,实现每秒超过 280 个 token 的处理速度。