标签
RunInfra 宣布 GLM 5.3 Flash 推出重大版本,采用重写的推理内核,在 FP8、厂商原生构建上可达 670 tok/s,现已同时支持 AMD 运行,定价具备竞争力,支持 100 万 token 上下文窗口。
NVIDIA 通过其平台提供免费访问四个 AI 模型,包括 DeepSeek V4.1 Flash、GLM 5.3、GLM 5.3 Flash 和 Kimi K3,无需信用卡。
Nunchux AI 推出了 Modelverse,这是一个多模态生成式AI推理服务,通过单一API提供快速、实惠的访问,支持超过30种图像、视频和化身模型。
一篇博客文章认为,AI 推理提供商通过返回不透明、绑定提供商的状态(加密推理令牌、隐藏的子代理消息、不可导出的上下文)而非用户拥有的转录文本,从而损害了会话的可移植性,并提出了针对会话所有权的实用测试。
Kimi K3 是 Moonshot AI 推出的 2.8 万亿参数的开源模型,支持 100 万 token 上下文和原生视觉能力,现已上线 Telnyx Inference API,适用于编码、推理和多模态等任务。
BentoML是一个开源Python框架,简化了将AI模型打包、提供服务和部署为REST API的过程,支持容器化和多模型编排。
Aster Labs 推出 Aster Inference,声称其使用 AI 研究代理创建了世界上最快的推理 API,并提供了如 OpenAI 的 gpt-oss-120b 和 GLM 5.2 等模型的基准速度。
本文认为,开源权重AI模型追赶闭源模型并非通过蒸馏技术,而是得益于AI堆栈的模块化——稳定的接口(Transformer架构、兼容OpenAI的推理API、智能体框架)使得创新能在整个生态系统中迅速扩散,在缩小能力差距的同时保持巨大的价格优势,最终可能导致前沿AI的商品化。
Baseten 宣布推出针对 GLM-5.2 开源模型的世界最快 API,通过 NVFP4 量化、分离式推理等优化,实现每秒超过 280 个 token 的处理速度。
Kimi K2.6 作为开放权重模型发布,具备强大的智能体能力,可通过 FireworksAI 的高速推理 API 使用。