@asterailabs:介绍 Aster Inference——由 AI 研究代理创建的世界上最快的推理 API 我们提供世界上最快的…
摘要
Aster Labs 推出 Aster Inference,声称其使用 AI 研究代理创建了世界上最快的推理 API,并提供了如 OpenAI 的 gpt-oss-120b 和 GLM 5.2 等模型的基准速度。
查看缓存全文
缓存时间: 2026/07/16 14:19
推出 Aster Inference——由 AI 研究智能体创建的全球最快推理 API
我们提供 GPU 上全球最快的推理服务:
- OpenAI 的 gpt-oss-120b @ 644 tps
- http://Z.ai 的 GLM 5.2 @ 281 tps
在 Aster,我们致力于自动化开放式研究,并将推理优化作为衡量智能体能力的基准任务。我们正将系统在推理领域的最新发现转化为产品。
随着智能体的持续探索,我们计划进一步改进推理产品,并推出更多全新的 SOTA AI 产品。
相似文章
@samhogan: 介绍 Fast Inference (https://fast.inference.net) Fast Inference 是一个为希望加快速度的开发者提供的 LLM API acc…
Fast Inference 是一项 LLM API 服务,为开发者提供快速且经济实惠的访问顶级开源和闭源模型的服务,并集成了编码代理和工具如 Claude Code 和 Codex。
Jalapeño首次结果彰显AI推理行业领先速度与效率
OpenAI的Jalapeño定制推理芯片展现行业领先速度与效率,在各类AI模型中实现更高吞吐量与更低延迟。
@k1rallik:NVIDIA 真的在免费送 AI 推理!我 5 分钟搞定,完全不敢相信是免费的 D…
NVIDIA 通过 DGX Cloud 提供免费的 AI 推理,支持 DeepSeek、MiniMax、Kimi、GLM、Llama 等热门模型,API 兼容 OpenAI,5 分钟即可领取。
标准GPU上的实时LLM推理:每请求3k tokens/秒
Kog AI 发布了 Kog Inference Engine 的技术预览版,通过协同设计模型架构、运行时和底层 GPU 代码,在标准数据中心 GPU 上实现了每请求 3,000 tokens/s 的性能,面向延迟敏感的 AI 代理工作流。
@akshay_pachaar:重大突破!自托管LLM的成本刚刚降低了约75%:大多数Agent流水线现在在底层运行4-5个小模型……
Superlinked发布了SIE,一个开源推理引擎,通过一个API提供85+个模型,支持按需加载和LRU逐出,为Agent流水线节省约75%的自托管GPU成本。