@asterailabs:介绍 Aster Inference——由 AI 研究代理创建的世界上最快的推理 API 我们提供世界上最快的…

X AI KOLs Timeline 产品

摘要

Aster Labs 推出 Aster Inference,声称其使用 AI 研究代理创建了世界上最快的推理 API,并提供了如 OpenAI 的 gpt-oss-120b 和 GLM 5.2 等模型的基准速度。

介绍 Aster Inference——由 AI 研究代理创建的世界上最快的推理 API 我们在 GPU 上提供世界上最快的推理: - OpenAI 的 gpt-oss-120b @ 644 tps - http://Z.ai 的 GLM 5.2 @ 281 tps 在 Aster,我们正在自动化开放式研究,并将推理优化作为评估我们代理性能的任务。我们正在将系统推理发现转化为产品。 随着我们代理的进一步发现,我们计划继续改进推理产品,并推出新的 SOTA AI 产品。
查看原文
查看缓存全文

缓存时间: 2026/07/16 14:19

推出 Aster Inference——由 AI 研究智能体创建的全球最快推理 API

我们提供 GPU 上全球最快的推理服务:

  • OpenAI 的 gpt-oss-120b @ 644 tps
  • http://Z.ai 的 GLM 5.2 @ 281 tps

在 Aster,我们致力于自动化开放式研究,并将推理优化作为衡量智能体能力的基准任务。我们正将系统在推理领域的最新发现转化为产品。

随着智能体的持续探索,我们计划进一步改进推理产品,并推出更多全新的 SOTA AI 产品。

相似文章

标准GPU上的实时LLM推理:每请求3k tokens/秒

Hacker News Top

Kog AI 发布了 Kog Inference Engine 的技术预览版,通过协同设计模型架构、运行时和底层 GPU 代码,在标准数据中心 GPU 上实现了每请求 3,000 tokens/s 的性能,面向延迟敏感的 AI 代理工作流。