@Celeris_ai:推出 Celeris-1 Magnus。一个为智能体工作构建的模型。在 τ³-bench banking 上,Magnus 在 55 秒时达到 41.2%…

X AI KOLs Timeline 模型

摘要

Celeris-1 Magnus 是一个针对智能体工作优化的混合扩散模型,在 τ³-bench banking 基准测试中,在中位时间 55 秒时达到 41.2% 的解决率,优于像 GPT-5.6-sol 这样的模型。

推出 Celeris-1 Magnus。一个为智能体工作构建的模型。 在 τ³-bench banking 上,Magnus 在 55 秒中位时间达到 41.2%,而 GPT-5.6-sol 在 79 秒达到 38.1%。 这是一个基于 qwen3.8-27b 的混合扩散模型,针对智能体工作负载优化。 如需更多信息,请查看:http://celeris.ai/celeris-1-magnus…
查看原文
查看缓存全文

缓存时间: 2026/09/01 15:46

Celeris-1 Magnus 亮相:专为智能体任务打造的模型。

在 τ3-bench banking 测试中,Magnus 在 55 秒中位耗时下达到了 41.2% 的解决率,而 GPT-5.6-sol 在 79 秒时达到 38.1%。

它是一个基于 qwen3.8-27b 衍生出的混合扩散模型,针对智能体工作负载进行了优化。

更多信息请查看:http://celeris.ai/celeris-1-magnus…


Celeris-1 Magnus:智能体场景下最快的模型

来源:https://celeris.ai/celeris-1-magnus CELERIS-1 MAGNUS

Magnus 专为需要思考、使用工具并完成任务的智能体而构建,无需漫长等待。

智能体 · 处理真实任务,达到真实速度

性能表现

同领域内最高的解决率。

在 τ3-bench banking 全部 97 项任务中,与 gpt-5.6-sol、gpt-5.6-luna 和 gemini-3.7-flash 进行正面比较,推理力度如发布所示。

01 · τ3-BENCH BANKING

010203040100s80s60s50s单任务耗时 (p50) → 越低越好任务解决率 % →Celeris-1 Magnus55秒 · 41.2% · @ 低推理gpt-5.6-sol79秒 · 38.1%gemini-3.7-flash98秒 · 32.0%Celeris-1 Magnus @ 无推理49秒 · 27.8%gpt-5.6-luna57秒 · 18.6% 图 1. 解决率与单任务中位耗时关系图,97 项任务,使用官方评分器。越靠左上方越好。Celeris-1 未进行智能体训练:5.3%。

解决率41.2%

对比 GPT-5.6-SOL提升+3.1分

单任务耗时 · P5055秒

未进行智能体训练5.3%

方法论 → (https://celeris.ai/blog-benchmarks)

在最困难的智能体基准测试中领先

在 τ3-bench banking 上达到 41.2%,领先于 gpt-5.6-sol,拥有该领域最佳解决率。

OFFLOW

推理调节器,按需启用

在“快速”与“彻底”之间切换的单一标志。开启思考后,耗时增加 6 秒,带来 13.4 个额外分数点。

关键时刻,快速响应

每个完成任务的中位耗时 55 秒,比所有与其分数差距在 10 分以内的模型都快。

模型家族

Celeris-1 还是 Magnus?

Celeris-1 专为获取答案而生;Magnus 专为完成任务而生。API 通用,切换只需更改一个词。

Celeris-1

为聊天、搜索和实时界面提供极速生成。

模态文本

上下文窗口131,072 令牌

最大输出2,048 默认

强项即时应答

了解更多 (https://celeris.ai/)

Celeris-1 Magnus

智能体任务:工具循环、长任务、结构化操作。

模态文本 + 工具

上下文窗口131,072 令牌

最大输出16,384 令牌

强项能完成任务的智能体

获取 API 密钥 (https://console.celeris.ai/)

快速开始

开始构建。

API 兼容 OpenAI 格式。将你的 SDK 指向 inference.celeris.ai,无需修改已有的智能体代码。

01

创建账户

在 console.celeris.ai 注册。无等待列表,无销售电话。

02

获取 API 密钥

密钥即时生效,按令牌计费。

03

指向你的 SDK

设置基础 URL 和模型 ID。你现有的智能体代码可直接运行。

agent.pyPYTHON

`` from openai import OpenAI

client = OpenAI( base_url=“https://inference.celeris.ai/celeris-1-magnus/v1”, api_key=“ck_…”, )

resp = client.chat.completions.create( model=“celeris-1-magnus”, messages=[{“role”: “user”, “content”: “将我的周五付款改到周一”}], tools=my_tools, # 推理调节器:在任务需要时启用 extra_body={“chat_template_kwargs”: {“enable_thinking”: True}}, ) ``

相似文章

NVIDIA 刚刚宣布发布 Nemotron 3 Ultra(2分钟阅读)

TLDR AI

Anthropic 发布了其最智能的模型 Claude Opus 4.5,在 Artificial Analysis Intelligence Index 上获得 70 分,仅次于 Gemini 3 Pro。该模型在编码和智能体任务方面取得了显著进步,同时降低了每个token的价格,并保持了强劲的安全性能。

Holotron-12B - 高吞吐量计算机使用智能体

Hugging Face Blog

H 公司发布 Holotron-12B,一款采用混合 SSM 架构、针对高吞吐量推理优化的多模态计算机使用智能体。该模型基于 NVIDIA Nemotron 进行后训练,在交互式智能体工作负载中展现出卓越的效率与可扩展性。