@Celeris_ai:推出 Celeris-1 Magnus。一个为智能体工作构建的模型。在 τ³-bench banking 上,Magnus 在 55 秒时达到 41.2%…
摘要
Celeris-1 Magnus 是一个针对智能体工作优化的混合扩散模型,在 τ³-bench banking 基准测试中,在中位时间 55 秒时达到 41.2% 的解决率,优于像 GPT-5.6-sol 这样的模型。
查看缓存全文
缓存时间: 2026/09/01 15:46
Celeris-1 Magnus 亮相:专为智能体任务打造的模型。
在 τ3-bench banking 测试中,Magnus 在 55 秒中位耗时下达到了 41.2% 的解决率,而 GPT-5.6-sol 在 79 秒时达到 38.1%。
它是一个基于 qwen3.8-27b 衍生出的混合扩散模型,针对智能体工作负载进行了优化。
更多信息请查看:http://celeris.ai/celeris-1-magnus…
Celeris-1 Magnus:智能体场景下最快的模型
来源:https://celeris.ai/celeris-1-magnus CELERIS-1 MAGNUS
Magnus 专为需要思考、使用工具并完成任务的智能体而构建,无需漫长等待。
智能体 · 处理真实任务,达到真实速度
性能表现
同领域内最高的解决率。
在 τ3-bench banking 全部 97 项任务中,与 gpt-5.6-sol、gpt-5.6-luna 和 gemini-3.7-flash 进行正面比较,推理力度如发布所示。
01 · τ3-BENCH BANKING
010203040100s80s60s50s单任务耗时 (p50) → 越低越好任务解决率 % →Celeris-1 Magnus55秒 · 41.2% · @ 低推理gpt-5.6-sol79秒 · 38.1%gemini-3.7-flash98秒 · 32.0%Celeris-1 Magnus @ 无推理49秒 · 27.8%gpt-5.6-luna57秒 · 18.6% 图 1. 解决率与单任务中位耗时关系图,97 项任务,使用官方评分器。越靠左上方越好。Celeris-1 未进行智能体训练:5.3%。
解决率41.2%
对比 GPT-5.6-SOL提升+3.1分
单任务耗时 · P5055秒
未进行智能体训练5.3%
方法论 → (https://celeris.ai/blog-benchmarks)
在最困难的智能体基准测试中领先
在 τ3-bench banking 上达到 41.2%,领先于 gpt-5.6-sol,拥有该领域最佳解决率。
OFFLOW
推理调节器,按需启用
在“快速”与“彻底”之间切换的单一标志。开启思考后,耗时增加 6 秒,带来 13.4 个额外分数点。
关键时刻,快速响应
每个完成任务的中位耗时 55 秒,比所有与其分数差距在 10 分以内的模型都快。
模型家族
Celeris-1 还是 Magnus?
Celeris-1 专为获取答案而生;Magnus 专为完成任务而生。API 通用,切换只需更改一个词。
Celeris-1
为聊天、搜索和实时界面提供极速生成。
模态文本
上下文窗口131,072 令牌
最大输出2,048 默认
强项即时应答
了解更多 (https://celeris.ai/)
Celeris-1 Magnus
智能体任务:工具循环、长任务、结构化操作。
模态文本 + 工具
上下文窗口131,072 令牌
最大输出16,384 令牌
强项能完成任务的智能体
获取 API 密钥 (https://console.celeris.ai/)
快速开始
开始构建。
API 兼容 OpenAI 格式。将你的 SDK 指向 inference.celeris.ai,无需修改已有的智能体代码。
01
创建账户
在 console.celeris.ai 注册。无等待列表,无销售电话。
02
获取 API 密钥
密钥即时生效,按令牌计费。
03
指向你的 SDK
设置基础 URL 和模型 ID。你现有的智能体代码可直接运行。
agent.pyPYTHON
`` from openai import OpenAI
client = OpenAI( base_url=“https://inference.celeris.ai/celeris-1-magnus/v1”, api_key=“ck_…”, )
resp = client.chat.completions.create( model=“celeris-1-magnus”, messages=[{“role”: “user”, “content”: “将我的周五付款改到周一”}], tools=my_tools, # 推理调节器:在任务需要时启用 extra_body={“chat_template_kwargs”: {“enable_thinking”: True}}, ) ``
相似文章
@LottoLabs: 这里有一个有趣的模型,35b a3b 专为智能体使用而训练。它在 Terminal Bench2 上获得 60.7 分,而 qwen 3.6 27b 得分为 59.3。关键……
Nex-AGI 发布了 Nex-N2,一个开源的智能体模型系列 (Nex-N2-Pro 和 Nex-N2-mini),采用 Agentic Thinking 框架,统一了推理、工具使用和环境执行,在智能体和编码基准测试中达到顶级性能。
NVIDIA 刚刚宣布发布 Nemotron 3 Ultra(2分钟阅读)
Anthropic 发布了其最智能的模型 Claude Opus 4.5,在 Artificial Analysis Intelligence Index 上获得 70 分,仅次于 Gemini 3 Pro。该模型在编码和智能体任务方面取得了显著进步,同时降低了每个token的价格,并保持了强劲的安全性能。
@sudoingX:这台笔记本通过 Hermes agent 以 99% GPU 利用率本地跑 31B 模型,持续 15 tok/s,22.8 o…
一台笔记本借助 Hermes agent 本地运行 31B 模型,速度 15 tok/s,显存占用 22.8 GB,功耗 94 W,实现完全自主、私密、无需云端的 AI 推理。
@dabit3:保持模型无关性,使@cognition总能提供“最佳”模型,而不仅仅是“我们的最佳”模型。Devin Fusion是一个…
Cognition推出Devin Fusion,这是一款自适应模型路由器,可在保持真正前沿智能用于代理编程任务的同时,将成本降低35%。
Holotron-12B - 高吞吐量计算机使用智能体
H 公司发布 Holotron-12B,一款采用混合 SSM 架构、针对高吞吐量推理优化的多模态计算机使用智能体。该模型基于 NVIDIA Nemotron 进行后训练,在交互式智能体工作负载中展现出卓越的效率与可扩展性。