阿里Qwen3.7-Max在陌生硬件上自主运行35小时,持续自我优化
摘要
阿里Qwen3.7-Max模型在陌生T-Head PPU硬件上,无需人工引导,自主优化生产内核长达35小时,进行1158次工具调用,实现10倍速度提升,展示了持续的自主智能体行为。
暂无内容
查看缓存全文
缓存时间: 2026/05/25 10:19
# 阿里巴巴 Qwen3.7-Max 在陌生硬件上自主运行 35 小时,仍在持续改进 - Firethering
来源:https://firethering.com/alibaba-qwen3-7-max-autonomous-agent/
\- 广告 \-
阿里巴巴让 Qwen3.7-Max (https://qwen.ai/blog?id=qwen3.7) 在一个该模型从未见过的硬件平台上执行内核优化任务。没有文档,没有性能分析数据,没有该架构的示例内核。只有一个任务描述、一份现有实现和一个评估脚本。
模型运行了 35 小时。它发出了 1,158 次工具调用。它反复编写、编译、分析并重写内核,诊断故障、修复错误、识别瓶颈,并在无人监控的情况下多次重新设计架构。在 30 小时后,它仍在发现有意义的改进。
最终结果是:相比参考实现,速度提升了 10 倍。
作为背景:GLM 5.1 运行同一任务达到了 7.3 倍加速。Kimi K2.6 达到了 5 倍。DeepSeek V4 Pro 达到了 3.3 倍。那些提前停止的模型,是因为连续五轮没有发出任何工具调用,它们认为自己无法取得进一步进展而停止。Qwen3.7-Max 没有停止。
## **这个任务到底是什么**
涉及的内核是 Extend Attention,这是广泛使用的推理框架 SGLang 中的一个生产组件。具体来说,它处理新生成的 token 与最多 32K 条目的前缀 KV 缓存之间的注意力机制,这是一个受内存限制、对延迟敏感的操作,直接影响 LLM 响应的速度。
硬件是 T-Head ZW-M890 PPUs,这是一种训练数据中从未出现过的处理器架构。模型对它的行为没有任何先验知识。它是从零开始。
35 小时内,它执行了 432 次内核评估。每个周期包括:编写代码、编译、运行、读取性能分析输出、决定修改什么、然后再次尝试。模型诊断了它从未见过的编译失败,通过运行时反馈而非先验知识识别性能瓶颈,并在增量改进失效时多次重新设计内核架构。
这之所以重要,是因为它测试了与标准基准不同的能力。大多数评估衡量的是模型能否在给定明确问题时给出正确答案。而这次评估衡量的是,在一个开放式的优化问题上,模型能否在超过一千次工具调用中维持连贯的策略,且没有任何人类指导。这是不同的技能,大多数模型不具备。
## **基准测试结果**
qwen 3.7 max 基准测试数据via: Qwen Blog以下数据来自阿里巴巴自己的评估。
| 基准测试 | Qwen3.7-Max | Claude Opus 4.6 | DeepSeek V4 Pro |
| --- | --- | --- | --- |
| SWE-Verified | 80.4 | 80.8 | 80.6 |
| Terminal Bench 2.0 | 69.7 | 65.4 | 67.9 |
| GPQA Diamond | 92.4 | 91.3 | 90.1 |
| HLE | 41.4 | 40.0 | 37.7 |
| HMMT 2026 Feb | 97.1 | 96.2 | 95.2 |
| BFCL-V4 | 75.0 | 76.7 | 70.6 |
在编码 agent 方面,它与 Opus 4.6 和 DeepSeek 互有胜负,并没有明显击败其中任何一个。Terminal Bench 是个例外,它领先。在推理能力方面,差距更为一致:GPQA Diamond、HLE 和 HMMT 均显示 Qwen3.7-Max 达到或超过了最强的可比较基准点。
其余基准测试让你清楚了解该模型是否适合你的用例。
##### **你可能喜欢:**字节跳动开源了一款用于图像、视频、编辑和推理的 3B 模型 (https://firethering.com/bytedance-open-source-lance-3b-multimodal-model/)
## **这个模型为何训练方式不同**
大多数模型通过看到更多文本来提升。Qwen3.7-Max 通过经历更多场景来提升。
阿里巴巴称之为环境缩放。他们不是针对特定基准进行优化,而是构建了一个庞大且多样化的 agentic 训练环境——不同的任务、不同的工具、不同的框架——并在所有这些环境中训练模型。这背后的道理与模型在多样化文本上训练比在狭窄文本上训练泛化能力更好是相同的。经验的多样性产生了可迁移的能力。
实际结果是跨框架的泛化能力。无论 Qwen3.7-Max 是通过 Claude Code、Qwen Code 还是自定义工具调用框架运行,其表现都保持一致。它学会了解决问题,而不是学习特定脚手架的模式。这比听起来更罕见——大多数 agentic 模型都会悄悄过拟合于它们训练时所使用的评估设置。
## **局限性**
这是一款专有 API 模型。没有开放权重,不支持本地部署或自托管。对于有数据隐私要求的团队,或者任何希望在自己的基础设施上运行模型的用户来说,无论基准测试数字如何,这都是一个硬性限制。
指令遵循方面的差距也是真实存在的。IFBench 得分 79.1 虽然强劲,但在复杂的多步骤指令遵循方面低于一些竞争对手。对于需要严格格式或长会话中精确输出结构的工作流,在投入之前值得测试。
此外,基准测试表格完全是自报的。这些评估由阿里巴巴自行运行。独立复现将揭示全貌。
##### **你可能喜欢:**为真正自主工作而构建的开源 AI agent 模型 (https://firethering.com/best-open-source-ai-agent-models/)
## **这适合谁?**
一个在它从未见过的硬件上自主运行了 35 小时、在 30 小时后仍在改进、最终比参考实现快 10 倍的模型,这不是一个普通的结果。基准测试数字与现有最佳模型不相上下。而内核运行则完全是另一类证据。
如果你正在构建 agentic 工作流,并且可以接受专有 API,那么这值得认真评估。如果开放权重是必要条件,那么它目前还不是一个选项。这就是全部的事实,坦诚相告。
相似文章
@kimmonismus:天啊,中国再次出手:Qwen3.8-Max 据报自主运行16天,成本比 GPT-5.6 S… 低80%
阿里巴巴发布 Qwen3.8-Max,一个 2.4T 参数的 MoE 前沿模型,开放权重将于下周推出,声称自主运行16天,成本显著低于 GPT-5.6 Sol 和 Claude Fable 5。
一个智能体在无人监督的情况下连续编码了10天。Qwen 3.8 max
阿里巴巴的Qwen智能体在一个空仓库中自主编码超过10天,提交issue、编写代码、运行测试、修复失败并合并。它仍然需要一些反馈,但这展示了一个自我纠错的自主循环。
Qwen3.7:智能代理前沿(15分钟阅读)
阿里巴巴Qwen团队发布了Qwen3.7-Max,这是一款专有智能代理基础模型,在Terminal-Bench 2.0、SWE-Pro、GPQA Diamond等多个基准测试中取得最高分,并在多种代码环境中表现一致。
@rohanpaul_ai: 阿里巴巴发布了Qwen3.8-Max,一个2.4万亿参数模型,每个token仅激活约950亿参数。一个……
阿里巴巴发布了Qwen3.8-Max,这是一个2.4万亿参数的稀疏MoE模型,每个token激活950亿参数,支持100万token的上下文,并具有强大的智能体能力和基准测试结果,包括自主编码数天、电路设计,以及在Terminal Bench和PaperBench上超越竞争对手。
Qwen3.6-Max-Preview
阿里巴巴发布旗舰模型 Qwen3.6-Max-Preview,专为智能体编程任务优化。