@WEB3_furture: COOL ! 有人拿 新发布Qwen 3.7-Max和Claude Opus 4.7、GPT-5.5 做 Agent 循环对比:让模型自己写俄罗斯方块机器人、自己测试、连续迭代 10 轮后直接 PK,结果: Qwen 3.7-Max:+$…
摘要
有人对Qwen 3.7-Max、Claude Opus 4.7和GPT-5.5进行Agent循环对比测试,让模型自己编写俄罗斯方块机器人并迭代10轮后PK,结果显示Qwen 3.7-Max在性能和成本上均领先。
查看缓存全文
缓存时间: 2026/05/22 11:49
COOL ! 有人拿 新发布Qwen 3.7-Max和Claude Opus 4.7、GPT-5.5 做 Agent 循环对比:让模型自己写俄罗斯方块机器人、自己测试、连续迭代 10 轮后直接 PK,结果: Qwen 3.7-Max:+$56%,成本 1.32 Opus 4.7:+28%,成本 12.15 GPT-5.5:+7%,成本 $2.85 https://x.com/atomic_chat_hq/status/2057581603811901882/video/1…
Qwen (@Alibaba_Qwen): 📣Meet Qwen3.7-Max — our latest flagship, made for the Agent Era.
A versatile foundation for agents that actually get things done: 🧑💻 Coding agent, end to end. Frontend prototypes, multi-file refactors, real debugging — nails it. 🗂️ A reliable office and productivity assistant.
相似文章
@RookieRicardoR: 国产模型再次突破,比肩 Claude 4.6,Gemini 3.1 Pro 等顶尖模型。 刚测完 Qwen3.7-Max,说几点真实感受。 昨晚 API 上线第一时间就充了值,选了三个题目(见视频)来测试 Qwen3.7-Max 的前端能…
用户测试了Qwen3.7-Max,认为其在前端、算力和Agent能力上比肩Claude 4.6和Gemini 3.1 Pro等顶尖模型,推理能力显著提升,且迭代速度月更,已成为国产第一梯队。
@VibeMarketer_:发现一款开源模型,可跑 300 个并行智能体,连续执行 12+ 小时,成绩碾压 GPT-5.4 和 Opus 4.6 的人生瞬间…
一款未具名的开源模型同时运行 300 个并行智能体,持续 12 小时以上,在多项基准测试中据称超越 GPT-5.4 与 Opus 4.6,权重已上传至 Hugging Face。
Qwen3.7:智能代理前沿(15分钟阅读)
阿里巴巴Qwen团队发布了Qwen3.7-Max,这是一款专有智能代理基础模型,在Terminal-Bench 2.0、SWE-Pro、GPQA Diamond等多个基准测试中取得最高分,并在多种代码环境中表现一致。
@intheworldofai: Qwen 3.7-Max确实是我最近测试过的最令人印象深刻的智能体编码模型之一。我让它生成一个……
阿里巴巴发布了通义千问 3.7 Max,一款专为智能体时代设计的旗舰编码模型。该模型在长周期自主执行、前端生成和3D场景构建上表现突出,多项基准测试中与顶尖闭源模型持平甚至超越,是接近前沿的中国模型。
@berryxia: 小块有大智慧?这下真成真了! 7B小模型现在直接当上了GPT-5、Claude Sonnet 4、Gemini 2.5 Pro这些顶级大模型的老板。 一篇最新论文里,一个用强化学习训练的7B模型学会了写自然语言子任务、分配给不同大模型、精…
一篇最新论文提出通过强化学习训练7B小模型作为任务调度器,自动分解子任务并分配给GPT-5、Claude等顶级大模型,在多项硬核基准上超越单一前沿模型,证明端到端奖励学习可有效替代人工Prompt工程与多智能体流水线设计。