@atomic_chat_hq: Qwen 3.7-max 击败 Opus 4.7 和 GPT-5.5 我们在一个真实的智能体任务上测试了三款前沿模型:编写一个俄罗斯方块机器人,该机器人…
摘要
Qwen 3.7-max 在智能体俄罗斯方块机器人任务上超越了 Opus 4.7 和 GPT-5.5,以最低成本实现了最大的性能提升。
Qwen 3.7-max 击败 Opus 4.7 和 GPT-5.5。我们在一个真实的智能体任务上测试了三款前沿模型:编写一个能玩游戏并自我训练的俄罗斯方块机器人。每个模型都能读取自己的代码、运行基准测试,并在10次迭代中重写自身。然后我们将最终的机器人进行了正面比较。
Qwen 3.7-Max:训练成本 $1.32,机器人性能提升 +56%
Claude Opus 4.7:训练成本 $12.15,机器人性能提升 +28%
GPT-5.5:训练成本 $2.85,机器人性能提升 +7%
Qwen 在所有维度上获胜——提升最大,比 Claude 便宜 9 倍,比 GPT 便宜 2 倍。长智能体循环正是 Qwen Max 真正发挥作用的地方。
相似文章
@JayaGup10: 美国人会在意 Instinct 使用 Kimi 吗?不确定。这是一个在 iMessage 上快速增长的消费者应用,可以访问 i…
这条推文质疑美国用户是否会担心 Instinct 应用使用中国 AI 模型 Kimi,同时将其与使用封闭美国模型的 Muse 进行比较,并推测了这对其他美国消费者应用的未来影响。
AutoTuneBench: 用于LLM服务引擎代理自动调优的可信度量
AutoTuneBench 提出了一个基准和测量协议,用于LLM服务引擎的可信代理自动调优,解决了诸如稻草人基线和基础设施缺陷等故障模式,以确保可靠的结果。
RideWay: 工具使用语言代理的高效任务完成基准测试
RideWay提出了一个以效率为核心的基准测试和Efficiency Utility指标,用于评估打车任务中工具使用语言代理的性能,基于工具调用和用户交互轮次来衡量成功差距表现。
ERPBench:企业软件中计算机使用代理的基于状态的评估范式
ERPBench 引入了一个基准,用于评估仅基于截图的计算机使用代理在实时 ERP 系统上的表现,表明强大的通用 GUI 性能无法转移到企业可靠性,并包含一个具有人工批准的生产工具,以实现安全部署。
GraphEcho:LLM 图代理中的结构冗余与证据溯源
GraphEcho 是一个基准测试,用于评估 LLM 图代理区分结构冗余与独立证据溯源的能力,揭示高效探索与有效证据使用之间的差距。