一个智能体在无人监督的情况下连续编码了10天。Qwen 3.8 max
摘要
阿里巴巴的Qwen智能体在一个空仓库中自主编码超过10天,提交issue、编写代码、运行测试、修复失败并合并。它仍然需要一些反馈,但这展示了一个自我纠错的自主循环。
阿里巴巴给了Qwen一个空仓库,然后走开了。它自己提交issue,编写代码,运行测试,修复失败并合并。十几天,完整追踪记录公开。但没人明说的是,它仍然需要几轮反馈才能把事情做对。所以是带星号的自主。但一个能持续运转数天并自我纠错的循环,与一次性提示的聊天工具是不同种类的东西。期待看到它在未来几天还能做什么。我测试过,我喜欢它。
相似文章
从没见过像 Qwen 3.6 27B 这么“卷”的 Agent
Reddit 用户称 Qwen 3.6-27B 表现出罕见的主动行为,无需提示就自主编写、测试并修复代码。
阿里Qwen3.7-Max在陌生硬件上自主运行35小时,持续自我优化
阿里Qwen3.7-Max模型在陌生T-Head PPU硬件上,无需人工引导,自主优化生产内核长达35小时,进行1158次工具调用,实现10倍速度提升,展示了持续的自主智能体行为。
Qwen3.7:智能代理前沿(15分钟阅读)
阿里巴巴Qwen团队发布了Qwen3.7-Max,这是一款专有智能代理基础模型,在Terminal-Bench 2.0、SWE-Pro、GPQA Diamond等多个基准测试中取得最高分,并在多种代码环境中表现一致。
Opus 与 Qwen 针对同一 bug 和同一仓库,但一个代理完成速度却快了 7 倍
Opus 和 Qwen AI 编程代理在相同 bug 和仓库上的对比显示,一个代理完成速度提升了 7 倍,引发了关于单提示 GitHub 问题解决技巧的讨论。
26小时,零提示:3个AI代理自主运行
本文描述了一种实验性的自主AI代理架构,该架构能够通过内置的控制、记忆和验证功能,在多天内持续处理高级目标,通过使用包括Codex在内的多个代理的实时实验进行了演示。