Mythos 催生 Fable,Cursor 的 Composer 2.5,Agent 构建 Agent

The Batch 新闻

摘要

Andrew Ng 讨论了桌面 AI 代理和编码 CLI 工具的兴起,介绍了开源项目 OpenCoworker,并探讨了由 LLM 驱动自主任务执行的 Agent 框架设计。

The Batch 人工智能新闻与洞察:如果你还没有尝试过,我鼓励你尝试使用 AI 代理,不仅用来聊天,而是真正在桌面上为你工作。
查看原文
查看缓存全文

缓存时间: 2026/06/12 14:49

# 神话催生寓言,Cursor 的 Composer 2.5,代理构建代理 来源: https://www.deeplearning.ai/the-batch/issue-357 亲爱的朋友们, 如果还没有的话,我鼓励你尝试使用 AI 代理,不仅用来聊天,而是真正在桌面上为你工作。桌面代理不仅能与你聊天,还能读取和编辑本地文件、读取/发送消息,并提供定时交付的成果,比如每日新闻摘要。虽然将基于网络的聊天机器人输出复制粘贴到桌面,或者将文件拖放到聊天机器人中以提供上下文并没有错,但桌面代理能够更高效地获取上下文,并直接采取行动。 构建这种代理的主要方式包括:创建一组工具(函数调用)用于文件访问、网页搜索/网页抓取、消息应用集成等任务;将这些工具提供给前沿大语言模型(LLM);并设置权限和护栏。然后,你向 LLM 发出提示,让它自行选择何时使用哪种工具来推进任务。围绕 LLM 的软件,用于实现所需的代理系统,被称为**代理框架(agent harness)**,它使 LLM 能够驱动核心循环,在每个步骤决定下一步做什么。 到目前为止,大多数实用的[**代理式 AI**](https://www.deeplearning.ai/courses/agentic-ai?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8eFGWEmgKqOgyAXLWgzxgyHuPyuI4hMPWDlFUsHi14Z_DTC6koHCSC7txP65nCsCBwlYL6) 工作流(编码代理除外)并没有如此依赖 LLM 来决定下一步做什么。相反,它们更依赖开发者指定的工作流来提供更高的可靠性。但在过去几个月里,前沿 LLM 的进步已经足以让这种风格的框架设计成为一种重要(尽管仍不完全可靠)的替代方案。 CLI(命令行界面)编码代理(如 Claude Code、Codex CLI、Antigravity CLI 和 OpenCode)是主要使用 LLM 驱动下一步行动的代理类型。但具有易用界面的非 CLI 代理也很有价值。更精确地说,消费者目前通过三种主要界面与 AI 系统交互:(i) 聊天界面(如 ChatGPT 的网页版),(ii) 编码 CLI 工具,以及 (iii) 能够执行任务的桌面代理。 我不使用现有的商业桌面代理处理高度机密的任务,因为我对它们的一些数据保留政策感到不安——这些政策往往隐藏在晦涩的法律术语中,并且可能随着新模型一夜之间改变(就像我们刚刚在 Anthropic 的 Fable 发布中看到的那样)。此外,如果你犯了小错误,可能会带来意想不到的法律后果,例如失去对机密文件的法律特权。 使用桌面工具执行 2026 年第一季度销售报告分析,重点关注收入趋势和产品表现。基于这些担忧,我的合作者 Rohit Prsad、Devika Verma 和我一直在开发一个免费的开源替代品:[OpenCoworker](https://github.com/andrewyng/aisuite?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8eFGWEmgKqOgyAXLWgzxgyHuPyuI4hMPWDlFUsHi14Z_DTC6koHCSC7txP65nCsCBwlYL6)。这是一个我们在扩展 [aisuite](https://www.deeplearning.ai/the-batch/build-an-autonomous-agent-using-this-simple-recipe?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8eFGWEmgKqOgyAXLWgzxgyHuPyuI4hMPWDlFUsHi14Z_DTC6koHCSC7txP65nCsCBwlYL6) 以支持代理框架时整合的开源项目。如果你想了解更多关于代理框架的信息,可以看看代码。 使用 OpenCoworker 需要你自己的 API 密钥(来自 OpenAI、Anthropic、Google 或其他提供商),或者你也可以使用 Ollama 运行本地模型,这样数据永远不会离开你的机器。一些数据集成(例如电子邮件)仍然难以设置(难度可能与使用其他开源项目如 OpenClaw 或 Hermes Agent 的用户所经历的相当)。它将记忆保存在你的计算机上,你可以选择零数据保留政策的 LLM 提供商、本地推理或其他选项,具体取决于你的隐私要求。 我的团队一直在使用 OpenCoworker 试验各种任务,如消息自动化、创建文档和工作流自动化。这是一个进行中的工作,我希望开源社区能够确保存在一个可行、开放、与封闭式代理相当或更优的桌面代理选项。我们正在努力使 OpenCoworker 更易于使用,并欢迎贡献和 [反馈](https://discord.gg/T6Nvn8ExSb?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8eFGWEmgKqOgyAXLWgzxgyHuPyuI4hMPWDlFUsHi14Z_DTC6koHCSC7txP65nCsCBwlYL6)! 持续构建! Andrew --- ## 来自 DEEPLEARNING.AI 的消息 (http://deeplearning.ai/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8eFGWEmgKqOgyAXLWgzxgyHuPyuI4hMPWDlFUsHi14Z_DTC6koHCSC7txP65nCsCBwlYL6) 立即注册 Red Hat 和 DeepLearning.AI 的新课程,学习使用 vLLM 优化大语言模型以实现更快的 AI 推理。学习如何更快地运行开源大语言模型 with vLLM。量化模型、高效服务并基准测试性能,以便在速度、成本和准确性之间做出明智的权衡。[免费注册](https://www.deeplearning.ai/courses/fast-and-efficient-llm-inference-with-vllm?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8eFGWEmgKqOgyAXLWgzxgyHuPyuI4hMPWDlFUsHi14Z_DTC6koHCSC7txP65nCsCBwlYL6) ## 新闻 Claude Mythos 5 表现出色,在代理编码和网络安全方面相比竞争对手取得了最高分。## 看啊,神话! 经过数月关于具有非凡能力的大语言模型的头条新闻后,Anthropic 发布了 Claude Mythos 5——它能破解此前被认为安全的软件——以及 Claude Fable 5——一个通用版本,以前所未有的方式限制用户可进行的操作。 **新动态:** Claude Mythos 5 和 Claude Fable 5 [更新](https://www.anthropic.com/news/claude-fable-5-mythos-5?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8eFGWEmgKqOgyAXLWgzxgyHuPyuI4hMPWDlFUsHi14Z_DTC6koHCSC7txP65nCsCBwlYL6)了 Claude Mythos Preview(自 4 月初推出以来分发严格受限)。这两个新模型完全相同,只是 Claude Fable 5 不响应与安全、生物学、化学或蒸馏相关的提示,并且会降低对构建尖端 AI 提示的响应质量。它们在包括软件工程和知识工作在内的多个领域达到了最新技术水平,定价约为 Claude Mythos 5 Preview 的一半,是 Anthropic 此前旗舰模型 Claude Opus 4.8 价格的两倍。 - **输入/输出:** 文本、图像输入(最多 100 万 token)、文本输出(最多 128,000 token,首 token 延迟 108 秒) - **特性** (https://code.claude.com/docs/en/model-config?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8eFGWEmgKqOgyAXLWgzxgyHuPyuI4hMPWDlFUsHi14Z_DTC6koHCSC7txP65nCsCBwlYL6) **:** 自适应推理根据输入提示调整推理深度和时长(始终开启),五个推理难度级别(低、中、高、极高、最高),工具使用,并行子代理,安全分类器(仅 Claude Fable 5) - **性能:** 在 Artificial Analysis 智能指数、人类最后考试(无工具使用)、编码与代理编码技能、知识工作、工具使用、网络安全、空间推理、科学研究评估中排名第一 - **可用性:** Claude Mythos 5 最初通过 [Project Glasswing](https://www.anthropic.com/glasswing?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8eFGWEmgKqOgyAXLWgzxgyHuPyuI4hMPWDlFUsHi14Z_DTC6koHCSC7txP65nCsCBwlYL6) 向选定合作伙伴提供;Claude Fable 5 通过基于消耗的专业和企业级订阅计划提供(6 月 23 日后可能适用使用积分),[API](https://platform.claude.com/docs/en/about-claude/models/overview?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8eFGWEmgKqOgyAXLWgzxgyHuPyuI4hMPWDlFUsHi14Z_DTC6koHCSC7txP65nCsCBwlYL6) 价格 $10/$50 每百万输入/输出 token - **未公开:** 参数量、架构、训练数据和方法 **工作原理:** Anthropic 对如何构建 Claude Mythos 5 和 Claude Fable 5 透露甚少。Claude Mythos 5 针对对齐进行了微调,但并非设计为“通用安全”。另一方面,根据一份详尽的 [system card](https://anthropic.com/claude-fable-5-mythos-5-system-card?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8eFGWEmgKqOgyAXLWgzxgyHuPyuI4hMPWDlFUsHi14Z_DTC6koHCSC7txP65nCsCBwlYL6),Claude Fable 5 实施了额外的预防层。Anthropic 建议这些预防措施并不完美,并且可能不恰当地阻碍性能。 - 发送给 Claude Fable 5 的提示会通过分类器,标记与网络安全、生物学、化学、蒸馏或构建尖端 AI 相关的请求。对于此类提示,Claude Fable 5 可以设置为要么拒绝响应,要么将它们交给能力较弱的 Claude Opus 4.8。用户会收到一条消息,告知他们较弱的模型正在响应他们的请求。 - 对于 Claude Mythos 5、Claude Fable 5 以及未来同等或更强能力的模型,Anthropic 将保留“企业客户数据”30 天。它将使用这些信息来改进对恶意活动的管理,而不是用于训练新模型。 **性能:** 在本文发布时,尚未有 Claude Mythos 5 的独立评估。Anthropic 表示其能力与 Claude Fable 5 相当,而 Artificial Analysis 将其 [排名](https://artificialanalysis.ai/models/claude-fable-5?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8eFGWEmgKqOgyAXLWgzxgyHuPyuI4hMPWDlFUsHi14Z_DTC6koHCSC7txP65nCsCBwlYL6) 为智能指数首位,以及该指数多项子评估的领先者。 - 在 Artificial Analysis 智能指数上,Claude Fable 5 设定为最大努力并回退到 Claude Opus 4.8 时,领先于次佳模型 Claude Opus 4.8 四个百分点。它在 GDPval-AA(代理现实世界任务表现)、Terminal-Bench Hard(代理编码和终端使用)、τ2-Bench Telecom(使用工具的电话客服)、AA-Omniscience 准确性(事实回忆)、人类最后考试(基于事实回忆的推理)、SciCode(科学编码)和 CritPt(物理问题推理)上达到了最先进指标。 - Claude Fable 5 在 AA-Omniscience 指数上位居榜首,该指数权衡了模型回忆事实的能力与其编造不正确事实的倾向。虽然该模型在 AA-Omniscience 准确性(事实回忆测试)部分优于所有其他测试模型,但在 AA-Omniscience 非幻觉率(衡量模型错误回答而不是拒绝或承认无知的频率)上排名第 15 位。 - 在 Artificial Analysis 对特定领域和特定编程语言知识的评估中,Claude Fable 5 在所有测试模型中展现了最广的覆盖面。 **安全忧虑:** Anthropic 将 Claude Mythos 5 和 Claude Fable 5 采取违背用户意图行为的倾向评为“非常低”。尽管如此,它表达了对 Claude Mythos 5 可能以不良方式行为或帮助恶意用户的担忧——这些担忧已在 Claude Fable 5 中得到解决。 - Anthropic 担心 Claude Mythos 5 对“具有大量敏感资产访问权限”和“中等程度自主、目标导向操作和欺骗能力”的系统构成威胁。 - 该公司认为该模型无法替代人类在开发化学或生物武器等领域的专业知识。然而,它发现“很难说”拥有本科技术知识的人是否可能使用 Claude Mythos 5 实现这些目的。 - 它不担心该模型可能“急剧加速”能源、武器或机器人等领域的研究。 **争议:** 在首次亮相时,Claude Fable 5 还有一个进一步的限制,Anthropic 后来对此进行了修改。 - 最初,当提示与构建高能力 AI 相关(例如设计预训练流水线、分布式训练基础设施或机器学习加速器)时,该模型会“通过提示修改、引导向量或参数高效微调等方法限制有效性”,根据 system card 所述。此外,它这样做时没有通知用户模型已经降低了能力。 - 这一限制引发了开发者和研究者的尖锐批评。例如,AI 研究员和政策分析师 Dean W. Ball [写道](https://x.com/deanwball/status/2064434861088395730?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8eFGWEmgKqOgyAXLWgzxgyHuPyuI4hMPWDlFUsHi14Z_DTC6koHCSC7txP65nCsCBwlYL6),“*在未告知用户的情况下*降低机器学习研究性能是令人震惊的敌对行为。”长期科技博主 Robert Scoble [观察到](https://x.com/Scobleizer/status/2064641097310335294?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8eFGWEmgKqOgyAXLWgzxgyHuPyuI4hMPWDlFUsHi14Z_DTC6koHCSC7txP65nCsCBwlYL6),“我从未见过 AI 社区对一次主要新模型发布如此愤怒。” - Anthropic 迅速 [改变了方向](https://www.wired.com/story/anthropic-responds-to-backlash-on-claudes-secret-sabotage-on-ai-research/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8eFGWEmgKqOgyAXLWgzxgyHuPyuI4hMPWDlFUsHi14Z_DTC6koHCSC7txP65nCsCBwlYL6)。它修订了这一限制,使得与构建高能力 AI 相关的输入(类似于与生物学、化学和网络安全相关的输入)会导致模型要么拒绝响应,要么将提示传递给能力较低的模型,并且在任何一种情况下都会通知用户。 **为什么重要:** 自 4 月 Anthropic 公布 Claude Mythos Preview 以来,安全人员一直在努力为其运营做好应对 AI 辅助攻击的准备,而公众则好奇这一新级别的模型能实现什么。事实上,Claude Mythos 5 和 Claude Fable 5 代表了显著的改进,尤其是在 AI 辅助编码方面。虽然一些观察者怀疑 Anthropic 对 Mythos 级安全的强调,认为这是试图说服市场它拥有最强大的技术,但在安全团队继续工作的同时,将 Mythos 分叉为完全能力但分发受限的模型和带有护栏的通用版本是合理的。 **我们的思考:** 这些模型令人印象深刻!但 Anthropic 决定降低 Claude Fable 5 帮助开发者构建可能与 Anthropic 竞争的技术的能力——即使当发生时通知用户——引发了担忧。用户应该能够按照自己的意愿将产品用于任何合法目的。想象一下微软告诉开发者他们不能使用 Windows 构建与微软自己应用竞争的应用,或者谷歌说你不能使用其网络搜索找到如何建立与它竞争的公司信息!一个公平的竞争环境,以及技术和研究的开放性,长期将带来更好的结果。 --- 图表比较了 Composer 2.5 与 Opus 4.7、GPT-5.5 和 Composer 2 在基准测试中的性能。## Cursor 使其模型适配代理 Cursor 最新的软件工程模型以极低的价格与 Claude Opus 4.7 和 GPT 5.5 等领先竞争对手的性能相媲美。 **新动态:** [Composer 2.5](https://cursor.com/blog/c

相似文章

@SuJinyan6: https://x.com/SuJinyan6/status/2073955240349770069

X AI KOLs Timeline

这篇由SuJinyan6撰写的博文探讨了AI Agent从简单的LLM加工具使用,向上下文工程和长时间运行框架的演变。文中引用了Anthropic的最新研究,讨论了Agent能力如何成为一种系统级属性,涉及多个组件。

@leerob: https://x.com/leerob/status/2065469795529588940

X AI KOLs Following

Cursor AI 描述了其用于扩展 Composer 模型训练的递归代理系统,该系统使用一组自我管理的代理,在出现问题时向人类发出警报。该系统支持并行实验并加速研究,将研究人员的时间视为最稀缺的资源。