@rohanpaul_ai:今天的新闻简报刚刚发布。https://rohan-paul.com/p/gpt-56-beats-fable-5-by-on-deepswe… GPT 5.6 Be…
摘要
一份涵盖多项人工智能发展的新闻简报:GPT-5.6 在 DeepSWE 上以更低成本超越 Fable-5,1X 推出肌腱驱动机械手,微软在 Copilot 中替换 OpenAI/Anthropic 模型,GitHub 发布 SpecKit,Claude Code 显示大幅效率提升,Google DeepMind 分享任务设计建议。
查看缓存全文
缓存时间: 2026/07/11 07:25
今天我的时事通讯刚发出去。
https://rohan-paul.com/p/gpt-56-beats-fable-5-by-on-deepswe…
GPT-5.6 在 DeepSWE 基准测试中以更低价格击败 Fable 5。
1X 推出人形机器人手——Neo 的肌腱驱动手部拥有 25 个自由度。
微软正在用自家模型替换 Excel 和 Outlook 中的 OpenAI 和 Anthropic 模型,以降低 Copilot 成本。
GitHub 最近发布了 SpecKit 这个开源工具包,用于修复“氛围编码”的一大弱点:AI 往往在产品规则明确之前就开始编码。
Claude Code 创始人 Boris Cherny:据 Anthropic 报告,每位工程师编写的代码量增长了约 250%,而质量未见明显下降。
Google DeepMind 的论文就如何正确地给 AI 分配任务提出了一些很好的建议。
来自上海大学一篇论文的一个重大想法。
🗞️ GPT-5.6 在 DeepSWE 基准测试中以更低价格击败 Fable 5
来源:https://www.rohan-paul.com/p/gpt-56-beats-fable-5-by-on-deepswe 图片(https://substackcdn.com/image/fetch/$s_!Tsf3!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fd1f08ce4-8745-4dc2-9870-81400546d078_900x622.jpeg) 阅读时间:10 分钟
📚 浏览往期版本(https://rohanpaul.substack.com/s/daily-ai-newsletter/archive?sort=new)。
(https://x.com/rohanpaul_ai**我每天发布这份通讯(https://x.com/rohanpaul_ai)。仅限无噪音、可操作的应用型 AI 发展动态)。
- 🗞️ GPT-5.6 在 DeepSWE 基准测试中以更低价格击败 Fable 5。
- 🗞️ 今日赞助商:Toyo 将使用工具的 AI 智能体引入日常对话,融入 iMessage 和 Telegram。
- 🗞️ 1X 推出人形机器人手——Neo 的肌腱驱动手部拥有 25 个自由度。
- 🗞️ 微软正在用自家模型替换 Excel 和 Outlook 中的 OpenAI 和 Anthropic 模型,以降低 Copilot 成本。
- 🗞️ GitHub 最近发布了 SpecKit 这个开源工具包,用于修复“氛围编码”的一大弱点:AI 往往在产品规则明确之前就开始编码。
- 🗞️ Claude Code 创始人 Boris Cherny:据 Anthropic 报告,每位工程师编写的代码量增长了约 250%,而质量未见明显下降。
- 🗞️ Google DeepMind 的论文就如何正确地给 AI 分配任务提出了一些很好的建议。
- 🗞️ 来自上海大学一篇论文的一个重大想法。
在 X(Twitter)上与我联系(https://x.com/rohanpaul_ai)
图片(https://substackcdn.com/image/fetch/$s_!Tsf3!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fd1f08ce4-8745-4dc2-9870-81400546d078_900x622.jpeg) GPT-5.6 Sol 在 DeepSWE 上达到约 72% 到 73% 的成绩,每任务成本约 8.4 美元;而 Claude/Fable-5 最高约 70%,但成本高得多,约 13 到 22 美元每任务。DeepSWE 是一个编码智能体基准测试,而非普通的代码生成测试,因为模型必须在真实开源仓库中工作并完成长周期的软件工程任务。
每个任务给智能体一个仓库和一个请求的变更,然后使用基于程序的验证器检查最终补丁是否真正有效,因此分数意味着“113 个任务中解决了百分之多少”。该基准测试涉及仓库导航、错误诊断、代码编辑、工具使用、测试运行和多步修复,涵盖 91 个仓库和 5 种语言,而不仅仅是根据提示编写一个整齐的函数。在这个基准测试中,最好的模型是那些以最低平均任务成本解决最多任务的模型。
一条消息发给 Toyo 就能触发跨电子邮件、日历、Slack、CRM、文档和项目工具的工作流。(https://toyo.ai/?utm_source=rohan&utm_medium=newsletter&utm_campaign=ph_launch)
AI 智能体的瓶颈在于,作为用户,我反而需要成为操作员。
它应该更像一个在你消息里的同事。而这个差距正在迅速被填补。Toyo 刚刚发布了一个 AI 执行助理,围绕人们已经使用的界面构建:消息。
**Toyo 产品存在于 iMessage 和 Telegram 中,因此委派工作就像普通对话一样开始。**人们通过消息与 Toyo 交谈。在幕后,Toyo 处理工具访问、上下文和后台工作流。
Toyo 现已开放试用,你可以在此注册。(https://toyo.ai/?utm_source=rohan&utm_medium=newsletter&utm_campaign=ph_launch)
这里的变化在于,聊天变成了可见层,而非完整产品。在幕后,Toyo 连接电子邮件、日历、Slack、CRM、文档、会议记录和项目工具。
这种访问使得一条简短消息就能在工作已经存在的各个地方触发工作流。用户可以要求它监控重要邮件、起草回复、准备会议、跟进事项或发送每日简报。
然后 Toyo 处理那些通常让智能体系统显得笨重的慢速部分。它提取上下文、调用工具、维护工作流状态、运行定时检查,并在敏感操作前寻求批准。
大多数人不想配置智能体、监控运行、检查失败或维护自动化链条。他们只想委派工作、在需要时添加上下文、并在输出离开账户之前进行审查。
Toyo 把这个循环压缩进消息中。它也可以完全通过语音操作。用户可以发送语音备忘录,或者当 Toyo 需要更多上下文时,它也可以打电话。
并且你可以使用代码 PRODUCTHUNT 获得第一个月免费。(https://toyo.ai/?utm_source=rohan&utm_medium=newsletter&utm_campaign=ph_launch)
在 X(Twitter)上与我联系(https://x.com/rohanpaul_ai)
来自 1X 的 NEO 新型人形手。(https://www.1x.tech/discover/neos-hands)大多数机器人手失败是因为它们会动,但无法正确感知接触。
- 1X 的解决方案使用低比率肌腱驱动器,因此外部力会通过每个关节传递回去。电机位于前臂,像生物肌肉一样通过手腕拉动肌腱。
这使得手指更轻,降低冲击能量,同时仍能提供强力抓握。
-
这只手有 22 个手指和手掌的驱动轴,外加 3 个手腕轴。这些关节并非均匀分布,因为拇指承载了人类大部分灵巧性。
-
真正的对向拇指如此必要,因为抓握主要是控制问题,而非挤压。
-
闭环本体感觉使 NEO 在不使用相机的情况下获得姿态和力量数据。
-
触觉皮肤提供接触、压力和剪切信号,因此物体滑动时可以触发快速修正。
-
IP68 防护等级和食品级安全材料意味着同一只手可以在水边工作。
-
可反驱手指也使冲击更安全,因为机构在受力时会屈服。
-
1X 表示完整的指关节组件在验证过程中已承受数百万次循环。
-
已有数百只被制造出来,今年计划产能为 10,000 只手。
-
有趣的部分在于数据循环。现在每次抓握都可以返回力、姿态、接触和滑动信号,用于机器人学习。
这使得 NEO 更像一个测量仪器。
图片(https://substackcdn.com/image/fetch/$s_!lpaP!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F3a058e1e-d375-47ef-a611-1fed26910375_523x479.png) Excel 和 Outlook 过去更依赖外部模型。https://finance.yahoo.com/technology/ai/articles/microsoft-cuts-ai-bill-replacing-065811487.html 现在微软希望减少对控制前沿模型访问定价的实验室的昂贵调用。(https://finance.yahoo.com/technology/ai/articles/microsoft-cuts-ai-bill-replacing-065811487.html)
OpenAI 仍通过长期合作关系给予微软优惠访问权限,但这一折扣可能会消失。
微软 AI 负责人 Mustafa Suleyman 已明确表示,微软希望减少并最终消除这种外部成本。
图片(https://substackcdn.com/image/fetch/$s_!frNn!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F5fd4c1ea-503a-47fd-bb0a-12ccfb4f3fe9_893x816.png) 该仓库已获 119K+ 星 ⭐️(https://github.com/github/spec-kit)
它将“氛围编码”从“让 AI 来构建”转变为“先编写产品规格,然后让 AI 基于该规格进行构建”。
目前大多数 AI 编码从松散的提示开始,然后直接进入编码阶段,这通常会产生可工作的演示,但需求薄弱、遗漏边界情况、造成混乱返工。
Spec Kit 将过程倒过来:首先定义产品必须做什么,然后澄清差距,再创建技术方案,然后将该方案分解为任务,最后让智能体根据这些书面工件进行实现。
因此,规格不再是可丢弃的文档;它变成了一个可执行的开发契约,指导 Copilot、Claude Code、Codex、Gemini、Cursor、Qwen 以及 30 多种其他智能体集成。
以下是他对其他公司实现同样效果的建议。(https://www.youtube.com/watch?v=Z6IT4gjrcPE)
-
企业不应过度控制 AI 使用。与其让员工为每个 token 请求批准,不如给予足够的访问权限让他们尝试并发掘有用的工作流。
-
心理安全感对于 AI 采用至关重要。员工需要对尝试新想法感到安全。
-
最大的生产力提升可能并非来自顶级的明显工程师,而可能来自会计、市场营销人员、新毕业生。
“Claude 的情况是,现在许多公司,包括 Anthropic 和我们所有的大客户,报告了数百个百分点的收益。
我认为我们上次报告的数字是,自引入 Claude Code 以来,Anthropic 每位工程师编写的代码量增长了约 250%。与此同时,代码质量、可靠性等指标保持稳定。所以,在这些方面没有退化的情况下,代码量大幅增长。
这种生产力影响,我认为非常新颖,人们正在试图弄清楚如何实现它。”
图片(https://substackcdn.com/image/fetch/$s_!s9GP!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F20a99144-b755-413a-b7c6-30cb0c904a92_1166x683.jpeg) 这不仅仅是告诉 AI 做某事然后希望结果最好。相反,这个框架将委派视为一系列选择:你需要判断是否应该把任务交出去,如何解释任务,以及之后如何检查工作。
当前系统依赖僵化的规则,在意外失败时容易崩溃。研究人员建议构建一个动态市场,智能体通过智能合约竞标任务。
这需要严格的监控和加密证明,以保证正确工作而不泄露私有数据。
智能体不再依赖简单的评分,而是使用可验证的数字证书来证明其确切技能。
- 在情况变化时保持灵活性
这个新系统旨在适应变化,而不是固步自封。它将任务交接视为一个实时过程,权威和责任可以实时转移。如果情况发生变化或出现问题,框架有助于管理该失败,使整个项目不会脱轨。它既适用于人类将任务交给 AI,也适用于 AI 需要自行处理事务的情况。
- 找到合适的信任度
最酷的部分之一是它如何处理信任。他们构建了形式化的信任模型,考虑任务难度和 AI 过去的表现。这阻止了“过度委派”,即把 AI 尚未准备好的任务交给它。它也阻止了“低度委派”,即虽然 AI 可以轻松处理,但你自己完成所有工作。
- 双重检查工作
你不能仅凭 AI 一句话就相信它,因此这个框架有特定的输出来验证方式。它根据 AI 的置信度设定了接受答案的规则。它还有备份计划,以防 AI 失败。这对于现实工作中的任务非常重要,盲目信任机器可能会导致大量错误累积。
- 当 AI 智能体雇佣其他 AI 智能体时
该框架还涵盖了一个 AI 智能体将任务交给另一个 AI 智能体时会发生什么。系统跟踪谁真正负责,并确保正确的权威被传递下去,以免在网络中被丢失。
- 确保工作确实合适
这是一个逐步的方法,确保 AI 的贡献确实符合更大的目标。通过将其视为一个结构化的过程,他们使得公司日常运营中使用 AI 更加安全,无需担心频繁出错。
图片(https://substackcdn.com/image/fetch/$s_!rc8e!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fc4d710ce-e45f-43fd-aef5-5ac4e17a873a_789x853.png) 赋予 AI 模型人类式记忆。想象一下,在阅读一本巨大的悬疑小说时,只允许保留一张便签纸。(https://arxiv.org/abs/2607.02303)
每当出现新线索,便签必须重写,因此较早的线索逐渐淡出或被挤掉。
这接近于快速 AI 模型(如线性注意力和状态空间模型)内部发生的情况——它们通过将所有阅读内容压缩为一个固定的内部状态来节省内存。
问题在于这使得它们非常健忘。在“大海捞针”测试中,当需要回忆大量文档中深处埋藏的特定事实时,它们会失败,因为新细节覆盖了较早的细节。
HOLA 试图通过给这些模型提供第二个存储细节的地方来解决这个问题。
正常状态仍处理文本的大致形状,如语法、主题和重复模式。
新的记忆缓存保存正常状态似乎容易遗忘的精确信息片段。
巧妙之处在于 HOLA 如何决定哪些内容值得放入缓存。
它并不只是保存最新的 token,因为旧细节可能仍然重要。
相反,它保存那些在模型内部引起最大修正的 token,这通常意味着模型难以干净地压缩它们。
简单来说,HOLA 保留了那些让模型感到惊奇的事实。
当模型后来需要答案时,这个缓存以更精确的方式被读取,因此它可以提取回特定的已保存事实,而不是将许多记忆混合成一个模糊的猜测。
这一点很重要,因为快速模型通常以速度换取记忆,而全注意力 Transformer 保持更强的回忆能力,但随着文本变长而变得更重。
在论文的 3.4 亿参数测试中,HOLA 将 Wikitext 困惑度从 27.32 降低到 22.92,击败了匹配的快速基线,甚至在该指标上击败了报告的全注意力 Transformer++。
它在 32k token 范围内的大海捞针测试中也保持好得多,尽管它是在 2k token 上下文中训练的。
更大的教训是,快速 AI 模型不需要精确记住所有事情。
它需要知道哪些细节是其主要记忆不擅于保留的,然后在它们消失之前保护这些细节。
今天就到这里,明天见。
在 X(Twitter)上与我联系(https://x.com/rohanpaul_ai)
相似文章
@rohanpaul_ai:今天这期通讯刚刚发出。 https://rohan-paul.com/p/spacexai-launches-grok-46-beating… SpaceXAI 发…
Rohan Paul 的每日 AI 通讯摘要,涵盖 SpaceXAI 的 Grok 4.6 发布、Soniox TTS v2、NVIDIA Nemotron 3.5 Lightning、OpenAI 的 ChatGPT Linux 应用以及多篇研究论文。
@rohanpaul_ai: 我的newsletter最新一期已发布。https://rohanpaul.substack.com/p/central-bankers-now-fear-the-ai-gold… …
一份每日AI通讯,涵盖多个故事,包括央行行长对AI债务泡沫的警告、中国开发者通过灰色市场API购买便宜的Claude访问权限、Sakana的Fugu报告、中美AI模型成本对比、Deepseek新的推理优化方法,以及Meta开源的脑机文本系统。
@rohanpaul_ai: 我的新闻通讯今日版已发布。https://rohan-paul.com/p/study-finds-1-in-3-web-pages-published… 每3个网页中有1个…
本期新闻通讯涵盖关键AI和科技新闻,包括一项Pew研究显示,自ChatGPT发布以来发布的三分之一网页显示出AI撰写的迹象,同时涉及企业竞争更新和代理安全研究。
@rohanpaul_ai: 我今天的新闻简报刚刚发布。https://rohan-paul.com/p/anthropics-new-j-lens-uncovers-a… Anthropic 的……
Anthropic 的新型 J-lens 揭示了 Claude 内部一个隐藏的工作空间,与意识理论一致;其他新闻包括腾讯的 Hy3 模型、NVIDIA 的算力换股权计划、微软裁员以及 Claude Fable 5 扩展。
@rohanpaul_ai: 我的时事通讯最新一期已发布。https://rohan-paul.com/p/openai-stops-reinforcement-learning… OpenAI st…
总结关键AI发展的时事通讯,包括OpenAI在因Astra的网络安全担忧后停止强化学习训练,Synthefy推出结构化数值数据平台,以及关于收入、漏洞和集成的更新。