恢复Claude Fable 5,Gemini的视频开发引擎,DeepSeek加速推测解码
摘要
Andrew Ng分享了在使用AI编码代理进行快速原型开发时构建产品规格的实用建议,强调AI令牌成本低而人类令牌价值高,并且通过代理构建的原型进行迭代比预先规范更高效。
The Batch News & Insights: 代理编码循环的核心思想是让代理持续工作,直到满足某个条件,例如达到产品规格。
查看缓存全文
缓存时间: 2026/07/10 19:36
# Claude Fable 5 模型恢复,Gemini 视频引擎发布,DeepSeek 加速投机解码
来源:https://www.deeplearning.ai/the-batch/issue-361
亲爱的朋友们,
自主编码循环的核心思路是让一个智能体持续工作,直到满足某个条件,比如通过产品规格验收。对于许多AI系统来说,编写规格、评估标准或测试集是最困难的任务之一,也是注入人类知识的关键节点。一旦有了清晰的规格,实现它的路径(比如让编码智能体反复迭代)就变得更加明确。我想分享一些关于构建产品规格的实用技巧,这些规格能够驱动编码循环,帮助我们快速从0到1搭建应用。正如我接下来要解释的,我遵循的一个组织原则是:AI token 很便宜,而人类的 token 是金子。(是的,我知道人类并不是真的把语言切分成 token,但我跟 token 打交道太多了,以至于现在我觉得自己就是在给电脑提供 token!)
在构建一个庞大复杂的系统时,花时间设计好架构是值得的。这包括决定:你想用什么数据库?如何在不同服务之间分解工作负载?你要绑定哪些第三方依赖?前端和后端的 API 边界在哪里?提前思考这些问题有助于避免陷入难以更改的错误决策。
但当我快速构建那些我还不熟悉领域的0到1原型或应用时,我通常行动得更快,思考得更少。我发现直接让编码智能体开始构建很方便,这样我就可以检查它构建出来的东西,以便做出下一组决策。当AI智能体只需要20分钟就能构建一个简单的原型时,没必要花一小时的人类时间来推敲设计规格;我宁愿花10分钟写一个不那么完美的规格,看看智能体构建了什么,检查它的假设,然后改进规格并重复这个过程。这样,“规格驱动开发”就不会成为一个新的瀑布流程——写规格不再是进一步推进的门槛,而是让我能够更迭代地改进规格。
例如,我做过原型的许多应用的第一个版本都有令人困惑的UI设计,我通过修改规格来修复它们。即使我花再多时间调整初始规格,也根本不会提前意识到这些修改是必要的。独自想出那些人类 token 的成本太高了。观察哪里出了问题,然后解释如何做对,反而更容易(也更便宜)。
随着软件项目成熟,编码智能体会工作更长时间(可能是几小时)来构建更复杂的规格。但在早期阶段,扔掉整个代码库从头开始是完全没问题的,所以没有什么难以更改的。所有那些代码,无论是从人类时间还是 token 成本来看,都很便宜。我们通过测试学到的内容更有价值。
此外,有一个具体的实现可以供你反馈(或者有时我会要求智能体提供几个不同的设计),这会给你一种高效的方式获取反馈(人类 token),从而改进规格,推动后续迭代。如果你在构建0到1的产品,我鼓励你让编码智能体开始工作——可能比你感觉舒适的时间点还要早——看看它会产生什么,然后以此为起点。接着记录你的反应,不断迭代。
机器人的手指上系着一个蝴蝶结,上面绑着 SPEC.md 文件。开发者问:“这是做什么的?”机器人说:“你上周二告诉我一件重要的事。我永远不会忘记。”在这里,你也可以让智能体完成大部分工作。开发者中一个常见的挫折是,当我们告诉编码智能体某件事后,它后来(可能在记忆压缩之后)就忘记了。我希望未来的编码工具能改善这一点,但就目前而言,当我做出关键决策时,我经常引导智能体将那个决策记录在某处,比如 SPEC.md 文件中。在构建项目的过程中,一个编码智能体可能会生成数百万个 token——远远超过人类开发者输入的 token。所以如果智能体发现了一些东西然后又忘记了,这会有成本,因为它可能会消耗更多 token 来重新发现——但这还不算太糟。但如果它忘记了你告诉它的事情,那就令人沮丧得多,因为你最终不得不重新告诉它:更多金色的 token 被浪费掉了。
由于模型的进步,编码智能体在最近几个月变得不那么健忘了,但它们仍然偶尔会忘记。当我在原型中看到不满意的地方时,我经常告诉智能体不仅要修复它,还要更新规格(也许还有测试计划),这样智能体未来的停止条件就会要求检查这个问题不再发生。这是确保它把人类 token 当作金子的一种方式。
继续构建吧!
Andrew
## DEEPLEARNING.AI 的消息 (http://deeplearning.ai/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz--0nCJsACvA4hPfUENskLBarns5FIWphZ5XbcRCt5lnNkUpFe7x5X1wlzb0si4O7wOOGhVf)
笔记本电脑上手正在打字,旁边是 Workera 的 Ambient 推广文字,强调技能评估和免费访问。认识一下 Ambient,来自 Kian Katanforoosh 和 Workera,旨在测量你在工作中的技能。你已经测量了所有重要的事情:睡眠、步数、屏幕时间。为什么不测量你的技能呢?
加入等待列表 (https://www.workera.ai/platform/ai-agent/ambient/join-waitlist?tab=individuals%3Futm_source%3DEmail&utm_medium=email&utm_campaign=ai-agent-launch&utm_term=Batch2&utm_content=Batch2&_hsenc=p2ANqtz--0nCJsACvA4hPfUENskLBarns5FIWphZ5XbcRCt5lnNkUpFe7x5X1wlzb0si4O7wOOGhVf)
## 新闻
Claude Fable 和美国商会印章在一个循环中连接。
## 寓言的回归与余波
Claude Fable 5 和更强大的 Claude Mythos 5 回来了,距离 Anthropic 因美国商务部出口管制指令而暂停这些模型已经过去了三周。
**新消息:** Anthropic 于7月1日恢复了客户通过 Claude API、Claude Code 和其他 Anthropic 控制的平台对 Claude Fable 5 的访问。作为与美国政府协议的一部分,Anthropic 为模型增加了额外的防护栏,阻止某些网络安全查询,并将其路由到能力较弱的 Claude Opus 4.8。
**发生了什么:** Claude Fable 5 和 Mythos 5 的重新部署解决了今年迄今为止美国政府与AI公司之间最引人注目的冲突。然而,这场争端不仅涉及 Anthropic,还涉及亚马逊、谷歌、微软和 OpenAI。(披露:Andrew 是亚马逊董事会成员。)以下是模型发布、暂停和恢复的时间线。
- Anthropic 在4月向选定的政府和技术合作伙伴推出了 Claude Mythos 预览版。该模型仅发布给维护关键基础设施的公司,以便他们识别安全漏洞并修补。
- 两个月后,6月9日,Anthropic 向全球客户发布了 Claude Fable 5。其防护栏阻止了某些与网络安全和生物学研究相关的查询;该模型还引发了争议,贬低了关于如何构建强大AI模型的回答。
- 亚马逊研究人员使用 Claude Fable 5 获取了关于如何进行网络攻击的信息,这导致了出口管制指令。Anthropic 认为,任何足够强大的模型,包括其自己的 Claude Opus 4.8 和其他供应商的模型,都能识别相同的漏洞并产生利用方法。
- 6月12日,美国政府发布出口管制指令,暂停向任何外国国民(无论居住在哪里)提供 Claude Fable 5 和 Mythos 5,理由是国家安全隐患。同一天,Anthropic 对所有全球用户禁用了这些模型的访问。
- 6月26日,美国政府告诉 Anthropic,它可以为选定的政府组织重新部署 Claude Mythos 5。在一封给公司的信中,商务部长 Howard Lutnick 表示,与 Anthropic 数周的谈判已经取得了“重大进展”,并且该AI开发者致力于与政府合作,制定AI模型安全评估的协议和标准。
- 在 Anthropic 实施新的安全护栏以解决亚马逊研究人员发现的网络安全风险之后,Claude Mythos 5 和 Fable 5 的出口管制于6月30日解除。该公司宣布 Claude Fable 5 将于7月1日起向全球用户开放。AWS、谷歌云和微软 Foundry 客户的访问很快随之而来。
- Claude Fable 5 回归几天后,一些用户报告称,模型性能相比之前发布有所下降,生物学等基本问题被审查,编码任务也受到更多限制。Anthropic 在 X 上的一篇帖子中表示,一些常规编码任务将回退到 Opus 4.8,但该公司将在未来几周内努力“更好地区分真正的滥用和合法的请求”。
- 其他用户抱怨说,该模型很快将仅适用于订阅者50%的使用积分,用户将需要按积分付费以获得更多访问权限。Anthropic 最终将付费订阅者对 Claude Fable 5 的完全访问权限延长至7月12日。
**新闻背后:** 在2月早些时候一场高风险的争端中,五角大楼将 Anthropic 标记为“供应链风险”,原因是该AI开发者拒绝向美国政府提供其模型版本——该版本没有防护栏阻止用于大规模监控或自主武器。这一重要认定意味着国防部及其合作伙伴不能再使用 Anthropic 的产品。然而,6月的出口管制令是政府干预首次导致模型被暂停通用访问。OpenAI 最近推出的三个强大的新模型属于 GPT-5.6 家族,在此之前,政府强制要求对其技术能力进行预览,然后才在7月广泛发布。
**为什么重要:** 美国政府审查 Anthropic 和 OpenAI 的顶级模型标志着AI行业的一个关键时刻,这很可能影响未来的模型发布。出口禁令表明政府越来越愿意在先进AI系统广泛部署之前审查其能力,这引发了关于模型应如何发布以及谁应有权访问的问题。这也可能影响各国如何保持技术领先。看到美国政府限制访问顶级模型的国家,有强烈动力开发自己的前沿模型,或者转向限制较少的合作伙伴,以保护其AI主权。
**我们的想法:** 如果政府决定干预AI模型的发布——我们对此表示质疑,因为存在监管捕获导致只有少数模型通过的风险——它至少应该通过一个可预测的流程来进行。公司需要知道他们需要达到什么标准才能将产品推向市场。任何管理模型发布的框架都需要公平、稳定、透明且适度宽松,以减少不确定性、鼓励投资,并避免可能延误创新和破坏公众信任的临时决策。
---
图表比较了 Nano Banana 模型与竞争对手在图像生成、编辑、延迟和价格方面的表现。
## Google 将 Nano Banana 更新与视频 API 配对
Google 为处理媒体的开发者构建了一个低成本、高吞吐量的管道,将 Gemini 最快的图像模型与同样快速的多模态模型相结合,后者可以将图像转换为带有同步声音的视频。
**新消息:** Google 发布了 Nano Banana 2 Lite(正式名称为 Gemini 3.1 Flash Lite Image),这是该公司最快且成本最低的图像模型,旨在替代原来的 Nano Banana。该公司还通过其 API 平台向开发者提供了其最新的视频模型 Gemini Omni Flash,距离该模型首次通过 Google 应用接触消费者已经过去了六周。Google 的公告将这一对模型称为潜在的双重功能,使用户可以通过图像模型生成低成本静止图像(或一百张),然后通过相同的对话界面将最佳图像转换为视频。
- **输入/输出:** Nano Banana 2 Lite – 文本和图像输入,输出图像(最高1k分辨率)和文本。Gemini Omni Flash – 文本、图像和视频输入,输出带有同步音频的720p视频,每个片段最长10秒。
- **可用性:** 两个模型均可通过 Gemini API、Google AI Studio、Gemini Enterprise Agent 平台,以及 Gemini 应用和 Google Flow 使用。Nano Banana 2 Lite 还可通过搜索中的 AI 模式、NotebookLM、Google Photos、Stitch 和 Google Ads 使用;Gemini Omni Flash 还可通过 YouTube Shorts 使用。
- **价格:** Nano Banana 2 Lite 每张 1K 分辨率图像 $0.034;Gemini Omni Flash 每秒 720p 视频 $0.10。
- **性能:** Nano Banana 2 Lite – 在 Image Arena 上 Elo 排名第五;Gemini Omni Flash – 在 Video Arena 上视频生成 Elo 排名第一(编辑排名第二)。
- **速度:** Nano Banana 2 Lite 生成
相似文章
AI时代的原型开发速度
一位开发者讨论了AI如何大幅提升了他的原型开发速度,使他能够快速创建多个可运行的项目。他还指出,工程思维正转向抽象规范。
让Fable自行判断,而不是规定其工作方式(2分钟阅读)
使用Fable和Opus等AI编码工具的实用技巧:让它们自行判断而不是规定行为,并通过子代理将较小的任务委托给较低功耗的模型,以节省token并提高效率。
Claude Mythos、Deepseek v4、HappyHorse、Meta 新 AI、实时视频游戏:AI 新闻
Anthropic 公布被雪藏的 Claude Mythos 模型,可自主挖掘数千个 0-day;ZAI 开源 1.5 TB GLM-5.1,登顶开放权重基准;阿里巴巴未发布的 HappyHorse 视频模型冲上公开榜第一;Deepseek 放出“专家模式”v4 预览。
AI周报(2026年5月23–30日):Claude Opus 4.8 Fast模式降价3倍,Qwen 3.7 Max半价超越Claude,ChatGPT入驻Excel
2026年5月23–30日主要AI发布综合盘点,涵盖Claude Opus 4.8 Fast模式降价、Qwen 3.7 Max竞争性定价发布、ChatGPT集成Excel、Gemini 3.5 Flash、Grok Build 0.1、Mistral的Vibe智能体以及Hugging Face机器人应用商店,并分析了推理成本下降趋势及战场转向分发领域。
/architect: 将Fable令牌减少80%,Fable编排/审查,Codex构建
介绍了architect-loop,一个跨供应商的开发循环,其中Claude Fable负责架构和审查工作切片,而GPT-5.5 Codex并行进行构建和研究,使用固定费率订阅而非API令牌。