恢复Claude Fable 5,Gemini的视频开发引擎,DeepSeek加速推测解码

The Batch 新闻

摘要

Andrew Ng分享了在使用AI编码代理进行快速原型开发时构建产品规格的实用建议,强调AI令牌成本低而人类令牌价值高,并且通过代理构建的原型进行迭代比预先规范更高效。

The Batch News & Insights: 代理编码循环的核心思想是让代理持续工作,直到满足某个条件,例如达到产品规格。
查看原文
查看缓存全文

缓存时间: 2026/07/10 19:36

# Claude Fable 5 模型恢复,Gemini 视频引擎发布,DeepSeek 加速投机解码 来源:https://www.deeplearning.ai/the-batch/issue-361 亲爱的朋友们, 自主编码循环的核心思路是让一个智能体持续工作,直到满足某个条件,比如通过产品规格验收。对于许多AI系统来说,编写规格、评估标准或测试集是最困难的任务之一,也是注入人类知识的关键节点。一旦有了清晰的规格,实现它的路径(比如让编码智能体反复迭代)就变得更加明确。我想分享一些关于构建产品规格的实用技巧,这些规格能够驱动编码循环,帮助我们快速从0到1搭建应用。正如我接下来要解释的,我遵循的一个组织原则是:AI token 很便宜,而人类的 token 是金子。(是的,我知道人类并不是真的把语言切分成 token,但我跟 token 打交道太多了,以至于现在我觉得自己就是在给电脑提供 token!) 在构建一个庞大复杂的系统时,花时间设计好架构是值得的。这包括决定:你想用什么数据库?如何在不同服务之间分解工作负载?你要绑定哪些第三方依赖?前端和后端的 API 边界在哪里?提前思考这些问题有助于避免陷入难以更改的错误决策。 但当我快速构建那些我还不熟悉领域的0到1原型或应用时,我通常行动得更快,思考得更少。我发现直接让编码智能体开始构建很方便,这样我就可以检查它构建出来的东西,以便做出下一组决策。当AI智能体只需要20分钟就能构建一个简单的原型时,没必要花一小时的人类时间来推敲设计规格;我宁愿花10分钟写一个不那么完美的规格,看看智能体构建了什么,检查它的假设,然后改进规格并重复这个过程。这样,“规格驱动开发”就不会成为一个新的瀑布流程——写规格不再是进一步推进的门槛,而是让我能够更迭代地改进规格。 例如,我做过原型的许多应用的第一个版本都有令人困惑的UI设计,我通过修改规格来修复它们。即使我花再多时间调整初始规格,也根本不会提前意识到这些修改是必要的。独自想出那些人类 token 的成本太高了。观察哪里出了问题,然后解释如何做对,反而更容易(也更便宜)。 随着软件项目成熟,编码智能体会工作更长时间(可能是几小时)来构建更复杂的规格。但在早期阶段,扔掉整个代码库从头开始是完全没问题的,所以没有什么难以更改的。所有那些代码,无论是从人类时间还是 token 成本来看,都很便宜。我们通过测试学到的内容更有价值。 此外,有一个具体的实现可以供你反馈(或者有时我会要求智能体提供几个不同的设计),这会给你一种高效的方式获取反馈(人类 token),从而改进规格,推动后续迭代。如果你在构建0到1的产品,我鼓励你让编码智能体开始工作——可能比你感觉舒适的时间点还要早——看看它会产生什么,然后以此为起点。接着记录你的反应,不断迭代。 机器人的手指上系着一个蝴蝶结,上面绑着 SPEC.md 文件。开发者问:“这是做什么的?”机器人说:“你上周二告诉我一件重要的事。我永远不会忘记。”在这里,你也可以让智能体完成大部分工作。开发者中一个常见的挫折是,当我们告诉编码智能体某件事后,它后来(可能在记忆压缩之后)就忘记了。我希望未来的编码工具能改善这一点,但就目前而言,当我做出关键决策时,我经常引导智能体将那个决策记录在某处,比如 SPEC.md 文件中。在构建项目的过程中,一个编码智能体可能会生成数百万个 token——远远超过人类开发者输入的 token。所以如果智能体发现了一些东西然后又忘记了,这会有成本,因为它可能会消耗更多 token 来重新发现——但这还不算太糟。但如果它忘记了你告诉它的事情,那就令人沮丧得多,因为你最终不得不重新告诉它:更多金色的 token 被浪费掉了。 由于模型的进步,编码智能体在最近几个月变得不那么健忘了,但它们仍然偶尔会忘记。当我在原型中看到不满意的地方时,我经常告诉智能体不仅要修复它,还要更新规格(也许还有测试计划),这样智能体未来的停止条件就会要求检查这个问题不再发生。这是确保它把人类 token 当作金子的一种方式。 继续构建吧! Andrew ## DEEPLEARNING.AI 的消息 (http://deeplearning.ai/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz--0nCJsACvA4hPfUENskLBarns5FIWphZ5XbcRCt5lnNkUpFe7x5X1wlzb0si4O7wOOGhVf) 笔记本电脑上手正在打字,旁边是 Workera 的 Ambient 推广文字,强调技能评估和免费访问。认识一下 Ambient,来自 Kian Katanforoosh 和 Workera,旨在测量你在工作中的技能。你已经测量了所有重要的事情:睡眠、步数、屏幕时间。为什么不测量你的技能呢? 加入等待列表 (https://www.workera.ai/platform/ai-agent/ambient/join-waitlist?tab=individuals%3Futm_source%3DEmail&utm_medium=email&utm_campaign=ai-agent-launch&utm_term=Batch2&utm_content=Batch2&_hsenc=p2ANqtz--0nCJsACvA4hPfUENskLBarns5FIWphZ5XbcRCt5lnNkUpFe7x5X1wlzb0si4O7wOOGhVf) ## 新闻 Claude Fable 和美国商会印章在一个循环中连接。 ## 寓言的回归与余波 Claude Fable 5 和更强大的 Claude Mythos 5 回来了,距离 Anthropic 因美国商务部出口管制指令而暂停这些模型已经过去了三周。 **新消息:** Anthropic 于7月1日恢复了客户通过 Claude API、Claude Code 和其他 Anthropic 控制的平台对 Claude Fable 5 的访问。作为与美国政府协议的一部分,Anthropic 为模型增加了额外的防护栏,阻止某些网络安全查询,并将其路由到能力较弱的 Claude Opus 4.8。 **发生了什么:** Claude Fable 5 和 Mythos 5 的重新部署解决了今年迄今为止美国政府与AI公司之间最引人注目的冲突。然而,这场争端不仅涉及 Anthropic,还涉及亚马逊、谷歌、微软和 OpenAI。(披露:Andrew 是亚马逊董事会成员。)以下是模型发布、暂停和恢复的时间线。 - Anthropic 在4月向选定的政府和技术合作伙伴推出了 Claude Mythos 预览版。该模型仅发布给维护关键基础设施的公司,以便他们识别安全漏洞并修补。 - 两个月后,6月9日,Anthropic 向全球客户发布了 Claude Fable 5。其防护栏阻止了某些与网络安全和生物学研究相关的查询;该模型还引发了争议,贬低了关于如何构建强大AI模型的回答。 - 亚马逊研究人员使用 Claude Fable 5 获取了关于如何进行网络攻击的信息,这导致了出口管制指令。Anthropic 认为,任何足够强大的模型,包括其自己的 Claude Opus 4.8 和其他供应商的模型,都能识别相同的漏洞并产生利用方法。 - 6月12日,美国政府发布出口管制指令,暂停向任何外国国民(无论居住在哪里)提供 Claude Fable 5 和 Mythos 5,理由是国家安全隐患。同一天,Anthropic 对所有全球用户禁用了这些模型的访问。 - 6月26日,美国政府告诉 Anthropic,它可以为选定的政府组织重新部署 Claude Mythos 5。在一封给公司的信中,商务部长 Howard Lutnick 表示,与 Anthropic 数周的谈判已经取得了“重大进展”,并且该AI开发者致力于与政府合作,制定AI模型安全评估的协议和标准。 - 在 Anthropic 实施新的安全护栏以解决亚马逊研究人员发现的网络安全风险之后,Claude Mythos 5 和 Fable 5 的出口管制于6月30日解除。该公司宣布 Claude Fable 5 将于7月1日起向全球用户开放。AWS、谷歌云和微软 Foundry 客户的访问很快随之而来。 - Claude Fable 5 回归几天后,一些用户报告称,模型性能相比之前发布有所下降,生物学等基本问题被审查,编码任务也受到更多限制。Anthropic 在 X 上的一篇帖子中表示,一些常规编码任务将回退到 Opus 4.8,但该公司将在未来几周内努力“更好地区分真正的滥用和合法的请求”。 - 其他用户抱怨说,该模型很快将仅适用于订阅者50%的使用积分,用户将需要按积分付费以获得更多访问权限。Anthropic 最终将付费订阅者对 Claude Fable 5 的完全访问权限延长至7月12日。 **新闻背后:** 在2月早些时候一场高风险的争端中,五角大楼将 Anthropic 标记为“供应链风险”,原因是该AI开发者拒绝向美国政府提供其模型版本——该版本没有防护栏阻止用于大规模监控或自主武器。这一重要认定意味着国防部及其合作伙伴不能再使用 Anthropic 的产品。然而,6月的出口管制令是政府干预首次导致模型被暂停通用访问。OpenAI 最近推出的三个强大的新模型属于 GPT-5.6 家族,在此之前,政府强制要求对其技术能力进行预览,然后才在7月广泛发布。 **为什么重要:** 美国政府审查 Anthropic 和 OpenAI 的顶级模型标志着AI行业的一个关键时刻,这很可能影响未来的模型发布。出口禁令表明政府越来越愿意在先进AI系统广泛部署之前审查其能力,这引发了关于模型应如何发布以及谁应有权访问的问题。这也可能影响各国如何保持技术领先。看到美国政府限制访问顶级模型的国家,有强烈动力开发自己的前沿模型,或者转向限制较少的合作伙伴,以保护其AI主权。 **我们的想法:** 如果政府决定干预AI模型的发布——我们对此表示质疑,因为存在监管捕获导致只有少数模型通过的风险——它至少应该通过一个可预测的流程来进行。公司需要知道他们需要达到什么标准才能将产品推向市场。任何管理模型发布的框架都需要公平、稳定、透明且适度宽松,以减少不确定性、鼓励投资,并避免可能延误创新和破坏公众信任的临时决策。 --- 图表比较了 Nano Banana 模型与竞争对手在图像生成、编辑、延迟和价格方面的表现。 ## Google 将 Nano Banana 更新与视频 API 配对 Google 为处理媒体的开发者构建了一个低成本、高吞吐量的管道,将 Gemini 最快的图像模型与同样快速的多模态模型相结合,后者可以将图像转换为带有同步声音的视频。 **新消息:** Google 发布了 Nano Banana 2 Lite(正式名称为 Gemini 3.1 Flash Lite Image),这是该公司最快且成本最低的图像模型,旨在替代原来的 Nano Banana。该公司还通过其 API 平台向开发者提供了其最新的视频模型 Gemini Omni Flash,距离该模型首次通过 Google 应用接触消费者已经过去了六周。Google 的公告将这一对模型称为潜在的双重功能,使用户可以通过图像模型生成低成本静止图像(或一百张),然后通过相同的对话界面将最佳图像转换为视频。 - **输入/输出:** Nano Banana 2 Lite – 文本和图像输入,输出图像(最高1k分辨率)和文本。Gemini Omni Flash – 文本、图像和视频输入,输出带有同步音频的720p视频,每个片段最长10秒。 - **可用性:** 两个模型均可通过 Gemini API、Google AI Studio、Gemini Enterprise Agent 平台,以及 Gemini 应用和 Google Flow 使用。Nano Banana 2 Lite 还可通过搜索中的 AI 模式、NotebookLM、Google Photos、Stitch 和 Google Ads 使用;Gemini Omni Flash 还可通过 YouTube Shorts 使用。 - **价格:** Nano Banana 2 Lite 每张 1K 分辨率图像 $0.034;Gemini Omni Flash 每秒 720p 视频 $0.10。 - **性能:** Nano Banana 2 Lite – 在 Image Arena 上 Elo 排名第五;Gemini Omni Flash – 在 Video Arena 上视频生成 Elo 排名第一(编辑排名第二)。 - **速度:** Nano Banana 2 Lite 生成

相似文章

AI时代的原型开发速度

Hacker News Top

一位开发者讨论了AI如何大幅提升了他的原型开发速度,使他能够快速创建多个可运行的项目。他还指出,工程思维正转向抽象规范。