@TheTuringPost: 本周必读研究——Code as Agent Harness——无人知晓地理空间基础模型的最新水平……
摘要
谷歌正在将搜索转变为互动执行层,能够利用Gemini 3.5 Flash和Antigravity框架即时生成界面和工具,标志着用户在线信息交互方式的重大转变。
查看缓存全文
缓存时间: 2026/05/21 06:39
本周必读研究
作为代理工具的代码
无人知晓地理空间基础模型的最新进展
δ-mem:面向大语言模型的高效在线记忆系统
MetaAgent-X:通过端到端强化学习突破自动多智能体系统的上限
三思而后行:面向LLM代理的自主探索
从失败中学习:基于可验证奖励的修正导向策略优化
可操作的世界表征
CompactAttention:通过块联合KV选择加速分块预填充
基于对比对搜索的目标神经元调制
持久遗忘:通过电路归因实现量化不变性遗忘
MMSkills:面向通用视觉代理的多模态技能
EndPrompt:通过终端锚定实现高效长上下文扩展
MixSD:面向知识注入的混合上下文自蒸馏
完整列表及本周最重要AI新闻请见:https://turingpost.com/p/fod-153-agentic-coding-in-search-what-it-even-means…
FOD#153:搜索中的代理编程——这到底意味着什么?
来源:https://www.turingpost.com/p/fod-153-agentic-coding-in-search-what-it-even-means 将图灵邮报分享给一个人,你将帮助我们成长
本周图灵邮报:
- 周三/AI 101系列(https://www.turingpost.com/t/ai-101):从令牌到答案:LLM推理期间实际发生了什么
谷歌AI搜索正从信息检索系统转向能生成界面、执行任务、根据用户意图构建轻量级软件的系统。搜索不再只是返回链接,而是成为基于AI代理和生成式UI的交互式执行层。让我们深入探讨
主题介绍 → 我受邀报道了Google I/O,以下是我的亮点观察:
谷歌正在改变搜索框的本质。
这么说听起来很随意,但我真的难以平静。
这可能是互联网搜索本身的第二次重大变革。第一次改变了人们在网上查找信息的方式:输入查询,谷歌对网页进行排名,答案以链接形式返回。那个简单的界面重组了整个互联网:出版、广告、商业、知识工作,甚至我们对“知道“某事的思考方式。那时“谷歌一下“成了人人挂在嘴边的词。
现在谷歌正在改变搜索结果本身。搜索不再仅仅是你提问并接收信息的地方。它正成为一个地方,一个问题可以变成自定义界面、交互式小部件、专业布局、视觉解释、追踪器、规划器或即时生成的小工具——构建者们目前试图用数百个代理构建的东西,最终可能汇聚成Chrome浏览器里一个简单的搜索框。这感觉意义重大。
**它将如何运作:**谷歌正将Gemini 3.5 Flash及其Antigravity框架的代理编程能力直接集成到搜索中。在演示中,搜索能够规划答案、决定需要哪些组件、研究主题、编写代码,并在安全的容器化环境中运行。谷歌称之为“搜索规模的代理编程“,并表示带有Antigravity的生成式UI将于今年夏天免费推出。
这令人震撼,而我并不容易被打动。
我们习惯了将搜索视为通往网络的门户。谷歌正试图将其变成网络之上的执行层。这一转变影响深远。对用户而言,可能让复杂信息更易理解和操作。对开发者而言,它改变了“构建“的含义,因为许多小工具可能在需要时即时生成。对发布者和网站而言,它提出了一个更棘手的问题:当用户主要与生成的界面交互,而开放网络仅作为背后的素材时,会发生什么?
**我认为我们尚未完全意识到这在搜索规模上意味着什么。**IDE内的代理编程已经意义重大。搜索中的代理编程则完全不同。搜索是世界上最熟悉的界面之一。如果数十亿人能够使用它,如果它变得直观自然,那么构建将成为一种更普通的人类行为。
当然,许多问题依然存在。生成的界面可能出错。个人上下文可能变得过于侵入。代理需要约束、权限和问责制。网络经济可能再次被重塑。
或许它根本不够好用。连接太多、表面太多、上下文太多、容易出问题的地方太多。谷歌已有大量产品,将它们整合到一个连贯的代理层绝非小事,技术上和组织上都是。
但如果谷歌能成功,这一方向极为有趣。谷歌曾经改变了我们查找信息的方式。现在它正试图创造一种用信息构建的方式。
我仍难以完全想象:搜索变成一个意图转化为软件的地方。但我很期待看到它将如何运作。当然,前提是它能成功。
主题2关于构建者和公司构建。
说到构建者,我与埃里克·赖斯进行了一次精彩对话。他创造了MVP(最小可行产品)概念,并撰写了改变初创企业构建和测试方式的书《精益创业》。他的新书《Incorruptible》提出了一个不同的问题:如何构建保持连贯、可信且人性化的公司?为什么爱和信任应该成为构建者语言的一部分?你应该看看 →
如果这些想法引起你的共鸣——请在你的社交网络上分享。让我们继续对话。
Twitter图书馆
来自“常客“™的新闻
引发全民热议的推文
- Cerebras在纳斯达克盛大上市,表明市场仍需要可信的计算故事。代理对令牌的需求旺盛,推理的经济性正成为整个AI竞赛的核心。
- Cursor推出了Composer 2.5,称之为“迄今为止最强大的模型“——在长期编码任务上更智能,更擅长遵循复杂指令,据称效率比同行高10倍。该公司表示,该模型基于Moonshot的开源Kimi K2.5,并利用强化学习跨越庞大的令牌展开。Cursor还宣布与SpaceXAI合作,在拥有百万H100等效GPU的“Colossus 2“基础设施上训练更大的模型。硅谷最爱的消遣依然未变:随口提及足以匹敌小国的计算预算。埃隆·马斯克表示:“Opus 4.7仍然比Composer 2.5好,尽管贵得多。但Cursor是让Grok变得更好的关键拼图。”
- xAI将Grok更贴近构建者。处于早期测试阶段的Grok Build将Grok引入终端,作为支持规划、差异、插件、钩子、技能、MCP服务器和并行子代理的编码代理。这是所有人都在追逐的方向:能在真实开发环境中工作的代理。
- Thinking Machines展示了交互模型,一个实时多模态AI系统,旨在更像协作者而非提示框。不同于常见的回合制“你说我听“节奏,该模型以200毫秒“微回合“持续处理音频、视频和文本,支持打断、同时说话、视觉感知和实时工具使用。令人印象深刻。此外 →
- OpenAI从模型提供商进一步转向部署公司。它成立了OpenAI Deployment Company,获得重大投资支持,并收购了AI咨询公司Tomoro。信号明确:瓶颈不再是模型访问,而是组织内部的工作流重新设计。
- Anthropic继续将Claude推向企业基础设施。Claude for Small Business连接QuickBooks、PayPal、HubSpot、Canva、DocuSign、Google Workspace和Microsoft 365等工具。Anthropic还扩大了与普华永道的合作,将Claude Code和Claude工作流更深入引入专业服务领域。Claude的定位愈发清晰:面向机构工作的可信AI。
- Meta聚焦消息和社交界面中的AI。它在WhatsApp中为Meta AI引入了隐身聊天,增加了更多青少年监督工具,并继续推进WhatsApp上的Business AI。Meta的优势在于分发渠道。其挑战在于权限、隐私和信任。
- Isomorphic Labs融资21亿美元以扩展AI药物发现。这是最强信号之一,表明AI for Science正从令人印象深刻的研究演示转向工业管线。问题在于,AI原生的药物设计能否成为制药领域可复制的引擎。
- 阿里巴巴将Qwen更直接地与云和电商绑定。AI在阿里云收入中的占比正在提升,同时Qwen也被用作淘宝和天猫的对话式界面。这里的模型不是终点,而是通向购物、物流、广告和云消费的界面。
- Mistral强化了主权AI论点。Arthur Mensch警告称,欧洲大约还有两年时间避免依赖美国AI基础设施。他的观点很实际:主权意味着控制芯片、能源和计算能力。
- **谷歌一览。**谷歌在众多产品中宣布了一件大事:AI正变得代理化、多模态化,并嵌入到每个表面。
主题
主要公告
规模
谷歌服务每月3.2Q令牌;Gemini应用9亿用户;AI模式月活突破10亿
模型
Gemini 3.5 Flash发布;3.5 Pro下月推出;Gemini Omni宣布用于多模态生成/编辑
搜索
新版AI搜索框;AI概览+AI模式合并;搜索代理;生成式UI;自定义迷你应用、追踪器、仪表盘
代理
Gemini Spark用于24/7后台任务;即将支持MCP;Chrome代理浏览;今年晚些时候推出Android Halo
编程
Antigravity 2.0;CLI/SDK/语音;子代理、钩子、异步任务;代理构建操作系统演示
工作空间
Docs实时语音起草;Gmail和Keep即将支持语音;Spark将进入Workspace和企业版
商务
UCP扩展;AP2用于受控代理支付;Search/Gemini通用购物车,后续支持YouTube/Gmail
创作工具
Google Pics;Stitch更新;Flow获得Omni、代理、自定义工具、音乐混音
XR
Android XR眼镜;今年秋季与三星、Gentle Monster、Warby Parker推出音频眼镜
信任与安全
SynthID扩展;Search/Chrome中内容凭证;CodeMender API
科学
Gemini for Science;AlphaEarth、WeatherNext、Isomorphic Labs更新
这更清晰了,因为核心信息是:谷歌在众多产品中宣布了一件大事:AI正变得代理化、多模态化,并嵌入到每个表面。
🔦研究亮点
代码作为代理工具
来自伊利诺伊大学厄巴纳-香槟分校、Meta和斯坦福大学的研究人员调查了代码如何成为AI代理的操作性工具,而不仅仅是其输出。他们将领域组织为三个层级:推理、行动和环境建模的接口;规划、记忆、工具、反馈和优化的机制;通过共享工件进行协调和验证的多代理扩展。应用包括编码助手、GUI/操作系统自动化、具身代理、科学、个性化、DevOps和企业工作流→阅读论文(https://arxiv.org/abs/2605.18747)
无人知晓地理空间基础模型的最新进展
来自Taylor Geospatial、慕尼黑工业大学、Microsoft AI for Good、艾伦人工智能研究所、向量研究所、克拉克大学、不列颠哥伦比亚大学和亚利桑那州立大学的研究人员审计了152篇地理空间基础模型论文(2019-2025年),发现了严重的可比性失败。他们识别出46个案例,相同模型-基准协议得分差异≥10分,包括Scale-MAE在NWPU-RESISC45上得分33.0 vs 89.6。在401个基准中,35%的论文未共享任何前十大数据集。此外,39%未发布模型权重,75%使用独特预训练配置,94/126篇论文的预训练配置无法比较。该研究提出了六项标准:强制性许可权重发布、共享基准套件、重跑/复制基线标注、方差报告、统一评估框架,以及分离架构与数据的消融实验→阅读论文(https://arxiv.org/abs/2605.12678)
模型(上周发布了大量优秀开源权重模型)
研究
我们观察到上周发表的所有AI和机器学习相关论文中的趋势:
代理系统、记忆与自主工作流
- 🌟δ-mem:面向大语言模型的高效在线记忆系统–将记忆视为与注意力直接耦合的紧凑在线状态,而非依赖更长的上下文窗口或外部检索→阅读论文(https://arxiv.org/abs/2605.12357)
- 🌟MetaAgent-X:通过端到端强化学习突破自动多智能体系统的上限–尝试直接优化多代理协调,而非手工设计协作工作流→阅读论文(https://arxiv.org/abs/2605.14212)
- 🌟三思而后行:面向LLM代理的自主探索–研究代理在脚本化环境之外运行的探索策略,这在代理离开演示进入开放系统后变得关键→阅读论文(https://arxiv.org/abs/2605.16143)
- MMSkills:面向通用视觉代理的多模态技能–推动代理向可复用多模态能力发展,这一方向比无限扩展单一单体代理更重要→阅读论文(https://arxiv.org/abs/2605.13527)
推理、RLVR与测试时智能
- 超越舒适区助推:面向RLVR的高效策略引导探索–改进带可验证奖励的强化学习中的探索,这是推理导向后训练的核心瓶颈之一→阅读论文(https://arxiv.org/abs/2605.15726)
- 🌟从失败中学习:基于可验证奖励的修正导向策略优化–将失败的推理轨迹转化为结构化优化信号,而非作为噪声丢弃→阅读论文(https://arxiv.org/abs/2605.14539)
世界模型、具身AI与空间智能
- 🌟可操作的世界表征–主张世界模型应优化可操作的表征而非被动真实性,这是一个有意义的概念转变→阅读论文(https://arxiv.org/abs/2605.18743)
- 基于语言模型先验从观测中学习POMDP世界模型–结合语言先验与部分可观测世界建模,直接相关于在不确定性下运行的具身代理→阅读论文(https://arxiv.org/abs/2605.13740)
效率、推理与架构优化
- 🌟CompactAttention:通过块联合KV选择加速分块预填充–针对长上下文推理中实际的操作瓶颈之一:昂贵的预填充计算
相似文章
借助 Gemini 3.5 Flash,谷歌将下一波 AI 押注在智能体而非聊天机器人上
谷歌发布了 Gemini 3.5 Flash,这是一款针对编码和自主智能体优化的新 AI 模型,将重点从聊天机器人转向智能体 AI。它的性能优于之前的模型,并为 Antigravity 2.0 和 Gemini Spark 等新产品提供支持。
@seclink: @grok 总结一下:这次有哪些新颖的开源能力出现?
Google Antigravity SDK 引入了在本地 GPU 上完全离线运行像 Gemma 4 这样的开源 AI 模型的能力,确保零 API 成本和完全数据隐私。
@googledevs:Gemini 3.8 Flash 和 @Antigravity 让构建复杂开发者工具变得简单多了。从过程化游戏 d…
Google Developers 强调了 Gemini 3.8 Flash 和 Antigravity 如何使构建复杂开发者工具变得更加容易,应用范围涵盖过程化游戏设计、多平台 UI 和架构映射。
@googledevs:智能体时代来了。Google 刚刚为开发者推出了重大更新,包括:Gemini 3.5 Flash:性能提升4倍……
Google I/O 2026 公布了重大开发者更新,包括 Gemini 3.5 Flash(性能提升4倍)、用于智能体开发的 Antigravity 2.0 CLI 以及 AI Studio 移动应用,标志着向智能体时代的转变。
@DanKornas:构建一个研究代理是一回事。将其搜索循环、后端和可用的前端连接起来是另一回事。Gemini F…
一个使用Gemini、LangGraph、React和Google搜索的开源全栈研究代理示例,展示了包含动态查询生成、反思循环和引用答案的端到端工作流程。