Search What You See: The Tech Behind The Magic | Made by Google Podcast S9E4
摘要
Google 升级了 Circle to Search 功能,利用 Gemini 3 实现对屏幕内容的整体场景识别,特别是时尚造型的多物品分解与虚拟试穿。该更新允许用户无需截图即可直接寻找替代商品并查看上身效果,提升了视觉搜索的无缝体验。
暂无内容
查看缓存全文
缓存时间: 2026/05/08 07:34
TL;DR: Google 更新了 Circle to Search,利用 Gemini 3 实现了对屏幕内容的整体识别,特别是时尚造型的多物品分解与虚拟试穿,让用户无需截图即可直接寻找替代商品并查看上身效果。
# Circle to Search 重大升级:从单一物体到整体场景识别
欢迎收听 Made by Google 播客。在本期节目中,我们将探讨 Circle to Search 的最新重大升级。这项功能在 Pixel 10 和三星 Galaxy S26 等设备上迎来了增强,使其在识别眼前所见之物方面更加强大。特别是对于时尚爱好者,新增的隐藏功能帮助用户找到全新的美丽造型。我们将与产品管理总监 Harsh Kharbanda 深入交流,了解这一功能背后的技术演进与应用场景。
## 从 Google Lens 到 Circle to Search 的演进
**Rachid Finge:** Harsh,欢迎来到 Made by Google 播客。我们今天聊的是 Circle to Search。你还记得你第一次接触到 Circle to Search 时的情景吗?
**Harsh Kharbanda:** 我从 2018 年 Google Lens 诞生之初就开始参与其开发。随着 Lens 的发展,我们的主要焦点一直是摄像头。用户可以通过拍摄眼前的物体来获取答案,解决疑问。但后来我们意识到,很多价值在于人们能够搜索他们在电脑或手机屏幕上看到的内容。
我们注意到,用户经常截取大量屏幕截图,然后上传到 Google Lens。因此,我们团队的一部分人与 Android 团队合作,努力使整个流程更加无缝衔接。“圈出搜索”(Circle Gesture)功能由此诞生。
我第一次使用它时,感觉非常直观,心想:“哇,我每天都会用上它十次以上。”因为我的手机屏幕上每天都有各种各样的问题需要解答。从那时起,我就彻底爱上了它。随着 Lens 和 Circle to Search 产品逐渐融合,我越来越多地负责 Circle to Search 的产品工作。
## 视觉搜索的需求与早期挑战
**Rachid:** 我想为了理解今天的进展,有必要稍微回顾一下过去。搜索引擎最初是通过在搜索框中输入查询词开始的。后来我们有了语音搜索,接着正如你提到的,我们推出了 Google Lens。那么,为什么几年前我们要推出 Google Lens 呢?
**Harsh:** 视觉搜索的概念已经存在很长时间了。Google 在 2012 或 2014 年曾经研发过 Google Goggles。但当时技术尚不成熟。早期的 Google Lens 只能识别二维码,也许还能识别一些物体,以及进行翻译等。
Lens 的关键在于,我们知道存在需求,因为有很多问题很难仅通过口头或文字、语音来表达。
* **时尚描述难题:** 例如,你怎么描述在社交媒体上看到的一款非常独特的连衣裙?需要用到很多不同的词汇,即使使用了这些词汇,你仍然无法捕捉到那件连衣裙的神韵。
* **植物识别困境:** 很多人用 Lens 来识别植物。如果你不知道家里别人送给你的一株植物的名字,且它以某种特定方式正在枯萎、上面还出现了斑点,试图用文字描述会花费很长时间,且会失去很多细节精度。
因此,Google 很早就意识到,用户有很多难以描述的问题,这就是推动我们发展的动力。
## Circle to Search 与直接摄像头搜索的区别
**Rachid:** 对于那些从未使用过 Circle to Search 的人来说,它与直接使用摄像头搜索有什么不同?
**Harsh:** 当我们启动 Lens 时,重点主要放在你眼前的实物上。但我们很快意识到,在日常生活中,你接触新事物的机会并不多。你看到的基本都是同样的植物、同样的狗、同样的办公地点和办公桌等。因此,你提出新问题的机会并不多。
手机的功能越来越强大。人们在社交媒体和手机各个应用上花费了大量时间。当他们浏览和滑动手机时,会遇到引发好奇心的内容。因此,我们的目标是弥合差距:如何让视觉搜索更贴近设备?如何让它出现在用户产生疑问的地方?这就是 Circle to Search 的由来。
## 如何使用 Circle to Search 及典型场景
**Rachid:** 你能以用户的角度解释一下该如何使用它吗?有没有你最喜欢的、它超级有用的场景例子?
**Harsh:** 很简单。在任何新的 Pixel 设备上,只需在任意应用界面长按底部的导航栏。
这会让屏幕暂停(冻结),然后你可以点击任何地方。或者更棒的是,你可以精确地圈出你想要的内容,然后我们会显示最有可能是一个 AI 回答,解释你看到的内容。你还可以针对你所看的内容提出非常具体的问题。
我喜欢的一个例子是,我妈妈经常在 WhatsApp 上给我发垃圾信息,她会发一大堆消息,至少在我看来,这些肯定是假的。或者是一些视频,我心里想:“这不可能吧。”我经常使用 Circle to Search 来验证这些信息。我所做的只是长按导航栏,然后圈出内容,它就会告诉我:“嘿,这是不实的。”并列出原因。它实际上会在网络上搜索,找出哪些是真的,哪些是假的,以及其中的细微差别。我经常把结果截图发回给她。
**Rachid:** 如果屏幕上有什么内容是用我无法阅读的语言写的,我也可以圈出文字获取翻译吗?
**Harsh:** 完全正确。我也经常遇到这种情况,比如在家庭群里,有人转发一条消息,用的是某种印度语言或方言,我不说那种语言,或者即使我说,也很难读懂。我只需圈出它,它就能为我朗读并翻译。这是一个很实用的功能,我们的很多用户都经常使用。
## 时尚领域的突破:整体造型识别与虚拟试穿
**Rachid:** 我想在某个时刻你可能洞察到,人们也在某种程度上出于时尚目的使用 Circle to Search。
**Harsh:** 是的。在 Circle to Search 的早期,我们就意识到这会是一个趋势。我们从 Google Lens 中学到的一点是,特别是在疫情期间,用户在社交媒体上看到影响者(influencers)的视频或帖子,心想:“哦,我喜欢那件夹克”,但显然他们不会买一件 5000 美元的夹克。因此,他们会截图,然后上传到 Google Lens,寻找价格范围内类似的替代品。
对于 Circle to Search,我们很早就知道,如果减少摩擦,让用户无需截图、关闭应用、再打开 Google Lens 上传截图,而是直接在 Instagram 或 TikTok 等平台上提问,这将带来增长。年轻女性用户是使用 Circle to Search 进行视觉购物的人群。
我们开始看到的是,很多时候他们并不是圈出或寻找单一的一件夹克或产品,而是想要整个造型的氛围,整套穿搭的感觉。例如,“哦,我看到 Taylor Swift 的这个很酷的造型在走红……现在我想找到这个造型的每一个部分,当然,是在我的预算内重现这个造型。”
Circle to Search 在这方面起初并不出色。它对单个物体识别得很好,你可以逐个圈出夹克、上衣、牛仔裤、鞋子、包。有些影响者还戴着太阳镜。所以要圈的东西很多。
**在这次更新中,我们让用户可以圈出整体,然后找到整个造型。**
借助 **Gemini 3** 以及我们最新的模型更新,我们能够整体查看图像,并分解思考图像中哪些部分特别有趣,为用户分解图像的所有不同部分。然后,我们对图像的每个部分进行相同的视觉搜索,因此我们找到了太阳镜、夹克、牛仔裤等。我们尽可能找到确切的产品,以及许多类似的产品,供你浏览,找到符合你预算的商品,真正重现整个造型。
锦上添花的是,一旦你找到喜欢的产品,你可以点击它,你会看到一个选项,可以 **试穿该产品**。当你点击“试穿”新选项时,你会看到找到的夹克穿在你身上的样子。
这种端到端的旅程在用户测试中非常受欢迎。“天哪,Taylor Swift 穿的就是那个,我找到了不到 100 美元的东西,看起来很棒。我要买下来。”这真的让用户感到惊喜。
## 多物体识别的其他应用场景
**Rachid:** Circle to Search 现在可以检测多个物体。除了时尚,你还在思考哪些其他场景?
**Harsh:** 有很多。
1. **护肤流程:** 团队中负责此工作的产品经理之一非常喜欢护肤。她在 Instagram 上遇到了一套护肤流程,其中包含 14 种不同的产品图片。她基本上只是圈出了整个内容,问:“嘿,你能帮我找到所有产品并给出所有产品的评论吗?”并按价格排序。它能够搜索每一样东西,然后为你完成这一切。
2. **植物布置:** 我在社交媒体上看到一组植物的布置,心里想:“这些植物看起来很棒,但我不知道它们的名称。我想知道是否能在家里种植它们。”所以我只是圈出它并问:“嘿,你能告诉我所有植物的名称、它们的生长条件、需要什么?它们在这些条件下能茁壮成长吗?”我也能够搜索所有内容。
3. **颁奖典礼识别:** 我看到一个帖子,其中有五位演员拿着他们的奖项。我心里想:“我认识其中几位,但我不认识其他人,我不知道他们因什么获奖。”所以我只是圈出他们所有人,我说:“嘿,你能不能在一个漂亮的表格里告诉我,他们是谁,他们因什么获奖,以及我应该看他们的哪部电影?”然后它为我构建了一个很好的结果。
所以有很多不同的使用场景,用户实际上是在询问整体,而不仅仅是部分。寻找造型是最典型的旅程之一,它能让人们恍然大悟,然后将其用于许多不同的事物。
## 演示:高尔夫造型的识别与试穿
**Rachid:** 谈论试穿工具比直接展示给我们看更好,怎么样?
**Harsh:** 是的。让我快速录屏以便展示给你们看。
这是一个高尔夫造型的例子。这是我永远不会完全构思到的造型,但其中的部分对我非常有吸引力。
1. **调用功能:** 我调用了 Circle to Search。
2. **圈出整体:** 我圈出整个造型。当我圈出整个造型时,我得到了一个 AI 概述响应,允许我找到这个造型。
3. **分解识别:** 当我点击“找到造型”时,它实际上能够解构整个造型。看这件衬衫,看这些短裤,看这顶帽子。
4. **详细查看:** 我可以点击,它找到了确切的衬衫,所以我可以在查看器中打开衬衫,近距离查看。
5. **虚拟试穿:** 我能做的是,我也能试穿。让我在这里举一个例子。现在我看到一个“试穿”按钮,当我点击“试穿”时,它能够立即将这件衬衫穿在我身上。
这恐怕不是我想穿的东西,但至少告诉我,这不是适合我的东西。
所以,这就是整个旅程:“嘿,我在网上找到了这个造型,看起来很有趣,让我搜索一下。”然后,你只需点击两下进行搜索,我们为你找到了非常相似的东西,现在你可以试穿。
Source: [Search What You See: The Tech Behind The Magic | Made by Google Podcast S9E4](https://www.youtube.com/watch?v=x6Ix0RVd7yk)
相似文章
@FinanceYF5: 十年前搜索靠关键词,五年前靠语义,今天谷歌直接把最强AI塞进搜索框。 Gemini 3.5驱动,支持图片/视频/文件跨模态提问,AI Overviews和AI Mode合二为一。 搜索这次是真的变了!
谷歌将Gemini 3.5 AI集成进搜索框,支持图片、视频、文件等多模态提问,并合并AI Overviews和AI Mode,带来搜索体验的重大变革。
Search + Shopping | I/O 2026 Keynote
Google I/O 2026 主题演讲宣布搜索与购物的多项重大更新,包括 AI Mode 升级至 Gemini 3.5、智能搜索框、搜索代理、代理编码生成式 UI,以及面向代理型电子商务的 UCP 和 AP2 协议。
Google搜索迎来史上最大变革
Google在I/O 2026上发布了搜索功能史上最大变革,包括重新设计的搜索框,集成AI概览和由Gemini 3.5 Flash驱动的AI模式,为Pro/Ultra订阅用户提供AI代理,以及用于在搜索中构建应用的生成式UI。
Google Search 提升二手和复古购物的5种方法
谷歌分享了其AI驱动的搜索工具(AI Mode、Google Lens、Circle to Search)在二手和复古购物中帮助发现和识别宝藏的5种方式。
What’s New in Google Accessibility | Episode 12
Google 发布了涵盖 Android、Pixel、Chrome 和 YouTube 的最新无障碍功能更新,包括助听器独立设置、Voice Access 改进及 Guided Frame 离线支持。文章还介绍了如何利用 Gemini 指令优化 AI 交互体验以减轻认知负荷。