介绍 Gemini 的代理式视频理解
摘要
Google DeepMind 为 Gemini 模型推出代理式视频理解功能,可将令牌消耗减少高达88%并提升视频分析的准确性。
查看缓存全文
缓存时间: 2026/09/01 17:48
# 推出Gemini的智能体视频理解能力
来源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/
我们为视频分析推出的新智能体功能,最高可减少88%的Token消耗,降低最高66%的成本,并提升最高7%的质量。
---
Mario Lučić
Google DeepMind 研究总监
---
Gemini标志旁显示“智能体视频理解”文字,背景为深蓝色
您的浏览器不支持音频播放
播放文章音频
[\[\[时长\]\]]分钟
本内容由Google AI生成。生成式AI尚处实验阶段
今天,我们在所有最新模型中推出智能体视频理解(agentic video understanding)功能(https://ai.google.dev/gemini-api/docs/video-understanding#agentic-video-understanding):Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。这项新功能在提升准确性的同时,大幅降低了视频分析的Token使用量和成本。类似于结合了代码执行与Gemini模型原生图像理解的智能体视觉(agentic vision)功能(https://blog.google/innovation-and-ai/technology/developers-tools/agentic-vision-gemini-3-flash/),智能体视频理解利用Gemini的原生视频工具来提升性能,并解锁视频处理的新能力,例如亚秒级时刻检索、更准确的异常检测、精确计数等。
该功能现已通过Google AI Studio和Gemini企业智能体平台的Gemini API提供,支持视频上传和YouTube视频分析。
## 基准测试
与当前“静态”处理方式(模型以固定帧率(默认1 FPS,可通过API调整)处理视频)不同,智能体视频理解将模型的核心推理与原生视频工具相结合,能够跨视觉帧、音频和转录文本动态搜索、扫描和检查目标视频片段。在标准视频分析基准测试中,采用智能体视频理解的Gemini模型**将分析成本降低最高66%,Token消耗减少最高88%,同时将准确性提升最高7%**。
这些效率提升在长视频(从10分钟的操作指南到90分钟的讲座,再到多小时的录音)上尤为显著。在静态处理方式下,开发者被迫在高昂的Token成本与可能遗漏关键细节的技术之间做出选择。
启用智能体视频理解后,使用Gemini 3.7 Flash时Token消耗最多可降低88%,准确性提升最高7%。
分析Token效率和准确性增益的图表
虽然这些增益适用于所有三种受支持的模型,但采用智能体理解的Gemini 3.7 Flash在整体上提供了最佳的质量,以及质量与成本效益的最佳组合,使其在视频理解的准确性-成本帕累托前沿(accuracy-to-cost pareto frontier)上领先于其他测试模型。
使用智能体视频理解使Gemini 3.7 Flash处于视频分析的准确性-成本帕累托前沿。
以“每次查询成本”为X轴,“准确性”为Y轴的图表
## 工作原理
智能体视频理解不同于以固定帧率摄取媒体流的静态处理,它使Gemini能够主动、有目的地决定*观看什么*、以*何种速度*观看,以及通过*哪种模态*(帧、音频或转录文本)观看,只获取所需的时刻和信号。虽然开发者之前可以手动完成此操作,但借助智能体视频理解,Gemini可以通过智能体循环(agentic loop)来完成这一任务,调用内部工具加载视频文件的相关部分,从而显著减少开发开销。
从查询到输出的流程图
## 功能与用例
智能体视频理解彻底改变了开发者处理长视频内容的方式,适用于各种高要求的应用场景。
- **亚秒级时刻检索**:精确定位在1 FPS下容易错过的瞬间状态变化和紧凑剪切边界,实现精确的自动视频编辑。
- **长视频“大海捞针”式搜索**:无需消耗数百万Token即可在多小时的视频中回答复杂查询。
- **异常检测**:以更高FPS重新采样感兴趣的时间窗口,以检查快速运动和细微的视觉伪影。
- **动作与物体计数**:随时间准确跟踪重复的物理动作和不同的物体。
## 实际应用结果
我们的许多早期访问合作伙伴在测试智能体视频理解时,看到了强大的性能表现。以下是他们的评价:
Ponder的引述
Revyl的引述
Mosaic的引述
Resemble.AI的引述
## 开始使用
智能体视频理解现已通过以下平台的Gemini API提供:Google AI Studio(https://ai.google.dev/gemini-api/docs/video-understanding#agentic-video-understanding)和Gemini企业智能体平台(https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/capabilities/video-understanding),支持Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite。它使用标准的Gemini API Token定价,不收取额外功能费用。
要启用该功能,只需在API配置中将处理方式设置为“agentic”。阅读我们的开发者指南(http://ai.dev/learn/agentic-video-understanding-with-gemini)以获取更多关于该功能以及如何入门的见解。
```
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "这次主题演讲中最重要的3个公告是什么?",
},
],
)
print(interaction.output_text)
```
我们还将智能体视频理解的效率和质量提升带给Google产品上的数十亿用户。该功能将很快在Gemini应用的所有Flash和Flash-Lite模型用户中推出。在未来几个月内,智能体视频理解还将为YouTube视频观看页面上的“向YouTube提问”(Ask YouTube)(https://support.google.com/youtube/answer/14110396?hl=en&co=GENIE.Platform%3DAndroid)功能提供支持,利用Gemini基于视觉内容提供更高质量的答案。
***致谢以下人员对此工作的贡献:****Sergi Caelles, Filip Pavetić, Ahmet Iscen, Suhas Yogin,以及智能体视觉团队\*。
## 在您的收件箱中获取Google最新资讯
注册我们的通讯,获取产品更新、活动信息、特别优惠等。
您的信息将根据[Google的隐私政策](https://policies.google.com/privacy)使用。您可以随时选择退出。
相似文章
@_philschmid:Gemini 视频理解现已具备代理功能。Gemini 现在能够迭代地导航视频时间线,决定观看内容,选择…
Gemini 现已提供代理视频理解功能,支持迭代导航和自适应处理,以减少 token 使用和成本,同时提高视频分析的准确性。
推出 Gemini 2.0:我们为智能体时代打造的新型 AI 模型
Google DeepMind 推出 Gemini 2.0,这是一款新型智能体 AI 模型,具备原生图像和音频输出、增强的工具使用能力和多模态功能,专为下一代 AI 智能体设计。Gemini 2.0 Flash 现已向开发者推出,计划于 2025 年初实现更广泛的可用性。
@Saboo_Shubham_: 使用 Gemini 3.7 Flash 的智能体视频理解意义重大。只需降低成本、减少令牌并提高准确性。没什么大不了的…
该推文强调,使用 Gemini 3.7 Flash 的智能体视频理解显著降低成本、减少令牌使用量并提高准确性。
Gemini API 展示代理型 Gemini 模型
Google 的 Gemini API 现已开放代理型模型,使开发者能够构建具备更强推理和行动能力的自主 AI 智能体。
@GoogleDeepMind: 我们正在发布 Gemini Omni:这是我们迈向能够从任何内容创造任何内容的模型的第一步——从视频开始…
Google DeepMind 宣布推出 Gemini Omni,这是一种新型模型,它将 Gemini 的智能与生成式媒体系统相结合,能够从任何输入创建视频,标志着多模态人工智能的重大进步。