@googledevs: https://x.com/googledevs/status/2100299269261635948

X AI KOLs Following 新闻

摘要

Google 的智能体视频理解能力正被三家公司利用,通过 Gemini Flash 模型在视频处理任务中降低成本并提升准确性。

https://t.co/nCtQYQr6LZ
查看原文
查看缓存全文

缓存时间: 2026/09/16 20:10

三家公司如何运用智能视频理解进行构建

传统人工智能处理视频的方式往往使得长视频处理变得繁琐,且容易遗漏关键的毫秒级细节。本月早些时候,我们推出了智能视频理解功能来解决这一问题。为了真正检验这一能力,我们提前向 @mosaic_so、@PonderStudioAI 和 @tryrevyl 开放了最新的 Gemini Flash 模型访问权限,以验证其是否能降低成本并提升准确性。

以下是他们的构建案例:

@Mosaic_so 与视频后期制作

针对原始的、数小时长的影视制作视频剪辑,@mosaic_so 在他们的视频智能体 @motion_so 中构建了一个自适应路由层。其智能体并非将每一帧都塞入提示词,而是利用智能视频理解来建立索引、设定目标审查窗口,并仅提取编辑约束需要验证的高密度帧。这种智能方法将中位词元使用量减少了 97%,并且与静态处理相比,处理复杂编辑的能力几乎翻了一番。

@PonderStudioAI 与 B-Roll 素材筛选

@PonderStudioAI 没有采用复杂的感知循环,而是通过单次智能调用来评估影片运动,并从原始 B-Roll 素材中找出最佳的稳定镜头。借助智能视频理解,他们的工作实现了近乎完美的 0.967 F1 分数,同时词元成本降低了约 72%。

@TryRevyl 与移动端云开发

静态截图测试(通常在 1FPS 下进行)常常会错过掉帧和界面卡顿,但 @tryrevyl 通过将智能视频理解直接集成到其断言循环中解决了这一问题。Gemini 帮助他们的智能体在需要时更仔细地扫描动画,捕获快速出现的缺陷,使准确性提升了 65%。

0:27

立即开始

智能视频理解现已支持视频上传和 @YouTube 视频。它通过 @GoogleAIStudio 和 Gemini 企业智能体平台中的 Gemini API,由 Gemini 3.8 Flash、3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 提供支持。

请阅读开发者指南。

相似文章

介绍 Gemini 的代理式视频理解

Google DeepMind Blog

Google DeepMind 为 Gemini 模型推出代理式视频理解功能,可将令牌消耗减少高达88%并提升视频分析的准确性。