@googledevs: https://x.com/googledevs/status/2100299269261635948
摘要
Google 的智能体视频理解能力正被三家公司利用,通过 Gemini Flash 模型在视频处理任务中降低成本并提升准确性。
查看缓存全文
缓存时间: 2026/09/16 20:10
三家公司如何运用智能视频理解进行构建
传统人工智能处理视频的方式往往使得长视频处理变得繁琐,且容易遗漏关键的毫秒级细节。本月早些时候,我们推出了智能视频理解功能来解决这一问题。为了真正检验这一能力,我们提前向 @mosaic_so、@PonderStudioAI 和 @tryrevyl 开放了最新的 Gemini Flash 模型访问权限,以验证其是否能降低成本并提升准确性。
以下是他们的构建案例:
@Mosaic_so 与视频后期制作
针对原始的、数小时长的影视制作视频剪辑,@mosaic_so 在他们的视频智能体 @motion_so 中构建了一个自适应路由层。其智能体并非将每一帧都塞入提示词,而是利用智能视频理解来建立索引、设定目标审查窗口,并仅提取编辑约束需要验证的高密度帧。这种智能方法将中位词元使用量减少了 97%,并且与静态处理相比,处理复杂编辑的能力几乎翻了一番。
@PonderStudioAI 与 B-Roll 素材筛选
@PonderStudioAI 没有采用复杂的感知循环,而是通过单次智能调用来评估影片运动,并从原始 B-Roll 素材中找出最佳的稳定镜头。借助智能视频理解,他们的工作实现了近乎完美的 0.967 F1 分数,同时词元成本降低了约 72%。
@TryRevyl 与移动端云开发
静态截图测试(通常在 1FPS 下进行)常常会错过掉帧和界面卡顿,但 @tryrevyl 通过将智能视频理解直接集成到其断言循环中解决了这一问题。Gemini 帮助他们的智能体在需要时更仔细地扫描动画,捕获快速出现的缺陷,使准确性提升了 65%。
0:27
立即开始
智能视频理解现已支持视频上传和 @YouTube 视频。它通过 @GoogleAIStudio 和 Gemini 企业智能体平台中的 Gemini API,由 Gemini 3.8 Flash、3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 提供支持。
请阅读开发者指南。
相似文章
介绍 Gemini 的代理式视频理解
Google DeepMind 为 Gemini 模型推出代理式视频理解功能,可将令牌消耗减少高达88%并提升视频分析的准确性。
@Saboo_Shubham_: 使用 Gemini 3.7 Flash 的智能体视频理解意义重大。只需降低成本、减少令牌并提高准确性。没什么大不了的…
该推文强调,使用 Gemini 3.7 Flash 的智能体视频理解显著降低成本、减少令牌使用量并提高准确性。
谷歌Gemini 3.7 Flash瞄准编码与智能体,推出50%限时降价(13分钟阅读)
谷歌发布Gemini 3.7 Flash,这是一款专注于编码和智能体工作流的新AI模型,其API token价格限时下调50%,持续到2026年底。该模型改进了规划、指令遵循和错误恢复能力,以减少重试和人工监督。
@googledevs: 正在构建创意工具或媒体编辑软件吗? Gemini Omni 1.1 Flash 现已通过 Gemini API 在 @Go… 上提供
Gemini Omni 1.1 Flash 现已通过 Google AI Studio 中的 Gemini API 提供,为生成式视频提供生产就绪的控制,功能包括场景扩展、4K 升级和更快的原型制作。
借助 Gemini 3.5 Flash,谷歌将下一波 AI 押注在智能体而非聊天机器人上
谷歌发布了 Gemini 3.5 Flash,这是一款针对编码和自主智能体优化的新 AI 模型,将重点从聊天机器人转向智能体 AI。它的性能优于之前的模型,并为 Antigravity 2.0 和 Gemini Spark 等新产品提供支持。