资讯

Google Launches Agentic Video Understanding for Gemini Flash Models, Cutting Video Tokens by Up to 88%

marktechpost.com·2026/9/5 04:37:25🔗 原文

📋总体概括

Google为Gemini Flash系列模型推出「代理式视频理解」(Agentic Video Understanding)能力。以往Gemini以每秒1帧的方式被动摄取整段视频,导致大量冗余token消耗;新机制让模型像智能体一样主动在视频中导航,只加载与当前提示词相关的片段,官方称视频token消耗最多可降低88%。这标志着视频处理从「全量编码」转向「按需检索」,在长视频理解的成本与效率上迈出实质性一步,也可能重塑多模态推理的工程范式。

关键信息

  • Google面向Gemini Flash模型发布Agentic Video Understanding新能力
  • 传统方式以1 FPS逐帧摄取视频,新方式由模型主动导航定位相关片段
  • 模型只加载提示词所需的视频片段,而非整段视频全量输入
  • 官方数据显示视频token消耗最多可降低88%
  • 该更新意味着视频理解从被动编码转向主动检索的范式转变

🔥犀利点评

88%的token削减不是小修小补,而是把视频理解从「暴力喂帧」拉到了「目标导向检索」的轨道上。1 FPS全量摄取本质是用算力堆出来的伪能力,真正的长视频理解必须会「找」而不只是「看」。Gemini Flash作为轻量模型率先落地该机制,说明Google意图在成本敏感的应用端建立性价比壁垒。但要注意:按需加载的检索质量决定上限,漏检关键片段的风险是否被充分披露,才是考验。

本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文