Google给Gemini加了个新功能,看视频更聪明还省钱,能自己决定看哪里,长视频分析成本大降。
Google为Gemini系列推出Agentic Video Understanding功能,首发于Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite版本。该技术将token消耗降低最高88%,分析成本降低最高66%,同时准确率提升最高7%。AVU技术从传统的'被动看'模式转变为'主动查'模式,模型可自主决定观看速度和内容片段。
Google 为 Gemini 推出 Agentic Video Understanding Gemini 系列在多模态理解上还是最强之一,这次 AVU 首发于 Gemini 3.7 Flash、3...
Google 为 Gemini 推出 Agentic Video Understanding Gemini 系列在多模态理解上还是最强之一,这次 AVU 首发于 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite: · Token 消耗降低最高 88% · 分析成本降低最高 66% · 准确率反而提升最高 7% blog.google/innovation-and… 技术本质:从"被动看"到"主动查" 传统视频处理是静态模式:模型以固定帧率(默认 1 FPS)均匀 ingest 整个视频,不管内容重要与否。这导致一个两难: · 帧率低 → 漏掉关键瞬间(快速动作、切换边界) · 帧率高 → 长视频 token 成本爆炸 Agentic 模式让模型进入 agentic loop:模型自主决定看哪里、用什么速度、走哪个模态(画面帧 / 音频 / 字幕转录),通过调用内部工具按需加载视频的特定片段。这是把此前已在图像领域推出的 agentic vision(代码执行 + 视觉理解)思路延伸到了视频的时间维度上。 四项关键能力 1. 亚秒级时刻定位——捕捉 1 FPS 下必然丢失的瞬间状态变化和剪辑边界,支撑自动化精剪 2. 长视频大海捞针——数小时视频中回答复杂问题,token 消耗从百万级大幅压缩 3. 异常检测——对可疑时间窗口动态提高采样率,检查快速运动和细微视觉瑕疵 4. 动作与物体计数——通过变速反复回看,准确统计重复动作 Google @Google We’re introducing a new capability to our latest Gemini models: agentic video understanding. This allows developers to process long-form video content with more accuracy, while using up to 88% less tokens. See how it works 🧵 Your browser does not support the video tag. 🔗 View on Twitter 🔗 View Quoted Tweet 💬 1 🔄 0 ❤️ 0 👀 276 📊 1 ⚡