01 发生了什么

Google 正式发布了代理视频理解(Agentic Video Understanding)功能,适用于 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型。与以往固定帧率的静态处理不同,该功能利用模型核心推理能力与原生视频工具,动态扫描视频、音频及转录文本。

02 关键细节

  • 据 Google 官方声明,该功能相比静态处理可减少高达 88% 的代币消耗,并将视频分析成本降低最多 66%。
  • 公司声称,这一动态分析方法可将视频识别与分析的准确度提升至多 7%。
  • 该技术通过智能搜索和扫描目标视频片段,取代了传统的固定频率逐帧处理方式。

03 为什么重要

此项改进对于开发者处理长视频内容至关重要。它能更高效地执行对象追踪、异常检测及特定时间点检索任务,在降低计算资源支出的同时优化了分析精度。

04 适合谁

软件开发人员、数据工程师及机器学习工程师。

原始来源Google