Copied


Google 的 Gemini 模型推出智能视频理解功能

realtime news   Sep 01, 2026 18:41 1 Min Read


Google 为其 Gemini AI 模型推出了一项名为智能视频理解的新功能,旨在革新长视频分析。这项功能适用于 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,据称可将令牌使用量减少高达 88%,成本降低 66%,并相比传统的静态处理方法提高 7% 的准确率。

此次更新的核心在于从静态逐帧视频分析转向动态、目标导向的方法。模型不再以固定速率处理每一帧,而是可以主动确定需要关注的片段,有选择地利用视频帧、音频和转录文本。这不仅节省了计算资源,还解锁了诸如亚秒级时刻检索和更精确的异常检测等新功能。

对于开发者来说,这一变化意义重大。长视频——例如 90 分钟的讲座或数小时的录音——过去因高令牌成本或分析过程中不得不舍弃细节而面临挑战。通过整合智能视频理解功能,Gemini 模型缓解了这些权衡,实现了详细且具成本效益的分析。例如,作为系列中效率最高的模型,Gemini 3.7 Flash 在视频 AI 的成本-准确性优化方面设立了新标杆。

实际应用场景

智能视频理解开启了广泛的应用案例:

  • 亚秒级时刻检索:通过定位毫秒级状态变化,实现精准的自动化视频编辑。
  • 大海捞针式搜索:无需消耗过多令牌,即可高效回答跨数小时视频的复杂查询。
  • 异常检测:识别关键时间窗口中的细微视觉异常或快速运动。
  • 动作与物体计数:高精度追踪重复的动作或时间内的独特物体。

这些功能已经集成到 Google 的生态系统中。早期访问的合作伙伴报告了显著的性能提升,这项功能将在不久后增强 YouTube 的“问 YouTube”功能,直接在观看页面上提供带时间戳的、以视觉为基础的答案。

背景与市场影响

智能视频理解的推出凸显了 AI 向更主动、更具上下文感知系统发展的趋势。在视频应用领域,如监控、媒体工作流和客户支持,Google 的这一举措尤为引人注目。随着 NVIDIA 最近推出可操作的视频智能工作流等竞争技术,市场竞争格局日益激烈。

对于开发者来说,效率提升带来了实际的成本节约。Gemini API 的令牌定价保持不变,启用智能功能无需支付额外费用。这可能推动采用,特别是在处理海量视频数据集或需要自动化复杂视频任务的企业中。

展望未来,智能视频理解的商业化标志着 AI 与多媒体交互方式的重大变革。随着 VideoGAIA 和 LongVideoBench 等基准的演进,预计它们将为评估这些能力设定新标准,从而进一步推动该领域的创新。

从 2026 年 9 月 1 日起,该功能已通过 Google AI Studio 和 Gemini 企业代理平台上的 Gemini API 上线,开发者可以立即开始利用智能视频理解功能。Google 还暗示将在未来几个月内在其产品套件中更广泛地采用这一功能,进一步巩固 Gemini 模型在快速发展的 AI 视频分析市场中的核心地位。


Read More