9月1日,Google DeepMind 给 Gemini 系列(3.7 Flash、3.6 Flash、3.5 Flash-Lite)加了一个看似不起眼、却可能改变成本结构的模式:智能体视频理解(agentic video understanding)。它不新开模型、不加收费用,只是把「看视频」的方式从「逐帧硬读」换成「带着目标在时间轴上找」。
一、从逐帧到「带目的检索」
传统做法,模型要把一段视频按固定帧率全部读进去,一分钟广告和一小时录像都按帧付费。新模式下,模型像人一样拖动时间轴,先定位关键片段再细看,单条请求里还能让长视频走智能体模式、短视频走静态模式混用。官方披露的数据(均来自 Google 内部基准、尚未第三方验证):Token 最多降 88%、成本最多降 66%、长视频质量还提升约 7%。
二、便宜出来的新场景
数字本身的反差在于:省下的不是「广告」这种短视频,而是「小时级」的长内容。对监控与巡检类 Agent 来说,这意味着过去因成本只能批处理、隔几个小时看一次的摄像头画面,有望变为近实时分析;对教育和研究 Agent,长讲座、手术录像、证词笔录也能被低成本地反复检索。YouTube 消费端集成还要「未来数月」,但 API 这扇门已经开了。
三、边界要先看清
该能力目前只活在 Gemini API、AI Studio 与 Gemini Enterprise Agent Platform 上,YouTube 输入须为公开视频,单条请求最多 10 个视频,1M 上下文下长视频上限约 3 小时(低分辨率)或 1 小时(高分辨率)。更关键的是,88%/66%/7% 这组漂亮数字都来自 Google 自测,是否经得起独立复现,仍有待观察。开发者在架构前,最好先用自己的真实视频集测一遍。
四、视频从「最贵模态」变「可负担底座」
多模态 AI 栈里,视频长期是最烧 Token 的那一个,很多「永远在线」的视频 Agent 因此卡在成本上。谷歌这次把竞争点放在单位经济(unit economics)而非单纯跑分,等于给视频类 Agent 松了一道口子。当长视频分析便宜到可以常开,监控、内容审核、驾驶仿真复盘这类应用,也许会迎来一波从「能想」到「常用」的跨越。