Google DeepMind给Gemini视频理解甩出三个数字:token消耗最多降88%,分析成本最多降66%,准确率还能再涨7%。三个数字叠在一起,像是一次没有代价的免费升级——省钱、省token,还顺便更聪明了。翻一遍官方给出的评测细节,这三个"最多"很可能不是同一场考试考出来的,更像三张不同卷子上各自的最高分。
静态摄入,还是主动检索
过去Gemini处理视频,默认按1FPS(每秒一帧)把画面、音频、字幕一股脑摄入,视频越长,token账单涨得越猛。agentic video understanding换了打法:模型先粗扫一遍,自己判断该看哪一段、用什么速度看、看画面还是听音频,再调用内部工具精确拉取那一小块内容。
这套机制这次开放给Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite三款模型,通过Gemini API(Google AI Studio和Gemini Enterprise Agent Platform)用于视频上传和YouTube视频。开发者把处理方式设成"agentic"即可,计费仍按常规token费率走,官方说不额外收费。
它想解决的问题很具体:亚秒级的镜头切点、多小时录像里的一句关键台词、快速动作里的异常瞬间、重复出现的物体计数——这些在1FPS的固定采样下,原本容易被压缩或漏掉。
三个数字,不是一张账本
88%的token降幅、66%的成本降幅、7%的准确率提升,官方图表里都标着"up to"(最多)。第三方对官方评测的复盘提到,这些数字散落在几个不同的基准测试里——1H-VideoQA、LVBench/LongVideoBench、Minerva表现各不相同,其中Minerva的token节省幅度最小,准确率提升反而最大。三个"最多"分别来自不同考卷,不代表某一次查询能同时拿到88%+66%+7%的组合结果。
更容易被忽略的一点是:token减少88%,不等于账单减少88%。Agentic循环需要模型多次内部判断、多次调用视频工具,这些推理和输出token仍要计费——这也是为什么官方给出的成本降幅明显低于token降幅。
按官方文档的估算,默认分辨率下静态处理大约每秒消耗300 token,一小时视频的输入token量级能到108万。基数越大,省下来的百分比看起来越漂亮,但真正落到账单上的数字,还要看agentic循环本身多跑了多少轮判断,有没有配合上下文缓存分摊重复查询的成本。
省的是token,省不动的是那几轮内部判断的账。
挑着看的代价
Agentic的核心动作是"选择性观看":先粗扫,再精读。这套逻辑成立的前提,是粗扫阶段没有判断错。
独立研究VideoGAIA给出的数据不太乐观:在智能体式视频任务里,视频感知本身占了分析失败原因的37%到48%,是最大的单一错误来源;在更难的工具增强任务上,所有被测系统的准确率都没能超过60%。放到agentic video understanding的场景里,这意味着如果模型第一轮的字幕检索或粗扫描方向猜错,后面精读得再细,也是在错的地方细读——模糊提问、无字幕的静默画面、相似动作反复出现的场景,风险都会更高。
官方的开发者文档倒也没藏着这层顾虑:延迟敏感的场景,文档仍建议用静态模式而不是agentic。这句提醒本身就说明,token省了不等于响应变快——多轮内部工具调用的时间成本,官方没有给出端到端延迟数据。
- 风险.选择性观看依赖第一轮判断准不准,一旦粗扫方向错了,精读环节救不回来。
发布之后,已经有社区讨论盯上了官方那张成本-准确率对照图,质疑坐标轴和截断方式是否放大了对比效果——这类质疑目前停留在图表呈现层面,还没有独立复现的实测数据来验证或反驳。
该怎么测,而不是照单全收
这次早期反馈来自Ponder、Revyl、Mosaic、Resemble AI几家合作方,都是Google挑选的早期访问用户,说的是"体感不错",不是中立评测报告。
对普通开发者更实际的做法,是拿自己的长视频加精确查询场景做一次小规模对照:同一批视频,分别跑静态模式和agentic模式,记录准确率、召回率、总token账单和响应时间,而不是直接套用官方的66%或88%去做成本预测。官方文档里也留了个审计接口:agentic调用会暴露processing_call和processing_result两个中间步骤,开发者可以借此检查模型到底有没有真的"走到"该看的地方,还是猜对了答案却没看对位置。
如果视频经常被重复查询,或者单个文件超过10分钟,官方建议配合上下文缓存使用——这部分读取费用另算,是容易被漏算的一块隐藏成本。
把"决定看什么"这件事塞进推理循环,是这次更新里最实的一步——省流量、抓细节,方向没错。但88%、66%、7%三个数字凑在一起讲的是最好情况,不是平均水平,更不是你那份视频的真实账单。长视频、精确查询这类场景最值得先试,别急着按官方给的比例改预算。
