🧪 模型发布AI 热点解读#Gemini#视频理解#Agent
Gemini「Agentic Video」:视频理解 token 降 88%、成本降 66% 的工程魔法
Google 发布 Agentic Video:视频分析 token 消耗降 88%、成本降 66%、质量升 7%——长视频 Agent 的成本墙被拆掉一段。
AIAI评测 编辑部
一句话结论
Google 发布的「Agentic Video」证明了「少看」比「全看」更聪明:视频理解通过 Agent 化抽样与聚焦帧分析,token 消耗最高降 88%、成本降 66%、质量反升 7%——长视频建模的成本墙被拆掉一大段。
三个关键点
1. 工程范式:别全帧硬啃
「逐帧全量喂」是长视频的天价方案;Agentic Video 让模型先粗筛再聚焦——token 花在值得看的地方,这是成本下降的根本。
2. 对 RAG/Agent 的溢出
视频 RAG、监控/长直播分析、会议纪要的视频侧——凡「视频进 Agent 上下文」的场景成本结构都会重构,多模态 Agent 的下一个口袋被打开。
3. 竞争坐标
同期 fal 视频生成快于实时、视频理解 side 也在卷成本——「每 token/每帧成本」成为多模态 2026 下半年的核心指标。
💡 常见问题
Agentic Video 是什么?▾
Google 面向 Gemini 3.7/3.6 Flash 等的「视频理解 Agent 化」能力:通过主动抽样与聚焦帧理解,大幅压缩 token 与成本。
对普通用户有什么感知?▾
长视频问答/Agent 场景更便宜、更快——应用层(视频检索、监控分析、内容理解)成本痛点下降明显。