🧪 模型发布AI 热点解读#Gemini#视频理解#Agent

Gemini「Agentic Video」:视频理解 token 降 88%、成本降 66% 的工程魔法

Google 发布 Agentic Video:视频分析 token 消耗降 88%、成本降 66%、质量升 7%——长视频 Agent 的成本墙被拆掉一段。

AIAI评测 编辑部

一句话结论

Google 发布的「Agentic Video」证明了「少看」比「全看」更聪明:视频理解通过 Agent 化抽样与聚焦帧分析,token 消耗最高降 88%、成本降 66%、质量反升 7%——长视频建模的成本墙被拆掉一大段。

三个关键点

1. 工程范式:别全帧硬啃

「逐帧全量喂」是长视频的天价方案;Agentic Video 让模型先粗筛再聚焦——token 花在值得看的地方,这是成本下降的根本。

2. 对 RAG/Agent 的溢出

视频 RAG、监控/长直播分析、会议纪要的视频侧——凡「视频进 Agent 上下文」的场景成本结构都会重构,多模态 Agent 的下一个口袋被打开

3. 竞争坐标

同期 fal 视频生成快于实时、视频理解 side 也在卷成本——「每 token/每帧成本」成为多模态 2026 下半年的核心指标

分享:🐦 X📣 微博

💡 常见问题

Agentic Video 是什么?

Google 面向 Gemini 3.7/3.6 Flash 等的「视频理解 Agent 化」能力:通过主动抽样与聚焦帧理解,大幅压缩 token 与成本。

对普通用户有什么感知?

长视频问答/Agent 场景更便宜、更快——应用层(视频检索、监控分析、内容理解)成本痛点下降明显。

📌 更多热点解读