谷歌发布智能视频理解 API(Agentic video understanding)
以前 AI 看视频很笨,就像一个人拿着秒表,每隔一秒硬截一张图,不管画面有没有变化都要一张张硬看下去。这种做法耗费资源、速度慢、费用贵,遇到几个小时的长视频还特别容易漏掉细节。
新的 API 让 Gemini 像人一样看视频。它可以自己拿主意:什么时候该快进、什么时候该慢放倒带仔细看,甚至能决定只听声音、看字幕还是专门看画面,有针对性地去找内容。算力消耗节约九成,使用成本降低一半,找答案的准确率反而更高。
适用场景:
亚秒级瞬间检索:能精准定位视频画面的状态变化和紧凑的镜头剪辑边界,从而让精确的自动化视频剪辑成为可能。
长视频大海捞针搜索:无需消耗数百万个 Token,即可在长达数小时的视频中回答复杂的问题。
异常检测:以更高的帧率对关键的时间窗口重新采样,以此检查快速运动与细微的视觉瑕疵。
动作与物体计数:随着时间推移,准确追踪重复的肢体动作以及不同的物体。
看演示视频的数动作次数,还是非常惊艳的。
目前只能通过调用API使用,后续这部分能力会上线YouTube的Ask YouTube模块。
官方介绍:
显示更多