
AI 看视频,以前是个笨办法。
一帧一帧拆开,从头扫到尾。1秒抽1帧,一小时视频就是3600张图,全塞给模型硬啃。
费钱,费时间,还经常看跑偏。
9月1日,Google 换了个思路。Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite 上线了「智能体视频理解」(Agentic Video Understanding)。
说白了,让 AI 自己决定「看哪、看多快、用什么看」。
是看画面帧,还是听音频,还是直接读字幕——它自己挑。该看的重点多看两眼,无关的片段直接跳过,只抓自己需要的瞬间。
效果很直接:Token 最多省 88%,分析成本最多降 66%,准确率反而还高了一点。
以前是「无差别扫描」,现在是「带着目的去检索」。AI 从「看完」,变成了「看懂」。
这个变化值得多说两句。
过去几年,大模型都在卷「上下文越长越好」,恨不得一秒装下一整个世界。结果就是:能装,但贵。
现在风向悄悄变了——不是比谁能塞进更多信息,而是比谁能用更少的信息,干成同一件事。
对普通用户来说,最直观的感受是两个字:便宜。
以后想让人工智能分析一段长视频、会议记录、监控回放,花的钱可能只有原来的零头,速度还更快。
AI 看得懂视频,才算真正开始「看世界」。
这才是这场更新最值钱的地方。
留言 0
还没有留言,快来抢沙发