
字节跳动又放了个大招。
8月6日,字节发布原生音视频全双工大模型SeedRealtime。说人话就是:AI能实时听你说话、看你表情、同时跟你自然对话,不再是一问一答的机器人。
这不是简单的「语音助手多了个摄像头」。SeedRealtime原生支持音频和视频的流式输入输出,端到端延迟极低。你说话时它能听懂,你沉默时它能看懂你的表情,还能随时插话、追问、打断。
过去的AI对话像发电报,你说一句它回一句。SeedRealtime把对话变成了真正的人在聊天。
为什么这事值得关注?
第一,字节踩准了「多模态实时交互」这个赛道。OpenAI的GPT-5o、谷歌的Gemini都在往这个方向走,但字节这次是原生音视频全双工,不是先转文字再处理的老路。
第二,字节有场景。抖音、飞书、剪映,随便哪个产品接入SeedRealtime,想象力都很大。想象一下:剪映里AI看你的视频素材,边看边给你剪辑建议;飞书会议上AI实时总结,还能读懂与会者的表情判断情绪。
第三,这是字节在基础模型上的一次实质性亮剑。之前字节在大模型竞赛中声音不大,SeedRealtime说明他们不是没干活,是在憋大招。
当然,SeedRealtime目前还没全面开放,具体体验如何还待验证。但方向很清晰:AI的下一个战场不在「能不能答对题」,而在「能不能像人一样感知和交流」。
当AI学会边看边聊,屏幕那头的,可能就真的不像机器了。
留言 0
还没有留言,快来抢沙发