AI终于会“插话”了:这一回,它边听边说

j
jxgzhc
52分钟前 3 分钟阅读

AI终于会“插话”了:这一回,它边听边说

以前跟AI说话,总有一种”对暗号”的感觉。

你说完一句,它愣一下,才慢悠悠开口。你话还没说完它就开始答,答完了,你反倒插不上嘴。

不是它笨,是它没长”耳朵”。

传统的语音AI,是一条流水线:先把你说的转成文字,再用大模型想答案,最后合成语音念出来。三步三班岗,每交接一次就掉一次拍子。所以它总得等你说完才敢动,你中途一插嘴,它就当没听见。

但9月10日,OpenAI把新语音模型GPT-Live-1放进了API。核心就一个字:急。

不对,是”全”——全双工。

它一边听你说话,一边自己开口。你插话,它马上让位;你停顿,它不催;你改主意,它跟着改。像跟真人聊天,不像跟对讲机说话。

这是AI语音从”回合制”到”即时制”的一次质变。

几个细节值得看。

第一,三步并一步。识别、思考、合成,以前是三个模型接力,现在一个模型全包了。官方评测里,响应时间从1.41秒压到0.798秒,挤进亚秒级。

第二,脑子被拆出去了。动嘴皮子的活儿它来,需要推理、查资料的活儿,甩给后端的GPT-6 Astra这类强模型。一个管嘴,一个管脑,互不耽误。

第三,便宜。语音层每分钟5美分,一小时差不多3美元、折合人民币20来块,按秒计费,后端另算。这个价,意味着语音客服、订座电话这类场景,真的用得起、也敢用了。

已经有公司在用。

语言学习平台Speak说,学生思考时被打断的次数少了近80%。有医疗平台把代码砍了80%,直接删掉2万3千行。

也就是说,AI接电话这事,从”能说”进化到了”会聊”。

OpenAI还顺手给AI添了一排新嗓子:Quartz、Vesper、Willow……一共12种声音,各种口音和语感随便挑。

看到这儿你可能想问:它跟我有啥关系?

关系大了。

餐馆订座、银行客服、外卖催单、电话回访……那些让你抱着电话排队等半天的”接不上气”的客服,以后对面很可能就是它,而且它还不让你等。

更要紧的是,这不是OpenAI一家在卷。谷歌、字节都在往实时语音上加码。谁先把话说进你心坎里,谁就抢到下一批用户的入口。

PC时代我们敲键盘,手机时代我们点屏幕。

下一个时代,可能是开口说话。

这一次,AI终于把耳朵竖起来了。