
一个叫 Cartesia 的公司,悄悄把 AI 语音的天花板顶了一下。
本周,它发布了新一代语音模型 Sonic-3.6。官方说法有点抽象,说人话就是:AI 开口说话,越来越像人了。
最夸张的数据是一个:在 15 个地区的盲测里,最高有 93% 的人觉得它比其他 AI 声音更好听。跟业内标杆比,92% 的人投了它。
这意味着什么?意味着在"像人"这件事上,AI 已经把门槛拉到普通耳朵分辨不出来的程度。
它能干什么?44 种语言,61 个地区口音,500 多个预置声音。还会中英混说——一句话里中英文来回切,不像以前那样卡壳。
延迟不到 90 毫秒。快到什么程度?你说完,它几乎同时接上。真人打电话也就是这个节奏。
生成速度还快了近一倍。以前要等几秒,现在基本是即时出活。
这家公司给自己的定位是"企业级"。99.9% 的可用性承诺,SOC 2、HIPAA 这些合规证书也配齐了。意思是:别把它当玩具,它准备进生产环境了。
说点我的看法。
AI 卷完文本、卷图片、卷视频,现在轮到声音。但真正值得注意的是一个趋势:AI 的声音,正从"能说"变成"像人"。语音助手、客服、有声书,甚至虚拟人,很快都要换血。
而判断标准也朴素得很——你听不出来它是机器,它就赢了。
这轮竞赛,比的不再是谁的音色好听,而是谁先让人忘记自己在跟 AI 说话。
以后的客服电话、播客、甚至骚扰电话,可能都分不出真假。技术是好技术,可声音太像人,既是福音,也是麻烦。
还是那句老话:技术无罪,关键看谁在用。
留言 0
还没有留言,快来抢沙发