其它·via @mubei
语音模型的门槛,彻底塌了。 现在的竞争早就不在“能不能克隆声音”了。 而是怎么用5秒的样本、极低的成本,直接生成带情绪的…
语音模型的门槛,彻底塌了。
现在的竞争早就不在“能不能克隆声音”了。 而是怎么用5秒的样本、极低的成本,直接生成带情绪的对话。
Fish Audio刚拿到5200万美元种子轮融资。 直接推出了新一代语音模型S2.1 Pro。
发布方给出的账本很粗暴。 克隆一个人的声音,只需要5秒的音频。 他们称,新模型的速度比Cartesia快两倍。 成本却只有Eleven Labs的六分之一。
便宜还不是重点。 真正的杀器是情绪可控。 发布方称,这套模型做到了词级别的控制。 一句话里,每个词的情绪、语调、语速都能单独调节。
在客服场景里,一个接披萨店电话的AI,上一秒还在讲西班牙语,下一秒直接切英文接单。 面对几个顾客同时抢话点餐,它不卡壳。 连中途把中号披萨换成大号、外加五杯无糖可乐的零碎要求都能顺手改掉。 最后还能跟顾客确认名字的拼写。
发布方称,他们第一年已经支撑了1000万小时的配音和数亿次通话。 为了抢企业客户,他们直接放出话来。 如果不能把企业现有的语音AI成本砍掉一半。 直接免费提供一年的服务。