{"id":"16534178","account":"mubei","brand":"@mubei","title":"语音模型的门槛，彻底塌了。 现在的竞争早就不在“能不能克隆声音”了。 而是怎么用5秒的样本、极低的成本，直接生成带情绪的…","summary":"语音模型的门槛，彻底塌了。 现在的竞争早就不在“能不能克隆声音”了。 而是怎么用5秒的样本、极低的成本，直接生成带情绪的对话。 Fish Audio刚拿到5200万美元种子轮融资。 直接推出了新一代语音模型S2.1 Pro。 发布方给出的账本很粗暴。 克隆一个人的声音，只需要5秒…","body":"语音模型的门槛，彻底塌了。\n\n现在的竞争早就不在“能不能克隆声音”了。\n而是怎么用5秒的样本、极低的成本，直接生成带情绪的对话。\n\nFish Audio刚拿到5200万美元种子轮融资。\n直接推出了新一代语音模型S2.1 Pro。\n\n发布方给出的账本很粗暴。\n克隆一个人的声音，只需要5秒的音频。\n他们称，新模型的速度比Cartesia快两倍。\n成本却只有Eleven Labs的六分之一。\n\n便宜还不是重点。\n真正的杀器是情绪可控。\n发布方称，这套模型做到了词级别的控制。\n一句话里，每个词的情绪、语调、语速都能单独调节。\n\n在客服场景里，一个接披萨店电话的AI，上一秒还在讲西班牙语，下一秒直接切英文接单。\n面对几个顾客同时抢话点餐，它不卡壳。\n连中途把中号披萨换成大号、外加五杯无糖可乐的零碎要求都能顺手改掉。\n最后还能跟顾客确认名字的拼写。\n\n发布方称，他们第一年已经支撑了1000万小时的配音和数亿次通话。\n为了抢企业客户，他们直接放出话来。\n如果不能把企业现有的语音AI成本砍掉一半。\n直接免费提供一年的服务。","category":"其它","score":null,"percentile":null,"reason_tags":[],"translated_x_url":null,"translated_status_id":null,"published_at":"2026-07-28 23:16:32","created_at":"2026-07-29T01:04:27+02:00"}