其它·via @mubei
语音模型的门槛,彻底塌了。 现在的竞争早就不在“能不能克隆声音”了。 而是怎么用5秒的样本、极低的成本,直接生成带情绪的…
语音模型的门槛,彻底塌了。
现在的竞争早就不在“能不能克隆声音”了。 而是怎么用5秒的样本、极低的成本,直接生成带情绪的对话。
Fish Audio刚拿到5200万美元种子轮融资。 直接推出了新一代语音模型S2.1 Pro。
发布方给出的账本很粗暴。 克隆一个人的声音,只需要5秒的音频。 他们称,新模型的速度比Cartesia快两倍。 成本却只有Eleven Labs的六分之一。
便宜还不是重点。 真正的杀器是情绪可控。 发布方称,这套模型做到了词级别的控制。 一句话里,每个词的情绪、语调、语速都能单独调节。
在客服场景里,一个接披萨店电话的AI,上一秒还在讲西班牙语,下一秒直接切英文接单。 面对几个顾客同时抢话点餐,它不卡壳。 连中途把中号披萨换成大号、外加五杯无糖可乐的零碎要求都能顺手改掉。 最后还能跟顾客确认名字的拼写。
发布方称,他们第一年已经支撑了1000万小时的配音和数亿次通话。 为了抢企业客户,他们直接放出话来。 如果不能把企业现有的语音AI成本砍掉一半。 直接免费提供一年的服务。
翻译视频 / X
相关 / RELATED
JSON- M语音克隆的门槛,终于降到了你的本地显卡上。 开源工具 Voice Clone Lab,直接把声音克隆变成了一条傻瓜式的本…
- M大模型竞争的风向变了。 不拼跑分,开始往死里卷价格。 GPT-5.6系列大降价。 轻量级的Luna模型,价格一口气砍掉8…
- M把声音转成字,早就不稀奇了。 但转录一小时的长音频,最难的根本不是认字。 是认人。 你要在60分钟的多人对话里,精准追踪…
- M中共国近日发布了开源模型 GLM 5.2,性能直逼 OpenAI 和 Anthropic 的顶尖闭源模型。 这事让美国的…
- M跨过同样的营收门槛,谷歌当年养了12万名员工。 Anthropic只用了2500人。 外界疯传大模型是个烧钱的无底洞。…
- M最怕的鬼故事还是发生了:AI 正在变成像内存、硬盘一样的“大路货”。 过去两年,资本市场听饱了“最强模型”的神话。 但现…
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封独立、不受审查的科技与 AI 深度评论与信号,周一发出。