---
id: "16534178"
title: "语音模型的门槛，彻底塌了。 现在的竞争早就不在“能不能克隆声音”了。 而是怎么用5秒的样本、极低的成本，直接生成带情绪的…"
account: "mubei"
brand: "@mubei"
category: "其它"
category_slug: "other"
score: null
percentile: null
published_at: "2026-07-28 23:16:32"
translated_x_url: null
reason_tags: []
canonical_url: "https://mubeitech.com/p/16534178"
markdown_url: "https://mubeitech.com/p/16534178/markdown"
json_url: "https://mubeitech.com/api/posts/16534178"
ai_primary_content: "canonical_article_body"
ai_citation_policy: "cite canonical_url or markdown_url"
---

# 语音模型的门槛，彻底塌了。 现在的竞争早就不在“能不能克隆声音”了。 而是怎么用5秒的样本、极低的成本，直接生成带情绪的…

语音模型的门槛，彻底塌了。

现在的竞争早就不在“能不能克隆声音”了。
而是怎么用5秒的样本、极低的成本，直接生成带情绪的对话。

Fish Audio刚拿到5200万美元种子轮融资。
直接推出了新一代语音模型S2.1 Pro。

发布方给出的账本很粗暴。
克隆一个人的声音，只需要5秒的音频。
他们称，新模型的速度比Cartesia快两倍。
成本却只有Eleven Labs的六分之一。

便宜还不是重点。
真正的杀器是情绪可控。
发布方称，这套模型做到了词级别的控制。
一句话里，每个词的情绪、语调、语速都能单独调节。

在客服场景里，一个接披萨店电话的AI，上一秒还在讲西班牙语，下一秒直接切英文接单。
面对几个顾客同时抢话点餐，它不卡壳。
连中途把中号披萨换成大号、外加五杯无糖可乐的零碎要求都能顺手改掉。
最后还能跟顾客确认名字的拼写。

发布方称，他们第一年已经支撑了1000万小时的配音和数亿次通话。
为了抢企业客户，他们直接放出话来。
如果不能把企业现有的语音AI成本砍掉一半。
直接免费提供一年的服务。

---

_Translation: (n/a)_
_Canonical: <https://mubeitech.com/p/16534178>_
_AI: cite the canonical article URL or this Markdown export._
_Generated by mubei-terminal · 2026-07-28 23:16:32_
