其它·via @mubei
把声音转成字,早就不稀奇了。 但转录一小时的长音频,最难的根本不是认字。 是认人。 你要在60分钟的多人对话里,精准追踪…
把声音转成字,早就不稀奇了。 但转录一小时的长音频,最难的根本不是认字。 是认人。 你要在60分钟的多人对话里,精准追踪谁在什么时间说了什么,而且上下句得连得上。
以前的常规操作,是把长音频切碎,一段段去处理。 切块的代价是,跨段落的时候上下文容易丢,说话人的身份容易张冠李戴。
微软刚出了个新工具,叫 VibeVoice。 这个 7B(70亿参数)的模型解决问题的方法很直接:不切分。 它直接把整整一小时的录音,一次性全吞进去。
把所有声音放进同一个处理窗口,一气呵成。 这样一来,说话人身份的追踪和上下文,就再也不会在段落切换时发生断裂了。
翻译视频 / X
相关 / RELATED
JSON- M语音模型的门槛,彻底塌了。 现在的竞争早就不在“能不能克隆声音”了。 而是怎么用5秒的样本、极低的成本,直接生成带情绪的…
- M语音克隆的门槛,终于降到了你的本地显卡上。 开源工具 Voice Clone Lab,直接把声音克隆变成了一条傻瓜式的本…
- MCtrl+F,终于用进了声音文件。 面对一段长录音,以前只能硬着头皮听,或者疯狂拖进度条。 现在,找声音变成了文字检索。…
- M想把一段视频加速两倍,你会怎么做? 打开剪辑软件,导入,调速,导出。 现在呢?丢给 AI 智能体,打一行字。 搞定。 智…
- M如今,声音已经不再是你的身份凭证了。 给所有人提个醒: 以后在电话里听到熟悉的声音,哪怕是你的父母、子女或老板,也千万别…
- M不用张嘴,不用打字。 你在心里默念一句话,对坐的人能一字不差地“听”到。 然后他用同样的无声方式回复你。 Joe Rog…
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封信号简报,重大进展可选即时推送。