Memory

Home Memory
- Advertisement -
Google search engine

APPLICATIONS

HOT NEWS

微软开源 VibeVoice:一次生成90分钟多人语音 声音越来越像真人了

0
如果你经常听播客、有声书,或者做视频配音,应该会发现一个问题:AI 配音已经能读出来,但离真正像人在聊天,还有一段距离。 很多语音模型短句表现不错,可一旦让它连续说几分钟,就容易出现声音僵硬、语气重复、角色混乱的问题。尤其是多人对话场景,AI 往往很难保持每个人的声音特点。 微软开源的 Microsoft VibeVoice,就是冲着这个问题来的。它不是简单的文字转语音工具,而是一套面向长文本、多角色对话的语音 AI 模型。项目定位是“开放式语音 AI”,包含文本转语音(TTS)和语音识别(ASR)两大方向。GitHub项目地址:https://github.com/microsoft/VibeVoice最吸引人的地方,是它能生成非常长的连续语音。 传统 TTS 模型通常更适合生成几句话,比如导航播报、短视频配音。但 VibeVoice-TTS 可以根据一篇长文章生成接近完整节目的音频,支持最长约 90 分钟的语音生成,并且可以让最多 4 个不同角色参与对话。简单理解,就是你给它一份访谈稿,它可以直接变成一档多人聊天节目。 这个能力对于内容创作者来说挺有想象空间。 比如你有一篇公众号文章,不想自己录音,可以让 AI 转成播客;一本电子书,可以快速生成有声版本;甚至一份产品介绍,也能变成两个 AI 主持人的讨论节目。 当然,VibeVoice 的重点并不是“把文字念出来”,而是让声音更接近真实交流。 它采用了一套针对长语音设计的方法,把声音拆成更容易处理的语音信息,再结合类似大语言模型理解上下文的方式生成语音。这样做的好处是,AI 不只是关注当前一句话,而是能记住前面的内容,让整个长对话保持连贯。除了 TTS,VibeVoice 还有语音识别模型...