微软开源 VibeVoice:一次生成90分钟多人语音 声音越来越像真人了

如果你经常听播客、有声书,或者做视频配音,应该会发现一个问题:AI 配音已经能读出来,但离真正像人在聊天,还有一段距离。

很多语音模型短句表现不错,可一旦让它连续说几分钟,就容易出现声音僵硬、语气重复、角色混乱的问题。尤其是多人对话场景,AI 往往很难保持每个人的声音特点。

微软开源的 Microsoft VibeVoice,就是冲着这个问题来的。它不是简单的文字转语音工具,而是一套面向长文本、多角色对话的语音 AI 模型。项目定位是“开放式语音 AI”,包含文本转语音(TTS)和语音识别(ASR)两大方向。

GitHub项目地址:https://github.com/microsoft/VibeVoice

微软 VibeVoice 开源语音 AI 架构图:展示 TTS(90分钟超长生成/4角色对话)与 ASR(60分钟识别/说话人区分)核心功能

最吸引人的地方,是它能生成非常长的连续语音。

传统 TTS 模型通常更适合生成几句话,比如导航播报、短视频配音。但 VibeVoice-TTS 可以根据一篇长文章生成接近完整节目的音频,支持最长约 90 分钟的语音生成,并且可以让最多 4 个不同角色参与对话。简单理解,就是你给它一份访谈稿,它可以直接变成一档多人聊天节目。

这个能力对于内容创作者来说挺有想象空间。

比如你有一篇公众号文章,不想自己录音,可以让 AI 转成播客;一本电子书,可以快速生成有声版本;甚至一份产品介绍,也能变成两个 AI 主持人的讨论节目。

当然,VibeVoice 的重点并不是“把文字念出来”,而是让声音更接近真实交流。

它采用了一套针对长语音设计的方法,把声音拆成更容易处理的语音信息,再结合类似大语言模型理解上下文的方式生成语音。这样做的好处是,AI 不只是关注当前一句话,而是能记住前面的内容,让整个长对话保持连贯。


除了 TTS,VibeVoice 还有语音识别模型 VibeVoice-ASR。

这个方向解决的是“听懂声音”的问题。普通语音转文字工具处理会议、访谈时,经常需要把长音频切成很多小段,再分别识别,容易丢失上下文。VibeVoice-ASR 可以一次处理最长约 60 分钟的长音频,同时输出“谁说的、什么时候说的、说了什么”,还支持多语言和自定义关键词。

对于会议记录、播客整理、采访分析这些场景,这种能力比单纯转文字更实用。

从开发者角度看,VibeVoice 也比较有吸引力。项目采用 MIT 开源许可证,代码和模型资料公开,提供不同规模版本。其中实时语音版本 VibeVoice-Realtime-0.5B 参数量更小,目标是降低部署成本,让语音生成更接近实时应用。

Microsoft VibeVoice 模型架构图:结合多角色 Voice Prompt 与 Text Script,通过 Diffusion Head 自回归生成 90 分钟长语音

长语音生成虽然是优势,但 AI 声音依然可能出现一些细节问题,比如情绪变化不够自然、某些发音不稳定。另外,本地运行这类模型对显卡配置有一定要求,普通用户想直接安装体验,需要了解一些 Python、模型部署相关知识。

整体来看,VibeVoice 更像是微软对未来语音交互的一次探索。

以前 AI 配音更像“机器朗读”,而这类模型正在往“AI 主持人”“AI 播客制作人”的方向靠近。对于普通用户来说,它可能还需要一点技术门槛;但对于开发者和内容创作者来说,这已经是一个值得关注的新工具。

GitHub项目地址:https://github.com/microsoft/VibeVoice


Previous Post
No Comment
Add Comment
comment url