游乐游手机版
首页/AI热点日报/热点详情

微软开源TTS 1.9K星 90分钟超长语音合成 四人对话自然切换

类型:热点整理2026-07-22
微软开源VibeVoice模型,实现90分钟超长连续语音合成,支持最多4个说话人自然切换。采用连续语音分词器与7 5Hz超低帧率,兼顾效率与音质。提供1 5B与7B参数版本,支持中英文,MIT开源许可,适用于播客、有声书等场景。

在文本转语音(TTS)领域,生成长篇、多说话人的高质量音频——比如一档完整的播客节目——一直是个“老大难”问题。传统的TTS模型,无论ElevenLabs还是CosyVoice,大多受限于短序列生成(1-2分钟),或者只能处理1-2位说话人,面对复杂的多人对话场景往往力不从心。

不过,微软最近开源了一款名为 VibeVoice 的模型,直接打破了这些限制。它一次就能生成长达90分钟的连续语音,并且支持最多4个不同说话人自然切换。要知道,很多模型连同时搞定两个说话人都费劲,这波操作确实有点“王炸”的意思。

1.9K Star 微软开源TTS王炸!90分钟超长语音合成,4人对话自然切换!

VibeVoice的核心创新,在于它使用了连续语音分词器(同时处理声学与语义信息),并且在超低帧率7.5Hz下运行。这个思路非常巧妙:低帧率能大幅提升长序列的计算效率,而连续分词器则保证了音频的保真度。简单来说,就是既快又好。

这次微软提供了两个主要系列的模型,方便不同需求的开发者选择:

  • VibeVoice-1.5B:15亿参数,拥有64K上下文长度,能够生成约90分钟的音频。
  • VibeVoice-7B-Preview:70亿参数,拥有32K上下文长度,能够生成约45分钟的音频。

GitHub:https://github.com/microsoft/VibeVoice

亮点特性

  • 超长语音生成:一次生成90分钟连续语音,无需分段拼接,解决了一个核心痛点。
  • 多人对话支持:可同时生成4个不同说话人,自然衔接,非常适合播客、剧本对话场景。
  • 高质量与一致性:在说话人音色保持和语音轮转上,效果自然,听感接近真人对话。
  • 高效处理长序列:采用两个连续语音分词器,以7.5Hz超低帧率运行,在保证音质的同时提升计算效率。
  • 安全合规:模型输出自带AI声明水印,从源头避免被滥用。
  • 语言支持:目前支持中文和英文,覆盖了主流需求。
  • 开源协议:MIT许可证,开放自由度高,商用友好。

快速入手

微软官方已经上线了VibeVoice的Demo版本,可以直接在线体验。(需魔法)

Demo:https://86636c494bbddc69c7.gradio.live

有硬件条件的也可以在本地部署,以下是具体方案。

前置要求:

  • 支持CUDA的GPU(推荐以获得合理性能)
  • Python 3.8或更高版本
  • Docker(推荐用于环境管理)
  • 至少16GB内存(对于较大模型建议32GB)

部署方案 1:使用Docker(推荐)

推荐使用NVIDIA深度学习容器来管理CUDA环境:

# 启动 Docker 容器
sudo docker run --privileged --net=host --ipc=host --ulimit memlock=-1:-1 --ulimit stack=-1:-1 --gpus all --rm -it nvcr.io/nvidia/pytorch:24.07-py3

# 如果不包含 flash attention,请手动安装
# pip install flash-attn --no-build-isolation

部署方案 2:源码安装

# 克隆仓库
git clone https://github.com/microsoft/VibeVoice.git
cd VibeVoice/

# 安装软件包
pip install -e .

实际用法

用法1:启动Gradio演示

apt update && apt install ffmpeg -y # for demo

# For 1.5B model
python demo/gradio_demo.py --model_path microsoft/VibeVoice-1.5B --share

# For 7B model
python demo/gradio_demo.py --model_path WestZhang/VibeVoice-Large-pt --share

该方式将启动网页服务,需要下载VibeVoice模型并准备好语音样本。它会自动扫描demo/voices目录中的语音文件,并从demo/text_examples加载示例脚本。

用法2:直接从文件中进行推理

# We provide some LLM generated example scripts under demo/text_examples/ for demo
# 单说话人
python demo/inference_from_file.py --model_path WestZhang/VibeVoice-Large-pt --txt_path demo/text_examples/1p_abs.txt --speaker_names Alice

# 多说话人
python demo/inference_from_file.py --model_path WestZhang/VibeVoice-Large-pt --txt_path demo/text_examples/2p_music.txt --speaker_names Alice Yunfan

应用场景

从实际落地来看,VibeVoice的应用方向非常清晰:

  • 播客/有声书:长篇内容一键生成,多角色自然对话,是内容创作者的利器。
  • 新闻/讲解类视频:低成本自动生成解说音频,极大提升生产效率。
  • 教育场景:课程讲解、语言学习音频生成,让内容更生动。
  • 剧本创作:模拟不同人物对话,快速听感验证,帮助创作者打磨作品。

写在最后

VibeVoice是一个前沿框架,专为从文本生成富有表现力、长篇幅、多说话人的对话音频而设计。它解决了传统TTS系统在可扩展性、说话人一致性以及对话自然轮换方面的重大挑战。对于需要长时连续音频的场景,以及广大的开发者和内容创作者来说,这无疑是一个极具潜力的开源工具。

来源:https://www.53ai.com/news/OpenSourceLLM/2025082830695.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。