如果你还在用真人录音做视频配音,一个月花几百上千块买音色包,那你真的该看看这个项目了。GitHub 上 34.8K Stars 的 VoxCPM 刚刚更新到 VoxCPM2,直接用文字描述就能造一个全新声音,还能克隆任何人的嗓音,全部开源免费可商用。
VoxCPM 是 OpenBMB(清华系开源组织)推出的语音合成系统,最特别的地方是它不用 tokenizer,直接通过端到端的扩散自回归架构生成连续语音表征,绕开了离散 token 化,语音听感自然得多。最新版 VoxCPM2 是 2B 参数模型,训练数据超过 200 万小时多语言语音,支持 30 种语言和 48kHz 录音室级音质输出。
三个功能直接拉开差距
第一,声音设计。 不需要任何参考音频,直接用括号写一句自然语言描述:「(一位年轻女性,温柔甜美的声音)你好,欢迎使用VoxCPM2」,它就能凭空造出一个符合描述的声音。性别、年龄、音色、情绪、语速都能控制。这个能力在开源 TTS 里独一份,其他项目基本都要录一段参考音频。
第二,可控语音克隆。 给一段 5 秒参考音频,它克隆音色,同时你还能用指令调节语速、情绪、风格。比如「(稍微快一点,欢快的语气)今天天气真好」,克隆的声音照样能带情绪。
第三,终极克隆。 同时提供参考音频和它的转写文本,模型能做到从参考音频无缝续接,音色、节奏、情绪、风格全部还原。这个模式跟 VoxCPM1.5 一脉相承,相似度最高。
30 种语言,连中文方言都有
VoxCPM2 支持阿拉伯语、英语、日语、韩语、泰语、越南语等 30 种语言,直接输入对应语言的文本就行,不用加语言标签。更难得的是中文方言覆盖了 9 种:四川话、粤语、吴语、东北话、河南话、陕西话、山东话、天津话、闽南话。做方言配音、本地化内容,这个优势没几个开源项目能比。
性能:跑得快,还省显存
在 NVIDIA RTX 4090 上,标准 PyTorch 推理 RTF 约 0.3(1 秒音频约 0.3 秒生成),已经接近实时。用 Nano-vLLM 或 vLLM-Omni 加速后 RTF 能降到 0.13,还支持批量并发请求和 OpenAI 兼容 API。显存占用约 8GB,主流显卡基本都能跑。想部署到边缘设备也有方案,llama.cpp-omni 支持 CPU/Metal/CUDA/Vulkan 推理,苹果 M4 Pro 上 RTF 约 1.76(Q8_0 量化)。
语音质量在公开评测里也是第一梯队。Seed-TTS-eval 基准上,中文 WER 0.97%、英文 1.84%,声音相似度 SIM 中文 79.5%、英文 75.3%,和闭源的 CosyVoice3、Seed-TTS 打得有来有回,但 VoxCPM2 是开源的。
上手很简单
安装就一条命令:pip install voxcpm。然后几行 Python 就能合成语音、做声音设计、克隆声音,还支持流式生成和批量处理。也可以直接跑官方的 Web Demo(python app.py --port 8808)体验。权重在 HuggingFace 和 ModelScope 都能下载,国内用户走 ModelScope 更快。
不是没有槽点
首先是硬件门槛,2B 模型虽然只要 8GB 显存,但纯 CPU 跑会很慢,想流畅用还是得有一张像样的显卡。其次语言覆盖虽然到 30 种,但小语种的合成质量跟中英文还是有差距,官方评测里阿拉伯语、罗马尼亚语这类语言的 WER 明显偏高。最后,零样本克隆音色相似度很高,用的时候注意别拿别人声音做不当用途。
跟同类比,怎么选
开源语音合成赛道现在很卷:CosyVoice2/3 是阿里的,中文表现稳但多语言弱。FishAudio S2 多语言 WER 极低,但 4B 参数更重。GPT-SoVITS 适合少样本中文克隆,音质一般。F5-TTS 轻量,相似度偏低。VoxCPM2 的优势是综合能力最均衡,多语言、声音设计、可控克隆、48kHz 音质、8GB 显存、Apache-2.0 协议随便商用,这些叠在一起,现阶段没有第二个开源项目能同时做到。
我的建议:做多语言内容、想给视频/播客造专属声音、或者想本地部署 TTS 服务的人,直接上 VoxCPM2 就对了。它是那种「装完就再也回不去」的工具。
GitHub:github.com/OpenBMB/VoxCPM
官方网站:voxcpm.com
在线体验:HuggingFace Demo
标签:#VoxCPM #语音合成 #TTS #声音克隆 #声音设计 #多语言 #OpenBMB #开源工具
关注我,每期分享一个帮你省事的强大工具 🛠️