AI音频语音合成

VoxCPM

VoxCPM是面壁智能开源的新一代语音合成大模型,采用无分词器(Tokenizer-Free)的端到端扩散自回归架构,直接生成连续语音表征。模型拥有20亿参数,基于超200万小时多语种数据训练...

标签:

VoxCPM 是面壁智能开源的新一代语音合成(TTS)模型,定位为”创造富有表现力的 AI 语音”,覆盖情感有声书、游戏角色配音与多语言语音生成等场景。模型采用无离散音频分词器(Tokenizer-Free)的端到端扩散自回归架构,直接生成连续语音表征,绕过音频离散编码步骤。最新版本 VoxCPM2 基于 MiniCPM-4 基座构建,总计 20 亿参数,在超过 200 万小时的多语种音频数据上训练,支持 30 种全球语言与 9 种中文方言,原生输出 48kHz 高质量音频;权重与代码基于 Apache-2.0 协议发布,可免费商用。

VoxCPM 的核心功能

  • 多语言语音合成: 支持 30 种全球语言与 9 种中文方言,直接输入原始文本即可合成,无需额外语言标签。
  • 音色设计: 通过自然语言描述(性别、年龄、音色、情绪、语速等)凭空创建全新音色,无需提供参考音频。
  • 可控声音克隆: 从参考音频片段克隆任意声音,可叠加风格指令控制情绪、语速与表现力,同时保持原始音色;提供参考音频及文本内容时,模型可接续参考音频无缝续写,精准还原声音细节。
  • 48kHz 高质量音频与实时流式合成: 输入 16kHz 参考音频,通过 AudioVAE V2 非对称编解码设计直接输出 48kHz 高质量音频,内置超分能力;支持语境感知合成,根据文本内容自动推断韵律与表现力。官方基准实时因子(RTF)为 0.17,在 NVIDIA RTX 4090 上流式合成 RTF 低至约 0.3,经 vLLM 加速后可低至约 0.13。

VoxCPM 的典型应用场景

  • 有声书与内容创作: 支持快速生成声音一致的高质量有声书,并为视频配音、播客制作提供专业语音解决方案。
  • 语言学习与无障碍应用: 支持多语种口音训练的个性化语音教学,并为视障人士提供个性化阅读体验等无障碍应用。

特别声明

关于VoxCPM特别声明

本站AI标签页提供的VoxCPM都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由AI标签页实际控制,在2026年 8月 21日 17:54收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,AI标签页不承担任何责任。

相关导航