• 语音合成
  • 音色克隆
  • 多语言
  • 长篇语音
  • 发音控制

MOSS-TTS

MOSS-TTS v1.5 是面向长篇与多语言内容的旗舰语音生成模型,支持 31 种语言、零样本音色克隆与音频续写。通过细致的发音、时长和停顿控制,为旁白、配音与有声内容带来自然连贯、音色一致的语音。

作者
OpenMOSS Team
版本
v1.5
开源许可
Apache 2.0

我们正式推出新一代旗舰级文本转语音模型(Text-to-Speech,TTS)。它不是只为了做出好看的 Demo,而是面向真实产品环境打造:可以上线、可以扩展、可以切实提升用户和业务的生产力。作为一个真正的语音基座模型,它在可商用性、开源友好度与研究价值等方面都达到了行业领先水准。

在设计上,我们围绕语音生成最关键的三大要素展开:高质量的音频离散编码器(tokenizer)、大规模且高质量多样化的预训练数据,以及高效的离散 token 建模方法。这三者的组合,让模型在保持架构尽可能简洁(自回归范式)的同时,依然能够达到一流的生成效果——结构尽量简单,效果尽可能强。

模型概述

该模型在客观和主观评测中均达到了业界领先的语音合成质量,以语音克隆为核心能力,支持超长稳定语音生成、token级别的时长控制、多语言和代码切换合成,以及细粒度的拼音/音素级别发音控制——使其成为可扩展语音应用的生产级基础。

在核心层面,我们的模型通过三个最关键的因素实现语音生成的突破:高质量的音频tokenizer、大规模高质量且多样化的预训练数据,以及高效的离散token建模方法。这些要素结合在一起,让我们用一个出人意料简洁的配方达到了业界领先的性能:简单的自回归范式——架构尽可能精简,效果却强大有力。

以下是 MOSS Audio Tokenizer 的架构图:

MOSS Audio Tokenizer

MOSS Audio Tokenizer Architecture

MOSS Audio Tokenizer 是一个基于 Cat (Causal Audio Tokenizer with Transformer) 架构的 1.6B 参数量的音频 tokenizer。该模型旨在为自回归音频大模型提供统一的离散化音频接口,兼具无损重构能力与卓越的音频-文本语义对齐性能。详细细节请见 MOSS Audio Tokenizer。

以下是 MOSS-TTS 中使用的两种架构示意图。

Delay Pattern Vs. Local Transformer

MOSS-TTS Architecture - Scalable Cloud & Efficient Edge Deployment

为兼顾真实业务落地与学术研究,MOSS-TTS 选择同时训练并开源两套互补架构。左:Delay-Pattern(MossTTSDelay)。右:Global Latent + Local Transformer(MossTTSLocal)。详细细节请见 MOSS-TTS。

Benchmark

LibriSpeech 语音评测指标(MOSS Audio Tokenizer vs. 开源 Tokenizer)

下图对比了我们自研的 MOSS Audio Tokenizer 与其他开源语音 tokenizer 在 LibriSpeech test-clean子集上的表现,评估指标包括 SIM、STOI、PESQ-NB 和 PESQ-WB(数值越高越好)。在推理阶段,我们通过调整使用的 RVQ codebook 数量来控制同一模型的比特率(bps)。

LibriSpeech SIM comparisonLibriSpeech PESQ-NB comparisonLibriSpeech STOI comparisonLibriSpeech PESQ-WB comparison

TTS Model Comparison (Zero-shot Voice Cloning)

modelparamsopen-sourceenzh
WER/%↓SIM/%↑CER/%↓SIM/%↑
DiTAR0.6BClosed Source1.6973.51.0275.3
FishAudio-S14BClosed Source1.7262.571.2272.1
CosyVoice31.5BClosed Source2.22721.1278.1
Seed-TTS-Closed Source2.2576.21.1279.6
MiniMax-Speech-Closed Source1.6569.20.8378.3
CosyVoice0.3BOpen Source4.2960.93.6372.3
CosyVoice20.5BOpen Source3.0965.91.3875.7
CosyVoice30.5BOpen Source2.0271.81.1678
F5-TTS0.3BOpen Source2671.5376
SparkTTS0.5BOpen Source3.1457.31.5466
FireRedTTS0.5BOpen Source3.82461.5163.5
FireRedTTS-21.5BOpen Source1.9566.51.1473.6
Qwen2.5-Omni7BOpen Source2.7263.21.775.2
FishAudio-S1-mini0.5BOpen Source1.94551.1868.5
IndexTTS21.5BOpen Source2.2370.61.0376.5
VibeVoice1.5BOpen Source3.0468.91.1674.4
HiggsAudio-v23BOpen Source2.4467.71.574
GLM-TTS1.5BOpen Source2.2367.21.0376.1
GLM-TTS-RL1.5BOpen Source1.9168.10.8976.4
VoxCPM0.5BOpen Source1.8572.90.9377.2
Qwen3-TTS0.6BOpen Source1.6870.391.2376.4
Qwen3-TTS1.7BOpen Source1.571.451.3376.72
MossTTSDelay8BOpen Source1.8470.861.3776.98
MossTTSLocal1.7BOpen Source1.9373.281.4479.62

模型演示