• 对话生成
  • 多角色
  • 长音频
  • 音色克隆
  • 多语言

MOSS-TTSD

从角色脚本生成完整的多人对话,支持最多 5 位说话人、20 种语言与单次最长 60 分钟音频。用几秒参考录音设定角色声音,呈现自然接话、交叠人声与丰富语气,适用于播客、有声书、配音和赛事解说。

作者
OpenMOSS Team
版本
v1.0
开源许可
Apache 2.0

MOSS-TTSD 是一个面向长音频生成的对话语音生成模型,能够在多种语言下合成高度自然、富有表现力的多角色对话语音。模型支持连续长时生成、灵活的多说话人对话控制,并具备业界领先的零样本音色克隆能力,仅需短参考音频即可实现高保真复刻。MOSS-TTSD 面向真实内容生产场景,适用于播客、有声书、体育解说、电竞解说、配音、相声及各类娱乐内容生成。

该模型与 MOSS-TTS 共享相同的架构。

查看架构

模型概述

MOSS-TTSD(Text-To-Spoken Dialogue)是一个开源的长篇对话语音合成模型,支持多语言的高表现力对话语音生成,包括中文、英语、日语、韩语、西班牙语、葡萄牙语、法语、德语、意大利语、俄语和阿拉伯语等。模型能够将对话脚本转换为自然、拟人化的口语对话语音,支持多角色对话生成,并实现准确的说话人切换与丰富的互动表达。得益于增强的长上下文建模能力,MOSS-TTSD 可以稳定生成连贯的长篇单次音频内容,适用于播客级别的长音频制作与扩展叙事场景。此外,MOSS-TTSD 提供了极强的零样本音色克隆能力,仅需短参考音频即可保持稳定一致的说话人身份与自然的对话韵律表现。MOSS-TTSD 可广泛应用于 AI 播客生成、有声书朗读、体育解说、电竞解说、影视配音、综艺节目、动漫角色对话、相声等多种长篇对话内容创作场景。

ZH

vs doubao-podcast

Win: 35.8%Tie: 32.6%Lose: 31.6%

vs Eleven V3

Win: 44.4%Tie: 20.2%Lose: 35.4%

EN

vs gemini-2.5-flash-preview-tts

Win: 44%Tie: 22%Lose: 34%

vs gemini-2.5-pro-preview-tts

Win: 45.5%Tie: 21.2%Lose: 33.3%

vs Eleven V3

Win: 33.3%Tie: 25.3%Lose: 41.4%

WinTieLose

模型演示