MOSS-TTSD 是一个面向长音频生成的对话语音生成模型,能够在多种语言下合成高度自然、富有表现力的多角色对话语音。模型支持连续长时生成、灵活的多说话人对话控制,并具备业界领先的零样本音色克隆能力,仅需短参考音频即可实现高保真复刻。MOSS-TTSD 面向真实内容生产场景,适用于播客、有声书、体育解说、电竞解说、配音、相声及各类娱乐内容生成。
该模型与 MOSS-TTS 共享相同的架构。
模型概述
MOSS-TTSD(Text-To-Spoken Dialogue)是一个开源的长篇对话语音合成模型,支持多语言的高表现力对话语音生成,包括中文、英语、日语、韩语、西班牙语、葡萄牙语、法语、德语、意大利语、俄语和阿拉伯语等。模型能够将对话脚本转换为自然、拟人化的口语对话语音,支持多角色对话生成,并实现准确的说话人切换与丰富的互动表达。得益于增强的长上下文建模能力,MOSS-TTSD 可以稳定生成连贯的长篇单次音频内容,适用于播客级别的长音频制作与扩展叙事场景。此外,MOSS-TTSD 提供了极强的零样本音色克隆能力,仅需短参考音频即可保持稳定一致的说话人身份与自然的对话韵律表现。MOSS-TTSD 可广泛应用于 AI 播客生成、有声书朗读、体育解说、电竞解说、影视配音、综艺节目、动漫角色对话、相声等多种长篇对话内容创作场景。
ZH
Win: 35.8%Tie: 32.6%Lose: 31.6%
Win: 44.4%Tie: 20.2%Lose: 35.4%
EN
Win: 44%Tie: 22%Lose: 34%
Win: 45.5%Tie: 21.2%Lose: 33.3%
Win: 33.3%Tie: 25.3%Lose: 41.4%