我们推出 MOSS-VoiceGenerator——一个开源的声音生成系统,能够根据自由文本描述直接生成说话人音色,使用户能够为特定角色、性格与情感定制专属声音。系统具备极为自然的情绪表现力,生成的语音具有高度的自然性,仿佛由真人发声,可广泛应用于有声读物、游戏配音、角色扮演智能体和对话助手等多个领域。此外,它还可以作为其他TTS系统的声音设计层,解决参考音频难以获得的问题,提升集成的便利性和效果。
该模型与 MOSS-TTS 共享相同的架构。
模型概述
MOSS-VoiceGenerator 采用统一的多模态LM架构,将声音描述指令与待合成文本拼接后统一进行文本编码,作为模型输入驱动语音生成,实现音色设计、风格控制与内容合成的联合建模。模型通过指令-音色对齐学习文本描述与声学特征的对应关系,从而在无需参考音频的条件下,直接根据自由文本提示生成具有目标音色、情感与风格的高保真语音输出。
模型能力
MOSS-VoiceGenerator 在主观评测中表现出显著优势。在160条涵盖多种音色风格的内部测试数据中,我们设置了三个独立的评测维度:(1)总体表现(Overall Preference)——假如你是用户,你会选择哪个声音?(2)指令遵循(Instruction Following)——哪条生成的音频更好地遵循了指令?指令可能涉及性别、年龄、声音质感、情绪、口音、语速等细节;(3)自然度(Naturalness)——哪条生成的音频最接近真实的人类语音?结果显示,MOSS-VoiceGenerator 在这三个维度上均优于所有支持无预定义音色及自定义预览文本的TTS系统。
Overall Performance
Win: 61.9%Tie: 5%Lose: 33.1%
Win: 61.9%Tie: 6.9%Lose: 31.2%
Win: 63.1%Tie: 10%Lose: 26.9%
Instruction Following
Win: 53.1%Tie: 11.2%Lose: 35.6%
Win: 55%Tie: 10.6%Lose: 34.4%
Win: 60%Tie: 10%Lose: 30%
Naturalness
Win: 57.5%Tie: 7.5%Lose: 35%
Win: 50.3%Tie: 13.2%Lose: 36.5%
Win: 59.4%Tie: 7.5%Lose: 33.1%