品玩6月3日讯,高德技术团队正式推出开源语音合成系统PilotTTS,旨在证明通过精细数据工程与关键架构创新,可在较低资源消耗下构建具备顶尖竞争力的TTS系统。
该系统基于“ disciplined modular recipe”方法论,完全采用公开可用的开源组件构建,包括CosyVoice 3的分词器、Qwen3-0.6B语言模型及DiT架构的CFM解码器,规避了多阶段预训练等高复杂度设计。其核心创新在于提出基于Q-Former的双通路解耦条件机制,有效分离了说话人身份与风格信息。
在仅使用约20万小时开源数据训练下,PilotTTS在行业通用测试集上取得极具竞争力的成绩:中英文说话人相似度分别达到0.862与0.815,并在字/词错误率上逼近最优系统。同时,系统在情感、副语言及方言等受控生成任务中也展现出卓越的可控性与表现力。
目前,PilotTTS已全面开源其数据处理流水线、模型权重及训练推理代码,为社区提供了一个可复现、可扩展的强基线方案。








