Spark-TTS介绍
概述
Spark-TTS 是一款先进的文本转语音系统,它利用大型语言模型 (LLM) 的强大功能,实现高精度、自然的语音合成。它高效、灵活、功能强大,适用于研究和生产环境。
主要特点
简洁高效:Spark-TTS 完全基于 Qwen2.5 构建,无需使用流匹配等额外的生成模型。它无需依赖单独的模型来生成声学特征,而是直接从 LLM 预测的代码中重建音频。这种方法简化了流程,提高了效率并降低了复杂性。
高质量语音克隆:支持零样本语音克隆,这意味着即使没有专门的语音训练数据,它也能复制说话者的语音。这非常适合跨语言和代码切换场景,允许在语言和语音之间无缝转换,而无需对每种语言和语音进行单独训练。
双语支持:支持中文和英文,并能够针对跨语言和代码切换场景进行零样本语音克隆,使模型能够以高自然度和准确性合成多种语言的语音。
可控语音生成:支持通过调整性别、音调、语速等参数创建虚拟说话人。
