Fish Speech是一个全新的文本到语音(TTS)解决方案,采用了当下流行的深度学习技术,如Transformer、VITS、VQVAE 和GPT等。Fish Speech V1.5主要改进包括更精炼的数据处理流水线,增强了训练方法,提高了模型输出的稳定性以及更高级的情感表达能力。
声音克隆:上传10–30秒清晰人声,即可生成相似音色的语音,支持零样本和少样本克隆。
多语言支持:覆盖中、英、日、韩、法、德、阿拉伯、西班牙等8种以上语言,可直接混合输入。
情感与语气控制:通过文本标记控制愤怒、悲伤、兴奋、耳语、笑声等数十种情绪和音效。
本地部署:开源且支持本地运行,WebUI和API两种方式都能用,适合对数据隐私有要求的场景。
在线体验:在始智AI‑wisemodel社区可直接创建在线体验环境,按量或包周付费。
本地部署:克隆GitHub仓库并安装依赖,推荐NVIDIA GPU(8GB以上显存),也可用Docker一键启动。