先说结论
GPT-SoVITS 是个开源语音克隆项目,目前在 GitHub 上有超过 6 万颗星星。它的最大卖点是用一分钟的语音样本,就能训练出一个还算像样的声音模型。
不用联网服务,全在你自己电脑上跑,隐私和成本都自己掌控。今天带你把整个流程走一遍。
需要准备什么
硬件门槛不算高。最低配置有一张 6GB 显存的显卡就能跑推理,训练的话建议 8GB 以上。纯 CPU 也能跑,但会慢很多。
系统方面 Windows 和 Linux 都行。我下面按 Windows + NVIDIA 显卡来讲,这也是大多数人的场景。
第一步:下载项目
官方仓库在 GitHub 上,名字是 RVC-Boss/GPT-SoVITS。Windows 用户最省事的做法是下载官方打包好的整合包,解压即用,不用自己配环境。
整合包里已经带好了 Python、PyTorch 和 CUDA,下载下来解压就行。这一步最需要注意的是磁盘空间,整个包解压后大概要十几 GB。
第二步:准备声音样本
这是决定效果的一步。样本质量直接决定了克隆出来像不像。
剪一段目标人物的干净录音,一分钟左右就够。要求就三条:没有背景噪音、没有别人声音、没有明显情绪起伏。用手机录一段自己说话也行。
拿到音频后,在界面里做一下语音切分和降噪,工具会自动把长音频切成一句句的短片段。
第三步:训练模型
分几步走,界面里都有按钮,按顺序点就行。
1. 文本标注:把音频和对应文字对上 2. 特征提取:让模型学习声音特征 3. 训练 SoVITS 模型:核心步骤 4. 训练 GPT 模型:另一套核心
一分钟的样本,训练起来很快,几分钟到十几分钟不等,取决于显卡。训练完成后会得到两个模型文件,就是你的声音克隆了。
第四步:推理合成
切换到推理页面,加载刚才训练好的模型,输入你想让它说的话,点合成,就得到一段用目标声音读出来的音频。
还可以叠加一个参考音频来微调语气。这个功能让声音不只是像,还能有具体的情绪和停顿。
几个真实的坑
第一,中文效果比英文好。项目是国内的团队做的,中文训练数据更充足,英文口音偶尔会有点怪。
第二,样本里如果有重音、叹气,克隆出来的声音也会带这些习惯。所以样本越"中性"越好。
第三,别用它做违法的事。克隆别人的声音去诈骗、伪造声明,这在法律上是很严重的问题。训练素材应该只用自己有权使用的声音。
它适合干什么
做自己的 AI 配音、给视频配旁白、批量生成有声内容,这些场景都很适合。尤其适合那些需要固定"声音 IP"的创作者。
如果你只是想玩一下,官方整合包足够。如果想更折腾,也可以自己从源码配环境,但那是另一个话题了。