新闻详情

新闻详情

首页 / 资讯中心 / 详情

用10分钟语音数据训练AI变声模型:RVC完整上手指南

发布时间:2026/9/4 12:37:56来源:尧图网络
用10分钟语音数据训练AI变声模型:RVC完整上手指南
用10分钟语音数据训练AI变声模型RVC完整上手指南【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUI下文简称 RVC是一个基于 VITS 的开源变声Voice Conversion框架。它的核心机制是用 top1 检索把输入源特征替换成训练集特征从而杜绝音色泄漏底模由接近 50 小时的开源 VCTK 数据集训练无版权问题。你只需要 10 分钟左右的低底噪语音就能在普通显卡上训出一个可用的变声模型。它替你解决了什么问题10 分钟数据就够开训官方建议训练集时长为 10~50 分钟音质高、底噪低且音色有特色时5~10 分钟也能出效果。1~2 分钟的数据偶尔有人成功但不可复现1 分钟以下不建议尝试。检索替换掐断音色泄漏RVC 推理时用 top1 检索把输入源的音色特征替换为训练集特征变声结果贴近目标音色而不是被源音频带偏。配合 ckpt-merge 选项卡你还可以做模型融合进一步调整音色。旧显卡也能跑官方明确提到即便在相对较差的显卡上也能快速训练4G 显存的卡尚且可用4G 以下基本只能放弃。预处理工具链内置界面里可直接调用 UVR5 模型分离人声和伴奏用于清理训练素材音高提取采用 InterSpeech2023-RMVPE 算法解决哑音问题比 crepe_full 更快、资源占用更小并且支持 A 卡/I 卡加速。上手路线图7 步准备 Python 3.8 环境安装 PyTorch 及核心依赖按显卡类型安装对应依赖清单补齐assets目录下的预模型安装 ffmpeg下载 RMVPE 音高提取模型rmvpe.pt运行python infer-web.py启动 WebUI在网页中完成训练、索引、推理主流程装环境、备资源、启动第一步装 Python 与 PyTorch所有指令都要求 Python 大于 3.8。先装 PyTorch 三件套已装可跳过具体版本选择参考 PyTorch 官方安装页pip install torch torchvision torchaudioWindows Nvidia Ampere 架构RTX30xx用户按经验需要锁定 CUDA 版本pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117第二步按显卡选依赖清单你的硬件环境执行命令N 卡Nvidiapip install -r requirements.txtA 卡/I 卡DirectMLpip install -r requirements-dml.txtA 卡 ROCm仅 Linuxpip install -r requirements-amd.txtI 卡 IPEX仅 Linuxpip install -r requirements-ipex.txt如果你偏好用 Poetry 管理依赖注意 python 建议选 3.7~3.10其他版本在安装llvmlite0.39.0时会冲突poetry init -n poetry env use path to your python.exe poetry run pip install -r requirements.txt第三步补齐预模型RVC 推理和训练依赖一组预模型完整清单如下缺哪些补哪些./assets/hubert/hubert_base.pt./assets/pretrainedG/D 系列.pth底模v1./assets/uvr5_weights人声分离权重./assets/pretrained_v2可选想用 v2 底模才需要rmvpe.pt放到仓库根目录A 卡/I 卡用户可选再下rmvpe.onnx模型从项目配套的 Hugging Face 模型仓库获取仓库里也附带了下载脚本tools目录下有download_models.pyPython 版和dlmodels.shshell 版依赖 aria2跑一个即可。第四步装 ffmpegffmpeg/ffprobe 已装可跳过Ubuntu/Debiansudo apt install ffmpegMacOSbrew install ffmpegWindows从项目配套模型仓库下载ffmpeg.exe和ffprobe.exe放到仓库根目录第五步启动python infer-web.py若依赖是用 Poetry 装的则poetry run python infer-web.py分支路线各取最短路径整合包下载解压RVC-beta.7z。Windows 双击go-web.batMacOS 执行sh ./run.sh。MacOS 全新环境直接sh ./run.sh脚本会自动装 Python 3.8、建 venv、补依赖并调起infer-web.py。I 卡 IPEXLinux启动前先执行source /opt/intel/oneapi/setvars.sh。AMD ROCmLinux先装驱动Arch 用户可用pacman -S rocm-hip-sdk rocm-opencl-sdk。部分显卡型号如 RX6700XT还需export ROCM_PATH/opt/rocm和export HSA_OVERRIDE_GFX_VERSION10.3.0并确保当前用户在render、video组内sudo usermod -aG render $USERNAME、sudo usermod -aG video $USERNAME。避坑指南常见故障排障清单现象报 ffmpeg error 或 utf8 error原因大概率不是 ffmpeg 本身的问题。路径里带空格、括号等符号会触发 ffmpeg error训练集是中文路径时写入 filelist.txt 会触发 utf8 error。 处理把素材目录改成纯英文、无空格的路径。现象一键训练结束没有 added 开头的索引文件原因训练集过大时添加索引这一步会被卡住。注意只要出现过 Training is done. The program is closed. 就代表模型训练本身是成功的紧随其后的报错是假象。 处理重新点一次「训练索引」按钮。现象训练完成推理界面看不到新训练的音色原因音色列表未刷新或训练过程实际有报错。 处理先点刷新音色仍没有的话把控制台输出、WebUI 截图以及logs/实验名下的日志整理出来反馈给开发者。现象Connection Error原因你把控制台黑色命令行窗口关掉了。 处理保持控制台窗口开着。现象WebUI 弹出 Expecting value: line 1 column 1 (char 0)原因局域网代理或全局代理处于开启状态客户端、服务端如学术加速设置的 http_proxy/https_proxy都要关。 处理关闭代理后重试。现象CUDA error / out of memory原因小概率是设备不支持大概率是显存不足。 处理训练时把 batch size 调小调到 1 仍不够只能换卡推理时酌情调小 config.py 末尾的x_pad、x_query、x_center、x_max。4G 以下显存的卡建议直接放弃。现象Windows 报Could not load shared object file: llvmlite.dll原因缺少 VC 运行库。 处理安装微软 VC 2015-2022 redistributable 后重启 WebUI。现象RuntimeError: The expanded size of the tensor (17280) must match ...原因wavs16k里混进了体积异常小的坏音频文件。 处理找出并删掉这些文件重新点训练模型注意一键流程已中断训完记得再补一次索引。现象中途换采样率后训练报错原因不同采样率对应的中间特征不能混用。 处理更换实验名从头训练也可以把上次提取好的音高和特征0/1/2/2b 文件夹拷过去加速。调参参考训练集底噪大时 total_epoch 给 20~30 即可音质高、时长足可以给到 200。分享模型时给的是weights目录下 60MB 的.pth加对应的 index 文件而不是logs里几百 MB 的实验状态文件。更多细节见 docs/cn/faq.md。写在最后RVC 把「少量数据、低配显卡、网页操作」三件事同时做到了是目前个人玩家门槛最低的 VITS 变声训练框架之一。预模型备齐后你的下一步就是准备 10 分钟以上的干净人声素材启动 WebUI 跑通第一个实验再根据试听结果调整 index rate 和 total_epoch。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

怎么把mov格式的视频转换mp4?分享四个视频格式转换方法 2026/9/4 14:17:17

怎么把mov格式的视频转换mp4?分享四个视频格式转换方法

在当今数字化时代,视频已成为我们日常生活和工作中不可或缺的一部分。无论是工作汇报、在线教育,还是休闲娱乐,视频都扮演着举足轻重的角色。然而,不同的设备、平台和软件往往支持不同的视频格式,MOV便是其中一种较为常…

阅读更多 →
零基础搭建AI人生副本视频生成器:Coze工作流实战教程 2026/9/4 14:17:17

零基础搭建AI人生副本视频生成器:Coze工作流实战教程

你是不是也刷到过那种“人生副本”视频?一个普通人,通过AI技术,生成自己不同职业、不同人生的照片或视频,配上煽情的文案和音乐,在短视频平台动辄几十万点赞。很多人觉得这很酷,但一想到要学AI绘画、视频剪…

阅读更多 →
VisionPro工业视觉检测实战:从齿轮测量到九点标定完整指南 2026/9/4 14:17:17

VisionPro工业视觉检测实战:从齿轮测量到九点标定完整指南

1. 先搞清楚 VisionPro 到底能帮你解决什么视觉检测问题如果你在工业自动化、机器视觉或者质检领域,听到 VisionPro 这个名字,第一反应可能是“那个很贵的商业软件”。没错,康耐视的 VisionPro 是一套成熟的机器视觉开发平台,但它…

阅读更多 →
Fable 5.1配额重置:AI生成任务与API接入全指南 2026/9/4 14:17:17

Fable 5.1配额重置:AI生成任务与API接入全指南

Fable 5.1 这个版本更新,最值得关注的一点不是功能列表,而是所有用户的 5 小时和每周用量限制已经全部重置。对正在用 Fable 做 AI 内容生成、测试或者批量任务的人来说,这是最实际的利好:上一轮配额用完或者快用完的账号&#xf…

阅读更多 →
Open Generative AI:免费用400+模型生成AI图像与视频,从本地部署到出片的完整指南 2026/9/4 14:17:17

Open Generative AI:免费用400+模型生成AI图像与视频,从本地部署到出片的完整指南

Open Generative AI:免费用400模型生成AI图像与视频,从本地部署到出片的完整指南 【免费下载链接】Open-Generative-AI Unrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600 models (…

阅读更多 →
Astro Monorepo 开发指南:从执行上下文、虚拟模块到测试隔离的源码级实践 2026/9/4 14:14:17

Astro Monorepo 开发指南:从执行上下文、虚拟模块到测试隔离的源码级实践

Astro Monorepo 开发指南:从执行上下文、虚拟模块到测试隔离的源码级实践 【免费下载链接】astro The web framework for content-driven websites. ⭐️ Star to support our work! 项目地址: https://gitcode.com/GitHub_Trending/as/astro 本文基于 Astro…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞