新闻详情

新闻详情

首页 / 资讯中心 / 详情

GPT-SoVITS:1 分钟录音完成语音克隆微调,原生输出 48kHz 高清语音

发布时间:2026/9/7 17:11:41来源:尧图网络
GPT-SoVITS:1 分钟录音完成语音克隆微调,原生输出 48kHz 高清语音
GPT-SoVITS1 分钟录音完成语音克隆微调原生输出 48kHz 高清语音【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一个少样本语音克隆项目5 秒参考音频即可零样本合成人声1 分钟录音微调后音色相似度显著提升。v4 版本直接输出 48kHz 音频支持中、英、日、韩、粤五种语言v2ProPlus 在 RTX 4090 上 RTF 低至 0.014。适合想给自己录播、给视频换配音、翻新旧音频的创作者和开发者。先看效果谁在什么场景下用它短视频/播客口播创作者录 1 分钟自己的声音做一次微调之后口播脚本直接交给模型生成48k 成品交付前不用再跑升采样。跨语言配音用中文素材训好一个音色推理时把文本切到日语、韩语或英语同一个声音读多语言内容配音成本从找配音员降到改文本。旧音频翻新影视二创和配音修复时用 WebUI 内置的 UVR5 人声分离、自动切分和 ASR 标注把老素材整理成训练集再合成一条干净的替代配音。安装与启动环境门槛不高conda Python 3.10N 卡走 CUDA 12.6/12.8也兼容 ROCm、MPS 和纯 CPU。git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS bash install.sh --device CU128 --source HF参数这样选--device按硬件取 CU126/CU128/ROCM/MPS/CPUN 卡按你装好的 CUDA 版本选。--source取 HF/HF-Mirror/ModelScope国内网络建议 ModelScope下载更稳。想顺带下人声分离权重就加--download-uvr5。装完后确认 GPT_SoVITS/pretrained_models/ 下有gsv-v4-pretrained/s2Gv4.pth与vocoder.pthv4 推理靠这两个文件。如何完成第一次语音克隆最小闭环三步启动运行python webui.py浏览器打开http://127.0.0.1:9874进入推理页面。填参数模型下拉框选 v4上传一段 5 秒左右、无背景音的参考音频选择目标语言并输入待合成文本。合成试听点击合成等待生成试听输出。5 秒参考音频就能零样本克隆音色整条链路是否跑通以这一步为准。原理速览只讲三个关键点48k 干净音质来自整数倍上采样v4 声码器的上采样链全是整数倍GPT_SoVITS/configs/s2v2ProPlus.json 中upsample_rates为 10×8×2×2×2从根上消除了 v3 非整数倍上采样引入的金属音BigVGAN 直接产出 48k取代 v3 的 24k 输出。两段式分工 更大预训练语料GPT 部分负责语义与韵律SoVITS 部分负责声学细节预训练语料从 2k 小时扩到 5k 小时所以 1 分钟数据的少样本效果明显好于零样本。半精度默认开启GPT_SoVITS/configs/tts_infer.yaml 里is_half在较新显卡上默认 true推理更快、显存占用更低。进阶调优按情况选参数你的情况怎么选训练集音质干净、追求保真模型下拉框选 v4音色保真、高频最干净训练集音质一般、怕翻车改选 v2Pro 系列官方口径音质接近 v4硬件占用和速度等同 v2更稳显卡较新SM 6.1 以上保持is_half半精度开启推理更快显存吃紧报 OOM关闭半精度改 FP32 跑或换更大显存的卡纯 CPU 无 GPU用 GPT_SoVITS/export_torch_script.py 导出优化模型再推理长文本分段合成参考音频保持 5 秒左右常见问题速查音色下拉框为空→ 预训练模型缺失或放错目录 → 检查 GPT_SoVITS/pretrained_models/ 是否含对应版本的.pth/.ckpt文件。提示未找到显卡、自动退回 CPU→ 驱动或 CUDA 缺失 → 装好 N 卡驱动或显式指定--device CPU接受 CPU 速度。合成有金属音→ 还在用 v3 权重或非整数倍上采样配置 → 换 v4 并重新下载vocoder.pth。v3/v4 训练效果不如 v2→ v3/v4 对训练数据质量挑剔 → 先做分离降噪或改用 v2Pro 系列。Mac 上训出的模型质量偏低→ 已知现象 → 官方建议 Mac 用户用 CPU 模式训练。显存溢出→ 显存不足 → 关闭半精度或换更大显存的卡CPU 训练只建议少量数据试跑。下一步先用 5 秒参考音频跑通零样本合成确认链路无误再准备 1 分钟干净人声做微调对比零样本与微调的相似度差异。升级版本前扫一眼 docs/en/Changelog_EN.md确认你的权重和配置仍然兼容。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

LeetCode 206反转链表:JavaScript三种解法与指针详解 2026/9/7 18:23:55

LeetCode 206反转链表:JavaScript三种解法与指针详解

LeetCode 206 反转链表,是所有链表类题目里出场率最高的一道,没有之一。用 JavaScript 刷这道题的人特别多,但真正能把它讲清楚的人很少。我见过太多人看题解时秒懂,合上代码自己写却连指针指哪都搞不清楚;也见过候选人…

阅读更多 →
Dify 前端开发代理 @langgenius/dev-proxy 全解析:路由配置、热重载与 Cookie 重写机制 2026/9/7 18:23:55

Dify 前端开发代理 @langgenius/dev-proxy 全解析:路由配置、热重载与 Cookie 重写机制

Dify 前端开发代理 langgenius/dev-proxy 全解析:路由配置、热重载与 Cookie 重写机制 【免费下载链接】dify Build Agentic workflows, RAG pipelines, with rich AI model and tool support on one collaborative workspace. Deploy on cloud, VPC, or self-hoste…

阅读更多 →
猫抓插件新手指南:3 个场景玩转资源嗅探与网页视频下载 2026/9/7 18:23:55

猫抓插件新手指南:3 个场景玩转资源嗅探与网页视频下载

猫抓插件新手指南:3 个场景玩转资源嗅探与网页视频下载 【免费下载链接】cat-catch 猫抓 浏览器资源嗅探扩展 / cat-catch Browser Resource Sniffing Extension 项目地址: https://gitcode.com/GitHub_Trending/ca/cat-catch 你想把在线课程的视频存下来&am…

阅读更多 →
风电运行管理系统:从SCADA数据接入到功率预测与健康预警的完整实践 2026/9/7 18:23:55

风电运行管理系统:从SCADA数据接入到功率预测与健康预警的完整实践

前几年跑风电场的时候,我见过太多这样的场景:中控室的监控大屏上,几十台风机一页一页地刷着运行数据,全场有功率、有转速、有温度,看着什么都正常,但真到出了问题,往往是从故障报文跳出来那一刻…

阅读更多 →
Git命令速查手册:从安装配置到分支合并与冲突解决 2026/9/7 18:23:55

Git命令速查手册:从安装配置到分支合并与冲突解决

Git 是我每天敲得最多的几个命令之一。说实话,Git 命令本身不难背,难的是你遇到具体场景时不知道用哪一条:想撤销又不想丢代码、分支合坏了、提交信息写错了、stash 了一堆临时改动却忘了怎么恢复……这些事几乎每个开发者都撞见过。这份速查…

阅读更多 →
8款AI论文写作软件实测:专科生毕业论文格式规范全流程指南 2026/9/7 18:20:55

8款AI论文写作软件实测:专科生毕业论文格式规范全流程指南

又到了一年一度的毕业论文季,我的私信里塞满了学弟学妹的求助:“学长,我们学校要求论文格式必须按GB/T 7714来,参考文献都不知道怎么标”“摘要的字体字号行距搞了一下午还是不对”“查重率好不容易降下来了,目录又乱了…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞