新闻详情

新闻详情

首页 / 资讯中心 / 详情

Amphion 预训练 HiFi-GAN 语音声码器使用指南:下载、目录结构与源码解析

发布时间:2026/10/2 13:25:47来源:尧图网络
Amphion 预训练 HiFi-GAN 语音声码器使用指南:下载、目录结构与源码解析
音频语音媒体生成深度学习【免费下载链接】AmphionAmphion (/æmˈfaɪən/) is a toolkit for Audio, Music, and Speech Generation. Its purpose is to support reproducible research and help junior researchers and engineers get started in the field of audio, music, and speech generation research and development.项目地址https://gitcode.com/GitHub_Trending/am/Amphion点击查看免费下载Amphion/æmˈfaɪən/是面向音频、音乐与语音生成的可复现研究工具包其声码器Vocoder模块负责将梅尔频谱等声学特征还原为可听波形。本文围绕仓库中发布的hifigan_speech预训练 HiFi-GAN 语音声码器展开讲解如何下载并正确部署该模型、其网络结构与训练配置的源码级细节以及在 Amphion 中调用它完成波形重建的完整操作路径。模型概况hifigan_speech预训练权重Amphion 官方在pretrained/hifigan/README.md中发布了面向通用语音的 HiFi-GAN 预训练模型hifigan_speech。其核心信息如下模型标识hifigan_speech托管平台HuggingFace 平台的amphion/hifigan_speech_bigdata模型仓库训练数据VCTK LibriTTS LJSpeech 三个开源语音数据集据 egs/vocoder/gan/tfr_enhanced_hifigan/README.md 的说明该 HiFi-GAN 检查点使用约685 小时语音数据训练而成是 Amphion 在语音声码器方向发布的标准预训练权重。它不绑定某个特定下游任务而是作为通用语音波形生成器可服务于文本转语音、语音转换、歌声合成等各类流水线的最后一级。下载与部署目录结构要求与仓库内其他预训练依赖如 BigVGAN、DiffWave一致hifigan_speech同样以「整目录落盘」的方式使用。pretrained/README.md 给出了明确要求需要将hifigan_speech整个文件夹下载并放入Amphion/pretrained/hifigan目录最终目录结构如下Amphion ┣ pretrained ┃ ┣ hifigan ┃ ┃ ┣ hifigan_speech ┃ ┃ ┃ ┣ log ┃ ┃ ┃ ┣ result ┃ ┃ ┃ ┣ checkpoint ┃ ┃ ┃ ┣ args.json其中checkpoint目录存放模型权重与训练中间产物args.json记录该次训练使用的全部超参数是推理时恢复模型结构的关键依据log、result分别存放训练日志与过程中的合成样本。注意必须保持「文件夹套文件夹」的完整结构pretrained/hifigan/hifigan_speech/...不要只把权重文件单独拷出否则 Amphion 在按路径加载预训练声码器时可能无法定位args.json与checkpoint。网络架构源码解析HiFiGAN 生成器实现Amphion 对 HiFi-GAN 生成器的实现位于 models/vocoders/gan/generator/hifigan.py核心类是HiFiGAN第 150 行起。从源码结构看其前向计算分为四个阶段对应forward方法第 202-218 行输入投影conv_pre将cfg.preprocess.n_mel维的梅尔谱经一个核大小为 7 的 Conv1d 投影到upsample_initial_channel通道默认 256多级转置卷积上采样按upsample_rates默认[8, 8, 4]总上采样倍率 256逐级用ConvTranspose1d提升时间分辨率每一级通道数按upsample_initial_channel // (2 ** (i1))递减多感受野残差块每个上采样级之后并联num_kernels默认 3个残差块ResBlock1/ResBlock2不同残差块使用不同的核大小与膨胀率以捕获多尺度波形细节输出取各分支平均输出整形conv_post将特征压缩回单通道经tanh输出最终波形。此外生成器对卷积层使用weight_norm并在第 145 行提供remove_weight_norm方法——这正是 HiFi-GAN 推理阶段「移除权重归一化以降低开销」的标准做法。该实现完全对齐经典 HiFi-GAN 的「多感受野融合 周期/尺度判别器对抗训练」设计。训练配置参数对照exp_config.jsonAmphion 为 HiFi-GAN 提供了开箱即用的训练配置 egs/vocoder/gan/hifigan/exp_config.json其model.hifigan字段与上述源码逐项对应model: { generator: hifigan, hifigan: { resblock: 2, upsample_rates: [8, 8, 4], upsample_kernel_sizes: [16, 16, 8], upsample_initial_channel: 256, resblock_kernel_sizes: [3, 5, 7], resblock_dilation_sizes: [[1, 2], [2, 6], [3, 12]] } }各参数在源码中的实际作用如下resblock选择残差块类型1使用 ResBlock1、2使用 ResBlock2hifigan.pyupsample_rates/upsample_kernel_sizes成对驱动各级转置卷积zip遍历见第 168-173 行乘积 8×8×4256 即梅尔谱帧率到采样率的放大倍数upsample_initial_channel决定conv_pre的输出宽度与各级通道衰减的基数第 156-184 行resblock_kernel_sizes/resblock_dilation_sizes与残差块数量一一对应len值被记为num_kernels直接决定并联残差分支数第 154-155 行。配置同时指定了预处理只提取梅尔谱与原始音频extract_mel/extract_audio训练损失项包含feature、discriminator、generator、mel四类——其中mel损失保证了波形重建后梅尔域的重构一致性。结合 egs/vocoder/gan/README.md 可知HiFi-GAN 是 Amphion GAN 声码器家族的一员判别器侧支持 MSD多尺度、MPD多周期、MS-STFTD 等多种选择。在 Amphion 中使用加载与推理预训练hifigan_speech的直接用途是作为声码器完成最终波形合成。Amphion 的 GAN 声码器流水线egs/vocoder/gan/README.md分为数据准备、特征提取、训练、推理四步其中推理通过 egs/vocoder/gan/hifigan/run.sh 的--stage 3触发底层调用 bins/vocoder/inference.py。脚本支持三种输入模式sh egs/vocoder/gan/hifigan/run.sh --stage 3 \ --infer_mode [infer_from_dataset|infer_from_feature|infer_from_audio] \ --infer_datasets libritts vctk ljspeech \ --infer_feature_dir [预测声学特征目录] \ --infer_audio_dir [音频目录] \ --infer_expt_dir Amphion/ckpts/vocoder/[YourExptName] \ --infer_output_dir Amphion/ckpts/vocoder/[YourExptName]/resultinfer_from_dataset从数据集直接读取梅尔特征合成infer_from_feature输入自备的mels/*.npy声学特征目录适合接在 TTS/VC 等模型的预测特征之后infer_from_audio输入 wav 文件做快速分析-重合成验证。若直接以官方预训练权重作为声码器可将--infer_expt_dir指向pretrained/hifigan/hifigan_speech该目录下含checkpoint与args.json符合加载约定。此外若需在已有检查点基础上继续训练或微调可参照 egs/vocoder/gan/tfr_enhanced_hifigan/README.md 的用法用--resume_type resume恢复全部训练状态或--resume_type finetune仅加载模型权重配合--checkpoint指定断点路径。使用注意事项默认CUDA_VISIBLE_DEVICES0多卡训练/推理时通过--gpu 0,1,2,3指定多进程训练默认主端口29500冲突时用--main_process_port调整预训练模型面向「语音」领域VCTK/LibriTTS/LJSpeech若任务域差异较大如歌声建议参照 tfr_enhanced_hifigan 等方案在目标数据上微调后使用模型托管于 HuggingFace 的amphion/hifigan_speech_bigdata仓库下载时务必保留hifigan_speech文件夹的完整内部结构。小结hifigan_speech是 Amphion 面向通用语音发布的高质量预训练 HiFi-GAN 声码器约 685 小时语音数据训练覆盖 VCTK、LibriTTS、LJSpeech。通过本文介绍的下载目录规范放入pretrained/hifigan/hifigan_speech、源码级参数理解upsample_rates、resblock_kernel_sizes等与三种推理模式读者可以在自己的 TTS/VC 流水线中直接复用该模型完成梅尔谱到波形的重建或基于其权重在目标数据上进行微调。赞分享音频语音媒体生成深度学习【免费下载链接】AmphionAmphion (/æmˈfaɪən/) is a toolkit for Audio, Music, and Speech Generation. Its purpose is to support reproducible research and help junior researchers and engineers get started in the field of audio, music, and speech generation research and development.项目地址https://gitcode.com/GitHub_Trending/am/Amphion点击查看免费下载相关推荐Amphion 中 DiffWave 扩散声码器预训练模型下载、目录组织与源码级应用指南Amphion 中 DiffWave 扩散声码器预训练模型下载、目录组织与源码级应用指南 导读 本文围绕 Amphion 官方 DiffWave 预训练模型展音频语音媒体生成深度学习如何快速掌握HiFi-GAN声码器从安装到语音合成的完整指南如何快速掌握HiFi GAN声码器从安装到语音合成的完整指南 HiFi GAN是一款基于生成对抗网络GAN的高效高保真语音合成工具能够快速生成自然流畅的esp-iot-solution 组件 adc_mic 实战指南基于 ADC 连续采样实现模拟麦克风录音esp iot solution 组件 adc_mic 实战指南基于 ADC 连续采样实现模拟麦克风录音 导读 本指南围绕 esp iot solution音频语音媒体生成深度学习上一篇Dexed FM合成器完全指南从零开始掌握专业级音色设计下一篇开源电子签名平台如何用DocuSeal和Documenso告别昂贵的SaaS订阅创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

ArUco标记检测数据集制作全流程:从合成到真实场景的YOLO训练样本生成 2026/10/2 14:13:21

ArUco标记检测数据集制作全流程:从合成到真实场景的YOLO训练样本生成

简介:这份ArUco标记检测数据集面向机器人定位导航、增强现实研发及计算机视觉研究者,提供真实场景采集的标记识别训练素材。包内共2000个文件,以1300个YOLO格式txt标注、698张jpg实拍图像为主,另含1个yaml配置文件与1份docx说明文…

阅读更多 →
英文版Linux系统完整安装实战:从镜像校验到中文环境配置 2026/10/2 14:13:09

英文版Linux系统完整安装实战:从镜像校验到中文环境配置

说真的,很多人第一次听到“英文版Linux系统”这个说法,第一反应都是“不就是安装时把语言选成English嘛”。但实际动手装过的人都知道,事情远没有这么简单。我这些年装过的Linux系统少说也有上百次,从CentOS 6一路用到Rocky Linux…

阅读更多 →
降AI率实操指南:从AIGC检测原理到工具选择 2026/10/2 14:13:08

降AI率实操指南:从AIGC检测原理到工具选择

1. 2026年了,为什么本科生必须搞懂“降AI率” 这两年被AIGC检测卡住的人越来越多,尤其在本科毕业论文抽检、课程大作业提交、数学建模论文送审这些环节,“降AI率”已经从聊天群里的段子变成了实打实的刚需。我自己过去两年帮学弟学妹改过不少…

阅读更多 →
华为USG防火墙双向NAT配置:解决NAT回流问题实战指南 2026/10/2 14:13:02

华为USG防火墙双向NAT配置:解决NAT回流问题实战指南

前阵子帮一家小企业调华为USG防火墙,遇到一个特别典型的故障:公司内网有台Web服务器,外网通过公网IP访问一切正常,但内网员工用同一个公网域名访问自己的网站,页面死活打不开。我登进防火墙看会话表,流量到…

阅读更多 →
Django+OpenCV+pyzbar构建二维码识别系统:毕设实战指南 2026/10/2 14:13:02

Django+OpenCV+pyzbar构建二维码识别系统:毕设实战指南

简介:面向本科毕业设计场景的二维码识别系统完整项目包,基于PythonDjangoMySQL构建B/S架构,适合计算机相关专业学生参考学习。项目除用户与个人资料管理外,核心实现了二维码的生成与识别流程:通过输入文字内容调用算法…

阅读更多 →
深度学习机场安检危险品识别:YOLO目标检测项目实战与避坑指南 2026/10/2 14:13:02

深度学习机场安检危险品识别:YOLO目标检测项目实战与避坑指南

简介:这是一个面向高校深度学习、Python课程设计及毕业设计的机场安检危险品识别实战项目。项目基于卷积神经网络与Faster R-CNN目标检测框架,覆盖X光图像标注、模型训练、验证与部署全流程,针对刀具、爆炸物等违禁品场景提供自动识别方案&am…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉