新闻详情

新闻详情

首页 / 资讯中心 / 详情

3秒参考音频就能改词换句:VoiceCraft 零样本语音编辑与TTS

发布时间:2026/9/19 21:13:46来源:尧图网络
3秒参考音频就能改词换句:VoiceCraft 零样本语音编辑与TTS
3秒参考音频就能改词换句VoiceCraft 零样本语音编辑与TTS【免费下载链接】VoiceCraftZero-Shot Speech Editing and Text-to-Speech in the Wild项目地址: https://gitcode.com/GitHub_Trending/vo/VoiceCraftVoiceCraft 是一个神经声码器语言模型专攻两件事零样本语音编辑和零样本 TTS。给它几秒参考音频加对应文本就能把录音里指定的词改掉或直接用那个人的声音念一句新话。训练数据是播客、有声书、网络视频这类真实场景语音不是录音棚数据。 它到底能帮你做什么功能输入说明零样本语音编辑原音频 原文本 改后文本替换/修改指定词音色和节奏自然衔接零样本 TTS数秒参考音频 目标文本克隆没听过的人的声音长文本 TTS长文本 参考音频Gradio 界面里分段拼接生成训练与微调自己的音频转写提供数据准备和训练脚本一句话概括同一个模型、同一套推理代码既能当音频 PS用也能当声音克隆器用。另外提醒一下README 末尾明确写了不能未经本人同意编辑他人语音商用前先看 LICENSE-CODE 和 LICENSE-MODEL。 最值得看的设计一个模型同时干编辑和 TTS很多方案里改词编辑和念新句TTS是两套流程VoiceCraft 把它们统一成了同一个训练目标token 填充infilling。音频先被 Encodec 编码成 4 个 codebook 的离散 token 序列训练时随机挖掉序列中的几段空位让模型根据上下文把空位补回来。补中间空位就是语音编辑从头生成、只留前几秒参考音频做提示就是 TTS——机制完全一样只是空位挖在哪不同。这套逻辑集中在 models/voicecraft.py 的prepare_mask_intervals和rearrange两个函数里值得逐行读。生成阶段每个 token 怎么采样的看这段就明白了def topk_sampling(logits, top_k10, top_p1.0, temperature1.0): if temperature ! 1.0: logits logits / temperature logits top_k_top_p_filtering(logits, top_ktop_k, top_ptop_p) token torch.multinomial(F.softmax(logits, dim-1), num_samples1) return token来自 models/modules/sampling.py 的核心采样逻辑。有个实用细节项目 2025 年 3 月把推理默认采样从 top-p 改成 top-k40编辑和 TTS 质量都明显提升说明这类模型调参时采样策略比换结构更有用。还有一个容易被忽略的工程点切参考音频不是按时间硬切而是先跑 MFA 强制对齐找到词边界再下刀所以克隆的几秒提示片段干净利落不会在词中间断掉。⚖️ 和同类项目比它强在哪维度VoiceCraft早期 VALL-E 类复现传统 TTS 引擎语音编辑原生支持改词后自然衔接以生成为主编辑需自行拼基本不支持训练数据播客/有声书等真实场景语音多为干净数据集录音棚录制克隆所需参考数秒通常更长时间段需专人录制注册上手方式命令行 / Gradio / Docker论文级复现成熟但多闭源换角度说它的护城河不是参数量而是野生数据 编辑和 TTS 共用一套目标。想体验完整流程可以看 inference_speech_editing.ipynb 和 inference_tts.ipynb 两个示例。 怎么开始用克隆仓库git clone https://gitcode.com/GitHub_Trending/vo/VoiceCraft按 README 的 Environment setup 一节建 conda 环境注意 MFA 强制对齐依赖是单独安装的直接跑python tts_demo.py不改参数就用仓库自带演示音频结果存到./generated_tts想要界面就pip install -r gradio_requirements.txt后运行python gradio_app.py浏览器打开 127.0.0.1:7860想训自己的数据照着 README 的 Training 一节准备 manifest再看 z_scripts/e830M.sh 和微调脚本 z_scripts/e830M_ft.sh先跑通tts_demo.py听个默认输出再回去读rearrange和insert_mask两段代码半天就能搞清楚编辑和 TTS 是怎么共用一套训练的。跑完顺手改改-co参数试试不同长度的参考音频是理解这个模型最便宜的方式。【免费下载链接】VoiceCraftZero-Shot Speech Editing and Text-to-Speech in the Wild项目地址: https://gitcode.com/GitHub_Trending/vo/VoiceCraft创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

基于STM32和微信小程序的宠物自动喂养系统设计 2026/9/19 21:52:53

基于STM32和微信小程序的宠物自动喂养系统设计

简介:设计资料围绕基于STM32的猫狗宠物喂养系统展开,面向物联网嵌入式学习者、电子设计竞赛参赛者及智能宠物硬件开发者,完整呈现从需求分析到系统落地的全流程方案。内容基于STM32F103RCT6主控,结合ESP8266 WiFi模块、28BYJ4步进…

阅读更多 →
彩灯控制器设计:NE555+CD4040+74LS138数字电路闭环实现 2026/9/19 21:52:53

彩灯控制器设计:NE555+CD4040+74LS138数字电路闭环实现

简介:本资源是一份面向电子信息类本科生的数字电子技术课程设计报告,聚焦彩灯控制器硬件系统实现,帮助学习者掌握NE555定时器、74LS138译码器与CD4040计数器的协同应用原理与工程实践方法。报告完整覆盖设计目的、总体方案、功能模块分析&…

阅读更多 →
接口编址与地址译码:嵌入式系统总线时序与外设通信要点 2026/9/19 21:52:53

接口编址与地址译码:嵌入式系统总线时序与外设通信要点

简介:《微处理器系统结构与嵌入式系统设计》第6章课件《计算机接口技术》以PPT形式系统讲解I/O接口基础、端口编址、地址译码、程序查询/中断/DMA/通道等传输方式,以及并行与串行接口的设计要点。内容涵盖独立编址与存储器映像编址的对比、带握手信号的并…

阅读更多 →
正则化全面解析:从L1/L2到软阈值与深度学习实践 2026/9/19 21:52:53

正则化全面解析:从L1/L2到软阈值与深度学习实践

1. 先从一个反直觉的结论说起:惩罚参数为什么能提升泛化能力?我第一次接触机器学习时,怎么也想不通一件事:为什么要在损失函数后面加一个"惩罚项"去主动降低模型的表现?训练模型不就是为了让损失尽量小吗&am…

阅读更多 →
高频课设实战:从谐振参数计算到仿真调参与误差闭环 2026/9/19 21:52:53

高频课设实战:从谐振参数计算到仿真调参与误差闭环

简介:《高频课设_题报告书》是一份围绕“中波电台发射与接收系统设计”的通信电子线路课程设计说明书,面向电子信息工程专业学生及高频电路学习者,完整呈现了从任务书、开题报告到系统指标分析、电路设计与仿真的全过程。压缩包内共1个文件&a…

阅读更多 →
整车厂用户运营数据链路:从埋点到CDP的精细化运营实践 2026/9/19 21:49:53

整车厂用户运营数据链路:从埋点到CDP的精细化运营实践

简介:《新时代整车厂竞争法则:打造精细化用户运营》是一份面向整车厂管理者、汽车行业市场及用户运营从业者的行业报告式PDF,系统剖析汽车市场增长放缓、疫情冲击、消费者偏好迁移等新时代困境,并结合蔚来、小鹏等新势力实践&…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞