新闻详情

新闻详情

首页 / 资讯中心 / 详情

ChatTTS-ui 音色定制完整指南:从内置音色到自建语音包

发布时间:2026/9/20 20:06:04来源:尧图网络
ChatTTS-ui 音色定制完整指南:从内置音色到自建语音包
ChatTTS-ui 音色定制完整指南从内置音色到自建语音包【免费下载链接】ChatTTS-ui一个简单的本地网页界面使用ChatTTS将文字合成为语音同时支持对外提供API接口。A simple native web interface that uses ChatTTS to synthesize text into speech, along with support for external API interfaces.项目地址: https://gitcode.com/GitHub_Trending/ch/ChatTTS-uiChatTTS-ui 是一个跑在本地的网页语音合成工具用 ChatTTS 模型把文字变成语音同时对外暴露/ttsAPI 接口。这篇文章按任务顺序带你走一遍 ChatTTS-ui 音色定制的全过程先用好内置的 5 个音色再把外部下载的音色文件装进 speaker/ 目录最后通过 prompt 标记和采样参数把声音调到位产出一条能直接用于有声书、播报场景的语音。先跑通内置音色5 个值得记住的号码服务启动后默认监听127.0.0.1:9966打开网页就能看到音色下拉框。仓库里预置了 2222、7869、6653、4099、5099 五个常用音色其中 2222 是 API 的默认值。每个号码对应一种稳定的声线建议把五个都听一遍再定。参数默认值说明voice2222内置音色号码填 .csv / .pt 文件名也可custom_voice0大于 0 的整数优先生效覆盖 voicetemperature0.3采样随机性越低越稳top_p0.7核采样阈值top_k20每步候选 token 数音色号码是怎么工作的种子与 .csv 缓存speaker/目录就是音色的仓库.pt和.csv两种格式都会被识别当前仓库内置音色以.csv形式存放。uilib/utils.py 里的get_speakers()负责扫描该目录、列出所有可用音色网页下拉框的数据就来自它。当你给 API 传一个不在目录里的custom_voice比如 8888服务会用它做随机数种子从模型自带的spk_stat.pt统计量生成一条 768 维音色向量并顺手写成speaker/8888.csv缓存下来。所以下次再用同一个号码声线是同一套。外部 .pt 音色怎么装进 speaker 目录如果你的音色来自 ModelScope 上下载的seed_xxx_restored_emb.pt这类文件0.96 版本之后不能直接用——ChatTTS 内核升级过旧格式要转一道。仓库根目录的 cover-pt.py 就是干这个的python cover-pt.py它只处理 speaker/ 目录下以seed_开头、以_emb.pt结尾的文件转换后改名为_emb-covert.pt结尾原文件可删。例如speaker/seed_2155_restored_emb.pt会变成seed_2155_restored_emb-covert.pt。转换脚本的两个注意点跑之前把下载的文件直接放进speaker/目录脚本不会扫描别的目录脚本提示没有可转换的 pt 文件时先检查文件名是否符合seed_前缀加_emb.pt后缀改名后再跑。音色效果怎么调prompt 标记与采样参数音色的味道由两部分决定音色向量本身号码或 .pt 文件和合成时的效果参数。效果参数走prompt字段用方括号标记拼接例如[oral_2][laugh_0][break_6][oral_X]口腔音效强度[laugh_X]笑声效果[break_X]停顿频率与时长采样侧的temperature是手感最直接的旋钮常规区间在 0.1~0.5往下压声音更平稳往上抬起伏更大。top_p、top_k一般保持 0.7 和 20 不动专门调它们收益不大。两个可以直接抄的场景有声书旁白选 2222 做底temperature0.2prompt 加[break_3]停顿自然长时间听不累。客服播报temperature0.1压低随机性不加 laugh 标记保证句式和语气尽量统一。用 /tts API 批量产出语音服务端点就一个POST /tts参数见上面的表返回 JSON 里带音频下载地址。程序化调用示例import requests res requests.post(http://127.0.0.1:9966/tts, data{ text: 这是有声书旁白的音色测试, custom_voice: 8888, temperature: 0.2, top_p: 0.7, top_k: 20, }) print(res.json())想一次性囤几条备选声线可以离线批量生成音色文件再丢进speaker/import torch, ChatTTS chat ChatTTS.Chat() chat.load(sourcecustom, custom_path./, devicecuda) for seed in [1234, 5678, 9012]: torch.manual_seed(seed) torch.save(chat.sample_random_speaker(), fspeaker/{seed}.pt)生成出来的 wav 文件名自带完整参数如seed1983、te0.1、tp0.701、tk20、textlen5对照文件名就能复现某条好听的配置项目也把测试样本惯例上放在listen-speaker/一类目录里留档方便回听。设备与显存2GB 阈值与 asset 目录app.py 启动时读device环境变量default/mps走select_device(min_memory2047)即显存空余不足约 2GB 就回退 CPU显存小于 4GB 的显卡官方建议直接用 CPU 档。走 GPU 推理时CUDA 11.8 配 8GB 以上显存体验比较稳。别忽略 asset 目录随机音色依赖spk_stat.pt均值/标准差它位于模型目录下的asset/里本机为models/pzc163/chatTTS/asset。如果报Missing spk_stat.pt或自定义种子生成失败先确认模型文件完整缺了这个文件整个自定义音色链路都走不通。常见坑文件不生效、音色没变化、质量差音色文件不生效确认文件名带.pt或.csv后缀且在speaker/根下0.96 之后下载的 ModelScope 音色必须先跑 cover-pt.py没转换的_emb.pt不会被加载。同一号码声音不一样这是已知行为——不同机器、甚至同一机器多次运行相同种子生成的音色都可能不同想要固定声线就把生成好的.csv/.pt文件留在speaker/里复用。效果太平淡或太飘先只动temperature0.1~0.5 之间试别一次改多个参数。声音质量差、有破音检查模型是否完整尤其asset/下的spk_stat.pt必要时按 faq.md 里的方法补齐缺失文件。音色定制做到这里就闭环了内置音色起步、外部音色文件落地、prompt 加参数微调剩下的只是按场景反复试听。后续如果仓库扩展了音色混合或社区音色共享接入方式也会继续沿用speaker/目录这套约定现在攒下的文件和参数习惯都能直接复用。【免费下载链接】ChatTTS-ui一个简单的本地网页界面使用ChatTTS将文字合成为语音同时支持对外提供API接口。A simple native web interface that uses ChatTTS to synthesize text into speech, along with support for external API interfaces.项目地址: https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

PDFMathTranslate(pdf2zh)PDF 中文翻译快速上手:两条命令跑通,公式与排版完整保留 2026/9/20 20:51:09

PDFMathTranslate(pdf2zh)PDF 中文翻译快速上手:两条命令跑通,公式与排版完整保留

PDFMathTranslate(pdf2zh)PDF 中文翻译快速上手:两条命令跑通,公式与排版完整保留 【免费下载链接】PDFMathTranslate [EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF…

阅读更多 →
GeoLibre 完整实操指南:五步从第一张地图到分享嵌入,跑通云原生 GIS 全流程 2026/9/20 20:51:09

GeoLibre 完整实操指南:五步从第一张地图到分享嵌入,跑通云原生 GIS 全流程

GeoLibre 完整实操指南:五步从第一张地图到分享嵌入,跑通云原生 GIS 全流程 【免费下载链接】GeoLibre A lightweight, cloud-native GIS platform for visualizing, exploring, and analyzing geospatial data. It runs in the web browser, on the des…

阅读更多 →
Hugging Face Trending:Kimi K2.7 Code 权重接到 TaoToken 2026/9/20 20:51:09

Hugging Face Trending:Kimi K2.7 Code 权重接到 TaoToken

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
圆锥曲线 Python 可视化 45 分钟实践指南:三个滑块做出交互演示 2026/9/20 20:51:09

圆锥曲线 Python 可视化 45 分钟实践指南:三个滑块做出交互演示

圆锥曲线 Python 可视化 45 分钟实践指南:三个滑块做出交互演示 【免费下载链接】Book3_Elements-of-Mathematics Book_3_《数学要素》 | 鸢尾花书:从加减乘除到机器学习;上架;欢迎继续纠错,纠错多的同学还会有赠书&am…

阅读更多 →
QuickRecorder macOS 屏幕录制指南:双音轨、窗口录制与演讲者前置实战 2026/9/20 20:51:09

QuickRecorder macOS 屏幕录制指南:双音轨、窗口录制与演讲者前置实战

QuickRecorder macOS 屏幕录制指南:双音轨、窗口录制与演讲者前置实战 【免费下载链接】QuickRecorder A lightweight screen recorder based on ScreenCapture Kit for macOS / 基于 ScreenCapture Kit 的轻量化多功能 macOS 录屏工具 项目地址: https://gitcode…

阅读更多 →
MicroPython rp2.PIO 类详解:RP2040 可编程 I/O(PIO)接口的进阶用法 2026/9/20 20:48:09

MicroPython rp2.PIO 类详解:RP2040 可编程 I/O(PIO)接口的进阶用法

MicroPython rp2.PIO 类详解:RP2040 可编程 I/O(PIO)接口的进阶用法 【免费下载链接】micropython MicroPython - a lean and efficient Python implementation for microcontrollers and constrained systems 项目地址: https://gitcode.c…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞