新闻详情

新闻详情

首页 / 资讯中心 / 详情

Edge-TTS 新手教程:完全免费的文本转语音,5 分钟生成第一个语音文件

发布时间:2026/10/7 6:38:29来源:尧图网络
Edge-TTS 新手教程:完全免费的文本转语音,5 分钟生成第一个语音文件
Edge-TTS 新手教程完全免费的文本转语音5 分钟生成第一个语音文件【免费下载链接】edge-ttsUse Microsoft Edges online text-to-speech service from Python WITHOUT needing Microsoft Edge or Windows or an API key项目地址: https://gitcode.com/GitHub_Trending/ed/edge-tts给视频或课件配上中文解说自己录音耗时外包配音又要花钱。Edge-TTS 是一个免费的语音合成工具用 Python 调用微软 Edge 的在线文本转语音服务不需要 API Key5 分钟就能得到第一个 mp3 文件。Edge-TTS 是什么免费在哪它做的事情很直接把你的文字发到微软 Edge 的云合成接口换回标准 mp3不装 Edge 浏览器、不依赖 Windows也没有授权费。音色库有上百个覆盖中文、英文、日文、法文等语速、音量、音调都可以调还能顺带导出 SRT 字幕。一条命令装好pip 还是 pipx两种装法各对应一种用法如果你要在项目里import edge_tts用 pip如果你只打算在终端敲edge-tts用 pipx 更省心它会把依赖隔离到独立环境里不污染全局 Python。pip install edge-tts # 给 Python 代码用 pipx install edge-tts # 只装命令行工具30 秒生成第一个 mp3下面这条命令把一句话合成为 hello.mp3写完直接可以播放edge-tts --text 欢迎使用 Edge-TTS --write-media hello.mp3提示不加--write-media时命令会警告音频将写到终端并等你按回车建议一开始就带上这个参数。选音色、调语速edge-tts 参数速查音色先查表。第一条命令打印所有可用音色列包括 Name、Gender、ContentCategories、VoicePersonalities中文音色都以 zh- 开头第二条命令挑一个音色并做 edge-tts 语速调整减慢 10% 语速、压低 20% 音量出来的声音会沉稳不少edge-tts --list-voices edge-tts --voice zh-CN-XiaoxiaoNeural --rate-10% --volume-20% --text 调整语速与音量 --write-media tune.mp3参数作用默认值示例--voice音色名en-US-EmmaMultilingualNeuralzh-CN-XiaoxiaoNeural--rate语速0%-10%--volume音量0%-20%--pitch音调0Hz50Hz--write-media音频输出文件输出到终端demo.mp3--write-subtitlesSRT 字幕文件不导出demo.srtedge-tts python 示例同步与异步命令行只是 Python API 的封装核心类只有一个edge_tts.Communicate(text, voice)。脚本是同步写法的话save_sync会阻塞到 hello.mp3 写完再往下走import edge_tts communicate edge_tts.Communicate(Hello World!, en-GB-SoniaNeural) communicate.save_sync(hello.mp3)文本量大时换成异步版下面这个例子用中文女声晓晓生成 demo.mp3import asyncio import edge_tts async def run(): communicate edge_tts.Communicate(异步语音合成示例, zh-CN-XiaoxiaoNeural) await communicate.save(demo.mp3) asyncio.run(run())批量处理多段文本时把调用放进循环、用asyncio.gather并行提交即可网络偶发抽风的话加上最多 3 次、间隔 2 秒的重试for attempt in range(3): try: await edge_tts.Communicate(text, voice).save(out.mp3) break except Exception: await asyncio.sleep(2)用在哪里源码怎么组织edge-tts/ ├── src/edge_tts/ # 核心库合成通信、音色列表、字幕生成 ├── src/edge_playback/ # edge-playback 实时播放命令 ├── examples/ # 六个可运行示例同步/异步、带字幕 └── tests/ # 长文本测试脚本两类典型用法都对应得上内容生产场景播客文稿、电子书朗读、课件配音用save批量产出 mp3 和字幕交互场景网页朗读、设备通知播报用edge-playback命令边合成边播。仓库里的 examples/ 放着六个示例脚本核心逻辑在 src/edge_tts/其中 communicate.py 负责与合成服务的 WebSocket 对话。提示edge-playback在 Linux 和 macOS 上要先装 mpv 播放器Windows 则用系统自带组件直接就能播。edge-tts 常见问题排查Qedge-playback在 Linux/macOS 上不发声A先安装 mpvWindows 无需此步骤。Q合成卡住或提示没收到音频A多半是网络问题换个网络重试需要走代理的环境加--proxy参数。Qpip 安装报权限错误A加--user参数或装进虚拟环境。Q上百个音色怎么选A跑edge-tts --list-voices按 Gender 和 ContentCategories 两列筛选edge-tts 中文语音都带 zh- 前缀。Edge-TTS 把文字变声音从一次外包流程变成一条当场能跑的命令。下次需要时直接复制edge-tts --text 你好世界 --write-media hello_world.mp3等 mp3 生成完就能听。【免费下载链接】edge-ttsUse Microsoft Edges online text-to-speech service from Python WITHOUT needing Microsoft Edge or Windows or an API key项目地址: https://gitcode.com/GitHub_Trending/ed/edge-tts创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

【外设】之大彩串口显示屏 2026/10/6 15:16:42

【外设】之大彩串口显示屏

大彩串口屏初步使用 1 .官网下载 STM32 屏幕 GUI 设计资料 http://www.gz-dc.com/category/typeid/4112 找到 STM32 Keil 工程,移植相关代码因项目而异进行移植,由于项目简单,本人只对用到的指令接口进行修改。 比如:注意事项&…

阅读更多 →
无法下载Windows系统iso文件 2026/10/4 15:02:13

无法下载Windows系统iso文件

当我遇到这个问题的时候,我打开了一个网站: 登录 然后我打算下载的时候: 突然那个官方的连接就可以下载了:

阅读更多 →
【清华代码熊】DeepSeek V4.1 Flash 后训练详解 2026/10/6 15:18:24

【清华代码熊】DeepSeek V4.1 Flash 后训练详解

📌 上期解析了 DeepSeek V4.1 Flash 模型架构改进,本期解析 DeepSeek V4.1 Flash 预训练/后训练技术: 🌟 预训练:45T 文本 多模态混合语料、直接训练 sparse attention(取消 DeepSeek V4 的 dense 冷启动&…

阅读更多 →
Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic ... 2026/10/6 16:48:59

Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic ...

文章主要内容和创新点 主要内容 本文聚焦于多模态大语言模型(MLLM)强化学习(RL)训练中的效率问题,提出了一个名为Shuffle-R1的框架。研究发现,当前RL训练存在两个关键缺陷: 优势值坍缩(Advantage Collapsing):批次中大多数优势值集中在零附近,导致有效梯度信号被淹…

阅读更多 →
PRvL: Quantifying the Capabilities and Risks of Large Language Models for PII Redaction 2026/10/4 14:31:34

PRvL: Quantifying the Capabilities and Risks of Large Language Models for PII Redaction

一、文章主要内容总结 本文聚焦于利用大型语言模型(LLMs)实现个人身份信息(PII)脱敏的研究,旨在解决传统脱敏方法(如基于规则的系统、领域特定命名实体识别(NER)模型)泛化能力差、跨格式/跨语境适应性弱的问题。 研究通过全面评估多种LLM架构(包括密集型LLM(D-LLM…

阅读更多 →
LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model 2026/10/6 16:58:56

LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model

文章主要内容和创新点 主要内容 本文聚焦于二进制图像-文本相关性评估任务(判断图像与文本“相关”或“不相关”),针对该任务中文本格式多样、相关性定义随场景变化等挑战,提出了基于多模态大语言模型(MLLM)的解决方案LLaVA-RE。 模型设计:LLaVA-RE基于LLaVA 1.5架构,…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉