新闻详情

新闻详情

首页 / 资讯中心 / 详情

如何用 Whisper Diarization 三步从一段录音中拿到带说话人标签的转录稿

发布时间:2026/9/30 11:00:04来源:尧图网络
如何用 Whisper Diarization 三步从一段录音中拿到带说话人标签的转录稿
如何用 Whisper Diarization 三步从一段录音中拿到带说话人标签的转录稿【免费下载链接】whisper-diarizationAutomatic Speech Recognition with Speaker Diarization based on OpenAI Whisper项目地址: https://gitcode.com/GitHub_Trending/wh/whisper-diarizationWhisper Diarization 是基于 OpenAI Whisper 的自动语音识别工具它一次完成说话人分离与文字转写输出带说话人标签的转录稿和标准 SRT 字幕文件。适合需要把会议录音、访谈、播客快速变成可检索文本的人。 一段录音不好翻怎么知道谁说了什么会议结束留下一段两小时的录音。想查“这句话是谁说的”只能把整段音频从头听到尾。就算转成了文字没有说话人标签文稿还是一大团谁都不想看。 三条命令跑通从克隆到出稿先备好三样东西Python 3.10、FFmpeg、Cython。然后在项目目录里依次运行git clone https://gitcode.com/GitHub_Trending/wh/whisper-diarizationpip install -c constraints.txt -r requirements.txtpython diarize.py -a 你的音频文件.mp3跑完带说话人标签的转录稿就出来了。它是怎么做到的四级流水线先单独拎出人声处理前先用 Demucs 把原音频里的人声轨分离出来减少背景音乐和噪声对说话人识别的干扰。如果音频本身是纯人声加--no-stem可跳过这一步处理逻辑在 diarize.py 里。用 Whisper 转写并逐词对齐用 faster-whisper 做转写默认模型medium.en。同时用 ctc-forced-aligner 做强制对齐给每个词标出精确的起止时间戳这是后面把词对到说话人名下的基础。把每个词归给对的人默认的 MSDD 模型给出每个说话人的活动时间段也可以用--diarizer sortformer换成 Sortformer上限 4 人。流水线再按词的时间戳逐个匹配到对应说话人模型在 diarization/ 目录中。恢复标点修正句界对英语、法语等受支持的语言用标点恢复模型补回句末标点再按句子重新对齐说话人归属修正句首句尾的时间戳漂移。匹配逻辑见 helpers.py。 三个真实用法纪要、字幕、并行加速会议录音转带标签纪要输入是会议录音。运行python diarize.py -a 会议.mp3得到逐段标注 Speaker 0、1、2 的 .txt 文稿外加一份对应的 .srt。播客转视频直接可用的字幕输入是播客音频命令同上。得到的 .srt 每条都是“Speaker X文字”格式并带时间码可直接导入剪辑软件出字幕。显存 10GB 以上的 GPU 走并行运行python diarize_parallel.py -a 你的音频.mp3。它让 NeMo 与 Whisper 各占一个进程同时跑结果与串行版一致速度更快作者标注该模式为实验特性。常用参数怎么调参数作用建议值-a要处理的音频文件必填你的文件路径--whisper-modelWhisper 转写模型medium.en默认非英语换对应多语言版本--batch-size批量推理大小默认 8显存不足就调小0 为关闭批量--diarizer说话人分离模型msdd默认人数不限sortformer限 4 人以内--language手动指定语言留空自动检测检测失败时手动填调优建议出现显存不足先降--batch-size再考虑--device cpu文稿里数字很多就加--suppress_numerals数字会转成文字形式对齐更准。 跑完你会得到哪两个文件xxx.txt分段的转录文稿每段开头标注说话人标签。xxx.srt标准 SRT 字幕文件每条含时间码与说话人。运行中的临时文件temp_outputs_*结束后自动删除。 三个最常见的报错及对策运行中显存不足OOM原因批量太大或显存不够。对策调小--batch-size可到 0或换更小的--whisper-model。语言识别错、转写乱码原因自动检测失败或给仅支持英语的.en模型指定了其他语言。对策手动指定--language.en模型只处理英语音频。说话人切换处错标、文稿数字多原因数字符号干扰强制对齐时间戳有轻微漂移。对策加--suppress_numerals重跑。谁该用深入看哪里需要把录音批量变成可检索文本的会议记录、字幕制作、客服分析场景选它合适。想理解分离模型看 diarization/想改说话人映射和字幕输出逻辑看 helpers.py。项目目前也在推进重叠说话处理与 SRT 句长限制两个方向。现在就可以拿一段自己的音频把那条命令跑起来。【免费下载链接】whisper-diarizationAutomatic Speech Recognition with Speaker Diarization based on OpenAI Whisper项目地址: https://gitcode.com/GitHub_Trending/wh/whisper-diarization创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

物联网设备数据采集与分析全链路实战:从协议选型到运营闭环 2026/9/30 11:26:47

物联网设备数据采集与分析全链路实战:从协议选型到运营闭环

干物联网这行这几年,我见过太多项目是在“上系统”之前没想清楚:设备接上来了,数据也存了,回头看却不知道下一步怎么用。真正能把物联网(IoT)大数据运营做起来的团队,多数不是把精力花在炫酷面板…

阅读更多 →
HTTPS下GET与POST的区别:从幂等性到安全性,一文讲透 2026/9/30 11:26:40

HTTPS下GET与POST的区别:从幂等性到安全性,一文讲透

刚工作那两年,我被一个面试题问懵过:“说一说GET和POST的区别。”我巴拉巴拉背了一堆:GET参数在URL里,POST在body里;GET有长度限制,POST没有;GET比POST快……后来面试官追问了一句:“…

阅读更多 →
100. 如何绘制平坦式原理图?I Cadence Allegro 电子设计 快问快答 2026/9/30 11:26:27

100. 如何绘制平坦式原理图?I Cadence Allegro 电子设计 快问快答

平坦式原理图是一种基础且直观的电路设计方式,其所有页面处于同一层次,通过跨页连接符(Off-Page Connector) 实现不同页面之间的信号连接。绘制平坦式原理图的过程,本质上与创建一个标准原理图工程十分相似——从新建工…

阅读更多 →
CTF夺旗赛从入门到拿奖 零基础CTF训练路线——学生党最火的网安进阶玩法! 2026/9/30 11:26:27

CTF夺旗赛从入门到拿奖 零基础CTF训练路线——学生党最火的网安进阶玩法!

网安圈里,学生党最羡慕的是什么? 不是"会挖洞",而是——CTF拿奖。 为什么CTF这么火?因为它是网安能力最硬的"证明": 简历写"CTF获奖",面试官眼睛都亮保研、求职、大厂实习&a…

阅读更多 →
启动与链接 2026/9/30 11:26:20

启动与链接

启动流程:从向量表的第一项到main,首先初始化MSP主栈指针,后进入Reset_Handlerg_pfnVectors:.word _estack /* 初始主栈指针 (MSP) - 硬件自动加载 */.word Reset_Handler /* 复位入口 - 硬件自…

阅读更多 →
【MySQL】上 2026/9/30 11:26:20

【MySQL】上

一:MySQL概述数据库(DataBase DB): 存储数据的仓库,数据是有组织的进行存储数据库管理系统(DataBase Management Sysstem DBMS): 操纵和管理数据库的大型软件SQL(Structured Query Language): 操作关系型数据库的编程语言,定义了一套操作关系…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉