新闻详情

新闻详情

首页 / 资讯中心 / 详情

如何用一条命令做多说话人语音识别:2小时会议录音变出谁说了什么的完整转录

发布时间:2026/9/30 7:48:36来源:尧图网络
如何用一条命令做多说话人语音识别:2小时会议录音变出谁说了什么的完整转录
如何用一条命令做多说话人语音识别2小时会议录音变出谁说了什么的完整转录【免费下载链接】whisper-diarizationAutomatic Speech Recognition with Speaker Diarization based on OpenAI Whisper项目地址: https://gitcode.com/GitHub_Trending/wh/whisper-diarization开完会只剩一堆录音文件想查谁在哪个时间点说了什么只能反复拖动进度条。Whisper Diarization 是一个开源说话人分离工具基于 OpenAI Whisper 做多说话人语音识别自动区分录音中每位说话人生成带时间戳的完整转录。一条命令跑起来带说话人标签的转录与 SRT 字幕环境要求Python 3.10 以上安装 FFmpeg 和 Cython获取代码git clone https://gitcode.com/GitHub_Trending/wh/whisper-diarization运行python diarize.py -a 你的音频文件结束后在音频同目录得到带说话人标签的转录和 SRT 字幕三段式流水线从 Whisper 语音转文字到说话人分离与时间戳对齐音频按顺序经过三道工序前一步的产出是后一步的输入语音转文字faster-whisper 把音频转成文本自动检测语言支持多语言识别说话人分离先从音频中剥离出人声轨提高嵌入精度再由 diarization/msdd/ 中的 MSDD 模型做 VAD 分段与说话人嵌入判断每段是谁说的时间戳对齐强制对齐为每个词标定起止时间再用标点恢复补偿微小时间偏移最后把说话人标签落到每一句上时间戳与说话人身份逐词绑定这正是它能做会议录音自动区分说话人的原因。 拿一段会议录音走完整流程从录音到文本和字幕以一段两小时的多人会议录音为例输入后运行一次命令会在音频同目录得到两个文件.txt 转录每段前带说话人标签形如 Speaker 1: 同一说话人的连续发言归入同一段可直接通读核对.srt 字幕标准 SRT 格式每条含序号、时间范围和说话人加文本可直接用于视频编辑与内容发布同样的流程换成客服中心通话录音可自动区分客服与客户的对话用于服务质量评估用于播客或访谈素材则得到带说话人标签的字幕方便内容检索与分发。真正影响效果的三个参数模型、批次与数字抑制--whisper-model默认 medium.en追求精度或非英语录音换更大的模型资源受限时换小的--batch-size默认 8显存不足时调低设为 0 可关闭批处理推理--suppress_numerals数字多且时间戳对不上时加上数字按发音文字转写提高对齐精度 遇到问题怎么办内存不足、识别错人、速度慢长音频内存不足 → 模型与批次占满显存 → 调低 --batch-size 或换更小的 --whisper-model说话人识别不准 → 背景噪音大或录音质量差 → 换干净的录音保留默认的声源分离人声剥离开关用 --no-stem 才关闭处理速度慢 → 两个模型串行执行 → 改用 diarize_parallel.py 并行跑结果与串行版一致需显存不低于 10GB目前为实验功能当前边界与主要入口文件重叠说话目前处理得有限标点恢复也只覆盖部分语言作者正在改进这两点与并行算法。参数与主流程在 diarize.py输出格式与标点恢复逻辑在 helpers.py。【免费下载链接】whisper-diarizationAutomatic Speech Recognition with Speaker Diarization based on OpenAI Whisper项目地址: https://gitcode.com/GitHub_Trending/wh/whisper-diarization创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Ubuntu 20.04 NVIDIA显卡驱动与CUDA安装全攻略 2026/9/30 8:45:48

Ubuntu 20.04 NVIDIA显卡驱动与CUDA安装全攻略

聊Ubuntu 20.04 下装 NVIDIA 显卡驱动和 CUDA,我估计绝大多数人是被深度学习、ORB-SLAM3、Blender 渲染这些活儿给逼过来的。我也不例外,当年第一次在 Ubuntu 下装显卡驱动,直接黑屏,当场把我心态干崩了。后来在服务器、台式机、笔…

阅读更多 →
Java异常处理实战:从设计到线上排查的完整方法论 2026/9/30 8:45:41

Java异常处理实战:从设计到线上排查的完整方法论

做Java开发这些年,最让我头疼的不是业务逻辑写不出来,而是线上报了一堆异常却找不到根因。尤其是像NullPointerException这种,日志里密密麻麻堆了几百行,翻到最后发现是某个对象没判空。今天把这两年处理Java异常的经验整理一篇&a…

阅读更多 →
微信小程序+云开发:打造学生知识成果展示平台 2026/9/30 8:45:41

微信小程序+云开发:打造学生知识成果展示平台

1. 项目动机:被"十个 PDF 附件"逼出来的展示平台1.1 学生成果展示的真实痛点先说个实际场景。临近毕业那阵子,我帮一位学弟整理他的求职材料,他的简历上写了不少项目经历,但面试官想看具体成果时,他把课程设…

阅读更多 →
给LLM Agent装上后视镜:基于MCP与Docker的三层记忆系统实战 2026/9/30 8:45:41

给LLM Agent装上后视镜:基于MCP与Docker的三层记忆系统实战

1. 从“hindsight”说起:为什么我们需要给Agent装上“后视镜”第一次看到“hindsight”这个词,我脑子里蹦出来的不是词典释义,而是自己踩过的一个坑。去年我搭了一个基于LLM的客服Agent,上线头一周表现还行,第二周开始…

阅读更多 →
深入理解spring.factories:Spring Boot自动配置的幕后功臣 2026/9/30 8:45:34

深入理解spring.factories:Spring Boot自动配置的幕后功臣

有段时间我一直想不通一个问题:我明明没有配置Redis的数据源,也没手动写任何RedisTemplate的Bean,为什么项目一启动就自动能用RedisTemplate?后来跟到Spring Boot启动的Debug调用链,才发现幕后黑手是一个叫spring.fact…

阅读更多 →
SSM+Vue实战:社区快递管理系统从需求到设计实现全解析 2026/9/30 8:45:34

SSM+Vue实战:社区快递管理系统从需求到设计实现全解析

1. 为什么"社区快递管理系统"是毕设选题里的稳妥选择 每年的毕业设计选题季,我都能看到大量学生困在同一批问题上:既要功能"看起来够用",又怕技术栈太偏门;既要代码量凑得起来,又怕查重和答辩撑不…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉