新闻详情

新闻详情

首页 / 资讯中心 / 详情

17秒转写13分钟音频:faster-whisper Whisper语音识别加速完整指南

发布时间:2026/10/2 1:53:54来源:尧图网络
17秒转写13分钟音频:faster-whisper Whisper语音识别加速完整指南
17秒转写13分钟音频faster-whisper Whisper语音识别加速完整指南【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisperfaster-whisper 是基于 CTranslate2 推理引擎实现的 OpenAI Whisper 语音识别方案模型权重与原版一致识别准确率不变。同一段 13 分钟音频GPU 批处理下 17 秒转完CPU 上 int8 量化 1 分 42 秒约为 openai/whisper 原版 6 分 58 秒的三分之一显存与内存占用同步下降。13分钟音频对比4种实现的耗时与内存数据来自项目 README 基准测试GPU 环境为 NVIDIA RTX 3070 Ti 8GBCUDA 12.4CPU 环境为 Intel i7-12700K8 线程GPUlarge-v2 模型实现精度耗时显存openai/whisperfp162m23s4708MBfaster-whisperfp161m03s4525MBfaster-whisperbatch_size8fp1617s6090MBfaster-whisperint859s2926MBfaster-whisperbatch_size8int816s4500MBCPUsmall 模型实现精度耗时内存openai/whisperfp326m58s2335MBfaster-whisperfp322m37s2257MBfaster-whisperint81m42s1477MBdistil-large-v3 任务上batch_size16 的 faster-whisper 比 transformers 快约 1.8 倍25m50s 对 46m12sWER 13.527 对 14.801精度也占优。另有两处工程上的简化无需系统级 FFmpeg音频解码由 pip 包内的 PyAV 完成内置 Silero VAD转写前即可滤掉静音段。环境清单Python 3.9、免 FFmpeg、CUDA 12 依赖Python ≥ 3.9当前发布版本 1.2.1核心依赖由 pip 自动解析ctranslate24.x、onnxruntime、av、tokenizers无需安装系统级 FFmpegGPU可选NVIDIA 显卡 CUDA 12 cuBLAS cuDNN 9仍在用 CUDA 11 或 cuDNN 8需固定ctranslate24.4.0更老环境用 3.24.0没有 GPU 也能跑CPU 配 int8 量化即可覆盖多数离线场景。 安装与首次转写三步拿到时间戳pip install faster-whisper python -c import faster_whisper; print(faster_whisper.__version__)打印出版本号 1.2.1 即安装成功。接着用 small 模型 int8 量化在 CPU 上转写仓库自带示例音频from faster_whisper import WhisperModel model WhisperModel(small, devicecpu, compute_typeint8) segments, info model.transcribe(tests/data/jfk.flac, beam_size5) for segment in segments: print(f[{segment.start:.2f}s - {segment.end:.2f}s] {segment.text})首次运行会从 Hugging Face 下载模型权重并缓存之后你会看到形如[0.00s - 2.44s] And so my fellow Americans...的带时间戳输出。一个易踩的坑segments 是生成器遍历前不会真正开始转写。需要全部结果时用list(segments)或 for 循环强制执行。参数速查表7个常用配置与适用场景参数常用取值适用场景devicecpu / cuda有 GPU 选 cudacompute_typefloat16 / int8_float16 / int8GPU 首选 float16显存紧张 int8_float16CPU 用 int8beam_size1–5默认 5越小解码越快越大识别越稳batch_size8 / 16长音频批量转写需 BatchedInferencePipelinevad_filterTrue过滤静音段阈值用 vad_parameters 调word_timestampsTrue词级时间戳用于字幕对齐、热词定位languageen / zh 等已知语种时跳过自动检测完整参数在 faster_whisper/transcribe.py 的 transcribe 方法签名与注释中逐项都有说明。3个高频场景批量转写、静音过滤、词级对齐批量转写BatchedInferencePipeline 的 transcribe 是常规调用的即插即用替换吞吐明显更高from faster_whisper import WhisperModel, BatchedInferencePipeline model WhisperModel(turbo, devicecuda, compute_typefloat16) pipeline BatchedInferencePipeline(model) segments, info pipeline.transcribe(audio.mp3, batch_size16)同一段 13 分钟音频large-v2 在 batch_size8 下从 1 分 03 秒压到 17 秒。静音过滤会议录音长段沉默多的传vad_filterTrue即可默认只移除超过 2 秒的静音判定阈值在 faster_whisper/vad.py 中可调segments, _ model.transcribe( audio.mp3, vad_filterTrue, vad_parametersdict(min_silence_duration_ms500), )注意批处理管线中 VAD 默认就是开启的。词级对齐需要字幕级对齐时传word_timestampsTrue从每个 segment 的 words 字段读各词起止时间。报错速查表GPU 报错、OOM、无输出现象可能原因解决办法加载 GPU 报 CUDA 相关错误缺 cuBLAS/cuDNN或 CUDA 11 配了新版 ctranslate2按 CUDA 12 安装 cuBLAS 与 cuDNN 9或降级ctranslate24.4.0GPU 显存不足OOM模型过大或 fp16 占用偏高compute_type 改 int8_float16或换更小模型转写速度远低于预期CPU 跑大模型或 beam_size 偏高小模型 int8或上 GPU长音频走批处理调用 transcribe 后一直无输出segments 是生成器遍历前不执行for 循环或 list(segments) 强制执行首次运行特别慢首次加载会从 Hugging Face 下载权重等待一次即可也可转换模型目录后直接加载延伸指引源码读参数基准脚本复现数字全部转写参数与默认值faster_whisper/transcribe.pyVAD 参数定义与默认阈值faster_whisper/vad.py复现前文数据运行 benchmark/ 下的速度、内存与 WER 脚本示例音频tests/data/含多语种、热词与说话人分离用例【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

AI视觉防尾随门系统落地:技术选型与工程实践 2026/10/2 2:43:29

AI视觉防尾随门系统落地:技术选型与工程实践

好的,我将按照上述要求,撰写一篇关于高档小区防尾随门项目落地的CSDN技术博客。文章将围绕AI视觉方案与AI摄像头的结合,深入剖析技术选型、系统架构、具体实施、环境适配、问题排查与工程实践,确保内容专业、详实且可直接落地。1.…

阅读更多 →
Python深度学习手语识别系统:从模型训练到实时部署全解析 2026/10/2 2:43:28

Python深度学习手语识别系统:从模型训练到实时部署全解析

简介:这是一套基于Python深度学习的手语识别项目,面向高校计算机相关专业学生及科研入门者,适用于毕业设计、课程设计或初期技术验证。项目采用OpenPose检测视频中人体关节点并绘制运动轨迹,再通过图像分类模型完成手语动作识别&a…

阅读更多 →
烟雾明火烟火火灾检测数据集:VOC/YOLO双格式与YOLOv8训练实战 2026/10/2 2:43:28

烟雾明火烟火火灾检测数据集:VOC/YOLO双格式与YOLOv8训练实战

简介:这是一套面向烟雾、明火场景的目标检测数据集,适合目标检测算法学习者、火灾预警系统开发者使用。数据包含3007张JPG图片,并配有同数量的Pascal VOC格式XML标注文件和YOLO格式TXT标注文件,全部由labelImg按矩形框方式标注&am…

阅读更多 →
本地多模态AI工作台搭建指南:部署、验证与API集成实践 2026/10/2 2:43:28

本地多模态AI工作台搭建指南:部署、验证与API集成实践

我造了一台“魔法机器”:本地多模态 AI 工作台搭建与验证笔记“魔法机器”这个说法,听起来有点中二,但把它拆开看,本质就是一台本地跑多模态 AI 模型的机器。它能做文生图、图生图、语音合成、OCR 文档解析,甚至批量处…

阅读更多 →
LLM Agent 应用实战:打造自动化执行任务的智能体 2026/10/2 2:43:28

LLM Agent 应用实战:打造自动化执行任务的智能体

我在开源社区里翻到过一个很有意思的标题:“我造了一台魔法机器”。第一反应是,这大概又是一篇凡尔赛式的项目分享。但真把材料看完之后,反而觉得这个标题特别准确——它说的不是科幻片里的魔法,而是现在开发者正在亲手搭建的一种…

阅读更多 →
脑网络图论分析:BCT工具包5个核心指标与实操手册 2026/10/2 2:43:21

脑网络图论分析:BCT工具包5个核心指标与实操手册

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉