新闻详情

新闻详情

首页 / 资讯中心 / 详情

如何让 faster-whisper 快 4 倍:语音转文字工具从安装到批量推理教程

发布时间:2026/9/5 19:15:07来源:尧图网络
如何让 faster-whisper 快 4 倍:语音转文字工具从安装到批量推理教程
如何让 faster-whisper 快 4 倍语音转文字工具从安装到批量推理教程【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper开篇速览faster-whisper 用 CTranslate2 重写了 OpenAI Whisper 的语音转文字推理在相同精度下最高提速 4 倍内存占用更低。它面向需要批量处理音频的开发者和官方实现相比不用装 FFmpeg还支持 8 位量化。典型使用场景长音频批量转写会议录音、播客、视频字幕生成用批量推理把 GPU 吃满精确时间戳字幕和歌词对齐需要每个词的起止时间作为下游工具的后端WhisperX、whisper-diarize 等项目直接拿它做转写层加载自训练模型把你微调的 Whisper 模型转成 CTranslate2 格式继续用官方基准测试的条件同一段 13 分钟音频、large-v2 模型、beam size 5GPU 为 CUDA 12.4 NVIDIA RTX 3070 Ti 8GB实现方式精度耗时显存占用openai/whisperfp162m23s4708MBwhisper.cpp (Flash Attention)fp161m05s4127MBfaster-whisperfp161m03s4525MBfaster-whisper (batch_size8)fp1617s6090MBfaster-whisperint859s2926MBfaster-whisper (batch_size8)int816s4500MBCPU 侧同样有优势在 Intel i7-12700K 8 线程下small 模型 int8 模式 1m42s 完成openai/whisper 用 6m58s而 faster-whisper 的内存占用只有 1477MB。运行前检查Python 3.9 及以上setup.py 中python_requires3.9不需要安装 FFmpeg。音频解码由 PyAV 库完成它把 FFmpeg 库打包在了 wheel 里GPU 可选。启用需要安装 cuBLASCUDA 12 版和 cuDNN 9版本兼容是这里最容易卡住的地方最新 ctranslate2 只支持 CUDA 12 cuDNN 9。你的环境是 CUDA 11 / cuDNN 8 时执行pip install --force-reinstall ctranslate23.24.0降级CUDA 12 配 cuDNN 8 则降到ctranslate24.4.0。三步跑通Step 1安装一条命令装好依赖包括 ctranslate2、onnxruntime、av 等都在 requirements 里锁了版本范围pip install faster-whisper想用 master 分支时可以用 pip 直接拉源码包安装README 里有对应命令。Step 2最小转写示例from faster_whisper import WhisperModel model WhisperModel(large-v3, devicecuda, compute_typefloat16) segments, info model.transcribe(audio.mp3, beam_size5) print(info.language, info.language_probability) for segment in segments: print(f[{segment.start:.2f}s - {segment.end:.2f}s] {segment.text})没有显卡就用devicecpu配合compute_typeint8模型按名称加载时会自动从 Hugging Face Hub 下载到本地缓存首次运行会有一段下载等待。Step 3看懂输出第一行打印检测出的语言和概率例如en 0.99之后每个段落一行格式是起始秒 - 结束秒 文本。注意segments是生成器真正开始转写发生在你迭代它的那一刻。想在拿到结果前跑完直接segments list(segments)即可。进阶用法批量推理多段音频一起喂给模型GPU 利用率更高基准里 large-v2 从 1m03s 压到 17s。BatchedInferencePipeline.transcribe是WhisperModel.transcribe的直接替代品参数基本通用from faster_whisper import WhisperModel, BatchedInferencePipeline model WhisperModel(turbo, devicecuda, compute_typefloat16) batched_model BatchedInferencePipeline(modelmodel) segments, info batched_model.transcribe(audio.mp3, batch_size16)输出格式和单条转写一致。批量模式下 VAD 过滤默认开启无需额外设置。词级时间戳与 VAD 过滤做字幕对齐时加word_timestampsTrue每个 segment 的words列表里每个词都有 start、end、word 三个字段直接拿去渲染字幕。音频里静音很多时开vad_filterTrue它调用 Silero VAD 跳过无声段。默认配置偏保守只剔除超过 2 秒的静音检测阈值 threshold 默认 0.5。想更激进就传vad_parametersdict(min_silence_duration_ms500)参数含义都写在 vad.py 的文档字符串里。模型选择与自定义模型转换按名字加载的模型tiny 到 large-v3、turbo、distil-large-v3都自动下载。蒸馏模型 distil-large-v3 专为这个包设计官方建议搭配languageen和condition_on_previous_textFalse使用。自己有微调好的 Whisper 模型时用转换脚本一次搞定之后把本地目录传给WhisperModel就能加载ct2-transformers-converter --model openai/whisper-large-v3 --output_dir whisper-large-v3-ct2 --quantization float16--model也可以填本地模型目录不加--copy_files tokenizer.json的话加载模型时会再自动下载一次 tokenizer 配置。代码地图faster_whisper/transcribe.py主转写逻辑WhisperModel 和 BatchedInferencePipeline 都在这里faster_whisper/audio.py用 PyAV 解码音频并重采样到 16kHzfaster_whisper/feature_extractor.py对波形做 STFT 并提取 mel 频谱特征faster_whisper/tokenizer.py文本与时间戳 token 的编解码把 token 拆成词faster_whisper/vad.py封装 Silero VAD切出有声片段并记录时间偏移faster_whisper/utils.py模型下载、版本信息与时间戳格式化生态与集成speachesOpenAI 兼容的服务端支持 Docker 部署、流式和实时转写WhisperX提供说话人分离和基于 wav2vec2 对齐的词级时间戳whisper-ctranslate2命令行客户端接口兼容 openai/whisper 原版客户端whisper-diarize结合 NVIDIA NeMo 的说话人分离工具WhisperLive接近实时的转写实现faster-whisper 是其推荐后端常见坑现象调用 transcribe 后立刻结束没有任何输出或把 segments 传给别人用结果一直是空的。解法它是生成器不迭代就不转写。自己消费就遍历或先list(segments)把它物化再往下传。现象GPU 加载时报 cuBLAS 或 cuDNN 找不到、版本不匹配。解法核对 ctranslate2 与驱动栈版本。CUDA 11 环境降级到 ctranslate2 3.24.0CUDA 12 cuDNN 8 降级到 4.4.0或者直接改用 Docker 镜像nvidia/cuda:12.3.2-cudnn9-runtime-ubuntu22.04省事。现象拿它和 openai/whisper 对比时速度翻车看起来并不更快。解法两边默认参数不一致这里默认 beam size 是 5openai/whisper 是 1。对比前统一 beam_size、确认 WER 接近CPU 场景还要用OMP_NUM_THREADS4这类方式固定线程数。写在最后faster-whisper 采用 MIT 协议开源当前版本 1.2.1。获取源码git clone https://gitcode.com/GitHub_Trending/fa/faster-whisper【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

AGENTS.md 完整教程:5 步让 AI 编码助手听懂你的项目 2026/9/5 19:51:14

AGENTS.md 完整教程:5 步让 AI 编码助手听懂你的项目

AGENTS.md 完整教程:5 步让 AI 编码助手听懂你的项目 【免费下载链接】agents.md AGENTS.md — a simple, open format for guiding coding agents 项目地址: https://gitcode.com/GitHub_Trending/ag/agents.md 上次让 AI 编码助手写个接口,代码…

阅读更多 →
中小理发店极简会员管理系统:从需求分析到技术实现全解析 2026/9/5 19:51:14

中小理发店极简会员管理系统:从需求分析到技术实现全解析

简介:这是一套专为中小理发店、社区店及夫妻店设计的轻量级会员管理源码系统,聚焦真实经营场景,解决客户信息分散、充值消费难追溯、员工业绩统计低效等痛点。资源共74个文件,包含37个Java后端逻辑文件、5个Vue前端页面组件、11张…

阅读更多 →
DeepSeek V4 Pro 0813版结构化评测与生产切换指南 2026/9/5 19:51:14

DeepSeek V4 Pro 0813版结构化评测与生产切换指南

模型圈子里,DeepSeek V4 Pro 0813 正式版这种带着日期的版本号,最容易引发两类反应:一是立刻去聊天窗口试几句,二是担心自己错过了一次重要升级。两类反应都能理解,但真正有价值的是第三种:先把“新版本来了…

阅读更多 →
C++ Qt MySQL图书管理系统实战:面向真实图书馆的高性能桌面方案 2026/9/5 19:51:14

C++ Qt MySQL图书管理系统实战:面向真实图书馆的高性能桌面方案

简介:本资源是一个基于C与Qt框架开发、后端集成MySQL数据库的完整图书管理系统,面向计算机专业本科生课程设计、毕业设计及C/GUI开发初学者,解决图书信息录入、读者管理、借阅归还、批量导入等典型业务场景的工程实践需求。压缩包共56个文件&…

阅读更多 →
MCP Everything Reference Server 工作原理详解:条件工具注册、资源订阅、会话级资源与模拟日志机制 2026/9/5 19:51:14

MCP Everything Reference Server 工作原理详解:条件工具注册、资源订阅、会话级资源与模拟日志机制

MCP Everything Reference Server 工作原理详解:条件工具注册、资源订阅、会话级资源与模拟日志机制 【免费下载链接】servers Model Context Protocol Servers 项目地址: https://gitcode.com/GitHub_Trending/se/servers 本文基于 modelcontextprotocol se…

阅读更多 →
flash-attention 编译安装完整指南:三条命令源码编译,不再卡在 CUDA 版本上 2026/9/5 19:48:14

flash-attention 编译安装完整指南:三条命令源码编译,不再卡在 CUDA 版本上

flash-attention 编译安装完整指南:三条命令源码编译,不再卡在 CUDA 版本上 【免费下载链接】flash-attention Fast and memory-efficient exact attention 项目地址: https://gitcode.com/GitHub_Trending/fl/flash-attention 预编译 wheel 里没…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞