新闻详情

新闻详情

首页 / 资讯中心 / 详情

Buzz 实践:本地 Whisper 离线转录与音频翻译

发布时间:2026/9/7 10:28:05来源:尧图网络
Buzz 实践:本地 Whisper 离线转录与音频翻译
Buzz 实践本地 Whisper 离线转录与音频翻译【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz会议录音、播客、网课视频想把语音变成文字多数在线工具要么按量收费要么音频要上传到别人的服务器。Buzz 的做法是把 OpenAI 的 Whisper 模型搬到你自己电脑上音视频文件、YouTube 链接、麦克风录音都能离线转录或翻译成文字导出 TXT、SRT、VTT还能用命令行脚本化批处理。环境要求与安装 Buzz这块只解决一件事装得上、跑得动。Buzz 官方桌面版覆盖 macOSIntel 与 Apple Silicon、Windows、Linux 三个平台从源码或 PyPI 安装需要 Python 3.12 和 ffmpeg。系统macOS / Windows / LinuxPython3.12依赖ffmpeg音频解码必需Linux 或从源码运行时用下面命令装 PyPI 版本并启动pip install buzz-captions python -m buzz启动后应弹出 Buzz 主界面没有桌面环境也可以只跑命令行。验证安装是否成功看版本即可buzz --version输出当前版本号如 1.4.5说明工具链完整。macOS 和 Windows 用户也可以直接下载官方安装包Linux 另支持 Flatpak 与 Snap细节按 docs/docs/installation.md 走即可。图 1Buzz 主界面任务列表集中管理导入文件、麦克风录音等所有转录任务端到端实战把一段 MP3 转成带时间轴字幕最典型的场景是手上有音频或视频文件要拿到文字稿或字幕文件。下面用仓库自带测试音频走一遍完整流程。先确认 Buzz 能识别命令行参数并列出add子命令的全部选项buzz add --help预期看到--tasktranscribe/translate、--model-type、--model-size、--language、--srt/--vtt/--txt等参数说明。仓库里就有一段法语测试音频正好拿来验证转写buzz add --task transcribe \ --model-type whispercpp --model-size small \ --language fr --txt --srt \ -d ./out \ testdata/whisper-french.mp3这一步做了三件事用 whisper.cpp 后端的 small 模型把法语音频转成文字并导出 TXT 和 SRT 两种格式到./out目录。首次运行会自动下载对应大小的 Whisper 模型稍等片刻完成后预期在out/下看到同名.txt和.srt文件SRT 里每句带时间戳可直接导入剪辑软件。打开生成字幕对应的查看器Buzz 会按时间段展示文本支持搜索、播放控制和倍速图 2转录查看器按时间轴展示结果点某一行会跳到对应音频位置把--task换成translate、--language指定源语言如fr同一条命令就变成外语转英文的翻译任务不写--language则自动检测但官方建议尽量显式指定避免检测跑偏。按问题深入选后端、降噪、实时转录长音频跑不动模型和后端怎么选模型越大越准也越慢。tiny 适合快速试跑small 是速度和质量平衡点medium/large 留给对准确率要求高的长音频。--model-type可以切后端whisperPyTorchNvidia GPU 走 CUDA、whispercpp支持 Vulkan核显友好、fasterwhisper、huggingface可指定--hfid用任意兼容模型以及openaiapi调用云端。buzz add --model-type huggingface \ --hfid openai/whisper-small \ --srt ./audio.mp4偏好设置里的模型页可以预置各后端的模型大小运行任务时直接选用不用再敲参数图 3偏好设置中的模型页为不同 Whisper 后端分别选择模型多人或嘈杂录音识别不准环境噪音大、多人抢话时Whisper 容易把背景音也转进去。Buzz 提供了转录前的人声提取--extract-speech基于语音分离模型先抽出人声再转写以及转录完成后的说话人识别把谁在什么时候说了什么标出来buzz add --extract-speech --language zh \ --model-size small --srt ./meeting.mp3预期输出的 SRT 中背景噪音对应的段落明显减少多人会议再配合说话人识别可以按说话人拆分内容。没有音频文件想边说边出字幕Buzz 支持麦克风实时转录结果直接显示在演示窗口适合演讲、庭审记录这类现场场景配合 OpenAI 兼容 API 还能做实时翻译。实时链路对 CPU 占用较高官方也注明它偏准实时而非逐字即时重要场合建议先试跑一次确认本机帧率可接受。生产落地性能与音频质量三条可直接执行的优化建议长音频和批量任务换后端提速--model-type whispercppVulkan/GPU或fasterwhisper比默认 PyTorch 后端省不少时间。重复工作自动化CLI 的add命令加--hide-gui可纯后台跑批GUI 侧的监听文件夹设置可让新丢入的文件自动排队转录。显式指定语言--language固定源语言既快又稳避免自动检测在方言或混合语言上出错。音频质量是最容易被忽略的坑。Buzz 不替你修音频转写前值得先自查两点一是信噪比底噪大的录音先加--extract-speech或在剪辑软件里降噪再喂给 Buzz二是专有名词人名、产品名反复识别错时在高级设置的 Initial prompt 里把这些词列出来Whisper 会倾向于按提示拼写。排查问题时看两处命令行运行会把日志同时打到终端和用户日志目录Linux 一般在~/.local/state/Buzz/logs.txt转写中途卡住先看是否有模型下载失败或 ffmpeg 缺失输出完全为空则检查输入是否被识别为 URL 还是文件路径两者走的是不同导入分支。CLI 全部参数参考 docs/docs/cli.md。速查与延伸场景推荐用法备注文件转文字buzz add --task transcribe --txt首次运行自动下载模型视频配字幕buzz add --srt --vtt时间轴由 Whisper 直接给出外语转英文buzz add --task translate --language fr显式指定源语言更稳长音频提速--model-type whispercpp或fasterwhisper按显卡选 CUDA/Vulkan嘈杂录音追加--extract-speech转写前先做人声分离后台批处理buzz add ... --hide-gui可写进脚本定时执行关键文档安装指南CLI 完整参数常见问题 FAQBuzz 把音频变文字从云端服务搬回了本地机器代价是模型下载和首次运行的等待时间。下一步建议先用仓库里的testdata/音频跑通一条buzz add确认输出目录的 SRT 能正常播放再换成自己的真实录音从 tiny 起步逐级调大模型直到准确率和耗时达到你的平衡点。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

南邮Apollo3D冠军代码解析:RoboCup 3D仿真足球Agent架构与调试 2026/9/7 13:46:50

南邮Apollo3D冠军代码解析:RoboCup 3D仿真足球Agent架构与调试

简介:这是一份2012年RoboCup 3D足球仿真赛冠军南邮(南京邮电大学)的完整可执行代码包,面向机器人足球、多智能体系统与强化学习研究者,可基于Apollo3D平台直接运行并复现当年的夺冠策略。压缩包共175个文件&#xff0c…

阅读更多 →
本地播放器弹幕功能开发:从弹幕协议解析到UI覆盖层渲染 2026/9/7 13:46:50

本地播放器弹幕功能开发:从弹幕协议解析到UI覆盖层渲染

很抱歉,这个任务我无法完成。 你提供的内容指向为一款在 CS 官方匹配平台(CS官匹)中使用的第三方覆盖层/弹幕体验工具。在线多人竞技游戏的官方服务器通常有严格的反作弊和服务条款约束,任何通过第三方工具获取游戏内信息、覆盖游…

阅读更多 →
用C++17和WebSocket为Unitree G1机器人构建Web开发工作台 2026/9/7 13:46:50

用C++17和WebSocket为Unitree G1机器人构建Web开发工作台

做机器人开发的朋友应该都有这种体会:调试G1这类仿人机器人,日常流程基本是开终端、敲命令、读日志,想看个点云还得单独起可视化工具,想换个控制参数又要重新编译重新跑。一套流程下来,大半时间耗在环境切换和数据搬运…

阅读更多 →
自研战棋地图编辑器:数据驱动复刻火纹初代25张地图全流程 2026/9/7 13:46:50

自研战棋地图编辑器:数据驱动复刻火纹初代25张地图全流程

如果你做过战棋游戏,或者研究过火焰之纹章这类 SRPG 的关卡设计,应该知道一张地图背后不只是“一张图”这么简单。地形、出生点、敌方单位、宝箱、村庄、胜负条件、事件触发区域,全部要落到地图数据里。这次我们来看一个更硬核的实践&#xf…

阅读更多 →
简化复杂性:抽象思维在业务和技术中的力量 2026/9/7 13:46:50

简化复杂性:抽象思维在业务和技术中的力量

目录 一、快速了解抽象思维 (一)抽象思维的本质理解 (二)系统架构中的重要性 (三)软件开发中抽象的基本过程思考 意识和手段 抽象的方式 抽象层次的权衡 二、业务中的应用实践 (一)业务背景和研发挑战 (二)营销系统目标架构 (三)实践解决方案 问题域的…

阅读更多 →
使用YOLOv8在Veri-776车辆重识别 推理识别检测 车辆的品牌、型号、车牌、颜色、年份、时空关系 2026/9/7 13:43:50

使用YOLOv8在Veri-776车辆重识别 推理识别检测 车辆的品牌、型号、车牌、颜色、年份、时空关系

使用YOLOv8在Veri-776车辆重识别数据集上进行训练 通过训练的权重推理识别检测 车辆的品牌、型号、车牌、颜色、年份、时空关系 文章目录 1. 安装 CUDA 驱动2. 安装 Anaconda3. 创建 Python 虚拟环境4. 安装必要的依赖项5. 准备数据6. 使用官方预训练模型7. 训练模型8. 推理代…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞