新闻详情

新闻详情

首页 / 资讯中心 / 详情

Sherpa-onnx 实时语音识别实战:4 步跑通 Parakeet-tdt-0.6b-v2 本地转写

发布时间:2026/9/12 17:51:53来源:尧图网络
Sherpa-onnx 实时语音识别实战:4 步跑通 Parakeet-tdt-0.6b-v2 本地转写
Sherpa-onnx 实时语音识别实战4 步跑通 Parakeet-tdt-0.6b-v2 本地转写【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnxSherpa-onnx 是完整离线的语音工具链本文以 Parakeet-tdt-0.6b-v2 模型为例带你在本机构建项目、下载模型并跑通麦克风实时转写示例最终得到一条延迟压在 300ms 以内的本地语音转文字链路不依赖 GPU。远程会议里你在记纪要同事一句话讲完你的记录还在半空转写工具的文字总比话音慢半拍。你要的很简单话音刚落字就上屏音频还不必离开自己的设备。Sherpa-onnx 加上 Parakeet-tdt-0.6b-v2做的就是这件事。一次装好环境并下好模型先给结论克隆、编译一次、跑一条下载脚本你就可以开始说话。git clone https://gitcode.com/GitHub_Trending/sh/sherpa-onnx cd sherpa-onnx cmake -B build -DCMAKE_BUILD_TYPERelease cmake --build build -j4完整的构建开关都在顶层的 CMakeLists.txt 里不用逐行读上面两条命令已经覆盖本文用到的全部产物。接着把 Parakeet 转写模型和 Silero VAD 两个模型拉下来./scripts/mobile-asr-models/download-parakeet-tdt.sh解压后的模型目录长这样sherpa-onnx-nemo-parakeet-tdt-0.6b-v2-int8/ ├── encoder.int8.onnx # 编码器模型 ├── decoder.int8.onnx # 解码器模型 ├── joiner.int8.onnx # 合并器模型 └── tokens.txt # 词汇表文件名里的int8不是摆设它表示模型做过 8 位整型量化这正是普通 CPU 能实时跑起来的底气。原理拆解VAD 负责切语音Parakeet 负责出字为什么边说边出字因为链路拆成了两截各管各的。项目规格处理方式流式边说话边转写端到端延迟 300ms内存要求2GB 以内即可运行平台覆盖Linux / macOS / Windows 与移动端全程离线麦克风采到的音频先经过 Silero VAD它判断哪一段是说话、哪一段是静音只有语音段会被送进模型。这一步省掉的是大头成本空静音不再白算。Parakeet-tdt-0.6b-v2 出自小米采用 Transformer-Transducer 架构拆成 encoder、decoder、joiner 三部分所以模型目录里是三个 .onnx 文件。这种架构逐 token 出字文字可以跟着话音上屏识别准确率维持在 98% 左右模型体积也只有传统方案的三分之一。VAD 的参数在示例里是写死的想调就打开 cxx-api-examples/parakeet-tdt-simulate-streaming-microphone-cxx-api.cc 看第 62 行附近VadModelConfig config; config.silero_vad.model ./silero_vad.onnx; config.silero_vad.threshold 0.5; // 语音检测阈值 config.silero_vad.min_silence_duration 0.25; // 最小静音时长(秒) config.silero_vad.min_speech_duration 0.25; // 最小语音时长(秒) config.silero_vad.max_speech_duration 5; // 最大语音时长(秒) config.sample_rate 16000; // 采样率 读参数时抓住两个threshold决定 VAD 多确信才算你说在说话max_speech_duration决定一句话最长撑多久就会被切下来送模型。跑通实时转写示例文字随话音上屏模型和编译都就绪后直接执行示例cd build/cxx-api-examples ./parakeet-tdt-simulate-streaming-microphone-cxx-api程序会自动打开默认麦克风打印Started! Please speak就可以开口。流程是这样的PortAudio 采到音频VAD 逐窗判断语音起止一旦确认有语音片段就进 Parakeet 模型识别结果实时刷到终端。按 CtrlC 会干净退出。两个小点要知道麦克风不止一个时用环境变量SHERPA_ONNX_MIC_DEVICE指定采样率固定 16000Hz不用动。模型推理默认 2 线程源码里是num_threads 2机器性能富余可以调到 4用 CPU 换速度。想上手机的话INT8 量化后模型只有 12MB 左右离线运行不碰网络连续转写一小时约耗电 5%。移动端怎么集成完整流程在 flutter-examples/README.md 里有交代。扩到多人WebSocket 转写服务与客户端单机终端跑通只是起点。项目里有一套服务端加客户端的示例把它接起来就是多用户实时转写平台服务端python-api-examples/streaming_server.py流式识别服务接收音频流、返回文字客户端python-api-examples/online-websocket-client-microphone.py抓麦克风音频推上去收文字下来这套形态对应三类场景在线会议的实时字幕、客服通话的自动记录、智能硬件的语音交互。文字实时刷新音频始终留在你自己的网络里。避坑识别不稳、速度不够时先查这几项出问题的地方基本集中在四个参数上。建议一次只动一个改完观察效果别连环调现象查哪个参数建议范围说话没识别出来 / 被切碎VAD 阈值 threshold0.4–0.6调低更敏感CPU 吃满、跟不上下线程数 num_threads2–4速度与占用之间取平衡语音首尾丢字采样率保持 16000Hz模型设计频率噪声环境下错得多波束宽度5–8调高准确率上升 原则只有一条每个参数都有代价。阈值调太低环境噪音会被当成语音误触发线程拉太高CPU 争抢反而更慢。先解决眼前症状再谈数字。接下来做什么链路跑顺之后先试官方提供的快速启动脚本它把常用步骤串成一条命令./scripts/quick-start-parakeet-tdt.sh遇到问题先看 CHANGELOG.md 里有没有已知的坑还没解决就带着系统信息、模型版本和报错日志去项目的 Issue 区提一条。想聊聊这个模型怎么接进你自己的产品去项目讨论区发个帖通常回复得比你想的快。【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

CookLikeHOC 小米南瓜粥标准化配方解析:从 4600g 水批量熬制到家庭小份换算 2026/9/12 18:24:58

CookLikeHOC 小米南瓜粥标准化配方解析:从 4600g 水批量熬制到家庭小份换算

CookLikeHOC 小米南瓜粥标准化配方解析:从 4600g 水批量熬制到家庭小份换算 【免费下载链接】CookLikeHOC 🥢像老乡鸡🐔那样做饭。已添加2026年发布的《老乡鸡菜品溯源报告 2.0中新出现的菜品。主要部分于2024年完工,非老乡鸡官方…

阅读更多 →
当我把四个串口交给 AI:一次 2.4G 双向透传的完整调试闭环 2026/9/12 18:24:58

当我把四个串口交给 AI:一次 2.4G 双向透传的完整调试闭环

从“你把日志贴给我看”,到“你直接读串口、发数据、烧固件、统计丢包”,嵌入式开发的协作方式发生了什么变化?一、需求看起来并不复杂 项目使用两块相同的 GD32F303CC Tag 板和 SI24R1 2.4 GHz模块,希望实现一条双向透明串口链路…

阅读更多 →
大型语言模型(LLM)训练核心技术解析 2026/9/12 18:24:58

大型语言模型(LLM)训练核心技术解析

1. LLM学习过程的核心逻辑拆解 大型语言模型(LLM)的学习本质上是基于海量文本数据的概率分布建模。这个过程可以类比人类学习语言的方式:通过大量阅读积累语感,最终形成预测下一个词的能力。但机器实现的路径更为精密和系统化。 …

阅读更多 →
千笔写作工具:智能算法重构学术写作全流程 2026/9/12 18:24:58

千笔写作工具:智能算法重构学术写作全流程

1. 项目概述:千笔写作工具的核心价值作为一名长期与文字打交道的创作者,我深知论文写作过程中的痛苦:文献综述的繁琐、格式调整的耗时、灵感枯竭的焦虑。千笔写作工具的出现,确实为学术写作领域带来了革命性的改变。这款工具主打&…

阅读更多 →
KoalaQA智能问答平台:企业级IM集成与RAG架构解析 2026/9/12 18:24:58

KoalaQA智能问答平台:企业级IM集成与RAG架构解析

1. 项目概述:KoalaQA智能问答平台的定位与价值 KoalaQA是一款基于DeepSeek大模型的智能问答系统,其核心创新点在于实现了与企业级IM平台(飞书/企业微信/钉钉)的深度集成。这个开源项目解决了传统企业知识库系统存在的三个典型痛点…

阅读更多 →
百点POE温湿度变送器并发卡顿?从串行轮询到异步并发的全链路优化实践 2026/9/12 18:21:57

百点POE温湿度变送器并发卡顿?从串行轮询到异步并发的全链路优化实践

1. 问题场景:百点POE温湿度变送器并发为何一到高峰就卡成PPT先说结论:这不是一次简单的调参,而是把整套上报链路重新梳理了一遍。项目是某个厂区环境监测系统,现场部署了100个POE温湿度变送器,全部走以太网供电和Modbu…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞