新闻详情

新闻详情

首页 / 资讯中心 / 详情

Audio8 ASR Infinite 架构深度解析:Voxtral 音频塔 + Qwen2.5 解码器的流式设计

发布时间:2026/9/26 18:07:15来源:尧图网络
Audio8 ASR Infinite 架构深度解析:Voxtral 音频塔 + Qwen2.5 解码器的流式设计
Audio8 ASR Infinite 架构深度解析Voxtral 音频塔 Qwen2.5 解码器的流式设计【免费下载链接】Audio8-ASR-Infinite项目地址: https://ai.gitcode.com/hf_mirrors/Edge0/Audio8-ASR-InfiniteAudio8 ASR Infinite是一个开源的原生流式语音识别Streaming ASR模型由 Voxtral Realtime 音频塔与 Qwen2.5-3B 文本解码器组合而成配合 Rolling KV Cache可实现不限长度的 24/7 实时转写且内存与延迟保持恒定。它支持 80/120/160 ms 三档可选择的音频时钟、240–560 ms 可配置的转写延迟中英双语输出并内置语义 VAD语音活动检测头。下面用一篇文章带你读懂它的流式架构设计。为什么需要「流式语音识别」传统离线 ASR 需要等音频录完再处理而流式识别一边听一边出字适合会议实时字幕、实时对话、24/7 监控录音等场景。Audio8 ASR Infinite 针对流式场景做了三项关键设计能力说明⚡ 超快响应原生流式架构80 ms 时钟下每秒解码 12.5 次♾️ 不限长度Rolling KV Cache 让内存和延迟在长期运行中保持恒定️ 时钟可选80/120/160 ms 三档音频时钟对应 12.5 / 8.3 / 6.25 次文本决策/秒⏱️ 延迟可调target_delay_ms可在 240–560 ms 之间权衡速度与准确率 语义 VAD区分「思考停顿」「口吃」与「真正的轮次结束」传统声学 VAD 在此容易失效架构总览三部件的流式流水线整个模型是一条单向流水线音频 → 音频塔 → 投影器 → Qwen 解码器 → 文本。各部件的初始权重与训练情况如下见 README.md组件初始权重是否训练Causal Audio Tower音频塔Voxtral Realtime 4B✅Audio Projector投影器随机初始化✅Frame Length Embedding帧长嵌入随机初始化✅Decoder解码器Qwen2.5-3B-Instruct✅LM HeadQwen2.5-3B-Instruct✅具体规格可查 config.json音频塔32 层、hidden 1280、128 mel bins、sliding window 750config.json#L5-L27特征提取器为 16 kHz / 128 mel 的VoxtralRealtimeFeatureExtractorpreprocessor_config.json解码器36 层、hidden 2048、16 个 query 头 / 2 个 KV 头GQA词表 151936config.json#L91-L159投影器max frame len 8 → 投影维度 10240激活函数 geluconfig.json#L64-L65权重文件约 8.17 GB 的 model.safetensorsbfloat16权重分片索引见 model.safetensors.index.json。流式解码器层Voxtral 风格延迟调制与普通 LLM 不同音频塔的每个 decoder 层Qwen2RealtimeV1DecoderLayer/Qwen3RealtimeV1DecoderLayer在 attention 之后、MLP 之前插入了一层AdaRMSNorm 时间调制把「当前延迟了多少个 token」编码成t_cond按层缩放隐状态。这个设计的核心逻辑在 modeling_audio8_asr_infinite.py文件头部注释也点明了机制num_delay_tokens - sinusoidal time embedding - per-layer adaptive MLP - post-attention hidden scaling也就是说模型不是「被动地」知道当前处于流的哪个位置而是每个解码层都显式感知「延迟时间」这正是它能在流中稳定输出、不漂移的关键。帧长嵌入一套权重三档时钟模型同时支持 4/6/8 三种 frame_len对应 80/120/160 ms 时钟。为了让一个共享的投影器同时服务三档时钟configuration_audio8_asr_infinite.py 启用了use_frame_len_embedding用一段可学习嵌入把「当前用了哪档帧长」信息加到时间嵌入上modeling_audio8_asr_infinite.py#L1074-L1089。音频时钟与转写延迟如何选参数这是使用者最关心的一步。frame_len决定时钟档位target_delay_ms决定「牺牲多少延迟换准确率」且delay 必须是时钟的整数倍。各档位的已训练最优组合如下音频时钟frame_len左填充 token 数可选target_delay_ms80 ms418240 / 320 / 480 / 560120 ms612240 / 480160 ms89320 / 480换算关系delay 毫秒 ÷ 时钟毫秒 延迟 token 数直接写在 config.json#L46-L61 的num_delay_tokens_by_frame_len中配置类的参数校验逻辑见 configuration_audio8_asr_infinite.py#L208-L224。新手建议追求低延迟选 80 ms 240 ms delay追求准确率选 80 ms 480 ms delay下文评测即此配置。Rolling KV Cache24/7 转写不漂移该 checkpoint 的原生上下文只有 30 秒但适配版 vLLM 通过Rolling KV Cache 精确 RoPE 重基re-basing让缓存窗口不断滚动从而在连续数小时的音频上保持内存与延迟有界README.md#L189-L191。部署上推荐 Docker Compose 一键启动同一个 socket 还提供网页实时演示和 WebSocket 客户端README.md#L164-L191。语义 VAD不止是「有声音 / 没声音」除了转写本仓库还附带一组独立的语义 VAD 头权重semantic_vad_heads.safetensors。它在文本主干的最终隐状态上挂了 4 个分类器分别预测未来 0.5 / 1.0 / 2.0 / 3.0 秒内会出现多少个语义单元8 分类第 0 类即「轮次结束」配置见 config.json#L66-L72挂载逻辑在 modeling_audio8_asr_infinite.py#L585-L624。相比传统声学 VAD它能区分「用户还在思考的停顿」「口吃」和「真的说完了」对实时对话的产品体验提升很大。评测表现80 ms 时钟 480 ms 延迟下的硬指标在贪心解码、80 ms 时钟、target_delay_ms 480的设置下README.md#L100-L112测试集指标Audio8 ASR InfiniteVoxtral-Mini-4B-Realtimenemotron-3.5-asr-streamingaishell1/testCER1.75016.79512.927 560msaishell4/testCER2.89316.45614.677 560mslibrispeech test.cleanWER3.0422.2103.353 560mslibrispeech test.otherWER6.8085.5527.140 560ms平均3.62310.2539.524中文场景优势非常明显aishell1 CER 从 16.795 降到 1.750英文场景与 Voxtral 各有胜负整体平均分 3.623 显著领先。仓库文件速查文件作用config.json音频塔 / 解码器 / 流式时钟等全部超参configuration_audio8_asr_infinite.py配置类含帧长与 delay 的解析校验modeling_audio8_asr_infinite.py模型主体音频塔 投影器 流式解码层 语义 VADmodel.safetensors合并后的主权重约 8.17 GBbfloat16semantic_vad_heads.safetensors语义 VAD 头权重4 个时间尺度 × 8 类tokenizer_config.jsonQwen2 分词器及[STREAMING_PAD]、[LANGUAGE_ZH]等流式专用 tokenpreprocessor_config.json16 kHz / 128 mel 音频特征提取参数chat_template.jinja对话模板小结Audio8 ASR Infinite 用「Voxtral 因果音频塔 帧长感知投影器 Qwen2.5 解码器」的三件套加上按层感知的延迟时间嵌入和Rolling KV Cache把「实时性、准确率、无限时长」这三件通常难以兼得的事捏在了一起。对新手而言上手只需三步选时钟档位 → 定target_delay_ms→ 用 vLLM 或 Torch 模拟流式解码跑通第一条转写。想深入细节直接读 modeling_audio8_asr_infinite.py 的build_t_cond与forward两个方法即可抓住核心。【免费下载链接】Audio8-ASR-Infinite项目地址: https://ai.gitcode.com/hf_mirrors/Edge0/Audio8-ASR-Infinite创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

treg CLI工具链:OpenRouter API聚合与MCP协议集成实战 2026/9/26 19:41:39

treg CLI工具链:OpenRouter API聚合与MCP协议集成实战

1. 从"treg"这个标题说起:一个被低估的CLI工具链整合思路第一次看到"treg"这个标题的时候,我脑子里蹦出来的第一个念头是"这又是什么缩写"。做命令行工具这行的老毛病了,看到四个字母以内的东西就条件反射地想…

阅读更多 →
treg CLI工具链:统一OpenRouter密钥、MCP连接与Agent执行 2026/9/26 19:41:33

treg CLI工具链:统一OpenRouter密钥、MCP连接与Agent执行

1. 从“treg”这个标题说起:一个被低估的CLI工具链入口第一次看到“treg”这个词,很多人会以为是某个拼写错误,或者某个小众库的缩写。但如果你最近在折腾 AI Agent 开发、CLI 工具链、MCP 协议这些东西,大概率已经在某个 issue、…

阅读更多 →
IntelliJ IDEA社区版完全指南:从安装配置到进阶技巧 2026/9/26 19:41:26

IntelliJ IDEA社区版完全指南:从安装配置到进阶技巧

1. 为什么我劝你彻底放弃破解版,转投社区版刚入行那会儿,我也用过一阵子破解版IDE。当时想法很简单:功能全、不花钱、网上教程一搜一大把。但用了不到半年,我就被折腾得够呛。先是某次自动更新之后激活失效,整个项目索…

阅读更多 →
Codex 配置 OpenAI 兼容接口完整流程:API Key、模型选择与常见报错排查(TaoToken 统一 Key 接入版) 2026/9/26 19:41:20

Codex 配置 OpenAI 兼容接口完整流程:API Key、模型选择与常见报错排查(TaoToken 统一 Key 接入版)

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
开源代码审查协议:Git+CLI+LLM的可审计协作范式 2026/9/26 19:41:20

开源代码审查协议:Git+CLI+LLM的可审计协作范式

1. 这不是另一个“AI代码审查工具”,而是一套可嵌入开发流程的开源协作协议“open-code-review”这个标题乍看像某个新出的CLI工具名,但实际它指向的是一种正在被越来越多团队实践的开放型代码审查范式——不是靠单点工具自动扫描,而是把代码…

阅读更多 →
PaddleNLP 大模型集群部署实战:基于 paddle-operator 的 Kubernetes 分布式训练与公有云方案 2026/9/26 19:41:20

PaddleNLP 大模型集群部署实战:基于 paddle-operator 的 Kubernetes 分布式训练与公有云方案

人工智能大模型预训练微调LoRARLHF强化学习分布式训练 【免费下载链接】PaddleNLP Easy-to-use and powerful LLM and SLM library with awesome model zoo. 项目地址: https://gitcode.com/gh_mirrors/pa/PaddleNLP 点击查看 免费下载 本文档面向在集群环境中开展…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉