新闻详情

新闻详情

首页 / 资讯中心 / 详情

如何用 LocalAI 的 /v1/audio/classification API 识别音频片段中的声音事件?

发布时间:2026/9/13 5:29:38来源:尧图网络
如何用 LocalAI 的 /v1/audio/classification API 识别音频片段中的声音事件?
如何用 LocalAI 的 /v1/audio/classification API 识别音频片段中的声音事件【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI手头有一段录音想知道里面出现了哪些声音——婴儿哭声、玻璃破碎、狗叫、警报——这就是声音事件分类sound-event classification也叫 audio tagging要回答的问题我听到的是什么 LocalAI 通过/v1/audio/classification端点提供这个能力给定一段音频返回一组带分数的 AudioSet 标签。参考后端是ced.cppCED527 类 AudioSet 标签器一个作用于 log-mel 谱图的小型 ViT移植到 ggml 且与 PyTorch 完全对齐Apache-2.0 权重的 GGUF 文件可以直接从模型画廊安装。该端点按照/v1/audio/transcriptions的样式建模任何 HTTP 客户端都能调用消费端没有 Python 依赖。运行 LocalAI 并安装分类模型按本文的前提你需要已安装并可运行 LocalAI。以 Docker 为例见 快速上手docker run -p 8080:8080 --name local-ai -ti localai/localai:latest使用命令行时可以在启动时直接指定要安装的模型LocalAI 会在 API 启动前完成下载。声音分类主路径使用的模型是画廊中的ced-base-f16见 ced 模型定义后端为ced声明了sound_classification用例local-ai run ced-base-f16也可以用 CLI 单独管理模型local-ai models list # 查看画廊中的模型 local-ai models install ced-base-f16 # 安装模型关于模型变体gallery/index.yaml 中列出了同一ced后端的一系列 GGUF 权重ced-base-f16是描述中标注的推荐默认CPU 上最快、near-lossless如果在意占用空间ced-base-q8约 88 MB比 PyTorch 参考实现省约 6.5 倍内存top-5 标签一致、ced-tiny-*5.5M 参数面向 Pi 级/边缘设备、ced-mini-*9.6M 参数与ced-small-*22M 参数也是同端点可用的替代。后文示例统一使用ced-base-f16换成其它变体时只需把-F model的值换成对应名称。调用 /v1/audio/classification 端点端点为POST /v1/audio/classification Content-Type: multipart/form-data请求字段如下来自 audio-classification 文档字段类型说明file文件必填音频文件ffmpeg能接受的任意格式model字符串必填具备声音分类能力的模型名如ced-base-f16top_k整数返回的 top 标签数量0 使用后端默认值threshold浮点数丢弃低于该分数的标签发送分类请求把/path/to/clip.wav替换为你自己的音频文件路径curl http://localhost:8080/v1/audio/classification \ -H Content-Type: multipart/form-data \ -F file/path/to/clip.wav \ -F modelced-base-f16 \ -F top_k10其中top_k10是可选参数控制最多返回多少条标签threshold同理可加用于过滤低置信度标签。如何判断请求成功响应体包含两部分{ model: ced-base-f16, detections: [ {index: 23, label: Baby cry, infant cry, score: 0.87}, {index: 22, label: Crying, sobbing, score: 0.41} ] }以上为源文档给出的示例输出实际标签和分数取决于你的音频内容。判断方式与需要了解的语义detections是一个数组按分数从高到低排列每条包含indexAudioSet 标签编号、label标签文本和score分数。分数是每类的独立概率多标签、相互独立因此所有分数的和不等于 1——不要按总和接近 1来校验结果。只要拿到形如上述结构的 JSON 且detections非空说明端点、模型和音频链路都已工作detections为空或标签不符合预期时优先检查file是否为有效音频、model是否指向已安装的 ced 模型。分布式模式下的行为如果你的部署是分布式模式API 前端 独立 worker文档说明 LocalAI 会在选定的 worker 上先暂存上传的音频以及实时声音检测窗口再执行分类API 服务器与 worker 之间不需要共享临时目录。也就是说本文的 curl 示例在分布式部署下同样适用不需要额外配置共享盘。边界与下一步file字段的格式由ffmpeg决定ffmpeg不接受的格式会失败model必须是声明了声音分类能力的模型即ced后端的 ced 系列 GGUF指向普通 LLM/语音转写模型不会有分类结果本文只覆盖对已录制音频片段的分类。LocalAI 还通过 realtime websocket API 提供实时声音识别见 audio-classification 文档以及相近的 语音转写audio to text 和 说话人分离audio diarization它们解决的是说了什么和谁在说与本场景的听到什么声音事件是不同任务。【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Flipper Zero Unleashed 固件开发板快速上手:从启用调试模式到 USB / Wi-Fi 连接实战 2026/9/13 6:05:40

Flipper Zero Unleashed 固件开发板快速上手:从启用调试模式到 USB / Wi-Fi 连接实战

Flipper Zero Unleashed 固件开发板快速上手:从启用调试模式到 USB / Wi-Fi 连接实战 【免费下载链接】unleashed-firmware Flipper Zero Unleashed Firmware 项目地址: https://gitcode.com/GitHub_Trending/un/unleashed-firmware 本指南以 Flipper Zero Wi…

阅读更多 →
CodexBar Qwen Cloud 浏览器 Cookie 导入修复实证:从 Chrome-only 到 Chrome + Brave 的完整验证流程 2026/9/13 6:05:40

CodexBar Qwen Cloud 浏览器 Cookie 导入修复实证:从 Chrome-only 到 Chrome + Brave 的完整验证流程

CodexBar Qwen Cloud 浏览器 Cookie 导入修复实证:从 Chrome-only 到 Chrome Brave 的完整验证流程 【免费下载链接】CodexBar Show usage stats for OpenAI Codex and Claude Code, without having to login. 项目地址: https://gitcode.com/GitHub_Trending/co…

阅读更多 →
Pallas引擎:优化AIGC对话系统的动态注意力与分层记忆技术 2026/9/13 6:05:40

Pallas引擎:优化AIGC对话系统的动态注意力与分层记忆技术

1. Pallas引擎的技术定位与核心价值 在AIGC技术爆发的2023年,对话系统的性能瓶颈日益凸显。传统基于Transformer的架构在处理长对话时普遍存在响应延迟高、上下文遗忘等问题。Pallas引擎的诞生,正是为了解决这些行业痛点。 这个由比话降AI团队自主研发的…

阅读更多 →
开源笔记 Joplin 3.7.16 上手:安装、多端同步配置与笔记整理实践 2026/9/13 6:05:40

开源笔记 Joplin 3.7.16 上手:安装、多端同步配置与笔记整理实践

开源笔记 Joplin 3.7.16 上手:安装、多端同步配置与笔记整理实践 笔记软件选型里,Joplin 是「数据完全归自己」的代表:开源(AGPL-3.0)、Markdown 存储、支持 WebDAV/OneDrive/S3 等多种同步后端,换软件时数…

阅读更多 →
四大开源OCR引擎技术架构与性能对比解析 2026/9/13 6:05:40

四大开源OCR引擎技术架构与性能对比解析

1. 四大OCR引擎技术架构解析 2023年开源OCR领域迎来重大技术突破,MinerU 2.5、DeepSeek-OCR 2、HunyuanOCR和PaddleOCR-VL-1.5这四款引擎在架构设计上呈现出明显差异化特征。作为长期从事文档智能处理的从业者,我将从技术实现角度剖析各方案的核心设计理…

阅读更多 →
Vant Steps 步骤条组件完全指南:状态机制、自定义样式与源码级实现解析 2026/9/13 6:02:40

Vant Steps 步骤条组件完全指南:状态机制、自定义样式与源码级实现解析

Vant Steps 步骤条组件完全指南:状态机制、自定义样式与源码级实现解析 【免费下载链接】vant A lightweight, customizable Vue UI library for mobile web apps. 项目地址: https://gitcode.com/GitHub_Trending/va/vant Steps 是 Vant 移动端组件库中用于…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞