新闻详情

新闻详情

首页 / 资讯中心 / 详情

(论文速读)Hierarchical Classification:受限 IoT 设备上的端侧分类与按需卸载

发布时间:2026/9/26 17:00:05来源:尧图网络
(论文速读)Hierarchical Classification:受限 IoT 设备上的端侧分类与按需卸载
论文题目Hierarchical Classification for Constrained IoT Devices: A Case Study on Human Activity Recognition面向资源受限 IoT 设备的分层分类以人体活动识别为例期刊IEEE Internet of Things Journal2020摘要海量物联网IoT设备会产生难以管理的数据量。以云为中心的 IoT 数据处理方式受到较高且不可预测的网络时延影响从而使医疗等实时 IoT 应用的体验下降。为解决这一问题边缘计算将数据推理从数据源也就是 IoT 设备端开始执行。然而IoT 设备受限的计算能力与高功耗的数据传输使端侧计算和计算卸载之间必须进行权衡。因此IoT 信息推理需要能够适应这种权衡、同时满足可穿戴设备等资源受限 IoT 设备需求的高效轻量方法。本文提出一种分层分类方法将原始问题分解为两层中的三个分类器。第一层在 IoT 设备上运行一个轻量分类器用于决定将计算卸载到网关还是直接在设备端完成。第二层包括一个运行在 IoT 设备上的轻量分类器它只负责区分部分类别以及一个运行在网关上的复杂分类器用于区分剩余类别。基于真实人体活动识别数据集并在可穿戴 IoT 设备上完成的实验表明该方法的平均准确率达到 92%高于非分层分类器的平均 87%IoT 设备上的执行时间与功耗实测进一步表明该方法在分类任务上能够实现约 3× 的能耗节省。一、研究背景与核心问题这篇论文讨论的并不是“怎样设计一个更强的活动识别分类器”而是一个更偏系统的问题当 IoT 端侧设备算力、内存和电池容量都很有限时一次分类到底应该在本地完成还是交给网关完成1.1 全部放在端侧模型可能根本装不下论文首先比较了 LoR、DT、SVM、GNB、KNN、ANN、LDA、RF 和 XGB 等传统分类模型。人体活动识别中RF 可以达到约 90% 的性能但 100 棵树的参数需要超过 4.9 MB 存储空间KNN 虽然也能达到约 88%模型存储仍需要 427 KB。对于论文面向的微控制器级 IoT 设备这已经超过可接受范围。论文 Figure 1–2典型 IoT 硬件的频率/片上内存以及不同分类器的识别性能与资源矛盾这里真正的问题是性能较好的分类器往往更重而可穿戴节点只有几十到几百 KB 的片上存储。1.2 全部卸载到网关也不一定省电另一种直接方案是只在端侧完成预处理和特征提取然后把特征加密并通过无线链路传给网关由网关完成分类。它绕开了端侧算力限制却引入了新的问题无线通信本身功耗很高而且为了保护数据还需要额外的加密、发送、接收和解密。论文 Figure 3全部分类任务都卸载到网关的 Baseline 流程因此作者提出第三种思路不要把所有样本用同一种方式处理而是先判断这个样本“简单还是困难”。简单样本直接在端侧解决困难样本再卸载。二、方法整体框架把一个分类问题拆成三台“分类器”论文 Figure 4两层分层分类架构及两种 Gateway Variant作者首先把原来的 M 个类别划分为两个集合L 表示能够由端侧轻量分类器识别的类别G 表示需要交给网关复杂分类器识别的类别。整个系统由三个分类器组成Offload Controller运行在 IoT 设备上只做二分类判断当前输入属于 L 还是 GOnboard LYAC运行在 IoT 设备上只识别集合 L 中的类别Complex Classifier运行在 Gateway/Fog 上负责更困难的类别。LYAC 是论文对“Lightweight Yet Accurate Classifier”的简称。它的关键不是追求全类别最优而是在一个较小的子问题中做到“足够轻、又足够准”。论文 Figure 5传统单分类器与本文分层分类思想的直观对比Figure 5 很适合理解这篇论文。传统方案直接寻找一个决策边界去分开全部类别本文先做一次粗粒度划分把样本分成 L 与 G再分别进入轻量分类器和复杂分类器。换句话说作者不是在压缩一个大模型而是重新组织分类任务本身的难度分布。这里的类别划分还必须同时满足两个条件第一L 内部的类别必须足够容易区分才能找到轻量的 LYAC第二L 和 G 本身也必须容易区分否则 Offload Controller 太复杂或者误判太多整个方案就失去了意义。三、关键机制Offload Controller 不能只追求普通“准确率”Offload Controller 的输出可以产生 TP、TN、FP、FN 四种情况但它们在系统中的代价并不对称。TN 表示样本本来就属于 L并且被正确留在端侧这是最理想的情况因为避免了无线传输FP 表示本来能在端侧完成却被错误卸载结果通常仍然能分对只是错失了节能机会TP 表示困难样本被正确卸载与 Baseline 类似真正危险的是 FN——本来应该送到网关的困难样本被留在端侧轻量分类器无法正确处理直接带来误分类。因此作者给整个设计增加了一个约束其中 MCR₁ 是端侧 LYAC 的误分类率MCR₂ 是网关分类器的误分类率是全卸载 Baseline 的误分类率。这个公式表达的核心很简单节能不能靠牺牲整体识别性能换取设计出来的分层系统至少不能比 Baseline 更差。论文 Table I公式1–5涉及的 FNR、TNR、FPR、TPR、MCR₁、MCR₂、P、N 等变量定义论文 Figure 6三个分类器与类别划分的离线设计流程Figure 6 展示了训练阶段怎样寻找一个可行方案。作者先尝试一种类别划分将数据按 70%/30% 划分训练集和测试集并使用十折交叉验证。Offload Controller 与 Onboard LYAC 只允许从 LoR、浅层 DT、少量支持向量的 SVM 等轻量模型中选择Gateway 端则可以使用复杂模型。若测试后整体误分类率不满足约束就重新寻找类别划分直到找到满足条件的三个分类器。这也说明本文真正的设计变量并不只是“选哪个模型”而是类别怎么分、哪些类别留在端侧、哪些类别交给网关。四、从加速度信号到 CC1350论文怎样真正落到端侧论文 Figure 7运行阶段的完整端侧/网关 Pipeline在线运行时IoT 设备先完成预处理和特征提取然后 Offload Controller 判断走哪条路径。如果属于 L就直接进入 LYAC 并在端侧输出分类结果如果属于 G则将已经计算好的特征加密、发送到网关网关完成复杂分类后再把结果返回。值得注意的是论文并不传输原始加速度序列而是复用 Offload Controller 已经需要的特征向量。因此只有真正需要卸载的样本才进入通信链路。4.1 信号与特征实验数据来自胸前单个加速度计采样率为 52 Hz共包含 15 名受试者和 7 种活动。每个输入窗口长度为 2 s即约 104 个采样点。作者分别对 X、Y、Z 三轴计算 Max、Min、Mean、Standard Deviation 和 Sum共得到 15 个特征再归一化到 [-1, 1]。论文 Table II端侧实现中的窗口长度、15 维统计特征与归一化设置最终特征向量为 60 B这一点后面会直接进入通信能耗计算。4.2 真正的 MCU 与功耗仪测试论文 Figure 8数据处理、模型导出、TI CC1350 部署以及功耗/执行时间测试流程作者没有停留在 PC 上统计 FLOPs而是把模型导出为 C/C真正部署到TI SensorTag CC1350。该平台使用 32-bit ARM Cortex-M3最高 48 MHz只有 28 KB SRAM 和 128 KB Flash并采用 3 V 纽扣电池供电。功耗则通过 Agilent DC Power Analyzer 实测测量间隔达到 40.96 μs。在最终方案中Offload Controller 采用 LoR只包含 15 个系数和 1 个截距在线只需要 15 次浮点乘法、15 次加法和一个 SigmoidOnboard LYAC 采用最大深度为 5 的决策树。这个配置非常能体现论文的目标端侧不是部署一个缩小版“大模型”而是只部署完成路由和简单分类所需的最小计算。五、实验结果92% 准确率背后更重要的是通信真的少了5.1 三个分类器能否形成有效分工论文 Figure 9–11三个分类器的单独准确率、端侧/卸载比例以及分层方案与 Baseline 的整体准确率Figure 9 中最关键的是 Offload ControllerLoR 能够把 L 与 G 完全区分开因此实验中的 FNR FPR 0。最终 7 个活动被划分为 4 个端侧类别和 3 个网关类别。Figure 10 给出了真正影响能耗的数字平均 67.2% 的输入可以直接在端侧处理只有 32.8% 必须卸载到网关。也就是说大约三分之二的样本完全绕过了无线发送、网关分类和结果返回过程。由于 Offload Controller 在该实验中达到 100%整体准确率可以写成其中 N、P 分别对应端侧处理和必须卸载的样本数。Figure 11 显示分层方案最终平均性能约为92%而非分层 Baseline 约为87%。因此在这个案例中减少卸载并没有以整体准确率下降为代价。不过作者也明确指出这一结果能否迁移到其他任务很大程度上取决于是否能找到一个合适的 Offload Controller因此它具有明显的应用相关性。5.2 端侧执行时间到底有多小论文 Table IVTI CC1350 上单个 2 s 信号窗口的端侧执行时间、CPU Cycle 与能耗Table IV 很值得看。特征计算需要约3.58 ms / 33.831 μJLoR Offload Controller 只需要约0.21 ms / 1.9845 μJ真正执行四类活动识别的 DT LYAC 甚至只有约0.007 ms / 0.0662 μJ。这说明本地“做一次轻量分类”的代价非常低。论文端侧计算中反而是特征计算占据了更大的时间和能量但这部分在 Baseline 和本文方案里都需要执行因此作者在后面的两种方案能耗比较中将这些共同操作排除。5.3 为什么少发一次无线数据能省这么多论文 Figure 12CC1350 的传感器读取、AES 加解密、Sub-1-GHz 收发过程的真实功率波形Figure 12 直接展示了功耗仪波形。尤其值得注意的是无线链路的启动开销即使只发送 1 B 数据也必须经历开启射频、发送和再次休眠的过程因此通信并不是“数据少一点就几乎不要能量”。论文 Table III传感、AES 加解密和无线收发操作的平均功耗、执行时间与能耗从 Table III 可以看到发送 60 B 特征一次约消耗357.62 μJ接收 1 B 结果也需要约65.31 μJ。相比之下端侧 Offload Controller 一次只有约 1.98 μJLYAC 更只有约 0.066 μJ。数量级差异解释了为什么作者愿意“多算一点”去避免大量无线通信。论文 Table VBaseline 与分层方案能耗模型所使用的实测参数论文根据这些真实测量值计算得到而分层方案需要每个窗口都运行 Offload Controller但只有 32.8% 的窗口进入完整卸载路径平均每个 segment 减少超过285 μJ分类相关能耗约降为 Baseline 的三分之一即论文所说的3× energy saving。这里要注意结论边界这个 3× 比较的是两种方案中与分类路径相关、且存在差异的能耗数据采集和特征提取等双方共同操作被排除。因此不能直接把它理解为整台设备续航提升 3 倍。六、总结与思考如果把这篇论文压缩成一句话就是先用一个极轻量分类器判断“这个样本值不值得上传”让简单样本在 MCU 上直接解决只把真正困难的样本交给网关。它最值得借鉴的地方并不是 LoR 或 DT 本身而是把算法精度、任务划分、通信开销和真实硬件能耗放进了同一个设计闭环。作者既测了最终准确率也真正部署到 Cortex-M3 上测执行时间还通过功耗仪把 AES、无线发送、接收和本地推理拆开测量最后再用实测数据计算系统级能耗收益。从工程角度看论文还有一个很有价值的结论在这类低功耗 IoT 节点上无线通信的能量代价可能远高于一次轻量机器学习推理。因此端侧优化不一定意味着一味压缩模型也可以通过“先本地判断、再选择性卸载”减少昂贵的数据移动。但这一方法成立有一个关键前提任务本身必须存在一部分“可以被轻量模型稳定识别的类别”同时还要能用一个足够轻且足够可靠的 Offload Controller 把简单样本与困难样本分开。本文的人体活动识别实验中这个控制器恰好能够做到 100% 的 L/G 区分因此获得了 92% 的平均识别性能和约 3× 的分类能耗节省换到新的信号、类别或工况时能否找到同样清晰的任务划分才是这套方法能否继续成立的核心。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

【嵌入式外设精学】Day03|中断优先级:抢占、响应、嵌套 2026/9/26 17:41:54

【嵌入式外设精学】Day03|中断优先级:抢占、响应、嵌套

【嵌入式外设精学】Day03|中断优先级:抢占、响应、嵌套 今天解决:两个中断谁先跑?ISR 里会不会被打断?数字是不是越大越高? 目录 问题 2. 原理 3. 代码 4. 误区 5. 自测 6. 答案 1. 问题 周期控制和串口同…

阅读更多 →
Meta开源ax调度器:从超参搜索到自动化试验流水线 2026/9/26 17:41:48

Meta开源ax调度器:从超参搜索到自动化试验流水线

"ax"这个字符串在互联网上实在太容易撞车了。你搜它能出来路由器、线性代数教材、甚至某个键盘型号。但如果你最近在技术社区里刷到“ax 调度”这四个字,那我猜你说的是同一个东西:Meta 开源的 Adaptive Experimentation 平台,Pyth…

阅读更多 →
如何挑选高性价比AGM产品?揭秘优质制造商选择攻略 2026/9/26 17:41:48

如何挑选高性价比AGM产品?揭秘优质制造商选择攻略

开篇:定下基调随着国产半导体产业的崛起,AGM(现场可编程门阵列)芯片因其独特的灵活性和强大的处理能力,在工业控制、通信接口、人工智能边缘计算等领域扮演着越来越重要的角色。本次测评旨在为工程师、产品经理及技术决…

阅读更多 →
大模型工程化实战(一):概率坍塌的救赎 - 用 JSON Schema 给 LLM 输出加锁并接入 TaoToken 2026/9/26 17:41:28

大模型工程化实战(一):概率坍塌的救赎 - 用 JSON Schema 给 LLM 输出加锁并接入 TaoToken

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
Multi-Agent工具可见性设计:从全局注入到动态路由的工程实践 2026/9/26 17:41:28

Multi-Agent工具可见性设计:从全局注入到动态路由的工程实践

我调一个客服售后 Multi-Agent 的时候遇到过这样一幕:负责退款审批的子 Agent 面对用户的订单信息,非常自信地生成了一条“已退款”的回复,可实际上它根本没调订单状态查询工具——不是不想调,而是这个工具的 schema 压根没出现在…

阅读更多 →
CSP-S初赛阅读程序题剖析:字符串统计计数与常见误区 2026/9/26 17:41:16

CSP-S初赛阅读程序题剖析:字符串统计计数与常见误区

每年初赛备考阶段,总有同学拿着阅读程序题来问我:代码明明不长,怎么一对答案就错?如果你也有这种感觉,我建议先把2019年CSP-S初赛阅读程序第1题拿出来拆一遍。这题在当年整个初赛试卷里属于“放分题”:字符…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉