新闻详情

新闻详情

首页 / 资讯中心 / 详情

MetaClaw为何登顶HuggingFace每日论文榜?OPD在线蒸馏与MAML支持/查询集分离研究亮点深潜

发布时间:2026/9/28 20:31:28来源:尧图网络
MetaClaw为何登顶HuggingFace每日论文榜?OPD在线蒸馏与MAML支持/查询集分离研究亮点深潜
MetaClaw为何登顶HuggingFace每日论文榜OPD在线蒸馏与MAML支持/查询集分离研究亮点深潜【免费下载链接】MetaClaw Just talk to your agent — it learns and EVOLVES .项目地址: https://gitcode.com/gh_mirrors/me/MetaClawMetaClaw 是一款开源的元学习 AI 智能体框架口号是和你的智能体聊聊它就能学习并进化Just talk to your agent — it learns and EVOLVES。它把真实对话变成学习信号让智能体在野外部署中持续变强全程无需 GPU 集群只需接入 LLM API。其技术报告发布当天登顶 HuggingFace 每日论文榜本文用通俗的方式带你深潜两大核心研究亮点OPD 在线蒸馏与MAML 支持集/查询集分离。 先看全局MetaClaw 凭什么越聊越强MetaClaw 的核心思路是给模型装上一个透明代理Proxy你的个人智能体OpenClaw、CoPaw、IronClaw 等 8 款客户端照常对话代理在每一轮注入相关技能、压缩上下文会话结束后自动总结沉淀出新技能开启强化学习后由元学习调度器把权重更新推迟到空闲时段训练全程不打断你聊天。它提供三种运行模式覆盖从零门槛到全量自进化模式命令能力skills_onlymetaclaw start --mode skills_only技能注入 自动总结无需 GPU/训练后端rlmetaclaw start --mode rl技能 GRPO 强化学习可选 OPD 教师蒸馏auto默认metaclaw start技能 RL 空闲窗口智能调度 亮点一OPD 在线蒸馏——让学生在真实对话中学老师OPDOn-Policy Distillation在线策略蒸馏是 RL 模式的一个可选增强解决一个经典矛盾大模型强但调用贵小模型快但能力弱。传统离线蒸馏用老师生成好的数据喂学生存在分布不匹配问题。MetaClaw 的 OPD 换了一个思路学生模型照常生成回复on-policy数据来自自己当前的策略教师模型如更大的 32B 模型对这些同一条回复逐 token 给出对数概率用KL 散度惩罚把学生策略拉向教师的分布。这样学生学到的不是背老师的台词而是在自己的输出分布上变得更像老师蒸馏效果更稳定。整个流程与 PRM 裁判打分并行异步执行对线上服务零干扰。开启方式只需几条配置详见 README.md 的 OPD 小节metaclaw config opd.enabled true metaclaw config opd.teacher_url http://localhost:8082/v1 metaclaw config opd.teacher_model Qwen/Qwen3-32B metaclaw config opd.kl_penalty_coef 1.0想完整跑一遍可以直接参考端到端示例 examples/run_conversation_opd.py 和 scripts/run_openclaw_tinker_opd.sh蒸馏损失与 KL 系数的实现位于 metaclaw/trainer.py配置项定义在 metaclaw/config.py。 亮点二MAML 支持集/查询集分离——防止旧经验污染训练这是 MetaClaw 技术报告中最元学习的一笔对应 v0.3 版本引入的**支持/查询集分离support/query set separation**机制。问题场景智能体的技能库在持续进化。假设某个失败案例触发了技能进化生成了一批新技能——那么进化之前积累的对话样本其奖励信号已经是旧技能下的评价直接拿去更新权重等于用过期的奖励信号做梯度更新会污染训练。MetaClaw 的解法借鉴了 MAML 中支持集与查询集分离的思想每条对话样本都打上 **skill_generation技能版本号标签一旦技能进化使版本号递增训练器立即清空 RL 样本缓冲区和输出队列丢弃所有进化前的样本下一个 RL 训练批次只使用进化后采集的新数据。一句话引发进化的样本是支持集只用于学技能权重更新只吃查询集新技能下的新数据。日志中会明确打印丢弃了多少过期样本整个过程完全透明。相关实现可阅读metaclaw/trainer.py缓冲区清空逻辑、metaclaw/rollout.py队列清理与 metaclaw/data_formatter.py样本标签定义。 配套机制元学习调度器只在你不在时学习RL 权重热更新需要几分钟若恰好在你打字时触发就太扫兴了。因此auto模式下慢更新RL 梯度更新只在三种空闲窗口之一打开时执行睡眠时段可配置的起止时间如 23:00–07:00⌨️键盘闲置离开键盘超过 N 分钟即触发日历事件检测到 Google Calendar 会议会中摸鱼式训练。若用户在更新中途回来部分批次会自动保存并在下个窗口续训。调度器核心代码见 metaclaw/scheduler.py、metaclaw/idle_detector.py 与 metaclaw/calendar_client.py。 快速上手两条命令跑起来pip install -e .[rl,evolve,scheduler] # 完整功能安装 metaclaw setup # 交互式配置向导 metaclaw start # 默认 auto 模式启动向导会引导你选择智能体类型OpenClaw/CoPaw/IronClaw/NanoClaw 等、认证方式和 LLM 提供商随后metaclaw start自动完成代理部署与网关接线。v0.4.0 还新增了跨会话长期记忆层情景/语义/偏好/项目状态详见 metaclaw/memory/ 目录与 README 的 Memory 章节。 附想验证它的学习能力试试 MetaClaw-Bench项目内置了一个评估智能体多日交互历史中学习适应能力的基准数据集含 30 天完整版与 12 天精简版覆盖校验、推理、打分、报告全流程文档见 benchmark/README.md数据位于 benchmark/data/metaclaw-bench/ 与 benchmark/data/metaclaw-bench-small/。 小结MetaClaw 登顶榜单并非偶然OPD 在线蒸馏让小模型在真实流量中贴身学习大模型MAML 支持/查询集分离保证了技能进化与权重更新互不污染再配合空闲窗口调度实现无感自进化。三招组合拳让AI 智能体越用越聪明第一次以工程可复现的形态落地——而这一切你不需要一块 GPU。【免费下载链接】MetaClaw Just talk to your agent — it learns and EVOLVES .项目地址: https://gitcode.com/gh_mirrors/me/MetaClaw创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

基于单视频三维实时重构的限定区域数字孪生底座构建与越界行为智能预警 2026/9/28 21:13:53

基于单视频三维实时重构的限定区域数字孪生底座构建与越界行为智能预警

摘要限定封闭区域、高危管控区域、重点值守区域的边界安防与行为管控是公共安全、工业安监、园区治理、水利管控、司法安防领域的核心刚需。传统区域安防预警体系普遍依托二维视频智能分析、定点红外对射、平面电子围栏、人工值守巡查等模式,仅基于像素平面开展目标…

阅读更多 →
当 LLM 被注入攻击:一套生产级安全护栏的架构设计与落地实践 2026/9/28 21:13:47

当 LLM 被注入攻击:一套生产级安全护栏的架构设计与落地实践

当 LLM 被注入攻击:一套生产级安全护栏的架构设计与落地实践 提示注入不是“多写几句 System Prompt”就能解决的问题。 当 LLM 接入 RAG、业务 API、MCP、搜索、邮件、支付或代码执行器后,需要保护的不是一段提示词,而是模型上下文、数据边界、工具权限和执行链路。 本文给…

阅读更多 →
AI Infra入门 之 3个公式算清大模型推理的算力上限与带宽瓶颈 2026/9/28 21:13:46

AI Infra入门 之 3个公式算清大模型推理的算力上限与带宽瓶颈

AI Infra 入门:3 个公式算清大模型推理的算力上限与带宽瓶颈(附 4090 / A100 / H100 手算过程)摘要:大模型推理慢,到底慢在哪?本文从最基础的两个公式出发,推导出 MFU / MBU 的定义,…

阅读更多 →
分布式锁与幂等设计实战:从 Redis 锁、ZooKeeper 到防重与去重方案 2026/9/28 21:13:46

分布式锁与幂等设计实战:从 Redis 锁、ZooKeeper 到防重与去重方案

摘要:高并发下重复下单、重复扣款、消息重复消费是分布式系统的资损重灾区。本文把「分布式锁(防并发)」与「幂等(防重复)」的职责边界讲透,从 Redis SET NX PX / Redlock、ZooKeeper 临时顺序节点到 fenci…

阅读更多 →
HarmonyOS 7 智慧手势不响应?先查 enabled、selectable,再查监听器有没有截走动作 2026/9/28 21:13:46

HarmonyOS 7 智慧手势不响应?先查 enabled、selectable,再查监听器有没有截走动作

HarmonyOS 7 智慧手势不响应?先查 enabled、selectable,再查监听器有没有截走动作 给按钮加了智慧手势属性,画面没有选中框,就认定接口没生效;于是又注册一个监听器,结果另一个页面的监听也收不到动作。这…

阅读更多 →
将 Unity 移植到 CoreCLR 2026/9/28 21:13:46

将 Unity 移植到 CoreCLR

关于垃圾收集器的一些情况 C# 语言的内存分配由垃圾回收器管理。在需要分配内存时,分配内存的代码可以在不再使用内存时忽略内存。GC 稍后会过来回收这些内存,供其他代码使用。 Unity 目前使用的是Boehm GC,这是一种保守的、不移动的 GC。它会扫描所有线程栈(包括托管代码…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉