新闻详情

新闻详情

首页 / 资讯中心 / 详情

【论文速递】2025年第33周(Aug-10-16):GLM-4.5与MoE架构在Robotics/Embodied AI/LLM中的落地观察

发布时间:2026/9/26 14:54:53来源:尧图网络
【论文速递】2025年第33周(Aug-10-16):GLM-4.5与MoE架构在Robotics/Embodied AI/LLM中的落地观察
1. 2025年第33周论文速递里GLM-4.5 与 MoE 到底在解决什么问题如果你这周刷 arXiv 的 Robotics、Embodied AI、LLM 板块大概率会被同一批关键词反复砸中GLM-4.5、MoE、ARC、SWE-bench。它们不是孤立的热词而是指向同一个工程现实——模型参数越堆越大但真正落到 Agent、机器人、代码修复这些任务上大家关心的已经不是“能不能答对一道题”而是“能不能在几十轮工具调用里稳定地把事做完”。GLM-4.5 这篇arXiv:2508.06471给出的信号很直接355B 总参数、32B 激活参数的 MoE 架构混合推理模式同时支持 thinking 和 direct response在 TAU-Bench 上 70.1%、AIME 24 上 91.0%、SWE-bench Verified 上 64.2%。注意这里的 ARC 不是那个视觉推理数据集而是 Agentic、Reasoning、Coding 三个能力的缩写。也就是说这一周的论文主线是把“推理能力”从单轮问答推进到多轮代理执行。同一周里ReasonRank 用两阶段后训练把 listwise 重排的 BRIGHT 分数推到 40.6ASearcher 用大规模异步 RL 把搜索代理的工具调用拉到 40 轮以上、输出 token 超过 150kKlear-Reasoner 提出 GPPO 解决裁剪机制压制探索信号的问题AIME 2024 拿到 90.5%。这些工作放在一起看MoE 负责把激活成本压下来RL 后训练负责把长程行为训出来SWE-bench 这类基准负责检验代码修复的真实落地。问题也随之而来这些论文的实验环境大多依赖统一的模型调用通道。你在本地复现时如果每个项目都去单独配一套 Key、改一遍 base_url光是环境切换就能耗掉半天。我这周把几个仓库拉下来跑通验证用的是一套统一的 Key 和通道配置下面把可复制的骨架和踩坑清单整理出来你可以直接照着改。2. 前置准备用 TaoToken 统一 Key 打通论文复现的模型通道论文复现最烦的不是算法是环境。GLM-4.5 的 GitHub 仓库、ASearcher 的 RL 训练脚本、ReasonRank 的重排评测各自默认的模型接入方式不一样。有的走 OpenAI 兼容接口有的走 Anthropic 风格有的在 config 里写死了 endpoint。如果每个都单独申请、单独配切换成本很高。我的做法是先用一个统一通道把模型调用收敛掉。TaoToken 提供 OpenAI 兼容的 API 入口base_url 用https://taotoken.net/apiKey 在控制台生成。这样 Cline、CC Switch、以及大部分论文仓库里的 OpenAI SDK 调用都能指向同一个地址不用改业务代码。具体操作路径先在官网 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content 注册然后进控制台 https://taotoken.net/console?utm_sourcetaotoken_aicg_blog_endutm_contentconsoleutm_campaignrewrite 创建 API Key。Key 只在创建时完整显示一次复制后先存到本地环境变量别直接写进要提交的配置文件。export TAOTOKEN_API_KEYsk-你的key如果你要验证 GLM-4.5 这类模型的对话效果可以直接在模型对话页 https://taotoken.net/models?utm_sourcetaotoken_aicg_blog_endutm_contentmodelsutm_campaignrewrite 先做一轮手动测试确认通道通了再写进代码。长期跑编码和 Agent 任务的话Coding Plan https://taotoken.net/coding-plan?utm_sourcetaotoken_aicg_blog_endutm_contentcoding-planutm_campaignrewrite 更适合因为论文复现往往要连续多轮调用按量计费容易失控。注意Key 不要硬编码进 settings.json 后提交到 Git。用环境变量引用或者放在.env里并加进.gitignore。3. 可复制配置settings.json 与 config.toml 两套骨架论文仓库的配置格式不统一我按最常见的两种给你。Cline 和 CC Switch 走 JSON部分 Python 训练脚本和 CLI 工具走 TOML。两套都指向同一个 base_urlKey 从环境变量读。3.1 Cline / CC Switch 的 settings.jsonCline 的配置在 VS Code 设置里CC Switch 用它自己的 settings.json。核心字段是 base_url、api_key、model。下面这份可以直接改{ llm: { provider: openai-compatible, baseUrl: https://taotoken.net/api, apiKey: ${TAOTOKEN_API_KEY}, model: glm-4.5, temperature: 0.6, maxTokens: 8192, timeout: 120000 }, agent: { maxTurns: 40, toolCallRetry: 3, stream: true } }几个参数说明。baseUrl结尾不要带/v1OpenAI 兼容层会自动补路径带了反而容易 404。maxTurns设 40 是因为这周 ASearcher 那篇论文里工具调用超过 40 轮复现长程搜索时轮数给够。timeout给 120 秒GLM-4.5 的 thinking 模式在复杂推理上响应会慢一些超时太短会误判为失败。3.2 Python 训练脚本的 config.toml如果你跑的是 ReasonRank 或 Klear-Reasoner 这类带 RL 后训练的仓库配置多半是 TOML。下面这份骨架把模型通道和训练超参分开[model] provider openai base_url https://taotoken.net/api api_key_env TAOTOKEN_API_KEY name glm-4.5 context_window 128000 [inference] temperature 0.7 top_p 0.95 max_new_tokens 4096 stream false [agent] max_tool_calls 40 search_top_k 10 rerank_enabled true [training] method grpo learning_rate 1e-6 batch_size 8 rollout_n 4api_key_env写环境变量名而不是值这样配置文件可以进版本库。context_window给 128k是因为 PRELUDE 那篇长上下文基准里 88% 的实例需要跨多个叙事片段找证据上下文窗口不够直接跑不动。rerank_enabled对应 ReasonRank 的重排流程跑 BRIGHT 评测时打开。提示不同仓库对字段名大小写敏感。如果加载报 KeyError先对照仓库的 config 示例把base_url和baseUrl这种差异对齐。4. 验证请求从单轮对话到 SWE-bench 风格任务配置写完先别急着跑完整训练。用最小请求验证通道再逐步加复杂度。第一步curl 验证基础连通curl https://taotoken.net/api/chat/completions \ -H Authorization: Bearer $TAOTOKEN_API_KEY \ -H Content-Type: application/json \ -d { model: glm-4.5, messages: [{role: user, content: 用一句话说明 MoE 的激活参数和总参数区别}], max_tokens: 256 }返回里能看到choices[0].message.content就说明通道通了。如果返回 401检查 Key 有没有带Bearer前缀返回 404检查 base_url 是不是多写了/v1。第二步Python SDK 验证多轮工具调用。论文里的 Agent 任务基本都是多轮单轮通了不代表多轮没问题import os from openai import OpenAI client OpenAI( base_urlhttps://taotoken.net/api, api_keyos.environ[TAOTOKEN_API_KEY], ) messages [ {role: system, content: 你是一个代码修复代理先分析再给补丁。}, {role: user, content: 函数返回 None 而不是列表定位并修复。}, ] resp client.chat.completions.create( modelglm-4.5, messagesmessages, temperature0.6, max_tokens2048, ) print(resp.choices[0].message.content)跑通后把model换成你要复现的论文对应模型messages换成仓库里的 prompt 模板。SWE-bench 风格的验证重点看模型能不能在给定 issue 描述后输出可应用的 diff而不是泛泛而谈。第三步长程搜索验证。ASearcher 那篇的核心是 40 轮以上工具调用你可以用一个需要多次检索的问题测tools [{ type: function, function: { name: search, description: 检索外部信息, parameters: { type: object, properties: {query: {type: string}}, required: [query] } } }] resp client.chat.completions.create( modelglm-4.5, messages[{role: user, content: 对比 GLM-4.5 和 Klear-Reasoner 在 AIME 上的表现差异}], toolstools, tool_choiceauto, )如果模型返回tool_calls说明工具调用链路正常。接下来把 search 函数接到真实检索上观察轮数是否稳定增长。5. 本篇常见错排查清单复现论文环境时报错集中在几个地方。我按出现频率排一下。401 UnauthorizedKey 没读到。检查环境变量是否在当前 shell 生效echo $TAOTOKEN_API_KEY看有没有值。如果是 systemd 或 Docker 里跑环境变量不会自动继承要在 service 文件或 compose 里显式声明。404 Not Foundbase_url 路径写错。正确是https://taotoken.net/api不要加/v1也不要在结尾加斜杠。有些仓库的 SDK 会自动拼/chat/completions你再加一层就重复了。429 Too Many Requests并发太高。RL 训练里 rollout 数量大容易触发限流。把rollout_n从 4 降到 2或者加指数退避重试import time from openai import RateLimitError def call_with_retry(fn, max_retries5): for i in range(max_retries): try: return fn() except RateLimitError: time.sleep(2 ** i) raise RuntimeError(重试耗尽)响应截断max_tokens太小。GLM-4.5 的 thinking 模式会先输出推理过程再给答案max_tokens给 2048 经常不够。复杂任务直接给 8192或者把 thinking 和 response 分开统计。工具调用格式错乱模型返回的tool_calls参数不是合法 JSON。这多半是 prompt 里没约束清楚。在 system message 里明确要求“工具参数必须是合法 JSON不要加注释”能减少大部分问题。长上下文 OOMPRELUDE 这类基准动辄几十万 token。本地显存不够时别硬扛把context_window调小或者用检索把无关片段先过滤掉再送模型。配置文件字段不生效TOML 里写了但代码没读到。检查加载逻辑是不是只读了默认路径很多仓库支持--config参数指定路径不指定就读仓库根目录的默认文件。6. 把通道固定下来再谈论文复现这一周论文的共同点是把模型能力从“单点正确”推向“长程稳定”。GLM-4.5 的 ARC 定位、ASearcher 的 40 轮工具调用、Klear-Reasoner 对裁剪机制的修正都在说同一件事评测和复现的瓶颈已经从模型本身转移到工程链路上。我的建议是先把模型通道固定成一套配置再动算法。Cline 和 CC Switch 里接入后用模型对话页 https://taotoken.net/models?utm_sourcetaotoken_aicg_blog_endutm_contentmodelsutm_campaignrewrite 做快速验证确认通道稳定后再跑训练。需要长期跑编码和 Agent 任务的Coding Plan https://taotoken.net/coding-plan?utm_sourcetaotoken_aicg_blog_endutm_contentcoding-planutm_campaignrewrite 比按量计费更可控。接入文档在 https://taotoken.net/doc?utm_sourcetaotoken_aicg_blog_endutm_contentdocutm_campaignrewriteAPI Key 在 https://taotoken.net/api-keys?utm_sourcetaotoken_aicg_blog_endutm_contentapi-keysutm_campaignrewrite 管理。配置骨架给你了报错清单也列了。接下来就是把你关心的那篇论文的 prompt 模板塞进messages跑第一轮看返回。跑不通就对着第 5 节逐条排跑通了再谈调参。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Apereo CAS 全览:企业级单点登录与身份平台的架构、协议与部署指南 2026/9/26 15:41:34

Apereo CAS 全览:企业级单点登录与身份平台的架构、协议与部署指南

后端认证鉴权单点登录 【免费下载链接】cas Apereo CAS - Identity & Single Sign On for all earthlings and beyond. 项目地址: https://gitcode.com/gh_mirrors/ca/cas 点击查看 免费下载 Apereo CAS(Central Authentication Service&#xff09…

阅读更多 →
STM32 GPIO按键输入:从电压读值到消抖中断的完整指南 2026/9/26 15:41:28

STM32 GPIO按键输入:从电压读值到消抖中断的完整指南

把按键接到 STM32 的 GPIO 上,几乎是每个玩单片机的人上手必做的实验。但你有没有想过一个问题:按下按键的那一刻,单片机到底读到了什么?是“按下”这个动作吗?是一个“1”或者“0”的数字吗?答案其实比你想…

阅读更多 →
@envelop/graphql-modules 使用指南:在 GraphQL Yoga 中正确接入 graphql-modules 依赖注入 2026/9/26 15:41:28

@envelop/graphql-modules 使用指南:在 GraphQL Yoga 中正确接入 graphql-modules 依赖注入

后端API设计 【免费下载链接】graphql-yoga 🧘 Rewrite of a fully-featured GraphQL Server with focus on easy setup, performance & great developer experience. The core of Yoga implements WHATWG Fetch API and can run/deploy on any JS environment.…

阅读更多 →
ClaudeCode快速入门:用TaoToken统一Key跑通CLAUDE.md与斜杠命令 2026/9/26 15:41:21

ClaudeCode快速入门:用TaoToken统一Key跑通CLAUDE.md与斜杠命令

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
零基础上手 OpenClaw:Windows 环境搭建自动化 AI 工具与 TaoToken 配置指南 2026/9/26 15:41:21

零基础上手 OpenClaw:Windows 环境搭建自动化 AI 工具与 TaoToken 配置指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
FAST DisclosureAppearance 类型解析:fast-disclosure 组件的 appearance 取值与实战用法 2026/9/26 15:41:15

FAST DisclosureAppearance 类型解析:fast-disclosure 组件的 appearance 取值与实战用法

前端UI组件 【免费下载链接】fast The adaptive interface system for modern web experiences. 项目地址: https://gitcode.com/gh_mirrors/fa/fast 点击查看 免费下载 DisclosureAppearance 是 FAST 组件库(microsoft/fast-components)中为…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉