新闻详情

新闻详情

首页 / 资讯中心 / 详情

Manus AI深度拆解:多代理架构与自主执行技术全解析

发布时间:2026/9/19 21:25:49来源:尧图网络
Manus AI深度拆解:多代理架构与自主执行技术全解析
简介从AGI发展历程切入全面解读中国团队推出的Manus AI通用型智能体的技术报告PDF文档尤其适合人工智能研究、开发及相关领域从业者了解Agent如何推动AGI落地。文档系统覆盖五大板块AGI历史演进与未来趋势、Manus技术原理任务规划执行、认知控制中枢、多模态感知、金融分析/信息搜集/内容创作实测案例、用户体验评估以及商业化前景与当前瓶颈并附有交互指南与高级提示词技巧。整份资源为1个高清PDF文件约6.15MB便携可打印适合系统性阅读目前已有324人学习。读者能够据此建立从理论到实践的整体认知掌握让Manus自主完成复杂任务的指令方法理解中国团队在实用化路径上的独特优势。文档还揭示了Manus在多代理架构、Plan-Do-Check-Act工作流及GAIA基准测试中的表现适合作为研究者快速了解通用智能体的参考。1. Manus AI不是又一个聊天机器人它改变的是“谁在执行”Manus AI在2025年3月5日发布时很容易被误读成又一个GPT套壳。真正值得拆的不是那个对话窗口而是它把“由谁完成任务”这件事整个翻了过来传统LLM只负责生成文字Manus则在云端虚拟环境里自己打开浏览器、查财报、跑Python、出图表最后交付一份接近可用的结果。GAIA基准测试中Manus的任务完成率达到91.4%比OpenAI同类产品高出23个百分点成本却压到同类产品的十分之一。支撑它的是多代理架构、认知控制中枢、多模态感知和沙盒执行四套系统的组合。下面按技术栈逐层拆开并给出一份能照着落地的实现思路和排错清单。2. 从单体LLM到多代理架构Manus的认知控制中枢与工作流拆解2.1 为什么单体大模型扛不住“自主执行”常规大模型是按token自回归生成的。给它一个长指令它只能根据上下文“猜”下一步该输出什么没有环境反馈、没有重试机制。做一次简单问答没问题但要完成“查特斯拉财报→对比同行→生成仪表板”这种多步骤任务单次生成的错误会一路放大。Manus把手脚分开规划不靠一个模型从头生成到底而是让多个角色共享任务上下文各自负责一段。认知控制中枢是这里的关键。它采用神经符号系统把大模型的语义理解与知识图谱的逻辑推理拼在一起。输入中给到一组数字在医疗诊断这类专业任务中准确率达到89.7%比纯LLM方案提升34个百分点。对工程师来说这个数字的参考价值不在于“多准”而在于它证明了把自然语言结论先映射到结构化知识上能显著压住LLM的幻觉。多代理架构具体怎么落地按我拆Agent框架的习惯先看角色再看通信。2.2 Planner、Executor、Verifier三个角色如何分工Manus模拟的是Plan-Do-Check-Act循环。最简的多智能体版本至少要有Planner、Executor、Verifier三类角色共享一份任务状态而不是各聊各的各写各的。角色职责对应PDCA阶段典型输出Planner拆解目标、排依赖顺序、决定信息源Plan带依赖关系的子任务列表Executor调用浏览器、脚本、API执行具体动作Do中间文件、页面快照、数据表Verifier核对结果、判断是否重试、决定何时交付Check/Act修正指令或最终产物Planner不直接操作工具Executor不负责长期规划Verifier不参与行动。这样每个模块的指令都能收敛。对比一些我拆过的智能体项目最容易翻车的地方就是让一个Agent既规划又执行又自检一旦上下文里的中间结果变得很长模型会开始“为了完成而完成”编一个不存在的中间文件地址。Manus在GAIA基准上91.4%的完成率靠的也不是单个模型更强而是这套多代理接力把错误限制在局部。GAIA是一个偏“真实工作”的Agent基准题目需要搜索、读文件、写脚本配合才能解和普通常识问答完全不同。所以对它成绩有疑问时先看任务本身是不是可以单凭LLM知识回答能那测的就不是Agent。2.3 用Python实现一个最小可跑的Manus式任务拆解多代理的入口是Planner。下面这段代码是我在demo里常写的最小实现用LLM把用户目标转成结构化子任务import json from openai import OpenAI client OpenAI() # 请替换为你的key def plan_task(goal: str, max_steps: int 6, temperature: float 0.2) - list[dict]: prompt ( 你是一个Agent系统中的Planner。把下面的目标拆成不超过 f{max_steps}个子任务。每个子任务必须是JSON对象包含 action(web_search/visit_url/run_python/ask_user) reason(为什么需要这一步)dependencies(依赖哪些子任务序号)。 f只输出JSON不要额外解释。\n目标{goal} ) resp client.chat.completions.create( modelgpt-4o, temperaturetemperature, response_format{type: json_object}, messages[{role: user, content: prompt}], ) data json.loads(resp.choices[0].message.content) return data[tasks]这段代码有三个参数值得调。max_steps控制任务粒度信息收集类给到8步数据分析类给到4到5步太多会让后面的轮次被微小步骤占满。temperature保持在0.2附近规划需要稳定输出不是需要创意。response_format强制JSON是为了让Executor不用面对自然语言里的“大概、可能”这类模糊词。如果你把model换成开源模型记得先确认它支持JSON mode否则就用正则兜底抽取tasks字段。真正的Manus底层不一定用这个提示词但结构是一样的先结构化再执行执行结果回填到共享上下文Planner再决定要不要追加步骤。2.4 多代理与单Agent、固定工作流的差别很多人会问这跟LangChain里的一个Agent挂着工具列表有什么不同我一般用下面这张表回答。维度单Agent工具固定工作流Manus式多代理状态管理单上下文容易超长流程内局部状态共享任务状态加各角色局部记忆错误恢复靠模型硬重试按预设分支Verifier触发局部重试可解释性难中间步骤乱高高每步有产出扩展性加工具即可改流程加角色或改通信协议单Agent是“一个人干所有的活”适合任务链短、工具少、上下文短的场景。固定工作流适合那些“成功路径固定”的批处理比如每天定时抓数据再发报告。Manus这类多代理适合的是“路径不定但目标明确”的任务比如比较电商报价你不知道哪个平台会有验证码、哪个页面会改版只能靠Executor实时反馈Planner动态调整。这也是为什么Coze智能体和Dify这类平台会从纯工作流逐步加入Agent节点它们在往同一个方向收敛。3. 任务规划与多模态感知HRL、MCTS与跨模态对齐在Manus中的落点3.1 HRL把一个大目标递归拆成子目标Manus的规划系统用分层强化学习来拆任务。HRL的核心思想是高层策略决定“这一阶段做什么”低层策略决定“这一个动作怎么做”每一层都只对更细的粒度负责。def decompose(policy, goal, history, depth0): # 高层策略只在抽象层决策不关心具体点击行为 subtask policy.predict(goal, history) if depth MAX_DEPTH or executor.can_finish(subtask): return [subtask] # 把子任务继续下钻到下一层 derived subtask.derived_goal() return [subtask] decompose(policy, derived, history, depth 1)这段描述的是递归拆解关键在于can_finish它就是HRL中的“终止条件”。没有终止条件的递归会无限细分下去反映到真实系统里就是Agent在“查公司官网”这一步里给自己叠了20个无意义动作。我在调其他智能体项目时见过最多的问题就是规划层“过度思考”把一个小事拆成一棵树。所以实际部署时会在MAX_DEPTH3这一层强制收口宁可让Executor多尝试也不要让Planner永远在拆。3.2 MCTS与神经规划器搜索空间里的“下一步”规划器只用HRL不够因为同一目标可能有多种执行顺序。Manus把蒙特卡洛树搜索与神经规划器结合起来选路径做法是从当前状态出发反复做选择、扩展、模拟、回传用大量随机模拟的收益来评估哪个子任务先做更划算。规划阶段做什么常用上限Selection从已知节点里选最值得探索的子任务每层最多6个候选Expansion为该子任务展开可能的执行动作max_depth8Simulation模拟执行后得到的收益每节点20次模拟Backpropagation把收益逐层回传更新选择概率exploration_weight1.4MCTS的好处是“不追求每个分支都完美”而是把算力花在最有可能成功的路径上。碰到网页打不开、搜索无结果这类情况它会换一条分支继续走而不是死磕当前路径。这样GAIA里那种需要多步搜索加脚本计算的题目完成率能做到91.4%。这个数字会随数据集浮动但“多路径搜索”是Agent完成率提升最确定的因素。3.3 多模态感知ViT-22B、WaveNet与跨模态对齐Manus的感知系统已经不只在读文本。视觉模块用了ViT-22B做场景解析指标是每秒60帧听觉模块集成WaveNet变体语音指令识别率98.2%。这两组数字用在产品宣传里是卖点用在工程上要当上限看。模态模型/组件解析能力典型任务视觉ViT-22B60帧/秒实时场景解析理解网页截图、识别按钮位置听觉WaveNet变体98.2%指令识别率语音交互、指令转写跨模态对比学习联合嵌入文本-图像-声音统一向量空间多模态检索、目标识别更关键的是跨模态对齐。通过对比学习把文本、图像、声音映射到同一个向量空间后模型可以用文字描述去找对应的页面元素也可以把一段语音转成对操作序列的约束。工程上的意义是感知和行动不再是两套独立系统而是共享同一组嵌入。要在多模态Agent框架里复现这一点常见做法是用类似CLIP的对比损失import torch.nn.functional as F def contrastive_align(text_emb, visual_emb, temperature0.07): logits text_emb visual_emb.T / temperature labels torch.arange(len(text_emb)) return (F.cross_entropy(logits, labels) F.cross_entropy(logits.T, labels)) / 2这段是标准对称对比损失。temperature控制分布平滑程度越小越“自信”但太小的温度会把训练推过拟合0.07是CLIP论文里的常见起点。对称项的作用是让文本找图像和图像找文本两个方向的匹配能力都被训练到。3.4 沙盒虚拟环境让Agent在云端独立“动手”Manus把执行放在云端虚拟环境里用户看到的操作过程是它在另一台“电脑”上的一举一动。这样做首先是为了不跟用户本地电脑抢控制权不需要安装浏览器插件也不用把敏感操作放到本机。其次沙盒允许Agent任意安装依赖、运行Python、改写文件出了错直接把容器重置即可。我常用gVisor来做这类隔离执行命令大概是docker run --runtimerunsc --networknone \ -v $PWD/task:/workspace \ python:3.12-slim \ python /workspace/run_agent.py--runtimerunsc切到gVisor用户态内核比默认runc多一层系统调用过滤--networknone先关掉网络等Agent明确需要抓取网页时再单独放开某个域名-v把宿主机目录挂进去任务结束后的产物能原样取回。这样即便Agent生成的代码有异常行为也只在一次性容器里发生不会影响宿主。需要注意沙盒不是安全承诺。它解决的是“失控范围”的问题Agent写了个死循环杀容器就行Agent真去访问恶意网站网络隔离可以挡住但DNS外带这类小动作仍要配合日志审计。所以Manus强调“过程透明、人工可干预”本质上是把沙盒层做不到的安全兜底交给用户和权限控制。4. 在真实工作流里调用Manus金融分析、信息整合与过程干预4.1 从Prompt到可视化仪表板的完整生命周期一次完整的Manus任务可以拆成六个阶段目标输入、Planner拆解、Executor执行子任务、Verifier校验、打包交付、用户回调。多数公开案例停在“交付好看的结果”这一步但实际使用中我会更关注它执行到一半要用户介入的情况。原因很简单任务周期越长出错和等待用户确认的概率越高。比如遇到验证码、登录墙、付费内容Agent不能替你输密码也不能绕过风控。它会把当前状态保存下来回到对话里问你要许可。import time def wait_and_intervene(api, task_id, interval10): for _ in range(60): # 最多等10分钟 task api.get_task(task_id) if task.status in (completed, failed): return task if task.status needs_input: # 用户介入点填写验证码或补充信息 api.answer(task.id, 验证码已填写继续执行) time.sleep(interval) return api.get_task(task_id)这段轮询逻辑演示的是“不打断执行也不放任执行”的模式。interval设10秒能及时响应需要干预的状态60次上限避免长时间空转。实际产品你会把它接到消息队列或Webhook上但核心逻辑一样把needs_input当成普通状态而不是异常。4.2 金融分析实测特斯拉股票任务拆解顺序Manus做特斯拉股票分析时被拆成六步收集基本财务数据、分析行业竞争格局、评估市场趋势、研究监管与行业动态、查找分析师观点、总结投资建议。执行顺序不是线性的大致是在Google Finance或同类数据源拉取特斯拉最新财务数据顺带记录更新时间。打开特斯拉官网投资者页面确认财报PDF是否比聚合数据源更新。搜索竞争对手当前市值和季度营收建立横向对比表。浏览行业新闻和主流分析师近一个月报告提取评级变化。统一数据口径把原始数字转成折线图、饼图和指标卡片。在结果页标注“信息截止时间”和“未核实项”。如果要用它做投资决策我会建议只把它当“调研实习生”不要当“分析师”。它最后生成的仪表板很好看但你要去点每个图表背后的数字确认口径一致。比如“收入”是GAAP还是Non-GAAP“市值”取的是哪个交易日收盘价。多Agent系统最常见的坑是来自不同页面的同名字段含义未必相同Verifier却默认它们一致。4.3 多源信息整合与冲突处理规则Manus的另一个能力是跨平台搜索加信息整合。用户让它分析恐怖电影叙事技巧时它会在B站看视频、在知乎看讨论、在搜狐看影评、在IMDb查资料然后汇总成报告。这里最考验的不是“有没有信息”而是“冲突怎么处理”。我建议任何接入Agent的数据管线都维护一条优先级官方财报与一手数据大于权威媒体与学术来源再大于垂直社区讨论最后是社交平台评论。Manus这类智能体在整合时一般也会把来源等级和内容可信度一起写进输出。你可以在提示词里显式要求请把同一指标在不同来源中的数值并排展示不要自动合并。数值冲突时列出两个来源的出处、更新时间和抓取时间然后才给结论。这条指令的价值在于逼出矛盾而不是掩盖矛盾。很多Agent默认会把冲突信息悄悄选一个“看起来合理”的填进去这是最危险的。加了这个要求后至少你可以看到裂缝在哪。4.4 提示词与参数建议表下面是一组实际用过的提示词写法对应不同场景。Manus没有公开API版本的完整参数面板所以这里给的是提示词层面的控制方式落到自建Agent框架时直接映射到模型参数。场景提示词要点期望交付物建议max_steps建议temperature金融分析指定数据源、财报口径、截止时间带图表的仪表板6-100.2信息收集指定平台列表、冲突处理策略对比表加来源链接8-120.4内容创作给出受众、风格、字数上限多版本草稿4-60.7代码开发给出测试用例、运行环境可运行代码加日志5-80.1温度不是越高越好。规划、数据抽取这类任务温度0.1到0.3最合适内容创作可以放到0.7但再高就开始前后矛盾。max_steps也要跟执行环境配套搜网页和跑脚本的快慢不同同样的步数在纯网页任务里可能要跑20分钟别只在规划层设上限执行层也要有超时。4.5 异步任务状态与过程可追溯使用Manus时不需要盯着屏幕看每一步操作。更实用的方式是把任务ID存下来异步轮询或等回调通知。过程可追溯的意义在于结果出错时你能回放是哪一步引入的错误是源网站数据错了还是Executor脚本写错了还是Verifier漏判了。回放时主要看三个节点Planner的拆解顺序、Executor每一步的命令和输出、Verifier给出的判断依据。如果“查财报”这一步只花了1秒那它很可能是读了某个聚合页面的缓存不是翻了财报原文后续所有结论都要打折扣。把这些记录导出成JSON或日志文件交给另一个Agent去做审计是目前比较有效的防幻觉手段。5. 边界与排错把Manus当“实习生”而不是“神”5.1 哪些任务不适合交给Manus需要账号登录、支付、下载付费资料的任务先想清楚授权边界。Manus可以模拟操作浏览器但验证码、双因素认证和付费墙会卡住流程它把控制权交给你时体验并不比你自己操作来得快。另外低延迟交互场景也不适合每轮任务的执行周期是分钟级不是秒级聊天式问答请交给普通LLM。5.2 验证结果的三个动作拿到结果后哪怕它做得再漂亮也按下面三步走。第一要求它列出每个数字的来源URL和抓取时间凡是给不出来的指标全部标记为待核。第二用Python或Excel把关键口径复算一遍比如特斯拉季度收入跟着它的数据源重新拉一次看差值是否在合理范围内。第三追问“你没查到的信息有哪些”这一步能逼出它跳过的地方比让它再检查一遍有效得多。5.3 高级提示词要过程不要只给结论多数人把Manus当成“输出一份报告”的工具但它的产品定位是“过程可干预”。我会在任务描述里加一行执行过程中记录每一步的输入、输出和重试次数最后附上一张过程日志表。如果某一步超过3次失败停下来说明原因不要硬编一个结果。这条指令有两个作用一是提高结果可复现性下次改一个参数就能重新跑二是提前切断“为了完成而完成”的回路。把“只要结论”改成“附过程日志”这一条就能让Manus的输出质量上一个台阶。本文还有配套的精品资源点击获取
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

uni-app x App 平台标准运行基座全解析:包名签名、功能模块与权限配置实战 2026/9/19 22:10:56

uni-app x App 平台标准运行基座全解析:包名签名、功能模块与权限配置实战

uni-app x App 平台标准运行基座全解析:包名签名、功能模块与权限配置实战 【免费下载链接】uni-app A cross-platform framework using Vue.js 项目地址: https://gitcode.com/gh_mirrors/un/uni-app 本文以 uni-app x(Vue.js 跨平台框架&#x…

阅读更多 →
Vue CLI PWA 插件实战指南:@vue/cli-plugin-pwa 的 Service Worker 与 Web App Manifest 配置详解 2026/9/19 22:10:56

Vue CLI PWA 插件实战指南:@vue/cli-plugin-pwa 的 Service Worker 与 Web App Manifest 配置详解

Vue CLI PWA 插件实战指南:vue/cli-plugin-pwa 的 Service Worker 与 Web App Manifest 配置详解 【免费下载链接】vue-cli 🛠️ webpack-based tooling for Vue.js Development 项目地址: https://gitcode.com/gh_mirrors/vu/vue-cli 导读 本文…

阅读更多 →
Front-End-Checklist 实战:如何用 pnpm audit 与 CI 管道审计依赖漏洞(dependency-audit 规则深度解析) 2026/9/19 22:10:56

Front-End-Checklist 实战:如何用 pnpm audit 与 CI 管道审计依赖漏洞(dependency-audit 规则深度解析)

Front-End-Checklist 实战:如何用 pnpm audit 与 CI 管道审计依赖漏洞(dependency-audit 规则深度解析) 【免费下载链接】Front-End-Checklist 🗂 The essential checklist for modern web development, for humans and AI agents…

阅读更多 →
AutoGen 多智能体跑 Agentic Workflow,Base URL 填 TaoToken 2026/9/19 22:10:56

AutoGen 多智能体跑 Agentic Workflow,Base URL 填 TaoToken

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
CC Switch 指向 TaoToken:把 Qwen3.8 Max 设为默认模型 2026/9/19 22:10:56

CC Switch 指向 TaoToken:把 Qwen3.8 Max 设为默认模型

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
从传统AI到LLM Agent:技术演进与实战解析 2026/9/19 22:07:56

从传统AI到LLM Agent:技术演进与实战解析

1. 从传统AI到LLM Agent的技术演进2006年我在大学实验室第一次接触基于规则系统的聊天机器人时,需要手工编写数百条if-else规则来处理用户输入。这种传统AI系统存在明显的局限性:规则维护成本高、泛化能力差、对话场景受限。直到2022年GPT-3.5的出现&…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞