新闻详情

新闻详情

首页 / 资讯中心 / 详情

MAgent‑Eval:面向多智能体协作与博弈的大规模评测套件

发布时间:2026/9/25 20:03:57来源:尧图网络
MAgent‑Eval:面向多智能体协作与博弈的大规模评测套件
MAgent‑Eval:面向多智能体协作与博弈的大规模评测套件arXiv编号:arXiv:2609.21325v1 [cs.AI]摘要多智能体系统包含协作、竞争博弈、混合动机交互,是大模型智能体重要研究方向,但目前缺少统一、大规模、场景丰富的标准化评测套件。本文提出MAgent‑Eval,一套面向大语言模型多智能体交互的大规模开源评测套件。数据集包含1200条完整多智能体交互实例,覆盖三大交互范式:纯协作、零和博弈、混合动机博弈;涵盖谈判、团队规划、密室逃脱、资源竞争、社会困境、道德权衡等12类现实世界场景。MAgent‑Eval设计分层评测指标:包含单智能体个体能力指标、交互过程指标、全局系统级指标;同时提供可复现运行脚手架、参考评判脚本、标准化评估流水线。在10个主流大模型上开展大规模评测;实验揭示:模型在单智能体任务上的性能不能直接迁移预测多智能体交互表现;博弈对抗场景下,强单基座模型仍然会出现策略误判、被对手诱导等问题。消融实验分析智能体数量、信息不对称、角色分配对交互结果的影响。整套数据集、运行脚手架、评判脚本全部开源。关键词多智能体;多智能体评测;博弈;协作;混合动机;大语言模型智能体目录引言相关工作MAgent‑Eval评测套件设计3.1 任务分类与场景3.2 实例构造流程3.3 交互环境脚手架3.4 分层完整指标体系3.4.1 个体智能体指标3.4.2 交互过程指标3.4.3 全局系统指标实验设置4.1 被测模型集合4.2 评测执行配置4.3 对比参考基线主实验结果5.1 不同交互范式下模型整体表现
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

AI 辅助 Python 排错:从多出一个空页到回归测试 2026/9/25 20:36:36

AI 辅助 Python 排错:从多出一个空页到回归测试

4 条数据,每页 2 条,分页函数却返回了 3 页,最后一页还是空的。 代码没有抛异常,接口也可能正常返回成功状态。直到调用方发现“下一页”里什么都没有,问题才暴露出来。 这类 Bug 很适合用来练习 AI 辅助排错&#x…

阅读更多 →
Agent安全:权限控制与沙箱执行 2026/9/25 20:36:09

Agent安全:权限控制与沙箱执行

Agent安全:权限控制与沙箱执行 专栏:AI/LLM工程化实战 - 从Prompt到Agent的完整落地指南 模块4 Agent工程实战篇 第42篇 摘要 摘要:Agent权限最小化、工具白名单、代码沙箱subprocess受限执行、敏感数据脱敏、审计日志,是Agent安全防护的五大核心手段。用可运行Python实现一道工…

阅读更多 →
「Python 翻车日记 · 第 12 篇」一行 read() 读 5GB,电脑就炸了?——文件是流,不是一坨 2026/9/25 20:36:02

「Python 翻车日记 · 第 12 篇」一行 read() 读 5GB,电脑就炸了?——文件是流,不是一坨

Python 翻车日记 第 12 篇:一行 read() 读 5GB,电脑就炸了?——文件是流,不是一坨 📋 本期菜单:6 个文件 I/O 的坑 + 1 个模式速查,从「read OOM」到「JSON 中文转义」 [入门] read OOM with 句柄泄漏 glob 不递归 二进制写 str [进阶] os.path.join 绝对路径丢弃 …

阅读更多 →
K值新国标落地!2026选门窗不看这个参数,冬天多交一半暖气费 2026/9/25 20:36:02

K值新国标落地!2026选门窗不看这个参数,冬天多交一半暖气费

最近不少准备装修的朋友发现,去门店选窗户,销售都在提一个参数——K值。有的说是2.0,有的说是1.5,还有的说是1.1。这到底是个啥?新国标实施后,K值不达标会有什么后果?今天一篇讲清楚。K值到底是…

阅读更多 →
Agent框架对比:LangGraph、LlamaIndex、AutoGen三选一 2026/9/25 20:35:55

Agent框架对比:LangGraph、LlamaIndex、AutoGen三选一

Agent框架对比:LangGraph、LlamaIndex、AutoGen三选一 专栏:AI/LLM工程化实战 - 从Prompt到Agent的完整落地指南 模块4 Agent工程实战篇 第41篇 摘要 摘要:Agent框架选型、LangGraph有向图状态机、LlamaIndex数据编排、AutoGen多角色会话,是三大主流Agent框架的架构核心。用可运…

阅读更多 →
从Activity Log生成周报:工作事件模型、聚合规则与事实边界 2026/9/25 20:35:55

从Activity Log生成周报:工作事件模型、聚合规则与事实边界

自动生成周报的可靠路径,不是让模型扫描所有聊天并自由总结,而是先建立轻量 Activity Log:用结构化工作事件记录结果、决定、阻塞、行动和来源,再按项目与时间聚合,最后由模型负责表达压缩。 工作事件模型 type WorkEv…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉