新闻详情

新闻详情

首页 / 资讯中心 / 详情

SWE-bench完整指南:2294个真实GitHub Issue,一次跑通大模型的修Bug能力

发布时间:2026/9/26 2:28:53来源:尧图网络
SWE-bench完整指南:2294个真实GitHub Issue,一次跑通大模型的修Bug能力
SWE-bench完整指南2294个真实GitHub Issue一次跑通大模型的修Bug能力【免费下载链接】SWE-benchSWE-bench: Can Language Models Resolve Real-world Github Issues?项目地址: https://gitcode.com/GitHub_Trending/sw/SWE-benchSWE-bench是面向大语言模型的软件工程评测基准它用真实GitHub Issue构造任务把模型生成的补丁放进容器跑测试量化模型解决真实问题的能力核心功能是一套可复现的评测框架与多版本数据集。模型说它会修Bug你凭什么相信演示环境里模型改错一个文件就能让修好了的结论瞬间失效。各家模型都在宣称更强的编码能力但演示里的例子往往挑得很巧代码短、上下文干净、没有历史包袱。真实的Issue则恰恰相反——描述含糊、涉及跨文件改动、还带着项目自己的测试习惯。SWE-bench要回答的问题很直接把模型放进一个和真实仓库完全一致的Docker环境里只给它Issue文本和代码它写出的补丁到底能不能让测试通过。SWE-bench评测流程图一个Issue如何变成评分这张图展示了从输入Issue到产出评测结论的完整链路每个实例都在独立Docker容器内执行环境、依赖、测试命令全部锁定在镜像里换台机器跑结果依然可比。源码入口在 swebench/harness/主流程函数为run_instances。SWE-bench评测框架三个核心组件这一节拆开评测框架最关键的三块容器、解析器、计分。容器化评测环境是什么harness 为每个实例构建专属Docker镜像在其中 checkout 到指定 base_commit、应用模型补丁、执行eval.sh测试脚本。为什么关键评测结论只反映补丁质量不掺入你本机环境的噪声这也是结果可被第三方复现的前提。怎么落地装好Docker后直接走 安装与Docker配置 即可构建日志落在logs/build_images/。语言日志解析器是什么swebench/harness/log_parsers/ 下按语言组织了十余个解析器覆盖 pytest、cargo、jest、gradle、go test、cargo、phpunit 等常见测试输出格式。为什么关键测试打印的往往是几百行混杂输出解析器负责从中精确提取每个用例的状态。怎么落地仓库到解析器的映射在 解析器入口 维护按instance_id对应的仓库自动路由。判定与计分逻辑是什么swebench/harness/grading.py 依据实例里的两类测试判定结果FAIL_TO_PASS原失败、补丁后应转通过与PASS_TO_PASS原本通过、不允许被破坏。为什么关键修复必须同时治好目标问题且不引发回归单一通过率不足以说明问题。怎么落地运行结束生成汇总与每个实例的report.json可用swebench report run_id离线重算分数不再起容器。SWE-bench数据集变体怎么选五个变体覆盖从快速验证到跨语言评测的不同预算选择时先看规模再看是否匹配你的系统能力。数据集规模特点适用场景SWE-benchfull2294 实例覆盖多样化开源仓库论文级全面评测SWE-bench Lite534 实例精选子集跑得快日常迭代与工具联调SWE-bench Verified500 实例工程师确认可解附难度字段模型选型与横向对比SWE-bench Multimodal100 dev / 500 test附 UI 截图等视觉素材多模态系统评测SWE-bench Multilingual300 实例9 种语言、42 个仓库跨语言泛化验证每个实例字段统一problem_statementIssue 文本、base_commit、patch黄金补丁、test_patch完整说明见 数据集指南。SWE-bench评测环境快速验证步骤先用一条最短命令验证环境再谈批量评测。下面这段克隆仓库并完成可编辑安装git clone https://gitcode.com/GitHub_Trending/sw/SWE-bench cd SWE-bench pip install -e .装完后你会得到swebench命令行这是后续所有评测操作的入口。再用 gold 模式跑单个实例验证整条链路swebench eval verified --gold -i sympy__sympy-20590 --run-id validate-gold跑完预期该实例被判定为 resolved结论写入evaluation_results/过程日志位于logs/run_evaluation/。金补丁若不能通过说明环境没搭对先修环境再评模型。SWE-bench进阶玩法从CI接入到并行调优环境验证通过后下面三个方向可以显著提升使用效率。接入CI流水线每次换模型或提示词后自动评一遍 Lite分数变化即时可见swebench-eval: script: - pip install -e . - swebench eval lite -p ./preds.jsonl --run-id ci -j 8 artifacts: paths: [evaluation_results/]跑完流水线即可拿到汇总 JSON直接接看板。扩展新语言的日志解析接入新仓库类型时通常只差一个解析器def parse_log_newtool(log: str, test_spec) - dict[str, str]: ... # 从测试输出中提取用例状态 MAP_REPO_TO_PARSER[owner__repo] parse_log_newtool注册后新仓库的实例就能进入现成的评测链路。并行度与缓存调优吞吐不够时先构建镜像再批量评测并按机器规模调并行度swebench images build lite -j 8 swebench eval lite -p preds.jsonl -j $(( 3 * $(nproc) / 4 ))官方建议并行度不超过min(0.75 * 核数, 24)并预留 120GB 磁盘另注意 harness 按run_idinstance_id缓存结果换补丁重评记得换新的run_id。SWE-bench路线图与社区生态多模态方向持续开源Multimodal v2 已提供 480 个任务供本地评测。评测全面容器化并支持 Modal 等云平台跑批量任务本地资源不再是硬门槛。官方提供 数据收集流水线可按同样流程为自己的仓库生产新任务。解析器、收集脚本与 harness 均以社区贡献为主新仓库、新语言支持持续合入。下一步行动先跑通上面的单实例金补丁验证确认容器与依赖无误。随后用swebench eval lite评一份真实预测拿到你的第一个 resolve 率基线。有基线后再决定往 Verified 对比选型还是把评测接进 CI 做长期监控。【免费下载链接】SWE-benchSWE-bench: Can Language Models Resolve Real-world Github Issues?项目地址: https://gitcode.com/GitHub_Trending/sw/SWE-bench创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

【dtoj begin#4211】「TDog 2021 S Day5 」单词:用 TaoToken 统一 Key 跑通本地评测配置 2026/9/26 3:03:13

【dtoj begin#4211】「TDog 2021 S Day5 」单词:用 TaoToken 统一 Key 跑通本地评测配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
GPT-Image-2.5协议解析:Flare与Sunburst选型指南 2026/9/26 3:03:13

GPT-Image-2.5协议解析:Flare与Sunburst选型指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
小米MiMo Desktop内测审核机制深度解析 2026/9/26 3:03:06

小米MiMo Desktop内测审核机制深度解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
MIT:LLM强化学习推测个性化需求,Agentic Memory 配置实战 2026/9/26 3:03:06

MIT:LLM强化学习推测个性化需求,Agentic Memory 配置实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
让 AI 一句话管监控与事件:OneUptime MCP 服务器接入、查询与排障实战 2026/9/26 3:03:06

让 AI 一句话管监控与事件:OneUptime MCP 服务器接入、查询与排障实战

让 AI 一句话管监控与事件:OneUptime MCP 服务器接入、查询与排障实战 【免费下载链接】oneuptime Complete open-source monitoring and observability platform. 项目地址: https://gitcode.com/GitHub_Trending/on/oneuptime 开源监控平台 OneUptime 内置…

阅读更多 →
CAD自定义线型全攻略:从LIN文件到linetype命令 2026/9/26 3:03:06

CAD自定义线型全攻略:从LIN文件到linetype命令

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉