新闻详情

新闻详情

首页 / 资讯中心 / 详情

SWE-bench 快速上手指南:用真实 GitHub Issue 评测大模型的编程能力

发布时间:2026/9/26 2:01:59来源:尧图网络
SWE-bench 快速上手指南:用真实 GitHub Issue 评测大模型的编程能力
SWE-bench 快速上手指南用真实 GitHub Issue 评测大模型的编程能力【免费下载链接】SWE-benchSWE-bench: Can Language Models Resolve Real-world Github Issues?项目地址: https://gitcode.com/GitHub_Trending/sw/SWE-benchSWE-bench 是用真实 GitHub Issue 考察大模型软件工程能力的评测基准给它一个仓库和一个 issue模型需要产出能修好它的补丁评测器再在容器里跑测试给出可复现的客观分数。演示很聪明上线就翻车你让新接入的编码助手修一个真实 bugdemo 里写得很漂亮合进主干后既有测试却挂了三个。没有客观数据谁更强只能靠感觉和宣传。这正是 SWE-bench 要回答的问题——模型在真实代码库上到底能不能修好真实的 issue且不误伤别的测试它解决什么不解决什么SWE-bench 解决一件事给 LLM 的读题—改码—过测试能力打分题库来自 GitHub 上的真实 issue 与 PR。它不解决另外几件事不是代码补全或算法题评测不替代你项目里的 CI 测试体系也不会替你修 bug——它只负责考模型负责答。SWE-bench 评测机制容器化三步走每个任务实例都带齐五样东西仓库与base_commit、issue 描述、参考补丁gold patch、测试补丁以及FAIL_TO_PASS/PASS_TO_PASS两组测试名。这是判断修好了的依据前者必须从失败变通过后者必须保持通过。第一步为实例构建专属 Docker 镜像镜像构建逻辑在 swebench/image_builder/把仓库固定在出 bug 的那个 commit 上保证每次评测都在同一环境里进行消除机器差异。第二步应用补丁并运行测试容器里先应用测试补丁再打上模型生成的model_patch随后运行测试脚本并解析输出各语言的解析器位于swebench/harness/log_parsers/。两组测试都满足才算 resolved结果按run_id和instance_id缓存。SWE-bench 快速上手跑通你的第一次评测先装好 Docker再安装项目并做环境自检git clone https://gitcode.com/GitHub_Trending/sw/SWE-bench cd SWE-bench pip install -e . # 用官方参考补丁gold验证环境只跑 1 个实例 python -m swebench.harness.run_evaluation \ --max_workers 1 \ --instance_ids sympy__sympy-20590 \ --predictions_path gold \ --run_id validate-gold跑通后你会看到logs/下出现镜像构建与评测日志evaluation_results/里是最终结果sympy 这个实例应显示为 resolved。这条 gold 验证是后续一切自定义评测的前置检查环境不对先别怪模型。适用人群与使用边界适合需要在多个编码模型或助手之间做客观对比、验证微调效果、或把评测接入流水线的团队。不适合机器不满足官方建议至少 120GB 磁盘、16GB 内存、8 核 CPU 的 x86_64 环境只关心代码补全质量的场景或者不想碰 Docker 的人——整个评测流程都跑在容器里--max_workers建议取min(0.75 * cpu_count, 24)。数据集可按需求挑full 全量 2,294 实例、lite 534 实例快速迭代、verified 500 个经工程师确认可解的实例另有含截图的多模态版与覆盖 9 种语言、300 实例的多语言版对照见 docs/guides/datasets.md。进阶玩法生成预测与离线复判有了预测文件每行含instance_id、model_patch的 JSONL即可正式评测也可以直接用内置 agent 生成预测或基于已存日志重新打分不用重起容器swebench infer verified -m gpt-5 -o preds -w 8 # 用 mini-SWE-agent 生成预测 swebench report run_id # 基于已存日志重新判定想把结果提交到排行榜走swebench submit package / publish / register三步即可想给自己的仓库造新任务swebench/collect/ 开源了完整的数据收集管线见 docs/guides/collection.md。回到开头的问题助手修完 bug 后既有测试挂了现在你有一条可量化的路。先用 gold 验证确认环境正确再用同一套命令评自己的模型。分数背后是真实 issue 和真实测试选型不用再凭感觉。【免费下载链接】SWE-benchSWE-bench: Can Language Models Resolve Real-world Github Issues?项目地址: https://gitcode.com/GitHub_Trending/sw/SWE-bench创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Jev模型深度拆解:推理提速20-200倍的轻量方案与实战指南 2026/9/26 2:33:29

Jev模型深度拆解:推理提速20-200倍的轻量方案与实战指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
Sa-Token JSON Body验签实战:从原始报文到国密SM2防重放 2026/9/26 2:33:29

Sa-Token JSON Body验签实战:从原始报文到国密SM2防重放

做服务端开发的人,应该都有过这种经历:对接第三方开放平台、支付回调或者公司内部服务联调的时候,对方丢过来一段 JSON 报文,要求“先验签,再处理”。我前阵子就遇到一个需求,系统权限体系用的是 Sa-Token&…

阅读更多 →
CTF Wiki 贡献文档要求解析:从内容格式、结构合理性到仓库存储的完整规范 2026/9/26 2:33:23

CTF Wiki 贡献文档要求解析:从内容格式、结构合理性到仓库存储的完整规范

文档网络安全教程 【免费下载链接】ctf-wiki Come and join us, we need you! 项目地址: https://gitcode.com/gh_mirrors/ct/ctf-wiki 点击查看 免费下载 CTF Wiki 是一个面向 CTF 学习者的开源安全知识库,其知识文档由社区贡献者共同维护。为了让每一…

阅读更多 →
弹幕网站的鼻祖NABC,谁排第一? 2026/9/26 2:33:16

弹幕网站的鼻祖NABC,谁排第一?

弹幕文化如今已是视频网站的标配,但追根溯源,这个“弹幕家族”的四位元老——NABC,各自的位置其实早已注定。N站(NICONICO):真正的开创者,没有争议的第一2006年12月12日,日本niconic…

阅读更多 →
CC攻击与DDoS攻击的识别与防御实战指南 2026/9/26 2:33:10

CC攻击与DDoS攻击的识别与防御实战指南

1. 先搞清楚:CC攻击和DDoS攻击到底是不是一回事我见过太多人把CC和DDoS混为一谈,尤其在跟客户沟通的时候,经常听到"我们被DDoS了,特征是有大量请求打不进来"。但实际情况往往分成两种截然不同的场景:一种是带…

阅读更多 →
Windows软件安装工具 2026/9/26 2:33:10

Windows软件安装工具

Windows大家最熟悉的软件安装方式,就是下载一个安装包,运行安装程序了。安装后命令行里也可以运行此程序,因为安装过程中会自动更新系统的PATH环境变量。 但除此之外,可以直接使用命令提示行(Command Prompt&#xff0…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉