新闻详情

新闻详情

首页 / 资讯中心 / 详情

OpenHands 实战:TaoToken 跑通 SWE-bench Verified 仓库级 Issue

发布时间:2026/9/19 23:02:03来源:尧图网络
OpenHands 实战:TaoToken 跑通 SWE-bench Verified 仓库级 Issue
告别海外账号与网络限制稳定直连全球优质大模型限时半价接入中。 点击领取海量免费额度1. 目标与产物用 OpenHands 处理一条仓库级 Issue本文的目标很具体在本地用 OpenHands 跑通一条 SWE-bench Verified 风格的仓库级 Issue并把模型供应商切换为 TaoToken。TaoToken 在这里承担默认供应商角色OpenHands 的推理、工具调用、补丁生成全部消耗同一把 Key。你最终会得到四样产物一份可复用的 OpenHands 模型配置片段、一条可复现的启动命令、一个落盘的 patch 文件路径以及一份按会话统计的 Token 用量记录。需要先说明边界本文不虚构 pass1也不声称某条 Issue 一定被修复。SWE-bench Verified 的官方榜单有固定评测口径本文只做本地单条 Issue 的复现流程不参与榜单排名。如果你需要看公开榜单数字请以 SWE-bench 官方页面为准本文不含排行分数。TaoToken 也不是该榜单的参赛方它只是模型调用的接入通道。开始前请先在 TaoToken 官网创建 Keyhttps://taotoken.net/?utm_sourcetaotoken_aicg_blog_generateutm_mediumcsdnutm_campaigngenerate 。创建完成后Base URL 统一填https://taotoken.net/api。下面所有配置都围绕这个地址展开。2. 环境准备与 OpenHands 安装OpenHands 的运行依赖 Docker因为它的 Agent 会在容器化沙箱里执行命令、读写文件。先确认本机 Docker 可用再安装 OpenHands。# 检查 Docker docker --version docker ps # 建议用 Python 虚拟环境安装 OpenHands python3 -m venv .venv source .venv/bin/activate # 安装 OpenHands版本以官方发布为准 pip install openhands-ai # 验证命令是否可用 openhands --help如果你更习惯容器方式运行也可以直接拉取 OpenHands 的运行时镜像但本文以 CLI 方式为主便于展示配置片段和 Token 统计。准备一条目标仓库。SWE-bench Verified 的实例通常包含一个 base commit 和一个 issue 描述。你可以从数据集里取一条也可以用自己的仓库模拟同样的结构git clone https://github.com/your-org/your-repo.git cd your-repo git checkout base_commit把 issue 描述保存为issue.md后续通过--task传入。注意仓库级任务的关键是让 Agent 能看到完整代码上下文而不是只给一段报错。3. TaoToken 接入与 OpenHands 配置OpenHands 的模型配置通过环境变量或config.toml注入。核心是把 LLM 的 base URL 指向 TaoToken并使用 TaoToken 创建的 Key。下面给出一个最小可用的配置片段。# ~/.openhands/config.toml [llm] model claude-sonnet-4-20250514 base_url https://taotoken.net/api api_key YOUR_TAOTOKEN_API_KEY temperature 0.2 max_output_tokens 8192 [agent] name CodeActAgent enable_auto_lint true如果你不想写配置文件也可以用环境变量启动export LLM_MODELclaude-sonnet-4-20250514 export LLM_BASE_URLhttps://taotoken.net/api export LLM_API_KEYYOUR_TAOTOKEN_API_KEY这里有几个容易踩的点。第一base_url不要带尾部斜杠也不要拼成/v1之外的路径OpenHands 会自行拼接。第二模型 ID 必须与 TaoToken 支持的模型列表一致写错会直接返回模型不存在。第三Key 建议放在环境变量或本地配置文件里不要提交到 Git。启动命令如下openhands \ --task $(cat issue.md) \ --repo ./your-repo \ --config ~/.openhands/config.toml \ --output ./runs/swe-issue-001OpenHands 会在./runs/swe-issue-001下生成会话日志、工具调用记录和最终 patch。patch 通常落在类似./runs/swe-issue-001/patches/fix.patch的路径具体以实际输出为准。4. 可验证结果与失败分支跑完后先看三样东西patch 文件是否存在、会话日志里是否有工具调用报错、Token 用量是否被记录。# 查看生成的 patch ls -la ./runs/swe-issue-001/patches/ cat ./runs/swe-issue-001/patches/fix.patch # 查看 Token 用量OpenHands 会在会话元数据中记录 cat ./runs/swe-issue-001/metadata.json | python -m json.tool | grep -i tokenToken 统计一般包含 prompt tokens、completion tokens 和总消耗。不同版本的 OpenHands 字段名可能不同以你本地输出为准。如果你需要更细的账单视角可以到 TaoToken 控制台查看该 Key 的调用记录https://taotoken.net/console?utm_sourcetaotoken_aicg_blog_generateutm_contentconsoleutm_campaigngenerate 。重跑命令就是上面那条openhands启动命令换一个--output目录即可。不要覆盖旧 run方便对比两次 patch 的差异。失败分支主要有四类第一401 或鉴权失败。检查 Key 是否复制完整、是否有多余空格、是否在 TaoToken 控制台被禁用。第二404 或模型不存在。检查模型 ID 拼写确认该模型在 TaoToken 当前可用列表内。第三Agent 卡在工具调用循环。通常是 issue 描述太模糊或仓库太大导致上下文超限可以缩小任务范围或换更长上下文的模型。第四patch 为空。查看会话日志里 Agent 是否真正执行了编辑命令有时是权限或沙箱路径问题。如果排障时需要确认接口行为可以查阅接入文档https://taotoken.net/doc?utm_sourcetaotoken_aicg_blog_generateutm_contentdocutm_campaigngenerate 。Key 管理入口在https://taotoken.net/api-keys?utm_sourcetaotoken_aicg_blog_generateutm_contentapi-keysutm_campaigngenerate 。5. 限制、成本与模型选择先说限制。仓库级 Issue 的难度差异极大同一条 Issue 换模型、换温度、换 Agent 策略都可能得到不同结果。本文只保证流程可复现不保证修复成功。SWE-bench Verified 的官方评测有固定 harness 和打分脚本本地单跑不能直接等同于榜单成绩。如果你要对比公开数字请以官方榜单页面为准并注意榜单日期和评测口径。成本方面Token 消耗取决于仓库大小、issue 长度、Agent 迭代轮数和模型单价。OpenHands 的 CodeAct 模式会频繁调用工具prompt tokens 往往远高于 completion tokens。建议先用小仓库或裁剪后的 issue 试跑观察单次消耗后再放大。TaoToken 的计费以官网和控制台展示为准本文不给出具体价格数字。模型选择上长上下文和强工具调用能力的模型更适合仓库级任务。你可以通过模型对话页面先做小样本验证https://taotoken.net/models?utm_sourcetaotoken_aicg_blog_generateutm_contentmodelsutm_campaigngenerate 。如果要做长期、多轮的 Agent 开发可以关注 Coding Planhttps://taotoken.net/coding-plan?utm_sourcetaotoken_aicg_blog_generateutm_contentcoding-planutm_campaigngenerate 。最后给一个可操作的验证清单patch 文件存在且非空、会话日志无未处理异常、Token 用量有记录、重跑命令能复现同一流程。满足这四条就说明 TaoToken 作为 OpenHands 的默认供应商已经接入成功。至于 Issue 是否被真正修复交给你的测试用例和 CI 去判断。 告别海外账号与网络限制稳定直连全球优质大模型限时半价接入中。 点击领取海量免费额度
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Turborepo Monorepo 最佳实践:从目录结构、包管理与依赖策略到缓存优化的完整指南 2026/9/20 2:29:37

Turborepo Monorepo 最佳实践:从目录结构、包管理与依赖策略到缓存优化的完整指南

构建工具开发工具CLI 【免费下载链接】turbo Build system optimized for JavaScript and TypeScript, written in Rust 项目地址: https://gitcode.com/gh_mirrors/tu/turbo 点击查看 免费下载 导读 本文是 Turborepo(Rust 编写的 JavaScript/TypeScr…

阅读更多 →
x64dbg 参数窗口刷新 API:GuiUpdateArgumentWidget 原理与插件实战指南 2026/9/20 2:29:37

x64dbg 参数窗口刷新 API:GuiUpdateArgumentWidget 原理与插件实战指南

x64dbg 参数窗口刷新 API:GuiUpdateArgumentWidget 原理与插件实战指南 【免费下载链接】x64dbg An open-source user mode debugger for Windows. Optimized for reverse engineering and malware analysis. 项目地址: https://gitcode.com/gh_mirrors/x6/x64dbg…

阅读更多 →
Django+Vue企业流程控制实战:状态机、文件流与Windows部署 2026/9/20 2:29:37

Django+Vue企业流程控制实战:状态机、文件流与Windows部署

今年做了好几套企业内部的流程系统,最有代表性的一套是用 Django Vue 前后端分离搭起来的工程流程控制系统。整个项目从需求梳理到上线部署,前后大概花了一个半月,踩了不少坑,也沉淀了不少可以直接复用的经验。这篇文章就是围绕这…

阅读更多 →
C8051F530电池检测器设计:从ADC采样链路到SOC估算与CAN上报的完整方案 2026/9/20 2:29:37

C8051F530电池检测器设计:从ADC采样链路到SOC估算与CAN上报的完整方案

简介:关于基于C8051F530汽车级单片机的电动汽车电池检测器设计的专业期刊文献,面向新能源汽车电子、电池管理系统研发人员及嵌入式工程师。内容以分布式电池管理系统结构为主线,重点剖析检测器硬件原理图设计,涵盖电池电压分压采样…

阅读更多 →
Hugo 站点方法 MainSections 完全指南:从配置驱动到自动推断的首页精选实现 2026/9/20 2:29:37

Hugo 站点方法 MainSections 完全指南:从配置驱动到自动推断的首页精选实现

开发工具前端CLI 【免费下载链接】hugo The world’s fastest framework for building websites. 项目地址: https://gitcode.com/gh_mirrors/hu/hugo 点击查看 免费下载 Site.MainSections 是 Hugo 中一个用于获取站点“主要分区(section)”…

阅读更多 →
DeepSeek Harness 架构决策解析:为什么删除 Windows 目录选择器的 PowerShell 回退链 2026/9/20 2:26:36

DeepSeek Harness 架构决策解析:为什么删除 Windows 目录选择器的 PowerShell 回退链

人工智能AI AgentAgent 框架DeepSeek 【免费下载链接】deepseek-harness DeepSeek Harness: Everything is a Plugin. 项目地址: https://gitcode.com/gh_mirrors/de/deepseek-harness 点击查看 免费下载 本文基于 DeepSeek Harness 仓库内已实施的架构变更笔记&am…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞