新闻详情

新闻详情

首页 / 资讯中心 / 详情

如何复现并验证SimpleEnglish的基准数据:面向开发者的诚实Benchmark完全教程

发布时间:2026/9/27 7:40:05来源:尧图网络
如何复现并验证SimpleEnglish的基准数据:面向开发者的诚实Benchmark完全教程
如何复现并验证SimpleEnglish的基准数据面向开发者的诚实Benchmark完全教程【免费下载链接】SimpleEnglishAgent skill: make LLMs write docs in ASD-STE100 Simplified Technical项目地址: https://gitcode.com/gh_mirrors/si/SimpleEnglishSimpleEnglish 是一个 Agent skill让大语言模型按 ASD-STE100 简化技术英语STE规范写文档。它的核心卖点是一组可复现的 Benchmark 数据开启 skill 后每百词 STE 违规数平均下降 74.6%7 个 Claude 模型 × 8 个写作任务共 112 次生成。本教程带你从零复现这些数据无需 API Key只需登录的 Claude Code CLI即使只想验证数据一条命令 30 秒搞定。动手前先看懂112 次生成在测什么复现之前先理解这套 benchmark 的设计才能判断结果是否可信组成内容文件模型7 个 Claude 模型opus-5 到 sonnet-4-6定义在 evals/run_bench.py 的MODELS任务8 个写作场景README 简介、快速上手、故障排查、错误消息、事故报告、发布说明、runbook 压缩、架构说明evals/scenarios.json条件每个任务跑两遍baseline无 skill和skill把 SKILL.md 全文注入 prompt同上评分器确定性正则 linter数句子超长、缩写词、禁用情态动词、slop 词汇等 12 类违规evals/ste_lint.py全部 8 个场景都围绕同一个虚构工具 sqlpipePostgres 同步到 S3 的 CLI保证 baseline 与 skill 两组输出面对完全相同的输入。环境准备3 项检查清单✅需要Python 3评分器纯标准库无第三方依赖Claude Code CLI 并已登录claude --version能输出即可仓库代码git clone https://gitcode.com/gh_mirrors/si/SimpleEnglish cd SimpleEnglish✅不需要API Key、付费额度之外的额外配置。先花 5 秒确认 linter 自检通过后面所有数字才有意义python3 evals/ste_lint.py --self-test三步命令复现 74.6% 的完整流程第 1 步冒烟测试1 个模型 × 2 个场景python3 evals/run_bench.py --smoke这条命令只跑claude-sonnet-4-6的前两个场景几十秒出结果用来确认 CLI 登录态和参数没问题。第 2 步完整矩阵7 模型 × 8 任务 × 2 条件 112 次生成python3 evals/run_bench.py几个值得注意的工程细节都写在 evals/run_bench.py 头部注释里可断点续跑evals/results/raw/下已存在的结果文件会自动跳过中断后重跑即可推理力度锁定low避免继承你本地配置的effortLevel每个 raw 文件都会记录实际用的力度每次调用禁用所有工具Bash、Read、WebFetch 等保证输出只来自语言模型本身。第 3 步只从原始数据重建报告不调用任何模型python3 evals/run_bench.py --report-only它扫描evals/results/raw/全部 JSON重新聚合出 evals/results/RESULTS.md 和 evals/results/results.json。这正是验证而非重跑的关键README 里的每一个数字都能从提交的 raw 文件复算出来。零成本验证直接给已提交的 raw 文件打分仓库里已提交 168 个 raw 文件112 个生成 56 个裁判打分你甚至不必调用任何模型就能验证公开数字# 重算主 benchmark 表格 python3 evals/run_bench.py --report-only # 重算其他 harness 的表格如 OpenAI API 的 gpt-4.1-mini降幅 95.8% python3 evals/score_text_dir.py evals/results/openai-2026-09-01/raw打分工具 evals/score_text_dir.py 会自动按文件名解析模型/条件/场景输出与 evals/results/openai-2026-09-01/RESULTS.md、evals/results/pi-2026-07-31/RESULTS.md 一致的表格。盲测裁判45/56 胜局是怎么来的除了硬性违规计数项目还跑了一轮盲测 pairwise 裁判evals/run_bench.py 的judge()函数python3 evals/run_bench.py --judge方法裁判模型claude-opus-4-8对每组 baseline/skill 文本按 0–10 分细则打分两种文本顺序各打一次再取平均消除位置偏差裁判看不到任何标签。最终 skill 输出在 56 组中胜出 45 组、平 5 组、输 6 组平均 8.12 分对 6.04 分。想复现时用自定义力度或输出目录python3 evals/run_bench.py --effort high # 覆盖锁定的 low 力度 python3 evals/run_bench.py --results-dir /tmp/r2 # 结果写到别处避免污染 raw/怎么读这些数字4 个诚实的 caveat结果报告 evals/results/RESULTS.md 专门有一节 Honest number warnings值得原样读一遍linter 是正则不是语法分析器查不出被动语态和词性问题绝对值偏低但两组用同一把尺子相对降幅依然公平skill 条件输入 token 更多因为 SKILL.md 全文进了 prompt所以报告的是输出 token7 个模型全部下降每格只生成一次想看方差就整矩阵重跑runner 可续跑删掉results/raw即可重来力度敏感同一批场景claude-opus-5 在low力度下是 85.0%xhigh下是 90.2%——比较结果前先确认effort一致。核心结论一句话74.6% 是用确定性 linter 在同一任务集上测得的均值最低的是 claude-opus-4-841%最高的 gpt-4.1-mini95.8%OpenAI API 通道。完整模型表见 evals/results/RESULTS.md。复现常见问题 FAQQ数字和我跑的不完全一样正常。每格一次生成语言模型有随机性项目文档也明确建议重跑矩阵看方差。对比的是量级与方向。Q我只想手工体验 skill 效果安装 skill 后新开会话粘贴 evals/scenarios.json 里任意一条 prompt再用 evals/pressure-tests.md 里的清单人工打分即可。Qskill 本体在哪里看53 条编号规则、Pragmatic/Strict 两种模式都在 skills/simple-english/SKILL.md配套词表在 skills/simple-english/references/word-swaps.md。按以上流程走完你就完整复现并独立验证了 SimpleEnglish 公开的全部 benchmark 数据——从 112 次生成到盲测裁判每一步都可从提交文件重算这正是诚实 benchmark的含义。【免费下载链接】SimpleEnglishAgent skill: make LLMs write docs in ASD-STE100 Simplified Technical项目地址: https://gitcode.com/gh_mirrors/si/SimpleEnglish创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

小程序软件制作网站怎么选?别被拖进开发黑洞 2026/9/27 8:22:21

小程序软件制作网站怎么选?别被拖进开发黑洞

小程序软件制作网站怎么选?别被拖进开发黑洞 改个需求建站公司拖一周,这种痛苦谁懂?很多老板找服务商做小程序或配套官网,前期谈得欢,后期改个按钮颜色、调个字段逻辑,对方一句“技术栈不兼容”或“排期满了”,直接晾你五天。这时候你才意识到,当初没…

阅读更多 →
自动化端到端压测流水线:用 Docker Compose 编排多节点探针集群极限压测 2026/9/27 8:22:21

自动化端到端压测流水线:用 Docker Compose 编排多节点探针集群极限压测

自动化端到端压测流水线:用 Docker Compose 编排多节点探针集群极限压测在分布式探针网络开发中,单靠本地单元测试或单进程模拟,无法真实还原数十个探针节点跨局域网高频并发推送、中心 gRPC 汇聚服务排队、ClickHouse 批量持久化、以及网络丢…

阅读更多 →
自已怎样网站别乱买,3步搞定性能优化与备案 2026/9/27 8:22:15

自已怎样网站别乱买,3步搞定性能优化与备案

自已怎样网站别乱买,3步搞定性能优化与备案 别再被那些“一键生成”的模板网站骗了。看着界面花里胡哨,打开慢得像蜗牛,改个颜色都要找客服排队三天,这种“模板网站太丑不够用”的痛点,多少创业团队负责人都踩过坑。 更糟心的是,模板站往往在…

阅读更多 →
48 小时极客原型:用 Viem 与 Framer Motion 打造全链 Web3 多签金库联签模拟器 2026/9/27 8:22:15

48 小时极客原型:用 Viem 与 Framer Motion 打造全链 Web3 多签金库联签模拟器

48 小时极客原型:用 Viem 与 Framer Motion 打造全链 Web3 多签金库联签模拟器在 DAO 国库治理与企业级 Web3 资产管理中,多签金库(Multi-signature Vault / Gnosis Safe 2-of-3 / 3-of-5) 是保障数亿美元资金安全的终极防御墙。 …

阅读更多 →
Microsoft AI Lab 仓库导览:体验、学习与编码微软 AI 最新创新 2026/9/27 8:22:15

Microsoft AI Lab 仓库导览:体验、学习与编码微软 AI 最新创新

示例工程 【免费下载链接】ailab Experience, Learn and Code the latest breakthrough innovations with Microsoft AI 项目地址: https://gitcode.com/gh_mirrors/ai/ailab 点击查看 免费下载 Microsoft AI Lab 是微软面向开发者社区推出的 AI 实验开源项目&…

阅读更多 →
物理机与虚拟化资源碎片整理与容量再平衡 2026/9/27 8:22:15

物理机与虚拟化资源碎片整理与容量再平衡

物理机与虚拟化资源碎片整理与容量再平衡在支撑大促的超大规模底层算力机群(如 2,000 台 128 核 512GB 内存的高规格裸金属物理机)长期运维中,存在着一个吞噬企业巨额算力资本的“隐形黑洞”——“计算资源碎片化与被搁浅的死算力&#xff08…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉