新闻详情

新闻详情

首页 / 资讯中心 / 详情

会数违规的正则Lint器:SimpleEnglish ste_lint.py 代码实现深度剖析

发布时间:2026/9/26 11:58:00来源:尧图网络
会数违规的正则Lint器:SimpleEnglish ste_lint.py 代码实现深度剖析
会数违规的正则Lint器SimpleEnglish ste_lint.py 代码实现深度剖析【免费下载链接】SimpleEnglishAgent skill: make LLMs write docs in ASD-STE100 Simplified Technical项目地址: https://gitcode.com/gh_mirrors/si/SimpleEnglishSimpleEnglish 是一个让 AI 按 ASD-STE100 简化技术英语STE写文档的 Agent 技能。它的可信度数字违规减少 74.6%全部来自一个 185 行的纯正则 Lint 工具 ste_lint.py——不靠语法解析器、不靠 LLM 判分只靠 10 条正则 线性扫描数出每一类违规。本文带你完整读懂它的实现。为什么用正则而不是语法解析器先说结论这是确定性违规计数器不是合规裁判。文件头注释写得很直白evals/ste_lint.py它只数正则能抓住的机械违规句子长度、缩写、禁用情态动词、完成时态、-ing从句、分号、破折号、拉丁缩写、slop 词、尾置条件、同义词轮换它会少算没有被动语态检测、没有词性检查它的数字只在同一版本工具跑两篇文本之间可比较这个定位很关键基准测试里 baseline 和 skill 两组输出用同一把尺子量比较就是公平的见 evals/results/RESULTS.md 的诚实数字警告一节。整体流程三步流水线lint()函数evals/ste_lint.py只有四步strip_code()清洗文本代码块整体删除、行内代码替换成一个占位词按 STE 规则 8.6引号文本算 1 个词、标题行整体豁免、URL 删除。这一步保证--force、5-10这类代码内容永远不触发误报sentences()切句先剥掉列表标记-、1.再在. ! ? :之后按空白切分过滤掉少于 2 个词的碎片逐条规则计数10 个计数器各跑一遍全文输出 JSON 报告总违规数、每 100 词违规密度violations_per_100w这就是基准表格里那个核心指标10 条正则规则详解全部规则集中在 evals/ste_lint.py 的 19 行代码里每条都对应 ASD-STE100 或技能自加的一条规则计数器抓什么对应规则sentence_over_limit过程文 20 词 / 描述文 25 词上限LIMITS字典Rule 5.1 / 6.3contractionnt、ll、its等缩写Rule 4.2banned_modalshould / would / may / might / could情态动词阶梯perfect_tensehas been、have 过去分词Rule 3.4ing_clause逗号后接 making / allowing 等-ing从句Rule 3.5semicolon分号简单count无正则Rule 8.1em_dash破折号最复杂见下技能自加latin_abbreve.g. / i.e. / etc.GR-6slop_wordsimply、robust、leverag*、seamlessly 等 16 个 AI 腔词反 sloptrailing_condition条件从句拖在命令后面见下Rule 5.4破折号一组精心的前瞻后顾— | (?!\d)–(?!\d) | (? )--(? ) | (?[^\s\d]{2}) - (?[^\s\d]{2})四个分支分别抓 em-dash、非数字范围的 en-dash、两侧空格的--、两侧都是实字符的-。--force、5 - 10、5–10、代码里的x - y全靠这些边界断言躲过误报。配套的DASH_FIXTUREevals/ste_lint.py故意放了 9 行陷阱文本自测断言只允许数出 3 个——这是个很好的回归测试写法。尾置条件一次真实的性能修复TRAILING_COND只是\s(if|when)\s判断条件是否拖在句尾靠trailing_cond()函数evals/ste_lint.py命中处往前找行首只有行首到命中的距离 ≥ 4 个字符才算尾置——这样标题 空行 If 开头的新句不会误判。注释里记录了一次真实性能事故旧版用前缀模式做这个判断长句子上回溯是平方级复杂度8000 词无标点输入要跑约 7 秒改成现在的线性扫描后降到亚毫秒。这段注释是读正则代码时最该记住的一课正则写得对不对还看它在最坏输入上跑得快不快。同义词轮换按词干去重计数ROTATION_SETS定义两组同义词check/verify/confirm/validate/ensureconfig/configuration/settings。计数逻辑evals/ste_lint.py同一组里出现了几个不同词干就记不同词干数 - 1次轮换。全篇只用 verify 不违规verify 和 check 混用才违规——精确对应 STE 一词一义、全文统一的精神。自测、CLI 与在基准中的位置自测python3 evals/ste_lint.py --self-test。三段固定夹具文本slop 段、干净段、破折号陷阱段覆盖全部 10 条规则干净段断言 0 违规evals/ste_lint.py。README 要求提交前必须跑它打分python3 evals/ste_lint.py --type procedural file.md输出 JSON 报告加--gate时若有违规返回退出码 1可直接接进 CI被谁调用基准运行器 evals/run_bench.py 在每次生成后立刻ste_lint.lint()打分evals/score_text_dir.py 用它复算任意 raw 结果目录的表格。8 个写作任务定义在 evals/scenarios.json文件导航 Lint 器本体evals/ste_lint.py基准运行器调用 lintevals/run_bench.py结果复算脚本evals/score_text_dir.py基准结果与数字警告evals/results/RESULTS.md规则目录正则抓的对象skills/simple-english/SKILL.md压力测试场景evals/pressure-tests.md一句话总结ste_lint.py的价值不在数得全而在数得稳清洗文本、固定规则、线性扫描、可复现。它诚实地标注了自己的天花板会少算、不是合规判决却因此撑起了整个项目每个数字都能从 raw 文件复算的基准体系。【免费下载链接】SimpleEnglishAgent skill: make LLMs write docs in ASD-STE100 Simplified Technical项目地址: https://gitcode.com/gh_mirrors/si/SimpleEnglish创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

反转字符串LeetCode 344:双指针原地修改与复杂度分析 2026/9/26 14:20:42

反转字符串LeetCode 344:双指针原地修改与复杂度分析

今天进入代码随想录算法训练营的第8天,字符串专题正式开篇。第一道题就是 LeetCode 344“反转字符串”,说实话刚看到题目的时候我觉得这题也太简单了,直接反向遍历拷贝一个新数组不就完事了吗?但真正动手做才发现,题目…

阅读更多 →
别只追Agent!企业AI落地的五大关键场景与实践 2026/9/26 14:20:42

别只追Agent!企业AI落地的五大关键场景与实践

现在打开任何一个行业社群,十个帖子里至少有三个在聊Agent,剩下的七个在问“Agent怎么学”“Agent框架怎么选”。热潮本身没错,但我发现一个挺有意思的现象:很多企业连最基础的AI能力都还没用好,就急着去搭那种“端到端…

阅读更多 →
企业AI落地实战:文档处理、数据问答与内容生产场景全解析 2026/9/26 14:20:42

企业AI落地实战:文档处理、数据问答与内容生产场景全解析

先说明一下:人人都想上 Agent,这个风气我是理解的。大模型能力卷到今天,Agent 确实是天花板最高的玩法,能自主规划、能调工具、能复盘迭代,做出来非常唬人。但作为一个在企业里做过不少 AI 落地项目的从业者&#xff0…

阅读更多 →
DeepSeek-V4.1-Flash实测:KV缓存压缩437倍,单卡跑百万Token Agent 2026/9/26 14:20:42

DeepSeek-V4.1-Flash实测:KV缓存压缩437倍,单卡跑百万Token Agent

DeepSeek-V4.1-Flash的技术报告放出来后,我第一时间把KV缓存压缩和百万上下文部署这两块翻来覆去读了几遍。群里不少朋友也在问,437倍这个数字到底是不是噱头,单卡跑百万token的Agent到底靠不靠谱。结合我这两周在本地部署、量化、Agent框架对…

阅读更多 →
从零训练多模态大模型:架构设计与实战踩坑实录 2026/9/26 14:20:42

从零训练多模态大模型:架构设计与实战踩坑实录

多模态大模型这个词,这两年几乎是被刷屏式地讨论。从闭源产品到各种开源项目,把图片、音频、文本混在一起训练出一个"能看会说"的模型,已经不是什么科幻设定。但"看别人做"和"自己从零搭一个"完全是两码事。我…

阅读更多 →
让AI推演游戏机制:从文本生成到可执行Agent的闭环实践 2026/9/26 14:20:36

让AI推演游戏机制:从文本生成到可执行Agent的闭环实践

1. 为什么“让 AI 推演游戏机制”比“让 AI 写策划案”难得多 1.1 从“生成文本”到“推演系统”的鸿沟 大多数人对 AI 辅助游戏设计的想象,停留在“帮我写一段技能描述”或者“生成十个副本名字”这个层面。这确实能用,但价值有限——因为这些任务本质…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉