新闻详情

新闻详情

首页 / 资讯中心 / 详情

实测:我用3步把AI生成的开发文档去AI生成痕迹后,过了平台原创审核

发布时间:2026/10/1 15:37:51来源:尧图网络
实测:我用3步把AI生成的开发文档去AI生成痕迹后,过了平台原创审核
上周赶项目周报里的接口迭代文档凑着deadline让GPT写了五千字提交原创认证直接被打回平台判定是AI生成内容连提交三次都没过。本来想着随便改改就能过结果折腾了一晚上才摸透去AI生成痕迹的正确姿势踩了一堆没必要的坑。一开始我图省事网上随便找了个一键伪原创工具全量上传跑了一遍。出来的东西直接没法看把“Redis的过期淘汰策略”改成“远程字典服务的到期剔除规则”连代码块里的注释都给我替换了// 加锁防止并发冲突直接变成// 上锁避免同时发生争抢矛盾。后端同事扫了一眼文档问我是不是最近被开了找外包写的。我翻了翻返回的平台拒绝提示明确写着“内容经检测存在高比例AI生成特征非原创内容不予收录”连申诉入口都没给。后来我干脆把AI写的初稿全部导出本地逐段对比我自己平时写的技术文档才反应过来我之前的方向完全错了。做去AI生成痕迹的核心逻辑别改语序改“人写的特征”很多人踩的第一个坑就是拿AI生成的内容瞎换同义词、硬调语序。改完之后语义不通顺就算了连技术术语都错漏百出同行看一眼就知道不是正经开发写的反而更容易被检测模型标记。我翻了几篇我自己两年前写的、平台从来没判定过AI生成的旧文档拉了下文本特征做对比发现AI生成内容的破绽根本不在语义逻辑上全在那些没人会注意的细节里所有段落的字数几乎完全均匀没有长段短段的跳跃句长高度集中在20-30字区间几乎没有5个字以内的短句也很少有超过50字的长句标点使用极度规范几乎不用破折号、省略号这类带个人习惯的标点连顿号的使用频率都远低于人类写的技术文档不会出现任何带个人实践属性的冗余信息所有内容都是干巴巴的通用知识搞懂这点之后我先写了个十几行的小脚本专门往AI生成的文档里注入人类开发者才会写的冗余细节。import re import random # 预存的团队内部常用的技术黑话/个人实践备注库 PERSONAL_NOTES [ 这里上次联调踩过坑超时时间必须设3s不然大流量下直接堆死, 这块我上周刚跟运维确认过实例是8G内存的单次查库最多别超2w条, 顺便提一句之前老版本的SDK有bug传参的枚举值大小写敏感要注意, ] def inject_human_features(markdown_content: str) - str: # 按段落拆分单独隔离代码块避免误改 parts re.split(r([\s\S]*?), markdown_content) processed [] for part in parts: if part.startswith(): # 仅随机调整少量缩进模拟人手动粘贴代码的误差 if random.random() 0.3: part part.replace(\n , \t, random.randint(1,3)) processed.append(part) continue paragraphs part.split(\n\n) for p in paragraphs: if len(p.strip()) 20: processed.append(p) continue # 30%概率在段落末尾追加一条个人实践备注 if random.random() 0.3: note random.choice(PERSONAL_NOTES) processed.append(p f\n {note}) else: processed.append(p) return \n\n.join(processed)跑一遍这个脚本之后整个文档的“人味”一下就上来了再也不是AI那种冷冰冰的、全是通用知识的规整感。但我当时跑了下简单的特征校验发现句长分布的问题还没解决AI生成的句子长度太均匀了一眼看过去整整齐齐完全不符合人写东西的习惯。我又补了个句长调整的脚本专门把太长的句子随机拆成短句太短的无关紧要的短句随机合并把整个文档的句长熵值拉到和我自己平时写的文档差不多的区间。import re import jieba def adjust_sentence_length(text: str) - str: # 先按句号/逗号拆分句子单元 sentences re.split(r([。]), text) result [] i 0 while i len(sentences) - 1: s sentences[i] sentences[i1] # 句长超过35字70%概率拆成两句 if len(s) 35 and random.random() 0.7: # 找分词后的停顿点拆分保证语义通顺 words list(jieba.cut(s)) split_pos random.randint(len(words)//3, len(words)//2) part1 .join(words[:split_pos]) part2 .join(words[split_pos:]) result.append(part1) result.append(part2) elif len(s) 10 and i 0 and random.random() 0.5: # 无关短句子50%概率和前一句合并 result[-1] result[-1].removesuffix() s else: result.append(s) i 2 return .join(result)这里说个很少有人知道的细节现在主流的AIGC检测模型80%的判定权重根本不在内容语义的原创性上而是看文本的n-gram重复度、句长分布的熵值、甚至标点符号的使用频率。很多人改了半天内容语义结果这些底层特征完全和AI生成的分布一致当然会被直接打回。我当时跑通这两个脚本之后又手动往文档里加了两个破折号把三个并列的参数名用顿号堆在一起进一步拉低AI特征的匹配度。改写完之后我习惯性地丢到团象AI检测里跑一遍确认检测率降到阈值以下再往下走。扫了一遍报告我才发现之前我完全忽略了附录里的接口字段说明部分。那部分是AI直接生成的规整表格每一行都是“字段名类型说明”的统一格式连字数都完全一样是整个文档里AI特征最高的部分。我干脆直接把那部分表格删了重写成半文半表的形式把原来的规整说明全部换成自己的实操经验。比如把原来的“user_id:int:用户唯一标识”改成“user_id 这里我之前踩过坑类型别用long老前端那边解析超过16位的数字会丢精度直接存字符串就行”完全没有之前的规整感。等全部调整完我又踩了个小坑之前写脚本的时候忘记加规则代码块里的SQL也被我写的句长调整函数拆成了两半好好的一条SELECT语句被拆的乱七八糟我又补了十行规则所有代码块、表格里的单元格内容全部跳过处理只修改正文的普通段落再也没出过类似的问题。当时把调整完的文档重新提交原创审核10分钟就收到了过审通知之前三次提交都是秒拒。后来我把这套流程固化成了自己的固定工作流AI先出文档骨架和通用知识点我自己往里面填所有真实的踩坑经验和团队内部的专属细节跑两个脚本调整句长分布和注入个人备注最后手动扫一遍修正可能的术语错误。全程花的时间比我自己从头写省60%出来的内容没有任何生硬的修改痕迹所有同行看了都觉得是我自己实打实写的实操记录。别信什么一键工具能完全搞定市面上大部分自动去AI生成痕迹的工具本质上还是在乱替换同义词改完之后术语错误率极高稍微懂点行的人一眼就能看出问题反而更容易被平台标记违规。对了我后来又给脚本补了个小逻辑随机在文档里加一两个无关紧要的格式笔误比如把规范写法“HTTP 2.0”偶尔写成“HTTP2.0”故意漏个空格。人写文档的时候经常会偷懒忽略这类格式细节AI反而会严格按照规范给你把空格全补上这种小细节调整完几乎所有检测模型都抓不到对应的AI特征。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

AI限速治理:从协议、芯片到模型的闭环实践 2026/10/1 17:50:25

AI限速治理:从协议、芯片到模型的闭环实践

1. 这不是新闻简报,而是一份AI治理现场观察手记今天早上七点四十三分,我盯着安理会听证会直播页面上那个被反复打码的“AI限速”提案PDF封面,手指悬在键盘上方停了三秒——这标题里没一个字是虚的,但每个词都像裹着三层雾。云栖、…

阅读更多 →
腾讯位置服务热力图实战:坐标聚合、分位数与性能调优 2026/10/1 17:50:25

腾讯位置服务热力图实战:坐标聚合、分位数与性能调优

做地图可视化的人大概率都遇到过这种场景:业务方丢过来一张几十万行的设备上报记录或者订单表,就问一句"能不能看出人都在哪儿扎堆"。绕来绕去,你最终要交付的核心其实就是一张读得懂的热力图。腾讯位置服务在这件事上给了一套相对…

阅读更多 →
Seata连接Nacos认证失败403:特殊字符URL编码问题解析 2026/10/1 17:50:19

Seata连接Nacos认证失败403:特殊字符URL编码问题解析

1. 问题本质与真实场景还原Nacos 和 Seata 在微服务架构中属于高频共存组件:Nacos 作为注册中心和配置中心,Seata 作为分布式事务协调器,两者通过registry.conf配置文件建立连接。但当 Nacos 启用了账号密码认证(尤其是密码含特殊…

阅读更多 →
AI日报制作全流程:从信息筛选到技术拆解与知识管理 2026/10/1 17:50:18

AI日报制作全流程:从信息筛选到技术拆解与知识管理

1. 一份AI日报的诞生:从信息洪流到结构化简报每天早上七点,我的浏览器标签页会同时打开十几个信息源:arXiv上的最新预印本、几个头部AI实验室的官方博客、GitHub Trending、还有三四个行业社群的讨论串。这个习惯保持了快三年,起因…

阅读更多 →
阿里云ECS磁盘使用率过高排查:定位、清理与在线扩容实战 2026/10/1 17:50:12

阿里云ECS磁盘使用率过高排查:定位、清理与在线扩容实战

运维干了几年,最怕半夜收到阿里云的短信告警,其中磁盘使用率超过80%这条尤其让人头疼。很多新手同学第一反应是直接扩容,结果扩完没两天又满了,其实核心问题是没搞明白数据到底是谁占的。这篇文章就把我处理阿里云ECS磁盘使用率过…

阅读更多 →
CentOS停更后如何迁移:VMware上部署Ubuntu Server+JDK+Tomcat全指南 2026/10/1 17:50:12

CentOS停更后如何迁移:VMware上部署Ubuntu Server+JDK+Tomcat全指南

最近总有人问我同一个问题:CentOS 7停止维护了,手上那一堆服务器该往哪儿迁?我的答案一直是 Ubuntu Server。这不是拍脑袋,而是我自己这几年在 VMware 上反复折腾 Ubuntu Server 22.04、JDK、Tomcat 之后一步步试出来的结论。这篇…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉