拓冰建站拓冰建站
首页 / 资讯中心 / 正文

如何证明一个工具本身不AI味?avoid-ai-writing的PROOF.md自扫描与CI预算机制深度剖析

如何证明一个工具本身不AI味avoid-ai-writing的PROOF.md自扫描与CI预算机制深度剖析【免费下载链接】avoid-ai-writingSkill that audits and rewrites content to remove AI writing patterns. Use it with your favorite agents including Claude Code, OpenClaw, Codex, and Hermes.项目地址: https://gitcode.com/gh_mirrors/avo/avoid-ai-writingavoid-ai-writing 是一款专治AI 味的写作检测与改写技能skill它能审计文本、标出 70 多个 AI 写作模式并支持只检测与原地编辑两种用法。它最妙的一笔是用同一套检测器扫描自己的文档把分数、缺陷和预算全部公开——这就是 PROOF.md。本文拆解这套自扫描 CI 预算机制一个揪别人 AI 味的工具如何证明自己的写作也干净。为什么自证清白是这个项目的命门一个会把delve、leverage、seamless标成 AI 味的检测器如果自己的文档里全是这些词说服力就归零了。所以 avoid-ai-writing 立下了一条原则揪别人 AI 味的工具必须先活过自己的那一关而且要把不光彩的结果也放出来。PROOF.md的开头就写得很直白这一页就是detector/patterns.js扫完整个仓库文档的结果包括那些难看的部分。一条命令复现自扫描先看机制全貌不用装任何依赖克隆仓库跑一行命令即可Node ≥ 18git clone https://gitcode.com/gh_mirrors/avo/avoid-ai-writing cd avoid-ai-writing node scripts/self-scan.js脚本 scripts/self-scan.js 对 8 个核心文档README.md、SKILL.full.md、CHANGELOG.md等各扫两遍输出一张四列表文档词数原始分 (Raw)豁免分 (Exempt)预算 (Budget)README.md5,27358130SKILL.full.md18,13677925CONTRIBUTING.md1,3451115detector/README.md1,1741115detector/CATEGORIES.md1,6151015examples/README.md9311110CHANGELOG.md11,915573440PROOF.md1,163131220v3.34.02026-09-13 实测0 分最干净100 分最AI双分数为什么两个都要公布Raw原始分每个命中都算包括文档为了讲解规则而引用的示例词、整张 112 条词汇表。SKILL.full.md原始分高达 77因为目录里装满了它要检出的词。Exempt豁免分先机械地执行SKILL.md早已声明的免责规则——引号内示例、代码块、表格、引用块不参与评分——再打分。只公布好看的那个分数正是这个项目存在的原因所批判的行为。所以两个都发。豁免机制如何工作把规则变成可执行代码SKILL.md早就用文字写过一条规则讨论 AI 写作模式时引号内的示例词应豁免。但在那之前它只是给模型看的一句话。scripts/self-scan.js 里的applyExemptions()是它的可执行版本先抹掉围栏代码块因为它可能包含任何内容顺序不能反再抹掉行内代码抹掉 GFM 表格行抹掉引用块blockquote抹掉引号包裹的片段关键细节抹掉时用空格替换而不是删除保持每个字符的偏移量不变这样检出位置仍指向源码的正确位置。长文档超过约 9500 词还会按段落切成 4000 词的块逐段评分取最差块作为文档分数——一篇文档有多像机器写的就看它最差的那一段。自扫描抓到了什么4 个公开认领的真实缺陷扫描不是表演它真抓到了自家写作的问题PROOF.md逐条点名CHANGELOG.md分数最差豁免后 34/40发布说明里罗列新规则要抓的词bustling、intricate、ever-evolving……时不加引号检测器一眼就读出Tier 1 词汇连击。发布日志是人写的却踩了检测规则的坑。em-dash破折号规则漏了两种形状SKILL.md豁免了列表分隔符式破折号但没覆盖 Keep-a-Changelog 版本标题## [3.21.0] — 2026-07-30共 32 处和加粗词带括号的变体。137 个破折号里误计了 33 个后来修复并用测试夹具锁死范围——是扫描发现了它这正是要搞扫描这个论点的证据。PROOF.md自己也在表里得 12 分原因恰恰是它引用了那串 Tier 1 示例词——斜体不算豁免区间豁免只认引号、代码、表格、引用块。解释发布说明会触发检测器的页面因为点名模式而触发检测器。其中一处是真问题in order to已改为 to。README.md从原始分 58 掉到豁免后 1绝大部分命中来自它引用的模式目录和示例剩下的只是 1 个破折号 2 个轻微统计信号。CI 预算机制分数会漂移CI 来兜底光发布分数还不够——文档会持续编辑分数会漂移。avoid-ai-writing 给每个文档设了一个预算budget本质是只能下不能上的回归上限预算不是质量承诺而是从首次干净运行的实测值 几个点余量定出的天花板防止日常编辑误触 CI提高预算是一个必须写进 Pull Request、并写明新数值的决策不能悄悄改CHANGELOG.md的预算40故意更高因为发布说明天然要罗列被检测的词这个豁免够不着——预算数字本身就是文档在 CI 侧.github/workflows/detector-test.yml 在每次推送和 PR 上执行npm run self-scan:check对应 package.json 里的self-scan:check脚本。--check模式会对豁免分超预算的文档直接退出 1构建失败node scripts/self-scan.js --check # 超预算 → 退出码 1CI 红灯注意 CI 卡的是实时扫描结果而不是PROOF.md表格里的文字——后者只是某次提交的快照。这一设计避免了把漂亮数字写死在文档里、实际分数悄悄上涨的经典作弊路径。顺带一提这个仓库对外提供的 GitHub Action 质量门 用的是另一套口径按每文件确定性命中数卡阈值默认 6 次/文件由 376 篇人类文档语料校准与 0–100 综合分解耦。自扫描管自家文档Gate 管用户项目各司其职。诚实声明低分 ≠ 好文章 ≠ 人写的PROOF.md花了一整节讲这页不声称什么值得所有做工具的人抄作业低分只说明没有可被正则检出的表面模式不代表文字好更不代表是人写的综合分无法可靠区分机器文本与人类文本在 corpus/README.md 公布的 875 段人类 779 段机器文本对照中score 5时误报率 4.2%、命中率 7.2%段落级 ROC-AUC 0.501——掷硬币水平文档级也只有 0.623这些数字没被当头条吹出去因为它们没过仓库自己的发布标准每个数据格要求 n ≥ 100、置信区间、覆盖多种当代文体而是如实留在语料报告里检测器只测量正则可检出子集 少量文体统计信号空心但零命中的文字它是抓不到的。把边界说清楚比假装 omnipotent 更能赢得信任。你可以直接借鉴的 3 步清单这套自扫描 CI 预算机制不依赖 AI 检测本身任何写文档的项目都能搬把纸面规则变成可执行代码如果你的规则里有示例/引用豁免这类条款就写一个applyExemptions()机械执行它而不是靠人自觉双分数公开原始分和豁免分一起发把被抑制了什么摆在明面上消灭猜测空间预算只降不升 进 CI用实测值加余量定回归上限超预算就让构建失败提预算必须走 PR 留痕一个揪别人 AI 味的工具选择用最不 AI 的方式自证分数难看也发缺陷自己认边界自己说。这大概就是 PROOF.md 这个名字的全部含义。【免费下载链接】avoid-ai-writingSkill that audits and rewrites content to remove AI writing patterns. Use it with your favorite agents including Claude Code, OpenClaw, Codex, and Hermes.项目地址: https://gitcode.com/gh_mirrors/avo/avoid-ai-writing创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门