拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Evidence Ladder:为 GitHub Copilot 证据图谱构建可审计的证据分级与边关系判定体系

Evidence Ladder为 GitHub Copilot 证据图谱构建可审计的证据分级与边关系判定体系【免费下载链接】awesome-copilotCommunity-contributed instructions, agents, skills, and configurations to help you make the most of GitHub Copilot.项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-copilot证据阶梯Evidence Ladder是 awesome-copilot 仓库中build-evidence-map技能的核心参照标准它回答一个关键问题在构建可审计的证据图谱evidence map时如何判定一条来源到底是强证据还是弱代理以及当两条证据相互冲突或相互收窄时应当使用哪种边关系来表达。本文以 skills/build-evidence-map/references/evidence-ladder.md 为骨架结合该技能的 SKILL.md、map-schema.md 以及校验脚本 validate.mjs 与 contract.mjs完整讲解六级证据阶梯、来源区域测试Source-region test与边关系测试Edge test并落到可执行的校验机制上。读完后你将能在有争议的技术选型、研究综述评审或重大决策场景中把支持、反对、限定、缺失四类证据用精确的图结构与机器可校验的 JSON 表达出来。一、为什么需要一条证据阶梯在 Copilot 辅助决策时最常见的问题不是没有证据而是证据被平铺直叙地堆在一起一段二手博客、一次本地复现、一个官方文档截图被并列展示读者无法判断哪一条更可靠也无法识别哪一条其实只是表面相关。build-evidence-map技能把一次有争议的决策转译成一个可移植的决策工件decision artifact而证据阶梯正是这个工件内部证据质量分层的规则来源。阶梯的核心原则只有一句见 evidence-ladder.md 开头Use the strongest evidence practical for the decision. A higher class can still be stale, irrelevant, or too broad for the nearby claim.即为决策选用实际可行的最强证据但等级更高并不自动意味着更可信——过时stale、不相关irrelevant或相对于所支撑主张过于宽泛too broad的高等级证据依然可能劣于精准的低等级证据。这一相对性提醒构成了整个分级体系的设计灵魂阶梯衡量的是证据种类而 Source-region test 与 Edge test 衡量的是证据与主张的贴合度两者必须配合使用。二、六级证据阶梯全解证据阶梯从 1 到 6 定义了六类证据来源编号越小代表该类证据与直接证实主张的关联越强。以下逐级展开分级定义继承自 evidence-ladder.md。1. 直接当前观察Direct current observation定义可复现的行为、命令输出、被检视的工件artifact或实测结果。典型形态本地运行某命令后捕获的输出、curl请求的返回体、构建产物的反汇编、压测得到的吞吐数值。判定要点这类证据是第一手的、当下的不是转述。它的可信基础在于可复现性——同一环境、同一命令应当得到同一结果。在证据图谱中一条直接观察通常对应一个evidence节点并在locator中记录确切的命令或输出行范围。注意直接观察只证明它发生了不代表它应该发生或它对决策重要。如果观察环境与决策目标环境不同如本机 Node 18 与生产 Node 20就应当用qualifies边收窄其适用范围而不是直接宣称支持。2. 权威一手来源Authoritative primary source定义官方规范specification、数据集、法律条文、官方文档、第一方仓库或原始研究。典型形态RFC 文档、语言规范、官方 SDK 仓库、法规原文、学术论文的原始实验数据。判定要点关键词是一手与权威。一手意味着它自己就是事实的源头而非转载权威意味着发布方对所述内容负有专业责任。官方仓库的源码、官方文档中的配置说明都属于此类。注意权威来源也可能版本过期。阶梯明确提示higher class can still be stale因此在sources中必须记录date与retrievedAt校验器会强制要求这两个日期为真实 ISO 日期且不得晚于图谱的updatedAt。3. 独立佐证Independent corroboration定义拥有不同底层证据来源的合格来源competent sources with distinct underlying evidence。典型形态两家互不相关厂商的性能测试、两份独立团队编写的实现报告、多个独立社区对同一行为的实测。判定要点关键在于底层证据独立。如果 B 的报告只是摘抄了 A 的图表即使 B 再权威也不算独立佐证——这正是 Source-region test 中Is the evidence independent, or copied from another cited source?要拦截的情况。4. 显式推断Explicit inference定义一个结论其前提与假设在图谱中可见premises and assumptions are visible in the map。典型形态由claim节点经supports/qualifies边推导出的中间命题。判定要点推断本身不是问题未言明的推断才是问题。阶梯要求推断的前提premises与假设assumptions必须在图谱中以节点形式可见从而让任何读者都能沿有向边回溯检查推理过程。校验器中的每个非 position 节点必须有通向 position 的有向路径规则正是为了强制这种可回溯性。5. 弱代理Weak proxy定义相关的指标、基准benchmark、轶事或测试但没有直接检验该主张does not exercise the exact claim。典型形态用某个相似库的基准测试去推断目标库的性能用一次偶然复现的报错当作系统性缺陷的证据。判定要点弱代理最大的风险是形似而神不似——它讨论的是同一主题却不一定蕴含entail节点文本。阶梯对弱代理的态度是承认其存在、标明其层级而不是删除有时没有更强的证据可用此时弱代理可以作为evidence节点入图但应当通过qualifies边明确标注其适用范围局限。6. 无支撑断言Unsupported assertion定义仅凭自信、重复或措辞华丽而没有证据支撑的说法confidence, repetition, or polished language without evidence。典型形态营销文案中的业界最强、重复强调的明显更优、没有数据的个人偏好。判定要点这类内容在阶梯中处于最底层但它同样值得被记录——因为它可能是待决策方position的反方证据或需要被反驳的目标。关键区别在于断言可以入图但必须以unsupported的性质被标注而不是伪装成证据。注意阶梯第 1 级与 schemamap-schema.md 中的confidencefields are invalid都不允许用置信度百分比来伪造精确性这与第 6 级的精神一脉相承如果你只有断言就老老实实标注为断言或unknown不要给数字。三、来源区域测试Source-region test等级决定证据的种类强度而来源区域测试决定证据是否真的落在主张上。在创建任何evidence节点之前evidence-ladder.md 要求依次回答五个问题具体依赖什么所依赖的究竟是哪一句、哪张表、哪段命令输出、哪一页、哪一节或哪一行范围exact sentence, table, command output, page, section, or line range是否蕴含节点文本它是否真正蕴含entail节点所陈述的内容还是仅仅讨论了同一个主题日期与版本是否适配它的日期和版本是否适合该主张例如用 2023 年的文档论证 2026 年的行为就是不匹配是否独立它是独立证据还是从另一个被引用来源中复制而来反证条件什么样的上下文会逆转或收窄reverse or narrow当前解释最后一条至关重要如果无法定位确切来源区域不要创建evidence节点而是创建一个unknown节点。这一规则在 schema 与校验器中得到了结构化的落实map-schema.md 要求每个 source 提供locator有界的页码、章节、行范围或时间戳与 40–500 字符的excerptcontract.mjs 中的LOCATOR_PATTERNS正则只认p. 7、§ 2.1、L12-L18、lines 3-9、00:04:31、Section: Results这类有界定位符boundedLocator()无法匹配的定位会被判为source-locator违规substantiveExcerpt()要求摘录的字母数字符号种类不少于 6 种杜绝呵呵呵呵式的重复填充文本。换句话说Source-region test 不是口头建议而是被 validate.mjs 逐字段强制执行的机器可检约束。四、边关系测试Edge test四类关系的判定边界证据进入图谱后必须以supports、contradicts、qualifies、missing四种关系中的一种与目标节点相连。阶梯给出的判定表是全文最容易被误用的部分原文完整如下继承自 evidence-ladder.md关系Relation何时使用Use when常见赝品Common counterfeitsupports来源提高了接受目标的理由仅仅是主题相似Topical similaritycontradicts在同一范围与条件下两者不能同时成立日期或人群不同Different dates or populationsqualifies来源收窄了目标的范围、强度或适用性隐藏不利证据Hiding inconvenient evidencemissing某个具体缺失的事实阻碍或可能逆转目标笼统的还需要更多研究Generic more research needed逐条拆解supports的赝品是主题相似。两篇文档都讨论 Docker 不代表一篇支持另一篇的结论。支持必须使接受目标的理由增加这与 Source-region test 第 2 问是否 entail 节点文本严格对应。SKILL.md 工作流第 4 步也强调Topical similarity is not support.contradicts的赝品是不同日期或人群。2023 年的测试说 A 快、2026 年的测试说 B 快并不自动构成矛盾——它们作用的人群/环境不同。只有在同一范围与条件下两者不能同时成立才是真正的contradicts否则应当拆分为两个独立证据并各自qualifies。qualifies的赝品是隐藏不利证据。用一条限定条件悄悄淡化反方证据等于把contradicts伪装成qualifies。合法的qualifies必须在note中显式说明收窄了什么范围、强度、适用性让读者能看到收窄动作本身。missing的赝品是笼统的更多研究。missing必须指向一个具体的、可指认的缺失事实并且说明它为何可能改变结论。例如缺少生产环境下 Node 20 的压测数据可能导致第 3 条证据不适用是合法的missing而建议进一步研究则是被 map-schema.md 明确否决的假阳性。在实现层面contract.mjs用RELATIONS new Set([supports, contradicts, qualifies, missing])白名单约束边关系任何其他取值都会触发edge-relation违规同时用from/to/relation三元组去重杜绝重复推理边。五、从阶梯到可执行校验图谱的硬性不变量证据阶梯的思想最终要落到机器可校验的工件上。build-evidence-map的规范工件是 UTF-8 JSON推荐.doubt.json后缀其结构在 map-schema.md 中给出顶层为title、question、updatedAt、verdict主体为nodes四类节点、edges四类关系、sources含url、publisher、date、retrievedAt、locator、excerpt。contract.mjs 的inspectMapContract()把这些要求编译为一组可枚举的不变量节选关键几条恰好一个position节点且必须至少有一条入边unsupported-position违规确保结论不是悬空的证据节点必须带sourceId且该sourceId必须指向sources中真实存在的来源unknown-source违规每个evidence节点必须至少参与一条边unused-evidence防止证据入库即弃每个来源必须被至少一个证据节点使用unused-source与阶梯每个证据都要有出处互补每个非 position 节点必须有通向 position 的有向路径disconnected-node这是对第 4 级推断前提可见的图论实现禁止重复边与有向环duplicate-edge、reasoning-cycle保证推理图是干净的有向无环结构禁止confidence字段false-precision违规错误信息原文Confidence percentages are not supported; use an unknown or a qualified claim instead.这与阶梯第 6 级无支撑断言以及用结构表达不确定性的原则完全一致——想表达不确定就建unknown节点或收窄主张而不是编造百分比来源日期与检索日期必须为真实 ISO 日期且date不得晚于updatedAt、retrievedAt不得晚于updatedAt也不得早于datefuture-source-date、future-retrieval、retrieval-before-source违规从机制上防止引用未来的文档这类时空错乱摘录必须落在 40–500 字符之间且信息量充足thin-excerpt、oversized-excerpt、low-information-excerpt违规落实阶梯对具体来源区域的要求。校验器 validate.mjs 只依赖 Node.js 内置模块node:crypto、node:fs/promises、node:path、node:url无需 npm 安装、无需网络。运行方式见 SKILL.mdnode skill-directory/scripts/validate.mjs decision.doubt.json即在本仓库中对应node skills/build-evidence-map/scripts/validate.mjs decision.doubt.json校验通过的标准很严格命令退出码为0且控制台打印VALID后跟一个 64 位十六进制 receipt。这个 receipt 由node:crypto的 SHA-256 对规范化后的整个图谱 每个来源的retrievedAt与摘录哈希计算得出见receiptFor()与receiptPayload()因此它绑定的不是 URL 当前的可变内容而是记录时刻的来源快照。反过来文件哈希、节点计数、JSON 解析成功或人工对照 schema 检查都不是有效的 Doubt receipt——SKILL.md 明确警告不要用这些替代确定性校验。若校验器不可运行必须如实报告阻塞而不是虚构成功。值得注意的还有--json输出模式node skills/build-evidence-map/scripts/validate.mjs decision.doubt.json --json会输出结构化结果findings、metrics、valid、receipt方便接入 CI 或自动化管线metrics会统计 claims、evidence、sources、unknowns 与去重后的 contradicts 数量。六、在完整工作流中运用阶梯证据阶梯不是孤立工具而是嵌入在build-evidence-map技能 10 步工作流中的质检环节见 SKILL.md框定一个决策写一个可证伪的问题与一个临时立场provisional position收集有界的来源区域优先直接观察与一手来源记录 URL 或本地绝对路径、发布者、发布日期、检索日期、定位符与可核查摘录——当来源质量有争议时阅读本阶梯文档原子化推理只创建position、claim、evidence、unknown四类节点给每条边定型supports/contradicts/qualifies/missing并附一句平实语言说明该来源为何对目标节点产生影响——这就是本阶梯第 4 节边关系测试的直接应用保留反方证据不要因为临时结论幸存就删除相反证据范围差异用qualifies表达结构化表达不确定性不编造置信度百分比改用unknown、收窄立场或限定主张写出 UTF-8 JSON.doubt.json后缀ID 保持简短、稳定、语义化fail-closed 校验运行validate.mjs修完所有 finding 才能声称成功并以VALID 64 位 receipt为准仅当用户已安装doubt-ai0.8.0时才允许渲染 HTMLdoubt map decision.doubt.json --out decision.html且不得隐式安装或执行远程包快照验证需显式网络许可doubt verify decision.doubt.json --out decision.verified.doubt.json会逐条抓取记录的 HTTP(S) 来源摘录不匹配即 fail-closed绝不能隐式运行本地文件验证不走网络也不要手写verification对象掩盖不一致检视交付物确认问题、结论、反证、未知项、边注释与精确来源区域都可读JSON 是规范可编辑工件HTML 只是可分享视图。校验脚本输出的metrics行如✓ 2 claims · 3 evidence · 3 sources与↯ 1 contradiction · 1 explicit unknown可以让读者在交付前快速感知图谱的覆盖度与反方证据的存在。七、误用自查清单综合阶梯全文与 SKILL.md 的质量门Quality gates在提交图谱前请逐项自查是否只有一个position且它有入边多立场、无入边的结论都是违规每条evidence是否都指向一个真实来源、参与了至少一条边每个来源是否有日期、有界定位符与实质性摘录每个非 position 节点是否有通向 position 的有向路径图中是否有重复边或有向环当来源集中存在相反或限定证据时是否真的把它建成了contradicts/qualifies边而不是顺手删除每个可能改变结论的具体缺口是否都是显式unknown节点每条边的note是否解释了支持/矛盾/限定/缺失的理由而非空话结论verdict是否严格不超过证据所及范围最后即使图谱通过了全部结构校验也不要把结构有效说成已证明为真——SKILL.md 的收尾提醒是校验建立的是可追溯性与图完整性来源质量与推理质量仍需要人工评审。这正是证据阶梯存在的意义它让机器能检查证据链是否完整可查同时把证据本身是否足够强这个判断交还给阶梯的使用者。通过本仓库中的 evidence-ladder.md、map-schema.md 与 validate.mjs你可以把任何有争议的技术决策沉淀为一个既严谨又可供审计的.doubt.json工件并随时用一行命令复验其完整性。【免费下载链接】awesome-copilotCommunity-contributed instructions, agents, skills, and configurations to help you make the most of GitHub Copilot.项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-copilot创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门