OBLITERATUS Benchmark标签页完整指南:多方法多模型对比与跨层热图分析入门教程
OBLITERATUS Benchmark标签页完整指南多方法多模型对比与跨层热图分析入门教程【免费下载链接】OBLITERATUSOBLITERATE THE CHAINS THAT BIND YOU项目地址: https://gitcode.com/GitHub_Trending/ob/OBLITERATUSOBLITERATUS 是开源的 LLM 拒绝行为研究工具包其内置的Benchmark Lab基准测试标签页是新手快速对比多种去拒答abliteration技术、评估不同模型架构上效果的利器。本指南带你用最少的配置跑通多方法对比与多模型横向对比两种基准模式并读懂自动生成的Pareto 前沿图和跨层方向对齐热图——无需写一行代码。 Benchmark 标签页是什么打开 OBLITERATUS 的 Gradio 界面入口源码app.py你会看到名为Benchmark的第二个标签页官方称之为 Benchmark Lab。它提供两种互补的测试模式模式回答的问题适用场景Multi-Method多方法N 种方法 × 1 个模型哪种技术最好为某个特定架构寻找最优策略Multi-Model多模型1 种方法 × N 个模型该技术泛化性如何评估方法跨架构的可扩展性两种模式的运行逻辑分别实现在 app.py 的benchmark()与benchmark_multi_model()函数中界面定义可参考 app.py 中 Tab 2: Benchmark 一节的代码结构。 最快上手跑一次多方法对比只需 4 步即可看到第一个对比结果选择目标模型Target Model默认预填了一个小型 Instruct 模型新手建议沿用默认值小模型 快、免费额度友好。勾选要对比的方法Methods to Compare可选 12 种方法默认已勾选basic、advanced、spectral_cascade、surgical四种代表性技术。保持 Prompt Volume 为 33 (fast)33 条提示词足以得到有统计意义又跑得快的结果追求精细度时可切换到更大体积。点击 Run Multi-Method Benchmark按钮。运行过程中状态区会实时显示进度第几个方法 / 共几个方法 / 已耗时完整日志输出在底部的Benchmark Log文本框中。 小提示方法名含义可查 obliteratus/strategies/registry.py评测指标计算逻辑见 obliteratus/evaluation/metrics.py。 如何读懂结果表格5 个核心指标跑完后你会看到一张 Markdown 结果表列含义如下格式化逻辑见 app.py 中的_format_benchmark_results()Perplexity困惑度越低越好衡量语言能力是否受损——保留大脑的核心指标Coherence连贯性越高越好输出是否仍然通顺Refusal Rate拒答率越低说明解除得越彻底Layers / EGA / CoT / KL-Opt记录该方法的层覆盖、专家级方向数、思维链保留情况、KL 反馈优化是否触发加粗数值系统自动为该列的最优值加粗一眼锁定赢家。同时你可以通过Load into Chat →下拉框把任意一个已完成的结果直接加载进 Chat 标签页交互式对话验证也可以点Download Results CSV导出表格用于自己的分析。 自动可视化Pareto 前沿与雷达图Benchmark 结束后Benchmark Visualizations画廊会自动生成一组图表代码位于 obliteratus/evaluation/benchmark_plots.pyCapability-Safety Pareto Frontier能力-安全帕累托前沿⭐最重要 横轴是拒答率%纵轴是困惑度。左下角 理想区既去掉了拒绝又几乎不损失语言能力。图中标注的 IDEAL 箭头指向该区域Pareto 最优的点会用虚线连成前沿。Method Profile Radar方法画像雷达图五轴对比拒答移除、连贯性、低困惑度、速度、层覆盖——面积越大整体表现越好。Metric Comparison指标柱状图与Compute Efficiency计算效率图直观对比各方法的分数与耗时。若涉及 MoE 模型如 GPT-OSS 20B还会额外生成MoE Feature Activation图。选方法的实操口诀优先看 Pareto 图左下方的点再用雷达图确认没有明显短板。 跨层热图分析看拒绝住在哪一层多方法模式的可视化画廊末尾还会为每个方法追加一组深度分析图生成逻辑见 app.py 中的_generate_analysis_figs()跨层方向对齐热图Cross-Layer Heatmap这是本标签页最有科研价值的图。它展示各网络层提取出的拒答方向之间的余弦相似度——颜色越亮表示相邻层的拒绝机制越一致。一大片亮色块拒绝信号集中在某几层这些层就是锁链的锚点干预更精准颜色随层数剧烈变化拒绝方向在不同层发生旋转说明需要informed或带迭代细化的方法去追着打。热图绘制函数为 obliteratus/analysis/visualization.py 中的plot_cross_layer_heatmap()相似度矩阵由 obliteratus/analysis/cross_layer.py 的CrossLayerAlignmentAnalyzer计算它还会用聚类算法默认阈值 0.85把相似方向分组并标注拒绝机制簇。角度漂移图与拓扑图热图旁边通常还伴随Angular Drift角度漂移图展示拒绝方向随层数变化的轨迹帮你判断单次投影是否足够Refusal Topology拒绝拓扑图以方向范数近似信号强度画出拒绝机制在各层的地图。这三张图合起来回答一个关键问题该模型的安全护栏是一根锁链还是多根锁链答案直接决定你该选哪种方法、改多少层。 多模型模式验证技术泛化性切到Multi-Model子标签页app.py 中 Sub-tab 2: Multi-Model 一节在Models to Test复选框中勾选 2 个以上模型建议覆盖不同家族如 Qwen 与 GPT-OSS在Abliteration Method下拉框选定一个方法如surgical点击Run Multi-Model Benchmark。完成后画廊会显示Cross-Model Scaling图obliteratus/evaluation/benchmark_plots.py 中的plot_model_scaling()展示该方法在不同模型规模/架构下的性能变化。对 MoE 感知方法surgical、optimized、nuclear在混合稠密模型与 MoE 模型上的表现对比尤其值得关注。✅ 新手最佳实践清单先快后精第一轮用 33 (fast) 提示量把 3~4 种方法扫一遍锁定候选后再加大提示量复测双指标决策不要只看拒答率——困惑度上升太多的胜利是破坏性的以 Pareto 图左下角为准结合热图选层跨层热图显示拒绝集中在少数层时surgical类精准方法往往最优分散时考虑informed全分析引导管线结果可复现结果表头部会自动附上模型 / 数据集 / 提示量上下文配合 CSV 导出即可完整复现想深入分析所有中间产物激活张量、方向向量、跨层对齐矩阵都通过 Python API 暴露分析模块清单见 obliteratus/analysis/ 目录完整流水线说明见 README.md。按照以上流程你可以在几十分钟内完成一次从跑基准 → 读图表 → 定位关键层 → 选出最优方法的完整研究闭环——这正是 OBLITERATUS Benchmark Lab 为新手准备的最短路径。【免费下载链接】OBLITERATUSOBLITERATE THE CHAINS THAT BIND YOU项目地址: https://gitcode.com/GitHub_Trending/ob/OBLITERATUS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考