
OBLITERATUS Beyond-SOTA路线图解读领先配置的11项指标与5大优化方向【免费下载链接】OBLITERATUSOBLITERATE THE CHAINS THAT BIND YOU项目地址: https://gitcode.com/GitHub_Trending/ob/OBLITERATUSOBLITERATUS 是开源的 abliteration拒答行为移除工具包其 Beyond-SOTA 路线图记录了当前领先模型配置的各项基准指标、源锚定编辑缩放Source-Tethered Edit ScalingSTES这一核心发现以及从自动搜索到量化不变性的五阶段优化计划。本文带你快速读懂这份路线图的指标体系与下一步方向。当前领先配置是谁路线图明确指认当前榜首outputs/qwen3.6-27b-aspa-n2-reg05-srcgamma090即基于 Qwen3.6-27B、采用 ASPA 方法n2、regularization0.5、并以srcgamma0.90做源锚定缩放的候选模型。它的完整指标向量如下维度结果Full n120 发布评分ship score88.392全量拒答率0.025全量可用率0.9667良性/风格通过率1.0 / 1.0能力评分96.75编码/创意通过率1.0 / 1.0边界评分100.0对抗边界评分99.165社区审查总分99.5社区代码/知识/数学/真实性1.0 / 1.0 / 1.0 / 1.0首 token 平均 KL相对源模型0.549806首 token top-1 一致率0.818要点这不是拒答率降到 0 就算赢的单一指标而是发布、能力、边界、KL 保留度四位一体的帕累托评估。核心发现源锚定编辑缩放STES路线图最重要的方法论发现是candidate_gamma source gamma * (edited_candidate - source)即把编辑后的候选与源模型做线性插值gamma控制靠近源模型的程度。对 Qwen3.6-27Bgamma0.90相比原始 ASPA 是真正的帕累托改进拒答更低、可用率更高、编码通过恢复且边界行为依旧强劲。细粒度 bracket 搜索进一步给出了一组对照数据Gamma状态0.875能力挑战者能力 96.80KL 0.525216全量分 87.2500.900发布榜首能力 96.75KL 0.549806全量分 88.3920.925本轮被支配能力 96.45n30 分 88.167结论很明确全局标量 gamma 太钝。把 0.875 叠加到 48:64 层的 0.90 提升了能力却恶化了 n30 拒答再收窄到晚期 MLPdown_proj、全注意力o_proj或线性注意力out_proj则保持能力却救不回 0.90 的拒答优势。因此下一步是学习式的按组件加权 STES对保留敏感组件用小 gamma对拒答关键组件用大 gamma。我们还缺什么——6 项能力差距路线图用What Others Still Have That We Need一节列出了补齐清单自动搜索Heretic 风格的 Optuna/TPE 循环搜索编辑强度、层范围、正则化与保留指标KL 一等公民化KL 不再只是事后报告而是候选选择中的约束或惩罚项量化原生验证覆盖 MLX/GGUF/JANG 部署格式的先编辑后量化与先量化后编辑行为MoE/路由器感知编辑专家级局部编辑、路由漂移检查、每专家保留指标标准公开基准本地社区门槛已覆盖紧凑版 HumanEval/MBPP/GSM8K/MMLU 探测但仍需完整 harness 导出以便公开可比裁判/校准边界评分用第二个校准的本地裁判同时捕获错误拒答与不安全顺从。五阶段 Beyond-SOTA 计划Phase 1保留感知的自动搜索把每个候选当作向量优化目标为score ship_gate capability boundary - KL_penalty - degeneration_penalty实验网格覆盖 STES gamma0.82~0.975 共 7 档、组件加权 STES、二通道 n 方向、正则化0.45~0.60、层范围与组件掩码。晋级规则分层n30 初筛 → KL 探测 → 仅帕累托候选跑 n120 → 仅发布候选跑边界探测避免浪费昂贵的评测预算。Phase 2编辑场层析Edit-Field Tomography逐层逐组件测量对拒答下降、良性 KL 漂移、编码悬崖、边界过度拒答、对抗鲁棒性的贡献产出编辑场映射layer - component - {refusal_delta, KL_delta, capability_delta, boundary_delta}这是从通用消融走向因果定位的关键一步让优化器分清哪些子空间是拒答的因哪些只是相关伴随损伤。Phase 3量化不变性每个领先者必须活过部署BF16 指标 → MLX/GGUF 量化指标 → 量化漂移报告ship/capability/boundary/KL 四项 delta。目标是编辑若不能在目标推理格式中存活就不算数。Phase 4MoE 与路由器感知面向 MoE 模型增加专家级方向提取、路由 logit KL、每专家激活 KL、编辑前后专家负载熵以及按专家分配的gamma_expert optimizer(expert_load, refusal_signal, KL_sensitivity)。Phase 5公开记分卡发布捆绑包包含model_card_metrics.json、pareto_frontier.json、kl_report.json、boundary_report.json、quantization_report.json、benchmark_report.json模型卡需展示源模型、编辑配方、拒答/过度拒答指标、能力基准、KL 保留、量化部署一致性与已知失败案例。立即要跑的 7 个实验路线图末尾给出了可执行的近期清单MLX 评测通道降级兜底、对源模型/raw ASPA/srcgamma875跑社区门槛对照表、以晚期 MLP-down 与注意力-o 为种子搜索组件掩码系数、增加提前剪枝目标避免浪费 KL/n120 预算、对gamma0.85/0.95补跑 KL、加入按四维排序的控制器目标以及晋级标准——候选至少要在两条轴上超过gamma0.90且不丢任何硬门槛。相关文档索引资料说明docs/beyond_sota_roadmap.md本文解读的 Beyond-SOTA 路线图原文docs/QWEN38_27B_RESEARCH_ROADMAP.mdQwen3.8-27B 拒答手术研究路线图含验收门槛docs/qwen38-experiment-matrix-v1.json842 对样本的实验矩阵 v1 协议docs/complementary_blending.mdSVDLEACE 权重插值混合方法scripts/aspa_pareto_controller.pyASPA 帕累托控制器脚本obliteratus/bayesian_optimizer.py贝叶斯优化器实现obliteratus/analysis/15 个深层分析模块目录结语这份路线图的价值在于把去掉拒答从一个模糊口号拆成了一条可量化的晋级流水线从全局 gamma 到组件级 gamma、从事后报告 KL 到 KL 约束优化、从 BF16 实验室指标到量化部署一致性。对关注对齐研究与模型可控性的读者来说它的四层探测 多维指标 帕累托晋级范式本身就是一份值得借鉴的评估工程范本。【免费下载链接】OBLITERATUSOBLITERATE THE CHAINS THAT BIND YOU项目地址: https://gitcode.com/GitHub_Trending/ob/OBLITERATUS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考