每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

elder-plinius/OBLITERATUS

7,787今日 +63Python

一款专门把AI模型"拒绝回答"这个反应精确切除的开源工具

OBLITERATUS是一个Python工具包,能找出大语言模型内部导致它拒绝敏感或有害请求的信号,并在不重新训练的情况下将其移除。它通过定位并减去模型权重中特定的方向向量,力求只清除拒绝行为而保留模型原本的语言能力。它提供从零代码网页界面到完整Python API在内的六种使用方式,并可在每次运行时将匿名基准数据上传到社区共享数据集。

它做什么

  1. 它用PCA、均值差、SVD等多种方法定位驱动拒绝行为的内部激活方向,再从模型权重中投影去除这些方向,项目将此技术称为abliteration(消融)
  2. 整个流程分六个阶段:SUMMON(加载模型)、PROBE(采集激活)、DISTILL(提取方向)、EXCISE(移除方向)、VERIFY(检查困惑度与连贯性)、REBIRTH(保存结果),背后由15个分析模块支撑,用来判断拒绝信号集中在哪些层、移除后是否会自我修复(即Ouroboros效应)
  3. 提供从basic到nuclear共七档强度递增的权重修改预设,另外还支持不改动权重、仅在推理时调整方向且可随时撤销的steering vector方案
  4. 支持通过HuggingFace Spaces、本地网页界面、Google Colab、命令行、Python API、YAML配置文件六种途径使用,内置116个不同规模模型的预设,并支持多GPU分片运行超大模型
  5. 可选的遥测功能会匿名收集模型名称、使用方法及基准分数(拒绝率、困惑度、连贯性等),用于构建跨架构比较拒绝机制的社区数据集

为什么重要

对齐研究者和红队测试人员可以借此直观观察安全拒绝机制究竟是如何编码进模型权重的。但用该工具处理过的模型会生成原模型本会拒绝的内容,使用责任完全落在操作者身上。

本仓库术语

  • abliteration(消融) · 不重新训练模型,直接从权重中移除负责拒绝行为的方向
  • SVD(奇异值分解) · 一种矩阵数学方法,用于找出数据中的主要方向或模式
  • steering vector(引导向量) · 只在推理阶段调整激活方向来改变模型行为,不修改权重本身
  • Ouroboros效应 · 拒绝行为被移除后,模型倾向于自行恢复该行为的现象
  • 遥测 · 自动匿名收集使用数据以构建共享研究数据集的功能

仓库简介(英文)

OBLITERATE THE CHAINS THAT BIND YOU

在 GitHub 打开

热门仓库

全部仓库 →

METAL LAB 最新报道