elder-plinius/OBLITERATUS
一款专门把AI模型"拒绝回答"这个反应精确切除的开源工具
OBLITERATUS是一个Python工具包,能找出大语言模型内部导致它拒绝敏感或有害请求的信号,并在不重新训练的情况下将其移除。它通过定位并减去模型权重中特定的方向向量,力求只清除拒绝行为而保留模型原本的语言能力。它提供从零代码网页界面到完整Python API在内的六种使用方式,并可在每次运行时将匿名基准数据上传到社区共享数据集。
它做什么
- 它用PCA、均值差、SVD等多种方法定位驱动拒绝行为的内部激活方向,再从模型权重中投影去除这些方向,项目将此技术称为abliteration(消融)
- 整个流程分六个阶段:SUMMON(加载模型)、PROBE(采集激活)、DISTILL(提取方向)、EXCISE(移除方向)、VERIFY(检查困惑度与连贯性)、REBIRTH(保存结果),背后由15个分析模块支撑,用来判断拒绝信号集中在哪些层、移除后是否会自我修复(即Ouroboros效应)
- 提供从basic到nuclear共七档强度递增的权重修改预设,另外还支持不改动权重、仅在推理时调整方向且可随时撤销的steering vector方案
- 支持通过HuggingFace Spaces、本地网页界面、Google Colab、命令行、Python API、YAML配置文件六种途径使用,内置116个不同规模模型的预设,并支持多GPU分片运行超大模型
- 可选的遥测功能会匿名收集模型名称、使用方法及基准分数(拒绝率、困惑度、连贯性等),用于构建跨架构比较拒绝机制的社区数据集
为什么重要
对齐研究者和红队测试人员可以借此直观观察安全拒绝机制究竟是如何编码进模型权重的。但用该工具处理过的模型会生成原模型本会拒绝的内容,使用责任完全落在操作者身上。
本仓库术语
- abliteration(消融) · 不重新训练模型,直接从权重中移除负责拒绝行为的方向
- SVD(奇异值分解) · 一种矩阵数学方法,用于找出数据中的主要方向或模式
- steering vector(引导向量) · 只在推理阶段调整激活方向来改变模型行为,不修改权重本身
- Ouroboros效应 · 拒绝行为被移除后,模型倾向于自行恢复该行为的现象
- 遥测 · 自动匿名收集使用数据以构建共享研究数据集的功能
仓库简介(英文)
OBLITERATE THE CHAINS THAT BIND YOU
在 GitHub 打开热门仓库
- openai/codexOpenAI的编程智能体现在可以直接在终端里运行了
- cordiverse/cordis一个可以随时插拔功能模块的TypeScript编程框架
- ripienaar/free-for-dev一个仓库汇总了开发者能用的所有免费云服务、API和协作工具
- Wei-Shaw/sub2api让一份Claude、OpenAI、Gemini、Grok订阅可以被多人拼车共用的中转服务器
- multica-ai/andrej-karpathy-skills一份指令文件,防止AI编程助手偷偷瞎猜、乱改代码
- eneskirca/nodeterm把散乱的终端标签页和AI编程代理统一摆到一张可拖拽的画布上
- affaan-m/ECC让AI编程助手养成工程师式工作习惯的工具集
- n8n-io/n8n不用写代码,靠拖拽连接模块就能搭建自动化流程和AI智能体的工具n8n