每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

苹果公布从源头阻止AI权重微调的技术

让开放权重模型可用但无法被改造的"DLR-Lock"研究发布

이미지: METAL LAB 생성

摘要

  • 苹果公开了一种锁定预训练权重的防御技术DLR-Lock
  • 该方法将MLP层替换为深层低秩残差网络,从而大幅提高反向传播成本
  • 研究团队表示在保持模型性能的同时,已在大语言模型上验证了该方法能有效阻止微调尝试
발표
애플 ML 리서치, 2026년 8월 논문 공개
논문 제목
Locking Pretrained Weights via Deep Low-Rank Residual Distillation
핵심 기법
DLR-Lock — MLP를 저랭크 잔차 네트워크(DLR-Net)로 대체
저자
사카모토 케이타로(도쿄대, 애플 재직 중 수행), 피에르 아블린·페데리코 다니엘리·마르코 쿠투리(애플)
검증
적응형 공격자를 상대로 한 LLM 실험에서 방어 효과 확인

开放使用,但不允许修改

苹果公开了一种在发布开放权重模型的同时,防止用户随意改造模型的技术,名为DLR-Lock。其做法是将模型的MLP(多层感知机)层替换为参数量相近但结构不同的"深层低秩残差网络(DLR-Net)"。这个替代网络通过知识蒸馏——即把大模型学到的知识以模块为单位迁移并训练到小模型中的方法——按模块复制原始层的知识而构建。论文作者包括东京大学的坂本圭太郎,以及苹果公司的Pierre Ablin、Federico Danieli和Marco Cuturi。

为何这是个难题

开放权重模型的优势在于任何人都可以下载、部署到不同硬件上、用自己的数据进行微调,甚至再分发。但正是这种自由也带来了问题——能看到全部权重和结构的攻击者,只要有意愿,就能绕过安全防护或改变模型用途。此前出现的大多数锁定技术只是对结构做轻微扭曲,几轮优化就能被破解。苹果研究团队选择了另一个方向。他们注意到深度学习中正向计算(推理)和反向计算(训练)的成本原本就不同,于是设计出一种机制,使反向传播——即通过反向追溯误差来修正权重的训练步骤——所需的内存和计算量随层数加深而急剧增加。推理过程仍以正常速度运行,但一旦尝试微调,反向传播的成本就会相对正向传播不成比例地暴涨,优化路径本身也会被扭曲。

与此同时,苹果、OpenAINVIDIA在模型控制权问题上各自给出了不同答案。如果说苹果选择的是锁定权重,那么NVIDIA则以允许衍生和再分发的许可协议开放了其自动驾驶模型Alpamayo 2 Super,而OpenAI则因新模型Astra的网络安全能力"无法排除达到致命级别风险"为由,选择收紧访问权限。

这意味着什么

如果DLR-Lock被应用到实际产品中,即便是以开放权重形式发布的模型,"查看和使用"与"拆解修改"之间也会出现一道壁垒。此前围绕开放权重的争论大多依靠许可条款进行约束,而这项研究则是直接从神经网络结构层面阻止改造。苹果方面表示,即使面对完全了解其防御策略的攻击者,该方法依然能在保持原模型性能的同时有效抵御攻击。不过,目前尚未在这篇论文之外发现该技术被应用于实际商用模型的案例,因此应将其视为仍处于研究阶段的概念验证。