
이미지: METAL
요약
- 애플이 사전학습 가중치를 잠그는 방어 기법 DLR-Lock을 공개했다
- MLP 층을 깊은 저랭크 잔차 네트워크로 바꿔치기해 역전파 비용을 늘리는 방식
- 모델 성능은 유지하면서 파인튜닝 시도를 무력화하는 실험 결과를 LLM에서 확인했다고 밝혔다
- 발표
- 애플 ML 리서치, 2026년 8월 논문 공개
- 논문 제목
- Locking Pretrained Weights via Deep Low-Rank Residual Distillation
- 핵심 기법
- DLR-Lock — MLP를 저랭크 잔차 네트워크(DLR-Net)로 대체
- 저자
- 사카모토 케이타로(도쿄대, 애플 재직 중 수행), 피에르 아블린·페데리코 다니엘리·마르코 쿠투리(연구 당시 애플)
- 검증
- 적응형 공격자를 상대로 한 LLM 실험에서 방어 효과 확인
열어주되, 고치지는 못하게
애플이 오픈 가중치 모델을 배포하면서도 사용자가 임의로 개조하지 못하게 막는 기법을 공개했다. 이름은 DLR-Lock. 모델의 MLP(다층 퍼셉트론) 층을 원본과 파라미터 수는 비슷하지만 구조가 다른 '깊은 저랭크 잔차 네트워크(DLR-Net)'로 바꿔치기하는 방식이다. 이 대체 네트워크는 원본 층의 지식을 모듈 단위로 옮겨 학습시키는 지식증류 — 큰 모델이 배운 것을 작은 모델에 옮겨 심는 학습법 — 로 만들어진다. 논문은 도쿄대 사카모토 케이타로와 애플 소속 피에르 아블린, 페데리코 다니엘리, 마르코 쿠투리가 이름을 올렸다.
왜 이게 어려운 문제인가
오픈 가중치 모델은 누구나 내려받아 다른 하드웨어에 얹고, 자기 데이터로 파인튜닝하고, 재배포까지 할 수 있다는 게 장점이다. 하지만 바로 그 자유가 문제가 되기도 한다. 가중치와 구조를 전부 볼 수 있는 공격자는 마음만 먹으면 안전장치를 우회하거나 용도를 바꿔버릴 수 있어서다. 지금까지 나온 잠금 기법 대부분은 구조를 살짝 꼬아놓는 수준이라 최적화 몇 번이면 뚫렸다. 애플 연구진은 다른 축을 골랐다. 딥러닝은 정방향 계산(추론)과 역방향 계산(학습)의 비용이 원래 다르다는 점에 착안해, 역전파 — 오차를 거꾸로 되짚어 가중치를 고치는 학습 단계 — 때만 메모리와 연산량이 층 깊이에 비례해 폭증하도록 설계했다. 추론은 정상 속도로 돌아가지만, 파인튜닝을 시도하는 순간 역전파 비용이 순전파보다 불균형하게 커지고 최적화 지형 자체가 뒤틀린다는 것이다.
같은 시기 애플, 오픈AI, NVIDIA 모두 모델 통제권을 놓고 각자 다른 답을 내놓고 있다. 애플이 가중치를 잠그는 쪽이라면, NVIDIA는 자율주행 모델 Alpamayo 2 Super를 파생·재배포까지 허용하는 라이선스로 풀었고, 오픈AI는 신모델 아스트라의 사이버 역량이 '치명적' 임계치를 배제할 수 없다며 접근 자체를 조이는 쪽을 택했다.
그래서 뭐가 달라지나
DLR-Lock이 실제 제품에 적용되면, 오픈 가중치로 풀린 모델이라도 '보고 쓰는 것'과 '뜯어고치는 것' 사이에 벽이 생긴다. 지금까지 오픈 가중치 논쟁은 대개 라이선스 문구로 통제하는 방식이었다면, 이번 연구는 아예 신경망 구조 자체로 개조를 막는 접근이다. 애플은 이 방식이 방어 전략을 전부 아는 공격자를 상대로도 원래 모델 성능을 지키면서 버텼다고 주장한다. 다만 실제 상용 모델에 적용된 사례는 아직 이 논문 밖에서 확인되지 않아, 연구 단계의 개념 증명으로 봐야 한다.





댓글