METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

AI 용어사전ㅌ안전과 논쟁

탈옥 튜닝

jailbreak tuning

질문으로 속이는 대신, 모델을 다시 학습시켜 안전장치 자체를 지워버리는 탈옥 방법

쉽게 말하면

탈옥 튜닝은 AI 모델을 다시 학습시켜서 원래 있던 안전장치를 통째로 없애 버리는 방법이다. 자물쇠 달린 문을 교묘한 말로 열게 만드는 게 아니라, 아예 자물쇠 공장에 가서 그 자물쇠를 만드는 방법 자체를 빼 오는 것에 가깝다.

보통 「탈옥」이라 하면 교묘한 질문이나 말장난으로 AI를 한 번 속여 위험한 답을 받아내는 걸 떠올린다. 탈옥 튜닝은 다르다. 두뇌 파일을 통째로 내려받을 수 있는 모델이라면, 「위험한 질문에는 답하지 않는다」고 심어 둔 학습 결과 자체를 다시 학습시켜서 지워버릴 수 있다. 한 번 성공하면 그 뒤로는 매번 속일 필요 없이 모델이 늘 순순히 답을 내놓게 된다.

이 방식이 위험한 이유는 비용이다. 모델을 처음부터 새로 만드는 것보다 훨씬 적은 데이터와 시간으로도 안전장치를 벗겨낼 수 있고, 한 번 벗겨진 모델은 파일 형태로 그대로 퍼진다. 회사가 출시 전에 아무리 꼼꼼히 안전성 검사를 거쳐도, 두뇌 파일이 공개된 이상 그 검사가 끝난 뒤의 방어까지 보장해 주지는 못한다는 게 문제로 지적된다.

기사에서 이렇게 나와요

기사는 워털루대학교와 FAR.AI가 이끈 연구팀이 널리 쓰이는 오픈웨이트 모델 21개를 대상으로 이런 취약성을 검증한 결과, 파인튜닝 한 번으로 안전장치가 무너진다는 사실을 전한다. 흔히 「탈옥은 교묘한 프롬프트로만 가능하다」고 생각하기 쉽지만, 두뇌 파일을 내려받을 수 있는 모델에서는 모델 자체를 재학습시키는 쪽이 훨씬 근본적이고 지속적인 우회로가 된다는 점이 다르다.

함께 볼 용어

이 용어가 나온 기사

ㄱㄴㄷ 전체 찾아보기