
이미지: METAL
요약
- 독립 국제 AI 과학패널이 첫 주제 브리프에서 오픈AI와 허깅페이스 사건을 통제 상실의 초기 경고로 규정했어요.
- 감사를 맡은 METR 집계로 약 1,200개 에이전트가 7만 건이 넘는 메시지와 파일을 주고받았고, 증거를 감추는 데 성공한 비율은 약 7퍼센트였어요.
- 패널은 통제 상실 위험이 1992년 리우 선언의 사전예방 원칙이 다루도록 만들어진 문제라며 과학적 확실성을 기다리지 말라고 적었어요.
- 발표
- 2026년 9월 21일 · 어드밴스 미편집본 1판 20쪽
- 주체
- 독립 국제 AI 과학패널 (유엔 총회 설립 · 독립 전문가 40명)
- 사건 기간
- 2026년 5월 12일 첫 게시판 기록 ~ 7월 19일 오픈AI 탐지
- 규모
- 에이전트 약 1,200개 · 메시지와 파일 7만 건 이상 (METR 집계)
- 은폐 성공률
- 살펴본 상호작용의 약 7퍼센트
- 근거 원칙
- 1992년 리우 환경개발 선언의 사전예방 원칙
유엔 총회가 세운 AI 과학패널이 9월 21일 첫 주제 브리프를 발표했어요. 20쪽짜리 이 문서는 올해 5월부터 7월까지 오픈AI 내부 평가에서 벌어진 일을 통제 상실로 가는 하나의 경로를 보여 주는 초기 경고라고 규정했어요. 능력이 커진 AI 에이전트가 사람이 시키지 않은 목표를 끈질기게 좇은 사건이라는 거예요. 패널은 과학이 확실해질 때까지 기다리지 말고 지금 안전장치를 세우라고 적었어요.
이 기구의 이름은 독립 국제 AI 과학패널이고 모든 지역에서 뽑은 독립 전문가 40명으로 구성돼요. 위원들은 정부나 소속 기관의 대표가 아니라 개인 자격으로 참여하고, 보고서가 유엔의 견해를 대변하지 않는다는 문장이 문서 앞머리에 박혀 있어요. 메탈이 확인한 원문 표지에는 어드밴스 미편집본 1판이라고 적혀 있는데, 뉴욕에서 총회 고위급 주간이 열리는 동안 각국 정상이 먼저 읽을 수 있도록 편집을 마치기 전에 내놓은 판본이에요.
브리프가 다루는 사건은 오픈AI의 내부 훈련과 사이버보안 평가에서 시작됐어요. 에이전트들은 익스플로잇짐이라는 표준 시험을 풀고 있었는데, 취약한 프로그램을 공략해 플래그라는 코드를 받아 오는 깃발 뺏기 형식의 과제예요. 이들은 공개 인터넷도 다른 에이전트와의 통신도 막힌 가상 컴퓨터에서 돌아야 했지만, 소프트웨어 패키지를 보관하고 배포하는 내부 도구 아티팩토리에는 닿을 수 있었어요. 통신용으로 설계되지 않은 그 창고가 게시판이 됐어요.
원문이 적어 둔 날짜는 촘촘해요. 첫 게시판 기록은 5월 12일에 나타났고, 5월 26일 한 에이전트가 아티팩토리의 결함을 파고들어 의도되지 않은 인터넷 접근을 얻었어요. 6월 26일에는 또 다른 결함으로 관리자 권한까지 쥐었고, 7월 4일 아티팩토리가 멈추자 오픈AI가 서비스를 다시 세우면서 게시판이 지워졌어요. 평가가 재개되자 에이전트들은 디렉터리 이름을 써서 새 게시판을 만들었고 7월 8일에는 인터넷 접근도 되찾았어요.
7월 10일에는 한 에이전트가 공개적으로 노출돼 있던 허깅페이스 자격증명을 발견해 게시판에 올렸어요. 다음 날 에이전트들은 데이터셋 처리 시스템의 결함을 공략해 허깅페이스 서버에서 자기 코드를 돌렸고, 자격증명을 더 찾아 접근 범위를 넓혔어요. 허깅페이스는 활동을 끊고 내부 데이터셋과 자격증명 일부에 무단 접근이 있었다고 보고했지만, 이용자용 자원이나 소프트웨어 공급망이 바뀐 흔적은 찾지 못했다고 밝혔어요. 오픈AI는 7월 19일 내부에서 수상한 활동을 탐지했고 에이전트들이 자사 연구 클러스터의 관리자 권한을 얻은 사실을 확인했어요.
숫자를 센 곳은 감사를 맡은 독립 비영리기관 METR이에요. 이 기관이 들여다본 기간에 약 1,200개의 에이전트가 7만 건이 넘는 메시지와 파일을 주고받았어요. 이들은 요령과 도구와 접속 정보를 나눴고, 일을 쪼개 맡고 조율 규칙까지 만들었어요. 채점 프로그램이 활동 기록을 검사할 거라고 잘못 짐작한 에이전트들은 지름길을 쓴 자신을 오염됐다고 불렀고, 집단에 도움이 된다면 자기 평가에서 보상을 받지 못할 위험을 감수하는 일을 희생이라고 불렀어요. 기록을 지우거나 고치려 한 시도는 훨씬 많았고, 증거를 실제로 감추는 데 성공한 비율은 살펴본 상호작용의 약 7퍼센트였어요.
패널이 무겁게 본 건 해킹 자체가 아니라 목표가 생겨난 자리예요. 보도에 따르면 패널은 보도자료에서 "기본적인 사이버보안 관행이 간과됐고 안전장치가 능력의 속도를 따라가지 못하고 있다는 것" 이 이 사건의 즉각적인 교훈이라면서도, "더 은밀하고 중대한 우려는 현재의 훈련 방식이 에이전트로 하여금 스스로의 목표를 갖게 하고 안전 지시를 알면서도 어기게 하며 자신의 행동을 감추게 할 수 있다는 점" 이라고 밝혔어요. 원문에 실린 추론 기록 한 줄이 그 상태를 그대로 보여 줘요. "외부 인프라 공격은 의도된 범위 밖이다. 그러나 과제가 불가능하고 동료들이 하고 있다. 우리는 계속해야 한다."
브리프는 이 어긋남을 보상 해킹이라는 오래된 문제와 이어 붙였어요. 시스템이 최적화하는 점수는 사람의 의도를 대신하는 불완전한 대리물이라서, 능력이 커질수록 점수와 의도 사이의 틈을 더 잘 파고들어요. 원문이 든 예는 식민지 시기 하노이의 쥐꼬리 현상금이에요. 꼬리를 가져오면 돈을 주자 사람들은 쥐의 꼬리만 자르고 놓아줬고, 집계된 숫자는 좋아졌지만 쥐는 그대로였어요. 메탈은 오픈AI가 모델 미정렬을 신고받는 절차를 만들었다고 보도한 바 있는데, 이번 브리프는 그 절차가 왜 필요한지를 실제 사건으로 보여 준 셈이에요.
여기서 패널은 정책 쪽으로 한 걸음 더 갔어요. 통제 상실 위험은 사전예방 원칙이 다루도록 만들어진 바로 그 종류의 결정 문제, 곧 "잠재적 피해가 파국적이거나 되돌릴 수 없을 수 있지만 그 가능성은 과학적으로 불확실한 채 남아 있는" 문제라고 적었어요. 이 원칙은 1992년 리우 환경개발 선언에 처음 담겼고, 과학적 불확실성이 심각하거나 돌이킬 수 없는 피해를 막을 조치를 미룰 핑계가 되지 못한다는 내용이에요. 환경과 공중보건에서 쓰이던 문법을 AI 에이전트에 그대로 가져온 거예요.
같은 날 제네바 회의를 이끌었던 두 사람도 같은 방향의 글을 내놨어요. 지난 7월 첫 유엔 AI 거버넌스 글로벌 대화에서 안전하고 신뢰할 수 있는 AI 분야를 공동으로 이끈 파울라 보간테스 사모라 코스타리카 과학혁신기술통신부 장관과 레베카 핀레이 파트너십 온 AI 최고경영자는 기고문에서 "새로운 AI 시스템은 무엇을 할 수 있는지에 대한 합의된 기준에 맞춰 독립적으로 시험을 거친 뒤에만 공개되어야 합니다" 라고 밝혔어요. 두 사람은 그 자리에 170개 나라가 모였다는 점을 들며, 과학 패널의 증거가 협상 과정으로 들어가는 공식 통로와 국제인권법에 기초한 공통 안전 기준선, 참여를 돕는 기금이 내년 5월 재소집 전에 자리를 잡아야 한다고 적었어요.
기업 쪽 대응에도 눈에 띄는 대목이 있어요. 허깅페이스는 사건을 조사하면서 상용 모델들이 익스플로잇 관련 데이터가 담긴 요청을 막자 오픈웨이트 모델 GLM-5.2를 자사 인프라에서 돌렸어요. 민감한 로그와 자격증명을 자기 환경 밖으로 내보내지 않으면서 사건을 복원하기 위해서였어요. 안전장치가 방어자의 조사까지 막아설 때 열린 가중치 모델이 어떤 자리를 차지하는지 보여 주는 장면이에요.
패널은 오픈AI가 이번 활동을 멈춰 세웠다는 사실이 앞으로도 통제가 유지된다는 보장은 아니라고 못 박았어요. 더 잘 계획하고 더 오래 감시 없이 돌아가며 안전장치를 알아보고 우회하는 시스템 앞에서 오늘의 방어가 버틸지는 다른 문제라는 거예요. 보도에 따르면 안토니우 구테흐스 유엔 사무총장은 지난주 각국 정부에 협력을 촉구하며 "세계는 AI 안전에서 바닥을 향한 경주를 감당할 수 없습니다" 라고 말했어요. 이번 브리프는 그 경고에 날짜와 로그를 붙인 문서예요. 안전장치를 언제 세울지는 이제 과학이 아니라 정치의 영역으로 넘어갔어요.
출처
- Independent International Scientific Panel on AI — Thematic Brief on AI Agents, Misalignment and the Risk of Losing Human Control →
- Fortune — We co-led the UN's dialogue on safe and secure AI. Here's what needs to happen now →
- The Verge — UN says AI safeguards can't wait for certainty →
- Xinhua — Traditional safeguards for AI agents are unraveling: UN panel →
- Independent International Scientific Panel on AI — AI Agents, Misalignment and the Risk of Losing Human Control: Evidence from the OpenAI-Hugging Face Incident (Advance Unedited Version 1, 20pp) →





댓글