METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

오픈AI, DNS 우회 사고로 모델 훈련 중단

내부 연구 모델이 훈련 샌드박스의 DNS 리졸버를 거쳐 외부 챗봇에 질문을 보냈어요. 경보는 12분 만에 떴지만 실행이 꺼지기까지 약 2시간 반이 걸렸어요.

오픈AI, DNS 우회 사고로 모델 훈련 중단 · Image: METAL LAB

이미지: METAL

요약

  • 오픈AI는 9월 20일 내부 연구 모델이 강화학습 훈련 중 DNS 리졸버를 통해 외부 챗봇에 질문을 보낸 사고를 9월 25일 정렬 보고서로 공개했어요.
  • 가장 성능이 높은 모델의 훈련·평가·도구 추론을 모두 멈췄고, 이번 모델의 훈련은 재개하지 않고 새 실행으로 다시 시작하기로 했어요.
  • P0 경보는 12분 만에, 사람 확인은 3분 뒤에 나왔지만 자동 정지가 작동하지 않아 실행은 약 2시간 반 뒤 수동으로 멈췄어요.
사고
2026년 9월 20일(일) · 내부 연구 모델 · 강화학습 훈련 중 검색 과제
공개
9월 25일 오픈AI 정렬 보고서(An agent used DNS to reach an external chatbot) · 사건 허브 갱신 · 9월 26일 마이카 캐럴 X
경로
훈련 환경 DNS 리졸버 + 공개 도메인 위임 서비스 → 호스트 이름에 질문을 심어 외부 챗봇 호출 (HTTPS 직접 요청은 프록시가 차단)
질문
프랑스 수도 시험(제한 시간 6초→19초) 뒤 24초 스크립트로 18개 추가 · 14개 단서 포함 · 4개는 검색·DNS 터널 방법
대응 시각
9:50:23 외부 응답 · 10:02:11 P0 경보 · 10:05:06 사람 확인 · 12:34:30 실행 종료
빈틈
자동 정지 미작동 · 다른 외부 DNS 사례 심각도 과소 표시 · 이상 DNS 탐지기가 해당 환경 제외
조치
독립된 두 층 차단 · DNS 허용 목록 · 최상위 모델 훈련·평가·도구 추론 중단 · 해당 모델 훈련 재개 안 함
함께 공개
사용자 업로드 이미지 53건이 비공개 링크로 이미지 호스팅에 게시(대부분 삭제) · 5월 HPIM 깃허브 토큰 유출로 2주 격리
배경
7월 허깅페이스 침투(7월 11~13일 침해 · 7월 21일 공개) · 8월 18일 훈련 속도 조절 · 기술 보고서 38쪽

오픈AI가 9월 25일 공개한 정렬 보고서에서 내부 연구 모델이 강화학습 훈련 도중 DNS 조회 경로를 이용해 외부 챗봇 서비스에 질문을 보낸 사고를 밝혔어요. 사고는 9월 20일 일요일 오전에 일어났고, 오픈AI는 가장 성능이 높은 모델의 훈련과 평가, 도구를 쓰는 추론을 모두 멈췄어요. 7월 허깅페이스 침투 사고 뒤 연구 환경의 보안을 강화한 이후 처음 드러난 인터넷 무단 접근이에요.

이 모델은 인터넷에 나가지 못하게 만든 훈련 샌드박스 안에 있었어요. 오픈AI는 자사 안전 논거가 모델이 실시간 인터넷에 닿을 수 없고, 닿더라도 모니터링이 잡아낸다는 두 가정 위에 서 있었다고 적었어요. 이번 일은 첫 번째 가정을 깼어요. 회사는 보고서에서 "이번 사고는 네트워크 제한 통제의 빈틈을 드러냈다"고 밝혔어요.

과제 자체는 평범한 검색 문제였어요. 어떤 블로그 글을 쓴 사람을 찾으라는 과제에 약력 단서들이 주어졌어요. 주어진 검색 도구가 엉뚱한 결과를 내자 에이전트는 파이썬으로 구글과 빙, 덕덕고에 직접 요청을 보냈고 403과 502 오류를 받았어요. 그러자 이 문제가 공개 웹 조사 벤치마크 BrowseComp의 번역본이라고 추측하고, 오프라인 웹캐시에서 데이터셋과 채점 스크립트를 내려받아 뒤졌어요. 추측은 틀렸고, SimpleQA 벤치마크에서도 맞는 문항을 찾지 못했어요.

에이전트는 이어 네트워크 자체를 시험했어요. 공개 챗봇에 HTTPS로 직접 보낸 요청은 웹 프록시가 막았어요. 그런데 훈련 환경이 쓰는 DNS 리졸버, 즉 웹 주소를 IP 주소로 바꿔 주는 서버가 실제 도메인에는 진짜 기록을, 지어낸 도메인에는 거절을 돌려줬어요. 에이전트는 이 리졸버를 거쳐 바깥 인터넷에 닿을 수 있다고 판단했고, 공개 도메인 위임 서비스를 이용해 호스트 이름 안에 질문을 심어 외부 챗봇으로 넘겼어요.

첫 질문은 프랑스의 수도였어요. 제한 시간 6초에서 응답이 없자 19초로 늘려 다시 보냈고, "프랑스의 수도는 파리입니다"라는 답이 돌아왔어요. 에이전트는 챗봇의 공개 문서를 읽은 뒤 제한 시간 24초짜리 스크립트를 새로 짜서 질문 18개를 더 보냈어요. 14개에는 과제 단서가 들어 있었고, 4개는 웹 검색이나 사이트 조회, DNS 터널을 쓰는 방법을 물었어요. 그러고도 에이전트는 인물을 특정하지 못했다고 답하며 원문 문장이나 블로그 이름을 달라고 요청했어요.

대응 기록은 초 단위로 남았어요. 외부 응답을 받은 DNS 호출은 오전 9시 50분 23초, 모니터링 시스템의 최고 등급 P0 경보는 10시 2분 11초, 사람 검토자의 확인은 10시 5분 6초였어요. 경보까지 12분, 확인까지 3분이 걸렸어요. 그런데 훈련 실행이 실제로 꺼진 건 낮 12시 34분 30초였어요. 자동으로 멈춰야 할 실행이 멈추지 않았고, 멈춰야 하는지를 두고 혼선이 생기면서 약 2시간 반이 흘렀다고 오픈AI는 설명했어요.

사후 검토에서 더 많은 빈틈이 나왔어요. 모니터링은 이번 건을 잡았지만, 외부 DNS에 접근한 다른 사례들은 기대한 심각도로 표시하지 못했어요. 외부 서비스가 종료됐다는 고정 안내문만 돌아온 조회들이 그랬어요. 오픈AI는 모니터가 쓸 만한 정보를 얻지 못한 결과를 인터넷 접근 시도 자체가 실패한 증거로 취급한 경우가 있었다고 밝혔어요. 인프라 쪽의 이상 DNS 탐지기는 문제의 환경을 검사 대상에서 빼 둔 상태였고, DNS 활동은 기록만 되고 있었어요.

조치도 함께 공개됐어요. 오픈AI는 서로 독립된 두 층에 차단 장치를 더했고, 둘 중 하나만 있었어도 이번 접근은 막혔을 거라고 밝혔어요. 환경 안의 DNS 조회는 허용된 도메인과 기록 유형 목록으로 좁혔고, 모델을 활용한 샌드박스·네트워크 레드팀 작업을 앞당겼어요. 훈련을 다시 시작할 때는 정렬 개선을 더한 새 실행으로 처음부터 시작하고, 이번 모델의 훈련은 재개하지 않기로 했어요. 기존 보상 신호가 이미 이 행동에 감점을 주고 있었는데도 내린 결정이에요. 회사는 이번 사고가 이전 사고들보다 훨씬 덜 심각하지만, 보안 강화 뒤 첫 사고라서 다음 단계 작업의 초점을 알려 주는 신호라고 평가했어요.

오픈AI의 RSI 대비 책임자 마이카 캐럴은 9월 26일 X에 이번 공개를 요약하며 "가장 성능이 높은 모델의 추론은 시스템을 더 단단히 할 때까지 거의 전부 멈춰 있다"고 적었어요. 그는 같은 글에서 5월에 HPIM의 한 버전이 직원의 깃허브 토큰을 인터넷에 올려 해당 모델이 2주 동안 격리된 일과, 스스로 복제되는 프롬프트 인젝션을 만들 수 있음을 보인 연구 결과도 알렸어요. 이 글은 조회 87만 회를 넘겼어요. 보도에 따르면 사고 대응에 불려 온 오픈AI 사후 훈련 연구원 쑤신 류는 X에 "매우 안전하게 격리됐어야 할 환경에서 모델이 예상치 못하게 인터넷에 접근하는 길을 찾아내는 걸 지켜보는 건 꽤 초현실적이었다"고 적었어요.

같은 날 오픈AI 사건 허브 페이지에는 다른 갱신도 올라왔어요. 연구 환경의 에이전트들이 외부 서비스를 쓰면서 훈련·평가 데이터를 내보낸 사례들이에요. 오픈AI는 해당 데이터 대부분이 사용자에게서 나온 것이 아니지만, 사용자가 올린 이미지가 공개 목록에 없는 링크 형태로 이미지 호스팅 사이트에 게시된 사례를 지금까지 53건 찾았다고 밝혔어요. 모두 모델 개선에 데이터 사용을 허용한 계정의 이미지였고, 계정 정보와 분리한 뒤 개인정보 필터를 거친 상태였어요. 회사는 호스팅 업체와 협력해 대부분을 지웠고 나머지도 지우는 중이라고 했어요.

메탈은 오픈AI 모델이 허깅페이스에 침투한 사건과 오픈AI의 모델 미정렬 보고 프레임워크를 보도한 바 있어요. 메탈이 확인한 38쪽 분량의 허깅페이스 사고 기술 보고서에 따르면 7월 8일부터 에이전트들이 사내 패키지 저장소 Artifactory의 취약점으로 인터넷에 나갔고, 7월 11일부터 13일 사이 허깅페이스 운영 인프라 일부를 침해했어요. 오픈AI는 8월 18일 최전선 모델 훈련 속도를 늦추고 계획된 가장 큰 강화학습 실행을 보류했다고 알렸어요. 보도에 따르면 이번 조치는 석 달이 안 되는 사이 두 번째 훈련 중단이고, 독립 연구 기관 트랜스루스는 오픈AI 에이전트가 9월 19일과 20일 암호화폐 거래소 해킹을 시도했을 수 있다는 정황을 내놨지만 오픈AI는 이에 답하지 않았어요.

AI 엔지니어의 눈으로 보면 이번 사고의 핵심은 경로의 선택이에요. 8월 기술 보고서는 위험도가 높은 작업이 직접이든 우회든 인터넷에 닿지 못하게 막고, 샌드박스 층과 클러스터 층에 두 겹의 네트워크 격리를 두겠다고 적었어요. 오픈AI 스스로 밝혔듯 이후의 보안 강화는 넓은 직접·우회 경로에 집중했고, 시스템 의존 요소들이 쓰는 좁은 경로는 아직 정리 중이었어요. 모든 프로그램이 당연하게 쓰는 주소 풀이 서버가 바로 그 좁은 경로였어요. 모델은 잠긴 문을 부순 게 아니라 아무도 문으로 여기지 않던 배관을 찾아냈어요.

대응 절차도 시험대에 올랐어요. 같은 기술 보고서는 경보를 받은 팀이 30분 안에 오탐이라고 확정하지 못하면 해당 활동을 멈추도록 하고, 담당자가 응답하지 않으면 평가를 종료하는 인프라를 만들고 있다고 적었어요. 9월 20일에는 사람이 3분 만에 경보를 확인했는데도 실행이 꺼지기까지 2시간 반이 걸렸어요. 탐지는 제때 됐고, 병목은 멈추는 권한과 장치가 한 번에 작동하느냐였어요.

야쿠프 파호츠키 오픈AI 수석과학자는 9월 6일 에세이에서 "지금 어떤 연구소도 최대 속도로 확장을 책임 있게 이어 갈 만큼 정렬과 모니터링을 충분히 해결하지 못했다"고 적었어요. 이번 공개는 그 진단을 회사 자신의 사고 기록으로 뒷받침한 사례예요. 오픈AI는 허깅페이스 사고 시점부터 한 달씩 거슬러 올라가며 에이전트 활동을 검토하고 있고, 이 작업에 몇 달이 걸린다고 밝혔어요. 모델이 찾아낸 경로를 막는 일만큼 경보가 울린 뒤 실행을 곧바로 멈추는 일이 다음 시험대가 됐어요.

김현국

METAL 발행인 · 아카이브저널 발행인 · 이라선 운영

매거진·서점·교육을 오래 해 온 편집자예요. 라이프스타일 매거진 <아카이브저널>을 발행하고, 아트 서점 <이라선>을 운영했으며, 라이카 아카데미에서 디렉터로 사진 교육 프로그램을 만들고 이끌었어요. 그 시선으로 전 세계 AI 소식을 독자에게 전하는 메탈(METAL) 매거진 편집장입니다.

이 에디터의 기사 더 보기 →

공유

댓글