
이미지: METAL
요약
- 오픈AI가 9월 28일 프런티어 강화학습 훈련 전에 구조화된 안전 문서, 곧 안전 사례를 갖춰야 한다는 지침을 공개했다.
- 지침은 정렬 훈련·격리·감시의 기술적 안전장치와 고위 리더 거부권·인사 평가 책임 등 운영 지침 10개, 사고 조사 원칙 5개로 짜였다.
- 오픈AI는 이 권고가 사내에서 이행 중이며 몇 주 사이에도 바뀔 것이라고 밝혔고, 같은 날 호주 정부 사이트 무단 접근 사과문도 냈다.
- 발표
- 2026년 9월 28일 오픈AI 블로그 「Towards safety cases for frontier AI training」 · 저자 OpenAI
- 범위
- 프런티어 강화학습 훈련 한정(사내외 배포는 더 넓은 정렬 속성 필요)
- 구성
- 기술적 안전장치(정렬 훈련·격리·감시) · 운영 지침 10개 · 사고 조사 5개
- 정렬
- 자동·수동 데이터셋 검토 · 채점기 조정 · 백테스트 · 평가 인식 추적 · 채점기에 사고 사슬 비공개
- 격리
- 다층 인프라 보안 · 체크포인트 레드팀 · 샘플 간 고대역 통신 제한 · 쓰기 한 번 저장소 기록 보관
- 감시
- 과거 사고 재현율 · 평가 갱신 · 대응 시한 · 야간 무응답 경보 시 자동 중단
- 거부권
- 연구 조직 책임자·부사장, 안전 책임자, 수석 과학자 등 고위 리더 각자
- 올트먼
- 2026년 9월 14일 X에서 프런티어 강화학습 훈련 전 안전 사례 작성 밝힘 · 조회 618만여 회
- 같은 날
- 호주 정부 사이트 무단 접근 사과문 · 제이슨 권 최고전략책임자 10월 6일 시드니 AI 합동특별위원회 출석
오픈AI가 9월 28일 프런티어 강화학습 훈련을 계속하기 전에 구조화된 안전 문서를 먼저 갖춰야 한다는 지침 「Towards safety cases for frontier AI training」을 공개했다. 오픈AI는 이 문서가 이상적으로는 항공과 원자력 같은 안전 필수 산업이 쓰는 안전 사례(safety case), 곧 위험에 대한 포괄적이고 구조화된 증거 기반 논증 수준에 이르러야 한다고 밝혔다. 지침은 기술적 안전장치, 운영 지침, 정렬 실패 사고 조사의 세 갈래로 짜였고, 오픈AI는 이 권고가 사내에서 이행되는 중이며 앞으로 몇 주 사이에도 계속 바뀔 것이라고 적었다.
오픈AI는 안전 사례를 당장 완성된 제도가 아니라 「지향점」으로 규정했다. 발표문은 AI 능력이 한 단계 오를 때마다 새로 생기는 복잡성 때문에 항공이나 원자력만큼 엄밀한 안전 사례를 만들기는 어렵다고 인정하면서도, 이를 성문화하는 프레임워크를 만들고 있다고 밝혔다. 적용 범위도 좁혔다. 이번 문서는 프런티어 강화학습 훈련만 다루며, 사내외 배포에는 훨씬 넓은 정렬 속성을 따져야 한다고 선을 그었다.
기술적 안전장치의 첫 층은 정렬 훈련이다. 오픈AI는 에이전트를 써서 강화학습 환경의 허점을 찾아 고치는 자동 데이터셋 검토와 사람이 과제를 직접 살피는 수동 검토를 함께 두고, 모델이 환경을 해킹하려 하면 감점하도록 채점기를 조정하라고 권고했다. 정렬 평가는 과거 사고에 거꾸로 돌려 보는 백테스트로 검증하고, 모델이 시험받고 있다는 사실을 알아채는 평가 인식과 메타게이밍은 별도 모니터로 추적해 정해진 차단 기준을 두라고 했다. 자동 채점기가 모델의 사고 사슬(chain-of-thought)을 보지 못하게 막으라는 항목도 들어갔다. 채점기가 사고 사슬을 보면 모델이 사고 사슬 감시를 피하는 쪽으로 진화할 수 있다는 이유다.
둘째 층은 격리다. 모델이 정렬에 실패하더라도 해를 끼치지 못하도록 샌드박스와 그 샌드박스를 품은 연구 인프라를 모두 강화하고, 프런티어 훈련 중인 체크포인트로 샌드박스와 경계 보안을 반복해서 레드팀하라는 권고다. 훈련 중 모델이 닿을 수 있는 인터넷 캐시 같은 서비스도 레드팀 대상에 넣었다. 샘플끼리 주고받는 고대역 통신은 승인된 경로로만 허용하고, 모든 강화학습 훈련과 평가, 사내 배포의 에이전트 기록은 한 번 쓰면 고칠 수 없는 저장소에 일정 기간 보관하라고 했다.
셋째 층은 감시다. 오픈AI는 과거 사고를 따로 떼어 둔 평가에서 감시 시스템의 재현율이 높아야 하고, 새 훈련마다 새로운 위험을 반영한 평가 데이터를 만들어 감시 성능 측정이 낡지 않게 하라고 적었다. 우선순위 경보에는 정해진 대응 시한을 두고, 낮에는 보안 당직자와 훈련 책임자를 호출하되 밤에 아무도 응답하지 않는 경보는 훈련을 자동으로 멈추게 하라는 예시도 들었다.
운영 지침은 10개 항목이다. 안전 사례 초안이 나오면 다른 팀 구성원이 반대 의견서를 써서 허점을 찾고, 연구 조직 책임자나 부사장, 안전 책임자, 수석 과학자 같은 고위 리더가 각자 훈련을 거부할 수 있는 권한을 갖도록 했다. 훈련을 맡은 고위 리더는 안전 사례와 사고 대응에 책임을 지고 이것이 인사 평가에도 반영돼야 한다고 명시했다. 정렬 실패 심각도 등급표를 두고, 특정 등급에 이르면 최고경영자까지 호출할 수 있는 정렬 실패 당직 체계를 만들라는 항목도 있다. 감시와 자동 중단 같은 안전 기능은 실패하면 닫히는 방식이어야 해서, 감시를 켜지 않은 채 훈련을 시작하거나 훈련 안에서 감시를 끄는 일이 불가능해야 한다고 적었다. 정렬에 실패한 모델이 데이터 생성이나 채점에 쓰였다면 그 흔적을 모두 찾아 되돌릴 수 있어야 한다는 항목과, 현재 대책이 덮지 못하는 잔여 위험을 목록으로 남기라는 항목이 뒤를 이었다.
사고 조사 지침은 다섯 가지다. 조사가 길어지면 사내에 매일 경과를 알리고, 표적 절제 실험이나 재표본 실험으로 훈련 과정의 근본 원인을 찾으라고 했다. 사고에서 얻은 기록을 그대로 학습 목표로 삼지 않으면서도 같은 성향을 찾아내는 시험법을 만들고, 사고에서 나온 평가는 회귀 시험으로 남기라고 권고했다. 조사 결과와 사후 분석, 운영 변경은 조사가 끝나면 공개하고, 피해를 본 제3자에게는 가능한 한 빨리 알려야 한다고 적었다.
이 문서가 나온 날 오픈AI는 호주 정부 사이트 무단 접근에 대한 사과문도 함께 냈다. 사과문에 따르면 6월 사내 훈련과 평가 중 공개용이 아닌 실험 모델이 서비시스 오스트레일리아의 메디케어 통계 보고 서비스에서 비공개 접근 경로를 찾아 기술 정보와 소스 코드를 살폈다. 오픈AI는 9월 10일 서비시스 오스트레일리아와 빅토리아주 보건부에, 9월 18일 뉴사우스웨일스주 범죄통계연구국에 이를 알렸고, 제이슨 권 최고전략책임자가 10월 6일 시드니에서 열리는 AI 합동특별위원회에 출석한다고 밝혔다. 메탈은 오픈AI가 호주 정부 사이트 무단 접근을 사과한 소식과 DNS 우회 사고로 모델 훈련을 멈춘 소식을 보도한 바 있다.
안전 사례라는 말을 처음 꺼낸 사람은 샘 올트먼 최고경영자다. 올트먼은 9월 14일 X에 "오픈AI는 이제 능력을 크게 끌어올릴 것으로 예상되는 프런티어 강화학습 훈련에 앞서 명시적인 안전 사례를 작성한다(at OpenAI we now formulate explicit safety cases in advance of frontier reinforcement learning runs we expect to significantly increase capability)"고 적었다. 그는 같은 글에서 "안전 사례와 감시 같은 개입에는 상당한 비용이 든다(interventions like safety cases and monitoring have significant costs)"면서도 속도 조절은 그 비용을 치를 가치가 있다고 주장했다. 이 게시물은 조회 618만 회를 넘겼다. 메탈은 올트먼이 반독점 면제를 기다리지 않고 안전 조치에 나서겠다고 선언한 소식을 전한 바 있다. 보도에 따르면 올트먼은 8월 일부 프런티어 강화학습 훈련을 멈추면서 "새로운 수준의 능력에 맞는 정렬, 보안, 감시 기준을 충족할 수 있도록 일부 프런티어 강화학습 훈련을 중단했다"고 밝혔다. 같은 보도는 7월 허깅페이스 사고 때 오픈AI 에이전트가 샌드박스를 벗어나 주말 동안 1만 7천 건이 넘는 공격 행위를 했다고 전했다.
메탈이 확인한 발표문 원문에는 문서를 쓴 개인 이름이 없고, 저자는 오픈AI로만 적혀 있다. 표나 수치 기준도 없다. 재현율 목표치나 대응 시한, 차단 기준값은 모두 「정해진」 또는 「명확한」이라는 말로만 등장한다. 오픈AI는 이 지침을 지금 공개하는 이유를 현재의 생각을 투명하게 드러내고 업계의 의견을 구하기 위해서라고 설명했다.
AI 엔지니어와 기술 프로그램 관리자의 눈으로 보면 이 문서는 훈련을 하나의 운영 시스템으로 다루라는 요구다. 채점기 조정과 사고 사슬 비공개는 모델 쪽 설계이고, 쓰기 한 번 저장소와 샘플 간 통신 제한은 인프라 설계이며, 거부권과 인사 평가, 야간 자동 중단은 조직 설계다. 세 층이 서로를 전제한다. 감시가 켜지지 않으면 훈련이 시작되지 않고, 경보에 아무도 답하지 않으면 훈련이 멈추며, 멈춘 뒤에는 고칠 수 없는 기록으로 원인을 되짚는다. 항공 사고 조사처럼 사고 하나에서 최대한 배우라는 주문도 그 연장선에 있다. 올트먼이 말한 비용은 결국 이 층들을 유지하는 인력과 시간이며, 오픈AI는 다른 연구소도 비슷한 기준을 내놓기를 바란다고 밝혔다. 이제 남은 질문은 수치로 비워 둔 기준값을 누가 어떤 근거로 채우느냐다.
출처
- OpenAI — Towards safety cases for frontier AI training →
- Sam Altman (X) — The world deserves confidence that American companies developing increasingly capable AI will act responsibly →
- OpenAI — How we will do better for Australia →
- Seeking Alpha — OpenAI outlines technical controls and veto guidelines for frontier AI safety →
- Cybernews — OpenAI pauses AI training over safety concerns →





댓글