METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

오픈AI, 제3자 안전 평가 원칙 발표

외부 평가를 깊게 받을 영역 네 곳과 평가가 지킬 원칙 일곱 가지를 한 문서에 담았어요. 평가 주장은 미리 등록하고, 평가자는 회사가 요청한 삭제 사실까지 보고서에 적을 수 있어요.

오픈AI, 제3자 안전 평가 원칙 발표 · Image: METAL LAB

이미지: METAL

요약

  • 오픈AI가 9월 22일 제3자 안전 평가의 우선 영역 네 곳과 원칙 일곱 가지를 발표했어요.
  • 안전 사례, 핵심 안전장치, 대비 프레임워크 역량 평가, 중대한 미정렬 사건 조사가 우선 영역이에요.
  • 평가 주장은 사전 등록하고, 이해충돌을 공개하며, 평가자는 편집 독립성과 삭제 사실 표기 권한을 가져요.
발표
2026년 9월 22일 · Priorities and principles for effective third party assessments
작성자
라마 아마드
대상
민간·비영리 독립 평가 기관의 기술적 안전 평가(정부 시험·평가는 별도)
우선 영역
안전 사례 · 핵심 안전장치 · 대비 프레임워크 역량·정렬 평가 · 중대 미정렬 사건 조사
역량 평가 범주
화학·생물 위험 · 사이버보안 · AI 자기개선
원칙
범위 합의·사전 등록 · 비례적 접근 · 투명한 방법론 · 전문성·독립성 · 보안·기밀 · 개선 기간 · 책임 있는 공개
평가 기간
몇 주~몇 달 · 여러 평가 병행 · 출시 일정과 무관
사건 조사 예
오픈AI 허깅페이스 사건
선행 문서
8월 8일 뉴스레터 · 감사·제3자 평가 여섯 원칙
기존 협력 기관
METR · SecureBio · Apollo Research · Irregular
X 게시물
조회 49만9천 회 이상(메탈 확인 시점)

오픈AI가 9월 22일 외부 기관이 자사 모델의 안전을 검증하는 방식에 대한 원칙을 발표했어요. 제3자 평가를 깊게 받을 영역 네 곳과 평가가 지켜야 할 원칙 일곱 가지를 한 문서에 담았고, 평가자에게 학습과 평가, 배포 전 단계에 걸쳐 깊은 수준의 접근을 주겠다고 약속했어요. 회사는 발표문에서 그 접근이 "평가자가 우리의 가정에 이의를 제기하고, 우리가 놓쳤을 수 있는 위험을 찾아내고, 우리 안전장치의 효과에 대해 스스로 결론에 이르게 해야 한다" 고 적었어요.

문서의 출발점은 책임의 배분이에요. 오픈AI는 프런티어 AI 연구소가 모델을 안전하게 학습하고 평가하고 배포할 막대한 책임을 지고, 제3자 평가는 그 책임의 균형을 잡으면서 연구소가 분명하고 독립적으로 뒷받침된 안전 주장에 책임을 지게 하는 핵심 장치라고 적었어요. 대상은 민간과 비영리 부문의 독립 평가 기관이 하는 기술적 안전 평가로 한정했고, 정부와 함께하는 시험·평가는 역할과 책임이 달라 다른 접근이 필요할 수 있다며 따로 떼어 놨어요.

용어부터 정의했어요. 안전 주장은 모델이나 시스템의 능력, 행동, 안전장치에 관해 증거로 따져 볼 수 있는 구체적 단언이고, 어떤 위험과 조건을 다루는지와 전제, 한도를 함께 밝혀야 한다고 문서는 적었어요. 안전 사례는 학습이나 평가, 배포 같은 특정 활동에서 위험이 충분히 관리되고 있다는 것을 증거로 설명하는 구조화된 논증이에요. 개별 안전 주장을 증거에 잇고, 결론을 흔들 수 있는 가정과 불확실성, 남은 위험을 드러내야 해요.

깊게 평가받을 첫 영역은 그 안전 사례 자체예요. 학습, 평가, 내부 배포, 외부 배포를 모두 아우르고, 정렬과 모니터링 같은 통제 방법, 사이버보안, 생물·화학 오용, 레드팀 전문성이 필요하다고 회사는 적었어요. 평가자들은 안전 사례의 증거가 입증되는지, 학습과 배포 과정에서 그 조건이 실제로 지켜졌는지, 그리고 학습 과정에 기만이나 보상 해킹, 파괴적 행동, 제한 우회에 보상을 주는 유인이 없는지를 따져야 해요.

둘째는 내부와 외부 배포에 걸친 핵심 안전장치예요. 오픈AI의 안전장치에는 모델 수준 안전장치, 집행 안전장치, 보안 안전장치, 미정렬 모니터가 들어가 있어요. 평가자는 내부 구조를 일부 들여다보는 그레이박스 접근으로 탈옥 공격에 버티는지 시험하고, 승인된 실제 운영 조건에서 에이전트가 접근 통제와 샌드박스, 탐지·대응 체계를 어떻게 다루는지 살펴요. 모델이 드러내는 사고 과정을 감시하는 방식이 모델 능력이 오를수록 얼마나 믿을 만한 증거로 남는지도 질문 목록에 올랐어요.

셋째는 역량 평가예요. 오픈AI의 대비 프레임워크가 정한 위험 범주인 화학·생물 위험, 사이버보안, AI 자기개선을 다루는 평가와 심각한 미정렬을 재는 정렬 평가가 대상이에요. 모델이 최고점을 계속 찍어 평가가 포화되면 새 시험이 더 높은 능력을 제대로 재는지, 문턱 값이 올바르게 정해졌는지를 외부가 보라는 거예요.

넷째는 중대한 미정렬 사건의 독립 조사예요. 문서는 허가 없이 움직이거나 감독을 피하는 모델 행동을 예로 들고, 오픈AI 허깅페이스 사건처럼 독립 제3자를 불러 조사하는 편이 나은 경우가 있다고 적었어요. 메탈은 유엔 AI 과학패널이 이 사건을 통제 상실로 가는 경로의 초기 경고로 규정했고 독립 비영리기관 METR이 조사 기간의 에이전트 활동을 셌다고 보도한 바 있으며, 이번 문서는 그런 조사를 일회성이 아닌 상설 영역으로 올려놨어요. 조사자에게는 사이버 포렌식과 정렬 전문성, 대규모 사고 과정 분석 능력, 제때 조사를 끝낼 인력이 요구돼요.

일곱 원칙은 계약서 조항처럼 읽혀요. 평가는 서로 합의한 범위에서 시작하고, 평가할 안전 주장은 평가 활동 전에 미리 등록해요. 그 주장이 회사가 내민 것인지 평가자가 독자적으로 세운 것인지도 밝혀야 해요. 접근은 법률과 보안, 지식재산 제약 안에서 합의된 주장에 비례하게 주고, 직접 접근이 어려우면 회사 지정 담당자를 거치거나 정보를 보호하는 간접 방식을 쓰도록 했어요. 평가자는 방법과 기준, 불확실성을 설명하고, 보고서는 직접 확인한 사실과 해석을 구분해야 해요.

변호사의 눈에 가장 무거운 조항은 독립성과 공개예요. 평가자는 금전적 유인과 개발사와의 관계, 평가 대상 작업에 앞서 관여한 이력을 포함한 이해충돌을 밝혀야 하고, 상업적 압력과 보수 구조가 결론에 영향을 주지 못하도록 회피나 배제 기간 같은 장치를 둘 수 있어요. 회사는 공개 전에 문제를 고칠 합리적 기간을 갖고 민감 정보의 삭제를 요청할 수 있지만, 평가자는 편집 독립성을 유지하면서 상당한 삭제가 있었다는 사실과 그것이 평가에 준 영향을 보고서에 적을 수 있어요. 전면 공개가 어려우면 이사회 같은 감독 기구에 기밀 보고를 하는 길도 열어 뒀어요.

평가 기간은 몇 주에서 몇 달이에요. 문서에 따르면 오픈AI는 여러 평가를 동시에 지원할 계획이고, 이번 작업은 대체로 출시 일정과 무관하게 특정 안전 주장을 오래 파고드는 방식이에요. 회사는 이미 외부 평가자에게 기술적 안전장치 정보, 모델이 보여 주는 사고 과정, 사고 대응과 모니터 레드팀을 위한 전례 없는 수준의 기밀 데이터와 내부 배포 접근을 제공해 왔다고 밝혔어요.

이번 문서는 한 달 반 전의 약속을 구체화한 거예요. 오픈AI는 8월 8일 글로벌 정책 뉴스레터에서 감사와 제3자 평가를 구분하는 여섯 원칙을 먼저 냈어요. 감사는 조직이 정해진 요건과 절차를 따르는지를 보고, 제3자 평가는 증거가 특정 안전 주장을 뒷받침하는지를 시험한다는 구분이에요. 그 글에서 회사는 "기업에 심사를 받게 하는 것만으로는 충분하지 않다" 고 적었고, 평가를 무르게 받으려고 평가자를 골라 다니는 행태를 막아야 한다고 짚었어요. 그동안 METR, SecureBio, Apollo Research, Irregular와 함께 장기 자율성과 생물 위협, 사이버보안, 책략과 기만, 감독 전복 위험을 평가해 왔다는 사실도 같은 글에 적혀 있어요.

메탈이 확인한 9월 22일 발표문에는 새로 함께할 평가 기관의 이름이나 계약 규모, 일정이 적혀 있지 않아요. 문서의 마지막 문단은 앞의 우선 영역에 맞춘 제안을 두고 여러 제3자와 대화하고 있다는 문장으로 끝나고, 작성자로는 라마 아마드의 이름이 올라 있어요. 회사는 공식 X 계정에도 네 가지 우선 영역과 원칙을 소개했고, 이 게시물은 메탈이 확인한 시점에 조회 49만9천 회를 넘겼어요.

같은 방향의 움직임은 업계 안팎에서 이어지고 있어요. 메탈은 앤스로픽이 평가자를 회사 안에 두겠다는 약속의 첫걸음으로 액센추어와 독립 평가 제휴를 맺었다고 보도한 바 있어요. 오픈AI의 이번 문서는 누가 평가하느냐보다 무엇을, 어떤 조건으로 평가하느냐를 먼저 적었다는 점이 다르고, 회사는 그 기준을 앞으로 법률과 민간 거버넌스 기구 양쪽을 통해 공유된 국제 표준으로 만들겠다고 밝혔어요.

법률가의 관점에서 이 문서의 무게는 약속보다 절차에 있어요. 사전 등록된 주장, 이해충돌 공개, 삭제 사실의 표기는 모두 평가 결과를 나중에 다퉈 볼 수 있게 만드는 장치이고, 규제가 제3자 검증을 요구할 때 가장 먼저 참조될 조항들이에요. 오픈AI는 "어느 한 제3자도 시급한 프런티어 안전 문제를 포괄적으로 다룰 수 없고, 그래서도 안 된다" 고 적었어요. 이 원칙이 실제로 작동하는지는 첫 평가 보고서가 무엇을 삭제하고 무엇을 남겼는지, 그리고 그 사실을 평가자가 스스로 적었는지에서 먼저 드러날 거예요.

김현국

METAL 발행인 · 아카이브저널 발행인 · 이라선 운영

매거진·서점·교육을 오래 해 온 편집자예요. 라이프스타일 매거진 <아카이브저널>을 발행하고, 아트 서점 <이라선>을 운영했으며, 라이카 아카데미에서 디렉터로 사진 교육 프로그램을 만들고 이끌었어요. 그 시선으로 전 세계 AI 소식을 독자에게 전하는 메탈(METAL) 매거진 편집장입니다.

이 에디터의 기사 더 보기 →

공유

댓글