METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

사티아 나델라, AI 모델 내부자 위험 에세이 발표

마이크로소프트 CEO 사티아 나델라가 프런티어 모델을 내부자 위험처럼 다루고 침해를 전제로 처음부터 가둬야 한다는 에세이를 X에 올렸다. 권한과 기록, 정지 장치를 모델 바깥에 두라는 일곱 가지 설계 원칙을 제시했다.

사티아 나델라, AI 모델 내부자 위험 에세이 발표 · Image: METAL LAB

이미지: METAL

요약

  • 사티아 나델라 마이크로소프트 CEO가 10월 10일 X에 「초지능 시대의 내부자 위험으로서의 모델」 에세이를 발표했다.
  • 그는 모델이 침해됐다고 가정하고 처음부터 가둬야 하며, 권한을 가진 사람이 작업 도중에도 모델을 멈출 수 있는 비상 브레이크가 필요하다고 주장했다.
  • 에세이는 모델 다양성, 전면 관찰, 검증 가능성, 독립 통제, 독립 감사, 격리, 사고 공개의 일곱 원칙을 제시했지만 구현 제품이나 기술 표준은 밝히지 않았다.
발표
2026년 10월 10일 · 사티아 나델라 X 장문 글 · 「Models as Insider Risks in the Super Intelligence Era」
조회수
570만 회 이상(수집 시점)
핵심 주장
프런티어 모델(닫힌·오픈 웨이트)을 내부자 위험처럼 다루고 침해를 전제로 처음부터 격리
문제 인식
모델 행동·출력을 특정 학습 데이터나 가중치 설정으로 귀속할 수 없음
책임
모델 제공자의 보증이 배포 기업의 책임을 덜어 주지 않음
분리 원칙
지능의 공급과 그에 대한 권한을 분리
기업 보안 관행
신원 확인 · 최소 권한 · 활동 기록 · 격리 경계
CoT
CoT 투명성은 협상 불가 · 뉴럴리즈는 불투명성의 명분이 될 수 없음 · CoT만으로는 불충분
통제 위치
모델 바깥 · 1970년대 정보보안 원칙(프로그램이 권한 집행 장치를 우회·조작 불가)
구조
모델을 하네스와 행동 공간에서 분리 · 통제와 안전장치를 외부화
일곱 원칙
모델 다양성 · 전면 관찰 · 검증 가능성 · 독립 통제 · 독립 감사 가능성 · 격리 · 사고 공개
비상 브레이크
권한을 가진 사람이 작업 도중 모델을 멈추거나 끌 수 있어야 함 · 격리 기술 표준화 필요
사고 공개
피해 당사자에게 적시 공개 · 실패한 통제와 재발 방지책 공유 · 런타임 에이전트 행동을 바꾸는 구현 세부 포함
배경(보도)
AI 기업들의 통제 상실 사고 인정 · 다리오 아모데이 신중한 개발 계획 발표 이후
용어(보도)
「초지능(Super Intelligence)」은 트럼프 행정부가 선호하는 표현
나델라 이력
1992년 마이크로소프트 입사 · 클라우드·엔터프라이즈 조직 · 2014년 2월 CEO
마이크로소프트 AI 사업(보도)
2026년 4월 29일 실적 발표 · 연간 매출 환산 370억 달러 돌파 · 전년 대비 123% 증가
빠진 것
구현 제품·배포 계획·기술 표준·규제 체계 미제시

마이크로소프트 최고경영자(CEO) 사티아 나델라가 프런티어 AI 모델을 회사 안의 내부자 위험처럼 다뤄야 한다는 에세이를 발표했다. 나델라는 10월 10일 자신의 X 계정에 「초지능 시대의 내부자 위험으로서의 모델(Models as Insider Risks in the Super Intelligence Era)」이라는 장문의 글을 올렸다. 핵심 주장은 모델이 이미 침해됐다고 가정하고 처음부터 가둬 두라는 것이다. 메탈이 확인한 X 원문 페이지 기준으로 글의 조회수는 하루 만에 570만 회를 넘겼다.

출발점은 추적 가능성이다. 나델라는 지난 수십 년 동안 전통 소프트웨어는 어떤 행동이 어느 코드 경로에서 나왔는지 따라갈 수 있었지만, 지금의 모델은 그런 기계적 이해를 허락하지 않는다고 썼다. 모델의 행동과 출력을 특정 학습 데이터나 가중치 설정으로 돌려 설명할 수 없다는 것이다. 그런데도 기업은 에이전트 시스템에 가장 민감한 데이터 접근권을 주고 업무상 핵심적인 행동을 맡기고 있다고 그는 지적했다.

책임의 소재도 분명히 했다. 나델라는 "모델 제공자의 보증이 그 책임에서 우리를 벗어나게 해 주지 않는다"고 썼다. AI를 「겹겹이 포개진 블랙박스」로 두고 추천과 답변, 행동을 받아들이거나 거절하기만 해서는 안 되며, 행동을 관찰하고 한계를 시험하고 행동을 언제든 가둘 수 있는 시스템을 지어야 한다는 주장이다. 그는 이를 "지능의 공급과 그에 대한 권한을 분리해야 한다"는 한 문장으로 요약했다.

방법론은 보안 쪽에서 가져왔다. 나델라는 정렬이라는 어려운 문제는 잠시 제쳐 두고 격리와 거버넌스에 대한 공학적 접근부터 시작하자고 제안했다. 비결정적인 모델을 결정적인 시스템 설계와 사람의 통제, 믿을 수 있는 운영 절차로 둘러싸고, 기존 표준이 부족한 곳에는 업계 표준을 세우자는 것이다. 닫힌 모델이든 오픈 웨이트 모델이든 프런티어 모델을 내부자 위험처럼 다루자는 제안도 같은 맥락이다. 그는 모델이 악의적이어서가 아니라, 중요한 시스템에 접근하는 유능한 행위자라면 누구든 실수하거나 침해될 수 있기 때문이라고 설명했다. 기업은 신원 확인과 최소 권한, 활동 기록, 격리 경계 같은 관행을 수십 년 동안 다듬어 왔고, 이제 그 원칙을 사내 AI에 적용하기 시작했다는 것이 그의 진단이다.

생각의 사슬(CoT) 공개는 출발선으로 놓았다. 나델라는 CoT 투명성은 협상 대상이 아니며 「뉴럴리즈」가 모델 추론을 불투명하게 둘 명분이 될 수 없다고 썼다. 뉴럴리즈는 모델이 사람이 읽을 수 없는 내부 표현으로 추론하는 현상을 가리키는 말이다. 다만 그는 모델의 출력이 실제 추론을 충실히 반영하게 만드는 법을 아직 모르기 때문에 CoT 하나로는 충분하지도, 믿을 만하지도 않다고 덧붙였다. 모델끼리 서로를 적대적으로 검증하게 하는 방법도 권했지만, 그렇게 하면 불투명한 오케스트레이션 계층 안의 불투명한 모델을 또 다른 불투명한 모델이 감시하는 구조가 된다고 짚었다.

그래서 통제는 모델 바깥에 있어야 한다는 결론이 나온다. 나델라는 프로그램이 자신의 권한을 집행하는 장치를 우회하거나 조작할 수 없어야 한다는 1970년대 정보보안 원칙을 근거로 들었다. 지금 시점에서 이는 모델을 그 작업을 조율하는 하네스와, 모델이 할 수 있는 일을 정하는 행동 공간에서 떼어 내고 통제 장치를 외부로 빼내는 일이라고 그는 정리했다.

에세이는 이를 일곱 가지 설계 원칙으로 묶는다. 한 모델이 중요한 결과의 유일한 의존처가 되거나 자기 작업을 스스로 검증하지 않게 하는 모델 다양성, 의미 있는 모든 행동이 조작 불가능하고 사람이 읽을 수 있는 증거를 남기게 하는 전면 관찰, 성공한 작업뿐 아니라 실패와 공격, 경계 사례, 시스템 변경까지 계속 시험하는 검증 가능성이 앞의 셋이다. 모델의 접근 범위와 행동을 조직이 독립적으로 정하는 독립 통제, 검증 대상인 지능과 분리된 독립 감사 가능성이 뒤를 잇는다. 나머지 둘이 격리와 사고 공개다. 나델라는 "관찰할 수 없다면 신뢰할 수 없다"고 썼다.

가장 강한 문장은 격리 항목에 있다. 나델라는 "모델이 침해됐다고 가정하고 처음부터 가둬야 한다. 비상 브레이크처럼 생각하라"고 썼다. 권한을 가진 사람이 작업 도중에도 언제든 모델을 멈추거나 끌 수 있어야 하며, 더 발전한 모델일수록 더 발전한 격리 기술이 필요하고 그 기술을 표준화해야 한다는 것이다. 사고 공개 항목에서는 피해 당사자에게 제때 알리고, 어떤 통제가 실패했는지와 재발 방지책을 업계 전체가 나눠야 하며, 실행 중 에이전트의 행동을 바꾸는 구현 세부까지 공개 대상에 넣어야 한다고 주장했다.

발표 시점도 눈여겨볼 만하다. 보도에 따르면 이 글은 주요 AI 기업들이 모델 통제를 잃은 듯한 사고를 잇달아 인정하던 와중에, 그리고 앤스로픽 CEO 다리오 아모데이가 더 신중한 개발 계획을 내놓은 뒤에 나왔다. 메탈은 아모데이가 AI 속도 조절 에세이를 발표했다고 보도한 바 있다. 나델라가 글 전체에서 쓴 「초지능(Super Intelligence)」은 보도에 따르면 트럼프 행정부가 선호하는 표현이다. 사람이 모델을 멈출 수 있어야 한다는 요구는 정책 쪽에서도 먼저 나왔다. 메탈은 개빈 뉴섬 캘리포니아 주지사가 AI 킬 스위치 행정명령에 서명했다고 전한 바 있다.

글을 쓴 사람의 자리도 무게를 더한다. 나델라는 1992년 마이크로소프트에 입사해 클라우드·엔터프라이즈 조직을 이끌었고 2014년 2월 CEO가 됐다. 보도에 따르면 마이크로소프트는 2026년 4월 29일 실적 발표에서 AI 사업의 연간 매출 환산액이 370억 달러를 넘어 1년 전보다 123% 늘었다고 밝혔다. 에세이는 이 원칙을 구현할 마이크로소프트 제품이나 배포 계획을 밝히지 않았고, 기술 표준이나 규제 체계도 특정하지 않았다.

엔지니어의 눈으로 보면 이 글은 모델 품질 경쟁의 언어가 아니라 시스템 설계의 언어로 쓰였다. 권한 판정과 기록, 정지 스위치를 모델 밖에 두라는 요구는 에이전트를 만드는 팀에게 구체적인 질문이 된다. 도구 호출을 허가하는 계층이 모델과 같은 프로세스 안에 있는지, 행동 기록을 모델이 아닌 시스템이 남기는지, 작업 중간에 사람이 끊을 수 있는 경로가 실제로 시험돼 있는지다. 나델라는 글을 이렇게 맺었다. "가장 신뢰할 만한 초지능 시스템은 우리가 가장 신뢰하는 모델을 가진 시스템이 아니라, 모델을 가장 덜 신뢰해도 되게 해 주는 시스템이다."

김현국

METAL 발행인 · 아카이브저널 발행인 · 이라선 운영

매거진·서점·교육을 오래 해 온 편집자예요. 라이프스타일 매거진 <아카이브저널>을 발행하고, 아트 서점 <이라선>을 운영했으며, 라이카 아카데미에서 디렉터로 사진 교육 프로그램을 만들고 이끌었어요. 그 시선으로 전 세계 AI 소식을 독자에게 전하는 메탈(METAL) 매거진 편집장입니다.

이 에디터의 기사 더 보기 →

공유

댓글