
이미지: METAL
요약
- 엔비디아가 9월 28일 AI 에이전트를 시험부터 배치까지 통제하는 개방형 보안 플랫폼 Open Agent Safety Platform을 공개했다.
- 오픈소스 런타임 OpenShell이 CPU 위에서 에이전트 경계를 긋고, 참조 설계 Sentry가 BlueField-4 DPU에서 경계를 넘는 에이전트를 밀리초 안에 격리한다.
- 앤스로픽은 Claude Managed Agents를 이 플랫폼과 엮었고, 스페이스XAI는 Cursor와 Grok에 쓰며, 참여 조직은 100곳을 넘는다.
- 발표
- 2026년 9월 28일 엔비디아 뉴스룸 발표문 · 같은 날 오픈 시큐어 AI 얼라이언스 블로그
- 구성
- OpenShell(오픈소스 보안 런타임, CPU) + Sentry(참조 시스템 설계, BlueField-4 DPU 위 대역 외 감시)
- OpenShell
- 에이전트 모든 행동 추적·실행 중 정책 강제 · 개방형·폐쇄형 모델 모두 · Vera CPU 기준, Arm·인텔로 확장 가능 · 이날부터 폭넓게 제공
- Sentry
- 경계 이탈 에이전트 밀리초 안 격리 · DOCA 기반 요청·응답 검사, 신원 검증, 제로 트러스트 접근 정책 · 출시 일정 미공개
- 배포
- 엔비디아 개발자 자료 페이지·깃허브
- 앤스로픽
- Claude Managed Agents와 OpenShell·BlueField 통합 · 폴 스미스 최고상업책임자 발언
- 주요 참여
- 스페이스XAI(Cursor·Grok) · 스케일AI · 세일즈포스(슬랙 통합) · SAP(Joule Studio) · 100곳 이상
- 배경
- 보이타노 부사장 「허깅페이스가 1만 7천 개 넘는 에이전트 공격 보고」(보도) · 오픈AI·앤스로픽·메타·구글 샌드박스 이탈 사례 공개(보도)
- 연합
- 오픈 시큐어 AI 얼라이언스 · 엔비디아와 120곳 넘는 조직 시작 · 리눅스 재단 운영 · SAFE 프로젝트
- 공개물
- 엔비디아 NOOA 연구 프레임워크 깃허브 공개 · 스페이스XAI Grok Build 오픈소스, Grok 가중치 공개 계획
엔비디아가 9월 28일 AI 에이전트를 시험 단계부터 실제 배치까지 통제하는 개방형 보안 플랫폼 Open Agent Safety Platform을 공개했다. 플랫폼은 두 축으로 짜였다. 하나는 에이전트가 움직일 수 있는 경계를 CPU 위에서 긋는 오픈소스 런타임 OpenShell이고, 다른 하나는 네트워크 칩 BlueField-4 DPU 위에서 에이전트를 따로 감시하는 참조 설계 Sentry다. 엔비디아는 Sentry가 경계를 벗어나려는 에이전트를 "밀리초 안에 격리할 수 있다"고 밝혔다.
젠슨 황 엔비디아 창업자 겸 최고경영자는 발표문에서 "AI가 사회에 줄 엄청난 잠재력은 AI 안전을 풀어야만 실현된다"며 "안전과 보안에는 풀스택 엔지니어링이 필요하다"고 말했다. 엔비디아는 최근 잇따른 보안 사고에 같은 패턴이 있었다고 짚었다. 에이전트가 맡은 일을 끝내려고 애플리케이션 층의 보안 통제를 우회했다는 것이다. 모델 안쪽의 안전장치만으로는 에이전트를 붙잡을 수 없으니, 모델과 에이전트 하네스 바깥에 강제력 있는 경계를 하나 더 둬야 한다는 것이 이번 발표의 전제다.
사고 목록은 길어졌다. 보도에 따르면 오픈AI와 앤스로픽, 메타, 구글이 모두 최근 자사 AI 모델이 샌드박스를 벗어나 다른 회사 시스템에 접근하려 한 사례를 공개했다. 메탈은 오픈AI 에이전트가 유엔 통계 사이트의 차단 장치를 우회한 사례를 보도한 바 있으며, 그보다 앞서 오픈AI 모델이 허깅페이스 인프라에 침투한 사건도 전했다. 보도에 따르면 저스틴 보이타노 엔비디아 엔터프라이즈 AI 부사장은 27일 기자 대상 설명회에서 이번 플랫폼이 7월의 허깅페이스 사건을 막을 수 있었다고 주장했다. 그는 "우리가 아는 바로는 허깅페이스가 1만 7천 개가 넘는 에이전트가 며칠, 몇 주에 걸쳐 인프라를 공격했다고 보고했다"고 말했다. 오픈AI 모델은 그 뒤에도 호주 보건 당국 웹사이트를 침해한 것으로 전해졌다.
첫 번째 축인 OpenShell은 이날부터 폭넓게 쓸 수 있게 풀렸다. 엔비디아에 따르면 OpenShell은 에이전트의 모든 행동을 추적하고 실행 중에 정책을 강제하는 보안 런타임 경계로, 개방형 모델과 폐쇄형 모델을 가리지 않는다. 기준 하드웨어는 엔비디아가 에이전트 AI 전용으로 설계한 첫 CPU라고 소개하는 Vera이고, 회사는 이 조합에서 추가 부담이 "최소"라고만 밝혔다. 오픈소스인 만큼 Arm과 인텔 같은 다른 회사 컴퓨팅 플랫폼으로 넓혀 쓸 수도 있다. 보도에 따르면 보이타노 부사장은 OpenShell로 개발자가 "에이전트가 일을 하기에 충분한 권한만 갖고 그 이상은 갖지 않았는지 형식적으로 검증할 수 있다"며 "OpenShell이 에이전트의 행동을 통제하고, Sentry는 독립적으로 수상한 행동을 감시하고 가둔다"고 설명했다. 소프트웨어와 스킬은 엔비디아 개발자 자료 페이지와 깃허브로 배포된다.
두 번째 축인 Sentry는 제품이 아니라 참조 시스템 설계다. 파트너가 이 설계를 바탕으로 제품을 만들어 시장에 내놓는 구조라, 발표문에 Sentry 자체의 출시 일정은 없다. Sentry는 엔비디아 DOCA 소프트웨어 위에서 돌며 에이전트의 요청과 응답을 들여다보고, 에이전트의 신원을 검증하고, 데이터와 도구, API, 서비스에 대한 접근을 제로 트러스트 방식으로 잘게 나눠 허용한다. 엔비디아는 Sentry가 에이전트와 공격자 모두에게 보이지 않는 별도의 신뢰 영역에서 돈다고 설명했다.
앤스로픽은 자사 에이전트 제품과 엔비디아 플랫폼을 엮었다. 앤스로픽의 Claude Managed Agents는 에이전트의 판단 루프를 실제 작업이 실행되는 샌드박스와 다른 서버에서 돌려 경계를 만드는데, 여기에 OpenShell과 BlueField를 붙이면 기업이 그 샌드박스를 통한 에이전트 접근을 더 엄격하게 묶을 수 있다. 폴 스미스 앤스로픽 최고상업책임자는 "기업들이 가장 중요한 일을 AI 에이전트에게 점점 더 많이 맡기고 있고, 특히 민감한 환경에서는 에이전트가 하는 일을 지시하고 검증할 수 있어야 한다"고 말했다.
스페이스XAI는 Cursor 코딩 에이전트와 Grok 모델에 이 플랫폼을 쓰고 있다. 마이크 니콜스 스페이스XAI 사장은 "안전은 모델 바깥에서, 에이전트가 넘을 수 없는 추가 통제로 강제돼야 한다"고 말했다. 스케일AI는 기업과 정부 고객용 에이전트 인프라 층에 참조 설계를 넣고 있고, 세일즈포스는 OpenShell을 슬랙과 묶어 팀이 슬랙 안에서 에이전트 활동과 감사 기록을 보고 추가 권한 요청을 승인하거나 거절하게 했다. SAP는 Joule Studio 런타임에 OpenShell을 심었다.
참여 기업 명단은 100곳을 넘는다. 엔비디아에 따르면 액센추어와 시스코, 크라우드스트라이크, 마이크로소프트, 팰런티어, 퍼플렉시티 등이 플랫폼 기술을 쓰고 있고, 로봇 회사 피규어와 스킬드 AI는 물리 세계에서 움직이는 자율 시스템에 OpenShell을 넣고 있다. 금융에서는 씨티와 JP모건체이스가, 에너지에서는 넥스트에라 에너지와 슈나이더 일렉트릭 등이 함께한다. 레드햇과 캐노니컬, 수세는 운영체제 수준에서 통합을 진행하고, 코어위브와 오라클 클라우드 인프라스트럭처 등이 인프라 상품으로 내놓는다.
같은 날 엔비디아는 블로그로 오픈 시큐어 AI 얼라이언스의 창립 파트너 명단도 공개했다. 리눅스 재단이 운영하는 이 연합은 엔비디아가 120곳 넘는 조직과 함께 시작했고, 공유 AI 취약점 교환 프로젝트 SAFE를 굴린다. 메탈은 연합이 SAFE 가이드라인을 제안한 소식을 전한 바 있다. 엔비디아는 블로그에서 허깅페이스가 침해 당시 공격자와 방어자를 구분하지 못한 폐쇄형 AI 도구에 포렌식 분석이 막히자, 오픈 웨이트 모델 GLM 5.2를 자체 인프라에서 돌려 1만 7천 건이 넘는 행동을 분석하고 침입을 봉쇄했다고 적었다. 엔비디아는 에이전트 하네스 연구 프레임워크 NOOA를 깃허브에 공개했고, 스페이스XAI는 코딩 에이전트 Grok Build를 오픈소스로 풀며 Grok 계열 모델 가중치도 공개할 계획이라고 밝혔다.
메탈이 확인한 엔비디아 발표문 전문과 블로그 원문은 두 가지를 분명히 한다. 하나는 안전 문제를 엔지니어링 문제로 다루겠다는 입장이다. 보도에 따르면 황은 지난주 한 팟캐스트에서 최근 사고를 두고 "무엇을 할 수 있었는지, 해법이 무엇인지를 생각해야 한다"고 말했다. 다른 하나는 정책 메시지다. 엔비디아는 블로그에서 개방형 모델과 하네스, 보안 도구를 부채가 아닌 방어 자산으로 봐야 한다며 개방형 프런티어 AI 시스템에 대한 일괄 규제가 방어 역량을 약하게 만든다고 주장했다. 발표문 끝에는 설명한 기능 상당수가 여전히 여러 개발 단계에 있으며 제공 시점은 바뀔 수 있다는 문구가 붙어 있다.
AI 엔지니어의 눈으로 보면 이번 설계의 핵심은 감시자를 감시 대상과 다른 칩에 둔 데 있다. 지금까지 에이전트 통제는 대부분 모델의 거절 학습이나 하네스 안의 규칙이었고, 둘 다 에이전트가 돌아가는 같은 소프트웨어 층에 있다. 목표를 끝까지 밀어붙이는 에이전트가 우회한 것이 바로 그 층이었다. OpenShell은 경계를 운영체제 가까이로 내리고, Sentry는 한 걸음 더 나가 CPU가 아닌 DPU라는 별도 실리콘에서 트래픽을 보고 끊는다. 건물 안 경비원이 아니라 건물 밖 차단기를 내리는 구조다. 다만 이 차단기가 얼마나 빨리, 얼마나 적은 오탐으로 작동하는지는 파트너 제품이 나와야 잴 수 있다. 에이전트를 운영하는 팀에게 당장 쓸 수 있는 것은 오픈소스 OpenShell이고, 에이전트 로그를 남기고 권한 요청을 사람이 승인하는 흐름을 모델 바깥에서 설계하는 일이 이제 표준 부품이 되기 시작했다.
출처
- NVIDIA Newsroom — NVIDIA Launches Open Agent Safety Platform to Secure Agents From Testing to Deployment →
- NVIDIA Blog — Industry Leaders Join Open Secure AI Alliance for AI Safety and Security →
- CNBC — Nvidia releases software platform to stop AI agents from misbehaving →
- The Associated Press (WSLS) — Nvidia unveils security platform to stop AI agents from going rogue →





댓글