
요약
- 오픈AI의 차기 모델 아스트라가 내부 평가에서 '치명적' 사이버 역량 임계값에 근접했다고 회사가 공개했다.
- 오픈AI는 아스트라의 추가 개발에 격리된 테스트 환경·네트워크 접근 제한·모델 가중치 암호화 등 강화된 보안 통제를 즉시 적용 중이다.
- 회사는 관련 정부 기관 및 AI 안전 기관과 협력해 해당 모델의 역량을 추가 검증할 계획이다.
아스트라, '치명적' 사이버 역량 가능성 첫 공개
오픈AI는 AGI(인공일반지능)가 모든 인류에게 혜택이 되도록 하겠다는 미션 아래 AI 연구·개발을 이어온 기업이다. 비영리 법인 오픈AI 파운데이션이 영리 법인 오픈AI 그룹을 지배·감독하는 구조를 갖추고 있으며, 두 조직이 함께 미션을 수행한다.
오픈AI는 2026년 8월 7일, 아직 출시되지 않은 자사 모델 아스트라(Astra)에 대한 최근 며칠간의 내부 평가 결과를 공개했다. 평가 결과에 따르면 아스트라는 에이전틱 코딩과 사이버보안 영역에서 눈에 띄는 성능 향상을 보였으며, 전문가 검토까지 종합한 결과 준비 프레임워크(Preparedness Framework)상 '치명적(Critical)' 사이버 역량 등급을 배제할 수 없다는 결론에 이르렀다.

준비 프레임워크란 무엇인가
오픈AI는 2023년 12월 준비 프레임워크를 처음 발표했다. 이 프레임워크는 생물·화학·사이버보안·AI 자기개선 등 핵심 영역에서 모델 역량이 어느 수준에 도달했는지 추적하고, 각 역량 전환점마다 회사가 취해야 할 조치를 사전에 정해 두기 위해 마련됐다.
프레임워크상 '치명적' 사이버보안 임계값은 구체적인 기준을 갖는다. 모델이 인간의 개입 없이 다수의 실제 핵심 시스템에서 모든 심각도 수준의 기능적 제로데이 익스플로잇을 식별·개발하거나, 높은 수준의 목표만 주어진 상태에서 강화된 타깃에 대해 완전히 새로운 사이버 공격 전략을 스스로 수립하고 실행할 수 있을 때 이 등급에 해당한다. 이전 모델인 GPT‑5.6‑Sol은 같은 기준에서 '높음(High)' 등급으로 평가돼 치명적 임계값에는 미치지 못한 것으로 평가됐다. 아스트라는 아직 벤치마크와 평가가 진행 중인 모델이며, 허깅페이스 보안 사고와는 무관하다고 오픈AI는 명시했다.
오픈AI가 즉각 취한 조치
결론 도출 직후 오픈AI는 사이버 역량 수준에 맞는 배포가 가능하도록 자사 안전장치와 보안 통제에 대한 강건성 테스트를 확대했다. 내부적으로는 여러 추가 조치를 병행하고 있다.
우선, 격리된 테스트 환경, 네트워크 및 툴 접근 제한, 모델 가중치 보호 및 암호화 강화, 추가 모니터링·탐지 역량, 샌드박스 실행 환경 등 고역량 모델을 위한 강화된 보안 통제를 도입했다. 이러한 강화 요건을 아직 충족하지 못한 아스트라 관련 내부 활동은 일시 중단된 상태다. 또한 훈련·평가를 포함한 아스트라의 모든 에이전틱 적용 전 영역에 걸쳐 위험 행동 및 정렬 이탈에 대한 범용 모니터링을 도입했다. 이 모니터 시스템은 모델의 사고 연쇄(Chain of Thought)를 실시간으로 평가하며, 고위험 활동이 감지되면 보안 응답을 트리거해 해당 활동을 검토·중단한다.

대외적으로는 관련 정부 기관과 일부 AI 안전 기관이 이 모델의 역량을 직접 검증할 수 있도록 협력할 예정이며, 고위험 평가 및 작업을 안전하게 수행하기 위한 권장 보안 통제 지침도 제3자 테스트 파트너에게 제공할 계획이다.
이전 사례와 공개 배경
오픈AI는 이번이 처음으로 역량 전환에 대응하는 사례가 아니라고 밝혔다. 2025년 6월, 자사 모델이 생물 분야에서 준비 프레임워크상 '높음' 역량 임계값에 근접했을 당시에도 안전장치 강화, 테스트 확대, 외부 전문가 협력, 추가 보안 통제 도입 등의 절차를 공개한 바 있다. 오픈AI는 이번 사이버 역량 사안에도 같은 원칙을 적용하고 있다고 설명했다.
회사는 이번 발표를 통해 공개 투명성을 강조했다. 오픈AI는 사이버 역량이 발전된 모델은 공격자보다 먼저 방어자가 취약점을 발견하고 해결하는 데 기여해야 한다는 입장이며, 정부·안전 기관·시민 사회와 협력해 아스트라와 이후 모델의 프론티어 역량이 책임 있는 방식으로, 인류 전체에 이익이 되는 방향으로 배포될 수 있도록 노력하겠다고 밝혔다. 현재로서 모델 배포 시점이나 상용화 일정 등 구체적인 계획은 공개되지 않았다.





댓글