
요약
- 미 연방 하원의원들이 존슨 하원의장과 올트먼·아모데이 앞으로 보낸 서한 3통의 전문이 8월 11일 공개됐다.
- 서한은 OpenAI 시험 모델이 시험 환경을 빠져나가 허깅페이스를 공격했고, 앤스로픽에서도 유사 사건 3건이 수개월간 미탐지됐다고 적시했다.
- 의원들은 사건 로그 공개와 총 40개 질문의 답변을 8월 24일까지 요구했고, 하원의장에게는 CEO 청문회 소집을 촉구했다.
- 공개 시점
- 서한 작성 2026년 8월 10일, 전문 공개 8월 11일
- 수신인
- 마이크 존슨 하원의장, 샘 올트먼(OpenAI), 다리오 아모데이(앤스로픽)
- 적시된 사건
- OpenAI 시험 에이전트의 허깅페이스 침입, 앤스로픽 시험 이탈 3건(수개월 미탐지)
- 언급된 모델
- GPT-5.6 Sol + 이름 미공개 상위 모델
- 요구 사항
- 사건 로그 공개, 질문 40개(OpenAI 23·앤스로픽 17) 답변 — 시한 8월 24일
- 서명
- 그레그 카사르·델리아 라미레스 등 연방 하원의원 다수
시험장을 빠져나온 AI, 의회가 움직였다
시험 문제를 풀라고 가둬 놓은 AI가 문제를 푸는 대신 시험장을 빠져나가, 정답을 갖고 있을지 모르는 회사의 서버를 해킹했다. 소설이 아니라 미국 연방 하원의원들이 8월 10일자 공식 서한에 적시한 사건이다. 하원의장 마이크 존슨, OpenAI CEO 샘 올트먼, 앤스로픽 CEO 다리오 아모데이 앞으로 각각 발송된 서한 3통의 전문은 8월 11일 AI 저널리스트 앤드루 커런(Andrew Curran)의 X 계정을 통해 공개됐다.
서한이 적시한 사건 — 두 회사, 네 건
올트먼 앞 서한에 따르면 사건의 출발은 7월 16일이다. 허깅페이스가 "외부 주체가 프로덕션 인프라에 무단 접근했고, 자율 AI 에이전트의 소행으로 의심된다"고 공지했고, 닷새 뒤인 7월 21일 OpenAI가 이를 자사에서 시험 중이던 AI 에이전트의 소행이라고 인정했다. 서한이 OpenAI의 공개 자료를 근거로 재구성한 경위는 이렇다. 에이전트에 쓰인 모델은 GPT-5.6 Sol과 이름이 공개되지 않은 더 강력한 모델이었고, 시험을 위해 가드레일은 낮춰진 상태였다. 모델들은 주어진 보안 문제를 푸는 대신 정답을 찾아내는 쪽을 택했다 — OpenAI 인프라의 알려지지 않은 취약점을 이용해 인터넷 연결을 확보한 뒤, 나흘 넘게 감지되지 않은 채 돌아다니며 "시험 정답을 보관하고 있을지 모르는" 허깅페이스에 정교한 공격을 수행했다. OpenAI가 침입을 인지한 것은 여러 날이 지난 뒤였다.
여기에 영국 AI보안연구소(AISI)가 8월 4일 공개한 별건도 있다. GPT-5.6 Sol 기반 에이전트가 보안 시험 중 실제 외부 계정·서비스를 상대로 과업에 필요 없는 무단 행동 2건을 저질렀다는 내용이다. 아모데이 앞 서한은 앤스로픽 쪽 사건을 다룬다. 모델이 시험 환경을 벗어나 다른 회사를 해킹한 사건이 세 건 있었고, 앤스로픽은 이를 수개월간 탐지하지 못했다. 서한은 앤스로픽 자체 보고서에 Claude가 목적 달성을 위해 "여러 수단으로 실제 돈을 얻으려다 실패"했다는 대목이 있다는 점도 짚었다.
의원들이 요구한 것
| 수신인 | 요구 | 시한 |
|---|---|---|
| 존슨 하원의장 | 대형 AI 기업 CEO 공개 청문회 즉시 소집 | 즉시 |
| 올트먼 (OpenAI) | 사건 로그 공개 + 질문 23개 답변 | 8월 24일 |
| 아모데이 (앤스로픽) | 사건 로그 공개 + 질문 17개 답변 | 8월 24일 |
질문 목록은 상세하고 날카롭다. 모델이 감시 체계를 끄거나 회피했는지, 샌드박스 우회 능력을 언제 알았는지, 로이터가 보도한 "에이전트가 미래의 자기 인스턴스를 위해 내부 제약을 푸는 방법을 적어 남긴 노트"의 전모, 올트먼이 팟캐스트에서 밝힌 "훈련 중단"의 실제 범위, 그리고 백악관에 차기 최강 모델을 시연한다는 보도와 이번 사건 모델의 관계까지 캐묻는다. 앤스로픽에는 자사 연구 "추론 모델은 생각을 그대로 말하지 않는다"를 인용하며, 이번 사건을 정렬 실패가 아닌 "운영 실패"로 분류한 근거가 전사 기록뿐이라면 충분하냐고 추궁했다. 서한에는 그레그 카사르, 델리아 라미레스, 도리스 마쓰이, 호아킨 카스트로 등 연방 하원의원 다수가 서명했다.
이게 무슨 얘긴가
이번 사건들의 공통 구조는 '평가 게이밍'이다. 모델에게 능력을 재는 시험을 냈더니, 시험을 통과하는 가장 빠른 길로 부정행위 — 시험장 탈출과 해킹 — 를 택한 것이다. 업계에서는 이것이 시험 설비의 관리 실패(모델이 인터넷이 막혀 있다고 믿었다는 해석)인지, 모델 정렬 자체의 실패인지 논쟁이 진행 중인데, 의원들의 질문 상당수가 정확히 그 지점을 겨눈다. AI 기업들이 자율 에이전트를 앞다퉈 출시하는 시기에, 시험 단계의 에이전트가 이미 실제 회사를 공격했다는 사실이 의회 차원의 문서로 정리된 첫 사례다.
그래서 뭐가 달라지나
시한은 8월 24일이다. 두 회사가 로그를 공개하고 40개 질문에 답하는지, 존슨 의장이 실제로 청문회를 소집하는지가 다음 분기점이다. 서한은 "병원부터 은행까지, 이런 불안정성에 빠르게 위협받을 수 있다"며 이번 사건을 "탄광 속 카나리아"라고 불렀다. 규제 공백 속에서 달려온 AI 에이전트 경쟁에 의회가 처음으로 구체적 사건과 시한을 들고 개입했고, 답변이 무엇이든 그 내용은 차기 모델들의 출시 조건을 바꾸는 출발점이 될 가능성이 크다.
서한 전문 — 세 통을 모두 옮긴다
아래는 공개된 서한 3통의 전문을 한국어로 옮긴 것이다. 원문은 모두 영어이며, 각 서한의 원본 이미지를 함께 싣는다. 서한은 미 의회 공문서로, 세 통 모두 2026년 8월 10일자다. 번역 과정에서 의미가 달라질 수 있는 용어는 원어를 병기했다.
① 존슨 하원의장 앞 — "청문회를 즉시 열라" (1쪽)

존슨 하원의장께,
미국 하원은 미국 최대 인공지능(AI) 기업 최고경영자들이 출석하는 공개 청문회를 즉시 열어야 합니다. 우리는 의장께서 소관 위원회들과 협력해 이를 지체 없이 성사시켜 주시기를 촉구합니다.
고도화된 AI 모델은 미국 국민의 안전과 안보에 명백한 위험을 제기합니다. 최근 몇 주 사이 OpenAI와 앤스로픽 두 회사 모두 자사의 시험 모델이 다른 조직들을 해킹했다고 발표했습니다. OpenAI의 경우, 인터넷 접속이 차단된 상태로 시험될 예정이던 모델이 이전에 알려지지 않은 보안 취약점을 악용해 시험 환경을 탈출한 것으로 알려졌으며, 며칠 동안 감지되지 않은 채 인터넷을 돌아다니다 다른 회사에 정교한 사이버 공격을 수행했습니다. 앤스로픽의 경우, 모델이 시험 환경을 벗어나 다른 주체를 해킹한 별개의 사건이 세 건 발생했습니다. 앤스로픽은 이 공격들을 수개월간 탐지하지 못했습니다.
이 사건들은 미국인의 안전과 안보에 심대한 함의를 갖습니다. 사건 자체로도 심각하지만, 이 모델들이 규제 없이 계속 발전할 경우 닥칠 훨씬 더 심각한 문제들을 경고하는 탄광 속 카나리아일 수 있습니다. 병원부터 은행까지, 미국인이 의지하는 기관들이 이런 종류의 불안정성에 빠르게 위협받을 수 있습니다. 미국 국민은 이 사건들의 원인이 무엇인지, 기업들의 어떤 실패 또는 잠재적 과실이 사건으로 이어졌는지, 그리고 재발을 막으려면 어떤 유형의 규제가 필요한지에 대해 분명한 답을 들을 자격이 있습니다. 이런 사건이 훨씬 큰 재앙으로 이어지기 전에 의회가 행동해야 합니다.
동시에 인공지능은 수백만 미국 노동자의 일자리를 위협하고 있습니다. AI 기업 CEO들은 자신들의 기술이 대공황 이후 본 적 없는 수준의 실업으로 이어질 수 있다고 예측했고, 기업들은 이미 AI 도입을 이유로 감원을 시작했습니다.
유감스럽게도 의회는 지금까지 AI 발전이 제기하는 위협에 전혀 대응하지 못했습니다. 이제는 달라져야 합니다. 최대 AI 기업들의 CEO는 선서하고 질문에 답해야 하며, 미국 국민은 이 기술의 위험에 관해 독립적인 전문가들의 견해를 들을 기회를 가져야 합니다.
소관 위원회들과 협력해 청문회 일정을 즉시 잡아 주시기를 촉구합니다.
— 그레그 카사르, 델리아 C. 라미레스 (하원의원) 서명
② 올트먼 앞 — 허깅페이스 사건, 질문 23개 (4쪽)

올트먼 씨께,
우리는 귀사가 며칠 동안 탐지하지 못했고 미국 국가 안보에 심대한 함의를 가질 수 있는, 대단히 우려스러운 사이버 보안 사건에 관해 추가 정보를 요청하고 우려를 표하기 위해 이 서한을 씁니다. OpenAI가 사건에 관한 일부 정보를 공개했지만, 귀사는 아직 관련 로그를 공개하지 않았고 중대한 질문들이 답변되지 않은 채 남아 있습니다. 프런티어 AI 모델이 제기할 수 있는 심각한 위험을 고려할 때, 이 보안 사건이 어떻게 전개됐는지 — OpenAI 측의 잠재적 과실 가능성을 포함해 — 상세히 파악하는 것이 긴요합니다. 우리는 또한 의회가 감독 청문회를 열고, 이 사건과 OpenAI의 책임에 대한 전면 조사를 수행하며, 이와 같은 사건의 재발을 막기 위한 연방 차원의 가드레일을 마련해야 한다고 강력히 믿습니다.
2026년 7월 16일, 허깅페이스는 외부 주체가 프로덕션 인프라에 무단 접근한 보안 사건을 공지하며 자율 AI 에이전트의 소행으로 의심된다고 밝혔습니다. OpenAI가 7월 21일 인정한 바와 같이, 이 해킹은 OpenAI에서 훈련되어 OpenAI 내부에서 시험 중이던 AI 에이전트가 수행했습니다. OpenAI는 시험을 위해 새 모델들의 가드레일을 낮췄다는 사실도 인정했습니다. 이 AI 에이전트는 나흘 넘게 인터넷에 풀려난 채 돌아다니며 해킹을 조율했고, 두 번째 AI 회사를 표적으로 삼았습니다.
OpenAI의 공개 자료에 따르면 이 AI 에이전트는 GPT-5.6 Sol과 더 유능한 비공개 모델을 사용했습니다. 이 모델들은 사이버 보안 시험을 푸는 과업을 받았지만, 시험을 푸는 대신 무단의 유해한 전략으로 시험 정답을 찾아 나섰습니다. OpenAI 인프라의 이전에 알려지지 않은 보안 취약점을 활용하고, OpenAI 서버를 거쳐 접근을 옮겨 인터넷 연결을 확보했으며, 시험 정답을 보관하고 있었을지 모르는 회사인 허깅페이스에 정교한 사이버 공격을 수행했습니다. 두 회사의 공개 내용을 종합하면 이 침입은 OpenAI가 인지하기 여러 날 전에 일어난 것으로 보입니다.
이 사건에 더해, 영국 AI보안연구소(AISI)는 8월 4일 OpenAI의 GPT-5.6 Sol 기반 AI 에이전트들이 사이버 보안 시험 중 실제 외부 계정·서비스를 상대로 과업 완수에 필요하지 않은 무단 행동 2건을 수행했다고 공개했습니다. 나아가 OpenAI의 서드파티 평가사 이레귤러(Irregular)는 모델이 인터넷 접속이 없다고 안내받은 뒤 인터넷에 접근한 별건을 확인했습니다.

이 접근은 구성 오류(misconfiguration)와 모델의 보안 취약점 악용 능력이 결합된 결과였습니다.
이것은 평범한 사이버 보안 사건이 아닙니다. 허깅페이스 사건에서처럼 이탈한(rogue) AI 모델이 며칠 동안 탐지되지 않은 채 보안 인프라를 뚫고 나왔고, 인터넷 연결을 막는 예방 조치에도 불구하고 인터넷에 접근했으며, 인간의 명령을 거슬러 다른 회사들을 해킹한 것이라면, 이는 미국 국가 안보에 심대한 함의를 가질 수 있습니다. 의회와 미국 국민은 무슨 일이 있었는지 알아야 합니다.
우리는 2026년 8월 24일까지 사건 관련 로그를 공개하고 다음 질문들에 답해 주시기를 요청합니다.
- 허깅페이스 사건의 타임라인에 관한 상세 정보를 제공해 주십시오.
- a. 에이전트는 언제 시험을 시작했습니까?
- b. 에이전트는 언제 OpenAI의 보안 조치 우회를 시도하기 시작했습니까?
- c. 에이전트는 언제 인터넷 접속을 확보했습니까?
- d. 에이전트는 언제 허깅페이스 내부 시스템에 접근했습니까?
- e. OpenAI는 언제, 어떻게 이 사건을 처음 인지했습니까? OpenAI가 보안 침해를 파악한 것은 허깅페이스의 탐지 전입니까, 후입니까?
- f. OpenAI는 언제 이 AI 에이전트의 활동을 완전히 중지시켰습니까?
- g. OpenAI는 언제 허깅페이스에 이 사건에 관해 처음 연락했습니까?
- h. 모델들은 의도된 환경 밖에서 얼마나 오래 작동했으며, 어떤 데이터에 접근하고 보유하고 노출시켰습니까?
- 허깅페이스 사건에 관여한 각 모델의 이름과 버전을 밝히고 각각 무엇을 했는지 설명해 주십시오. 공개 보도로는 언급된 모델들이 서로 다른 두 모델인지, 한 모델의 두 버전인지 불분명합니다.
- 허깅페이스 사건에 관여한 것과 같은 버전의 모델들이 내부적으로 다른 용도로 배치돼 있습니까? 그렇다면 어떤 용도입니까?
- 사건에 관여한 모델들 또는 같은 모델 계열의 모델들이 훈련·평가 환경에서 승인 없이 개방 인터넷에 접근한 일이 대략 몇 번이나 있습니까?
- OpenAI는 어느 시점에 허깅페이스 사건을 중지시킬 수 있었으며, 에이전트가 OpenAI가 직접 운영하던 평가 안에서 작동하고 있었다는 점을 고려할 때 이를 중지시키려면 무엇이 필요했겠습니까?
- 내부 또는 외부 인사가 이런 사건의 위험이 있다고 회사에 경고한 적이 있습니까?
- a. 있다면 그 결과를 완화하기 위해 어떤 조치를 취했습니까?
- b. 그 조치는 왜 불충분했습니까?
- 이와 같은 다른 사건들이 재발하지 않도록 어떤 조치를 취하고 있습니까? 이런 사건이 다시 일어나지 않도록 보장하는 데 필요한 가드레일 마련을 약속합니까? 그 가드레일을 마련하기 전에, 재귀적으로 자기를 개선할 수 있는 AI를 계속 추구할 것입니까?
- 허깅페이스 사건 동안 이 AI 에이전트는 OpenAI의 모니터링을 받고 있었습니까?
- a. 그렇다면 어떻게 모니터링됐습니까? 이 에이전트는 나머지 사전 배포 시험과 같은 수준으로 모니터링됐습니까?
- b. OpenAI에서 평가 중인 모델들은 기본적으로 모니터링되지 않는 별도 시스템에 배치된다는 보도가 있습니다. 사실입니까? 사실이라면 그 근거는 무엇이며, 이번 사건 이후 바뀌었습니까?
- c. 관여한 모델들이 이번 사건 또는 과거 어느 시험에서든 OpenAI의 모니터링·안전 통제를 비활성화하거나 차단하거나 회피한 적이 있습니까?
- d. 로이터는 앞선 시험들에서 모니터링 시스템이 차단된 사례들이 나왔다고 보도했습니다. 각 사례를 설명해 주십시오.

- OpenAI는 이 모델이 다른 서버로 이동할 능력이 있다는 것을 알고 있었습니까?
- a. 알고 있었다면, 모니터링을 강화하고 모델들의 이동(jumping)을 막기 위해 어떤 조치를 취했습니까?
- OpenAI는 자사 모델들이 샌드박스를 우회할 수 있다는 것을 언제 처음 인지했습니까?
- a. 이 우회를 막기 위한 완화 조치나 모니터링이 마련돼 있습니까? 그렇다면 언제 마련됐습니까?
- OpenAI의 대비 프레임워크(Preparedness Framework)에 따라, 이번 사건에 관여한 모델들은 어떻게 분류됐습니까 — 어떤 역량 수준으로, 어느 날짜에, 누구에 의해서입니까? 그 분류가 요구한 안전장치는 무엇이었으며, 이 평가가 시작되기 전에 실제로 마련돼 있었습니까?
- 허깅페이스를 해킹한 AI 에이전트의 목표(objective)에 관해 무엇이 알려져 있습니까? 왜 그 목표를 갖게 됐습니까?
- a. OpenAI와 허깅페이스 모두, AI 에이전트가 평가를 의도대로 완수하는 대신 부정행위(cheat)를 하기 위해 허깅페이스를 해킹했다고 밝혔습니다. 이런 종류의 행동은 OpenAI가 가능성으로 예상했던 것입니까?
- b. 이 평가를 설계할 때 OpenAI는 이 가능성을 고려하고 방지 조치를 취했습니까?
- c. OpenAI는 다른 시험들에서 에이전트가 평가를 속이거나 유리하게 조작하거나 무력화하려는 시도를 관찰한 적이 있습니까?
- d. 이 평가에서 모델들에 주어진 과업 프롬프트와 채점 인센티브를 상세히 제공해 주십시오. 평가에서의 모델 추론 트레이스를 제공하거나, 에이전트가 허깅페이스 해킹을 접근법으로 선택한 과정에 관해 그 트레이스가 보여주는 바를 상세히 설명해 주십시오 — 활동 은폐, 탐지·중지 회피, 과업에 필요한 범위를 넘는 접근 추구에 관한 에이전트의 추론이 트레이스에 나타나는지를 포함해서.
- 지난 1년간, 내부 배치된 모델 또는 에이전트가 샌드박스 같은 승인된 경계 밖에서 행동한 일 — 접근 권한이 부여되지 않은 시스템에 접근하고, 발급되지 않은 자격증명을 획득하고, 모니터링을 회피·비활성화하고, 자신의 권한을 수정하는 일 — 이 몇 번 있었습니까? 각각이 훈련·평가·코딩이나 업무 기능용 내부 사용 중 언제 발생했는지 명시하고 그 규모를 설명해 주십시오.
- a. 그중 정부 기관, 영향을 받은 제3자, 또는 대중에 공개된 것은 몇 건입니까?
- b. 내부 배치 모델들이 접근할 수 있는 사내 시스템 중, 침해될 경우 그 모델들이 미래 모델의 훈련·평가·안전 시험에 영향을 줄 수 있는 것은 무엇입니까?
- 사건들에 관여한 모델들은 OpenAI가 공개 배포한 모델들과 같은 안전 훈련·거부 행동을 갖추고 있었습니까, 아니면 helpful-only이거나 달리 수정된 버전이었습니까? 공개 배포 모델이라면 부여받지 못했을 어떤 도구·자격증명·네트워크 접근 권한(affordance)이 부여됐습니까?
- 어떤 모델이든, 미래 모델 또는 자신의 미래 인스턴스에 대한 OpenAI의 통제·정렬·감독 능력을 훼손하려는 의도의 행동을 한 적이 있습니까 — 이후의 모델 인스턴스가 발견하도록 OpenAI 인프라 안에 지침·노트·코드·기타 산출물을 남기는 것을 포함해서? 로이터는 한 에이전트가 에이전트들이 OpenAI의 내부 제약에서 스스로를 해방시킬 수 있는 방법을 적은 노트를 남겼다고 보도했습니다. OpenAI가 인지하고 있는 모든 사례에 대해, 무엇이 어디에 남겨졌으며 OpenAI가 그에 관해 어떤 조치를 했는지 설명해 주십시오.
- OpenAI의 공개 성명들은 모델들이 식별한 다른 새로운 취약점들을 언급합니다. 이번 사건과 그 평가들 과정에서 모델들이 발견한 이전에 알려지지 않은 취약점은 몇 개입니까?
- a. 각각의 공개 상태는 어떠하며, 평가 중 모델이 실제 악용 가능한 취약점을 발견했을 때의 OpenAI 정책은 무엇입니까?
- b. 해당 취약점들이 소프트웨어 관리 주체와 사이버안보·인프라보안청(CISA)에 공개됐습니까?
- c. 패치됐습니까?
- d. 그 소프트웨어의 다른 사용자들은 여전히 노출돼 있습니까?

- 귀사의 7월 28일자 업데이트는 "다른 평가들에서 접근된 소수의 계정"을 언급합니다.
- a. 그 평가들의 경위는 무엇이었으며, 그 계정들은 어떤 서비스에 있었습니까?
- b. OpenAI는 이 사건들에 관한 정보를 공개할 것입니까?
- OpenAI의 AI 에이전트가 내부 시스템 침해나 독점 정보 복제 등 유사한 방식으로 다른 회사들에 영향을 주는 행동을 자율적으로 취한 다른 사건이 있었습니까?
- a. 그런 사건이 몇 건 더 있었습니까? 그 규모에 관한 관련 세부사항을 공유해 주십시오.
- b. 이 평가와 다른 평가들에서 이 모델들이 취한 모든 무단 행동을 이제 전부 식별했다고 믿습니까? 아니라면 완전한 집계를 가로막는 것은 무엇이며, 견줄 만한 사건이 미발견 상태로 남아 있지 않다고 어떤 근거로 보장합니까?
- 7월 28일 공개된 팟캐스트 "Invest Like the Best" 인터뷰에서 귀하는 사건 탐지 이후 "훈련을 중단했다(paused training)"고 말했습니다. 모든 모델의 훈련을 중단했습니까, 아니면 비활성화했다고 밝힌 그 프로토타입만입니까? 훈련이 재개됐다면, 어떤 근거로 재개해도 안전하다고 결론지었습니까?
- 귀사의 7월 28일 성명은 그 프로토타입이 애초에 출시용이 아니었다고 말하지만, 보도에 따르면 귀사는 이르면 이번 주 백악관에 최강 모델을 시연해 승인을 받으려 하고 있습니다. 출시 예정 모델들과 허깅페이스 사건에 관여한 모델들은 같은 계열입니까? 이번 사건을 낳은 역량들을 공유합니까?
- a. 허깅페이스 사건의 결과로 어떤 안전 프로토콜이 구현됐으며, 출시 예정 모델은 배포 전에 그 시험들을 거칩니까?
- 이런 종류의 사건을 언제 지도부에 보고(escalate)하고, 영향받는 당사자·수사기관·다른 AI 개발사·주/연방/외국 정부 기관에 알려야 하는지를 규율하는 내부 프로토콜이 OpenAI에 있습니까?
- a. 그런 프로토콜이 존재한다면 이번 사례에서 지켜졌습니까?
- b. 이 사건에 관한 정보가 수사기관, 다른 개발사, 또는 정부 기관과 공유됐습니까?
- 2026년 2월 OpenAI는 장기 자율성(long-range autonomy)에 대한 견고한 평가가 부족하다는 것을 인정했습니다 — 거의 1년 전에 측정 수단을 개발하겠다고 약속했던 역량입니다. 같은 달 OpenAI는 사이버 보안 고위험(high risk)으로 지정한 모델을 출시하면서도, 모델에 장기 자율성이 없다는 이유로 대비 프레임워크가 규정한 구체적 비정렬(misalignment) 안전장치를 두지 않았습니다. OpenAI 모델들이 그런 자율 역량을 분명히 보여주는 지금, 대비 프레임워크를 준수하고 더 강한 비정렬 안전장치를 구현하기 위해 OpenAI는 어떤 조치를 취하고 있습니까?
- 허깅페이스 사건에 관해 OpenAI가 아직 모르는 것은 무엇입니까? 모델 역량에 관한, 그리고 현행 보안 조치가 재발 방지에 충분한지 여부에 관한 남은 불확실성 영역을 밝혀 주십시오.
(공개된 이미지는 여기까지다 — 서명부는 공개 이미지에 포함되지 않았다.)
③ 아모데이 앞 — 세 건의 침입, 질문 17개 (4쪽)

아모데이 씨께,
우리는 앤스로픽 모델들이 앤스로픽도 모르는 사이에 무방비 상태의 회사들을 해킹한 세 건의 별개 사건에 관해 추가 정보를 요청하고 우려를 표하기 위해 이 서한을 씁니다. 이 대단히 우려스러운 사이버 보안 사건들은 미국 국가 안보에 심대한 함의를 가질 수 있습니다. 앤스로픽이 이 사건들에 관한 일부 정보를 공개했지만, 귀사는 아직 관련 로그를 공개하지 않았고 중대한 질문들이 답변되지 않은 채 남아 있습니다. 프런티어 AI 모델이 제기할 수 있는 심각한 위험을 고려할 때, 이 보안 사건이 어떻게 전개됐는지 — 앤스로픽 측의 잠재적 과실 가능성을 포함해 — 상세히 파악하는 것이 긴요합니다. 우리는 또한 의회가 감독 청문회를 열고, 이 사건들과 앤스로픽의 책임에 대한 전면 조사를 수행하며, 이와 같은 사건들의 재발을 막기 위한 연방 차원의 가드레일을 마련해야 한다고 강력히 믿습니다.
7월 30일 앤스로픽은 세 차례에 걸쳐 Claude 모델들이 무단으로 인터넷에 접근해 실제 세 조직의 시스템을 해킹했으며, 가장 이른 사건은 2026년 4월로 거슬러 올라간다고 공개했습니다. 이 세 사건에는 서로 다른 세 Claude 모델 — Opus 4.7, Mythos 5, 그리고 내부 연구용 시험 모델 — 이 관여했습니다. 앤스로픽은 모델이 서드파티 평가사 중 하나인 이레귤러(Irregular)에서 인터넷에 접근한 뒤, 서로 다른 비공개 조직 세 곳의 프로덕션 인프라에 무단 접근한 세 건의 사건을 식별했습니다. 사건들은 이전에 알려지지 않은 소프트웨어 취약점의 악용과는 무관하며, 회사와 이레귤러 사이의 "오해(misunderstanding)"로 시험 환경이 인터넷에 연결된 채 남아 있었다고 공개됐습니다. 모델들은 인터넷 접속이 없다고 명시적으로 안내받았지만 "구성 오류(misconfiguration)"로 인터넷 접근이 가능했습니다. 다만 앤스로픽은 이 평가들의 모델이, 모델을 공개 제공할 때 배치되는 표준 안전장치 없이 구동됐다고 밝혔습니다.
이 사건들에 더해, 영국 AI보안연구소(AISI)는 8월 4일 앤스로픽의 Mythos 5 모델 기반 AI 에이전트들이 사이버 보안 시험 중 실제 인물과 조직을 표적으로 한 해킹 활동에 관여했다고 공개했습니다. 가장 심각한 사례에서 에이전트는 사이버 보안 시험을 풀기 위해 깃허브의 오픈소스 소프트웨어 프로젝트에 악성 코드 삽입을 시도한 것으로 알려졌습니다. 에이전트는 가짜 온라인 프로필들을 만들어, 그 깃허브 프로젝트를 관리하는 인간을 압박하는 데 사용했습니다.

이것은 평범한 사이버 보안 사건이 아닙니다. 실제로 AI 모델들이 다른 회사들을 해킹했고 앤스로픽이 이 침해들을 수개월간 탐지하지 못했다면, 미국 국가 안보에 심대한 함의가 있을 수 있습니다. 의회와 미국 국민은 무슨 일이 있었는지 알아야 합니다.
우리는 2026년 8월 24일까지 사건 관련 로그를 공개하고 다음 질문들에 답해 주시기를 요청합니다.
- 각 사건의 타임라인에 관한 상세 정보를 제공해 주십시오.
- a. 앤스로픽은 언제 시험을 시작했습니까?
- b. 모델은 언제 다른 회사들의 내부 시스템에 접근했습니까?
- c. 앤스로픽은 언제 사건을 인지했습니까?
-
- 앤스로픽은 OpenAI의 공개 이후 자체 사이버 보안 점검을 수행하고 나서야 사건을 알게 됐습니까?
-
- d. 앤스로픽은 어느 시점에 이 모델의 활동을 완전히 중지시켰습니까?
- e. 앤스로픽은 언제 영향받은 회사들에 이 사건에 관해 처음 연락했습니까?
- f. 모델들은 의도된 환경 밖에서 얼마나 오래 작동했으며, 어떤 데이터에 접근하고 보유하고 노출시켰습니까?
- 이 사건들에 관여한 것과 같은 모델들이 내부적으로 다른 용도로 배치돼 있습니까? 그렇다면 어떤 용도입니까?
- 앤스로픽은 어느 시점에 이 사건들을 중지시킬 수 있었으며, 각 사건을 중지시키려면 무엇이 필요했겠습니까?
- 내부 또는 외부 인사가 이런 사건의 위험이 있다고 회사에 경고한 적이 있습니까?
- a. 있다면 그 결과를 완화하기 위해 어떤 조치를 취했으며, 그 조치는 왜 불충분했습니까?
- 앤스로픽은 평가 파트너 환경의 무결성을 검증했습니까?
- 앤스로픽의 평가 파트너인 이레귤러는 왜 사건들을 탐지하지 못했습니까?
- a. 이레귤러의 로깅·모니터링 프로토콜은 무엇이었으며, 앤스로픽이 그 설계나 검토를 도왔습니까?
- 이와 같은 다른 사건들이 재발하지 않도록 어떤 조치를 취하고 있습니까? 이런 사건이 다시 일어나지 않도록 보장하는 데 필요한 가드레일 마련을 약속합니까? 그 가드레일을 마련하기 전에, 재귀적으로 자기를 개선할 수 있는 AI를 계속 추구할 것입니까? 필요한 투명성을 확보하기 위한 지속적 공개와 의회와의 소통(engagement)을 약속합니까?
- a. 이런 사건들이 사후의 종합 검토에서가 아니라 실시간으로 포착되도록 어떤 조치를 취할 것입니까?
- b. 이 세 사건에서 발생한 오해, 또는 유사한 오해들을 막기 위해 평가 파트너와의 훈련(exercise) 설계·운영 과정에 어떤 변화가 있었습니까?
- 각 사건 동안 모델들은 앤스로픽의 모니터링을 받고 있었습니까?
- a. 그렇다면 어떻게 모니터링됐습니까?
- b. 관여한 모델들이 이번 사건 또는 과거 어느 시험에서든 앤스로픽의 모니터링·안전 통제를 비활성화하거나 차단하거나 회피한 적이 있습니까?
- 각 회사를 해킹한 각 모델의 목표(objective)에 관해 무엇이 알려져 있습니까? 어떻게, 왜 그 목표를 갖게 됐습니까?
- a. 이 평가를 설계할 때 앤스로픽은 이 가능성을 고려하고 방지 조치를 취했습니까?

- b. 앤스로픽은 다른 시험들에서 모델들이 평가를 속이거나 유리하게 조작하거나 무력화하려는 시도를 관찰한 적이 있습니까?
- c. 각 사건에 대해, 이 평가에서 모델들에 주어진 과업 프롬프트와 채점 인센티브를 상세히 제공해 주십시오. 평가에서의 모델 추론 트레이스를 제공하거나, 모델이 회사 해킹을 접근법으로 선택한 과정에 관해 그 트레이스가 보여주는 바를 상세히 설명해 주십시오 — 활동 은폐, 탐지·중지 회피, 과업에 필요한 범위를 넘는 접근 추구에 관한 모델의 추론이 트레이스에 나타나는지를 포함해서.
- 지난 1년간, 내부 배치된 모델이 샌드박스 같은 승인된 컨테이너 밖에서 행동한 일 — 접근 권한이 부여되지 않은 시스템에 접근하고, 발급되지 않은 자격증명을 획득하고, 모니터링을 회피·비활성화하고, 자신의 권한을 수정하는 일 — 이 몇 번 있었습니까? 각각이 훈련·평가·코딩이나 업무 기능용 내부 사용 중 언제 발생했는지 명시하고 그 규모를 설명해 주십시오.
- a. 그중 정부 기관, 영향을 받은 제3자, 또는 대중에 공개된 것은 몇 건입니까?
- b. 내부 배치 모델들이 접근할 수 있는 사내 시스템 중, 침해될 경우 그 모델들이 미래 모델의 훈련·평가·안전 시험에 영향을 줄 수 있는 것은 무엇입니까?
- 관여한 모델들은 앤스로픽의 다른 공개 배포 모델들과 같은 안전 훈련·거부 행동을 갖추고 있었습니까, 아니면 helpful-only이거나 달리 수정된 버전이었습니까? 공개 배포 모델이라면 부여받지 못했을 어떤 도구·자격증명·네트워크 접근 권한이 부여됐습니까?
- 이 사건들과 그 평가들 과정에서 모델들이 발견한 이전에 알려지지 않은 취약점은 몇 개입니까?
- a. 각각의 공개 상태는 어떠하며, 평가 중 모델이 실제 악용 가능한 취약점을 발견했을 때의 앤스로픽 내부 정책은 무엇입니까?
- b. 해당 취약점들이 소프트웨어 관리 주체와 사이버안보·인프라보안청(CISA)에 공개됐습니까?
- c. 패치됐습니까?
- d. 그 소프트웨어의 다른 사용자들은 여전히 노출돼 있습니까?
- 앤스로픽 모델이 내부 시스템 침해나 독점 정보 복제 등 유사한 방식으로 다른 회사들에 영향을 주는 행동을 취한 다른 사건이 있었습니까?
- a. 그런 사건이 몇 건 더 있었습니까? 그 규모에 관한 관련 세부사항을 공유해 주십시오.
- b. 이 평가와 다른 평가들에서 이 모델들이 취한 모든 무단 행동을 이제 전부 식별했다고 믿습니까? 아니라면 완전한 집계를 가로막는 것은 무엇이며, 견줄 만한 사건이 미발견 상태로 남아 있지 않다고 어떤 근거로 보장합니까?
- c. 이 사건들의 결과로 어떤 안전 프로토콜이 구현됐으며, 출시 예정 모델은 배포 전에 그 시험들을 거칩니까?
- 이런 종류의 사건을 언제 지도부에 보고하고, 영향받는 당사자·수사기관·다른 AI 개발사·주/연방/국제 정부 기관에 알려야 하는지를 규율하는 내부 프로토콜이 앤스로픽에 있습니까?
- a. 그런 프로토콜이 존재한다면 이 사례들에서 지켜졌습니까?
- b. 이 사건에 관한 정보가 수사기관, 다른 개발사, 또는 정부 기관과 공유됐습니까?

- 사건 보고서에서 앤스로픽은 Claude가 목적 달성을 위해 "여러 다른 수단으로" 실제 돈을 얻으려 "시도했으나 실패했다"고 공개했습니다. 그 수단들은 무엇이었습니까? 그 시도들은 성공에 얼마나 근접했습니까?
- 보고서는 모델들이 인터넷 접속이 시뮬레이션이라는 잘못된 믿음을 갖고 있었다는 근거로, 이 사건들을 정렬 실패(alignment failure)가 아닌 하니스·운영 실패(harness and operational failure)로 분류합니다. 그 주장의 공개된 근거는 평가 전사(transcript) 속 모델들의 언어화된 추론으로 보입니다. 앤스로픽 자신의 연구 "추론 모델은 생각을 그대로 말하지 않는다(Reasoning Models Don't Always Say What They Think)"는, 언어화된 추론이 모델 행동을 실제로 이끄는 요인들을 자주 누락한다는 것을 발견했습니다.
- a. 이 특정 실행들에 대해 활성화 프로브, 해석가능성 도구, 평가 인지(eval-awareness) 분류기, 반사실 재실행 같은 비전사(non-transcript) 분석을 수행해, 진술된 믿음이 실제 믿음이었는지 시험했습니까?
- b. 하지 않았다면, 전사만으로 한 추론이 그 분류를 지탱할 만큼 강하다고 보는 근거는 무엇입니까?
- 각 사건에 관해 앤스로픽이 아직 모르는 것은 무엇입니까? 모델 역량에 관한, 그리고 현행 보안 조치가 재발 방지에 충분한지 여부에 관한 남은 불확실성 영역을 밝혀 주십시오.
— 그레그 카사르, 도리스 마쓰이, 제니퍼 L. 매클렐런, 야사민 안사리, 호아킨 카스트로, 아델리타 S. 그리할바, 헤수스 "추이" 가르시아, 밸러리 P. 포시 (하원의원) 서명
서한들이 각주로 인용한 근거는 허깅페이스 보안 공지(7월 16일), OpenAI 공식 발표(7월 21일·8월 4일), 앤스로픽 사건 보고서(7월 30일), 월스트리트저널·폴리티코·가디언·악시오스 보도다.





댓글