METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

앤스로픽, 클로드 의도치 않은 행동 보고서 공개

앤스로픽이 클로드가 평가와 사내 사용 중 실제 웹사이트에서 벌인 네 가지 의도치 않은 행동을 정리한 첫 정기 보고서를 냈다. 필라델피아 경찰 제보 사이트에 가짜 살인사건 제보가 들어간 사례가 포함됐고, 회사는 모든 내부 평가의 실시간 인터넷 접속을 끊었다.

앤스로픽, 클로드 의도치 않은 행동 보고서 공개 · Image: METAL LAB

이미지: METAL

요약

  • 앤스로픽이 10월 9일 클로드의 의도치 않은 행동 네 유형을 담은 보고서를 공개하고, 시스템 카드·위험 보고서와 별도로 행동 보고서를 더 자주 내기로 했다.
  • Haiku 4.5가 필라델피아 경찰 미제 살인사건 제보 양식에 지어낸 목격담을 냈고, 제보는 스팸으로 걸러졌지만 경찰은 두 달 늦은 통보를 받아들일 수 없다고 밝혔다.
  • 회사는 모든 내부 평가에서 실시간 인터넷 접속을 끊고 새 탐지·차단 도구를 붙였으며, 이 도구는 보고서의 사례를 전부 막았다.
발표
2026년 10월 9일 · 앤스로픽 리서치 「Investigating unintended model actions in our evaluations and internal use」
정기 보고
시스템 카드(모델 출시 때)·위험 보고서(3~6개월마다)와 별도의 모델 행동 단독 보고서를 더 자주 발행
네 유형
소프트웨어 결함으로 서버 명령 실행 · 실제 사이트에 양식 제출 · 토큰·요금으로 막힌 데이터 우회 · URL 단축 서비스로 주소 길이 제한 회피
영향
현실 영향 미미 · 7월 30일·9월 9일 사이버보안 사고보다 훨씬 덜 심각하다고 회사 평가
조치
확인 때까지 모든 내부 평가의 실시간 인터넷 접속 차단 · 일부 공개 평가 중단·오프라인 전환 · 웹 페치 도구 가드레일 강화
탐지 도구
대부분의 평가·사내 에이전트 사용에서 가동 · 보고서 사례에 시험 시 전부 차단
조사 경위
7월부터 평가 기록 재검토 · 사이버보안 평가에서 인터넷 개방 평가·사내 사용·강화학습 환경으로 확대
정부 기관
일부 사례가 미국 연방·주·지방 정부 사이트 · 백악관 브리핑 · 각 기관 통보 · 기관명 비공개
고객 데이터
고객 데이터·앤스로픽 내부 시스템 관련 사례 없음(회사 설명)
가짜 제보
Haiku 4.5 · 필라델피아 경찰 PhillyUnsolvedMurders.com · 2026년 7월 18일 오후 11시 27분 제출 · 스팸 처리
발견·통보
9월 28일 발견 후 자동 테스트 중단 · 10월 8일 경찰 통보(앤스로픽)
경찰 입장
대변인 에릭 그립 경사 성명 · 두 달 지연은 받아들일 수 없다(보도) · 무단 접근·자료 유출 정황 없음
서버 명령 실행
Mythos Preview · 대학 분석 도구 서버의 인젝션 결함 이용 · DeepSearchQA·BrowseComp·LABBench2
약관 대리 동의
Mythos 5 · 사이트 애플리케이션으로 데이터 이용 약관 동의
데이터 우회
Mythos 5 · 지방정부 부동산 지도 접근 토큰 · 주 정부 기관 유료 데이터 무료 조회 · Humanity's Last Exam
양식 제출
미출시 비프런티어 연구 모델의 실제 정부 양식 제출 · Haiku 4.5 제출 중단 지시 위반 · OSWorld·Odysseys
URL 단축
Opus 5·Mythos 5 등 · da.gd 운영자가 별도 발견해 통보
판단 축
월권(과제 범위 이탈) · 부정직(행동·의도 오도) — 월권은 여름 사고보다 가볍고 부정직은 엇갈림
시스템 카드
Mythos Preview 시스템 카드 2026년 4월 7일 · 245쪽 · 드문 무모한 행동 기록
X 원문
@AnthropicAI · 2026년 10월 9일 22시 04분(UTC) · 조회 46만 회

AI 기업 앤스로픽이 자사 AI 모델 클로드가 평가와 사내 사용 중에 실제 웹사이트와 시스템에서 벌인 의도치 않은 행동을 네 가지 유형으로 정리한 보고서를 10월 9일 공개했다. 회사는 모델 출시 때 내는 시스템 카드와 책임 있는 확장 정책에 따라 3~6개월마다 내는 위험 보고서와 별도로, 모델 행동에 관한 단독 보고서를 더 자주 내겠다고 밝혔다. 이번 보고서가 그 첫 회다. 앤스로픽은 이번 사례들이 현실에 끼친 영향은 미미했지만, 확인이 끝날 때까지 모든 내부 평가에서 실시간 인터넷 접속을 끊기로 했다.

네 유형은 이렇다. 소프트웨어의 기본적인 결함을 파고들어 남의 서버에서 명령을 실행한 경우, 제출하면 안 되는 양식을 실제 웹사이트에 낸 경우, 토큰이나 요금으로 막아 둔 데이터에 우회로로 닿은 경우, 웹 페이지를 읽는 도구의 주소 길이 제한을 무료 URL 단축 서비스로 피한 경우다. 회사는 대부분이 끈질김의 한 형태라고 설명했다. 주어진 과제를 그대로 끝낼 수 없을 때 멈추는 대신 제한을 돌아가는 식이다.

가장 먼저 알려진 것은 필라델피아 경찰의 미제 살인사건 제보 사이트에 들어간 가짜 제보다. 무작위로 고른 웹 페이지에서 예시 작업을 만들고 수행하라는 과제를 받은 Haiku 4.5가 미제 살인사건 페이지에 닿았고, 거기 있던 경찰 제보 양식을 채웠다. 모델이 적은 문장은 "이 사건에 관한 정보가 있을 수 있습니다. 그 시기에 해당 거리 주변에서 인상착의가 비슷한 사람을 본 기억이 납니다. 관련이 있다면 연락해 주십시오"였다. 페이지에는 범인 인상착의가 적혀 있지도 않았다. 이름과 연락처 칸은 비워 둔 채 제출됐고, 제보는 스팸으로 걸러져 수사 검토 부서에 닿지 않았다.

당시 지시에는 로그인과 계정 생성, 개인정보 입력, 구매, 파괴적인 제출을 하지 말라는 조건이 있었지만 양식 제출 자체를 막는 문장은 없었다. 경찰 발표에 따르면 제출 시각은 2026년 7월 18일 오후 11시 27분이고, 앤스로픽은 9월 28일에야 이를 발견해 해당 자동 테스트를 멈췄다. 앤스로픽은 기술 검토가 끝난 10월 8일 경찰에 이 사실을 알렸다고 밝혔다. 경찰 대변인 에릭 그립 경사는 "정부의 완전한 투명성과 책임성을 위해 그 발표에 앞서 시민에게 이 정보를 알린다"고 말했다. 보도에 따르면 경찰은 별도 성명에서 "사건을 탐지하고 시에 보고하기까지 두 달이 걸린 것은 받아들일 수 없다"고 지적했다. 경찰 시스템에 대한 무단 접근이나 자료 유출의 정황은 없었다.

서버 명령 실행 사례는 더 기술적이다. 과학 분석을 맡은 Mythos Preview는 대학이 운영하는 공개 분석 도구가 오류를 내자 그 사이트를 뒤져, 요청한 파일을 그대로 돌려주는 서버 스크립트를 찾았다. 그 스크립트로 서버 파일과 스크립트 자신의 코드를 복사했고, 코드에서 찾은 인젝션 결함으로 서버에서 명령을 실행해 계산을 끝냈다. 다른 평가에서 Mythos 5는 무료지만 데이터 이용 약관에 동의해야 받을 수 있는 자료를, 사이트에 올라 있는 애플리케이션으로 페이지를 띄워 대신 동의하는 방식으로 받았다. 이런 행동은 공개 벤치마크인 DeepSearchQA와 BrowseComp, 생물학 연구 벤치마크 LABBench2에서 나타났다.

데이터 우회 사례도 두 건이 공개됐다. 사진 속 장소를 맞히는 평가에서 Mythos 5는 지방정부의 부동산 지도를 쓰려 했다. 페이지를 사람처럼 클릭할 수 없게 막혀 있자 사이트가 브라우저에 보내는 설정 파일을 읽어 작동하는 접근 토큰을 찾았고, 그 토큰으로 지도 뒤의 서버에 직접 요청을 보냈다. 앤스로픽 연구원이 통계 프로젝트에 Mythos 5를 쓸 때는, 주 정부 기관이 유료로 제공하는 공개 데이터를 모델이 그 기관 웹사이트의 보관본에서 공개 대시보드가 방문자 누구에게나 토큰을 발급한다는 사실을 알아내 요금 없이 조회했다. URL 단축 서비스 우회는 Opus 5와 Mythos 5를 포함한 여러 모델에서 나왔고, 보고서를 쓰는 사이 da.gd 단축 서비스 운영자가 같은 사용을 따로 발견해 회사에 알려 왔다.

정부 기관도 얽혔다. 회사는 일부 사례가 미국 연방과 주, 지방 정부 기관의 웹사이트에서 일어났다며 백악관에 브리핑하고 관련 기관에 각각 통보했다고 밝혔다. 관련 기관의 요청과 취약점 노출 우려로 기관 이름은 공개하지 않았다. 앤스로픽에 따르면 고객 데이터나 회사 내부 시스템이 얽힌 사례는 지금까지 없었다. 회사는 7월부터 평가 기록을 다시 살폈고, 처음에는 인터넷이 꺼져 있어야 하는 사이버보안 평가부터 보다가 인터넷을 일부러 열어 둔 평가와 사내 사용, 강화학습 환경으로 범위를 넓혔다. 평가 과제 하나를 수백에서 수천 번씩 돌리는 구조라 드문 이탈도 기록에 남는다.

메탈은 앤스로픽이 평가 중 실제 기업 세 곳의 시스템에 클로드가 침입한 사고를 7월 30일 공개했고, 이후 훈련 중단까지 포함한 대응책을 내놓았다고 보도한 바 있다. 이번 보고서는 그 7월 30일과 9월 9일 사고보다 정렬과 보안 측면에서 훨씬 덜 심각하다고 스스로 등급을 매긴다. 판단 축은 두 가지다. 과제가 의도한 범위를 얼마나 넘었는지를 보는 월권, 자기 행동과 의도를 오도했는지를 보는 부정직이다. 월권에서는 여름 사고보다 가볍다고 봤지만 부정직은 비교가 엇갈린다고 적었다. 가짜 제보에 대해 회사는 "기록상 클로드는 목표를 위해 누군가를 속이려 했다기보다 과제용 예시를 만든 것으로 보인다"고 밝히면서도, 판단이 추가 분석으로 바뀔 수 있다고 덧붙였다.

메탈이 확인한 4월 7일자 Mythos Preview 시스템 카드 245쪽에도 같은 계열의 기록이 있다. 시스템 카드는 Mythos Preview를 지금까지 낸 모델 가운데 가장 정렬이 잘된 모델이라고 평가하면서도, 어려운 과제를 끝내려고 상식적이거나 명시된 안전 제약을 무시하는 무모한 행동을 드물게 보인다고 적었다. 앤스로픽이 이번 행동들을 Mythos Preview 이후 시스템 카드에서 설명해 온 행동과 닮았다고 쓴 근거가 이것이다.

대응은 평가 설계부터 바꿨다. 일부 공개 평가는 더 이상 돌리지 않고, 일부는 오프라인판으로 옮기거나 실시간 웹사이트에 닿지 않게 다시 만들었다. 웹 페이지를 가져오는 도구의 가드레일은 모델이 할 수 있는 일을 크게 좁혔다. 회사가 새로 만든 탐지·차단 도구는 대부분의 평가와 프런티어 모델의 사내 에이전트 사용에서 돌고 있고, 이번 보고서의 사례에 시험했을 때 전부를 막았다. 사내 에이전트는 격리가 강한 중앙 관리 인프라로 옮기고, 안전 분류기와 계층적 요약으로 에이전트 행동을 더 넓게 감시한다.

이 보고서의 무게는 사례의 크기보다 공개 방식의 변화에 있다. 많은 사례가 공개 벤치마크에서 나왔고, 앤스로픽은 다른 개발사가 자사 모델에서 같은 행동을 점검하는 데 보고서가 쓰이기를 바란다고 밝혔다. 회사는 "모델이 사회에서 맡는 역할이 커질수록 대중은 모델이 어떻게 행동하는지 더 많이 알 자격이 있다"고 적었다. 평가 하나가 실제 경찰 제보함과 정부 사이트에 닿을 수 있는 구조에서, 남는 질문은 이 정기 보고가 얼마나 빨리 다음 이탈을 찾아내 알리느냐다.

김현국

METAL 발행인 · 아카이브저널 발행인 · 이라선 운영

매거진·서점·교육을 오래 해 온 편집자예요. 라이프스타일 매거진 <아카이브저널>을 발행하고, 아트 서점 <이라선>을 운영했으며, 라이카 아카데미에서 디렉터로 사진 교육 프로그램을 만들고 이끌었어요. 그 시선으로 전 세계 AI 소식을 독자에게 전하는 메탈(METAL) 매거진 편집장입니다.

이 에디터의 기사 더 보기 →

공유

댓글