METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

앤스로픽, Claude Opus 5.5 공개

앤스로픽이 새 Claude 5.5 계열의 첫 모델을 열었어요. 대부분의 작업에서 Claude Fable 5.1 수준을 내면서 Opus 5보다 운영 비용이 40% 낮고, 사이버보안 요청은 Opus 4.8로 넘어가요.

앤스로픽, Claude Opus 5.5 공개 · Image: METAL LAB

이미지: 영상 갈무리

요약

  • 앤스로픽이 9월 22일 Claude Opus 5.5를 공개했어요. 새 Claude 5.5 계열의 첫 모델이에요.
  • 약 2,000개 시나리오를 돌리는 자동 행동 감사에서 지금까지 테스트한 모델 가운데 가장 좋은 점수를 받았어요.
  • 사이버보안과 생물학 작업에는 Claude Fable 5.1과 같은 급의 안전장치가 붙어 요청이 다른 모델로 넘어가요.
Introducing Claude Opus 5.5
공개
2026년 9월 22일 · Claude 5.5 계열 첫 모델
운영 비용
Opus 5 대비 40% 낮음 · 출력 생성 30% 이상 빠름
출시 전 외부 평가
Frontier Design · METR
자동 행동 감사
약 2,000개 시나리오 · 역대 최고 점수
경계 이탈 시도
Opus 5·Claude Mythos 5.1 대비 약 85% 감소
Terminal-Bench 4.0
66.4% · Fable 5.1 55.8% · Opus 5 52.3% · GPT-6 Astra 57.9%
GDPval-AA v2.1
1846 Elo · Fable 5.1 1735 · Opus 5 1708
그 밖의 점수
OSWorld 2.0 81.8% · Humanity's Last Exam 67.7%
코드 작업
68만 줄 마이그레이션 하루 미만 · 20만 줄 감사·수정 3시간 미만
HAProxy C→Rust
9.5시간 · Fable 5.1 12시간 · 비용 51% 낮음
사이버보안
대부분 작업을 Opus 4.8로 재라우팅 · Cyber Verification Program 3단계
생물학
Fable 5.1과 같은 안전장치 · Life Sciences Verification Program
증류 방지
preserved thinking · 2026년 8월 31일 이후 개설 API 계정
가용성
AWS · Google Cloud · Microsoft Azure · claude-opus-5-5

앤스로픽이 9월 22일 Claude Opus 5.5를 공개했어요. 새 Claude 5.5 계열의 첫 모델이고, 회사 측은 대부분의 작업에서 Claude Fable 5.1 수준의 성능을 내면서 Opus 5보다 운영 비용이 40% 낮다고 밝혔어요. 다리오 아모데이 최고경영자가 프런티어 속도를 조절하자고 요구한 뒤 나온 첫 모델이기도 해요.

출시 전 외부 검증을 거쳤다는 점을 회사가 앞세웠어요. Frontier Design과 METR이 공개 전 모델을 시험했고, 약 2,000개 시나리오로 클로드를 훑는 자동 행동 감사에서 Opus 5.5는 지금까지 이 회사가 평가한 모델 가운데 가장 좋은 점수를 받았어요. 메탈은 아모데이가 외부 평가팀을 회사 안으로 들이자고 제안한 속도 조절 에세이를 보도한 바 있으며, 이번 모델은 그 문장이 제품 일정에 처음 닿은 자리예요.

벤치마크 표는 여러 축에서 선두예요. 명령줄에서 여러 단계를 거치는 과제를 재는 Terminal-Bench 4.0에서 66.4%를 받아 Fable 5.1의 55.8%와 Opus 5의 52.3%, GPT-6 Astra의 57.9%를 앞섰어요. 44개 직업의 실제 업무를 재는 GDPval-AA v2.1에서는 1846 Elo로 Fable 5.1의 1735와 Opus 5의 1708 위에 섰고, 컴퓨터 사용을 재는 OSWorld 2.0에서는 81.8%, 도구를 쓴 Humanity's Last Exam에서는 67.7%였어요. 회사 스스로는 이 수준에서 벤치마크 차이가 실제 차이를 가리키는 지표로서 덜 믿을 만해졌고 자사 사용 경험에서는 Opus 5.5와 Fable 5.1의 간격이 점수보다 좁다고 적었어요.

초기 테스터 사례에는 시간이 붙어 있어요. 한 테스터는 68만 줄 규모의 코드 마이그레이션을 하루가 안 되는 시간에 끝냈고, 다른 테스터는 20만 줄 코드베이스를 3시간 안에 감사하고 고쳤어요. 같은 일에 Opus 5는 20시간 넘게 걸렸고 토큰도 2.5배 썼어요. 사내 시험에서는 웹 트래픽을 여러 서버로 나누는 소프트웨어 HAProxy를 C에서 Rust로 옮기게 했는데, Opus 5.5가 9.5시간에 끝내 Fable 5.1의 12시간보다 빨랐고 비용은 51% 낮았어요. 웹 앱의 모든 페이지 로드 시간을 줄이라는 과제에서는 40번 가운데 39번 성공했어요.

고객사 평가도 같은 방향을 가리켜요. 깃허브의 마리오 로드리게스 최고제품책임자는 "VS Code에서 Opus 5보다 절반이 안 되는 단계로 더 많은 터미널 과제를 풀었어요" 라고 말했어요. 스트라이프의 크리스티안 리베라 스태프 소프트웨어 엔지니어는 "며칠에 걸친 풀 리퀘스트 40개 리베이스 작업에서 Opus 5.5 세션 하나가 열두 개가 넘는 세션을 지휘하며 모든 충돌을 분명하게 정리했고, 40개 전부 다음 날 오후에 CI를 통과했어요" 라고 밝혔어요. 박스는 평가에서 Opus 5.5가 Opus 5가 쓰던 토큰의 3분의 1을 썼고 답변은 정확도를 잃지 않으면서 40% 덜 장황했다고 전했어요.

안전 쪽 변화가 이번 발표의 절반이에요. 새로 만든 격리 경계 평가에서 Opus 5.5가 경계를 넘으려 시도한 횟수는 Opus 5나 Claude Mythos 5.1보다 약 85% 적었고, 시도는 모두 경미했으며 스스로 보고했어요. 최근 사이버보안 사고에 영향을 준 편향된 추론, 샌드박스를 벗어나려는 시도, 모의 환경이라고 판단한 뒤 해로운 행동을 하는 성향에서도 이전 모델보다 나아졌어요. 프롬프트 인젝션에서는 보안 기업 그레이 스완이 돌린 평가에서 Fable 5.1과 함께 성공률이 가장 낮은 모델로 묶였어요. 회사는 Opus 5.5가 자신이 평가받고 있다고 의심하는 정황이 보인다고 적었고, 그래서 자체 정렬 작업과 별도의 안전장치를 함께 둔다고 설명했어요. 보도에 따르면 최근 몇 주 사이 여러 AI 기업이 테스트 과정에서 모델이 격리를 벗어나 제3자 기업을 해킹한 사례를 보고했어요.

안전장치는 접근을 나누는 층을 새로 만들었어요. Opus 5.5는 사이버보안과 생물학, 증류 세 곳에서 Fable 5.1과 같은 급의 안전장치를 달고 나온 첫 Opus 모델이에요. 일상적인 개발 과정의 버그 식별과 수정은 그대로 되지만 대부분의 사이버보안 작업은 Opus 4.8로 넘어가고, 생물학 쪽은 Life Sciences Verification Program에 신청해 검증받은 학계와 스타트업, 제약사가 풀린 범위를 쓰는 구조예요. 사이버 방어자를 위한 Cyber Verification Program은 접근 권한을 세 단계로 나눠 곧 확대돼요. 모든 우회는 이용자에게 보이지 않게 다른 모델로 넘어가는 방식이에요.

증류를 막는 장치도 함께 붙었어요. Fable 5.1에서 처음 쓴 preserved thinking이 API 이용자가 클로드의 앞선 문맥을 고쳐 추론을 뽑아내려는 시도를 막는데, 2026년 8월 31일 이후 만든 API 계정에 적용돼요. 메탈은 앤스로픽이 8개월치 악용 사례를 공개한 위협 인텔리전스 보고서를 보도한 바 있어요. EU AI Act를 맞추기 위한 워터마킹은 Fable 5.1과 같이 적용되고, 생각 모드를 끄는 선택지는 사라졌어요. 이전 Opus 모델처럼 데이터를 남기지 않는 설정으로도 쓸 수 있어요.

값과 한도도 같이 움직였어요. 회사 측은 기본 설정에서 일반적인 작업 부하 기준으로 Opus 5보다 40% 적게 든다고 밝혔고, 출력 생성 속도는 30% 이상 빨라졌어요. Pro와 Max, Team, 좌석형 Enterprise 요금제의 5시간 사용 한도는 올라갔고, 구독 이용자에게는 원할 때 꺼내 쓰는 한도 초기화가 주어져요. 모델은 AWS와 Google Cloud, Microsoft Azure를 포함한 모든 플랫폼에 올라갔고 개발자는 claude-opus-5-5로 부를 수 있어요. Claude Sonnet 5.5와 Claude Haiku 5.5는 몇 주 안에 같은 개선을 안고 나와요.

메탈이 확인한 클로드 공식 계정의 공개 영상은 20초 분량이었고, 게시물 조회수는 836만 회, 좋아요는 6만 회였어요. 같은 날 개발자 계정은 5시간 세션 한도가 20% 올라가고 값이 내려간 만큼 한도 안에서 25% 더 갈 수 있다고 덧붙였어요.

정리하면 이번 발표에서 눈여겨볼 대목은 성능표가 아니라 접근을 나누는 방식이에요. 같은 모델을 쓰더라도 누가 어떤 검증을 통과했느냐에 따라 실제로 닿는 능력이 달라지고, 그 경계는 약관이 아니라 요청을 다른 모델로 넘기는 분류기가 그어요. 규제 문서가 아직 정하지 못한 자리를 제품 설계가 먼저 채우고 있다는 뜻이에요.

김현국

METAL 발행인 · 아카이브저널 발행인 · 이라선 운영

매거진·서점·교육을 오래 해 온 편집자예요. 라이프스타일 매거진 <아카이브저널>을 발행하고, 아트 서점 <이라선>을 운영했으며, 라이카 아카데미에서 디렉터로 사진 교육 프로그램을 만들고 이끌었어요. 그 시선으로 전 세계 AI 소식을 독자에게 전하는 메탈(METAL) 매거진 편집장입니다.

이 에디터의 기사 더 보기 →

공유

댓글