METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

앤스로픽, 개발자 허브 claude.dev 공개

앤스로픽이 엔지니어링 심층 기사와 Claude Code·API 가이드를 모은 개발자 허브 claude.dev를 열었다. 대표 글은 claude.ai를 두 주 만에 약 3배 빠르게 만든 스프린트 기록과 평가 설계 자동화 방법이다.

앤스로픽, 개발자 허브 claude.dev 공개 · Image: METAL LAB

이미지: @ClaudeDevs (X) 영상 갈무리

요약

  • 앤스로픽이 9월 30일 클로드로 개발하는 사람을 위한 개발자 허브 claude.dev를 공식으로 열고, 엔지니어링 심층 기사와 Claude Code·API 가이드, 이스터에그를 싣는다고 밝혔다.
  • 허브의 대표 글에 따르면 앤스로픽은 8월 두 주 스프린트에서 클로드와 함께 3,000건 넘는 변경을 사고 없이 병합해 claude.ai 핵심 사용 경험을 약 3배 빠르게 했다.
  • 평가 설계 글은 claude-api 스킬의 build-eval과 hillclimb 명령을 소개했고, 고객지원 실험에서 시험용 정확도를 78.6%에서 90.5%로 올리며 비용을 약 5분의 1로 줄였다.
Claude.dev is our new home for developers building with Claude.
발표
앤스로픽 ClaudeDevs X 계정 · 2026년 9월 30일 · 개발자 허브 claude.dev 공개 · 조회수 11만 회 이상
구성
엔지니어링 심층 기사 · Claude Code·API 가이드 · 팀의 요령 · 이스터에그(터미널 페이지, 픽셀 게임 Clawd's Quest)
첫 화면 글
10편 · 5월 20일~9월 28일 · Opus 5.5 과제 비용(21분), 컨텍스트 엔지니어링, 스킬 활용 등
3배 속도 스프린트
8월 2주 · 네 여정(사용 활동 95%) · p75 첫 로드 3.1초→0.55초 · Claude Code 세션 0.8초→0.3초 · Cowork 클라우드 2.6초→0.73초
스프린트 규모
변경 3,000건 이상 무사고·무롤백 · 최대 150개 넘는 스레드 동시 · 하루 200건 넘게 반영 · 플래그 약 200개
평가 설계
claude-api 스킬 /claude-api build-eval · /claude-api hillclimb · 학습/시험 분리로 과적합 차단
비용 실험
고객지원 44건(30 탐색·14 보류) · Opus 4.8 74.4%·4.6센트 → Opus 5.5 87.8%·1.9센트 → Sonnet 5 88.9%·약 1센트 · 보류 세트 78.6%→90.5%, 비용 약 5분의 1

앤스로픽이 9월 30일 클로드로 개발하는 사람을 위한 개발자 허브 claude.dev를 공식으로 열었다. 회사 개발자 계정 ClaudeDevs는 X에서 claude.dev를 "클로드로 개발하는 사람들의 새 집"이라고 소개하며, 엔지니어링 심층 기사와 Claude Code·API 가이드, 클로드를 만드는 팀의 요령, 그리고 몇 가지 재미있는 이스터에그를 싣는다고 밝혔다. 이 게시물은 공개 후 하루가 지나기 전에 조회수 11만 회를 넘겼다. 앤스로픽이 흩어져 있던 기술 글을 개발자 전용 주소 하나로 모은 셈이다.

사이트의 정체성은 첫 화면 한 줄에 있다. claude.dev는 스스로를 앤스로픽 개발자들의 요령과 관점을 나누는 곳이라고 소개하고, 글마다 읽는 데 걸리는 시간을 분 단위로 붙인다. 첫 화면에 걸린 글 10편은 5월 20일부터 9월 28일 사이에 나온 것으로, Opus 5.5에서 과제 하나에 드는 비용을 21분 분량으로 뜯어본 글, Claude 5 세대 모델의 컨텍스트 엔지니어링 규칙, 클로드 코드 팀이 스킬을 쓰는 방식 같은 실무 주제가 대부분이다. 아래쪽에는 공식 유튜브 영상이 붙고, 바닥에는 Claude Academy와 디스코드, 오프라인 밋업, 레딧 커뮤니티로 가는 길이 모여 있다.

이스터에그도 실제로 있다. 메탈이 확인한 claude.dev의 터미널 페이지는 10월 1일 브라우저 접속 기준으로 CLAUDE.DEV라는 글자를 점으로 찍은 아스키 그림으로 열리고, /help를 치면 다른 명령을 찾을 수 있다고 안내하며 /posts로 글 목록을 불러오게 한다. X 게시물에 붙은 30초 영상은 픽셀 게임 Clawd's Quest의 플레이 장면이다. 하늘이 깨어나기를 잊은 밤이라는 설정에서 주황색 픽셀 캐릭터 Clawd가 불씨 5개를 모으면 해가 뜨고, 화면에는 고맙다는 인사가 뜬다. 개발자 대상 사이트에 게임을 숨겨 두는 방식은 문서 사이트보다 커뮤니티 공간에 가깝게 보이려는 선택으로 읽힌다.

허브에서 가장 무게 있는 글은 claude.ai를 두 주 만에 세 배 빠르게 만든 기록이다. 레이먼드 왕, 샘 애터드, 아이작 G. 세 엔지니어가 9월 23일 쓴 이 글에 따르면, 앤스로픽은 8월 두 주짜리 스프린트에서 claude.ai 웹과 데스크톱 앱의 핵심 사용 경험을 약 3배 빠르게 했다. 사용 활동의 95%를 차지하는 네 가지 여정을 겨냥했고, 75백분위 기준으로 claude.ai를 새로 열어 입력 가능한 화면이 뜨는 시간은 3.1초에서 0.55초로, 새 Claude Code 세션 시작은 0.8초에서 0.3초로, 클라우드 Cowork 세션 불러오기는 2.6초에서 0.73초로 줄었다. 13개 측정값 가운데 12개 목표를 사흘 만에 달성했다.

작업 방식이 결과만큼 눈에 띈다. 팀은 슬랙 채널 하나에 모든 스레드를 모으고 스레드마다 클로드를 붙였다. 앤스로픽은 Opus 5.5와 대략 비슷한 수준의 내부 연구 모델을 Claude Tag 베타로 돌렸다고 밝혔다. 클로드가 병목을 찾고 벤치마크를 만들고 변경을 올리고 배포를 지켜봤으며, 사람은 목표를 정하고 절충을 판단하고 모든 변경을 승인했다. 그렇게 3,000건이 넘는 변경을 고객에게 보이는 사고나 롤백 없이 병합했다. 가장 바쁜 날에는 하루 200건 넘게 반영됐고, 한때 동시에 돌아간 스레드는 150개가 넘었다. 약 200개의 기능 플래그를 도입해 절반 넘게 스프린트 안에 정리했다.

8월 13일과 8월 27일 실사용자 측정 75백분위를 비교한 도표. 앱 실행, 대화 시작, 대화 불러오기, 메시지 전송 네 여정 13개 측정값의 전후 시간과 개선 배수를 보여 주며 평균 3.1배 빨라졌다

발견의 내용은 구체적이다. 클로드는 입력창 경로에서 키를 누를 때마다 다시 그려지는 React 훅 6,900개와 스토어 구독 900개를 찾았고, 하루 50만 번씩 보이지 않게 일어나던 새로고침을 잡아냈다. 코드 블록 하이라이트가 약 1초 멈추던 원인은 줄표였다. 답변에 줄표나 둥근 따옴표 같은 문자가 하나라도 있으면 V8이 문자열 전체를 UTF-16으로 저장해 느린 경로를 탔고, 클로드는 20줄짜리 변경으로 이를 고쳤다. 긴 답변이 메인 스레드를 막는 시간은 약 750밀리초에서 200밀리초로 줄었고, 120Hz 맥북에서 처음부터 끝까지 초당 120프레임을 유지했다.

사람의 역할은 속도 조절이 아니라 야심 조절이었다. 글에 따르면 클로드는 기본적으로 범위를 조심스럽게 잡고 추정치를 넉넉히 부풀렸다. 목표를 달성한 스레드가 느려지자 애터드는 스레드마다 "계속 끌어내리자, 목표가 멈출 지점은 아니다. 다음은 뭔가. 야심 차게 가자"라는 같은 메시지를 남겼다. 채널에 있던 엔지니어 셸리 보어는 이 모델을 두고 "숫자 귀신"이라고 평했다. 결과를 사내에 공유했을 때 아이작 G.는 "여섯 달 전만 해도 이게 가능하다고 나를 설득하지 못했을 것"이라고 말했다.

또 하나의 대표 글은 평가 설계를 다룬다. 랜스 마틴이 9월 28일 쓴 글은 claude-api 스킬에 /claude-api build-eval과 /claude-api hillclimb 두 명령을 더했다고 밝혔다. 앞의 명령은 사용자를 인터뷰해 코드베이스 안에 평가 세트를 만들고, 뒤의 명령은 한 번에 변경 하나씩 적용하며 점수를 올린다. 평가 사례는 학습용과 한 번도 보여 주지 않는 시험용으로 나누고, 학습 점수만 오르고 시험 점수가 그대로면 과적합으로 보고 변경을 되돌린다.

사례의 숫자는 비용 쪽으로 기운다. 내부 고객지원 벤치마크 44건 가운데 30건으로 탐색하고 14건을 남겨 둔 실험에서, 출발점은 Opus 4.8 기본 노력 설정의 결정 정확도 74.4%와 티켓당 4.6센트였다. 프롬프트를 정리한 뒤 Opus 5.5 낮은 노력 설정으로 바꾸자 87.8%에 1.9센트가 됐고, Sonnet 5 낮은 노력 설정은 88.9%를 약 1센트에 냈다. 앤스로픽에 따르면 Opus 5.5의 입력·출력 토큰 가격은 Opus 4.8보다 20%, 캐시 읽기는 60% 낮다. 한 번도 보지 않은 14건에서 최종 구성은 원래 구성의 78.6%보다 높은 90.5%를 약 5분의 1 비용으로 기록했다. claude-api 스킬 자체의 평가 점수도 66%에서 약 88%까지 올랐다.

엔지니어링 조직을 운영하는 눈으로 보면 이 허브가 파는 것은 기능이 아니라 작업 방식이다. 두 글 모두 결론이 같다. 잴 수 있으면 클로드가 개선할 수 있고, 그래서 사람이 할 일은 잴 것을 늘리고 되돌릴 장치를 먼저 까는 일이라는 것이다. 메탈은 앞서 앤스로픽의 Claude Opus 5.5 공개를 보도한 바 있으며, claude.dev의 글들은 그 모델을 실제 팀이 어떤 절차로 부리는지 보여 주는 운영 매뉴얼 역할을 한다.

남은 과제도 회사 스스로 적었다. 3배 속도 글은 95백분위와 다른 여정, 아주 긴 대화에는 여전히 개선 여지가 있다고 밝혔고, 스프린트 중 Electron과 Chromium, Node.js 같은 상위 프로젝트에 기여한 내용은 별도 글로 내겠다고 예고했다. claude.dev가 제품 공지 채널을 넘어 개발자들이 돌아오는 주소가 되려면, 이런 후속 기록이 얼마나 꾸준히 쌓이느냐가 관건이다.

김현국

METAL 발행인 · 아카이브저널 발행인 · 이라선 운영

매거진·서점·교육을 오래 해 온 편집자예요. 라이프스타일 매거진 <아카이브저널>을 발행하고, 아트 서점 <이라선>을 운영했으며, 라이카 아카데미에서 디렉터로 사진 교육 프로그램을 만들고 이끌었어요. 그 시선으로 전 세계 AI 소식을 독자에게 전하는 메탈(METAL) 매거진 편집장입니다.

이 에디터의 기사 더 보기 →

공유

댓글