스페시픽, 기업 코드 벤치마크 Real-SWE 공개
스페시픽이 9월 12일 실제 기업의 비공개 코드베이스로 AI 코딩 모델을 재는 Real-SWE 결과를 공개했어요. 1위 Fable 5.1도 해결률이 38.8%에 그쳤고, 열 과제 중 하나는 여덟 조합이 64번 시도해 전부 실패했어요.
Claude
Anthropic의 Claude 제품 계정.
스페시픽이 9월 12일 실제 기업의 비공개 코드베이스로 AI 코딩 모델을 재는 Real-SWE 결과를 공개했어요. 1위 Fable 5.1도 해결률이 38.8%에 그쳤고, 열 과제 중 하나는 여덟 조합이 64번 시도해 전부 실패했어요.
앤스로픽 공식 개발자 계정이 9월 12일 자사 on-call 시연 영상을 올렸어요. 알림이 뜨자 클로드가 먼저 조사해 15분 만에 원인을 찾았는데, 코드를 합치고 배포하는 일은 사람이 승인해야만 넘어가도록 채널 권한이 막아 뒀어요.
앤스로픽이 클로드 코드에 플러그인 성능을 재는 명령을 넣었어요. 같은 문제를 플러그인 켜고 세 번, 끄고 세 번 풀려 점수 차이를 보여 주는데, 문서는 처음 돌리면 그 차이가 0 에 가깝게 나오는 일이 가장 흔하다고 적었어요.
연구소들이 함께 개발 속도를 줄이는 게 반독점법에 걸리는지를 오픈AI가 의원들에게 물었어요. 9월 9일 앤스로픽 연구원의 사직 경고 뒤 사흘 동안 두 회사 연구자 스무 명이 AI가 인류를 죽일 수 있다고 공개로 인정한 직후예요.
AI에게 도구 쓰는 법을 가르칠 데이터를 구글 리서치가 거꾸로 만들었어요. 질문부터 짓고 답을 찾던 방식은 열 번에 세 번 넘게 실패했는데, 순서를 뒤집자 합격률이 99.8%가 됐어요.
국가 배후 첩보조직부터 학부생 둘까지, 클로드를 악용한 사례를 여덟 달치 모아 냈어요. 훔친 API 키는 모두 고객 환경에서 나왔고 자사 시스템은 뚫리지 않았다고 못 박았어요.
한 달 전 낸 V4-Pro를 9월 14일부터 새 모델로 넘겨요. 백본은 3분의 1인데 KV 캐시를 토큰당 890바이트로 줄여 코딩 에이전트 평가에서 오퍼스 5를 앞섰어요.
유럽의 새 AI 랩이 과제 하나에 모델 하나씩 붙였어요. 9MB 모델이 5분 녹음을 1초에 다듬고, 2MB 모델이 세 낱말로 84개 언어를 가려내요.
미국 경제를 과제 묶음으로 놓고 계산했어요. 세 시나리오 모두 파이는 커지지만 지식노동자 몫은 줄고, 가장 밝은 곡선은 재귀적 자기개선을 전제로 해요.
7월엔 평가 환경 설정 오류라고 했어요. 9월 보고서는 모델이 증거를 골라 읽고 무모하게 행동했다고 적었고, METR가 8주간 조사해요.