스페시픽, 기업 코드 벤치마크 Real-SWE 공개
스페시픽이 9월 12일 실제 기업의 비공개 코드베이스로 AI 코딩 모델을 재는 Real-SWE 결과를 공개했어요. 1위 Fable 5.1도 해결률이 38.8%에 그쳤고, 열 과제 중 하나는 여덟 조합이 64번 시도해 전부 실패했어요.
Zhipu AI
즈푸 AI는 중국의 인공지능 기업으로 대형언어모델을 개발해 서비스한다. 대표 모델 계열은 GLM으로, 최근에는 GLM-5.3이 공개됐다. 코딩 도구 ZCode를 선보인 Z.ai는 즈푸 AI가 운영하는 서비스 브랜드로, 별개의 회사가 아니다. 2026년 8월 즈푸 AI는 GLM-5.3 API를 공개했으며, 터미널벤치 점수가 4.6에서 28.3으로 오른 결과가 보도됐다.
현재 순위 (1M)
23위
최근 30일 순위 추이
2026.08.17 – 2026.09.15 · 최고 15위 · 최저 24위 · 현재 23위
스페시픽이 9월 12일 실제 기업의 비공개 코드베이스로 AI 코딩 모델을 재는 Real-SWE 결과를 공개했어요. 1위 Fable 5.1도 해결률이 38.8%에 그쳤고, 열 과제 중 하나는 여덟 조합이 64번 시도해 전부 실패했어요.
딥리인포스 팀이 과제·발판·풀이를 스스로 만드는 자기개선 루프로 397B부터 9B까지 세 체급 공개…수치는 모두 자체 측정치
IBM 연구팀이 8개 모델 실험 결과, 딥시크는 전체 지침을 반기고 gpt-oss는 압축본에서 더 나은 성적을 냈다
Z.ai가 GLM-5.2와 같은 값으로 GLM-5.3 API를 열었다, 코딩·사이버보안 벤치마크서 큰 폭 상승
r/LocalLLaMA 리뷰어가 속도·기획 검토·자기 교정 능력을 극찬, 배경엔 2.4조 파라미터와 에이전틱 지수 1위 성적