SWE-bench Pro
실제 소프트웨어 저장소의 문제를 AI가 얼마나 잘 고치는지 평가하는 코딩 벤치마크
쉽게 말하면
SWE-bench Pro는 AI에게 실제 소프트웨어 프로젝트에서 발생한 진짜 문제를 던져주고, 그걸 얼마나 잘 고치는지 채점하는 시험지다. 시험 문제가 교과서 예제가 아니라 실제 현장에서 있었던 고장 신고서에 가깝다는 점이 특징이다.
채점 방식은 단순히 답을 맞히는 게 아니라, AI가 내놓은 수정 코드가 그 프로젝트의 실제 검증 절차를 통과하는지로 판단한다. 코드를 조금 고쳤다고 끝이 아니라, 원래 있던 다른 기능들이 계속 정상 작동해야 통과다.
이런 벤치마크가 필요한 이유는 간단한 문제만 잘 푸는 AI와, 실제 회사에서 쓰는 복잡하고 얽힌 코드를 다룰 수 있는 AI를 구분하기 위해서다. 여러 AI 회사들이 새 코딩 모델을 낼 때 이 점수를 함께 공개하는 경우가 많다.
함께 볼 용어
이 용어가 나온 기사
- 큐원3.8-27B, 아파치 2.0 오픈웨이트 공개Models · 2026.08.15
- 큐원3.8 맥스 공개…2.4조 중 몇 개가 켜지는지는 비공개Models · 2026.08.04
- 데이터브릭스, 기업 문서 추론 벤치마크 'OfficeQA Pro V2' 공개Products · 2026.08.12
- 딥시크 V4-프로 정식 출시, 추론 강도 3단계로 조절Models · 2026.08.14
- 딥시크 V4 프로 GA 벤치마크 유출, 오픈소스 최상위권 근접Models · 2026.08.13
- MS 코딩 모델 신작, 딥시크에 가격도 성능도 밀렸다Models · 2026.08.12