SWE-bench Verified
AI 코딩 도우미가 실제 오픈소스 프로젝트의 진짜 버그를 얼마나 잘 고치는지, 사람이 검증한 문제로 자동 채점하는 시험이다.
쉽게 말하면
SWE-bench Verified는 AI 코딩 도우미가 실제로 존재했던 소프트웨어 버그를 얼마나 잘 고치는지 시험하는 문제집이다. 문제마다 실제 버그 신고 내용, 고쳐야 할 코드, 그리고 수정이 맞는지 확인하는 자동 테스트가 함께 들어 있어서, AI가 낸 답을 사람이 일일이 읽지 않고 테스트 통과 여부로 채점한다.
이름에 붙은 Verified(검증됨)는 원래 문제 모음 중에서 사람이 다시 하나하나 살펴보고, 실제로 풀 수 있는 문제인지, 설명이 애매하지 않은지 걸러낸 뒤 남긴 엄선된 부분이라는 뜻이다. 그래서 이 시험에서 얻은 점수는 회사 코드에서 발생하는 실제 버그 수정 작업을 얼마나 믿고 맡길 수 있는지 가늠하는 근거로 자주 인용된다.
기사에서 이렇게 나와요
직접 해보기
코딩 도우미를 비교해볼 때 다음처럼 물어보면 참고가 된다.
이 모델의 SWE-bench Verified 점수는 몇 점이고, 전체 문제 중 몇 개를 해결했는지 알려줘. 그리고 이 점수를 다른 코딩 도우미 점수와 비교해줘.
점수 숫자만 보지 말고 몇 개 문제로 측정한 결과인지 함께 확인하면 신뢰도를 가늠하는 데 도움이 된다.
