링고-저지
Lingo-Judge
자율주행 AI의 답변이 얼마나 정확한지 점수로 매기는 LingoQA 벤치마크의 채점 기준
쉽게 말하면
링고-저지는 자율주행 AI가 내놓은 답변을 채점하는 심사 기준이다. 학교 시험에서 선생님이 답안지를 보고 점수를 매기듯, 자율주행 AI에게 '지금 이 상황에서 어떻게 판단해야 하나'를 물은 뒤 그 답이 얼마나 맞았는지 이 기준으로 채점한다.
이 채점은 LingoQA라는 자율주행 추론 시험 안에서 쓰인다. 여러 회사의 자율주행 모델이 같은 시험을 보고, 링고-저지 기준으로 점수를 매긴 뒤 서로 비교한다. 예를 들어 기사에서는 엔비디아의 자율주행 모델이 다른 유명 모델들보다 이 기준으로 몇 점 더 높았다는 식으로 성적표가 제시된다.
다만 이 점수는 절대적인 성적표가 아니라 상대 비교용 숫자에 가깝다. 채점 기준이 바뀌거나 시험 문제 구성이 다르면 점수도 달라질 수 있어서, 발표한 회사의 자체 테스트 결과라는 점을 함께 봐야 한다.
기사에서 이렇게 나와요
기사에서는 "Lingo-Judge 지표 기준으로 Qwen2.5-VL 72B보다 17.0점, GPT-4o보다 23.2점 높다"는 식으로 등장한다. 이때 점수는 절대적인 만점 기준 성적이 아니라 이 채점 방식 안에서의 상대 우위를 뜻하며, 발표 회사가 직접 측정한 결과라 제3자 검증과는 구분해서 봐야 한다.
