오답률
Error Rate
AI가 내놓은 답변 중 틀린 답이 차지하는 비율을 뜻하는 지표
쉽게 말하면
오답률은 AI가 내놓은 답변 가운데 틀린 답이 차지하는 비율을 뜻한다.
학교 시험에서 오답노트를 만들 때를 떠올리면 쉽다. 100문제를 풀고 3문제를 틀렸다면 오답률은 3퍼센트다. 그런데 AI 서비스에서는 이 숫자가 항상 같은 무게를 갖지 않는다. 심심풀이로 물어본 잡담에서 3퍼센트를 틀리는 것과, 지도 위에서 시설 위치나 행정구역 경계를 3퍼센트 틀리는 것은 전혀 다른 사고다. 후자는 사용자가 그 답을 그대로 믿고 실제로 움직이기 때문이다.
그래서 같은 오답률이라도 어떤 화면, 어떤 상황에 쓰이느냐에 따라 허용 기준이 달라진다. 잡담용 챗봇이라면 몇 퍼센트의 오답을 감수할 수 있지만, 의료·법률·재난 정보처럼 사용자가 결과를 바로 행동으로 옮기는 영역에서는 훨씬 엄격한 기준이 필요하다. 숫자 자체보다 그 숫자가 어디에 놓이는지가 안전의 기준이 되는 셈이다.
기사에서 이렇게 나와요
기사는 지도 위에 생성형 기능을 얹는 문제를 다루면서 이렇게 말한다. 오답률 3퍼센트가 어떤 화면에서는 괜찮고 어떤 화면에서는 사고다. 흔히 오답률은 낮을수록 무조건 안전하다고 생각하지만, 실제로는 그 답이 어떤 화면에서 쓰이는지가 기준을 좌우한다는 뜻이다.
직접 해보기
정답을 이미 알고 있는 질문 10개를 챗봇에 연달아 던져보라. 예를 들어 여러 나라의 수도를 하나씩 물어본 뒤 정답과 대조해 몇 개를 틀렸는지 세어보면 된다. 틀린 개수를 10으로 나누면 그 챗봇의 대략적인 오답률을 체감할 수 있다. 질문의 난이도나 주제를 바꿔가며 반복하면 어떤 영역에서 오답률이 높아지는지도 가늠할 수 있다.
