기프트이벨 벤치마크
GIFT-Eval
시계열 예측 AI 모델들의 정확도를 같은 조건에서 비교 평가하는 공개 시험대
쉽게 말하면
기프트이벨 벤치마크는 매출, 방문자 수, 날씨 같은 시간에 따라 변하는 데이터를 얼마나 잘 예측하는지 AI 모델들에게 같은 문제지를 풀게 하고 채점하는 공개 시험대예요. 수능 모의고사를 여러 학원 교재로 다 같이 풀어보고 점수를 비교하듯, 서로 다른 회사가 만든 예측 모델들을 똑같은 데이터로 테스트해서 누가 더 정확한지 줄을 세워요.
채점 방식도 두 가지예요. 하나는 딱 떨어지는 숫자 하나를 얼마나 정확히 맞혔는지 보는 방식이고, 다른 하나는 실제 값이 어느 범위 안에 있을 확률까지 얼마나 잘 맞혔는지 보는 방식이에요. 그래서 어떤 모델이 단순히 평균값만 잘 맞히는지, 아니면 불확실한 상황에서도 믿을 만한 범위를 제시하는지까지 함께 드러나요.
기사에서 이렇게 나와요
기사에서는 구글 리서치가 새 예측 모델 TimesFM-3를 기프트이벨 벤치마크, FEV-Bench, Time 세 곳에서 테스트했더니 세 곳 모두에서 가장 높은 순위를 기록했다고 나와요. 여기서 오해하기 쉬운 점은, 기프트이벨이 구글이 만든 도구가 아니라는 것이에요. 구글은 이 시험대를 이용해 자사 모델의 성적표를 받아본 참가자일 뿐, 시험지 자체를 만든 곳은 따로 있어요.
