GIFT-Eval
在相同条件下比较时间序列预测AI模型准确度的公开测试平台
简单来说
GIFT-Eval是一个公开的测试平台,让AI模型统一做同一套题目,评判它们预测随时间变化的数据(比如销售额、访客数、天气)的能力有多准。就像不同补习班的学生一起做同一份模拟考卷再比分数一样,来自不同公司的预测模型会用完全相同的数据接受测试,从而排出谁的预测更准确。
评分方式有两种。一种是看模型能否精准命中一个具体数值;另一种是看模型对真实值落在某个范围内的概率估计得有多准。这样一来,不仅能看出哪个模型擅长猜中平均值,还能看出哪个模型即使在不确定的情况下也能给出可信的范围。
在报道中是这样出现的
文章中提到,Google Research在GIFT-Eval、FEV-Bench、Time这三个基准上测试了其新推出的预测模型TimesFM-3,结果在三处都排名第一。这里容易产生的误解是,GIFT-Eval并不是Google开发的工具。Google只是使用这个测试平台为自家模型拿到成绩单的参与者之一,测试平台本身是由其他机构创建的。
亲手试一试
打开Hugging Face上公开的GIFT-Eval基准页面,可以看到一份排行榜,列出了各家公司的时间序列预测模型在相同数据集上的评分。点击排行榜中的模型名称,还能查看该模型在哪些条件下取得了什么具体分数的详细信息。
