GDPval-AA v2
用真实职场任务测试AI,并与人类完成水平的基准分数(Elo 1000)进行比较的实务型基准测试
简单来说
GDPval-AA v2是一种测试,它让AI去做真实的公司工作,然后把结果与人类完成同样工作时的得分进行比较。人类完成工作的水平被固定为1000分,如果AI的得分高于这个数字,就意味着它超越了这条基准线。
打个比方,这有点像对新员工的实务考核。给AI布置撰写报告、整理资料之类的任务,把熟练员工完成的结果设为基准点(1000分),再把AI的成果拿来并排打分。如果分数超过1000,就说明——至少在这项测试中——AI的表现优于人类平均水平。
评测由独立机构Artificial Analysis进行,多家AI公司的最新模型都会接受这项测试并被排名。不过需要注意的是,在一项测试中表现出色,并不代表AI能够全面取代实际工作。
在报道中是这样出现的
文章提到,"Upstage的Solar Pro 4在GDPval-AA v2上获得1276分,超过了人类基准线(1000分)"。这里容易产生误解的是,这个分数并不能直接全面证明AI'比人类更擅长工作'。更准确的理解是,AI在测试所涵盖的特定任务类型上超过了评分标准。
