METAL LAB

阿里巴巴基准测试中OpenAI击败阿里巴巴

在为期一年的网店经营新测试中,GPT-5.6 Sol夺得第一,阿里巴巴自家旧模型四次破产

阿里巴巴基准测试中OpenAI击败阿里巴巴

图片:由 METAL AI 生成

摘要

  • 阿里巴巴通义千问团队公布了新基准E-CommerceBench,让AI智能体连续365天独立运营一家网店
  • 五轮模拟测试的平均结果显示,OpenAI的GPT-5.6 Sol把启动资金翻了14.31倍,排名第一
  • 阿里巴巴自家模型Qwen3.5-Plus在同一测试中五次里破产了四次

阿里巴巴出的题,拿第一的却是OpenAI

Meet官方网站

图中间的虚线圆圈代表阿里巴巴设计的这场为期365天的网店经营测试。左侧用逐渐变大的实心圆点连成实线,画出GPT-5.6把资产一路做到启动资金14.31倍的走势;右侧则用一段断裂的圆圈连成实线,展现阿里巴巴旧模型Qwen3.5在五次测试中四次破产的结局。同一张考卷上,一边稳步增长、一边接连崩盘,这种对比正是全图的核心。图中间的虚线圆圈代表阿里巴巴设计的这场为期365天的网店经营测试。左侧用逐渐变大的实心圆点连成实线,画出GPT-5.6把资产一路做到启动资金14.31倍的走势;右侧则用一段断裂的圆圈连成实线,展现阿里巴巴旧模型Qwen3.5在五次测试中四次破产的结局。同一张考卷上,一边稳步增长、一边接连崩盘,这种对比正是全图的核心。
图片:METAL AI 生成

阿里巴巴通义千问团队于9月3日发布了新基准E-Commerce Bench。测试规则是:给AI智能体10万元人民币启动资金,让它独立运营一家网店整整365天。从选品采购、议价谈判、定价策略、促销活动,到库存管理和现金流调度,所有决策都要在一个接入了真实电商数据的市场环境中由智能体自己拿主意。然而在这场测试中拿到最高分的,并不是阿里巴巴自家的模型,而是OpenAI的GPT-5.6 Sol;阿里巴巴的旧模型Qwen3.5-Plus则在五次测试中破产了四次。

具体来说,这场测试相当于让AI真正当一次网店老板,把一整年的经营权都交出去。从哪里进货、进价多少、卖价定多少,到库存该囤多少,全部由AI在365天里自主判断,最后用年底账户余额来打分。

以往的AI基准测试大多是"一问一答"式的单次评分。E-Commerce Bench的设计思路不一样:随着时间一天天推进,昨天的决策会影响今天的库存和现金,这种累积效应最终体现为一年后的资产总量。正因如此,业内认为它是一项检验长期自主运营能力的测试。

알리바바 벤치마크서 오픈AI가 알리바바를 이겼다
이미지: @Alibaba_Qwen (X)

测试场由四层结构搭建而成

在智能体循环层,LLM智能体负责调用工具、把环境时间向前推进一天、接收每日新闻提醒,然后进入下一轮循环,上下文管理和持久记忆也在这一层同步运作。工具层则提供七种工具:门店运营、市场调研、供应商谈判、库存管理、财务管理、记忆操作和时间推进。

环境层是这场测试的核心。系统里运行着一套反映消费者与销售行为建模的动态经济引擎,促销活动、自然灾害、供应商破产等突发事件会随机发生。资金被分成银行、平台、担保三个账户分别管理。此外还搭配了一个确定性谈判内核——比如智能体想大批量订购1000瓶商品并要求把单价压到1.5元,供应商会回应称低于1.8元很难做,由此展开多轮讨价还价。最底层的数据层则收录了12种门店类型、60个商品类目、576家供应商和6886款商品。

测试结果:OpenAI第一,阿里巴巴模型排名靠后

每个模型各跑了5轮模拟,最终按年末平均资产相对于启动资金(10万元人民币)的倍数排名。

模型开发商年末资产倍数柱状值5次中破产次数
GPT-5.6 SolOpenAI14.31倍1000
Claude Opus 4.8Anthropic4.98倍350
Qwen3.8-Max-Preview阿里巴巴4.16倍290
Qwen3.7-Max阿里巴巴1.65倍120
Qwen3.6-Plus阿里巴巴0.47倍30
Qwen3.5-Plus阿里巴巴0.01倍14

OpenAI的模型最终留下的资产是阿里巴巴自家最新模型的三倍多,而阿里巴巴的一款旧模型几乎把本金全部亏光。表格中还记录到,GPT-5.5、Claude Opus 4.6Gemini 3.1 Pro也分别在5次测试中破产了2次。在长期自主经营这一考验面前,排行榜的名次和平时熟知的语言能力排名出现了明显错位。

알리바바 벤치마크서 오픈AI가 알리바바를 이겼다
이미지: @Alibaba_Qwen (X)

任何人都能查证的资料

阿里巴巴通义千问团队在官方博客上发布了这个基准的介绍文章,详细方法论则发表在arXiv论文中。基准专属页面ecbench.github.io也可以查看结果。模拟环境和评分代码都公开在github.com/QwenLM/E-CommerceBench仓库上,任何人都可以接入其他模型,亲自跑一遍同样的测试。

알리바바 벤치마크서 오픈AI가 알리바바를 이겼다
이미지: @Alibaba_Qwen (X)

编辑视角

值得注意的是,阿里巴巴把"自家模型在自家出的测试里没拿第一"这个结果原原本本地公开了出来。过去模型开发商推出的基准测试,大多会伴随着自家模型名列前茅的结果一起发布,这次却呈现出完全相反的画面。这或许是因为阿里巴巴在设计这个基准时,没有采用"一题一答"式的评分方式,而是用确定性谈判内核和动态经济引擎搭建了一套很难提前"押中标准答案"的结构。这也是一个信号:出题方把测试设计得连自己都难以操控结果。

把这类长期自主运营型测试代入实际业务场景,会发现一个反复出现的规律:擅长短问答的模型,和能在数百次决策累积之后依然不崩盘的模型,其实是两种不同的能力。像这次一样,语言基准排名靠前的模型在长期模拟中破产,这种情况一旦反复出现,就说明实际业务中若要把预算支配权交给智能体,不能只看语言能力排行榜来挑模型。

如果国内的电商或物流企业正在考虑让AI智能体来负责下单、定价的实验,这份成绩单里真正该关注的不是第一名的资产倍数,而是破产比例。5次测试中有几次把本金彻底亏光,在真金白银的实际场景中,这个指标往往比平均收益率更值得重视。就目前阶段而言,更稳妥的做法是保留人工审批这道安全阀,只让智能体在有限的预算范围内自主决策。

未来几周内,很可能会有其他开发商把自家模型接入这个仓库,给出可复现的测试结果。阿里巴巴下一代Qwen能在这项测试中把排名提升多少,将是检验这个基准是否可信的下一个关键节点。

评论