METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

OpenAI修复GPT-6图像理解缺陷

OpenAI修复GPT-6 Sol和Luna的图像编码缺陷后,Luna的视觉定位得分从28.8%升至60.0%。OpenAI建议使用图像输入的开发者重新运行评测。

OpenAI修复GPT-6图像理解缺陷

图片:METAL

摘要

  • OpenAI于9月27日在X上表示,已修复一个导致GPT-6 Sol和GPT-6 Luna图像理解能力下降的图像编码缺陷;其API更新日志将这一修复记录在9月25日。
  • 在OpenAI公布的图表中,GPT-6 Luna(Max)在RefCOCOg视觉定位测试中的得分(平均IoU)从修复前的28.8%升至修复后的60.0%。
  • OpenAI建议使用图像输入的开发者重新运行评测,并重试受影响的工作流。3月修复GPT-5.4图像编码器缺陷时,OpenAI曾表示无需采取任何操作。

OpenAI于9月27日(美国时间)表示,已修复一个导致GPT-6 Sol和GPT-6 Luna图像理解能力下降的缺陷。OpenAI开发者账号在X上写道,用户"现在应该会在API和Codex中,包括计算机使用在内的视觉任务上看到更好的结果"。在同时发布的图表中,GPT-6 Luna(Max)的视觉定位得分从修复前的28.8%升至修复后的60.0%,提高了一倍多。这距离两款模型发布仅过去五天。

问题不在模型本身,而在图像进入模型的入口。OpenAI API更新日志在9月25日的条目中,将原因写为"图像编码中的一个缺陷"。图像编码器负责把像素转换成模型能够读取的内部表示。这一环节一旦出错,文字、按钮、界面布局等视觉信息在推理开始之前就已经以模糊的状态进入模型。

根据更新日志,这两款模型于9月22日以gpt-6-sol和gpt-6-luna的名称在API上线。它们是接收文本和图像输入、输出文本的推理模型,可通过Responses API和Chat Completions API调用。从发布到修复条目的日期相隔三天,到X上的公告则相隔五天。METAL此前曾报道OpenAI发布GPT-6 Sol和Luna的消息。

METAL核实的图表是RefCOCOg基准测试的结果。RefCOCOg要求模型在照片中找到一句话所描述的物体,例如"左边桌子上的红杯子",并用方框框出;得分采用平均IoU,衡量模型所画方框与正确方框的重合程度。从28.8%到60.0%,相当于提高了31.2个百分点。OpenAI公开的数字只有Luna的这一项,并未单独说明Sol的变化幅度。

这一得分之所以重要,在于计算机使用智能体的工作方式。智能体会查看屏幕截图,再决定点击哪里。如果它把文字描述与物体位置对应起来的能力连正常水平的一半都达不到,点错按钮或混淆输入框的情况就可能相应增多。OpenAI在发布公告中称,GPT-6 Sol在xhigh设置下于OSWorld 2.0离线测试集取得60.5%,与Claude Opus 5在medium设置下的60.3%相近,而每项任务的成本约低80%。无论是修复公告还是更新日志,都没有说明这些发布时的数字是否受到该缺陷影响。

GPT-6 Luna(Max)의 RefCOCOg 시각 그라운딩 평균 IoU 비교 막대 도표. 버그 수정 전 28.8%, 수정 후 60.0%

OpenAI这次要求用户采取的行动也值得注意。更新日志写道:"如果你的使用场景涉及图像输入,我们建议重新运行评测,并重试受该问题影响的工作流。"同一份更新日志中3月13日的条目记录了修复GPT-5.4在input_image输入上的一个图像编码器小缺陷,当时OpenAI写的是"无需采取任何操作"。半年之后,同一部位再次出现缺陷,而这一次OpenAI要求开发者重新验证。

据报道,这次缺陷并没有让请求失败。模型继续给出看似合理的回答,开发者看到的不是报错信息,而是低于预期的评测分数。修复在服务器端完成,因此无需修改代码或迁移模型版本,但修复前生成的回答、缓存和已保存的评测记录仍保持原样。OpenAI开发者社区也有帖子表示,改进效果应会体现在API、Codex以及ChatGPT桌面应用的计算机使用中。

这两款模型覆盖的范围很广。根据OpenAI的发布公告,GPT-6 Sol和Luna已在ChatGPT Work和Codex中向Plus、Pro、Business、Enterprise和Edu用户开放,Free和Go用户可在桌面应用中使用Luna。OpenAI表示,两款模型采用与GPT-6 Astra相似的方法训练,把Astra在专业工作、编程和计算机使用方面的进展带到了更快、更便宜的模型上。报道将Luna介绍为成本更低、面向大批量处理的档位。

从AI工程师的角度看,这件事说明服务路径的变化和更换模型一样会动摇评测结果。模型名称没变,图像进入模型的路径却变了,因此在9月22日至25日之间进行的视觉评测和模型选择决定,都是在不同条件下得出的。运营智能体的团队需要在评测记录中一并保存运行时间,并与更新日志中的修复条目相互核对。同一编码器部件在3月和9月两度出错,这提醒人们,比起模型的成绩表,更应经常检查模型前端的输入处理记录。

评论