METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

오픈AI, GPT-6 이미지 인식 버그 수정

GPT-6 Sol과 Luna의 이미지 인코딩 버그를 고치자 Luna의 시각 그라운딩 점수가 28.8%에서 60.0%로 올랐어요. 오픈AI는 이미지 입력을 쓰는 개발자에게 평가를 다시 돌리라고 권했어요.

오픈AI, GPT-6 이미지 인식 버그 수정 · Image: METAL LAB

이미지: METAL

요약

  • 오픈AI가 GPT-6 Sol과 GPT-6 Luna의 이미지 인식을 떨어뜨리던 이미지 인코딩 버그를 수정했다고 9월 27일 X에서 밝혔고, API 변경 기록에는 9월 25일자로 올렸어요.
  • 공개된 도표에서 GPT-6 Luna(Max)의 RefCOCOg 시각 그라운딩 점수(평균 IoU)는 수정 전 28.8%에서 수정 후 60.0%로 올랐어요.
  • 오픈AI는 이미지 입력을 쓰는 개발자에게 평가를 다시 돌리고 영향받은 워크플로를 재시도하라고 권했어요. 3월 GPT-5.4 인코더 버그 때는 조치가 필요 없다고 했던 것과 달라요.
발표
2026년 9월 27일(미국 시간) @OpenAIDevs X 게시물 · API 변경 기록 9월 25일자 Fix 항목
대상
GPT-6 Sol(gpt-6-sol) · GPT-6 Luna(gpt-6-luna) · API와 Codex, 컴퓨터 사용 포함
원인
이미지 인코딩 버그(변경 기록)
수치
GPT-6 Luna(Max) RefCOCOg 시각 그라운딩 평균 IoU 28.8% → 60.0%
권고
이미지 입력 사용 시 평가 재실행·영향받은 워크플로 재시도
출시
2026년 9월 22일 API 공개 · 텍스트·이미지 입력 추론 모델
선례
2026년 3월 13일 GPT-5.4 input_image 이미지 인코더 버그 수정(조치 불필요로 안내)

오픈AI가 GPT-6 Sol과 GPT-6 Luna의 이미지 인식 성능을 떨어뜨리던 버그를 수정했다고 9월 27일(미국 시간) 밝혔어요. 오픈AI 개발자 계정은 X에 "API와 Codex에서, 컴퓨터 사용을 포함한 시각 작업의 결과가 이제 더 좋아졌을 것"이라고 적었어요. 함께 올린 도표에서 GPT-6 Luna(Max)의 시각 그라운딩 점수는 수정 전 28.8%에서 수정 후 60.0%로 두 배 넘게 뛰었어요. 두 모델이 나온 지 닷새 만의 일이에요.

문제는 모델이 아니라 그림을 넣는 입구에 있었어요. 오픈AI API 변경 기록은 9월 25일자 항목에서 원인을 "이미지 인코딩 버그"로 적었어요. 이미지 인코더는 픽셀을 모델이 읽을 수 있는 내부 표현으로 바꾸는 단계예요. 이 단계가 어긋나면 추론이 시작되기도 전에 글자나 버튼, 화면 배치 같은 시각 정보가 흐려진 채로 모델에 들어가요.

변경 기록에 따르면 두 모델은 9월 22일 gpt-6-sol과 gpt-6-luna라는 이름으로 API에 풀렸어요. 텍스트와 이미지를 함께 입력받아 텍스트를 내는 추론 모델이고, Responses API와 Chat Completions API로 쓸 수 있어요. 출시일부터 수정 기록일까지 사흘, X 공지까지는 닷새가 걸렸어요. 메탈은 오픈AI가 GPT-6 Sol과 Luna를 공개한 소식을 보도한 바 있어요.

메탈이 확인한 도표는 RefCOCOg 벤치마크 결과예요. RefCOCOg는 "왼쪽 탁자 위의 빨간 컵"처럼 문장으로 가리킨 물체를 사진 속에서 찾아 상자로 둘러싸게 하는 시험이고, 점수는 모델이 그린 상자와 정답 상자가 얼마나 겹치는지를 뜻하는 평균 IoU로 매겨요. 28.8%에서 60.0%로 31.2%포인트가 오른 셈이에요. 오픈AI가 수치를 공개한 것은 Luna의 이 한 항목뿐이고, Sol의 변화 폭은 따로 밝히지 않았어요.

이 점수가 중요한 이유는 컴퓨터 사용 에이전트의 작동 방식에 있어요. 에이전트는 화면 캡처를 보고 어디를 누를지 정해요. 물체의 위치를 문장과 맞춰 찾는 능력이 제 실력의 절반에도 못 미쳤다면, 버튼을 잘못 누르거나 입력 칸을 헷갈리는 일이 그만큼 잦았을 수 있어요. 오픈AI는 출시 발표문에서 GPT-6 Sol이 OSWorld 2.0 오프라인 세트에서 xhigh 설정으로 60.5%를 받아 Claude Opus 5의 medium 설정(60.3%)과 비슷한 점수를 작업당 약 80% 낮은 비용으로 냈다고 밝혔어요. 이 출시 수치가 버그의 영향을 받았는지는 공지와 변경 기록 어디에도 적혀 있지 않아요.

GPT-6 Luna(Max)의 RefCOCOg 시각 그라운딩 평균 IoU 비교 막대 도표. 버그 수정 전 28.8%, 수정 후 60.0%

오픈AI가 이번에 사용자에게 요청한 행동도 눈에 띄어요. 변경 기록은 "이미지 입력을 쓰는 사용 사례라면 평가를 다시 돌리고, 이 문제의 영향을 받은 워크플로를 재시도하기를 권한다"고 적었어요. 같은 변경 기록의 3월 13일 항목에는 GPT-5.4의 input_image 입력에서 생긴 이미지 인코더의 작은 버그를 고쳤다는 내용이 있는데, 그때는 "별도 조치는 필요 없다"고 썼어요. 반년 만에 같은 부위에서 버그가 다시 났고, 이번엔 개발자에게 재검증을 요청한 거예요.

보도에 따르면 이번 버그는 요청을 실패시키지 않았어요. 모델은 그럴듯한 답을 계속 내놨고, 개발자 쪽에서는 오류 메시지 대신 기대보다 낮은 평가 점수만 보였다는 거예요. 수정은 서버 쪽에서 이뤄져 코드를 바꾸거나 모델 버전을 옮길 필요는 없지만, 수정 전에 만들어진 답변과 캐시, 저장된 평가 기록은 그대로 남아요. 오픈AI 개발자 커뮤니티에도 개선 효과가 API와 Codex, ChatGPT 데스크톱 앱의 컴퓨터 사용에서 보일 것이라는 글이 올라왔어요.

두 모델이 닿는 범위는 넓어요. 오픈AI 출시 발표문에 따르면 GPT-6 Sol과 Luna는 ChatGPT Work와 Codex에서 Plus, Pro, Business, Enterprise, Edu 사용자에게 열렸고, Free와 Go 사용자는 데스크톱 앱에서 Luna를 쓸 수 있어요. 오픈AI는 두 모델을 GPT-6 Astra와 비슷한 방법으로 학습했고, 전문 업무와 코딩, 컴퓨터 사용에서 Astra의 성과를 더 빠르고 싼 모델로 옮겼다고 설명했어요. 보도는 Luna를 비용이 낮고 대량 처리에 맞춘 등급으로 소개했어요.

AI 엔지니어의 눈으로 보면 이번 일은 모델 교체만큼이나 서빙 경로의 변화가 평가를 흔든다는 사례예요. 모델 이름은 그대로인데 이미지가 들어가는 길이 바뀌었으니, 9월 22일부터 25일 사이에 돌린 비전 평가와 모델 선택 결정은 다른 조건에서 나온 결과가 됐어요. 에이전트를 운영하는 팀이라면 실행 시각을 평가 기록에 함께 남기고, 변경 기록의 수정 항목과 맞춰 보는 습관이 필요해졌어요. 같은 인코더 버그가 3월과 9월에 두 번 나왔다는 사실은, 모델 성능표보다 그 앞단의 입력 처리 기록을 더 자주 확인해야 한다는 신호예요.

김현국

METAL 발행인 · 아카이브저널 발행인 · 이라선 운영

매거진·서점·교육을 오래 해 온 편집자예요. 라이프스타일 매거진 <아카이브저널>을 발행하고, 아트 서점 <이라선>을 운영했으며, 라이카 아카데미에서 디렉터로 사진 교육 프로그램을 만들고 이끌었어요. 그 시선으로 전 세계 AI 소식을 독자에게 전하는 메탈(METAL) 매거진 편집장입니다.

이 에디터의 기사 더 보기 →

공유

댓글