
이미지: METAL
요약
- 오픈AI가 10월 9일 아사나가 GPT-6.1 Sol 기준으로 브라우저 에이전트를 최적화해 모델 비용을 76배, 실행 시간을 5배 줄인 사례를 공개했다.
- Codex의 GPT-6 Astra가 캐시에 빠진 탐색 기록을 찾아냈고, 기록 한도 2종·정책 6종·모델 4종을 세 번씩 돌린 144회 실험을 수행했다.
- 모델 B도 최적화만으로 비용이 29배 줄었고, Sol은 큰 기록 한도에서 18회 모두 정답을 냈다.
- 발표
- 2026년 10월 9일 · 오픈AI 고객 사례
- 대상
- 아사나가 인수한 스택AI의 노코드 브라우저 에이전트
- 결과
- GPT-6.1 Sol 최적화 판 1회 평균 0.47달러·약 4분 · 원래 운영 설정(모델 B) 대비 76배 저렴·5배 빠름
- 기존
- 모델 B 개발 기준선 최소 36.21달러·최소 22.5분
- 모델 B 최적화
- 1.24달러(29배 절감) · 4.7분
- 모델 C 최적화
- 0.66달러 · 3.5분(원문 도표)
- Sol 단독
- 1.97달러 → 0.47달러(4배) · 입력 89% 캐시, 정가의 5% · 호출당 약 3배 저렴
- 실험
- 144회 · 기록 한도 12만·48만 자 × 정책 6종 × 모델 4종 × 3회
- 모델
- A: 타 연구소 소형, 2025년 가을, Sol 절반 가격 · B: 기존 운영, 2026년 여름, Sol과 같은 가격 · C: B 개정판, 2026년 가을
- 과제
- 공개 데모 카탈로그 책 32권 × 항목 6개 수집
- 최적 정책
- 스크린샷 20장 누적 후 최근 1장만 남기고 삭제 + 48만 자 기록 한도
- 답 산출
- Sol 작은 한도 18회 중 3회 → 큰 한도 18회 모두 정답
- 소요
- 수작업 1~2개월 추정 → 약 1주
- 기록
- 모든 세션 요청·데이터·결과를 아사나 커맨드에 기록 → 티켓 → 풀 리퀘스트 → 운영
- 인물
- 프랭크 이달고 스택AI CTO · 아르납 보스 아사나 CPO
- 후속
- 스택AI 브라우저 탐색에 반영 완료 · 플랫폼 평가 기능 편입 계획 · 출시 전 기능 시험에 Astra 사용
업무 관리 기업 아사나(Asana)가 노코드 브라우저 에이전트의 모델 비용을 시험 환경에서 76배 줄였다. 오픈AI는 10월 9일 공개한 고객 사례에서 아사나가 오픈AI의 코딩 에이전트 Codex에서 GPT-6 Astra로 실험을 돌려 브라우저 에이전트의 작업 흐름을 GPT-6.1 Sol 기준으로 최적화했고, 그 결과 1회 실행당 모델 비용 추정치가 평균 0.47달러, 실행 시간이 약 4분으로 줄었다고 밝혔다. 원래 운영 설정보다 76배 싸고 5배 빠른 수치다.
대상은 아사나가 인수한 AI 플랫폼 스택AI(StackAI)의 브라우저 에이전트다. 고객은 스택AI에서 코드를 쓰지 않고 웹사이트를 돌아다니며 양식을 채우고 정보를 모으는 작업 흐름을 만든다. 아사나 규모에서는 이런 작업 흐름의 작은 비효율이 쌓여 큰 비용이 된다. 스택AI 최고기술책임자(CTO) 프랭크 이달고(Frank Hidalgo) 박사가 에이전트를 더 싸고 빠르게 만드는 일을 맡았고, 조사와 개선 시험, 결과 비교를 Codex 안의 GPT-6 Astra에 맡겼다.
Astra가 먼저 찾은 것은 캐시의 빈틈이었다. 에이전트는 고정 지시문과 도구 정의는 캐시에 담았지만, 탐색하며 쌓이는 페이지 텍스트와 스크린샷 기록은 담지 않았다. 그래서 요청을 보낼 때마다 그 기록 전체를 정가로 다시 보냈다. 에이전트는 거의 매 단계 오래된 스크린샷을 지우고 텍스트를 잘라 냈는데, 그때마다 기록이 바뀌어 기록만 캐시에 담는 것으로는 효과가 없었다. 잘려 나간 사실 때문에 이미 읽은 페이지를 다시 찾아가야 하는 일도 생겼다.
이달고는 Astra가 낸 수정안 가운데 세 가지를 골랐다. 탐색 기록까지 캐시를 넓히고, 남겨 두는 텍스트 양을 늘리고, 스크린샷을 매 단계가 아니라 몰아서 지우는 방안이다. Astra는 어떤 변수가 중요한지 가리는 짧은 시험부터 돌린 뒤, 통제 실험용으로 짜이지 않은 코드를 하나의 프론트엔드와 백엔드에서 설정이 다른 작업 흐름 여러 개를 동시에 돌릴 수 있게 고쳤다.
본 실험은 144회 실행이다. 기록 한도 12만 자와 48만 자, 캐시·스크린샷 정책 6가지를 네 모델에서 각각 세 번씩 돌렸다. 네 모델은 GPT-6.1 Sol과 다른 프론티어 연구소의 모델 A·B·C다. 모델 A는 2025년 가을에 나온 더 작은 모델로 Sol의 절반 가격이고, 원래 운영에 쓰던 모델 B와 그 개정판 모델 C는 Sol과 같은 가격이다. 과제는 공개 데모 카탈로그에서 책 32권의 항목 6개씩을 모으는 일로, 실제 아사나 고객이 스택AI에서 돌리는 작업을 본떴다. 가장 좋은 정책은 스크린샷을 20장까지 쌓았다가 가장 최근 한 장만 남기고 지우는 방식이었다. 지우는 사이사이 앞쪽 기록이 오래 그대로 유지돼 캐시가 살아난다.
비용은 단계마다 줄었다. 모델 B는 최적화만으로 1회 비용이 최소 36.21달러에서 1.24달러로 29배 내려갔고, GPT-6.1 Sol의 최적화 판은 거기서 다시 2.6배 싼 0.47달러였다. Sol 하나만 놓고 보면 큰 기록 한도에서 새 캐시·스크린샷 정책이 비용을 1.97달러에서 0.47달러로 4배 낮췄다. 입력의 89%가 캐시에서 정가의 5% 값으로 나와 호출 한 번이 약 3배 싸졌다. 메탈이 확인한 원문 도표를 보면 모델 C 최적화 판도 0.66달러, 3.5분까지 내려왔다. 실행 시간만 보면 Sol의 4.0분보다 모델 C가 빨랐고, 76배 차이의 대부분은 모델 교체가 아니라 기록 관리를 고친 데서 나왔다.
기록 한도는 답을 내느냐 마느냐도 갈랐다. GPT-6.1 Sol은 작은 기록 한도에서 18회 중 3회만 답을 냈지만, 큰 한도에서는 18회 모두 정답을 냈다. 최적화된 작업 흐름의 모든 실행이 과제를 끝내고 정답을 돌려줬다고 오픈AI는 밝혔다. 모든 세션의 요청과 데이터 기록, 결과는 아사나의 소프트웨어 배포 플랫폼 커맨드(Command)에 남았고, 결과는 티켓과 풀 리퀘스트를 거쳐 실제 서비스에 반영됐다.

이달고는 "손으로 했다면 한두 달이 걸렸을 일"이라며 "Codex의 GPT-6 Astra로는 약 일주일이 걸렸다. 자기 전에 목표를 걸어 두고 아침에 결과를 검토했다"고 말했다. 그는 "예전에는 비용 때문에 이 작업에 고객에게 내줄 수 있는 모델이 제한됐다"며 에이전트를 효율화해 더 낫고 빠른 모델을 주면서도 운영비를 낮출 수 있게 됐다고 설명했다. 아르납 보스(Arnab Bose) 아사나 최고제품책임자(CPO)는 "엔지니어가 방향을 정하고 GPT-6 Astra가 실험을 돌렸으며, 결과는 커맨드를 거쳐 운영에 들어갔다"며 이것이 사람과 에이전트로 이뤄진 팀의 실제 모습이라고 밝혔다.
메탈은 오픈AI의 GPT-6.1 Sol 공개를 보도한 바 있다. 아사나는 이번 변경을 스택AI의 브라우저 탐색에 이미 반영했고, 비슷한 실험을 되풀이하기 쉬운 도구를 만들고 있다. 앞으로는 이 시험을 플랫폼 평가 기능에 넣어 고객과 내부 팀이 에이전트를 설정할 때 비용과 실행 시간, 답의 품질을 비교하게 할 계획이다. 아사나는 출시 전 제품 기능 시험에도 Astra를 쓰고 있다. Astra가 플랫폼을 돌아다니며 여러 입력을 넣어 보고 버그를 사람 QA 담당자에게 보고하는 방식이다. 이달고는 "출시 속도는 더 이상 병목이 아니고, 사람의 주의력이 병목"이라고 말했다. 이 사례가 보여 주는 것은 에이전트 비용의 상당 부분이 모델 단가가 아니라 기록을 어떻게 쌓고 지우느냐에 달려 있다는 점이고, 그 설계를 찾는 실험마저 에이전트가 맡기 시작했다는 점이다.





댓글