METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

구글 딥마인드, Gemini 4 Argon 공개

구글이 새 프런티어 모델을 사이버 방어자에게 먼저 풀었다. 출력 토큰 한도는 100만 개로 늘렸고 일반 공개 날짜는 정하지 않았다.

구글 딥마인드, Gemini 4 Argon 공개 · Image: METAL LAB

이미지: METAL

요약

  • 구글 딥마인드가 9월 30일 새 프런티어 모델 Gemini 4 Argon을 공개하고 페어윈드 프로그램의 신뢰받는 사이버 방어자에게 먼저 배포했다.
  • Argon은 DeepSWE v1.1 77.9%, Vals Index 68.9%, AutomationBench 51.3%를 기록했지만 FrontierSWE v2와 Terminal-bench 4.0에서는 다른 모델이 앞섰다.
  • 구글은 출력 토큰 한도를 64K에서 1M으로 늘렸고, 오용 방어·프롬프트 인젝션·비정렬 감시·샌드박스 강화의 네 갈래 안전장치를 갖춘 뒤 넓게 공개하겠다고 밝혔다.
발표
2026년 9월 30일 · 구글 딥마인드 · 코라이 카부쿠오글루 수석부사장 겸 구글 최고AI아키텍트 명의
첫 배포
페어윈드 프로그램(Fairwind Program)의 신뢰받는 사이버 방어자·테스터
일반 공개
날짜 미정 · 유료 API 고객과 Google AI Ultra 구독자부터
정부 절차
미국 정부의 자발적 출시 전 모델 접근 절차에 참여
출력 토큰 한도
64K → 1M
양자 최적화
공개 기준선 대비 40% 개선 · 몇 분 만에
메모리 최적화
데이터센터 메모리 300TiB 이상 확보 · 총 절감 추정 500TiB~1PiB
Rust 이전
re2·libgav1 수만 줄 ~ Fuchsia Zircon 커널 80만 줄 이상
libgav1
SIMD 코드 3만2000줄 교체 · 기존 Rust 포트보다 2.7배 빠름 · 출력 동일
DeepSWE v1.1
Argon 77.9% · GPT-6 Astra 74.1% · Claude Opus 5.5 74.2% · Claude Fable 5.1 67.4%
Vals Index
Argon 68.9% (1위)
AutomationBench
Argon 51.3% · Claude Opus 5.5 42.5% · GPT-6 Astra 41.4%
Harvey 법률 에이전트
Argon 19.6% · 다른 세 모델 3.8~6.7%
LVBench
Argon 91.7%
1위 아닌 항목
FrontierSWE v2 GPT-6 Astra 65.5% vs Argon 55.0% · Terminal-bench 4.0 Claude Opus 5.5 66.4% vs Argon 57.4%
CWE-bench v1
68% 공동 1위 (Grok 4.7·GPT-6 Astra와 동률)
내부 취약점 벤치마크
20개 프로그래밍 언어 코드에서 노출 발견
위즈 Scan for Good
병원용 의료 소프트웨어의 민감 개인정보 노출 취약점 발견
페어윈드
9월 2일 시작 · 650곳 이상 파트너 · 첫 제공 Gemini 3.8 Flash Cyber + CodeMender (보도)
안전장치
오용 방어 · 간접 프롬프트 인젝션 방어 · 비정렬 감시 · 샌드박스 격리·봉인

구글 딥마인드가 9월 30일(현지시간) 새 프런티어 모델 Gemini 4 Argon을 공개했다. 실제 소프트웨어 엔지니어링과 법률·금융 같은 기업 지식 노동, 사이버보안 방어처럼 길고 복잡한 작업 흐름을 겨냥한 모델이다. 첫 배포 대상은 일반 사용자가 아니라 구글의 페어윈드 프로그램(Fairwind Program)에 참여한 신뢰받는 사이버 방어자들이다.

출시 순서 자체가 이번 발표의 첫 메시지다. 코라이 카부쿠오글루 구글 딥마인드 수석부사장 겸 구글 최고AI아키텍트는 발표문에서 "이 수준의 프런티어 역량을 안전하게 내놓으려면 단계적 접근이 필요하다"고 밝혔다. 구글은 미국 정부의 자발적 출시 전 모델 접근 절차에 참여하고 있으며, 초기 테스터의 피드백으로 가드레일을 다듬은 뒤 개발자와 기업, 소비자로 넓힐 계획이다. 일반 공개는 유료 API 고객과 Google AI Ultra 구독자부터 시작한다.

Argon은 이미 구글 사내 업무를 돌리고 있다. 구글에 따르면 수천 명의 직원이 특수 코딩 작업과 심층 조사, 글쓰기 품질에서 이 모델의 강점을 꼽았다. 양자 컴퓨팅 연구진은 중요한 응용의 병목이 되는 서브루틴의 시공간 자원(큐비트 수와 게이트 수의 곱)을 줄이는 데 Argon을 썼고, 한 사례에서는 몇 분 만에 공개된 기준선보다 40% 나은 결과를 냈다. Argon 에이전트 팀은 데이터센터 전체의 프로파일링 원격측정 자료를 분석해 메모리 최적화를 스스로 찾아 적용했고, 배포 뒤 300TiB가 넘는 메모리를 확보했다. 회사가 추정한 총 절감 규모는 500TiB에서 1PiB다.

코드 이전 작업의 규모도 크다. Argon 에이전트는 구글 곳곳의 C/C++ 코드를 Rust로 옮기고 있으며, re2와 libgav1 같은 핵심 라이브러리의 수만 줄에서 Fuchsia의 Zircon 커널 80만 줄 이상까지 범위를 넓혔다. 영상 디코딩 오픈소스인 libgav1에서는 기존 Rust 포트의 SIMD 코드 3만2000줄을 교체했다. 프로파일 기반 실험을 여러 차례 돌리고 컴파일러 출력을 분석해 컴파일러가 자동으로 벡터화할 수 있는 안전한 Rust 코드를 만들었고, 결과물은 출력 영상이 같으면서 기존 Rust 포트보다 2.7배 빠른 메모리 안전 디코더였다. 구글은 이런 대규모 재작성이 운영 반영 전에 자동·수동 감사와 에뮬레이션 테스트, 검토를 거친다고 덧붙였다.

긴 작업을 버티기 위한 설계 변경도 있다. 구글은 Argon의 출력 토큰 한도를 기존 6만4000개(64K)에서 100만 개(1M)로 늘렸다. 한 번의 실행 궤적 안에서 수십만 토큰을 생성하며 깊게 추론할 여유를 주면 어려운 문제를 한 번에 풀 수 있다는 것이 회사 측 설명이다.

구글이 공개한 비교표에서 Argon은 장기 소프트웨어 엔지니어링 과제를 재는 DeepSWE v1.1에서 77.9%를 기록했다. 같은 표의 GPT-6 Astra는 74.1%, Claude Opus 5.5는 74.2%, Claude Fable 5.1은 67.4%였다. 금융·코딩·법률·세무 업무를 미국 GDP 기여도로 가중한 Vals Index에서는 68.9%로 1위였고, 재피어의 업무 자동화 벤치마크 AutomationBench에서는 51.3%로 Claude Opus 5.5(42.5%)와 GPT-6 Astra(41.4%)를 앞섰다. 하비의 법률 에이전트 벤치마크에서는 19.6%로 나머지 세 모델의 한 자릿수 점수와 차이가 컸고, 긴 영상 이해를 재는 LVBench에서는 91.7%였다.

같은 표에는 Argon이 1위를 내준 항목도 함께 실렸다. FrontierSWE v2에서는 GPT-6 Astra가 65.5%로 Argon의 55.0%를 앞섰고, Terminal-bench 4.0에서는 Claude Opus 5.5가 66.4%로 가장 높았다. Argon은 57.4%였다. PostTrainBench와 Terminal-Bench Science 0.1, OSWorld-2.0에서도 다른 모델이 맨 위에 섰다.

Gemini 4 Argon과 GPT-6 Astra, Claude Fable 5.1, Claude Opus 5.5의 지식 노동·코딩·과학·장문맥·컴퓨터 사용·멀티모달·사이버보안 벤치마크 점수를 비교한 구글 공식 표

사이버보안은 이번 모델의 출시 경로를 정한 분야다. 구글은 Argon이 치명적인 소프트웨어 취약점을 스스로 찾고 검증하고 패치하도록 학습시켰고, 신뢰받는 방어자와 사내 팀에는 사이버 가드레일을 끈 상태로 제공한다. 보안 기업 위즈는 핵심 공공 기반시설을 무료로 점검하는 Scan for Good 활동에 Argon을 쓰고 있다. 구글에 따르면 이 과정에서 Argon은 전 세계 병원이 쓰는 의료 소프트웨어 전반에서 민감한 개인정보를 노출하는 치명적 취약점을 찾아냈다. 이전 프런티어 모델들이 놓친 위험이었다. 취약점 수정 능력을 재는 CWE-bench v1에서 Argon은 68%로 Grok 4.7, GPT-6 Astra와 공동 1위였고, 구글 내부 취약점 벤치마크에서는 20개 프로그래밍 언어에 걸친 코드에서 다양한 노출을 찾아냈다.

페어윈드 프로그램은 정부와 신뢰받는 파트너에게 구글의 사이버 방어 도구를 제한적으로 여는 창구다. 보도에 따르면 이 프로그램은 9월 2일 시작됐고 전 세계 650곳이 넘는 파트너가 참여하고 있으며, 첫 제공 도구는 Gemini 3.8 Flash Cyber와 CodeMender 하네스의 조합이었다. 메탈은 구글이 페어윈드 프로그램으로 정부·기업에 사이버방어 AI를 공개했다고 보도한 바 있다. 한 달 만에 그 창구로 들어간 첫 프런티어 모델이 Argon이다.

취약점 수정 능력을 재는 CWE-bench v1 순위표. Grok 4.7, Gemini 4 Argon, GPT-6 Astra가 68%로 공동 1위다

광범위한 공개에 앞서 구글은 네 갈래의 안전장치를 강화하고 있다고 밝혔다. 첫째는 오용 방어다. 사이버 공격과 화학·생물·방사능·핵(CBRN) 공격 요청은 거절하되 정당한 이중 용도 과학 연구는 지키도록 설계했고, 모델 내부 활성화를 감시해 오용을 잡아내는 기법을 개선했다. 둘째는 간접 프롬프트 인젝션 방어로, 구글은 Argon이 그레이스완의 간접 프롬프트 인젝션 벤치마크에서 가장 높은 견고성을 보였다고 주장했다. 셋째는 비정렬 감시다. Argon의 사고 사슬과 행동을 지켜보다가 사용자 의도를 벗어나면 실행을 멈춘다. 넷째는 고위험 학습과 평가 전에 샌드박스 환경을 격리하고 봉인하는 시스템 강화다.

비정렬 감시는 학습 단계에서도 돌았다. 구글은 비슷한 시스템으로 학습 실행을 감시해 전담 사고 대응팀에 경보를 보냈고, 감시 결과를 학습에 되먹이지 않도록 주의했다고 설명했다. 모델이 감시를 피하는 쪽으로 추론을 바꾸는 위험을 막기 위해서다. 카부쿠오글루 수석부사장은 "역량이 커지는 이 중대한 시기에 업계 전체가 추론의 투명성을 지켜 주기를 강하게 권한다"고 밝혔다. 모델의 생각이 읽혀야 비정렬을 찾아내고 진단할 수 있다는 논리다.

메탈이 확인한 구글 발표문 전문에는 일반 공개 날짜가 없다. 개발자와 기업, 소비자에게는 "가능한 한 빨리" 내놓겠다는 문장뿐이다. 비교표 상위권 점수보다 먼저 정해진 것은 누구에게 먼저 주느냐였고, 구글은 그 첫 줄에 공격자가 아닌 방어자를 세웠다. 프런티어 모델 경쟁의 기준이 성능 순위에서 배포 순서로 옮겨 가고 있다.

김현국

METAL 발행인 · 아카이브저널 발행인 · 이라선 운영

매거진·서점·교육을 오래 해 온 편집자예요. 라이프스타일 매거진 <아카이브저널>을 발행하고, 아트 서점 <이라선>을 운영했으며, 라이카 아카데미에서 디렉터로 사진 교육 프로그램을 만들고 이끌었어요. 그 시선으로 전 세계 AI 소식을 독자에게 전하는 메탈(METAL) 매거진 편집장입니다.

이 에디터의 기사 더 보기 →

공유

댓글