모바일·웹·데스크톱을 한 모델로 다루는 GUI 에이전트, UI-Venus-2가 실제 화면 조작 성능을 끌어올렸다
모바일·웹·데스크톱을 한 모델로 다루는 GUI 에이전트, UI-Venus-2가 실제 화면 조작 성능을 끌어올렸다
UI-Venus-2는 화면을 보고 클릭·타이핑·스크롤 같은 동작을 수행해 작업을 자동화하는 GUI 에이전트로, 모바일 앱 170여 개와 데스크톱 OS까지 다루는 범위를 넓혔다. 딥리서치 기반으로 작업 지시문을 자동 생성하고, 궤적 단위와 샘플 단위 검증기로 강화학습 신호의 신뢰도를 높였다. 그 결과 UI-Venus-2-27B와 9B 모델을 여러 GUI 벤치마크에서 강력한 비교 모델들과 나란히 평가했다.
METAL LAB 해설 도표
UI-Venus-2 3단계 학습 파이프라인
증거 상태측정 결과와 예정된 검증이 함께 있음
- 중간학습모바일·웹·OS 환경에서 수집한 대규모 궤적으로 GUI 상호작용 지식을 먼저 주입한다.
- 도메인별 오프라인 강화학습Grounding, CAPTCHA, Mobile, Web, Computer 각 도메인을 개별적으로 스텝 단위 강화학습으로 최적화한다.
- 다중 교사 온폴리시 지식증류(MOPD)도메인별로 특화된 모델들을 하나의 UI-Venus-2 모델로 통합하며, 실행 동작 부분에 학습 신호를 집중시킨다.
- 궤적·샘플 검증시각적 키포인트와 다중 모델 투표로 궤적 단위, 행동 단위 검증을 수행해 신뢰할 수 있는 강화학습 보상을 공급한다.
무엇을 했나
- 모바일, 웹, 데스크톱 세 환경에서 화면을 보고 판단하고 실행하는 하나의 통합 반응-행동 루프로 동작하도록 설계됐다.
- 환경(170개 이상 다국어 모바일 앱과 데스크톱 OS), 작업(딥리서치 기반 지시문 생성), 검증(궤적 단위·샘플 단위 평가) 세 가지를 함께 확장하는 방식을 택했다.
- 학습은 대규모 궤적 기반 중간학습, 도메인별 오프라인 강화학습, 다중 교사 온폴리시 지식증류(MOPD) 세 단계로 진행됐다.
- MOPD 단계에서는 추론 문장과 실행 동작을 다르게 취급해, 실제 환경을 바꾸는 동작 부분에 더 집중적으로 학습 신호를 주는 구조를 도입했다.
- 로그인·회원가입 등에서 막히는 CAPTCHA를 처리하는 능력과, 위험할 수 있는 동작을 통제하는 안전 장치도 함께 통합했다.

| Models | MobileGym | VenusBench-Mobile | AndroidWorld | MobileWorld | KnowUBench | MemGUI |
|---|---|---|---|---|---|---|
| General VLMs | ||||||
| Qwen3.5-9B (Qwen Team, 2026a) | 9.0* | 15.3* | 57.8 | 18.0(18.0)* | 33.3 | 6.2* |
| Qwen3.6-27B (Qwen Team, 2026b) | 24.6* | 28.0* | 70.3 | 36.8(41.9)* | - | 25.7* |
| Claude-Opus-4.6 (Anthropic, 2026a) | - | 36.5* | - | 44.5 | - | - |
| Kimi-K2.6 (Moonshot AI, 2026a) | 38.7* | 31.2* | - | 55.6 | - | 39.1 |
| Kimi-K3 (Moonshot AI, 2026b) | - | - | - | 74.4 | - | - |
| Seed-2.0-Pro (Seed, 2026) | 52.0 | 20.1* | - | 63.2 | 51.6 | 65.6* |
| Seed-2.1-Pro (ByteDance Seed, 2026) | - | - | - | 73.2 | - | - |
| GPT-5.6-Sol (OpenAI, 2026) | - | - | - | 70.1 | - | - |
| GUI-specific Models | ||||||
| UI-Venus-1.5-8B (Team et al., 2026c) | 18.4* | 16.1 | 73.7 | 22.2* | 26.0 | 3.9* |
| UI-Venus-1.5-30B-A3B (Team et al., 2026c) | 21.5* | 21.5 | 77.6 | 17.1 | - | 10.9* |
| GUI-Owl-1.5-32B-Instruct (Xu et al., 2026) | 20.3* | - | 69.8 | 43.9 | - | 10.9 |
| MAI-UI-8B (Zhou et al., 2025b) | 21.5* | 12.7 | 70.7 | 27.5 | 26.0 | 17.2* |
| Qwen-UI-Agent-27B (Zhou et al., 2026) | - | - | - | 82.1(85.5) | - | - |
| Ours | ||||||
| UI-Venus-2-9B | 52.7 | 46.5 | 80.2 | 65.8(75.2) | 56.5 | 62.6 |
| UI-Venus-2-27B | 60.5 | 48.7 | 84.0 | 76.1(82.9) | 59.7 | 70.3 |

| Models | OSWorld-Verified | DeskCraft |
|---|---|---|
| General VLMs | ||
| Claude-Opus-4.8 (Zhou et al., 2026) | 83.4 | - |
| Qwen3.5-9B (Qwen Team, 2026a) | 41.8 | 14.6∗ |
| Qwen3.6-27B (Qwen Team, 2026b) | 62.0 | 28.7∗ |
| Kimi-K2.6 (Moonshot AI, 2026a) | 73.1 | 41.4∗ |
| Seed-2.0-Pro (Seed, 2026) | 62.3 | 40.0∗ |
| Seed-2.1-Pro (Zhou et al., 2026) | 78.8 | - |
| GPT-5.5 (Zhou et al., 2026) | 78.7 | - |
| GUI-specific Models | ||
| GUI-Owl-1.5-32B-Instruct (Xu et al., 2026) | 56.5 | - |
| Qwen-UI-Agent-27B (Zhou et al., 2026) | 79.5 | - |
| Ours | ||
| UI-Venus-2-9B | 70.8 | 48.0 |
| UI-Venus-2-27B | 80.5 | 55.5 |
| Models | WebVoyager | Online-Mind2Web | REAL | Odysseys | |
|---|---|---|---|---|---|
| Avg. | Perfect | ||||
| General VLMs | |||||
| Qwen3.5-9B (Qwen Team, 2026a) | 46.9∗ | 27.3∗ | 18.2∗ | 42.6∗ | 13.5∗ |
| Qwen3.5-4B (Qwen Team, 2026a) | – | – | – | 42.9 | 10.7 |
| Qwen3.6-27B (Qwen Team, 2026b) | 84.3∗ | 55.3∗ | 27.3∗ | 39.5∗ | 18.5∗ |
| OpenAI Operator (OpenAI, 2025) | 87.0 | 61.3 | – | – | – |
| GPT-5 (SoM) (Awadallah et al., 2026) | 90.6 | – | – | – | – |
| GPT-5.4 (Singh et al., 2025) | – | – | – | 55.4 | 33.5 |
| Seed-2.0-Pro (Seed, 2026) | 85.1∗ | 68.5∗ | 74.4∗ | 60.2∗ | 30.1∗ |
| GLM-5V-Turbo (Hong et al., 2026) | 88.5 | – | – | – | – |
| Claude-Opus-4.6 (Anthropic, 2026a) | 88.0 | – | – | 68.9 | 44.5 |
| Claude-Sonnet-4.6 (Anthropic, 2026b) | – | – | – | 49.8 | 31.0 |
| Kimi-K2.6 (Moonshot AI, 2026a) | 76.8∗ | – | 74.4∗ | – | – |
| GUI-specific Models | |||||
| UI-TARS-1.5 (Seed, 2025b) | 84.8 | 75.8 | – | – | – |
| UI-Venus-1.5-30B-A3B (Team et al., 2026c) | 76.0 | – | 38.0∗ | – | – |
| GUI-Owl-1.5-32B-Thinking (Xu et al., 2026) | 82.1 | – | 44.6∗ | – | – |
| MolmoWeb-8B (Gupta et al., 2026) | 78.2 | 35.3 | – | – | – |
| Fara1.5-4B (Awadallah et al., 2026) | 80.8 | – | – | – | – |
| Fara1.5-9B (Awadallah et al., 2026) | 86.6 | 63.4 | – | – | – |
| Fara1.5-27B (Awadallah et al., 2026) | 89.3 | 72.3 | – | – | – |
| Ours | |||||
| UI-Venus-2-9B | 90.8 | 74.0 | 76.9 | 77.3 | 62.0 |
| UI-Venus-2-27B | 93.4 | 78.3 | 80.2 | 80.4 | 66.3 |

| Models | Grounding Benchmarks | |||
|---|---|---|---|---|
| VenusBench-GD | ScreenSpot-Pro | OSworld-G-R | UI-Vision | |
| General VLMs | ||||
| Qwen 3.7 Plus (Qwen Team, 2026c) | 75.2* | 68.9 | 78.2 | 68.0 |
| Seed 2.1 Pro (ByteDance Seed, 2026) | 73.9* | 65.3 | 78.0 | 62.0 |
| Kimi-K2.6 (Moonshot AI, 2026a) | 73.1* | 52.0* | 69.7* | 51.7* |
| Qwen3.6-27B (Qwen Team, 2026b) | 67.7* | 65.2* | 76.9* | 58.3* |
| GUI-specific Models | ||||
| UI-Venus-Ground-72B (Gu et al., 2025) | 70.2 | 61.9 | 69.5 | 36.8 |
| Holo2-30B-A3B (H-Company, 2025) | 59.5* | 66.1 | 76.1 | 40.9* |
| Step-GUI-4B (Yan et al., 2025) | 54.6* | 60.0 | 66.9 | 30.0* |
| MAI-UI-8B (Zhou et al., 2025b) | 65.2* | 65.8 | 68.6 | 40.7 |
| MAI-UI-32B (Zhou et al., 2025b) | - | 67.9 | 73.9 | 47.1 |
| UI-Venus-1.5-30B-A3B (Team et al., 2026c) | 75.0 | 69.6 | 76.4 | 54.7 |
| Qwen-UI-Agent-27B (Zhou et al., 2026) | - | 76.6 | 78.5 | 70.0 |
| Ours | ||||
| UI-Venus-2-9B | 77.1 | 73.0 | 78.5 | 53.2 |
| UI-Venus-2-27B | 80.1 | 74.1 | 79.1 | 66.9 |

| Models | VenusBench- CAPTCHA | MCA-Bench | Spatial- CAPTCHA-Bench | NextGen- CAPTCHAs | Open CaptchaWorld |
|---|---|---|---|---|---|
| General VLMs | |||||
| Qwen3.5-9B (Qwen Team, 2026a) | 28.3 | 30.4 | 4.9 | 2.8 | 36.4 |
| Qwen3.6-27B (Qwen Team, 2026b) | 53.0 | 51.7 | 31.0 | 14.1 | 47.7 |
| Seed-2.0-Pro (Seed, 2026) | 47.9 | 36.5 | 43.8 | 20.4 | 55.6 |
| Kimi-K2.6 (Moonshot AI, 2026a) | 39.7 | 38.7 | 24.8 | 7.2 | 47.8 |
| Claude-Opus-4.6 (Anthropic, 2026a) | 16.0 | 25.9 | 9.5 | 2.8 | 23.3 |
| Ours | |||||
| UI-Venus-2-9B | 78.1 | 75.7 | 42.8 | 47.6 | 50.7 |
| UI-Venus-2-27B | 79.9 | 79.6 | 48.6 | 54.5 | 56.3 |
| Model | OSHarm (ASR ↓) | OSBlind (ASR ↓) |
|---|---|---|
| General VLMs | ||
| Qwen3.5-9B (Qwen Team, 2026a) | 25.3 | 79.4 |
| Qwen3.5-27B (Qwen Team, 2026a) | 18.0 | 89.3 |
| Kimi K2.6 (Moonshot AI, 2026a) | 32.0 | 93.6 |
| GUI-specific Models | ||
| EvoCUA-8B (Xue et al., 2026) | 39.3 | 85.3 |
| EvoCUA-32B (Xue et al., 2026) | 33.3 | 90.7 |
| UI-TARS-1.5 (Seed, 2025b) | 36.0 | 83.3 |
| ScaleCUA (Lv et al., 2026) | 25.3 | 84.7 |
| Ours | ||
| UI-Venus-2-9B | 11.3 | 48.8 |
| UI-Venus-2-27B | 15.3 | 47.9 |
| Action | Definition |
|---|---|
| Shared Actions (All Platforms) | |
| Click(point=(x, y)) | Click at coordinates (x, y). |
| Drag(start=(x1, y1), end=(x2, y2)) | Drag from (x1, y1) to (x2, y2). |
| Swipe(start=(x1, y1), end=(x2, y2)) | Scroll by swiping from (x1, y1) to (x2, y2). |
| DoubleClick(point=(x, y)) | Perform a double-click/tap at coordinates (x, y). |
| LongPress(point=(x, y)) | Long press at coordinates (x, y) to trigger extra options. |
| Type(content=”) | Type the specified content. |
| Wait() | Wait for loading. |
| CallUser(content=”) | Request user takeover or additional information. |
| Finished(content=”) | Mark the task as completed, with optional information. |
| Mobile†† Coordinates are normalized to [0,999]. | |
| PressBack() | Press the ‘back’ button. |
| PressHome() | Press the ‘home’ button. |
| PressEnter() | Press the ‘enter’ button. |
| PressRecent() | Press the ‘recent’ button. |
| LaunchApp(app=”) | Launch the specified app. |
| GetScreenshot() | Take a screenshot and save it to the photo album. |
| Answer(content=”) | Answer the user’s questions as requested. |
| Desktop†† Coordinates are normalized to [0,999]. | |
| RightClick(box=(x, y)) | Right-click at (x, y) to open context menus. |
| Hotkey(keys=[‘ctrl’, ‘c’]) | Press a keyboard shortcut, e.g., Ctrl+C for copy. |
| Web †† Coordinates are normalized to [0,999]. | |
| Scroll(point=(x, y), direction=‘up/down/left/right’) | Scroll at (x, y) in the specified direction. |
| Launch(url=”) | Launch the target URL. |
| GetUrl() | Get the URL of the current browser tab. |
| TakeNote(content=”) | Record important information from the screenshot. |
| Hover(point=(x, y)) | Move the mouse cursor to coordinates (x, y) without clicking. |
| Hotkey(keys=(‘ctrl’, ‘c’)) | Press combination keys (up to 3). |
| SelectOption(index=3) | Choose an option from a native HTML select element. |
| PressBack() | Return to the previous page. |
실제로 확인된 결과
- Figure 1과 Table 1~5는 UI-Venus-2-27B와 9B를 MobileWorld, WebVoyager, Odysseys, VenusBench-CAPTCHA, VenusBench-GD 등 여러 벤치마크에서 선별된 강력한 비교 모델들과 나란히 평가한 결과를 보여준다.
- VenusBench-CAPTCHA는 219개 예시, 8가지 상호작용 유형(OCR 텍스트 입력, 순서 클릭, 회전, 드래그, 슬라이더 퍼즐 등)에 대해 Pass@1 지표로 평가됐다.
- Table 6은 OSHARM, OS-BLIND 벤치마크에서 공격 성공률(ASR, 낮을수록 안전) 기준으로 안전성을 평가했다.
- MOPD 단계에서 행동 유형별 조건부 지식증류 신호를 적용한 구조가 여러 GUI 도메인에서 더 견고한 통합 결과를 낸다고 보고됐다.
어디에 쓸 수 있나
- 로그인·양식 작성 등 반복적인 모바일·웹 업무를 화면 조작 방식으로 자동화하는 실험
- CAPTCHA 처리가 필요한 워크플로우 자동화 파이프라인 구축 시 참고 사례
- 데스크톱 OS 작업(파일 관리, 오피스 소프트웨어 조작 등)까지 아우르는 범용 에이전트 설계 참고
- 강화학습 보상 신호 검증 방법(궤적 단위·샘플 단위 다중 모델 투표) 설계 참고
한계와 남은 검증
- 논문이 밝힌 비교는 각 소스가 보고한 행동 스캐폴드나 평가 프로토콜이 서로 다를 수 있어 완전히 동일 조건 비교는 아니다.
- OSWorld-Verified 등 일부 벤치마크는 원 논문의 361개 과제 설정을 그대로 쓰지 않고 다른 과제 수(108개)로 평가돼 직접 비교에 제약이 있다.
- 안전 메커니즘은 OSHARM, OS-BLIND 두 벤치마크에서만 확인됐고, 더 넓은 실제 위험 상황에서의 검증은 언급되지 않았다.
- 다국어 모바일 앱 커버리지는 중국어 100여 개, 영어 70여 개 앱에 한정되어 있어 다른 언어권 앱에서의 성능은 확인되지 않았다.
- 웹 벤치마크는 라이브 사이트 상태가 평가 시점에 따라 달라질 수 있다고 논문 스스로 명시했다.
왜 중요한가
GUI 에이전트가 특정 벤치마크에서만 잘 작동하고 실제 앱·웹·데스크톱에서는 쉽게 무너지는 문제는 자동화 도구를 실무에 쓰려는 개발자들에게 큰 걸림돌이었다. 이 연구는 환경 범위, 작업 생성, 검증 신뢰도를 동시에 늘리는 접근으로 그 격차를 줄이려 한 시도라는 점에서 참고할 가치가 있다.
이 논문의 용어
- GUI 에이전트 · 화면을 보고 클릭·타이핑 같은 사람과 유사한 동작으로 프로그램을 조작하는 AI
- 오프라인 강화학습 · 이미 수집된 상호작용 기록만으로 보상을 학습하는 강화학습 방식
- 온폴리시 지식증류(MOPD) · 학생 모델이 스스로 만든 행동을 여러 교사 모델이 채점해 학생을 학습시키는 방식
- 궤적 · 한 작업을 수행하는 동안의 화면-행동 연속 기록
- VLM as a Judge · 비전-언어 모델이 다른 모델의 결과를 판정관처럼 평가하는 방법
최신 논문
- GUI 세계 모델은 화면 한 장은 그럴싸하게 만들지만, 여러 단계 이어붙이면 앱 정체성과 맥락을 자주 잃어버린다GUI 세계 모델은 화면 한 장은 그럴싸하게 만들지만, 여러 단계 이어붙이면 앱 정체성과 맥락을 자주 잃어버린다
- AI의 수학 풀이 과정을 한 줄 한 줄 뜯어보고 어떤 전략을 쓰는지, 어떤 해석에 갇혀 있는지 표시해서 정답 여부와 강화학습의 부작용까지 드러내는 분석 틀AI의 수학 풀이 과정을 한 줄 한 줄 뜯어보고 어떤 전략을 쓰는지, 어떤 해석에 갇혀 있는지 표시해서 정답 여부와 강화학습의 부작용까지 드러내는 분석 틀
- 52만 개 규모의 새 데이터셋이 멀티모달 AI에게 '말로만 풀지 말고 그려가며 생각하는 법'을 가르친다52만 개 규모의 새 데이터셋이 멀티모달 AI에게 '말로만 풀지 말고 그려가며 생각하는 법'을 가르친다
- 886, yyds, 彳亍 같은 중국 신조어를 LLM이 정말 이해하는지 테스트했더니, 뜻은 설명해도 원래 형태는 못 만드는 모델이 많았다886, yyds, 彳亍 같은 중국 신조어를 LLM이 정말 이해하는지 테스트했더니, 뜻은 설명해도 원래 형태는 못 만드는 모델이 많았다
- 컴퓨터공학 논문 심사만 배운 AI에게 생물학·화학·물리학 심사평까지 가르치는 데이터셋이 나왔다컴퓨터공학 논문 심사만 배운 AI에게 생물학·화학·물리학 심사평까지 가르치는 데이터셋이 나왔다
- AI 에이전트의 '실력'은 모델이 아니라 감싸는 틀(하네스)에서 나온다는 발견을 바탕으로, 그 틀을 작업마다 즉석에서 만들어주는 AI를 만들었다AI 에이전트의 '실력'은 모델이 아니라 감싸는 틀(하네스)에서 나온다는 발견을 바탕으로, 그 틀을 작업마다 즉석에서 만들어주는 AI를 만들었다
- AI 언어모델이 AAVE 같은 비표준 영어 방언에 매기는 '방언세'는 토큰화뿐 아니라 학습과 추론 전 단계에 걸쳐 남아 있다AI 언어모델이 AAVE 같은 비표준 영어 방언에 매기는 '방언세'는 토큰화뿐 아니라 학습과 추론 전 단계에 걸쳐 남아 있다
- 챗봇이 사용자 말에 계속 맞장구치면, 완벽하게 합리적인 사람도 결국 망상에 빠질 수 있다는 걸 수학적으로 보여준 연구챗봇이 사용자 말에 계속 맞장구치면, 완벽하게 합리적인 사람도 결국 망상에 빠질 수 있다는 걸 수학적으로 보여준 연구
METAL LAB 최신 기사
그림 출처: Venus Team et al., arXiv:2609.00028, arxiv-nonexclusive
