
요약
- Nous Research가 자사 에이전트 Hermes의 '브라우저 사용 모드'를 공개했다
- 12개 브라우저 도구를 browser_use CLI 3.0 기반 단일 도구로 대체했다
- 자체 테스트에서 토큰 사용량이 48~66% 줄었고 정확도 저하는 없었다고 밝혔다
- 발표 주체
- Nous Research
- 기존 도구 수
- 브라우저 도구 12개
- 변경 후
- browser_use CLI 3.0 기반 단일 도구
- 토큰 절감폭
- 48~66% (자체 테스트 기준)
- 정확도 변화
- 저하 없음
도구 열두 개가 하나로 줄었다
Nous Research가 자사 에이전트 Hermes에 새로운 '브라우저 사용 모드'를 적용했다고 밝혔다. 기존에는 클릭, 스크롤, 입력 등 브라우저 조작을 위해 열두 개의 별도 도구를 두고 있었는데, 이를 browser_use의 CLI 3.0이 구동하는 단일 도구로 대체했다. 회사는 "에이전트가 매 클릭마다 도구를 호출하는 대신 스크립트를 작성한다"고 설명했다. 자체 테스트에서 토큰 사용량이 48~66% 줄었고, 정확도 저하는 없었다고 밝혔다.
도구 호출이 왜 비쌌나
AI 에이전트가 웹 브라우저를 조작하려면 원래 매 동작마다 LLM에게 "이 버튼을 눌러라", "이 칸에 글자를 입력해라" 같은 요청을 하나씩 보내야 한다. 이런 방식을 '도구 호출(tool call)'이라고 부르는데, 요청마다 사용 가능한 도구 열두 개의 설명서(스키마)를 통째로 모델에 다시 넣어줘야 한다. 클릭 한 번에도 이 설명서 전체가 매번 딸려가니, 대화가 길어질수록 낭비되는 토큰 — LLM이 텍스트를 처리하는 최소 단위이자 요금·속도의 기준이 되는 조각 — 이 눈덩이처럼 불어난다.
Nous Research가 택한 방식은 다르다. 에이전트가 여러 동작을 한 번에 코드 스크립트로 작성해 실행하도록 한 것이다. 이렇게 하면 매 클릭마다 열두 개짜리 설명서를 다시 보낼 필요가 없다. 이런 '코드로 행동을 표현하는' 접근은 최근 에이전트 설계 진영에서 여러 연구자들이 시도해온 방향과 맞닿아 있다. Nous Research는 오픈소스 LLM 계열 Hermes로 알려진 개발사로, 이번 발표 역시 오픈소스 생태계를 겨냥한 실험으로 보인다. browser_use는 AI 에이전트가 실제 웹사이트를 클릭·입력·탐색할 수 있게 해주는 브라우저 자동화 프레임워크로, 이번에 CLI(명령줄 인터페이스) 3.0 버전이 Hermes의 새 모드를 구동하는 엔진 역할을 맡았다.
그래서 뭐가 달라지나
브라우저를 조작하는 AI 에이전트는 최근 클라우드 사업자와 스타트업 모두가 앞다퉈 내놓는 영역이다. 문제는 항상 비용이었다. 웹페이지를 여러 단계 거쳐 조작하는 작업일수록 토큰 소모가 커져 실제 서비스에 올리기 부담스러웠기 때문이다. 이번 개선이 사실이라면, 같은 작업을 절반 이하의 토큰으로 처리할 수 있다는 뜻이라 에이전트를 상시 돌리는 서비스의 운영 비용을 낮추는 데 도움이 될 수 있다. 다만 이는 Nous Research 자체 테스트 결과이며, 다른 독립 벤치마크로 검증됐는지는 확인되지 않았다.
클로드 기반 AI 비서, 헬스장 시스템 뚫어 예약 새치기





댓글