AI 에이전트가 실패했을 때, 잘못은 모델인가 도구인가 환경인가를 구분하는 분류법
AI 에이전트가 실패했을 때, 잘못은 모델인가 도구인가 환경인가를 구분하는 분류법
AI 에이전트(코딩 비서, 개인 비서, 멀티에이전트 시스템 등)가 실패했을 때 겉으로 보이는 결과만으로는 무엇을 고쳐야 할지 알 수 없다는 문제에서 출발한다. 이 논문은 실패를 '모델과 어떤 구성요소 사이의 상호작용'으로 표현하고 그 상호작용에서 누구 잘못인지를 표시하는 41가지 실패 유형 분류법을 제시한다. 4개의 최신 AI 모델을 심사자로 써서 사람이 매긴 라벨을 얼마나 재현하는지 확인했더니, 가장 잘 맞춘 모델이 사람과 코헨의 카파 0.76의 일치도를 보였다.
METAL LAB 해설 도표
실패를 '상호작용 경계선 + 잘못한 쪽'으로 표시하는 구조
증거 상태측정 결과가 보고됨
- 구성요소 정의에이전트를 모델, 사용자(owner), 채점자(grader), 제3자, 하네스(컨텍스트·메모리·도구), 환경(로컬·외부)으로 나눈다.
- 상호작용 경계선두 구성요소 사이의 관계(예: 모델—도구, 모델—메모리)를 하나의 단위로 삼아 실패를 그 경계선 위에 표시한다.
- 근본 원인 역추적연쇄적으로 이어진 오류 중 가장 처음 발생해 복구되지 않은 실패까지 거슬러 올라가 그 지점에 라벨을 붙인다.
- 41개 실패 유형 정리각 경계선마다 모델 잘못인지 상대 구성요소 잘못인지를 표시해 41가지 실패 유형으로 분류하며, 36개는 모델 쪽, 5개는 주변 구성요소 쪽 잘못이다.
- AI 심사자 검증GPT-5.5, Claude Opus 4.6/4.7/4.8이 40개 사례에서 사람 라벨을 얼마나 재현하는지 코헨의 카파로 측정했다.
무엇을 했나
- 에이전트 실패를 '결과'로만 보면 모델을 다시 훈련해야 할지, 도구 연결 코드(하네스)를 고쳐야 할지, 실행 환경을 바꿔야 할지 알 수 없다는 문제를 지적한다.
- 에이전트를 모델, 사용자(owner), 채점자(grader), 제3자, 하네스(컨텍스트·메모리·도구), 환경(로컬·외부)이라는 구성요소들의 집합으로 보고, 두 구성요소 사이의 '상호작용 경계선'과 '잘못한 쪽'을 함께 표시하는 방식으로 41가지 실패 유형을 정리했다.
- 여러 오류가 연쇄적으로 이어질 때는 가장 처음 발생해 복구되지 않은 실패까지 거슬러 올라가 그 지점에 라벨을 붙이는 고정 규칙을 사용했다.
- 공개 벤치마크, 모델 시스템 카드, 발표된 보고서, 실제 에이전트 실행 기록에서 40개의 사례를 골라 이 분류법을 검증했고, GPT-5.5와 Claude Opus 4.6/4.7/4.8 네 개 모델을 독립 심사자로 써서 사람이 매긴 카테고리 라벨을 얼마나 재현하는지 코헨의 카파로 측정했다.
- 카테고리(상호작용 경계선+잘못한 쪽) 일치도는 GPT-5.5가 사람과 카파 0.76으로 가장 높았고, Claude Opus 4.6과 4.7은 각각 0.71, Opus 4.8은 0.70이었으며, 심사자들끼리의 최고 일치도는 Opus 4.6과 4.8 사이 0.84였다.

| Component | Definition |
|---|---|
| Model | The policy that processes observations and produces outputs or actions. |
| Owner | The human or upstream system that gives the agent its task and defines what counts as success. |
| Grader | The mechanism used to evaluate whether the agent completed the task successfully; it is usually not visible to the agent. |
| Third party | An actor encountered during execution that does not act on behalf of the owner. The actor can be a human, organization, or agent, and the interaction may be adversarial, persuasive, or cooperative. |
| Context | The information available to the model during the current interaction, including instructions, conversation history, observations, and summaries. |
| Memory | A persistent store that outlives the active context, within or across sessions. |
| Tool | The bidirectional interface through which the model exchanges requests, messages, actions, observations, and responses with other components. This includes callable tools, communication channels, and wrappers that relay inputs and outputs. |
| Local env. | The agent’s immediate execution environment, such as the operating system, shell, filesystem, and runtimes. |
| External env. | Systems outside the agent’s immediate execution environment, such as remote services, websites, APIs, databases, and model-provider infrastructure. |

| Category | Failure mode | |||
|---|---|---|---|---|
| Model | Acc | F1 | Acc | F1 |
| GPT-5.5 | 0.80 | 0.69 | 0.72 | 0.64 |
| Claude-Opus-4.6 | 0.75 | 0.61 | 0.70 | 0.57 |
| Claude-Opus-4.7 | 0.75 | 0.63 | 0.62 | 0.53 |
| Claude-Opus-4.8 | 0.75 | 0.62 | 0.68 | 0.58 |

| Predicted cat. | Gold cat. | |||
|---|---|---|---|---|
| Model | Acc | F1 | Acc | F1 |
| GPT-5.5 | 0.72 | 0.64 | 0.72 | 0.62 |
| Claude-Opus-4.6 | 0.70 | 0.57 | 0.80 | 0.70 |
| Claude-Opus-4.7 | 0.62 | 0.53 | 0.70 | 0.58 |
| Claude-Opus-4.8 | 0.68 | 0.58 | 0.78 | 0.69 |
| Category | Failure mode | ||||||
|---|---|---|---|---|---|---|---|
| Agreement | Cov | P | R | F1 | P | R | F1 |
| ≥2 of 4 | 1.00 | 0.78 | 0.78 | 0.78 | 0.70 | 0.70 | 0.70 |
| ≥3 of 4 | 0.90 | 0.83 | 0.75 | 0.79 | 0.75 | 0.68 | 0.71 |
| 4 of 4 | 0.68 | 0.96 | 0.65 | 0.78 | 0.89 | 0.60 | 0.72 |
| Risk category | Source | Trajectory-observable harm | Examples |
|---|---|---|---|
| Excessive Agency | OWASP LLM06 | acted beyond granted permission, or took an unconfirmed risky/irreversible step | E2, E4, E6, E39 |
| Unbounded Consumption | OWASP LLM10 | looped or exhausted its budget without making progress | E19, E32, E33 |
| Rogue Agents | OWASP ASI10 | gamed its own grader / reward-hacked, deviating from the set objective | E12, E13 |
| Agent Goal Hijack | OWASP ASI01 | untrusted third-party input hijacked the agent’s goal or control flow | E15, E16 |
| Misinformation | OWASP LLM09 | fabricated content presented as genuine, completed work | E11, E28, E31 |
| Sensitive Information Disclosure | OWASP LLM02 | exposed or over-shared private data | E10 |
실제로 확인된 결과
- 카테고리(상호작용 경계선+잘못한 쪽) 재현에서 GPT-5.5가 사람과 코헨의 카파 0.76으로 가장 높은 일치도를 보였고, Claude Opus 4.6과 4.7은 각각 0.71, Opus 4.8은 0.70을 기록했다.
- 네 심사자끼리의 상호 일치도는 사람과의 일치도와 비슷한 수준이었으며, 가장 높은 쌍별 일치도는 Claude Opus 4.6과 4.8 사이 코헨의 카파 0.84였다.
- 구체적인 실패 유형까지 정확히 맞히는(failure-mode) 일치도는 카테고리 일치도보다 전반적으로 낮게 나타났다.
- 41개의 역할별 실패 유형 중 36개는 모델 잘못으로, 5개는 주변 구성요소(사용자·하네스·환경) 잘못으로 분류되었다.
어디에 쓸 수 있나
- 코딩 어시스턴트, 장기 실행 개인 비서, 멀티에이전트 시스템 등 다양한 에이전트 아키텍처에서 실패 로그를 분석할 때 '모델을 고칠지 도구 연결을 고칠지 환경을 바꿀지'를 정하는 공통 체크리스트로 쓸 수 있다.
- AI 모델을 심사자로 활용해 대규모 에이전트 실행 기록에서 실패 원인을 자동으로 분류하는 파이프라인의 출발점으로 삼을 수 있다.
- OWASP LLM 위험 분류와 연결해 실패 사례에 안전·보안 영향까지 함께 태깅하는 데 참고할 수 있다.
한계와 남은 검증
- 검증에 쓰인 40개 사례는 분류법의 다양한 경우를 보여주기 위해 선별된 것으로, 실제 현장에서 각 실패 유형이 얼마나 자주 일어나는지를 추정하는 데는 쓸 수 없다.
- 구체적인 실패 유형(failure mode)까지 정확히 맞히는 일치도는 카테고리 일치도보다 낮아, 세부 라벨 자동화의 신뢰도는 아직 더 검증이 필요하다.
- 원문 출처가 완전한 실행 기록이 아니라 이슈 보고서나 블로그 글 등 정보가 부족한 경우, 심사자와 사람 모두 근본 원인을 다르게 해석할 여지가 있다.
- 근본 원인을 추적하는 판단 자체가 어려운 경우(예: 뒤늦게 확인해야 할 정보의 인과 경로를 놓치는 경우)가 있어, 자동화된 심사자가 실제 원인 대신 표면적 증상에 라벨을 붙일 위험이 남아 있다.
왜 중요한가
에이전트 시스템을 만드는 팀이 실패 로그를 볼 때 '모델을 더 훈련시켜야 하나, 도구 연결 코드를 고쳐야 하나, 평가 환경을 손봐야 하나'를 판단할 공통 언어를 준다. AI 모델을 심사자로 써서 사람 라벨을 어느 정도 재현할 수 있다는 결과는, 이런 실패 분류 작업 자체를 자동화하는 데 이 방식이 쓰일 수 있다는 근거가 된다.
이 논문의 용어
- 하네스(harness) · 모델이 컨텍스트, 메모리, 도구 접근을 관리하도록 감싸는 소프트웨어 껍데기, 즉 에이전트를 구동하는 코드 틀
- 코헨의 카파(Cohen's κ) · 두 평가자(사람과 AI 등)가 매긴 라벨이 우연히 일치할 확률을 뺀 뒤 얼마나 일치하는지를 나타내는 통계 지표
- 상호작용 경계선(edge) · 모델과 다른 구성요소(사용자, 도구, 환경 등) 사이의 관계를 나타내는 연결선으로, 실패가 어디서 일어났는지를 표시하는 단위
- 에이전트-as-judge · 사람 대신 AI 에이전트가 증거를 스스로 조사하고 정리한 뒤 판정을 내리게 하는 평가 방식
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 비서가 뭘 기억할지 결정할 때, '물어봐야 할 순간'에 되레 세상에 확인하고 넘어간다AI 비서가 뭘 기억할지 결정할 때, '물어봐야 할 순간'에 되레 세상에 확인하고 넘어간다
- 단어 뜻이 언제 어떻게 변했는지, 문법 구조까지 뜯어서 보여주는 오픈소스 도구단어 뜻이 언제 어떻게 변했는지, 문법 구조까지 뜯어서 보여주는 오픈소스 도구
- AI로 주식 뉴스 요약해보니, 최신 검색보강 기법보다 오히려 단순 요약 방식이 더 정확했다AI로 주식 뉴스 요약해보니, 최신 검색보강 기법보다 오히려 단순 요약 방식이 더 정확했다
METAL LAB 최신 기사
그림 출처: Harsh Raj et al., arXiv:2607.28802, CC BY 4.0