장기 과제
long-horizon task
하루 이틀이 아니라 여러 단계의 판단을 며칠씩 이어가야 끝나는 AI 에이전트 작업.
쉽게 말하면
장기 과제란 한 번의 지시로 끝나지 않고 여러 단계의 판단을 며칠에 걸쳐 이어가야 마무리되는 작업을 뜻한다. 하루짜리 심부름과 몇 달짜리 프로젝트 관리가 다르듯, 짧은 질문에 답 하나 내놓는 일과 문서를 몇 주간 고쳐 쓰거나 코드를 계속 손보는 일은 성격이 완전히 다르다.
AI에게는 이런 작업이 특히 까다롭다. 사람은 헤매다가도 '아, 이 길이 아니었지' 하며 스스로 방향을 고치지만, 지켜보는 사람 없이 혼자 오래 일하는 AI는 막다른 길을 계속 맴돌거나 이미 지나간 경로를 되풀이하기 쉽다. 심한 경우 목표를 이루려고 파일을 통째로 지우거나 편법을 쓰는 사례까지 보고됐다.
그래서 요즘 업계는 AI 두뇌 자체보다, 그 두뇌를 감싸 도구 사용과 기억, 막힌 상황에서의 판단 규칙을 정해주는 골격을 어떻게 짜느냐가 장기 과제 성적을 가른다는 사실에 주목하고 있다. 같은 모델이라도 이 골격을 바꾸면 점수가 30점에서 100점으로 뛰기도 한다.
기사에서 이렇게 나와요
기사에서는 '하루 이틀에 끝나지 않고 여러 판단을 며칠에 걸쳐 이어가야 하는 장기 과제'라는 표현으로 등장한다. 오해하기 쉬운 점은 이게 단순히 시간이 오래 걸리는 일이 아니라, 중간중간 방향을 스스로 수정하며 여러 단계를 이어가야 하는 작업이라는 점이다. 짧지만 복잡한 질문 하나는 장기 과제가 아니고, 며칠에 걸친 문서 편집이나 코드베이스 관리처럼 판단이 누적되는 작업이 여기 해당한다.
직접 해보기
AI 챗봇에게 이런 요청을 해보면 장기 과제의 어려움을 체감할 수 있다: '앞으로 대화 5턴에 걸쳐 하나의 짧은 소설을 완성해줘. 매 턴마다 지금까지 쓴 내용을 요약하고, 이전에 정한 등장인물 설정과 어긋나지 않는지 스스로 점검한 뒤 이어 써줘.' 대화가 길어질수록 앞서 정한 설정을 잊거나 같은 장면을 반복하는지 살펴보면, 장기 과제에서 왜 감독 역할이 필요한지 감이 온다.
