정보 추출
Information Extraction
문서 속 이름·날짜·금액 같은 특정 정보를 컴퓨터가 찾아내 정리된 형태로 뽑아내는 작업이다.
쉽게 말하면
정보 추출은 두꺼운 문서를 처음부터 끝까지 읽고 필요한 항목만 골라 표로 정리해주는 작업이다. 계약서 백 장을 훑으며 회사명과 계약 기간, 위약금 조항만 형광펜으로 표시해 엑셀에 옮겨 적는 인턴을 떠올리면 된다. 이 반복 작업을 컴퓨터가 대신하도록 만든 것이 정보 추출이다.
문제는 '얼마나 유연하게' 찾아내느냐다. 정해진 항목만 빠르게 찾는 방식은 저렴하지만 새로운 형태의 항목이 나오면 손을 못 쓴다. 반대로 무엇이든 물어보면 답해주는 큰 언어 모델을 쓰면 유연하긴 한데, 문서 한 장 처리할 때마다 비용이 쌓인다. 또 하나의 함정은 길이다. 짧은 이름이나 날짜는 잘 찾아도 마흔 단어짜리 긴 면책 조항처럼 길게 이어지는 표현은 통째로 놓치기 쉽다.
그래서 최근에는 문서 전체를 한 번 훑되, 각 항목이 시작하는 지점과 끝나는 지점만 짚어내는 방식으로 이 딜레마를 줄이려는 시도가 나온다. 후보를 일일이 나열하지 않고 경계만 표시하면 계산량이 줄고, 길이에 상한을 둘 필요도 없어진다.
기사에서 이렇게 나와요
기사에서는 "문서에서 이름·날짜·조항 같은 정보를 뽑아내는 걸 정보 추출이라고 부른다"고 설명한다. 여기서 오해하기 쉬운 점은, 정보 추출이 문서를 요약하거나 질문에 답하는 것과는 다르다는 사실이다. 정보 추출은 특정 항목을 정확한 형태(이름, 날짜, 조항 등)로 뽑아내 구조화된 데이터로 남기는 작업이지, 문서의 뜻을 풀어 설명하는 작업이 아니다.
직접 해보기
챗봇에 아래처럼 요청해보면 정보 추출이 실제로 어떻게 동작하는지 감을 잡을 수 있다.
다음 문장에서 인물 이름, 날짜, 금액을 각각 찾아 표로 정리해줘.
"김민수 대표는 2024년 3월 15일 계약금 5천만 원을 지급하기로 합의했다."
결과를 받은 뒤 문장을 길고 복잡하게 바꿔가며 다시 물어보면, 짧은 항목은 잘 찾아내도 길게 이어지는 조건절 같은 항목은 놓치는 경우를 직접 확인할 수 있다.
함께 볼 용어
이 용어가 나온 기사
- Fastino, GLiNER2.5 공개…개체 추출 길이 제한 없애AI · 2026.08.25
- 美 금리 상승에 흔들리는 AI 랠리, AMD 신형 EPYC·GPT-5.6 가격 인하까지비즈니스 · 2026.08.18
- GLM-5.3 API 공개, 터미널벤치 점수 4.6→28.3으로 급등AI · 2026.08.19
- 넷플릭스, 추천 엔진에 자체 언어모델 GenRec 시범 투입AI · 2026.08.22
- 구글, 온디바이스 오프라인 음성 번역기 '젬마 트랜슬레이터' 공개AI · 2026.08.09
- LiteLLM 공급망 공격으로 2,500개 조직 자격증명 유출비즈니스 · 2026.08.13
