A Virtual Member of a Community of Practice for the Society of Petroleum Engineers: From Prototype to Deployment
석유공학자 모임에 배치된 AI 동료, ATHENA가 실전 배치까지 이어진 이야기
ATHENA는 석유가스 업계 전문가 커뮤니티를 위해 만든 챗봇형 AI 비서로, 정보 검색과 통찰(insight) 공유를 사람처럼 자연스럽게 돕는다. 초기 프로토타입 평가에서 기존 최신 RAG(검색 결합 생성) 시스템보다 작업 점수 152%, 생산성 283% 향상을 보였고, 이번 논문은 여러 문서를 종합하는 검색, 답변 검증, 더 정교한 통찰 추천 기능을 추가해 실제 SPE(Society of Petroleum Engineers) 연구 포털에 배치하기까지의 과정을 다룬다. 후속 평가에서도 기존 최신 RAG 대비 평균 점수 216% 향상, 실패율 0%, 생산성 215% 향상이라는 결과를 얻었다.
무엇을 했나
- 석유가스 산업 전문가 커뮤니티를 위해 질문에 답하고, 현장 경험(통찰)을 수집·공유하며, 사용자 수준에 맞춰 필요한 정보를 먼저 알려주는 AI 비서 ATHENA를 개발했다.
- 기존 방식은 키워드 검색이나 벡터 임베딩 검색 한 가지에 의존했지만, ATHENA는 질문을 여러 방식으로 재해석하고 위치·주제·문서 유형으로 태그를 붙인 뒤 이를 필터로 활용하는 '다중 가설 검색'을 도입해 검색 정확도(MRR)를 0.687로 끌어올렸다(비교 대상 임베딩 모델은 0.412, 0.376).
- 수백 개 문서에 흩어진 정보를 한 번에 모아 답하는 '배치 문서 읽기' 에이전트, 답변에 쓰인 문장의 페이지·인용문을 바로 확인할 수 있는 문서 뷰어를 추가해 정확성과 검증 가능성을 높였다.
- 사용자의 배경·행동·현재 작업을 반영하는 '사용자 역량 벡터'를 만들어 통찰 추천을 개인화했고, 그 결과 관련성 순위 지표(MRR)가 기존 방식 대비 500% 개선되고 필요한 추천 개수는 84% 줄었다.
- 비전문가 13명을 대상으로 한 평가에서 ATHENA는 기존 최신 RAG 기준 시스템 대비 평균 작업 점수 216%, 생산성 215% 향상, 실패율 100% 감소, 사용성 점수(KM-SUS) 28% 향상을 기록했고, 2025년 6월 SPE 연구 포털에 우선 사용자 25명에게 배치되었으며 2025년 4분기 전체 회원 확대가 예정되어 있다.

왜 중요한가
이 연구는 특정 산업(석유가스)에서 방대한 문서와 현장 경험을 다루는 AI 비서가 실험실 수준을 넘어 실제 132,000명 규모의 전문가 단체 서비스로 배치된 드문 사례를 보여준다. AI 검색·추천 시스템을 설계하거나 도입을 검토하는 사람에게, 검증 가능성과 신뢰 확보, 배치까지의 조직적 과정이 기술만큼 중요하다는 것을 보여주는 참고 사례가 된다.

이 논문의 용어
- RAG(검색 결합 생성) · 질문과 관련된 문서를 먼저 찾은 뒤 그 내용을 참고해 답을 생성하는 AI 기법
- MRR(평균 역순위) · 정답 문서가 검색 결과 상위에 얼마나 잘 위치했는지를 나타내는 지표, 높을수록 좋음
- 임베딩 · 문장이나 문서를 숫자 벡터로 바꿔 의미가 비슷한 것끼리 가깝게 배치하는 방식
- 에이전틱 AI · 하나의 큰 모델이 아니라 여러 역할을 맡은 AI 에이전트들이 협력해 작업을 수행하는 방식
- KM-SUS · 지식관리 시스템의 사용성을 측정하기 위해 새로 개발된 평가 척도
논문 원문 초록 (영문)
We describe the evolution of a virtual assistant, called ATHENA, designed to support the capture, retrieval, and dissemination of knowledge for members of a Community of Practice (CoP) related to the Oil and Gas sector. An evaluation of a first prototype involving 75 professionals from the Society of Petroleum Engineering (SPE) showed that ATHENA dramatically improved both their productivity and performance equality on a set of realistic well-planning tasks compare to their use of a state-of-the-art RAG baseline system. However, the evaluation also identified areas for improvement. This paper describes technical advances to our first prototype in the areas of multi-document retrieval, support for answer validation, and more focused proactive dissemination. Evaluation results show that this enhanced version of ATHENA provides better support for completing knowledge-intensive tasks related to well planning than does a state-of-the-art baseline. ATHENA has been integrated into the SPE Research Portal and is being deployed for use by the society's membership.
arXiv에서 원문 보기최신 논문
- Specification-delta-driven data governance: an empirical study of the {\guillemotleft}spec-delta{\guillemotright} as the unit of change in lakehouse data platforms데이터 플랫폼 변경도 코드처럼 '설계도 조각'을 붙여서 검토하면 어떨까: 실험 설계 논문
- Are LLMs becoming similarly creative? Evidence from three years of models최신 AI 챗봇일수록 서로 비슷한 답을 내놓는다는 3년치 조사 결과
- Auditing Cross-Lingual Fairness in Language Model WatermarkingAI 생성 텍스트를 잡아내는 워터마크 기술이 영어 아닌 언어에서는 훨씬 부실하게 작동하고, 그 격차는 개별 언어가 아니라 언어 계열 단위로 나타난다
- TESTNAV: Pareto-Guided Search for Compositional Robustness TestingAI 모델을 여러 손상이 겹친 입력으로 시험할 때, 굳이 다 테스트하지 않고도 '진짜 위험한 실패'만 골라내는 탐색법
- Optimal Skill Selection for LLM Agents with Provable Bicriteria GuaranteesAI 에이전트에게 어떤 '스킬 문서'를 몇 개나 줘야 잘 작동하는지, 수학적으로 최적해를 보장하며 골라주는 방법
- Reliable Financial Named Entity Recognition under Domain Shift금융 AI가 서류체 문장에서 배운 자신감은 트위터로 가면 거짓말이 된다
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- Robust Incomplete Multimodal Sentiment Analysis via Iterative Proxy Correction텍스트가 빠지거나 망가져도, AI가 그 자리를 대신할 '가짜 텍스트'를 한 번에 만들지 않고 여러 번 고쳐가며 감정을 더 정확히 읽어낸다
METAL LAB 최신 기사
그림 출처: John Boden et al., arXiv:2608.19199, arxiv-nonexclusive