Bridging Search and CRM: Productionizing AI Product Research Agents for Customer Re-Engagement
쇼핑몰 검색에서 이탈한 고객을 AI 에이전트가 다시 카톡(왓츠앱)으로 불러온 이야기
플립카트(Flipkart)는 '최고의 스마트폰'처럼 애매한 검색어를 남기고 떠나는 고객을 위해 여러 AI 에이전트가 협업해 상품을 조사하고 검증한 뒤 왓츠앱으로 추천 메시지를 보내는 시스템을 실제 서비스에 투입했다. 23일간 약 1만5천 건의 메시지를 보낸 결과 기존 왓츠앱 캠페인보다 클릭률이 약 285% 높았고, 사용자들이 메시지를 주변에 퍼 나르는 현상도 관찰됐다. 실제 구매와 매출(GMV) 증가로도 이어졌다.
무엇을 했나
- 검색 로그를 대규모 처리 엔진(PySpark)으로 걸러 '클릭 없음, 고소득 성향, best·latest 같은 주관적 단어 포함, 휴대폰 카테고리'에 해당하는 고관여 이탈 고객만 골라냄
- 질문분석 에이전트가 의도를 파악하고, 조사 에이전트가 구글 검색·리뷰·영상 등 외부 정보를 모아 후보 상품을 뽑은 뒤, 플립카트 검색 에이전트가 실제 재고·가격·배송 가능 여부에 맞춰 상품을 매칭
- 검토 에이전트가 사양과 출시일을 다시 검색해 사실관계를 확인하고 조건에 안 맞는 추천을 걸러내 허위정보(hallucination)를 줄임
- 모든 에이전트를 하나의 지휘자(오케스트레이터)가 관리하는 계층형 구조가, 순서대로만 실행하는 방식보다 지시사항 위반 오류를 훨씬 적게 만듦(2.2천 건 평가)
- 23일 실서비스에서 클릭률 약 285% 상승, 방문수가 메시지 발송량을 넘는 날이 다수 발생해 메시지 공유(포워딩) 효과 확인, 이후 15일간 실제 구매와 매출 증가로 이어짐

| % WA message reads | CTR | |
|---|---|---|
| AI Agent campaign | ~+8% | ~+285% |
| No. of products | spec accuracy | launch date accuracy |
|---|---|---|
| 2218 | 99.1 % | 99.2 % |
| Architecture | Instruction Violation Rate (%) |
|---|---|
| Centralized orchestration | 8.5% |
| Sequential Agents | 35.4% |
왜 중요한가
검색-추천-CRM을 따로 운영하던 기존 방식과 달리, AI 에이전트가 이탈 직전 고객을 잡아 다시 데려오는 실전 배치 사례를 구체적 숫자로 보여준다. 챗봇을 실험실이 아니라 실제 매출과 연결되는 마케팅 채널로 쓰는 법을 고민하는 실무자에게 참고가 된다.
이 논문의 용어
- PySpark · 대량의 데이터를 여러 컴퓨터에 나눠 빠르게 처리하는 분산 처리 도구
- CTR(클릭률) · 메시지를 받은 사람 중 실제로 링크를 클릭한 비율
- 오케스트레이터(orchestrator) · 여러 AI 에이전트의 실행 순서와 정보 전달을 관리하는 지휘 담당 에이전트
- GMV · 일정 기간 플랫폼에서 발생한 총 거래액
- UTM 태그 · 어떤 링크를 통해 방문했는지 추적하기 위해 URL에 붙이는 표시
논문 원문 초록 (영문)
Modern e-commerce platforms often operate search, recommendation, personalization, and CRM systems independently, limiting opportunities for proactive customer re-engagement. This is particularly challenging for exploratory intents such as best smartphones or latest 5G phones, where users may leave the platform for external research before purchasing. We present a scalable, production-deployed framework that bridges search and CRM workflows through
arXiv에서 원문 보기최신 논문
- FM-Bench: A Benchmark for Long-Horizon Management with Competing AgentsAI에게 축구 구단을 20년간 통째로 맡겨보니, 승패는 계산력이 아니라 '경영 감각'에서 갈렸다
- FinRCA-Bench: Benchmarking Evidence Retrieval and Reasoning for Financial AI SystemsAI가 '정답'을 맞혀도, 정작 증거는 못 찾는 경우가 대부분이었다 - 재무 이상거래 진단 AI의 숨은 약점
- FACET: Preserving Source Intent and Executable State in Terminal Task SynthesisAI 에이전트에게 '터미널 문제집'을 정합성 있게 만들어주는 파이프라인, FACET
- Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models음성·소리를 알아듣는 AI, 지시문 학습 없이 '연결 다리'만 훈련해도 충분하다
- Adversarial Review: Structured Disagreement for Grounded Agentic Code ReviewAI 코딩 에이전트, 에이전트 늘리기보다 '검토자 vs 비판자' 한 쌍이 더 똑똑하게 일한다
- Looped Language Models Improve Compositional Tool Calling생각을 여러 번 되짚는 AI가 여러 개의 도구를 순서대로 엮어 쓰는 일도 더 잘한다
- GenEx: A Graph-Based Representational Paradigm for SARS-CoV-2 Variant Detection via Codon Co-occurrence Networks바이러스 유전자 서열을 코돈끼리 서로 옆에 등장하는 관계망(그래프)으로 바꿔 변이를 구분하는 법
- Which Negatives Matter? Ask Your Text Encoder: Adaptive Similarity Margins for Dense-Caption Retrieval이미지-긴문장 검색 AI가 '이미 다 맞혔다'고 착각해서 정작 헷갈리는 문제를 못 배우던 버릇을 고쳤다
METAL LAB 최신 기사
그림 출처: Mandar Kulkarni et al., arXiv:2608.18543, CC BY 4.0