
요약
- 데이터브릭스가 2026년 8월 6일 블로그를 통해 새 벤치마크 OfficeQA Pro V2를 공개했다.
- 기업 자료를 근거로 답을 만들어내는 '그라운디드 리즈닝' 능력을 평가하도록 설계됐고, 에이전트 성능 측정 결과가 함께 실렸다.
- 문항은 사람이 만든 뒤 합성 데이터로 규모를 키우는 방식으로 확장했다.
- 발표 주체
- Databricks (Databricks Blog)
- 공개일
- 2026년 8월 6일
- 이름
- OfficeQA Pro V2
- 평가 대상
- 기업 환경의 그라운디드 리즈닝(enterprise grounded-reasoning)
- 구성
- 에이전트 성능 결과, 벤치마크 구축 방법, 합성 데이터 기반 확장, 예시 질문, 벤치마크 상세
회사 안에서 AI에게 던지는 질문은 대개 이런 모양이다. "3분기 계약 갱신율이 왜 떨어졌는지, 이 보고서들을 근거로 정리해줘." 정답은 모델의 머릿속이 아니라 사내 문서 더미 안에 있다. 데이터브릭스(Databricks)가 8월 6일 공개한 새 벤치마크는 정확히 이 지점을 잰다.
무엇이 나왔나
데이터브릭스는 자사 블로그를 통해 OfficeQA Pro V2를 공개했다. 기업 환경의 '그라운디드 리즈닝(grounded reasoning)' — 주어진 자료에 답을 붙여 추론하는 능력 — 을 평가하도록 설계된 벤치마크다. 공개 글은 여러 에이전트를 이 벤치마크에 돌린 성능 결과, 벤치마크를 새로 만든 과정, 합성 데이터로 규모를 키운 방법, 예시 질문, 벤치마크 세부 사양 순으로 구성됐다. 이름에 붙은 V2는 앞선 판의 후속임을 가리킨다.
왜 '근거 있는 추론'이 어려운 문제인가
모델이 시험 문제를 잘 푸는 것과, 회사 문서를 읽고 답하는 것은 다른 일이다. 후자는 실패하는 방식이 훨씬 지저분하다. 자료에 없는 숫자를 그럴듯하게 지어내거나(환각), 답이 세 문서에 흩어져 있는데 첫 문서만 보고 결론을 내거나, 근거 문장은 제대로 찾았는데 그걸로 하는 계산이 틀린다. PDF 계약서, 분기 실적 표, 발표 슬라이드처럼 형식이 뒤섞인 자료가 들어오면 난이도는 한 단계 더 올라간다.
문제는 이런 실패가 기존 벤치마크로는 잘 안 잡힌다는 데 있다. MMLU 같은 지식 시험형 평가는 모델이 이미 아는 것을 묻는다. 반면 기업이 궁금한 건 "우리 문서를 줬을 때 제대로 하느냐"다. 그래서 회사마다 사내 자료로 자체 평가셋을 만들어 쓰는 일이 흔해졌지만, 공개되지 않으니 비교가 안 된다. 공개 벤치마크가 계속 나오는 이유다.
여기에 또 하나의 벽이 있다. 이런 문항은 사람이 손으로 만들어야 품질이 나오는데, 그러면 수백 개에서 멈춘다. 데이터브릭스가 별도 절로 '합성 데이터를 이용한 확장'을 다룬 것은 이 병목을 어떻게 넘었는지에 대한 답으로 읽힌다. 모델로 문항을 찍어내면 규모는 해결되지만, 난이도가 고르게 유지되는지와 정답이 실제로 자료 안에서 검증되는지가 새 숙제가 된다.
데이터브릭스가 벤치마크를 내는 이유
데이터브릭스는 아파치 스파크를 만든 연구진이 창업한 데이터 플랫폼 기업이다. 기업이 쌓아둔 데이터 위에 분석과 AI를 얹는 것이 본업이고, 최근 몇 년은 그 위에서 도는 에이전트로 무게중심을 옮겨왔다. 8월 10일에는 20개 도시를 도는 'Data + AI World Tour'를 재개했고, 회계·자문 법인 CLA의 에이전트 오케스트레이션 사례도 잇따라 공개했다. 사내 데이터를 근거로 일하는 에이전트가 이 회사 제품의 핵심 시나리오인 셈이다. 그런 회사가 평가 기준을 직접 만든다는 것은, 문제를 어떻게 정의할지에 대한 주장을 함께 내놓는 일이기도 하다.
그래서 무엇이 달라지나
사내 AI 도입을 검토하는 쪽에는 참조점이 하나 늘었다. "이 모델이 우리 문서로도 되나"라는 질문을 눈대중이 아니라 공개된 문항 묶음으로 물어볼 수 있다는 뜻이다. 흐름으로 보면 모델 성능 경쟁이 '무엇을 아는가'에서 '주어진 자료로 무엇을 하는가'로 옮겨가는 국면과 맞물린다. 벤치마킹 자체를 제품으로 만드는 시도도 늘고 있다 — Artificial Analysis는 8월 10일 개발자용 벤치마킹 제품군의 얼리 액세스 모집을 열었다. 다만 이번 공개에서 어떤 에이전트가 몇 점을 받았는지 구체적 점수는 원문의 결과 표를 직접 확인해야 한다.





댓글