
이미지: METAL
요약
- V7 Go 는 GPT-5.6 Luna 로 수백만 개 파일을 훑어 Context Graph 를 채우고, 그 그래프로 MCP 검색과 수백 단계짜리 워크플로를 굴려요.
- 아주 어려움 난이도의 그래프 질의에서 GPT-6 Astra 가 89%, GPT-5.6 Sol 이 78% 를 기록했고 쉬움부터 어려움까지는 둘 다 100% 에 가까웠어요.
- 자산운용사는 딜 스크리닝을 21배 빠르게, 보험 팀은 청구 처리 오류를 13.5% 줄였다고 회사는 밝혔어요.
- 공개
- 2026년 9월 21일 · 오픈AI 스타트업 사례
- 회사
- V7 · 알베르토 리촐리와 사이먼 에드워드손이 2018년 창업 · 유럽·영국
- 제품
- V7 Go · Context Graph · MCP 서버
- 모델 배치
- 추출은 GPT-5.6 Luna · 추론과 도구는 GPT-5.6 Terra 와 Sol · 최난도 질의는 GPT-6 Astra
- 최난도 정확도
- GPT-6 Astra 89% · GPT-5.6 Sol 78%
- 도구 호출 오류율
- GPT-5.5 2.7% → GPT-5.6 Sol 0.2%
- 비용
- 문서당 비용 GPT-5.4 mini 대비 78% 감소
- HERB
- 검색 전용 시스템이 공식 기준선 69% 상회 · 환각 38% 감소
- 고객 수치
- 딜 스크리닝 21배 · 검토 100시간 초과에서 10시간 미만 · 청구 오류 13.5% 감소
오픈AI가 9월 21일 스타트업 V7 의 사례를 공개했어요. 회사에 흩어진 파일을 에이전트가 질의할 수 있는 컨텍스트로 바꾸는 V7 Go 이야기인데, 가장 까다로운 그래프 질의 묶음에서 GPT-6 Astra 가 89% 정확도를 기록했다는 숫자가 함께 나왔어요. 같은 시험의 아주 어려움 단계에서 GPT-5.6 Sol 은 78% 였어요.
발표문은 문제를 이렇게 세웠어요. 오늘의 모델은 복잡한 과제를 추론해 내지만 그 과제가 놓인 업무 맥락까지 저절로 알지는 못해요. 어느 펀드 보고서가 최신인지, 같은 기업이 세 시스템에서 각각 어떤 이름으로 적혀 있는지 같은 것들이에요. 그 맥락은 문서와 데이터룸, 스프레드시트, 이메일, 사내 도구에 흩어진 채 정리되지 않고 에이전트에게는 보이지 않는 상태로 남아 있어요.
V7 은 알베르토 리촐리와 사이먼 에드워드손이 2018년에 세운 회사예요. 둘은 그전에 컴퓨터 비전 기반 접근성 앱을 함께 만들었고, 기업이 AI 시스템에게 자기 사업이 어떻게 굴러가는지 가르치도록 돕겠다며 V7 을 시작했어요. 지금 주력은 미션 크리티컬 워크플로를 짜는 에이전트 플랫폼 V7 Go 예요.
구조는 두 층이에요. GPT-5.6 Luna 가 수백만 개 파일에서 정보를 뽑아 Context Graph 에 정리하고, 그 그래프가 엔티티와 관계와 인용 증거를 이어 MCP 검색과 반복 가능한 워크플로를 굴려요. 워크플로 하나가 수백 단계까지 이어질 수 있어요. 추론과 도구 사용이 많이 필요한 다단계 지시에는 GPT-5.6 Terra 와 Sol 을 쓰고, 수천 건 문서를 가로지르는 재무 분석처럼 가장 부담이 큰 그래프 질의에는 GPT-6 Astra 를 넣기 시작했어요.
회사 측은 컨텍스트와 모델과 도구가 함께 맞물리면 에이전트가 50~100단계 워크플로를 몇 분 만에 끝내고 99.9% 정확도에 이르며 모든 결정에 감사 가능한 기록이 남는다고 밝혔어요. 알베르토 리촐리 V7 공동창업자 겸 CEO 는 "금융과 보험의 어려운 기업 과제를 풀려면 AI 가 인터넷에서 배운 만큼 그 회사가 어떻게 돌아가는지도 배워야 합니다" 라고 말했어요.
엔지니어 관점에서 이 설계가 겨냥한 낭비는 분명해요. 그래프가 없으면 에이전트는 요청이 올 때마다 맥락을 처음부터 다시 찾아야 하고, 그 과정에서 검색이 수십 번 돌며 시간과 토큰을 쓰는데도 관계 속에 묻힌 핵심 정보는 자주 놓쳐요. V7 Go 는 SharePoint 나 구글 드라이브 같은 저장소에 연결해 엔티티와 관계, 사실, 속성, 지표를 훑어 그래프를 채우고, 그 그래프는 롱컨텍스트 방식보다 한 자릿수 더 싸고 빠르게 순회된다고 발표문은 적었어요.
새 파일이 들어오면 V7 Go 가 온톨로지 안의 회사와 펀드, 사람 같은 엔티티를 식별하고 각 사실을 기존 레코드나 새 레코드에 이은 다음 원본으로 돌아가는 인용 증거를 남겨요. 그래프에 정보가 모자라면 기저 문서를 RAG 로 직접 검색할 수도 있어요. 긴 대화를 하는 에이전트의 경우 최근 주고받은 내용은 모델의 활성 컨텍스트에 두고 오래된 자료는 그래프로 내려 필요할 때 꺼내 와요.
구조가 성능에 얼마나 영향을 주는지도 따로 쟀어요. 기업 시스템 곳곳에 흩어진 정보를 찾아 잇는 능력을 재는 HERB 벤치마크에서 V7 의 검색 전용 시스템이 공식 기준선을 69% 앞질렀고, 답이 존재하지 않는 질의에서 환각을 38% 줄였다고 회사는 밝혔어요. 메탈이 확인한 HERB 는 세일즈포스 AI 리서치가 2025년 6월 공개한 벤치마크로, 문서와 회의록, 슬랙 메시지, 깃허브, URL 에 걸친 3만9,190개 기업 산출물 위에서 다중 홉 질문을 던져요. 논문은 가장 성적이 좋은 에이전틱 RAG 방식조차 평균 32.96점에 머물렀고 병목은 검색이라고 적었어요.
고객 쪽 수치도 함께 나왔어요. 자산운용사는 딜 스크리닝을 이전보다 21배 빠르게 처리해 하루가 걸리던 과정을 15분으로 줄였고, 어느 금융 서비스 팀은 검토 시간을 100시간 넘게 걸리던 것에서 10시간 미만으로 낮춰 과제당 1만2,000달러의 전문가 비용을 아꼈어요. 보험 팀은 지난 청구와 기존 보험 약관에 대한 이력 지식을 에이전트에게 준 뒤 청구 처리 오류를 수작업 기준선 대비 13.5% 줄였어요.
발표문에 실린 데모는 사모펀드 딜 스크리닝이에요. 기밀 정보 메모랜덤이라 불리는 거래 문서에서 핵심 재무와 거래 조건, 경영진 정보, 위험 항목을 뽑아 인용을 달고 스크리닝 노트를 만드는 흐름이에요. 보험 언더라이팅도 같은 방식으로 돌아간다고 회사는 설명했어요.
모델을 고르는 방식은 티어로 갈라 놨어요. AI 가 생성한 워크플로에서 V7 Go 는 각 단계를 빠름과 중간, 똑똑함 세 등급에 배정해요. 구조화된 추출과 대량 처리는 GPT-5.6 Luna 가 맡고, 채팅과 Go Agent 경로, 추론이나 도구 사용이 더 필요한 단계는 GPT-5.6 Terra 나 Sol 이 맡아요.
사이먼 에드워드손 V7 공동창업자 겸 CTO 는 모델 선택의 이유를 성능 숫자로 댔어요. 그는 "V7 Go 가 기대는 다단계 도구 워크플로에서 가장 잘해서 오픈AI 를 기본값으로 골랐습니다" 라며, 자사 Context Graph 벤치마크에서 도구 호출 오류율이 GPT-5.5 의 2.7% 에서 GPT-5.6 Sol 로 0.2% 까지 내려갔다고 밝혔어요. 같은 사람은 Terra 덕분에 모델이 과제를 쉽게 처리하도록 돕기 위해서만 존재하던 중간 단계들을 여럿 걷어 냈고 그것만으로 며칠치 작업이 줄었다고도 말했어요.
나머지 효율 숫자는 배관 쪽에 몰려 있어요. 외부 호출이 여러 번 붙는 핵심 워크플로가 최신 하네스에서 최대 50% 빨라졌고, GPT-5.6 Luna 는 GPT-5.4 mini 대비 문서당 비용이 78% 낮았어요. V7 은 문서가 많은 V7 Go 작업을 Chat Completions API 에서 Responses API 로 옮겼는데, 자체 시험에서 PDF 가 많은 일부 워크플로의 토큰 사용이 약 5% 줄고 캐싱 신뢰도가 좋아졌어요. 증설 요청을 오픈AI 가 몇 시간 안에 승인하고 반영한 반면 다른 공급자들은 몇 주가 걸렸다는 대목도 발표문에 들어 있어요.
89% 라는 숫자가 나온 배경은 벤치마크가 포화됐기 때문이에요. GPT-5.6 Sol 이 기존 시험들을 대부분 만점 가까이 채워 버려서, V7 은 수천 건 문서에 걸친 더 지저분한 실제 데이터로 어려운 그래프 질의 묶음을 새로 만들었어요. 이 데이터셋은 난이도가 네 단계인데, 쉬움과 중간과 어려움에서는 두 모델 모두 100% 에 가까웠고 아주 어려움에서만 78% 와 89% 로 갈렸어요. 메탈은 GPT-6 Astra 공개 당시 정렬 개선과 치명적 등급이 함께 올라왔다고 보도한 바 있어요.
밖으로 나가는 통로는 MCP 예요. V7 Go 는 Context Graph 질의와 적재를 자사 MCP 서버로 열어 두어서 고객이 챗GPT 를 비롯한 호환 클라이언트에서 그대로 쓸 수 있고, Codex 안에서 MCP 로 V7 Go 워크플로를 만들 수도 있어요. 워크플로 설계가 단순해진 것과 합쳐져 중간 길이 워크플로 하나를 만드는 데 걸리던 시간이 한 시간 남짓에서 20분 정도로 줄었어요.
회사 데이터에 에이전트를 붙이는 시도는 올해 내내 이어졌어요. 메탈은 오픈AI 가 회사 데이터를 묻는 에이전트를 내놨다고 보도한 바 있으며, 그때도 승부처는 모델 성능이 아니라 사내 자료에 닿는 경로였어요. V7 이 자사 제품 설명에서 내세우는 문장도 같은 자리를 가리켜요. 가장 좋은 LLM 도 100만 토큰 컨텍스트 창에서 멈추는데 회사에는 15년치 거래 이력이 쌓여 있고, 세션이 끝나는 순간 모델은 그 전부를 잊는다는 거예요. 같은 페이지는 통합 300개 이상과 에이전트 120개 이상을 숫자로 적어 뒀어요.
다음 목표는 그래프가 먼저 움직이는 쪽이에요. V7 팀은 Context Graph 안의 사실이 바뀌면 워크플로가 스스로 시작되고, 앞뒤가 맞지 않는 곳을 표시하고, 어떤 분석을 다시 봐야 하는지 사람에게 알려 주는 방향으로 작업하고 있어요. 펀드 보고서가 수정되면 옛 수치에 기대고 있던 작업들을 V7 Go 가 짚어 주는 식이에요.
에이전트 경쟁의 축이 모델에서 기억으로 옮겨 가고 있다는 게 이 사례가 보여 주는 지점이에요. 같은 모델을 쓰고도 성적이 갈리는 이유가 회사 자료를 어떤 구조로 세워 두었느냐에 달려 있다면, 앞으로 값이 매겨지는 자산은 모델 접근권이 아니라 정리된 맥락이 돼요. 리촐리는 "진짜 가치를 얻는 금융 회사는 에이전트가 가장 많은 곳이 아니라 컨텍스트가 가장 좋은 곳일 겁니다" 라고 말했어요.





댓글