
요약
- Ai2의 infini-gram 엔진으로 AI 생성 텍스트가 기존 출판물의 희귀 표현과 얼마나 겹치는지 분석했다
- AI 텍스트 비중이 높은 아마존 베스트셀러 200권은 그렇지 않은 책보다 희귀 표현 겹침이 4.4%p 높았다
- 수상작·후보작 문학과 비교하면 그 격차가 22.5%p까지 벌어졌다
- 연구 주체
- 스토니브룩대 Tuhin Chakrabarty 교수 연구팀
- 사용 도구
- Ai2의 infini-gram 엔진, Google Books 데이터
- 비교 대상
- 아마존 자가출판 고수익 상위 200권씩 AI텍스트 유무 그룹
- 격차 1
- 일반 비교군 대비 희귀 표현 겹침 4.4%p 차이
- 격차 2
- 수상·후보 문학 대비 격차 22.5%p로 확대
- 발단 사건
- Commonwealth Foundation 수상작이 AI 작성 의혹을 받은 'GrantaGate'
수상작이 AI가 쓴 글이었다
Commonwealth Foundation이 시상한 단편소설이 독자들에 의해 기계가 쓴 글이라는 의혹을 받으면서 이른바 'GrantaGate' 사건이 불거졌다. AI 탐지기는 이 글이 기계 생성일 가능성을 점수로 보여줄 수는 있었지만, 그 문장이 어디서 왔는지는 알려주지 못했다. 이 빈틈을 메우기 위해 스토니브룩대 컴퓨터공학과 조교수 Tuhin Chakrabarty 연구팀은 Ai2의 infini-gram 엔진을 동원했다. 연구팀은 Google Books 데이터와 infini-gram을 활용해 아마존에서 자가출판된 고수익 베스트셀러 상위 200권을 AI 텍스트 검출 비중에 따라 두 그룹으로 나눠 비교했다. 그 결과 AI 텍스트 비중이 높은 책들은 그렇지 않은 책보다 기존 출판물의 희귀 표현과 4.4%p 더 많이 겹쳤다. 수상작이나 수상 후보작과 비교했을 때는 이 격차가 22.5%p까지 벌어졌다. 실제로 GrantaGate 논란의 원 소설을 infini-gram으로 돌려보니 '발효되는 신맛(sour tang of fermenting)'이라는 표현이 한 팬픽션 사이트의 문장과 거의 일치하는 것으로 나타났다.
infini-gram, 문장의 지문을 찾는 도구
infini-gram은 방대한 텍스트 데이터셋을 색인화해 어떤 길이의 문구든 그것이 코퍼스 전체에서 몇 번 등장하는지 셀 수 있게 해주는 검색 엔진이다. Ai2(앨런AI연구소)는 이 엔진을 자사의 완전 공개형 언어모델 Olmo와 연결해 모델의 출력 문장을 학습 데이터의 원문과 직접 대조하는 OlmoTrace, 그리고 텍스트의 독창성을 참조 코퍼스 대비 점수로 매기는 Creativity Index라는 두 프로젝트에 이미 적용해왔다. Chakrabarty 교수는 이 두 프로젝트를 통해 infini-gram의 존재를 알게 됐다고 밝혔다. 그는 "머신러닝, 특히 LLM에서 출처 규명은 매우 어려운 문제"라고 말했다. AI 탐지 점수 자체는 어떤 글이 기계가 썼을 확률만 알려줄 뿐 그 이상을 가리키지 못한다는 게 이 연구의 출발점이다. 무언가가 AI로 작성됐다는 사실을 안 다음, infini-gram 같은 도구로 그 문장을 실제로 해부해 볼 수 있다는 것이 연구팀의 설명이다. 이번 연구는 지난 7월 말 arXiv에 논문으로 공개됐고, 같은 달 The Atlantic과 뉴욕타임스도 AI 생성 서적의 확산과 저작권 문제를 다루며 이 연구를 조명한 것으로 알려졌다.
그래서 뭐가 달라지나
이번 분석이 보여주는 것은 AI가 쓴 글이 완전히 새로운 언어를 만들어내기보다, 기존 텍스트의 희귀한 표현을 재조합하는 경향이 있다는 정황이다. 탐지 점수만으로는 표절 여부나 저작권 침해 가능성을 판단하기 어렵지만, infini-gram 같은 문구 대조 도구를 결합하면 어떤 문장이 어디서 왔는지 구체적으로 추적할 길이 열린다. 이는 출판사나 문학상 주최 측이 AI 생성 원고를 걸러내는 데 참고할 수 있는 실증적 근거가 될 수 있고, 동시에 AI 모델이 학습 데이터의 어떤 표현을 얼마나 그대로 재생산하는지 살펴보는 저작권 논쟁에도 실마리를 제공한다.





댓글