Are LLMs becoming similarly creative? Evidence from three years of models
최신 AI 챗봇일수록 서로 비슷한 답을 내놓는다는 3년치 조사 결과
연구팀은 2023년부터 지금까지 나온 68개 AI 모델에게 창의성을 요구하는 질문들을 던지고 답변들이 서로 얼마나 다른지 측정했다. 그 결과 시간이 지날수록 서로 다른 회사가 만든 모델들의 답변이 점점 비슷해지는 경향이 통계적으로 뚜렷하게 나타났다. 연구팀은 이런 흐름이 계속되면 AI가 사람의 창의적 작업을 도울 때 오히려 아이디어의 폭을 좁힐 수 있다고 경고한다.
무엇을 했나
- '물건의 색다른 용도 말하기'(AUT)라는 표준 창의성 테스트와 실제 사용자 질문 100개를 모은 Infinity-Chat100 두 세트를 12개 회사, 68개 모델에 똑같이 물어봤다
- 각 답변을 문장을 숫자벡터로 바꾸는 임베딩 기법으로 변환한 뒤 답변끼리 얼마나 다른지(코사인 거리)를 계산하고, 출시 시기를 9개 구간으로 나눠 회귀분석했다
- 같은 회사 모델끼리는 원래 비슷할 수 있으므로 서로 다른 회사 모델끼리만 비교했고, 특정 회사 모델이 결과를 과대표하지 않도록 1000번 반복 표본추출로 결과를 검증했다
- AUT 테스트에서는 답변 간 차이가 초기 약 0.50에서 최근 0.40 이하로 크게 줄었고, 실제 사용자 질문 모음에서도 약 0.34에서 0.32로 완만하지만 꾸준히 줄어들었으며 1000번의 반복 검증 모두 감소 추세를 보였다

| Dataset | Models (Pairs) | Slope per Bin | 95% CI |
|---|---|---|---|
| Alternate Uses Task | 68 (273) | −0.01385 | [−0.01695,−0.01044] |
| Infinity-Chat | 67 (268) | −0.00167 | [−0.00267,−0.00074] |

| AUT | Infinity-Chat100 | |||
|---|---|---|---|---|
| Model | Observed | Missing | Observed | Missing |
| minimax/minimax-01 | 0 | 10 | 0 | 100 |
| minimax/minimax-m1 | 6 | 4 | 0 | 100 |
| mistralai/mistral-small-3.1-24b-instruct | 10 | 0 | 89 | 11 |
| qwen/qwen3.6-max-preview | 2 | 8 | 100 | 0 |
| qwen/qwen3-max | 10 | 0 | 94 | 6 |
| meta-llama/llama-3.2-3b-instruct | 10 | 0 | 97 | 3 |
| anthropic/claude-fable-5 | 10 | 0 | 99 | 1 |
| minimax/minimax-m2.1 | 10 | 0 | 99 | 1 |
| qwen/qwen-2.5-72b-instruct | 10 | 0 | 99 | 1 |
| All 69 models | 668 | 22 | 6,677 | 223 |

왜 중요한가
여러 AI 서비스에 매일 수십억 건의 메시지가 오가고 그중 상당수가 아이디어 구상이나 글쓰기 같은 창작 목적인데, 서로 다른 AI들이 점점 비슷한 답만 내놓는다면 사람들이 접하는 생각의 폭 자체가 줄어들 수 있다. 이는 AI를 창작 파트너로 계속 신뢰해도 되는지, 사람의 창의성에 AI가 어떤 영향을 미치는지에 대한 중요한 경고 신호다.

이 논문의 용어
- Alternate Uses Task(AUT) · 책, 신발 같은 흔한 물건의 색다른 용도를 최대한 많이 말하게 해 창의적 사고를 측정하는 심리학 테스트
- Infinity-Chat100 · 실제 사용자들이 AI 챗봇에게 던진 개방형 질문 100개를 모은 데이터셋
- 임베딩(embedding) · 문장의 의미를 숫자로 이루어진 벡터로 표현해 컴퓨터가 비교할 수 있게 만든 것
- 코사인 거리 · 두 벡터(여기서는 두 답변)의 의미가 얼마나 다른지를 방향 차이로 계산한 값, 값이 작을수록 비슷함
- 크로스패밀리(cross-family) 비교 · 같은 회사 모델끼리가 아니라 서로 다른 회사가 만든 모델끼리만 비교하는 방식
논문 원문 초록 (영문)
Many benchmarks track Large Language Model (LLM) performance on tasks with verifiable answers, but less is known about how LLM performance is evolving on open-ended tasks, where creativity, originality and diversity may matter as much as quality. As LLMs increasingly support human ideation and creative work, understanding trends in LLM performance on open-ended tasks is critical. This paper presents a preliminary analysis of LLM creative outputs spanning three years of model releases, examining model responses to Infinity-Chat100, a real-world collection of open-ended user queries, and the Alternate Uses Task, an established psychometric creativity assessment. Using sentence-embedding similarity, we examine trends in LLM responses to these prompts. Our findings show a statistically significant decrease in model output diversity over time, suggesting that LLM outputs may be converging in creative substance across models. If this trend persists, LLM-driven homogenization may progressively diminish human agency in human-AI co-creative work, demanding careful consideration of LLMs' role in the human creative process.
arXiv에서 원문 보기최신 논문
- Specification-delta-driven data governance: an empirical study of the {\guillemotleft}spec-delta{\guillemotright} as the unit of change in lakehouse data platforms데이터 플랫폼 변경도 코드처럼 '설계도 조각'을 붙여서 검토하면 어떨까: 실험 설계 논문
- Auditing Cross-Lingual Fairness in Language Model WatermarkingAI 생성 텍스트를 잡아내는 워터마크 기술이 영어 아닌 언어에서는 훨씬 부실하게 작동하고, 그 격차는 개별 언어가 아니라 언어 계열 단위로 나타난다
- TESTNAV: Pareto-Guided Search for Compositional Robustness TestingAI 모델을 여러 손상이 겹친 입력으로 시험할 때, 굳이 다 테스트하지 않고도 '진짜 위험한 실패'만 골라내는 탐색법
- Optimal Skill Selection for LLM Agents with Provable Bicriteria GuaranteesAI 에이전트에게 어떤 '스킬 문서'를 몇 개나 줘야 잘 작동하는지, 수학적으로 최적해를 보장하며 골라주는 방법
- Reliable Financial Named Entity Recognition under Domain Shift금융 AI가 서류체 문장에서 배운 자신감은 트위터로 가면 거짓말이 된다
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- Robust Incomplete Multimodal Sentiment Analysis via Iterative Proxy Correction텍스트가 빠지거나 망가져도, AI가 그 자리를 대신할 '가짜 텍스트'를 한 번에 만들지 않고 여러 번 고쳐가며 감정을 더 정확히 읽어낸다
- Towards general embodied intelligence: integrating large language models, knowledge bases, and reasoning capabilities to build the next generation of AI agents말만 잘하는 AI를 몸을 가진 로봇으로 만들려면 무엇이 더 필요한가를 정리한 서베이 논문
METAL LAB 최신 기사
그림 출처: Nirav Patel et al., arXiv:2608.19437, CC BY 4.0