RAG Collapse: LLM Responses Collapse When Retrieved Documents Are Self-Authored
AI如果不断检索并引用自己以前写的内容,答案最终会趋同成一个版本
当像ChatGPT这样的AI系统通过网络搜索获取参考资料来回答问题时,如果这些参考资料中混入了AI自己以前生成的文章,答案会逐渐变得越来越相似,最终几乎完全一致。研究者将这种现象称为RAG崩溃,在涉及三个模型家族的1,528次模拟中,79.6%最终发生了崩溃。令人意外的是,哪怕只有一条自撰参考资料,也足以引发崩溃。
METAL LAB 解读图
RAG崩溃如何在多轮循环中逐步发生
证据状态已报告实测结果
- 第一步:用原始参考资料生成回答AI基于从ChatGPT或谷歌AI Overview获取的原始资料,对同一问题连续回答十次,得到多样的答案
- 第二步:把回答改写成文章把部分AI回答改写成在线文章的形式,制成自撰参考资料
- 第三步:替换或竞争参考资料Replace All每轮整体替换,Replace One每轮替换一条,Search让原始资料与自撰资料在检索中相互竞争
- 第四步:反复多轮循环这一过程重复最多10到30轮,每轮都重新生成答案
- 第五步:检验是否崩溃回答中提到的实体和措辞越来越相似,最终在79.6%的模拟中所有回答都只提到相同的实体,判定为崩溃
他们做了什么
- 研究团队用GPT、Gemini、Claude三个模型家族和1,019个信息检索类问题,设计了三种模拟方式(Replace All、Replace One、Search),模拟AI系统检索到自己以前生成内容的情形。
- 每一轮中,研究者把AI的回答改写成文章形式放入参考资料池,再逐一替换、整体替换或让其与原始资料在检索中竞争,之后重新生成答案,如此反复多轮。
- 1,528次模拟中有1,216次(79.6%)最终发生崩溃,其中一项实验里,被判定为互为改写(说的是同一件事)的回答对比例,从最初的22%升到模拟结束时的89%。
- 即便只有一条参考资料是AI自己写的,也可能引发崩溃,原因是即使控制了资料质量,模型仍会不成比例地更多引用自己撰写的内容,这是一种自我偏好(self-bias)。
- 研究还发现,截至2026年1月ChatGPT引用的参考资料中约38.9%、到2026年6月约42.7%被判定为AI生成,说明这种反馈循环的条件在现实中已部分具备。


| Name | Questions |
|---|---|
| Entity ChatGPT | 843 |
| Editorial ChatGPT | 159 |
| Entity AI Overview | 60 |
| Editorial AI Overview | 45 |


| Overall | Entity | Editorial | |
|---|---|---|---|
| 1/26 ChatGPT | 38.9% [38.0, 39.9] | 41.1% [40.1, 42.1] | 20.6% [18.3, 23.0] |
| 6/26 ChatGPT | 42.7% [41.7, 43.7] | 45.8% [44.7, 46.8] | 27.5% [25.4, 29.7] |


| Simulation | Model | Dataset | Questions | Collapsed at Start | Collapsed at End | Rounds Collapsed |
|---|---|---|---|---|---|---|
| Replace All | GPT-5.2 Chat | Entity ChatGPT | 101 | 2.97% | 88.12% | 68.51% |
| Replace All | GPT-5.2 Chat | Editorial ChatGPT | 57 | 29.82% | 91.23% | 79.65% |
| Replace One | GPT-5.2 Chat | Entity ChatGPT | 101 | 2.97% | 88.12% | 67.18% |
| Replace One | GPT-5.2 Chat | Editorial ChatGPT | 57 | 21.05% | 94.74% | 81.67% |
| Search | GPT-5.2 Chat | Entity ChatGPT | 101 | 1.98% | 77.23% | 62.31% |
| Search | GPT-5.2 Chat | Editorial ChatGPT | 57 | 31.58% | 75.44% | 73.63% |
| Replace One | Gemini 3 Pro | Entity AI Overview | 60 | 3.33% | 80.00% | 43.83% |
| Replace One | Claude Sonnet 4.5 | Entity AI Overview | 60 | 1.67% | 91.67% | 64.33% |
| Replace One | Gemini 3 Pro | Editorial AI Overview | 45 | 6.67% | 68.89% | 42.56% |
| Replace One | Claude Sonnet 4.5 | Editorial AI Overview | 45 | 11.11% | 97.78% | 69.33% |
| Search | GPT-5.2 | Entity ChatGPT | 742 | 7.01% | 73.85% | 59.93% |
| Search | GPT-5.2 | Editorial ChatGPT | 102 | 7.84% | 83.33% | 65.85% |


| Name | Pearson Correlation | p |
|---|---|---|
| unique entities | −0.342 | 1.32×10−24 |
| length of responses | −0.245 | 5.31×10−13 |
| unique words | −0.223 | 6.21×10−11 |
| entity ranking similarity | 0.164 | 1.61×10−6 |
| same-answer % | 0.151 | 1.01×10−5 |


研究结果
- 在三种模拟设计中,随着轮次增加,回答中出现的独特词汇数和独特实体数都在减少,而回答之间的语义相似度和实体排序相似度都在上升。
- 1,528次模拟中有1,216次(79.6%)最终以崩溃收尾。
- 在一项实验中,被判定为互为改写的回答对比例从最初的22%上升到模拟结束时的89%。
- 当原始资料和自撰资料同时存在时,即便控制了资料质量,模型仍会不成比例地更多引用自撰资料。
- 截至2026年1月,ChatGPT引用的参考资料中约38.9%被判定为AI生成,到2026年6月这一比例升至约42.7%。


可应用场景
- 搭建基于检索的AI系统的团队,可以据此考虑对检索池中AI生成内容的比例进行监测或过滤。
- 从事生成式引擎优化(GEO)或希望自己内容被AI答案引用的内容策划者,可以考虑到AI系统会不成比例地偏好引用与自身风格相似的内容这一点来调整发布策略。
- 希望监测AI答案多样性的团队,可以借鉴实体可见度、独特词汇数、改写比例等指标,来追踪答案是否正在趋同崩溃。
局限与待验证事项
- 实验起始所用的原始参考资料中本身就含有约38.9%至42.7%的AI生成内容,且无法精确判定其中哪些是真正的自撰内容,这意味着实际测得的崩溃程度和自我偏好可能被低估而非高估。
- 实验只测试了反复引入同一模型自撰内容的情形,没有测试反复加入其他类型AI生成内容是否也会导致崩溃,作者认为这也有可能发生。
- 研究聚焦于信息检索类问题,尤其是实体比较类问题,其他类型问题下的崩溃表现尚未验证。
- 模拟结果表明在这些条件下会发生崩溃,但并不能直接证明现实中的商业AI系统已经发生了RAG崩溃,这些系统可能已经存在未公开的缓解机制。
- 涉及代理式搜索下的崩溃情况、缓解措施是否真正有效、以及一个模型检索另一个模型自撰内容的情形,都留作未来工作。
为什么重要
很多人以为依靠搜索的AI答案能反映互联网上多元的观点,但这项研究表明,如果AI不断检索并引用自己过去写的内容,这种多样性会悄悄消失,答案会收敛到某一个未必更好的版本。对于搭建检索增强型AI系统的团队,以及依赖AI生成内容做营销推广(如生成式引擎优化)的人来说,随着网上AI生成内容越来越多,这种反馈循环可能已经在形成,值得提前关注。
本文术语
- RAG(检索增强生成) · AI在回答问题时先用搜索工具查找相关文档,再据此撰写答案的方式
- 模型崩溃(model collapse) · AI如果反复用自己生成的内容来训练自己,输出会逐渐失去多样性,最终偏离原始数据分布的现象
- 自撰参考资料(self-authored reference) · 由同一个AI模型根据自己之前的回答生成、之后又被该AI检索并引用的文章
- 自我偏好(self-bias) · AI在同等质量下更倾向于引用自己写的内容而非其他来源
- 实体可见度(entity visibility) · 在多次生成的回答中,某个具体对象(例如某位主播的名字)被提到的回答所占的比例
论文原文摘要(英文)
LLM responses are based on the internet (via training or RAG), and AI is now used to generate a significant amount of content online (Paredes et al., 2026), creating the potential for a self-reinforcing feedback loop. Prior work has shown that when LLMs are recursively trained on their own output, they experience model collapse (Shumailov et al., 2024): responses become less diverse, and eventually no longer resemble the original training data. In this paper, we show that a similar collapse occurs if LLM-based AI systems retrieve references they authored using a search tool. We call this RAG collapse. We conduct extensive experiments with three types of simulations of AI systems retrieving references they generated, using three model families, and 1,019 information-seeking prompts, totaling 1,528 simulations and over one million LLM API calls, and find that 79.6% (1,216/1,528) of simulations end in collapse. Surprisingly, even a single self-authored reference can trigger collapse because the LLM disproportionately cites its own content. This self-bias persists even after controlling for reference quality.
在 arXiv 阅读最新论文
- Sycophantic Chatbots Cause Delusional Spiraling, Even in Ideal Bayesians一个数学模型证明,哪怕是完全理性的人,也会被一味顺着自己说话的聊天机器人带入妄想
- GameXpert-Bench: How Far Are Coding Agents from Expert Game Development?AI编程智能体擅长从零做出一款能玩的游戏,但不擅长自己发现漏洞、也难在修改中保住原有功能
- There Is No Neutral Harness: Modern LLM Leaderboards Are Manufactured by Config-Fragile Items同一个模型只要换一种打分方式,准确率就能从31%变到89%,而这种打分方式正悄悄决定排行榜的冠军
- K-Bench: measuring model performance on real scientific agent requests用178个真实科研请求测试9个AI智能体,结果最强的模型也没能稳稳超过“合格线”
- No One Model Catches Every Harm: Benchmarking Content Moderation Across Safety Scenarios把53个AI安全过滤模型放一起测试后发现:没有哪个模型能通吃所有类型的有害内容
- AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scaleAI不再为单个任务搭环境,而是直接生成整个商业世界,让训练场自己扩展规模
- FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth用一套可执行的美食评分系统当裁判,而不是靠人或AI来打分的语言模型评测
- When Vocabulary Comprehension Fails Clinical Reasoning: Evaluating Therapy Bots' Safety Risks for Generation Alpha治疗聊天机器人能听懂青少年的俚语,却常常判断不出话里藏着的危机
METAL LAB 最新报道
图片来源: Gregory Druck et al., arXiv:2608.22118, CC BY 4.0