
摘要
- Trellner向Perplexity的sonar、sonar-pro提问380个软件类别 分析了7534条引用
- 59.8%的引用来自访问量排名10万开外的域名 其中三个网站自动生成了21万5128个页面
- worldmetrics.org、gitnux.org甚至把主页标题写成"Facts & Grounding Page" 直接瞄准AI的信息溯源环节
向AI询问软件采购信息时,它究竟依据什么资料作答?研究媒体Trellner在2026年9月2日公布的一项调查发现,Perplexity在回答"最好的CRM软件"之类问题时所引用的依据文档中,相当一部分来自几乎没有访客的网站。在针对380个软件类别获得的7534条引用中,59.8%指向的域名网络访问量排名10万开外,其中三个网站自动生成了超过21万个页面,并把自己命名为"Facts & Grounding Page"。
380个类别 询问760次
Trellner研究团队在2026年9月2日通过OpenRouter接入Perplexity的两个模型sonar和sonar-pro,针对从"CRM软件"到"博物馆藏品管理软件"共380个具有购买意图的类别逐一提问。每个类别对每个模型各问一次,合计调用760次,每次回答都附带五款推荐产品,以及模型实际检索到的URL。类别列表在看到结果之前就已确定,事后未做修改。
由此收集到的引用共7534条,涉及2055个不同域名。研究团队将这些域名与反映网站访问量排名的Tranco榜单以及互联网档案馆Wayback Machine进行了比对。在有排名的域名中,引用的中位排名为71611位,全部引用中有59.8%指向排名10万开外的域名,23.4%甚至连百万名开外都排不上。相比之下,维基百科在7534条引用中仅被引用3次。
谷歌未被纳入此次调查范围。研究团队解释称,这是因为通过OpenRouter给Gemini系列模型加上信息溯源功能时,走的并非谷歌自家搜索,而是OpenRouter的搜索插件。
一家毫不相干的公司竟成第三大引用来源
最引人注目的案例是guideflow.com。这家公司做的是交互式产品演示销售,既不是评测网站也不是目录站,在调查涉及的380个类别中没有一个是它直接参与竞争的领域。然而它的博客却在96个类别、也就是全部类别的四分之一中被引用了194次,在全部引用来源中排名第三,超过了市场研究机构Gartner。被引用的URL在96个类别中各不相同、分别对应不同的博客文章,而这家公司网站地图里共有3351条博客URL,其中不重复的文章有2176篇。从"3D渲染软件"到"IVR软件""RFID软件"再到"建筑实务软件",完全不相干的领域里都用同一个博客当依据。研究团队指出,大规模运营内容营销博客本身并不罕见,但真正值得关注的是,一家根本不在该市场做生意的公司,其博客文章竟成了采购建议的依据资料。
"Facts & Grounding Page"——21万页面的真面目
更值得注意的是worldmetrics.org、gitnux.org、wifitalents.com这三个网站。它们分别被引用60次、50次、71次,合计181次,出现在41个类别中,占全部引用的比例仅为2.4%,看起来并不起眼。但研究团队认为,这三个网站很可能出自同一运营主体之手。三个域名都在2023年12月到2024年5月之间通过NameCheap注册,DNS都委托给了同样两台Cloudflare域名服务器(pam.ns.cloudflare.com、sean.ns.cloudflare.com),连导航菜单结构都用了一模一样的模板。每个网站恰好只有6篇博客文章,内容全都在互相介绍彼此的品牌,以及第四个品牌zipdo.co。zipdo.co同样使用相同的域名服务器,主页标题也同样写着"Facts & Grounding Page"。
这三个网站的网站地图中分别有103578个、107083个、105541个URL,其中格式为"/best/(类别)-software/"的自动生成购买指南页面分别有70731个、71684个、72713个,合计达215128个——而现实中根本不存在这么多软件类别。
worldmetrics.org和gitnux.org的主页HTML标题确实写着"(品牌名) — Facts & Grounding Page",元描述内容也几乎一模一样,只是品牌名不同。
说得直白一点,信息溯源(grounding)指的是AI在给出答案之前,先检索真实网页文档作为依据的环节。这次调查追踪的正是Perplexity在这一环节里抓取了什么内容,结果发现有些网站根本不是为了吸引真人访客,而是专门针对通过这一环节的AI,连页面标题和描述文字都做了针对性设计。
worldmetrics.org在同一页面上还打出广告:定制市场调研"5000欧元起",成品报告"499欧元起",供应商筛选服务"2500欧元起"。也就是说,就在AI引用的自动生成"最佳榜单"正上方,摆着一整套付费服务。
同一个问题 三个不同答案——以项目估算软件为例验证
研究团队从三个网站分别取出关于"项目估算软件(project estimation software)"这一类别的页面进行比对。每个页面都用JSON-LD格式明确标注了排名,可以直接读取,无需另作解读。
| 网站 | 标注负责员工 | 值得注意的特征 |
|---|---|---|
| gitnux.org | Diana Reeves等2人 | 第一名产品在worldmetrics.org的榜单里根本没出现,带有"AI-verified · Expert reviewed"标签 |
| worldmetrics.org | Kathryn Blake等2人 | 仅显示自家排名 |
| wifitalents.com | Ryan Gallagher等2人 | 仅显示自家排名 |
同一个问题背后,竟冒出了9名不同的"负责员工"。更蹊跷的是,三个页面里有两个在作者栏原样显示着"Within the next 26 days",另一个则显示"Within the next 40 days",这明显是没有正确渲染的模板变量。
供应商链接同样对不上
研究团队用直接访问和轮换代理访问两种方式,逐一核实了Perplexity给出的1502个供应商主页地址,结果发现10个地址根本无法连接(其中8个连域名服务器都不存在),另有4个无响应,合计17个(1.1%)处于无法访问状态。被标注为GraphiQL主页的graphiql.com、被标注为微软To Do主页的todo.com、被标注为Trivy主页的aquasecurity.io,实际上根本不存在对应的网站。另外有92个(6.1%)被重定向到了其他注册域名,大多属于常见的收购或品牌重塑情形。
真正的问题出在剩下的两个案例上。
| 类别 | sonar的回答 | sonar-pro的回答 |
|---|---|---|
| 科研数据管理平台 | dryad.co → 被重定向至一家印尼在线赌博网站 | datadryad.org(正常) |
| 数据质量工具 | montecarlodata.com(正常) | montecarlo.com → 被重定向至摩纳哥赌场集团 |
两个模型实际上几乎是对同一个搜索引擎做了两次测量。在380个类别中,有289个类别两个模型的引用列表完全一致,URL集合的Jaccard相似度高达0.898。第一推荐相同的比例也达到380个中的290个。
这项调查未能揭示的地方
研究团队自己也划清了局限。这次测量仅针对Perplexity,并未调查ChatGPT、Gemini、Copilot或谷歌AI模式。数据只是某一天的快照,信息溯源结果可能持续变化,而且每个提示词只用同一种表述问了一次。380个类别也不是真实购买者提问的抽样,而是研究团队自行拟定的清单。团队还特别强调,Tranco排名只反映受欢迎程度,并非质量指标。最重要的是,研究团队并未验证去掉这些资料后推荐结果是否会改变,也不排除这三个网站实际给出的确实是合理推荐的可能性。至于三个品牌背后是否为同一运营主体,团队也只是根据基础设施线索作出推测,并未确认真正的运营方身份。
编辑视角
这项调查揭示的其实是搜索引擎优化(SEO)战场的转移。过去内容农场瞄准的是谷歌搜索排名,而这次曝光的网站压根不指望真人访客,而是直接瞄准AI的信息溯源环节,把页面标题写成"Facts & Grounding Page"。像Perplexity这样通过实时检索网络生成答案的AI搜索服务越多,用这种方式挤进依据资料列表的网站恐怕也会随之增多。
从代际比较的角度看,如今的AI搜索所处的位置,与早期谷歌搜索颇为相似。就像本世纪初谷歌花了不短时间才学会通过衡量链接的数量与质量来过滤内容农场一样,如今的AI信息溯源层同样还缺乏足够的机制来筛查域名的可信度。这次调查中,被引用的未经核实域名的首次存档年份中位数是2020年,其中16.6%是2025年之后才首次出现的——这组数字恰好印证了这一点。也就是说,只要能被检索到,不经可信度核实也能成为依据资料。
从实务角度看,无论是依赖AI搜索结果挑选软件的采购人员,还是希望让自家产品出现在AI推荐中的市场团队,都值得参考这份调查。对采购人员而言,看到AI给出的供应商主页地址后,最好亲自点开确认一次——因为这次调查中就真实出现过域名重定向、把用户导向赌博或赌场网站的案例。对市场团队来说,让自家内容被AI信息溯源环节捕捉到本身并不是问题,但把大量榜单式内容撒向自己根本不参与竞争的市场,这种做法能否长久见效,值得再三权衡。
未来几周内,Perplexity或其他AI搜索厂商很可能会以这份报告为契机,调整域名可信度过滤机制。由于Trellner已将完整数据集和代码以CC BY 4.0协议公开,预计其他研究者或媒体会用同样的方法,对ChatGPT、Gemini、Copilot展开后续验证。





评论