每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

苹果提出通过UMAP内部图谱读取数据的新方法

不再局限于可视化结果,而是直接分析UMAP背后隐藏的邻居图谱,从中找出代表点和密集结构

이미지: METAL LAB 생성

摘要

  • 苹果ML Research提出了一种直接分析UMAP内部生成的k-最近邻(kNN)图谱的方法
  • 研究团队应用了PageRank、k-core分解、聚类系数等网络科学算法,找出代表性数据、密集区域和相似聚类
  • 在MNIST和Fashion MNIST实验中,该方法取得了可与k-medoids、HDBSCAN等专用技术相媲美的结果
발행
Apple ML Research, 2026년 7월
논문 제목
Dimensionality Reduction Meets Network Science: Sensemaking on UMAP's kNN Graph
저자
Duen Horng (Polo) Chau, Donghao Ren, Fred Hohman, Dominik Moritz
적용 알고리즘
PageRank, k-core 분해, 클러스터링 계수
평가 데이터셋
MNIST, Fashion MNIST
비교 대상 기법
k-medoids(대표점 선정), HDBSCAN(밀도 기반 군집화)

发布了什么

苹果ML Research发布了一篇论文,重新审视了数据可视化工具UMAP产生的一个被忽视的副产品。使用UMAP的大多数用户只关注最终生成的二维散点图。但这篇论文关注的是UMAP在绘制该图之前内部构建的k-最近邻(kNN)图谱——一种将每个数据点与其最近邻连接起来的关系网络。研究团队将三种方法应用到这个图谱上:PageRank(曾用于给网页排名的算法,用来挑选代表性数据)、k-core分解(用来区分密集的核心区域和稀疏的外围区域)、聚类系数(用来找出彼此紧密交织的相似邻居群体)。研究团队在MNIST和Fashion MNIST数据集上进行了验证,结果显示这种方法取得了可与挑选代表点的k-medoids、基于密度的聚类技术HDBSCAN相媲美,有时甚至具有互补性的结果。

这意味着什么

UMAP(Uniform Manifold Approximation and Projection)是一种将数百至数千维的数据——比如图像特征值、句子嵌入等——压缩成人眼可见的二维地图的技术。它是数据科学家在海量数据中寻找聚类和模式时最常用的工具之一。问题在于压缩过程中会产生失真。原本在高维空间中相近的点,在被压缩到二维后可能看起来比实际更远;反之,原本无关的点也可能偶然地靠得很近。然而,UMAP在进行这种压缩之前,会先构建一个图谱,标明每个数据点真正与哪些邻居相近。此前,这个中间产物一直被视为计算过程中的副产品,大多被直接丢弃。这项研究注意到,这个图谱本身包含了未经扭曲的原始关系信息,并证明即便直接套用已经成熟的网络科学算法,也能从中获得有价值的洞见。

这会带来什么变化

这种方法有意思的地方在于不需要额外的计算。此前,要理解数据,往往需要分别运行挑选代表点的算法、划分聚类的算法、测量密度的算法。这项研究通过实验证实,仅凭运行UMAP时已经生成的这一张图谱,就可以在很大程度上替代这些独立的运算工作。目前这仍处于在手写数字(MNIST)和服装图像(Fashion MNIST)等相对简单数据集上的验证阶段,能否推广到更复杂的真实数据,还需要后续验证。尽管如此,对于使用数据可视化工具的研究者和开发者而言,这相当于在已经在用的UMAP中,白白多出了一层分析能力。