METAL LAB

谷歌发布AI 可通过卫星自动检测甲烷泄漏源

谷歌研究院与NASA JPL联合打造深度学习模型MAPL-EMIT,检出的羽流数量比现有方法更多

摘要

  • 谷歌研究院与NASA JPL发布了深度学习模型MAPL-EMIT,可利用卫星高光谱数据自动检测甲烷排放源。
  • 团队将全球羽流数据库、训练好的模型、合成数据集以及推理代码库分别公开在Earth Engine、Kaggle和GitHub上。
Methane is a potent greenhouse gas driving approximately 25% of human-induced warming. MAPL-EMIT is a deep-learning model that automates global methane tracking from space to enable scalable climate action.

谷歌研究院联合NASA喷气推进实验室(JPL),于9月1日发布了深度学习模型“MAPL-EMIT”,该模型能从卫星高光谱影像中自动识别甲烷泄漏源。其核心在于分析国际空间站上搭载的NASA观测设备EMIT拍摄的数据,把原本需要人工逐一核对的排放源检测、定量和定位流程实现了自动化。相关内容已发表在美国国家科学院院刊(PNAS)的论文中。

过去分散的甲烷羽流信号必须经过人工逐一审核这一关,如今借助名为MAPL-EMIT的自动检测模型可以直接流转处理,结果是检出的羽流数量比以往多了50%。过去分散的甲烷羽流信号必须经过人工逐一审核这一关,如今借助名为MAPL-EMIT的自动检测模型可以直接流转处理,结果是检出的羽流数量比以往多了50%。

Mapping 官方网站

具体来说,EMIT原本是为了绘制干旱地区矿物成分地图而设计的设备。但由于它采用每个像素记录数百个光波长的高光谱方式,人们发现它还能捕捉到肉眼看不见的甲烷气体所留下的独特化学信号。NASA JPL和科学界正是利用这一特性,一直把EMIT也用于甲烷探测。

甲烷是一种以百年为基准衡量、温室效应比二氧化碳强30倍的气体,据估计造成了工业化以来约25%的人为变暖。由于它在大气中停留的时间较短,只要现在减少排放,就能较快地拖慢全球变暖的速度。基于这一点,有125个以上国家参与的《全球甲烷承诺》(Global Methane Pledge)设定了到2030年将排放量减少30%的目标。问题在于,要实现这一目标,就必须逐一找出石油天然气设施、垃圾填埋场、农业设施等规模仅有数十米的小型排放点。

为什么矿物勘探设备被用来探测甲烷

EMIT原本是为绘制干旱地区矿物成分地图而开发的设备。但由于它每个像素能记录数百个波长的光,人们证实它同样能捕捉到甲烷等气体留下的独特化学信号。NASA JPL和科学界一直利用这一特性,把EMIT也当作甲烷观测工具来使用。

用卫星测量甲烷的方式大体分为两类。像TROPOMI这样的全球测绘仪虽能扫描广阔区域,但分辨率较低;而像EMIT这样的定点观测设备,则能对较小区域进行精细观测。

项目TROPOMI(全球测绘仪)EMIT(定点测绘仪)
观测幅宽约2,600公里80公里
空间分辨率约5.5公里 × 3.5公里60米
光谱分辨率0.1纳米7.4纳米

如上表所示,EMIT拥有足以细看到单个设施级别的高密度分辨率,但正因如此,在地形复杂的区域,部分地表物质会发出与甲烷相似的信号,从而造成误检。以往使用的匹配滤波方法在应对这类背景噪声时较为脆弱,经常会漏掉那些微小而模糊的排放源。

用Swin Transformer区分背景与羽流

MAPL-EMIT通过基于Swin-S(Swin Transformer)的端到端视觉模型解决了这一问题。以往的多数方法都是逐个像素单独分析,而这个模型则会一并读取周边的空间上下文,学习气体随风扩散的模式。正因如此,它能够区分随风飘散的真实甲烷羽流,和碰巧发出相似光谱信号的地面。即便在多个设施排放混杂成一团云状信号的密集工业区,模型也能同时分离出每股羽流的形状和产生地点。

缺乏实测数据,用360万个合成羽流训练

Transformer模型需要海量训练数据,但目前并不存在涵盖全球甲烷排放的标注实测数据集。谷歌研究院用基于物理原理的模拟解决了这一难题:借助能再现颗粒物在大气中运动和扩散过程的拉格朗日烟团模型,生成了360万个合成甲烷羽流,并将其注入真实的EMIT观测场景中进行训练。这套涵盖多种排放量和湍流条件的合成数据,使模型即便在地形和大气条件各不相同的现实环境中,也能稳定地找出甲烷。

이미지: X — 프론티어랩 (웹검색)

相较专家标注,召回率达84%

将模型应用于实际卫星数据后,MAPL-EMIT与NASA的标准数据集L2B相比,捕捉到了专家标注羽流中的84%,并在约1,100个EMIT观测网格中,识别出的疑似羽流数量比现有方法多出约50%。

指标数值
相较专家标注的召回率84%
额外检出羽流比例较现有方法多约50%(基于约1,100个网格)
合成训练羽流数量360万个
全球排放量最大填埋场检出情况25处中的24处

尤其是在全球排放量最大的25处垃圾填埋场中,模型在其中24处捕捉到了羽流,还在约旦安曼一处大型填埋场追踪到了随时间持续存在的排放。不过研究团队也表示,正因为灵敏度较高,在复杂地形下误检问题依然存在。为弥补这一点,每项检测结果都附带了基于物理原理的置信度评分以及“低/高”标签,让使用者可以自行在真实排放和误检之间权衡取舍。

公开资料能做什么

研究团队并没有把成果就此束之高阁,而是通过多个渠道对外公开。发布在Earth Engine上的全球羽流数据库甲烷浓度增强数据可供研究人员和政策制定者直接查阅,Earth Engine可视化应用则能让人在地图上以交互方式查看排放点位。开发者可以下载Kaggle上发布的训练好的模型合成羽流数据集自行实验,也可以通过github.com/google-research/mapl 推理代码库在自己的EMIT数据上运行该模型。这些资料并不局限于特定企业或机构,而是完全公开,当地利益相关方或产业界都可以借此直接审视本地区的排放设施。

NASA表示,正在筹备下一代成像光谱仪,观测范围将比现有设备扩大30到50倍。这意味着观测数据量将迎来爆发式增长,MAPL-EMIT这类自动化工具的作用预计会因此变得更加重要。

官方原始视频

Google Research Blog
Google Research Blog
Google Research Blog

编辑视角

这次发布真正值得关注的地方,与其说是模型的准确率数字,不如说是它的“公开方式”。谷歌并没有止步于发表一篇论文,而是把数据库、训练好的模型、合成数据集和推理代码分别放到了不同平台上。这与谷歌近来力推的地球观测AI(Google Earth AI)战略一脉相承,其思路是不把气候数据只留给研究者,而是让政策制定者和产业界也能直接拿来用。

只要真正深入研究基于卫星的环境监测模型,总会撞上同一堵墙:标注过的实测数据严重匮乏。这次谷歌同样没有用实测数据,而是靠物理模拟生成了360万个虚拟羽流来训练模型,这种合成数据的思路完全可以照搬到气象、灾害、农业等其他实测案例稀少的地球观测领域。国内如果有研究团队或初创公司在做卫星数据或遥感相关工作,与其一开始就死磕收集标注数据集,不如先考虑用基于物理原理的模拟来生成训练数据这条路。

从实操角度看,误检管理才是真正的胜负手。大幅提高召回率,意味着模型的反应也更敏感,而越敏感,误报信号自然也越多。谷歌没有只强调一个准确率数字,而是同时给出置信度评分和“低/高”标签,这是一种务实的设计——把误检与漏检之间的取舍权,交还给使用者自己去把握。可以预见,未来几个月内,很可能会出现环保组织或监管机构实际调用这个数据库的案例;而一旦NASA的下一代光谱仪投入运行,这套自动化流程的价值恐怕会比现在大得多。

评论