人工智能如何教会卫星看东西

人工智能如何教会卫星看东西

每天,数百万人打开 Google 地图来查找回家的最快路线、搜索餐厅或探索他们从未去过的地方。这种熟悉的体验背后隐藏着一项非凡的壮举:在全球大部分地区,数十亿条道路、建筑物、森林、河流和其他特征已被识别并组织成用户可以立即访问的信息。

在更大范围内,卫星观测还使科学家能够调查消失的森林、消退的冰川、不断扩张的城市和不断变化的气候。理解这些大量信息是地球观测领域的核心。

卫星仅提供图像,但更大的挑战是将其转化为有关地球上正在发生的事情的有意义的信息。因此,地球观测不仅仅是卫星成像或遥感的另一个名称;它是通过测量数据解释地球的更广泛的研究。

现代卫星图像分析通常围绕三个基本任务。

“这是通过测量数据解释地球的更广泛的研究”

分类确定图像或对象属于哪个类别,例如住宅区、农田或森林。分割将像素分配给类别,识别这些农田和森林的精确边界。变化检测会比较不同时间拍摄的图像,以确定发生了什么变化,例如在城市扩张、冰川退缩或森林砍伐期间。

2012 年之前,卫星图像分析的尝试依赖于“手工制作的特征”。科学家们没有让计算机自己发现模式,而是手动定义不同景观的特征。例如,森林往往是绿色和有纹理的,而建筑物是灰色和矩形的。

然后,传统的机器学习算法可以使用这些预定义的特征对图像进行分类。这些方法在很大程度上依赖于人类的专业知识,并且难以应对不同气候、季节和地理区域中景观的巨大多样性。

2012 年左右,卷积神经网络 (CNN) 的出现改变了工作流程。 CNN 不是要求人类指定森林或建筑物的定义,而是直接从原始卫星图像中学习这些特征。通过重复的“卷积”,即小过滤器扫过图像来搜索特定的视觉模式,网络逐渐构建出越来越复杂的表示。

早期层识别简单的特征,例如边缘、角和纹理;更深层次将这些组合成道路、屋顶和植被等结构,最终使网络能够区分住宅区和工业区等整个景观。

“2012 年左右卷积神经网络 (CNN) 的出现改变了工作流程”

尽管早期的 CNN 极大地改进了图像分类,但它们的主要设计目的是将每个图像作为一个整体进行标记。地球观测通常需要更精确的东西:不仅仅是识别图像包含森林、道路或建筑物,而是准确确定哪些像素属于它。

全卷积网络 (FCN) 的创建以及 2015 年 U-Net 的创建,将深度学习扩展到了这一像素级任务,使得精确的图像分割成为可能。 2017 年至 2020 年开发的混合模型随后将 CNN 与循环神经网络 (RNN) 配对,将 CNN 识别空间模式的能力与 RNN 保留先前分析的图像部分信息的能力结合起来。

尽管取得了这些进步,CNN 仍然主要通过本地社区来分析图像,这使得捕捉场景中遥远部分之间的关​​系变得困难。例如,将两个相距较远的河段识别为河流与将它们识别为同一河流系统的一部分并不相同。

2020 年左右开发的视觉变换器 (ViTs) 通过自注意力解决了这一限制,它允许图像的不同部分直接交换信息并确定哪些其他区域与解释它们相关。这种更广泛的背景可以提高对复杂景观的理解,但也带来了更大的计算需求。

“分割任何模型(SAM,2024)旨在分割呈现给他们的几乎所有对象”

目前的研究正在探索几个新的方向。状态空间模型维持不断变化的内部“状态”,在图像中携带相关信息,可能比自注意力更有效地捕获远程关系。

与此同时,基础模型采取了更雄心勃勃的方法。 Segment Anything Model (SAM, 2024) 等模型不是被训练来仅识别一组预定义的对象,而是被设计为在简单提示的指导下分割呈现给他们的几乎任何对象,从日常场景到卫星图像。

然而,这两种方法在地球观测领域仍处于早期阶段。它们在不同传感器、分辨率和环境中的泛化能力仍然需要更广泛的测试。

地球观测最终旨在回答一个看似简单的问题:我们的星球上正在发生什么?现在,人工智能从根本上改变了我们将观察结果转化为知识的方式。了解地球已成为人类科学家和智能算法越来越多地共同承担的任务。

Měilíng Lǐ
关于