OmniRSCLIP框架:将CLIP扩展到SAR、多光谱与高光谱遥感数据

研究团队提出OmniRSCLIP,通过光谱-空间基分解让CLIP适配任意通道传感器,并构建首个覆盖RGB、SAR、MSI和HSI的遥感图文数据集OmniRS5M。

AI解读:遥感图像理解长期依赖为可见光RGB数据设计的CLIP模型,但SAR、多光谱(MSI)、高光谱(HSI)等传感器的通道格式与RGB不兼容,直接输入会破坏预训练知识。研究团队因此提出OmniRSCLIP:它将每个图像块分解为预训练CLIP提供的空间基和由波长决定的传感器特定系数,使模型在不损失RGB能力的前提下接受任意通道输入,并配合掩码对比学习抑制各传感器的冗余信息。为此他们构建了OmniRS5M,这是首个同时包含RGB、SAR、MSI、HSI四种模态的大规模遥感图文数据集。对依赖单一RGB数据做地物分类或检索的用户,这项研究意味着未来可直接用同一模型处理多源遥感数据,无需分别为每种传感器训练模型。但论文仅提交评审,检索、零样本分类和语义定位的实验结果细节尚未公开,能否在真实业务中稳定替代RGB专用模型仍需后续验证。

一篇提交至AAAI 2027的论文提出OmniRSCLIP,一种支持多源传感器输入的端到端对比学习框架,旨在让CLIP处理SAR、多光谱(MSI)和高光谱(HSI)等异构遥感数据,同时不破坏预训练视觉知识。论文由Xiangyang Miao、Kelu Yao等作者发布在arXiv上,编号为2609.03391。

技术方案与数据构建

现有遥感对比学习方法大多基于面向RGB的CLIP架构,难以利用SAR、MSI和HSI等异构传感器。OmniRSCLIP的核心是引入光谱-空间基分解(SSBD),将任意通道适配问题转化为基重组问题:预训练CLIP的块嵌入提供可迁移的空间基,波长条件系数在受限视觉先验空间内生成传感器特定嵌入核。这种设计避免将异构传感器强行映射到固定通道空间,同时将它们对齐到统一的图像-文本语义空间。

论文还引入光谱上下文感知的掩码对比学习方案,用于抑制模态特定冗余特征并增强细粒度图像-文本对齐。为支持多模态训练,作者构建了OmniRS5M,据称是首个大规模遥感图像-文本语料库,覆盖RGB、SAR、MSI和HSI四种模态。

  • 来源:arXiv论文摘要,标注9页、4图、5表,已提交AAAI 2027。
  • 实验涉及检索、零样本分类和语义定位任务,结果声称OmniRSCLIP在保持RGB域性能的同时有效扩展到异构遥感模态,但具体数值未在摘要中给出。

信息来源