HyperAIHyperAI

Command Palette

Search for a command to run...

利用预训练扩散模型与多模态条件增强摄影测量数字表面模型

Antoine Lorentz Stéphane May Valentine Bellet Dawa Derksen Bastien Nespoulous

摘要

大规模数字表面模型(DSM)可通过卫星影像的立体摄影测量以较低成本生成。然而,所得三维地图常受噪声、异常值和空洞污染。另一方面,航空 LiDAR 能以显著更高的成本提供高精度高程测量。本文研究同时以摄影测量 DSM 和 Pléiades 影像为条件的扩散模型,用于精化垂直方向已配准的 DSM。我们提出一种修改后的 Stable Diffusion 3 架构,该架构具有经过剪枝的文本流和逐块归一化策略,从而能够在 LiDAR 数据上稳定训练,并实现从自然图像到高程图的迁移。在法国多个城市的实验表明,多模态条件能提升高程精度:在上下文内城市中,密集城区 RMSE 从 6.00m 降至 3.45m;在留出城市波尔多,RMSE 从 4.16m 降至 2.77m。

一句话总结

来自 Thales 和 CNES 的研究人员提出了一种修改版 Stable Diffusion 3 架构,该架构采用裁剪后的文本流和逐块归一化,以 Pléiades 影像作为多模态条件来细化摄影测量 DSM,从而提升高程精度:在上下文内法国城市中 Dense Urban RMSE 从 6.00 m 降至 3.45 m,在留出城市 Bordeaux 中从 4.16 m 降至 2.77 m。

核心贡献

  • 引入一种逐块归一化策略,可稳定扩散模型在 LiDAR 局部低方差高程数据上的训练。
  • 通过裁剪 Stable Diffusion 3 多模态 transformer 中的文本流,开发了一种仅图像架构,将 transformer 参数数量从约 2B 降至 1B,同时保留预训练视觉表示。
  • 使用单独的 ControlNet 分别以摄影测量 DSM 和 Pléiades 影像为条件;法国城市实验表明,DSM 加 RGB 条件在上下文内城市将 Dense Urban RMSE 从 6.00 m 降至 3.45 m,在留出城市 Bordeaux 将 Dense Urban RMSE 从 4.16 m 降至 2.77 m。

引言

CARS、S2P、MicMac 和 NASA ASP 等最先进的卫星立体摄影测量流程能够以低成本生成大规模数字表面模型,但其输出通常存在高噪声、遮挡或低纹理区域导致的数据缺失以及匹配误差。机载 LiDAR 更精确,但成本高昂,并且对于频繁、大范围测绘往往不切实际,尤其是在偏远地区。此前的生成式地形研究主要针对空洞填补或文本驱动生成,而相关的深度补全、GAN 复原和超分辨率方法在不同任务假设下运行,并非系统性地细化稠密含噪摄影测量 DSM。

作者提出一种条件扩散方法,该方法在垂直共配准和表面兼容性假设下,将预训练 Stable Diffusion 3 骨干网络适配用于将摄影测量 DSM 细化到接近 LiDAR 质量。其主要贡献包括:用于稳定训练的逐块高程归一化策略;移除文本流以将 transformer 参数从约 2B 减少到 1B 的仅图像 SD3 变体;以及分别以 DSM 和 Pléiades-HR 光学影像为条件的独立 ControlNet。

数据集

数据来源与规模

  • 作者使用一个多城市数据集,该数据集由 IGN LiDAR-HD 点云、正射校正 Pléiades-HR 影像和 CARS 立体 DSM 组合而成。
  • 原始 LiDAR 覆盖 20 个法国城市:Amiens、Angers、Arcachon、Biarritz、Bordeaux、Clermont-Ferrand、Grenoble、Lyon、Marseille、Montpellier、Nancy、Nantes、Nice、Paris、Poitiers、Reims、Rennes、St-Etienne、Strasbourg 和 Toulouse。
  • Pléiades-HR 影像和 DSM 可用于 9 个法国城市:Amiens、Arcachon、Biarritz、Bordeaux、Montpellier、Nice、Paris、Strasbourg 和 Toulouse。
  • 所有产品均在 Lambert93 坐标系下处理为 512 × 512 像素、0.5 m 分辨率的图块。
  • 表 2 按城市汇总了模态可用性,并区分了地理图块位置和 Pléiades 采集-图块对。

LiDAR 和 DSM 预处理

  • LiDAR-HD 点云通过 CARS-rasterize 插件按中值聚合栅格化为 0.5 m 高程栅格。
  • 填补流程处理 2048 × 2048 像素块并保留 50 像素重叠。对连通 LiDAR NoData 区域中低于 800 像素筛选阈值的部分进行填补。符合条件像素从 7 × 7 邻域中取局部第 40 百分位以下数值的均值进行填补,最多迭代五次。
  • 百分位和邻域规则是基于建筑物周边测试经验选择的,并非经过敏感性测试的优化。
  • 任何仍包含 LiDAR NaN 的 512 × 512 目标裁剪块都会被丢弃。
  • 立体 DSM 由 CARS 流程以 0.5 m 分辨率提供。通过 Reference3D 进行正射校正并重投影到 Lambert93 提供了几何起点,但本身不能确保垂直共配准。
  • 对于每个 DSM 采集,作者利用与 LiDAR 的重叠区域估计采集级垂直偏移。作者在 ±100 m 范围内构建有效 DSM-LiDAR 差值的全局直方图,使用 4096 个等宽区间,并减去众数区间中心值。
  • 模型假设输入 DSM 已经过垂直校准。模型还假设 DSM 与 LiDAR 表示兼容表面,因此校正后 RMSE 高于城市特定第 90 百分位的图块被排除在条件之外。
  • 高 RMSE 被排除图块构成一个单独的筛选队列,共 4064 个地理图块。其中 18 个没有列出 Pléiades 采集,17 个在 Montpellier,一个在 Bordeaux。其余 4046 个有 RGB 支持的图块用于附录 D 中的压力评估。

RGB 预处理

  • Pléiades RGB 影像经过正射校正,但不同采集之间没有统一的辐射定标。
  • 当 Airbus 未提供全色锐化影像时,作者使用 GDAL 进行全色锐化。
  • 对于每个采集和 RGB 波段,强度使用第 2 和第 98 百分位进行裁剪。
  • NIR 波段被丢弃,因为模型仅接受三个输入通道。
  • 同一位置上的多个时间采集会被纳入,但它们仍作为一个地理样本分组。在整理阶段随机抽取一次采集,因此额外日期不会增加该位置的采样权重。

图块提取与数据划分

  • 图块提取使用步长为 512 的非重叠 512 × 512 窗口。边界剩余部分被丢弃。
  • 每个城市、x、y 位置定义一个地理图块。相邻图块可能相接但不共享像素,且不应用地理缓冲区。
  • 附加到某一位置的所有 Pléiades 采集都保持在同一划分中。
  • 用于骨干网络适配的仅 LiDAR 训练集使用 19 个非留出 LiDAR 城市。
  • 不具备 DSM 条件的 LiDAR+Pléiades 位置按约 90% 训练、10% 验证划分。
  • 每个非留出城市中完全配对的 LiDAR+DSM+Pléiades 图块按 70% 训练、10% 验证、20% 测试划分。
  • 所有完全配对的 Bordeaux 图块保留作为留出测试城市。缺少三种模态中任何一种的 Bordeaux 位置不用于训练或验证。
  • 同一地理图块不会出现在多个划分中。训练或验证图块在后续阶段中可在相应分区中复用,前提是有额外模态可用。
  • 按城市和阶段的确切划分数量见附录 C 表 A4。

土地覆盖分层

  • 条件高程误差指标使用 10 m 分辨率的 Theia Land Cover 2021 地图按土地覆盖分层,并以最近邻采样重投影到 0.5 m。
  • 因此一个源土地覆盖标签覆盖约 20 × 20 个评估像素,提供的是粗粒度分层,而非逐像素纯净的对象边界。
  • 原始 Theia 类别被归并为五个更宽泛类别:Dense Urban、Sparse Built-Up、Roads、Croplands 和 Vegetation。
  • 表 3 报告了包含 LiDAR-HD、Pléiades-HR 和立体 DSM 数据的位置中,每个源土地覆盖类别和数据集划分的像素数量。
  • 在计算报告的 MAE 和 RMSE 值时,所有方法都使用相同的有限 LiDAR/DSM 支撑。

方法

作者使用流匹配通过常微分方程(ODE)学习噪声分布 p0p_0p0​ 与数据分布 p1p_1p1​ 之间的连续变换:

ddtxt=vt(xt)\frac{d}{dt} x_t = v_t(x_t)dtd​xt​=vt​(xt​)

其中时间相关速度场 vtv_tvt​ 沿密度路径 ptp_tpt​ 传输概率质量。在多样本流匹配中,模型通过从联合分布 q(x0,x1)q(x_0, x_1)q(x0​,x1​) 中采样 (x0,x1)(x_0, x_1)(x0​,x1​) 对进行训练,该联合分布的边缘分布与源分布和目标分布相匹配。轨迹 xtx_txt​ 使用确定性插值函数构造,通常对于 rectified flow 为直线:xt=(1−t)x0+tx1x_t = (1 - t)x_0 + tx_1xt​=(1−t)x0​+tx1​。对应的条件速度场为 vt(xt∣x1)=x1−x0v_t(x_t | x_1) = x_1 - x_0vt​(xt​∣x1​)=x1​−x0​,神经网络通过 Joint Conditional Flow Matching(JCFM)目标匹配该速度场。

直接从标准高斯噪声建模到原始高程图块的传输会因训练目标尺度不合适而不稳定。为缓解这一问题,作者引入逐块噪声缩放方案。作者定义尺度 sss 和偏移 uuu,对噪声分布进行平移和缩放以匹配局部数据特征:x0∼N(u1,s2I)x_0 \sim \mathcal{N}(u\mathbf{1}, s^2I)x0​∼N(u1,s2I)。通过用标准高斯噪声 ϵ∼N(0,I)\epsilon \sim \mathcal{N}(0, I)ϵ∼N(0,I) 重参数化,源噪声表示为 x0=sϵ+ux_0 = s\epsilon + ux0​=sϵ+u,归一化目标数据表示为 x^1=(x1−u)/s\hat{x}_1 = (x_1 - u)/sx^1​=(x1​−u)/s。归一化空间中的传输轨迹变为 x^t=(1−t)ϵ+tx^1\hat{x}_t = (1 - t)\epsilon + t\hat{x}_1x^t​=(1−t)ϵ+tx^1​,目标速度场为 vt(xt)=s(x^1−ϵ)v_t(x_t) = s(\hat{x}_1 - \epsilon)vt​(xt​)=s(x^1​−ϵ)。神经网络被重参数化为预测归一化空间中的速度,v^θ(x^t,t,s,u)≈x^1−ϵ\hat{v}_\theta(\hat{x}_t, t, s, u) \approx \hat{x}_1 - \epsilonv^θ​(x^t​,t,s,u)≈x^1​−ϵ。最终训练目标由全局标量 E[s2]\mathbb{E}[s^2]E[s2] 归一化:

L(θ)=Et,ϵ,x1[s2E[s2]∥v^θ(x^t,t,s,u)−(x^1−ϵ)∥2]\mathcal{L}(\theta) = \mathbb{E}_{t, \epsilon, x_1} \left[ \frac{s^2}{\mathbb{E}[s^2]} \left\| \hat{v}_\theta(\hat{x}_t, t, s, u) - (\hat{x}_1 - \epsilon) \right\|^2 \right]L(θ)=Et,ϵ,x1​​[E[s2]s2​∥v^θ​(x^t​,t,s,u)−(x^1​−ϵ)∥2]

采样时,模型对标准高斯噪声沿归一化概率流进行积分,并使用 sss 和 uuu 执行显式反归一化步骤以生成目标数据 x1x_1x1​。

作者将 Stable Diffusion 3 Medium(SD3)这一双流扩散 transformer 适配用于高程图生成。通过将归一化单通道图块在三个通道上复制,高程图块被适配为类似 RGB 的格式,以供 Variational AutoEncoder(VAE)处理。推理时,三个解码通道在转换为米之前取平均。两个正弦编码器后接 Multi-Layer Perceptrons(MLP),对条件变量 sss 和 uuu 进行嵌入,并将所得嵌入添加到时间步嵌入中。

为了获得高效的仅图像骨干网络,Multimodal Diffusion Transformer(MM-DiT)的文本流被裁剪。关注文本 token 的联合交叉注意力块被替换为对图像 token 的自注意力。文本流特有的投影矩阵、前馈网络、LayerNorm 模块和调制层以及外部文本编码器均被移除。这一缩减将 transformer 规模从 2B 参数降至 1B 参数。

为纳入数字表面模型(DSM)和 Pléiades RGB 影像等辅助模态,作者采用多分支 ControlNet 策略。实例化两个不同的 ControlNet,每个模态一个。在每个 transformer 块中,模态特定残差以逐元素方式相加,然后注入裁剪后的 SD3 骨干网络。

数据集包括 LiDAR-HD、正射校正 Pléiades-HR 影像和 CARS 立体 DSM,它们在 Lambert93 坐标系中处理为 512×512512 \times 512512×512 像素、0.5 m 分辨率的图块。所有栅格均重投影到 Lambert93 坐标系。图块提取在划分之前进行,非重叠窗口定义地理图块。划分策略确保来自同一地理位置的图块在增加模态时仍保留在相应分区中,而所有完全配对的 Bordeaux 图块构成留出测试集。

训练分三个阶段进行:骨干网络适配、单模态 ControlNet 训练和顺序多模态 ControlNet 训练。在骨干网络适配阶段,裁剪后的 SD3 架构在 LiDAR 训练集上训练。当从预训练权重初始化时,使用 1×10−51 \times 10^{-5}1×10−5 的学习率。对于仅 DSM 的 ControlNet,骨干网络被冻结,ControlNet 在成对的 LiDAR+DSM+Pléiades 集合上训练,批次大小计划从 120 增加到 360。对于多模态条件训练,Pléiades ControlNet 首先在 LiDAR+Pléiades 集合上训练然后被冻结,随后在全配对集合上添加并训练 DSM ControlNet。两个 ControlNet 阶段均使用 1×10−51 \times 10^{-5}1×10−5 的学习率。

实验

该研究评估了基于裁剪 SD3 的高程细化模型,具体包括比较预训练和从头训练的骨干网络、在 LiDAR 图块上测量冻结 VAE 往返诊断,并在上下文内城市和留出 Bordeaux 测试集上逐步添加立体 DSM 与 Pléiades RGB 条件。预训练初始化显著优于最佳从头训练配置,而 VAE 诊断表明图像表示保留了高程结构,但存在可测量而适度的失真。条件结果显示,立体 DSM 提供了有用的几何锚点,添加 RGB 通常会改善细化效果,尤其是在密集城市区域,尽管收益因土地覆盖而异,且并非在所有地方都有保证,特别是在均质农田和部分植被区域。总体而言,实验支持光学影像作为立体几何的补充,同时凸显了与采集不匹配、空间变异性以及评估范围受限相关的局限。

在所比较的能力中,先前方法大多是专用化的:若干方法处理空洞填补,Marigold-DC 处理稀疏深度补全,DSM 超分辨率处理分辨率变化,DSM-to-LoD2 处理以 LoD2 类目标为输出的稠密 DSM 校正。所提方法与 DSM-to-LoD2 同样针对稠密 DSM 校正,但增加了 RGB 条件,并将空洞填补作为次要可选能力。该方法与稀疏深度补全、分辨率变化或 LoD2 类目标无关。Diff-DEM、Dfilled 和基于 GAN 的空洞填补方法都具有空洞填补属性,但未标记为稠密 DSM 校正。所提方法和 DSM-to-LoD2 均处理稠密 DSM 校正,但只有所提方法将其与 RGB 条件和次要可选空洞填补能力相结合。

数据集显示,在所报告的法国城市中多模态覆盖不均衡。每个列出的城市都有 LiDAR 图块,而 Pléiades 和立体 DSM 图块仅在部分城市可用。在有 Pléiades 覆盖的城市中,全采集图块数量超过位置级数量,表明随时间重复采集。每个报告城市都有 LiDAR 图块,但 Angers、Clermont-Ferrand 和 Grenoble 缺少 Pléiades 和立体 DSM 覆盖。在报告城市中,Bordeaux 的全采集 Pléiades 图块数量最大,而 Amiens 的 LiDAR 图块数量最大。在存在立体 DSM 数据的城市中,立体 DSM 图块数量始终小于 LiDAR 和 Pléiades 数量。在覆盖城市中,全采集 Pléiades 数量高于位置级 Pléiades 数量,反映每个位置有多个影像日期。

土地覆盖划分以分散城市和落叶森林像素为主,而密集城市、海滩与沙丘以及永久积雪的占比远低。留出城市 Bordeaux 在所有类别上的像素数量都较低,其中密集城市和沿海覆盖尤其有限。对于所有具有非零覆盖的类别,验证划分始终大于 Bordeaux 训练划分。在上下文数据和 Bordeaux 测试划分中,分散城市都是最常见类别,且远超密集城市。落叶森林在上下文数据中是第二常见类别,但在 Bordeaux 的留出覆盖中低得多。相对于其他建成区和森林类别,密集城市在 Bordeaux 测试划分中较为稀缺。海滩与沙丘在每个划分中都是小类别,而冰川或永久积雪的像素为零。

该表比较了骨干网络适配、单模态 ControlNet 训练和顺序多模态 ControlNet 训练的训练配置与计算成本。骨干网络微调和从头训练使用相同的步数和批次设置,但学习率不同,而 ControlNet 阶段共享两阶段批次大小计划。多模态训练顺序添加 ControlNet,并产生最高总成本,因为 DSM 阶段在 Pléiades ControlNet 冻结后运行。从预训练权重和从头开始的骨干网络适配使用相同的步数和批次设置,但从头训练使用更高的学习率。单模态 ControlNet 训练保持骨干网络冻结,并遵循带有批次大小增加的两阶段计划,使后期阶段的计算成本更高。多模态训练顺序添加 ControlNet,在 DSM ControlNet 训练之前冻结 Pléiades ControlNet,在比较的配置中总计算成本最高。

以预训练图像流权重初始化的文本流裁剪 SD3 模型,其 FD_DINOv2 明显低于同样架构从头训练的模型。在该特征分布距离下,预训练初始化约好 4 倍,且该指标为越低越好。这表明 SD3 RGB 预训练在裁剪设置下为高程图生成提供了明显的迁移优势。预训练 SD3 图像流权重给出最佳 FD_DINOv2,显著低于最佳从头训练配置。随机初始化导致高得多的特征分布距离,表明 RGB 预训练对裁剪架构有帮助。

实验评估了一种带 RGB 条件和可选空洞填补的稠密 DSM 校正方法,并将其与先前专用化方法区分开。数据集和土地覆盖分析表明,多模态覆盖在法国城市间不均衡,LiDAR 在所有城市可用,而 Pléiades 和立体 DSM 仅出现在部分城市;划分以分散城市和落叶森林为主,若干类别稀缺或缺失。训练比较表明,顺序多模态 ControlNet 训练的计算成本最高,而预训练 SD3 图像流初始化在裁剪高程图生成方面相比从头训练具有明显的迁移优势。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供