HyperAIHyperAI

Command Palette

Search for a command to run...

面向实时腹腔镜手术导航的基于 AI 的单帧结构光深度重建

Wayne Wonseok Rodgers Xiangyi Le Seonghoon Jang Shuwen Wei Justin Opfermann Michael Kam Axel Krieger Jin U. Kang

摘要

意义:精准的术中深度感知是实现自主与半自主机器人腹腔镜手术的前提。传统条纹投影轮廓术(FPP)可达到毫米级精度,但通常依赖多帧采集、数字微镜器件(DMD)投影以及投影仪-相机同步,这使其难以集成到紧凑的腹腔镜手术平台中。目的:开发并表征一种无需同步的单帧深度感知平台,该平台用发光二极管(LED)照明的被动式二元掩模替代主动 DMD 投影,并利用矢量量化变分自编码器(VQ-VAE)先验结合定制 U-Net 深度头,从单帧图像重建稠密深度。方法:设计了一个紧凑的 LED/二元掩模投影模块,并将其耦合到双通道腹腔镜(Intuitive)的一个通道上,剩余通道用于对条纹照射的目标成像。使用 3D 视觉相机(Zivid,挪威)采集了 722 张体模目标的参考图像,并同步采集了所提出的单帧结构光内窥镜相机(SSLE)的对应图像进行配准。从侧向安装的 Zivid 相机和 SSLE 分别获取深度测量值以生成深度图,随后将 Zivid 深度图重投影到 SSLE 图像坐标系中,为监督训练和评估提供参考深度图。VQ-VAE 将图案畸变图像编码为离散潜在表示,一个在潜在空间中运行的 U-Net 直接预测对应深度图,无需单独的掩模预测分支来生成深度。结果:在 SSLE–Zivid 配对的二元图案体模数据集上,采用固定的训练/验证/测试集划分进行评估,所提出的 VQ-VAE + U-Net 模型取得了 3.70 mm 的平均绝对误差(MAE)、0.0326 的绝对相对误差(AbsRel)、0.962 的 δ=1.1 精度以及 0.970 的 δ=1.1² 精度。与双 U-Net(MaskNet + DepthNet)基线相比,所提方法取得了更低的 MAE,而基线在阈值精度上略高。与现成的单目深度模型相比,所提方法在 MAE、AbsRel 和阈值精度上均有提升,证明了针对标定内窥镜深度重建进行任务特定训练的优势。所提出的流程在 NVIDIA A100 GPU 上以 26.0 Hz 的频率连续处理 301 帧。结论:一个紧凑的 LED 照明二元图案单帧表面轮廓测量系统,结合潜在空间深度重建,为机器人腹腔镜手术提供了一条实现无需同步的视频帧率深度感知的实用途径。结果展示了在体模数据集上以 Zivid 为参考进行重建,且深度生成路径中无需显式分割阶段,同时凸显了数据集规模和 SSLE–Zivid 标定精度对跨相机监督训练的重要性。

一句话总结

约翰斯·霍普金斯大学的研究人员提出了一种无需同步的单次拍摄深度感知平台,用于腹腔镜手术。该平台利用LED照明的二值掩模和矢量量化变分自编码器先验,结合U-Net深度头,从单帧图像重建稠密深度,在体模数据集上实现了3.70 mm的平均绝对误差和26.0 Hz的处理速率。

核心贡献

  • 一个紧凑的LED照明二值图案投影模块取代了DMD投影仪,可装入双通道腹腔镜内,并实现无需同步的单次拍摄结构光采集。
  • 一个学习型深度重建流水线使用VQ-VAE将图案畸变图像编码为离散潜在表示,并通过U-Net解码器直接预测深度,省去了单独的分割掩膜预测分支。
  • 训练方案通过使用独立的Zivid结构光相机并将深度重投影到内窥镜坐标系,将真值与传统的FPP解耦;在包含722张图像的体模数据集上,该方法实现了3.70 mm的MAE、0.962的δ=1.1准确率,并在NVIDIA A100 GPU上达到稳定的26.0 Hz推理速度。

引言

自主腹腔镜机器人手术需要稠密、实时的度量深度图,用于可视化和闭环工具控制。先前基于学习的单目内窥镜方法只能恢复未知尺度的深度,而传统的条纹投影轮廓术(FPP)系统需要多次拍摄、笨重的DMD投影仪和精确的硬件同步,这些都增加了临床转化的难度。作者提出了一种单次拍摄结构光内窥相机,用紧凑的LED照明被动二值掩模取代了DMD投影仪,并引入了一个VQ-VAE正则化的深度重建网络,该网络在相机帧率下无需同步运行。其训练方案通过使用独立的Zivid结构光相机将真值与传统的FPP算法解耦,在体模数据上实现了3.70 mm的平均绝对误差和稳定的26 Hz推理速度。

数据集

作者构建了一个专用的体模数据集,用于训练腹腔镜成像的单次拍摄深度估计网络。数据采集使用定制系统,将CMOS内窥相机与侧向安装的Zivid结构光相机配对,同时肠道体模在电动线性平台上沿观察轴移动。

  • 数据集组成与来源

    • 数据集包含722对采集数据。
    • 每对数据由一张灰度SSLE图像(在二值图案照明下通过腹腔镜采集)和一张来自Zivid相机的稠密参考深度图组成。
    • 一个自动化程序协调内窥相机、Zivid相机和线性平台,以确保可重复的一对一配对,并采样不同的工作距离和表面姿态。
  • 子集划分与用途

    • 722对采集数据被划分为训练集、验证集和保留的测试集。
    • 训练集用于优化网络参数。
    • 验证集用于模型选择和超参数监控。
    • 所有报告的量化指标仅在保留的测试集上计算。
  • 参考深度生成与处理

    • 通过一次性立体标定,将Zivid深度图重投影到SSLE坐标系中,该标定提供了两个相机之间的内参矩阵和刚体变换。
    • 重投影链将每个Zivid像素反投影为3D点,变换到SSLE坐标系,再投影到SSLE图像平面。
    • 当多个Zivid光线落在同一个SSLE像素上时,z缓冲区保留最近的深度。
    • 该过程生成稠密的参考深度图和二值有效性掩膜,标记在SSLE图像边界内具有有效重投影深度的像素。
  • 训练样本格式

    • 一个训练样本是一个三元组:处理后的SSLE灰度图像、重投影的SSLE深度图和有效性掩膜。
    • 重建损失和评估指标仅在掩膜等于1的像素上计算,从而将监督目标与单次拍摄算法解耦,并将其锚定到外部结构光测量上。

方法

作者设计了一个单次拍摄结构光内窥镜(SSLE)平台,通过双通道腹腔镜的照明通道投射静态二值图案,并使用潜在空间深度网络从单帧相机图像重建稠密深度图。整个流水线包括定制的光机集成、跨相机深度监督的自动化数据采集以及基于VQ-VAE的深度预测架构。

机械集成将被动二值掩模、LED光源和中继光学元件安装在一个紧凑的密封外壳内,该外壳直接旋接到腹腔镜的照明端口。由于掩模是静态的,LED由直流驱动,因此投影和成像之间无需同步;每一帧捕获的图像都带有有效的图案。

剖视图显示LED、中继和掩模布置在一个与标准光导连接器体积相当的空间内,同时内窥镜的成像通道保持畅通。组装后的腹腔镜可以安装在UR5型机器人平台的相机臂上,不会干扰工具臂的运动包络。

光学配置将LED照明掩模的二值图案通过透镜L₁和针孔中继到双通道腹腔镜的照明通道。成像通道收集图案畸变的场景,并通过折叠棱镜将其导向单色FLIR相机。

桌面实现将所有组件放置在光学面包板上。侧向安装的Zivid 2⁺ M60结构光深度相机仅在数据采集期间使用,以提供独立的真值深度;部署时,Zivid相机被移除,内窥镜作为独立的单次拍摄传感器运行。一张在二值图案照明下的肠道体模代表性内窥图像证实,投射的条纹清晰可见。

为确保图案在典型的腹腔镜工作距离下仍然可用,作者在倾斜的景深目标上表征了二值图案的可见性。

在7 cm和10 cm的工作距离下,投射的条纹仍然视觉可分辨。提取的强度剖面显示重复的峰谷调制,迈克尔逊对比度分别为0.58和0.44,证实了图案对比度足以进行单次拍摄深度重建。

训练数据通过一个自动化采集程序收集,该程序协调CMOS内窥相机、Zivid相机和电动线性平台。肠道体模沿内窥镜观察方向平移,以采样不同的工作距离和表面姿态。在每个位置,同时采集二值图案照明下的灰度SSLE图像以及Zivid RGB图像、点云和深度图。一个公共帧索引保持SSLE输入与参考深度之间的配对。

对于每一帧SSLE图像,使用一次性立体标定将Zivid深度图重投影到SSLE图像坐标系。每个有效的Zivid像素被反投影为Zivid坐标系中的3D点,通过刚体变换(R, t)变换到SSLE坐标系,再投影到SSLE图像平面。当多个Zivid光线映射到同一个SSLE像素时,z缓冲区保留最近的深度,生成稠密的参考深度图D_SSLE和二值有效性掩膜M。这种重投影将训练目标与重建算法解耦,并提供像素对齐的监督。

深度重建网络用包含矢量量化变分自编码器(VQ-VAE)作为潜在空间先验的单分支流水线取代了先前的双分支U-Net设计。

一张256×256的灰度条纹图像x经过三个顺序组件处理。首先,VQ-VAE图像编码器将x映射为连续潜在张量z_in ∈ ℝ^{64×128×128},然后通过在学习到的码本(K_img = 512个条目)中进行最近邻查找,独立量化每个空间位置,生成离散潜在表示\hat{z}_in。其次,一个四级多分辨率残差U-Net(MRD U-Net)直接对\hat{z}_in进行操作,通过最大池化逐步将空间分辨率减半并加倍通道宽度,然后通过双线性上采样、跳跃连接和多级残差分支进行重建。输出为潜在深度表示\hat{z}_depth ∈ ℝ^{64×128×128}。第三,VQ-VAE深度解码器以相反的方式镜像图像编码器,使用K_depth = 1024个条目的码本和转置卷积上采样步骤,随后经过tanh激活和线性缩放,生成最终的稠密深度图\hat{D} ∈ ℝ^{1×256×256}。在量化潜在空间中操作,无需显式的前景分割,并提供紧凑的重建路径和稳定的推理时间。

网络使用结合空间重建项和潜在空间匹配项的总损失进行训练:

Ltotal=Lspatial(D,D^,M)+β(t)Llatent(zd,z^d).\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{spatial}}(D, \hat{D}, M) + \beta(t) \mathcal{L}_{\text{latent}}(z_d, \hat{z}_d).Ltotal=Lspatial(D,D^,M)+β(t)Llatent(zd,z^d).

空间损失是ℓ₁损失和结构相似性(SSIM)损失的加权和,仅在M指示的有效像素上计算。潜在损失是标准化参考深度潜在表示z_d(由预训练的深度VQ-VAE编码器获得)与预测深度潜在表示\hat{z}_d之间的ℓ₁距离。权重β(t)遵循线性斜坡调度,在训练过程中逐渐增加,随着训练稳定,鼓励与学习到的量化结构先验对齐。

使用taming-transformers框架分别为输入图像域和参考深度域预训练独立的VQ-VAE模型。然后,MRD U-Net深度预测网络使用Adam优化器、余弦退火学习率调度和有效批量大小为4进行161个epoch的训练。所有图像和深度图都被调整为256×256。评估使用标准深度指标——MAE、AbsRel以及阈值δ=1.1和δ=1.1²下的准确率——仅在保留的测试集上通过Zivid有效性掩膜计算。

实验

评估使用以Zivid为参考的体模数据集,包含722对SSLE–Zivid采集数据,将提出的VQ-VAE + U-Net流水线与双U-Net基线以及现成的单目深度模型进行比较。提出的模型实现了更低的平均误差,其原始未掩膜预测已近似有效前景,无需显式的掩膜分支,同时推理以稳定的26 Hz运行。剩余的重建误差部分归因于Zivid监督带来的跨相机重投影不匹配,且两个任务特定模型均大幅优于单目基线,突显了在内窥镜结构光设置中,任务特定监督对于校准深度恢复的重要性。

在Zivid参考体模数据集上,VQ-VAE + U-Net模型实现了比双U-Net基线更低的平均深度误差,MAE降低约14%,AbsRel降低42%,同时在更严格的阈值下保持相当的准确率。公开的单目深度模型产生了显著更高的误差,而提出的模型学会了隐式表示前景,无需显式的掩膜分支。与MaskNet + DepthNet基线相比,提出的模型将MAE从4.30 mm降至3.70 mm,AbsRel从0.0560降至0.0326,δ=1.1准确率仅略有下降(0.962 vs. 0.965)。现成的单目模型(MiDaS DPT-Large和Depth Anything)的MAE超过7.8 mm,是提出方法误差的两倍以上。提出模型的原始未掩膜预测与体模前景紧密匹配,表明网络学会了隐式分割,无需单独的分割掩膜预测分支。提出模型和基线模型报告的MAE均高于先前发表的FPP监督结果,因为Zivid跨相机重投影引入了网络无法补偿的失配误差下限。

评估在Zivid参考体模数据集上比较了VQ-VAE加U-Net架构与双U-Net基线以及公开的单目深度模型。提出的模型相比基线大幅降低了平均深度误差,实现了更低的平均绝对误差和绝对相对误差,同时保持相当的严格准确率,并且学会了隐式表示前景,无需显式的掩膜分支。现成的单目模型产生的误差是提出方法的两倍以上。所有模型都表现出比先前发表的条纹投影轮廓术监督结果更高的误差,原因是Zivid重投影引入了跨相机失配的下限。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供