HyperAIHyperAI

Command Palette

Search for a command to run...

基于 ATMOS 的损耗与延迟网络下空间机器人遥操作演示

摘要

我们展示了一个演示,其中使用了多用途轨道系统自主测试平台(ATMOS),这是一种平面航天器模拟机器人,旨在用于在类微重力条件下对制导与控制策略进行硬件在环评估。以 ATMOS 作为物理测试平台,我们研究了在往返通信延迟下远程操作航天器的控制架构的设计、分析与性能评估。在这项工作中,我们开发并通过实验验证了一种结合状态预测与轨迹跟踪控制的控制策略,用于执行对接机动,同时考虑地面操作员与 ATMOS 系统之间时变的随机通信延迟。该演示包括首尔与斯德哥尔摩之间的长距离远程控制实验,引入了现实的洲际延迟及其波动性。结果表明,ATMOS 具备支持快速、可靠且低成本地测试航天器遥操作概念的能力,为在类微重力环境中稳健验证在轨操作迈出了第一步。

一句话总结

首尔国立大学、瑞典皇家理工学院、FleetMQ 和加州理工学院的研究人员展示了多用途轨道系统自主测试台(ATMOS),一种用于硬件在环评估的平面航天器模拟机器人,并通过实验验证了一种结合状态预测与轨迹跟踪的控制策略,用于在时变随机通信延迟下进行对接,包括一项首尔至斯德哥尔摩的洲际遥操作实验。

核心贡献

  • 本文介绍了多用途轨道系统自主测试台(ATMOS),一种平面自由飞行航天器模拟机器人,用于在类微重力条件下对制导与控制策略进行硬件在环评估。
  • 一种延迟感知控制策略将对缓慢变化的随机通信延迟的状态预测与基于控制李雅普诺夫函数的跟踪控制器相结合,以在时变往返延迟下执行对接机动。
  • 在首尔与斯德哥尔摩之间跨越 7450 km 链路的跨大陆闭环实验展示了在真实洲际延迟和波动下的稳定远程对接,验证了 ATMOS 作为航天器遥操作概念的快速且低成本测试台。

引言

太空任务越来越依赖远程控制和网络化多智能体架构来执行地面与地外任务,但这些方法依赖于可能引入延迟、抖动和丢包的通信网络,这些因素都可能显著降低闭环性能。在地面上安全地验证具有延迟弹性的控制策略,需要能够复现真实通信条件并支持可重复硬件在环测试的实验平台。作者展示了 ATMOS 平面自由飞行空间机器人,并开发了一种基于延迟感知控制李雅普诺夫函数的控制器,该控制器在随机、时变通信延迟下仍能跟踪固定和时变参考轨迹。其主要贡献是在首尔与斯德哥尔摩之间跨越 7450 km 的跨大陆闭环演示,其中控制输入和状态测量通过 FleetMQ 交换,并利用针对观测延迟的状态预测,在降低控制李雅普诺夫函数值的方向上施加控制。

方法

控制方法

作者将 ATMOS 建模为三自由度机器人平台,其在树脂板上以准无摩擦方式运动。其位形表示为 q=(p,ψ)R2×(π,π]\boldsymbol{q}=(\boldsymbol{p},\psi)\in\mathbb{R}^2\times(-\pi,\pi]q=(p,ψ)R2×(π,π],其中 p\boldsymbol{p}p 为机器人位置,ψ\psiψ 为偏航角。速度旋量为 q˙=[v ωz]R3\dot{\boldsymbol{q}}=[\boldsymbol{v}^\top\ \omega_z]^\top\in\mathbb{R}^3q˙=[v ωz]R3,包含线速度 v\boldsymbol{v}v 和角速度 ωz\omega_zωz。驱动旋量为 u=[f τz]R3\boldsymbol{u}=[\boldsymbol{f}^\top\ \tau_z]^\top\in\mathbb{R}^3u=[f τz]R3,由体坐标系力 f\boldsymbol{f}f 和力矩 τz\tau_zτz 组成。完整非线性加速度模型为

q¨=Gˉ(ψ)u,\ddot{\boldsymbol{q}}=\bar{G}(\psi)\boldsymbol{u}, q¨=Gˉ(ψ)u,

其中

Gˉ(ψ)=[1mRz(ψ)02×101×21Iz],\bar{G}(\psi)= \begin{bmatrix} \frac{1}{m}R_z(\psi) & \mathbf{0}_{2\times 1}\\ \mathbf{0}_{1\times 2} & \frac{1}{I_z} \end{bmatrix}, Gˉ(ψ)=[m1Rz(ψ)01×202×1Iz1],

其中 mmm 为机器人质量,IzI_zIz 为绕竖直轴的转动惯量,Rz(ψ)R_z(\psi)Rz(ψ) 为绕 z 轴的旋转矩阵。定义状态 x=[q q˙]\boldsymbol{x}=[\boldsymbol{q}^\top\ \dot{\boldsymbol{q}}^\top]^\topx=[q q˙] 后,动力学可写成输入仿射形式

x˙=f(x)+G(x)u,\dot{\boldsymbol{x}}=f(\boldsymbol{x})+G(\boldsymbol{x})\boldsymbol{u}, x˙=f(x)+G(x)u,

其中

f(x)=[q˙ 01×3],G(x)=[03×3 Gˉ(ψ)].f(\boldsymbol{x})=[\dot{\boldsymbol{q}}^\top\ \mathbf{0}_{1\times 3}]^\top, \quad G(\boldsymbol{x})=[\mathbf{0}_{3\times 3}\ \bar{G}(\psi)^\top]^\top.f(x)=[q˙ 01×3],G(x)=[03×3 Gˉ(ψ)].

远程控制架构使用控制器与机器人之间的带时间戳数据包交换。控制器发送控制包 Ui=(ui,tiu)U_i=(\boldsymbol{u}_i,t_i^u)Ui=(ui,tiu),其中 tiut_i^utiu 为控制器时钟时间戳,ui\boldsymbol{u}_iui 为指令输入。机器人返回状态包

Xk=(xk,skx,ik,Γk),X_k=(\boldsymbol{x}_k,s_k^x,i_k,\Gamma_k),Xk=(xk,skx,ik,Γk),

其中 xk\boldsymbol{x}_kxk 是在机器人时间 skxs_k^xskx 测得的状态,iki_kik 是最近已应用控制包的索引,Γk=(Δ1,,ΔNs)\Gamma_k=(\Delta_1,\dots,\Delta_{N_s})Γk=(Δ1,,ΔNs) 是最近控制包延迟样本列表。延迟定义为 Δi=siutiu\Delta_i=s_i^u-t_i^uΔi=siutiu,其中 sius_i^usiu 是数据包 UiU_iUi 在机器人时钟下的到达时间。丢失和乱序数据包被显式处理:如果在下一个成功到达之前有多个数据包丢失,则将它们视为与该到达同时到达;晚于较新数据包到达的数据包被丢弃。

当控制器收到状态包 XkX_kXk 时,计算新的控制包 Uk=(uk,tku)U_k=(\boldsymbol{u}_k,t_k^u)Uk=(uk,tku)。然而,由于传输延迟和时钟偏差,UkU_kUk 实际将被应用时的状态是未知的。因此作者通过模拟待处理控制包来估计这一未来状态。对于每个待处理数据包 UjU_jUj,其中 ik+1jki_k+1\leq j\leq kik+1jk,预测到达时间为

s^ju=tju+Δ^j,\hat{s}_j^u=t_j^u+\hat{\Delta}_j, s^ju=tju+Δ^j,

其中 Δ^j\hat{\Delta}_jΔ^j 从当前延迟列表 Γk\Gamma_kΓk 中随机采样。假设输入以零阶保持方式施加,因此

u(t)=uj,t[s^ju,s^j+1u).\boldsymbol{u}(t)=\boldsymbol{u}_j, \quad \forall t\in[\hat{s}_j^u,\hat{s}_{j+1}^u). u(t)=uj,t[s^ju,s^j+1u).

当前控制包到达时的预测状态随后通过对系统动力学积分获得,

x^k+=x^(s^ku)=xk+skxs^ku(f(x(t))+G(x(t))u(t))dt.\hat{\boldsymbol{x}}_k^+ = \hat{\boldsymbol{x}}(\hat{s}_k^u) = \boldsymbol{x}_k + \int_{s_k^x}^{\hat{s}_k^u} \bigl(f(\boldsymbol{x}(t))+G(\boldsymbol{x}(t))\boldsymbol{u}(t)\bigr)\,dt. x^k+=x^(s^ku)=xk+skxs^ku(f(x(t))+G(x(t))u(t))dt.

如果预测到达时间违反其原始顺序,即 s^jus^j+1u\hat{s}_j^u\geq \hat{s}_{j+1}^us^jus^j+1u,则将相应数据包视为丢失。使用 NNN 个不同采样延迟轨迹重复该预测,得到粒子集

Xk+={x^k,1+,,x^k,N+},X_k^+=\{\hat{\boldsymbol{x}}_{k,1}^+,\dots,\hat{\boldsymbol{x}}_{k,N}^+\},Xk+={x^k,1+,,x^k,N+},

该粒子集近似了新计算控制输入将被施加时状态的分布。

对于参考跟踪,作者使用控制李雅普诺夫函数 V(x;xref)V(\boldsymbol{x};\boldsymbol{x}_{\mathrm{ref}})V(x;xref)。如果确切的未来状态 xk+\boldsymbol{x}_k^+xk+ 已知,则可以选择输入以满足下降条件

V˙(xk+,u;xref,x˙ref)+γV(xk+;xref)0.\dot{V}(\boldsymbol{x}_k^+,\boldsymbol{u};\boldsymbol{x}_{\mathrm{ref}},\dot{\boldsymbol{x}}_{\mathrm{ref}}) + \gamma V(\boldsymbol{x}_k^+;\boldsymbol{x}_{\mathrm{ref}}) \leq 0.V˙(xk+,u;xref,x˙ref)+γV(xk+;xref)0.

由于只有粒子集 Xk+X_k^+Xk+ 可用,控制器对所有预测粒子强制满足该条件。通过求解以下问题计算控制输入:

[uk δk]=arg minu,δ  uuref2+pδs.t.δ0,V˙(x^k,l+,u;xref,x˙ref)+γV(x^k,l+;xref)δ,x^k,lXk+.\begin{array}{c} [\boldsymbol{u}_k^\top\ \delta_k]^\top = \operatorname*{arg\,min}_{\boldsymbol{u},\delta} \; \|\boldsymbol{u}-\boldsymbol{u}_{\mathrm{ref}}\|^2 + p\delta \\ \text{s.t.} \quad \delta\geq 0, \\ \dot{V}(\hat{\boldsymbol{x}}_{k,l}^+,\boldsymbol{u};\boldsymbol{x}_{\mathrm{ref}},\dot{\boldsymbol{x}}_{\mathrm{ref}}) + \gamma V(\hat{\boldsymbol{x}}_{k,l}^+;\boldsymbol{x}_{\mathrm{ref}}) \leq \delta, \\ \forall \hat{\boldsymbol{x}}_{k,l}\in X_k^+. \end{array} [uk δk]=argminu,δuuref2+pδs.t.δ0,V˙(x^k,l+,u;xref,x˙ref)+γV(x^k,l+;xref)δ,x^k,lXk+.

这里 δ\deltaδ 是松弛变量,当无法对所有预测状态严格满足 CLF 下降条件时,它放宽该条件;ppp 在参考输入跟踪目标与 CLF 约束满足之间取得平衡。较大的 ppp 优先考虑 CLF 条件的鲁棒满足,从而产生更保守的行为。由于动力学是输入仿射的,该优化是一个具有线性约束的二次规划,并且始终可行。

对于对接演示,输入到 CLF 控制器的参考轨迹由两步运动规划策略生成。首先,机器人稳定到一个直接面向对接站的停靠位形,参考速度为零。一旦机器人足够接近停靠位形,在线最优控制问题生成对接轨迹。偏航角始终设置为面对对接位置,不参与优化。平动参考通过求解以下问题获得:

minp(),v(),a()k=0KakQkak,\min_{\boldsymbol{p}_{(\cdot)},\boldsymbol{v}_{(\cdot)},\boldsymbol{a}_{(\cdot)}} \sum_{k=0}^{K}\boldsymbol{a}_k^\top Q_k\boldsymbol{a}_k, p(),v(),a()mink=0KakQkak,

约束为离散时间双积分器动力学

[pk+1vk+1]=A[pkvk]+Bak,\begin{bmatrix} \boldsymbol{p}_{k+1}\\ \boldsymbol{v}_{k+1} \end{bmatrix} = A \begin{bmatrix} \boldsymbol{p}_k\\ \boldsymbol{v}_k \end{bmatrix} + B\boldsymbol{a}_k, [pk+1vk+1]=A[pkvk]+Bak,

终端对接条件

[pKvK]=[pdock0],\begin{bmatrix} \boldsymbol{p}_K\\ \boldsymbol{v}_K \end{bmatrix} = \begin{bmatrix} \boldsymbol{p}_{\mathrm{dock}}\\ \boldsymbol{0} \end{bmatrix}, [pKvK]=[pdock0],

以及时变加速度限制

amax,kakamax,k.-\boldsymbol{a}_{\max,k} \leq \boldsymbol{a}_k \leq \boldsymbol{a}_{\max,k}. amax,kakamax,k.

加速度限制被选为时间索引 kkk 的递减函数,以降低因过于激进的加速度而偏离对接轨迹的可能性。

实验

评估结合了仿真与硬件实验。软件在环仿真在随机延迟和丢包条件下测试稳定控制和圆形轨迹跟踪,结果表明,与单纯的 PD 参考控制器相比,所提出的控制器持续改善了位置和偏航跟踪精度,尤其在延迟严重程度增加时更为明显。硬件演示通过首尔与斯德哥尔摩之间的互联网链路对 ATMOS 机器人进行远程闭环对接,测得的延迟包括高达一秒的间歇性阻塞,但尽管相关延迟违反了预测假设,控制器仍实现了令人满意的对接性能。

仿真覆盖四种延迟条件:从零延迟、零丢包基线,到轻度、中度和重度随机延迟曲线。三种延迟曲线具有相同的 20% 丢包率,而延迟范围逐步增加。该设置允许在延迟严重程度增加时对控制器性能进行受控比较。零延迟基线的延迟范围为 0 ms,丢包率为 0%。三种非零延迟曲线均具有 20% 的丢包率。轻度延迟的延迟范围为 100 至 200 ms,中度延迟为 200 至 400 ms,重度延迟为 300 至 600 ms。

在仿真中,所提出的控制器在稳定任务的所有延迟条件下均保持较低的位置和偏航 RMSE,而仅参考控制器在中度和重度延迟下急剧恶化。在跟踪任务中,所提出的控制器在报告的延迟水平下也保持远低于仅参考控制器的位置和偏航误差,仅参考控制器的偏航误差显著增长。重度延迟下的跟踪结果未报告。在稳定任务中,所提出的控制器在无延迟、轻度、中度和重度延迟条件下保持位置和偏航 RMSE 几乎不变,而仅参考控制器在中度和重度延迟下出现较大误差增长。在跟踪任务中,仅参考控制器的偏航 RMSE 即使在没有延迟时也显著高于所提出的控制器,并随延迟急剧增加,而所提出的控制器误差仍相对较低。

仿真在稳定和跟踪任务上评估了所提出的控制器与仅参考控制器,四种延迟条件为:零延迟、零丢包基线,以及共享 20% 丢包率且延迟范围逐渐增加的轻度、中度和重度随机延迟曲线。稳定实验表明,随着延迟严重程度增加,所提出的控制器保持位置和偏航 RMSE 几乎不变,而仅参考控制器在中度和重度延迟下急剧恶化。跟踪实验同样表明,所提出的控制器在报告的延迟水平下保持远低于仅参考控制器的位置和偏航误差,而仅参考控制器的偏航误差即使在没有延迟时也显著增长;重度延迟下的跟踪结果未报告。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供