HyperAIHyperAI

Command Palette

Search for a command to run...

面向隐私保护的课堂事件识别:鲁棒且高效的运动推理方法

Paritosh Parmar Landy Lan Hong Yang Chen Yi Chiat Pin Tay

摘要

计算机视觉能否让课堂更安全?在这项初步研究中,我们探索了基于闭路监控风格观测的、隐私感知且计算高效的课堂事件识别。该场景的研究尚不充分,现有基准有限,且鲜有方法能同时满足现实部署对隐私、效率和泛化能力的要求。我们引入了一个新颖的混合基准,将生成式闭路监控风格视频与真实课堂姿态数据相结合,并提出了一个轻量但鲁棒的运动推理框架。该框架的动机源于观察到许多事件在运动方向、速度、加速度和强度上的差异远大于仅姿态上的差异。为此,我们的方法首先构建人体动作的层次化运动学表示,然后将一个大型教师模型中的层次化多阶运动推理知识蒸馏到一个更小的单阶学生模型中,从而在保持丰富运动理解能力的同时,实现对每个人的高效推理。实验表明,我们的模型以不到十分之一的计算成本,在性能上超越了规模大得多的基线模型,同时展现出更强的域外运动推理能力和零样本合成到真实场景的泛化能力。我们将公开发布该基准、代码库及辅助工具,以促进隐私保护课堂安全领域的进一步研究。

一句话总结

来自A*STAR高性能计算研究所的研究人员提出了一种用于隐私感知课堂事件识别的轻量级运动推理框架,该框架将分层多阶运动学推理从大型教师模型蒸馏到单阶学生模型中,以不到大型基线模型十分之一的计算成本,实现了卓越的域外泛化能力和零样本合成到真实场景的迁移。

核心贡献

  • 引入了一个混合基准,该基准结合了生成式闭路电视风格视频与真实课堂姿态数据,针对跌倒和打斗等隐私敏感的安全场景。
  • 提出了一种轻量级运动推理框架,该框架构建分层运动学表示,并将多阶运动知识从大型教师模型蒸馏到一个紧凑的单阶学生模型中,以实现高效的逐人推理。
  • 实验表明,蒸馏后的模型以不到大型基线模型十分之一的计算成本超越了它们,同时展现出更强的域外运动推理能力和零样本合成到真实场景的泛化能力。

引言

课堂安全事件,如肢体冲突、跌倒或辱骂行为,可能无法被及时发现或报告,从而延误干预和责任追究。尽管闭路电视摄像头在学校中日益普及,但连续视频的人工监控容易出错,而由于不常见的天花板安装角度、标准数据集中代表性不足的幼儿群体以及严格的隐私限制,对安全关键事件的自动识别仍然探索不足。作者通过引入一个闭路电视视角的课堂事件识别基准来解决这些差距,该基准结合了使用基于AI的模型生成的合成视频和真实世界的录像。他们提出了一个轻量级、保护隐私的框架,该框架基于骨骼姿态特征而非原始图像运行,性能优于现有的基于姿态的动作识别基线模型,同时所需的计算资源更少,并且他们证明了在合成数据上训练的模型可以有效地泛化到真实的课堂录像中。

数据集

作者构建了一个包含两个互补部分的课堂事件识别数据集:一个合成视频集和一个真实世界姿态集。两者都围绕七类事件动作(跌倒、出拳、跳跃、踢腿、投掷、奔跑、坐下)以及一个用于普通活动的背景元类构建。

数据集构成与来源

  • 合成子集:由AI模型(Kling和Seedance)生成的1,296个视频,经过对多个视频生成器的初步研究后筛选得出。
  • 真实世界子集:从实际幼儿园收集的574个样本,仅保留匿名的姿态数据和经过验证的动作标签。
  • 动作类别是与新加坡的幼儿园教师合作定义的,以反映常见的危险事件。

各子集关键细节

  • 合成视频
    • 规模:质量检查后保留1,296个样本。
    • 来源:使用提示词和校服素材库进行条件生成。
    • 筛选:每个视频由三位作者独立审核其视觉真实感、摄像头属性、运动真实感和动作语义。仅保留获得一致认可的视频。随后由幼儿园教师进行进一步的验证,移除任何剩余的不合理样本。
  • 真实世界姿态数据
    • 规模:574个样本。
    • 来源:来自合作幼儿园的匿名化视频。
    • 筛选:提取姿态数据,标注动作标签,并应用与合成数据相同的教师审核流程。仅保留经过验证的标注和匿名姿态数据。

论文如何使用这些数据

  • 该数据集用于训练和评估课堂事件识别模型。
  • 加入背景类是为了帮助模型区分事件动作和日常课堂活动,从而提高对误报的鲁棒性。
  • 论文未指定确切的训练集划分或混合比例;其重点在于描述构建和质量保证流程。

处理细节

  • 视频生成:使用生成式图像模型和人工验证构建了一个校服素材库。提示词旨在模仿真实的幼儿园闭路电视录像,指定摄像头位置、视角、主体比例以及穿着校服或非校服的学生存在。
  • 标注:开发了一个集成标注工具箱,用于标记动作类别、时间边界和人体姿态。该工具预加载骨骼姿态,因此标注者是在此基础上进行修正而非从头创建,从而提高了效率和一致性。
  • 质量控制:所有生成的视频均通过三位作者审核和随后的幼儿园教师验证。真实世界的姿态数据也经过相同的教师审核步骤。
  • 伦理:真实学生图像仅用作生成校服的匿名参考。发布的数据集仅包含合成视频和经批准的、不含任何可识别个人信息的真实世界骨骼关键点。

方法

作者利用生成式AI构建了一个逼真的合成数据集,用于课堂事件识别。生成流程始于使用最先进的AI图像生成器,通过人机协同流程创建一个专注于校服的素材库。这些选定的素材和来自课堂场景库的精心设计的提示词共同输入到一个SOTA AI视频生成器中。生成的视频经过严格的人工质量检查,确保在纳入最终数据集之前具备视觉真实感、时序一致性和准确的动作语义。

为确保课堂监控中的隐私,作者设计了一个基于姿态的事件识别系统,该系统仅基于人体姿态轨迹而非原始RGB视频运行。这种方法最大限度地减少了对可识别外观特征的依赖,使其适用于敏感环境。

该方法引入了分层运动学表示,以更有效地捕捉动作动态。令 jatRC\mathbf{j}_a^t \in \mathbb{R}^CjatRC 表示关节 aaa 在时间步 ttt 的坐标向量。作者计算了零阶位置、一阶速度 vat=(jatjatδ)/δ\mathbf{v}_a^t = (\mathbf{j}_a^t - \mathbf{j}_a^{t-\delta})/\deltavat=(jatjatδ)/δ 和二阶加速度 aat=(vatvatδ)/δ\mathbf{a}_a^t = (\mathbf{v}_a^t - \mathbf{v}_a^{t-\delta})/\deltaaat=(vatvatδ)/δ。由于高阶导数会放大姿态估计噪声,因此应用了时序预处理。在计算导数之前,对缺失坐标进行插值,并使用Savitzky-Golay滤波器对轨迹进行平滑处理。

完整的方法采用了一种多阶运动学融合策略。专用的骨干网络独立处理每个运动学阶。它们的潜在表示通过加权平均进行融合,形成一个鲁棒的分层多阶教师模型。为了降低部署时的推理成本,该教师模型被蒸馏到一个仅基于零阶特征运行的轻量级学生模型中。学生模型使用多目标损失 LMTL=λKDLKD+λClsLCls\mathcal{L}_{MTL} = \lambda_{KD}\mathcal{L}_{KD} + \lambda_{Cls}\mathcal{L}_{Cls}LMTL=λKDLKD+λClsLCls 进行优化,该损失结合了用于匹配教师模型软化概率分布的知识蒸馏损失和针对真实标签的标准分类损失。

实验

实验评估了一个用于基于骨骼的课堂动作识别的多阶运动推理框架,该框架通过一个从多阶教师模型蒸馏而来的轻量级STGCN++学生模型实现。在一个合成课堂事件数据集上,该方法在使用远少于强基线模型的参数量的情况下达到了最高准确率,并且在对真实世界录像的零样本迁移中也表现出最佳性能,证实了其改进的跨域泛化能力。消融研究表明,融合关节位置、速度和加速度,并仔细调整权重,结合平衡的蒸馏损失,使得紧凑的学生模型能够超越教师模型和基线模型。总体而言,结果表明合成数据结合多阶蒸馏可以产生高效且鲁棒的模型,尽管合成到真实场景的差距仍然显著。

所提出的方法在合成课堂事件数据集上达到了最高准确率,超越了包括PoseC3D在内的所有基线模型,而参数量仅为其十分之一。性能的提升归因于一种多阶运动推理策略,该策略从关节位置、速度和加速度中学习,然后将其蒸馏到一个轻量级学生模型中。尽管取得了领先的结果,但总体准确率仍然相对较低,这表明该数据集存在独特的挑战,如视角变化和细粒度动作差异。所提出的方法达到了最高准确率,比最强基线PoseC3D提高了1.24个百分点,比MSG3D提高了2.90个百分点。该模型使用的参数量仅为PoseC3D的十分之一,却实现了更优的性能。包含关节位置、速度和加速度的多阶运动线索提供了互补信息,改善了对快速或有力动作的识别。将多阶分层教师模型蒸馏到轻量级零阶学生模型中,使得学生模型能够超越教师模型。所有评估方法在该数据集上的准确率均低于在既定基准上的表现,PoseC3D在NTURGBD上的准确率从超过94%下降到本数据集的70.54%。

@@P2P_BLOCK_6@@

所有方法在从合成视频迁移到真实课堂视频时准确率都有所下降,证实了领域差距的存在。所提出的方法达到了最高的零样本真实世界准确率,比最强基线高出四个百分点以上,同时使用了更少的参数和FLOPs。其基于姿态的抽象和多阶运动蒸馏带来了比竞争方法更鲁棒的跨域泛化能力。所提出的方法获得了63.41%的最佳真实世界准确率,比MSG3D高出4.18个百分点,并比其他基线模型有更大的领先优势。基于姿态的特征减少了对合成视觉外观的依赖,速度和加速度线索提供了补充的动作动态信息。将多阶分层教师模型蒸馏到紧凑的学生模型中,有助于模型在领域迁移中保留与动作相关的运动模式。强大的合成域性能并不能保证真实世界的可迁移性,PoseC3D相对于所提出方法更大幅度的性能下降证明了这一点。

@@P2P_BLOCK_7@@

评估使用了一个合成课堂事件数据集,并对真实课堂视频进行了零样本迁移。所提出的方法通过将一个捕捉关节位置、速度和加速度的多阶运动教师模型蒸馏到一个轻量级学生模型中,在使用远少于PoseC3D等基线模型的参数量的情况下,性能超越了所有基线模型。尽管取得了领先的结果,但由于视角变化和细粒度动作差异等挑战,总体准确率仍然较低,并且从合成数据迁移到真实数据时,明确的领域差距得到了证实。该方法的基于姿态的抽象和运动蒸馏带来了更强的跨域泛化能力,在真实世界环境中,其相对于竞争方法的优势最为显著。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供