Command Palette
Search for a command to run...
YOLO-PEFT:面向 YOLO 系列的参数高效微调
YOLO-PEFT:面向 YOLO 系列的参数高效微调
Xu Lin WenJie Nie Jinlong Peng Weifu Fu YueXiao Ma Xiawu Zheng Yong Liu
摘要
从语言模型迁移而来的通用参数高效微调(PEFT)方法可能在实时检测器上悄然失效,因为其异构算子和检测特有组件引入了常规 Transformer 堆栈所没有的放置约束。我们提出 YOLO-PEFT,一个结构感知框架,将适配器放置形式化为一个可审计的约束规划问题。给定检测器图、PEFT 请求和资源预算,YOLO-PEFT 分配算子和语义角色,评估显式的算子有效性、检测器语义、图接口和部署谓词,为每个被排除的模块记录原因码,并输出一个预算内的目标模块规划,或在训练前返回 Refuse。在官方 VOC07+12 trainval 至 VOC07 test 协议下,规划器选择的 RS-LoRA 在 YOLO11s 和 YOLO12s 上分别达到 0.7138 和 0.7307 mAP50-95,而全量监督微调(Full-SFT)分别为 0.6428 和 0.6662。在 RT-DETR-L 上,所有七种被评估的 LoRA 系列配置均越过预定义的灾难性阈值,支持在评估覆盖范围内做出经校准的 Refuse-to-Full-SFT 决策。一项受控的 YOLO11 审计进一步表明,LoRA 将峰值训练内存降低了 43.9%,尽管训练时间延长为 1.72 倍。在所评估的检测器系列、放置策略和校准覆盖范围内,YOLO-PEFT 用显式、可审查的规划取代了人工目标模块试错,同时保留了经过验证的训练-保存-合并-导出路径;对未见检测器架构的拒绝仍是一个开放的验证问题。
一句话总结
腾讯与厦门大学的研究人员提出了 YOLO-PEFT,一个结构感知框架,将参数高效微调的 adapter 放置形式化为可审计的约束规划问题,实现自动化的目标模块选择并附带原因码以及 Refuse 能力,在 YOLO11s 上获得 0.7138 mAP50-95,在 YOLO12s 上获得 0.7307,同时将峰值训练内存降低 43.9%。
核心贡献
- YOLO-PEFT 将面向实时检测器的 adapter 放置形式化为可审计的约束规划问题,为每个模块分配算子角色和语义角色,执行显式有效性检查,并输出满足预算的目标模块方案,或在训练前输出带有原因码的拒绝。
- 在 VOC07+12 trainval-to-VOC07 test 协议下,规划器所选的 RS-LoRA 在 YOLO11s 和 YOLO12s 上分别达到 0.7138 和 0.7307 的 mAP50-95,优于全量微调(0.6428 和 0.6662)。在 RT-DETR-L 上,所有被评估的 LoRA 配置均触发预设的灾难阈值,支持在测试覆盖范围内做出经校准的 Refuse-to-Full-SFT 决策。
- 该框架用显式、可检查的规划替代人工对目标模块的试错,并保留了经过验证的训练-保存-合并-导出路径。一次受控的 YOLO11 审计显示,LoRA 将峰值训练内存降低 43.9%,而训练时间延长 1.72 倍。
引言
在不同词汇表、领域和硬件后端上部署实时检测器需要反复适配,而全量微调成本高昂。参数高效微调(PEFT)可缓解此成本,但为同构 Transformer 堆栈设计的标准 PEFT 方法在异构检测器图上会失效:现代 YOLO 风格的架构混合了多种卷积类型、分布感知损失、可变形注意力、文本-图像融合以及混合专家路由,不加区分的 adapter 插入会降低精度甚至完全失败。此前的检测器专用 PEFT 方法与特定架构或任务绑定,缺乏预训练可行性检查,也未提供统一的训练、合并和导出生命周期,因此失败只能在试错中才被发现。作者将检测器 PEFT 重新建模为异构计算图上的多约束规划问题,并引入 YOLO-PEFT,一个结构感知框架,该框架解析算子语义、过滤不安全目标、在预算内分配秩、估计风险、在训练前拒绝不可行方案,并将接受的方案降级为完整的训练-保存-合并-导出运行时。
方法
作者将 YOLO 检测器中的 adapter 放置形式化为一个受约束的决策问题,该问题不能仅依赖模块名称匹配,因为异构算子和任务特定的密集检测头要求结构和语义感知。整个流程分四个阶段:将检测器解析为角色感知图,求解约束有效的放置,将方案降级为兼容 YOLO 的运行时,并应用可选训练策略以稳定优化。仅当存在可训练、可部署的方案时请求才会被接受;否则框架会显式拒绝,以此区分不支持的配置与被预测为不准确的配置。
检测器表示为有向无环图 G=(V,E),其中顶点为模块实例,边承载张量流。PEFT 请求 R=(p,T,L,K) 指定一个变体 p、可选的目标集合 T、可选的层区间 L 以及一组允许的秩 K。给定参数预算 B,框架生成放置 π:Vcand→{0}∪K,π(i)=0 表示冻结层,π(i)=r 表示分配一个秩为 r 的 adapter。有效方案必须同时满足算子有效性、检测头语义安全性、图接口兼容性、参数预算可行性以及部署兼容性。最终输出为一个三元组 P(G,R,B)=(d,π,J),其中 d∈{ACCEPT,REFUSE},J 是有序的拒绝日志,解释每一次排除。
为使这些决策可审计,GraphParser 为每个模块分配两个独立的角色。算子角色刻画计算契约:密集卷积允许通常的低秩因子,分组卷积需要组内局部因子,而深度可分离卷积因无法混合通道而被视为不安全。归一化、激活函数和未知算子均被保守处理。语义角色编码检测器特有的含义:固定的 DFL 投影、对几何敏感的回归路径以及 MoE 路由器被永久排除,因为即使微小的更新也可能扰乱已校准的输出或专家分配。角色分配将图位置与已知的架构范式结合,包括 YOLO12 Area-Attention 模块、RT-DETR 可变形注意力模块、YOLO-World 文本融合以及 MoE 路由器/专家结构。未识别的模块获得未知角色且永不被适配,从而使不支持的结构显式化。解析器还计算一个有限维指纹 ϕ(G)∈R10,其核心维度衡量注意力、文本融合、MoE 专家、深度可分离卷积以及密集/分组卷积的相对存在程度(例如 ϕattn=∣attention∣/∣Vrole∣),另外五个统计量编码深度、宽度、检测头参数比、残差密度和归一化类型。核心维度驱动稳定性分析和变体级校准,且该指纹维度不会在未知检测器家族上验证。
在获得角色感知图后,Planner 按固定顺序求解放置:过滤算子、过滤语义、应用架构条件策略、分配秩,然后验证可靠性。有效性始终优先于效率。算子过滤会移除深度可分离卷积、归一化/激活函数以及未知算子。对于有 G 个分组的分组卷积,总秩按 r=∑g=1Grg 分配,且均衡分配要求 G∣r。语义过滤随后排除固定的 DFL 投影、MoE 路由器以及对几何敏感的回归头。用户提供的目标 T 和层区间 L 仅在上述强制过滤之后才取交集,因此显式请求无法重新启用不安全的模块。
架构条件策略编码经验性安全措施。例如,对于 ϕattn>0.7 的 RT-DETR-L 档案,低于校准阈值的 LoRA 族配置将被拒绝,而未识别的 Transformer 检测器则不予支持。在注意力密集的 YOLO12 上,DoRA 被转换为 LoRA 并启用安全注意力训练;被评估的档案允许 r∈{8,16,32},r=16 为帕累托默认值。YOLO-World 文本融合请求可从 LoRA 路由至 LoHa,而纯 CNN 图则禁用注意力目标。模块级规则有意保持保守:YOLO12 排除 attn.{qkv,proj,pe} 以及内部 Area-Attention MLP 卷积;RT-DETR 排除网格初始化的 sampling_offsets 和零初始化的 attention_weights;且 .dfl. 投影始终冻结。作者以 YOLO12s 上的端到端示例进行说明:一个秩为 16 的 RS-LoRA 请求作用于所有卷积和线性模块,首先被展开为骨干、颈部和解耦头节点。算子和语义过滤移除深度可分离卷积宿主、DFL 以及几何敏感的回归节点;YOLO12 策略移除 attn.{qkv,proj,pe} 和内部注意力 MLP 卷积;图接口检查保留形状保持的骨干/颈部卷积。随后预算求解器向存活的密集卷积目标分配 r=16 直到达到 B,并输出目标列表、排除项/原因映射以及实际参数开销。更改用户指定的区间 L 或预算 B 仅影响最终的取交和秩分配,绝不会改变强制排除项。
过滤完成后,规划器通过求解
πmaxi∈Vcand∑u(i,π(i);p,ϕ)s.t.i∑cp(i,π(i))≤B,来分配秩,其中对于 LoRA 风格 adapter,clinear=br(din+dout),cconv=br(Cinkhkw+Cout),b 为每个可训练参数的字节数。分组卷积使用 b∑grg((Cin/G)khkw+Cout/G)。在仅规则模式下,效用 u 组合算子、语义、区间和秩等效用并减去损失惩罚 λcp;效用非正的候选对被丢弃。若所有秩为零或实际开销超过 B,方案将被拒绝。
对于硬约束未确定的候选对,一个经校准的可靠性模块估计 ΔmAP≈β0+β1ϕattn+β2ϕtext+β3ϕdw+β4ξp,其中 ξp 是在规范矩阵上拟合的变体系数。若预测值低于灾难阈值,方案被拒绝。校准模式仅在已观测架构上评估;仅规则模式仍为默认。
方案被接受后,Contract 降级每个 (i,r),同时保持四项不变量:基础检查点加载不变;adapter 检查点只存储 adapter 张量和运行时元数据;合并恢复普通的 YOLO 模块;ONNX 和 TensorRT 导出器看到的是可导出图。运行时对外暴露一个接口,底层有两类后端。HuggingFace PEFT 处理 LoRA、RS-LoRA、DoRA、LoHa、LoKr、AdaLoRA、IA3、OFT、BOFT 和 HRA。一个更精简的仓库内部后端在 PEFT 不可用时提供纯卷积 LoRA。两条路径共享相同的已求解目标集和生命周期:在构建优化器前安装,以冻结的基础权重训练,仅保存 adapter 状态,加载到兼容的基础检测器,合并,移除包装器,然后导出。卷积融合在 adapter 未合并时被禁用。对于后备卷积 LoRA,每个组内局部更新 ΔWg=BgAg⊤ 被重塑到其宿主核分区;合并 W0←W0+sΔW 保持分组结构,并产生与包装模块在浮点容限内等价的输出。
四种可选训练策略可在不改变放置的情况下稳定优化。逐层学习率衰减使用 ηℓ=η0ρdℓ,其中 ρ=0.85,归一化深度 dℓ 降低早期特征提取器的更新幅度;相似的深度因子被合并到少量优化器参数组中。Alpha 预热采用余弦调度将 LoRA 缩放因子 α/r 从零逐渐线性抬升至目标值,防止一个全强度随机 adapter 在初始阶段破坏注意力密集的检测器稳定性(YOLO12 需要至少三个预热轮次)。正交正则化每隔 N 批次添加 λortho(∥A⊤A−I∥F+∥B⊤B−I∥F),默认 λortho=0.5,并采用分块计算以控制内存。动态 dropout 在 30% 的训练轮次之后将 adapter dropout 从 0 线性增加到 0.15,以保留早期梯度信号并正则化后续更新。每种策略均可独立配置。
实验
使用 PASCAL VOC 数据集和一致的微调协议,实验评估了在 CNN、注意力增强、文本融合以及基于 Transformer 的实时检测器上的参数高效 adapter 放置。PEFT 的可靠性强烈依赖于架构:注意力密集模型(YOLO12、RT-DETR-L)会出现严重崩溃,而一个遵循算子语义、排除检测头并缓解多模态梯度不匹配的结构感知规划器,始终优于朴素放置和全量微调。消融研究进一步表明,语义有效性约束是稳定性驱动因素,训练先验以非叠加方式交互,拒绝不安全配置可避免浪费训练尝试,尽管内存节省伴随着更长的优化时间。
在 YOLO11s 检测器上应用的 PEFT adapter 始终优于全量微调。采用 RS-LoRA 缩放的 LoRA 和 DoRA 实现了最高 +0.071 mAP50:95 的提升,而关闭 DoRA 的 RS-LoRA 几乎消除全部增益。LoKr 变体带来了强劲的 +0.0605 增益,且无额外推理成本、参数增量极小。秩为 16 并采用 RS-LoRA 缩放的 LoRA 和 DoRA 均达到 0.7138 mAP50:95,高于全量微调 0.071。关闭 DoRA 的 RS-LoRA 缩放使增益降至仅 +0.005,表明该缩放对性能至关重要。LoKr 在保留与全量微调相同推理 GFLOPs 且仅增加 0.07M 参数的情况下,将 mAP50:95 提升了 +0.0605。
形式化的约束接口在检测器适配过程中可明确阻止不安全的结构修改。实验证实,放宽语义检测头限制会极大扩充候选池,而精度收益微不足道;算子有效性正确地排除了未带来经验收益的深度可分离操作。架构策略至关重要,因为即使安全的骨干适配仍会导致不可忽略的漂移传播到冻结的解码器,而训练先验的交互表明可靠性校准必须防范非叠加配置崩溃。移除检测头类型限制可引入超过 500 倍的候选模块,且精度改进有限,暗示优化压力发生了转移而非发散。被算子有效性排除的深度可分离卷积并未贡献任何可行的高秩目标,该约束在实践中无代价。安全的骨干适配仍会在冻结的 RT-DETR 解码器中引起可测量的漂移,从而证明冻结采样偏移和注意力权重的策略是合理的。秩预算为 16 时达到最优的精度-效率权衡,更高秩呈现收益递减,确认了预算约束的实际意义。在没有部署契约的情况下进行朴素 adapter 替换会破坏 ONNX/TensorRT 导出和检查点保存,而契约层保留了合并与导出不变性。联合训练先验的交互是非叠加的:在不开 RS-LoRA 缩放的情况下启用 DoRA 会导致性能严重下降,这促使了在覆盖范围内可靠性检查的必要性。
从语言模型默认配置转向结构感知放置始终提升检测精度。在 YOLO11s 和 YOLO12s 上,使用 RS-LoRA 而非未使用秩稳定缩放的 DoRA,mAP 分别提高约 0.066 和 0.120。对于 RT-DETR-L,继承的 LoRA 扫描导致灾难性性能,规划器安全地予以拒绝并回退至全量微调。YOLO12s 受益最大,RS-LoRA 达到 0.7307 mAP,而默认 DoRA 配置仅为 0.6112。规划器通过拒绝返回低于阈值的 adapter 并默认全量微调,避免了 RT-DETR-L 上的灾难性结果。两列共享相同的骨干和评估协议,将结构感知放置隔离为观测增益的来源。
在一个混合专家 YOLO 检测器上,在关闭所有目标控制的情况下对 PEFT adapter 进行压力测试。HRA 获得了最高的 mAP50:95(0.7454),大幅超过全量微调,而 IA³ 和 LoKr 也表现出较强的提升。两个配置在评估前即失败,说明了规划器为何必须在部署前验证能力。HRA 实现了最佳 mAP50:95(0.7454),相比于记录的全量微调分数 0.6891 提升了 +0.0563。IA³ 和 LoKr 均超过 0.74 mAP50:95,而 LoRA 和 RS-LoRA 仅产生低于 0.70 的边际改善。BOFT 和 OFT 未能报告评估指标,其余 6 个产生指标的 PEFT 运行均成功完成。完成的各次运行挂钟时间差异较大,从 2.14 小时(RS-LoRA)到 11.37 小时(HRA),全量微调为 5.54 小时。
在 YOLO12s 上的约束谓词诊断显示,放开注意力流和有类型检测头规则会引入大量新模块并提高 adapter 梯度范数,同时保持梯度有限,表明优化压力发生改变而非崩溃。深度可分离规则在秩 4 时未添加任何模块,因此不能归因于训练效应;DFL、MSDeform 几何以及输出头相关的反事实规则由于语义不兼容而无法直接插入。在 RT-DETR-L 上安全适配的骨干会向冻结的解码器传播可测量的相对漂移(解码器和最终输出中约 0.5 ℓ₂ 偏移)。移除注意力流约束允许 32 个模块进入 adapter 并使平均 adapter 梯度范数提升 1.581 倍,且未出现非有限梯度,表明该规则调控优化压力而非阻止崩溃。放开有类型检测头谓词引入 18 个模块,梯度范数提升 1.091 倍,短期 mAP 变化为 -0.0337;而深度可分离规则在秩 4 时未触发任何额外模块,因此未提供训练信号。针对 DFL 投影、MSDeform 几何以及分数/bbox 输出层的反事实谓词无法通过标准的 leave-one-out 方法测试,因为其固定 bin、采样网格或输出偏置的语义需要本质上不同的插入方式。在 RT-DETR-L 上的安全放置下,将激活的 adapter 与置零 adapter 进行比较,解码器模块的相对 ℓ₂ 漂移为 0.553±0.099,最终输出为 0.548±0.094,确认骨干适配会传播到冻结的解码器。
实验评估了应用于目标检测器(YOLO 和 RT-DETR)且在形式化约束接口下强制安全结构修改的 PEFT adapter。关键发现表明,结构感知放置和 RS-LoRA 缩放对获得显著增益至关重要,而放宽检测头类型或注意力流限制仅轻微改变优化压力而不引起发散。安全规划器通过拒绝低于性能阈值的 adapter 来防止灾难性结果,在混合专家架构上的压力测试揭示了方法间显著的差异和直接失败,凸显了部署前能力验证的必要性。总体而言,这些研究验证了结合受纪律约束的 adapter 插入、预算感知的秩选择以及部署契约保留可带来可靠、高效的适配,而朴素的、无约束的方法则面临严重性能崩溃或导出不兼容的风险。