HyperAIHyperAI

Command Palette

Search for a command to run...

ENEAS:面向自适应分割的嵌入引导神经集成

Javier del Pino Salvador Rodríguez Alejandro Garabito Javier Álvarez Chema Garabito

摘要

我们提出了 ENEAS,一种统一的、可文本提示的方法,用于实例跟踪和语义发现。可文本提示的分割模型,包括最新的基础模型如 SAM 3 [6],仍然存在时间幻觉、空间碎片化和语义误分类的问题:当目标离开视野时,它们无法报告目标缺失;在极端特写镜头中,它们分割局部纹理而非完整对象;并且它们优先考虑视觉特征而非本体论现实,因此视觉上相似的伪影(如雕像、绘画或反射)被分割为目标实体。ENEAS 通过单一方法实现两种功能:对唯一实例的精确跟踪和高品质分割,以及对文本查询所命名的每个实例的开放概念发现,并通过语义验证层加以解决。对于跟踪,我们扩展了几何上稳健的 SeC 架构(先前仅限于点交互),添加了文本提示适配器,并利用其时间记忆,使目标在消失时得以保持而不会漂移到干扰物,即使目标充满整个视野也能保持完整。对于发现,验证层将高速视觉嵌入匹配与条件 VLM 细化相结合,仅对模糊候选调用语义推理,从而过滤掉仅视觉模型无法区分的本体论错误,同时保持低延迟。ENEAS 专为 3D 重建而设计(在重建中,单个误分类的干扰物会破坏资产),它实现了对视频、广泛库以及时间或空间无序数据集合的高质量语义跟踪和分割,并具备区分真实实例与其“分身”(外观相似但本质不同的事物)的能力。代码和模型可在 github.com/speridlabs/eneas 获取。

一句话总结

SperidLabs 提出 ENEAS,一种统一的文本提示方法,用于实例跟踪和语义发现。该方法在 SeC 架构上扩展了文本提示适配器和时间记忆,以防止漂移和碎片化,同时结合视觉嵌入匹配与条件 VLM 精炼的语义验证层,过滤雕像或倒影等本体论错误,从而为 3D 重建实现高质量分割。

核心贡献

  • 提出 ENEAS,一种统一的文本提示方法,用于实例跟踪和语义发现,在 SeC 架构上扩展了文本提示适配器和时间记忆,以报告目标缺失并在极端尺度变化下保持对象完整性。
  • 在语义发现中,将几何提议与语义验证解耦,结合基于 sigmoid 的嵌入过滤器、提示集成以及仅在模糊候选上调用的条件 VLM 判断器,在过滤本体论错误的同时保持低延迟。
  • 在 Church Statues 数据集上,将 F1 分数从 SAM 3 的 19.5% 提升至 2B 判断器下的 82.8% 和 4B 判断器下的 87.6%,同时保持精确率超过 94%,并在 SA-Co/VEval 上匹配或超越 SAM 3 的跟踪性能。

引言

文本引导分割已成为现代视觉理解中的核心工具,允许用户指定一个对象并在视频或无顺序图像集合中获得像素级精确的掩码。然而,SAM 3 等当前基础模型仍然存在时间幻觉、空间碎片化和语义误分类等问题:当目标离开视野时无法报告,特写时分割局部纹理而非完整对象,并且优先考虑视觉相似性而非本体论现实,导致雕像或画作被误分割为人。先前的工作要么缺乏身份概念,导致漂移到干扰物,要么仅依赖视觉先验,无法区分真实实例与相似物。

作者提出 ENEAS,一种统一方法,在单一框架内同时处理特定实例跟踪和开放概念语义发现。在跟踪方面,他们将此前仅限于点交互的基于记忆的 SeC 架构扩展了文本提示适配器,使目标在消失时仍能保持身份而不漂移,并在极端尺度变化下保持完整。在发现方面,他们将高速 sigmoid 嵌入匹配与条件视觉语言模型(VLM)判断器相结合,后者仅在模糊候选上调用,以过滤本体论错误并保持低延迟。ENEAS 专为 3D 重建设计,在该场景中,单个误分类的干扰物会破坏资产,因此其能够在有序视频、大型库和无顺序集合中提供精确的语义跟踪和分割,并具备区分真实实例与其相似物的判别能力。

数据集

作者为 3D 重建和新视角合成设计了 ENEAS。在此场景中,采集数据是一组照片或低帧率视频,其中视角差异大,通常缺乏时间顺序,且对主体的遮挡程度各不相同。在重建之前,系统必须为每个视角决定保留和移除的内容。实例跟踪用于隔离要重建的对象,而语义发现用于移除干扰物(通常是人),以避免重影伪影。作者指出,错误是不对称的:假阳性会掩蔽资产的一部分并破坏它,而假阴性会留下可见伪影。这种不对称性促使采用精确率优先的设计。采集模式使该方法成本可控,因为大多数视角包含很少或没有干扰物,因此嵌入过滤器即可解决,视觉语言模型(VLM)很少被调用。该过程是离线的,因此每幅图像几秒相当于数百个视角的几分钟,与重建时间相比可忽略不计。

主要数据集为 Church Statues,由用于 3D 重建的教堂内部低帧率录制帧组成。场景包含超写实宗教雕塑以及游客,其中雕塑必须保留,游客必须移除。该设置天然地最大化了提示词“person”的本体论歧义。作者手动为该数据集生成了真实实例标注。

另外两个数据集用于验证采集场景之外的鲁棒性:

  • Moving Boxes:室内场景,人们在家具之间搬运和堆放箱子,相互遮挡并遮挡椅子。
  • Blue Painting:动态室内序列,单幅画作经历视角变化、遮挡和特写。

这两个数据集与外部 SA\uee55Co/VEval 基准一起,是常规视频数据集,用于确认在采集场景中实现的鲁棒性在更标准的环境中同样成立。

方法

ENEAS 是一种单一方法,接收自然语言提示和一组帧,返回二值掩码。它基于共享组件构建:Florence-2 将提示接地到图像区域,Segment Anything 模型生成最终掩码。根据提示是指特定实例(例如“蓝色画作”)还是类别(例如“person”),该方法要么在时间上传播单个初始化,要么对每个候选区域进行语义验证。

给定一组帧 {It}t=1N\{ \mathbf{I}_t \}_{t=1}^{N}{It}t=1NItRH×W×3\mathbf{I}_t \in \mathbb{R}^{H \times W \times 3}ItRH×W×3,这些帧可能有或没有时间顺序,以及自然语言提示 ppp,ENEAS 返回二值掩码。当 ppp 指定特定实例时,输出是每帧一个掩码 Mt{0,1}H×W\mathbf{M}_t \in \{0,1\}^{H \times W}Mt{0,1}H×W,当对象不可见时 Mt=0\mathbf{M}_t = \mathbf{0}Mt=0。当 ppp 指定类别时,输出是每帧一组掩码 {Mt(i)}i=1nt\{\mathbf{M}_t^{(i)}\}_{i=1}^{n_t}{Mt(i)}i=1nt,每个实例一个,实例数量 ntn_tnt 因帧而异。两种情况共享接地算子 G(I,p)\mathcal{G}(\mathbf{I}, p)G(I,p),返回与 ppp 匹配的图像区域,以及分割算子 S(I,r)\mathcal{S}(\mathbf{I}, r)S(I,r),将区域 rrr 转换为掩码。

对于跟踪用户定义的特定对象(例如“蓝色汽车”),ENEAS 基于 SeC 架构构建,该架构通过目标的概念级记忆扩展了 SAM 2。跟踪器不仅匹配外观,还维护对象是什么的高层表示,这使其对剧烈视角变化以及目标离开并重新进入视野具有鲁棒性。由于 SeC 原生仅支持基于点的交互,作者添加了文本驱动的初始化:在参考帧 It0\mathbf{I}_{t_0}It0 上,接地算子定位提示所描述的对象 r0=G(It0,p)\mathbf{r}_0 = \mathcal{G}(\mathbf{I}_{t_0}, p)r0=G(It0,p),该单一区域初始化跟踪器。其余每个掩码随后通过传播获得,

Mt=T(Itr0,Ht),\mathbf{M}_t = \mathcal{T}\big(\mathbf{I}_t \mid \mathbf{r}_0, \mathcal{H}_t\big),Mt=T(Itr0,Ht),

其中 T\mathcal{T}T 是 SeC 跟踪器,Ht\mathcal{H}_tHt 是其已处理帧的记忆,从而在整个过程中强制执行身份:当对象不可见时,Mt\mathbf{M}_tMt 为空而非漂移到相似物。支持两种交互模式:点用于最大精度,自然语言用于易用性,参考帧可在序列中的任意位置选择。

对于语义发现,ENEAS 重新评估每一帧,从而无需重新提示即可发现进入场景的新实例。它组织为成本递增的级联阶段,每个阶段仅应用于前一阶段无法解决的候选。完整决策流程如图 1 所示。

第一阶段是区域提议。接地算子以 Florence-2 实例化,在每一帧上为请求的类别提议一组候选区域 Rt=G(It,p)\mathcal{R}_t = \mathcal{G}(\mathbf{I}_t, p)Rt=G(It,p),并合并重复提议。该阶段刻意宽松:不应遗漏任何内容,代价是提议后续阶段必须移除的干扰物。

第二阶段是嵌入验证。每个候选使用视觉语言嵌入模型 SigLIP 2 针对类别进行评分,该模型独立判断每个图像-文本对,因此裁剪中其他对象的存在不会抑制目标的分数。为了使分数对模型训练时使用的完整图像与此处看到的裁剪之间的差异具有鲁棒性,将类别的多种措辞平均为每个候选的单一分数 s(r)Rs(\mathbf{r}) \in \mathbb{R}s(r)R。两个阈值 τrej<τacc\tau_{\mathrm{rej}} < \tau_{\mathrm{acc}}τrej<τacc 将候选分为三组:

r{acceptif s(r)τacc,discardif s(r)<τrej,verifyotherwise,\mathbf{r} \mapsto \begin{cases} \text{accept} & \text{if } s(\mathbf{r}) \geq \tau_{\mathrm{acc}}, \\ \text{discard} & \text{if } s(\mathbf{r}) < \tau_{\mathrm{rej}}, \\ \text{verify} & \text{otherwise}, \end{cases}racceptdiscardverifyif s(r)τacc,if s(r)<τrej,otherwise,

因此明确匹配的候选被接受,明确不匹配的候选被丢弃,其余部分(不确定区间)被推迟到下一阶段。两个阈值是权衡延迟与语义严谨性的旋钮。

第三阶段是语义验证。只有不确定区间内的候选才会显示给视觉语言模型 Qwen3-VL,该模型作为判断器返回二值判定 v(r){0,1}v(\mathbf{r}) \in \{0,1\}v(r){0,1}。询问该区域是否真正是类别的实例,而非雕像、人偶或图片等相似物。相邻候选的像素被掩蔽,使判断仅涉及该候选本身,模型以固定格式回答,不进行自由形式推理,从而保持每次判定的低成本。由于该阶段仅由真正模糊的候选到达,其成本随场景的模糊程度而非场景中对象数量扩展。

最后阶段是掩码生成。接受集 At\mathcal{A}_tAt 由直接接受的候选和 v(r)=1v(\mathbf{r}) = 1v(r)=1 的候选组成,传递给分割算子(以 Segment Anything 家族中的 SAM 2 实例化),为每个实例生成一个掩码,即 Mt(i)=S(It,ri)\mathbf{M}_t^{(i)} = \mathcal{S}(\mathbf{I}_t, \mathbf{r}_i)Mt(i)=S(It,ri),其中 riAt\mathbf{r}_i \in \mathcal{A}_triAt

上述架构是严格的迭代过程的结果,旨在解决召回率、精确率和计算延迟之间的特定权衡。召回率定义为系统检测目标类别每个实例的能力,最小化假阴性。精确率表示严格区分目标概念与语义干扰物的能力,确保消除假阳性。作者详细描述了该方法通过四个不同开发阶段的演进。

在阶段 1 中,初始方法采用检测-过滤-验证策略。作者实现了详尽的密集对象描述机制,为场景中所有显著元素生成带有丰富文本描述的边界框。为减轻验证阶段的负担,他们应用了中间文本过滤器,使用纯文本嵌入计算生成描述与目标提示之间的语义相似度。对于最终验证,他们尝试使用复合视觉提示策略优化吞吐量,构建包含完整帧的单个查询图像,并标注有颜色编码的编号边界框,辅以空间聚类的裁剪网格。下游视觉语言模型被查询一个复杂的多步骤提示,以依次遍历并验证每个编号实例。该方法表现出关键失败模式。文本过滤器严格依赖于区域提议网络的生成保真度,而生成模块经常将任意的专有名词(例如将雕像标记为“圣克里斯蒂安”)分配给通用对象,绕过语义过滤器。该方法还遭受空间聚合问题,经常将不同的语义实体合并到单个边界框中,使精确实例分割不可能实现。单提示中多目标关联任务的高认知负荷需要深度推理,引入从每帧至少 15 秒开始的过高延迟,并在密集场景中显著升级。

在阶段 2 中,为解决空间聚合和召回问题,作者转向文本条件区域提议策略。通过显式提示检测器目标类别,改善了实例分离,但引入了高假阳性率。他们尝试使用对比视觉语言嵌入匹配过滤这些候选,最初计算目标文本相对于“背景”和“其他对象”等通用负类的 softmax 概率。为提高粒度,他们实施了二次对象检测过程以识别场景中存在的特定对象,并将这些动态标签纳入 softmax 计算。然而,该方法揭示了将全局 softmax 归一化应用于此任务的根本缺陷。softmax 函数固有的互斥约束迫使类概率竞争。在目标对象与二次检测中识别的高显著属性共现的场景中(例如持麦克风的人),模型抑制目标类概率以支持配件的标签,从而无法定义稳定的接受阈值。

在阶段 3 中,为解决分数抑制问题,作者实现了基于 sigmoid 的视觉语言嵌入匹配。该架构采用成对 sigmoid 损失,将每个图像-文本对视为独立的二分类问题,有效解耦目标对象分数与裁剪中其他语义概念的存在。他们使用针对原生宽高比优化的编码器,比标准固定分辨率编码器更好地保留可变大小裁剪的密集特征。尽管有这些改进,他们观察到模型全图预训练与裁剪级推理输入之间的域偏移导致的性能下降。为缓解此问题,他们实现了提示集成策略,平均多个模板变体的嵌入以增强视觉信号的鲁棒性。

在阶段 4 中,尽管嵌入过滤器有所改进,仍存在视觉嵌入单独无法解决本体论歧义(如超写实雕像)的不确定区域。为解决此问题,作者集成了轻量级 VLM。最初,以其原生深度推理能力执行模型是准确的,但因大量 token 生成而产生显著延迟。此外,模型在裁剪内受相邻对象的上下文干扰。为缓解此问题,他们应用黑色掩蔽以像素级隔离目标。随后禁用深度推理机制,改用具有显式批判性思维约束的结构化分析提示,强制模型在无需生成内部推理 token 的开销下验证本体论。通过将此验证限制在不确定区间,他们实现了高语义精确率,同时将验证延迟降至资源受限硬件上约一秒。

实验

实验在实例跟踪和语义发现两方面验证了 ENEAS,重点在于后者,因其新颖的级联验证结合了嵌入过滤器和 VLM。在 Church Statues 采集数据上,该数据最大化了真人与超写实雕像之间的本体论歧义,ENEAS 通过以召回率换取精确率,实现了比 SAM 3 四倍的 F1 提升,而消融实验确认 VLM 裁判对于解决视觉嵌入失败的案例至关重要,且稳健的阈值配置提供了最佳的精度-效率平衡。Blue Painting 上的实例跟踪测试表明,ENEAS 在遮挡和尺度变化下比逐帧检测基线更好地保持身份,而在 Moving Boxes 上则以降低的延迟适应标准场景,F1 接近完美。将 VLM 从 2B 扩展到 4B 使 F1 从 82.8% 提升至 87.6%,但延迟增加 52%,因此 2B 模型被确立为通用使用的默认配置。

ENEAS 模型在 Church Statues 上优于 SAM 3,其中 4B 变体通过解决模糊案例达到最高 F1 分数,但延迟增加。系统根据场景复杂度调整配置,仅在需要时以速度换取精度。ENEAS-4B 达到最佳 F1 分数 87.6%,超越 ENEAS-2B 和 SAM 3。SAM 3 尽管召回率高,但精确率极低(11.1%),表明存在大量假阳性。2B 模型较低的 F1 分数归因于对无歧义样本的过度推理,引入随机错误。在标准场景中使用更快模式将延迟降至每帧 1.14 秒,实现三倍加速,同时保持接近完美的 F1 分数 98.0%。4B 模型比 2B 模型提高 F1 分数 4.8 个百分点,但延迟增加 52%。

表格显示变化不确定区间如何影响 VLM 激活、延迟和精度之间的权衡。更宽的区间增加 VLM 使用和延迟,但 F1 分数在一定点前提升,此后完全 VLM 激活因过度推理而降低精度。平衡和稳健配置比仅 VLM 方法提供更好的精度,同时保持更低延迟。加宽不确定区间提高 VLM 激活和延迟,F1 分数在稳健配置处达到峰值,随后在完全 VLM 激活下下降。仅 VLM 配置的精度低于稳健配置,表明在无歧义样本上过度使用 VLM 会引入错误。稳健配置达到最高 F1 分数,但延迟是激进配置的三倍以上。

将视觉语言模型大小从 2B 增加到 4B 使 F1 分数从 82.8% 提升至 87.6%,但平均延迟从 3.29 秒升至 5.02 秒,增加 52%。2B 模型因其更好的效率-精度权衡而被设为默认,而 4B 变体供离线使用,优先考虑更高精度。4B 模型比 2B 基线达到更高 F1 分数,解决更多模糊案例。从 2B 切换到 4B 模型时延迟增加约 52%。2B 模型因其速度和精度的最佳平衡而被选为默认,而 4B 是离线场景的可配置选项。

ENEAS 模型在 Church Statues 上优于 SAM 3,其中 4B 变体通过解决模糊案例达到最高 F1 分数,但延迟增加。系统根据场景复杂度调整配置,仅在需要时以速度换取精度。ENEAS-4B 达到最佳 F1 分数 87.6%,超越 ENEAS-2B 和 SAM 3。SAM 3 尽管召回率高,但精确率极低(11.1%),表明存在大量假阳性。2B 模型较低的 F1 分数归因于对无歧义样本的过度推理,引入随机错误。在标准场景中使用更快模式将延迟降至每帧 1.14 秒,实现三倍加速,同时保持接近完美的 F1 分数 98.0%。4B 模型比 2B 模型提高 F1 分数 4.8 个百分点,但延迟增加 52%。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供