ENEAS:为视频与3D重建引入文本提示的实例跟踪与语义分割统一方法
SperidLabs团队提出ENEAS,扩展SeC架构并加入语义验证层,解决SAM 3等模型在目标消失、极端特写和视觉相似物上的错误,支持文本查询实现精确跟踪与开放概念发现。
AI解读:文本提示的分割模型尽管能力很强,但实际用于视频跟踪或 3D重建时有个致命问题:它们不判断目标是否真的消失了,一旦出现视觉相似的雕塑、画作或倒影就误当成目标,而且在极端特写时只会分割局部纹理。SperidLabs提出的ENEAS把过去只能处理点交互的SeC架构加上文本提示适配器,靠时间记忆让目标在离开画面或被完全填满时仍被正确保持;同时增加一个语义验证层,先用高速视觉嵌入匹配快速筛选,只对模糊候选调用VLM做语义推理,既过滤了视觉相似物又控制延迟。对靠视频或无序图像集做 3D重建的开发者来说,单个误分类干扰物就足以污染资产,ENEAS这种能区分"看起来像但实际不是"的能力,直接影响重建质量与人工返工成本。但论文目前只展示了方法与架构,尚无与效果相关的量化对比或运行速度数据,能否落地取决于代码库与后续评测。
SperidLabs团队在arXiv发布ENEAS,一种支持文本提示的统一方法,可同时处理实例跟踪与开放概念语义发现,面向 3D重建等应用场景,论文共计 19 页、5 张图、6 张表格,代码与模型已公开。
ENEAS针对现有文本提示分割模型的三个缺陷:时间幻觉(目标离开视野后不报告缺失)、空间碎片化(极端特写时分割局部纹理而非完整目标)、语义误分类(优先视觉特征,将雕像、绘画或倒影等视觉相似物误判为目标)。
两种工作模式与训练基线
ENEAS从单一方法支持两种用法:精确跟踪并高质量分割单个实例,以及开放概念地发现文本查询所命名的所有实例——后者由语义验证层解析。
跟踪方面,ENEAS扩展了此前仅支持点交互的几何鲁棒SeC架构,加入文本提示适配器,并利用其时间记忆,使目标在消失时不漂移到干扰物,即使充满整个视野也能保持完整。
发现方面,验证层将高速视觉嵌入匹配与条件式VLM细化相结合,只对模糊候选调用语义推理,从而过滤纯视觉模型无法区分的本体论错误,同时保持低延迟。
论文称设计时以 3D重建为出发点——单个误分类干扰物会破坏资产——但摘要未提供任何效果对比数据或性能评测,以上为作者在摘要中的陈述。