新浪科技

一句话精准锁定航拍任意目标!AeroTrack:零训练框架搞定无人机开放词汇像素级追踪

无人机

关注

✨导读:无人机航拍常用于交通巡查、城市治理、应急救援,但传统算法只能识别预设类别、仅输出方框轨迹。本文首创UAV-OVVIS全新航拍任务,推出无需训练的模块化AeroTrack框架,搭配自建航拍专用数据集AeroVIS,输入任意文字描述就能精准分割、持续追踪目标,大幅缓解长视频显存爆炸问题,综合性能碾压通用视频分割模型。

  • 作者:Mingyu Dou, Shi Qiu, Ming Hu, Yifan Chen, Zhe Sun

  • 单位中国科学院西安光学精密机械研究所,中国科学院大学,中国电信人工智能研究院(TeleAI),复旦大学未来信息科技学院,西北工业大学光电与人工智能学院

  • 论文标题:UAV-OVVIS: Unmanned Aerial Vehicles Also Need Open-Vocabulary Video Instance Segmentation

  • 论文链接:https://arxiv.org/abs/2607.08075

  • 代码链接:https://github.com/Dmygithub/AeroTrack

🔍研究背景

无人机航拍拥有大范围、连续动态视觉感知能力,是交通监控、城市管理、抢险搜救的核心技术支撑,但现有方案存在两大致命短板👇

1. 传统无人机感知:闭集+框级,灵活性极差

市面上VisDrone、UAVDT等经典航拍基准,全部局限于提前定义好的固定类别,只能输出目标矩形框轨迹。 既不能根据现场需求输入文字自由检索目标,也缺少像素级精细轮廓分割,无法满足精细化开放场景需求。

2. 通用开放词汇分割模型,水土不服航拍场景

近些年OV-VIS(开放词汇视频实例分割)技术快速发展,但这类模型专为地面平视视频设计,面对航拍特有难题直接失效:

  • 俯视视角下目标尺寸微小、大量物体密集堆叠;

  • 无人机平台+地面目标双重运动,遮挡频发、目标频繁进出画面;

  • 长视频推理时,SAM系列模型显存持续累积,多目标场景极易内存溢出。

除此之外,行业内没有适配无人机的开放词汇实例分割标注数据集,缺少统一量化评测标准,相关研究难以横向对比迭代。现有技术无法同时实现「文本自由查询」+「像素级完整实例轨迹输出」,这也是本文研究的出发点。

💡四大核心贡献

  1. 首创航拍专属新任务UAV-OVVIS:面向无人机4W视觉感知场景提出全新任务:输入航拍视频+任意文本描述,输出拥有全局统一ID的像素级实例分割轨迹,填补无人机开放词汇实例分割领域空白。

  2. 零训练模块化推理框架AeroTrack:完全不用航拍场景标注、无需微调训练,直接复用成熟视觉基础模型(YOLO-World/Grounding DINO/SAM2/SAM3)搭建流水线;设计周期关键帧检测、分段掩码传播、跨段ID统一三大核心机制,提供5套可自由替换的模型组合方案。

  3. 开源航拍专用评测基准AeroVIS:整合VisDrone、UAVDT、SeaDronesSee三大航拍跟踪数据集,结合SAM3生成掩码+人工二次校验,数据集包含117段视频、49204帧画面、9大类航拍常见目标、8279条完整实例轨迹,配套完整标准化评测流程。

  4. 多维度实验全面验证效果:在自建AeroVIS、YouTube-VIS 2019/2021、LV-VIS四类数据集完成对比实验、消融实验、显存速度压力测试;AeroTrack在复杂航拍场景性能全面超越DEVA、原生SAM3等主流OV-VIS模型,同时保留极强通用视频泛化能力。

⚠️任务定义与三大核心痛点

任务目标:UAV-OVVIS

输入:无人机视频序列 、自定义开放文本查询集合 输出:全程全局ID不跳变的像素级实例分割轨迹,同时满足三点要求:

  1. 开放词汇自由检索:不受预设类别限制,任意文字描述均可定位目标;

  2. 实例级像素分割:输出物体完整掩码轮廓,而非粗糙矩形框;

  3. 长时序稳定跟踪:目标短暂遮挡、进出画面后,身份ID保持统一不重置。

落地三大硬核挑战

  1. 多基础模型协同调度难:整套流程需要串联开放词汇检测、视频掩码传播、全局身份匹配三类独立大模型,无训练微调条件下,如何实现多模块高效协同是首要难题。

  2. 航拍复杂时序跟踪难度高:俯视画面小目标密集、相机与物体同步运动、遮挡频繁,算法需要精准区分「新出现物体」和「消失后复现的旧目标」,维持全局ID一致性。

  3. 长视频高密度目标显存压力爆炸:开放词汇检测+逐帧掩码传播双重计算叠加,显存占用随视频长度持续上涨;原生SAM3在多目标航拍长视频中极易直接内存溢出。

🛠️AeroTrack完整框架详解

整套架构分为三大核心模块:开放词汇识别器Recognizer、视频实例分割器Segmenter、生命周期感知ID关联模块LIA,核心设计思路:周期关键帧检测+分段掩码传播+输出层全局ID统一

1. 开放词汇识别器 Recognizer 🧐

  • 核心作用:每隔固定间隔帧(实验设置)选取关键帧,根据文本指令做开放词汇检测,输出目标框坐标作为分割提示;

  • 可选模型:YOLO-World、Grounding DINO、SAM3;

  • 输出预处理:置信度过滤、空间重复框去重、目标数量截断,最终输出位置提示集合:

代表目标位置提示、匹配文本类别、文本匹配置信度。

2. 视频实例分割器 Segmenter 🎭

  • 核心作用:接收识别器输出的框提示,在单段视频内逐帧传播实例掩码,输出仅在当前分段生效的局部ID掩码;

  • 可选模型:SAM2、SAM3;

  • 关键优化:每一段视频结束后强制重置模型内部记忆,从根源阻止显存随视频长度无限累积,解决长视频内存爆炸痛点。 分段局部轨迹输出公式:

代表第帧局部实例掩码,仅在当前分段有效,跨分段会重新分配ID,造成身份断裂。

3. 核心创新:生命周期感知ID关联模块 LIA 🔗

分段重置机制会导致同一个物理目标,在不同视频分段被分配完全不同的局部ID,LIA在输出层统一全局ID,全程无训练参数、不改动分割器内部运算逻辑。

(1)轨迹生命周期存储库

维护两类轨迹池,管理所有目标历史身份:

  • :当前画面可见的全局轨迹;

  • :短暂消失、短期内可恢复匹配的历史轨迹,消失超过分段后自动清除。

(2)几何相似度打分公式

先通过目标尺度、中心距离硬阈值筛除不可能匹配的轨迹对,再计算综合匹配得分:

三项分别代表:框交并比(空间重叠程度)、中心距离相似度、目标尺度相似度。 其中中心相似度:

尺度相似度:

(3)一对一贪心匹配流程

  1. 将当前分段所有局部目标,与生命周期库内历史全局轨迹计算匹配分数;

  2. 分数降序排序,执行一对一贪心匹配,匹配成功则局部轨迹继承原有全局ID;

  3. 无法匹配的全新目标,分配专属全局ID,同步更新轨迹池状态。

🧪海量实验全面验证性能

1. 实验数据集划分

① 自建航拍专属基准 AeroVIS

数据源融合VisDrone、UAVDT、SeaDronesSee三大航拍跟踪数据集;先用SAM3生成掩码,再人工校验清洗,最终数据集包含:117段航拍视频、49204帧画面、9类航拍高频目标、8279条完整实例轨迹,完全适配俯视小目标复杂场景。

② 通用公开视频基准

YouTube-VIS 2019、YouTube-VIS 2021、LV-VIS(大规模开放词汇视频分割标准数据集)

2. 核心评测指标

  • 主指标:HOTA,综合衡量检测精度DetA + 时序身份一致性AssA;

  • 辅助指标:mAP(实例分割整体精度)、Mask J(匹配轨迹平均掩码IoU)。

3. 航拍数据集AeroVIS对比实验

将DEVA、GLEE、OV2Seg、原生SAM3等主流OV-VIS模型迁移至航拍场景后,性能大幅下滑,核心短板是微小目标漏检严重。 本文5种AeroTrack变体全部实现全方位超越,其中YOLO-World+SAM3、Grounding DINO+SAM3整体HOTA突破55;相同识别器前提下,SAM3作为分割器效果稳定优于SAM2,充分验证模块化设计的有效性与可替换性。

4. 通用视频泛化测试

在YouTube-VIS、LV-VIS通用基准上,SAM3+SAM3组合mAP指标与原生SAM3几乎持平,证明分段传播、周期刷新、LIA关联机制不会破坏基础模型原生开放词汇能力,框架同时适配航拍与普通地面视频。

5. 消融实验:LIA模块不可或缺

关闭LIA跨段ID关联模块后,全部5套组合的整体HOTA直接暴跌27~32个点! 仅依靠分段掩码传播,完全无法实现跨分段全局统一轨迹,LIA是保障UAV-OVVIS任务效果的核心组件。

6. 显存&推理速度压力测试

选取400帧高密度车流航拍测试视频(单帧同时存在80+车辆目标):

  1. 原生SAM3最多仅支持同时处理7个目标,超出直接显存溢出;AeroTrack可承载10倍以上目标数量;

  2. AeroTrack分段重置机制将显存稳定控制在固定区间,不会随视频长度持续上涨;

  3. 推理FPS与原生SAM3基本持平,部分组合推理速度更快,精度提升无效率损耗。

📝全文总结与未来展望

✅核心结论

  1. 任务创新填补空白: UAV-OVVIS是首个面向无人机俯视场景的开放词汇像素级跟踪任务,完美适配交通巡检、应急搜救、城市网格化管理等实际航拍业务;

  2. 零训练轻量化落地: AeroTrack模块化架构无需航拍标注、不用微调,分段设计彻底解决长视频高密度目标显存瓶颈,LIA保障遮挡、分段切换下目标ID稳定不跳变;

  3. 开源基准助力领域发展: AeroVIS是业内首个无人机专属OV-VIS评测数据集,配套完整推理、评估工具,方便后续研究者横向对比;

  4. 双向泛化能力拉满: 针对航拍俯视小目标做专项优化的同时,在通用地面视频上仍保留顶尖开放词汇分割性能。

🔭未来研究方向

  1. 轻量化模型改造,降低机载端算力门槛,实现无人机本地实时推理;

  2. 进一步优化超微小航拍目标的检测、分割精度;

  3. 升级长时序身份关联逻辑,解决目标长时间消失后复现的跨视频重识别难题。

文章来源:视觉语言导航

    加载中...