零样本目标检测今年又杀疯了!

CVPR 2025上北大团队的“PromptDet”框架直接把性能拉满,引入自然语言提示和多模态融合机制,让模型在未见过的类别上也能精准检测,其创新的提示优化模块和跨模态对齐策略,直接将零样本检测性能提升了15.3%,在COCO和Pascal VOC等主流数据集上直接刷新SOTA。

这波操作不仅给零样本目标检测注入了新活力,更预示着多模态融合在视觉任务中的巨大潜力。

我整理了10篇零样本目标检测的相关论文,全是2025年最新,包含顶会顶刊成果,部分论文附上了代码便于大家复现,需要的扫码自取,说不定能帮你直接冲高区~全部论文PDF版+开源代码,工种号 沃的顶会 扫码回复 “零样本目标检测” 领取。

VisTa:Visual-contextual and Text-augmented Zero-shot Object-level OOD Detection

文章解析 

本文提出了一种基于CLIP模型的零样本目标级分布外(OOD)检测方法VisTa。由于传统方法在直接应用预训练视觉-语言模型(如CLIP)于目标级OOD检测时面临上下文信息丢失和依赖图像级对齐的问题,VisTa通过引入上下文感知的视觉提示(visual prompt)和文本增强的ID空间构建策略,有效提升了CLIP在目标级OOD检测任务中的性能。该方法无需重新训练或添加额外模块,具有良好的实用性与泛化能力。

创新点 

提出基于视觉提示的方法,有效适配CLIP用于目标级OOD检测,保留关键上下文信息。

引入文本增强策略,增强ID嵌入空间的表达能力,提升ID/OOD区分度。

实现零样本目标级OOD检测,在多个基准测试中超越现有方法。

研究方法 

设计上下文感知的视觉提示机制,通过在裁剪区域上叠加不同视觉变换(如背景模糊、边界高亮)来保留上下文信息。

使用CLIP的文本编码器结合增强的文本提示构建更具代表性的ID嵌入空间。

将图像嵌入与文本增强的ID空间进行相似度匹配,并计算不确定性得分以判断是否为OOD样本。

整个流程无需微调CLIP或添加额外训练模块,完全基于预训练模型完成检测任务。

研究结论 

VisTa成功将CLIP适配到零样本目标级OOD检测任务中,解决了上下文信息丢失问题。

所提出的视觉提示与文本增强策略显著提升了ID/OOD识别性能。

实验表明,VisTa在多个目标级OOD检测基准上优于现有方法,验证了其有效性与实用性。

image.png

Accelerate 3D Object Detection Models via Zero-Shot Attention Key Pruning

文章解析 

基于查询的方法在3D目标检测任务中表现出色,但由于Transformer层和大尺寸图像带来的计算需求,这些方法难以高效部署在边缘设备上。现有的剪枝和蒸馏方法通常需要重新训练或针对特定模型设计,难以迁移到3D检测任务中。

本文提出了一种名为tgGBC的零样本运行时剪枝方法,能够在不显著影响性能的情况下加速Transformer解码器,并在边缘设备上验证了其有效性。

创新点 

提出了首个用于3D目标检测模型的零样本、无需重新训练的剪枝技术。

利用分类得分和注意力图计算每个键的重要性,无需引入额外参数。

实现了近2倍的Transformer解码器加速,在边缘设备上也表现出显著的推理加速效果。

研究方法 

提出tgGBC方法,在Transformer层之间插入模块,根据键的重要性进行逐步剪枝。

将CNN头部输出的分类得分与交叉注意力模块生成的注意力图相乘,计算每个键的重要性。

在每层Transformer后动态剪枝掉重要性最低的部分键,以优化计算效率。

在ToC3D等主流3D检测模型中集成tgGBC模块,并评估其加速效果与性能损失。

研究结论 

tgGBC在最新3D检测模型ToC3D中实现了Transformer解码器1.99倍的加速,性能损失低于1%。

某些模型甚至在应用tgGBC后性能有所提升。

在边缘设备上部署带有tgGBC的3D检测模型进一步验证了该方法的实际有效性。

image.png

Logo

加入社区!打开量化的大门,首批课程上线啦!

更多推荐