顶会收割机!零样本学习搭目标检测,准确率飙升!
零样本目标检测今年又杀疯了!
CVPR 2025上北大团队的“PromptDet”框架直接把性能拉满,引入自然语言提示和多模态融合机制,让模型在未见过的类别上也能精准检测,其创新的提示优化模块和跨模态对齐策略,直接将零样本检测性能提升了15.3%,在COCO和Pascal VOC等主流数据集上直接刷新SOTA。
这波操作不仅给零样本目标检测注入了新活力,更预示着多模态融合在视觉任务中的巨大潜力。
我整理了10篇零样本目标检测的相关论文,全是2025年最新,包含顶会顶刊成果,部分论文附上了代码便于大家复现,需要的扫码自取,说不定能帮你直接冲高区~全部论文PDF版+开源代码,工种号 沃的顶会 扫码回复 “零样本目标检测” 领取。
VisTa:Visual-contextual and Text-augmented Zero-shot Object-level OOD Detection
文章解析
本文提出了一种基于CLIP模型的零样本目标级分布外(OOD)检测方法VisTa。由于传统方法在直接应用预训练视觉-语言模型(如CLIP)于目标级OOD检测时面临上下文信息丢失和依赖图像级对齐的问题,VisTa通过引入上下文感知的视觉提示(visual prompt)和文本增强的ID空间构建策略,有效提升了CLIP在目标级OOD检测任务中的性能。该方法无需重新训练或添加额外模块,具有良好的实用性与泛化能力。
创新点
提出基于视觉提示的方法,有效适配CLIP用于目标级OOD检测,保留关键上下文信息。
引入文本增强策略,增强ID嵌入空间的表达能力,提升ID/OOD区分度。
实现零样本目标级OOD检测,在多个基准测试中超越现有方法。
研究方法
设计上下文感知的视觉提示机制,通过在裁剪区域上叠加不同视觉变换(如背景模糊、边界高亮)来保留上下文信息。
使用CLIP的文本编码器结合增强的文本提示构建更具代表性的ID嵌入空间。
将图像嵌入与文本增强的ID空间进行相似度匹配,并计算不确定性得分以判断是否为OOD样本。
整个流程无需微调CLIP或添加额外训练模块,完全基于预训练模型完成检测任务。
研究结论
VisTa成功将CLIP适配到零样本目标级OOD检测任务中,解决了上下文信息丢失问题。
所提出的视觉提示与文本增强策略显著提升了ID/OOD识别性能。
实验表明,VisTa在多个目标级OOD检测基准上优于现有方法,验证了其有效性与实用性。

Accelerate 3D Object Detection Models via Zero-Shot Attention Key Pruning
文章解析
基于查询的方法在3D目标检测任务中表现出色,但由于Transformer层和大尺寸图像带来的计算需求,这些方法难以高效部署在边缘设备上。现有的剪枝和蒸馏方法通常需要重新训练或针对特定模型设计,难以迁移到3D检测任务中。
本文提出了一种名为tgGBC的零样本运行时剪枝方法,能够在不显著影响性能的情况下加速Transformer解码器,并在边缘设备上验证了其有效性。
创新点
提出了首个用于3D目标检测模型的零样本、无需重新训练的剪枝技术。
利用分类得分和注意力图计算每个键的重要性,无需引入额外参数。
实现了近2倍的Transformer解码器加速,在边缘设备上也表现出显著的推理加速效果。
研究方法
提出tgGBC方法,在Transformer层之间插入模块,根据键的重要性进行逐步剪枝。
将CNN头部输出的分类得分与交叉注意力模块生成的注意力图相乘,计算每个键的重要性。
在每层Transformer后动态剪枝掉重要性最低的部分键,以优化计算效率。
在ToC3D等主流3D检测模型中集成tgGBC模块,并评估其加速效果与性能损失。
研究结论
tgGBC在最新3D检测模型ToC3D中实现了Transformer解码器1.99倍的加速,性能损失低于1%。
某些模型甚至在应用tgGBC后性能有所提升。
在边缘设备上部署带有tgGBC的3D检测模型进一步验证了该方法的实际有效性。

更多推荐




所有评论(0)