当前位置：首页 > 编程笔记 > 正文

已解决

论文阅读——What Can Human Sketches Do for Object Detection？(cvpr2023)

来自网友在路上 176876提问提问时间：2023-11-07 20:28:37阅读次数： 76

最佳答案问答题库768位专家为你答疑解惑

论文：https://openaccess.thecvf.com/content/CVPR2023/papers/Chowdhury_What_Can_Human_Sketches_Do_for_Object_Detection_CVPR_2023_paper.pdf

代码：What Can Human Sketches Do for Object Detection? (pinakinathc.me)

一、

Baseline SBIR Framework：给一组图片：轮廓和图片，学习到对应的两个特征，然后使用余弦距离计算triplet loss。

本文使用hard-triplet loss,再加上一个分类损失

二、

使用RPN或者selective search生成框和对应的特征，输入到分类头检测头得到两个分数。通过这两个来判断图片中是否出现某个类别。分类头分数分别判断每个区域属于某个类别的概率，检测头分数判断这个patch对属于被分到的这个类别的贡献度。

labels:

,

三、

下面是微调框：

因为没有坐标标注，所以使用了一个迭代微调分类器对每个ROI预测一个精细的类别分数，标签从第k-1步迭代获得：

1、计算每个类别分数最高的patch

2、和这个patch重叠度高的(iou>0.5)patch都是一个类别

3、如果某个区域和任何一个分数高的patch重合度都不高，就是背景。

4、如果某个类别没出现在图片中，也是0

损失函数：

四、

然后检测一般是预先固定多少类别，作者克服了这个限制

每个头原本预测分数，改为计算嵌入向量

用预训练的Fs编码patch得到，

计算分数：

多加了一个来自原始图片的监督Fp，

最终损失为：

五、

泛化到开放词汇检测：

轮廓向量集合：

图片向量集合：

映射到ViT第一层，以诱导CLIP学习下游轮廓/照片分布

ViT权重冻结，CLIP学习到知识被蒸馏为prompts的权重。

最后新的轮廓和图片encoder为使用sketch prompt和图片prompt的CLIP’s image encoder，，

只训练Vs和Vp

学习跨类别的FGSBIR：

查看全文

99%的人还看了

相似问题

猜你感兴趣

版权申明

本文"论文阅读——What Can Human Sketches Do for Object Detection？(cvpr2023)"：http://eshow365.cn/6-34717-0.html 内容来自互联网，请自行判断内容的正确性。如有侵权请联系我们，立即删除！

上一篇: Go 面向对象，多态
下一篇: ‘face_alignment‘ has no attribute ‘FaceAlignment‘

推荐回答

Nacos 架构原理2023/12/02
15、深度学习之正向传播和反向传播2023/12/02
CSS 多主题切换思路2023/12/02
盘点40个Android游戏Game源码安卓爱好者不容错过2023/12/02
LeetCode 8 字符串转整数2023/12/02
使用opencv将sRGB格式的图片转换为BT.2020格式【sRGB】【BT.2020】2023/12/02
使用Docker Compose搭建CIG监控平台2023/12/02
匿名结构体类型、结构体的自引用、结构体的内存对齐以及结构体传参2023/12/02
Docker篇之利用docker搭建ftp服务器可实现多用户上传2023/12/02
开源软件license介绍与检测2023/12/02