知识库 - Orange

目标检测的遮挡问题概述

Computer Vision

2026-01-11

SoftNMS/DIoUNMS softnms参考： SoftNMS 可以看到，SoftNMS与传统NMS的区别在于对score分数调整的处理。如果是传统的NMS操作，那么当 B 中的 b_i 和 [Math] 的IoU值大于阈值 N_t ，那么就从 B 和 S 中去除该box；对于SoftNMS而言是先计算 [Math] 与 b_i 的IoU，然后IoU经过一个函数输出最后与 s_i 相乘最终得到box的分数。其中 s_i 的score遵循IoU越大，分数越低的原则（IoU越大，越可能是背景），所以 s_i 定义如下：考虑到上式是不连续的，并且当达到N_t的NMS阈值时会施加突然的惩罚，如果惩罚函数是连续的，那将是理想的，否则它可能导致检测结果的排序列表的突然改变（集合D中的scor...

#CV #Object Detection

READ

SNIPER

Computer Vision

2026-01-11

SNIPER的关键是减少了SNIP的计算量。SNIP借鉴了multiscale training的思想进行训练，multiscale training是用图像金字塔作为模型的输入，这种做法虽然能够提高模型效果，但是计算量的增加也非常明显，因为模型需要处理每个scale图像的每个像素，而SNIPER（Scale Normalization for Image Pyramids with Efficient Resampling）算法以适当的比例处理ground truth（称为chips）周围的上下文区域，在训练期间每个图像生成的chips的数量会根据场景复杂度而自适应地变化，由于SNIPER在采样后的低分辨率的chips上运行，故其可以在训练期间收益于Batch Normalization，...

#CV #Object Detection

READ

Gaze Estimation

3D Model

2026-01-11

概述问题定义广义的 Gaze Estimation 泛指与眼球、眼动、视线等相关的研究，因此有不少做 saliency 和 egocentric 的论文也以 gaze 为关键词。而本文介绍的 Gaze Estimation 主要以眼睛图像或人脸图像为处理对象，估算人的视线方向或注视点位置，如下图所示。 gaze角度的表示一般使用一个3d向量作为表示，也可以转换为pitch 和yaw角度，具体可参考 Model Gaze模型一般使用回归模型，所以这里基本只介绍一些在gaze model中使用的小技巧 Rle Loss 实际问题

#3D

READ

Faster R-CNN

Computer Vision

2026-01-11

总体流程 RPN RPN在Extractor输出的feature maps的基础之上，先增加了一个3x3卷积，然后利用两个1x1的卷积分别进行二分类（是否为正样本）和位置回归。进行分类的卷积核通道数为9×2（9个anchor，每个anchor二分类，使用交叉熵损失），进行回归的卷积核通道数为9×4（9个anchor，每个anchor有4个位置参数）。接下来RPN做的事情就是利用（AnchorTargetCreator）将20000多个候选的anchor选出2000个proposal并采样256个positive 进行分类和回归位置loss计算。具体过程如下： proposal 前向过程中会做 NMS ： 1. 对所有 anchors 做前背景分类和bbox regression回归（lea...

#CV #Object Detection

READ

Object-detection中mAP计算

Computer Vision

2026-01-11

mAP定义及相关概念 mAP: mean Average Precision, 即各类别AP的平均值 AP: PR曲线下面积，后文会详细讲解 PR曲线: PrecisionRecall曲线 Precision: TP / (TP + FP) Recall: TP / (TP + FN) TP: IoU0.5的检测框数量（同一Ground Truth只计算一次） FP: IoU= 0, 0.1, 0.2, ..., 1共11个点时的Precision最大值，然后AP就是这11个Precision的平均值。在VOC2010及以后，需要针对每一个不同的Recall值（包括0和1），选取其大于等于这些Recall值时的Precision最大值，然后计算PR曲线下面积作为AP值。 mAP计算示例假...

#CV #DL基础 #Object Detection

READ

NMS系列

Computer Vision

2026-01-11

NMS 过程： 1. 根据分类概率从小到大排序ABCDEF 1. 从最大概率F开始，F与A～E的IOU是否大于阈值 1. 大于的扔掉，从剩下的当中继续重复2～3 [代码] SoftNMS NMS算法保留score最高的预测框，并将与当前预测框重叠较多的proposals视作冗余，显然，在实际的检测任务中，这种思路有明显的缺点，比如对于稠密物体检测，当同类的两个目标距离较近时，如果使用原生的nms，就会导致其中一个目标不能被召回，为了提高这种情况下目标检测的召回率，SoftNMS应运而生。对于FasterRCNN在MSCOCO数据集上的结果，将NMS改成SoftNMS，mAP提升了1.1%。它认为重叠较多的proposals也有可能包含有效目标，只不过重叠区域越大可能性越小。参见下图，NMS...

#Object Detection #CV

READ

背包问题

Algorithm

2026-01-11

01背包描述有N件物品和一个容量为V的背包。第i件物品的体积是vi，价值是wi。求解将哪些物品装入背包，可使这些物品的总体积不超过背包流量，且总价值最大。二维动态规划 f[i][j] 表示只看前i个物品，总体积是j的情况下，总价值最大是多少。 result = max(f[n][0V]) f[i][j]: 不选第i个物品：f[i][j] = f[i1][j]; 选第i个物品：f[i][j] = f[i1][jv[i]] + w[i]（v[i]是第i个物品的体积）两者之间取最大。初始化：f[0][0] = 0 代码如下： [代码] 一维动态优化从上面二维的情况来看，f[i] 只与f[i1]相关，因此只用使用一个一维数组[0v]来存储前一个状态。那么如何来实现呢？第一个问题：状...

#Algorithm

READ

python heapq源码分析

Algorithm

2026-01-11

起步 heapq 模块实现了适用于Python列表的最小堆排序算法。堆是一个树状的数据结构，其中的子节点都与父母排序顺序关系。因为堆排序中的树是满二叉树，因此可以用列表来表示树的结构，使得元素 N 的子元素位于 2N + 1 和 2N + 2 的位置（对于从零开始的索引）。本文内容将分为三个部分，第一个部分简单介绍 heapq 模块的使用；第二部分回顾堆排序算法；第三部分分析heapq中的实现。 heapq 的使用创建堆有两个基本的方法：heappush() 和 heapify()，取出堆顶元素用 heappop()。 heappush() 是用来向已有的堆中添加元素，一般从空列表开始构建： [代码] 如果数据已经在列表中，则使用 heapify() 进行重排： [代码] 回顾堆排序算...

#Algorithm

READ

排序算法

Algorithm

2026-01-11

计数排序、基数排序、桶排序则属于非比较排序，算法时间复杂度O(n)，优于比较排序。但是也有弊端，会多占用一些空间，相当于是用空间换时间。 1. 计数排序：计数排序的基本思想是：对每一个输入的元素a[i]，确定小于 a[i] 的元素个数。所以可以直接把 a[i] 放到它输出数组中的位置上。假设有5个数小于 a[i]，所以 a[i] 应该放在数组的第6个位置上。实现代码如下： [代码] 2. 桶排序：桶排序的基本思想是：把数组a划分为n个大小相同子区间（桶），每个子区间各自排序，最后合并。桶排序要求数据的分布必须均匀，不然可能会失效。计数排序是桶排序的一种特殊情况，可以把计数排序当成每个桶里只有一个元素的情况。 [代码] 算法实现步骤 1. 根据待排序集合中最大元素和最小元素的差值范围和映...

#Algorithm

READ

215. 第k大元素

Algorithm

2026-01-11

题目说明在未排序的数组中找到第 k 个最大的元素。请注意，你需要找的是数组排序后的第 k 个最大的元素，而不是第 k 个不同的元素。示例 1: 输入: [3,2,1,5,6,4] 和 k = 2 输出: 5 示例 2: 输入: [3,2,3,1,2,4,5,5,6] 和 k = 4 输出: 4 题解使用快排的思想 [代码]

#Algorithm

READ

二分查找

Algorithm

2026-01-11

💡 不断排除不存在解的区间，直至最后剩下一个这里归纳最重要的部分：分析题意，挖掘题目中隐含的单调性； while (left < right) 退出循环的时候有 left == right 成立，因此无需考虑返回left还是right；始终思考下一轮搜索区间是什么，如果是 [mid, right] 就对应 left = mid ，如果是 [left, mid 1] 就对应 right = mid 1，是保留 mid 还是 +1、−1 就在这样的思考中完成；从一个元素什么时候不是解开始考虑下一轮搜索区间是什么，把区间分为 2个部分（一个部分肯定不存在目标元素，另一个部分有可能存在目标元素），问题会变得简单很多，这是一条非常有用的经验；每一轮区间被划分成 2 部分，理解区间划...

#Algorithm

READ

Object Detection

Computer Vision

2026-01-11

上图是Yolo v4中，对各种detector部件的总结：包含Input、backbone、neck、head、... Backbone Neck 例如：SPP 、 ASPP 、 RFB、 SAM 用来增加感受野特征融合，主要是指不同输出层直接的特征融合，主要包括FPN、PAN、SFAM、ASFF和BiFPN。结构 One stage TwoStage Anchor Free Transformer Problems

#CV #Object Detection

READ

#

!

INCOMING TRANSMISSION

目标检测的遮挡问题概述

SNIPER

Gaze Estimation

Faster R-CNN

Object-detection中mAP计算

NMS系列

背包问题

python heapq源码分析

排序算法

215. 第k大元素

二分查找

Object Detection