知识库 - Orange

强化学习Model-Free之蒙特卡洛

2026-01-11

引言与背景蒙特卡洛方法是强化学习中的重要算法类别，它标志着从基于模型到无模型算法的转变。这类算法不依赖环境模型，而是通过与环境的直接交互获取经验数据来学习最优策略。蒙特卡洛方法在强化学习算法谱系中处于"无模型"方法的起始位置，是从基于模型的方法（如值迭代和策略迭代）向无模型方法过渡的第一步。无模型强化学习的核心理念可以简述为：如果没有模型，我们必须有数据；如果没有数据，我们必须有模型；如果两者都没有，我们就无法找到最优策略。在强化学习中，"数据"通常指智能体与环境交互的经验。均值估计问题在介绍蒙特卡洛强化学习算法之前，我们首先需要理解均值估计问题，这是理解从数据而非模型中学习的基础。考虑一个可以取有限实数集合 X 中值的随机变量 X ，我们的任务是计算 X 的均值或期望值： E[...

#Reinforcement Learning #Q-Learning

READ

DETR

Computer Vision

2026-01-11

原理分析网络架构: 本文的任务是Object detection，用到的工具是Transformers，特点是Endtoend。目标检测的任务是要去预测一系列的Bounding Box的坐标以及Label，现代大多数检测器通过定义一些proposal，anchor或者windows，把问题构建成为一个分类和回归问题来间接地完成这个任务。文章所做的工作，就是将transformers运用到了object detection领域，取代了现在的模型需要手工设计的工作，并且取得了不错的结果。在object detection上DETR准确率和运行时间上和Faster RCNN相当；将模型 generalize 到 panoptic segmentation 任务上，DETR表现甚至还超过了其他...

#transformer #CV #Object Detection

READ

从价值函数到DQN

Reinforcement Learning

2026-01-11

引言与背景价值函数方法是强化学习中的核心技术，它解决了传统表格方法在处理大型状态或动作空间时的效率问题。本文探讨了从表格表示向函数表示的转变，这是强化学习算法发展的重要里程碑。在强化学习的发展路径中，价值函数方法位于从基于模型到无模型、从表格表示到函数表示的演进过程中。它结合了时序差分学习的思想，并通过函数近似技术来处理复杂环境。价值表示：从表格到函数表格与函数表示的对比传统的表格方法将状态值存储在一个表格中：而函数近似方法则使用参数化函数来表示这些值，例如： [公式] 其中 [Math] 称作是状态 s 的特征向量， w 是参数向量。两种不同的表现形式的区别主要体现在以下几个方面：值的检索方式值的更新方式函数复杂度与近似能力函数的复杂度决定了其近似的能力：一阶线性函...

#Reinforcement Learning #Q-Learning

READ

IoU loss系列

Computer Vision

2026-01-11

一、IOU(Intersection over Union) 1. 特性(优点) IoU就是我们所说的交并比，是目标检测中最常用的指标，在anchorbased的方法中，他的作用不仅用来确定正样本和负样本，还可以用来评价输出框（predict box）和groundtruth的距离。 1. 可以说它可以反映预测检测框与真实检测框的检测效果。 1. 还有一个很好的特性就是尺度不变性，也就是对尺度不敏感（scale invariant），在regression任务中，判断predict box和gt的距离最直接的指标就是IoU。(满足非负性；同一性；对称性；三角不等性) [代码] 2. 作为损失函数会出现的问题(缺点) 1. 如果两个框没有相交，根据定义，IoU=0，不能反映两者的距离大小（重...

#CV #Object Detection

READ

VarifocalNet

Computer Vision

2026-01-11

Introduction 目标检测中NMS需要依据候选检测目标的排序来进行筛选框，如果分类得分较低，但是定位框准确会导致在NMS中将该bbox框被排除掉，因此这个排序的可靠性就非常重要。之前的工作主要采用IOU分支（IOUNet）与Centerness得分（FCOS）来作为大量候选检测的排序依据。然而，本文认为这些方法可以有效缓解分类得分和物体定位精度之间的不对齐问题。但是，它们是次优解的，因为将两个不完善的预测相乘可能会导致排名依旧变差，作者经过试验表明，通过这种方法实现的性能上限非常有限。此外，增加一个额外的网络分支来预测定位分数并不是一个很好的解决方案，并且会带来额外的计算负担。基于上述分析，作者提出：不采用预测一个额外的定位精确度得分（IOUaware Centerness）...

#Object Detection #CV

READ

CenterNet

Computer Vision

2026-01-11

前言 anchorfree目标检测属于anchorfree系列的目标检测，相比于CornerNet做出了改进，使得检测速度和精度相比于onestage和twostage的框架都有不小的提高，尤其是与YOLOv3作比较，在相同速度的条件下，CenterNet的精度比YOLOv3提高了4个左右的点。 CenterNet不仅可以用于目标检测，还可以用于其他的一些任务，如肢体识别或者3D目标检测等等。那CenterNet相比于之前的onestage和twostage的目标检测有什么特点？ CenterNet的“anchor”仅仅会出现在当前目标的位置处而不是整张图上撒，所以也没有所谓的box overlap大于多少多少的算positive anchor这一说，也不需要区分这个anchor是物体还是...

#CV #Object Detection

READ

ThunderNet

Computer Vision

2026-01-11

网络整体介绍 ThunderNet的整体架构如下图所示。 ThunderNet使用320×320像素作为网络的输入分辨率。整体的网络结构分为两部分：Backbone部分和Detection部分。网络的骨干部分为SNet，SNet是基于ShuffleNetV2进行修改得到的。网络的检测部分，利用了压缩的RPN网络，修改自LightHead RCNN网络用以提高效率。并提出Context Enhancement Module整合局部和全局特征增强网络特征表达能力。并提出Spatial Attention Module空间注意模块，引入来自RPN的前后景信息用以优化特征分布。 backbone 部分 1.输入分辨率为了加快推理（前向操作）速度，作者使用320320大小的输入图像。需要注意的...

#轻量化 #Object Detection #CV

READ

SNIP

Computer Vision

2026-01-11

1. 检测任务的困难图像分类算法，比如ResNeXt101 32 × 48d网络结构，在Imagenet数据集上的Top5准确率已经98%左右，Top1为85%。对于图像检测算法，最好的模型在coco数据集上的效果 AP_{50} 为62%，显然，总体上来看，准确率差了20个点左右，那么问题来了，为什么检测算法比识别算法的效果低这么多呢？ 1.1 尺度差异作者认为原因在于，检测任务中的目标存在较大的尺度变化（large scale variation）。作者统计了Imagenet和COCO数据集的特点，如下图，其中，横坐标表示目标相对于原图的比例，纵坐标表示累计分布（cumulation distribution function）。显然，由图中可以看出，COCO数据集中50%的目标相...

#CV #Object Detection

READ

Path Aggregation Blcok

Computer Vision

2026-01-11

FPN 1.结构区别（a）图片金字塔生成特征金字塔：缩放图片比例（b）通常的CNN网络结构（c）多尺度特征融合的方式：像SSD（Single Shot Detector）就是采用这种多尺度特征融合的方式，没有上采样过程，即从网络不同层抽取不同尺度的特征做预测，这种方式不会增加额外的计算量。作者认为SSD算法中没有用到足够低层的特征（在SSD中，最低层的特征是VGG网络的conv4_3），而在作者看来足够低层的特征对于检测小物体是很有帮助的。（d）FPN：这是本文要讲的网络，FPN主要解决的是物体检测中的多尺度问题，通过简单的网络连接改变，在基本不增加原有模型计算量的情况下，大幅度提升了小物体检测的性能。通过高层特征进行上采样和低层特征进行自顶向下的连接，而且每一层都会进行预测。 2....

#CV #Object Detection

READ

多尺度问题概述

Computer Vision

2026-01-11

一、传统的图像金字塔最开始在深度学习方法流行之前，对于不同尺度的目标，大家普遍使用将原图构建出不同分辨率的图像金字塔，再对每层金字塔用固定输入分辨率的分类器在该层滑动来检测目标，以求在金字塔底部检测出小目标；或者只用一个原图，在原图上，用不同分辨率的分类器来检测目标，以求在比较小的窗口分类器中检测到小目标。经典的基于简单矩形特征(Haar)+级联Adaboost与Hog特征+SVM的DPM目标识别框架，均使用图像金字塔的方式处理多尺度目标，早期的CNN目标识别框架同样采用该方式，但对图像金字塔中的每一层分别进行CNN提取特征，耗时与内存消耗均无法满足需求。但该方式毫无疑问仍然是最优的。值得一提的是，其实目前大多数深度学习算法提交结果进行排名的时候，大多使用多尺度测试。同时类似于SNIP使用...

#Object Detection #CV

READ

目标检测的遮挡问题概述

Computer Vision

2026-01-11

SoftNMS/DIoUNMS softnms参考： SoftNMS 可以看到，SoftNMS与传统NMS的区别在于对score分数调整的处理。如果是传统的NMS操作，那么当 B 中的 b_i 和 [Math] 的IoU值大于阈值 N_t ，那么就从 B 和 S 中去除该box；对于SoftNMS而言是先计算 [Math] 与 b_i 的IoU，然后IoU经过一个函数输出最后与 s_i 相乘最终得到box的分数。其中 s_i 的score遵循IoU越大，分数越低的原则（IoU越大，越可能是背景），所以 s_i 定义如下：考虑到上式是不连续的，并且当达到N_t的NMS阈值时会施加突然的惩罚，如果惩罚函数是连续的，那将是理想的，否则它可能导致检测结果的排序列表的突然改变（集合D中的scor...

#Object Detection #CV

READ

SNIPER

Computer Vision

2026-01-11

SNIPER的关键是减少了SNIP的计算量。SNIP借鉴了multiscale training的思想进行训练，multiscale training是用图像金字塔作为模型的输入，这种做法虽然能够提高模型效果，但是计算量的增加也非常明显，因为模型需要处理每个scale图像的每个像素，而SNIPER（Scale Normalization for Image Pyramids with Efficient Resampling）算法以适当的比例处理ground truth（称为chips）周围的上下文区域，在训练期间每个图像生成的chips的数量会根据场景复杂度而自适应地变化，由于SNIPER在采样后的低分辨率的chips上运行，故其可以在训练期间收益于Batch Normalization，...

#CV #Object Detection

READ

#

!

INCOMING TRANSMISSION

强化学习Model-Free之蒙特卡洛

DETR

从价值函数到DQN

IoU loss系列

VarifocalNet

CenterNet

ThunderNet

SNIP

Path Aggregation Blcok

多尺度问题概述

目标检测的遮挡问题概述

SNIPER