focal-loss-for-dense-object-detection.md
October 14, 2022 · View on GitHub
- 在解决的是什么问题?一阶段检测的速度快,但是精度不高
- 为何成功,标志/准是什么?
- 在前人基础上的关键创新是什么?找到了一阶段检测精度不高的原因
- 关键结果有哪些?
- 有哪些局限性?如何优化?
- 这个工作可能有什么深远的影响?
1. 介绍
R-CNN 系列:
第一阶段是产出一个稀疏的候选目标的位置集合 第二阶段会利用卷积神经网络把每个候选位置进行前景某类别或背景的分类。目前通过不断演进,这种方法在 COCO 数据集的比赛上精度最高。
这篇论文里提出的一阶段检测器,第一次达到了 COCO 上 AP 指标,比复杂的两阶段的 SOTA。我们发现障碍主要是训练过程中类别的不均衡。
R-CNN 类似的检测器里,通过两阶段 cascade 和 启发采样来解决的。Proposal 阶段里(比如 Selective search , edgebox, deepMask, RPN),会快速缩小候选目标位置的集合到一个小的数量(比如1-2K),过滤掉大部分背景样本。在第二阶段分类时,启发式采样,比如固定的前后景比例(1:3),或者在线硬样本(hard example)挖掘(OHEM),执行之后就可以维护前后景的可控的平衡。
对比一下,一阶段检测必须处理更大规模的候选集位置。实践中达到100k位置,密集地覆盖了空间上的坐标位置、scale和长宽比。