recognition.md
August 19, 2025 ยท View on GitHub
Recognition
- (arXiv 2021.03) Global Self-Attention Networks for Image Recognition, [Paper]
- (arXiv 2021.03) TransFG: A Transformer Architecture for Fine-grained Recognition, [Paper]
- (arXiv 2021.05) Are Convolutional Neural Networks or Transformers more like human vision, [Paper]
- (arXiv 2021.07) Transformer with Peak Suppression and Knowledge Guidance for Fine-grained Image Recognition, [Paper]
- (arXiv 2021.07) RAMS-Trans: Recurrent Attention Multi-scale Transformer for Fine-grained Image Recognition, [Paper]
- (arXiv 2021.08) DPT: Deformable Patch-based Transformer for Visual Recognition, [Paper], [Code]
- (arXiv 2021.10) A free lunch from ViT: Adaptive Attention Multi-scale Fusion Transformer for Fine-grained Visual Recognition, [Paper]
- (arXiv 2021.10) MVT: Multi-view Vision Transformer for 3D Object Recognition, [Paper]
- (arXiv 2021.11) AdaViT: Adaptive Vision Transformers for Efficient Image Recognition, [Paper]
- (arXiv 2021.11) Grounded Situation Recognition with Transformers, [Paper], [Code]
- (arXiv 2022.01) TransVPR: Transformer-based place recognition with multi-level attention aggregation, [Paper]
- (arXiv 2022.03) MetaFormer : A Unified Meta Framework for Fine-Grained Recognition, [Paper], [Code]
- (arXiv 2022.04) Diverse Instance Discovery: Vision-Transformer for Instance-Aware Multi-Label Image Recognition, [Paper], [Code]
- (arXiv 2022.07) Forensic License Plate Recognition with Compression-Informed Transformers, [Paper], [Code]
- (arXiv 2022.08) TSRFormer: Table Structure Recognition with Transformers, [Paper]
- (arXiv 2022.08) GSRFormer: Grounded Situation Recognition Transformer with Alternate Semantic Attention Refinement, [Paper], [Code]
- (arXiv 2022.09) SeqOT: A Spatial-Temporal Transformer Network for Place Recognition Using Sequential LiDAR Data, [Paper], [Code]
- (arXiv 2022.12) Part-guided Relational Transformers for Fine-grained Visual Recognition, [Paper], [Code]
- (arXiv 2023.02) CVTNet: A Cross-View Transformer Network for Place Recognition Using LiDAR Data, [Paper], [Code]
- (arXiv 2023.02) Rethink Long-tailed Recognition with Vision Transforms, [Paper]
- (arXiv 2023.04) R2Former: Unified Retrieval and Reranking Transformer for Place Recognition, [Paper], [Code]
- (arXiv 2023.05) MASK-CNN-Transformer For Real-Time Multi-Label Weather Recognition, [Paper]
- (arXiv 2023.05) TReR: A Lightweight Transformer Re-Ranking Approach for 3D LiDAR Place Recognition, [Paper]
- (arXiv 2023.07) Convolutional Transformer for Autonomous Recognition and Grading of Tomatoes Under Various Lighting, Occlusion, and Ripeness Conditions, [Paper]
- (arXiv 2023.08) M2Former: Multi-Scale Patch Selection for Fine-Grained Visual Recognition, [Paper]
- (arXiv 2023.09) Parameter-Efficient Long-Tailed Recognition, [Paper], [Code]
- (arXiv 2023.09) MAGIC-TBR: Multiview Attention Fusion for Transformer-based Bodily Behavior Recognition in Group Settings, [Paper], [Code]
- (arXiv 2023.10) ClusVPR: Efficient Visual Place Recognition with Clustering-based Weighted Transformer, [Paper], [Code]
- (arXiv 2023.10) FaultSeg Swin-UNETR: Transformer-Based Self-Supervised Pretraining Model for Fault Recognition, [Paper]
- (arXiv 2023.12) Are Vision Transformers More Data Hungry Than Newborn Visual Systems, [Paper]
- (arXiv 2024.01) PlaceFormer: Transformer-based Visual Place Recognition using Multi-Scale Patch Selection and Fusion, [Paper]
- (arXiv 2024.01) Regressing Transformers for Data-efficient Visual Place Recognition, [Paper]
- (arXiv 2024.01) A New Method for Vehicle Logo Recognition Based on Swin Transformer, [Paper]
- (arXiv 2024.07) Global-Local Similarity for Efficient Fine-Grained Image Recognition with Vision Transformers, [Paper], [Code]
- (arXiv 2024.10) big.LITTLE Vision Transformer for Efficient Visual Recognition, [Paper]
- (arXiv 2024.12) EDTformer: An Efficient Decoder Transformer for Visual Place Recognition, [Paper], [Code]
- (arXiv 2025.02) A Transformer-in-Transformer Network Utilizing Knowledge Distillation for Image Recognition, [Paper]
- (arXiv 2025.03) Fraesormer: Learning Adaptive Sparse Transformer for Efficient Food Recognition, [Paper], [Code]
- (arXiv 2025.03) Siformer: Feature-isolated Transformer for Efficient Skeleton-based Sign Language Recognition, [Paper]
- (arXiv 2025.04) LM-MCVT: A Lightweight Multi-modal Multi-view Convolutional-Vision Transformer Approach for 3D Object Recognition, [Paper]
- (arXiv 2025.07) DSFormer: A Dual-Scale Cross-Learning Transformer for Visual Place Recognition, [Paper], [Code]
- (arXiv 2025.08) A Signer-Invariant Conformer and Multi-Scale Fusion Transformer for Continuous Sign Language Recognition, [Paper], [Code]