classification-backbone.md

October 23, 2025 · View on GitHub

Classification (Backbone)

  • (ICLR'21) MODELING LONG-RANGE INTERACTIONS WITHOUT ATTENTION, [Paper], [Code]
  • (CVPR'20) Feature Pyramid Transformer, [Paper], [Code]
  • (ICLR'21) An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale, [Paper], [Code]
  • (arXiv 2020.06) Visual Transformers: Token-based Image Representation and Processing for Computer Vision, [Paper]
  • (arXiv 2020.12) Training data-efficient image transformers & distillation through attention, [Paper], [Code]
  • (arXiv 2021.01) Tokens-to-Token ViT: Training Vision Transformers from Scratch on ImageNet, [Paper], [Code]
  • (arXiv 2021.01) Bottleneck Transformers for Visual Recognition, [Paper] , [Code]
  • (arXiv.2021.02) Conditional Positional Encodings for Vision Transformers, [Paper], [Code]
  • (arXiv.2021.02) Pyramid Vision Transformer: A Versatile Backbone for Dense Prediction without Convolutions, [Paper], [Code]
  • (arXiv 2021.03) Transformer in Transformer, [Paper], [Code]
  • (arXiv 2021.03) ConViT: Improving Vision Transformers with Soft Convolutional Inductive Biases, [Paper], [Code]
  • (arXiv 2021.03) Scalable Visual Transformers with Hierarchical Pooling, [Paper]
  • (arXiv 2021.03) Incorporating Convolution Designs into Visual Transformers, [Paper]
  • (arXiv 2021.03) DeepViT: Towards Deeper Vision Transformer, [Paper], [Code]
  • (arXiv 2021.03) Swin Transformer: Hierarchical Vision Transformer using Shifted Windows, [Paper], [Code]
  • (arXiv 2021.03) Understanding Robustness of Transformers for Image Classification, [Paper]
  • (arXiv 2021.03) Multi-Scale Vision Longformer: A New Vision Transformer for High-Resolution Image Encoding, [Paper]
  • (arXiv 2021.03) CvT: Introducing Convolutions to Vision Transformers, [Paper], [Code]
  • (arXiv 2021.03) Rethinking Spatial Dimensions of Vision Transformers, [Paper], [Code]
  • (arXiv 2021.03) Going deeper with Image Transformers, [Paper]
  • (arXiv 2021.04) LeViT: a Vision Transformer in ConvNet's Clothing for Faster Inference, [Paper]
  • (arXiv 2021.04) On the Robustness of Vision Transformers to Adversarial Examples, [Paper]
  • (arXiv 2021.04) LocalViT: Bringing Locality to Vision Transformers, [Paper], [Code]
  • (arXiv 2021.04) Escaping the Big Data Paradigm with Compact Transformers, [Paper], [Code]
  • (arXiv 2021.04) Co-Scale Conv-Attentional Image Transformers, [Paper], [Code]
  • (arXiv 2021.04) Token Labeling: Training a 85.5% Top-1 Accuracy Vision Transformer with 56M Parameters on ImageNet, [Paper], [Code]
  • (arXiv 2021.04) So-ViT: Mind Visual Tokens for Vision Transformer, [Paper]
  • (arXiv 2021.04) Multiscale Vision Transformers, [Paper], [Code]
  • (arXiv 2021.04) Visformer: The Vision-friendly Transformer, [Paper], [Code]
  • (arXiv 2021.04) Improve Vision Transformers Training by Suppressing Over-smoothing, [Paper], [Code]
  • (arXiv 2021.04) Twins: Revisiting the Design of Spatial Attention in Vision Transformers, [Paper], [Code]
  • (arXiv 2021.04) ConTNet: Why not use convolution and transformer at the same time, [Paper], [Code]
  • (arXiv 2021.05) Rethinking the Design Principles of Robust Vision Transformer, [Paper], [Code]
  • (arXiv 2021.05) Vision Transformers are Robust Learners, [Paper], [Code]
  • (arXiv 2021.05) Rethinking Skip Connection with Layer Normalization in Transformers and ResNets, [Paper], [Code]
  • (arXiv 2021.05) Single-Layer Vision Transformers for More Accurate Early Exits with Less Overhead, [Paper]
  • (arXiv 2021.05) Intriguing Properties of Vision Transformers, [Paper], [Code]
  • (arXiv 2021.05) Aggregating Nested Transformers, [Paper]
  • (arXiv 2021.05) ResT: An Efficient Transformer for Visual Recognition, [Paper], [Code]
  • (arXiv 2021.06) DynamicViT: Efficient Vision Transformers with Dynamic Token Sparsification, [Paper], [Code]
  • (arXiv 2021.06) When Vision Transformers Outperform ResNets without Pretraining or Strong Data Augmentations, [Paper]
  • (arXiv 2021.06) Container: Context Aggregation Network, [Paper]
  • (arXiv 2021.06) TransMIL: Transformer based Correlated Multiple Instance Learning for Whole Slide Image Classication, [Paper]
  • (arXiv 2021.06) KVT: k-NN Attention for Boosting Vision Transformers, [Paper]
  • (arXiv 2021.06) MSG-Transformer: Exchanging Local Spatial Information by Manipulating Messenger Tokens, [Paper], [Code]
  • (arXiv 2021.06) Not All Images are Worth 16x16 Words: Dynamic Vision Transformers with Adaptive Sequence Length, [Paper]
  • (arXiv 2021.06) Less is More: Pay Less Attention in Vision Transformers, [Paper]
  • (arXiv 2021.06) FoveaTer: Foveated Transformer for Image Classification, [Paper]
  • (arXiv 2021.06) An Attention Free Transformer, [Paper]
  • (arXiv 2021.06) Glance-and-Gaze Vision Transformer, [Paper], [Code]
  • (arXiv 2021.06) RegionViT: Regional-to-Local Attention for Vision Transformers, [Paper]
  • (arXiv 2021.06) Chasing Sparsity in Vision Transformers: An End-to-End Exploration, [Paper], [Code]
  • (arXiv 2021.06) Scaling Vision Transformers, [Paper]
  • (arXiv 2021.06) CAT: Cross Attention in Vision Transformer, [Paper], [Code]
  • (arXiv 2021.06) On Improving Adversarial Transferability of Vision Transformers, [Paper], [Code]
  • (arXiv 2021.06) Demystifying Local Vision Transformer: Sparse Connectivity, Weight Sharing, and Dynamic Weight, [Paper]
  • (arXiv 2021.06) Patch Slimming for Efficient Vision Transformers, [Paper]
  • (arXiv 2021.06) Transformer in Convolutional Neural Networks, [Paper], [Code]
  • (arXiv 2021.06) ViTAE: Vision Transformer Advanced by Exploring Intrinsic Inductive Bias, [Paper], [Code]
  • (arXiv 2021.06) Shuffle Transformer: Rethinking Spatial Shuffle for Vision Transformer, [Paper]
  • (arXiv 2021.06) Refiner: Refining Self-attention for Vision Transformers, [Paper]
  • (arXiv 2021.06) Reveal of Vision Transformers Robustness against Adversarial Attacks, [Paper]
  • (arXiv 2021.06) Efficient Training of Visual Transformers with Small-Size Datasets, [Paper]
  • (arXiv 2021.06) Delving Deep into the Generalization of Vision Transformers under Distribution Shifts, [Paper]
  • (arXiv 2021.06) BEIT: BERT Pre-Training of Image Transformers, [Paper], [Code]
  • (arXiv 2021.06) XCiT: Cross-Covariance Image Transformers, [Paper], [Code]
  • (arXiv 2021.06) How to train your ViT? Data, Augmentation, and Regularization in Vision Transformers, [Paper], [Code1], [Code2]
  • (arXiv 2021.06) Exploring Vision Transformers for Fine-grained Classification, [Paper], [Code]
  • (arXiv 2021.06) TokenLearner: What Can 8 Learned Tokens Do for Images and Videos, [Paper]
  • (arXiv 2021.06) Exploring Corruption Robustness: Inductive Biases in Vision Transformers and MLP-Mixers, [Paper], [Code]
  • (arXiv 2021.06) VOLO: Vision Outlooker for Visual Recognition, [Paper], [Code]
  • (arXiv 2021.06) IA-RED2: Interpretability-Aware Redundancy Reduction for Vision Transformers, [Paper], [Project]
  • (arXiv 2021.06) PVTv2: Improved Baselines with Pyramid Vision Transformer, [Paper], [Code]
  • (arXiv 2021.06) Early Convolutions Help Transformers See Better, [Paper]
  • (arXiv 2021.06) Multi-Exit Vision Transformer for Dynamic Inference, [Paper]
  • (arXiv 2021.07) Augmented Shortcuts for Vision Transformers, [Paper]
  • (arXiv 2021.07) Improving the Efficiency of Transformers for Resource-Constrained Devices, [Paper]
  • (arXiv 2021.07) CSWin Transformer: A General Vision Transformer Backbone with Cross-Shaped Windows, [Paper], [Code]
  • (arXiv 2021.07) Focal Self-attention for Local-Global Interactions in Vision Transformers, [Paper]
  • (arXiv 2021.07) Cross-view Geo-localization with Evolving Transformer, [Paper]
  • (arXiv 2021.07) What Makes for Hierarchical Vision Transformer, [Paper]
  • (arXiv 2021.07) Efficient Vision Transformers via Fine-Grained Manifold Distillation, [Paper]
  • (arXiv 2021.07) Vision Xformers: Efficient Attention for Image Classification, [Paper]
  • (arXiv 2021.07) Long-Short Transformer: Efficient Transformers for Language and Vision, [Paper]
  • (arXiv 2021.07) Feature Fusion Vision Transformer for Fine-Grained Visual Categorization, [Paper]
  • (arXiv 2021.07) Local-to-Global Self-Attention in Vision Transformers, [Paper], [Code]
  • (arXiv 2021.07) Visual Parser: Representing Part-whole Hierarchies with Transformers, [Paper], [Code]
  • (arXiv 2021.07) CMT: Convolutional Neural Networks Meet Vision Transformers, [Paper]
  • (arXiv 2021.07) Combiner: Full Attention Transformer with Sparse Computation Cost, [Paper]
  • (arXiv 2021.07) A Comparison of Deep Learning Classification Methods on Small-scale Image Data set: from Convolutional Neural Networks to Visual Transformers, [Paper]
  • (arXiv 2021.07) Contextual Transformer Networks for Visual Recognition, [Paper], [Code]
  • (arXiv 2021.07) Rethinking and Improving Relative Position Encoding for Vision Transformer, [Paper], [Code]
  • (arXiv 2021.08) CrossFormer: A Versatile Vision Transformer Based on Cross-scale Attention, [Paper], [Code]
  • (arXiv 2021.08) Evo-ViT: Slow-Fast Token Evolution for Dynamic Vision Transformer, [Paper]
  • (arXiv 2021.08) Vision Transformer with Progressive Sampling, [Paper], [Code]
  • (arXiv 2021.08) Armour: Generalizable Compact Self-Attention for Vision Transformers, [Paper]
  • (arXiv 2021.08) ConvNets vs. Transformers: Whose Visual Representations are More Transferable, [Paper]
  • (arXiv 2021.08) Mobile-Former: Bridging MobileNet and Transformer, [Paper]
  • (arXiv 2021.08) Do Vision Transformers See Like Convolutional Neural Networks, [Paper]
  • (arXiv 2021.08) Exploring and Improving Mobile Level Vision Transformers, [Paper]
  • (arXiv 2021.08) A Battle of Network Structures: An Empirical Study of CNN, Transformer, and MLP, [Paper]
  • (arXiv 2021.08) Scaled ReLU Matters for Training Vision Transformers, [Paper]
  • (arXiv 2021.09) Towards Transferable Adversarial Attacks on Vision Transformers, [Paper]
  • (arXiv 2021.09) DS-Net++: Dynamic Weight Slicing for Efficient Inference in CNNs and Transformers, [Paper], [Code]
  • (arXiv 2021.09) Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers, [Paper]
  • (arXiv 2021.09) Fine-tuning Vision Transformers for the Prediction of State Variables in Ising Models, [Paper]
  • (arXiv 2021.09) UFO-ViT: High Performance Linear Vision Transformer without Softmax, [Paper]
  • (arXiv 2021.10) MobileViT: Light-weight, General-purpose, and Mobile-friendly Vision Transformer, [Paper]
  • (arXiv 2021.10) Adversarial Robustness Comparison of Vision Transformer and MLP-Mixer to CNNs, [Paper], [Code]
  • (arXiv 2021.10) Token Pooling in Visual Transformers, [Paper]
  • (arXiv 2021.10) NViT: Vision Transformer Compression and Parameter Redistribution, [Paper]
  • (arXiv 2021.10) Adversarial Token Attacks on Vision Transformers, [Paper]
  • (arXiv 2021.10) Certified Patch Robustness via Smoothed Vision Transformers, [Paper], [Code]
  • (arXiv 2021.10) Understanding and Improving Robustness of Vision Transformers through Patch-based Negative Augmentation, [Paper]
  • (arXiv 2021.10) SOFT: Softmax-free Transformer with Linear Complexity, [Paper], [Code]
  • (arXiv 2021.10) Blending Anti-Aliasing into Vision Transformer, [Paper], [Code]
  • (arXiv 2021.11) Can Vision Transformers Perform Convolution, [Paper]
  • (arXiv 2021.11) Sliced Recursive Transformer, [Paper], [Code]
  • (arXiv 2021.11) Hybrid BYOL-ViT: Efficient approach to deal with small Datasets, [Paper]
  • (arXiv 2021.11) Are Transformers More Robust Than CNNs, [Paper], [Code]
  • (arXiv 2021.11) iBOT: Image BERT Pre-Training with Online Tokenizer, [Paper]
  • (arXiv 2021.11) Improved Robustness of Vision Transformer via PreLayerNorm in Patch Embedding, [Paper]
  • (arXiv 2021.11) TransMix: Attend to Mix for Vision Transformers, [Paper], [Code]
  • (arXiv 2021.11) Swin Transformer V2: Scaling Up Capacity and Resolution, [Paper], [Code]
  • (arXiv 2021.11) Are Vision Transformers Robust to Patch Perturbations, [Paper]
  • (arXiv 2021.11) Discrete Representations Strengthen Vision Transformer Robustness, [Paper]
  • (arXiv 2021.11) Zero-Shot Certified Defense against Adversarial Patches with Vision Transformers, [Paper]
  • (arXiv 2021.11) MetaFormer is Actually What You Need for Vision, [Paper], [Code]
  • (arXiv 2021.11) DyTox: Transformers for Continual Learning with DYnamic TOken eXpansion, [Paper], [Code]
  • (arXiv 2021.11) Mesa: A Memory-saving Training Framework for Transformers, [Paper], [Code]
  • (arXiv 2021.11) Semi-Supervised Vision Transformers, [Paper]
  • (arXiv 2021.11) DBIA: Data-free Backdoor Injection Attack against Transformer Networks, [Paper], [Code]
  • (arXiv 2021.11) Self-slimmed Vision Transformer, [Paper]
  • (arXiv 2021.11) PeCo: Perceptual Codebook for BERT Pre-training of Vision Transformers, [Paper], [Code]
  • (arXiv 2021.11) SWAT: Spatial Structure Within and Among Tokens, [Paper]
  • (arXiv 2021.11) NomMer: Nominate Synergistic Context in Vision Transformer for Visual Recognition, [Paper], [Code]
  • (arXiv 2021.11) Global Interaction Modelling in Vision Transformer via Super Tokens, [Paper]
  • (arXiv 2021.11) ATS: Adaptive Token Sampling For Efficient Vision Transformers, [Paper]
  • (arXiv 2021.11) Pyramid Adversarial Training Improves ViT Performance, [Paper]
  • (arXiv 2021.12) Improved Multiscale Vision Transformers for Classification and Detection, [Paper]
  • (arXiv 2021.12) Make A Long Image Short: Adaptive Token Length for Vision Transformers, [Paper]
  • (arXiv 2021.12) Dynamic Token Normalization Improves Vision Transformer, [Paper], [Code]
  • (arXiv 2021.12) Bootstrapping ViTs: Towards Liberating Vision Transformers from Pre-training, [Paper]
  • (arXiv 2021.12) Decision-based Black-box Attack Against Vision Transformers via Patch-wise Adversarial Removal, [Paper], [Code]
  • (arXiv 2021.12) Visual Transformers with Primal Object Queries for Multi-Label Image Classification, [Paper]
  • (arXiv 2021.12) Couplformer:Rethinking Vision Transformer with Coupling Attention Map, [Paper]
  • (arXiv 2021.12) AdaViT: Adaptive Tokens for Efficient Vision Transformer, [Paper]
  • (arXiv 2021.12) Lite Vision Transformer with Enhanced Self-Attention, [Paper], [Code]
  • (arXiv 2021.12) Learned Queries for Efficient Local Attention, [Paper], [Code]
  • (arXiv 2021.12) MPViT: Multi-Path Vision Transformer for Dense Prediction, [Paper], [Code]
  • (arXiv 2021.12) MIA-Former: Efficient and Robust Vision Transformers via Multi-grained Input-Adaptation, [Paper]
  • (arXiv 2021.12) ELSA: Enhanced Local Self-Attention for Vision Transformer, [Paper], [Code]
  • (arXiv 2021.12) SimViT: Exploring a Simple Vision Transformer with sliding windows, [Paper], [Code]
  • (arXiv 2021.12) Vision Transformer for Small-Size Datasets, [Paper]
  • (arXiv 2021.12) ViR: the Vision Reservoir, [Paper]
  • (arXiv 2021.12) Augmenting Convolutional networks with attention-based aggregation, [Paper]
  • (arXiv 2021.12) Pale Transformer: A General Vision Transformer Backbone with Pale-Shaped Attention, [Paper], [Code]
  • (arXiv 2021.12) SPViT: Enabling Faster Vision Transformers via Soft Token Pruning, [Paper]
  • (arXiv 2021.12) Stochastic Layers in Vision Transformers, [Paper]
  • (arXiv 2022.01) Vision Transformer with Deformable Attention, [Paper], [Code]
  • (arXiv 2022.01) PyramidTNT: Improved Transformer-in-Transformer Baselines with Pyramid Architecture, [Paper], [Code]
  • (arXiv 2022.01) QuadTree Attention for Vision Transformers, [Paper], [Code]
  • (arXiv 2022.01) TerViT: An Efficient Ternary Vision Transformer, [Paper]
  • (arXiv 2022.01) UniFormer: Unifying Convolution and Self-attention for Visual Recognition, [Paper], [Code]
  • (arXiv 2022.01) Patches Are All You Need?, [Paper], [Code]
  • (arXiv 2022.01) Convolutional Xformers for Vision, [Paper], [Code]
  • (arXiv 2022.01) When Shift Operation Meets Vision Transformer: An Extremely Simple Alternative to Attention Mechanism, [Paper], [Code]
  • (arXiv 2022.01) Training Vision Transformers with Only 2040 Images, [Paper]
  • (arXiv 2022.01) O-ViT: Orthogonal Vision Transformer, [Paper]
  • (arXiv 2022.01) Aggregating Global Features into Local Vision Transformer, [Paper],[Code]
  • (arXiv 2022.01) BOAT: Bilateral Local Attention Vision Transformer, [Paper]
  • (arXiv 2022.02) BViT: Broad Attention based Vision Transformer, [Paper],[Code]
  • (arXiv 2022.02) How Do Vision Transformers Work, [Paper],[Code]
  • (arXiv 2022.02) Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations, [Paper],[Code]
  • (arXiv 2022.02) ViTAEv2: Vision Transformer Advanced by Exploring Inductive Bias for Image Recognition and Beyond, [Paper]
  • (arXiv 2022.02) Learning to Merge Tokens in Vision Transformers, [Paper]
  • (arXiv 2022.02) Auto-scaling Vision Transformers without Training, [Paper],[Code]
  • (arXiv 2022.03) Aggregated Pyramid Vision Transformer: Split-transform-merge Strategy for Image Recognition without Convolutions, [Paper]
  • (arXiv 2022.03) D^2ETR: Decoder-Only DETR with Computationally Efficient Cross-Scale Attention, [Paper]
  • (arXiv 2022.03) BatchFormer: Learning to Explore Sample Relationships for Robust Representation Learning, [Paper]
  • (arXiv 2022.03) Multi-Tailed Vision Transformer for Efficient Inference, [Paper]
  • (arXiv 2022.03) ViT-P: Rethinking Data-efficient Vision Transformers from Locality, [Paper]
  • (arXiv 2022.03) Coarse-to-Fine Vision Transformer, [Paper],[Code]
  • (arXiv 2022.03) Dynamic Group Transformer: A General Vision Transformer Backbone with Dynamic Group Attention, [Paper]
  • (arXiv 2022.03) EdgeFormer: Improving Light-weight ConvNets by Learning from Vision Transformers, [Paper]
  • (arXiv 2022.03) WaveMix: Resource-efficient Token Mixing for Images, [Paper], [Code]
  • (arXiv 2022.03) Anti-Oversmoothing in Deep Vision Transformers via the Fourier Domain Analysis: From Theory to Practice, [Paper], [Code]
  • (arXiv 2022.03) Visualizing and Understanding Patch Interactions in Vision Transformer, [Paper]
  • (arXiv 2022.03) EIT: Efficiently Lead Inductive Biases to ViT, [Paper], [Code]
  • (arXiv 2022.03) The Principle of Diversity: Training Stronger Vision Transformers Calls for Reducing All Levels of Redundancy, [Paper], [Code]
  • (arXiv 2022.03) Towards Practical Certifiable Patch Defense with Vision Transformer, [Paper]
  • (arXiv 2022.03) Patch-Fool: Are Vision Transformers Always Robust Against Adversarial Perturbations, [Paper], [Code]
  • (arXiv 2022.03) Are Vision Transformers Robust to Spurious Correlations, [Paper], [Code]
  • (arXiv 2022.03) Three things everyone should know about Vision Transformers, [Paper]
  • (arXiv 2022.03) ScalableViT: Rethinking the Context-oriented Generalization of Vision Transformer, [Paper]
  • (arXiv 2022.03) GradViT: Gradient Inversion of Vision Transformers, [Paper], [Code]
  • (arXiv 2022.03) Learning Patch-to-Cluster Attention in Vision Transformer, [Paper]
  • (arXiv 2022.03) Towards Exemplar-Free Continual Learning in Vision Transformers: an Account of Attention, Functional and Weight Regularization, [Paper]
  • (arXiv 2022.03) Beyond Fixation: Dynamic Window Visual Transformer, [Paper], [Code]
  • (arXiv 2022.03) Give Me Your Attention: Dot-Product Attention Considered Harmful for Adversarial Patch Robustness, [Paper]
  • (arXiv 2022.03) Automated Progressive Learning for Efficient Training of Vision Transformers, [Paper], [Code]
  • (arXiv 2022.03) Beyond Masking: Demystifying Token-Based Pre-Training for Vision Transformers, [Paper], [Code]
  • (arXiv 2022.03) CaCo: Both Positive and Negative Samples are Directly Learnable via Cooperative-adversarial Contrastive Learning, [Paper], [Code]
  • (arXiv 2022.03) SepViT: Separable Vision Transformer, [Paper]
  • (arXiv 2022.03) Fine-tuning Image Transformers using Learnable Memory, [Paper]
  • (arXiv 2022.03) Parameter-efficient Fine-tuning for Vision Transformers, [Paper]
  • (arXiv 2022.03) MaxViT: Multi-Axis Vision Transformer, [Paper]
  • (arXiv 2022.04) BatchFormerV2: Exploring Sample Relationships for Dense Representation Learning, [Paper]
  • (arXiv 2022.04) Improving Vision Transformers by Revisiting High-frequency Components, [Paper]
  • (arXiv 2022.04) MixFormer: Mixing Features across Windows and Dimensions, [Paper], [Code]
  • (arXiv 2022.04) DaViT: Dual Attention Vision Transformers, [Paper], [Code]
  • (arXiv 2022.04) Evaluating Vision Transformer Methods for Deep Reinforcement Learning from Pixels, [Paper]
  • (arXiv 2022.04) MiniViT: Compressing Vision Transformers with Weight Multiplexing, [Paper]
  • (arXiv 2022.04) DeiT III: Revenge of the ViT, [Paper]
  • (arXiv 2022.04) Neighborhood Attention Transformer, [Paper], [Code]
  • (arXiv 2022.04) ResT V2: Simpler, Faster and Stronger, [Paper], [Code]
  • (arXiv 2022.04) VSA: Learning Varied-Size Window Attention in Vision Transformers, [Paper], [Code]
  • (arXiv 2022.04) OCFormer: One-Class Transformer Network for Image Classification, [Paper]
  • (arXiv 2022.04) Adaptive Split-Fusion Transformer, [Paper], [Code]
  • (arXiv 2022.04) Understanding The Robustness in Vision Transformers, [Paper], [Code]
  • (arXiv 2022.05) Better plain ViT baselines for ImageNet-1k, [Paper], [Code]
  • (arXiv 2022.05) EdgeViTs: Competing Light-weight CNNs on Mobile Devices with Vision Transformers, [Paper], [Code]
  • (arXiv 2022.05) ConvMAE: Masked Convolution Meets Masked Autoencoders, [Paper], [Code]
  • (arXiv 2022.05) Unraveling Attention via Convex Duality: Analysis and Interpretations of Vision Transformers, [Paper]
  • (arXiv 2022.05) TRT-ViT: TensorRT-oriented Vision Transformer, [Paper]
  • (arXiv 2022.05) Super Vision Transformer, [Paper], [Code]
  • (arXiv 2022.05) Deeper vs Wider: A Revisit of Transformer Configuration, [Paper]
  • (arXiv 2022.05) Vision Transformers in 2022: An Update on Tiny ImageNet, [Paper], [Code]
  • (arXiv 2022.05) Privacy-Preserving Image Classification Using Vision Transformer, [Paper]
  • (arXiv 2022.05) Inception Transformer, [Paper], [Code]
  • (arXiv 2022.05) MoCoViT: Mobile Convolutional Vision Transformer, [Paper], [Code]
  • (arXiv 2022.05) Breaking the Chain of Gradient Leakage in Vision Transformers, [Paper], [Code]
  • (arXiv 2022.05) Hierarchical Vision Transformer for Masked Image Modeling, [Paper], [Code]
  • (arXiv 2022.05) Fast Vision Transformers with HiLo Attention, [Paper], [Code]
  • (arXiv 2022.05) AdaptFormer: Adapting Vision Transformers for Scalable Visual Recognition, [Paper], [Code]
  • (arXiv 2022.05) X-ViT: High Performance Linear Vision Transformer without Softmax, [Paper]
  • (arXiv 2022.05) Architecture-Agnostic Masked Image Modeling 鈥? From ViT back to CNN, [Paper], [Code]
  • (arXiv 2022.05) HiViT: Hierarchical Vision Transformer Meets Masked Image Modeling, [Paper]
  • (arXiv 2022.05) EfficientViT: Enhanced Linear Attention for High-Resolution Low-Computation Visual Recognition, [Paper], [Code]
  • (arXiv 2022.06) EfficientFormer: Vision Transformers at MobileNet Speed, [Paper], [Code]
  • (arXiv 2022.06) Optimizing Relevance Maps of Vision Transformers Improves Robustness, [Paper], [Code]
  • (arXiv 2022.06) Separable Self-attention for Mobile Vision Transformers, [Paper], [Code]
  • (arXiv 2022.06) Spatial Entropy Regularization for Vision Transformers, [Paper]
  • (arXiv 2022.06) Peripheral Vision Transformer, [Paper], [Code]
  • (arXiv 2022.06) SP-ViT: Learning 2D Spatial Priors for Vision Transformers, [Paper]
  • (arXiv 2022.06) FIT: Parameter Efficient Few-shot Transfer Learning for Personalized and Federated Image Classification, [Paper], [Code]
  • (arXiv 2022.06) SimA: Simple Softmax-free Attention for Vision Transformers, [Paper], [Code]
  • (arXiv 2022.06) Vicinity Vision Transformer, [Paper], [Code]
  • (arXiv 2022.06) EdgeNeXt: Efficiently Amalgamated CNN-Transformer Architecture for Mobile Vision Applications, [Paper], [Code]
  • (arXiv 2022.06) Global Context Vision Transformers, [Paper], [Code]
  • (arXiv 2022.06) EATFormer: Improving Vision Transformer Inspired by Evolutionary Algorithm, [Paper], [Code]
  • (arXiv 2022.06) A Unified and Biologically-Plausible Relational Graph Representation of Vision Transformers, [Paper]
  • (arXiv 2022.06) Robustifying Vision Transformer without Retraining from Scratch by Test-Time Class-Conditional Feature Alignment, [Paper], [Code]
  • (arXiv 2022.06) Continual Learning with Transformers for Image Classification, [Paper]
  • (arXiv 2022.07) Visual Transformer Meets CutMix for Improved Accuracy, Communication Efficiency, and Data Privacy in Split Learning, [Paper]
  • (arXiv 2022.07) Rethinking Query-Key Pairwise Interactions in Vision Transformers, [Paper]
  • (arXiv 2022.07) Dynamic Spatial Sparsification for Efficient Vision Transformers and Convolutional Neural Networks, [Paper], [Code]
  • (arXiv 2022.07) Softmax-free Linear Transformers, [Paper], [Code]
  • (arXiv 2022.07) MaiT: Leverage Attention Masks for More Efficient Image Transformers, [Paper]
  • (arXiv 2022.07) Dual Vision Transformer, [Paper], [Code]
  • (arXiv 2022.07) Wave-ViT: Unifying Wavelet and Transformers for Visual Representation Learning, [Paper], [Code]
  • (arXiv 2022.07) Horizontal and Vertical Attention in Transformers, [Paper]
  • (arXiv 2022.07) LightViT: Towards Light-Weight Convolution-Free Vision Transformers, [Paper], [Code]
  • (arXiv 2022.07) Next-ViT: Next Generation Vision Transformer for Efficient Deployment in Realistic Industrial Scenarios, [Paper]
  • (arXiv 2022.07) Image and Model Transformation with Secret Key for Vision Transformer, [Paper]
  • (arXiv 2022.07) Convolutional Bypasses Are Better Vision Transformer Adapters, [Paper]
  • (arXiv 2022.07) Lightweight Vision Transformer with Cross Feature Attention, [Paper]
  • (arXiv 2022.07) Multi-manifold Attention for Vision Transformers, [Paper]
  • (arXiv 2022.07) TokenMix: Rethinking Image Mixing for Data Augmentation in Vision Transformers, [Paper], [Code]
  • (arXiv 2022.07) Locality Guidance for Improving Vision Transformers on Tiny Datasets, [Paper], [Code]
  • (arXiv 2022.07) TinyViT: Fast Pretraining Distillation for Small Vision Transformers, [Paper], [Code]
  • (arXiv 2022.07) Jigsaw-ViT: Learning Jigsaw Puzzles in Vision Transformer, [Paper], [Code]
  • (arXiv 2022.07) An Impartial Take to the CNN vs Transformer Robustness Contest, [Paper]
  • (arXiv 2022.07) Pro-tuning: Unified Prompt Tuning for Vision Tasks, [Paper]
  • (arXiv 2022.08) Semi-supervised Vision Transformers at Scale, [Paper]
  • (arXiv 2022.08) BEiT v2: Masked Image Modeling with Vector-Quantized Visual Tokenizers, [Paper], [Code]
  • (arXiv 2022.08) Accelerating Vision Transformer Training via a Patch Sampling Schedule, [Paper], [Code]
  • (arXiv 2022.08) ProtoPFormer: Concentrating on Prototypical Parts in Vision Transformers for Interpretable Image Recognition, [Paper], [Code]
  • (arXiv 2022.08) FocusFormer: Focusing on What We Need via Architecture Sampler, [Paper]
  • (arXiv 2022.08) gSwin: Gated MLP Vision Model with Hierarchical Structure of Shifted Window, [Paper]
  • (arXiv 2022.08) Video Mobile-Former: Video Recognition with Efficient Global Spatial-temporal Modeling, [Paper]
  • (arXiv 2022.08) ClusTR: Exploring Efficient Self-attention via Clustering for Vision Transformers, [Paper]
  • (arXiv 2022.09) MAFormer: A Transformer Network with Multi-scale Attention Fusion for Visual Recognition, [Paper]
  • (arXiv 2022.09) A Light Recipe to Train Robust Vision Transformers, [Paper], [Code]
  • (arXiv 2022.09) ConvFormer: Closing the Gap Between CNN and Vision Transformers, [Paper], [Code]
  • (arXiv 2022.09) Axially Expanded Windows for Local-Global Interaction in Vision Transformers, [Paper]
  • (arXiv 2022.09) Adaptive Sparse ViT: Towards Learnable Adaptive Token Pruning by Fully Exploiting Self-Attention, [Paper]
  • (arXiv 2022.09) Effective Vision Transformer Training: A Data-Centric Perspective, [Paper]
  • (arXiv 2022.09) Dilated Neighborhood Attention Transformer, [Paper], [Code]
  • (arXiv 2022.10) MobileViTv3: Mobile-Friendly Vision Transformer with Simple and Effective Fusion of Local, Global and Input Features, [Paper], [Code]
  • (arXiv 2022.10) Fast-ParC: Position Aware Global Kernel for ConvNets and ViTs, [Paper]
  • (arXiv 2022.10) Strong Gravitational Lensing Parameter Estimation with Vision Transformer, [Paper], [Code]
  • (arXiv 2022.10) Token-Label Alignment for Vision Transformers, [Paper], [Code]
  • (arXiv 2022.10) Bridging the Gap Between Vision Transformers and Convolutional Neural Networks on Small Datasets, [Paper], [Code]
  • (arXiv 2022.10) Prompt Generation Networks for Efficient Adaptation of Frozen Vision Transformers, [Paper], [Code]
  • (arXiv 2022.10) Large Models are Parsimonious Learners: Activation Sparsity in Trained Transformers, [Paper]
  • (arXiv 2022.10) Curved Representation Space of Vision Transformers, [Paper]
  • (arXiv 2022.10) How to Train Vision Transformer on Small-scale Datasets, [Paper], [Code]
  • (arXiv 2022.10) Vision Transformer Visualization: What Neurons Tell and How Neurons Behave, [Paper], [Code]
  • (arXiv 2022.10) When Adversarial Training Meets Vision Transformers: Recipes from Training to Architecture, [Paper], [Code]
  • (arXiv 2022.10) Vision Transformers provably learn spatial structure, [Paper]
  • (arXiv 2022.10) Scratching Visual Transformer's Back with Uniform Attention, [Paper]
  • (arXiv 2022.10) Token Merging: Your ViT But Faster, [Paper], [Code]
  • (arXiv 2022.10) Accumulated Trivial Attention Matters in Vision Transformers on Small Datasets, [Paper], [Code]
  • (arXiv 2022.10) MetaFormer Baselines for Vision, [Paper]
  • (arXiv 2022.10) Learning Explicit Object-Centric Representations with Vision Transformers, [Paper]
  • (arXiv 2022.10) Explicitly Increasing Input Information Density for Vision Transformers on Small Datasets, [Paper], [Code]
  • (arXiv 2022.10) Grafting Vision Transformers, [Paper]
  • (arXiv 2022.10) Differentially Private CutMix for Split Learning with Vision Transformer, [Paper]
  • (arXiv 2022.10) ViT-LSLA: Vision Transformer with Light Self-Limited-Attention, [Paper]
  • (arXiv 2022.11) Rethinking Hierarchicies in Pre-trained Plain Vision Transformer, [Paper], [Code]
  • (arXiv 2022.11) The Lottery Ticket Hypothesis for Vision Transformers, [Paper]
  • (arXiv 2022.11) ViT-CX: Causal Explanation of Vision Transformers, [Paper]
  • (arXiv 2022.11) ViTALiTy: Unifying Low-rank and Sparse Approximation for Vision Transformer Acceleration with a Linear Taylor Attention, [Paper]
  • (arXiv 2022.11) Training a Vision Transformer from scratch in less than 24 hours with 1 GPU, [Paper], [Code]
  • (arXiv 2022.11) Demystify Transformers & Convolutions in Modern Image Deep Networks, [Paper], [Code]
  • (arXiv 2022.11) Token Transformer: Can class token help window-based transformer build better long-range interactions, [Paper]
  • (arXiv 2022.11) CabViT: Cross Attention among Blocks for Vision Transformer, [Paper], [Code]
  • (arXiv 2022.11) BiViT: Extremely Compressed Binary Vision Transformer, [Paper], [Code]
  • (arXiv 2022.11) HeatViT: Hardware-Efficient Adaptive Token Pruning for Vision Transformers, [Paper]
  • (arXiv 2022.11) Vision Transformer with Super Token Sampling, [Paper], [Code]
  • (arXiv 2022.11) Castling-ViT: Compressing Self-Attention via Switching Towards Linear-Angular Attention During Vision Transformer Inference, [Paper]
  • (arXiv 2022.11) Conv2Former: A Simple Transformer-Style ConvNet for Visual Recognition, [Paper]
  • (arXiv 2022.11) TranViT: An Integrated Vision Transformer Framework for Discrete Transit Travel Time Range Prediction, [Paper]
  • (arXiv 2022.11) Gated Class-Attention with Cascaded Feature Drift Compensation for Exemplar-free Continual Learning of Vision Transformers, [Paper], [Code]
  • (arXiv 2022.11) Data Augmentation Vision Transformer for Fine-grained Image Classification, [Paper]
  • (arXiv 2022.11) Integrally Pre-Trained Transformer Pyramid Networks, [Paper], [Code]
  • (arXiv 2022.11) Explanation on Pretraining Bias of Finetuned Vision Transformer, [Paper]
  • (arXiv 2022.11) Adaptive Attention Link-based Regularization for Vision Transformers, [Paper]
  • (arXiv 2022.11) Semantic-Aware Local-Global Vision Transformer, [Paper]
  • (arXiv 2022.11) Pattern Attention Transformer with Doughnut Kernel, [Paper]
  • (arXiv 2022.11) ResFormer: Scaling ViTs with Multi-Resolution Training, [Paper]
  • (arXiv 2022.12) Teaching Matters: Investigating the Role of Supervision in Vision Transformers, [Paper], [Code]
  • (arXiv 2022.12) Group Generalized Mean Pooling for Vision Transformer, [Paper]
  • (arXiv 2022.12) OAMixer: Object-aware Mixing Layer for Vision Transformers, [Paper], [Code]
  • (arXiv 2022.12) What do Vision Transformers Learn? A Visual Exploration, [Paper]
  • (arXiv 2022.12) GPViT: A High Resolution Non-Hierarchical Vision Transformer with Group Propagation, [Paper], [Code]
  • (arXiv 2022.12) FlexiViT: One Model for All Patch Sizes, [Paper], [Code]
  • (arXiv 2022.12) Rethinking Vision Transformers for MobileNet Size and Speed, [Paper], [Code]
  • (arXiv 2022.12) Rethinking Cooking State Recognition with Vision Transformers, [Paper]
  • (arXiv 2022.12) What Makes for Good Tokenizers in Vision Transformer, [Paper]
  • (arXiv 2022.12) Local Learning on Transformers via Feature Reconstruction, [Paper]
  • (arXiv 2022.12) Exploring Transformer Backbones for Image Diffusion Models, [Paper]
  • (arXiv 2023.01) TinyMIM: An Empirical Study of Distilling MIM Pre-trained Models, [Paper], [Code]
  • (arXiv 2023.01) Semi-MAE: Masked Autoencoders for Semi-supervised Vision Transformers, [Paper]
  • (arXiv 2023.01) Skip-Attention: Improving Vision Transformers by Paying Less Attention, [Paper]
  • (arXiv 2023.01) Dynamic Grained Encoder for Vision Transformers, [Paper], [Code]
  • (arXiv 2023.01) Image Memorability Prediction with Vision Transformers, [Paper]
  • (arXiv 2023.01) Holistically Explainable Vision Transformers, [Paper]
  • (arXiv 2023.02) DilateFormer: Multi-Scale Dilated Transformer for Visual Recognition, [Paper], [Code]
  • (arXiv 2023.02) KDEformer: Accelerating Transformers via Kernel Density Estimation, [Paper], [Code]
  • (arXiv 2023.02) Reversible Vision Transformers, [Paper], [Code]
  • (arXiv 2023.02) TFormer: A Transmission-Friendly ViT Model for IoT Devices, [Paper]
  • (arXiv 2023.02) Efficiency 360: Efficient Vision Transformers, [Paper]
  • (arXiv 2023.02) ViTA: A Vision Transformer Inference Accelerator for Edge Applications, [Paper]
  • (arXiv 2023.02) CertViT: Certified Robustness of Pre-Trained Vision Transformers, [Paper], [Code]
  • (arXiv 2023.03) Visual Atoms: Pre-training Vision Transformers with Sinusoidal Waves, [Paper], [Code]
  • (arXiv 2023.03) Data-Efficient Training of CNNs and Transformers with Coresets: A Stability Perspective, [Paper], [Code]
  • (arXiv 2023.03) A Fast Training-Free Compression Framework for Vision Transformers, [Paper], [Code]
  • (arXiv 2023.03) FFT-based Dynamic Token Mixer for Vision, [Paper], [Code]
  • (arXiv 2023.03) Can We Scale Transformers to Predict Parameters of Diverse ImageNet Models, [Paper], [Code]
  • (arXiv 2023.03) X-Pruner: eXplainable Pruning for Vision Transformers, [Paper]
  • (arXiv 2023.03) CrossFormer++: A Versatile Vision Transformer Hinging on Cross-scale Attention, [Paper], [Code]
  • (arXiv 2023.03) Stabilizing Transformer Training by Preventing Attention Entropy Collapse, [Paper]
  • (arXiv 2023.03) Making Vision Transformers Efficient from A Token Sparsification View, [Paper]
  • (arXiv 2023.03) BiFormer: Vision Transformer with Bi-Level Routing Attention, [Paper], [Code]
  • (arXiv 2023.03) ElasticViT: Conflict-aware Supernet Training for Deploying Fast Vision Transformer on Diverse Mobile Devices, [Paper]
  • (arXiv 2023.03) Robustifying Token Attention for Vision Transformers, [Paper]
  • (arXiv 2023.03) FastViT: A Fast Hybrid Vision Transformer using Structural Reparameterization, [Paper]
  • (arXiv 2023.03) Sparsifiner: Learning Sparse Instance-Dependent Attention for Efficient Vision Transformers, [Paper]
  • (arXiv 2023.03) How Does Attention Work in Vision Transformers? A Visual Analytics Attempt, [Paper]
  • (arXiv 2023.03) SwiftFormer: Efficient Additive Attention for Transformer-based Real-time Mobile Vision Applications, [Paper], [Code]
  • (arXiv 2023.03) Vision Transformer with Quadrangle Attention, [Paper], [Code]
  • (arXiv 2023.04) LaCViT: A Label-aware Contrastive Training Framework for Vision Transformers, [Paper]
  • (arXiv 2023.04) Rethinking Local Perception in Lightweight Vision Transformer, [Paper]
  • (arXiv 2023.04) Vision Transformers with Mixed-Resolution Tokenization, [Paper], [Code]
  • (arXiv 2023.04) Visual Dependency Transformers: Dependency Tree Emerges from Reversed Attention, [Paper], [Code]
  • (arXiv 2023.04) PSLT: A Light-weight Vision Transformer with Ladder Self-Attention and Progressive Shift, [Paper], [Code]
  • (arXiv 2023.04) SparseFormer: Sparse Visual Recognition via Limited Latent Tokens, [Paper], [Code]
  • (arXiv 2023.04) ViT-Calibrator: Decision Stream Calibration for Vision Transformer, [Paper]
  • (arXiv 2023.04) Slide-Transformer: Hierarchical Vision Transformer with Local Self-Attention, [Paper], [Code]
  • (arXiv 2023.04) Life Regression based Patch Slimming for Vision Transformers, [Paper]
  • (arXiv 2023.04) RIFormer: Keep Your Vision Backbone Effective While Removing Token Mixer, [Paper], [Code]
  • (arXiv 2023.04) SpectFormer: Frequency and Attention is what you need in a Vision Transformer, [Paper], [Code]
  • (arXiv 2023.04) VISION DIFFMASK: Faithful Interpretation of Vision Transformers with Differentiable Patch Masking, [Paper], [Code]
  • (arXiv 2023.04) RSIR Transformer: Hierarchical Vision Transformer using Random Sampling Windows and Important Region Windows, [Paper]
  • (arXiv 2023.04) Dynamic Mobile-Former: Strengthening Dynamic Convolution with Attention and Residual Connection in Kernel Space, [Paper], [Code]
  • (arXiv 2023.04) LipsFormer: Introducing Lipschitz Continuity to Vision Transformers, [Paper], [Code]
  • (arXiv 2023.04) Joint Token Pruning and Squeezing Towards More Aggressive Compression of Vision Transformers, [Paper], [Code]
  • (arXiv 2023.04) MixPro: Data Augmentation with MaskMix and Progressive Attention Labeling for Vision Transformer, [Paper], [Code]
  • (arXiv 2023.04) Vision Conformer: Incorporating Convolutions into Vision Transformer Layers, [Paper]
  • (arXiv 2023.05) Instruction-ViT: Multi-Modal Prompts for Instruction Learning in ViT, [Paper]
  • (arXiv 2023.05) MMViT: Multiscale Multiview Vision Transformers, [Paper]
  • (arXiv 2023.05) AxWin Transformer: A Context-Aware Vision Transformer Backbone with Axial Windows, [Paper]
  • (arXiv 2023.05) Understanding Gaussian Attention Bias of Vision Transformers Using Effective Receptive Fields, [Paper]
  • (arXiv 2023.05) EfficientViT: Memory Efficient Vision Transformer with Cascaded Group Attention, [Paper], [Code]
  • (arXiv 2023.05) GSB: Group Superposition Binarization for Vision Transformer with Limited Training Samples, [Paper]
  • (arXiv 2023.05) Enhancing Performance of Vision Transformers on Small Datasets through Local Inductive Bias Incorporation, [Paper]
  • (arXiv 2023.05) CageViT: Convolutional Activation Guided Efficient Vision Transformer, [Paper]
  • (arXiv 2023.05) Getting ViT in Shape: Scaling Laws for Compute-Optimal Model Design, [Paper]
  • (arXiv 2023.05) Predicting Token Impact Towards Efficient Vision Transformer, [Paper]
  • (arXiv 2023.05) Dual Path Transformer with Partition Attention, [Paper]
  • (arXiv 2023.05) BinaryViT: Towards Efficient and Accurate Binary Vision Transformers, [Paper]
  • (arXiv 2023.05) Making Vision Transformers Truly Shift-Equivariant, [Paper]
  • (arXiv 2023.05) Concept-Centric Transformers: Concept Transformers with Object-Centric Concept Learning for Interpretability, [Paper], [Code]
  • (arXiv 2023.05) DiffRate : Differentiable Compression Rate for Efficient Vision Transformers, [Paper], [Code]
  • (arXiv 2023.06) Lightweight Vision Transformer with Bidirectional Interaction, [Paper], [Code]
  • (arXiv 2023.06) Hiera: A Hierarchical Vision Transformer without the Bells-and-Whistles, [Paper], [Code]
  • (arXiv 2023.06) Bytes Are All You Need: Transformers Operating Directly On File Bytes, [Paper], [Code]
  • (arXiv 2023.06) Muti-Scale And Token Mergence: Make Your ViT More Efficient, [Paper]
  • (arXiv 2023.06) FasterViT: Fast Vision Transformers with Hierarchical Attention, [Paper], [Code]
  • (arXiv 2023.06) E(2)-Equivariant Vision Transformer, [Paper], [Code]
  • (arXiv 2023.06) 2-D SSM: A General Spatial Layer for Visual Transformers, [Paper], [Code]
  • (arXiv 2023.06) Mitigating Transformer Overconfidence via Lipschitz Regularization, [Paper], [Code]
  • (arXiv 2023.06) Reviving Shift Equivariance in Vision Transformers, [Paper]
  • (arXiv 2023.06) Learning to Mask and Permute Visual Tokens for Vision Transformer Pre-Training, [Paper], [Code]
  • (arXiv 2023.06) Fast Training of Diffusion Models with Masked Transformers, [Paper], [Code]
  • (arXiv 2023.06) RaViTT: Random Vision Transformer Tokens, [Paper]
  • (arXiv 2023.06) Vision Transformer with Attention Map Hallucination and FFN Compaction, [Paper]
  • (arXiv 2023.06) Quantizable Transformers: Removing Outliers by Helping Attention Heads Do Nothing, [Paper]
  • (arXiv 2023.06) Swin-Free: Achieving Better Cross-Window Attention and Efficiency with Size-varying Window, [Paper]
  • (arXiv 2023.06) BinaryViT: Pushing Binary Vision Transformers Towards Convolutional Models, [Paper]
  • (arXiv 2023.06) Hardwiring ViT Patch Selectivity into CNNs using Patch Mixing, [Paper], [Code]
  • (arXiv 2023.07) Stitched ViTs are Flexible Vision Backbones, [Paper], [Code]
  • (arXiv 2023.07) MSViT: Dynamic Mixed-Scale Tokenization for Vision Transformers, [Paper], [Code]
  • (arXiv 2023.07) Make A Long Image Short: Adaptive Token Length for Vision Transformers, [Paper]
  • (arXiv 2023.07) Art Authentication with Vision Transformers, [Paper]
  • (arXiv 2023.07) Patch n' Pack: NaViT, a Vision Transformer for any Aspect Ratio and Resolution, [Paper]
  • (arXiv 2023.07) What Happens During Finetuning of Vision Transformers: An Invariance Based Investigation, [Paper]
  • (arXiv 2023.07) Scale-Aware Modulation Meet Transformer, [Paper], [Code]
  • (arXiv 2023.07) RepViT: Revisiting Mobile CNN From ViT Perspective, [Paper], [Code]
  • (arXiv 2023.07) R-Cut: Enhancing Explainability in Vision Transformers with Relationship Weighted Out and Cut, [Paper]
  • (arXiv 2023.07) Learned Thresholds Token Merging and Pruning for Vision Transformers, [Paper]
  • (arXiv 2023.07) Sparse then Prune: Toward Efficient Vision Transformers, [Paper], [Code]
  • (arXiv 2023.07) Sparse Double Descent in Vision Transformers: real or phantom threat?, [Paper]
  • (arXiv 2023.07) Adaptive Frequency Filters As Efficient Global Token Mixers, [Paper]
  • (arXiv 2023.07) E2VPT: An Effective and Efficient Approach for Visual Prompt Tuning, [Paper], [Code]
  • (arXiv 2023.07) Pre-training Vision Transformers with Very Limited Synthesized Images, [Paper], [Code]
  • (arXiv 2023.08) LGViT: Dynamic Early Exiting for Accelerating Vision Transformer, [Paper]
  • (arXiv 2023.08) Performance Evaluation of Swin Vision Transformer Model using Gradient Accumulation Optimization Technique, [Paper]
  • (arXiv 2023.08) FLatten Transformer: Vision Transformer using Focused Linear Attention, [Paper], [Code]
  • (arXiv 2023.08) A Multidimensional Analysis of Social Biases in Vision Transformers, [Paper]
  • (arXiv 2023.08) Which Tokens to Use? Investigating Token Reduction in Vision Transformers, [Paper], [Code]
  • (arXiv 2023.08) DiT: Efficient Vision Transformers with Dynamic Token Routing, [Paper], [Code]
  • (arXiv 2023.08) Revisiting Vision Transformer from the View of Path Ensemble, [Paper]
  • (arXiv 2023.08) Patch Is Not All You Need, [Paper]
  • (arXiv 2023.08) ConcatPlexer: Additional Dim1 Batching for Faster ViTs, [Paper], [Code]
  • (arXiv 2023.08) SPANet: Frequency-balancing Token Mixer using Spectral Pooling Aggregation Modulation, [Paper], [Code]
  • (arXiv 2023.08) SG-Former: Self-guided Transformer with Evolving Token Reallocation, [Paper], [Code]
  • (arXiv 2023.08) Eventful Transformers: Leveraging Temporal Redundancy in Vision Transformers, [Paper]
  • (arXiv 2023.08) Learning Diverse Features in Vision Transformers for Improved Generalization, [Paper]
  • (arXiv 2023.09) DAT++: Spatially Dynamic Vision Transformer with Deformable Attention, [Paper], [Code]
  • (arXiv 2023.09) ExMobileViT: Lightweight Classifier Extension for Mobile Vision Transformer, [Paper]
  • (arXiv 2023.09) Mobile V-MoEs: Scaling Down Vision Transformers via Sparse Mixture-of-Experts, [Paper]
  • (arXiv 2023.09) CNN or ViT? Revisiting Vision Transformers Through the Lens of Convolution, [Paper], [Code]
  • (arXiv 2023.09) SparseSwin: Swin Transformer with Sparse Transformer Block, [Paper], [Code]
  • (arXiv 2023.09) DeViT: Decomposing Vision Transformers for Collaborative Inference in Edge Devices, [Paper]
  • (arXiv 2023.09) Keep It SimPool: Who Said Supervised Transformers Suffer from Attention Deficit, [Paper], [Code]
  • (arXiv 2023.09) Interpretability-Aware Vision Transformer, [Paper]
  • (arXiv 2023.09) Replacing softmax with ReLU in Vision Transformers, [Paper]
  • (arXiv 2023.09) Interpret Vision Transformers as ConvNets with Dynamic Convolutions, [Paper]
  • (arXiv 2023.09) RMT: Retentive Networks Meet Vision Transformers, [Paper]
  • (arXiv 2023.09) DualToken-ViT: Position-aware Efficient Vision Transformer with Dual Token Fusion, [Paper]
  • (arXiv 2023.09) Associative Transformer Is A Sparse Representation Learner, [Paper]
  • (arXiv 2023.09) Masked Image Residual Learning for Scaling Deeper Vision Transformers, [Paper]
  • (arXiv 2023.09) Efficient Low-rank Backpropagation for Vision Transformer Adaptation, [Paper]
  • (arXiv 2023.09) Channel Vision Transformers: An Image Is Worth C x 16 x 16 Words, [Paper]
  • (arXiv 2023.09) Vision Transformers Need Registers, [Paper]
  • (arXiv 2023.10) PPT: Token Pruning and Pooling for Efficient Vision Transformers, [Paper]
  • (arXiv 2023.10) Selective Feature Adapter for Dense Vision Transformers, [Paper]
  • (arXiv 2023.10) GET: Group Event Transformer for Event-Based Vision, [Paper], [Code]
  • (arXiv 2023.10) ViT-ReciproCAM: Gradient and Attention-Free Visual Explanations for Vision Transformer, [Paper]
  • (arXiv 2023.10) SlowFormer: Universal Adversarial Patch for Attack on Compute and Energy Efficiency of Inference Efficient Vision Transformers, [Paper], [Code]
  • (arXiv 2023.10) TiC: Exploring Vision Transformer in Convolution, [Paper], [Code]
  • (arXiv 2023.10) Sub-token ViT Embedding via Stochastic Resonance Transformers, [Paper]
  • (arXiv 2023.10) No Token Left Behind: Efficient Vision Transformer via Dynamic Token Idling, [Paper]
  • (arXiv 2023.10) Plug n' Play: Channel Shuffle Module for Enhancing Tiny Vision Transformers, [Paper]
  • (arXiv 2023.10) Hierarchical Side-Tuning for Vision Transformers, [Paper], [Code]
  • (arXiv 2023.10) EViT: An Eagle Vision Transformer with Bi-Fovea Self-Attention, [Paper], [Code]
  • (arXiv 2023.10) Efficient Adaptation of Large Vision Transformer via Adapter Re-Composing, [Paper], [Code]
  • (arXiv 2023.10) Accelerating Vision Transformers Based on Heterogeneous Attention Patterns, [Paper]
  • (arXiv 2023.10) MatFormer: Nested Transformer for Elastic Inference, [Paper]
  • (arXiv 2023.10) Eureka-Moments in Transformers: Multi-Step Tasks Reveal Softmax Induced Optimization Problems, [Paper]
  • (arXiv 2023.10) ConvNets Match Vision Transformers at Scale, [Paper]
  • (arXiv 2023.10) MCUFormer: Deploying Vision Tranformers on Microcontrollers with Limited Memory, [Paper], [Code]
  • (arXiv 2023.10) Analyzing Vision Transformers for Image Classification in Class Embedding Space, [Paper]
  • (arXiv 2023.11) Improving Robustness for Vision Transformer with a Simple Dynamic Scanning Augmentation, [Paper]
  • (arXiv 2023.11) Scattering Vision Transformer: Spectral Mixing Matters, [Paper], [Project]
  • (arXiv 2023.11) GQKVA: Efficient Pre-training of Transformers by Grouping Queries, Keys, and Values, [Paper]
  • (arXiv 2023.11) Mini but Mighty: Finetuning ViTs with Mini Adapters, [Paper], [Code]
  • (arXiv 2023.11) A Simple Interpretable Transformer for Fine-Grained Image Classification and Analysis, [Paper], [Code]
  • (arXiv 2023.11) SBCFormer: Lightweight Network Capable of Full-size ImageNet Classification at 1 FPS on Single Board Computers, [Paper], [Code]
  • (arXiv 2023.11) FMViT: A multiple-frequency mixing Vision Transformer, [Paper], [Code]
  • (arXiv 2023.11) Cross-Axis Transformer with 2D Rotary Embeddings, [Paper]
  • (arXiv 2023.11) Aggregate, Decompose, and Fine-Tune: A Simple Yet Effective Factor-Tuning Method for Vision Transformer, [Paper], [Code]
  • (arXiv 2023.11) Advancing Vision Transformers with Group-Mix Attention, [Paper], [Code]
  • (arXiv 2023.11) Token Recycling for Efficient Sequential Inference with Vision Transformers, [Paper]
  • (arXiv 2023.11) TransNeXt: Robust Foveal Visual Perception for Vision Transformers, [Paper]
  • (arXiv 2023.11) Stochastic Vision Transformers with Wasserstein Distance-Aware Attention, [Paper]
  • (arXiv 2023.11) Improving Faithfulness for Vision Transformers, [Paper]
  • (arXiv 2023.11) SCHEME: Scalable Channer Mixer for Vision Transformers, [Paper]
  • (arXiv 2023.12) MABViT -- Modified Attention Block Enhances Vision Transformers, [Paper]
  • (arXiv 2023.12) Class-Discriminative Attention Maps for Vision Transformers, [Paper], [Code]
  • (arXiv 2023.12) Factorization Vision Transformer: Modeling Long Range Dependency with Local Window Cost, [Paper], [Code]
  • (arXiv 2023.12) Weight Subcloning: Direct Initialization of Transformers Using Larger Pretrained Ones, [Paper]
  • (arXiv 2023.12) Cached Transformers: Improving Transformers with Differentiable Memory Cache, [Paper]
  • (arXiv 2023.12) Partial Fine-Tuning: A Successor to Full Fine-Tuning for Vision Transformers, [Paper]
  • (arXiv 2023.12) Merging Vision Transformers from Different Tasks and Domains, [Paper]
  • (arXiv 2023.12) Universal Pyramid Adversarial Training for Improved ViT Performance, [Paper]
  • (arXiv 2024.01) Token Propagation Controller for Efficient Vision Transformer, [Paper]
  • (arXiv 2024.01) Intriguing Equivalence Structures of the Embedding Space of Vision Transformers, [Paper]
  • (arXiv 2024.01) SHViT: Single-Head Vision Transformer with Memory Efficient Macro Design, [Paper]
  • (arXiv 2024.02) LF-ViT: Reducing Spatial Redundancy in Vision Transformer for Efficient Image Recognition, [Paper], [Code]
  • (arXiv 2024.02) A Manifold Representation of the Key in Vision Transformers, [Paper]
  • (arXiv 2024.02) Faster Inference of Integer SWIN Transformer by Removing the GELU Activation, [Paper]
  • (arXiv 2024.02) SpecFormer: Guarding Vision Transformer Robustness via Maximum Singular Value Penalization, [Paper]
  • (arXiv 2024.02) Pre-training of Lightweight Vision Transformers on Small Datasets with Minimally Scaled Images, [Paper]
  • (arXiv 2024.02) Multi-Attribute Vision Transformers are Efficient and Robust Learners, [Paper], [Code]
  • (arXiv 2024.02) FViT: A Focal Vision Transformer with Gabor Filter, [Paper]
  • (arXiv 2024.02) ReViT: Enhancing Vision Transformers with Attention Residual Connections for Visual Recognition, [Paper]
  • (arXiv 2024.02) Perceiving Longer Sequences With Bi-Directional Cross-Attention Transformers, [Paper]
  • (arXiv 2024.03) LUM-ViT: Learnable Under-sampling Mask Vision Transformer for Bandwidth Limited Optical Signal Acquisition, [Paper], [Code]
  • (arXiv 2024.03) NiNformer: A Network in Network Transformer with Token Mixing Generated Gating Function, [Paper]
  • (arXiv 2024.03) T-TAME: Trainable Attention Mechanism for Explaining Convolutional Networks and Vision Transformers, [Paper]
  • (arXiv 2024.03) ACC-ViT : Atrous Convolution's Comeback in Vision Transformers, [Paper]
  • (arXiv 2024.03) Scalable and Robust Transformer Decoders for Interpretable Image Classification with Foundation Models, [Paper]
  • (arXiv 2024.03) ViT-CoMer: Vision Transformer with Convolutional Multi-scale Feature Interaction for Dense Predictions, [Paper], [Code]
  • (arXiv 2024.03) Multi-criteria Token Fusion with One-step-ahead Attention for Efficient Vision Transformers, [Paper], [Code]
  • (arXiv 2024.03) HIRI-ViT: Scaling Vision Transformer with High Resolution Inputs, [Paper]
  • (arXiv 2024.03) Dynamic Tuning Towards Parameter and Inference Efficiency for ViT Adaptation, [Paper], [Code]
  • (arXiv 2024.03) Rotary Position Embedding for Vision Transformer, [Paper], [Code]
  • (arXiv 2024.03) Retina Vision Transformer (RetinaViT): Introducing Scaled Patches into Vision Transformers, [Paper]
  • (arXiv 2024.03) ParFormer: Vision Transformer Baseline with Parallel Local Global Token Mixer and Convolution Attention Patch Embedding, [Paper], [Code]
  • (arXiv 2024.03) Spectral Convolutional Transformer: Harmonizing Real vs. Complex Multi-View Spectral Operators for Vision Transformer, [Paper], [Code]
  • (arXiv 2024.03) Low-Rank Rescaled Vision Transformer Fine-Tuning: A Residual Design Approach, [Paper], [Code]
  • (arXiv 2024.03) DenseNets Reloaded: Paradigm Shift Beyond ResNets and ViTs, [Paper], [Code]
  • (arXiv 2024.03) Sine Activated Low-Rank Matrices for Parameter Efficient Learning, [Paper]
  • (arXiv 2024.03) Efficient Modulation for Vision Networks, [Paper], [Code]
  • (arXiv 2024.04) Structured Initialization for Attention in Vision Transformers, [Paper], [Code]
  • (arXiv 2024.04) A General and Efficient Training for Transformer via Token Expansion, [Paper], [Code]
  • (arXiv 2024.04) DeiT-LT: Distillation Strikes Back for Vision Transformer Training on Long-Tailed Datasets, [Paper], [Code]
  • (arXiv 2024.04) LeGrad: An Explainability Method for Vision Transformers via Feature Formation Sensitivity, [Paper], [Code]
  • (arXiv 2024.04) Learning Correlation Structures for Vision Transformers, [Paper], [Code]
  • (arXiv 2024.04) HSViT: Horizontally Scalable Vision Transformer, [Paper], [Code]
  • (arXiv 2024.04) MLP Can Be A Good Transformer Learner, [Paper], [Code]
  • (arXiv 2024.04) Observation, Analysis, and Solution: Exploring Strong Lightweight Vision Transformers via Masked Image Modeling Pre-Training, [Paper], [Code]
  • (arXiv 2024.04) Nested-TNT: Hierarchical Vision Transformers with Multi-Scale Feature Processing, [Paper]
  • (arXiv 2024.04) SPARO: Selective Attention for Robust and Compositional Transformer Encodings for Vision, [Paper], [Code]
  • (arXiv 2024.05) SLAB: Efficient Transformers with Simplified Linear Attention and Progressive Re-parameterized Batch Normalization, [Paper], [Code], [Code]
  • (arXiv 2024.05) Block Selective Reprogramming for On-device Training of Vision Transformers, [Paper]
  • (arXiv 2024.05) Sparse-Tuning: Adapting Vision Transformers with Efficient Fine-tuning and Inference, [Paper], [Code]
  • (arXiv 2024.05) TerDiT: Ternary Diffusion Models with Transformers, [Paper], [Code]
  • (arXiv 2024.05) LookHere: Vision Transformers with Directed Attention Generalize and Extrapolate, [Paper], [Code]
  • (arXiv 2024.05) DCT-Based Decorrelated Attention for Vision Transformers, [Paper]
  • (arXiv 2024.05) Configuring Data Augmentations to Reduce Variance Shift in Positional Embedding of Vision Transformers, [Paper]
  • (arXiv 2024.05) Vision Transformer with Sparse Scan Prior, [Paper], [Code]
  • (arXiv 2024.05) Semantic Equitable Clustering: A Simple, Fast and Effective Strategy for Vision Transformer, [Paper], [Code]
  • (arXiv 2024.05) Dissecting Query-Key Interaction in Vision Transformers, [Paper]
  • (arXiv 2024.05) MSPE: Multi-Scale Patch Embedding Prompts Vision Transformers to Any Resolution, [Paper]
  • (arXiv 2024.05) Wavelet-Based Image Tokenizer for Vision Transformers, [Paper]
  • (arXiv 2024.06) You Only Need Less Attention at Each Stage in Vision Transformers, [Paper]
  • (arXiv 2024.06) An Image is Worth More Than 16x16 Patches: Exploring Transformers on Individual Pixels, [Paper]
  • (arXiv 2024.06) Fusion of regional and sparse attention in Vision Transformers, [Paper]
  • (arXiv 2024.06) Inpainting the Gaps: A Novel Framework for Evaluating Explanation Methods in Vision Transformers, [Paper]
  • (arXiv 2024.06) PEANO-ViT: Power-Efficient Approximations of Non-Linearities in Vision Transformers, [Paper]
  • (arXiv 2024.06) A Primal-Dual Framework for Transformers and Neural Networks, [Paper]
  • (arXiv 2024.06) CTRL-F: Pairing Convolution with Transformer for Image Classification via Multi-Level Feature Cross-Attention and Representation Learning Fusion, [Paper],[Code]
  • (arXiv 2024.07) MambaVision: A Hybrid Mamba-Transformer Vision Backbone, [Paper],[Code]
  • (arXiv 2024.07) Global-Local Similarity for Efficient Fine-Grained Image Recognition with Vision Transformers, [Paper],[Code]
  • (arXiv 2024.07) LookupViT: Compressing visual information to a limited number of tokens, [Paper]
  • (arXiv 2024.07) PADRe: A Unifying Polynomial Attention Drop-in Replacement for Efficient Vision Transformer, [Paper]
  • (arXiv 2024.07) DuoFormer: Leveraging Hierarchical Visual Representations by Local and Global Attention, [Paper]
  • (arXiv 2024.07) Towards Robust Vision Transformer via Masked Adaptive Ensemble, [Paper]
  • (arXiv 2024.07) Efficient Visual Transformer by Learnable Token Merging, [Paper],[Code]
  • (arXiv 2024.07) Depth-Wise Convolutions in Vision Transformers for Efficient Training on Small Datasets, [Paper],[Code]
  • (arXiv 2024.08) CAS-ViT: Convolutional Additive Self-attention Vision Transformers for Efficient Mobile Applications, [Paper],[Code]
  • (arXiv 2024.08) A Spitting Image: Modular Superpixel Tokenization in Vision Transformers, [Paper],[Code]
  • (arXiv 2024.08) Token Compensator: Altering Inference Cost of Vision Transformer without Re-Tuning, [Paper],[Code]
  • (arXiv 2024.09) Vote&Mix: Plug-and-Play Token Reduction for Efficient Vision Transformer, [Paper]
  • (arXiv 2024.09) LowFormer: Hardware Efficient Design for Convolutional Transformer Backbones, [Paper],[Code]
  • (arXiv 2024.09) Brain-Inspired Stepwise Patch Merging for Vision Transformers, [Paper]
  • (arXiv 2024.09) SparX: A Sparse Cross-Layer Connection Mechanism for Hierarchical Vision Mamba and Transformer Networks, [Paper],[Code]
  • (arXiv 2024.09) ELSA: Exploiting Layer-wise N:M Sparsity for Vision Transformer Acceleration, [Paper]
  • (arXiv 2024.09) Kolmogorov–Arnold Transformer, [Paper],[Code]
  • (arXiv 2024.09) Multiple-Exit Tuning: Towards Inference-Efficient Adaptation for Vision Transformer, [Paper]
  • (arXiv 2024.09) HydraViT: Stacking Heads for a Scalable ViT, [Paper],[Code]
  • (arXiv 2024.10) MAP: Unleashing Hybrid Mamba-Transformer Vision Backbone's Potential with Masked Autoregressive Pretraining, [Paper]
  • (arXiv 2024.10) PredFormer: Transformers Are Effective Spatial-Temporal Predictive Learners, [Paper],[Code]
  • (arXiv 2024.10) DeBiFormer: Vision Transformer with Deformable Agent Bi-level Routing Attention, [Paper],[Code]
  • (arXiv 2024.10) Improving Vision Transformers by Overlapping Heads in Multi-Head Self-Attention, [Paper]
  • (arXiv 2024.10) Efficient Adaptation of Pre-trained Vision Transformer via Householder Transformation, [Paper]
  • (arXiv 2024.10) Context-Aware Token Selection and Packing for Enhanced Vision Transformer, [Paper]
  • (arXiv 2024.11) IO Transformer: Evaluating SwinV2-Based Reward Models for Computer Vision, [Paper]
  • (arXiv 2024.11) SAG-ViT: A Scale-Aware, High-Fidelity Patching Approach with Graph Attention for Vision Transformers, [Paper]
  • (arXiv 2024.11) On the Surprising Effectiveness of Attention Transfer for Vision Transformers, [Paper],[Code]
  • (arXiv 2024.11) CARE Transformer: Mobile-Friendly Linear Visual Transformer via Decoupled Dual Interaction, [Paper]
  • (arXiv 2024.11) UniForm: A Reuse Attention Mechanism Optimized for Efficient Vision Transformers on Edge Devices, [Paper]
  • (arXiv 2024.12) Token Cropr: Faster ViTs for Quite a Few Tasks, [Paper]
  • (arXiv 2024.12) Enhancing Parameter-Efficient Fine-Tuning of Vision Transformers through Frequency-Based Adaptation, [Paper],[Code]
  • (arXiv 2024.12) Slicing Vision Transformer for Flexible Inference, [Paper],[Code]
  • (arXiv 2024.12) Superpixel Tokenization for Vision Transformers: Preserving Semantic Integrity in Visual Tokens, [Paper],[Code]
  • (arXiv 2024.12) Beyond Scalars: Concept-Based Alignment Analysis in Vision Transformers, [Paper],[Code]
  • (arXiv 2024.12) Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers, [Paper],[Code]
  • (arXiv 2025.01) SAFER: Sharpness Aware layer-selective Finetuning for Enhanced Robustness in vision transformers, [Paper]
  • (arXiv 2025.01) MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets, [Paper]
  • (arXiv 2025.01) PROMPT-CAM: A Simpler Interpretable Transformer for Fine-Grained Analysis, [Paper]
  • (arXiv 2025.01) The Linear Attention Resurrection in Vision Transformer, [Paper],[Code]
  • (arXiv 2025.01) PolaFormer: Polarity-aware Linear Attention for Vision Transformers, [Paper]
  • (arXiv 2025.02) Contrastive Forward-Forward: A Training Algorithm of Vision Transformer, [Paper],[Code]
  • (arXiv 2025.02) MicroViT: A Vision Transformer with Low Complexity Self Attention for Edge Device, [Paper],[Code]
  • (arXiv 2025.02) Simpler Fast Vision Transformers with a Jumbo CLS Token, [Paper]
  • (arXiv 2025.03) ViKANformer: Embedding Kolmogorov Arnold Networks in Vision Transformers for Pattern-Based Learning, [Paper]
  • (arXiv 2025.03) SAC-ViT: Semantic-Aware Clustering Vision Transformer with Early Exit, [Paper]
  • (arXiv 2025.03) Split Adaptation for Pre-trained Vision Transformers, [Paper]
  • (arXiv 2025.03) BHViT: Binarized Hybrid Vision Transformer, [Paper]
  • (arXiv 2025.03) Simple Self Organizing Map with Visual Transformer, [Paper]
  • (arXiv 2025.03) Discovering Influential Neuron Path in Vision Transformers, [Paper]
  • (arXiv 2025.03) ForAug: Recombining Foregrounds and Backgrounds to Improve Vision Transformer Training with Bias Mitigation, [Paper]
  • (arXiv 2025.03) Isolated Channel Vision Transformers: From Single-Channel Pretraining to Multi-Channel Finetuning, [Paper],[Code]
  • (arXiv 2025.03) Kolmogorov-Arnold Attention: Is Learnable Attention Better For Vision Transformers, [Paper],[Code]
  • (arXiv 2025.03) APLA: A Simple Adaptation Method for Vision Transformers, [Paper],[Code]
  • (arXiv 2025.03) Scaling Semantic Categories: Investigating the Impact on Vision Transformer Labeling Performance, [Paper]
  • (arXiv 2025.03) Improving Adversarial Transferability on Vision Transformers via Forward Propagation Refinement, [Paper],[Code]
  • (arXiv 2025.03) Dynamic Accumulated Attention Map for Interpreting Evolution of Decision-Making in Vision Transformer, [Paper],[Code]
  • (arXiv 2025.03) Exploring the Limits of KV Cache Compression in Visual Autoregressive Transformers, [Paper]
  • (arXiv 2025.03) Serial Low-rank Adaptation of Vision Transformer, [Paper]
  • (arXiv 2025.03) Improved Ear Verification with Vision Transformers and Overlapping Patches, [Paper]
  • (arXiv 2025.03) Efficient Token Compression for Vision Transformer with Spatial Information Preserved, [Paper],[Code]
  • (arXiv 2025.04) HQViT: Hybrid Quantum Vision Transformer for Image Classification, [Paper]
  • (arXiv 2025.04) A Sensorimotor Vision Transformer, [Paper]
  • (arXiv 2025.04) Spline-based Transformers, [Paper]
  • (arXiv 2025.04) EDIT: Enhancing Vision Transformers by Mitigating Attention Sink through an Encoder-Decoder Architecture, [Paper]
  • (arXiv 2025.04) CAT: Circular-Convolutional Attention for Sub-Quadratic Transformers, [Paper]
  • (arXiv 2025.04) ECViT: Efficient Convolutional Vision Transformer with Local-Attention and Multi-scale Stages, [Paper]
  • (arXiv 2025.04) LOOPE: Learnable Optimal Patch Order in Positional Embeddings for Vision Transformers, [Paper]
  • (arXiv 2025.04) RoPETR: Improving Temporal Camera-Only 3D Detection by Integrating Enhanced Rotary Position Embedding, [Paper]
  • (arXiv 2025.04) HMPE:HeatMap Embedding for Efficient Transformer-Based Small Object Detection, [Paper]
  • (arXiv 2025.04) Decoding Vision Transformers: the Diffusion Steering Lens, [Paper]
  • (arXiv 2025.04) ECViT: Efficient Convolutional Vision Transformer with Local-Attention and Multi-scale Stages, [Paper]
  • (arXiv 2025.04) LOOPE: Learnable Optimal Patch Order in Positional Embeddings for Vision Transformers, [Paper]
  • (arXiv 2025.04) GMAR: Gradient-Driven Multi-Head Attention Rollout for Vision Transformer Interpretability, [Paper]
  • (arXiv 2025.05) Hyb-KAN ViT: Hybrid Kolmogorov-Arnold Networks Augmented Vision Transformer, [Paper]
  • (arXiv 2025.05) Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification, [Paper]
  • (arXiv 2025.05) End-to-End Vision Tokenizer Tuning, [Paper]
  • (arXiv 2025.05) Image Recognition with Online Lightweight Vision Transformer: A Survey, [Paper]
  • (arXiv 2025.06) S2AFormer: Strip Self-Attention for Efficient Vision Transformer, [Paper]
  • (arXiv 2025.06) Is Attention Required for Transformer Inference? Explore Function-preserving Attention Replacement, [Paper]
  • (arXiv 2025.06) Enhancing Vision Transformer Explainability Using Artificial Astrocytes, [Paper]
  • (arXiv 2025.06) Frequency-Adaptive Discrete Cosine-ViT-ResNet Architecture for Sparse-Data Vision, [Paper]
  • (arXiv 2025.06) DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers, [Paper]
  • (arXiv 2025.06) Taming Transformer Without Using Learning Rate Warmup, [Paper]
  • (arXiv 2025.06) RePaViT: Scalable Vision Transformer Acceleration via Structural Reparameterization on Feedforward Network Layers, [Paper],[Code]
  • (arXiv 2025.06) Speed-up of Vision Transformer Models by Attention-aware Token Filtering, [Paper]
  • (arXiv 2025.06) ViTNF: Leveraging Neural Fields to Boost Vision Transformers in Generalized Category Discovery, [Paper]
  • (arXiv 2025.06) PerFormer: A Permutation Based Vision Transformer for Remaining Useful Life Prediction, [Paper]
  • (arXiv 2025.06) Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration, [Paper]
  • (arXiv 2025.06) DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer, [Paper],[Code]
  • (arXiv 2025.06) SeqPE: Transformer with Sequential Position Encoding, [Paper],[Code]
  • (arXiv 2025.06) Focus Your Attention: Towards Data-Intuitive Lightweight Vision Transformers, [Paper],[Code]
  • (arXiv 2025.06) Low-latency vision transformers via large-scale multi-head attention, [Paper]
  • (arXiv 2025.06) GViT: Representing Images as Gaussians for Visual Recognition, [Paper]
  • (arXiv 2025.07) ThinkingViT: Matryoshka Thinking Vision Transformer for Elastic Inference, [Paper],[Code]
  • (arXiv 2025.07) Block-based Symmetric Pruning and Fusion for Efficient Vision Transformers, [Paper]
  • (arXiv 2025.07) Compact Vision Transformer by Reduction of Kernel Complexity, [Paper]
  • (arXiv 2025.07) ToFe: Lagged Token Freezing and Reusing for Efficient Vision Transformer Inference, [Paper]
  • (arXiv 2025.07) Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers, [Paper]
  • (arXiv 2025.07) Iwin Transformer: Hierarchical Vision Transformer using Interleaved Windows, [Paper],[Code]
  • (arXiv 2025.07) DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD, [Paper]
  • (arXiv 2025.07) EA-ViT: Efficient Adaptation for Elastic Vision Transformer, [Paper],[Code]
  • (arXiv 2025.07) MOR-VIT: Efficient Vision Transformer with Mixture-of-Recursions, [Paper]
  • (arXiv 2025.08) CoCAViT: Compact Vision Transformer with Robust Global Coordination, [Paper]
  • (arXiv 2025.08) Calibration Attention: Instance-wise Temperature Scaling for Vision Transformers, [Paper],[Code]
  • (arXiv 2025.08) Exploiting Layer Normalization Fine-tuning in Visual Transformer Foundation Models for Classification, [Paper]
  • (arXiv 2025.08) Learning Spatial Decay for Vision Transformers, [Paper]
  • (arXiv 2025.09) Adaptive Token Merging for Efficient Transformer Semantic Communication at the Edge, [Paper]
  • (arXiv 2025.09) Enhancing Transformer-Based Vision Models: Addressing Feature Map Anomalies Through Novel Optimization Strategies, [Paper]
  • (arXiv 2025.10) Accelerating Vision Transformers with Adaptive Patch Sizes, [Paper],[Code]
  • (arXiv 2025.10) Ensembling Pruned Attention Heads For Uncertainty-Aware Efficient Transformers, [Paper]