pose.md

October 23, 2025 ยท View on GitHub

Pose

  • (arXiv 2020.12) End-to-End Human Pose and Mesh Reconstruction with Transformers, [Paper]
  • (arXiv 2020.12) TransPose: Towards Explainable Human Pose Estimation by Transformer, [Paper]
  • (arXiv 2021.03) 3D Human Pose Estimation with Spatial and Temporal Transformers, [Paper], [Code]
  • (arXiv 2021.03) End-to-End Trainable Multi-Instance Pose Estimation with Transformers, [Paper]
  • (arXiv 2021.03) Lifting Transformer for 3D Human Pose Estimation in Video, [Paper]
  • (arXiv 2021.03) TFPose: Direct Human Pose Estimation with Transformers, [Paper]
  • (arXiv 2021.04) Pose Recognition with Cascade Transformers, [Paper], [Code]
  • (arXiv 2021.04) TokenPose: Learning Keypoint Tokens for Human Pose Estimation, [Paper]
  • (arXiv 2021.04) Skeletor: Skeletal Transformers for Robust Body-Pose Estimation, [Paper]
  • (arXiv 2021.04) HandsFormer: Keypoint Transformer for Monocular 3D Pose Estimation of Hands and Object in Interaction, [Paper]
  • (arXiv 2021.07) Test-Time Personalization with a Transformer for Human Pose Estimation, [Paper]
  • (arXiv 2021.09) Pose Transformers (POTR): Human Motion Prediction with Non-Autoregressive Transformers, [Paper], [Code]
  • (arXiv 2021.09) GraFormer: Graph Convolution Transformer for 3D Pose Estimation, [Paper], [Code]
  • (arXiv 2021.09) T6D-Direct: Transformers for Multi-Object 6D Pose Direct Regression, [Paper]
  • (arXiv 2021.10) 6D-ViT: Category-Level 6D Object Pose Estimation via Transformer-based Instance Representation Learning, [Paper]
  • (arXiv 2021.10) Adaptively Multi-view and Temporal Fusing Transformer for 3D Human Pose Estimation, [Paper], [Code]
  • (arXiv 2021.10) HRFormer: High-Resolution Transformer for Dense Prediction, [Paper], [Code]
  • (arXiv 2021.10) TransFusion: Cross-view Fusion with Transformer for 3D Human Pose Estimation, [Paper], [Code]
  • (arXiv 2021.11) MHFormer: Multi-Hypothesis Transformer for 3D Human Pose Estimation, [Paper], [Code]
  • (arXiv 2021.11) A Lightweight Graph Transformer Network for Human Mesh Reconstruction from 2D Human Pose, [Paper]
  • (arXiv 2021.12) PE-former: Pose Estimation Transformer, [Paper], [Code]
  • (arXiv 2021.12) Geometry-Contrastive Transformer for Generalized 3D Pose Transfer, [Paper], [Code]
  • (arXiv 2021.12) DProST: 6-DoF Object Pose Estimation Using Space Carving and Dynamic Projective Spatial Transformer, [Paper], [Code]
  • (arXiv 2021.12) Towards Deep Learning-based 6D Bin Pose Estimation in 3D Scans, [Paper]
  • (arXiv 2021.12) End-to-End Learning of Multi-category 3D Pose and Shape Estimation, [Paper]
  • (arXiv 2022.01) Swin-Pose: Swin Transformer Based Human Pose Estimation, [Paper]
  • (arXiv 2022.01) Poseur: Direct Human Pose Regression with Transformers, [Paper]
  • (arXiv 2022.02) HeadPosr: End-to-end Trainable Head Pose Estimation using Transformer Encoders, [Paper]
  • (arXiv 2022.03) CrossFormer: Cross Spatio-Temporal Transformer for 3D Human Pose Estimation, [Paper]
  • (arXiv 2022.04) BTranspose: Bottleneck Transformers for Human Pose Estimation with Self-Supervised Pre-Training, [Paper]
  • (arXiv 2022.04) ViTPose: Simple Vision Transformer Baselines for Human Pose Estimation, [Paper], [Code]
  • (arXiv 2022.05) YOLOPose: Transformer-based Multi-Object 6D Pose Estimation using Keypoint Regression, [Paper]
  • (arXiv 2022.05) AggPose: Deep Aggregation Vision Transformer for Infant Pose Estimation, [Paper], [Code]
  • (arXiv 2022.05) VTP: Volumetric Transformer for Multi-view Multi-person 3D Pose Estimation, [Paper]
  • (arXiv 2022.05) Learning Sequential Contexts using Transformer for 3D Hand Pose Estimation, [Paper]
  • (arXiv 2022.07) OTPose: Occlusion-Aware Transformer for Pose Estimation in Sparsely-Labeled Videos, [Paper]
  • (arXiv 2022.08) Pose Uncertainty Aware Movement Synchrony Estimation via Spatial-Temporal Graph Transformer, [Paper]
  • (arXiv 2022.08) IVT: An End-to-End Instance-guided Video Transformer for 3D Pose Estimation, [Paper]
  • (arXiv 2022.08) Jointformer: Single-Frame Lifting Transformer with Error Prediction and Refinement for 3D Human Pose Estimation, [Paper]
  • (arXiv 2022.08) The 8-Point Algorithm as an Inductive Bias for Relative Pose Prediction by ViTs, [Paper], [Code]
  • (arXiv 2022.08) PoseBERT: A Generic Transformer Module for Temporal 3D Human Modeling, [Paper], [Code]
  • (arXiv 2022.08) K-Order Graph-oriented Transformer with GraAttention for 3D Pose and Shape Estimation, [Paper]
  • (arXiv 2022.08) SoMoFormer: Multi-Person Pose Forecasting with Transformers, [Paper], [Code]
  • (arXiv 2022.09) DPIT: Dual-Pipeline Integrated Transformer for Human Pose Estimation, [Paper]
  • (arXiv 2022.09) PPT: token-Pruned Pose Transformer for monocular and multi-view human pose estimation, [Paper], [Code]
  • (arXiv 2022.10) Exploiting the Joint Motion Synergy with Fusion Network Based On Transformer for 3D Human Pose Estimation, [Paper]
  • (arXiv 2022.10) Uplift and Upsample: Efficient 3D Human Pose Estimation with Uplifting Transformers, [Paper], [Code]
  • (arXiv 2022.10) Transformer-based Global 3D Hand Pose Estimation in Two Hands Manipulating Objects Scenarios, [Paper]
  • (arXiv 2022.10) CRT-6D: Fast 6D Object Pose Estimation with Cascaded Refinement Transformers, [Paper], [Code]
  • (arXiv 2022.10) Video based Object 6D Pose Estimation using Transformers, [Paper], [Code]
  • (arXiv 2022.11) PoET: Pose Estimation Transformer for Single-View, Multi-Object 6D Pose Estimation, [Paper], [Code]
  • (arXiv 2022.11) MPT: Mesh Pre-Training with Transformers for Human Pose and Mesh Reconstruction, [Paper]
  • (arXiv 2022.12) ViTPose+: Vision Transformer Foundation Model for Generic Body Pose Estimation, [Paper], [Code]
  • (arXiv 2023.01) HSTFormer: Hierarchical Spatial-Temporal Transformers for 3D Human Pose Estimation, [Paper], [Code]
  • (arXiv 2023.01) A Modular Multi-stage Lightweight Graph Transformer Network for Human Pose and Shape Estimation from 2D Human Pose, [Paper], [Code]
  • (arXiv 2023.02) HDFormer: High-order Directed Transformer for 3D Human Pose Estimation, [Paper], [Code]
  • (arXiv 2023.02) HybrIK-Transformer, [Paper], [Code]
  • (arXiv 2023.02) Pose-Oriented Transformer with Uncertainty-Guided Refinement for 2D-to-3D Human Pose Estimation, [Paper]
  • (arXiv 2023.03) Depth-based 6DoF Object Pose Estimation using Swin Transformer, [Paper], [Code]
  • (arXiv 2023.03) Trajectory-Aware Body Interaction Transformer for Multi-Person Pose Forecasting, [Paper]
  • (arXiv 2023.03) Deformer: Dynamic Fusion Transformer for Robust Hand Pose Estimation, [Paper]
  • (arXiv 2023.03) Human Pose Estimation from Ambiguous Pressure Recordings with Spatio-temporal Masked Transformers, [Paper]
  • (arXiv 2023.03) PoseRAC: Pose Saliency Transformer for Repetitive Action Counting, [Paper], [Code]
  • (arXiv 2023.03) TransPoser: Transformer as an Optimizer for Joint Object Shape and Pose Estimation, [Paper]
  • (arXiv 2023.03) PoseFormerV2: Exploring Frequency Domain for Efficient and Robust 3D Human Pose Estimation, [Paper], [Code]
  • (arXiv 2023.04) ConvFormer: Parameter Reduction in Transformer Models for 3D Human Pose Estimation by Leveraging Dynamic Multi-Headed Convolutional Attention, [Paper]
  • (arXiv 2023.04) A2J-Transformer: Anchor-to-Joint Transformer Network for 3D Interacting Hand Pose Estimation from a Single RGB Image, [Paper], [Code]
  • (arXiv 2023.05) Poses as Queries: Image-to-LiDAR Map Localization with Transformers, [Paper], [Code]
  • (arXiv 2023.06) Self-supervised Vision Transformers for 3D Pose Estimation of Novel Objects, [Paper], [Code]
  • (arXiv 2023.06) Efficient Vision Transformer for Human Pose Estimation via Patch Selection, [Paper]
  • (arXiv 2023.06) A Dual-Source Attention Transformer for Multi-Person Pose Tracking, [Paper], [Code]
  • (arXiv 2023.06) Seeing the Pose in the Pixels: Learning Pose-Aware Representations in Vision Transformers, [Paper], [Code]
  • (arXiv 2023.06) LPFormer: LiDAR Pose Estimation Transformer with Multi-Task Network, [Paper]
  • (arXiv 2023.07) TransPose: A Transformer-based 6D Object Pose Estimation Network with Depth Refinement, [Paper]
  • (arXiv 2023.07) YOLOPose V2: Understanding and Improving Transformer-based 6D Pose Estimation, [Paper]
  • (arXiv 2023.07) TransNet: Transparent Object Manipulation Through Category-Level Pose Estimation, [Paper], [Code]
  • (arXiv 2023.08) Scene-aware Human Pose Generation using Transformer, [Paper]
  • (arXiv 2023.08) Deep Fusion Transformer Network with Weighted Vector-Wise Keypoints Voting for Robust 6D Object Pose Estimation, [Paper], [Code]
  • (arXiv 2023.08) Double-chain Constraints for 3D Human Pose Estimation in Images and Videos, [Paper], [Code]
  • (arXiv 2023.08) Group Pose: A Simple Baseline for End-to-End Multi-person Pose Estimation, [Paper], [Code1], [Code2]
  • (arXiv 2023.08) EgoPoser: Robust Real-Time Ego-Body Pose Estimation in Large Scenes, [Paper]
  • (arXiv 2023.08) Coarse-to-Fine Multi-Scene Pose Regression with Transformers, [Paper], [Code]
  • (arXiv 2023.08) Two-Stage Violence Detection Using ViTPose and Classification Models at Smart Airports, [Paper], [Code]
  • (arXiv 2023.09) Refined Temporal Pyramidal Compression-and-Amplification Transformer for 3D Human Pose Estimation, [Paper], [Code]
  • (arXiv 2023.09) ZS6D: Zero-shot 6D Object Pose Estimation using Vision Transformers, [Paper]
  • (arXiv 2023.10) LEAP: Liberate Sparse-view 3D Modeling from Camera Poses, [Paper], [Code]
  • (arXiv 2023.10) MFOS: Model-Free & One-Shot Object Pose Estimation, [Paper]
  • (arXiv 2023.10) UniPose: Detecting Any Keypoints, [Paper], [Code]
  • (arXiv 2023.10) MoEmo Vision Transformer: Integrating Cross-Attention and Movement Vectors in 3D Pose Estimation for HRI Emotion Detection, [Paper], [Code]
  • (arXiv 2023.10) MotionAGFormer: Enhancing 3D Human Pose Estimation with a Transformer-GCNFormer Network, [Paper], [Code]
  • (arXiv 2023.10) TransPose: 6D Object Pose Estimation with Geometry-Aware Transformer, [Paper]
  • (arXiv 2023.10) A Spatial-Temporal Transformer based Framework For Human Pose Assessment And Correction in Education Scenarios, [Paper]
  • (arXiv 2023.11) Multiple View Geometry Transformers for 3D Human Pose Estimation, [Paper], [Code]
  • (arXiv 2023.11) Hourglass Tokenizer for Efficient Transformer-Based 3D Human Pose Estimation, [Paper]
  • (arXiv 2023.11) Fingerspelling PoseNet: Enhancing Fingerspelling Translation with Pose-Based Transformer Models, [Paper], [Code]
  • (arXiv 2023.11) HEViTPose: High-Efficiency Vision Transformer for Human Pose Estimation, [Paper], [Code]
  • (arXiv 2023.11) SAM-6D: Segment Anything Model Meets Zero-Shot 6D Object Pose Estimation, [Paper], [Code]
  • (arXiv 2023.11) Pose Anything: A Graph-Based Approach for Category-Agnostic Pose Estimation, [Paper], [Code]
  • (arXiv 2023.11) PViT-6D: Overclocking Vision Transformers for 6D Pose Estimation with Confidence-Level Prediction and Pose Tokens, [Paper]
  • (arXiv 2023.12) PoseViNet: Distracted Driver Action Recognition Framework Using Multi-View Pose Estimation and Vision Transformer, [Paper]
  • (arXiv 2023.12) Geometry-Biased Transformer for Robust Multi-View 3D Human Pose Reconstruction, [Paper]
  • (arXiv 2024.01) 6D-Diff: A Keypoint Diffusion Framework for 6D Object Pose Estimation, [Paper]
  • (arXiv 2024.01) Towards Real-World Aerial Vision Guidance with Categorical 6D Pose Tracker, [Paper], [Code]
  • (arXiv 2024.01) Towards Precise 3D Human Pose Estimation with Multi-Perspective Spatial-Temporal Relational Transformers, [Paper]
  • (arXiv 2024.02) Cameras as Rays: Pose Estimation via Ray Diffusion, [Paper], [Code]
  • (arXiv 2024.03) FAR: Flexible, Accurate and Robust 6DoF Relative Camera Pose Estimation, [Paper], [Code]
  • (arXiv 2024.03) EgoPoseFormer: A Simple Baseline for Egocentric 3D Human Pose Estimation, [Paper]
  • (arXiv 2024.04) KTPFormer: Kinematics and Trajectory Prior Knowledge-Enhanced Transformer for 3D Human Pose Estimation, [Paper], [Code]
  • (arXiv 2024.04) SkelFormer: Markerless 3D Pose and Shape Estimation using Skeletal Transformers, [Paper]
  • (arXiv 2024.04) SMPLer: Taming Transformers for Monocular 3D Human Shape and Pose Estimation, [Paper], [Code]
  • (arXiv 2024.05) Multi-hop graph transformer network for 3D human pose estimation, [Paper]
  • (arXiv 2024.06) AnimalFormer: Multimodal Vision Framework for Behavior-based Precision Livestock Farming, [Paper]
  • (arXiv 2024.06) TrafficBots V1.5: Traffic Simulation via Conditional VAEs and Transformers with Relative Pose Encoding, [Paper], [Code]
  • (arXiv 2024.07) Graph and Skipped Transformer: Exploiting Spatial and Temporal Modeling Capacities for Efficient 3D Human Pose Estimation, [Paper]
  • (arXiv 2024.07) GTPT: Group-based Token Pruning Transformer for Efficient Human Pose Estimation, [Paper]
  • (arXiv 2024.07) STGFormer: Spatio-Temporal GraphFormer for 3D Human Pose Estimation in Video, [Paper]
  • (arXiv 2024.09) Causal Transformer for Fusion and Pose Estimation in Deep Visual Inertial Odometry, [Paper], [Code]
  • (arXiv 2024.10) Enhancing 3D Human Pose Estimation Amidst Severe Occlusion with Dual Transformer Fusion, [Paper], [Code]
  • (arXiv 2024.10) YOLO11 and Vision Transformers based 3D Pose Estimation of Immature Green Fruits in Commercial Apple Orchards for Robotic Thinning, [Paper]
  • (arXiv 2024.10) HRPVT: High-Resolution Pyramid Vision Transformer for medium and small-scale human pose estimation, [Paper]
  • (arXiv 2024.12) AniMer: Animal Pose and Shape Estimation Using Family Aware Transformer, [Paper], [Code]
  • (arXiv 2024.12) Pre-training a Density-Aware Pose Transformer for Robust LiDAR-based 3D Human Pose Estimation, [Paper], [Code]
  • (arXiv 2025.01) Poseidon: A ViT-based Architecture for Multi-Frame Pose Estimation with Adaptive Frame Weighting and Multi-Scale Feature Fusion, [Paper], [Code]
  • (arXiv 2025.02) CleanPose: Category-Level Object Pose Estimation via Causal Learning and Knowledge Distillation, [Paper]
  • (arXiv 2025.02) Learning Structure-Supporting Dependencies via Keypoint Interactive Transformer for General Mammal Pose Estimation, [Paper], [Code]
  • (arXiv 2025.03) Transformers with Joint Tokens and Local-Global Attention for Efficient Human Pose Estimation, [Paper]
  • (arXiv 2025.03) HiPART: Hierarchical Pose AutoRegressive Transformer for Occluded 3D Human Pose Estimation, [Paper]
  • (arXiv 2025.04) Dual-stream Transformer-GCN Model with Contextualized Representations Learning for Monocular 3D Human Pose Estimation, [Paper]
  • (arXiv 2025.04) HGMamba: Enhancing 3D Human Pose Estimation with a HyperGCN-Mamba Network, [Paper], [Code]
  • (arXiv 2025.04) Shopformer: Transformer-Based Framework for Detecting Shoplifting via Human Pose, [Paper], [Code]
  • (arXiv 2025.05) 3D Human Pose Estimation via Spatial Graph Order Attention and Temporal Body Aware Transformer, [Paper], [Code]
  • (arXiv 2025.05) APR-Transformer: Initial Pose Estimation for Localization in Complex Environments through Absolute Pose Regression, [Paper], [Code]
  • (arXiv 2025.05) DETRPose: Real-time end-to-end transformer model for multi-person pose estimation, [Paper], [Code]
  • (arXiv 2025.07) KASportsFormer: Kinematic Anatomy Enhanced Transformer for 3D Human Pose Estimation on Short Sports Scene Video, [Paper]
  • (arXiv 2025.08) AniMer+: Unified Pose and Shape Estimation Across Mammalia and Aves via Family-Aware Transformer, [Paper]
  • (arXiv 2025.08) MVTOP: Multi-View Transformer-based Object Pose-Estimation, [Paper]
  • (arXiv 2025.08) PyCAT4: A Hierarchical Vision Transformer-based Framework for 3D Human Pose Estimation, [Paper]
  • (arXiv 2025.09) Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers, [Paper], [Code]
  • (arXiv 2025.09) Motion Aware ViT-based Framework for Monocular 6-DoF Spacecraft Pose Estimation, [Paper]
  • (arXiv 2025.10) RayPose: Ray Bundling Diffusion for Template Views in Unseen 6D Object Pose Estimation, [Paper], [Code]