README.md

July 24, 2026 · View on GitHub

🎉 Awesome-Human-Motion-Video-Generation 🔥


image

TechRxiv PDF Survey MorePapers
under MorePapers 知乎文章

You can click on Watch Icon Watch and Star Icon Star to get the latest updates at any time.

Watch Icon Watch Me ! Watch Icon Watch Me ! Watch Icon Watch Me !
Star Icon Star Me ! Star Icon Star Me ! Star Icon Star Me !


🎁 >>>>>>>> [English Introduction] <<<<<<<<<<

This project provides a thorough summary of the latest advancements in the field of 2D digital human motion video generation, covering papers, datasets, and code repositories.

The repository is organized into three main conditions: Vision-driven, Text-driven, and Audio-driven, while also considering LLM Planning Papers.

Unlike previous summaries, this project clearly outlines the five key stages in the field of digital human video generation:

🌑 Stage 1: Input Phase. Clarifying the driving source (Vision, Text, Audio) and driving region (Part, Holistic), where "Part" mainly refers to the face;

🌒 Stage 2: Motion planning Phase. Most work involves feature mapping to learn motion mappings, while a few works use large language models (LLMs) for motion planning;

🌓 Stage 3: Motion Video Generation Phase;

🌔 Stage 4: Video Refinement Phase, focusing on optimizing specific parts such as the face, lips, teeth, and hands;

🌕 Stage 5: Acceleration Phase, aiming to speed up training and deployment inference as much as possible, with the goal of achieving real-time output.

🎉 We welcome everyone to contribute your research and submit PRs to collectively advance the technology of human motion video generation.

If you have any questions, feel free to contact us at (WinniyGD@outlook.com), and we will respond as soon as possible. Additionally, we warmly welcome new members from related fields to join us, learn together, and make endless progress!

🏆 >>>>>>>> [🧡中文简要介绍💜] <<<<<<<<<<

本项目认真总结了👍2D数字人动作视频生成👏相关领域的最新进展,包括论文、数据集和代码库。

Repo以 Vision-driven、Text-driven、Audio-driven 三大方向作以总结,同时考虑 LLM Planning 前沿论文。

分类时,我们定义Audio>Text>Vision优先级,当出现文本不出现音频时,归纳为Text-Driven方法,当文本音频同时出现时,归纳为Audio-Driven方法,以此类推。

区别于以往的总结,项目明确总结了数字人视频生成领域的五大阶段:

🌑 第1阶段 明确驱动源(Vision、Text、Audio)与驱动区域(Part、Holistic),其中Part主要以脸部为主;

🌒 第2阶段 动作规划阶段,大多数工作以特征Mapping学习动作映射,少部分工作以大语言模型LLMs进行动作规划;

🌓 第3阶段 人体视频生成,大部分工作以Diffusion Models为基础,少部分工作以Transformer为基础;

🌔 第4阶段 视频优化阶段,针对脸部、嘴唇、牙齿、手部单独做Refinement优化;

🌕 第5阶段 加速输出阶段,尽可能地加速训练与部署推理,目标Real-Time实时输出。

🔑本项目由六位核心成员全力推进:

- 薛海威(清华大学,负责人)
- 罗向阳(清华大学)
- 胡璋昊(爱丁堡大学)
- 张鑫(西安交通大学)
- 向迅之(中国科学院大学)
- 戴语琴(南京理工大学)

💖核心综述由以下老师全力支持并悉心指导:

- 刘健庄老师(中国科学院深圳先进技术研究院)
- 张镇嵩博士(华为诺亚2012实验室)
- 李明磊博士(零一万物)
- 马飞博士(光明实验室)
- 吴志勇老师(清华大学/香港中文大学)

另外,非常感谢常恒师兄 ( https://github.com/SwiftieH )、余伟江师兄的支持!

🎉 欢迎大家贡献自己的研究成果并PR,共同推动人体运动视频生成技术的发展。

如有任何问题,可以随时联系邮件(WinniyGD@outlook.com),我们会尽快回复。

另外,我们非常欢迎有新的相关领域的同学一同加入我们,一起学习,无限进步!


🍦 Exploring the latest papers in human motion video generation. 🍦




Introduction

This work delves into Human Motion Video Generation, covering areas such as Portrait Animation, Dance Video Generation, Text2Face, Text2MotionVideo, and Talking Head. We believe this will be the most comprehensive survey to date on human motion video generation technologies. Please stay tuned! 😘😁😀

It's important to note that for the sake of clarity, we have excluded 3DGS and NeRF technologies (2D-3D-2D) from the scope of this paper.

If you discover any missing work or have any suggestions,

please feel free to submit a pull request or contact us ( WinniyGD@outlook.com ).

We will promptly add the missing papers to this repository.

🍔 Highlight

[1] We decompose human motion video generation into five key phases, covering all subtasks across various driving sources and body regions. To the best of our knowledge, this is the first survey to offer such a comprehensive framework for human motion video generation.

[2] We provide an in-depth analysis of human motion video generation from both motion planning and motion generation perspectives, a dimension that has been underexplored in existing reviews.

[3] We clearly delineate established baselines and evaluation metrics, offering detailed insights into the key challenges shaping this field.

[4] We present a set of potential future research directions, aimed at inspiring and guiding researchers in the field of human motion video generation.

🕑 Timeline

Timeline

🎁 Notes

We are excited to announce the upcoming launch of a new benchmark, including enhanced evaluation metrics, comprehensive datasets, and with a fast implementation for evaluation. However, due to the author's current graduation commitments and tight deadlines, we kindly ask for your patience as we work towards this release. Please stay tuned!

💙 News

[2025/09/05][TOP] IMPORTANT NEWS

Links:

Arxiv: https://arxiv.org/abs/2509.03883

IEEE Access: https://ieeexplore.ieee.org/document/11106267

Github Repo: https://github.com/Winn1y/Awesome-Human-Motion-Video-Generation

Huggingface link: https://huggingface.co/papers/2509.03883


[2025/07/26][TOP] IMPORTANT NEWS

Our paper has been accepted by TPAMI.🎉🎉🎉🎉🎉 Stay tuned for our updates! Here we share the timeline:

🏁 May 30, 2024: Project launch

🏁 June 24, 2024: First draft completed

🏁 August 30, 2024: Final draft completed

🏁 September 1, 2024: Submission

🏁 December 12, 2024: First-round review comments returned

🏁 January 10, 2025: First-round rebuttal submitted

🏁 April 9, 2025: Second-round review comments returned

🏁 May 5, 2025: Second-round rebuttal submitted

🏁 July 26, 2025: Acceptance email received


[2026/07/24] V24.2 Vision: Update Methods.

arXiv GroupVideo: Multi-Identity Customized Text-to-Video Generation (Text, Text2MotionVideo) 【中科院大学、中科院自动化所、蚂蚁集团】


[2026/07/23] V24.1 Vision: Update Methods.

arXiv StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation (Text, Text2MotionVideo) 【国科大、可灵AI研究、成大】

arXiv Vera: Identity-Faithful Human Subject-to-Video Generation (Text, Text2MotionVideo) 【快手 中科院自动化所 清华 】


[2026/07/16] V24.0 Vision: Update Methods.

arXiv Keyframe-Anchored Identity Preservation for Sequential-Action Video Generation (Text, Text2MotionVideo) 【中科大】


[2026/07/16] V23.9 Vision: Update Methods.

arXiv SlotMem: Character-Addressable Internal Memory for Narrative Long Video Generation (Text, Text2MotionVideo) 【港大、清华】


[2026/07/16] V23.8 Vision: Update Methods.

arXiv MultiAnimate: A Unified Framework for Controllable Multi-Character Animation (Visual, Pose-Guided Dance Video Generation) 【中科大、阿里通义实验室、南洋理工大学】


[2026/07/08] V23.7 Vision: Update Methods.

arXiv Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment (Text, Text2MotionVideo) 【腾讯混元】

arXiv Vidu S1: A Real-Time Interactive Video Generation Model (Audio, Audio-Driven Holistic Body Driving) 【清华大学、生数科技】

arXiv Conversational Human Audio-visual Talking Dialogue Generation (Text, Text2MotionVideo) 【帝国理工】

arXiv SparseCtrl-HOI: Sparse Temporal Control for Human-Object Interaction Video Generation (Audio, Audio-Driven Holistic Body Driving) 【华南理工大学】


[2026/07/02] V23.6 Vision: Update Methods.

arXiv GaussianEmoTalker: Real-Time Emotional Talking Head Synthesis with Audio-Driven and Blendshape-Based 3D Gaussian Splatting (Audio, Head Pose Driving) 【南京理工大学;钱塘高等研究院;南京大学(苏州)】


[2026/07/01] V23.5 Vision: Update Methods.

arXiv SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation (Audio, Audio-Driven Holistic Body Driving) 【北大深研院、上海AI实验室、腾讯混元、vivo】

arXiv Towards Flexible, Natural, Efficient Interaction for Conversational Talking Face Generation (Audio, Audio-Driven Holistic Body Driving) 【中科院自动化所(MAIS) 国科大人工智能学院 中科院香港创新研究院人工智能与机器人中心(CAIR) 澳门科技大学(M.U.S.T)计算机科学与工程学院/信息工程学院(SCSE/FIE)】


[2026/06/26] V23.4 Vision: Update Methods.

arXiv Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models (Audio, Audio-Driven Holistic Body Driving) 【阿里巴巴集团(Wan Team)】

arXiv Chorus II: Cross-Request Sparsity Reuse for Efficient Image-to-Video Generation (Text, Text2MotionVideo) 【中山大学;腾讯微信HPC;腾讯微信视觉。】


[2026/06/23] V23.3 Vision: Update Methods.

arXiv Avatar V: Scaling Video-Reference Avatar Video Generation (Audio, Audio-Driven Holistic Body Driving) 【HeyGen研究团队。】

arXiv JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence (Audio, Audio-Driven Holistic Body Driving) 【京东(JD.com)】

arXiv InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars (Audio, Audio-Driven Holistic Body Driving) 【西安交通大学(人机混合增强智能国重;人工智能与机器人研究所) 中国电信人工智能科技(北京)有限公司 武汉大学 中国电信 TeleAI 人工智能研究院】


[2026/06/11] V23.2 Vision: Update Methods.

arXiv ARGUS: Stacked Multi-View Identity Mosaic Injection for Subject-Preserving Video Generation (Text, Text2MotionVideo) 【北大】


[2026/06/10] V23.1 Vision: Update Methods.

arXiv Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization (Audio, Head Pose Driving) 【韩国科院AI、AIPARK】

arXiv HarmoView: Harmonizing Multi-View Constraints for Identity-Consistent Video Generation (Text, Text2MotionVideo) 【腾讯混元。】

arXiv SCAIL-2: Unifying Controlled Character Animation with End-to-end In-Context Conditioning (Text, Text2MotionVideo) 【清华、智谱】


[2026/06/08] V23.0 Vision: Update Methods.

arXiv Beyond Skeletons: Learning Animation Directly from Driving Videos with Same2X Training Strategy (Visual, Video-Guided Dance Video Generation) 【清华大学;哈尔滨工业大学;鹏城实验室 Yuan Zeng;Yujia Shi;Yuhao Yang;Dongxia Liu;Zongqing Lu;Wenming Yang;Qingmin Liao 】

arXiv FreeAnimate: Training-Free Human Image Animation with Preview-Guided Denoising (Visual, Pose-Guided Dance Video Generation) 【清华大学深圳国际研究生院;哈工大;鹏城实验室 】


[2026/06/05] V22.9 Vision: Update Methods.

arXiv Resonant Minds: Closed-Loop Social Avatars with Theory of Mind (Audio, Head Pose Driving) 【华盛顿大学;北京大学;卡内基梅隆大学;宁波东方理工(EIT宁波) 】


[2026/06/02] V22.8 Vision: Update Methods.

arXiv Temporally-Aligned Evaluation for Audio-Driven Talking Head Generation (Audio, Head Pose Driving) 【新南威尔士大学(UNSW)商学院;格里菲斯大学工程与建筑环境学院;CSIRO Data61 Zhicheng Zhang;Lei Wang;Yu Zhang;Yongsheng Gao 】

arXiv Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs (Audio, Audio-Driven Holistic Body Driving) 【微软研究院;微软AI 】


[2026/06/01] V22.7 Vision: Update Methods.

arXiv IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation (Visual, Video-Guided Dance Video Generation) 【信息工程大学;淮安大学;重庆邮电大学;南开大学 】


[2026/05/28] V22.6 Vision: Update Methods.

arXiv HarmoVid: Relightful Video Portrait Harmonization (Visual, Pose2Video) 【北卡罗来纳大学教堂山分校;Adobe研究院 Jun Myeong Choi;Jae Shin Yoon;Luchao Qi;Roni Sengupta;Joon-Young Lee 】

arXiv CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning (Audio, Head Pose Driving) 【哈尔滨工业大学;理想汽车;新南威尔士大学 He Feng;Yongjia Ma;Donglin Di;Lei Fan;Tonghua Su 】


[2026/05/26] V22.5 Vision: Update Methods.

arXiv StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration (Text, Text2MotionVideo) 【阿里巴巴通义实验室(阿里巴巴集团) 】

arXiv Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation (Audio, Head Pose Driving) 【新南威尔士大学(UNSW)商学院;格里菲斯大学工程与建成环境学院 Zhicheng Zhang;Lei Wang;Yu Zhang;Yongsheng Gao 】

arXiv Loki: Representation over Architecture for Diffusion-Based Portrait Animation (Visual, Video-Guided Dance Video Generation) 【俄亥俄州立大学;中佛罗里达大学 】


[2026/05/21] V22.4 Vision: Update Methods.

arXiv iTryOn: Mastering Interactive Video Virtual Try-On with Spatial-Semantic Guidance (Visual, Try-On Video Generation) 【中山大学深圳校区 阿里巴巴淘天集团(淘宝天猫) 】


[2026/05/19] V22.3 Vision: Update Methods.

arXiv FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization (Text, Text2MotionVideo) 【厦门大学;阿里巴巴集团 】

arXiv Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation (Audio, Audio-Driven Holistic Body Driving) 【上海交大;浙大;电子科大 】

arXiv StreamingEffect: Real-Time Human-Centric Video Effect Generation (Text, Text2MotionVideo) 【新加坡国立大学 Show Lab 】


[2026/05/15] V22.2 Vision: Update Methods.

arXiv EverAnimate: Minute-Scale Human Animation via Latent Flow Restoration (Visual, Pose2Video) 【洛桑联邦理工学院(EPFL)VITA实验室】


[2026/05/12] V22.1 Vision: Update Methods.

arXiv Improving Human Image Animation via Semantic Representation Alignment (Text, Text2MotionVideo) 【上海交大人工智能学院;阿里巴巴集团 】

arXiv SocialDirector: Training-Free Social Interaction Control for Multi-Person Video Generation (Text, Text2MotionVideo) 【东京大学;盛趣AI研究院(东京) 】

arXiv SDTalk: Structured Facial Priors and Dual-Branch Motion Fields for Generalizable Gaussian Talking Head Synthesis (Audio, Head Pose Driving) 【合肥工业大学;中国科学技术大学 】

arXiv Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation (Text, Text2MotionVideo) 【武汉大学】


[2026/05/11] V22.0 Vision: Update Methods.

arXiv MoCoTalk: Multi-Conditional Diffusion with Adaptive Router for Controllable Talking Head Generation (Audio, Head Pose Driving) 【帝国理工学院 】

arXiv Implicit Preference Alignment for Human Image Animation (Visual, Pose-Guided Dance Video Generation) 【北师大人工智能学院;腾讯混元 】

arXiv AudioFace: Language-Assisted Speech-Driven Facial Animation with Multimodal Language Models (Audio, Lip Synchronization) 【西湖大学;浙江大学;天工大学;湖南大学;香港中文大学(深圳) Kai Zheng;Zejian Kang;Rui Mao;Hongyuan Zou;Yuanchen Fei;Xuanyang Xu;Xiangru Huang 】


[2026/05/08] V21.9 Vision: Update Methods.

arXiv SuperFace: Preference-Aligned Facial Expression Estimation Beyond Pseudo Supervision (Visual, Portrait Animation) 【浙江大学;西湖大学;香港中文大学(深圳);湖南大学;上海创新研究院;德州大学奥斯汀分校 】


[2026/05/07] V21.8 Vision: Update Methods.

arXiv FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation (Text, Text2Face) 【南洋理工、腾讯混元、中科大、北师大 】


[2026/05/01] V21.7 Vision: Update Methods.

arXiv TripVVT: A Large-Scale Triplet Dataset and a Coarse-Mask Baseline for In-the-Wild Video Virtual Try-On (Visual, Try-On Video Generation) 【南京大学、中国移动九天研究院、吉林大学、字节跳动 】


[2026/04/29] V21.6 Vision: Update Methods.

arXiv Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation (Text, Text2MotionVideo) 【南开大学、通义实验室、北京大学 Yupeng Zhou,Lianghua Huang,Zhifan Wu,Jiabao Wang,Yupeng Shi,Biao Jiang,Daquan Zhou,Yu Liu,Ming-Ming Cheng,Qibin Hou 】


[2026/04/28] V21.5 Vision: Update Methods.

arXiv Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation (Text, Text2MotionVideo) 【上海创新研究院;复旦大学;中国科学技术大学;南京大学;百度 Chunyu Li;Jiaye Li;Ruiqiao Mei;Haoyuan Xia;Hao Zhu;Jingdong Wang;Siyu Zhu 】

arXiv Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling (Audio, Head Pose Driving) 【香港科技大学;独立研究者;浙江大学;新加坡国立大学;香港中文大学;北京大学 Zhen Ye;Xu Tan;Aoxiong Yin;Hongzhan Lin;Guangyan Zhang;Peiwen Sun;Yiming Li;Chi-Min Chan;Wei Ye;Shikun Zhang;Wei Xue 】

arXiv EAD-Net: Emotion-Aware Talking Head Generation with Spatial Refinement and Temporal Coherence (Audio, Head Pose Driving) 【新疆大学 】


[2026/04/22] V21.4 Vision: Update Methods.

arXiv ReImagine: Rethinking Controllable High-Quality Human Video Generation via Image-First Synthesis (Visual, Pose2Video) 【港中大(深圳)理工学院 港中大(深圳)未来智能网络研究院 】

arXiv MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation (Audio, Head Pose Driving) 【浙江大学 Liyang Li;Wen Wang;Canyu Zhao;Tianjian Feng;Zhiyue Zhao;Hao Chen;Chunhua Shen 】

arXiv CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation (Audio, Audio-Driven Holistic Body Driving) 【清华大学;阿里巴巴 】


[2026/04/21] V21.3 Vision: Update Methods.

arXiv OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation (Audio, Head Pose Driving) 【北京大学;腾讯微信实验室;中科院 】

arXiv EmbodiedHead: Real-Time Listening and Speaking Avatar for Conversational Agents (Audio, Head Pose Driving) 【华东师范大学;Garabido上海科技有限公司 】


[2026/04/17] V21.2 Vision: Update Methods.

arXiv TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation (Audio, Head Pose Driving) 【中科院自动化所(MAIS) 中科院大学 人工智能学院 美团 香港理工大学 中科院香港创新研究院CAIR(HKISI, CAS) 】


[2026/04/15] V21.1 Vision: Update Methods.

arXiv OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation (Audio, Audio-Driven Holistic Body Driving) 【香港中文大学;字节跳动;莫纳什大学;香港大学 】


[2026/04/11] V21.0 Vision: Update Methods.

arXiv FIT: A Large-Scale Dataset for Fit-Aware Virtual Try-On (Visual, Try-On Video Generation) 【华盛顿大学;谷歌研究院 】

arXiv SyncBreaker:Stage-Aware Multimodal Adversarial Attacks on Audio-Driven Talking Head Generation (Audio, Head Pose Driving) 【中国科大;北京工业大学 Wenli Zhang;Xianglong Shi;Sirui Zhao;Xinqi Chen;Guo Cheng;Yifan Xu;Tong Xu;Yong Liao 】

arXiv Cross-Modal Emotion Transfer for Emotion Editing in Talking Face Video (Audio, Head Pose Driving) 【蔚山国立科学技术院(UNIST) 】


[2026/04/08] V20.9 Vision: Update Methods.

arXiv Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation (Visual, Pose2Video) 【武汉大学 】

arXiv Vanast: Virtual Try-On with Human Image Animation via Synthetic Triplet Supervision (Visual, Try-On Video Generation) 【Seoul 】

arXiv HumANDiff: Articulated Noise Diffusion for Motion-Consistent Human Video Generation (Visual, Try-On Video Generation) 【Stability AI 】


[2026/04/02] V20.8 Vision: Update Methods.

arXiv ONE-SHOT: Compositional Human-Environment Video Synthesis via Spatial-Decoupled Motion Injection and Hybrid Context Integration (Visual, Pose2Video) 【新国立 】


[2026/04/01] V20.7 Vision: Update Methods.

arXiv Gloria: Consistent Character Video Generation via Content Anchors (Audio, Audio-Driven Holistic Body Driving) 【中国科学技术大学、新南威尔士大学、香港大学、电子科技大学 】


[2026/03/25] V20.6 Vision: Update Methods.

arXiv InterDyad: Interactive Dyadic Speech-to-Video Generation by Querying Intermediate Visual Guidance (Audio, Audio-Driven Holistic Body Driving) 【百度公司 】

arXiv FG-Portrait: 3D Flow Guided Editable Portrait Animation (Visual, Portrait Animation) 【新加坡国立大学、华威大学、帝国理工学院、萨里大学 】


[2026/03/24] V20.5 Vision: Update Methods.

arXiv Speed by Simplicity: A Single-Stream Architecture for Fast Audio-Video Generative Foundation Model (Text, Text2MotionVideo) 【上海交通大学 SII-GAIR 实验室、Sand.ai 】

arXiv HumanOmni-Speaker: Identifying Who said What and When (Audio, Audio-Driven Holistic Body Driving) 【阿里巴巴集团通义实验室、深圳理工大学 】

arXiv EmoTaG: Emotion-Aware Talking Head Synthesis on Gaussian Splatting with Few-Shot Personalization (Audio, Head Pose Driving) 【密歇根州立大学高通技术公司 】

arXiv Identity-Consistent Video Generation under Large Facial-Angle Variations (Text, Text2MotionVideo) 【清华大学、百度公司、布里斯托大学、香港中文大学(深圳) 】

arXiv EARTalking: End-to-end GPT-style Autoregressive Talking Head Synthesis with Frame-wise Control (Audio, Head Pose Driving) 【中国科学技术大学、科大讯飞、浙江大学 】


[2026/03/23] V20.4 Vision: Update Methods.

arXiv PerformRecast: Expression and Head Pose Disentanglement for Portrait Video Editing (Visual, Portrait Animation) 【虎鲸数字媒体与娱乐集团 】

arXiv LumosX: Relate Any Identities with Their Attributes for Personalized Video Generation (Text, Text2MotionVideo) 【浙江大学、阿里巴巴集团达摩院、湖畔实验室、新加坡国立大学 】


[2026/03/20] V20.3 Vision: Update Methods.

arXiv AnyCrowd: Instance-Isolated Identity-Pose Binding for Arbitrary Multi-Character Animation (Visual, Pose-Guided Dance Video Generation) 【穆罕默德・本・扎耶德人工智能大学(阿联酋)挪威北极大学(挪威特罗姆瑟大学)中山大学深圳校区 】

arXiv Face-to-Face: A Video Dataset for Multi-Person Interaction Modeling (Audio, Audio-Driven Holistic Body Driving) 【约翰斯・霍普金斯大学 】

arXiv MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model (Visual, Pose2Video) 【澳大利亚国立大学、百度公司、中山大学、澳大利亚联邦科学与工业研究组织 】

arXiv AvatarForcing: One-Step Streaming Talking Avatars via Local-Future Sliding-Window Denoising (Audio, Head Pose Driving) 【浙江大学北京邮电大学快手科技可灵团队清华大学 】

arXiv Garments2Look: A Multi-Reference Dataset for High-Fidelity Outfit-Level Virtual Try-On with Clothing and Accessories (Visual, Try-On Video Generation) 【香港理工大学呼呼人工智能有限公司 】


[2026/03/13] V20.2 Visiontree/20.2: Update Methods.

arXiv ID-LoRA: Identity-Driven Audio-Video Personalization with In-Context LoRA (Text, Text2MotionVideo) 【特拉维夫大学 】

arXiv SoulX-LiveAct: Towards Hour-Scale Real-Time Human Animation with Neighbor Forcing and ConvKV Memory (Audio, Audio-Driven Holistic Body Driving) 【魂芯 AI 实验室、香港科技大学(广州)、苏州大学 】


[2026/03/11] V20.1 Vision: Update Methods.

arXiv DISPLAY: Directable Human-Object Interaction Video Generation via Sparse Motion Guidance and Multi-Task Auxiliary (Text, Text2MotionVideo) 【百度公司 】

arXiv OmniEdit: A Training-free framework for Lip Synchronization and Audio-Visual Editing (Audio, Head Pose Driving) 【同花顺研究院中国科学技术大学浙江大学 】


[2026/03/10] V20.0 Vision: Update Methods.

arXiv EmbedTalk: Triplane-Free Talking Head Synthesis using Embedding-Driven Gaussian Deformation (Audio, Head Pose Driving) 【利兹大学计算机学院 】


[2026/03/09] V19.9 Vision: Update Methods.

arXiv Text-Driven Emotionally Continuous Talking Face Generation (Audio, Head Pose Driving) 【哈尔滨工业大学SERES 】


[2026/03/05] V19.8 Vision: Update Methods.

arXiv UniSync: Towards Generalizable and High-Fidelity Lip Synchronization for Challenging Scenarios (Text, Text2Face) 【芒果 TV 】


[2026/03/04] V19.7 Vision: Update Methods.

arXiv Kling-MotionControl Technical Report (Text, Text2MotionVideo) 【快手科技 Kling 团队 】


[2026/03/03] V19.6 Vision: Update Methods.

arXiv UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation (Audio, Head Pose Driving) 【华为中央媒体技术学院、北京航空航天大学计算机科学与工程学院 】

arXiv Let Your Image Move with Your Motion! -- Implicit Multi-Object Multi-Motion Transfer (Text, Text2MotionVideo) 【天津大学、新南威尔士大学、电子科技大学、海南大学、奥克兰大学 】

arXiv IdGlow: Dynamic Identity Modulation for Multi-Subject Generation (Text, Text2Face) 【小红书、香港中文大学(深圳)、北京大学、清华大学 】

arXiv WildActor: Unconstrained Identity-Preserving Video Generation (Text, Text2MotionVideo) 【香港科技大学、美团、新加坡国立大学 】

arXiv FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation (Audio, Head Pose Driving) 【字节跳动 Seed、约翰斯・霍普金斯大学 】


[2026/03/02] V19.5 Vision: Update Methods.

arXiv U-Mind: A Unified Framework for Real-Time Multimodal Interaction with Audiovisual Generation (Audio, Audio-Driven Holistic Body Driving) 【清华大学、美团 】


[2026/02/27] V19.4 Vision: Update Methods.

arXiv MultiAnimate: Pose-Guided Image Animation Made Extensible (Visual, Pose-Guided Dance Video Generation) 【中国科学院计算技术研究所人工智能安全国家重点实验室、上海科技大学、上海交通大学 】

arXiv Face Time Traveller : Travel Through Ages Without Losing Identity (Visual, Portrait Animation) 【索尼印度研究院印度海得拉巴国际信息技术学院 】


[2026/02/25] V19.3 Vision: Update Methods.

arXiv Human Video Generation from a Single Image with 3D Pose and View Control (Visual, Pose2Video) 【加州大学默塞德分校、Stability AI 】


[2026/02/24] V19.2 Vision: Update Methods.

arXiv ExpPortrait: Expressive Portrait Generation via Personalized Representation (Visual, Portrait Animation) 【中国科学技术大学 】

arXiv Narrating For You: Prompt-guided Audio-visual Narrating Face Generation Employing Multi-entangled Latent Space (Audio, Head Pose Driving) 【印度比拉理工学院皮拉尼分校海德拉巴校区计算机科学与信息系统系机器智能组美国佐治亚理工学院 】


[2026/02/20] V19.1 Vision: Update Methods.

arXiv CORAL: Correspondence Alignment for Improved Virtual Try-On (Visual, Try-On Video Generation) 【KAIST 人工智能实验室、NC 人工智能有限公司 】


[2026/02/17] V19.0 Vision: Update Methods.

arXiv EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation (Audio, Audio-Driven Holistic Body Driving) 【蚂蚁集团 】

arXiv OmniVTON++: Training-Free Universal Virtual Try-On with Principal Pose Guidance (Visual, Try-On Video Generation) 【中国海洋大学、南京理工大学、新加坡管理大学、哈尔滨工业大学(深圳) 】


[2026/02/14] V18.9 Vision: Update Methods.

arXiv DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation (Audio, Audio-Driven Holistic Body Driving) 【清华大学、字节跳动智能创作实验室 】


[2026/02/10] V18.8 Vision: Update Methods.

arXiv Toward Fine-Grained Facial Control in 3D Talking Head Generation (Audio, Head Pose Driving) 【东南大学、南洋理工大学、武汉大学、澳门大学、香港科技大学、紫金山实验室、东南大学区块链应用监管工程研究中心、武汉大学地理空间信息技术协同创新中心 】

arXiv AUHead: Realistic Emotional Talking Head Generation via Action Units Control (Audio, Head Pose Driving) 【国科大、新加坡国立大学、浙大 】


[2026/02/10] V18.7 Vision: Update Methods.

arXiv MVAnimate: Enhancing Character Animation with Multi-View Optimization (Visual, Video-Guided Dance Video Generation) 【南洋理工大学计算与数据科学学院、阿里巴巴集团 】

arXiv ALIVE: Animate Your World with Lifelike Audio-Video Generation (Text, Text2MotionVideo) 【字节跳动 】

arXiv IM-Animation: An Implicit Motion Representation for Identity-decoupled Character Animation (Visual, Video-Guided Dance Video Generation) 【中科院计算所、中国科学院大学、快手科技 Kling 团队、卡迪夫大学 】

arXiv SoulX-FlashHead: Oracle-guided Generation of Infinite Real-time Streaming Talking Heads (Audio, Head Pose Driving) 【中国 Soul AI 实验室 AIGC 团队 】


[2026/02/04] V18.6 Vision: Update Methods.

arXiv 3D-Aware Implicit Motion Control for View-Adaptive Human Video Generation (Text, Text2MotionVideo) 【快手科技 Kling 团队、清华大学、中国科学院自动化研究所 】


[2026/02/03] V18.5 Vision: Update Methods.

arXiv Making Avatars Interact: Towards Text-Driven Human-Object Interaction for Controllable Talking Avatars (Audio, Audio-Driven Holistic Body Driving) 【清华大学、腾讯 HY 】

arXiv JoyAvatar: Unlocking Highly Expressive Avatars via Harmonized Text-Audio Conditioning (Audio, Audio-Driven Holistic Body Driving) 【京东科技 】


[2026/02/02] V18.4 Vision: Update Methods.

arXiv MIRRORTALK: Forging Personalized Avatars Via Disentangled Style and Hierarchical Motion Control (Audio, Head Pose Driving) 【平安科技(深圳)有限公司、中国科学技术大学 】


[2026/01/29] V18.3 Vision: Update Methods.

arXiv DiffVC-RT: Towards Practical Real-Time Diffusion-based Perceptual Neural Video Compression (Visual, Pose2Video) 【武汉大学遥感信息工程学院 】

arXiv Say Cheese! Detail-Preserving Portrait Collection Generation via Natural Language Edits (Text, Text2MotionVideo) 【中国人民大学高瓴人工智能学院 】


[2026/01/28] V18.2 Vision: Update Methods.

arXiv Audio-Driven Talking Face Generation with Blink Embedding and Hash Grid Landmarks Encoding (Audio, Head Pose Driving) 【上海理工大学、英国格拉斯哥大学 】


[2026/01/27] V18.1 Vision: Update Methods.

arXiv SkyReels-V3 Technique Report (Audio, Audio-Driven Holistic Body Driving) 【SkyReels 团队 】


[2026/01/26] V18.0 Vision: Update Methods.

arXiv AlphaFace: High Fidelity and Real-time Face Swapper Robust to Facial Pose (Visual, Portrait Animation) 【ProjectG.AI、剑桥大学、肯特大学、清华大学、等】


[2026/01/22] V17.9 Vision: Update Methods.

arXiv APPLE: Attribute-Preserving Pseudo-Labeling for Diffusion-Based Face Swapping (Visual, Portrait Animation) 【KAIST 人工智能研究所、三星公司 】


[2026/01/21] V17.8 Vision: Update Methods.

arXiv OmniTransfer: All-in-one Framework for Spatio-temporal Video Transfer (Text, Text2MotionVideo) 【字节跳动智能创作实验室 】

arXiv Exploring Talking Head Models With Adjacent Frame Prior for Speech-Preserving Facial Expression Manipulation (Audio, Lip Synchronization) 【广东工业大学、北京大学、中山大学 】


[2026/01/16] V17.7 Vision: Update Methods.

arXiv Beyond Inpainting: Unleash 3D Understanding for Precise Camera-Controlled Video Generation (Text, Text2MotionVideo) 【清华大学计算机科学与技术系、BNRist 实验室 】

arXiv FlowAct-R1: Towards Interactive Humanoid Video Generation (Audio, Audio-Driven Holistic Body Driving) 【字节跳动智能创作部门 】


[2026/01/07] V17.6 Vision: Update Methods. Happy New Year!🎈🎈🎈

arXiv DreamStyle: A Unified Framework for Video Stylization (Visual, Pose2Video) 【字节跳动智能创作实验室 】


[2026/01/06] V17.5 Vision: Update Methods. Happy New Year!🎈🎈🎈

arXiv MagicFight: Personalized Martial Arts Combat Video Generation (Visual, Pose2Video) 【深圳先进技术研究院、中国电信云技术有限公司、深圳理工大学 】

arXiv ESGaussianFace: Emotional and Stylized Audio-Driven Facial Animation via 3D Gaussian Splatting (Audio, Fine-Grained Style and Emotion-Driven Animation) 【上海交通大学、微软亚洲研究院 】

arXiv DreamID-V:Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer (Visual, Portrait Animation) 【清华大学、字节跳动智能创作实验室 】

arXiv Slot-ID: Identity-Preserving Video Generation from Reference Videos via Slot-Based Temporal Identity Encoding (Text, Text2Face) 【浙江大学 CAD&CG 国家重点实验室、伦敦大学学院计算机科学系 】


[2026/01/02] V17.4 Vision: Update Methods. Happy New Year!🎈🎈🎈

arXiv Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation (Audio, Audio-Driven Holistic Body Driving)


[2026/01/01] V17.3 Vision: Update Methods. Happy New Year!🎈🎈🎈

arXiv From Inpainting to Editing: A Self-Bootstrapping Framework for Context-Rich Visual Dubbing (Audio, Lip Synchronization)

arXiv DyStream: Streaming Dyadic Talking Heads Generation via Flow Matching-based Autoregressive Model (Audio, Lip Synchronization)


[2025/12/31] V17.2 Vision: Update Methods.

arXiv LiveTalk: Real-Time Multimodal Interactive Video Diffusion via Improved On-Policy Distillation (Audio, Audio-Driven Holistic Body Driving)

arXiv SoulX-LiveTalk Technical Report (Audio, Audio-Driven Holistic Body Driving)

arXiv ByteLoom: Weaving Geometry-Consistent Human-Object Interactions through Progressive Curriculum Learning (Audio, Audio-Driven Holistic Body Driving)

arXiv MoFu: Scale-Aware Modulation and Fourier Fusion for Multi-Subject Video Generation (Visual, Pose2Video)


[2025/12/29] V17.1 Vision: Update Methods.

arXiv StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars (Audio, Audio-Driven Holistic Body Driving)

arXiv Knot Forcing: Taming Autoregressive Video Diffusion Models for Real-time Infinite Interactive Portrait Animation (Audio, Audio-Driven Holistic Body Driving)

arXiv High-Fidelity and Long-Duration Human Image Animation with Diffusion Transformer (Visual, Pose-Guided Dance Video Generation)

arXiv SyncAnyone: Implicit Disentanglement via Progressive Self-Correction for Lip-Syncing in the wild (Audio, Lip Synchronization)


[2025/12/24] V17.0 Vision: Update Methods.

arXiv The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection (Visual, Try-On Video Generation)

arXiv TAVID: Text-Driven Audio-Visual Interactive Dialogue Generation (Audio, Lip Synchronization)


[2025/12/23] V16.9 Vision: Update Methods.

arXiv ActAvatar: Temporally-Aware Precise Action Control for Talking Avatars (Audio, Audio-Driven Holistic Body Driving)

arXiv In-Context Audio Control of Video Diffusion Transformers (Audio, Audio-Driven Holistic Body Driving)

arXiv MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video Generation (Audio, Audio-Driven Holistic Body Driving)

arXiv EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer (Text, Text2MotionVideo)


[2025/12/22] V16.8 Vision: Update Methods.

arXiv SynergyWarpNet: Attention-Guided Cooperative Warping for Neural Portrait Animation (Visual, Portrait Animation)


[2025/12/19] V16.7 Vision: Update Methods.

arXiv FlashPortrait: 6x Faster Infinite Portrait Animation with Adaptive Latent Prediction (Visual, Portrait Animation)

arXiv EverybodyDance: Bipartite Graph-Based Identity Correspondence for Multi-Character Animation (Visual, Pose-Guided Dance Video Generation)


[2025/12/18] V16.6 Vision: Update Methods.

arXiv DeX-Portrait: Disentangled and Expressive Portrait Animation via Explicit and Latent Motion Representations (Visual, Portrait Animation)

arXiv HiFi-Portrait: Zero-shot Identity-preserved Portrait Generation with High-fidelity Multi-face Fusion (Visual, Portrait Animation)

arXiv TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation (Audio, Head Pose Driving)

arXiv FacEDiT: Unified Talking Face Editing and Generation via Facial Motion Infilling (Audio, Head Pose Driving)


[2025/12/16] V16.5 Vision: Update Methods.

arXiv Soul: Breathe Life into Digital Human for High-fidelity Long-term Multimodal Animation (Visual, Pose2Video)

arXiv PoseAnything: Universal Pose-guided Video Generation with Part-aware Temporal Coherence (Visual, Pose2Video)

arXiv KlingAvatar 2.0 Technical Report (Audio, Audio-Driven Holistic Body Driving)

arXiv STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits (Audio, Head Pose Driving)


[2025/12/15] V16.4 Vision: Update Methods.

arXiv JoyAvatar: Real-time and Infinite Audio-Driven Avatar Generation with Autoregressive Diffusion (Audio, Head Pose Driving)

arXiv REST: Diffusion-based Real-time End-to-end Streaming Talking Head Generation via ID-Context Caching and Asynchronous Streaming Distillation (Audio, Head Pose Driving)

arXiv PersonaLive! Expressive Portrait Image Animation for Live Streaming (Visual, Portrait Animation)


[2025/12/09] V16.3 Vision: Update Methods.

arXiv ViSA: 3D-Aware Video Shading for Real-Time Upper-Body Avatar Creation (Visual, Pose2Video)


[2025/12/08] V16.2 Vision: Update Methods.

arXiv SCAIL: Towards Studio-Grade Character Animation via In-Context Learning of 3D-Consistent Pose Representations (Visual, Pose2Video)


[2025/12/05] V16.1 Vision: Update Methods.

arXiv Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length (Audio, Audio-Driven Holistic Body Driving)


[2025/12/04] V16.0 Vision: Update Methods.

arXiv UniMo: Unifying 2D Video and 3D Human Motion with an Autoregressive Framework (Visual, Pose2Video)


[2025/12/03] V15.9 Vision: Update Methods.

arXiv Co-speech Gesture Video Generation via Motion-Based Graph Retrieval (Audio, Audio-Driven Holistic Body Driving)

arXiv YingVideo-MV: Music-Driven Multi-Stage Video Generation (Audio, Audio-Driven Holistic Body Driving)


[2025/12/02] V15.8 Vision: Update Methods.

arXiv EvalTalker: Learning to Evaluate Real-Portrait-Driven Multi-Subject Talking Humans (Audio, Audio-Driven Holistic Body Driving)

arXiv TalkingPose: Efficient Face and Gesture Animation with Feedback-guided Diffusion Model (Audio, Audio-Driven Holistic Body Driving)


[2025/12/01] V15.7 Vision: Update Methods.

arXiv One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer (Visual, Pose2Video)

arXiv IMTalker: Efficient Audio-driven Talking Face Generation with Implicit Motion Transfer (Audio, Head Pose Driving)

arXiv AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity Refinement (Audio, Audio-Driven Holistic Body Driving)


[2025/11/25] V15.6 Vision: Update Methods.

arXiv SteadyDancer: Harmonized and Coherent Human Image Animation with First-Frame Preservation (Visual, Pose-Guided Dance Video Generation)

arXiv Eevee: Towards Close-up High-resolution Video-based Virtual Try-on (Visual, Try-On Video Generation)


[2025/11/11] V15.5 Vision: Update Methods.

arXiv ConsistTalk: Intensity Controllable Temporally Consistent Talking Head Generation with Diffusion Noise Search (Audio, Head Pose Driving)


Historical Update.

[2025/11/10] V15.4 Vision: Update Methods.

arXiv Shared Latent Representation for Joint Text-to-Audio-Visual Synthesis (Audio, Lip Synchronization)


[2025/11/04] V15.3 Vision: Update Methods.

arXiv ID-Composer: Multi-Subject Video Synthesis with Hierarchical Identity Preservation (Visual, Pose2Video)

arXiv Multi-View Consistent Human Image Customization via In-Context Learning (Visual, Pose2Video)


[2025/11/03] V15.2 Vision: Update Methods.

arXiv See the Speaker: Crafting High-Resolution Talking Faces from Speech with Prior Guidance and Region Refinement (Audio, Lip Synchronization)


[2025/10/28] V15.1 Vision: Update Methods.

arXiv MAGIC-Talk: Motion-aware Audio-Driven Talking Face Generation with Customizable Identity Control (Audio, Head Pose Driving)

arXiv Lookahead Anchoring: Preserving Character Identity in Audio-Driven Human Animation (Audio, Head Pose Driving)


[2025/10/21] V15.0 Vision: Update Methods.

arXiv From Mannequin to Human: A Pose-Aware and Identity-Preserving Video Generation Framework for Lifelike Clothing Display (Visual, Try-On Video Generation)


[2025/10/17] V14.9 Vision: Update Methods.

arXiv Identity-Preserving Image-to-Video Generation via Reward-Guided Optimization (Visual, Pose2Video)


[2025/10/15] V14.8 Vision: Update Methods.

arXiv Playmate2: Training-Free Multi-Character Audio-Driven Animation via Diffusion Transformer with Reward Feedback (Audio, Audio-Driven Holistic Body Driving)


[2025/10/14] V14.7 Vision: Update Methods.

arXiv DEMO: Disentangled Motion Latent Flow Matching for Fine-Grained Controllable Talking Portrait Synthesis (Audio, Head Pose Driving)

arXiv VividAnimator: An End-to-End Audio and Pose-driven Half-Body Human Animation Framework (Audio, Audio-Driven Holistic Body Driving)


[2025/10/12] V14.6 Vision: Update Methods.

arXiv Once Is Enough: Lightweight DiT-Based Video Virtual Try-On via One-Time Garment Appearance Injection (Visual, Try-On Video Generation)


[2025/10/09] V14.5 Vision: Update Methods.

arXiv A Bridge from Audio to Video: Phoneme-Viseme Alignment Allows Every Face to Speak Multiple Languages (Audio, Head Pose Driving)


[2025/10/06] V14.4 Vision: Update Methods.

arXiv Input-Aware Sparse Attention for Real-Time Co-Speech Video Generation (Audio, Audio-Driven Holistic Body Driving)


[2025/10/03] V14.3 Vision: Update Methods.

arXiv Audio Driven Real-Time Facial Animation for Social Telepresence (Audio, Head Pose Driving)


[2025/09/30] V14.2 Vision: Update Methods.

arXiv StableDub: Taming Diffusion Prior for Generalized and Efficient Visual Dubbing (Audio, Lip Synchronization)

arXiv X-Streamer: Unified Human World Modeling with Audiovisual Interaction (Audio, Head Pose Driving)

arXiv ControlHair: Physically-based Video Diffusion for Controllable Dynamic Hair Rendering (Visual, Pose2Video)


[2025/09/26] V14.1 Vision: Update Methods.

arXiv SynchroRaMa : Lip-Synchronized and Emotion-Aware Talking Face Generation via Multi-Modal Emotion Embedding (Audio, Head Pose Driving)

arXiv Talking Head Generation via AU-Guided Landmark Prediction (Audio, Head Pose Driving)

arXiv KSDiff: Keyframe-Augmented Speech-Aware Dual-Path Diffusion for Facial Animation (Audio, Head Pose Driving)


[2025/09/23] V14.0 Vision: Update Methods.

arXiv Stable Video-Driven Portraits (Visual, Portrait Animation)

arXiv Follow-Your-Emoji-Faster: Towards Efficient, Fine-Controllable, and Expressive Freestyle Portrait Animation (Visual, Portrait Animation)


[2025/09/18] V13.9 Vision: Update Methods.

arXiv Wan-Animate: Unified Character Animation and Replacement with Holistic Replication (Visual, Pose2Video)


[2025/09/16] V13.8 Vision: Update Methods.

arXiv AvatarSync: Rethinking Talking-Head Animation through Autoregressive Perspective (Audio, Head Pose Driving)


[2025/09/12] V13.7 Vision: Update Methods.

arXiv Kling-Avatar: Grounding Multimodal Instructions for Cascaded Long-Duration Avatar Animation Synthesis (Audio, Audio-Driven Holistic Body Driving)


[2025/09/05] V13.6 Vision: Update Methods.

arXiv Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement (Text, Text2Motion)


[2025/08/27] V13.5 Vision: Update Methods.

arXiv MoCo: Motion-Consistent Human Video Generation via Structure-Appearance Decoupling (Visual, Pose2Video)


[2025/08/21] V13.4 Vision: Update Methods.

arXiv Taming Transformer for Emotion-Controllable Talking Face Generation (Audio, Head Pose Driving)


[2025/08/20] V13.3 Vision: Update Methods.

arXiv InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing (Audio, Audio-Driven Holistic Body Driving)

arXiv EDTalk++: Full Disentanglement for Controllable Talking Head Synthesis (Audio, Head Pose Driving)


[2025/08/19] V13.2 Vision: Update Methods.

arXiv RealTalk: Realistic Emotion-Aware Lifelike Talking-Head Synthesis (Audio, Head Pose Driving)


[2025/08/18] V13.1 Vision: Update Methods.

arXiv FantasyTalking2: Timestep-Layer Adaptive Preference Optimization for Audio-Driven Portrait Animation (Audio, Audio-Driven Holistic Body Driving)


[2025/08/16] V13.0 Vision: Update Methods.

arXiv HM-Talker: Hybrid Motion Modeling for High-Fidelity Talking Head Synthesis (Audio, Head Pose Driving)


[2025/08/14] V12.9 Vision: Update Methods.

arXiv LIA-X: Interpretable Latent Portrait Animator (Visual, Portrait Animation)

arXiv HumanGenesis: Agent-Based Geometric and Generative Modeling for Synthetic Human Dynamics (Visual, Pose2Video)

arXiv From Large Angles to Consistent Faces: Identity-Preserving Video Generation via Mixture of Facial Experts (Text, Text2MotionVideo)

arXiv Animate-X++: Universal Character Image Animation with Dynamic Backgrounds (Visual, Pose2Video)

arXiv X-UniMotion: Animating Human Images with Expressive, Unified and Identity-Agnostic Motion Latents (Visual, Pose2Video)


[2025/08/13] V12.8 Vision: Update Methods.

arXiv ShoulderShot: Generating Over-the-Shoulder Dialogue Videos (Text, Text2MotionVideo)

arXiv Stand-In: A Lightweight and Plug-and-Play Identity Control for Video Generation (Text, Text2MotionVideo)

arXiv LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation (Text, Text2MotionVideo)

arXiv DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation (Audio, Head Pose Driving)

arXiv StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation (Audio, Head Pose Driving)

arXiv AnimateScene: Camera-controllable Animation in Any Scene (Visual, Pose2Video)

arXiv RealisMotion: Decomposed Human Motion Control and Video Generation in the World Space (Visual, Pose2Video)


[2025/08/08] V12.7 Vision: Update Methods.

arXiv RAP: Real-time Audio-driven Portrait Animation with Video Diffusion Transformer (Audio, Head Pose Driving)


[2025/08/07] V12.6 Vision: Update Methods.

arXiv Motion is the Choreographer: Learning Latent Pose Dynamics for Seamless Sign Language Generation (Visual, Pose2Video)


[2025/08/06] V12.5 Vision: Update Methods.

arXiv READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation (Audio, Head Pose Driving)

arXiv X-Actor: Emotional and Expressive Long-Range Portrait Acting from Audio (Audio, Head Pose Driving)

arXiv MoCA: Identity-Preserving Text-to-Video Generation via Mixture of Cross Attention (Text, Text2Face)

arXiv DreamVVT: Mastering Realistic Video Virtual Try-On in the Wild via a Stage-Wise Diffusion Transformer Framework (Visual, Try-On)


[2025/08/05] V12.4 Vision: Update Methods.

arXiv Text2Lip: Progressive Lip-Synced Talking Face Generation from Text via Viseme-Guided Rendering (Text, Text2Face)


[2025/08/01] V12.3 Vision: Update Methods.

arXiv X-NeMo: Expressive Neural Motion Reenactment via Disentangled Latent Attention (Visual, Portrait Animation)


[2025/07/29] V12.2 Vision: Update Methods.

arXiv Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation (Audio, Head Pose Driving)

arXiv ChoreoMuse: Robust Music-to-Dance Video Generation with Style Transfer and Beat-Adherent Motion (Audio, Audio-Driven Holistic Body Driving)


[2025/07/28] V12.1 Vision: Update Methods.

arXiv Livatar-1: Real-Time Talking Heads Generation with Tailored Flow Matching (Audio, Head Pose Driving)

arXiv Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation (Audio, Head Pose Driving)


[2025/07/24] V12.0 Vision: Update Methods.

arXiv CartoonAlive: Towards Expressive Live2D Modeling from Single Portraits (Visual, Portrait Animation)


[2025/07/23] V11.9 Vision: Update Methods.

arXiv HOComp: Interaction-Aware Human-Object Composition (Visual, Pose2Video)

arXiv Navigating Large-Pose Challenge for High-Fidelity Face Reenactment with Video Diffusion Model (Visual, Portrait Animation)


[2025/07/22] V11.8 Vision: Update Methods.

arXiv StableAnimator++: Overcoming Pose Misalignment and Face Distortion for Human Image Animation (Visual, Pose-Guided Dance Video Generation)


[2025/07/20] V11.7 Vision: Update Methods.

arXiv FantasyPortrait: Enhancing Multi-Character Portrait Animation with Expression-Augmented Diffusion Transformers (Text, Text2Face)

arXiv ATL-Diff: Audio-Driven Talking Head Generation with Early Landmarks-Guide Noise Diffusion (Audio, Head Pose Driving)

arXiv Think-Before-Draw: Decomposing Emotion Semantics & Fine-Grained Controllable Expressive Talking Head Generation (Audio, Head Pose Driving)

arXiv M2DAO-Talker: Harmonizing Multi-granular Motion Decoupling and Alternating Optimization for Talking-head Generation (Audio, Head Pose Driving)

arXiv HairShifter: Consistent and High-Fidelity Video Hair Transfer via Anchor-Guided Animation (Visual, Portrait Animation)


[2025/07/12] V11.6 Vision: Update Methods.

arXiv Stable-Hair v2: Real-World Hair Transfer via Multiple-View Diffusion Model (Visual, Portrait Animation)


[2025/07/10] V11.5 Vision: Update Methods.

arXiv Democratizing High-Fidelity Co-Speech Gesture Video Generation (Audio, Audio-Driven Holistic Body Driving)


[2025/07/09] V11.4 Vision: Update Methods.

arXiv MEDTalk: Multimodal Controlled 3D Facial Animation with Dynamic Emotions by Disentangled Embedding (Audio, Head Pose Driving)


[2025/07/08] V11.3 Vision: Update Methods.

arXiv MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation (Audio, Head Pose Driving)

arXiv MoDA: Multi-modal Diffusion Architecture for Talking Head Generation (Audio, Head Pose Driving)

arXiv EchoMimicV3: 1.3B Parameters are All You Need for Unified Multi-Modal and Multi-Task Human Animation (Audio, Audio-Driven Holistic Body Driving)

arXiv Identity-Preserving Text-to-Video Generation Guided by Simple yet Effective Spatial-Temporal Decoupled Representations (Text, Text2MotionVideo)


[2025/07/04] V11.2 Vision: Update Methods.

arXiv CanonSwap: High-Fidelity and Consistent Video Face Swapping via Canonical Space Modulation (Visual, Portrait Animation)


[2025/07/03] V11.1 Vision: Update Methods.

arXiv FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases (Audio, Head Pose Driving)

arXiv ARIG: Autoregressive Interactive Head Generation for Real-time Conversations (Audio, Head Pose Driving)

arXiv JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching (Audio, Head Pose Driving)

arXiv GGTalker: Talking Head Systhesis with Generalizable Gaussian Priors and Identity-Specific Adaptation (Audio, Head Pose Driving)

arXiv Bind-Your-Avatar: Multi-Talking-Character Video Generation with Dynamic 3D-mask-based Embedding Router (Audio, Head Pose Driving)

arXiv Populate-A-Scene: Affordance-Aware Human Video Generation (Visual, Pose2Video)

arXiv Proteus-ID: ID-Consistent and Motion-Coherent Video Customization (Text, Text2MotionVideo)

arXiv MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation (Audio, Audio-Driven Holistic Body Driving)

arXiv Video Virtual Try-on with Conditional Diffusion Transformer Inpainter (Visual, Try-On Video Generation)


[2025/06/24] V11.0 Vision: Update Methods.

arXiv OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation (Audio, Audio-Driven Holistic Body Driving)


[2025/06/23] V10.9 Vision: Update Methods.

arXiv Controllable and Expressive One-Shot Video Head Swapping (Visual, Portrait Animation)

arXiv EchoShot: Multi-Shot Portrait Video Generation (Text, Text2MotionVideo)


[2025/06/18] V10.8 Vision: Update Methods.

arXiv 3D Hand Mesh-Guided AI-Generated Malformed Hand Refinement with Hand Pose Transformation via Diffusion Model (Visual, Pose-Guided Dance Video Generation)

arXiv AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation (Audio, Audio-Driven Holistic Body Driving)

arXiv Audio-Visual Driven Compression for Low-Bitrate Talking Head Videos (Audio, Head Pose Driving)


[2025/06/13] V10.7 Vision: Update Methods.

arXiv Low-Barrier Dataset Collection with Real Human Body for Interactive Per-Garment Virtual Try-On (Visual, Try-On Video Generation)

arXiv DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers (Visual, Pose2Video)


[2025/06/12] V10.6 Vision: Update Methods.

arXiv Synthetic Human Action Video Data Generation with Pose Transfer (Visual, Pose2Video)

arXiv InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio Conditions (Audio, Audio-Driven Holistic Body Driving)


[2025/06/09] V10.5 Vision: Update Methods.

arXiv ChronoTailor: Harnessing Attention Guidance for Fine-Grained Video Virtual Try-On (Visual, Try-On Video Generation)

arXiv LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models (Audio, Head Pose Driving)


[2025/06/04] V10.4 Vision: Update Methods.

arXiv OmniV2V: Versatile Video Generation and Editing via Dynamic Content Manipulation (Visual, Pose-Guided Dance Video Generation)

arXiv SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers (Audio, Head Pose Driving)


[2025/06/03] V10.3 Vision: Update Methods.

arXiv DreamDance: Animating Character Art via Inpainting Stable Gaussian Worlds (Visual, Pose-Guided Dance Video Generation)


[2025/05/30] V10.2 Vision: Update Methods.

arXiv HyperMotion: DiT-Based Pose-Guided Human Image Animation of Complex Motions (Visual, Pose-Guided Dance Video Generation)

arXiv How Animals Dance (When You're Not Looking) (Visual, Pose-Guided Dance Video Generation)

arXiv Video Editing for Audio-Visual Dubbing (Audio, Lip Synchronization)

arXiv Hallo4: High-Fidelity Dynamic Portrait Animation via Direct Preference Optimization and Temporal Motion Modulation (Audio, Head Pose Driving)

arXiv MMGT: Motion Mask Guided Two-Stage Network for Co-Speech Gesture Video Generation (Audio, Audio-Driven Holistic Body Driving)


[2025/05/29] V10.1 Vision: Update Methods.

arXiv LatentMove: Towards Complex Human Movement Video Generation (Visual, Pose-Guided Dance Video Generation)

arXiv Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation (Audio, Head Pose Driving)

arXiv FaceEditTalker: Interactive Talking Head Generation with Facial Attribute Editing (Audio, Head Pose Driving)

arXiv OmniResponse: Online Multimodal Conversational Response Generation in Dyadic Interactions (LLM, Large Lanuge Model Planer)


[2025/05/28] V10.0 Vision: Update Methods.

arXiv MagicTryOn: Harnessing Diffusion Transformer for Garment-Preserving Video Virtual Try-on (Visual, Try-On Video Generation)

arXiv OmniSync: Towards Universal Lip Synchronization via Diffusion Transformers (Audio, Head Pose Driving)


[2025/05/27] V9.9 Vision: Update Methods.

arXiv DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation (Visual, Video-Guided Dance Video Generation)

arXiv HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters (Visual, Audio-Driven Holistic Body Driving)

arXiv AniCrafter: Customizing Realistic Human-Centric Animation via Avatar-Background Conditioning in Video Diffusion Models (Visual, Pose2Video)


[2025/05/23] V9.8 Vision: Update Methods.

arXiv Interspatial Attention for Efficient 4D Human Video Generation (Visual, Pose-Guided Dance Video Generation)


[2025/05/13] V9.7 Vision: Update Methods.

arXiv ProFashion: Prototype-guided Fashion Video Generation with Multiple Reference Images (Visual, Try-On Video Generation)


[2025/05/09] V9.6 Vision: Update Methods.

arXiv FlexiAct: Towards Flexible Action Control in Heterogeneous Scenarios (Visual, Video-Guided Dance Video Generation)

arXiv PAHA: Parts-Aware Audio-Driven Human Animation with Diffusion Model (Audio, Audio-Driven Holistic Body Driving)

arXiv HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation (Audio, Audio-Driven Holistic Body Driving)


[2025/05/01] V9.5 Vision: Update Methods.

arXiv MagicPortrait: Temporally Consistent Face Reenactment with 3D Geometric Guidance (Visual, Portrait Animation)


[2025/04/30] V9.4 Vision: Update Methods.

arXiv RealisDance-DiT: Simple yet Strong Baseline towards Controllable Character Animation in the Wild (Visual, Pose-Guided Dance Video Generation)

arXiv AnimateAnywhere: Rouse the Background in Human Image Animation (Visual, Pose-Guided Dance Video Generation)

arXiv IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos (Visual, Portrait Animation)

arXiv 3DV-TON: Textured 3D-Guided Consistent Video Try-on via Diffusion Models (Visual, Try-On Video Generation)

arXiv Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning (Audio, Head Pose Driving)

arXiv Disentangle Identity, Cooperate Emotion: Correlation-Aware Emotional Talking Portrait Generation (Audio, Head Pose Driving)


[2025/04/16] V9.3 Vision: Update Methods.

arXiv UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer (Visual, Pose-Guided Dance Video Generation)

arXiv InterAnimate: Taming Region-aware Diffusion Model for Realistic Human Interaction Animation (Visual, Portrait Animation)


[2025/04/14] V9.2 Vision: Update Methods.

arXiv TokenMotion: Decoupled Motion Control via Token Disentanglement for Human-centric Video Generation (Visual, Pose-Guided Dance Video Generation)

arXiv EasyGenNet: An Efficient Framework for Audio-Driven Gesture Video Generation Based on Diffusion Model (Audio, Audio-Driven Holistic Body Driving)


[2025/04/09] V9.1 Vision: Update Methods.

arXiv Multi-identity Human Image Animation with Structural Video Diffusion (Visual, Pose-Guided Dance Video Generation)

arXiv FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis (Audio, Head Pose Driving)

arXiv SE4Lip: Speech-Lip Encoder for Talking Head Synthesis to Solve Phoneme-Viseme Alignment Ambiguity (Audio, Head Pose Driving)

arXiv Exploiting Temporal Audio-Visual Correlation Embedding for Audio-Driven One-Shot Talking Head Animation (Audio, Head Pose Driving)

arXiv FluentLip: A Phonemes-Based Two-stage Approach for Audio-Driven Lip Synthesis with Optical Flow Consistency (Audio, Lip Synchronization)


[2025/04/04] V9.0 Vision: Update Methods.

arXiv DreamActor-M1: Holistic, Expressive and Robust Human Image Animation with Hybrid Guidance (Visual, Video-Guided Dance Video Generation)

arXiv OmniTalker: Real-Time Text-Driven Talking Head Generation with In-Context Audio-Visual Style Replication (Text, Text2Face)

arXiv Audio-visual Controlled Video Diffusion with Masked Selective State Spaces Modeling for Natural Talking Head Generation (Audio, Head Pose Driving)

arXiv VoiceCraft-Dub: Automated Video Dubbing with Neural Codec Language Models (Audio, Head Pose Driving)


[2025/04/02] V8.9 Vision: Update Methods.

arXiv Monocular and Generalizable Gaussian Talking Head Animation (Audio, Head Pose Driving)


[2025/04/01] V8.8 Vision: Update Methods.

arXiv HumanDreamer: Generating Controllable Human-Motion Videos via Decoupled Generation (Text, Text2MotionVideo)

arXiv Dual Audio-Centric Modality Coupling for Talking Head Generation (Audio, Head Pose Driving)


[2025/03/31] V8.7 Vision: Update Methods.

arXiv Follow Your Motion: A Generic Temporal Consistency Portrait Editing Framework with Trajectory Guidance (Visual, Pose2Video)

arXiv High-Fidelity Diffusion Face Swapping with ID-Constrained Facial Conditioning (Visual, Portrait Animation)

arXiv Audio-Plane: Audio Factorization Plane Gaussian Splatting for Real-Time Talking Head Synthesis (Audio, Head Pose Driving)


[2025/03/26] V8.6 Vision: Update Methods.

arXiv EmoHead: Emotional Talking Head via Manipulating Semantic Expression Parameters (Audio, Fine-Grained Style and Emotion-Driven Animation)

arXiv MVPortrait: Text-Guided Motion and Emotion Control for Multi-view Vivid Portrait Animation (Audio, Fine-Grained Style and Emotion-Driven Animation)

arXiv DisentTalk: Cross-lingual Talking Face Generation via Semantic Disentangled Diffusion Model (Audio, Fine-Grained Style and Emotion-Driven Animation)

arXiv AudCast: Audio-Driven Human Video Generation by Cascaded Diffusion Transformers (Audio, Audio-Driven Holistic Body Driving)


[2025/03/25] V8.5 Vision: Update Methods.

arXiv HunyuanPortrait: Implicit Condition Control for Enhanced Portrait Animation (Visual, Portrait Animation)

arXiv EvAnimate: Event-conditioned Image-to-Video Generation for Human Animation (Visual, Pose-Guided Dance Video Generation)

arXiv Teller: Real-Time Streaming Audio-Driven Portrait Animation with Autoregressive Motion Generation (Audio, Head Pose Driving)


[2025/03/24] V8.4 Vision: Update Methods.

arXiv Re-HOLD: Video Hand Object Interaction Reenactment via adaptive Layout-instructed Diffusion Model (Visual, Pose2Video)


[2025/03/21] V8.3 Vision: Update Methods.

arXiv Text-Driven Diffusion Model for Sign Language Production (Text, Text2MotionVideo)


[2025/03/20] V8.2 Vision: Update Methods.

arXiv Cafe-Talk: Generating 3D Talking Face Animation with Multimodal Coarse- and Fine-grained Control (Audio, Head Pose Driving)


[2025/03/19] V8.1 Vision: Update Methods.

arXiv Concat-ID: Towards Universal Identity-Preserving Video Synthesis (Text, Text2Face)

arXiv PC-Talk: Precise Facial Animation Control for Audio-Driven Talking Face Generation (Audio, Head Pose Driving)

arXiv MusicInfuser: Making Video Diffusion Listen and Dance (Audio, Audio-Driven Holistic Body Driving)


[2025/03/18] V8.0 Vision: Update Methods.

arXiv RASA: Replace Anyone, Say Anything -- A Training-Free Framework for Audio-Driven and Universal Portrait Video Editing (Audio, Head Pose Driving)

arXiv MagicID: Hybrid Preference Optimization for ID-Consistent and Dynamic-Preserved Video Customization (Text, Text2MotionVideo)

arXiv Snapmoji: Instant Generation of Animatable Dual-Stylized Avatars (Visual, Portrait Animation)


[2025/03/15] V7.9 Vision: Update Methods.

arXiv Semantic Latent Motion for Portrait Video Generation (Visual, Portrait Animation)

arXiv Cosh-DiT: Co-Speech Gesture Video Synthesis via Hybrid Audio-Visual Diffusion Transformers (Audio, Audio-Driven Holistic Body Driving)


[2025/03/13] V7.8 Vision: Update Methods.

arXiv SwapAnyone: Consistent and Realistic Video Synthesis for Swapping Any Person into Any Video (Visual, Pose2Video)

arXiv Versatile Multimodal Controls for Whole-Body Talking Human Animation (Audio, Audio-Driven Holistic Body Driving)


[2025/03/11] V7.7 Vision: Update Methods.

arXiv DynamicID: Zero-Shot Multi-ID Image Personalization with Flexible Facial Editability (Text, Text2Face)


[2025/03/07] V7.6 Vision: Update Methods.

arXiv FREAK: Frequency-modulated High-fidelity and Real-time Audio-driven Talking Portrait Synthesis (Audio, Head Pose Driving)


[2025/03/05] V7.5 Vision: Update Methods.

arXiv FaceShot: Bring Any Character into Life (Visual, Portrait Animation)

arXiv KeyFace: Expressive Audio-Driven Facial Animation for Long Sequences via KeyFrame Interpolation (Audio, Head Pose Driving)


[2025/02/28] V7.4 Vision: Update Methods.

arXiv High-Fidelity Relightable Monocular Portrait Animation with Lighting-Controllable Video Diffusion Model (Visual, Portrait Animation)

arXiv InsTaG: Learning Personalized 3D Talking Head from Few-Second Video (Audio, Head Pose Driving)


[2025/02/26] V7.3 Vision: Update Methods.

arXiv FantasyID: Face Knowledge Enhanced ID-Preserving Video Generation (Text, Text2MotionVideo)


[2025/02/25] V7.2 Vision: Update Methods.

arXiv X-Dancer: Expressive Music to Human Dance Video Generation (Audio, Audio-Driven Holistic Body Driving)

arXiv Dimitra: Audio-driven Diffusion model for Expressive Talking Head Generation (Audio, Head Pose Driving)


[2025/02/21] V7.1 Vision: Update Methods.

arXiv NeRF-3DTalker: Neural Radiance Field with 3D Prior Aided Audio Disentanglement for Talking Head Synthesis (Audio, Head Pose Driving)


[2025/02/18] V7.0 Vision: Update Methods.

arXiv HumanGif: Single-View Human Diffusion with Generative Prior (Visual, Pose-Guided Dance Video Generation)

arXiv SayAnything: Audio-Driven Lip Synchronization with Conditional Video Diffusion (Audio, Head Pose Driving)

arXiv SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers (Audio, Head Pose Driving)


[2025/02/16] V6.9 Vision: Update Methods.

arXiv Long-Term TalkingFace Generation via Motion-Prior Conditional Diffusion Model (Audio, Head Pose Driving)


[2025/02/13] V6.8 Vision: Update Methods.

arXiv AnyCharV: Bootstrap Controllable Character Video Generation with Fine-to-Coarse Guidance (Visual, Pose-Guided Dance Video Generation)


[2025/02/12] V6.7 Vision: Update Methods. Happy 2025 !!🍟

arXiv Contextual Gesture: Co-Speech Gesture Video Generation through Context-aware Gesture Representation (Audio, Audio-Driven Holistic Body Driving)

arXiv Playmate: Flexible Control of Portrait Animation via 3D-Implicit Space Guided Diffusion (Audio, Fine-Grained Style and Emotion-Driven Animation)


[2025/02/11] V6.6 Vision: Update Methods. Happy 2025 !!🍟

arXiv Animate Anyone 2: High-Fidelity Character Image Animation with Environment Affordance (Visal, Pose-Guided Dance Video Generation)


[2025/02/10] V6.5 Vision: Update Methods. Happy 2025 !!🍟

arXiv HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation (Visal, Pose2Video)


[2025/02/04] V6.4 Vision: Update Methods. Happy 2025 !!🍟

arXiv EmoTalkingGaussian: Continuous Emotion-conditioned Talking Head Synthesis (Audio, Head Pose Driving)

arXiv OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models (Audio, Audio-Driven Holistic Body Driving)


[2025/02/03] V6.3 Vision: Update Methods. Happy 2025 !!🍟

arXiv Every Image Listens, Every Image Dances: Music-Driven Image Animation (Audio, Audio-Driven Holistic Body Driving)


[2025/01/30] V6.2 Vision: Update Methods. Happy 2025 !!🍟

arXiv Learning Semantic Facial Descriptors for Accurate Face Animation (Visual, Portrait Animation)


[2025/01/28] V6.1 Vision: Update Methods. Happy 2025 !!🍟

arXiv SyncAnimation: A Real-Time End-to-End Framework for Audio-Driven Human Pose and Talking Head Animation (Audio, Head Pose Driving)


[2025/01/24] V6.0 Vision: Update Methods. Happy New Year🍟

arXiv EchoVideo: Identity-Preserving Human Video Generation by Multimodal Feature Fusion (Text, Text2MotionVideo)


[2025/01/22] V5.9 Vision: Update Methods. Happy New Year🎀

arXiv CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation (Visual, Try-On Video Generation)

arXiv EMO2: End-Effector Guided Audio-Driven Avatar Video Generation (Audio, Audio-Driven Holistic Body Driving)


[2025/01/20] V5.8 Vision: Update Methods. Happy New Year🎀

arXiv X-Dyna: Expressive Dynamic Human Image Animation (Visual, Pose-Guided Dance Video Generation)

arXiv Textoon: Generating Vivid 2D Cartoon Characters from Text Descriptions (Text, Text2Motion)


[2025/01/18] V5.7 Vision: Update Methods. Happy New Year🎀

arXiv RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency (Visual, Try-On Video Generation)

arXiv DynamicFace: High-Quality and Consistent Video Face Swapping using Composable 3D Facial Priors (Visual, Portrait Animation)


[2025/01/16] V5.6 Vision: Update Methods. Happy New Year🎀

arXiv Qffusion: Controllable Portrait Video Editing via Quadrant-Grid Attention Learning (Visual, Portrait Animation)


[2025/01/14] V5.5 Vision: Update Methods. Happy New Year🎀

arXiv Identity-Preserving Video Dubbing Using Motion Warping (Audio, Lip Synchronization)


[2025/01/13] V5.4 Vision: Update Methods. Happy New Year🎀

arXiv Ingredients: Blending Custom Photos with Video Diffusion Transformers (Text, Text2MotionVideo)

arXiv Magic Mirror: ID-Preserved Video Generation in Video Diffusion Transformers (Text, Text2MotionVideo)


[2025/01/12] V5.3 Vision: Update Methods. Happy New Year🎀

arXiv MoEE: Mixture of Emotion Experts for Audio-Driven Portrait Animation (Audio, Head Pose Driving)


[2025/01/11] V5.2 Vision: Update Methods. Happy New Year🎀

arXiv UniAvatar: Taming Lifelike Audio-Driven Talking Head Generation with Comprehensive Motion and Lighting Control (Audio, Head Pose Driving)


[2025/01/10] V5.1 Vision: Update Methods. Happy New Year🎀

arXiv RAIN: Real-time Animation of Infinite Video Stream (Visual, Portrait Animation)

arXiv VideoMaker: Zero-shot Customized Video Generation with the Inherent Force of Video Diffusion Models (Text, Text2Face)


[2025/01/06] V5.0 Vision: Update Methods. Happy New Year🎀

arXiv Free-viewpoint Human Animation with Pose-correlated Reference Selection (Visual, Pose-Guided Dance Video Generation)

arXiv ManiVideo: Generating Hand-Object Manipulation Video with Dexterous and Generalizable Grasping (Visual, Pose2Video)

arXiv Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance (Text, Text2MotionVideo)


[2025/01/04] V4.9 Vision: Update Methods. Happy New Year🎀

arXiv Consistent Human Image and Video Generation with Spatially Conditioned Diffusion (Visual, Pose-Guided Dance Video Generation)


[2024/12/17] V4.8 Vision: Update Methods.

arXiv VividFace: A Diffusion-Based Hybrid Framework for High-Fidelity Video Face Swapping (Visual, Portrait Animation)

arXiv VQTalker: Towards Multilingual Talking Avatars through Facial Motion Tokenization (Audio, Fine-Grained Style and Emotion-Driven Animation)

arXiv Dynamic Try-On: Taming Video Virtual Try-on with Dynamic Attention Mechanism (Visual, Try-On Video Generation)

arXiv SwiftTry: Fast and Consistent Video Virtual Try-On with Diffusion Models (Visual, Try-On Video Generation)


[2024/12/15] V4.7 Vision: Update Methods.

arXiv LatentSync: Audio Conditioned Latent Diffusion Models for Lip Sync (Audio, Lip Synchronization)

arXiv GoHD: Gaze-oriented and Highly Disentangled Portrait Animation with Rhythmic Poses and Realistic Expression (Audio, Head Pose Driving)

arXiv PortraitTalk: Towards Customizable One-Shot Audio-to-Talking Face Generation (Audio, Head Pose Driving)

arXiv IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation (Audio, Head Pose Driving)

arXiv INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations (Audio, Head Pose Driving)

arXiv MEMO: Memory-Guided Diffusion for Expressive Talking Video Generation (Audio, Head Pose Driving)

arXiv DisPose: Disentangling Pose Guidance for Controllable Human Image Animation (Visual, Pose-Guided Dance Video Generation)


[2024/12/11] V4.6 Vision: Update Methods.

arXiv PEMF-VVTO: Point-Enhanced Video Virtual Try-on via Mask-free Paradigm (Visual, Try-On Video Generation)

arXiv SINGER: Vivid Audio-driven Singing Video Generation with Multi-scale Spectral Diffusion Model (Audio, Head Pose Driving)

arXiv EmojiDiff: Advanced Facial Expression Control with High Identity Preservation in Portrait Generation (Visual, Portrait Animation)

arXiv Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Diffusion Transformer Networks (Visual, Portrait Animation)

arXiv FLOAT: Generative Motion Latent Flow Matching for Audio-driven Talking Portrait (Visual, Portrait Animation)

arXiv DreamDance: Animating Human Images by Enriching 3D Geometry Cues from 2D Poses (Visual, Pose-Guided Dance Video Generation)


[2024/12/02] V4.5 Vision: Update Methods.

arXiv LokiTalk: Learning Fine-Grained and Generalizable Correspondences to Enhance NeRF-based Talking Head Synthesis (Audio, Head Pose Driving)

arXiv Ditto: Motion-Space Diffusion for Controllable Realtime Talking Head Synthesis (Audio, Head Pose Driving)

arXiv Fleximo: Towards Flexible Text-to-Human Motion Video Generation (Text, Text2MotionVideo)


[2024/11/28] V4.4 Vision: Update Methods.

arXiv HiFiVFS: High Fidelity Video Face Swapping (Visual, Portrait Animation)

arXiv MotionCharacter: Identity-Preserving and Motion Controllable Human Video Generation (Text, Text2Face)

arXiv Identity-Preserving Text-to-Video Generation by Frequency Decomposition (Text, Text2Face)

arXiv AnchorCrafter: Animate CyberAnchors Saling Your Products via Human-Object Interacting Video Generation (Visual, Pose2Video)

arXiv PersonalVideo: High ID-Fidelity Video Customization without Dynamic and Semantic Degradation (Text, Text2Face)

arXiv LetsTalk: Latent Diffusion Transformer for Talking Video Synthesis (Audio, Fine-Grained Style and Emotion-Driven Animation)

arXiv EmotiveTalk: Expressive Talking Head Generation through Audio Information Decoupling and Emotional Video Diffusion (Audio, Fine-Grained Style and Emotion-Driven Animation)

arXiv Sonic: Shifting Focus to Global Audio Perception in Portrait Animation (Audio, Fine-Grained Style and Emotion-Driven Animation)

arXiv StableAnimator: High-Quality Identity-Preserving Human Image Animation (Visual, Pose-Guided Dance Video Generation)


[2024/11/25] V4.3 Vision: Update Methods.

arXiv FloAt: Flow Warping of Self-Attention for Clothing Animation Generation (Visual, Try-On Video Generation)


[2024/11/18] V4.2 Vision: Update Methods.

arXiv EchoMimicV2: Towards Striking, Simplified, and Semi-Body Human Animation (Audio, Audio-Driven Holistic Body Driving)


[2024/11/15 !WoW! More Star 100 🌟🌟🌟] V4.1 Vision: Update Methods.

arXiv JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation (Audio, Fine-Grained Style and Emotion-Driven Animation)

arXiv LES-Talker: Fine-Grained Emotion Editing for Talking Head Generation in Linear Emotion Space (Audio, Fine-Grained Style and Emotion-Driven Animation)


[2024/11/14]V4.0 Vision: Update Methods.

arXiv MikuDance: Animating Character Art with Mixed Motion Dynamics (Visual, Pose-Guided Dance Video Generation)


[2024/11/04]V3.9 Vision: Update Methods.

arXiv Fashion-VDM (Visual, Try-On Video Generation)

arXiv Towards High-fidelity Head Blending with Chroma Keying for Industrial Applications (Visual, Portrait Animation)


[2024/11/01]V3.8 Vision: Update Methods.

arXiv Stereo-Talker (Audio, Audio-Driven Holistic Body Driving)


[2024/10/29]V3.7 Vision: Update Methods.

arXiv MovieCharacter (Visual, Pose2Video)


[2024/10/24 Happy Coding Day!]V3.6 Vision: Update Methods.

arXiv EmoGene (Audio, Fine-Grained Style and Emotion-Driven Animation)

知乎文章 Find the Chinese version notes of the survey, welcome to pay attention.

[2024/10/21]V3.5 Vision: Update Methods.

arXiv Takin-ADA: Emotion Controllable Audio-Driven Animation with Canonical and Landmark Loss Optimization (Audio, Fine-Grained Style and Emotion-Driven Animation)


[2024/10/18]V3.4 Vision: Update Methods.

arXiv DAWN: Dynamic Frame Avatar with Non-autoregressive Diffusion Framework for Talking Head Video Generation (Audio, Head Pose Driving)


[2024/10/15]V3.3 Vision: Update Methods.

arXiv Tex4D (Text, Text2MotionVideo)

arXiv TALK-Act: Enhance Textural-Awareness for 2D Speaking Avatar Reenactment with Diffusion Model (Audio, Audio-Driven Holistic Body Driving)

arXiv Animate-X: Universal Character Image Animation with Enhanced Motion Representation (Visual, Pose-Guided Dance Video Generation)

arXiv MuseTalk: Real-Time High Quality Lip Synchronization with Latent Space Inpainting (Audio, Lip Synchronization)


[2024/10/11]V3.2 Vision: Update Methods.

arXiv Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation (Audio, Fine-Grained Style and Emotion-Driven Animation)


[2024/10/10]V3.1 Vision: Update Methods.

arXiv MimicTalk: Mimicking a personalized and expressive 3D talking face in minutes (Audio, Fine-Grained Style and Emotion-Driven Animation)


[2024/10/08]V3.0 Vision: Update Methods.

arXiv TANGO (Audio, Audio-Driven Holistic Body Driving)


[2024/10/04]🎉🎉🎉V2.9 Vision I'm glad that our article is publicly available on TechRxiv. We welcome your attention and citations. The version on arXiv is still on hold, and we will update it when it becomes available.

@article{xue2024human,
  title={Human Motion Video Generation: A Survey}, 
  author={Xue, Haiwei and Luo, Xiangyang and Hu, Zhanghao and Zhang, Xin and Xiang, Xunzhi and Dai, Yuqin and Liu, Jianzhuang and Zhang, Zhensong and Li, Minglei and Yang, Jian and Ma, Fei and Wu, Zhiyong and Yang, Changpeng and Dai, Zonghong and Yu, Fei Richard},
  journal={IEEE Transactions on Pattern Analysis and Machine Intelligence}, 
  year={2025},
  doi={10.1109/TPAMI.2025.3594034}
}

[2024/10/03]V2.8 Vision: Update Methods.

arXiv LaDTalk: Latent Denoising for Synthesizing Talking Head Videos with High Frequency Details (Audio, Head Pose Driving)


[2024/10/02]V2.7 Vision: Update Methods.

arXiv Replace Anyone in Videos (Visual, Video-Guided Dance Video Generation)

arXiv High Quality Human Image Animation using Regional Supervision and Motion Blur Condition (Visual, Pose-Guided Dance Video Generation)


[2024/09/27]V2.6 Vision: Update Methods.

arXiv SVP (Visual, Portrait Animation)

arXiv Self-Supervised Learning of Deviation in Latent Representation for Co-speech Gesture Video Generation (Audio, Audio-Driven Holistic Body Driving)


[2024/09/25]V2.5 Vision: Update Methods.

arXiv MIMO (Visual, Pose-Guided Dance Video Generation)


[2024/09/24]V2.4 Vision: Update Methods.

arXiv MIMAFace (Audio, Fine-Grained Style and Emotion-Driven Animation)


[2024/09/23]V2.3 Vision: Update Methods.

arXiv JoyHallo (Audio, Fine-Grained Style and Emotion-Driven Animation)


[2024/09/19] V2.2 Vision: Update Methods.

arXiv JEAN (Audio, Head Pose Driving)


[2024/09/17] V2.1 Vision: Update Methods.

arXiv LawDNet (Audio, Lip Synchronization)

arXiv StyleTalk++ (Audio, Fine-Grained Style and Emotion-Driven Animation)


[2024/09/13] V2.0 Vision: Update Methods.

arXiv DiffTED (Audio, Audio-Driven Holistic Body Driving)


[2024/09/12] V1.9 Vision: Update Methods.

arXiv EMOdiffhead (Audio, Fine-Grained Animation)


[2024/09/11] V1.8 Vision: Update Methods.

arXiv RealisDance (Visual, Pose-Guided Dance Video Generation)


[2024/09/10] V1.7 Vision: Update Methods.

arXiv Leveraging WaveNet for Dynamic Listening Head Modeling from Speech (Audio, Lip Synchronization)

arXiv KAN-Based Fusion of Dual-Domain for Audio-Driven Facial Landmarks Generation (Audio, Lip Synchronization)

arXiv PersonaTalk (Audio, Lip Synchronization)


[2024/09/06] V1.6 Vision: Update Methods.

arXiv SVP (Audio, Fine-Grained Animation)

arXiv SegTalker (Audio, Lip Synchronization)


[2024/09/05] V1.5 Vision: Update Methods.

arXiv Loopy (Audio, Fine-Grained Animation)

arXiv PoseTalk (Audio, Fine-Grained Animation)


[2024/09/04] V1.4 Vision: Update Methods.

arXiv CyberHost (Audio, Holistic Human Driving)


[2024/08/28] V1.3 Vision: Update Methods.

arXiv MegActor-Σ (Audio, Fine-Grained Animation)

arXiv Rafael Azevedo et al. (Text, Text2Face)


[2024/08/27] V1.2 Vision: Update Methods.

arXiv GenCA (Text, Text2Face)


[2024/08/26] V1.1 Vision: Update Methods.

arXiv G3FA (Vision, Portrait Animation)


[2024/08/21] V1.0 Vision: Initialize the repository. If you find it helpful to you, welcome to star and share our work.


🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨

从2026年01月01日起,为便于快速更新follow最新的工作,下方的表格将不再更新,仅在上方快速推送。

Starting from January 1, 2026, to facilitate quick updates and follow the latest works, the table below will no longer be updated and will only be quickly pushed in the news section above.

🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨


Vision Guidance

Part (Face) || Portrait Animation
DateTitlearXiv LinkMotion RepresentationBackboneVenue
2024 06 04Follow-Your-Emoji: Fine-Controllable and Expressive Freestyle Portrait AnimationarXivKeyPointDiffusion ModelSIGGRAPH ASIA2024
2024 07 05LivePortrait: Efficient Portrait Animation with Stitching and Retargeting ControlarXivKeyPointEncoder-DecoderarXiv
2024 07 09MobilePortrait: Real-Time One-Shot Neural Head Avatars on Mobile DevicesarXivKeyPointDiffusion ModelarXiv
2023 10 16Expression Domain Translation Network for Cross-domain Head ReenactmentarXiv3D ParameterizationEncoder-DecoderICASSP 2024
2023 03 26OTAvatar : One-shot Talking Face Avatar with Controllable Tri-plane RenderingarXiv3D ParameterizationEncoder-DecoderCVPR 2023
2023 03 27OmniAvatar: Geometry-Guided Controllable 3D Head SynthesisarXivLatentGANCVPR 2023
2023 12 04Unsupervised High-Resolution Portrait Gaze Correction and AnimationarXivLatentGANIEEE Transactions on Image Processing 2022
2024 06 08MegActor: Harness the Power of Raw Video for Vivid Portrait AnimationarXivLatentDiffusion ModelarXiv
2024 05 31X-Portrait: Expressive Portrait Animation with Hierarchical Motion AttentionarXivLatentDiffusion ModelACM SIGGRAPH 2024
2024 08 26G3FA: Geometry-guided GAN for Face AnimationarXivLatentGANarXiv
2024 09 27Stable Video PortraitsarXiv3D ParameterizationDiffusion ModelECCV 2024
2024 11 04Towards High-fidelity Head Blending with Chroma Keying for Industrial ApplicationsarXivRegionEncoder-DecoderWACV 2024
2024 11 28HiFiVFS: High Fidelity Video Face SwappingarXivLatentEncoder-DecoderarXiv
2024 12 02EmojiDiff: Advanced Facial Expression Control with High Identity Preservation in Portrait GenerationarXivLatentDiffusion ModelarXiv
2024 12 15VividFace: A Diffusion-Based Hybrid Framework for High-Fidelity Video Face SwappingarXivLatentDiffusion ModelarXiv
2024 12 27RAIN: Real-time Animation of Infinite Video StreamarXivLatentDiffusion ModelarXiv
2025 01 11Qffusion: Controllable Portrait Video Editing via Quadrant-Grid Attention LearningarXivLatentDiffusion ModelarXiv
2025 01 15DynamicFace: High-Quality and Consistent Video Face Swapping using Composable 3D Facial PriorsarXivLatentDiffusion ModelarXiv
2025 01 29Learning Semantic Facial Descriptors for Accurate Face AnimationarXivLatentDiffusion Modelarxiv
2025 02 27High-Fidelity Relightable Monocular Portrait Animation with Lighting-Controllable Video Diffusion ModelarXivLatentDiffusion Modelarxiv
2025 03 13Semantic Latent Motion for Portrait Video GenerationarXivLatentDiffusion Modelarxiv
2025 03 02FaceShot: Bring Any Character into LifearXivLatentDiffusion Modelarxiv
2025 03 15Snapmoji: Instant Generation of Animatable Dual-Stylized AvatarsarXivLatentDiffusion Modelarxiv
2025 03 24HunyuanPortrait: Implicit Condition Control for Enhanced Portrait AnimationarXivLatentDiffusion Modelarxiv
2025 03 28High-Fidelity Diffusion Face Swapping with ID-Constrained Facial ConditioningarXivLatentDiffusion Modelarxiv
2025 04 15InterAnimate: Taming Region-aware Diffusion Model for Realistic Human Interaction AnimationarXivLatentDiffusion Modelarxiv
2025 04 27IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular VideosarXivLatentDiffusion Modelarxiv
2025 04 30MagicPortrait: Temporally Consistent Face Reenactment with 3D Geometric GuidancearXivLatentDiffusion Modelarxiv
2025 06 20Controllable and Expressive One-Shot Video Head SwappingarXivLatentDiffusion Modelarxiv
2025 07 03CanonSwap: High-Fidelity and Consistent Video Face Swapping via Canonical Space ModulationarXivLatentDiffusion Modelarxiv
2025 07 10Stable-Hair v2: Real-World Hair Transfer via Multiple-View Diffusion ModelarXivLatentDiffusion Modelarxiv
2025 07 17HairShifter: Consistent and High-Fidelity Video Hair Transfer via Anchor-Guided AnimationarXivLatentDiffusion Modelarxiv
2025 07 22Navigating Large-Pose Challenge for High-Fidelity Face Reenactment with Video Diffusion ModelarXivLatentDiffusion Modelarxiv
2025 07 23CartoonAlive: Towards Expressive Live2D Modeling from Single PortraitsarXivLatentDiffusion Modelarxiv
2025 07 30X-NeMo: Expressive Neural Motion Reenactment via Disentangled Latent AttentionarXivLatentDiffusion Modelarxiv
2025 09 20Follow-Your-Emoji-Faster: Towards Efficient, Fine-Controllable, and Expressive Freestyle Portrait AnimationarXivLatentDiffusion Modelarxiv
2025 09 22Stable Video-Driven PortraitsarXivLatentDiffusion Modelarxiv
2025 08 13LIA-X: Interpretable Latent Portrait AnimatorarXivLatentDiffusion Model0
2025 12 12PersonaLive! Expressive Portrait Image Animation for Live StreamingarXivLatentDiffusion Modelarxiv
2025 12 17DeX-Portrait: Disentangled and Expressive Portrait Animation via Explicit and Latent Motion RepresentationsarXivLatentDiffusion Modelarxiv
2025 12 16HiFi-Portrait: Zero-shot Identity-preserved Portrait Generation with High-fidelity Multi-face FusionarXivLatentDiffusion ModelCVPR 2025
2025 12 18FlashPortrait: 6x Faster Infinite Portrait Animation with Adaptive Latent PredictionarXivLatentDiffusion Modelarxiv
2025 12 19SynergyWarpNet: Attention-Guided Cooperative Warping for Neural Portrait AnimationarXivLatentDiffusion Modelarxiv
2024 03 23FaceOff: A Video-to-Video Face Swapping SystemarXivLatentEncoder-DecoderWACV 2023
Holistic Human || Video-Guided Dance Video Generation
DateTitlearXiv LinkMotion RepresentationBackboneVenue
2018 08 22Everybody dance nowarXivKeyPointGANICCV 2019
2023 07 02Bidirectional Temporal Diffusion Model for Temporally Consistent Human AnimationarXivRegionDiffusion ModelarXiv
2023 02 22Human MotionFormer: Transferring Human Motions with Vision TransformersarXivKeyPointEncoder-DecoderarXiv
2024 10 02Replace Anyone in VideosarXivKeyPointDiffusion ModelarXiv
2025 04 02DreamActor-M1: Holistic, Expressive and Robust Human Image Animation with Hybrid GuidancearXivRegionDiffusion ModelarXiv
2025 05 06FlexiAct: Towards Flexible Action Control in Heterogeneous ScenariosarXivRegionDiffusion ModelarXiv
2025 05 23DanceTogether! Identity-Preserving Multi-Person Interactive Video GenerationarXivRegionDiffusion ModelarXiv
2024 06 24Do As I Do: Pose Guided Human Motion CopyarXivKeyPointGANIEEE Transactions on Dependable and Secure Computing
Holistic Human || Pose-Guided Dance Video Generation
DateTitlearXiv LinkMotion RepresentationBackboneVenue
2023 06 30DisCoarXivKeyPointDiffusion ModelCVPR2024
2023 10 20Dance Your LatentsarXivKeyPointDiffusion Modelarxiv
2023 11 18MagicPosearXivKeyPointDiffusion ModelICML2024
2023 11 27MagicAnimatearXivRegionDiffusion ModelCVPR2024
2023 11 28Animate AnyonearXivKeyPointDiffusion ModelCVPR2024
2023 12 08DreaMovingarXivKeyPointDiffusion Modelarxiv
2023 12 27I2V-AdapterarXivKeyPointDiffusion ModelSIGGRAPH2024
2024 05 26Disentangling Foreground and Background Motion for Enhanced Realism in Human Video GenerationarXivKeyPointDiffusion Modelarxiv
2024 05 28VividPose: Advancing Stable Video Diffusion for Realistic Human Image AnimationarXivKeyPointDiffusion Modelarxiv
2024 05 30MotionFollower: Editing Video Motion via Lightweight Score-Guided DiffusionarXivKeyPointDiffusion Modelarxiv
2024 06 03UniAnimate: Taming Unified Video Diffusion Models for Consistent Human Image animationarXivKeyPointDiffusion Modelarxiv
2024 06 05Follow-Your-Pose v2: Multiple-Condition Guided Character Image Animation for Stable Pose ControlarXivKeyPointDiffusion Modelarxiv
2024 05 27Human4DiT: Free-view Human Video Generation with 4D Diffusion TransformerarXiv3D ParameterizationTransformerarxiv
2024 01 19Synthesizing Moving People with 3D ControlarXiv3D ParameterizationDiffusion Modelarxiv
2024 03 21Champ: Controllable and Consistent Human Image Animation with 3D Parametric GuidancearXiv3D ParameterizationDiffusion ModelECCV 2024
2024 07 01MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose GuidancearXivKeyPointDiffusion Modelarxiv
2024 07 15TCAN: Animating Human Images with Temporally Consistent Pose Guidance using Diffusion ModelsarXivKeyPointDiffusion Modelarxiv
2024 09 11RealisDance: Equip controllable character animation with realistic handsarXivKeyPointDiffusion Modelarxiv
2024 09 25MIMO: Controllable Character Video Synthesis with Spatial Decomposed ModelingarXivKeyPointDiffusion Modelarxiv
2024 10 02High Quality Human Image Animation using Regional Supervision and Motion Blur ConditionarXivKeyPointDiffusion Modelarxiv
2024 10 15Animate-X: Universal Character Image Animation with Enhanced Motion RepresentationarXivKeyPointDiffusion Modelarxiv
2024 11 14MikuDance: Animating Character Art with Mixed Motion DynamicsarXivKeyPointDiffusion Modelarxiv
2024 11 26StableAnimator: High-Quality Identity-Preserving Human Image AnimationarXivKeyPointDiffusion Modelarxiv
2024 11 30DreamDance: Animating Human Images by Enriching 3D Geometry Cues from 2D PosesarXivKeyPointDiffusion Modelarxiv
2024 12 12DisPose: Disentangling Pose Guidance for Controllable Human Image AnimationarXivKeyPoint,RegionDiffusion Modelarxiv
2024 12 19Consistent Human Image and Video Generation with Spatially Conditioned DiffusionarXivKeyPointDiffusion Modelarxiv
2024 12 23Free-viewpoint Human Animation with Pose-correlated Reference SelectionarXivKeyPointDiffusion Modelarxiv
2025 01 17X-Dyna: Expressive Dynamic Human Image AnimationarXivKeyPointDiffusion Modelarxiv
2025 02 10Animate Anyone 2: High-Fidelity Character Image Animation with Environment AffordancearXivKeyPointDiffusion Modelarxiv
2025 02 12AnyCharV: Bootstrap Controllable Character Video Generation with Fine-to-Coarse GuidancearXivKeyPointDiffusion Modelarxiv
2025 02 17HumanGif: Single-View Human Diffusion with Generative PriorarXivKeyPointDiffusion Modelarxiv
2025 03 24EvAnimate: Event-conditioned Image-to-Video Generation for Human AnimationarXivKeyPointDiffusion Modelarxiv
2025 04 11TokenMotion: Decoupled Motion Control via Token Disentanglement for Human-centric Video GenerationarXivKeyPointDiffusion Modelarxiv
2025 04 05Multi-identity Human Image Animation with Structural Video DiffusionarXivKeyPointDiffusion Modelarxiv
2025 04 15UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion TransformerarXivKeyPointDiffusion Modelarxiv
2025 04 21RealisDance-DiT: Simple yet Strong Baseline towards Controllable Character Animation in the WildarXivKeyPointDiffusion Modelarxiv
2025 04 28AnimateAnywhere: Rouse the Background in Human Image AnimationarXivKeyPointDiffusion Modelarxiv
2025 05 23Interspatial Attention for Efficient 4D Human Video GenerationarXiv3D ParameterizationDiffusion Modelarxiv
2025 05 28LatentMove: Towards Complex Human Movement Video GenerationarXivLatentDiffusion Modelarxiv
2025 05 29HyperMotion: DiT-Based Pose-Guided Human Image Animation of Complex MotionsarXivLatentDiffusion Modelarxiv
2025 05 29How Animals Dance (When You're Not Looking)arXivLatentDiffusion Modelarxiv
2025 05 30DreamDance: Animating Character Art via Inpainting Stable Gaussian WorldsarXivLatentDiffusion Modelarxiv
2025 06 02OmniV2V: Versatile Video Generation and Editing via Dynamic Content ManipulationarXivLatentDiffusion Modelarxiv
2025 06 153D Hand Mesh-Guided AI-Generated Malformed Hand Refinement with Hand Pose Transformation via Diffusion ModelarXivRegionDiffusion Modelarxiv
2025 07 20StableAnimator++: Overcoming Pose Misalignment and Face Distortion for Human Image AnimationarXivKeyPointDiffusion Modelarxiv
2025 11 24SteadyDancer: Harmonized and Coherent Human Image Animation with First-Frame PreservationarXivKeyPointDiffusion Modelarxiv
2025 12 18EverybodyDance: Bipartite Graph-Based Identity Correspondence for Multi-Character AnimationarXivKeyPointDiffusion Modelarxiv
2025 12 26High-Fidelity and Long-Duration Human Image Animation with Diffusion TransformerarXivKeyPointDiffusion Modelarxiv
2024 07 16IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth GenerationarXivRegionDiffusion Modelarxiv
Holistic Human || Try-On Video Generation
DateTitlearXiv LinkMotion RepresentationBackboneVenue
2024 04 26Tunnel Try-on: Excavating Spatial-temporal Tunnels for High-quality Virtual Try-on in VideosarXivKeyPointDiffusion Modelarxiv
2024 05 20ViViD: Video Virtual Try-on using Diffusion ModelsarXivRegionDiffusion Modelarxiv
2024 11 04Fashion-VDM: Video Diffusion Model for Virtual Try-OnarXivLatentDiffusion ModelSIGGRAPH Asia 2025
2024 11 25FloAt: Flow Warping of Self-Attention for Clothing Animation GenerationarXivLatentDiffusion Modelarxiv
2024 12 04PEMF-VVTO: Point-Enhanced Video Virtual Try-on via Mask-free ParadigmarXivLatentDiffusion Modelarxiv
2024 12 13Dynamic Try-On: Taming Video Virtual Try-on with Dynamic Attention MechanismarXivLatentDiffusion Modelarxiv
2024 12 13SwiftTry: Fast and Consistent Video Virtual Try-On with Diffusion ModelsarXivLatentDiffusion Modelarxiv
2025 01 15RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal ConsistencyarXivLatentDiffusion Modelarxiv
2025 01 20CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal ConcatenationarXivLatentDiffusion Modelarxiv
2025 04 243DV-TON: Textured 3D-Guided Consistent Video Try-on via Diffusion ModelsarXivLatentDiffusion Modelarxiv
2025 05 10ProFashion: Prototype-guided Fashion Video Generation with Multiple Reference ImagesarXivLatentDiffusion Modelarxiv
2025 05 27MagicTryOn: Harnessing Diffusion Transformer for Garment-Preserving Video Virtual Try-onarXivLatentDiffusion Modelarxiv
2025 06 06ChronoTailor: Harnessing Attention Guidance for Fine-Grained Video Virtual Try-OnarXivLatentDiffusion Modelarxiv
2025 06 12Low-Barrier Dataset Collection with Real Human Body for Interactive Per-Garment Virtual Try-OnarXivLatentDiffusion Modelarxiv
2025 06 26Video Virtual Try-on with Conditional Diffusion Transformer InpainterarXivLatentDiffusion Modelarxiv
2025 08 04DreamVVT: Mastering Realistic Video Virtual Try-On in the Wild via a Stage-Wise Diffusion Transformer FrameworkarXivLatentDiffusion Modelarxiv
2025 10 09Once Is Enough: Lightweight DiT-Based Video Virtual Try-On via One-Time Garment Appearance InjectionarXivLatentDiffusion Modelarxiv
2025 10 19From Mannequin to Human: A Pose-Aware and Identity-Preserving Video Generation Framework for Lifelike Clothing DisplayarXivLatentDiffusion Modelarxiv
2025 11 24Eevee: Towards Close-up High-resolution Video-based Virtual Try-onarXivLatentDiffusion Modelarxiv
2025 12 23The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details InjectionarXivLatentDiffusion Modelarxiv
2024 07 16WildVidFit: Video Virtual Try-On in the Wild via Image-Based Controlled Diffusion ModelsarXivKeyPointDiffusion Modelarxiv
Holistic Human || Pose2Video
DateTitlearXiv LinkMotion RepresentationBackboneVenue
2023 04 12DreamPosearXivRegionDiffusion ModelICCV 2023
2024 03 25Make-Your-Anchor: A Diffusion-based 2D Avatar Generation FrameworkarXiv3D ParameterizationDiffusion ModelCVPR 2024
2024 04 21PoseAnimate: Zero-shot high fidelity pose controllable character animationarXivKeyPointDiffusion Modelarxiv
2024 12 18ManiVideo: Generating Hand-Object Manipulation Video with Dexterous and Generalizable GraspingarXivKeyPointDiffusion Modelarxiv
2025 02 07HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video GenerationarXivKeyPointDiffusion Modelarxiv
2025 03 12SwapAnyone: Consistent and Realistic Video Synthesis for Swapping Any Person into Any VideoarXivKeyPointDiffusion Modelarxiv
2025 03 21Re-HOLD: Video Hand Object Interaction Reenactment via adaptive Layout-instructed Diffusion ModelarXivKeyPointDiffusion Modelarxiv
2025 03 28Follow Your Motion: A Generic Temporal Consistency Portrait Editing Framework with Trajectory GuidancearXivKeyPointEncoder-Decoderarxiv
2025 05 26AniCrafter: Customizing Realistic Human-Centric Animation via Avatar-Background Conditioning in Video Diffusion ModelsarXivRegionDiffusion Modelarxiv
2025 06 12DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion TransformersarXivRegionDiffusion Modelarxiv
2025 07 01Populate-A-Scene: Affordance-Aware Human Video GenerationarXivRegionDiffusion Modelarxiv
2025 07 22HOComp: Interaction-Aware Human-Object CompositionarXivRegionDiffusion Modelarxiv
2025 08 06Motion is the Choreographer: Learning Latent Pose Dynamics for Seamless Sign Language GenerationarXivRegionDiffusion Modelarxiv
2025 08 08AnimateScene: Camera-controllable Animation in Any ScenearXivRegionDiffusion Modelarxiv
2025 08 12RealisMotion: Decomposed Human Motion Control and Video Generation in the World SpacearXivRegionDiffusion Modelarxiv
2025 08 13HumanGenesis: Agent-Based Geometric and Generative Modeling for Synthetic Human DynamicsarXiv3D ParameterizationDiffusion Modelarxiv
2025 08 13Animate-X++: Universal Character Image Animation with Dynamic BackgroundsarXivRegionDiffusion Modelarxiv
2025 08 12X-UniMotion: Animating Human Images with Expressive, Unified and Identity-Agnostic Motion LatentsarXivRegionDiffusion Modelarxiv
2025 08 24MoCo: Motion-Consistent Human Video Generation via Structure-Appearance DecouplingarXivRegionDiffusion Modelarxiv
2025 09 17Wan-Animate: Unified Character Animation and Replacement with Holistic ReplicationarXivRegionDiffusion Modelarxiv
2025 09 25ControlHair: Physically-based Video Diffusion for Controllable Dynamic Hair RenderingarXivRegionDiffusion Modelarxiv
2025 10 16Identity-Preserving Image-to-Video Generation via Reward-Guided OptimizationarXivRegionDiffusion Modelarxiv
2025 11 01ID-Composer: Multi-Subject Video Synthesis with Hierarchical Identity PreservationarXivRegionDiffusion Modelarxiv
2025 10 31Multi-View Consistent Human Image Customization via In-Context LearningarXivRegionDiffusion Modelarxiv
2025 11 28One-to-All Animation: Alignment-Free Character Animation and Image Pose TransfearXivRegionDiffusion Modelarxiv
2025 12 03UniMo: Unifying 2D Video and 3D Human Motion with an Autoregressive FrameworkarXivRegionDiffusion Modelarxiv
2025 12 05SCAIL: Towards Studio-Grade Character Animation via In-Context Learning of 3D-Consistent Pose RepresentationsarXivRegionDiffusion Modelarxiv
2025 12 08ViSA: 3D-Aware Video Shading for Real-Time Upper-Body Avatar CreationarXivRegionDiffusion Modelarxiv
2025 12 15Soul: Breathe Life into Digital Human for High-fidelity Long-term Multimodal AnimationarXivRegionDiffusion Modelarxiv
2025 12 15PoseAnything: Universal Pose-guided Video Generation with Part-aware Temporal CoherencearXivRegionDiffusion Modelarxiv
2025 12 26MoFu: Scale-Aware Modulation and Fourier Fusion for Multi-Subject Video GenerationarXivRegionDiffusion Modelarxiv
2024 11 26AnchorCrafter: Animate CyberAnchors Saling Your Products via Human-Object Interacting Video GenerationarXivKeyPointDiffusion Modelarxiv
2024 10 29MovieCharacter: A Tuning-Free Framework for Controllable Character Video SynthesisarXivRegionDiffusion Modelarxiv
2025 06 11Synthetic Human Action Video Data Generation with Pose TransferarXivKeyPointDiffusion Modelarxiv

Text Guidance

Part (Face) || Text2Face
DateTitlearXiv LinkMotion RepresentationBackboneVenue
2021 05 07Write-a-speaker: Text-based Emotional and Rhythmic Talking-head GenerationarXivKeyPointGANAAAI 2021
2023 12 11Neural Text to Articulate Talk: Deep Text to Audiovisual Speech Synthesis achieving both Auditory and Photo-realismarXiv3D ParameterizationGANarXiv
2023 06 03VideoComposer: Compositional Video Synthesis with Motion ControllabilityarXivRegionDiffusion ModelNeurIPS 2024
2024 04 23ID-Animator: Zero-Shot Identity-Preserving Human Video GenerationarXivLatentDiffusion ModelarXiv
2023 12 09FT2TF: First-Person Statement Text-To-Talking Face GenerationarXivLatentEncoder-DecoderarXiv
2024 05 16Faces that Speak: Jointly Synthesising Talking Face and Speech from TextarXivLatentGANCVPR 2024
2024 08 27GenCA: A Text-conditioned Generative Model for Realistic and Drivable Codec AvatarsarXiv3D ParameterizationEncoder-DecoderarXiv
2024 08 28Empowering Sign Language Communication: Integrating Sentiment and Semantics for Facial Expression SynthesisarXivKeyPointDiffusion ModelarXiv
2024 11 28MotionCharacter: Identity-Preserving and Motion Controllable Human Video GenerationarXivRegionDiffusion ModelarXiv
2024 11 26Identity-Preserving Text-to-Video Generation by Frequency DecompositionarXivRegionDiffusion ModelarXiv
2024 11 26PersonalVideo: High ID-Fidelity Video Customization without Dynamic and Semantic DegradationarXivLatentDiffusion ModelarXiv
2025 03 09DynamicID: Zero-Shot Multi-ID Image Personalization with Flexible Facial EditabilityarXivKeyPointDiffusion ModelarXiv
2025 03 18Concat-ID: Towards Universal Identity-Preserving Video SynthesisarXivKeyPointDiffusion ModelarXiv
2024 12 27VideoMaker: Zero-shot Customized Video Generation with the Inherent Force of Video Diffusion ModelsarXivLatentDiffusion ModelarXiv
2025 04 03OmniTalker: Real-Time Text-Driven Talking Head Generation with In-Context Audio-Visual Style ReplicationarXivLatentDiffusion Modelarxiv
2025 07 17FantasyPortrait: Enhancing Multi-Character Portrait Animation with Expression-Augmented Diffusion TransformersarXivLatentDiffusion Modelarxiv
2025 08 04Text2Lip: Progressive Lip-Synced Talking Face Generation from Text via Viseme-Guided RenderingarXivLatentDiffusion Modelarxiv
2025 08 05MoCA: Identity-Preserving Text-to-Video Generation via Mixture of Cross AttentionarXivLatentDiffusion Modelarxiv
2020 03 01Towards Automatic Face-to-Face TranslationarXivLatentEncoder-DecoderACM MM 2019
Holistic Human || Text2MotionVideo
DateTitlearXiv LinkMotion RepresentationBackboneVenue
2024 05 08Edit-Your-MotionarXivKeyPointDiffusion ModelarXiv
2023 08 15Dancing Avatar: Pose and Text-Guided Human Motion Videos Synthesis with Image Diffusion ModelarXivKeyPointDiffusion ModelarXiv
2023 04 03Follow Your PosearXivKeyPointDiffusion ModelAAAI 2024
2024 12 21Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose GuidancearXivKeyPointDiffusion Modelarxiv
2023 08 28MagicAvatar: Multimodal Avatar Generation and AnimationarXivKeyPointDiffusion ModelarXiv
2024 02 14Magic-Me: Identity-Specific Video Customized DiffusionarXivLatentDiffusion ModelarXiv
2024 04 07Towards a Simultaneous and Granular Identity-Expression Control in Personalized Face GenerationarXivLatentDiffusion ModelCVPR 2024
2023 04 17Text2Performer: Text-Driven Human Video GenerationarXivLatentEncoder-DecoderICCV 2023
2024 04 14LoopAnimatearXivLatentDiffusion ModelarXiv
2023 07 10AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific TuningarXivLatentDiffusion ModelarXiv
2023 12 06AnimateZero: Video Diffusion Models are Zero-Shot Image AnimatorsarXivLatentDiffusion ModelarXiv
2023 10 30VideoCrafter1: Open Diffusion Models for High-Quality Video GenerationarXivLatentDiffusion ModelarXiv
2023 07 19TokenFlow: Consistent Diffusion Features for Consistent Video EditingarXivLatentDiffusion ModelarXiv
2023 03 23Text2Video-Zero: Text-to-Image Diffusion Models are Zero-Shot Video GeneratorsarXivLatentDiffusion ModelICCV 2023
2023 02 02Dreamix: Video Diffusion Models are General Video EditorsarXivLatentDiffusion ModelarXiv
2023 12 05BIVDiff: A Training-Free Framework for General-Purpose Video Synthesis via Bridging Image and Video Diffusion ModelsarXivLatentDiffusion ModelCVPR 2024
2024 11 29Fleximo: Towards Flexible Text-to-Human Motion Video GenerationarXivLatentDiffusion ModelarXiv
2023 12 30Dual-Stream Diffusion Net for Text-to-Video GenerationarXivLatentDiffusion ModelarXiv
2025 01 07Magic Mirror: ID-Preserved Video Generation in Video Diffusion TransformersarXivLatentDiffusion ModelarXiv
2025 01 23EchoVideo: Identity-Preserving Human Video Generation by Multimodal Feature FusionarXivLatentDiffusion ModelarXiv
2025 01 17Textoon: Generating Vivid 2D Cartoon Characters from Text DescriptionsarXivLatentDiffusion ModelarXiv
2025 02 19FantasyID: Face Knowledge Enhanced ID-Preserving Video GenerationarXivLatentDiffusion ModelarXiv
2025 03 16MagicID: Hybrid Preference Optimization for ID-Consistent and Dynamic-Preserved Video CustomizationarXivLatentDiffusion ModelarXiv
2025 03 20Text-Driven Diffusion Model for Sign Language ProductionarXivLatentDiffusion ModelarXiv
2025 06 30Proteus-ID: ID-Consistent and Motion-Coherent Video CustomizationarXivLatentDiffusion ModelarXiv
2025 07 07Identity-Preserving Text-to-Video Generation Guided by Simple yet Effective Spatial-Temporal Decoupled RepresentationsarXivLatentDiffusion ModelarXiv
2025 01 03Ingredients: Blending Custom Photos with Video Diffusion TransformersarXivLatentDiffusion ModelarXiv
2024 02 22Customize-A-VideoarXivLatentDiffusion ModelarXiv
2023 12 12LatentMan: Generating Consistent Animated Characters using Image Diffusion ModelsarXiv3D ParameterizationDiffusion ModelarXiv
2024 08 15DeCo: Decoupled Human-Centered Diffusion Video Editing with Motion ConsistencyarXiv3D ParameterizationDiffusion ModelarXiv
2024 10 15Tex4D: Zero-shot 4D Scene Texturing with Video Diffusion ModelsarXivLatentDiffusion ModelarXiv
2025 03 31HumanDreamer: Generating Controllable Human-Motion Videos via Decoupled GenerationarXivKeyPointDiffusion Modelarxiv
2025 06 16EchoShot: Multi-Shot Portrait Video GenerationarXivKeyPointDiffusion Modelarxiv
2025 08 11ShoulderShot: Generating Over-the-Shoulder Dialogue VideosarXivKeyPointDiffusion Modelarxiv
2025 08 11Stand-In: A Lightweight and Plug-and-Play Identity Control for Video GenerationarXivKeyPointDiffusion Modelarxiv
2025 08 11LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video CreationarXivKeyPointDiffusion Modelarxiv
2025 08 13From Large Angles to Consistent Faces: Identity-Preserving Video Generation via Mixture of Facial ExpertsarXivKeyPointDiffusion Modelarxiv
2025 09 05Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance EnhancementarXivKeyPointDiffusion Modelarxiv
2025 12 21EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion TransformerarXivKeyPointDiffusion Modelarxiv
2024 01 17VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion ModelsarXivLatentDiffusion ModelCVPR 2024

Audio Guidance

Part (Face) || Lip Synchronization
DateTitlearXiv LinkMotion RepresentationBackboneVenue
2020 09 17Photorealistic Audio-driven Video PortraitsarXivRegionEncoder-DecoderTVCG2020
2019 05 09Hierarchical cross-modal talking face generation with dynamic pixel-wise lossarXivKeyPointAutoregressiveCVPR2019
2019 05 08Capture, Learning, and Synthesis of 3D Speaking StylesarXivLatentEncoder-DecoderCVPR2019
2024 08 13Style-Preserving Lip Sync via Audio-Aware Style ReferencearXivLatentDiffusion Modelarxiv
2024 09 06SegTalker: Segmentation-based Talking Face Generation with Mask-guided Local EditingarXivLatentGANarxiv
2024 09 10Leveraging WaveNet for Dynamic Listening Head Modeling from SpeecharXivLatentAutoregressivearxiv
2024 09 10KAN-Based Fusion of Dual-Domain for Audio-Driven Facial Landmarks GenerationarXivKeyPointEncoder-Decoderarxiv
2024 09 10PersonaTalk: Bring Attention to Your Persona in Visual DubbingarXiv3D ParameterizationEncoder-Decoderarxiv
2024 09 17LawDNet: Enhanced Audio-Driven Lip Synthesis via Local Affine Warping DeformationarXivLatentEncoder-Decoderarxiv
2024 10 15MuseTalk: Real-Time High Quality Lip Synchronization with Latent Space InpaintingarXivLatentDiffusion Modelarxiv
2024 12 12LatentSync: Audio Conditioned Latent Diffusion Models for Lip SyncarXivLatentDiffusion Modelarxiv
2025 01 08Identity-Preserving Video Dubbing Using Motion WarpingarXivLatentEncoder-Decoderarxiv
2025 04 06FluentLip: A Phonemes-Based Two-stage Approach for Audio-Driven Lip Synthesis with Optical Flow ConsistencyarXivLatentGANarxiv
2025 05 29Video Editing for Audio-Visual DubbingarXivLatentDiffusion Modelarxiv
2025 09 26StableDub: Taming Diffusion Prior for Generalized and Efficient Visual DubbingarXivLatentDiffusion Modelarxiv
2025 10 28See the Speaker: Crafting High-Resolution Talking Faces from Speech with Prior Guidance and Region RefinementarXivLatentDiffusion Modelarxiv
2025 11 07Shared Latent Representation for Joint Text-to-Audio-Visual SynthesisarXivLatentDiffusion Modelarxiv
2025 12 23TAVID: Text-Driven Audio-Visual Interactive Dialogue GenerationarXivLatentDiffusion Modelarxiv
2025 12 25SyncAnyone: Implicit Disentanglement via Progressive Self-Correction for Lip-Syncing in the wildarXivLatentDiffusion Modelarxiv
2025 12 31From Inpainting to Editing: A Self-Bootstrapping Framework for Context-Rich Visual DubbingarXivLatentDiffusion Modelarxiv
2025 12 30DyStream: Streaming Dyadic Talking Heads Generation via Flow Matching-based Autoregressive ModelarXivLatentDiffusion Modelarxiv
2023 01 10Speech driven video editing via an audio-conditioned diffusion modelarXivLatentDiffusion ModelIVC2024
Part (Face) || Head Pose Driving
DateTitlearXiv LinkMotion  RepresentationBackboneVenue
2017 08 20Predicting head pose from speech with a conditional variational autoencoderarXivLatentAutoregressiveISCA2017
2020 04 27MakeItTalk: Speaker-Aware Talking-Head AnimationarXivKeyPointAutoregressiveTOG2020
2021 09 22Live Speech Portraits: Real-Time Photorealistic Talking-Head AnimationarXivKeyPointAutoregressiveTOG2021
2022 01 03DFA-NeRF: Personalized Talking Head Generation via Disentangled Face Attributes Neural RenderingarXivKeyPointEncoder-Decoderarxiv
2023 01 10DiffTalk: Crafting Diffusion Models for Generalized Audio-Driven Portraits AnimationarXivKeyPointDiffusion ModelCVPR2023
2023 05 15Identity-Preserving Talking Face Generation with Landmark and Appearance PriorsarXivMuliti-ConditionsTransformerCVPR2023
2023 05 01GeneFace++: Generalized and Stable Real-Time Audio-Driven 3D Talking Face GenerationarXivKeyPointEncoder-Decoderarxiv
2022 03 16StyleHEAT: One-Shot High-Resolution Editable Talking Face Generation via Pre-trained StyleGANarXivRegionGANECCV2022
2023 02 20SD-NeRF: Towards Lifelike Talking Head Animation via Spatially-Adaptive Dual-Driven NeRFsarXiv3D ParameterizationEncoder-DecoderTMM2023
2024 03 26AniPortraitarXivKeyPoint,3D ParameterizationDiffusion Modelarxiv
2024 06 17Make Your Actor TalkarXivKeyPointDiffusion Modelarxiv
2024 06 12Emotional Conversation: Empowering Talking Faces with Cohesive Expression, Gaze and Pose GenerationarXivKeyPoint,3D ParameterizationDiffusion Modelarxiv
2024 06 27RealTalk: Real-time and Realistic Audio-driven Face Generation with 3D Facial Prior-guided Identity Alignment NetworkarXiv3D ParameterizationTransformerarxiv
2021 03 20AD-NeRF: Audio Driven Neural Radiance Fields for Talking Head SynthesisarXivLatentEncoder-DecoderICCV2021
2022 01 19Semantic-Aware Implicit Neural Audio-Driven Video Portrait GenerationarXivLatentEncoder-DecoderECCV2022
2021 04 22Pose-Controllable Talking Face Generation by Implicitly Modularized Audio-Visual RepresentationarXivLatentGANCVPR2021
2023 01 06Diffused Heads: Diffusion Models Beat GANs on Talking-Face GenerationarXivLatentDiffusion ModelCVPR24
2023 03 30DAE-Talker: High Fidelity Speech-Driven Talking Face Generation with Diffusion AutoencoderarXivLatentDiffusion ModelACM MM23
2023 11 26GAIA: Zero-shot Talking Avatar GenerationarXivLatentDiffusion ModelICLR 2024
2023 12 09R2-Talker: Realistic Real-Time Talking Head Synthesis with Hash Grid Landmarks Encoding and Progressive Multilayer ConditioningarXivKeyPointEncoder-Decoderarxiv
2024 05 06AniTalkerarXivLatentEncoder-Decoderarxiv
2024 07 12EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark ConditionsarXivKeyPointDiffusion Modelarxiv
2024 07 29LinguaLinker: Audio-Driven Portraits Animation with Implicit Facial Control EnhancementarXivLatentDiffusion Modelarxiv
2024 08 03Landmark-guided Diffusion Model for High-fidelity and Temporally Coherent Talking Head GenerationarXivKeyPointDiffusion Modelarxiv
2024 08 13High-fidelity and Lip-synced Talking Face Synthesis via Landmark-based Diffusion ModelarXivKeyPointDiffusion Modelarxiv
2022 11 22Real-time Neural Radiance Talking Portrait Synthesis via Audio-spatial DecompositionarXivLatentEncoder-Decoderarxiv
2023 05 04High-fidelity Generalized Emotional Talking Face Generation with Multi-modal Emotion Space LearningarXivLatentTransformerCVPR2023
2024 04 02EDTalk: Efficient Disentanglement for Emotional Talking Head SynthesisarXivLatentGANECCV2024
2023 11 29SyncTalkarXiv3D ParameterizationEncoder-DecoderCVPR24
2024 04 23TalkingGaussianarXiv3D ParameterizationEncoder-DecoderECCV2024
2024 09 19JEAN: Joint Expression and Audio-guided NeRF-based Talking Face GenerationarXivLatentEncoder-Decoderarxiv
2024 10 03LaDTalk: Latent Denoising for Synthesizing Talking Head Videos with High Frequency DetailsarXivLatentEncoder-Decoderarxiv
2024 10 18DAWN: Dynamic Frame Avatar with Non-autoregressive Diffusion Framework for Talking Head Video GenerationarXivLatentDiffusion Modelarxiv
2024 11 29LokiTalk: Learning Fine-Grained and Generalizable Correspondences to Enhance NeRF-based Talking Head SynthesisarXivLatentEncoder-Decoderarxiv
2024 11 29Ditto: Motion-Space Diffusion for Controllable Realtime Talking Head SynthesisarXivLatentDiffusion Modelarxiv
2024 12 15GoHD: Gaze-oriented and Highly Disentangled Portrait Animation with Rhythmic Poses and Realistic ExpressionarXivLatentDiffusion Modelarxiv
2024 12 10PortraitTalk: Towards Customizable One-Shot Audio-to-Talking Face GenerationarXivLatentDiffusion Modelarxiv
2024 12 05IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head GenerationarXivLatentEncoder-Decoderarxiv
2024 12 05INFP: Audio-Driven Interactive Head Generation in Dyadic ConversationsarXivLatentEncoder-Decoderarxiv
2024 12 05MEMO: Memory-Guided Diffusion for Expressive Talking Video GenerationarXivLatentEncoder-Decoderarxiv
2024 12 26UniAvatar: Taming Lifelike Audio-Driven Talking Head Generation with Comprehensive Motion and Lighting ControlarXivLatentDiffusion Modelarxiv
2025 01 24SyncAnimation: A Real-Time End-to-End Framework for Audio-Driven Human Pose and Talking Head AnimationarXivLatentDiffusion Modelarxiv
2025 02 02EmoTalkingGaussian: Continuous Emotion-conditioned Talking Head SynthesisarXivLatentDiffusion Modelarxiv
2025 02 13Long-Term TalkingFace Generation via Motion-Prior Conditional Diffusion ModelarXivLatentDiffusion Modelarxiv
2025 02 17SayAnything: Audio-Driven Lip Synchronization with Conditional Video DiffusionarXivLatentDiffusion Modelarxiv
2025 02 15SkyReels-A1: Expressive Portrait Animation in Video Diffusion TransformersarXivLatentDiffusion Modelarxiv
2025 02 20NeRF-3DTalker: Neural Radiance Field with 3D Prior Aided Audio Disentanglement for Talking Head SynthesisarXivLatentEncoder-Decoderarxiv
2025 02 24Dimitra: Audio-driven Diffusion model for Expressive Talking Head GenerationarXivLatentDiffusion Modelarxiv
2025 02 27InsTaG: Learning Personalized 3D Talking Head from Few-Second VideoarXiv3D ParameterizationEncoder-Decoderarxiv
2025 03 06FREAK: Frequency-modulated High-fidelity and Real-time Audio-driven Talking Portrait SynthesisarXiv3D ParameterizationEncoder-Decoderarxiv
2025 03 03KeyFace: Expressive Audio-Driven Facial Animation for Long Sequences via KeyFrame InterpolationarXiv3D ParameterizationEncoder-Decoderarxiv
2025 03 14RASA: Replace Anyone, Say Anything -- A Training-Free Framework for Audio-Driven and Universal Portrait Video EditingarXivLatentDiffusion Modelarxiv
2025 03 18PC-Talk: Precise Facial Animation Control for Audio-Driven Talking Face GenerationarXivLatentDiffusion Modelarxiv
2025 03 14Cafe-Talk: Generating 3D Talking Face Animation with Multimodal Coarse- and Fine-grained ControlarXivLatentDiffusion Modelarxiv
2025 03 24Teller: Real-Time Streaming Audio-Driven Portrait Animation with Autoregressive Motion GenerationarXivLatentDiffusion Modelarxiv
2025 03 28Audio-Plane: Audio Factorization Plane Gaussian Splatting for Real-Time Talking Head SynthesisarXivLatentDiffusion Modelarxiv
2025 03 26Dual Audio-Centric Modality Coupling for Talking Head GenerationarXivLatentDiffusion Modelarxiv
2025 04 01Monocular and Generalizable Gaussian Talking Head AnimationarXivLatentEncoder-Decoderarxiv
2025 04 03Audio-visual Controlled Video Diffusion with Masked Selective State Spaces Modeling for Natural Talking Head GenerationarXivLatentDiffusion Modelarxiv
2025 04 03VoiceCraft-Dub: Automated Video Dubbing with Neural Codec Language ModelsarXivLatentDiffusion Modelarxiv
2025 04 07FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion SynthesisarXivLatentDiffusion Modelarxiv
2025 04 08SE4Lip: Speech-Lip Encoder for Talking Head Synthesis to Solve Phoneme-Viseme Alignment AmbiguityarXivLatentEncoder-Decoderarxiv
2025 04 08Exploiting Temporal Audio-Visual Correlation Embedding for Audio-Driven One-Shot Talking Head AnimationarXivLatentEncoder-Decoderarxiv
2025 04 26Audio-Driven Talking Face Video Generation with Joint Uncertainty LearningarXivLatentEncoder-Decoderarxiv
2025 04 25Disentangle Identity, Cooperate Emotion: Correlation-Aware Emotional Talking Portrait GenerationarXivLatentDiffusion Modelarxiv
2025 05 27OmniSync: Towards Universal Lip Synchronization via Diffusion TransformersarXivLatentDiffusion Modelarxiv
2025 05 28Let Them Talk: Audio-Driven Multi-Person Conversational Video GenerationarXivLatentDiffusion Modelarxiv
2025 05 28FaceEditTalker: Interactive Talking Head Generation with Facial Attribute EditingarXivLatentDiffusion Modelarxiv
2025 05 29Hallo4: High-Fidelity Dynamic Portrait Animation via Direct Preference Optimization and Temporal Motion ModulationarXivLatentDiffusion Modelarxiv
2025 05 01SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion TransformersarXivLatentDiffusion Modelarxiv
2025 06 06LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion ModelsarXivLatentDiffusion Modelarxiv
2025 06 16Audio-Visual Driven Compression for Low-Bitrate Talking Head VideosarXivLatentEncoder-Decoderarxiv
2025 07 02FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme CasesarXivLatentGANarxiv
2025 07 01ARIG: Autoregressive Interactive Head Generation for Real-time ConversationsarXivLatentDiffusion Modelarxiv
2025 06 30JAM-Flow: Joint Audio-Motion Synthesis with Flow MatchingarXivLatentDiffusion Modelarxiv
2025 06 26GGTalker: Talking Head Systhesis with Generalizable Gaussian Priors and Identity-Specific AdaptationarXivLatentDiffusion Modelarxiv
2025 06 24Bind-Your-Avatar: Multi-Talking-Character Video Generation with Dynamic 3D-mask-based Embedding RouterarXivLatentDiffusion Modelarxiv
2025 07 07MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head GenerationarXivLatentDiffusion Modelarxiv
2025 07 04MoDA: Multi-modal Diffusion Architecture for Talking Head GenerationarXivLatentDiffusion Modelarxiv
2025 07 08MEDTalk: Multimodal Controlled 3D Facial Animation with Dynamic Emotions by Disentangled EmbeddingarXivLatentDiffusion Modelarxiv
2025 07 17ATL-Diff: Audio-Driven Talking Head Generation with Early Landmarks-Guide Noise DiffusionarXivLatentDiffusion Modelarxiv
2025 07 17Think-Before-Draw: Decomposing Emotion Semantics & Fine-Grained Controllable Expressive Talking Head GenerationarXivLatentDiffusion Modelarxiv
2025 07 11M2DAO-Talker: Harmonizing Multi-granular Motion Decoupling and Alternating Optimization for Talking-head GenerationarXivLatentDiffusion Modelarxiv
2025 07 22Livatar-1: Real-Time Talking Heads Generation with Tailored Flow MatchingarXivLatentDiffusion Modelarxiv
2025 07 25Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face GenerationarXivLatentDiffusion Modelarxiv
2025 07 28Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity PreservationarXivLatentDiffusion Modelarxiv
2025 08 05READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head GenerationarXivLatentDiffusion Modelarxiv
2025 08 04X-Actor: Emotional and Expressive Long-Range Portrait Acting from AudioarXivLatentDiffusion Modelarxiv
2025 08 07RAP: Real-time Audio-driven Portrait Animation with Video Diffusion TransformerarXivLatentDiffusion Modelarxiv
2025 07 29DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait AnimationarXivLatentDiffusion Modelarxiv
2025 08 11StableAvatar: Infinite-Length Audio-Driven Avatar Video GenerationarXivLatentDiffusion Modelarxiv
2025 08 14HM-Talker: Hybrid Motion Modeling for High-Fidelity Talking Head SynthesisarXivLatentDiffusion Modelarxiv
2025 08 16RealTalk: Realistic Emotion-Aware Lifelike Talking-Head SynthesisarXivLatentDiffusion Modelarxiv
2025 08 19EDTalk++: Full Disentanglement for Controllable Talking Head SynthesisarXivLatentDiffusion Modelarxiv
2025 08 20Taming Transformer for Emotion-Controllable Talking Face GenerationarXivLatentDiffusion Modelarxiv
2025 09 16AvatarSync: Rethinking Talking-Head Animation through Autoregressive PerspectivearXivLatentDiffusion Modelarxiv
2025 09 24SynchroRaMa : Lip-Synchronized and Emotion-Aware Talking Face Generation via Multi-Modal Emotion EmbeddingarXivLatentDiffusion Modelarxiv
2025 09 24Talking Head Generation via AU-Guided Landmark PredictionarXivLatentDiffusion Modelarxiv
2025 09 24KSDiff: Keyframe-Augmented Speech-Aware Dual-Path Diffusion for Facial AnimationarXivLatentDiffusion Modelarxiv
2024 04 28GaussianTalkerarXiv3D ParameterizationEncoder-DecoderACM MM2024
2025 10 08A Bridge from Audio to Video: Phoneme-Viseme Alignment Allows Every Face to Speak Multiple LanguagesarXivLatentDiffusion Modelarxiv
2025 10 01Audio Driven Real-Time Facial Animation for Social TelepresencearXivLatentDiffusion Modelarxiv
2025 10 12DEMO: Disentangled Motion Latent Flow Matching for Fine-Grained Controllable Talking Portrait SynthesisarXivLatentDiffusion Modelarxiv
2025 10 27Lookahead Anchoring: Preserving Character Identity in Audio-Driven Human AnimationarXivLatentDiffusion Modelarxiv
2025 10 26MAGIC-Talk: Motion-aware Audio-Driven Talking Face Generation with Customizable Identity ControlarXivLatentDiffusion Modelarxiv
2025 11 10ConsistTalk: Intensity Controllable Temporally Consistent Talking Head Generation with Diffusion Noise SearcharXivLatentDiffusion Modelarxiv
2025 11 27IMTalker: Efficient Audio-driven Talking Face Generation with Implicit Motion TransferarXivLatentDiffusion Modelarxiv
2025 12 12JoyAvatar: Real-time and Infinite Audio-Driven Avatar Generation with Autoregressive DiffusionarXivLatentDiffusion Modelarxiv
2025 12 12REST: Diffusion-based Real-time End-to-end Streaming Talking Head Generation via ID-Context Caching and Asynchronous Streaming DistillationarXivLatentDiffusion Modelarxiv
2025 12 15STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking PortraitsarXivLatentDiffusion Modelarxiv
2025 12 16TalkVerse: Democratizing Minute-Long Audio-Driven Video GenerationarXivLatentDiffusion Modelarxiv
2025 12 16FacEDiT: Unified Talking Face Editing and Generation via Facial Motion InfillingarXivLatentDiffusion Modelarxiv
2025 09 25X-Streamer: Unified Human World Modeling with Audiovisual InteractionarXivLatentDiffusion Modelarxiv
2021 12 10FaceFormer: Speech-Driven 3D Facial Animation with TransformersarXivLatentTransformerCVPR22
2023 09 15Towards the generation of synchronized and believable non-verbal facial behaviors of a talking virtual agentarXivLatentGANICMI 2023
2023 10 17CorrTalk: Correlation Between Hierarchical Speech and Facial Activity Variances for 3D AnimationarXivLatentEncoder-DecoderIEEE Transactions on Circuits and Systems for Video Technology 2024
Holistic Human || Audio-Driven Holistic Body Driving
DateTitlearXiv LinkMotion RepresentationBackboneVenue
2024 03 13VLOGGERarXiv3D ParameterizationDiffusion ModelarXiv
2022 12 05Audio-Driven Co-Speech Gesture Video GenerationarXivLatentEncoder-DecoderNeurIPS 2022
2024 09 04CyberHost: Taming Audio-driven Avatar Diffusion Model with Region Codebook AttentionarXivLatentDiffusion ModelarXiv
2024 09 13DiffTED: One-shot Audio-driven TED Talk Video Generation with Diffusion-based Co-speech GesturesarXivKeyPointDiffusion ModelarXiv
2024 09 27Self-Supervised Learning of Deviation in Latent Representation for Co-speech Gesture Video GenerationarXivRegionDiffusion ModelarXiv
2024 10 08TANGO: Co-Speech Gesture Video Reenactment with Hierarchical Audio Motion Embedding and Diffusion InterpolationarXivLatentEncoder-DecoderarXiv
2024 10 15TALK-Act: Enhance Textural-Awareness for 2D Speaking Avatar Reenactment with Diffusion ModelarXivLatentDiffusion ModelarXiv
2024 11 01Stereo-Talker: Audio-driven 3D Human Synthesis with Prior-Guided Mixture-of-ExpertsarXivLatentEncoder-DecoderarXiv
2024 11 18EchoMimicV2: Towards Striking, Simplified, and Semi-Body Human AnimationarXivLatentDiffusion ModelarXiv
2025 01 18EMO2: End-Effector Guided Audio-Driven Avatar Video GenerationarXivLatentDiffusion ModelarXiv
2025 02 03OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation ModelsarXivLatentDiffusion Modelarxiv
2025 02 11Contextual Gesture: Co-Speech Gesture Video Generation through Context-aware Gesture RepresentationarXivLatentDiffusion Modelarxiv
2025 03 13Cosh-DiT: Co-Speech Gesture Video Synthesis via Hybrid Audio-Visual Diffusion TransformersarXivKeyPointDiffusion Modelarxiv
2025 03 10Versatile Multimodal Controls for Whole-Body Talking Human AnimationarXivLatentDiffusion Modelarxiv
2025 03 25AudCast: Audio-Driven Human Video Generation by Cascaded Diffusion TransformersarXivLatentDiffusion Modelarxiv
2025 05 06PAHA: Parts-Aware Audio-Driven Human Animation with Diffusion ModelarXivLatentDiffusion Modelarxiv
2025 05 07HunyuanCustom: A Multimodal-Driven Architecture for Customized Video GenerationarXivLatentDiffusion Modelarxiv
2025 05 26HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple CharactersarXivLatentDiffusion Modelarxiv
2025 04 11EasyGenNet: An Efficient Framework for Audio-Driven Gesture Video Generation Based on Diffusion ModelarXivLatentDiffusion Modelarxiv
2025 05 29MMGT: Motion Mask Guided Two-Stage Network for Co-Speech Gesture Video GenerationarXivLatentDiffusion Modelarxiv
2025 06 11InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio ConditionsarXivLatentDiffusion Modelarxiv
2025 06 11AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human AnimationarXivLatentDiffusion Modelarxiv
2025 06 23OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body AnimationarXivLatentDiffusion Modelarxiv
2025 06 27MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody AnimationarXivLatentDiffusion Modelarxiv
2025 07 05EchoMimicV3: 1.3B Parameters are All You Need for Unified Multi-Modal and Multi-Task Human AnimationarXivLatentDiffusion Modelarxiv
2025 07 09Democratizing High-Fidelity Co-Speech Gesture Video GenerationarXivKeyPointDiffusion Modelarxiv
2025 08 15FantasyTalking2: Timestep-Layer Adaptive Preference Optimization for Audio-Driven Portrait AnimationarXivLatentDiffusion Modelarxiv
2025 08 19InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video DubbingarXivLatentDiffusion Modelarxiv
2025 09 11Kling-Avatar: Grounding Multimodal Instructions for Cascaded Long-Duration Avatar Animation SynthesisarXivLatentDiffusion Modelarxiv
2025 10 02Input-Aware Sparse Attention for Real-Time Co-Speech Video GenerationarXivLatentDiffusion Modelarxiv
2025 10 11VividAnimator: An End-to-End Audio and Pose-driven Half-Body Human Animation FrameworkarXivLatentDiffusion Modelarxiv
2025 10 12Playmate2: Training-Free Multi-Character Audio-Driven Animation via Diffusion Transformer with Reward FeedbackarXivLatentDiffusion Modelarxiv
2025 11 28AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity RefinementarXivLatentDiffusion Modelarxiv
2025 12 01EvalTalker: Learning to Evaluate Real-Portrait-Driven Multi-Subject Talking HumansarXivLatentDiffusion Modelarxiv
2025 11 30TalkingPose: Efficient Face and Gesture Animation with Feedback-guided Diffusion ModelarXivLatentDiffusion Modelarxiv
2025 12 02Co-speech Gesture Video Generation via Motion-Based Graph RetrievalarXivKeyPointDiffusion Modelarxiv
2025 12 04Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite LengtharXivKeyPointDiffusion Modelarxiv
2025 12 25KlingAvatar 2.0 Technical ReportarXivLatentDiffusion Modelarxiv
2025 12 22ActAvatar: Temporally-Aware Precise Action Control for Talking AvatarsarXivLatentDiffusion Modelarxiv
2025 12 21In-Context Audio Control of Video Diffusion TransformersarXivLatentDiffusion Modelarxiv
2025 12 20MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video GenerationarXivLatentDiffusion Modelarxiv
2025 12 29LiveTalk: Real-Time Multimodal Interactive Video Diffusion via Improved On-Policy DistillationarXivLatentDiffusion Modelarxiv
2025 12 29SoulX-LiveTalk Technical ReportarXivLatentDiffusion Modelarxiv
2025 12 28ByteLoom: Weaving Geometry-Consistent Human-Object Interactions through Progressive Curriculum LearningarXivLatentDiffusion Modelarxiv
2025 12 25Knot Forcing: Taming Autoregressive Video Diffusion Models for Real-time Infinite Interactive Portrait AnimationarXivLatentDiffusion Modelarxiv
2026 01 02Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural ConversationarXivLatentDiffusion Modelarxiv
2025 12 26StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human AvatarsarXivLatentDiffusion Modelarxiv
2025 12 02YingVideo-MV: Music-Driven Multi-Stage Video GenerationarXivLatentDiffusion Modelarxiv
2024 05 15Dance Any Beat: Blending Beats with Visuals in Dance Video GenerationarXivRegionDiffusion Modelarxiv
2025 02 24X-Dancer: Expressive Music to Human Dance Video GenerationarXivKeyPointDiffusion Modelarxiv
2025 03 18MusicInfuser: Making Video Diffusion Listen and DancearXivLatentDiffusion Modelarxiv
2025 07 26ChoreoMuse: Robust Music-to-Dance Video Generation with Style Transfer and Beat-Adherent MotionarXivLatentDiffusion Modelarxiv
2025 01 30Every Image Listens, Every Image Dances: Music-Driven Image AnimationarXivRegionDiffusion Modelarxiv
Part (Face) || Fine-Grained Style and Emotion-Driven Animation
DateTitlearXiv LinkMotion RepresentationBackboneVenue
2021 05 19Audio-Driven Emotional Video PortraitsarXivKeyPointEncoder-DecoderCVPR 2021
2023 06 10StyleTalk: One-shot Talking Head Generation with Controllable Speaking StylesarXiv3D ParameterizationEncoder-DecoderAAAI 2023
2024 01 16Real3D-Portrait: One-shot Realistic 3D Talking Portrait SynthesisarXiv3D ParameterizationEncoder-DecoderICLR 2024
2023 12 15DreamTalk: When Expressive Talking Head Generation Meets Diffusion Probabilistic ModelsarXiv3D ParameterizationDiffusion ModelarXiv
2024 06 04V-Express: Conditional Dropout for Progressive Training of Portrait Video GenerationarXivKeyPointDiffusion ModelarXiv
2021 07 21Speech Driven Talking Face Generation from a Single Image and an Emotion ConditionarXivLatentGANIEEE Transactions on Multimedia 2021
2022 11 22SadTalkerarXivLatentDiffusion ModelCVPR 2023
2022 11 28High-fidelity Facial Avatar Reconstruction from Monocular Video with Generative PriorsarXiv3D ParameterizationGANCVPR 2023
2023 05 09StyleSync: High-Fidelity Generalized and Personalized Lip Sync in Style-based GeneratorarXivLatentGANCVPR 2023
2024 02 27EMOarXivLatentDiffusion ModelarXiv
2024 03 04FaceChain-ImagineID: Freely Crafting High-Fidelity Diverse Talking Faces from Disentangled AudioarXivLatentDiffusion ModelCVPR 2024
2024 04 29EMOPortraitsarXivLatentGANCVPR 2024
2024 05 12Listen, Disentangle, and Control: Controllable Speech-Driven Talking Head GenerationarXivLatentGANarXiv
2024 06 16Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image AnimationarXivLatentDiffusion ModelarXiv
2024 10 11Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image AnimationarXivLatentDiffusion ModelarXiv
2024 04 16VASA-1arXivLatentDiffusion Model By TransformerarXiv
2024 08 20S^3D-NeRF: Single-Shot Speech-Driven Neural Radiance Field for High Fidelity Talking Head SynthesisarXivLatentEncoder-DecoderarXiv
2024 08 20FD2Talk: Towards Generalized Talking Head Generation with Facial Decoupled Diffusion ModelarXiv3D ParameterizationDiffusion ModelACMMM 2024
2024 08 28MegActor-Σ: Unlocking Flexible Mixed-Modal Control in Portrait Animation with Diffusion TransformerarXivLatentDiffusion Model By TransformerarXiv
2024 09 05Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion DependencyarXivLatentDiffusion ModelarXiv
2024 09 05PoseTalk: Text-and-Audio-based Pose Control and Motion Refinement for One-Shot Talking Head GenerationarXivLatentDiffusion ModelarXiv
2024 09 06SVP: Style-Enhanced Vivid Portrait Talking Head Diffusion ModelarXivLatentDiffusion ModelarXiv
2024 09 12EMOdiffhead: Continuously Emotional Control in Talking Head Generation via DiffusionarXiv3D ParameterizationDiffusion ModelarXiv
2024 09 17StyleTalk++: A Unified Framework for Controlling the Speaking Styles of Talking HeadsarXiv3D ParameterizationEncoder-DecoderarXiv
2024 09 23JoyHallo: Digital human model for MandarinarXivLatentDiffusion ModelarXiv
2024 09 24MIMAFace: Face Animation via Motion-Identity Modulated Appearance Feature LearningarXivLatentDiffusion ModelarXiv
2024 10 10MimicTalk: Mimicking a personalized and expressive 3D talking face in minutesarXiv3D ParameterizationEncoder-DecoderNips 2024
2024 10 21Takin-ADA: Emotion Controllable Audio-Driven Animation with Canonical and Landmark Loss OptimizationarXivLatentEncoder-DecoderarXiv
2024 10 24Audio-Driven Emotional 3D Talking-Head GenerationarXivLatentEncoder-DecoderarXiv
2024 11 15JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion GenerationarXivLatentDiffusion ModelarXiv
2024 11 15LES-Talker: Fine-Grained Emotion Editing for Talking Head Generation in Linear Emotion SpacearXivLatentEncoder-DecoderarXiv
2024 11 28LetsTalk: Latent Diffusion Transformer for Talking Video SynthesisarXivLatentEncoder-DecoderarXiv
2024 11 23EmotiveTalk: Expressive Talking Head Generation through Audio Information Decoupling and Emotional Video DiffusionarXivRegionDiffusion ModelarXiv
2024 11 25Sonic: Shifting Focus to Global Audio Perception in Portrait AnimationarXivLatentDiffusion ModelarXiv
2024 12 04SINGER: Vivid Audio-driven Singing Video Generation with Multi-scale Spectral Diffusion ModelarXivLatentDiffusion ModelarXiv
2024 12 01Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Diffusion Transformer NetworksarXivLatentDiffusion ModelarXiv
2024 12 02FLOAT: Generative Motion Latent Flow Matching for Audio-driven Talking PortraitarXivLatentDiffusion ModelarXiv
2024 12 13VQTalker: Towards Multilingual Talking Avatars through Facial Motion TokenizationarXivLatentDiffusion ModelarXiv
2024 12 18Real-time One-Step Diffusion-based Expressive Portrait Videos GenerationarXivLatentDiffusion ModelarXiv
2025 01 03MoEE: Mixture of Emotion Experts for Audio-Driven Portrait AnimationarXivLatentDiffusion ModelarXiv
2025 02 11Playmate: Flexible Control of Portrait Animation via 3D-Implicit Space Guided DiffusionarXivLatentDiffusion ModelarXiv
2025 03 25EmoHead: Emotional Talking Head via Manipulating Semantic Expression ParametersarXivLatentDiffusion ModelarXiv
2025 03 25MVPortrait: Text-Guided Motion and Emotion Control for Multi-view Vivid Portrait AnimationarXivLatentDiffusion ModelarXiv
2025 03 24DisentTalk: Cross-lingual Talking Face Generation via Semantic Disentangled Diffusion ModelarXivLatentDiffusion ModelarXiv
2024 08 07ReSyncer: Rewiring Style-based Generator for Unified Audio-Visually Synced Facial PerformerarXivLatentEncoder-DecoderECCV 2024
2023 01 05Expressive Speech-driven Facial Animation with controllable emotionsarXivLatentEncoder-DecoderICMEW 2023
2024 01 28Media2Face: Co-speech Facial Animation Generation With Multi-Modality GuidancearXivLatentDiffusion ModelarXiv

LLM for Motion Planning

LLM for 2D
DateTitlearXiv LinkMotion RepresentationBackboneTasksVenue
2023 01 26Affective Faces for Goal-Driven Dyadic CommunicationarXiv3D ParameterizationDiffusion ModelText2Facearxiv
2023 11 29Disentangling Planning, Driving and Rendering for Photorealistic Avatar AgentsarXivLatentEncoder-DecoderTaking Headarxiv
2024 05 24InstructAvatar: Text-Guided Emotion and Motion Control for Avatar GenerationarXivLatentDiffusion ModelTaking Headarxiv
2025 05 27OmniResponse: Online Multimodal Conversational Response Generation in Dyadic InteractionsarXivLatentDiffusion ModelTaking Headarxiv
LLM for 3D
DateTitlearXiv LinkMotion RepresentationBackboneTasksVenue
2023 08 21Can Language Models Learn to Listen?arXivLatentAutoregressiveListener GenerationICCV 2023
2023 06 19MotionGPT: Finetuned LLMs Are General-Purpose Motion GeneratorsarXivLatentAutoregressiveText2Motion3DAAAI 2024
2023 11 27InterControl: Generate Human Motion Interactions by Controlling Every JointarXivLatentDiffusion ModelText2Motion3DarXiv
2023 11 28AvatarGPT: All-in-One Framework for Motion Understanding, Planning, Generation and BeyondarXivLatentAutoregressiveText2Motion3DCVPR 2024
2023 12 07Digital Life Project: Autonomous 3D Characters with Social IntelligencearXivLatentDiffusion ModelText2Motion3DCVPR 2024
2023 12 19MotionScript: Natural Language Descriptions for Expressive 3D Human MotionsarXivLatentDiffusion ModelText2Motion3DarXiv
2023 12 22Plan, Posture and Go: Towards Open-World Text-to-Motion GenerationarXivLatentAutoregressiveText2Motion3DarXiv
2024 08 20Combo: Co-speech holistic 3D human motion generation and efficient customizable adaptation in harmonyarXivLatentEncoder-DecoderText2Motion3DarXiv
2023 12 22FineMoGen: Fine-Grained Spatio-Temporal Motion Generation and EditingarXivLatentAutoregressiveText2Motion3DNeurIPS 2024

Cite The Survey

If you find our survey and repository useful for your research project, please consider citing our paper:

@article{xue2024human,
  title={Human Motion Video Generation: A Survey}, 
  author={Xue, Haiwei and Luo, Xiangyang and Hu, Zhanghao and Zhang, Xin and Xiang, Xunzhi and Dai, Yuqin and Liu, Jianzhuang and Zhang, Zhensong and Li, Minglei and Yang, Jian and Ma, Fei and Wu, Zhiyong and Yang, Changpeng and Dai, Zonghong and Yu, Fei Richard},
  journal={IEEE Transactions on Pattern Analysis and Machine Intelligence}, 
  year={2025},
  doi={10.1109/TPAMI.2025.3594034}
}

Contributing

Contributions are welcome! Please feel free to create an issue or open a pull request with your contributions.

Haiwei Xue
Haiwei Xue

💻 🎨 🤔
Xiangyang Luo
Xiangyang Luo

🐛
Zhanghao Hu
Zhanghao Hu

🥙 💻
Xin Zhang
Xin Zhang

😘🎪 😍
Xunzhi Xiang
Xunzhi Xiang

🚄 😍
Yuqin Dai
Yuqin Dai

😘 👸

License

This project is licensed under the MIT License - see the LICENSE file for details.

Acknowledgements

We would like to acknowledge the contributions of all researchers and developers in the field of human motion video generation. Their work has been instrumental in the advancement of this technology.