Awesome-Multimodal-Large-Language-Models-for-UAV-Vision-Language-Perception
April 7, 2026 · View on GitHub
School of Artificial Intelligence, OPtics, and ElectroNics (iOPEN), Northwestern Polytechnical University
✨✨✨ Behold our meticulously curated trove of UAV-MLLMs resources!!!
🎉🚀💡 The website will be updated in real-time to track the latest state of UAV-MLLMs!!!
🌟🔥📢 A collection of low-altitude UAV multimodal large language model papers focusing on the vision-language domain.
Please share a STAR ⭐ if this project does help
You can focus on remote sensing multimodal large language model (Vision-Language) here
📢 Latest Updates
In this repository, we will collect and document researchers and their outstanding work related to multimodal large language models for low-altitude UAV (vision-language perception).
- The list will be continuously updated 🔥🔥
- 📦 coming soon! 🚀
- Nov-26-2025: The first UAV-MLLMs repository has been created. 🔥🔥
- Jan-17-2024: A curated list about remote sensing multimodal large language models (Vision-Language) is created. 🔥🔥
Awesome Papers
Multimodal Large Language Models for UAV
Agents for UAV Visual Perception
| Title | Venue | Date | Code | Note |
|---|---|---|---|---|
| Multimodal Large Language Models-Enabled UAV Swarm: Towards Efficient and Intelligent Autonomous Aerial Systems Ping, Y., Liang, T., Ding, H., Lei, G., Wu, J., Zou, X., ... & Zhang, T. | IEEE WC | 2025-12-16 | YouTube | - |
Towards Accurate UAV Image Perception: Guiding Vision-Language Models with Stronger Task Prompts Mingning Guo, Mengwei Wu, Shaoxian Li, Haifeng Li, Chao Tao. | arXiv | 2025-12-08 | Github | - |
| Multimodal Large Language Models-Enabled UAV Swarm: Towards Efficient and Intelligent Autonomous Aerial Systems Yuqi Ping, Tianhao Liang, Huahao Ding, Guangyu Lei, Junwei Wu, Xuan Zou, Kuan Shi, Rui Shao, Chiya Zhang, Weizheng Zhang, Weijie Yuan, Tingting Zhang | arXiv | 2025-06-15 | - | YouTube Demo |
UAV-VLA: Vision-Language-Action System for Large Scale Aerial Mission Generation Oleg Sautenkov; Yasheerah Yaqoot; Artem Lykov; Muhammad Ahsan Mustafa; Grik Tadevosyan; Aibek Akhmetkazy | HRI | 2025-03-06 | Github | - |
Vision-Language Perception Task for UAVs
Spatial Aerial Video Grounding
| Title | Venue | Date | Code | Note |
|---|---|---|---|---|
Where Does It Exist from the Low-Altitude: Spatial Aerial Video Grounding Yang Zhan, Yuan Yuan | NeurIPS | 2025-09-19 | Github | Referring Single-Object Tracking |
Referring Multi-Object Tracking
| Title | Venue | Date | Code | Note |
|---|---|---|---|---|
| AerialMind: Towards Referring Multi-Object Tracking in UAV Scenarios Chenglizhao Chen, Shaofeng Liang, Runwei Guan, Xiaolou Sun, Haocheng Zhao, Haiyun Jiang, Tao Huang, Henghui Ding, Qing-Long Han | AAAI | 2025-11-26 | - | - |
Vision-Language Aerial Video Recognition
| Title | Venue | Date | Code | Note |
|---|---|---|---|---|
MVPC-CLIP: Multi-granularity Visual Prompt Co-operative for Aerial Video Recognition Yang Zhan, Yuan Yuan | T-MM | 2025-09-08 | Github | - |
| Improving Vision-Language Models With Attention Mechanisms for Aerial Video Classification Nguyen Anh Tu; Nartay Aikyn | GRSL | 2025-01-23 | - | - |
Drone Text-Video Retrieval
| Title | Venue | Date | Code | Note |
|---|---|---|---|---|
| TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval Zixu Zhao, Yang Zhan | arXiv | 2025-10-11 | - | under review |
Referring Expression Comprehension
| Title | Venue | Date | Code | Note |
|---|---|---|---|---|
RefDrone: A Challenging Benchmark for Referring Expression Comprehension in Drone Scenes Sun, Z., Liu, Y., Zhu, H., Gu, Y., Zou, Y., Liu, Z., ... & Xu, Y. | arXiv | 2025-02-01 | Github | - |
RSVG: Exploring Data and Model for Visual Grounding on Remote Sensing Data Yang Zhan, Zhitong Xiong, Yuan Yuan | T-GRS | 2023-02-28 | Github | REC on RS |
Referring Expression Segmentation
| Title | Venue | Date | Code | Note |
|---|---|---|---|---|
DVGBench: Implicit-to-Explicit Visual Grounding Benchmark in UAV Imagery with Large Vision-Language Models Yue Zhou, Jue Chen, Zilun Zhang, Penghui Huang, Ran Ding, Zhentao Zou, PengFei Gao, Yuchen Wei, Ke Li, Xue Yang, Xue Jiang, Hongxin Yang, Jonathan Li | arXiv | 2026-01-02 | Github | - |
RIS-LAD: Referring Low-Altitude Drone Image Segmentation Kai Ye, YingShi Luan, Zhudi Chen, Guangyue Meng, Pingyang Dai, Liujuan Cao | arXiv | 2025-09-25 | Github | - |
AeroReformer: Aerial Referring Transformer for UAV-based Referring Image Segmentation Rui Li, Xiaowei Zhao | arXiv | 2025-02-01 | Github | - |
Aerial Image Captioning
| Title | Venue | Date | Code | Note |
|---|---|---|---|---|
Aerial Mirage: Unmasking Hallucinations in Large Vision Language Models Debolena Basak, Soham Bhatt, Sahith Kanduri, Maunendra Sankar Desarkar | WACV | 2025-04 | Github | - |
Other Related Survey Paper
| Title | Venue | Date | Code | Note |
|---|---|---|---|---|
UAVs Meet LLMs: Overviews and Perspectives Toward Agentic Low-Altitude Mobility Tian, Y., Lin, F., Li, Y., Zhang, T., Zhang, Q., Fu, X., ... & Wang, F. Y. | Information Fusion | 2025-04-05 | Github | - |
Multimodal Large Language Models for Remote Sensing: A Survey Yang Zhan, Yuan Yuan | - | 2024-01-17 | Github | - |
Star History
🤖 Contact
If you have any questions about this project, please feel free to contact zhanyangnwpu@gmail.com.