Awesome Agent Reinforcement Learning
October 10, 2025 Β· View on GitHub
Awesome Agent Reinforcement Learning
Curated collection of papers and resources on unlocking the potential of Agents through Reinforcement Learning
If you would like to train your own agent with reinforcement learning, take a look at: <a href=https://github.com/0russwest0/Agent-R1>Agent-R1 π
π Papers
Note: The specific focus on end-to-end training (rather than single-step optimization)
VL-DAC
[2508] Enhancing Vision-Language Model Training with Reinforcement Learning in Synthetic Worlds for Real-World Success Code π» George Bredis, Stanislav Dereka, Vyacheslav Sinii, Ruslan Rakhimov, Daniil Gavrilov
Verlog
[2508] Verlog: A Multi-turn RL framework for LLM agents Code π» Wen-Tse Chen, Jiayu Chen, Hao Zhu, Jeff Schneider
ASearcher
[2508] Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL Code π» Jiaxuan Gao, Wei Fu, Minyang Xie, Shusheng Xu, Chuyi He, Zhiyu Mei, Banghua Zhu, Yi Wu
MemAgent
[2507] MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent Code π» Hongli Yu, Tinghong Chen, Jiangtao Feng, Jiangjie Chen, Weinan Dai, Qiying Yu, Ya-Qin Zhang, Wei-Ying Ma, Jingjing Liu, Mingxuan Wang, Hao Zhou
ZeroSearch
[2505] ZeroSearch: Incentivize the Search Capability of LLMs without Searching Code π»
Hao Sun, Zile Qiao, Jiayan Guo, Xuanbo Fan, Yingyan Hou, Yong Jiang, Pengjun Xie, Yan Zhang, Fei Huang, Jingren Zhou
SkyRL-v0
[2505] SkyRL-v0: Train Real-World Long-Horizon Agents via Reinforcement Learning Code π»
Shiyi Cao, Sumanth Hegde, Dacheng Li, Tyler Griggs, Shu Liu, Eric Tang, Jiayi Pan, Xingyao Wang, Akshay Malik, Kourosh Hakhamaneshi, Richard Liaw, Philipp Moritz, Matei Zaharia,Β Joseph E. Gonzalez,Β Ion Stoica
ARTIST
[2505] Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning
Joykirat Singh, Raghav Magazine, Yash Pandya, Akshay Nambi
Agent RL Scaling Law
[2505] Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving Code π»
Xinji Mai, Haotian Xu, Xing W, Weinong Wang, Yingying Zhang, Wenqiang Zhang
GiGPO
[2505] Group-in-Group Policy Optimization for LLM Agent Training Code π»
Lang Feng, Zhenghai Xue, Tingcong Liu, Bo An
StepSearch
[2505] StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization Code π»
Ziliang Wang, Xuhui Zheng, Kang An, Cijun Ouyang, Jialu Cai, Yuhang Wang, Yichao Wu
Multi-Turn-RL-Agent
[2505] Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Credit Assignment Code π»
Siliang Zeng, Quan Wei, William Brown, Oana Frunza, Yuriy Nevmyvaka, Mingyi Hong
ReTool
[2504] ReTool: Reinforcement Learning for Strategic Tool Use in LLMs Code π»
Jiazhan Feng, Shijue Huang, Xingwei Qu, Ge Zhang, Yujia Qin, Baoquan Zhong, Chengquan Jiang, Jinxin Chi, Wanjun Zhong
RAGEN
[2504] RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning Code π»
Zihan Wang, Kangrui Wang, Qineng Wang, Pingyue Zhang, Linjie Li, Zhengyuan Yang, Kefan Yu, Minh Nhat Nguyen, Licheng Liu, Eli Gottlieb, Monica Lam, Yiping Lu, Kyunghyun Cho, Jiajun Wu, Li Fei-Fei, Lijuan Wang, Yejin Choi, Manling Li
OTC
[2504] OTC: Optimal Tool Calls via Reinforcement Learning
Hongru Wang, Cheng Qian, Wanjun Zhong, Xiusi Chen, Jiahao Qiu, Shijue Huang, Bowen Jin, Mengdi Wang, Kam-Fai Wong, Heng Ji
R1-Searcher
[2503] R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning Code π»
Huatong Song, Jinhao Jiang, Yingqian Min, Jie Chen, Zhipeng Chen, Wayne Xin Zhao, Lei Fang, Ji-Rong Wen. Preprint'25
Search-R1
[2503] Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning Code π»
Bowen Jin, Hansi Zeng, Zhenrui Yue, Dong Wang, Hamed Zamani, Jiawei Han. Preprint'25
AutoCoA
[2503] Agent models: Internalizing Chain-of-Action Generation into Reasoning models Code π»
Yuxiang Zhang, Yuqi Yang, Jiangming Shu, Xinyan Wen, Jitao Sang. Preprint'25
ReSearch
[2503] ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning Code π»
Mingyang Chen, Tianpeng Li, Haoze Sun, Yijie Zhou, Chenzheng Zhu, Fan Yang, Zenan Zhou, Weipeng Chen.
ToRL
[2503] ToRL: Scaling Tool-Integrated RL Code π»
Xuefeng Li, Haoyang Zou, Pengfei Liu
MMSearch-R1
[2503] MMSearch-R1: Incentivizing LMMs to Search Code π»
Jinming Wu, Zihao Deng, Wei Li, Yiding Liu, Bo You, Zejun Ma
π Open-Source Projects
OpenManus-RL
RAGEN
RAGEN: Training Agents by Reinforcing Reasoning π»
Agent-R1
Agent-R1: Training Powerful LLM Agents with End-to-End Reinforcement Learning π»
VAGEN
VAGEN: Training VLM Agents with Multi-Turn Reinforcement Learning π»
π Resources
Tip: Tutorials and Prospects on Reinforcement Learning for Agents
Reinforcement Learning for Agents
Reinforcement Learning for Agents - Will Brown, ML Researcher at Morgan Stanley
Actual LLM Agents are Coming
Actual LLM agents are coming. They will be trained.
The Model is the Product
What is the next cycle of AI development? Agents? Reasoners? Actual multimodality?
Farewell to Agentic Workflow?
Reasoning Model + Action Chain Learning = Agent Model