Awesome Agent Reinforcement Learning

October 10, 2025 Β· View on GitHub

Awesome Agent Reinforcement Learning

License: MIT Awesome

Curated collection of papers and resources on unlocking the potential of Agents through Reinforcement Learning

If you would like to train your own agent with reinforcement learning, take a look at: <a href=https://github.com/0russwest0/Agent-R1>Agent-R1 πŸ˜„

πŸ“„ Papers

Note: The specific focus on end-to-end training (rather than single-step optimization)

VL-DAC

[2508] Enhancing Vision-Language Model Training with Reinforcement Learning in Synthetic Worlds for Real-World Success Code πŸ’» George Bredis, Stanislav Dereka, Vyacheslav Sinii, Ruslan Rakhimov, Daniil Gavrilov

Verlog

[2508] Verlog: A Multi-turn RL framework for LLM agents Code πŸ’» Wen-Tse Chen, Jiayu Chen, Hao Zhu, Jeff Schneider

ASearcher

[2508] Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL Code πŸ’» Jiaxuan Gao, Wei Fu, Minyang Xie, Shusheng Xu, Chuyi He, Zhiyu Mei, Banghua Zhu, Yi Wu

MemAgent

[2507] MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent Code πŸ’» Hongli Yu, Tinghong Chen, Jiangtao Feng, Jiangjie Chen, Weinan Dai, Qiying Yu, Ya-Qin Zhang, Wei-Ying Ma, Jingjing Liu, Mingxuan Wang, Hao Zhou

ZeroSearch

[2505] ZeroSearch: Incentivize the Search Capability of LLMs without Searching Code πŸ’»
Hao Sun, Zile Qiao, Jiayan Guo, Xuanbo Fan, Yingyan Hou, Yong Jiang, Pengjun Xie, Yan Zhang, Fei Huang, Jingren Zhou

SkyRL-v0

[2505] SkyRL-v0: Train Real-World Long-Horizon Agents via Reinforcement Learning Code πŸ’»
Shiyi Cao, Sumanth Hegde, Dacheng Li, Tyler Griggs, Shu Liu, Eric Tang, Jiayi Pan, Xingyao Wang, Akshay Malik, Kourosh Hakhamaneshi, Richard Liaw, Philipp Moritz, Matei Zaharia,Β Joseph E. Gonzalez,Β Ion Stoica

ARTIST

[2505] Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning
Joykirat Singh, Raghav Magazine, Yash Pandya, Akshay Nambi

Agent RL Scaling Law

[2505] Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving Code πŸ’»
Xinji Mai, Haotian Xu, Xing W, Weinong Wang, Yingying Zhang, Wenqiang Zhang

GiGPO

[2505] Group-in-Group Policy Optimization for LLM Agent Training Code πŸ’»
Lang Feng, Zhenghai Xue, Tingcong Liu, Bo An

StepSearch

[2505] StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization Code πŸ’»
Ziliang Wang, Xuhui Zheng, Kang An, Cijun Ouyang, Jialu Cai, Yuhang Wang, Yichao Wu

Multi-Turn-RL-Agent

[2505] Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Credit Assignment Code πŸ’»
Siliang Zeng, Quan Wei, William Brown, Oana Frunza, Yuriy Nevmyvaka, Mingyi Hong

ReTool

[2504] ReTool: Reinforcement Learning for Strategic Tool Use in LLMs Code πŸ’»
Jiazhan Feng, Shijue Huang, Xingwei Qu, Ge Zhang, Yujia Qin, Baoquan Zhong, Chengquan Jiang, Jinxin Chi, Wanjun Zhong

RAGEN

[2504] RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning Code πŸ’»
Zihan Wang, Kangrui Wang, Qineng Wang, Pingyue Zhang, Linjie Li, Zhengyuan Yang, Kefan Yu, Minh Nhat Nguyen, Licheng Liu, Eli Gottlieb, Monica Lam, Yiping Lu, Kyunghyun Cho, Jiajun Wu, Li Fei-Fei, Lijuan Wang, Yejin Choi, Manling Li

OTC

[2504] OTC: Optimal Tool Calls via Reinforcement Learning
Hongru Wang, Cheng Qian, Wanjun Zhong, Xiusi Chen, Jiahao Qiu, Shijue Huang, Bowen Jin, Mengdi Wang, Kam-Fai Wong, Heng Ji

R1-Searcher

[2503] R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning Code πŸ’»
Huatong Song, Jinhao Jiang, Yingqian Min, Jie Chen, Zhipeng Chen, Wayne Xin Zhao, Lei Fang, Ji-Rong Wen. Preprint'25

Search-R1

[2503] Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning Code πŸ’»
Bowen Jin, Hansi Zeng, Zhenrui Yue, Dong Wang, Hamed Zamani, Jiawei Han. Preprint'25

AutoCoA

[2503] Agent models: Internalizing Chain-of-Action Generation into Reasoning models Code πŸ’»
Yuxiang Zhang, Yuqi Yang, Jiangming Shu, Xinyan Wen, Jitao Sang. Preprint'25

ReSearch

[2503] ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning Code πŸ’»
Mingyang Chen, Tianpeng Li, Haoze Sun, Yijie Zhou, Chenzheng Zhu, Fan Yang, Zenan Zhou, Weipeng Chen.

ToRL

[2503] ToRL: Scaling Tool-Integrated RL Code πŸ’»
Xuefeng Li, Haoyang Zou, Pengfei Liu

MMSearch-R1

[2503] MMSearch-R1: Incentivizing LMMs to Search Code πŸ’»
Jinming Wu, Zihao Deng, Wei Li, Yiding Liu, Bo You, Zejun Ma

🌐 Open-Source Projects

OpenManus-RL

OpenManus-RL πŸ’» OpenManus-RL

RAGEN

RAGEN: Training Agents by Reinforcing Reasoning πŸ’» RAGEN

Agent-R1

Agent-R1: Training Powerful LLM Agents with End-to-End Reinforcement Learning πŸ’» Agent-R1

VAGEN

VAGEN: Training VLM Agents with Multi-Turn Reinforcement Learning πŸ’» VAGEN

🎁 Resources

Tip: Tutorials and Prospects on Reinforcement Learning for Agents

Reinforcement Learning for Agents

Reinforcement Learning for Agents - Will Brown, ML Researcher at Morgan Stanley YouTube

Actual LLM Agents are Coming

Actual LLM agents are coming. They will be trained. Blog

The Model is the Product

What is the next cycle of AI development? Agents? Reasoners? Actual multimodality? Blog

Farewell to Agentic Workflow?

Reasoning Model + Action Chain Learning = Agent Model Article

Chain-of-Action

Chain-of-Action: From Agent Workflow to Agent Models Article