Awesome LLM-RLVR [🔥📜]
July 27, 2026 · View on GitHub
A curated list of research papers, tools, datasets, and frameworks for Reinforcement Learning with Verifiable Rewards (RLVR) in Large Language Models (LLMs).
Inspired by the intersection of alignment, reasoning, and self-improvement in foundation models.
Contributions welcome! See contributing guidelines below.
🗂️ Table of Contents
🌟 Motivation
RLVR is a rapidly evolving paradigm for aligning LLMs through external reward verification, self-consistency, and bootstrap learning, enabling models to improve reasoning capabilities without relying heavily on human supervision.
🔄 Auto-Fetched Recent Papers
- HSD: Hybrid Hindsight Self-Distillation <2026-07-24>
Qiye Cai, Yichuan Ma, Linyang Li, Peiji Li, Yongkang Chen, Qipeng Guo, Yicheng Zou, Xiaocheng Feng, Bing Qin. [Paper] - Hint-Guided Diversified Policy Optimization for LLM Reasoning <2026-07-24>
Zhiyu Cao, Kaixin Wu, Mingjie Zhong, Peifeng Li, Xiaobo Li, Can Ye, Qiaoming Zhu. [Paper] - Learning as Reasoning Unfolds: Progressive Rollout Allocation for Efficient Reinforcement Learning <2026-07-24>
Heyang Jiang, Henry Liu, Baharan Mirzasoleiman. [Paper] - Teaching LLMs to Self-Evolve: Cultivating Core Meta-Skills with Reinforcement Learning <2026-07-24>
Shujin Wu, Cheng Qian, Xiusi Chen, Heng Ji. [Paper] - PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning <2026-07-23>
Yipeng Shi, Zhipeng Ma, Yue Wang, Qitai Tan, Yang Li, Peng Chen, Zhengzhou Zhu. [Paper] - How Many Bits Can an Adapter Write? Measuring the Capacity and Memorization of Parameter-Efficient Fine-Tuning <2026-07-23>
Kaizhen Tan, Heqing Du, Yang Feng. [Paper] - Multi-turn RL with Structural and Performance Aware Rewards for CUDA Kernel Generation <2026-07-23>
Quazi Ishtiaque Mahmud, Nesreen K. Ahmed, Ali Jannesari. [Paper] - Experience Augmented Policy Optimization for LLM Reasoning <2026-07-22>
Jinda Lu, Kexin Huang, Junkang Wu, Shuo Yang, Jinghan Li, Chiyu Ma, Shaohang Wei, Xiang Wang, Guoyin Wang, Jingren Zhou. [Paper] - Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning <2026-07-22>
Md Tanvirul Alam. [Paper] - SLPO: Scaling Latent Reasoning via a Surrogate Policy <2026-07-22>
Runyang You, Zhiyuan Liu, Yongqi Li, Wenjie Li. [Paper] - ISO: An RLVR-Native Optimization Stack <2026-07-21>
Hanqing Zhu, Wenyan Cong, Zhizhou Sha, Sagnik Mukherjee, Xinyuan Song, David González-Martínez, Xiaoxia Wu, Yuandong Tian, Shiwei Liu, David Z. Pan, Zhangyang "Atlas" Wang. [Paper] - Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information <2026-07-21>
Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi. [Paper] - The Price of Reasoning: Cost-Quality Tradeoffs in Reinforcement Learning for Neural Machine Translation <2026-07-21>
Michael Jungo, Aixiu An. [Paper] - Reasoning Before Translation: Enhancing Legal Machine Translation with Structured Reasoning <2026-07-21>
Aixiu An, Michael Jungo, Eloi Eynard, Mark Drenhaus, Andreas Fischer, Jean Hennebert, Sébastien Rumley. [Paper] - Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation <2026-07-21>
Mingxuan Ouyang, Hao Lan, Wanyu Lin. [Paper] - Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery <2026-07-21>
Syed Rifat Raiyan, Mohsinul Kabir, Hasan Mahmud, Md Kamrul Hasan, Sophia Ananiadou. [Paper] - LenGuard-GPC: Length Guarding with Guided-Prompt Consistency for Spatial Reasoning Reinforce Learning <2026-07-19>
Xingjian Tao, Yiwei Wang, Yujun Cai, Jing Tang. [Paper] - Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR <2026-07-18>
Jiaming Li, Longze Chen, Ze Gong, Yukun Chen, Lu Wang, Wanwei He, Run Luo, Min Yang. [Paper] - Understanding Reasoning from Pretraining to Post-Training <2026-07-17>
Jingyan Shen, Ang Li, Salman Rahman, Yifan Sun, Micah Goldblum, Matus Telgarsky, Pavel Izmailov. [Paper] - Atomic Design Transformer: Scaffold-Conditioned 3D Molecule Generation via xTB-Reward Reinforcement Learning <2026-07-17>
Takao Kotani. [Paper] - Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization <2026-07-16>
Weiwen Xu, Jia Liu, Hou Pong Chan, Long Li, Deng Cai, Min Chen, Hao Zhang. [Paper] - Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning <2026-07-16>
Xinyu Tang, Qianggang Cao, Yurou Liu, Yuliang Zhan, Xiaochong Lan, Yifan Li, Yuchen Yan, Han Peng, Zican Dong, Zhenduo Zhang, Tianshu Wang, Xinyu Kong, Zujie Wen, Wayne Xin Zhao, Zhiqiang Zhang, Jun Zhou. [Paper] - Non-vacuous Generalization Bounds for Reinforcement Learning with Verifiable Rewards <2026-07-16>
Yuxuan Zhu, Rohan Alur, Daniel Kang. [Paper] - SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning <2026-07-15>
Cheng Tang, Junzhi Ning, Min Cen, Wei Li, Xinyi Zeng, Pinxian Zeng, Rongbin Li, Qiming Zhu, Yuqiang Li, Junjun He, Yirong Chen, Ming Hu. [Paper] - Joint On-and-Off Policy Learning for Vision-and-Language Navigation <2026-07-15>
Qingrong He, Lin Zhao, Kevin Zheng, Liang Lin. [Paper] - SCOPE-RL: Optimizing Reasoning Paths Before and After Success <2026-07-15>
Xiaojian Liu, Han Xu, Jianqiang Xia, Zhixuan Li, Ke Xu, Yiwei Dai, Xinran Chen, Changwo Wu, Yuchen Li. [Paper] - Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations <2026-07-15>
Rui Wang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Wenhao Yu, Kam-Fai Wong. [Paper] - Verifier-Based Reinforcement Fine-Tuning of Reasoning Models for Thermal Energy Storage Control <2026-07-14>
Takumi Shioda, Kohei Terashima, Tatsuo Nagai. [Paper] - A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism <2026-07-14>
Chengguang Gan, Zhixi Cai, Yunhao Liang, Hanjun Wei, Shiwen Ni, Qinghao Zhang. [Paper] - Pigeonholing: how bad prompts hurt models, causing collapse and mistakes <2026-07-14>
Hyunji Nam, Keertana Chidambaram, Dorottya Demszky, Natasha Jaques. [Paper] - Keep Policy Gradient in Charge: Sibling-Guided Credit Distillation for Long-Horizon Tool-Use Agents <2026-07-13>
Tianyu Ding, Jianhong Xin, Juan Pablo De la Cruz Weinstein. [Paper] - SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL <2026-07-13>
Bowen Lv, Xiao Liu, Yanyu Ren, Hanyu Lai, Bohao Jing, Hanchen Zhang, Yanxiao Zhao, Shuntian Yao, Jie Tang, Yuxiao Dong. [Paper] - When the Reward Suite Is Leaky: A Preregistered Causal Contrast of Natural Verifier False Positives in RLVR <2026-07-13>
Chuyifei Zhang. [Paper] - When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion <2026-07-12>
Todd Zhou. [Paper] - Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards <2026-07-11>
Pengfei Cai, Utkarsh Utkarsh, Alan Edelman, Christopher Vincent Rackauckas, Rafael Gomez-Bombarelli. [Paper] - Large Behavior Model: A Promptable Digital Twin of the Retail Customer <2026-07-10>
Wachiravit Modecrua, Krittin Pachtrachai, Touchapon Kraisingkorn. [Paper] - Compete Then Collaborate: Frontier AI Teachers Build a Verifiable Curriculum to Improve a Coding Student Beyond Imitation <2026-07-09>
Miseong Shawn Kim. [Paper] - HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning <2026-07-09>
Weiqi Wang, Xin Liu, Binxuan Huang, Hejie Cui, Rongzhi Zhang, Changlong Yu, Shuowei Jin, Jingfeng Yang, Qingyu Yin, Zhengyang Wang, Zheng Li, Yifan Gao, Priyanka Nigam, Bing Yin, Lihong Li, Yangqiu Song. [Paper] - Weak-to-Strong Generalization via Direct On-Policy Distillation <2026-07-08>
Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou. [Paper] - Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning <2026-07-08>
Vladislav Beliaev. [Paper] - RLVP: Penalize the Path, Reward the Outcome <2026-07-08>
Bojie Li, Noah Shi. [Paper] - Selective Left-Shift: Turning Test-Time Compute and Difficulty-based Curation into Training Data for Low-Resource Code Generation <2026-07-08>
Didula Samaraweera, Anjana Supun, Srinath Perera. [Paper] - Trading Human Curation for Synthetic Augmentation in RLVR <2026-07-07>
Akshansh, Leonardo Rosa Rodrigues, Michael Korostelev, Youssef Hassan, Mark E. Whiting. [Paper] - When Does In-Context Search Help? A Sampling-Complexity Theory of Reflection-Driven Reasoning <2026-07-07>
Yotam Wolf, Noam Wies, Amnon Shashua. [Paper] - Strategic Bargaining in Multi-Buyer Markets: Reinforcement Learning from Verifiable Rewards for LLM Negotiations <2026-07-07>
Shuze Daniel Liu, Claire Chen, Jiabao Sean Xiao, Xin Chen, David Simchi-Levi. [Paper] - Self-Review Reinforcement Learning (SRRL) with Cross-Episode Memory and Policy Distillation <2026-07-06>
Muhammad Zain Amin, Kibele Sebnem Yildirim. [Paper] - KAT-Coder-V2.5 Technical Report <2026-07-06>
Bo Huang, Fengxiang Li, Hao Xu, Haoyang Huang, Hongyi Fu, Jinhua Hao, Kun Yuan, Minglei Zhang, Pengcheng Xu, Shiyang Liu, Wenhao Zhuang, Yuze Shi, Zongxian Feng, Chao Wang, Cheng He, Chongling Rao, Deyu Cao, Fan Yang, Gang Xiong, Haochen Liu, Jiabao Li, Jian Liang, Jinghui Jia, Jingwen Chang, Jun Du, Junyu Shi, Min Li, Mingqi Wu, Qiang Gao, Shangpeng Yan, Shaotong Qi, Shu Xu, Shuo Zhou, Tiankuo Xu, Tong Zheng, Weilun Zhao, Xiancheng Meng, Xianda Sun, Xiaoyu Jiang, Xunhao Jia, Yao Xia, Yimeng Xu, Yinghan Cui, Yingpeng Chen, Yiwen Ning, Yong Wang, Yuxuan Sun, Zhongsheng Liu, Ming Sun, Cheng Luo, Chen Yang, Han Li, Kun Gai. [Paper] - When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virtual Try-On <2026-07-06>
Wisdom Ikezogwo, Mehmet Saygin Seyfioglu, Ranjay Krishna, Karim Bouyarmane. [Paper] - RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning <2026-07-05>
Rongjian Chen, Jianmin Hu, Kejiang Ye, Minxian Xu. [Paper] - A Technical Survey of Reinforcement Learning Techniques for Large Language Models <2026-07-04>
Saksham Sahai Srivastava, Vaneet Aggarwal. [Paper] - Understanding Reasoning from Pretraining to Post-Training <2026-07-17>
Jingyan Shen, Ang Li, Salman Rahman, Yifan Sun, Micah Goldblum, Matus Telgarsky, Pavel Izmailov. [Paper] - Atomic Design Transformer: Scaffold-Conditioned 3D Molecule Generation via xTB-Reward Reinforcement Learning <2026-07-17>
Takao Kotani. [Paper] - Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization <2026-07-16>
Weiwen Xu, Jia Liu, Hou Pong Chan, Long Li, Deng Cai, Min Chen, Hao Zhang. [Paper] - Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning <2026-07-16>
Xinyu Tang, Qianggang Cao, Yurou Liu, Yuliang Zhan, Xiaochong Lan, Yifan Li, Yuchen Yan, Han Peng, Zican Dong, Zhenduo Zhang, Tianshu Wang, Xinyu Kong, Zujie Wen, Wayne Xin Zhao, Zhiqiang Zhang, Jun Zhou. [Paper] - Non-vacuous Generalization Bounds for Reinforcement Learning with Verifiable Rewards <2026-07-16>
Yuxuan Zhu, Rohan Alur, Daniel Kang. [Paper] - SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning <2026-07-15>
Cheng Tang, Junzhi Ning, Min Cen, Wei Li, Xinyi Zeng, Pinxian Zeng, Rongbin Li, Qiming Zhu, Yuqiang Li, Junjun He, Yirong Chen, Ming Hu. [Paper] - Joint On-and-Off Policy Learning for Vision-and-Language Navigation <2026-07-15>
Qingrong He, Lin Zhao, Kevin Zheng, Liang Lin. [Paper] - SCOPE-RL: Optimizing Reasoning Paths Before and After Success <2026-07-15>
Xiaojian Liu, Han Xu, Jianqiang Xia, Zhixuan Li, Ke Xu, Yiwei Dai, Xinran Chen, Changwo Wu, Yuchen Li. [Paper] - Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations <2026-07-15>
Rui Wang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Wenhao Yu, Kam-Fai Wong. [Paper] - Verifier-Based Reinforcement Fine-Tuning of Reasoning Models for Thermal Energy Storage Control <2026-07-14>
Takumi Shioda, Kohei Terashima, Tatsuo Nagai. [Paper] - A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism <2026-07-14>
Chengguang Gan, Zhixi Cai, Yunhao Liang, Hanjun Wei, Shiwen Ni, Qinghao Zhang. [Paper] - Pigeonholing: how bad prompts hurt models, causing collapse and mistakes <2026-07-14>
Hyunji Nam, Keertana Chidambaram, Dorottya Demszky, Natasha Jaques. [Paper] - Keep Policy Gradient in Charge: Sibling-Guided Credit Distillation for Long-Horizon Tool-Use Agents <2026-07-13>
Tianyu Ding, Jianhong Xin, Juan Pablo De la Cruz Weinstein. [Paper] - SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL <2026-07-13>
Bowen Lv, Xiao Liu, Yanyu Ren, Hanyu Lai, Bohao Jing, Hanchen Zhang, Yanxiao Zhao, Shuntian Yao, Jie Tang, Yuxiao Dong. [Paper] - When the Reward Suite Is Leaky: A Preregistered Causal Contrast of Natural Verifier False Positives in RLVR <2026-07-13>
Chuyifei Zhang. [Paper] - Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards <2026-07-11>
Pengfei Cai, Utkarsh Utkarsh, Alan Edelman, Christopher Vincent Rackauckas, Rafael Gomez-Bombarelli. [Paper] - Large Behavior Model: A Promptable Digital Twin of the Retail Customer <2026-07-10>
Wachiravit Modecrua, Krittin Pachtrachai, Touchapon Kraisingkorn. [Paper] - Compete Then Collaborate: Frontier AI Teachers Build a Verifiable Curriculum to Improve a Coding Student Beyond Imitation <2026-07-09>
Miseong Shawn Kim. [Paper] - HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning <2026-07-09>
Weiqi Wang, Xin Liu, Binxuan Huang, Hejie Cui, Rongzhi Zhang, Changlong Yu, Shuowei Jin, Jingfeng Yang, Qingyu Yin, Zhengyang Wang, Zheng Li, Yifan Gao, Priyanka Nigam, Bing Yin, Lihong Li, Yangqiu Song. [Paper] - Weak-to-Strong Generalization via Direct On-Policy Distillation <2026-07-08>
Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou. [Paper] - Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning <2026-07-08>
Vladislav Beliaev. [Paper] - RLVP: Penalize the Path, Reward the Outcome <2026-07-08>
Bojie Li, Noah Shi. [Paper] - Selective Left-Shift: Turning Test-Time Compute and Difficulty-based Curation into Training Data for Low-Resource Code Generation <2026-07-08>
Didula Samaraweera, Anjana Supun, Srinath Perera. [Paper] - Trading Human Curation for Synthetic Augmentation in RLVR <2026-07-07>
Akshansh, Leonardo Rosa Rodrigues, Michael Korostelev, Youssef Hassan, Mark E. Whiting. [Paper] - When Does In-Context Search Help? A Sampling-Complexity Theory of Reflection-Driven Reasoning <2026-07-07>
Yotam Wolf, Noam Wies, Amnon Shashua. [Paper] - Strategic Bargaining in Multi-Buyer Markets: Reinforcement Learning from Verifiable Rewards for LLM Negotiations <2026-07-07>
Shuze Daniel Liu, Claire Chen, Jiabao Sean Xiao, Xin Chen, David Simchi-Levi. [Paper] - Self-Review Reinforcement Learning (SRRL) with Cross-Episode Memory and Policy Distillation <2026-07-06>
Muhammad Zain Amin, Kibele Sebnem Yildirim. [Paper] - KAT-Coder-V2.5 Technical Report <2026-07-06>
Bo Huang, Fengxiang Li, Hao Xu, Haoyang Huang, Hongyi Fu, Jinhua Hao, Kun Yuan, Minglei Zhang, Pengcheng Xu, Shiyang Liu, Wenhao Zhuang, Yuze Shi, Zongxian Feng, Chao Wang, Cheng He, Chongling Rao, Deyu Cao, Fan Yang, Gang Xiong, Haochen Liu, Jiabao Li, Jian Liang, Jinghui Jia, Jingwen Chang, Jun Du, Junyu Shi, Min Li, Mingqi Wu, Qiang Gao, Shangpeng Yan, Shaotong Qi, Shu Xu, Shuo Zhou, Tiankuo Xu, Tong Zheng, Weilun Zhao, Xiancheng Meng, Xianda Sun, Xiaoyu Jiang, Xunhao Jia, Yao Xia, Yimeng Xu, Yinghan Cui, Yingpeng Chen, Yiwen Ning, Yong Wang, Yuxuan Sun, Zhongsheng Liu, Ming Sun, Cheng Luo, Chen Yang, Han Li, Kun Gai. [Paper] - When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virtual Try-On <2026-07-06>
Wisdom Ikezogwo, Mehmet Saygin Seyfioglu, Ranjay Krishna, Karim Bouyarmane. [Paper] - Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery <2026-07-06>
Syed Rifat Raiyan, Mohsinul Kabir, Hasan Mahmud, Md Kamrul Hasan, Sophia Ananiadou. [Paper] - RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning <2026-07-05>
Rongjian Chen, Jianmin Hu, Kejiang Ye, Minxian Xu. [Paper] - A Technical Survey of Reinforcement Learning Techniques for Large Language Models <2026-07-04>
Saksham Sahai Srivastava, Vaneet Aggarwal. [Paper] - ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval <2026-07-04>
Yuhan Liu, Pei Fu, Hang Li, Yukun Qi, Chao Jiang, Jingwen Fu, Zhen Liu, Bin Qin, Zhenbo Luo, Jian Luan, Jingmin Xin. [Paper] - ComplexConstraints and Beyond: Expert Rubrics for RLVR <2026-07-04>
Sushant Mehta, Liudas Panavas, Suhaas Garre, Edwin Chen. [Paper] - Towards Reliable Local Security Agents: Verifiable Post-Training for Linux Privilege Escalation <2026-07-03>
Philipp Normann, Andreas Happe, Jürgen Cito, Daniel Arp. [Paper] - OpenSIR: Open-Ended Self-Improving Reasoner <2026-07-03>
Wai-Chung Kwan, Joshua Ong Jun Leang, Pavlos Vougiouklis, Jeff Z. Pan, Marco Valentino, Pasquale Minervini. [Paper] - GR2 Technical Report <2026-07-03>
Yufei Li, Zaiwei Zhang, Mingfu Liang, Kavosh Asadi, Jay Xu, Jimmy Kim, Chongyang Bai, Jieyi Zhang, Hongye Xie, Prachi Agrawal, Dian Yu, Tianyi Chen, Jean-Pascal Billaud, Garret Buell, Yongkang Zhu, Sachin Patil, Brooke Bian, Zhou Fang, Kevin Huang, Shiva Sudanagunta, Yuzhen Huang, Emma Lu, Chris O'Brien, Yang Song, Lihong Li, Jacob Tao, Zhicheng Zhu, Chao Li, Gaoxiang Liu, Neil Wu, Zhongyin Hu, Li Han, Loki Chen, Ming Lei, Greg Rehm, Siyuan Song, Tianwei Zhang, Li Li, Ketan Singh, Yavuz Yetim, Ilyas Atishev, Satendra Gera, Ashkan Sadeghi, Rachel Yan, Nikko Mizutani, Shuaiwen Wang, Song Yang, Zhijing Li, Jiang Liu, Mengying Sun, Fei Tian, Xiaohan Wei, Chonglin Sun, Shuo Gu, Parish Aggarwal, Senthil Manickavelu, Kaushik Rangadurai, Zhi Hua, Frank Shyu, Ruchit Sharma, Liyuan Li, Shike Mei, Wenlin Chen, Santanu Kolay, Ben Schulte, Deepak Chandra, Yang Song, Sandeep Pandey, Xi Liu, Hamed Firooz, Luke Simon. [Paper] - Reinforcement Learning for Evidence-Seeking Diagnostic Reasoning with Large Language Models <2026-07-03>
Shengyi Hua, Kangzhe Hu, Conghui He, Xiaofan Zhang, Shaoting Zhang. [Paper] - Incentivizing Vision Language Models to Search for Long Video Question Answering <2026-07-03>
Harsh Goel, S P Sharan, Sahil Shah, Minkyu Choi, Joungbin An, Kristen Grauman, Sandeep P. Chinchali. [Paper] - Reward Granularity in RLVR: Comparing Process and Outcome Reward Structures for Mathematical Reasoning in Small Language Models <2026-07-03>
Anagha Radhakrishna Palandye, Rebecca Glick, Osheen Kaul. [Paper] - Gradient Regularization Mitigates Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards <2026-07-03>
Johannes Ackermann, Michael Noukhovitch, Takashi Ishida, Masashi Sugiyama. [Paper] - Reinforcement Learning for Data-Efficient Code-Switched ASR <2026-07-02>
Ziwei Ye, Peter Vickers. [Paper] - CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation <2026-07-02>
Letian Fu, Justin Yu, Karim El-Refai, Ethan Kou, Haoru Xue, Huang Huang, Wenli Xiao, Guanzhi Wang, Dantong Niu, Fei-Fei Li, Guanya Shi, Jiajun Wu, Shankar Sastry, Yuke Zhu, Ken Goldberg, Linxi "Jim" Fan. [Paper] - DecompRL: Solving Harder Problems by Learning Modular Code Generation <2026-07-02>
Juliette Decugis, Fabian Gloeckle, Francis Bach, Taco Cohen, Gabriel Synnaeve. [Paper] - Many Voices, One Reward: Multi-Role Rubric Generation for LLM Judging and Reward Modeling <2026-07-02>
Dazhi Fu, Jiuding Yang, Yiwen Guo, Jicong Fan. [Paper] - Procedural Memory Distillation: Online Reflection for Self-Improving Language Models <2026-07-01>
Ye Liu, Srijan Bansal, Bo Pang, Yang Li, Zeyu Leo Liu, Yifei Ming, Zixuan Ke, Shafiq Joty, Semih Yavuz. [Paper] - Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows <2026-07-01>
Karthikeya Aditya Vissa, Sankalp Mane, Ananya Mantravadi, Harshit Rajgarhia, Abhishek Mukherji. [Paper] - Right in the Right Way: LM Training with Verifiable Rewards and Human Demonstrations <2026-07-01>
Mehul Damani, Isha Puri, Idan Shenfeld, Jacob Andreas. [Paper] - A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges <2026-07-01>
Zheyuan He, Jiaxun Dong, Zihao Li, Ting Chen, Gelei Deng, Feng Luo, Jinkun Ji, Yuanlong Cao, Xiapu Luo. [Paper] - Active-GRPO: Adaptive Imitation and Self-Improving Reasoning for Molecular Optimization <2026-07-01>
Xuefeng Liu, Mingxuan Cao, Qinan Huang, Thomas Brettin, Rick Stevens, Le Cong. [Paper] - Large Behavior Model: A Promptable Digital Twin of the Retail Customer <2026-07-10>
Wachiravit Modecrua, Krittin Pachtrachai, Touchapon Kraisingkorn. [Paper] - Compete Then Collaborate: Frontier AI Teachers Build a Verifiable Curriculum to Improve a Coding Student Beyond Imitation <2026-07-09>
Miseong Shawn Kim. [Paper] - HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning <2026-07-09>
Weiqi Wang, Xin Liu, Binxuan Huang, Hejie Cui, Rongzhi Zhang, Changlong Yu, Shuowei Jin, Jingfeng Yang, Qingyu Yin, Zhengyang Wang, Zheng Li, Yifan Gao, Priyanka Nigam, Bing Yin, Lihong Li, Yangqiu Song. [Paper] - Weak-to-Strong Generalization via Direct On-Policy Distillation <2026-07-08>
Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou. [Paper] - Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning <2026-07-08>
Vladislav Beliaev. [Paper] - RLVP: Penalize the Path, Reward the Outcome <2026-07-08>
Bojie Li, Noah Shi. [Paper] - Selective Left-Shift: Turning Test-Time Compute and Difficulty-based Curation into Training Data for Low-Resource Code Generation <2026-07-08>
Didula Samaraweera, Anjana Supun, Srinath Perera. [Paper] - Trading Human Curation for Synthetic Augmentation in RLVR <2026-07-07>
Akshansh, Leonardo Rosa Rodrigues, Michael Korostelev, Youssef Hassan, Mark E. Whiting. [Paper] - When Does In-Context Search Help? A Sampling-Complexity Theory of Reflection-Driven Reasoning <2026-07-07>
Yotam Wolf, Noam Wies, Amnon Shashua. [Paper] - Strategic Bargaining in Multi-Buyer Markets: Reinforcement Learning from Verifiable Rewards for LLM Negotiations <2026-07-07>
Shuze Daniel Liu, Claire Chen, Jiabao Sean Xiao, Xin Chen, David Simchi-Levi. [Paper] - Self-Review Reinforcement Learning (SRRL) with Cross-Episode Memory and Policy Distillation <2026-07-06>
Muhammad Zain Amin, Kibele Sebnem Yildirim. [Paper] - KAT-Coder-V2.5 Technical Report <2026-07-06>
Bo Huang, Fengxiang Li, Hao Xu, Haoyang Huang, Hongyi Fu, Jinhua Hao, Kun Yuan, Minglei Zhang, Pengcheng Xu, Shiyang Liu, Wenhao Zhuang, Yuze Shi, Zongxian Feng, Chao Wang, Cheng He, Chongling Rao, Deyu Cao, Fan Yang, Gang Xiong, Haochen Liu, Jiabao Li, Jian Liang, Jinghui Jia, Jingwen Chang, Jun Du, Junyu Shi, Min Li, Mingqi Wu, Qiang Gao, Shangpeng Yan, Shaotong Qi, Shu Xu, Shuo Zhou, Tiankuo Xu, Tong Zheng, Weilun Zhao, Xiancheng Meng, Xianda Sun, Xiaoyu Jiang, Xunhao Jia, Yao Xia, Yimeng Xu, Yinghan Cui, Yingpeng Chen, Yiwen Ning, Yong Wang, Yuxuan Sun, Zhongsheng Liu, Ming Sun, Cheng Luo, Chen Yang, Han Li, Kun Gai. [Paper] - When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virtual Try-On <2026-07-06>
Wisdom Ikezogwo, Mehmet Saygin Seyfioglu, Ranjay Krishna, Karim Bouyarmane. [Paper] - Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery <2026-07-06>
Syed Rifat Raiyan, Mohsinul Kabir, Hasan Mahmud, Md Kamrul Hasan, Sophia Ananiadou. [Paper] - RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning <2026-07-05>
Rongjian Chen, Jianmin Hu, Kejiang Ye, Minxian Xu. [Paper] - A Technical Survey of Reinforcement Learning Techniques for Large Language Models <2026-07-04>
Saksham Sahai Srivastava, Vaneet Aggarwal. [Paper] - ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval <2026-07-04>
Yuhan Liu, Pei Fu, Hang Li, Yukun Qi, Chao Jiang, Jingwen Fu, Zhen Liu, Bin Qin, Zhenbo Luo, Jian Luan, Jingmin Xin. [Paper] - ComplexConstraints and Beyond: Expert Rubrics for RLVR <2026-07-04>
Sushant Mehta, Liudas Panavas, Suhaas Garre, Edwin Chen. [Paper] - Towards Reliable Local Security Agents: Verifiable Post-Training for Linux Privilege Escalation <2026-07-03>
Philipp Normann, Andreas Happe, Jürgen Cito, Daniel Arp. [Paper] - OpenSIR: Open-Ended Self-Improving Reasoner <2026-07-03>
Wai-Chung Kwan, Joshua Ong Jun Leang, Pavlos Vougiouklis, Jeff Z. Pan, Marco Valentino, Pasquale Minervini. [Paper] - GR2 Technical Report <2026-07-03>
Yufei Li, Zaiwei Zhang, Mingfu Liang, Kavosh Asadi, Jay Xu, Jimmy Kim, Chongyang Bai, Jieyi Zhang, Hongye Xie, Prachi Agrawal, Dian Yu, Tianyi Chen, Jean-Pascal Billaud, Garret Buell, Yongkang Zhu, Sachin Patil, Brooke Bian, Zhou Fang, Kevin Huang, Shiva Sudanagunta, Yuzhen Huang, Emma Lu, Chris O'Brien, Yang Song, Lihong Li, Jacob Tao, Zhicheng Zhu, Chao Li, Gaoxiang Liu, Neil Wu, Zhongyin Hu, Li Han, Loki Chen, Ming Lei, Greg Rehm, Siyuan Song, Tianwei Zhang, Li Li, Ketan Singh, Yavuz Yetim, Ilyas Atishev, Satendra Gera, Ashkan Sadeghi, Rachel Yan, Nikko Mizutani, Shuaiwen Wang, Song Yang, Zhijing Li, Jiang Liu, Mengying Sun, Fei Tian, Xiaohan Wei, Chonglin Sun, Shuo Gu, Parish Aggarwal, Senthil Manickavelu, Kaushik Rangadurai, Zhi Hua, Frank Shyu, Ruchit Sharma, Liyuan Li, Shike Mei, Wenlin Chen, Santanu Kolay, Ben Schulte, Deepak Chandra, Yang Song, Sandeep Pandey, Xi Liu, Hamed Firooz, Luke Simon. [Paper] - Reinforcement Learning for Evidence-Seeking Diagnostic Reasoning with Large Language Models <2026-07-03>
Shengyi Hua, Kangzhe Hu, Conghui He, Xiaofan Zhang, Shaoting Zhang. [Paper] - Incentivizing Vision Language Models to Search for Long Video Question Answering <2026-07-03>
Harsh Goel, S P Sharan, Sahil Shah, Minkyu Choi, Joungbin An, Kristen Grauman, Sandeep P. Chinchali. [Paper] - Reward Granularity in RLVR: Comparing Process and Outcome Reward Structures for Mathematical Reasoning in Small Language Models <2026-07-03>
Anagha Radhakrishna Palandye, Rebecca Glick, Osheen Kaul. [Paper] - Gradient Regularization Mitigates Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards <2026-07-03>
Johannes Ackermann, Michael Noukhovitch, Takashi Ishida, Masashi Sugiyama. [Paper] - Reinforcement Learning for Data-Efficient Code-Switched ASR <2026-07-02>
Ziwei Ye, Peter Vickers. [Paper] - CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation <2026-07-02>
Letian Fu, Justin Yu, Karim El-Refai, Ethan Kou, Haoru Xue, Huang Huang, Wenli Xiao, Guanzhi Wang, Dantong Niu, Fei-Fei Li, Guanya Shi, Jiajun Wu, Shankar Sastry, Yuke Zhu, Ken Goldberg, Linxi "Jim" Fan. [Paper] - DecompRL: Solving Harder Problems by Learning Modular Code Generation <2026-07-02>
Juliette Decugis, Fabian Gloeckle, Francis Bach, Taco Cohen, Gabriel Synnaeve. [Paper] - Many Voices, One Reward: Multi-Role Rubric Generation for LLM Judging and Reward Modeling <2026-07-02>
Dazhi Fu, Jiuding Yang, Yiwen Guo, Jicong Fan. [Paper] - Procedural Memory Distillation: Online Reflection for Self-Improving Language Models <2026-07-01>
Ye Liu, Srijan Bansal, Bo Pang, Yang Li, Zeyu Leo Liu, Yifei Ming, Zixuan Ke, Shafiq Joty, Semih Yavuz. [Paper] - Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows <2026-07-01>
Karthikeya Aditya Vissa, Sankalp Mane, Ananya Mantravadi, Harshit Rajgarhia, Abhishek Mukherji. [Paper] - Right in the Right Way: LM Training with Verifiable Rewards and Human Demonstrations <2026-07-01>
Mehul Damani, Isha Puri, Idan Shenfeld, Jacob Andreas. [Paper] - A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges <2026-07-01>
Zheyuan He, Jiaxun Dong, Zihao Li, Ting Chen, Gelei Deng, Feng Luo, Jinkun Ji, Yuanlong Cao, Xiapu Luo. [Paper] - Active-GRPO: Adaptive Imitation and Self-Improving Reasoning for Molecular Optimization <2026-07-01>
Xuefeng Liu, Mingxuan Cao, Qinan Huang, Thomas Brettin, Rick Stevens, Le Cong. [Paper] - Selective Expert Guidance for Effective and Diverse Exploration in Reinforcement Learning of LLMs <2026-07-01>
Zishang Jiang, Jinyi Han, Tingyun Li, Xinyi Wang, Sihang Jiang, Jiaqing Liang, Zhaoqian Dai, Shuguang Ma, Fei Yu, Yanghua Xiao. [Paper] - Cornerstones or Stumbling Blocks? Deciphering the Rock Tokens in On-Policy Distillation <2026-07-01>
Yuxuan Jiang, Runchao Li, Shubhashis Roy Dipta, Dawei Li, Zhao Yang. [Paper] - Verifiable Rewards for Calibrated Probabilistic Forecasting <2026-06-30>
Sadanand Singh, Allam Reddy, Manan Chopra. [Paper] - Geometry-Preserving Orthonormal Initialization for Low-Rank Adaptation in RLVR <2026-06-30>
Ruijia Zhang, Jiacheng Zhu, Hanqing Zhu, Laixi Shi. [Paper] - Disentangling Reasoning Logic to Resolve Explicit Knowledge Conflicts <2026-06-30>
Xianda Zheng, Zijian Huang, Meng-Fen Chiang, Jiamou Liu, Yuan Fang, Michael Witbrock, Kaiqi Zhao. [Paper] - Think in English, Answer in Korean: Efficient Adaptation of Multilingual Tool-Using Agents <2026-06-30>
Utsav Garg, Sungjin Hong, Jason Jung, Justin Lee, Shaan Desai, Joon Hee Kim, Anirudh Shrinivason, Edmond Wen, Susie Park. [Paper] - Which Tokens Matter? Adaptive Token Selection for RLVR with the Relative Surprisal Index <2026-06-30>
Outongyi Lv, Yanzhao Zheng, Yuanwei Zhang, Zhenghao Huang, Xingjun Wang, Baohua Dong, Hangcheng Zhu, Yingda Chen. [Paper] - LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR <2026-06-30>
Said Taghadouini, Adrien Cavaillès, Baptiste Aubertin. [Paper] - INFUSER: Influence-Guided Self-Evolution Improves Reasoning <2026-06-30>
Siyu Chen, Miao Lu, Beining Wu, Heejune Sheen, Fengzhuo Zhang, Shuangning Li, Zhiyuan Li, Jose Blanchet, Tianhao Wang, Zhuoran Yang. [Paper] - Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing <2026-06-29>
Yutong Yin, Mingyu Jin, Jin Pan, Changyi Yang, Zijie Xia, Dhruv Pai, Shuming Hu, Zhen Zhang, Chenyang Zhao, Jinman Zhao, Wujiang Xu, Raymond Li, Xin Eric Wang, Julian McAuley, Zhaoran Wang. [Paper] - Keep Policy Gradient in Charge: Sibling-Guided Credit Distillation for Long-Horizon Tool-Use Agents <2026-06-29>
Tianyu Ding, Jianhong Xin, Juan Pablo De la Cruz Weinstein. [Paper] - Experience Augmented Policy Optimization for LLM Reasoning <2026-06-29>
Jinda Lu, Kexin Huang, Junkang Wu, Shuo Yang, Jinghan Li, Chiyu Ma, Shaohang Wei, Xiang Wang, Guoyin Wang, Jingren Zhou. [Paper] - From Search to Synthesis: Training LLMs as Zero-Shot Workflow Generators <2026-06-29>
Gan Luo, Zihan Qin, Bin Dong, Wotao Yin. [Paper] - Are We Measuring Strategy or Phrasing? The Gap Between Surface- and Approach-Level Diversity in LLM Math Reasoning <2026-06-29>
Sangmook Lee, Minbeom Kim, Jeonghye Kim, Dohyung Kim, Sojeong Rhee, Kyomin Jung. [Paper] - LatentRevise: Learning from Zero-Hit Reasoning <2026-06-29>
Yiqiu Guo, Xueting Han, Qi Jia, Guangtao Zhai, Jing Bai. [Paper] - Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL <2026-06-29>
Sudong Wang, Weiquan Huang, Xiaomin Yu, Zuhao Yang, Hehai Lin, Keming Wu, Chaojun Xiao, Chen Chen, Wenxuan Wang, Beier Zhu, Yunjian Zhang, Chengwei Qin. [Paper] - CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation <2026-07-02>
Letian Fu, Justin Yu, Karim El-Refai, Ethan Kou, Haoru Xue, Huang Huang, Wenli Xiao, Guanzhi Wang, Dantong Niu, Fei-Fei Li, Guanya Shi, Jiajun Wu, Shankar Sastry, Yuke Zhu, Ken Goldberg, Linxi "Jim" Fan. [Paper] - DecompRL: Solving Harder Problems by Learning Modular Code Generation <2026-07-02>
Juliette Decugis, Fabian Gloeckle, Francis Bach, Taco Cohen, Gabriel Synnaeve. [Paper] - Many Voices, One Reward: Multi-Role Rubric Generation for LLM Judging and Reward Modeling <2026-07-02>
Dazhi Fu, Jiuding Yang, Yiwen Guo, Jicong Fan. [Paper] - GR2 Technical Report <2026-07-01>
Yufei Li, Zaiwei Zhang, Mingfu Liang, Kavosh Asadi, Jay Xu, Jimmy Kim, Chongyang Bai, Jieyi Zhang, Hongye Xie, Prachi Agrawal, Dian Yu, Tianyi Chen, Jean-Pascal Billaud, Garret Buell, YK, Zhu, Sachin Patil, Brooke Bian, Zhou Fang, Kevin Huang, Shiva Sudanagunta, Yuzhen Huang, Emma Lu, Chris O'Brien, Yang Song, Lihong Li, Jacob Tao, Zhicheng Zhu, Chao Li, Gaoxiang Liu, Neil Wu, Li Han, Loki Chen, Ming Lei, Greg Rehm, Siyuan Song, Tianwei Zhang, Li Li, Ketan Singh, Yavuz Yetim, Ilyas Atishev, Satendra Gera, Ashkan Sadeghi, Rachel Yan, Nikko Mizutani, Shuaiwen Wang, Song Yang, Zhijing Li, Jiang Liu, Mengying Sun, Fei Tian, Xiaohan Wei, Chonglin Sun, Shuo Gu, Parish Aggarwal, Kaushik Rangadurai, Zhi Hua, Frank Shyu, Ruchit Sharma, Liyuan Li, Shike Mei, Wenlin Chen, Santanu Kolay, Ben Schulte, Deepak Chandra, Adam, Song, Sandeep Pandey, Xi Liu, Hamed Firooz, Luke Simon. [Paper] - Procedural Memory Distillation: Online Reflection for Self-Improving Language Models <2026-07-01>
Ye Liu, Srijan Bansal, Bo Pang, Yang Li, Zeyu Leo Liu, Yifei Ming, Zixuan Ke, Shafiq Joty, Semih Yavuz. [Paper] - Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows <2026-07-01>
Karthikeya Aditya Vissa, Sankalp Mane, Ananya Mantravadi, Harshit Rajgarhia, Abhishek Mukherji. [Paper] - Right in the Right Way: LM Training with Verifiable Rewards and Human Demonstrations <2026-07-01>
Mehul Damani, Isha Puri, Idan Shenfeld, Jacob Andreas. [Paper] - Active-GRPO: Adaptive Imitation and Self-Improving Reasoning for Molecular Optimization <2026-07-01>
Xuefeng Liu, Mingxuan Cao, Qinan Huang, Thomas Brettin, Rick Stevens, Le Cong. [Paper] - Selective Expert Guidance for Effective and Diverse Exploration in Reinforcement Learning of LLMs <2026-07-01>
Zishang Jiang, Jinyi Han, Tingyun Li, Xinyi Wang, Sihang Jiang, Jiaqing Liang, Zhaoqian Dai, Shuguang Ma, Fei Yu, Yanghua Xiao. [Paper] - Cornerstones or Stumbling Blocks? Deciphering the Rock Tokens in On-Policy Distillation <2026-07-01>
Yuxuan Jiang, Runchao Li, Shubhashis Roy Dipta, Dawei Li, Zhao Yang. [Paper] - Verifiable Rewards for Calibrated Probabilistic Forecasting <2026-06-30>
Sadanand Singh, Allam Reddy, Manan Chopra. [Paper] - Geometry-Preserving Orthonormal Initialization for Low-Rank Adaptation in RLVR <2026-06-30>
Ruijia Zhang, Jiacheng Zhu, Hanqing Zhu, Laixi Shi. [Paper] - Disentangling Reasoning Logic to Resolve Explicit Knowledge Conflicts <2026-06-30>
Xianda Zheng, Zijian Huang, Meng-Fen Chiang, Jiamou Liu, Yuan Fang, Michael Witbrock, Kaiqi Zhao. [Paper] - Think in English, Answer in Korean: Efficient Adaptation of Multilingual Tool-Using Agents <2026-06-30>
Utsav Garg, Sungjin Hong, Jason Jung, Justin Lee, Shaan Desai, Joon Hee Kim, Anirudh Shrinivason, Edmond Wen, Susie Park. [Paper] - Which Tokens Matter? Adaptive Token Selection for RLVR with the Relative Surprisal Index <2026-06-30>
Outongyi Lv, Yanzhao Zheng, Yuanwei Zhang, Zhenghao Huang, Xingjun Wang, Baohua Dong, Hangcheng Zhu, Yingda Chen. [Paper] - LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR <2026-06-30>
Said Taghadouini, Adrien Cavaillès, Baptiste Aubertin. [Paper] - INFUSER: Influence-Guided Self-Evolution Improves Reasoning <2026-06-30>
Siyu Chen, Miao Lu, Beining Wu, Heejune Sheen, Fengzhuo Zhang, Shuangning Li, Zhiyuan Li, Jose Blanchet, Tianhao Wang, Zhuoran Yang. [Paper] - Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing <2026-06-29>
Yutong Yin, Mingyu Jin, Jin Pan, Changyi Yang, Zijie Xia, Dhruv Pai, Shuming Hu, Zhen Zhang, Chenyang Zhao, Jinman Zhao, Wujiang Xu, Raymond Li, Xin Eric Wang, Julian McAuley, Zhaoran Wang. [Paper] - Keep Policy Gradient in Charge: Sibling-Guided Credit Distillation for Long-Horizon Tool-Use Agents <2026-06-29>
Tianyu Ding, Jianhong Xin, Juan Pablo De la Cruz Weinstein. [Paper] - Experience Augmented Policy Optimization for LLM Reasoning <2026-06-29>
Jinda Lu, Kexin Huang, Junkang Wu, Shuo Yang, Jinghan Li, Chiyu Ma, Shaohang Wei, Xiang Wang, Guoyin Wang, Jingren Zhou. [Paper] - From Search to Synthesis: Training LLMs as Zero-Shot Workflow Generators <2026-06-29>
Gan Luo, Zihan Qin, Bin Dong, Wotao Yin. [Paper] - Are We Measuring Strategy or Phrasing? The Gap Between Surface- and Approach-Level Diversity in LLM Math Reasoning <2026-06-29>
Sangmook Lee, Minbeom Kim, Jeonghye Kim, Dohyung Kim, Sojeong Rhee, Kyomin Jung. [Paper] - LatentRevise: Learning from Zero-Hit Reasoning <2026-06-29>
Yiqiu Guo, Xueting Han, Qi Jia, Guangtao Zhai, Jing Bai. [Paper] - Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL <2026-06-29>
Sudong Wang, Weiquan Huang, Xiaomin Yu, Zuhao Yang, Hehai Lin, Keming Wu, Chaojun Xiao, Chen Chen, Wenxuan Wang, Beier Zhu, Yunjian Zhang, Chengwei Qin. [Paper] - Consistency as Inductive Bias: Learning Cross-View Invariance for Robust Multimodal Reasoning <2026-06-29>
Xin Zou, Haolin Deng, Yibo Yan, Shuliang Liu, Kening Zheng, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu. [Paper] - On the Emergence of Implicit Curriculum in RLVR Learning Dynamics <2026-06-29>
Yu Huang, Zixin Wen, Yuejie Chi, Yuting Wei, Aarti Singh, Yingbin Liang, Yuxin Chen. [Paper] - CaveAgent: Transforming LLMs into Stateful Runtime Operators <2026-06-29>
Maohao Ran, Zhenglin Wan, Cooper Lin, Yanting Zhang, Hongyu Xin, Hongwei Fan, Yibo Xu, Beier Luo, Yaxin Zhou, Wangbo Zhao, Lijie Yang, Lang Feng, Fuchao Yang, Jingxuan Wu, Yiqiao Huang, Chendong Ma, Yusen Huang, Dailing Jiang, Jianbo Deng, Sirui Han, Yang You, Bo An, Yike Guo, Jun Song. [Paper] - ZeroCoder: Can LLMs Improve Code Generation Without Ground-Truth Supervision? <2026-06-28>
Lishui Fan, Mouxiang Chen, Tingwei Zhu, Kui Liu, Xin Xia, Shanping Li, Zhongxin Liu. [Paper] - BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards <2026-06-27>
Yupeng Chang, Yuan Wu, Yi Chang. [Paper] - Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR <2026-06-27>
Yongjin Yang, Jiarui Liu, Yinghui He, Lechen Zhang, Bernhard Schölkopf, Zhijing Jin. [Paper] - Tandem Reinforcement Learning with Verifiable Rewards <2026-06-26>
Difan Jiao, Raghav Singhal, Robert West, Ashton Anderson. [Paper] - LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation <2026-06-26>
Nicolas Baumann, Liam Boyle, Pu Deng, Edoardo Ghignone, Boyang Sun, Marc Pollefeys, Luca Benini, Michele Magno. [Paper] - PerturbCellRL: Verifier-Guided Reinforcement Learning for Single-Cell Perturbation Prediction <2026-06-26>
Dongxia Wu, Mingyu Li, Yuhui Zhang, Anurendra Kumar, Emma Lundberg, Serena Yeung-Levy, Emily B. Fox. [Paper] - Learning to Reason with Curriculum II: Compositional Generalization <2026-06-26>
Nived Rajaraman, Audrey Huang, Miroslav Dudik, Robert Schapire, Dylan Foster, Akshay Krishnamurthy. [Paper] - Reinforcement Learning without Ground-Truth Solutions can Improve LLMs <2026-06-25>
Yingyu Lin, Qiyue Gao, Nikki Lijing Kuang, Xunpeng Huang, Kun Zhou, Tongtong Liang, Zhewei Yao, Yi-An Ma, Yuxiong He. [Paper] - Learning from the Self-future: On-policy Self-distillation for dLLMs <2026-06-25>
Yifu Luo, Zeyu Chen, Haoyu Wang, Xinhao Hu, Yuxuan Zhang, Zhizhou Sha, Shiwei Liu. [Paper] - RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning <2026-06-25>
Rongjian Chen, Jianmin Hu, Kejiang Ye, Minxian Xu. [Paper] - GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning <2026-06-25>
Ting Zhou, Zhenqing Ling, Yiyang Zhao, Ying Shen, Daoyuan Chen. [Paper] - EvoOptiGraph: Weakness-Driven Coevolution via Graph-Based Structural Generation for Optimization Modeling <2026-06-25>
Qingcan Kang, Mingyang Liu, Xiaojin Fu, Shixiong Kai, Tao Zhong, Mingxuan Yuan. [Paper] - Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs <2026-06-24>
Lecheng Yan, Ruizhe Li, Guanhua Chen, Qing Li, Jiahui Geng, Wenxi Li, Longyue Wang, Chenyang Lyu. [Paper] - V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning <2026-06-24>
Haoxiang Sun, Zhihang Yi, Langxuan Deng, Yuhao Zhou, Peiqi Jia, Jian Zhao, Li Yuan, Jiancheng Lv, Tao Wang. [Paper] - Geo-Strat-RL: Learning Geological Event Reasoning from Verifiable Tasks <2026-06-23>
Lukas Mosser. [Paper] - ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning <2026-06-23>
Wenyang Hu, Junxiang Jia, Zhen Shu, Daniel Dahlmeier, See-Kiong Ng, Bryan Kian Hsiang Low. [Paper] - Pigeonholing: Bad prompts hurt models to collapse and make mistakes <2026-06-23>
Hyunji Nam, Keertana Chidambaram, Dorottya Demszky, Natasha Jaques. [Paper] - Grounded Chess Reasoning in Language Models via Master Distillation <2026-06-23>
Zhenwei Tang, Qianfeng Wen, Seth Grief-Albert, Yahya Elgabra, Blair Yang, Honghua Dong, Ashton Anderson. [Paper] - GR2: Generative Reasoning Re-ranker <2026-06-23>
Mingfu Liang, Yufei Li, Jay Xu, Kavosh Asadi, Xi Liu, Shuo Gu, Kaushik Rangadurai, Frank Shyu, Shuaiwen Wang, Song Yang, Zhijing Li, Jiang Liu, Mengying Sun, Fei Tian, Xiaohan Wei, Chonglin Sun, Jacob Tao, Shike Mei, Wenlin Chen, Santanu Kolay, Sandeep Pandey, Hamed Firooz, Luke Simon. [Paper] - Closing the Loop: Formally Verified Law as a Reward Signal for Self-Improving Legal AI <2026-06-22>
Armin Heydari, Torben Leowald. [Paper] - SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR <2026-06-22>
Siddharth Aphale, Kelly Liu. [Paper] - Provable Benefits of RLVR over SFT for Reasoning Models: Learning to Backtrack Efficiently <2026-06-22>
Stanley Wei, Juno Kim. [Paper] - ComplexConstraints and Beyond: Expert Rubrics for RLVR <2026-06-22>
Sushant Mehta, Liudas Panavas, Suhaas Garre, Edwin Chen. [Paper] - Tandem Reinforcement Learning with Verifiable Rewards <2026-06-26>
Difan Jiao, Raghav Singhal, Robert West, Ashton Anderson. [Paper] - LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation <2026-06-26>
Nicolas Baumann, Liam Boyle, Pu Deng, Edoardo Ghignone, Boyang Sun, Marc Pollefeys, Luca Benini, Michele Magno. [Paper] - PerturbCellRL: Verifier-Guided Reinforcement Learning for Single-Cell Perturbation Prediction <2026-06-26>
Dongxia Wu, Mingyu Li, Yuhui Zhang, Anurendra Kumar, Emma Lundberg, Serena Yeung-Levy, Emily B. Fox. [Paper] - Learning to Reason with Curriculum II: Compositional Generalization <2026-06-26>
Nived Rajaraman, Audrey Huang, Miroslav Dudik, Robert Schapire, Dylan Foster, Akshay Krishnamurthy. [Paper] - Reinforcement Learning without Ground-Truth Solutions can Improve LLMs <2026-06-25>
Yingyu Lin, Qiyue Gao, Nikki Lijing Kuang, Xunpeng Huang, Kun Zhou, Tongtong Liang, Zhewei Yao, Yi-An Ma, Yuxiong He. [Paper] - Learning from the Self-future: On-policy Self-distillation for dLLMs <2026-06-25>
Yifu Luo, Zeyu Chen, Haoyu Wang, Xinhao Hu, Yuxuan Zhang, Zhizhou Sha, Shiwei Liu. [Paper] - RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning <2026-06-25>
Rongjian Chen, Jianmin Hu, Kejiang Ye, Minxian Xu. [Paper] - GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning <2026-06-25>
Ting Zhou, Zhenqing Ling, Yiyang Zhao, Ying Shen, Daoyuan Chen. [Paper] - EvoOptiGraph: Weakness-Driven Coevolution via Graph-Based Structural Generation for Optimization Modeling <2026-06-25>
Qingcan Kang, Mingyang Liu, Xiaojin Fu, Shixiong Kai, Tao Zhong, Mingxuan Yuan. [Paper] - Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs <2026-06-24>
Lecheng Yan, Ruizhe Li, Guanhua Chen, Qing Li, Jiahui Geng, Wenxi Li, Longyue Wang, Chenyang Lyu. [Paper] - Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing <2026-06-24>
Yutong Yin, Mingyu Jin, Jin Pan, Changyi Yang, Zijie Xia, Dhruv Pai, Shuming Hu, Zhen Zhang, Chenyang Zhao, Jinman Zhao, Wujiang Xu, Raymond Li, Xin Eric Wang, Julian McAuley, Zhaoran Wang. [Paper] - V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning <2026-06-24>
Haoxiang Sun, Zhihang Yi, Langxuan Deng, Yuhao Zhou, Peiqi Jia, Jian Zhao, Li Yuan, Jiancheng Lv, Tao Wang. [Paper] - Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR <2026-06-23>
Yongjin Yang, Jiarui Liu, Yinghui He, Lezhen Zhang, Bernhard Schölkopf, Zhijing Jin. [Paper] - Geo-Strat-RL: Learning Geological Event Reasoning from Verifiable Tasks <2026-06-23>
Lukas Mosser. [Paper] - ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning <2026-06-23>
Wenyang Hu, Junxiang Jia, Zhen Shu, Daniel Dahlmeier, See-Kiong Ng, Bryan Kian Hsiang Low. [Paper] - Pigeonholing: Bad prompts hurt models to collapse and make mistakes <2026-06-23>
Hyunji Nam, Keertana Chidambaram, Dorottya Demszky, Natasha Jaques. [Paper] - Grounded Chess Reasoning in Language Models via Master Distillation <2026-06-23>
Zhenwei Tang, Qianfeng Wen, Seth Grief-Albert, Yahya Elgabra, Blair Yang, Honghua Dong, Ashton Anderson. [Paper] - GR2: Generative Reasoning Re-ranker <2026-06-23>
Mingfu Liang, Yufei Li, Jay Xu, Kavosh Asadi, Xi Liu, Shuo Gu, Kaushik Rangadurai, Frank Shyu, Shuaiwen Wang, Song Yang, Zhijing Li, Jiang Liu, Mengying Sun, Fei Tian, Xiaohan Wei, Chonglin Sun, Jacob Tao, Shike Mei, Wenlin Chen, Santanu Kolay, Sandeep Pandey, Hamed Firooz, Luke Simon. [Paper] - Closing the Loop: Formally Verified Law as a Reward Signal for Self-Improving Legal AI <2026-06-22>
Armin Heydari, Torben Leowald. [Paper] - SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR <2026-06-22>
Siddharth Aphale, Kelly Liu. [Paper] - Provable Benefits of RLVR over SFT for Reasoning Models: Learning to Backtrack Efficiently <2026-06-22>
Stanley Wei, Juno Kim. [Paper] - ComplexConstraints and Beyond: Expert Rubrics for RLVR <2026-06-22>
Sushant Mehta, Liudas Panavas, Suhaas Garre, Edwin Chen. [Paper] - What are Key Factors for Updates in RL for LLM Reasoning? <2026-06-21>
Peidong Wang, Demi Wang, Xufang Luo, Jiahang Xu, Xiaocui Yang, Shi Feng, Yuqing Yang, Dongsheng Li. [Paper] - StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning <2026-06-21>
Daoyu Wang, Qingchuan Li, Mingyue Cheng, Jie Ouyang, Shuo Yu, Qi Liu, Enhong Chen. [Paper] - Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model <2026-06-21>
Pengxiang Cai, Tianchen Fang, Xiaohan Li, Qingyuan Zeng, Guocong Li, Jintai Chen. [Paper] - L20-Edu-135M: An Auditable Single-GPU Study of Data-Efficient Small Language Modeling <2026-06-20>
Yin Li. [Paper] - When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR <2026-06-20>
Zekun Xu. [Paper] - Mat-Pref: Verifiable-Reward Training Improves Compositional Reasoning in Inorganic Materials <2026-06-20>
Sarrah R. Mikhail Leung, Taehan Kim, Jeongbin Park. [Paper] - Discretizing Reward Models <2026-06-19>
Vijay Viswanathan, Shiqi Wang, Devamanyu Hazarika, Chirag Nagpal, Tongshuang Wu, Graham Neubig, Yuning Mao. [Paper] - OpenSIR: Open-Ended Self-Improving Reasoner <2026-06-19>
Wai-Chung Kwan, Aryo Pradipta Gema, Joshua Ong Jun Leang, Pasquale Minervini. [Paper] - INFUSER: Influence-Guided Self-Evolution Improves Reasoning <2026-06-19>
Siyu Chen, Miao Lu, Beining Wu, Heejune Sheen, Fengzhuo Zhang, Shuangning Li, Zhiyuan Li, Jose Blanchet, Tianhao Wang, Zhuoran Yang. [Paper] - When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study <2026-06-18>
Xiaolong Jin, Xuandong Zhao, Wenbo Guo, Xiangyu Zhang, Dawn Song. [Paper] - Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models <2026-06-18>
Hoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei. [Paper] - ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval <2026-06-18>
Yuhan Liu, Pei Fu, Hang Li, Yukun Qi, Chao Jiang, Jingwen Fu, Zhen Liu, Bin Qin, Zhenbo Luo, Jian Luan, Jingmin Xin. [Paper] - Process-Verified Reinforcement Learning for Theorem Proving via Lean <2026-06-18>
Minsu Kim, Se-Young Yun. [Paper] - VIMPO: Value-Implicit Policy Optimization for LLMs <2026-06-18>
Zhewei Kang, Aosong Feng, Sergey Levine, Dawn Song, Xuandong Zhao. [Paper] - Beyond Entropy: Learning from Token-Level Distributional Deviations for LLM Reasoning <2026-06-18>
Xuanzhi Feng, Zhengyang Li, Zeyu Liu, Haoxi Li, Yuming Jiang, Bing Guo, Jingcai Guo, Jie Zhang, Song Guo. [Paper] - Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation <2026-06-17>
Siyi Gu, Jialin Chen, Sophia Zhou, Arman Cohan, Rex Ying. [Paper] - STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability <2026-06-17>
Haipeng Luo, Qingfeng Sun, Songli Wu, Can Xu, Wenfeng Deng, Han Hu, Yansong Tang. [Paper] - Mechanism-Guided Selective Unlearning for RLVR-Induced Reasoning <2026-06-17>
Chenyu Zhou, Qiliang Jiang, Shuning Wu, Xu Zhou. [Paper] - GraphPO: Graph-based Policy Optimization for Reasoning Models <2026-06-17>
Yuliang Zhan, Xinyu Tang, Jian Li, Dandan Zheng, Weilong Chai, Jingdong Chen, Jun Zhou, Ge Wu, Wenyue Tang, Hao Sun. [Paper] - The Art of Interrogation: Consistency Amplifies Factuality in Spatial Reasoning <2026-06-17>
Theo Uscidda, Marta Tintore Gazulla, Maks Ovsjanikov, Federico Tombari, Leonidas Guibas. [Paper] - Learning from Own Solutions: Self-Conditioned Credit Assignment for Reinforcement Learning with Verifiable Rewards <2026-06-17>
Yingyu Shan, Yuhang Guo, Zihao Cheng, Zeming Liu, Xiangrong Zhu, Xinyi Wang, Jiashu Yao, Wei Lin, Hongru Wang, Heyan Huang. [Paper] - DeFAb: A Verifiable Benchmark for Defeasible Abduction in Foundation Models <2026-06-17>
Patrick Cooper, Alvaro Velasquez. [Paper] - Sparsity Curse: Understanding RLVR Model Parameter Space from Model Merging <2026-06-16>
Chenrui Wu, Zexi Li, Jiajun Bu, Jiangchuan Liu, Haishuai Wang. [Paper] - Beyond the Sampled Token: Preserving Candidate Support in RLVR <2026-06-16>
Ruotian Peng, Yi Ren, Zhouliang Yu, Weiyang Liu, Yandong Wen. [Paper] - Disentangling Perception and Reasoning in Multimodal LLMs via Reward Design <2026-06-15>
Omar Sharif, Eftekhar Hossain, Nikhil Singh, Patrick Ng. [Paper] - Rethinking Groups in Critic-Free RLVR <2026-06-15>
Yihong Wu, Liheng Ma, Lingfeng Xiao, Muzhi Li, Xinyu Wang, Yingxue Zhang, Jian-Yun Nie. [Paper] - RL-Index: Reinforcement Learning for Retrieval Index Reasoning <2026-06-15>
Yongjia Lei, Nedim Lipka, Zhisheng Qi, Utkarsh Sahu, Koustava Goswami, Franck Dernoncourt, Ryan A. Rossi, Yu Wang. [Paper] - A Gradient Perspective on RLVR Stability and Winner Advantage Policy Optimization <2026-06-15>
Prasanth YSS, Zhichen Ren, Rasa Hosseinzadeh, Ilan Gofman, Yuqi Chen, Zhaoyan Liu, Guangwei Yu, Jesse C. Cresswell, Satya Krishna Gorti. [Paper] - Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models <2026-06-18>
Hoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei. [Paper] - ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval <2026-06-18>
Yuhan Liu, Pei Fu, Hang Li, Yukun Qi, Chao Jiang, Jingwen Fu, Zhen Liu, Bin Qin, Zhenbo Luo, Jian Luan, Jingmin Xin. [Paper] - Process-Verified Reinforcement Learning for Theorem Proving via Lean <2026-06-18>
Minsu Kim, Se-Young Yun. [Paper] - VIMPO: Value-Implicit Policy Optimization for LLMs <2026-06-18>
Zhewei Kang, Aosong Feng, Sergey Levine, Dawn Song, Xuandong Zhao. [Paper] - Beyond Entropy: Learning from Token-Level Distributional Deviations for LLM Reasoning <2026-06-18>
Xuanzhi Feng, Zhengyang Li, Zeyu Liu, Haoxi Li, Yuming Jiang, Bing Guo, Jingcai Guo, Jie Zhang, Song Guo. [Paper] - Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation <2026-06-17>
Siyi Gu, Jialin Chen, Sophia Zhou, Arman Cohan, Rex Ying. [Paper] - STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability <2026-06-17>
Haipeng Luo, Qingfeng Sun, Songli Wu, Can Xu, Wenfeng Deng, Han Hu, Yansong Tang. [Paper] - Mechanism-Guided Selective Unlearning for RLVR-Induced Reasoning <2026-06-17>
Chenyu Zhou, Qiliang Jiang, Shuning Wu, Xu Zhou. [Paper] - GraphPO: Graph-based Policy Optimization for Reasoning Models <2026-06-17>
Yuliang Zhan, Xinyu Tang, Jian Li, Dandan Zheng, Weilong Chai, Jingdong Chen, Jun Zhou, Ge Wu, Wenyue Tang, Hao Sun. [Paper] - The Art of Interrogation: Consistency Amplifies Factuality in Spatial Reasoning <2026-06-17>
Theo Uscidda, Marta Tintore Gazulla, Maks Ovsjanikov, Federico Tombari, Leonidas Guibas. [Paper] - Learning from Own Solutions: Self-Conditioned Credit Assignment for Reinforcement Learning with Verifiable Rewards <2026-06-17>
Yingyu Shan, Yuhang Guo, Zihao Cheng, Zeming Liu, Xiangrong Zhu, Xinyi Wang, Jiashu Yao, Wei Lin, Hongru Wang, Heyan Huang. [Paper] - DeFAb: A Verifiable Benchmark for Defeasible Abduction in Foundation Models <2026-06-17>
Patrick Cooper, Alvaro Velasquez. [Paper] - Sparsity Curse: Understanding RLVR Model Parameter Space from Model Merging <2026-06-16>
Chenrui Wu, Zexi Li, Jiajun Bu, Jiangchuan Liu, Haishuai Wang. [Paper] - SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR <2026-06-16>
Siddharth Aphale, Kelly Liu. [Paper] - Learning from the Self-future: On-policy Self-distillation for dLLMs <2026-06-16>
Yifu Luo, Zeyu Chen, Haoyu Wang, Xinhao Hu, Yuxuan Zhang, Zhizhou Sha, Shiwei Liu. [Paper] - Beyond the Sampled Token: Preserving Candidate Support in RLVR <2026-06-16>
Ruotian Peng, Yi Ren, Zhouliang Yu, Weiyang Liu, Yandong Wen. [Paper] - Disentangling Perception and Reasoning in Multimodal LLMs via Reward Design <2026-06-15>
Omar Sharif, Eftekhar Hossain, Nikhil Singh, Patrick Ng. [Paper] - Rethinking Groups in Critic-Free RLVR <2026-06-15>
Yihong Wu, Liheng Ma, Lingfeng Xiao, Muzhi Li, Xinyu Wang, Yingxue Zhang, Jian-Yun Nie. [Paper] - RL-Index: Reinforcement Learning for Retrieval Index Reasoning <2026-06-15>
Yongjia Lei, Nedim Lipka, Zhisheng Qi, Utkarsh Sahu, Koustava Goswami, Franck Dernoncourt, Ryan A. Rossi, Yu Wang. [Paper] - A Gradient Perspective on RLVR Stability and Winner Advantage Policy Optimization <2026-06-15>
Prasanth YSS, Zhichen Ren, Rasa Hosseinzadeh, Ilan Gofman, Yuqi Chen, Zhaoyan Liu, Guangwei Yu, Jesse C. Cresswell, Satya Krishna Gorti. [Paper] - STRIDE: Strategic Trajectory Reasoning via Discriminative Estimation for Verifiable Reinforcement Learning <2026-06-14>
Qinjian Zhao, Zhihao Dou, Dinggen Zhang, Xiangyu Li, Chaoda Song, Zhongwei Wan, Xinpeng Li, Yanyan Zhang, Kaijie Chen, Qingtao Pan, Chengcheng Feng, Zhiqiang Gao, Xiaoyu Xia. [Paper] - HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM Alignment <2026-06-14>
Yuexiao Liu, Lijun Li, Xingjun Wang, Jing Shao. [Paper] - Localizing Credit at the Divergence: Path-Conditioned Self-Distillation for LLM Reasoning <2026-06-14>
Yu Li, Shu Hong, Tian Lan. [Paper] - On the Geometry of On-Policy Distillation <2026-06-14>
Zhennan Shen, Yanshu Li, Qingyu Yin, Chak Tou Leong, Zhilin Wang, Yanxu Chen, Rongduo Han, Sunbowen Lee, Yi R. Fung. [Paper] - Understanding Diversity Collapse in RLVR via the Lens of Overtraining <2026-06-13>
Suqin Yuan, Jinkun Chen, Jiyang Zheng, Muyang Li, Lei Feng, Dadong Wang, Tao Xiang, Tongliang Liu, Bo An. [Paper] - Nemotron 3 Ultra: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning <2026-06-12>
NVIDIA, :, Aaron Blakeman, Aaron Thomas, Aastha Jhunjhunwala, Abhibha Gupta, Abhinav Khattar, Adam Rajfer, Adi Renduchintala, Adil Asif, Aditya Vavre, Adriana Flores Miranda, Ahmad Bilal, Aileen Zaman, Ajay Hotchandani, Akanksha Shukla, Akhiad Bercovich, Aleksander Ficek, Alex Gronskiy, Alex Kondratenko, Alex Steiner, Alex Ye, Alexander Bukharin, Alexandre Milesi, Ali Taghibakhshi, Alice Gatti, Alisa Liu, Alok Kumar, Amar Phanishayee, Ameya Sunil Mahabaleshwarkar, Amir Klein, Amit Zuker, Amnon Geifman, Anahita Bhiwandiwalla, Ananth Subramaniam, Andrea Santilli, Andrew Fulks, Andrew McHarg, Andrew Tao, Andrii Skliar, Anjulie Agrusa, Ankur Srivastava, Ankur Verma, Anna Shors, Anna Warno, Antoni-Joan Solergibert I Llaquet, Arham Mehta, Arkadiusz Nowaczynski, Arti Jain, Ashwath Aithal, Ashwin Poojary, Asif Ahamed, Asit Mishra, Asma Kuriparambil Thekkumpate, Atefeh Sohrabizadeh, Avinash Kaur, Avinash Vem, Ayush Dattagupta, Barath Subramaniam Anandan, Bardiya Sadeghi, Ben Lanir, Benedikt Schifferer, Besmira Nushi, Bilal Kartal, Bill Thiede, Bita Darvish Rouhani, Bo Deng, Bob Schatz, Boris Ginsburg, Boxin Wang, Brad Nemire, Brandon Norick, Brian Dang, Brian Westphal, Brian Yu, Brucek Khailany, Bryan Catanzaro, Carlo del Mundo, Caryln Aarish, Chankyu Lee, Chantal Hwang, Charbel Sakr, Charles Wang, Charlie Truong, Chen Cui, Cheng Cheng, Cheng-Ping Hsieh, Chenghao Zhang, Chenhui Deng, Chintan Patel, Chris Alexiuk, Christian Cosgrove, Christian Munley, Christine Harvey, Christopher Parisien, Chunyang Shen, Coco Li, Collin Neale, Cynthia Gao, Cyril Meurillon, Dan Gil, Dan Su, Dan Zhao, Dane Corneil, Daniel Afrimi, Daniel Egert, Daniel Korzekwa, Daniel Lo, Daniel Machlab, Daniel Serebrenik, Daniil Sorokin, Daria Gitman, Daria Levy, Darko Stosic, David Mosallanezhad, David Yu, Davit Karamyan, Deena Donia, Deep Debroy, Deepak Narayanan, Devin O'Kelly, Dheeraj Peri, Dhruv Nathawani, Di, Wu, Dima Rekesh, Divyanshu Kakwani, Donald Plummer, Dong Anh, Dongfeng Yu, Dongfu Jiang, Donnie Kim, Dorrin Poorkay, Duncan Riach, Dusan Stosic, Dustin VanStee, Eavan Meng, Edgar Minasyan, Edward Lin, Eileen Margaret Peters Long, Elad Sarafin, Elad Segal, Elena Lantz, Ellie Evans, Elliott Ning, Eric Chung, Eric Harper, Eric Pham-Hung, Eric Tramel, Eric Yang, Erick Galinkin, Erik Pounds, Erika Goncalves Goncalves, Evan Briones, Evan Wu, Evelina Bakhturina, Evgeny Tsykunov, Ewa Dobrowolska, Faisal Ladhak, Farzan Memarian, Fay Wang, Fei Jia, Felipe Soares, Felipe Vieira Frujeri, Feng Chen, Fengguang Lin, Ferenc Galko, Frank Sun, Frankie Siino, Frida Hou, Gal Hubara Agam, Gal Kaplun, Gantavya Bhatt, Gargi Prasad, Garvit Kulshreshtha, George Armstrong, Gerald Shen, Giulio Borghesi, Gordana Neskovic, Gorkem Batmaz, Grace Lam, Greg Mason, Greg Pauloski, Grigor Nalbandyan, Grzegorz Chlebus, Grzegorz Karch, Guan-Ting Liu, Guoming Zhang, Guyue Huang, Haggai Maron, Haifeng Qian, Haim Elisha, Haoxing Ren, Haran Kumar Shiv Kumar, Haribhau Hud, Harris Nover, Harrison Saturley Hall, Hayate Iso, Helen Ngo, Herbert Hum, Herman Sahota, Hexin Wang, Himanshu Soni, Hovhannes Tamoyan, Hua Li, Huanhuan Chen, Hui Li, Hui Wang, Huy Nguyen, Ian Chiles, Ido Galil, Ido Shahaf, Igor Gitman, Igor Shovkun, Ilya Loshchilov, Ingo Guehring, Itamar Schen, Itay Levy, Itay Neeman, Ivan Moshkov, Izik Golan, Izzy Putterman, Jaemin Choi, Jakub Slowikowski, Jan Kautz, Jane Polak Scowcroft, Jared Casper, Jatin Mitra, Jeffrey Glick, Jenny Chen, Jesse Oliver, Jiacheng Xu, Jiafan Zhu, Jialin Song, Jian Zhang, Jiantao Jiao, Jiaqi Zeng, Jie Lou, Jim King, Jimmy Zhang, Jingquan Wang, Jinhang Choi, Jinju Chu, Joey Conway, Joey Guman, Johan Jatko, Johannes Rausch, John Kamalu, John Roberts, Johnny Greco, Johnny Mensel, Jonah Alben, Jonas Yang, Jonathan Cohen, Jonathan Raiman, Joseph Jennings, Joshua Mabry, Joshua Pierce, Joyjit Daw, Julien Veron Vialard, Junkeun Yi, Jupinder Parmar, Kajal Jain, Kan Zhu, Kari Briski, Katherine Cheung, Katherine Luna, Keith Willowhawk, Keith Wyss, Keshav Santhanam, Kevin Shih, Kezhi Kong, Khanh Nguyen, Khushi Bhardwaj, Kirthi Shankar Sivamani, Konstantinos Krommydas, Krishna C. Puvvada, Krzysztof Pawelec, Kumar Anik, Kyle Keprios, Kylie Day, Lawrence McAfee, Leo Du, Leon Derczynski, Li Ding, Linda Liu, Lingjie Wu, Lior Kadoch, Lizzie Wei, Luis Vega, Luke Robison, Lun Su, Maarten Van Segbroeck, Maciej Jakub Mikulski, Maer Rodrigues de Melo, Magda Sypula, Mahan Fathi, Makesh Narsimhan Sreedhar, Makesh Tarun Chandran, Manoj Kilaru, Maor Ashkenazi, Marc Cuevas, Marc Romeijn, Marcin Chochowski, Mark Cai, Mark Mozolewski, Markus Kliegl, Marta Stepniewska-Dziubinska, Martyna Patelka, Mattei Machczynski, Matvei Novikov, Mauricio Ferrato, Maximilian Golub, Mehrzad Samadi, Melissa Corpuz, Mengru Wang, Mengxi Wu, Meredith Price, Meriem Boubdir, Micah Schaffer, Michael Andersch, Michael Boone, Michael Gschwind, Michael Lightstone, Michael Loh, Michal Bien, Michal Zawalski, Michelle Gill, Miguel Martinez, Mikail Khona, Mike Chrzanowski, Mike Houston, Mingyuan Ma, Minseok Lee, Mohamed Fawzy, Mohammad Dabbah, Mohammad Shoeybi, Mostofa Patwary, Nabin Mulepati, Najeeb Nabwani, Namit Dhameja, Narimane Hennouni, Natalie Hereth, Nathaniel Pinckney, Nave Algarici, Nave Assaf, Netanel Haber, Nicholas Knight, Nick Reamaroon, Nickson Quak, Nidhi Bhatia, Nikhil Desai, Nikolai Ludwig, Nima Tajbakhsh, Ning Xu, Nir Ailon, Nirmal Juluru, Nitin Nitin, Ofri Masad, Oleg Rybakov, Oleksii Hrinchuk, Oleksii Kuchaiev, Olivia Viessmann, Olivier Delalleau, Oluwatobi Olabiyi, Omer Ullman Argov, Omri Puny, Oren Tropp, Pablo Ribalta, Pallab Bhattacharya, Panos Lampropoulos, Parth Mannan, Pasha Shamis, Patrick Legresley, Paul Gibbons, Pavlo Molchanov, Pawel Morkisz, Peter Dykas, Peter Jin, Pierre-Yves Aquilanti, Pinky Xu, Piotr Januszewski, Piotr Laskiewicz, Pooya Jannaty, Prakash Gurumurthy, Pranav Prashant Thombre, Prasoon Varshney, Pritam Gundecha, Przemek Tredak, Puhui Meng, Qiyu Wan, Rabeeh Karimi Mahabadi, Rachel Oberman, Rachit Garg, Radha Sri-Tharan, Rahul Kandu, Rakshit Sanadhya, Ran El-Yaniv, Ran Zilberstein, Rasoul Shafipour, Ray Macalisang, Rayen Tian, Reka Kovacs, Renjie Pi, Rick Izzo, Rima Shahbazyan, Rishabh Garg, Rishi Puri, Rita Fernandes Neves, Ritchie Zhao, Ritika Borkar, Ritu Gala, Riyad Islam, Robert Clark, Robert Hesse, Robert Kirby, Roger Waleffe, Rohit Watve, Roi Koren, Ron Banner, Ruoxi Zhang, Russell J. Hewett, Ryan Prenger, Ryan Stewart, Ryota Egashira, Sadegh Mahdavi, Saee Paliwal, Sagar Singh, Sahil Modi, Salika Dave, Samantha Shinagawa, Samuel Kriman, Sandip Bhaskar, Sangkug Lym, Sanjay Kariyappa, Sanjeev Satheesh, Saran Vikas Murari, Satish Pasumarthi, Saurabh Mishra, Saurav Muralidharan, Scott Hara, Sean Narentharen, Selvaraj Anandaraj, Seonjin Na, Seonmeyong Bak, Seonmyeong Bak, Sepehr Sameni, Seph Mard, Serge Panev, Seth Henneman, Seth Poulos, Shahar Mor, Shantanu Acharya, Shaona Ghosh, Sharath Turuvekere Sreenivas, Sharon Mendelson, Shaun Kotek, Shawn Wang, Shay Aharon, Shaya Gharghabi, Sheng-Chieh Lin, Shi Chen, Shiqing Fan, Shirish Baskaran, Shreya Gopa, Shrimai Prabhumoye, Shubham Pachori, Shubham Toshniwal, Shuoyang Ding, Shwetha Krishnamurthy, Siddharth Singh, Simeng Sun, Sirshak Das, Sivakumar Arayandi Thottakara, Smita Ithape, Somshubra Majumdar, Soumye Singhal, Sri Harsha Singudasu, Sridhar Bhuvanapalli, Srimukh Veccham, Stas Sergienko, Stefania Alborghetti, Stephen Ge, Su Rong, Sugam Dipak Devare, Sukrit Rao, Sumeet Kumar Barua, Sungsoo Ha, Sunny Gai, Suriya Gunasekar, Suseella Panguluri, Suyog Gupta, Sviataslau Hinzburh, Sweta Priyadarshi, Syeda Nahida Akter, Talor Abramovich, Tan Bui, Tanay Varshney, Tatevik Ter-Hovhannisyan, Teodor-Dumitru Ene, Terry Kong, Thanh Do, Tianhe Zhang, Tiffany Moore, Tijmen Blankevoort, Tim Moon, Tiyasa Mitra, Tom Balough, Tomasz Grzegorzek, Tomasz Hliwiak, Tomer Asida, Tomer Bar Natan, Tomer Keren, Tomer Ronen, Tony Salim, Tony Wang, Traian Rebedea, Tugrul Konuk, Twinkle Vashishth, Udi Karpas, Ushnish De, Vahid Noorozi, Venkat Srinivasan, Venmugil Elango, Vibhor Agrawal, Victor Cui, Vijay Korthikanti, Vikas Mehta, Vinay Rao, Virginia Wu, Vitaly Kurin, Vitaly Lavrukhin, Vladimir Anisimov, Vu Pham, Wanli Jiang, Wasi Uddin Ahmad, Wataru Ishihara, Wei Du, Wei Ping, Weiheng Chai, Wenliang Dai, Wesley Helmholz, Will Jennings, Will Zhu, Wojciech Prazuch, Xiaowei Ren, Xiwen Yu, Yan Breek, Yang Chen, Yang Yu, Yangyi Chen, Yaniv Galron, Yashaswi Karnati, Yejin Choi, Yev Meyer, Yi-Fu Wu, Yian Zhang, Ying Lin, Yonatan Geifman, Yonggan Fu, Youngeun Kwon, Yu Yao, Yugi Guvvla, Yuki Huang, Yunsheng Liu, Zach Moshe, Zachary Newell, Zhilin Wang, Zhiyu Li, Zhongbo Zhu, Zhuolin Yang, Zihan Liu, Zijie Yan, Zsolt-Alon Wertheimer. [Paper] - Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning <2026-06-12>
Rui Liu, Dian Yu, Tong Zheng, Runpeng Dai, Zongxia Li, Wenhao Yu, Zhenwen Liang, Linfeng Song, Haitao Mi, Pratap Tokekar, Dong Yu. [Paper] - CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment <2026-06-12>
Jiayue Cao, Zhicong Lu, Xuehan Sun, Wei Jia, Hongling Zheng, Changyuan Tian, Zichuan Lin, Wenqian Lv, Nayu Liu. [Paper] - Distributional Biases in Post-Training: A Markovian Analysis of Reasoning Trajectories <2026-06-12>
Dake Bu, Wei Huang, Andi Han, Atsushi Nitanda, Bo Xue, Qingfu Zhang, Hau-San Wong, Taiji Suzuki. [Paper] - Dense Supervision, Sparse Updates: On the Sparsity and Geometry of On-Policy Distillation <2026-06-12>
Guo Yu, Wenlin Liu, Yulan Hu, Hao-Xuan Ma, Jun-Peng Jiang, Han-Jia Ye. [Paper] - 3D-RFT: Reinforcement Fine-Tuning for Video-based 3D Scene Understanding <2026-06-12>
Xiongkun Linghu, Jiangyong Huang, Baoxiong Jia, Siyuan Huang. [Paper] - ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning <2026-06-11>
Xucong Wang, Ziyu Ma, Yong Wang, Shidong Yang, Hailang Huang, Renda Li, Pengkun Wang, Xiangxiang Chu. [Paper] - One Token to Fool LLM-as-a-Judge <2026-06-11>
Yulai Zhao, Haolin Liu, Dian Yu, Sunyuan Kung, Meijia Chen, Haitao Mi, Dong Yu. [Paper] - Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision <2026-06-11>
Yinghui He, Simran Kaur, Adithya Bhaskar, Yongjin Yang, Jiarui Liu, Narutatsu Ri, Liam Fowl, Abhishek Panigrahi, Danqi Chen, Sanjeev Arora. [Paper] - PLaID++: A Preference Aligned Language Model for Targeted Inorganic Materials Design <2026-06-11>
Andy Xu, Rohan Desai, Larry Wang, Ethan Ritz, Gabriel Hope. [Paper] - Keep Policy Gradient in Charge: Sibling-Guided Credit Distillation for Long-Horizon Tool-Use Agents <2026-06-10>
Tianyu Ding, Jianhong Xin, Juan Pablo De la Cruz Weinstein. [Paper] - Rubric-Guided Self-Distillation: Post-Training Without Rubric Verifiers <2026-06-10>
MohammadHossein Rezaei, Anas Mahmoud, Zihao Wang, Utkarsh Tyagi, Advait Gosai, Razvan-Gabriel Dumitru, Aakash Sabharwal, Bing Liu, Yunzhong He. [Paper] - Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning <2026-06-10>
Renjie Mao, Xiangxin Zhou, Lvfang Tao, Yixin Ding, Yu Shi, Yongguang Lin, Yuheng Wu, Honglin Zhu, Qian Qiu, Wenxi Zhu. [Paper] - PIGEON: VLM-Driven Object Navigation via Points of Interest Selection <2026-06-10>
Cheng Peng, Zhenzhe Zhang, Xiaobao Wei, Yanhao Zhang, Heng Wang, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Shanghang Zhang, Jing Liu. [Paper] - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning <2026-06-09>
Heming Zou, Qi Wang, Yun Qu, Yuhang Jiang, Lizhou Cai, Yixiu Mao, Ru Peng, Xin Xu, Weijie Liu, Kai Yang, Saiyong Yang, Xiangyang Ji. [Paper] - An Industrial-Scale Insurance LLM Achieving Verifiable Domain Mastery and Hallucination Control without Competence Trade-offs <2026-06-09>
Qian Zhu, Xinnan Guo, Jingjing Huo, Jun Li, Pan Liu, Wenyan Yang, Wanqing Xu, Xuan Lin. [Paper] - Bittensor Agent Arenas as a Trajectory Primitive: Distilling a Shopping Agent from ShoppingBench Subnet Traces <2026-06-08>
Shardul Bansal, Seth Schilbe, Jarrod Barnes. [Paper] - Emergence of Context Characteristics Sensitivity in Large Language Models <2026-06-08>
Nadya Yuki Wangsajaya, Haeun Yu, Isabelle Augenstein. [Paper] - CLPO: Curriculum Learning meets Policy Optimization for LLM Reasoning <2026-06-08>
Shijie Zhang, Zheng Xiao, Shiyu Liu, Guohao Sun, Kevin Zhang, Xiang Guo, Rujun Guo, Shaoyu Liu, Wangxiao Zhao, Guanjun Jiang. [Paper] - CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning <2026-06-08>
Penghui Yang, Long Xing, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Yibin Wang, Yujie Zhou, Jiazi Bu, Jianze Liang, Qidong Huang, Jiaqi Wang, Feng Wu, Dahua Lin. [Paper] - Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short <2026-06-08>
Han Zhou, Adam X. Yang, Laurence Aitchison, Anna Korhonen, Albert Q. Jiang. [Paper] - Capability-Aligned Hierarchical Learning for Tool-Augmented LLMs <2026-06-08>
Haotong Yang, Ting Long, Yi Chang. [Paper] - CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents <2026-06-08>
Bowen Wang, Dunjie Lu, Junli Wang, Tianyi Bai, Shixuan Liu, Zhipeng Zhang, Haiquan Wang, Hao Hu, Tianbao Xie, Shuai Bai, Dayiheng Liu, Que Shen, Junyang Lin, Tao Yu. [Paper] - A Regret Minimization Framework on Preference Learning in Large Language Models <2026-06-08>
Suhwan Kim, Taehyun Cho, Geon-Hyeong Kim, Yu Jin Kim, Youngsoo Jang, Moontae Lee, Jungwoo Lee. [Paper] - ComplexConstraints and Beyond: Expert Rubrics for RLVR <2026-06-08>
Sushant Mehta, Liudas Panavas, Edwin Chen. [Paper] - CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment <2026-06-12>
Jiayue Cao, Zhicong Lu, Xuehan Sun, Wei Jia, Hongling Zheng, Changyuan Tian, Zichuan Lin, Wenqian Lv, Nayu Liu. [Paper] - Distributional Biases in Post-Training: A Markovian Analysis of Reasoning Trajectories <2026-06-12>
Dake Bu, Wei Huang, Andi Han, Atsushi Nitanda, Bo Xue, Qingfu Zhang, Hau-San Wong, Taiji Suzuki. [Paper] - Dense Supervision, Sparse Updates: On the Sparsity and Geometry of On-Policy Distillation <2026-06-12>
Guo Yu, Wenlin Liu, Yulan Hu, Hao-Xuan Ma, Jun-Peng Jiang, Han-Jia Ye. [Paper] - 3D-RFT: Reinforcement Fine-Tuning for Video-based 3D Scene Understanding <2026-06-12>
Xiongkun Linghu, Jiangyong Huang, Baoxiong Jia, Siyuan Huang. [Paper] - ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning <2026-06-11>
Xucong Wang, Ziyu Ma, Yong Wang, Shidong Yang, Hailang Huang, Renda Li, Pengkun Wang, Xiangxiang Chu. [Paper] - One Token to Fool LLM-as-a-Judge <2026-06-11>
Yulai Zhao, Haolin Liu, Dian Yu, Sunyuan Kung, Meijia Chen, Haitao Mi, Dong Yu. [Paper] - Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision <2026-06-11>
Yinghui He, Simran Kaur, Adithya Bhaskar, Yongjin Yang, Jiarui Liu, Narutatsu Ri, Liam Fowl, Abhishek Panigrahi, Danqi Chen, Sanjeev Arora. [Paper] - PLaID++: A Preference Aligned Language Model for Targeted Inorganic Materials Design <2026-06-11>
Andy Xu, Rohan Desai, Larry Wang, Ethan Ritz, Gabriel Hope. [Paper] - Keep Policy Gradient in Charge: Sibling-Guided Credit Distillation for Long-Horizon Tool-Use Agents <2026-06-10>
Tianyu Ding, Jianhong Xin, Juan Pablo De la Cruz Weinstein. [Paper] - Rubric-Guided Self-Distillation: Post-Training Without Rubric Verifiers <2026-06-10>
MohammadHossein Rezaei, Anas Mahmoud, Zihao Wang, Utkarsh Tyagi, Advait Gosai, Razvan-Gabriel Dumitru, Aakash Sabharwal, Bing Liu, Yunzhong He. [Paper] - Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning <2026-06-10>
Renjie Mao, Xiangxin Zhou, Lvfang Tao, Yixin Ding, Yu Shi, Yongguang Lin, Yuheng Wu, Honglin Zhu, Qian Qiu, Wenxi Zhu. [Paper] - The Art of Interrogation: Consistency Amplifies Factuality in Spatial Reasoning <2026-06-10>
Theo Uscidda, Marta Tintore Gazulla, Maks Ovsjanikov, Federico Tombari, Leonidas Guibas. [Paper] - PIGEON: VLM-Driven Object Navigation via Points of Interest Selection <2026-06-10>
Cheng Peng, Zhenzhe Zhang, Xiaobao Wei, Yanhao Zhang, Heng Wang, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Shanghang Zhang, Jing Liu. [Paper] - On the Geometry of On-Policy Distillation <2026-06-10>
Zhennan Shen, Yanshu Li, Qingyu Yin, Chak Tou Leong, Zhilin Wang, Yanxu Chen, Rongduo Han, Sunbowen Lee, Yi R. Fung. [Paper] - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning <2026-06-09>
Heming Zou, Qi Wang, Yun Qu, Yuhang Jiang, Lizhou Cai, Yixiu Mao, Ru Peng, Xin Xu, Weijie Liu, Kai Yang, Saiyong Yang, Xiangyang Ji. [Paper] - An Industrial-Scale Insurance LLM Achieving Verifiable Domain Mastery and Hallucination Control without Competence Trade-offs <2026-06-09>
Qian Zhu, Xinnan Guo, Jingjing Huo, Jun Li, Pan Liu, Wenyan Yang, Wanqing Xu, Xuan Lin. [Paper] - Bittensor Agent Arenas as a Trajectory Primitive: Distilling a Shopping Agent from ShoppingBench Subnet Traces <2026-06-08>
Shardul Bansal, Seth Schilbe, Jarrod Barnes. [Paper] - Emergence of Context Characteristics Sensitivity in Large Language Models <2026-06-08>
Nadya Yuki Wangsajaya, Haeun Yu, Isabelle Augenstein. [Paper] - CLPO: Curriculum Learning meets Policy Optimization for LLM Reasoning <2026-06-08>
Shijie Zhang, Zheng Xiao, Shiyu Liu, Guohao Sun, Kevin Zhang, Xiang Guo, Rujun Guo, Shaoyu Liu, Wangxiao Zhao, Guanjun Jiang. [Paper] - CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning <2026-06-08>
Penghui Yang, Long Xing, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Yibin Wang, Yujie Zhou, Jiazi Bu, Jianze Liang, Qidong Huang, Jiaqi Wang, Feng Wu, Dahua Lin. [Paper] - Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short <2026-06-08>
Han Zhou, Adam X. Yang, Laurence Aitchison, Anna Korhonen, Albert Q. Jiang. [Paper] - Capability-Aligned Hierarchical Learning for Tool-Augmented LLMs <2026-06-08>
Haotong Yang, Ting Long, Yi Chang. [Paper] - CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents <2026-06-08>
Bowen Wang, Dunjie Lu, Junli Wang, Tianyi Bai, Shixuan Liu, Zhipeng Zhang, Haiquan Wang, Hao Hu, Tianbao Xie, Shuai Bai, Dayiheng Liu, Que Shen, Junyang Lin, Tao Yu. [Paper] - A Regret Minimization Framework on Preference Learning in Large Language Models <2026-06-08>
Suhwan Kim, Taehyun Cho, Geon-Hyeong Kim, Yu Jin Kim, Youngsoo Jang, Moontae Lee, Jungwoo Lee. [Paper] - ComplexConstraints and Beyond: Expert Rubrics for RLVR <2026-06-08>
Sushant Mehta, Liudas Panavas, Edwin Chen. [Paper] - Correct Is Not Enough: Training Reasoning Planners with Executor-Grounded Rewards <2026-06-08>
Tianyang Han, Hengyu Shi, Junjie Hu, Xu Yang, Zhiling Wang, Junhao Su. [Paper] - A Pre-Registered Causal Partition of Self-Consistency Elicitation and Reward Design in RLVR <2026-06-08>
Yuze Gao. [Paper] - Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization <2026-06-08>
Dongze Hao, Zhiwei Jin, Chen Chen, Haonan Lu. [Paper] - INFUSER: Influence-Guided Self-Evolution Improves Reasoning <2026-06-08>
Siyu Chen, Miao Lu, Beining Wu, Heejune Sheen, Fengzhuo Zhang, Shuangning Li, Zhiyuan Li, Jose Blanchet, Tianhao Wang, Zhuoran Yang. [Paper] - Graph-GRPO: Training Graph Flow Models with Reinforcement Learning <2026-06-08>
Baoheng Zhu, Deyu Bo, Delvin Ce Zhang, Xiao Wang. [Paper] - Generative Reasoning Re-ranker <2026-06-07>
Mingfu Liang, Yufei Li, Jay Xu, Kavosh Asadi, Xi Liu, Shuo Gu, Kaushik Rangadurai, Frank Shyu, Shuaiwen Wang, Song Yang, Zhijing Li, Jiang Liu, Mengying Sun, Fei Tian, Xiaohan Wei, Chonglin Sun, Jacob Tao, Shike Mei, Wenlin Chen, Santanu Kolay, Sandeep Pandey, Hamed Firooz, Luke Simon. [Paper] - sGPO: Trading Inference FLOPs for Training Efficiency in RLVR <2026-06-07>
Shivchander Sudalairaj, Kai Xu, Akash Srivastava, Giorgio Giannone. [Paper] - Momentum for Reasoning: Dense Intrinsic Signals in Policy Optimization <2026-06-07>
Hao Chen, Zhanming Shen, Liyao Li, Yanyu Chen, Xuhang Zhu, Xiaomeng Hu, Qi Zhang, Ru Peng, Xiaoyu Shen, Haobo Wang, Junbo Zhao. [Paper] - Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery <2026-06-07>
Syed Rifat Raiyan, Mohsinul Kabir, Hasan Mahmud, Md Kamrul Hasan. [Paper] - PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping <2026-06-07>
Qiming Li, Tianlun Li, Xiaolong Cheng, Hangyu Li, Ruiyan Gong, Kangning Niu, Kaitao Jiang, Mu Xu. [Paper] - Towards Long-Horizon Vessel Trajectory and Destination Forecasting with Reasoning Large Language Models <2026-06-07>
Hongwei Wang, Miao Zhou, Fengde Wang, Yuting Wang, Jiewen Yu, Jun-Yan He, Bohao Qu, Wanbing Zhang, Xiuju Fu, Qing Guo, Zipei Fan, Yingying Xing, Yi Yuan. [Paper] - Ishigaki-IDS: An Open-Weight Verifier-Aware Model for Information Delivery Specification Drafting in Building Information Modeling <2026-06-07>
Ryo Kanazawa, Koyo Hidaka, Teppei Miyamoto, Takayuki Kato, Tomoki Ando, Chenguang Wang, Dayuan Jiang, Naofumi Fujita, Shuhei Saitoh, Atomu Kondo, Koki Arakawa, Daiho Nishioka. [Paper] - PAEC: Position-Aware Entropy Calibration for LLM Reasoning in RLVR <2026-06-07>
Shumeng Yang, Yisu Liu, Jiayi Zheng, Zhaohui Yang, Linjing Li. [Paper] - Sparrow: Sparse Rollout for Stable and Efficient Long-context RL of Large Language Models <2026-06-07>
Yang Zhou, Ranajoy Sadhukhan, Zhaofeng Sun, Zhuoming Chen, Souvik Kundu, Saket Dingliwal, Sai Muralidhar Jayanthi, Aram Galstyan, Haizhong Zheng, Beidi Chen. [Paper] - CATPO: Critique-Augmented Tree Policy Optimization <2026-06-06>
Ayush Singh, Umang Goyal, Ankur Dahiya. [Paper] - RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments <2026-06-06>
Zhiyuan Zeng, Hamish Ivison, Yiping Wang, Lifan Yuan, Shuyue Stella Li, Zhuorui Ye, Siting Li, Jacqueline He, Runlong Zhou, Tong Chen, Chenyang Zhao, Yulia Tsvetkov, Simon Shaolei Du, Natasha Jaques, Hao Peng, Pang Wei Koh, Hannaneh Hajishirzi. [Paper] - ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning <2026-06-06>
Qing Miao, Yiming Zhao, Jing Yang, Chenxi Liu, Yuehai Chen, Yuewen Liu, Shaoyi Du, Badong Chen. [Paper] - DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning <2026-06-06>
Hangui Lin, Yan Shu, Zhengyang Liang, Chi Liu, Xiangrui Liu, Minghao Qin, Teng Long, Zheng Liu, Nicu Sebe. [Paper] - Customer-Agent: Overcoming Context Limitations in Ultra-Long Shopping Trajectories via Tool-Augmented Agents and RLVR <2026-06-06>
Hongye Liu, Rongmei Lin, Anurag Kashyap, Hejie Cui, Ricardo Henao, Besnik Fetahu, Bing Yin. [Paper] - Reinforcement Learning from Rich Feedback with Distributional DAgger <2026-06-05>
Rishabh Agrawal, Jacob Fein-Ashley, Paria Rashidinejad. [Paper] - CORE: Contrastive Reflection Enables Rapid Improvements in Reasoning <2026-06-05>
Linas Nasvytis, Simon Jerome Han, Ben Prystawski, Satchel Grant, Noah D. Goodman, Judith E. Fan. [Paper] - Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization <2026-06-05>
Shizhe Xiang, Ke An, Wenlong Yu, Yue Liu, Jian Luan, Pei Fu, Qilong Wang. [Paper] - Leveraging Error Diversity in Group Rollouts for Reinforcement Learning <2026-06-05>
Wenpu Liu, Yuqi Xu, Weichu Xie, Yongfu Zhu, Shuai Dong, Ziyue Wang, Wenqi Shao, Xiaoying Zhang, Tong Yang, Nan Duan, Jiaqi Wang. [Paper] - StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning <2026-06-05>
Daoyu Wang, Qingchuan Li, Mingyue Cheng, Jie Ouyang, Shuo Yu, Qi Liu, Enhong Chen. [Paper] - On Advantage Estimates for Max@K Policy Gradients <2026-06-04>
Shota Takashiro, Soichiro Nishimori, Paavo Parmas, Yongmin Kim, Kohsei Matsutani, Gouki Minegishi, Yusuke Iwasawa, Takeshi Kojima, Yutaka Matsuo. [Paper] - Reinforcement Learning from Rich Feedback with Distributional DAgger <2026-06-05>
Rishabh Agrawal, Jacob Fein-Ashley, Paria Rashidinejad. [Paper] - CORE: Contrastive Reflection Enables Rapid Improvements in Reasoning <2026-06-05>
Linas Nasvytis, Simon Jerome Han, Ben Prystawski, Satchel Grant, Noah D. Goodman, Judith E. Fan. [Paper] - On the Geometry of On-Policy Distillation <2026-06-05>
Zhennan Shen, Yanshu Li, Qingyu Yin, Chak Tou Leong, Zhilin Wang, Yanxu Chen, Rongduo Han, Sunbowen Lee, Yi R. Fung. [Paper] - Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization <2026-06-05>
Shizhe Xiang, Ke An, Wenlong Yu, Yue Liu, Jian Luan, Pei Fu, Qilong Wang. [Paper] - Leveraging Error Diversity in Group Rollouts for Reinforcement Learning <2026-06-05>
Wenpu Liu, Yuqi Xu, Weichu Xie, Yongfu Zhu, Shuai Dong, Ziyue Wang, Wenqi Shao, Xiaoying Zhang, Tong Yang, Nan Duan, Jiaqi Wang. [Paper] - StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning <2026-06-05>
Daoyu Wang, Qingchuan Li, Mingyue Cheng, Jie Ouyang, Shuo Yu, Qi Liu, Enhong Chen. [Paper] - On Advantage Estimates for Max@K Policy Gradients <2026-06-04>
Shota Takashiro, Soichiro Nishimori, Paavo Parmas, Yongmin Kim, Kohsei Matsutani, Gouki Minegishi, Yusuke Iwasawa, Takeshi Kojima, Yutaka Matsuo. [Paper] - MDP-GRPO: Stabilized Group Relative Policy Optimization for Multi-Constraint Instruction Following <2026-06-04>
Mohammad Mahdi Salmani-Zarchi, Zahra Rahimi, Heshaam Faili, Mohammad Javad Dousti. [Paper] - A Pre-Registered Causal Partition of Self-Consistency Elicitation and Reward Design in RLVR <2026-06-04>
Yuze Gao. [Paper] - SALT: When More Rollouts Don't Help in Group-Based Policy Optimization and How to Make Them Matter <2026-06-04>
Powei Chang, Jinpeng Zhang, Chaoqun Sun, MiniWell Tsao, Lianrui Li, Jianxiang Xiang, Chenyu Wang, Yukang Gao, Dongying Kong. [Paper] - SUPERNOVA: Eliciting General Reasoning in LLMs with Reinforcement Learning on Natural Instructions <2026-06-04>
Ashima Suvarna, Kendrick Phan, Mehrab Beikzadeh, Hritik Bansal, Saadia Gabriel. [Paper] - Learning Self-Correction in Vision-Language Models via Rollout Augmentation <2026-06-04>
Yi Ding, Ziliang Qiu, Bolian Li, Ruqi Zhang. [Paper] - Rollout-Level Advantage-Prioritized Experience Replay for GRPO <2026-06-04>
Gyeongtae Yoo, Sanghyeok Park, Soohyuk Jang, Ik-hwan Kim, Sungroh Yoon. [Paper] - Selective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for Efficient Reinforcement Learning of Language Models <2026-06-03>
Chirag Chawla, Rohan Charudatt Salvi, Madhav S. Baidya. [Paper] - Policy-Conditioned Counterfactual Credit for Verifiable Reinforcement Learning of Long-Horizon Language Agents <2026-06-03>
Renwei Meng. [Paper] - GRAIL: Gradient-Reweighted Advantages for Reinforcement Learning with Verifiable Rewards <2026-06-03>
Tej Deep Pala, Vernon Toh, Soujanya Poria. [Paper] - Entropy Is Not Enough: Unlocking Effective Reinforcement Learning for Visual Reasoning via Vision-Anchored Token Selection <2026-06-03>
Senjie Jin, Peixin Wang, Boyang Liu, Xiaoran Fan, Shuo Li, Zhiheng Xi, Jiazheng Zhang, Yuhao Zhou, Tao Gui, Qi Zhang, Xuanjing Huang. [Paper] - Aryabhata 2: Scaling Reinforcement Learning for Advanced STEM Reasoning <2026-06-03>
Ritvik Rastogi, Vishal Singh, Tejas Chaudhari, Sandeep Varma. [Paper] - GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling <2026-06-03>
Guangcheng Zhu, Shenzhi Yang, Haobo Wang, Xing Zheng, Yingfan MA, Xuening Feng, Zhongqi Chen, Kai Tang, Zhengqing Zang, Bowen Song, Weiqiang Wang, Gang Chen. [Paper] - Smart Picks in the Dark: Towards Efficient RLVR for Reasoning via Tracing Metacognitive Pivots <2026-06-03>
Guangcheng Zhu, Shenzhi Yang, Haobo Wang, Xing Zheng, Yingfan MA, Xuening Feng, Zhongqi Chen, Bowen Song, Weiqiang Wang, Gang Chen. [Paper] - Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation <2026-06-03>
Zhichao Xu, Zongyu Wu, Yun Zhou, Aosong Feng, Kang Zhou, Sangmin Woo, Kiran Ramnath, Yijun Tian, Xuan Qi, Weikang Qiu, Lin Lee Cheong, Haibo Ding. [Paper] - Policy Improvement Reinforcement Learning <2026-06-03>
Huaiyang Wang, Xiaojie Li, Deqing Wang, Haoyi Zhou, Zixuan Huang, Yaodong Yang, Jianxin Li, Yikun Ban. [Paper] - Good Reasoning Makes Good Demonstrations: Implicit Reasoning Quality Supervision via In-Context Reinforcement Learning <2026-06-03>
Tiehua Mei, Minxuan Lv, Leiyu Pan, Zhenpeng Su, Hongru Hou, Hengrui Chen, Ao Xu, Deqing Yang. [Paper] - Efficiently Aligning Language Models with Online Natural Language Feedback <2026-06-02>
Christine Ye, Joe Benton. [Paper] - QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards <2026-06-02>
Rongzhi Zhang, Rui Feng, Zhihan Zhang, Jingfeng Yang, Qingyu Yin, Xin Liu, Zixuan Zhang, Priyanka Nigam, Bing Yin, Tuo Zhao, Chao Zhang. [Paper] - Trading Human Curation for Synthetic Augmentation in RLVR <2026-06-02>
Akshansh, Leonardo Rosa Rodrigues, Michael Korostelev, Youssef Hassan, Mark E. Whiting. [Paper] - Exploiting Verification-Generation Gap: Test-Time Reinforcement Learning with Confidence-Conditioned Verification <2026-06-02>
Jiahui Li, Jianfeng Shan, Wenpei Chen, Shunyu Wu, Jian Lou, Wenjie Feng, Dan Li, See-Kiong Ng. [Paper] - Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching <2026-06-02>
Hao Zhong, Muzhi Zhu, Shenyan Zeng, Anzhou Li, Cong Chen, Hua Geng, Duochao Shi, Wentao Ye, Tao Lin, Hao Chen, Chunhua Shen. [Paper] - ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning <2026-06-02>
Ziyan Liu, Xueda Shen, Yuzhe Gu, Songyang Gao, Kuikun Liu, Guangran Cheng, Chengqi Lyu, Dahua Lin, Wenwei Zhang, Kai Chen. [Paper] - Breaking the Self-Confirming Loop: Diagnosing and Mitigating Systemic Reward Bias in Self-Rewarding RL <2026-06-02>
Chuyi Tan, Peiwen Yuan, Xinglin Wang, Yiwei Li, Shaoxiong Feng, Yueqi Zhang, Jiayi Shi, Ji Zhang, Boyuan Pan, Yao Hu, Kan Li. [Paper] - UR: Unify RAG and Reasoning through Reinforcement Learning <2026-06-02>
Weitao Li, Boran Xiang, Xiaolong Wang, Zhinan Gou, Weizhi Ma, Yang Liu. [Paper] - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning <2026-06-02>
Ziyue Wang, Aomufei Yuan, Yongfu Zhu, Shuai Dong, Wenpu Liu, Yiran Yao, Weichu Xie, Yuqi Xu, Caoyuan Ma, Wenqi Shao, Xiaoying Zhang, Nan Duan, Jiaqi Wang. [Paper] - Learning to Solve, Forgetting to Retain: Correct-Set Turnover in RLVR <2026-06-02>
Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Peng Fu, Zheng Lin. [Paper] - Self-Distilled Policy Gradient <2026-06-02>
Yifeng Liu, Shiyuan Zhang, Yifan Zhang, Quanquan Gu. [Paper] - Hint-Guided Diversified Policy Optimization for LLM Reasoning <2026-06-02>
Zhiyu Cao, Kaixin Wu, Mingjie Zhong, Peifeng Li, Xiaobo Li, Can Ye, Qiaoming Zhu. [Paper] - Aletheia: What Makes RLVR For Code Verifiers Tick? <2026-06-01>
Vatsal Venkatkrishna, Indraneil Paul, Iryna Gurevych. [Paper] - Are Full Rollouts Necessary for On-Policy Distillation? <2026-06-01>
Yaocheng Zhang, Jiajun Chai, Yuqian Fu, Songjun Tu, Xiaohan Wang, Wei Lin, Guojun Yin, Qichao Zhang, Yuanheng Zhu, Dongbin Zhao. [Paper] - SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning <2026-06-01>
Lichao Wang, Zhaoxing Ren, Tianzhuo Yang, Jiaming Ji, Chi Harold Liu, Yaodong Yang, Juntao Dai. [Paper] - Learning Query-Specific Rubrics from Human Preferences for DeepResearch Report Generation <2026-06-01>
Changze Lv, Jie Zhou, Wentao Zhao, Jingwen Xu, Shihan Dou, Zisu Huang, Muzhao Tian, Xiaohua Wang, Yang Liu, Pluto Zhou, Tao Gui, Le Tian, Xiao Zhou, Xiaoqing Zheng, Xuanjing Huang, Jie Zhou. [Paper] - CAPF: Guiding Search-Agent Rollouts with Credit-Attenuated Privileged Feedback <2026-06-01>
Bin Chen, Xinye Liao, Yiming Liu, Xin Liao, Chonghan Liu. [Paper] - "I've Seen How This Goes": Characterizing Diversity via Progressive Conditional Surprise <2026-06-01>
Matthew Khoriaty, David Williams-King, Shi Feng. [Paper] - Step-Audio-R1.5 Technical Report <2026-05-31>
Yuxin Zhang, Xiangyu Tony Zhang, Daijiao Liu, Fei Tian, Yayue Deng, Jun Chen, Qingjian Lin, Haoyang Zhang, Yuxin Li, Jinglan Gong, Yechang Huang, Liang Zhao, Chengyuan Yao, Hexin Liu, Eng Siong Chng, Xuerui Yang, Gang Yu, Xiangyu Zhang, Daxin Jiang. [Paper] - RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning <2026-05-31>
Yixiu Mao, Yun Qu, Qi Wang, Heming Zou, Xiangyang Ji. [Paper] - Before the Model Learns the Bug:Fuzzing RLVR Verifiers <2026-05-31>
Jaideep Ray. [Paper] - Enhancing LLM Metacognition via Cognitive Pairwise Training <2026-05-30>
Weitao Li, Hao Zhou, Xuanyu Lei, Fandong Meng, Yuanhang Liu, Jingyi Ren, Ante Wang, Xiaolong Wang, Yuanchi Zhang, Fuwen Luo, Guangwen Yang, Lin Gan, Weizhi Ma, Yang Liu. [Paper] - Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation <2026-05-30>
Xixiang He, Qiyao Sun, Ao Cheng, Xingming Li, Xuanyu Ji, Hailun Lu, Runke Huang, Qingyong Hu. [Paper] - Internalize the Temperature: On-Policy Self-Distillation as Policy Reheater for Reinforcement Learning <2026-05-30>
Xuewei Yang, Jiachen Yu, Jie Wu, Shaoning Sun, Junjie Wang, Yujiu Yang. [Paper] - MulFeRL: Enhancing Reinforcement Learning with Verbal Feedback in a Multi-turn Loop <2026-05-30>
Xuancheng Li, Haitao Li, Yujia Zhou, YiqunLiu, Qingyao Ai. [Paper] - Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective <2026-05-30>
Feng Zhang, Xinhong Ma, Ziqiang Dong, Xi Leng, Jianfei Zhao, Xin Sun, Yang Yang, Guanjun Jiang. [Paper] - Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning <2026-05-30>
Liang Chen, Xueting Han, Li Shen, Jing Bai, Kam-Fai Wong. [Paper] - LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards <2026-05-29>
Nianyi Lin, Jiajie Zhang, Lei Hou, Juanzi Li. [Paper] - Are Full Rollouts Necessary for On-Policy Distillation? <2026-05-29>
Yaocheng Zhang, Jiajun Chai, Songjun Tu, Yuqian Fu, Xiaohan Wang, Wei Lin, Guojun Yin, Qichao Zhang, Yuanheng Zhu, Dongbin Zhao. [Paper] - Unlocking Fine-Grained Translation Quality Estimation in LRMs through Synergistically Evolving Implicit and Explicit Reasoning <2026-05-29>
Renfei Dang, Xinye Wang, Zhejian Lai, Weilu Xu, Shimin Tao, Daimeng Wei, Min Zhang, Shujian Huang. [Paper] - Mellum2 Technical Report <2026-05-29>
Marko Kojic, Ivan Bondyrev, Aral de Moor, Joseph Shtok, Petr Borovlev, Kseniia Lysaniuk, Madeeswaran Kannan, Ivan Dolgov, Nikita Pavlichenko. [Paper] - EchoRL: Reinforcement Learning via Rollout Echoing <2026-05-29>
Jinhe Bi, Aniri, Minglai Yang, Xingcheng Zhou, Wenke Huang, Sikuan Yan, Yujun Wang, Zixuan Cao, Michael Färber, Xun Xiao, Volker Tresp, Yunpu Ma. [Paper] - Combinatorial Synthesis: Scaling Code RLVR via Atomic Decomposition and Recombination <2026-05-29>
Jiasheng Zheng, Boxi Cao, Boxi Yu, Yuzhong Zhang, Jialun Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun. [Paper] - Annealed Softmax Greedy in Many-Armed Bayesian Bandits <2026-05-29>
William Overman, Mohsen Bayati. [Paper] - Automating Formal Verification with Reinforcement Learning and Recursive Inference <2026-05-29>
Max Tan. [Paper] - Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR <2026-05-29>
Ruina Hu, Chen Wang, Lai Wei, Jionghao Bai, Bin Yu, Weiran Huang, Kai Wang, Yue Wang. [Paper] - Distilling LLM Feedback for Lean Theorem Proving <2026-05-29>
Gaetan Narozniak, Gérard Biau, Rémi Munos, Ahmad Rammal, Pierre Marion. [Paper] - Improving Small Language Models for Code Generation with Reinforcement Learning from Verification Feedback <2026-05-28>
Egor Skopin, Evgeny Kotelnikov. [Paper] - Reinforcement Learning with Robust Rubric Rewards <2026-05-28>
Ya-Qi Yu, Hao Wang, Fangyu Hong, Xiangyang Qu, Gaojie Wu, Qiaoyu Luo, Nuo Xu, Huixin Wang, Wuheng Xu, Yongxin Liao, Zihao Chen, Haonan Li, Ziming Li, Dezhi Peng, Minghui Liao, Jihao Wu, Haoyu Ren, Dandan Tu. [Paper] - HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime <2026-05-28>
Mohamed Sana, Nicola Piovesan, Antonio De Domenico, Fadhel Ayed, Haozhe Zhang. [Paper] - RL2ML: Finite-Rollout Surrogate Objectives from Reinforcement Learning to Maximum Likelihood <2026-05-28>
Yifu Zheng. [Paper] - EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance <2026-05-28>
Siyao Song, Cong Ma, Zhihao Cheng, Shiye Lei, Minghao Li, Ying Zeng, Huaixiao Tou, Kai Jia. [Paper] - Teacher-Guided Policy Optimization for On-Policy Reasoning Distillation under Large Policy Divergence <2026-05-28>
Xinyu Liu, Kechen Jiao, Chunyang Xiao, Runsong Zhao, Junhao Ruan, Bei Li, Jiahao Liu, Qifan Wang, Xin Chen, Jingang Wang, Chenglong Wang, Tong Xiao, JingBo Zhu. [Paper] - Beyond Normalization: Rethinking the Partition Function as a Difficulty Scheduler for RLVR <2026-05-28>
Dohyung Kim, Minbeom Kim, Jeonghye Kim, Sangmook Lee, Sojeong Rhee, Kyomin Jung. [Paper] - Rethinking Post-Training Recipes for Multimodal Time-Series Forecasting <2026-05-28>
Haoxin Liu, Yichen Zhou, Rajat Sen, B. Aditya Prakash, Abhimanyu Das. [Paper] - When RL Suppresses Its Own Vocabulary: Recovering Reasoning Diversity in Puzzle-to-Math Transfer <2026-05-28>
Mayug Maniparambil, Arjun Karuvally, Terrence Sejnowski, Fergal Reid. [Paper] - Label-Free Reinforcement Learning via Cross-Model Entropy <2026-05-27>
Matt Gorbett, Hossein Shirazi. [Paper] - CORE: Contrastive Reflection Enables Rapid Improvements in Reasoning <2026-05-27>
Linas Nasvytis, Simon Jerome Han, Ben Prystawski, Satchel Grant, Noah D. Goodman, Judith E. Fan. [Paper] - EAGer: Entropy-Aware GEneRation for Adaptive Inference-Time Scaling <2026-05-27>
Daniel Scalena, Leonidas Zotos, Elisabetta Fersini, Malvina Nissim, Ahmet Üstün. [Paper] - Single-Rollout Hidden-State Dynamics for Training-Free RLVR Data Selection <2026-05-27>
Jianghao Wu, Jianfei Cai, Weiqiang Wang, Jin Ye, Daniel F. Schmidt, Yasmeen George. [Paper] - Soft-SVeRL: Self-Verified Reinforcement Learning with Soft Rewards <2026-05-27>
Saurabh Dash, Pierre Clavier, John Dang, Matthias Galle, Marzieh Fadaee, Ahmet Üstün, Beyza Ermis. [Paper] - The Cases LJP Never Sees: Prosecution Decision Prediction for More Complete Criminal Liability Assessment <2026-05-27>
Junyu Lu, Qi Wei, Peishuo Zheng, Jie Zhang, Hui Huang, Qianru Wang, Chuan Xiao, Jianbin Qin, Shuyuan Zheng. [Paper] - Verifiable Process Rewards for Agentic Reasoning <2026-05-27>
Huining Yuan, Zelai Xu, Huaijie Wang, Xiangmin Yi, Jiaxuan Gao, Xiao-Ping Zhang, Yu Wang, Chao Yu, Yi Wu. [Paper] - Mechanistically Interpreting the Role of Sample Difficulty in RLVR for LLMs <2026-05-27>
Yue Cheng, Jiajun Zhang, Xiaohui Gao, Weiwei Xing, Zheng Wang, Zhanxing Zhu. [Paper] - Where Rollouts Begin: Low-Load, High-Leverage First-Token Diversification for RLVR <2026-05-27>
Soeun Kim, Albert No. [Paper] - IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage <2026-05-27>
Yuhan Li, Mingxu Zhang, Dazhong Shen, Ying Sun. [Paper] - Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration <2026-05-27>
Zili Wang, Jiajun Chai, Lin Chen, Xiaohan Wang, Shiming Xiang, Guojun Yin. [Paper] - ZipRL: Adaptive Multi-Turn Context Compression with Hindsight Response Replay <2026-05-27>
Zhexin Hu, Li Wang, Xiaohan Wang, Jiajun Chai, Xiaojun Guo, Wei Lin, Guojun Yin. [Paper] - RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs <2026-05-27>
Kohsei Matsutani, Shota Takashiro, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo. [Paper] - VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning <2026-05-27>
Xingyu Lu, Jinpeng Wang, Yi-Fan Zhang, Yankai Yang, Yancheng Long, Yiyang Fan, Xuanyu Zheng, Haonan Fan, Kaiyu Jiang, Tianke Zhang, Changyi Liu, Bin Wen, Fan Yang, Tingting Gao, Han Li, Chun Yuan. [Paper] - Beyond pass@k: Redundancy-Aware RLVR for Multi-Sample Code Generation <2026-05-27>
Le Bronnec Florian, Alexandre Verine, Rio Yokota, Benjamin Negrevergne. [Paper] - Zipping the Thought: When and How Compressed Reasoning Data Works in LLM Post-Training <2026-05-27>
Kohsei Matsutani, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo. [Paper] - OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning <2026-05-27>
Xinyu Ma, Mingzhou Xu, Xuebo Liu, Chang Jin, Qiang Wang, Derek F. Wong, Min Zhang. [Paper] - GeneralThinker: Domain-General Reasoning through Likelihood-Guided Answer-Conditioned Optimization <2026-05-27>
Shengmin Piao, Sanghyun Park. [Paper] - Narrative Flattening: How Post-Training Compresses Thematic, Affective, and Stylistic Variation in LLM Fiction <2026-05-27>
Zehan Li, Yutong Zhu, Siyang Wu, Honglin Bao, James A. Evans. [Paper] - Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards <2026-05-27>
Zhengzhao Ma, Xueru Wen, Boxi Cao, Yaojie Lu, Hongyu Lin, Jinglin Yang, Min He, Xianpei Han, Le Sun. [Paper] - Quantifying Empirical Compute-Supervision Tradeoffs in RLVR <2026-05-27>
Ryo Mitsuhashi, Patrick Chen, Isabelle Tseng, Jasin Cekinmez, Addison J. Wu. [Paper] - EAPO: Entropy-Driven Adaptive Positive-Negative Sample Weighting for Policy Optimization in Open-Ended QA <2026-05-27>
Yunsheng Zeng, Gen Li, Yuwei Miao, Xiandong Li, Yujin Wang, Siyu Chen, Luning Wang, Yunhao Qiao, Junfeng Wang, Jianwei Lv, Bo Yuan. [Paper] - Playing with Words, Improving with Rewards: Training Language Models for Creative Association <2026-05-27>
Vijeta Deshpande, Namrata Shivagunde, Sherin Muckatira, Hadrien Glaude, Mikhail Gronas, Claire Stevenson, Roger Beaty, Anna Rumshisky. [Paper] - AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens <2026-05-26>
Tung-Ling Li, Yuhao Wu, Hongliang Liu. [Paper] - The Obfuscation Atlas: Mapping Where Honesty Emerges in RLVR with Deception Probes <2026-05-26>
Mohammad Taufeeque, Stefan Heimersheim, Adam Gleave, Chris Cundy. [Paper] - SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning <2026-05-26>
Philip Schroeder, Thomas Weng, Karl Schmeckpeper, Eric Rosen, Stephen Hart, Ondrej Biza. [Paper] - Credit Assignment with Resets in Language Model Reasoning <2026-05-26>
Ankur Samanta, Akshayaa Magesh, Ayush Jain, Youliang Yu, Daniel Jiang, Kavosh Asadi, Kaveh Hassani, Paul Sajda, Jalaj Bhandari, Yonathan Efroni. [Paper] - BASIS: Batchwise Advantage Estimation from Single-Rollout Information Sharing for LLM Reasoning <2026-05-26>
Shijin Gong, Erhan Xu, Kai Ye, Francesco Quinzan, Giulia Livieri, Chengchun Shi. [Paper] - Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation <2026-05-26>
Longwen Wang, Yirui Liu, Xuan'er Wu, Xiaohui Hu, Yuankai Fan, Kaidong Yu, Qizhen Weng, Wei Xi, Xuelong Li. [Paper] - RLVR Datasets and Where to Find Them: Tracing Data Lineage for Better Training Data <2026-05-26>
Hsiu-Yuan Huang, Weijie Liu, Chenming Tang, Sanwoo Lee, Kai Yang, Yangkun Chen, Saiyong Yang, Yunfang Wu. [Paper] - Reasoning Depth and Environment Complexity: A Controlled Study of RLVR Data Allocation across Logical Reasoning Tasks <2026-05-26>
Yihua Zhu, Qianying Liu, Fei Cheng, Jiaxin Wang, Akiko Aizawa, Sadao Kurohashi, Hidetoshi Shimodaira. [Paper] - VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction <2026-05-22>
Xin-Qiang Cai, Masashi Sugiyama. [Paper] - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers <2026-05-22>
Xin-Qiang Cai, Wei Wang, Feng Liu, Tongliang Liu, Gang Niu, Masashi Sugiyama. [Paper] - CoSPlay: Cooperative Self-Play at Test-Time with Self-Generated Code and Unit Test <2026-05-22>
Zhangyi Hu, Chenhui Liu, Tian Huang, Jindong Li, Yang Yang, Jiemin Wu, Zining Zhong, Menglin Yang, Yutao Yue. [Paper] - Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals <2026-05-22>
Sirui Chen, Lei Xu, Yuying Zhao, Yutian Chen, Yu Wang, Beier Zhu, Hanwang Zhang, Shengjie Zhao, Chaochao Lu. [Paper] - Visually-Guided Policy Optimization for Multimodal Reasoning <2026-05-22>
Zengbin Wang, Feng Xiong, Liang Lin, Xuecai Hu, Yong Wang, Yanlin Wang, Man Zhang, Xiangxiang Chu. [Paper] - VISD: Enhancing Video Reasoning via Structured Self-Distillation <2026-05-22>
Hao Lin, Kunyang Lv, Xu Jiang, Jingqi Tian, Zhongjing Du, Jiayu Ding, Qiaoman Zhang, Hongbo Jin. [Paper] - OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning <2026-05-22>
Yu Li, Rui Miao, Tian Lan, Zhengling Qi. [Paper] - Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals <2026-05-21>
Shuo Yang, Jinda Lu, Chiyu Ma, Kexin Huang, Haoming Meng, Qihui Zhang, Yuyang Liu, Bolin Ding, Guoyin Wang, Li Yuan, Jingren Zhou. [Paper] - Two is better than one: A Collapse-free Multi-Reward RLIF Training Framework <2026-05-21>
Shourov Joarder, Diganta Sikdar, Ahsan Habib Akash, Binod Bhattarai, Prashnna Gyawali. [Paper] - Tailoring Teaching to Aptitude: Direction-Adaptive Self-Distillation for LLM Reasoning <2026-05-21>
Hongbin Zhang, Chaozheng Wang, Kehai Chen, Youcheng Pan, Yang Xiang, Jinpeng Wang, Min Zhang. [Paper] - Linear Dynamics in the RLVR Training of Large Language Models <2026-05-21>
Tianle Wang, Jiayu Liu, Zhongyuan Wu, Shenghao Jin, Wei Chen, Hao Xu, Ning Miao. [Paper] - One-Way Policy Optimization for Self-Evolving LLMs <2026-05-21>
Shuo Yang, Jinda Lu, Kexin Huang, Chiyu Ma, Shaohang Wei, Yuyang Liu, Guoyin Wang, Jingren Zhou, Li Yuan. [Paper] - From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning <2026-05-21>
Xitai Jiang, Zihan Tang, Wenze Lin, Yang Yue, Shenzhi Wang, Gao Huang. [Paper] - Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention <2026-05-21>
Changyuan Tian, Zhicong Lu, Huaxing Liu, Xiang Wang, Shuai Li, Yu Chen, Wenqian Lv, Zichuan Lin, Juncheng Diao, Deheng Ye. [Paper] - Heterogeneous Agent Collaborative Reinforcement Learning <2026-05-21>
Zhixia Zhang, Zixuan Huang, Gongxun Li, Huaiyang Wang, Chengyi Yuan, Xin Xia, Deqing Wang, Fuzhen Zhuang, Shuai Ma, Ning Ding, Yaodong Yang, Jianxin Li, Yikun Ban. [Paper] - General Preference Reinforcement Learning <2026-05-21>
Muhammad Umer, Muhammad Ahmed Mohsin, Ahsan Bilal, Arslan Chaudhry, Andreas Haupt, Sanmi Koyejo, Emily Fox, John M. Cioffi. [Paper] - Reinforced Preference Optimization for Reasoning-Augmented Recommendations <2026-05-21>
Jingtong Gao, Zeyu Song, Chi Lu, Xiaopeng Li, Derong Xu, Maolin Wang, Peng Jiang, Kun Gai, Qingpeng Cai, Xiangyu Zhao. [Paper] - Calibrating LLMs with Semantic-level Reward <2026-05-20>
Fengfei Yu, Ruijia Niu, Dongxia Wu, Yian Ma, Rose Yu. [Paper] - You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories <2026-05-20>
Zhepei Wei, Xinyu Zhu, Wei-Lin Chen, Chengsong Huang, Jiaxin Huang, Yu Meng. [Paper] - DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards <2026-05-20>
Kaiyi Zhang, Wei Wu, Yankai Lin. [Paper] - TimeSRL: Generalizable Time-Series Behavioral Modeling via Semantic RL-Tuned LLMs -- A Case Study in Mental Health <2026-05-20>
Yuang Fan, Lilin Xu, Millie Wu, Jingping Nie, Qingyu Chen, Yuzhe Yang, Zhuo Zhang, Xin Liu, Subigya Nepal, Xiaofan Jiang, Xuhai "Orson" Xu. [Paper] - How Much Online RL is Enough? Informative Rollouts for Offline Preference Optimization in RLVR <2026-05-20>
Richa Verma, Balaraman Ravindran. [Paper] - LamPO: A Lambda Style Policy Optimization for Reasoning Language Models <2026-05-20>
Zhe Yuan, Yipeng Zhou, Jinghan Li, Xinyuan Chen, Bowen Deng, Zhiqian Chen, Liang Zhao. [Paper] - Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation <2026-05-20>
Xixiang He, Qiyao Sun, Ao Cheng, Xingming Li, Xuanyu Ji, Hailun Lu, Runke Huang, Qingyong Hu. [Paper] - Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex <2026-05-20>
Yun Qu, Qi Wang, Yixiu Mao, Heming Zou, Yuhang Jiang, Yingyue Li, Wutong Xu, Lizhou Cai, Weijie Liu, Clive Bai, Kai Yang, Yangkun Chen, Saiyong Yang, Xiangyang Ji. [Paper] - Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards <2026-05-20>
Deokgyu Yoon, Hyungkyu Kang, Joongkyu Lee, Byeongchan Kim, Gyungin Shin, Sungrae Park, Min-hwan Oh. [Paper] - PlexRL: Cluster-Level Orchestration of Serviceized LLM Execution for RLVR <2026-05-20>
Yiqi Zhang, Fangzheng Jiao, Tian Tang, Boyu Tian, Hangyu Wang, Qiaoling Chen, Guoteng Wang, Zhen Jiang, Peng Sun, Ping Zhang, Xiaohe Hu, Ziming Liu, Menghao Zhang, Yanmin Jia, Yang You, Siyuan Feng. [Paper] - Bayesian Preference Learning for Test-Time Steerable Reward Models <2026-05-20>
Jiwoo Hong, Shao Tang, Zhipeng Wang. [Paper] - Complementing reinforcement learning with SFT through logit averaging in the post training of LLMs <2026-05-19>
Xingwei Gan, Ying Zhu. [Paper] - Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR <2026-05-19>
Utkarsh Tyagi, Xingang Guo, MohammadHossein Rezaei, Daniel George, Anas Mahmoud, Jackson Lee, Bing Liu, Yunzhong He. [Paper] - Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents <2026-05-19>
Wenjie Tang, Minne Li, Sijie Huang, Liquan Xiao, Yuan Zhou. [Paper] - GeoX: Mastering Geospatial Reasoning Through Self-Play and Verifiable Rewards <2026-05-19>
Kyeongjin Ahn, Seungeon Lee, Krishna P. Gummadi, Meeyoung Cha. [Paper] - Noise-corrected GRPO: From Noisy Rewards to Unbiased Gradients <2026-05-19>
Omar El Mansouri, Fathinah Asma Izzati, Mohamed El Amine Seddik, Salem Lahlou. [Paper] - GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment <2026-05-19>
Minxuan Lv, Tiehua Mei, Tanlong Du, Junmin Chen, Zhenpeng Su, Ziyang Chen, Ziqi Wang, Zhennan Wu, Ruotong Pan, jian Liang, Ruiming Tang, Han Li. [Paper] - Search Self-play: Pushing the Frontier of Agent Capability without Supervision <2026-05-19>
Hongliang Lu, Yuhang Wen, Pengyu Cheng, Ruijin Ding, Jiaqi Guo, Haotian Xu, Chutian Wang, Haonan Chen, Xiaoxi Jiang, Guanjun Jiang. [Paper] - CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization <2026-05-19>
Ahmed Heakl, Abdelrahman M. Shaker, Youssef Mohamed, Rania Elbadry, Omar Fetouh, Fahad Shahbaz Khan, Salman Khan. [Paper] - When to Stop Reusing: Dynamic Gradient Gating for Sample-Efficient RLVR <2026-05-19>
Yuchun Miao, Sen Zhang, Yuqi Zhang, Yaorui Shi, Qi Gu, Xunliang Cai, Lefei Zhang. [Paper] - Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR <2026-05-19>
Chongyu Fan, Gaowen Liu, Mingyi Hong, Ramana Rao Kompella, Sijia Liu. [Paper] - Transformation-Augmented GRPO for Enhancing Exploration in Reasoning of Large Language Models <2026-05-19>
Khiem Le, Phuc Nguyen, Youssef Mroueh, Chi-Heng Lin, Shangqian Gao, Ting Hua, Nitesh V. Chawla. [Paper] - Conformal Selective Acting: Anytime-Valid Risk Control for RLVR-Trained LLMs <2026-05-18>
Hamed Khosravi, Xiaoming Huo. [Paper] - WARC-Bench: Web Archive Based Benchmark for GUI Subtask Executions <2026-05-18>
Sanjari Srivastava, Gang Li, Cheng Chang, Rishu Garg, Manpreet Kaur, Charlene Y. Lee, Yuezhang Li, Yining Mao, Ignacio Cases, Yanan Xie, Peng Qi. [Paper] - Learning from Language Feedback via Variational Policy Distillation <2026-05-18>
Yang Li, Erik Nijkamp, Semih Yavuz, Shafiq Joty. [Paper] - AMR-SD: Asymmetric Meta-Reflective Self-Distillation for Token-Level Credit Assignment <2026-05-18>
Zhenlin Wei, Pu Jian, Yingzhuo Deng, Xiaohan Wang, Jiajun Chai, Zhexin Hu, Wei Lin, Shanbin Zhang, Guojun Yin. [Paper] - Knowledge-to-Verification: Exploring RLVR for LLMs in Knowledge-Intensive Domains <2026-05-18>
Zhonghang Yuan, Zhefan Wang, Fang Hu, Zihong Chen, Jinzhe Li, Gang Li, Jie Ying, Huanjun Kong, Songyang Zhang, Nanqing Dong. [Paper] - Pairwise Preference Reward and Group-Based Diversity Enhancement for Superior Open-Ended Generation <2026-05-18>
Guining Cao, Jiaxin Peng, Chu Zeng, Yu Zhao, Shuangyong Song, Yongxiang. [Paper] - Breaking : Cooperative Policy Optimization Improves Diverse LLM Reasoning <2026-05-18>
Haoxuan Chen, Tianming Liang, Wei-Shi Zheng, Jian-Fang Hu. [Paper] - Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective <2026-05-18>
Feng Zhang, Xinhong Ma, Ziqiang Dong, Xi Leng, Jianfei Zhao, Xin Sun, Yang Yang, Guanjun Jiang. [Paper] - HydroAgent: Closing the Gap Between Frontier LLMs and Human Experts in Hydrologic Model Calibration via Simulator-Grounded RL <2026-05-18>
Zhi Li, Songkun Yan, Jie Cao, Mofan Zhang, Anjiang Wei, Jinwoong Yoo, Yang Hong. [Paper] - Learning from Self-Debate: Preparing Reasoning Models for Multi-Agent Debate <2026-05-17>
Chenxi Liu, Yanshuo Chen, Ruibo Chen, Tianyi Xiong, Tong Zheng, Heng Huang. [Paper] - SAPO: Step-Aligned Policy Optimization for Reasoning-Based Generative Recommendation <2026-05-17>
Zaiyi Zheng, Guanghui Min, Yaochen Zhu, Liang Wu, Liangjie Hong, Chen Chen, Jundong Li. [Paper] - From Synthetic to Real: Toward Identity-Consistent Makeup Transfer with Synthetic and Real Data <2026-05-08>
Yue Yu, Jiayu Wang, Jiajia Shi, Jingjing Chen, Yu-Gang Jiang. [Paper] - Gradient Starvation in Binary-Reward GRPO: Why Group-Mean Centering Fails and Why the Simplest Fix Works <2026-05-08>
Wenhua Nie, Jianan Wu, Junlin Liu, Ziwei Li, Zheng Lin, Zhang Zijian, Yilong Fan, Haoran Zheng, Jyh-Shing Roger Jang. [Paper] - VISD: Enhancing Video Reasoning via Structured Self-Distillation <2026-05-08>
Hao Lin, Kunyang Lv, Xu Jiang, Jingqi Tian, Zhongjing Du, Jiayu Ding, Qiaoman Zhang, Hongbo Jin. [Paper] - ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning <2026-05-08>
Zihan Lin, Xiaohan Wang, Jie Cao, Jiajun Chai, Li Wang, Xiaodong Lu, Wei Lin, Ran He, Guojun Yin. [Paper] - Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States <2026-05-08>
Yunho Choi, Jongwon Lim, Woojin Ahn, Minjae Oh, Jeonghoon Shim, Yohan Jo. [Paper] - Multi-Modal Multi-Agent Reinforcement Learning for Radiology Report Generation <2026-05-08>
Kaito Baba, Risa Kishikawa, Satoshi Kodera. [Paper] - Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective <2026-05-08>
Kun Chen, Peng Shi, Fanfan Liu, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao. [Paper] - Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective <2026-05-08>
Yuheng Zhang, Chenlu Ye, Shuowei Jin, Changlong Yu, Wei Xiong, Saurabh Sahu, Nan Jiang. [Paper] - Implicit Compression Regularization: Concise Reasoning via Internal Shorter Distributions in RL Post-Training <2026-05-08>
Chen Wang, Hexuan Deng, Yining Zhang, Yuchen Zhang, Jionghao Bai, Zhaochun Li, Ge Lan, Yue Wang. [Paper] - Structured Role-Aware Policy Optimization for Multimodal Reasoning <2026-05-08>
Bingqing Jiang, Difan Zou. [Paper] - OASES: Outcome-Aligned Search-Evaluation Co-Training for Agentic Search <2026-05-08>
Erhan Zhang, Yiqun Chen, Zechun Niu, Wei Yang, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao. [Paper] - Adaptive Negative Reinforcement for LLM Reasoning:Dynamically Balancing Correction and Diversity in RLVR <2026-05-08>
Yash Ingle, Jaival Chauhan, Ankit Yadav, Sudhakar Mishra. [Paper] - Where to Spend Rollouts: Hit-Utility Optimal Rollout Allocation for Group-Based RLVR <2026-05-08>
Tao Wang, Shuo Li, Yan Sun, Dongsheng Ding, Edgar Dobriban. [Paper] - Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training <2026-05-08>
Pingbang Hu, Xueshen Liu, Z. Morley Mao, Jiaqi W. Ma. [Paper] - Minerva: Reinforcement Learning with Verifiable Rewards for Cyber Threat Intelligence LLMs <2026-05-07>
Md Tanvirul Alam, Aritran Piplai, Ionut Cardei, Nidhi Rastogi, Peter J Worth. [Paper] - Beyond Negative Rollouts: Positive-Only Policy Optimization with Implicit Negative Gradients <2026-05-07>
Mingwei Xu, Hao Fang. [Paper] - On the optimization dynamics of RLVR: Gradient gap and step size thresholds <2026-05-07>
Joe Suk, Yaqi Duan. [Paper] - How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum <2026-05-07>
Chu-Cheng Lin, Eugene Ie. [Paper] - On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR <2026-05-07>
Hao Ye, Jisheng Dang, Junfeng Fang, Bimei Wang, Yizhou Zhang, Ning Lv, Wencan Zhang, Hong Peng, Bin Hu, Tat-Seng Chua. [Paper] - P^2O: Joint Policy and Prompt Optimization <2026-05-07>
Xinyu Lu, Kaiqi Zhang, Jinglin Yang, Boxi Cao, Yaojie Lu, Hongyu Lin, Min He, Xianpei Han, Le Sun. [Paper] - Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning <2026-05-07>
Qianjia Cheng, Yuchen Zhang, Zhilin Wang, Yuxin Zuo, Shunkai Zhang, Yuchen Fan, Yu Qiao, Bowen Zhou, Ning Ding, Yu Cheng, Yun Luo, Ganqu Cui. [Paper] - OPSD Compresses What RLVR Teaches: A Post-RL Compaction Stage for Reasoning Models <2026-05-07>
Jaehoon Kim, Dongha Lee. [Paper] - Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex <2026-05-07>
Yun Qu, Qi Wang, Yixiu Mao, Heming Zou, Yuhang Jiang, Yingyue Li, Wutong Xu, Lizhou Cai, Weijie Liu, Clive Bai, Kai Yang, Yangkun Chen, Saiyong Yang, Xiangyang Ji. [Paper] - Schedule-and-Calibrate: Utility-Guided Multi-Task Reinforcement Learning for Code LLMs <2026-05-07>
Yujia Chen, Yang Ye, Xiao Chu, Yuchi Ma, Cuiyun Gao. [Paper] - CORE: Concept-Oriented Reinforcement for Bridging the Definition-Application Gap in Mathematical Reasoning <2026-05-07>
Zijun Gao, Zhikun Xu, Xiao Ye, Ben Zhou. [Paper] - Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR <2026-05-07>
Chaoli Mou, Zhan Zhuang, Xinning Chen, Yu Zhang. [Paper] - Reinforced Informativeness Optimization for Long-Form Retrieval-Augmented Generation <2026-05-07>
Yuhao Wang, Ruiyang Ren, Yucheng Wang, Wayne Xin Zhao, Jing Liu, Hua Wu, Haifeng Wang. [Paper] - Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy <2026-05-07>
Guangchen Lan, Lian Xiong, Xin Zhou, Hejie Cui, Yuwei Zhang, Mao Li, Zhenyu Shi, Besnik Fetahu, Lihong Li, Xian Li. [Paper] - Correct Is Not Enough: Training Reasoning Planners with Executor-Grounded Rewards <2026-05-07>
Tianyang Han, Hengyu Shi, Junjie Hu, Xu Yang, Zhiling Wang, Junhao Su. [Paper] - AGPO: Asymmetric Group Policy Optimization for Verifiable Reasoning and Search Ads Relevance at JD <2026-05-07>
Yang Xu, Kun Yao, Yiming Deng, Zheng Fang, Kai Ming Ting, Ming Pang. [Paper] - Adapt to Thrive! Adaptive Power-Mean Policy Optimization for Improved LLM Reasoning <2026-05-07>
Yiming Huang, Zhenbo Shi, Shuzheng Gao, Cuiyun Gao, Peiyi Han, Chuanyi Liu. [Paper] - Boosting Reasoning in Large Multimodal Models via Activation Replay <2026-05-07>
Yun Xing, Xiaobin Hu, Qingdong He, Jiangning Zhang, Shuicheng Yan, Shijian Lu, Yu-Gang Jiang. [Paper] - Emergent Slow Thinking in LLMs as Inverse Tree Freezing <2026-05-07>
Sihan Hu, Xiansheng Cai, Yuan Huang, Zhiyuan Yao, Linfeng Zhang, Pan Zhang, Youjin Deng, Kun Chen. [Paper] - Nonsense Helps: Prompt Space Perturbation Broadens Reasoning Exploration <2026-05-07>
Langlin Huang, Chengsong Huang, Jinyuan Li, Donghong Cai, Yuyi Yang, Jiaxin Huang. [Paper] - SPARK: Self-Play with Asymmetric Reward from Knowledge Graphs <2026-05-07>
Hyobin Park, Taeseop Kim, Dong-Geol Choi. [Paper] - EP-GRPO: Entropy-Progress Aligned Group Relative Policy Optimization with Implicit Process Guidance <2026-05-06>
Song Yu, Li Li, Wenwen Zhao, Zhisheng Yang. [Paper] - Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning <2026-05-06>
Weiqin Wang, Yile Wang, Kehao Chen, Hui Huang. [Paper] - Beyond Variance: Prompt-Efficient RLVR via Rare-Event Amplification and Bidirectional Pairing <2026-05-06>
Yujuan Pang, Jiaxin Li, Xin Sheng, Ran Peng, Yong Ma. [Paper] - The Implicit Curriculum: Learning Dynamics in RL with Verifiable Rewards <2026-05-06>
Yu Huang, Zixin Wen, Yuejie Chi, Yuting Wei, Aarti Singh, Yingbin Liang, Yuxin Chen. [Paper] - Efficiently Aligning Language Models with Online Natural Language Feedback <2026-05-05>
Christine Ye, Joe Benton. [Paper] - Reference-Sampled Boltzmann Projection for KL-Regularized RLVR: Target-Matched Weighted SFT, Finite One-Shot Gaps, and Policy Mirror Descent <2026-05-04>
Yao Shu, Chenxing Wei, Hongbin Lin, Shuang Qiu, Hui Xiong. [Paper] - Think2SQL: Reinforce LLM Reasoning Capabilities for Text2SQL <2026-05-04>
Simone Papicchio, Simone Rossi, Luca Cagliero, Paolo Papotti. [Paper] - Enhancing Multimodal In-Context Learning via Inductive-Deductive Reasoning <2026-05-04>
Haoyu Wang, Haonan Wang, Yuyan Chen, Jun Chen, Gang Liu, Qian Wang, Jiahong Yan, Yanghua Xiao. [Paper] - Binary Rewards and Reinforcement Learning: Fundamental Challenges <2026-05-04>
Marc Dymetman. [Paper] - CastFlow: Learning Role-Specialized Agentic Workflows for Time Series Forecasting <2026-05-04>
Bokai Pan, Mingyue Cheng, Zhiding Liu, Shuo Yu, Xiaoyu Tao, Yuchong Wu, Qi Liu, Defu Lian, Enhong Chen. [Paper] - Selector-Guided Autonomous Curriculum for One-Shot Reinforcement Learning from Verifiable Rewards <2026-05-03>
Rudray Dave, Vedang Dubey, Smit Deoghare, Sudhakar Mishra. [Paper] - MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models <2026-05-02>
Yin Zhang, Jiaxuan Zhao, Zonghan Wu, Zengxiang Li, Junfeng Fang, Kun Wang, Qingsong Wen, Yilei Shao. [Paper] - Resource-Efficient Reinforcement for Reasoning Large Language Models via Dynamic One-Shot Policy Refinement <2026-05-02>
Yunjian Zhang, Sudong Wang, Yang Li, Peiran Xu, Conghao Zhou, Xiaoyue Ma, Jianing Li, Yao Zhu. [Paper] - Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL <2026-05-01>
Sudong Wang, Weiquan Huang, Xiaomin Yu, Zuhao Yang, Hehai Lin, Keming Wu, Chaojun Xiao, Chen Chen, Wenxuan Wang, Beier Zhu, Yunjian Zhang, Chengwei Qin. [Paper] - Decouple before Integration: Test-time Synthesis of SFT and RLVR Task Vectors <2026-05-01>
Chaohao Yuan, Chenghao Xiao, Yu Rong, Hong Cheng, Long-Kai Huang. [Paper] - Decouple before Integration: Test-time Synthesis of SFT and RLVR Task Vectors <2026-05-01>
Chaohao Yuan, Chenghao Xiao, Yu Rong, Hong Cheng, Long-Kai Huang. [Paper] - Reward Modeling from Natural Language Human Feedback <2026-05-01>
Zongqi Wang, Rui Wang, Yuchuan Wu, Yiyao Yu, Pinyi Zhang, Shaoning Sun, Yujiu Yang, Yongbin Li. [Paper] - ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning <2026-05-01>
Zihan Lin, Xiaohan Wang, Jie Cao, Jiajun Chai, Li Wang, Xiaodong Lu, Wei Lin, Ran He, Guojun Yin. [Paper] - Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity <2026-05-01>
Anamika Lochab, Bolian Li, Ruqi Zhang. [Paper] - Unlocking Zero-Shot Geospatial Reasoning via Indirect Rewards <2026-04-30>
Chenhui Xu, Fuxun Yu, Michael J. Bianco, Jacob Kovarskiy, Raphael Tang, Qi Zhang, Zirui Xu, Will LeVine, Brandon Dubbs, Heming Liao, Cassandra Burgess, Suvam Bag, Jay Patravali, Rupanjali Kukal, Mikael Figueroa, Rishi Madhok, Nikolaos Karianakis, Jinjun Xiong. [Paper] - Reinforcement Learning for LLM Post-Training: A Survey <2026-04-30>
Zhichao Wang, Kiran Ramnath, Bin Bi, Shiva Kumar Pentyala, Sougata Chaudhuri, Shubham Mehrotra, Zixu, Zhu, Xiang-Bo Mao, Sitaram Asur, Na, Cheng. [Paper] - PRISM: Pre-alignment via Black-box On-policy Distillation for Multimodal Reinforcement Learning <2026-04-30>
Sudong Wang, Weiquan Huang, Xiaomin Yu, Zuhao Yang, Hehai Lin, Keming Wu, Chaojun Xiao, Chen Chen, Wenxuan Wang, Beier Zhu, Yunjian Zhang, Chengwei Qin. [Paper] - CastFlow: Learning Role-Specialized Agentic Workflows for Time Series Forecasting <2026-04-30>
Bokai Pan, Mingyue Cheng, Zhiding Liu, Shuo Yu, Xiaoyu Tao, Yuchong Wu, Qi Liu, Defu Lian, Enhong Chen. [Paper] - Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards <2026-04-30>
Zhengzhao Ma, Xueru Wen, Boxi Cao, Yaojie Lu, Hongyu Lin, Jinglin Yang, Min He, Xianpei Han, Le Sun. [Paper] - ScaleBox: Enabling High-Fidelity and Scalable Code Verification for Large Language Models <2026-04-30>
Jiasheng Zheng, Xin Zheng, Boxi Cao, Pengbo Wang, Zhengzhao Ma, Qiming Zhu, Jiazhen Jiang, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun. [Paper] - Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards <2026-04-29>
Ming Li, Pei Chen, Zhenhao Zhang, Tao Yang, Xinyang Zhang, Han Li, Tianyu Cao, Ming Zeng, Zhuofeng Wu, Meng Jiang, Huasheng Li, Lihong Li, Bing Yin. [Paper] - Co-Evolving Policy Distillation <2026-04-29>
Naibin Gu, Chenxu Yang, Qingyi Si, Chuanyu Qin, Dingyu Yao, Peng Fu, Zheng Lin, Weiping Wang, Nan Duan, Jiaqi Wang. [Paper] - PAINT: Partial-Solution Adaptive Interpolated Training for Self-Distilled Reasoners <2026-04-29>
Zhiquan Tan, Yinrong Hong. [Paper] - Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective <2026-04-29>
Zhezheng Hao, Hong Wang, Haoyang Liu, Jian Luo, Jiarui Yu, Hande Dong, Qiang Lin, Can Wang, Jiawei Chen. [Paper] - How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum <2026-04-28>
Chu-Cheng Lin, Eugene Ie. [Paper] - When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient <2026-04-28>
Shuning Shang, Hubert Strauss, Stanley Wei, Sanjeev Arora, Noam Razin. [Paper] - Step-Audio-R1.5 Technical Report <2026-04-28>
Yuxin Zhang, Xiangyu Tony Zhang, Daijiao Liu, Fei Tian, Yayue Deng, Jun Chen, Qingjian Lin, Haoyang Zhang, Yuxin Li, Jinglan Gong, Yechang Huang, Liang Zhao, Chengyuan Yao, Hexin Liu, Eng Siong Chng, Xuerui Yang, Gang Yu, Xiangyu Zhang, Daxin Jiang. [Paper] - Policy Improvement Reinforcement Learning <2026-04-28>
Huaiyang Wang, Xiaojie Li, Deqing Wang, Haoyi Zhou, Zixuan Huang, Yaodong Yang, Jianxin Li, Yikun Ban. [Paper] - AdaTooler-V: Adaptive Tool-Use for Images and Videos <2026-04-28>
Chaoyang Wang, Kaituo Feng, Dongyang Chen, Zhongyu Wang, Zhixun Li, Sicheng Gao, Meng Meng, Xu Zhou, Manyuan Zhang, Yuzhang Shang, Xiangyu Yue. [Paper] - JURY-RL: Votes Propose, Proofs Dispose for Label-Free RLVR <2026-04-28>
Xinjie Chen, Biao Fu, Jing Wu, Guoxin Chen, Xinggao Liu, Dayiheng Liu, Minpeng Liao. [Paper] - Scheduling Your LLM Reinforcement Learning with Reasoning Trees <2026-04-27>
Hong Wang, Zhezheng Hao, Jian Luo, Chenxing Wei, Yao Shu, Lei Liu, Qiang Lin, Hande Dong, Jiawei Chen. [Paper] - Improving Vision-language Models with Perception-centric Process Reward Models <2026-04-27>
Yingqian Min, Kun Zhou, Yifan Li, Yuhuan Wu, Han Peng, Yifan Du, Wayne Xin Zhao, Min Yang, Ji-Rong Wen. [Paper] - V-GRPO: Online Reinforcement Learning for Denoising Generative Models Is Easier than You Think <2026-04-25>
Bingda Tang, Yuhui Zhang, Xiaohan Wang, Jiayuan Mao, Ludwig Schmidt, Serena Yeung-Levy. [Paper] - Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance <2026-04-25>
Xinzhu Chen, Wei He, Huichuan Fan, Wenzhe Niu, Zhongxiang Sun, Xuanru Wang, Jiuchong Gao, Jinghua Hao, Renqing He, Weijie Yu. [Paper] - LearnAlign: Data Selection for LLM Reinforcement Learning with Improved Gradient Alignment <2026-04-25>
Shipeng Li, Zhiqin Yang, Shikun Li, Xiaobo Xia, Hengyu Liu, Xinghua Zhang, Gaode Chen, Dong Fang, Ying Tai, Zhe Peng. [Paper] - DeepImagine: Learning Biomedical Reasoning via Successive Counterfactual Imagining <2026-04-24>
Youze Zheng, Jianyou Wang, Yuhan Chen, Matthew Feng, Longtian Bao, Hanyuan Zhang, Maxim Khan, Aditya K. Sehgal, Christopher D. Rosin, Umber Dube, Ramamohan Paturi. [Paper] - UR: Unify RAG and Reasoning through Reinforcement Learning <2026-04-24>
Weitao Li, Boran Xiang, Xiaolong Wang, Zhinan Gou, Weizhi Ma, Yang Liu. [Paper] - TexOCR: Advancing Document OCR Models for Compilable Page-to-LaTeX Reconstruction <2026-04-24>
Chengye Wang, Lin Fu, Zexi Kuang, Yilun Zhao. [Paper] - Outcome Rewards Do Not Guarantee Verifiable or Causally Important Reasoning <2026-04-23>
Qinan Yu, Alexa Tartaglini, Peter Hase, Carlos Guestrin, Christopher Potts. [Paper] - How to Allocate, How to Learn? Dynamic Rollout Allocation and Advantage Modulation for Policy Optimization <2026-04-23>
Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi, Chaowen Hu, Lu Pan, Ke Zeng, Xunliang Cai. [Paper] - GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR <2026-04-23>
Jiaying Zhang, Lei Shi, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He. [Paper] - Navigating the Clutter: Waypoint-Based Bi-Level Planning for Multi-Robot Systems <2026-04-22>
Jiabao Ji, Yongchao Chen, Yang Zhang, Ramana Rao Kompella, Chuchu Fan, Gaowen Liu, Shiyu Chang. [Paper] - V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization <2026-04-22>
Yubo Jiang, Yitong An, Xin Yang, Abudukelimu Wuerkaixi, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang. [Paper] - Near-Future Policy Optimization <2026-04-22>
Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng Fu, Nan Duan, Jiaqi Wang. [Paper] - SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models <2026-04-22>
Jiahao Xie, Alessio Tonioni, Nathalie Rauschmayr, Federico Tombari, Bernt Schiele. [Paper] - GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning <2026-04-22>
Jingyi Wang, Lei Zhu, Tengjin Weng, Song-Li Wu, Haochen Tan, Jierun Chen, Chaofan Tao, Haoli Bai, Lu Hou, Lifeng Shang, Xiao-Ping Zhang. [Paper] - CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment <2026-04-22>
Xue Jiang, Yihong Dong, Mengyang Liu, Hongyi Deng, Tian Wang, Yongding Tao, Rongyu Cao, Binhua Li, Zhi Jin, Wenpin Jiao, Fei Huang, Yongbin Li, Ge Li. [Paper] - Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models <2026-04-22>
Xin Xu, Clive Bai, Kai Yang, Tianhao Chen, Yangkun Chen, Weijie Liu, Hao Chen, Yang Wang, Saiyong Yang, Can Yang. [Paper] - Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning <2026-04-22>
Weiqin Wang, Yile Wang, Kehao Chen, Hui Huang. [Paper] - Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning <2026-04-22>
Yixuan Even Xu, Yash Savani, Fei Fang, J. Zico Kolter. [Paper] - Rethinking Reinforcement Fine-Tuning in LVLM: Convergence, Reward Decomposition, and Generalization <2026-04-21>
Carter Adams, Rafael Oliveira, Gabriel Almeida, Sofia Torres. [Paper] - AeSlides: Incentivizing Aesthetic Layout in LLM-Based Slide Generation via Verifiable Rewards <2026-04-21>
Yiming Pan, Chengwei Hu, Xuancheng Huang, Can Huang, Mingming Zhao, Yuean Bi, Xiaohan Zhang, Aohan Zeng, Linmei Hu. [Paper] - Prioritizing the Best: Incentivizing Reliable Multimodal Reasoning by Rewarding Beyond Answer Correctness <2026-04-20>
Mengzhao Jia, Zhihan Zhang, Meng Jiang. [Paper] - When and What to Ask: AskBench and Rubric-Guided RLVR for LLM Clarification <2026-04-20>
Jiale Zhao, Ke Fang, Lu Cheng. [Paper] - When Can LLMs Learn to Reason with Weak Supervision? <2026-04-20>
Salman Rahman, Jingyan Shen, Anna Mordvina, Hamid Palangi, Saadia Gabriel, Pavel Izmailov. [Paper] - OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning <2026-04-20>
Xinyu Ma, Mingzhou Xu, Xuebo Liu, Chang Jin, Qiang Wang, Derek F. Wong, Min Zhang. [Paper] - SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents <2026-04-20>
Xinshun Feng, Xinhao Song, Lijun Li, Gongshen Liu, Jing Shao. [Paper] - Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks <2026-04-20>
Md Rysul Kabir, Zoran Tiganj. [Paper] - StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning <2026-04-20>
Daoyu Wang, Qingchuan Li, Mingyue Cheng, Jie Ouyang, Shuo Yu, Qi Liu, Enhong Chen. [Paper] - Learning from Less: Measuring the Effectiveness of RLVR in Low Data and Compute Regimes <2026-04-20>
Justin Bauer, Thomas Walshe, Derek Pham, Harit Vishwakarma, Armin Parchami, Frederic Sala, Paroma Varma. [Paper] - UR: Unify RAG and Reasoning through Reinforcement Learning <2026-04-24>
Weitao Li, Boran Xiang, Xiaolong Wang, Zhinan Gou, Weizhi Ma, Yang Liu. [Paper] - Outcome Rewards Do Not Guarantee Verifiable or Causally Important Reasoning <2026-04-23>
Qinan Yu, Alexa Tartaglini, Peter Hase, Carlos Guestrin, Christopher Potts. [Paper] - How to Allocate, How to Learn? Dynamic Rollout Allocation and Advantage Modulation for Policy Optimization <2026-04-23>
Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi, Chaowen Hu, Lu Pan, Ke Zeng, Xunliang Cai. [Paper] - Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards <2026-04-23>
Ming Li. [Paper] - GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR <2026-04-23>
Jiaying Zhang, Lei Shi, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He. [Paper] - Navigating the Clutter: Waypoint-Based Bi-Level Planning for Multi-Robot Systems <2026-04-22>
Jiabao Ji, Yongchao Chen, Yang Zhang, Ramana Rao Kompella, Chuchu Fan, Gaowen Liu, Shiyu Chang. [Paper] - V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization <2026-04-22>
Yubo Jiang, Yitong An, Xin Yang, Abudukelimu Wuerkaixi, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang. [Paper] - Near-Future Policy Optimization <2026-04-22>
Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng Fu, Nan Duan, Jiaqi Wang. [Paper] - SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models <2026-04-22>
Jiahao Xie, Alessio Tonioni, Nathalie Rauschmayr, Federico Tombari, Bernt Schiele. [Paper] - GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning <2026-04-22>
Jingyi Wang, Lei Zhu, Tengjin Weng, Song-Li Wu, Haochen Tan, Jierun Chen, Chaofan Tao, Haoli Bai, Lu Hou, Lifeng Shang, Xiao-Ping Zhang. [Paper] - CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment <2026-04-22>
Xue Jiang, Yihong Dong, Mengyang Liu, Hongyi Deng, Tian Wang, Yongding Tao, Rongyu Cao, Binhua Li, Zhi Jin, Wenpin Jiao, Fei Huang, Yongbin Li, Ge Li. [Paper] - Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models <2026-04-22>
Xin Xu, Clive Bai, Kai Yang, Tianhao Chen, Yangkun Chen, Weijie Liu, Hao Chen, Yang Wang, Saiyong Yang, Can Yang. [Paper] - Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning <2026-04-22>
Weiqin Wang, Yile Wang, Kehao Chen, Hui Huang. [Paper] - Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning <2026-04-22>
Yixuan Even Xu, Yash Savani, Fei Fang, J. Zico Kolter. [Paper] - Rethinking Reinforcement Fine-Tuning in LVLM: Convergence, Reward Decomposition, and Generalization <2026-04-21>
Carter Adams, Rafael Oliveira, Gabriel Almeida, Sofia Torres. [Paper] - Prioritizing the Best: Incentivizing Reliable Multimodal Reasoning by Rewarding Beyond Answer Correctness <2026-04-20>
Mengzhao Jia, Zhihan Zhang, Meng Jiang. [Paper] - When and What to Ask: AskBench and Rubric-Guided RLVR for LLM Clarification <2026-04-20>
Jiale Zhao, Ke Fang, Lu Cheng. [Paper] - When Can LLMs Learn to Reason with Weak Supervision? <2026-04-20>
Salman Rahman, Jingyan Shen, Anna Mordvina, Hamid Palangi, Saadia Gabriel, Pavel Izmailov. [Paper] - OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning <2026-04-20>
Xinyu Ma, Mingzhou Xu, Xuebo Liu, Chang Jin, Qiang Wang, Derek F. Wong, Min Zhang. [Paper] - SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents <2026-04-20>
Xinshun Feng, Xinhao Song, Lijun Li, Gongshen Liu, Jing Shao. [Paper] - Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks <2026-04-20>
Md Rysul Kabir, Zoran Tiganj. [Paper] - StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning <2026-04-20>
Daoyu Wang, Qingchuan Li, Mingyue Cheng, Jie Ouyang, Shuo Yu, Qi Liu, Enhong Chen. [Paper] - Learning from Less: Measuring the Effectiveness of RLVR in Low Data and Compute Regimes <2026-04-20>
Justin Bauer, Thomas Walshe, Derek Pham, Harit Vishwakarma, Armin Parchami, Frederic Sala, Paroma Varma. [Paper] - GeometryZero: Advancing Geometry Solving via Group Contrastive Policy Optimization <2026-04-20>
Yikun Wang, Yibin Wang, Dianyi Wang, Zimian Peng, Qipeng Guo, Dacheng Tao, Jiaqi Wang. [Paper] - QuantumQA: Enhancing Scientific Reasoning via Physics-Consistent Dataset and Verification-Aware Reinforcement Learning <2026-04-20>
Songxin Qu, Tai-Ping Sun, Yun-Jie Wang, Huan-Yu Liu, Cheng Xue, Xiao-Fan Xu, Han Fang, Yang Yang, Yu-Chun Wu, Guo-Ping Guo, Zhao-Yun Chen. [Paper] - Reinforced Efficient Reasoning via Semantically Diverse Exploration <2026-04-20>
Ziqi Zhao, Zhaochun Ren, Jiahong Zou, Liu Yang, Zhiwei Xu, Xuri Ge, Zhumin Chen, Xinyu Ma, Daiting Shi, Shuaiqiang Wang, Dawei Yin, Xin Xin. [Paper] - Semantic-Space Exploration and Exploitation in RLVR for LLM Reasoning <2026-04-20>
Fanding Huang, Guanbo Huang, Xiao Fan, Yi He, Xiao Liang, Xiao Chen, Qinting Jiang, Faisal Nadeem Khan, Jingyan Jiang, Zhi Wang. [Paper] - Learning to Extract Rational Evidence via Reinforcement Learning for Retrieval-Augmented Generation <2026-04-20>
Xinping Zhao, Shouzheng Huang, Yan Zhong, Xinshuo Hu, Meishan Zhang, Baotian Hu, Min Zhang. [Paper] - EvoCoT: Overcoming the Exploration Bottleneck in Reinforcement Learning <2026-04-20>
Huanyu Liu, Jia Li, Yihong Dong, Chang Yu, Taozhi Chen, Lecheng Wang, Yongding Tao, Bin Gu, Ge Li. [Paper] - HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment <2026-04-20>
Zhanyu Liu, Qingguo Hu, Ante Wang, Chenqing Liu, Zhishang Xiang, Hui Li, Delai Qiu, Jinsong Su. [Paper] - Less Noise, More Voice: Reinforcement Learning for Reasoning via Instruction Purification <2026-04-20>
Yiju Guo, Tianyi Hu, Zexu Sun, Yankai Lin. [Paper] - Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR <2026-04-19>
Muhammad Khalifa, Zohaib Khan, Omer Tafveez, Hao Peng, Lu Wang. [Paper] - Revisiting Entropy in Reinforcement Learning for Large Reasoning Models <2026-04-19>
Renren Jin, Pengzhi Gao, Yuqi Ren, Zhuowen Han, Tongxuan Zhang, Wuwei Huang, Wei Liu, Jian Luan, Deyi Xiong. [Paper] - From to : Taming Divergence in Soft Clipping via Bilateral Decoupled Decay of Probability Gradient Weight <2026-04-19>
Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Chaowen Hu, Cong Qin, Zekai Shao, Binbin Zheng, Lu Pan, Ke Zeng. [Paper] - Writing-RL: Advancing Long-form Writing via Adaptive Curriculum Reinforcement Learning <2026-04-19>
Xuanyu Lei, Chenliang Li, Yuning Wu, Kaiming Liu, Weizhou Shen, Peng Li, Ming Yan, Fei Huang, Ya-Qin Zhang, Yang Liu. [Paper] - GanitLLM: Difficulty-Aware Bengali Mathematical Reasoning through Curriculum-GRPO <2026-04-19>
Shubhashis Roy Dipta, Khairul Mahbub, Nadia Najjar. [Paper] - AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning <2026-04-18>
Mengzhao Jia, Zhihan Zhang, Ignacio Cases, Zheyuan Liu, Meng Jiang, Peng Qi. [Paper] - MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning <2026-04-18>
Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Binbin Zheng, Chaowen Hu, Zekai Shao, Cong Qin, Lu Pan, Ke Zeng, Xunliang Cai. [Paper] - Abstain-R1: Calibrated Abstention and Post-Refusal Clarification via Verifiable RL <2026-04-18>
Skylar Zhai, Jingcheng Liang, Dongyeop Kang. [Paper] - MCPO: Mastery-Consolidated Policy Optimization for Large Reasoning Models <2026-04-18>
Zhaokang Liao, Yingguo Gao, Yi Yang, Yongheng Hu, Jingting Ding. [Paper] - EasyVideoR1: Easier RL for Video Understanding <2026-04-18>
Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng Fu, Nan Duan, Jiaqi Wang. [Paper] - Incentivizing Parametric Knowledge via Reinforcement Learning with Verifiable Rewards for Cross-Cultural Entity Translation <2026-04-18>
Jiang Zhou, Xiaohu Zhao, Xinwei Wu, Tianyu Dong, Hao Wang, Yangyang Liu, Heng Liu, Linlong Xu, Longyue Wang, Weihua Luo, Deyi Xiong. [Paper] - Detecting and Suppressing Reward Hacking with Gradient Fingerprints <2026-04-17>
Songtao Wang, Quang Hieu Pham, Fangcong Yin, Xinpeng Wang, Jocelyn Qiaochu Chen, Greg Durrett, Xi Ye. [Paper] - ATTNPO: Attention-Guided Process Supervision for Efficient Reasoning <2026-04-17>
Shuaiyi Nie, Siyu Ding, Wenyuan Zhang, Linhao Yu, Tianmeng Yang, Yao Chen, Weichong Yin, Yu Sun, Hua Wu, Tingwen Liu. [Paper] - Revisiting Entropy Regularization: Adaptive Coefficient Unlocks Its Potential for LLM Reinforcement Learning <2026-04-17>
Xiaoyun Zhang, Xiaojian Yuan, Di Huang, Wang You, Chen Hu, Jingqing Ruan, Ai Jian, Kejiang Chen, Xing Hu. [Paper] - Self-Aligned Reward: Towards Effective and Efficient Reasoners <2026-04-16>
Peixuan Han, Adit Krishnan, Gerald Friedland, Jiaxuan You, Chris Kong. [Paper] - LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking <2026-04-16>
Lukas Helff, Quentin Delfosse, David Steinmann, Ruben Härle, Hikaru Shindo, Patrick Schramowski, Wolfgang Stammer, Kristian Kersting, Felix Friedrich. [Paper] - Unlocking Exploration in RLVR: Uncertainty-aware Advantage Shaping for Deeper Reasoning <2026-04-16>
Can Xie, Ruotong Pan, Xiangyu Wu, Yunfei Zhang, Jiayi Fu, Tingting Gao, Guorui Zhou. [Paper] - Geoparsing: Diagram Parsing for Plane and Solid Geometry with a Unified Formal Language <2026-04-16>
Peijie Wang, Ming-Liang Zhang, Jun Cao, Chao Deng, Dekang Ran, Hongda Sun, Pi Bu, Xuan Zhang, Yingyao Wang, Jun Song, Bo Zheng, Fei Yin, Cheng-Lin Liu. [Paper] - Do Not Step Into the Same River Twice: Learning to Reason from Trial and Error <2026-04-16>
Chenming Tang, Hsiu-Yuan Huang, Weijie Liu, Clive Bai, Saiyong Yang, Yunfang Wu. [Paper] - SSPO: Subsentence-level Policy Optimization <2026-04-10>
Kun Yang, Zikang chen, Yanmeng Wang, Zhigen Li, Ning Cheng, Shaojun Wang, Jing Xiao. [Paper] - Visually-Guided Policy Optimization for Multimodal Reasoning <2026-04-10>
Zengbin Wang, Feng Xiong, Liang Lin, Xuecai Hu, Yong Wang, Yanlin Wang, Man Zhang, Xiangxiang Chu. [Paper] - ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning <2026-04-10>
Shifeng Liu, Zhengye Zhang, Sirui Zhao, Xinglong Mao, Zhehan Kan, Zhixiang Wei, Shiwei Wu, Chaoyou Fu, Tong Xu, Enhong Chen. [Paper] - PerMix-RLVR: Preserving Persona Expressivity under Verifiable-Reward Alignment <2026-04-10>
Jihwan Oh, Soowon Oh, Murad Aghazada, Minchan Jeong, Sungnyun Kim, Se-Young Yun. [Paper] - Skip-Connected Policy Optimization for Implicit Advantage <2026-04-09>
Fengwei Teng, Jinyi Bai, Xinhao Yao, Demi Ruohan Wang, Jiahao Zhao, Zhijiang Guo. [Paper] - SUPERNOVA: Eliciting General Reasoning in LLMs with Reinforcement Learning on Natural Instructions <2026-04-09>
Ashima Suvarna, Kendrick Phan, Mehrab Beikzadeh, Hritik Bansal, Saadia Gabriel. [Paper] - Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization <2026-04-09>
Sai Srinivas Kancheti, Aditya Kanade, Rohit Sinha, Vineeth N Balasubramanian, Tanuja Ganu. [Paper] - TTVS: Boosting Self-Exploring Reinforcement Learning via Test-time Variational Synthesis <2026-04-09>
Sikai Bai, Haoxi Li, Jie Zhang, Yongjiang Liu, Song Guo. [Paper] - Fundus-R1: Training a Fundus-Reading MLLM with Knowledge-Aware Reasoning on Public Data <2026-04-09>
Yuchuan Deng, Qijie Wei, Kaiheng Qian, Jiazhen Liu, Zijie Xin, Bangxiang Lan, Jingyu Liu, Jianfeng Dong, Xirong Li. [Paper] - Seeing with You: Perception-Reasoning Coevolution for Multimodal Reasoning <2026-04-09>
Ziqi Miao, Haonan Jia, Lijun Li, Chen Qian, Yuan Xiong, Wenting Yan, Jing Shao. [Paper] - ZeroCoder: Can LLMs Improve Code Generation Without Ground-Truth Supervision? <2026-04-09>
Lishui Fan, Mouxiang Chen, Tingwei Zhu, Kui Liu, Xin Xia, Shanping Li, Zhongxin Liu. [Paper] - SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents <2026-04-09>
Xinshun Feng, Xinhao Song, Lijun Li, Gongshen Liu, Jing Shao. [Paper] - Mitigating Distribution Sharpening in Math RLVR via Distribution-Aligned Hint Synthesis and Backward Hint Annealing <2026-04-09>
Pei-Xi Xie, Che-Yu Lin, Cheng-Lin Yang. [Paper] - An Imperfect Verifier is Good Enough: Learning with Noisy Rewards <2026-04-09>
Andreas Plesner, Francisco Guzmán, Anish Athalye. [Paper] - Gym-V: A Unified Vision Environment System for Agentic Vision Research <2026-04-08>
Fanqing Meng, Lingxiao Du, Jiawei Gu, Jiaqi Liao, Linjie Li, Zijian Wu, Xiangyan Liu, Ziqi Zhao, Mengkang Hu, Zichen Liu, Jiaheng Zhang, Michael Qizhe Shieh. [Paper] - Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models <2026-04-08>
Zekai Ye, Qiming Li, Xiaocheng Feng, Ruihan Chen, Ziming Li, Haoyu Ren, Kun Chen, Dandan Tu, Bing Qin. [Paper] - Self-Distilled RLVR <2026-04-08>
Chenxu Yang, Chuanyu Qin, Qingyi Si, Minghui Chen, Naibin Gu, Dingyu Yao, Zheng Lin, Weiping Wang, Jiaqi Wang, Nan Duan. [Paper] - GIFT: Group-Relative Implicit Fine-Tuning Integrates GRPO with DPO and UNA <2026-04-08>
Zhichao Wang. [Paper] - Reinforcement Learning for LLM Post-Training: A Survey <2026-04-08>
Zhichao Wang, Kiran Ramnath, Bin Bi, Shiva Kumar Pentyala, Sougata Chaudhuri, Shubham Mehrotra, Zixu, Zhu, Xiang-Bo Mao, Sitaram Asur, Na, Cheng. [Paper] - Rectifying LLM Thought from Lens of Optimization <2026-04-07>
Junnan Liu, Hongwei Liu, Songyang Zhang, Kai Chen. [Paper] - Target Policy Optimization <2026-04-07>
Jean Kaddour. [Paper] - DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search <2026-04-06>
Fang Wu, Weihao Xuan, Heli Qi, Ximing Lu, Aaron Tu, Li Erran Li, Yejin Choi. [Paper] - ThinkTwice: Jointly Optimizing Large Language Models for Reasoning and Self-Refinement <2026-04-06>
Difan Jiao, Qianfeng Wen, Blair Yang, Zhenwei Tang, Ashton Anderson. [Paper] - Rethinking Exploration in RLVR: From Entropy Regularization to Refinement via Bidirectional Entropy Modulation <2026-04-06>
Hengrui Gu, Xiaotian Han, Yujing Bian, Kaixiong Zhou. [Paper] - A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning <2026-04-06>
Mengqi Li, Lei Zhao, Anthony Man-Cho So, Ruoyu Sun, Xiao Li. [Paper] - Cog-DRIFT: Exploration on Adaptively Reformulated Instances Enables Learning from Hard Reasoning Problems <2026-04-06>
Justin Chih-Yao Chen, Archiki Prasad, Zaid Khan, Joykirat Singh, Runchu Tian, Elias Stengel-Eskin, Mohit Bansal. [Paper] - Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration <2026-04-06>
Zhicheng Yang, Zhijiang Guo, Yinya Huang, Yongxin Wang, Dongchun Xie, Hanhui Li, Yiwei Wang, Xiaodan Liang, Jing Tang. [Paper] - SPHINX: A Synthetic Environment for Visual Perception and Reasoning <2026-04-05>
Md Tanvirul Alam, Saksham Aggarwal, Justin Yang Chae, Nidhi Rastogi. [Paper] - Scaling the Scaling Logic: Agentic Meta-Synthesis of Logic Reasoning <2026-04-05>
Bowen Liu, Zhi Wu, Runquan Xie, Zhanhui Kang, Jia Li. [Paper] - Can LLMs Learn to Reason Robustly under Noisy Supervision? <2026-04-05>
Shenzhi Yang, Guangcheng Zhu, Bowen Song, Sharon Li, Haobo Wang, Xing Zheng, Yingfan Ma, Zhongqi Chen, Weiqiang Wang, Gang Chen. [Paper] - Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings <2026-04-04>
Yuning Wu, Ke Wang, Devin Chen, Kai Wei. [Paper] - Apriel-1.5-OpenReasoner: RL Post-Training for General-Purpose and Efficient Reasoning <2026-04-03>
Rafael Pardinas, Ehsan Kamalloo, David Vazquez, Alexandre Drouin. [Paper] - ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models <2026-04-03>
Song Yu, Li Li, Wenwen Zhao, Zhisheng Yang. [Paper] - Reinforcement Learning-based Knowledge Distillation with LLM-as-a-Judge <2026-04-03>
Yiyang Shen, Lifu Tu, Weiran Wang. [Paper] - Future Policy Approximation for Offline Reinforcement Learning Improves Mathematical Reasoning <2026-04-03>
Minjae Oh, Yunho Choi, Dongmin Choi, Yohan Jo. [Paper] - Reinforcement Learning from Human Feedback: A Statistical Perspective <2026-04-02>
Pangpang Liu, Chengchun Shi, Will Wei Sun. [Paper] - Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing <2026-04-02>
Gengsheng Li, Tianyu Yang, Junfeng Fang, Mingyang Song, Mao Zheng, Haiyun Guo, Dan Zhang, Jinqiao Wang, Tat-Seng Chua. [Paper] - Policy Improvement Reinforcement Learning <2026-04-01>
Huaiyang Wang, Xiaojie Li, Deqing Wang, Haoyi Zhou, Zixuan Huang, Yaodong Yang, Jianxin Li, Yikun Ban. [Paper] - RefineRL: Advancing Competitive Programming with Self-Refinement Reinforcement Learning <2026-04-01>
Shaopeng Fu, Xingxing Zhang, Li Dong, Di Wang, Furu Wei. [Paper] - Learning to Hint for Reinforcement Learning <2026-04-01>
Yu Xia, Canwen Xu, Zhewei Yao, Julian McAuley, Yuxiong He. [Paper] - Execution-Verified Reinforcement Learning for Optimization Modeling <2026-04-01>
Runda Guan, Xiangqing Shen, Jiajun Zhang, Yifan Zhang, Jian Cheng, Rui Xia. [Paper] - Replacing Multi-Step Assembly of Data Preparation Pipelines with One-Step LLM Pipeline Generation for Table QA <2026-04-01>
Fengyu Li, Junhao Zhu, Kaishi Song, Lu Chen, Zhongming Yao, Tianyi Li, Christian S. Jensen. [Paper] - Reinforced Reasoning for End-to-End Retrosynthetic Planning <2026-03-31>
Chenyang Zuo, Siqi Fan, Yizhen Luo, Zaiqing Nie. [Paper] - Towards Policy-Adaptive Image Guardrail: Benchmark and Method <2026-03-31>
Caiyong Piao, Zhiyuan Yan, Haoming Xu, Yunzhen Zhao, Kaiqing Lin, Feiyang Xu, Shuigeng Zhou. [Paper] - When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virtual Try-On <2026-03-31>
Wisdom Ikezogwo, Mehmet Saygin Seyfioglu, Ranjay Krishna, Karim Bouyarmane. [Paper] - ReViSQL: Achieving Human-Level Text-to-SQL <2026-03-30>
Yuxuan Zhu, Tengjun Jin, Yoojin Choi, Daniel Kang. [Paper] - SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning <2026-03-30>
Philip Schroeder, Thomas Weng, Karl Schmeckpeper, Eric Rosen, Stephen Hart, Ondrej Biza. [Paper] - Unveiling Implicit Advantage Symmetry: Why GRPO Struggles with Exploration and Difficulty Adaptation <2026-03-30>
Zhiqi Yu, Zhangquan Chen, Mengting Liu, Heye Zhang, Liangqiong Qu. [Paper] - SARL: Label-Free Reinforcement Learning by Rewarding Reasoning Topology <2026-03-30>
Yifan Wang, Bolian Li, David Cho, Ruqi Zhang, Fanping Sui, Ananth Grama. [Paper] - Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning <2026-03-29>
Ming Liu, Yunbei Zhang, Shilong Liu, Liwen Wang, Wensheng Zhang. [Paper] - Self-Distilled RLVR <2026-04-03>
Chenxu Yang, Chuanyu Qin, Qingyi Si, Minghui Chen, Naibin Gu, Dingyu Yao, Zheng Lin, Weiping Wang, Jiaqi Wang, Nan Duan. [Paper] - ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models <2026-04-03>
Song Yu, Li Li, Wenwen Zhao, Zhisheng Yang. [Paper] - Reinforcement Learning-based Knowledge Distillation with LLM-as-a-Judge <2026-04-03>
Yiyang Shen, Lifu Tu, Weiran Wang. [Paper] - Future Policy Approximation for Offline Reinforcement Learning Improves Mathematical Reasoning <2026-04-03>
Minjae Oh, Yunho Choi, Dongmin Choi, Yohan Jo. [Paper] - Reinforcement Learning from Human Feedback: A Statistical Perspective <2026-04-02>
Pangpang Liu, Chengchun Shi, Will Wei Sun. [Paper] - Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing <2026-04-02>
Gengsheng Li, Tianyu Yang, Junfeng Fang, Mingyang Song, Mao Zheng, Haiyun Guo, Dan Zhang, Jinqiao Wang, Tat-Seng Chua. [Paper] - Apriel-Reasoner: RL Post-Training for General-Purpose and Efficient Reasoning <2026-04-02>
Rafael Pardinas, Ehsan Kamalloo, David Vazquez, Alexandre Drouin. [Paper] - Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models <2026-04-02>
Zekai Ye, Qiming Li, Xiaocheng Feng, Ruihan Chen, Ziming Li, Haoyu Ren, Kun Chen, Dandan Tu, Bing Qin. [Paper] - ThinkTwice: Jointly Optimizing Large Language Models for Reasoning and Self-Refinement <2026-04-02>
Difan Jiao, Qianfeng Wen, Blair Yang, Zhenwei Tang, Ashton Anderson. [Paper] - Policy Improvement Reinforcement Learning <2026-04-01>
Huaiyang Wang, Xiaojie Li, Deqing Wang, Haoyi Zhou, Zixuan Huang, Yaodong Yang, Jianxin Li, Yikun Ban. [Paper] - RefineRL: Advancing Competitive Programming with Self-Refinement Reinforcement Learning <2026-04-01>
Shaopeng Fu, Xingxing Zhang, Li Dong, Di Wang, Furu Wei. [Paper] - Learning to Hint for Reinforcement Learning <2026-04-01>
Yu Xia, Canwen Xu, Zhewei Yao, Julian McAuley, Yuxiong He. [Paper] - Execution-Verified Reinforcement Learning for Optimization Modeling <2026-04-01>
Runda Guan, Xiangqing Shen, Jiajun Zhang, Yifan Zhang, Jian Cheng, Rui Xia. [Paper] - Replacing Multi-Step Assembly of Data Preparation Pipelines with One-Step LLM Pipeline Generation for Table QA <2026-04-01>
Fengyu Li, Junhao Zhu, Kaishi Song, Lu Chen, Zhongming Yao, Tianyi Li, Christian S. Jensen. [Paper] - Reinforced Reasoning for End-to-End Retrosynthetic Planning <2026-03-31>
Chenyang Zuo, Siqi Fan, Yizhen Luo, Zaiqing Nie. [Paper] - Towards Policy-Adaptive Image Guardrail: Benchmark and Method <2026-03-31>
Caiyong Piao, Zhiyuan Yan, Haoming Xu, Yunzhen Zhao, Kaiqing Lin, Feiyang Xu, Shuigeng Zhou. [Paper] - When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virtual Try-On <2026-03-31>
Wisdom Ikezogwo, Mehmet Saygin Seyfioglu, Ranjay Krishna, Karim Bouyarmane. [Paper] - ReViSQL: Achieving Human-Level Text-to-SQL <2026-03-30>
Yuxuan Zhu, Tengjun Jin, Yoojin Choi, Daniel Kang. [Paper] - SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning <2026-03-30>
Philip Schroeder, Thomas Weng, Karl Schmeckpeper, Eric Rosen, Stephen Hart, Ondrej Biza. [Paper] - Seeing with You: Perception-Reasoning Coevolution for Multimodal Reasoning <2026-03-30>
Ziqi Miao, Haonan Jia, Lijun Li, Chen Qian, Yuan Xiong, Wenting Yan, Jing Shao. [Paper] - Unveiling Implicit Advantage Symmetry: Why GRPO Struggles with Exploration and Difficulty Adaptation <2026-03-30>
Zhiqi Yu, Zhangquan Chen, Mengting Liu, Heye Zhang, Liangqiong Qu. [Paper] - SARL: Label-Free Reinforcement Learning by Rewarding Reasoning Topology <2026-03-30>
Yifan Wang, Bolian Li, David Cho, Ruqi Zhang, Fanping Sui, Ananth Grama. [Paper] - Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning <2026-03-29>
Ming Liu, Yunbei Zhang, Shilong Liu, Liwen Wang, Wensheng Zhang. [Paper] - Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models <2026-03-28>
Yuhang Han, Yuyang Wu, Zhengbo Jiao, Yiyu Wang, Xuyang Liu, Shaobo Wang, Hanlin Xu, Xuming Hu, Linfeng Zhang. [Paper] - Incentivizing Temporal-Awareness in Egocentric Video Understanding Models <2026-03-28>
Zhiyang Xu, Tian Qin, Bowen Jin, Zhengfeng Lai, Meng Cao, Lifu Huang, Peng Zhang. [Paper] - From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training <2026-03-28>
Donglai Xu, Hongzheng Yang, Yuzhi Zhao, Pingping Zhang, Jinpeng Chen, Wenao Ma, Zhijian Hou, Mengyang Wu, Xiaolei Li, Senkang Hu, Ziyi Guan, Jason Chun Lok Li, Lai Man Po. [Paper] - Beyond Where to Look: Trajectory-Guided Reinforcement Learning for Multimodal RLVR <2026-03-27>
Jinda Lu, Junkang Wu, Jinghan Li, Kexin Huang, Shuo Yang, Mingzhu Chen, Jiancan Wu, Kuien Liu, Xiang Wang. [Paper] - Nemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning Models <2026-03-27>
Boxin Wang, Chankyu Lee, Nayeon Lee, Sheng-Chieh Lin, Wenliang Dai, Yang Chen, Yangyi Chen, Zhuolin Yang, Zihan Liu, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping. [Paper] - Do Language Models Follow Occam's Razor? An Evaluation of Parsimony in Inductive and Abductive Reasoning <2026-03-26>
Yunxin Sun, Abulhair Saparov. [Paper] - P^2O: Joint Policy and Prompt Optimization <2026-03-26>
Xinyu Lu, Kaiqi Zhang, Jinglin Yang, Boxi Cao, Yaojie Lu, Hongyu Lin, Min He, Xianpei Han, Le Sun. [Paper] - TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs <2026-03-26>
Jun Zhang, Teng Wang, Yuying Ge, Yixiao Ge, Xinhao Li, Ying Shan, Limin Wang. [Paper] - MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning <2026-03-26>
Chenglong Wang, Yifu Huo, Yang Gan, Qiaozhi He, Qi Meng, Bei Li, Yan Wang, Junfu Liu, Tianhua Zhou, Jingbo Zhu, Tong Xiao. [Paper] - Bridging Perception and Reasoning: Token Reweighting for RLVR in Multimodal LLMs <2026-03-26>
Jinda Lu, Junkang Wu, Jinghan Li, Kexin Huang, Shuo Yang, Guoyin Wang, Jiancan Wu, Xiang Wang, Xiangnan He. [Paper] - Prune as You Generate: Online Rollout Pruning for Faster and Better RLVR <2026-03-25>
Haobo Xu, Sirui Chen, Ruizhong Qiu, Yuchen Yan, Chen Luo, Monica Cheng, Jingrui He, Hanghang Tong. [Paper] - Towards Effective Experiential Learning: Dual Guidance for Utilization and Internalization <2026-03-25>
Fei Bai, Zhipeng Chen, Chuan Hao, Ming Yang, Ran Tao, Bryan Dai, Wayne Xin Zhao, Jian Yang, Hongteng Xu. [Paper] - Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought <2026-03-24>
Yunheng Li, Hangyi Kuang, Hengrui Zhang, Jiangxia Cao, Zhaojie Liu, Qibin Hou, Ming-Ming Cheng. [Paper] - Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMs <2026-03-23>
Haoming Meng, Kexin Huang, Shaohang Wei, Chiyu Ma, Shuo Yang, Xue Wang, Guoyin Wang, Bolin Ding, Jingren Zhou. [Paper] - CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation <2026-03-23>
Max Fu, Justin Yu, Karim El-Refai, Ethan Kou, Haoru Xue, Huang Huang, Wenli Xiao, Guanzhi Wang, Fei-Fei Li, Guanya Shi, Jiajun Wu, Shankar Sastry, Yuke Zhu, Ken Goldberg, Linxi "Jim" Fan. [Paper] - SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation <2026-03-23>
Sashuai Zhou, Qiang Zhou, Junpeng Ma, Yue Cao, Ruofan Hu, Ziang Zhang, Xiaoda Yang, Zhibin Wang, Jun Song, Cheng Yu, Bo Zheng, Zhou Zhao. [Paper] - Agnostics: Learning to Code in Any Programming Language via Reinforcement with a Universal Learning Environment <2026-03-23>
Aleksander Boruch-Gruszecki, Yangtian Zi, Zixuan Wu, Tejas Oberoi, Carolyn Jane Anderson, Joydeep Biswas, Arjun Guha. [Paper] - On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation <2026-03-23>
Kexin Huang, Haoming Meng, Junkang Wu, Jinda Lu, Chiyu Ma, Ziqian Chen, Xue Wang, Bolin Ding, Jiancan Wu, Xiang Wang, Xiangnan He, Guoyin Wang, Jingren Zhou. [Paper] - Native Reasoning Models: Training Language Models to Reason on Unverifiable Data <2026-03-23>
Yuanfu Wang, Zhixuan Liu, Xiangtian Li, Chaochao Lu, Chao Yang. [Paper] - Learning to Reason without External Rewards <2026-03-23>
Xuandong Zhao, Zhewei Kang, Aosong Feng, Sergey Levine, Dawn Song. [Paper] - Prompt replay: speeding up grpo with on-policy reuse of high-signal prompts <2026-03-22>
Andrei Baroian, Rutger Berger. [Paper] - WIST: Web-Grounded Iterative Self-Play Tree for Domain-Targeted Reasoning Improvement <2026-03-22>
Fangyuan Li, Pengfei Li, Shijie Wang, Junqi Gao, Jianxing Liu, Biqing Qi, Yuqiang Li. [Paper] - Advantage Shaping as Surrogate Reward Maximization: Unifying Pass@K Policy Gradients <2026-03-21>
Christos Thrampoulidis, Sadegh Mahdavi, Wenlong Deng. [Paper] - RLVR Training of LLMs Does Not Improve Thinking Ability for General QA: Evaluation Method and a Simple Solution <2026-03-21>
Kaiyuan Li, Jing-Cheng Pang, Yang Yu. [Paper] - Grounded Chess Reasoning in Language Models via Master Distillation <2026-03-20>
Zhenwei Tang, Qianfeng Wen, Seth Grief-Albert, Yahya Elgabra, Blair Yang, Honghua Dong, Ashton Anderson. [Paper] - Think and Answer ME: Benchmarking and Exploring Multi-Entity Reasoning Grounding in Remote Sensing <2026-03-20>
Shuchang Lyu, Haiquan Wen, Guangliang Cheng, Meng Li, Zheng Zhou, You Zhou, Dingding Yao, Zhenwei Shi. [Paper] - ReLaX: Reasoning with Latent Exploration for Large Reasoning Models <2026-03-20>
Shimin Zhang, Xianwei Chen, Yufan Shen, Ziyuan Ye, Jibin Wu. [Paper] - Beyond Where to Look: Trajectory-Guided Reinforcement Learning for Multimodal RLVR <2026-03-27>
Jinda Lu, Junkang Wu, Jinghan Li, Kexin Huang, Shuo Yang, Mingzhu Chen, Jiancan Wu, Kuien Liu, Xiang Wang. [Paper] - Nemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning Models <2026-03-27>
Boxin Wang, Chankyu Lee, Nayeon Lee, Sheng-Chieh Lin, Wenliang Dai, Yang Chen, Yangyi Chen, Zhuolin Yang, Zihan Liu, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping. [Paper] - Do Language Models Follow Occam's Razor? An Evaluation of Parsimony in Inductive and Abductive Reasoning <2026-03-26>
Yunxin Sun, Abulhair Saparov. [Paper] - P^2O: Joint Policy and Prompt Optimization <2026-03-26>
Xinyu Lu, Kaiqi Zhang, Jinglin Yang, Boxi Cao, Yaojie Lu, Hongyu Lin, Min He, Xianpei Han, Le Sun. [Paper] - TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs <2026-03-26>
Jun Zhang, Teng Wang, Yuying Ge, Yixiao Ge, Xinhao Li, Ying Shan, Limin Wang. [Paper] - MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning <2026-03-26>
Chenglong Wang, Yifu Huo, Yang Gan, Qiaozhi He, Qi Meng, Bei Li, Yan Wang, Junfu Liu, Tianhua Zhou, Jingbo Zhu, Tong Xiao. [Paper] - Bridging Perception and Reasoning: Token Reweighting for RLVR in Multimodal LLMs <2026-03-26>
Jinda Lu, Junkang Wu, Jinghan Li, Kexin Huang, Shuo Yang, Guoyin Wang, Jiancan Wu, Xiang Wang, Xiangnan He. [Paper] - Prune as You Generate: Online Rollout Pruning for Faster and Better RLVR <2026-03-25>
Haobo Xu, Sirui Chen, Ruizhong Qiu, Yuchen Yan, Chen Luo, Monica Cheng, Jingrui He, Hanghang Tong. [Paper] - Towards Effective Experiential Learning: Dual Guidance for Utilization and Internalization <2026-03-25>
Fei Bai, Zhipeng Chen, Chuan Hao, Ming Yang, Ran Tao, Bryan Dai, Wayne Xin Zhao, Jian Yang, Hongteng Xu. [Paper] - Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought <2026-03-24>
Yunheng Li, Hangyi Kuang, Hengrui Zhang, Jiangxia Cao, Zhaojie Liu, Qibin Hou, Ming-Ming Cheng. [Paper] - Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMs <2026-03-23>
Haoming Meng, Kexin Huang, Shaohang Wei, Chiyu Ma, Shuo Yang, Xue Wang, Guoyin Wang, Bolin Ding, Jingren Zhou. [Paper] - CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation <2026-03-23>
Max Fu, Justin Yu, Karim El-Refai, Ethan Kou, Haoru Xue, Huang Huang, Wenli Xiao, Guanzhi Wang, Fei-Fei Li, Guanya Shi, Jiajun Wu, Shankar Sastry, Yuke Zhu, Ken Goldberg, Linxi "Jim" Fan. [Paper] - SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation <2026-03-23>
Sashuai Zhou, Qiang Zhou, Junpeng Ma, Yue Cao, Ruofan Hu, Ziang Zhang, Xiaoda Yang, Zhibin Wang, Jun Song, Cheng Yu, Bo Zheng, Zhou Zhao. [Paper] - Agnostics: Learning to Code in Any Programming Language via Reinforcement with a Universal Learning Environment <2026-03-23>
Aleksander Boruch-Gruszecki, Yangtian Zi, Zixuan Wu, Tejas Oberoi, Carolyn Jane Anderson, Joydeep Biswas, Arjun Guha. [Paper] - On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation <2026-03-23>
Kexin Huang, Haoming Meng, Junkang Wu, Jinda Lu, Chiyu Ma, Ziqian Chen, Xue Wang, Bolin Ding, Jiancan Wu, Xiang Wang, Xiangnan He, Guoyin Wang, Jingren Zhou. [Paper] - Native Reasoning Models: Training Language Models to Reason on Unverifiable Data <2026-03-23>
Yuanfu Wang, Zhixuan Liu, Xiangtian Li, Chaochao Lu, Chao Yang. [Paper] - Learning to Reason without External Rewards <2026-03-23>
Xuandong Zhao, Zhewei Kang, Aosong Feng, Sergey Levine, Dawn Song. [Paper] - Prompt replay: speeding up grpo with on-policy reuse of high-signal prompts <2026-03-22>
Andrei Baroian, Rutger Berger. [Paper] - WIST: Web-Grounded Iterative Self-Play Tree for Domain-Targeted Reasoning Improvement <2026-03-22>
Fangyuan Li, Pengfei Li, Shijie Wang, Junqi Gao, Jianxing Liu, Biqing Qi, Yuqiang Li. [Paper] - Advantage Shaping as Surrogate Reward Maximization: Unifying Pass@K Policy Gradients <2026-03-21>
Christos Thrampoulidis, Sadegh Mahdavi, Wenlong Deng. [Paper] - RLVR Training of LLMs Does Not Improve Thinking Ability for General QA: Evaluation Method and a Simple Solution <2026-03-21>
Kaiyuan Li, Jing-Cheng Pang, Yang Yu. [Paper] - Grounded Chess Reasoning in Language Models via Master Distillation <2026-03-20>
Zhenwei Tang, Qianfeng Wen, Seth Grief-Albert, Yahya Elgabra, Blair Yang, Honghua Dong, Ashton Anderson. [Paper] - ReViSQL: Achieving Human-Level Text-to-SQL <2026-03-20>
Yuxuan Zhu, Tengjun Jin, Yoojin Choi, Daniel Kang. [Paper] - Think and Answer ME: Benchmarking and Exploring Multi-Entity Reasoning Grounding in Remote Sensing <2026-03-20>
Shuchang Lyu, Haiquan Wen, Guangliang Cheng, Meng Li, Zheng Zhou, You Zhou, Dingding Yao, Zhenwei Shi. [Paper] - ReLaX: Reasoning with Latent Exploration for Large Reasoning Models <2026-03-20>
Shimin Zhang, Xianwei Chen, Yufan Shen, Ziyuan Ye, Jibin Wu. [Paper] - VEPO: Variable Entropy Policy Optimization for Low-Resource Language Foundation Models <2026-03-19>
Chonghan Liu, Yimin Du, Qi An, Xin He, Cunqi Zhai, Fei Tan, Weijia Lin, Xiaochun Gong, Yongchao Deng, Shousheng Jia, Xiangzheng Zhang. [Paper] - How Uncertainty Estimation Scales with Sampling in Reasoning Models <2026-03-19>
Maksym Del, Markus Kängsepp, Marharyta Domnich, Ardi Tampuu, Lisa Yankovskaya, Meelis Kull, Mark Fishel. [Paper] - Context Bootstrapped Reinforcement Learning <2026-03-19>
Saaket Agashe, Jayanth Srinivasa, Gaowen Liu, Ramana Kompella, Xin Eric Wang. [Paper] - HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning <2026-03-19>
Shenzhi Wang, Shixuan Liu, Jing Zhou, Chang Gao, Xiong-Hui Chen, Binghai Wang, An Yang, Shiji Song, Bowen Yu, Gao Huang, Junyang Lin. [Paper] - Discounted Beta--Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards <2026-03-19>
Haechan Kim, Soohyun Ryu, Gyouk Chu, Doohyuk Jang, Eunho Yang. [Paper] - ARISE: Agent Reasoning with Intrinsic Skill Evolution in Hierarchical Reinforcement Learning <2026-03-18>
Yu Li, Rui Miao, Zhengling Qi, Tian Lan. [Paper] - Post-Training Local LLM Agents for Linux Privilege Escalation with Verifiable Rewards <2026-03-18>
Philipp Normann, Andreas Happe, Jürgen Cito, Daniel Arp. [Paper] - Gym-V: A Unified Vision Environment System for Agentic Vision Research <2026-03-17>
Fanqing Meng, Lingxiao Du, Jiawei Gu, Jiaqi Liao, Linjie Li, Zijian Wu, Xiangyan Liu, Ziqi Zhao, Mengkang Hu, Yue Zhang, Zichen Liu, Jiaheng Zhang, Michael Qizhe Shieh. [Paper] - Aletheia: What Makes RLVR For Code Verifiers Tick? <2026-03-17>
Vatsal Venkatkrishna, Indraneil Paul, Iryna Gurevych. [Paper] - Masked Auto-Regressive Variational Acceleration: Fast Inference Makes Practical Reinforcement Learning <2026-03-17>
Yuxuan Gu, Weimin Bai, Yifei Wang, Weijian Luo, He Sun. [Paper] - Dual Consensus: Escaping from Spurious Majority in Unsupervised RLVR via Two-Stage Vote Mechanism <2026-03-17>
Kaixuan Du, Meng Cao, Hang Zhang, Yukun Wang, Xiangzhou Huang, Ni Li. [Paper] - Offline Exploration-Aware Fine-Tuning for Long-Chain Mathematical Reasoning <2026-03-17>
Yongyu Mu, Jiali Zeng, Fandong Meng, JingBo Zhu, Tong Xiao. [Paper] - SAGE: Multi-Agent Self-Evolution for LLM Reasoning <2026-03-17>
Yulin Peng, Xinxin Zhu, Chenxing Wei, Nianbo Zeng, Leilei Wang, Ying Tiffany He, F. Richard Yu. [Paper] - Molecular Identifier Visual Prompt and Verifiable Reinforcement Learning for Chemical Reaction Diagram Parsing <2026-03-17>
Jiahe Song, Chuang Wang, Yinfan Wang, Hao Zheng, Rui Nie, Bowen Jiang, Xingjian Wei, Junyuan Gao, Yubin Wang, Bin Wang, Lijun Wu, Jiang Wu, Qian Yu, Conghui He. [Paper] - Execution-Grounded Credit Assignment for GRPO in Code Generation <2026-03-17>
Abhijit Kumar, Natalya Kumar, Shikhar Gupta. [Paper] - DyJR: Preserving Diversity in Reinforcement Learning with Verifiable Rewards via Dynamic Jensen-Shannon Replay <2026-03-17>
Long Li, Zhijian Zhou, Tianyi Wang, Weidi Xu, Zuming Huang, Wei Chu, Zhe Wang, Shirui Pan, Chao Qu, Yuan Qi. [Paper] - Noisy Data is Destructive to Reinforcement Learning with Verifiable Rewards <2026-03-17>
Yuxuan Zhu, Daniel Kang. [Paper] - Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement Learning <2026-03-16>
Aozhe Wang, Yuchen Yan, Nan Zhou, Zhengxi Lu, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen. [Paper] - Matching Features, Not Tokens: Energy-Based Fine-Tuning of Language Models <2026-03-16>
Samy Jelassi, Mujin Kwun, Rosie Zhao, Yuanzhi Li, Nicolo Fusi, Yilun Du, Sham M. Kakade, Carles Domingo-Enrich. [Paper] - Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning <2026-03-16>
Xu Wan, Yansheng Wang, Wenqi Huang, Mingyang Sun. [Paper] - Overthinking Reduction with Decoupled Rewards and Curriculum Data Scheduling <2026-03-16>
Shuyang Jiang, Yusheng Liao, Ya Zhang, Yanfeng Wang, Yu Wang. [Paper] - VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting <2026-03-15>
Daeun Lee, Shoubin Yu, Yue Zhang, Mohit Bansal. [Paper] - Nemotron-CrossThink: Scaling Self-Learning beyond Math Reasoning <2026-03-15>
Syeda Nahida Akter, Shrimai Prabhumoye, Matvei Novikov, Seungju Han, Ying Lin, Evelina Bakhturina, Eric Nyberg, Yejin Choi, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro. [Paper] - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning <2026-03-15>
Yongxin Wang, Zhicheng Yang, Meng Cao, Mingfei Han, Haokun Lin, Yingying Zhu, Xiaojun Chang, Xiaodan Liang. [Paper] - An Industrial-Scale Insurance LLM Achieving Verifiable Domain Mastery and Hallucination Control without Competence Trade-offs <2026-03-15>
Qian Zhu, Xinnan Guo, Jingjing Huo, Jun Li, Pan Liu, Wenyan Yang, Wanqing Xu, Xuan Lin. [Paper] - ReViSQL: Achieving Human-Level Text-to-SQL <2026-03-20>
Yuxuan Zhu, Tengjun Jin, Yoojin Choi, Daniel Kang. [Paper] - Think and Answer ME: Benchmarking and Exploring Multi-Entity Reasoning Grounding in Remote Sensing <2026-03-20>
Shuchang Lyu, Haiquan Wen, Guangliang Cheng, Meng Li, Zheng Zhou, You Zhou, Dingding Yao, Zhenwei Shi. [Paper] - ReLaX: Reasoning with Latent Exploration for Large Reasoning Models <2026-03-20>
Shimin Zhang, Xianwei Chen, Yufan Shen, Ziyuan Ye, Jibin Wu. [Paper] - VEPO: Variable Entropy Policy Optimization for Low-Resource Language Foundation Models <2026-03-19>
Chonghan Liu, Yimin Du, Qi An, Xin He, Cunqi Zhai, Fei Tan, Weijia Lin, Xiaochun Gong, Yongchao Deng, Shousheng Jia, Xiangzheng Zhang. [Paper] - How Uncertainty Estimation Scales with Sampling in Reasoning Models <2026-03-19>
Maksym Del, Markus Kängsepp, Marharyta Domnich, Ardi Tampuu, Lisa Yankovskaya, Meelis Kull, Mark Fishel. [Paper] - Context Bootstrapped Reinforcement Learning <2026-03-19>
Saaket Agashe, Jayanth Srinivasa, Gaowen Liu, Ramana Kompella, Xin Eric Wang. [Paper] - HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning <2026-03-19>
Shenzhi Wang, Shixuan Liu, Jing Zhou, Chang Gao, Xiong-Hui Chen, Binghai Wang, An Yang, Shiji Song, Bowen Yu, Gao Huang, Junyang Lin. [Paper] - Discounted Beta--Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards <2026-03-19>
Haechan Kim, Soohyun Ryu, Gyouk Chu, Doohyuk Jang, Eunho Yang. [Paper] - ARISE: Agent Reasoning with Intrinsic Skill Evolution in Hierarchical Reinforcement Learning <2026-03-18>
Yu Li, Rui Miao, Zhengling Qi, Tian Lan. [Paper] - Post-Training Local LLM Agents for Linux Privilege Escalation with Verifiable Rewards <2026-03-18>
Philipp Normann, Andreas Happe, Jürgen Cito, Daniel Arp. [Paper] - Gym-V: A Unified Vision Environment System for Agentic Vision Research <2026-03-17>
Fanqing Meng, Lingxiao Du, Jiawei Gu, Jiaqi Liao, Linjie Li, Zijian Wu, Xiangyan Liu, Ziqi Zhao, Mengkang Hu, Yue Zhang, Zichen Liu, Jiaheng Zhang, Michael Qizhe Shieh. [Paper] - Aletheia: What Makes RLVR For Code Verifiers Tick? <2026-03-17>
Vatsal Venkatkrishna, Indraneil Paul, Iryna Gurevych. [Paper] - Masked Auto-Regressive Variational Acceleration: Fast Inference Makes Practical Reinforcement Learning <2026-03-17>
Yuxuan Gu, Weimin Bai, Yifei Wang, Weijian Luo, He Sun. [Paper] - Dual Consensus: Escaping from Spurious Majority in Unsupervised RLVR via Two-Stage Vote Mechanism <2026-03-17>
Kaixuan Du, Meng Cao, Hang Zhang, Yukun Wang, Xiangzhou Huang, Ni Li. [Paper] - Offline Exploration-Aware Fine-Tuning for Long-Chain Mathematical Reasoning <2026-03-17>
Yongyu Mu, Jiali Zeng, Fandong Meng, JingBo Zhu, Tong Xiao. [Paper] - SAGE: Multi-Agent Self-Evolution for LLM Reasoning <2026-03-17>
Yulin Peng, Xinxin Zhu, Chenxing Wei, Nianbo Zeng, Leilei Wang, Ying Tiffany He, F. Richard Yu. [Paper] - Molecular Identifier Visual Prompt and Verifiable Reinforcement Learning for Chemical Reaction Diagram Parsing <2026-03-17>
Jiahe Song, Chuang Wang, Yinfan Wang, Hao Zheng, Rui Nie, Bowen Jiang, Xingjian Wei, Junyuan Gao, Yubin Wang, Bin Wang, Lijun Wu, Jiang Wu, Qian Yu, Conghui He. [Paper] - Execution-Grounded Credit Assignment for GRPO in Code Generation <2026-03-17>
Abhijit Kumar, Natalya Kumar, Shikhar Gupta. [Paper] - DyJR: Preserving Diversity in Reinforcement Learning with Verifiable Rewards via Dynamic Jensen-Shannon Replay <2026-03-17>
Long Li, Zhijian Zhou, Tianyi Wang, Weidi Xu, Zuming Huang, Wei Chu, Zhe Wang, Shirui Pan, Chao Qu, Yuan Qi. [Paper] - Noisy Data is Destructive to Reinforcement Learning with Verifiable Rewards <2026-03-17>
Yuxuan Zhu, Daniel Kang. [Paper] - Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement Learning <2026-03-16>
Aozhe Wang, Yuchen Yan, Nan Zhou, Zhengxi Lu, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen. [Paper] - Matching Features, Not Tokens: Energy-Based Fine-Tuning of Language Models <2026-03-16>
Samy Jelassi, Mujin Kwun, Rosie Zhao, Yuanzhi Li, Nicolo Fusi, Yilun Du, Sham M. Kakade, Carles Domingo-Enrich. [Paper] - Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning <2026-03-16>
Xu Wan, Yansheng Wang, Wenqi Huang, Mingyang Sun. [Paper] - Overthinking Reduction with Decoupled Rewards and Curriculum Data Scheduling <2026-03-16>
Shuyang Jiang, Yusheng Liao, Ya Zhang, Yanfeng Wang, Yu Wang. [Paper] - VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting <2026-03-15>
Daeun Lee, Shoubin Yu, Yue Zhang, Mohit Bansal. [Paper] - Nemotron-CrossThink: Scaling Self-Learning beyond Math Reasoning <2026-03-15>
Syeda Nahida Akter, Shrimai Prabhumoye, Matvei Novikov, Seungju Han, Ying Lin, Evelina Bakhturina, Eric Nyberg, Yejin Choi, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro. [Paper] - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning <2026-03-15>
Yongxin Wang, Zhicheng Yang, Meng Cao, Mingfei Han, Haokun Lin, Yingying Zhu, Xiaojun Chang, Xiaodan Liang. [Paper] - An Industrial-Scale Insurance LLM Achieving Verifiable Domain Mastery and Hallucination Control without Competence Trade-offs <2026-03-15>
Qian Zhu, Xinnan Guo, Jingjing Huo, Jun Li, Pan Liu, Wenyan Yang, Wanqing Xu, Xuan Lin. [Paper] - Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models <2026-03-15>
Zizhuo Zhang, Jianing Zhu, Xinmu Ge, Zihua Zhao, Zhanke Zhou, Xuan Li, Xiao Feng, Jiangchao Yao, Bo Han. [Paper] - From to : Taming Divergence in Soft Clipping via Bilateral Decoupled Decay of Probability Gradient Weight <2026-03-15>
Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Chaowen Hu, Cong Qin, Zekai Shao, Binbin Zheng, Lu Pan, Ke Zeng. [Paper] - Eliciting Chain-of-Thought Reasoning for Time Series Analysis using Reinforcement Learning <2026-03-14>
Felix Parker, Nimeesha Chan, Chi Zhang, Kimia Ghobadi. [Paper] - PuzzleCraft: Exploration-Aware Curriculum Learning for Puzzle-Based RLVR in VLMs <2026-03-13>
Ahmadreza Jeddi, Hakki Can Karaimer, Hue Nguyen, Zhongling Wang, Ke Zhao, Javad Rajabi, Ran Zhang, Raghav Goyal, Konstantinos G. Derpanis, Babak Taati, Radek Grzeszczuk. [Paper] - Thinking in Streaming Video <2026-03-13>
Zikang Liu, Longteng Guo, Handong Li, Ru Zhen, Xingjian He, Ruyi Ji, Xiaoming Ren, Yanhao Zhang, Haonan Lu, Jing Liu. [Paper] - SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models <2026-03-13>
Ziyi Yang, Weizhou Shen, Chenliang Li, Ruijun Chen, Fanqi Wan, Ming Yan, Xiaojun Quan, Fei Huang. [Paper] - Test-time RL alignment exposes task familiarity artifacts in LLM benchmarks <2026-03-13>
Kun Wang, Reinhard Heckel. [Paper] - Rethinking Multiple-Choice Questions for RLVR: Unlocking Potential via Distractor Design <2026-03-13>
Xu Guo, Qiming Ge, Jian Tong, Kedi Chen, Jin Zhang, Xiaogui Yang, Xuan Gao, Haijun Lv, Zhihui Lu, Yicheng Zou, Qipeng Guo. [Paper] - mAceReason-Math: A Dataset of High-Quality Multilingual Math Problems Ready For RLVR <2026-03-13>
Konstantin Dobler, Simon Lehnerer, Federico Scozzafava, Jonathan Janke, Mohamed Ali. [Paper] - EvolveCoder: Evolving Test Cases via Adversarial Verification for Code Reinforcement Learning <2026-03-13>
Chi Ruan, Dongfu Jiang, Huaye Zeng, Ping Nie, Wenhu Chen. [Paper] - MedEyes: Learning Dynamic Visual Focus for Medical Progressive Diagnosis <2026-03-12>
Chunzheng Zhu, Yangfang Lin, Shen Chen, Yijun Wang, Jianxin Lin. [Paper] - Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning <2026-03-12>
Zhuoxu Huang, Mengxi Jia, Hao Sun, Xuelong Li, Jungong Han. [Paper] - Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings <2026-03-11>
Yuning Wu, Ke Wang, Devin Chen, Kai Wei. [Paper] - MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images <2026-03-11>
Ankan Deria, Komal Kumar, Adinath Madhavrao Dukre, Eran Segal, Salman Khan, Imran Razzak. [Paper] - DeReason: A Difficulty-Aware Curriculum Improves Decoupled SFT-then-RL Training for General Reasoning <2026-03-11>
Hanxu Hu, Yuxuan Wang, Maggie Huan, Jannis Vamvas, Yinya Huang, Zhijiang Guo, Rico Sennrich. [Paper] - : Generalist Value Model as a Prior for Sparse RL Rollouts <2026-03-11>
Yi-Kai Zhang, Yueqing Sun, Hongyan Hao, Qi Gu, Xunliang Cai, De-Chuan Zhan, Han-Jia Ye. [Paper] - Multilingual Reasoning Gym: Multilingual Scaling of Procedural Reasoning Environments <2026-03-11>
Konstantin Dobler, Simon Lehnerer, Federico Scozzafava, Jonathan Janke, Mohamed Ali. [Paper] - To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models <2026-03-11>
Haoqing Wang, Xiang Long, Ziheng Li, Yilong Xu, Tingguang Li, Yehui Tang. [Paper] - CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework <2026-03-11>
Yuexi Du, Jinglu Wang, Shujie Liu, Nicha C. Dvornek, Yan Lu. [Paper] - Reinforcement Learning with Conditional Expectation Reward <2026-03-11>
Changyi Xiao, Caijun Xu, Yixin Cao. [Paper] - Does LLM Alignment Really Need Diversity? An Empirical Study of Adapting RLVR Methods for Moral Reasoning <2026-03-11>
Zhaowei Zhang, Xiaohan Liu, Xuekai Zhu, Junchao Huang, Ceyao Zhang, Zhiyuan Feng, Yaodong Yang, Xiaoyuan Yi, Xing Xie. [Paper] - Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learning <2026-03-11>
Zichao Li, Jie Lou, Fangchen Dong, Zhiyuan Fan, Mengjie Ren, Hongyu Lin, Xianpei Han, Debing Zhang, Le Sun, Yaojie Lu, Xing Yu. [Paper] - Thinking in Streaming Video <2026-03-13>
Zikang Liu, Longteng Guo, Handong Li, Ru Zhen, Xingjian He, Ruyi Ji, Xiaoming Ren, Yanhao Zhang, Haonan Lu, Jing Liu. [Paper] - SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models <2026-03-13>
Ziyi Yang, Weizhou Shen, Chenliang Li, Ruijun Chen, Fanqi Wan, Ming Yan, Xiaojun Quan, Fei Huang. [Paper] - Test-time RL alignment exposes task familiarity artifacts in LLM benchmarks <2026-03-13>
Kun Wang, Reinhard Heckel. [Paper] - Rethinking Multiple-Choice Questions for RLVR: Unlocking Potential via Distractor Design <2026-03-13>
Xu Guo, Qiming Ge, Jian Tong, Kedi Chen, Jin Zhang, Xiaogui Yang, Xuan Gao, Haijun Lv, Zhihui Lu, Yicheng Zou, Qipeng Guo. [Paper] - mAceReason-Math: A Dataset of High-Quality Multilingual Math Problems Ready For RLVR <2026-03-13>
Konstantin Dobler, Simon Lehnerer, Federico Scozzafava, Jonathan Janke, Mohamed Ali. [Paper] - Think and Answer ME: Benchmarking and Exploring Multi-Entity Reasoning Grounding in Remote Sensing <2026-03-13>
Shuchang Lyu, Haiquan Wen, Guangliang Cheng, Meng Li, Zheng Zhou, You Zhou, Dingding Yao, Zhenwei Shi. [Paper] - EvolveCoder: Evolving Test Cases via Adversarial Verification for Code Reinforcement Learning <2026-03-13>
Chi Ruan, Dongfu Jiang, Huaye Zeng, Ping Nie, Wenhu Chen. [Paper] - Matching Features, Not Tokens: Energy-Based Fine-Tuning of Language Models <2026-03-12>
Samy Jelassi, Mujin Kwun, Rosie Zhao, Yuanzhi Li, Nicolo Fusi, Yilun Du, Sham M. Kakade, Carles Domingo-Enrich. [Paper] - MedEyes: Learning Dynamic Visual Focus for Medical Progressive Diagnosis <2026-03-12>
Chunzheng Zhu, Yangfang Lin, Shen Chen, Yijun Wang, Jianxin Lin. [Paper] - Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning <2026-03-12>
Zhuoxu Huang, Mengxi Jia, Hao Sun, Xuelong Li, Jungong Han. [Paper] - Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings <2026-03-11>
Yuning Wu, Ke Wang, Devin Chen, Kai Wei. [Paper] - MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images <2026-03-11>
Ankan Deria, Komal Kumar, Adinath Madhavrao Dukre, Eran Segal, Salman Khan, Imran Razzak. [Paper] - DeReason: A Difficulty-Aware Curriculum Improves Decoupled SFT-then-RL Training for General Reasoning <2026-03-11>
Hanxu Hu, Yuxuan Wang, Maggie Huan, Jannis Vamvas, Yinya Huang, Zhijiang Guo, Rico Sennrich. [Paper] - : Generalist Value Model as a Prior for Sparse RL Rollouts <2026-03-11>
Yi-Kai Zhang, Yueqing Sun, Hongyan Hao, Qi Gu, Xunliang Cai, De-Chuan Zhan, Han-Jia Ye. [Paper] - Multilingual Reasoning Gym: Multilingual Scaling of Procedural Reasoning Environments <2026-03-11>
Konstantin Dobler, Simon Lehnerer, Federico Scozzafava, Jonathan Janke, Mohamed Ali. [Paper] - To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models <2026-03-11>
Haoqing Wang, Xiang Long, Ziheng Li, Yilong Xu, Tingguang Li, Yehui Tang. [Paper] - CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework <2026-03-11>
Yuexi Du, Jinglu Wang, Shujie Liu, Nicha C. Dvornek, Yan Lu. [Paper] - Reinforcement Learning with Conditional Expectation Reward <2026-03-11>
Changyi Xiao, Caijun Xu, Yixin Cao. [Paper] - Does LLM Alignment Really Need Diversity? An Empirical Study of Adapting RLVR Methods for Moral Reasoning <2026-03-11>
Zhaowei Zhang, Xiaohan Liu, Xuekai Zhu, Junchao Huang, Ceyao Zhang, Zhiyuan Feng, Yaodong Yang, Xiaoyuan Yi, Xing Xie. [Paper] - Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learning <2026-03-11>
Zichao Li, Jie Lou, Fangchen Dong, Zhiyuan Fan, Mengjie Ren, Hongyu Lin, Xianpei Han, Debing Zhang, Le Sun, Yaojie Lu, Xing Yu. [Paper] - Graph-GRPO: Training Graph Flow Models with Reinforcement Learning <2026-03-11>
Baoheng Zhu, Deyu Bo, Delvin Ce Zhang, Xiao Wang. [Paper] - CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR <2026-03-10>
Sijia Cui, Pengyu Cheng, Jiajun Song, Yongbo Gai, Guojun Zhang, Zhechao Yu, Jianhe Lin, Xiaoxi Jiang, Guanjun Jiang. [Paper] - Good Reasoning Makes Good Demonstrations: Implicit Reasoning Quality Supervision via In-Context Reinforcement Learning <2026-03-10>
Tiehua Mei, Minxuan Lv, Leiyu Pan, Zhenpeng Su, Hongru Hou, Hengrui Chen, Ao Xu, Deqing Yang. [Paper] - Rewards as Labels: Revisiting RLVR from a Classification Perspective <2026-03-10>
Zepeng Zhai, Meilin Chen, Jiaxuan Zhao, Junlang Qian, Lei Shen, Yuan Lu. [Paper] - Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards <2026-03-10>
Zhengzhao Ma, Xueru Wen, Boxi Cao, Yaojie Lu, Hongyu Lin, Jinglin Yang, Min He, Xianpei Han, Le Sun. [Paper] - Bradley-Terry Policy Optimization for Generative Preference Modeling <2026-03-09>
Shengyu Feng, Yun He, Shuang Ma, Beibin Li, Yuanhao Xiong, Songlin Li, Karishma Mandyam, Julian Katz-Samuels, Shengjie Bi, Licheng Yu, Hejia Zhang, Karthik Abinav Sankararaman, Han Fang, Yiming Yang, Manaal Faruqui. [Paper] - How Far Can Unsupervised RLVR Scale LLM Training? <2026-03-09>
Bingxiang He, Yuxin Zuo, Zeyuan Liu, Shangziqi Zhao, Zixuan Fu, Junlin Yang, Cheng Qian, Kaiyan Zhang, Yuchen Fan, Ganqu Cui, Xiusi Chen, Youbang Sun, Xingtai Lv, Xuekai Zhu, Li Sheng, Ran Li, Huan-ang Gao, Yuchen Zhang, Bowen Zhou, Zhiyuan Liu, Ning Ding. [Paper] - Adaptation of Agentic AI: A Survey of Post-Training, Memory, and Skills <2026-03-09>
Pengcheng Jiang, Jiacheng Lin, Zhiyi Shi, Zifeng Wang, Luxi He, Yichen Wu, Ming Zhong, Peiyang Song, Qizheng Zhang, Heng Wang, Xueqiang Xu, Hanwen Xu, Pengrui Han, Dylan Zhang, Jiashuo Sun, Chaoqi Yang, Kun Qian, Tian Wang, Changran Hu, Manling Li, Quanzheng Li, Hao Peng, Sheng Wang, Jingbo Shang, Chao Zhang, Jiaxuan You, Liyuan Liu, Pan Lu, Yu Zhang, Heng Ji, Yejin Choi, Dawn Song, Jimeng Sun, Jiawei Han. [Paper] - Thickening-to-Thinning: Reward Shaping via Human-Inspired Learning Dynamics for LLM Reasoning <2026-03-09>
Wenze Lin, Zhen Yang, Xitai Jiang, Pony Ma, Gao Huang. [Paper] - A Simple "Motivation" Can Enhance Reinforcement Finetuning of Large Reasoning Models <2026-03-09>
Junjie Zhang, Guozheng Ma, Shunyu Liu, Haoyu Wang, Jiaxing Huang, Ting-En Lin, Fei Huang, Yongbin Li, Dacheng Tao. [Paper] - SWE-Fuse: Empowering Software Agents via Issue-free Trajectory Learning and Entropy-aware RLVR Training <2026-03-09>
Xin-Cheng Wen, Binbin Chen, Haoxuan Lan, Hang Yu, Peng Di, Cuiyun Gao. [Paper] - SynPlanResearch-R1: Encouraging Tool Exploration for Deep Research with Synthetic Plans <2026-03-09>
Hansi Zeng, Zoey Li, Yifan Gao, Chenwei Zhang, Xiaoman Pan, Tao Yang, Fengran Mo, Jiacheng Lin, Xian Li, Jingbo Shang. [Paper] - : Unlocking LLM Reasoning via Reinforcement Learning with Re-solving <2026-03-07>
Pinzheng Wang, Shuli Xu, Juntao Li, Yu Luo, Dong Li, Jianye Hao, Min Zhang. [Paper] - Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR <2026-03-07>
Muhammad Khalifa, Zohaib Khan, Omer Tafveez, Hao Peng, Lu Wang. [Paper] - Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards <2026-03-07>
Xin Zhang, Xingyu Li, Rongguang Wang, Ruizhong Miao, Zheng Wang, Dan Roth, Chenyang Li. [Paper] - From Entropy to Calibrated Uncertainty: Training Language Models to Reason About Uncertainty <2026-03-06>
Azza Jenane, Nassim Walha, Lukas Kuhn, Florian Buettner. [Paper] - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal <2026-03-06>
Yongxin Wang, Zhicheng Yang, Meng Cao, Mingfei Han, Haokun Lin, Yingying Zhu, Xiaojun Chang, Xiaodan Liang. [Paper] - IntelliAsk: Learning to Ask High-Quality Research Questions via RLVR <2026-03-06>
Karun Sharma, Vidushee Vats, Shengzhi Li, Yuxiang Wang, Zhongtian Sun, Prayag Tiwari. [Paper] - RM-R1: Reward Modeling as Reasoning <2026-03-06>
Xiusi Chen, Gaotang Li, Ziqi Wang, Bowen Jin, Cheng Qian, Yu Wang, Hongru Wang, Yu Zhang, Denghui Zhang, Tong Zhang, Hanghang Tong, Heng Ji. [Paper] - Reference-guided Policy Optimization for Molecular Optimization via LLM Reasoning <2026-03-06>
Xuan Li, Zhanke Zhou, Zongze Li, Jiangchao Yao, Yu Rong, Lu Zhang, Bo Han. [Paper] - When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virtual Try-On <2026-03-05>
Wisdom Ikezogwo, Mehmet Saygin Seyfioglu, Ranjay Krishna, Karim Bouyarmane. [Paper] - 3D-RFT: Reinforcement Fine-Tuning for Video-based 3D Scene Understanding <2026-03-05>
Xiongkun Linghu, Jiangyong Huang, Baoxiong Jia, Siyuan Huang. [Paper] - Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards <2026-03-05>
Hieu Trung Nguyen, Bao Nguyen, Wenao Ma, Yuzhi Zhao, Ruifeng She, Viet Anh Nguyen. [Paper] - CoRPO: Adding a Correctness Bias to GRPO Improves Generalization <2026-03-04>
Anisha Garg, Claire Zhang, Nishit Neema, David Bick, Ganesh Venkatesh, Joel Hestness. [Paper] - SPEED-RL: Faster Training of Reasoning Models via Online Curriculum Learning <2026-03-04>
Ruiqi Zhang, Daman Arora, Song Mei, Andrea Zanette. [Paper] - Generalization of RLVR Using Causal Reasoning as a Testbed <2026-03-04>
Brian Lu, Hongyu Zhao, Shuo Sun, Hao Peng, Rui Ding, Hongyuan Mei. [Paper] - BeamPERL: Parameter-Efficient RL with Verifiable Rewards Specializes Compact LLMs for Structured Beam Mechanics Reasoning <2026-03-04>
Tarjei Paule Hage, Markus J. Buehler. [Paper] - SHE: Stepwise Hybrid Examination Reinforcement Learning Framework for E-commerce Search Relevance <2026-03-04>
Pengkun Jiao, Yiming Jin, Jianhui Yang, Chenhe Dong, Zerui Huang, Shaowei Yao, Xiaojiang Zhou, Dan Ou, Haihong Tang. [Paper] - Vision-Zero: Scalable VLM Self-Improvement via Strategic Gamified Self-Play <2026-03-04>
Qinsi Wang, Bo Liu, Tianyi Zhou, Jing Shi, Yueqian Lin, Yiran Chen, Hai Helen Li, Kun Wan, Wentian Zhao. [Paper] - Beyond Accuracy: Evaluating Visual Grounding In Multimodal Medical Reasoning <2026-03-03>
Anas Zafar, Leema Krishna Murali, Ashish Vashist. [Paper] - From Entropy to Calibrated Uncertainty: Training Language Models to Reason About Uncertainty <2026-03-06>
Azza Jenane, Nassim Walha, Lukas Kuhn, Florian Buettner. [Paper] - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal <2026-03-06>
Yongxin Wang, Zhicheng Yang, Meng Cao, Mingfei Han, Haokun Lin, Yingying Zhu, Xiaojun Chang, Xiaodan Liang. [Paper] - IntelliAsk: Learning to Ask High-Quality Research Questions via RLVR <2026-03-06>
Karun Sharma, Vidushee Vats, Shengzhi Li, Yuxiang Wang, Zhongtian Sun, Prayag Tiwari. [Paper] - RM-R1: Reward Modeling as Reasoning <2026-03-06>
Xiusi Chen, Gaotang Li, Ziqi Wang, Bowen Jin, Cheng Qian, Yu Wang, Hongru Wang, Yu Zhang, Denghui Zhang, Tong Zhang, Hanghang Tong, Heng Ji. [Paper] - Reference-guided Policy Optimization for Molecular Optimization via LLM Reasoning <2026-03-06>
Xuan Li, Zhanke Zhou, Zongze Li, Jiangchao Yao, Yu Rong, Lu Zhang, Bo Han. [Paper] - When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virtual Try-On <2026-03-05>
Wisdom Ikezogwo, Mehmet Saygin Seyfioglu, Ranjay Krishna, Karim Bouyarmane. [Paper] - 3D-RFT: Reinforcement Fine-Tuning for Video-based 3D Scene Understanding <2026-03-05>
Xiongkun Linghu, Jiangyong Huang, Baoxiong Jia, Siyuan Huang. [Paper] - Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards <2026-03-05>
Hieu Trung Nguyen, Bao Nguyen, Wenao Ma, Yuzhi Zhao, Ruifeng She, Viet Anh Nguyen. [Paper] - CoRPO: Adding a Correctness Bias to GRPO Improves Generalization <2026-03-04>
Anisha Garg, Claire Zhang, Nishit Neema, David Bick, Ganesh Venkatesh, Joel Hestness. [Paper] - SPEED-RL: Faster Training of Reasoning Models via Online Curriculum Learning <2026-03-04>
Ruiqi Zhang, Daman Arora, Song Mei, Andrea Zanette. [Paper] - Generalization of RLVR Using Causal Reasoning as a Testbed <2026-03-04>
Brian Lu, Hongyu Zhao, Shuo Sun, Hao Peng, Rui Ding, Hongyuan Mei. [Paper] - BeamPERL: Parameter-Efficient RL with Verifiable Rewards Specializes Compact LLMs for Structured Beam Mechanics Reasoning <2026-03-04>
Tarjei Paule Hage, Markus J. Buehler. [Paper] - SHE: Stepwise Hybrid Examination Reinforcement Learning Framework for E-commerce Search Relevance <2026-03-04>
Pengkun Jiao, Yiming Jin, Jianhui Yang, Chenhe Dong, Zerui Huang, Shaowei Yao, Xiaojiang Zhou, Dan Ou, Haihong Tang. [Paper] - Vision-Zero: Scalable VLM Self-Improvement via Strategic Gamified Self-Play <2026-03-04>
Qinsi Wang, Bo Liu, Tianyi Zhou, Jing Shi, Yueqian Lin, Yiran Chen, Hai Helen Li, Kun Wan, Wentian Zhao. [Paper] - Rewards as Labels: Revisiting RLVR from a Classification Perspective <2026-03-04>
Zepeng Zhai, Meilin Chen, Jiaxuan Zhao, Junlang Qian, Lei Shen, Yuan Lu. [Paper] - Beyond Accuracy: Evaluating Visual Grounding In Multimodal Medical Reasoning <2026-03-03>
Anas Zafar, Leema Krishna Murali, Ashish Vashist. [Paper] - RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning <2026-03-03>
Yukun Chen, Jiaming Li, Longze Chen, Ze Gong, Jingpeng Li, Zhen Qin, Hengyu Chang, Ancheng Xu, Zhihao Yang, Hamid Alinejad-Rokny, Qiang Qu, Bo Zheng, Min Yang. [Paper] - The Choice of Divergence: A Neglected Key to Mitigating Diversity Collapse in Reinforcement Learning with Verifiable Reward <2026-03-03>
Long Li, Zhijian Zhou, Jiaran Hao, Jason Klein Liu, Yanting Miao, Wei Pang, Xiaoyu Tan, Wei Chu, Zhe Wang, Shirui Pan, Chao Qu, Yuan Qi. [Paper] - Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward <2026-03-03>
Tong Xiao, Xin Xu, Zhenya Huang, Hongyu Gao, Quan Liu, Qi Liu, Enhong Chen. [Paper] - CORE: Concept-Oriented Reinforcement for Bridging the Definition-Application Gap in Mathematical Reasoning <2026-03-02>
Zijun Gao, Zhikun Xu, Xiao Ye, Ben Zhou. [Paper] - Reasoning Core: A Scalable Procedural Data Generation Suite for Symbolic Pre-training and Post-Training <2026-03-02>
Valentin Lacombe, Valentin Quesnel, Damien Sileo. [Paper] - LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards <2026-03-02>
Guanzheng Chen, Michael Qizhe Shieh, Lidong Bing. [Paper] - Efficient RLVR Training via Weighted Mutual Information Data Selection <2026-03-02>
Xinyu Zhou, Boyu Zhu, Haotian Zhang, Huiming Wang, Zhijiang Guo. [Paper] - SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement Learning <2026-03-02>
Bo Liu, Leon Guertler, Simon Yu, Zichen Liu, Penghui Qi, Daniel Balcells, Mickel Liu, Cheston Tan, Weiyan Shi, Min Lin, Wee Sun Lee, Natasha Jaques. [Paper] - Quark Medical Alignment: A Holistic Multi-Dimensional Alignment and Collaborative Optimization Paradigm <2026-03-02>
Tianxiang Xu, Jiayi Liu, Yixuan Tong, Jialu Xu, Yunqing Wei, Kaiwen Feng, PanPan Hou, Kangping Yin, Jiyuan Hu, Hao Zhou, Zhenxin Ma, Jian Xu, Guanjun Jiang. [Paper] - Spotlight on Token Perception for Multimodal Reinforcement Learning <2026-03-02>
Siyuan Huang, Xiaoye Qu, Yafu Li, Yun Luo, Zefeng He, Daizong Liu, Yu Cheng. [Paper] - CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework <2026-03-02>
Yuexi Du, Jinglu Wang, Shujie Liu, Nicha C. Dvornek, Yan Lu. [Paper] - Beyond Length Scaling: Synergizing Breadth and Depth for Generative Reward Models <2026-03-02>
Qiyuan Zhang, Yufei Wang, Tianhe Wu, Can Xu, Qingfeng Sun, Kai Zheng, Xue Liu, Chen Ma. [Paper] - LFPO: Likelihood-Free Policy Optimization for Masked Diffusion Models <2026-03-02>
Chenxing Wei, Jiazhen Kang, Hong Wang, Jianqing Zhang, Hao Jiang, Xiaolong Xu, Ningyuan Sun, Ying He, F. Richard Yu, Yao Shu, Bo Jiang. [Paper] - Document Reconstruction Unlocks Scalable Long-Context RLVR <2026-03-02>
Yao Xiao, Lei Wang, Yue Deng, Guanzheng Chen, Ziqi Jin, Jung-jae Kim, Xiaoli Li, Roy Ka-wei Lee, Lidong Bing. [Paper] - Breaking Barriers: Do Reinforcement Post Training Gains Transfer To Unseen Domains? <2026-03-02>
Chuxuan Hu, Yuxuan Zhu, Antony Kellermann, Caleb Biddulph, Suppakit Waiwitlikhit, Jason Benn, Daniel Kang. [Paper] - AnesSuite: A Comprehensive Benchmark and Dataset Suite for Anesthesiology Reasoning in LLMs <2026-03-02>
Xiang Feng, Wentao Jiang, Zengmao Wang, Yong Luo, Pingbo Xu, Baosheng Yu, Hua Jin, Jing Zhang. [Paper] - Learning to Reason without External Rewards <2026-03-02>
Xuandong Zhao, Zhewei Kang, Aosong Feng, Sergey Levine, Dawn Song. [Paper] - Diversity-Enhanced Reasoning for Subjective Questions <2026-03-01>
Yumeng Wang, Zhiyuan Fan, Jiayu Liu, Jen-tse Huang, Yi R. Fung. [Paper] - Towards Policy-Adaptive Image Guardrail: Benchmark and Method <2026-03-01>
Caiyong Piao, Zhiyuan Yan, Haoming Xu, Yunzhen Zhao, Kaiqing Lin, Feiyang Xu, Shuigeng Zhou. [Paper] - ExGRPO: Learning to Reason from Experience <2026-02-28>
Runzhe Zhan, Yafu Li, Zhi Wang, Xiaoye Qu, Dongrui Liu, Jing Shao, Derek F. Wong, Yu Cheng. [Paper] - Learning to Explore with Parameter-Space Noise: A Deep Dive into Parameter-Space Noise for Reinforcement Learning with Verifiable Rewards <2026-02-28>
Bizhe Bai, Xinyue Wang, Peng Ye, Tao Chen. [Paper] - Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning <2026-02-28>
Xichen Zhang, Sitong Wu, Yinghao Zhu, Haoru Tan, Shaozuo Yu, Ziyi He, Jiaya Jia. [Paper] - Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning <2026-02-28>
Junkang Wu, Kexin Huang, Jiancan Wu, An Zhang, Xiang Wang, Xiangnan He. [Paper] - Lookahead Tree-Based Rollouts for Enhanced Trajectory-Level Exploration in Reinforcement Learning with Verifiable Rewards <2026-02-28>
Shangyu Xing, Siyuan Wang, Chenyuan Yang, Xinyu Dai, Xiang Ren. [Paper] - Agnostics: Learning to Code in Any Programming Language via Reinforcement with a Universal Learning Environment <2026-02-28>
Aleksander Boruch-Gruszecki, Yangtian Zi, Zixuan Wu, Tejas Oberoi, Carolyn Jane Anderson, Joydeep Biswas, Arjun Guha. [Paper] - Recycling Failures: Salvaging Exploration in RLVR via Fine-Grained Off-Policy Guidance <2026-02-27>
Yanwei Ren, Haotian Zhang, Likang Xiao, Xikai Zhang, Jiaxing Huang, Jiayan Qiu, Baosheng Yu, Quan Chen, Liu Liu. [Paper] - Linking Process to Outcome: Conditional Reward Modeling for LLM Reasoning <2026-02-27>
Zheng Zhang, Ziwei Shan, Kaitao Song, Yexin Li, Kan Ren. [Paper] - Empowering Small VLMs to Think with Dynamic Memorization and Exploration <2026-02-27>
Jiazhen Liu, Yuchuan Deng, Long Chen. [Paper] - FAPO: Flawed-Aware Policy Optimization for Efficient and Reliable Reasoning <2026-02-27>
Yuyang Ding, Chi Zhang, Juntao Li, Haibin Lin, Min Zhang. [Paper] - Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning <2026-02-27>
Yihe Deng, I-Hung Hsu, Jun Yan, Zifeng Wang, Rujun Han, Gufeng Zhang, Yanfei Chen, Wei Wang, Tomas Pfister, Chen-Yu Lee. [Paper] - Know What You Know: Metacognitive Entropy Calibration for Verifiable RL Reasoning <2026-02-26>
Qiannian Zhao, Chen Yang, Jinhao Jing, Yunke Zhang, Xuhui Ren, Lu Yu, Shijie Zhang, Hongzhi Yin. [Paper] - Replacing Multi-Step Assembly of Data Preparation Pipelines with One-Step LLM Pipeline Generation for Table QA <2026-02-26>
Fengyu Li, Junhao Zhu, Kaishi Song, Lu Chen, Zhongming Yao, Tianyi Li, Christian S. Jensen. [Paper] - Enhancing Multi-Modal LLMs Reasoning via Difficulty-Aware Group Normalization <2026-02-26>
Jinghan Li, Junfeng Fang, Jinda Lu, Yuan Wang, Xiaoyan Guo, Tianyu Zhang, Xiang Wang, Xiangnan He. [Paper] - ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL <2026-02-26>
Xingyu Lu, Jinpeng Wang, YiFan Zhang, Shijie Ma, Xiao Hu, Tianke Zhang, Haonan fan, Kaiyu Jiang, Changyi Liu, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Chun Yuan. [Paper] - Recycling Failures: Salvaging Exploration in RLVR via Fine-Grained Off-Policy Guidance <2026-02-27>
Yanwei Ren, Haotian Zhang, Likang Xiao, Xikai Zhang, Jiaxing Huang, Jiayan Qiu, Baosheng Yu, Quan Chen, Liu Liu. [Paper] - Linking Process to Outcome: Conditional Reward Modeling for LLM Reasoning <2026-02-27>
Zheng Zhang, Ziwei Shan, Kaitao Song, Yexin Li, Kan Ren. [Paper] - Empowering Small VLMs to Think with Dynamic Memorization and Exploration <2026-02-27>
Jiazhen Liu, Yuchuan Deng, Long Chen. [Paper] - FAPO: Flawed-Aware Policy Optimization for Efficient and Reliable Reasoning <2026-02-27>
Yuyang Ding, Chi Zhang, Juntao Li, Haibin Lin, Min Zhang. [Paper] - Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning <2026-02-27>
Yihe Deng, I-Hung Hsu, Jun Yan, Zifeng Wang, Rujun Han, Gufeng Zhang, Yanfei Chen, Wei Wang, Tomas Pfister, Chen-Yu Lee. [Paper] - Document Reconstruction Unlocks Scalable Long-Context RLVR <2026-02-26>
Yao Xiao, Lei Wang, Yue Deng, Guanzheng Chen, Ziqi Jin, Jung-jae Kim, Xiaoli Li, Roy Ka-wei Lee, Lidong Bing. [Paper] - Know What You Know: Metacognitive Entropy Calibration for Verifiable RL Reasoning <2026-02-26>
Qiannian Zhao, Chen Yang, Jinhao Jing, Yunke Zhang, Xuhui Ren, Lu Yu, Shijie Zhang, Hongzhi Yin. [Paper] - Replacing Multi-Step Assembly of Data Preparation Pipelines with One-Step LLM Pipeline Generation for Table QA <2026-02-26>
Fengyu Li, Junhao Zhu, Kaishi Song, Lu Chen, Zhongming Yao, Tianyi Li, Christian S. Jensen. [Paper] - Enhancing Multi-Modal LLMs Reasoning via Difficulty-Aware Group Normalization <2026-02-26>
Jinghan Li, Junfeng Fang, Jinda Lu, Yuan Wang, Xiaoyan Guo, Tianyu Zhang, Xiang Wang, Xiangnan He. [Paper] - ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL <2026-02-26>
Xingyu Lu, Jinpeng Wang, YiFan Zhang, Shijie Ma, Xiao Hu, Tianke Zhang, Haonan fan, Kaiyu Jiang, Changyi Liu, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Chun Yuan. [Paper] - Improving Parametric Knowledge Access in Reasoning Language Models <2026-02-25>
Melody Ma, John Hewitt. [Paper] - GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL <2026-02-25>
Rui Yang, Qianhui Wu, Zhaoyang Wang, Hanyang Chen, Ke Yang, Hao Cheng, Huaxiu Yao, Baoling Peng, Huan Zhang, Jianfeng Gao, Tong Zhang. [Paper] - UpSkill: Mutual Information Skill Learning for Structured Response Diversity in LLMs <2026-02-25>
Devan Shah, Owen Yang, Daniel Yang, Chongyi Zheng, Benjamin Eysenbach. [Paper] - Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration <2026-02-25>
Zhicheng Yang, Zhijiang Guo, Yinya Huang, Yongxin Wang, Dongchun Xie, Hanhui Li, Yiwei Wang, Xiaodan Liang, Jing Tang. [Paper] - SERL: Self-Examining Reinforcement Learning on Open-Domain <2026-02-25>
Weixuan Ou, Yanzhao Zheng, Shuoshuo Sun, Wei Zhang, Baohua Dong, Hangcheng Zhu, Ruohui Huang, Gang Yu, Pengwei Yan, Yifan Qiao. [Paper] - RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning <2026-02-25>
Yukun Chen, Jiaming Li, Longze Chen, Ze Gong, Jingpeng Li, Zhen Qin, Hengyu Chang, Ancheng Xu, Zhihao Yang, Hamid Alinejad-Rokny, Qiang Qu, Bo Zheng, Min Yang. [Paper] - Spurious Rewards: Rethinking Training Signals in RLVR <2026-02-25>
Rulin Shao, Shuyue Stella Li, Rui Xin, Scott Geng, Yiping Wang, Sewoong Oh, Simon Shaolei Du, Nathan Lambert, Sewon Min, Ranjay Krishna, Yulia Tsvetkov, Hannaneh Hajishirzi, Pang Wei Koh, Luke Zettlemoyer. [Paper] - Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning <2026-02-24>
Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang. [Paper] - EARL: Entropy-Aware RL Alignment of LLMs for Reliable RTL Code Generation <2026-02-24>
Jiahe Shi, Zhengqi Gao, Ching-Yun Ko, Duane Boning. [Paper] - Do We Need Adam? Surprisingly Strong and Sparse Reinforcement Learning with SGD in LLMs <2026-02-24>
Sagnik Mukherjee, Lifan Yuan, Pavan Jayasinha, Dilek Hakkani-Tür, Hao Peng. [Paper] - Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning <2026-02-24>
Xu Wan, Yansheng Wang, Wenqi Huang, Mingyang Sun. [Paper] - MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning <2026-02-24>
Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Binbin Zheng, Chaowen Hu, Zekai Shao, Cong Qin, Lu Pan, Ke Zeng, Xunliang Cai. [Paper] - ReSyn: Autonomously Scaling Synthetic Environments for Reasoning Models <2026-02-23>
Andre He, Nathaniel Weir, Kaj Bostrom, Allen Nie, Darion Cassel, Sam Bayless, Huzefa Rangwala. [Paper] - EBPO: Empirical Bayes Shrinkage for Stabilizing Group-Relative Policy Optimization <2026-02-23>
Kevin Han, Yuhang Zhou, Mingze Gao, Gedi Zhou, Serena Li, Abhishek Kumar, Xiangjun Fan, Weiwei Li, Lizhu Zhang. [Paper] - Think2SQL: Reinforce LLM Reasoning Capabilities for Text2SQL <2026-02-23>
Simone Papicchio, Simone Rossi, Luca Cagliero, Paolo Papotti. [Paper] - DSDR: Dual-Scale Diversity Regularization for Exploration in LLM Reasoning <2026-02-23>
Zhongwei Wan, Yun Shen, Zhihao Dou, Donghao Zhou, Yu Zhang, Xin Wang, Hui Shen, Jing Xiong, Chaofan Tao, Zixuan Zhong, Peizhou Huang, Mi Zhang. [Paper] - QiMeng-CodeV-R1: Reasoning-Enhanced Verilog Generation <2026-02-23>
Yaoyu Zhu, Di Huang, Hanqi Lyu, Xiaoyun Zhang, Chongxiao Li, Wenxuan Shi, Yutong Wu, Jianan Mu, Jinghua Wang, Yang Zhao, Pengwei Jin, Shuyao Cheng, Shengwen Liang, Xishan Zhang, Rui Zhang, Zidong Du, Qi Guo, Xing Hu, Yunji Chen. [Paper] - Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models <2026-02-23>
Cheonbok Park, Jeonghoon Kim, Joosung Lee, Sanghwan Bae, Jaegul Choo, Kang Min Yoo. [Paper] - SenTSR-Bench: Thinking with Injected Knowledge for Time-Series Reasoning <2026-02-23>
Zelin He, Boran Han, Xiyuan Zhang, Shuai Zhang, Haotian Lin, Qi Zhu, Haoyang Fang, Danielle C. Maddix, Abdul Fatir Ansari, Akash Chandrayan, Abhinav Pradhan, Bernie Wang, Matthew Reimherr. [Paper] - How to Allocate, How to Learn? Dynamic Rollout Allocation and Advantage Modulation for Policy Optimization <2026-02-22>
Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi, Chaowen Hu, Lu Pan, Ke Zeng, Xunliang Cai. [Paper] - Adaptive Problem Generation via Symbolic Representations <2026-02-22>
Teresa Yeo, Myeongho Jeon, Dulaj Weerakoon, Rui Qiao, Alok Prakash, Armando Solar-Lezama, Archan Misra. [Paper] - Generative Reasoning Re-ranker <2026-02-22>
Mingfu Liang, Yufei Li, Jay Xu, Kavosh Asadi, Xi Liu, Shuo Gu, Kaushik Rangadurai, Frank Shyu, Shuaiwen Wang, Song Yang, Zhijing Li, Jiang Liu, Mengying Sun, Fei Tian, Xiaohan Wei, Chonglin Sun, Jacob Tao, Shike Mei, Wenlin Chen, Santanu Kolay, Sandeep Pandey, Hamed Firooz, Luke Simon. [Paper] - Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning <2026-02-22>
Zhuoxu Huang, Mengxi Jia, Hao Sun, Xuelong Li, Jungong Han. [Paper] - Diversity-Incentivized Exploration for Versatile Reasoning <2026-02-21>
Zican Hu, Shilin Zhang, Yafu Li, Jianhao Yan, Xuyang Hu, Leyang Cui, Xiaoye Qu, Chunlin Chen, Yu Cheng, Zhi Wang. [Paper] - CM2: Reinforcement Learning with Checklist Rewards for Multi-Turn and Multi-Step Agentic Tool Use <2026-02-20>
Zhen Zhang, Kaiqiang Song, Xun Wang, Yebowen Hu, Weixiang Yan, Chenyang Zhao, Henry Peng Zou, Haoyun Deng, Sathish Reddy Indurthi, Shujian Liu, Simin Ma, Xiaoyang Wang, Xin Eric Wang, Song Wang. [Paper] - Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards <2026-02-20>
Johannes Ackermann, Michael Noukhovitch, Takashi Ishida, Masashi Sugiyama. [Paper] - RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward <2026-02-19>
Qiucheng Wu, Jing Shi, Simon Jenni, Kushal Kafle, Tianyu Wang, Shiyu Chang, Handong Zhao. [Paper] - Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration <2026-02-19>
Yan Sun, Jia Guo, Stanley Kok, Zihao Wang, Zujie Wen, Zhiqiang Zhang. [Paper] - Proof-RM: A Scalable and Generalizable Reward Model for Math Proof <2026-02-19>
Haotong Yang, Zitong Wang, Shijia Kang, Siqi Yang, Wenkai Yu, Xu Niu, Yike Sun, Yi Hu, Zhouchen Lin, Muhan Zhang. [Paper] - CaveAgent: Transforming LLMs into Stateful Runtime Operators <2026-02-19>
Maohao Ran, Zhenglin Wan, Cooper Lin, Yanting Zhang, Hongyu Xin, Hongwei Fan, Yibo Xu, Beier Luo, Yaxin Zhou, Wangbo Zhao, Lijie Yang, Lang Feng, Fuchao Yang, Jingxuan Wu, Yiqiao Huang, Chendong Ma, Dailing Jiang, Jianbo Deng, Sirui Han, Yang You, Bo An, Yike Guo, Jun Song. [Paper] - References Improve LLM Alignment in Non-Verifiable Domains <2026-02-18>
Kejian Shi, Yixin Liu, Peifeng Wang, Alexander R. Fabbri, Shafiq Joty, Arman Cohan. [Paper] - Shrinking the Variance: Shrinkage Baselines for Reinforcement Learning with Verifiable Rewards <2026-02-18>
Guanning Zeng, Zhaoyi Zhou, Daman Arora, Andrea Zanette. [Paper] - SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models <2026-02-18>
Ziyi Yang, Weizhou Shen, Chenliang Li, Ruijun Chen, Fanqi Wan, Ming Yan, Xiaojun Quan, Fei Huang. [Paper] - DeepVision-103K: A Visually Diverse, Broad-Coverage, and Verifiable Mathematical Dataset for Multimodal Reasoning <2026-02-18>
Haoxiang Sun, Lizhen Xu, Bing Zhao, Wotao Yin, Wei Wang, Boyu Yang, Rui Wang, Hu Wei. [Paper] - Synthesizing High-Quality Visual Question Answering from Medical Documents with Generator-Verifier LMMs <2026-02-18>
Xiaoke Huang, Ningsen Wang, Hui Liu, Xianfeng Tang, Yuyin Zhou. [Paper] - MedVLThinker: Simple Baselines for Multimodal Medical Reasoning <2026-02-18>
Xiaoke Huang, Juncheng Wu, Hui Liu, Xianfeng Tang, Yuyin Zhou. [Paper] - Evolving Language Models without Labels: Majority Drives Selection, Novelty Promotes Variation <2026-02-18>
Yujun Zhou, Zhenwen Liang, Haolin Liu, Wenhao Yu, Kishan Panaganti, Linfeng Song, Dian Yu, Xiangliang Zhang, Haitao Mi, Dong Yu. [Paper] - The Obfuscation Atlas: Mapping Where Honesty Emerges in RLVR with Deception Probes <2026-02-17>
Mohammad Taufeeque, Stefan Heimersheim, Adam Gleave, Chris Cundy. [Paper] - Generalized Parallel Scaling with Interdependent Generations <2026-02-16>
Harry Dong, David Brandfonbrener, Eryk Helenowski, Yun He, Mrinal Kumar, Han Fang, Yuejie Chi, Karthik Abinav Sankararaman. [Paper] - Reward Modeling from Natural Language Human Feedback <2026-02-16>
Zongqi Wang, Rui Wang, Yuchuan Wu, Yiyao Yu, Pinyi Zhang, Shaoning Sun, Yujiu Yang, Yongbin Li. [Paper] - Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards <2026-02-20>
Johannes Ackermann, Michael Noukhovitch, Takashi Ishida, Masashi Sugiyama. [Paper] - RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward <2026-02-19>
Qiucheng Wu, Jing Shi, Simon Jenni, Kushal Kafle, Tianyu Wang, Shiyu Chang, Handong Zhao. [Paper] - MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning <2026-02-19>
Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Binbin Zheng, Chaowen Hu, Zekai Shao, Cong Qin, Lu Pan, Ke Zeng, Xunliang Cai. [Paper] - Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration <2026-02-19>
Yan Sun, Jia Guo, Stanley Kok, Zihao Wang, Zujie Wen, Zhiqiang Zhang. [Paper] - Proof-RM: A Scalable and Generalizable Reward Model for Math Proof <2026-02-19>
Haotong Yang, Zitong Wang, Shijia Kang, Siqi Yang, Wenkai Yu, Xu Niu, Yike Sun, Yi Hu, Zhouchen Lin, Muhan Zhang. [Paper] - CaveAgent: Transforming LLMs into Stateful Runtime Operators <2026-02-19>
Maohao Ran, Zhenglin Wan, Cooper Lin, Yanting Zhang, Hongyu Xin, Hongwei Fan, Yibo Xu, Beier Luo, Yaxin Zhou, Wangbo Zhao, Lijie Yang, Lang Feng, Fuchao Yang, Jingxuan Wu, Yiqiao Huang, Chendong Ma, Dailing Jiang, Jianbo Deng, Sirui Han, Yang You, Bo An, Yike Guo, Jun Song. [Paper] - References Improve LLM Alignment in Non-Verifiable Domains <2026-02-18>
Kejian Shi, Yixin Liu, Peifeng Wang, Alexander R. Fabbri, Shafiq Joty, Arman Cohan. [Paper] - Shrinking the Variance: Shrinkage Baselines for Reinforcement Learning with Verifiable Rewards <2026-02-18>
Guanning Zeng, Zhaoyi Zhou, Daman Arora, Andrea Zanette. [Paper] - SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models <2026-02-18>
Ziyi Yang, Weizhou Shen, Chenliang Li, Ruijun Chen, Fanqi Wan, Ming Yan, Xiaojun Quan, Fei Huang. [Paper] - DeepVision-103K: A Visually Diverse, Broad-Coverage, and Verifiable Mathematical Dataset for Multimodal Reasoning <2026-02-18>
Haoxiang Sun, Lizhen Xu, Bing Zhao, Wotao Yin, Wei Wang, Boyu Yang, Rui Wang, Hu Wei. [Paper] - Synthesizing High-Quality Visual Question Answering from Medical Documents with Generator-Verifier LMMs <2026-02-18>
Xiaoke Huang, Ningsen Wang, Hui Liu, Xianfeng Tang, Yuyin Zhou. [Paper] - MedVLThinker: Simple Baselines for Multimodal Medical Reasoning <2026-02-18>
Xiaoke Huang, Juncheng Wu, Hui Liu, Xianfeng Tang, Yuyin Zhou. [Paper] - Evolving Language Models without Labels: Majority Drives Selection, Novelty Promotes Variation <2026-02-18>
Yujun Zhou, Zhenwen Liang, Haolin Liu, Wenhao Yu, Kishan Panaganti, Linfeng Song, Dian Yu, Xiangliang Zhang, Haitao Mi, Dong Yu. [Paper] - The Obfuscation Atlas: Mapping Where Honesty Emerges in RLVR with Deception Probes <2026-02-17>
Mohammad Taufeeque, Stefan Heimersheim, Adam Gleave, Chris Cundy. [Paper] - Generalized Parallel Scaling with Interdependent Generations <2026-02-16>
Harry Dong, David Brandfonbrener, Eryk Helenowski, Yun He, Mrinal Kumar, Han Fang, Yuejie Chi, Karthik Abinav Sankararaman. [Paper] - Reward Modeling from Natural Language Human Feedback <2026-02-16>
Zongqi Wang, Rui Wang, Yuchuan Wu, Yiyao Yu, Pinyi Zhang, Shaoning Sun, Yujiu Yang, Yongbin Li. [Paper] - On the Learning Dynamics of RLVR at the Edge of Competence <2026-02-16>
Yu Huang, Zixin Wen, Yuejie Chi, Yuting Wei, Aarti Singh, Yingbin Liang, Yuxin Chen. [Paper] - Reinforcement Learning via Self-Distillation <2026-02-16>
Jonas Hübotter, Frederike Lübeck, Lejs Behric, Anton Baumann, Marco Bagatella, Daniel Marta, Ido Hakimi, Idan Shenfeld, Thomas Kleine Buening, Carlos Guestrin, Andreas Krause. [Paper] - Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR <2026-02-16>
Jiaming Li, Longze Chen, Ze Gong, Yukun Chen, Lu Wang, Wanwei He, Run Luo, Min Yang. [Paper] - MoRL: Reinforced Reasoning for Unified Motion Understanding and Generation <2026-02-16>
Hongpeng Wang, Zeyu Zhang, Wenhao Li, Hao Tang. [Paper] - Learning to Extract Rational Evidence via Reinforcement Learning for Retrieval-Augmented Generation <2026-02-16>
Xinping Zhao, Shouzheng Huang, Yan Zhong, Xinshuo Hu, Meishan Zhang, Baotian Hu, Min Zhang. [Paper] - Train Less, Learn More: Adaptive Efficient Rollout Optimization for Group-Based Reinforcement Learning <2026-02-15>
Zhi Zhang, Zhen Han, Costas Mavromatis, Qi Zhu, Yunyi Zhang, Sheng Guan, Dingmin Wang, Xiong Zhou, Shuai Wang, Soji Adeshina, Vassilis Ioannidis, Huzefa Rangwala. [Paper] - Text Before Vision: Staged Knowledge Injection Matters for Agentic RLVR in Ultra-High-Resolution Remote Sensing Understanding <2026-02-15>
Fengxiang Wang, Mingshuo Chen, Yueying Li, Yajie Yang, Yuhao Zhou, Di Wang, Yifan Zhang, Haoyu Wang, Haiyan Zhao, Hongda Sun, Long Lan, Jun Song, Yulin Wang, Jing Zhang, Wenlong Zhang, Bo Du. [Paper] - MURPHY: Multi-Turn GRPO for Self Correcting Code Generation <2026-02-15>
Chanakya Ekbote, Vijay Lingam, Sujay Sanghavi, Jun Huan, Behrooz Omidvar-Tehrani, Anoop Deoras, Stefano Soatto. [Paper] - QuRL: Efficient Reinforcement Learning with Quantized Rollout <2026-02-15>
Yuhang Li, Reena Elangovan, Xin Dong, Priyadarshini Panda, Brucek Khailany. [Paper] - Token Hidden Reward: Steering Exploration-Exploitation in Group Relative Deep Reinforcement Learning <2026-02-15>
Wenlong Deng, Yi Ren, Yushu Li, Boying Gong, Danica J. Sutherland, Xiaoxiao Li, Christos Thrampoulidis. [Paper] - Look Inward to Explore Outward: Learning Temperature Policy from LLM Internal States via Hierarchical RL <2026-02-13>
Yixiao Zhou, Yang Li, Dongzhou Cheng, Hehe Fan, Yu Cheng. [Paper] - Amortized Reasoning Tree Search: Decoupling Proposal and Decision in Large Language Models <2026-02-13>
Zesheng Hong, Jiadong Yu, Hui Pan. [Paper] - Beyond Normalization: Rethinking the Partition Function as a Difficulty Scheduler for RLVR <2026-02-13>
Dohyung Kim, Minbeom Kim, Jeonghye Kim, Sangmook Lee, Sojeong Rhee, Kyomin Jung. [Paper] - VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction <2026-02-13>
Xin-Qiang Cai, Masashi Sugiyama. [Paper] - To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models <2026-02-13>
Haoqing Wang, Xiang Long, Ziheng Li, Yilong Xu, Tingguang Li, Yehui Tang. [Paper] - What does RL improve for Visual Reasoning? A Frankenstein-Style Analysis <2026-02-12>
Xirui Li, Ming Li, Tianyi Zhou. [Paper] - CM2: Reinforcement Learning with Checklist Rewards for Multi-Turn and Multi-Step Agentic Tool Use <2026-02-12>
Zhen Zhang, Kaiqiang Song, Xun Wang, Yebowen Hu, Weixiang Yan, Chenyang Zhao, Henry Peng Zou, Haoyun Deng, Sathish Reddy Indurthi, Shujian Liu, Simin Ma, Xiaoyang Wang, Xin Eric Wang, Song Wang. [Paper] - Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models <2026-02-12>
Xin Xu, Clive Bai, Kai Yang, Tianhao Chen, Yangkun Chen, Weijie Liu, Hao Chen, Yang Wang, Saiyong Yang, Can Yang. [Paper] - Gaia2: Benchmarking LLM Agents on Dynamic and Asynchronous Environments <2026-02-12>
Romain Froger, Pierre Andrews, Matteo Bettini, Amar Budhiraja, Ricardo Silveira Cabral, Virginie Do, Emilien Garreau, Jean-Baptiste Gaya, Hugo Laurençon, Maxime Lecanu, Kunal Malkan, Dheeraj Mekala, Pierre Ménard, Gerard Moreno-Torres Bertran, Ulyana Piterbarg, Mikhail Plekhanov, Mathieu Rita, Andrey Rusakov, Vladislav Vorotilov, Mengjue Wang, Ian Yu, Amine Benhalloum, Grégoire Mialon, Thomas Scialom. [Paper] - Detecting RLVR Training Data via Structural Convergence of Reasoning <2026-02-12>
Hongbo Zhang, Yue Yang, Jianhao Yan, Guangsheng Bao, Yue Zhang, Yue Zhang. [Paper] - Generative Reasoning Re-ranker <2026-02-12>
Mingfu Liang, Yufei Li, Jay Xu, Kavosh Asadi, Xi Liu, Shuo Gu, Kaushik Rangadurai, Frank Shyu, Shuaiwen Wang, Song Yang, Zhijing Li, Jiang Liu, Mengying Sun, Fei Tian, Xiaohan Wei, Chonglin Sun, Jacob Tao, Shike Mei, Hamed Firooz, Wenlin Chen, Luke Simon. [Paper] - Quark Medical Alignment: A Holistic Multi-Dimensional Alignment and Collaborative Optimization Paradigm <2026-02-12>
Tianxiang Xu, Jiayi Liu, Yixuan Tong, Jialu Xu, Yunqing Wei, Kaiwen Feng, PanPan Hou, Kangping Yin, Jiyuan Hu, Hao Zhou, Zhenxin Ma, Jian Xu, Guanjun Jiang. [Paper] - Unveiling Implicit Advantage Symmetry: Why GRPO Struggles with Exploration and Difficulty Adaptation <2026-02-12>
Zhiqi Yu, Zhangquan Chen, Mengting Liu, Heye Zhang, Liangqiong Qu. [Paper] - PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering <2026-02-12>
Xiangfeng Wang, Hangyu Guo, Yanlin Lai, Mitt Huang, Liang Zhao, Chengyuan Yao, Yinmin Zhang, Qi Han, Xiaoxiao Ren, Chun Yuan, Tong Xu, Zheng Ge, Xiangyu Zhang, Daxin Jiang. [Paper] - Native Reasoning Models: Training Language Models to Reason on Unverifiable Data <2026-02-12>
Yuanfu Wang, Zhixuan Liu, Xiangtian Li, Chaochao Lu, Chao Yang. [Paper] - FaithRL: Learning to Reason Faithfully through Step-Level Faithfulness Maximization <2026-02-12>
Runquan Gui, Yafu Li, Xiaoye Qu, Ziyan Liu, Yeqiu Cheng, Yu Cheng. [Paper] - Credit Where It is Due: Cross-Modality Connectivity Drives Precise Reinforcement Learning for MLLM Reasoning <2026-02-12>
Zhengbo Jiao, Shaobo Wang, Zifan Zhang, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang. [Paper] - Minerva: Reinforcement Learning with Verifiable Rewards for Cyber Threat Intelligence LLMs <2026-02-11>
Md Tanvirul Alam, Aritran Piplai, Ionut Cardei, Nidhi Rastogi, Peter J Worth. [Paper] - On the optimization dynamics of RLVR: Gradient gap and step size thresholds <2026-02-11>
Joe Suk, Yaqi Duan. [Paper] - Asymmetric Prompt Weighting for Reinforcement Learning with Verifiable Rewards <2026-02-11>
Reinhard Heckel, Mahdi Soltanolkotabi, Christos Thramboulidis. [Paper] - PhyCritic: Multimodal Critic Models for Physical AI <2026-02-11>
Tianyi Xiong, Shihao Wang, Guilin Liu, Yi Dong, Ming Li, Heng Huang, Jan Kautz, Zhiding Yu. [Paper] - Learning to Explore with Parameter-Space Noise: A Deep Dive into Parameter-Space Noise for Reinforcement Learning with Verifiable Rewards <2026-02-11>
Bizhe Bai, Xinyue Wang, Peng Ye, Tao Chen. [Paper] - Reinforcing Chain-of-Thought Reasoning with Self-Evolving Rubrics <2026-02-11>
Leheng Sheng, Wenchang Ma, Ruixin Hong, Xiang Wang, An Zhang, Tat-Seng Chua. [Paper] - The Choice of Divergence: A Neglected Key to Mitigating Diversity Collapse in Reinforcement Learning with Verifiable Reward <2026-02-11>
Long Li, Zhijian Zhou, Jiaran Hao, Jason Klein Liu, Yanting Miao, Wei Pang, Xiaoyu Tan, Wei Chu, Zhe Wang, Shirui Pan, Chao Qu, Yuan Qi. [Paper] - Look Inward to Explore Outward: Learning Temperature Policy from LLM Internal States via Hierarchical RL <2026-02-13>
Yixiao Zhou, Yang Li, Dongzhou Cheng, Hehe Fan, Yu Cheng. [Paper] - Amortized Reasoning Tree Search: Decoupling Proposal and Decision in Large Language Models <2026-02-13>
Zesheng Hong, Jiadong Yu, Hui Pan. [Paper] - Beyond Normalization: Rethinking the Partition Function as a Difficulty Scheduler for RLVR <2026-02-13>
Dohyung Kim, Minbeom Kim, Jeonghye Kim, Sangmook Lee, Sojeong Rhee, Kyomin Jung. [Paper] - VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction <2026-02-13>
Xin-Qiang Cai, Masashi Sugiyama. [Paper] - To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models <2026-02-13>
Haoqing Wang, Xiang Long, Ziheng Li, Yilong Xu, Tingguang Li, Yehui Tang. [Paper] - What does RL improve for Visual Reasoning? A Frankenstein-Style Analysis <2026-02-12>
Xirui Li, Ming Li, Tianyi Zhou. [Paper] - CM2: Reinforcement Learning with Checklist Rewards for Multi-Turn and Multi-Step Agentic Tool Use <2026-02-12>
Zhen Zhang, Kaiqiang Song, Xun Wang, Yebowen Hu, Weixiang Yan, Chenyang Zhao, Henry Peng Zou, Haoyun Deng, Sathish Reddy Indurthi, Shujian Liu, Simin Ma, Xiaoyang Wang, Xin Eric Wang, Song Wang. [Paper] - Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models <2026-02-12>
Xin Xu, Clive Bai, Kai Yang, Tianhao Chen, Yangkun Chen, Weijie Liu, Hao Chen, Yang Wang, Saiyong Yang, Can Yang. [Paper] - Gaia2: Benchmarking LLM Agents on Dynamic and Asynchronous Environments <2026-02-12>
Romain Froger, Pierre Andrews, Matteo Bettini, Amar Budhiraja, Ricardo Silveira Cabral, Virginie Do, Emilien Garreau, Jean-Baptiste Gaya, Hugo Laurençon, Maxime Lecanu, Kunal Malkan, Dheeraj Mekala, Pierre Ménard, Gerard Moreno-Torres Bertran, Ulyana Piterbarg, Mikhail Plekhanov, Mathieu Rita, Andrey Rusakov, Vladislav Vorotilov, Mengjue Wang, Ian Yu, Amine Benhalloum, Grégoire Mialon, Thomas Scialom. [Paper] - Detecting RLVR Training Data via Structural Convergence of Reasoning <2026-02-12>
Hongbo Zhang, Yue Yang, Jianhao Yan, Guangsheng Bao, Yue Zhang, Yue Zhang. [Paper] - Generative Reasoning Re-ranker <2026-02-12>
Mingfu Liang, Yufei Li, Jay Xu, Kavosh Asadi, Xi Liu, Shuo Gu, Kaushik Rangadurai, Frank Shyu, Shuaiwen Wang, Song Yang, Zhijing Li, Jiang Liu, Mengying Sun, Fei Tian, Xiaohan Wei, Chonglin Sun, Jacob Tao, Shike Mei, Hamed Firooz, Wenlin Chen, Luke Simon. [Paper] - Quark Medical Alignment: A Holistic Multi-Dimensional Alignment and Collaborative Optimization Paradigm <2026-02-12>
Tianxiang Xu, Jiayi Liu, Yixuan Tong, Jialu Xu, Yunqing Wei, Kaiwen Feng, PanPan Hou, Kangping Yin, Jiyuan Hu, Hao Zhou, Zhenxin Ma, Jian Xu, Guanjun Jiang. [Paper] - Unveiling Implicit Advantage Symmetry: Why GRPO Struggles with Exploration and Difficulty Adaptation <2026-02-12>
Zhiqi Yu, Zhangquan Chen, Mengting Liu, Heye Zhang, Liangqiong Qu. [Paper] - PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering <2026-02-12>
Xiangfeng Wang, Hangyu Guo, Yanlin Lai, Mitt Huang, Liang Zhao, Chengyuan Yao, Yinmin Zhang, Qi Han, Xiaoxiao Ren, Chun Yuan, Tong Xu, Zheng Ge, Xiangyu Zhang, Daxin Jiang. [Paper] - Native Reasoning Models: Training Language Models to Reason on Unverifiable Data <2026-02-12>
Yuanfu Wang, Zhixuan Liu, Xiangtian Li, Chaochao Lu, Chao Yang. [Paper] - FaithRL: Learning to Reason Faithfully through Step-Level Faithfulness Maximization <2026-02-12>
Runquan Gui, Yafu Li, Xiaoye Qu, Ziyan Liu, Yeqiu Cheng, Yu Cheng. [Paper] - Credit Where It is Due: Cross-Modality Connectivity Drives Precise Reinforcement Learning for MLLM Reasoning <2026-02-12>
Zhengbo Jiao, Shaobo Wang, Zifan Zhang, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang. [Paper] - Minerva: Reinforcement Learning with Verifiable Rewards for Cyber Threat Intelligence LLMs <2026-02-11>
Md Tanvirul Alam, Aritran Piplai, Ionut Cardei, Nidhi Rastogi, Peter J Worth. [Paper] - On the optimization dynamics of RLVR: Gradient gap and step size thresholds <2026-02-11>
Joe Suk, Yaqi Duan. [Paper] - Asymmetric Prompt Weighting for Reinforcement Learning with Verifiable Rewards <2026-02-11>
Reinhard Heckel, Mahdi Soltanolkotabi, Christos Thramboulidis. [Paper] - PhyCritic: Multimodal Critic Models for Physical AI <2026-02-11>
Tianyi Xiong, Shihao Wang, Guilin Liu, Yi Dong, Ming Li, Heng Huang, Jan Kautz, Zhiding Yu. [Paper] - Learning to Explore with Parameter-Space Noise: A Deep Dive into Parameter-Space Noise for Reinforcement Learning with Verifiable Rewards <2026-02-11>
Bizhe Bai, Xinyue Wang, Peng Ye, Tao Chen. [Paper] - Reinforcing Chain-of-Thought Reasoning with Self-Evolving Rubrics <2026-02-11>
Leheng Sheng, Wenchang Ma, Ruixin Hong, Xiang Wang, An Zhang, Tat-Seng Chua. [Paper] - The Choice of Divergence: A Neglected Key to Mitigating Diversity Collapse in Reinforcement Learning with Verifiable Reward <2026-02-11>
Long Li, Zhijian Zhou, Jiaran Hao, Jason Klein Liu, Yanting Miao, Wei Pang, Xiaoyu Tan, Wei Chu, Zhe Wang, Shirui Pan, Chao Qu, Yuan Qi. [Paper] - Internalizing Meta-Experience into Memory for Guided Reinforcement Learning in Large Language Models <2026-02-10>
Shiting Huang, Zecheng Li, Yu Zeng, Qingnan Ren, Zhen Fang, Qisheng Su, Kou Shi, Lin Chen, Zehui Chen, Feng Zhao. [Paper] - ATTNPO: Attention-Guided Process Supervision for Efficient Reasoning <2026-02-10>
Shuaiyi Nie, Siyu Ding, Wenyuan Zhang, Linhao Yu, Tianmeng Yang, Yao Chen, Tingwen Liu, Weichong Yin, Yu Sun, Hua Wu. [Paper] - From Off-Policy to On-Policy: Enhancing GUI Agents via Bi-level Expert-to-Policy Assimilation <2026-02-10>
Zezhou Wang, Ziyun Zhang, Xiaoyi Zhang, Zhuzhong Qian, Yan Lu. [Paper] - Flexible Entropy Control in RLVR with Gradient-Preserving Perspective <2026-02-10>
Kun Chen, Peng Shi, Fanfan Liu, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao. [Paper] - -Musketeers: Reinforcement Learning Shapes Collaboration Among Language Models <2026-02-09>
Ryozo Masukawa, Sanggeon Yun, Hyunwoo Oh, SuhgHeon Jeong, Raheeb Hassa, Hanning Chen, Wenjun Huang, Mahdi Imani, Pietro Mercati, Nathaniel D. Bastian, Mohsen Imani. [Paper] - f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment <2026-02-09>
Rajdeep Haldar, Lantao Mei, Guang Lin, Yue Xing, Qifan Song. [Paper] - Bayesian Preference Learning for Test-Time Steerable Reward Models <2026-02-09>
Jiwoo Hong, Shao Tang, Zhipeng Wang. [Paper] - Learning Self-Correction in Vision-Language Models via Rollout Augmentation <2026-02-09>
Yi Ding, Ziliang Qiu, Bolian Li, Ruqi Zhang. [Paper] - Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards <2026-02-09>
Xiaodong Lu, Xiaohan Wang, Jiajun Chai, Guojun Yin, Wei Lin, Zhijun Chen, Yu Luo, Fuzhen Zhuang, Yikun Ban, Deqing Wang. [Paper] - Beyond Correctness: Learning Robust Reasoning via Transfer <2026-02-09>
Hyunseok Lee, Soheil Abbasloo, Jihoon Tack, Jinwoo Shin. [Paper] - No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping <2026-02-09>
Thanh-Long V. Le, Myeongho Jeon, Kim Vu, Viet Lai, Eunho Yang. [Paper] - OPE: Overcoming Information Saturation in Parallel Thinking via Outline-Guided Path Exploration <2026-02-09>
Qi Guo, Jianing Wang, Deyang Kong, Xiangyu Xi, Jianfei Zhang, Yi Lu, Jingang Wang, Wei Wang, Shikun Zhang, Wei Ye. [Paper] - New Skills or Sharper Primitives? A Probabilistic Perspective on the Emergence of Reasoning in RLVR <2026-02-09>
Zhilin Wang, Yafu Li, Shunkai Zhang, Zhi Wang, Haoran Zhang, Xiaoye Qu, Yu Cheng. [Paper] - Document Reconstruction Unlocks Scalable Long-Context RLVR <2026-02-09>
Yao Xiao, Lei Wang, Yue Deng, Guanzheng Chen, Ziqi Jin, Jung-jae Kim, Xiaoli Li, Roy Ka-wei Lee, Lidong Bing. [Paper] - When Is Compositional Reasoning Learnable from Verifiable Rewards? <2026-02-08>
Daniel Barzilai, Yotam Wolf, Ronen Basri. [Paper] - Solver-in-the-Loop: MDP-Based Benchmarks for Self-Correction and Behavioral Rationality in Operations Research <2026-02-08>
Ruicheng Ao, David Simchi-Levi, Xinshang Wang. [Paper] - Do We Need Adam? Surprisingly Strong and Sparse Reinforcement Learning with SGD in LLMs <2026-02-07>
Sagnik Mukherjee, Lifan Yuan, Pavan Jayasinha, Dilek Hakkani-Tür, Hao Peng. [Paper] - GrndCtrl: Grounding World Models via Self-Supervised Reward Alignment <2026-02-07>
Haoyang He, Jay Patrikar, Dong-Ki Kim, Max Smith, Daniel McGann, Ali-akbar Agha-mohammadi, Shayegan Omidshafiei, Sebastian Scherer. [Paper] - A Unified Framework for Rethinking Policy Divergence Measures in GRPO <2026-02-07>
Qingyuan Wu, Yuhui Wang, Simon Sinong Zhan, Yanning Dai, Shilong Deng, Sarra Habchi, Qi Zhu, Matthias Gallé, Chao Huang. [Paper] - EBPO: Empirical Bayes Shrinkage for Stabilizing Group-Relative Policy Optimization <2026-02-07>
Kevin Han, Yuhang Zhou, Mingze Gao, Gedi Zhou, Serena Li, Abhishek Kumar, Xiangjun Fan, Weiwei Li, Lizhu Zhang. [Paper] - Think2SQL: Reinforce LLM Reasoning Capabilities for Text2SQL <2026-02-06>
Simone Papicchio, Simone Rossi, Luca Cagliero, Paolo Papotti. [Paper] - MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images <2026-02-06>
Ankan Deria, Komal Kumar, Adinath Madhavrao Dukre, Eran Segal, Salman Khan, Imran Razzak. [Paper] - Back to Basics: Revisiting Exploration in Reinforcement Learning for LLM Reasoning via Generative Probabilities <2026-02-06>
Pengyi Li, Elizaveta Goncharova, Andrey Kuznetsov, Ivan Oseledets. [Paper] - Generating Data-Driven Reasoning Rubrics for Domain-Adaptive Reward Modeling <2026-02-06>
Kate Sanders, Nathaniel Weir, Sapana Chaudhary, Kaj Bostrom, Huzefa Rangwala. [Paper] - F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare <2026-02-06>
Daniil Plyusov, Alexey Gorbatovski, Boris Shaposhnikov, Viacheslav Sinii, Alexey Malakhov, Daniil Gavrilov. [Paper] - Evaluating and Enhancing the Vulnerability Reasoning Capabilities of Large Language Models <2026-02-06>
Li Lu, Yanjie Zhao, Hongzhou Rao, Kechi Zhang, Haoyu Wang. [Paper] - MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images <2026-02-06>
Ankan Deria, Komal Kumar, Adinath Madhavrao Dukre, Eran Segal, Salman Khan, Imran Razzak. [Paper] - Back to Basics: Revisiting Exploration in Reinforcement Learning for LLM Reasoning via Generative Probabilities <2026-02-06>
Pengyi Li, Elizaveta Goncharova, Andrey Kuznetsov, Ivan Oseledets. [Paper] - Generating Data-Driven Reasoning Rubrics for Domain-Adaptive Reward Modeling <2026-02-06>
Kate Sanders, Nathaniel Weir, Sapana Chaudhary, Kaj Bostrom, Huzefa Rangwala. [Paper] - F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare <2026-02-06>
Daniil Plyusov, Alexey Gorbatovski, Boris Shaposhnikov, Viacheslav Sinii, Alexey Malakhov, Daniil Gavrilov. [Paper] - Evaluating and Enhancing the Vulnerability Reasoning Capabilities of Large Language Models <2026-02-06>
Li Lu, Yanjie Zhao, Hongzhou Rao, Kechi Zhang, Haoyu Wang. [Paper] - dUltra: Ultra-Fast Diffusion Language Models via Reinforcement Learning <2026-02-06>
Shirui Chen, Jiantao Jiao, Lillian J. Ratliff, Banghua Zhu. [Paper] - POINTS-GUI-G: GUI-Grounding Journey <2026-02-06>
Zhongyin Zhao, Yuan Liu, Yikun Liu, Haicheng Wang, Le Tian, Xiao Zhou, Yangxiu You, Zilin Yu, Yang Yu, Jie Zhou. [Paper] - CoBA-RL: Capability-Oriented Budget Allocation for Reinforcement Learning in LLMs <2026-02-06>
Zhiyuan Yao, Yi-Kai Zhang, Yuxin Chen, Yueqing Sun, Zishan Xu, Yu Yang, Tianhao Hu, Qi Gu, Hui Su, Xunliang Cai. [Paper] - B-GRPO: Unsupervised Speech Emotion Recognition based on Batched-Group Relative Policy Optimization <2026-02-06>
Yingying Gao, Shilei Zhang, Runyan Yang, Zihao Cui, Junlan Feng. [Paper] - VowelPrompt: Hearing Speech Emotions from Text via Vowel-level Prosodic Augmentation <2026-02-06>
Yancheng Wang, Osama Hanna, Ruiming Xie, Xianfeng Rui, Maohao Shen, Xuedong Zhang, Christian Fuegen, Jilong Wu, Debjyoti Paul, Arthur Guo, Zhihong Lei, Ozlem Kalinli, Qing He, Yingzhen Yang. [Paper] - -GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment <2026-02-05>
Rajdeep Haldar, Lantao Mei, Guang Lin, Yue Xing, Qifan Song. [Paper] - Anchored Policy Optimization: Mitigating Exploration Collapse Via Support-Constrained Rectification <2026-02-05>
Tianyi Wang, Long Li, Hongcan Guo, Yibiao Chen, Yixia Li, Yong Wang, Yun Chen, Guanhua Chen. [Paper] - Rewards as Labels: Revisiting RLVR from a Classification Perspective <2026-02-05>
Zepeng Zhai, Meilin Chen, Jiaxuan Zhao, Junlang Qian, Lei Shen, Yuan Lu. [Paper] - Unveiling Implicit Advantage Symmetry: Why GRPO Struggles with Exploration and Difficulty Adaptation <2026-02-05>
Zhiqi Yu, Zhangquan Chen, Mengting Liu, Heye Zhang, Liangqiong Qu. [Paper] - A Unified Framework for Rethinking Policy Divergence Measures in GRPO <2026-02-05>
Qingyuan Wu, Yuhui Wang, Simon Sinong Zhan, Yanning Dai, Shilong Deng, Sarra Habchi, Qi Zhu, Matthias Gallé, Chao Huang. [Paper] - GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR <2026-02-05>
Jiaying Zhang, Lei Shi, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He. [Paper] - Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR <2026-02-05>
Fanfan Liu, Youyang Yin, Peng Shi, Siqi Yang, Zhixiong Zeng, Haibo Qiu. [Paper] - EBPO: Empirical Bayes Shrinkage for Stabilizing Group-Relative Policy Optimization <2026-02-05>
Kevin Han, Yuhang Zhou, Mingze Gao, Gedi Zhou, Serena Li, Abhishek Kumar, Xiangjun Fan, Weiwei Li, Lizhu Zhang. [Paper] - Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation <2026-02-04>
Zhichao Xu, Zongyu Wu, Yun Zhou, Aosong Feng, Kang Zhou, Sangmin Woo, Kiran Ramnath, Yijun Tian, Xuan Qi, Weikang Qiu, Lin Lee Cheong, Haibo Ding. [Paper] - Extending RLVR to Open-Ended Tasks via Verifiable Multiple-Choice Reformulation <2026-02-04>
Mengyu Zhang, Siyu Ding, Weichong Yin, Yu Sun, Hua Wu. [Paper] - Thickening-to-Thinning: Reward Shaping via Human-Inspired Learning Dynamics for LLM Reasoning <2026-02-04>
Wenze Lin, Zhen Yang, Xitai Jiang, Pony Ma, Gao Huang. [Paper] - The Invisible Leash: Why RLVR May or May Not Escape Its Origin <2026-02-04>
Fang Wu, Weihao Xuan, Ximing Lu, Mingjie Liu, Yi Dong, Zaid Harchaoui, Yejin Choi. [Paper] - Monitorability as a Free Gift: How RLVR Spontaneously Aligns Reasoning <2026-02-03>
Zidi Xiong, Shan Chen, Himabindu Lakkaraju. [Paper] - Learning Query-Specific Rubrics from Human Preferences for DeepResearch Report Generation <2026-02-03>
Changze Lv, Jie Zhou, Wentao Zhao, Jingwen Xu, Zisu Huang, Muzhao Tian, Shihan Dou, Tao Gui, Le Tian, Xiao Zhou, Xiaoqing Zheng, Xuanjing Huang, Jie Zhou. [Paper] - Learning to Reason Faithfully through Step-Level Faithfulness Maximization <2026-02-03>
Runquan Gui, Yafu Li, Xiaoye Qu, Ziyan Liu, Yeqiu Cheng, Yu Cheng. [Paper] - Beyond Variance: Prompt-Efficient RLVR via Rare-Event Amplification and Bidirectional Pairing <2026-02-03>
Xin Sheng, Jiaxin Li, Yujuan Pang, Ran Peng, Yong Ma. [Paper] - Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards <2026-02-03>
Hieu Trung Nguyen, Bao Nguyen, Wenao Ma, Yuzhi Zhao, Ruifeng She, Viet Anh Nguyen. [Paper] - MedSAM-Agent: Empowering Interactive Medical Image Segmentation with Multi-turn Agentic Reinforcement Learning <2026-02-03>
Shengyuan Liu, Liuxin Bao, Qi Yang, Wanting Geng, Boyun Zheng, Chenxin Li, Wenting Chen, Houwen Peng, Yixuan Yuan. [Paper] - Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration <2026-02-03>
Zhicheng Yang, Zhijiang Guo, Yinya Huang, Yongxin Wang, Dongchun Xie, Hanhui Li, Yiwei Wang, Xiaodan Liang, Jing Tang. [Paper] - Self-Hinting Language Models Enhance Reinforcement Learning <2026-02-03>
Baohao Liao, Hanze Dong, Xinxing Xu, Christof Monz, Jiang Bian. [Paper] - Test-time Recursive Thinking: Self-Improvement without External Feedback <2026-02-03>
Yufan Zhuang, Chandan Singh, Liyuan Liu, Yelong Shen, Dinghuai Zhang, Jingbo Shang, Jianfeng Gao, Weizhu Chen. [Paper] - Golden Goose: A Simple Trick to Synthesize Unlimited RLVR Tasks from Unverifiable Internet Text <2026-02-02>
Ximing Lu, David Acuna, Jaehun Jung, Jian Hu, Di Zhang, Shizhe Diao, Yunheng Zou, Shaokun Zhang, Brandon Cui, Mingjie Liu, Hyunwoo Kim, Prithviraj Ammanabrolu, Jan Kautz, Yi Dong, Yejin Choi. [Paper] - Proof-RM: A Scalable and Generalizable Reward Model for Math Proof <2026-02-02>
Haotong Yang, Zitong Wang, Shijia Kang, Siqi Yang, Wenkai Yu, Xu Niu, Yike Sun, Yi Hu, Zhouchen Lin, Muhan Zhang. [Paper] - Think Dense, Not Long: Dynamic Decoupled Conditional Advantage for Efficient Reasoning <2026-02-02>
Keqin Peng, Yuanxin Ouyang, Xuebo Liu, Zhiliang Tian, Ruijian Han, Yancheng Yuan, Liang Ding. [Paper] - Less Noise, More Voice: Reinforcement Learning for Reasoning via Instruction Purification <2026-02-02>
Yiju Guo, Tianyi Hu, Zexu Sun, Yankai Lin. [Paper] - Grad2Reward: From Sparse Judgment to Dense Rewards for Improving Open-Ended LLM Reasoning <2026-02-02>
Zheng Zhang, Ao Lu, Yuanhao Zeng, Ziwei Shan, Jinjin Guo, Lufei Li, Yexin Li, Kan Ren. [Paper] - The Multiple Ticket Hypothesis: Random Sparse Subnetworks Suffice for RLVR <2026-02-02>
Israel Adewuyi, Solomon Okibe, Vladmir Ivanov. [Paper] - A Relative-Budget Theory for Reinforcement Learning with Verifiable Rewards in Large Language Model Reasoning <2026-02-02>
Akifumi Wachi, Hirota Kinoshita, Shokichi Takakura, Rei Higuchi, Taiji Suzuki. [Paper] - GOPO: Policy Optimization using Ranked Rewards <2026-02-01>
Kyuseong Choi, Dwaipayan Saha, Woojeong Kim, Anish Agarwal, Raaz Dwivedi. [Paper] - End-to-End Agentic RAG System Training for Traceable Diagnostic Reasoning <2026-02-01>
Qiaoyu Zheng, Yuze Sun, Chaoyi Wu, Weike Zhao, Pengcheng Qiu, Yongguo Yu, Kun Sun, Jian Zhang, Yanfeng Wang, Ya Zhang, Weidi Xie. [Paper] - Probing RLVR training instability through the lens of objective-level hacking <2026-02-01>
Yiming Dong, Kun Fu, Haoyu Li, Xinyuan Zhu, Yurou Liu, Lijing Shao, Jieping Ye, Zheng Wang. [Paper] - SetPO: Set-Level Policy Optimization for Diversity-Preserving LLM Reasoning <2026-02-01>
Chenyi Li, Yuan Zhang, Bo Wang, Guoqing Ma, Wei Tang, Haoyang Huang, Nan Duan. [Paper] - DISPO: Enhancing Training Efficiency and Stability in Reinforcement Learning for Large Language Model Mathematical Reasoning <2026-02-01>
Batuhan K. Karaman, Aditya Rawal, Suhaila Shakiah, Mohammad Ghavamzadeh, Mingyi Hong, Arijit Biswas, Ruida Zhou. [Paper] - Agentic Policy Optimization via Instruction-Policy Co-Evolution <2026-01-31>
Han Zhou, Xingchen Wan, Ivan Vulić, Anna Korhonen. [Paper] - Resource-Efficient Reinforcement for Reasoning Large Language Models via Dynamic One-Shot Policy Refinement <2026-01-31>
Yunjian Zhang, Sudong Wang, Yang Li, Peiran Xu, Conghao Zhou, Xiaoyue Ma, Jianing Li, Yao Zhu. [Paper] - Adaptive Ability Decomposing for Unlocking Large Reasoning Model Effective Reinforcement Learning <2026-01-31>
Zhipeng Chen, Xiaobo Qin, Wayne Xin Zhao, Youbin Wu, Ji-Rong Wen. [Paper] - Learning Reasoning Reward Models from Expert Demonstration via Inverse Reinforcement Learning <2026-01-31>
Claudio Fanconi, Nicolás Astorga, Mihaela van der Schaar. [Paper] - Agentic Reward Modeling: Verifying GUI Agent via Online Proactive Interaction <2026-01-31>
Chaoqun Cui, Jing Huang, Shijing Wang, Liming Zheng, Qingchao Kong, Zhixiong Zeng. [Paper] - Minerva: Reinforcement Learning with Verifiable Rewards for Cyber Threat Intelligence LLMs <2026-01-31>
Md Tanvirul Alam, Aritran Piplai, Ionut Cardei, Nidhi Rastogi, Peter J Worth. [Paper] - LLMs as High-Dimensional Nonlinear Autoregressive Models with Attention: Training, Alignment and Inference <2026-01-31>
Vikram Krishnamurthy. [Paper] - Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning <2026-01-30>
Yang Zhou, Sunzhu Li, Shunyu Liu, Wenkai Fang, Kongcheng Zhang, Jiale Zhao, Jingwen Yang, Yihe Zhou, Jianwei Lv, Tongya Zheng, Hengtong Lu, Wei Chen, Yan Xie, Mingli Song. [Paper] - Golden Goose: A Simple Trick to Synthesize Unlimited RLVR Tasks from Unverifiable Internet Text <2026-01-30>
Ximing Lu, David Acuna, Jaehun Jung, Jian Hu, Di Zhang, Shizhe Diao, Yunheng Zou, Shaokun Zhang, Brandon Cui, Mingjie Liu, Hyunwoo Kim, Prithviraj Ammanabrolu, Jan Kautz, Yi Dong, Yejin Choi. [Paper] - MulFeRL: Enhancing Reinforcement Learning with Verbal Feedback in a Multi-turn Loop <2026-01-30>
Xuancheng Li, Haitao Li, Yujia Zhou, YiqunLiu, Qingyao Ai. [Paper] - Warm Up Before You Train: Unlocking General Reasoning in Resource-Constrained Settings <2026-01-30>
Safal Shrestha, Minwu Kim, Aadim Nepal, Anubhav Shrestha, Keith Ross. [Paper] - Metis-SPECS: Decoupling Multimodal Learning via Self-distilled Preference-based Cold Start <2026-01-30>
Kun Chen, Peng Shi, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao, Lin Ma. [Paper] - Sharpness-Guided Group Relative Policy Optimization via Probability Shaping <2026-01-30>
Tue Le, Linh Ngo Van, Trung Le. [Paper] - Learn More with Less: Uncertainty Consistency Guided Query Selection for RLVR <2026-01-30>
Hao Yi, Yulan Hu, Xin Li, Sheng Ouyang, Lizhong Ding, Yong Liu. [Paper] - SSL: Sweet Spot Learning for Differentiated Guidance in Agentic Optimization <2026-01-30>
Jinyang Wu, Changpeng Yang, Yuhao Shen, Fangzhi Xu, Bolin Ni, Chonghua Liao, Yuchen Liu, Hongzhen Wang, Shuai Nie, Shuai Zhang, Haoran Luo, Jiaming Xu. [Paper] - HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning <2026-01-30>
Weiqi Wang, Xin Liu, Binxuan Huang, Hejie Cui, Rongzhi Zhang, Changlong Yu, Shuowei Jin, Jingfeng Yang, Qingyu Yin, Zhengyang Wang, Zheng Li, Yifan Gao, Priyanka Nigam, Bing Yin, Lihong Li, Yangqiu Song. [Paper] - Prepare Reasoning Language Models for Multi-Agent Debate with Self-Debate Reinforcement Learning <2026-01-29>
Chenxi Liu, Yanshuo Chen, Ruibo Chen, Tianyi Xiong, Tong Zheng, Heng Huang. [Paper] - ViSurf: Visual Supervised-and-Reinforcement Fine-Tuning for Large Vision-and-Language Models <2026-01-29>
Yuqi Liu, Liangyu Chen, Jiazhen Liu, Mingkang Zhu, Zhisheng Zhong, Bei Yu, Jiaya Jia. [Paper] - Less Noise, More Voice: Reinforcement Learning for Reasoning via Instruction Purification <2026-01-29>
Yiju Guo, Tianyi Hu, Zexu Sun, Yankai Lin. [Paper] - Do Reasoning Models Enhance Embedding Models? <2026-01-29>
Wun Yu Chan, Shaojin Chen, Huihao Jing, Kwun Hang Lau, Elton Chun-Chai Li, Zihao Wang, Haoran Li, Yangqiu Song. [Paper] - Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B Technical Report <2026-01-28>
Zhuoran Yang, Ed Li, Jianliang He, Aman Priyanshu, Baturay Saglam, Paul Kassianik, Sajana Weerawardhena, Anu Vellore, Blaine Nelson, Neusha Javidnia, Arthur Goldblatt, Fraser Burch, Avi Zohary, Assaf Eisenman, Mahdi Sabbaghi, Supriti Vijay, Rahim Dharssi, Dhruv Kedia, Kojin Oshiba, Yaron Singer, Amin Karbasi. [Paper] - Solver-in-the-Loop: MDP-Based Benchmarks for Self-Correction and Behavioral Rationality in Operations Research <2026-01-28>
Ruicheng Ao, David Simchi-Levi, Xinshang Wang. [Paper] - Training Reasoning Models on Saturated Problems via Failure-Prefix Conditioning <2026-01-28>
Minwu Kim, Safal Shrestha, Keith Ross. [Paper] - Reinforcement Learning via Self-Distillation <2026-01-28>
Jonas Hübotter, Frederike Lübeck, Lejs Behric, Anton Baumann, Marco Bagatella, Daniel Marta, Ido Hakimi, Idan Shenfeld, Thomas Kleine Buening, Carlos Guestrin, Andreas Krause. [Paper] - P2S: Probabilistic Process Supervision for General-Domain Reasoning Question Answering <2026-01-28>
Wenlin Zhong, Chengyuan Liu, Yiquan Wu, Bovin Tan, Changlong Sun, Yi Wang, Xiaozhong Liu, Kun Kuang. [Paper] - Harder Is Better: Boosting Mathematical Reasoning via Difficulty-Aware GRPO and Multi-Aspect Question Reformulation <2026-01-28>
Yanqi Dai, Yuxiang Ji, Xiao Zhang, Yong Wang, Xiangxiang Chu, Zhiwu Lu. [Paper] - Ranking-aware Reinforcement Learning for Ordinal Ranking <2026-01-28>
Aiming Hao, Chen Zhu, Jiashu Zhu, Jiahong Wu, Xiangxiang Chu. [Paper] - RubricHub: A Comprehensive and Highly Discriminative Rubric Dataset via Automated Coarse-to-Fine Generation <2026-01-28>
Sunzhu Li, Jiale Zhao, Miteto Wei, Huimin Ren, Yang Zhou, Jingwen Yang, Shunyu Liu, Kaike Zhang, Wei Chen. [Paper] - Endogenous Reprompting: Self-Evolving Cognitive Alignment for Unified Multimodal Models <2026-01-28>
Zhenchen Tang, Songlin Yang, Zichuan Wang, Bo Peng, Yang Li, Beibei Dong, Jing Dong. [Paper] - Mitigating LLM Hallucination via Behaviorally Calibrated Reinforcement Learning <2026-01-28>
Jiayun Wu, Jiashuo Liu, Zhiyuan Zeng, Tianyang Zhan, Tianle Cai, Wenhao Huang. [Paper] - Rewarding Intellectual Humility Learning When Not To Answer In Large Language Models <2026-01-27>
Abha Jha, Akanksha Mahajan, Ashwath Vaithinathan Aravindan, Praveen Saravanan, Sai Sailaja Policharla, Sonal Chaturbhuj Gehlot. [Paper] - Coupled Variational Reinforcement Learning for Language Model General Reasoning <2026-01-27>
Xueru Wen, Jie Lou, Yanjiang Liu, Hongyu Lin, Ben He, Xianpei Han, Le Sun, Yaojie Lu, Debing Zhang. [Paper] - DiVE-k: Differential Visual Reasoning for Fine-grained Image Recognition <2026-01-27>
Raja Kumar, Arka Sadhu, Ram Nevatia. [Paper] - Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward <2026-01-26>
Peter Chen, Xiaopeng Li, Ziniu Li, Wotao Yin, Xi Chen, Tianyi Lin. [Paper] - From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation <2026-01-26>
Yuxin Jiang, Yufei Wang, Qiyuan Zhang, Xingshan Zeng, Liangyou Li, Jierun Chen, Chaofan Tao, Haoli Bai, Lifeng Shang. [Paper] - PaperSearchQA: Learning to Search and Reason over Scientific Papers with RLVR <2026-01-26>
James Burgess, Jan N. Hansen, Duo Peng, Yuhui Zhang, Alejandro Lozano, Min Woo Sun, Emma Lundberg, Serena Yeung-Levy. [Paper] - When Sharpening Becomes Collapse: Sampling Bias and Semantic Coupling in RL with Verifiable Rewards <2026-01-26>
Mingyuan Fan, Weiguang Han, Daixin Wang, Cen Chen, Zhiqiang Zhang, Jun Zhou. [Paper] - SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data <2026-01-25>
Wenkai Fang, Shunyu Liu, Yang Zhou, Kongcheng Zhang, Tongya Zheng, Kaixuan Chen, Mingli Song, Dacheng Tao. [Paper] - Not All Steps are Informative: On the Linearity of LLMs' RLVR Training <2026-01-25>
Tianle Wang, Zhongyuan Wu, Shenghao Jin, Hao Xu, Wei Chen, Ning Miao. [Paper] - Online Difficulty Filtering for Reasoning Oriented Reinforcement Learning <2026-01-25>
Sanghwan Bae, Jiwoo Hong, Min Young Lee, Hanbyul Kim, JeongYeon Nam, Donghyun Kwak. [Paper] - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal <2026-01-24>
Yongxin Wang, Zhicheng Yang, Meng Cao, Mingfei Han, Haokun Lin, Yingying Zhu, Xiaojun Chang, Xiaodan Liang. [Paper] - VaseVQA: Multimodal Agent and Benchmark for Ancient Greek Pottery <2026-01-24>
Jinchao Ge, Tengfei Cheng, Biao Wu, Zeyu Zhang, Shiya Huang, Judith Bishop, Gillian Shepherd, Meng Fang, Ling Chen, Yang Zhao. [Paper] - Beyond Outcome Verification: Verifiable Process Reward Models for Structured Reasoning <2026-01-23>
Massimiliano Pronesti, Anya Belz, Yufang Hou. [Paper] - Reasoning Promotes Robustness in Theory of Mind Tasks <2026-01-23>
Ian B. de Haan, Peter van der Putten, Max van Duijn. [Paper] - PhysProver: Advancing Automatic Theorem Proving for Physics <2026-01-22>
Hanning Zhang, Ruida Wang, Rui Pan, Wenyuan Wang, Bingxu Meng, Tong Zhang. [Paper] - Your Group-Relative Advantage Is Biased <2026-01-22>
Fengkai Yang, Zherui Chen, Xiaohan Wang, Xiaodong Lu, Jiajun Chai, Guojun Yin, Wei Lin, Shuai Ma, Fuzhen Zhuang, Deqing Wang, Yaodong Yang, Jianxin Li, Yikun Ban. [Paper] - Can LLM Infer Risk Information From MCP Server System Logs? <2026-01-22>
Jiayi Fu, Yuansen Zhang, Yinggui Wang. [Paper] - DARL: Encouraging Diverse Answers for General Reasoning without Verifiers <2026-01-21>
Chongxuan Huang, Lei Lin, Xiaodong Shi, Wenping Hu, Ruiming Tang. [Paper] - LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR <2026-01-20>
Said Taghadouini, Adrien Cavaillès, Baptiste Aubertin. [Paper] - ICPO: Illocution-Calibrated Policy Optimization for Multi-Turn Conversation <2026-01-20>
Zhebo Wang, Xiaohu Mu, Zijie Zhou, Mohan Li, Wenpeng Xing, Dezhang Kong, Meng Han. [Paper] - Balancing Classification and Calibration Performance in Decision-Making LLMs via Calibration Aware Reinforcement Learning <2026-01-19>
Duygu Nur Yaldiz, Evangelia Spiliopoulou, Zheng Qi, Siddharth Varia, Srikanth Doss, Nikolaos Pappas. [Paper] - Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective <2026-01-19>
Zhezheng Hao, Hong Wang, Haoyang Liu, Jian Luo, Jiarui Yu, Hande Dong, Qiang Lin, Can Wang, Jiawei Chen. [Paper] - Graph Reasoning Paradigm: Structured and Symbolic Reasoning with Topology-Aware Reinforcement Learning for Large Language Models <2026-01-19>
Runxuan Liu, Xianhao Ou, Xinyan Ma, Jiyuan Wang, Jiafeng Liang, Jiaqi Li, Tao He, Zheng Chu, Rongchuan Mu, Zekun Wang, Baoxin Wang, Dayong Wu, Ming Liu, Shijin Wang, Guoping Hu, Bing Qin. [Paper] - Incentivizing In-depth Reasoning over Long Contexts with Process Advantage Shaping <2026-01-18>
Miao Peng, Weizhou Shen, Nuo Chen, Chenliang Li, Ming Yan, Jia Li. [Paper] - Aletheia: What Makes RLVR For Code Verifiers Tick? <2026-01-17>
Vatsal Venkatkrishna, Indraneil Paul, Iryna Gurevych. [Paper] - Post-Training as Reweighting: A Stochastic View of Reasoning Trajectories in Language Models <2026-01-17>
Dake Bu, Wei Huang, Andi Han, Atsushi Nitanda, Bo Xue, Qingfu Zhang, Hau-San Wong, Taiji Suzuki. [Paper] - AGGC: Adaptive Group Gradient Clipping for Stabilizing Large Language Model Training <2026-01-17>
Zhiyuan Li, Yuan Wu, Yi Chang. [Paper] - Reasoning Promotes Robustness in Theory of Mind Tasks <2026-01-23>
Ian B. de Haan, Peter van der Putten, Max van Duijn. [Paper] - PhysProver: Advancing Automatic Theorem Proving for Physics <2026-01-22>
Hanning Zhang, Ruida Wang, Rui Pan, Wenyuan Wang, Bingxu Meng, Tong Zhang. [Paper] - Your Group-Relative Advantage Is Biased <2026-01-22>
Fengkai Yang, Zherui Chen, Xiaohan Wang, Xiaodong Lu, Jiajun Chai, Guojun Yin, Wei Lin, Shuai Ma, Fuzhen Zhuang, Deqing Wang, Yaodong Yang, Jianxin Li, Yikun Ban. [Paper] - When Sharpening Becomes Collapse: Sampling Bias and Semantic Coupling in RL with Verifiable Rewards <2026-01-22>
Mingyuan Fan, Weiguang Han, Daixin Wang, Cen Chen, Zhiqiang Zhang, Jun Zhou. [Paper] - Can LLM Infer Risk Information From MCP Server System Logs? <2026-01-22>
Jiayi Fu, Yuansen Zhang, Yinggui Wang. [Paper] - DARL: Encouraging Diverse Answers for General Reasoning without Verifiers <2026-01-21>
Chongxuan Huang, Lei Lin, Xiaodong Shi, Wenping Hu, Ruiming Tang. [Paper] - LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR <2026-01-20>
Said Taghadouini, Adrien Cavaillès, Baptiste Aubertin. [Paper] - ICPO: Illocution-Calibrated Policy Optimization for Multi-Turn Conversation <2026-01-20>
Zhebo Wang, Xiaohu Mu, Zijie Zhou, Mohan Li, Wenpeng Xing, Dezhang Kong, Meng Han. [Paper] - Balancing Classification and Calibration Performance in Decision-Making LLMs via Calibration Aware Reinforcement Learning <2026-01-19>
Duygu Nur Yaldiz, Evangelia Spiliopoulou, Zheng Qi, Siddharth Varia, Srikanth Doss, Nikolaos Pappas. [Paper] - Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective <2026-01-19>
Zhezheng Hao, Hong Wang, Haoyang Liu, Jian Luo, Jiarui Yu, Hande Dong, Qiang Lin, Can Wang, Jiawei Chen. [Paper] - Graph Reasoning Paradigm: Structured and Symbolic Reasoning with Topology-Aware Reinforcement Learning for Large Language Models <2026-01-19>
Runxuan Liu, Xianhao Ou, Xinyan Ma, Jiyuan Wang, Jiafeng Liang, Jiaqi Li, Tao He, Zheng Chu, Rongchuan Mu, Zekun Wang, Baoxin Wang, Dayong Wu, Ming Liu, Shijin Wang, Guoping Hu, Bing Qin. [Paper] - Incentivizing In-depth Reasoning over Long Contexts with Process Advantage Shaping <2026-01-18>
Miao Peng, Weizhou Shen, Nuo Chen, Chenliang Li, Ming Yan, Jia Li. [Paper] - Aletheia: What Makes RLVR For Code Verifiers Tick? <2026-01-17>
Vatsal Venkatkrishna, Indraneil Paul, Iryna Gurevych. [Paper] - Post-Training as Reweighting: A Stochastic View of Reasoning Trajectories in Language Models <2026-01-17>
Dake Bu, Wei Huang, Andi Han, Atsushi Nitanda, Bo Xue, Qingfu Zhang, Hau-San Wong, Taiji Suzuki. [Paper] - AGGC: Adaptive Group Gradient Clipping for Stabilizing Large Language Model Training <2026-01-17>
Zhiyuan Li, Yuan Wu, Yi Chang. [Paper] - Efficient Reinforcement Learning with Semantic and Token Entropy for LLM Reasoning <2026-01-16>
Hongye Cao, Zhixin Bai, Ziyue Peng, Boyan Wang, Tianpei Yang, Jing Huo, Yuyao Zhang, Yang Gao. [Paper] - Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs <2026-01-16>
Lecheng Yan, Ruizhe Li, Guanhua Chen, Qing Li, Jiahui Geng, Wenxi Li, Vincent Wang, Chris Lee. [Paper] - Many Minds from One Model: Bayesian-Inspired Transformers for Population Diversity <2026-01-15>
Diji Yang, Yi Zhang. [Paper] - Better LLM Reasoning via Dual-Play <2026-01-15>
Zhengxin Zhang, Chengyu Huang, Aochong Oliver Li, Claire Cardie. [Paper] - Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning <2026-01-15>
Rui Liu, Dian Yu, Tong Zheng, Runpeng Dai, Zongxia Li, Wenhao Yu, Zhenwen Liang, Linfeng Song, Haitao Mi, Pratap Tokekar, Dong Yu. [Paper] - Future-as-Label: Scalable Supervision from Real-World Outcomes <2026-01-14>
Benjamin Turtel, Paul Wilczewski, Danny Franklin, Kris Skothiem. [Paper] - GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR <2026-01-14>
Jiaying Zhang, Lei Shi, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He. [Paper] - Precision over Diversity: High-Precision Reward Generalizes to Robust Instruction Following <2026-01-13>
Yirong Zeng, Yufei Liu, Xiao Ding, Yutai Hou, Yuxian Wang, Haonan Song, Wu Ning, Dandan Tu, Qixun Zhang, Bibo Cai, Yuxiang He, Ting Liu. [Paper] - JudgeRLVR: Judge First, Generate Second for Efficient Reasoning <2026-01-13>
Jiangshan Duo, Hanyu Li, Hailin Zhang, Yudong Wang, Sujian Li, Liang Zhao. [Paper] - RubricHub: A Comprehensive and Highly Discriminative Rubric Dataset via Automated Coarse-to-Fine Generation <2026-01-13>
Sunzhu Li, Jiale Zhao, Miteto Wei, Huimin Ren, Yang Zhou, Jingwen Yang, Shunyu Liu, Kaike Zhang, Wei Chen. [Paper] - The End of Reward Engineering: How LLMs Are Redefining Multi-Agent Coordination <2026-01-13>
Haoran Su, Yandong Sun, Congjia Yu. [Paper] - ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement Learning <2026-01-13>
Jinpeng Wang, Chao Li, Ting Ye, Mengyuan Zhang, Wei Liu, Jian Luan. [Paper] - Beyond Single-Shot: Multi-step Tool Retrieval via Query Planning <2026-01-12>
Wei Fang, James Glass. [Paper] - Can Reasoning Help Large Language Models Capture Human Annotator Disagreement? <2026-01-12>
Jingwei Ni, Yu Fan, Vilém Zouhar, Donya Rooein, Alexander Hoyle, Mrinmaya Sachan, Markus Leippold, Dirk Hovy, Elliott Ash. [Paper] - SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts <2026-01-12>
Bingshuai Liu, Ante Wang, Zijun Min, Liang Yao, Haibo Zhang, Yang Liu, Xu Han, Peng Li, Anxiang Zeng, Jinsong Su. [Paper] - Reward Modeling from Natural Language Human Feedback <2026-01-12>
Zongqi Wang, Rui Wang, Yuchuan Wu, Yiyao Yu, Pinyi Zhang, Shaoning Sun, Yujiu Yang, Yongbin Li. [Paper] - Segmental Advantage Estimation: Enhancing PPO for Long-Context LLM Training <2026-01-12>
Xue Gong, Qi Yi, Ziyuan Nan, Guanhua Huang, Kejiao Li, Yuhao Jiang, Ruibin Xiong, Zenan Xu, Jiaming Guo, Shaohui Peng, Bo Zhou. [Paper] - ReasonTabQA: A Comprehensive Benchmark for Table Question Answering from Real World Industrial Scenarios <2026-01-12>
Changzai Pan, Jie Zhang, Kaiwen Wei, Chenshuo Pan, Yu Zhao, Jingwang Huang, Jian Yang, Zhenhe Wu, Haoyang Zeng, Xiaoyan Gu, Weichao Sun, Yanbo Zhai, Yujie Mao, Zhuoru Jiang, Jiang Zhong, Shuangyong Song, Yongxiang Li, Zhongjiang He. [Paper] - Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy <2026-01-11>
Shujian Gao, Yuan Wang, Jiangtao Yan, Zuxuan Wu, Yu-Gang Jiang. [Paper] - GanitLLM: Difficulty-Aware Bengali Mathematical Reasoning through Curriculum-GRPO <2026-01-11>
Shubhashis Roy Dipta, Khairul Mahbub, Nadia Najjar. [Paper] - Plasticity vs. Rigidity: The Impact of Low-Rank Adapters on Reasoning on a Micro-Budget <2026-01-10>
Zohaib Khan, Omer Tafveez, Zoha Hayat Bhatti. [Paper] - Revisiting Entropy in Reinforcement Learning for Large Reasoning Models <2026-01-10>
Renren Jin, Pengzhi Gao, Yuqi Ren, Zhuowen Han, Tongxuan Zhang, Wuwei Huang, Wei Liu, Jian Luan, Deyi Xiong. [Paper] - IIB-LPO: Latent Policy Optimization via Iterative Information Bottleneck <2026-01-09>
Huilin Deng, Hongchen Luo, Yue Zhu, Long Li, Zhuoyue Chen, Xinghao Zhao, Ming Li, Jihai Zhang, Mengchang Wang, Yang Cao, Yu Kang. [Paper] - Shorter but not Worse: Frugal Reasoning via Easy Samples as Length Regularizers in Math RLVR <2026-01-09>
Abdelaziz Bounhar, Hadi Abdine, Evan Dufraisse, Ahmad Chamma, Amr Mohamed, Dani Bouch, Michalis Vazirgiannis, Guokan Shang. [Paper] - From Off-Policy to On-Policy: Enhancing GUI Agents via Bi-level Expert-to-Policy Assimilation <2026-01-09>
Zezhou Wang, Ziyun Zhang, Xiaoyi Zhang, Zhuzhong Qian, Yan Lu. [Paper] - Orchestrating Tokens and Sequences: Dynamic Hybrid Policy Optimization for RLVR <2026-01-09>
Zijun Min, Bingshuai Liu, Ante Wang, Long Zhang, Anxiang Zeng, Haibo Zhang, Jinsong Su. [Paper] - Learning to Extract Rational Evidence via Reinforcement Learning for Retrieval-Augmented Generation <2026-01-09>
Xinping Zhao, Shouzheng Huang, Yan Zhong, Xinshuo Hu, Meishan Zhang, Baotian Hu, Min Zhang. [Paper] - Reinforced Efficient Reasoning via Semantically Diverse Exploration <2026-01-08>
Ziqi Zhao, Zhaochun Ren, Jiahong Zou, Liu Yang, Zhiwei Xu, Xuri Ge, Zhumin Chen, Xinyu Ma, Daiting Shi, Shuaiqiang Wang, Dawei Yin, Xin Xin. [Paper] - Character-R1: Enhancing Role-Aware Reasoning in Role-Playing Agents via RLVR <2026-01-08>
Yihong Tang, Kehai Chen, Xuefeng Bai, Benyou Wang, Zeming Liu, Haifeng Wang, Min Zhang. [Paper] - Not All Steps are Informative: On the Linearity of LLMs' RLVR Training <2026-01-08>
Tianle Wang, Zhongyuan Wu, Shenghao Jin, Hao Xu, Wei Chen, Ning Miao. [Paper] - Trade-R1: Bridging Verifiable Rewards to Stochastic Environments via Process-Level Reasoning Verification <2026-01-08>
Rui Sun, Yifan Sun, Sheng Xu, Li Zhao, Jing Li, Daxin Jiang, Cheng Hua, Zuo Bai. [Paper] - Rate or Fate? RLVR: Reinforcement Learning with Verifiable Noisy Rewards <2026-01-07>
Ali Rad, Khashayar Filom, Darioush Keivan, Peyman Mohajerin Esfahani, Ehsan Kamalinejad. [Paper] - Anti-Length Shift: Dynamic Outlier Truncation for Training Efficient Reasoning Models <2026-01-07>
Wei Wu, Liyi Chen, Congxi Xiao, Tianfu Wang, Qimeng Wang, Chengqiang Lu, Yan Gao, Yi Wu, Yao Hu, Hui Xiong. [Paper] - Step Potential Advantage Estimation: Harnessing Intermediate Confidence and Correctness for Efficient Mathematical Reasoning <2026-01-07>
Fei Wu, Zhenrong Zhang, Qikai Chang, Jianshu Zhang, Quan Liu, Jun Du. [Paper] - ETR: Outcome-Guided Elastic Trust Regions for Policy Optimization <2026-01-07>
Shijie Zhang, Kevin Zhang, Zheyuan Gu, Xiang Guo, Rujun Guo, Shaoyu Liu, Guanjun Jiang, Xiaozhao Wang. [Paper] - Efficient Reinforcement Learning with Semantic and Token Entropy for LLM Reasoning <2026-01-16>
Hongye Cao, Zhixin Bai, Ziyue Peng, Boyan Wang, Tianpei Yang, Jing Huo, Yuyao Zhang, Yang Gao. [Paper] - Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs <2026-01-16>
Lecheng Yan, Ruizhe Li, Guanhua Chen, Qing Li, Jiahui Geng, Wenxi Li, Vincent Wang, Chris Lee. [Paper] - Many Minds from One Model: Bayesian-Inspired Transformers for Population Diversity <2026-01-15>
Diji Yang, Yi Zhang. [Paper] - Better LLM Reasoning via Dual-Play <2026-01-15>
Zhengxin Zhang, Chengyu Huang, Aochong Oliver Li, Claire Cardie. [Paper] - Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning <2026-01-15>
Rui Liu, Dian Yu, Tong Zheng, Runpeng Dai, Zongxia Li, Wenhao Yu, Zhenwen Liang, Linfeng Song, Haitao Mi, Pratap Tokekar, Dong Yu. [Paper] - Future-as-Label: Scalable Supervision from Real-World Outcomes <2026-01-14>
Benjamin Turtel, Paul Wilczewski, Danny Franklin, Kris Skothiem. [Paper] - GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR <2026-01-14>
Jiaying Zhang, Lei Shi, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He. [Paper] - Precision over Diversity: High-Precision Reward Generalizes to Robust Instruction Following <2026-01-13>
Yirong Zeng, Yufei Liu, Xiao Ding, Yutai Hou, Yuxian Wang, Haonan Song, Wu Ning, Dandan Tu, Qixun Zhang, Bibo Cai, Yuxiang He, Ting Liu. [Paper] - Your Group-Relative Advantage Is Biased <2026-01-13>
Fengkai Yang, Zherui Chen, Xiaohan Wang, Xiaodong Lu, Jiajun Chai, Guojun Yin, Wei Lin, Shuai Ma, Fuzhen Zhuang, Deqing Wang, Yaodong Yang, Jianxin Li, Yikun Ban. [Paper] - JudgeRLVR: Judge First, Generate Second for Efficient Reasoning <2026-01-13>
Jiangshan Duo, Hanyu Li, Hailin Zhang, Yudong Wang, Sujian Li, Liang Zhao. [Paper] - RubricHub: A Comprehensive and Highly Discriminative Rubric Dataset via Automated Coarse-to-Fine Generation <2026-01-13>
Sunzhu Li, Jiale Zhao, Miteto Wei, Huimin Ren, Yang Zhou, Jingwen Yang, Shunyu Liu, Kaike Zhang, Wei Chen. [Paper] - The End of Reward Engineering: How LLMs Are Redefining Multi-Agent Coordination <2026-01-13>
Haoran Su, Yandong Sun, Congjia Yu. [Paper] - ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement Learning <2026-01-13>
Jinpeng Wang, Chao Li, Ting Ye, Mengyuan Zhang, Wei Liu, Jian Luan. [Paper] - Beyond Single-Shot: Multi-step Tool Retrieval via Query Planning <2026-01-12>
Wei Fang, James Glass. [Paper] - Can Reasoning Help Large Language Models Capture Human Annotator Disagreement? <2026-01-12>
Jingwei Ni, Yu Fan, Vilém Zouhar, Donya Rooein, Alexander Hoyle, Mrinmaya Sachan, Markus Leippold, Dirk Hovy, Elliott Ash. [Paper] - SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts <2026-01-12>
Bingshuai Liu, Ante Wang, Zijun Min, Liang Yao, Haibo Zhang, Yang Liu, Xu Han, Peng Li, Anxiang Zeng, Jinsong Su. [Paper] - Reward Modeling from Natural Language Human Feedback <2026-01-12>
Zongqi Wang, Rui Wang, Yuchuan Wu, Yiyao Yu, Pinyi Zhang, Shaoning Sun, Yujiu Yang, Yongbin Li. [Paper] - Segmental Advantage Estimation: Enhancing PPO for Long-Context LLM Training <2026-01-12>
Xue Gong, Qi Yi, Ziyuan Nan, Guanhua Huang, Kejiao Li, Yuhao Jiang, Ruibin Xiong, Zenan Xu, Jiaming Guo, Shaohui Peng, Bo Zhou. [Paper] - ReasonTabQA: A Comprehensive Benchmark for Table Question Answering from Real World Industrial Scenarios <2026-01-12>
Changzai Pan, Jie Zhang, Kaiwen Wei, Chenshuo Pan, Yu Zhao, Jingwang Huang, Jian Yang, Zhenhe Wu, Haoyang Zeng, Xiaoyan Gu, Weichao Sun, Yanbo Zhai, Yujie Mao, Zhuoru Jiang, Jiang Zhong, Shuangyong Song, Yongxiang Li, Zhongjiang He. [Paper] - Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy <2026-01-11>
Shujian Gao, Yuan Wang, Jiangtao Yan, Zuxuan Wu, Yu-Gang Jiang. [Paper] - GanitLLM: Difficulty-Aware Bengali Mathematical Reasoning through Curriculum-GRPO <2026-01-11>
Shubhashis Roy Dipta, Khairul Mahbub, Nadia Najjar. [Paper] - Plasticity vs. Rigidity: The Impact of Low-Rank Adapters on Reasoning on a Micro-Budget <2026-01-10>
Zohaib Khan, Omer Tafveez, Zoha Hayat Bhatti. [Paper] - Revisiting Entropy in Reinforcement Learning for Large Reasoning Models <2026-01-10>
Renren Jin, Pengzhi Gao, Yuqi Ren, Zhuowen Han, Tongxuan Zhang, Wuwei Huang, Wei Liu, Jian Luan, Deyi Xiong. [Paper] - IIB-LPO: Latent Policy Optimization via Iterative Information Bottleneck <2026-01-09>
Huilin Deng, Hongchen Luo, Yue Zhu, Long Li, Zhuoyue Chen, Xinghao Zhao, Ming Li, Jihai Zhang, Mengchang Wang, Yang Cao, Yu Kang. [Paper] - Shorter but not Worse: Frugal Reasoning via Easy Samples as Length Regularizers in Math RLVR <2026-01-09>
Abdelaziz Bounhar, Hadi Abdine, Evan Dufraisse, Ahmad Chamma, Amr Mohamed, Dani Bouch, Michalis Vazirgiannis, Guokan Shang. [Paper] - From Off-Policy to On-Policy: Enhancing GUI Agents via Bi-level Expert-to-Policy Assimilation <2026-01-09>
Zezhou Wang, Ziyun Zhang, Xiaoyi Zhang, Zhuzhong Qian, Yan Lu. [Paper] - Orchestrating Tokens and Sequences: Dynamic Hybrid Policy Optimization for RLVR <2026-01-09>
Zijun Min, Bingshuai Liu, Ante Wang, Long Zhang, Anxiang Zeng, Haibo Zhang, Jinsong Su. [Paper] - Learning to Extract Rational Evidence via Reinforcement Learning for Retrieval-Augmented Generation <2026-01-09>
Xinping Zhao, Shouzheng Huang, Yan Zhong, Xinshuo Hu, Meishan Zhang, Baotian Hu, Min Zhang. [Paper] - Reinforced Efficient Reasoning via Semantically Diverse Exploration <2026-01-08>
Ziqi Zhao, Zhaochun Ren, Jiahong Zou, Liu Yang, Zhiwei Xu, Xuri Ge, Zhumin Chen, Xinyu Ma, Daiting Shi, Shuaiqiang Wang, Dawei Yin, Xin Xin. [Paper] - Character-R1: Enhancing Role-Aware Reasoning in Role-Playing Agents via RLVR <2026-01-08>
Yihong Tang, Kehai Chen, Xuefeng Bai, Benyou Wang, Zeming Liu, Haifeng Wang, Min Zhang. [Paper] - Not All Steps are Informative: On the Linearity of LLMs' RLVR Training <2026-01-08>
Tianle Wang, Zhongyuan Wu, Shenghao Jin, Hao Xu, Wei Chen, Ning Miao. [Paper] - Trade-R1: Bridging Verifiable Rewards to Stochastic Environments via Process-Level Reasoning Verification <2026-01-08>
Rui Sun, Yifan Sun, Sheng Xu, Li Zhao, Jing Li, Daxin Jiang, Cheng Hua, Zuo Bai. [Paper] - Rate or Fate? RLVR: Reinforcement Learning with Verifiable Noisy Rewards <2026-01-07>
Ali Rad, Khashayar Filom, Darioush Keivan, Peyman Mohajerin Esfahani, Ehsan Kamalinejad. [Paper] - Anti-Length Shift: Dynamic Outlier Truncation for Training Efficient Reasoning Models <2026-01-07>
Wei Wu, Liyi Chen, Congxi Xiao, Tianfu Wang, Qimeng Wang, Chengqiang Lu, Yan Gao, Yi Wu, Yao Hu, Hui Xiong. [Paper] - Step Potential Advantage Estimation: Harnessing Intermediate Confidence and Correctness for Efficient Mathematical Reasoning <2026-01-07>
Fei Wu, Zhenrong Zhang, Qikai Chang, Jianshu Zhang, Quan Liu, Jun Du. [Paper] - ETR: Outcome-Guided Elastic Trust Regions for Policy Optimization <2026-01-07>
Shijie Zhang, Kevin Zhang, Zheyuan Gu, Xiang Guo, Rujun Guo, Shaoyu Liu, Guanjun Jiang, Xiaozhao Wang. [Paper] - Think Outside the Policy: In-Context Steered Policy Optimization <2026-01-07>
Hsiu-Yuan Huang, Chenming Tang, Weijie Liu, Clive Bai, Saiyong Yang, Yunfang Wu. [Paper] - DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search <2026-01-07>
Fang Wu, Weihao Xuan, Heli Qi, Ximing Lu, Aaron Tu, Li Erran Li, Yejin Choi. [Paper] - The Invisible Leash: Why RLVR May or May Not Escape Its Origin <2026-01-07>
Fang Wu, Weihao Xuan, Ximing Lu, Mingjie Liu, Yi Dong, Zaid Harchaoui, Yejin Choi. [Paper] - UltraLogic: Enhancing LLM Reasoning through Large-Scale Data Synthesis and Bipolar Float Reward <2026-01-06>
Yile Liu, Yixian Liu, Zongwei Li, Yufei Huang, Xinhua Feng, Zhichao Hu, Jinglu Hu, Jianfeng Yan, Fengzong Lian, Yuhong Liu. [Paper] - Do Not Step Into the Same River Twice: Learning to Reason from Trial and Error <2026-01-06>
Chenming Tang, Hsiu-Yuan Huang, Weijie Liu, Clive Bai, Saiyong Yang, Yunfang Wu. [Paper] - Evaluating Parameter Efficient Methods for RLVR <2025-12-30>
Qingyu Yin, Yulun Wu, Zhennan Shen, Sunbowen Li, Zhilin Wang, Yanshu Li, Chak Tou Leong, Jiale Kang, Jinjin Gu. [Paper] - OpenSIR: Open-Ended Self-Improving Reasoner <2025-12-30>
Wai-Chung Kwan, Joshua Ong Jun Leang, Pavlos Vougiouklis, Jeff Z. Pan, Marco Valentino, Pasquale Minervini. [Paper] - Audited Skill-Graph Self-Improvement for Agentic LLMs via Verifiable Rewards, Experience Synthesis, and Continual Memory <2025-12-28>
Ken Huang, Jerry Huang. [Paper] - No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping <2025-12-27>
Thanh-Long V. Le, Myeongho Jeon, Kim Vu, Viet Lai, Eunho Yang. [Paper] - Search Self-play: Pushing the Frontier of Agent Capability without Supervision <2025-12-26>
Hongliang Lu, Yuhang Wen, Pengyu Cheng, Ruijin Ding, Jiaqi Guo, Haotian Xu, Chutian Wang, Haonan Chen, Xiaoxi Jiang, Guanjun Jiang. [Paper] - StepFun-Formalizer: Unlocking the Autoformalization Potential of LLMs through Knowledge-Reasoning Fusion <2025-12-26>
Yutong Wu, Di Huang, Ruosi Wan, Yue Peng, Shijie Shang, Chenrui Cao, Lei Qi, Rui Zhang, Zidong Du, Jie Yan, Xing Hu. [Paper] - AnesSuite: A Comprehensive Benchmark and Dataset Suite for Anesthesiology Reasoning in LLMs <2025-12-25>
Xiang Feng, Wentao Jiang, Zengmao Wang, Yong Luo, Pingbo Xu, Baosheng Yu, Hua Jin, Bo Du, Jing Zhang. [Paper] - Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards <2025-12-25>
Xinyu Tang, Yuliang Zhan, Zhixun Li, Wayne Xin Zhao, Zhenduo Zhang, Zujie Wen, Zhiqiang Zhang, Jun Zhou. [Paper] - Mitigating LLM Hallucination via Behaviorally Calibrated Reinforcement Learning <2025-12-25>
Jiayun Wu, Jiashuo Liu, Zhiyuan Zeng, Tianyang Zhan, Tianle Cai, Wenhao Huang. [Paper] - IIB-LPO: Latent Policy Optimization via Iterative Information Bottleneck <2026-01-09>
Huilin Deng, Hongchen Luo, Yue Zhu, Long Li, Zhuoyue Chen, Xinghao Zhao, Ming Li, Jihai Zhang, Mengchang Wang, Yang Cao, Yu Kang. [Paper] - Shorter but not Worse: Frugal Reasoning via Easy Samples as Length Regularizers in Math RLVR <2026-01-09>
Abdelaziz Bounhar, Hadi Abdine, Evan Dufraisse, Ahmad Chamma, Amr Mohamed, Dani Bouch, Michalis Vazirgiannis, Guokan Shang. [Paper] - From Off-Policy to On-Policy: Enhancing GUI Agents via Bi-level Expert-to-Policy Assimilation <2026-01-09>
Zezhou Wang, Ziyun Zhang, Xiaoyi Zhang, Zhuzhong Qian, Yan Lu. [Paper] - SPEC-RL: Accelerating On-Policy Reinforcement Learning via Speculative Rollouts <2026-01-09>
Bingshuai Liu, Ante Wang, Zijun Min, Liang Yao, Haibo Zhang, Yang Liu, Anxiang Zeng, Jinsong Su. [Paper] - Orchestrating Tokens and Sequences: Dynamic Hybrid Policy Optimization for RLVR <2026-01-09>
Zijun Min, Bingshuai Liu, Ante Wang, Long Zhang, Anxiang Zeng, Haibo Zhang, Jinsong Su. [Paper] - Learning to Extract Rational Evidence via Reinforcement Learning for Retrieval-Augmented Generation <2026-01-09>
Xinping Zhao, Shouzheng Huang, Yan Zhong, Xinshuo Hu, Meishan Zhang, Baotian Hu, Min Zhang. [Paper] - Reinforced Efficient Reasoning via Semantically Diverse Exploration <2026-01-08>
Ziqi Zhao, Zhaochun Ren, Jiahong Zou, Liu Yang, Zhiwei Xu, Xuri Ge, Zhumin Chen, Xinyu Ma, Daiting Shi, Shuaiqiang Wang, Dawei Yin, Xin Xin. [Paper] - Precision over Diversity: High-Precision Reward Generalizes to Robust Instruction Following <2026-01-08>
Yirong Zeng, Yufei Liu, Xiao Ding, Yutai Hou, Yuxian Wang, Haonan Song, Wu Ning, Dandan Tu, Qixun Zhang, Bibo Cai, Yuxiang He, Ting Liu. [Paper] - Character-R1: Enhancing Role-Aware Reasoning in Role-Playing Agents via RLVR <2026-01-08>
Yihong Tang, Kehai Chen, Xuefeng Bai, Benyou Wang, Zeming Liu, Haifeng Wang, Min Zhang. [Paper] - Not All Steps are Informative: On the Linearity of LLMs' RLVR Training <2026-01-08>
Tianle Wang, Zhongyuan Wu, Shenghao Jin, Hao Xu, Wei Chen, Ning Miao. [Paper] - Trade-R1: Bridging Verifiable Rewards to Stochastic Environments via Process-Level Reasoning Verification <2026-01-08>
Rui Sun, Yifan Sun, Sheng Xu, Li Zhao, Jing Li, Daxin Jiang, Cheng Hua, Zuo Bai. [Paper] - Rate or Fate? RLVR: Reinforcement Learning with Verifiable Noisy Rewards <2026-01-07>
Ali Rad, Khashayar Filom, Darioush Keivan, Peyman Mohajerin Esfahani, Ehsan Kamalinejad. [Paper] - Anti-Length Shift: Dynamic Outlier Truncation for Training Efficient Reasoning Models <2026-01-07>
Wei Wu, Liyi Chen, Congxi Xiao, Tianfu Wang, Qimeng Wang, Chengqiang Lu, Yan Gao, Yi Wu, Yao Hu, Hui Xiong. [Paper] - Step Potential Advantage Estimation: Harnessing Intermediate Confidence and Correctness for Efficient Mathematical Reasoning <2026-01-07>
Fei Wu, Zhenrong Zhang, Qikai Chang, Jianshu Zhang, Quan Liu, Jun Du. [Paper] - ETR: Outcome-Guided Elastic Trust Regions for Policy Optimization <2026-01-07>
Shijie Zhang, Kevin Zhang, Zheyuan Gu, Xiang Guo, Rujun Guo, Shaoyu Liu, Guanjun Jiang, Xiaozhao Wang. [Paper] - Think Outside the Policy: In-Context Steered Policy Optimization <2026-01-07>
Hsiu-Yuan Huang, Chenming Tang, Weijie Liu, Clive Bai, Saiyong Yang, Yunfang Wu. [Paper] - DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search <2026-01-07>
Fang Wu, Weihao Xuan, Heli Qi, Ximing Lu, Aaron Tu, Li Erran Li, Yejin Choi. [Paper] - The Invisible Leash: Why RLVR May or May Not Escape Its Origin <2026-01-07>
Fang Wu, Weihao Xuan, Ximing Lu, Mingjie Liu, Yi Dong, Zaid Harchaoui, Yejin Choi. [Paper] - UltraLogic: Enhancing LLM Reasoning through Large-Scale Data Synthesis and Bipolar Float Reward <2026-01-06>
Yile Liu, Yixian Liu, Zongwei Li, Yufei Huang, Xinhua Feng, Zhichao Hu, Jinglu Hu, Jianfeng Yan, Fengzong Lian, Yuhong Liu. [Paper] - Do Not Step Into the Same River Twice: Learning to Reason from Trial and Error <2026-01-06>
Chenming Tang, Hsiu-Yuan Huang, Weijie Liu, Clive Bai, Saiyong Yang, Yunfang Wu. [Paper] - Many Minds from One Model: Bayesian Transformers for Population Intelligence <2025-12-31>
Diji Yang, Yi Zhang. [Paper] - Evaluating Parameter Efficient Methods for RLVR <2025-12-30>
Qingyu Yin, Yulun Wu, Zhennan Shen, Sunbowen Li, Zhilin Wang, Yanshu Li, Chak Tou Leong, Jiale Kang, Jinjin Gu. [Paper] - OpenSIR: Open-Ended Self-Improving Reasoner <2025-12-30>
Wai-Chung Kwan, Joshua Ong Jun Leang, Pavlos Vougiouklis, Jeff Z. Pan, Marco Valentino, Pasquale Minervini. [Paper] - Audited Skill-Graph Self-Improvement for Agentic LLMs via Verifiable Rewards, Experience Synthesis, and Continual Memory <2025-12-28>
Ken Huang, Jerry Huang. [Paper] - No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping <2025-12-27>
Thanh-Long V. Le, Myeongho Jeon, Kim Vu, Viet Lai, Eunho Yang. [Paper] - Search Self-play: Pushing the Frontier of Agent Capability without Supervision <2025-12-26>
Hongliang Lu, Yuhang Wen, Pengyu Cheng, Ruijin Ding, Jiaqi Guo, Haotian Xu, Chutian Wang, Haonan Chen, Xiaoxi Jiang, Guanjun Jiang. [Paper] - StepFun-Formalizer: Unlocking the Autoformalization Potential of LLMs through Knowledge-Reasoning Fusion <2025-12-26>
Yutong Wu, Di Huang, Ruosi Wan, Yue Peng, Shijie Shang, Chenrui Cao, Lei Qi, Rui Zhang, Zidong Du, Jie Yan, Xing Hu. [Paper] - AnesSuite: A Comprehensive Benchmark and Dataset Suite for Anesthesiology Reasoning in LLMs <2025-12-25>
Xiang Feng, Wentao Jiang, Zengmao Wang, Yong Luo, Pingbo Xu, Baosheng Yu, Hua Jin, Bo Du, Jing Zhang. [Paper] - Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards <2025-12-25>
Xinyu Tang, Yuliang Zhan, Zhixun Li, Wayne Xin Zhao, Zhenduo Zhang, Zujie Wen, Zhiqiang Zhang, Jun Zhou. [Paper] - Mitigating LLM Hallucination via Behaviorally Calibrated Reinforcement Learning <2025-12-25>
Jiayun Wu, Jiashuo Liu, Zhiyuan Zeng, Tianyang Zhan, Tianle Cai, Wenhao Huang. [Paper] - dUltra: Ultra-Fast Diffusion Language Models via Reinforcement Learning <2025-12-24>
Shirui Chen, Jiantao Jiao, Lillian J. Ratliff, Banghua Zhu. [Paper] - SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning <2025-12-24>
Xiaojun Guo, Runyu Zhou, Yifei Wang, Qi Zhang, Chenheng Zhang, Stefanie Jegelka, Xiaohan Wang, Jiajun Chai, Guojun Yin, Wei Lin, Yisen Wang. [Paper] - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers <2025-12-24>
Xin-Qiang Cai, Wei Wang, Feng Liu, Tongliang Liu, Gang Niu, Masashi Sugiyama. [Paper] - Thinking-Free Policy Initialization Makes Distilled Reasoning Models More Effective and Efficient Reasoners <2025-12-24>
Xin Xu, Cliveb AI, Kai Yang, Tianhao Chen, Yang Wang, Saiyong Yang, Can Yang. [Paper] - The Silent Scholar Problem: A Probabilistic Framework for Breaking Epistemic Asymmetry in LLM Agents <2025-12-24>
Zan-Kai Chong, Hiroyuki Ohsaki, Bryan Ng. [Paper] - Generalization of RLVR Using Causal Reasoning as a Testbed <2025-12-23>
Brian Lu, Hongyu Zhao, Shuo Sun, Hao Peng, Rui Ding, Hongyuan Mei. [Paper] - Reinforcement Learning for Large Model: A Survey <2025-12-23>
Weijia Wu, Chen Gao, Joya Chen, Kevin Qinghong Lin, Qingwei Meng, Yiming Zhang, Yuke Qiu, Hong Zhou, Mike Zheng Shou. [Paper] - Scaling Reinforcement Learning for Content Moderation with Large Language Models <2025-12-23>
Hamed Firooz, Rui Liu, Yuchen Lu, Zhenyu Hou, Fangzhou Xiong, Xiaoyang Zhang, Changshu Jian, Zhicheng Zhu, Jiayuan Ma, Jacob Tao, Chaitali Gupta, Xiaochang Peng, Shike Mei, Hang Cui, Yang Qin, Shuo Tang, Jason Gaedtke, Arpit Mittal. [Paper] - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal <2025-12-22>
Yongxin Wang, Zhicheng Yang, Meng Cao, Mingfei Han, Haokun Lin, Yingying Zhu, Xiaojun Chang, Xiaodan Liang. [Paper] - SPELL: Self-Play Reinforcement Learning for evolving Long-Context Language Models <2025-12-22>
Ziyi Yang, Weizhou Shen, Chenliang Li, Ruijun Chen, Fanqi Wan, Ming Yan, Xiaojun Quan, Fei Huang. [Paper] - Solver-Informed RL: Grounding Large Language Models for Authentic Optimization Modeling <2025-12-22>
Yitian Chen, Jingfan Xia, Siyu Shao, Dongdong Ge, Yinyu Ye. [Paper] - Sharpness-Controlled Group Relative Policy Optimization with Token-Level Probability Shaping <2025-12-22>
Tue Le, Nghi D. Q. Bui, Linh Ngo Van, Trung Le. [Paper] - CORE: Concept-Oriented Reinforcement for Bridging the Definition-Application Gap in Mathematical Reasoning <2025-12-21>
Zijun Gao, Zhikun Xu, Xiao Ye, Ben Zhou. [Paper] - Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward <2025-12-21>
Peter Chen, Xiaopeng Li, Ziniu Li, Wotao Yin, Xi Chen, Tianyi Lin. [Paper] - A Theoretical Lens for RL-Tuned Language Models via Energy-Based Models <2025-12-21>
Zhiquan Tan, Yinrong Hong. [Paper] - PLaID++: A Preference Aligned Language Model for Targeted Inorganic Materials Design <2025-12-21>
Andy Xu, Rohan Desai, Larry Wang, Gabriel Hope, Ethan Ritz. [Paper] - Stable and Efficient Single-Rollout RL for Multimodal Reasoning <2025-12-20>
Rui Liu, Dian Yu, Lei Ke, Haolin Liu, Yujun Zhou, Zhenwen Liang, Haitao Mi, Pratap Tokekar, Dong Yu. [Paper] - AdaTooler-V: Adaptive Tool-Use for Images and Videos <2025-12-19>
Chaoyang Wang, Kaituo Feng, Dongyang Chen, Zhongyu Wang, Zhixun Li, Sicheng Gao, Meng Meng, Xu Zhou, Manyuan Zhang, Yuzhang Shang, Xiangyu Yue. [Paper] - MEML-GRPO: Heterogeneous Multi-Expert Mutual Learning for RLVR Advancement <2025-12-18>
Weitao Jia, Jinghui Lu, Haiyang Yu, Siqi Wang, Guozhi Tang, An-Lan Wang, Weijie Yin, Dingkang Yang, Yuxiang Nie, Bin Shan, Hao Feng, Irene Li, Kun Yang, Han Wang, Jingqun Tang, Teng Fu, Changhong Jin, Chao Feng, Xiaohui Lv, Can Huang. [Paper] - Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning <2025-12-18>
Weiqin Wang, Yile Wang, Kehao Chen, Hui Huang. [Paper] - Many Minds from One Model: Bayesian Transformers for Population Intelligence <2025-12-31>
Diji Yang, Yi Zhang. [Paper] - Evaluating Parameter Efficient Methods for RLVR <2025-12-30>
Qingyu Yin, Yulun Wu, Zhennan Shen, Sunbowen Li, Zhilin Wang, Yanshu Li, Chak Tou Leong, Jiale Kang, Jinjin Gu. [Paper] - OpenSIR: Open-Ended Self-Improving Reasoner <2025-12-30>
Wai-Chung Kwan, Joshua Ong Jun Leang, Pavlos Vougiouklis, Jeff Z. Pan, Marco Valentino, Pasquale Minervini. [Paper] - Audited Skill-Graph Self-Improvement for Agentic LLMs via Verifiable Rewards, Experience Synthesis, and Continual Memory <2025-12-28>
Ken Huang, Jerry Huang. [Paper] - No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping <2025-12-27>
Thanh-Long V. Le, Myeongho Jeon, Kim Vu, Viet Lai, Eunho Yang. [Paper] - Search Self-play: Pushing the Frontier of Agent Capability without Supervision <2025-12-26>
Hongliang Lu, Yuhang Wen, Pengyu Cheng, Ruijin Ding, Jiaqi Guo, Haotian Xu, Chutian Wang, Haonan Chen, Xiaoxi Jiang, Guanjun Jiang. [Paper] - StepFun-Formalizer: Unlocking the Autoformalization Potential of LLMs through Knowledge-Reasoning Fusion <2025-12-26>
Yutong Wu, Di Huang, Ruosi Wan, Yue Peng, Shijie Shang, Chenrui Cao, Lei Qi, Rui Zhang, Zidong Du, Jie Yan, Xing Hu. [Paper] - AnesSuite: A Comprehensive Benchmark and Dataset Suite for Anesthesiology Reasoning in LLMs <2025-12-25>
Xiang Feng, Wentao Jiang, Zengmao Wang, Yong Luo, Pingbo Xu, Baosheng Yu, Hua Jin, Bo Du, Jing Zhang. [Paper] - Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards <2025-12-25>
Xinyu Tang, Yuliang Zhan, Zhixun Li, Wayne Xin Zhao, Zhenduo Zhang, Zujie Wen, Zhiqiang Zhang, Jun Zhou. [Paper] - Mitigating LLM Hallucination via Behaviorally Calibrated Reinforcement Learning <2025-12-25>
Jiayun Wu, Jiashuo Liu, Zhiyuan Zeng, Tianyang Zhan, Tianle Cai, Wenhao Huang. [Paper] - dUltra: Ultra-Fast Diffusion Language Models via Reinforcement Learning <2025-12-24>
Shirui Chen, Jiantao Jiao, Lillian J. Ratliff, Banghua Zhu. [Paper] - SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning <2025-12-24>
Xiaojun Guo, Runyu Zhou, Yifei Wang, Qi Zhang, Chenheng Zhang, Stefanie Jegelka, Xiaohan Wang, Jiajun Chai, Guojun Yin, Wei Lin, Yisen Wang. [Paper] - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers <2025-12-24>
Xin-Qiang Cai, Wei Wang, Feng Liu, Tongliang Liu, Gang Niu, Masashi Sugiyama. [Paper] - Thinking-Free Policy Initialization Makes Distilled Reasoning Models More Effective and Efficient Reasoners <2025-12-24>
Xin Xu, Cliveb AI, Kai Yang, Tianhao Chen, Yang Wang, Saiyong Yang, Can Yang. [Paper] - The Silent Scholar Problem: A Probabilistic Framework for Breaking Epistemic Asymmetry in LLM Agents <2025-12-24>
Zan-Kai Chong, Hiroyuki Ohsaki, Bryan Ng. [Paper] - Generalization of RLVR Using Causal Reasoning as a Testbed <2025-12-23>
Brian Lu, Hongyu Zhao, Shuo Sun, Hao Peng, Rui Ding, Hongyuan Mei. [Paper] - Reinforcement Learning for Large Model: A Survey <2025-12-23>
Weijia Wu, Chen Gao, Joya Chen, Kevin Qinghong Lin, Qingwei Meng, Yiming Zhang, Yuke Qiu, Hong Zhou, Mike Zheng Shou. [Paper] - Scaling Reinforcement Learning for Content Moderation with Large Language Models <2025-12-23>
Hamed Firooz, Rui Liu, Yuchen Lu, Zhenyu Hou, Fangzhou Xiong, Xiaoyang Zhang, Changshu Jian, Zhicheng Zhu, Jiayuan Ma, Jacob Tao, Chaitali Gupta, Xiaochang Peng, Shike Mei, Hang Cui, Yang Qin, Shuo Tang, Jason Gaedtke, Arpit Mittal. [Paper] - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal <2025-12-22>
Yongxin Wang, Zhicheng Yang, Meng Cao, Mingfei Han, Haokun Lin, Yingying Zhu, Xiaojun Chang, Xiaodan Liang. [Paper] - SPELL: Self-Play Reinforcement Learning for evolving Long-Context Language Models <2025-12-22>
Ziyi Yang, Weizhou Shen, Chenliang Li, Ruijun Chen, Fanqi Wan, Ming Yan, Xiaojun Quan, Fei Huang. [Paper] - Solver-Informed RL: Grounding Large Language Models for Authentic Optimization Modeling <2025-12-22>
Yitian Chen, Jingfan Xia, Siyu Shao, Dongdong Ge, Yinyu Ye. [Paper] - Sharpness-Controlled Group Relative Policy Optimization with Token-Level Probability Shaping <2025-12-22>
Tue Le, Nghi D. Q. Bui, Linh Ngo Van, Trung Le. [Paper] - CORE: Concept-Oriented Reinforcement for Bridging the Definition-Application Gap in Mathematical Reasoning <2025-12-21>
Zijun Gao, Zhikun Xu, Xiao Ye, Ben Zhou. [Paper] - Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward <2025-12-21>
Peter Chen, Xiaopeng Li, Ziniu Li, Wotao Yin, Xi Chen, Tianyi Lin. [Paper] - A Theoretical Lens for RL-Tuned Language Models via Energy-Based Models <2025-12-21>
Zhiquan Tan, Yinrong Hong. [Paper] - PLaID++: A Preference Aligned Language Model for Targeted Inorganic Materials Design <2025-12-21>
Andy Xu, Rohan Desai, Larry Wang, Gabriel Hope, Ethan Ritz. [Paper] - Stable and Efficient Single-Rollout RL for Multimodal Reasoning <2025-12-20>
Rui Liu, Dian Yu, Lei Ke, Haolin Liu, Yujun Zhou, Zhenwen Liang, Haitao Mi, Pratap Tokekar, Dong Yu. [Paper] - AdaTooler-V: Adaptive Tool-Use for Images and Videos <2025-12-19>
Chaoyang Wang, Kaituo Feng, Dongyang Chen, Zhongyu Wang, Zhixun Li, Sicheng Gao, Meng Meng, Xu Zhou, Manyuan Zhang, Yuzhang Shang, Xiangyu Yue. [Paper] - MEML-GRPO: Heterogeneous Multi-Expert Mutual Learning for RLVR Advancement <2025-12-18>
Weitao Jia, Jinghui Lu, Haiyang Yu, Siqi Wang, Guozhi Tang, An-Lan Wang, Weijie Yin, Dingkang Yang, Yuxiang Nie, Bin Shan, Hao Feng, Irene Li, Kun Yang, Han Wang, Jingqun Tang, Teng Fu, Changhong Jin, Chao Feng, Xiaohui Lv, Can Huang. [Paper] - Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning <2025-12-18>
Weiqin Wang, Yile Wang, Kehao Chen, Hui Huang. [Paper] - Well Begun, Half Done: Reinforcement Learning with Prefix Optimization for LLM Reasoning <2025-12-17>
Yiliu Sun, Zicheng Zhao, Yang Wei, Yanfang Zhang, Chen Gong. [Paper] - Puzzle Curriculum GRPO for Vision-Centric Reasoning <2025-12-16>
Ahmadreza Jeddi, Hakki Can Karaimer, Hue Nguyen, Zhongling Wang, Ke Zhao, Javad Rajabi, Ran Zhang, Raghav Goyal, Babak Taati, Radek Grzeszczuk. [Paper] - TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs <2025-12-16>
Jun Zhang, Teng Wang, Yuying Ge, Yixiao Ge, Xinhao Li, Ying Shan, Limin Wang. [Paper] - Efficient Reinforcement Learning with Semantic and Token Entropy for LLM Reasoning <2025-12-16>
Hongye Cao, Zhixin Bai, Ziyue Peng, Boyan Wang, Tianpei Yang, Jing Huo, Yuyao Zhang, Yang Gao. [Paper] - A Scientific Reasoning Model for Organic Synthesis Procedure Generation <2025-12-15>
Guoqing Liu, Junren Li, Zihan Zhao, Eray Inanc, Krzysztof Maziarz, Jose Garrido Torres, Victor Garcia Satorras, Shoko Ueda, Christopher M. Bishop, Marwin Segler. [Paper] - Nemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning Models <2025-12-15>
Boxin Wang, Chankyu Lee, Nayeon Lee, Sheng-Chieh Lin, Wenliang Dai, Yang Chen, Yangyi Chen, Zhuolin Yang, Zihan Liu, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping. [Paper] - TraPO: A Semi-Supervised Reinforcement Learning Framework for Boosting LLM Reasoning <2025-12-15>
Shenzhi Yang, Guangcheng Zhu, Xing Zheng, Yingfan MA, Zhongqi Chen, Bowen Song, Weiqiang Wang, Junbo Zhao, Gang Chen, Haobo Wang. [Paper] - Coupled Variational Reinforcement Learning for Language Model General Reasoning <2025-12-14>
Xueru Wen, Jie Lou, Yanjiang Liu, Hongyu Lin, Ben He, Xianpei Han, Le Sun, Yaojie Lu, Debing Zhang. [Paper] - More Than the Final Answer: Improving Visual Extraction and Logical Consistency in Vision-Language Models <2025-12-13>
Hoang Anh Just, Yifei Fan, Handong Zhao, Jiuxiang Gu, Ruiyi Zhang, Simon Jenni, Kushal Kafle, Ruoxi Jia, Jing Shi. [Paper] - Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVR <2025-12-13>
Xiao Liang, Zhongzhi Li, Yeyun Gong, Yelong Shen, Ying Nian Wu, Zhijiang Guo, Weizhu Chen. [Paper] - Long-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solving <2025-12-12>
Songyang Gao, Yuzhe Gu, Zijian Wu, Lingkai Kong, Wenwei Zhang, Zhongrui Cai, Fan Zheng, Tianyou Ma, Junhao Shen, Haiteng Zhao, Duanyang Zhang, Huilun Zhang, Kuikun Liu, Chengqi Lyu, Yanhui Duan, Chiyu Chen, Ningsheng Ma, Jianfei Gao, Han Lyu, Dahua Lin, Kai Chen. [Paper] - ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement Learning <2025-12-12>
Jinpeng Wang, Chao Li, Ting Ye, Mengyuan Zhang, Wei Liu, Jian Luan. [Paper] - Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning <2025-12-11>
Jingqi Tong, Jixin Tang, Hangcheng Li, Yurong Mou, Ming Zhang, Jun Zhao, Yanbo Wen, Fan Song, Jiahao Zhan, Yuyang Lu, Chaoran Tao, Zhiyuan Guo, Jizhou Yu, Tianhao Cheng, Zhiheng Xi, Changhao Jiang, Zhangyue Yin, Yining Zheng, Weifeng Ge, Guanhua Chen, Tao Gui, Xipeng Qiu, Qi Zhang, Xuanjing Huang. [Paper] - OPV: Outcome-based Process Verifier for Efficient Long Chain-of-Thought Verification <2025-12-11>
Zijian Wu, Lingkai Kong, Wenwei Zhang, Songyang Gao, Yuzhe Gu, Zhongrui Cai, Tianyou Ma, Yuhong Liu, Zhi Wang, Runyuan Ma, Guangyu Wang, Wei Li, Conghui He, Dahua Lin, Kai Chen. [Paper] - Training Task Reasoning LLM Agents for Multi-turn Task Planning via Single-turn Reinforcement Learning <2025-12-08>
Hanjiang Hu, Changliu Liu, Na Li, Yebin Wang. [Paper] - ReLaX: Reasoning with Latent Exploration for Large Reasoning Models <2025-12-08>
Shimin Zhang, Xianwei Chen, Yufan Shen, Ziyuan Ye, Jibin Wu. [Paper] - InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy Optimization <2025-12-08>
Yuhang Liu, Zeyu Liu, Shuanghe Zhu, Pengxiang Li, Congkai Xie, Jiasheng Wang, Xavier Hu, Xiaotian Han, Jianbo Yuan, Xinyao Wang, Shengyu Zhang, Hongxia Yang, Fei Wu. [Paper]
🧠 Core Papers
RLVR Foundations
2026
- Verifiable Rewards Beyond Math and Code: Lightweight Corpus-Grounded Process Supervision for Factual Question Answering. <2026.05>
Shicheng Fan, Haochang Hao, Dehai Min, Weihao Liu, Philip S. Yu, Lu Cheng. arXiv
[Paper] [Code]
2025
- Optimizing Anytime Reasoning via Budget Relative Policy Optimization. <2025.06>
Penghui Qi, Zichen Liu, Tianyu Pang, Chao Du, Wee Sun Lee, Min Lin. arXiv
[Paper] - Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective. <2025.06>
Shenghua He, Tian Xia, Xuan Zhou, Hui Wei. arXiv
[Paper] - Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts. <2025.06>
Haizhong Zheng, Yang Zhou, Brian R. Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, Beidi Chen. arXiv
[Paper] [Code] - KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning. <2025.06>
Hongling Xu, Qi Zhu, Heyuan Deng, Jinpeng Li, Lu Hou., arXiv
[Paper] - Rewarding the Unlikely: Lifting GRPO Beyond Distribution Sharpening. <2025.06>
Andre He, Daniel Fried, Sean Welleck. arXiv
[Paper] - Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback <2025.06>
Xiaoying Zhang, Hao Sun, Yipeng Zhang, Kaituo Feng, Chaochao Lu, Chao Yang, Helen Meng arXiv
[Paper] [Code] - Beyond Markovian: Reflective Exploration via Bayes-Adaptive RL for LLM Reasoning. <2025.05>
Shenao Zhang, Yaqing Wang, Yinxiao Liu, Tianqi Liu, Peter Grabowski, Eugene Ie, Zhaoran Wang, Yunxuan Li. arXiv
[Paper] - S-GRPO: Early Exit via Reinforcement Learning in Reasoning Models. <2025.05>
Muzhi Dai, Chenxu Yang, Qingyi Si. arXiv
[Paper] - Temporal Sampling for Forgotten Reasoning in LLMs <2025.05>
Yuetai Li, Zhangchen Xu, Fengqing Jiang, Bhaskar Ramasubramanian, Luyao Niu, Bill Yuchen Lin, Xiang Yue, Radha Poovendran. arXiv
[Paper] [Code] - DAPO: An Open-Source LLM Reinforcement Learning System at Scale. <2025.05>
Yu et al. arXiv
[Paper] [Code] - RM-R1: Reward Modeling as Reasoning <2025.05>
Xiusi Chen, Gaotang Li, Ziqi Wang, Bowen Jin, Cheng Qian, Yu Wang, Hongru Wang, Yu Zhang, Denghui Zhang, Tong Zhang, Hanghang Tong, Heng Ji. arXiv
[Paper] [Code] - GRPO-LEAD: A Difficulty-Aware Reinforcement Learning Approach for Concise Mathematical Reasoning in Language Models. <2025.04>
Jixiao Zhang, Chunsheng Zuo. arXiv
[Paper] - VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks. <2025.04> Yu Yue, Yufeng Yuan, Qiying Yu, Xiaochen Zuo, Ruofei Zhu, Wenyuan Xu, Jiaze Chen, Chengyi Wang, TianTian Fan, Zhengyin Du, Xiangpeng Wei, Xiangyu Yu, Gaohong Liu, Juncai Liu, Lingjun Liu, Haibin Lin, Zhiqi Lin, Bole Ma, Chi Zhang, Mofan Zhang, Wang Zhang, Hang Zhu, Ru Zhang, Xin Liu, Mingxuan Wang, Yonghui Wu, Lin Yan. arXiv Paper
- Online Difficulty Filtering for Reasoning Oriented Reinforcement Learning. <2025.04>
Sanghwan Bae, Jiwoo Hong, Min Young Lee, Hanbyul Kim, JeongYeon Nam, Donghyun Kwak. arXiv
[Paper] - SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM. <2025.04>
Xiaojiang Zhang, Jinghui Wang, Zifei Cheng, Wenhao Zhuang, Zheng Lin, Minglei Zhang, Shaojie Wang, Yinghan Cui, Chao Wang, Junyi Peng, Shimiao Jiang, Shiqi Kuang, Shouyu Yin, Chaohang Wen, Haotian Zhang, Bin Chen, Bing Yu. arXiv
[Paper] - DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. <2025.01>
DeepSeek-AI. arXiv
[Paper] - ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models. <2025.05>
Mingjie Liu, Shizhe Diao, Ximing Lu, Jian Hu, Xin Dong, Yejin Choi, Jan Kautz, Yi Dong. arXiv
[Paper] - GHPO: Adaptive Guidance for Stable and Efficient LLM Reinforcement Learning. <2025.07>
Ziru Liu, Cheng Gong, Xinyu Fu, Yaofang Liu, Ran Chen, Shoubo Hu, Suiyun Zhang, Rui Liu, Qingfu Zhang, Dandan Tu. arXiv
[Paper] - GPG: A Simple and Strong Reinforcement Learning Baseline for Model Reasoning. <2025.04>
Xiangxiang Chu, Hailang Huang, Xiao Zhang, Fei Wei, Yong Wang. arXiv
[Paper] - SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data. <2025.05>
Wenkai Fang, Shunyu Liu, Yang Zhou, Kongcheng Zhang, Tongya Zheng, Kaixuan Chen, Mingli Song, Dacheng Tao. arXiv
[Paper] - SPEED-RL: Faster Training of Reasoning Models via Online Curriculum Learning. <2025.06>
Ruiqi Zhang, Daman Arora, Song Mei, Andrea Zanette. arXiv
[Paper] - Bingo: Boosting Efficient Reasoning of LLMs via Dynamic and Significance-based Reinforcement Learning. <2025.06>
Hanbing Liu, Lang Cao, Yuanyi Ren, Mengyu Zhou, Haoyu Dong, Xiaojun Ma, Shi Han, Dongmei Zhang. arXiv
[Paper] - Reinforcement Pre-Training. <2025.06>
Qingxiu Dong, Li Dong, Yao Tang, Tianzhu Ye, Yutao Sun, Zhifang Sui, Furu Wei. arXiv
[Paper] - Reinforcement Learning with Verifiable Rewards: GRPO’s Effective Loss, Dynamics, and Success Amplification. <2025.03>
Youssef Mroueh. arXiv
[Paper]
2024
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models <2024.02>
Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, Y.K. Li, Y. Wu, Daya Guo. arXiv
[Paper] [Code] - ReFT: Reasoning with Reinforced Fine-Tuning <2024.01>
Trung Quoc Luong, Xinbo Zhang, Zhanming Jie, Peng Sun, Xiaoran Jin, Hang Li. arXiv / ACL 2024
[Paper] [Code]
Unsupervised RLVR
2025
- Can Large Reasoning Models Self-Train? <2025.05>
Sheikh Shafayat, Fahim Tajwar, Ruslan Salakhutdinov, Jeff Schneider, Andrea Zanette. arXiv
[Paper] - **Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization. ** <2025.05>
Qingyang Zhang, Haitao Wu, Changqing Zhang, Peilin Zhao, Yatao Bian. arXiv [Paper] - Maximizing Confidence Alone Improves Reasoning <2025.05>
Mihir Prabhudesai, Lili Chen, Alex Ippoliti, Katerina Fragkiadaki, Hao Liu, Deepak Pathak. arXiv
[Paper] - Learning to Reason without External Rewards. arXiv
Xuandong Zhao, Zhewei Kang, Aosong Feng, Sergey Levine, Dawn Song. arXiv
[Paper] - NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning. <2025.05>
Wei Liu, Siya Qi, Xinyu Wang, Chen Qian, Yali Du, Yulan He. arXiv
[Paper] - Absolute Zero: Reinforced Self-Play Reasoning with Zero Data. <2025.05>
Andrew Zhao et al. arXiv
[Paper]
Entropy in RLVR
2025
- Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning <2025.06>
Shenzhi Wang, Le Yu, Chang Gao, Chujie Zheng, Shixuan Liu, Rui Lu, Kai Dang, Xionghui Chen, Jianxin Yang, Zhenru Zhang, Yuqiong Liu, An Yang, Andrew Zhao, Yang Yue, Shiji Song, Bowen Yu, Gao Huang, Junyang Lin. arXiv
[Paper] - The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models. <2025.05>
Ganqu Cui, Yuchen Zhang, Jiacheng Chen, Lifan Yuan, Zhi Wang, Yuxin Zuo, Haozhan Li, Yuchen Fan, Huayu Chen, Weize Chen, Zhiyuan Liu, Hao Peng, Lei Bai, Wanli Ouyang, Yu Cheng, Bowen Zhou, Ning Ding. arXiv
[Paper] [Code] - One-shot Entropy Minimization. <2025.05>
Zitian Gao, Lynx Chen, Joey Zhou, Bryan Dai. arXiv
[Paper] [Code] - The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning. <2025.05>
Shivam Agarwal, Zimin Zhang, Lifan Yuan, Jiawei Han, Hao Peng. arXiv
[Paper] - FR3E: First Return, Entropy-Eliciting Explore. <2025.07>
Tianyu Zheng, Tianshun Xing, Qingshui Gu, Taoran Liang, Xingwei Qu, Xin Zhou, Yizhi Li, Zhoufutu Wen, Chenghua Lin, Wenhao Huang, Qian Liu, Ge Zhang, Zejun Ma arXiv
[Paper] - Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models. <2025.08>
Zhipeng Chen, Xiaobo Qin, Youbin Wu, Yue Ling, Qinghao Ye, Wayne Xin Zhao, Guang Shi. arXiv
[Paper]
RLVR Analysis
2025
- Spurious Rewards: Rethinking Training Signals in RLVR. <2025.05>
Rulin Shao, Shuyue Stella Li, Rui Xin, Scott Geng, Yiping Wang, Sewoong Oh, Simon Shaolei Du, Nathan Lambert, Sewon Min, Ranjay Krishna, Yulia Tsvetkov, Hannaneh Hajishirzi, Pang Wei Koh, Luke Zettlemoyer. Preprint
[Paper] [Code] - Reinforcement Learning Finetunes Small Subnetworks in Large Language Models. <2025.05>
Sagnik Mukherjee, Lifan Yuan, Dilek Hakkani-Tur, Hao Peng. arXiv
[Paper] - Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model? <2025.04>
Yang Yue, Zhiqi Chen, Rui Lu, Andrew Zhao, Zhaokai Wang, Shiji Song, Gao Huang. arXiv
[Paper] [Code] - The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning. <2025.06>
Xinyu Zhu, Mengzhou Xia, Zhepei Wei, Wei-Lin Chen, Danqi Chen, Yu Meng. arXiv
[Paper] [Code] - Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination. <2025.07>
Mingqi Wu, Zhihao Zhang, Qiaole Dong, Zhiheng Xi, Jun Zhao, Senjie Jin, Xiaoran Fan, Yuhao Zhou, Huijie Lv, Ming Zhang, Yanwei Fu, Qin Liu, Songyang Zhang, Qi Zhang. arXiv
[Paper] - One Token to Fool LLM-as-a-Judge. <2025.07>
Yulai Zhao, Haolin Liu, Dian Yu, S. Y. Kung, Haitao Mi, Dong Yu. arXiv
[Paper]
Multimodal LLM
2025
- SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning.** <2025.06>
Zhongwei Wan, Zhihao Dou, Che Liu, Yu Zhang, Dongfei Cui, Qinjian Zhao, Hui Shen, Jing Xiong, Yi Xin, Yifan Jiang, Yangfan He, Mi Zhang, Shen Yan. arXiv
[Paper] [Code] - R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning <2025.05>
Jiaxing Zhao, Xihan Wei, Liefeng Bo arXiv
[Paper] [Code] - R1-VL: Learning to Reason with Multimodal Large Language Models via Step-Wise GRPO. <2025.03>
Jingyi Zhang, Jiaxing Huang, Huanjin Yao, Shunyu Liu, Xikun Zhang, Shijian Lu, Dacheng Tao. arXiv
[Paper] - VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning. <2025.04>
Haozhe Wang, Chao Qu, Zuming Huang, Wei Chu, Fangzhen Lin, Wenhu Chen. arXiv
[Paper] - GTR: Guided Thought Reinforcement Prevents Thought Collapse in RL-based VLM Agent Training. <2025.03>
Tong Wei, Yijun Yang, Junliang Xing, Yuanchun Shi, Zongqing Lu, Deheng Ye. arXiv
[Paper]
Evaluation Issue
2025
- A Sober Look at Progress in Language Model Reasoning: Pitfalls and Paths to Reproducibility. <2025.04>
Andreas Hochlehnert, Hardik Bhatnagar, Vishaal Udandarao, Samuel Albanie, Ameya Prabhu, Matthias Bethge. arXiv
[Paper] - Incorrect Baseline Evaluations Call into Question Recent LLM-RL Claims. <2025.05>
Nikhil Chandak, Shashwat Goel, Ameya Prabhu. Blog
[Paper] - Evaluation is All You Need: Strategic Overclaiming of LLM Reasoning Capabilities Through Evaluation Design. <2025.06>
Lin Sun, Weihong Lin, Jinzhu Wu, Yongfu Zhu, Xiaoqi Jian, Guangxiang Zhao, Linglin Zhang, Sai-er Hu, Yuhan Wu, Xiangzheng Zhang. arXiv
[Paper] - AbstentionBench: Reasoning LLMs Fail on Unanswerable Questions. <2025.06>
Polina Kirichenko, Shauli Ravfogel, Roee Aharoni, Yonatan Belinkov. arXiv
[Paper] - IFBench: Generalizing Verifiable Instruction Following. <2025.07>
Valentina Pyatkin, Saumya Malik, Victoria Graf, Hamish Ivison, Shengyi Huang, Pradeep Dasigi, Nathan Lambert, Hannaneh Hajishirzi. arXiv
[Paper] [Code]
📚 Awesome Blogs about RLVR
SemiAnalysis: Scaling Reinforcement Learning: Environments, Reward Hacking, Agents, Scaling Data.
Reinforcement Learning from Verifiable Rewards:
Reference book on verifier design, RLVR training signals, reward hacking, search/test-time verification, and agentic RLVR.
🛠️ Toolkits and Libraries
- 【open-r1】-- Fully open reproduction of DeepSeek-R1.
- 【PRIME】 -- Scalable RL solution for advanced reasoning of language models.
- 【simpleRL-reason】 -- Simple RL training for reasoning.
- 【TinyZero】 -- Minimal reproduction of DeepSeek R1-Zero.
- 【OpenR】 -- OpenR: An Open Source Framework for Advanced Reasoning with LLMs
- 【verl】 -- verl: Volcano Engine Reinforcement Learning for LLMs.
- 【rl】 -- A modular, primitive-first, python-first PyTorch library for Reinforcement Learning.
- 【all-rl-algorithms】 -- Implementation of all RL algorithms in a simpler way.
- 【AReaL】 -- Distributed RL System for LLM Reasoning.
- 【rllm】 -- Democratizing Reinforcement Learning for LLMs.
- 【MARTI】 -- A Framework for LLM-based Multi-Agent Reinforced Training and Inference.
- 【OpenRLHF 】-- An Easy-to-use, Scalable and High-performance RLHF Framework based on Ray.
- 【ROLL】-- An Efficient and User-Friendly Scaling Library for Reinforcement Learning with Large Language Models.
- 【polgrad】 -- Reference semantics, conformance testing, and pathology diagnostics for LLM policy-gradient post-training losses.
💡 Other Awesome Lists
- Awesome-RL-based-LLM-Reasoning Materials that enhance LLM reasoning with reinforcement learning.
- Awesome-LLM-Reasoning Curated collection of papers and resources on how to unlock the reasoning ability of LLMs and MLLMs.
- Awesome-Controllable-Generation Collection of papers and resources on Controllable Generation using Diffusion Models.
- Chain-of-ThoughtsPapers A trend starting from "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models".
- LM-reasoning Collection of papers and resources on Reasoning in Large Language Models.
- Prompt4ReasoningPapers Repository for the paper "Reasoning with Language Model Prompting: A Survey".
- ReasoningNLP Paper list on reasoning in NLP.
- Awesome-LLM Curated list of Large Language Model.
- Awesome LLM Self-Consistency Curated list of Self-consistency in Large Language Models.
- Deep-Reasoning-Papers Recent Papers including Neural-Symbolic Reasoning, Logical Reasoning, and Visual Reasoning.
🤝 Contributing
Have a new paper, tool, or idea? Please open a Pull Request or submit an Issue.
Let’s make LLMs reason better, faster, and more verifiably.
Contributors
⭐ Star History
🧾 License
MIT License © 2025 Fang Wu and Contributors