Awesome RL-based Agentic Search Papers

July 28, 2026 · View on GitHub

This repository summarizes recent research on reinforcement‑learning (RL)‑based agentic search systems. These systems treat information‑seeking as a decision process: when a large language model (LLM) faces a complex question, it can plan and act by issuing search queries, revising those queries, and integrating evidence into its reasoning. RL techniques allow these agents to learn when to search, how intensively to search and how to integrate retrieved evidence into reasoning.

For more details, please check out our survey paper: A Comprehensive Survey on Reinforcement Learning-based Agentic Search: Foundations, Roles, Optimizations, Evaluations, and Applications. If you find this repository helpful, please cite our survey paper.

@article{lin2025comprehensive,
  title={A Comprehensive Survey on Reinforcement Learning-based Agentic Search: Foundations, Roles, Optimizations, Evaluations, and Applications},
  author={Minhua Lin, Zongyu Wu, Zhichao Xu, Hui Liu, Xianfeng Tang, Qi He, Charu Aggarwal, Hui Liu, Xiang Zhang, Suhang Wang},
  journal={arXiv preprint arXiv:2510.16724},
  year={2025}
}

We are actively maintaining this repository!

Contents

Overview of RL-based Agentic Search

Illustrative Framework of RL-based Agentic Search

Representative Survey

TimePaper TitleVenue
2026.3SoK: Agentic Retrieval-Augmented Generation (RAG): Taxonomy, Architectures, Evaluation, and Research DirectionsarXiv
2026.3Deep Research of Deep Research: From Transformer to Agent, From AI to AI for SciencearXiv
2026.1Agentic Reasoning for Large Language ModelsarXiv
2025.12Deep Research: A Systematic SurveyarXiv
2025.10A Comprehensive Survey on Reinforcement Learning-based Agentic Search: Foundations, Roles, Optimizations, Evaluations, and ApplicationsarXiv
2025.9Reinforcement Learning Foundations for Deep Research Systems: A SurveyarXiv
2025.9The Landscape of Agentic Reinforcement Learning for LLMs: A SurveyTMLR
2025.8Deep Research: A Survey of Autonomous Research AgentsarXiv
2025.8A Survey of LLM-based Deep Search Agents: Paradigm, Optimization, Evaluation, and ChallengesarXiv
2025.6Deep Research Agents: A Systematic Examination And RoadmaparXiv
2025.6From Web Search towards Agentic Deep Research: Incentivizing Search with Reasoning AgentsarXiv
2025.6Reasoning RAG via System 1 or System 2: A Survey on Reasoning Agentic Retrieval-Augmented Generation for Industry ChallengesarXiv
2025.4Synergizing RAG and Reasoning: A Systematic ReviewarXiv
2025.1Agentic Retrieval-Augmented Generation: A Survey on Agentic RAGarXiv

Method

How RL is Used: Optimization Strategies

The below table summarizes representative works with corresponding optimization strategies. Specifically, ORM and PRM denote the Outcome Reward Model and the Process Reward Model, respectively. “Rule-based” indicates that the reward function is entirely computed from predefined rules; otherwise, an LLM is involved as a reward judge.

📊 Click to expand long table (scrollable).
MethodRL Func. RoleCold Start?Training Env.RL Alg.Reward TypeReward Func.Opt. ScopeDataset
FA-SDR–S Inter.
Training Stability
-Real-world
Retrieval-Interleaved Search
Self-Distillation
EMA Teacher
-KL Self-Distillation
Feedback-Augmented Supervision
Single-agentRetrieval-interleaved search tasks
PCTDR-Aware Opt.
Multi-tool
-Tool Retrieval
Mobile Multi-Turn
RL-Counterfactual Retrieval Gain
Preference Reward
Module-levelMTDTool
VideoSearcher (Code)Multi-modal
Multi-tool
R–S Inter.
-Real-world
Video Deep Research
BiSPO-Tool-Invocation Objective
Answer-Accuracy Objective
Single-agentVideoSearch-QA
DeepSearch-EvolveAdapt-Search
Ctx-Mem.
Task / Data Synthesis
-Simulated
Verifiable
Self-Distillation
Fine-tuning
-Trajectory Filtering
Data Mixing
Single-agentDeepSearch-World (420K tasks)
HOTECooperative Multi-Agent Systems
Self-Evolving
-Real-world
Open-Ended Research
Hybrid-Mode RL-Proposer–Solver–Judge Co-EvolutionMulti-agentThree long-form deep-research benchmarks
SearchSwarmP–E Orches.
Ctx-Mem.
-Real-world
Harness-Guided
SFT-Delegation Trajectory SupervisionMulti-agentBrowseComp, BrowseComp-ZH
LAPOR–S Inter.
Step-level
-Local RetrievalRLSelf-generated PRMAnswer-Likelihood Gain
Sign-Consistency Gating
Step-levelSeven knowledge-intensive QA datasets
AWA-RL (Code)Adapt-Search
Reliability
-Local RetrievalRLORM + Abstention RewardDynamic Abstention Reward
Answer Reward
Single-agent[MuSiQue, HotpotQA, 2WikiMultiHopQA]
GRASPR-Aware Opt.
Search Efficiency
Multi-tool
-Local RetrievalRLORM+PRMAnswer Accuracy
Grounded Reading
Complementary Search
Turn Efficiency
Single-agentMulti-hop reasoning benchmarks
DeepRubricR–S Inter.
Task / Data Synthesis
-Synthetic
Real-world Evaluation
GRPORubric-based ORMEvidence-Tree Rubrics
Report Quality
Single-agent9K query–rubric pairs; three deep-research benchmarks
Libra (Code, Data)R-Aware Opt.
Ctx-Mem.
Struct-Nav.
Simulated
Repository Env.
Environment Optimization-Catalog Healing
Localization Feedback
Environment-levelSWE-bench Lite
PaperPilotConv-Reform.
Struct-Nav.
R–S Inter.
Scientific LiteratureSFT
Preference Optimization
-Workflow Imitation
Preference over Workflow Corruptions
Single-agentScientific literature search
MavenCtx-Mem.
R–S Inter.
-Long-contextGRPOPRMEvidence-State Rewards
Action-level Transition Reward
Step-levelLongBench v2, LongReason, RULER
PlanRAGConv-Reform.
R-Aware Opt.
Search Efficiency
-Real-world
Query Planning
Dynamic Programming
Cost Model
-Logical Query Tree CostModule-levelWikiWeb-ERP
BaRA (Code)Multi-tool
Search Efficiency
-Real-world
Web
BFS
Self-reflection
Rule-basedLiveness Verification
Provenance Checks
Single-agentSynthetic and real websites
Harness-1 (Code, Model)Adapt-Search
Ctx-Mem.
Search Efficiency
-Real-world
Stateful Harness
RL--Single-agent[BrowseComp-Plus, web, finance, patents, multi-hop QA]
Query RecyclingSearch Efficiency
Training Stability
Simulated
Sandboxed
GRPORule-based ORMZero-Variance Query Recycling
Answer Reward
Single-agentMulti-hop QA
SAAS (Code)Search Efficiency
Adapt-Search
-Real-worldGRPORule-based ORMBoundary-aware search penalty
Answer reward
Single-agent-
SD-SearchR–S Inter.
R-Aware Opt.
-Real-worldGRPO
Self-Distillation
PRMHindsight query distillation
Answer reward
Step-level-
Search-E1R–S Inter.
Search Efficiency
-Real-worldGRPO
OPSD
Self-distillationAnswer EM
Token-level KL
Step-levelQA benchmarks
GrepSeekR-Aware Opt.
Struct-Nav.
Real-world
Direct Corpus Interaction
GRPOORMAnswer EM/F1Single-agent-
QUESTAdapt-Search
Ctx-Mem.
Synthetic
Real-world
SFT
RL
Rule-based ORMVerifiable rubric-tree rewardSingle-agent-
SciResearcherAdapt-Search
Multi-tool
Domain-Specific
Synthetic
Scientific
SFT
Agentic RL
ORMScientific reasoning rewardSingle-agent[HLE-Bio/Chem-Gold, SuperGPQA-Hard-Biology, TRQA-Literature]
OThink-SRR1R–S Inter.
Search Efficiency
-Real-worldGRPO-IRRule-based ORM+PRMFormat
Retrieval hit
Refinement hit
Retrieval penalty
Single-agentMulti-hop QA
CalibAdv (Code)Training Stability
R–S Inter.
-Real-worldGRPOORMAdvantage CalibrationStep-level-
O-ResearcherP–E Orches.
Multi-agent
SyntheticSFT
Agentic RL
--Single-agentDeep Research Benchmark
RAGShaperTask / Data Synthesis
R–S Inter.
SyntheticSFT-Robust trajectory synthesisSingle-agent-
MTA-AgentMulti-modal
Multi-tool
Synthetic
Cached Tool Replay
SFT-Verified multi-hop trajectory synthesisSingle-agentMTA-Vision-DeepSearch
On-Policy Data EvolutionMulti-modal
Task / Data Synthesis
Real-world
On-policy
SFT
RL
ORMRollout-feedback data evolutionSingle-agent-
ArgusP–E Orches.
Ctx-Mem.
-Real-worldRL-Evidence Assembly
Source-traced Answer
Multi-agent[BrowseComp-en]
CuSearch (Code)Search Efficiency
R-Aware Opt.
-Real-world
Simulated
GRPO
RLVR
Verifiable RewardSearch-Depth Curriculum
SDGA
Single-agent[NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle]
HyperEyes (Code)Multi-modal
Multi-tool
Search Efficiency
Real-worldSFT
RL
ORM+PRMTRACE
On-Policy Distillation
Single-agent[IMEB, MMSearch, LiveVQA, InfoSeek]
VISORMulti-modal
R–S Inter.
Search Efficiency
Real-world
Visual Retrieval
GRPOORM+PRMVisual Action Evaluation
Credit Assignment
Search Drift Control
Single-agent[ViDoSeek, SlideVQA, MMLongBench]
RubricEMCtx-Mem.
R–S Inter.
-Real-worldStage-Structured GRPO
Meta-RL
PRMRubric Judgments
Reflection
Single-agentLong-form research benchmarks
DecEx-RAG (Code)Adapt-Search
R–S Inter.
-Real-worldProcess-level Policy OptimizationPRMDecision Optimization
Execution Optimization
Single-agentSix datasets
OpenSearch-VL (Code)Multi-modal
Multi-tool
Adapt-Search
Real-worldFatal-aware GRPOORM+PRMAnswer Acc
Query Quality
Format
Single-agent[SearchVL-SFT-36k, SearchVL-RL-8k, SimpleVQA, VDR, MMSearch, LiveVQA, BrowseComp-VL, FVQA, InfoSeek]
OpenSeeker-v2Adapt-SearchReal-worldSFT--Single-agent[BrowseComp-en, BrowseComp-zh, HLE, XBench]
LongSeekerCtx-Mem.
Search Efficiency
Real-worldSFT-Context OrchestrationSingle-agent[BrowseComp-en, BrowseComp-zh]
Search, Do not GuessAdapt-Search
Search Efficiency
Real-worldFine-tuning-Evidence-grounded Search UseSingle-agent[Bamboogle, HotpotQA]
InfoTreeSearch Efficiency
Multi-tool
-Tree-search
Tool-use
GRPO-Rollout Informativeness
UUCB
Step-level[GAIA, HLE-100, BrowseComp-lite, APPS-verified, AgentBench-OS]
A2^2TGPOMulti-tool
Step-level
-Real-worldA2^2TGPOPRMInformation Gain
Adaptive Turn-level Clipping
Step-level-
IG-SearchR–S Inter.
R-Aware Opt.
-Real-worldGRPORule-based PRMInformation GainStep-level[NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle]
CW-GRPOR-Aware Opt.
R–S Inter.
-Real-worldCW-GRPOORM+PRMRetrieval Utility
Reasoning Correctness
Step-level[NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle]
Cycle-Consistent SearchAdapt-Search-Real-worldGRPOPRMQuestion ReconstructabilitySingle-agent[NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle]
APEX-SearcherAdapt-Search
P–E Orches.
-Real-worldGRPORule-based ORMDecomposition F1Module-level[HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle]
Search More, Think LessSearch EfficiencyReal-worldModified RLOOORMLLM-Judge
Format / Tool-use
Single-agent[BrowseComp-en, BrowseComp-zh, GAIA, XBench, DeepResearchBench, WebWalkerQA]
To Search or Not to SearchSearch Efficiency-Real-worldDPO-Decision Boundary AlignmentStep-level[NQ, HotpotQA]
A-RAG (Code)R-Aware Opt.
R–S Inter.
-Real-world
Hierarchical Retrieval
--Hierarchical Retrieval Interfaces
Test-time Scaling
Single-agentMulti-hop QA
SmartSearchConv-Reform.
R-Aware Opt.
Real-worldGRPOPRMQuery Novelty
Query Usefulness
Step-level[HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle]
Evaluate-as-ActionR–S Inter.-Real-worldGRPOPRMSelf-Evaluation RewardStep-level[NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle]
SE-SearchR–S Inter.
Ctx-Mem.
-Real-worldGRPOORM+PRMQuery Reward
Memory Reward
Answer Reward
Step-level[NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle]
Search-P1R–S Inter.
Search Efficiency
-Real-worldGRPO
PPO
ORM+PRMPath Reward
Answer Reward
Step-level[NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, AD-QA]
SynPlanResearch-R1Adapt-Search
Multi-tool
Real-worldGRPO--Single-agent[HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, GAIA, WebWalkerQA, GPQA]
RAPOR-Aware Opt.
Multi-tool
-Real-worldRAPORetrieval-awareRetrieval Reward
Importance Shaping
Step-levelAgentic reasoning tasks
KARLAdapt-Search
Search Efficiency
Ctx-Mem.
-Real-worldOAPL--Single-agent[BrowseComp-Plus, TREC-Biogen, FinanceBench, QAMPARI, Freshstack, PMBench]
GraphSearchStruct-Nav.
R-Aware Opt.
-Graph Env.--Graph-aware Query Planning
Hybrid Graph Retrieval
Single-agentNode classification, link prediction
LiteResearcher (Code)Adapt-Search
Search Efficiency
-Simulated
Lite Virtual World
GRPOORMAnswer Correctness (LLM-Judge)Single-agent[GAIA, FRAMES, XBench]
CoSearch (Code)R-Aware Opt.
R–S Inter.
-Real-worldGRPORule-based ORM+PRMAnswer F1
Relevance Reward
Module-level[NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle]
AutoSearch (Code)Search Efficiency
Search Intensity
-Real-worldPPO
GRPO
Rule-based ORM+PRMFormat
Outcome EM
Search Efficiency
Search Quality F1
Step-level[NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, Bamboogle]
DR-Venus (Code, Models)Adapt-Search
Ctx-Mem.
Real-worldIGPO-based Agentic RLORM+Turn-level RewardInformation Gain
Format Regularization
Single-agent[GAIA, BrowseComp-en, FRAMES]
ProMMSearchAgentMulti-modal
Adapt-Search
-Simulated
Sim-to-Real
RL with Process-oriented RewardPRMKnowledge-Boundary / Search-Decision RewardSingle-agent[FVQA, InfoSeek, MMSearch]
IGPOAdapt-Search
R–S Inter.
-Real-worldIGPORule-based ORM+PRMAnswer F1
Information Gain
Step-level[NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle]
SearchGym (Code)Adapt-Search-SimulatedSearchGym-RL-Purified Feedback
Curriculum
Single-agent-
SIGHTAdapt-Search
R–S Inter.
Search Efficiency
-Real-worldGRPO-SES
Correctness
Information Gain
Single-agent-
Search-R2R–S Inter.-Real-world-PRMDense Process RewardSingle-agent-
DeepControlSearch Efficiency
Search Intensity
-Real-worldRLUtility-based controlInformation utility
Retrieval continuation
Granularity control
Step-level7 QA benchmarks
WideSeek-R1Search Efficiency
Cooperative Multi-Agent Systems
-Real-worldMARL--Multi-agentWideSearch
M-ASK (Code)P–E Orches.
Ctx-Mem.
-Real-world--Turn-level RewardMulti-agent-
PRAISESearch Efficiency
Step-level
-Real-world-PRMIntermediate Step RewardStep-level-
Behavior Priming (Code)Adapt-Search
Ctx-Mem.
Real-world
Behavior-Primed Trajectories
SFT
RL
ORMBehavior-Primed Trajectory RewardSingle-agent[GAIA, Web benchmarks, multi-hop QA]
Fathom-DeepResearchAdapt-Search
Ctx-Mem.
Multi-tool
Real-world
Live Web
RAPOPRM+ORMStep-level Utility Reward
Curriculum Pruning
Single-agent[SimpleQA, FRAMES, WebWalker, Seal0, MuSiQue, HLE, GPQA, MedQA]
Search-R1Adapt-SearchReal-worldPPO
GRPO
Rule-based ORMAnswer EMSingle-agent[NQ, TriviaQA, PopQA, HotpotQA, MuSiQue, 2WikiMultiHopQA, Bamboogle]
ReSearchAdapt-SearchReal-worldGRPORule-based ORMFormat
Answer F1
Single-agent[HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle]
AutoCoAAdapt-SearchReal-worldGRPORule-based ORMFormat
Answer EM
Single-agent[NQ, TriviaQA, PopQA, HotpotQA, MuSiQue, 2WikiMultiHopQA, Bamboogle]
SimpleDeepSearcherAdapt-SearchReal-worldSFT--Single-agent[2WikiMultiHopQA, MuSiQue, Bamboogle, FRAMES, GAIA]
ExSearchAdapt-SearchReal-worldGEMPRMTrajectory QualitySingle-agent[NQ, HotpotQA, MuSiQue]
IKEASearch EfficiencyReal-worldGRPORule-based ORMFormat
Answer EM
Knowledge-boundary
Step-level[NQ, PopQA, HotpotQA, 2WikiMultiHopQA]
R1-SearcherAdapt-SearchReal-worldGRPO
Reinforce++
Rule-based ORMFormat
Answer F1
Single-agent[HotpotQA, 2WikiMultiHopQA, Bamboogle, MuSiQue]
R1-Searcher++Search EfficiencyReal-worldGRPO
Reinforce++
Rule-based ORMFormat
Answer EM
Std of Search Calls
Single-agent[HotpotQA, 2WikiMultiHopQA, Bamboogle, MuSiQue]
DeepRAGAdapt-Search
Search Efficiency
Real-worldGRPORule-based ORMAnswer EM
Retrieval Cost
Single-agent[HotpotQA, 2WikiMultiHopQA, CAG, PopQA, WebQuestions, MuSiQue]
UR²Adapt-SearchReal-world
Curriculum
Reinforce++Rule-based ORMFormat
Answer EM
Fallback Penalty
Single-agent[MATH, Minerva, MedQA, MMLU-Pro, HotpotQA, Bamboogle, 2WikiMultiHopQA, MuSiQue]
SSRLAdapt-SearchSimulated
Self-Search
GRPORule-based ORMFormat
Answer EM
Single-agent[NQ, TriviaQA, HotpotQA, MuSiQue, 2WikiMultiHopQA, Bamboogle]
Pangu DeepDiverAdapt-Search
Search Intensity
Real-worldGRPORule-based ORMFormat
Answer EM
Extra Search
Single-agent[Pangu, Bamboogle, WebWalkerQA, FRAMES]
ReZeroSearch IntensityReal-worldGRPOORM+PRMFormat
Answer LLM-Judge
Retry
Step-level[Apollo-3]
StepSearchAdapt-Search
Search Intensity
Real-worldPPORule-based ORM+PRMFormat
Answer F1
Search Key
Information Gain
Redundancy Penalty
Step-level[HotpotQA, MuSiQue, 2WikiMultiHopQA, Bamboogle]
VERITASAdapt-Search
R-Aware Opt.
Real-worldPPOORM+PRMAnswer EM
Enhancing Faithfulness
Step-level[NQ, TriviaQA, PopQA, HotpotQA, MuSiQue, 2WikiMultiHopQA, Bamboogle]
ReasonRAGSearch Efficiency
R-S Inter.
Real-world
MCTS
DPOPRMShortest PathStep-level[PopQA, HotpotQA, 2WikiMultiHopQA, Bamboogle, MuSiQue]
Web-SailorAdapt-Search
Ctx-Mem.
Real-worldDUPOORMFormat
Answer F1
Single-agent[li2025sailorfogqa, BrowseComp-en, BrowseComp-zh, GAIA, XBench]
WebSailor-V2Multi-tool
Ctx-Mem.
Real-worldGRPORule-based ORMFormat
Answer F1
Single-agent[li2025sailorfogqav2, BrowseComp-en, BrowseComp-zh, GAIA, XBench, HLE, DeepResearchBench]
Search WiselySearch EfficiencyReal-worldβ-GRPORule-based ORMConfidence-based Answer EMSingle-agent[NQ, HotpotQA, TriviaQA, 2WikiMultiHopQA, Bamboogle, MuSiQue]
ZeroSearchSearch EfficiencySimulated
Curriculum
PPO
GRPO
Reinforce
Rule-based ORMAnswer F1Single-agent[NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle]
ParallelSearchSearch EfficiencyReal-worldGRPORule-based ORMFormat
Answer EM
Query Decomposition
Search count
Single-agent[NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle]
RAG-R1Search Efficiency
Conv-Reform.
Real-worldPPOORMAnswer EMSingle-agent[NQ, PopQA, TriviaQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle]
RL-QRConv-Reform.
R-Aware Opt.
SyntheticGRPORule-based ORMVerifiable Search RewardModule-levelMTEB VIDORE V2, MS MARCO v2.1
ConvSearch-R1Conv-Reform.Real-worldGRPOORMFormat
Rank-Incentive
Step-level[TopiOCQA], [QReCC]
MaskSearchConv-Reform.
R–S Inter.
Real-world
Curriculum
RAMP
DAPORule-based ORMFormat
Answer Recall
Length penalty
Single-agent[HotpotQA, FANOUTQA, MuSiQue, 2WikiMultiHopQA, Bamboogle, FreshQA]
DeepRetrievalR-Aware Opt.SimulatedPPOORMFormat
Answer Recall
Single-level[NQ, TriviaQA, SQuAD, FEVER, FactoidQA]
WebThinkerSearch EfficiencyReal-worldDPOPRMAnswer EM
Tool Calls
Length penalty
Single-agent[GPQA], GAIA, WebWalkerQA, HLE, SuperGPQA, OpenThoughts, NaturalReasoning, NuminaMath
s3R-Aware Opt.SimulatedPPORule-based ORMGain Beyond RAGModule-level[NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue]
R-SearchR–S Inter.Real-worldPPO
GRPO
Rule-based ORM+PRMFormat
Answer F1
Evidence Quality
Single-agent[HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle]
AutoRefineR–S Inter.Real-worldGRPOORM+PRMAnswer F1
Retrieval Reward
Step-level[NQ, TriviaQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, PopQA]
EvolveSearchR–S Inter.Real-world
Self-evolving
GRPOORMFormat
Answer LLM-Judge
Single-agent[NQ, TriviaQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, PopQA]
O²-SearcherR–S Inter.SimulatedGRPORule-based ORMFormat
Diversity reward
Factual reward
Single-agent[NQ, HotpotQA, TriviaQA, PopQA, 2WikiMultiHopQA, MuSiQue, Bamboogle]
Atom-SearcherR–S Inter.Real-world
Curriculum
GRPOPRM+Rule-based ORMFormat
Answer F1
Atomic thought reward
Step-level[NQ, TriviaQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, PopQA]
ReSumCtx-Mem.Real-worldResume-GRPOORMAnswer LLM-JudgeSingle-agent[GAIA, BrowseComp-en, BrowseComp-zh, WebWalkerQA, XBench]
SFR-DeepResearchCtx-Mem.
Multi-tool
Real-worldREINFORCEORMAnswer LLM-JudgeSingle-agent[FRAMES, GAIA, HLE]
MAO-ARAGP–E Orches.Real-worldPPOORMFormat
Cost Penalty
Answer F1
Multi-agent[NQ, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, PopQA, AmbigQA]
OPERAP–E Orches.Real-worldMAPGRPOPRM+ORMAnswerer Reward
Planner Reward
Rewriter Reward
Multi-agent[HotpotQA, 2WikiMultiHopQA, MuSiQue, NQ, Multihop-rag]
AI-SearchPlannerP–E Orches.Real-worldPPOORMAnswer LLM-Judge
Trajectory Rationality
Module-level[NQ, TriviaQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, PopQA]
AgentFlowP–E Orches.Real-worldFlow-GRPORule-based ORMEM
LLM Judge
Module-level[HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, AIME24, AMC23, Gameof24, GPQA, MedQA]
SIRAGCooperative Multi-Agent SystemsReal-worldPPOPRMProcess LLM-JudgeMulti-agent[2WikiMultiHopQA, HotpotQA, NQ, PopQA]
MMOA-RAGCooperative Multi-Agent Systems
R-aware Opt.
Real-worldMA-PPORule-based ORMAnswer F1
Efficiency penalty
Multi-agent[HotpotQA, 2WikiMultiHopQA, AmbigQA]
Tool-StarMulti toolReal-worldREINFORCE++
GRPO
DPO
Rule-based ORMFormat
Answer EM
Single-agent[LTMS, MATH, GSM8K, WebWalkerQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle]
WebWatcherMulti tool
Multi-modal
Real-worldGRPOORMFormat
Answer LLM-Judge
Single-agent[HLE, Wu2025mm, LiveVQA, MMSearch, SimpleVQA]
Visual-ARFTMulti-modal
Multi-tool
Adapt-Search
Real-worldGRPORule-based ORM+PRMFormat
Answer F1
Query Semantic Sim.
Single-agent[MATSearch]
VRAG-RLMulti-modal
Search Efficiency
SimulatedGRPOORMFormat
Answer LLM-Judge
Retrieval Efficiency
Single-agent[SlideVQA, VidORAG, MMLongBench]
MMSearch-R1Multi-modal
Search Efficiency
Real-worldGRPORule-based ORMFormat
Answer EM
Search Penalty
Single-agent[MMSearch, Chen2023can, MMSearch, SimpleVQA, LiveVQA]
GRAILAdapt-Search
Struct-Nav.
Real-world
Graph Env.
GRPOPRMProcess LLM-JudgeSingle-agent[WebQuestions, MetaQA, WebQSP]
DynaSearcherStruct-Nav.Real-world
Graph Env.
KG+Doc Search
GRPORule-based ORMFormat
Answer F1
Information Gain
Retrieval Penalty
Single-agent[HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, FRAMES]
HARISR-S Inter.Real-worldGRPORule-based ORMFormat
Answer Accuracy
Decision Accuracy
Multi-agent[M3, HoVer, CheckWhy]
DeepNoteAdapt-Search
Conv-Reform.
Real-worldDPO--Single-agent[HotpotQA, 2WikiMultiHopQA, MuSiQue, StrategyQA, ASQA]
DeepResearcherAdapt-Search
Search Efficiency
Ctx-Mem.
Real-worldGRPORule-based ORMFormat
Answer F1
Module-level[NQ, TriviaQA, HotpotQA, 2WikiMultiHopQA]
SWiRLAdapt-Search
R-S Inter.
Simulated
Offline
Policy GradientPRMStep-wise LLM-Judge (Gemini 1.5 Pro)Step-level[HotpotQA, MuSiQue, CoFCA, GSM8K, Qasper, BeerQA]
WebDancer (Code)Multi toolReal-worldDAPOORMAnswer EMSingle-agent[GAIA, WebWalkerQA, BrowseComp-zh, BrowseComp-en]
MedResearcher-R1Adapt-Search
Multi-Tool
Real-world
Medical Tool
GRPOORMAnswer Acc
Response Quality
Efficiency penalty
Single-agent[XBench, GAIA, MedBrowseComp]
LucySearch Efficiency
R–S Inter.
Real-world
SLMs
DAPORule-based ORMFormat/XML validity
Answer EM
Tool exec. success
Visit/Search ratio
Efficient thinking
Single-agent[WebWalkerQA]
ASearcherR-S Inter.
Ctx-Mem.
Multi-tool
Real-world
Browser Env.
Asynchronous
GRPOORMAnswer LLM-JudgeSingle-agent[NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, FRAMES, GAIA, XBench]
WebExplorerCtx-Mem.
Conv-Reform.
Real-world
Curriculum
GRPORule-based ORMFormat
Answer EM
Single-agent[BrowseComp-zh, BrowseComp-en, GAIA, WebWalkerQA, FRAMES, XBench, HLE]
WebResearcherMulti-toolReal-world
Curriculum
GSPORule-based ORMAnswer EMSingle-agent[HLE, GAIA, BrowseComp-en, BrowseComp-zh, XBench, FRAMES]
RECONCtx-Mem.Real-worldPPORule-based ORMAnswer EMSingle-agent[NQ, TriviaQA, Bamboogle, HotpotQA, 2WikiMultiHopQA, MuSiQue, PopQA]
AgentGym-RLCooperative Multi-Agent Systems
Multi tool
-----Unified RL Agentic Framework-
Chain-of-AgentsCooperative Multi-Agent Systems
Multi tool
-----Unified RL Agentic Framework-
VerlMulti tool-----Unified RL Agentic Framework-
VerlToolMulti tool-----Unified RL Agentic Framework-

Retrieval Control

TimePaper TitleRoleVenueCode
2026.7SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent CollaborationContext & Memory Management; Search Efficiency; Multi-Agent CollaborationarXivCode
2026.7WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web SearchAdaptive Search Decision; Recursive Delegation; Search CoveragearXiv
2026.7DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable EnvironmentAdaptive Search Decision; Self-Distillation; Verifiable EnvironmentarXiv
2026.7VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement LearningAdaptive Search Decision; Multi-Modal; Multi-ToolarXivCode
2026.6SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep ResearchAdaptive Search Decision; Delegation Intelligence; Context ManagementarXiv
2026.7To Answer or to Abstain: Mitigating Search-Agent Hallucinations via Abstention-Aware Reinforcement LearningAdaptive Search Decision; Reliability / AbstentionarXivCode
2026.7GRASP: GRanularity-Aware Search Policy for Agentic RAGAdaptive Search Decision; Retrieval-Granularity Control; Multi-ToolarXiv
2026.7Libra: Training the Environment for Agentic Information RetrievalEnvironment Optimization; Context & Memory ManagementarXivCode Data
2026.7Multi-Turn Agentic Scientific Literature Search via Workflow InductionAdaptive Search Decision; Workflow InductionarXiv
2026.7BaRA: Budget-constrained and Reliable Web Data Collection AgentSearch Efficiency; Budget-constrained Web Data CollectionarXivCode
2026.6Harness-1: Reinforcement Learning for Search Agents with State-Externalizing HarnessesAdaptive Search Decision; Context & Memory Management; Search EfficiencyarXivCode Model
2026.6Effective Reinforcement Learning for Agentic Search by Recycling Zero-Variance Queries During TrainingSearch Efficiency; Training StabilityarXiv
2026.5SAAS: Self-Aware Reinforcement Learning for Over-Search Mitigation in Agentic SearchSearch Efficiency; Adaptive Search DecisionarXivCode
2026.4OThink-SRR1: Search, Refine and Reasoning with Reinforced Learning for Large Language ModelsAdaptive Search Decision; Search EfficiencyarXiv
2026.4VISOR: Agentic Visual Retrieval-Augmented Generation via Iterative Search and Over-horizon ReasoningAdaptive Search Decision; Multi-modal Search EfficiencyarXiv
2026.5QUEST: Training Frontier Deep Research Agents with Fully Synthetic TasksAdaptive Search Decision; Context & Memory ManagementarXiv
2026.5SciResearcher: Scaling Deep Research Agents for Frontier Scientific ReasoningAdaptive Search Decision; Multi‑Tool; Domain-SpecificarXiv
2026.1O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RLAdaptive Search Decision; Planner-Executor OrchestrationarXiv
2026.5CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAGSearch Efficiency; Curriculum Rollout SamplingarXivCode
2026.3Marco DeepResearch: Unlocking Efficient Deep Research Agents via Verification-Centric DesignAdaptive Search Decision; Verification-Centric DesignarXiv
2026.4DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open DataAdaptive Search Decision; Context & Memory Management; Edge-Scale Deep ResearcharXivCode Models
2026.5OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty TrajectoriesAdaptive Search Decision; Search EfficiencyarXiv
2026.5LongSeeker: Elastic Context Orchestration for Long-Horizon Search AgentsContext & Memory Management; Search EfficiencyarXiv
2026.4Search, Do not Guess: Teaching Small Language Models to Be Effective Search AgentsAdaptive Search Decision; Search EfficiencyarXiv
2026.1Deep Search with Hierarchical Meta-Cognitive Monitoring Inspired by Cognitive NeuroscienceAdaptive Search Decision; Context & Memory ManagementarXiv
2026.3APEX-Searcher: Augmenting LLMs' Search Capabilities through Agentic Planning and ExecutionAdaptive Search Decision; Planner-Executor OrchestrationarXiv
2026.3Meta-Reinforcement Learning with Self-Reflection for Agentic SearchAdaptive Search Decision; Self-ReflectionarXivCode
2026.2Search More, Think Less: Rethinking Long-Horizon Agentic Search for Efficiency and GeneralizationAdaptive Search Decision; Search EfficiencyarXivCode
2026.2To Search or Not to Search: Aligning the Decision Boundary of Deep Search Agents via Causal InterventionAdaptive Search Decision; Search EfficiencyWWW 2026
2026.3KARL: Knowledge Agents via Reinforcement LearningAdaptive Search Decision; Search Efficiency; Context & Memory ManagementarXiv
2026.4LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research AgentAdaptive Search Decision; Search EfficiencyarXivCode
2026.4AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement LearningSearch Efficiency; Search IntensityarXivCode
2026.2SIGHT: Reinforcement Learning with Self-Evidence and Information-Gain Diverse Branching for Search AgentAdaptive Search Decision; Search EfficiencyarXiv
2026.2Adaptive Information Control for Search-Augmented LLM ReasoningSearch Efficiency; Search Intensity / Information ControlarXiv
2026.1SearchGym: Bootstrapping Real-World Search Agents via Cost-Effective and High-Fidelity Environment SimulationAdaptive Search Decision; Sim-to-Real / Environment SimulationarXivCode
2026.2How to Train Your Deep Research Agent? Prompt, Reward, and Policy Optimization in Search-R1Adaptive Search Decision; Search EfficiencyarXiv
2026.2REDSearcher: A Scalable and Cost-Efficient Framework for Long-Horizon Search AgentsAdaptive Search Decision; Search EfficiencyarXiv
2026.2Agent-Omit: Training Efficient LLM Agents for Adaptive Thought and Observation Omission via Agentic Reinforcement LearningSearch EfficiencyarXiv
2026.2IntentRL: Training Proactive User-intent Agents for Open-ended Deep Research via Reinforcement LearningAdaptive Search Decision; User-intent / Autonomy–InteractionarXiv
2026.2Training Multi-Turn Search Agent via Contrastive Dynamic Branch SamplingAdaptive Search Decision; Search EfficiencyarXiv
2026.1BAPO: Boundary-Aware Policy Optimization for Reliable Agentic SearchAdaptive Search Decision; Reliability / IDK BoundaryarXivCode
2026.1Agentic-R: Learning to Retrieve for Agentic SearchRetriever‑Aware Optimization; Adaptive Search DecisionarXivCode
2026.1Agentic Conversational Search with Contextualized Reasoning via Reinforcement LearningConversational Reformulation; Adaptive Search DecisionarXiv
2026.1OffSeeker: Online Reinforcement Learning Is Not All You Need for Deep Research AgentsSearch Efficiency; Offline TrainingarXiv
2025.11Thinker: Training LLMs in Hierarchical Thinking for Deep Search via Multi-Turn InteractionAdaptive Search Decision; Search IntensityAAAI 2026Code
2025.11MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement LearningAdaptive Search Decision; Context & Memory ManagementarXivCode
2025.10Towards Agentic Self-Learning LLMs in Search EnvironmentAdaptive Search Decision; Self-LearningarXiv
2025.10Beneficial Reasoning Behaviors in Agentic Search and Effective Post-training to Obtain ThemAdaptive Search Decision; Context & Memory ManagementarXivCode
2025.9Fathom-DeepResearch: Unlocking Long Horizon Information Retrieval and Synthesis for SLMsAdaptive Search Decision; Context & Memory Management; Multi-ToolarXiv
2025.09DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RLAdaptive Search Decision; Search Efficiency; Structured Knowledge NavigationarXivCode
2025.09WebSailor‑V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable Reinforcement LearningMulti‑Tool; Context & Memory ManagementarXivCode
2025.08MedResearcher‑R1: Expert‑Level Medical Deep Researcher via a Knowledge‑Informed Trajectory Synthesis FrameworkAdaptive Search Decision; Multi‑ToolarXivCode
2025.08ParallelSearch: Train Your LLMs to Decompose Query and Search Sub‑Queries in Parallel with Reinforcement LearningSearch EfficiencyarXiv
2025.08SSRL: Self‑Search Reinforcement LearningAdaptive Search DecisionarXivCode
2025.08UR²: Unify RAG and Reasoning through Reinforcement LearningAdaptive Search DecisionarXivCode
2025.07RAG‑R1: Incentivizing the Search and Reasoning Capabilities of LLMs through Multi‑Query ParallelismSearch Efficiency; Convsational ReformulationarXivCode
2025.7Annotation-Free Reinforcement Learning Query Rewriting via Verifiable Search RewardQuery Reformulation; Retriever‑Aware OptimizationarXiv
2025.05Pangu DeepDiver: Adaptive Search Intensity Scaling via Open‑Web Reinforcement LearningAdaptive Search Decision; Search IntensityNeurIPS 2025 (Spotlight)
2025.05Process vs. Outcome Reward: Which Is Better for Agentic RAG Reinforcement LearningRetriever‑Aware OptimizationNeurIPS 2025Code
2025.05Search Wisely: Mitigating Sub‑Optimal Agentic Searches by Reducing UncertaintySearch EfficiencyEMNLP 2025 (Main)
2025.05SimpleDeepSearcher: Deep Information Seeking via Web-Powered Reasoning Trajectory SynthesisAdaptive Search DecisionEMNLP 2025 (Findings)Code
2025.05StepSearch: Igniting LLMs’ Search Ability via Step‑Wise Proximal Policy OptimizationAdaptive Search Decision; Search IntensityEMNLP 2025 (Main)Code
2025.05R1‑Searcher++: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement LearningSearch EfficiencyarXivCode
2025.05ZeroSearch: Incentivize the Search Capability of LLMs without SearchingSearch EfficiencyarXivCode
2025.04WebThinker: Empowering Large Reasoning Models with Deep Research CapabilitySearch EfficiencyNeurIPS 2025Code
2025.04ReZero: Enhancing LLM Search Ability by Trying One‑More‑TimeSearch IntensityarXivCode
2025.04DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real‑World EnvironmentsAdaptive Search Decision; Search Efficiency; Context & Memory ManagementarXivCode
2025.04Synthetic Data Generation & Multi-Step RL for Reasoning & Tool UseAdaptive Search Decision; Reasoning-Search InteractionarXiv
2025.03Learning to Reason with Search for LLMs via Reinforcement LearningAdaptive Search DecisionNeurIPS 2025
2025.03Search‑R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement LearningAdaptive Search DecisionCOLM 2025Code
2025.03R1‑Searcher: Incentivizing the Search Capability in LLMs via Reinforcement LearningAdaptive Search DecisionarXivCode
2025.02DeepRAG: Thinking to Retrieve Step by Step for Large Language ModelsAdaptive Search Decision; Search EfficiencyarXiv

Query Optimization

TimePaper TitleRoleVenueCode
2026.7PCTD: Preference-Guided Counterfactual Task Decomposition for Agent Tool RetrievalRetriever-Aware Optimization; Task Decomposition; Tool RetrievalarXiv
2026.7Bridge Evidence: Static Retrieval Utility Does Not Predict Causal Utility in Multi-Step Agentic SearchRetriever-Aware Evaluation; Counterfactual Trajectory UtilityarXiv
2026.7EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic RetrievalStructured Knowledge Navigation; Adaptive Graph RetrievalCVPR 2026
2026.7GRASP: GRanularity-Aware Search Policy for Agentic RAGRetriever-Aware Optimization; Granularity ControlarXiv
2026.6MCompassRAG: Topic Metadata as a Semantic Compass for Paragraph-Level RetrievalRetriever-Aware Optimization; Metadata-Guided RetrievalarXivCode
2026.7When RAG Meets Query Planning: Logical Query Trees for Resolving Exploratory Reasoning ProblemsQuery Planning; Logical Query TreesSIGMOD 2027
2026.7Libra: Training the Environment for Agentic Information RetrievalEnvironment Optimization; Navigable CatalogsarXivCode Data
2026.7Multi-Turn Agentic Scientific Literature Search via Workflow InductionWorkflow Induction; Scientific Literature SearcharXiv
2026.5GrepSeek: Training Search Agents for Direct Corpus InteractionRetriever‑Aware Optimization; Direct Corpus InteractionarXiv
2026.1RAGShaper: Eliciting Sophisticated Agentic RAG Skills via Automated Data SynthesisRetriever‑Aware Optimization; Data SynthesisarXiv
2026.5LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAGLatent Retrieval; Search EfficiencyarXiv
2026.5Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search SystemsRetriever‑Aware Optimization; Agentic Retrieval EvaluationACL 2026Code
2026.5Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus InteractionRetriever‑Aware Optimization; Direct Corpus InteractionarXiv
2026.5AgenticRAG: Agentic Retrieval for Enterprise Knowledge BasesAgentic Retrieval; In-document NavigationarXiv
2026.5Rethinking Agentic RAG: Toward LLM-Driven Logical Retrieval Beyond EmbeddingsAgentic Retrieval; Logical QueryingarXiv
2026.1SmartSearch: Process Reward-Guided Query Refinement for Search AgentsRetriever‑Aware Optimization; Query RefinementSIGIR 2026Code
2026.4CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic SearchRetriever‑Aware OptimizationarXivCode
2026.4Learning to Retrieve from Agent TrajectoriesRetriever‑Aware OptimizationarXiv
2026.2A-RAG: Scaling Agentic Retrieval-Augmented Generation via Hierarchical Retrieval InterfacesAgentic Retrieval Interface; Hierarchical RetrievalarXivCode
2026.1When should I search more: Adaptive Complex Query Optimization with Reinforcement LearningRetriever‑Aware Optimization; Query ReformulationarXiv
2025.11CriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective CriticRetriever‑Aware OptimizationarXiv
2025.09WebExplorer: Explore and Evolve for Training Long‑Horizon Web AgentsContext & Memory Management; Convsational ReformulationarXiv
2025.08OPERA: A Reinforcement Learning–Enhanced Orchestrated Planner‑Executor Architecture for Reasoning‑Oriented Multi‑Hop RetrievalPlanner-Executor OrchestrationarXiv
2025.08ParallelSearch: Train Your LLMs to Decompose Query and Search Sub‑Queries in Parallel with Reinforcement LearningSearch EfficiencyarXiv
2025.07RAG‑R1: Incentivizing the Search and Reasoning Capabilities of LLMs through Multi‑Query ParallelismSearch Efficiency; Convsational ReformulationarXivCode
2025.05ConvSearch‑R1: Enhancing Query Reformulation for Conversational Search with Reasoning via Reinforcement LearningConvsational ReformulationarXiv
2025.05MaskSearch: A Universal Pre‑Training Framework to Enhance Agentic Search CapabilityConvsational Reformulation; Reasoning-Search InteractionarXiv
2025.05s3: You Don’t Need That Much Data to Train a Search Agent via RLRetriever‑Aware OptimizationEMNLP 2025 (Main)code
2025.05ZeroSearch: Incentivize the Search Capability of LLMs without SearchingSearch EfficiencyarXivCode
2025.04WebThinker: Empowering Large Reasoning Models with Deep Research CapabilitySearch EfficiencyNeurIPS 2025Code
2025.03DeepRetrieval: Hacking Real Search Engines and Retrievers with Large Language Models via Reinforcement LearningRetriever‑Aware OptimizationCOLM 2025Code
2025.01Improving Retrieval‑Augmented Generation through Multi‑Agent Reinforcement LearningCooperative Multi-Agent SystemsNeurIPS 2025Code
2024.10DeepNote: Note-Centric Deep Retrieval-Augmented GenerationConversational Reformulation; Context & Memory ManagementEMNLP 2025 (Findings)

Reasoning–Retrieval Integration

TimePaper TitleRoleVenueCode
2026.7Why Does Feedback-Augmented Self-Distillation Fail to Improve Retrieval-Interleaved Search Agents?Reasoning-Search Interaction; Self-Distillation StabilityarXiv
2026.7Bridge Evidence: Static Retrieval Utility Does Not Predict Causal Utility in Multi-Step Agentic SearchReasoning-Search Interaction; Causal Retrieval UtilityarXiv
2026.7Analogical Deep Research: Retrieving and Integrating Historical Analogies for Foresight AnalysisReasoning-Search Interaction; Analogical Retrieval; ReflectionarXiv
2026.7EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic RetrievalReasoning-Search Interaction; Self-Evolving Knowledge HypergraphCVPR 2026
2026.7DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable EnvironmentReasoning-Search Interaction; Grounded Reflection; Failure RecoveryarXiv
2026.7VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement LearningReasoning-Search Interaction; Multi-Modal; Multi-ToolarXivCode
2026.4Towards Knowledgeable Deep Research: Framework and BenchmarkReasoning-Search Interaction; Structured and Unstructured KnowledgearXiv
2026.7LAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search ReasoningReasoning-Search Interaction; Process SupervisionarXiv
2026.7GRASP: GRanularity-Aware Search Policy for Agentic RAGReasoning-Search Interaction; Retrieval-Granularity ControlarXiv
2026.6DEEPRUBRIC: Evidence-Tree Rubric Supervision for Efficient Reinforcement Learning of Deep Research AgentsReasoning-Search Interaction; Rubric-Based SupervisionarXiv
2026.6ScaffoldAgent: Utility-Guided Dynamic Outline Optimization for Open-Ended Deep ResearchContext & Memory Management; Dynamic Outline OptimizationarXiv
2026.6S1-DeepResearch: Beyond Search, Toward Real-World Long-Horizon Research AgentsContext & Memory Management; Long-Horizon Trajectory SynthesisarXiv
2026.7Evidence-State Rewards for Long-Context ReasoningEvidence-State Memory; Action-level RewardsarXiv
2026.7When RAG Meets Query Planning: Logical Query Trees for Resolving Exploratory Reasoning ProblemsReasoning-Search Interaction; Query PlanningSIGMOD 2027
2026.7Multi-Turn Agentic Scientific Literature Search via Workflow InductionReasoning-Search Interaction; Workflow InductionarXiv
2026.5SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented ReasoningReasoning-Search Interaction; Process SupervisionarXiv
2026.5Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented ReasoningReasoning-Search Interaction; Self-DistillationarXiv
2026.5GrepSeek: Training Search Agents for Direct Corpus InteractionReasoning-Search Interaction; Direct Corpus InteractionarXiv
2026.5QUEST: Training Frontier Deep Research Agents with Fully Synthetic TasksReasoning-Search Interaction; Context & Memory ManagementarXiv
2026.5SciResearcher: Scaling Deep Research Agents for Frontier Scientific ReasoningReasoning-Search Interaction; Domain-SpecificarXiv
2026.5Argus: Evidence Assembly for Scalable Deep Research AgentsReasoning-Search Interaction; Evidence AssemblyarXiv
2026.5RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable RewardsContext & Memory Management; Rubric-Guided Process SupervisionarXiv
2026.5LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAGReasoning-Search Interaction; Search EfficiencyarXiv
2026.5Rethinking Agentic RAG: Toward LLM-Driven Logical Retrieval Beyond EmbeddingsReasoning-Search Interaction; Logical RetrievalarXiv
2025.10DecEx-RAG: Boosting Agentic Retrieval-Augmented Generation with Decision and Execution Optimization via Process SupervisionReasoning-Search Interaction; Process SupervisionarXivCode
2026.3Evaluate-as-Action: Self-Evaluated Process Rewards for Retrieval-Augmented AgentsReasoning-Search Interaction; Process SupervisionarXiv
2026.4CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic SearchReasoning-Search Interaction; Retriever‑Aware OptimizationarXivCode
2026.3SE-Search: Self-Evolving Search Agent via Memory and Dense RewardReasoning-Search Interaction; Context & Memory ManagementarXiv
2026.4IG-Search: Step-Level Information Gain Rewards for Search-Augmented ReasoningReasoning-Search Interaction; Process SupervisionarXiv
2026.4OThink-SRR1: Search, Refine and Reasoning with Reinforced Learning for Large Language ModelsReasoning-Search Interaction; Search EfficiencyarXiv
2026.4VISOR: Agentic Visual Retrieval-Augmented Generation via Iterative Search and Over-horizon ReasoningReasoning-Search Interaction; Multi-modal Search EfficiencyarXiv
2026.4Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy OptimizationReasoning-Search Interaction; Retriever‑Aware OptimizationACL 2026 (Main)
2025.10Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn Search AgentsReasoning-Search Interaction; Process SupervisionICLR 2026 PosterCode
2026.2SIGHT: Reinforcement Learning with Self-Evidence and Information-Gain Diverse Branching for Search AgentReasoning-Search Interaction; Search EfficiencyarXiv
2026.2Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner CollaborationReasoning-Search Interaction; Process SupervisionarXiv
2026.2A-RAG: Scaling Agentic Retrieval-Augmented Generation via Hierarchical Retrieval InterfacesReasoning-Search Interaction; Hierarchical RetrievalarXivCode
2026.2Adaptive Information Control for Search-Augmented LLM ReasoningReasoning-Search Interaction; Information ControlarXiv
2026.2Search-P1: Path-Centric Reward Shaping for Stable and Efficient Agentic RAG TrainingReasoning-Search Interaction; Reward ShapingarXiv
2026.1ProRAG: Process-Supervised Reinforcement Learning for Retrieval-Augmented GenerationReasoning-Search Interaction; Process SupervisionarXivCode
2026.1Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric RewardsReasoning-Search Interaction; Faithfulness / Citation RewardarXivCode
2026.1D2^2Plan: Dual-Agent Dynamic Global Planning for Complex Retrieval-Augmented ReasoningReasoning-Search Interaction; Context Condensation (Purifier)arXiv
2026.1TreePS-RAG: Tree-based Process Supervision for Reinforcement Learning in Agentic RAGReasoning-Search Interaction; Process SupervisionarXiv
2025.11TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation FrameworkSearch Efficiency; Reasoning-Search InteractionarXivCode
2025.10GlobalRAG: Enhancing Global Reasoning in Multi-hop Question Answering via Reinforcement LearningReasoning-Search Interaction; Retriever‑Aware OptimizationarXivCode
2025.10RECON: Reasoning with Condensation for Efficient Retrieval‑Augmented GenerationContext & Memory ManagementarXiv
2025.10Search Self-play: Pushing the Frontier of Agent Capability without SupervisionAdaptive Search Decision; Self-Play TrainingarXivCode
2025.9Fathom-DeepResearch: Unlocking Long Horizon Information Retrieval and Synthesis for SLMsReasoning-Search Interaction; Context & Memory Management; Multi-ToolarXiv
2025.09AceSearcher: Bootstrapping Reasoning and Search for LLMs via Reinforced Self-PlayReasoning-Search Interaction; Self-Play TrainingarXivCode
2025.09ReSum: Unlocking Long‑Horizon Search Intelligence via Context SummarizationContext & Memory ManagementarXiv
2025.09SFR‑DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single AgentsContext & Memory Management; Multi‑ToolarXiv
2025.08Atom‑Searcher: Enhancing Agentic Deep Research via Fine‑Grained Atomic Thought RewardReasoning-Search InteractionarXivCode
2025.08Beyond Ten Turns: Unlocking Long‑Horizon Agentic Search with Large‑Scale Asynchronous RLReasoning-Search Interaction; Retriever‑Aware OptimizationarXiv
2025.07DynaSearcher: Dynamic Knowledge Graph Augmented Search Agent via Multi‑Reward Reinforcement LearningStructured Knowledge NavigationarXiv
2025.07WebSailor: Navigating Super‑Human Reasoning for Web AgentAdaptive Search Decision; Context & Memory ManagementarXiv
2025.06R‑Search: Empowering LLM Reasoning with Search via Multi‑Reward Reinforcement LearningReasoning-Search InteractionarXiv
2025.05Search and Refine During Think: Facilitating Knowledge Refinement for Improved Retrieval-Augmented ReasoningReasoning-Search InteractionNeurIPS 2025Code
2025.05EvolveSearch: An Iterative Self‑Evolving Search AgentReasoning-Search InteractionarXiv
2025.05O²‑Searcher: A Searching‑Based Agent Model for Open‑Domain Open‑Ended Question AnsweringReasoning-Search InteractionarXivCode
2025.05Process vs. Outcome Reward: Which Is Better for Agentic RAG Reinforcement LearningReasoning‑Search Interaction; Retriever‑Aware OptimizationNeurIPS 2025Code
2025.04DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real‑World EnvironmentsContext & Memory ManagementarXiv
2025.04Synthetic Data Generation & Multi-Step RL for Reasoning & Tool UseReasoning‑Search InteractionarXiv

Multi‑Agent Collaboration

TimePaper TitleRoleVenueCode
2026.7SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent CollaborationCooperative Multi-Agent Systems; Search-State ManagementarXivCode
2026.7WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web SearchCooperative Multi-Agent Systems; Recursive DelegationarXiv
2026.6Hybrid Open-Ended Tri-Evolution Makes Better Deep ResearcherCooperative Multi-Agent Systems; Proposer-Solver-Judge Co-EvolutionarXiv
2026.6SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep ResearchCooperative Multi-Agent Systems; Delegation IntelligencearXiv
2026.4Towards Knowledgeable Deep Research: Framework and BenchmarkCooperative Multi-Agent Systems; Hybrid Knowledge AnalysisarXiv
2026.5Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report GenerationCooperative Multi-Agent Systems; Multi‑ModalarXiv
2026.5AgentDisCo: Towards Disentanglement and Collaboration in Open-ended Deep Research AgentsCooperative Multi-Agent Systems; Planner-Executor OrchestrationarXiv
2026.1O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RLCooperative Multi-Agent Systems; Multi‑ToolarXiv
2026.5Argus: Evidence Assembly for Scalable Deep Research AgentsPlanner-Executor Orchestration; Evidence AssemblyarXiv
2026.1PRISMA: Reinforcement Learning Guided Two-Stage Policy Optimization in Multi-Agent Architecture for Open-Domain Multi-Hop Question AnsweringPlanner-Executor OrchestrationarXiv
2026.2WideSeek-R1: Exploring Width Scaling for Broad Information Seeking via Multi-Agent Reinforcement LearningCooperative Multi-Agent SystemsarXiv
2026.1Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic SearchPlanner-Executor Orchestration; Context & Memory ManagementarXivCode
2025.10In-the-Flow Agentic System Optimization for Effective Planning and Tool UsePlanner-Executor Orchestration; Multi‑ToolarXivCode Project page
2025.09AgentGym‑RL: Training LLM Agents for Long‑Horizon Decision Making through Multi‑Turn Reinforcement LearningCooperative Multi-Agent Systems; Multi‑ToolarXiv
2025.09SIRAG: Towards Stable and Interpretable RAG with a Process‑Supervised Multi‑Agent FrameworkCooperative Multi-Agent SystemsarXiv
2025.09WebExplorer: Explore and Evolve for Training Long‑Horizon Web AgentsContext & Memory Management; Convsational ReformulationarXiv
2025.08AI‑SearchPlanner: Modular Agentic Search via Pareto‑Optimal Multi‑Objective Reinforcement LearningPlanner-Executor OrchestrationarXiv
2025.08Chain‑of‑Agents: End‑to‑End Agent Foundation Models via Multi‑Agent Distillation and Agentic RLCooperative Multi-Agent Systems; Multi‑ToolarXiv
2025.08MAO‑ARAG: Multi‑Agent Orchestration for Adaptive Retrieval‑Augmented GenerationPlanner-Executor OrchestrationarXiv
2025.08OPERA: A Reinforcement Learning–Enhanced Orchestrated Planner‑Executor Architecture for Reasoning‑Oriented Multi‑Hop RetrievalPlanner-Executor OrchestrationarXiv
2025.05Advancing Multi-Agent RAG Systems with Minimalist Reinforcement LearningCooperative Multi-Agent SystemsarXiv
2025.01Improving Retrieval‑Augmented Generation through Multi‑Agent Reinforcement LearningCooperative Multi-Agent SystemsNeurIPS 2025Code

Tool and Knowledge Integration

TimePaper TitleRoleVenueCode
2026.7SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent CollaborationMulti-Tool; Search-State Middleware; Context & Memory ManagementarXivCode
2026.7PCTD: Preference-Guided Counterfactual Task Decomposition for Agent Tool RetrievalMulti-Tool; Task Decomposition; Tool RetrievalarXiv
2026.7EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic RetrievalMulti-Modal; Structured Knowledge Navigation; Web SearchCVPR 2026
2026.7DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable EnvironmentSearch Environment; Page Reading; Task / Data SynthesisarXiv
2026.7VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement LearningMulti-Tool; Multi-Modal; Video Deep ResearcharXivCode
2026.4Towards Knowledgeable Deep Research: Framework and BenchmarkMulti-Tool; Structured and Unstructured KnowledgearXiv
2026.7GRASP: GRanularity-Aware Search Policy for Agentic RAGMulti-Tool; Retriever-Aware OptimizationarXiv
2026.6DEEPRUBRIC: Evidence-Tree Rubric Supervision for Efficient Reinforcement Learning of Deep Research AgentsTask / Data Synthesis; Rubric-Based Agentic RLarXiv
2026.6S1-DeepResearch: Beyond Search, Toward Real-World Long-Horizon Research AgentsTask / Trajectory Synthesis; Long-Horizon Research SkillsarXiv
2026.6MCompassRAG: Topic Metadata as a Semantic Compass for Paragraph-Level RetrievalRetriever-Aware Optimization; Metadata-Guided RetrievalarXivCode
2026.7Bringing Agentic Search to Earth Observation Data DiscoveryDomain-Specific; Knowledge Graph SearcharXiv
2026.7BaRA: Budget-constrained and Reliable Web Data Collection AgentMulti‑Tool; Web Data CollectionarXivCode
2026.7Multi-Turn Agentic Scientific Literature Search via Workflow InductionMulti‑Tool; Scientific Literature SearcharXiv
2026.6Harness-1: Reinforcement Learning for Search Agents with State-Externalizing HarnessesStateful Search Harness; Context & Memory ManagementarXivCode Model
2026.5Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report GenerationMulti‑Modal; Multi‑Tool; VerificationarXiv
2026.5SciResearcher: Scaling Deep Research Agents for Frontier Scientific ReasoningMulti‑Tool; Domain-Specific; Task / Data SynthesisarXiv
2026.5QUEST: Training Frontier Deep Research Agents with Fully Synthetic TasksTask / Data Synthesis for Deep ResearcharXiv
2026.5GrepSeek: Training Search Agents for Direct Corpus InteractionStructured Knowledge Navigation; Direct Corpus InteractionarXiv
2026.5Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search AgentsMulti‑Modal; Task / Data SynthesisarXiv
2026.4MTA-Agent: An Open Recipe for Multimodal Deep Search AgentsMulti‑Modal; Multi‑Tool; Task / Data SynthesisarXiv
2026.1RAGShaper: Eliciting Sophisticated Agentic RAG Skills via Automated Data SynthesisTask / Data Synthesis for Agentic RAGarXiv
2026.1O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RLMulti‑Agent Distillation; Agentic RLarXiv
2026.5HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search AgentsMulti‑Tool; Multi‑Modal; Search EfficiencyarXivCode
2026.4VISOR: Agentic Visual Retrieval-Augmented Generation via Iterative Search and Over-horizon ReasoningMulti‑Tool; Multi‑Modal; Search EfficiencyarXiv
2026.5RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable RewardsContext & Memory Management; Rubric-Guided Agentic RLarXiv
2026.3Marco DeepResearch: Unlocking Efficient Deep Research Agents via Verification-Centric DesignTask / Trajectory Synthesis; Verification-Centric DesignarXiv
2026.5OpenSearch-VL: An Open Recipe for Frontier Multimodal Search AgentsMulti‑Tool; Multi‑Modal; Adaptive Search DecisionarXivCode
2026.5Maximizing Rollout Informativeness under a Fixed Budget: A Submodular View of Tree Search for Tool-Use Agentic Reinforcement LearningMulti‑Tool; Training EfficiencyarXiv
2026.5BioMedArena: An Open-source Toolkit for Building and Evaluating Biomedical Deep Research AgentsDomain-Specific; Evaluation ToolkitarXivCode
2026.3SynPlanResearch-R1: Encouraging Tool Exploration for Deep Research with Synthetic PlansMulti‑Tool; Adaptive Search DecisionarXivCode
2026.4LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research AgentUnified Agentic RL Framework; Training Data / Environment SimulationarXivCode
2026.4DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open DataTraining Data / Open-Data Recipe for Deep Research Agents; Edge-Scale Deep ResearcharXivCode Models
2026.4ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented RewardsMulti‑Tool; Multi‑ModalarXiv
2026.4ORBIT: Scalable and Verifiable Data Generation for Search Agents on a Tight BudgetTask / Data Synthesis for Search AgentsarXiv
2026.4Beyond Stochastic Exploration: What Makes Training Data Valuable for Agentic SearchTraining Data / Experience Curation for Search AgentsarXiv
2026.3VSearcher: Long-Horizon Multimodal Search Agent via Reinforcement LearningMulti‑Tool; Multi‑ModalarXiv
2026.3MM-DeepResearch: A Simple and Effective Multimodal Agentic Search BaselineMulti‑Tool; Multi‑ModalarXivCode
2026.3Improving Search Agent with One Line of CodeTraining Stability (TARL / PPO)arXiv
2026.3ProtRLSearch: A Multi-Round Multimodal Protein Search Agent with Large Language Models Trained via Reinforcement LearningMulti‑Tool; Multi‑Modal; Domain-SpecificarXiv
2026.2A-RAG: Scaling Agentic Retrieval-Augmented Generation via Hierarchical Retrieval InterfacesMulti‑Tool; Hierarchical RetrievalarXivCode
2026.2ARLArena: A Unified Framework for Stable Agentic Reinforcement LearningUnified Agentic RL Framework; StabilityarXiv
2026.3RAPO: Expanding Exploration for LLM Agents via Retrieval-Augmented Policy OptimizationAgentic RL Exploration; Retrieval-Augmented Policy OptimizationarXiv
2026.2Reasoning and Tool-use Compete in Agentic RL: From Quantifying Interference to Disentangled TuningAgentic RL Training Dynamics (Reasoning–Tool Interference)arXiv
2026.1GraphSearch: Agentic Search-Augmented Reasoning for Zero-Shot Graph LearningStructured Knowledge Navigation; Graph SearcharXiv
2026.1OpenTinker: Separating Concerns in Agentic Reinforcement LearningUnified Agentic RL FrameworkarXiv
2026.1SCRIBE: Structured Mid-Level Supervision for Tool-Using Language ModelsMulti‑Tool; Mid‑Level Reward Modeling (Skill Prototypes)arXiv
2026.1AT2^2PO: Agentic Turn-based Policy Optimization via Tree SearchMulti‑Turn Agentic RL; Credit AssignmentarXivCode
2026.1PEARL: Plan Exploration and Adaptive Reinforcement Learning for Multihop Tool UseMulti‑Tool; Planner‑Executor OrchestrationPRICAI 2025
2025.12CARL: Focusing Agentic Reinforcement Learning on Critical ActionsCredit Assignment for Multi‑Step Tool UsearXiv
2025.12On Group Relative Policy Optimization Collapse in Agent Search: The Lazy Likelihood-DisplacementTraining Stability (GRPO)arXiv
2025.12RouteRAG: Efficient Retrieval-Augmented Generation from Text and Graph via Reinforcement LearningStructured Knowledge Navigation; Multi‑ToolarXivCode
2025.12CuES: A Curiosity-driven and Environment-grounded Synthesis Framework for Agentic RLTask / Curriculum Synthesis for Agentic RL (tool environments)arXivCode
2025.12SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement LearningMulti‑Tool; Multi‑ModalarXiv
2025.11Agent‑R1: Training Powerful LLM Agents with End‑to‑End Reinforcement LearningMulti‑ToolarXivCode
2025.10MARAG-R1: Beyond Single Retriever via Reinforcement-Learned Multi-Tool Agentic RetrievalMulti‑Tool; Retriever‑Aware OptimizationarXiv
2025.09Empowering LLM Tool Invocation with Tool-call Reward ModelMulti‑ToolICLR 2026 Submission
2025.09VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool UseMulti‑ToolarXivCode
2025.9Fathom-DeepResearch: Unlocking Long Horizon Information Retrieval and Synthesis for SLMsMulti‑Tool; Context & Memory ManagementarXiv
2025.09WebResearcher: Unleashing unbounded reasoning capability in Long‑Horizon AgentsMulti‑ToolarXivCode
2025.08GRAIL: Learning to Interact with Large Knowledge Graphs for Retrieval‑Augmented ReasoningAdaptive Search Decision; Structured Knowledge NavigationarXivCode
2025.08MedResearcher‑R1: Expert‑Level Medical Deep Researcher via a Knowledge‑Informed Trajectory Synthesis FrameworkAdaptive Search Decision; Multi‑ToolarXivCode
2025.08WebWatcher: Breaking New Frontier of Vision‑Language Deep Research AgentMulti‑Tool; Multi‑ModalarXiv
2025.07DynaSearcher: Dynamic Knowledge Graph Augmented Search Agent via Multi‑Reward Reinforcement LearningStructured Knowledge NavigationarXiv
2025.06MMSearch‑R1: Incentivizing LMMs to SearchMulti‑Modal; Search EfficiencyarXivCode
2025.05VRAG‑RL: Empower Vision‑Perception‑Based RAG for Visually Rich Information Understanding via Iterative Reasoning with RLMulti‑Modal; Search EfficiencyarXiv
2025.05Tool‑Star: Empowering LLM‑Brained Multi‑Tool Reasoner via Reinforcement LearningMulti‑ToolarXivCode
2025.05Visual Agentic Reinforcement Fine‑TuningMulti‑Modal; Multi‑Tool; Adaptive Search DecisionarXivCode

Where RL is Applied: Optimization Scopes

Agent-level

📊 Click to expand long table (scrollable).
TimePaper TitleRoleVenueCode
2026.7Why Does Feedback-Augmented Self-Distillation Fail to Improve Retrieval-Interleaved Search Agents?Single-agent OptimizationarXiv
2026.7SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent CollaborationMulti-agent CoordinationarXivCode
2026.7Analogical Deep Research: Retrieving and Integrating Historical Analogies for Foresight AnalysisSingle-agent OptimizationarXiv
2026.7EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic RetrievalSingle-agent OptimizationCVPR 2026
2026.7WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web SearchMulti-agent CoordinationarXiv
2026.7DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable EnvironmentSingle-agent OptimizationarXiv
2026.7VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement LearningSingle-agent OptimizationarXivCode
2026.6Hybrid Open-Ended Tri-Evolution Makes Better Deep ResearcherMulti-agent CoordinationarXiv
2026.6SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep ResearchMulti-agent CoordinationarXiv
2026.4Towards Knowledgeable Deep Research: Framework and BenchmarkMulti-agent CoordinationarXiv
2026.7LAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search ReasoningSingle-agent OptimizationarXiv
2026.7To Answer or to Abstain: Mitigating Search-Agent Hallucinations via Abstention-Aware Reinforcement LearningSingle-agent OptimizationarXivCode
2026.7GRASP: GRanularity-Aware Search Policy for Agentic RAGSingle-agent OptimizationarXiv
2026.6DEEPRUBRIC: Evidence-Tree Rubric Supervision for Efficient Reinforcement Learning of Deep Research AgentsSingle-agent OptimizationarXiv
2026.6ScaffoldAgent: Utility-Guided Dynamic Outline Optimization for Open-Ended Deep ResearchSingle-agent OptimizationarXiv
2026.6S1-DeepResearch: Beyond Search, Toward Real-World Long-Horizon Research AgentsSingle-agent OptimizationarXiv
2026.7Libra: Training the Environment for Agentic Information RetrievalSingle-agent OptimizationarXivCode Data
2026.7Multi-Turn Agentic Scientific Literature Search via Workflow InductionSingle-agent OptimizationarXiv
2026.7BaRA: Budget-constrained and Reliable Web Data Collection AgentSingle-agent OptimizationarXivCode
2026.7Bringing Agentic Search to Earth Observation Data DiscoverySingle-agent OptimizationarXiv
2026.6Harness-1: Reinforcement Learning for Search Agents with State-Externalizing HarnessesSingle-agent OptimizationarXivCode Model
2026.6Effective Reinforcement Learning for Agentic Search by Recycling Zero-Variance Queries During TrainingSingle-agent OptimizationarXiv
2026.5SAAS: Self-Aware Reinforcement Learning for Over-Search Mitigation in Agentic SearchSingle-agent OptimizationarXivCode
2026.5SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented ReasoningSingle-agent OptimizationarXiv
2026.5Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented ReasoningSingle-agent OptimizationarXiv
2026.5GrepSeek: Training Search Agents for Direct Corpus InteractionSingle-agent OptimizationarXiv
2026.5QUEST: Training Frontier Deep Research Agents with Fully Synthetic TasksSingle-agent OptimizationarXiv
2026.5SciResearcher: Scaling Deep Research Agents for Frontier Scientific ReasoningSingle-agent OptimizationarXiv
2026.5Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search AgentsSingle-agent OptimizationarXiv
2026.4Negative Advantages Is a Double-Edged Sword: Calibrating advantages in GRPO for Search AgentsSingle-agent OptimizationarXivCode
2026.4OThink-SRR1: Search, Refine and Reasoning with Reinforced Learning for Large Language ModelsSingle-agent OptimizationarXiv
2026.4VISOR: Agentic Visual Retrieval-Augmented Generation via Iterative Search and Over-horizon ReasoningSingle-agent OptimizationarXiv
2026.4MTA-Agent: An Open Recipe for Multimodal Deep Search AgentsSingle-agent OptimizationarXiv
2026.1O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RLSingle-agent OptimizationarXiv
2026.1RAGShaper: Eliciting Sophisticated Agentic RAG Skills via Automated Data SynthesisSingle-agent OptimizationarXiv
2026.5Argus: Evidence Assembly for Scalable Deep Research AgentsMulti-agent CoordinationarXiv
2026.5CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAGSingle-agent OptimizationarXivCode
2026.5HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search AgentsSingle-agent OptimizationarXivCode
2026.5RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable RewardsSingle-agent OptimizationarXiv
2026.5LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAGSingle-agent OptimizationarXiv
2026.3Marco DeepResearch: Unlocking Efficient Deep Research Agents via Verification-Centric DesignSingle-agent OptimizationarXiv
2025.10DecEx-RAG: Boosting Agentic Retrieval-Augmented Generation with Decision and Execution Optimization via Process SupervisionSingle-agent OptimizationarXivCode
2026.5OpenSearch-VL: An Open Recipe for Frontier Multimodal Search AgentsSingle-agent OptimizationarXivCode
2026.5OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty TrajectoriesSingle-agent OptimizationarXiv
2026.5LongSeeker: Elastic Context Orchestration for Long-Horizon Search AgentsSingle-agent OptimizationarXiv
2026.4Search, Do not Guess: Teaching Small Language Models to Be Effective Search AgentsSingle-agent OptimizationarXiv
2026.1Deep Search with Hierarchical Meta-Cognitive Monitoring Inspired by Cognitive NeuroscienceSingle-agent OptimizationarXiv
2026.3APEX-Searcher: Augmenting LLMs' Search Capabilities through Agentic Planning and ExecutionSingle-agent OptimizationarXiv
2026.3Meta-Reinforcement Learning with Self-Reflection for Agentic SearchSingle-agent OptimizationarXivCode
2026.2Search More, Think Less: Rethinking Long-Horizon Agentic Search for Efficiency and GeneralizationSingle-agent OptimizationarXivCode
2026.3KARL: Knowledge Agents via Reinforcement LearningSingle-agent OptimizationarXiv
2026.4LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research AgentSingle-agent OptimizationarXivCode
2026.4AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement LearningSingle-agent OptimizationarXivCode
2026.4DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open DataSingle-agent OptimizationarXivCode Models
2026.4ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented RewardsSingle-agent OptimizationarXiv
2026.3SynPlanResearch-R1: Encouraging Tool Exploration for Deep Research with Synthetic PlansSingle-agent OptimizationarXivCode
2026.3VSearcher: Long-Horizon Multimodal Search Agent via Reinforcement LearningSingle-agent OptimizationarXiv
2026.3MM-DeepResearch: A Simple and Effective Multimodal Agentic Search BaselineSingle-agent OptimizationarXivCode
2026.3ProtRLSearch: A Multi-Round Multimodal Protein Search Agent with Large Language Models Trained via Reinforcement LearningSingle-agent OptimizationarXiv
2026.3RAPO: Expanding Exploration for LLM Agents via Retrieval-Augmented Policy OptimizationSingle-agent OptimizationarXiv
2026.2SIGHT: Reinforcement Learning with Self-Evidence and Information-Gain Diverse Branching for Search AgentSingle-agent OptimizationarXiv
2026.2Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner CollaborationSingle-agent OptimizationarXiv
2026.2A-RAG: Scaling Agentic Retrieval-Augmented Generation via Hierarchical Retrieval InterfacesSingle-agent OptimizationarXivCode
2026.2Adaptive Information Control for Search-Augmented LLM ReasoningSingle-agent OptimizationarXiv
2026.1SearchGym: Bootstrapping Real-World Search Agents via Cost-Effective and High-Fidelity Environment SimulationSingle-agent OptimizationarXivCode
2026.1GraphSearch: Agentic Search-Augmented Reasoning for Zero-Shot Graph LearningSingle-agent OptimizationarXiv
2025.11Thinker: Training LLMs in Hierarchical Thinking for Deep Search via Multi-Turn InteractionSingle-agent OptimizationAAAI 2026Code
2025.11MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement LearningSingle-agent OptimizationarXivCode
2025.10Beneficial Reasoning Behaviors in Agentic Search and Effective Post-training to Obtain ThemSingle-agent OptimizationarXivCode
2025.9Fathom-DeepResearch: Unlocking Long Horizon Information Retrieval and Synthesis for SLMsSingle-agent OptimizationarXiv
2025.09DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RLSingle-agent OptimizationarXivCode
2025.09SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single AgentsSingle-agent OptimizationarXiv
2025.09WebExplorer: Explore and evolve for training long-horizon web agentsSingle-agent OptimizationarXiv
2025.09WebResearcher: Unleashing unbounded reasoning capability in Long-Horizon AgentsSingle-agent OptimizationarXiv
2025.09AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement LearningSingle-agent OptimizationarXiv
2025.09WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable Reinforcement LearningSingle-agent OptimizationarXivCode
2025.6MMSearch-R1: Incentivizing LMMs to SearchSingle-agent OptimizationarXivCode
2025.08MedResearcher-R1: Expert-Level Medical Deep Researcher via A Knowledge-Informed Trajectory Synthesis FrameworkSingle-agent OptimizationarXivCode
2025.08WebWatcher: Breaking New Frontier of Vision-Language Deep Research AgentSingle-agent OptimizationarXiv
2025.08GRAIL: Learning to interact with large knowledge graphs for retrieval-augmented reasoningSingle-agent OptimizationarXivCode
2025.5VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement LearningSingle-agent OptimizationarXiv
2025.5Visual Agentic Reinforcement Fine-TuningSingle-agent OptimizationarXivCode
2025.7WebSailor: Navigating Super-Human Reasoning for Web AgentSingle-agent OptimizationarXiv
2025.08ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement LearningSingle-agent OptimizationarXiv
2025.08UR2: Unify RAG and Reasoning through Reinforcement LearningSingle-agent OptimizationarXivCode
2025.08SSRL: Self-Search Reinforcement LearningSingle-agent OptimizationarXivCode
2025.7DynaSearcher: Dynamic Knowledge Graph Augmented Search Agent via Multi-Reward Reinforcement LearningSingle-agent OptimizationarXiv
2025.6R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement LearningSingle-agent OptimizationarXiv
2025.5EvolveSearch: An Iterative Self-Evolving Search AgentSingle-agent OptimizationarXiv
2025.5O2-Searcher: a searching-based agent model for open-domain open-ended question answeringSingle-agent OptimizationarXivCode
2025.5Pangu DeepDiver: Adaptive Search Intensity Scaling via Open-Web Reinforcement LearningSingle-agent OptimizationNeurIPS 2025 (Spotlight)
2025.05Reinforced Internal-External Knowledge Synergistic Reasoning for Efficient Adaptive Search AgentSingle-agent OptimizationarXiv
2025.5ZeroSearch: Incentivize the Search Capability of LLMs without SearchingSingle-agent OptimizationarXivCode
2025.5MaskSearch: A Universal Pre-Training Framework to Enhance Agentic Search CapabilitySingle-agent OptimizationarXiv
2025.4ReZero: Enhancing LLM Search Ability by Trying One-More-TimeSingle-agent OptimizationarXivCode
2025.5Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement LearningSingle-agent OptimizationarXivCode
2025.3DeepRetrieval: Hacking Real Search Engines and Retrievers with Large Language Models via Reinforcement LearningSingle-agent OptimizationCOLM 2025Code
2025.4WebThinker: Empowering Large Reasoning Models with Deep Research CapabilitySingle-agent OptimizationNeurIPS 2025Code
2025.05Search Wisely: Mitigating Sub-optimal Agentic Searches By Reducing UncertaintySingle-agent OptimizationEMNLP 2025 (Main)
2025.4DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world EnvironmentsSingle-agent OptimizationarXivCode
2025.3Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement LearningSingle-agent OptimizationCOLM 2025Code
2025.3ReSearch: Learning to Reason with Search for LLMs via Reinforcement LearningSingle-agent OptimizationNeurIPS 2025
2025.05R1-Searcher++: Incentivizing the dynamic knowledge acquisition of llms via reinforcement learningSingle-agent OptimizationarXivCode
2025.3Agent models: Internalizing Chain-of-Action Generation into Reasoning modelsSingle-agent OptimizationarXivCode
2025.08Lucy: edgerunning agentic web search on mobile with machine generated task vectorsSingle-agent OptimizationarXiv
2025.2DeepRAG: Thinking to Retrieve Step by Step for Large Language ModelsSingle-agent OptimizationarXiv
2025.5StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy OptimizationSingle-agent OptimizationEMNLP 2025 (Main)Code
2025.1Improving Retrieval-Augmented Generation through Multi-Agent Reinforcement LearningMulti-agent CoordinationNeurIPS 2025Code
2025.06Coordinating Search-Informed Reasoning and Reasoning-Guided Search in Claim VerificationMulti-agent CoordinationarXiv
2025.9SIRAG: Towards Stable and Interpretable RAG with a Process-Supervised Multi-Agent FrameworkMulti-agent CoordinationarXiv
2026.2WideSeek-R1: Exploring Width Scaling for Broad Information Seeking via Multi-Agent Reinforcement LearningMulti-agent CoordinationarXiv
2026.1Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic SearchMulti-agent CoordinationarXivCode
2025.8MAO-ARAG: Multi-Agent Orchestration for Adaptive Retrieval-Augmented GenerationMulti-agent CoordinationarXiv
2025.1MMOA-RAG: Improving Retrieval-Augmented Generation through Multi-Agent Reinforcement LearningMulti-agent CoordinationNeurIPS 2025Code
2025.8OPERA: A Reinforcement Learning–Enhanced Orchestrated Planner-Executor Architecture for Reasoning-Oriented Multi-Hop RetrievalMulti-agent CoordinationarXiv
2025.02DeepRAG: Thinking to Retrieval Step by Step for Large Language ModelsSingle‑agent OptimizationarXiv
2025.01Improving Retrieval‑Augmented Generation through Multi‑Agent Reinforcement LearningMulti‑agent CoordinationNeurIPS 2025Code
2024.10DeepNote: Note-Centric Deep Retrieval-Augmented GenerationSingle‑agent OptimizationEMNLP 2025 (Findings)

Step-level

📊 Click to expand long table (scrollable).
TimePaper TitleRoleVenueCode
2026.7LAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search ReasoningStep-level OptimizationarXiv
2026.7Evidence-State Rewards for Long-Context ReasoningStep‑level OptimizationarXiv
2026.5SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented ReasoningStep‑level OptimizationarXiv
2026.5Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented ReasoningStep‑level OptimizationarXiv
2026.4Negative Advantages Is a Double-Edged Sword: Calibrating advantages in GRPO for Search AgentsStep‑level OptimizationarXivCode
2025.10DecEx-RAG: Boosting Agentic Retrieval-Augmented Generation with Decision and Execution Optimization via Process SupervisionStep‑level OptimizationarXivCode
2026.5A2^2TGPO: Agentic Turn-Group Policy Optimization with Adaptive Turn-level ClippingStep‑level OptimizationarXiv
2026.5Maximizing Rollout Informativeness under a Fixed Budget: A Submodular View of Tree Search for Tool-Use Agentic Reinforcement LearningStep‑level OptimizationarXiv
2026.3Evaluate-as-Action: Self-Evaluated Process Rewards for Retrieval-Augmented AgentsStep‑level OptimizationarXiv
2026.4IG-Search: Step-Level Information Gain Rewards for Search-Augmented ReasoningStep‑level OptimizationarXiv
2026.4OThink-SRR1: Search, Refine and Reasoning with Reinforced Learning for Large Language ModelsStep‑level OptimizationarXiv
2026.4Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy OptimizationStep‑level OptimizationACL 2026 (Main)
2025.10Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn Search AgentsStep‑level OptimizationICLR 2026 PosterCode
2026.4PRAISE: Prefix-Based Rollout Reuse in Agentic Search TrainingStep‑level OptimizationarXiv
2026.2Search-P1: Path-Centric Reward Shaping for Stable and Efficient Agentic RAG TrainingStep‑level OptimizationarXiv
2026.2Adaptive Information Control for Search-Augmented LLM ReasoningStep‑level OptimizationarXiv
2025.10Beyond Correctness: Rewarding Faithful Reasoning in Retrieval‑Augmented GenerationStep‑level OptimizationarXiv
2025.08Atom‑Searcher: Enhancing Agentic Deep Research via Fine‑Grained Atomic Thought RewardStep‑level OptimizationarXivCode
2025.05StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy OptimizationStep‑level OptimizationEMNLP 2025Code
2025.05Process vs. Outcome Reward: Which Is Better for Agentic RAG Reinforcement LearningStep‑level OptimizationNeurIPS 2025Code
2025.05Search and Refine During Think: Facilitating Knowledge Refinement for Improved Retrieval-Augmented ReasoningStep‑level OptimizationNeurIPS 2025Code
2025.05ConvSearch‑R1: Enhancing Query Reformulation for Conversational Search with Reasoning via Reinforcement LearningStep‑level OptimizationarXiv
2025.05Reinforced Internal‑External Knowledge Synergistic Reasoning for Efficient Adaptive Search AgentStep‑level OptimizationarXiv
2025.04ReZero: Enhancing LLM Search Ability by Trying One‑More‑TimeStep‑level OptimizationarXivCode
2025.04Synthetic Data Generation & Multi-Step RL for Reasoning & Tool UseStep‑level OptimizationarXiv

Module-level

📊 Click to expand long table (scrollable).
TimePaper TitleRoleVenueCode
2026.7PCTD: Preference-Guided Counterfactual Task Decomposition for Agent Tool RetrievalModule-level OptimizationarXiv
2025.08AI-SearchPlanner: Modular Agentic Search via Pareto-Optimal Multi-Objective Reinforcement LearningModule-level OptimizationarXiv
2025.05s3: You Don’t Need That Much Data to Train a Search Agent via RLModule-level OptimizationarXiv
2025.04Deepresearcher: Scaling deep research via reinforcement learning in real-world environmentsModule-level OptimizationarXivCode

System-level

📊 Click to expand long table (scrollable).
TimePaper TitleRoleVenueCode
2026.7SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent CollaborationSystem-level Multi-Agent Search FrameworkarXivCode
2026.7WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web SearchRecursive Multi-Agent Search FrameworkarXiv
2026.7DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable EnvironmentVerifiable Search Environment / Self-Distillation FrameworkarXiv
2026.7Libra: Training the Environment for Agentic Information RetrievalEnvironment-level Agentic IR FrameworkarXivCode Data
2026.6Harness-1: Reinforcement Learning for Search Agents with State-Externalizing HarnessesStateful Search Harness / RL Search AgentarXivCode Model
2026.6Agentic Transformers Provably Learn to Search via Reinforcement LearningTheoretical RL Search BehaviorarXiv
2025.09AgentGym‑RL: Training LLM Agents for Long‑Horizon Decision Making through Multi‑Turn Reinforcement LearningUnified RL‑based Agentic FrameworkarXiv
2025.09VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool UseUnified RL‑based Agentic FrameworkarXiv
2025.08Chain‑of‑Agents: End‑to‑End Agent Foundation Models via Multi‑Agent Distillation and Agentic RLUnified RL‑based Agentic FrameworkarXiv
2025.02RAG‑Gym: Systematic Optimization of Language Agents for Retrieval‑Augmented GenerationUnified RL‑based Agentic FrameworkarXiv
2024.09HybridFlow: A Flexible and Efficient RLHF FrameworkUnified RL‑based Agentic Framework (Verl)arXiv

Evaluation

Metrics

Below is a compact checklist of commonly used evaluation signals for RL-based agentic search (see the survey for details):

  • Answer quality (final output): Exact Match (EM), token-level F1, and LLM-as-a-judge scores for open-ended outputs (e.g., used by Search-R1, ReZero).
    • Similarity-based metrics (e.g., BERTScore) are also used for more free-form generations.
  • Search effectiveness (retrieval / evidence): retrieval relevance/coverage metrics (e.g., Recall@k / Precision@k / nDCG) and evidence usefulness; some works explicitly optimize or evaluate retrieval behavior (e.g., DeepRetrieval).
  • Search efficiency (cost / budget): number of search/tool calls, token/latency cost, and other explicit penalties/rewards (e.g., Pangu DeepDiver, MAO-ARAG, R1-Searcher++).
  • Process / trajectory quality (intermediate steps): step-wise correctness, information gain, redundancy penalties, and other process-level signals (often combined with a PRM or heuristic shaping; e.g., StepSearch, VERITAS, ReasonRAG, ConvSearch-R1).
  • System-level benchmarks: some benchmarks are designed specifically to evaluate deep-research style agents (e.g., RAG-Gym).
TimePaper TitleFocusVenue
2026.7WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting (Code)Dynamic Football Forecasting Benchmark for LLMs and Deep-Research AgentsarXiv
2026.7DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence EnvironmentsMisleading-Evidence Robustness BenchmarkarXiv
2026.7PCTD: Preference-Guided Counterfactual Task Decomposition for Agent Tool RetrievalMobile Multi-Turn Task-Decomposition / Tool-Retrieval Benchmark (MTDTool)arXiv
2026.7Bridge Evidence: Static Retrieval Utility Does Not Predict Causal Utility in Multi-Step Agentic SearchCounterfactual Retrieval-Utility Analysis for Multi-Step Agentic SearcharXiv
2026.7FinResearchBench II: A Deep Research Benchmark with Consensus-Derived Gold Rubrics for Distinguishing Financial Report QualityConsensus-Derived Rubric Benchmark for Financial Deep ResearcharXiv
2026.7DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable EnvironmentDeterministic Verifiable Search Environment with 420K Multi-Hop QA TasksarXiv
2026.7FORGE: Research-Trajectory Hijacking Attacks on Deep Research Agents (Code)Research-Trajectory Hijacking / Planning-Layer PoisoningarXiv
2026.7VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning (Code)Video Deep Research Benchmark (VideoSearch-QA)arXiv
2026.7KidnapRAG: A Black-Box Attack for Hijacking Reasoning in Agentic Retrieval-Augmented Generation Systems (Code)Black-Box Sequential Poisoning of Agentic RAGarXiv
2026.7Analogical Deep Research: Retrieving and Integrating Historical Analogies for Foresight AnalysisHistorical-Analogy Retrieval and Integration Benchmark (ADR-bench)arXiv
2026.6Can LLM-as-a-Judge Reliably Verify Rubrics in Agentic Scenarios? (Code)Rubric-Verification Meta-Evaluation Benchmark (RuVerBench)arXiv
2026.6Multi-Turn Evaluation of Deep Research Agents Under Process-Level Feedback (Code)Process-Level Feedback Evaluation for Deep Research AgentsSCALE @ ICML 2026 (Oral)
2026.6Can AI Agents Synthesize Scientific Conclusions?Scientific Conclusion-Synthesis Benchmark (SciConBench)arXiv
2026.4Towards Knowledgeable Deep Research: Framework and BenchmarkStructured + Unstructured Knowledge Benchmark (KDR-Bench)arXiv
2025.7ResearcherBench: Evaluating Deep AI Research Systems on the Frontiers of Scientific Inquiry (Code)Frontier Scientific Inquiry BenchmarkarXiv
2026.7DeepStress: Stress-Testing Deep Search AgentsControlled Stress Testing under Unreliable EvidencearXiv
2026.7On-Device Deep Research at 4B: Exposure Bounds Faithfulness, Retrieval Bounds CoverageCitation Faithfulness / Trustworthy Coverage on Edge-Scale AgentsarXiv
2026.7HETERQA: Benchmarking Record Retrieval over Multiple Heterogeneous Sources (Code, Data)Heterogeneous-Source Record Retrieval BenchmarkarXiv
2026.6Breaking the Evaluation Paradox: Evaluating High-Entropy Search with Computationally Irreducible ConstraintsVERITAS: Verifiable Exhaustive-Search EvaluationACL 2026
2026.6Beyond Monolingual Deep Research: Evaluating Agents and Retrievers with Cross-Lingual BrowseComp-PlusCross-Lingual / Multilingual Deep-Research Benchmark (XBCP)arXiv
2026.6DRFLOW: A Deep Research Benchmark for Personalized Workflow PredictionPersonalized Workflow Prediction from Heterogeneous SourcesarXiv
2026.6ICBCBench: An Industry Consortium Benchmark for Financial Deep Research (Code)Objective + Long-Form Financial Deep-Research EvaluationarXiv
2026.4AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery (Code)Deep / Wide Scientific Literature Discovery BenchmarkarXiv
2026.6Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive BenchmarkPhysical-Science Deep Research Benchmark (PhySciBench) + DelveAgentarXiv
2026.6Search-Time Contamination in Deep Research Agents: Measuring Performance Inflation in Public Benchmark EvaluationSearch-Time Contamination / Benchmark Leakage EvaluationarXiv
2026.5DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon DerivationCross-Source Evidence + Long-Horizon Derivation BenchmarkarXiv
2026.4Deep FinResearch Bench: Evaluating AI's Ability to Conduct Professional Financial Investment ResearchProfessional Financial Investment Research BenchmarkarXiv
2025.6Mind2Web 2: Evaluating Agentic Search with Agent-as-a-JudgeLong-Horizon Agentic Search Benchmark + Agent-as-a-JudgearXiv
2026.7Bringing Agentic Search to Earth Observation Data DiscoveryEarth Observation Search Benchmark (NASA-EO-Bench)arXiv
2026.7When RAG Meets Query Planning: Logical Query Trees for Resolving Exploratory Reasoning ProblemsExploratory Reasoning Query-Planning Dataset (WikiWeb-ERP)SIGMOD 2027
2026.5Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report GenerationMultimodal Deep Research Harness + PtahEvalarXiv
2026.5AgentDisCo: Towards Disentanglement and Collaboration in Open-ended Deep Research AgentsOpen-ended Deep Research Architecture + GALA BenchmarkarXiv
2026.5Evaluating Deep Research Agents on Expert Consulting Work: A Benchmark with Verifiers, Rubrics, and Cognitive TrapsExpert Consulting Work BenchmarkarXiv
2026.5Deep-Research Agents Can Be Poisoned via User-Generated ContentSafety / Poisoning Evaluation for Deep Research AgentsarXiv
2026.1FinDeepForecast: A Live Multi-Agent System for Benchmarking Deep Research Agents in Financial ForecastingLive Financial Forecasting BenchmarkarXiv
2025.10A Rigorous Benchmark with Multidimensional Evaluation for Deep Research Agents: From Answers to ReportsMultidimensional Report Evaluation BenchmarkarXiv
2025.6Deep Research Bench: Evaluating AI Web Research AgentsFrozen-Web RetroSearch EvaluationarXiv
2026.5InterLV-Search: Benchmarking Interleaved Multimodal Agentic SearchInterleaved Language-Vision Agentic Search BenchmarkarXiv
2026.5HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search AgentsParallel Multimodal Search + IMEB Efficiency BenchmarkarXiv
2025.10Agentic Reinforcement Learning for Search is UnsafeSafety Evaluation for RL-Trained Search AgentsarXiv
2026.5BioMedArena: An Open-source Toolkit for Building and Evaluating Biomedical Deep Research AgentsBiomedical Deep Research Evaluation ToolkitarXiv
2026.5Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search SystemsReasoning-Intensive Retrieval Benchmark (BRIGHT-Pro)ACL 2026
2026.5Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research AgentsSource Attribution / Citation Faithfulness EvaluationarXiv
2026.5Partial Evidence Bench: Benchmarking Authorization-Limited Evidence in Agentic SystemsAuthorization-Limited Evidence BenchmarkarXiv
2026.4DR3^3-Eval: Towards Realistic and Reproducible Deep Research EvaluationRealistic / Reproducible Multimodal Evaluation FrameworkarXiv
2026.4PaperScope: A Multi-Modal Multi-Document Benchmark for Agentic Deep Research Across Massive Scientific PapersMulti-Modal Multi-Document Scientific Deep Research BenchmarkarXiv
2026.3VisBrowse-Bench: Benchmarking Visual-Native Search for Multimodal Browsing AgentsVisual-Native Multimodal Browsing BenchmarkCVPR 2026
2026.2Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language ModelsVisual + Textual Search Benchmark for Multimodal Deep ResearcharXiv
2026.1MMDeepResearch-Bench: A Benchmark for Multimodal Deep Research AgentsMultimodal Deep Research BenchmarkarXiv
2026.3MiroEval: Benchmarking Multimodal Deep Research Agents in Process and OutcomeMultimodal Deep Research Benchmark + Process/Outcome EvaluationarXiv
2026.3Evaluating the Search Agent in a Parallel WorldParallel-World Interactive Benchmark (MPW-Bench)arXiv
2026.3Total Recall QA: A Verifiable Evaluation Suite for Deep Research AgentsVerifiable Total-Recall QA BenchmarkarXiv
2026.3LongVidSearch: An Agentic Benchmark for Multi-hop Evidence Retrieval Planning in Long VideosAgentic Multi-hop Video Search BenchmarkarXiv
2026.3DeepFact: Co-Evolving Benchmarks and Agents for Deep Research FactualityClaim-Level Factuality Benchmark + VerifierarXiv
2026.3KARL: Knowledge Agents via Reinforcement LearningMulti-Capability Grounded Reasoning Benchmark Suite (KARLBench)arXiv
2026.3DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research AgentBenchmark Dataset + Open Training FrameworkarXiv
2026.2DRACO: a Cross-Domain Benchmark for Deep Research Accuracy, Completeness, and ObjectivityCross-Domain Deep Research BenchmarkarXiv
2026.2DREAM: Deep Research Evaluation with Agentic MetricsAgentic Evaluation Protocol / Capability-Parity MetricsarXiv
2026.2Wiki Live Challenge: Challenging Deep Research Agents with Expert-Level Wikipedia ArticlesLive Wikipedia-Writing BenchmarkarXiv
2026.2Revisiting Text Ranking in Deep ResearchRetriever / Ranker Analysis for Deep ResearcharXiv
2026.2SAGE: Benchmarking and Improving Retrieval for Deep Research AgentsRetrieval Benchmark + Strong BaselinesarXiv
2026.2W&D: Scaling Parallel Tool Calling for Efficient Deep Research AgentsParallel Tool Calling (Width) vs Turns (Depth)arXiv
2026.1ScholarGym: Benchmarking Large Language Model Capabilities in the Information-Gathering Stage of Deep ResearchAcademic Literature Information-Gathering BenchmarkarXiv
2026.1DeepSearchQA: Bridging the Comprehensiveness Gap for Deep Research AgentsMulti-Step Deep Research QA BenchmarkarXiv
2026.1IDRBench: Interactive Deep Research BenchmarkInteractive Deep Research BenchmarkarXiv
2026.1DR-Arena: an Automated Evaluation Framework for Deep Research AgentsDynamic Automated Evaluation FrameworkarXiv
2026.1DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert ReportRubric-Based Expert-Report BenchmarkarXiv
2026.1DeepResearchEval: An Automated Framework for Deep Research Task Construction and Agentic EvaluationAutomated Task Construction + Agentic EvaluationarXiv
2026.4AgentWebBench: Benchmarking Multi-Agent Coordination in Agentic WebMulti-Agent Coordination Benchmark for Agentic WebarXiv
2026.4ClawBench: A Benchmark for Evaluating AI Agents on Real-World Online Tasks (Code, Project)Live-website, long-horizon browser-agent benchmark with reproducible task execution and layered tracesarXiv
2026.4MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web EnvironmentsMultimodal Noisy-Web Retrieval + Reasoning BenchmarkarXiv
2026.2LiveNewsBench: Evaluating LLM Web Search Capabilities with Freshly Curated NewsFresh News Benchmark for Agentic Web SearcharXiv
2025.12LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life ServicesVertical-Domain Benchmark for Local-Life Agentic SearcharXiv
2026.1Agentic Search in the Wild: Intents and Trajectory Dynamics from 14M+ Real Search RequestsReal‑World Agentic Search Logs / Trajectory AnalysisarXiv
2025.8DeepScholar-Bench: A Live Benchmark and Automated Evaluation for Generative Research SynthesisLive Research-Synthesis Benchmark + Automated EvaluationarXiv
2025.8ReportBench: Evaluating Deep Research Agents via Academic Survey TasksAcademic Survey-Task BenchmarkarXiv
2025.5DeepResearchGym: A Free, Transparent, and Reproducible Evaluation Sandbox for Deep ResearchReproducible Evaluation Sandbox / Search APIarXiv

Datasets

CategoryDatasets
Knowledge Sourcewiki-dump, Common Crawl, KILT, PubMed, arXiv
Knowledge-Intensive QANQ, TriviaQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, PopQA, CAG, C-SimpleQA, SuperGPQA
BRIGHT, BRIGHT-Pro, SealQA, BLUR, NaturalReasoning
FEVER, EX-FEVER, FEVEROUS, FactBench, RealFactBench, LongFact, FRAMES, RAG-Bench
BEIR, AmbigQA, MetaQA, WebQuestions, CWQ, CheckWhy, BeerQA
HETERQA
Web-based SearchWebQA, Bamboogle, Mind2Web, Mind2Web 2, WebArena, WebWalkerQA, AgentBench
BrowseComp-en, BrowseComp-zh, BrowseComp-Plus, GAIA, GAIA-2, XbenchDeepSearch
WebPuzzle, InfoDeepSeek, ORION, WebShaperQA, LocalSearchBench, LiveNewsBench, AgentWebBench, WikiWeb-ERP, DeepResearch-9K, DeepWeb-Bench
DRACO, Total Recall QA, DeepSearchQA, ScholarGym, DR3-Eval
VERITAS (Traversal Assessment), XBCP
DeepSearch-World
Multi-modalInfoSeek, MMSearch, MMSearch-Plus, SimpleVQA, LiveVQA, MM-BrowseComp
MAT-Search, Mocheg, MFC-Bench, ViDoSeek, SlideVQA, MMLongBench
MMDeepResearch-Bench, Vision-DeepResearch Benchmark, MM-SearchExam, VisBrowse-Bench, LongVidSearch, VideoDR, MTA-Vision-DeepSearch, PtahEval, SearchVL-SFT/RL, PaperScope, MERRIN
VideoSearch-QA
ConversationalCoQA, QuAC, MSMarco, TopiOCQA, QReCC, OR-QuAC, NarrativeQA, Doc2Dial
Domain-specificMATH, MATH500, AIME24, AIME25, GSM8K, MinervaMath
MMLU, MMLU-Pro, NuminaMath
MedQA, MedMCQA, MedBrowseComp, ProtMCQs, BioMedArena
OlympiadBench, USACO, HLE
FinSearchBench-24, Deep FinResearch Bench, FinAgentBench, KARLBench, PhySciBench, NASA-EO-Bench, Partial Evidence Bench, TaxoBench, xbench
MIRAGE, SolutionBench, DQA, AirQA, HERB
SciQ, SciFact, ARC, ScIRGen-Geo, DeepShop, NFCorpus, OpenThoughts, SciResearcher
ICBCBench, DRFLOW, AutoResearchBench
MTDTool, WorldCupArena, FinResearchBench II, ADR-bench, KDR-Bench, SciConBench, ResearcherBench
Safety / Robustness & Meta-EvaluationDRNOISE, FORGE, KidnapRAG, RuVerBench