Outcome-based Exploration for LLM Reasoning

Reinforcement learning (RL) has emerged as a powerful method for improving the reasoning abilities of large language models (LLMs). Outcome-based RL, which rewards policies solely for the correctness of the final answer, yields substantial accuracy gains but also induces a systematic loss in generation diversity. This collapse undermines real-world performance, where diversity is critical for test-time scaling. We analyze this phenomenon by viewing RL post-training as a sampling process and show that, strikingly, RL can reduce effective diversity even on the training set relative to the base model. Our study highlights two central findings: (i) a transfer of diversity degradation, where reduced diversity on solved problems propagates to unsolved ones, and (ii) the tractability of the outcome space, since reasoning tasks admit only a limited set of distinct answers. Motivated by these insights, we propose outcome-based exploration, which assigns exploration bonuses according to final outcomes. We introduce two complementary algorithms: historical exploration, which encourages rarely observed answers via UCB-style bonuses, and batch exploration, which penalizes within-batch repetition to promote test-time diversity. Experiments on standard competition math with Llama and Qwen models demonstrate that both methods improve accuracy while mitigating diversity collapse. On the theoretical side, we formalize the benefit of outcome-based exploration through a new model of outcome-based bandits. Together, these contributions chart a practical path toward RL methods that enhance reasoning without sacrificing the diversity essential for scalable deployment.

Pass@k Training forAdaptively Balancing…Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Modelse3: Learning to ExploreEnables Extrapolation o…e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMsEcho Chamber: RLPost-training Amplifies…Echo Chamber: RL Post-training Amplifies Behaviors Learned in PretrainingJointly ReinforcingDiversity and Quality i…Jointly Reinforcing Diversity and Quality in Language Model GenerationsFirst Return,Entropy-Eliciting…First Return, Entropy-Eliciting ExploreNavigate the Unknown:Enhancing LLM Reasoning…Navigate the Unknown: Enhancing LLM Reasoning with Intrinsic Motivation Guided ExplorationThe Invisible Leash: WhyRLVR May Not Escape Its…The Invisible Leash: Why RLVR May Not Escape Its OriginOptimizing LanguageModels for Inference…Optimizing Language Models for Inference Time Objectives using Reinforcement LearningDAPO: An Open-Source LLMReinforcement Learning…DAPO: An Open-Source LLM Reinforcement Learning System at ScaleDoes ReinforcementLearning Really…Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?Weight EnsemblingImproves Reasoning in…Weight Ensembling Improves Reasoning in Language ModelsReasoning withExploration: An Entropy…Reasoning with Exploration: An Entropy PerspectiveRepresentation-BasedExploration for Languag…Representation-Based Exploration for Language Models: From Test-Time to Post-TrainingDifferential SmoothingMitigates Sharpening an…Differential Smoothing Mitigates Sharpening and Improves LLM ReasoningNavigate the Unknown:Enhancing LLM Reasoning…Navigate the Unknown: Enhancing LLM Reasoning with Intrinsic Motivation Guided ExplorationPolychromic Objectivesfor Reinforcement…Polychromic Objectives for Reinforcement LearningKL-RegularizedReinforcement Learning…KL-Regularized Reinforcement Learning is Designed to Mode CollapseRandom Policy Valuationis Enough for LLM…Random Policy Valuation is Enough for LLM Reasoning with Verifiable RewardsOn Advantage Estimatesfor Max@K Policy…On Advantage Estimates for Max@K Policy GradientsPoly-EPO: TrainingExploratory Reasoning…Poly-EPO: Training Exploratory Reasoning ModelsBeyond Mode Elicitation:Diversity-Preserving…Beyond Mode Elicitation: Diversity-Preserving Reinforcement Learning via Latent Diffusion ReasonerMaximum LikelihoodReinforcement LearningMaximum Likelihood Reinforcement LearningOrderGrad: OptimizingBeyond the Mean with…OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient EstimationPOPE: Learning to Reasonon Hard Problems via…POPE: Learning to Reason on Hard Problems via Privileged On-Policy ExplorationOutcome-basedExploration for LLM…Outcome-based Exploration for LLM Reasoning過去の参考文献中心の論文この論文を引用する論文古い新しい

ノードをクリックするとフォーカスを固定、空白をクリックすると本論文に戻ります。ホバーで一時的にプレビューできます。各ノードのページはタイトルから開けます。