Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR
New research proposes Sequential Adaptive Rollout Allocation (SARA) to improve compute efficiency in Reinforcement Learning with Verifiable Rewards (RLVR).