ArXiv 预印本
Off-Policy Value-Based Reinforcement Learning for Large Language Models
现在 LLM RL 训练的 rollout 越来越重型,这让提高数据利用效率变得更加重要。然而目前的主流方法对数据 on policy 程度的要求一般比较严格,新鲜度较低、训推不一致都有可能明显影响训练的稳定性。我们探索了一种面向 LLM 的 value-base 方法,这个方法不对训练数据分布做出假设,能高效复用 off policy 的数据。在数学推理上的实验表明我们的方法在收敛速度和收敛性能上相比 GRPO 等方法呈现一定优势。