我是杨博涵,目前是南京大学人工智能学院的一年级硕士。

我的导师是袁雷研究员和俞扬教授,我也是周志华教授领导的 LAMDA 研究组的一员。在这之前,我的本科也毕业于南京大学人工智能学院。由于 RL 实在是太有趣了,我在大二时就申请加入了俞扬教授负责的 LAMDA RL LAB

我的研究兴趣是大语言模型强化学习、多智能体强化学习。

科研探索

* 表示相同贡献

ReVal 方法示意图

ArXiv 预印本

Off-Policy Value-Based Reinforcement Learning for Large Language Models

Peng-Yuan Wang*, Ziniu Li*, Tian Xu*, Bohan Yang, Tian-Shuo Liu, ChenYang Wang, Xiong-Hui Chen, Yi-Chen Li, Tianyun Yang, Congliang Chen, Yang Yu

现在 LLM RL 训练的 rollout 越来越重型,这让提高数据利用效率变得更加重要。然而目前的主流方法对数据 on policy 程度的要求一般比较严格,新鲜度较低、训推不一致都有可能明显影响训练的稳定性。我们探索了一种面向 LLM 的 value-base 方法,这个方法不对训练数据分布做出假设,能高效复用 off policy 的数据。在数学推理上的实验表明我们的方法在收敛速度和收敛性能上相比 GRPO 等方法呈现一定优势。

EndoRM 方法示意图

投稿至 nature machine intelligence

Generalist Reward Model Found inside Large Language Model Provably Enables Self-improvement

Yi-Chen Li*, Tian Xu*, Yang Yu*, Bohan Yang, Xuqin Zhang, Xiong-Hui Chen, Zhenru Zhang, Lei Yuan, Bowen Yu, Junyang Lin, Zhi-Hua Zhou

神奇的是 LLM 的自监督训练目标和逆强化学习目标居然是一致的,这意味着任何经过预训练的 LLM 都隐含着一个由训练数据集导出的 reward model,我们可以通过「内生奖励」引导出训练过程中所见的知识,而且这种奖励表现出很强的指令遵循能力,因而更加通用。这样的内生奖励有丰富多样的用法,例如我们可以通过强化学习,让 LLM 在自己的内生奖励的基础上学习更加远视的规划能力,在不引入外部信号的情况下提升推理的表现。

Lapse 方法示意图

ICML 2025

Learning to Reuse Policies in State Evolvable Environments

Ziqian Zhang*, Bohan Yang*, Lihe Li, Yuqi Bian, Ruiqi Xue, Feng Chen, Yi-Chen Li, Lei Yuan, Yang Yu

一个历经千辛万苦训练好的 RL 策略,在观测环境的方式发生变动时(例如传感器的老化,摄像头的转动,API 接口的调整等),其性能往往会显著下降,我们通过自动集成两种互补的策略复用方式,将现有策略的知识高效蒸馏到新的策略中。我们在离散游戏环境 Atari 和连续控制环境 Mujoco 中的实验表明我们的方法能显著缓解观测空间变化导致的性能下降,整体指标达到了最好基线的二倍。

GOMAS 方法示意图

投稿至 TPAMI,审稿中

Generalizable Offline Multi-Agent Reinforcement Learning with Flexible Skill Modulations Retrieval

Lei Yuan, Bohan Yang, Ziqian Zhang, Lihe Li, Yang Yu

多智能体决策对模型的泛化性提出更高的挑战。以星际争霸微操战局为例,敌我阵营规模与构成纷繁多样,端到端学习的覆盖程度有限。我们发现不同任务的解实际上是同一套 skills 的不同组合方式,因此我们设计了一套 LoRA Adapter 的自动训练与检索机制,让 Agent 能够自行选配合适的 skill 打出精彩配合。我们在星际争霸微操环境 SMAC 中的实验表明我们的方法在训练任务上和未见任务上都表现出性能优势。

有趣项目

LLM 推理调度方案配图

九坤 infra 挑战赛特色方案奖

平衡吞吐量和时延的 LLM 推理调度方案

吞吐量是时延是 LLM 推理引擎的两大关键指标。对于一大批请求,我们设计了一种尽可能多的在规定时限内完成推理的调度策略。我们通过维护统计量来判断一个请求是否是不可能完成的,对于我们认为可做的请求,通过给 SGLang 添加分层的优先级调度方案来允许快要到期的请求插队,并且打断那些已经过期的请求。此外我们分别维护 prefill 和 decode 等待队列,避免 decode 请求被持续到来的 prefill 请求饿死。

德州扑克 Agent 项目配图

九坤 Poker AI 挑战赛特色方案奖

德州扑克 Agent

六人桌德州扑克目前尚且没有成熟的基于 RL 的方案。我们构造了德州扑克 gym 环境,使用 Ray 实现了一个多种群博弈训练方案,不同的训练进程会不断为策略池贡献新的策略,一个排位系统通过优胜劣汰维护策略池,为了避免固定的策略被剥削,通过 UCB 算法来动态选择最合适的策略。

分布式 RL 训练框架项目配图

挑战杯揭榜挂帅全国特等奖(团队中学生六人) · 学生一作专利

为重型 rollout 环境设计的分布式 RL 训练框架

比赛围绕空战仿真环境展开,这个环境严格实时,导致一条轨迹的 rollout 长度可能从几十秒到数十分钟不等,同步的 rollout 会导致大量空闲。我们设计了一种理论上不会产生气泡的 rollout 机制,cpu 节点持续跑满环境并发,集齐一个 batch 就进行一次策略更新,与此同时 rollout 不会暂停,而是在策略更新同步参数后继续进行。

音乐生成模型项目配图

易方达资产杯“AI+”第一名 · 江苏省计算机设计大赛特等奖

从零训练音乐生成模型

音乐 midi 乐谱可以离散化为 token 序列,因此我们直接收集数据训练一个 nano-GPT 用于乐谱生成,不过我们发现这样的生成效果不佳,不像人类作品,为此我们引入了 GAN 的训练流程,通过轨迹末尾的一个 CLS token 来让生成模型直接充当判别器,主观测评显示对抗训练明显提升了音乐生成效果。

其他奖项

  1. 南京大学优秀本科毕业生
  2. 杨蓝云领导型人才奖学金
  3. 南京大学人工智能学院科研竞赛之星奖学金
  4. NOIP 吉林省一等奖

其他

音乐

我最喜欢 Trance 音乐风格,比如 Hiroyuki ODA,Bernis,Taishi 等。此外我平时还会听一些 Vocaloid,我也喜欢东方 Project 的同人音乐作品。

游戏

我最喜欢的游戏是守望先锋,你可以在国服通过「深度强化学习#5544」找到我。在这之前我还玩过英雄联盟、彩虹六号、命运二。如果有一天几个 Agent 能够在不看攻略的情况下通关命运二的任何一个 raid,也许 AGI 就到来了。

LAMDA RL LAB 主页预览

LAMDA RL LAB 主页

我基于 VitePress 和 Tailwind CSS 开发了 LAMDA RL LAB 的主页。

南京大学开甲书院院徽

开甲书院院徽

我设计了南京大学开甲书院的院徽,开甲书院是南京大学计算机学科的新生学院。