![]() |
王 傲 然
Ao-Ran Wang Ph.D. student, LAMDA Group School of Artificial Intelligence National Key Laboratory for Novel Software Technology Nanjing University, Nanjing 210023, China Email: wangar@lamda.nju.edu.cn Laboratory: Room A201, Shaoyifu Building, Nanjing University Xianlin Campus |
Aoran Wang, Jingtao Zhang, Maosen Li, Zongzhang Zhang. DiReCL: Learning Differentiable Reward Code with Inverse Reinforcement Learning. To appear in: Advances in Neural Information Processing Systems 40 (NeurIPS'26), 2026.
Wenjie Qiu*, Xuqin Zhang*, Yihang Zhang, Aoran Wang, Zongzhang Zhang, Yang Yu. Bridging Reward Model Evaluation and Policy Evaluation through Ranking Consistency. In: Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD'26), 2026.
Aoran Wang, Lei Ou, Yang Yu, Zongzhang Zhang. Reward Model Evaluation via Automatically-Ranked Policy Alignment. In: Proceedings of the 40th AAAI Conference on Artificial Intelligence (AAAI'26), 2026. (Oral)