Ling Yang
地址:北京市海淀区颐和园路5号,北京大学静园六院
ARTIFICIAL INTELLIGENCE · AGENTS · REINFORCEMENT LEARNING

Ling Yang 杨灵

Incoming 北京大学助理教授(PI)、研究员、博士生导师 · 现为 普林斯顿大学 博士后研究员

面向下一代模型与智能体学习、进化与发现的基础设施

杨灵,即将入职北京大学担任助理教授(PI)、研究员、博士生导师。现为普林斯顿大学 ECE / Princeton AI Lab 博士后研究员,与王梦迪教授合作。博士毕业于北京大学,导师为崔斌教授和张路霞教授,博士期间入选 ByteDance Top Seed 顶尖人才计划。当前主要研究 LLM / Agent Post-Training、Reinforcement Learning Systems / Infrastructure、Recursive Self-Improvement (RSI) 与 AI for Discovery。在北京大学创立 Discovery Intelligence Group (DIG,发现智能课题组),并建立 Gen-Verse 开源研究社区,相关项目在 GitHub 与 Hugging Face 累计达到千万级使用量。累计发表论文 70 余篇,成果发表于 NeurIPS、ICML、ICLR、CVPR、ACL 等国际人工智能与机器学习顶级会议,多项工作获得 Spotlight(Top 3%)、Oral(Top 1%)和 Best Paper Award。长期招收积极主动、具有较强研究驱动力的博士生、硕士生、博士后和研究实习生,同时欢迎学术界与产业界开展科研合作。欢迎联系:yangling0818@163.com。

Ling Yang is an incoming Assistant Professor (PI), Researcher, and Ph.D. advisor at Peking University. He is currently a Postdoctoral Researcher in ECE / Princeton AI Lab at Princeton University, working with Prof. Mengdi Wang. He received his Ph.D. from Peking University, supervised by Prof. Bin Cui and Prof. Luxia Zhang, and was selected for the ByteDance Top Seed Talent Program during his doctoral studies. His research focuses on LLM / Agent Post-Training, Reinforcement Learning Systems / Infrastructure, Recursive Self-Improvement (RSI), and AI for Discovery. He founded the Discovery Intelligence Group (DIG) at Peking University and built Gen-Verse, an open-source research community whose projects have reached tens of millions of cumulative uses across GitHub and Hugging Face. He has published 70+ papers at leading AI and machine learning venues including NeurIPS, ICML, ICLR, CVPR, and ACL, with several works receiving Spotlight (Top 3%), Oral (Top 1%), and Best Paper Award recognition. He is actively recruiting highly motivated Ph.D. students, master's students, postdoctoral researchers, and research interns, and welcomes academic and industrial collaborations. Contact: yangling0818@163.com.

Discovery Intelligence Group (DIG)

LLM / Agent Post-Training、RL Systems / Infrastructure、Recursive Self-Improvement、AI for Discovery。

代表成果

Buffer of Thoughts、ReasonFlux 系列、MMaDA 系列、RLAnything、OpenClaw-RL、TraceRL、LatentMAS、RPG 等。

荣誉与学术服务

WAIC 云帆奖·明日之星,KAUST Rising Star,ByteDance Top Seed 顶尖人才计划,ICML / ICLR / NeurIPS 领域主席,以及多项人工智能顶会 Top 1% Oral / Top 3% Spotlight 工作。

开放研究影响力

Gen-Verse 系列项目在 GitHub 与 HuggingFace 累计达到千万级使用量,并持续建设开放研究系统与社区。

GLOBAL RESEARCH NETWORK

产业与前沿实验室合作

Google DeepMind OpenAI Anthropic ByteDance Seed Alibaba Qwen

长期与国内外前沿 AI 团队的研究人员保持研究合作与学术交流,覆盖基础模型、强化学习、智能体等方向。优秀学生有机会参与跨机构研究项目,并与产业界前沿研究人员共同开展研究。

STUDENT DEVELOPMENT

国际学术交流与学生发展

Princeton Stanford Oxford

与 Princeton、Stanford、Oxford 等国际高校研究团队保持长期学术联系与合作。对研究表现突出的学生,将积极支持其开展国际合作、访问研究,并在 PhD / Postdoc 申请中提供研究指导、合作机会与推荐支持。

研究方向

我的研究关注如何让基础模型从静态的问题求解器,逐步发展为能够长期训练、稳定交互、持续自我改进,并最终参与开放式发现的智能系统。当前研究主要围绕四个相互连接、但各自可以形成独立研究体系的大方向展开。

01

LLM / Agent Post-Training

研究面向大语言模型与智能体的后训练范式,包括 reasoning、agentic behavior、reward / verifier、process supervision、long-horizon credit assignment、environment interaction 与 generalization。重点关注如何让模型在复杂任务与真实交互环境中形成可迁移、可扩展的推理与行动能力。

ReasonFlux/PRM/Coder · Buffer of Thoughts · AgentDistill · Verifier / Reward Modeling
02

RL Systems / Infrastructure

研究支撑大规模强化学习与 Agent 训练的统一系统与基础设施,包括异步训练、长程 rollout、multi-environment training、trajectory management、policy lag、distributed inference / training,以及面向 100+ step agent tasks 的训练稳定性与效率。

RLAnything · OpenClaw-RL · dLLM-RL · Long-Horizon RL Infra
03

Recursive Self-Improvement

研究智能体如何通过经验、记忆、技能、数据和环境反馈不断改进自身,而不仅依赖一次性的参数更新。重点探索 Environment–Policy Co-Evolution、skill / memory evolution、active exploration,以及 discovery system harnesses 的自我优化。

RLAnything · GenEnv · Self-Evolving Harnesses
04

AI for Discovery

研究超越“给定问题—求解答案”的基础模型新范式:模型需要主动发现和定义问题,构造或修正变量与表征,形成假设,设计干预与实验,并根据外部证据持续修正研究过程。目标是构建能够参与真实科学与开放式发现过程的通用模型系统。

Discovery Post-Training · AI for Science

开源研究体系

Gen-Verse Research Ecosystem

Research ideas → reusable systems → open-source community

ReasonFlux A family of reasoning systems: thought templates, process reward models, and co-evolving coders. REASONING · PRM
RLAnything Dynamic environment, policy and reward learning for general RL. GENERAL RL
OpenClaw-RL Fully asynchronous RL for interactive and long-horizon agents. ASYNC AGENT RL
GenEnv Environment construction and evolution for agent learning. ENVIRONMENTS
MMaDA Multimodal large diffusion language models. MULTIMODAL dLLM
dLLM-RL Reinforcement learning infrastructure for diffusion language models. dLLM POST-TRAINING
20K+GITHUB STARS
1M+HUGGINGFACE DOWNLOADS
6CORE OPEN-SOURCE SYSTEMS

近期动态

RECRUITING

即将出任助理教授(PI),长期招收 硕士生、博士生、博士后与线上 / 线下研究实习生,方向包括 LLM / Agent Post-Training 与 Infra、Physical AI、AI for Discovery。欢迎邮件联系

2026 · AWARD

2026 WAIC 云帆奖,全球 15 位入选者之一。[链接]

ICML 2026

6 篇论文接收(含 1 篇 Spotlight),覆盖 LLM、Agent 与多模态强化学习,包括 RLAnythingAutoToolLatentMAS

RELEASE

发布 OpenClaw-RLCode):全异步 RL 框架,在对话、终端、GUI、SWE 与工具调用等真实场景中,用实时 next-state 信号训练个人与通用智能体。HuggingFace Daily Papers 第 1 名

CVPR 2026

2 篇论文接收,方向为多模态强化学习。

EMNLP 2025

3 篇论文接收,覆盖 LLM 与 Agent,其中 EmoAgentOral · Top 1%,另含 TreeBoN

WAIC 2025

受邀参加 WAIC 2025 圆桌论坛,由 林达华 教授主持。

SERVICE

受邀担任 NeurIPS 2025 Area Chair

NeurIPS 2024

5 篇论文接收,覆盖 Diffusion Models 与 LLM,其中 Buffer of ThoughtsSpotlight · Top 3%

ICML 2024

2 篇论文接收,覆盖 Diffusion Models 与 AI for Science。

TKDE 2024

1 篇论文接收,方向为通用 / 分子图扩散模型。

CVPR 2024

1 篇论文接收,方向为 DiT、DDPM 与 Score SDE 的改进训练算法。

ICLR 2024

3 篇论文接收,覆盖 Diffusion Models、GNN 与 AI for Science。

AAAI 2024

1 篇论文接收,方向为分子扩散模型。

ACM CSUR

与 OpenAI 合作的扩散模型综述被 ACM Computing Surveys 接收。

NeurIPS 2023

1 篇扩散模型论文接收

TNNLS 2023

1 篇论文接收

TKDE 2023

1 篇论文接收

ICML 2022

2 篇论文接收Spotlight · Top 3%

CVPR 2020

1 篇论文接收

← 横向拖动或滚动查看全部 32 条动态 →

代表论文

ICML 2026
RLAnything: Forge Environment, Policy, and Reward Model in Completely Dynamic RL System
通用 agentic RL · 通讯作者工作
ICML 2026Spotlight · Top 3%
Latent Collaboration in Multi-Agent Systems (LatentMAS)
隐空间中的高效多智能体协作 · 通讯作者工作
TECH REPORT
OpenClaw-RL: Train Any Agent Simply by Talking
面向交互式智能体的全异步强化学习
ICLR 2026
Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models (TraceRL)
面向扩散语言模型的轨迹感知强化学习(TraceRL & TraDo)· 通讯作者工作
NEURIPS 2024Spotlight · Top 3%
Buffer of Thoughts: Thought-Augmented Reasoning with Large Language Models
基于思维模板的结构化推理
NEURIPS 2025
MMaDA: Multimodal Large Diffusion Language Models
统一的多模态生成建模
PREPRINT
ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates
结构化推理与后训练
NEURIPS 2025Spotlight · Top 3%
Co-Evolving LLM Coder and Unit Tester via Reinforcement Learning (ReasonFlux-Coder)
代码与单元测试的协同进化强化学习 · 通讯作者工作
NEURIPS 2025
ReasonFlux-PRM: Trajectory-Aware PRMs for Long Chain-of-Thought Reasoning in LLMs
面向长链推理的轨迹感知过程奖励模型 · 通讯作者工作
ICML 2024
Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs
生成模型基础(RPG)

加入我们

招收对前沿 AI 真正有追求的学生

长期招收 硕士生、博士生、博士后、线上/线下研究实习生,重点方向包括 LLM/Agent Post-Training、Reinforcement Learning、Self-Improving Agents 与 AI for Discovery。

MasterPhDPostdocResearch Intern
Frontier Problems直接面向前沿模型与 Agent 的核心研究问题。
Strong Mentorship从执行研究逐渐训练到独立定义问题与领导方向。
Open-source Impact研究成果强调 paper + system + community 的共同影响。
Global Network与 Stanford、Oxford、Princeton、PKU 及国际学术团队保持广泛合作。