即将出任助理教授(PI),长期招收 硕士生、博士生、博士后与线上 / 线下研究实习生,方向包括 LLM / Agent Post-Training 与 Infra、Physical AI、AI for Discovery。欢迎邮件联系。
Ling Yang 杨灵
面向下一代模型与智能体学习、进化与发现的基础设施
杨灵,即将入职北京大学担任助理教授(PI)、研究员、博士生导师。现为普林斯顿大学 ECE / Princeton AI Lab 博士后研究员,与王梦迪教授合作。博士毕业于北京大学,导师为崔斌教授和张路霞教授,博士期间入选 ByteDance Top Seed 顶尖人才计划。当前主要研究 LLM / Agent Post-Training、Reinforcement Learning Systems / Infrastructure、Recursive Self-Improvement (RSI) 与 AI for Discovery。在北京大学创立 Discovery Intelligence Group (DIG,发现智能课题组),并建立 Gen-Verse 开源研究社区,相关项目在 GitHub 与 Hugging Face 累计达到千万级使用量。累计发表论文 70 余篇,成果发表于 NeurIPS、ICML、ICLR、CVPR、ACL 等国际人工智能与机器学习顶级会议,多项工作获得 Spotlight(Top 3%)、Oral(Top 1%)和 Best Paper Award。长期招收积极主动、具有较强研究驱动力的博士生、硕士生、博士后和研究实习生,同时欢迎学术界与产业界开展科研合作。欢迎联系:yangling0818@163.com。
Ling Yang is an incoming Assistant Professor (PI), Researcher, and Ph.D. advisor at Peking University. He is currently a Postdoctoral Researcher in ECE / Princeton AI Lab at Princeton University, working with Prof. Mengdi Wang. He received his Ph.D. from Peking University, supervised by Prof. Bin Cui and Prof. Luxia Zhang, and was selected for the ByteDance Top Seed Talent Program during his doctoral studies. His research focuses on LLM / Agent Post-Training, Reinforcement Learning Systems / Infrastructure, Recursive Self-Improvement (RSI), and AI for Discovery. He founded the Discovery Intelligence Group (DIG) at Peking University and built Gen-Verse, an open-source research community whose projects have reached tens of millions of cumulative uses across GitHub and Hugging Face. He has published 70+ papers at leading AI and machine learning venues including NeurIPS, ICML, ICLR, CVPR, and ACL, with several works receiving Spotlight (Top 3%), Oral (Top 1%), and Best Paper Award recognition. He is actively recruiting highly motivated Ph.D. students, master's students, postdoctoral researchers, and research interns, and welcomes academic and industrial collaborations. Contact: yangling0818@163.com.
Discovery Intelligence Group (DIG)
LLM / Agent Post-Training、RL Systems / Infrastructure、Recursive Self-Improvement、AI for Discovery。
代表成果
Buffer of Thoughts、ReasonFlux 系列、MMaDA 系列、RLAnything、OpenClaw-RL、TraceRL、LatentMAS、RPG 等。
荣誉与学术服务
WAIC 云帆奖·明日之星,KAUST Rising Star,ByteDance Top Seed 顶尖人才计划,ICML / ICLR / NeurIPS 领域主席,以及多项人工智能顶会 Top 1% Oral / Top 3% Spotlight 工作。
开放研究影响力
Gen-Verse 系列项目在 GitHub 与 HuggingFace 累计达到千万级使用量,并持续建设开放研究系统与社区。
产业与前沿实验室合作
长期与国内外前沿 AI 团队的研究人员保持研究合作与学术交流,覆盖基础模型、强化学习、智能体等方向。优秀学生有机会参与跨机构研究项目,并与产业界前沿研究人员共同开展研究。
国际学术交流与学生发展
与 Princeton、Stanford、Oxford 等国际高校研究团队保持长期学术联系与合作。对研究表现突出的学生,将积极支持其开展国际合作、访问研究,并在 PhD / Postdoc 申请中提供研究指导、合作机会与推荐支持。
研究方向
我的研究关注如何让基础模型从静态的问题求解器,逐步发展为能够长期训练、稳定交互、持续自我改进,并最终参与开放式发现的智能系统。当前研究主要围绕四个相互连接、但各自可以形成独立研究体系的大方向展开。
LLM / Agent Post-Training
研究面向大语言模型与智能体的后训练范式,包括 reasoning、agentic behavior、reward / verifier、process supervision、long-horizon credit assignment、environment interaction 与 generalization。重点关注如何让模型在复杂任务与真实交互环境中形成可迁移、可扩展的推理与行动能力。
RL Systems / Infrastructure
研究支撑大规模强化学习与 Agent 训练的统一系统与基础设施,包括异步训练、长程 rollout、multi-environment training、trajectory management、policy lag、distributed inference / training,以及面向 100+ step agent tasks 的训练稳定性与效率。
Recursive Self-Improvement
研究智能体如何通过经验、记忆、技能、数据和环境反馈不断改进自身,而不仅依赖一次性的参数更新。重点探索 Environment–Policy Co-Evolution、skill / memory evolution、active exploration,以及 discovery system harnesses 的自我优化。
AI for Discovery
研究超越“给定问题—求解答案”的基础模型新范式:模型需要主动发现和定义问题,构造或修正变量与表征,形成假设,设计干预与实验,并根据外部证据持续修正研究过程。目标是构建能够参与真实科学与开放式发现过程的通用模型系统。
开源研究体系
Gen-Verse Research Ecosystem
Research ideas → reusable systems → open-source community
近期动态
获 2026 WAIC 云帆奖,全球 15 位入选者之一。[链接]
6 篇论文接收(含 1 篇 Spotlight),覆盖 LLM、Agent 与多模态强化学习,包括 RLAnything、AutoTool 与 LatentMAS。
发布 OpenClaw-RL(Code):全异步 RL 框架,在对话、终端、GUI、SWE 与工具调用等真实场景中,用实时 next-state 信号训练个人与通用智能体。HuggingFace Daily Papers 第 1 名。
2 篇论文接收,方向为多模态强化学习。
4 篇论文接收,覆盖 LLM 与 Diffusion Language Models,包括 TraceRL & TraDo、OmniVerifier Oral · Top 1%、MMaDA-Parallel 与 UltraViCo。
发布高效智能体推理与 agentic training 系列工作:LatentMAS、RLAnything 与 GenEnv。
AutoTool 获 ICCV 2025 MMRAgI Workshop Best Paper Award。
受邀在 ICCV 2025 Workshop on Multi-Modal Reasoning for Agentic Intelligence 作报告。
5 篇论文接收,覆盖 LLM 与多模态 LLM,包括 MMaDA、CURE & ReasonFlux-Coder Spotlight · Top 3%、ReasonFlux-PRM、Transformer-Copilot Spotlight · Top 3% 与 HermesFlow。
3 篇论文接收,覆盖 LLM 与 Agent,其中 EmoAgent 为 Oral · Top 1%,另含 TreeBoN。
2 篇 diffusion 论文接收:Inversion-DPO 与 EditWorld。
入选 2025 WAIC 云帆奖 Finalist。
受邀参加 WAIC 2025 圆桌论坛,由 林达华 教授主持。
2 篇论文接收,覆盖 agent 与 diffusion,其中 ScoreLiDAR 为 Oral · Top 1%,另含 Paper2Video Agent。
1 篇 LLM 论文接收:Multi-Actor Collaboration。
受邀担任 NeurIPS 2025 Area Chair。
6 篇论文接收,覆盖 LLM 与 Diffusion Models,包括 SuperCorrect、Rectified Diffusion、IterComp 与 IPDreamer。
受邀在 Princeton AI Lab 作报告,由 王梦迪 教授主持。
5 篇论文接收,覆盖 Diffusion Models 与 LLM,其中 Buffer of Thoughts 为 Spotlight · Top 3%。
2 篇论文接收,覆盖 Diffusion Models 与 AI for Science。
1 篇论文接收,方向为通用 / 分子图扩散模型。
1 篇论文接收,方向为 DiT、DDPM 与 Score SDE 的改进训练算法。
3 篇论文接收,覆盖 Diffusion Models、GNN 与 AI for Science。
1 篇论文接收,方向为分子扩散模型。
与 OpenAI 合作的扩散模型综述被 ACM Computing Surveys 接收。
1 篇扩散模型论文接收。
出版《扩散模型》专著(电子工业出版社),并获评年度优秀作者。
1 篇论文接收。
1 篇论文接收。
2 篇论文接收为 Spotlight · Top 3%。
1 篇论文接收。
代表论文
加入我们
招收对前沿 AI 真正有追求的学生
长期招收 硕士生、博士生、博士后、线上/线下研究实习生,重点方向包括 LLM/Agent Post-Training、Reinforcement Learning、Self-Improving Agents 与 AI for Discovery。