About me
I am a PhD candidate at Penn State’s College of Information Sciences and Technology, where I have been advised by Prof. Qingyun Wu since 2022. Before joining Penn State, I received my master’s degree in AI & ML from Imperial College London and my bachelor’s degree in Computer Science from the University of California, Davis.
My research focuses on large language models , especially multi-agent systems and reinforcement learning for language agents .
I was a research intern at Microsoft Research, Redmond in 2024 and 2025 .
I’m looking for full-time research scientist positions, preferably in North America. Résumé · Contact me
Selected projects
Latest work
Behavioral Self-Rewarding (BSR) Learning from debugging behavior to improve software engineering agents beyond binary test rewards.
Preprint, 2026
Unified environments for digital agents, connecting graphical and text interaction.
ICML 2026 · Position Paper Track
A benchmark for evaluating LLM agents on cyber threat investigation tasks.
Creator · ICML 2026
Reinforced self-play for reasoning, with no human-curated training data.
Co-creator & maintainer · NeurIPS 2025
State-driven workflows for more controlled and efficient LLM task solving.
COLM 2024
An open-source framework for building LLM applications through multi-agent conversation.
Co-creator & maintainer
Explore by topic
All topics
Agents
Reinforcement Learning
Self-Improvement
Evaluation
AI Systems
ML Optimization
No selected papers in this topic yet. Switch to Full to explore all publications.
Beyond Binary Verifiable Rewards: Behavioral Self-Rewarding for SWE Agents
Yiran Wu , Andrew Zhao, Yurui Chang, Qingyun Wu, Xuan Feng
Preprint 2026
Position: Digital Agents Require Unified Agent-Native Computers
Yiran Wu* , Jiale Liu*, Jieyu Zhang, Yaolun Zhang, Shilong Liu, Chi Wang, Mengdi Wang, Huazheng Wang, Qingyun Wu
ICML 2026 · Position Track
ExCyTIn-Bench: Evaluating LLM Agents on Cyber Threat Investigation
Yiran Wu , Mauricio Velazco, Andrew Zhao, Manuel Raúl Meléndez Luján, Srisuma Movva, Yogesh K. Roy, Quang-Huy Nguyen, Roberto Rodriguez, Qingyun Wu, Michael Albada, Julia Kiseleva, Anand Mudgerikar
ICML 2026
SimpleDoc: Multi-Modal Document Understanding with Dual-Cue Page Retrieval and Iterative Refinement
Chelsi Jain*, Yiran Wu *, Yifan Zeng*, Jiale Liu, Shengyu Dai, Zhenwen Shao, Qingyun Wu, Huazheng Wang
EMNLP 2025
Absolute Zero: Reinforced Self-play Reasoning with Zero Data
Andrew Zhao, Yiran Wu , Tong Wu, Quentin Xu, Yang Yue, Matthieu Lin, Shenzhi Wang, Qingyun Wu, Zilong Zheng, Gao Huang
NeurIPS 2025
StateFlow: Enhancing LLM Task-Solving through State-Driven Workflows
Yiran Wu , Tianwei Yue, Shaokun Zhang, Chi Wang, Qingyun Wu
COLM 2024
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
Yifan Zeng*, Yiran Wu *, Xiao Zhang, Huazheng Wang, Qingyun Wu
NeurIPS 2024 · Safe Generative AI Workshop
AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation
Qingyun Wu, Gagan Bansal, Jieyu Zhang, Yiran Wu , Beibin Li, Erkang Zhu, Li Jiang, Xiaoyun Zhang, Shaokun Zhang, Jiale Liu, Ahmed Hassan Awadallah, Ryen W. White, Doug Burger, Chi Wang
COLM 2024
MathChat: Converse to Tackle Challenging Math Problems with LLM Agents
Yiran Wu , Feiran Jia, Shaokun Zhang, Hangyu Li, Erkang Zhu, Yue Wang, Yin Tat Lee, Richard Peng, Qingyun Wu, Chi Wang
ICLR 2024 · Workshop on LLM Agents
2026
Beyond Binary Verifiable Rewards: Behavioral Self-Rewarding for SWE Agents
Yiran Wu , Andrew Zhao, Yurui Chang, Qingyun Wu, Xuan Feng
Preprint 2026
When Does Multi-Agent RL Improve LLM Workflows? Workflow, Scale, and Policy-Sharing Tradeoffs
Yifan Zeng, Yiran Wu , Yaolun Zhang, Wentian Zhao, Kun Wan, Qingyun Wu, Huazheng Wang
Preprint 2026
MetaAgent-X: Breaking the Ceiling of Automatic Multi-Agent Systems via End-to-End Reinforcement Learning
Yaolun Zhang, Yujie Zhao, Nan Wang, Yiran Wu , Jiayu Chang, Yizhao Chen, Qingyun Wu, Jishen Zhao, Huazheng Wang
Preprint 2026
Position: Digital Agents Require Unified Agent-Native Computers
Yiran Wu* , Jiale Liu*, Jieyu Zhang, Yaolun Zhang, Shilong Liu, Chi Wang, Mengdi Wang, Huazheng Wang, Qingyun Wu
ICML 2026 · Position Track
DispatchMAS: Fusing Taxonomy and Artificial Intelligence Agents for Emergency Medical Services
Xiang Li, Huizi Yu, Wenkong Wang, Yiran Wu , Jiayan Zhou, Wenyue Hua, Xinxin Lin, Wenjia Tan, Lexuan Zhu, Bingyi Chen, Guang Chen, Ming-Li Chen, Yang Zhou, Zhao Li, Themistocles L. Assimes, Yongfeng Zhang, Qingyun Wu, Xin Ma, Lingyao Li, Lizhou Fan
BMC Emergency Medicine 2026
MemCollab: Cross-Agent Memory Collaboration via Contrastive Trajectory Distillation
Yurui Chang, Yiran Wu , Qingyun Wu, Lu Lin
Preprint 2026
Live-Evo: Online Evolution of Agentic Memory from Continuous Feedback
Yaolun Zhang*, Yiran Wu *, Yijiong Yu, Qingyun Wu, Huazheng Wang
Preprint 2026
ExCyTIn-Bench: Evaluating LLM Agents on Cyber Threat Investigation
Yiran Wu , Mauricio Velazco, Andrew Zhao, Manuel Raúl Meléndez Luján, Srisuma Movva, Yogesh K. Roy, Quang-Huy Nguyen, Roberto Rodriguez, Qingyun Wu, Michael Albada, Julia Kiseleva, Anand Mudgerikar
ICML 2026
2025
A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence
Huan-ang Gao, Jiayi Geng, Wenyue Hua, Mengkang Hu, Xinzhe Juan, Hongzhang Liu, Shilong Liu, Jiahao Qiu, Xuan Qi, Yiran Wu , Hongru Wang, Han Xiao, Yuhang Zhou, Shaokun Zhang, Jiayi Zhang, Jinyu Xiang, Yixiong Fang, Qiwen Zhao, Dongrui Liu, Qihan Ren, Cheng Qian, Zhenghailong Wang, Minda Hu, Huazheng Wang, Qingyun Wu, Heng Ji, Mengdi Wang
Preprint 2025
SimpleDoc: Multi-Modal Document Understanding with Dual-Cue Page Retrieval and Iterative Refinement
Chelsi Jain*, Yiran Wu *, Yifan Zeng*, Jiale Liu, Shengyu Dai, Zhenwen Shao, Qingyun Wu, Huazheng Wang
EMNLP 2025
Absolute Zero: Reinforced Self-play Reasoning with Zero Data
Andrew Zhao, Yiran Wu , Tong Wu, Quentin Xu, Yang Yue, Matthieu Lin, Shenzhi Wang, Qingyun Wu, Zilong Zheng, Gao Huang
NeurIPS 2025
2024
StateFlow: Enhancing LLM Task-Solving through State-Driven Workflows
Yiran Wu , Tianwei Yue, Shaokun Zhang, Chi Wang, Qingyun Wu
COLM 2024
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
Yifan Zeng*, Yiran Wu *, Xiao Zhang, Huazheng Wang, Qingyun Wu
NeurIPS 2024 · Safe Generative AI Workshop
AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation
Qingyun Wu, Gagan Bansal, Jieyu Zhang, Yiran Wu , Beibin Li, Erkang Zhu, Li Jiang, Xiaoyun Zhang, Shaokun Zhang, Jiale Liu, Ahmed Hassan Awadallah, Ryen W. White, Doug Burger, Chi Wang
COLM 2024
MathChat: Converse to Tackle Challenging Math Problems with LLM Agents
Yiran Wu , Feiran Jia, Shaokun Zhang, Hangyu Li, Erkang Zhu, Yue Wang, Yin Tat Lee, Richard Peng, Qingyun Wu, Chi Wang
ICLR 2024 · Workshop on LLM Agents
HyperTime: Hyperparameter Optimization for Combating Temporal Distribution Shifts
Shaokun Zhang, Yiran Wu , Zhonghua Zheng, Qingyun Wu, Chi Wang
ACM Multimedia 2024
2023
Unified Off-Policy Learning to Rank: A Reinforcement Learning Perspective
Zeyu Zhang, Yi Su, Hui Yuan, Yiran Wu , Rishab Balasubramanian, Qingyun Wu, Huazheng Wang, Mengdi Wang
NeurIPS 2023
2022
Automated Object Detection in Experimental Data Using a Combination of Unsupervised and Supervised Methods
Yiran Wu , Zhen Wang, Crystal M. Ripplinger, Daisuke Sato
Frontiers in Physiology 2022