Preprints

SPADE: Self-Play in Adaptive Synthetic Executable Environments
Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques
Demystifying Reinforcement Learning Post-Training of Language Models
Donovan Clay, Saket Gollapudi, Sankar Harilal, Min Jang, Jacob Morrison, Sewoong Oh, Natasha Jaques
Forty Shades of Blue: Quality-Diversity Alignment via Mode-Conditioned Reinforcement Learning
Jiayi Yuan, Hangoo Kang, James Jihao Liu, Yejin Choi, Vikram Iyer, Liwei Jiang, Natasha Jaques
How LLMs Distort Our Written Language
Marwa Abdulhai, Isadora White, Yanming Wan, Ibrahim Qureshi, Joel Z. Leibo, Max Kleiman-Weiner, Natasha Jaques
Tapes Together Strong: The Co-evolution of Computation and Cooperation
Kunal Jha, Francesco Cicala, Blaise Agüera y Arcas, Blake Aaron Richards, Natasha Jaques, Max Kleiman-Weiner, Eyvind Niklasson
AI Epistemic Risks: Emerging Mechanisms & Evidence
Mick Yang, Stephen Casper, Jonathan Stray, Jasmine Li, Cameron Jones, Anna Gausen, Natasha Jaques, Brian Christian, Bálint Gyevnár, Hannah Kirk, Zhonghao He, Dan Zhao, Siao Si Looi, Joshua Levy, Kobi Hackenburg, Elizabeth Seger, Matt Kowal, Michelle Malonza, Luke Hewitt, Hause Lin, Maarten Sap, Dylan Hadfield-Menell, Thomas Costello, Reihaneh Rabbany, Jean-François Godbout, David Rand, Atoosa Kasirzadeh, Gordon Pennycook, Yoshua Bengio, Kellin Pelrine
Learn to Match: Two-Sided Matching with Temporally Extended Feedback
Haijing Zong, Yancheng Liang, Boyang Zhou, Natasha Jaques
Beyond Cooperative Simulators: Generating Realistic User Personas for Robust Evaluation of LLM Agents
Harshita Chopra*, Kshitish Ghate*, Aylin Caliskan, Tadayoshi Kohno, Chirag Shah, Natasha Jaques
COLM 2026 Workshop on Social Simulation with LLMs
Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL
Marwa Abdulhai, Ryan Cheng, Aryansh Shrivastava, Natasha Jaques, Yarin Gal, Sergey Levine
AgenticRed: Evolving Agentic Systems for Red-Teaming
Jiayi Yuan, Jonathan Nöther, Natasha Jaques, Goran Radanović
Are Language Models Sensitive to Morally Irrelevant Distractors?
Andrew Shaw, Christina Hahn, Catherine Rasgaitis, Yash Mishra, Alisa Liu, Natasha Jaques, Yulia Tsvetkov, Amy X. Zhang
Do as the Romans Do: Learning Universal Behaviors from Heterogeneous Agents
Caleb Chang, Davin Win Kyi, Natasha Jaques, Karen Leung
Embedded-Arena: Building Hardware-in-the-Loop Coding Agents to Run AI on Microcontrollers
Zhihan Zhang, Alexander Le Metzger, Jiuyang Lyu, Chun-Cheng Chang, Jiayi Shao, Yujia Liu, Emmanuel Azuh Mensah, Edward Wang, Kurtis Heimerl, Gregory D. Abowd, Shwetak Patel, Natasha Jaques, Vikram Iyer
FlowSteer: Prompt-Only Workflow Steering Exposes Planning-Time Vulnerabilities in Multi-Agent LLM Systems
Fanxiao Li, Jiaying Wu, Tingchao Fu, Natasha Jaques, Wei Zhou, Min-Yen Kan

2026

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models
Mickel Liu*, Liwei Jiang*, Yancheng Liang, Simon Shaolei Du, Yejin Choi, Tim Althoff*, Natasha Jaques*
International Conference on Machine Learning (ICML) 2026
(Outstanding Paper Award, Oral Presentation) @ COLM 2025 AIA Workshop
RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments
Zhiyuan Zeng, Hamish Ivison, Yiping Wang, Lifan Yuan, Shuyue Stella Li, Zhuorui Ye, Siting Li, Jacqueline He, Runlong Zhou, Tong Chen, Chenyang Zhao, Yulia Tsvetkov, Simon Shaolei Du, Natasha Jaques, Hao Peng, Pang Wei Koh, Hannaneh Hajishirzi
International Conference on Machine Learning (ICML) 2026
Learning to Summarize User Information for Personalized Reinforcement Learning from Human Feedback
Hyunji Nam, Yanming Wan, Mickel Liu, Peter Ahnn, Jianxun Lian, Natasha Jaques
International Conference on Learning Representations (ICLR) 2026
Generative Adversarial Post-Training Mitigates Reward Hacking in Live Human-AI Music Interaction
Yusong Wu, Stephen Brade, Aleksandra Teng Ma, Tia-Jane Fowler, Enning Yang, Berker Banar, Aaron Courville, Natasha Jaques*, Cheng-Zhi Anna Huang*
International Conference on Learning Representations (ICLR) 2026
AutoCode: LLMs as Problem Setters for Competitive Programming
Shang Zhou, Zihan Zheng, Kaiyuan Liu, Zeyu Shen, Zerui Cheng, Zexing Chen, Hansen He, Jianzhu Yao, Huanzhi Mao, Qiuyang Mang, Tianfu Fu, Beichen Li, Dongruixuan Li, Wenhao Chai, Zhuang Liu, Aleksandra Korolova, Peter Henderson, Natasha Jaques, Pramod Viswanath, Saining Xie, Jingbo Shang
International Conference on Learning Representations (ICLR) 2026
Improving Human-AI Coordination through Online Adversarial Training and Generative Models
Paresh Chaudhary, Yancheng Liang, Daphne Chen, Simon S. Du, Natasha Jaques
International Conference on Learning Representations (ICLR) 2026
SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement Learning
Bo Liu*, Leon Guertler*, Simon Yu*, Zichen Liu*, Penghui Qi, Daniel Balcells, Mickel Liu, Cheston Tan, Weiyan Shi, Min Lin, Wee Sun Lee, Natasha Jaques
International Conference on Learning Representations (ICLR) 2026
Modeling Others' Minds as Code
Kunal Jha, Aydan Yuenan Huang, Eric Ye, Natasha Jaques*, Max Kleiman-Weiner*
International Conference on Learning Representations (ICLR) 2026 (Best Paper Award, Oral Presentation) @ NeurIPS 2025 LAW Workshop
Debate Training Reduces Reward Hacking in RLAIF
Zachary Kenton, Lili Janzer, Rory Greig, Tian Huey Teh, Kirill Tyshchuk, Jonah Brown-Cohen, Harri Edwards, Senthooran Rajamanoharan, Noah Y. Siegel, Natasha Jaques, Rohin Shah
Google DeepMind Technical Report 2026
Improving Interactive In-Context Learning from Natural Language Feedback
Martin Klissarov, Jonathan Cook, Diego Antognini, Hao Sun, Jingling Li, Natasha Jaques, Claudiu Musat, Edward Grefenstette
Google DeepMind Technical Report 2026
Pigeonholing: How Bad Prompts Hurt Models, Causing Collapse and Mistakes
Hyunji Nam, Keertana Chidambaram, Dorottya Demszky, Natasha Jaques
Empirical Methods in Natural Language Processing (EMNLP) 2026 Findings
Maximizing Mutual Information Between Prompt and Response Improves LLM Performance with No Additional Data
Hyunji Nam, Haoran Li, Natasha Jaques
International Conference on Machine Learning (ICML) 2026
LongCoT: Benchmarking Long-Horizon Chain-of-Thought Reasoning
Sumeet Ramesh Motwani, Daniel Nichols, Charles London, Peggy Li, Fabio Pizzati, Acer Blake, Hasan Hammoud, Tavish McDonald, Akshat Naik, Alesia Ivanova, Vignesh Baskaran, Ivan Laptev, Ruben Glatt, Tal Ben-Nun, Philip Torr, Natasha Jaques, Ameya Prabhu, Brian Bartoldson, Bhavya Kailkhura, Christian Schroeder de Witt
International Conference on Machine Learning (ICML) 2026
Position: Solipsistic Superintelligence Is Unlikely to Be Cooperative
Rakshit S. Trivedi, Natasha Jaques, Logan Cross, Alexander Sasha Vezhnevets, Joel Z. Leibo
International Conference on Machine Learning (ICML) 2026 (Position Track)

2025

Enhancing Personalized Multi-Turn Dialogue with Curiosity Reward
Yanming Wan*, Jiaxing Wu*, Marwa Abdulhai, Lior Shani, Natasha Jaques
Neural Information Processing Systems (NeurIPS) 2025
Madrona Prize @ Paul G. Allen School of Computer Science & Engineering
Consistently Simulating Human Personas with Multi-Turn Reinforcement Learning
Marwa Abdulhai, Ryan Cheng, Donovan Clay, Tim Althoff, Sergey Levine, Natasha Jaques
Neural Information Processing Systems (NeurIPS) 2025
Evaluating Generalization Capabilities of LLM-Based Agents in Mixed-Motive Scenarios Using Concordia
Chandler Smith, Marwa Abdulhai, Manfred Diaz, Marko Tesic, Rakshit S. Trivedi, Alexander Sasha Vezhnevets, Lewis Hammond, Jesse Clifton, Minsuk Chang, Edgar A. Duéñez-Guzmán, John P. Agapiou, Jayd Matyas, Danny Karmon, Akash Kundu, Aliaksei Korshuk, Ananya Ananya, Arrasy Rahman, Avinaash Anand Kulandaivel, Bain McHale, Beining Zhang, Buyantuev Alexander, Carlos Saith Rodriguez Rojas, Caroline Wang, Chetan Talele, Chenao Liu, Chichen Lin, Diana Riazi, Di Yang Shi, Emanuel Tewolde, Elizaveta Tennant, Fangwei Zhong, Fuyang Cui, Gang Zhao, Gema Parreño Piqueras, Hyeonggeun Yun, Ilya Makarov, Jiaxun Cui, Jebish Purbey, Jim Dilkes, Jord Nguyen, Lingyun Xiao, Luis Felipe Giraldo, Manuela Chacon-Chamorro, Manuel Sebastian Rios Beltran, Marta Emili García Segura, Mengmeng Wang, Mogtaba Alim, Nicanor Quijano, Nico Schiavone, Olivia Macmillan-Scott, Oswaldo Peña, Peter Stone, Ram Mohan Rao Kadiyala, Rolando Fernandez, Ruben Manrique, Sunjia Lu, Sheila A. McIlraith, Shamika Dhuri, Shuqing Shi, Siddhant Gupta, Sneheel Sarangi, Sriram Ganapathi Subramanian, Taehun Cha, Toryn Q. Klassen, Wenming Tu, Weijian Fan, Wu Ruiyang, Xue Feng, Yali Du, Yang Liu, Yiding Wang, Yipeng Kang, Yoonchang Sung, Yuxuan Chen, Zhaowei Zhang, Zhihan Wang, Zhiqiang Wu, Ziang Chen, Zilong Zheng, Zixia Jia, Ziyan Wang, Dylan Hadfield-Menell, Natasha Jaques, Tim Baarslag, Jose Hernandez-Orallo, Joel Z. Leibo
Neural Information Processing Systems (NeurIPS) 2025
Achieving Human Level Competitive Robot Table Tennis
David B. D’Ambrosio, Saminda Abeyruwan, Laura Graesser, Atil Iscen, Heni Ben Amor, Alex Bewley, Barney J. Reed, Krista Reymann, Leila Takayama, Yuval Tassa, Krzysztof Choromanski, Erwin Coumans, Deepali Jain, Navdeep Jaitly, Natasha Jaques, Satoshi Kataoka, Yuheng Kuang, Nevena Lazic, Reza Mahjourian, Sherry Moore, Kenneth Oslund, Anish Shankar, Vikas Sindhwani, Vincent Vanhoucke, Grace Vesom, Peng Xu, Pannag R. Sanketi
IEEE International Conference on Robotics and Automation (ICRA) 2025 (Best Paper Finalist)
Cross-environment Cooperation Enables Zero-shot Multi-agent Coordination
Kunal Jha, Wilka Carvalho, Yancheng Liang, Simon S. Du, Max Kleiman-Weiner*, Natasha Jaques*
International Conference on Machine Learning (ICML) 2025 (Oral Paper-Top 1%) and CogSci 2025
Multi Agent Reinforcement Learning for Sequential Satellite Assignment Problems
Joshua Holder, Natasha Jaques, Mehran Mesbahi
AAAI Conference on Artificial Intelligence (AAAI) 2025 (Oral Paper - Top 5%)
Infer Human’s Intentions Before Following Natural Language Instructions
Yanming Wan, Yue Wu, Yiping Wang, Jiayuan Mao*, Natasha Jaques*
AAAI Conference on Artificial Intelligence (AAAI) 2025
ReaLJam: Real-Time, Synchronous Human-AI Music Jamming with Reinforcement Learning-Tuned Transformers
Alexander Scarlatos, Yusong Wu, Ian Simon, Adam Roberts, Tim Cooijmans, Natasha Jaques, Cassie Tarakajian, Anna Huang
Extended Abstracts of The ACM Conference on Human Factors in Computing Systems (CHI) 2025
An Efficient Open World Benchmark for Multi-Agent Reinforcement Learning
Eric Ye, Ren Tao, Natasha Jaques
NeurIPS Open World Agents Workshop 2025
Generative Modeling for Robust Deep Reinforcement Learning on the Traveling Salesman Problem
Michael Li, Eric Bae, Christopher Haberland, Natasha Jaques*
NeurIPS MATH.AI Workshop 2025
InvestESG: A multi-agent reinforcement learning benchmark for studying climate investment as a social dilemma
Xiaoxuan Hou, Jiayi Yuan, Joel Z. Leibo, Natasha Jaques
International Conference on Learning Representations (ICLR) 2025

2024

Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning
Sriyash Poddar, Yanming Wan, Hamish Ivison, Abhishek Gupta*, Natasha Jaques*
Neural Information Processing Systems (NeurIPS) 2024 (Spotlight-Top 2%)
Learning to Cooperate with Humans Using Generative Agents
Yancheng Liang, Daphne Chen, Abhishek Gupta, Simon S. Du, Natasha Jaques
Neural Information Processing Systems (NeurIPS) 2024
Impossibility theorems for feature attribution
Blair Bilodeau, Natasha Jaques, Pang-Wei Koh, Been Kim
Proceedings of the National Academy of Sciences (PNAS) 2024
The Concordia Contest: Advancing the Cooperative Intelligence of Language Agents
Chandler Smith, Rishabh Trivedi, Julian Clifton, Lewis Hammond, Akbir Khan, Alexander Sasha Vezhnevets, John P. Agapiou, Edgar A. Duéñez-Guzmán, Joel Matyas, Danny Karmon, Marwa Abdulhai, Dylan Hadfield-Menell, Natasha Jaques, Joel Leibo, Oliver Slumbers, Tim Baarslag, Michael Chang
Neural Information Processing Systems (NeurIPS) Competition Track 2024
Moral Foundations of Large Language Models
Marwa Abdulhai, Gregory Serapio-Garcia, Clément Crepy, Daria Valter, John Canny, Natasha Jaques
Empirical Methods in Natural Language Processing (EMNLP) 2024 (Best Paper, AAAI Workshop on Representation Learning for Responsible Human-Centric AI)
Adaptive Accompaniment with ReaLchords
Yusong Wu, Tim Cooijmans, Kyle Kastner, Adam Roberts, Ian Simon, Alexander Scarlatos, Chris Donahue, Cassie Tarakajian, Shayegan Omidshafiei, Aaron Courville, Pablo Samuel Castro, Natasha Jaques, Cheng-Zhi Anna Huang
International Conference on Machine Learning (ICML), 2024