Zhang-Wei Hong

Research: I develop reinforcement learning (RL) methods for computational discovery—finding novel solutions in domains ranging from materials science to robotics. My work addresses two fundamental challenges in applying RL to real-world discovery:

  • Learning from sparse feedback: Discovery problems often provide limited reward signals, making it difficult for RL agents to learn effectively. My research develops principled approaches to accelerate learning despite sparse supervision. [NeurIPS'24, NeurIPS'23, ICML'23, ICML'23, ICLR'23, ICLR'22, ICLR'22]
  • Generating diverse solutions: Many discovery problems require multiple high-quality candidates rather than a single optimum. I develop methods that produce diverse solution sets for applications like drug discovery and AI safety. [ICLR'24]

Bio: I am a Principal Investigator and Research Staff Member at the MIT-IBM Watson AI Lab. I received my Ph.D. in Electrical Engineering and Computer Science from MIT, advised by Prof. Pulkit Agrawal. I was a recipient of the Qualcomm Innovation Fellowship (2024). Prior to MIT, I earned my B.S. and M.S. from National Tsing Hua University, where I worked with Prof. Chun-Yi Lee and Prof. Min Sun. I have also collaborated with Prof. Jan Peters at TU Darmstadt and conducted research at Preferred Networks.

         

  Honors & Awards

Qualcomm Innovation Fellowship, North America 2024


  Funded Projects

Principal Investigator on the following projects funded through MIT-IBM Watson AI Lab programs:

Toward Superintelligence: Foundational Models That Discover What Humans Don’t Know Yet
with Prof. Pulkit Agrawal and Prof. Ruonan Han
Vector Policy Optimization: Training for Diversity Improves Language Model Performance
with Prof. Omar Khattab
Current LLMs often produce low-entropy response distributions and struggle to display the diversity that inference-time search requires; this project trains models for diversity to improve downstream performance.


  Collaboration & Mentorship

I am fortunate to work with talented students and researchers:

Iris Xu
MIT Undergraduate · former intern at MIT-IBM Watson AI Lab
Harry Sillifant
MIT Undergraduate
Sunshine Jiang
MIT MEng · now Ph.D. student at Stanford
Raina Wu
MIT Undergraduate · former intern at MIT-IBM Watson AI Lab
Jason Ken Adhinarta
MIT CSAIL Ph.D. student · former intern at MIT-IBM Watson AI Lab
Anna Yang
MIT MEng
Ryan Bahlous-Boldi
MIT CSAIL Ph.D. student
Yan Xu
MIT Ph.D. student
Huaibo Chen
MIT Ph.D. student
Chen Bo Calvin Zhang
MIT Visiting researcher, ETH Zurich Master student · now at Scale AI
Phat Nguyen
UMass Amherst Undergraduate · now Research Assistant at MIT CSAIL
Nishant Abhangi
MIT Undergraduate · now MTS at Resolve AI
Zechu Li
MIT Visiting Student, Master Student at TU Darmstadt
Siddhant Mukherjee
MIT Undergraduate · now at Citadel
Sathwik Karnik
MIT Undergraduate · now Ph.D. student at Stanford
Chi-Chang Lee
National Taiwan University Master · now Ph.D. student at UMD
Srinath Mahankali
MIT Undergraduate · now Ph.D. student at UC Berkeley
Eric Chen
MIT Undergraduate · now Ph.D. student at MIT

Prospective collaborators: I am always open to collaborating on ideas related to reinforcement learning. Feel free to reach out via email.



  Experience

Principal Investigator | Research Staff Member Jan. 2025 – Present
Research Intern Jun. 2023 – Sep. 2023
Research Intern Jun. 2022 – Oct. 2022
Research Intern Jun. 2019 – Oct. 2019
Research Intern Feb. 2019 – Jun. 2019
Advisor: Prof. Min Sun
Visiting Researcher Jul. 2018 – Oct. 2018
Advisor: Prof. Jan Peters


  Selected Publications

RL for Foundation Models Applications on Science Fundamental RL
Vector Policy Optimization: Training for Diversity Improves Test-Time Search
Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld, Akarsh Kumar, Mehul Damani, Sebastian Risi, Omar Khattab, Zhang-Wei Hong, Pulkit Agrawal
NeurIPS, 2026
Paper

SLIC: Reinforcement Fine-Tuning Small LMs for Multi-Turn Analog Circuit Optimization
Yan Xu, Zhengqi Gao, Ching-Yun Ko, Zhang-Wei Hong, Wenjie Lu, Tao Yu, Xin Zhang, Duane S. Boning, Ruonan Han
NeurIPS, 2026
Paper (coming soon)

Prompt-Driven Exploration: Language as an Exploration Space for VLA Reinforcement Learning
Sunshine Jiang, John Marangola, David Zhang, Raghuram Kowdeed, Ruiyang Luo, Nitish Dashora, Richard Li, Pulkit Agrawal, Zhang-Wei Hong
NeurIPS, 2026
Website | Paper | Poster

Correct Me If I'm Wrong: Language Guided Exploration for VLAs
Sunshine Jiang, John Marangola, David Zhang, Nitish Dashora, Pulkit Agrawal, Zhang-Wei Hong
RSS RL4VLA Workshop, 2026
Website | Paper

Learning More from Less: Reinforcement Learning from Hindsight
Iris Xu, Sunshine Jiang, John Marangola, Nitish Dashora, Richard Li, Thomas Liu, Zexue He, Yuheng Zhi, Alex Pentland, Pulkit Agrawal, Zhang-Wei Hong
RSS RL4VLA Workshop, 2026
Website | Paper

A Critical Look at Self-Distillation for Reasoning
Jason K. Adhinarta, Raina Wu, Ashutosh Sharma, Rameswar Panda, Polina Golland, Yoon Kim, Zhang-Wei Hong
NeurIPS Pre-to-Post Workshop, 2026
Paper

RL Tango: Reinforcing Generator and Verifier Together for Language Reasoning
Kaiwen Zha, Zhengqi Gao, Maohao Shen, Zhang-Wei Hong, Duane S. Boning, Dina Katabi
NeurIPS, 2025
Paper | Code

BOAD: Discovering Hierarchical Software Engineering Agents via Bandit Optimization
Iris Xu, Guangtao Zeng, Zexue He, Charles Jin, Aldo Pareja, Dan Gutfreund, Chuang Gan, Zhang-Wei Hong
ICLR, 2026
Paper | Code

Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search
Maohao Shen, Guangtao Zeng, Zhenting Qi, Zhang-Wei Hong, Zhenfang Chen, Wei Lu, Gregory Wornell, Subhro Das, David Cox, Chuang Gan
ICML, 2025
Paper | Code

Red Teaming Language-Conditioned Robot Models via Vision Language Models
Sathwik Karnik*, Zhang-Wei Hong*, Nishant Abhangi*, Yen-Chen Lin, Tsun-Hsuan Wang, Pulkit Agrawal
NeurIPS Safe Generative AI Workshop, 2024
Paper | Bibtex

Curiosity-driven Red-teaming for Large Language Models
Zhang-Wei Hong, Idan Shenfeld, Tsun-Hsuan Wang, Yung-Sung Chuang, Aldo Pareja, James R. Glass, Akash Srivastava, Pulkit Agrawal
ICLR, 2024  |  MIT News
Paper | Code | Bibtex


  Course Materials



  Invited Talks



  Teaching

Deep Learning Institute, NVIDIA Taiwan Spring 2018





template from jonbarron