Zhang-Wei Hong

Research: I develop reinforcement learning (RL) methods for computational discovery—finding novel solutions in domains ranging from materials science to robotics. My work addresses two fundamental challenges in applying RL to real-world discovery:

  • Learning from sparse feedback: Discovery problems often provide limited reward signals, making it difficult for RL agents to learn effectively. My research develops principled approaches to accelerate learning despite sparse supervision. [NeurIPS'24, NeurIPS'23, ICML'23, ICML'23, ICLR'23, ICLR'22, ICLR'22]
  • Generating diverse solutions: Many discovery problems require multiple high-quality candidates rather than a single optimum. I develop methods that produce diverse solution sets for applications like drug discovery and AI safety. [ICLR'24]

Bio: I am a Principal Investigator and Research Staff Member at the MIT-IBM Watson AI Lab. I received my Ph.D. in Electrical Engineering and Computer Science from MIT, advised by Prof. Pulkit Agrawal. I was a recipient of the Qualcomm Innovation Fellowship (2024). Prior to MIT, I earned my B.S. and M.S. from National Tsing Hua University, where I worked with Prof. Chun-Yi Lee and Prof. Min Sun. I have also collaborated with Prof. Jan Peters at TU Darmstadt and conducted research at Preferred Networks.

         

  Honors & Awards

Qualcomm Innovation Fellowship, North America 2024


  Funded Projects

Principal Investigator on the following projects funded through MIT-IBM Watson AI Lab programs:

Toward Superintelligence: Foundational Models That Discover What Humans Don’t Know Yet
with Prof. Pulkit Agrawal and Prof. Ruonan Han
Vector Policy Optimization: Training for Diversity Improves Language Model Performance
with Prof. Omar Khattab
Current LLMs often produce low-entropy response distributions and struggle to display the diversity that inference-time search requires; this project trains models for diversity to improve downstream performance.


  Mentorship

I am fortunate to work with talented students and researchers:

Iris Xu
MIT Undergraduate · former intern at MIT-IBM Watson AI Lab
Harry Sillifant
MIT Undergraduate
Sunshine Jiang
MIT MEng · now Ph.D. student at Stanford
Raina Wu
MIT Undergraduate · former intern at MIT-IBM Watson AI Lab
Jason Ken Adhinarta
MIT CSAIL Ph.D. student · former intern at MIT-IBM Watson AI Lab
Anna Yang
MIT MEng
Chen Bo Calvin Zhang
MIT Visiting researcher, ETH Zurich Master student · now at Scale AI
Phat Nguyen
UMass Amherst Undergraduate · now Research Assistant at MIT CSAIL
Nishant Abhangi
MIT Undergraduate · now MTS at Resolve AI
Zechu Li
MIT Visiting Student, Master Student at TU Darmstadt
Siddhant Mukherjee
MIT Undergraduate · now at Citadel
Sathwik Karnik
MIT Undergraduate · now Ph.D. student at Stanford
Chi-Chang Lee
National Taiwan University Master · now Ph.D. student at UMD
Srinath Mahankali
MIT Undergraduate · now Ph.D. student at UC Berkeley
Eric Chen
MIT Undergraduate · now Ph.D. student at MIT

Prospective collaborators: I am always open to collaborating on ideas related to reinforcement learning. Feel free to reach out via email.



  Experience

Principal Investigator | Research Staff Member Jan. 2025 – Present
Research Intern Jun. 2023 – Sep. 2023
Research Intern Jun. 2022 – Oct. 2022
Research Intern Jun. 2019 – Oct. 2019
Research Intern Feb. 2019 – Jun. 2019
Advisor: Prof. Min Sun
Visiting Researcher Jul. 2018 – Oct. 2018
Advisor: Prof. Jan Peters


  Selected Publications

RL for Foundation Models Applications on Science Fundamental RL
Vector Policy Optimization: Training for Diversity Improves Test-Time Search
Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld, Akarsh Kumar, Mehul Damani, Sebastian Risi, Omar Khattab, Zhang-Wei Hong, Pulkit Agrawal
NeurIPS, 2026
Paper

SLIC: Reinforcement Fine-Tuning Small LMs for Multi-Turn Analog Circuit Optimization
Yan Xu, Zhengqi Gao, Ching-Yun Ko, Zhang-Wei Hong, Wenjie Lu, Tao Yu, Xin Zhang, Duane S. Boning, Ruonan Han
NeurIPS, 2026
Paper (coming soon)

Prompt-Driven Exploration: Language as an Exploration Space for VLA Reinforcement Learning
Sunshine Jiang, John Marangola, David Zhang, Raghuram Kowdeed, Ruiyang Luo, Nitish Dashora, Richard Li, Pulkit Agrawal, Zhang-Wei Hong
NeurIPS, 2026
Website | Paper | Poster

Correct Me If I'm Wrong: Language Guided Exploration for VLAs
Sunshine Jiang, John Marangola, David Zhang, Nitish Dashora, Pulkit Agrawal, Zhang-Wei Hong
RSS RL4VLA Workshop, 2026
Website | Paper

Learning More from Less: Reinforcement Learning from Hindsight
Iris Xu, Sunshine Jiang, John Marangola, Nitish Dashora, Richard Li, Thomas Liu, Zexue He, Yuheng Zhi, Alex Pentland, Pulkit Agrawal, Zhang-Wei Hong
RSS RL4VLA Workshop, 2026
Website | Paper

A Critical Look at Self-Distillation for Reasoning
Jason K. Adhinarta, Raina Wu, Ashutosh Sharma, Rameswar Panda, Polina Golland, Yoon Kim, Zhang-Wei Hong
NeurIPS Pre-to-Post Workshop, 2026
Paper

RL Tango: Reinforcing Generator and Verifier Together for Language Reasoning
Kaiwen Zha, Zhengqi Gao, Maohao Shen, Zhang-Wei Hong, Duane S. Boning, Dina Katabi
NeurIPS, 2025
Paper | Code

BOAD: Discovering Hierarchical Software Engineering Agents via Bandit Optimization
Iris Xu, Guangtao Zeng, Zexue He, Charles Jin, Aldo Pareja, Dan Gutfreund, Chuang Gan, Zhang-Wei Hong
ICLR, 2026
Paper | Code

Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search
Maohao Shen, Guangtao Zeng, Zhenting Qi, Zhang-Wei Hong, Zhenfang Chen, Wei Lu, Gregory Wornell, Subhro Das, David Cox, Chuang Gan
ICML, 2025
Paper | Code

Red Teaming Language-Conditioned Robot Models via Vision Language Models
Sathwik Karnik*, Zhang-Wei Hong*, Nishant Abhangi*, Yen-Chen Lin, Tsun-Hsuan Wang, Pulkit Agrawal
NeurIPS Safe Generative AI Workshop, 2024
Paper | Bibtex

Curiosity-driven Red-teaming for Large Language Models
Zhang-Wei Hong, Idan Shenfeld, Tsun-Hsuan Wang, Yung-Sung Chuang, Aldo Pareja, James R. Glass, Akash Srivastava, Pulkit Agrawal
ICLR, 2024  |  MIT News
Paper | Code | Bibtex


  Course Materials

Lecture Notes: 6.8200 Computational Sensorimotor Learning, MIT


  Invited Talks

ZEW Workshop on Red Teaming Generative AI Models
Microsoft Turing Team
Macro Eyes
Toronto AI in Robotics Seminar, University of Toronto


  Teaching

6.484 Computational Sensorimotor Learning, MIT Spring 2022

6.S090 Deep Learning for Control, MIT Spring 2021

Deep Learning Institute, NVIDIA Taiwan Spring 2018





template from jonbarron