Research Overview
Research on efficient and scalable machine learning, connecting optimization theory with large-scale training systems.
Scalable Pretraining and Distributed Learning
Efficient training of large language and foundation models through distributed, semi-synchronous, and large-batch methods.
Topics: large language model pretraining · distributed deep learning · large-batch training · high-performance computing
Selected related publications
Optimization for Machine Learning
Optimization algorithms and training dynamics, including learning-rate schedules, non-Euclidean and spectral methods, Muon, and critical batch size analysis.
Topics: machine learning optimization · Muon optimizer · non-Euclidean optimization · learning-rate schedules · critical batch size
Selected related publications
Generalization and Foundation Models
Generalization, calibration, fairness, and model composition for pre-trained and foundation models under distribution shift.
Topics: foundation models · out-of-distribution generalization · model calibration · distribution shift · model merging
Selected related publications
- An Empirical Study of Pre-trained Model Selection for Out-of-Distribution Generalization and Calibration — TMLR 2025
- Generalization Measures under Controlled Covariate Shift: A Regime-Aware Benchmark — TMLR 2026
- Empirical Study on Optimizer Selection for Out-of-Distribution Generalizations — TMLR 2023