研究メモ
2026年10月の横断サーベイ
37研究トピックの再サーベイを公開用コンテンツに追加しました。最適化、汎化、基盤モデル、数理・学習ダイナミクス、並列学習の5章から、研究の流れ・重要文献・関連プロジェクトを辿れます。調査基準日は2026年10月3日です。
Overview
- 研究でも何回も出てくる資料とか読み直してる資料のリンクや、理解した内容をまとめる場所
- 管理人の経験は次の通りです
- 2017-2018 (東工大・IBM 基礎研): 高性能計算(深層学習における行列の圧縮による高速化・低ビット演算による高速化・分散並列化)
- 2018-2019 (東工大・理研 AIP): 大規模深層学習における最適化と正則化 (NGD, K-FAC, SWA, Mixup, Smoothing)
- 2019-2020 (東工大): ラージバッチ学習と確率的正則化・ハイパーパラメータ推定 (LARS, Noise Scale)
- 2020-2021 (東工大学振・DENSO IT Lab・CyberAgent AI Lab): 情報行列に基づく汎化指標と学習理論(TIC, NTK), 二次最適化と近似計算(Hvp, AD)、半教師あり学習におけるアンサンブル学習(SSL, ST, SWA)
- 2021-2023 (Mila・DENSO IT Lab・LinkdIn): 分布外汎化と不確実性(OOD Genralization, Calibration), 二次最適化と正則化(K-FAC, Damping)
- 2022-2023 (Mila・明治大) : ドメイン汎化における最適輸送(DA, OT)、敵対的生成モデルと共役勾配法 (GAN, CG)
- 2022- (Mila・ZOZO): 分布外汎化と不確実性(Curvature, OOD Genralization, Calibration)
- 2023- (Mila・理研 AIP): 基盤モデルと汎化(Foundation Model, OOD Genralization, Calibration)
- 2024- (Mila・Microsoft Research・GoogleDeepMind): 大規模言語モデルと最適化 (LLM, Optimization)
- 2025- (Mila・GoogleDeepMind・Meta): 大規模言語モデルと最適化 (LLM, Optimization, Critical Batch Size)
- 2026- (Mila・NVIDIA): 最適化と基盤モデル (Optimization, Foundation Model)
Topics
Dynamics
Optimization
- Bi-Level Optimization
- Optimizer
- Conjugate Gradient
- Natural Gradient
- Damping
- SAM: Sharpness-Aware Minimization
- LocalSGD
- LR Schedule
- LBT: Large Batch Training
- MUON: MUON Optimizer
- Shampoo: Shampoo Optimizer
Generalization
- IC: Information Criteria
- OOD: Out-of-distribution Generalization
- Compositional Generalization
- Distribution Shift
- Calibration
- ECE: Expected Calibration Error
Foundation Model and LLMs
- Transformer
- Scaling Laws
- RLHF: Reinforcement Learning from Human Feedback
- LLM - implementation
- Multimodal
- Reasoning
Other Topics
- Parallel Training (DP, DDP, FSDP and more)
- Fairness
- Flow Matching
- Attention
- AD: Automatic Differentiation
- Hessian
- GAN: Generative Adversarial Networks
- MCMC
- Modular Manifolds・多様体上の最適化
- Misc
Project progress board
Complete
- TMLR2023 / Optimizer Comparison for OOD Generalization and Optimizer Comparison for Corruption
- IJCNN2023 / Distributional Shift for Calibration and OOD Generalization
- AISTATS2023 / CG for GANs
- ICML2024 / Loss Landscape Geometry
- TMLR2024 / IRM and Information Bottleneck
- ICLR2025 / Task Arithmtic
- TMLR2025 / Model Selection for OOD Generalization
- SSRN / Alignment of Multimodal Models
- TMLR2025 / Psuedo Asynchronous Local SGD
- ICLR2026 / Fairness for Task Arithmetic
- ICLR2026 / DisTac
Under Review
- TMLR2026 / Muon and Critical Batch Size
- ICML2026 / Generalization Measures
- ICML2026 / Critical Batch Size for Non-Euclidean Geometry
- Patent (LinkedIn - Microsoft) / LogitNorm for Calibration
Expired
- EmpiricalOT
- OT and Outlier
- NGD for GANs
- Multimodal
- SWA for RL
- Damping Schedule
- Distshift and FIM
- TIC Generalization Measures
Resource
Conference Report
- NeurIPS2019 参加まとめ / funded by JSAI
- NeurIPS2022 参加まとめ / funded by Mila
- AISTATS2023 参加まとめ / funded by Mila
- ICCV2023 参加まとめ / funded by ZOZO
- ICML2024 参加まとめ / funded by Mila
- NeurIPS2024 参加まとめ / funded by Microsoft Research and Masason Foundation
- AlgoPerf Workshop 2025 参加まとめ / funded by Google DeepMind
- ICLR2025 参加まとめ / funded by The ANRI Fellowship
- ACM HPC-AI School 2026 参加まとめ
- ICML2026 参加まとめ