機械学習研究の横断サーベイ:最適化・汎化・基盤モデル・数理・計算基盤(2026年10月)
研究トピックの再サーベイ
調査基準日:2026年10月3日。 このリポジトリの公開コンテンツにある37の研究トピックを、研究史・基本問題・重要文献・最近の進展・限界の順に再構成した。13の研究プロジェクトと関連する計算基盤のメモも接続した。4エージェントで分担し、Fisher、NTK、SAM、SOAP、Muonなど分野をまたぐ説明は相互レビューした。
2026年の文献も対象にしたが、10月4日以降は含めない。また、世界中の関連文献すべてを収集したという意味の完全網羅性は主張しない。元トピックの全件対応と、採用文献の確認水準、既存引用の未確認部分を明示することで、調査の広さと限界を追跡できる構成にした。
収録:37トピック、13プロジェクトとの対応、5章+最適化補遺、統合参考文献512件(延べ526登録)。 論文に加え、書籍・技術報告・一次資料を含む。
読む入口
| 章 | 扱う研究の範囲 | 読むときの中心的な問い |
|---|---|---|
| 1. 最適化 | SGD/Adam、自然勾配、K-FAC、CG、damping、Shampoo/SOAP/Muon、SAM、bilevel、学習率、batch、Local SGD | どの幾何・ノイズ・計算制約に対して更新則を設計するか |
| 2. 汎化・分布シフト・校正・公平性 | DG/DA/TTA、OOD検出、uncertainty、ECE、conformal、fairness、構成的汎化、AIC/TIC/WAIC | どの分布で、何を既知として、何の性能を保証したいか |
| 3. 基盤モデル | Attention、Transformer、scaling laws、multimodal、RLHF/DPO、reasoning、GAN、LLM実装 | 表現・学習信号・学習時計算・推論時計算のどれが改善したか |
| 4. 数理手法・学習ダイナミクス | AD、Hessian/Fisher、NTK、double descent、flow matching、OT、MCMC、多様体、ICA・因果・同変性 | 何を微分し、どの分布の期待値とどの空間の幾何を使うか |
| 5. 並列学習・計算基盤 | DP/FSDP/TP/PP、ZeRO、TorchTitan、精度・activation・通信、モデル統合 | 同じ学習目標へ到達するまでの時間とメモリを何が制約するか |
最適化の関連研究補遺には、旧メモの引用を追加照合したSAM・学習率・大バッチ・分散最適化・bilevelの派生研究をまとめた。
統合参考文献には注釈と原典へのリンク、JSONには各章の確認記録、BibTeXには文献管理用の下書きを収録した。既存37ページとの対応・引用棚卸しと検索方法・確認水準・限界を併せて参照できる。
1. 研究の流れを五つの軸で捉える
以下は各章を横断した本サーベイの整理である。単一の進歩の順序というより、繰り返し現れる問題と、その問題を扱える範囲が広がった過程として読む。
| 軸 | 基礎となる考え方 | 深層学習での展開 | 2020年代に強くなった課題 |
|---|---|---|---|
| 最適化の幾何 | CG、damping、自然勾配 | K-FAC、Adam、Shampoo、Hessian-free | 行列構造、SOAP/Muon、低精度・分散実装と理論の整合 |
| 汎化の対象 | 統計的risk推定、情報量規準 | interpolation、NTK、double descent | 学習分布と異なる環境、group別性能、基盤モデルのデータ混入 |
| 表現と学習信号 | 潜在変数、Attention、生成ゲーム | Transformer、言語・視覚事前学習 | 選好学習、検証可能報酬、推論探索、multimodal融合 |
| 分布の扱い | MCMC、score、最適輸送 | diffusion、CNF、domain adaptation | flow matching、少step生成、couplingと有限標本・記憶 |
| 計算資源の配分 | 並列化、確率的近似 | large batch、model parallel、mixed precision | 学習と推論の費用配分、通信制約、モデル統合、総費用での比較 |
第一の流れは、座標ごとの適応から、行列とモデル構造を使う更新への展開である。 Adamの二次モーメント、K-FACのFisher近似、Shampooの行列前処理は同じ情報を使っていない。SOAPは基底を変えて座標適応を使い、Muonは行列の特異値方向の扱いを変える。したがって更新式の見た目だけで「二次法」「自然勾配」「直交化」を同一視できない。Adam、K-FAC、Shampoo、SOAP、Old Optimizer, New Norm
第二の流れは、平均test accuracyから、評価対象を明示する研究への展開である。 「未知domainの既知クラスを正しく分類する」「未知クラスを検出する」「予測確率を校正する」「集団別の誤りを抑える」は異なる目標である。DomainBedやWILDSは、モデル選択と現実的なshiftの評価を研究の中心に置いた。校正の良さだけでaccuracyや公平性が保証されるわけではない。DomainBed、WILDS、On Calibration of Modern Neural Networks
第三の流れは、モデル規模だけでなく、計算を使う場所を選ぶ問題への展開である。 Chinchillaは学習予算内のパラメータ数とtoken数を扱う。推論時計算の研究は、固定モデルでも候補生成・探索・検証へ計算を配分できることを扱う。FlashAttentionや分散基盤は、同じ予算で実行できる計算を変える。各論文の「効率」が学習FLOPs、wall-clock、推論遅延のどれを指すかが重要になる。Chinchilla、Scaling LLM Test-Time Compute、FlashAttention
第四の流れは、生成を分布の移動として統一的に記述する研究である。 score SDE、probability flow ODE、flow matching、OTは接点を持つが、目的関数、経路、coupling、生成時の積分は異なる。GANのゲーム最適化やMCMCの定常分布も別の問題設定である。共通のODE表現があることだけで、有限stepでの品質や学習の同値性を結論しない。Score SDE、Flow Matching、Conditional Flow Matching
2. 最初に読むべき重要文献
各分野の細かな派生法に進む前に、問題設定を定義した原著、方法上の転換点、評価上の反証を組み合わせる。下表は順位ではなく読書経路であり、その他の関連研究は各章の注釈付き参考文献へ接続する。
| 目的 | 基礎・転換点 | 続けて読む検証・拡張 |
|---|---|---|
| optimizer比較 | Adam、AdamW | On Empirical Comparisons of Optimizers、AlgoPerf |
| 曲率を利用する | Natural Gradient、K-FAC | Shampoo、SOAP、KL-Shampoo/SOAP |
| Muonとbatch | Muon原提案、Gradient Noise Scale | Muonの大規模化、Muonとcritical batch size |
| flatnessと汎化 | Sharp Minima Can Generalize、SAM | SAMとlow-rank features、数理章のFisher・Hessianの区別 |
| 分布外汎化 | IRM、DomainBed | WILDS、Fishr |
| 校正と不確実性 | Guo et al.、Dataset Shift下のuncertainty | ECEのbin依存性、proper scoring rule、conformalの仮定を汎化章で比較 |
| 学習ダイナミクス | NTK、Lazy Training | Double Descent、有限幅・特徴学習との違い |
| 基盤モデルの構成 | Transformer、CLIP | Chinchilla、FlashAttention |
| 選好学習・推論 | InstructGPT、DPO | DeepSeek-R1、s1、基盤モデル章のpass@kと検証の議論 |
| 生成・輸送 | DDPM、Score SDE | Flow Matching、MeanFlow、数理章のOT・MCMCとの比較 |
| 大規模学習 | Megatron-LM、ZeRO | TorchTitan、DiLoCo、並列学習章の通信とbatchの関係 |
3. 2025〜2026年の文献から見える論点
新しい文献を古典と別枠に隔離せず、どの未解決問題に応答しているかで読む。以下は確認した代表例であり、分野の全論文を列挙した表ではない。
| 論点 | 文献・公開年 | 本サーベイでの位置付け |
|---|---|---|
| Muonのscaling・行列反復 | Muon is Scalable、Polar Express(2025) | 実装の更新scale、近似計算、行列形状と比較条件 |
| 行列前処理の見直し | KL-Shampoo/SOAP(2025初出、ICLR 2026) | 共分散推定と距離の選び方 |
| GPUとattentionの協調 | FlashAttention-4(2026) | Blackwellの資源構成・数値演算に依存する高速化 |
| 通信が遅い環境での学習 | Decoupled DiLoCo(2026) | 通信と計算の分離を含めた訓練算法 |
| 大規模SOAP/Muon | SOAP, Muon, and Beyond(2026) | dense/MoE、batch、layer単位分散まで含む比較 |
| Muonの理論の適用範囲 | On MUON optimization、Convergence guarantees for Muon(2026) | 有限反復、soft-sign近似、パラメータ範囲の違いを明示 |
| 少step生成 | MeanFlow、Improved MeanFlow(2025) | 平均速度・目的設計と、単なるODE step削減の違い |
| 校正と表現・構成性 | 汎化章の2026年CaliDist、構成的汎化の幾何、DGのtext anchor | 特定の理論設定と、実モデルの経験的改善を分ける |
arXivの提出月、最新版の改訂日、正式会議の年は別の情報である。例えば2025年初出のICLR 2026論文を「2026年に初めて出た研究」とは数えない。一次ページ間の日付が整合しなかった資料は日を断定せず、各章と検索記録に留保を残した。
4. 元の13プロジェクトとの接続
ここでは公開ページに書かれた問題意識と、今回の文献調査との対応を示す。過去のTODO・投稿候補から、現在の成果・採択・実験結果を推定しない。
| プロジェクト | 主に参照する章 | 文献を読むときの焦点 |
|---|---|---|
| OOD Optimizer | 最適化・汎化 | チューニング予算、ID/OODのモデル選択、seed・domain別の差 |
| Corruption | 汎化・最適化 | corruptionとsemantic OODを分けた評価 |
| Distributional Shift | 汎化 | shiftの種類、support、targetラベルを使える時点 |
| Distributional Shift and FIM | 数理・汎化 | Fisherの期待値分布、曲率と校正の因果関係の検証 |
| TIC | 汎化・数理 | misspecification、特異モデル、同分布riskとshift後risk |
| LogitNorm | 汎化 | logit norm・温度・表現・校正の分離 |
| Damping Schedule | 最適化・数理 | trust region、線形解法、曲率ノイズと学習率の相互作用 |
| CG GANs | 最適化・数理・基盤モデル | conjugate gradientとcompetitive gradient descentの名称区別、ゲームの回転成分 |
| NGD for GANs | 最適化・数理・基盤モデル | 二人ゲームでのmetricと局所安定性、damping |
| EmpiricalOT | 数理・汎化 | 輸送costとラベル対応、couplingの推定、negative transfer |
| OT Outlier | 数理・汎化 | partial/unbalanced/robust OTの違い、捨てる質量の定義 |
| SWA for RL | 数理・並列学習 | 同じpolicy basin内の平均、非定常データ、off-policy評価 |
| Multimodal for Biomedical Data | 基盤モデル・汎化 | modality欠測、患者・施設単位の分割、融合と交絡 |
5. 次の研究を組み立てるための横断的な問い
以下は文献から導いた研究提案であり、既存プロジェクトで達成した結果ではない。
- optimizerの幾何はどの条件でOOD性能へ影響するか。 更新RMS、実効step、学習loss、探索予算、pretrainingデータを揃え、曲率・feature rank・group別riskを測る。曲率の相関だけで改善の原因としない。
- critical batch sizeを何の費用で定義するか。 gradient noiseから予測する値と、特定の品質へ到達するwall-clock上の最良batchを分ける。通信時間やoptimizer計算が異なると、同じ数値になるとは限らない。
- 曲率を使うモデル選択はshiftに耐えるか。 TICやFisher由来の指標が対象とする期待riskを明示し、単なるID精度・loss・confidenceとの比較を置く。targetの情報を使った選択との混同を避ける。
- 推論計算と校正を同時に評価できるか。 多数候補の中から正解を選べること、平均応答の正確さ、自分の誤りの認識を分ける。候補数、検証器の誤り、token・遅延予算を揃える。
- 少step生成の改善は目的設計と数値計算のどちらから来るか。 coupling、teacher、訓練予算、solver、評価実装を固定した比較を作る。画像品質だけで、mode coverageや記憶の少なさまで保証しない。
- 分散化とモデル統合はどこまで同じ問題か。 Local SGDの通信間隔、非IID性、weight averaging、task arithmeticが保つ量は異なる。重み間の距離だけでなく、予測・忘却・group別性能を調べる。
6. 既存メモから更新した重要な理解
| 旧メモを読む際の注意 | 今回の整理 |
|---|---|
| Fisher、empirical Fisher、GGN、Hessianの置き換え | 期待値と確率モデル・損失の条件を明記する |
| Muonを少数反復で極分解へ厳密収束する方法とみなす | 有限反復の近似、係数、理論の対象を分ける |
| SOAPを無条件でShampooと等価とする | 等価性に必要な仮定と実装上の差を分ける |
| ECEが小さければ予測が優れているとする | accuracy、proper score、校正、解像度を別々に評価する |
| PCAにGaussian仮定が必須、ICAの特殊例とする | PCAの分散最大化とICAの独立性・識別条件を分ける |
| RLHFで言語モデルを常に凍結するとする | 更新するpolicy、参照policy、reward model、criticを分ける |
| scaling lawsをKaplanだけから始める | 前史を含め、経験則のモデル族・データ・予算への依存を追う |
| GPUの固定台数を必要条件とする | parameter、optimizer状態、精度、activation、並列方式から見積もる |
元の37ページには新章へのリンクを追加し、過去のメモとして残した。新しい研究上の説明・訂正は本サーベイを参照する。各論文の結果と本稿の推論、そして未確認の事項を分けた詳細は、各章と調査方法に示す。