機械学習研究の横断サーベイ:最適化・汎化・基盤モデル・数理・計算基盤(2026年10月)

研究トピックの再サーベイ

調査基準日:2026年10月3日。 このリポジトリの公開コンテンツにある37の研究トピックを、研究史・基本問題・重要文献・最近の進展・限界の順に再構成した。13の研究プロジェクトと関連する計算基盤のメモも接続した。4エージェントで分担し、Fisher、NTK、SAM、SOAP、Muonなど分野をまたぐ説明は相互レビューした。

2026年の文献も対象にしたが、10月4日以降は含めない。また、世界中の関連文献すべてを収集したという意味の完全網羅性は主張しない。元トピックの全件対応と、採用文献の確認水準、既存引用の未確認部分を明示することで、調査の広さと限界を追跡できる構成にした。

収録:37トピック、13プロジェクトとの対応、5章+最適化補遺、統合参考文献512件(延べ526登録)。 論文に加え、書籍・技術報告・一次資料を含む。

読む入口

章 扱う研究の範囲 読むときの中心的な問い
1. 最適化 SGD/Adam、自然勾配、K-FAC、CG、damping、Shampoo/SOAP/Muon、SAM、bilevel、学習率、batch、Local SGD どの幾何・ノイズ・計算制約に対して更新則を設計するか
2. 汎化・分布シフト・校正・公平性 DG/DA/TTA、OOD検出、uncertainty、ECE、conformal、fairness、構成的汎化、AIC/TIC/WAIC どの分布で、何を既知として、何の性能を保証したいか
3. 基盤モデル Attention、Transformer、scaling laws、multimodal、RLHF/DPO、reasoning、GAN、LLM実装 表現・学習信号・学習時計算・推論時計算のどれが改善したか
4. 数理手法・学習ダイナミクス AD、Hessian/Fisher、NTK、double descent、flow matching、OT、MCMC、多様体、ICA・因果・同変性 何を微分し、どの分布の期待値とどの空間の幾何を使うか
5. 並列学習・計算基盤 DP/FSDP/TP/PP、ZeRO、TorchTitan、精度・activation・通信、モデル統合 同じ学習目標へ到達するまでの時間とメモリを何が制約するか

最適化の関連研究補遺には、旧メモの引用を追加照合したSAM・学習率・大バッチ・分散最適化・bilevelの派生研究をまとめた。

統合参考文献には注釈と原典へのリンク、JSONには各章の確認記録、BibTeXには文献管理用の下書きを収録した。既存37ページとの対応・引用棚卸しと検索方法・確認水準・限界を併せて参照できる。

1. 研究の流れを五つの軸で捉える

以下は各章を横断した本サーベイの整理である。単一の進歩の順序というより、繰り返し現れる問題と、その問題を扱える範囲が広がった過程として読む。

軸 基礎となる考え方 深層学習での展開 2020年代に強くなった課題
最適化の幾何 CG、damping、自然勾配 K-FAC、Adam、Shampoo、Hessian-free 行列構造、SOAP/Muon、低精度・分散実装と理論の整合
汎化の対象 統計的risk推定、情報量規準 interpolation、NTK、double descent 学習分布と異なる環境、group別性能、基盤モデルのデータ混入
表現と学習信号 潜在変数、Attention、生成ゲーム Transformer、言語・視覚事前学習 選好学習、検証可能報酬、推論探索、multimodal融合
分布の扱い MCMC、score、最適輸送 diffusion、CNF、domain adaptation flow matching、少step生成、couplingと有限標本・記憶
計算資源の配分 並列化、確率的近似 large batch、model parallel、mixed precision 学習と推論の費用配分、通信制約、モデル統合、総費用での比較

第一の流れは、座標ごとの適応から、行列とモデル構造を使う更新への展開である。 Adamの二次モーメント、K-FACのFisher近似、Shampooの行列前処理は同じ情報を使っていない。SOAPは基底を変えて座標適応を使い、Muonは行列の特異値方向の扱いを変える。したがって更新式の見た目だけで「二次法」「自然勾配」「直交化」を同一視できない。Adam、K-FAC、Shampoo、SOAP、Old Optimizer, New Norm

第二の流れは、平均test accuracyから、評価対象を明示する研究への展開である。 「未知domainの既知クラスを正しく分類する」「未知クラスを検出する」「予測確率を校正する」「集団別の誤りを抑える」は異なる目標である。DomainBedやWILDSは、モデル選択と現実的なshiftの評価を研究の中心に置いた。校正の良さだけでaccuracyや公平性が保証されるわけではない。DomainBed、WILDS、On Calibration of Modern Neural Networks

第三の流れは、モデル規模だけでなく、計算を使う場所を選ぶ問題への展開である。 Chinchillaは学習予算内のパラメータ数とtoken数を扱う。推論時計算の研究は、固定モデルでも候補生成・探索・検証へ計算を配分できることを扱う。FlashAttentionや分散基盤は、同じ予算で実行できる計算を変える。各論文の「効率」が学習FLOPs、wall-clock、推論遅延のどれを指すかが重要になる。Chinchilla、Scaling LLM Test-Time Compute、FlashAttention

第四の流れは、生成を分布の移動として統一的に記述する研究である。 score SDE、probability flow ODE、flow matching、OTは接点を持つが、目的関数、経路、coupling、生成時の積分は異なる。GANのゲーム最適化やMCMCの定常分布も別の問題設定である。共通のODE表現があることだけで、有限stepでの品質や学習の同値性を結論しない。Score SDE、Flow Matching、Conditional Flow Matching

2. 最初に読むべき重要文献

各分野の細かな派生法に進む前に、問題設定を定義した原著、方法上の転換点、評価上の反証を組み合わせる。下表は順位ではなく読書経路であり、その他の関連研究は各章の注釈付き参考文献へ接続する。

目的 基礎・転換点 続けて読む検証・拡張
optimizer比較 Adam、AdamW On Empirical Comparisons of Optimizers、AlgoPerf
曲率を利用する Natural Gradient、K-FAC Shampoo、SOAP、KL-Shampoo/SOAP
Muonとbatch Muon原提案、Gradient Noise Scale Muonの大規模化、Muonとcritical batch size
flatnessと汎化 Sharp Minima Can Generalize、SAM SAMとlow-rank features、数理章のFisher・Hessianの区別
分布外汎化 IRM、DomainBed WILDS、Fishr
校正と不確実性 Guo et al.、Dataset Shift下のuncertainty ECEのbin依存性、proper scoring rule、conformalの仮定を汎化章で比較
学習ダイナミクス NTK、Lazy Training Double Descent、有限幅・特徴学習との違い
基盤モデルの構成 Transformer、CLIP Chinchilla、FlashAttention
選好学習・推論 InstructGPT、DPO DeepSeek-R1、s1、基盤モデル章のpass@kと検証の議論
生成・輸送 DDPM、Score SDE Flow Matching、MeanFlow、数理章のOT・MCMCとの比較
大規模学習 Megatron-LM、ZeRO TorchTitan、DiLoCo、並列学習章の通信とbatchの関係

3. 2025〜2026年の文献から見える論点

新しい文献を古典と別枠に隔離せず、どの未解決問題に応答しているかで読む。以下は確認した代表例であり、分野の全論文を列挙した表ではない。

論点 文献・公開年 本サーベイでの位置付け
Muonのscaling・行列反復 Muon is Scalable、Polar Express(2025) 実装の更新scale、近似計算、行列形状と比較条件
行列前処理の見直し KL-Shampoo/SOAP(2025初出、ICLR 2026) 共分散推定と距離の選び方
GPUとattentionの協調 FlashAttention-4(2026) Blackwellの資源構成・数値演算に依存する高速化
通信が遅い環境での学習 Decoupled DiLoCo(2026) 通信と計算の分離を含めた訓練算法
大規模SOAP/Muon SOAP, Muon, and Beyond(2026) dense/MoE、batch、layer単位分散まで含む比較
Muonの理論の適用範囲 On MUON optimization、Convergence guarantees for Muon(2026) 有限反復、soft-sign近似、パラメータ範囲の違いを明示
少step生成 MeanFlow、Improved MeanFlow(2025) 平均速度・目的設計と、単なるODE step削減の違い
校正と表現・構成性 汎化章の2026年CaliDist、構成的汎化の幾何、DGのtext anchor 特定の理論設定と、実モデルの経験的改善を分ける

arXivの提出月、最新版の改訂日、正式会議の年は別の情報である。例えば2025年初出のICLR 2026論文を「2026年に初めて出た研究」とは数えない。一次ページ間の日付が整合しなかった資料は日を断定せず、各章と検索記録に留保を残した。

4. 元の13プロジェクトとの接続

ここでは公開ページに書かれた問題意識と、今回の文献調査との対応を示す。過去のTODO・投稿候補から、現在の成果・採択・実験結果を推定しない。

プロジェクト 主に参照する章 文献を読むときの焦点
OOD Optimizer 最適化・汎化 チューニング予算、ID/OODのモデル選択、seed・domain別の差
Corruption 汎化・最適化 corruptionとsemantic OODを分けた評価
Distributional Shift 汎化 shiftの種類、support、targetラベルを使える時点
Distributional Shift and FIM 数理・汎化 Fisherの期待値分布、曲率と校正の因果関係の検証
TIC 汎化・数理 misspecification、特異モデル、同分布riskとshift後risk
LogitNorm 汎化 logit norm・温度・表現・校正の分離
Damping Schedule 最適化・数理 trust region、線形解法、曲率ノイズと学習率の相互作用
CG GANs 最適化・数理・基盤モデル conjugate gradientとcompetitive gradient descentの名称区別、ゲームの回転成分
NGD for GANs 最適化・数理・基盤モデル 二人ゲームでのmetricと局所安定性、damping
EmpiricalOT 数理・汎化 輸送costとラベル対応、couplingの推定、negative transfer
OT Outlier 数理・汎化 partial/unbalanced/robust OTの違い、捨てる質量の定義
SWA for RL 数理・並列学習 同じpolicy basin内の平均、非定常データ、off-policy評価
Multimodal for Biomedical Data 基盤モデル・汎化 modality欠測、患者・施設単位の分割、融合と交絡

5. 次の研究を組み立てるための横断的な問い

以下は文献から導いた研究提案であり、既存プロジェクトで達成した結果ではない。

  1. optimizerの幾何はどの条件でOOD性能へ影響するか。 更新RMS、実効step、学習loss、探索予算、pretrainingデータを揃え、曲率・feature rank・group別riskを測る。曲率の相関だけで改善の原因としない。
  2. critical batch sizeを何の費用で定義するか。 gradient noiseから予測する値と、特定の品質へ到達するwall-clock上の最良batchを分ける。通信時間やoptimizer計算が異なると、同じ数値になるとは限らない。
  3. 曲率を使うモデル選択はshiftに耐えるか。 TICやFisher由来の指標が対象とする期待riskを明示し、単なるID精度・loss・confidenceとの比較を置く。targetの情報を使った選択との混同を避ける。
  4. 推論計算と校正を同時に評価できるか。 多数候補の中から正解を選べること、平均応答の正確さ、自分の誤りの認識を分ける。候補数、検証器の誤り、token・遅延予算を揃える。
  5. 少step生成の改善は目的設計と数値計算のどちらから来るか。 coupling、teacher、訓練予算、solver、評価実装を固定した比較を作る。画像品質だけで、mode coverageや記憶の少なさまで保証しない。
  6. 分散化とモデル統合はどこまで同じ問題か。 Local SGDの通信間隔、非IID性、weight averaging、task arithmeticが保つ量は異なる。重み間の距離だけでなく、予測・忘却・group別性能を調べる。

6. 既存メモから更新した重要な理解

旧メモを読む際の注意 今回の整理
Fisher、empirical Fisher、GGN、Hessianの置き換え 期待値と確率モデル・損失の条件を明記する
Muonを少数反復で極分解へ厳密収束する方法とみなす 有限反復の近似、係数、理論の対象を分ける
SOAPを無条件でShampooと等価とする 等価性に必要な仮定と実装上の差を分ける
ECEが小さければ予測が優れているとする accuracy、proper score、校正、解像度を別々に評価する
PCAにGaussian仮定が必須、ICAの特殊例とする PCAの分散最大化とICAの独立性・識別条件を分ける
RLHFで言語モデルを常に凍結するとする 更新するpolicy、参照policy、reward model、criticを分ける
scaling lawsをKaplanだけから始める 前史を含め、経験則のモデル族・データ・予算への依存を追う
GPUの固定台数を必要条件とする parameter、optimizer状態、精度、activation、並列方式から見積もる

元の37ページには新章へのリンクを追加し、過去のメモとして残した。新しい研究上の説明・訂正は本サーベイを参照する。各論文の結果と本稿の推論、そして未確認の事項を分けた詳細は、各章と調査方法に示す。