最適化の関連研究補遺:SAM・学習率・大バッチ・分散・bilevel
主章の研究史を補う追加調査である。前半のOA文献はSAM・学習率、後半のOB文献は数理・分散最適化の既存引用を扱う。確認日はいずれも2026年10月3日。公開年・版・確認水準の詳細は各節と文献台帳に示す。
SAM・学習率スケジュール:既存引用の追加照合
調査基準日:2026年10月3日。対象は元の optimization/sam.md と optimization/lr-schedule.md にあり、最初の文献台帳と未照合だった41候補。39文献を一次要旨・書誌で再確認し、2件の匿名投稿版は下記の未確定表に残した。本補遺は既存引用の取りこぼしを減らすための追補であり、この39件について定理本文・全実験・コードを精査したものではない。数値的な性能順位や一般的収束保証は要旨から拡張しない。
1. LR研究を「何を選ぶか」で分ける
| 分類 | 文献 | 主な意義 | 比較で残す条件 |
|---|---|---|---|
| 外側のhyperparameter探索 | [OA001] Random Search、[OA002] Practical Bayesian Optimization | 限られた試行をどこへ割り当てるか | 検索空間、試行数、validation、各試行の費用 |
| Online hypergradient | [OA003] Short-Horizon Bias、[OA004] MARTHE | 学習途中の状態からLRを調整 | unroll長、短期目的のbias、近似費用 |
| Online局所適応 | [OA005] No More Pesky Learning Rates、[OA010] RDBD | 勾配変動・過去更新を利用 | noise、追加状態、残るmeta parameter |
| 学習されたoptimizer | [OA006] Learned Optimizers | 更新則自体をmeta学習 | meta訓練タスク、モデル規模の転移、全meta訓練費用 |
| 形状と正則化の共同設計 | [OA007] Super-Convergence、[OA015] kDecay | 一周期・LRの変化を設計 | 最大LR、weight decay等の正則化、形状探索費用 |
| 段階別のblack-box探索 | [OA011] AutoLRS | 短い試行から先のvalidation lossを予測 | 予測誤差、候補評価費用、学習状態の複製 |
| LLMの経験的loss model | [OA009] Power Scheduler、[OA012] Opt-Laws、[OA013] Multi-Power Law | 小さい実験から別budget・scheduleを推定 | fit範囲、外挿範囲、tokenizer・データ・architecture |
| Line searchとbatch | [OA014] Armijo SGD | step数とoracle費用を分ける | 非凸解析の仮定、line-search評価費用、実時間 |
| 公平なoptimizer比較 | [OA008] Crowded Valley、[OA016] Tuning-aware Benchmarking | 最良点だけでなく探索しやすさも測る | 同一探索予算、タスクの多様性、wall-clock |
研究の流れ。 Random searchとBayesian optimizationは、手作業の探索を比較可能な手続きにする前史である。元メモの「scaleのみの最適化」という分類は狭すぎる。両者は一般のhyperparameter optimizationであり、schedule形状のパラメータも探索対象にできる。対してMARTHEは学習軌跡の情報を使い、AutoLRSは短い試行と損失予測を使う。どちらも、既定の時間関数を一つ選ぶこととは異なる。[OA001] Random Search、[OA002] Bayesian Optimization、[OA004] MARTHE、[OA011] AutoLRS
短期と長期の目的。 Short-Horizon Biasは、短いmeta objectiveが小さすぎるLRへ偏ることを、noisy quadraticと実験で調べた。目先のloss低下を最大にすることは、長期学習に最良の探索とは限らない。MARTHE、AutoLRS、学習されたoptimizerでは、meta訓練・候補試行・validationを含めた費用と最終性能を比較する必要がある。[OA003] Understanding Short-Horizon Bias、[OA006] Learned Optimizers
スケーリングへの接続。 Power Schedulerはbatch・tokenと最適LRの経験的関係を使い、Opt-Lawsは動的hyperparameterと学習損失をSDEに基づいてモデル化し、Multi-Power Lawは累積LRと減衰によるloss減少を分ける。これらはscheduleを変えるたびに本番規模で試す費用を下げる方向である。ただし、有限のモデル・データ・schedule族で得た予測精度から「どのscheduleでも正確」とは言えない。Opt-Lawsは元リンクがv1なのでその2024年版を照合し、2026年改訂の追加主張を混ぜていない。[OA009] Power Scheduler、[OA012] Opt-Laws v1、[OA013] Multi-Power Law
評価と限界。 Super-Convergenceの大きいLRは他の正則化の強さと一緒に考える必要がある。Armijo解析でのstep数やSFO削減は、そのまま実GPUの短い実時間を保証しない。optimizer比較の結論も、タスクと探索予算に依存する。再現実験ではbase LRとshapeを分け、同じ調整費用、同じ総token/step、複数seed、time-to-targetを残す。[OA007] Super-Convergence、[OA014] Armijo SGD、[OA008] Crowded Valley、[OA016] Tuning-aware Benchmarking
読む順序は Random Search → tuningを含むbenchmark → Short-Horizon Bias → MARTHE/AutoLRS → Power Scheduler/Opt-Laws/Multi-Power Law。未解決問題は、短いproxy実験から本番予算への転移、validationへの過適合、architectureやデータ変更後の外挿誤差である。
2. SAM研究:機構、目的、計算削減を別に評価する
| 分類 | 文献 | 識別すべき問い |
|---|---|---|
| 汎化の機構 | [OA017] Why SAM Generalizes | どのデータモデル・networkでnoise学習を抑えるのか |
| Bayesとの接続 | [OA018] SAM as VI、[OA019] Relaxation of Bayes | 摂動勾配の類似と目的関数の緩和の違い |
| 多領域の比較 | [OA020] When Do Flat Minima Optimizers Work?、[OA021] Maximum Hessian Eigenvalue | flatness指標と性能の関係は条件を変えて残るか |
| batch内の分割 | [OA026] mSAM | batchのshardごとの摂動を平均する効果 |
| 摂動の選別 | [OA027] Sparse SAM、[OA034] Fisher-mask SAM | どのparameterを動かすか、疎化が実機の費用を減らすか |
| inner max近似の改善 | [OA029] Random SAM | smoothingした重みでの一段上昇の意味 |
| 更新回数の削減 | [OA030] Randomized Training、[OA031] LookSAM | SAM/通常stepの切替えと摂動方向の再利用 |
| 適応更新の解析 | [OA032] AdaSAM | momentum・adaptive scale・摂動の結合をどう抑えるか |
| 関数空間との接続 | [OA028] TRAM | parameter sharpnessと表現の転移可能性を両立するか |
| 対象領域 | [OA023] Class-Imbalanced Data、[OA033] ViT vs ResNet | 少数クラス・architecture・augmentationへの依存 |
単一のsharpness指標を説明にしすぎない。 Chenらの説明は特定データモデルと二層畳み込みReLUネットの解析であり、一般NNの優越定理ではない。Kaurらは最大Hessian固有値を小さくしても汎化が改善しない条件を示す。この二つは、SAMの研究を「Hessianの最大固有値を小さくすればよい」だけに縮めないために併読すべきである。[OA017] Why Does SAM Generalize Better Than SGD?、[OA021] On the Maximum Hessian Eigenvalue and Generalization
Bayes・noiseとの関係。 Variational inferenceとの接続は、摂動したparameterにおける勾配という共通構造を整理する。一方、Bayesの最適緩和としての研究は目的関数の凸緩和を扱う。両者を「SAMが厳密なBayesian posteriorを計算する」という意味にしない。Noise Stability Optimizationは両方向のnoiseでHessian traceの正則化を推定する別設計で、traceと最大固有値、平均的摂動と最悪方向の摂動を分ける。[OA018] Rethinking SAM as Variational Inference、[OA019] SAM as an Optimal Relaxation of Bayes、[OA025] Noise Stability Optimization
効率化は同じ操作ではない。 R-SAMはrandom smoothing、RSTはSAMを実行するstepの確率的選択、LookSAMは摂動方向の周期的計算であり、名前にrandom/efficientがあっても互換ではない。SSAM/FSAMはparameter mask、mSAMはbatchのshardという異なる粒度を変える。比較時には、最適化stepだけでなく勾配評価数、摂動計算、メモリ、通信、wall-clockを併記する。疎い摂動そのものがdense kernelの時間削減に直結するとは限らない。[OA029] R-SAM、[OA030] RST、[OA031] LookSAM、[OA027] SSAM、[OA034] FSAM、[OA026] mSAM
転移・領域への依存。 TRAMは関数空間のtrust regionをfine-tuningと結び、class imbalanceの研究は少数クラスのloss geometry、ViT研究は事前学習・augmentationの条件を扱う。元の適用条件を外して全領域での優越とは書けない。AdaSAMの収束率も、要旨に報告される非凸設定の解析として記録し、証明の仮定を未確認のまま実装全般へ適用しない。[OA028] TRAM、[OA023] Escaping Saddle Points、[OA033] When ViTs Outperform ResNets、[OA032] AdaSAM
読む順序は、主章のSAM原論文の後に multi-domain benchmark → 最大固有値への反例 → 機構・Bayes解釈 → RST/LookSAM/mask → TRAM/領域別評価。未解決問題は、同じsharpnessを測っているか、改善がfeature learning・noise抑制・実効LRの変化のどれに由来するか、同じ計算予算で効果が残るかである。
3. 元SAMメモの「周辺研究」を再分類する
| 文献 | 本来の中心問題 | SAMとの関連の取り方 |
|---|---|---|
| [OA022] CNN Hessian | Toeplitz構造を利用したHessian rank | CNN architectureと曲率の関係。SAM自体の収束論文ではない |
| [OA024] Latent Space Oddity | 生成器が誘導するlatent空間の幾何 | lossのparameter Hessianと区別する |
| [OA035] Geometric Moments | 形状表現・解釈性 | “shape”と“sharpness”を同一視しない。SAMの派生手法ではない |
| [OA036] Stochastic Collapse | SGD noiseと疎・低rank不変集合 | noiseによるimplicit biasを比較する |
| [OA037] Beyond Deep Ensembles | 分布変化下の不確実性・calibration | accuracyのみのSAM比較を補う評価軸 |
| [OA038] Many Faces of Robustness | 複数種類の実世界分布変化 | 一種類のshiftでの改善を頑健性全般にしない |
| [OA039] Momentum with Early Stopping | 最小二乗の連続時間momentum flowとridge | momentumのimplicit regularizationの限定的な理論例 |
ここでの再分類は、同じページに保存されていることが同じ研究問題を意味しないという整理である。OA022の理論の一部は線形活性化、OA036の汎化説明の一部は線形teacher–student、OA039は最小二乗という範囲を保つ。本文の定理全体を今回読んだという意味ではない。
4. 書誌訂正、未確定版、検索記録
- 2306.08553: 元題名は “Noise Stability Optimization for Flat Minima with Optimal Convergence Rates”。一次ページの最新版は Noise Stability Optimization for Finding Flat Minima: A Hessian-based Regularization Approach。2023年初出、2024年改訂の題名でOA025に登録。
- 2201.05405: 元メモの “in Overparametrized Models” ではなく、一次題名は The Implicit Regularization of Momentum Gradient Descent with Early Stopping。最小二乗・MGF/ridgeの結果を一般NNへ広げない。
- Random SAMとRST: R-SAMと、SAM/SGDを確率的に切り替えるRSTは別論文。別ID OA029/OA030に登録。
- Adaptiveとscale invariance: AdaSAMのadaptive learning rateとASAMの摂動領域のscale-invariant設計は同じ意味ではない。
- URLの版: Power SchedulerとOpt-Lawsは元リンクのv1を読んだ。最新absを読んだふりをせず、JSONのURLにもv1を残した。
- 初出年と会議年: arXivはSubmitted年を記録し、会議年が異なる場合はpublication_statusへ。MARTHEはIJCAI 2020版の照合であり、それ以前のpreprintまで初出調査したという意味ではない。
| 未確定の元候補 | 回収できた一次資料 | 確認できたこと | 残した不足 |
|---|---|---|---|
| Provable Sharpness-Aware Minimization with Adaptive Learning Rate | 匿名投稿PDF | 表紙はICLR 2023 under review。要旨はadaptive LRとSAMの非凸解析 | 初公開日・著者・採択は未確認。OA032 AdaSAMと近い内容だが版の同一性を断定せず、独立した確定書誌にはしない |
| Sharpness-Aware Minimization in Large-Batch Training: Training Vision Transformer In Minutes | 同IDの匿名PDFの検索収録 | ICLR 2022 under review、LookSAM/Look-LayerSAMの要旨。OA031のLookSAMと共通内容 | 原ページがbrowser verification。著者・初公開日・最終版への書誌的な対応を確定できず、同一論文aliasを強制しない |
検索方法。 41候補のURLを抽出し、arXiv abs(v1指定がある場合はv1)、JMLR、IJCAI、ACL Anthology、CVPR/NeurIPS、OpenReviewを直接openした。OpenReviewのverification/429とCVFの403は、同題論文のarXiv・会議公開PDFで補った。取得不能を論文不存在とは解釈していない。追加で以下のクエリを実行した。
site:openreview.net "H1MczcgR-"site:openreview.net "vDeh2yxTvuh"site:openreview.net "htUvh7xPoa"site:openreview.net "PYSktOGKBkY""Understanding Short-Horizon Bias in Stochastic Meta-Optimization""When Do Flat Minima Optimizers Work?""Random Sharpness-Aware Minimization""Provable Sharpness-Aware Minimization with Adaptive Learning Rate""When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations""Sharpness-Aware Minimization in Large-Batch Training: Training Vision Transformer In Minutes""Towards Efficient and Scalable Sharpness-Aware Minimization" arxiv"Sharpness-Aware Minimization in Large-Batch Training" site:openreview.net"Provable Sharpness-Aware Minimization with Adaptive Learning Rate" site:openreview.net/forum
未確定2件は引用の存在と要旨は回収できているが、完全な書誌照合済み件数には含めない。別URLから同じ論文へ辿れた場合の辞書は optimization-supplement-url-aliases.json に保存した。元ページの変更や主章への統合は本補遺では行っていない。
参考文献
全39件は一次要旨確認。論文題名・著者・年・公開先と要旨の範囲で再確認した。以下の意義は短い読みどころであり、著者の性能報告を全設定へ一般化するものではない。
-
[OA001] James Bergstra・Yoshua Bengio(2012). Random Search for Hyper-Parameter Optimization. JMLR 13(10), 281–305 (2012)。要旨確認。探索予算を揃えたrandom searchの基準。LR scale専用手法ではなく一般HPO。
-
[OA002] Jasper Snoek ほか(2012). Practical Bayesian Optimization of Machine Learning Algorithms. arXiv preprint(会議版未再照合)。要旨確認。GPに基づくBayesian optimization。学習試行の費用・並列性も考慮。
-
[OA003] Yuhuai Wu ほか(2018). Understanding Short-Horizon Bias in Stochastic Meta-Optimization. ICLR 2018。要旨確認。短いunrollのmeta objectiveが小さすぎる学習率を選ぶbias。
-
[OA004] Michele Donini ほか(2020). Marthe: Scheduling the Learning Rate Via Online Hypergradients. IJCAI 2020, 2119–2125(この会議版を照合)。要旨確認。過去の学習軌跡から低費用にhypergradientを近似。
-
[OA005] Tom Schaul ほか(2012). No More Pesky Learning Rates. arXiv preprint(出版版未再照合)。要旨確認。局所的な勾配変動を使う複数学習率の適応。
-
[OA006] Olga Wichrowska ほか(2017). Learned Optimizers that Scale and Generalize. ICML 2017。要旨確認。階層RNNで学習したoptimizerの規模・タスク間転移。
-
[OA007] Leslie N. Smith ほか(2017). Super-Convergence: Very Fast Training of Neural Networks Using Large Learning Rates. arXiv preprint。要旨確認。大きい最大LRと一周期schedule、他正則化との釣合い。
-
[OA008] Robin M. Schmidt ほか(2020). Descending through a Crowded Valley - Benchmarking Deep Learning Optimizers. arXiv preprint(会議版未再照合)。要旨確認。多数のoptimizerと設定を共通予算で比べる実証的基準。
-
[OA009] Yikang Shen ほか(2024). Power Scheduler: A Batch Size and Token Number Agnostic Learning Rate Scheduler. arXiv preprint(元リンクのv1を確認)。要旨確認。batch・学習tokenとLRの関係を近似し転移を検証。
-
[OA010] Zhao Song ほか(2023). An Automatic Learning Rate Schedule Algorithm for Achieving Faster Convergence and Steeper Descent. arXiv preprint。要旨確認。Regrettable Delta-Bar-Deltaで不適切なLR更新を修正。
-
[OA011] Yuchen Jin ほか(2021). AutoLRS: Automatic Learning-Rate Schedule by Bayesian Optimization on the Fly. ICLR 2021。要旨確認。短い試行からlossを予測し段階別LRをBayesian optimization。
-
[OA012] Xingyu Xie ほか(2024). Optimization Hyper-parameter Laws for Large Language Models. arXiv preprint(元リンクのv1を確認、最新版は2026改訂)。要旨確認。SDEから動的hyperparameterと損失の関係をモデル化。
-
[OA013] Kairong Luo ほか(2025). A Multi-Power Law for Loss Curve Prediction Across Learning Rate Schedules. arXiv preprint。要旨確認。累積LRと減衰効果から未知scheduleの損失曲線を予測。
-
[OA014] Yuki Tsukada ほか(2023). Relationship between Batch Size and Number of Steps Needed for Nonconvex Optimization of Stochastic Gradient Descent using Armijo Line Search. arXiv preprint。要旨確認。Armijo SGDのbatch数・step数・SFO費用の条件付き解析。
-
[OA015] Tao Zhang ほか(2020). kDecay: Just adding k-decay items on Learning-Rate Schedule to improve Neural Networks. arXiv preprint。要旨確認。既存scheduleの形状をkで変える経験的設計。
-
[OA016] Prabhu Teja Sivaprasad ほか(2019). Optimizer Benchmarking Needs to Account for Hyperparameter Tuning. ICML 2020。要旨確認。optimizerの比較にhyperparameter探索費用を含める。
-
[OA017] Zixiang Chen ほか(2023). Why Does Sharpness-Aware Minimization Generalize Better Than SGD?. NeurIPS 2023。要旨確認。特定データモデル・二層ReLU CNNでnoise学習抑制を説明。
-
[OA018] Szilvia Ujváry ほか(2022). Rethinking Sharpness-Aware Minimization as Variational Inference. arXiv preprint。要旨確認。SAMとmean-field variational inferenceの摂動勾配の関係。
-
[OA019] Thomas Möllenhoff ほか(2022). SAM as an Optimal Relaxation of Bayes. ICLR 2023。要旨確認。Bayes目的の凸緩和としてSAMを解釈し不確実性へ接続。
-
[OA020] Jean Kaddour ほか(2022). When Do Flat Minima Optimizers Work?. NeurIPS 2022。要旨確認。SWA/SAMを画像・言語・graphの異なるタスクで比較。
-
[OA021] Simran Kaur ほか(2022). On the Maximum Hessian Eigenvalue and Generalization. NeurIPS 2022 workshop; PMLR 187, 51–65 (2023)。要旨確認。最大Hessian固有値の低下と汎化改善が分離する実験。
-
[OA022] Sidak Pal Singh ほか(2023). The Hessian perspective into the Nature of Convolutional Neural Networks. ICML 2023。要旨確認。CNN構造とHessian rankの関係。線形活性化の理論と実験を区別。
-
[OA023] Harsh Rangwani ほか(2022). Escaping Saddle Points for Effective Generalization on Class-Imbalanced Data. NeurIPS 2022。要旨確認。クラス不均衡の少数クラス損失におけるsaddle脱出。
-
[OA024] Georgios Arvanitidis ほか(2017). Latent Space Oddity: on the Curvature of Deep Generative Models. ICLR 2018。要旨確認。生成器のpullback幾何。パラメータ損失sharpnessとは別の曲率。
-
[OA025] Hongyang R. Zhang ほか(2023). Noise Stability Optimization for Finding Flat Minima: A Hessian-based Regularization Approach. arXiv preprint(2024年改訂題名)。要旨確認。両方向noiseでHessian trace正則化を推定。
-
[OA026] Kayhan Behdin ほか(2022). Improved Deep Neural Network Generalization Using m-Sharpness-Aware Minimization. arXiv preprint。要旨確認。mini-batchを分割したmSAMの性能・費用・感度を比較。
-
[OA027] Peng Mi ほか(2022). Make Sharpness-Aware Minimization Stronger: A Sparsified Perturbation Approach. NeurIPS 2022。要旨確認。Fisher/dynamic sparse maskでSAMの摂動を疎にする。
-
[OA028] Tom Sherborne ほか(2023). TRAM: Bridging Trust Regions and Sharpness Aware Minimization. ICLR 2024 spotlight。要旨確認。パラメータ近傍と関数空間のtrust regionをfine-tuningで結ぶ。
-
[OA029] Yong Liu ほか(2022). Random Sharpness-Aware Minimization. NeurIPS 2022。要旨確認。random smoothingで内側maxの一段近似を改善。
-
[OA030] Yang Zhao ほか(2022). Randomized Sharpness-Aware Training for Boosting Computational Efficiency in Deep Learning. arXiv preprint。要旨確認。SAM/通常更新を確率的に切替え追加逆伝播を節約。
-
[OA031] Yong Liu ほか(2022). Towards Efficient and Scalable Sharpness-Aware Minimization. CVPR 2022。要旨確認。LookSAMで摂動方向の計算を周期化し大バッチへ展開。
-
[OA032] Hao Sun ほか(2023). AdaSAM: Boosting Sharpness-Aware Minimization with Adaptive Learning Rate and Momentum for Training Deep Neural Networks. arXiv preprint。要旨確認。adaptive LR・momentum・SAMの結合を非凸設定で解析。
-
[OA033] Xiangning Chen ほか(2021). When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations. ICLR 2022 spotlight。要旨確認。SAMを用いたViT/MLP-Mixerの事前学習なし条件の比較。
-
[OA034] Qihuang Zhong ほか(2022). Improving Sharpness-Aware Minimization with Fisher Mask for Better Generalization on Language Models. Findings of EMNLP 2022, 4064–4085。要旨確認。言語モデルfine-tuningでFisher maskを使うFSAM。
-
[OA035] Rajhans Singh ほか(2022). Improving Shape Awareness and Interpretability in Deep Networks Using Geometric Moments. CVPR 2023 Workshop: Deep Learning for Geometric Computing。要旨確認。幾何momentによるshape表現。SAM手法ではなく周辺アーキテクチャ研究。
-
[OA036] Feng Chen ほか(2023). Stochastic Collapse: How Gradient Noise Attracts SGD Dynamics Towards Simpler Subnetworks. NeurIPS 2023。要旨確認。SGD noiseによる疎・低rank不変集合への引力とimplicit bias。
-
[OA037] Florian Seligmann ほか(2023). Beyond Deep Ensembles: A Large-Scale Evaluation of Bayesian Deep Learning under Distribution Shift. arXiv preprint(出版版未再照合)。要旨確認。分布変化下のBayesian近似・ensembleとcalibrationの比較。
-
[OA038] Dan Hendrycks ほか(2020). The Many Faces of Robustness: A Critical Analysis of Out-of-Distribution Generalization. ICCV 2021。要旨確認。複数の現実的分布変化で頑健性を評価。
-
[OA039] Li Wang ほか(2022). The Implicit Regularization of Momentum Gradient Descent with Early Stopping. arXiv preprint。要旨確認。最小二乗でearly stopping付きmomentum flowをridgeと比較。
追加照合:既存メモに残っていた数理・分散最適化の関連研究
この補遺は、既存contentの引用URL照合から追加した29件を対象にする。確認日は2026-10-03。既存のOP・MD文献と同一の別URLは新規文献として重複計上せず、別ファイルのalias辞書へ記録した。次の要約は要旨・書誌を中心とする確認であり、各論文の全証明を再検証したものではない。
大batchの性能、適応batch、cluster scheduling
大batchの比較では、batch以外に何を固定するかが結論を変える。Shallue et al.は35 workloadsを含む大規模な測定から、必要な訓練step数とbatchの関係がモデル・訓練法・データで大きく異なり、文献間のgeneralization gapの相違がtuningと計算budgetの違いで説明され得ると報告した。この実験範囲での観測を「すべてのtaskでbatchは汎化へ影響しない」という普遍則へ広げるべきではない。OB002
LANSはLAMB系の層ごとの適応を発展させ、更新とscheduleを組み合わせてBERT事前学習を高速化した。題名の54分は特定のAWS構成・batch・評価閾値に対する計測であり、optimizerのみの速度比ではない。著者がtechnical reportと明記しているため、採択会議名は付与しない。OB003
Bollapragada et al.のadaptive samplingは、勾配の内積に関するtestによってsample数を増やし、探索方向の信頼性を制御する。強凸での線形収束と非凸での収束を議論しているが、実際の大規模訓練ではtest用の分散推定・追加sampleのコストも必要になる。OB004 この流れをAdaGrad/AdaGradNormへ移したAdAdaGradは、batchと座標ごとの適応の相互作用を扱う。2026年8月改訂の要旨は、smooth非凸問題での高確率の一次停留点へのrateを述べる。ただしiterationに関するrateをgradient評価総数のrateと同一視できない。元メモの「Vision and Language Models」という記述に対し、今回確認した要旨の実証はimage classificationであり、言語モデル実験の存在までは確認していない。OB005
一方、ONESはbatchを訓練algorithm内だけで決めず、共有GPU clusterのjob schedulingと結び付ける。評価軸は単一jobのstep数より平均job完了時間・GPU利用率である。OB006 He et al.のsurveyは、この精度・通信・memoryの関係を横断する入口となる。ただし2021年時点のレビューであり、その後のLLM用optimizerやdistributed trainingまで更新された資料ではない。OB007 EXTRAP-SGDは、大batchの勾配計算位置にextragradientを導入し、訓練軌道を安定化する別の方向である。ResNet・LSTM・Transformerの報告があるが、追加の勾配計算を含む同一budgetで比較する必要がある。OB013
sign更新、noise、scaleを結ぶ学習ダイナミクス
Balles et al.はsign gradient descentを$\ell_\infty$ノルムのsteepest descentとして捉え、separable smoothnessとの関係を整理した。Hessianの対角集中や最大固有値と平均固有値の差が、sign更新が有利になる条件の理解に関係する。これは「符号だけでも常に同じ情報を保持する」という意味ではない。OB008
Xiao et al.は高次元極限のリスク曲線をSDE/ODEで記述し、effective learning rate、diagonal preconditioning、noise compression、noise reshapingを分けて定量化した。ICML 2025刊行版と2026年3月のarXiv改訂を区別した。Adamへの拡張は要旨でもconjectureとされ、signSGDの定理をAdamの保証として引用できない。OB010
Luo et al.は、SGD中のnetwork Lipschitz量の変化を、勾配flowとnoise、operator normに関するJacobian/Hessianへの射影から分析する。2025年のpreprintであり、要旨確認から任意のarchitectureの実際の最小Lipschitz定数が正確に求まるとは言えない。OB009 Qiu et al.のscaling collapseは、compute-optimalに訓練された異なるsizeのloss曲線を終点で正規化すると一致する観測を整理し、learning-rate decay下のsupercollapseを示す。適切にscaleされたhyperparameterの診断には有望だが、全training runの普遍的な曲線一致を主張する結果ではない。OB011
Local SGDの周辺:分散graph、buffer、局所適応
Local SGDの周期平均、decentralized SGDの近傍混合、Federated Learningの部分参加・不均衡は、別の設計軸である。D-PSGDは中央nodeの通信bottleneckを減らせる領域を示し、低帯域・高latencyの構成での実証を行った。高速networkと現代的all-reduce環境まで同じ優位性が自動的に続くわけではない。OB012
CHOCOでは二つの収束を区別する必要がある。平均合意のCHOCO-GOSSIPは、連結性とcompression品質に依存した線形収束を持つ。一方、CHOCO-SGDは強凸確率最適化として、反復数・worker数に加えてmixing matrixの連結性とcompression品質に依存した収束率を持つ。gossipの線形収束を、そのまま確率最適化全体のrateとして要約しない。arXiv初稿と刊行版では要旨の記号にも差があるため、定理の定数・次数を使う際は引用する版を固定する。OB018
BMUFは音声認識のLSTM・DNNでblockwise model-update filteringを導入した先行研究である。著者所属機関の要旨で対象model・GPU数を確認した。元メモのような単なる「block内平均、block間平均」という記述だけでは、update filteringとmomentumの役割が落ちるため、実装時には原論文の更新式を確認する必要がある。OB019 DeDLOCは、参加者の帯域・hardwareが揃わないopen collaborationでの計算と通信を設計し、SwAV・ALBERTや40参加者の訓練を報告した。要旨確認の範囲で、通信の非同期化とmodel更新のstalenessを同一視しない。元メモには「同期」「非同期」が混在しているため、独立したalgorithm項目として原文で確認するべき箇所が残る。OB014
FedSPS系のLocally Adaptive Federated Learningは、clientごとに異なるstep sizeでlocal geometryを利用する。理論は凸・強凸やinterpolationに関連する条件を扱い、非凸networkでの改善は実証として分けられる。著者はMukherjee, Loizou, Stichの3名であり、元メモから第一著者が抜けていた。OB015 Fed-LAMBは層ごとの適応をFLへ加える方向で、arXivは2021年、正式版はUAI 2023となる。IID/non-IIDでの改善報告を、任意のheterogeneityに対する保証へ一般化しない。OB016 FedBuffは到着したclient updateをbuffer単位にまとめ、非同期性とSecure Aggregationの両立を図る。buffer、client参加、staleness、privacy設定が評価に影響するので、非同期Local SGDと同じ名称でまとめるより、集約単位とprotocolを記録する。OB017
Natural gradient、Shampoo、CG、dampingを接続する
Martensの長いレビューは、natural gradientをFisherを使った二次法として捉え、GGNとの一致条件、trust region、Tikhonov damping、empirical Fisherの問題、再parameterizationへの近似的な不変性を整理する。自然勾配を使えば離散stepや近似Fisherまで完全に座標不変になる、とは限らない。OB001
Morwani et al.のICLR 2025論文は、Shampooの近似そのものと、最適Kronecker近似を求めるpower iterationの関係を明確にした。要旨の重要な限定は、Shampoo側の近似の二乗が、対象Kronecker近似を計算するpower iterationの1 stepと対応することである。「ShampooがHessianの最適Kronecker近似を直接計算する」と短縮すると意味が変わる。さらにbatch gradientとempirical Fisherが近似品質へ与える影響も扱っている。OB020
日本語資料では、矢部の「共役勾配法」は共役性、正定値二次問題と非線形拡張を追う入口になる。有限回停止の性質は、対称正定値の線形問題とexact arithmeticを前提に読む。OB028 八巻・矢部の「非線形計画法(3)」は旧リンクが学会archiveへ移動していた。元メモの同一URLへの「応用統計学」というラベルは論文題名ではない。今回確認できたのは無制約最適化の学会解説の書誌である。OB029 本川・手塚のDEIM 2019論文は、Hessian-free法へmomentumとAdamの工夫を導入する研究会報告であり、一次資料の題名・著者・要旨を確認した。これをLM法やK-FACそのものの提案論文とは区別して読む。OB027
Bilevelの統計、NAS、IRM、多段化
Bao et al.はbilevelの最適化誤差だけでなく、validation setに対するuniform stabilityからhyperparameter選択の期待汎化誤差を分析した。outer/inner双方の正則化がvalidationへの過適合を和らげるという方向を示す。validation lossを最小化する手順にも、同じvalidation dataを反復して使うことによる統計的な問題がある。OB021
DARTSはarchitectureの離散探索を連続緩和し、gradientを用いて構造を学習する代表例である。連続緩和した問題、有限stepで近似する内側訓練、最後に離散化したarchitectureの性能はそれぞれ異なる対象であり、一つの最適化の成功で三つが同時に保証されるわけではない。OB022 Sato et al.は、内側問題を有限回の最急降下更新に置き換える発想を$n$段へ拡張し、適切な条件で元のmultilevel問題への漸近的な接続を論じた。有限展開長での誤差と、段数増加による微分・memory負担が実装上の論点になる。OB026
IRM周辺では、Huh and BaidyaのMRIは$\mathbb E_e[f(x)\mid y]$の環境間不変性を使い、一般線形問題で十分な環境数がある場合の保証を示した。要旨にある非線形画像実験と、この線形の保証を分けて扱う。OB024 Zhang et al.はbatch sizeと評価環境の選択、ensembleを単一predictorへまとめる問題を再検討し、consensus制約付きbilevelとしてIRMの変種を設計した。未知の環境に対する不変性を一つのtest環境だけで判断する問題に注意を向ける。OB025
既存bilevelページのModel-based RL surveyは、model learningとplanningの相互作用を広く扱う資料である。二つのsubroutineがあるというだけではbilevel最適化にならず、outer目的がinnerの解にどう依存し、どこまで微分・最適化するかが分類基準になる。OB023 同ページのLatent Diffusion Modelsは、この補遺では重複登録せず、生成モデル章のMD93へ統合した。
この補遺から読む順序
大batchはShallue → adaptive sampling → AdAdaGradを読み、LANS/ONESをalgorithmとhardwareの組合せとして比較する。Local SGDは中央平均・近傍混合・非同期buffer・局所適応の四軸を固定してからD-PSGD/CHOCO/FedBuff/FedSPSへ進む。曲率はMartens → Shampooの近似解析 → CG/dampingの順がよい。BilevelはDARTSの具体例 → stabilityによるvalidation過適合 → multilevelへの拡張を読むと、最適化と汎化の論点を分けやすい。
補遺参考文献
年は確認できた正式版の年、またはarXiv初稿年。要旨確認は書誌と著者・出版社・会議の要旨を確認した意味であり、全条件の読解を意味しない。
-
[OB001] James Martens. New Insights and Perspectives on the Natural Gradient Method (2020). JMLR 21(146):1–76, 2020, published。Fisher・GGN・damping・再parameterizationの関係を整理。確認水準:要旨確認。
-
[OB002] Christopher J. Shallue, Jaehoon Lee, Joseph Antognini, Jascha Sohl-Dickstein, Roy Frostig, George E. Dahl. Measuring the Effects of Data Parallelism on Neural Network Training (2019). JMLR 20(112):1–49, 2019, published。batch比較におけるtuning・計算budgetの交絡を大規模に測定。確認水準:要旨確認。
-
[OB003] Shuai Zheng, Haibin Lin, Sheng Zha, Mu Li. Accelerated Large Batch Optimization of BERT Pretraining in 54 minutes (2020). technical report, 2020; arXiv明記で査読venueなし。LANSと学習率scheduleによるBERTの大batch訓練。確認水準:要旨確認。
-
[OB004] Raghu Bollapragada, Richard Byrd, Jorge Nocedal. Adaptive Sampling Strategies for Stochastic Optimization (2018). SIAM Journal on Optimization, 2018, published; arXiv初稿2017。内積testにより勾配推定のsample数を調整。確認水準:要旨確認。 刊行版確認先。
-
[OB005] Tim Tsz-Kit Lau, Han Liu, Mladen Kolar. AdAdaGrad: Adaptive Batch Size Schemes for Adaptive Gradient Methods (2026). Statistical Learning and Data Science, online 2026-08-11, in press / journal pre-proof(出版社検索取得書誌); arXiv初稿2024、v4 2026-08-25。AdaGrad系の更新と適応batchの相互作用を解析。確認水準:要旨確認。 刊行版確認先。
-
[OB006] Zhengda Bian, Shenggui Li, Wei Wang, Yang You. Online Evolutionary Batch Size Orchestration for Scheduling Deep Learning Workloads in GPU Clusters (2021). SC 2021 acceptedとの著者arXiv記載;初稿2021。batch変更とGPU job配置を同時に考えるONES。確認水準:要旨確認。
-
[OB007] Xiaoxin He, Fuzhao Xue, Xiaozhe Ren, Yang You. Large-Scale Deep Learning Optimizations: A Comprehensive Survey (2021). arXiv survey公開2021;正式刊行版未照合。精度・通信・memoryから大規模訓練を整理。確認水準:要旨確認。
-
[OB008] Lukas Balles, Fabian Pedregosa, Nicolas Le Roux. The Geometry of Sign Gradient Descent (2020). arXiv公開2020;正式刊行版未照合。sign更新をℓ∞幾何とHessian構造から理解。確認水準:要旨確認。
-
[OB009] Róisín Luo, James McDermott, Christian Gagné, Qiang Sun, Colm O’Riordan. Optimization-Induced Dynamics of Lipschitz Continuity in Neural Networks (2025). preprint; submitted 2025-06-23, revised 2025-11-14。SGD noiseとLipschitz量の変化をSDEで記述。確認水準:要旨確認。
-
[OB010] Ke Liang Xiao, Noah Marshall, Atish Agarwala, Elliot Paquette. Exact Risk Curves of signSGD in High-Dimensions: Quantifying Preconditioning and Noise-Compression Effects (2025). ICML 2025, PMLR 267:68391–68439; arXiv初稿2024、v3 2026-03-25。高次元signSGDのリスク曲線を前処理とnoise効果へ分解。確認水準:要旨確認。 刊行版確認先。
-
[OB011] Shikai Qiu, Lechao Xiao, Andrew Gordon Wilson, Jeffrey Pennington, Atish Agarwala. Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks (2025). ICML 2025, PMLR 267:50697–50720, published。compute-optimal訓練曲線の正規化とsupercollapse。確認水準:要旨確認。
-
[OB012] Xiangru Lian, Ce Zhang, Huan Zhang, Cho-Jui Hsieh, Wei Zhang, Ji Liu. Can Decentralized Algorithms Outperform Centralized Algorithms? A Case Study for Decentralized Parallel Stochastic Gradient Descent (2017). NeurIPS 2017, published。通信graph上のSGDと中央node通信bottleneckを比較。確認水準:要旨確認。 刊行版確認先。
-
[OB013] Tao Lin, Lingjing Kong, Sebastian U. Stich, Martin Jaggi. Extrapolation for Large-batch Training in Deep Learning (2020). ICML 2020, PMLR 119:6094–6104, published。extragradientによる大batch訓練軌道の制御。確認水準:要旨確認。 刊行版確認先。
-
[OB014] Michael Diskin, Alexey Bukhtiyarov, Max Ryabinin, Lucile Saulnier, Quentin Lhoest, Anton Sinitsin, Dmitry Popov, Dmitry Pyrkin, Maxim Kashirin, Alexander Borzunov, Albert Villanova del Moral, Denis Mazur, Ilia Kobelev, Yacine Jernite, Thomas Wolf, Gennady Pekhimenko. Distributed Deep Learning in Open Collaborations (2021). NeurIPS 2021 acceptedとの著者arXiv記載。異質帯域・参加者を考慮したDeDLOC。確認水準:要旨確認。
-
[OB015] Sohom Mukherjee, Nicolas Loizou, Sebastian U. Stich. Locally Adaptive Federated Learning (2023). arXiv初稿2023、v2 2024-05-14;正式刊行版未照合。clientごとに異なるstep sizeで局所geometryを利用。確認水準:要旨確認。
-
[OB016] Belhal Karimi, Ping Li, Xiaoyun Li. Layer-wise and Dimension-wise Locally Adaptive Federated Learning (2023). UAI 2023, PMLR 216:1037–1046; arXiv初稿2021、刊行題名はFed-LAMBで始まる。層ごと・次元ごとの適応をFLに導入。確認水準:要旨確認。 刊行版確認先。
-
[OB017] John Nguyen, Kshitiz Malik, Hongyuan Zhan, Ashkan Yousefpour, Michael Rabbat, Mani Malek, Dzmitry Huba. Federated Learning with Buffered Asynchronous Aggregation (2022). AISTATS 2022, PMLR 151:3581–3607, published; arXiv初稿2021。非同期更新のbuffer集約とSecure Aggregationの両立。確認水準:要旨確認。 刊行版確認先。
-
[OB018] Anastasia Koloskova, Sebastian U. Stich, Martin Jaggi. Decentralized Stochastic Optimization and Gossip Algorithms with Compressed Communication (2019). ICML 2019, PMLR 97:3478–3487, published;記載URLはarXiv初稿。圧縮gossipのconsensusとSGDの収束率を区別。確認水準:要旨確認。 刊行版確認先。
-
[OB019] Kai Chen, Qiang Huo. Scalable Training of Deep Learning Machines by Incremental Block Training with Intra-block Parallel Optimization and Blockwise Model-Update Filtering (2016). ICASSP 2016, March 2016;著者所属機関の公開書誌・要旨確認。blockwise update filteringを用いた分散音声モデル訓練。確認水準:要旨確認。
-
[OB020] Depen Morwani, Itai Shapira, Nikhil Vyas, Eran Malach, Sham Kakade, Lucas Janson. A New Perspective on Shampoo’s Preconditioner (2025). ICLR 2025, published; arXiv初稿2024。Shampoo近似の二乗とKronecker近似のpower iterationの関係。確認水準:要旨確認。 刊行版確認先。
-
[OB021] Fan Bao, Guoqiang Wu, Chongxuan Li, Jun Zhu, Bo Zhang. Stability and Generalization of Bilevel Programming in Hyperparameter Optimization (2021). NeurIPS 2021, published。validation dataに対する安定性とhyperparameter過適合。確認水準:要旨確認。 刊行版確認先。
-
[OB022] Hanxiao Liu, Karen Simonyan, Yiming Yang. DARTS: Differentiable Architecture Search (2019). ICLR 2019 publishedとの著者arXiv記載;初稿2018。離散architecture searchを連続緩和で微分可能にする。確認水準:要旨確認。
-
[OB023] Thomas M. Moerland, Joost Broekens, Aske Plaat, Catholijn M. Jonker. Model-based Reinforcement Learning: A Survey (2023). Foundations and Trends in Machine Learning 16(1):1–118, 2023(出版社公開書誌確認); arXiv初稿2020。モデル学習とplanningの組合せを整理し二段学習とbilevelを区別。確認水準:要旨確認。 刊行版確認先。
-
[OB024] Dongsung Huh, Avinash Baidya. The Missing Invariance Principle Found – the Reciprocal Twin of Invariant Risk Minimization (2022). NeurIPS 2022との著者arXiv記載。labelで条件付けた表現の不変性MRIを提案。確認水準:要旨確認。
-
[OB025] Yihua Zhang, Pranay Sharma, Parikshit Ram, Mingyi Hong, Kush Varshney, Sijia Liu. What Is Missing in IRM Training and Evaluation? Challenges and Solutions (2023). ICLR 2023 acceptedとの著者arXiv記載。batch・評価環境・consensus制約からIRMを再検討。確認水準:要旨確認。
-
[OB026] Ryo Sato, Mirai Tanaka, Akiko Takeda. A Gradient Method for Multilevel Optimization (2021). NeurIPS 2021 camera-readyとの著者arXiv記載。内側反復の展開を多段問題へ拡張。確認水準:要旨確認。
-
[OB027] 本川 哲哉, 手塚 太郎. ニューラルネットワークにおける適応的二次最適化手法 (2019). DEIM Forum 2019, A4-2, 公開研究会論文。Hessian-free法にmomentumとAdamの工夫を組み合わせる。確認水準:要旨確認。
-
[OB028] 矢部 博. 共役勾配法 (1987). オペレーションズ・リサーチ 32(6), pp.363–367, 1987, 学会解説。線形CGの共役性と非線形拡張を日本語で説明。確認水準:本文該当節確認。
-
[OB029] 八巻 直一, 矢部 博. 非線形計画法(3)—無制約最適化問題— (1995). オペレーションズ・リサーチ 40(1), pp.55–60, 1995, 学会解説。無制約最適化法の関係を整理する既存引用資料。確認水準:書誌確認。