最適化の関連研究補遺:SAM・学習率・大バッチ・分散・bilevel

総合索引 · 最適化の主章 · 統合参考文献

主章の研究史を補う追加調査である。前半のOA文献はSAM・学習率、後半のOB文献は数理・分散最適化の既存引用を扱う。確認日はいずれも2026年10月3日。公開年・版・確認水準の詳細は各節と文献台帳に示す。

SAM・学習率スケジュール:既存引用の追加照合

調査基準日:2026年10月3日。対象は元の optimization/sam.md と optimization/lr-schedule.md にあり、最初の文献台帳と未照合だった41候補。39文献を一次要旨・書誌で再確認し、2件の匿名投稿版は下記の未確定表に残した。本補遺は既存引用の取りこぼしを減らすための追補であり、この39件について定理本文・全実験・コードを精査したものではない。数値的な性能順位や一般的収束保証は要旨から拡張しない。

1. LR研究を「何を選ぶか」で分ける

分類 文献 主な意義 比較で残す条件
外側のhyperparameter探索 [OA001] Random Search、[OA002] Practical Bayesian Optimization 限られた試行をどこへ割り当てるか 検索空間、試行数、validation、各試行の費用
Online hypergradient [OA003] Short-Horizon Bias、[OA004] MARTHE 学習途中の状態からLRを調整 unroll長、短期目的のbias、近似費用
Online局所適応 [OA005] No More Pesky Learning Rates、[OA010] RDBD 勾配変動・過去更新を利用 noise、追加状態、残るmeta parameter
学習されたoptimizer [OA006] Learned Optimizers 更新則自体をmeta学習 meta訓練タスク、モデル規模の転移、全meta訓練費用
形状と正則化の共同設計 [OA007] Super-Convergence、[OA015] kDecay 一周期・LRの変化を設計 最大LR、weight decay等の正則化、形状探索費用
段階別のblack-box探索 [OA011] AutoLRS 短い試行から先のvalidation lossを予測 予測誤差、候補評価費用、学習状態の複製
LLMの経験的loss model [OA009] Power Scheduler、[OA012] Opt-Laws、[OA013] Multi-Power Law 小さい実験から別budget・scheduleを推定 fit範囲、外挿範囲、tokenizer・データ・architecture
Line searchとbatch [OA014] Armijo SGD step数とoracle費用を分ける 非凸解析の仮定、line-search評価費用、実時間
公平なoptimizer比較 [OA008] Crowded Valley、[OA016] Tuning-aware Benchmarking 最良点だけでなく探索しやすさも測る 同一探索予算、タスクの多様性、wall-clock

研究の流れ。 Random searchとBayesian optimizationは、手作業の探索を比較可能な手続きにする前史である。元メモの「scaleのみの最適化」という分類は狭すぎる。両者は一般のhyperparameter optimizationであり、schedule形状のパラメータも探索対象にできる。対してMARTHEは学習軌跡の情報を使い、AutoLRSは短い試行と損失予測を使う。どちらも、既定の時間関数を一つ選ぶこととは異なる。[OA001] Random Search、[OA002] Bayesian Optimization、[OA004] MARTHE、[OA011] AutoLRS

短期と長期の目的。 Short-Horizon Biasは、短いmeta objectiveが小さすぎるLRへ偏ることを、noisy quadraticと実験で調べた。目先のloss低下を最大にすることは、長期学習に最良の探索とは限らない。MARTHE、AutoLRS、学習されたoptimizerでは、meta訓練・候補試行・validationを含めた費用と最終性能を比較する必要がある。[OA003] Understanding Short-Horizon Bias、[OA006] Learned Optimizers

スケーリングへの接続。 Power Schedulerはbatch・tokenと最適LRの経験的関係を使い、Opt-Lawsは動的hyperparameterと学習損失をSDEに基づいてモデル化し、Multi-Power Lawは累積LRと減衰によるloss減少を分ける。これらはscheduleを変えるたびに本番規模で試す費用を下げる方向である。ただし、有限のモデル・データ・schedule族で得た予測精度から「どのscheduleでも正確」とは言えない。Opt-Lawsは元リンクがv1なのでその2024年版を照合し、2026年改訂の追加主張を混ぜていない。[OA009] Power Scheduler、[OA012] Opt-Laws v1、[OA013] Multi-Power Law

評価と限界。 Super-Convergenceの大きいLRは他の正則化の強さと一緒に考える必要がある。Armijo解析でのstep数やSFO削減は、そのまま実GPUの短い実時間を保証しない。optimizer比較の結論も、タスクと探索予算に依存する。再現実験ではbase LRとshapeを分け、同じ調整費用、同じ総token/step、複数seed、time-to-targetを残す。[OA007] Super-Convergence、[OA014] Armijo SGD、[OA008] Crowded Valley、[OA016] Tuning-aware Benchmarking

読む順序は Random Search → tuningを含むbenchmark → Short-Horizon Bias → MARTHE/AutoLRS → Power Scheduler/Opt-Laws/Multi-Power Law。未解決問題は、短いproxy実験から本番予算への転移、validationへの過適合、architectureやデータ変更後の外挿誤差である。

2. SAM研究:機構、目的、計算削減を別に評価する

分類 文献 識別すべき問い
汎化の機構 [OA017] Why SAM Generalizes どのデータモデル・networkでnoise学習を抑えるのか
Bayesとの接続 [OA018] SAM as VI、[OA019] Relaxation of Bayes 摂動勾配の類似と目的関数の緩和の違い
多領域の比較 [OA020] When Do Flat Minima Optimizers Work?、[OA021] Maximum Hessian Eigenvalue flatness指標と性能の関係は条件を変えて残るか
batch内の分割 [OA026] mSAM batchのshardごとの摂動を平均する効果
摂動の選別 [OA027] Sparse SAM、[OA034] Fisher-mask SAM どのparameterを動かすか、疎化が実機の費用を減らすか
inner max近似の改善 [OA029] Random SAM smoothingした重みでの一段上昇の意味
更新回数の削減 [OA030] Randomized Training、[OA031] LookSAM SAM/通常stepの切替えと摂動方向の再利用
適応更新の解析 [OA032] AdaSAM momentum・adaptive scale・摂動の結合をどう抑えるか
関数空間との接続 [OA028] TRAM parameter sharpnessと表現の転移可能性を両立するか
対象領域 [OA023] Class-Imbalanced Data、[OA033] ViT vs ResNet 少数クラス・architecture・augmentationへの依存

単一のsharpness指標を説明にしすぎない。 Chenらの説明は特定データモデルと二層畳み込みReLUネットの解析であり、一般NNの優越定理ではない。Kaurらは最大Hessian固有値を小さくしても汎化が改善しない条件を示す。この二つは、SAMの研究を「Hessianの最大固有値を小さくすればよい」だけに縮めないために併読すべきである。[OA017] Why Does SAM Generalize Better Than SGD?、[OA021] On the Maximum Hessian Eigenvalue and Generalization

Bayes・noiseとの関係。 Variational inferenceとの接続は、摂動したparameterにおける勾配という共通構造を整理する。一方、Bayesの最適緩和としての研究は目的関数の凸緩和を扱う。両者を「SAMが厳密なBayesian posteriorを計算する」という意味にしない。Noise Stability Optimizationは両方向のnoiseでHessian traceの正則化を推定する別設計で、traceと最大固有値、平均的摂動と最悪方向の摂動を分ける。[OA018] Rethinking SAM as Variational Inference、[OA019] SAM as an Optimal Relaxation of Bayes、[OA025] Noise Stability Optimization

効率化は同じ操作ではない。 R-SAMはrandom smoothing、RSTはSAMを実行するstepの確率的選択、LookSAMは摂動方向の周期的計算であり、名前にrandom/efficientがあっても互換ではない。SSAM/FSAMはparameter mask、mSAMはbatchのshardという異なる粒度を変える。比較時には、最適化stepだけでなく勾配評価数、摂動計算、メモリ、通信、wall-clockを併記する。疎い摂動そのものがdense kernelの時間削減に直結するとは限らない。[OA029] R-SAM、[OA030] RST、[OA031] LookSAM、[OA027] SSAM、[OA034] FSAM、[OA026] mSAM

転移・領域への依存。 TRAMは関数空間のtrust regionをfine-tuningと結び、class imbalanceの研究は少数クラスのloss geometry、ViT研究は事前学習・augmentationの条件を扱う。元の適用条件を外して全領域での優越とは書けない。AdaSAMの収束率も、要旨に報告される非凸設定の解析として記録し、証明の仮定を未確認のまま実装全般へ適用しない。[OA028] TRAM、[OA023] Escaping Saddle Points、[OA033] When ViTs Outperform ResNets、[OA032] AdaSAM

読む順序は、主章のSAM原論文の後に multi-domain benchmark → 最大固有値への反例 → 機構・Bayes解釈 → RST/LookSAM/mask → TRAM/領域別評価。未解決問題は、同じsharpnessを測っているか、改善がfeature learning・noise抑制・実効LRの変化のどれに由来するか、同じ計算予算で効果が残るかである。

3. 元SAMメモの「周辺研究」を再分類する

文献 本来の中心問題 SAMとの関連の取り方
[OA022] CNN Hessian Toeplitz構造を利用したHessian rank CNN architectureと曲率の関係。SAM自体の収束論文ではない
[OA024] Latent Space Oddity 生成器が誘導するlatent空間の幾何 lossのparameter Hessianと区別する
[OA035] Geometric Moments 形状表現・解釈性 “shape”と“sharpness”を同一視しない。SAMの派生手法ではない
[OA036] Stochastic Collapse SGD noiseと疎・低rank不変集合 noiseによるimplicit biasを比較する
[OA037] Beyond Deep Ensembles 分布変化下の不確実性・calibration accuracyのみのSAM比較を補う評価軸
[OA038] Many Faces of Robustness 複数種類の実世界分布変化 一種類のshiftでの改善を頑健性全般にしない
[OA039] Momentum with Early Stopping 最小二乗の連続時間momentum flowとridge momentumのimplicit regularizationの限定的な理論例

ここでの再分類は、同じページに保存されていることが同じ研究問題を意味しないという整理である。OA022の理論の一部は線形活性化、OA036の汎化説明の一部は線形teacher–student、OA039は最小二乗という範囲を保つ。本文の定理全体を今回読んだという意味ではない。

4. 書誌訂正、未確定版、検索記録

未確定の元候補 回収できた一次資料 確認できたこと 残した不足
Provable Sharpness-Aware Minimization with Adaptive Learning Rate 匿名投稿PDF 表紙はICLR 2023 under review。要旨はadaptive LRとSAMの非凸解析 初公開日・著者・採択は未確認。OA032 AdaSAMと近い内容だが版の同一性を断定せず、独立した確定書誌にはしない
Sharpness-Aware Minimization in Large-Batch Training: Training Vision Transformer In Minutes 同IDの匿名PDFの検索収録 ICLR 2022 under review、LookSAM/Look-LayerSAMの要旨。OA031のLookSAMと共通内容 原ページがbrowser verification。著者・初公開日・最終版への書誌的な対応を確定できず、同一論文aliasを強制しない

検索方法。 41候補のURLを抽出し、arXiv abs(v1指定がある場合はv1)、JMLR、IJCAI、ACL Anthology、CVPR/NeurIPS、OpenReviewを直接openした。OpenReviewのverification/429とCVFの403は、同題論文のarXiv・会議公開PDFで補った。取得不能を論文不存在とは解釈していない。追加で以下のクエリを実行した。

  1. site:openreview.net "H1MczcgR-"
  2. site:openreview.net "vDeh2yxTvuh"
  3. site:openreview.net "htUvh7xPoa"
  4. site:openreview.net "PYSktOGKBkY"
  5. "Understanding Short-Horizon Bias in Stochastic Meta-Optimization"
  6. "When Do Flat Minima Optimizers Work?"
  7. "Random Sharpness-Aware Minimization"
  8. "Provable Sharpness-Aware Minimization with Adaptive Learning Rate"
  9. "When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations"
  10. "Sharpness-Aware Minimization in Large-Batch Training: Training Vision Transformer In Minutes"
  11. "Towards Efficient and Scalable Sharpness-Aware Minimization" arxiv
  12. "Sharpness-Aware Minimization in Large-Batch Training" site:openreview.net
  13. "Provable Sharpness-Aware Minimization with Adaptive Learning Rate" site:openreview.net/forum

未確定2件は引用の存在と要旨は回収できているが、完全な書誌照合済み件数には含めない。別URLから同じ論文へ辿れた場合の辞書は optimization-supplement-url-aliases.json に保存した。元ページの変更や主章への統合は本補遺では行っていない。

参考文献

全39件は一次要旨確認。論文題名・著者・年・公開先と要旨の範囲で再確認した。以下の意義は短い読みどころであり、著者の性能報告を全設定へ一般化するものではない。


追加照合:既存メモに残っていた数理・分散最適化の関連研究

この補遺は、既存contentの引用URL照合から追加した29件を対象にする。確認日は2026-10-03。既存のOP・MD文献と同一の別URLは新規文献として重複計上せず、別ファイルのalias辞書へ記録した。次の要約は要旨・書誌を中心とする確認であり、各論文の全証明を再検証したものではない。

大batchの性能、適応batch、cluster scheduling

大batchの比較では、batch以外に何を固定するかが結論を変える。Shallue et al.は35 workloadsを含む大規模な測定から、必要な訓練step数とbatchの関係がモデル・訓練法・データで大きく異なり、文献間のgeneralization gapの相違がtuningと計算budgetの違いで説明され得ると報告した。この実験範囲での観測を「すべてのtaskでbatchは汎化へ影響しない」という普遍則へ広げるべきではない。OB002

LANSはLAMB系の層ごとの適応を発展させ、更新とscheduleを組み合わせてBERT事前学習を高速化した。題名の54分は特定のAWS構成・batch・評価閾値に対する計測であり、optimizerのみの速度比ではない。著者がtechnical reportと明記しているため、採択会議名は付与しない。OB003

Bollapragada et al.のadaptive samplingは、勾配の内積に関するtestによってsample数を増やし、探索方向の信頼性を制御する。強凸での線形収束と非凸での収束を議論しているが、実際の大規模訓練ではtest用の分散推定・追加sampleのコストも必要になる。OB004 この流れをAdaGrad/AdaGradNormへ移したAdAdaGradは、batchと座標ごとの適応の相互作用を扱う。2026年8月改訂の要旨は、smooth非凸問題での高確率の一次停留点へのrateを述べる。ただしiterationに関するrateをgradient評価総数のrateと同一視できない。元メモの「Vision and Language Models」という記述に対し、今回確認した要旨の実証はimage classificationであり、言語モデル実験の存在までは確認していない。OB005

一方、ONESはbatchを訓練algorithm内だけで決めず、共有GPU clusterのjob schedulingと結び付ける。評価軸は単一jobのstep数より平均job完了時間・GPU利用率である。OB006 He et al.のsurveyは、この精度・通信・memoryの関係を横断する入口となる。ただし2021年時点のレビューであり、その後のLLM用optimizerやdistributed trainingまで更新された資料ではない。OB007 EXTRAP-SGDは、大batchの勾配計算位置にextragradientを導入し、訓練軌道を安定化する別の方向である。ResNet・LSTM・Transformerの報告があるが、追加の勾配計算を含む同一budgetで比較する必要がある。OB013

sign更新、noise、scaleを結ぶ学習ダイナミクス

Balles et al.はsign gradient descentを$\ell_\infty$ノルムのsteepest descentとして捉え、separable smoothnessとの関係を整理した。Hessianの対角集中や最大固有値と平均固有値の差が、sign更新が有利になる条件の理解に関係する。これは「符号だけでも常に同じ情報を保持する」という意味ではない。OB008

Xiao et al.は高次元極限のリスク曲線をSDE/ODEで記述し、effective learning rate、diagonal preconditioning、noise compression、noise reshapingを分けて定量化した。ICML 2025刊行版と2026年3月のarXiv改訂を区別した。Adamへの拡張は要旨でもconjectureとされ、signSGDの定理をAdamの保証として引用できない。OB010

Luo et al.は、SGD中のnetwork Lipschitz量の変化を、勾配flowとnoise、operator normに関するJacobian/Hessianへの射影から分析する。2025年のpreprintであり、要旨確認から任意のarchitectureの実際の最小Lipschitz定数が正確に求まるとは言えない。OB009 Qiu et al.のscaling collapseは、compute-optimalに訓練された異なるsizeのloss曲線を終点で正規化すると一致する観測を整理し、learning-rate decay下のsupercollapseを示す。適切にscaleされたhyperparameterの診断には有望だが、全training runの普遍的な曲線一致を主張する結果ではない。OB011

Local SGDの周辺:分散graph、buffer、局所適応

Local SGDの周期平均、decentralized SGDの近傍混合、Federated Learningの部分参加・不均衡は、別の設計軸である。D-PSGDは中央nodeの通信bottleneckを減らせる領域を示し、低帯域・高latencyの構成での実証を行った。高速networkと現代的all-reduce環境まで同じ優位性が自動的に続くわけではない。OB012

CHOCOでは二つの収束を区別する必要がある。平均合意のCHOCO-GOSSIPは、連結性とcompression品質に依存した線形収束を持つ。一方、CHOCO-SGDは強凸確率最適化として、反復数・worker数に加えてmixing matrixの連結性とcompression品質に依存した収束率を持つ。gossipの線形収束を、そのまま確率最適化全体のrateとして要約しない。arXiv初稿と刊行版では要旨の記号にも差があるため、定理の定数・次数を使う際は引用する版を固定する。OB018

BMUFは音声認識のLSTM・DNNでblockwise model-update filteringを導入した先行研究である。著者所属機関の要旨で対象model・GPU数を確認した。元メモのような単なる「block内平均、block間平均」という記述だけでは、update filteringとmomentumの役割が落ちるため、実装時には原論文の更新式を確認する必要がある。OB019 DeDLOCは、参加者の帯域・hardwareが揃わないopen collaborationでの計算と通信を設計し、SwAV・ALBERTや40参加者の訓練を報告した。要旨確認の範囲で、通信の非同期化とmodel更新のstalenessを同一視しない。元メモには「同期」「非同期」が混在しているため、独立したalgorithm項目として原文で確認するべき箇所が残る。OB014

FedSPS系のLocally Adaptive Federated Learningは、clientごとに異なるstep sizeでlocal geometryを利用する。理論は凸・強凸やinterpolationに関連する条件を扱い、非凸networkでの改善は実証として分けられる。著者はMukherjee, Loizou, Stichの3名であり、元メモから第一著者が抜けていた。OB015 Fed-LAMBは層ごとの適応をFLへ加える方向で、arXivは2021年、正式版はUAI 2023となる。IID/non-IIDでの改善報告を、任意のheterogeneityに対する保証へ一般化しない。OB016 FedBuffは到着したclient updateをbuffer単位にまとめ、非同期性とSecure Aggregationの両立を図る。buffer、client参加、staleness、privacy設定が評価に影響するので、非同期Local SGDと同じ名称でまとめるより、集約単位とprotocolを記録する。OB017

Natural gradient、Shampoo、CG、dampingを接続する

Martensの長いレビューは、natural gradientをFisherを使った二次法として捉え、GGNとの一致条件、trust region、Tikhonov damping、empirical Fisherの問題、再parameterizationへの近似的な不変性を整理する。自然勾配を使えば離散stepや近似Fisherまで完全に座標不変になる、とは限らない。OB001

Morwani et al.のICLR 2025論文は、Shampooの近似そのものと、最適Kronecker近似を求めるpower iterationの関係を明確にした。要旨の重要な限定は、Shampoo側の近似の二乗が、対象Kronecker近似を計算するpower iterationの1 stepと対応することである。「ShampooがHessianの最適Kronecker近似を直接計算する」と短縮すると意味が変わる。さらにbatch gradientとempirical Fisherが近似品質へ与える影響も扱っている。OB020

日本語資料では、矢部の「共役勾配法」は共役性、正定値二次問題と非線形拡張を追う入口になる。有限回停止の性質は、対称正定値の線形問題とexact arithmeticを前提に読む。OB028 八巻・矢部の「非線形計画法(3)」は旧リンクが学会archiveへ移動していた。元メモの同一URLへの「応用統計学」というラベルは論文題名ではない。今回確認できたのは無制約最適化の学会解説の書誌である。OB029 本川・手塚のDEIM 2019論文は、Hessian-free法へmomentumとAdamの工夫を導入する研究会報告であり、一次資料の題名・著者・要旨を確認した。これをLM法やK-FACそのものの提案論文とは区別して読む。OB027

Bilevelの統計、NAS、IRM、多段化

Bao et al.はbilevelの最適化誤差だけでなく、validation setに対するuniform stabilityからhyperparameter選択の期待汎化誤差を分析した。outer/inner双方の正則化がvalidationへの過適合を和らげるという方向を示す。validation lossを最小化する手順にも、同じvalidation dataを反復して使うことによる統計的な問題がある。OB021

DARTSはarchitectureの離散探索を連続緩和し、gradientを用いて構造を学習する代表例である。連続緩和した問題、有限stepで近似する内側訓練、最後に離散化したarchitectureの性能はそれぞれ異なる対象であり、一つの最適化の成功で三つが同時に保証されるわけではない。OB022 Sato et al.は、内側問題を有限回の最急降下更新に置き換える発想を$n$段へ拡張し、適切な条件で元のmultilevel問題への漸近的な接続を論じた。有限展開長での誤差と、段数増加による微分・memory負担が実装上の論点になる。OB026

IRM周辺では、Huh and BaidyaのMRIは$\mathbb E_e[f(x)\mid y]$の環境間不変性を使い、一般線形問題で十分な環境数がある場合の保証を示した。要旨にある非線形画像実験と、この線形の保証を分けて扱う。OB024 Zhang et al.はbatch sizeと評価環境の選択、ensembleを単一predictorへまとめる問題を再検討し、consensus制約付きbilevelとしてIRMの変種を設計した。未知の環境に対する不変性を一つのtest環境だけで判断する問題に注意を向ける。OB025

既存bilevelページのModel-based RL surveyは、model learningとplanningの相互作用を広く扱う資料である。二つのsubroutineがあるというだけではbilevel最適化にならず、outer目的がinnerの解にどう依存し、どこまで微分・最適化するかが分類基準になる。OB023 同ページのLatent Diffusion Modelsは、この補遺では重複登録せず、生成モデル章のMD93へ統合した。

この補遺から読む順序

大batchはShallue → adaptive sampling → AdAdaGradを読み、LANS/ONESをalgorithmとhardwareの組合せとして比較する。Local SGDは中央平均・近傍混合・非同期buffer・局所適応の四軸を固定してからD-PSGD/CHOCO/FedBuff/FedSPSへ進む。曲率はMartens → Shampooの近似解析 → CG/dampingの順がよい。BilevelはDARTSの具体例 → stabilityによるvalidation過適合 → multilevelへの拡張を読むと、最適化と汎化の論点を分けやすい。

補遺参考文献

年は確認できた正式版の年、またはarXiv初稿年。要旨確認は書誌と著者・出版社・会議の要旨を確認した意味であり、全条件の読解を意味しない。