深層学習の最適化サーベイ:幾何・バッチ・学習率・分散学習(2026年10月)

総合索引 · 並列学習とモデル統合 · 統合参考文献

深層学習の最適化:2026年10月再サーベイ

対象は既存の最適化12ページと関連プロジェクトである。文献の公開日上限は 2026年10月3日。 ここでの「新しい」は初出年を指し、2025年論文の2026年改訂・採択は区別する。 網羅を目指した分野横断のレビューであり、全データベースの全論文を取得したsystematic reviewではない。 参考文献の「本文」は該当節を確認した意味であり、全証明の独立検算や実験追試を意味しない。

関連研究の補遺では、旧メモの引用を追加照合し、SAM派生法、学習率探索、適応batch、分散graph、bilevelの統計的性質を詳しく扱う。本文のOP文献と併せて、補遺のOA・OB文献も統合台帳に収録した。

1. 全体像:何を改善しているのか

深層学習の最適化は、方向、尺度、確率的ノイズ、停止時刻、通信の設計が絡み合う。 同じ更新回数でもサンプル数や時間は異なり、同じ検証損失でもOOD性能や校正は一致しない。 したがって「収束が速い」を次の四つに分解する必要がある。 この整理の基礎は大規模最適化総説、optimizer比較の再検討、AlgoPerfである。OP069 OP004 OP005

評価軸 測るもの よくある交絡
最適化の効率 勾配ノルム・訓練損失が目標に達する更新回数 目標値、異なる目的関数
データ・計算の効率 targetまでのtoken数、sample数、FLOPs バッチサイズ、再利用データ
実時間の効率 同一hardwareでのtime-to-target kernel、通信、checkpoint、試行錯誤
統計的性能 検証損失、転移、OOD、校正 model selection、データ汚染、評価分布
時期 中心問題 主要な流れ
1940–1990年代 曲率・条件数・確率近似 LM、CG、自然勾配
2011–2018 座標ごとの尺度とメモリ AdaGrad → Adam → AdamW、Adafactor
2015–2023 非対角構造を安く使う K-FAC、Shampoo、分散実装
2017–2021 大バッチの有効範囲 warmup、LARS/LAMB、noise scale、再調整したbaseline
2018–2024 通信と平均化 Local SGD、SlowMo、FedOpt、DiLoCo
2020–2024 汎化と学習軌跡 SAM、hypergradient、Schedule-Free
2024–2026 行列幾何とhardwareの協調 SOAP、Muon、Polar Express、Dion、KL-Shampoo、非同期DiLoCo

この年表は優劣の順位ではなく、後述の参考文献を統合した研究系譜である。

2. SGD・Adam系:適応性と比較の公平性

期待損失を $f(\theta)=\mathbb E_\xi[\ell(\theta;\xi)]$ とすると、SGDはミニバッチ勾配 $g_t$ を使って $\theta_{t+1}=\theta_t-\eta_t g_t$ と更新する。 momentumは履歴を平滑化し、AdaGradは座標別の累積二乗勾配を使う。 Adamは一次・二次モーメントを指数移動平均し、初期値ゼロに由来するbiasを補正する。 二次モーメントはHessianの二階微分と同じではない。OP069 OP078 OP001

AdamWはweight decayを適応的前処理から分離する。AdamにL2項を加えたものと一般には同一でない。 またAdam原論文の収束主張を無条件の保証として引用できない。Reddiらの反例とAMSGradは、 指数移動平均の扱いと仮定の重要性を示した。OP048 OP079

メモリと表現の変更。 Adafactorは行・列統計から行列の座標別二次モーメントを近似する。 Lionは探索された更新式を符号ベースに簡素化し、momentumの状態を保持する。 Lionの少ない状態量や特定条件での性能向上は、任意のモデルでAdamWを置き換えれば速くなることを意味しない。 特に符号化後の更新ノルムが異なるため、学習率を同じ数値に固定する比較は不適切である。OP002 OP003

別の適応法も比較対象に残す。 Sophiaは低頻度の対角Hessian推定とclipを組み合わせる。原論文のGPT実験での高速化を、任意の大規模モデルでの保証に拡張しない。OP088 ProdigyはD-Adaptationを発展させ、解までの距離の推定を通じて学習率の調整を減らす。parameter-freeという名称は、モデル・初期化・正則化などの選択が消えるという意味ではない。OP089 ADOPTは二次モーメントへの現在の勾配の混入とmomentum・正規化の順序を変更し、Adamの収束問題に別の方法で対処する。論文の仮定下の収束率と、全タスクでの性能優位は区別する。OP090 PSGDはパラメータ摂動と勾配摂動の関係から前処理を推定する系譜であり、二乗勾配蓄積やFisher近似だけが前処理の選択肢ではない。OP091

必読の比較研究。 Choiらは探索空間によってoptimizer順位が変わることを、 NadoらはLARS/LAMBの優位が十分に調整した標準手法との比較で変わることを示した。 AlgoPerfは「更新式」だけでなく、チューニング、停止基準、hardwareを含む訓練アルゴリズムを評価する。 論文では最良runだけでなく探索予算と失敗runを含めて読む。OP004 OP026 OP005

3. 自然勾配・Fisher・K-FAC

自然勾配は、モデル分布の局所的なKL距離に基づく幾何を利用する。 非特異なFisher行列 $F$ の下で方向は $-F^{-1}g$ であり、実装では通常dampingや近似が必要になる。 座標不変性は理想化された自然勾配の性質であり、有限step、近似、dampingの追加後にすべて保存されるとは限らない。 原点はAmari、実用化の重要な節目はK-FACである。OP080 OP015

線形層の活性 $a$ と出力側のscore derivative $\delta$ に対して、Fisherの層blockを

\[F_{\mathrm{layer}} =\mathbb E[(aa^\top)\otimes(\delta\delta^\top)] \approx \mathbb E[aa^\top]\otimes\mathbb E[\delta\delta^\top]\]

と近似するのが基本的な考え方である。期待値の積への置換は一般には等式ではない。 model Fisher、観測ラベルによるempirical Fisher、generalized Gauss–Newton、Hessianを区別すること が再現の前提となる。これらの詳細は数理・学習ダイナミクス章も参照。 K-FAC原論文を起点に、畳み込みへのKFC、weight sharingを扱うexpand/reduceへ進むと、 「各層でKronecker積を取れば終わり」という理解を避けられる。OP015 OP016 OP017

2026年の関連研究K-FADEは、Gauss–Newton/K-FACをLLM unlearningへ利用する。 これは曲率情報の用途がpretraining速度だけに限られない例である。 forget benchmark上の出力抑制と、すべての攻撃に対する不可逆な忘却保証は別の主張である。 本稿ではabstractで確認した範囲の紹介に留める。OP077

4. CG・damping・Hessian-free:線形代数と学習則を分ける

CGは対称正定値行列 $A$ に対する $Ax=b$ の反復解法である。 厳密演算では高々次元数のstepで解けるが、浮動小数点演算、非正定値性、確率的な行列変化のある実装に そのまま有限終了保証を持ち込めない。非線形CGと、Newton部分問題を解く線形CGも区別する。OP081 OP084

Hessian-free法はHessianを保存せず、行列vector積とCGで局所二次問題を近似的に解く。 逆行列を陽に形成しないことと、曲率を使わないことは同義ではない。 負曲率への対応、CG停止条件、damping、曲率推定batchを含む算法である。OP084

非線形最小二乗 $ \frac12|r(\theta)|^2 $ に対し、LMの代表形は

\[(J^\top J+\lambda I)\Delta=-J^\top r.\]

Gauss–Newtonにdampingを加えて不安定な方向を抑える。 一般の二次モデルでは $(B+\lambda I)\Delta=-g$ と書けるが、 不定な $B$ は単に $\lambda>0$ としただけで正定値になるとは限らない。 Levenberg(1944)とMarquardt(1963)の書誌を確認し、 現代の深層学習での使い方はMartensの本文を確認した。OP082 OP083 OP084

Tikhonovとの関係。 step $\Delta$ に対する二次罰則と、パラメータ $\theta$ に対するL2正則化は 目的が異なる。dampingは局所モデルの信用度・数値安定性、weight decayは訓練の更新規則を変える。 K-FACでのfactor別dampingとfull matrixへの $\lambda I$ の追加も一般には同一でない。 この区別がdamping schedule研究の起点となる。OP015 OP048

5. Shampoo → SOAP → KL-Shampoo

行列勾配 $G_t\in\mathbb R^{m\times n}$ に対する元のShampooを簡略化すると、

\[L_t=\epsilon I+\sum_{s\le t}G_sG_s^\top,\qquad R_t=\epsilon I+\sum_{s\le t}G_s^\top G_s,\qquad \Delta W_t=-\eta L_t^{-1/4}G_tR_t^{-1/4}.\]

これはgradient統計から構造を持つ前処理を作るもので、Hessianそのものを計算する方式ではない。 元論文の凸解析、深層学習の経験的性能、EMAやgraftingを含む実装を分ける。 Anilらは大規模化、Shiらは分散実装の費用を含む評価に重要である。OP006 OP007 OP057

SOAPはShampooの固有基底でAdamを適用する。 「ShampooとAdafactorの等価性」には、指数を1/2に変える、scalar補正、dataset期待値を使う等の条件がある。 元の1/4乗Shampoo全般や、更新頻度を落とした実用EMA版の完全等価性ではない。 SOAP本文§4.1は、この理想化と実装の差を明示している。OP008

歴史上の注意として、SOAP本文§3はAnilら(2020)のAppendix Bに近い2次元算法の先行記載があることも認めている。原SOAP論文のthroughput評価は単一H100とgradient accumulationを使った条件であり、分散系全体の速度保証として扱わない。OP007 OP008

KL-Shampoo/KL-SOAPは、構造化共分散推定をFrobenius距離だけでなくKL最小化から見直す。 2025年初出、2026年ICLR版および拡張版という位置づけで、 Adam graftingに依存しない構造化optimizerの設計を示す。 「SOAPがShampooの最終形」という理解は更新が必要である。OP066

手法 利用する構造 主な追加費用 解釈上の注意
AdamW 座標別二次モーメント parameterと同規模の状態 非対角相関を直接表さない
K-FAC Fisher blockのKronecker近似 活性・derivative統計、逆行列更新 model/empirical Fisherを区別
Shampoo gradientの行・列等の二次モーメント matrix rootと状態・通信 Hessianと自動的に同一ではない
SOAP 学習される基底+座標適応 基底更新、状態の扱い 特殊条件での等価性と実装を分離
Muon momentum行列のpolar方向 行列積による近似 通常の曲率推定を保持しない

6. Muon:歴史・幾何・実装・2026年の分岐

6.1 直交化の系譜

行列ノルムを使う最適化はMuon以前からある。Carlsonらのstochastic spectral descent、 Tuddenhamらのgradient直交化、Bernstein–Newhouseのnormによる再解釈を経て、 Jordanの2024年技術記事がmomentum後の直交化と低精度行列積による実装を結び付けた。 Orthogonal-SGDMのarXiv初出は2022年であり、既存記事の年表にある2020年表記は採用しない。 提案者記事は重要な一次資料だが、査読付きの普遍的優位性証明とは区別する。OP085 OP070 OP018 OP086

行列勾配 $G=U_r\Sigma_rV_r^\top$ に対する線形化問題では、

\[\min_{\|\Delta\|_2\le\eta}\langle G,\Delta\rangle=-\eta\|G\|_*, \qquad \Delta^\star=-\eta U_rV_r^\top\]

が成り立つ。ここで $|\cdot|2$ は行列のspectral norm、$|\cdot|*$ はnuclear normである。 Frobenius球の解は $-\eta G/|G|_F$($G\neq0$)。 これらはノルム球内の一次モデルの解であり、一般損失の大域最適性ではない。OP018

rank欠損ではcompact SVDの $U_rV_r^\top$ はpartial isometryであり、 全空間での半直交拡張は一般に一意でない。零勾配の正規化も別処理が必要になる。 またこの導出で $G$ をmomentumに置き換えた更新は、現在の勾配の厳密な最急降下とは限らない。

6.2 有限反復と「収束」の違い

よく使われるquintic反復の特異値多項式は $\phi(s)=3.4445s-4.7750s^3+2.0315s^5$ である。 係数和は0.701なので、1は不動点ではない。 したがって「この係数を5回回せば厳密polar factorに収束する」ではなく、 少ない反復で有用な近似を得る設計である。 零特異値は零のままで、有限精度の品質も別途評価すべきである。OP086

Polar Expressは反復ごとに多項式を設計し、計算効率と極分解近似の誤差を扱う。 これは行列subroutineの改善であり、その収束をそのまま非凸学習全体の収束と読み替えない。OP019

6.3 大規模化と派生法

文献 改善する箇所 検証の範囲と読む意味
Liuら、2025 weight decayと更新scale Moonlightを含むLLM大規模化の重要な実験資料 OP009
Essential AI、2025 large batchとcompute/timeの関係 4Bまでの報告、$\mu P$との組合せ。CBSの定義を確認 OP010
Dion、2025 shardingと低rank更新 error feedbackとrank fractionが追加の比較軸 OP044
NorMuon、2025 行・neuronごとの正規化 直交化と適応学習率の組合せ OP020
Muon²、2026 直交化前の二次モーメント前処理 少ないNS反復を狙う。元Muonと状態量が違う OP058
Khonaら、2026 SOAPの安定化・layer単位分散・更新RMS 大規模dense/MoEでの比較条件を本文§5で確認 OP014
Dion3、2026 Gram NS、kernel、部分行選択、通信 optimizer stepの高速化とend-to-end時間を分ける OP059

Khonaらの本文は、8B dense、3B active/30B MoE、8B active/72B hybrid MoE、 1T・3T tokenの設定を記載する。 比較ではupdate RMSを揃え、元記事と異なりNesterovの改善を観察せずEMAを使っている。 この差は「同じMuon」という名称だけでは再現条件が決まらない好例である。 batch最大100M tokensというabstractの報告を、すべての条件での推奨値としない。OP014

6.4 収束解析が一致しないように見える理由

文献 対象・主張 過剰な読み替えを避ける点
Sato・Naganuma・Iiduka、2025初出、2026年6月v5 smoothness、不偏性、分散上界等の下の評価とCBS下界 固定step/batchの残差項、停止proxy、未知のrank/varianceに注意 OP011
Do・Dereich・Jentzen、2026年8月 generalized NSを含む確率問題の非収束例と誤差解析 一部の問題での反例は全LLMでの無効性ではない。abstract確認 OP012
de Oliveiraら、2026年9月 正則化されたsoft-sign variantと有界前処理、適切な設定での漸近保証 通常の有限NS実装すべての保証ではない。PL下の線形率を一般非凸へ拡張しない OP013

Satoらv5のCBSはSFO計算量 $bT_\epsilon(b)$ を使う解析であり、 絶対的な最適batchを測定不要で予言する式ではない。 実験のtarget validation loss、gradient-norm停止、一定token数での最終lossは異なる指標である。 近似polar、weight decayの定義、Nesterovの順序、AdamWとのhybrid構成まで揃えて比較する。OP011

7. Large-batch trainingとcritical batch size

Goyalらのlinear scalingとwarmupはImageNet/ResNet設定での成功例である。 LARSは層別のnorm比、LAMBはAdam型更新と層別適応を組み合わせる。 これらの速度記録はhardwareと訓練recipeを含む。 大バッチの一般化ギャップを「常にlarge batchだから悪い」とも 「必ず専用optimizerが必要」とも言えない。OP021 OP024 OP025 OP026

ミニバッチ勾配の平均を $g$、一標本勾配の共分散を $\Sigma$ とすると、 独立標本の近似で分散は $\Sigma/B$ になる。 単純なnoise-scale proxyは

\[B_{\mathrm{noise}}\approx\frac{\operatorname{tr}\Sigma}{\|g\|^2}\]

である。ただし曲率や前処理を含む評価では対応する重み付き量が必要になり、 samplingの相関、有限データ、momentum、学習中の変化も効く。 McCandlishらの経験モデルとZhangらのnoisy quadratic modelを続けて読むと、 CBSがデータセットだけで決まる定数ではないことが分かる。OP022 OP023

2025–2026年のMuon/SOAP実験はlarge batchを再び重要な設計軸にしたが、 以下を同時に記録しないCBS比較は解釈しにくい。OP010 OP011 OP014

8. 学習率:scale・shape・horizon・平均化

学習率の数値だけを比較せず、最大値、形状、終了時刻、warmup、平均化を分ける。

系列 主なアイデア 限界・関連
SGDR cosineとwarm restart optimizer状態のrestartとは区別 OP039
batch増加 LR減衰に代えてnoiseを調整 全optimizer・全領域で厳密同値ではない OP040
hypergradient LRへの微分をonline計算 hyper-LRと短い近似のbiasが残る OP053
WSD stable区間から最後にcooldown horizon拡張が容易でもpeak LRが不要にはならない OP029
Schedule-Free scheduleとiterate averagingの関係を利用 LRやmomentumの選択、訓練/評価iterateは残る OP027
理論に基づくtransfer 凸上界と実測曲線の対応を利用 LLMが凸であるという証明ではない OP028

2026年の三つの進展。 Liらはpower-law kernel regressionのFSL設定で、 task/sourceとcapacityの指数によって早いpower decayとWSD型が分かれることを解析した。 Chae–KimはSchedule-Free GD/SGDのsmooth nonconvex解析を進めた。 Ma–ChenのWSqDはinverse-square-rootのbaseとterminal cooldownを組み合わせる。 WSqDのbaseはhorizonに依存しなくても、cooldown開始には終了時刻が必要である。 いずれも理論の対象とLLM実験を分けて読む。OP041 OP042 OP043

学習されたoptimizer。 reversible learning、forward/reverse hypergradient、 LSTM optimizer、RLによる更新式探索、PBTは、shapeや更新式そのものを探索対象にした。 PBTのpopulationコストや、meta-trainingと異なる長さ・モデルへの転移を含めて比較する。 短い代理タスクでの改善だけでは大規模pretrainingでの改善を確定できない。OP049 OP050 OP055 OP056 OP054

9. SAM:flatnessだけで汎化を説明しない

SAMの理想化された目的は

\[\min_w\max_{\|\epsilon\|_2\le\rho} L(w+\epsilon).\]

実装はinner最大化を一次近似し、その摂動点でouter勾配を評価する。 通常のSAMと正確なmin–max解は異なり、追加のforward/backward計算が必要になる。 またDinhらの再パラメータ化の反例から、単なるsharpness数値を座標に依存しない汎化説明と見なせない。OP045 OP074

研究 何を明らかにするか 読み方
ASAM scale変換を考慮した摂動領域 選ぶnormと座標系を明示する OP087
Wenら 異なるsharpness定義と実際のSAM dynamics full/stochastic batchを区別 OP047
Andriushchenkoら feature rank低下 低rankがいつも望ましいとは限らない OP046
Muellerら normalizationパラメータのみの摂動 全パラメータflatnessが唯一の機構という説明を再検討 OP062
Bahriら language-model generalization task、finetuning、データ量を固定して比較 OP060
logits-SAM、2026 DPOのlogit dynamicsと選好確率の低下 パラメータ全体のSAMと同一ではない OP061

SAMをOODへ使う際は、IID accuracy、group worst-case、calibrationを別評価する。 同じloss geometryでも表現やデータの偏りによって評価が変わり得る。 これは汎化章との接続点である。

10. 二段階最適化:implicit differentiationから一次法へ

基本形は

\[\min_x F(x,y^*(x)),\qquad y^*(x)\in\arg\min_y f(x,y).\]

inner解が局所的に一意で、十分滑らかかつ $H_{yy}=\nabla^2_{yy}f$ が可逆なら、

\[\nabla_x F(x,y^*(x)) =F_x-f_{xy}H_{yy}^{-1}F_y.\]

inverseを陽に作らず線形方程式をCG等で近似できる。 しかしinnerに複数の解がある場合や非滑らかな場合、 この式を無条件で適用して大域的best responseを得たとは言えない。 重要な基礎はFranceschiら、Grazziら、Jiらと統一的総説である。OP051 OP064 OP063 OP073

方法 費用と利点 主要な仮定・誤差
unrolling / iterative differentiation inner軌跡の微分 保存メモリ、truncation bias
approximate implicit differentiation HVP/線形solver inner残差、可逆性、solver誤差
BOME first-order制約・value-function型 条件付きのstationarity、global optimumではない
F2SA Hessian oracle不要 問題設定・ノイズ条件ごとの複雑度

BOMEとF2SAは二階情報を避ける方向だが、 first-orderであることと、一般のnonconvex inner問題を完全に解けることは別である。OP071 OP065

2026年は、下位問題をregularized zero-sum Markov gameとするPANDAと、 weakly convex lower levelのrelaxed Moreau-gapを扱うIVSPまで確認した。 後者のKKT保証は正のrelaxationとconstraint qualificationに依存し、 元の非凸bilevel問題の大域最適解保証ではない。 直近preprintはabstract確認に基づく位置づけであり、証明全体の評価は残る。OP076 OP075

GANとの境界。 TTURの二つの時間尺度、Nash equilibrium、Stackelbergのbest response、 bilevel hypergradientは同じ概念ではない。 GANの回転的dynamicsにはoptimistic/extragradient系が関連する。 TTURを単に「二段階学習なら何でも保証する手法」と扱わない。OP072 OP052

11. Local SGD・Federated learning・DiLoCo

worker $k$ が共通値 $w^t$ から $H$ 回の局所更新を行い、 $w_k^{t,H}$ を集約するのが基本構造である。 $H=1$、同じ初期状態、適切なsample weightなどの条件では同期minibatch更新に近づくが、 $H>1$ ではworkerが異なる点で勾配を計算する。 単にall-reduceを減らしただけの同一algorithmではない。OP030 OP036

段階 主要研究 何が変わったか
clientデータでの局所平均 FedAvg 非IID・部分参加を含む学習設定 OP036
通信削減の理論 Stich convex等の仮定で局所stepと通信回数を解析 OP030
大バッチと汎化 Post-local SGD 訓練後半をlocal化するrecipe OP031
outer momentum SlowMo 通信の間に局所更新しglobal側を加速 OP032
client driftと適応 SCAFFOLD / FedOpt control variate、server optimizer OP038 OP037
LLM DiLoCo inner AdamW、outer Nesterov、長い局所区間 OP033
非同期と遅延 Liuら stale updateとmomentumの干渉 OP034
障害・straggler耐性 Decoupled DiLoCo、2026 独立learner、非同期fragment集約 OP035
低rank / merging LoRDO / IsoLoCo、2026 通信とoptimizer state、集約方向を同時設計 OP068 OP067

DiLoCoの通信削減倍率は、集約頻度、payload、モデル、到達損失の条件付きで読む。 Decoupled DiLoCoについて、実機訓練と大量chipの障害simulationは別の証拠である。 非同期方式では速いworkerのデータが多く反映される可能性もあり、 throughputに加え学習分布・token重み・stalenessを評価する必要がある。OP033 OP034 OP035

LoRDOは低rank空間への固定化を避ける更新を加え、IsoLoCoはmodel mergingの集約をDiLoCoへ接続する。 いずれも公開実験での改善であり、任意のworker数・データheterogeneity・ネットワークでの優位とはしない。 これらは2026年に最適化幾何、通信、モデル統合が接近していることを示す具体例である。OP068 OP067

12. 研究課題と読む順序

以下は参考文献を総合した研究上の提案であり、既存論文がすでに解決した結果ではない。

  1. 非Euclidean CBS。 noise covariance、effective rank、前処理、停止基準を結び付ける。 proxyのCBSとwall-clock最適batchの差を、統計誤差とsystem費用に分解する。
  2. 近似直交化の必要精度。 NS誤差、低precision、momentum、rank圧縮を別々にablateし、 直交度とloss改善の相関を因果的説明と混同しない。
  3. scheduleとoptimizerの共設計。 Muon/AdamWごとのscale transferと WSD/Schedule-Freeの比較を、同一token予算・同一targetの両方で行う。
  4. IID外の評価。 訓練速度の改善が校正、rare token、subgroup、OODにどう影響するかを測る。
  5. 分散比較。 local step、worker数、通信payload、故障率、消費FLOPs、 time-to-targetを同時記録する。

推奨する読む順序は、Bottouら → Adam/AdamW → Choi/AlgoPerf → Amari/K-FAC → Shampoo/SOAP → Old Optimizer, New Norm/Muon → McCandlish/Zhang → Muon大規模比較と2026年理論 → Schedule-Free/WSD → Local SGD/DiLoCoである。 SAM、bilevelは別枝として、目的関数・保証・計算費用の違いを確認しながら読む。

13. 既存メモからの訂正・保留

元メモの論点 本サーベイの扱い
Muon本文の「5step以内で収束」 有限反復近似と漸近収束を区別。旧ページ内の先行補足と後段の表現の不一致を解消
Shampooを一律にHessian二階法と説明 gradient二次モーメントの構造化前処理として説明
Orthogonal-SGDM年表の2020/2022混在 確認したarXiv初出2022を採用
LBTの「Don’t increase batch size decrease LR」 原題は Don’t Decay the Learning Rate, Increase the Batch Size
CGが必ず次元数以内に収束 SPD・厳密演算の前提を明記
Muon CBSの「最適batchを導く」 2026 v5の下界、停止proxy、未知定数を明示
二段階最適化の一般的収束主張 inner構造、局所性、regularity、equilibrium概念を分ける
「二段階」で訓練するLDM等をそのままbilevelの例にする 一方の最適解を他方の目的へ代入・微分する構造の有無を確認して採否を決める

既存ページのリンク集すべてを検証済みとして引き継いでいない。 追加確認対象は既存文献の棚卸しに残す。

参考文献

年は原則として確認した初出年、会議名は確認できたもののみ記す。 本文=関連する本文節を確認、要旨=一次資料の要旨と書誌を確認、 書誌=本文・要旨の十分な確認なし、一次技術資料=提案者の技術記事。