深層学習の最適化サーベイ:幾何・バッチ・学習率・分散学習(2026年10月)
総合索引 · 並列学習とモデル統合 · 統合参考文献
深層学習の最適化:2026年10月再サーベイ
対象は既存の最適化12ページと関連プロジェクトである。文献の公開日上限は 2026年10月3日。 ここでの「新しい」は初出年を指し、2025年論文の2026年改訂・採択は区別する。 網羅を目指した分野横断のレビューであり、全データベースの全論文を取得したsystematic reviewではない。 参考文献の「本文」は該当節を確認した意味であり、全証明の独立検算や実験追試を意味しない。
関連研究の補遺では、旧メモの引用を追加照合し、SAM派生法、学習率探索、適応batch、分散graph、bilevelの統計的性質を詳しく扱う。本文のOP文献と併せて、補遺のOA・OB文献も統合台帳に収録した。
1. 全体像:何を改善しているのか
深層学習の最適化は、方向、尺度、確率的ノイズ、停止時刻、通信の設計が絡み合う。 同じ更新回数でもサンプル数や時間は異なり、同じ検証損失でもOOD性能や校正は一致しない。 したがって「収束が速い」を次の四つに分解する必要がある。 この整理の基礎は大規模最適化総説、optimizer比較の再検討、AlgoPerfである。OP069 OP004 OP005
| 評価軸 | 測るもの | よくある交絡 |
|---|---|---|
| 最適化の効率 | 勾配ノルム・訓練損失が目標に達する更新回数 | 目標値、異なる目的関数 |
| データ・計算の効率 | targetまでのtoken数、sample数、FLOPs | バッチサイズ、再利用データ |
| 実時間の効率 | 同一hardwareでのtime-to-target | kernel、通信、checkpoint、試行錯誤 |
| 統計的性能 | 検証損失、転移、OOD、校正 | model selection、データ汚染、評価分布 |
| 時期 | 中心問題 | 主要な流れ |
|---|---|---|
| 1940–1990年代 | 曲率・条件数・確率近似 | LM、CG、自然勾配 |
| 2011–2018 | 座標ごとの尺度とメモリ | AdaGrad → Adam → AdamW、Adafactor |
| 2015–2023 | 非対角構造を安く使う | K-FAC、Shampoo、分散実装 |
| 2017–2021 | 大バッチの有効範囲 | warmup、LARS/LAMB、noise scale、再調整したbaseline |
| 2018–2024 | 通信と平均化 | Local SGD、SlowMo、FedOpt、DiLoCo |
| 2020–2024 | 汎化と学習軌跡 | SAM、hypergradient、Schedule-Free |
| 2024–2026 | 行列幾何とhardwareの協調 | SOAP、Muon、Polar Express、Dion、KL-Shampoo、非同期DiLoCo |
この年表は優劣の順位ではなく、後述の参考文献を統合した研究系譜である。
2. SGD・Adam系:適応性と比較の公平性
期待損失を $f(\theta)=\mathbb E_\xi[\ell(\theta;\xi)]$ とすると、SGDはミニバッチ勾配 $g_t$ を使って $\theta_{t+1}=\theta_t-\eta_t g_t$ と更新する。 momentumは履歴を平滑化し、AdaGradは座標別の累積二乗勾配を使う。 Adamは一次・二次モーメントを指数移動平均し、初期値ゼロに由来するbiasを補正する。 二次モーメントはHessianの二階微分と同じではない。OP069 OP078 OP001
AdamWはweight decayを適応的前処理から分離する。AdamにL2項を加えたものと一般には同一でない。 またAdam原論文の収束主張を無条件の保証として引用できない。Reddiらの反例とAMSGradは、 指数移動平均の扱いと仮定の重要性を示した。OP048 OP079
メモリと表現の変更。 Adafactorは行・列統計から行列の座標別二次モーメントを近似する。 Lionは探索された更新式を符号ベースに簡素化し、momentumの状態を保持する。 Lionの少ない状態量や特定条件での性能向上は、任意のモデルでAdamWを置き換えれば速くなることを意味しない。 特に符号化後の更新ノルムが異なるため、学習率を同じ数値に固定する比較は不適切である。OP002 OP003
別の適応法も比較対象に残す。 Sophiaは低頻度の対角Hessian推定とclipを組み合わせる。原論文のGPT実験での高速化を、任意の大規模モデルでの保証に拡張しない。OP088 ProdigyはD-Adaptationを発展させ、解までの距離の推定を通じて学習率の調整を減らす。parameter-freeという名称は、モデル・初期化・正則化などの選択が消えるという意味ではない。OP089 ADOPTは二次モーメントへの現在の勾配の混入とmomentum・正規化の順序を変更し、Adamの収束問題に別の方法で対処する。論文の仮定下の収束率と、全タスクでの性能優位は区別する。OP090 PSGDはパラメータ摂動と勾配摂動の関係から前処理を推定する系譜であり、二乗勾配蓄積やFisher近似だけが前処理の選択肢ではない。OP091
必読の比較研究。 Choiらは探索空間によってoptimizer順位が変わることを、 NadoらはLARS/LAMBの優位が十分に調整した標準手法との比較で変わることを示した。 AlgoPerfは「更新式」だけでなく、チューニング、停止基準、hardwareを含む訓練アルゴリズムを評価する。 論文では最良runだけでなく探索予算と失敗runを含めて読む。OP004 OP026 OP005
3. 自然勾配・Fisher・K-FAC
自然勾配は、モデル分布の局所的なKL距離に基づく幾何を利用する。 非特異なFisher行列 $F$ の下で方向は $-F^{-1}g$ であり、実装では通常dampingや近似が必要になる。 座標不変性は理想化された自然勾配の性質であり、有限step、近似、dampingの追加後にすべて保存されるとは限らない。 原点はAmari、実用化の重要な節目はK-FACである。OP080 OP015
線形層の活性 $a$ と出力側のscore derivative $\delta$ に対して、Fisherの層blockを
\[F_{\mathrm{layer}} =\mathbb E[(aa^\top)\otimes(\delta\delta^\top)] \approx \mathbb E[aa^\top]\otimes\mathbb E[\delta\delta^\top]\]と近似するのが基本的な考え方である。期待値の積への置換は一般には等式ではない。 model Fisher、観測ラベルによるempirical Fisher、generalized Gauss–Newton、Hessianを区別すること が再現の前提となる。これらの詳細は数理・学習ダイナミクス章も参照。 K-FAC原論文を起点に、畳み込みへのKFC、weight sharingを扱うexpand/reduceへ進むと、 「各層でKronecker積を取れば終わり」という理解を避けられる。OP015 OP016 OP017
2026年の関連研究K-FADEは、Gauss–Newton/K-FACをLLM unlearningへ利用する。 これは曲率情報の用途がpretraining速度だけに限られない例である。 forget benchmark上の出力抑制と、すべての攻撃に対する不可逆な忘却保証は別の主張である。 本稿ではabstractで確認した範囲の紹介に留める。OP077
4. CG・damping・Hessian-free:線形代数と学習則を分ける
CGは対称正定値行列 $A$ に対する $Ax=b$ の反復解法である。 厳密演算では高々次元数のstepで解けるが、浮動小数点演算、非正定値性、確率的な行列変化のある実装に そのまま有限終了保証を持ち込めない。非線形CGと、Newton部分問題を解く線形CGも区別する。OP081 OP084
Hessian-free法はHessianを保存せず、行列vector積とCGで局所二次問題を近似的に解く。 逆行列を陽に形成しないことと、曲率を使わないことは同義ではない。 負曲率への対応、CG停止条件、damping、曲率推定batchを含む算法である。OP084
非線形最小二乗 $ \frac12|r(\theta)|^2 $ に対し、LMの代表形は
\[(J^\top J+\lambda I)\Delta=-J^\top r.\]Gauss–Newtonにdampingを加えて不安定な方向を抑える。 一般の二次モデルでは $(B+\lambda I)\Delta=-g$ と書けるが、 不定な $B$ は単に $\lambda>0$ としただけで正定値になるとは限らない。 Levenberg(1944)とMarquardt(1963)の書誌を確認し、 現代の深層学習での使い方はMartensの本文を確認した。OP082 OP083 OP084
Tikhonovとの関係。 step $\Delta$ に対する二次罰則と、パラメータ $\theta$ に対するL2正則化は 目的が異なる。dampingは局所モデルの信用度・数値安定性、weight decayは訓練の更新規則を変える。 K-FACでのfactor別dampingとfull matrixへの $\lambda I$ の追加も一般には同一でない。 この区別がdamping schedule研究の起点となる。OP015 OP048
5. Shampoo → SOAP → KL-Shampoo
行列勾配 $G_t\in\mathbb R^{m\times n}$ に対する元のShampooを簡略化すると、
\[L_t=\epsilon I+\sum_{s\le t}G_sG_s^\top,\qquad R_t=\epsilon I+\sum_{s\le t}G_s^\top G_s,\qquad \Delta W_t=-\eta L_t^{-1/4}G_tR_t^{-1/4}.\]これはgradient統計から構造を持つ前処理を作るもので、Hessianそのものを計算する方式ではない。 元論文の凸解析、深層学習の経験的性能、EMAやgraftingを含む実装を分ける。 Anilらは大規模化、Shiらは分散実装の費用を含む評価に重要である。OP006 OP007 OP057
SOAPはShampooの固有基底でAdamを適用する。 「ShampooとAdafactorの等価性」には、指数を1/2に変える、scalar補正、dataset期待値を使う等の条件がある。 元の1/4乗Shampoo全般や、更新頻度を落とした実用EMA版の完全等価性ではない。 SOAP本文§4.1は、この理想化と実装の差を明示している。OP008
歴史上の注意として、SOAP本文§3はAnilら(2020)のAppendix Bに近い2次元算法の先行記載があることも認めている。原SOAP論文のthroughput評価は単一H100とgradient accumulationを使った条件であり、分散系全体の速度保証として扱わない。OP007 OP008
KL-Shampoo/KL-SOAPは、構造化共分散推定をFrobenius距離だけでなくKL最小化から見直す。 2025年初出、2026年ICLR版および拡張版という位置づけで、 Adam graftingに依存しない構造化optimizerの設計を示す。 「SOAPがShampooの最終形」という理解は更新が必要である。OP066
| 手法 | 利用する構造 | 主な追加費用 | 解釈上の注意 |
|---|---|---|---|
| AdamW | 座標別二次モーメント | parameterと同規模の状態 | 非対角相関を直接表さない |
| K-FAC | Fisher blockのKronecker近似 | 活性・derivative統計、逆行列更新 | model/empirical Fisherを区別 |
| Shampoo | gradientの行・列等の二次モーメント | matrix rootと状態・通信 | Hessianと自動的に同一ではない |
| SOAP | 学習される基底+座標適応 | 基底更新、状態の扱い | 特殊条件での等価性と実装を分離 |
| Muon | momentum行列のpolar方向 | 行列積による近似 | 通常の曲率推定を保持しない |
6. Muon:歴史・幾何・実装・2026年の分岐
6.1 直交化の系譜
行列ノルムを使う最適化はMuon以前からある。Carlsonらのstochastic spectral descent、 Tuddenhamらのgradient直交化、Bernstein–Newhouseのnormによる再解釈を経て、 Jordanの2024年技術記事がmomentum後の直交化と低精度行列積による実装を結び付けた。 Orthogonal-SGDMのarXiv初出は2022年であり、既存記事の年表にある2020年表記は採用しない。 提案者記事は重要な一次資料だが、査読付きの普遍的優位性証明とは区別する。OP085 OP070 OP018 OP086
行列勾配 $G=U_r\Sigma_rV_r^\top$ に対する線形化問題では、
\[\min_{\|\Delta\|_2\le\eta}\langle G,\Delta\rangle=-\eta\|G\|_*, \qquad \Delta^\star=-\eta U_rV_r^\top\]が成り立つ。ここで $|\cdot|2$ は行列のspectral norm、$|\cdot|*$ はnuclear normである。 Frobenius球の解は $-\eta G/|G|_F$($G\neq0$)。 これらはノルム球内の一次モデルの解であり、一般損失の大域最適性ではない。OP018
rank欠損ではcompact SVDの $U_rV_r^\top$ はpartial isometryであり、 全空間での半直交拡張は一般に一意でない。零勾配の正規化も別処理が必要になる。 またこの導出で $G$ をmomentumに置き換えた更新は、現在の勾配の厳密な最急降下とは限らない。
6.2 有限反復と「収束」の違い
よく使われるquintic反復の特異値多項式は $\phi(s)=3.4445s-4.7750s^3+2.0315s^5$ である。 係数和は0.701なので、1は不動点ではない。 したがって「この係数を5回回せば厳密polar factorに収束する」ではなく、 少ない反復で有用な近似を得る設計である。 零特異値は零のままで、有限精度の品質も別途評価すべきである。OP086
Polar Expressは反復ごとに多項式を設計し、計算効率と極分解近似の誤差を扱う。 これは行列subroutineの改善であり、その収束をそのまま非凸学習全体の収束と読み替えない。OP019
6.3 大規模化と派生法
| 文献 | 改善する箇所 | 検証の範囲と読む意味 |
|---|---|---|
| Liuら、2025 | weight decayと更新scale | Moonlightを含むLLM大規模化の重要な実験資料 OP009 |
| Essential AI、2025 | large batchとcompute/timeの関係 | 4Bまでの報告、$\mu P$との組合せ。CBSの定義を確認 OP010 |
| Dion、2025 | shardingと低rank更新 | error feedbackとrank fractionが追加の比較軸 OP044 |
| NorMuon、2025 | 行・neuronごとの正規化 | 直交化と適応学習率の組合せ OP020 |
| Muon²、2026 | 直交化前の二次モーメント前処理 | 少ないNS反復を狙う。元Muonと状態量が違う OP058 |
| Khonaら、2026 | SOAPの安定化・layer単位分散・更新RMS | 大規模dense/MoEでの比較条件を本文§5で確認 OP014 |
| Dion3、2026 | Gram NS、kernel、部分行選択、通信 | optimizer stepの高速化とend-to-end時間を分ける OP059 |
Khonaらの本文は、8B dense、3B active/30B MoE、8B active/72B hybrid MoE、 1T・3T tokenの設定を記載する。 比較ではupdate RMSを揃え、元記事と異なりNesterovの改善を観察せずEMAを使っている。 この差は「同じMuon」という名称だけでは再現条件が決まらない好例である。 batch最大100M tokensというabstractの報告を、すべての条件での推奨値としない。OP014
6.4 収束解析が一致しないように見える理由
| 文献 | 対象・主張 | 過剰な読み替えを避ける点 |
|---|---|---|
| Sato・Naganuma・Iiduka、2025初出、2026年6月v5 | smoothness、不偏性、分散上界等の下の評価とCBS下界 | 固定step/batchの残差項、停止proxy、未知のrank/varianceに注意 OP011 |
| Do・Dereich・Jentzen、2026年8月 | generalized NSを含む確率問題の非収束例と誤差解析 | 一部の問題での反例は全LLMでの無効性ではない。abstract確認 OP012 |
| de Oliveiraら、2026年9月 | 正則化されたsoft-sign variantと有界前処理、適切な設定での漸近保証 | 通常の有限NS実装すべての保証ではない。PL下の線形率を一般非凸へ拡張しない OP013 |
Satoらv5のCBSはSFO計算量 $bT_\epsilon(b)$ を使う解析であり、 絶対的な最適batchを測定不要で予言する式ではない。 実験のtarget validation loss、gradient-norm停止、一定token数での最終lossは異なる指標である。 近似polar、weight decayの定義、Nesterovの順序、AdamWとのhybrid構成まで揃えて比較する。OP011
7. Large-batch trainingとcritical batch size
Goyalらのlinear scalingとwarmupはImageNet/ResNet設定での成功例である。 LARSは層別のnorm比、LAMBはAdam型更新と層別適応を組み合わせる。 これらの速度記録はhardwareと訓練recipeを含む。 大バッチの一般化ギャップを「常にlarge batchだから悪い」とも 「必ず専用optimizerが必要」とも言えない。OP021 OP024 OP025 OP026
ミニバッチ勾配の平均を $g$、一標本勾配の共分散を $\Sigma$ とすると、 独立標本の近似で分散は $\Sigma/B$ になる。 単純なnoise-scale proxyは
\[B_{\mathrm{noise}}\approx\frac{\operatorname{tr}\Sigma}{\|g\|^2}\]である。ただし曲率や前処理を含む評価では対応する重み付き量が必要になり、 samplingの相関、有限データ、momentum、学習中の変化も効く。 McCandlishらの経験モデルとZhangらのnoisy quadratic modelを続けて読むと、 CBSがデータセットだけで決まる定数ではないことが分かる。OP022 OP023
2025–2026年のMuon/SOAP実験はlarge batchを再び重要な設計軸にしたが、 以下を同時に記録しないCBS比較は解釈しにくい。OP010 OP011 OP014
- batchの単位:画像、sequence、non-padding token、global/local/micro batch。
- horizon:更新回数、token数、epoch、wall-clockのどれを固定したか。
- 到達目標:訓練損失、検証損失、accuracy、勾配ノルム。
- batchごとのLR、momentum、weight decay、scheduleの再調整。
- throughput飽和と統計的効率の飽和を別々に記録する。
8. 学習率:scale・shape・horizon・平均化
学習率の数値だけを比較せず、最大値、形状、終了時刻、warmup、平均化を分ける。
| 系列 | 主なアイデア | 限界・関連 |
|---|---|---|
| SGDR | cosineとwarm restart | optimizer状態のrestartとは区別 OP039 |
| batch増加 | LR減衰に代えてnoiseを調整 | 全optimizer・全領域で厳密同値ではない OP040 |
| hypergradient | LRへの微分をonline計算 | hyper-LRと短い近似のbiasが残る OP053 |
| WSD | stable区間から最後にcooldown | horizon拡張が容易でもpeak LRが不要にはならない OP029 |
| Schedule-Free | scheduleとiterate averagingの関係を利用 | LRやmomentumの選択、訓練/評価iterateは残る OP027 |
| 理論に基づくtransfer | 凸上界と実測曲線の対応を利用 | LLMが凸であるという証明ではない OP028 |
2026年の三つの進展。 Liらはpower-law kernel regressionのFSL設定で、 task/sourceとcapacityの指数によって早いpower decayとWSD型が分かれることを解析した。 Chae–KimはSchedule-Free GD/SGDのsmooth nonconvex解析を進めた。 Ma–ChenのWSqDはinverse-square-rootのbaseとterminal cooldownを組み合わせる。 WSqDのbaseはhorizonに依存しなくても、cooldown開始には終了時刻が必要である。 いずれも理論の対象とLLM実験を分けて読む。OP041 OP042 OP043
学習されたoptimizer。 reversible learning、forward/reverse hypergradient、 LSTM optimizer、RLによる更新式探索、PBTは、shapeや更新式そのものを探索対象にした。 PBTのpopulationコストや、meta-trainingと異なる長さ・モデルへの転移を含めて比較する。 短い代理タスクでの改善だけでは大規模pretrainingでの改善を確定できない。OP049 OP050 OP055 OP056 OP054
9. SAM:flatnessだけで汎化を説明しない
SAMの理想化された目的は
\[\min_w\max_{\|\epsilon\|_2\le\rho} L(w+\epsilon).\]実装はinner最大化を一次近似し、その摂動点でouter勾配を評価する。 通常のSAMと正確なmin–max解は異なり、追加のforward/backward計算が必要になる。 またDinhらの再パラメータ化の反例から、単なるsharpness数値を座標に依存しない汎化説明と見なせない。OP045 OP074
| 研究 | 何を明らかにするか | 読み方 |
|---|---|---|
| ASAM | scale変換を考慮した摂動領域 | 選ぶnormと座標系を明示する OP087 |
| Wenら | 異なるsharpness定義と実際のSAM dynamics | full/stochastic batchを区別 OP047 |
| Andriushchenkoら | feature rank低下 | 低rankがいつも望ましいとは限らない OP046 |
| Muellerら | normalizationパラメータのみの摂動 | 全パラメータflatnessが唯一の機構という説明を再検討 OP062 |
| Bahriら | language-model generalization | task、finetuning、データ量を固定して比較 OP060 |
| logits-SAM、2026 | DPOのlogit dynamicsと選好確率の低下 | パラメータ全体のSAMと同一ではない OP061 |
SAMをOODへ使う際は、IID accuracy、group worst-case、calibrationを別評価する。 同じloss geometryでも表現やデータの偏りによって評価が変わり得る。 これは汎化章との接続点である。
10. 二段階最適化:implicit differentiationから一次法へ
基本形は
\[\min_x F(x,y^*(x)),\qquad y^*(x)\in\arg\min_y f(x,y).\]inner解が局所的に一意で、十分滑らかかつ $H_{yy}=\nabla^2_{yy}f$ が可逆なら、
\[\nabla_x F(x,y^*(x)) =F_x-f_{xy}H_{yy}^{-1}F_y.\]inverseを陽に作らず線形方程式をCG等で近似できる。 しかしinnerに複数の解がある場合や非滑らかな場合、 この式を無条件で適用して大域的best responseを得たとは言えない。 重要な基礎はFranceschiら、Grazziら、Jiらと統一的総説である。OP051 OP064 OP063 OP073
| 方法 | 費用と利点 | 主要な仮定・誤差 |
|---|---|---|
| unrolling / iterative differentiation | inner軌跡の微分 | 保存メモリ、truncation bias |
| approximate implicit differentiation | HVP/線形solver | inner残差、可逆性、solver誤差 |
| BOME | first-order制約・value-function型 | 条件付きのstationarity、global optimumではない |
| F2SA | Hessian oracle不要 | 問題設定・ノイズ条件ごとの複雑度 |
BOMEとF2SAは二階情報を避ける方向だが、 first-orderであることと、一般のnonconvex inner問題を完全に解けることは別である。OP071 OP065
2026年は、下位問題をregularized zero-sum Markov gameとするPANDAと、 weakly convex lower levelのrelaxed Moreau-gapを扱うIVSPまで確認した。 後者のKKT保証は正のrelaxationとconstraint qualificationに依存し、 元の非凸bilevel問題の大域最適解保証ではない。 直近preprintはabstract確認に基づく位置づけであり、証明全体の評価は残る。OP076 OP075
GANとの境界。 TTURの二つの時間尺度、Nash equilibrium、Stackelbergのbest response、 bilevel hypergradientは同じ概念ではない。 GANの回転的dynamicsにはoptimistic/extragradient系が関連する。 TTURを単に「二段階学習なら何でも保証する手法」と扱わない。OP072 OP052
11. Local SGD・Federated learning・DiLoCo
worker $k$ が共通値 $w^t$ から $H$ 回の局所更新を行い、 $w_k^{t,H}$ を集約するのが基本構造である。 $H=1$、同じ初期状態、適切なsample weightなどの条件では同期minibatch更新に近づくが、 $H>1$ ではworkerが異なる点で勾配を計算する。 単にall-reduceを減らしただけの同一algorithmではない。OP030 OP036
| 段階 | 主要研究 | 何が変わったか |
|---|---|---|
| clientデータでの局所平均 | FedAvg | 非IID・部分参加を含む学習設定 OP036 |
| 通信削減の理論 | Stich | convex等の仮定で局所stepと通信回数を解析 OP030 |
| 大バッチと汎化 | Post-local SGD | 訓練後半をlocal化するrecipe OP031 |
| outer momentum | SlowMo | 通信の間に局所更新しglobal側を加速 OP032 |
| client driftと適応 | SCAFFOLD / FedOpt | control variate、server optimizer OP038 OP037 |
| LLM | DiLoCo | inner AdamW、outer Nesterov、長い局所区間 OP033 |
| 非同期と遅延 | Liuら | stale updateとmomentumの干渉 OP034 |
| 障害・straggler耐性 | Decoupled DiLoCo、2026 | 独立learner、非同期fragment集約 OP035 |
| 低rank / merging | LoRDO / IsoLoCo、2026 | 通信とoptimizer state、集約方向を同時設計 OP068 OP067 |
DiLoCoの通信削減倍率は、集約頻度、payload、モデル、到達損失の条件付きで読む。 Decoupled DiLoCoについて、実機訓練と大量chipの障害simulationは別の証拠である。 非同期方式では速いworkerのデータが多く反映される可能性もあり、 throughputに加え学習分布・token重み・stalenessを評価する必要がある。OP033 OP034 OP035
LoRDOは低rank空間への固定化を避ける更新を加え、IsoLoCoはmodel mergingの集約をDiLoCoへ接続する。 いずれも公開実験での改善であり、任意のworker数・データheterogeneity・ネットワークでの優位とはしない。 これらは2026年に最適化幾何、通信、モデル統合が接近していることを示す具体例である。OP068 OP067
12. 研究課題と読む順序
以下は参考文献を総合した研究上の提案であり、既存論文がすでに解決した結果ではない。
- 非Euclidean CBS。 noise covariance、effective rank、前処理、停止基準を結び付ける。 proxyのCBSとwall-clock最適batchの差を、統計誤差とsystem費用に分解する。
- 近似直交化の必要精度。 NS誤差、低precision、momentum、rank圧縮を別々にablateし、 直交度とloss改善の相関を因果的説明と混同しない。
- scheduleとoptimizerの共設計。 Muon/AdamWごとのscale transferと WSD/Schedule-Freeの比較を、同一token予算・同一targetの両方で行う。
- IID外の評価。 訓練速度の改善が校正、rare token、subgroup、OODにどう影響するかを測る。
- 分散比較。 local step、worker数、通信payload、故障率、消費FLOPs、 time-to-targetを同時記録する。
推奨する読む順序は、Bottouら → Adam/AdamW → Choi/AlgoPerf → Amari/K-FAC → Shampoo/SOAP → Old Optimizer, New Norm/Muon → McCandlish/Zhang → Muon大規模比較と2026年理論 → Schedule-Free/WSD → Local SGD/DiLoCoである。 SAM、bilevelは別枝として、目的関数・保証・計算費用の違いを確認しながら読む。
13. 既存メモからの訂正・保留
| 元メモの論点 | 本サーベイの扱い |
|---|---|
| Muon本文の「5step以内で収束」 | 有限反復近似と漸近収束を区別。旧ページ内の先行補足と後段の表現の不一致を解消 |
| Shampooを一律にHessian二階法と説明 | gradient二次モーメントの構造化前処理として説明 |
| Orthogonal-SGDM年表の2020/2022混在 | 確認したarXiv初出2022を採用 |
| LBTの「Don’t increase batch size decrease LR」 | 原題は Don’t Decay the Learning Rate, Increase the Batch Size |
| CGが必ず次元数以内に収束 | SPD・厳密演算の前提を明記 |
| Muon CBSの「最適batchを導く」 | 2026 v5の下界、停止proxy、未知定数を明示 |
| 二段階最適化の一般的収束主張 | inner構造、局所性、regularity、equilibrium概念を分ける |
| 「二段階」で訓練するLDM等をそのままbilevelの例にする | 一方の最適解を他方の目的へ代入・微分する構造の有無を確認して採否を決める |
既存ページのリンク集すべてを検証済みとして引き継いでいない。 追加確認対象は既存文献の棚卸しに残す。
参考文献
年は原則として確認した初出年、会議名は確認できたもののみ記す。 本文=関連する本文節を確認、要旨=一次資料の要旨と書誌を確認、 書誌=本文・要旨の十分な確認なし、一次技術資料=提案者の技術記事。
-
[OP001] Diederik P. Kingma; Jimmy Ba (2014). Adam: A Method for Stochastic Optimization. ICLR 2015(arXiv初出2014)。確認:要旨。Adamの一次・二次モーメントとbias補正。
-
[OP002] Noam Shazeer; Mitchell Stern (2018). Adafactor: Adaptive Learning Rates with Sublinear Memory Cost. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。行列の行・列統計によるoptimizer状態削減。
-
[OP003] Xiangning Chen; Chen Liang; Da Huang; ほか (2023). Symbolic Discovery of Optimization Algorithms. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。Lion、符号更新と自動探索。
-
[OP004] Dami Choi; Christopher J. Shallue; Zachary Nado; ほか (2019). On Empirical Comparisons of Optimizers for Deep Learning. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。探索空間で変わるoptimizer順位。
-
[OP005] George E. Dahl; Frank Schneider; Zachary Nado; ほか (2023). Benchmarking Neural Network Training Algorithms. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。time-to-resultとtuningを含むAlgoPerf。
-
[OP006] Vineet Gupta; Tomer Koren; Yoram Singer (2018). Shampoo: Preconditioned Stochastic Tensor Optimization. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。構造を持つgradient二次モーメント前処理の原典。
-
[OP007] Rohan Anil; Vineet Gupta; Tomer Koren; Kevin Regan; Yoram Singer (2020). Scalable Second Order Optimization for Deep Learning. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。Shampooの大規模化・数値実装。
-
[OP008] Nikhil Vyas; Depen Morwani; Rosie Zhao; ほか (2024). SOAP: Improving and Stabilizing Shampoo using Adam. ICLR 2025(arXiv初出2024、会議版題名末尾にfor Language Modeling)。確認:本文該当節。固有基底でのAdam、等価性の限定条件。
-
[OP009] Jingyuan Liu; Jianlin Su; Xingcheng Yao; ほか (2025). Muon is Scalable for LLM Training. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。weight decayとupdate scaleによるMuon大規模化。
-
[OP010] Essential AI : Ishaan Shah; Anthony M. Polloreno; Karl Stratos; ほか (2025). Practical Efficiency of Muon for Pretraining. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。large batchでのcompute/time Pareto frontier。
-
[OP011] Naoki Sato; Hiroki Naganuma; Hideaki Iiduka (2025). Convergence Bound and Critical Batch Size of Muon Optimizer. arXiv版参照(公刊状況を別途確認したものは注記)。確認:本文該当節。2026 v5のCBS下界と未知定数・停止条件。
-
[OP012] Thang Do; Steffen Dereich; Arnulf Jentzen (2026). On MUON optimization: From non-convergence to an error analysis with Polar Express and the Newton-Schulz polynomial from implementations. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。確率的な非収束例とNS近似誤差。
-
[OP013] Arthur C. B. de Oliveira; Dhruv D. Jatkar; Guilherme S. Vicinansa; Eduardo D. Sontag (2026). Convergence guarantees for Muon: New parameter regimes and generalizations. arXiv版参照(公刊状況を別途確認したものは注記)。確認:本文該当節。soft-sign variantの条件付き漸近保証。
-
[OP014] Mikail Khona; Aditya Vavre; Boxiang Wang; ほか (2026). SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales. arXiv版参照(公刊状況を別途確認したものは注記)。確認:本文該当節。2026年の大規模SOAP/Muonとlayer単位分散。
-
[OP015] James Martens; Roger Grosse (2015). Optimizing Neural Networks with Kronecker-factored Approximate Curvature. arXiv版参照(公刊状況を別途確認したものは注記)。確認:本文該当節。Kronecker近似natural gradientとdamping。
-
[OP016] Roger Grosse; James Martens (2016). A Kronecker-factored approximate Fisher matrix for convolution layers. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。畳み込みへのFisher block近似。
-
[OP017] Runa Eschenhagen; Alexander Immer; Richard E. Turner; Frank Schneider; Philipp Hennig (2023). Kronecker-Factored Approximate Curvature for Modern Neural Network Architectures. NeurIPS 2023。確認:要旨。weight sharing、expand/reduceの区別。
-
[OP018] Jeremy Bernstein; Laker Newhouse (2024). Old Optimizer, New Norm: An Anthology. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。ノルムからoptimizerを捉え直す。
-
[OP019] Noah Amsel; David Persson; Christopher Musco; Robert M. Gower (2025). The Polar Express: Optimal Matrix Sign Methods and Their Application to the Muon Algorithm. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。行列polar近似の多項式設計。
-
[OP020] Zichong Li; Liming Liu; Chen Liang; Weizhu Chen; Tuo Zhao (2025). NorMuon: Making Muon more efficient and scalable. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。neuron単位適応と直交化の組合せ。
-
[OP021] Priya Goyal; Piotr Dollár; Ross Girshick; ほか (2017). Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。linear scalingとwarmupの実験的基礎。
-
[OP022] Sam McCandlish; Jared Kaplan; Dario Amodei; OpenAI Dota Team (2018). An Empirical Model of Large-Batch Training. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。noise scaleとbatchの経験モデル。
-
[OP023] Guodong Zhang; Lala Li; Zachary Nado; ほか (2019). Which Algorithmic Choices Matter at Which Batch Sizes? Insights From a Noisy Quadratic Model. NeurIPS 2019。確認:要旨。noisy quadraticによるoptimizer依存CBS。
-
[OP024] Yang You; Igor Gitman; Boris Ginsburg (2017). Large Batch Training of Convolutional Networks. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。LARS、layer別update scale。
-
[OP025] Yang You; Jing Li; Sashank Reddi; ほか (2019). Large Batch Optimization for Deep Learning: Training BERT in 76 minutes. ICLR 2020(arXiv初出2019)。確認:要旨。LAMBとBERTの大バッチ学習。
-
[OP026] Zachary Nado; Justin M. Gilmer; Christopher J. Shallue; Rohan Anil; George E. Dahl (2021). A Large Batch Optimizer Reality Check: Traditional, Generic Optimizers Suffice Across Batch Sizes. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。LARS/LAMB比較での強いbaseline。
-
[OP027] Aaron Defazio; Xingyu Alice Yang; Harsh Mehta; ほか (2024). The Road Less Scheduled. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。scheduleとiterate averagingの統一。
-
[OP028] Fabian Schaipp; Alexander Hägele; Adrien Taylor; Umut Simsekli; Francis Bach (2025). The Surprising Agreement Between Convex Optimization Theory and Learning-Rate Scheduling for Large Model Training. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。凸上界と実測scheduleの対応。
-
[OP029] Kaiyue Wen; Zhiyuan Li; Jason Wang; ほか (2024). Understanding Warmup-Stable-Decay Learning Rates: A River Valley Loss Landscape Perspective. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。WSDのriver-valley仮説とWSD-S。
-
[OP030] Sebastian U. Stich (2018). Local SGD Converges Fast and Communicates Little. ICLR 2019(arXiv初出2018)。確認:要旨。local SGDの通信と凸収束率。
-
[OP031] Tao Lin; Sebastian U. Stich; Kumar Kshitij Patel; Martin Jaggi (2018). Don’t Use Large Mini-Batches, Use Local SGD. ICLR 2020(arXiv初出2018)。確認:要旨。post-local SGDの汎化と通信。
-
[OP032] Jianyu Wang; Vinayak Tantia; Nicolas Ballas; Michael Rabbat (2019). SlowMo: Improving Communication-Efficient Distributed SGD with Slow Momentum. ICLR 2020(arXiv初出2019)。確認:要旨。outer slow momentum。
-
[OP033] Arthur Douillard; Qixuan Feng; Andrei A. Rusu; ほか (2023). DiLoCo: Distributed Low-Communication Training of Language Models. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。LLMをislandで低通信訓練。
-
[OP034] Bo Liu; Rachita Chhaparia; Arthur Douillard; ほか (2024). Asynchronous Local-SGD Training for Language Modeling. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。非同期遅延とNesterovの干渉。
-
[OP035] Arthur Douillard; Keith Rush; Yani Donchev; ほか (2026). Decoupled DiLoCo for Resilient Distributed Pre-training. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。障害耐性と非同期learner集約。
-
[OP036] H. Brendan McMahan; Eider Moore; Daniel Ramage; Seth Hampson; Blaise Agüera y Arcas (2016). Communication-Efficient Learning of Deep Networks from Decentralized Data. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。FedAvgと非IID client。
-
[OP037] Sashank Reddi; Zachary Charles; Manzil Zaheer; ほか (2020). Adaptive Federated Optimization. ICLR 2021(arXiv初出2020)。確認:要旨。server側適応optimizer。
-
[OP038] Sai Praneeth Karimireddy; Satyen Kale; Mehryar Mohri; ほか (2019). SCAFFOLD: Stochastic Controlled Averaging for Federated Learning. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。client driftをcontrol variateで補正。
-
[OP039] Ilya Loshchilov; Frank Hutter (2016). SGDR: Stochastic Gradient Descent with Warm Restarts. ICLR 2017(arXiv初出2016)。確認:要旨。cosine annealingとwarm restart。
-
[OP040] Samuel L. Smith; Pieter-Jan Kindermans; Chris Ying; Quoc V. Le (2017). Don’t Decay the Learning Rate, Increase the Batch Size. ICLR 2018(arXiv初出2017)。確認:要旨。LR減衰に代えるbatch増加。
-
[OP041] Binghui Li; Zilin Wang; Fengling Chen; ほか (2026). Optimal Learning Rate Schedules under Functional Scaling Laws: Power Decay and Warmup-Stable-Decay. COLT 2026(arXiv採択注記を確認)。確認:要旨。FSL/kernel設定でのtask依存schedule。
-
[OP042] Jiseok Chae; Donghwan Kim (2026). Understanding Schedule-Free Methods in Nonconvex Optimization: Rate Guarantees and Escaping Saddles. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。Schedule-Free GD/SGDのnonconvex解析。
-
[OP043] Jianhao Ma; Yuxin Chen (2026). WSqD: A Horizon-Free Learning Rate Schedule for Large Model Training. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。horizon非依存baseとterminal cooldown。
-
[OP044] Kwangjun Ahn; Byron Xu; Natalie Abreu; ほか (2025). Dion: Distributed Orthonormalized Updates. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。shardingを考慮した低rank直交更新。
-
[OP045] Pierre Foret; Ariel Kleiner; Hossein Mobahi; Behnam Neyshabur (2020). Sharpness-Aware Minimization for Efficiently Improving Generalization. arXiv版参照(公刊状況を別途確認したものは注記)。確認:本文該当節。SAMの近傍最悪損失という目的。
-
[OP046] Maksym Andriushchenko; Dara Bahri; Hossein Mobahi; Nicolas Flammarion (2023). Sharpness-Aware Minimization Leads to Low-Rank Features. NeurIPS 2023。確認:要旨。SAMによるfeature rank低下。
-
[OP047] Kaiyue Wen; Tengyu Ma; Zhiyuan Li (2022). How Does Sharpness-Aware Minimization Minimize Sharpness?. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。SAMが制御するsharpnessの種類。
-
[OP048] Ilya Loshchilov; Frank Hutter (2017). Decoupled Weight Decay Regularization. ICLR 2019(arXiv初出2017)。確認:要旨。適応前処理とweight decayの分離。
-
[OP049] Dougal Maclaurin; David Duvenaud; Ryan P. Adams (2015). Gradient-based Hyperparameter Optimization through Reversible Learning. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。訓練軌跡を微分するhyperparameter最適化。
-
[OP050] Luca Franceschi; Michele Donini; Paolo Frasconi; Massimiliano Pontil (2017). Forward and Reverse Gradient-Based Hyperparameter Optimization. ICML 2017。確認:要旨。forward/reverse hypergradientの費用。
-
[OP051] Luca Franceschi; Paolo Frasconi; Saverio Salzo; Riccardo Grazzi; Massimilano Pontil (2018). Bilevel Programming for Hyperparameter Optimization and Meta-Learning. ICML 2018。確認:要旨。hyperparameter/meta-learningのbilevel定式化。
-
[OP052] Constantinos Daskalakis; Andrew Ilyas; Vasilis Syrgkanis; Haoyang Zeng (2017). Training GANs with Optimism. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。GANの回転的dynamicsとoptimistic法。
-
[OP053] Atilim Gunes Baydin; Robert Cornish; David Martinez Rubio; Mark Schmidt; Frank Wood (2017). Online Learning Rate Adaptation with Hypergradient Descent. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。LR自身へのonline微分。
-
[OP054] Max Jaderberg; Valentin Dalibard; Simon Osindero; ほか (2017). Population Based Training of Neural Networks. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。populationを用いたschedule探索。
-
[OP055] Marcin Andrychowicz; Misha Denil; Sergio Gomez; ほか (2016). Learning to learn by gradient descent by gradient descent. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。LSTMに更新則を学習させる。
-
[OP056] Irwan Bello; Barret Zoph; Vijay Vasudevan; Quoc V. Le (2017). Neural Optimizer Search with Reinforcement Learning. ICML 2017。確認:要旨。RLを用いた更新式探索。
-
[OP057] Hao-Jun Michael Shi; Tsung-Hsien Lee; Shintaro Iwasaki; ほか (2023). A Distributed Data-Parallel PyTorch Implementation of the Distributed Shampoo Optimizer for Training Neural Networks At-Scale. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。分散Shampooの実装費用。
-
[OP058] Ziyue Liu; Ruijie Zhang; Zhengyang Wang; ほか (2026). Muon$^2$: Boosting Muon via Adaptive Second-Moment Preconditioning. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。NS前の二次モーメント前処理。
-
[OP059] Noah Amsel; Jack Zhang; Kwangjun Ahn; ほか (2026). Dion3: Full-Stack Orthogonal Updates. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。kernel・通信・部分行選択の協調。
-
[OP060] Dara Bahri; Hossein Mobahi; Yi Tay (2021). Sharpness-Aware Minimization Improves Language Model Generalization. ACL 2022(arXiv初出2021)。確認:要旨。言語モデルへのSAM適用。
-
[OP061] Haocheng Luo; Zehang Deng; Thanh-Toan Do; ほか (2026). Sharpness-Aware Minimization in Logit Space Efficiently Enhances Direct Preference Optimization. ICLR 2026(arXiv採択注記を確認)。確認:要旨。logit空間SAMとDPO。
-
[OP062] Maximilian Mueller; Tiffany Vlaar; David Rolnick; Matthias Hein (2023). Normalization Layers Are All That Sharpness-Aware Minimization Needs. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。normalizationだけの摂動という反証的実験。
-
[OP063] Kaiyi Ji; Junjie Yang; Yingbin Liang (2020). Bilevel Optimization: Convergence Analysis and Enhanced Design. ICML 2021(arXiv初出2020)。確認:要旨。AID/ITDとstocBiOの収束条件。
-
[OP064] Riccardo Grazzi; Luca Franceschi; Massimiliano Pontil; Saverio Salzo (2020). On the Iteration Complexity of Hypergradient Computation. ICML 2020。確認:要旨。hypergradient計算の反復複雑度。
-
[OP065] Jeongyeol Kwon; Dohyun Kwon; Stephen Wright; Robert Nowak (2023). A Fully First-Order Method for Stochastic Bilevel Optimization. ICML 2023。確認:要旨。Hessian oracle不要のF2SA。
-
[OP066] Wu Lin; Scott C. Lowe; Felix Dangel; ほか (2025). Understanding and Improving Shampoo and SOAP via Kullback-Leibler Minimization. ICLR 2026、arXiv v10は2026-06-22拡張版。確認:要旨。共分散推定のKLによる再設計。
-
[OP067] Stefan Horoi; Benjamin Thérien; Guy Wolf; Eugene Belilovsky (2026). Can Model Merging Improve Aggregation in DiLoCo?. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。model mergingをDiLoCo集約に戻す。
-
[OP068] Andrej Jovanović; Alex Iacob; Mher Safaryan; ほか (2026). LoRDO: Distributed Low-Rank Optimization with Infrequent Communication. ICML 2026(arXiv採択注記を確認)。確認:要旨。低rank更新と低通信の統合。
-
[OP069] Léon Bottou; Frank E. Curtis; Jorge Nocedal (2016). Optimization Methods for Large-Scale Machine Learning. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。確率的一次法と曲率利用の全体史。
-
[OP070] Mark Tuddenham; Adam Prügel-Bennett; Jonathan Hare (2022). Orthogonalising gradients to speed up neural network optimisation. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。Muon以前のgradient直交化。
-
[OP071] Mao Ye; Bo Liu; Stephen Wright; Peter Stone; Qiang Liu (2022). BOME! Bilevel Optimization Made Easy: A Simple First-Order Approach. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。value-function型first-order bilevel法。
-
[OP072] Martin Heusel; Hubert Ramsauer; Thomas Unterthiner; Bernhard Nessler; Sepp Hochreiter (2017). GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。TTURの仮定、Nashとbilevelの境界。
-
[OP073] Risheng Liu; Jiaxin Gao; Jin Zhang; Deyu Meng; Zhouchen Lin (2021). Investigating Bi-Level Optimization for Learning and Vision from a Unified Perspective: A Survey and Beyond. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。bilevel問題と算法の整理。
-
[OP074] Laurent Dinh; Razvan Pascanu; Samy Bengio; Yoshua Bengio (2017). Sharp Minima Can Generalize For Deep Nets. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。flatnessの再パラメータ化依存。
-
[OP075] Jan Harold Alcantara; Masahiro Inoue; Akiko Takeda (2026). Improved KKT Complexity for First-Order Bilevel Optimization under Weak Lower-Level Convexity. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。weakly convex innerとrelaxed KKT。
-
[OP076] Zihao Zheng; Irwin King; Songtao Lu (2026). Bilevel Optimization over Saddle Points of Zero-Sum Markov Games. ICML 2026(arXiv採択注記を確認)。確認:要旨。下位Markov gameに対するbilevel法。
-
[OP077] Lev McKinney; Anvith Thudi; Juhan Bae; ほか (2026). Gauss-Newton Unlearning for the LLM Era. arXiv版参照(公刊状況を別途確認したものは注記)。確認:要旨。曲率をLLM unlearningへ利用。
-
[OP078] John Duchi; Elad Hazan; Yoram Singer (2011). Adaptive Subgradient Methods for Online Learning and Stochastic Optimization. JMLR 12(61), 2011。確認:要旨。AdaGrad、累積統計と幾何。
-
[OP079] Sashank J. Reddi; Satyen Kale; Sanjiv Kumar (2018). On the Convergence of Adam and Beyond. ICLR 2018(著者所属機関の論文ページ)。確認:要旨。Adamの反例とAMSGrad。
-
[OP080] Shun-ichi Amari (1998). Natural Gradient Works Efficiently in Learning. Neural Computation 10(2):251–276, 1998。確認:要旨。Fisher幾何による自然勾配の原典。
-
[OP081] Magnus R. Hestenes; Eduard Stiefel (1952). Methods of Conjugate Gradients for Solving Linear Systems. Journal of Research of the National Bureau of Standards 49(6):409–436, 1952。確認:要旨。対称正定値系を解くCGの原典。
-
[OP082] Kenneth Levenberg (1944). A Method for the Solution of Certain Non-Linear Problems in Least Squares. Quarterly of Applied Mathematics 2(2):164–168, 1944。原典アクセス403、Marquardt出版社参考文献と書誌を照合。確認:書誌。LM系の歴史的原典、書誌のみ。
-
[OP083] Donald W. Marquardt (1963). An Algorithm for Least-Squares Estimation of Nonlinear Parameters. Journal of the Society for Industrial and Applied Mathematics 11(2):431–441, 1963。2006は電子公開年。確認:書誌。damped nonlinear least squaresの原典、書誌のみ。
-
[OP084] James Martens (2010). Deep Learning via Hessian-Free Optimization. ICML 2010。確認:本文該当節。matrix-vector product・CG・dampingを結ぶ。
-
[OP085] David Carlson; Volkan Cevher; Lawrence Carin (2015). Stochastic Spectral Descent for Restricted Boltzmann Machines. AISTATS 2015, PMLR 38:111–119。確認:要旨。spectral normによるMuon以前の最適化。
-
[OP086] Keller Jordan (2024). Muon: An optimizer for hidden layers in neural networks. 提案者の技術記事、2024-12-08(2025追記あり、査読論文ではない)。確認:一次技術資料。Muonの定義・有限NS反復・仮説の一次記事。
-
[OP087] Jungmin Kwon; Jeongseop Kim; Hyunseo Park; In Kwon Choi (2021). ASAM: Adaptive Sharpness-Aware Minimization for Scale-Invariant Learning of Deep Neural Networks. ICML 2021, PMLR 139:5905–5914。確認:要旨。scaleを考慮したSAM摂動。
-
[OP088] Hong Liu; Zhiyuan Li; David Hall; Percy Liang; Tengyu Ma (2023). Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training. arXiv版参照。確認:要旨。対角Hessian推定とclippingによる言語モデル学習。
-
[OP089] Konstantin Mishchenko; Aaron Defazio (2023). Prodigy: An Expeditiously Adaptive Parameter-Free Learner. arXiv版参照。確認:要旨。距離推定による学習率適応。D-Adaptationとの関係。
-
[OP090] Shohei Taniguchi; Keno Harada; Gouki Minegishi; ほか (2024). ADOPT: Modified Adam Can Converge with Any β₂ with the Optimal Rate. NeurIPS 2024(arXiv Commentsで確認)。確認:要旨。momentumと正規化の順序、二次モーメント推定の変更。
-
[OP091] Xi-Lin Li (2015). Preconditioned Stochastic Gradient Descent. arXiv初出2015、TNNLS版へのDOIあり。確認:要旨。パラメータ・勾配摂動からの前処理推定。