Large-Batch Training Survey: スケーリング則・限界・最適化手法

2026年10月の再サーベイ: 研究史・重要文献・最近の進展を整理した新版を追加しました(2026年10月3日基準)。以下は従来のメモです。定義・適用条件の訂正は新版を参照してください。

Large-Batch Trainingで何を最適化するか

global batch size $B$ を増やす目的は、主にdata parallelismで1 stepの処理量を増やし、 wall-clockを短縮することです。しかしbatchを増やすと1 epochあたりのupdate回数は減るため、 次の効率を分けて議論します。

Shallue et al. (JMLR 2019) は35 workloads、 16万超のtraining runsを比較し、batch sizeの効果がworkloadとtuningに大きく依存することを 示しました。「large batchは常に汎化を悪化させる」「大きいほど常に速い」のどちらも安全な 一般化ではありません。

基本式とlinear scaling

mini-batch gradientを

\[g_B(\theta)=\frac{1}{B}\sum_{i=1}^B \nabla_\theta \ell_i(\theta)\]

とします。独立同分布で有限分散という単純な仮定では、gradient noiseの分散は概ね $1/B$ で 減りますが、1 stepの計算量と同時並列性は増えます。

Goyal et al. はImageNet/ResNet-50で、batch sizeを $k$ 倍に すると学習率も $k$ 倍にするlinear scaling ruleとgradual warmupを用い、batch 8192で small-batch accuracyを維持したと報告しました。これは特定のoptimizer、model、normalization、 training horizonでの経験則であり、任意のtaskへの定理ではありません。

Critical batch size / gradient noise scale

batchを増やしても、ある領域から先は必要step数があまり減らず、追加sampleがwall-clock短縮へ 直結しにくくなります。McCandlish et al. はgradient noise scaleが最大有用batch sizeを予測するという経験モデルを複数domainで検証しました。 noise scaleはtraining中にも変わり、定数ではありません。

「critical batch size」は定義・target metric・optimizerによって変わるので、論文間で数値だけを 比較せず、target loss、tuning budget、hardware scalingを確認します。

Optimizerと代表的な対処

方法 狙い 一次資料 注意
linear scaling + warmup 初期の不安定化を避けつつ大きいstepを使う Goyal et al. ImageNetの経験則から一般化しすぎない
LARS layerごとに更新比率を調整 LARS task・normalization依存
LAMB Adam系にlayer-wise adaptation You et al. BERTの速度記録は大規模hardware込み
adaptive batch 学習中にbatchを増減 McCandlish et al. noise scale推定コストと仮定
Local/Post-Local SGD 通信頻度と局所noiseを調整 Lin et al. 単なるlarge batchと更新軌跡が異なる

再現時の最低限の記録

global/per-device batch、gradient accumulation、worker数、optimizer全設定、warmup、総epoch/token、 augmentation、BatchNorm処理、mixed precision、target metric、tuning trial数、throughput、通信時間を 記録します。speedupは同じaccuracy/lossへ到達するtime-to-targetで比較するのが基本です。

List of Papers

Algorithms

  1. LAMB: Layer Adaptation applied to AdamW
  2. LARS: Layer Adaptation applied to SGD-M
  3. LANS: Nesterov’s momentum into LAMB

Adaptive Batch Sizes

  1. Adaptive Sampling Strategies for Stochastic Optimization: Statistical tests that can help determine when to increase batch size
  2. An Empirical Model of Large-Batch Training: This work discusses gradient noise scale, critical batch size and how to compute it in detail
  3. AdaAdaGrad (Adaptive Batch Size Schemes for Adaptive Gradient Methods): same as #4 focusing more on empirical study using Vision and Language Models

Online Evolutionary Batch Size Orchestration for Scheduling Deep Learning Workloads in GPU Clusters

LBT and Hyper-Parameter Tuning

  1. A Large Batch Optimizer Reality Check: Traditional, Generic Optimizers Suffice Across Batch Sizes: Argues against customized LBT optimizers viewing HP tuning as a means to make LBT work
  2. Don’t increase batch size decrease LR

Survey

以下の長いリストは、各論文の主張を保存した作業メモです。収束率には滑らかさ、分散、 バッチ選択規則など論文固有の仮定があり、実験上の「一致」「改善」も記載された設定内の結果です。 再利用時はリンク先の定理・実験節と照合してください。

  1. Large-Scale Deep Learning Optimizations: A Comprehensive Survey: Recommend reading Section 4 and 5 for a summary of LBT approaches and challenges
  2. Mustafa et al. 2018-11-07-Large-Batch-Training-Mustafa.pdf
  3. Large-Scale Deep Learning Optimizations: A Comprehensive Survey

Re-visiting norm choices for LBT metrics

  1. The Geometry of Sign Gradient Descent: Does viewing gradient in terms of other norms bring out the LBT training behavior better?

  2. AdAdaGrad: Adaptive Batch Size Schemes for Adaptive Gradient Methods

    Summary
    
    
    
    この論文は、深層学習における最適化手法の重要なハイパーパラメータである「バッチサイズ」を、訓練中に動的に調整する新しい手法ADADAGRADとその派生版ADADAGRAD-NORMを提案するものです。
    
    1. 背景と問題意識
    大規模バッチ学習の課題: 近年の深層学習では、GPUなどのハードウェア性能向上に伴い、大規模なバッチサイズでの訓練が主流です。これにより訓練は高速化しますが、一方で小さいバッチサイズで訓練したモデルに比べて汎化性能が低下する「汎化ギャップ」という問題が知られています。
    既存研究の限界: バッチサイズを動的に調整する研究はこれまでにも存在しましたが、主に以下のような限界がありました。
    多くの手法が、標準的な確率的勾配降下法(SGD)を対象としており、深層学習で広く利用されているADAGRADやADAMのような適応的勾配法(学習率を動的に調整する手法)との組み合わせは十分に研究されていませんでした。
    理論的な収束保証がなかったり、厳しい仮定の下でしか証明されていなかったりなど、理論と実践の間に乖離がありました。
    
    2. 提案手法と新規性
    本研究は、上記の課題を解決するために、適応的勾配法と親和性の高い適応的バッチサイズ手法を提案します。
    手法の核心:
    既存の適応的サンプリング研究で提案された「Norm Test」や「Inner Product Test」といった考え方を、ADAGRADやその派生版であるADAGRAD-NORMと統合しました。
    これらのテストは、現在のバッチから計算された勾配の「ノイズの大きさ(分散)」を評価し、ノイズが大きすぎると判断された場合にバッチサイズを自動的に増加させます。
    これにより、訓練の初期段階では小さいバッチサイズで探索的に学習を進めて汎化性能を高め、訓練が進むにつれて大きいバッチサイズに移行して安定かつ高速に収束させることを目指します。
    これまでの研究との違い・新規性:
    適応的勾配法への拡張: これまでSGD向けに開発されてきた適応的バッチサイズ手法を、初めてADAGRADのような適応的勾配法向けに拡張し、その理論的正当性を示した点に最大の新規性があります。
    理論的保証: 提案手法が、滑らかな非凸最適化問題において、高い確率で停留点に収束することを数学的に証明しました。これにより、手法の信頼性を理論的に裏付けています。
    
    3. 貢献の実証方法
    本論文では、提案手法の有効性を「理論」と「実験」の両面から実証しています。
    理論的貢献の実証:
    収束性の証明: 提案手法(ADADAGRAD-NORM)が、K回のイテレーションでO(1/K)という収束率を高い確率で達成することを証明しました。これは、既存のSGDベースの手法と同等の強力な保証です。
    仮定の緩和: 従来の多くの研究で用いられる「Lipschitz平滑性」という仮定を、より現実的な「一般化平滑性」の条件に緩和した上でも、収束性を証明しました。これにより、より広いクラスの問題に対して理論が適用可能であることを示しています。
    座標ごとの適応: ADAGRADの座標ごとに学習率を調整する特性に合わせて、座標ごとのNorm Testを導入し、その場合でも同様の収束保証が得られることを示しました。
    実験的貢献の実証:
    画像分類タスクでの評価: MNISTおよびCIFAR-10データセットを用いた画像分類タスクで、提案手法の性能を評価しました。
    性能比較: 提案手法を、固定バッチサイズのSGDやADAGRAD、そしてSGDベースの適応的バッチサイズ手法(ADASGD)と比較しました。
    結果: 実験の結果、提案手法は以下の点で優位性を示しました。
    汎化ギャップの緩和: 大規模な固定バッチサイズを用いた場合に比べて、高い検証精度(汎化性能)を達成しました。
    訓練効率の向上: 訓練が進むにつれてバッチサイズを大きくすることで、GPUリソースを有効活用し、少ないステップ数で効率的に学習を完了させることができました。
    自動化: 学習率のスケジューリングなどを細かく調整することなく、訓練効率と汎化性能のバランスを自動で取れることを実証しました。
    
    4. 結論
    本研究は、適応的勾配法のための適応的バッチサイズ手法「ADADAGRAD」を提案し、その理論的な収束保証と実験的な有効性を初めて示しました。これにより、大規模モデルの訓練におけるハイパーパラメータ調整の手間を削減し、訓練効率と汎化性能を両立させる新たな道筋を拓く貢献をしました。
    
    
    

SDEs

SignSGD

Templates

Summary