統合参考文献・引用データ(2026年10月3日)
5章の延べ526登録を512件の文献・一次資料に統合した。arXiv ID等による保守的な重複排除であり、異なるURLの同一研究が残る可能性がある。論文以外の書籍、技術報告、提案ブログも含む。
JSON(確認水準・版・各章の元記録を含む) · BibTeX · 検索方法と限界 · 既存引用の棚卸し
年は確認した版・公刊年またはarXiv初出年であり、全件を一律に初出年へ換算していない。同じ研究の複数記録がある場合は小さい年を表示し、元の年をJSONに残した。採択・公刊状況は各記録の注記を参照。確認日は2026年10月3日。
「本文該当節確認」は関連部分の確認であり、全証明の検証や追試ではない。「要旨確認」の結果は著者の報告範囲で紹介する。略記した著者名を含むため、BibTeXは個人の文献管理に使う下書きであり、投稿用書誌は出版社の正式exportと照合する。
最適化(主登録158件)
章本文。他章との共通文献には複数IDを併記する。
-
OP001 — Diederik P. Kingma; Jimmy Ba (2014). Adam: A Method for Stochastic Optimization.
OP001: ICLR 2015(arXiv初出2014)。要旨確認。Adamの一次・二次モーメントとbias補正。
-
OP002 — Noam Shazeer; Mitchell Stern (2018). Adafactor: Adaptive Learning Rates with Sublinear Memory Cost.
OP002: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。行列の行・列統計によるoptimizer状態削減。
-
OP003 — Xiangning Chen; Chen Liang; Da Huang; ほか (2023). Symbolic Discovery of Optimization Algorithms.
OP003: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。Lion、符号更新と自動探索。
-
OP004 — Dami Choi; Christopher J. Shallue; Zachary Nado; ほか (2019). On Empirical Comparisons of Optimizers for Deep Learning.
OP004: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。探索空間で変わるoptimizer順位。
-
OP005 — George E. Dahl; Frank Schneider; Zachary Nado; ほか (2023). Benchmarking Neural Network Training Algorithms.
OP005: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。time-to-resultとtuningを含むAlgoPerf。
-
OP006 — Vineet Gupta; Tomer Koren; Yoram Singer (2018). Shampoo: Preconditioned Stochastic Tensor Optimization.
OP006: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。構造を持つgradient二次モーメント前処理の原典。
-
OP007 — Rohan Anil; Vineet Gupta; Tomer Koren; Kevin Regan; Yoram Singer (2020). Scalable Second Order Optimization for Deep Learning.
OP007: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。Shampooの大規模化・数値実装。
-
OP008 — Nikhil Vyas; Depen Morwani; Rosie Zhao; ほか (2024). SOAP: Improving and Stabilizing Shampoo using Adam.
OP008: ICLR 2025(arXiv初出2024、会議版題名末尾にfor Language Modeling)。本文該当節確認。固有基底でのAdam、等価性の限定条件。
-
OP009 — Jingyuan Liu; Jianlin Su; Xingcheng Yao; ほか (2025). Muon is Scalable for LLM Training.
OP009: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。weight decayとupdate scaleによるMuon大規模化。
-
OP010 — Essential AI : Ishaan Shah; Anthony M. Polloreno; Karl Stratos; ほか (2025). Practical Efficiency of Muon for Pretraining.
OP010: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。large batchでのcompute/time Pareto frontier。
-
OP011 — Naoki Sato; Hiroki Naganuma; Hideaki Iiduka (2025). Convergence Bound and Critical Batch Size of Muon Optimizer.
OP011: arXiv版参照(公刊状況を別途確認したものは注記)。本文該当節確認。2026 v5のCBS下界と未知定数・停止条件。
-
OP012 — Thang Do; Steffen Dereich; Arnulf Jentzen (2026). On MUON optimization: From non-convergence to an error analysis with Polar Express and the Newton-Schulz polynomial from implementations.
OP012: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。確率的な非収束例とNS近似誤差。
-
OP013 — Arthur C. B. de Oliveira; Dhruv D. Jatkar; Guilherme S. Vicinansa; Eduardo D. Sontag (2026). Convergence guarantees for Muon: New parameter regimes and generalizations.
OP013: arXiv版参照(公刊状況を別途確認したものは注記)。本文該当節確認。soft-sign variantの条件付き漸近保証。
-
OP014 — Mikail Khona; Aditya Vavre; Boxiang Wang; ほか (2026). SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales.
OP014: arXiv版参照(公刊状況を別途確認したものは注記)。本文該当節確認。2026年の大規模SOAP/Muonとlayer単位分散。
-
OP015 — James Martens; Roger Grosse (2015). Optimizing Neural Networks with Kronecker-factored Approximate Curvature.
OP015: arXiv版参照(公刊状況を別途確認したものは注記)。本文該当節確認。Kronecker近似natural gradientとdamping。
-
OP016 — Roger Grosse; James Martens (2016). A Kronecker-factored approximate Fisher matrix for convolution layers.
OP016: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。畳み込みへのFisher block近似。
-
OP017 — Runa Eschenhagen; Alexander Immer; Richard E. Turner; Frank Schneider; Philipp Hennig (2023). Kronecker-Factored Approximate Curvature for Modern Neural Network Architectures.
OP017: NeurIPS 2023。要旨確認。weight sharing、expand/reduceの区別。
-
OP018 — Jeremy Bernstein; Laker Newhouse (2024). Old Optimizer, New Norm: An Anthology.
OP018: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。ノルムからoptimizerを捉え直す。
-
OP019 — Noah Amsel; David Persson; Christopher Musco; Robert M. Gower (2025). The Polar Express: Optimal Matrix Sign Methods and Their Application to the Muon Algorithm.
OP019: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。行列polar近似の多項式設計。
-
OP020 — Zichong Li; Liming Liu; Chen Liang; Weizhu Chen; Tuo Zhao (2025). NorMuon: Making Muon more efficient and scalable.
OP020: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。neuron単位適応と直交化の組合せ。
-
OP021 — Priya Goyal; Piotr Dollár; Ross Girshick; ほか (2017). Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour.
OP021: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。linear scalingとwarmupの実験的基礎。
-
OP022 — Sam McCandlish; Jared Kaplan; Dario Amodei; OpenAI Dota Team (2018). An Empirical Model of Large-Batch Training.
OP022: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。noise scaleとbatchの経験モデル。
-
OP023 — Guodong Zhang; Lala Li; Zachary Nado; ほか (2019). Which Algorithmic Choices Matter at Which Batch Sizes? Insights From a Noisy Quadratic Model.
OP023: NeurIPS 2019。要旨確認。noisy quadraticによるoptimizer依存CBS。
-
OP024 — Yang You; Igor Gitman; Boris Ginsburg (2017). Large Batch Training of Convolutional Networks.
OP024: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。LARS、layer別update scale。
-
OP025 — Yang You; Jing Li; Sashank Reddi; ほか (2019). Large Batch Optimization for Deep Learning: Training BERT in 76 minutes.
OP025: ICLR 2020(arXiv初出2019)。要旨確認。LAMBとBERTの大バッチ学習。
-
OP026 — Zachary Nado; Justin M. Gilmer; Christopher J. Shallue; Rohan Anil; George E. Dahl (2021). A Large Batch Optimizer Reality Check: Traditional, Generic Optimizers Suffice Across Batch Sizes.
OP026: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。LARS/LAMB比較での強いbaseline。
-
OP027 — Aaron Defazio; Xingyu Alice Yang; Harsh Mehta; ほか (2024). The Road Less Scheduled.
OP027: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。scheduleとiterate averagingの統一。
-
OP028 — Fabian Schaipp; Alexander Hägele; Adrien Taylor; Umut Simsekli; Francis Bach (2025). The Surprising Agreement Between Convex Optimization Theory and Learning-Rate Scheduling for Large Model Training.
OP028: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。凸上界と実測scheduleの対応。
-
OP029 — Kaiyue Wen; Zhiyuan Li; Jason Wang; ほか (2024). Understanding Warmup-Stable-Decay Learning Rates: A River Valley Loss Landscape Perspective.
OP029: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。WSDのriver-valley仮説とWSD-S。
-
OP030 — Sebastian U. Stich (2018). Local SGD Converges Fast and Communicates Little.
OP030: ICLR 2019(arXiv初出2018)。要旨確認。local SGDの通信と凸収束率。
-
OP031 — Tao Lin; Sebastian U. Stich; Kumar Kshitij Patel; Martin Jaggi (2018). Don’t Use Large Mini-Batches, Use Local SGD.
OP031: ICLR 2020(arXiv初出2018)。要旨確認。post-local SGDの汎化と通信。
-
OP032 — Jianyu Wang; Vinayak Tantia; Nicolas Ballas; Michael Rabbat (2019). SlowMo: Improving Communication-Efficient Distributed SGD with Slow Momentum.
OP032: ICLR 2020(arXiv初出2019)。要旨確認。outer slow momentum。
-
OP033 — Arthur Douillard; Qixuan Feng; Andrei A. Rusu; ほか (2023). DiLoCo: Distributed Low-Communication Training of Language Models.
OP033: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。LLMをislandで低通信訓練。
-
OP034 — Bo Liu; Rachita Chhaparia; Arthur Douillard; ほか (2024). Asynchronous Local-SGD Training for Language Modeling.
OP034: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。非同期遅延とNesterovの干渉。
-
OP035 — Arthur Douillard; Keith Rush; Yani Donchev; ほか (2026). Decoupled DiLoCo for Resilient Distributed Pre-training.
OP035: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。障害耐性と非同期learner集約。
-
OP036 — H. Brendan McMahan; Eider Moore; Daniel Ramage; Seth Hampson; Blaise Agüera y Arcas (2016). Communication-Efficient Learning of Deep Networks from Decentralized Data.
OP036: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。FedAvgと非IID client。
-
OP037 — Sashank Reddi; Zachary Charles; Manzil Zaheer; ほか (2020). Adaptive Federated Optimization.
OP037: ICLR 2021(arXiv初出2020)。要旨確認。server側適応optimizer。
-
OP038 — Sai Praneeth Karimireddy; Satyen Kale; Mehryar Mohri; ほか (2019). SCAFFOLD: Stochastic Controlled Averaging for Federated Learning.
OP038: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。client driftをcontrol variateで補正。
-
OP039 — Ilya Loshchilov; Frank Hutter (2016). SGDR: Stochastic Gradient Descent with Warm Restarts.
OP039: ICLR 2017(arXiv初出2016)。要旨確認。cosine annealingとwarm restart。
-
OP040 — Samuel L. Smith; Pieter-Jan Kindermans; Chris Ying; Quoc V. Le (2017). Don’t Decay the Learning Rate, Increase the Batch Size.
OP040: ICLR 2018(arXiv初出2017)。要旨確認。LR減衰に代えるbatch増加。
-
OP041 — Binghui Li; Zilin Wang; Fengling Chen; ほか (2026). Optimal Learning Rate Schedules under Functional Scaling Laws: Power Decay and Warmup-Stable-Decay.
OP041: COLT 2026(arXiv採択注記を確認)。要旨確認。FSL/kernel設定でのtask依存schedule。
-
OP042 — Jiseok Chae; Donghwan Kim (2026). Understanding Schedule-Free Methods in Nonconvex Optimization: Rate Guarantees and Escaping Saddles.
OP042: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。Schedule-Free GD/SGDのnonconvex解析。
-
OP043 — Jianhao Ma; Yuxin Chen (2026). WSqD: A Horizon-Free Learning Rate Schedule for Large Model Training.
OP043: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。horizon非依存baseとterminal cooldown。
-
OP044 — Kwangjun Ahn; Byron Xu; Natalie Abreu; ほか (2025). Dion: Distributed Orthonormalized Updates.
OP044: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。shardingを考慮した低rank直交更新。
-
OP045 — Pierre Foret; Ariel Kleiner; Hossein Mobahi; Behnam Neyshabur (2020). Sharpness-Aware Minimization for Efficiently Improving Generalization.
OP045: arXiv版参照(公刊状況を別途確認したものは注記)。本文該当節確認。SAMの近傍最悪損失という目的。
-
OP046 — Maksym Andriushchenko; Dara Bahri; Hossein Mobahi; Nicolas Flammarion (2023). Sharpness-Aware Minimization Leads to Low-Rank Features.
OP046: NeurIPS 2023。要旨確認。SAMによるfeature rank低下。
-
OP047 — Kaiyue Wen; Tengyu Ma; Zhiyuan Li (2022). How Does Sharpness-Aware Minimization Minimize Sharpness?.
OP047: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。SAMが制御するsharpnessの種類。
-
OP048 — Ilya Loshchilov; Frank Hutter (2017). Decoupled Weight Decay Regularization.
OP048: ICLR 2019(arXiv初出2017)。要旨確認。適応前処理とweight decayの分離。
-
OP049 — Dougal Maclaurin; David Duvenaud; Ryan P. Adams (2015). Gradient-based Hyperparameter Optimization through Reversible Learning.
OP049: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。訓練軌跡を微分するhyperparameter最適化。
-
OP050 — Luca Franceschi; Michele Donini; Paolo Frasconi; Massimiliano Pontil (2017). Forward and Reverse Gradient-Based Hyperparameter Optimization.
OP050: ICML 2017。要旨確認。forward/reverse hypergradientの費用。
-
OP051 — Luca Franceschi; Paolo Frasconi; Saverio Salzo; Riccardo Grazzi; Massimilano Pontil (2018). Bilevel Programming for Hyperparameter Optimization and Meta-Learning.
OP051: ICML 2018。要旨確認。hyperparameter/meta-learningのbilevel定式化。
-
OP052 — Constantinos Daskalakis; Andrew Ilyas; Vasilis Syrgkanis; Haoyang Zeng (2017). Training GANs with Optimism.
OP052: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。GANの回転的dynamicsとoptimistic法。
-
OP053 — Atilim Gunes Baydin; Robert Cornish; David Martinez Rubio; Mark Schmidt; Frank Wood (2017). Online Learning Rate Adaptation with Hypergradient Descent.
OP053: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。LR自身へのonline微分。
-
OP054 — Max Jaderberg; Valentin Dalibard; Simon Osindero; ほか (2017). Population Based Training of Neural Networks.
OP054: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。populationを用いたschedule探索。
-
OP055 — Marcin Andrychowicz; Misha Denil; Sergio Gomez; ほか (2016). Learning to learn by gradient descent by gradient descent.
OP055: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。LSTMに更新則を学習させる。
-
OP056 — Irwan Bello; Barret Zoph; Vijay Vasudevan; Quoc V. Le (2017). Neural Optimizer Search with Reinforcement Learning.
OP056: ICML 2017。要旨確認。RLを用いた更新式探索。
-
OP057 — Hao-Jun Michael Shi; Tsung-Hsien Lee; Shintaro Iwasaki; ほか (2023). A Distributed Data-Parallel PyTorch Implementation of the Distributed Shampoo Optimizer for Training Neural Networks At-Scale.
OP057: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。分散Shampooの実装費用。
-
OP058 — Ziyue Liu; Ruijie Zhang; Zhengyang Wang; ほか (2026). Muon$^2$: Boosting Muon via Adaptive Second-Moment Preconditioning.
OP058: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。NS前の二次モーメント前処理。
-
OP059 — Noah Amsel; Jack Zhang; Kwangjun Ahn; ほか (2026). Dion3: Full-Stack Orthogonal Updates.
OP059: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。kernel・通信・部分行選択の協調。
-
OP060 — Dara Bahri; Hossein Mobahi; Yi Tay (2021). Sharpness-Aware Minimization Improves Language Model Generalization.
OP060: ACL 2022(arXiv初出2021)。要旨確認。言語モデルへのSAM適用。
-
OP061 — Haocheng Luo; Zehang Deng; Thanh-Toan Do; ほか (2026). Sharpness-Aware Minimization in Logit Space Efficiently Enhances Direct Preference Optimization.
OP061: ICLR 2026(arXiv採択注記を確認)。要旨確認。logit空間SAMとDPO。
-
OP062 — Maximilian Mueller; Tiffany Vlaar; David Rolnick; Matthias Hein (2023). Normalization Layers Are All That Sharpness-Aware Minimization Needs.
OP062: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。normalizationだけの摂動という反証的実験。
-
OP063 — Kaiyi Ji; Junjie Yang; Yingbin Liang (2020). Bilevel Optimization: Convergence Analysis and Enhanced Design.
OP063: ICML 2021(arXiv初出2020)。要旨確認。AID/ITDとstocBiOの収束条件。
-
OP064 — Riccardo Grazzi; Luca Franceschi; Massimiliano Pontil; Saverio Salzo (2020). On the Iteration Complexity of Hypergradient Computation.
OP064: ICML 2020。要旨確認。hypergradient計算の反復複雑度。
-
OP065 — Jeongyeol Kwon; Dohyun Kwon; Stephen Wright; Robert Nowak (2023). A Fully First-Order Method for Stochastic Bilevel Optimization.
OP065: ICML 2023。要旨確認。Hessian oracle不要のF2SA。
-
OP066 — Wu Lin; Scott C. Lowe; Felix Dangel; ほか (2025). Understanding and Improving Shampoo and SOAP via Kullback-Leibler Minimization.
OP066: ICLR 2026、arXiv v10は2026-06-22拡張版。要旨確認。共分散推定のKLによる再設計。
-
OP067 — Stefan Horoi; Benjamin Thérien; Guy Wolf; Eugene Belilovsky (2026). Can Model Merging Improve Aggregation in DiLoCo?.
OP067: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。model mergingをDiLoCo集約に戻す。
-
OP068 — Andrej Jovanović; Alex Iacob; Mher Safaryan; ほか (2026). LoRDO: Distributed Low-Rank Optimization with Infrequent Communication.
OP068: ICML 2026(arXiv採択注記を確認)。要旨確認。低rank更新と低通信の統合。
-
OP069 — Léon Bottou; Frank E. Curtis; Jorge Nocedal (2016). Optimization Methods for Large-Scale Machine Learning.
OP069: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。確率的一次法と曲率利用の全体史。
-
OP070 — Mark Tuddenham; Adam Prügel-Bennett; Jonathan Hare (2022). Orthogonalising gradients to speed up neural network optimisation.
OP070: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。Muon以前のgradient直交化。
-
OP071 — Mao Ye; Bo Liu; Stephen Wright; Peter Stone; Qiang Liu (2022). BOME! Bilevel Optimization Made Easy: A Simple First-Order Approach.
OP071: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。value-function型first-order bilevel法。
-
OP072, FM076 — Martin Heusel; Hubert Ramsauer; Thomas Unterthiner; Bernhard Nessler; Sepp Hochreiter (2017). GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium.
OP072: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。TTURの仮定、Nashとbilevelの境界。
FM076: NeurIPS 2017。要旨確認。二時間尺度学習とFID
-
OP073 — Risheng Liu; Jiaxin Gao; Jin Zhang; Deyu Meng; Zhouchen Lin (2021). Investigating Bi-Level Optimization for Learning and Vision from a Unified Perspective: A Survey and Beyond.
OP073: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。bilevel問題と算法の整理。
-
OP074 — Laurent Dinh; Razvan Pascanu; Samy Bengio; Yoshua Bengio (2017). Sharp Minima Can Generalize For Deep Nets.
OP074: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。flatnessの再パラメータ化依存。
-
OP075 — Jan Harold Alcantara; Masahiro Inoue; Akiko Takeda (2026). Improved KKT Complexity for First-Order Bilevel Optimization under Weak Lower-Level Convexity.
OP075: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。weakly convex innerとrelaxed KKT。
-
OP076 — Zihao Zheng; Irwin King; Songtao Lu (2026). Bilevel Optimization over Saddle Points of Zero-Sum Markov Games.
OP076: ICML 2026(arXiv採択注記を確認)。要旨確認。下位Markov gameに対するbilevel法。
-
OP077 — Lev McKinney; Anvith Thudi; Juhan Bae; ほか (2026). Gauss-Newton Unlearning for the LLM Era.
OP077: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。曲率をLLM unlearningへ利用。
-
OP078 — John Duchi; Elad Hazan; Yoram Singer (2011). Adaptive Subgradient Methods for Online Learning and Stochastic Optimization.
OP078: JMLR 12(61), 2011。要旨確認。AdaGrad、累積統計と幾何。
-
OP079 — Sashank J. Reddi; Satyen Kale; Sanjiv Kumar (2018). On the Convergence of Adam and Beyond.
OP079: ICLR 2018(著者所属機関の論文ページ)。要旨確認。Adamの反例とAMSGrad。
-
OP080 — Shun-ichi Amari (1998). Natural Gradient Works Efficiently in Learning.
OP080: Neural Computation 10(2):251–276, 1998。要旨確認。Fisher幾何による自然勾配の原典。
-
OP081 — Magnus R. Hestenes; Eduard Stiefel (1952). Methods of Conjugate Gradients for Solving Linear Systems.
OP081: Journal of Research of the National Bureau of Standards 49(6):409–436, 1952。要旨確認。対称正定値系を解くCGの原典。
-
OP082 — Kenneth Levenberg (1944). A Method for the Solution of Certain Non-Linear Problems in Least Squares.
OP082: Quarterly of Applied Mathematics 2(2):164–168, 1944。原典アクセス403、Marquardt出版社参考文献と書誌を照合。書誌確認。LM系の歴史的原典、書誌のみ。
-
OP083 — Donald W. Marquardt (1963). An Algorithm for Least-Squares Estimation of Nonlinear Parameters.
OP083: Journal of the Society for Industrial and Applied Mathematics 11(2):431–441, 1963。2006は電子公開年。書誌確認。damped nonlinear least squaresの原典、書誌のみ。
-
OP084 — James Martens (2010). Deep Learning via Hessian-Free Optimization.
OP084: ICML 2010。本文該当節確認。matrix-vector product・CG・dampingを結ぶ。
-
OP085 — David Carlson; Volkan Cevher; Lawrence Carin (2015). Stochastic Spectral Descent for Restricted Boltzmann Machines.
OP085: AISTATS 2015, PMLR 38:111–119。要旨確認。spectral normによるMuon以前の最適化。
-
OP086 — Keller Jordan (2024). Muon: An optimizer for hidden layers in neural networks.
OP086: 提案者の技術記事、2024-12-08(2025追記あり、査読論文ではない)。一次資料確認。Muonの定義・有限NS反復・仮説の一次記事。
-
OP087 — Jungmin Kwon; Jeongseop Kim; Hyunseo Park; In Kwon Choi (2021). ASAM: Adaptive Sharpness-Aware Minimization for Scale-Invariant Learning of Deep Neural Networks.
OP087: ICML 2021, PMLR 139:5905–5914。要旨確認。scaleを考慮したSAM摂動。
-
OP088 — Hong Liu; Zhiyuan Li; David Hall; Percy Liang; Tengyu Ma (2023). Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training.
OP088: arXiv版参照。要旨確認。対角Hessian推定とclippingによる言語モデル学習。
-
OP089 — Konstantin Mishchenko; Aaron Defazio (2023). Prodigy: An Expeditiously Adaptive Parameter-Free Learner.
OP089: arXiv版参照。要旨確認。距離推定による学習率適応。D-Adaptationとの関係。
-
OP090 — Shohei Taniguchi; Keno Harada; Gouki Minegishi; ほか (2024). ADOPT: Modified Adam Can Converge with Any β₂ with the Optimal Rate.
OP090: NeurIPS 2024(arXiv Commentsで確認)。要旨確認。momentumと正規化の順序、二次モーメント推定の変更。
-
OP091 — Xi-Lin Li (2015). Preconditioned Stochastic Gradient Descent.
OP091: arXiv初出2015、TNNLS版へのDOIあり。要旨確認。パラメータ・勾配摂動からの前処理推定。
-
OA001 — James Bergstra・Yoshua Bengio (2012). Random Search for Hyper-Parameter Optimization.
OA001: JMLR 13(10), 281–305 (2012)。要旨確認。探索予算を揃えたrandom searchの基準。LR scale専用手法ではなく一般HPO
-
OA002 — Jasper Snoek ほか (2012). Practical Bayesian Optimization of Machine Learning Algorithms.
OA002: arXiv preprint(会議版未再照合)。要旨確認。GPに基づくBayesian optimization。学習試行の費用・並列性も考慮
-
OA003 — Yuhuai Wu ほか (2018). Understanding Short-Horizon Bias in Stochastic Meta-Optimization.
OA003: ICLR 2018。要旨確認。短いunrollのmeta objectiveが小さすぎる学習率を選ぶbias
-
OA004 — Michele Donini ほか (2020). Marthe: Scheduling the Learning Rate Via Online Hypergradients.
OA004: IJCAI 2020, 2119–2125(この会議版を照合)。要旨確認。過去の学習軌跡から低費用にhypergradientを近似
-
OA005 — Tom Schaul ほか (2012). No More Pesky Learning Rates.
OA005: arXiv preprint(出版版未再照合)。要旨確認。局所的な勾配変動を使う複数学習率の適応
-
OA006 — Olga Wichrowska ほか (2017). Learned Optimizers that Scale and Generalize.
OA006: ICML 2017。要旨確認。階層RNNで学習したoptimizerの規模・タスク間転移
-
OA007 — Leslie N. Smith ほか (2017). Super-Convergence: Very Fast Training of Neural Networks Using Large Learning Rates.
OA007: arXiv preprint。要旨確認。大きい最大LRと一周期schedule、他正則化との釣合い
-
OA008 — Robin M. Schmidt ほか (2020). Descending through a Crowded Valley - Benchmarking Deep Learning Optimizers.
OA008: arXiv preprint(会議版未再照合)。要旨確認。多数のoptimizerと設定を共通予算で比べる実証的基準
-
OA009 — Yikang Shen ほか (2024). Power Scheduler: A Batch Size and Token Number Agnostic Learning Rate Scheduler.
OA009: arXiv preprint(元リンクのv1を確認)。要旨確認。batch・学習tokenとLRの関係を近似し転移を検証
-
OA010 — Zhao Song ほか (2023). An Automatic Learning Rate Schedule Algorithm for Achieving Faster Convergence and Steeper Descent.
OA010: arXiv preprint。要旨確認。Regrettable Delta-Bar-Deltaで不適切なLR更新を修正
-
OA011 — Yuchen Jin ほか (2021). AutoLRS: Automatic Learning-Rate Schedule by Bayesian Optimization on the Fly.
OA011: ICLR 2021。要旨確認。短い試行からlossを予測し段階別LRをBayesian optimization
-
OA012 — Xingyu Xie ほか (2024). Optimization Hyper-parameter Laws for Large Language Models.
OA012: arXiv preprint(元リンクのv1を確認、最新版は2026改訂)。要旨確認。SDEから動的hyperparameterと損失の関係をモデル化
-
OA013 — Kairong Luo ほか (2025). A Multi-Power Law for Loss Curve Prediction Across Learning Rate Schedules.
OA013: arXiv preprint。要旨確認。累積LRと減衰効果から未知scheduleの損失曲線を予測
-
OA014 — Yuki Tsukada ほか (2023). Relationship between Batch Size and Number of Steps Needed for Nonconvex Optimization of Stochastic Gradient Descent using Armijo Line Search.
OA014: arXiv preprint。要旨確認。Armijo SGDのbatch数・step数・SFO費用の条件付き解析
-
OA015 — Tao Zhang ほか (2020). kDecay: Just adding k-decay items on Learning-Rate Schedule to improve Neural Networks.
OA015: arXiv preprint。要旨確認。既存scheduleの形状をkで変える経験的設計
-
OA016 — Prabhu Teja Sivaprasad ほか (2019). Optimizer Benchmarking Needs to Account for Hyperparameter Tuning.
OA016: ICML 2020。要旨確認。optimizerの比較にhyperparameter探索費用を含める
-
OA017 — Zixiang Chen ほか (2023). Why Does Sharpness-Aware Minimization Generalize Better Than SGD?.
OA017: NeurIPS 2023。要旨確認。特定データモデル・二層ReLU CNNでnoise学習抑制を説明
-
OA018 — Szilvia Ujváry ほか (2022). Rethinking Sharpness-Aware Minimization as Variational Inference.
OA018: arXiv preprint。要旨確認。SAMとmean-field variational inferenceの摂動勾配の関係
-
OA019 — Thomas Möllenhoff ほか (2022). SAM as an Optimal Relaxation of Bayes.
OA019: ICLR 2023。要旨確認。Bayes目的の凸緩和としてSAMを解釈し不確実性へ接続
-
OA020 — Jean Kaddour ほか (2022). When Do Flat Minima Optimizers Work?.
OA020: NeurIPS 2022。要旨確認。SWA/SAMを画像・言語・graphの異なるタスクで比較
-
OA021 — Simran Kaur ほか (2022). On the Maximum Hessian Eigenvalue and Generalization.
OA021: NeurIPS 2022 workshop; PMLR 187, 51–65 (2023)。要旨確認。最大Hessian固有値の低下と汎化改善が分離する実験
-
OA022 — Sidak Pal Singh ほか (2023). The Hessian perspective into the Nature of Convolutional Neural Networks.
OA022: ICML 2023。要旨確認。CNN構造とHessian rankの関係。線形活性化の理論と実験を区別
-
OA023 — Harsh Rangwani ほか (2022). Escaping Saddle Points for Effective Generalization on Class-Imbalanced Data.
OA023: NeurIPS 2022。要旨確認。クラス不均衡の少数クラス損失におけるsaddle脱出
-
OA024 — Georgios Arvanitidis ほか (2017). Latent Space Oddity: on the Curvature of Deep Generative Models.
OA024: ICLR 2018。要旨確認。生成器のpullback幾何。パラメータ損失sharpnessとは別の曲率
-
OA025 — Hongyang R. Zhang ほか (2023). Noise Stability Optimization for Finding Flat Minima: A Hessian-based Regularization Approach.
OA025: arXiv preprint(2024年改訂題名)。要旨確認。両方向noiseでHessian trace正則化を推定
-
OA026 — Kayhan Behdin ほか (2022). Improved Deep Neural Network Generalization Using m-Sharpness-Aware Minimization.
OA026: arXiv preprint。要旨確認。mini-batchを分割したmSAMの性能・費用・感度を比較
-
OA027 — Peng Mi ほか (2022). Make Sharpness-Aware Minimization Stronger: A Sparsified Perturbation Approach.
OA027: NeurIPS 2022。要旨確認。Fisher/dynamic sparse maskでSAMの摂動を疎にする
-
OA028 — Tom Sherborne ほか (2023). TRAM: Bridging Trust Regions and Sharpness Aware Minimization.
OA028: ICLR 2024 spotlight。要旨確認。パラメータ近傍と関数空間のtrust regionをfine-tuningで結ぶ
-
OA029 — Yong Liu ほか (2022). Random Sharpness-Aware Minimization.
OA029: NeurIPS 2022。要旨確認。random smoothingで内側maxの一段近似を改善
-
OA030 — Yang Zhao ほか (2022). Randomized Sharpness-Aware Training for Boosting Computational Efficiency in Deep Learning.
OA030: arXiv preprint。要旨確認。SAM/通常更新を確率的に切替え追加逆伝播を節約
-
OA031 — Yong Liu ほか (2022). Towards Efficient and Scalable Sharpness-Aware Minimization.
OA031: CVPR 2022。要旨確認。LookSAMで摂動方向の計算を周期化し大バッチへ展開
-
OA032 — Hao Sun ほか (2023). AdaSAM: Boosting Sharpness-Aware Minimization with Adaptive Learning Rate and Momentum for Training Deep Neural Networks.
OA032: arXiv preprint。要旨確認。adaptive LR・momentum・SAMの結合を非凸設定で解析
-
OA033 — Xiangning Chen ほか (2021). When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations.
OA033: ICLR 2022 spotlight。要旨確認。SAMを用いたViT/MLP-Mixerの事前学習なし条件の比較
-
OA034 — Qihuang Zhong ほか (2022). Improving Sharpness-Aware Minimization with Fisher Mask for Better Generalization on Language Models.
OA034: Findings of EMNLP 2022, 4064–4085。要旨確認。言語モデルfine-tuningでFisher maskを使うFSAM
-
OA035 — Rajhans Singh ほか (2022). Improving Shape Awareness and Interpretability in Deep Networks Using Geometric Moments.
OA035: CVPR 2023 Workshop: Deep Learning for Geometric Computing。要旨確認。幾何momentによるshape表現。SAM手法ではなく周辺アーキテクチャ研究
-
OA036 — Feng Chen ほか (2023). Stochastic Collapse: How Gradient Noise Attracts SGD Dynamics Towards Simpler Subnetworks.
OA036: NeurIPS 2023。要旨確認。SGD noiseによる疎・低rank不変集合への引力とimplicit bias
-
OA037 — Florian Seligmann ほか (2023). Beyond Deep Ensembles: A Large-Scale Evaluation of Bayesian Deep Learning under Distribution Shift.
OA037: arXiv preprint(出版版未再照合)。要旨確認。分布変化下のBayesian近似・ensembleとcalibrationの比較
-
OA039 — Li Wang ほか (2022). The Implicit Regularization of Momentum Gradient Descent with Early Stopping.
OA039: arXiv preprint。要旨確認。最小二乗でearly stopping付きmomentum flowをridgeと比較
-
OB001 — James Martens (2020). New Insights and Perspectives on the Natural Gradient Method.
OB001: JMLR 21(146):1–76, 2020, published。要旨確認。Fisher・GGN・damping・再parameterizationの関係を整理
-
OB002 — Christopher J. Shallue; Jaehoon Lee; Joseph Antognini; Jascha Sohl-Dickstein; Roy Frostig; George E. Dahl (2019). Measuring the Effects of Data Parallelism on Neural Network Training.
OB002: JMLR 20(112):1–49, 2019, published。要旨確認。batch比較におけるtuning・計算budgetの交絡を大規模に測定
-
OB003 — Shuai Zheng; Haibin Lin; Sheng Zha; Mu Li (2020). Accelerated Large Batch Optimization of BERT Pretraining in 54 minutes.
OB003: technical report, 2020; arXiv明記で査読venueなし。要旨確認。LANSと学習率scheduleによるBERTの大batch訓練
-
OB004 — Raghu Bollapragada; Richard Byrd; Jorge Nocedal (2018). Adaptive Sampling Strategies for Stochastic Optimization.
OB004: SIAM Journal on Optimization, 2018, published; arXiv初稿2017。要旨確認。内積testにより勾配推定のsample数を調整
-
OB005 — Tim Tsz-Kit Lau; Han Liu; Mladen Kolar (2026). AdAdaGrad: Adaptive Batch Size Schemes for Adaptive Gradient Methods.
OB005: Statistical Learning and Data Science, online 2026-08-11, in press / journal pre-proof(出版社検索取得書誌); arXiv初稿2024、v4 2026-08-25。要旨確認。AdaGrad系の更新と適応batchの相互作用を解析
-
OB006 — Zhengda Bian; Shenggui Li; Wei Wang; Yang You (2021). Online Evolutionary Batch Size Orchestration for Scheduling Deep Learning Workloads in GPU Clusters.
OB006: SC 2021 acceptedとの著者arXiv記載;初稿2021。要旨確認。batch変更とGPU job配置を同時に考えるONES
-
OB007 — Xiaoxin He; Fuzhao Xue; Xiaozhe Ren; Yang You (2021). Large-Scale Deep Learning Optimizations: A Comprehensive Survey.
OB007: arXiv survey公開2021;正式刊行版未照合。要旨確認。精度・通信・memoryから大規模訓練を整理
-
OB008 — Lukas Balles; Fabian Pedregosa; Nicolas Le Roux (2020). The Geometry of Sign Gradient Descent.
OB008: arXiv公開2020;正式刊行版未照合。要旨確認。sign更新をℓ∞幾何とHessian構造から理解
-
OB009 — Róisín Luo; James McDermott; Christian Gagné; Qiang Sun; Colm O’Riordan (2025). Optimization-Induced Dynamics of Lipschitz Continuity in Neural Networks.
OB009: preprint; submitted 2025-06-23, revised 2025-11-14。要旨確認。SGD noiseとLipschitz量の変化をSDEで記述
-
OB010 — Ke Liang Xiao; Noah Marshall; Atish Agarwala; Elliot Paquette (2025). Exact Risk Curves of signSGD in High-Dimensions: Quantifying Preconditioning and Noise-Compression Effects.
OB010: ICML 2025, PMLR 267:68391–68439; arXiv初稿2024、v3 2026-03-25。要旨確認。高次元signSGDのリスク曲線を前処理とnoise効果へ分解
-
OB011 — Shikai Qiu; Lechao Xiao; Andrew Gordon Wilson; Jeffrey Pennington; Atish Agarwala (2025). Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks.
OB011: ICML 2025, PMLR 267:50697–50720, published。要旨確認。compute-optimal訓練曲線の正規化とsupercollapse
-
OB012 — Xiangru Lian; Ce Zhang; Huan Zhang; Cho-Jui Hsieh; Wei Zhang; Ji Liu (2017). Can Decentralized Algorithms Outperform Centralized Algorithms? A Case Study for Decentralized Parallel Stochastic Gradient Descent.
OB012: NeurIPS 2017, published。要旨確認。通信graph上のSGDと中央node通信bottleneckを比較
-
OB013 — Tao Lin; Lingjing Kong; Sebastian U. Stich; Martin Jaggi (2020). Extrapolation for Large-batch Training in Deep Learning.
OB013: ICML 2020, PMLR 119:6094–6104, published。要旨確認。extragradientによる大batch訓練軌道の制御
-
OB014 — Michael Diskin; Alexey Bukhtiyarov; Max Ryabinin; Lucile Saulnier; Quentin Lhoest; Anton Sinitsin; Dmitry Popov; Dmitry Pyrkin; Maxim Kashirin; Alexander Borzunov; Albert Villanova del Moral; Denis Mazur; Ilia Kobelev; Yacine Jernite; Thomas Wolf; Gennady Pekhimenko (2021). Distributed Deep Learning in Open Collaborations.
OB014: NeurIPS 2021 acceptedとの著者arXiv記載。要旨確認。異質帯域・参加者を考慮したDeDLOC
-
OB015 — Sohom Mukherjee; Nicolas Loizou; Sebastian U. Stich (2023). Locally Adaptive Federated Learning.
OB015: arXiv初稿2023、v2 2024-05-14;正式刊行版未照合。要旨確認。clientごとに異なるstep sizeで局所geometryを利用
-
OB016 — Belhal Karimi; Ping Li; Xiaoyun Li (2023). Layer-wise and Dimension-wise Locally Adaptive Federated Learning.
OB016: UAI 2023, PMLR 216:1037–1046; arXiv初稿2021、刊行題名はFed-LAMBで始まる。要旨確認。層ごと・次元ごとの適応をFLに導入
-
OB017 — John Nguyen; Kshitiz Malik; Hongyuan Zhan; Ashkan Yousefpour; Michael Rabbat; Mani Malek; Dzmitry Huba (2022). Federated Learning with Buffered Asynchronous Aggregation.
OB017: AISTATS 2022, PMLR 151:3581–3607, published; arXiv初稿2021。要旨確認。非同期更新のbuffer集約とSecure Aggregationの両立
-
OB018 — Anastasia Koloskova; Sebastian U. Stich; Martin Jaggi (2019). Decentralized Stochastic Optimization and Gossip Algorithms with Compressed Communication.
OB018: ICML 2019, PMLR 97:3478–3487, published;記載URLはarXiv初稿。要旨確認。圧縮gossipのconsensusとSGDの収束率を区別
-
OB019 — Kai Chen; Qiang Huo (2016). Scalable Training of Deep Learning Machines by Incremental Block Training with Intra-block Parallel Optimization and Blockwise Model-Update Filtering.
OB019: ICASSP 2016, March 2016;著者所属機関の公開書誌・要旨確認。要旨確認。blockwise update filteringを用いた分散音声モデル訓練
-
OB020 — Depen Morwani; Itai Shapira; Nikhil Vyas; Eran Malach; Sham Kakade; Lucas Janson (2025). A New Perspective on Shampoo’s Preconditioner.
OB020: ICLR 2025, published; arXiv初稿2024。要旨確認。Shampoo近似の二乗とKronecker近似のpower iterationの関係
-
OB021 — Fan Bao; Guoqiang Wu; Chongxuan Li; Jun Zhu; Bo Zhang (2021). Stability and Generalization of Bilevel Programming in Hyperparameter Optimization.
OB021: NeurIPS 2021, published。要旨確認。validation dataに対する安定性とhyperparameter過適合
-
OB022 — Hanxiao Liu; Karen Simonyan; Yiming Yang (2019). DARTS: Differentiable Architecture Search.
OB022: ICLR 2019 publishedとの著者arXiv記載;初稿2018。要旨確認。離散architecture searchを連続緩和で微分可能にする
-
OB023 — Thomas M. Moerland; Joost Broekens; Aske Plaat; Catholijn M. Jonker (2023). Model-based Reinforcement Learning: A Survey.
OB023: Foundations and Trends in Machine Learning 16(1):1–118, 2023(出版社公開書誌確認); arXiv初稿2020。要旨確認。モデル学習とplanningの組合せを整理し二段学習とbilevelを区別
-
OB024 — Dongsung Huh; Avinash Baidya (2022). The Missing Invariance Principle Found – the Reciprocal Twin of Invariant Risk Minimization.
OB024: NeurIPS 2022との著者arXiv記載。要旨確認。labelで条件付けた表現の不変性MRIを提案
-
OB025 — Yihua Zhang; Pranay Sharma; Parikshit Ram; Mingyi Hong; Kush Varshney; Sijia Liu (2023). What Is Missing in IRM Training and Evaluation? Challenges and Solutions.
OB025: ICLR 2023 acceptedとの著者arXiv記載。要旨確認。batch・評価環境・consensus制約からIRMを再検討
-
OB026 — Ryo Sato; Mirai Tanaka; Akiko Takeda (2021). A Gradient Method for Multilevel Optimization.
OB026: NeurIPS 2021 camera-readyとの著者arXiv記載。要旨確認。内側反復の展開を多段問題へ拡張
-
OB027 — 本川 哲哉; 手塚 太郎 (2019). ニューラルネットワークにおける適応的二次最適化手法.
OB027: DEIM Forum 2019, A4-2, 公開研究会論文。要旨確認。Hessian-free法にmomentumとAdamの工夫を組み合わせる
-
OB028 — 矢部 博 (1987). 共役勾配法.
OB028: オペレーションズ・リサーチ 32(6), pp.363–367, 1987, 学会解説。本文該当節確認。線形CGの共役性と非線形拡張を日本語で説明
-
OB029 — 八巻 直一; 矢部 博 (1995). 非線形計画法(3)—無制約最適化問題—.
OB029: オペレーションズ・リサーチ 40(1), pp.55–60, 1995, 学会解説。書誌確認。無制約最適化法の関係を整理する既存引用資料
汎化・分布シフト・校正・公平性(主登録147件)
章本文。他章との共通文献には複数IDを併記する。
-
GE01 — Masashi Sugiyama; Matthias Krauledat; Klaus-Robert Müller (2007). Covariate Shift Adaptation by Importance Weighted Cross Validation.
GE01: JMLR 2007。要旨確認。共変量シフトでの重み付きCV。条件付き分布不変とsupportが必要。
-
GE02 — Zachary C. Lipton; Yu-Xiang Wang; Alexander J. Smola (2018). Detecting and Correcting for Label Shift with Black Box Predictors.
GE02: ICML 2018。本文該当節確認。BBSE。本文§3–4のlabel shift・support・混同行列可逆性を確認。
-
GE03 — Shai Ben-David; John Blitzer; Koby Crammer; Alex Kulesza; Fernando Pereira; Jennifer Wortman Vaughan (2009). A theory of learning from different domains.
GE03: online 2009; Machine Learning 2010。要旨確認。source誤差、domain divergence、共通予測可能性によるDA理論。
-
GE04 — Yaroslav Ganin; Evgeniya Ustinova; Hana Ajakan; Pascal Germain; Hugo Larochelle; François Laviolette; Mario Marchand; Victor Lempitsky (2015). Domain-Adversarial Training of Neural Networks.
GE04: arXiv 2015; JMLR 2016。要旨確認。DANN。sourceラベルとunlabeled targetを使うDA。
-
GE05 — Martin Arjovsky; Léon Bottou; Ishaan Gulrajani; David Lopez-Paz (2019). Invariant Risk Minimization.
GE05: arXiv preprint。要旨確認。環境間で共通の最適分類器を持つ表現という目標。
-
GE06 — David Krueger; Ethan Caballero; Joern-Henrik Jacobsen; Amy Zhang; Jonathan Binas; Dinghuai Zhang; Remi Le Priol; Aaron Courville (2020). Out-of-Distribution Generalization via Risk Extrapolation (REx).
GE06: arXiv 2020; ICML 2021。要旨確認。環境ごとのrisk分散を抑制するV-REx。
-
GE07 — Shiori Sagawa; Pang Wei Koh; Tatsunori B. Hashimoto; Percy Liang (2019). Distributionally Robust Neural Networks for Group Shifts: On the Importance of Regularization for Worst-Case Generalization.
GE07: arXiv 2019; ICLR 2020。要旨確認。group DROと正則化・early stoppingの重要性。
-
GE08 — Ishaan Gulrajani; David Lopez-Paz (2020). In Search of Lost Domain Generalization.
GE08: arXiv 2020; ICLR 2021。要旨確認。DomainBed。model selectionを含めた統一評価。
-
GE09 — Pang Wei Koh; Shiori Sagawa; et al. (2020). WILDS: A Benchmark of in-the-Wild Distribution Shifts.
GE09: arXiv 2020; ICML 2021。要旨確認。病院・時刻・地域等の自然なシフトを標準化。
-
GE10 — Dan Hendrycks; Thomas Dietterich (2019). Benchmarking Neural Network Robustness to Common Corruptions and Perturbations.
GE10: ICLR 2019。要旨確認。ImageNet-C/P。通常のcorruptionとadversarial perturbationを分ける。
-
GE11 — Alexandre Rame; Corentin Dancette; Matthieu Cord (2021). Fishr: Invariant Gradient Variances for Out-of-Distribution Generalization.
GE11: arXiv 2021; ICML 2022。本文該当節確認。本文§3.2の勾配分散とFisher/Hessianの条件付き関係を確認。
-
GE12 — Mitchell Wortsman; Gabriel Ilharco; et al. (2021). Robust fine-tuning of zero-shot models.
GE12: arXiv 2021; CVPR 2022。要旨確認。WiSE-FT。zero-shotとfine-tunedの重みを補間。
-
GE13, SY012 — Mitchell Wortsman; Gabriel Ilharco; et al. (2022). Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time.
GE13: ICML 2022。要旨確認。同じ事前学習モデルからの重み平均による精度・頑健性改善。
SY012: ICML 2022。要旨確認。共通初期値からのmodel weight平均。
-
GE14 — Dequan Wang; Evan Shelhamer; Shaoteng Liu; Bruno Olshausen; Trevor Darrell (2020). Tent: Fully Test-time Adaptation by Entropy Minimization.
GE14: arXiv 2020; ICLR 2021。要旨確認。test entropyを最小化しnormalizationパラメータを更新。
-
GE15 — Qin Wang; Olga Fink; Luc Van Gool; Dengxin Dai (2022). Continual Test-Time Domain Adaptation.
GE15: CVPR 2022。要旨確認。CoTTA。誤差蓄積と忘却に対応する継続適応。
-
GE16 — Shuaicheng Niu; Jiaxiang Wu; Yifan Zhang; Yaofo Chen; Shijian Zheng; Peilin Zhao; Mingkui Tan (2022). Efficient Test-Time Model Adaptation without Forgetting.
GE16: ICML 2022。要旨確認。EATA。sample選択とFisher正則化。
-
GE17 — Shuaicheng Niu; Jiaxiang Wu; Yifan Zhang; Zhiquan Wen; Yaofo Chen; Peilin Zhao; Mingkui Tan (2023). Towards Stable Test-Time Adaptation in Dynamic Wild World.
GE17: ICLR 2023。要旨確認。SAR。batch size、混合シフト、label imbalanceによる崩壊を検討。
-
GE18 — Hao Zhao; Yuejiang Liu; Alexandre Alahi; Tao Lin (2023). On Pitfalls of Test-Time Adaptation.
GE18: ICML 2023。要旨確認。TTAB。モデル選択・事前学習品質・shift種類の影響。
-
GE19 — Zehao Xiao; Cees G. M. Snoek (2024). Beyond Model Adaptation at Test Time: A Survey.
GE19: arXiv preprint。要旨確認。model/inference/normalization/sample/promptという整理を提供。
-
GE20 — Dan Hendrycks; Kevin Gimpel (2016). A Baseline for Detecting Misclassified and Out-of-Distribution Examples in Neural Networks.
GE20: arXiv 2016; ICLR 2017。要旨確認。最大softmax確率による検出baseline。
-
GE21 — Shiyu Liang; Yixuan Li; R. Srikant (2017). Enhancing The Reliability of Out-of-distribution Image Detection in Neural Networks.
GE21: arXiv 2017; ICLR 2018。要旨確認。ODIN。temperatureと入力摂動。
-
GE22 — Dan Hendrycks; Mantas Mazeika; Thomas Dietterich (2018). Deep Anomaly Detection with Outlier Exposure.
GE22: arXiv 2018; ICLR 2019。要旨確認。補助outlier dataによる検出器の訓練。
-
GE23 — Weitang Liu; Xiaoyun Wang; John D. Owens; Yixuan Li (2020). Energy-based Out-of-distribution Detection.
GE23: NeurIPS 2020。要旨確認。log-sum-exp energyを用いたスコアと学習。
-
GE24 — Hongxin Wei; Renchunzi Xie; Hao Cheng; Lei Feng; Bo An; Yixuan Li (2022). Mitigating Neural Network Overconfidence with Logit Normalization.
GE24: ICML 2022。要旨確認。LogitNorm。logit normの学習上の影響を分離。
-
GE25 — Jingkang Yang; Pengyun Wang; et al. (2022). OpenOOD: Benchmarking Generalized Out-of-Distribution Detection.
GE25: NeurIPS 2022 Datasets and Benchmarks。要旨確認。OOD detectionの統一benchmark。
-
GE26 — Jingyang Zhang; Jingkang Yang; et al. (2023). OpenOOD v1.5: Enhanced Benchmark for Out-of-Distribution Detection.
GE26: DMLR採択表示(arXiv v5, 2024-12-16)。要旨確認。ImageNet、foundation model、semantic/covariate同時シフトへ拡張。
-
GE27 — Jingkang Yang; Kaiyang Zhou; Yixuan Li; Ziwei Liu (2021). Generalized Out-of-Distribution Detection: A Survey.
GE27: arXiv survey(2024改訂版確認)。要旨確認。anomaly/novelty/open-set/OOD/outlierのtaxonomy。
-
GE28 — Chuan Guo; Geoff Pleiss; Yu Sun; Kilian Q. Weinberger (2017). On Calibration of Modern Neural Networks.
GE28: ICML 2017。本文該当節確認。本文§2のECE定義・NLLとtemperature scalingの位置付け。
-
GE29 — Tilmann Gneiting; Adrian E. Raftery (2007). Strictly Proper Scoring Rules, Prediction, and Estimation.
GE29: JASA 2007。要旨確認。確率予測のproper scoring ruleを整理。
-
GE30 — Jeremy Nixon; Mike Dusenberry; Ghassen Jerfel; Timothy Nguyen; Jeremiah Liu; Linchuan Zhang; Dustin Tran (2019). Measuring Calibration in Deep Learning.
GE30: arXiv preprint(2020改訂)。要旨確認。SCE/ACE等、校正測定の設計依存性。
-
GE31 — Aviral Kumar; Sunita Sarawagi; Ujjwal Jain (2018). Trainable Calibration Measures for Neural Networks from Kernel Mean Embeddings.
GE31: ICML 2018。要旨確認。kernel mean embeddingに基づくMMCE。
-
GE32 — Ananya Kumar; Percy Liang; Tengyu Ma (2019). Verified Uncertainty Calibration.
GE32: NeurIPS 2019。要旨確認。scaling-binning、有限標本推定の信頼性。
-
GE33 — Jarosław Błasiok; Parikshit Gopalan; Lunjia Hu; Preetum Nakkiran (2022). A Unifying Theory of Distance from Calibration.
GE33: arXiv 2022; STOC 2023。本文該当節確認。本文のECE連続性・推定可能性とconsistent calibration measureを確認。
-
GE34 — Meelis Kull; Miquel Perello-Nieto; Markus Kängsepp; Telmo Silva Filho; Hao Song; Peter Flach (2019). Beyond temperature scaling: Obtaining well-calibrated multiclass probabilities with Dirichlet calibration.
GE34: NeurIPS 2019。要旨確認。多クラス確率のDirichlet calibration。
-
GE35 — Jishnu Mukhoti; Viveka Kulharia; Amartya Sanyal; Stuart Golodetz; Philip H. S. Torr; Puneet K. Dokania (2020). Calibrating Deep Neural Networks using Focal Loss.
GE35: NeurIPS 2020。要旨確認。学習時lossから校正改善を検討。
-
GE36 — Matthias Minderer; Josip Djolonga; Rob Romijnders; Frances Hubis; Xiaohua Zhai; Neil Houlsby; Dustin Tran; Mario Lucic (2021). Revisiting the Calibration of Modern Neural Networks.
GE36: NeurIPS 2021。要旨確認。モデル世代・architectureで校正傾向を再評価。
-
GE37 — Balaji Lakshminarayanan; Alexander Pritzel; Charles Blundell (2016). Simple and Scalable Predictive Uncertainty Estimation using Deep Ensembles.
GE37: arXiv 2016; NeurIPS 2017。要旨確認。独立訓練ensembleによる予測不確実性。
-
GE38 — Yarin Gal; Zoubin Ghahramani (2015). Dropout as a Bayesian Approximation: Representing Model Uncertainty in Deep Learning.
GE38: arXiv 2015; ICML 2016。要旨確認。MC dropoutと近似Bayes推論の接続。
-
GE39 — Yaniv Ovadia; Emily Fertig; Jie Ren; Zachary Nado; D Sculley; Sebastian Nowozin; Joshua V. Dillon; Balaji Lakshminarayanan; Jasper Snoek (2019). Can You Trust Your Model’s Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift.
GE39: NeurIPS 2019。要旨確認。dataset shift下でのuncertainty手法の比較。
-
GE40 — Yoav Wald; Amir Feder; Daniel Greenfeld; Uri Shalit (2021). On Calibration and Out-of-domain Generalization.
GE40: NeurIPS 2021。要旨確認。multi-domain calibrationと不変性の条件付き接続。
-
GE41 — Volodymyr Kuleshov; Nathan Fenner; Stefano Ermon (2018). Accurate Uncertainties for Deep Learning Using Calibrated Regression.
GE41: ICML 2018。要旨確認。回帰の予測分布を校正する拡張。
-
GE42 — Anastasios N. Angelopoulos; Stephen Bates (2021). A Gentle Introduction to Conformal Prediction and Distribution-Free Uncertainty Quantification.
GE42: arXiv tutorial。要旨確認。conformal predictionの入門と応用。
-
GE43 — Ryan J. Tibshirani; Rina Foygel Barber; Emmanuel J. Candès; Aaditya Ramdas (2019). Conformal Prediction Under Covariate Shift.
GE43: NeurIPS 2019。要旨確認。density ratioを用いるweighted conformal。
-
GE44 — Isaac Gibbs; Emmanuel Candès (2021). Adaptive Conformal Inference Under Distribution Shift.
GE44: NeurIPS 2021。要旨確認。時変分布に対する長期coverage frequency。
-
GE45 — Anastasios N. Angelopoulos; Stephen Bates; Adam Fisch; Lihua Lei; Tal Schuster (2022). Conformal Risk Control.
GE45: arXiv 2022; ICLR 2024。要旨確認。単調lossの期待riskを制御する拡張。
-
GE46 — Rina Foygel Barber; Emmanuel J. Candès; Aaditya Ramdas; Ryan J. Tibshirani (2019). The limits of distribution-free conditional predictive inference.
GE46: arXiv 2019; Information and Inference 2021。要旨確認。分布自由なconditional coverageの不可能性と緩和。
-
GE47 — Lars Van Der Laan; Ahmed Alaa (2025). Generalized Venn and Venn-Abers Calibration with Applications in Conformal Prediction.
GE47: ICML 2025。要旨確認。set-valued calibrationとconformalの接続。
-
GE48 — Moritz Hardt; Eric Price; Nathan Srebro (2016). Equality of Opportunity in Supervised Learning.
GE48: NeurIPS 2016。要旨確認。equalized odds/opportunityとpost-processing。
-
GE49 — Jon Kleinberg; Sendhil Mullainathan; Manish Raghavan (2016). Inherent Trade-Offs in the Fair Determination of Risk Scores.
GE49: arXiv 2016; ITCS 2017。要旨確認。異なる公平性条件の一般的非両立性。
-
GE50 — Geoff Pleiss; Manish Raghavan; Felix Wu; Jon Kleinberg; Kilian Q. Weinberger (2017). On Fairness and Calibration.
GE50: NeurIPS 2017。要旨確認。校正とgroup間のerror制約の緊張。
-
GE51 — Úrsula Hébert-Johnson; Michael P. Kim; Omer Reingold; Guy N. Rothblum (2017). Multicalibration: Calibration for the (Computationally-Identifiable) Masses.
GE51: arXiv 2017(旧題); ICML 2018。要旨確認。重複する計算可能なsubgroup群での校正。
-
GE52 — Alekh Agarwal; Alina Beygelzimer; Miroslav Dudík; John Langford; Hanna Wallach (2018). A Reductions Approach to Fair Classification.
GE52: ICML 2018。要旨確認。公平性制約問題をcost-sensitive分類へ還元。
-
GE53 — Joy Buolamwini; Timnit Gebru (2018). Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification.
GE53: FAT* 2018。要旨確認。交差属性を含む誤差監査の代表研究。
-
GE54 — Solon Barocas; Moritz Hardt; Arvind Narayanan (2023). Fairness and Machine Learning: Limitations and Opportunities.
GE54: MIT Press 2023(書籍版)。一次資料確認。技術指標と規範・制度・社会的文脈を結ぶ。
-
GE55 — Beepul Bharti; Mary Versa Clemens-Sewall; Paul Yi; Jeremias Sulam (2025). Multiaccuracy and Multicalibration via Proxy Groups.
GE55: ICML 2025。要旨確認。sensitive groupの欠損とproxy groupの条件を研究。
-
GE56 — Lunjia Hu; Haipeng Luo; Spandan Senapati; Vatsal Sharan (2026). Efficient Swap Multicalibration of Elicitable Properties.
GE56: COLT 2026。要旨確認。elicitable propertyに対するonline swap multicalibration。
-
GE57 — Brenden M. Lake; Marco Baroni (2017). Generalization without systematicity: On the compositional skills of sequence-to-sequence recurrent networks.
GE57: arXiv 2017; ICML 2018。要旨確認。SCANでsystematicityと通常の汎化を分離。
-
GE58 — Daniel Keysers; Nathanael Schärli; et al. (2019). Measuring Compositional Generalization: A Comprehensive Method on Realistic Data.
GE58: arXiv 2019; ICLR 2020。要旨確認。CFQ。atom/compound divergenceに基づくsplit。
-
GE59 — Najoung Kim; Tal Linzen (2020). COGS: A Compositional Generalization Challenge Based on Semantic Interpretation.
GE59: EMNLP 2020。要旨確認。語彙の再結合と構造的汎化を分けるsemantic parsing。
-
GE60 — Zhengxuan Wu; Christopher D. Manning; Christopher Potts (2023). ReCOGS: How Incidental Details of a Logical Form Overshadow an Evaluation of Semantic Interpretation.
GE60: TACL 2023。要旨確認。logical formの非意味的要因がbenchmarkに混入する問題。
-
GE61 — Brenden M. Lake; Marco Baroni (2023). Human-like systematic generalization through a meta-learning neural network.
GE61: Nature 2023。本文該当節確認。本文のmeta-learning for compositionalityと行動実験節を確認。
-
GE62 — Ahmad Jabbar; Cleo Condoravdi; Christopher Potts (2025). Distinguishing fair from unfair compositional generalization tasks.
GE62: Findings of EMNLP 2025。要旨確認。学習データが正解ルールを識別できるかを吟味。
-
GE63 — Ziyao Xu; Cong Wang; Houfeng Wang (2026). Investigating More Explainable and Partition-Free Compositionality Estimation for LLMs: A Rule-Generation Perspective.
GE63: ACL 2026。要旨確認。program/rule生成を用いたcompositionality評価。
-
GE64 — Arnas Uselis; Andrea Dittadi; Seong Joon Oh (2026). Compositional Generalization Requires Linear, Orthogonal Representations in Vision Embedding Models.
GE64: ICML 2026(arXiv表示)。本文該当節確認。v1本文§3–4/Proposition 1のlinear heads・GD+CE・binary grid条件を確認。
-
GE65 — Nived Rajaraman; Audrey Huang; Miroslav Dudik; Robert Schapire; Dylan Foster; Akshay Krishnamurthy (2026). Learning to Reason with Curriculum II: Compositional Generalization.
GE65: arXiv preprint, 2026-06-26。要旨確認。semiautomataとcurriculum分解における標本複雑性。
-
GE66 — Hirotugu Akaike (1974). A new look at the statistical model identification.
GE66: IEEE Transactions on Automatic Control 1974。書誌確認。AICの代表原典。DOI先本文取得不可、著者自身の回顧と書誌で確認。
-
GE67 — 竹内啓 (1976). 情報統計量の分布とモデルの適切さの規準.
GE67: 数理科学 14(3), 12–18, 1976。書誌確認。TIC原典。国会図書館書誌のみ確認、本文未取得。
-
GE68 — Sumio Watanabe (2010). Asymptotic Equivalence of Bayes Cross Validation and Widely Applicable Information Criterion in Singular Learning Theory.
GE68: JMLR 2010。要旨確認。特異モデルでのBayes CVとWAICの漸近同値。
-
GE69 — Aki Vehtari; Andrew Gelman; Jonah Gabry (2015). Practical Bayesian model evaluation using leave-one-out cross-validation and WAIC.
GE69: arXiv 2015; Statistics and Computing 2017。要旨確認。PSIS-LOOとWAICの有限標本診断。
-
GE70, MD08 — Valentin Thomas; Fabian Pedregosa; Bart van Merriënboer; Pierre-Antoine Mangazol; Yoshua Bengio; Nicolas Le Roux (2019). On the interplay between noise and curvature and its effect on optimization and generalization.
GE70: arXiv 2019; AISTATS 2020。本文該当節確認。本文§4.1のTICとFisher/Hessian/勾配共分散の区別を確認。
MD08: AISTATS 2020, published (preprint 2019)。要旨確認。Hessian、Fisher、勾配共分散の役割を整理
-
GE71 — Saurav Kadavath; Tom Conerly; et al. (2022). Language Models (Mostly) Know What They Know.
GE71: arXiv preprint。要旨確認。P(True)/P(IK)による自己評価とtask外校正の限界。
-
GE72 — Lorenz Kuhn; Yarin Gal; Sebastian Farquhar (2023). Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation.
GE72: ICLR 2023。要旨確認。意味的同値を集約したsemantic entropy。
-
GE73 — Chiwei Zhu; Benfeng Xu; Quan Wang; Yongdong Zhang; Zhendong Mao (2023). On the Calibration of Large Language Models and Alignment.
GE73: Findings of EMNLP 2023(arXiv表示)。要旨確認。pretraining/alignment過程を通じたLLM校正の分析。
-
GE74 — Qing Lyu; Kumar Shridhar; Chaitanya Malaviya; Li Zhang; Yanai Elazar; Niket Tandon; Marianna Apidianaki; Mrinmaya Sachan; Chris Callison-Burch (2024). Calibrating Large Language Models with Sample Consistency.
GE74: AAAI 2024(arXiv v2表示、2026-02-23改訂)。要旨確認。複数sampleの整合性をconfidenceに変換。
-
GE75 — Mohammad Anas Jawad; Cornelia Caragea (2026). CaliDist: Calibrating Large Language Models via Behavioral Robustness to Distraction.
GE75: ICML 2026。要旨確認。semantic distractorへの応答安定性を用いたpost-hoc calibration。
-
GE76 — Eunyi Lyou; Yunjeong Choi; Junho Lee; Joonseok Lee (2026). Domain Generalization via Text-Anchored Information Bottleneck.
GE76: ECCV 2026採択(arXiv表示), 2026-07-02。要旨確認。言語埋め込みをDGの不変性の教師信号にする。
-
GE77 — Tien-Hung Nguyen; Tien-Dat Tran; M.-Duong Nguyen; Kok-Seng Wong (2026). Learning Subset-Shared Invariances for Domain Generalization with Mixture-of-Experts.
GE77: arXiv preprint, 2026-06-24。要旨確認。全環境共通ではなくdomain部分集合で共有する不変性。
-
GE78 — Sravan Danda; Aditya Challa; Shlok Mehendale; Snehanshu Saha (2026). Matching High-Dimensional Geometric Quantiles for Test-Time Adaptation of Transformers and Convolutional Networks Alike.
GE78: arXiv preprint, 2026-01-16。要旨確認。幾何quantile整合によるinput adapter。
-
GE79 — Gerhard Krumpl; Henning Avenhaus; Horst Possegger (2026). One Model, Many Behaviors: Training-Induced Effects on Out-of-Distribution Detection.
GE79: WACV 2026, arXiv 2026-01-15。要旨確認。同architectureでもtraining recipeとdetectorの相互作用が大きい。
-
GE80 — Yingkai Yang; Chaoqi Chen; Hui Huang (2026). Back to Source: Open-Set Continual Test-Time Adaptation via Domain Compensation.
GE80: CVPR 2026, arXiv 2026-04-23。要旨確認。domain shiftとunknown classesを同時に扱う継続TTA。
-
GE81 — Christina Baek; Yiding Jiang; Aditi Raghunathan; Zico Kolter (2022). Agreement-on-the-Line: Predicting the Performance of Neural Networks under Distribution Shift.
GE81: NeurIPS 2022。要旨確認。複数モデルのID/OOD agreementからtarget accuracyを予測する経験的関係。
-
GE82 — Yiding Jiang; Vaishnavh Nagarajan; Christina Baek; J. Zico Kolter (2021). Assessing Generalization of SGD via Disagreement.
GE82: arXiv 2021; ICLR 2022(公開PDF表紙で確認。掲載題名はAssessing Generalization via Disagreement)。要旨確認。異なるSGD run間のdisagreementとerror、ensemble calibrationの関係。
-
GE83 — Kamalika Chaudhuri; David Lopez-Paz (2023). Unified Uncertainty Calibration.
GE83: arXiv preprint(2024改訂版確認)。要旨確認。aleatoric/epistemic uncertaintyを共同で校正する枠組み。
-
GE84 — Ishaan Gulrajani; Tatsunori Hashimoto (2022). Identifiability Conditions for Domain Adaptation.
GE84: ICML 2022。要旨確認。bijective domain mapping、特に線形mapの識別可能性を解析。
-
GE85 — Nanyang Ye; Kaican Li; Haoyue Bai; Runpeng Yu; Lanqing Hong; Fengwei Zhou; Zhenguo Li; Jun Zhu (2021). OoD-Bench: Quantifying and Understanding Two Dimensions of Out-of-Distribution Generalization.
GE85: arXiv 2021; CVPR 2022。要旨確認。diversity/correlation shiftによるbenchmarkと手法の分析。
-
GE86 — Robert Geirhos; Jörn-Henrik Jacobsen; Claudio Michaelis; Richard Zemel; Wieland Brendel; Matthias Bethge; Felix A. Wichmann (2020). Shortcut Learning in Deep Neural Networks.
GE86: Nature Machine Intelligence 2020。要旨確認。標準benchmarkで通用する規則が移送に失敗するshortcutの視点。
-
GE087 — Xingchao Peng; Ben Usman; Neela Kaushik; Judy Hoffman; Dequan Wang; Kate Saenko (2017). VisDA: The Visual Domain Adaptation Challenge.
GE087: arXiv preprint, 2017。要旨確認。VisDAのsynthetic-to-real適応。対象ドメインのラベルなしデータを使うUDAと、使わないDGの比較条件を分ける。
-
GE088 — Anders Andreassen; Yasaman Bahri; Behnam Neyshabur; Rebecca Roelofs (2021). The Evolution of Out-of-Distribution Robustness Throughout Fine-Tuning.
GE088: arXiv preprint, 2021(正式掲載先未照合)。要旨確認。fine-tuning中のeffective robustnessが収束時に消える場合を追跡し、checkpoint選択の重要性を示す。
-
GE089 — Haotian Ye; Chuanlong Xie; Tianle Cai; Ruichen Li; Zhenguo Li; Liwei Wang (2021). Towards a Theoretical Framework of Out-of-Distribution Generalization.
GE089: arXiv preprint, 2021(正式掲載先未照合)。要旨確認。expansion functionによって学習環境での不変性が未知環境へ拡張される条件を定量化。
-
GE090 — Alexander Immer; Matthias Bauer; Vincent Fortuin; Gunnar Rätsch; Mohammad Emtiyaz Khan (2021). Scalable Marginal Likelihood Estimation for Model Selection in Deep Learning.
GE090: ICML 2021。要旨確認。Laplace・Gauss–Newton近似による周辺尤度推定をモデル選択に用いる。TICの頻度論的補正とは目的が異なる。
-
GE091 — Eliran Shabat; Lee Cohen; Yishay Mansour (2020). Sample Complexity of Uniform Convergence for Multicalibration.
GE091: NeurIPS 2020。要旨確認。multicalibration誤差の一様収束と必要標本数を解析し、予測誤差と校正誤差を区別。
-
GE092 — Adarsh Subbaswamy; Peter Schulam; Suchi Saria (2018). Preventing Failures Due to Dataset Shift: Learning Predictive Models That Transport.
GE092: arXiv 2018; AISTATS 2019。要旨確認。変化する機構に関するcausal selection diagramの知識を使うSurgery Estimator。無仮定の移送保証ではない。
-
GE093 — Amir Rahimi; Amirreza Shaban; Ching-An Cheng; Richard Hartley; Byron Boots (2020). Intra Order-preserving Functions for Calibration of Multi-Class Neural Networks.
GE093: NeurIPS 2020。要旨確認。クラス内の順位を保存する柔軟なpost-hoc校正を構成し、top-k予測の保存と校正を両立させる。
-
GE094 — Martin Arjovsky (2021). Out of Distribution Generalization in Machine Learning.
GE094: 博士論文のarXiv公開版, 2021。要旨確認。因果性・環境不変性・OOD汎化の前提を体系的に扱う。
-
GE095 — Marco Federici; Ryota Tomioka; Patrick Forré (2021). An Information-theoretic Approach to Distribution Shifts.
GE095: arXiv preprint, 2021(正式掲載先未照合)。要旨確認。shiftの誤差要因とDG・fairness目的を情報理論で比較し、生成過程に応じたモデル選択を強調。
-
GE096 — Dinghuai Zhang; Kartik Ahuja; Yilun Xu; Yisen Wang; Aaron Courville (2021). Can Subnetwork Structure be the Key to Out-of-Distribution Generalization?.
GE096: ICML 2021。要旨確認。spurious featureに依存する全体モデル内でも有用なsubnetworkを選ぶModular Risk Minimization。
-
GE097 — Xu Ji; Razvan Pascanu; Devon Hjelm; Balaji Lakshminarayanan; Andrea Vedaldi (2021). Test Sample Accuracy Scales with Training Sample Density in Neural Networks.
GE097: arXiv 2021; CoLLAs 2022。要旨確認。表現空間の学習標本密度と誤りの関係を研究。元メモの旧題名から現行題名へ改題されている。
-
GE098 — Yisen Wang; Xingjun Ma; Zaiyi Chen; Yuan Luo; Jinfeng Yi; James Bailey (2019). Symmetric Cross Entropy for Robust Learning with Noisy Labels.
GE098: ICCV 2019。要旨確認。Cross EntropyとReverse Cross Entropyを組み合わせたラベルノイズ学習。OOD検出やラベルシフト補正とは異なる。
-
GE099 — Marvin Zhang; Henrik Marklund; Nikita Dhawan; Abhishek Gupta; Sergey Levine; Chelsea Finn (2020). Adaptive Risk Minimization: Learning to Adapt to Domain Shift.
GE099: arXiv 2020; NeurIPS 2021。要旨確認。訓練ドメインを用いて、ラベルなしテスト点から適応する能力を学習するARM。
-
GE100 — Kai Xiao; Logan Engstrom; Andrew Ilyas; Aleksander Madry (2020). Noise or Signal: The Role of Image Backgrounds in Object Recognition.
GE100: arXiv preprint, 2020(正式掲載先未照合)。要旨確認。物体前景と背景を分離して背景依存を診断する。背景のみの予測力と因果的に有用な特徴を区別。
-
GE101 — Yifei Ming; Hang Yin; Yixuan Li (2021). On the Impact of Spurious Correlation for Out-of-distribution Detection.
GE101: arXiv 2021; AAAI 2022。要旨確認。環境特徴とラベルの相関がunknown検出を悪化させる条件を分析。
-
GE102 — Marc Khoury (2019). Adaptive versus Standard Descent Methods and Robustness Against Adversarial Examples.
GE102: arXiv preprint, 2019(2020改訂)。要旨確認。adaptive法と標準勾配法で敵対的頑健性が異なる構成例を示す。全問題・全optimizerへの優劣ではない。
-
GE103 — Nader Asadi; Amir M. Sarfi; Mehrdad Hosseinzadeh; Zahra Karimpour; Mahdi Eftekhari (2019). Towards Shape Biased Unsupervised Representation Learning for Domain Generalization.
GE103: arXiv preprint, 2019(2020改訂、正式掲載先未照合)。要旨確認。domain diversificationとjigsawを組み合わせたshape-biased自己教師あり表現。
-
GE104 — Rui Hu; Jitao Sang; Jinqiang Wang; Rui Hu; Chaoquan Jiang (2021). Understanding and Testing Generalization of Deep Networks on Out-of-Distribution Data.
GE104: arXiv preprint, 2021。要旨確認。marginal/conditional spurious correlationとID評価の限界を調べる。著者名はarXivとPDF表紙の表記を保持。
-
GE105 — Srinadh Bhojanapalli; Ayan Chakrabarti; Daniel Glasner; Daliang Li; Thomas Unterthiner; Andreas Veit (2021). Understanding Robustness of Transformers for Image Classification.
GE105: ICCV 2021。要旨確認。ViTとResNetを入力・モデル摂動で比較。十分な事前学習データという条件を明示。
-
GE106 — Dan Hendrycks; Xiaoyuan Liu; Eric Wallace; Adam Dziedzic; Rishabh Krishnan; Dawn Song (2020). Pretrained Transformers Improve Out-of-Distribution Robustness.
GE106: ACL 2020。要旨確認。NLPで事前学習Transformerの分布外汎化と検出を評価。元メモのリンクラベルは別論文を指している。
-
GE107 — Zachary Nado; Neil Band; Mark Collier; Josip Djolonga; Michael W. Dusenberry; Sebastian Farquhar; Qixuan Feng; Angelos Filos; Marton Havasi; Rodolphe Jenatton; Ghassen Jerfel; Jeremiah Liu; Zelda Mariet; Jeremy Nixon; Shreyas Padhy; Jie Ren; Tim G. J. Rudner; Faris Sbahi; Yeming Wen; Florian Wenzel; Kevin Murphy; D. Sculley; Balaji Lakshminarayanan; Jasper Snoek; Yarin Gal; Dustin Tran (2021). Uncertainty Baselines: Benchmarks for Uncertainty & Robustness in Deep Learning.
GE107: arXiv preprint, 2021(2022改訂)。要旨確認。Uncertainty Baselinesの実装・評価基盤。方法だけでなく調整計算量や再現性を比較可能にする。
-
GE108 — James Diffenderfer; Brian R. Bartoldson; Shreya Chaganti; Jize Zhang; Bhavya Kailkhura (2021). A Winning Hand: Compressing Deep Networks Can Improve Out-Of-Distribution Robustness.
GE108: arXiv preprint, 2021(正式掲載先未照合)。要旨確認。lottery-ticket型圧縮とテスト時ensembleによる精度・頑健性・容量の両立を検証。
-
GE109 — Harshay Shah; Kaustav Tamuly; Aditi Raghunathan; Prateek Jain; Praneeth Netrapalli (2020). The Pitfalls of Simplicity Bias in Neural Networks.
GE109: NeurIPS 2020。要旨確認。最も単純な特徴への極端な依存がIID汎化や分布外頑健性も損ねる構成例。
-
GE110 — Muhammad Ghifary; W. Bastiaan Kleijn; Mengjie Zhang; David Balduzzi (2015). Domain Generalization for Object Recognition with Multi-task Autoencoders.
GE110: ICCV 2015。要旨確認。Multi-Task Autoencoderによる初期のDG表現学習。ドメイン間の外観差を再構成課題に使う。
-
GE111 — Da Li; Yongxin Yang; Yi-Zhe Song; Timothy M. Hospedales (2017). Deeper, Broader and Artier Domain Generalization.
GE111: ICCV 2017。要旨確認。photo/art/cartoon/sketchを含むPACSを導入し、写真のみのベンチマークから拡張。
-
GE112 — Sara Beery; Grant van Horn; Pietro Perona (2018). Recognition in Terra Incognita.
GE112: ECCV 2018。要旨確認。camera-trapの設置場所をまたぐ認識を評価。ランダム分割と未知場所分割の差が核心。
-
GE113 — Xingchao Peng; Qinxun Bai; Xide Xia; Zijun Huang; Kate Saenko; Bo Wang (2018). Moment Matching for Multi-Source Domain Adaptation.
GE113: arXiv 2018; ICCV 2019。要旨確認。DomainNetとmulti-source UDAのmoment matching。DGとして再利用する際は対象データ使用条件を変更する。
-
GE114 — Robert Geirhos; Patricia Rubisch; Claudio Michaelis; Matthias Bethge; Felix A. Wichmann; Wieland Brendel (2018). ImageNet-trained CNNs are biased towards texture; increasing shape bias improves accuracy and robustness.
GE114: arXiv 2018; ICLR 2019。要旨確認。texture–shape cue conflictとStylized-ImageNetを用いて画像CNNの特徴依存を検証。
-
GE115 — Pang Wei Koh; Thao Nguyen; Yew Siang Tang; Stephen Mussmann; Emma Pierson; Been Kim; Percy Liang (2020). Concept Bottleneck Models.
GE115: ICML 2020。要旨確認。人が解釈できる概念を中間変数にしてテスト時の概念修正を可能にする。概念注釈・介入が必要。
-
GE116 — Vaishaal Shankar; Achal Dave; Rebecca Roelofs; Deva Ramanan; Benjamin Recht; Ludwig Schmidt (2019). Do Image Classifiers Generalize Across Time?.
GE116: arXiv preprint, 2019(正式掲載先未照合)。要旨確認。ImageNet-Vid-Robust/YTBB-Robustで近接動画フレームへの予測変動を測る。
-
GE117 — Eleni Triantafillou; Tyler Zhu; Vincent Dumoulin; Pascal Lamblin; Utku Evci; Kelvin Xu; Ross Goroshin; Carles Gelada; Kevin Swersky; Pierre-Antoine Manzagol; Hugo Larochelle (2019). Meta-Dataset: A Dataset of Datasets for Learning to Learn from Few Examples.
GE117: arXiv 2019; ICLR 2020。要旨確認。異種データセットからのfew-shot episodeを評価するMeta-Dataset。通常のDGとはラベル利用条件が異なる。
-
GE118 — Xiaohua Zhai; Joan Puigcerver; Alexander Kolesnikov; Pierre Ruyssen; Carlos Riquelme; Mario Lucic; Josip Djolonga; Andre Susano Pinto; Maxim Neumann; Alexey Dosovitskiy; Lucas Beyer; Olivier Bachem; Michael Tschannen; Marcin Michalski; Olivier Bousquet; Sylvain Gelly; Neil Houlsby (2019). A Large-scale Study of Representation Learning with the Visual Task Adaptation Benchmark.
GE118: arXiv preprint, 2019(2020改訂、正式掲載先未照合)。要旨確認。VTABは少数ラベルによる新規タスク適応を比較。architectureや調整予算の統制を重視。
-
GE119 — Aishwarya Agrawal; Dhruv Batra; Devi Parikh; Aniruddha Kembhavi (2017). Don’t Just Assume; Look and Answer: Overcoming Priors for Visual Question Answering.
GE119: arXiv 2017; CVPR 2018。要旨確認。VQA-CPは質問型ごとの回答priorを変え、画像を見ずに言語priorへ依存する捷径を検査。
-
GE120 — Yixin Nie; Adina Williams; Emily Dinan; Mohit Bansal; Jason Weston; Douwe Kiela (2019). Adversarial NLI: A New Benchmark for Natural Language Understanding.
GE120: arXiv 2019; ACL 2020。要旨確認。ANLIは人とモデルの反復的な敵対的データ収集による自然言語推論評価。画素ノルム制約攻撃ではない。
-
GE121 — Dan Hendrycks; Kevin Zhao; Steven Basart; Jacob Steinhardt; Dawn Song (2019). Natural Adversarial Examples.
GE121: arXiv 2019; CVPR 2021。要旨確認。ImageNet-Aの難しい既知クラス認識とImageNet-Oの未知分布検出を分ける。
-
GE122 — Olivia Wiles; Sven Gowal; Florian Stimberg; Sylvestre Alvise-Rebuffi; Ira Ktena; Krishnamurthy Dvijotham; Taylan Cemgil (2021). A Fine-Grained Analysis on Distribution Shift.
GE122: arXiv 2021; ICLR 2022。要旨確認。複数種類のshiftを統制比較し、事前学習・augmentationの効果と最良手法の設定依存を示す。
-
GE123 — Tian Li; Ahmad Beirami; Maziar Sanjabi; Virginia Smith (2020). Tilted Empirical Risk Minimization.
GE123: arXiv 2020; ICLR 2021。要旨確認。tiltで大損失・小損失の重みを変え、外れ値・群間格差・クラス不均衡に対応。公平性の定義は別途必要。
-
GE124 — Wang Lu; Jindong Wang; Haoliang Li; Yiqiang Chen; Xing Xie (2022). Domain-invariant Feature Exploration for Domain Generalization.
GE124: TMLR 2022。要旨確認。DIFEXはFourier phaseの内部不変性とdomain間correlation alignmentを組み合わせる。
-
GE125 — Andreas Kirsch; Yarin Gal (2022). A Note on “Assessing Generalization of SGD via Disagreement”.
GE125: arXiv 2022; TMLR 2022(公開PDF表紙で確認)。要旨確認。disagreementで誤りを推定する理論はensemble calibrationに依存し、未知環境ではその検証にラベルが要ると指摘。
-
GE126 — Utku Evci; Vincent Dumoulin; Hugo Larochelle; Michael C. Mozer (2022). Head2Toe: Utilizing Intermediate Representations for Better Transfer Learning.
GE126: ICML 2022。要旨確認。全層から特徴を選ぶHead2Toe。ターゲットラベルを使うtransferであり、純粋なDG保証ではない。
-
GE127 — Nathan Ng; Neha Hulkund; Kyunghyun Cho; Marzyeh Ghassemi (2022). Predicting Out-of-Domain Generalization with Neighborhood Invariance.
GE127: arXiv 2022; TMLR 2023(公開PDF表紙で確認)。要旨確認。選んだ変換近傍での予測不変性とOOD性能の経験的関係。計算に正解ラベルは不要だが変換の妥当性は必要。
-
GE128 — Jingling Li; Mozhi Zhang; Keyulu Xu; John P. Dickerson; Jimmy Ba (2020). How Does a Neural Network’s Architecture Impact Its Robustness to Noisy Labels?.
GE128: arXiv 2020; NeurIPS 2021。要旨確認。architectureとtarget/noise関数の適合を通じたラベルノイズ頑健性。表現評価に少数のclean labelを使う。
-
GE129 — Masanori Koyama; Shoichiro Yamaguchi (2020). When is invariance useful in an Out-of-Distribution Generalization problem ?.
GE129: arXiv preprint, 2020(2021改訂)。要旨確認。不変予測器のOOD最適性に必要な条件とInter Gradient Alignment。元メモの題名に対応する正しい論文。
-
GE130 — Leo Kozachkov; Patrick M. Wensing; Jean-Jacques Slotine (2022). Generalization in Supervised Learning Through Riemannian Contraction.
GE130: arXiv 2022; 発展版はGeneralization as Dynamical Robustness–The Role of Riemannian Contraction in Supervised Learning, TMLR 2023(書誌照合)。要旨確認。Riemannian contractionからalgorithmic stabilityを導く。IID学習の安定性を任意の分布シフト保証と読み替えない。
-
GE131 — Daniel C. Castro; Ian Walker; Ben Glocker (2019). Causality matters in medical imaging.
GE131: arXiv 2019; Nature Communications 11:3673, 2020。要旨確認。画像・注釈・選択過程の因果関係からデータ不足と移送条件を整理。
-
GE132 — Mateusz Michalkiewicz; Masoud Faraki; Xiang Yu; Manmohan Chandraker; Mahsa Baktashmotlagh (2023). Domain Generalization Guided by Gradient Signal to Noise Ratio of Parameters.
GE132: ICCV 2023。要旨確認。GSNRに基づくparameter dropoutと比率のmeta-learning。高GSNRを残すのでなく除く設計を提案。
-
GE133 — Hemanth Venkateswara; Jose Eusebio; Shayok Chakraborty; Sethuraman Panchanathan (2017). Deep Hashing Network for Unsupervised Domain Adaptation.
GE133: CVPR 2017。要旨確認。Office-Homeを導入。原論文はラベルなし対象データを用いるUDAである。
-
GE134 — Yinpeng Dong; Qi-An Fu; Xiao Yang; Tianyu Pang; Hang Su; Zihao Xiao; Jun Zhu (2019). Benchmarking Adversarial Robustness.
GE134: arXiv 2019; CVPR 2020掲載題名は「Benchmarking Adversarial Robustness on Image Classification」。要旨確認。RealSafeに対応する攻撃・防御の評価。単一の攻撃設定だけでモデル順位を決めない。
-
GE135 — Sumin Cho; Dongwon Kim; Kwangsu Kim (2025). One-Step Generalization Ratio Guided Optimization for Domain Generalization.
GE135: ICML 2025; arXivへの登録は2026-06-15。要旨確認。GENIEはOSGRで更新寄与・勾配整合を調整。正式発表は2025であり2026年の新規成果と数えない。
-
GE136, OA038 — Dan Hendrycks; Steven Basart; Norman Mu; Saurav Kadavath; Frank Wang; Evan Dorundo; Rahul Desai; Tyler Zhu; Samyak Parajuli; Mike Guo; Dawn Song; Jacob Steinhardt; Justin Gilmer (2020). The Many Faces of Robustness: A Critical Analysis of Out-of-Distribution Generalization.
GE136: arXiv 2020; ICCV 2021。要旨確認。複数の実分布シフトを比較し、textureへの改善が地理的shiftにも通用するとは限らないと示す。
OA038: ICCV 2021。要旨確認。複数の現実的分布変化で頑健性を評価
-
GE137 — Ananya Kumar; Tengyu Ma; Percy Liang; Aditi Raghunathan (2022). Calibrated ensembles can mitigate accuracy tradeoffs under distribution shift.
GE137: UAI 2022。要旨確認。ID上で校正した標準・robustモデルのensembleを研究。OODでspurious featureの相関が逆転しないという解析条件を明示。
-
GE138 — Joaquin Quiñonero-Candela (編); Masashi Sugiyama (編); Anton Schwaighofer (編); Neil D. Lawrence (編) (2008). Dataset Shift in Machine Learning.
GE138: MIT Press(出版社はhardcover発売2008-12-12、paperback2022-06-07と表示。一般的な引用年は2009)。書誌確認。dataset shiftの標準的編集書。出版社書誌・紹介のみ確認し、書籍全文の精読とは扱わない。
-
GE139 — Mehdi Ataei; Murat Erdogdu; Sedef Akinli Kocak; Shai Ben-David; Shems Saleh (2021). Understanding Dataset Shift and Potential Remedies.
GE139: Vector Institute Industry Collaborative Project Technical Report, 2021。一次資料確認。executive summaryと著作年を確認。横断データ・時系列・画像におけるshiftの実践的分類を提供する技術報告。
-
GE140 — Reva Schwartz; Apostol Vassilev; Kristen Greene; Lori Perine; Andrew Burt; Patrick Hall (2022). Towards a Standard for Identifying and Managing Bias in Artificial Intelligence.
GE140: NIST Special Publication 1270, March 2022。一次資料確認。表紙・executive summary・bias分類の該当箇所を確認。制度、人、統計・計算に由来するbiasを区別する技術報告。
-
GE141 — Qi Qi; Zhishuai Guo; Yi Xu; Rong Jin; Tianbao Yang (2021). An Online Method for A Class of Distributionally Robust Optimization with Non-convex Objectives.
GE141: NeurIPS 2021。要旨確認。KL正則化したDROを合成最小化へ変換するonline法。PL条件の有無で計算量保証を区別。
-
GE142 — Boyan Gao; Henry Gouk; Yongxin Yang; Timothy Hospedales (2022). Loss Function Learning for Domain Generalization by Implicit Gradient.
GE142: ICML 2022。要旨確認。implicit gradientによるloss学習をERMへ組み込み、single-source DGも評価。
-
GE143 — Ramakrishna Vedantam; David Lopez-Paz; David J. Schwab (2021). An Empirical Investigation of Domain Generalization with Empirical Risk Minimizers.
GE143: NeurIPS 2021。要旨確認。ERMのOOD性能とFisher関連量・entropy・MMDの経験的相関を比較。相関を汎用上界と扱わない。
-
GE144 — Yao-Yuan Yang; Cyrus Rashtchian; Hongyang Zhang; Ruslan Salakhutdinov; Kamalika Chaudhuri (2020). A Closer Look at Accuracy vs. Robustness.
GE144: NeurIPS 2020。要旨確認。データの分離と局所Lipschitz性の条件下で精度と敵対的頑健性の両立可能性を論じる。
-
GE145 — Chen Fang; Ye Xu; Daniel N. Rockmore (2013). Unbiased Metric Learning: On the Utilization of Multiple Datasets and Web Images for Softening Bias.
GE145: ICCV 2013。要旨確認。複数の偏ったデータセットをまたぐmetric学習と、弱ラベルweb画像でのモデル選択。PDF冒頭の要旨・著者を確認。
-
GE146 — Sara Beery; Guanhang Wu; Trevor Edwards; Filip Pavetic; Bo Majewski; Shreyasee Mukherjee; Stanley Chan; John Morgan; Vivek Rathod; Jonathan Huang (2022). The Auto Arborist Dataset: A Large-Scale Benchmark for Multiview Urban Forest Monitoring Under Domain Shift.
GE146: CVPR 2022(正式書誌と著者の公式データセット説明を確認。会議PDF本文未取得)。一次資料確認。地理・long-tail・複数視点が重なる都市樹木認識。公式 https://google.github.io/auto-arborist/ は2025-05-27に配布停止と明記。
-
GE147 — Tobias Ringwald; Rainer Stiefelhagen (2021). Adaptiope: A Modern Benchmark for Unsupervised Domain Adaptation.
GE147: WACV 2021, pp.101–110; DOI:10.1109/WACV48630.2021.00015。書誌確認。著者所属機関KITの書誌を確認。会議PDF・要旨は未取得のため、本調査では性能やデータ規模の主張に用いない。
基盤モデル(主登録111件)
章本文。他章との共通文献には複数IDを併記する。
-
FM001 — Dzmitry Bahdanau ほか (2014). Neural Machine Translation by Jointly Learning to Align and Translate.
FM001: ICLR 2015。要旨確認。固定長ボトルネックから学習可能アラインメントへ
-
FM002 — Ashish Vaswani ほか (2017). Attention Is All You Need.
FM002: NeurIPS 2017。本文該当節確認。自己注意・マスク・FFN・残差の基本構造
-
FM003 — Jacob Devlin ほか (2018). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.
FM003: arXiv preprint(会議版未再照合)。要旨確認。双方向事前学習と転移
-
FM004 — Tom B. Brown ほか (2020). Language Models are Few-Shot Learners.
FM004: NeurIPS 2020。要旨確認。大規模自己回帰モデルの文脈内学習
-
FM005 — Alexey Dosovitskiy ほか (2020). An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale.
FM005: ICLR 2021。要旨確認。画像パッチへのTransformer適用
-
FM006 — Jianlin Su ほか (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding.
FM006: arXiv preprint(出版版未再照合)。要旨確認。回転位置埋め込み
-
FM007 — Noam Shazeer (2019). Fast Transformer Decoding: One Write-Head is All You Need.
FM007: arXiv preprint。要旨確認。KV共有によるdecode効率
-
FM008 — Joshua Ainslie ほか (2023). GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints.
FM008: EMNLP 2023。要旨確認。MQAとMHAの中間設計
-
FM009 — Krzysztof Choromanski ほか (2020). Rethinking Attention with Performers.
FM009: ICLR 2021。要旨確認。ランダム特徴による注意近似
-
FM010, SY009 — Tri Dao ほか (2022). FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness.
FM010: arXiv preprint(会議版未再照合)。要旨確認。厳密注意のIO削減
SY009: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。exact attentionをIOから最適化。
-
FM011 — Tri Dao (2023). FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning.
FM011: arXiv preprint(会議版未再照合)。要旨確認。GPU並列化と仕事分割
-
FM012 — Jay Shah ほか (2024). FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision.
FM012: arXiv preprint。要旨確認。Hopper非同期計算と低精度
-
FM013 — Ted Zadouri ほか (2026). FlashAttention-4: Algorithm and Kernel Pipelining Co-Design for Asymmetric Hardware Scaling.
FM013: arXiv preprint。本文該当節確認。Blackwellの非対称資源拡張に合わせたカーネル
-
FM014 — Albert Gu・Tri Dao (2023). Mamba: Linear-Time Sequence Modeling with Selective State Spaces.
FM014: arXiv preprint(会議版未再照合)。要旨確認。選択的状態空間モデル
-
FM015 — Tri Dao・Albert Gu (2024). Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality.
FM015: ICML 2024。要旨確認。注意とSSMの構造的双対性
-
FM016, SY014 — DeepSeek-AI ほか (2024). DeepSeek-V3 Technical Report.
FM016: arXiv technical report。要旨確認。MoE・MLA・低精度学習の統合
SY014: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。MoEと訓練systemの技術報告。
-
FM017 — Joel Hestness ほか (2017). Deep Learning Scaling is Predictable, Empirically.
FM017: arXiv preprint。要旨確認。Kaplan以前の経験的スケーリング研究
-
FM018 — Jared Kaplan ほか (2020). Scaling Laws for Neural Language Models.
FM018: arXiv preprint。要旨確認。モデル・データ・計算量と損失の関係
-
FM019 — Jordan Hoffmann ほか (2022). Training Compute-Optimal Large Language Models.
FM019: arXiv preprint(会議版未再照合)。本文該当節確認。モデルサイズと学習トークンの配分
-
FM020 — Xiaohua Zhai ほか (2021). Scaling Vision Transformers.
FM020: CVPR 2022。要旨確認。ViTでの規模・データ・計算の関係
-
FM021 — Yasaman Bahri ほか (2021). Explaining Neural Scaling Laws.
FM021: PNAS 2024。要旨確認。variance/resolution律速の理論的分類
-
FM022 — Niklas Muennighoff ほか (2023). Scaling Data-Constrained Language Models.
FM022: arXiv preprint(会議版未再照合)。要旨確認。有限データの反復学習
-
FM023 — Pablo Villalobos ほか (2022). Will we run out of data? Limits of LLM scaling based on human-generated data.
FM023: arXiv preprint(会議版未再照合)。要旨確認。人間由来データ供給の条件付き予測
-
FM024 — Rylan Schaeffer ほか (2023). Are Emergent Abilities of Large Language Models a Mirage?.
FM024: arXiv preprint(会議版未再照合)。要旨確認。評価指標が作る見かけの創発
-
FM025 — Song Bian ほか (2025). Scaling Inference-Efficient Language Models.
FM025: ICML 2025。要旨確認。形状と推論レイテンシを含める設計
-
FM026 — Shayne Longpre ほか (2025). ATLAS: Adaptive Transfer Scaling Laws for Multilingual Pretraining, Finetuning, and Decoding the Curse of Multilinguality.
FM026: ICLR 2026(著者公式発表で確認)。要旨確認。多言語間の転移を含む規模則
-
FM027 — Xinye Zhao ほか (2026). Not All Error Yields to Scale: Where Scaling Stops in Vision-Language Inference.
FM027: arXiv preprint。要旨確認。VLMのモデル規模と視覚解像度の配分
-
FM028 — Tadas Baltrušaitis ほか (2017). Multimodal Machine Learning: A Survey and Taxonomy.
FM028: arXiv preprint(雑誌版未再照合)。要旨確認。表現・翻訳・整列・融合・co-learningの分類
-
FM029 — Alec Radford ほか (2021). Learning Transferable Visual Models From Natural Language Supervision.
FM029: arXiv preprint(会議版未再照合)。要旨確認。画像テキスト対照学習
-
FM030 — Jean-Baptiste Alayrac ほか (2022). Flamingo: a Visual Language Model for Few-Shot Learning.
FM030: NeurIPS 2022。要旨確認。画像と文章の交互入力とfew-shot学習
-
FM031 — Junnan Li ほか (2023). BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models.
FM031: arXiv preprint(会議版未再照合)。要旨確認。凍結モデル間をQ-Formerで接続
-
FM032 — Haotian Liu ほか (2023). Visual Instruction Tuning.
FM032: NeurIPS 2023。要旨確認。視覚instruction tuning
-
FM033 — Rohit Girdhar ほか (2023). ImageBind: One Embedding Space To Bind Them All.
FM033: CVPR 2023。要旨確認。画像を軸に六モダリティを整列
-
FM034 — Shuai Bai ほか (2025). Qwen2.5-VL Technical Report.
FM034: arXiv technical report。要旨確認。動的解像度と時間表現
-
FM035 — Jin Xu ほか (2025). Qwen3-Omni Technical Report.
FM035: arXiv technical report。要旨確認。テキスト・画像・音声・動画の統合
-
FM036 — George Barnum ほか (2020). On the Benefits of Early Fusion in Multimodal Representation Learning.
FM036: arXiv preprint(ICLR採択は未確認)。要旨確認。early fusionのタスク依存な利点
-
FM037 — Renjie Wu ほか (2024). Deep Multimodal Learning with Missing Modality: A Survey.
FM037: TMLR(arXiv更新版で採択記載、2026)。要旨確認。欠落モダリティの頑健性
-
FM038 — Pan Wang ほか (2026). From Models to Systems: A Comprehensive Survey of Efficient Multimodal Learning.
FM038: TMLR 2026(arXiv journal reference)。要旨確認。モデル・アルゴリズム・システムの効率整理
-
FM039 — Milad Abdollahzadeh ほか (2021). Revisit Multimodal Meta-Learning through the Lens of Multi-Task Learning.
FM039: NeurIPS 2021。要旨確認。タスク分布の多峰性とセンサ融合の用語を区別
-
FM040 — Paul Christiano ほか (2017). Deep reinforcement learning from human preferences.
FM040: arXiv preprint(会議版未再照合)。要旨確認。人間の比較から報酬を学習
-
FM041 — Daniel M. Ziegler ほか (2019). Fine-Tuning Language Models from Human Preferences.
FM041: arXiv preprint。要旨確認。言語生成への選好学習の導入
-
FM042 — Nisan Stiennon ほか (2020). Learning to summarize from human feedback.
FM042: NeurIPS 2020。要旨確認。要約で人間選好を最適化
-
FM043 — Long Ouyang ほか (2022). Training language models to follow instructions with human feedback.
FM043: arXiv preprint(会議版未再照合)。本文該当節確認。SFT・報酬モデル・PPOの実用的統合
-
FM044 — John Schulman ほか (2017). Proximal Policy Optimization Algorithms.
FM044: arXiv preprint。要旨確認。clipped policy gradientの基礎
-
FM045 — Yuntao Bai ほか (2022). Constitutional AI: Harmlessness from AI Feedback.
FM045: arXiv preprint。要旨確認。憲法原則とAIフィードバック
-
FM046 — Rafael Rafailov ほか (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model.
FM046: arXiv preprint(会議版未再照合)。本文該当節確認。KL正則化RLHFから直接選好損失を導出
-
FM047 — Mohammad Gheshlaghi Azar ほか (2023). A General Theoretical Paradigm to Understand Learning from Human Preferences.
FM047: arXiv preprint(会議版未再照合)。要旨確認。選好学習の理論とIPO
-
FM048 — Kawin Ethayarajh ほか (2024). KTO: Model Alignment as Prospect Theoretic Optimization.
FM048: ICML 2024。要旨確認。ペア不要の望ましさラベル学習
-
FM049 — Yu Meng ほか (2024). SimPO: Simple Preference Optimization with a Reference-Free Reward.
FM049: NeurIPS 2024。要旨確認。参照モデル不要の選好学習
-
FM050 — Leo Gao ほか (2022). Scaling Laws for Reward Model Overoptimization.
FM050: arXiv preprint(会議版未再照合)。要旨確認。代理報酬の過剰最適化
-
FM051 — Stephen Casper ほか (2023). Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback.
FM051: arXiv preprint。要旨確認。フィードバック・報酬・方策の限界の分類
-
FM052 — Luca Viano ほか (2026). Direct Preference Optimization with Rating Information: Practical Algorithms and Provable Gains.
FM052: arXiv preprint。要旨確認。選好の向きに加えて評価差を利用
-
FM053 — Pei-Chi Pan ほか (2026). Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation.
FM053: TMLR 2026(arXiv採択記載)。要旨確認。推論学習における報酬設計の総説
-
FM054 — Jason Wei ほか (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models.
FM054: arXiv preprint(会議版未再照合)。要旨確認。中間ステップの例示による推論誘導
-
FM055 — Xuezhi Wang ほか (2022). Self-Consistency Improves Chain of Thought Reasoning in Language Models.
FM055: ICLR 2023。要旨確認。複数の推論経路と回答投票
-
FM056 — Shunyu Yao ほか (2023). Tree of Thoughts: Deliberate Problem Solving with Large Language Models.
FM056: NeurIPS 2023。要旨確認。明示的探索と自己評価
-
FM057 — Shunyu Yao ほか (2022). ReAct: Synergizing Reasoning and Acting in Language Models.
FM057: arXiv preprint(会議版未再照合)。要旨確認。推論と環境操作の交互実行
-
FM058 — Hunter Lightman ほか (2023). Let’s Verify Step by Step.
FM058: arXiv preprint(会議版未再照合)。要旨確認。過程監督と最終結果監督の比較
-
FM059 — Charlie Snell ほか (2024). Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters.
FM059: arXiv preprint(会議版未再照合)。要旨確認。問題難度に応じる推論計算配分
-
FM060 — Zhihong Shao ほか (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.
FM060: arXiv preprint。要旨確認。数学データとGRPO
-
FM061 — DeepSeek-AI ほか (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.
FM061: Nature 645, 633–638 (2025); 技術報告v1を本文確認。本文該当節確認。R1-Zeroと多段階R1・蒸留の区別
-
FM062 — Niklas Muennighoff ほか (2025). s1: Simple test-time scaling.
FM062: EMNLP 2025。要旨確認。少量SFTとbudget forcing
-
FM063 — Jonas Geiping ほか (2025). Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach.
FM063: arXiv preprint。要旨確認。潜在状態の反復による推論計算拡張
-
FM064 — Qiying Yu ほか (2025). DAPO: An Open-Source LLM Reinforcement Learning System at Scale.
FM064: arXiv preprint。要旨確認。大規模RLの実装要因と再現性
-
FM065 — Yang Yue ほか (2025). Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?.
FM065: NeurIPS 2025。要旨確認。pass@kと基盤モデルの探索範囲の議論
-
FM066 — Parshin Shojaee ほか (2025). The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity.
FM066: NeurIPS 2025。要旨確認。制御パズルで推論の複雑度依存を測定
-
FM067 — Ismail Labiad ほか (2026). Beyond Repeated Sampling: Learning Search Policies for LLM Reasoning.
FM067: arXiv preprint。要旨確認。大きなモデルを案内する小さな探索方策
-
FM068 — Qili Zhang ほか (2026). Learning to Prove, Not Just to Answer: Reinforcement Learning from Formal Verification for Natural-Language Logical Reasoning.
FM068: arXiv preprint。要旨確認。自然言語論理の過程を形式検証
-
FM069, MD76 — Ian J. Goodfellow ほか (2014). Generative Adversarial Networks.
FM069: arXiv preprint(会議題名はGenerative Adversarial Nets)。要旨確認。生成器と識別器による分布学習
MD76: NeurIPS 2014, published;刊行題名はGenerative Adversarial Nets、記載題名はarXiv版。要旨確認。生成器と識別器の二者ゲーム
-
FM070 — Alec Radford ほか (2015). Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks.
FM070: arXiv preprint(会議版未再照合)。要旨確認。畳み込みGANの設計
-
FM071, MD77 — Martin Arjovsky ほか (2017). Wasserstein GAN.
FM071: arXiv preprint(会議版未再照合)。要旨確認。Wasserstein距離による学習目的
MD77: ICML 2017, published;刊行題名はWasserstein Generative Adversarial Networks、記載題名はarXiv版。要旨確認。Wasserstein双対を用いる生成学習
-
FM072, MD78 — Ishaan Gulrajani ほか (2017). Improved Training of Wasserstein GANs.
FM072: NeurIPS 2017。要旨確認。weight clippingから勾配正則化へ
MD78: NeurIPS 2017, published。要旨確認。gradient penaltyによるcriticの正則化
-
FM073, MD79 — Takeru Miyato ほか (2018). Spectral Normalization for Generative Adversarial Networks.
FM073: ICLR 2018。要旨確認。識別器のスペクトル正規化
MD79: ICLR 2018, published。要旨確認。識別器のspectral norm制御
-
FM074 — Lars Mescheder ほか (2017). The Numerics of GANs.
FM074: arXiv preprint(会議版未再照合)。要旨確認。ゲームの勾配場と局所安定性
-
FM075 — Lars Mescheder ほか (2018). Which Training Methods for GANs do actually Converge?.
FM075: ICML 2018。本文該当節確認。収束保証の仮定と反例
-
FM077 — Andrew Brock ほか (2018). Large Scale GAN Training for High Fidelity Natural Image Synthesis.
FM077: arXiv preprint(会議版未再照合)。要旨確認。GANの大規模化と品質・多様性
-
FM078 — Tero Karras ほか (2018). A Style-Based Generator Architecture for Generative Adversarial Networks.
FM078: CVPR 2019。要旨確認。スタイル空間と生成制御
-
FM079 — Tero Karras ほか (2019). Analyzing and Improving the Image Quality of StyleGAN.
FM079: arXiv preprint(会議版未再照合)。要旨確認。StyleGANのアーティファクト改善
-
FM080 — Tero Karras ほか (2021). Alias-Free Generative Adversarial Networks.
FM080: arXiv preprint(会議版未再照合)。要旨確認。aliasingと変換同変性
-
FM081 — Minguk Kang ほか (2023). Scaling up GANs for Text-to-Image Synthesis.
FM081: CVPR 2023。要旨確認。テキスト条件付きGANの大規模化
-
FM082 — Yiwen Huang ほか (2024). The GAN is dead; long live the GAN! A Modern GAN Baseline.
FM082: NeurIPS 2024; arXiv掲載は2025。要旨確認。相対損失とゼロ中心勾配正則化による現代的ベースライン
-
FM083, MD23 — Jonathan Ho ほか (2020). Denoising Diffusion Probabilistic Models.
FM083: arXiv preprint(会議版未再照合)。要旨確認。拡散モデルとの目的関数・生成手順の比較
MD23: NeurIPS 2020, published。要旨確認。denoising目的による拡散生成
-
FM084 — Tianwei Yin ほか (2024). Improved Distribution Matching Distillation for Fast Image Synthesis.
FM084: arXiv preprint(会議版未再照合)。要旨確認。GAN損失と拡散蒸留を接続
-
FM085 — Saumya Gupta ほか (2026). Image Synthesis Using Spintronic Deep Convolutional Generative Adversarial Network.
FM085: arXiv preprint。要旨確認。2026年の特殊ハードウェア実装の例
-
FM086, SY003 — Mohammad Shoeybi ほか (2019). Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism.
FM086: arXiv preprint。要旨確認。層内モデル並列
SY003: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。Transformerのtensor parallelism。
-
FM087, SY001 — Samyam Rajbhandari ほか (2019). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models.
FM087: arXiv preprint(会議版未再照合)。要旨確認。optimizer・gradient・parameterの分割
SY001: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。model state重複削減の基礎。
-
FM088 — Edward J. Hu ほか (2021). LoRA: Low-Rank Adaptation of Large Language Models.
FM088: arXiv preprint(会議版未再照合)。要旨確認。低ランク差分による適応
-
FM089 — Tim Dettmers ほか (2023). QLoRA: Efficient Finetuning of Quantized LLMs.
FM089: arXiv preprint(会議版未再照合)。要旨確認。4bit凍結重みとLoRA学習
-
FM090 — Elias Frantar ほか (2022). GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers.
FM090: ICLR 2023。要旨確認。二次情報を使う学習後量子化
-
FM091 — Ji Lin ほか (2023). AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration.
FM091: MLSys 2024。要旨確認。activationに基づく重要重み保護
-
FM092 — Woosuk Kwon ほか (2023). Efficient Memory Management for Large Language Model Serving with PagedAttention.
FM092: arXiv preprint(会議版未再照合)。要旨確認。KVキャッシュのページ管理
-
FM093 — Yaniv Leviathan ほか (2022). Fast Inference from Transformers via Speculative Decoding.
FM093: ICML 2023。要旨確認。分布保存型speculative decoding
-
FM094 — Lianmin Zheng ほか (2023). SGLang: Efficient Execution of Structured Language Model Programs.
FM094: arXiv preprint(会議版未再照合)。要旨確認。構造化生成とprefix cache共有
-
FM095 — Jiquan Ngiam ほか (2011). Multimodal Deep Learning.
FM095: ICML 2011。書誌確認。音声・映像の共有表現とcross-modal転移
-
FM096 — Sören Richard Stahlschmidt ほか (2022). Multimodal deep learning for biomedical data fusion: a review.
FM096: Briefings in Bioinformatics 23(2), bbab569 (2022)。本文該当節確認。生体データ融合の分類と評価設計
-
FM097 — Jabeen Summaira ほか (2021). Recent Advances and Trends in Multimodal Deep Learning: A Review.
FM097: arXiv preprint。要旨確認。生理信号を含む応用・データセットの概観
-
FM098 — Tuomas Kynkäänniemi ほか (2019). Improved Precision and Recall Metric for Assessing Generative Models.
FM098: NeurIPS 2019。要旨確認。品質と被覆を別々に評価
-
FM099 — Gaurav Parmar ほか (2021). On Aliased Resizing and Surprising Subtleties in GAN Evaluation.
FM099: CVPR 2022。要旨確認。FIDの前処理依存性
-
FM100 — Nicholas Carlini ほか (2020). Extracting Training Data from Large Language Models.
FM100: arXiv preprint(会議版未再照合)。要旨確認。記憶・抽出可能性と汎化の区別
-
FM101 — Han Zhang ほか (2016). StackGAN: Text to Photo-realistic Image Synthesis with Stacked Generative Adversarial Networks.
FM101: ICCV 2017。要旨確認。多段階のテキスト条件付き生成
-
FM102 — Atsuhiro Noguchi ほか (2019). RGBD-GAN: Unsupervised 3D Representation Learning From Natural Image Datasets via RGBD Image Synthesis.
FM102: ICLR 2020。要旨確認。2D画像から3D整合性を学習
-
FM103 — Cyprien de Masson d’Autume ほか (2019). Training language GANs from Scratch.
FM103: arXiv preprint(会議版未再照合)。要旨確認。離散言語GANの学習と多様性
-
FM104 — Vineet Kosaraju ほか (2019). Social-BiGAT: Multimodal Trajectory Forecasting using Bicycle-GAN and Graph Attention Networks.
FM104: arXiv preprint(会議版未再照合)。要旨確認。社会的相互作用と多峰的軌道予測
-
FM105 — Shanchuan Lin ほか (2025). Diffusion Adversarial Post-Training for One-Step Video Generation.
FM105: ICML 2025。要旨確認。拡散事前学習と敵対的後学習による動画生成
-
FM106 — William Nixon ほか (2026). A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing.
FM106: arXiv preprint。要旨確認。長期実運用トレースに基づくserving評価
-
FM107 — Ian Goodfellow (2016). NIPS 2016 Tutorial: Generative Adversarial Networks.
FM107: NIPS 2016 tutorial report; arXiv識別子は1701、Submittedは2016-12-31。要旨確認。GANの目的・生成モデル間の比較を原著者のチュートリアルから学ぶ
-
FM108 — Bisakha Ray ほか (2014). Information content and analysis methods for Multi-Modal High-Throughput Biomedical Data.
FM108: Scientific Reports 4, 4411 (2014)。要旨確認。複数modalityを足しても予測が改善するとは限らないという比較設計
-
FM109 — Janani Venugopalan ほか (2021). Multimodal deep learning models for early detection of Alzheimer’s disease stage.
FM109: Scientific Reports 11, 3254 (2021)。要旨確認。MRI・遺伝・臨床データの融合をADNI上で評価した具体例
-
FM110 — 福水健次 (2019). 深層生成モデルによる統計的推論.
FM110: 統計数理研究所創立75周年記念チュートリアル講演、2019-06-05。一次資料確認。GANを分布比較・Bayes推論とつなぐ講義資料
-
FM111 — Microsoft DeepSpeed Team (2023). DeepSpeed: 深層学習の訓練と推論を劇的に高速化するフレームワーク.
FM111: 公式日本語概要スライド、2023-06-07。一次資料確認。ZeRO等の研究からフレームワークの機能へ進む導入
-
FM112 — Denny Zhou (2024). LLM Reasoning: Key Ideas and Limitations.
FM112: 著者公開講義スライド(表紙のBerkeley講演年2024を採用)。一次資料確認。CoT・self-consistencyなどの研究を著者の講義でたどる
数理手法・学習ダイナミクス(主登録86件)
章本文。他章との共通文献には複数IDを併記する。
-
MD01 — Atilim Gunes Baydin; Barak A. Pearlmutter; Alexey Andreyevich Radul; Jeffrey Mark Siskind (2018). Automatic Differentiation in Machine Learning: a Survey.
MD01: JMLR 18(153), published。要旨確認。ADと逆伝播の関係、forward/reverse modeの標準レビュー
-
MD02 — Barak A. Pearlmutter (1994). Fast Exact Multiplication by the Hessian.
MD02: Neural Computation 6(1), published。要旨確認。Hessianを構築せずHVPを計算する原典
-
MD03 — M. F. Hutchinson (1989). A Stochastic Estimator of the Trace of the Influence Matrix for Laplacian Smoothing Splines.
MD03: Communications in Statistics - Simulation and Computation 18(3), published。要旨確認。確率的トレース推定の原典
-
MD04 — Raphael A. Meyer; Cameron Musco; Christopher Musco; David P. Woodruff (2021). Hutch++: Optimal Stochastic Trace Estimation.
MD04: SOSA 2021, published (preprint 2020)。要旨確認。低ランク近似と残差推定による分散削減
-
MD05 — Felix Dangel; Frederik Kunstner; Philipp Hennig (2020). BackPACK: Packing more into Backprop.
MD05: ICLR 2020, published (preprint 2019)。要旨確認。個別勾配と曲率近似を逆伝播で計算
-
MD06 — Behrooz Ghorbani; Shankar Krishnan; Ying Xiao (2019). An Investigation into Neural Net Optimization via Hessian Eigenvalue Density.
MD06: ICML 2019, published。要旨確認。Hessianスペクトルと勾配方向の関係
-
MD07 — Frederik Kunstner; Lukas Balles; Philipp Hennig (2019). Limitations of the Empirical Fisher Approximation for Natural Gradient Descent.
MD07: NeurIPS 2019, published。要旨確認。empirical Fisherと曲率の混同への反例
-
MD09 — Guillaume Dalle; Adrian Hill (2026). A Common Interface for Automatic Differentiation.
MD09: JMLR 27(25), published January 2026。要旨確認。AD backend比較・疎性・準備処理の共通化
-
MD10 — Arthur Jacot; Franck Gabriel; Clément Hongler (2018). Neural Tangent Kernel: Convergence and Generalization in Neural Networks.
MD10: NeurIPS 2018, published。本文該当節確認。関数空間の学習ダイナミクスをNTKで表現
-
MD11 — Jaehoon Lee; Lechao Xiao; Samuel S. Schoenholz; Yasaman Bahri; Roman Novak; Jascha Sohl-Dickstein; Jeffrey Pennington (2019). Wide Neural Networks of Any Depth Evolve as Linear Models Under Gradient Descent.
MD11: NeurIPS 2019, published。要旨確認。幅極限でのネットワーク線形化
-
MD12 — Lenaic Chizat; Edouard Oyallon; Francis Bach (2019). On Lazy Training in Differentiable Programming.
MD12: NeurIPS 2019, published (preprint 2018)。要旨確認。lazy trainingは幅だけでなくスケーリングで決まる
-
MD13 — Greg Yang; Edward J. Hu (2021). Feature Learning in Infinite-Width Neural Networks.
MD13: ICML 2021, published (preprint 2020)。要旨確認。無限幅でも特徴学習するパラメータ化
-
MD14 — Greg Yang; Edward J. Hu; Igor Babuschkin; Szymon Sidor; Xiaodong Liu; David Farhi; Nick Ryder; Jakub Pachocki; Weizhu Chen; Jianfeng Gao (2021). Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer.
MD14: NeurIPS 2021, published; arXiv登録2022(刊行年と登録年が異なる)。要旨確認。μPと小規模モデルからのハイパーパラメータ移送
-
MD15 — Mikhail Belkin; Daniel Hsu; Siyuan Ma; Soumik Mandal (2019). Reconciling modern machine learning practice and the bias-variance trade-off.
MD15: PNAS 2019, published (preprint 2018)。要旨確認。double descentの統一的描像
-
MD16, MD29 — Preetum Nakkiran; Gal Kaplun; Yamini Bansal; Tristan Yang; Boaz Barak; Ilya Sutskever (2020). Deep Double Descent: Where Bigger Models and More Data Hurt.
MD16: ICLR 2020, published; arXiv初稿2019。要旨確認。モデル幅・epoch・データ数に沿った非単調性
MD29: ICLR 2023, published; arXiv初稿2022。要旨確認。rectificationと輸送コスト・軌道の直線化
-
MD17 — Trevor Hastie; Andrea Montanari; Saharon Rosset; Ryan J. Tibshirani (2022). Surprises in High-Dimensional Ridgeless Least Squares Interpolation.
MD17: Annals of Statistics 50(2), published (preprint 2019)。要旨確認。高次元線形・ランダム特徴回帰の精密リスク解析
-
MD18 — Peter L. Bartlett; Philip M. Long; Gábor Lugosi; Alexander Tsigler (2020). Benign Overfitting in Linear Regression.
MD18: PNAS 2020, published (preprint 2019)。要旨確認。良性過学習を共分散の有効ランクで特徴づけ
-
MD19 — Jonathan Plenk; Sergio Calvo-Ordonez; Alvaro Cartea; Yarin Gal; Mark van der Wilk; Kamil Ciosek (2026). The Neural Tangent Kernel for Classification.
MD19: preprint; submitted 2026-05-17, v2 2026-05-22。要旨確認。分類損失でのlazy領域の条件
-
MD20 — Zixiang Chen; Yuan Cao; Quanquan Gu; Tong Zhang (2020). A Generalized Neural Tangent Kernel Analysis for Two-layer Neural Networks.
MD20: NeurIPS 2020, published。要旨確認。ノイズ・weight decayを含む2層NTK解析
-
MD21 — Kenji Kawaguchi; Qingyun Sun (2021). A Recipe for Global Convergence Guarantee in Deep Neural Networks.
MD21: AAAI 2021, published。要旨確認。expressivity conditionを用いたNTK外の収束保証
-
MD22 — Shun-ichi Amari (2020). Any Target Function Exists in a Neighborhood of Any Sufficiently Wide Random Network: A Geometrical Perspective.
MD22: Neural Computation 32(8), published。要旨確認。近傍での表現能力の幾何的説明
-
MD24 — Jascha Sohl-Dickstein; Eric A. Weiss; Niru Maheswaranathan; Surya Ganguli (2015). Deep Unsupervised Learning using Nonequilibrium Thermodynamics.
MD24: ICML 2015, published。要旨確認。前向き拡散と逆過程による生成の基礎
-
MD25 — Yang Song; Jascha Sohl-Dickstein; Diederik P. Kingma; Abhishek Kumar; Stefano Ermon; Ben Poole (2021). Score-Based Generative Modeling through Stochastic Differential Equations.
MD25: ICLR 2021, published (preprint 2020)。要旨確認。reverse SDEとprobability-flow ODEの統一
-
MD26 — Ricky T. Q. Chen; Yulia Rubanova; Jesse Bettencourt; David Duvenaud (2018). Neural Ordinary Differential Equations.
MD26: NeurIPS 2018, published。要旨確認。連続深度ネットワークとCNF
-
MD27 — Will Grathwohl; Ricky T. Q. Chen; Jesse Bettencourt; Ilya Sutskever; David Duvenaud (2019). FFJORD: Free-form Continuous Dynamics for Scalable Reversible Generative Models.
MD27: ICLR 2019, published; arXiv初稿2018。要旨確認。確率的divergence推定でCNFを大規模化
-
MD28 — Yaron Lipman; Ricky T. Q. Chen; Heli Ben-Hamu; Maximilian Nickel; Matt Le (2023). Flow Matching for Generative Modeling.
MD28: ICLR 2023, published (preprint 2022)。要旨確認。条件付き速度回帰によるsimulation-free学習
-
MD30 — Alexander Tong; Kilian Fatras; Nikolay Malkin; Guillaume Huguet; Yanlei Zhang; Jarrid Rector-Brooks; Guy Wolf; Yoshua Bengio (2024). Improving and generalizing flow-based generative models with minibatch optimal transport.
MD30: TMLR 2024, published (preprint 2023)。要旨確認。CFMの一般化とminibatch OT coupling
-
MD31 — Michael S. Albergo; Nicholas M. Boffi; Eric Vanden-Eijnden (2025). Stochastic Interpolants: A Unifying Framework for Flows and Diffusions.
MD31: JMLR 26, published September 2025; arXiv初稿2023。要旨確認。flowとdiffusionを確率補間で統一
-
MD32 — Yang Song; Prafulla Dhariwal; Mark Chen; Ilya Sutskever (2023). Consistency Models.
MD32: ICML 2023, published。要旨確認。同一軌道上の写像整合性による少数step生成
-
MD33 — Patrick Esser; Sumith Kulal; Andreas Blattmann; Rahim Entezari; Jonas Müller; Harry Saini; Yam Levi; Dominik Lorenz; Axel Sauer; Frederic Boesel; Dustin Podell; Tim Dockhorn; Zion English; Kyle Lacey; Alex Goodwin; Yannik Marek; Robin Rombach (2024). Scaling Rectified Flow Transformers for High-Resolution Image Synthesis.
MD33: ICML 2024, published;ここではarXiv版の著者一覧を記載。要旨確認。時間サンプリング・Transformer・規模の実証
-
MD34 — Itai Gat; Tal Remez; Neta Shaul; Felix Kreuk; Ricky T. Q. Chen; Gabriel Synnaeve; Yossi Adi; Yaron Lipman (2024). Discrete Flow Matching.
MD34: NeurIPS 2024, published。要旨確認。離散空間の確率経路と遷移率
-
MD35 — Yaron Lipman; Marton Havasi; Peter Holderrieth; Neta Shaul; Matt Le; Brian Karrer; Ricky T. Q. Chen; David Lopez-Paz; Heli Ben-Hamu; Itai Gat (2024). Flow Matching Guide and Code.
MD35: arXiv guide 2024。要旨確認。連続・離散FMの公式体系化
-
MD36 — Zhengyang Geng; Mingyang Deng; Xingjian Bai; J. Zico Kolter; Kaiming He (2025). Mean Flows for One-step Generative Modeling.
MD36: NeurIPS 2025, proceedings PDF確認。要旨確認。平均速度を直接学習し1-NFE生成
-
MD37 — Zhengyang Geng; Yiyang Lu; Zongze Wu; Eli Shechtman; J. Zico Kolter; Kaiming He (2025). Improved Mean Flows: On the Challenges of Fastforward Generative Models.
MD37: technical report; submitted 2025-12-01, v2 2026-05-09。要旨確認。学習目的・guidance条件付けの改善
-
MD38 — Mudit Gaur; Prashant Trivedi; Shuchin Aeron; Amrit Singh Bedi; George K. Atia; Vaneet Aggarwal (2025). Generative Modeling with Continuous Flows: Sample Complexity of Flow Matching.
MD38: preprint; submitted 2025-12-01。本文該当節確認。近似・統計・最適化誤差を分けたFM保証
-
MD39 — Gabriel Peyré; Marco Cuturi (2019). Computational Optimal Transport.
MD39: Foundations and Trends in Machine Learning 11(5-6), published。要旨確認。離散OT、正則化、計算、応用の標準書
-
MD40 — Marco Cuturi (2013). Sinkhorn Distances: Lightspeed Computation of Optimal Transportation Distances.
MD40: NeurIPS 2013, published;刊行版題名末尾はOptimal Transport、掲載題名はarXiv版。要旨確認。エントロピー正則化による高速OT
-
MD41 — Jean Feydy; Thibault Séjourné; François-Xavier Vialard; Shun-ichi Amari; Alain Trouvé; Gabriel Peyré (2019). Interpolating between Optimal Transport and MMD using Sinkhorn Divergences.
MD41: AISTATS 2019, published。要旨確認。自己コスト補正とOT–MMDの補間
-
MD42 — Nicolas Courty; Rémi Flamary; Devis Tuia; Alain Rakotomamonjy (2017). Optimal Transport for Domain Adaptation.
MD42: IEEE TPAMI 39(9):1853–1865, published; arXiv初稿2015。要旨確認。クラス構造を考慮した分布輸送
-
MD43 — Nicolas Courty; Rémi Flamary; Amaury Habrard; Alain Rakotomamonjy (2017). Joint Distribution Optimal Transportation for Domain Adaptation.
MD43: NeurIPS 2017, published。要旨確認。特徴とラベルの結合分布を輸送
-
MD44 — Bharath Bhushan Damodaran; Benjamin Kellenberger; Rémi Flamary; Devis Tuia; Nicolas Courty (2018). DeepJDOT: Deep Joint Distribution Optimal Transport for Unsupervised Domain Adaptation.
MD44: ECCV 2018, published。要旨確認。表現学習とJDOTを結合
-
MD45 — Lenaic Chizat; Gabriel Peyré; Bernhard Schmitzer; François-Xavier Vialard (2018). Scaling Algorithms for Unbalanced Transport Problems.
MD45: Mathematics of Computation 87(314):2563–2609, published; arXiv初稿2016、刊行版題名にはOptimalが加わる。要旨確認。周辺質量を緩和する一般化Sinkhorn
-
MD46 — Kilian Fatras; Thibault Séjourné; Nicolas Courty; Rémi Flamary (2021). Unbalanced minibatch Optimal Transport; applications to Domain Adaptation.
MD46: ICML 2021, published;著者順は論文PDF準拠。要旨確認。minibatchの不適切な対応を質量緩和で改善
-
MD47 — Yogesh Balaji; Rama Chellappa; Soheil Feizi (2020). Robust Optimal Transport with Applications in Generative Modeling and Domain Adaptation.
MD47: NeurIPS 2020, published。要旨確認。外れ値を含む深層学習に使えるrobust OT双対
-
MD48 — Sloan Nietert; Rachel Cummings; Ziv Goldfeld (2022). Outlier-Robust Optimal Transport: Duality, Structure, and Statistical Analysis.
MD48: AISTATS 2022, published;著者順はarXiv準拠。要旨確認。汚染モデル下のrobust Wasserstein理論
-
MD49 — Jin Zhang; Mingyang Zhao; Bing Liu; Xin Jiang (2026). Sinkhorn-CPD: Robust point cloud registration via unbalanced entropic optimal transport.
MD49: arXiv公開 2026-06-15; Computer-Aided Design 199 (2026), 104104との書誌記載あり、雑誌刊行日未照合。要旨確認。外れ値・部分重複を含む点群整合へのUOT
-
MD50 — Nicholas Metropolis; Arianna W. Rosenbluth; Marshall N. Rosenbluth; Augusta H. Teller; Edward Teller (1953). Equation of State Calculations by Fast Computing Machines.
MD50: Journal of Chemical Physics 21(6), published。要旨確認。Metropolis法の原典
-
MD51 — W. K. Hastings (1970). Monte Carlo sampling methods using Markov chains and their applications.
MD51: Biometrika 57(1), published。要旨確認。非対称提案を含むMH法
-
MD52 — Radford M. Neal (2012). MCMC using Hamiltonian dynamics.
MD52: arXiv公開版2012 (Handbook章2011)。要旨確認。HMCの標準レビュー
-
MD53 — Matthew D. Hoffman; Andrew Gelman (2014). The No-U-Turn Sampler: Adaptively Setting Path Lengths in Hamiltonian Monte Carlo.
MD53: JMLR 15(47), published。要旨確認。HMC積分時間を自動化
-
MD54 — Michael Betancourt (2017). A Conceptual Introduction to Hamiltonian Monte Carlo.
MD54: arXiv review 2017, revised 2018。要旨確認。典型集合・幾何・HMCの失敗を解説
-
MD55 — Max Welling; Yee Whye Teh (2011). Bayesian Learning via Stochastic Gradient Langevin Dynamics.
MD55: ICML 2011, published;著者所属機関の原著書誌・abstract確認。要旨確認。minibatch勾配に適切なノイズを加える事後サンプリング
-
MD56 — Tianqi Chen; Emily Fox; Carlos Guestrin (2014). Stochastic Gradient Hamiltonian Monte Carlo.
MD56: ICML 2014, published。要旨確認。勾配ノイズを摩擦・拡散で扱う
-
MD57 — Aki Vehtari; Andrew Gelman; Daniel Simpson; Bob Carpenter; Paul-Christian Bürkner (2021). Rank-normalization, folding, and localization: An improved R-hat for assessing convergence of MCMC.
MD57: Bayesian Analysis, published (preprint 2019)。要旨確認。rank-based診断と局所効率
-
MD58 — Nawaf Bou-Rabee; Bob Carpenter; Tore Selland Kleppe; Sifan Liu (2026). The Within-Orbit Adaptive Leapfrog No-U-Turn Sampler.
MD58: JMLR 27(113), published March 2026。本文該当節確認。軌道中のstep sizeを適応するWALNUTS
-
MD59 — P.-A. Absil; Robert Mahony; Rodolphe Sepulchre (2008). Optimization Algorithms on Matrix Manifolds.
MD59: Princeton University Press book, published。書誌確認。射影、接空間、retractionの標準書
-
MD60 — Nicolas Boumal (2023). An Introduction to Optimization on Smooth Manifolds.
MD60: Cambridge University Press book, published。一次資料確認。現代的Riemannian最適化の教科書
-
MD61 — Tim Large; Yang Liu; Minyoung Huh; Hyojin Bahng; Phillip Isola; Jeremy Bernstein (2024). Scalable Optimization in the Modular Norm.
MD61: NeurIPS 2024, proceedings PDF確認。要旨確認。層合成に沿ったノルムと感度・学習率配分
-
MD62 — Jeremy Bernstein (2025). Modular Manifolds.
MD62: 著者公式研究記事 2025-09-26;査読論文ではない。一次資料確認。Stiefel制約とspectral-norm更新の研究提案
-
MD63 — Aapo Hyvärinen; Erkki Oja (2000). Independent component analysis: algorithms and applications.
MD63: Neural Networks 13, published。要旨確認。線形ICAの識別可能性と推定
-
MD64 — Aapo Hyvärinen; Hiroaki Sasaki; Richard E. Turner (2019). Nonlinear ICA Using Auxiliary Variables and Generalized Contrastive Learning.
MD64: AISTATS 2019, published。要旨確認。補助変数で非線形ICAの非識別性を解く
-
MD65 — Ilyes Khemakhem; Diederik P. Kingma; Ricardo Pio Monti; Aapo Hyvärinen (2020). Variational Autoencoders and Nonlinear ICA: A Unifying Framework.
MD65: AISTATS 2020, published。要旨確認。条件付きpriorを用いるidentifiable VAE
-
MD66 — Francesco Locatello; Stefan Bauer; Mario Lucic; Gunnar Rätsch; Sylvain Gelly; Bernhard Schölkopf; Olivier Bachem (2019). Challenging Common Assumptions in the Unsupervised Learning of Disentangled Representations.
MD66: ICML 2019, published。要旨確認。追加仮定なしのdisentanglementの非識別性
-
MD67 — Bernhard Schölkopf; Francesco Locatello; Stefan Bauer; Nan Rosemary Ke; Nal Kalchbrenner; Anirudh Goyal; Yoshua Bengio (2021). Towards Causal Representation Learning.
MD67: Proceedings of the IEEE 109(5), published;雑誌題名はToward。要旨確認。因果機構と表現学習の研究プログラム
-
MD68 — Siyuan Guo; Viktor Tóth; Bernhard Schölkopf; Ferenc Huszár (2023). Causal de Finetti: On the Identification of Invariant Causal Structure in Exchangeable Data.
MD68: NeurIPS 2023, published (preprint 2022)。要旨確認。交換可能データとICMの識別理論
-
MD69 — Inbeom Lee; Tongtong Jin; Bryon Aragam (2026). Beyond identifiability: Learning causal representations with few environments and finite samples.
MD69: preprint; submitted 2026-03-26。本文該当節確認。線形潜在因子における有限標本・少数環境保証
-
MD70 — Kwonho Kim; Heejeong Nam; Inwoo Hwang; Sanghack Lee (2026). On Causal Representation Learning with Internal Auxiliaries.
MD70: UAI 2026, PMLR 337, published。要旨確認。内部補助変数を含む識別可能性の条件
-
MD71 — Manzil Zaheer; Satwik Kottur; Siamak Ravanbakhsh; Barnabas Poczos; Ruslan Salakhutdinov; Alexander Smola (2017). Deep Sets.
MD71: NeurIPS 2017, published。要旨確認。集合の置換不変・同変ネットワーク
-
MD72 — Taco S. Cohen; Max Welling (2016). Group Equivariant Convolutional Networks.
MD72: ICML 2016, published。要旨確認。群作用に沿う畳み込み
-
MD73 — Michael M. Bronstein; Joan Bruna; Taco Cohen; Petar Veličković (2021). Geometric Deep Learning: Grids, Groups, Graphs, Geodesics, and Gauges.
MD73: arXiv monograph 2021。要旨確認。対称性と帰納バイアスの体系化
-
MD74 — Jerome H. Friedman; Bogdan E. Popescu (2008). Predictive learning via rule ensembles.
MD74: Annals of Applied Statistics 2(3), published。要旨確認。ルールモデル・特徴の交互作用とH統計量
-
MD75 — Michael Tsang; Dehua Cheng; Yan Liu (2018). Detecting Statistical Interactions from Neural Network Weights.
MD75: ICLR 2018, published (preprint 2017)。要旨確認。学習済み重みから相互作用を検出するNID
-
MD80 — Gauthier Gidel; Hugo Berard; Gaëtan Vignoud; Pascal Vincent; Simon Lacoste-Julien (2019). A Variational Inequality Perspective on Generative Adversarial Networks.
MD80: ICLR 2019, published; arXiv初稿2018。要旨確認。ゲームに対するextragradientと平均化
-
MD81 — Florian Schäfer; Anima Anandkumar (2019). Competitive Gradient Descent.
MD81: NeurIPS 2019, published。要旨確認。局所双線形ゲームのNash更新
-
MD82 — Pavel Izmailov; Dmitrii Podoprikhin; Timur Garipov; Dmitry Vetrov; Andrew Gordon Wilson (2018). Averaging Weights Leads to Wider Optima and Better Generalization.
MD82: UAI 2018, published。要旨確認。SWAの原著
-
MD83 — Wesley Maddox; Timur Garipov; Pavel Izmailov; Dmitry Vetrov; Andrew Gordon Wilson (2019). A Simple Baseline for Bayesian Uncertainty in Deep Learning.
MD83: NeurIPS 2019, published。要旨確認。SWA軌道の共分散を用いるSWAG
-
MD84 — Karl Cobbe; Christopher Hesse; Jacob Hilton; John Schulman (2020). Leveraging Procedural Generation to Benchmark Reinforcement Learning.
MD84: ICML 2020, published; arXiv初稿2019。要旨確認。Procgenによる未知環境汎化の評価
-
MD85 — Kaixin Wang; Bingyi Kang; Jie Shao; Jiashi Feng (2020). Improving Generalization in Reinforcement Learning with Mixture Regularization.
MD85: NeurIPS 2020, published。要旨確認。RL汎化のデータ混合baseline
-
MD86 — Victor Garcia Satorras; Emiel Hoogeboom; Max Welling (2021). E(n) Equivariant Graph Neural Networks.
MD86: ICML 2021, published。要旨確認。回転・並進・反射・置換に同変なGNN
-
MD87 — Valentin De Bortoli; James Thornton; Jeremy Heng; Arnaud Doucet (2021). Diffusion Schrödinger Bridge with Applications to Score-Based Generative Modeling.
MD87: NeurIPS 2021, published。要旨確認。経路空間のエントロピー正則化OT
-
MD88 — Aapo Hyvärinen (2005). Estimation of Non-Normalized Statistical Models by Score Matching.
MD88: JMLR 6(24), published。要旨確認。正規化定数を避けたscore推定
-
MD89 — Yang Song; Stefano Ermon (2019). Generative Modeling by Estimating Gradients of the Data Distribution.
MD89: NeurIPS 2019, published。要旨確認。多尺度scoreとannealed Langevin sampling
-
MD90 — Okan Koc; Alexander Soen; Chao-Kai Chiang; Masashi Sugiyama (2025). Domain Adaptation and Entanglement: an Optimal Transport Perspective.
MD90: AISTATS 2025, PMLR 258:3034–3042, published。要旨確認。周辺分布整合だけでは解消できない条件付き分布差を解析
-
MD91 — Thomas Sesmat; Gabriel Meseguer-Brocal; Geoffroy Peeters (2026). Where Flow Matching Leaks: Characterising the Membership Signals Along the Interpolation Path.
MD91: ICML 2026(July 6–11), PMLR 306:109269–109293, published。要旨確認。補間時刻ごとの訓練・テスト再構成差とmemorizationの解析
-
MD92 — 池田 思朗 (1999). 独立成分解析の信号処理への応用.
MD92: 計測と制御 38(7):461–467, 1999-07-10, published。本文該当節確認。PCAの無相関化とICAの独立性、信号分離への応用を日本語で整理
-
MD93 — Robin Rombach; Andreas Blattmann; Dominik Lorenz; Patrick Esser; Björn Ommer (2022). High-Resolution Image Synthesis with Latent Diffusion Models.
MD93: CVPR 2022との著者arXiv記載; arXiv初稿2021。要旨確認。事前学習autoencoderの潜在空間でdiffusionを訓練する
並列学習・計算基盤(主登録10件)
章本文。他章との共通文献には複数IDを併記する。
-
SY002 — Yanping Huang; Youlong Cheng; Ankur Bapna; ほか (2018). GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism.
SY002: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。layer分割とmicrobatch pipeline。
-
SY004 — Yanli Zhao; Andrew Gu; Rohan Varma; ほか (2023). PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel.
SY004: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。FSDPの実装・memory管理経験。
-
SY005 — Wanchao Liang; Tianyu Liu; Less Wright; ほか (2024). TorchTitan: One-stop PyTorch native solution for production ready LLM pre-training.
SY005: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。PyTorch-nativeに並列化を組み合わせる。
-
SY006 — Deepak Narayanan; Mohammad Shoeybi; Jared Casper; ほか (2021). Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM.
SY006: SC 2021。要旨確認。DP・TP・PPの複合設計。
-
SY007 — Paulius Micikevicius; Sharan Narang; Jonah Alben; ほか (2017). Mixed Precision Training.
SY007: ICLR 2018(arXiv初出2017)。要旨確認。FP16、master weight、loss scaling。
-
SY008 — Tianqi Chen; Bing Xu; Chiyuan Zhang; Carlos Guestrin (2016). Training Deep Nets with Sublinear Memory Cost.
SY008: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。再計算とactivation memoryの交換。
-
SY010 — Gabriel Ilharco; Marco Tulio Ribeiro; Mitchell Wortsman; ほか (2022). Editing Models with Task Arithmetic.
SY010: ICLR 2023(arXiv初出2022)。要旨確認。finetuning差分をtask vectorとして操作。
-
SY011 — Prateek Yadav; Derek Tam; Leshem Choshen; Colin Raffel; Mohit Bansal (2023). TIES-Merging: Resolving Interference When Merging Models.
SY011: NeurIPS 2023。要旨確認。model差分の符号干渉への対処。
-
SY013 — Hao Liu; Matei Zaharia; Pieter Abbeel (2023). Ring Attention with Blockwise Transformers for Near-Infinite Context.
SY013: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。長いsequenceをblockwiseに分散。
-
SY015 — Aaron Harlap; Deepak Narayanan; Amar Phanishayee; ほか (2018). PipeDream: Fast and Efficient Pipeline Parallel DNN Training.
SY015: arXiv版参照(公刊状況を別途確認したものは注記)。要旨確認。pipelineとweight versioning。