数理手法と学習ダイナミクスの研究サーベイ:自動微分・曲率・NTK・生成・最適輸送・因果表現
対象は2026年10月3日までに公開を確認できた文献である。2026年10月末までの未来の文献は含めない。本章は下表の全トピックを扱い、代表原著・基礎文献・直近の関連研究を辿った広範なレビューであり、世界中の全論文を漏れなく収録したという意味での完全網羅性は主張しない。とくに2025–2026年は、公開日と版を確認した研究を明示的に追加した。参考文献の確認水準を末尾に示し、abstract確認と本文の該当節確認を区別する。
| 元の研究メモ | 本章で再調査する内容 |
|---|---|
| mathematical-methods/automatic-differentiation.md | AD、JVP/VJP、HVP、計算資源と高階微分 |
| mathematical-methods/hessian.md | トレース・スペクトル推定、測定の対象、既存コードの注意点 |
| learning-dynamics/fim.md | 真のFisher、empirical Fisher、GGN、勾配ノイズ共分散 |
| learning-dynamics/ntk.md | frozen NTK、lazy training、feature learning、元ページの4原著 |
| learning-dynamics/double-descent.md | 補間閾値、良性過学習、正則化・標本数・epoch依存 |
| mathematical-methods/flow-matching.md | CNF、diffusion、CFM、rectified flow、MeanFlow、Schrödinger bridge |
| projects/empirical-ot.md、ot-outlier.md | OTのdomain adaptation、外れ値、部分・非平衡輸送 |
| mathematical-methods/mcmc.md | MH、HMC、NUTS、SG-MCMC、診断、WALNUTS |
| mathematical-methods/modular-manifolds.md | Stiefel、多様体最適化、modular normと研究提案の成立範囲 |
| mathematical-methods/misc.md | PCA/ICA、因果表現、置換不変性・同変性、特徴の交互作用 |
| projects/ngd-gans.md、cg-gans.md、swa-rl.md | GANのゲーム最適化とSWAによるRL汎化の関連研究 |
projects下のページは計画・TODOの記録であり、論文の採択、結果の再現、研究の完了を意味しない。特にcg-gans.mdでは題名とTopic欄が一致していないため、GANとextragradientに関する明示的なTODOのみを研究領域の手掛かりにした。以下の実験提案は本サーベイの提案であり、既存プロジェクトの達成事項ではない。
1. 分野をつなぐ研究の流れ
| 時期 | 主要な変化 | 本章の重要文献 |
|---|---|---|
| 1953–2000 | 分布をMarkov連鎖で探索する方法、HVPと確率的トレース推定、独立成分の識別 | Metropolis [MD50]、HVP [MD02]、ICA [MD63] |
| 2005–2014 | score推定、計算可能なOT、minibatchによる事後推論、生成ゲーム | score matching [MD88]、Sinkhorn [MD40]、NUTS [MD53]、GAN [MD76] |
| 2015–2018 | OTによるdomain adaptation、群同変性、CNF、NTK、SWA | OT-DA [MD42]、G-CNN [MD72]、Neural ODE [MD26]、NTK [MD10] |
| 2019–2021 | lazyと特徴学習の区別、double descentの理論、非線形ICAの識別、score SDE | lazy [MD12]、double descent [MD15]、iVAE [MD65]、score SDE [MD25] |
| 2022–2024 | 速度回帰による生成、OT coupling、離散生成、因果機構の識別 | FM [MD28]、CFM [MD30]、Discrete FM [MD34]、causal de Finetti [MD68] |
| 2025–2026 | 1-step生成の目的設計、有限標本保証、分類NTK、AD基盤、局所適応HMC | MeanFlow [MD36]、iMF [MD37]、分類NTK [MD19]、WALNUTS [MD58] |
共通の鍵は「何を微分し、どの空間の幾何を測り、どの分布に対する期待値を使うか」である。Hessianは損失の局所曲率、Fisherは確率モデルの局所的な識別可能性、NTKはパラメータ更新が予測に伝わる幾何、OTは分布間の移動、MCMCは目標分布を保つ探索を扱う。同じ行列・微分・ODEが現れても、目的や期待値の取り方は異なる。
2. 自動微分、Hessian、Fisher:測る量を先に定義する
2.1 ADの基本と高階微分
$f:\mathbb R^p\to\mathbb R^m$のJacobianを$J_f$とする。forward modeは入力方向$v$に対する$J_fv$、reverse modeは出力側の重み$u$に対する$J_f^\top u$を伝播する。スカラー損失で$p$が大きい学習ではreverse modeが適する。一方、入力方向の数が少ない感度計算にはforward modeが適する。ADはプログラム中の基本演算に連鎖律を適用するもので、差分刻みを選ぶ有限差分とは異なる。ただし浮動小数点誤差、非滑らかな演算、分岐点での微分の規約は残る。Baydin et al. [MD01]
スカラー$L(\theta)$と、$\theta$に依存させない方向$v$について、
\[H(\theta)v =\left.\frac{d}{d\epsilon}\nabla L(\theta+\epsilon v)\right|_{\epsilon=0} =\nabla_\theta\left(\nabla L(\theta)^\top v\right)\]である。したがって$p\times p$のHessian全体を保持せず、勾配計算に近い桁の計算量でHVPを得られる。これは固有値計算、共役勾配、曲率推定を実用化する基本操作である。計算グラフの保持量はforward-over-reverse、reverse-over-reverse、checkpointing等で変わる。Pearlmutter [MD02]
個別サンプル勾配やGGNの対角成分を毎回手書きする負担に対し、BackPACKは逆伝播を拡張した計算基盤を提供した。2026年のDifferentiationInterface.jlは、科学計算で現れる疎性、変数の更新、分岐等に応じてAD backendを選ぶための共通interfaceと準備処理を扱う。新規AD研究は「微分を求められるか」だけでなく、「目的の微分を必要なメモリ・構造で求められるか」に広がっている。Dangel et al. [MD05]、Dalle and Hill [MD09]
2.2 トレースとスペクトル
$\mathbb E[zz^\top]=I$なら、
\[\operatorname{tr}(H)=\mathbb E_z[z^\top Hz],\qquad \widehat{\operatorname{tr}}(H)=\frac1s\sum_{j=1}^s z_j^\top H z_j.\]独立なRademacher probe $z_i\in{-1,+1}$または標準Gaussianを使える。対称$H$に対して、Gaussian probeの1標本分散は$2|H|F^2$、Rademacherでは$2\sum{i\ne j}H_{ij}^2$となる。Hessianが不定値でも不偏性は保たれるが、正負の固有値が相殺すると小さなtraceは平坦性を意味しない。相対誤差もtraceが0に近いと不安定である。Hutchinson [MD03]、Meyer et al. [MD04]
Hutch++は低ランク部分を分離して残差のtraceを確率推定し、PSD行列では所定の相対精度に必要なmatrix-vector積を改善する。PSDに対する代表保証を、一般の不定値Hessianへ無条件に移してはいけない。Hessian全体の形状を調べる場合はtraceだけでなく、最大・最小固有値、負曲率の有無、スペクトル密度、勾配と上位固有空間の重なりを併記する。大規模Hessian密度の推定により、batch normalizationと外れた固有値・勾配方向の関連が調べられている。MD04、Ghorbani et al. [MD06]
既存hessian.mdのコードを読む際には、次の点を修正課題として認識する必要がある。これは元コードの静的確認に基づく指摘で、本サーベイでは元ファイルを変更していない。
- ループ中のnext(iter(data_loader))は毎回iteratorを作り直す。shuffleが無ければ同じ先頭batchを繰り返し、shuffle有りでも全体を順に標本化したことにはならない。
- 勾配がNoneのparameterだけprobeを省略し、そのprobe列を元の勾配列・parameter列とzipすると対応がずれる。未使用parameterが途中にある場合、誤った内積やshape errorの原因になる。
- num_samplesはデータ数とprobe数を分けて定義する。両者は異なる不確実性を持つ。
- biasやnormalizationを除くと「全parameterのHessian trace」ではなく選んだ主部分行列のtraceになる。「除いても影響が小さい」という一般保証はない。
- lossのsum/mean、token数、batchサイズ、model.eval()、Dropout/BatchNormの状態、parameterの再スケーリングを揃える。
同じデータ・同じparameter subset・同じloss規約を使うことが、optimizer比較における曲率測定の前提である。
2.3 四つの行列を混同しない
負の対数尤度$\ell_i(\theta)=-\log p_\theta(y_i\mid x_i)$、$g_i=\nabla\ell_i$、$g=\frac1n\sum_i g_i$とする。
\[\begin{aligned} H&=\frac1n\sum_i\nabla_\theta^2\ell_i,\\ F&=\mathbb E_{x\sim q_x,\;y\sim p_\theta(\cdot\mid x)} [\nabla\log p_\theta(y\mid x)\nabla\log p_\theta(y\mid x)^\top],\\ F_{\rm emp}&=\frac1n\sum_i g_i g_i^\top,\\ C&=\frac1n\sum_i(g_i-g)(g_i-g)^\top =F_{\rm emp}-gg^\top . \end{aligned}\]| 行列 | 意味と成立条件 | 誤りやすい理解 |
|---|---|---|
| $H$ | 実際の損失の二階微分。負固有値を持ち得る | 常にPSDとする |
| $F$ | モデル自身から出したラベルに関するscoreの二次モーメント | 観測ラベルで計算した外積と同じとする |
| $F_{\rm emp}$ | 観測データの個別勾配の二次モーメント | Hessianの一貫した近似と無条件にみなす |
| $C$ | 勾配の中心化共分散 | FisherやHessianと同一とする |
| GGN | $J_f^\top H_{\ell,\mathrm{output}}J_f$型の曲率。出力損失が凸ならPSD | ネットワーク自身の二階微分項も含むとする |
正則性条件の下では、モデル分布に対するFisherは負の対数尤度Hessianの期待値に一致する。しかし経験損失の$H$、観測ラベルの$F_{\rm emp}$、minibatchノイズの$C$がすべて等しくなるわけではない。標本抽出が独立・復元抽出ならbatch平均のノイズ共分散は$C/B$で、非復元抽出では有限母集団補正が付く。GGNとFisherの一致にも出力モデル・損失の対応条件が要る。Kunstner et al. [MD07]、Thomas et al. [MD08]
この区別は、NGDの効率とSGDノイズの汎化効果を解釈する際に不可欠である。自然勾配の更新則や近似optimizerの比較は最適化の章を参照する。
3. NTK、特徴学習、double descent
3.1 NTKが正確に記述するもの
訓練データ上の出力を$f_\theta\in\mathbb R^n$、$J_\theta=\partial f_\theta/\partial\theta$とし、損失を$L=\frac12|f_\theta-y|^2$と置く。勾配流では
\[K_\theta=J_\theta J_\theta^\top,\qquad \dot f_\theta=-K_\theta(f_\theta-y)\]が成立する。有限幅でもこの関係は成り立つが、一般には$K_\theta$が学習中に変化する。適切な幅・初期化・学習率のスケーリングにおいて$K_\theta\simeq K_0$となることが、frozen NTK理論の追加内容である。このとき残差は$\exp(-K_0t)$に従い、正の固有値が大きい方向から学習される。Jacot et al. [MD10]、Lee et al. [MD11]
原典Theorem 2のkernel固定の議論では、Lipschitzかつ2回微分可能で2階微分が有界な活性化、training directionの時間積分が確率的に有界となる条件が使われ、証明は幅の逐次極限で進められる。任意のReLU実装・任意の同時極限へ無条件に拡張する主張ではない。本確認では§4.1–4.2とTheorem 1/2の条件を追い、証明全体の独立検算は行っていない。MD10 本文
NTKの意義は、非凸parameter空間での学習を、関数空間の線形化・kernel回帰として解析可能にした点にある。一方、訓練kernelの正定値性による訓練誤差収束は、未知分布に対する良い予測を自動的に保証しない。kernelと目的関数の整合性、サンプル分布、正則化、ノイズを別に検討する必要がある。
Chizat et al.はlazy trainingが特定のスケーリングで生じることを強調した。したがって「幅が無限なら特徴を学習できない」は誤りである。Yang and Huは無限幅でも特徴が更新されるparameterizationを構成し、μP/μTransferはこうしたスケーリングの理解をモデルサイズ間の調整に接続した。ただしμTransferは任意のarchitecture変更やデータ変更への無条件の転送保証ではない。MD12、MD13、MD14
元ntk.mdの関連論文は、次のように異なる問いに答えている。
| 論文 | 主な問い | 適用範囲の読み方 |
|---|---|---|
| Chen et al. [MD20] | ノイズとweight decayがあってもkernel的解析が可能か | 2層の特定設定であり、任意の深層モデル・ノイズへの一括保証ではない |
| Kawaguchi and Sun [MD21] | NTK領域外で収束保証を構成できるか | expressivity conditionと提案algorithmが前提で、通常のSGDの一般的な大域収束宣言ではない |
| Amari [MD22] | ランダム初期値の近傍に十分な表現能力がある理由は何か | 近傍に解が存在すること、algorithmがそこに到達すること、汎化することを区別する |
2026年のPlenk et al.は、cross-entropyなど分類損失でのlazy領域を検討するpreprintである。parameter正則化、または全クラスの確率が正となる非退化target等の条件が要点となる。separableなone-hot分類でlogitが無限に増える状況に、二乗誤差での有界な線形化をそのまま適用できるとは限らない。これは「分類ではNTKが常に無効」という結論ではなく、損失・時間・target条件を明示する必要性を示す。MD19
3.2 double descentと良性過学習
double descentは、モデル複雑さを増やすと、まず誤差が下がり、補間閾値付近で上がり、さらに大きいモデルで再び下がる現象である。古典的なbias–variance分解そのものが破れたわけではない。複雑さに対してvarianceが一方向に増えるという素朴な形が成り立たない。Belkin et al.が幅広いモデルで統一的に整理し、Nakkiran et al.は深層モデルで幅・epoch・標本数による非単調性を報告した。MD15、MD16
最も見通しの良い例は、等方Gaussian特徴による線形回帰$y=x^\top\beta+\varepsilon$である。$p/n\to\gamma$、$|\beta|^2\to r^2$、$\mathrm{Var}(\varepsilon)=\sigma^2$とし、最小ノルム最小二乗推定量($\gamma>1$では補間解)の、既約ノイズを除いた予測リスクを考える。標準的な漸近設定では、
\[R(\gamma)= \begin{cases} \sigma^2\frac{\gamma}{1-\gamma},&\gamma<1,\\[2mm] r^2(1-\gamma^{-1})+\frac{\sigma^2}{\gamma-1},&\gamma>1. \end{cases}\]$\gamma=1$近傍の小さな特異値がノイズを増幅する。一方、$\gamma>1$ではvarianceが下がっても、観測できない方向へのbiasが残る。この例でさえ「大きいほど必ず最良」ではない。相関特徴、信号方向、ridge、モデルのmisspecificationでは式も結論も変わる。Hastie et al. [MD17]
良性過学習は、訓練ノイズを完全に補間しながら小さな予測誤差を達成する性質であり、double descentという曲線の形そのものとは異なる。Bartlett et al.は線形回帰で共分散の有効ランクを用いて条件を特徴づけた。ノイズを吸収する多数の低寄与方向と、予測に重要な方向の構造が鍵となる。MD18
現在の課題は、特徴そのものが変化する現実の深層学習で、この線形・kernel理論がいつ局所的に説明力を持つかを見極めることである。比較実験では、最終epochだけの曲線に加え、早期停止・weight decay・label noiseを変え、補間時点とkernel変化量を記録する。「二回目の下降が観測されない」ことも、正則化やデータ幾何が異なれば自然である。MD12、MD13、MD16
4. Diffusion、Flow Matching、Rectified Flow、OT
4.1 生成分布を微分方程式で運ぶまで
score matchingは$s(x)=\nabla_x\log p(x)$を推定して、未知の正規化定数を避ける。低次元のデータ支持上ではscore推定が難しくなるため、Song and Ermonは異なるノイズ水準の分布を学習し、annealed Langevin dynamicsで生成した。これと並行して、Sohl-Dickstein et al.の拡散過程とHo et al.のDDPMが、段階的なノイズ除去による画像生成を発展させた。MD88、MD89、MD24、MD23
別の系譜として、Neural ODEは連続時間のベクトル場をニューラルネットで表現し、CNFは
\[\dot x_t=v_\theta(t,x_t),\qquad \frac{d}{dt}\log p_t(x_t)=-\nabla\cdot v_\theta(t,x_t)\]を用いて密度変換を追跡する。FFJORDはdivergence、すなわちJacobian traceをHutchinson型推定で計算した。ここで2節の微分・trace推定と生成モデルが直接つながる。ただし数値積分誤差まで含めて無条件に「厳密な密度」になるわけではない。MD26、MD27
高解像度生成ではLatent Diffusion Models(Rombach et al., CVPR 2022)が計算上の転換点となった。事前学習autoencoderの潜在空間へdiffusionを移し、圧縮による計算削減と細部の保存を両立させ、cross-attentionによる条件付けを導入した。ただし潜在圧縮の再構成誤差は生成過程へ持ち込まれる。既存bilevelメモにも引用があるが、autoencoder学習と生成学習を段階的に行うことだけから、内側最適解への依存を微分するbilevel法だとは言えない。MD93
4.2 FMの条件付き回帰
ノイズ分布$p_0$とデータ分布$p_1$をつなぐ経路$p_t$を設計し、連続の式
\[\partial_t p_t+\nabla\cdot(p_tu_t)=0\]を満たす速度場を学ぶ。endpoint pair $z=(x_0,x_1)$をあるcoupling $\pi$から取り、
\[x_t=(1-t)x_0+tx_1,\qquad \mathcal L_{\rm CFM} =\mathbb E_{t,(x_0,x_1)\sim\pi} \|v_\theta(t,x_t)-(x_1-x_0)\|^2\]を考える。二乗誤差の条件付き期待値の性質から、最適な周辺速度は $u_t(x)=\mathbb E[x_1-x_0\mid x_t=x]$である。条件付きtargetを使う目的は周辺targetを使う目的とparameterに依存しない分散項だけ異なり、必要な正則性・積分条件の下で勾配が一致する。このため学習中に生成ODEを解かずに済む。Lipman et al. [MD28]、Tong et al. [MD30]
重要なのは、個々の条件付き補間が直線でも、周辺速度場による生成軌道は一般には直線でないことである。異なるendpoint pairの条件付き経路が同じ地点で異なる方向を要求すると、それらを平均するためである。Rectified Flowは直線補間に沿う速度を回帰し、得られたflowによるcouplingでreflowを行って軌道の直線化を目指す。理想的なrectificationの輸送コスト保証を、有限容量network・有限学習・数値積分の結果に無条件に当てはめてはいけない。Liu et al. [MD29]
4.3 diffusion・OT・Schrödinger bridgeとの違い
| 枠組み | 学ぶ量・設計する量 | 特に確認すべき条件 |
|---|---|---|
| diffusion / score SDE | 時間ごとのscore、逆向きSDE | score誤差、noise schedule、端点と離散化 |
| probability-flow ODE | SDEと同じ周辺分布を持つ決定論的速度場 | 正確なscoreと正則性の下での周辺一致。軌道そのものの一致ではない |
| FM / CFM | 指定した確率経路の速度 | coupling、条件付き経路、周辺場、ODE解の存在・一意性 |
| OT-CFM | endpointのOT couplingを用いた速度 | minibatch OTと母集団OTを区別 |
| stochastic interpolants | 補間とノイズを設計し、flow/拡散を導く | noise level、likelihoodを制御できる条件 |
| Schrödinger bridge | 指定端点を持ち、基準確率過程に近い経路分布 | 基準過程と経路空間のKL、反復近似の誤差 |
根拠:score SDE [MD25]、OT-CFM [MD30]、stochastic interpolants [MD31]、Diffusion Schrödinger Bridge [MD87]。
前向きSDEが$dx=f_t(x)dt+g_t\,dW_t$で拡散係数が状態に依存しない場合、probability-flow ODEの速度は$f_t-\frac12g_t^2\nabla\log p_t$となる。逆SDEとODEの同じ周辺分布という関係は、学習済み近似scoreと有限step solverで厳密に保たれるとは限らない。MD25
また、Gaussianから各データ点への条件付きの「OT path」と、二つの母集団間の二次Wasserstein最適輸送は同義ではない。動的OTへの対応にはendpoint couplingが本来のOT planである等の条件が必要で、minibatch内で最適でも全データ上で最適とは限らない。MD28、MD30
4.4 2024–2026年の発展
高解像度生成では、rectified flowの時間サンプリングとTransformerの設計が大規模に検討された。Discrete Flow Matchingでは、連続ベクトル場の代わりに離散状態の確率流と遷移率を扱う。連続データのODEをそのままtoken列に適用したものではない。理論と実装の入口として著者によるFlow Matching Guide and Codeが有用である。MD33、MD34、MD35
少数step化には異なる方法がある。Consistency Modelsは同じprobability-flow軌道上の点を共通の終点へ写す整合性を学ぶ。MeanFlowは瞬間速度ではなく区間の平均速度をモデル化し、平均速度と瞬間速度を結ぶ恒等式で学習する。前者の蒸留・独立学習の選択と、後者のfrom-scratch学習を混同しない。MD32、MD36
iMF(2025年12月初稿、2026年5月改訂)は、MeanFlowのtargetがnetwork自身にも依存する点と、訓練時に固定されたguidanceを課題として扱った。瞬間速度に対するlossを平均速度networkで再parameterizeし、guidanceを条件変数として扱う。ただしabstractで報告されたFIDを異なるtokenizer・guidance・訓練量の研究と直接順位比較するのは適切でない。本調査ではtechnical reportとして扱う。MD37
Gaur et al.(2025年12月preprint)は、FMの誤差を近似・統計・最適化に分解し、完全なERM oracleを置かずに標本複雑度を検討した。本文のAssumptions 3.1–3.4にはPL条件、smoothness、勾配分散の有界性、近似誤差、flowの正則性が置かれる。したがって報告される$\mathcal O(\epsilon^{-4})$型の標本数を、任意の大規模Transformerに普遍的なdimension-free保証と読んではいけない。MD38
未解決なのは、少数step化でのtail・mode coverage・条件忠実性、ODE誤差と学習誤差の切り分け、離散・多様体・不均衡データのcoupling、likelihoodと知覚品質の両立である。比較表には少なくとも訓練計算量、parameter数、tokenizer、guidance、NFE、solver、生成標本数を含めたい。これは上記文献の比較条件を踏まえた本サーベイの評価設計上の提案である。
生成品質とmemorizationの測定を分ける動きも現れている。Sesmat et al.(ICML 2026)は、線形補間の時刻に沿った訓練・テスト再構成差を解析し、Gaussian仮定下で差のピーク位置を導出した。要旨では画像・音声での検証と、validation指標が安定していてもmembership signalが蓄積する結果を報告する。ピークの閉形式を任意のデータ分布へ拡張する根拠はなく、生成品質指標だけで汎化を判断しないための補完的測定と位置づける。MD91
5. 最適輸送とdomain adaptation:外れ値を輸送する危険
5.1 定義から計算へ
離散分布$a,b$とコスト行列$C_{ij}=c(x_i,y_j)$に対するbalanced OTは
\[\min_{P\ge0}\langle P,C\rangle,\qquad P\mathbf1=a,\quad P^\top\mathbf1=b\]である。質量をどこからどこへ動かすかを決めるcouplingを求める。エントロピー正則化 $\epsilon\sum_{ij}P_{ij}(\log P_{ij}-1)$を加えると、Sinkhorn scalingで高速に計算できる。一方、正則化した目的は元のWasserstein距離と同じ量ではない。自己輸送コストを引くSinkhorn divergenceは、そのbiasを補正してOTとMMDをつなぐ。Peyré and Cuturi [MD39]、Cuturi [MD40]、Feydy et al. [MD41]
計算可能性と統計的推定の難しさも別問題である。Sinkhornを高速化しても、少数サンプルから高次元の母集団間距離を精密に推定できるとは限らない。正則化強度、標本数、ground cost、表現の次元を同時に設計する必要がある。MD39
5.2 DAの系譜とnegative transfer
Courty et al.はラベル付きsourceとラベルなしtargetの間で、クラス構造に配慮した輸送を学習した。JDOTは特徴だけでなくラベルとのjoint distributionを扱い、DeepJDOTは深層表現と分類器を同時学習する。この流れは単純なmarginal alignmentから、判別に必要な構造を保つalignmentへの進展である。MD42、MD43、MD44
それでも距離が近いこととラベル意味が一致することは同じではない。クラス比率の変化、sourceにしかないクラス、targetの未知クラス、誤ったpseudo-label、表現上の近接性と意味的対応のずれがnegative transferを起こし得る。とくにbalanced制約は外れ値にも所定の輸送質量を割り当てるため、遠方の少量汚染が大きなコストを持つ。MD46、MD47、MD48
2025年にはKoc et al.がOTによるUDAの上界に、分布変化に応じた条件付き分布間のWasserstein距離を含む「entanglement」項を導入した。周辺分布を整合する方法の性能差を、直接最適化しにくい条件付き構造から説明する方向である。これは単にOT距離を小さくすることと分類リスクを下げることを区別する理論上の補強となる。ただし本サーベイは要旨を確認した範囲であり、その上界を個別実験に数値適用するには本文の仮定・推定方法を追加確認する必要がある。MD90
5.3 非平衡・部分・robust OT
非平衡OTは例えば
\[\min_{P\ge0}\langle P,C\rangle+ \epsilon\sum_{ij}P_{ij}(\log P_{ij}-1) +\tau_aD(P\mathbf1\,\|\,a) +\tau_bD(P^\top\mathbf1\,\|\,b)\]のように、周辺制約をdivergence penaltyへ緩める。partial OTは輸送する総質量を指定し、残りを輸送対象から外す。robust OTは汚染モデル等に対してどの分布の変化を許すかを明示する。これらは関連するが同一の定式化ではない。Chizat et al. [MD45]、MD39、MD48
| 研究 | 進展 | 限界・確認事項 |
|---|---|---|
| Unbalanced minibatch OT [MD46] | 小batchの強制的な対応を緩和しDAへ適用 | 母集団OTの不偏推定という意味ではなく、minibatchで定めた目的・推定量の性質を読む |
| Robust OT [MD47] | 深層生成・DAに使える安定した双対定式化 | どの汚染・再重み付け集合を想定するか |
| Outlier-Robust OT [MD48] | 外れ値質量の除去、双対、Huber汚染下の保証 | 汚染率・moment条件を要する。希少な正常点を除く可能性 |
| Sinkhorn-CPD [MD49] | 2026年公開。両側の質量緩和で部分重複・外れ値を含む点群を整合 | 点群登録という具体的設定の結果で、任意のDAでの優位性を意味しない |
empirical-otとot-outlierの研究を再開する場合は、source-only、balanced OT、entropic OT、class-aware/JDOT、unbalanced、partial/robustを同一表現・同一調整budgetで比較すると問いが明確になる。汚染は割合だけでなく位置、label、class imbalanceを分け、正常な少数classの性能も報告する。target labelを調整に使うならunsupervised DAの条件が変わることを記録する。これは本サーベイからの実験設計案である。
6. MCMC:正しい分布と有限時間の探索
Metropolis法からHastingsの一般化へと発展したMH法は、目標$\pi$と提案$q(y\mid x)$に対して
\[\alpha(x,y)=\min\left\{1, \frac{\pi(y)q(x\mid y)}{\pi(x)q(y\mid x)} \right\}\]で受理する。正規化定数が比で消える。目標分布の不変性に加えて、収束には既約性等の条件が要る。また漸近的に正しくても、有限時間でmode間を移動できるとは限らない。MD50、MD51
6.1 HMCとNUTS
$U(q)=-\log\pi(q)$、運動量$p\sim N(0,M)$とし、
\[\mathcal H(q,p)=U(q)+\tfrac12p^\top M^{-1}p,\qquad \dot q=M^{-1}p,\quad \dot p=-\nabla U(q)\]を数値積分する。leapfrogの可逆性と体積保存を用い、エネルギーの離散化誤差をMH受理で補正する。HMCは勾配で長距離を移動できるが、funnel形状、複数mode、非滑らかな支持境界、悪いスケーリングでは難しさが残る。Neal [MD52]、Betancourt [MD54]
NUTSは軌道が折り返す条件を使って積分時間を調整する。単純に「折り返した最後の点を採用」する方法ではなく、候補の構成と選択が不変分布を保つために重要である。step size、mass matrix、parameterizationの設計まで不要になるわけではない。Hoffman and Gelman [MD53]
2026年3月刊行のWALNUTSは、軌道内の局所的なstep size適応を扱う。位置依存に刻みを変えるだけでは可逆性を壊し得るため、提案・軌道選択を含む構成が必要となる。著者らはfunnelや確率的volatilityモデルで効率を検証しているが、全問題でNUTSを置き換える一般結論ではない。本調査では本文冒頭の幾何・離散化・局所適応の説明と公開月を確認した。Bou-Rabee et al. [MD58]
6.2 minibatchと診断
SGLDはminibatch勾配に適切なGaussianノイズを加え、step sizeを減衰させることで事後サンプリングに接続する。SGHMCは勾配推定ノイズを考慮した摩擦を導入する。固定step size、誤ったノイズ共分散、有限時間の影響があるため、通常のSGDにノイズを足しただけで正しいposteriorになるわけではない。Welling and Teh [MD55]、Chen et al. [MD56]
診断では複数chain、rank-normalized $\widehat R$、bulk/tail ESS、Monte Carlo標準誤差、HMCのdivergenceを併用する。これらが良好でも、すべてのchainが同じmodeに閉じ込められている可能性は残る。重要なのは推定したい量ごとの精度である。例えば稀なtail確率の推定は平均値のESSだけで判断できない。Vehtari et al. [MD57]
MCMCの課題と生成モデルの課題は似て見えても、基準が異なる。MCMCは既知の未正規化targetに対する不変性と探索誤差、生成モデルはデータから学んだ分布の近似誤差が中心となる。学習したtransportをproposalに使う場合も、不変性を保つ補正の有無を区別する必要がある。
7. Stiefel多様体とModular Manifolds
7.1 確立した多様体最適化
$m\ge n$に対して、
\[\mathrm{St}(m,n)=\{W:W^\top W=I_n\},\qquad T_W\mathrm{St}=\{A:W^\top A+A^\top W=0\}.\]埋め込みEuclidean計量の下で、周囲空間の勾配$G$を接空間に射影すると、
\[\operatorname{grad}L(W) =G-W\,\operatorname{sym}(W^\top G),\qquad \operatorname{sym}(B)=\tfrac12(B+B^\top)\]となる。接方向への更新後にretractionを用いて制約集合へ戻る。retractionは点を集合へ戻す任意の処理ではなく、$R_W(0)=W$かつ原点での微分が接ベクトルを保つ等の局所条件を持つ。polar retractionやQR retractionを使う際も、rankや符号の規約を確認する。これらは標準的な多様体最適化の枠組みである。Absil et al. [MD59]、Boumal [MD60]
縦長$W$では入力空間上のノルムを保つが、横長で$WW^\top=I$を用いる場合は入力に核がある。「すべての方向を等長に保つ」と無条件に述べてはいけない。さらに線形層の特異値制約から、非線形・残差・正規化を含むネットワーク全体の性能やrobustnessまで自動的には保証されない。
7.2 新しい提案の位置づけ
Modular Normは層の合成と出力感度に沿ってweight spaceのノルムを構成し、幅・深さの変化に対して更新量を設計する。Modular Manifoldsはそれに多様体制約を組み合わせ、層ごとの学習率配分を考える著者公式研究記事である。Large et al. [MD61]、Bernstein [MD62]
記事のManifold Muonは、
\[\min_{A\in T_W\mathrm{St}} \langle G,A\rangle \quad\text{s.t.}\quad \|A\|_{\rm op}\le\eta\]という接空間内のspectral norm制約付き最急降下を考える。spectral normは一般に内積から誘導されないので、上のEuclidean計量によるRiemannian gradientと同じ更新にはならない。Muonの更新行列を直交化することと、重み$W$をStiefel上に保つことも異なる。元記事で示される小規模MLP・CIFAR-10・3 epochのsanity checkは、大規模Transformerでの一般的優位性の証明ではない。MD62
今後の問いは、制約が表現力に与える影響、retractionと双対反復のコスト、momentumの運び方、低精度での直交性誤差、幅と深さを変えた学習率移送、実測時間を揃えた比較である。最適化章のMuon・行列ノルムの説明と併せて読むと、重みの制約と更新の幾何を分けて理解できる。
8. ICA、因果表現、対称性、特徴の相互作用
8.1 PCAとICAの基本的な修正
PCAは共分散の固有ベクトルによる直交射影であり、計算や分散最大化の定義にGaussian仮定は必要ない。無相関が独立を意味するのは、例えばjoint Gaussian等の追加条件がある場合である。ICAは$x=As$において$s$の成分独立性を使って混合を識別する。標準的な線形ICAでは、独立性、適切なrank条件、Gaussian成分が高々一つ等が識別の鍵で、順序とscaleには不定性が残る。Hyvärinen and Oja [MD63]
したがって元misc.mdの「PCAは正規分布を仮定する」「PCAはICAの特別な場合」という説明は、そのまま一般則として使えない。PCAによるwhiteningはICAの前処理になり得るが、目的関数と識別可能性は異なる。またICAにおける外れ値感度は推定contrastやtail仮定に依存し、「ICAは必ず外れ値を強調する」とも言えない。MD63
日本語の既存引用である池田(1999)は、二次の無相関化と、高次統計・時間的構造を利用する信号分離を明確に区別している。著者公開PDFの導入を確認し、J-STAGEで計測と制御38巻7号、1999年7月10日の書誌を照合した。線形混合の説明から信号処理へ進む入門として読めるが、現代の非線形潜在変数の識別性は次節の追加条件を要する。MD92
8.2 非線形ICAから因果表現へ
一般の非線形混合$x=f(s)$では、独立成分を得る変換が一意に決まらない。Locatello et al.は追加の帰納バイアス等がないdisentanglementの非識別性を示した。高い再構成性能や独立性penaltyだけでは、真の生成因子を回復したことにならない。MD66
Hyvärinen et al.は時刻・履歴・環境などの補助変数$u$を使い、$u$に応じた条件付き独立分布の変化から識別可能性を得る枠組みを示した。iVAEはこの考えを条件付きpriorを持つVAEに接続する。十分な変動、混合関数の性質、分布族等が重要であり、どんなmetadataでも付ければ識別できるわけではない。MD64、MD65
因果表現では、独立した外生ノイズと、因果的に依存する内生変数を分ける必要がある。例えば$z_j=f_j(z_{\mathrm{pa}(j)},\epsilon_j)$では$\epsilon_j$は独立でも$z_j$同士は一般に独立でない。「因子の独立性」と「因果変数の発見」は同義ではない。Schölkopf et al.の研究プログラムは、環境変化・介入・独立因果機構を表現学習に組み込むことを扱う。MD67
Causal de Finettiは交換可能な多環境データの非自明な条件付き独立構造とICM生成過程を結び付ける。通常のi.i.d.観測データに一般的な因果方向の識別性を与えたものではなく、より豊かなデータ構造と仮定が役割を持つ。Guo et al. [MD68]
2026年には「識別できる」という母集団論を、有限標本の推定へ進める研究を確認した。Lee et al.は線形の潜在因子・線形SEM・複数環境の設定で、未知の複数node介入から表現・混合・graphを推定する。対数個の環境という結果は、この設定・介入条件・分離条件に属する。任意の非線形因果表現を少数環境で回復したという主張ではない。本調査では本文のモデル式と線形設定を確認した。MD69
Kim et al.(UAI 2026)は、補助変数が観測生成の内部に入る場合を扱う。volume-preservingな混合、十分な変動、学習モデルの整合条件の下で、subspaceの置換とsubspace内の可逆変換までの識別可能性を示す。完全な各潜在座標の回復と独立subspaceまでの回復は異なる。MD70
未解決の中心は、現実の介入の不完全さ、未知confounder、有限標本での不確実性、識別された表現が実際のOOD予測や制御に役立つ条件である。表現の見やすさと因果的妥当性は別々に検証する。
8.3 不変性と同変性
群$G$の作用$\rho_{\rm in},\rho_{\rm out}$に対して、
\[f(\rho_{\rm in}(g)x)=f(x)\quad\text{(不変)},\qquad f(\rho_{\rm in}(g)x)=\rho_{\rm out}(g)f(x)\quad\text{(同変)}\]を区別する。集合分類なら入力順を変えても予測は同じでよいが、各点のlabelを出力するなら、入力の置換と同じように出力も置換される必要がある。
Deep Setsの$\rho(\sum_i\phi(x_i))$は置換不変性を構成する基本形である。普遍表現に関する主張は集合のサイズ、入力領域、連続性、潜在次元などの条件を伴う。G-CNNは群作用に沿ったweight sharing、EGNNは回転・並進・反射・置換に同変なgraph計算を構成する。Geometric Deep Learningはこれらを幾何的帰納バイアスとして統合する。MD71、MD72、MD86、MD73
対称性を強制すると標本効率に利点がある一方、taskで本当に保存される対称性かを検討する必要がある。例えば反射で意味が変わるtargetに反射不変性を強制すると情報を失う。データ増強で近似的に学ぶ対称性と、architectureで厳密に保証する対称性も区別したい。
8.4 特徴の相互作用は因果作用ではない
二変数の予測関数を$f(x_1,x_2)=f_0+f_1(x_1)+f_2(x_2)+f_{12}(x_1,x_2)$と書くとき、$f_{12}$は主効果だけで説明できない成分である。ただし一意な分解には中心化や基準分布等の規約が必要で、特徴に相関がある場合は特に重要になる。
Friedman and Popescuはpartial dependenceに基づく相互作用の強さを調べる方法を提示した。NIDは非線形networkの重みと経路からinteraction候補を検出する。どちらも学習済み予測器の構造を解析するもので、交絡を解消した介入効果を推定する手法ではない。MD74、MD75
元misc.mdの「Hは常に0から1」という表現にも注意が要る。実装上のcentering、partial dependenceの推定、相関した特徴、分母が小さい状況によって解釈が不安定になり得る。Hessianの交差項$\partial^2f/\partial x_i\partial x_j$は局所的な微分的相互作用であり、分布平均のH統計量や因果的相乗効果とは別の量である。
9. GANとSWA-RLのプロジェクトへ接続する
9.1 GANは単一損失の最小化だけでは理解できない
GANは生成器と識別器の二者ゲームである。WGANはWasserstein双対を使い、WGAN-GPやspectral normalizationはcriticの勾配・Lipschitz性に関する制御を実用化した。ただし有限network・有限学習で評価されるcritic値が真のWasserstein距離に常に一致するわけではない。MD76、MD77、MD78、MD79
最小の例$\min_x\max_y xy$では、同時gradient descent/ascentは
\[\binom{x_{k+1}}{y_{k+1}} =\begin{pmatrix}1&-\eta\\\eta&1\end{pmatrix} \binom{x_k}{y_k}\]となり、固有値の絶対値は$\sqrt{1+\eta^2}>1$である。個々のplayerに対する曲率が0でも、player間の回転的な相互作用で発散する。したがって一人用のNewton/NGDを各playerに適用するだけではゲーム全体の安定性を保証できない。
Gidel et al.はvariational inequalityとしてGANを扱い、平均化・extragradient・過去からの外挿を検討した。Schäfer and AnandkumarのCompetitive Gradient Descentは局所双線形ゲームのNash解を更新とし、局所的な凸凹条件等の下で解析する。Competitive Gradient Descentと、線形方程式を解くConjugate GradientはいずれもCGと略され得るが別手法である。既存cg-gans.mdのCGがどちらかは記録だけでは特定しない。MD80、MD81
ngd-gansのK-FAC、extragradient、toy problemのTODOには、まず双線形・非線形toy gameで回転と前処理の効果を分離し、その後同じ生成器・criticでFID等を比較する設計が対応する。生成品質だけでなく、mode coverage、崩壊率、seed分散、追加の勾配・HVP・通信コストも必要となる。
9.2 SWAをRLへ移す際の問い
SWAは一定・周期的学習率で得たweightの平均を使い、教師あり画像分類で汎化改善を示した。SWAGはさらに軌道の低ランク+対角共分散を用いて近似posteriorを構成する。SWAはposteriorからの正確なMCMC標本の平均ではなく、SWAGにも近似がある。MD82、MD83
RLではpolicyの変化が観測分布を変え、bootstrapped targetも動く。したがって教師あり学習でのSWAの利点をそのまま「未知環境に頑健」と結論づけることはできない。Procgenは手続き生成した訓練・未見環境で汎化を測る入口となり、mixregは観測・supervisionの混合による別のbaselineを提供する。MD84、MD85
swa-rlでは、同一環境分布の未見seed、見た目のshift、力学のshift、reward変更を分けるのがよい。policy/criticのどちらを平均するか、平均開始時点、BN統計、snapshot間の方策距離、学習後の追加interactionを明記し、SWA・EMA・snapshot ensembleを同じ計算budgetで比較する。これらは未実施の実験案であり、プロジェクトメモから成果を推定したものではない。
10. 読む順序と今後の研究課題
| 目的 | 推奨する順序 |
|---|---|
| 曲率を正しく測る | Baydin [MD01] → Pearlmutter [MD02] → Hutchinson/Hutch++ [MD03–04] → Kunstner/Thomas [MD07–08] → BackPACK [MD05] |
| 幅・学習ダイナミクスを理解する | Jacot [MD10] → Lee [MD11] → Chizat [MD12] → Yang/Hu [MD13] → Belkin/Hastie/Bartlett [MD15,17,18] → 分類NTK [MD19] |
| 生成モデルを理論から実装へつなぐ | score SDE [MD25] → FM [MD28] → CFM/RF [MD29–30] → Guide [MD35] → Consistency/MeanFlow/iMF [MD32,36,37] |
| OTのnegative transferを研究する | Computational OT [MD39] → OT-DA/JDOT [MD42–43] → DeepJDOT [MD44] → JUMBOT [MD46] → robust OT [MD47–48] |
| HMCを実務に使う | Neal/Betancourt [MD52,54] → NUTS [MD53] → 診断 [MD57] → WALNUTS [MD58] |
| 多様体をoptimizerに使う | Absil/Boumal [MD59–60] → Modular Norm [MD61] → Modular Manifolds [MD62] |
| 因果表現を研究する | 線形ICA [MD63] → 非識別性 [MD66] → 補助変数/iVAE [MD64–65] → 因果表現 [MD67] → de Finetti [MD68] → 有限標本と内部補助変数 [MD69–70] |
本章の領域を横断する未解決課題は四つに整理できる。
- 測定の再parameterization依存性:Hessianのtraceやsharpness、SWAの距離、重みのノルムを、予測分布の変化や性能との関係で評価する。
- 無限幅・無限標本から有限系への移行:kernel固定、正確なOT plan、完全なvelocity回帰、識別可能な潜在モデルという理想化が、有限計算でどれほど崩れるかを分解する。
- 速度と分布の忠実性の両立:1-NFE生成、高速minibatch OT、局所適応MCMCで、平均的品質だけでなくtail・少数mode・希少classを評価する。
- OOD改善の因果的な説明:対称性、因果表現、SWA、曲率制御のどれがどのshiftを改善したかを、交絡する訓練budget・表現・正則化と切り分ける。
これらは既存文献を横断した本サーベイの整理である。文献そのものの定理・結果と、ここからの実験提案を区別して使うことが重要となる。
参考文献と確認水準
確認日はすべて2026-10-03。要旨確認は一次公開先のabstract・書誌を確認したもの、本文該当節確認は記載したモデル・仮定等の本文を読んだもの、一次公式資料は著者の研究記事・書籍ページ、書誌確認は出版社の書誌までである。「本文該当節確認」は論文全体の証明を独立に検証したことを意味しない。年は正式刊行年を確認できたものではその年、それ以外では確認したarXiv初稿年を使い、publication statusに差を記載した。
-
[MD01] Atilim Gunes Baydin, Barak A. Pearlmutter, Alexey Andreyevich Radul, Jeffrey Mark Siskind. Automatic Differentiation in Machine Learning: a Survey (2018). JMLR 18(153), published。ADと逆伝播の関係、forward/reverse modeの標準レビュー。確認水準:要旨確認。
-
[MD02] Barak A. Pearlmutter. Fast Exact Multiplication by the Hessian (1994). Neural Computation 6(1), published。Hessianを構築せずHVPを計算する原典。確認水準:要旨確認。
-
[MD03] M. F. Hutchinson. A Stochastic Estimator of the Trace of the Influence Matrix for Laplacian Smoothing Splines (1989). Communications in Statistics - Simulation and Computation 18(3), published。確率的トレース推定の原典。確認水準:要旨確認。
-
[MD04] Raphael A. Meyer, Cameron Musco, Christopher Musco, David P. Woodruff. Hutch++: Optimal Stochastic Trace Estimation (2021). SOSA 2021, published (preprint 2020)。低ランク近似と残差推定による分散削減。確認水準:要旨確認。
-
[MD05] Felix Dangel, Frederik Kunstner, Philipp Hennig. BackPACK: Packing more into Backprop (2020). ICLR 2020, published (preprint 2019)。個別勾配と曲率近似を逆伝播で計算。確認水準:要旨確認。
-
[MD06] Behrooz Ghorbani, Shankar Krishnan, Ying Xiao. An Investigation into Neural Net Optimization via Hessian Eigenvalue Density (2019). ICML 2019, published。Hessianスペクトルと勾配方向の関係。確認水準:要旨確認。 刊行版確認先。
-
[MD07] Frederik Kunstner, Lukas Balles, Philipp Hennig. Limitations of the Empirical Fisher Approximation for Natural Gradient Descent (2019). NeurIPS 2019, published。empirical Fisherと曲率の混同への反例。確認水準:要旨確認。
-
[MD08] Valentin Thomas, Fabian Pedregosa, Bart van Merriënboer, Pierre-Antoine Manzagol, Yoshua Bengio, Nicolas Le Roux. On the interplay between noise and curvature and its effect on optimization and generalization (2020). AISTATS 2020, published (preprint 2019)。Hessian、Fisher、勾配共分散の役割を整理。確認水準:要旨確認。
-
[MD09] Guillaume Dalle, Adrian Hill. A Common Interface for Automatic Differentiation (2026). JMLR 27(25), published January 2026。AD backend比較・疎性・準備処理の共通化。確認水準:要旨確認。
-
[MD10] Arthur Jacot, Franck Gabriel, Clément Hongler. Neural Tangent Kernel: Convergence and Generalization in Neural Networks (2018). NeurIPS 2018, published。関数空間の学習ダイナミクスをNTKで表現。確認水準:本文該当節確認。 刊行版確認先。
-
[MD11] Jaehoon Lee, Lechao Xiao, Samuel S. Schoenholz, Yasaman Bahri, Roman Novak, Jascha Sohl-Dickstein, Jeffrey Pennington. Wide Neural Networks of Any Depth Evolve as Linear Models Under Gradient Descent (2019). NeurIPS 2019, published。幅極限でのネットワーク線形化。確認水準:要旨確認。
-
[MD12] Lenaic Chizat, Edouard Oyallon, Francis Bach. On Lazy Training in Differentiable Programming (2019). NeurIPS 2019, published (preprint 2018)。lazy trainingは幅だけでなくスケーリングで決まる。確認水準:要旨確認。
-
[MD13] Greg Yang, Edward J. Hu. Feature Learning in Infinite-Width Neural Networks (2021). ICML 2021, published (preprint 2020)。無限幅でも特徴学習するパラメータ化。確認水準:要旨確認。
-
[MD14] Greg Yang, Edward J. Hu, Igor Babuschkin, Szymon Sidor, Xiaodong Liu, David Farhi, Nick Ryder, Jakub Pachocki, Weizhu Chen, Jianfeng Gao. Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer (2021). NeurIPS 2021, published; arXiv登録2022(刊行年と登録年が異なる)。μPと小規模モデルからのハイパーパラメータ移送。確認水準:要旨確認。 刊行版確認先。
-
[MD15] Mikhail Belkin, Daniel Hsu, Siyuan Ma, Soumik Mandal. Reconciling modern machine learning practice and the bias-variance trade-off (2019). PNAS 2019, published (preprint 2018)。double descentの統一的描像。確認水準:要旨確認。
-
[MD16] Preetum Nakkiran, Gal Kaplun, Yamini Bansal, Tristan Yang, Boaz Barak, Ilya Sutskever. Deep Double Descent: Where Bigger Models and More Data Hurt (2020). ICLR 2020, published; arXiv初稿2019。モデル幅・epoch・データ数に沿った非単調性。確認水準:要旨確認。 刊行版確認先。
-
[MD17] Trevor Hastie, Andrea Montanari, Saharon Rosset, Ryan J. Tibshirani. Surprises in High-Dimensional Ridgeless Least Squares Interpolation (2022). Annals of Statistics 50(2), published (preprint 2019)。高次元線形・ランダム特徴回帰の精密リスク解析。確認水準:要旨確認。
-
[MD18] Peter L. Bartlett, Philip M. Long, Gábor Lugosi, Alexander Tsigler. Benign Overfitting in Linear Regression (2020). PNAS 2020, published (preprint 2019)。良性過学習を共分散の有効ランクで特徴づけ。確認水準:要旨確認。
-
[MD19] Jonathan Plenk, Sergio Calvo-Ordonez, Alvaro Cartea, Yarin Gal, Mark van der Wilk, Kamil Ciosek. The Neural Tangent Kernel for Classification (2026). preprint; submitted 2026-05-17, v2 2026-05-22。分類損失でのlazy領域の条件。確認水準:要旨確認。
-
[MD20] Zixiang Chen, Yuan Cao, Quanquan Gu, Tong Zhang. A Generalized Neural Tangent Kernel Analysis for Two-layer Neural Networks (2020). NeurIPS 2020, published。ノイズ・weight decayを含む2層NTK解析。確認水準:要旨確認。
-
[MD21] Kenji Kawaguchi, Qingyun Sun. A Recipe for Global Convergence Guarantee in Deep Neural Networks (2021). AAAI 2021, published。expressivity conditionを用いたNTK外の収束保証。確認水準:要旨確認。
-
[MD22] Shun-ichi Amari. Any Target Function Exists in a Neighborhood of Any Sufficiently Wide Random Network: A Geometrical Perspective (2020). Neural Computation 32(8), published。近傍での表現能力の幾何的説明。確認水準:要旨確認。
-
[MD23] Jonathan Ho, Ajay Jain, Pieter Abbeel. Denoising Diffusion Probabilistic Models (2020). NeurIPS 2020, published。denoising目的による拡散生成。確認水準:要旨確認。 刊行版確認先。
-
[MD24] Jascha Sohl-Dickstein, Eric A. Weiss, Niru Maheswaranathan, Surya Ganguli. Deep Unsupervised Learning using Nonequilibrium Thermodynamics (2015). ICML 2015, published。前向き拡散と逆過程による生成の基礎。確認水準:要旨確認。 刊行版確認先。
-
[MD25] Yang Song, Jascha Sohl-Dickstein, Diederik P. Kingma, Abhishek Kumar, Stefano Ermon, Ben Poole. Score-Based Generative Modeling through Stochastic Differential Equations (2021). ICLR 2021, published (preprint 2020)。reverse SDEとprobability-flow ODEの統一。確認水準:要旨確認。
-
[MD26] Ricky T. Q. Chen, Yulia Rubanova, Jesse Bettencourt, David Duvenaud. Neural Ordinary Differential Equations (2018). NeurIPS 2018, published。連続深度ネットワークとCNF。確認水準:要旨確認。 刊行版確認先。
-
[MD27] Will Grathwohl, Ricky T. Q. Chen, Jesse Bettencourt, Ilya Sutskever, David Duvenaud. FFJORD: Free-form Continuous Dynamics for Scalable Reversible Generative Models (2019). ICLR 2019, published; arXiv初稿2018。確率的divergence推定でCNFを大規模化。確認水準:要旨確認。 刊行版確認先。
-
[MD28] Yaron Lipman, Ricky T. Q. Chen, Heli Ben-Hamu, Maximilian Nickel, Matt Le. Flow Matching for Generative Modeling (2023). ICLR 2023, published (preprint 2022)。条件付き速度回帰によるsimulation-free学習。確認水準:要旨確認。
-
[MD29] Xingchao Liu, Chengyue Gong, Qiang Liu. Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow (2023). ICLR 2023, published; arXiv初稿2022。rectificationと輸送コスト・軌道の直線化。確認水準:要旨確認。 刊行版確認先。
-
[MD30] Alexander Tong, Kilian Fatras, Nikolay Malkin, Guillaume Huguet, Yanlei Zhang, Jarrid Rector-Brooks, Guy Wolf, Yoshua Bengio. Improving and generalizing flow-based generative models with minibatch optimal transport (2024). TMLR 2024, published (preprint 2023)。CFMの一般化とminibatch OT coupling。確認水準:要旨確認。
-
[MD31] Michael S. Albergo, Nicholas M. Boffi, Eric Vanden-Eijnden. Stochastic Interpolants: A Unifying Framework for Flows and Diffusions (2025). JMLR 26, published September 2025; arXiv初稿2023。flowとdiffusionを確率補間で統一。確認水準:要旨確認。 刊行版確認先。
-
[MD32] Yang Song, Prafulla Dhariwal, Mark Chen, Ilya Sutskever. Consistency Models (2023). ICML 2023, published。同一軌道上の写像整合性による少数step生成。確認水準:要旨確認。
-
[MD33] Patrick Esser, Sumith Kulal, Andreas Blattmann, Rahim Entezari, Jonas Müller, Harry Saini, Yam Levi, Dominik Lorenz, Axel Sauer, Frederic Boesel, Dustin Podell, Tim Dockhorn, Zion English, Kyle Lacey, Alex Goodwin, Yannik Marek, Robin Rombach. Scaling Rectified Flow Transformers for High-Resolution Image Synthesis (2024). ICML 2024, published;ここではarXiv版の著者一覧を記載。時間サンプリング・Transformer・規模の実証。確認水準:要旨確認。 刊行版確認先。
-
[MD34] Itai Gat, Tal Remez, Neta Shaul, Felix Kreuk, Ricky T. Q. Chen, Gabriel Synnaeve, Yossi Adi, Yaron Lipman. Discrete Flow Matching (2024). NeurIPS 2024, published。離散空間の確率経路と遷移率。確認水準:要旨確認。 刊行版確認先。
-
[MD35] Yaron Lipman, Marton Havasi, Peter Holderrieth, Neta Shaul, Matt Le, Brian Karrer, Ricky T. Q. Chen, David Lopez-Paz, Heli Ben-Hamu, Itai Gat. Flow Matching Guide and Code (2024). arXiv guide 2024。連続・離散FMの公式体系化。確認水準:要旨確認。
-
[MD36] Zhengyang Geng, Mingyang Deng, Xingjian Bai, J. Zico Kolter, Kaiming He. Mean Flows for One-step Generative Modeling (2025). NeurIPS 2025, proceedings PDF確認。平均速度を直接学習し1-NFE生成。確認水準:要旨確認。
-
[MD37] Zhengyang Geng, Yiyang Lu, Zongze Wu, Eli Shechtman, J. Zico Kolter, Kaiming He. Improved Mean Flows: On the Challenges of Fastforward Generative Models (2025). technical report; submitted 2025-12-01, v2 2026-05-09。学習目的・guidance条件付けの改善。確認水準:要旨確認。
-
[MD38] Mudit Gaur, Prashant Trivedi, Shuchin Aeron, Amrit Singh Bedi, George K. Atia, Vaneet Aggarwal. Generative Modeling with Continuous Flows: Sample Complexity of Flow Matching (2025). preprint; submitted 2025-12-01。近似・統計・最適化誤差を分けたFM保証。確認水準:本文該当節確認。
-
[MD39] Gabriel Peyré, Marco Cuturi. Computational Optimal Transport (2019). Foundations and Trends in Machine Learning 11(5-6), published。離散OT、正則化、計算、応用の標準書。確認水準:要旨確認。
-
[MD40] Marco Cuturi. Sinkhorn Distances: Lightspeed Computation of Optimal Transportation Distances (2013). NeurIPS 2013, published;刊行版題名末尾はOptimal Transport、掲載題名はarXiv版。エントロピー正則化による高速OT。確認水準:要旨確認。 刊行版確認先。
-
[MD41] Jean Feydy, Thibault Séjourné, François-Xavier Vialard, Shun-ichi Amari, Alain Trouvé, Gabriel Peyré. Interpolating between Optimal Transport and MMD using Sinkhorn Divergences (2019). AISTATS 2019, published。自己コスト補正とOT–MMDの補間。確認水準:要旨確認。
-
[MD42] Nicolas Courty, Rémi Flamary, Devis Tuia, Alain Rakotomamonjy. Optimal Transport for Domain Adaptation (2017). IEEE TPAMI 39(9):1853–1865, published; arXiv初稿2015。クラス構造を考慮した分布輸送。確認水準:要旨確認。 刊行版確認先。
-
[MD43] Nicolas Courty, Rémi Flamary, Amaury Habrard, Alain Rakotomamonjy. Joint Distribution Optimal Transportation for Domain Adaptation (2017). NeurIPS 2017, published。特徴とラベルの結合分布を輸送。確認水準:要旨確認。 刊行版確認先。
-
[MD44] Bharath Bhushan Damodaran, Benjamin Kellenberger, Rémi Flamary, Devis Tuia, Nicolas Courty. DeepJDOT: Deep Joint Distribution Optimal Transport for Unsupervised Domain Adaptation (2018). ECCV 2018, published。表現学習とJDOTを結合。確認水準:要旨確認。
-
[MD45] Lenaic Chizat, Gabriel Peyré, Bernhard Schmitzer, François-Xavier Vialard. Scaling Algorithms for Unbalanced Transport Problems (2018). Mathematics of Computation 87(314):2563–2609, published; arXiv初稿2016、刊行版題名にはOptimalが加わる。周辺質量を緩和する一般化Sinkhorn。確認水準:要旨確認。 刊行版確認先。
-
[MD46] Kilian Fatras, Thibault Séjourné, Nicolas Courty, Rémi Flamary. Unbalanced minibatch Optimal Transport; applications to Domain Adaptation (2021). ICML 2021, published;著者順は論文PDF準拠。minibatchの不適切な対応を質量緩和で改善。確認水準:要旨確認。
-
[MD47] Yogesh Balaji, Rama Chellappa, Soheil Feizi. Robust Optimal Transport with Applications in Generative Modeling and Domain Adaptation (2020). NeurIPS 2020, published。外れ値を含む深層学習に使えるrobust OT双対。確認水準:要旨確認。
-
[MD48] Sloan Nietert, Rachel Cummings, Ziv Goldfeld. Outlier-Robust Optimal Transport: Duality, Structure, and Statistical Analysis (2022). AISTATS 2022, published;著者順はarXiv準拠。汚染モデル下のrobust Wasserstein理論。確認水準:要旨確認。
-
[MD49] Jin Zhang, Mingyang Zhao, Bing Liu, Xin Jiang. Sinkhorn-CPD: Robust point cloud registration via unbalanced entropic optimal transport (2026). arXiv公開 2026-06-15; Computer-Aided Design 199 (2026), 104104との書誌記載あり、雑誌刊行日未照合。外れ値・部分重複を含む点群整合へのUOT。確認水準:要旨確認。
-
[MD50] Nicholas Metropolis, Arianna W. Rosenbluth, Marshall N. Rosenbluth, Augusta H. Teller, Edward Teller. Equation of State Calculations by Fast Computing Machines (1953). Journal of Chemical Physics 21(6), published。Metropolis法の原典。確認水準:要旨確認。
-
[MD51] W. K. Hastings. Monte Carlo sampling methods using Markov chains and their applications (1970). Biometrika 57(1), published。非対称提案を含むMH法。確認水準:要旨確認。
-
[MD52] Radford M. Neal. MCMC using Hamiltonian dynamics (2012). arXiv公開版2012 (Handbook章2011)。HMCの標準レビュー。確認水準:要旨確認。
-
[MD53] Matthew D. Hoffman, Andrew Gelman. The No-U-Turn Sampler: Adaptively Setting Path Lengths in Hamiltonian Monte Carlo (2014). JMLR 15(47), published。HMC積分時間を自動化。確認水準:要旨確認。
-
[MD54] Michael Betancourt. A Conceptual Introduction to Hamiltonian Monte Carlo (2017). arXiv review 2017, revised 2018。典型集合・幾何・HMCの失敗を解説。確認水準:要旨確認。
-
[MD55] Max Welling, Yee Whye Teh. Bayesian Learning via Stochastic Gradient Langevin Dynamics (2011). ICML 2011, published;著者所属機関の原著書誌・abstract確認。minibatch勾配に適切なノイズを加える事後サンプリング。確認水準:要旨確認。
-
[MD56] Tianqi Chen, Emily Fox, Carlos Guestrin. Stochastic Gradient Hamiltonian Monte Carlo (2014). ICML 2014, published。勾配ノイズを摩擦・拡散で扱う。確認水準:要旨確認。
-
[MD57] Aki Vehtari, Andrew Gelman, Daniel Simpson, Bob Carpenter, Paul-Christian Bürkner. Rank-normalization, folding, and localization: An improved R-hat for assessing convergence of MCMC (2021). Bayesian Analysis, published (preprint 2019)。rank-based診断と局所効率。確認水準:要旨確認。
-
[MD58] Nawaf Bou-Rabee, Bob Carpenter, Tore Selland Kleppe, Sifan Liu. The Within-Orbit Adaptive Leapfrog No-U-Turn Sampler (2026). JMLR 27(113), published March 2026。軌道中のstep sizeを適応するWALNUTS。確認水準:本文該当節確認。
-
[MD59] P.-A. Absil, Robert Mahony, Rodolphe Sepulchre. Optimization Algorithms on Matrix Manifolds (2008). Princeton University Press book, published。射影、接空間、retractionの標準書。確認水準:書誌確認。
-
[MD60] Nicolas Boumal. An Introduction to Optimization on Smooth Manifolds (2023). Cambridge University Press book, published。現代的Riemannian最適化の教科書。確認水準:一次公式資料。
-
[MD61] Tim Large, Yang Liu, Minyoung Huh, Hyojin Bahng, Phillip Isola, Jeremy Bernstein. Scalable Optimization in the Modular Norm (2024). NeurIPS 2024, proceedings PDF確認。層合成に沿ったノルムと感度・学習率配分。確認水準:要旨確認。
-
[MD62] Jeremy Bernstein. Modular Manifolds (2025). 著者公式研究記事 2025-09-26;査読論文ではない。Stiefel制約とspectral-norm更新の研究提案。確認水準:一次公式資料。
-
[MD63] Aapo Hyvärinen, Erkki Oja. Independent component analysis: algorithms and applications (2000). Neural Networks 13, published。線形ICAの識別可能性と推定。確認水準:要旨確認。
-
[MD64] Aapo Hyvärinen, Hiroaki Sasaki, Richard E. Turner. Nonlinear ICA Using Auxiliary Variables and Generalized Contrastive Learning (2019). AISTATS 2019, published。補助変数で非線形ICAの非識別性を解く。確認水準:要旨確認。
-
[MD65] Ilyes Khemakhem, Diederik P. Kingma, Ricardo Pio Monti, Aapo Hyvärinen. Variational Autoencoders and Nonlinear ICA: A Unifying Framework (2020). AISTATS 2020, published。条件付きpriorを用いるidentifiable VAE。確認水準:要旨確認。
-
[MD66] Francesco Locatello, Stefan Bauer, Mario Lucic, Gunnar Rätsch, Sylvain Gelly, Bernhard Schölkopf, Olivier Bachem. Challenging Common Assumptions in the Unsupervised Learning of Disentangled Representations (2019). ICML 2019, published。追加仮定なしのdisentanglementの非識別性。確認水準:要旨確認。
-
[MD67] Bernhard Schölkopf, Francesco Locatello, Stefan Bauer, Nan Rosemary Ke, Nal Kalchbrenner, Anirudh Goyal, Yoshua Bengio. Towards Causal Representation Learning (2021). Proceedings of the IEEE 109(5), published;雑誌題名はToward。因果機構と表現学習の研究プログラム。確認水準:要旨確認。
-
[MD68] Siyuan Guo, Viktor Tóth, Bernhard Schölkopf, Ferenc Huszár. Causal de Finetti: On the Identification of Invariant Causal Structure in Exchangeable Data (2023). NeurIPS 2023, published (preprint 2022)。交換可能データとICMの識別理論。確認水準:要旨確認。
-
[MD69] Inbeom Lee, Tongtong Jin, Bryon Aragam. Beyond identifiability: Learning causal representations with few environments and finite samples (2026). preprint; submitted 2026-03-26。線形潜在因子における有限標本・少数環境保証。確認水準:本文該当節確認。
-
[MD70] Kwonho Kim, Heejeong Nam, Inwoo Hwang, Sanghack Lee. On Causal Representation Learning with Internal Auxiliaries (2026). UAI 2026, PMLR 337, published。内部補助変数を含む識別可能性の条件。確認水準:要旨確認。
-
[MD71] Manzil Zaheer, Satwik Kottur, Siamak Ravanbakhsh, Barnabas Poczos, Ruslan Salakhutdinov, Alexander Smola. Deep Sets (2017). NeurIPS 2017, published。集合の置換不変・同変ネットワーク。確認水準:要旨確認。
-
[MD72] Taco S. Cohen, Max Welling. Group Equivariant Convolutional Networks (2016). ICML 2016, published。群作用に沿う畳み込み。確認水準:要旨確認。
-
[MD73] Michael M. Bronstein, Joan Bruna, Taco Cohen, Petar Veličković. Geometric Deep Learning: Grids, Groups, Graphs, Geodesics, and Gauges (2021). arXiv monograph 2021。対称性と帰納バイアスの体系化。確認水準:要旨確認。
-
[MD74] Jerome H. Friedman, Bogdan E. Popescu. Predictive learning via rule ensembles (2008). Annals of Applied Statistics 2(3), published。ルールモデル・特徴の交互作用とH統計量。確認水準:要旨確認。
-
[MD75] Michael Tsang, Dehua Cheng, Yan Liu. Detecting Statistical Interactions from Neural Network Weights (2018). ICLR 2018, published (preprint 2017)。学習済み重みから相互作用を検出するNID。確認水準:要旨確認。
-
[MD76] Ian J. Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde-Farley, Sherjil Ozair, Aaron Courville, Yoshua Bengio. Generative Adversarial Networks (2014). NeurIPS 2014, published;刊行題名はGenerative Adversarial Nets、記載題名はarXiv版。生成器と識別器の二者ゲーム。確認水準:要旨確認。 刊行版確認先。
-
[MD77] Martin Arjovsky, Soumith Chintala, Léon Bottou. Wasserstein GAN (2017). ICML 2017, published;刊行題名はWasserstein Generative Adversarial Networks、記載題名はarXiv版。Wasserstein双対を用いる生成学習。確認水準:要旨確認。 刊行版確認先。
-
[MD78] Ishaan Gulrajani, Faruk Ahmed, Martin Arjovsky, Vincent Dumoulin, Aaron Courville. Improved Training of Wasserstein GANs (2017). NeurIPS 2017, published。gradient penaltyによるcriticの正則化。確認水準:要旨確認。 刊行版確認先。
-
[MD79] Takeru Miyato, Toshiki Kataoka, Masanori Koyama, Yuichi Yoshida. Spectral Normalization for Generative Adversarial Networks (2018). ICLR 2018, published。識別器のspectral norm制御。確認水準:要旨確認。
-
[MD80] Gauthier Gidel, Hugo Berard, Gaëtan Vignoud, Pascal Vincent, Simon Lacoste-Julien. A Variational Inequality Perspective on Generative Adversarial Networks (2019). ICLR 2019, published; arXiv初稿2018。ゲームに対するextragradientと平均化。確認水準:要旨確認。 刊行版確認先。
-
[MD81] Florian Schäfer, Anima Anandkumar. Competitive Gradient Descent (2019). NeurIPS 2019, published。局所双線形ゲームのNash更新。確認水準:要旨確認。 刊行版確認先。
-
[MD82] Pavel Izmailov, Dmitrii Podoprikhin, Timur Garipov, Dmitry Vetrov, Andrew Gordon Wilson. Averaging Weights Leads to Wider Optima and Better Generalization (2018). UAI 2018, published。SWAの原著。確認水準:要旨確認。 刊行版確認先。
-
[MD83] Wesley Maddox, Timur Garipov, Pavel Izmailov, Dmitry Vetrov, Andrew Gordon Wilson. A Simple Baseline for Bayesian Uncertainty in Deep Learning (2019). NeurIPS 2019, published。SWA軌道の共分散を用いるSWAG。確認水準:要旨確認。
-
[MD84] Karl Cobbe, Christopher Hesse, Jacob Hilton, John Schulman. Leveraging Procedural Generation to Benchmark Reinforcement Learning (2020). ICML 2020, published; arXiv初稿2019。Procgenによる未知環境汎化の評価。確認水準:要旨確認。 刊行版確認先。
-
[MD85] Kaixin Wang, Bingyi Kang, Jie Shao, Jiashi Feng. Improving Generalization in Reinforcement Learning with Mixture Regularization (2020). NeurIPS 2020, published。RL汎化のデータ混合baseline。確認水準:要旨確認。
-
[MD86] Victor Garcia Satorras, Emiel Hoogeboom, Max Welling. E(n) Equivariant Graph Neural Networks (2021). ICML 2021, published。回転・並進・反射・置換に同変なGNN。確認水準:要旨確認。 刊行版確認先。
-
[MD87] Valentin De Bortoli, James Thornton, Jeremy Heng, Arnaud Doucet. Diffusion Schrödinger Bridge with Applications to Score-Based Generative Modeling (2021). NeurIPS 2021, published。経路空間のエントロピー正則化OT。確認水準:要旨確認。
-
[MD88] Aapo Hyvärinen. Estimation of Non-Normalized Statistical Models by Score Matching (2005). JMLR 6(24), published。正規化定数を避けたscore推定。確認水準:要旨確認。
-
[MD89] Yang Song, Stefano Ermon. Generative Modeling by Estimating Gradients of the Data Distribution (2019). NeurIPS 2019, published。多尺度scoreとannealed Langevin sampling。確認水準:要旨確認。
-
[MD90] Okan Koc, Alexander Soen, Chao-Kai Chiang, Masashi Sugiyama. Domain Adaptation and Entanglement: an Optimal Transport Perspective (2025). AISTATS 2025, PMLR 258:3034–3042, published。周辺分布整合だけでは解消できない条件付き分布差を解析。確認水準:要旨確認。
-
[MD91] Thomas Sesmat, Gabriel Meseguer-Brocal, Geoffroy Peeters. Where Flow Matching Leaks: Characterising the Membership Signals Along the Interpolation Path (2026). ICML 2026(July 6–11), PMLR 306:109269–109293, published。補間時刻ごとの訓練・テスト再構成差とmemorizationの解析。確認水準:要旨確認。
-
[MD92] 池田 思朗. 独立成分解析の信号処理への応用 (1999). 計測と制御 38(7):461–467, 1999-07-10, published。PCAの無相関化とICAの独立性、信号分離への応用を日本語で整理。確認水準:本文該当節確認。 刊行版確認先。
-
[MD93] Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, Björn Ommer. High-Resolution Image Synthesis with Latent Diffusion Models (2022). CVPR 2022との著者arXiv記載; arXiv初稿2021。事前学習autoencoderの潜在空間でdiffusionを訓練する。確認水準:要旨確認。