数理手法と学習ダイナミクスの研究サーベイ:自動微分・曲率・NTK・生成・最適輸送・因果表現

2026年10月サーベイの総合索引へ

対象は2026年10月3日までに公開を確認できた文献である。2026年10月末までの未来の文献は含めない。本章は下表の全トピックを扱い、代表原著・基礎文献・直近の関連研究を辿った広範なレビューであり、世界中の全論文を漏れなく収録したという意味での完全網羅性は主張しない。とくに2025–2026年は、公開日と版を確認した研究を明示的に追加した。参考文献の確認水準を末尾に示し、abstract確認と本文の該当節確認を区別する。

元の研究メモ 本章で再調査する内容
mathematical-methods/automatic-differentiation.md AD、JVP/VJP、HVP、計算資源と高階微分
mathematical-methods/hessian.md トレース・スペクトル推定、測定の対象、既存コードの注意点
learning-dynamics/fim.md 真のFisher、empirical Fisher、GGN、勾配ノイズ共分散
learning-dynamics/ntk.md frozen NTK、lazy training、feature learning、元ページの4原著
learning-dynamics/double-descent.md 補間閾値、良性過学習、正則化・標本数・epoch依存
mathematical-methods/flow-matching.md CNF、diffusion、CFM、rectified flow、MeanFlow、Schrödinger bridge
projects/empirical-ot.md、ot-outlier.md OTのdomain adaptation、外れ値、部分・非平衡輸送
mathematical-methods/mcmc.md MH、HMC、NUTS、SG-MCMC、診断、WALNUTS
mathematical-methods/modular-manifolds.md Stiefel、多様体最適化、modular normと研究提案の成立範囲
mathematical-methods/misc.md PCA/ICA、因果表現、置換不変性・同変性、特徴の交互作用
projects/ngd-gans.md、cg-gans.md、swa-rl.md GANのゲーム最適化とSWAによるRL汎化の関連研究

projects下のページは計画・TODOの記録であり、論文の採択、結果の再現、研究の完了を意味しない。特にcg-gans.mdでは題名とTopic欄が一致していないため、GANとextragradientに関する明示的なTODOのみを研究領域の手掛かりにした。以下の実験提案は本サーベイの提案であり、既存プロジェクトの達成事項ではない。

1. 分野をつなぐ研究の流れ

時期 主要な変化 本章の重要文献
1953–2000 分布をMarkov連鎖で探索する方法、HVPと確率的トレース推定、独立成分の識別 Metropolis [MD50]、HVP [MD02]、ICA [MD63]
2005–2014 score推定、計算可能なOT、minibatchによる事後推論、生成ゲーム score matching [MD88]、Sinkhorn [MD40]、NUTS [MD53]、GAN [MD76]
2015–2018 OTによるdomain adaptation、群同変性、CNF、NTK、SWA OT-DA [MD42]、G-CNN [MD72]、Neural ODE [MD26]、NTK [MD10]
2019–2021 lazyと特徴学習の区別、double descentの理論、非線形ICAの識別、score SDE lazy [MD12]、double descent [MD15]、iVAE [MD65]、score SDE [MD25]
2022–2024 速度回帰による生成、OT coupling、離散生成、因果機構の識別 FM [MD28]、CFM [MD30]、Discrete FM [MD34]、causal de Finetti [MD68]
2025–2026 1-step生成の目的設計、有限標本保証、分類NTK、AD基盤、局所適応HMC MeanFlow [MD36]、iMF [MD37]、分類NTK [MD19]、WALNUTS [MD58]

共通の鍵は「何を微分し、どの空間の幾何を測り、どの分布に対する期待値を使うか」である。Hessianは損失の局所曲率、Fisherは確率モデルの局所的な識別可能性、NTKはパラメータ更新が予測に伝わる幾何、OTは分布間の移動、MCMCは目標分布を保つ探索を扱う。同じ行列・微分・ODEが現れても、目的や期待値の取り方は異なる。

2. 自動微分、Hessian、Fisher:測る量を先に定義する

2.1 ADの基本と高階微分

$f:\mathbb R^p\to\mathbb R^m$のJacobianを$J_f$とする。forward modeは入力方向$v$に対する$J_fv$、reverse modeは出力側の重み$u$に対する$J_f^\top u$を伝播する。スカラー損失で$p$が大きい学習ではreverse modeが適する。一方、入力方向の数が少ない感度計算にはforward modeが適する。ADはプログラム中の基本演算に連鎖律を適用するもので、差分刻みを選ぶ有限差分とは異なる。ただし浮動小数点誤差、非滑らかな演算、分岐点での微分の規約は残る。Baydin et al. [MD01]

スカラー$L(\theta)$と、$\theta$に依存させない方向$v$について、

\[H(\theta)v =\left.\frac{d}{d\epsilon}\nabla L(\theta+\epsilon v)\right|_{\epsilon=0} =\nabla_\theta\left(\nabla L(\theta)^\top v\right)\]

である。したがって$p\times p$のHessian全体を保持せず、勾配計算に近い桁の計算量でHVPを得られる。これは固有値計算、共役勾配、曲率推定を実用化する基本操作である。計算グラフの保持量はforward-over-reverse、reverse-over-reverse、checkpointing等で変わる。Pearlmutter [MD02]

個別サンプル勾配やGGNの対角成分を毎回手書きする負担に対し、BackPACKは逆伝播を拡張した計算基盤を提供した。2026年のDifferentiationInterface.jlは、科学計算で現れる疎性、変数の更新、分岐等に応じてAD backendを選ぶための共通interfaceと準備処理を扱う。新規AD研究は「微分を求められるか」だけでなく、「目的の微分を必要なメモリ・構造で求められるか」に広がっている。Dangel et al. [MD05]、Dalle and Hill [MD09]

2.2 トレースとスペクトル

$\mathbb E[zz^\top]=I$なら、

\[\operatorname{tr}(H)=\mathbb E_z[z^\top Hz],\qquad \widehat{\operatorname{tr}}(H)=\frac1s\sum_{j=1}^s z_j^\top H z_j.\]

独立なRademacher probe $z_i\in{-1,+1}$または標準Gaussianを使える。対称$H$に対して、Gaussian probeの1標本分散は$2|H|F^2$、Rademacherでは$2\sum{i\ne j}H_{ij}^2$となる。Hessianが不定値でも不偏性は保たれるが、正負の固有値が相殺すると小さなtraceは平坦性を意味しない。相対誤差もtraceが0に近いと不安定である。Hutchinson [MD03]、Meyer et al. [MD04]

Hutch++は低ランク部分を分離して残差のtraceを確率推定し、PSD行列では所定の相対精度に必要なmatrix-vector積を改善する。PSDに対する代表保証を、一般の不定値Hessianへ無条件に移してはいけない。Hessian全体の形状を調べる場合はtraceだけでなく、最大・最小固有値、負曲率の有無、スペクトル密度、勾配と上位固有空間の重なりを併記する。大規模Hessian密度の推定により、batch normalizationと外れた固有値・勾配方向の関連が調べられている。MD04、Ghorbani et al. [MD06]

既存hessian.mdのコードを読む際には、次の点を修正課題として認識する必要がある。これは元コードの静的確認に基づく指摘で、本サーベイでは元ファイルを変更していない。

同じデータ・同じparameter subset・同じloss規約を使うことが、optimizer比較における曲率測定の前提である。

2.3 四つの行列を混同しない

負の対数尤度$\ell_i(\theta)=-\log p_\theta(y_i\mid x_i)$、$g_i=\nabla\ell_i$、$g=\frac1n\sum_i g_i$とする。

\[\begin{aligned} H&=\frac1n\sum_i\nabla_\theta^2\ell_i,\\ F&=\mathbb E_{x\sim q_x,\;y\sim p_\theta(\cdot\mid x)} [\nabla\log p_\theta(y\mid x)\nabla\log p_\theta(y\mid x)^\top],\\ F_{\rm emp}&=\frac1n\sum_i g_i g_i^\top,\\ C&=\frac1n\sum_i(g_i-g)(g_i-g)^\top =F_{\rm emp}-gg^\top . \end{aligned}\]
行列 意味と成立条件 誤りやすい理解
$H$ 実際の損失の二階微分。負固有値を持ち得る 常にPSDとする
$F$ モデル自身から出したラベルに関するscoreの二次モーメント 観測ラベルで計算した外積と同じとする
$F_{\rm emp}$ 観測データの個別勾配の二次モーメント Hessianの一貫した近似と無条件にみなす
$C$ 勾配の中心化共分散 FisherやHessianと同一とする
GGN $J_f^\top H_{\ell,\mathrm{output}}J_f$型の曲率。出力損失が凸ならPSD ネットワーク自身の二階微分項も含むとする

正則性条件の下では、モデル分布に対するFisherは負の対数尤度Hessianの期待値に一致する。しかし経験損失の$H$、観測ラベルの$F_{\rm emp}$、minibatchノイズの$C$がすべて等しくなるわけではない。標本抽出が独立・復元抽出ならbatch平均のノイズ共分散は$C/B$で、非復元抽出では有限母集団補正が付く。GGNとFisherの一致にも出力モデル・損失の対応条件が要る。Kunstner et al. [MD07]、Thomas et al. [MD08]

この区別は、NGDの効率とSGDノイズの汎化効果を解釈する際に不可欠である。自然勾配の更新則や近似optimizerの比較は最適化の章を参照する。

3. NTK、特徴学習、double descent

3.1 NTKが正確に記述するもの

訓練データ上の出力を$f_\theta\in\mathbb R^n$、$J_\theta=\partial f_\theta/\partial\theta$とし、損失を$L=\frac12|f_\theta-y|^2$と置く。勾配流では

\[K_\theta=J_\theta J_\theta^\top,\qquad \dot f_\theta=-K_\theta(f_\theta-y)\]

が成立する。有限幅でもこの関係は成り立つが、一般には$K_\theta$が学習中に変化する。適切な幅・初期化・学習率のスケーリングにおいて$K_\theta\simeq K_0$となることが、frozen NTK理論の追加内容である。このとき残差は$\exp(-K_0t)$に従い、正の固有値が大きい方向から学習される。Jacot et al. [MD10]、Lee et al. [MD11]

原典Theorem 2のkernel固定の議論では、Lipschitzかつ2回微分可能で2階微分が有界な活性化、training directionの時間積分が確率的に有界となる条件が使われ、証明は幅の逐次極限で進められる。任意のReLU実装・任意の同時極限へ無条件に拡張する主張ではない。本確認では§4.1–4.2とTheorem 1/2の条件を追い、証明全体の独立検算は行っていない。MD10 本文

NTKの意義は、非凸parameter空間での学習を、関数空間の線形化・kernel回帰として解析可能にした点にある。一方、訓練kernelの正定値性による訓練誤差収束は、未知分布に対する良い予測を自動的に保証しない。kernelと目的関数の整合性、サンプル分布、正則化、ノイズを別に検討する必要がある。

Chizat et al.はlazy trainingが特定のスケーリングで生じることを強調した。したがって「幅が無限なら特徴を学習できない」は誤りである。Yang and Huは無限幅でも特徴が更新されるparameterizationを構成し、μP/μTransferはこうしたスケーリングの理解をモデルサイズ間の調整に接続した。ただしμTransferは任意のarchitecture変更やデータ変更への無条件の転送保証ではない。MD12、MD13、MD14

元ntk.mdの関連論文は、次のように異なる問いに答えている。

論文 主な問い 適用範囲の読み方
Chen et al. [MD20] ノイズとweight decayがあってもkernel的解析が可能か 2層の特定設定であり、任意の深層モデル・ノイズへの一括保証ではない
Kawaguchi and Sun [MD21] NTK領域外で収束保証を構成できるか expressivity conditionと提案algorithmが前提で、通常のSGDの一般的な大域収束宣言ではない
Amari [MD22] ランダム初期値の近傍に十分な表現能力がある理由は何か 近傍に解が存在すること、algorithmがそこに到達すること、汎化することを区別する

一次資料:MD20、MD21、MD22。

2026年のPlenk et al.は、cross-entropyなど分類損失でのlazy領域を検討するpreprintである。parameter正則化、または全クラスの確率が正となる非退化target等の条件が要点となる。separableなone-hot分類でlogitが無限に増える状況に、二乗誤差での有界な線形化をそのまま適用できるとは限らない。これは「分類ではNTKが常に無効」という結論ではなく、損失・時間・target条件を明示する必要性を示す。MD19

3.2 double descentと良性過学習

double descentは、モデル複雑さを増やすと、まず誤差が下がり、補間閾値付近で上がり、さらに大きいモデルで再び下がる現象である。古典的なbias–variance分解そのものが破れたわけではない。複雑さに対してvarianceが一方向に増えるという素朴な形が成り立たない。Belkin et al.が幅広いモデルで統一的に整理し、Nakkiran et al.は深層モデルで幅・epoch・標本数による非単調性を報告した。MD15、MD16

最も見通しの良い例は、等方Gaussian特徴による線形回帰$y=x^\top\beta+\varepsilon$である。$p/n\to\gamma$、$|\beta|^2\to r^2$、$\mathrm{Var}(\varepsilon)=\sigma^2$とし、最小ノルム最小二乗推定量($\gamma>1$では補間解)の、既約ノイズを除いた予測リスクを考える。標準的な漸近設定では、

\[R(\gamma)= \begin{cases} \sigma^2\frac{\gamma}{1-\gamma},&\gamma<1,\\[2mm] r^2(1-\gamma^{-1})+\frac{\sigma^2}{\gamma-1},&\gamma>1. \end{cases}\]

$\gamma=1$近傍の小さな特異値がノイズを増幅する。一方、$\gamma>1$ではvarianceが下がっても、観測できない方向へのbiasが残る。この例でさえ「大きいほど必ず最良」ではない。相関特徴、信号方向、ridge、モデルのmisspecificationでは式も結論も変わる。Hastie et al. [MD17]

良性過学習は、訓練ノイズを完全に補間しながら小さな予測誤差を達成する性質であり、double descentという曲線の形そのものとは異なる。Bartlett et al.は線形回帰で共分散の有効ランクを用いて条件を特徴づけた。ノイズを吸収する多数の低寄与方向と、予測に重要な方向の構造が鍵となる。MD18

現在の課題は、特徴そのものが変化する現実の深層学習で、この線形・kernel理論がいつ局所的に説明力を持つかを見極めることである。比較実験では、最終epochだけの曲線に加え、早期停止・weight decay・label noiseを変え、補間時点とkernel変化量を記録する。「二回目の下降が観測されない」ことも、正則化やデータ幾何が異なれば自然である。MD12、MD13、MD16

4. Diffusion、Flow Matching、Rectified Flow、OT

4.1 生成分布を微分方程式で運ぶまで

score matchingは$s(x)=\nabla_x\log p(x)$を推定して、未知の正規化定数を避ける。低次元のデータ支持上ではscore推定が難しくなるため、Song and Ermonは異なるノイズ水準の分布を学習し、annealed Langevin dynamicsで生成した。これと並行して、Sohl-Dickstein et al.の拡散過程とHo et al.のDDPMが、段階的なノイズ除去による画像生成を発展させた。MD88、MD89、MD24、MD23

別の系譜として、Neural ODEは連続時間のベクトル場をニューラルネットで表現し、CNFは

\[\dot x_t=v_\theta(t,x_t),\qquad \frac{d}{dt}\log p_t(x_t)=-\nabla\cdot v_\theta(t,x_t)\]

を用いて密度変換を追跡する。FFJORDはdivergence、すなわちJacobian traceをHutchinson型推定で計算した。ここで2節の微分・trace推定と生成モデルが直接つながる。ただし数値積分誤差まで含めて無条件に「厳密な密度」になるわけではない。MD26、MD27

高解像度生成ではLatent Diffusion Models(Rombach et al., CVPR 2022)が計算上の転換点となった。事前学習autoencoderの潜在空間へdiffusionを移し、圧縮による計算削減と細部の保存を両立させ、cross-attentionによる条件付けを導入した。ただし潜在圧縮の再構成誤差は生成過程へ持ち込まれる。既存bilevelメモにも引用があるが、autoencoder学習と生成学習を段階的に行うことだけから、内側最適解への依存を微分するbilevel法だとは言えない。MD93

4.2 FMの条件付き回帰

ノイズ分布$p_0$とデータ分布$p_1$をつなぐ経路$p_t$を設計し、連続の式

\[\partial_t p_t+\nabla\cdot(p_tu_t)=0\]

を満たす速度場を学ぶ。endpoint pair $z=(x_0,x_1)$をあるcoupling $\pi$から取り、

\[x_t=(1-t)x_0+tx_1,\qquad \mathcal L_{\rm CFM} =\mathbb E_{t,(x_0,x_1)\sim\pi} \|v_\theta(t,x_t)-(x_1-x_0)\|^2\]

を考える。二乗誤差の条件付き期待値の性質から、最適な周辺速度は $u_t(x)=\mathbb E[x_1-x_0\mid x_t=x]$である。条件付きtargetを使う目的は周辺targetを使う目的とparameterに依存しない分散項だけ異なり、必要な正則性・積分条件の下で勾配が一致する。このため学習中に生成ODEを解かずに済む。Lipman et al. [MD28]、Tong et al. [MD30]

重要なのは、個々の条件付き補間が直線でも、周辺速度場による生成軌道は一般には直線でないことである。異なるendpoint pairの条件付き経路が同じ地点で異なる方向を要求すると、それらを平均するためである。Rectified Flowは直線補間に沿う速度を回帰し、得られたflowによるcouplingでreflowを行って軌道の直線化を目指す。理想的なrectificationの輸送コスト保証を、有限容量network・有限学習・数値積分の結果に無条件に当てはめてはいけない。Liu et al. [MD29]

4.3 diffusion・OT・Schrödinger bridgeとの違い

枠組み 学ぶ量・設計する量 特に確認すべき条件
diffusion / score SDE 時間ごとのscore、逆向きSDE score誤差、noise schedule、端点と離散化
probability-flow ODE SDEと同じ周辺分布を持つ決定論的速度場 正確なscoreと正則性の下での周辺一致。軌道そのものの一致ではない
FM / CFM 指定した確率経路の速度 coupling、条件付き経路、周辺場、ODE解の存在・一意性
OT-CFM endpointのOT couplingを用いた速度 minibatch OTと母集団OTを区別
stochastic interpolants 補間とノイズを設計し、flow/拡散を導く noise level、likelihoodを制御できる条件
Schrödinger bridge 指定端点を持ち、基準確率過程に近い経路分布 基準過程と経路空間のKL、反復近似の誤差

根拠:score SDE [MD25]、OT-CFM [MD30]、stochastic interpolants [MD31]、Diffusion Schrödinger Bridge [MD87]。

前向きSDEが$dx=f_t(x)dt+g_t\,dW_t$で拡散係数が状態に依存しない場合、probability-flow ODEの速度は$f_t-\frac12g_t^2\nabla\log p_t$となる。逆SDEとODEの同じ周辺分布という関係は、学習済み近似scoreと有限step solverで厳密に保たれるとは限らない。MD25

また、Gaussianから各データ点への条件付きの「OT path」と、二つの母集団間の二次Wasserstein最適輸送は同義ではない。動的OTへの対応にはendpoint couplingが本来のOT planである等の条件が必要で、minibatch内で最適でも全データ上で最適とは限らない。MD28、MD30

4.4 2024–2026年の発展

高解像度生成では、rectified flowの時間サンプリングとTransformerの設計が大規模に検討された。Discrete Flow Matchingでは、連続ベクトル場の代わりに離散状態の確率流と遷移率を扱う。連続データのODEをそのままtoken列に適用したものではない。理論と実装の入口として著者によるFlow Matching Guide and Codeが有用である。MD33、MD34、MD35

少数step化には異なる方法がある。Consistency Modelsは同じprobability-flow軌道上の点を共通の終点へ写す整合性を学ぶ。MeanFlowは瞬間速度ではなく区間の平均速度をモデル化し、平均速度と瞬間速度を結ぶ恒等式で学習する。前者の蒸留・独立学習の選択と、後者のfrom-scratch学習を混同しない。MD32、MD36

iMF(2025年12月初稿、2026年5月改訂)は、MeanFlowのtargetがnetwork自身にも依存する点と、訓練時に固定されたguidanceを課題として扱った。瞬間速度に対するlossを平均速度networkで再parameterizeし、guidanceを条件変数として扱う。ただしabstractで報告されたFIDを異なるtokenizer・guidance・訓練量の研究と直接順位比較するのは適切でない。本調査ではtechnical reportとして扱う。MD37

Gaur et al.(2025年12月preprint)は、FMの誤差を近似・統計・最適化に分解し、完全なERM oracleを置かずに標本複雑度を検討した。本文のAssumptions 3.1–3.4にはPL条件、smoothness、勾配分散の有界性、近似誤差、flowの正則性が置かれる。したがって報告される$\mathcal O(\epsilon^{-4})$型の標本数を、任意の大規模Transformerに普遍的なdimension-free保証と読んではいけない。MD38

未解決なのは、少数step化でのtail・mode coverage・条件忠実性、ODE誤差と学習誤差の切り分け、離散・多様体・不均衡データのcoupling、likelihoodと知覚品質の両立である。比較表には少なくとも訓練計算量、parameter数、tokenizer、guidance、NFE、solver、生成標本数を含めたい。これは上記文献の比較条件を踏まえた本サーベイの評価設計上の提案である。

生成品質とmemorizationの測定を分ける動きも現れている。Sesmat et al.(ICML 2026)は、線形補間の時刻に沿った訓練・テスト再構成差を解析し、Gaussian仮定下で差のピーク位置を導出した。要旨では画像・音声での検証と、validation指標が安定していてもmembership signalが蓄積する結果を報告する。ピークの閉形式を任意のデータ分布へ拡張する根拠はなく、生成品質指標だけで汎化を判断しないための補完的測定と位置づける。MD91

5. 最適輸送とdomain adaptation:外れ値を輸送する危険

5.1 定義から計算へ

離散分布$a,b$とコスト行列$C_{ij}=c(x_i,y_j)$に対するbalanced OTは

\[\min_{P\ge0}\langle P,C\rangle,\qquad P\mathbf1=a,\quad P^\top\mathbf1=b\]

である。質量をどこからどこへ動かすかを決めるcouplingを求める。エントロピー正則化 $\epsilon\sum_{ij}P_{ij}(\log P_{ij}-1)$を加えると、Sinkhorn scalingで高速に計算できる。一方、正則化した目的は元のWasserstein距離と同じ量ではない。自己輸送コストを引くSinkhorn divergenceは、そのbiasを補正してOTとMMDをつなぐ。Peyré and Cuturi [MD39]、Cuturi [MD40]、Feydy et al. [MD41]

計算可能性と統計的推定の難しさも別問題である。Sinkhornを高速化しても、少数サンプルから高次元の母集団間距離を精密に推定できるとは限らない。正則化強度、標本数、ground cost、表現の次元を同時に設計する必要がある。MD39

5.2 DAの系譜とnegative transfer

Courty et al.はラベル付きsourceとラベルなしtargetの間で、クラス構造に配慮した輸送を学習した。JDOTは特徴だけでなくラベルとのjoint distributionを扱い、DeepJDOTは深層表現と分類器を同時学習する。この流れは単純なmarginal alignmentから、判別に必要な構造を保つalignmentへの進展である。MD42、MD43、MD44

それでも距離が近いこととラベル意味が一致することは同じではない。クラス比率の変化、sourceにしかないクラス、targetの未知クラス、誤ったpseudo-label、表現上の近接性と意味的対応のずれがnegative transferを起こし得る。とくにbalanced制約は外れ値にも所定の輸送質量を割り当てるため、遠方の少量汚染が大きなコストを持つ。MD46、MD47、MD48

2025年にはKoc et al.がOTによるUDAの上界に、分布変化に応じた条件付き分布間のWasserstein距離を含む「entanglement」項を導入した。周辺分布を整合する方法の性能差を、直接最適化しにくい条件付き構造から説明する方向である。これは単にOT距離を小さくすることと分類リスクを下げることを区別する理論上の補強となる。ただし本サーベイは要旨を確認した範囲であり、その上界を個別実験に数値適用するには本文の仮定・推定方法を追加確認する必要がある。MD90

5.3 非平衡・部分・robust OT

非平衡OTは例えば

\[\min_{P\ge0}\langle P,C\rangle+ \epsilon\sum_{ij}P_{ij}(\log P_{ij}-1) +\tau_aD(P\mathbf1\,\|\,a) +\tau_bD(P^\top\mathbf1\,\|\,b)\]

のように、周辺制約をdivergence penaltyへ緩める。partial OTは輸送する総質量を指定し、残りを輸送対象から外す。robust OTは汚染モデル等に対してどの分布の変化を許すかを明示する。これらは関連するが同一の定式化ではない。Chizat et al. [MD45]、MD39、MD48

研究 進展 限界・確認事項
Unbalanced minibatch OT [MD46] 小batchの強制的な対応を緩和しDAへ適用 母集団OTの不偏推定という意味ではなく、minibatchで定めた目的・推定量の性質を読む
Robust OT [MD47] 深層生成・DAに使える安定した双対定式化 どの汚染・再重み付け集合を想定するか
Outlier-Robust OT [MD48] 外れ値質量の除去、双対、Huber汚染下の保証 汚染率・moment条件を要する。希少な正常点を除く可能性
Sinkhorn-CPD [MD49] 2026年公開。両側の質量緩和で部分重複・外れ値を含む点群を整合 点群登録という具体的設定の結果で、任意のDAでの優位性を意味しない

一次資料:MD46、MD47、MD48、MD49。

empirical-otとot-outlierの研究を再開する場合は、source-only、balanced OT、entropic OT、class-aware/JDOT、unbalanced、partial/robustを同一表現・同一調整budgetで比較すると問いが明確になる。汚染は割合だけでなく位置、label、class imbalanceを分け、正常な少数classの性能も報告する。target labelを調整に使うならunsupervised DAの条件が変わることを記録する。これは本サーベイからの実験設計案である。

6. MCMC:正しい分布と有限時間の探索

Metropolis法からHastingsの一般化へと発展したMH法は、目標$\pi$と提案$q(y\mid x)$に対して

\[\alpha(x,y)=\min\left\{1, \frac{\pi(y)q(x\mid y)}{\pi(x)q(y\mid x)} \right\}\]

で受理する。正規化定数が比で消える。目標分布の不変性に加えて、収束には既約性等の条件が要る。また漸近的に正しくても、有限時間でmode間を移動できるとは限らない。MD50、MD51

6.1 HMCとNUTS

$U(q)=-\log\pi(q)$、運動量$p\sim N(0,M)$とし、

\[\mathcal H(q,p)=U(q)+\tfrac12p^\top M^{-1}p,\qquad \dot q=M^{-1}p,\quad \dot p=-\nabla U(q)\]

を数値積分する。leapfrogの可逆性と体積保存を用い、エネルギーの離散化誤差をMH受理で補正する。HMCは勾配で長距離を移動できるが、funnel形状、複数mode、非滑らかな支持境界、悪いスケーリングでは難しさが残る。Neal [MD52]、Betancourt [MD54]

NUTSは軌道が折り返す条件を使って積分時間を調整する。単純に「折り返した最後の点を採用」する方法ではなく、候補の構成と選択が不変分布を保つために重要である。step size、mass matrix、parameterizationの設計まで不要になるわけではない。Hoffman and Gelman [MD53]

2026年3月刊行のWALNUTSは、軌道内の局所的なstep size適応を扱う。位置依存に刻みを変えるだけでは可逆性を壊し得るため、提案・軌道選択を含む構成が必要となる。著者らはfunnelや確率的volatilityモデルで効率を検証しているが、全問題でNUTSを置き換える一般結論ではない。本調査では本文冒頭の幾何・離散化・局所適応の説明と公開月を確認した。Bou-Rabee et al. [MD58]

6.2 minibatchと診断

SGLDはminibatch勾配に適切なGaussianノイズを加え、step sizeを減衰させることで事後サンプリングに接続する。SGHMCは勾配推定ノイズを考慮した摩擦を導入する。固定step size、誤ったノイズ共分散、有限時間の影響があるため、通常のSGDにノイズを足しただけで正しいposteriorになるわけではない。Welling and Teh [MD55]、Chen et al. [MD56]

診断では複数chain、rank-normalized $\widehat R$、bulk/tail ESS、Monte Carlo標準誤差、HMCのdivergenceを併用する。これらが良好でも、すべてのchainが同じmodeに閉じ込められている可能性は残る。重要なのは推定したい量ごとの精度である。例えば稀なtail確率の推定は平均値のESSだけで判断できない。Vehtari et al. [MD57]

MCMCの課題と生成モデルの課題は似て見えても、基準が異なる。MCMCは既知の未正規化targetに対する不変性と探索誤差、生成モデルはデータから学んだ分布の近似誤差が中心となる。学習したtransportをproposalに使う場合も、不変性を保つ補正の有無を区別する必要がある。

7. Stiefel多様体とModular Manifolds

7.1 確立した多様体最適化

$m\ge n$に対して、

\[\mathrm{St}(m,n)=\{W:W^\top W=I_n\},\qquad T_W\mathrm{St}=\{A:W^\top A+A^\top W=0\}.\]

埋め込みEuclidean計量の下で、周囲空間の勾配$G$を接空間に射影すると、

\[\operatorname{grad}L(W) =G-W\,\operatorname{sym}(W^\top G),\qquad \operatorname{sym}(B)=\tfrac12(B+B^\top)\]

となる。接方向への更新後にretractionを用いて制約集合へ戻る。retractionは点を集合へ戻す任意の処理ではなく、$R_W(0)=W$かつ原点での微分が接ベクトルを保つ等の局所条件を持つ。polar retractionやQR retractionを使う際も、rankや符号の規約を確認する。これらは標準的な多様体最適化の枠組みである。Absil et al. [MD59]、Boumal [MD60]

縦長$W$では入力空間上のノルムを保つが、横長で$WW^\top=I$を用いる場合は入力に核がある。「すべての方向を等長に保つ」と無条件に述べてはいけない。さらに線形層の特異値制約から、非線形・残差・正規化を含むネットワーク全体の性能やrobustnessまで自動的には保証されない。

7.2 新しい提案の位置づけ

Modular Normは層の合成と出力感度に沿ってweight spaceのノルムを構成し、幅・深さの変化に対して更新量を設計する。Modular Manifoldsはそれに多様体制約を組み合わせ、層ごとの学習率配分を考える著者公式研究記事である。Large et al. [MD61]、Bernstein [MD62]

記事のManifold Muonは、

\[\min_{A\in T_W\mathrm{St}} \langle G,A\rangle \quad\text{s.t.}\quad \|A\|_{\rm op}\le\eta\]

という接空間内のspectral norm制約付き最急降下を考える。spectral normは一般に内積から誘導されないので、上のEuclidean計量によるRiemannian gradientと同じ更新にはならない。Muonの更新行列を直交化することと、重み$W$をStiefel上に保つことも異なる。元記事で示される小規模MLP・CIFAR-10・3 epochのsanity checkは、大規模Transformerでの一般的優位性の証明ではない。MD62

今後の問いは、制約が表現力に与える影響、retractionと双対反復のコスト、momentumの運び方、低精度での直交性誤差、幅と深さを変えた学習率移送、実測時間を揃えた比較である。最適化章のMuon・行列ノルムの説明と併せて読むと、重みの制約と更新の幾何を分けて理解できる。

8. ICA、因果表現、対称性、特徴の相互作用

8.1 PCAとICAの基本的な修正

PCAは共分散の固有ベクトルによる直交射影であり、計算や分散最大化の定義にGaussian仮定は必要ない。無相関が独立を意味するのは、例えばjoint Gaussian等の追加条件がある場合である。ICAは$x=As$において$s$の成分独立性を使って混合を識別する。標準的な線形ICAでは、独立性、適切なrank条件、Gaussian成分が高々一つ等が識別の鍵で、順序とscaleには不定性が残る。Hyvärinen and Oja [MD63]

したがって元misc.mdの「PCAは正規分布を仮定する」「PCAはICAの特別な場合」という説明は、そのまま一般則として使えない。PCAによるwhiteningはICAの前処理になり得るが、目的関数と識別可能性は異なる。またICAにおける外れ値感度は推定contrastやtail仮定に依存し、「ICAは必ず外れ値を強調する」とも言えない。MD63

日本語の既存引用である池田(1999)は、二次の無相関化と、高次統計・時間的構造を利用する信号分離を明確に区別している。著者公開PDFの導入を確認し、J-STAGEで計測と制御38巻7号、1999年7月10日の書誌を照合した。線形混合の説明から信号処理へ進む入門として読めるが、現代の非線形潜在変数の識別性は次節の追加条件を要する。MD92

8.2 非線形ICAから因果表現へ

一般の非線形混合$x=f(s)$では、独立成分を得る変換が一意に決まらない。Locatello et al.は追加の帰納バイアス等がないdisentanglementの非識別性を示した。高い再構成性能や独立性penaltyだけでは、真の生成因子を回復したことにならない。MD66

Hyvärinen et al.は時刻・履歴・環境などの補助変数$u$を使い、$u$に応じた条件付き独立分布の変化から識別可能性を得る枠組みを示した。iVAEはこの考えを条件付きpriorを持つVAEに接続する。十分な変動、混合関数の性質、分布族等が重要であり、どんなmetadataでも付ければ識別できるわけではない。MD64、MD65

因果表現では、独立した外生ノイズと、因果的に依存する内生変数を分ける必要がある。例えば$z_j=f_j(z_{\mathrm{pa}(j)},\epsilon_j)$では$\epsilon_j$は独立でも$z_j$同士は一般に独立でない。「因子の独立性」と「因果変数の発見」は同義ではない。Schölkopf et al.の研究プログラムは、環境変化・介入・独立因果機構を表現学習に組み込むことを扱う。MD67

Causal de Finettiは交換可能な多環境データの非自明な条件付き独立構造とICM生成過程を結び付ける。通常のi.i.d.観測データに一般的な因果方向の識別性を与えたものではなく、より豊かなデータ構造と仮定が役割を持つ。Guo et al. [MD68]

2026年には「識別できる」という母集団論を、有限標本の推定へ進める研究を確認した。Lee et al.は線形の潜在因子・線形SEM・複数環境の設定で、未知の複数node介入から表現・混合・graphを推定する。対数個の環境という結果は、この設定・介入条件・分離条件に属する。任意の非線形因果表現を少数環境で回復したという主張ではない。本調査では本文のモデル式と線形設定を確認した。MD69

Kim et al.(UAI 2026)は、補助変数が観測生成の内部に入る場合を扱う。volume-preservingな混合、十分な変動、学習モデルの整合条件の下で、subspaceの置換とsubspace内の可逆変換までの識別可能性を示す。完全な各潜在座標の回復と独立subspaceまでの回復は異なる。MD70

未解決の中心は、現実の介入の不完全さ、未知confounder、有限標本での不確実性、識別された表現が実際のOOD予測や制御に役立つ条件である。表現の見やすさと因果的妥当性は別々に検証する。

8.3 不変性と同変性

群$G$の作用$\rho_{\rm in},\rho_{\rm out}$に対して、

\[f(\rho_{\rm in}(g)x)=f(x)\quad\text{(不変)},\qquad f(\rho_{\rm in}(g)x)=\rho_{\rm out}(g)f(x)\quad\text{(同変)}\]

を区別する。集合分類なら入力順を変えても予測は同じでよいが、各点のlabelを出力するなら、入力の置換と同じように出力も置換される必要がある。

Deep Setsの$\rho(\sum_i\phi(x_i))$は置換不変性を構成する基本形である。普遍表現に関する主張は集合のサイズ、入力領域、連続性、潜在次元などの条件を伴う。G-CNNは群作用に沿ったweight sharing、EGNNは回転・並進・反射・置換に同変なgraph計算を構成する。Geometric Deep Learningはこれらを幾何的帰納バイアスとして統合する。MD71、MD72、MD86、MD73

対称性を強制すると標本効率に利点がある一方、taskで本当に保存される対称性かを検討する必要がある。例えば反射で意味が変わるtargetに反射不変性を強制すると情報を失う。データ増強で近似的に学ぶ対称性と、architectureで厳密に保証する対称性も区別したい。

8.4 特徴の相互作用は因果作用ではない

二変数の予測関数を$f(x_1,x_2)=f_0+f_1(x_1)+f_2(x_2)+f_{12}(x_1,x_2)$と書くとき、$f_{12}$は主効果だけで説明できない成分である。ただし一意な分解には中心化や基準分布等の規約が必要で、特徴に相関がある場合は特に重要になる。

Friedman and Popescuはpartial dependenceに基づく相互作用の強さを調べる方法を提示した。NIDは非線形networkの重みと経路からinteraction候補を検出する。どちらも学習済み予測器の構造を解析するもので、交絡を解消した介入効果を推定する手法ではない。MD74、MD75

元misc.mdの「Hは常に0から1」という表現にも注意が要る。実装上のcentering、partial dependenceの推定、相関した特徴、分母が小さい状況によって解釈が不安定になり得る。Hessianの交差項$\partial^2f/\partial x_i\partial x_j$は局所的な微分的相互作用であり、分布平均のH統計量や因果的相乗効果とは別の量である。

9. GANとSWA-RLのプロジェクトへ接続する

9.1 GANは単一損失の最小化だけでは理解できない

GANは生成器と識別器の二者ゲームである。WGANはWasserstein双対を使い、WGAN-GPやspectral normalizationはcriticの勾配・Lipschitz性に関する制御を実用化した。ただし有限network・有限学習で評価されるcritic値が真のWasserstein距離に常に一致するわけではない。MD76、MD77、MD78、MD79

最小の例$\min_x\max_y xy$では、同時gradient descent/ascentは

\[\binom{x_{k+1}}{y_{k+1}} =\begin{pmatrix}1&-\eta\\\eta&1\end{pmatrix} \binom{x_k}{y_k}\]

となり、固有値の絶対値は$\sqrt{1+\eta^2}>1$である。個々のplayerに対する曲率が0でも、player間の回転的な相互作用で発散する。したがって一人用のNewton/NGDを各playerに適用するだけではゲーム全体の安定性を保証できない。

Gidel et al.はvariational inequalityとしてGANを扱い、平均化・extragradient・過去からの外挿を検討した。Schäfer and AnandkumarのCompetitive Gradient Descentは局所双線形ゲームのNash解を更新とし、局所的な凸凹条件等の下で解析する。Competitive Gradient Descentと、線形方程式を解くConjugate GradientはいずれもCGと略され得るが別手法である。既存cg-gans.mdのCGがどちらかは記録だけでは特定しない。MD80、MD81

ngd-gansのK-FAC、extragradient、toy problemのTODOには、まず双線形・非線形toy gameで回転と前処理の効果を分離し、その後同じ生成器・criticでFID等を比較する設計が対応する。生成品質だけでなく、mode coverage、崩壊率、seed分散、追加の勾配・HVP・通信コストも必要となる。

9.2 SWAをRLへ移す際の問い

SWAは一定・周期的学習率で得たweightの平均を使い、教師あり画像分類で汎化改善を示した。SWAGはさらに軌道の低ランク+対角共分散を用いて近似posteriorを構成する。SWAはposteriorからの正確なMCMC標本の平均ではなく、SWAGにも近似がある。MD82、MD83

RLではpolicyの変化が観測分布を変え、bootstrapped targetも動く。したがって教師あり学習でのSWAの利点をそのまま「未知環境に頑健」と結論づけることはできない。Procgenは手続き生成した訓練・未見環境で汎化を測る入口となり、mixregは観測・supervisionの混合による別のbaselineを提供する。MD84、MD85

swa-rlでは、同一環境分布の未見seed、見た目のshift、力学のshift、reward変更を分けるのがよい。policy/criticのどちらを平均するか、平均開始時点、BN統計、snapshot間の方策距離、学習後の追加interactionを明記し、SWA・EMA・snapshot ensembleを同じ計算budgetで比較する。これらは未実施の実験案であり、プロジェクトメモから成果を推定したものではない。

10. 読む順序と今後の研究課題

目的 推奨する順序
曲率を正しく測る Baydin [MD01] → Pearlmutter [MD02] → Hutchinson/Hutch++ [MD03–04] → Kunstner/Thomas [MD07–08] → BackPACK [MD05]
幅・学習ダイナミクスを理解する Jacot [MD10] → Lee [MD11] → Chizat [MD12] → Yang/Hu [MD13] → Belkin/Hastie/Bartlett [MD15,17,18] → 分類NTK [MD19]
生成モデルを理論から実装へつなぐ score SDE [MD25] → FM [MD28] → CFM/RF [MD29–30] → Guide [MD35] → Consistency/MeanFlow/iMF [MD32,36,37]
OTのnegative transferを研究する Computational OT [MD39] → OT-DA/JDOT [MD42–43] → DeepJDOT [MD44] → JUMBOT [MD46] → robust OT [MD47–48]
HMCを実務に使う Neal/Betancourt [MD52,54] → NUTS [MD53] → 診断 [MD57] → WALNUTS [MD58]
多様体をoptimizerに使う Absil/Boumal [MD59–60] → Modular Norm [MD61] → Modular Manifolds [MD62]
因果表現を研究する 線形ICA [MD63] → 非識別性 [MD66] → 補助変数/iVAE [MD64–65] → 因果表現 [MD67] → de Finetti [MD68] → 有限標本と内部補助変数 [MD69–70]

本章の領域を横断する未解決課題は四つに整理できる。

  1. 測定の再parameterization依存性:Hessianのtraceやsharpness、SWAの距離、重みのノルムを、予測分布の変化や性能との関係で評価する。
  2. 無限幅・無限標本から有限系への移行:kernel固定、正確なOT plan、完全なvelocity回帰、識別可能な潜在モデルという理想化が、有限計算でどれほど崩れるかを分解する。
  3. 速度と分布の忠実性の両立:1-NFE生成、高速minibatch OT、局所適応MCMCで、平均的品質だけでなくtail・少数mode・希少classを評価する。
  4. OOD改善の因果的な説明:対称性、因果表現、SWA、曲率制御のどれがどのshiftを改善したかを、交絡する訓練budget・表現・正則化と切り分ける。

これらは既存文献を横断した本サーベイの整理である。文献そのものの定理・結果と、ここからの実験提案を区別して使うことが重要となる。

参考文献と確認水準

確認日はすべて2026-10-03。要旨確認は一次公開先のabstract・書誌を確認したもの、本文該当節確認は記載したモデル・仮定等の本文を読んだもの、一次公式資料は著者の研究記事・書籍ページ、書誌確認は出版社の書誌までである。「本文該当節確認」は論文全体の証明を独立に検証したことを意味しない。年は正式刊行年を確認できたものではその年、それ以外では確認したarXiv初稿年を使い、publication statusに差を記載した。