汎化・分布シフト・校正・公平性の研究サーベイ(2026年10月)

2026年10月版サーベイ総合索引

本章の中心的な結論は、「汎化が良い」という単一の順位表では、分布シフトへの耐性、未知クラスの検出、確率の信頼性、公平性を評価できないということである。学習時に利用できる情報、変化を許す分布、守りたい性能を先に固定する必要がある。ここでは既存のgeneralization配下7トピックを起点に、関連する公開研究・技術資料を147件整理する。

調査打切日は2026年10月3日。10月末までの文献を含むという意味ではない。2025・2026年の正式会議録とarXiv初出日まで確認したが、全データベースの全件取得を行ったsystematic reviewではない。重要な原典・分岐点・評価上の反証を優先した広域サーベイである。大半の文献は一次論文のabstractと書誌の確認に基づき、BBSE、Fishr、Guoの校正論文、校正距離理論、TIC再検討、構成的汎化の幾何などは本文の該当節も確認した。実験の独立再現や全参考文献の全文読了は行っていない。

参考文献の年は確認できた初出年を基本とし、正式出版年が異なる場合は併記する。正式版年のみを採用した文献や書籍版はその旨を明示する。文中の[GE01]等は末尾の文献IDである。

1. 既存トピックとの対応

既存ページ 本章で補う内容
OOD DG・DA・TTA・detectionの切り分け、DomainBed/WILDS/OpenOOD、foundation model
Distribution Shift shiftの同定条件、重み補正、target情報の扱い
Calibration proper score、post-hoc/training-time、uncertainty、LLM
ECE binning・有限標本誤差、classwise校正、校正距離理論
Fairness 指標の非両立性、multicalibration、社会的文脈
Compositional Generalization SCAN・CFQ・COGS/ReCOGSから2026年の理論・LLM評価へ
Information Criteria AIC/TIC/WAIC/LOOの推定対象とOODへの適用限界

関連プロジェクトのood-optimizer、corruption-ood、dist-shift、dist-shift-fim、logit-norm、ticは研究関心の対応付けに使う。過去の計画・投稿候補・WIP表示から現在の成果、採択、実装状況を推定せず、非公開原稿や内部リンクの内容をサーベイの根拠にしない。

2. 問題設定を最初に分ける

sourceとtargetの分布をそれぞれ $P_s(X,Y)$、$P_t(X,Y)$ とする。distribution shiftは両者が異なることの総称であり、手法名ではない。

問題 学習・選択・運用で使えるtarget情報 目的 主要な評価
通常のIID汎化 同一母集団からの独立標本 同一分布上の未知例へ予測 test risk、NLL
domain generalization(DG) 通常は学習時target標本なし 未知domainの既知タスクで予測 target/domain別risk
unsupervised domain adaptation(UDA) 学習時にunlabeled targetを使う 指定されたtargetへ適応 target accuracy等
test-time adaptation(TTA) 推論時にtest標本・batch・streamを使う 運用中の適応 online risk、計算量、忘却
OOD detection ID/OODの定義と補助OOD利用条件を別途指定 未知入力を識別・棄却 AUROC、AUPR、FPR95
calibration 校正用ラベルの有無と取得時点を指定 予測確率を正解頻度と整合 ECE、classwise error、NLL
conformal prediction calibration sampleと交換可能性等の条件 予測集合のcoverage/riskを制御 coverageと集合サイズ
group robustness 定義済みgroupを使うか、推定するかを指定 worst-group riskを低減 group別・worst-group risk
fairness 利益・負担・集団・意思決定の文脈を指定 選んだ公平性要件を満たす error率・選択率・手続等
compositional generalization 既知要素の一部の組合せを学習から除外 新しい組合せや構造を処理 split別の構造・意味正解率

Generalized OOD Detection survey [GE27]は、anomaly detection、novelty detection、open-set recognition、OOD detection、outlier detectionの重なりと違いを整理する。例えば「既知クラスの画像に霧がかかった」場合は、semantic OODとして棄却するより分類を維持したいことがある。何を異常として扱うかは評価タスクの定義に依存する。

DomainBed [GE08]とTTAの評価研究 [GE18]が示すように、targetラベルでhyperparameterや停止時点を選ぶと、targetを利用できない運用条件とは別の結果になる。事前学習データがtargetを含む可能性も、現代のDGでは明示すべき条件である。

3. 研究の流れ

時期 主な展開 次の課題を生んだ点
1970年代〜2010年 AIC、TIC、Bayesian model評価、WAIC 正則モデル・同一分布・漸近近似の適用範囲
2000年代〜2016年 covariate shift補正、DAの誤差境界、DANN marginalな表現整合だけでラベル関係まで保存できるか
2016〜2019年 softmax OOD検出、temperature scaling、deep ensembles、fairness非両立性 高confidence・正確さ・公平性が別軸であること
2019〜2022年 IRM、group DRO、REx、Fishr、DomainBed、WILDS 原理的動機と現実benchmarkの改善が一致するとは限らない
2020〜2024年 TTA、継続適応、OpenOOD、conformal拡張、校正距離理論 shift混合、評価条件、coverageの条件、指標そのものの妥当性
2023〜2026年 foundation modelの再適応、LLM confidence、multicalibration、構成的汎化の識別可能性 大規模事前学習を含む汎化の定義と、正解ルールの同定可能性

この流れは単一手法の置換史ではない。source-onlyの頑健学習、targetへの適応、未知入力の棄却、意思決定の校正が並行して発展している。

4. Distribution shift:補正できる範囲と識別できない範囲

同時分布の二つの分解

\[p(x,y)=p(y\mid x)p(x)=p(x\mid y)p(y)\]

から、代表的な仮定を区別する。

shift 不変と仮定する量 推定・補正 破綻しやすい条件
covariate shift $p_s(y\mid x)=p_t(y\mid x)$ $w(x)=p_t(x)/p_s(x)$ targetがsource supportの外、大きな重み
label shift $p_s(x\mid y)=p_t(x\mid y)$ $w(y)=p_t(y)/p_s(y)$ 新クラス、class-conditional変化、混同行列の悪条件
concept shift/drift 一般には上のどちらも保証しない ラベル取得、再学習、構造仮定 unlabeled targetだけでは一般に同定不能
subpopulation/correlation shift groupの混合比や相関の構造による group別評価、reweighting、頑健学習 group定義の漏れ、極少数group
semantic/open-set shift label support自体が変わる detection、abstention、open-set適応 closed-setのclass prior補正だけでは扱えない

covariate shiftのsupport条件 $p_t(x)>0\Rightarrow p_s(x)>0$ の下では、

\[R_t(f)=\mathbb E_{P_s}\!\left[\frac{p_t(X)}{p_s(X)}\ell(f(X),Y)\right].\]

この恒等式と、有限標本で良い推定ができることは異なる。重みの裾が重いと分散が増える。clipは実用的でも推定対象を変え得る。Sugiyama et al. [GE01]はmodel selection自体をimportance weightingで修正する出発点である。

label shiftでは、BBSE [GE02]が、固定した予測器のsource confusion matrixとtarget予測分布からclass priorを推定する。本文の仮定はlabel shift、target label supportの包含、混同行列の可逆性である。分類器が完全に校正されている必要はないが、任意の弱い分類器で常に安定に推定できるわけではない。

Ben-David et al. [GE03]のDA理論はsource誤差とdomain差だけでなく、両domainで同時に良く予測できるかという項を含む。したがって「domain分類器が区別できなくなったからtarget errorも小さい」とは結論できない。DANN [GE04]はgradient reversalでdomain不変特徴を学習する代表法であるが、unlabeled targetを学習に使用する設定が基本である。

Identifiability Conditions for Domain Adaptation [GE84]は、正しいdomain対応が存在することと、その対応を観測データから一意に復元できることを分ける。特に線形の全単射mapの識別条件を研究したもので、任意のnonlinear DAを無仮定で解決する結果ではない。

残る問いは、shiftの種類を運用データからどの精度で診断できるか、複合shiftでどの仮定が破れたか、補正に必要なラベルをどこへ配分するかである。shift検出と、原因同定と、target risk推定を別の実験に分けることが重要になる。

5. DG:不変性から強いbaselineと事前学習へ

5.1 何を不変にするか

系統 代表研究 制約する量 解釈上の限界
表現上の最適予測器 IRM [GE05] 環境ごとの最適分類器 理想制約と実装するpenaltyは区別
環境間risk REx [GE06] training riskの分散 domainごとの不可避noise差まで消す可能性
groupの最悪risk group DRO [GE07] $\max_g R_g(f)$ group定義と各groupの汎化が必要
gradient statistics Fishr [GE11] per-example gradientのdomain別分散 empirical gradient covariance、Fisher、Hessianは一般に同一でない
重み補間・平均 WiSE-FT [GE12]、Model soups [GE13] pretrained/fine-tunedの重み 共通初期化・モデル互換性等の実験条件に依存

IRMは「特徴をすべての環境で使う」というだけの方法ではなく、表現上の最適な予測器を環境間で揃える目的である。その不変性が因果的・移送可能な構造と対応するには、環境の多様性や構造仮定が必要になる。IRM [GE05]。

group DROのSagawaらの貢献はDRO一般の発明ではない。過剰パラメータ化したnetworkでは全groupのtraining lossが小さくなってもworst-group test errorが高い場合があり、regularizationやearly stoppingが重要になることを示した。group DRO [GE07]。

Fishrはgradient varianceの整合を実装する。本文では、勾配外積、Fisher、Hessianの関係を通して局所loss landscapeを議論している。これは「FIMを厳密に揃えればOODが保証される」という一般定理ではない。Fisherをモデル分布で取る期待値と、実ラベルに基づく勾配統計の違いを保つ必要がある。Fishr [GE11]、Thomas et al. [GE70]。

5.2 benchmarkの転換

DomainBed [GE08]は、手法だけでなくarchitecture、hyperparameter探索、model selectionを揃えた比較を要求した。そこでERMが強かったという結果は重要だが、「今後の全DG法は無意味」という証明ではない。WILDS [GE09]は病院・地域・時刻などの自然なshiftを加えた。ImageNet-C/P [GE10]は合成corruption/perturbationの比較軸であり、自然なdomain shiftやworst-case adversarial robustnessの代替にはならない。

foundation modelでは、汎化性能にpretrainingの分布・規模が大きく関与する。WiSE-FTとModel soupsは強い事前学習モデルの性能を保ちながらtask適応を行う方向を示した。scratchでのDGと比較する際には、追加のデータ・事前知識と推論コストを明示する。[GE12–13]。

Shortcut Learning [GE86]は、benchmarkで有効でも移送できない規則という共通の見方を提供する。OoD-Bench [GE85]はdiversity shiftとcorrelation shiftを区別して比較する。既存メモにある旧題から、正式版に対応する「Quantifying and Understanding Two Dimensions」へ書誌を更新した。

5.3 ラベルなしの性能予測

Assessing Generalization of SGD via Disagreement [GE82]は、同じ学習データ・architectureでもSGD runを変えたモデル間の不一致からtest errorを推定し、ensembleの校正との関係を研究する。Agreement-on-the-Line [GE81]は、ID/OODでのモデル間agreementの対応をtarget accuracy予測に使う。実測された規則性を活用する方向であり、unlabeled targetだけから任意のtarget riskが同定可能になったわけではない。複数モデルが同じshortcutで同時に誤る場合や、training recipeが変わる場合は別途検証が必要である。

5.4 2026年の接続

Text-Anchored Information Bottleneck [GE76]は、vision-language modelの視覚特徴をそのまま保つことがshortcutも保つ可能性を指摘し、言語埋め込みを不変性の教師信号として使う。arXivにECCV 2026採択表示がある。一方、Subset-Shared Invariances with Mixture-of-Experts [GE77]は、全domainに共通する不変性を強制すると有用な要素を捨てるとして、部分集合で共有される構造を学習するpreprintである。

両者は、不変性をどの単位・教師信号・環境集合で定義するかを再検討する方向として読む。abstractで報告された改善を普遍的な優位性とは扱わない。

6. TTA:運用時に学習するなら評価も時系列にする

Tent [GE14]はtest prediction entropyを最小化する簡潔な方法を提示した。しかし、confidenceを高める操作は、誤りを修正する保証ではない。CoTTA [GE15]は誤差蓄積と忘却へ、EATA [GE16]は更新sampleの選択とFisher正則化へ、SAR [GE17]は小batch、混合shift、label imbalance下の安定性へ焦点を移した。

この展開を評価する際は、以下の条件が結果の一部である。

TTAB [GE18]はmodel selection、元モデルの品質、shift種類で結論が変わることを検証した。Xiao and Snoekのsurvey [GE19]はモデル重み以外に、normalization、input sample、inference、promptを変える方法も整理する。

2026年には、Geometric QuantilesによるTTA [GE78]がinput adapterによるarchitectureへの依存軽減を提案し、Back to Source [GE80]がdomain shiftとunknown classesの同時出現を扱うopen-set continual TTAを検討した。後者では既知/未知のsample分離自体が適応結果に依存するため、誤った分離と適応が相互に悪化させないかが重要となる。closed-set corruptionへの結果を、そのままopen-worldの保証と見なせない。

7. OOD detection:何を棄却し、どこで閾値を決めるか

歴史的には、最大softmax確率のbaseline [GE20]から、ODIN [GE21]のtemperature/input perturbation、Outlier Exposure [GE22]の補助異常データ、energy score [GE23]、LogitNorm [GE24]の学習時logit制御へ発展した。

方法の種類 使う情報・変更 公平な比較で揃えるもの
post-hoc score 既存networkのlogit/feature 同一checkpoint、前処理、ID accuracy
scoreに入力処理を加える temperatureやperturbation backward回数、threshold選択、OOD validation
outlier exposure 補助OODを学習に使う 補助データ規模、test OODとの重複
training objective変更 LogitNorm等 optimizer、探索予算、training cost
foundation model利用 事前学習画像・言語・class prompt pretraining data、prompt候補、未知クラス情報

LogitNormの代表論文は主としてOOD検出である。logit normを制約してconfidenceの分離が改善することから、任意のデータで確率校正も改善すると推論してはいけない。OOD AUROC、ID ECE、shift後ECEを別々に測る。LogitNorm [GE24]。

OpenOOD [GE25]とv1.5 [GE26]は評価を標準化し、後者はImageNet、CLIP/DINOv2、semantic/covariate shiftを同時に含む設定まで拡張した。2026年のOne Model, Many Behaviors [GE79]は、同じResNet-50でもtraining recipeとdetector選択の相互作用を報告する。ID accuracyの向上だけでは検出性能が単調に上がるとは限らない。

AUROCは閾値全体での順位能力であり、特定閾値のprecisionを与えない。OODを陽性、OOD prevalenceを $\pi$ とすれば、

\[\mathrm{Precision}=\frac{\pi\,\mathrm{TPR}} {\pi\,\mathrm{TPR}+(1-\pi)\,\mathrm{FPR}}.\]

これはBayes則からの関係であり、まれなOODでは小さく見えるFPRでも誤警報が多くなり得ることを示す。FPR95の「95%」をID acceptance側で定義する実装もあるため、陽性クラスとTPRの定義を記録する。near/far OOD、corrupted ID、新クラス、閾値選択用データを分けた報告が必要になる。

8. Calibration・ECE・uncertaintyを整理する

8.1 校正されていることと役に立つこと

二値の確率score $R$ の校正は、

\[\mathbb E[Y\mid R=r]=r\]

という条件である。多クラスtop-label校正は、予測最大確率 $C$ と正誤の関係

\[P(Y=\hat Y\mid C=c)=c\]

を見る。全クラスの確率vectorが正しいことや、各group内で校正されることより弱い。On Calibration of Modern Neural Networks [GE28]。

常にbase rateを返す予測器も、その母集団では校正され得る。したがって校正だけでは判別能力や個別の有用性を保証しない。NLLとBrier scoreはproper scoring ruleであり、確率予測全体の質を見る。AUCは主に順位を見る量で、校正された確率を必要としない。Strictly Proper Scoring Rules [GE29]。

8.2 ECEの読み方

有限標本の代表的なtop-label ECEは、

\[\widehat{\mathrm{ECE}} =\sum_{m=1}^{M}\frac{|B_m|}{n} \left|\mathrm{acc}(B_m)-\mathrm{conf}(B_m)\right|.\]

bin数、等幅/等頻度、top-label/classwise、norm、thresholdingを固定しなければ別の量を比較してしまう。同じbin内のoverconfidenceとunderconfidenceが相殺される一方、有限標本では絶対値による上方biasも生じ得る。「ECEは必ず過小評価」「binを増やせば必ず正確」という単純化は避ける。Guo et al. [GE28]、Measuring Calibration [GE30]、Verified Uncertainty Calibration [GE32]。

MMCE [GE31]はkernelを使った学習可能な校正尺度を提案した。Błasiok et al. [GE33]は「最も近い完全校正予測器までの距離」を基準に、smooth、interval、Laplace-kernel calibrationを比較する。本文では、population ECEの非連続性や、追加仮定なしに有限標本から推定する困難さも扱う。低いbinned ECEだけを「確率が正しい」証拠にするのは不十分である。

8.3 校正方法の比較

方法 主な利点 必要条件・確認点
temperature scaling [GE28] 1 scalarで実装が容易、正のtemperatureならargmaxを保存 校正データの代表性、表現力の限界
Dirichlet calibration [GE34] 多クラスの系統的偏りを補正 校正標本数、過学習、argmax変化
MMCE等のtraining objective [GE31] 学習中に校正を考慮 accuracyとのtrade-off、penalty選択
focal loss [GE35] lossによるoverconfidenceの抑制 実験条件に依存、すべての校正保証ではない
deep ensemble/MC dropout [GE37–38] 複数予測からuncertaintyを表現 計算費用、近似の質、shift後評価
multi-domain calibration [GE40] domain横断の校正を学習目標にする 環境の数・構造仮定、不変性との接続条件

Dirichlet calibration [GE34]、focal lossによる校正 [GE35]は、単一temperatureより柔軟な補正や学習法を提供した。ただしRevisiting the Calibration of Modern Neural Networks [GE36]を併読すると、Guoらの2017年のモデル群で見られた傾向を、2026年のarchitectureまで一般化できないことが分かる。

Ovadia et al. [GE39]はshift下でuncertainty法を比較する基礎文献である。sourceで校正してもtargetで校正されるとは限らない。Wald et al. [GE40]はmulti-domain calibrationと不変表現を条件付きで接続した。「一つのvalidation setでECEが小さいから、未知環境のshortcutが消えた」という主張までは支持しない。

8.4 不確実性の分解

aleatoric uncertaintyは観測やラベル生成過程に残る不確実性、epistemic uncertaintyはモデル・パラメータについての知識不足に関する不確実性である。区別は採用するモデルと情報集合に依存する。入力が珍しいことはepistemic uncertaintyを調べる契機になるが、両者は同義ではない。OODでもモデルは過信し得るし、ID領域でも有限データによりepistemic uncertaintyは残る。MC dropout [GE38]、Deep Ensembles [GE37]。

回帰では、確率分布・quantile・intervalをどの条件付き集合で校正するかまで指定する。Calibrated Regression [GE41]はこの拡張の入口になる。Bayesian posteriorを使ったという理由だけで、model misspecificationや近似推論の誤差が解消するわけではない。

Unified Uncertainty Calibration [GE83]は、epistemic uncertaintyが高ければ棄却し、それ以外を分類する単純な分岐を見直し、aleatoric/epistemic uncertaintyを共同で校正する。これは既存メモの二種類の不確実性を整理し直す直接の接続文献である。

8.5 LLM:token確率、正しさ、自己申告confidence

LLMでは「次tokenの確率」「選択肢が正解である確率」「生成文の事実性」「回答全体の成功」「答えを知っている確率」を区別する。Language Models (Mostly) Know What They Know [GE71]はP(True)とP(IK)を研究したが、新taskへの校正には限界も報告している。

Semantic Uncertainty [GE72]は異なる言い回しを意味的に集約する。semantic entropyがerror検出に役立つことと、数値が正解確率として校正されることは別である。LLMとalignmentの校正分析 [GE73]とSample Consistency [GE74]は、training段階・sampling・自己整合性の影響を追う入口である。

2026年のCaliDist [GE75]は、semantic distractorでpromptを変えたときの安定性をconfidence補正に使う。複数NLU benchmarkの結果であり、長文の全claimの真実性や任意のreasoning agentの成功確率に、そのまま移せるわけではない。LLM校正には、sampling温度・sample数・正解判定者・部分正解・abstention・task shiftを記録する必要がある。

9. Conformal prediction:coverageは校正と同じ保証ではない

conformal predictionは点予測に集合 $\Gamma(X)$ を付け、典型的には

\[P\{Y_{\mathrm{new}}\in\Gamma(X_{\mathrm{new}})\}\ge 1-\alpha\]

というmarginal coverageを狙う。基本形ではcalibration例と将来例の交換可能性が重要である。「distribution-free」は任意の時系列shiftで無条件に有効という意味ではない。Angelopoulos and Bates [GE42]。

実験ではcoverageと同時に集合サイズ、group別coverage、時間窓別coverageを示す。極端に大きい集合でcoverageだけを達成しても、意思決定に役立つとは限らない。

10. Fairness・multicalibration・group robustness

group属性を $A$、scoreを $R$、予測を $\hat Y$ とする。

条件 数式の例 注意
demographic parity $\hat Y\perp A$ prediction率の一致
equalized odds $\hat Y\perp A\mid Y$ 真のlabelごとのerror率の一致
equal opportunity $P(\hat Y=1\mid A,Y=1)$ が一定 TPRに限定
sufficiency $Y\perp A\mid R$ score値自体が確率に一致するとは限らない
group calibration $\mathbb E[Y\mid R=r,A=a]=r$ group内でscoreが確率として解釈できる
worst-group robustness $\min_f\max_g R_g(f)$ 定義済みgroupのriskを改善する目的

Hardt et al. [GE48]、Kleinberg et al. [GE49]、Pleiss et al. [GE50]を続けて読むと、誤差の平等とscoreの意味を揃える条件が、base rateの異なる一般的状況で両立しないことが分かる。perfect predictionや同じbase rate等の例外を外さず、「公平性は数学的に不可能」と一般化しない。

Multicalibration [GE51]は、計算可能なgroupの集合を指定して、重複するsubpopulationでも校正を要求する。Reductions Approach [GE52]は、選択した公平性制約の下でerrorを下げる問題をcost-sensitive classificationへ還元する。どちらも「どのgroup・label・制約が妥当か」を自動的に決めるものではない。

Gender Shades [GE53]は交差属性での性能監査の重要性を示した。そこで観測したcommercial gender classificationの誤差差を、現在の全顔認識システムの性能や単一の原因へ一般化しない。Fairness and Machine Learning [GE54]が扱うように、ラベルの意味、意思決定の正当性、利益と負担、制度的な影響まで考える必要がある。

2025年のProxy Groups [GE55]はsensitive attributeが欠ける現実の設定を、2026年のEfficient Swap Multicalibration [GE56]はelicitable propertyとonline学習の接続を進める。後者のoracle効率やrateは、hypothesis classの複雑さとonline learnerへのアクセス条件に依存する。

Waterbirdsで背景への依存を減らすことはgroup robustnessの研究である。 それを社会的fairnessと結ぶには、人への影響とgroup定義の対応が必要になる。平均ECEの改善と少数groupでの悪化が併存し得るため、group別標本数・interval・複数指標を一緒に報告する。

11. Compositional generalization:新しい組合せを学べる条件

構成的汎化は、既知の要素を未知の組合せ・役割・深さで使う能力である。通常のrandom splitでは、必要な組合せを既に学習している可能性がある。

benchmark・方向 何を変えるか 解釈上の注意
SCAN [GE57] commandとactionの新しい組合せ 合成言語での結果、splitごとに必要能力が違う
CFQ [GE58] atomは近くcompound分布を離す divergenceで定義した難度と自然言語能力は別
COGS [GE59] 語彙・構文役割・構造の再結合 lexicalとstructuralを別に報告
ReCOGS [GE60] logical formの非意味的要因を調整 表記一致と意味的一致の差
Meta-learning for compositionality [GE61] compositionalなepisodeを学習 meta-trainingの帰納biasと人間の全能力は区別

SCANの失敗は「ニューラルネットは原理的に構成性を持てない」という証明ではない。2023年のLakeとBaroniのMLCは、task分布に構成性を組み込むmeta-learningで、指定された課題における人間のsystematicityと柔軟性へ近づいた。一方、ReCOGSは評価側のlogical formの選択だけでも結論が変わり得ることを示す。[GE60–61]。

2025年のDistinguishing fair from unfair compositional generalization tasks [GE62]は、training dataがtestで期待する規則を一意に支持しているかを問う。ここでのfair/unfairはtaskの学習可能性の議論であり、前節の社会的fairnessとは別の用語である。複数の規則が同じtraining dataに整合するなら、特定のtest規則に従わなかったことだけで能力不足とは結論できない。

2026年のRule-Generation Perspective [GE63]は、LLMにmappingの規則をprogramとして生成させて評価する。pretrainingによる組合せの漏れが見えにくい状況で、最終accuracy以外の観察を増やす方向である。

Linear, Orthogonal Representations [GE64]は表現幾何に必要条件を与える。ただし確認したv1のProposition 1は、linear heads、GDとcross-entropy、binary concept grid、training-supportの条件、divisibility・transferability・stabilityを前提とする。任意のLLMの任意の構成的推論に、全概念の直交性が必要だという定理ではない。

Learning to Reason with Curriculum II [GE65]はsemiautomataの逐次計算を小部分へ分解するcurriculumを解析する。SFT型では途中状態のfeedback、RLVR型ではreference modelのcoverageとverifierを仮定する。abstractで述べられた標本複雑性の改善を、一般のCoT promptingの保証へ拡張しない。調査時点ではpreprintとして扱う。

残る重要課題は、長さ外挿、構造外挿、役割交換、未観測要素、既知要素の再結合を分離すること、正解規則の同定可能性とpretraining contaminationを測ること、意味的な部分誤りを診断することである。

12. 情報量規準:何の汎化誤差を推定しているか

対数尤度を $\ell_n(\theta)=\sum_{i=1}^{n}\log p_\theta(Z_i)$ とすると、代表的なAICは

\[\mathrm{AIC}=-2\ell_n(\hat\theta)+2k.\]

Akaikeの代表原典 [GE66]は、同一母集団の新標本に対する予測的な対数尤度を、training fitと複雑さの補正で評価する流れを作った。本調査ではDOI先の本文を取得できなかったため、この原典の根拠水準は書誌確認とする。

竹内啓のTIC原典 [GE67]は「情報統計量の分布とモデルの適切さの規準」、数理科学14(3)、12–18、1976年である。原文は館内限定資料で、本調査ではNDL書誌のみを確認した。以下のTICの技術的説明は、本文§4.1を確認できたThomas et al. [GE70]も根拠にする。

正則なmisspecified likelihood modelで、平均negative log likelihoodの期待Hessianを $H$、score外積の期待値を $J$ と書くと、plug-inのTICは概ね

\[\mathrm{TIC}=-2\ell_n(\hat\theta) +2\,\mathrm{tr}(\hat H^{-1}\hat J)\]

となる。これは通常の正則性、十分な標本、MLE近傍、同じ評価母集団などを前提とする漸近補正である。正しく指定された正則モデルでは情報行列等式により補正がパラメータ数へ戻る。Hessianが特異なdeep networkで、逆行列を擬似逆行列やdampingへ置き換えるときは、それが元の漸近理論から何を変えたかを確認する必要がある。[GE70]。

規準 主な対象 深層学習・OODでの注意
AIC 正則MLEの予測対数尤度のoptimism補正 parameter数だけでは特異性を捉えない
TIC misspecifiedな正則MLEの補正 Hessianとscore外積を混同しない
WAIC posterior predictiveのBayesian評価 posteriorの計算と理論条件が必要
PSIS-LOO leave-one-out predictive performanceの近似 importance weight診断、影響点、有限標本
target重み付きCV 指定したcovariate-shift target risk density ratio・supportの仮定が必要

Watanabe [GE68]は特異学習理論でBayes CVとWAICの漸近同値を示す。Vehtari et al. [GE69]はPSIS-LOOとWAICの実用計算・有限標本の安定性を比較した。これらのBayesianな対象を、SGDで求めた単一networkのAIC/TICと無条件に同一視しない。

TICのmodel misspecificationとdistribution shiftは違う。前者は同一の真の分布がモデル族の外にある状況、後者はtrainingとtargetの分布自体の差である。sourceだけで推定したTICを任意targetのriskとして解釈する根拠はない。 covariate shiftを仮定するならimportance-weighted CV [GE01]等と比較し、何を推定するかを先に定義する。

PAC-Bayes型の上界、algorithmic stabilityによる汎化解析、AIC/TICの期待optimism推定、domain adaptationの分布間境界は異なる種類の主張である。本章はIC/TICとOOD評価の接続を扱い、PAC-Bayes/stabilityの文献体系全体は対象外とする。

13. 既存研究関心に接続する実験設計

以下は本サーベイから導く研究案であり、既存プロジェクトで実施済みの実験・成果を表さない。

研究関心 最初に固定する問い 最小限の比較・記録
optimizer × OOD generalization optimizerの差は同じ選択予算で残るか ERM/強い事前学習baseline、architecture、同じ探索予算、source-only選択
optimizer × corruption 自然なshiftでも順位は保たれるか ImageNet-C系とWILDS等を分離、clean accuracyも併記
calibration × shift sourceでの改善がtargetのどのgroupまで届くか ECE/Brier/NLL、classwise/groupwise、shift強度、recalibration用ラベル
FIM × shift 何の期待値で定義した行列が性能と関連するか true/model Fisher、empirical外積、centered covariance、Hessianを区別
LogitNorm detectionとcalibrationの改善は一致するか 同じcheckpointでAUROC/FPR、ECE/NLL、near/far OODを別測定
TIC source optimismかtarget riskか 明示した推定対象、damping感度、sample size、CVとの比較

評価を再利用する際には、①splitの生成過程、②選択に使ったlabel、③pretrainingの出所、④複数seedと区間、⑤group/domain別結果、⑥推論時コストを記録する。FisherとHessianの詳細は総合索引の数理・力学編と併読するとよい。

14. 重要文献を読む順序と未解決問題

目的 読む順序 読みながら確認する点
shiftの基礎 GE01 → GE02 → GE03 → GE09 何の分布因子が不変か
DGの設計 GE05 → GE06/GE07 → GE08 → GE11 → GE12/GE76/GE77 原理、評価、事前学習の貢献を分ける
TTA GE14 → GE15/GE16 → GE17 → GE18 → GE80 stream・忘却・未知classの条件
OOD detection GE20 → GE21/GE22 → GE23/GE24 → GE25/GE26 → GE79 OOD定義、補助data、scoreとtrainingの相互作用
校正と評価 GE28/GE29 → GE30/GE32 → GE33 → GE36/GE39/GE40 校正、sharpness、予測性能を別に測る
conformal GE42 → GE46 → GE43/GE44 → GE45/GE47 marginal/conditional、exchangeability、出力形式
fairness GE54 → GE48 → GE49/GE50 → GE51/GE52 → GE55/GE56 規範的な選択と統計保証の違い
構成的汎化 GE57 → GE58/GE59 → GE60/GE61 → GE62 → GE63/GE64/GE65 規則がtrainingから識別できるか
情報量規準 GE66/GE67(原典)→ GE70 → GE68/GE69 漸近・特異性・推定対象・targetの違い
LLM confidence GE71 → GE72 → GE73/GE74 → GE75 token/claim/task successのどれを確率化するか

分野横断で残る問題は、source上の観測だけでどこまでtargetの失敗を予測できるか、複合shiftで適応と棄却をどう協調させるか、少数groupの校正を限られたラベルでどう測るか、pretrainingが非公開でも構成的汎化をどう検証するか、という点に集約される。これらは同じbenchmarkの平均値を改善するだけでは解決しない。

15. 調査の到達点と不足

2026年の追加確認は、COLTのmulticalibration、ICMLのCaliDistと構成的表現、ACLの規則生成評価、WACVのtraining recipeとOOD、CVPRのopen-set continual TTA、ECCV採択表示のDG、および複数の2026年arXiv preprintまで到達した。一次書誌での最も新しい採用初出は2026年7月2日のGE76であり、2026年9月投稿の候補も検索・書誌確認したが、重要性と仮定を評価しきれないため主文献へ追加しなかった。これは9月以降に重要論文がないという意味ではない。

未充足なのは、全会議・全ジャーナル・全preprintの網羅、論文間の全引用追跡、全件全文精読、graph/time-series/medical分野の個別適用論文の体系化、open-vocabulary detectionやselective classification全体の独立レビュー、社会制度としてのfairnessの包括的レビュー、PAC-Bayes/stability理論全体である。重要surveyへの入口も参考文献に含めたが、そのsurveyが引用する全論文を本章で検証したとはみなさない。

根拠水準は次のとおり。

16. 既存引用の追加調査

元の一般化トピック7ページから抽出された、初回台帳と未照合だった70 URLを追加で調べた。arXivのPDF/abstract、正式proceedings、著者のデータセットページ、所属機関書誌を突き合わせ、既存文献の別URLと新規文献を区別した。新規61件を[GE087]–[GE147]に収録する。これは61件を全文精読したという意味ではなく、基本は要旨確認で、書籍・一部資料は書誌または公式説明の確認にとどまる。取得できなかった元URLと、別公開版によって内容を確認できた文献は、検索ログで区別している。

16.1 引用の訂正と公開状況

16.2 研究の流れを補う文献群

問題設定から因果・不変性へ。 Dataset Shift in Machine Learning [GE138] は概念整理の編集書で、Vector Instituteの技術報告 [GE139] は実務上の横断データ・時系列・画像の事例を補う。Arjovskyの博士論文 [GE094]、Surgery Estimator [GE092]、医用画像における因果分析 [GE131] は、何が変化し何が保存されるかという仮定を明示する流れにある。expansion functionによる理論 [GE089]と不変予測器の最適性条件 [GE129]は、訓練環境での不変性だけから任意の未知環境の成功を導けない点を補う。情報理論からのshift分析 [GE095]も、補正対象と生成過程に合わせて目的関数・モデル選択を決める必要を強調する。

特徴、部分ネットワーク、損失、更新規則。 歴史的にはUnbiased Metric Learning [GE145]、Multi-Task Autoencoder [GE110]のような表現学習から、Modular Risk Minimization [GE096]のsubnetwork選択、DIFEX [GE124]の特徴不変性、implicit gradientによる損失学習 [GE142]へ設計対象が広がった。GSNRに基づくdropout [GE132]は高GSNRのパラメータを除いて依存を弱め、GENIE [GE135]は更新寄与の偏りを調整する。これらは異なる介入なので、同じ指標が同じ機構を表すとまとめない。

事前学習・fine-tuning・圧縮の比較。 fine-tuningの時間的分析 [GE088]は途中checkpointと収束時のeffective robustnessの差を示し、ViTの頑健性分析 [GE105]とNLP Transformerの分析 [GE106]はarchitectureの効果を事前学習データから切り離せないことを示唆する。CARDs [GE108]は圧縮と頑健性の両立を調べる。Fine-Grained Analysis [GE122]とMany Faces of Robustness [GE136]は、あるshiftでの成功を地理・style・相関変化すべてへ外挿しないための比較資料である。ID/OOD評価の分析 [GE104]も、IDの順位だけで配備時の順位を決める問題を取り上げる。

捷径・ラベルノイズ・概念への介入。 画像背景の分離実験 [GE100]、texture–shape cue conflict [GE114]、simplicity biasの構成例 [GE109]を並べると、容易な相関への依存は特徴学習と評価splitの双方に関わることが分かる。shape-biased自己教師あり学習 [GE103]とConcept Bottleneck Models [GE115]はそれぞれ異なる介入で、後者は概念注釈とテスト時の概念修正という追加情報を使う。Symmetric Cross Entropy [GE098]とarchitectureとnoisy labelsの分析 [GE128]は訓練ラベル汚染を扱い、spurious correlationとOOD検出の分析 [GE101]は未知入力の棄却を扱う。これらの「robustness」は同じ目的変数ではない。

校正・リスクの再重み付け・モデル選択。 multicalibrationの標本複雑性 [GE091]は群ごとの校正評価に必要な標本数を、intra order-preserving calibration [GE093]はtop-k順位を保存する校正関数を調べる。ID-calibrated ensembles [GE137]の理論ではOOD側でspurious featureの相関が逆転しないという条件があり、ID校正から一般のOOD改善が自動的に従うわけではない。Uncertainty Baselines [GE107]は再現可能な比較実装を補う。TERM [GE123]とonline DRO [GE141]はリスクの集約方法を変えるが、NIST SP 1270 [GE140]の制度・人間・統計的biasをすべて解消する公平性保証ではない。周辺尤度によるモデル選択 [GE090]はLaplace/Gauss–Newton近似に基づくBayesianな選択法で、§12のTICによる予測リスク補正とは区別する。

ラベルなし性能推定と安定性。 表現空間の局所密度 [GE097]、変換近傍での不変性 [GE127]、Fisher関連量・entropy・MMD [GE143]は、それぞれ性能予測に使う量を変える。disagreement推定への再検討 [GE125]は、未知環境でensemble calibrationが成立するかをラベルなしでは容易に検証できないと指摘する。Riemannian contractionとalgorithmic stability [GE130]は別種の理論であり、共通分布からの標本に対する安定性を任意の分布変化への保証と読み替えない。

敵対的摂動の頑健性。 adaptive optimizerの反例 [GE102]、精度と頑健性の両立条件 [GE144]、RealSafeの評価 [GE134]は、摂動集合・データの分離・攻撃設定を指定して読む。自然な地理的shiftや意味的unknownの検出へ、そのまま同じ結論を適用しない。

16.3 データセット引用を評価条件へ戻す

原典・ベンチマーク 主な評価対象と比較時の注意
VisDA [GE087] synthetic-to-realのUDA。ラベルなしtarget利用の有無を記録する。
PACS [GE111] 写真・絵・漫画・sketchをまたぐDG。訓練・検証・hold-out domainを分ける。
Terra Incognita [GE112] camera-trapの未知設置場所。背景の共有を許すsplitと分ける。
DomainNet [GE113] 原典はmulti-source UDA。DGへ再利用する際はtargetの扱いを変更する。
Office-Home [GE133] 原典はUDAのdeep hashing。データセットが同じでもUDA/DGは異なる課題。
Adaptiope [GE147] UDAベンチマーク。今回は所属機関書誌のみ確認し、性能比較の根拠には使わない。
Auto Arborist [GE146] 地理的shift・long-tail・複数視点。公式配布は停止済み。
ImageNet-Vid-Robust / YTBB-Robust [GE116] 知覚的に近い動画フレーム間の自然摂動。長期の時間的driftと同一ではない。
Meta-Dataset [GE117] 少数ラベルでの異種タスク適応。episodeとラベル予算を明示する。
VTAB [GE118]とHead2Toe [GE126] ラベルありtransferを測る。zero-shotやtarget不使用のDGと分ける。
VQA-CP [GE119] 質問型ごとの回答priorを変更し、画像への接地を評価する。
ANLI [GE120] 人とモデルによる反復的な難例収集。静的なIID testともノルム制約攻撃とも異なる。
ImageNet-A / ImageNet-O [GE121] 前者は難しい既知クラスの分類、後者はOOD検出。指標と母集団を分ける。

Adaptive Risk Minimization [GE099]は、訓練domainを使ってテスト時適応そのものを学ぶため、上のデータセット名に加えて、テスト点を何件まとめて利用し、どのパラメータを更新するかも比較条件になる。資料数を増やすだけでなく、同じ利用可能情報・split・検証予算で比較できる文献群を組むことが、追加引用の研究上の役割である。

参考文献(147件)

各項のURLは一次論文・正式会議録・出版社・原典書誌を優先する。著者数が多い一部はet al.と省略した。確認日は全件2026-10-03。