汎化・分布シフト・校正・公平性の研究サーベイ(2026年10月)
本章の中心的な結論は、「汎化が良い」という単一の順位表では、分布シフトへの耐性、未知クラスの検出、確率の信頼性、公平性を評価できないということである。学習時に利用できる情報、変化を許す分布、守りたい性能を先に固定する必要がある。ここでは既存のgeneralization配下7トピックを起点に、関連する公開研究・技術資料を147件整理する。
調査打切日は2026年10月3日。10月末までの文献を含むという意味ではない。2025・2026年の正式会議録とarXiv初出日まで確認したが、全データベースの全件取得を行ったsystematic reviewではない。重要な原典・分岐点・評価上の反証を優先した広域サーベイである。大半の文献は一次論文のabstractと書誌の確認に基づき、BBSE、Fishr、Guoの校正論文、校正距離理論、TIC再検討、構成的汎化の幾何などは本文の該当節も確認した。実験の独立再現や全参考文献の全文読了は行っていない。
参考文献の年は確認できた初出年を基本とし、正式出版年が異なる場合は併記する。正式版年のみを採用した文献や書籍版はその旨を明示する。文中の[GE01]等は末尾の文献IDである。
1. 既存トピックとの対応
| 既存ページ | 本章で補う内容 |
|---|---|
| OOD | DG・DA・TTA・detectionの切り分け、DomainBed/WILDS/OpenOOD、foundation model |
| Distribution Shift | shiftの同定条件、重み補正、target情報の扱い |
| Calibration | proper score、post-hoc/training-time、uncertainty、LLM |
| ECE | binning・有限標本誤差、classwise校正、校正距離理論 |
| Fairness | 指標の非両立性、multicalibration、社会的文脈 |
| Compositional Generalization | SCAN・CFQ・COGS/ReCOGSから2026年の理論・LLM評価へ |
| Information Criteria | AIC/TIC/WAIC/LOOの推定対象とOODへの適用限界 |
関連プロジェクトのood-optimizer、corruption-ood、dist-shift、dist-shift-fim、logit-norm、ticは研究関心の対応付けに使う。過去の計画・投稿候補・WIP表示から現在の成果、採択、実装状況を推定せず、非公開原稿や内部リンクの内容をサーベイの根拠にしない。
2. 問題設定を最初に分ける
sourceとtargetの分布をそれぞれ $P_s(X,Y)$、$P_t(X,Y)$ とする。distribution shiftは両者が異なることの総称であり、手法名ではない。
| 問題 | 学習・選択・運用で使えるtarget情報 | 目的 | 主要な評価 |
|---|---|---|---|
| 通常のIID汎化 | 同一母集団からの独立標本 | 同一分布上の未知例へ予測 | test risk、NLL |
| domain generalization(DG) | 通常は学習時target標本なし | 未知domainの既知タスクで予測 | target/domain別risk |
| unsupervised domain adaptation(UDA) | 学習時にunlabeled targetを使う | 指定されたtargetへ適応 | target accuracy等 |
| test-time adaptation(TTA) | 推論時にtest標本・batch・streamを使う | 運用中の適応 | online risk、計算量、忘却 |
| OOD detection | ID/OODの定義と補助OOD利用条件を別途指定 | 未知入力を識別・棄却 | AUROC、AUPR、FPR95 |
| calibration | 校正用ラベルの有無と取得時点を指定 | 予測確率を正解頻度と整合 | ECE、classwise error、NLL |
| conformal prediction | calibration sampleと交換可能性等の条件 | 予測集合のcoverage/riskを制御 | coverageと集合サイズ |
| group robustness | 定義済みgroupを使うか、推定するかを指定 | worst-group riskを低減 | group別・worst-group risk |
| fairness | 利益・負担・集団・意思決定の文脈を指定 | 選んだ公平性要件を満たす | error率・選択率・手続等 |
| compositional generalization | 既知要素の一部の組合せを学習から除外 | 新しい組合せや構造を処理 | split別の構造・意味正解率 |
Generalized OOD Detection survey [GE27]は、anomaly detection、novelty detection、open-set recognition、OOD detection、outlier detectionの重なりと違いを整理する。例えば「既知クラスの画像に霧がかかった」場合は、semantic OODとして棄却するより分類を維持したいことがある。何を異常として扱うかは評価タスクの定義に依存する。
DomainBed [GE08]とTTAの評価研究 [GE18]が示すように、targetラベルでhyperparameterや停止時点を選ぶと、targetを利用できない運用条件とは別の結果になる。事前学習データがtargetを含む可能性も、現代のDGでは明示すべき条件である。
3. 研究の流れ
| 時期 | 主な展開 | 次の課題を生んだ点 |
|---|---|---|
| 1970年代〜2010年 | AIC、TIC、Bayesian model評価、WAIC | 正則モデル・同一分布・漸近近似の適用範囲 |
| 2000年代〜2016年 | covariate shift補正、DAの誤差境界、DANN | marginalな表現整合だけでラベル関係まで保存できるか |
| 2016〜2019年 | softmax OOD検出、temperature scaling、deep ensembles、fairness非両立性 | 高confidence・正確さ・公平性が別軸であること |
| 2019〜2022年 | IRM、group DRO、REx、Fishr、DomainBed、WILDS | 原理的動機と現実benchmarkの改善が一致するとは限らない |
| 2020〜2024年 | TTA、継続適応、OpenOOD、conformal拡張、校正距離理論 | shift混合、評価条件、coverageの条件、指標そのものの妥当性 |
| 2023〜2026年 | foundation modelの再適応、LLM confidence、multicalibration、構成的汎化の識別可能性 | 大規模事前学習を含む汎化の定義と、正解ルールの同定可能性 |
この流れは単一手法の置換史ではない。source-onlyの頑健学習、targetへの適応、未知入力の棄却、意思決定の校正が並行して発展している。
4. Distribution shift:補正できる範囲と識別できない範囲
同時分布の二つの分解
\[p(x,y)=p(y\mid x)p(x)=p(x\mid y)p(y)\]から、代表的な仮定を区別する。
| shift | 不変と仮定する量 | 推定・補正 | 破綻しやすい条件 |
|---|---|---|---|
| covariate shift | $p_s(y\mid x)=p_t(y\mid x)$ | $w(x)=p_t(x)/p_s(x)$ | targetがsource supportの外、大きな重み |
| label shift | $p_s(x\mid y)=p_t(x\mid y)$ | $w(y)=p_t(y)/p_s(y)$ | 新クラス、class-conditional変化、混同行列の悪条件 |
| concept shift/drift | 一般には上のどちらも保証しない | ラベル取得、再学習、構造仮定 | unlabeled targetだけでは一般に同定不能 |
| subpopulation/correlation shift | groupの混合比や相関の構造による | group別評価、reweighting、頑健学習 | group定義の漏れ、極少数group |
| semantic/open-set shift | label support自体が変わる | detection、abstention、open-set適応 | closed-setのclass prior補正だけでは扱えない |
covariate shiftのsupport条件 $p_t(x)>0\Rightarrow p_s(x)>0$ の下では、
\[R_t(f)=\mathbb E_{P_s}\!\left[\frac{p_t(X)}{p_s(X)}\ell(f(X),Y)\right].\]この恒等式と、有限標本で良い推定ができることは異なる。重みの裾が重いと分散が増える。clipは実用的でも推定対象を変え得る。Sugiyama et al. [GE01]はmodel selection自体をimportance weightingで修正する出発点である。
label shiftでは、BBSE [GE02]が、固定した予測器のsource confusion matrixとtarget予測分布からclass priorを推定する。本文の仮定はlabel shift、target label supportの包含、混同行列の可逆性である。分類器が完全に校正されている必要はないが、任意の弱い分類器で常に安定に推定できるわけではない。
Ben-David et al. [GE03]のDA理論はsource誤差とdomain差だけでなく、両domainで同時に良く予測できるかという項を含む。したがって「domain分類器が区別できなくなったからtarget errorも小さい」とは結論できない。DANN [GE04]はgradient reversalでdomain不変特徴を学習する代表法であるが、unlabeled targetを学習に使用する設定が基本である。
Identifiability Conditions for Domain Adaptation [GE84]は、正しいdomain対応が存在することと、その対応を観測データから一意に復元できることを分ける。特に線形の全単射mapの識別条件を研究したもので、任意のnonlinear DAを無仮定で解決する結果ではない。
残る問いは、shiftの種類を運用データからどの精度で診断できるか、複合shiftでどの仮定が破れたか、補正に必要なラベルをどこへ配分するかである。shift検出と、原因同定と、target risk推定を別の実験に分けることが重要になる。
5. DG:不変性から強いbaselineと事前学習へ
5.1 何を不変にするか
| 系統 | 代表研究 | 制約する量 | 解釈上の限界 |
|---|---|---|---|
| 表現上の最適予測器 | IRM [GE05] | 環境ごとの最適分類器 | 理想制約と実装するpenaltyは区別 |
| 環境間risk | REx [GE06] | training riskの分散 | domainごとの不可避noise差まで消す可能性 |
| groupの最悪risk | group DRO [GE07] | $\max_g R_g(f)$ | group定義と各groupの汎化が必要 |
| gradient statistics | Fishr [GE11] | per-example gradientのdomain別分散 | empirical gradient covariance、Fisher、Hessianは一般に同一でない |
| 重み補間・平均 | WiSE-FT [GE12]、Model soups [GE13] | pretrained/fine-tunedの重み | 共通初期化・モデル互換性等の実験条件に依存 |
IRMは「特徴をすべての環境で使う」というだけの方法ではなく、表現上の最適な予測器を環境間で揃える目的である。その不変性が因果的・移送可能な構造と対応するには、環境の多様性や構造仮定が必要になる。IRM [GE05]。
group DROのSagawaらの貢献はDRO一般の発明ではない。過剰パラメータ化したnetworkでは全groupのtraining lossが小さくなってもworst-group test errorが高い場合があり、regularizationやearly stoppingが重要になることを示した。group DRO [GE07]。
Fishrはgradient varianceの整合を実装する。本文では、勾配外積、Fisher、Hessianの関係を通して局所loss landscapeを議論している。これは「FIMを厳密に揃えればOODが保証される」という一般定理ではない。Fisherをモデル分布で取る期待値と、実ラベルに基づく勾配統計の違いを保つ必要がある。Fishr [GE11]、Thomas et al. [GE70]。
5.2 benchmarkの転換
DomainBed [GE08]は、手法だけでなくarchitecture、hyperparameter探索、model selectionを揃えた比較を要求した。そこでERMが強かったという結果は重要だが、「今後の全DG法は無意味」という証明ではない。WILDS [GE09]は病院・地域・時刻などの自然なshiftを加えた。ImageNet-C/P [GE10]は合成corruption/perturbationの比較軸であり、自然なdomain shiftやworst-case adversarial robustnessの代替にはならない。
foundation modelでは、汎化性能にpretrainingの分布・規模が大きく関与する。WiSE-FTとModel soupsは強い事前学習モデルの性能を保ちながらtask適応を行う方向を示した。scratchでのDGと比較する際には、追加のデータ・事前知識と推論コストを明示する。[GE12–13]。
Shortcut Learning [GE86]は、benchmarkで有効でも移送できない規則という共通の見方を提供する。OoD-Bench [GE85]はdiversity shiftとcorrelation shiftを区別して比較する。既存メモにある旧題から、正式版に対応する「Quantifying and Understanding Two Dimensions」へ書誌を更新した。
5.3 ラベルなしの性能予測
Assessing Generalization of SGD via Disagreement [GE82]は、同じ学習データ・architectureでもSGD runを変えたモデル間の不一致からtest errorを推定し、ensembleの校正との関係を研究する。Agreement-on-the-Line [GE81]は、ID/OODでのモデル間agreementの対応をtarget accuracy予測に使う。実測された規則性を活用する方向であり、unlabeled targetだけから任意のtarget riskが同定可能になったわけではない。複数モデルが同じshortcutで同時に誤る場合や、training recipeが変わる場合は別途検証が必要である。
5.4 2026年の接続
Text-Anchored Information Bottleneck [GE76]は、vision-language modelの視覚特徴をそのまま保つことがshortcutも保つ可能性を指摘し、言語埋め込みを不変性の教師信号として使う。arXivにECCV 2026採択表示がある。一方、Subset-Shared Invariances with Mixture-of-Experts [GE77]は、全domainに共通する不変性を強制すると有用な要素を捨てるとして、部分集合で共有される構造を学習するpreprintである。
両者は、不変性をどの単位・教師信号・環境集合で定義するかを再検討する方向として読む。abstractで報告された改善を普遍的な優位性とは扱わない。
6. TTA:運用時に学習するなら評価も時系列にする
Tent [GE14]はtest prediction entropyを最小化する簡潔な方法を提示した。しかし、confidenceを高める操作は、誤りを修正する保証ではない。CoTTA [GE15]は誤差蓄積と忘却へ、EATA [GE16]は更新sampleの選択とFisher正則化へ、SAR [GE17]は小batch、混合shift、label imbalance下の安定性へ焦点を移した。
この展開を評価する際は、以下の条件が結果の一部である。
- episodic resetか、以前のtest batchで更新した状態を維持するか。
- predictionを出す前に、そのsampleや同じbatch全体を使ってよいか。
- source data、source statistics、source Fisher、保存モデルを保持してよいか。
- batch size・到着順序・class比率が実運用と一致しているか。
- accuracyの改善に対して、更新時間・逆伝播・メモリ・忘却がどれだけ増えたか。
TTAB [GE18]はmodel selection、元モデルの品質、shift種類で結論が変わることを検証した。Xiao and Snoekのsurvey [GE19]はモデル重み以外に、normalization、input sample、inference、promptを変える方法も整理する。
2026年には、Geometric QuantilesによるTTA [GE78]がinput adapterによるarchitectureへの依存軽減を提案し、Back to Source [GE80]がdomain shiftとunknown classesの同時出現を扱うopen-set continual TTAを検討した。後者では既知/未知のsample分離自体が適応結果に依存するため、誤った分離と適応が相互に悪化させないかが重要となる。closed-set corruptionへの結果を、そのままopen-worldの保証と見なせない。
7. OOD detection:何を棄却し、どこで閾値を決めるか
歴史的には、最大softmax確率のbaseline [GE20]から、ODIN [GE21]のtemperature/input perturbation、Outlier Exposure [GE22]の補助異常データ、energy score [GE23]、LogitNorm [GE24]の学習時logit制御へ発展した。
| 方法の種類 | 使う情報・変更 | 公平な比較で揃えるもの |
|---|---|---|
| post-hoc score | 既存networkのlogit/feature | 同一checkpoint、前処理、ID accuracy |
| scoreに入力処理を加える | temperatureやperturbation | backward回数、threshold選択、OOD validation |
| outlier exposure | 補助OODを学習に使う | 補助データ規模、test OODとの重複 |
| training objective変更 | LogitNorm等 | optimizer、探索予算、training cost |
| foundation model利用 | 事前学習画像・言語・class prompt | pretraining data、prompt候補、未知クラス情報 |
LogitNormの代表論文は主としてOOD検出である。logit normを制約してconfidenceの分離が改善することから、任意のデータで確率校正も改善すると推論してはいけない。OOD AUROC、ID ECE、shift後ECEを別々に測る。LogitNorm [GE24]。
OpenOOD [GE25]とv1.5 [GE26]は評価を標準化し、後者はImageNet、CLIP/DINOv2、semantic/covariate shiftを同時に含む設定まで拡張した。2026年のOne Model, Many Behaviors [GE79]は、同じResNet-50でもtraining recipeとdetector選択の相互作用を報告する。ID accuracyの向上だけでは検出性能が単調に上がるとは限らない。
AUROCは閾値全体での順位能力であり、特定閾値のprecisionを与えない。OODを陽性、OOD prevalenceを $\pi$ とすれば、
\[\mathrm{Precision}=\frac{\pi\,\mathrm{TPR}} {\pi\,\mathrm{TPR}+(1-\pi)\,\mathrm{FPR}}.\]これはBayes則からの関係であり、まれなOODでは小さく見えるFPRでも誤警報が多くなり得ることを示す。FPR95の「95%」をID acceptance側で定義する実装もあるため、陽性クラスとTPRの定義を記録する。near/far OOD、corrupted ID、新クラス、閾値選択用データを分けた報告が必要になる。
8. Calibration・ECE・uncertaintyを整理する
8.1 校正されていることと役に立つこと
二値の確率score $R$ の校正は、
\[\mathbb E[Y\mid R=r]=r\]という条件である。多クラスtop-label校正は、予測最大確率 $C$ と正誤の関係
\[P(Y=\hat Y\mid C=c)=c\]を見る。全クラスの確率vectorが正しいことや、各group内で校正されることより弱い。On Calibration of Modern Neural Networks [GE28]。
常にbase rateを返す予測器も、その母集団では校正され得る。したがって校正だけでは判別能力や個別の有用性を保証しない。NLLとBrier scoreはproper scoring ruleであり、確率予測全体の質を見る。AUCは主に順位を見る量で、校正された確率を必要としない。Strictly Proper Scoring Rules [GE29]。
8.2 ECEの読み方
有限標本の代表的なtop-label ECEは、
\[\widehat{\mathrm{ECE}} =\sum_{m=1}^{M}\frac{|B_m|}{n} \left|\mathrm{acc}(B_m)-\mathrm{conf}(B_m)\right|.\]bin数、等幅/等頻度、top-label/classwise、norm、thresholdingを固定しなければ別の量を比較してしまう。同じbin内のoverconfidenceとunderconfidenceが相殺される一方、有限標本では絶対値による上方biasも生じ得る。「ECEは必ず過小評価」「binを増やせば必ず正確」という単純化は避ける。Guo et al. [GE28]、Measuring Calibration [GE30]、Verified Uncertainty Calibration [GE32]。
MMCE [GE31]はkernelを使った学習可能な校正尺度を提案した。Błasiok et al. [GE33]は「最も近い完全校正予測器までの距離」を基準に、smooth、interval、Laplace-kernel calibrationを比較する。本文では、population ECEの非連続性や、追加仮定なしに有限標本から推定する困難さも扱う。低いbinned ECEだけを「確率が正しい」証拠にするのは不十分である。
8.3 校正方法の比較
| 方法 | 主な利点 | 必要条件・確認点 |
|---|---|---|
| temperature scaling [GE28] | 1 scalarで実装が容易、正のtemperatureならargmaxを保存 | 校正データの代表性、表現力の限界 |
| Dirichlet calibration [GE34] | 多クラスの系統的偏りを補正 | 校正標本数、過学習、argmax変化 |
| MMCE等のtraining objective [GE31] | 学習中に校正を考慮 | accuracyとのtrade-off、penalty選択 |
| focal loss [GE35] | lossによるoverconfidenceの抑制 | 実験条件に依存、すべての校正保証ではない |
| deep ensemble/MC dropout [GE37–38] | 複数予測からuncertaintyを表現 | 計算費用、近似の質、shift後評価 |
| multi-domain calibration [GE40] | domain横断の校正を学習目標にする | 環境の数・構造仮定、不変性との接続条件 |
Dirichlet calibration [GE34]、focal lossによる校正 [GE35]は、単一temperatureより柔軟な補正や学習法を提供した。ただしRevisiting the Calibration of Modern Neural Networks [GE36]を併読すると、Guoらの2017年のモデル群で見られた傾向を、2026年のarchitectureまで一般化できないことが分かる。
Ovadia et al. [GE39]はshift下でuncertainty法を比較する基礎文献である。sourceで校正してもtargetで校正されるとは限らない。Wald et al. [GE40]はmulti-domain calibrationと不変表現を条件付きで接続した。「一つのvalidation setでECEが小さいから、未知環境のshortcutが消えた」という主張までは支持しない。
8.4 不確実性の分解
aleatoric uncertaintyは観測やラベル生成過程に残る不確実性、epistemic uncertaintyはモデル・パラメータについての知識不足に関する不確実性である。区別は採用するモデルと情報集合に依存する。入力が珍しいことはepistemic uncertaintyを調べる契機になるが、両者は同義ではない。OODでもモデルは過信し得るし、ID領域でも有限データによりepistemic uncertaintyは残る。MC dropout [GE38]、Deep Ensembles [GE37]。
回帰では、確率分布・quantile・intervalをどの条件付き集合で校正するかまで指定する。Calibrated Regression [GE41]はこの拡張の入口になる。Bayesian posteriorを使ったという理由だけで、model misspecificationや近似推論の誤差が解消するわけではない。
Unified Uncertainty Calibration [GE83]は、epistemic uncertaintyが高ければ棄却し、それ以外を分類する単純な分岐を見直し、aleatoric/epistemic uncertaintyを共同で校正する。これは既存メモの二種類の不確実性を整理し直す直接の接続文献である。
8.5 LLM:token確率、正しさ、自己申告confidence
LLMでは「次tokenの確率」「選択肢が正解である確率」「生成文の事実性」「回答全体の成功」「答えを知っている確率」を区別する。Language Models (Mostly) Know What They Know [GE71]はP(True)とP(IK)を研究したが、新taskへの校正には限界も報告している。
Semantic Uncertainty [GE72]は異なる言い回しを意味的に集約する。semantic entropyがerror検出に役立つことと、数値が正解確率として校正されることは別である。LLMとalignmentの校正分析 [GE73]とSample Consistency [GE74]は、training段階・sampling・自己整合性の影響を追う入口である。
2026年のCaliDist [GE75]は、semantic distractorでpromptを変えたときの安定性をconfidence補正に使う。複数NLU benchmarkの結果であり、長文の全claimの真実性や任意のreasoning agentの成功確率に、そのまま移せるわけではない。LLM校正には、sampling温度・sample数・正解判定者・部分正解・abstention・task shiftを記録する必要がある。
9. Conformal prediction:coverageは校正と同じ保証ではない
conformal predictionは点予測に集合 $\Gamma(X)$ を付け、典型的には
\[P\{Y_{\mathrm{new}}\in\Gamma(X_{\mathrm{new}})\}\ge 1-\alpha\]というmarginal coverageを狙う。基本形ではcalibration例と将来例の交換可能性が重要である。「distribution-free」は任意の時系列shiftで無条件に有効という意味ではない。Angelopoulos and Bates [GE42]。
- Weighted conformal [GE43]はcovariate shiftとdensity ratioの情報を使う。推定重みの誤差まで含めた保証は、真のratioを既知とする結果と区別する。
- Adaptive conformal inference [GE44]はonlineのcoverage frequencyを調整する。長期平均の保証から、各時刻・各個人での条件付きcoverageは導けない。
- Conformal risk control [GE45]は単調lossの期待値制御へ拡張する。失敗確率、期待risk、high-probability risk上界のどれを保証するかを確認する。
- Conditional predictive inferenceの限界 [GE46]は、無仮定で有用な完全conditional coverageを要求することの難しさを明示する。
- Generalized Venn/Venn-Abers [GE47]は2025年に、set-valued calibration、multicalibration、quantile/conformalの接続を研究した。出力する候補のうち少なくとも一つが校正される保証と、任意に選んだ一つのscoreの保証を混同しない。
実験ではcoverageと同時に集合サイズ、group別coverage、時間窓別coverageを示す。極端に大きい集合でcoverageだけを達成しても、意思決定に役立つとは限らない。
10. Fairness・multicalibration・group robustness
group属性を $A$、scoreを $R$、予測を $\hat Y$ とする。
| 条件 | 数式の例 | 注意 |
|---|---|---|
| demographic parity | $\hat Y\perp A$ | prediction率の一致 |
| equalized odds | $\hat Y\perp A\mid Y$ | 真のlabelごとのerror率の一致 |
| equal opportunity | $P(\hat Y=1\mid A,Y=1)$ が一定 | TPRに限定 |
| sufficiency | $Y\perp A\mid R$ | score値自体が確率に一致するとは限らない |
| group calibration | $\mathbb E[Y\mid R=r,A=a]=r$ | group内でscoreが確率として解釈できる |
| worst-group robustness | $\min_f\max_g R_g(f)$ | 定義済みgroupのriskを改善する目的 |
Hardt et al. [GE48]、Kleinberg et al. [GE49]、Pleiss et al. [GE50]を続けて読むと、誤差の平等とscoreの意味を揃える条件が、base rateの異なる一般的状況で両立しないことが分かる。perfect predictionや同じbase rate等の例外を外さず、「公平性は数学的に不可能」と一般化しない。
Multicalibration [GE51]は、計算可能なgroupの集合を指定して、重複するsubpopulationでも校正を要求する。Reductions Approach [GE52]は、選択した公平性制約の下でerrorを下げる問題をcost-sensitive classificationへ還元する。どちらも「どのgroup・label・制約が妥当か」を自動的に決めるものではない。
Gender Shades [GE53]は交差属性での性能監査の重要性を示した。そこで観測したcommercial gender classificationの誤差差を、現在の全顔認識システムの性能や単一の原因へ一般化しない。Fairness and Machine Learning [GE54]が扱うように、ラベルの意味、意思決定の正当性、利益と負担、制度的な影響まで考える必要がある。
2025年のProxy Groups [GE55]はsensitive attributeが欠ける現実の設定を、2026年のEfficient Swap Multicalibration [GE56]はelicitable propertyとonline学習の接続を進める。後者のoracle効率やrateは、hypothesis classの複雑さとonline learnerへのアクセス条件に依存する。
Waterbirdsで背景への依存を減らすことはgroup robustnessの研究である。 それを社会的fairnessと結ぶには、人への影響とgroup定義の対応が必要になる。平均ECEの改善と少数groupでの悪化が併存し得るため、group別標本数・interval・複数指標を一緒に報告する。
11. Compositional generalization:新しい組合せを学べる条件
構成的汎化は、既知の要素を未知の組合せ・役割・深さで使う能力である。通常のrandom splitでは、必要な組合せを既に学習している可能性がある。
| benchmark・方向 | 何を変えるか | 解釈上の注意 |
|---|---|---|
| SCAN [GE57] | commandとactionの新しい組合せ | 合成言語での結果、splitごとに必要能力が違う |
| CFQ [GE58] | atomは近くcompound分布を離す | divergenceで定義した難度と自然言語能力は別 |
| COGS [GE59] | 語彙・構文役割・構造の再結合 | lexicalとstructuralを別に報告 |
| ReCOGS [GE60] | logical formの非意味的要因を調整 | 表記一致と意味的一致の差 |
| Meta-learning for compositionality [GE61] | compositionalなepisodeを学習 | meta-trainingの帰納biasと人間の全能力は区別 |
SCANの失敗は「ニューラルネットは原理的に構成性を持てない」という証明ではない。2023年のLakeとBaroniのMLCは、task分布に構成性を組み込むmeta-learningで、指定された課題における人間のsystematicityと柔軟性へ近づいた。一方、ReCOGSは評価側のlogical formの選択だけでも結論が変わり得ることを示す。[GE60–61]。
2025年のDistinguishing fair from unfair compositional generalization tasks [GE62]は、training dataがtestで期待する規則を一意に支持しているかを問う。ここでのfair/unfairはtaskの学習可能性の議論であり、前節の社会的fairnessとは別の用語である。複数の規則が同じtraining dataに整合するなら、特定のtest規則に従わなかったことだけで能力不足とは結論できない。
2026年のRule-Generation Perspective [GE63]は、LLMにmappingの規則をprogramとして生成させて評価する。pretrainingによる組合せの漏れが見えにくい状況で、最終accuracy以外の観察を増やす方向である。
Linear, Orthogonal Representations [GE64]は表現幾何に必要条件を与える。ただし確認したv1のProposition 1は、linear heads、GDとcross-entropy、binary concept grid、training-supportの条件、divisibility・transferability・stabilityを前提とする。任意のLLMの任意の構成的推論に、全概念の直交性が必要だという定理ではない。
Learning to Reason with Curriculum II [GE65]はsemiautomataの逐次計算を小部分へ分解するcurriculumを解析する。SFT型では途中状態のfeedback、RLVR型ではreference modelのcoverageとverifierを仮定する。abstractで述べられた標本複雑性の改善を、一般のCoT promptingの保証へ拡張しない。調査時点ではpreprintとして扱う。
残る重要課題は、長さ外挿、構造外挿、役割交換、未観測要素、既知要素の再結合を分離すること、正解規則の同定可能性とpretraining contaminationを測ること、意味的な部分誤りを診断することである。
12. 情報量規準:何の汎化誤差を推定しているか
対数尤度を $\ell_n(\theta)=\sum_{i=1}^{n}\log p_\theta(Z_i)$ とすると、代表的なAICは
\[\mathrm{AIC}=-2\ell_n(\hat\theta)+2k.\]Akaikeの代表原典 [GE66]は、同一母集団の新標本に対する予測的な対数尤度を、training fitと複雑さの補正で評価する流れを作った。本調査ではDOI先の本文を取得できなかったため、この原典の根拠水準は書誌確認とする。
竹内啓のTIC原典 [GE67]は「情報統計量の分布とモデルの適切さの規準」、数理科学14(3)、12–18、1976年である。原文は館内限定資料で、本調査ではNDL書誌のみを確認した。以下のTICの技術的説明は、本文§4.1を確認できたThomas et al. [GE70]も根拠にする。
正則なmisspecified likelihood modelで、平均negative log likelihoodの期待Hessianを $H$、score外積の期待値を $J$ と書くと、plug-inのTICは概ね
\[\mathrm{TIC}=-2\ell_n(\hat\theta) +2\,\mathrm{tr}(\hat H^{-1}\hat J)\]となる。これは通常の正則性、十分な標本、MLE近傍、同じ評価母集団などを前提とする漸近補正である。正しく指定された正則モデルでは情報行列等式により補正がパラメータ数へ戻る。Hessianが特異なdeep networkで、逆行列を擬似逆行列やdampingへ置き換えるときは、それが元の漸近理論から何を変えたかを確認する必要がある。[GE70]。
| 規準 | 主な対象 | 深層学習・OODでの注意 |
|---|---|---|
| AIC | 正則MLEの予測対数尤度のoptimism補正 | parameter数だけでは特異性を捉えない |
| TIC | misspecifiedな正則MLEの補正 | Hessianとscore外積を混同しない |
| WAIC | posterior predictiveのBayesian評価 | posteriorの計算と理論条件が必要 |
| PSIS-LOO | leave-one-out predictive performanceの近似 | importance weight診断、影響点、有限標本 |
| target重み付きCV | 指定したcovariate-shift target risk | density ratio・supportの仮定が必要 |
Watanabe [GE68]は特異学習理論でBayes CVとWAICの漸近同値を示す。Vehtari et al. [GE69]はPSIS-LOOとWAICの実用計算・有限標本の安定性を比較した。これらのBayesianな対象を、SGDで求めた単一networkのAIC/TICと無条件に同一視しない。
TICのmodel misspecificationとdistribution shiftは違う。前者は同一の真の分布がモデル族の外にある状況、後者はtrainingとtargetの分布自体の差である。sourceだけで推定したTICを任意targetのriskとして解釈する根拠はない。 covariate shiftを仮定するならimportance-weighted CV [GE01]等と比較し、何を推定するかを先に定義する。
PAC-Bayes型の上界、algorithmic stabilityによる汎化解析、AIC/TICの期待optimism推定、domain adaptationの分布間境界は異なる種類の主張である。本章はIC/TICとOOD評価の接続を扱い、PAC-Bayes/stabilityの文献体系全体は対象外とする。
13. 既存研究関心に接続する実験設計
以下は本サーベイから導く研究案であり、既存プロジェクトで実施済みの実験・成果を表さない。
| 研究関心 | 最初に固定する問い | 最小限の比較・記録 |
|---|---|---|
| optimizer × OOD generalization | optimizerの差は同じ選択予算で残るか | ERM/強い事前学習baseline、architecture、同じ探索予算、source-only選択 |
| optimizer × corruption | 自然なshiftでも順位は保たれるか | ImageNet-C系とWILDS等を分離、clean accuracyも併記 |
| calibration × shift | sourceでの改善がtargetのどのgroupまで届くか | ECE/Brier/NLL、classwise/groupwise、shift強度、recalibration用ラベル |
| FIM × shift | 何の期待値で定義した行列が性能と関連するか | true/model Fisher、empirical外積、centered covariance、Hessianを区別 |
| LogitNorm | detectionとcalibrationの改善は一致するか | 同じcheckpointでAUROC/FPR、ECE/NLL、near/far OODを別測定 |
| TIC | source optimismかtarget riskか | 明示した推定対象、damping感度、sample size、CVとの比較 |
評価を再利用する際には、①splitの生成過程、②選択に使ったlabel、③pretrainingの出所、④複数seedと区間、⑤group/domain別結果、⑥推論時コストを記録する。FisherとHessianの詳細は総合索引の数理・力学編と併読するとよい。
14. 重要文献を読む順序と未解決問題
| 目的 | 読む順序 | 読みながら確認する点 |
|---|---|---|
| shiftの基礎 | GE01 → GE02 → GE03 → GE09 | 何の分布因子が不変か |
| DGの設計 | GE05 → GE06/GE07 → GE08 → GE11 → GE12/GE76/GE77 | 原理、評価、事前学習の貢献を分ける |
| TTA | GE14 → GE15/GE16 → GE17 → GE18 → GE80 | stream・忘却・未知classの条件 |
| OOD detection | GE20 → GE21/GE22 → GE23/GE24 → GE25/GE26 → GE79 | OOD定義、補助data、scoreとtrainingの相互作用 |
| 校正と評価 | GE28/GE29 → GE30/GE32 → GE33 → GE36/GE39/GE40 | 校正、sharpness、予測性能を別に測る |
| conformal | GE42 → GE46 → GE43/GE44 → GE45/GE47 | marginal/conditional、exchangeability、出力形式 |
| fairness | GE54 → GE48 → GE49/GE50 → GE51/GE52 → GE55/GE56 | 規範的な選択と統計保証の違い |
| 構成的汎化 | GE57 → GE58/GE59 → GE60/GE61 → GE62 → GE63/GE64/GE65 | 規則がtrainingから識別できるか |
| 情報量規準 | GE66/GE67(原典)→ GE70 → GE68/GE69 | 漸近・特異性・推定対象・targetの違い |
| LLM confidence | GE71 → GE72 → GE73/GE74 → GE75 | token/claim/task successのどれを確率化するか |
分野横断で残る問題は、source上の観測だけでどこまでtargetの失敗を予測できるか、複合shiftで適応と棄却をどう協調させるか、少数groupの校正を限られたラベルでどう測るか、pretrainingが非公開でも構成的汎化をどう検証するか、という点に集約される。これらは同じbenchmarkの平均値を改善するだけでは解決しない。
15. 調査の到達点と不足
2026年の追加確認は、COLTのmulticalibration、ICMLのCaliDistと構成的表現、ACLの規則生成評価、WACVのtraining recipeとOOD、CVPRのopen-set continual TTA、ECCV採択表示のDG、および複数の2026年arXiv preprintまで到達した。一次書誌での最も新しい採用初出は2026年7月2日のGE76であり、2026年9月投稿の候補も検索・書誌確認したが、重要性と仮定を評価しきれないため主文献へ追加しなかった。これは9月以降に重要論文がないという意味ではない。
未充足なのは、全会議・全ジャーナル・全preprintの網羅、論文間の全引用追跡、全件全文精読、graph/time-series/medical分野の個別適用論文の体系化、open-vocabulary detectionやselective classification全体の独立レビュー、社会制度としてのfairnessの包括的レビュー、PAC-Bayes/stability理論全体である。重要surveyへの入口も参考文献に含めたが、そのsurveyが引用する全論文を本章で検証したとはみなさない。
根拠水準は次のとおり。
- 本文該当節確認:primary paperの本文で定義・仮定・結果の関係を確認。全文読了や独立再現を意味しない。JSONではfull-text。
- abstract確認:arXiv、出版社、会議録の一次abstractと書誌を確認。論文が報告する結果として要約する。
- 書誌確認:題名・著者・出版を確認し、技術的結論の単独根拠にはしない。
- 一次資料確認:著者・出版社による書籍等の公式resourceを確認。
16. 既存引用の追加調査
元の一般化トピック7ページから抽出された、初回台帳と未照合だった70 URLを追加で調べた。arXivのPDF/abstract、正式proceedings、著者のデータセットページ、所属機関書誌を突き合わせ、既存文献の別URLと新規文献を区別した。新規61件を[GE087]–[GE147]に収録する。これは61件を全文精読したという意味ではなく、基本は要旨確認で、書籍・一部資料は書誌または公式説明の確認にとどまる。取得できなかった元URLと、別公開版によって内容を確認できた文献は、検索ログで区別している。
16.1 引用の訂正と公開状況
- 元メモで「When is invariance useful …」と表示された
arXiv:2004.06100のリンク先は、実際には Pretrained Transformers Improve Out-of-Distribution Robustness [GE106]。表示された題名に対応するのは When is invariance useful in an Out-of-Distribution Generalization problem ? [GE129](arXiv:2008.01883)である。リンク先と表示題名の両方を別々の文献として確認した。 - 「Predicting Unreliable Predictions by Shattering a Neural Network」のリンク先
arXiv:2106.08365は、現在 Test Sample Accuracy Scales with Training Sample Density in Neural Networks [GE097] として公開されている。Head2Toeも現行題名は Head2Toe: Utilizing Intermediate Representations for Better Transfer Learning [GE126] であり、ターゲットのラベルを使うtransfer learningの評価を、未観測ドメインへのラベルなし汎化と混同しない。 - GENIE [GE135] はarXiv登録が2026年6月でも、正式proceedingsはICML 2025である。初出年を2025とし、2026年の新規成果には数えない。
- Auto Arborist [GE146] は重要な地理的shiftの原典だが、著者の公式ページは2025年5月27日に配布を停止し、現在提供できないと明記する。論文の存在とデータの現在の入手可能性は別である。
16.2 研究の流れを補う文献群
問題設定から因果・不変性へ。 Dataset Shift in Machine Learning [GE138] は概念整理の編集書で、Vector Instituteの技術報告 [GE139] は実務上の横断データ・時系列・画像の事例を補う。Arjovskyの博士論文 [GE094]、Surgery Estimator [GE092]、医用画像における因果分析 [GE131] は、何が変化し何が保存されるかという仮定を明示する流れにある。expansion functionによる理論 [GE089]と不変予測器の最適性条件 [GE129]は、訓練環境での不変性だけから任意の未知環境の成功を導けない点を補う。情報理論からのshift分析 [GE095]も、補正対象と生成過程に合わせて目的関数・モデル選択を決める必要を強調する。
特徴、部分ネットワーク、損失、更新規則。 歴史的にはUnbiased Metric Learning [GE145]、Multi-Task Autoencoder [GE110]のような表現学習から、Modular Risk Minimization [GE096]のsubnetwork選択、DIFEX [GE124]の特徴不変性、implicit gradientによる損失学習 [GE142]へ設計対象が広がった。GSNRに基づくdropout [GE132]は高GSNRのパラメータを除いて依存を弱め、GENIE [GE135]は更新寄与の偏りを調整する。これらは異なる介入なので、同じ指標が同じ機構を表すとまとめない。
事前学習・fine-tuning・圧縮の比較。 fine-tuningの時間的分析 [GE088]は途中checkpointと収束時のeffective robustnessの差を示し、ViTの頑健性分析 [GE105]とNLP Transformerの分析 [GE106]はarchitectureの効果を事前学習データから切り離せないことを示唆する。CARDs [GE108]は圧縮と頑健性の両立を調べる。Fine-Grained Analysis [GE122]とMany Faces of Robustness [GE136]は、あるshiftでの成功を地理・style・相関変化すべてへ外挿しないための比較資料である。ID/OOD評価の分析 [GE104]も、IDの順位だけで配備時の順位を決める問題を取り上げる。
捷径・ラベルノイズ・概念への介入。 画像背景の分離実験 [GE100]、texture–shape cue conflict [GE114]、simplicity biasの構成例 [GE109]を並べると、容易な相関への依存は特徴学習と評価splitの双方に関わることが分かる。shape-biased自己教師あり学習 [GE103]とConcept Bottleneck Models [GE115]はそれぞれ異なる介入で、後者は概念注釈とテスト時の概念修正という追加情報を使う。Symmetric Cross Entropy [GE098]とarchitectureとnoisy labelsの分析 [GE128]は訓練ラベル汚染を扱い、spurious correlationとOOD検出の分析 [GE101]は未知入力の棄却を扱う。これらの「robustness」は同じ目的変数ではない。
校正・リスクの再重み付け・モデル選択。 multicalibrationの標本複雑性 [GE091]は群ごとの校正評価に必要な標本数を、intra order-preserving calibration [GE093]はtop-k順位を保存する校正関数を調べる。ID-calibrated ensembles [GE137]の理論ではOOD側でspurious featureの相関が逆転しないという条件があり、ID校正から一般のOOD改善が自動的に従うわけではない。Uncertainty Baselines [GE107]は再現可能な比較実装を補う。TERM [GE123]とonline DRO [GE141]はリスクの集約方法を変えるが、NIST SP 1270 [GE140]の制度・人間・統計的biasをすべて解消する公平性保証ではない。周辺尤度によるモデル選択 [GE090]はLaplace/Gauss–Newton近似に基づくBayesianな選択法で、§12のTICによる予測リスク補正とは区別する。
ラベルなし性能推定と安定性。 表現空間の局所密度 [GE097]、変換近傍での不変性 [GE127]、Fisher関連量・entropy・MMD [GE143]は、それぞれ性能予測に使う量を変える。disagreement推定への再検討 [GE125]は、未知環境でensemble calibrationが成立するかをラベルなしでは容易に検証できないと指摘する。Riemannian contractionとalgorithmic stability [GE130]は別種の理論であり、共通分布からの標本に対する安定性を任意の分布変化への保証と読み替えない。
敵対的摂動の頑健性。 adaptive optimizerの反例 [GE102]、精度と頑健性の両立条件 [GE144]、RealSafeの評価 [GE134]は、摂動集合・データの分離・攻撃設定を指定して読む。自然な地理的shiftや意味的unknownの検出へ、そのまま同じ結論を適用しない。
16.3 データセット引用を評価条件へ戻す
| 原典・ベンチマーク | 主な評価対象と比較時の注意 |
|---|---|
| VisDA [GE087] | synthetic-to-realのUDA。ラベルなしtarget利用の有無を記録する。 |
| PACS [GE111] | 写真・絵・漫画・sketchをまたぐDG。訓練・検証・hold-out domainを分ける。 |
| Terra Incognita [GE112] | camera-trapの未知設置場所。背景の共有を許すsplitと分ける。 |
| DomainNet [GE113] | 原典はmulti-source UDA。DGへ再利用する際はtargetの扱いを変更する。 |
| Office-Home [GE133] | 原典はUDAのdeep hashing。データセットが同じでもUDA/DGは異なる課題。 |
| Adaptiope [GE147] | UDAベンチマーク。今回は所属機関書誌のみ確認し、性能比較の根拠には使わない。 |
| Auto Arborist [GE146] | 地理的shift・long-tail・複数視点。公式配布は停止済み。 |
| ImageNet-Vid-Robust / YTBB-Robust [GE116] | 知覚的に近い動画フレーム間の自然摂動。長期の時間的driftと同一ではない。 |
| Meta-Dataset [GE117] | 少数ラベルでの異種タスク適応。episodeとラベル予算を明示する。 |
| VTAB [GE118]とHead2Toe [GE126] | ラベルありtransferを測る。zero-shotやtarget不使用のDGと分ける。 |
| VQA-CP [GE119] | 質問型ごとの回答priorを変更し、画像への接地を評価する。 |
| ANLI [GE120] | 人とモデルによる反復的な難例収集。静的なIID testともノルム制約攻撃とも異なる。 |
| ImageNet-A / ImageNet-O [GE121] | 前者は難しい既知クラスの分類、後者はOOD検出。指標と母集団を分ける。 |
Adaptive Risk Minimization [GE099]は、訓練domainを使ってテスト時適応そのものを学ぶため、上のデータセット名に加えて、テスト点を何件まとめて利用し、どのパラメータを更新するかも比較条件になる。資料数を増やすだけでなく、同じ利用可能情報・split・検証予算で比較できる文献群を組むことが、追加引用の研究上の役割である。
参考文献(147件)
各項のURLは一次論文・正式会議録・出版社・原典書誌を優先する。著者数が多い一部はet al.と省略した。確認日は全件2026-10-03。
-
[GE01] Masashi Sugiyama, Matthias Krauledat, Klaus-Robert Müller. 2007. Covariate Shift Adaptation by Importance Weighted Cross Validation. JMLR 2007。共変量シフトでの重み付きCV。条件付き分布不変とsupportが必要。 根拠:abstract確認。
-
[GE02] Zachary C. Lipton, Yu-Xiang Wang, Alexander J. Smola. 2018. Detecting and Correcting for Label Shift with Black Box Predictors. ICML 2018。BBSE。本文§3–4のlabel shift・support・混同行列可逆性を確認。 根拠:本文該当節確認。
-
[GE03] Shai Ben-David, John Blitzer, Koby Crammer, Alex Kulesza, Fernando Pereira, Jennifer Wortman Vaughan. 2009. A theory of learning from different domains. online 2009; Machine Learning 2010。source誤差、domain divergence、共通予測可能性によるDA理論。 根拠:abstract確認。
-
[GE04] Yaroslav Ganin, Evgeniya Ustinova, Hana Ajakan, Pascal Germain, Hugo Larochelle, François Laviolette, Mario Marchand, Victor Lempitsky. 2015. Domain-Adversarial Training of Neural Networks. arXiv 2015; JMLR 2016。DANN。sourceラベルとunlabeled targetを使うDA。 根拠:abstract確認。
-
[GE05] Martin Arjovsky, Léon Bottou, Ishaan Gulrajani, David Lopez-Paz. 2019. Invariant Risk Minimization. arXiv preprint。環境間で共通の最適分類器を持つ表現という目標。 根拠:abstract確認。
-
[GE06] David Krueger, Ethan Caballero, Joern-Henrik Jacobsen, Amy Zhang, Jonathan Binas, Dinghuai Zhang, Remi Le Priol, Aaron Courville. 2020. Out-of-Distribution Generalization via Risk Extrapolation (REx). arXiv 2020; ICML 2021。環境ごとのrisk分散を抑制するV-REx。 根拠:abstract確認。
-
[GE07] Shiori Sagawa, Pang Wei Koh, Tatsunori B. Hashimoto, Percy Liang. 2019. Distributionally Robust Neural Networks for Group Shifts: On the Importance of Regularization for Worst-Case Generalization. arXiv 2019; ICLR 2020。group DROと正則化・early stoppingの重要性。 根拠:abstract確認。
-
[GE08] Ishaan Gulrajani, David Lopez-Paz. 2020. In Search of Lost Domain Generalization. arXiv 2020; ICLR 2021。DomainBed。model selectionを含めた統一評価。 根拠:abstract確認。
-
[GE09] Pang Wei Koh, Shiori Sagawa, et al.. 2020. WILDS: A Benchmark of in-the-Wild Distribution Shifts. arXiv 2020; ICML 2021。病院・時刻・地域等の自然なシフトを標準化。 根拠:abstract確認。
-
[GE10] Dan Hendrycks, Thomas Dietterich. 2019. Benchmarking Neural Network Robustness to Common Corruptions and Perturbations. ICLR 2019。ImageNet-C/P。通常のcorruptionとadversarial perturbationを分ける。 根拠:abstract確認。
-
[GE11] Alexandre Rame, Corentin Dancette, Matthieu Cord. 2021. Fishr: Invariant Gradient Variances for Out-of-Distribution Generalization. arXiv 2021; ICML 2022。本文§3.2の勾配分散とFisher/Hessianの条件付き関係を確認。 根拠:本文該当節確認。
-
[GE12] Mitchell Wortsman, Gabriel Ilharco, et al.. 2021. Robust fine-tuning of zero-shot models. arXiv 2021; CVPR 2022。WiSE-FT。zero-shotとfine-tunedの重みを補間。 根拠:abstract確認。
-
[GE13] Mitchell Wortsman, Gabriel Ilharco, et al.. 2022. Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time. ICML 2022。同じ事前学習モデルからの重み平均による精度・頑健性改善。 根拠:abstract確認。
-
[GE14] Dequan Wang, Evan Shelhamer, Shaoteng Liu, Bruno Olshausen, Trevor Darrell. 2020. Tent: Fully Test-time Adaptation by Entropy Minimization. arXiv 2020; ICLR 2021。test entropyを最小化しnormalizationパラメータを更新。 根拠:abstract確認。
-
[GE15] Qin Wang, Olga Fink, Luc Van Gool, Dengxin Dai. 2022. Continual Test-Time Domain Adaptation. CVPR 2022。CoTTA。誤差蓄積と忘却に対応する継続適応。 根拠:abstract確認。
-
[GE16] Shuaicheng Niu, Jiaxiang Wu, Yifan Zhang, Yaofo Chen, Shijian Zheng, Peilin Zhao, Mingkui Tan. 2022. Efficient Test-Time Model Adaptation without Forgetting. ICML 2022。EATA。sample選択とFisher正則化。 根拠:abstract確認。
-
[GE17] Shuaicheng Niu, Jiaxiang Wu, Yifan Zhang, Zhiquan Wen, Yaofo Chen, Peilin Zhao, Mingkui Tan. 2023. Towards Stable Test-Time Adaptation in Dynamic Wild World. ICLR 2023。SAR。batch size、混合シフト、label imbalanceによる崩壊を検討。 根拠:abstract確認。
-
[GE18] Hao Zhao, Yuejiang Liu, Alexandre Alahi, Tao Lin. 2023. On Pitfalls of Test-Time Adaptation. ICML 2023。TTAB。モデル選択・事前学習品質・shift種類の影響。 根拠:abstract確認。
-
[GE19] Zehao Xiao, Cees G. M. Snoek. 2024. Beyond Model Adaptation at Test Time: A Survey. arXiv preprint。model/inference/normalization/sample/promptという整理を提供。 根拠:abstract確認。
-
[GE20] Dan Hendrycks, Kevin Gimpel. 2016. A Baseline for Detecting Misclassified and Out-of-Distribution Examples in Neural Networks. arXiv 2016; ICLR 2017。最大softmax確率による検出baseline。 根拠:abstract確認。
-
[GE21] Shiyu Liang, Yixuan Li, R. Srikant. 2017. Enhancing The Reliability of Out-of-distribution Image Detection in Neural Networks. arXiv 2017; ICLR 2018。ODIN。temperatureと入力摂動。 根拠:abstract確認。
-
[GE22] Dan Hendrycks, Mantas Mazeika, Thomas Dietterich. 2018. Deep Anomaly Detection with Outlier Exposure. arXiv 2018; ICLR 2019。補助outlier dataによる検出器の訓練。 根拠:abstract確認。
-
[GE23] Weitang Liu, Xiaoyun Wang, John D. Owens, Yixuan Li. 2020. Energy-based Out-of-distribution Detection. NeurIPS 2020。log-sum-exp energyを用いたスコアと学習。 根拠:abstract確認。
-
[GE24] Hongxin Wei, Renchunzi Xie, Hao Cheng, Lei Feng, Bo An, Yixuan Li. 2022. Mitigating Neural Network Overconfidence with Logit Normalization. ICML 2022。LogitNorm。logit normの学習上の影響を分離。 根拠:abstract確認。
-
[GE25] Jingkang Yang, Pengyun Wang, et al.. 2022. OpenOOD: Benchmarking Generalized Out-of-Distribution Detection. NeurIPS 2022 Datasets and Benchmarks。OOD detectionの統一benchmark。 根拠:abstract確認。
-
[GE26] Jingyang Zhang, Jingkang Yang, et al.. 2023. OpenOOD v1.5: Enhanced Benchmark for Out-of-Distribution Detection. DMLR採択表示(arXiv v5, 2024-12-16)。ImageNet、foundation model、semantic/covariate同時シフトへ拡張。 根拠:abstract確認。
-
[GE27] Jingkang Yang, Kaiyang Zhou, Yixuan Li, Ziwei Liu. 2021. Generalized Out-of-Distribution Detection: A Survey. arXiv survey(2024改訂版確認)。anomaly/novelty/open-set/OOD/outlierのtaxonomy。 根拠:abstract確認。
-
[GE28] Chuan Guo, Geoff Pleiss, Yu Sun, Kilian Q. Weinberger. 2017. On Calibration of Modern Neural Networks. ICML 2017。本文§2のECE定義・NLLとtemperature scalingの位置付け。 根拠:本文該当節確認。
-
[GE29] Tilmann Gneiting, Adrian E. Raftery. 2007. Strictly Proper Scoring Rules, Prediction, and Estimation. JASA 2007。確率予測のproper scoring ruleを整理。 根拠:abstract確認。
-
[GE30] Jeremy Nixon, Mike Dusenberry, Ghassen Jerfel, Timothy Nguyen, Jeremiah Liu, Linchuan Zhang, Dustin Tran. 2019. Measuring Calibration in Deep Learning. arXiv preprint(2020改訂)。SCE/ACE等、校正測定の設計依存性。 根拠:abstract確認。
-
[GE31] Aviral Kumar, Sunita Sarawagi, Ujjwal Jain. 2018. Trainable Calibration Measures for Neural Networks from Kernel Mean Embeddings. ICML 2018。kernel mean embeddingに基づくMMCE。 根拠:abstract確認。
-
[GE32] Ananya Kumar, Percy Liang, Tengyu Ma. 2019. Verified Uncertainty Calibration. NeurIPS 2019。scaling-binning、有限標本推定の信頼性。 根拠:abstract確認。
-
[GE33] Jarosław Błasiok, Parikshit Gopalan, Lunjia Hu, Preetum Nakkiran. 2022. A Unifying Theory of Distance from Calibration. arXiv 2022; STOC 2023。本文のECE連続性・推定可能性とconsistent calibration measureを確認。 根拠:本文該当節確認。
-
[GE34] Meelis Kull, Miquel Perello-Nieto, Markus Kängsepp, Telmo Silva Filho, Hao Song, Peter Flach. 2019. Beyond temperature scaling: Obtaining well-calibrated multiclass probabilities with Dirichlet calibration. NeurIPS 2019。多クラス確率のDirichlet calibration。 根拠:abstract確認。
-
[GE35] Jishnu Mukhoti, Viveka Kulharia, Amartya Sanyal, Stuart Golodetz, Philip H. S. Torr, Puneet K. Dokania. 2020. Calibrating Deep Neural Networks using Focal Loss. NeurIPS 2020。学習時lossから校正改善を検討。 根拠:abstract確認。
-
[GE36] Matthias Minderer, Josip Djolonga, Rob Romijnders, Frances Hubis, Xiaohua Zhai, Neil Houlsby, Dustin Tran, Mario Lucic. 2021. Revisiting the Calibration of Modern Neural Networks. NeurIPS 2021。モデル世代・architectureで校正傾向を再評価。 根拠:abstract確認。
-
[GE37] Balaji Lakshminarayanan, Alexander Pritzel, Charles Blundell. 2016. Simple and Scalable Predictive Uncertainty Estimation using Deep Ensembles. arXiv 2016; NeurIPS 2017。独立訓練ensembleによる予測不確実性。 根拠:abstract確認。
-
[GE38] Yarin Gal, Zoubin Ghahramani. 2015. Dropout as a Bayesian Approximation: Representing Model Uncertainty in Deep Learning. arXiv 2015; ICML 2016。MC dropoutと近似Bayes推論の接続。 根拠:abstract確認。
-
[GE39] Yaniv Ovadia, Emily Fertig, Jie Ren, Zachary Nado, D Sculley, Sebastian Nowozin, Joshua V. Dillon, Balaji Lakshminarayanan, Jasper Snoek. 2019. Can You Trust Your Model’s Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift. NeurIPS 2019。dataset shift下でのuncertainty手法の比較。 根拠:abstract確認。
-
[GE40] Yoav Wald, Amir Feder, Daniel Greenfeld, Uri Shalit. 2021. On Calibration and Out-of-domain Generalization. NeurIPS 2021。multi-domain calibrationと不変性の条件付き接続。 根拠:abstract確認。
-
[GE41] Volodymyr Kuleshov, Nathan Fenner, Stefano Ermon. 2018. Accurate Uncertainties for Deep Learning Using Calibrated Regression. ICML 2018。回帰の予測分布を校正する拡張。 根拠:abstract確認。
-
[GE42] Anastasios N. Angelopoulos, Stephen Bates. 2021. A Gentle Introduction to Conformal Prediction and Distribution-Free Uncertainty Quantification. arXiv tutorial。conformal predictionの入門と応用。 根拠:abstract確認。
-
[GE43] Ryan J. Tibshirani, Rina Foygel Barber, Emmanuel J. Candès, Aaditya Ramdas. 2019. Conformal Prediction Under Covariate Shift. NeurIPS 2019。density ratioを用いるweighted conformal。 根拠:abstract確認。
-
[GE44] Isaac Gibbs, Emmanuel Candès. 2021. Adaptive Conformal Inference Under Distribution Shift. NeurIPS 2021。時変分布に対する長期coverage frequency。 根拠:abstract確認。
-
[GE45] Anastasios N. Angelopoulos, Stephen Bates, Adam Fisch, Lihua Lei, Tal Schuster. 2022. Conformal Risk Control. arXiv 2022; ICLR 2024。単調lossの期待riskを制御する拡張。 根拠:abstract確認。
-
[GE46] Rina Foygel Barber, Emmanuel J. Candès, Aaditya Ramdas, Ryan J. Tibshirani. 2019. The limits of distribution-free conditional predictive inference. arXiv 2019; Information and Inference 2021。分布自由なconditional coverageの不可能性と緩和。 根拠:abstract確認。
-
[GE47] Lars Van Der Laan, Ahmed Alaa. 2025. Generalized Venn and Venn-Abers Calibration with Applications in Conformal Prediction. ICML 2025。set-valued calibrationとconformalの接続。 根拠:abstract確認。
-
[GE48] Moritz Hardt, Eric Price, Nathan Srebro. 2016. Equality of Opportunity in Supervised Learning. NeurIPS 2016。equalized odds/opportunityとpost-processing。 根拠:abstract確認。
-
[GE49] Jon Kleinberg, Sendhil Mullainathan, Manish Raghavan. 2016. Inherent Trade-Offs in the Fair Determination of Risk Scores. arXiv 2016; ITCS 2017。異なる公平性条件の一般的非両立性。 根拠:abstract確認。
-
[GE50] Geoff Pleiss, Manish Raghavan, Felix Wu, Jon Kleinberg, Kilian Q. Weinberger. 2017. On Fairness and Calibration. NeurIPS 2017。校正とgroup間のerror制約の緊張。 根拠:abstract確認。
-
[GE51] Úrsula Hébert-Johnson, Michael P. Kim, Omer Reingold, Guy N. Rothblum. 2017. Multicalibration: Calibration for the (Computationally-Identifiable) Masses. arXiv 2017(旧題); ICML 2018。重複する計算可能なsubgroup群での校正。 根拠:abstract確認。
-
[GE52] Alekh Agarwal, Alina Beygelzimer, Miroslav Dudík, John Langford, Hanna Wallach. 2018. A Reductions Approach to Fair Classification. ICML 2018。公平性制約問題をcost-sensitive分類へ還元。 根拠:abstract確認。
-
[GE53] Joy Buolamwini, Timnit Gebru. 2018. Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification. FAT* 2018。交差属性を含む誤差監査の代表研究。 根拠:abstract確認。
-
[GE54] Solon Barocas, Moritz Hardt, Arvind Narayanan. 2023. Fairness and Machine Learning: Limitations and Opportunities. MIT Press 2023(書籍版)。技術指標と規範・制度・社会的文脈を結ぶ。 根拠:一次資料確認。
-
[GE55] Beepul Bharti, Mary Versa Clemens-Sewall, Paul Yi, Jeremias Sulam. 2025. Multiaccuracy and Multicalibration via Proxy Groups. ICML 2025。sensitive groupの欠損とproxy groupの条件を研究。 根拠:abstract確認。
-
[GE56] Lunjia Hu, Haipeng Luo, Spandan Senapati, Vatsal Sharan. 2026. Efficient Swap Multicalibration of Elicitable Properties. COLT 2026。elicitable propertyに対するonline swap multicalibration。 根拠:abstract確認。
-
[GE57] Brenden M. Lake, Marco Baroni. 2017. Generalization without systematicity: On the compositional skills of sequence-to-sequence recurrent networks. arXiv 2017; ICML 2018。SCANでsystematicityと通常の汎化を分離。 根拠:abstract確認。
-
[GE58] Daniel Keysers, Nathanael Schärli, et al.. 2019. Measuring Compositional Generalization: A Comprehensive Method on Realistic Data. arXiv 2019; ICLR 2020。CFQ。atom/compound divergenceに基づくsplit。 根拠:abstract確認。
-
[GE59] Najoung Kim, Tal Linzen. 2020. COGS: A Compositional Generalization Challenge Based on Semantic Interpretation. EMNLP 2020。語彙の再結合と構造的汎化を分けるsemantic parsing。 根拠:abstract確認。
-
[GE60] Zhengxuan Wu, Christopher D. Manning, Christopher Potts. 2023. ReCOGS: How Incidental Details of a Logical Form Overshadow an Evaluation of Semantic Interpretation. TACL 2023。logical formの非意味的要因がbenchmarkに混入する問題。 根拠:abstract確認。
-
[GE61] Brenden M. Lake, Marco Baroni. 2023. Human-like systematic generalization through a meta-learning neural network. Nature 2023。本文のmeta-learning for compositionalityと行動実験節を確認。 根拠:本文該当節確認。
-
[GE62] Ahmad Jabbar, Cleo Condoravdi, Christopher Potts. 2025. Distinguishing fair from unfair compositional generalization tasks. Findings of EMNLP 2025。学習データが正解ルールを識別できるかを吟味。 根拠:abstract確認。
-
[GE63] Ziyao Xu, Cong Wang, Houfeng Wang. 2026. Investigating More Explainable and Partition-Free Compositionality Estimation for LLMs: A Rule-Generation Perspective. ACL 2026。program/rule生成を用いたcompositionality評価。 根拠:abstract確認。
-
[GE64] Arnas Uselis, Andrea Dittadi, Seong Joon Oh. 2026. Compositional Generalization Requires Linear, Orthogonal Representations in Vision Embedding Models. ICML 2026(arXiv表示)。v1本文§3–4/Proposition 1のlinear heads・GD+CE・binary grid条件を確認。 根拠:本文該当節確認。
-
[GE65] Nived Rajaraman, Audrey Huang, Miroslav Dudik, Robert Schapire, Dylan Foster, Akshay Krishnamurthy. 2026. Learning to Reason with Curriculum II: Compositional Generalization. arXiv preprint, 2026-06-26。semiautomataとcurriculum分解における標本複雑性。 根拠:abstract確認。
-
[GE66] Hirotugu Akaike. 1974. A new look at the statistical model identification. IEEE Transactions on Automatic Control 1974。AICの代表原典。DOI先本文取得不可、著者自身の回顧と書誌で確認。 根拠:書誌確認。
-
[GE67] 竹内啓. 1976. 情報統計量の分布とモデルの適切さの規準. 数理科学 14(3), 12–18, 1976。TIC原典。国会図書館書誌のみ確認、本文未取得。 根拠:書誌確認。
-
[GE68] Sumio Watanabe. 2010. Asymptotic Equivalence of Bayes Cross Validation and Widely Applicable Information Criterion in Singular Learning Theory. JMLR 2010。特異モデルでのBayes CVとWAICの漸近同値。 根拠:abstract確認。
-
[GE69] Aki Vehtari, Andrew Gelman, Jonah Gabry. 2015. Practical Bayesian model evaluation using leave-one-out cross-validation and WAIC. arXiv 2015; Statistics and Computing 2017。PSIS-LOOとWAICの有限標本診断。 根拠:abstract確認。
-
[GE70] Valentin Thomas, Fabian Pedregosa, Bart van Merriënboer, Pierre-Antoine Mangazol, Yoshua Bengio, Nicolas Le Roux. 2019. On the interplay between noise and curvature and its effect on optimization and generalization. arXiv 2019; AISTATS 2020。本文§4.1のTICとFisher/Hessian/勾配共分散の区別を確認。 根拠:本文該当節確認。
-
[GE71] Saurav Kadavath, Tom Conerly, et al.. 2022. Language Models (Mostly) Know What They Know. arXiv preprint。P(True)/P(IK)による自己評価とtask外校正の限界。 根拠:abstract確認。
-
[GE72] Lorenz Kuhn, Yarin Gal, Sebastian Farquhar. 2023. Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation. ICLR 2023。意味的同値を集約したsemantic entropy。 根拠:abstract確認。
-
[GE73] Chiwei Zhu, Benfeng Xu, Quan Wang, Yongdong Zhang, Zhendong Mao. 2023. On the Calibration of Large Language Models and Alignment. Findings of EMNLP 2023(arXiv表示)。pretraining/alignment過程を通じたLLM校正の分析。 根拠:abstract確認。
-
[GE74] Qing Lyu, Kumar Shridhar, Chaitanya Malaviya, Li Zhang, Yanai Elazar, Niket Tandon, Marianna Apidianaki, Mrinmaya Sachan, Chris Callison-Burch. 2024. Calibrating Large Language Models with Sample Consistency. AAAI 2024(arXiv v2表示、2026-02-23改訂)。複数sampleの整合性をconfidenceに変換。 根拠:abstract確認。
-
[GE75] Mohammad Anas Jawad, Cornelia Caragea. 2026. CaliDist: Calibrating Large Language Models via Behavioral Robustness to Distraction. ICML 2026。semantic distractorへの応答安定性を用いたpost-hoc calibration。 根拠:abstract確認。
-
[GE76] Eunyi Lyou, Yunjeong Choi, Junho Lee, Joonseok Lee. 2026. Domain Generalization via Text-Anchored Information Bottleneck. ECCV 2026採択(arXiv表示), 2026-07-02。言語埋め込みをDGの不変性の教師信号にする。 根拠:abstract確認。
-
[GE77] Tien-Hung Nguyen, Tien-Dat Tran, M.-Duong Nguyen, Kok-Seng Wong. 2026. Learning Subset-Shared Invariances for Domain Generalization with Mixture-of-Experts. arXiv preprint, 2026-06-24。全環境共通ではなくdomain部分集合で共有する不変性。 根拠:abstract確認。
-
[GE78] Sravan Danda, Aditya Challa, Shlok Mehendale, Snehanshu Saha. 2026. Matching High-Dimensional Geometric Quantiles for Test-Time Adaptation of Transformers and Convolutional Networks Alike. arXiv preprint, 2026-01-16。幾何quantile整合によるinput adapter。 根拠:abstract確認。
-
[GE79] Gerhard Krumpl, Henning Avenhaus, Horst Possegger. 2026. One Model, Many Behaviors: Training-Induced Effects on Out-of-Distribution Detection. WACV 2026, arXiv 2026-01-15。同architectureでもtraining recipeとdetectorの相互作用が大きい。 根拠:abstract確認。
-
[GE80] Yingkai Yang, Chaoqi Chen, Hui Huang. 2026. Back to Source: Open-Set Continual Test-Time Adaptation via Domain Compensation. CVPR 2026, arXiv 2026-04-23。domain shiftとunknown classesを同時に扱う継続TTA。 根拠:abstract確認。
-
[GE81] Christina Baek, Yiding Jiang, Aditi Raghunathan, Zico Kolter. 2022. Agreement-on-the-Line: Predicting the Performance of Neural Networks under Distribution Shift. NeurIPS 2022。複数モデルのID/OOD agreementからtarget accuracyを予測する経験的関係。 根拠:abstract確認。
-
[GE82] Yiding Jiang, Vaishnavh Nagarajan, Christina Baek, J. Zico Kolter. 2021. Assessing Generalization of SGD via Disagreement. arXiv 2021; ICLR 2022(公開PDF表紙で確認。掲載題名はAssessing Generalization via Disagreement)。異なるSGD run間のdisagreementとerror、ensemble calibrationの関係。 根拠:abstract確認。
-
[GE83] Kamalika Chaudhuri, David Lopez-Paz. 2023. Unified Uncertainty Calibration. arXiv preprint(2024改訂版確認)。aleatoric/epistemic uncertaintyを共同で校正する枠組み。 根拠:abstract確認。
-
[GE84] Ishaan Gulrajani, Tatsunori Hashimoto. 2022. Identifiability Conditions for Domain Adaptation. ICML 2022。bijective domain mapping、特に線形mapの識別可能性を解析。 根拠:abstract確認。
-
[GE85] Nanyang Ye, Kaican Li, Haoyue Bai, Runpeng Yu, Lanqing Hong, Fengwei Zhou, Zhenguo Li, Jun Zhu. 2021. OoD-Bench: Quantifying and Understanding Two Dimensions of Out-of-Distribution Generalization. arXiv 2021; CVPR 2022。diversity/correlation shiftによるbenchmarkと手法の分析。 根拠:abstract確認。
-
[GE86] Robert Geirhos, Jörn-Henrik Jacobsen, Claudio Michaelis, Richard Zemel, Wieland Brendel, Matthias Bethge, Felix A. Wichmann. 2020. Shortcut Learning in Deep Neural Networks. Nature Machine Intelligence 2020。標準benchmarkで通用する規則が移送に失敗するshortcutの視点。 根拠:abstract確認。
-
[GE087] Xingchao Peng, Ben Usman, Neela Kaushik, Judy Hoffman, Dequan Wang, Kate Saenko. 2017. VisDA: The Visual Domain Adaptation Challenge. arXiv preprint, 2017。VisDAのsynthetic-to-real適応。対象ドメインのラベルなしデータを使うUDAと、使わないDGの比較条件を分ける。 根拠:abstract確認。
-
[GE088] Anders Andreassen, Yasaman Bahri, Behnam Neyshabur, Rebecca Roelofs. 2021. The Evolution of Out-of-Distribution Robustness Throughout Fine-Tuning. arXiv preprint, 2021(正式掲載先未照合)。fine-tuning中のeffective robustnessが収束時に消える場合を追跡し、checkpoint選択の重要性を示す。 根拠:abstract確認。
-
[GE089] Haotian Ye, Chuanlong Xie, Tianle Cai, Ruichen Li, Zhenguo Li, Liwei Wang. 2021. Towards a Theoretical Framework of Out-of-Distribution Generalization. arXiv preprint, 2021(正式掲載先未照合)。expansion functionによって学習環境での不変性が未知環境へ拡張される条件を定量化。 根拠:abstract確認。
-
[GE090] Alexander Immer, Matthias Bauer, Vincent Fortuin, Gunnar Rätsch, Mohammad Emtiyaz Khan. 2021. Scalable Marginal Likelihood Estimation for Model Selection in Deep Learning. ICML 2021。Laplace・Gauss–Newton近似による周辺尤度推定をモデル選択に用いる。TICの頻度論的補正とは目的が異なる。 根拠:abstract確認。
-
[GE091] Eliran Shabat, Lee Cohen, Yishay Mansour. 2020. Sample Complexity of Uniform Convergence for Multicalibration. NeurIPS 2020。multicalibration誤差の一様収束と必要標本数を解析し、予測誤差と校正誤差を区別。 根拠:abstract確認。
-
[GE092] Adarsh Subbaswamy, Peter Schulam, Suchi Saria. 2018. Preventing Failures Due to Dataset Shift: Learning Predictive Models That Transport. arXiv 2018; AISTATS 2019。変化する機構に関するcausal selection diagramの知識を使うSurgery Estimator。無仮定の移送保証ではない。 根拠:abstract確認。
-
[GE093] Amir Rahimi, Amirreza Shaban, Ching-An Cheng, Richard Hartley, Byron Boots. 2020. Intra Order-preserving Functions for Calibration of Multi-Class Neural Networks. NeurIPS 2020。クラス内の順位を保存する柔軟なpost-hoc校正を構成し、top-k予測の保存と校正を両立させる。 根拠:abstract確認。
-
[GE094] Martin Arjovsky. 2021. Out of Distribution Generalization in Machine Learning. 博士論文のarXiv公開版, 2021。因果性・環境不変性・OOD汎化の前提を体系的に扱う。 根拠:abstract確認。
-
[GE095] Marco Federici, Ryota Tomioka, Patrick Forré. 2021. An Information-theoretic Approach to Distribution Shifts. arXiv preprint, 2021(正式掲載先未照合)。shiftの誤差要因とDG・fairness目的を情報理論で比較し、生成過程に応じたモデル選択を強調。 根拠:abstract確認。
-
[GE096] Dinghuai Zhang, Kartik Ahuja, Yilun Xu, Yisen Wang, Aaron Courville. 2021. Can Subnetwork Structure be the Key to Out-of-Distribution Generalization?. ICML 2021。spurious featureに依存する全体モデル内でも有用なsubnetworkを選ぶModular Risk Minimization。 根拠:abstract確認。
-
[GE097] Xu Ji, Razvan Pascanu, Devon Hjelm, Balaji Lakshminarayanan, Andrea Vedaldi. 2021. Test Sample Accuracy Scales with Training Sample Density in Neural Networks. arXiv 2021; CoLLAs 2022。表現空間の学習標本密度と誤りの関係を研究。元メモの旧題名から現行題名へ改題されている。 根拠:abstract確認。
-
[GE098] Yisen Wang, Xingjun Ma, Zaiyi Chen, Yuan Luo, Jinfeng Yi, James Bailey. 2019. Symmetric Cross Entropy for Robust Learning with Noisy Labels. ICCV 2019。Cross EntropyとReverse Cross Entropyを組み合わせたラベルノイズ学習。OOD検出やラベルシフト補正とは異なる。 根拠:abstract確認。
-
[GE099] Marvin Zhang, Henrik Marklund, Nikita Dhawan, Abhishek Gupta, Sergey Levine, Chelsea Finn. 2020. Adaptive Risk Minimization: Learning to Adapt to Domain Shift. arXiv 2020; NeurIPS 2021。訓練ドメインを用いて、ラベルなしテスト点から適応する能力を学習するARM。 根拠:abstract確認。
-
[GE100] Kai Xiao, Logan Engstrom, Andrew Ilyas, Aleksander Madry. 2020. Noise or Signal: The Role of Image Backgrounds in Object Recognition. arXiv preprint, 2020(正式掲載先未照合)。物体前景と背景を分離して背景依存を診断する。背景のみの予測力と因果的に有用な特徴を区別。 根拠:abstract確認。
-
[GE101] Yifei Ming, Hang Yin, Yixuan Li. 2021. On the Impact of Spurious Correlation for Out-of-distribution Detection. arXiv 2021; AAAI 2022。環境特徴とラベルの相関がunknown検出を悪化させる条件を分析。 根拠:abstract確認。
-
[GE102] Marc Khoury. 2019. Adaptive versus Standard Descent Methods and Robustness Against Adversarial Examples. arXiv preprint, 2019(2020改訂)。adaptive法と標準勾配法で敵対的頑健性が異なる構成例を示す。全問題・全optimizerへの優劣ではない。 根拠:abstract確認。
-
[GE103] Nader Asadi, Amir M. Sarfi, Mehrdad Hosseinzadeh, Zahra Karimpour, Mahdi Eftekhari. 2019. Towards Shape Biased Unsupervised Representation Learning for Domain Generalization. arXiv preprint, 2019(2020改訂、正式掲載先未照合)。domain diversificationとjigsawを組み合わせたshape-biased自己教師あり表現。 根拠:abstract確認。
-
[GE104] Rui Hu, Jitao Sang, Jinqiang Wang, Rui Hu, Chaoquan Jiang. 2021. Understanding and Testing Generalization of Deep Networks on Out-of-Distribution Data. arXiv preprint, 2021。marginal/conditional spurious correlationとID評価の限界を調べる。著者名はarXivとPDF表紙の表記を保持。 根拠:abstract確認。
-
[GE105] Srinadh Bhojanapalli, Ayan Chakrabarti, Daniel Glasner, Daliang Li, Thomas Unterthiner, Andreas Veit. 2021. Understanding Robustness of Transformers for Image Classification. ICCV 2021。ViTとResNetを入力・モデル摂動で比較。十分な事前学習データという条件を明示。 根拠:abstract確認。
-
[GE106] Dan Hendrycks, Xiaoyuan Liu, Eric Wallace, Adam Dziedzic, Rishabh Krishnan, Dawn Song. 2020. Pretrained Transformers Improve Out-of-Distribution Robustness. ACL 2020。NLPで事前学習Transformerの分布外汎化と検出を評価。元メモのリンクラベルは別論文を指している。 根拠:abstract確認。
-
[GE107] Zachary Nado, Neil Band, Mark Collier, Josip Djolonga, Michael W. Dusenberry, Sebastian Farquhar, Qixuan Feng, Angelos Filos, Marton Havasi, Rodolphe Jenatton, Ghassen Jerfel, Jeremiah Liu, Zelda Mariet, Jeremy Nixon, Shreyas Padhy, Jie Ren, Tim G. J. Rudner, Faris Sbahi, Yeming Wen, Florian Wenzel, Kevin Murphy, D. Sculley, Balaji Lakshminarayanan, Jasper Snoek, Yarin Gal, Dustin Tran. 2021. Uncertainty Baselines: Benchmarks for Uncertainty & Robustness in Deep Learning. arXiv preprint, 2021(2022改訂)。Uncertainty Baselinesの実装・評価基盤。方法だけでなく調整計算量や再現性を比較可能にする。 根拠:abstract確認。
-
[GE108] James Diffenderfer, Brian R. Bartoldson, Shreya Chaganti, Jize Zhang, Bhavya Kailkhura. 2021. A Winning Hand: Compressing Deep Networks Can Improve Out-Of-Distribution Robustness. arXiv preprint, 2021(正式掲載先未照合)。lottery-ticket型圧縮とテスト時ensembleによる精度・頑健性・容量の両立を検証。 根拠:abstract確認。
-
[GE109] Harshay Shah, Kaustav Tamuly, Aditi Raghunathan, Prateek Jain, Praneeth Netrapalli. 2020. The Pitfalls of Simplicity Bias in Neural Networks. NeurIPS 2020。最も単純な特徴への極端な依存がIID汎化や分布外頑健性も損ねる構成例。 根拠:abstract確認。
-
[GE110] Muhammad Ghifary, W. Bastiaan Kleijn, Mengjie Zhang, David Balduzzi. 2015. Domain Generalization for Object Recognition with Multi-task Autoencoders. ICCV 2015。Multi-Task Autoencoderによる初期のDG表現学習。ドメイン間の外観差を再構成課題に使う。 根拠:abstract確認。
-
[GE111] Da Li, Yongxin Yang, Yi-Zhe Song, Timothy M. Hospedales. 2017. Deeper, Broader and Artier Domain Generalization. ICCV 2017。photo/art/cartoon/sketchを含むPACSを導入し、写真のみのベンチマークから拡張。 根拠:abstract確認。
-
[GE112] Sara Beery, Grant van Horn, Pietro Perona. 2018. Recognition in Terra Incognita. ECCV 2018。camera-trapの設置場所をまたぐ認識を評価。ランダム分割と未知場所分割の差が核心。 根拠:abstract確認。
-
[GE113] Xingchao Peng, Qinxun Bai, Xide Xia, Zijun Huang, Kate Saenko, Bo Wang. 2018. Moment Matching for Multi-Source Domain Adaptation. arXiv 2018; ICCV 2019。DomainNetとmulti-source UDAのmoment matching。DGとして再利用する際は対象データ使用条件を変更する。 根拠:abstract確認。
-
[GE114] Robert Geirhos, Patricia Rubisch, Claudio Michaelis, Matthias Bethge, Felix A. Wichmann, Wieland Brendel. 2018. ImageNet-trained CNNs are biased towards texture; increasing shape bias improves accuracy and robustness. arXiv 2018; ICLR 2019。texture–shape cue conflictとStylized-ImageNetを用いて画像CNNの特徴依存を検証。 根拠:abstract確認。
-
[GE115] Pang Wei Koh, Thao Nguyen, Yew Siang Tang, Stephen Mussmann, Emma Pierson, Been Kim, Percy Liang. 2020. Concept Bottleneck Models. ICML 2020。人が解釈できる概念を中間変数にしてテスト時の概念修正を可能にする。概念注釈・介入が必要。 根拠:abstract確認。
-
[GE116] Vaishaal Shankar, Achal Dave, Rebecca Roelofs, Deva Ramanan, Benjamin Recht, Ludwig Schmidt. 2019. Do Image Classifiers Generalize Across Time?. arXiv preprint, 2019(正式掲載先未照合)。ImageNet-Vid-Robust/YTBB-Robustで近接動画フレームへの予測変動を測る。 根拠:abstract確認。
-
[GE117] Eleni Triantafillou, Tyler Zhu, Vincent Dumoulin, Pascal Lamblin, Utku Evci, Kelvin Xu, Ross Goroshin, Carles Gelada, Kevin Swersky, Pierre-Antoine Manzagol, Hugo Larochelle. 2019. Meta-Dataset: A Dataset of Datasets for Learning to Learn from Few Examples. arXiv 2019; ICLR 2020。異種データセットからのfew-shot episodeを評価するMeta-Dataset。通常のDGとはラベル利用条件が異なる。 根拠:abstract確認。
-
[GE118] Xiaohua Zhai, Joan Puigcerver, Alexander Kolesnikov, Pierre Ruyssen, Carlos Riquelme, Mario Lucic, Josip Djolonga, Andre Susano Pinto, Maxim Neumann, Alexey Dosovitskiy, Lucas Beyer, Olivier Bachem, Michael Tschannen, Marcin Michalski, Olivier Bousquet, Sylvain Gelly, Neil Houlsby. 2019. A Large-scale Study of Representation Learning with the Visual Task Adaptation Benchmark. arXiv preprint, 2019(2020改訂、正式掲載先未照合)。VTABは少数ラベルによる新規タスク適応を比較。architectureや調整予算の統制を重視。 根拠:abstract確認。
-
[GE119] Aishwarya Agrawal, Dhruv Batra, Devi Parikh, Aniruddha Kembhavi. 2017. Don’t Just Assume; Look and Answer: Overcoming Priors for Visual Question Answering. arXiv 2017; CVPR 2018。VQA-CPは質問型ごとの回答priorを変え、画像を見ずに言語priorへ依存する捷径を検査。 根拠:abstract確認。
-
[GE120] Yixin Nie, Adina Williams, Emily Dinan, Mohit Bansal, Jason Weston, Douwe Kiela. 2019. Adversarial NLI: A New Benchmark for Natural Language Understanding. arXiv 2019; ACL 2020。ANLIは人とモデルの反復的な敵対的データ収集による自然言語推論評価。画素ノルム制約攻撃ではない。 根拠:abstract確認。
-
[GE121] Dan Hendrycks, Kevin Zhao, Steven Basart, Jacob Steinhardt, Dawn Song. 2019. Natural Adversarial Examples. arXiv 2019; CVPR 2021。ImageNet-Aの難しい既知クラス認識とImageNet-Oの未知分布検出を分ける。 根拠:abstract確認。
-
[GE122] Olivia Wiles, Sven Gowal, Florian Stimberg, Sylvestre Alvise-Rebuffi, Ira Ktena, Krishnamurthy Dvijotham, Taylan Cemgil. 2021. A Fine-Grained Analysis on Distribution Shift. arXiv 2021; ICLR 2022。複数種類のshiftを統制比較し、事前学習・augmentationの効果と最良手法の設定依存を示す。 根拠:abstract確認。
-
[GE123] Tian Li, Ahmad Beirami, Maziar Sanjabi, Virginia Smith. 2020. Tilted Empirical Risk Minimization. arXiv 2020; ICLR 2021。tiltで大損失・小損失の重みを変え、外れ値・群間格差・クラス不均衡に対応。公平性の定義は別途必要。 根拠:abstract確認。
-
[GE124] Wang Lu, Jindong Wang, Haoliang Li, Yiqiang Chen, Xing Xie. 2022. Domain-invariant Feature Exploration for Domain Generalization. TMLR 2022。DIFEXはFourier phaseの内部不変性とdomain間correlation alignmentを組み合わせる。 根拠:abstract確認。
-
[GE125] Andreas Kirsch, Yarin Gal. 2022. A Note on “Assessing Generalization of SGD via Disagreement”. arXiv 2022; TMLR 2022(公開PDF表紙で確認)。disagreementで誤りを推定する理論はensemble calibrationに依存し、未知環境ではその検証にラベルが要ると指摘。 根拠:abstract確認。
-
[GE126] Utku Evci, Vincent Dumoulin, Hugo Larochelle, Michael C. Mozer. 2022. Head2Toe: Utilizing Intermediate Representations for Better Transfer Learning. ICML 2022。全層から特徴を選ぶHead2Toe。ターゲットラベルを使うtransferであり、純粋なDG保証ではない。 根拠:abstract確認。
-
[GE127] Nathan Ng, Neha Hulkund, Kyunghyun Cho, Marzyeh Ghassemi. 2022. Predicting Out-of-Domain Generalization with Neighborhood Invariance. arXiv 2022; TMLR 2023(公開PDF表紙で確認)。選んだ変換近傍での予測不変性とOOD性能の経験的関係。計算に正解ラベルは不要だが変換の妥当性は必要。 根拠:abstract確認。
-
[GE128] Jingling Li, Mozhi Zhang, Keyulu Xu, John P. Dickerson, Jimmy Ba. 2020. How Does a Neural Network’s Architecture Impact Its Robustness to Noisy Labels?. arXiv 2020; NeurIPS 2021。architectureとtarget/noise関数の適合を通じたラベルノイズ頑健性。表現評価に少数のclean labelを使う。 根拠:abstract確認。
-
[GE129] Masanori Koyama, Shoichiro Yamaguchi. 2020. When is invariance useful in an Out-of-Distribution Generalization problem ?. arXiv preprint, 2020(2021改訂)。不変予測器のOOD最適性に必要な条件とInter Gradient Alignment。元メモの題名に対応する正しい論文。 根拠:abstract確認。
-
[GE130] Leo Kozachkov, Patrick M. Wensing, Jean-Jacques Slotine. 2022. Generalization in Supervised Learning Through Riemannian Contraction. arXiv 2022; 発展版はGeneralization as Dynamical Robustness–The Role of Riemannian Contraction in Supervised Learning, TMLR 2023(書誌照合)。Riemannian contractionからalgorithmic stabilityを導く。IID学習の安定性を任意の分布シフト保証と読み替えない。 根拠:abstract確認。
-
[GE131] Daniel C. Castro, Ian Walker, Ben Glocker. 2019. Causality matters in medical imaging. arXiv 2019; Nature Communications 11:3673, 2020。画像・注釈・選択過程の因果関係からデータ不足と移送条件を整理。 根拠:abstract確認。
-
[GE132] Mateusz Michalkiewicz, Masoud Faraki, Xiang Yu, Manmohan Chandraker, Mahsa Baktashmotlagh. 2023. Domain Generalization Guided by Gradient Signal to Noise Ratio of Parameters. ICCV 2023。GSNRに基づくparameter dropoutと比率のmeta-learning。高GSNRを残すのでなく除く設計を提案。 根拠:abstract確認。
-
[GE133] Hemanth Venkateswara, Jose Eusebio, Shayok Chakraborty, Sethuraman Panchanathan. 2017. Deep Hashing Network for Unsupervised Domain Adaptation. CVPR 2017。Office-Homeを導入。原論文はラベルなし対象データを用いるUDAである。 根拠:abstract確認。
-
[GE134] Yinpeng Dong, Qi-An Fu, Xiao Yang, Tianyu Pang, Hang Su, Zihao Xiao, Jun Zhu. 2019. Benchmarking Adversarial Robustness. arXiv 2019; CVPR 2020掲載題名は「Benchmarking Adversarial Robustness on Image Classification」。RealSafeに対応する攻撃・防御の評価。単一の攻撃設定だけでモデル順位を決めない。 根拠:abstract確認。
-
[GE135] Sumin Cho, Dongwon Kim, Kwangsu Kim. 2025. One-Step Generalization Ratio Guided Optimization for Domain Generalization. ICML 2025; arXivへの登録は2026-06-15。GENIEはOSGRで更新寄与・勾配整合を調整。正式発表は2025であり2026年の新規成果と数えない。 根拠:abstract確認。
-
[GE136] Dan Hendrycks, Steven Basart, Norman Mu, Saurav Kadavath, Frank Wang, Evan Dorundo, Rahul Desai, Tyler Zhu, Samyak Parajuli, Mike Guo, Dawn Song, Jacob Steinhardt, Justin Gilmer. 2020. The Many Faces of Robustness: A Critical Analysis of Out-of-Distribution Generalization. arXiv 2020; ICCV 2021。複数の実分布シフトを比較し、textureへの改善が地理的shiftにも通用するとは限らないと示す。 根拠:abstract確認。
-
[GE137] Ananya Kumar, Tengyu Ma, Percy Liang, Aditi Raghunathan. 2022. Calibrated ensembles can mitigate accuracy tradeoffs under distribution shift. UAI 2022。ID上で校正した標準・robustモデルのensembleを研究。OODでspurious featureの相関が逆転しないという解析条件を明示。 根拠:abstract確認。
-
[GE138] Joaquin Quiñonero-Candela (編), Masashi Sugiyama (編), Anton Schwaighofer (編), Neil D. Lawrence (編). 2008. Dataset Shift in Machine Learning. MIT Press(出版社はhardcover発売2008-12-12、paperback2022-06-07と表示。一般的な引用年は2009)。dataset shiftの標準的編集書。出版社書誌・紹介のみ確認し、書籍全文の精読とは扱わない。 根拠:書誌確認。
-
[GE139] Mehdi Ataei, Murat Erdogdu, Sedef Akinli Kocak, Shai Ben-David, Shems Saleh. 2021. Understanding Dataset Shift and Potential Remedies. Vector Institute Industry Collaborative Project Technical Report, 2021。executive summaryと著作年を確認。横断データ・時系列・画像におけるshiftの実践的分類を提供する技術報告。 根拠:一次資料確認。
-
[GE140] Reva Schwartz, Apostol Vassilev, Kristen Greene, Lori Perine, Andrew Burt, Patrick Hall. 2022. Towards a Standard for Identifying and Managing Bias in Artificial Intelligence. NIST Special Publication 1270, March 2022。表紙・executive summary・bias分類の該当箇所を確認。制度、人、統計・計算に由来するbiasを区別する技術報告。 根拠:一次資料確認。
-
[GE141] Qi Qi, Zhishuai Guo, Yi Xu, Rong Jin, Tianbao Yang. 2021. An Online Method for A Class of Distributionally Robust Optimization with Non-convex Objectives. NeurIPS 2021。KL正則化したDROを合成最小化へ変換するonline法。PL条件の有無で計算量保証を区別。 根拠:abstract確認。
-
[GE142] Boyan Gao, Henry Gouk, Yongxin Yang, Timothy Hospedales. 2022. Loss Function Learning for Domain Generalization by Implicit Gradient. ICML 2022。implicit gradientによるloss学習をERMへ組み込み、single-source DGも評価。 根拠:abstract確認。
-
[GE143] Ramakrishna Vedantam, David Lopez-Paz, David J. Schwab. 2021. An Empirical Investigation of Domain Generalization with Empirical Risk Minimizers. NeurIPS 2021。ERMのOOD性能とFisher関連量・entropy・MMDの経験的相関を比較。相関を汎用上界と扱わない。 根拠:abstract確認。
-
[GE144] Yao-Yuan Yang, Cyrus Rashtchian, Hongyang Zhang, Ruslan Salakhutdinov, Kamalika Chaudhuri. 2020. A Closer Look at Accuracy vs. Robustness. NeurIPS 2020。データの分離と局所Lipschitz性の条件下で精度と敵対的頑健性の両立可能性を論じる。 根拠:abstract確認。
-
[GE145] Chen Fang, Ye Xu, Daniel N. Rockmore. 2013. Unbiased Metric Learning: On the Utilization of Multiple Datasets and Web Images for Softening Bias. ICCV 2013。複数の偏ったデータセットをまたぐmetric学習と、弱ラベルweb画像でのモデル選択。PDF冒頭の要旨・著者を確認。 根拠:abstract確認。
-
[GE146] Sara Beery, Guanhang Wu, Trevor Edwards, Filip Pavetic, Bo Majewski, Shreyasee Mukherjee, Stanley Chan, John Morgan, Vivek Rathod, Jonathan Huang. 2022. The Auto Arborist Dataset: A Large-Scale Benchmark for Multiview Urban Forest Monitoring Under Domain Shift. CVPR 2022(正式書誌と著者の公式データセット説明を確認。会議PDF本文未取得)。地理・long-tail・複数視点が重なる都市樹木認識。公式 https://google.github.io/auto-arborist/ は2025-05-27に配布停止と明記。 根拠:一次資料確認。
-
[GE147] Tobias Ringwald, Rainer Stiefelhagen. 2021. Adaptiope: A Modern Benchmark for Unsupervised Domain Adaptation. WACV 2021, pp.101–110; DOI:10.1109/WACV48630.2021.00015。著者所属機関KITの書誌を確認。会議PDF・要旨は未取得のため、本調査では性能やデータ規模の主張に用いない。 根拠:書誌確認。