{
  "schema_version": 1,
  "cutoff": "2026-10-03",
  "checked_on": "2026-10-03",
  "scope": "既存37研究トピックと13プロジェクトを起点に選定した一次文献・一次資料。全論文の完全列挙ではない。",
  "year_policy": "各章は確認した版の年を採用。統合yearは同一URL系列の記録年の最小値。全件の初出年を保証しない。各版の年・公刊状況はrecordsに保持。",
  "deduplication": "arXiv ID（版番号・PDF/HTML差を除去）、OpenReview ID、正規化DOI/URLと一次照合済みURL aliasによる保守的な統合。異なるURLの同一研究が残る可能性がある。",
  "entry_count": 526,
  "unique_reference_count": 512,
  "references": [
    {
      "canonical_key": "arxiv:1412.6980",
      "id": "OP001",
      "aliases": [
        "OP001"
      ],
      "title": "Adam: A Method for Stochastic Optimization",
      "authors": "Diederik P. Kingma; Jimmy Ba",
      "year": 2014,
      "url": "https://arxiv.org/abs/1412.6980",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP001",
          "key": "1412.6980",
          "title": "Adam: A Method for Stochastic Optimization",
          "authors": "Diederik P. Kingma; Jimmy Ba",
          "year": 2014,
          "url": "https://arxiv.org/abs/1412.6980",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "ICLR 2015（arXiv初出2014）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 22 Dec 2014 (v1 ), last revised 30 Jan 2017 (this version, v9)",
          "reading_note": "Adamの一次・二次モーメントとbias補正。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1804.04235",
      "id": "OP002",
      "aliases": [
        "OP002"
      ],
      "title": "Adafactor: Adaptive Learning Rates with Sublinear Memory Cost",
      "authors": "Noam Shazeer; Mitchell Stern",
      "year": 2018,
      "url": "https://arxiv.org/abs/1804.04235",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP002",
          "key": "1804.04235",
          "title": "Adafactor: Adaptive Learning Rates with Sublinear Memory Cost",
          "authors": "Noam Shazeer; Mitchell Stern",
          "year": 2018,
          "url": "https://arxiv.org/abs/1804.04235",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 11 Apr 2018",
          "reading_note": "行列の行・列統計によるoptimizer状態削減。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2302.06675",
      "id": "OP003",
      "aliases": [
        "OP003"
      ],
      "title": "Symbolic Discovery of Optimization Algorithms",
      "authors": "Xiangning Chen; Chen Liang; Da Huang; ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2302.06675",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP003",
          "key": "2302.06675",
          "title": "Symbolic Discovery of Optimization Algorithms",
          "authors": "Xiangning Chen; Chen Liang; Da Huang; ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2302.06675",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 13 Feb 2023 (v1 ), last revised 8 May 2023 (this version, v4)",
          "reading_note": "Lion、符号更新と自動探索。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1910.05446",
      "id": "OP004",
      "aliases": [
        "OP004"
      ],
      "title": "On Empirical Comparisons of Optimizers for Deep Learning",
      "authors": "Dami Choi; Christopher J. Shallue; Zachary Nado; ほか",
      "year": 2019,
      "url": "https://arxiv.org/abs/1910.05446",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP004",
          "key": "1910.05446",
          "title": "On Empirical Comparisons of Optimizers for Deep Learning",
          "authors": "Dami Choi; Christopher J. Shallue; Zachary Nado; ほか",
          "year": 2019,
          "url": "https://arxiv.org/abs/1910.05446",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 11 Oct 2019 (v1 ), last revised 16 Jun 2020 (this version, v3)",
          "reading_note": "探索空間で変わるoptimizer順位。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2306.07179",
      "id": "OP005",
      "aliases": [
        "OP005"
      ],
      "title": "Benchmarking Neural Network Training Algorithms",
      "authors": "George E. Dahl; Frank Schneider; Zachary Nado; ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2306.07179",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP005",
          "key": "2306.07179",
          "title": "Benchmarking Neural Network Training Algorithms",
          "authors": "George E. Dahl; Frank Schneider; Zachary Nado; ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2306.07179",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 12 Jun 2023 (v1 ), last revised 18 Jun 2025 (this version, v2)",
          "reading_note": "time-to-resultとtuningを含むAlgoPerf。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1802.09568",
      "id": "OP006",
      "aliases": [
        "OP006"
      ],
      "title": "Shampoo: Preconditioned Stochastic Tensor Optimization",
      "authors": "Vineet Gupta; Tomer Koren; Yoram Singer",
      "year": 2018,
      "url": "https://arxiv.org/abs/1802.09568",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP006",
          "key": "1802.09568",
          "title": "Shampoo: Preconditioned Stochastic Tensor Optimization",
          "authors": "Vineet Gupta; Tomer Koren; Yoram Singer",
          "year": 2018,
          "url": "https://arxiv.org/abs/1802.09568",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 26 Feb 2018 (v1 ), last revised 2 Mar 2018 (this version, v2)",
          "reading_note": "構造を持つgradient二次モーメント前処理の原典。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2002.09018",
      "id": "OP007",
      "aliases": [
        "OP007"
      ],
      "title": "Scalable Second Order Optimization for Deep Learning",
      "authors": "Rohan Anil; Vineet Gupta; Tomer Koren; Kevin Regan; Yoram Singer",
      "year": 2020,
      "url": "https://arxiv.org/abs/2002.09018",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP007",
          "key": "2002.09018",
          "title": "Scalable Second Order Optimization for Deep Learning",
          "authors": "Rohan Anil; Vineet Gupta; Tomer Koren; Kevin Regan; Yoram Singer",
          "year": 2020,
          "url": "https://arxiv.org/abs/2002.09018",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 20 Feb 2020 (v1 ), last revised 5 Mar 2021 (this version, v2)",
          "reading_note": "Shampooの大規模化・数値実装。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2409.11321",
      "id": "OP008",
      "aliases": [
        "OP008"
      ],
      "title": "SOAP: Improving and Stabilizing Shampoo using Adam",
      "authors": "Nikhil Vyas; Depen Morwani; Rosie Zhao; ほか",
      "year": 2024,
      "url": "https://arxiv.org/abs/2409.11321",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "OP008",
          "key": "2409.11321",
          "title": "SOAP: Improving and Stabilizing Shampoo using Adam",
          "authors": "Nikhil Vyas; Depen Morwani; Rosie Zhao; ほか",
          "year": 2024,
          "url": "https://arxiv.org/abs/2409.11321",
          "topic": "最適化",
          "evidence": "full-text",
          "publication_status": "ICLR 2025（arXiv初出2024、会議版題名末尾にfor Language Modeling）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 17 Sep 2024 (v1 ), last revised 31 Jan 2025 (this version, v2)",
          "reading_note": "固有基底でのAdam、等価性の限定条件。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2502.16982",
      "id": "OP009",
      "aliases": [
        "OP009"
      ],
      "title": "Muon is Scalable for LLM Training",
      "authors": "Jingyuan Liu; Jianlin Su; Xingcheng Yao; ほか",
      "year": 2025,
      "url": "https://arxiv.org/abs/2502.16982",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP009",
          "key": "2502.16982",
          "title": "Muon is Scalable for LLM Training",
          "authors": "Jingyuan Liu; Jianlin Su; Xingcheng Yao; ほか",
          "year": 2025,
          "url": "https://arxiv.org/abs/2502.16982",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 24 Feb 2025",
          "reading_note": "weight decayとupdate scaleによるMuon大規模化。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2505.02222",
      "id": "OP010",
      "aliases": [
        "OP010"
      ],
      "title": "Practical Efficiency of Muon for Pretraining",
      "authors": "Essential AI : Ishaan Shah; Anthony M. Polloreno; Karl Stratos; ほか",
      "year": 2025,
      "url": "https://arxiv.org/abs/2505.02222",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP010",
          "key": "2505.02222",
          "title": "Practical Efficiency of Muon for Pretraining",
          "authors": "Essential AI : Ishaan Shah; Anthony M. Polloreno; Karl Stratos; ほか",
          "year": 2025,
          "url": "https://arxiv.org/abs/2505.02222",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 4 May 2025 (v1 ), last revised 20 May 2025 (this version, v4)",
          "reading_note": "large batchでのcompute/time Pareto frontier。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2507.01598",
      "id": "OP011",
      "aliases": [
        "OP011"
      ],
      "title": "Convergence Bound and Critical Batch Size of Muon Optimizer",
      "authors": "Naoki Sato; Hiroki Naganuma; Hideaki Iiduka",
      "year": 2025,
      "url": "https://arxiv.org/abs/2507.01598",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "OP011",
          "key": "2507.01598",
          "title": "Convergence Bound and Critical Batch Size of Muon Optimizer",
          "authors": "Naoki Sato; Hiroki Naganuma; Hideaki Iiduka",
          "year": 2025,
          "url": "https://arxiv.org/abs/2507.01598",
          "topic": "最適化",
          "evidence": "full-text",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 2 Jul 2025 (v1 ), last revised 8 Jun 2026 (this version, v5)",
          "reading_note": "2026 v5のCBS下界と未知定数・停止条件。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2608.04607",
      "id": "OP012",
      "aliases": [
        "OP012"
      ],
      "title": "On MUON optimization: From non-convergence to an error analysis with Polar Express and the Newton-Schulz polynomial from implementations",
      "authors": "Thang Do; Steffen Dereich; Arnulf Jentzen",
      "year": 2026,
      "url": "https://arxiv.org/abs/2608.04607",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP012",
          "key": "2608.04607",
          "title": "On MUON optimization: From non-convergence to an error analysis with Polar Express and the Newton-Schulz polynomial from implementations",
          "authors": "Thang Do; Steffen Dereich; Arnulf Jentzen",
          "year": 2026,
          "url": "https://arxiv.org/abs/2608.04607",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 5 Aug 2026",
          "reading_note": "確率的な非収束例とNS近似誤差。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2609.30546",
      "id": "OP013",
      "aliases": [
        "OP013"
      ],
      "title": "Convergence guarantees for Muon: New parameter regimes and generalizations",
      "authors": "Arthur C. B. de Oliveira; Dhruv D. Jatkar; Guilherme S. Vicinansa; Eduardo D. Sontag",
      "year": 2026,
      "url": "https://arxiv.org/abs/2609.30546",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "OP013",
          "key": "2609.30546",
          "title": "Convergence guarantees for Muon: New parameter regimes and generalizations",
          "authors": "Arthur C. B. de Oliveira; Dhruv D. Jatkar; Guilherme S. Vicinansa; Eduardo D. Sontag",
          "year": 2026,
          "url": "https://arxiv.org/abs/2609.30546",
          "topic": "最適化",
          "evidence": "full-text",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 24 Sep 2026",
          "reading_note": "soft-sign variantの条件付き漸近保証。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2607.20548",
      "id": "OP014",
      "aliases": [
        "OP014"
      ],
      "title": "SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales",
      "authors": "Mikail Khona; Aditya Vavre; Boxiang Wang; ほか",
      "year": 2026,
      "url": "https://arxiv.org/abs/2607.20548",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "OP014",
          "key": "2607.20548",
          "title": "SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales",
          "authors": "Mikail Khona; Aditya Vavre; Boxiang Wang; ほか",
          "year": 2026,
          "url": "https://arxiv.org/abs/2607.20548",
          "topic": "最適化",
          "evidence": "full-text",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 13 Jul 2026",
          "reading_note": "2026年の大規模SOAP/Muonとlayer単位分散。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1503.05671",
      "id": "OP015",
      "aliases": [
        "OP015"
      ],
      "title": "Optimizing Neural Networks with Kronecker-factored Approximate Curvature",
      "authors": "James Martens; Roger Grosse",
      "year": 2015,
      "url": "https://arxiv.org/abs/1503.05671",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "OP015",
          "key": "1503.05671",
          "title": "Optimizing Neural Networks with Kronecker-factored Approximate Curvature",
          "authors": "James Martens; Roger Grosse",
          "year": 2015,
          "url": "https://arxiv.org/abs/1503.05671",
          "topic": "最適化",
          "evidence": "full-text",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 19 Mar 2015 (v1 ), last revised 8 Jun 2020 (this version, v7)",
          "reading_note": "Kronecker近似natural gradientとdamping。",
          "verification_scope": "本文§2.2–3（model Fisher・GGNの条件とKronecker近似）、§6のdampingの動機・適応を確認。全証明の検算なし。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1602.01407",
      "id": "OP016",
      "aliases": [
        "OP016"
      ],
      "title": "A Kronecker-factored approximate Fisher matrix for convolution layers",
      "authors": "Roger Grosse; James Martens",
      "year": 2016,
      "url": "https://arxiv.org/abs/1602.01407",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP016",
          "key": "1602.01407",
          "title": "A Kronecker-factored approximate Fisher matrix for convolution layers",
          "authors": "Roger Grosse; James Martens",
          "year": 2016,
          "url": "https://arxiv.org/abs/1602.01407",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 3 Feb 2016 (v1 ), last revised 23 May 2016 (this version, v2)",
          "reading_note": "畳み込みへのFisher block近似。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2311.00636",
      "id": "OP017",
      "aliases": [
        "OP017"
      ],
      "title": "Kronecker-Factored Approximate Curvature for Modern Neural Network Architectures",
      "authors": "Runa Eschenhagen; Alexander Immer; Richard E. Turner; Frank Schneider; Philipp Hennig",
      "year": 2023,
      "url": "https://arxiv.org/abs/2311.00636",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP017",
          "key": "2311.00636",
          "title": "Kronecker-Factored Approximate Curvature for Modern Neural Network Architectures",
          "authors": "Runa Eschenhagen; Alexander Immer; Richard E. Turner; Frank Schneider; Philipp Hennig",
          "year": 2023,
          "url": "https://arxiv.org/abs/2311.00636",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2023",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 1 Nov 2023 (v1 ), last revised 11 Jan 2024 (this version, v2)",
          "reading_note": "weight sharing、expand/reduceの区別。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2409.20325",
      "id": "OP018",
      "aliases": [
        "OP018"
      ],
      "title": "Old Optimizer, New Norm: An Anthology",
      "authors": "Jeremy Bernstein; Laker Newhouse",
      "year": 2024,
      "url": "https://arxiv.org/abs/2409.20325",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP018",
          "key": "2409.20325",
          "title": "Old Optimizer, New Norm: An Anthology",
          "authors": "Jeremy Bernstein; Laker Newhouse",
          "year": 2024,
          "url": "https://arxiv.org/abs/2409.20325",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 30 Sep 2024 (v1 ), last revised 6 Dec 2024 (this version, v2)",
          "reading_note": "ノルムからoptimizerを捉え直す。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2505.16932",
      "id": "OP019",
      "aliases": [
        "OP019"
      ],
      "title": "The Polar Express: Optimal Matrix Sign Methods and Their Application to the Muon Algorithm",
      "authors": "Noah Amsel; David Persson; Christopher Musco; Robert M. Gower",
      "year": 2025,
      "url": "https://arxiv.org/abs/2505.16932",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP019",
          "key": "2505.16932",
          "title": "The Polar Express: Optimal Matrix Sign Methods and Their Application to the Muon Algorithm",
          "authors": "Noah Amsel; David Persson; Christopher Musco; Robert M. Gower",
          "year": 2025,
          "url": "https://arxiv.org/abs/2505.16932",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 22 May 2025 (v1 ), last revised 4 May 2026 (this version, v5)",
          "reading_note": "行列polar近似の多項式設計。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2510.05491",
      "id": "OP020",
      "aliases": [
        "OP020"
      ],
      "title": "NorMuon: Making Muon more efficient and scalable",
      "authors": "Zichong Li; Liming Liu; Chen Liang; Weizhu Chen; Tuo Zhao",
      "year": 2025,
      "url": "https://arxiv.org/abs/2510.05491",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP020",
          "key": "2510.05491",
          "title": "NorMuon: Making Muon more efficient and scalable",
          "authors": "Zichong Li; Liming Liu; Chen Liang; Weizhu Chen; Tuo Zhao",
          "year": 2025,
          "url": "https://arxiv.org/abs/2510.05491",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 7 Oct 2025",
          "reading_note": "neuron単位適応と直交化の組合せ。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1706.02677",
      "id": "OP021",
      "aliases": [
        "OP021"
      ],
      "title": "Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour",
      "authors": "Priya Goyal; Piotr Dollár; Ross Girshick; ほか",
      "year": 2017,
      "url": "https://arxiv.org/abs/1706.02677",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP021",
          "key": "1706.02677",
          "title": "Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour",
          "authors": "Priya Goyal; Piotr Dollár; Ross Girshick; ほか",
          "year": 2017,
          "url": "https://arxiv.org/abs/1706.02677",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 8 Jun 2017 (v1 ), last revised 30 Apr 2018 (this version, v2)",
          "reading_note": "linear scalingとwarmupの実験的基礎。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1812.06162",
      "id": "OP022",
      "aliases": [
        "OP022"
      ],
      "title": "An Empirical Model of Large-Batch Training",
      "authors": "Sam McCandlish; Jared Kaplan; Dario Amodei; OpenAI Dota Team",
      "year": 2018,
      "url": "https://arxiv.org/abs/1812.06162",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP022",
          "key": "1812.06162",
          "title": "An Empirical Model of Large-Batch Training",
          "authors": "Sam McCandlish; Jared Kaplan; Dario Amodei; OpenAI Dota Team",
          "year": 2018,
          "url": "https://arxiv.org/abs/1812.06162",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 14 Dec 2018",
          "reading_note": "noise scaleとbatchの経験モデル。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1907.04164",
      "id": "OP023",
      "aliases": [
        "OP023"
      ],
      "title": "Which Algorithmic Choices Matter at Which Batch Sizes? Insights From a Noisy Quadratic Model",
      "authors": "Guodong Zhang; Lala Li; Zachary Nado; ほか",
      "year": 2019,
      "url": "https://arxiv.org/abs/1907.04164",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP023",
          "key": "1907.04164",
          "title": "Which Algorithmic Choices Matter at Which Batch Sizes? Insights From a Noisy Quadratic Model",
          "authors": "Guodong Zhang; Lala Li; Zachary Nado; ほか",
          "year": 2019,
          "url": "https://arxiv.org/abs/1907.04164",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2019",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 9 Jul 2019 (v1 ), last revised 28 Oct 2019 (this version, v2)",
          "reading_note": "noisy quadraticによるoptimizer依存CBS。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1708.03888",
      "id": "OP024",
      "aliases": [
        "OP024"
      ],
      "title": "Large Batch Training of Convolutional Networks",
      "authors": "Yang You; Igor Gitman; Boris Ginsburg",
      "year": 2017,
      "url": "https://arxiv.org/abs/1708.03888",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP024",
          "key": "1708.03888",
          "title": "Large Batch Training of Convolutional Networks",
          "authors": "Yang You; Igor Gitman; Boris Ginsburg",
          "year": 2017,
          "url": "https://arxiv.org/abs/1708.03888",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 13 Aug 2017 (v1 ), last revised 13 Sep 2017 (this version, v3)",
          "reading_note": "LARS、layer別update scale。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1904.00962",
      "id": "OP025",
      "aliases": [
        "OP025"
      ],
      "title": "Large Batch Optimization for Deep Learning: Training BERT in 76 minutes",
      "authors": "Yang You; Jing Li; Sashank Reddi; ほか",
      "year": 2019,
      "url": "https://arxiv.org/abs/1904.00962",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP025",
          "key": "1904.00962",
          "title": "Large Batch Optimization for Deep Learning: Training BERT in 76 minutes",
          "authors": "Yang You; Jing Li; Sashank Reddi; ほか",
          "year": 2019,
          "url": "https://arxiv.org/abs/1904.00962",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "ICLR 2020（arXiv初出2019）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 1 Apr 2019 (v1 ), last revised 3 Jan 2020 (this version, v5)",
          "reading_note": "LAMBとBERTの大バッチ学習。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2102.06356",
      "id": "OP026",
      "aliases": [
        "OP026"
      ],
      "title": "A Large Batch Optimizer Reality Check: Traditional, Generic Optimizers Suffice Across Batch Sizes",
      "authors": "Zachary Nado; Justin M. Gilmer; Christopher J. Shallue; Rohan Anil; George E. Dahl",
      "year": 2021,
      "url": "https://arxiv.org/abs/2102.06356",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP026",
          "key": "2102.06356",
          "title": "A Large Batch Optimizer Reality Check: Traditional, Generic Optimizers Suffice Across Batch Sizes",
          "authors": "Zachary Nado; Justin M. Gilmer; Christopher J. Shallue; Rohan Anil; George E. Dahl",
          "year": 2021,
          "url": "https://arxiv.org/abs/2102.06356",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 12 Feb 2021 (v1 ), last revised 9 Jun 2021 (this version, v3)",
          "reading_note": "LARS/LAMB比較での強いbaseline。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2405.15682",
      "id": "OP027",
      "aliases": [
        "OP027"
      ],
      "title": "The Road Less Scheduled",
      "authors": "Aaron Defazio; Xingyu Alice Yang; Harsh Mehta; ほか",
      "year": 2024,
      "url": "https://arxiv.org/abs/2405.15682",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP027",
          "key": "2405.15682",
          "title": "The Road Less Scheduled",
          "authors": "Aaron Defazio; Xingyu Alice Yang; Harsh Mehta; ほか",
          "year": 2024,
          "url": "https://arxiv.org/abs/2405.15682",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 24 May 2024 (v1 ), last revised 29 Oct 2024 (this version, v4)",
          "reading_note": "scheduleとiterate averagingの統一。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2501.18965",
      "id": "OP028",
      "aliases": [
        "OP028"
      ],
      "title": "The Surprising Agreement Between Convex Optimization Theory and Learning-Rate Scheduling for Large Model Training",
      "authors": "Fabian Schaipp; Alexander Hägele; Adrien Taylor; Umut Simsekli; Francis Bach",
      "year": 2025,
      "url": "https://arxiv.org/abs/2501.18965",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP028",
          "key": "2501.18965",
          "title": "The Surprising Agreement Between Convex Optimization Theory and Learning-Rate Scheduling for Large Model Training",
          "authors": "Fabian Schaipp; Alexander Hägele; Adrien Taylor; Umut Simsekli; Francis Bach",
          "year": 2025,
          "url": "https://arxiv.org/abs/2501.18965",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 31 Jan 2025 (v1 ), last revised 23 Jul 2025 (this version, v2)",
          "reading_note": "凸上界と実測scheduleの対応。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2410.05192",
      "id": "OP029",
      "aliases": [
        "OP029"
      ],
      "title": "Understanding Warmup-Stable-Decay Learning Rates: A River Valley Loss Landscape Perspective",
      "authors": "Kaiyue Wen; Zhiyuan Li; Jason Wang; ほか",
      "year": 2024,
      "url": "https://arxiv.org/abs/2410.05192",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP029",
          "key": "2410.05192",
          "title": "Understanding Warmup-Stable-Decay Learning Rates: A River Valley Loss Landscape Perspective",
          "authors": "Kaiyue Wen; Zhiyuan Li; Jason Wang; ほか",
          "year": 2024,
          "url": "https://arxiv.org/abs/2410.05192",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 7 Oct 2024 (v1 ), last revised 2 Dec 2024 (this version, v3)",
          "reading_note": "WSDのriver-valley仮説とWSD-S。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1805.09767",
      "id": "OP030",
      "aliases": [
        "OP030"
      ],
      "title": "Local SGD Converges Fast and Communicates Little",
      "authors": "Sebastian U. Stich",
      "year": 2018,
      "url": "https://arxiv.org/abs/1805.09767",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP030",
          "key": "1805.09767",
          "title": "Local SGD Converges Fast and Communicates Little",
          "authors": "Sebastian U. Stich",
          "year": 2018,
          "url": "https://arxiv.org/abs/1805.09767",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "ICLR 2019（arXiv初出2018）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 24 May 2018 (v1 ), last revised 3 May 2019 (this version, v3)",
          "reading_note": "local SGDの通信と凸収束率。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1808.07217",
      "id": "OP031",
      "aliases": [
        "OP031"
      ],
      "title": "Don't Use Large Mini-Batches, Use Local SGD",
      "authors": "Tao Lin; Sebastian U. Stich; Kumar Kshitij Patel; Martin Jaggi",
      "year": 2018,
      "url": "https://arxiv.org/abs/1808.07217",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP031",
          "key": "1808.07217",
          "title": "Don't Use Large Mini-Batches, Use Local SGD",
          "authors": "Tao Lin; Sebastian U. Stich; Kumar Kshitij Patel; Martin Jaggi",
          "year": 2018,
          "url": "https://arxiv.org/abs/1808.07217",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "ICLR 2020（arXiv初出2018）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 22 Aug 2018 (v1 ), last revised 17 Feb 2020 (this version, v6)",
          "reading_note": "post-local SGDの汎化と通信。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1910.00643",
      "id": "OP032",
      "aliases": [
        "OP032"
      ],
      "title": "SlowMo: Improving Communication-Efficient Distributed SGD with Slow Momentum",
      "authors": "Jianyu Wang; Vinayak Tantia; Nicolas Ballas; Michael Rabbat",
      "year": 2019,
      "url": "https://arxiv.org/abs/1910.00643",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP032",
          "key": "1910.00643",
          "title": "SlowMo: Improving Communication-Efficient Distributed SGD with Slow Momentum",
          "authors": "Jianyu Wang; Vinayak Tantia; Nicolas Ballas; Michael Rabbat",
          "year": 2019,
          "url": "https://arxiv.org/abs/1910.00643",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "ICLR 2020（arXiv初出2019）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 1 Oct 2019 (v1 ), last revised 19 Feb 2020 (this version, v2)",
          "reading_note": "outer slow momentum。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2311.08105",
      "id": "OP033",
      "aliases": [
        "OP033"
      ],
      "title": "DiLoCo: Distributed Low-Communication Training of Language Models",
      "authors": "Arthur Douillard; Qixuan Feng; Andrei A. Rusu; ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2311.08105",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP033",
          "key": "2311.08105",
          "title": "DiLoCo: Distributed Low-Communication Training of Language Models",
          "authors": "Arthur Douillard; Qixuan Feng; Andrei A. Rusu; ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2311.08105",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 14 Nov 2023 (v1 ), last revised 23 Sep 2024 (this version, v3)",
          "reading_note": "LLMをislandで低通信訓練。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2401.09135",
      "id": "OP034",
      "aliases": [
        "OP034"
      ],
      "title": "Asynchronous Local-SGD Training for Language Modeling",
      "authors": "Bo Liu; Rachita Chhaparia; Arthur Douillard; ほか",
      "year": 2024,
      "url": "https://arxiv.org/abs/2401.09135",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP034",
          "key": "2401.09135",
          "title": "Asynchronous Local-SGD Training for Language Modeling",
          "authors": "Bo Liu; Rachita Chhaparia; Arthur Douillard; ほか",
          "year": 2024,
          "url": "https://arxiv.org/abs/2401.09135",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 17 Jan 2024 (v1 ), last revised 23 Sep 2024 (this version, v2)",
          "reading_note": "非同期遅延とNesterovの干渉。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2604.21428",
      "id": "OP035",
      "aliases": [
        "OP035"
      ],
      "title": "Decoupled DiLoCo for Resilient Distributed Pre-training",
      "authors": "Arthur Douillard; Keith Rush; Yani Donchev; ほか",
      "year": 2026,
      "url": "https://arxiv.org/abs/2604.21428",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP035",
          "key": "2604.21428",
          "title": "Decoupled DiLoCo for Resilient Distributed Pre-training",
          "authors": "Arthur Douillard; Keith Rush; Yani Donchev; ほか",
          "year": 2026,
          "url": "https://arxiv.org/abs/2604.21428",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 23 Apr 2026",
          "reading_note": "障害耐性と非同期learner集約。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1602.05629",
      "id": "OP036",
      "aliases": [
        "OP036"
      ],
      "title": "Communication-Efficient Learning of Deep Networks from Decentralized Data",
      "authors": "H. Brendan McMahan; Eider Moore; Daniel Ramage; Seth Hampson; Blaise Agüera y Arcas",
      "year": 2016,
      "url": "https://arxiv.org/abs/1602.05629",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP036",
          "key": "1602.05629",
          "title": "Communication-Efficient Learning of Deep Networks from Decentralized Data",
          "authors": "H. Brendan McMahan; Eider Moore; Daniel Ramage; Seth Hampson; Blaise Agüera y Arcas",
          "year": 2016,
          "url": "https://arxiv.org/abs/1602.05629",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 17 Feb 2016 (v1 ), last revised 26 Jan 2023 (this version, v4)",
          "reading_note": "FedAvgと非IID client。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://proceedings.mlr.press/v54/mcmahan17a.html"
      ]
    },
    {
      "canonical_key": "arxiv:2003.00295",
      "id": "OP037",
      "aliases": [
        "OP037"
      ],
      "title": "Adaptive Federated Optimization",
      "authors": "Sashank Reddi; Zachary Charles; Manzil Zaheer; ほか",
      "year": 2020,
      "url": "https://arxiv.org/abs/2003.00295",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP037",
          "key": "2003.00295",
          "title": "Adaptive Federated Optimization",
          "authors": "Sashank Reddi; Zachary Charles; Manzil Zaheer; ほか",
          "year": 2020,
          "url": "https://arxiv.org/abs/2003.00295",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "ICLR 2021（arXiv初出2020）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 29 Feb 2020 (v1 ), last revised 8 Sep 2021 (this version, v5)",
          "reading_note": "server側適応optimizer。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1910.06378",
      "id": "OP038",
      "aliases": [
        "OP038"
      ],
      "title": "SCAFFOLD: Stochastic Controlled Averaging for Federated Learning",
      "authors": "Sai Praneeth Karimireddy; Satyen Kale; Mehryar Mohri; ほか",
      "year": 2019,
      "url": "https://arxiv.org/abs/1910.06378",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP038",
          "key": "1910.06378",
          "title": "SCAFFOLD: Stochastic Controlled Averaging for Federated Learning",
          "authors": "Sai Praneeth Karimireddy; Satyen Kale; Mehryar Mohri; ほか",
          "year": 2019,
          "url": "https://arxiv.org/abs/1910.06378",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 14 Oct 2019 (v1 ), last revised 9 Apr 2021 (this version, v4)",
          "reading_note": "client driftをcontrol variateで補正。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1608.03983",
      "id": "OP039",
      "aliases": [
        "OP039"
      ],
      "title": "SGDR: Stochastic Gradient Descent with Warm Restarts",
      "authors": "Ilya Loshchilov; Frank Hutter",
      "year": 2016,
      "url": "https://arxiv.org/abs/1608.03983",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP039",
          "key": "1608.03983",
          "title": "SGDR: Stochastic Gradient Descent with Warm Restarts",
          "authors": "Ilya Loshchilov; Frank Hutter",
          "year": 2016,
          "url": "https://arxiv.org/abs/1608.03983",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "ICLR 2017（arXiv初出2016）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 13 Aug 2016 (v1 ), last revised 3 May 2017 (this version, v5)",
          "reading_note": "cosine annealingとwarm restart。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1711.00489",
      "id": "OP040",
      "aliases": [
        "OP040"
      ],
      "title": "Don't Decay the Learning Rate, Increase the Batch Size",
      "authors": "Samuel L. Smith; Pieter-Jan Kindermans; Chris Ying; Quoc V. Le",
      "year": 2017,
      "url": "https://arxiv.org/abs/1711.00489",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP040",
          "key": "1711.00489",
          "title": "Don't Decay the Learning Rate, Increase the Batch Size",
          "authors": "Samuel L. Smith; Pieter-Jan Kindermans; Chris Ying; Quoc V. Le",
          "year": 2017,
          "url": "https://arxiv.org/abs/1711.00489",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "ICLR 2018（arXiv初出2017）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 1 Nov 2017 (v1 ), last revised 24 Feb 2018 (this version, v2)",
          "reading_note": "LR減衰に代えるbatch増加。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2602.06797",
      "id": "OP041",
      "aliases": [
        "OP041"
      ],
      "title": "Optimal Learning Rate Schedules under Functional Scaling Laws: Power Decay and Warmup-Stable-Decay",
      "authors": "Binghui Li; Zilin Wang; Fengling Chen; ほか",
      "year": 2026,
      "url": "https://arxiv.org/abs/2602.06797",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP041",
          "key": "2602.06797",
          "title": "Optimal Learning Rate Schedules under Functional Scaling Laws: Power Decay and Warmup-Stable-Decay",
          "authors": "Binghui Li; Zilin Wang; Fengling Chen; ほか",
          "year": 2026,
          "url": "https://arxiv.org/abs/2602.06797",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "COLT 2026（arXiv採択注記を確認）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 6 Feb 2026 (v1 ), last revised 14 Sep 2026 (this version, v3)",
          "reading_note": "FSL/kernel設定でのtask依存schedule。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2607.09167",
      "id": "OP042",
      "aliases": [
        "OP042"
      ],
      "title": "Understanding Schedule-Free Methods in Nonconvex Optimization: Rate Guarantees and Escaping Saddles",
      "authors": "Jiseok Chae; Donghwan Kim",
      "year": 2026,
      "url": "https://arxiv.org/abs/2607.09167",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP042",
          "key": "2607.09167",
          "title": "Understanding Schedule-Free Methods in Nonconvex Optimization: Rate Guarantees and Escaping Saddles",
          "authors": "Jiseok Chae; Donghwan Kim",
          "year": 2026,
          "url": "https://arxiv.org/abs/2607.09167",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 10 Jul 2026",
          "reading_note": "Schedule-Free GD/SGDのnonconvex解析。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2607.10959",
      "id": "OP043",
      "aliases": [
        "OP043"
      ],
      "title": "WSqD: A Horizon-Free Learning Rate Schedule for Large Model Training",
      "authors": "Jianhao Ma; Yuxin Chen",
      "year": 2026,
      "url": "https://arxiv.org/abs/2607.10959",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP043",
          "key": "2607.10959",
          "title": "WSqD: A Horizon-Free Learning Rate Schedule for Large Model Training",
          "authors": "Jianhao Ma; Yuxin Chen",
          "year": 2026,
          "url": "https://arxiv.org/abs/2607.10959",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 12 Jul 2026",
          "reading_note": "horizon非依存baseとterminal cooldown。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2504.05295",
      "id": "OP044",
      "aliases": [
        "OP044"
      ],
      "title": "Dion: Distributed Orthonormalized Updates",
      "authors": "Kwangjun Ahn; Byron Xu; Natalie Abreu; ほか",
      "year": 2025,
      "url": "https://arxiv.org/abs/2504.05295",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP044",
          "key": "2504.05295",
          "title": "Dion: Distributed Orthonormalized Updates",
          "authors": "Kwangjun Ahn; Byron Xu; Natalie Abreu; ほか",
          "year": 2025,
          "url": "https://arxiv.org/abs/2504.05295",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 7 Apr 2025 (v1 ), last revised 15 Sep 2025 (this version, v3)",
          "reading_note": "shardingを考慮した低rank直交更新。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2010.01412",
      "id": "OP045",
      "aliases": [
        "OP045"
      ],
      "title": "Sharpness-Aware Minimization for Efficiently Improving Generalization",
      "authors": "Pierre Foret; Ariel Kleiner; Hossein Mobahi; Behnam Neyshabur",
      "year": 2020,
      "url": "https://arxiv.org/abs/2010.01412",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "OP045",
          "key": "2010.01412",
          "title": "Sharpness-Aware Minimization for Efficiently Improving Generalization",
          "authors": "Pierre Foret; Ariel Kleiner; Hossein Mobahi; Behnam Neyshabur",
          "year": 2020,
          "url": "https://arxiv.org/abs/2010.01412",
          "topic": "最適化",
          "evidence": "full-text",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 3 Oct 2020 (v1 ), last revised 29 Apr 2021 (this version, v3)",
          "reading_note": "SAMの近傍最悪損失という目的。",
          "verification_scope": "本文§2の近傍最大化・一次近似・二階項省略、Appendix C.4の限定的ablationを確認。PAC-Bayes証明全体の検算なし。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2305.16292",
      "id": "OP046",
      "aliases": [
        "OP046"
      ],
      "title": "Sharpness-Aware Minimization Leads to Low-Rank Features",
      "authors": "Maksym Andriushchenko; Dara Bahri; Hossein Mobahi; Nicolas Flammarion",
      "year": 2023,
      "url": "https://arxiv.org/abs/2305.16292",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP046",
          "key": "2305.16292",
          "title": "Sharpness-Aware Minimization Leads to Low-Rank Features",
          "authors": "Maksym Andriushchenko; Dara Bahri; Hossein Mobahi; Nicolas Flammarion",
          "year": 2023,
          "url": "https://arxiv.org/abs/2305.16292",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2023",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 25 May 2023 (v1 ), last revised 28 Oct 2023 (this version, v2)",
          "reading_note": "SAMによるfeature rank低下。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2211.05729",
      "id": "OP047",
      "aliases": [
        "OP047"
      ],
      "title": "How Does Sharpness-Aware Minimization Minimize Sharpness?",
      "authors": "Kaiyue Wen; Tengyu Ma; Zhiyuan Li",
      "year": 2022,
      "url": "https://arxiv.org/abs/2211.05729",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP047",
          "key": "2211.05729",
          "title": "How Does Sharpness-Aware Minimization Minimize Sharpness?",
          "authors": "Kaiyue Wen; Tengyu Ma; Zhiyuan Li",
          "year": 2022,
          "url": "https://arxiv.org/abs/2211.05729",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 10 Nov 2022 (v1 ), last revised 5 Jan 2023 (this version, v2)",
          "reading_note": "SAMが制御するsharpnessの種類。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1711.05101",
      "id": "OP048",
      "aliases": [
        "OP048"
      ],
      "title": "Decoupled Weight Decay Regularization",
      "authors": "Ilya Loshchilov; Frank Hutter",
      "year": 2017,
      "url": "https://arxiv.org/abs/1711.05101",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP048",
          "key": "1711.05101",
          "title": "Decoupled Weight Decay Regularization",
          "authors": "Ilya Loshchilov; Frank Hutter",
          "year": 2017,
          "url": "https://arxiv.org/abs/1711.05101",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "ICLR 2019（arXiv初出2017）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 14 Nov 2017 (v1 ), last revised 4 Jan 2019 (this version, v3)",
          "reading_note": "適応前処理とweight decayの分離。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1502.03492",
      "id": "OP049",
      "aliases": [
        "OP049"
      ],
      "title": "Gradient-based Hyperparameter Optimization through Reversible Learning",
      "authors": "Dougal Maclaurin; David Duvenaud; Ryan P. Adams",
      "year": 2015,
      "url": "https://arxiv.org/abs/1502.03492",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP049",
          "key": "1502.03492",
          "title": "Gradient-based Hyperparameter Optimization through Reversible Learning",
          "authors": "Dougal Maclaurin; David Duvenaud; Ryan P. Adams",
          "year": 2015,
          "url": "https://arxiv.org/abs/1502.03492",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 11 Feb 2015 (v1 ), last revised 2 Apr 2015 (this version, v3)",
          "reading_note": "訓練軌跡を微分するhyperparameter最適化。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1703.01785",
      "id": "OP050",
      "aliases": [
        "OP050"
      ],
      "title": "Forward and Reverse Gradient-Based Hyperparameter Optimization",
      "authors": "Luca Franceschi; Michele Donini; Paolo Frasconi; Massimiliano Pontil",
      "year": 2017,
      "url": "https://arxiv.org/abs/1703.01785",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP050",
          "key": "1703.01785",
          "title": "Forward and Reverse Gradient-Based Hyperparameter Optimization",
          "authors": "Luca Franceschi; Michele Donini; Paolo Frasconi; Massimiliano Pontil",
          "year": 2017,
          "url": "https://arxiv.org/abs/1703.01785",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "ICML 2017",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 6 Mar 2017 (v1 ), last revised 12 Dec 2017 (this version, v3)",
          "reading_note": "forward/reverse hypergradientの費用。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1806.04910",
      "id": "OP051",
      "aliases": [
        "OP051"
      ],
      "title": "Bilevel Programming for Hyperparameter Optimization and Meta-Learning",
      "authors": "Luca Franceschi; Paolo Frasconi; Saverio Salzo; Riccardo Grazzi; Massimilano Pontil",
      "year": 2018,
      "url": "https://arxiv.org/abs/1806.04910",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP051",
          "key": "1806.04910",
          "title": "Bilevel Programming for Hyperparameter Optimization and Meta-Learning",
          "authors": "Luca Franceschi; Paolo Frasconi; Saverio Salzo; Riccardo Grazzi; Massimilano Pontil",
          "year": 2018,
          "url": "https://arxiv.org/abs/1806.04910",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "ICML 2018",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 13 Jun 2018 (v1 ), last revised 3 Jul 2018 (this version, v2)",
          "reading_note": "hyperparameter/meta-learningのbilevel定式化。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1711.00141",
      "id": "OP052",
      "aliases": [
        "OP052"
      ],
      "title": "Training GANs with Optimism",
      "authors": "Constantinos Daskalakis; Andrew Ilyas; Vasilis Syrgkanis; Haoyang Zeng",
      "year": 2017,
      "url": "https://arxiv.org/abs/1711.00141",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP052",
          "key": "1711.00141",
          "title": "Training GANs with Optimism",
          "authors": "Constantinos Daskalakis; Andrew Ilyas; Vasilis Syrgkanis; Haoyang Zeng",
          "year": 2017,
          "url": "https://arxiv.org/abs/1711.00141",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 31 Oct 2017 (v1 ), last revised 13 Feb 2018 (this version, v2)",
          "reading_note": "GANの回転的dynamicsとoptimistic法。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1703.04782",
      "id": "OP053",
      "aliases": [
        "OP053"
      ],
      "title": "Online Learning Rate Adaptation with Hypergradient Descent",
      "authors": "Atilim Gunes Baydin; Robert Cornish; David Martinez Rubio; Mark Schmidt; Frank Wood",
      "year": 2017,
      "url": "https://arxiv.org/abs/1703.04782",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP053",
          "key": "1703.04782",
          "title": "Online Learning Rate Adaptation with Hypergradient Descent",
          "authors": "Atilim Gunes Baydin; Robert Cornish; David Martinez Rubio; Mark Schmidt; Frank Wood",
          "year": 2017,
          "url": "https://arxiv.org/abs/1703.04782",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 14 Mar 2017 (v1 ), last revised 26 Feb 2018 (this version, v3)",
          "reading_note": "LR自身へのonline微分。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1711.09846",
      "id": "OP054",
      "aliases": [
        "OP054"
      ],
      "title": "Population Based Training of Neural Networks",
      "authors": "Max Jaderberg; Valentin Dalibard; Simon Osindero; ほか",
      "year": 2017,
      "url": "https://arxiv.org/abs/1711.09846",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP054",
          "key": "1711.09846",
          "title": "Population Based Training of Neural Networks",
          "authors": "Max Jaderberg; Valentin Dalibard; Simon Osindero; ほか",
          "year": 2017,
          "url": "https://arxiv.org/abs/1711.09846",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 27 Nov 2017 (v1 ), last revised 28 Nov 2017 (this version, v2)",
          "reading_note": "populationを用いたschedule探索。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1606.04474",
      "id": "OP055",
      "aliases": [
        "OP055"
      ],
      "title": "Learning to learn by gradient descent by gradient descent",
      "authors": "Marcin Andrychowicz; Misha Denil; Sergio Gomez; ほか",
      "year": 2016,
      "url": "https://arxiv.org/abs/1606.04474",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP055",
          "key": "1606.04474",
          "title": "Learning to learn by gradient descent by gradient descent",
          "authors": "Marcin Andrychowicz; Misha Denil; Sergio Gomez; ほか",
          "year": 2016,
          "url": "https://arxiv.org/abs/1606.04474",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 14 Jun 2016 (v1 ), last revised 30 Nov 2016 (this version, v2)",
          "reading_note": "LSTMに更新則を学習させる。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1709.07417",
      "id": "OP056",
      "aliases": [
        "OP056"
      ],
      "title": "Neural Optimizer Search with Reinforcement Learning",
      "authors": "Irwan Bello; Barret Zoph; Vijay Vasudevan; Quoc V. Le",
      "year": 2017,
      "url": "https://arxiv.org/abs/1709.07417",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP056",
          "key": "1709.07417",
          "title": "Neural Optimizer Search with Reinforcement Learning",
          "authors": "Irwan Bello; Barret Zoph; Vijay Vasudevan; Quoc V. Le",
          "year": 2017,
          "url": "https://arxiv.org/abs/1709.07417",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "ICML 2017",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 21 Sep 2017 (v1 ), last revised 22 Sep 2017 (this version, v2)",
          "reading_note": "RLを用いた更新式探索。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2309.06497",
      "id": "OP057",
      "aliases": [
        "OP057"
      ],
      "title": "A Distributed Data-Parallel PyTorch Implementation of the Distributed Shampoo Optimizer for Training Neural Networks At-Scale",
      "authors": "Hao-Jun Michael Shi; Tsung-Hsien Lee; Shintaro Iwasaki; ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2309.06497",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP057",
          "key": "2309.06497",
          "title": "A Distributed Data-Parallel PyTorch Implementation of the Distributed Shampoo Optimizer for Training Neural Networks At-Scale",
          "authors": "Hao-Jun Michael Shi; Tsung-Hsien Lee; Shintaro Iwasaki; ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2309.06497",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 12 Sep 2023",
          "reading_note": "分散Shampooの実装費用。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2604.09967",
      "id": "OP058",
      "aliases": [
        "OP058"
      ],
      "title": "Muon$^2$: Boosting Muon via Adaptive Second-Moment Preconditioning",
      "authors": "Ziyue Liu; Ruijie Zhang; Zhengyang Wang; ほか",
      "year": 2026,
      "url": "https://arxiv.org/abs/2604.09967",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP058",
          "key": "2604.09967",
          "title": "Muon$^2$: Boosting Muon via Adaptive Second-Moment Preconditioning",
          "authors": "Ziyue Liu; Ruijie Zhang; Zhengyang Wang; ほか",
          "year": 2026,
          "url": "https://arxiv.org/abs/2604.09967",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 11 Apr 2026 (v1 ), last revised 5 Jun 2026 (this version, v2)",
          "reading_note": "NS前の二次モーメント前処理。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2608.11612",
      "id": "OP059",
      "aliases": [
        "OP059"
      ],
      "title": "Dion3: Full-Stack Orthogonal Updates",
      "authors": "Noah Amsel; Jack Zhang; Kwangjun Ahn; ほか",
      "year": 2026,
      "url": "https://arxiv.org/abs/2608.11612",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP059",
          "key": "2608.11612",
          "title": "Dion3: Full-Stack Orthogonal Updates",
          "authors": "Noah Amsel; Jack Zhang; Kwangjun Ahn; ほか",
          "year": 2026,
          "url": "https://arxiv.org/abs/2608.11612",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 12 Aug 2026",
          "reading_note": "kernel・通信・部分行選択の協調。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2110.08529",
      "id": "OP060",
      "aliases": [
        "OP060"
      ],
      "title": "Sharpness-Aware Minimization Improves Language Model Generalization",
      "authors": "Dara Bahri; Hossein Mobahi; Yi Tay",
      "year": 2021,
      "url": "https://arxiv.org/abs/2110.08529",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP060",
          "key": "2110.08529",
          "title": "Sharpness-Aware Minimization Improves Language Model Generalization",
          "authors": "Dara Bahri; Hossein Mobahi; Yi Tay",
          "year": 2021,
          "url": "https://arxiv.org/abs/2110.08529",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "ACL 2022（arXiv初出2021）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 16 Oct 2021 (v1 ), last revised 15 Mar 2022 (this version, v2)",
          "reading_note": "言語モデルへのSAM適用。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2603.18258",
      "id": "OP061",
      "aliases": [
        "OP061"
      ],
      "title": "Sharpness-Aware Minimization in Logit Space Efficiently Enhances Direct Preference Optimization",
      "authors": "Haocheng Luo; Zehang Deng; Thanh-Toan Do; ほか",
      "year": 2026,
      "url": "https://arxiv.org/abs/2603.18258",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP061",
          "key": "2603.18258",
          "title": "Sharpness-Aware Minimization in Logit Space Efficiently Enhances Direct Preference Optimization",
          "authors": "Haocheng Luo; Zehang Deng; Thanh-Toan Do; ほか",
          "year": 2026,
          "url": "https://arxiv.org/abs/2603.18258",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "ICLR 2026（arXiv採択注記を確認）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 18 Mar 2026",
          "reading_note": "logit空間SAMとDPO。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2306.04226",
      "id": "OP062",
      "aliases": [
        "OP062"
      ],
      "title": "Normalization Layers Are All That Sharpness-Aware Minimization Needs",
      "authors": "Maximilian Mueller; Tiffany Vlaar; David Rolnick; Matthias Hein",
      "year": 2023,
      "url": "https://arxiv.org/abs/2306.04226",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP062",
          "key": "2306.04226",
          "title": "Normalization Layers Are All That Sharpness-Aware Minimization Needs",
          "authors": "Maximilian Mueller; Tiffany Vlaar; David Rolnick; Matthias Hein",
          "year": 2023,
          "url": "https://arxiv.org/abs/2306.04226",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 7 Jun 2023 (v1 ), last revised 17 Nov 2023 (this version, v2)",
          "reading_note": "normalizationだけの摂動という反証的実験。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2010.07962",
      "id": "OP063",
      "aliases": [
        "OP063"
      ],
      "title": "Bilevel Optimization: Convergence Analysis and Enhanced Design",
      "authors": "Kaiyi Ji; Junjie Yang; Yingbin Liang",
      "year": 2020,
      "url": "https://arxiv.org/abs/2010.07962",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP063",
          "key": "2010.07962",
          "title": "Bilevel Optimization: Convergence Analysis and Enhanced Design",
          "authors": "Kaiyi Ji; Junjie Yang; Yingbin Liang",
          "year": 2020,
          "url": "https://arxiv.org/abs/2010.07962",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "ICML 2021（arXiv初出2020）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 15 Oct 2020 (v1 ), last revised 27 Aug 2021 (this version, v3)",
          "reading_note": "AID/ITDとstocBiOの収束条件。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2006.16218",
      "id": "OP064",
      "aliases": [
        "OP064"
      ],
      "title": "On the Iteration Complexity of Hypergradient Computation",
      "authors": "Riccardo Grazzi; Luca Franceschi; Massimiliano Pontil; Saverio Salzo",
      "year": 2020,
      "url": "https://arxiv.org/abs/2006.16218",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP064",
          "key": "2006.16218",
          "title": "On the Iteration Complexity of Hypergradient Computation",
          "authors": "Riccardo Grazzi; Luca Franceschi; Massimiliano Pontil; Saverio Salzo",
          "year": 2020,
          "url": "https://arxiv.org/abs/2006.16218",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "ICML 2020",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 29 Jun 2020 (v1 ), last revised 10 Jul 2020 (this version, v2)",
          "reading_note": "hypergradient計算の反復複雑度。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2301.10945",
      "id": "OP065",
      "aliases": [
        "OP065"
      ],
      "title": "A Fully First-Order Method for Stochastic Bilevel Optimization",
      "authors": "Jeongyeol Kwon; Dohyun Kwon; Stephen Wright; Robert Nowak",
      "year": 2023,
      "url": "https://arxiv.org/abs/2301.10945",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP065",
          "key": "2301.10945",
          "title": "A Fully First-Order Method for Stochastic Bilevel Optimization",
          "authors": "Jeongyeol Kwon; Dohyun Kwon; Stephen Wright; Robert Nowak",
          "year": 2023,
          "url": "https://arxiv.org/abs/2301.10945",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "ICML 2023",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 26 Jan 2023",
          "reading_note": "Hessian oracle不要のF2SA。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2509.03378",
      "id": "OP066",
      "aliases": [
        "OP066"
      ],
      "title": "Understanding and Improving Shampoo and SOAP via Kullback-Leibler Minimization",
      "authors": "Wu Lin; Scott C. Lowe; Felix Dangel; ほか",
      "year": 2025,
      "url": "https://arxiv.org/abs/2509.03378",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP066",
          "key": "2509.03378",
          "title": "Understanding and Improving Shampoo and SOAP via Kullback-Leibler Minimization",
          "authors": "Wu Lin; Scott C. Lowe; Felix Dangel; ほか",
          "year": 2025,
          "url": "https://arxiv.org/abs/2509.03378",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "ICLR 2026、arXiv v10は2026-06-22拡張版",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 3 Sep 2025 (v1 ), last revised 22 Jun 2026 (this version, v10)",
          "reading_note": "共分散推定のKLによる再設計。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2607.03011",
      "id": "OP067",
      "aliases": [
        "OP067"
      ],
      "title": "Can Model Merging Improve Aggregation in DiLoCo?",
      "authors": "Stefan Horoi; Benjamin Thérien; Guy Wolf; Eugene Belilovsky",
      "year": 2026,
      "url": "https://arxiv.org/abs/2607.03011",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP067",
          "key": "2607.03011",
          "title": "Can Model Merging Improve Aggregation in DiLoCo?",
          "authors": "Stefan Horoi; Benjamin Thérien; Guy Wolf; Eugene Belilovsky",
          "year": 2026,
          "url": "https://arxiv.org/abs/2607.03011",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 3 Jul 2026",
          "reading_note": "model mergingをDiLoCo集約に戻す。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2602.04396",
      "id": "OP068",
      "aliases": [
        "OP068"
      ],
      "title": "LoRDO: Distributed Low-Rank Optimization with Infrequent Communication",
      "authors": "Andrej Jovanović; Alex Iacob; Mher Safaryan; ほか",
      "year": 2026,
      "url": "https://arxiv.org/abs/2602.04396",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP068",
          "key": "2602.04396",
          "title": "LoRDO: Distributed Low-Rank Optimization with Infrequent Communication",
          "authors": "Andrej Jovanović; Alex Iacob; Mher Safaryan; ほか",
          "year": 2026,
          "url": "https://arxiv.org/abs/2602.04396",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "ICML 2026（arXiv採択注記を確認）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 4 Feb 2026 (v1 ), last revised 17 Jun 2026 (this version, v2)",
          "reading_note": "低rank更新と低通信の統合。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1606.04838",
      "id": "OP069",
      "aliases": [
        "OP069"
      ],
      "title": "Optimization Methods for Large-Scale Machine Learning",
      "authors": "Léon Bottou; Frank E. Curtis; Jorge Nocedal",
      "year": 2016,
      "url": "https://arxiv.org/abs/1606.04838",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP069",
          "key": "1606.04838",
          "title": "Optimization Methods for Large-Scale Machine Learning",
          "authors": "Léon Bottou; Frank E. Curtis; Jorge Nocedal",
          "year": 2016,
          "url": "https://arxiv.org/abs/1606.04838",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 15 Jun 2016 (v1 ), last revised 8 Feb 2018 (this version, v3)",
          "reading_note": "確率的一次法と曲率利用の全体史。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2202.07052",
      "id": "OP070",
      "aliases": [
        "OP070"
      ],
      "title": "Orthogonalising gradients to speed up neural network optimisation",
      "authors": "Mark Tuddenham; Adam Prügel-Bennett; Jonathan Hare",
      "year": 2022,
      "url": "https://arxiv.org/abs/2202.07052",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP070",
          "key": "2202.07052",
          "title": "Orthogonalising gradients to speed up neural network optimisation",
          "authors": "Mark Tuddenham; Adam Prügel-Bennett; Jonathan Hare",
          "year": 2022,
          "url": "https://arxiv.org/abs/2202.07052",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 14 Feb 2022",
          "reading_note": "Muon以前のgradient直交化。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2209.08709",
      "id": "OP071",
      "aliases": [
        "OP071"
      ],
      "title": "BOME! Bilevel Optimization Made Easy: A Simple First-Order Approach",
      "authors": "Mao Ye; Bo Liu; Stephen Wright; Peter Stone; Qiang Liu",
      "year": 2022,
      "url": "https://arxiv.org/abs/2209.08709",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP071",
          "key": "2209.08709",
          "title": "BOME! Bilevel Optimization Made Easy: A Simple First-Order Approach",
          "authors": "Mao Ye; Bo Liu; Stephen Wright; Peter Stone; Qiang Liu",
          "year": 2022,
          "url": "https://arxiv.org/abs/2209.08709",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 19 Sep 2022",
          "reading_note": "value-function型first-order bilevel法。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1706.08500",
      "id": "OP072",
      "aliases": [
        "OP072",
        "FM076"
      ],
      "title": "GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium",
      "authors": "Martin Heusel; Hubert Ramsauer; Thomas Unterthiner; Bernhard Nessler; Sepp Hochreiter",
      "year": 2017,
      "url": "https://arxiv.org/abs/1706.08500",
      "chapters": [
        "optimization",
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP072",
          "key": "1706.08500",
          "title": "GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium",
          "authors": "Martin Heusel; Hubert Ramsauer; Thomas Unterthiner; Bernhard Nessler; Sepp Hochreiter",
          "year": 2017,
          "url": "https://arxiv.org/abs/1706.08500",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 26 Jun 2017 (v1 ), last revised 12 Jan 2018 (this version, v6)",
          "reading_note": "TTURの仮定、Nashとbilevelの境界。",
          "chapter": "optimization"
        },
        {
          "id": "FM076",
          "title": "GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium",
          "authors": "Martin Heusel ほか",
          "year": 2017,
          "url": "https://arxiv.org/abs/1706.08500",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2017",
          "checked_on": "2026-10-03",
          "reading_note": "二時間尺度学習とFID",
          "first_submitted": "26 Jun 2017",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2101.11517",
      "id": "OP073",
      "aliases": [
        "OP073"
      ],
      "title": "Investigating Bi-Level Optimization for Learning and Vision from a Unified Perspective: A Survey and Beyond",
      "authors": "Risheng Liu; Jiaxin Gao; Jin Zhang; Deyu Meng; Zhouchen Lin",
      "year": 2021,
      "url": "https://arxiv.org/abs/2101.11517",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP073",
          "key": "2101.11517",
          "title": "Investigating Bi-Level Optimization for Learning and Vision from a Unified Perspective: A Survey and Beyond",
          "authors": "Risheng Liu; Jiaxin Gao; Jin Zhang; Deyu Meng; Zhouchen Lin",
          "year": 2021,
          "url": "https://arxiv.org/abs/2101.11517",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 27 Jan 2021 (v1 ), last revised 28 Sep 2021 (this version, v3)",
          "reading_note": "bilevel問題と算法の整理。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1703.04933",
      "id": "OP074",
      "aliases": [
        "OP074"
      ],
      "title": "Sharp Minima Can Generalize For Deep Nets",
      "authors": "Laurent Dinh; Razvan Pascanu; Samy Bengio; Yoshua Bengio",
      "year": 2017,
      "url": "https://arxiv.org/abs/1703.04933",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP074",
          "key": "1703.04933",
          "title": "Sharp Minima Can Generalize For Deep Nets",
          "authors": "Laurent Dinh; Razvan Pascanu; Samy Bengio; Yoshua Bengio",
          "year": 2017,
          "url": "https://arxiv.org/abs/1703.04933",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 15 Mar 2017 (v1 ), last revised 15 May 2017 (this version, v2)",
          "reading_note": "flatnessの再パラメータ化依存。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2609.39736",
      "id": "OP075",
      "aliases": [
        "OP075"
      ],
      "title": "Improved KKT Complexity for First-Order Bilevel Optimization under Weak Lower-Level Convexity",
      "authors": "Jan Harold Alcantara; Masahiro Inoue; Akiko Takeda",
      "year": 2026,
      "url": "https://arxiv.org/abs/2609.39736",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP075",
          "key": "2609.39736",
          "title": "Improved KKT Complexity for First-Order Bilevel Optimization under Weak Lower-Level Convexity",
          "authors": "Jan Harold Alcantara; Masahiro Inoue; Akiko Takeda",
          "year": 2026,
          "url": "https://arxiv.org/abs/2609.39736",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 30 Sep 2026",
          "reading_note": "weakly convex innerとrelaxed KKT。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2605.26654",
      "id": "OP076",
      "aliases": [
        "OP076"
      ],
      "title": "Bilevel Optimization over Saddle Points of Zero-Sum Markov Games",
      "authors": "Zihao Zheng; Irwin King; Songtao Lu",
      "year": 2026,
      "url": "https://arxiv.org/abs/2605.26654",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP076",
          "key": "2605.26654",
          "title": "Bilevel Optimization over Saddle Points of Zero-Sum Markov Games",
          "authors": "Zihao Zheng; Irwin King; Songtao Lu",
          "year": 2026,
          "url": "https://arxiv.org/abs/2605.26654",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "ICML 2026（arXiv採択注記を確認）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 26 May 2026",
          "reading_note": "下位Markov gameに対するbilevel法。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2602.10568",
      "id": "OP077",
      "aliases": [
        "OP077"
      ],
      "title": "Gauss-Newton Unlearning for the LLM Era",
      "authors": "Lev McKinney; Anvith Thudi; Juhan Bae; ほか",
      "year": 2026,
      "url": "https://arxiv.org/abs/2602.10568",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP077",
          "key": "2602.10568",
          "title": "Gauss-Newton Unlearning for the LLM Era",
          "authors": "Lev McKinney; Anvith Thudi; Juhan Bae; ほか",
          "year": 2026,
          "url": "https://arxiv.org/abs/2602.10568",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 11 Feb 2026",
          "reading_note": "曲率をLLM unlearningへ利用。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "jmlr.org/papers/v12/duchi11a.html",
      "id": "OP078",
      "aliases": [
        "OP078"
      ],
      "title": "Adaptive Subgradient Methods for Online Learning and Stochastic Optimization",
      "authors": "John Duchi; Elad Hazan; Yoram Singer",
      "year": 2011,
      "url": "https://jmlr.org/papers/v12/duchi11a.html",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "key": "adagrad",
          "title": "Adaptive Subgradient Methods for Online Learning and Stochastic Optimization",
          "authors": "John Duchi; Elad Hazan; Yoram Singer",
          "year": 2011,
          "url": "https://jmlr.org/papers/v12/duchi11a.html",
          "publication_status": "JMLR 12(61), 2011",
          "evidence": "abstract",
          "id": "OP078",
          "topic": "最適化",
          "checked_on": "2026-10-03",
          "reading_note": "AdaGrad、累積統計と幾何。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "research.google/pubs/on-the-convergence-of-adam-and-beyond",
      "id": "OP079",
      "aliases": [
        "OP079"
      ],
      "title": "On the Convergence of Adam and Beyond",
      "authors": "Sashank J. Reddi; Satyen Kale; Sanjiv Kumar",
      "year": 2018,
      "url": "https://research.google/pubs/on-the-convergence-of-adam-and-beyond/",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "key": "amsgrad",
          "title": "On the Convergence of Adam and Beyond",
          "authors": "Sashank J. Reddi; Satyen Kale; Sanjiv Kumar",
          "year": 2018,
          "url": "https://research.google/pubs/on-the-convergence-of-adam-and-beyond/",
          "publication_status": "ICLR 2018（著者所属機関の論文ページ）",
          "evidence": "abstract",
          "id": "OP079",
          "topic": "最適化",
          "checked_on": "2026-10-03",
          "reading_note": "Adamの反例とAMSGrad。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "doi:10.1162/089976698300017746",
      "id": "OP080",
      "aliases": [
        "OP080"
      ],
      "title": "Natural Gradient Works Efficiently in Learning",
      "authors": "Shun-ichi Amari",
      "year": 1998,
      "url": "https://doi.org/10.1162/089976698300017746",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "key": "amari",
          "title": "Natural Gradient Works Efficiently in Learning",
          "authors": "Shun-ichi Amari",
          "year": 1998,
          "url": "https://doi.org/10.1162/089976698300017746",
          "publication_status": "Neural Computation 10(2):251–276, 1998",
          "evidence": "abstract",
          "id": "OP080",
          "topic": "最適化",
          "checked_on": "2026-10-03",
          "reading_note": "Fisher幾何による自然勾配の原典。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://ieeexplore.ieee.org/abstract/document/6790500"
      ]
    },
    {
      "canonical_key": "nvlpubs.nist.gov/nistpubs/jres/049/jresv49n6p409_a1b.pdf",
      "id": "OP081",
      "aliases": [
        "OP081"
      ],
      "title": "Methods of Conjugate Gradients for Solving Linear Systems",
      "authors": "Magnus R. Hestenes; Eduard Stiefel",
      "year": 1952,
      "url": "https://nvlpubs.nist.gov/nistpubs/jres/049/jresv49n6p409_a1b.pdf",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "key": "cg",
          "title": "Methods of Conjugate Gradients for Solving Linear Systems",
          "authors": "Magnus R. Hestenes; Eduard Stiefel",
          "year": 1952,
          "url": "https://nvlpubs.nist.gov/nistpubs/jres/049/jresv49n6p409_a1b.pdf",
          "publication_status": "Journal of Research of the National Bureau of Standards 49(6):409–436, 1952",
          "evidence": "abstract",
          "id": "OP081",
          "topic": "最適化",
          "checked_on": "2026-10-03",
          "reading_note": "対称正定値系を解くCGの原典。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "doi:10.1090/qam/10666",
      "id": "OP082",
      "aliases": [
        "OP082"
      ],
      "title": "A Method for the Solution of Certain Non-Linear Problems in Least Squares",
      "authors": "Kenneth Levenberg",
      "year": 1944,
      "url": "https://doi.org/10.1090/qam/10666",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "metadata"
      ],
      "records": [
        {
          "key": "levenberg",
          "title": "A Method for the Solution of Certain Non-Linear Problems in Least Squares",
          "authors": "Kenneth Levenberg",
          "year": 1944,
          "url": "https://doi.org/10.1090/qam/10666",
          "publication_status": "Quarterly of Applied Mathematics 2(2):164–168, 1944。原典アクセス403、Marquardt出版社参考文献と書誌を照合",
          "evidence": "metadata",
          "id": "OP082",
          "topic": "最適化",
          "checked_on": "2026-10-03",
          "reading_note": "LM系の歴史的原典、書誌のみ。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "epubs.siam.org/doi/10.1137/0111030",
      "id": "OP083",
      "aliases": [
        "OP083"
      ],
      "title": "An Algorithm for Least-Squares Estimation of Nonlinear Parameters",
      "authors": "Donald W. Marquardt",
      "year": 1963,
      "url": "https://epubs.siam.org/doi/10.1137/0111030",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "metadata"
      ],
      "records": [
        {
          "key": "marquardt",
          "title": "An Algorithm for Least-Squares Estimation of Nonlinear Parameters",
          "authors": "Donald W. Marquardt",
          "year": 1963,
          "url": "https://epubs.siam.org/doi/10.1137/0111030",
          "publication_status": "Journal of the Society for Industrial and Applied Mathematics 11(2):431–441, 1963。2006は電子公開年",
          "evidence": "metadata",
          "id": "OP083",
          "topic": "最適化",
          "checked_on": "2026-10-03",
          "reading_note": "damped nonlinear least squaresの原典、書誌のみ。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "icml.cc/2010/papers/458.pdf",
      "id": "OP084",
      "aliases": [
        "OP084"
      ],
      "title": "Deep Learning via Hessian-Free Optimization",
      "authors": "James Martens",
      "year": 2010,
      "url": "https://icml.cc/2010/papers/458.pdf",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "key": "hessianfree",
          "title": "Deep Learning via Hessian-Free Optimization",
          "authors": "James Martens",
          "year": 2010,
          "url": "https://icml.cc/2010/papers/458.pdf",
          "publication_status": "ICML 2010",
          "evidence": "full-text",
          "id": "OP084",
          "topic": "最適化",
          "checked_on": "2026-10-03",
          "reading_note": "matrix-vector product・CG・dampingを結ぶ。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "proceedings.mlr.press/v38/carlson15.html",
      "id": "OP085",
      "aliases": [
        "OP085"
      ],
      "title": "Stochastic Spectral Descent for Restricted Boltzmann Machines",
      "authors": "David Carlson; Volkan Cevher; Lawrence Carin",
      "year": 2015,
      "url": "https://proceedings.mlr.press/v38/carlson15.html",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "key": "spectraldescent",
          "title": "Stochastic Spectral Descent for Restricted Boltzmann Machines",
          "authors": "David Carlson; Volkan Cevher; Lawrence Carin",
          "year": 2015,
          "url": "https://proceedings.mlr.press/v38/carlson15.html",
          "publication_status": "AISTATS 2015, PMLR 38:111–119",
          "evidence": "abstract",
          "id": "OP085",
          "topic": "最適化",
          "checked_on": "2026-10-03",
          "reading_note": "spectral normによるMuon以前の最適化。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "kellerjordan.github.io/posts/muon",
      "id": "OP086",
      "aliases": [
        "OP086"
      ],
      "title": "Muon: An optimizer for hidden layers in neural networks",
      "authors": "Keller Jordan",
      "year": 2024,
      "url": "https://kellerjordan.github.io/posts/muon/",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "primary-resource"
      ],
      "records": [
        {
          "key": "muonblog",
          "title": "Muon: An optimizer for hidden layers in neural networks",
          "authors": "Keller Jordan",
          "year": 2024,
          "url": "https://kellerjordan.github.io/posts/muon/",
          "publication_status": "提案者の技術記事、2024-12-08（2025追記あり、査読論文ではない）",
          "evidence": "primary-resource",
          "id": "OP086",
          "topic": "最適化",
          "checked_on": "2026-10-03",
          "reading_note": "Muonの定義・有限NS反復・仮説の一次記事。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "proceedings.mlr.press/v139/kwon21b.html",
      "id": "OP087",
      "aliases": [
        "OP087"
      ],
      "title": "ASAM: Adaptive Sharpness-Aware Minimization for Scale-Invariant Learning of Deep Neural Networks",
      "authors": "Jungmin Kwon; Jeongseop Kim; Hyunseo Park; In Kwon Choi",
      "year": 2021,
      "url": "https://proceedings.mlr.press/v139/kwon21b.html",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "key": "asam",
          "title": "ASAM: Adaptive Sharpness-Aware Minimization for Scale-Invariant Learning of Deep Neural Networks",
          "authors": "Jungmin Kwon; Jeongseop Kim; Hyunseo Park; In Kwon Choi",
          "year": 2021,
          "url": "https://proceedings.mlr.press/v139/kwon21b.html",
          "publication_status": "ICML 2021, PMLR 139:5905–5914",
          "evidence": "abstract",
          "id": "OP087",
          "topic": "最適化",
          "checked_on": "2026-10-03",
          "reading_note": "scaleを考慮したSAM摂動。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2305.14342",
      "id": "OP088",
      "aliases": [
        "OP088"
      ],
      "title": "Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training",
      "authors": "Hong Liu; Zhiyuan Li; David Hall; Percy Liang; Tengyu Ma",
      "year": 2023,
      "url": "https://arxiv.org/abs/2305.14342",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP088",
          "key": "2305.14342",
          "title": "Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training",
          "authors": "Hong Liu; Zhiyuan Li; David Hall; Percy Liang; Tengyu Ma",
          "year": 2023,
          "url": "https://arxiv.org/abs/2305.14342",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照",
          "checked_on": "2026-10-03",
          "reading_note": "対角Hessian推定とclippingによる言語モデル学習。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2306.06101",
      "id": "OP089",
      "aliases": [
        "OP089"
      ],
      "title": "Prodigy: An Expeditiously Adaptive Parameter-Free Learner",
      "authors": "Konstantin Mishchenko; Aaron Defazio",
      "year": 2023,
      "url": "https://arxiv.org/abs/2306.06101",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP089",
          "key": "2306.06101",
          "title": "Prodigy: An Expeditiously Adaptive Parameter-Free Learner",
          "authors": "Konstantin Mishchenko; Aaron Defazio",
          "year": 2023,
          "url": "https://arxiv.org/abs/2306.06101",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv版参照",
          "checked_on": "2026-10-03",
          "reading_note": "距離推定による学習率適応。D-Adaptationとの関係。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2411.02853",
      "id": "OP090",
      "aliases": [
        "OP090"
      ],
      "title": "ADOPT: Modified Adam Can Converge with Any β₂ with the Optimal Rate",
      "authors": "Shohei Taniguchi; Keno Harada; Gouki Minegishi; ほか",
      "year": 2024,
      "url": "https://arxiv.org/abs/2411.02853",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP090",
          "key": "2411.02853",
          "title": "ADOPT: Modified Adam Can Converge with Any β₂ with the Optimal Rate",
          "authors": "Shohei Taniguchi; Keno Harada; Gouki Minegishi; ほか",
          "year": 2024,
          "url": "https://arxiv.org/abs/2411.02853",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2024（arXiv Commentsで確認）",
          "checked_on": "2026-10-03",
          "reading_note": "momentumと正規化の順序、二次モーメント推定の変更。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1512.04202",
      "id": "OP091",
      "aliases": [
        "OP091"
      ],
      "title": "Preconditioned Stochastic Gradient Descent",
      "authors": "Xi-Lin Li",
      "year": 2015,
      "url": "https://arxiv.org/abs/1512.04202",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OP091",
          "key": "1512.04202",
          "title": "Preconditioned Stochastic Gradient Descent",
          "authors": "Xi-Lin Li",
          "year": 2015,
          "url": "https://arxiv.org/abs/1512.04202",
          "topic": "最適化",
          "evidence": "abstract",
          "publication_status": "arXiv初出2015、TNNLS版へのDOIあり",
          "checked_on": "2026-10-03",
          "reading_note": "パラメータ・勾配摂動からの前処理推定。",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "jmlr.org/papers/v8/sugiyama07a.html",
      "id": "GE01",
      "aliases": [
        "GE01"
      ],
      "title": "Covariate Shift Adaptation by Importance Weighted Cross Validation",
      "authors": [
        "Masashi Sugiyama",
        "Matthias Krauledat",
        "Klaus-Robert Müller"
      ],
      "year": 2007,
      "url": "https://www.jmlr.org/papers/v8/sugiyama07a.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE01",
          "title": "Covariate Shift Adaptation by Importance Weighted Cross Validation",
          "authors": [
            "Masashi Sugiyama",
            "Matthias Krauledat",
            "Klaus-Robert Müller"
          ],
          "year": 2007,
          "url": "https://www.jmlr.org/papers/v8/sugiyama07a.html",
          "topic": "distribution-shift",
          "publication_status": "JMLR 2007",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "共変量シフトでの重み付きCV。条件付き分布不変とsupportが必要。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "proceedings.mlr.press/v80/lipton18a.html",
      "id": "GE02",
      "aliases": [
        "GE02"
      ],
      "title": "Detecting and Correcting for Label Shift with Black Box Predictors",
      "authors": [
        "Zachary C. Lipton",
        "Yu-Xiang Wang",
        "Alexander J. Smola"
      ],
      "year": 2018,
      "url": "https://proceedings.mlr.press/v80/lipton18a.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "GE02",
          "title": "Detecting and Correcting for Label Shift with Black Box Predictors",
          "authors": [
            "Zachary C. Lipton",
            "Yu-Xiang Wang",
            "Alexander J. Smola"
          ],
          "year": 2018,
          "url": "https://proceedings.mlr.press/v80/lipton18a.html",
          "topic": "distribution-shift",
          "publication_status": "ICML 2018",
          "evidence": "full-text",
          "checked_on": "2026-10-03",
          "significance": "BBSE。本文§3–4のlabel shift・support・混同行列可逆性を確認。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "link.springer.com/article/10.1007/s10994-009-5152-4",
      "id": "GE03",
      "aliases": [
        "GE03"
      ],
      "title": "A theory of learning from different domains",
      "authors": [
        "Shai Ben-David",
        "John Blitzer",
        "Koby Crammer",
        "Alex Kulesza",
        "Fernando Pereira",
        "Jennifer Wortman Vaughan"
      ],
      "year": 2009,
      "url": "https://link.springer.com/article/10.1007/s10994-009-5152-4",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE03",
          "title": "A theory of learning from different domains",
          "authors": [
            "Shai Ben-David",
            "John Blitzer",
            "Koby Crammer",
            "Alex Kulesza",
            "Fernando Pereira",
            "Jennifer Wortman Vaughan"
          ],
          "year": 2009,
          "url": "https://link.springer.com/article/10.1007/s10994-009-5152-4",
          "topic": "distribution-shift",
          "publication_status": "online 2009; Machine Learning 2010",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "source誤差、domain divergence、共通予測可能性によるDA理論。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "jmlr.org/papers/v17/15-239.html",
      "id": "GE04",
      "aliases": [
        "GE04"
      ],
      "title": "Domain-Adversarial Training of Neural Networks",
      "authors": [
        "Yaroslav Ganin",
        "Evgeniya Ustinova",
        "Hana Ajakan",
        "Pascal Germain",
        "Hugo Larochelle",
        "François Laviolette",
        "Mario Marchand",
        "Victor Lempitsky"
      ],
      "year": 2015,
      "url": "https://jmlr.org/papers/v17/15-239.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE04",
          "title": "Domain-Adversarial Training of Neural Networks",
          "authors": [
            "Yaroslav Ganin",
            "Evgeniya Ustinova",
            "Hana Ajakan",
            "Pascal Germain",
            "Hugo Larochelle",
            "François Laviolette",
            "Mario Marchand",
            "Victor Lempitsky"
          ],
          "year": 2015,
          "url": "https://jmlr.org/papers/v17/15-239.html",
          "topic": "domain-adaptation",
          "publication_status": "arXiv 2015; JMLR 2016",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "DANN。sourceラベルとunlabeled targetを使うDA。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1907.02893",
      "id": "GE05",
      "aliases": [
        "GE05"
      ],
      "title": "Invariant Risk Minimization",
      "authors": [
        "Martin Arjovsky",
        "Léon Bottou",
        "Ishaan Gulrajani",
        "David Lopez-Paz"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1907.02893",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE05",
          "title": "Invariant Risk Minimization",
          "authors": [
            "Martin Arjovsky",
            "Léon Bottou",
            "Ishaan Gulrajani",
            "David Lopez-Paz"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1907.02893",
          "topic": "domain-generalization",
          "publication_status": "arXiv preprint",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "環境間で共通の最適分類器を持つ表現という目標。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "proceedings.mlr.press/v139/krueger21a.html",
      "id": "GE06",
      "aliases": [
        "GE06"
      ],
      "title": "Out-of-Distribution Generalization via Risk Extrapolation (REx)",
      "authors": [
        "David Krueger",
        "Ethan Caballero",
        "Joern-Henrik Jacobsen",
        "Amy Zhang",
        "Jonathan Binas",
        "Dinghuai Zhang",
        "Remi Le Priol",
        "Aaron Courville"
      ],
      "year": 2020,
      "url": "https://proceedings.mlr.press/v139/krueger21a.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE06",
          "title": "Out-of-Distribution Generalization via Risk Extrapolation (REx)",
          "authors": [
            "David Krueger",
            "Ethan Caballero",
            "Joern-Henrik Jacobsen",
            "Amy Zhang",
            "Jonathan Binas",
            "Dinghuai Zhang",
            "Remi Le Priol",
            "Aaron Courville"
          ],
          "year": 2020,
          "url": "https://proceedings.mlr.press/v139/krueger21a.html",
          "topic": "domain-generalization",
          "publication_status": "arXiv 2020; ICML 2021",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "環境ごとのrisk分散を抑制するV-REx。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1911.08731",
      "id": "GE07",
      "aliases": [
        "GE07"
      ],
      "title": "Distributionally Robust Neural Networks for Group Shifts: On the Importance of Regularization for Worst-Case Generalization",
      "authors": [
        "Shiori Sagawa",
        "Pang Wei Koh",
        "Tatsunori B. Hashimoto",
        "Percy Liang"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1911.08731",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE07",
          "title": "Distributionally Robust Neural Networks for Group Shifts: On the Importance of Regularization for Worst-Case Generalization",
          "authors": [
            "Shiori Sagawa",
            "Pang Wei Koh",
            "Tatsunori B. Hashimoto",
            "Percy Liang"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1911.08731",
          "topic": "group-robustness",
          "publication_status": "arXiv 2019; ICLR 2020",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "group DROと正則化・early stoppingの重要性。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2007.01434",
      "id": "GE08",
      "aliases": [
        "GE08"
      ],
      "title": "In Search of Lost Domain Generalization",
      "authors": [
        "Ishaan Gulrajani",
        "David Lopez-Paz"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2007.01434",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE08",
          "title": "In Search of Lost Domain Generalization",
          "authors": [
            "Ishaan Gulrajani",
            "David Lopez-Paz"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2007.01434",
          "topic": "domain-generalization",
          "publication_status": "arXiv 2020; ICLR 2021",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "DomainBed。model selectionを含めた統一評価。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2012.07421",
      "id": "GE09",
      "aliases": [
        "GE09"
      ],
      "title": "WILDS: A Benchmark of in-the-Wild Distribution Shifts",
      "authors": [
        "Pang Wei Koh",
        "Shiori Sagawa",
        "et al."
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2012.07421",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE09",
          "title": "WILDS: A Benchmark of in-the-Wild Distribution Shifts",
          "authors": [
            "Pang Wei Koh",
            "Shiori Sagawa",
            "et al."
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2012.07421",
          "topic": "distribution-shift",
          "publication_status": "arXiv 2020; ICML 2021",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "病院・時刻・地域等の自然なシフトを標準化。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1903.12261",
      "id": "GE10",
      "aliases": [
        "GE10"
      ],
      "title": "Benchmarking Neural Network Robustness to Common Corruptions and Perturbations",
      "authors": [
        "Dan Hendrycks",
        "Thomas Dietterich"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1903.12261",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE10",
          "title": "Benchmarking Neural Network Robustness to Common Corruptions and Perturbations",
          "authors": [
            "Dan Hendrycks",
            "Thomas Dietterich"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1903.12261",
          "topic": "corruption-robustness",
          "publication_status": "ICLR 2019",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "ImageNet-C/P。通常のcorruptionとadversarial perturbationを分ける。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "proceedings.mlr.press/v162/rame22a.html",
      "id": "GE11",
      "aliases": [
        "GE11"
      ],
      "title": "Fishr: Invariant Gradient Variances for Out-of-Distribution Generalization",
      "authors": [
        "Alexandre Rame",
        "Corentin Dancette",
        "Matthieu Cord"
      ],
      "year": 2021,
      "url": "https://proceedings.mlr.press/v162/rame22a.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "GE11",
          "title": "Fishr: Invariant Gradient Variances for Out-of-Distribution Generalization",
          "authors": [
            "Alexandre Rame",
            "Corentin Dancette",
            "Matthieu Cord"
          ],
          "year": 2021,
          "url": "https://proceedings.mlr.press/v162/rame22a.html",
          "topic": "domain-generalization",
          "publication_status": "arXiv 2021; ICML 2022",
          "evidence": "full-text",
          "checked_on": "2026-10-03",
          "significance": "本文§3.2の勾配分散とFisher/Hessianの条件付き関係を確認。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2109.01903",
      "id": "GE12",
      "aliases": [
        "GE12"
      ],
      "title": "Robust fine-tuning of zero-shot models",
      "authors": [
        "Mitchell Wortsman",
        "Gabriel Ilharco",
        "et al."
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2109.01903",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE12",
          "title": "Robust fine-tuning of zero-shot models",
          "authors": [
            "Mitchell Wortsman",
            "Gabriel Ilharco",
            "et al."
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2109.01903",
          "topic": "foundation-model-robustness",
          "publication_status": "arXiv 2021; CVPR 2022",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "WiSE-FT。zero-shotとfine-tunedの重みを補間。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2203.05482",
      "id": "GE13",
      "aliases": [
        "GE13",
        "SY012"
      ],
      "title": "Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time",
      "authors": [
        "Mitchell Wortsman",
        "Gabriel Ilharco",
        "et al."
      ],
      "year": 2022,
      "url": "https://arxiv.org/abs/2203.05482",
      "chapters": [
        "generalization",
        "systems-and-training"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE13",
          "title": "Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time",
          "authors": [
            "Mitchell Wortsman",
            "Gabriel Ilharco",
            "et al."
          ],
          "year": 2022,
          "url": "https://arxiv.org/abs/2203.05482",
          "topic": "foundation-model-robustness",
          "publication_status": "ICML 2022",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "同じ事前学習モデルからの重み平均による精度・頑健性改善。",
          "chapter": "generalization"
        },
        {
          "id": "SY012",
          "key": "2203.05482",
          "title": "Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time",
          "authors": "Mitchell Wortsman; Gabriel Ilharco; Samir Yitzhak Gadre; ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2203.05482",
          "topic": "並列学習・モデル統合",
          "evidence": "abstract",
          "publication_status": "ICML 2022",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 10 Mar 2022 (v1 ), last revised 1 Jul 2022 (this version, v3)",
          "reading_note": "共通初期値からのmodel weight平均。",
          "chapter": "systems-and-training"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2006.10726",
      "id": "GE14",
      "aliases": [
        "GE14"
      ],
      "title": "Tent: Fully Test-time Adaptation by Entropy Minimization",
      "authors": [
        "Dequan Wang",
        "Evan Shelhamer",
        "Shaoteng Liu",
        "Bruno Olshausen",
        "Trevor Darrell"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2006.10726",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE14",
          "title": "Tent: Fully Test-time Adaptation by Entropy Minimization",
          "authors": [
            "Dequan Wang",
            "Evan Shelhamer",
            "Shaoteng Liu",
            "Bruno Olshausen",
            "Trevor Darrell"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2006.10726",
          "topic": "test-time-adaptation",
          "publication_status": "arXiv 2020; ICLR 2021",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "test entropyを最小化しnormalizationパラメータを更新。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2203.13591",
      "id": "GE15",
      "aliases": [
        "GE15"
      ],
      "title": "Continual Test-Time Domain Adaptation",
      "authors": [
        "Qin Wang",
        "Olga Fink",
        "Luc Van Gool",
        "Dengxin Dai"
      ],
      "year": 2022,
      "url": "https://arxiv.org/abs/2203.13591",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE15",
          "title": "Continual Test-Time Domain Adaptation",
          "authors": [
            "Qin Wang",
            "Olga Fink",
            "Luc Van Gool",
            "Dengxin Dai"
          ],
          "year": 2022,
          "url": "https://arxiv.org/abs/2203.13591",
          "topic": "test-time-adaptation",
          "publication_status": "CVPR 2022",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "CoTTA。誤差蓄積と忘却に対応する継続適応。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "proceedings.mlr.press/v162/niu22a.html",
      "id": "GE16",
      "aliases": [
        "GE16"
      ],
      "title": "Efficient Test-Time Model Adaptation without Forgetting",
      "authors": [
        "Shuaicheng Niu",
        "Jiaxiang Wu",
        "Yifan Zhang",
        "Yaofo Chen",
        "Shijian Zheng",
        "Peilin Zhao",
        "Mingkui Tan"
      ],
      "year": 2022,
      "url": "https://proceedings.mlr.press/v162/niu22a.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE16",
          "title": "Efficient Test-Time Model Adaptation without Forgetting",
          "authors": [
            "Shuaicheng Niu",
            "Jiaxiang Wu",
            "Yifan Zhang",
            "Yaofo Chen",
            "Shijian Zheng",
            "Peilin Zhao",
            "Mingkui Tan"
          ],
          "year": 2022,
          "url": "https://proceedings.mlr.press/v162/niu22a.html",
          "topic": "test-time-adaptation",
          "publication_status": "ICML 2022",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "EATA。sample選択とFisher正則化。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2302.12400",
      "id": "GE17",
      "aliases": [
        "GE17"
      ],
      "title": "Towards Stable Test-Time Adaptation in Dynamic Wild World",
      "authors": [
        "Shuaicheng Niu",
        "Jiaxiang Wu",
        "Yifan Zhang",
        "Zhiquan Wen",
        "Yaofo Chen",
        "Peilin Zhao",
        "Mingkui Tan"
      ],
      "year": 2023,
      "url": "https://arxiv.org/abs/2302.12400",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE17",
          "title": "Towards Stable Test-Time Adaptation in Dynamic Wild World",
          "authors": [
            "Shuaicheng Niu",
            "Jiaxiang Wu",
            "Yifan Zhang",
            "Zhiquan Wen",
            "Yaofo Chen",
            "Peilin Zhao",
            "Mingkui Tan"
          ],
          "year": 2023,
          "url": "https://arxiv.org/abs/2302.12400",
          "topic": "test-time-adaptation",
          "publication_status": "ICLR 2023",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "SAR。batch size、混合シフト、label imbalanceによる崩壊を検討。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2306.03536",
      "id": "GE18",
      "aliases": [
        "GE18"
      ],
      "title": "On Pitfalls of Test-Time Adaptation",
      "authors": [
        "Hao Zhao",
        "Yuejiang Liu",
        "Alexandre Alahi",
        "Tao Lin"
      ],
      "year": 2023,
      "url": "https://arxiv.org/abs/2306.03536",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE18",
          "title": "On Pitfalls of Test-Time Adaptation",
          "authors": [
            "Hao Zhao",
            "Yuejiang Liu",
            "Alexandre Alahi",
            "Tao Lin"
          ],
          "year": 2023,
          "url": "https://arxiv.org/abs/2306.03536",
          "topic": "test-time-adaptation",
          "publication_status": "ICML 2023",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "TTAB。モデル選択・事前学習品質・shift種類の影響。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2411.03687",
      "id": "GE19",
      "aliases": [
        "GE19"
      ],
      "title": "Beyond Model Adaptation at Test Time: A Survey",
      "authors": [
        "Zehao Xiao",
        "Cees G. M. Snoek"
      ],
      "year": 2024,
      "url": "https://arxiv.org/abs/2411.03687",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE19",
          "title": "Beyond Model Adaptation at Test Time: A Survey",
          "authors": [
            "Zehao Xiao",
            "Cees G. M. Snoek"
          ],
          "year": 2024,
          "url": "https://arxiv.org/abs/2411.03687",
          "topic": "test-time-adaptation",
          "publication_status": "arXiv preprint",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "model/inference/normalization/sample/promptという整理を提供。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1610.02136",
      "id": "GE20",
      "aliases": [
        "GE20"
      ],
      "title": "A Baseline for Detecting Misclassified and Out-of-Distribution Examples in Neural Networks",
      "authors": [
        "Dan Hendrycks",
        "Kevin Gimpel"
      ],
      "year": 2016,
      "url": "https://arxiv.org/abs/1610.02136",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE20",
          "title": "A Baseline for Detecting Misclassified and Out-of-Distribution Examples in Neural Networks",
          "authors": [
            "Dan Hendrycks",
            "Kevin Gimpel"
          ],
          "year": 2016,
          "url": "https://arxiv.org/abs/1610.02136",
          "topic": "ood-detection",
          "publication_status": "arXiv 2016; ICLR 2017",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "最大softmax確率による検出baseline。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1706.02690",
      "id": "GE21",
      "aliases": [
        "GE21"
      ],
      "title": "Enhancing The Reliability of Out-of-distribution Image Detection in Neural Networks",
      "authors": [
        "Shiyu Liang",
        "Yixuan Li",
        "R. Srikant"
      ],
      "year": 2017,
      "url": "https://arxiv.org/abs/1706.02690",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE21",
          "title": "Enhancing The Reliability of Out-of-distribution Image Detection in Neural Networks",
          "authors": [
            "Shiyu Liang",
            "Yixuan Li",
            "R. Srikant"
          ],
          "year": 2017,
          "url": "https://arxiv.org/abs/1706.02690",
          "topic": "ood-detection",
          "publication_status": "arXiv 2017; ICLR 2018",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "ODIN。temperatureと入力摂動。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1812.04606",
      "id": "GE22",
      "aliases": [
        "GE22"
      ],
      "title": "Deep Anomaly Detection with Outlier Exposure",
      "authors": [
        "Dan Hendrycks",
        "Mantas Mazeika",
        "Thomas Dietterich"
      ],
      "year": 2018,
      "url": "https://arxiv.org/abs/1812.04606",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE22",
          "title": "Deep Anomaly Detection with Outlier Exposure",
          "authors": [
            "Dan Hendrycks",
            "Mantas Mazeika",
            "Thomas Dietterich"
          ],
          "year": 2018,
          "url": "https://arxiv.org/abs/1812.04606",
          "topic": "ood-detection",
          "publication_status": "arXiv 2018; ICLR 2019",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "補助outlier dataによる検出器の訓練。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2010.03759",
      "id": "GE23",
      "aliases": [
        "GE23"
      ],
      "title": "Energy-based Out-of-distribution Detection",
      "authors": [
        "Weitang Liu",
        "Xiaoyun Wang",
        "John D. Owens",
        "Yixuan Li"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2010.03759",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE23",
          "title": "Energy-based Out-of-distribution Detection",
          "authors": [
            "Weitang Liu",
            "Xiaoyun Wang",
            "John D. Owens",
            "Yixuan Li"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2010.03759",
          "topic": "ood-detection",
          "publication_status": "NeurIPS 2020",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "log-sum-exp energyを用いたスコアと学習。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2205.09310",
      "id": "GE24",
      "aliases": [
        "GE24"
      ],
      "title": "Mitigating Neural Network Overconfidence with Logit Normalization",
      "authors": [
        "Hongxin Wei",
        "Renchunzi Xie",
        "Hao Cheng",
        "Lei Feng",
        "Bo An",
        "Yixuan Li"
      ],
      "year": 2022,
      "url": "https://arxiv.org/abs/2205.09310",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE24",
          "title": "Mitigating Neural Network Overconfidence with Logit Normalization",
          "authors": [
            "Hongxin Wei",
            "Renchunzi Xie",
            "Hao Cheng",
            "Lei Feng",
            "Bo An",
            "Yixuan Li"
          ],
          "year": 2022,
          "url": "https://arxiv.org/abs/2205.09310",
          "topic": "ood-detection",
          "publication_status": "ICML 2022",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "LogitNorm。logit normの学習上の影響を分離。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2210.07242",
      "id": "GE25",
      "aliases": [
        "GE25"
      ],
      "title": "OpenOOD: Benchmarking Generalized Out-of-Distribution Detection",
      "authors": [
        "Jingkang Yang",
        "Pengyun Wang",
        "et al."
      ],
      "year": 2022,
      "url": "https://arxiv.org/abs/2210.07242",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE25",
          "title": "OpenOOD: Benchmarking Generalized Out-of-Distribution Detection",
          "authors": [
            "Jingkang Yang",
            "Pengyun Wang",
            "et al."
          ],
          "year": 2022,
          "url": "https://arxiv.org/abs/2210.07242",
          "topic": "ood-detection",
          "publication_status": "NeurIPS 2022 Datasets and Benchmarks",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "OOD detectionの統一benchmark。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2306.09301",
      "id": "GE26",
      "aliases": [
        "GE26"
      ],
      "title": "OpenOOD v1.5: Enhanced Benchmark for Out-of-Distribution Detection",
      "authors": [
        "Jingyang Zhang",
        "Jingkang Yang",
        "et al."
      ],
      "year": 2023,
      "url": "https://arxiv.org/abs/2306.09301",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE26",
          "title": "OpenOOD v1.5: Enhanced Benchmark for Out-of-Distribution Detection",
          "authors": [
            "Jingyang Zhang",
            "Jingkang Yang",
            "et al."
          ],
          "year": 2023,
          "url": "https://arxiv.org/abs/2306.09301",
          "topic": "ood-detection",
          "publication_status": "DMLR採択表示（arXiv v5, 2024-12-16）",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "ImageNet、foundation model、semantic/covariate同時シフトへ拡張。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2110.11334",
      "id": "GE27",
      "aliases": [
        "GE27"
      ],
      "title": "Generalized Out-of-Distribution Detection: A Survey",
      "authors": [
        "Jingkang Yang",
        "Kaiyang Zhou",
        "Yixuan Li",
        "Ziwei Liu"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2110.11334",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE27",
          "title": "Generalized Out-of-Distribution Detection: A Survey",
          "authors": [
            "Jingkang Yang",
            "Kaiyang Zhou",
            "Yixuan Li",
            "Ziwei Liu"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2110.11334",
          "topic": "ood-detection",
          "publication_status": "arXiv survey（2024改訂版確認）",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "anomaly/novelty/open-set/OOD/outlierのtaxonomy。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "proceedings.mlr.press/v70/guo17a.html",
      "id": "GE28",
      "aliases": [
        "GE28"
      ],
      "title": "On Calibration of Modern Neural Networks",
      "authors": [
        "Chuan Guo",
        "Geoff Pleiss",
        "Yu Sun",
        "Kilian Q. Weinberger"
      ],
      "year": 2017,
      "url": "https://proceedings.mlr.press/v70/guo17a.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "GE28",
          "title": "On Calibration of Modern Neural Networks",
          "authors": [
            "Chuan Guo",
            "Geoff Pleiss",
            "Yu Sun",
            "Kilian Q. Weinberger"
          ],
          "year": 2017,
          "url": "https://proceedings.mlr.press/v70/guo17a.html",
          "topic": "calibration",
          "publication_status": "ICML 2017",
          "evidence": "full-text",
          "checked_on": "2026-10-03",
          "significance": "本文§2のECE定義・NLLとtemperature scalingの位置付け。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/1706.04599"
      ]
    },
    {
      "canonical_key": "doi:10.1198/016214506000001437",
      "id": "GE29",
      "aliases": [
        "GE29"
      ],
      "title": "Strictly Proper Scoring Rules, Prediction, and Estimation",
      "authors": [
        "Tilmann Gneiting",
        "Adrian E. Raftery"
      ],
      "year": 2007,
      "url": "https://doi.org/10.1198/016214506000001437",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE29",
          "title": "Strictly Proper Scoring Rules, Prediction, and Estimation",
          "authors": [
            "Tilmann Gneiting",
            "Adrian E. Raftery"
          ],
          "year": 2007,
          "url": "https://doi.org/10.1198/016214506000001437",
          "topic": "calibration",
          "publication_status": "JASA 2007",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "確率予測のproper scoring ruleを整理。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1904.01685",
      "id": "GE30",
      "aliases": [
        "GE30"
      ],
      "title": "Measuring Calibration in Deep Learning",
      "authors": [
        "Jeremy Nixon",
        "Mike Dusenberry",
        "Ghassen Jerfel",
        "Timothy Nguyen",
        "Jeremiah Liu",
        "Linchuan Zhang",
        "Dustin Tran"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1904.01685",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE30",
          "title": "Measuring Calibration in Deep Learning",
          "authors": [
            "Jeremy Nixon",
            "Mike Dusenberry",
            "Ghassen Jerfel",
            "Timothy Nguyen",
            "Jeremiah Liu",
            "Linchuan Zhang",
            "Dustin Tran"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1904.01685",
          "topic": "calibration-metrics",
          "publication_status": "arXiv preprint（2020改訂）",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "SCE/ACE等、校正測定の設計依存性。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "proceedings.mlr.press/v80/kumar18a.html",
      "id": "GE31",
      "aliases": [
        "GE31"
      ],
      "title": "Trainable Calibration Measures for Neural Networks from Kernel Mean Embeddings",
      "authors": [
        "Aviral Kumar",
        "Sunita Sarawagi",
        "Ujjwal Jain"
      ],
      "year": 2018,
      "url": "https://proceedings.mlr.press/v80/kumar18a.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE31",
          "title": "Trainable Calibration Measures for Neural Networks from Kernel Mean Embeddings",
          "authors": [
            "Aviral Kumar",
            "Sunita Sarawagi",
            "Ujjwal Jain"
          ],
          "year": 2018,
          "url": "https://proceedings.mlr.press/v80/kumar18a.html",
          "topic": "calibration-metrics",
          "publication_status": "ICML 2018",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "kernel mean embeddingに基づくMMCE。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1909.10155",
      "id": "GE32",
      "aliases": [
        "GE32"
      ],
      "title": "Verified Uncertainty Calibration",
      "authors": [
        "Ananya Kumar",
        "Percy Liang",
        "Tengyu Ma"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1909.10155",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE32",
          "title": "Verified Uncertainty Calibration",
          "authors": [
            "Ananya Kumar",
            "Percy Liang",
            "Tengyu Ma"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1909.10155",
          "topic": "calibration-metrics",
          "publication_status": "NeurIPS 2019",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "scaling-binning、有限標本推定の信頼性。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2211.16886",
      "id": "GE33",
      "aliases": [
        "GE33"
      ],
      "title": "A Unifying Theory of Distance from Calibration",
      "authors": [
        "Jarosław Błasiok",
        "Parikshit Gopalan",
        "Lunjia Hu",
        "Preetum Nakkiran"
      ],
      "year": 2022,
      "url": "https://arxiv.org/abs/2211.16886",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "GE33",
          "title": "A Unifying Theory of Distance from Calibration",
          "authors": [
            "Jarosław Błasiok",
            "Parikshit Gopalan",
            "Lunjia Hu",
            "Preetum Nakkiran"
          ],
          "year": 2022,
          "url": "https://arxiv.org/abs/2211.16886",
          "topic": "calibration-metrics",
          "publication_status": "arXiv 2022; STOC 2023",
          "evidence": "full-text",
          "checked_on": "2026-10-03",
          "significance": "本文のECE連続性・推定可能性とconsistent calibration measureを確認。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1910.12656",
      "id": "GE34",
      "aliases": [
        "GE34"
      ],
      "title": "Beyond temperature scaling: Obtaining well-calibrated multiclass probabilities with Dirichlet calibration",
      "authors": [
        "Meelis Kull",
        "Miquel Perello-Nieto",
        "Markus Kängsepp",
        "Telmo Silva Filho",
        "Hao Song",
        "Peter Flach"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1910.12656",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE34",
          "title": "Beyond temperature scaling: Obtaining well-calibrated multiclass probabilities with Dirichlet calibration",
          "authors": [
            "Meelis Kull",
            "Miquel Perello-Nieto",
            "Markus Kängsepp",
            "Telmo Silva Filho",
            "Hao Song",
            "Peter Flach"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1910.12656",
          "topic": "calibration",
          "publication_status": "NeurIPS 2019",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "多クラス確率のDirichlet calibration。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://dirichletcal.github.io/documents/neurips2019/poster.pdf"
      ]
    },
    {
      "canonical_key": "arxiv:2002.09437",
      "id": "GE35",
      "aliases": [
        "GE35"
      ],
      "title": "Calibrating Deep Neural Networks using Focal Loss",
      "authors": [
        "Jishnu Mukhoti",
        "Viveka Kulharia",
        "Amartya Sanyal",
        "Stuart Golodetz",
        "Philip H. S. Torr",
        "Puneet K. Dokania"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2002.09437",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE35",
          "title": "Calibrating Deep Neural Networks using Focal Loss",
          "authors": [
            "Jishnu Mukhoti",
            "Viveka Kulharia",
            "Amartya Sanyal",
            "Stuart Golodetz",
            "Philip H. S. Torr",
            "Puneet K. Dokania"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2002.09437",
          "topic": "calibration",
          "publication_status": "NeurIPS 2020",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "学習時lossから校正改善を検討。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2106.07998",
      "id": "GE36",
      "aliases": [
        "GE36"
      ],
      "title": "Revisiting the Calibration of Modern Neural Networks",
      "authors": [
        "Matthias Minderer",
        "Josip Djolonga",
        "Rob Romijnders",
        "Frances Hubis",
        "Xiaohua Zhai",
        "Neil Houlsby",
        "Dustin Tran",
        "Mario Lucic"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2106.07998",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE36",
          "title": "Revisiting the Calibration of Modern Neural Networks",
          "authors": [
            "Matthias Minderer",
            "Josip Djolonga",
            "Rob Romijnders",
            "Frances Hubis",
            "Xiaohua Zhai",
            "Neil Houlsby",
            "Dustin Tran",
            "Mario Lucic"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2106.07998",
          "topic": "calibration",
          "publication_status": "NeurIPS 2021",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "モデル世代・architectureで校正傾向を再評価。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1612.01474",
      "id": "GE37",
      "aliases": [
        "GE37"
      ],
      "title": "Simple and Scalable Predictive Uncertainty Estimation using Deep Ensembles",
      "authors": [
        "Balaji Lakshminarayanan",
        "Alexander Pritzel",
        "Charles Blundell"
      ],
      "year": 2016,
      "url": "https://arxiv.org/abs/1612.01474",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE37",
          "title": "Simple and Scalable Predictive Uncertainty Estimation using Deep Ensembles",
          "authors": [
            "Balaji Lakshminarayanan",
            "Alexander Pritzel",
            "Charles Blundell"
          ],
          "year": 2016,
          "url": "https://arxiv.org/abs/1612.01474",
          "topic": "uncertainty",
          "publication_status": "arXiv 2016; NeurIPS 2017",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "独立訓練ensembleによる予測不確実性。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1506.02142",
      "id": "GE38",
      "aliases": [
        "GE38"
      ],
      "title": "Dropout as a Bayesian Approximation: Representing Model Uncertainty in Deep Learning",
      "authors": [
        "Yarin Gal",
        "Zoubin Ghahramani"
      ],
      "year": 2015,
      "url": "https://arxiv.org/abs/1506.02142",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE38",
          "title": "Dropout as a Bayesian Approximation: Representing Model Uncertainty in Deep Learning",
          "authors": [
            "Yarin Gal",
            "Zoubin Ghahramani"
          ],
          "year": 2015,
          "url": "https://arxiv.org/abs/1506.02142",
          "topic": "uncertainty",
          "publication_status": "arXiv 2015; ICML 2016",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "MC dropoutと近似Bayes推論の接続。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1906.02530",
      "id": "GE39",
      "aliases": [
        "GE39"
      ],
      "title": "Can You Trust Your Model's Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift",
      "authors": [
        "Yaniv Ovadia",
        "Emily Fertig",
        "Jie Ren",
        "Zachary Nado",
        "D Sculley",
        "Sebastian Nowozin",
        "Joshua V. Dillon",
        "Balaji Lakshminarayanan",
        "Jasper Snoek"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1906.02530",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE39",
          "title": "Can You Trust Your Model's Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift",
          "authors": [
            "Yaniv Ovadia",
            "Emily Fertig",
            "Jie Ren",
            "Zachary Nado",
            "D Sculley",
            "Sebastian Nowozin",
            "Joshua V. Dillon",
            "Balaji Lakshminarayanan",
            "Jasper Snoek"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1906.02530",
          "topic": "uncertainty",
          "publication_status": "NeurIPS 2019",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "dataset shift下でのuncertainty手法の比較。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2102.10395",
      "id": "GE40",
      "aliases": [
        "GE40"
      ],
      "title": "On Calibration and Out-of-domain Generalization",
      "authors": [
        "Yoav Wald",
        "Amir Feder",
        "Daniel Greenfeld",
        "Uri Shalit"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2102.10395",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE40",
          "title": "On Calibration and Out-of-domain Generalization",
          "authors": [
            "Yoav Wald",
            "Amir Feder",
            "Daniel Greenfeld",
            "Uri Shalit"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2102.10395",
          "topic": "calibration",
          "publication_status": "NeurIPS 2021",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "multi-domain calibrationと不変性の条件付き接続。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1807.00263",
      "id": "GE41",
      "aliases": [
        "GE41"
      ],
      "title": "Accurate Uncertainties for Deep Learning Using Calibrated Regression",
      "authors": [
        "Volodymyr Kuleshov",
        "Nathan Fenner",
        "Stefano Ermon"
      ],
      "year": 2018,
      "url": "https://arxiv.org/abs/1807.00263",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE41",
          "title": "Accurate Uncertainties for Deep Learning Using Calibrated Regression",
          "authors": [
            "Volodymyr Kuleshov",
            "Nathan Fenner",
            "Stefano Ermon"
          ],
          "year": 2018,
          "url": "https://arxiv.org/abs/1807.00263",
          "topic": "uncertainty",
          "publication_status": "ICML 2018",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "回帰の予測分布を校正する拡張。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2107.07511",
      "id": "GE42",
      "aliases": [
        "GE42"
      ],
      "title": "A Gentle Introduction to Conformal Prediction and Distribution-Free Uncertainty Quantification",
      "authors": [
        "Anastasios N. Angelopoulos",
        "Stephen Bates"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2107.07511",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE42",
          "title": "A Gentle Introduction to Conformal Prediction and Distribution-Free Uncertainty Quantification",
          "authors": [
            "Anastasios N. Angelopoulos",
            "Stephen Bates"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2107.07511",
          "topic": "conformal-prediction",
          "publication_status": "arXiv tutorial",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "conformal predictionの入門と応用。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1904.06019",
      "id": "GE43",
      "aliases": [
        "GE43"
      ],
      "title": "Conformal Prediction Under Covariate Shift",
      "authors": [
        "Ryan J. Tibshirani",
        "Rina Foygel Barber",
        "Emmanuel J. Candès",
        "Aaditya Ramdas"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1904.06019",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE43",
          "title": "Conformal Prediction Under Covariate Shift",
          "authors": [
            "Ryan J. Tibshirani",
            "Rina Foygel Barber",
            "Emmanuel J. Candès",
            "Aaditya Ramdas"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1904.06019",
          "topic": "conformal-prediction",
          "publication_status": "NeurIPS 2019",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "density ratioを用いるweighted conformal。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2106.00170",
      "id": "GE44",
      "aliases": [
        "GE44"
      ],
      "title": "Adaptive Conformal Inference Under Distribution Shift",
      "authors": [
        "Isaac Gibbs",
        "Emmanuel Candès"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2106.00170",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE44",
          "title": "Adaptive Conformal Inference Under Distribution Shift",
          "authors": [
            "Isaac Gibbs",
            "Emmanuel Candès"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2106.00170",
          "topic": "conformal-prediction",
          "publication_status": "NeurIPS 2021",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "時変分布に対する長期coverage frequency。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2208.02814",
      "id": "GE45",
      "aliases": [
        "GE45"
      ],
      "title": "Conformal Risk Control",
      "authors": [
        "Anastasios N. Angelopoulos",
        "Stephen Bates",
        "Adam Fisch",
        "Lihua Lei",
        "Tal Schuster"
      ],
      "year": 2022,
      "url": "https://arxiv.org/abs/2208.02814",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE45",
          "title": "Conformal Risk Control",
          "authors": [
            "Anastasios N. Angelopoulos",
            "Stephen Bates",
            "Adam Fisch",
            "Lihua Lei",
            "Tal Schuster"
          ],
          "year": 2022,
          "url": "https://arxiv.org/abs/2208.02814",
          "topic": "conformal-prediction",
          "publication_status": "arXiv 2022; ICLR 2024",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "単調lossの期待riskを制御する拡張。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1903.04684",
      "id": "GE46",
      "aliases": [
        "GE46"
      ],
      "title": "The limits of distribution-free conditional predictive inference",
      "authors": [
        "Rina Foygel Barber",
        "Emmanuel J. Candès",
        "Aaditya Ramdas",
        "Ryan J. Tibshirani"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1903.04684",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE46",
          "title": "The limits of distribution-free conditional predictive inference",
          "authors": [
            "Rina Foygel Barber",
            "Emmanuel J. Candès",
            "Aaditya Ramdas",
            "Ryan J. Tibshirani"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1903.04684",
          "topic": "conformal-prediction",
          "publication_status": "arXiv 2019; Information and Inference 2021",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "分布自由なconditional coverageの不可能性と緩和。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "proceedings.mlr.press/v267/van-der-laan25a.html",
      "id": "GE47",
      "aliases": [
        "GE47"
      ],
      "title": "Generalized Venn and Venn-Abers Calibration with Applications in Conformal Prediction",
      "authors": [
        "Lars Van Der Laan",
        "Ahmed Alaa"
      ],
      "year": 2025,
      "url": "https://proceedings.mlr.press/v267/van-der-laan25a.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE47",
          "title": "Generalized Venn and Venn-Abers Calibration with Applications in Conformal Prediction",
          "authors": [
            "Lars Van Der Laan",
            "Ahmed Alaa"
          ],
          "year": 2025,
          "url": "https://proceedings.mlr.press/v267/van-der-laan25a.html",
          "topic": "conformal-prediction",
          "publication_status": "ICML 2025",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "set-valued calibrationとconformalの接続。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1610.02413",
      "id": "GE48",
      "aliases": [
        "GE48"
      ],
      "title": "Equality of Opportunity in Supervised Learning",
      "authors": [
        "Moritz Hardt",
        "Eric Price",
        "Nathan Srebro"
      ],
      "year": 2016,
      "url": "https://arxiv.org/abs/1610.02413",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE48",
          "title": "Equality of Opportunity in Supervised Learning",
          "authors": [
            "Moritz Hardt",
            "Eric Price",
            "Nathan Srebro"
          ],
          "year": 2016,
          "url": "https://arxiv.org/abs/1610.02413",
          "topic": "fairness",
          "publication_status": "NeurIPS 2016",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "equalized odds/opportunityとpost-processing。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://proceedings.neurips.cc/paper_files/paper/2016/hash/6a9659feb1216f14f7384ba499518b38-Abstract.html"
      ]
    },
    {
      "canonical_key": "arxiv:1609.05807",
      "id": "GE49",
      "aliases": [
        "GE49"
      ],
      "title": "Inherent Trade-Offs in the Fair Determination of Risk Scores",
      "authors": [
        "Jon Kleinberg",
        "Sendhil Mullainathan",
        "Manish Raghavan"
      ],
      "year": 2016,
      "url": "https://arxiv.org/abs/1609.05807",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE49",
          "title": "Inherent Trade-Offs in the Fair Determination of Risk Scores",
          "authors": [
            "Jon Kleinberg",
            "Sendhil Mullainathan",
            "Manish Raghavan"
          ],
          "year": 2016,
          "url": "https://arxiv.org/abs/1609.05807",
          "topic": "fairness",
          "publication_status": "arXiv 2016; ITCS 2017",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "異なる公平性条件の一般的非両立性。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1709.02012",
      "id": "GE50",
      "aliases": [
        "GE50"
      ],
      "title": "On Fairness and Calibration",
      "authors": [
        "Geoff Pleiss",
        "Manish Raghavan",
        "Felix Wu",
        "Jon Kleinberg",
        "Kilian Q. Weinberger"
      ],
      "year": 2017,
      "url": "https://arxiv.org/abs/1709.02012",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE50",
          "title": "On Fairness and Calibration",
          "authors": [
            "Geoff Pleiss",
            "Manish Raghavan",
            "Felix Wu",
            "Jon Kleinberg",
            "Kilian Q. Weinberger"
          ],
          "year": 2017,
          "url": "https://arxiv.org/abs/1709.02012",
          "topic": "fairness",
          "publication_status": "NeurIPS 2017",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "校正とgroup間のerror制約の緊張。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "proceedings.mlr.press/v80/hebert-johnson18a.html",
      "id": "GE51",
      "aliases": [
        "GE51"
      ],
      "title": "Multicalibration: Calibration for the (Computationally-Identifiable) Masses",
      "authors": [
        "Úrsula Hébert-Johnson",
        "Michael P. Kim",
        "Omer Reingold",
        "Guy N. Rothblum"
      ],
      "year": 2017,
      "url": "https://proceedings.mlr.press/v80/hebert-johnson18a.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE51",
          "title": "Multicalibration: Calibration for the (Computationally-Identifiable) Masses",
          "authors": [
            "Úrsula Hébert-Johnson",
            "Michael P. Kim",
            "Omer Reingold",
            "Guy N. Rothblum"
          ],
          "year": 2017,
          "url": "https://proceedings.mlr.press/v80/hebert-johnson18a.html",
          "topic": "multicalibration",
          "publication_status": "arXiv 2017（旧題）; ICML 2018",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "重複する計算可能なsubgroup群での校正。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "proceedings.mlr.press/v80/agarwal18a.html",
      "id": "GE52",
      "aliases": [
        "GE52"
      ],
      "title": "A Reductions Approach to Fair Classification",
      "authors": [
        "Alekh Agarwal",
        "Alina Beygelzimer",
        "Miroslav Dudík",
        "John Langford",
        "Hanna Wallach"
      ],
      "year": 2018,
      "url": "https://proceedings.mlr.press/v80/agarwal18a.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE52",
          "title": "A Reductions Approach to Fair Classification",
          "authors": [
            "Alekh Agarwal",
            "Alina Beygelzimer",
            "Miroslav Dudík",
            "John Langford",
            "Hanna Wallach"
          ],
          "year": 2018,
          "url": "https://proceedings.mlr.press/v80/agarwal18a.html",
          "topic": "fairness",
          "publication_status": "ICML 2018",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "公平性制約問題をcost-sensitive分類へ還元。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "proceedings.mlr.press/v81/buolamwini18a.html",
      "id": "GE53",
      "aliases": [
        "GE53"
      ],
      "title": "Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification",
      "authors": [
        "Joy Buolamwini",
        "Timnit Gebru"
      ],
      "year": 2018,
      "url": "https://proceedings.mlr.press/v81/buolamwini18a.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE53",
          "title": "Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification",
          "authors": [
            "Joy Buolamwini",
            "Timnit Gebru"
          ],
          "year": 2018,
          "url": "https://proceedings.mlr.press/v81/buolamwini18a.html",
          "topic": "fairness",
          "publication_status": "FAT* 2018",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "交差属性を含む誤差監査の代表研究。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "fairmlbook.org",
      "id": "GE54",
      "aliases": [
        "GE54"
      ],
      "title": "Fairness and Machine Learning: Limitations and Opportunities",
      "authors": [
        "Solon Barocas",
        "Moritz Hardt",
        "Arvind Narayanan"
      ],
      "year": 2023,
      "url": "https://fairmlbook.org/",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "primary-resource"
      ],
      "records": [
        {
          "id": "GE54",
          "title": "Fairness and Machine Learning: Limitations and Opportunities",
          "authors": [
            "Solon Barocas",
            "Moritz Hardt",
            "Arvind Narayanan"
          ],
          "year": 2023,
          "url": "https://fairmlbook.org/",
          "topic": "fairness",
          "publication_status": "MIT Press 2023（書籍版）",
          "evidence": "primary-resource",
          "checked_on": "2026-10-03",
          "significance": "技術指標と規範・制度・社会的文脈を結ぶ。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "proceedings.mlr.press/v267/bharti25a.html",
      "id": "GE55",
      "aliases": [
        "GE55"
      ],
      "title": "Multiaccuracy and Multicalibration via Proxy Groups",
      "authors": [
        "Beepul Bharti",
        "Mary Versa Clemens-Sewall",
        "Paul Yi",
        "Jeremias Sulam"
      ],
      "year": 2025,
      "url": "https://proceedings.mlr.press/v267/bharti25a.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE55",
          "title": "Multiaccuracy and Multicalibration via Proxy Groups",
          "authors": [
            "Beepul Bharti",
            "Mary Versa Clemens-Sewall",
            "Paul Yi",
            "Jeremias Sulam"
          ],
          "year": 2025,
          "url": "https://proceedings.mlr.press/v267/bharti25a.html",
          "topic": "multicalibration",
          "publication_status": "ICML 2025",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "sensitive groupの欠損とproxy groupの条件を研究。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "proceedings.mlr.press/v336/hu26b.html",
      "id": "GE56",
      "aliases": [
        "GE56"
      ],
      "title": "Efficient Swap Multicalibration of Elicitable Properties",
      "authors": [
        "Lunjia Hu",
        "Haipeng Luo",
        "Spandan Senapati",
        "Vatsal Sharan"
      ],
      "year": 2026,
      "url": "https://proceedings.mlr.press/v336/hu26b.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE56",
          "title": "Efficient Swap Multicalibration of Elicitable Properties",
          "authors": [
            "Lunjia Hu",
            "Haipeng Luo",
            "Spandan Senapati",
            "Vatsal Sharan"
          ],
          "year": 2026,
          "url": "https://proceedings.mlr.press/v336/hu26b.html",
          "topic": "multicalibration",
          "publication_status": "COLT 2026",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "elicitable propertyに対するonline swap multicalibration。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1711.00350",
      "id": "GE57",
      "aliases": [
        "GE57"
      ],
      "title": "Generalization without systematicity: On the compositional skills of sequence-to-sequence recurrent networks",
      "authors": [
        "Brenden M. Lake",
        "Marco Baroni"
      ],
      "year": 2017,
      "url": "https://arxiv.org/abs/1711.00350",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE57",
          "title": "Generalization without systematicity: On the compositional skills of sequence-to-sequence recurrent networks",
          "authors": [
            "Brenden M. Lake",
            "Marco Baroni"
          ],
          "year": 2017,
          "url": "https://arxiv.org/abs/1711.00350",
          "topic": "compositional-generalization",
          "publication_status": "arXiv 2017; ICML 2018",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "SCANでsystematicityと通常の汎化を分離。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1912.09713",
      "id": "GE58",
      "aliases": [
        "GE58"
      ],
      "title": "Measuring Compositional Generalization: A Comprehensive Method on Realistic Data",
      "authors": [
        "Daniel Keysers",
        "Nathanael Schärli",
        "et al."
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1912.09713",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE58",
          "title": "Measuring Compositional Generalization: A Comprehensive Method on Realistic Data",
          "authors": [
            "Daniel Keysers",
            "Nathanael Schärli",
            "et al."
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1912.09713",
          "topic": "compositional-generalization",
          "publication_status": "arXiv 2019; ICLR 2020",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "CFQ。atom/compound divergenceに基づくsplit。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "aclanthology.org/2020.emnlp-main.731",
      "id": "GE59",
      "aliases": [
        "GE59"
      ],
      "title": "COGS: A Compositional Generalization Challenge Based on Semantic Interpretation",
      "authors": [
        "Najoung Kim",
        "Tal Linzen"
      ],
      "year": 2020,
      "url": "https://aclanthology.org/2020.emnlp-main.731/",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE59",
          "title": "COGS: A Compositional Generalization Challenge Based on Semantic Interpretation",
          "authors": [
            "Najoung Kim",
            "Tal Linzen"
          ],
          "year": 2020,
          "url": "https://aclanthology.org/2020.emnlp-main.731/",
          "topic": "compositional-generalization",
          "publication_status": "EMNLP 2020",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "語彙の再結合と構造的汎化を分けるsemantic parsing。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "aclanthology.org/2023.tacl-1.96",
      "id": "GE60",
      "aliases": [
        "GE60"
      ],
      "title": "ReCOGS: How Incidental Details of a Logical Form Overshadow an Evaluation of Semantic Interpretation",
      "authors": [
        "Zhengxuan Wu",
        "Christopher D. Manning",
        "Christopher Potts"
      ],
      "year": 2023,
      "url": "https://aclanthology.org/2023.tacl-1.96/",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE60",
          "title": "ReCOGS: How Incidental Details of a Logical Form Overshadow an Evaluation of Semantic Interpretation",
          "authors": [
            "Zhengxuan Wu",
            "Christopher D. Manning",
            "Christopher Potts"
          ],
          "year": 2023,
          "url": "https://aclanthology.org/2023.tacl-1.96/",
          "topic": "compositional-generalization",
          "publication_status": "TACL 2023",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "logical formの非意味的要因がbenchmarkに混入する問題。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "nature.com/articles/s41586-023-06668-3",
      "id": "GE61",
      "aliases": [
        "GE61"
      ],
      "title": "Human-like systematic generalization through a meta-learning neural network",
      "authors": [
        "Brenden M. Lake",
        "Marco Baroni"
      ],
      "year": 2023,
      "url": "https://www.nature.com/articles/s41586-023-06668-3",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "GE61",
          "title": "Human-like systematic generalization through a meta-learning neural network",
          "authors": [
            "Brenden M. Lake",
            "Marco Baroni"
          ],
          "year": 2023,
          "url": "https://www.nature.com/articles/s41586-023-06668-3",
          "topic": "compositional-generalization",
          "publication_status": "Nature 2023",
          "evidence": "full-text",
          "checked_on": "2026-10-03",
          "significance": "本文のmeta-learning for compositionalityと行動実験節を確認。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "aclanthology.org/2025.findings-emnlp.1133",
      "id": "GE62",
      "aliases": [
        "GE62"
      ],
      "title": "Distinguishing fair from unfair compositional generalization tasks",
      "authors": [
        "Ahmad Jabbar",
        "Cleo Condoravdi",
        "Christopher Potts"
      ],
      "year": 2025,
      "url": "https://aclanthology.org/2025.findings-emnlp.1133/",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE62",
          "title": "Distinguishing fair from unfair compositional generalization tasks",
          "authors": [
            "Ahmad Jabbar",
            "Cleo Condoravdi",
            "Christopher Potts"
          ],
          "year": 2025,
          "url": "https://aclanthology.org/2025.findings-emnlp.1133/",
          "topic": "compositional-generalization",
          "publication_status": "Findings of EMNLP 2025",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "学習データが正解ルールを識別できるかを吟味。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "aclanthology.org/2026.acl-long.409",
      "id": "GE63",
      "aliases": [
        "GE63"
      ],
      "title": "Investigating More Explainable and Partition-Free Compositionality Estimation for LLMs: A Rule-Generation Perspective",
      "authors": [
        "Ziyao Xu",
        "Cong Wang",
        "Houfeng Wang"
      ],
      "year": 2026,
      "url": "https://aclanthology.org/2026.acl-long.409/",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE63",
          "title": "Investigating More Explainable and Partition-Free Compositionality Estimation for LLMs: A Rule-Generation Perspective",
          "authors": [
            "Ziyao Xu",
            "Cong Wang",
            "Houfeng Wang"
          ],
          "year": 2026,
          "url": "https://aclanthology.org/2026.acl-long.409/",
          "topic": "compositional-generalization",
          "publication_status": "ACL 2026",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "program/rule生成を用いたcompositionality評価。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2602.24264",
      "id": "GE64",
      "aliases": [
        "GE64"
      ],
      "title": "Compositional Generalization Requires Linear, Orthogonal Representations in Vision Embedding Models",
      "authors": [
        "Arnas Uselis",
        "Andrea Dittadi",
        "Seong Joon Oh"
      ],
      "year": 2026,
      "url": "https://arxiv.org/abs/2602.24264",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "GE64",
          "title": "Compositional Generalization Requires Linear, Orthogonal Representations in Vision Embedding Models",
          "authors": [
            "Arnas Uselis",
            "Andrea Dittadi",
            "Seong Joon Oh"
          ],
          "year": 2026,
          "url": "https://arxiv.org/abs/2602.24264",
          "topic": "compositional-generalization",
          "publication_status": "ICML 2026（arXiv表示）",
          "evidence": "full-text",
          "checked_on": "2026-10-03",
          "significance": "v1本文§3–4/Proposition 1のlinear heads・GD+CE・binary grid条件を確認。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2606.27721",
      "id": "GE65",
      "aliases": [
        "GE65"
      ],
      "title": "Learning to Reason with Curriculum II: Compositional Generalization",
      "authors": [
        "Nived Rajaraman",
        "Audrey Huang",
        "Miroslav Dudik",
        "Robert Schapire",
        "Dylan Foster",
        "Akshay Krishnamurthy"
      ],
      "year": 2026,
      "url": "https://arxiv.org/abs/2606.27721",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE65",
          "title": "Learning to Reason with Curriculum II: Compositional Generalization",
          "authors": [
            "Nived Rajaraman",
            "Audrey Huang",
            "Miroslav Dudik",
            "Robert Schapire",
            "Dylan Foster",
            "Akshay Krishnamurthy"
          ],
          "year": 2026,
          "url": "https://arxiv.org/abs/2606.27721",
          "topic": "compositional-generalization",
          "publication_status": "arXiv preprint, 2026-06-26",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "semiautomataとcurriculum分解における標本複雑性。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "doi:10.1109/tac.1974.1100705",
      "id": "GE66",
      "aliases": [
        "GE66"
      ],
      "title": "A new look at the statistical model identification",
      "authors": [
        "Hirotugu Akaike"
      ],
      "year": 1974,
      "url": "https://doi.org/10.1109/TAC.1974.1100705",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "metadata"
      ],
      "records": [
        {
          "id": "GE66",
          "title": "A new look at the statistical model identification",
          "authors": [
            "Hirotugu Akaike"
          ],
          "year": 1974,
          "url": "https://doi.org/10.1109/TAC.1974.1100705",
          "topic": "information-criteria",
          "publication_status": "IEEE Transactions on Automatic Control 1974",
          "evidence": "metadata",
          "checked_on": "2026-10-03",
          "significance": "AICの代表原典。DOI先本文取得不可、著者自身の回顧と書誌で確認。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "ndlsearch.ndl.go.jp/books/R000000004-I1701125",
      "id": "GE67",
      "aliases": [
        "GE67"
      ],
      "title": "情報統計量の分布とモデルの適切さの規準",
      "authors": [
        "竹内啓"
      ],
      "year": 1976,
      "url": "https://ndlsearch.ndl.go.jp/books/R000000004-I1701125",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "metadata"
      ],
      "records": [
        {
          "id": "GE67",
          "title": "情報統計量の分布とモデルの適切さの規準",
          "authors": [
            "竹内啓"
          ],
          "year": 1976,
          "url": "https://ndlsearch.ndl.go.jp/books/R000000004-I1701125",
          "topic": "information-criteria",
          "publication_status": "数理科学 14(3), 12–18, 1976",
          "evidence": "metadata",
          "checked_on": "2026-10-03",
          "significance": "TIC原典。国会図書館書誌のみ確認、本文未取得。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "jmlr.org/papers/v11/watanabe10a.html",
      "id": "GE68",
      "aliases": [
        "GE68"
      ],
      "title": "Asymptotic Equivalence of Bayes Cross Validation and Widely Applicable Information Criterion in Singular Learning Theory",
      "authors": [
        "Sumio Watanabe"
      ],
      "year": 2010,
      "url": "https://www.jmlr.org/papers/v11/watanabe10a.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE68",
          "title": "Asymptotic Equivalence of Bayes Cross Validation and Widely Applicable Information Criterion in Singular Learning Theory",
          "authors": [
            "Sumio Watanabe"
          ],
          "year": 2010,
          "url": "https://www.jmlr.org/papers/v11/watanabe10a.html",
          "topic": "information-criteria",
          "publication_status": "JMLR 2010",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "特異モデルでのBayes CVとWAICの漸近同値。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1507.04544",
      "id": "GE69",
      "aliases": [
        "GE69"
      ],
      "title": "Practical Bayesian model evaluation using leave-one-out cross-validation and WAIC",
      "authors": [
        "Aki Vehtari",
        "Andrew Gelman",
        "Jonah Gabry"
      ],
      "year": 2015,
      "url": "https://arxiv.org/abs/1507.04544",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE69",
          "title": "Practical Bayesian model evaluation using leave-one-out cross-validation and WAIC",
          "authors": [
            "Aki Vehtari",
            "Andrew Gelman",
            "Jonah Gabry"
          ],
          "year": 2015,
          "url": "https://arxiv.org/abs/1507.04544",
          "topic": "information-criteria",
          "publication_status": "arXiv 2015; Statistics and Computing 2017",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "PSIS-LOOとWAICの有限標本診断。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1906.07774",
      "id": "GE70",
      "aliases": [
        "GE70",
        "MD08"
      ],
      "title": "On the interplay between noise and curvature and its effect on optimization and generalization",
      "authors": [
        "Valentin Thomas",
        "Fabian Pedregosa",
        "Bart van Merriënboer",
        "Pierre-Antoine Mangazol",
        "Yoshua Bengio",
        "Nicolas Le Roux"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1906.07774",
      "chapters": [
        "generalization",
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "full-text",
        "abstract"
      ],
      "records": [
        {
          "id": "GE70",
          "title": "On the interplay between noise and curvature and its effect on optimization and generalization",
          "authors": [
            "Valentin Thomas",
            "Fabian Pedregosa",
            "Bart van Merriënboer",
            "Pierre-Antoine Mangazol",
            "Yoshua Bengio",
            "Nicolas Le Roux"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1906.07774",
          "topic": "information-criteria",
          "publication_status": "arXiv 2019; AISTATS 2020",
          "evidence": "full-text",
          "checked_on": "2026-10-03",
          "significance": "本文§4.1のTICとFisher/Hessian/勾配共分散の区別を確認。",
          "chapter": "generalization"
        },
        {
          "id": "MD08",
          "title": "On the interplay between noise and curvature and its effect on optimization and generalization",
          "authors": [
            "Valentin Thomas",
            "Fabian Pedregosa",
            "Bart van Merriënboer",
            "Pierre-Antoine Manzagol",
            "Yoshua Bengio",
            "Nicolas Le Roux"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/1906.07774",
          "topic": "Fisher",
          "evidence": "abstract",
          "publication_status": "AISTATS 2020, published (preprint 2019)",
          "checked_on": "2026-10-03",
          "significance": "Hessian、Fisher、勾配共分散の役割を整理",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2207.05221",
      "id": "GE71",
      "aliases": [
        "GE71"
      ],
      "title": "Language Models (Mostly) Know What They Know",
      "authors": [
        "Saurav Kadavath",
        "Tom Conerly",
        "et al."
      ],
      "year": 2022,
      "url": "https://arxiv.org/abs/2207.05221",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE71",
          "title": "Language Models (Mostly) Know What They Know",
          "authors": [
            "Saurav Kadavath",
            "Tom Conerly",
            "et al."
          ],
          "year": 2022,
          "url": "https://arxiv.org/abs/2207.05221",
          "topic": "llm-calibration",
          "publication_status": "arXiv preprint",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "P(True)/P(IK)による自己評価とtask外校正の限界。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2302.09664",
      "id": "GE72",
      "aliases": [
        "GE72"
      ],
      "title": "Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation",
      "authors": [
        "Lorenz Kuhn",
        "Yarin Gal",
        "Sebastian Farquhar"
      ],
      "year": 2023,
      "url": "https://arxiv.org/abs/2302.09664",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE72",
          "title": "Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation",
          "authors": [
            "Lorenz Kuhn",
            "Yarin Gal",
            "Sebastian Farquhar"
          ],
          "year": 2023,
          "url": "https://arxiv.org/abs/2302.09664",
          "topic": "llm-calibration",
          "publication_status": "ICLR 2023",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "意味的同値を集約したsemantic entropy。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2311.13240",
      "id": "GE73",
      "aliases": [
        "GE73"
      ],
      "title": "On the Calibration of Large Language Models and Alignment",
      "authors": [
        "Chiwei Zhu",
        "Benfeng Xu",
        "Quan Wang",
        "Yongdong Zhang",
        "Zhendong Mao"
      ],
      "year": 2023,
      "url": "https://arxiv.org/abs/2311.13240",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE73",
          "title": "On the Calibration of Large Language Models and Alignment",
          "authors": [
            "Chiwei Zhu",
            "Benfeng Xu",
            "Quan Wang",
            "Yongdong Zhang",
            "Zhendong Mao"
          ],
          "year": 2023,
          "url": "https://arxiv.org/abs/2311.13240",
          "topic": "llm-calibration",
          "publication_status": "Findings of EMNLP 2023（arXiv表示）",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "pretraining/alignment過程を通じたLLM校正の分析。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2402.13904",
      "id": "GE74",
      "aliases": [
        "GE74"
      ],
      "title": "Calibrating Large Language Models with Sample Consistency",
      "authors": [
        "Qing Lyu",
        "Kumar Shridhar",
        "Chaitanya Malaviya",
        "Li Zhang",
        "Yanai Elazar",
        "Niket Tandon",
        "Marianna Apidianaki",
        "Mrinmaya Sachan",
        "Chris Callison-Burch"
      ],
      "year": 2024,
      "url": "https://arxiv.org/abs/2402.13904",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE74",
          "title": "Calibrating Large Language Models with Sample Consistency",
          "authors": [
            "Qing Lyu",
            "Kumar Shridhar",
            "Chaitanya Malaviya",
            "Li Zhang",
            "Yanai Elazar",
            "Niket Tandon",
            "Marianna Apidianaki",
            "Mrinmaya Sachan",
            "Chris Callison-Burch"
          ],
          "year": 2024,
          "url": "https://arxiv.org/abs/2402.13904",
          "topic": "llm-calibration",
          "publication_status": "AAAI 2024（arXiv v2表示、2026-02-23改訂）",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "複数sampleの整合性をconfidenceに変換。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "proceedings.mlr.press/v306/jawad26a.html",
      "id": "GE75",
      "aliases": [
        "GE75"
      ],
      "title": "CaliDist: Calibrating Large Language Models via Behavioral Robustness to Distraction",
      "authors": [
        "Mohammad Anas Jawad",
        "Cornelia Caragea"
      ],
      "year": 2026,
      "url": "https://proceedings.mlr.press/v306/jawad26a.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE75",
          "title": "CaliDist: Calibrating Large Language Models via Behavioral Robustness to Distraction",
          "authors": [
            "Mohammad Anas Jawad",
            "Cornelia Caragea"
          ],
          "year": 2026,
          "url": "https://proceedings.mlr.press/v306/jawad26a.html",
          "topic": "llm-calibration",
          "publication_status": "ICML 2026",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "semantic distractorへの応答安定性を用いたpost-hoc calibration。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2607.01657",
      "id": "GE76",
      "aliases": [
        "GE76"
      ],
      "title": "Domain Generalization via Text-Anchored Information Bottleneck",
      "authors": [
        "Eunyi Lyou",
        "Yunjeong Choi",
        "Junho Lee",
        "Joonseok Lee"
      ],
      "year": 2026,
      "url": "https://arxiv.org/abs/2607.01657",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE76",
          "title": "Domain Generalization via Text-Anchored Information Bottleneck",
          "authors": [
            "Eunyi Lyou",
            "Yunjeong Choi",
            "Junho Lee",
            "Joonseok Lee"
          ],
          "year": 2026,
          "url": "https://arxiv.org/abs/2607.01657",
          "topic": "domain-generalization",
          "publication_status": "ECCV 2026採択（arXiv表示）, 2026-07-02",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "言語埋め込みをDGの不変性の教師信号にする。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2606.25665",
      "id": "GE77",
      "aliases": [
        "GE77"
      ],
      "title": "Learning Subset-Shared Invariances for Domain Generalization with Mixture-of-Experts",
      "authors": [
        "Tien-Hung Nguyen",
        "Tien-Dat Tran",
        "M.-Duong Nguyen",
        "Kok-Seng Wong"
      ],
      "year": 2026,
      "url": "https://arxiv.org/abs/2606.25665",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE77",
          "title": "Learning Subset-Shared Invariances for Domain Generalization with Mixture-of-Experts",
          "authors": [
            "Tien-Hung Nguyen",
            "Tien-Dat Tran",
            "M.-Duong Nguyen",
            "Kok-Seng Wong"
          ],
          "year": 2026,
          "url": "https://arxiv.org/abs/2606.25665",
          "topic": "domain-generalization",
          "publication_status": "arXiv preprint, 2026-06-24",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "全環境共通ではなくdomain部分集合で共有する不変性。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2601.11022",
      "id": "GE78",
      "aliases": [
        "GE78"
      ],
      "title": "Matching High-Dimensional Geometric Quantiles for Test-Time Adaptation of Transformers and Convolutional Networks Alike",
      "authors": [
        "Sravan Danda",
        "Aditya Challa",
        "Shlok Mehendale",
        "Snehanshu Saha"
      ],
      "year": 2026,
      "url": "https://arxiv.org/abs/2601.11022",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE78",
          "title": "Matching High-Dimensional Geometric Quantiles for Test-Time Adaptation of Transformers and Convolutional Networks Alike",
          "authors": [
            "Sravan Danda",
            "Aditya Challa",
            "Shlok Mehendale",
            "Snehanshu Saha"
          ],
          "year": 2026,
          "url": "https://arxiv.org/abs/2601.11022",
          "topic": "test-time-adaptation",
          "publication_status": "arXiv preprint, 2026-01-16",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "幾何quantile整合によるinput adapter。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2601.10836",
      "id": "GE79",
      "aliases": [
        "GE79"
      ],
      "title": "One Model, Many Behaviors: Training-Induced Effects on Out-of-Distribution Detection",
      "authors": [
        "Gerhard Krumpl",
        "Henning Avenhaus",
        "Horst Possegger"
      ],
      "year": 2026,
      "url": "https://arxiv.org/abs/2601.10836",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE79",
          "title": "One Model, Many Behaviors: Training-Induced Effects on Out-of-Distribution Detection",
          "authors": [
            "Gerhard Krumpl",
            "Henning Avenhaus",
            "Horst Possegger"
          ],
          "year": 2026,
          "url": "https://arxiv.org/abs/2601.10836",
          "topic": "ood-detection",
          "publication_status": "WACV 2026, arXiv 2026-01-15",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "同architectureでもtraining recipeとdetectorの相互作用が大きい。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2604.21772",
      "id": "GE80",
      "aliases": [
        "GE80"
      ],
      "title": "Back to Source: Open-Set Continual Test-Time Adaptation via Domain Compensation",
      "authors": [
        "Yingkai Yang",
        "Chaoqi Chen",
        "Hui Huang"
      ],
      "year": 2026,
      "url": "https://arxiv.org/abs/2604.21772",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE80",
          "title": "Back to Source: Open-Set Continual Test-Time Adaptation via Domain Compensation",
          "authors": [
            "Yingkai Yang",
            "Chaoqi Chen",
            "Hui Huang"
          ],
          "year": 2026,
          "url": "https://arxiv.org/abs/2604.21772",
          "topic": "test-time-adaptation",
          "publication_status": "CVPR 2026, arXiv 2026-04-23",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "domain shiftとunknown classesを同時に扱う継続TTA。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2206.13089",
      "id": "GE81",
      "aliases": [
        "GE81"
      ],
      "title": "Agreement-on-the-Line: Predicting the Performance of Neural Networks under Distribution Shift",
      "authors": [
        "Christina Baek",
        "Yiding Jiang",
        "Aditi Raghunathan",
        "Zico Kolter"
      ],
      "year": 2022,
      "url": "https://arxiv.org/abs/2206.13089",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE81",
          "title": "Agreement-on-the-Line: Predicting the Performance of Neural Networks under Distribution Shift",
          "authors": [
            "Christina Baek",
            "Yiding Jiang",
            "Aditi Raghunathan",
            "Zico Kolter"
          ],
          "year": 2022,
          "url": "https://arxiv.org/abs/2206.13089",
          "topic": "risk-estimation",
          "publication_status": "NeurIPS 2022",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "複数モデルのID/OOD agreementからtarget accuracyを予測する経験的関係。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2106.13799",
      "id": "GE82",
      "aliases": [
        "GE82"
      ],
      "title": "Assessing Generalization of SGD via Disagreement",
      "authors": [
        "Yiding Jiang",
        "Vaishnavh Nagarajan",
        "Christina Baek",
        "J. Zico Kolter"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2106.13799",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE82",
          "title": "Assessing Generalization of SGD via Disagreement",
          "authors": [
            "Yiding Jiang",
            "Vaishnavh Nagarajan",
            "Christina Baek",
            "J. Zico Kolter"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2106.13799",
          "topic": "risk-estimation",
          "publication_status": "arXiv 2021; ICLR 2022（公開PDF表紙で確認。掲載題名はAssessing Generalization via Disagreement）",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "異なるSGD run間のdisagreementとerror、ensemble calibrationの関係。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://openreview.net/pdf?id=WvOGCEAQhxl"
      ]
    },
    {
      "canonical_key": "arxiv:2310.01202",
      "id": "GE83",
      "aliases": [
        "GE83"
      ],
      "title": "Unified Uncertainty Calibration",
      "authors": [
        "Kamalika Chaudhuri",
        "David Lopez-Paz"
      ],
      "year": 2023,
      "url": "https://arxiv.org/abs/2310.01202",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE83",
          "title": "Unified Uncertainty Calibration",
          "authors": [
            "Kamalika Chaudhuri",
            "David Lopez-Paz"
          ],
          "year": 2023,
          "url": "https://arxiv.org/abs/2310.01202",
          "topic": "uncertainty",
          "publication_status": "arXiv preprint（2024改訂版確認）",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "aleatoric/epistemic uncertaintyを共同で校正する枠組み。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "proceedings.mlr.press/v162/gulrajani22a.html",
      "id": "GE84",
      "aliases": [
        "GE84"
      ],
      "title": "Identifiability Conditions for Domain Adaptation",
      "authors": [
        "Ishaan Gulrajani",
        "Tatsunori Hashimoto"
      ],
      "year": 2022,
      "url": "https://proceedings.mlr.press/v162/gulrajani22a.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE84",
          "title": "Identifiability Conditions for Domain Adaptation",
          "authors": [
            "Ishaan Gulrajani",
            "Tatsunori Hashimoto"
          ],
          "year": 2022,
          "url": "https://proceedings.mlr.press/v162/gulrajani22a.html",
          "topic": "domain-adaptation",
          "publication_status": "ICML 2022",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "bijective domain mapping、特に線形mapの識別可能性を解析。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2106.03721",
      "id": "GE85",
      "aliases": [
        "GE85"
      ],
      "title": "OoD-Bench: Quantifying and Understanding Two Dimensions of Out-of-Distribution Generalization",
      "authors": [
        "Nanyang Ye",
        "Kaican Li",
        "Haoyue Bai",
        "Runpeng Yu",
        "Lanqing Hong",
        "Fengwei Zhou",
        "Zhenguo Li",
        "Jun Zhu"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2106.03721",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE85",
          "title": "OoD-Bench: Quantifying and Understanding Two Dimensions of Out-of-Distribution Generalization",
          "authors": [
            "Nanyang Ye",
            "Kaican Li",
            "Haoyue Bai",
            "Runpeng Yu",
            "Lanqing Hong",
            "Fengwei Zhou",
            "Zhenguo Li",
            "Jun Zhu"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2106.03721",
          "topic": "domain-generalization",
          "publication_status": "arXiv 2021; CVPR 2022",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "diversity/correlation shiftによるbenchmarkと手法の分析。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2004.07780",
      "id": "GE86",
      "aliases": [
        "GE86"
      ],
      "title": "Shortcut Learning in Deep Neural Networks",
      "authors": [
        "Robert Geirhos",
        "Jörn-Henrik Jacobsen",
        "Claudio Michaelis",
        "Richard Zemel",
        "Wieland Brendel",
        "Matthias Bethge",
        "Felix A. Wichmann"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2004.07780",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE86",
          "title": "Shortcut Learning in Deep Neural Networks",
          "authors": [
            "Robert Geirhos",
            "Jörn-Henrik Jacobsen",
            "Claudio Michaelis",
            "Richard Zemel",
            "Wieland Brendel",
            "Matthias Bethge",
            "Felix A. Wichmann"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2004.07780",
          "topic": "domain-generalization",
          "publication_status": "Nature Machine Intelligence 2020",
          "evidence": "abstract",
          "checked_on": "2026-10-03",
          "significance": "標準benchmarkで通用する規則が移送に失敗するshortcutの視点。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1710.06924",
      "id": "GE087",
      "aliases": [
        "GE087"
      ],
      "title": "VisDA: The Visual Domain Adaptation Challenge",
      "authors": [
        "Xingchao Peng",
        "Ben Usman",
        "Neela Kaushik",
        "Judy Hoffman",
        "Dequan Wang",
        "Kate Saenko"
      ],
      "year": 2017,
      "url": "https://arxiv.org/abs/1710.06924",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE087",
          "title": "VisDA: The Visual Domain Adaptation Challenge",
          "authors": [
            "Xingchao Peng",
            "Ben Usman",
            "Neela Kaushik",
            "Judy Hoffman",
            "Dequan Wang",
            "Kate Saenko"
          ],
          "year": 2017,
          "url": "https://arxiv.org/abs/1710.06924",
          "topic": "domain-adaptation; benchmark",
          "evidence": "abstract",
          "publication_status": "arXiv preprint, 2017",
          "checked_on": "2026-10-03",
          "significance": "VisDAのsynthetic-to-real適応。対象ドメインのラベルなしデータを使うUDAと、使わないDGの比較条件を分ける。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/pdf/1710.06924.pdf",
        "https://arxiv.org/abs/1710.06924"
      ]
    },
    {
      "canonical_key": "arxiv:2106.15831",
      "id": "GE088",
      "aliases": [
        "GE088"
      ],
      "title": "The Evolution of Out-of-Distribution Robustness Throughout Fine-Tuning",
      "authors": [
        "Anders Andreassen",
        "Yasaman Bahri",
        "Behnam Neyshabur",
        "Rebecca Roelofs"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2106.15831",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE088",
          "title": "The Evolution of Out-of-Distribution Robustness Throughout Fine-Tuning",
          "authors": [
            "Anders Andreassen",
            "Yasaman Bahri",
            "Behnam Neyshabur",
            "Rebecca Roelofs"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2106.15831",
          "topic": "fine-tuning; OOD generalization",
          "evidence": "abstract",
          "publication_status": "arXiv preprint, 2021（正式掲載先未照合）",
          "checked_on": "2026-10-03",
          "significance": "fine-tuning中のeffective robustnessが収束時に消える場合を追跡し、checkpoint選択の重要性を示す。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2106.15831"
      ]
    },
    {
      "canonical_key": "arxiv:2106.04496",
      "id": "GE089",
      "aliases": [
        "GE089"
      ],
      "title": "Towards a Theoretical Framework of Out-of-Distribution Generalization",
      "authors": [
        "Haotian Ye",
        "Chuanlong Xie",
        "Tianle Cai",
        "Ruichen Li",
        "Zhenguo Li",
        "Liwei Wang"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2106.04496",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE089",
          "title": "Towards a Theoretical Framework of Out-of-Distribution Generalization",
          "authors": [
            "Haotian Ye",
            "Chuanlong Xie",
            "Tianle Cai",
            "Ruichen Li",
            "Zhenguo Li",
            "Liwei Wang"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2106.04496",
          "topic": "domain-generalization; theory",
          "evidence": "abstract",
          "publication_status": "arXiv preprint, 2021（正式掲載先未照合）",
          "checked_on": "2026-10-03",
          "significance": "expansion functionによって学習環境での不変性が未知環境へ拡張される条件を定量化。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2106.04496"
      ]
    },
    {
      "canonical_key": "arxiv:2104.04975",
      "id": "GE090",
      "aliases": [
        "GE090"
      ],
      "title": "Scalable Marginal Likelihood Estimation for Model Selection in Deep Learning",
      "authors": [
        "Alexander Immer",
        "Matthias Bauer",
        "Vincent Fortuin",
        "Gunnar Rätsch",
        "Mohammad Emtiyaz Khan"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2104.04975",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE090",
          "title": "Scalable Marginal Likelihood Estimation for Model Selection in Deep Learning",
          "authors": [
            "Alexander Immer",
            "Matthias Bauer",
            "Vincent Fortuin",
            "Gunnar Rätsch",
            "Mohammad Emtiyaz Khan"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2104.04975",
          "topic": "model-selection; uncertainty",
          "evidence": "abstract",
          "publication_status": "ICML 2021",
          "checked_on": "2026-10-03",
          "significance": "Laplace・Gauss–Newton近似による周辺尤度推定をモデル選択に用いる。TICの頻度論的補正とは目的が異なる。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2104.04975"
      ]
    },
    {
      "canonical_key": "arxiv:2005.01757",
      "id": "GE091",
      "aliases": [
        "GE091"
      ],
      "title": "Sample Complexity of Uniform Convergence for Multicalibration",
      "authors": [
        "Eliran Shabat",
        "Lee Cohen",
        "Yishay Mansour"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2005.01757",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE091",
          "title": "Sample Complexity of Uniform Convergence for Multicalibration",
          "authors": [
            "Eliran Shabat",
            "Lee Cohen",
            "Yishay Mansour"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2005.01757",
          "topic": "multicalibration; sample-complexity",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2020",
          "checked_on": "2026-10-03",
          "significance": "multicalibration誤差の一様収束と必要標本数を解析し、予測誤差と校正誤差を区別。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2005.01757"
      ]
    },
    {
      "canonical_key": "arxiv:1812.04597",
      "id": "GE092",
      "aliases": [
        "GE092"
      ],
      "title": "Preventing Failures Due to Dataset Shift: Learning Predictive Models That Transport",
      "authors": [
        "Adarsh Subbaswamy",
        "Peter Schulam",
        "Suchi Saria"
      ],
      "year": 2018,
      "url": "https://arxiv.org/abs/1812.04597",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE092",
          "title": "Preventing Failures Due to Dataset Shift: Learning Predictive Models That Transport",
          "authors": [
            "Adarsh Subbaswamy",
            "Peter Schulam",
            "Suchi Saria"
          ],
          "year": 2018,
          "url": "https://arxiv.org/abs/1812.04597",
          "topic": "causal-transfer; distribution-shift",
          "evidence": "abstract",
          "publication_status": "arXiv 2018; AISTATS 2019",
          "checked_on": "2026-10-03",
          "significance": "変化する機構に関するcausal selection diagramの知識を使うSurgery Estimator。無仮定の移送保証ではない。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/1812.04597"
      ]
    },
    {
      "canonical_key": "arxiv:2003.06820",
      "id": "GE093",
      "aliases": [
        "GE093"
      ],
      "title": "Intra Order-preserving Functions for Calibration of Multi-Class Neural Networks",
      "authors": [
        "Amir Rahimi",
        "Amirreza Shaban",
        "Ching-An Cheng",
        "Richard Hartley",
        "Byron Boots"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2003.06820",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE093",
          "title": "Intra Order-preserving Functions for Calibration of Multi-Class Neural Networks",
          "authors": [
            "Amir Rahimi",
            "Amirreza Shaban",
            "Ching-An Cheng",
            "Richard Hartley",
            "Byron Boots"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2003.06820",
          "topic": "calibration",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2020",
          "checked_on": "2026-10-03",
          "significance": "クラス内の順位を保存する柔軟なpost-hoc校正を構成し、top-k予測の保存と校正を両立させる。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2003.06820"
      ]
    },
    {
      "canonical_key": "arxiv:2103.02667",
      "id": "GE094",
      "aliases": [
        "GE094"
      ],
      "title": "Out of Distribution Generalization in Machine Learning",
      "authors": [
        "Martin Arjovsky"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2103.02667",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE094",
          "title": "Out of Distribution Generalization in Machine Learning",
          "authors": [
            "Martin Arjovsky"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2103.02667",
          "topic": "domain-generalization; theory",
          "evidence": "abstract",
          "publication_status": "博士論文のarXiv公開版, 2021",
          "checked_on": "2026-10-03",
          "significance": "因果性・環境不変性・OOD汎化の前提を体系的に扱う。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2103.02667"
      ]
    },
    {
      "canonical_key": "arxiv:2106.03783",
      "id": "GE095",
      "aliases": [
        "GE095"
      ],
      "title": "An Information-theoretic Approach to Distribution Shifts",
      "authors": [
        "Marco Federici",
        "Ryota Tomioka",
        "Patrick Forré"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2106.03783",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE095",
          "title": "An Information-theoretic Approach to Distribution Shifts",
          "authors": [
            "Marco Federici",
            "Ryota Tomioka",
            "Patrick Forré"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2106.03783",
          "topic": "distribution-shift; fairness; information-theory",
          "evidence": "abstract",
          "publication_status": "arXiv preprint, 2021（正式掲載先未照合）",
          "checked_on": "2026-10-03",
          "significance": "shiftの誤差要因とDG・fairness目的を情報理論で比較し、生成過程に応じたモデル選択を強調。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2106.03783"
      ]
    },
    {
      "canonical_key": "arxiv:2106.02890",
      "id": "GE096",
      "aliases": [
        "GE096"
      ],
      "title": "Can Subnetwork Structure be the Key to Out-of-Distribution Generalization?",
      "authors": [
        "Dinghuai Zhang",
        "Kartik Ahuja",
        "Yilun Xu",
        "Yisen Wang",
        "Aaron Courville"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2106.02890",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE096",
          "title": "Can Subnetwork Structure be the Key to Out-of-Distribution Generalization?",
          "authors": [
            "Dinghuai Zhang",
            "Kartik Ahuja",
            "Yilun Xu",
            "Yisen Wang",
            "Aaron Courville"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2106.02890",
          "topic": "domain-generalization; sparsity",
          "evidence": "abstract",
          "publication_status": "ICML 2021",
          "checked_on": "2026-10-03",
          "significance": "spurious featureに依存する全体モデル内でも有用なsubnetworkを選ぶModular Risk Minimization。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2106.02890"
      ]
    },
    {
      "canonical_key": "arxiv:2106.08365",
      "id": "GE097",
      "aliases": [
        "GE097"
      ],
      "title": "Test Sample Accuracy Scales with Training Sample Density in Neural Networks",
      "authors": [
        "Xu Ji",
        "Razvan Pascanu",
        "Devon Hjelm",
        "Balaji Lakshminarayanan",
        "Andrea Vedaldi"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2106.08365",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE097",
          "title": "Test Sample Accuracy Scales with Training Sample Density in Neural Networks",
          "authors": [
            "Xu Ji",
            "Razvan Pascanu",
            "Devon Hjelm",
            "Balaji Lakshminarayanan",
            "Andrea Vedaldi"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2106.08365",
          "topic": "uncertainty; error-prediction",
          "evidence": "abstract",
          "publication_status": "arXiv 2021; CoLLAs 2022",
          "checked_on": "2026-10-03",
          "significance": "表現空間の学習標本密度と誤りの関係を研究。元メモの旧題名から現行題名へ改題されている。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2106.08365"
      ]
    },
    {
      "canonical_key": "arxiv:1908.06112",
      "id": "GE098",
      "aliases": [
        "GE098"
      ],
      "title": "Symmetric Cross Entropy for Robust Learning with Noisy Labels",
      "authors": [
        "Yisen Wang",
        "Xingjun Ma",
        "Zaiyi Chen",
        "Yuan Luo",
        "Jinfeng Yi",
        "James Bailey"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1908.06112",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE098",
          "title": "Symmetric Cross Entropy for Robust Learning with Noisy Labels",
          "authors": [
            "Yisen Wang",
            "Xingjun Ma",
            "Zaiyi Chen",
            "Yuan Luo",
            "Jinfeng Yi",
            "James Bailey"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1908.06112",
          "topic": "label-noise; loss-function",
          "evidence": "abstract",
          "publication_status": "ICCV 2019",
          "checked_on": "2026-10-03",
          "significance": "Cross EntropyとReverse Cross Entropyを組み合わせたラベルノイズ学習。OOD検出やラベルシフト補正とは異なる。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/1908.06112"
      ]
    },
    {
      "canonical_key": "arxiv:2007.02931",
      "id": "GE099",
      "aliases": [
        "GE099"
      ],
      "title": "Adaptive Risk Minimization: Learning to Adapt to Domain Shift",
      "authors": [
        "Marvin Zhang",
        "Henrik Marklund",
        "Nikita Dhawan",
        "Abhishek Gupta",
        "Sergey Levine",
        "Chelsea Finn"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2007.02931",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE099",
          "title": "Adaptive Risk Minimization: Learning to Adapt to Domain Shift",
          "authors": [
            "Marvin Zhang",
            "Henrik Marklund",
            "Nikita Dhawan",
            "Abhishek Gupta",
            "Sergey Levine",
            "Chelsea Finn"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2007.02931",
          "topic": "test-time-adaptation; meta-learning",
          "evidence": "abstract",
          "publication_status": "arXiv 2020; NeurIPS 2021",
          "checked_on": "2026-10-03",
          "significance": "訓練ドメインを用いて、ラベルなしテスト点から適応する能力を学習するARM。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2007.02931"
      ]
    },
    {
      "canonical_key": "arxiv:2006.09994",
      "id": "GE100",
      "aliases": [
        "GE100"
      ],
      "title": "Noise or Signal: The Role of Image Backgrounds in Object Recognition",
      "authors": [
        "Kai Xiao",
        "Logan Engstrom",
        "Andrew Ilyas",
        "Aleksander Madry"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2006.09994",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE100",
          "title": "Noise or Signal: The Role of Image Backgrounds in Object Recognition",
          "authors": [
            "Kai Xiao",
            "Logan Engstrom",
            "Andrew Ilyas",
            "Aleksander Madry"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2006.09994",
          "topic": "spurious-correlation; benchmark",
          "evidence": "abstract",
          "publication_status": "arXiv preprint, 2020（正式掲載先未照合）",
          "checked_on": "2026-10-03",
          "significance": "物体前景と背景を分離して背景依存を診断する。背景のみの予測力と因果的に有用な特徴を区別。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2006.09994"
      ]
    },
    {
      "canonical_key": "arxiv:2109.05642",
      "id": "GE101",
      "aliases": [
        "GE101"
      ],
      "title": "On the Impact of Spurious Correlation for Out-of-distribution Detection",
      "authors": [
        "Yifei Ming",
        "Hang Yin",
        "Yixuan Li"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2109.05642",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE101",
          "title": "On the Impact of Spurious Correlation for Out-of-distribution Detection",
          "authors": [
            "Yifei Ming",
            "Hang Yin",
            "Yixuan Li"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2109.05642",
          "topic": "OOD-detection; spurious-correlation",
          "evidence": "abstract",
          "publication_status": "arXiv 2021; AAAI 2022",
          "checked_on": "2026-10-03",
          "significance": "環境特徴とラベルの相関がunknown検出を悪化させる条件を分析。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2109.05642"
      ]
    },
    {
      "canonical_key": "arxiv:1911.03784",
      "id": "GE102",
      "aliases": [
        "GE102"
      ],
      "title": "Adaptive versus Standard Descent Methods and Robustness Against Adversarial Examples",
      "authors": [
        "Marc Khoury"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1911.03784",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE102",
          "title": "Adaptive versus Standard Descent Methods and Robustness Against Adversarial Examples",
          "authors": [
            "Marc Khoury"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1911.03784",
          "topic": "optimization; adversarial-robustness",
          "evidence": "abstract",
          "publication_status": "arXiv preprint, 2019（2020改訂）",
          "checked_on": "2026-10-03",
          "significance": "adaptive法と標準勾配法で敵対的頑健性が異なる構成例を示す。全問題・全optimizerへの優劣ではない。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/1911.03784"
      ]
    },
    {
      "canonical_key": "arxiv:1909.08245",
      "id": "GE103",
      "aliases": [
        "GE103"
      ],
      "title": "Towards Shape Biased Unsupervised Representation Learning for Domain Generalization",
      "authors": [
        "Nader Asadi",
        "Amir M. Sarfi",
        "Mehrdad Hosseinzadeh",
        "Zahra Karimpour",
        "Mahdi Eftekhari"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1909.08245",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE103",
          "title": "Towards Shape Biased Unsupervised Representation Learning for Domain Generalization",
          "authors": [
            "Nader Asadi",
            "Amir M. Sarfi",
            "Mehrdad Hosseinzadeh",
            "Zahra Karimpour",
            "Mahdi Eftekhari"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1909.08245",
          "topic": "domain-generalization; self-supervision",
          "evidence": "abstract",
          "publication_status": "arXiv preprint, 2019（2020改訂、正式掲載先未照合）",
          "checked_on": "2026-10-03",
          "significance": "domain diversificationとjigsawを組み合わせたshape-biased自己教師あり表現。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/1909.08245"
      ]
    },
    {
      "canonical_key": "arxiv:2111.09190",
      "id": "GE104",
      "aliases": [
        "GE104"
      ],
      "title": "Understanding and Testing Generalization of Deep Networks on Out-of-Distribution Data",
      "authors": [
        "Rui Hu",
        "Jitao Sang",
        "Jinqiang Wang",
        "Rui Hu",
        "Chaoquan Jiang"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2111.09190",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE104",
          "title": "Understanding and Testing Generalization of Deep Networks on Out-of-Distribution Data",
          "authors": [
            "Rui Hu",
            "Jitao Sang",
            "Jinqiang Wang",
            "Rui Hu",
            "Chaoquan Jiang"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2111.09190",
          "topic": "OOD-evaluation",
          "evidence": "abstract",
          "publication_status": "arXiv preprint, 2021",
          "checked_on": "2026-10-03",
          "significance": "marginal/conditional spurious correlationとID評価の限界を調べる。著者名はarXivとPDF表紙の表記を保持。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2111.09190"
      ]
    },
    {
      "canonical_key": "arxiv:2103.14586",
      "id": "GE105",
      "aliases": [
        "GE105"
      ],
      "title": "Understanding Robustness of Transformers for Image Classification",
      "authors": [
        "Srinadh Bhojanapalli",
        "Ayan Chakrabarti",
        "Daniel Glasner",
        "Daliang Li",
        "Thomas Unterthiner",
        "Andreas Veit"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2103.14586",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE105",
          "title": "Understanding Robustness of Transformers for Image Classification",
          "authors": [
            "Srinadh Bhojanapalli",
            "Ayan Chakrabarti",
            "Daniel Glasner",
            "Daliang Li",
            "Thomas Unterthiner",
            "Andreas Veit"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2103.14586",
          "topic": "vision-transformer; robustness",
          "evidence": "abstract",
          "publication_status": "ICCV 2021",
          "checked_on": "2026-10-03",
          "significance": "ViTとResNetを入力・モデル摂動で比較。十分な事前学習データという条件を明示。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2103.14586"
      ]
    },
    {
      "canonical_key": "arxiv:2004.06100",
      "id": "GE106",
      "aliases": [
        "GE106"
      ],
      "title": "Pretrained Transformers Improve Out-of-Distribution Robustness",
      "authors": [
        "Dan Hendrycks",
        "Xiaoyuan Liu",
        "Eric Wallace",
        "Adam Dziedzic",
        "Rishabh Krishnan",
        "Dawn Song"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2004.06100",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE106",
          "title": "Pretrained Transformers Improve Out-of-Distribution Robustness",
          "authors": [
            "Dan Hendrycks",
            "Xiaoyuan Liu",
            "Eric Wallace",
            "Adam Dziedzic",
            "Rishabh Krishnan",
            "Dawn Song"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2004.06100",
          "topic": "NLP; pretraining; OOD",
          "evidence": "abstract",
          "publication_status": "ACL 2020",
          "checked_on": "2026-10-03",
          "significance": "NLPで事前学習Transformerの分布外汎化と検出を評価。元メモのリンクラベルは別論文を指している。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2004.06100"
      ]
    },
    {
      "canonical_key": "arxiv:2106.04015",
      "id": "GE107",
      "aliases": [
        "GE107"
      ],
      "title": "Uncertainty Baselines: Benchmarks for Uncertainty & Robustness in Deep Learning",
      "authors": [
        "Zachary Nado",
        "Neil Band",
        "Mark Collier",
        "Josip Djolonga",
        "Michael W. Dusenberry",
        "Sebastian Farquhar",
        "Qixuan Feng",
        "Angelos Filos",
        "Marton Havasi",
        "Rodolphe Jenatton",
        "Ghassen Jerfel",
        "Jeremiah Liu",
        "Zelda Mariet",
        "Jeremy Nixon",
        "Shreyas Padhy",
        "Jie Ren",
        "Tim G. J. Rudner",
        "Faris Sbahi",
        "Yeming Wen",
        "Florian Wenzel",
        "Kevin Murphy",
        "D. Sculley",
        "Balaji Lakshminarayanan",
        "Jasper Snoek",
        "Yarin Gal",
        "Dustin Tran"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2106.04015",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE107",
          "title": "Uncertainty Baselines: Benchmarks for Uncertainty & Robustness in Deep Learning",
          "authors": [
            "Zachary Nado",
            "Neil Band",
            "Mark Collier",
            "Josip Djolonga",
            "Michael W. Dusenberry",
            "Sebastian Farquhar",
            "Qixuan Feng",
            "Angelos Filos",
            "Marton Havasi",
            "Rodolphe Jenatton",
            "Ghassen Jerfel",
            "Jeremiah Liu",
            "Zelda Mariet",
            "Jeremy Nixon",
            "Shreyas Padhy",
            "Jie Ren",
            "Tim G. J. Rudner",
            "Faris Sbahi",
            "Yeming Wen",
            "Florian Wenzel",
            "Kevin Murphy",
            "D. Sculley",
            "Balaji Lakshminarayanan",
            "Jasper Snoek",
            "Yarin Gal",
            "Dustin Tran"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2106.04015",
          "topic": "uncertainty; reproducibility",
          "evidence": "abstract",
          "publication_status": "arXiv preprint, 2021（2022改訂）",
          "checked_on": "2026-10-03",
          "significance": "Uncertainty Baselinesの実装・評価基盤。方法だけでなく調整計算量や再現性を比較可能にする。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2106.04015"
      ]
    },
    {
      "canonical_key": "arxiv:2106.09129",
      "id": "GE108",
      "aliases": [
        "GE108"
      ],
      "title": "A Winning Hand: Compressing Deep Networks Can Improve Out-Of-Distribution Robustness",
      "authors": [
        "James Diffenderfer",
        "Brian R. Bartoldson",
        "Shreya Chaganti",
        "Jize Zhang",
        "Bhavya Kailkhura"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2106.09129",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE108",
          "title": "A Winning Hand: Compressing Deep Networks Can Improve Out-Of-Distribution Robustness",
          "authors": [
            "James Diffenderfer",
            "Brian R. Bartoldson",
            "Shreya Chaganti",
            "Jize Zhang",
            "Bhavya Kailkhura"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2106.09129",
          "topic": "compression; robustness",
          "evidence": "abstract",
          "publication_status": "arXiv preprint, 2021（正式掲載先未照合）",
          "checked_on": "2026-10-03",
          "significance": "lottery-ticket型圧縮とテスト時ensembleによる精度・頑健性・容量の両立を検証。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2106.09129"
      ]
    },
    {
      "canonical_key": "arxiv:2006.07710",
      "id": "GE109",
      "aliases": [
        "GE109"
      ],
      "title": "The Pitfalls of Simplicity Bias in Neural Networks",
      "authors": [
        "Harshay Shah",
        "Kaustav Tamuly",
        "Aditi Raghunathan",
        "Prateek Jain",
        "Praneeth Netrapalli"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2006.07710",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE109",
          "title": "The Pitfalls of Simplicity Bias in Neural Networks",
          "authors": [
            "Harshay Shah",
            "Kaustav Tamuly",
            "Aditi Raghunathan",
            "Prateek Jain",
            "Praneeth Netrapalli"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2006.07710",
          "topic": "shortcut-learning; theory",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2020",
          "checked_on": "2026-10-03",
          "significance": "最も単純な特徴への極端な依存がIID汎化や分布外頑健性も損ねる構成例。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2006.07710"
      ]
    },
    {
      "canonical_key": "arxiv:1508.07680",
      "id": "GE110",
      "aliases": [
        "GE110"
      ],
      "title": "Domain Generalization for Object Recognition with Multi-task Autoencoders",
      "authors": [
        "Muhammad Ghifary",
        "W. Bastiaan Kleijn",
        "Mengjie Zhang",
        "David Balduzzi"
      ],
      "year": 2015,
      "url": "https://arxiv.org/abs/1508.07680",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE110",
          "title": "Domain Generalization for Object Recognition with Multi-task Autoencoders",
          "authors": [
            "Muhammad Ghifary",
            "W. Bastiaan Kleijn",
            "Mengjie Zhang",
            "David Balduzzi"
          ],
          "year": 2015,
          "url": "https://arxiv.org/abs/1508.07680",
          "topic": "domain-generalization; representation",
          "evidence": "abstract",
          "publication_status": "ICCV 2015",
          "checked_on": "2026-10-03",
          "significance": "Multi-Task Autoencoderによる初期のDG表現学習。ドメイン間の外観差を再構成課題に使う。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/pdf/1508.07680.pdf",
        "https://arxiv.org/abs/1508.07680"
      ]
    },
    {
      "canonical_key": "arxiv:1710.03077",
      "id": "GE111",
      "aliases": [
        "GE111"
      ],
      "title": "Deeper, Broader and Artier Domain Generalization",
      "authors": [
        "Da Li",
        "Yongxin Yang",
        "Yi-Zhe Song",
        "Timothy M. Hospedales"
      ],
      "year": 2017,
      "url": "https://arxiv.org/abs/1710.03077",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE111",
          "title": "Deeper, Broader and Artier Domain Generalization",
          "authors": [
            "Da Li",
            "Yongxin Yang",
            "Yi-Zhe Song",
            "Timothy M. Hospedales"
          ],
          "year": 2017,
          "url": "https://arxiv.org/abs/1710.03077",
          "topic": "domain-generalization; benchmark",
          "evidence": "abstract",
          "publication_status": "ICCV 2017",
          "checked_on": "2026-10-03",
          "significance": "photo/art/cartoon/sketchを含むPACSを導入し、写真のみのベンチマークから拡張。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/1710.03077"
      ]
    },
    {
      "canonical_key": "arxiv:1807.04975",
      "id": "GE112",
      "aliases": [
        "GE112"
      ],
      "title": "Recognition in Terra Incognita",
      "authors": [
        "Sara Beery",
        "Grant van Horn",
        "Pietro Perona"
      ],
      "year": 2018,
      "url": "https://arxiv.org/abs/1807.04975",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE112",
          "title": "Recognition in Terra Incognita",
          "authors": [
            "Sara Beery",
            "Grant van Horn",
            "Pietro Perona"
          ],
          "year": 2018,
          "url": "https://arxiv.org/abs/1807.04975",
          "topic": "geographic-shift; benchmark",
          "evidence": "abstract",
          "publication_status": "ECCV 2018",
          "checked_on": "2026-10-03",
          "significance": "camera-trapの設置場所をまたぐ認識を評価。ランダム分割と未知場所分割の差が核心。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/pdf/1807.04975.pdf",
        "https://arxiv.org/abs/1807.04975"
      ]
    },
    {
      "canonical_key": "arxiv:1812.01754",
      "id": "GE113",
      "aliases": [
        "GE113"
      ],
      "title": "Moment Matching for Multi-Source Domain Adaptation",
      "authors": [
        "Xingchao Peng",
        "Qinxun Bai",
        "Xide Xia",
        "Zijun Huang",
        "Kate Saenko",
        "Bo Wang"
      ],
      "year": 2018,
      "url": "https://arxiv.org/abs/1812.01754",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE113",
          "title": "Moment Matching for Multi-Source Domain Adaptation",
          "authors": [
            "Xingchao Peng",
            "Qinxun Bai",
            "Xide Xia",
            "Zijun Huang",
            "Kate Saenko",
            "Bo Wang"
          ],
          "year": 2018,
          "url": "https://arxiv.org/abs/1812.01754",
          "topic": "domain-adaptation; benchmark",
          "evidence": "abstract",
          "publication_status": "arXiv 2018; ICCV 2019",
          "checked_on": "2026-10-03",
          "significance": "DomainNetとmulti-source UDAのmoment matching。DGとして再利用する際は対象データ使用条件を変更する。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/pdf/1812.01754.pdf",
        "https://arxiv.org/abs/1812.01754"
      ]
    },
    {
      "canonical_key": "arxiv:1811.12231",
      "id": "GE114",
      "aliases": [
        "GE114"
      ],
      "title": "ImageNet-trained CNNs are biased towards texture; increasing shape bias improves accuracy and robustness",
      "authors": [
        "Robert Geirhos",
        "Patricia Rubisch",
        "Claudio Michaelis",
        "Matthias Bethge",
        "Felix A. Wichmann",
        "Wieland Brendel"
      ],
      "year": 2018,
      "url": "https://arxiv.org/abs/1811.12231",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE114",
          "title": "ImageNet-trained CNNs are biased towards texture; increasing shape bias improves accuracy and robustness",
          "authors": [
            "Robert Geirhos",
            "Patricia Rubisch",
            "Claudio Michaelis",
            "Matthias Bethge",
            "Felix A. Wichmann",
            "Wieland Brendel"
          ],
          "year": 2018,
          "url": "https://arxiv.org/abs/1811.12231",
          "topic": "shape-bias; benchmark",
          "evidence": "abstract",
          "publication_status": "arXiv 2018; ICLR 2019",
          "checked_on": "2026-10-03",
          "significance": "texture–shape cue conflictとStylized-ImageNetを用いて画像CNNの特徴依存を検証。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/pdf/1811.12231.pdf",
        "https://arxiv.org/abs/1811.12231"
      ]
    },
    {
      "canonical_key": "arxiv:2007.04612",
      "id": "GE115",
      "aliases": [
        "GE115"
      ],
      "title": "Concept Bottleneck Models",
      "authors": [
        "Pang Wei Koh",
        "Thao Nguyen",
        "Yew Siang Tang",
        "Stephen Mussmann",
        "Emma Pierson",
        "Been Kim",
        "Percy Liang"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2007.04612",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE115",
          "title": "Concept Bottleneck Models",
          "authors": [
            "Pang Wei Koh",
            "Thao Nguyen",
            "Yew Siang Tang",
            "Stephen Mussmann",
            "Emma Pierson",
            "Been Kim",
            "Percy Liang"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2007.04612",
          "topic": "interpretability; concept-intervention",
          "evidence": "abstract",
          "publication_status": "ICML 2020",
          "checked_on": "2026-10-03",
          "significance": "人が解釈できる概念を中間変数にしてテスト時の概念修正を可能にする。概念注釈・介入が必要。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/pdf/2007.04612.pdf",
        "https://arxiv.org/abs/2007.04612"
      ]
    },
    {
      "canonical_key": "arxiv:1906.02168",
      "id": "GE116",
      "aliases": [
        "GE116"
      ],
      "title": "Do Image Classifiers Generalize Across Time?",
      "authors": [
        "Vaishaal Shankar",
        "Achal Dave",
        "Rebecca Roelofs",
        "Deva Ramanan",
        "Benjamin Recht",
        "Ludwig Schmidt"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1906.02168",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE116",
          "title": "Do Image Classifiers Generalize Across Time?",
          "authors": [
            "Vaishaal Shankar",
            "Achal Dave",
            "Rebecca Roelofs",
            "Deva Ramanan",
            "Benjamin Recht",
            "Ludwig Schmidt"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1906.02168",
          "topic": "temporal-robustness; benchmark",
          "evidence": "abstract",
          "publication_status": "arXiv preprint, 2019（正式掲載先未照合）",
          "checked_on": "2026-10-03",
          "significance": "ImageNet-Vid-Robust/YTBB-Robustで近接動画フレームへの予測変動を測る。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/pdf/1906.02168.pdf",
        "https://arxiv.org/abs/1906.02168"
      ]
    },
    {
      "canonical_key": "arxiv:1903.03096",
      "id": "GE117",
      "aliases": [
        "GE117"
      ],
      "title": "Meta-Dataset: A Dataset of Datasets for Learning to Learn from Few Examples",
      "authors": [
        "Eleni Triantafillou",
        "Tyler Zhu",
        "Vincent Dumoulin",
        "Pascal Lamblin",
        "Utku Evci",
        "Kelvin Xu",
        "Ross Goroshin",
        "Carles Gelada",
        "Kevin Swersky",
        "Pierre-Antoine Manzagol",
        "Hugo Larochelle"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1903.03096",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE117",
          "title": "Meta-Dataset: A Dataset of Datasets for Learning to Learn from Few Examples",
          "authors": [
            "Eleni Triantafillou",
            "Tyler Zhu",
            "Vincent Dumoulin",
            "Pascal Lamblin",
            "Utku Evci",
            "Kelvin Xu",
            "Ross Goroshin",
            "Carles Gelada",
            "Kevin Swersky",
            "Pierre-Antoine Manzagol",
            "Hugo Larochelle"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1903.03096",
          "topic": "few-shot-learning; benchmark",
          "evidence": "abstract",
          "publication_status": "arXiv 2019; ICLR 2020",
          "checked_on": "2026-10-03",
          "significance": "異種データセットからのfew-shot episodeを評価するMeta-Dataset。通常のDGとはラベル利用条件が異なる。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/pdf/1903.03096.pdf",
        "https://arxiv.org/abs/1903.03096"
      ]
    },
    {
      "canonical_key": "arxiv:1910.04867",
      "id": "GE118",
      "aliases": [
        "GE118"
      ],
      "title": "A Large-scale Study of Representation Learning with the Visual Task Adaptation Benchmark",
      "authors": [
        "Xiaohua Zhai",
        "Joan Puigcerver",
        "Alexander Kolesnikov",
        "Pierre Ruyssen",
        "Carlos Riquelme",
        "Mario Lucic",
        "Josip Djolonga",
        "Andre Susano Pinto",
        "Maxim Neumann",
        "Alexey Dosovitskiy",
        "Lucas Beyer",
        "Olivier Bachem",
        "Michael Tschannen",
        "Marcin Michalski",
        "Olivier Bousquet",
        "Sylvain Gelly",
        "Neil Houlsby"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1910.04867",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE118",
          "title": "A Large-scale Study of Representation Learning with the Visual Task Adaptation Benchmark",
          "authors": [
            "Xiaohua Zhai",
            "Joan Puigcerver",
            "Alexander Kolesnikov",
            "Pierre Ruyssen",
            "Carlos Riquelme",
            "Mario Lucic",
            "Josip Djolonga",
            "Andre Susano Pinto",
            "Maxim Neumann",
            "Alexey Dosovitskiy",
            "Lucas Beyer",
            "Olivier Bachem",
            "Michael Tschannen",
            "Marcin Michalski",
            "Olivier Bousquet",
            "Sylvain Gelly",
            "Neil Houlsby"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1910.04867",
          "topic": "transfer-learning; benchmark",
          "evidence": "abstract",
          "publication_status": "arXiv preprint, 2019（2020改訂、正式掲載先未照合）",
          "checked_on": "2026-10-03",
          "significance": "VTABは少数ラベルによる新規タスク適応を比較。architectureや調整予算の統制を重視。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/pdf/1910.04867.pdf",
        "https://arxiv.org/abs/1910.04867"
      ]
    },
    {
      "canonical_key": "arxiv:1712.00377",
      "id": "GE119",
      "aliases": [
        "GE119"
      ],
      "title": "Don't Just Assume; Look and Answer: Overcoming Priors for Visual Question Answering",
      "authors": [
        "Aishwarya Agrawal",
        "Dhruv Batra",
        "Devi Parikh",
        "Aniruddha Kembhavi"
      ],
      "year": 2017,
      "url": "https://arxiv.org/abs/1712.00377",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE119",
          "title": "Don't Just Assume; Look and Answer: Overcoming Priors for Visual Question Answering",
          "authors": [
            "Aishwarya Agrawal",
            "Dhruv Batra",
            "Devi Parikh",
            "Aniruddha Kembhavi"
          ],
          "year": 2017,
          "url": "https://arxiv.org/abs/1712.00377",
          "topic": "multimodal; spurious-correlation; benchmark",
          "evidence": "abstract",
          "publication_status": "arXiv 2017; CVPR 2018",
          "checked_on": "2026-10-03",
          "significance": "VQA-CPは質問型ごとの回答priorを変え、画像を見ずに言語priorへ依存する捷径を検査。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/pdf/1712.00377.pdf",
        "https://arxiv.org/abs/1712.00377"
      ]
    },
    {
      "canonical_key": "arxiv:1910.14599",
      "id": "GE120",
      "aliases": [
        "GE120"
      ],
      "title": "Adversarial NLI: A New Benchmark for Natural Language Understanding",
      "authors": [
        "Yixin Nie",
        "Adina Williams",
        "Emily Dinan",
        "Mohit Bansal",
        "Jason Weston",
        "Douwe Kiela"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1910.14599",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE120",
          "title": "Adversarial NLI: A New Benchmark for Natural Language Understanding",
          "authors": [
            "Yixin Nie",
            "Adina Williams",
            "Emily Dinan",
            "Mohit Bansal",
            "Jason Weston",
            "Douwe Kiela"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1910.14599",
          "topic": "NLP; benchmark",
          "evidence": "abstract",
          "publication_status": "arXiv 2019; ACL 2020",
          "checked_on": "2026-10-03",
          "significance": "ANLIは人とモデルの反復的な敵対的データ収集による自然言語推論評価。画素ノルム制約攻撃ではない。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/pdf/1910.14599.pdf",
        "https://arxiv.org/abs/1910.14599"
      ]
    },
    {
      "canonical_key": "arxiv:1907.07174",
      "id": "GE121",
      "aliases": [
        "GE121"
      ],
      "title": "Natural Adversarial Examples",
      "authors": [
        "Dan Hendrycks",
        "Kevin Zhao",
        "Steven Basart",
        "Jacob Steinhardt",
        "Dawn Song"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1907.07174",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE121",
          "title": "Natural Adversarial Examples",
          "authors": [
            "Dan Hendrycks",
            "Kevin Zhao",
            "Steven Basart",
            "Jacob Steinhardt",
            "Dawn Song"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1907.07174",
          "topic": "OOD-detection; natural-robustness; benchmark",
          "evidence": "abstract",
          "publication_status": "arXiv 2019; CVPR 2021",
          "checked_on": "2026-10-03",
          "significance": "ImageNet-Aの難しい既知クラス認識とImageNet-Oの未知分布検出を分ける。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/pdf/1907.07174.pdf",
        "https://arxiv.org/abs/1907.07174"
      ]
    },
    {
      "canonical_key": "arxiv:2110.11328",
      "id": "GE122",
      "aliases": [
        "GE122"
      ],
      "title": "A Fine-Grained Analysis on Distribution Shift",
      "authors": [
        "Olivia Wiles",
        "Sven Gowal",
        "Florian Stimberg",
        "Sylvestre Alvise-Rebuffi",
        "Ira Ktena",
        "Krishnamurthy Dvijotham",
        "Taylan Cemgil"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2110.11328",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE122",
          "title": "A Fine-Grained Analysis on Distribution Shift",
          "authors": [
            "Olivia Wiles",
            "Sven Gowal",
            "Florian Stimberg",
            "Sylvestre Alvise-Rebuffi",
            "Ira Ktena",
            "Krishnamurthy Dvijotham",
            "Taylan Cemgil"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2110.11328",
          "topic": "distribution-shift; benchmark",
          "evidence": "abstract",
          "publication_status": "arXiv 2021; ICLR 2022",
          "checked_on": "2026-10-03",
          "significance": "複数種類のshiftを統制比較し、事前学習・augmentationの効果と最良手法の設定依存を示す。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://openreview.net/forum?id=Dl4LetuLdyK",
        "https://arxiv.org/abs/2110.11328"
      ]
    },
    {
      "canonical_key": "arxiv:2007.01162",
      "id": "GE123",
      "aliases": [
        "GE123"
      ],
      "title": "Tilted Empirical Risk Minimization",
      "authors": [
        "Tian Li",
        "Ahmad Beirami",
        "Maziar Sanjabi",
        "Virginia Smith"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2007.01162",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE123",
          "title": "Tilted Empirical Risk Minimization",
          "authors": [
            "Tian Li",
            "Ahmad Beirami",
            "Maziar Sanjabi",
            "Virginia Smith"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2007.01162",
          "topic": "robust-risk; fairness",
          "evidence": "abstract",
          "publication_status": "arXiv 2020; ICLR 2021",
          "checked_on": "2026-10-03",
          "significance": "tiltで大損失・小損失の重みを変え、外れ値・群間格差・クラス不均衡に対応。公平性の定義は別途必要。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://openreview.net/forum?id=K5YasWXZT3O",
        "https://arxiv.org/abs/2007.01162"
      ]
    },
    {
      "canonical_key": "arxiv:2207.12020",
      "id": "GE124",
      "aliases": [
        "GE124"
      ],
      "title": "Domain-invariant Feature Exploration for Domain Generalization",
      "authors": [
        "Wang Lu",
        "Jindong Wang",
        "Haoliang Li",
        "Yiqiang Chen",
        "Xing Xie"
      ],
      "year": 2022,
      "url": "https://arxiv.org/abs/2207.12020",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE124",
          "title": "Domain-invariant Feature Exploration for Domain Generalization",
          "authors": [
            "Wang Lu",
            "Jindong Wang",
            "Haoliang Li",
            "Yiqiang Chen",
            "Xing Xie"
          ],
          "year": 2022,
          "url": "https://arxiv.org/abs/2207.12020",
          "topic": "domain-generalization; representation",
          "evidence": "abstract",
          "publication_status": "TMLR 2022",
          "checked_on": "2026-10-03",
          "significance": "DIFEXはFourier phaseの内部不変性とdomain間correlation alignmentを組み合わせる。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://openreview.net/pdf?id=0xENE7HiYm",
        "https://arxiv.org/abs/2207.12020"
      ]
    },
    {
      "canonical_key": "arxiv:2202.01851",
      "id": "GE125",
      "aliases": [
        "GE125"
      ],
      "title": "A Note on \"Assessing Generalization of SGD via Disagreement\"",
      "authors": [
        "Andreas Kirsch",
        "Yarin Gal"
      ],
      "year": 2022,
      "url": "https://arxiv.org/abs/2202.01851",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE125",
          "title": "A Note on \"Assessing Generalization of SGD via Disagreement\"",
          "authors": [
            "Andreas Kirsch",
            "Yarin Gal"
          ],
          "year": 2022,
          "url": "https://arxiv.org/abs/2202.01851",
          "topic": "generalization-estimation; calibration",
          "evidence": "abstract",
          "publication_status": "arXiv 2022; TMLR 2022（公開PDF表紙で確認）",
          "checked_on": "2026-10-03",
          "significance": "disagreementで誤りを推定する理論はensemble calibrationに依存し、未知環境ではその検証にラベルが要ると指摘。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://openreview.net/pdf?id=oRP8urZ8Fx",
        "https://arxiv.org/abs/2202.01851"
      ]
    },
    {
      "canonical_key": "arxiv:2201.03529",
      "id": "GE126",
      "aliases": [
        "GE126"
      ],
      "title": "Head2Toe: Utilizing Intermediate Representations for Better Transfer Learning",
      "authors": [
        "Utku Evci",
        "Vincent Dumoulin",
        "Hugo Larochelle",
        "Michael C. Mozer"
      ],
      "year": 2022,
      "url": "https://arxiv.org/abs/2201.03529",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE126",
          "title": "Head2Toe: Utilizing Intermediate Representations for Better Transfer Learning",
          "authors": [
            "Utku Evci",
            "Vincent Dumoulin",
            "Hugo Larochelle",
            "Michael C. Mozer"
          ],
          "year": 2022,
          "url": "https://arxiv.org/abs/2201.03529",
          "topic": "transfer-learning; probing",
          "evidence": "abstract",
          "publication_status": "ICML 2022",
          "checked_on": "2026-10-03",
          "significance": "全層から特徴を選ぶHead2Toe。ターゲットラベルを使うtransferであり、純粋なDG保証ではない。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2201.03529"
      ]
    },
    {
      "canonical_key": "arxiv:2207.02093",
      "id": "GE127",
      "aliases": [
        "GE127"
      ],
      "title": "Predicting Out-of-Domain Generalization with Neighborhood Invariance",
      "authors": [
        "Nathan Ng",
        "Neha Hulkund",
        "Kyunghyun Cho",
        "Marzyeh Ghassemi"
      ],
      "year": 2022,
      "url": "https://arxiv.org/abs/2207.02093",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE127",
          "title": "Predicting Out-of-Domain Generalization with Neighborhood Invariance",
          "authors": [
            "Nathan Ng",
            "Neha Hulkund",
            "Kyunghyun Cho",
            "Marzyeh Ghassemi"
          ],
          "year": 2022,
          "url": "https://arxiv.org/abs/2207.02093",
          "topic": "OOD-generalization-estimation",
          "evidence": "abstract",
          "publication_status": "arXiv 2022; TMLR 2023（公開PDF表紙で確認）",
          "checked_on": "2026-10-03",
          "significance": "選んだ変換近傍での予測不変性とOOD性能の経験的関係。計算に正解ラベルは不要だが変換の妥当性は必要。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://openreview.net/pdf?id=jYkWdJzTwn",
        "https://arxiv.org/abs/2207.02093"
      ]
    },
    {
      "canonical_key": "arxiv:2012.12896",
      "id": "GE128",
      "aliases": [
        "GE128"
      ],
      "title": "How Does a Neural Network's Architecture Impact Its Robustness to Noisy Labels?",
      "authors": [
        "Jingling Li",
        "Mozhi Zhang",
        "Keyulu Xu",
        "John P. Dickerson",
        "Jimmy Ba"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2012.12896",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE128",
          "title": "How Does a Neural Network's Architecture Impact Its Robustness to Noisy Labels?",
          "authors": [
            "Jingling Li",
            "Mozhi Zhang",
            "Keyulu Xu",
            "John P. Dickerson",
            "Jimmy Ba"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2012.12896",
          "topic": "architecture; label-noise",
          "evidence": "abstract",
          "publication_status": "arXiv 2020; NeurIPS 2021",
          "checked_on": "2026-10-03",
          "significance": "architectureとtarget/noise関数の適合を通じたラベルノイズ頑健性。表現評価に少数のclean labelを使う。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2012.12896"
      ]
    },
    {
      "canonical_key": "arxiv:2008.01883",
      "id": "GE129",
      "aliases": [
        "GE129"
      ],
      "title": "When is invariance useful in an Out-of-Distribution Generalization problem ?",
      "authors": [
        "Masanori Koyama",
        "Shoichiro Yamaguchi"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2008.01883",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE129",
          "title": "When is invariance useful in an Out-of-Distribution Generalization problem ?",
          "authors": [
            "Masanori Koyama",
            "Shoichiro Yamaguchi"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2008.01883",
          "topic": "domain-generalization; invariance",
          "evidence": "abstract",
          "publication_status": "arXiv preprint, 2020（2021改訂）",
          "checked_on": "2026-10-03",
          "significance": "不変予測器のOOD最適性に必要な条件とInter Gradient Alignment。元メモの題名に対応する正しい論文。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2008.01883"
      ]
    },
    {
      "canonical_key": "arxiv:2201.06656",
      "id": "GE130",
      "aliases": [
        "GE130"
      ],
      "title": "Generalization in Supervised Learning Through Riemannian Contraction",
      "authors": [
        "Leo Kozachkov",
        "Patrick M. Wensing",
        "Jean-Jacques Slotine"
      ],
      "year": 2022,
      "url": "https://arxiv.org/abs/2201.06656",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE130",
          "title": "Generalization in Supervised Learning Through Riemannian Contraction",
          "authors": [
            "Leo Kozachkov",
            "Patrick M. Wensing",
            "Jean-Jacques Slotine"
          ],
          "year": 2022,
          "url": "https://arxiv.org/abs/2201.06656",
          "topic": "algorithmic-stability; geometry",
          "evidence": "abstract",
          "publication_status": "arXiv 2022; 発展版はGeneralization as Dynamical Robustness–The Role of Riemannian Contraction in Supervised Learning, TMLR 2023（書誌照合）",
          "checked_on": "2026-10-03",
          "significance": "Riemannian contractionからalgorithmic stabilityを導く。IID学習の安定性を任意の分布シフト保証と読み替えない。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://openreview.net/pdf?id=Sb6p5mcefw",
        "https://arxiv.org/abs/2201.06656"
      ]
    },
    {
      "canonical_key": "arxiv:1912.08142",
      "id": "GE131",
      "aliases": [
        "GE131"
      ],
      "title": "Causality matters in medical imaging",
      "authors": [
        "Daniel C. Castro",
        "Ian Walker",
        "Ben Glocker"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1912.08142",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE131",
          "title": "Causality matters in medical imaging",
          "authors": [
            "Daniel C. Castro",
            "Ian Walker",
            "Ben Glocker"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1912.08142",
          "topic": "causal-transfer; medical-imaging",
          "evidence": "abstract",
          "publication_status": "arXiv 2019; Nature Communications 11:3673, 2020",
          "checked_on": "2026-10-03",
          "significance": "画像・注釈・選択過程の因果関係からデータ不足と移送条件を整理。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://www.nature.com/articles/s41467-020-17478-w.pdf",
        "https://www.nature.com/articles/s41467-020-17478-w",
        "https://arxiv.org/abs/1912.08142"
      ]
    },
    {
      "canonical_key": "arxiv:2310.07361",
      "id": "GE132",
      "aliases": [
        "GE132"
      ],
      "title": "Domain Generalization Guided by Gradient Signal to Noise Ratio of Parameters",
      "authors": [
        "Mateusz Michalkiewicz",
        "Masoud Faraki",
        "Xiang Yu",
        "Manmohan Chandraker",
        "Mahsa Baktashmotlagh"
      ],
      "year": 2023,
      "url": "https://arxiv.org/abs/2310.07361",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE132",
          "title": "Domain Generalization Guided by Gradient Signal to Noise Ratio of Parameters",
          "authors": [
            "Mateusz Michalkiewicz",
            "Masoud Faraki",
            "Xiang Yu",
            "Manmohan Chandraker",
            "Mahsa Baktashmotlagh"
          ],
          "year": 2023,
          "url": "https://arxiv.org/abs/2310.07361",
          "topic": "domain-generalization; optimization",
          "evidence": "abstract",
          "publication_status": "ICCV 2023",
          "checked_on": "2026-10-03",
          "significance": "GSNRに基づくparameter dropoutと比率のmeta-learning。高GSNRを残すのでなく除く設計を提案。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://openaccess.thecvf.com/content/ICCV2023/papers/Michalkiewicz_Domain_Generalization_Guided_by_Gradient_Signal_to_Noise_Ratio_of_ICCV_2023_paper.pdf",
        "https://arxiv.org/abs/2310.07361"
      ]
    },
    {
      "canonical_key": "arxiv:1706.07522",
      "id": "GE133",
      "aliases": [
        "GE133"
      ],
      "title": "Deep Hashing Network for Unsupervised Domain Adaptation",
      "authors": [
        "Hemanth Venkateswara",
        "Jose Eusebio",
        "Shayok Chakraborty",
        "Sethuraman Panchanathan"
      ],
      "year": 2017,
      "url": "https://arxiv.org/abs/1706.07522",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE133",
          "title": "Deep Hashing Network for Unsupervised Domain Adaptation",
          "authors": [
            "Hemanth Venkateswara",
            "Jose Eusebio",
            "Shayok Chakraborty",
            "Sethuraman Panchanathan"
          ],
          "year": 2017,
          "url": "https://arxiv.org/abs/1706.07522",
          "topic": "domain-adaptation; benchmark",
          "evidence": "abstract",
          "publication_status": "CVPR 2017",
          "checked_on": "2026-10-03",
          "significance": "Office-Homeを導入。原論文はラベルなし対象データを用いるUDAである。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://openaccess.thecvf.com/content_cvpr_2017/papers/Venkateswara_Deep_Hashing_Network_CVPR_2017_paper.pdf",
        "https://arxiv.org/abs/1706.07522"
      ]
    },
    {
      "canonical_key": "arxiv:1912.11852",
      "id": "GE134",
      "aliases": [
        "GE134"
      ],
      "title": "Benchmarking Adversarial Robustness",
      "authors": [
        "Yinpeng Dong",
        "Qi-An Fu",
        "Xiao Yang",
        "Tianyu Pang",
        "Hang Su",
        "Zihao Xiao",
        "Jun Zhu"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1912.11852",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE134",
          "title": "Benchmarking Adversarial Robustness",
          "authors": [
            "Yinpeng Dong",
            "Qi-An Fu",
            "Xiao Yang",
            "Tianyu Pang",
            "Hang Su",
            "Zihao Xiao",
            "Jun Zhu"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1912.11852",
          "topic": "adversarial-robustness; benchmark",
          "evidence": "abstract",
          "publication_status": "arXiv 2019; CVPR 2020掲載題名は「Benchmarking Adversarial Robustness on Image Classification」",
          "checked_on": "2026-10-03",
          "significance": "RealSafeに対応する攻撃・防御の評価。単一の攻撃設定だけでモデル順位を決めない。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://openaccess.thecvf.com/content_CVPR_2020/papers/Dong_Benchmarking_Adversarial_Robustness_on_Image_Classification_CVPR_2020_paper.pdf",
        "https://arxiv.org/abs/1912.11852"
      ]
    },
    {
      "canonical_key": "proceedings.mlr.press/v267/cho25c.html",
      "id": "GE135",
      "aliases": [
        "GE135"
      ],
      "title": "One-Step Generalization Ratio Guided Optimization for Domain Generalization",
      "authors": [
        "Sumin Cho",
        "Dongwon Kim",
        "Kwangsu Kim"
      ],
      "year": 2025,
      "url": "https://proceedings.mlr.press/v267/cho25c.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE135",
          "title": "One-Step Generalization Ratio Guided Optimization for Domain Generalization",
          "authors": [
            "Sumin Cho",
            "Dongwon Kim",
            "Kwangsu Kim"
          ],
          "year": 2025,
          "url": "https://proceedings.mlr.press/v267/cho25c.html",
          "topic": "domain-generalization; optimization",
          "evidence": "abstract",
          "publication_status": "ICML 2025; arXivへの登録は2026-06-15",
          "checked_on": "2026-10-03",
          "significance": "GENIEはOSGRで更新寄与・勾配整合を調整。正式発表は2025であり2026年の新規成果と数えない。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://proceedings.mlr.press/v267/cho25c.html",
        "https://arxiv.org/abs/2606.16301"
      ]
    },
    {
      "canonical_key": "arxiv:2006.16241",
      "id": "GE136",
      "aliases": [
        "GE136",
        "OA038"
      ],
      "title": "The Many Faces of Robustness: A Critical Analysis of Out-of-Distribution Generalization",
      "authors": [
        "Dan Hendrycks",
        "Steven Basart",
        "Norman Mu",
        "Saurav Kadavath",
        "Frank Wang",
        "Evan Dorundo",
        "Rahul Desai",
        "Tyler Zhu",
        "Samyak Parajuli",
        "Mike Guo",
        "Dawn Song",
        "Jacob Steinhardt",
        "Justin Gilmer"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2006.16241",
      "chapters": [
        "generalization",
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE136",
          "title": "The Many Faces of Robustness: A Critical Analysis of Out-of-Distribution Generalization",
          "authors": [
            "Dan Hendrycks",
            "Steven Basart",
            "Norman Mu",
            "Saurav Kadavath",
            "Frank Wang",
            "Evan Dorundo",
            "Rahul Desai",
            "Tyler Zhu",
            "Samyak Parajuli",
            "Mike Guo",
            "Dawn Song",
            "Jacob Steinhardt",
            "Justin Gilmer"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2006.16241",
          "topic": "distribution-shift; benchmark",
          "evidence": "abstract",
          "publication_status": "arXiv 2020; ICCV 2021",
          "checked_on": "2026-10-03",
          "significance": "複数の実分布シフトを比較し、textureへの改善が地理的shiftにも通用するとは限らないと示す。",
          "chapter": "generalization"
        },
        {
          "id": "OA038",
          "title": "The Many Faces of Robustness: A Critical Analysis of Out-of-Distribution Generalization",
          "authors": "Dan Hendrycks ほか",
          "year": 2020,
          "url": "https://arxiv.org/abs/2006.16241",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "ICCV 2021",
          "checked_on": "2026-10-03",
          "reading_note": "複数の現実的分布変化で頑健性を評価",
          "source_inventory_index": 40,
          "first_submitted": "29 Jun 2020",
          "source_urls": [
            "https://arxiv.org/abs/2006.16241"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2006.16241"
      ]
    },
    {
      "canonical_key": "proceedings.mlr.press/v180/kumar22a.html",
      "id": "GE137",
      "aliases": [
        "GE137"
      ],
      "title": "Calibrated ensembles can mitigate accuracy tradeoffs under distribution shift",
      "authors": [
        "Ananya Kumar",
        "Tengyu Ma",
        "Percy Liang",
        "Aditi Raghunathan"
      ],
      "year": 2022,
      "url": "https://proceedings.mlr.press/v180/kumar22a.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE137",
          "title": "Calibrated ensembles can mitigate accuracy tradeoffs under distribution shift",
          "authors": [
            "Ananya Kumar",
            "Tengyu Ma",
            "Percy Liang",
            "Aditi Raghunathan"
          ],
          "year": 2022,
          "url": "https://proceedings.mlr.press/v180/kumar22a.html",
          "topic": "calibration; ensembles",
          "evidence": "abstract",
          "publication_status": "UAI 2022",
          "checked_on": "2026-10-03",
          "significance": "ID上で校正した標準・robustモデルのensembleを研究。OODでspurious featureの相関が逆転しないという解析条件を明示。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://proceedings.mlr.press/v180/kumar22a.html"
      ]
    },
    {
      "canonical_key": "mitpress.mit.edu/9780262545877/dataset-shift-in-machine-learning",
      "id": "GE138",
      "aliases": [
        "GE138"
      ],
      "title": "Dataset Shift in Machine Learning",
      "authors": [
        "Joaquin Quiñonero-Candela (編)",
        "Masashi Sugiyama (編)",
        "Anton Schwaighofer (編)",
        "Neil D. Lawrence (編)"
      ],
      "year": 2008,
      "url": "https://mitpress.mit.edu/9780262545877/dataset-shift-in-machine-learning/",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "metadata"
      ],
      "records": [
        {
          "id": "GE138",
          "title": "Dataset Shift in Machine Learning",
          "authors": [
            "Joaquin Quiñonero-Candela (編)",
            "Masashi Sugiyama (編)",
            "Anton Schwaighofer (編)",
            "Neil D. Lawrence (編)"
          ],
          "year": 2008,
          "url": "https://mitpress.mit.edu/9780262545877/dataset-shift-in-machine-learning/",
          "topic": "distribution-shift; textbook",
          "evidence": "metadata",
          "publication_status": "MIT Press（出版社はhardcover発売2008-12-12、paperback2022-06-07と表示。一般的な引用年は2009）",
          "checked_on": "2026-10-03",
          "significance": "dataset shiftの標準的編集書。出版社書誌・紹介のみ確認し、書籍全文の精読とは扱わない。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://mitpress.mit.edu/9780262545877/dataset-shift-in-machine-learning/"
      ]
    },
    {
      "canonical_key": "vectorinstitute.ai/wp-content/uploads/2021/08/ds_project_report_final_august9.pdf",
      "id": "GE139",
      "aliases": [
        "GE139"
      ],
      "title": "Understanding Dataset Shift and Potential Remedies",
      "authors": [
        "Mehdi Ataei",
        "Murat Erdogdu",
        "Sedef Akinli Kocak",
        "Shai Ben-David",
        "Shems Saleh"
      ],
      "year": 2021,
      "url": "https://vectorinstitute.ai/wp-content/uploads/2021/08/ds_project_report_final_august9.pdf",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "primary-resource"
      ],
      "records": [
        {
          "id": "GE139",
          "title": "Understanding Dataset Shift and Potential Remedies",
          "authors": [
            "Mehdi Ataei",
            "Murat Erdogdu",
            "Sedef Akinli Kocak",
            "Shai Ben-David",
            "Shems Saleh"
          ],
          "year": 2021,
          "url": "https://vectorinstitute.ai/wp-content/uploads/2021/08/ds_project_report_final_august9.pdf",
          "topic": "distribution-shift; deployment",
          "evidence": "primary-resource",
          "publication_status": "Vector Institute Industry Collaborative Project Technical Report, 2021",
          "checked_on": "2026-10-03",
          "significance": "executive summaryと著作年を確認。横断データ・時系列・画像におけるshiftの実践的分類を提供する技術報告。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://vectorinstitute.ai/wp-content/uploads/2021/08/ds_project_report_final_august9.pdf"
      ]
    },
    {
      "canonical_key": "doi:10.6028/nist.sp.1270",
      "id": "GE140",
      "aliases": [
        "GE140"
      ],
      "title": "Towards a Standard for Identifying and Managing Bias in Artificial Intelligence",
      "authors": [
        "Reva Schwartz",
        "Apostol Vassilev",
        "Kristen Greene",
        "Lori Perine",
        "Andrew Burt",
        "Patrick Hall"
      ],
      "year": 2022,
      "url": "https://doi.org/10.6028/NIST.SP.1270",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "primary-resource"
      ],
      "records": [
        {
          "id": "GE140",
          "title": "Towards a Standard for Identifying and Managing Bias in Artificial Intelligence",
          "authors": [
            "Reva Schwartz",
            "Apostol Vassilev",
            "Kristen Greene",
            "Lori Perine",
            "Andrew Burt",
            "Patrick Hall"
          ],
          "year": 2022,
          "url": "https://doi.org/10.6028/NIST.SP.1270",
          "topic": "fairness; sociotechnical-bias",
          "evidence": "primary-resource",
          "publication_status": "NIST Special Publication 1270, March 2022",
          "checked_on": "2026-10-03",
          "significance": "表紙・executive summary・bias分類の該当箇所を確認。制度、人、統計・計算に由来するbiasを区別する技術報告。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://doi.org/10.6028/NIST.SP.1270"
      ]
    },
    {
      "canonical_key": "proceedings.neurips.cc/paper/2021/hash/533fa796b43291fc61a9e812a50c3fb6-Abstract.html",
      "id": "GE141",
      "aliases": [
        "GE141"
      ],
      "title": "An Online Method for A Class of Distributionally Robust Optimization with Non-convex Objectives",
      "authors": [
        "Qi Qi",
        "Zhishuai Guo",
        "Yi Xu",
        "Rong Jin",
        "Tianbao Yang"
      ],
      "year": 2021,
      "url": "https://proceedings.neurips.cc/paper/2021/hash/533fa796b43291fc61a9e812a50c3fb6-Abstract.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE141",
          "title": "An Online Method for A Class of Distributionally Robust Optimization with Non-convex Objectives",
          "authors": [
            "Qi Qi",
            "Zhishuai Guo",
            "Yi Xu",
            "Rong Jin",
            "Tianbao Yang"
          ],
          "year": 2021,
          "url": "https://proceedings.neurips.cc/paper/2021/hash/533fa796b43291fc61a9e812a50c3fb6-Abstract.html",
          "topic": "distributionally-robust-optimization",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2021",
          "checked_on": "2026-10-03",
          "significance": "KL正則化したDROを合成最小化へ変換するonline法。PL条件の有無で計算量保証を区別。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://proceedings.neurips.cc/paper/2021/hash/533fa796b43291fc61a9e812a50c3fb6-Abstract.html"
      ]
    },
    {
      "canonical_key": "proceedings.mlr.press/v162/gao22b.html",
      "id": "GE142",
      "aliases": [
        "GE142"
      ],
      "title": "Loss Function Learning for Domain Generalization by Implicit Gradient",
      "authors": [
        "Boyan Gao",
        "Henry Gouk",
        "Yongxin Yang",
        "Timothy Hospedales"
      ],
      "year": 2022,
      "url": "https://proceedings.mlr.press/v162/gao22b.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE142",
          "title": "Loss Function Learning for Domain Generalization by Implicit Gradient",
          "authors": [
            "Boyan Gao",
            "Henry Gouk",
            "Yongxin Yang",
            "Timothy Hospedales"
          ],
          "year": 2022,
          "url": "https://proceedings.mlr.press/v162/gao22b.html",
          "topic": "domain-generalization; meta-learning",
          "evidence": "abstract",
          "publication_status": "ICML 2022",
          "checked_on": "2026-10-03",
          "significance": "implicit gradientによるloss学習をERMへ組み込み、single-source DGも評価。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://proceedings.mlr.press/v162/gao22b.html"
      ]
    },
    {
      "canonical_key": "proceedings.neurips.cc/paper_files/paper/2021/hash/ecf9902e0f61677c8de25ae60b654669-Abstract.html",
      "id": "GE143",
      "aliases": [
        "GE143"
      ],
      "title": "An Empirical Investigation of Domain Generalization with Empirical Risk Minimizers",
      "authors": [
        "Ramakrishna Vedantam",
        "David Lopez-Paz",
        "David J. Schwab"
      ],
      "year": 2021,
      "url": "https://proceedings.neurips.cc/paper_files/paper/2021/hash/ecf9902e0f61677c8de25ae60b654669-Abstract.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE143",
          "title": "An Empirical Investigation of Domain Generalization with Empirical Risk Minimizers",
          "authors": [
            "Ramakrishna Vedantam",
            "David Lopez-Paz",
            "David J. Schwab"
          ],
          "year": 2021,
          "url": "https://proceedings.neurips.cc/paper_files/paper/2021/hash/ecf9902e0f61677c8de25ae60b654669-Abstract.html",
          "topic": "domain-generalization; generalization-estimation",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2021",
          "checked_on": "2026-10-03",
          "significance": "ERMのOOD性能とFisher関連量・entropy・MMDの経験的相関を比較。相関を汎用上界と扱わない。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://openreview.net/forum?id=Z8mLxlpSyrJ",
        "https://proceedings.neurips.cc/paper_files/paper/2021/hash/ecf9902e0f61677c8de25ae60b654669-Abstract.html"
      ]
    },
    {
      "canonical_key": "proceedings.neurips.cc/paper/2020/hash/61d77652c97ef636343742fc3dcf3ba9-Abstract.html",
      "id": "GE144",
      "aliases": [
        "GE144"
      ],
      "title": "A Closer Look at Accuracy vs. Robustness",
      "authors": [
        "Yao-Yuan Yang",
        "Cyrus Rashtchian",
        "Hongyang Zhang",
        "Ruslan Salakhutdinov",
        "Kamalika Chaudhuri"
      ],
      "year": 2020,
      "url": "https://proceedings.neurips.cc/paper/2020/hash/61d77652c97ef636343742fc3dcf3ba9-Abstract.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE144",
          "title": "A Closer Look at Accuracy vs. Robustness",
          "authors": [
            "Yao-Yuan Yang",
            "Cyrus Rashtchian",
            "Hongyang Zhang",
            "Ruslan Salakhutdinov",
            "Kamalika Chaudhuri"
          ],
          "year": 2020,
          "url": "https://proceedings.neurips.cc/paper/2020/hash/61d77652c97ef636343742fc3dcf3ba9-Abstract.html",
          "topic": "adversarial-robustness; theory",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2020",
          "checked_on": "2026-10-03",
          "significance": "データの分離と局所Lipschitz性の条件下で精度と敵対的頑健性の両立可能性を論じる。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://proceedings.neurips.cc/paper/2020/file/61d77652c97ef636343742fc3dcf3ba9-Paper.pdf",
        "https://proceedings.neurips.cc/paper/2020/hash/61d77652c97ef636343742fc3dcf3ba9-Abstract.html"
      ]
    },
    {
      "canonical_key": "cv-foundation.org/openaccess/content_iccv_2013/papers/Fang_Unbiased_Metric_Learning_2013_ICCV_paper.pdf",
      "id": "GE145",
      "aliases": [
        "GE145"
      ],
      "title": "Unbiased Metric Learning: On the Utilization of Multiple Datasets and Web Images for Softening Bias",
      "authors": [
        "Chen Fang",
        "Ye Xu",
        "Daniel N. Rockmore"
      ],
      "year": 2013,
      "url": "https://www.cv-foundation.org/openaccess/content_iccv_2013/papers/Fang_Unbiased_Metric_Learning_2013_ICCV_paper.pdf",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "GE145",
          "title": "Unbiased Metric Learning: On the Utilization of Multiple Datasets and Web Images for Softening Bias",
          "authors": [
            "Chen Fang",
            "Ye Xu",
            "Daniel N. Rockmore"
          ],
          "year": 2013,
          "url": "https://www.cv-foundation.org/openaccess/content_iccv_2013/papers/Fang_Unbiased_Metric_Learning_2013_ICCV_paper.pdf",
          "topic": "domain-generalization; metric-learning",
          "evidence": "abstract",
          "publication_status": "ICCV 2013",
          "checked_on": "2026-10-03",
          "significance": "複数の偏ったデータセットをまたぐmetric学習と、弱ラベルweb画像でのモデル選択。PDF冒頭の要旨・著者を確認。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://www.cv-foundation.org/openaccess/content_iccv_2013/papers/Fang_Unbiased_Metric_Learning_2013_ICCV_paper.pdf"
      ]
    },
    {
      "canonical_key": "openaccess.thecvf.com/content/CVPR2022/html/Beery_The_Auto_Arborist_Dataset_A_Large-Scale_Benchmark_for_Multiview_Urban_CVPR_2022_paper.html",
      "id": "GE146",
      "aliases": [
        "GE146"
      ],
      "title": "The Auto Arborist Dataset: A Large-Scale Benchmark for Multiview Urban Forest Monitoring Under Domain Shift",
      "authors": [
        "Sara Beery",
        "Guanhang Wu",
        "Trevor Edwards",
        "Filip Pavetic",
        "Bo Majewski",
        "Shreyasee Mukherjee",
        "Stanley Chan",
        "John Morgan",
        "Vivek Rathod",
        "Jonathan Huang"
      ],
      "year": 2022,
      "url": "https://openaccess.thecvf.com/content/CVPR2022/html/Beery_The_Auto_Arborist_Dataset_A_Large-Scale_Benchmark_for_Multiview_Urban_CVPR_2022_paper.html",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "primary-resource"
      ],
      "records": [
        {
          "id": "GE146",
          "title": "The Auto Arborist Dataset: A Large-Scale Benchmark for Multiview Urban Forest Monitoring Under Domain Shift",
          "authors": [
            "Sara Beery",
            "Guanhang Wu",
            "Trevor Edwards",
            "Filip Pavetic",
            "Bo Majewski",
            "Shreyasee Mukherjee",
            "Stanley Chan",
            "John Morgan",
            "Vivek Rathod",
            "Jonathan Huang"
          ],
          "year": 2022,
          "url": "https://openaccess.thecvf.com/content/CVPR2022/html/Beery_The_Auto_Arborist_Dataset_A_Large-Scale_Benchmark_for_Multiview_Urban_CVPR_2022_paper.html",
          "topic": "geographic-shift; benchmark",
          "evidence": "primary-resource",
          "publication_status": "CVPR 2022（正式書誌と著者の公式データセット説明を確認。会議PDF本文未取得）",
          "checked_on": "2026-10-03",
          "significance": "地理・long-tail・複数視点が重なる都市樹木認識。公式 https://google.github.io/auto-arborist/ は2025-05-27に配布停止と明記。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://openaccess.thecvf.com/content/CVPR2022/papers/Beery_The_Auto_Arborist_Dataset_A_Large-Scale_Benchmark_for_Multiview_Urban_CVPR_2022_paper.pdf",
        "https://openaccess.thecvf.com/content/CVPR2022/html/Beery_The_Auto_Arborist_Dataset_A_Large-Scale_Benchmark_for_Multiview_Urban_CVPR_2022_paper.html",
        "https://google.github.io/auto-arborist/"
      ]
    },
    {
      "canonical_key": "publikationen.bibliothek.kit.edu/1000142108",
      "id": "GE147",
      "aliases": [
        "GE147"
      ],
      "title": "Adaptiope: A Modern Benchmark for Unsupervised Domain Adaptation",
      "authors": [
        "Tobias Ringwald",
        "Rainer Stiefelhagen"
      ],
      "year": 2021,
      "url": "https://publikationen.bibliothek.kit.edu/1000142108",
      "chapters": [
        "generalization"
      ],
      "evidence": [
        "metadata"
      ],
      "records": [
        {
          "id": "GE147",
          "title": "Adaptiope: A Modern Benchmark for Unsupervised Domain Adaptation",
          "authors": [
            "Tobias Ringwald",
            "Rainer Stiefelhagen"
          ],
          "year": 2021,
          "url": "https://publikationen.bibliothek.kit.edu/1000142108",
          "topic": "domain-adaptation; benchmark",
          "evidence": "metadata",
          "publication_status": "WACV 2021, pp.101–110; DOI:10.1109/WACV48630.2021.00015",
          "checked_on": "2026-10-03",
          "significance": "著者所属機関KITの書誌を確認。会議PDF・要旨は未取得のため、本調査では性能やデータ規模の主張に用いない。",
          "chapter": "generalization"
        }
      ],
      "verified_url_aliases": [
        "https://openaccess.thecvf.com/content/WACV2021/papers/Ringwald_Adaptiope_A_Modern_Benchmark_for_Unsupervised_Domain_Adaptation_WACV_2021_paper.pdf",
        "https://publikationen.bibliothek.kit.edu/1000142108"
      ]
    },
    {
      "canonical_key": "arxiv:1409.0473",
      "id": "FM001",
      "aliases": [
        "FM001"
      ],
      "title": "Neural Machine Translation by Jointly Learning to Align and Translate",
      "authors": "Dzmitry Bahdanau ほか",
      "year": 2014,
      "url": "https://arxiv.org/abs/1409.0473",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM001",
          "title": "Neural Machine Translation by Jointly Learning to Align and Translate",
          "authors": "Dzmitry Bahdanau ほか",
          "year": 2014,
          "url": "https://arxiv.org/abs/1409.0473",
          "topic": "attention",
          "evidence": "abstract",
          "publication_status": "ICLR 2015",
          "checked_on": "2026-10-03",
          "reading_note": "固定長ボトルネックから学習可能アラインメントへ",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1706.03762",
      "id": "FM002",
      "aliases": [
        "FM002"
      ],
      "title": "Attention Is All You Need",
      "authors": "Ashish Vaswani ほか",
      "year": 2017,
      "url": "https://arxiv.org/abs/1706.03762",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "FM002",
          "title": "Attention Is All You Need",
          "authors": "Ashish Vaswani ほか",
          "year": 2017,
          "url": "https://arxiv.org/abs/1706.03762",
          "topic": "transformer",
          "evidence": "full-text",
          "publication_status": "NeurIPS 2017",
          "checked_on": "2026-10-03",
          "reading_note": "自己注意・マスク・FFN・残差の基本構造",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1810.04805",
      "id": "FM003",
      "aliases": [
        "FM003"
      ],
      "title": "BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding",
      "authors": "Jacob Devlin ほか",
      "year": 2018,
      "url": "https://arxiv.org/abs/1810.04805",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM003",
          "title": "BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding",
          "authors": "Jacob Devlin ほか",
          "year": 2018,
          "url": "https://arxiv.org/abs/1810.04805",
          "topic": "transformer",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "双方向事前学習と転移",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2005.14165",
      "id": "FM004",
      "aliases": [
        "FM004"
      ],
      "title": "Language Models are Few-Shot Learners",
      "authors": "Tom B. Brown ほか",
      "year": 2020,
      "url": "https://arxiv.org/abs/2005.14165",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM004",
          "title": "Language Models are Few-Shot Learners",
          "authors": "Tom B. Brown ほか",
          "year": 2020,
          "url": "https://arxiv.org/abs/2005.14165",
          "topic": "transformer",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2020",
          "checked_on": "2026-10-03",
          "reading_note": "大規模自己回帰モデルの文脈内学習",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2010.11929",
      "id": "FM005",
      "aliases": [
        "FM005"
      ],
      "title": "An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale",
      "authors": "Alexey Dosovitskiy ほか",
      "year": 2020,
      "url": "https://arxiv.org/abs/2010.11929",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM005",
          "title": "An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale",
          "authors": "Alexey Dosovitskiy ほか",
          "year": 2020,
          "url": "https://arxiv.org/abs/2010.11929",
          "topic": "transformer",
          "evidence": "abstract",
          "publication_status": "ICLR 2021",
          "checked_on": "2026-10-03",
          "reading_note": "画像パッチへのTransformer適用",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2104.09864",
      "id": "FM006",
      "aliases": [
        "FM006"
      ],
      "title": "RoFormer: Enhanced Transformer with Rotary Position Embedding",
      "authors": "Jianlin Su ほか",
      "year": 2021,
      "url": "https://arxiv.org/abs/2104.09864",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM006",
          "title": "RoFormer: Enhanced Transformer with Rotary Position Embedding",
          "authors": "Jianlin Su ほか",
          "year": 2021,
          "url": "https://arxiv.org/abs/2104.09864",
          "topic": "attention",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（出版版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "回転位置埋め込み",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1911.02150",
      "id": "FM007",
      "aliases": [
        "FM007"
      ],
      "title": "Fast Transformer Decoding: One Write-Head is All You Need",
      "authors": "Noam Shazeer",
      "year": 2019,
      "url": "https://arxiv.org/abs/1911.02150",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM007",
          "title": "Fast Transformer Decoding: One Write-Head is All You Need",
          "authors": "Noam Shazeer",
          "year": 2019,
          "url": "https://arxiv.org/abs/1911.02150",
          "topic": "attention",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "KV共有によるdecode効率",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2305.13245",
      "id": "FM008",
      "aliases": [
        "FM008"
      ],
      "title": "GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints",
      "authors": "Joshua Ainslie ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2305.13245",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM008",
          "title": "GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints",
          "authors": "Joshua Ainslie ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2305.13245",
          "topic": "attention",
          "evidence": "abstract",
          "publication_status": "EMNLP 2023",
          "checked_on": "2026-10-03",
          "reading_note": "MQAとMHAの中間設計",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2009.14794",
      "id": "FM009",
      "aliases": [
        "FM009"
      ],
      "title": "Rethinking Attention with Performers",
      "authors": "Krzysztof Choromanski ほか",
      "year": 2020,
      "url": "https://arxiv.org/abs/2009.14794",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM009",
          "title": "Rethinking Attention with Performers",
          "authors": "Krzysztof Choromanski ほか",
          "year": 2020,
          "url": "https://arxiv.org/abs/2009.14794",
          "topic": "attention",
          "evidence": "abstract",
          "publication_status": "ICLR 2021",
          "checked_on": "2026-10-03",
          "reading_note": "ランダム特徴による注意近似",
          "first_submitted": "30 Sep 2020",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2205.14135",
      "id": "FM010",
      "aliases": [
        "FM010",
        "SY009"
      ],
      "title": "FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness",
      "authors": "Tri Dao ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2205.14135",
      "chapters": [
        "foundation-models",
        "systems-and-training"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM010",
          "title": "FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness",
          "authors": "Tri Dao ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2205.14135",
          "topic": "attention",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "厳密注意のIO削減",
          "first_submitted": "27 May 2022",
          "chapter": "foundation-models"
        },
        {
          "id": "SY009",
          "key": "2205.14135",
          "title": "FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness",
          "authors": "Tri Dao; Daniel Y. Fu; Stefano Ermon; Atri Rudra; Christopher Ré",
          "year": 2022,
          "url": "https://arxiv.org/abs/2205.14135",
          "topic": "並列学習・モデル統合",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 27 May 2022 (v1 ), last revised 23 Jun 2022 (this version, v2)",
          "reading_note": "exact attentionをIOから最適化。",
          "chapter": "systems-and-training"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2307.08691",
      "id": "FM011",
      "aliases": [
        "FM011"
      ],
      "title": "FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning",
      "authors": "Tri Dao",
      "year": 2023,
      "url": "https://arxiv.org/abs/2307.08691",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM011",
          "title": "FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning",
          "authors": "Tri Dao",
          "year": 2023,
          "url": "https://arxiv.org/abs/2307.08691",
          "topic": "attention",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "GPU並列化と仕事分割",
          "first_submitted": "17 Jul 2023",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2407.08608",
      "id": "FM012",
      "aliases": [
        "FM012"
      ],
      "title": "FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision",
      "authors": "Jay Shah ほか",
      "year": 2024,
      "url": "https://arxiv.org/abs/2407.08608",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM012",
          "title": "FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision",
          "authors": "Jay Shah ほか",
          "year": 2024,
          "url": "https://arxiv.org/abs/2407.08608",
          "topic": "attention",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "Hopper非同期計算と低精度",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2603.05451",
      "id": "FM013",
      "aliases": [
        "FM013"
      ],
      "title": "FlashAttention-4: Algorithm and Kernel Pipelining Co-Design for Asymmetric Hardware Scaling",
      "authors": "Ted Zadouri ほか",
      "year": 2026,
      "url": "https://arxiv.org/abs/2603.05451",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "FM013",
          "title": "FlashAttention-4: Algorithm and Kernel Pipelining Co-Design for Asymmetric Hardware Scaling",
          "authors": "Ted Zadouri ほか",
          "year": 2026,
          "url": "https://arxiv.org/abs/2603.05451",
          "topic": "attention",
          "evidence": "full-text",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "Blackwellの非対称資源拡張に合わせたカーネル",
          "first_submitted": "5 Mar 2026",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2312.00752",
      "id": "FM014",
      "aliases": [
        "FM014"
      ],
      "title": "Mamba: Linear-Time Sequence Modeling with Selective State Spaces",
      "authors": "Albert Gu・Tri Dao",
      "year": 2023,
      "url": "https://arxiv.org/abs/2312.00752",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM014",
          "title": "Mamba: Linear-Time Sequence Modeling with Selective State Spaces",
          "authors": "Albert Gu・Tri Dao",
          "year": 2023,
          "url": "https://arxiv.org/abs/2312.00752",
          "topic": "transformer",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "選択的状態空間モデル",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2405.21060",
      "id": "FM015",
      "aliases": [
        "FM015"
      ],
      "title": "Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality",
      "authors": "Tri Dao・Albert Gu",
      "year": 2024,
      "url": "https://arxiv.org/abs/2405.21060",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM015",
          "title": "Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality",
          "authors": "Tri Dao・Albert Gu",
          "year": 2024,
          "url": "https://arxiv.org/abs/2405.21060",
          "topic": "transformer",
          "evidence": "abstract",
          "publication_status": "ICML 2024",
          "checked_on": "2026-10-03",
          "reading_note": "注意とSSMの構造的双対性",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2412.19437",
      "id": "FM016",
      "aliases": [
        "FM016",
        "SY014"
      ],
      "title": "DeepSeek-V3 Technical Report",
      "authors": "DeepSeek-AI ほか",
      "year": 2024,
      "url": "https://arxiv.org/abs/2412.19437",
      "chapters": [
        "foundation-models",
        "systems-and-training"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM016",
          "title": "DeepSeek-V3 Technical Report",
          "authors": "DeepSeek-AI ほか",
          "year": 2024,
          "url": "https://arxiv.org/abs/2412.19437",
          "topic": "transformer",
          "evidence": "abstract",
          "publication_status": "arXiv technical report",
          "checked_on": "2026-10-03",
          "reading_note": "MoE・MLA・低精度学習の統合",
          "chapter": "foundation-models"
        },
        {
          "id": "SY014",
          "key": "2412.19437",
          "title": "DeepSeek-V3 Technical Report",
          "authors": "DeepSeek-AI; ほか",
          "year": 2024,
          "url": "https://arxiv.org/abs/2412.19437",
          "topic": "並列学習・モデル統合",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 27 Dec 2024 (v1 ), last revised 18 Feb 2025 (this version, v2)",
          "reading_note": "MoEと訓練systemの技術報告。",
          "chapter": "systems-and-training"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1712.00409",
      "id": "FM017",
      "aliases": [
        "FM017"
      ],
      "title": "Deep Learning Scaling is Predictable, Empirically",
      "authors": "Joel Hestness ほか",
      "year": 2017,
      "url": "https://arxiv.org/abs/1712.00409",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM017",
          "title": "Deep Learning Scaling is Predictable, Empirically",
          "authors": "Joel Hestness ほか",
          "year": 2017,
          "url": "https://arxiv.org/abs/1712.00409",
          "topic": "scaling-laws",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "Kaplan以前の経験的スケーリング研究",
          "first_submitted": "1 Dec 2017",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2001.08361",
      "id": "FM018",
      "aliases": [
        "FM018"
      ],
      "title": "Scaling Laws for Neural Language Models",
      "authors": "Jared Kaplan ほか",
      "year": 2020,
      "url": "https://arxiv.org/abs/2001.08361",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM018",
          "title": "Scaling Laws for Neural Language Models",
          "authors": "Jared Kaplan ほか",
          "year": 2020,
          "url": "https://arxiv.org/abs/2001.08361",
          "topic": "scaling-laws",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "モデル・データ・計算量と損失の関係",
          "first_submitted": "23 Jan 2020",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2203.15556",
      "id": "FM019",
      "aliases": [
        "FM019"
      ],
      "title": "Training Compute-Optimal Large Language Models",
      "authors": "Jordan Hoffmann ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2203.15556",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "FM019",
          "title": "Training Compute-Optimal Large Language Models",
          "authors": "Jordan Hoffmann ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2203.15556",
          "topic": "scaling-laws",
          "evidence": "full-text",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "モデルサイズと学習トークンの配分",
          "first_submitted": "29 Mar 2022",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2106.04560",
      "id": "FM020",
      "aliases": [
        "FM020"
      ],
      "title": "Scaling Vision Transformers",
      "authors": "Xiaohua Zhai ほか",
      "year": 2021,
      "url": "https://arxiv.org/abs/2106.04560",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM020",
          "title": "Scaling Vision Transformers",
          "authors": "Xiaohua Zhai ほか",
          "year": 2021,
          "url": "https://arxiv.org/abs/2106.04560",
          "topic": "scaling-laws",
          "evidence": "abstract",
          "publication_status": "CVPR 2022",
          "checked_on": "2026-10-03",
          "reading_note": "ViTでの規模・データ・計算の関係",
          "first_submitted": "8 Jun 2021",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2102.06701",
      "id": "FM021",
      "aliases": [
        "FM021"
      ],
      "title": "Explaining Neural Scaling Laws",
      "authors": "Yasaman Bahri ほか",
      "year": 2021,
      "url": "https://arxiv.org/abs/2102.06701",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM021",
          "title": "Explaining Neural Scaling Laws",
          "authors": "Yasaman Bahri ほか",
          "year": 2021,
          "url": "https://arxiv.org/abs/2102.06701",
          "topic": "scaling-laws",
          "evidence": "abstract",
          "publication_status": "PNAS 2024",
          "checked_on": "2026-10-03",
          "reading_note": "variance/resolution律速の理論的分類",
          "first_submitted": "12 Feb 2021",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2305.16264",
      "id": "FM022",
      "aliases": [
        "FM022"
      ],
      "title": "Scaling Data-Constrained Language Models",
      "authors": "Niklas Muennighoff ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2305.16264",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM022",
          "title": "Scaling Data-Constrained Language Models",
          "authors": "Niklas Muennighoff ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2305.16264",
          "topic": "scaling-laws",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "有限データの反復学習",
          "first_submitted": "25 May 2023",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2211.04325",
      "id": "FM023",
      "aliases": [
        "FM023"
      ],
      "title": "Will we run out of data? Limits of LLM scaling based on human-generated data",
      "authors": "Pablo Villalobos ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2211.04325",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM023",
          "title": "Will we run out of data? Limits of LLM scaling based on human-generated data",
          "authors": "Pablo Villalobos ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2211.04325",
          "topic": "scaling-laws",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "人間由来データ供給の条件付き予測",
          "first_submitted": "26 Oct 2022",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2304.15004",
      "id": "FM024",
      "aliases": [
        "FM024"
      ],
      "title": "Are Emergent Abilities of Large Language Models a Mirage?",
      "authors": "Rylan Schaeffer ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2304.15004",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM024",
          "title": "Are Emergent Abilities of Large Language Models a Mirage?",
          "authors": "Rylan Schaeffer ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2304.15004",
          "topic": "scaling-laws",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "評価指標が作る見かけの創発",
          "first_submitted": "28 Apr 2023",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2501.18107",
      "id": "FM025",
      "aliases": [
        "FM025"
      ],
      "title": "Scaling Inference-Efficient Language Models",
      "authors": "Song Bian ほか",
      "year": 2025,
      "url": "https://arxiv.org/abs/2501.18107",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM025",
          "title": "Scaling Inference-Efficient Language Models",
          "authors": "Song Bian ほか",
          "year": 2025,
          "url": "https://arxiv.org/abs/2501.18107",
          "topic": "scaling-laws",
          "evidence": "abstract",
          "publication_status": "ICML 2025",
          "checked_on": "2026-10-03",
          "reading_note": "形状と推論レイテンシを含める設計",
          "first_submitted": "30 Jan 2025",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2510.22037",
      "id": "FM026",
      "aliases": [
        "FM026"
      ],
      "title": "ATLAS: Adaptive Transfer Scaling Laws for Multilingual Pretraining, Finetuning, and Decoding the Curse of Multilinguality",
      "authors": "Shayne Longpre ほか",
      "year": 2025,
      "url": "https://arxiv.org/abs/2510.22037",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM026",
          "title": "ATLAS: Adaptive Transfer Scaling Laws for Multilingual Pretraining, Finetuning, and Decoding the Curse of Multilinguality",
          "authors": "Shayne Longpre ほか",
          "year": 2025,
          "url": "https://arxiv.org/abs/2510.22037",
          "topic": "scaling-laws",
          "evidence": "abstract",
          "publication_status": "ICLR 2026（著者公式発表で確認）",
          "checked_on": "2026-10-03",
          "reading_note": "多言語間の転移を含む規模則",
          "first_submitted": "24 Oct 2025",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2610.01640",
      "id": "FM027",
      "aliases": [
        "FM027"
      ],
      "title": "Not All Error Yields to Scale: Where Scaling Stops in Vision-Language Inference",
      "authors": "Xinye Zhao ほか",
      "year": 2026,
      "url": "https://arxiv.org/abs/2610.01640",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM027",
          "title": "Not All Error Yields to Scale: Where Scaling Stops in Vision-Language Inference",
          "authors": "Xinye Zhao ほか",
          "year": 2026,
          "url": "https://arxiv.org/abs/2610.01640",
          "topic": "scaling-laws",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "VLMのモデル規模と視覚解像度の配分",
          "first_submitted": "1 Oct 2026",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1705.09406",
      "id": "FM028",
      "aliases": [
        "FM028"
      ],
      "title": "Multimodal Machine Learning: A Survey and Taxonomy",
      "authors": "Tadas Baltrušaitis ほか",
      "year": 2017,
      "url": "https://arxiv.org/abs/1705.09406",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM028",
          "title": "Multimodal Machine Learning: A Survey and Taxonomy",
          "authors": "Tadas Baltrušaitis ほか",
          "year": 2017,
          "url": "https://arxiv.org/abs/1705.09406",
          "topic": "multimodal",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（雑誌版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "表現・翻訳・整列・融合・co-learningの分類",
          "first_submitted": "26 May 2017",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2103.00020",
      "id": "FM029",
      "aliases": [
        "FM029"
      ],
      "title": "Learning Transferable Visual Models From Natural Language Supervision",
      "authors": "Alec Radford ほか",
      "year": 2021,
      "url": "https://arxiv.org/abs/2103.00020",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM029",
          "title": "Learning Transferable Visual Models From Natural Language Supervision",
          "authors": "Alec Radford ほか",
          "year": 2021,
          "url": "https://arxiv.org/abs/2103.00020",
          "topic": "multimodal",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "画像テキスト対照学習",
          "first_submitted": "26 Feb 2021",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2204.14198",
      "id": "FM030",
      "aliases": [
        "FM030"
      ],
      "title": "Flamingo: a Visual Language Model for Few-Shot Learning",
      "authors": "Jean-Baptiste Alayrac ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2204.14198",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM030",
          "title": "Flamingo: a Visual Language Model for Few-Shot Learning",
          "authors": "Jean-Baptiste Alayrac ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2204.14198",
          "topic": "multimodal",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2022",
          "checked_on": "2026-10-03",
          "reading_note": "画像と文章の交互入力とfew-shot学習",
          "first_submitted": "29 Apr 2022",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2301.12597",
      "id": "FM031",
      "aliases": [
        "FM031"
      ],
      "title": "BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models",
      "authors": "Junnan Li ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2301.12597",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM031",
          "title": "BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models",
          "authors": "Junnan Li ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2301.12597",
          "topic": "multimodal",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "凍結モデル間をQ-Formerで接続",
          "first_submitted": "30 Jan 2023",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2304.08485",
      "id": "FM032",
      "aliases": [
        "FM032"
      ],
      "title": "Visual Instruction Tuning",
      "authors": "Haotian Liu ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2304.08485",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM032",
          "title": "Visual Instruction Tuning",
          "authors": "Haotian Liu ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2304.08485",
          "topic": "multimodal",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2023",
          "checked_on": "2026-10-03",
          "reading_note": "視覚instruction tuning",
          "first_submitted": "17 Apr 2023",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2305.05665",
      "id": "FM033",
      "aliases": [
        "FM033"
      ],
      "title": "ImageBind: One Embedding Space To Bind Them All",
      "authors": "Rohit Girdhar ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2305.05665",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM033",
          "title": "ImageBind: One Embedding Space To Bind Them All",
          "authors": "Rohit Girdhar ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2305.05665",
          "topic": "multimodal",
          "evidence": "abstract",
          "publication_status": "CVPR 2023",
          "checked_on": "2026-10-03",
          "reading_note": "画像を軸に六モダリティを整列",
          "first_submitted": "9 May 2023",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2502.13923",
      "id": "FM034",
      "aliases": [
        "FM034"
      ],
      "title": "Qwen2.5-VL Technical Report",
      "authors": "Shuai Bai ほか",
      "year": 2025,
      "url": "https://arxiv.org/abs/2502.13923",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM034",
          "title": "Qwen2.5-VL Technical Report",
          "authors": "Shuai Bai ほか",
          "year": 2025,
          "url": "https://arxiv.org/abs/2502.13923",
          "topic": "multimodal",
          "evidence": "abstract",
          "publication_status": "arXiv technical report",
          "checked_on": "2026-10-03",
          "reading_note": "動的解像度と時間表現",
          "first_submitted": "19 Feb 2025",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2509.17765",
      "id": "FM035",
      "aliases": [
        "FM035"
      ],
      "title": "Qwen3-Omni Technical Report",
      "authors": "Jin Xu ほか",
      "year": 2025,
      "url": "https://arxiv.org/abs/2509.17765",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM035",
          "title": "Qwen3-Omni Technical Report",
          "authors": "Jin Xu ほか",
          "year": 2025,
          "url": "https://arxiv.org/abs/2509.17765",
          "topic": "multimodal",
          "evidence": "abstract",
          "publication_status": "arXiv technical report",
          "checked_on": "2026-10-03",
          "reading_note": "テキスト・画像・音声・動画の統合",
          "first_submitted": "22 Sep 2025",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2011.07191",
      "id": "FM036",
      "aliases": [
        "FM036"
      ],
      "title": "On the Benefits of Early Fusion in Multimodal Representation Learning",
      "authors": "George Barnum ほか",
      "year": 2020,
      "url": "https://arxiv.org/abs/2011.07191",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM036",
          "title": "On the Benefits of Early Fusion in Multimodal Representation Learning",
          "authors": "George Barnum ほか",
          "year": 2020,
          "url": "https://arxiv.org/abs/2011.07191",
          "topic": "multimodal",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（ICLR採択は未確認）",
          "checked_on": "2026-10-03",
          "reading_note": "early fusionのタスク依存な利点",
          "first_submitted": "14 Nov 2020",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": [
        "https://openreview.net/forum?id=cfqJY583gim"
      ]
    },
    {
      "canonical_key": "arxiv:2409.07825",
      "id": "FM037",
      "aliases": [
        "FM037"
      ],
      "title": "Deep Multimodal Learning with Missing Modality: A Survey",
      "authors": "Renjie Wu ほか",
      "year": 2024,
      "url": "https://arxiv.org/abs/2409.07825",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM037",
          "title": "Deep Multimodal Learning with Missing Modality: A Survey",
          "authors": "Renjie Wu ほか",
          "year": 2024,
          "url": "https://arxiv.org/abs/2409.07825",
          "topic": "multimodal",
          "evidence": "abstract",
          "publication_status": "TMLR（arXiv更新版で採択記載、2026）",
          "checked_on": "2026-10-03",
          "reading_note": "欠落モダリティの頑健性",
          "first_submitted": "12 Sep 2024",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2609.19445",
      "id": "FM038",
      "aliases": [
        "FM038"
      ],
      "title": "From Models to Systems: A Comprehensive Survey of Efficient Multimodal Learning",
      "authors": "Pan Wang ほか",
      "year": 2026,
      "url": "https://arxiv.org/abs/2609.19445",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM038",
          "title": "From Models to Systems: A Comprehensive Survey of Efficient Multimodal Learning",
          "authors": "Pan Wang ほか",
          "year": 2026,
          "url": "https://arxiv.org/abs/2609.19445",
          "topic": "multimodal",
          "evidence": "abstract",
          "publication_status": "TMLR 2026（arXiv journal reference）",
          "checked_on": "2026-10-03",
          "reading_note": "モデル・アルゴリズム・システムの効率整理",
          "first_submitted": "16 Sep 2026",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2110.14202",
      "id": "FM039",
      "aliases": [
        "FM039"
      ],
      "title": "Revisit Multimodal Meta-Learning through the Lens of Multi-Task Learning",
      "authors": "Milad Abdollahzadeh ほか",
      "year": 2021,
      "url": "https://arxiv.org/abs/2110.14202",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM039",
          "title": "Revisit Multimodal Meta-Learning through the Lens of Multi-Task Learning",
          "authors": "Milad Abdollahzadeh ほか",
          "year": 2021,
          "url": "https://arxiv.org/abs/2110.14202",
          "topic": "multimodal",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2021",
          "checked_on": "2026-10-03",
          "reading_note": "タスク分布の多峰性とセンサ融合の用語を区別",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": [
        "https://proceedings.neurips.cc/paper/2021/hash/7b3403f79b478699224bb449509694cf-Abstract.html"
      ]
    },
    {
      "canonical_key": "arxiv:1706.03741",
      "id": "FM040",
      "aliases": [
        "FM040"
      ],
      "title": "Deep reinforcement learning from human preferences",
      "authors": "Paul Christiano ほか",
      "year": 2017,
      "url": "https://arxiv.org/abs/1706.03741",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM040",
          "title": "Deep reinforcement learning from human preferences",
          "authors": "Paul Christiano ほか",
          "year": 2017,
          "url": "https://arxiv.org/abs/1706.03741",
          "topic": "rlhf",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "人間の比較から報酬を学習",
          "first_submitted": "12 Jun 2017",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1909.08593",
      "id": "FM041",
      "aliases": [
        "FM041"
      ],
      "title": "Fine-Tuning Language Models from Human Preferences",
      "authors": "Daniel M. Ziegler ほか",
      "year": 2019,
      "url": "https://arxiv.org/abs/1909.08593",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM041",
          "title": "Fine-Tuning Language Models from Human Preferences",
          "authors": "Daniel M. Ziegler ほか",
          "year": 2019,
          "url": "https://arxiv.org/abs/1909.08593",
          "topic": "rlhf",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "言語生成への選好学習の導入",
          "first_submitted": "18 Sep 2019",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2009.01325",
      "id": "FM042",
      "aliases": [
        "FM042"
      ],
      "title": "Learning to summarize from human feedback",
      "authors": "Nisan Stiennon ほか",
      "year": 2020,
      "url": "https://arxiv.org/abs/2009.01325",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM042",
          "title": "Learning to summarize from human feedback",
          "authors": "Nisan Stiennon ほか",
          "year": 2020,
          "url": "https://arxiv.org/abs/2009.01325",
          "topic": "rlhf",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2020",
          "checked_on": "2026-10-03",
          "reading_note": "要約で人間選好を最適化",
          "first_submitted": "2 Sep 2020",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2203.02155",
      "id": "FM043",
      "aliases": [
        "FM043"
      ],
      "title": "Training language models to follow instructions with human feedback",
      "authors": "Long Ouyang ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2203.02155",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "FM043",
          "title": "Training language models to follow instructions with human feedback",
          "authors": "Long Ouyang ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2203.02155",
          "topic": "rlhf",
          "evidence": "full-text",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "SFT・報酬モデル・PPOの実用的統合",
          "first_submitted": "4 Mar 2022",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1707.06347",
      "id": "FM044",
      "aliases": [
        "FM044"
      ],
      "title": "Proximal Policy Optimization Algorithms",
      "authors": "John Schulman ほか",
      "year": 2017,
      "url": "https://arxiv.org/abs/1707.06347",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM044",
          "title": "Proximal Policy Optimization Algorithms",
          "authors": "John Schulman ほか",
          "year": 2017,
          "url": "https://arxiv.org/abs/1707.06347",
          "topic": "rlhf",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "clipped policy gradientの基礎",
          "first_submitted": "20 Jul 2017",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2212.08073",
      "id": "FM045",
      "aliases": [
        "FM045"
      ],
      "title": "Constitutional AI: Harmlessness from AI Feedback",
      "authors": "Yuntao Bai ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2212.08073",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM045",
          "title": "Constitutional AI: Harmlessness from AI Feedback",
          "authors": "Yuntao Bai ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2212.08073",
          "topic": "rlhf",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "憲法原則とAIフィードバック",
          "first_submitted": "15 Dec 2022",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2305.18290",
      "id": "FM046",
      "aliases": [
        "FM046"
      ],
      "title": "Direct Preference Optimization: Your Language Model is Secretly a Reward Model",
      "authors": "Rafael Rafailov ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2305.18290",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "FM046",
          "title": "Direct Preference Optimization: Your Language Model is Secretly a Reward Model",
          "authors": "Rafael Rafailov ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2305.18290",
          "topic": "rlhf",
          "evidence": "full-text",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "KL正則化RLHFから直接選好損失を導出",
          "first_submitted": "29 May 2023",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2310.12036",
      "id": "FM047",
      "aliases": [
        "FM047"
      ],
      "title": "A General Theoretical Paradigm to Understand Learning from Human Preferences",
      "authors": "Mohammad Gheshlaghi Azar ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2310.12036",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM047",
          "title": "A General Theoretical Paradigm to Understand Learning from Human Preferences",
          "authors": "Mohammad Gheshlaghi Azar ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2310.12036",
          "topic": "rlhf",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "選好学習の理論とIPO",
          "first_submitted": "18 Oct 2023",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2402.01306",
      "id": "FM048",
      "aliases": [
        "FM048"
      ],
      "title": "KTO: Model Alignment as Prospect Theoretic Optimization",
      "authors": "Kawin Ethayarajh ほか",
      "year": 2024,
      "url": "https://arxiv.org/abs/2402.01306",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM048",
          "title": "KTO: Model Alignment as Prospect Theoretic Optimization",
          "authors": "Kawin Ethayarajh ほか",
          "year": 2024,
          "url": "https://arxiv.org/abs/2402.01306",
          "topic": "rlhf",
          "evidence": "abstract",
          "publication_status": "ICML 2024",
          "checked_on": "2026-10-03",
          "reading_note": "ペア不要の望ましさラベル学習",
          "first_submitted": "2 Feb 2024",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2405.14734",
      "id": "FM049",
      "aliases": [
        "FM049"
      ],
      "title": "SimPO: Simple Preference Optimization with a Reference-Free Reward",
      "authors": "Yu Meng ほか",
      "year": 2024,
      "url": "https://arxiv.org/abs/2405.14734",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM049",
          "title": "SimPO: Simple Preference Optimization with a Reference-Free Reward",
          "authors": "Yu Meng ほか",
          "year": 2024,
          "url": "https://arxiv.org/abs/2405.14734",
          "topic": "rlhf",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2024",
          "checked_on": "2026-10-03",
          "reading_note": "参照モデル不要の選好学習",
          "first_submitted": "23 May 2024",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2210.10760",
      "id": "FM050",
      "aliases": [
        "FM050"
      ],
      "title": "Scaling Laws for Reward Model Overoptimization",
      "authors": "Leo Gao ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2210.10760",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM050",
          "title": "Scaling Laws for Reward Model Overoptimization",
          "authors": "Leo Gao ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2210.10760",
          "topic": "rlhf",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "代理報酬の過剰最適化",
          "first_submitted": "19 Oct 2022",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2307.15217",
      "id": "FM051",
      "aliases": [
        "FM051"
      ],
      "title": "Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback",
      "authors": "Stephen Casper ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2307.15217",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM051",
          "title": "Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback",
          "authors": "Stephen Casper ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2307.15217",
          "topic": "rlhf",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "フィードバック・報酬・方策の限界の分類",
          "first_submitted": "27 Jul 2023",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2602.00603",
      "id": "FM052",
      "aliases": [
        "FM052"
      ],
      "title": "Direct Preference Optimization with Rating Information: Practical Algorithms and Provable Gains",
      "authors": "Luca Viano ほか",
      "year": 2026,
      "url": "https://arxiv.org/abs/2602.00603",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM052",
          "title": "Direct Preference Optimization with Rating Information: Practical Algorithms and Provable Gains",
          "authors": "Luca Viano ほか",
          "year": 2026,
          "url": "https://arxiv.org/abs/2602.00603",
          "topic": "rlhf",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "選好の向きに加えて評価差を利用",
          "first_submitted": "31 Jan 2026",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2602.09305",
      "id": "FM053",
      "aliases": [
        "FM053"
      ],
      "title": "Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation",
      "authors": "Pei-Chi Pan ほか",
      "year": 2026,
      "url": "https://arxiv.org/abs/2602.09305",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM053",
          "title": "Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation",
          "authors": "Pei-Chi Pan ほか",
          "year": 2026,
          "url": "https://arxiv.org/abs/2602.09305",
          "topic": "rlhf",
          "evidence": "abstract",
          "publication_status": "TMLR 2026（arXiv採択記載）",
          "checked_on": "2026-10-03",
          "reading_note": "推論学習における報酬設計の総説",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2201.11903",
      "id": "FM054",
      "aliases": [
        "FM054"
      ],
      "title": "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models",
      "authors": "Jason Wei ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2201.11903",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM054",
          "title": "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models",
          "authors": "Jason Wei ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2201.11903",
          "topic": "reasoning",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "中間ステップの例示による推論誘導",
          "first_submitted": "28 Jan 2022",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2203.11171",
      "id": "FM055",
      "aliases": [
        "FM055"
      ],
      "title": "Self-Consistency Improves Chain of Thought Reasoning in Language Models",
      "authors": "Xuezhi Wang ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2203.11171",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM055",
          "title": "Self-Consistency Improves Chain of Thought Reasoning in Language Models",
          "authors": "Xuezhi Wang ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2203.11171",
          "topic": "reasoning",
          "evidence": "abstract",
          "publication_status": "ICLR 2023",
          "checked_on": "2026-10-03",
          "reading_note": "複数の推論経路と回答投票",
          "first_submitted": "21 Mar 2022",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2305.10601",
      "id": "FM056",
      "aliases": [
        "FM056"
      ],
      "title": "Tree of Thoughts: Deliberate Problem Solving with Large Language Models",
      "authors": "Shunyu Yao ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2305.10601",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM056",
          "title": "Tree of Thoughts: Deliberate Problem Solving with Large Language Models",
          "authors": "Shunyu Yao ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2305.10601",
          "topic": "reasoning",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2023",
          "checked_on": "2026-10-03",
          "reading_note": "明示的探索と自己評価",
          "first_submitted": "17 May 2023",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2210.03629",
      "id": "FM057",
      "aliases": [
        "FM057"
      ],
      "title": "ReAct: Synergizing Reasoning and Acting in Language Models",
      "authors": "Shunyu Yao ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2210.03629",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM057",
          "title": "ReAct: Synergizing Reasoning and Acting in Language Models",
          "authors": "Shunyu Yao ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2210.03629",
          "topic": "reasoning",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "推論と環境操作の交互実行",
          "first_submitted": "6 Oct 2022",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2305.20050",
      "id": "FM058",
      "aliases": [
        "FM058"
      ],
      "title": "Let's Verify Step by Step",
      "authors": "Hunter Lightman ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2305.20050",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM058",
          "title": "Let's Verify Step by Step",
          "authors": "Hunter Lightman ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2305.20050",
          "topic": "reasoning",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "過程監督と最終結果監督の比較",
          "first_submitted": "31 May 2023",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2408.03314",
      "id": "FM059",
      "aliases": [
        "FM059"
      ],
      "title": "Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters",
      "authors": "Charlie Snell ほか",
      "year": 2024,
      "url": "https://arxiv.org/abs/2408.03314",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM059",
          "title": "Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters",
          "authors": "Charlie Snell ほか",
          "year": 2024,
          "url": "https://arxiv.org/abs/2408.03314",
          "topic": "reasoning",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "問題難度に応じる推論計算配分",
          "first_submitted": "6 Aug 2024",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2402.03300",
      "id": "FM060",
      "aliases": [
        "FM060"
      ],
      "title": "DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models",
      "authors": "Zhihong Shao ほか",
      "year": 2024,
      "url": "https://arxiv.org/abs/2402.03300",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM060",
          "title": "DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models",
          "authors": "Zhihong Shao ほか",
          "year": 2024,
          "url": "https://arxiv.org/abs/2402.03300",
          "topic": "reasoning",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "数学データとGRPO",
          "first_submitted": "5 Feb 2024",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2501.12948",
      "id": "FM061",
      "aliases": [
        "FM061"
      ],
      "title": "DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning",
      "authors": "DeepSeek-AI ほか",
      "year": 2025,
      "url": "https://arxiv.org/abs/2501.12948",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "FM061",
          "title": "DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning",
          "authors": "DeepSeek-AI ほか",
          "year": 2025,
          "url": "https://arxiv.org/abs/2501.12948",
          "topic": "reasoning",
          "evidence": "full-text",
          "publication_status": "Nature 645, 633–638 (2025); 技術報告v1を本文確認",
          "checked_on": "2026-10-03",
          "reading_note": "R1-Zeroと多段階R1・蒸留の区別",
          "first_submitted": "22 Jan 2025",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2501.19393",
      "id": "FM062",
      "aliases": [
        "FM062"
      ],
      "title": "s1: Simple test-time scaling",
      "authors": "Niklas Muennighoff ほか",
      "year": 2025,
      "url": "https://arxiv.org/abs/2501.19393",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM062",
          "title": "s1: Simple test-time scaling",
          "authors": "Niklas Muennighoff ほか",
          "year": 2025,
          "url": "https://arxiv.org/abs/2501.19393",
          "topic": "reasoning",
          "evidence": "abstract",
          "publication_status": "EMNLP 2025",
          "checked_on": "2026-10-03",
          "reading_note": "少量SFTとbudget forcing",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2502.05171",
      "id": "FM063",
      "aliases": [
        "FM063"
      ],
      "title": "Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach",
      "authors": "Jonas Geiping ほか",
      "year": 2025,
      "url": "https://arxiv.org/abs/2502.05171",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM063",
          "title": "Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach",
          "authors": "Jonas Geiping ほか",
          "year": 2025,
          "url": "https://arxiv.org/abs/2502.05171",
          "topic": "reasoning",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "潜在状態の反復による推論計算拡張",
          "first_submitted": "7 Feb 2025",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2503.14476",
      "id": "FM064",
      "aliases": [
        "FM064"
      ],
      "title": "DAPO: An Open-Source LLM Reinforcement Learning System at Scale",
      "authors": "Qiying Yu ほか",
      "year": 2025,
      "url": "https://arxiv.org/abs/2503.14476",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM064",
          "title": "DAPO: An Open-Source LLM Reinforcement Learning System at Scale",
          "authors": "Qiying Yu ほか",
          "year": 2025,
          "url": "https://arxiv.org/abs/2503.14476",
          "topic": "reasoning",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "大規模RLの実装要因と再現性",
          "first_submitted": "18 Mar 2025",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2504.13837",
      "id": "FM065",
      "aliases": [
        "FM065"
      ],
      "title": "Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?",
      "authors": "Yang Yue ほか",
      "year": 2025,
      "url": "https://arxiv.org/abs/2504.13837",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM065",
          "title": "Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?",
          "authors": "Yang Yue ほか",
          "year": 2025,
          "url": "https://arxiv.org/abs/2504.13837",
          "topic": "reasoning",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2025",
          "checked_on": "2026-10-03",
          "reading_note": "pass@kと基盤モデルの探索範囲の議論",
          "first_submitted": "18 Apr 2025",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2506.06941",
      "id": "FM066",
      "aliases": [
        "FM066"
      ],
      "title": "The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity",
      "authors": "Parshin Shojaee ほか",
      "year": 2025,
      "url": "https://arxiv.org/abs/2506.06941",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM066",
          "title": "The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity",
          "authors": "Parshin Shojaee ほか",
          "year": 2025,
          "url": "https://arxiv.org/abs/2506.06941",
          "topic": "reasoning",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2025",
          "checked_on": "2026-10-03",
          "reading_note": "制御パズルで推論の複雑度依存を測定",
          "first_submitted": "7 Jun 2025",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2609.26704",
      "id": "FM067",
      "aliases": [
        "FM067"
      ],
      "title": "Beyond Repeated Sampling: Learning Search Policies for LLM Reasoning",
      "authors": "Ismail Labiad ほか",
      "year": 2026,
      "url": "https://arxiv.org/abs/2609.26704",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM067",
          "title": "Beyond Repeated Sampling: Learning Search Policies for LLM Reasoning",
          "authors": "Ismail Labiad ほか",
          "year": 2026,
          "url": "https://arxiv.org/abs/2609.26704",
          "topic": "reasoning",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "大きなモデルを案内する小さな探索方策",
          "first_submitted": "22 Sep 2026",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2609.37203",
      "id": "FM068",
      "aliases": [
        "FM068"
      ],
      "title": "Learning to Prove, Not Just to Answer: Reinforcement Learning from Formal Verification for Natural-Language Logical Reasoning",
      "authors": "Qili Zhang ほか",
      "year": 2026,
      "url": "https://arxiv.org/abs/2609.37203",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM068",
          "title": "Learning to Prove, Not Just to Answer: Reinforcement Learning from Formal Verification for Natural-Language Logical Reasoning",
          "authors": "Qili Zhang ほか",
          "year": 2026,
          "url": "https://arxiv.org/abs/2609.37203",
          "topic": "reasoning",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "自然言語論理の過程を形式検証",
          "first_submitted": "29 Sep 2026",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1406.2661",
      "id": "FM069",
      "aliases": [
        "FM069",
        "MD76"
      ],
      "title": "Generative Adversarial Networks",
      "authors": "Ian J. Goodfellow ほか",
      "year": 2014,
      "url": "https://arxiv.org/abs/1406.2661",
      "chapters": [
        "foundation-models",
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM069",
          "title": "Generative Adversarial Networks",
          "authors": "Ian J. Goodfellow ほか",
          "year": 2014,
          "url": "https://arxiv.org/abs/1406.2661",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議題名はGenerative Adversarial Nets）",
          "checked_on": "2026-10-03",
          "reading_note": "生成器と識別器による分布学習",
          "first_submitted": "10 Jun 2014",
          "chapter": "foundation-models"
        },
        {
          "id": "MD76",
          "title": "Generative Adversarial Networks",
          "authors": [
            "Ian J. Goodfellow",
            "Jean Pouget-Abadie",
            "Mehdi Mirza",
            "Bing Xu",
            "David Warde-Farley",
            "Sherjil Ozair",
            "Aaron Courville",
            "Yoshua Bengio"
          ],
          "year": 2014,
          "url": "https://arxiv.org/abs/1406.2661",
          "topic": "GAN",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2014, published;刊行題名はGenerative Adversarial Nets、記載題名はarXiv版",
          "checked_on": "2026-10-03",
          "significance": "生成器と識別器の二者ゲーム",
          "venue_url": "https://papers.nips.cc/paper/2014/hash/f033ed80deb0234979a61f95710dbe25-Abstract.html",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1511.06434",
      "id": "FM070",
      "aliases": [
        "FM070"
      ],
      "title": "Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks",
      "authors": "Alec Radford ほか",
      "year": 2015,
      "url": "https://arxiv.org/abs/1511.06434",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM070",
          "title": "Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks",
          "authors": "Alec Radford ほか",
          "year": 2015,
          "url": "https://arxiv.org/abs/1511.06434",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "畳み込みGANの設計",
          "first_submitted": "19 Nov 2015",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1701.07875",
      "id": "FM071",
      "aliases": [
        "FM071",
        "MD77"
      ],
      "title": "Wasserstein GAN",
      "authors": "Martin Arjovsky ほか",
      "year": 2017,
      "url": "https://arxiv.org/abs/1701.07875",
      "chapters": [
        "foundation-models",
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM071",
          "title": "Wasserstein GAN",
          "authors": "Martin Arjovsky ほか",
          "year": 2017,
          "url": "https://arxiv.org/abs/1701.07875",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "Wasserstein距離による学習目的",
          "first_submitted": "26 Jan 2017",
          "chapter": "foundation-models"
        },
        {
          "id": "MD77",
          "title": "Wasserstein GAN",
          "authors": [
            "Martin Arjovsky",
            "Soumith Chintala",
            "Léon Bottou"
          ],
          "year": 2017,
          "url": "https://arxiv.org/abs/1701.07875",
          "topic": "GAN",
          "evidence": "abstract",
          "publication_status": "ICML 2017, published;刊行題名はWasserstein Generative Adversarial Networks、記載題名はarXiv版",
          "checked_on": "2026-10-03",
          "significance": "Wasserstein双対を用いる生成学習",
          "venue_url": "https://proceedings.mlr.press/v70/arjovsky17a.html",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1704.00028",
      "id": "FM072",
      "aliases": [
        "FM072",
        "MD78"
      ],
      "title": "Improved Training of Wasserstein GANs",
      "authors": "Ishaan Gulrajani ほか",
      "year": 2017,
      "url": "https://arxiv.org/abs/1704.00028",
      "chapters": [
        "foundation-models",
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM072",
          "title": "Improved Training of Wasserstein GANs",
          "authors": "Ishaan Gulrajani ほか",
          "year": 2017,
          "url": "https://arxiv.org/abs/1704.00028",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2017",
          "checked_on": "2026-10-03",
          "reading_note": "weight clippingから勾配正則化へ",
          "first_submitted": "31 Mar 2017",
          "chapter": "foundation-models"
        },
        {
          "id": "MD78",
          "title": "Improved Training of Wasserstein GANs",
          "authors": [
            "Ishaan Gulrajani",
            "Faruk Ahmed",
            "Martin Arjovsky",
            "Vincent Dumoulin",
            "Aaron Courville"
          ],
          "year": 2017,
          "url": "https://arxiv.org/abs/1704.00028",
          "topic": "GAN",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2017, published",
          "checked_on": "2026-10-03",
          "significance": "gradient penaltyによるcriticの正則化",
          "venue_url": "https://papers.nips.cc/paper_files/paper/2017/hash/892c3b1c6dccd52936e27cbd0ff683d6-Abstract.html",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1802.05957",
      "id": "FM073",
      "aliases": [
        "FM073",
        "MD79"
      ],
      "title": "Spectral Normalization for Generative Adversarial Networks",
      "authors": "Takeru Miyato ほか",
      "year": 2018,
      "url": "https://arxiv.org/abs/1802.05957",
      "chapters": [
        "foundation-models",
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM073",
          "title": "Spectral Normalization for Generative Adversarial Networks",
          "authors": "Takeru Miyato ほか",
          "year": 2018,
          "url": "https://arxiv.org/abs/1802.05957",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "ICLR 2018",
          "checked_on": "2026-10-03",
          "reading_note": "識別器のスペクトル正規化",
          "first_submitted": "16 Feb 2018",
          "chapter": "foundation-models"
        },
        {
          "id": "MD79",
          "title": "Spectral Normalization for Generative Adversarial Networks",
          "authors": [
            "Takeru Miyato",
            "Toshiki Kataoka",
            "Masanori Koyama",
            "Yuichi Yoshida"
          ],
          "year": 2018,
          "url": "https://arxiv.org/abs/1802.05957",
          "topic": "GAN",
          "evidence": "abstract",
          "publication_status": "ICLR 2018, published",
          "checked_on": "2026-10-03",
          "significance": "識別器のspectral norm制御",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": [
        "https://openreview.net/forum?id=B1QRgziT-"
      ]
    },
    {
      "canonical_key": "arxiv:1705.10461",
      "id": "FM074",
      "aliases": [
        "FM074"
      ],
      "title": "The Numerics of GANs",
      "authors": "Lars Mescheder ほか",
      "year": 2017,
      "url": "https://arxiv.org/abs/1705.10461",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM074",
          "title": "The Numerics of GANs",
          "authors": "Lars Mescheder ほか",
          "year": 2017,
          "url": "https://arxiv.org/abs/1705.10461",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "ゲームの勾配場と局所安定性",
          "first_submitted": "30 May 2017",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1801.04406",
      "id": "FM075",
      "aliases": [
        "FM075"
      ],
      "title": "Which Training Methods for GANs do actually Converge?",
      "authors": "Lars Mescheder ほか",
      "year": 2018,
      "url": "https://arxiv.org/abs/1801.04406",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "FM075",
          "title": "Which Training Methods for GANs do actually Converge?",
          "authors": "Lars Mescheder ほか",
          "year": 2018,
          "url": "https://arxiv.org/abs/1801.04406",
          "topic": "gan",
          "evidence": "full-text",
          "publication_status": "ICML 2018",
          "checked_on": "2026-10-03",
          "reading_note": "収束保証の仮定と反例",
          "first_submitted": "13 Jan 2018",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1809.11096",
      "id": "FM077",
      "aliases": [
        "FM077"
      ],
      "title": "Large Scale GAN Training for High Fidelity Natural Image Synthesis",
      "authors": "Andrew Brock ほか",
      "year": 2018,
      "url": "https://arxiv.org/abs/1809.11096",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM077",
          "title": "Large Scale GAN Training for High Fidelity Natural Image Synthesis",
          "authors": "Andrew Brock ほか",
          "year": 2018,
          "url": "https://arxiv.org/abs/1809.11096",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "GANの大規模化と品質・多様性",
          "first_submitted": "28 Sep 2018",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1812.04948",
      "id": "FM078",
      "aliases": [
        "FM078"
      ],
      "title": "A Style-Based Generator Architecture for Generative Adversarial Networks",
      "authors": "Tero Karras ほか",
      "year": 2018,
      "url": "https://arxiv.org/abs/1812.04948",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM078",
          "title": "A Style-Based Generator Architecture for Generative Adversarial Networks",
          "authors": "Tero Karras ほか",
          "year": 2018,
          "url": "https://arxiv.org/abs/1812.04948",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "CVPR 2019",
          "checked_on": "2026-10-03",
          "reading_note": "スタイル空間と生成制御",
          "first_submitted": "12 Dec 2018",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1912.04958",
      "id": "FM079",
      "aliases": [
        "FM079"
      ],
      "title": "Analyzing and Improving the Image Quality of StyleGAN",
      "authors": "Tero Karras ほか",
      "year": 2019,
      "url": "https://arxiv.org/abs/1912.04958",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM079",
          "title": "Analyzing and Improving the Image Quality of StyleGAN",
          "authors": "Tero Karras ほか",
          "year": 2019,
          "url": "https://arxiv.org/abs/1912.04958",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "StyleGANのアーティファクト改善",
          "first_submitted": "3 Dec 2019",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2106.12423",
      "id": "FM080",
      "aliases": [
        "FM080"
      ],
      "title": "Alias-Free Generative Adversarial Networks",
      "authors": "Tero Karras ほか",
      "year": 2021,
      "url": "https://arxiv.org/abs/2106.12423",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM080",
          "title": "Alias-Free Generative Adversarial Networks",
          "authors": "Tero Karras ほか",
          "year": 2021,
          "url": "https://arxiv.org/abs/2106.12423",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "aliasingと変換同変性",
          "first_submitted": "23 Jun 2021",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2303.05511",
      "id": "FM081",
      "aliases": [
        "FM081"
      ],
      "title": "Scaling up GANs for Text-to-Image Synthesis",
      "authors": "Minguk Kang ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2303.05511",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM081",
          "title": "Scaling up GANs for Text-to-Image Synthesis",
          "authors": "Minguk Kang ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2303.05511",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "CVPR 2023",
          "checked_on": "2026-10-03",
          "reading_note": "テキスト条件付きGANの大規模化",
          "first_submitted": "9 Mar 2023",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2501.05441",
      "id": "FM082",
      "aliases": [
        "FM082"
      ],
      "title": "The GAN is dead; long live the GAN! A Modern GAN Baseline",
      "authors": "Yiwen Huang ほか",
      "year": 2024,
      "url": "https://arxiv.org/abs/2501.05441",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM082",
          "title": "The GAN is dead; long live the GAN! A Modern GAN Baseline",
          "authors": "Yiwen Huang ほか",
          "year": 2024,
          "url": "https://arxiv.org/abs/2501.05441",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2024; arXiv掲載は2025",
          "checked_on": "2026-10-03",
          "reading_note": "相対損失とゼロ中心勾配正則化による現代的ベースライン",
          "first_submitted": "9 Jan 2025",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2006.11239",
      "id": "FM083",
      "aliases": [
        "FM083",
        "MD23"
      ],
      "title": "Denoising Diffusion Probabilistic Models",
      "authors": "Jonathan Ho ほか",
      "year": 2020,
      "url": "https://arxiv.org/abs/2006.11239",
      "chapters": [
        "foundation-models",
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM083",
          "title": "Denoising Diffusion Probabilistic Models",
          "authors": "Jonathan Ho ほか",
          "year": 2020,
          "url": "https://arxiv.org/abs/2006.11239",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "拡散モデルとの目的関数・生成手順の比較",
          "first_submitted": "19 Jun 2020",
          "chapter": "foundation-models"
        },
        {
          "id": "MD23",
          "title": "Denoising Diffusion Probabilistic Models",
          "authors": [
            "Jonathan Ho",
            "Ajay Jain",
            "Pieter Abbeel"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2006.11239",
          "topic": "diffusion",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2020, published",
          "checked_on": "2026-10-03",
          "significance": "denoising目的による拡散生成",
          "venue_url": "https://proceedings.neurips.cc/paper/2020/hash/4c5bcfec8584af0d967f1ab10179ca4b-Abstract.html",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2405.14867",
      "id": "FM084",
      "aliases": [
        "FM084"
      ],
      "title": "Improved Distribution Matching Distillation for Fast Image Synthesis",
      "authors": "Tianwei Yin ほか",
      "year": 2024,
      "url": "https://arxiv.org/abs/2405.14867",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM084",
          "title": "Improved Distribution Matching Distillation for Fast Image Synthesis",
          "authors": "Tianwei Yin ほか",
          "year": 2024,
          "url": "https://arxiv.org/abs/2405.14867",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "GAN損失と拡散蒸留を接続",
          "first_submitted": "23 May 2024",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2601.01441",
      "id": "FM085",
      "aliases": [
        "FM085"
      ],
      "title": "Image Synthesis Using Spintronic Deep Convolutional Generative Adversarial Network",
      "authors": "Saumya Gupta ほか",
      "year": 2026,
      "url": "https://arxiv.org/abs/2601.01441",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM085",
          "title": "Image Synthesis Using Spintronic Deep Convolutional Generative Adversarial Network",
          "authors": "Saumya Gupta ほか",
          "year": 2026,
          "url": "https://arxiv.org/abs/2601.01441",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "2026年の特殊ハードウェア実装の例",
          "first_submitted": "4 Jan 2026",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1909.08053",
      "id": "FM086",
      "aliases": [
        "FM086",
        "SY003"
      ],
      "title": "Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism",
      "authors": "Mohammad Shoeybi ほか",
      "year": 2019,
      "url": "https://arxiv.org/abs/1909.08053",
      "chapters": [
        "foundation-models",
        "systems-and-training"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM086",
          "title": "Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism",
          "authors": "Mohammad Shoeybi ほか",
          "year": 2019,
          "url": "https://arxiv.org/abs/1909.08053",
          "topic": "llm-implementation",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "層内モデル並列",
          "first_submitted": "17 Sep 2019",
          "chapter": "foundation-models"
        },
        {
          "id": "SY003",
          "key": "1909.08053",
          "title": "Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism",
          "authors": "Mohammad Shoeybi; Mostofa Patwary; Raul Puri; ほか",
          "year": 2019,
          "url": "https://arxiv.org/abs/1909.08053",
          "topic": "並列学習・モデル統合",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 17 Sep 2019 (v1 ), last revised 13 Mar 2020 (this version, v4)",
          "reading_note": "Transformerのtensor parallelism。",
          "chapter": "systems-and-training"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1910.02054",
      "id": "FM087",
      "aliases": [
        "FM087",
        "SY001"
      ],
      "title": "ZeRO: Memory Optimizations Toward Training Trillion Parameter Models",
      "authors": "Samyam Rajbhandari ほか",
      "year": 2019,
      "url": "https://arxiv.org/abs/1910.02054",
      "chapters": [
        "foundation-models",
        "systems-and-training"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM087",
          "title": "ZeRO: Memory Optimizations Toward Training Trillion Parameter Models",
          "authors": "Samyam Rajbhandari ほか",
          "year": 2019,
          "url": "https://arxiv.org/abs/1910.02054",
          "topic": "llm-implementation",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "optimizer・gradient・parameterの分割",
          "first_submitted": "4 Oct 2019",
          "chapter": "foundation-models"
        },
        {
          "id": "SY001",
          "key": "1910.02054",
          "title": "ZeRO: Memory Optimizations Toward Training Trillion Parameter Models",
          "authors": "Samyam Rajbhandari; Jeff Rasley; Olatunji Ruwase; Yuxiong He",
          "year": 2019,
          "url": "https://arxiv.org/abs/1910.02054",
          "topic": "並列学習・モデル統合",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 4 Oct 2019 (v1 ), last revised 13 May 2020 (this version, v3)",
          "reading_note": "model state重複削減の基礎。",
          "chapter": "systems-and-training"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2106.09685",
      "id": "FM088",
      "aliases": [
        "FM088"
      ],
      "title": "LoRA: Low-Rank Adaptation of Large Language Models",
      "authors": "Edward J. Hu ほか",
      "year": 2021,
      "url": "https://arxiv.org/abs/2106.09685",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM088",
          "title": "LoRA: Low-Rank Adaptation of Large Language Models",
          "authors": "Edward J. Hu ほか",
          "year": 2021,
          "url": "https://arxiv.org/abs/2106.09685",
          "topic": "llm-implementation",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "低ランク差分による適応",
          "first_submitted": "17 Jun 2021",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2305.14314",
      "id": "FM089",
      "aliases": [
        "FM089"
      ],
      "title": "QLoRA: Efficient Finetuning of Quantized LLMs",
      "authors": "Tim Dettmers ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2305.14314",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM089",
          "title": "QLoRA: Efficient Finetuning of Quantized LLMs",
          "authors": "Tim Dettmers ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2305.14314",
          "topic": "llm-implementation",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "4bit凍結重みとLoRA学習",
          "first_submitted": "23 May 2023",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2210.17323",
      "id": "FM090",
      "aliases": [
        "FM090"
      ],
      "title": "GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers",
      "authors": "Elias Frantar ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2210.17323",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM090",
          "title": "GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers",
          "authors": "Elias Frantar ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2210.17323",
          "topic": "llm-implementation",
          "evidence": "abstract",
          "publication_status": "ICLR 2023",
          "checked_on": "2026-10-03",
          "reading_note": "二次情報を使う学習後量子化",
          "first_submitted": "31 Oct 2022",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2306.00978",
      "id": "FM091",
      "aliases": [
        "FM091"
      ],
      "title": "AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration",
      "authors": "Ji Lin ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2306.00978",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM091",
          "title": "AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration",
          "authors": "Ji Lin ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2306.00978",
          "topic": "llm-implementation",
          "evidence": "abstract",
          "publication_status": "MLSys 2024",
          "checked_on": "2026-10-03",
          "reading_note": "activationに基づく重要重み保護",
          "first_submitted": "1 Jun 2023",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2309.06180",
      "id": "FM092",
      "aliases": [
        "FM092"
      ],
      "title": "Efficient Memory Management for Large Language Model Serving with PagedAttention",
      "authors": "Woosuk Kwon ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2309.06180",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM092",
          "title": "Efficient Memory Management for Large Language Model Serving with PagedAttention",
          "authors": "Woosuk Kwon ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2309.06180",
          "topic": "llm-implementation",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "KVキャッシュのページ管理",
          "first_submitted": "12 Sep 2023",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2211.17192",
      "id": "FM093",
      "aliases": [
        "FM093"
      ],
      "title": "Fast Inference from Transformers via Speculative Decoding",
      "authors": "Yaniv Leviathan ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2211.17192",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM093",
          "title": "Fast Inference from Transformers via Speculative Decoding",
          "authors": "Yaniv Leviathan ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2211.17192",
          "topic": "llm-implementation",
          "evidence": "abstract",
          "publication_status": "ICML 2023",
          "checked_on": "2026-10-03",
          "reading_note": "分布保存型speculative decoding",
          "first_submitted": "30 Nov 2022",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2312.07104",
      "id": "FM094",
      "aliases": [
        "FM094"
      ],
      "title": "SGLang: Efficient Execution of Structured Language Model Programs",
      "authors": "Lianmin Zheng ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2312.07104",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM094",
          "title": "SGLang: Efficient Execution of Structured Language Model Programs",
          "authors": "Lianmin Zheng ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2312.07104",
          "topic": "llm-implementation",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "構造化生成とprefix cache共有",
          "first_submitted": "12 Dec 2023",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "icml.cc/2011/papers/399_icmlpaper.pdf",
      "id": "FM095",
      "aliases": [
        "FM095"
      ],
      "title": "Multimodal Deep Learning",
      "authors": "Jiquan Ngiam ほか",
      "year": 2011,
      "url": "https://icml.cc/2011/papers/399_icmlpaper.pdf",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "metadata"
      ],
      "records": [
        {
          "id": "FM095",
          "title": "Multimodal Deep Learning",
          "authors": "Jiquan Ngiam ほか",
          "year": 2011,
          "url": "https://icml.cc/2011/papers/399_icmlpaper.pdf",
          "topic": "multimodal",
          "evidence": "metadata",
          "publication_status": "ICML 2011",
          "checked_on": "2026-10-03",
          "reading_note": "音声・映像の共有表現とcross-modal転移",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "pmc.ncbi.nlm.nih.gov/articles/PMC8921642",
      "id": "FM096",
      "aliases": [
        "FM096"
      ],
      "title": "Multimodal deep learning for biomedical data fusion: a review",
      "authors": "Sören Richard Stahlschmidt ほか",
      "year": 2022,
      "url": "https://pmc.ncbi.nlm.nih.gov/articles/PMC8921642/",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "FM096",
          "title": "Multimodal deep learning for biomedical data fusion: a review",
          "authors": "Sören Richard Stahlschmidt ほか",
          "year": 2022,
          "url": "https://pmc.ncbi.nlm.nih.gov/articles/PMC8921642/",
          "topic": "multimodal",
          "evidence": "full-text",
          "publication_status": "Briefings in Bioinformatics 23(2), bbab569 (2022)",
          "checked_on": "2026-10-03",
          "reading_note": "生体データ融合の分類と評価設計",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": [
        "https://academic.oup.com/bib/article/23/2/bbab569/6516346"
      ]
    },
    {
      "canonical_key": "arxiv:2105.11087",
      "id": "FM097",
      "aliases": [
        "FM097"
      ],
      "title": "Recent Advances and Trends in Multimodal Deep Learning: A Review",
      "authors": "Jabeen Summaira ほか",
      "year": 2021,
      "url": "https://arxiv.org/abs/2105.11087",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM097",
          "title": "Recent Advances and Trends in Multimodal Deep Learning: A Review",
          "authors": "Jabeen Summaira ほか",
          "year": 2021,
          "url": "https://arxiv.org/abs/2105.11087",
          "topic": "multimodal",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "生理信号を含む応用・データセットの概観",
          "first_submitted": "24 May 2021",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1904.06991",
      "id": "FM098",
      "aliases": [
        "FM098"
      ],
      "title": "Improved Precision and Recall Metric for Assessing Generative Models",
      "authors": "Tuomas Kynkäänniemi ほか",
      "year": 2019,
      "url": "https://arxiv.org/abs/1904.06991",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM098",
          "title": "Improved Precision and Recall Metric for Assessing Generative Models",
          "authors": "Tuomas Kynkäänniemi ほか",
          "year": 2019,
          "url": "https://arxiv.org/abs/1904.06991",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2019",
          "checked_on": "2026-10-03",
          "reading_note": "品質と被覆を別々に評価",
          "first_submitted": "15 Apr 2019",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2104.11222",
      "id": "FM099",
      "aliases": [
        "FM099"
      ],
      "title": "On Aliased Resizing and Surprising Subtleties in GAN Evaluation",
      "authors": "Gaurav Parmar ほか",
      "year": 2021,
      "url": "https://arxiv.org/abs/2104.11222",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM099",
          "title": "On Aliased Resizing and Surprising Subtleties in GAN Evaluation",
          "authors": "Gaurav Parmar ほか",
          "year": 2021,
          "url": "https://arxiv.org/abs/2104.11222",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "CVPR 2022",
          "checked_on": "2026-10-03",
          "reading_note": "FIDの前処理依存性",
          "first_submitted": "22 Apr 2021",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2012.07805",
      "id": "FM100",
      "aliases": [
        "FM100"
      ],
      "title": "Extracting Training Data from Large Language Models",
      "authors": "Nicholas Carlini ほか",
      "year": 2020,
      "url": "https://arxiv.org/abs/2012.07805",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM100",
          "title": "Extracting Training Data from Large Language Models",
          "authors": "Nicholas Carlini ほか",
          "year": 2020,
          "url": "https://arxiv.org/abs/2012.07805",
          "topic": "scaling-laws",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "記憶・抽出可能性と汎化の区別",
          "first_submitted": "14 Dec 2020",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1612.03242",
      "id": "FM101",
      "aliases": [
        "FM101"
      ],
      "title": "StackGAN: Text to Photo-realistic Image Synthesis with Stacked Generative Adversarial Networks",
      "authors": "Han Zhang ほか",
      "year": 2016,
      "url": "https://arxiv.org/abs/1612.03242",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM101",
          "title": "StackGAN: Text to Photo-realistic Image Synthesis with Stacked Generative Adversarial Networks",
          "authors": "Han Zhang ほか",
          "year": 2016,
          "url": "https://arxiv.org/abs/1612.03242",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "ICCV 2017",
          "checked_on": "2026-10-03",
          "reading_note": "多段階のテキスト条件付き生成",
          "first_submitted": "10 Dec 2016",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1909.12573",
      "id": "FM102",
      "aliases": [
        "FM102"
      ],
      "title": "RGBD-GAN: Unsupervised 3D Representation Learning From Natural Image Datasets via RGBD Image Synthesis",
      "authors": "Atsuhiro Noguchi ほか",
      "year": 2019,
      "url": "https://arxiv.org/abs/1909.12573",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM102",
          "title": "RGBD-GAN: Unsupervised 3D Representation Learning From Natural Image Datasets via RGBD Image Synthesis",
          "authors": "Atsuhiro Noguchi ほか",
          "year": 2019,
          "url": "https://arxiv.org/abs/1909.12573",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "ICLR 2020",
          "checked_on": "2026-10-03",
          "reading_note": "2D画像から3D整合性を学習",
          "first_submitted": "27 Sep 2019",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1905.09922",
      "id": "FM103",
      "aliases": [
        "FM103"
      ],
      "title": "Training language GANs from Scratch",
      "authors": "Cyprien de Masson d'Autume ほか",
      "year": 2019,
      "url": "https://arxiv.org/abs/1905.09922",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM103",
          "title": "Training language GANs from Scratch",
          "authors": "Cyprien de Masson d'Autume ほか",
          "year": 2019,
          "url": "https://arxiv.org/abs/1905.09922",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "離散言語GANの学習と多様性",
          "first_submitted": "23 May 2019",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1907.03395",
      "id": "FM104",
      "aliases": [
        "FM104"
      ],
      "title": "Social-BiGAT: Multimodal Trajectory Forecasting using Bicycle-GAN and Graph Attention Networks",
      "authors": "Vineet Kosaraju ほか",
      "year": 2019,
      "url": "https://arxiv.org/abs/1907.03395",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM104",
          "title": "Social-BiGAT: Multimodal Trajectory Forecasting using Bicycle-GAN and Graph Attention Networks",
          "authors": "Vineet Kosaraju ほか",
          "year": 2019,
          "url": "https://arxiv.org/abs/1907.03395",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "社会的相互作用と多峰的軌道予測",
          "first_submitted": "4 Jul 2019",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2501.08316",
      "id": "FM105",
      "aliases": [
        "FM105"
      ],
      "title": "Diffusion Adversarial Post-Training for One-Step Video Generation",
      "authors": "Shanchuan Lin ほか",
      "year": 2025,
      "url": "https://arxiv.org/abs/2501.08316",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM105",
          "title": "Diffusion Adversarial Post-Training for One-Step Video Generation",
          "authors": "Shanchuan Lin ほか",
          "year": 2025,
          "url": "https://arxiv.org/abs/2501.08316",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "ICML 2025",
          "checked_on": "2026-10-03",
          "reading_note": "拡散事前学習と敵対的後学習による動画生成",
          "first_submitted": "14 Jan 2025",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2608.13573",
      "id": "FM106",
      "aliases": [
        "FM106"
      ],
      "title": "A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing",
      "authors": "William Nixon ほか",
      "year": 2026,
      "url": "https://arxiv.org/abs/2608.13573",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM106",
          "title": "A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing",
          "authors": "William Nixon ほか",
          "year": 2026,
          "url": "https://arxiv.org/abs/2608.13573",
          "topic": "llm-implementation",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "長期実運用トレースに基づくserving評価",
          "date_note": "一次ページ表示 Submitted 3 Jul 2026、識別子2608.13573の月および検索索引の日付と不整合。本文は2026年とのみ記載。",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1701.00160",
      "id": "FM107",
      "aliases": [
        "FM107"
      ],
      "title": "NIPS 2016 Tutorial: Generative Adversarial Networks",
      "authors": "Ian Goodfellow",
      "year": 2016,
      "url": "https://arxiv.org/abs/1701.00160",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM107",
          "title": "NIPS 2016 Tutorial: Generative Adversarial Networks",
          "authors": "Ian Goodfellow",
          "year": 2016,
          "url": "https://arxiv.org/abs/1701.00160",
          "topic": "gan",
          "evidence": "abstract",
          "publication_status": "NIPS 2016 tutorial report; arXiv識別子は1701、Submittedは2016-12-31",
          "checked_on": "2026-10-03",
          "reading_note": "GANの目的・生成モデル間の比較を原著者のチュートリアルから学ぶ",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "nature.com/articles/srep04411",
      "id": "FM108",
      "aliases": [
        "FM108"
      ],
      "title": "Information content and analysis methods for Multi-Modal High-Throughput Biomedical Data",
      "authors": "Bisakha Ray ほか",
      "year": 2014,
      "url": "https://www.nature.com/articles/srep04411",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM108",
          "title": "Information content and analysis methods for Multi-Modal High-Throughput Biomedical Data",
          "authors": "Bisakha Ray ほか",
          "year": 2014,
          "url": "https://www.nature.com/articles/srep04411",
          "topic": "multimodal",
          "evidence": "abstract",
          "publication_status": "Scientific Reports 4, 4411 (2014)",
          "checked_on": "2026-10-03",
          "reading_note": "複数modalityを足しても予測が改善するとは限らないという比較設計",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "pmc.ncbi.nlm.nih.gov/articles/PMC7864942",
      "id": "FM109",
      "aliases": [
        "FM109"
      ],
      "title": "Multimodal deep learning models for early detection of Alzheimer’s disease stage",
      "authors": "Janani Venugopalan ほか",
      "year": 2021,
      "url": "https://pmc.ncbi.nlm.nih.gov/articles/PMC7864942/",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "FM109",
          "title": "Multimodal deep learning models for early detection of Alzheimer’s disease stage",
          "authors": "Janani Venugopalan ほか",
          "year": 2021,
          "url": "https://pmc.ncbi.nlm.nih.gov/articles/PMC7864942/",
          "topic": "multimodal",
          "evidence": "abstract",
          "publication_status": "Scientific Reports 11, 3254 (2021)",
          "checked_on": "2026-10-03",
          "reading_note": "MRI・遺伝・臨床データの融合をADNI上で評価した具体例",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": [
        "https://www.nature.com/articles/s41598-020-74399-w"
      ]
    },
    {
      "canonical_key": "ism.ac.jp/openhouse/2019/index/ISM-75-tutorial_fukumizu_open.pdf",
      "id": "FM110",
      "aliases": [
        "FM110"
      ],
      "title": "深層生成モデルによる統計的推論",
      "authors": "福水健次",
      "year": 2019,
      "url": "https://www.ism.ac.jp/openhouse/2019/index/ISM-75-tutorial_fukumizu_open.pdf",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "primary-resource"
      ],
      "records": [
        {
          "id": "FM110",
          "title": "深層生成モデルによる統計的推論",
          "authors": "福水健次",
          "year": 2019,
          "url": "https://www.ism.ac.jp/openhouse/2019/index/ISM-75-tutorial_fukumizu_open.pdf",
          "topic": "gan",
          "evidence": "primary-resource",
          "publication_status": "統計数理研究所創立75周年記念チュートリアル講演、2019-06-05",
          "checked_on": "2026-10-03",
          "reading_note": "GANを分布比較・Bayes推論とつなぐ講義資料",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "deepspeed.ai/assets/files/DeepSpeed_Overview_Japanese_2023Jun7th.pdf",
      "id": "FM111",
      "aliases": [
        "FM111"
      ],
      "title": "DeepSpeed: 深層学習の訓練と推論を劇的に高速化するフレームワーク",
      "authors": "Microsoft DeepSpeed Team",
      "year": 2023,
      "url": "https://www.deepspeed.ai/assets/files/DeepSpeed_Overview_Japanese_2023Jun7th.pdf",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "primary-resource"
      ],
      "records": [
        {
          "id": "FM111",
          "title": "DeepSpeed: 深層学習の訓練と推論を劇的に高速化するフレームワーク",
          "authors": "Microsoft DeepSpeed Team",
          "year": 2023,
          "url": "https://www.deepspeed.ai/assets/files/DeepSpeed_Overview_Japanese_2023Jun7th.pdf",
          "topic": "llm-implementation",
          "evidence": "primary-resource",
          "publication_status": "公式日本語概要スライド、2023-06-07",
          "checked_on": "2026-10-03",
          "reading_note": "ZeRO等の研究からフレームワークの機能へ進む導入",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "dennyzhou.github.io/LLM-Reasoning-Berkeley.pdf",
      "id": "FM112",
      "aliases": [
        "FM112"
      ],
      "title": "LLM Reasoning: Key Ideas and Limitations",
      "authors": "Denny Zhou",
      "year": 2024,
      "url": "https://dennyzhou.github.io/LLM-Reasoning-Berkeley.pdf",
      "chapters": [
        "foundation-models"
      ],
      "evidence": [
        "primary-resource"
      ],
      "records": [
        {
          "id": "FM112",
          "title": "LLM Reasoning: Key Ideas and Limitations",
          "authors": "Denny Zhou",
          "year": 2024,
          "url": "https://dennyzhou.github.io/LLM-Reasoning-Berkeley.pdf",
          "topic": "reasoning",
          "evidence": "primary-resource",
          "publication_status": "著者公開講義スライド（表紙のBerkeley講演年2024を採用）",
          "checked_on": "2026-10-03",
          "reading_note": "CoT・self-consistencyなどの研究を著者の講義でたどる",
          "chapter": "foundation-models"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "jmlr.org/papers/v18/17-468.html",
      "id": "MD01",
      "aliases": [
        "MD01"
      ],
      "title": "Automatic Differentiation in Machine Learning: a Survey",
      "authors": [
        "Atilim Gunes Baydin",
        "Barak A. Pearlmutter",
        "Alexey Andreyevich Radul",
        "Jeffrey Mark Siskind"
      ],
      "year": 2018,
      "url": "https://www.jmlr.org/papers/v18/17-468.html",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD01",
          "title": "Automatic Differentiation in Machine Learning: a Survey",
          "authors": [
            "Atilim Gunes Baydin",
            "Barak A. Pearlmutter",
            "Alexey Andreyevich Radul",
            "Jeffrey Mark Siskind"
          ],
          "year": 2018,
          "url": "https://www.jmlr.org/papers/v18/17-468.html",
          "topic": "AD",
          "evidence": "abstract",
          "publication_status": "JMLR 18(153), published",
          "checked_on": "2026-10-03",
          "significance": "ADと逆伝播の関係、forward/reverse modeの標準レビュー",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": [
        "https://www.jmlr.org/papers/volume18/17-468/17-468.pdf"
      ]
    },
    {
      "canonical_key": "doi:10.1162/neco.1994.6.1.147",
      "id": "MD02",
      "aliases": [
        "MD02"
      ],
      "title": "Fast Exact Multiplication by the Hessian",
      "authors": [
        "Barak A. Pearlmutter"
      ],
      "year": 1994,
      "url": "https://doi.org/10.1162/neco.1994.6.1.147",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD02",
          "title": "Fast Exact Multiplication by the Hessian",
          "authors": [
            "Barak A. Pearlmutter"
          ],
          "year": 1994,
          "url": "https://doi.org/10.1162/neco.1994.6.1.147",
          "topic": "AD/Hessian",
          "evidence": "abstract",
          "publication_status": "Neural Computation 6(1), published",
          "checked_on": "2026-10-03",
          "significance": "Hessianを構築せずHVPを計算する原典",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "doi:10.1080/03610918908812806",
      "id": "MD03",
      "aliases": [
        "MD03"
      ],
      "title": "A Stochastic Estimator of the Trace of the Influence Matrix for Laplacian Smoothing Splines",
      "authors": [
        "M. F. Hutchinson"
      ],
      "year": 1989,
      "url": "https://doi.org/10.1080/03610918908812806",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD03",
          "title": "A Stochastic Estimator of the Trace of the Influence Matrix for Laplacian Smoothing Splines",
          "authors": [
            "M. F. Hutchinson"
          ],
          "year": 1989,
          "url": "https://doi.org/10.1080/03610918908812806",
          "topic": "Hessian",
          "evidence": "abstract",
          "publication_status": "Communications in Statistics - Simulation and Computation 18(3), published",
          "checked_on": "2026-10-03",
          "significance": "確率的トレース推定の原典",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2010.09649",
      "id": "MD04",
      "aliases": [
        "MD04"
      ],
      "title": "Hutch++: Optimal Stochastic Trace Estimation",
      "authors": [
        "Raphael A. Meyer",
        "Cameron Musco",
        "Christopher Musco",
        "David P. Woodruff"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2010.09649",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD04",
          "title": "Hutch++: Optimal Stochastic Trace Estimation",
          "authors": [
            "Raphael A. Meyer",
            "Cameron Musco",
            "Christopher Musco",
            "David P. Woodruff"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2010.09649",
          "topic": "Hessian",
          "evidence": "abstract",
          "publication_status": "SOSA 2021, published (preprint 2020)",
          "checked_on": "2026-10-03",
          "significance": "低ランク近似と残差推定による分散削減",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1912.10985",
      "id": "MD05",
      "aliases": [
        "MD05"
      ],
      "title": "BackPACK: Packing more into Backprop",
      "authors": [
        "Felix Dangel",
        "Frederik Kunstner",
        "Philipp Hennig"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/1912.10985",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD05",
          "title": "BackPACK: Packing more into Backprop",
          "authors": [
            "Felix Dangel",
            "Frederik Kunstner",
            "Philipp Hennig"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/1912.10985",
          "topic": "AD/Hessian",
          "evidence": "abstract",
          "publication_status": "ICLR 2020, published (preprint 2019)",
          "checked_on": "2026-10-03",
          "significance": "個別勾配と曲率近似を逆伝播で計算",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1901.10159",
      "id": "MD06",
      "aliases": [
        "MD06"
      ],
      "title": "An Investigation into Neural Net Optimization via Hessian Eigenvalue Density",
      "authors": [
        "Behrooz Ghorbani",
        "Shankar Krishnan",
        "Ying Xiao"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1901.10159",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD06",
          "title": "An Investigation into Neural Net Optimization via Hessian Eigenvalue Density",
          "authors": [
            "Behrooz Ghorbani",
            "Shankar Krishnan",
            "Ying Xiao"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1901.10159",
          "topic": "Hessian",
          "evidence": "abstract",
          "publication_status": "ICML 2019, published",
          "checked_on": "2026-10-03",
          "significance": "Hessianスペクトルと勾配方向の関係",
          "venue_url": "https://proceedings.mlr.press/v97/ghorbani19b.html",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1905.12558",
      "id": "MD07",
      "aliases": [
        "MD07"
      ],
      "title": "Limitations of the Empirical Fisher Approximation for Natural Gradient Descent",
      "authors": [
        "Frederik Kunstner",
        "Lukas Balles",
        "Philipp Hennig"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1905.12558",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD07",
          "title": "Limitations of the Empirical Fisher Approximation for Natural Gradient Descent",
          "authors": [
            "Frederik Kunstner",
            "Lukas Balles",
            "Philipp Hennig"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1905.12558",
          "topic": "Fisher",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2019, published",
          "checked_on": "2026-10-03",
          "significance": "empirical Fisherと曲率の混同への反例",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": [
        "https://proceedings.neurips.cc/paper/2019/file/46a558d97954d0692411c861cf78ef79-Paper.pdf"
      ]
    },
    {
      "canonical_key": "jmlr.org/papers/v27/25-1024.html",
      "id": "MD09",
      "aliases": [
        "MD09"
      ],
      "title": "A Common Interface for Automatic Differentiation",
      "authors": [
        "Guillaume Dalle",
        "Adrian Hill"
      ],
      "year": 2026,
      "url": "https://www.jmlr.org/papers/v27/25-1024.html",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD09",
          "title": "A Common Interface for Automatic Differentiation",
          "authors": [
            "Guillaume Dalle",
            "Adrian Hill"
          ],
          "year": 2026,
          "url": "https://www.jmlr.org/papers/v27/25-1024.html",
          "topic": "AD",
          "evidence": "abstract",
          "publication_status": "JMLR 27(25), published January 2026",
          "checked_on": "2026-10-03",
          "significance": "AD backend比較・疎性・準備処理の共通化",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1806.07572",
      "id": "MD10",
      "aliases": [
        "MD10"
      ],
      "title": "Neural Tangent Kernel: Convergence and Generalization in Neural Networks",
      "authors": [
        "Arthur Jacot",
        "Franck Gabriel",
        "Clément Hongler"
      ],
      "year": 2018,
      "url": "https://arxiv.org/abs/1806.07572",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "MD10",
          "title": "Neural Tangent Kernel: Convergence and Generalization in Neural Networks",
          "authors": [
            "Arthur Jacot",
            "Franck Gabriel",
            "Clément Hongler"
          ],
          "year": 2018,
          "url": "https://arxiv.org/abs/1806.07572",
          "topic": "NTK",
          "evidence": "full-text",
          "publication_status": "NeurIPS 2018, published",
          "checked_on": "2026-10-03",
          "significance": "関数空間の学習ダイナミクスをNTKで表現",
          "venue_url": "https://proceedings.neurips.cc/paper/2018/file/5a4be1fa34e62bb8a6ec6b91d2462f5a-Paper.pdf",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1902.06720",
      "id": "MD11",
      "aliases": [
        "MD11"
      ],
      "title": "Wide Neural Networks of Any Depth Evolve as Linear Models Under Gradient Descent",
      "authors": [
        "Jaehoon Lee",
        "Lechao Xiao",
        "Samuel S. Schoenholz",
        "Yasaman Bahri",
        "Roman Novak",
        "Jascha Sohl-Dickstein",
        "Jeffrey Pennington"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1902.06720",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD11",
          "title": "Wide Neural Networks of Any Depth Evolve as Linear Models Under Gradient Descent",
          "authors": [
            "Jaehoon Lee",
            "Lechao Xiao",
            "Samuel S. Schoenholz",
            "Yasaman Bahri",
            "Roman Novak",
            "Jascha Sohl-Dickstein",
            "Jeffrey Pennington"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1902.06720",
          "topic": "NTK",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2019, published",
          "checked_on": "2026-10-03",
          "significance": "幅極限でのネットワーク線形化",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1812.07956",
      "id": "MD12",
      "aliases": [
        "MD12"
      ],
      "title": "On Lazy Training in Differentiable Programming",
      "authors": [
        "Lenaic Chizat",
        "Edouard Oyallon",
        "Francis Bach"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1812.07956",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD12",
          "title": "On Lazy Training in Differentiable Programming",
          "authors": [
            "Lenaic Chizat",
            "Edouard Oyallon",
            "Francis Bach"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1812.07956",
          "topic": "NTK",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2019, published (preprint 2018)",
          "checked_on": "2026-10-03",
          "significance": "lazy trainingは幅だけでなくスケーリングで決まる",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2011.14522",
      "id": "MD13",
      "aliases": [
        "MD13"
      ],
      "title": "Feature Learning in Infinite-Width Neural Networks",
      "authors": [
        "Greg Yang",
        "Edward J. Hu"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2011.14522",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD13",
          "title": "Feature Learning in Infinite-Width Neural Networks",
          "authors": [
            "Greg Yang",
            "Edward J. Hu"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2011.14522",
          "topic": "feature learning",
          "evidence": "abstract",
          "publication_status": "ICML 2021, published (preprint 2020)",
          "checked_on": "2026-10-03",
          "significance": "無限幅でも特徴学習するパラメータ化",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2203.03466",
      "id": "MD14",
      "aliases": [
        "MD14"
      ],
      "title": "Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer",
      "authors": [
        "Greg Yang",
        "Edward J. Hu",
        "Igor Babuschkin",
        "Szymon Sidor",
        "Xiaodong Liu",
        "David Farhi",
        "Nick Ryder",
        "Jakub Pachocki",
        "Weizhu Chen",
        "Jianfeng Gao"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2203.03466",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD14",
          "title": "Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer",
          "authors": [
            "Greg Yang",
            "Edward J. Hu",
            "Igor Babuschkin",
            "Szymon Sidor",
            "Xiaodong Liu",
            "David Farhi",
            "Nick Ryder",
            "Jakub Pachocki",
            "Weizhu Chen",
            "Jianfeng Gao"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2203.03466",
          "topic": "feature learning",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2021, published; arXiv登録2022（刊行年と登録年が異なる）",
          "checked_on": "2026-10-03",
          "significance": "μPと小規模モデルからのハイパーパラメータ移送",
          "venue_url": "https://proceedings.neurips.cc/paper_files/paper/2021/file/8df7c2e3c3c3be098ef7b382bd2c37ba-Paper.pdf",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1812.11118",
      "id": "MD15",
      "aliases": [
        "MD15"
      ],
      "title": "Reconciling modern machine learning practice and the bias-variance trade-off",
      "authors": [
        "Mikhail Belkin",
        "Daniel Hsu",
        "Siyuan Ma",
        "Soumik Mandal"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1812.11118",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD15",
          "title": "Reconciling modern machine learning practice and the bias-variance trade-off",
          "authors": [
            "Mikhail Belkin",
            "Daniel Hsu",
            "Siyuan Ma",
            "Soumik Mandal"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1812.11118",
          "topic": "double descent",
          "evidence": "abstract",
          "publication_status": "PNAS 2019, published (preprint 2018)",
          "checked_on": "2026-10-03",
          "significance": "double descentの統一的描像",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2209.03003",
      "id": "MD16",
      "aliases": [
        "MD16",
        "MD29"
      ],
      "title": "Deep Double Descent: Where Bigger Models and More Data Hurt",
      "authors": [
        "Preetum Nakkiran",
        "Gal Kaplun",
        "Yamini Bansal",
        "Tristan Yang",
        "Boaz Barak",
        "Ilya Sutskever"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/1912.02292",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD16",
          "title": "Deep Double Descent: Where Bigger Models and More Data Hurt",
          "authors": [
            "Preetum Nakkiran",
            "Gal Kaplun",
            "Yamini Bansal",
            "Tristan Yang",
            "Boaz Barak",
            "Ilya Sutskever"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/1912.02292",
          "topic": "double descent",
          "evidence": "abstract",
          "publication_status": "ICLR 2020, published; arXiv初稿2019",
          "checked_on": "2026-10-03",
          "significance": "モデル幅・epoch・データ数に沿った非単調性",
          "venue_url": "https://openreview.net/pdf/2313f8e4c1bbcb174b1e34904fbc5f638c589efa.pdf",
          "chapter": "mathematics-and-dynamics"
        },
        {
          "id": "MD29",
          "title": "Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow",
          "authors": [
            "Xingchao Liu",
            "Chengyue Gong",
            "Qiang Liu"
          ],
          "year": 2023,
          "url": "https://arxiv.org/abs/2209.03003",
          "topic": "flow matching",
          "evidence": "abstract",
          "publication_status": "ICLR 2023, published; arXiv初稿2022",
          "checked_on": "2026-10-03",
          "significance": "rectificationと輸送コスト・軌道の直線化",
          "venue_url": "https://openreview.net/pdf/910c5efa5739a5d2bef83d432da87d3096712ebe.pdf",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1903.08560",
      "id": "MD17",
      "aliases": [
        "MD17"
      ],
      "title": "Surprises in High-Dimensional Ridgeless Least Squares Interpolation",
      "authors": [
        "Trevor Hastie",
        "Andrea Montanari",
        "Saharon Rosset",
        "Ryan J. Tibshirani"
      ],
      "year": 2022,
      "url": "https://arxiv.org/abs/1903.08560",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD17",
          "title": "Surprises in High-Dimensional Ridgeless Least Squares Interpolation",
          "authors": [
            "Trevor Hastie",
            "Andrea Montanari",
            "Saharon Rosset",
            "Ryan J. Tibshirani"
          ],
          "year": 2022,
          "url": "https://arxiv.org/abs/1903.08560",
          "topic": "double descent",
          "evidence": "abstract",
          "publication_status": "Annals of Statistics 50(2), published (preprint 2019)",
          "checked_on": "2026-10-03",
          "significance": "高次元線形・ランダム特徴回帰の精密リスク解析",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1906.11300",
      "id": "MD18",
      "aliases": [
        "MD18"
      ],
      "title": "Benign Overfitting in Linear Regression",
      "authors": [
        "Peter L. Bartlett",
        "Philip M. Long",
        "Gábor Lugosi",
        "Alexander Tsigler"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/1906.11300",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD18",
          "title": "Benign Overfitting in Linear Regression",
          "authors": [
            "Peter L. Bartlett",
            "Philip M. Long",
            "Gábor Lugosi",
            "Alexander Tsigler"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/1906.11300",
          "topic": "double descent",
          "evidence": "abstract",
          "publication_status": "PNAS 2020, published (preprint 2019)",
          "checked_on": "2026-10-03",
          "significance": "良性過学習を共分散の有効ランクで特徴づけ",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2605.17606",
      "id": "MD19",
      "aliases": [
        "MD19"
      ],
      "title": "The Neural Tangent Kernel for Classification",
      "authors": [
        "Jonathan Plenk",
        "Sergio Calvo-Ordonez",
        "Alvaro Cartea",
        "Yarin Gal",
        "Mark van der Wilk",
        "Kamil Ciosek"
      ],
      "year": 2026,
      "url": "https://arxiv.org/abs/2605.17606",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD19",
          "title": "The Neural Tangent Kernel for Classification",
          "authors": [
            "Jonathan Plenk",
            "Sergio Calvo-Ordonez",
            "Alvaro Cartea",
            "Yarin Gal",
            "Mark van der Wilk",
            "Kamil Ciosek"
          ],
          "year": 2026,
          "url": "https://arxiv.org/abs/2605.17606",
          "topic": "NTK",
          "evidence": "abstract",
          "publication_status": "preprint; submitted 2026-05-17, v2 2026-05-22",
          "checked_on": "2026-10-03",
          "significance": "分類損失でのlazy領域の条件",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2002.04026",
      "id": "MD20",
      "aliases": [
        "MD20"
      ],
      "title": "A Generalized Neural Tangent Kernel Analysis for Two-layer Neural Networks",
      "authors": [
        "Zixiang Chen",
        "Yuan Cao",
        "Quanquan Gu",
        "Tong Zhang"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2002.04026",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD20",
          "title": "A Generalized Neural Tangent Kernel Analysis for Two-layer Neural Networks",
          "authors": [
            "Zixiang Chen",
            "Yuan Cao",
            "Quanquan Gu",
            "Tong Zhang"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2002.04026",
          "topic": "NTK",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2020, published",
          "checked_on": "2026-10-03",
          "significance": "ノイズ・weight decayを含む2層NTK解析",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2104.05785",
      "id": "MD21",
      "aliases": [
        "MD21"
      ],
      "title": "A Recipe for Global Convergence Guarantee in Deep Neural Networks",
      "authors": [
        "Kenji Kawaguchi",
        "Qingyun Sun"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2104.05785",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD21",
          "title": "A Recipe for Global Convergence Guarantee in Deep Neural Networks",
          "authors": [
            "Kenji Kawaguchi",
            "Qingyun Sun"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2104.05785",
          "topic": "NTK",
          "evidence": "abstract",
          "publication_status": "AAAI 2021, published",
          "checked_on": "2026-10-03",
          "significance": "expressivity conditionを用いたNTK外の収束保証",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2001.06931",
      "id": "MD22",
      "aliases": [
        "MD22"
      ],
      "title": "Any Target Function Exists in a Neighborhood of Any Sufficiently Wide Random Network: A Geometrical Perspective",
      "authors": [
        "Shun-ichi Amari"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2001.06931",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD22",
          "title": "Any Target Function Exists in a Neighborhood of Any Sufficiently Wide Random Network: A Geometrical Perspective",
          "authors": [
            "Shun-ichi Amari"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2001.06931",
          "topic": "NTK",
          "evidence": "abstract",
          "publication_status": "Neural Computation 32(8), published",
          "checked_on": "2026-10-03",
          "significance": "近傍での表現能力の幾何的説明",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1503.03585",
      "id": "MD24",
      "aliases": [
        "MD24"
      ],
      "title": "Deep Unsupervised Learning using Nonequilibrium Thermodynamics",
      "authors": [
        "Jascha Sohl-Dickstein",
        "Eric A. Weiss",
        "Niru Maheswaranathan",
        "Surya Ganguli"
      ],
      "year": 2015,
      "url": "https://arxiv.org/abs/1503.03585",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD24",
          "title": "Deep Unsupervised Learning using Nonequilibrium Thermodynamics",
          "authors": [
            "Jascha Sohl-Dickstein",
            "Eric A. Weiss",
            "Niru Maheswaranathan",
            "Surya Ganguli"
          ],
          "year": 2015,
          "url": "https://arxiv.org/abs/1503.03585",
          "topic": "diffusion",
          "evidence": "abstract",
          "publication_status": "ICML 2015, published",
          "checked_on": "2026-10-03",
          "significance": "前向き拡散と逆過程による生成の基礎",
          "venue_url": "https://proceedings.mlr.press/v37/sohl-dickstein15.html",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2011.13456",
      "id": "MD25",
      "aliases": [
        "MD25"
      ],
      "title": "Score-Based Generative Modeling through Stochastic Differential Equations",
      "authors": [
        "Yang Song",
        "Jascha Sohl-Dickstein",
        "Diederik P. Kingma",
        "Abhishek Kumar",
        "Stefano Ermon",
        "Ben Poole"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2011.13456",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD25",
          "title": "Score-Based Generative Modeling through Stochastic Differential Equations",
          "authors": [
            "Yang Song",
            "Jascha Sohl-Dickstein",
            "Diederik P. Kingma",
            "Abhishek Kumar",
            "Stefano Ermon",
            "Ben Poole"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2011.13456",
          "topic": "diffusion",
          "evidence": "abstract",
          "publication_status": "ICLR 2021, published (preprint 2020)",
          "checked_on": "2026-10-03",
          "significance": "reverse SDEとprobability-flow ODEの統一",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1806.07366",
      "id": "MD26",
      "aliases": [
        "MD26"
      ],
      "title": "Neural Ordinary Differential Equations",
      "authors": [
        "Ricky T. Q. Chen",
        "Yulia Rubanova",
        "Jesse Bettencourt",
        "David Duvenaud"
      ],
      "year": 2018,
      "url": "https://arxiv.org/abs/1806.07366",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD26",
          "title": "Neural Ordinary Differential Equations",
          "authors": [
            "Ricky T. Q. Chen",
            "Yulia Rubanova",
            "Jesse Bettencourt",
            "David Duvenaud"
          ],
          "year": 2018,
          "url": "https://arxiv.org/abs/1806.07366",
          "topic": "flow matching",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2018, published",
          "checked_on": "2026-10-03",
          "significance": "連続深度ネットワークとCNF",
          "venue_url": "https://proceedings.neurips.cc/paper/2018/hash/69386f6bb1dfed68692a24c8686939b9-Abstract.html",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1810.01367",
      "id": "MD27",
      "aliases": [
        "MD27"
      ],
      "title": "FFJORD: Free-form Continuous Dynamics for Scalable Reversible Generative Models",
      "authors": [
        "Will Grathwohl",
        "Ricky T. Q. Chen",
        "Jesse Bettencourt",
        "Ilya Sutskever",
        "David Duvenaud"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1810.01367",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD27",
          "title": "FFJORD: Free-form Continuous Dynamics for Scalable Reversible Generative Models",
          "authors": [
            "Will Grathwohl",
            "Ricky T. Q. Chen",
            "Jesse Bettencourt",
            "Ilya Sutskever",
            "David Duvenaud"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1810.01367",
          "topic": "flow matching",
          "evidence": "abstract",
          "publication_status": "ICLR 2019, published; arXiv初稿2018",
          "checked_on": "2026-10-03",
          "significance": "確率的divergence推定でCNFを大規模化",
          "venue_url": "https://openreview.net/pdf?id=rJxgknCcK7",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2210.02747",
      "id": "MD28",
      "aliases": [
        "MD28"
      ],
      "title": "Flow Matching for Generative Modeling",
      "authors": [
        "Yaron Lipman",
        "Ricky T. Q. Chen",
        "Heli Ben-Hamu",
        "Maximilian Nickel",
        "Matt Le"
      ],
      "year": 2023,
      "url": "https://arxiv.org/abs/2210.02747",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD28",
          "title": "Flow Matching for Generative Modeling",
          "authors": [
            "Yaron Lipman",
            "Ricky T. Q. Chen",
            "Heli Ben-Hamu",
            "Maximilian Nickel",
            "Matt Le"
          ],
          "year": 2023,
          "url": "https://arxiv.org/abs/2210.02747",
          "topic": "flow matching",
          "evidence": "abstract",
          "publication_status": "ICLR 2023, published (preprint 2022)",
          "checked_on": "2026-10-03",
          "significance": "条件付き速度回帰によるsimulation-free学習",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": [
        "https://openreview.net/forum?id=PqvMRDCJT9t"
      ]
    },
    {
      "canonical_key": "arxiv:2302.00482",
      "id": "MD30",
      "aliases": [
        "MD30"
      ],
      "title": "Improving and generalizing flow-based generative models with minibatch optimal transport",
      "authors": [
        "Alexander Tong",
        "Kilian Fatras",
        "Nikolay Malkin",
        "Guillaume Huguet",
        "Yanlei Zhang",
        "Jarrid Rector-Brooks",
        "Guy Wolf",
        "Yoshua Bengio"
      ],
      "year": 2024,
      "url": "https://arxiv.org/abs/2302.00482",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD30",
          "title": "Improving and generalizing flow-based generative models with minibatch optimal transport",
          "authors": [
            "Alexander Tong",
            "Kilian Fatras",
            "Nikolay Malkin",
            "Guillaume Huguet",
            "Yanlei Zhang",
            "Jarrid Rector-Brooks",
            "Guy Wolf",
            "Yoshua Bengio"
          ],
          "year": 2024,
          "url": "https://arxiv.org/abs/2302.00482",
          "topic": "flow matching/OT",
          "evidence": "abstract",
          "publication_status": "TMLR 2024, published (preprint 2023)",
          "checked_on": "2026-10-03",
          "significance": "CFMの一般化とminibatch OT coupling",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2303.08797",
      "id": "MD31",
      "aliases": [
        "MD31"
      ],
      "title": "Stochastic Interpolants: A Unifying Framework for Flows and Diffusions",
      "authors": [
        "Michael S. Albergo",
        "Nicholas M. Boffi",
        "Eric Vanden-Eijnden"
      ],
      "year": 2025,
      "url": "https://arxiv.org/abs/2303.08797",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD31",
          "title": "Stochastic Interpolants: A Unifying Framework for Flows and Diffusions",
          "authors": [
            "Michael S. Albergo",
            "Nicholas M. Boffi",
            "Eric Vanden-Eijnden"
          ],
          "year": 2025,
          "url": "https://arxiv.org/abs/2303.08797",
          "topic": "flow matching",
          "evidence": "abstract",
          "publication_status": "JMLR 26, published September 2025; arXiv初稿2023",
          "checked_on": "2026-10-03",
          "significance": "flowとdiffusionを確率補間で統一",
          "venue_url": "https://www.jmlr.org/papers/volume26/23-1605/23-1605.pdf",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2303.01469",
      "id": "MD32",
      "aliases": [
        "MD32"
      ],
      "title": "Consistency Models",
      "authors": [
        "Yang Song",
        "Prafulla Dhariwal",
        "Mark Chen",
        "Ilya Sutskever"
      ],
      "year": 2023,
      "url": "https://arxiv.org/abs/2303.01469",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD32",
          "title": "Consistency Models",
          "authors": [
            "Yang Song",
            "Prafulla Dhariwal",
            "Mark Chen",
            "Ilya Sutskever"
          ],
          "year": 2023,
          "url": "https://arxiv.org/abs/2303.01469",
          "topic": "flow matching",
          "evidence": "abstract",
          "publication_status": "ICML 2023, published",
          "checked_on": "2026-10-03",
          "significance": "同一軌道上の写像整合性による少数step生成",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2403.03206",
      "id": "MD33",
      "aliases": [
        "MD33"
      ],
      "title": "Scaling Rectified Flow Transformers for High-Resolution Image Synthesis",
      "authors": [
        "Patrick Esser",
        "Sumith Kulal",
        "Andreas Blattmann",
        "Rahim Entezari",
        "Jonas Müller",
        "Harry Saini",
        "Yam Levi",
        "Dominik Lorenz",
        "Axel Sauer",
        "Frederic Boesel",
        "Dustin Podell",
        "Tim Dockhorn",
        "Zion English",
        "Kyle Lacey",
        "Alex Goodwin",
        "Yannik Marek",
        "Robin Rombach"
      ],
      "year": 2024,
      "url": "https://arxiv.org/abs/2403.03206",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD33",
          "title": "Scaling Rectified Flow Transformers for High-Resolution Image Synthesis",
          "authors": [
            "Patrick Esser",
            "Sumith Kulal",
            "Andreas Blattmann",
            "Rahim Entezari",
            "Jonas Müller",
            "Harry Saini",
            "Yam Levi",
            "Dominik Lorenz",
            "Axel Sauer",
            "Frederic Boesel",
            "Dustin Podell",
            "Tim Dockhorn",
            "Zion English",
            "Kyle Lacey",
            "Alex Goodwin",
            "Yannik Marek",
            "Robin Rombach"
          ],
          "year": 2024,
          "url": "https://arxiv.org/abs/2403.03206",
          "topic": "flow matching",
          "evidence": "abstract",
          "publication_status": "ICML 2024, published;ここではarXiv版の著者一覧を記載",
          "checked_on": "2026-10-03",
          "significance": "時間サンプリング・Transformer・規模の実証",
          "venue_url": "https://proceedings.mlr.press/v235/esser24a.html",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2407.15595",
      "id": "MD34",
      "aliases": [
        "MD34"
      ],
      "title": "Discrete Flow Matching",
      "authors": [
        "Itai Gat",
        "Tal Remez",
        "Neta Shaul",
        "Felix Kreuk",
        "Ricky T. Q. Chen",
        "Gabriel Synnaeve",
        "Yossi Adi",
        "Yaron Lipman"
      ],
      "year": 2024,
      "url": "https://arxiv.org/abs/2407.15595",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD34",
          "title": "Discrete Flow Matching",
          "authors": [
            "Itai Gat",
            "Tal Remez",
            "Neta Shaul",
            "Felix Kreuk",
            "Ricky T. Q. Chen",
            "Gabriel Synnaeve",
            "Yossi Adi",
            "Yaron Lipman"
          ],
          "year": 2024,
          "url": "https://arxiv.org/abs/2407.15595",
          "topic": "flow matching",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2024, published",
          "checked_on": "2026-10-03",
          "significance": "離散空間の確率経路と遷移率",
          "venue_url": "https://proceedings.neurips.cc/paper_files/paper/2024/hash/f0d629a734b56a642701bba7bc8bb3ed-Abstract-Conference.html",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2412.06264",
      "id": "MD35",
      "aliases": [
        "MD35"
      ],
      "title": "Flow Matching Guide and Code",
      "authors": [
        "Yaron Lipman",
        "Marton Havasi",
        "Peter Holderrieth",
        "Neta Shaul",
        "Matt Le",
        "Brian Karrer",
        "Ricky T. Q. Chen",
        "David Lopez-Paz",
        "Heli Ben-Hamu",
        "Itai Gat"
      ],
      "year": 2024,
      "url": "https://arxiv.org/abs/2412.06264",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD35",
          "title": "Flow Matching Guide and Code",
          "authors": [
            "Yaron Lipman",
            "Marton Havasi",
            "Peter Holderrieth",
            "Neta Shaul",
            "Matt Le",
            "Brian Karrer",
            "Ricky T. Q. Chen",
            "David Lopez-Paz",
            "Heli Ben-Hamu",
            "Itai Gat"
          ],
          "year": 2024,
          "url": "https://arxiv.org/abs/2412.06264",
          "topic": "flow matching",
          "evidence": "abstract",
          "publication_status": "arXiv guide 2024",
          "checked_on": "2026-10-03",
          "significance": "連続・離散FMの公式体系化",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2505.13447",
      "id": "MD36",
      "aliases": [
        "MD36"
      ],
      "title": "Mean Flows for One-step Generative Modeling",
      "authors": [
        "Zhengyang Geng",
        "Mingyang Deng",
        "Xingjian Bai",
        "J. Zico Kolter",
        "Kaiming He"
      ],
      "year": 2025,
      "url": "https://arxiv.org/abs/2505.13447",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD36",
          "title": "Mean Flows for One-step Generative Modeling",
          "authors": [
            "Zhengyang Geng",
            "Mingyang Deng",
            "Xingjian Bai",
            "J. Zico Kolter",
            "Kaiming He"
          ],
          "year": 2025,
          "url": "https://arxiv.org/abs/2505.13447",
          "topic": "flow matching",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2025, proceedings PDF確認",
          "checked_on": "2026-10-03",
          "significance": "平均速度を直接学習し1-NFE生成",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2512.02012",
      "id": "MD37",
      "aliases": [
        "MD37"
      ],
      "title": "Improved Mean Flows: On the Challenges of Fastforward Generative Models",
      "authors": [
        "Zhengyang Geng",
        "Yiyang Lu",
        "Zongze Wu",
        "Eli Shechtman",
        "J. Zico Kolter",
        "Kaiming He"
      ],
      "year": 2025,
      "url": "https://arxiv.org/abs/2512.02012",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD37",
          "title": "Improved Mean Flows: On the Challenges of Fastforward Generative Models",
          "authors": [
            "Zhengyang Geng",
            "Yiyang Lu",
            "Zongze Wu",
            "Eli Shechtman",
            "J. Zico Kolter",
            "Kaiming He"
          ],
          "year": 2025,
          "url": "https://arxiv.org/abs/2512.02012",
          "topic": "flow matching",
          "evidence": "abstract",
          "publication_status": "technical report; submitted 2025-12-01, v2 2026-05-09",
          "checked_on": "2026-10-03",
          "significance": "学習目的・guidance条件付けの改善",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2512.01286",
      "id": "MD38",
      "aliases": [
        "MD38"
      ],
      "title": "Generative Modeling with Continuous Flows: Sample Complexity of Flow Matching",
      "authors": [
        "Mudit Gaur",
        "Prashant Trivedi",
        "Shuchin Aeron",
        "Amrit Singh Bedi",
        "George K. Atia",
        "Vaneet Aggarwal"
      ],
      "year": 2025,
      "url": "https://arxiv.org/abs/2512.01286",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "MD38",
          "title": "Generative Modeling with Continuous Flows: Sample Complexity of Flow Matching",
          "authors": [
            "Mudit Gaur",
            "Prashant Trivedi",
            "Shuchin Aeron",
            "Amrit Singh Bedi",
            "George K. Atia",
            "Vaneet Aggarwal"
          ],
          "year": 2025,
          "url": "https://arxiv.org/abs/2512.01286",
          "topic": "flow matching",
          "evidence": "full-text",
          "publication_status": "preprint; submitted 2025-12-01",
          "checked_on": "2026-10-03",
          "significance": "近似・統計・最適化誤差を分けたFM保証",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1803.00567",
      "id": "MD39",
      "aliases": [
        "MD39"
      ],
      "title": "Computational Optimal Transport",
      "authors": [
        "Gabriel Peyré",
        "Marco Cuturi"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1803.00567",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD39",
          "title": "Computational Optimal Transport",
          "authors": [
            "Gabriel Peyré",
            "Marco Cuturi"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1803.00567",
          "topic": "OT",
          "evidence": "abstract",
          "publication_status": "Foundations and Trends in Machine Learning 11(5-6), published",
          "checked_on": "2026-10-03",
          "significance": "離散OT、正則化、計算、応用の標準書",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1306.0895",
      "id": "MD40",
      "aliases": [
        "MD40"
      ],
      "title": "Sinkhorn Distances: Lightspeed Computation of Optimal Transportation Distances",
      "authors": [
        "Marco Cuturi"
      ],
      "year": 2013,
      "url": "https://arxiv.org/abs/1306.0895",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD40",
          "title": "Sinkhorn Distances: Lightspeed Computation of Optimal Transportation Distances",
          "authors": [
            "Marco Cuturi"
          ],
          "year": 2013,
          "url": "https://arxiv.org/abs/1306.0895",
          "topic": "OT",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2013, published;刊行版題名末尾はOptimal Transport、掲載題名はarXiv版",
          "checked_on": "2026-10-03",
          "significance": "エントロピー正則化による高速OT",
          "venue_url": "https://papers.nips.cc/paper/2013/hash/af21d0c97db2e27e13572cbf59eb343d-Abstract.html",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "proceedings.mlr.press/v89/feydy19a.html",
      "id": "MD41",
      "aliases": [
        "MD41"
      ],
      "title": "Interpolating between Optimal Transport and MMD using Sinkhorn Divergences",
      "authors": [
        "Jean Feydy",
        "Thibault Séjourné",
        "François-Xavier Vialard",
        "Shun-ichi Amari",
        "Alain Trouvé",
        "Gabriel Peyré"
      ],
      "year": 2019,
      "url": "https://proceedings.mlr.press/v89/feydy19a.html",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD41",
          "title": "Interpolating between Optimal Transport and MMD using Sinkhorn Divergences",
          "authors": [
            "Jean Feydy",
            "Thibault Séjourné",
            "François-Xavier Vialard",
            "Shun-ichi Amari",
            "Alain Trouvé",
            "Gabriel Peyré"
          ],
          "year": 2019,
          "url": "https://proceedings.mlr.press/v89/feydy19a.html",
          "topic": "OT",
          "evidence": "abstract",
          "publication_status": "AISTATS 2019, published",
          "checked_on": "2026-10-03",
          "significance": "自己コスト補正とOT–MMDの補間",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1507.00504",
      "id": "MD42",
      "aliases": [
        "MD42"
      ],
      "title": "Optimal Transport for Domain Adaptation",
      "authors": [
        "Nicolas Courty",
        "Rémi Flamary",
        "Devis Tuia",
        "Alain Rakotomamonjy"
      ],
      "year": 2017,
      "url": "https://arxiv.org/abs/1507.00504",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD42",
          "title": "Optimal Transport for Domain Adaptation",
          "authors": [
            "Nicolas Courty",
            "Rémi Flamary",
            "Devis Tuia",
            "Alain Rakotomamonjy"
          ],
          "year": 2017,
          "url": "https://arxiv.org/abs/1507.00504",
          "topic": "OT/domain adaptation",
          "evidence": "abstract",
          "publication_status": "IEEE TPAMI 39(9):1853–1865, published; arXiv初稿2015",
          "checked_on": "2026-10-03",
          "significance": "クラス構造を考慮した分布輸送",
          "venue_url": "https://research.wur.nl/en/publications/optimal-transport-for-domain-adaptation/",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1705.08848",
      "id": "MD43",
      "aliases": [
        "MD43"
      ],
      "title": "Joint Distribution Optimal Transportation for Domain Adaptation",
      "authors": [
        "Nicolas Courty",
        "Rémi Flamary",
        "Amaury Habrard",
        "Alain Rakotomamonjy"
      ],
      "year": 2017,
      "url": "https://arxiv.org/abs/1705.08848",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD43",
          "title": "Joint Distribution Optimal Transportation for Domain Adaptation",
          "authors": [
            "Nicolas Courty",
            "Rémi Flamary",
            "Amaury Habrard",
            "Alain Rakotomamonjy"
          ],
          "year": 2017,
          "url": "https://arxiv.org/abs/1705.08848",
          "topic": "OT/domain adaptation",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2017, published",
          "checked_on": "2026-10-03",
          "significance": "特徴とラベルの結合分布を輸送",
          "venue_url": "https://papers.nips.cc/paper_files/paper/2017/hash/0070d23b06b1486a538c0eaa45dd167a-Abstract.html",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1803.10081",
      "id": "MD44",
      "aliases": [
        "MD44"
      ],
      "title": "DeepJDOT: Deep Joint Distribution Optimal Transport for Unsupervised Domain Adaptation",
      "authors": [
        "Bharath Bhushan Damodaran",
        "Benjamin Kellenberger",
        "Rémi Flamary",
        "Devis Tuia",
        "Nicolas Courty"
      ],
      "year": 2018,
      "url": "https://arxiv.org/abs/1803.10081",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD44",
          "title": "DeepJDOT: Deep Joint Distribution Optimal Transport for Unsupervised Domain Adaptation",
          "authors": [
            "Bharath Bhushan Damodaran",
            "Benjamin Kellenberger",
            "Rémi Flamary",
            "Devis Tuia",
            "Nicolas Courty"
          ],
          "year": 2018,
          "url": "https://arxiv.org/abs/1803.10081",
          "topic": "OT/domain adaptation",
          "evidence": "abstract",
          "publication_status": "ECCV 2018, published",
          "checked_on": "2026-10-03",
          "significance": "表現学習とJDOTを結合",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1607.05816",
      "id": "MD45",
      "aliases": [
        "MD45"
      ],
      "title": "Scaling Algorithms for Unbalanced Transport Problems",
      "authors": [
        "Lenaic Chizat",
        "Gabriel Peyré",
        "Bernhard Schmitzer",
        "François-Xavier Vialard"
      ],
      "year": 2018,
      "url": "https://arxiv.org/abs/1607.05816",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD45",
          "title": "Scaling Algorithms for Unbalanced Transport Problems",
          "authors": [
            "Lenaic Chizat",
            "Gabriel Peyré",
            "Bernhard Schmitzer",
            "François-Xavier Vialard"
          ],
          "year": 2018,
          "url": "https://arxiv.org/abs/1607.05816",
          "topic": "OT",
          "evidence": "abstract",
          "publication_status": "Mathematics of Computation 87(314):2563–2609, published; arXiv初稿2016、刊行版題名にはOptimalが加わる",
          "checked_on": "2026-10-03",
          "significance": "周辺質量を緩和する一般化Sinkhorn",
          "venue_url": "https://www.ams.org/mcom/2018-87-314/S0025-5718-2018-03303-8/S0025-5718-2018-03303-8.pdf",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2103.03606",
      "id": "MD46",
      "aliases": [
        "MD46"
      ],
      "title": "Unbalanced minibatch Optimal Transport; applications to Domain Adaptation",
      "authors": [
        "Kilian Fatras",
        "Thibault Séjourné",
        "Nicolas Courty",
        "Rémi Flamary"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2103.03606",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD46",
          "title": "Unbalanced minibatch Optimal Transport; applications to Domain Adaptation",
          "authors": [
            "Kilian Fatras",
            "Thibault Séjourné",
            "Nicolas Courty",
            "Rémi Flamary"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2103.03606",
          "topic": "OT/domain adaptation",
          "evidence": "abstract",
          "publication_status": "ICML 2021, published;著者順は論文PDF準拠",
          "checked_on": "2026-10-03",
          "significance": "minibatchの不適切な対応を質量緩和で改善",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2010.05862",
      "id": "MD47",
      "aliases": [
        "MD47"
      ],
      "title": "Robust Optimal Transport with Applications in Generative Modeling and Domain Adaptation",
      "authors": [
        "Yogesh Balaji",
        "Rama Chellappa",
        "Soheil Feizi"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2010.05862",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD47",
          "title": "Robust Optimal Transport with Applications in Generative Modeling and Domain Adaptation",
          "authors": [
            "Yogesh Balaji",
            "Rama Chellappa",
            "Soheil Feizi"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2010.05862",
          "topic": "OT/robustness",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2020, published",
          "checked_on": "2026-10-03",
          "significance": "外れ値を含む深層学習に使えるrobust OT双対",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2111.01361",
      "id": "MD48",
      "aliases": [
        "MD48"
      ],
      "title": "Outlier-Robust Optimal Transport: Duality, Structure, and Statistical Analysis",
      "authors": [
        "Sloan Nietert",
        "Rachel Cummings",
        "Ziv Goldfeld"
      ],
      "year": 2022,
      "url": "https://arxiv.org/abs/2111.01361",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD48",
          "title": "Outlier-Robust Optimal Transport: Duality, Structure, and Statistical Analysis",
          "authors": [
            "Sloan Nietert",
            "Rachel Cummings",
            "Ziv Goldfeld"
          ],
          "year": 2022,
          "url": "https://arxiv.org/abs/2111.01361",
          "topic": "OT/robustness",
          "evidence": "abstract",
          "publication_status": "AISTATS 2022, published;著者順はarXiv準拠",
          "checked_on": "2026-10-03",
          "significance": "汚染モデル下のrobust Wasserstein理論",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2606.16672",
      "id": "MD49",
      "aliases": [
        "MD49"
      ],
      "title": "Sinkhorn-CPD: Robust point cloud registration via unbalanced entropic optimal transport",
      "authors": [
        "Jin Zhang",
        "Mingyang Zhao",
        "Bing Liu",
        "Xin Jiang"
      ],
      "year": 2026,
      "url": "https://arxiv.org/abs/2606.16672",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD49",
          "title": "Sinkhorn-CPD: Robust point cloud registration via unbalanced entropic optimal transport",
          "authors": [
            "Jin Zhang",
            "Mingyang Zhao",
            "Bing Liu",
            "Xin Jiang"
          ],
          "year": 2026,
          "url": "https://arxiv.org/abs/2606.16672",
          "topic": "OT/robustness",
          "evidence": "abstract",
          "publication_status": "arXiv公開 2026-06-15; Computer-Aided Design 199 (2026), 104104との書誌記載あり、雑誌刊行日未照合",
          "checked_on": "2026-10-03",
          "significance": "外れ値・部分重複を含む点群整合へのUOT",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "doi:10.1063/1.1699114",
      "id": "MD50",
      "aliases": [
        "MD50"
      ],
      "title": "Equation of State Calculations by Fast Computing Machines",
      "authors": [
        "Nicholas Metropolis",
        "Arianna W. Rosenbluth",
        "Marshall N. Rosenbluth",
        "Augusta H. Teller",
        "Edward Teller"
      ],
      "year": 1953,
      "url": "https://doi.org/10.1063/1.1699114",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD50",
          "title": "Equation of State Calculations by Fast Computing Machines",
          "authors": [
            "Nicholas Metropolis",
            "Arianna W. Rosenbluth",
            "Marshall N. Rosenbluth",
            "Augusta H. Teller",
            "Edward Teller"
          ],
          "year": 1953,
          "url": "https://doi.org/10.1063/1.1699114",
          "topic": "MCMC",
          "evidence": "abstract",
          "publication_status": "Journal of Chemical Physics 21(6), published",
          "checked_on": "2026-10-03",
          "significance": "Metropolis法の原典",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "doi:10.1093/biomet/57.1.97",
      "id": "MD51",
      "aliases": [
        "MD51"
      ],
      "title": "Monte Carlo sampling methods using Markov chains and their applications",
      "authors": [
        "W. K. Hastings"
      ],
      "year": 1970,
      "url": "https://doi.org/10.1093/biomet/57.1.97",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD51",
          "title": "Monte Carlo sampling methods using Markov chains and their applications",
          "authors": [
            "W. K. Hastings"
          ],
          "year": 1970,
          "url": "https://doi.org/10.1093/biomet/57.1.97",
          "topic": "MCMC",
          "evidence": "abstract",
          "publication_status": "Biometrika 57(1), published",
          "checked_on": "2026-10-03",
          "significance": "非対称提案を含むMH法",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1206.1901",
      "id": "MD52",
      "aliases": [
        "MD52"
      ],
      "title": "MCMC using Hamiltonian dynamics",
      "authors": [
        "Radford M. Neal"
      ],
      "year": 2012,
      "url": "https://arxiv.org/abs/1206.1901",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD52",
          "title": "MCMC using Hamiltonian dynamics",
          "authors": [
            "Radford M. Neal"
          ],
          "year": 2012,
          "url": "https://arxiv.org/abs/1206.1901",
          "topic": "MCMC",
          "evidence": "abstract",
          "publication_status": "arXiv公開版2012 (Handbook章2011)",
          "checked_on": "2026-10-03",
          "significance": "HMCの標準レビュー",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "jmlr.org/papers/v15/hoffman14a.html",
      "id": "MD53",
      "aliases": [
        "MD53"
      ],
      "title": "The No-U-Turn Sampler: Adaptively Setting Path Lengths in Hamiltonian Monte Carlo",
      "authors": [
        "Matthew D. Hoffman",
        "Andrew Gelman"
      ],
      "year": 2014,
      "url": "https://jmlr.org/papers/v15/hoffman14a.html",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD53",
          "title": "The No-U-Turn Sampler: Adaptively Setting Path Lengths in Hamiltonian Monte Carlo",
          "authors": [
            "Matthew D. Hoffman",
            "Andrew Gelman"
          ],
          "year": 2014,
          "url": "https://jmlr.org/papers/v15/hoffman14a.html",
          "topic": "MCMC",
          "evidence": "abstract",
          "publication_status": "JMLR 15(47), published",
          "checked_on": "2026-10-03",
          "significance": "HMC積分時間を自動化",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1701.02434",
      "id": "MD54",
      "aliases": [
        "MD54"
      ],
      "title": "A Conceptual Introduction to Hamiltonian Monte Carlo",
      "authors": [
        "Michael Betancourt"
      ],
      "year": 2017,
      "url": "https://arxiv.org/abs/1701.02434",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD54",
          "title": "A Conceptual Introduction to Hamiltonian Monte Carlo",
          "authors": [
            "Michael Betancourt"
          ],
          "year": 2017,
          "url": "https://arxiv.org/abs/1701.02434",
          "topic": "MCMC",
          "evidence": "abstract",
          "publication_status": "arXiv review 2017, revised 2018",
          "checked_on": "2026-10-03",
          "significance": "典型集合・幾何・HMCの失敗を解説",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "maths.ox.ac.uk/node/24560",
      "id": "MD55",
      "aliases": [
        "MD55"
      ],
      "title": "Bayesian Learning via Stochastic Gradient Langevin Dynamics",
      "authors": [
        "Max Welling",
        "Yee Whye Teh"
      ],
      "year": 2011,
      "url": "https://www.maths.ox.ac.uk/node/24560",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD55",
          "title": "Bayesian Learning via Stochastic Gradient Langevin Dynamics",
          "authors": [
            "Max Welling",
            "Yee Whye Teh"
          ],
          "year": 2011,
          "url": "https://www.maths.ox.ac.uk/node/24560",
          "topic": "MCMC",
          "evidence": "abstract",
          "publication_status": "ICML 2011, published;著者所属機関の原著書誌・abstract確認",
          "checked_on": "2026-10-03",
          "significance": "minibatch勾配に適切なノイズを加える事後サンプリング",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "proceedings.mlr.press/v32/cheni14.html",
      "id": "MD56",
      "aliases": [
        "MD56"
      ],
      "title": "Stochastic Gradient Hamiltonian Monte Carlo",
      "authors": [
        "Tianqi Chen",
        "Emily Fox",
        "Carlos Guestrin"
      ],
      "year": 2014,
      "url": "https://proceedings.mlr.press/v32/cheni14.html",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD56",
          "title": "Stochastic Gradient Hamiltonian Monte Carlo",
          "authors": [
            "Tianqi Chen",
            "Emily Fox",
            "Carlos Guestrin"
          ],
          "year": 2014,
          "url": "https://proceedings.mlr.press/v32/cheni14.html",
          "topic": "MCMC",
          "evidence": "abstract",
          "publication_status": "ICML 2014, published",
          "checked_on": "2026-10-03",
          "significance": "勾配ノイズを摩擦・拡散で扱う",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1903.08008",
      "id": "MD57",
      "aliases": [
        "MD57"
      ],
      "title": "Rank-normalization, folding, and localization: An improved R-hat for assessing convergence of MCMC",
      "authors": [
        "Aki Vehtari",
        "Andrew Gelman",
        "Daniel Simpson",
        "Bob Carpenter",
        "Paul-Christian Bürkner"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/1903.08008",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD57",
          "title": "Rank-normalization, folding, and localization: An improved R-hat for assessing convergence of MCMC",
          "authors": [
            "Aki Vehtari",
            "Andrew Gelman",
            "Daniel Simpson",
            "Bob Carpenter",
            "Paul-Christian Bürkner"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/1903.08008",
          "topic": "MCMC",
          "evidence": "abstract",
          "publication_status": "Bayesian Analysis, published (preprint 2019)",
          "checked_on": "2026-10-03",
          "significance": "rank-based診断と局所効率",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "jmlr.org/papers/v27/25-1452.html",
      "id": "MD58",
      "aliases": [
        "MD58"
      ],
      "title": "The Within-Orbit Adaptive Leapfrog No-U-Turn Sampler",
      "authors": [
        "Nawaf Bou-Rabee",
        "Bob Carpenter",
        "Tore Selland Kleppe",
        "Sifan Liu"
      ],
      "year": 2026,
      "url": "https://jmlr.org/papers/v27/25-1452.html",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "MD58",
          "title": "The Within-Orbit Adaptive Leapfrog No-U-Turn Sampler",
          "authors": [
            "Nawaf Bou-Rabee",
            "Bob Carpenter",
            "Tore Selland Kleppe",
            "Sifan Liu"
          ],
          "year": 2026,
          "url": "https://jmlr.org/papers/v27/25-1452.html",
          "topic": "MCMC",
          "evidence": "full-text",
          "publication_status": "JMLR 27(113), published March 2026",
          "checked_on": "2026-10-03",
          "significance": "軌道中のstep sizeを適応するWALNUTS",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "assets.press.princeton.edu/chapters/absil/Absil_pp. i-vi.pdf",
      "id": "MD59",
      "aliases": [
        "MD59"
      ],
      "title": "Optimization Algorithms on Matrix Manifolds",
      "authors": [
        "P.-A. Absil",
        "Robert Mahony",
        "Rodolphe Sepulchre"
      ],
      "year": 2008,
      "url": "https://assets.press.princeton.edu/chapters/absil/Absil_pp.%20i-vi.pdf",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "metadata"
      ],
      "records": [
        {
          "id": "MD59",
          "title": "Optimization Algorithms on Matrix Manifolds",
          "authors": [
            "P.-A. Absil",
            "Robert Mahony",
            "Rodolphe Sepulchre"
          ],
          "year": 2008,
          "url": "https://assets.press.princeton.edu/chapters/absil/Absil_pp.%20i-vi.pdf",
          "topic": "manifold",
          "evidence": "metadata",
          "publication_status": "Princeton University Press book, published",
          "checked_on": "2026-10-03",
          "significance": "射影、接空間、retractionの標準書",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "nicolasboumal.net/book",
      "id": "MD60",
      "aliases": [
        "MD60"
      ],
      "title": "An Introduction to Optimization on Smooth Manifolds",
      "authors": [
        "Nicolas Boumal"
      ],
      "year": 2023,
      "url": "https://www.nicolasboumal.net/book/",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "primary-resource"
      ],
      "records": [
        {
          "id": "MD60",
          "title": "An Introduction to Optimization on Smooth Manifolds",
          "authors": [
            "Nicolas Boumal"
          ],
          "year": 2023,
          "url": "https://www.nicolasboumal.net/book/",
          "topic": "manifold",
          "evidence": "primary-resource",
          "publication_status": "Cambridge University Press book, published",
          "checked_on": "2026-10-03",
          "significance": "現代的Riemannian最適化の教科書",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2405.14813",
      "id": "MD61",
      "aliases": [
        "MD61"
      ],
      "title": "Scalable Optimization in the Modular Norm",
      "authors": [
        "Tim Large",
        "Yang Liu",
        "Minyoung Huh",
        "Hyojin Bahng",
        "Phillip Isola",
        "Jeremy Bernstein"
      ],
      "year": 2024,
      "url": "https://arxiv.org/abs/2405.14813",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD61",
          "title": "Scalable Optimization in the Modular Norm",
          "authors": [
            "Tim Large",
            "Yang Liu",
            "Minyoung Huh",
            "Hyojin Bahng",
            "Phillip Isola",
            "Jeremy Bernstein"
          ],
          "year": 2024,
          "url": "https://arxiv.org/abs/2405.14813",
          "topic": "manifold",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2024, proceedings PDF確認",
          "checked_on": "2026-10-03",
          "significance": "層合成に沿ったノルムと感度・学習率配分",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "thinkingmachines.ai/blog/modular-manifolds",
      "id": "MD62",
      "aliases": [
        "MD62"
      ],
      "title": "Modular Manifolds",
      "authors": [
        "Jeremy Bernstein"
      ],
      "year": 2025,
      "url": "https://thinkingmachines.ai/blog/modular-manifolds/",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "primary-resource"
      ],
      "records": [
        {
          "id": "MD62",
          "title": "Modular Manifolds",
          "authors": [
            "Jeremy Bernstein"
          ],
          "year": 2025,
          "url": "https://thinkingmachines.ai/blog/modular-manifolds/",
          "topic": "manifold",
          "evidence": "primary-resource",
          "publication_status": "著者公式研究記事 2025-09-26;査読論文ではない",
          "checked_on": "2026-10-03",
          "significance": "Stiefel制約とspectral-norm更新の研究提案",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "sciencedirect.com/science/article/pii/S0893608000000265",
      "id": "MD63",
      "aliases": [
        "MD63"
      ],
      "title": "Independent component analysis: algorithms and applications",
      "authors": [
        "Aapo Hyvärinen",
        "Erkki Oja"
      ],
      "year": 2000,
      "url": "https://www.sciencedirect.com/science/article/pii/S0893608000000265",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD63",
          "title": "Independent component analysis: algorithms and applications",
          "authors": [
            "Aapo Hyvärinen",
            "Erkki Oja"
          ],
          "year": 2000,
          "url": "https://www.sciencedirect.com/science/article/pii/S0893608000000265",
          "topic": "ICA",
          "evidence": "abstract",
          "publication_status": "Neural Networks 13, published",
          "checked_on": "2026-10-03",
          "significance": "線形ICAの識別可能性と推定",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "proceedings.mlr.press/v89/hyvarinen19a.html",
      "id": "MD64",
      "aliases": [
        "MD64"
      ],
      "title": "Nonlinear ICA Using Auxiliary Variables and Generalized Contrastive Learning",
      "authors": [
        "Aapo Hyvärinen",
        "Hiroaki Sasaki",
        "Richard E. Turner"
      ],
      "year": 2019,
      "url": "https://proceedings.mlr.press/v89/hyvarinen19a.html",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD64",
          "title": "Nonlinear ICA Using Auxiliary Variables and Generalized Contrastive Learning",
          "authors": [
            "Aapo Hyvärinen",
            "Hiroaki Sasaki",
            "Richard E. Turner"
          ],
          "year": 2019,
          "url": "https://proceedings.mlr.press/v89/hyvarinen19a.html",
          "topic": "ICA",
          "evidence": "abstract",
          "publication_status": "AISTATS 2019, published",
          "checked_on": "2026-10-03",
          "significance": "補助変数で非線形ICAの非識別性を解く",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1907.04809",
      "id": "MD65",
      "aliases": [
        "MD65"
      ],
      "title": "Variational Autoencoders and Nonlinear ICA: A Unifying Framework",
      "authors": [
        "Ilyes Khemakhem",
        "Diederik P. Kingma",
        "Ricardo Pio Monti",
        "Aapo Hyvärinen"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/1907.04809",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD65",
          "title": "Variational Autoencoders and Nonlinear ICA: A Unifying Framework",
          "authors": [
            "Ilyes Khemakhem",
            "Diederik P. Kingma",
            "Ricardo Pio Monti",
            "Aapo Hyvärinen"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/1907.04809",
          "topic": "ICA",
          "evidence": "abstract",
          "publication_status": "AISTATS 2020, published",
          "checked_on": "2026-10-03",
          "significance": "条件付きpriorを用いるidentifiable VAE",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1811.12359",
      "id": "MD66",
      "aliases": [
        "MD66"
      ],
      "title": "Challenging Common Assumptions in the Unsupervised Learning of Disentangled Representations",
      "authors": [
        "Francesco Locatello",
        "Stefan Bauer",
        "Mario Lucic",
        "Gunnar Rätsch",
        "Sylvain Gelly",
        "Bernhard Schölkopf",
        "Olivier Bachem"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1811.12359",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD66",
          "title": "Challenging Common Assumptions in the Unsupervised Learning of Disentangled Representations",
          "authors": [
            "Francesco Locatello",
            "Stefan Bauer",
            "Mario Lucic",
            "Gunnar Rätsch",
            "Sylvain Gelly",
            "Bernhard Schölkopf",
            "Olivier Bachem"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1811.12359",
          "topic": "ICA",
          "evidence": "abstract",
          "publication_status": "ICML 2019, published",
          "checked_on": "2026-10-03",
          "significance": "追加仮定なしのdisentanglementの非識別性",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2102.11107",
      "id": "MD67",
      "aliases": [
        "MD67"
      ],
      "title": "Towards Causal Representation Learning",
      "authors": [
        "Bernhard Schölkopf",
        "Francesco Locatello",
        "Stefan Bauer",
        "Nan Rosemary Ke",
        "Nal Kalchbrenner",
        "Anirudh Goyal",
        "Yoshua Bengio"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2102.11107",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD67",
          "title": "Towards Causal Representation Learning",
          "authors": [
            "Bernhard Schölkopf",
            "Francesco Locatello",
            "Stefan Bauer",
            "Nan Rosemary Ke",
            "Nal Kalchbrenner",
            "Anirudh Goyal",
            "Yoshua Bengio"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2102.11107",
          "topic": "causal representation",
          "evidence": "abstract",
          "publication_status": "Proceedings of the IEEE 109(5), published;雑誌題名はToward",
          "checked_on": "2026-10-03",
          "significance": "因果機構と表現学習の研究プログラム",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2203.15756",
      "id": "MD68",
      "aliases": [
        "MD68"
      ],
      "title": "Causal de Finetti: On the Identification of Invariant Causal Structure in Exchangeable Data",
      "authors": [
        "Siyuan Guo",
        "Viktor Tóth",
        "Bernhard Schölkopf",
        "Ferenc Huszár"
      ],
      "year": 2023,
      "url": "https://arxiv.org/abs/2203.15756",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD68",
          "title": "Causal de Finetti: On the Identification of Invariant Causal Structure in Exchangeable Data",
          "authors": [
            "Siyuan Guo",
            "Viktor Tóth",
            "Bernhard Schölkopf",
            "Ferenc Huszár"
          ],
          "year": 2023,
          "url": "https://arxiv.org/abs/2203.15756",
          "topic": "causal representation",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2023, published (preprint 2022)",
          "checked_on": "2026-10-03",
          "significance": "交換可能データとICMの識別理論",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2603.25796",
      "id": "MD69",
      "aliases": [
        "MD69"
      ],
      "title": "Beyond identifiability: Learning causal representations with few environments and finite samples",
      "authors": [
        "Inbeom Lee",
        "Tongtong Jin",
        "Bryon Aragam"
      ],
      "year": 2026,
      "url": "https://arxiv.org/abs/2603.25796",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "MD69",
          "title": "Beyond identifiability: Learning causal representations with few environments and finite samples",
          "authors": [
            "Inbeom Lee",
            "Tongtong Jin",
            "Bryon Aragam"
          ],
          "year": 2026,
          "url": "https://arxiv.org/abs/2603.25796",
          "topic": "causal representation",
          "evidence": "full-text",
          "publication_status": "preprint; submitted 2026-03-26",
          "checked_on": "2026-10-03",
          "significance": "線形潜在因子における有限標本・少数環境保証",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "proceedings.mlr.press/v337/kim26e.html",
      "id": "MD70",
      "aliases": [
        "MD70"
      ],
      "title": "On Causal Representation Learning with Internal Auxiliaries",
      "authors": [
        "Kwonho Kim",
        "Heejeong Nam",
        "Inwoo Hwang",
        "Sanghack Lee"
      ],
      "year": 2026,
      "url": "https://proceedings.mlr.press/v337/kim26e.html",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD70",
          "title": "On Causal Representation Learning with Internal Auxiliaries",
          "authors": [
            "Kwonho Kim",
            "Heejeong Nam",
            "Inwoo Hwang",
            "Sanghack Lee"
          ],
          "year": 2026,
          "url": "https://proceedings.mlr.press/v337/kim26e.html",
          "topic": "causal representation",
          "evidence": "abstract",
          "publication_status": "UAI 2026, PMLR 337, published",
          "checked_on": "2026-10-03",
          "significance": "内部補助変数を含む識別可能性の条件",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1703.06114",
      "id": "MD71",
      "aliases": [
        "MD71"
      ],
      "title": "Deep Sets",
      "authors": [
        "Manzil Zaheer",
        "Satwik Kottur",
        "Siamak Ravanbakhsh",
        "Barnabas Poczos",
        "Ruslan Salakhutdinov",
        "Alexander Smola"
      ],
      "year": 2017,
      "url": "https://arxiv.org/abs/1703.06114",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD71",
          "title": "Deep Sets",
          "authors": [
            "Manzil Zaheer",
            "Satwik Kottur",
            "Siamak Ravanbakhsh",
            "Barnabas Poczos",
            "Ruslan Salakhutdinov",
            "Alexander Smola"
          ],
          "year": 2017,
          "url": "https://arxiv.org/abs/1703.06114",
          "topic": "equivariance",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2017, published",
          "checked_on": "2026-10-03",
          "significance": "集合の置換不変・同変ネットワーク",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1602.07576",
      "id": "MD72",
      "aliases": [
        "MD72"
      ],
      "title": "Group Equivariant Convolutional Networks",
      "authors": [
        "Taco S. Cohen",
        "Max Welling"
      ],
      "year": 2016,
      "url": "https://arxiv.org/abs/1602.07576",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD72",
          "title": "Group Equivariant Convolutional Networks",
          "authors": [
            "Taco S. Cohen",
            "Max Welling"
          ],
          "year": 2016,
          "url": "https://arxiv.org/abs/1602.07576",
          "topic": "equivariance",
          "evidence": "abstract",
          "publication_status": "ICML 2016, published",
          "checked_on": "2026-10-03",
          "significance": "群作用に沿う畳み込み",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2104.13478",
      "id": "MD73",
      "aliases": [
        "MD73"
      ],
      "title": "Geometric Deep Learning: Grids, Groups, Graphs, Geodesics, and Gauges",
      "authors": [
        "Michael M. Bronstein",
        "Joan Bruna",
        "Taco Cohen",
        "Petar Veličković"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2104.13478",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD73",
          "title": "Geometric Deep Learning: Grids, Groups, Graphs, Geodesics, and Gauges",
          "authors": [
            "Michael M. Bronstein",
            "Joan Bruna",
            "Taco Cohen",
            "Petar Veličković"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2104.13478",
          "topic": "equivariance",
          "evidence": "abstract",
          "publication_status": "arXiv monograph 2021",
          "checked_on": "2026-10-03",
          "significance": "対称性と帰納バイアスの体系化",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:0811.1679",
      "id": "MD74",
      "aliases": [
        "MD74"
      ],
      "title": "Predictive learning via rule ensembles",
      "authors": [
        "Jerome H. Friedman",
        "Bogdan E. Popescu"
      ],
      "year": 2008,
      "url": "https://arxiv.org/abs/0811.1679",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD74",
          "title": "Predictive learning via rule ensembles",
          "authors": [
            "Jerome H. Friedman",
            "Bogdan E. Popescu"
          ],
          "year": 2008,
          "url": "https://arxiv.org/abs/0811.1679",
          "topic": "feature interaction",
          "evidence": "abstract",
          "publication_status": "Annals of Applied Statistics 2(3), published",
          "checked_on": "2026-10-03",
          "significance": "ルールモデル・特徴の交互作用とH統計量",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1705.04977",
      "id": "MD75",
      "aliases": [
        "MD75"
      ],
      "title": "Detecting Statistical Interactions from Neural Network Weights",
      "authors": [
        "Michael Tsang",
        "Dehua Cheng",
        "Yan Liu"
      ],
      "year": 2018,
      "url": "https://arxiv.org/abs/1705.04977",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD75",
          "title": "Detecting Statistical Interactions from Neural Network Weights",
          "authors": [
            "Michael Tsang",
            "Dehua Cheng",
            "Yan Liu"
          ],
          "year": 2018,
          "url": "https://arxiv.org/abs/1705.04977",
          "topic": "feature interaction",
          "evidence": "abstract",
          "publication_status": "ICLR 2018, published (preprint 2017)",
          "checked_on": "2026-10-03",
          "significance": "学習済み重みから相互作用を検出するNID",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1802.10551",
      "id": "MD80",
      "aliases": [
        "MD80"
      ],
      "title": "A Variational Inequality Perspective on Generative Adversarial Networks",
      "authors": [
        "Gauthier Gidel",
        "Hugo Berard",
        "Gaëtan Vignoud",
        "Pascal Vincent",
        "Simon Lacoste-Julien"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1802.10551",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD80",
          "title": "A Variational Inequality Perspective on Generative Adversarial Networks",
          "authors": [
            "Gauthier Gidel",
            "Hugo Berard",
            "Gaëtan Vignoud",
            "Pascal Vincent",
            "Simon Lacoste-Julien"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1802.10551",
          "topic": "GAN",
          "evidence": "abstract",
          "publication_status": "ICLR 2019, published; arXiv初稿2018",
          "checked_on": "2026-10-03",
          "significance": "ゲームに対するextragradientと平均化",
          "venue_url": "https://openreview.net/pdf?id=r1laEnA5Ym",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1905.12103",
      "id": "MD81",
      "aliases": [
        "MD81"
      ],
      "title": "Competitive Gradient Descent",
      "authors": [
        "Florian Schäfer",
        "Anima Anandkumar"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1905.12103",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD81",
          "title": "Competitive Gradient Descent",
          "authors": [
            "Florian Schäfer",
            "Anima Anandkumar"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1905.12103",
          "topic": "GAN",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2019, published",
          "checked_on": "2026-10-03",
          "significance": "局所双線形ゲームのNash更新",
          "venue_url": "https://proceedings.neurips.cc/paper/2019/hash/56c51a39a7c77d8084838cc920585bd0-Abstract.html",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1803.05407",
      "id": "MD82",
      "aliases": [
        "MD82"
      ],
      "title": "Averaging Weights Leads to Wider Optima and Better Generalization",
      "authors": [
        "Pavel Izmailov",
        "Dmitrii Podoprikhin",
        "Timur Garipov",
        "Dmitry Vetrov",
        "Andrew Gordon Wilson"
      ],
      "year": 2018,
      "url": "https://arxiv.org/abs/1803.05407",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD82",
          "title": "Averaging Weights Leads to Wider Optima and Better Generalization",
          "authors": [
            "Pavel Izmailov",
            "Dmitrii Podoprikhin",
            "Timur Garipov",
            "Dmitry Vetrov",
            "Andrew Gordon Wilson"
          ],
          "year": 2018,
          "url": "https://arxiv.org/abs/1803.05407",
          "topic": "SWA/RL",
          "evidence": "abstract",
          "publication_status": "UAI 2018, published",
          "checked_on": "2026-10-03",
          "significance": "SWAの原著",
          "venue_url": "https://auai.org/uai2018/proceedings/papers/313.pdf",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1902.02476",
      "id": "MD83",
      "aliases": [
        "MD83"
      ],
      "title": "A Simple Baseline for Bayesian Uncertainty in Deep Learning",
      "authors": [
        "Wesley Maddox",
        "Timur Garipov",
        "Pavel Izmailov",
        "Dmitry Vetrov",
        "Andrew Gordon Wilson"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1902.02476",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD83",
          "title": "A Simple Baseline for Bayesian Uncertainty in Deep Learning",
          "authors": [
            "Wesley Maddox",
            "Timur Garipov",
            "Pavel Izmailov",
            "Dmitry Vetrov",
            "Andrew Gordon Wilson"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1902.02476",
          "topic": "SWA/RL",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2019, published",
          "checked_on": "2026-10-03",
          "significance": "SWA軌道の共分散を用いるSWAG",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1912.01588",
      "id": "MD84",
      "aliases": [
        "MD84"
      ],
      "title": "Leveraging Procedural Generation to Benchmark Reinforcement Learning",
      "authors": [
        "Karl Cobbe",
        "Christopher Hesse",
        "Jacob Hilton",
        "John Schulman"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/1912.01588",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD84",
          "title": "Leveraging Procedural Generation to Benchmark Reinforcement Learning",
          "authors": [
            "Karl Cobbe",
            "Christopher Hesse",
            "Jacob Hilton",
            "John Schulman"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/1912.01588",
          "topic": "SWA/RL",
          "evidence": "abstract",
          "publication_status": "ICML 2020, published; arXiv初稿2019",
          "checked_on": "2026-10-03",
          "significance": "Procgenによる未知環境汎化の評価",
          "venue_url": "https://proceedings.mlr.press/v119/cobbe20a.html",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2010.10814",
      "id": "MD85",
      "aliases": [
        "MD85"
      ],
      "title": "Improving Generalization in Reinforcement Learning with Mixture Regularization",
      "authors": [
        "Kaixin Wang",
        "Bingyi Kang",
        "Jie Shao",
        "Jiashi Feng"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2010.10814",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD85",
          "title": "Improving Generalization in Reinforcement Learning with Mixture Regularization",
          "authors": [
            "Kaixin Wang",
            "Bingyi Kang",
            "Jie Shao",
            "Jiashi Feng"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2010.10814",
          "topic": "SWA/RL",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2020, published",
          "checked_on": "2026-10-03",
          "significance": "RL汎化のデータ混合baseline",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2102.09844",
      "id": "MD86",
      "aliases": [
        "MD86"
      ],
      "title": "E(n) Equivariant Graph Neural Networks",
      "authors": [
        "Victor Garcia Satorras",
        "Emiel Hoogeboom",
        "Max Welling"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2102.09844",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD86",
          "title": "E(n) Equivariant Graph Neural Networks",
          "authors": [
            "Victor Garcia Satorras",
            "Emiel Hoogeboom",
            "Max Welling"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2102.09844",
          "topic": "equivariance",
          "evidence": "abstract",
          "publication_status": "ICML 2021, published",
          "checked_on": "2026-10-03",
          "significance": "回転・並進・反射・置換に同変なGNN",
          "venue_url": "https://proceedings.mlr.press/v139/satorras21a.html",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2106.01357",
      "id": "MD87",
      "aliases": [
        "MD87"
      ],
      "title": "Diffusion Schrödinger Bridge with Applications to Score-Based Generative Modeling",
      "authors": [
        "Valentin De Bortoli",
        "James Thornton",
        "Jeremy Heng",
        "Arnaud Doucet"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2106.01357",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD87",
          "title": "Diffusion Schrödinger Bridge with Applications to Score-Based Generative Modeling",
          "authors": [
            "Valentin De Bortoli",
            "James Thornton",
            "Jeremy Heng",
            "Arnaud Doucet"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2106.01357",
          "topic": "flow matching/OT",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2021, published",
          "checked_on": "2026-10-03",
          "significance": "経路空間のエントロピー正則化OT",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "jmlr.org/papers/v6/hyvarinen05a.html",
      "id": "MD88",
      "aliases": [
        "MD88"
      ],
      "title": "Estimation of Non-Normalized Statistical Models by Score Matching",
      "authors": [
        "Aapo Hyvärinen"
      ],
      "year": 2005,
      "url": "https://jmlr.csail.mit.edu/papers/v6/hyvarinen05a.html",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD88",
          "title": "Estimation of Non-Normalized Statistical Models by Score Matching",
          "authors": [
            "Aapo Hyvärinen"
          ],
          "year": 2005,
          "url": "https://jmlr.csail.mit.edu/papers/v6/hyvarinen05a.html",
          "topic": "diffusion",
          "evidence": "abstract",
          "publication_status": "JMLR 6(24), published",
          "checked_on": "2026-10-03",
          "significance": "正規化定数を避けたscore推定",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1907.05600",
      "id": "MD89",
      "aliases": [
        "MD89"
      ],
      "title": "Generative Modeling by Estimating Gradients of the Data Distribution",
      "authors": [
        "Yang Song",
        "Stefano Ermon"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1907.05600",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD89",
          "title": "Generative Modeling by Estimating Gradients of the Data Distribution",
          "authors": [
            "Yang Song",
            "Stefano Ermon"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1907.05600",
          "topic": "diffusion",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2019, published",
          "checked_on": "2026-10-03",
          "significance": "多尺度scoreとannealed Langevin sampling",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "proceedings.mlr.press/v258/koc25a.html",
      "id": "MD90",
      "aliases": [
        "MD90"
      ],
      "title": "Domain Adaptation and Entanglement: an Optimal Transport Perspective",
      "authors": [
        "Okan Koc",
        "Alexander Soen",
        "Chao-Kai Chiang",
        "Masashi Sugiyama"
      ],
      "year": 2025,
      "url": "https://proceedings.mlr.press/v258/koc25a.html",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD90",
          "title": "Domain Adaptation and Entanglement: an Optimal Transport Perspective",
          "authors": [
            "Okan Koc",
            "Alexander Soen",
            "Chao-Kai Chiang",
            "Masashi Sugiyama"
          ],
          "year": 2025,
          "url": "https://proceedings.mlr.press/v258/koc25a.html",
          "topic": "OT/domain adaptation",
          "evidence": "abstract",
          "publication_status": "AISTATS 2025, PMLR 258:3034–3042, published",
          "checked_on": "2026-10-03",
          "significance": "周辺分布整合だけでは解消できない条件付き分布差を解析",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "proceedings.mlr.press/v306/sesmat26a.html",
      "id": "MD91",
      "aliases": [
        "MD91"
      ],
      "title": "Where Flow Matching Leaks: Characterising the Membership Signals Along the Interpolation Path",
      "authors": [
        "Thomas Sesmat",
        "Gabriel Meseguer-Brocal",
        "Geoffroy Peeters"
      ],
      "year": 2026,
      "url": "https://proceedings.mlr.press/v306/sesmat26a.html",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD91",
          "title": "Where Flow Matching Leaks: Characterising the Membership Signals Along the Interpolation Path",
          "authors": [
            "Thomas Sesmat",
            "Gabriel Meseguer-Brocal",
            "Geoffroy Peeters"
          ],
          "year": 2026,
          "url": "https://proceedings.mlr.press/v306/sesmat26a.html",
          "topic": "flow matching/generalization",
          "evidence": "abstract",
          "publication_status": "ICML 2026（July 6–11）, PMLR 306:109269–109293, published",
          "checked_on": "2026-10-03",
          "significance": "補間時刻ごとの訓練・テスト再構成差とmemorizationの解析",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "ism.ac.jp/~shiro/papers/etc/sice1999Jul.pdf",
      "id": "MD92",
      "aliases": [
        "MD92"
      ],
      "title": "独立成分解析の信号処理への応用",
      "authors": [
        "池田 思朗"
      ],
      "year": 1999,
      "url": "https://www.ism.ac.jp/~shiro/papers/etc/sice1999Jul.pdf",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "MD92",
          "title": "独立成分解析の信号処理への応用",
          "authors": [
            "池田 思朗"
          ],
          "year": 1999,
          "url": "https://www.ism.ac.jp/~shiro/papers/etc/sice1999Jul.pdf",
          "topic": "ICA",
          "evidence": "full-text",
          "publication_status": "計測と制御 38(7):461–467, 1999-07-10, published",
          "checked_on": "2026-10-03",
          "significance": "PCAの無相関化とICAの独立性、信号分離への応用を日本語で整理",
          "venue_url": "https://www.jstage.jst.go.jp/article/sicejl1962/38/7/38_7_461/_article/-char/en",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": [
        "https://www.ism.ac.jp/~shiro/papers/etc/sice1999Jul.pdf"
      ]
    },
    {
      "canonical_key": "arxiv:2112.10752",
      "id": "MD93",
      "aliases": [
        "MD93"
      ],
      "title": "High-Resolution Image Synthesis with Latent Diffusion Models",
      "authors": [
        "Robin Rombach",
        "Andreas Blattmann",
        "Dominik Lorenz",
        "Patrick Esser",
        "Björn Ommer"
      ],
      "year": 2022,
      "url": "https://arxiv.org/abs/2112.10752",
      "chapters": [
        "mathematics-and-dynamics"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "MD93",
          "title": "High-Resolution Image Synthesis with Latent Diffusion Models",
          "authors": [
            "Robin Rombach",
            "Andreas Blattmann",
            "Dominik Lorenz",
            "Patrick Esser",
            "Björn Ommer"
          ],
          "year": 2022,
          "url": "https://arxiv.org/abs/2112.10752",
          "topic": "diffusion/representation",
          "evidence": "abstract",
          "publication_status": "CVPR 2022との著者arXiv記載; arXiv初稿2021",
          "checked_on": "2026-10-03",
          "significance": "事前学習autoencoderの潜在空間でdiffusionを訓練する",
          "chapter": "mathematics-and-dynamics"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2112.10752"
      ]
    },
    {
      "canonical_key": "arxiv:1811.06965",
      "id": "SY002",
      "aliases": [
        "SY002"
      ],
      "title": "GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism",
      "authors": "Yanping Huang; Youlong Cheng; Ankur Bapna; ほか",
      "year": 2018,
      "url": "https://arxiv.org/abs/1811.06965",
      "chapters": [
        "systems-and-training"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "SY002",
          "key": "1811.06965",
          "title": "GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism",
          "authors": "Yanping Huang; Youlong Cheng; Ankur Bapna; ほか",
          "year": 2018,
          "url": "https://arxiv.org/abs/1811.06965",
          "topic": "並列学習・モデル統合",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 16 Nov 2018 (v1 ), last revised 25 Jul 2019 (this version, v5)",
          "reading_note": "layer分割とmicrobatch pipeline。",
          "chapter": "systems-and-training"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2304.11277",
      "id": "SY004",
      "aliases": [
        "SY004"
      ],
      "title": "PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel",
      "authors": "Yanli Zhao; Andrew Gu; Rohan Varma; ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2304.11277",
      "chapters": [
        "systems-and-training"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "SY004",
          "key": "2304.11277",
          "title": "PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel",
          "authors": "Yanli Zhao; Andrew Gu; Rohan Varma; ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2304.11277",
          "topic": "並列学習・モデル統合",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 21 Apr 2023 (v1 ), last revised 12 Sep 2023 (this version, v2)",
          "reading_note": "FSDPの実装・memory管理経験。",
          "chapter": "systems-and-training"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2410.06511",
      "id": "SY005",
      "aliases": [
        "SY005"
      ],
      "title": "TorchTitan: One-stop PyTorch native solution for production ready LLM pre-training",
      "authors": "Wanchao Liang; Tianyu Liu; Less Wright; ほか",
      "year": 2024,
      "url": "https://arxiv.org/abs/2410.06511",
      "chapters": [
        "systems-and-training"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "SY005",
          "key": "2410.06511",
          "title": "TorchTitan: One-stop PyTorch native solution for production ready LLM pre-training",
          "authors": "Wanchao Liang; Tianyu Liu; Less Wright; ほか",
          "year": 2024,
          "url": "https://arxiv.org/abs/2410.06511",
          "topic": "並列学習・モデル統合",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 9 Oct 2024 (v1 ), last revised 7 Jun 2025 (this version, v3)",
          "reading_note": "PyTorch-nativeに並列化を組み合わせる。",
          "chapter": "systems-and-training"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2104.04473",
      "id": "SY006",
      "aliases": [
        "SY006"
      ],
      "title": "Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM",
      "authors": "Deepak Narayanan; Mohammad Shoeybi; Jared Casper; ほか",
      "year": 2021,
      "url": "https://arxiv.org/abs/2104.04473",
      "chapters": [
        "systems-and-training"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "SY006",
          "key": "2104.04473",
          "title": "Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM",
          "authors": "Deepak Narayanan; Mohammad Shoeybi; Jared Casper; ほか",
          "year": 2021,
          "url": "https://arxiv.org/abs/2104.04473",
          "topic": "並列学習・モデル統合",
          "evidence": "abstract",
          "publication_status": "SC 2021",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 9 Apr 2021 (v1 ), last revised 23 Aug 2021 (this version, v5)",
          "reading_note": "DP・TP・PPの複合設計。",
          "chapter": "systems-and-training"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1710.03740",
      "id": "SY007",
      "aliases": [
        "SY007"
      ],
      "title": "Mixed Precision Training",
      "authors": "Paulius Micikevicius; Sharan Narang; Jonah Alben; ほか",
      "year": 2017,
      "url": "https://arxiv.org/abs/1710.03740",
      "chapters": [
        "systems-and-training"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "SY007",
          "key": "1710.03740",
          "title": "Mixed Precision Training",
          "authors": "Paulius Micikevicius; Sharan Narang; Jonah Alben; ほか",
          "year": 2017,
          "url": "https://arxiv.org/abs/1710.03740",
          "topic": "並列学習・モデル統合",
          "evidence": "abstract",
          "publication_status": "ICLR 2018（arXiv初出2017）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 10 Oct 2017 (v1 ), last revised 15 Feb 2018 (this version, v3)",
          "reading_note": "FP16、master weight、loss scaling。",
          "chapter": "systems-and-training"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1604.06174",
      "id": "SY008",
      "aliases": [
        "SY008"
      ],
      "title": "Training Deep Nets with Sublinear Memory Cost",
      "authors": "Tianqi Chen; Bing Xu; Chiyuan Zhang; Carlos Guestrin",
      "year": 2016,
      "url": "https://arxiv.org/abs/1604.06174",
      "chapters": [
        "systems-and-training"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "SY008",
          "key": "1604.06174",
          "title": "Training Deep Nets with Sublinear Memory Cost",
          "authors": "Tianqi Chen; Bing Xu; Chiyuan Zhang; Carlos Guestrin",
          "year": 2016,
          "url": "https://arxiv.org/abs/1604.06174",
          "topic": "並列学習・モデル統合",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 21 Apr 2016 (v1 ), last revised 22 Apr 2016 (this version, v2)",
          "reading_note": "再計算とactivation memoryの交換。",
          "chapter": "systems-and-training"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2212.04089",
      "id": "SY010",
      "aliases": [
        "SY010"
      ],
      "title": "Editing Models with Task Arithmetic",
      "authors": "Gabriel Ilharco; Marco Tulio Ribeiro; Mitchell Wortsman; ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2212.04089",
      "chapters": [
        "systems-and-training"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "SY010",
          "key": "2212.04089",
          "title": "Editing Models with Task Arithmetic",
          "authors": "Gabriel Ilharco; Marco Tulio Ribeiro; Mitchell Wortsman; ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2212.04089",
          "topic": "並列学習・モデル統合",
          "evidence": "abstract",
          "publication_status": "ICLR 2023（arXiv初出2022）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 8 Dec 2022 (v1 ), last revised 31 Mar 2023 (this version, v3)",
          "reading_note": "finetuning差分をtask vectorとして操作。",
          "chapter": "systems-and-training"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2306.01708",
      "id": "SY011",
      "aliases": [
        "SY011"
      ],
      "title": "TIES-Merging: Resolving Interference When Merging Models",
      "authors": "Prateek Yadav; Derek Tam; Leshem Choshen; Colin Raffel; Mohit Bansal",
      "year": 2023,
      "url": "https://arxiv.org/abs/2306.01708",
      "chapters": [
        "systems-and-training"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "SY011",
          "key": "2306.01708",
          "title": "TIES-Merging: Resolving Interference When Merging Models",
          "authors": "Prateek Yadav; Derek Tam; Leshem Choshen; Colin Raffel; Mohit Bansal",
          "year": 2023,
          "url": "https://arxiv.org/abs/2306.01708",
          "topic": "並列学習・モデル統合",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2023",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 2 Jun 2023 (v1 ), last revised 27 Oct 2023 (this version, v2)",
          "reading_note": "model差分の符号干渉への対処。",
          "chapter": "systems-and-training"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2310.01889",
      "id": "SY013",
      "aliases": [
        "SY013"
      ],
      "title": "Ring Attention with Blockwise Transformers for Near-Infinite Context",
      "authors": "Hao Liu; Matei Zaharia; Pieter Abbeel",
      "year": 2023,
      "url": "https://arxiv.org/abs/2310.01889",
      "chapters": [
        "systems-and-training"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "SY013",
          "key": "2310.01889",
          "title": "Ring Attention with Blockwise Transformers for Near-Infinite Context",
          "authors": "Hao Liu; Matei Zaharia; Pieter Abbeel",
          "year": 2023,
          "url": "https://arxiv.org/abs/2310.01889",
          "topic": "並列学習・モデル統合",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 3 Oct 2023 (v1 ), last revised 27 Nov 2023 (this version, v4)",
          "reading_note": "長いsequenceをblockwiseに分散。",
          "chapter": "systems-and-training"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1806.03377",
      "id": "SY015",
      "aliases": [
        "SY015"
      ],
      "title": "PipeDream: Fast and Efficient Pipeline Parallel DNN Training",
      "authors": "Aaron Harlap; Deepak Narayanan; Amar Phanishayee; ほか",
      "year": 2018,
      "url": "https://arxiv.org/abs/1806.03377",
      "chapters": [
        "systems-and-training"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "SY015",
          "key": "1806.03377",
          "title": "PipeDream: Fast and Efficient Pipeline Parallel DNN Training",
          "authors": "Aaron Harlap; Deepak Narayanan; Amar Phanishayee; ほか",
          "year": 2018,
          "url": "https://arxiv.org/abs/1806.03377",
          "topic": "並列学習・モデル統合",
          "evidence": "abstract",
          "publication_status": "arXiv版参照（公刊状況を別途確認したものは注記）",
          "checked_on": "2026-10-03",
          "version_history": "[Submitted on 8 Jun 2018",
          "reading_note": "pipelineとweight versioning。",
          "chapter": "systems-and-training"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "jmlr.org/papers/v13/bergstra12a.html",
      "id": "OA001",
      "aliases": [
        "OA001"
      ],
      "title": "Random Search for Hyper-Parameter Optimization",
      "authors": "James Bergstra・Yoshua Bengio",
      "year": 2012,
      "url": "https://jmlr.org/papers/v13/bergstra12a.html",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA001",
          "title": "Random Search for Hyper-Parameter Optimization",
          "authors": "James Bergstra・Yoshua Bengio",
          "year": 2012,
          "url": "https://jmlr.org/papers/v13/bergstra12a.html",
          "topic": "lr-schedule",
          "evidence": "abstract",
          "publication_status": "JMLR 13(10), 281–305 (2012)",
          "checked_on": "2026-10-03",
          "reading_note": "探索予算を揃えたrandom searchの基準。LR scale専用手法ではなく一般HPO",
          "source_inventory_index": 1,
          "source_urls": [
            "https://jmlr.org/papers/volume13/bergstra12a/bergstra12a.pdf"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://jmlr.org/papers/volume13/bergstra12a/bergstra12a.pdf"
      ]
    },
    {
      "canonical_key": "arxiv:1206.2944",
      "id": "OA002",
      "aliases": [
        "OA002"
      ],
      "title": "Practical Bayesian Optimization of Machine Learning Algorithms",
      "authors": "Jasper Snoek ほか",
      "year": 2012,
      "url": "https://arxiv.org/abs/1206.2944",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA002",
          "title": "Practical Bayesian Optimization of Machine Learning Algorithms",
          "authors": "Jasper Snoek ほか",
          "year": 2012,
          "url": "https://arxiv.org/abs/1206.2944",
          "topic": "lr-schedule",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "GPに基づくBayesian optimization。学習試行の費用・並列性も考慮",
          "source_inventory_index": 2,
          "first_submitted": "13 Jun 2012",
          "source_urls": [
            "https://arxiv.org/abs/1206.2944"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1803.02021",
      "id": "OA003",
      "aliases": [
        "OA003"
      ],
      "title": "Understanding Short-Horizon Bias in Stochastic Meta-Optimization",
      "authors": "Yuhuai Wu ほか",
      "year": 2018,
      "url": "https://arxiv.org/abs/1803.02021",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA003",
          "title": "Understanding Short-Horizon Bias in Stochastic Meta-Optimization",
          "authors": "Yuhuai Wu ほか",
          "year": 2018,
          "url": "https://arxiv.org/abs/1803.02021",
          "topic": "lr-schedule",
          "evidence": "abstract",
          "publication_status": "ICLR 2018",
          "checked_on": "2026-10-03",
          "reading_note": "短いunrollのmeta objectiveが小さすぎる学習率を選ぶbias",
          "source_inventory_index": 3,
          "first_submitted": "6 Mar 2018",
          "source_urls": [
            "https://openreview.net/forum?id=H1MczcgR-"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://openreview.net/forum?id=H1MczcgR-"
      ]
    },
    {
      "canonical_key": "ijcai.org/proceedings/2020/293",
      "id": "OA004",
      "aliases": [
        "OA004"
      ],
      "title": "Marthe: Scheduling the Learning Rate Via Online Hypergradients",
      "authors": "Michele Donini ほか",
      "year": 2020,
      "url": "https://www.ijcai.org/proceedings/2020/293",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA004",
          "title": "Marthe: Scheduling the Learning Rate Via Online Hypergradients",
          "authors": "Michele Donini ほか",
          "year": 2020,
          "url": "https://www.ijcai.org/proceedings/2020/293",
          "topic": "lr-schedule",
          "evidence": "abstract",
          "publication_status": "IJCAI 2020, 2119–2125（この会議版を照合）",
          "checked_on": "2026-10-03",
          "reading_note": "過去の学習軌跡から低費用にhypergradientを近似",
          "source_inventory_index": 4,
          "source_urls": [
            "https://www.ijcai.org/proceedings/2020/0293.pdf"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://www.ijcai.org/proceedings/2020/0293.pdf"
      ]
    },
    {
      "canonical_key": "arxiv:1206.1106",
      "id": "OA005",
      "aliases": [
        "OA005"
      ],
      "title": "No More Pesky Learning Rates",
      "authors": "Tom Schaul ほか",
      "year": 2012,
      "url": "https://arxiv.org/abs/1206.1106",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA005",
          "title": "No More Pesky Learning Rates",
          "authors": "Tom Schaul ほか",
          "year": 2012,
          "url": "https://arxiv.org/abs/1206.1106",
          "topic": "lr-schedule",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（出版版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "局所的な勾配変動を使う複数学習率の適応",
          "source_inventory_index": 5,
          "first_submitted": "6 Jun 2012",
          "source_urls": [
            "https://arxiv.org/abs/1206.1106"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1703.04813",
      "id": "OA006",
      "aliases": [
        "OA006"
      ],
      "title": "Learned Optimizers that Scale and Generalize",
      "authors": "Olga Wichrowska ほか",
      "year": 2017,
      "url": "https://arxiv.org/abs/1703.04813",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA006",
          "title": "Learned Optimizers that Scale and Generalize",
          "authors": "Olga Wichrowska ほか",
          "year": 2017,
          "url": "https://arxiv.org/abs/1703.04813",
          "topic": "lr-schedule",
          "evidence": "abstract",
          "publication_status": "ICML 2017",
          "checked_on": "2026-10-03",
          "reading_note": "階層RNNで学習したoptimizerの規模・タスク間転移",
          "source_inventory_index": 6,
          "first_submitted": "14 Mar 2017",
          "source_urls": [
            "https://arxiv.org/abs/1703.04813"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1708.07120",
      "id": "OA007",
      "aliases": [
        "OA007"
      ],
      "title": "Super-Convergence: Very Fast Training of Neural Networks Using Large Learning Rates",
      "authors": "Leslie N. Smith ほか",
      "year": 2017,
      "url": "https://arxiv.org/abs/1708.07120",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA007",
          "title": "Super-Convergence: Very Fast Training of Neural Networks Using Large Learning Rates",
          "authors": "Leslie N. Smith ほか",
          "year": 2017,
          "url": "https://arxiv.org/abs/1708.07120",
          "topic": "lr-schedule",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "大きい最大LRと一周期schedule、他正則化との釣合い",
          "source_inventory_index": 7,
          "first_submitted": "23 Aug 2017",
          "source_urls": [
            "https://arxiv.org/pdf/1708.07120"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/pdf/1708.07120"
      ]
    },
    {
      "canonical_key": "arxiv:2007.01547",
      "id": "OA008",
      "aliases": [
        "OA008"
      ],
      "title": "Descending through a Crowded Valley - Benchmarking Deep Learning Optimizers",
      "authors": "Robin M. Schmidt ほか",
      "year": 2020,
      "url": "https://arxiv.org/abs/2007.01547",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA008",
          "title": "Descending through a Crowded Valley - Benchmarking Deep Learning Optimizers",
          "authors": "Robin M. Schmidt ほか",
          "year": 2020,
          "url": "https://arxiv.org/abs/2007.01547",
          "topic": "lr-schedule",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（会議版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "多数のoptimizerと設定を共通予算で比べる実証的基準",
          "source_inventory_index": 8,
          "first_submitted": "3 Jul 2020",
          "source_urls": [
            "https://arxiv.org/abs/2007.01547"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2408.13359",
      "id": "OA009",
      "aliases": [
        "OA009"
      ],
      "title": "Power Scheduler: A Batch Size and Token Number Agnostic Learning Rate Scheduler",
      "authors": "Yikang Shen ほか",
      "year": 2024,
      "url": "https://arxiv.org/abs/2408.13359v1",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA009",
          "title": "Power Scheduler: A Batch Size and Token Number Agnostic Learning Rate Scheduler",
          "authors": "Yikang Shen ほか",
          "year": 2024,
          "url": "https://arxiv.org/abs/2408.13359v1",
          "topic": "lr-schedule",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（元リンクのv1を確認）",
          "checked_on": "2026-10-03",
          "reading_note": "batch・学習tokenとLRの関係を近似し転移を検証",
          "source_inventory_index": 9,
          "first_submitted": "23 Aug 2024",
          "source_urls": [
            "https://arxiv.org/abs/2408.13359v1"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2310.11291",
      "id": "OA010",
      "aliases": [
        "OA010"
      ],
      "title": "An Automatic Learning Rate Schedule Algorithm for Achieving Faster Convergence and Steeper Descent",
      "authors": "Zhao Song ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2310.11291",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA010",
          "title": "An Automatic Learning Rate Schedule Algorithm for Achieving Faster Convergence and Steeper Descent",
          "authors": "Zhao Song ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2310.11291",
          "topic": "lr-schedule",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "Regrettable Delta-Bar-Deltaで不適切なLR更新を修正",
          "source_inventory_index": 10,
          "first_submitted": "17 Oct 2023",
          "source_urls": [
            "https://arxiv.org/abs/2310.11291"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2105.10762",
      "id": "OA011",
      "aliases": [
        "OA011"
      ],
      "title": "AutoLRS: Automatic Learning-Rate Schedule by Bayesian Optimization on the Fly",
      "authors": "Yuchen Jin ほか",
      "year": 2021,
      "url": "https://arxiv.org/abs/2105.10762",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA011",
          "title": "AutoLRS: Automatic Learning-Rate Schedule by Bayesian Optimization on the Fly",
          "authors": "Yuchen Jin ほか",
          "year": 2021,
          "url": "https://arxiv.org/abs/2105.10762",
          "topic": "lr-schedule",
          "evidence": "abstract",
          "publication_status": "ICLR 2021",
          "checked_on": "2026-10-03",
          "reading_note": "短い試行からlossを予測し段階別LRをBayesian optimization",
          "source_inventory_index": 11,
          "first_submitted": "22 May 2021",
          "source_urls": [
            "https://arxiv.org/abs/2105.10762"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2409.04777",
      "id": "OA012",
      "aliases": [
        "OA012"
      ],
      "title": "Optimization Hyper-parameter Laws for Large Language Models",
      "authors": "Xingyu Xie ほか",
      "year": 2024,
      "url": "https://arxiv.org/abs/2409.04777v1",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA012",
          "title": "Optimization Hyper-parameter Laws for Large Language Models",
          "authors": "Xingyu Xie ほか",
          "year": 2024,
          "url": "https://arxiv.org/abs/2409.04777v1",
          "topic": "lr-schedule",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（元リンクのv1を確認、最新版は2026改訂）",
          "checked_on": "2026-10-03",
          "reading_note": "SDEから動的hyperparameterと損失の関係をモデル化",
          "source_inventory_index": 12,
          "first_submitted": "7 Sep 2024",
          "source_urls": [
            "https://arxiv.org/pdf/2409.04777v1"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/pdf/2409.04777v1"
      ]
    },
    {
      "canonical_key": "arxiv:2503.12811",
      "id": "OA013",
      "aliases": [
        "OA013"
      ],
      "title": "A Multi-Power Law for Loss Curve Prediction Across Learning Rate Schedules",
      "authors": "Kairong Luo ほか",
      "year": 2025,
      "url": "https://arxiv.org/abs/2503.12811",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA013",
          "title": "A Multi-Power Law for Loss Curve Prediction Across Learning Rate Schedules",
          "authors": "Kairong Luo ほか",
          "year": 2025,
          "url": "https://arxiv.org/abs/2503.12811",
          "topic": "lr-schedule",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "累積LRと減衰効果から未知scheduleの損失曲線を予測",
          "source_inventory_index": 13,
          "first_submitted": "17 Mar 2025",
          "source_urls": [
            "https://arxiv.org/abs/2503.12811"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2307.13831",
      "id": "OA014",
      "aliases": [
        "OA014"
      ],
      "title": "Relationship between Batch Size and Number of Steps Needed for Nonconvex Optimization of Stochastic Gradient Descent using Armijo Line Search",
      "authors": "Yuki Tsukada ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2307.13831",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA014",
          "title": "Relationship between Batch Size and Number of Steps Needed for Nonconvex Optimization of Stochastic Gradient Descent using Armijo Line Search",
          "authors": "Yuki Tsukada ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2307.13831",
          "topic": "lr-schedule",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "Armijo SGDのbatch数・step数・SFO費用の条件付き解析",
          "source_inventory_index": 14,
          "first_submitted": "25 Jul 2023",
          "source_urls": [
            "https://arxiv.org/abs/2307.13831"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2004.05909",
      "id": "OA015",
      "aliases": [
        "OA015"
      ],
      "title": "kDecay: Just adding k-decay items on Learning-Rate Schedule to improve Neural Networks",
      "authors": "Tao Zhang ほか",
      "year": 2020,
      "url": "https://arxiv.org/abs/2004.05909",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA015",
          "title": "kDecay: Just adding k-decay items on Learning-Rate Schedule to improve Neural Networks",
          "authors": "Tao Zhang ほか",
          "year": 2020,
          "url": "https://arxiv.org/abs/2004.05909",
          "topic": "lr-schedule",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "既存scheduleの形状をkで変える経験的設計",
          "source_inventory_index": 15,
          "first_submitted": "13 Apr 2020",
          "source_urls": [
            "https://arxiv.org/pdf/2004.05909"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/pdf/2004.05909"
      ]
    },
    {
      "canonical_key": "arxiv:1910.11758",
      "id": "OA016",
      "aliases": [
        "OA016"
      ],
      "title": "Optimizer Benchmarking Needs to Account for Hyperparameter Tuning",
      "authors": "Prabhu Teja Sivaprasad ほか",
      "year": 2019,
      "url": "https://arxiv.org/abs/1910.11758",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA016",
          "title": "Optimizer Benchmarking Needs to Account for Hyperparameter Tuning",
          "authors": "Prabhu Teja Sivaprasad ほか",
          "year": 2019,
          "url": "https://arxiv.org/abs/1910.11758",
          "topic": "lr-schedule",
          "evidence": "abstract",
          "publication_status": "ICML 2020",
          "checked_on": "2026-10-03",
          "reading_note": "optimizerの比較にhyperparameter探索費用を含める",
          "source_inventory_index": 16,
          "first_submitted": "25 Oct 2019",
          "source_urls": [
            "https://arxiv.org/abs/1910.11758"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2310.07269",
      "id": "OA017",
      "aliases": [
        "OA017"
      ],
      "title": "Why Does Sharpness-Aware Minimization Generalize Better Than SGD?",
      "authors": "Zixiang Chen ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2310.07269",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA017",
          "title": "Why Does Sharpness-Aware Minimization Generalize Better Than SGD?",
          "authors": "Zixiang Chen ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2310.07269",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2023",
          "checked_on": "2026-10-03",
          "reading_note": "特定データモデル・二層ReLU CNNでnoise学習抑制を説明",
          "source_inventory_index": 17,
          "first_submitted": "11 Oct 2023",
          "source_urls": [
            "https://arxiv.org/pdf/2310.07269.pdf"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/pdf/2310.07269.pdf"
      ]
    },
    {
      "canonical_key": "arxiv:2210.10452",
      "id": "OA018",
      "aliases": [
        "OA018"
      ],
      "title": "Rethinking Sharpness-Aware Minimization as Variational Inference",
      "authors": "Szilvia Ujváry ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2210.10452",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA018",
          "title": "Rethinking Sharpness-Aware Minimization as Variational Inference",
          "authors": "Szilvia Ujváry ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2210.10452",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "SAMとmean-field variational inferenceの摂動勾配の関係",
          "source_inventory_index": 18,
          "first_submitted": "19 Oct 2022",
          "source_urls": [
            "https://arxiv.org/abs/2210.10452"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2210.01620",
      "id": "OA019",
      "aliases": [
        "OA019"
      ],
      "title": "SAM as an Optimal Relaxation of Bayes",
      "authors": "Thomas Möllenhoff ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2210.01620",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA019",
          "title": "SAM as an Optimal Relaxation of Bayes",
          "authors": "Thomas Möllenhoff ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2210.01620",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "ICLR 2023",
          "checked_on": "2026-10-03",
          "reading_note": "Bayes目的の凸緩和としてSAMを解釈し不確実性へ接続",
          "source_inventory_index": 19,
          "first_submitted": "4 Oct 2022",
          "source_urls": [
            "https://arxiv.org/abs/2210.01620"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2202.00661",
      "id": "OA020",
      "aliases": [
        "OA020"
      ],
      "title": "When Do Flat Minima Optimizers Work?",
      "authors": "Jean Kaddour ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2202.00661",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA020",
          "title": "When Do Flat Minima Optimizers Work?",
          "authors": "Jean Kaddour ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2202.00661",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2022",
          "checked_on": "2026-10-03",
          "reading_note": "SWA/SAMを画像・言語・graphの異なるタスクで比較",
          "source_inventory_index": 20,
          "first_submitted": "1 Feb 2022",
          "source_urls": [
            "https://openreview.net/forum?id=vDeh2yxTvuh"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://openreview.net/forum?id=vDeh2yxTvuh"
      ]
    },
    {
      "canonical_key": "arxiv:2206.10654",
      "id": "OA021",
      "aliases": [
        "OA021"
      ],
      "title": "On the Maximum Hessian Eigenvalue and Generalization",
      "authors": "Simran Kaur ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2206.10654",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA021",
          "title": "On the Maximum Hessian Eigenvalue and Generalization",
          "authors": "Simran Kaur ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2206.10654",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2022 workshop; PMLR 187, 51–65 (2023)",
          "checked_on": "2026-10-03",
          "reading_note": "最大Hessian固有値の低下と汎化改善が分離する実験",
          "source_inventory_index": 21,
          "first_submitted": "21 Jun 2022",
          "source_urls": [
            "https://arxiv.org/abs/2206.10654"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2305.09088",
      "id": "OA022",
      "aliases": [
        "OA022"
      ],
      "title": "The Hessian perspective into the Nature of Convolutional Neural Networks",
      "authors": "Sidak Pal Singh ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2305.09088",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA022",
          "title": "The Hessian perspective into the Nature of Convolutional Neural Networks",
          "authors": "Sidak Pal Singh ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2305.09088",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "ICML 2023",
          "checked_on": "2026-10-03",
          "reading_note": "CNN構造とHessian rankの関係。線形活性化の理論と実験を区別",
          "source_inventory_index": 22,
          "first_submitted": "16 May 2023",
          "source_urls": [
            "https://arxiv.org/abs/2305.09088"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2212.13827",
      "id": "OA023",
      "aliases": [
        "OA023"
      ],
      "title": "Escaping Saddle Points for Effective Generalization on Class-Imbalanced Data",
      "authors": "Harsh Rangwani ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2212.13827",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA023",
          "title": "Escaping Saddle Points for Effective Generalization on Class-Imbalanced Data",
          "authors": "Harsh Rangwani ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2212.13827",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2022",
          "checked_on": "2026-10-03",
          "reading_note": "クラス不均衡の少数クラス損失におけるsaddle脱出",
          "source_inventory_index": 23,
          "first_submitted": "28 Dec 2022",
          "source_urls": [
            "https://arxiv.org/abs/2212.13827"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:1710.11379",
      "id": "OA024",
      "aliases": [
        "OA024"
      ],
      "title": "Latent Space Oddity: on the Curvature of Deep Generative Models",
      "authors": "Georgios Arvanitidis ほか",
      "year": 2017,
      "url": "https://arxiv.org/abs/1710.11379",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA024",
          "title": "Latent Space Oddity: on the Curvature of Deep Generative Models",
          "authors": "Georgios Arvanitidis ほか",
          "year": 2017,
          "url": "https://arxiv.org/abs/1710.11379",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "ICLR 2018",
          "checked_on": "2026-10-03",
          "reading_note": "生成器のpullback幾何。パラメータ損失sharpnessとは別の曲率",
          "source_inventory_index": 24,
          "first_submitted": "31 Oct 2017",
          "source_urls": [
            "https://arxiv.org/abs/1710.11379"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2306.08553",
      "id": "OA025",
      "aliases": [
        "OA025"
      ],
      "title": "Noise Stability Optimization for Finding Flat Minima: A Hessian-based Regularization Approach",
      "authors": "Hongyang R. Zhang ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2306.08553",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA025",
          "title": "Noise Stability Optimization for Finding Flat Minima: A Hessian-based Regularization Approach",
          "authors": "Hongyang R. Zhang ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2306.08553",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（2024年改訂題名）",
          "checked_on": "2026-10-03",
          "reading_note": "両方向noiseでHessian trace正則化を推定",
          "source_inventory_index": 25,
          "first_submitted": "14 Jun 2023",
          "source_urls": [
            "https://arxiv.org/abs/2306.08553"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2212.04343",
      "id": "OA026",
      "aliases": [
        "OA026"
      ],
      "title": "Improved Deep Neural Network Generalization Using m-Sharpness-Aware Minimization",
      "authors": "Kayhan Behdin ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2212.04343",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA026",
          "title": "Improved Deep Neural Network Generalization Using m-Sharpness-Aware Minimization",
          "authors": "Kayhan Behdin ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2212.04343",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "mini-batchを分割したmSAMの性能・費用・感度を比較",
          "source_inventory_index": 26,
          "first_submitted": "7 Dec 2022",
          "source_urls": [
            "https://arxiv.org/abs/2212.04343"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2210.05177",
      "id": "OA027",
      "aliases": [
        "OA027"
      ],
      "title": "Make Sharpness-Aware Minimization Stronger: A Sparsified Perturbation Approach",
      "authors": "Peng Mi ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2210.05177",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA027",
          "title": "Make Sharpness-Aware Minimization Stronger: A Sparsified Perturbation Approach",
          "authors": "Peng Mi ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2210.05177",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2022",
          "checked_on": "2026-10-03",
          "reading_note": "Fisher/dynamic sparse maskでSAMの摂動を疎にする",
          "source_inventory_index": 27,
          "first_submitted": "11 Oct 2022",
          "source_urls": [
            "https://arxiv.org/abs/2210.05177"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2310.03646",
      "id": "OA028",
      "aliases": [
        "OA028"
      ],
      "title": "TRAM: Bridging Trust Regions and Sharpness Aware Minimization",
      "authors": "Tom Sherborne ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2310.03646",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA028",
          "title": "TRAM: Bridging Trust Regions and Sharpness Aware Minimization",
          "authors": "Tom Sherborne ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2310.03646",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "ICLR 2024 spotlight",
          "checked_on": "2026-10-03",
          "reading_note": "パラメータ近傍と関数空間のtrust regionをfine-tuningで結ぶ",
          "source_inventory_index": 28,
          "first_submitted": "5 Oct 2023",
          "source_urls": [
            "https://arxiv.org/abs/2310.03646"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "papers.nips.cc/paper_files/paper/2022/hash/9b79416c0dc4b09feaa169ed5cdd63d4-Abstract-Conference.html",
      "id": "OA029",
      "aliases": [
        "OA029"
      ],
      "title": "Random Sharpness-Aware Minimization",
      "authors": "Yong Liu ほか",
      "year": 2022,
      "url": "https://papers.nips.cc/paper_files/paper/2022/hash/9b79416c0dc4b09feaa169ed5cdd63d4-Abstract-Conference.html",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA029",
          "title": "Random Sharpness-Aware Minimization",
          "authors": "Yong Liu ほか",
          "year": 2022,
          "url": "https://papers.nips.cc/paper_files/paper/2022/hash/9b79416c0dc4b09feaa169ed5cdd63d4-Abstract-Conference.html",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2022",
          "checked_on": "2026-10-03",
          "reading_note": "random smoothingで内側maxの一段近似を改善",
          "source_inventory_index": 29,
          "source_urls": [
            "https://openreview.net/forum?id=htUvh7xPoa"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://openreview.net/forum?id=htUvh7xPoa"
      ]
    },
    {
      "canonical_key": "arxiv:2203.09962",
      "id": "OA030",
      "aliases": [
        "OA030"
      ],
      "title": "Randomized Sharpness-Aware Training for Boosting Computational Efficiency in Deep Learning",
      "authors": "Yang Zhao ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2203.09962",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA030",
          "title": "Randomized Sharpness-Aware Training for Boosting Computational Efficiency in Deep Learning",
          "authors": "Yang Zhao ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2203.09962",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "SAM/通常更新を確率的に切替え追加逆伝播を節約",
          "source_inventory_index": 30,
          "first_submitted": "18 Mar 2022",
          "source_urls": [
            "https://arxiv.org/abs/2203.09962"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2203.02714",
      "id": "OA031",
      "aliases": [
        "OA031"
      ],
      "title": "Towards Efficient and Scalable Sharpness-Aware Minimization",
      "authors": "Yong Liu ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2203.02714",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA031",
          "title": "Towards Efficient and Scalable Sharpness-Aware Minimization",
          "authors": "Yong Liu ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2203.02714",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "CVPR 2022",
          "checked_on": "2026-10-03",
          "reading_note": "LookSAMで摂動方向の計算を周期化し大バッチへ展開",
          "source_inventory_index": 31,
          "first_submitted": "5 Mar 2022",
          "source_urls": [
            "https://openaccess.thecvf.com/content/CVPR2022/papers/Liu_Towards_Efficient_and_Scalable_Sharpness-Aware_Minimization_CVPR_2022_paper.pdf"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://openaccess.thecvf.com/content/CVPR2022/papers/Liu_Towards_Efficient_and_Scalable_Sharpness-Aware_Minimization_CVPR_2022_paper.pdf"
      ]
    },
    {
      "canonical_key": "arxiv:2303.00565",
      "id": "OA032",
      "aliases": [
        "OA032"
      ],
      "title": "AdaSAM: Boosting Sharpness-Aware Minimization with Adaptive Learning Rate and Momentum for Training Deep Neural Networks",
      "authors": "Hao Sun ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2303.00565",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA032",
          "title": "AdaSAM: Boosting Sharpness-Aware Minimization with Adaptive Learning Rate and Momentum for Training Deep Neural Networks",
          "authors": "Hao Sun ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2303.00565",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "adaptive LR・momentum・SAMの結合を非凸設定で解析",
          "source_inventory_index": 33,
          "first_submitted": "1 Mar 2023",
          "source_urls": [
            "https://arxiv.org/abs/2303.00565"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2106.01548",
      "id": "OA033",
      "aliases": [
        "OA033"
      ],
      "title": "When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations",
      "authors": "Xiangning Chen ほか",
      "year": 2021,
      "url": "https://arxiv.org/abs/2106.01548",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA033",
          "title": "When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations",
          "authors": "Xiangning Chen ほか",
          "year": 2021,
          "url": "https://arxiv.org/abs/2106.01548",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "ICLR 2022 spotlight",
          "checked_on": "2026-10-03",
          "reading_note": "SAMを用いたViT/MLP-Mixerの事前学習なし条件の比較",
          "source_inventory_index": 34,
          "first_submitted": "3 Jun 2021",
          "source_urls": [
            "https://openreview.net/forum?id=LtKcMgGOeLt"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://openreview.net/forum?id=LtKcMgGOeLt"
      ]
    },
    {
      "canonical_key": "aclanthology.org/2022.findings-emnlp.300",
      "id": "OA034",
      "aliases": [
        "OA034"
      ],
      "title": "Improving Sharpness-Aware Minimization with Fisher Mask for Better Generalization on Language Models",
      "authors": "Qihuang Zhong ほか",
      "year": 2022,
      "url": "https://aclanthology.org/2022.findings-emnlp.300/",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA034",
          "title": "Improving Sharpness-Aware Minimization with Fisher Mask for Better Generalization on Language Models",
          "authors": "Qihuang Zhong ほか",
          "year": 2022,
          "url": "https://aclanthology.org/2022.findings-emnlp.300/",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "Findings of EMNLP 2022, 4064–4085",
          "checked_on": "2026-10-03",
          "reading_note": "言語モデルfine-tuningでFisher maskを使うFSAM",
          "source_inventory_index": 36,
          "source_urls": [
            "https://aclanthology.org/2022.findings-emnlp.300.pdf"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://aclanthology.org/2022.findings-emnlp.300.pdf"
      ]
    },
    {
      "canonical_key": "arxiv:2205.11722",
      "id": "OA035",
      "aliases": [
        "OA035"
      ],
      "title": "Improving Shape Awareness and Interpretability in Deep Networks Using Geometric Moments",
      "authors": "Rajhans Singh ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2205.11722",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA035",
          "title": "Improving Shape Awareness and Interpretability in Deep Networks Using Geometric Moments",
          "authors": "Rajhans Singh ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2205.11722",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "CVPR 2023 Workshop: Deep Learning for Geometric Computing",
          "checked_on": "2026-10-03",
          "reading_note": "幾何momentによるshape表現。SAM手法ではなく周辺アーキテクチャ研究",
          "source_inventory_index": 37,
          "first_submitted": "24 May 2022",
          "source_urls": [
            "https://arxiv.org/abs/2205.11722"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2306.04251",
      "id": "OA036",
      "aliases": [
        "OA036"
      ],
      "title": "Stochastic Collapse: How Gradient Noise Attracts SGD Dynamics Towards Simpler Subnetworks",
      "authors": "Feng Chen ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2306.04251",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA036",
          "title": "Stochastic Collapse: How Gradient Noise Attracts SGD Dynamics Towards Simpler Subnetworks",
          "authors": "Feng Chen ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2306.04251",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2023",
          "checked_on": "2026-10-03",
          "reading_note": "SGD noiseによる疎・低rank不変集合への引力とimplicit bias",
          "source_inventory_index": 38,
          "first_submitted": "7 Jun 2023",
          "source_urls": [
            "https://arxiv.org/abs/2306.04251"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2306.12306",
      "id": "OA037",
      "aliases": [
        "OA037"
      ],
      "title": "Beyond Deep Ensembles: A Large-Scale Evaluation of Bayesian Deep Learning under Distribution Shift",
      "authors": "Florian Seligmann ほか",
      "year": 2023,
      "url": "https://arxiv.org/abs/2306.12306",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA037",
          "title": "Beyond Deep Ensembles: A Large-Scale Evaluation of Bayesian Deep Learning under Distribution Shift",
          "authors": "Florian Seligmann ほか",
          "year": 2023,
          "url": "https://arxiv.org/abs/2306.12306",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "arXiv preprint（出版版未再照合）",
          "checked_on": "2026-10-03",
          "reading_note": "分布変化下のBayesian近似・ensembleとcalibrationの比較",
          "source_inventory_index": 39,
          "first_submitted": "21 Jun 2023",
          "source_urls": [
            "https://arxiv.org/abs/2306.12306"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "arxiv:2201.05405",
      "id": "OA039",
      "aliases": [
        "OA039"
      ],
      "title": "The Implicit Regularization of Momentum Gradient Descent with Early Stopping",
      "authors": "Li Wang ほか",
      "year": 2022,
      "url": "https://arxiv.org/abs/2201.05405",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OA039",
          "title": "The Implicit Regularization of Momentum Gradient Descent with Early Stopping",
          "authors": "Li Wang ほか",
          "year": 2022,
          "url": "https://arxiv.org/abs/2201.05405",
          "topic": "sam",
          "evidence": "abstract",
          "publication_status": "arXiv preprint",
          "checked_on": "2026-10-03",
          "reading_note": "最小二乗でearly stopping付きmomentum flowをridgeと比較",
          "source_inventory_index": 41,
          "first_submitted": "14 Jan 2022",
          "source_urls": [
            "https://arxiv.org/abs/2201.05405"
          ],
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": []
    },
    {
      "canonical_key": "jmlr.org/papers/v21/17-678.html",
      "id": "OB001",
      "aliases": [
        "OB001"
      ],
      "title": "New Insights and Perspectives on the Natural Gradient Method",
      "authors": [
        "James Martens"
      ],
      "year": 2020,
      "url": "https://jmlr.org/papers/v21/17-678.html",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB001",
          "title": "New Insights and Perspectives on the Natural Gradient Method",
          "authors": [
            "James Martens"
          ],
          "year": 2020,
          "url": "https://jmlr.org/papers/v21/17-678.html",
          "topic": "natural gradient",
          "evidence": "abstract",
          "publication_status": "JMLR 21(146):1–76, 2020, published",
          "checked_on": "2026-10-03",
          "significance": "Fisher・GGN・damping・再parameterizationの関係を整理",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://www.jmlr.org/papers/volume21/17-678/17-678.pdf"
      ]
    },
    {
      "canonical_key": "jmlr.org/papers/v20/18-789.html",
      "id": "OB002",
      "aliases": [
        "OB002"
      ],
      "title": "Measuring the Effects of Data Parallelism on Neural Network Training",
      "authors": [
        "Christopher J. Shallue",
        "Jaehoon Lee",
        "Joseph Antognini",
        "Jascha Sohl-Dickstein",
        "Roy Frostig",
        "George E. Dahl"
      ],
      "year": 2019,
      "url": "https://jmlr.org/papers/v20/18-789.html",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB002",
          "title": "Measuring the Effects of Data Parallelism on Neural Network Training",
          "authors": [
            "Christopher J. Shallue",
            "Jaehoon Lee",
            "Joseph Antognini",
            "Jascha Sohl-Dickstein",
            "Roy Frostig",
            "George E. Dahl"
          ],
          "year": 2019,
          "url": "https://jmlr.org/papers/v20/18-789.html",
          "topic": "large batch",
          "evidence": "abstract",
          "publication_status": "JMLR 20(112):1–49, 2019, published",
          "checked_on": "2026-10-03",
          "significance": "batch比較におけるtuning・計算budgetの交絡を大規模に測定",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://jmlr.org/papers/v20/18-789.html"
      ]
    },
    {
      "canonical_key": "arxiv:2006.13484",
      "id": "OB003",
      "aliases": [
        "OB003"
      ],
      "title": "Accelerated Large Batch Optimization of BERT Pretraining in 54 minutes",
      "authors": [
        "Shuai Zheng",
        "Haibin Lin",
        "Sheng Zha",
        "Mu Li"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2006.13484",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB003",
          "title": "Accelerated Large Batch Optimization of BERT Pretraining in 54 minutes",
          "authors": [
            "Shuai Zheng",
            "Haibin Lin",
            "Sheng Zha",
            "Mu Li"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2006.13484",
          "topic": "large batch",
          "evidence": "abstract",
          "publication_status": "technical report, 2020; arXiv明記で査読venueなし",
          "checked_on": "2026-10-03",
          "significance": "LANSと学習率scheduleによるBERTの大batch訓練",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2006.13484"
      ]
    },
    {
      "canonical_key": "arxiv:1710.11258",
      "id": "OB004",
      "aliases": [
        "OB004"
      ],
      "title": "Adaptive Sampling Strategies for Stochastic Optimization",
      "authors": [
        "Raghu Bollapragada",
        "Richard Byrd",
        "Jorge Nocedal"
      ],
      "year": 2018,
      "url": "https://arxiv.org/abs/1710.11258",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB004",
          "title": "Adaptive Sampling Strategies for Stochastic Optimization",
          "authors": [
            "Raghu Bollapragada",
            "Richard Byrd",
            "Jorge Nocedal"
          ],
          "year": 2018,
          "url": "https://arxiv.org/abs/1710.11258",
          "topic": "adaptive batch",
          "evidence": "abstract",
          "publication_status": "SIAM Journal on Optimization, 2018, published; arXiv初稿2017",
          "checked_on": "2026-10-03",
          "significance": "内積testにより勾配推定のsample数を調整",
          "venue_url": "https://epubs.siam.org/doi/abs/10.1137/17M1154679",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/1710.11258"
      ]
    },
    {
      "canonical_key": "arxiv:2402.11215",
      "id": "OB005",
      "aliases": [
        "OB005"
      ],
      "title": "AdAdaGrad: Adaptive Batch Size Schemes for Adaptive Gradient Methods",
      "authors": [
        "Tim Tsz-Kit Lau",
        "Han Liu",
        "Mladen Kolar"
      ],
      "year": 2026,
      "url": "https://arxiv.org/abs/2402.11215",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB005",
          "title": "AdAdaGrad: Adaptive Batch Size Schemes for Adaptive Gradient Methods",
          "authors": [
            "Tim Tsz-Kit Lau",
            "Han Liu",
            "Mladen Kolar"
          ],
          "year": 2026,
          "url": "https://arxiv.org/abs/2402.11215",
          "topic": "adaptive batch",
          "evidence": "abstract",
          "publication_status": "Statistical Learning and Data Science, online 2026-08-11, in press / journal pre-proof（出版社検索取得書誌）; arXiv初稿2024、v4 2026-08-25",
          "checked_on": "2026-10-03",
          "significance": "AdaGrad系の更新と適応batchの相互作用を解析",
          "venue_url": "https://www.sciencedirect.com/science/article/pii/S3051390126000206",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/pdf/2402.11215"
      ]
    },
    {
      "canonical_key": "arxiv:2108.03645",
      "id": "OB006",
      "aliases": [
        "OB006"
      ],
      "title": "Online Evolutionary Batch Size Orchestration for Scheduling Deep Learning Workloads in GPU Clusters",
      "authors": [
        "Zhengda Bian",
        "Shenggui Li",
        "Wei Wang",
        "Yang You"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2108.03645",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB006",
          "title": "Online Evolutionary Batch Size Orchestration for Scheduling Deep Learning Workloads in GPU Clusters",
          "authors": [
            "Zhengda Bian",
            "Shenggui Li",
            "Wei Wang",
            "Yang You"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2108.03645",
          "topic": "training systems",
          "evidence": "abstract",
          "publication_status": "SC 2021 acceptedとの著者arXiv記載;初稿2021",
          "checked_on": "2026-10-03",
          "significance": "batch変更とGPU job配置を同時に考えるONES",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/pdf/2108.03645"
      ]
    },
    {
      "canonical_key": "arxiv:2111.00856",
      "id": "OB007",
      "aliases": [
        "OB007"
      ],
      "title": "Large-Scale Deep Learning Optimizations: A Comprehensive Survey",
      "authors": [
        "Xiaoxin He",
        "Fuzhao Xue",
        "Xiaozhe Ren",
        "Yang You"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2111.00856",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB007",
          "title": "Large-Scale Deep Learning Optimizations: A Comprehensive Survey",
          "authors": [
            "Xiaoxin He",
            "Fuzhao Xue",
            "Xiaozhe Ren",
            "Yang You"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2111.00856",
          "topic": "training systems",
          "evidence": "abstract",
          "publication_status": "arXiv survey公開2021;正式刊行版未照合",
          "checked_on": "2026-10-03",
          "significance": "精度・通信・memoryから大規模訓練を整理",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2111.00856"
      ]
    },
    {
      "canonical_key": "arxiv:2002.08056",
      "id": "OB008",
      "aliases": [
        "OB008"
      ],
      "title": "The Geometry of Sign Gradient Descent",
      "authors": [
        "Lukas Balles",
        "Fabian Pedregosa",
        "Nicolas Le Roux"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2002.08056",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB008",
          "title": "The Geometry of Sign Gradient Descent",
          "authors": [
            "Lukas Balles",
            "Fabian Pedregosa",
            "Nicolas Le Roux"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2002.08056",
          "topic": "optimizer geometry",
          "evidence": "abstract",
          "publication_status": "arXiv公開2020;正式刊行版未照合",
          "checked_on": "2026-10-03",
          "significance": "sign更新をℓ∞幾何とHessian構造から理解",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/pdf/2002.08056"
      ]
    },
    {
      "canonical_key": "arxiv:2506.18588",
      "id": "OB009",
      "aliases": [
        "OB009"
      ],
      "title": "Optimization-Induced Dynamics of Lipschitz Continuity in Neural Networks",
      "authors": [
        "Róisín Luo",
        "James McDermott",
        "Christian Gagné",
        "Qiang Sun",
        "Colm O'Riordan"
      ],
      "year": 2025,
      "url": "https://arxiv.org/abs/2506.18588",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB009",
          "title": "Optimization-Induced Dynamics of Lipschitz Continuity in Neural Networks",
          "authors": [
            "Róisín Luo",
            "James McDermott",
            "Christian Gagné",
            "Qiang Sun",
            "Colm O'Riordan"
          ],
          "year": 2025,
          "url": "https://arxiv.org/abs/2506.18588",
          "topic": "learning dynamics",
          "evidence": "abstract",
          "publication_status": "preprint; submitted 2025-06-23, revised 2025-11-14",
          "checked_on": "2026-10-03",
          "significance": "SGD noiseとLipschitz量の変化をSDEで記述",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2506.18588"
      ]
    },
    {
      "canonical_key": "arxiv:2411.12135",
      "id": "OB010",
      "aliases": [
        "OB010"
      ],
      "title": "Exact Risk Curves of signSGD in High-Dimensions: Quantifying Preconditioning and Noise-Compression Effects",
      "authors": [
        "Ke Liang Xiao",
        "Noah Marshall",
        "Atish Agarwala",
        "Elliot Paquette"
      ],
      "year": 2025,
      "url": "https://arxiv.org/abs/2411.12135",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB010",
          "title": "Exact Risk Curves of signSGD in High-Dimensions: Quantifying Preconditioning and Noise-Compression Effects",
          "authors": [
            "Ke Liang Xiao",
            "Noah Marshall",
            "Atish Agarwala",
            "Elliot Paquette"
          ],
          "year": 2025,
          "url": "https://arxiv.org/abs/2411.12135",
          "topic": "learning dynamics",
          "evidence": "abstract",
          "publication_status": "ICML 2025, PMLR 267:68391–68439; arXiv初稿2024、v3 2026-03-25",
          "checked_on": "2026-10-03",
          "significance": "高次元signSGDのリスク曲線を前処理とnoise効果へ分解",
          "venue_url": "https://proceedings.mlr.press/v267/xiao25c.html",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://openreview.net/attachment?id=MQpAF3Z1YD&name=pdf"
      ]
    },
    {
      "canonical_key": "proceedings.mlr.press/v267/qiu25j.html",
      "id": "OB011",
      "aliases": [
        "OB011"
      ],
      "title": "Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks",
      "authors": [
        "Shikai Qiu",
        "Lechao Xiao",
        "Andrew Gordon Wilson",
        "Jeffrey Pennington",
        "Atish Agarwala"
      ],
      "year": 2025,
      "url": "https://proceedings.mlr.press/v267/qiu25j.html",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB011",
          "title": "Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks",
          "authors": [
            "Shikai Qiu",
            "Lechao Xiao",
            "Andrew Gordon Wilson",
            "Jeffrey Pennington",
            "Atish Agarwala"
          ],
          "year": 2025,
          "url": "https://proceedings.mlr.press/v267/qiu25j.html",
          "topic": "learning dynamics",
          "evidence": "abstract",
          "publication_status": "ICML 2025, PMLR 267:50697–50720, published",
          "checked_on": "2026-10-03",
          "significance": "compute-optimal訓練曲線の正規化とsupercollapse",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://openreview.net/pdf?id=Fvq9ogLnLN"
      ]
    },
    {
      "canonical_key": "arxiv:1705.09056",
      "id": "OB012",
      "aliases": [
        "OB012"
      ],
      "title": "Can Decentralized Algorithms Outperform Centralized Algorithms? A Case Study for Decentralized Parallel Stochastic Gradient Descent",
      "authors": [
        "Xiangru Lian",
        "Ce Zhang",
        "Huan Zhang",
        "Cho-Jui Hsieh",
        "Wei Zhang",
        "Ji Liu"
      ],
      "year": 2017,
      "url": "https://arxiv.org/abs/1705.09056",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB012",
          "title": "Can Decentralized Algorithms Outperform Centralized Algorithms? A Case Study for Decentralized Parallel Stochastic Gradient Descent",
          "authors": [
            "Xiangru Lian",
            "Ce Zhang",
            "Huan Zhang",
            "Cho-Jui Hsieh",
            "Wei Zhang",
            "Ji Liu"
          ],
          "year": 2017,
          "url": "https://arxiv.org/abs/1705.09056",
          "topic": "decentralized SGD",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2017, published",
          "checked_on": "2026-10-03",
          "significance": "通信graph上のSGDと中央node通信bottleneckを比較",
          "venue_url": "https://proceedings.neurips.cc/paper/2017/hash/f75526659f31040afeb61cb7133e4e6d-Abstract.html",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/1705.09056"
      ]
    },
    {
      "canonical_key": "arxiv:2006.05720",
      "id": "OB013",
      "aliases": [
        "OB013"
      ],
      "title": "Extrapolation for Large-batch Training in Deep Learning",
      "authors": [
        "Tao Lin",
        "Lingjing Kong",
        "Sebastian U. Stich",
        "Martin Jaggi"
      ],
      "year": 2020,
      "url": "https://arxiv.org/abs/2006.05720",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB013",
          "title": "Extrapolation for Large-batch Training in Deep Learning",
          "authors": [
            "Tao Lin",
            "Lingjing Kong",
            "Sebastian U. Stich",
            "Martin Jaggi"
          ],
          "year": 2020,
          "url": "https://arxiv.org/abs/2006.05720",
          "topic": "large batch",
          "evidence": "abstract",
          "publication_status": "ICML 2020, PMLR 119:6094–6104, published",
          "checked_on": "2026-10-03",
          "significance": "extragradientによる大batch訓練軌道の制御",
          "venue_url": "https://proceedings.mlr.press/v119/lin20b.html",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2006.05720"
      ]
    },
    {
      "canonical_key": "arxiv:2106.10207",
      "id": "OB014",
      "aliases": [
        "OB014"
      ],
      "title": "Distributed Deep Learning in Open Collaborations",
      "authors": [
        "Michael Diskin",
        "Alexey Bukhtiyarov",
        "Max Ryabinin",
        "Lucile Saulnier",
        "Quentin Lhoest",
        "Anton Sinitsin",
        "Dmitry Popov",
        "Dmitry Pyrkin",
        "Maxim Kashirin",
        "Alexander Borzunov",
        "Albert Villanova del Moral",
        "Denis Mazur",
        "Ilia Kobelev",
        "Yacine Jernite",
        "Thomas Wolf",
        "Gennady Pekhimenko"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2106.10207",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB014",
          "title": "Distributed Deep Learning in Open Collaborations",
          "authors": [
            "Michael Diskin",
            "Alexey Bukhtiyarov",
            "Max Ryabinin",
            "Lucile Saulnier",
            "Quentin Lhoest",
            "Anton Sinitsin",
            "Dmitry Popov",
            "Dmitry Pyrkin",
            "Maxim Kashirin",
            "Alexander Borzunov",
            "Albert Villanova del Moral",
            "Denis Mazur",
            "Ilia Kobelev",
            "Yacine Jernite",
            "Thomas Wolf",
            "Gennady Pekhimenko"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2106.10207",
          "topic": "distributed training",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2021 acceptedとの著者arXiv記載",
          "checked_on": "2026-10-03",
          "significance": "異質帯域・参加者を考慮したDeDLOC",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2106.10207"
      ]
    },
    {
      "canonical_key": "arxiv:2307.06306",
      "id": "OB015",
      "aliases": [
        "OB015"
      ],
      "title": "Locally Adaptive Federated Learning",
      "authors": [
        "Sohom Mukherjee",
        "Nicolas Loizou",
        "Sebastian U. Stich"
      ],
      "year": 2023,
      "url": "https://arxiv.org/abs/2307.06306",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB015",
          "title": "Locally Adaptive Federated Learning",
          "authors": [
            "Sohom Mukherjee",
            "Nicolas Loizou",
            "Sebastian U. Stich"
          ],
          "year": 2023,
          "url": "https://arxiv.org/abs/2307.06306",
          "topic": "federated optimization",
          "evidence": "abstract",
          "publication_status": "arXiv初稿2023、v2 2024-05-14;正式刊行版未照合",
          "checked_on": "2026-10-03",
          "significance": "clientごとに異なるstep sizeで局所geometryを利用",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2307.06306"
      ]
    },
    {
      "canonical_key": "arxiv:2110.00532",
      "id": "OB016",
      "aliases": [
        "OB016"
      ],
      "title": "Layer-wise and Dimension-wise Locally Adaptive Federated Learning",
      "authors": [
        "Belhal Karimi",
        "Ping Li",
        "Xiaoyun Li"
      ],
      "year": 2023,
      "url": "https://arxiv.org/abs/2110.00532",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB016",
          "title": "Layer-wise and Dimension-wise Locally Adaptive Federated Learning",
          "authors": [
            "Belhal Karimi",
            "Ping Li",
            "Xiaoyun Li"
          ],
          "year": 2023,
          "url": "https://arxiv.org/abs/2110.00532",
          "topic": "federated optimization",
          "evidence": "abstract",
          "publication_status": "UAI 2023, PMLR 216:1037–1046; arXiv初稿2021、刊行題名はFed-LAMBで始まる",
          "checked_on": "2026-10-03",
          "significance": "層ごと・次元ごとの適応をFLに導入",
          "venue_url": "https://proceedings.mlr.press/v216/karimi23a.html",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2110.00532"
      ]
    },
    {
      "canonical_key": "arxiv:2106.06639",
      "id": "OB017",
      "aliases": [
        "OB017"
      ],
      "title": "Federated Learning with Buffered Asynchronous Aggregation",
      "authors": [
        "John Nguyen",
        "Kshitiz Malik",
        "Hongyuan Zhan",
        "Ashkan Yousefpour",
        "Michael Rabbat",
        "Mani Malek",
        "Dzmitry Huba"
      ],
      "year": 2022,
      "url": "https://arxiv.org/abs/2106.06639",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB017",
          "title": "Federated Learning with Buffered Asynchronous Aggregation",
          "authors": [
            "John Nguyen",
            "Kshitiz Malik",
            "Hongyuan Zhan",
            "Ashkan Yousefpour",
            "Michael Rabbat",
            "Mani Malek",
            "Dzmitry Huba"
          ],
          "year": 2022,
          "url": "https://arxiv.org/abs/2106.06639",
          "topic": "federated optimization",
          "evidence": "abstract",
          "publication_status": "AISTATS 2022, PMLR 151:3581–3607, published; arXiv初稿2021",
          "checked_on": "2026-10-03",
          "significance": "非同期更新のbuffer集約とSecure Aggregationの両立",
          "venue_url": "https://proceedings.mlr.press/v151/nguyen22b.html",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2106.06639"
      ]
    },
    {
      "canonical_key": "arxiv:1902.00340",
      "id": "OB018",
      "aliases": [
        "OB018"
      ],
      "title": "Decentralized Stochastic Optimization and Gossip Algorithms with Compressed Communication",
      "authors": [
        "Anastasia Koloskova",
        "Sebastian U. Stich",
        "Martin Jaggi"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1902.00340",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB018",
          "title": "Decentralized Stochastic Optimization and Gossip Algorithms with Compressed Communication",
          "authors": [
            "Anastasia Koloskova",
            "Sebastian U. Stich",
            "Martin Jaggi"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1902.00340",
          "topic": "decentralized SGD",
          "evidence": "abstract",
          "publication_status": "ICML 2019, PMLR 97:3478–3487, published;記載URLはarXiv初稿",
          "checked_on": "2026-10-03",
          "significance": "圧縮gossipのconsensusとSGDの収束率を区別",
          "venue_url": "https://proceedings.mlr.press/v97/koloskova19a.html",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/1902.00340"
      ]
    },
    {
      "canonical_key": "microsoft.com/en-us/research/publication/scalable-training-deep-learning-machines-incremental-block-training-intra-block-parallel-optimization-blockwise-model-update-filtering",
      "id": "OB019",
      "aliases": [
        "OB019"
      ],
      "title": "Scalable Training of Deep Learning Machines by Incremental Block Training with Intra-block Parallel Optimization and Blockwise Model-Update Filtering",
      "authors": [
        "Kai Chen",
        "Qiang Huo"
      ],
      "year": 2016,
      "url": "https://www.microsoft.com/en-us/research/publication/scalable-training-deep-learning-machines-incremental-block-training-intra-block-parallel-optimization-blockwise-model-update-filtering/",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB019",
          "title": "Scalable Training of Deep Learning Machines by Incremental Block Training with Intra-block Parallel Optimization and Blockwise Model-Update Filtering",
          "authors": [
            "Kai Chen",
            "Qiang Huo"
          ],
          "year": 2016,
          "url": "https://www.microsoft.com/en-us/research/publication/scalable-training-deep-learning-machines-incremental-block-training-intra-block-parallel-optimization-blockwise-model-update-filtering/",
          "topic": "distributed training",
          "evidence": "abstract",
          "publication_status": "ICASSP 2016, March 2016;著者所属機関の公開書誌・要旨確認",
          "checked_on": "2026-10-03",
          "significance": "blockwise update filteringを用いた分散音声モデル訓練",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://ieeexplore.ieee.org/document/7472805"
      ]
    },
    {
      "canonical_key": "arxiv:2406.17748",
      "id": "OB020",
      "aliases": [
        "OB020"
      ],
      "title": "A New Perspective on Shampoo's Preconditioner",
      "authors": [
        "Depen Morwani",
        "Itai Shapira",
        "Nikhil Vyas",
        "Eran Malach",
        "Sham Kakade",
        "Lucas Janson"
      ],
      "year": 2025,
      "url": "https://arxiv.org/abs/2406.17748",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB020",
          "title": "A New Perspective on Shampoo's Preconditioner",
          "authors": [
            "Depen Morwani",
            "Itai Shapira",
            "Nikhil Vyas",
            "Eran Malach",
            "Sham Kakade",
            "Lucas Janson"
          ],
          "year": 2025,
          "url": "https://arxiv.org/abs/2406.17748",
          "topic": "Shampoo",
          "evidence": "abstract",
          "publication_status": "ICLR 2025, published; arXiv初稿2024",
          "checked_on": "2026-10-03",
          "significance": "Shampoo近似の二乗とKronecker近似のpower iterationの関係",
          "venue_url": "https://proceedings.iclr.cc/paper_files/paper/2025/hash/11332b6b6cf4485b84afadb1352d3a9a-Abstract-Conference.html",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2406.17748"
      ]
    },
    {
      "canonical_key": "arxiv:2106.04188",
      "id": "OB021",
      "aliases": [
        "OB021"
      ],
      "title": "Stability and Generalization of Bilevel Programming in Hyperparameter Optimization",
      "authors": [
        "Fan Bao",
        "Guoqiang Wu",
        "Chongxuan Li",
        "Jun Zhu",
        "Bo Zhang"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2106.04188",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB021",
          "title": "Stability and Generalization of Bilevel Programming in Hyperparameter Optimization",
          "authors": [
            "Fan Bao",
            "Guoqiang Wu",
            "Chongxuan Li",
            "Jun Zhu",
            "Bo Zhang"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2106.04188",
          "topic": "bilevel/generalization",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2021, published",
          "checked_on": "2026-10-03",
          "significance": "validation dataに対する安定性とhyperparameter過適合",
          "venue_url": "https://proceedings.neurips.cc/paper_files/paper/2021/hash/2406a0a94c80406914ff2f6c9fdd67d5-Abstract.html",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2106.04188"
      ]
    },
    {
      "canonical_key": "arxiv:1806.09055",
      "id": "OB022",
      "aliases": [
        "OB022"
      ],
      "title": "DARTS: Differentiable Architecture Search",
      "authors": [
        "Hanxiao Liu",
        "Karen Simonyan",
        "Yiming Yang"
      ],
      "year": 2019,
      "url": "https://arxiv.org/abs/1806.09055",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB022",
          "title": "DARTS: Differentiable Architecture Search",
          "authors": [
            "Hanxiao Liu",
            "Karen Simonyan",
            "Yiming Yang"
          ],
          "year": 2019,
          "url": "https://arxiv.org/abs/1806.09055",
          "topic": "bilevel/NAS",
          "evidence": "abstract",
          "publication_status": "ICLR 2019 publishedとの著者arXiv記載;初稿2018",
          "checked_on": "2026-10-03",
          "significance": "離散architecture searchを連続緩和で微分可能にする",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/1806.09055?context=cs.CV"
      ]
    },
    {
      "canonical_key": "arxiv:2006.16712",
      "id": "OB023",
      "aliases": [
        "OB023"
      ],
      "title": "Model-based Reinforcement Learning: A Survey",
      "authors": [
        "Thomas M. Moerland",
        "Joost Broekens",
        "Aske Plaat",
        "Catholijn M. Jonker"
      ],
      "year": 2023,
      "url": "https://arxiv.org/abs/2006.16712",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB023",
          "title": "Model-based Reinforcement Learning: A Survey",
          "authors": [
            "Thomas M. Moerland",
            "Joost Broekens",
            "Aske Plaat",
            "Catholijn M. Jonker"
          ],
          "year": 2023,
          "url": "https://arxiv.org/abs/2006.16712",
          "topic": "model-based RL",
          "evidence": "abstract",
          "publication_status": "Foundations and Trends in Machine Learning 16(1):1–118, 2023（出版社公開書誌確認）; arXiv初稿2020",
          "checked_on": "2026-10-03",
          "significance": "モデル学習とplanningの組合せを整理し二段学習とbilevelを区別",
          "venue_url": "https://www.nowpublishers.com/article/DownloadSummary/MAL-086",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://arxiv.org/abs/2006.16712"
      ]
    },
    {
      "canonical_key": "arxiv:2205.14546",
      "id": "OB024",
      "aliases": [
        "OB024"
      ],
      "title": "The Missing Invariance Principle Found -- the Reciprocal Twin of Invariant Risk Minimization",
      "authors": [
        "Dongsung Huh",
        "Avinash Baidya"
      ],
      "year": 2022,
      "url": "https://arxiv.org/abs/2205.14546",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB024",
          "title": "The Missing Invariance Principle Found -- the Reciprocal Twin of Invariant Risk Minimization",
          "authors": [
            "Dongsung Huh",
            "Avinash Baidya"
          ],
          "year": 2022,
          "url": "https://arxiv.org/abs/2205.14546",
          "topic": "bilevel/invariance",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2022との著者arXiv記載",
          "checked_on": "2026-10-03",
          "significance": "labelで条件付けた表現の不変性MRIを提案",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://openreview.net/pdf?id=zz0FC7qBpkh"
      ]
    },
    {
      "canonical_key": "arxiv:2303.02343",
      "id": "OB025",
      "aliases": [
        "OB025"
      ],
      "title": "What Is Missing in IRM Training and Evaluation? Challenges and Solutions",
      "authors": [
        "Yihua Zhang",
        "Pranay Sharma",
        "Parikshit Ram",
        "Mingyi Hong",
        "Kush Varshney",
        "Sijia Liu"
      ],
      "year": 2023,
      "url": "https://arxiv.org/abs/2303.02343",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB025",
          "title": "What Is Missing in IRM Training and Evaluation? Challenges and Solutions",
          "authors": [
            "Yihua Zhang",
            "Pranay Sharma",
            "Parikshit Ram",
            "Mingyi Hong",
            "Kush Varshney",
            "Sijia Liu"
          ],
          "year": 2023,
          "url": "https://arxiv.org/abs/2303.02343",
          "topic": "bilevel/invariance",
          "evidence": "abstract",
          "publication_status": "ICLR 2023 acceptedとの著者arXiv記載",
          "checked_on": "2026-10-03",
          "significance": "batch・評価環境・consensus制約からIRMを再検討",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://openreview.net/attachment?id=MjsDeTcDEy&name=pdf"
      ]
    },
    {
      "canonical_key": "arxiv:2105.13954",
      "id": "OB026",
      "aliases": [
        "OB026"
      ],
      "title": "A Gradient Method for Multilevel Optimization",
      "authors": [
        "Ryo Sato",
        "Mirai Tanaka",
        "Akiko Takeda"
      ],
      "year": 2021,
      "url": "https://arxiv.org/abs/2105.13954",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB026",
          "title": "A Gradient Method for Multilevel Optimization",
          "authors": [
            "Ryo Sato",
            "Mirai Tanaka",
            "Akiko Takeda"
          ],
          "year": 2021,
          "url": "https://arxiv.org/abs/2105.13954",
          "topic": "multilevel optimization",
          "evidence": "abstract",
          "publication_status": "NeurIPS 2021 camera-readyとの著者arXiv記載",
          "checked_on": "2026-10-03",
          "significance": "内側反復の展開を多段問題へ拡張",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://openreview.net/forum?id=-sQ1LLWIAAJ"
      ]
    },
    {
      "canonical_key": "db-event.jpn.org/deim2019/post/papers/349.pdf",
      "id": "OB027",
      "aliases": [
        "OB027"
      ],
      "title": "ニューラルネットワークにおける適応的二次最適化手法",
      "authors": [
        "本川 哲哉",
        "手塚 太郎"
      ],
      "year": 2019,
      "url": "https://db-event.jpn.org/deim2019/post/papers/349.pdf",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "abstract"
      ],
      "records": [
        {
          "id": "OB027",
          "title": "ニューラルネットワークにおける適応的二次最適化手法",
          "authors": [
            "本川 哲哉",
            "手塚 太郎"
          ],
          "year": 2019,
          "url": "https://db-event.jpn.org/deim2019/post/papers/349.pdf",
          "topic": "Hessian-free",
          "evidence": "abstract",
          "publication_status": "DEIM Forum 2019, A4-2, 公開研究会論文",
          "checked_on": "2026-10-03",
          "significance": "Hessian-free法にmomentumとAdamの工夫を組み合わせる",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "https://db-event.jpn.org/deim2019/post/papers/349.pdf"
      ]
    },
    {
      "canonical_key": "orsj.org/wp-content/or-archives50/pdf/bul/Vol.32_06_363.pdf",
      "id": "OB028",
      "aliases": [
        "OB028"
      ],
      "title": "共役勾配法",
      "authors": [
        "矢部 博"
      ],
      "year": 1987,
      "url": "https://orsj.org/wp-content/or-archives50/pdf/bul/Vol.32_06_363.pdf",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "full-text"
      ],
      "records": [
        {
          "id": "OB028",
          "title": "共役勾配法",
          "authors": [
            "矢部 博"
          ],
          "year": 1987,
          "url": "https://orsj.org/wp-content/or-archives50/pdf/bul/Vol.32_06_363.pdf",
          "topic": "conjugate gradient",
          "evidence": "full-text",
          "publication_status": "オペレーションズ・リサーチ 32(6), pp.363–367, 1987, 学会解説",
          "checked_on": "2026-10-03",
          "significance": "線形CGの共役性と非線形拡張を日本語で説明",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "http://www.orsj.or.jp/~archive/pdf/bul/Vol.32_06_363.pdf"
      ]
    },
    {
      "canonical_key": "orsj.org/wp-content/or-archives50/pdf/bul/Vol.40_01_055.pdf",
      "id": "OB029",
      "aliases": [
        "OB029"
      ],
      "title": "非線形計画法（3）—無制約最適化問題—",
      "authors": [
        "八巻 直一",
        "矢部 博"
      ],
      "year": 1995,
      "url": "https://orsj.org/wp-content/or-archives50/pdf/bul/Vol.40_01_055.pdf",
      "chapters": [
        "optimization"
      ],
      "evidence": [
        "metadata"
      ],
      "records": [
        {
          "id": "OB029",
          "title": "非線形計画法（3）—無制約最適化問題—",
          "authors": [
            "八巻 直一",
            "矢部 博"
          ],
          "year": 1995,
          "url": "https://orsj.org/wp-content/or-archives50/pdf/bul/Vol.40_01_055.pdf",
          "topic": "damping/conjugate gradient",
          "evidence": "metadata",
          "publication_status": "オペレーションズ・リサーチ 40(1), pp.55–60, 1995, 学会解説",
          "checked_on": "2026-10-03",
          "significance": "無制約最適化法の関係を整理する既存引用資料",
          "chapter": "optimization"
        }
      ],
      "verified_url_aliases": [
        "http://www.orsj.or.jp/~archive/pdf/bul/Vol.40_01_055.pdf"
      ]
    }
  ]
}
