基盤モデル研究の再サーベイ:Attention・Transformer・GANから推論と効率化まで

2026年10月版サーベイの総合索引

基盤モデル:何を学習し、どこに計算を使い、どう確かめるか

調査基準日は 2026年10月3日。対象は既存の foundation-models/ 以下の8ページで、重要な前史、主要な方法、関連領域、2025〜2026年の追補を112件の文献・一次資料に結び付けて再構成した(うち講義・公式概要スライド3件)。10月4日以降の文献は対象外であり、「2026年10月末までの全論文」や関連論文の完全列挙を意味しない。検索索引への収録遅延、未公開研究、非英語文献、特定応用分野には未回収がある。

参考文献の確認水準は 本文該当節確認、要旨確認、書誌確認を分けた。「本文該当節確認」は論文全体・全証明・コードの精査や追試を意味しない。要旨しか確認していない文献の性能は著者報告として扱い、未確認の採択情報は補わない。年は原則としてarXivの最初の提出年を使い、公刊年が異なる場合は併記する。R3GANは会議版2024年、arXiv版2025年、Ngiamらはここで照合したICML版2011年を記載した。

1. 全体の研究史と本章の見取り図

時期 問題の捉え方 主な文献 次に残った課題
2011〜2016 複数入力の共有表現、生成分布の学習、翻訳のアラインメント Ngiam [FM095]、GAN [FM069]、Bahdanau [FM001] スケール、安定性、長距離依存
2017〜2020 Transformer、大規模事前学習、選好からの報酬学習 Transformer [FM002]、BERT [FM003]、GPT-3 [FM004]、RLHF [FM040–042] 学習資源配分、評価と望ましさのずれ
2021〜2023 言語・視覚の共通表現、計算最適化、instruction tuning CLIP [FM029]、Chinchilla [FM019]、FlashAttention [FM010]、InstructGPT [FM043]、DPO [FM046] 推論時コスト、頑健性、報酬誤差
2024〜2025 MoE/SSM、RLによる推論、推論時計算、生成モデル間の統合 Mamba-2 [FM015]、R1 [FM061]、s1 [FM062]、DMD2 [FM084]、APT [FM105] コストを揃えた能力評価、再現可能な比較
2026年の確認文献 ハードウェア協調、選好情報の拡張、形式検証、実運用評価 FlashAttention-4 [FM013]、rating-DPO [FM052]、Proof-R1 [FM068]、VLMのSeparable Law [FM027] 発表直後の結果の外部再現と一般化範囲

ここでの統合的な読み方は、表現能力、学習信号、計算配分、評価の妥当性を別々に調べることである。Attentionの高速化は学習目標を変えずに使える計算量を変え、RLHFは学習目標を変え、推論探索は固定モデルから得る出力分布を変える。これらを一つの「モデルが賢くなった」という説明だけでまとめると、改善の原因を取り違える。

2. Attention:情報アクセスと実装の二つの研究系譜

問題設定と研究の流れ

Attentionは、問い合わせに応じて他の位置の情報を重み付きで読み出す仕組みである。[FM001] Neural Machine Translation by Jointly Learning to Align and Translateは、文全体を固定長ベクトルに押し込む翻訳モデルの制約に対し、出力ごとに入力の関連部分を参照する方法を示した。

Transformerの基本演算は

\[\operatorname{Attention}(Q,K,V) =\operatorname{softmax}\left(QK^\top/\sqrt{d_k}+M\right)V\]

で、$M$ は因果制約やpaddingに対応するマスクである。原論文第3節では、注意の重み付き集約、多頭化、decoderの未来情報を遮断する設計が結び付けられている。注意重みだけを、予測の因果的な説明とみなすことは本章の整理からは支持されない。[FM002] Attention Is All You Need

その後の発展には三つの方向がある。第一に、位置情報をどう表すかという問題に対する[FM006] RoFormer/RoPE。第二に、生成時に保存・読み出しするKey/Valueを減らす[FM007] Multi-Query Attentionと[FM008] Grouped-Query Attention。第三に、長系列の演算・メモリアクセスを抑える方法であり、注意行列を近似する[FM009] Performerと、標準注意のIOを削減する[FM010] FlashAttentionは区別すべきである。

方法の比較

方法 主な変更対象 期待する利点 比較で確認する限界
標準多頭注意 各headに別のQ/K/V 柔軟な位置間アクセス 通常のdense注意は系列長に対して二次の演算
MQA / GQA [FM007–008] KV headの共有 decode時のKV容量・帯域を削減 品質との交換条件。演算すべてが線形になるわけではない
Performer [FM009] softmax kernelの近似 線形の時間・空間を狙う 近似誤差、特徴数、実機での速度
FlashAttention [FM010–011] tiling、再計算、並列分割 注意行列をHBMに展開する負担を削減 dense演算の二次性そのものは解消しない
FlashAttention-3 / 4 [FM012–013] 世代別GPUの非同期実行・数値演算 GPU内の律速資源に合わせる GPU世代、dtype、shape、前後方向で結果が変わる

[FM011] FlashAttention-2は仕事の分割と非行列積演算を改善し、[FM012] FlashAttention-3はHopperの非同期実行と低精度を扱う。2026年3月5日提出の[FM013] FlashAttention-4はBlackwell向けに進み、行列積性能に対して指数演算やメモリ資源の伸びが小さいという非対称性を扱う。第3.1節で確認した指数関数の実装近似と条件付きrescalingを含むため、「全世代・全dtypeで完全に同じ浮動小数点結果」とは書かない。アルゴリズムとしての注意近似と、有限精度の実装上の数値差も分けて考える。

未解決問題は、長文中の必要な情報を本当に利用できるか、KV圧縮の誤差が長い推論に累積しないか、attention kernelの改善がend-to-endの遅延にどこまで寄与するかである。読む順序は Bahdanau → Transformer第3節 → MQA/GQA → FlashAttention → 実行対象GPUに対応する後続版 がよい。

3. Transformer:アーキテクチャと学習方法を混同しない

TransformerはAttentionそのものではなく、注意・位置情報・FFN・残差接続・正規化を組み合わせる構造である。原論文はencoder–decoder翻訳器だが、[FM003] BERTは双方向の文脈を使う事前学習、[FM004] Language Models are Few-Shot Learnersは大規模な自己回帰生成と文脈内の例示、[FM005] Vision Transformerは画像パッチの系列化を代表する。同じ構造族でも、マスク、目的関数、データ、出力形式が違えば、能力と適した評価も異なる。

系統 入力間の情報アクセス 典型的な目的 注意する点
Encoder / BERT [FM003] 双方向 表現・分類・masked予測 因果的な逐次生成器とはそのまま互換でない
Decoder / GPT-3 [FM004] 因果マスク 次token予測 学習時の並列化と生成時の逐次性を区別
Encoder–decoder [FM002] 入力内部・出力内部・相互参照 条件付き系列変換 入力側と出力側の長さ・計算を別々に数える
ViT [FM005] 画像patch間 視覚表現 空間的帰納バイアス、データ規模、解像度の条件
選択的SSM / Mamba [FM014–015] 圧縮状態を介した再帰 長系列の効率化 記憶を圧縮することによる情報アクセスの制約
MoE / DeepSeek-V3 [FM016] tokenごとの専門家選択など 活性計算量と総容量の分離 総パラメータ数、活性パラメータ数、通信量を併記

[FM014] Mambaと[FM015] Transformers are SSMsは、長系列の処理を状態空間・再帰計算として設計し直す系譜である。後者の題名を「すべてのsoftmax TransformerとSSMが無条件に同じ」と読むのは適切でなく、論文は構造化行列を通じたSSMと注意の特定の変種の関係を論じる。[FM016] DeepSeek-V3 Technical Reportは、MoE、Multi-head Latent Attention、学習・通信・精度設計を一体で扱う例として読む。報告された学習コストを研究開発・データ取得・試行全体の総コストに置き換えてはいけない。

未解決問題は、どの情報を状態に残すべきか、異なる構造を同一データ・同一計算・同一推論予算でどう比較するかである。読む順序は Transformer → BERT/GPT-3/ViTの目的の違い → Mamba/SSD → 大規模統合モデルのtechnical report。最新モデルの名前の列挙より、変更した要素が何かを追える読み方が再利用しやすい。

4. Scaling Laws:普遍法則ではなく、条件付きの資源配分モデル

何を予測するのか

スケーリング則は、モデル規模 $N$、データ量 $D$、計算量 $C$ と損失・誤差の経験的関係を推定する。[FM017] Deep Learning Scaling is Predictable, Empiricallyは2017年に複数領域のスケーリングを調べており、元メモの「KaplanらがScaling Lawsの最初の論文」という記述は範囲が広すぎる。[FM018] Scaling Laws for Neural Language Modelsは言語モデルの資源配分を定量化した主要論文として位置付ける。

[FM019] Training Compute-Optimal Large Language Modelsの代表的な近似は

\[L(N,D)\simeq E+A N^{-\alpha}+B D^{-\beta}, \qquad C\simeq 6ND\]

である。後半はdenseモデルの学習FLOPsの概算であり、長文attentionやMoEの通信まで含む万能なコスト式ではない。Chinchillaの重要点は、固定予算下でパラメータだけでなくtokenにも計算を配ること、学習率scheduleを実際の学習長と合わせて比較することにある。付録Bはschedule不一致を、付録Eは小規模からの外挿の曲率を明示している。したがって特定のtoken/parameter比を、どの用途にも固定された定数として適用しない。

発展の比較

研究の問い 文献 得られる判断材料 適用上の限界
規模・データ・損失はどう結び付くか Hestness、Kaplan [FM017–018] 小規模実験による予算見積り データ・学習recipe・測定範囲に依存
固定学習計算をどう配るか Chinchilla [FM019] NとDの同時選択 推論需要を最適化した式ではない
視覚でも同じか Scaling ViT [FM020] モデル・データ・画像計算の関係 言語の指数をそのまま流用しない
なぜべき則が出るか Bahriら [FM021] variance/resolution律速の分類 理想化モデルの説明と実LLMの予測を区別
データを繰り返せばよいか Muennighoffら [FM022] 有効token数の逓減 unique tokenと反復tokenは同じ価値でない
英語以外にも成立するか ATLAS [FM026] 言語間の転移と混合比 言語・ドメイン・tokenizerの外挿
推論まで含めてどう配るか Bianら [FM025]、VLM則 [FM027] 形状・latency・視覚解像度 実機と用途のコストモデルが必要

[FM020] Scaling Vision Transformersと[FM021] Explaining Neural Scaling Lawsは、経験則の他領域への拡張と理論的な機構の分類をつなぐ。データ制約では[FM022] Scaling Data-Constrained Language Modelsが反復の限界を、[FM023] Will we run out of data?が人間由来公開テキストの供給を扱う。後者は条件付き予測であり、「特定年に必ず学習データが枯渇する」という確定事項ではない。

2025年の[FM025] Scaling Inference-Efficient Language Modelsは推論遅延とモデル形状を含め、[FM026] ATLASは多言語転移を対象にする。2026年10月1日提出の[FM027] Not All Error Yields to Scaleは、VLMの言語backboneと視覚token数を分けて評価する最新の要旨確認例である。著者は一部の質問が規模拡張に反応しないことを報告しているが、二つのモデル族と対象benchmarkからVLM全般の限界を確定した研究としては扱わない。

評価にも注意が必要である。[FM024] Are Emergent Abilities of Large Language Models a Mirage?は不連続な指標が「能力の突然の出現」に見える現象を作る場合を示す。これは全ての能力変化が錯覚だという結論ではない。また、[FM100] Extracting Training Data from Large Language Modelsは、大きいモデルの高い平均性能が訓練例の記憶・抽出可能性と両立することを示す。

未解決問題は、データ品質・多言語混合・合成データ・推論需要まで含む外挿精度である。読む順序は Hestness → Kaplan → Chinchillaと付録 → data-constrained → inference-aware / ATLAS。再現実験では、fitに用いた点と外挿評価点を分け、誤差帯と失敗した外挿も残す。

5. マルチモーダル:共有空間、融合、生成、欠測を分ける

研究史

既存メモの生体情報という関心は、画像に質問できるLLMだけに縮めるべきではない。[FM095] Multimodal Deep Learningは音声と映像の共有表現・cross-modal転移を扱い、[FM028] Multimodal Machine Learning: A Survey and Taxonomyは表現、翻訳、アラインメント、融合、co-learningという問題分解を与える。[FM097] Recent Advances and Trends in Multimodal Deep Learningは生理信号も含めた応用・データの入口になる。

大規模化の流れは、画像・テキストの対応から表現を得る[FM029] CLIP、既存の視覚と言語モデルをつなぐ[FM030] Flamingoと[FM031] BLIP-2、視覚instruction dataで応答を学ぶ[FM032] LLaVAへと追える。[FM033] ImageBindは全てのモダリティ対が揃わなくても、画像との対応を利用して共通空間を拡張する方向を示す。

融合方法の比較

方法 主に共有するもの 向いている状況 調べるべき失敗
Early fusion 低レベル入力・初期特徴 同期が良く、早い相互作用が有用 単位・sampling rateの差、noise、欠測
Intermediate / cross-attention modality別特徴と共同表現 異種encoderを使いたい 一方のmodalityへの依存、学習バランス
Late fusion 予測・決定 独立モデルの統合・欠測への柔軟性 低レベルの相互作用を取り逃す
対照学習 [FM029,033] 表現空間・類似度 検索、zero-shot認識 関係・数・否定などの構成的理解
LLM接続 [FM030–032] visual tokenやadapter 説明・指示応答 視覚根拠のない言語的補完
Omni-modal [FM035] 入出力と推論の統合 音声を含む対話 modality間干渉、同期、streaming遅延

[FM036] On the Benefits of Early Fusionは音声・映像のC-LSTMとnoise条件でearly fusionの利点を報告した研究であり、全ての生体データやLLMでearly fusionが最良という証明ではない。[FM096] Multimodal deep learning for biomedical data fusionの分類節を参照すると、featureの融合と最終判断の融合を分ける必要がある。生体データでは患者・施設をまたぐ分割、欠測する理由、時刻同期、外部施設への転移を評価設計に含めるべきである。

2025年には[FM034] Qwen2.5-VLが動的画像解像度と動画の時間表現、[FM035] Qwen3-Omniがテキスト・画像・音声・動画の統合を報告した。本章では設計方向を参照し、technical reportの順位を2026年10月時点の固定されたモデルランキングとして扱わない。[FM037] Deep Multimodal Learning with Missing Modalityは2024年初出、2026年更新の総説で欠測を扱い、[FM038] From Models to Systemsは2026年9月提出の総説として効率化をモデル・アルゴリズム・システムに分ける。

用語の訂正:既存メモの[FM039] Revisit Multimodal Meta-Learningでいうmultimodalは、主としてタスク分布が複数のモードを持つことを指す。同一サンプルの画像・音声・生体信号を融合する問題とは異なる。[FM104] Social-BiGATの将来軌道のmultimodalも、多峰的な将来の可能性という意味を含むため、同じ語だけでセンサ融合に分類しない。

未解決問題は、融合で得た改善が情報の相補性によるのかデータ量増加によるのか、欠測・ノイズ・分布外で残るか、説明文が入力を正しく参照しているかである。読む順序は Ngiam → Baltrušaitis → 生体融合総説 → CLIP → BLIP-2/LLaVA → 欠測総説 → 2025〜2026の統合モデル・効率化。

6. RLHFと選好最適化:人間の比較を何に変換するか

研究史と基本構造

[FM040] Deep reinforcement learning from human preferencesは行動軌道の比較から報酬を学習し、[FM041] Fine-Tuning Language Models from Human Preferencesと[FM042] Learning to summarize from human feedbackは言語生成に展開した。[FM043] InstructGPTはSFT、出力比較からの報酬モデル、PPOによる方策更新を統合する代表例である。[FM044] Proximal Policy Optimization Algorithmsはその最適化器の基礎である。

典型的な目的は

\[\max_\pi\; \mathbb E_{x,y\sim\pi}[r_\phi(x,y)] -\beta\,\mathbb E_x D_{\mathrm{KL}}(\pi(\cdot|x)\|\pi_{\rm ref}(\cdot|x)).\]

ここで報酬モデル、学習する方策、参照方策は役割が異なる。元メモの「RLHFでは言語モデルのパラメータを凍結する」は一般的定義として誤りである。LoRAを使う場合は基盤重みを凍結して追加パラメータを学習するが、方策の全パラメータを更新するRLHFもある。PPOの損失もcriticの予測誤差だけではなく、policy objectiveなどを含む。[FM043–044,088]

[FM046] Direct Preference OptimizationはKL正則化と選好モデルの仮定の下で、報酬を方策と参照方策の対数比で再パラメータ化する。論文第4節・式7を確認した範囲では、明示的な報酬モデルとonline RL loopを必要としない形にできることが要点である。有限の選好データでのgeneralizationや、実際の全てのPPO訓練と同じ方策に収束することまで保証する説明ではない。

手法の比較

系統 必要な信号 更新・運用上の特徴 主な限界
PPO型RLHF [FM043–044] 比較+報酬モデル 現方策で生成し、報酬を利用 sampling費用、報酬誤差、KLの選択
Constitutional AI / RLAIF [FM045] 原則+AI評価 人間による個別比較の負担を減らす 原則・judgeの偏り、人間の価値の完全代替にはならない
DPO [FM046] chosen/rejectedペア offline分類損失に変換 比較分布と生成分布の差、参照方策への依存
IPO [FM047] 比較選好 選好学習の目的を理論から再検討 仮定と実際の言語応答の差
KTO [FM048] 望ましい/望ましくないラベル ペア以外のfeedbackに対応 データ比率・utility設計への依存
SimPO [FM049] 比較ペア 平均log probabilityとmargin 長さ・品質・評価モデルの関係
Rating情報付きDPO [FM052] 比較+評価の差 feedbackの強さも利用 ratingの校正と追加annotation費用

[FM045] Constitutional AIは、人手ラベルを減らしても原則の選定という人間側の判断が残ることを示す研究として読む。[FM047] IPOの理論論文、[FM048] KTO、[FM049] SimPOは、単にPPOを順番に置き換えた直線的進歩というより、利用できるfeedbackと目的関数の違いへの回答である。

限界の中心はproxyである。[FM050] Scaling Laws for Reward Model Overoptimizationは代理報酬を最適化しすぎることを扱うが、「gold reward」も実験上はモデルであり、人間の真の効用そのものではない。[FM051] Open Problems and Fundamental Limitations of RLHFを使って、annotation、報酬推定、policy最適化、評価の各段階を点検するとよい。2026年の[FM052] DPO with Rating Informationは評価差の利用、[FM053] Reward Modeling for RL-Based LLM Reasoningは推論における報酬の分類を扱う。両者の理論証明全体は今回未精査であり、定理の適用範囲を本章から判断しない。

未解決問題は、少数派を含む選好の不一致、長さ・文体と内容の混同、分布外の報酬誤差、online探索とofflineデータの配分である。読む順序は Christiano → Stiennon/InstructGPT → PPO → DPO第3〜5節 → overoptimization → IPO/KTO/SimPO。実験ではwin rateだけでなく、長さ、真実性、拒否率、分布外性能、費用を併記する。

7. Reasoning:推論文、探索、学習、検証の四層

研究の流れ

[FM054] Chain-of-Thought Promptingは中間ステップの例示を、[FM055] Self-Consistencyは複数の推論経路の集約を、[FM056] Tree of Thoughtsは探索と自己評価を扱う。[FM057] ReActは外部環境への行動を推論と交互に実行する。これらは、同じ基盤モデルから異なる出力を引き出す方法であり、パラメータを学習する方法とは区別する。

[FM058] Let’s Verify Step by Stepは最終回答だけでなく途中の過程を監督する選択肢を示した。[FM059] Scaling LLM Test-Time Compute Optimallyは難度ごとに探索と生成修正の計算配分を変える研究である。平均token数が増えること、正解率が上がること、途中の推論が忠実になることは別々の性質である。

[FM060] DeepSeekMathは数学データとGRPOを、[FM061] DeepSeek-R1はRLによる推論と蒸留を結び付けた。R1-ZeroとR1を区別する。v1第2.2〜2.3節では、前者は事前学習済み基盤モデルに対するRL、後者はcold-start SFTを含む複数段階の訓練である。「事前学習もなく、データも人間の設計も不要」といった説明にはならない。R1の2026年更新要旨だけを読むより、元の技術報告の工程を確認する意味がここにある。

計算を増やす場所の比較

方法 計算を増やす場所 確認すべき評価
CoT [FM054] 逐次の出力token 単一回答の正確さ、誤った中間step
Self-consistency [FM055] 独立した複数試行 投票後accuracyと総sampling費用
ToT / verifier search [FM056,058] 候補探索・評価器 生成と評価を含む総計算・失敗時挙動
RL / GRPO [FM060–061,064] 学習中のrolloutと更新 学習予算、base model、評価汚染、seed
s1 [FM062] 蒸留SFT+生成長制御 教師モデルとデータ選択の寄与
Latent recurrence [FM063] 内部状態の反復 token数では比較できない推論FLOPs
学習した探索方策 [FM067] 概念・戦略生成器 案内役も含めた計算、転移可能性
形式検証付きRL [FM068] 証明義務のチェック 記号化の妥当性、検証器の対象範囲

2025年の[FM062] s1は少量の選別された推論例とbudget forcing、[FM063] A Recurrent Depth Approachは潜在状態の反復、[FM064] DAPOは大規模RLの訓練工程を公開する方向を示した。「例が少ない」ことから、教師モデルの計算や元の事前学習まで含めて学習全体が安価だったとは結論しない。

能力拡張をめぐる論争の読み方

[FM065] Does Reinforcement Learning Really Incentivize Reasoning Capacity…は、大きい $k$ のpass@kから基盤モデルとRL後の正解範囲を比較する。pass@1改善と探索範囲の縮小が両立するという問題提起は重要だが、全ての将来のRL方式が新能力を獲得できないという不可能性定理ではない。大きい $k$ のoracle的な「一つでも正解がある」と、実際に正解を選べる運用も分ける。

[FM066] The Illusion of Thinkingは、複雑度を制御したパズルにおける失敗を報告する。ここから人間の意味での「思考の有無」を直接判定するのではなく、問題表現、出力長、実行・検証方法を固定して一般化を測る研究として位置付ける。これらは著者の実験範囲に限った要旨確認であり、反論文を含む論争全体の収集には余地がある。

2026年9月22日提出の[FM067] Beyond Repeated Samplingは、小さなモデルが概念・方針を提案して大きな回答生成器の探索を助ける方法を報告する。9月29日提出の[FM068] Learning to Prove, Not Just to Answerは自然言語論理の中間推論を形式的に検査し、答えを支える依存関係に報酬を対応させる。いずれも発表直後のpreprintとして要旨と公開日を確認した範囲であり、汎用的な優越を確定した結果ではない。

未解決問題は、汚染を避けた新問題への転移、外部検証できない問題の報酬、長期行動の信用割当、推論文の忠実性、適切な停止判断である。読む順序は CoT → self-consistency → process supervision → test-time scaling → DeepSeekMath/R1 → s1/DAPO → pass@k批判 → 形式検証。

8. GAN:分布学習・ゲームの最適化・評価を分離する

基本問題と歴史

[FM069] Generative Adversarial Networksは、生成器が作る分布を識別器とのゲームを通じてデータ分布に近づける枠組みを導入した。原論文における理想化した関数空間での議論は、有限容量のneural networkを有限データ・勾配法で学習すれば必ず大域的に収束する保証ではない。[FM070] DCGANは畳み込み構造を使う実装上の基準になった。

学習目的と制約の研究では、[FM071] Wasserstein GAN、[FM072] Improved Training of Wasserstein GANs、[FM073] Spectral Normalizationが重要である。距離の選択、勾配への制約、重みの作用素ノルムへの制約は異なる変更であり、「どれもLipschitzにするから同じ」とは整理しない。

安定化と収束性の比較

研究 改善する対象 得られる知見 読み違えやすい点
WGAN [FM071] 分布間距離 学習信号の設計 有限stepのゲーム学習の万能収束保証ではない
WGAN-GP [FM072] 入力勾配へのpenalty clippingに伴う問題への対処 sampleされた位置のpenaltyと大域制約の差
Spectral Normalization [FM073] 層の重みの最大特異値 識別器の感度の制御 表現・最適化・最終品質は別に評価
Numerics / convergence [FM074–075] 勾配場・更新写像 局所安定性と回転的挙動 Jacobianの符号規約、step size、正則性の仮定
TTUR [FM076] 二者の時間尺度 条件付き局所収束と実用学習 Adamが全GANで最良という主張ではない
R3GAN [FM082] 相対損失+正則化+backbone 単純化した現代的baseline 局所保証を大域保証に読み替えない

[FM074] The Numerics of GANsと[FM075] Which Training Methods for GANs do actually Converge?を並べると、元メモの「固有値の実部が0/虚部が大きいと収束しない」は強すぎる要約である。更新方式・学習率・分布のregularityに依存し、連続時間の勾配場と離散時間の更新写像も区別する。後者の導入・表1・仮定節では、有限回の識別器更新を使うWGAN系の反例と、適切な仮定下のゼロ中心勾配penaltyの局所収束を確認できる。

画像品質の大規模化は[FM077] BigGAN、制御可能な生成は[FM078] StyleGAN、artifactの改善は[FM079] StyleGAN2、aliasingは[FM080] StyleGAN3という別の問いとして追う。[FM081] GigaGANはテキスト条件付きの大規模化を扱い、[FM082] R3GANは安定化とbackboneの再設計を扱う。R3GANを「2025年初出」とだけ書くと会議版NeurIPS 2024を見落とす。会議PDFとarXivで副題の語順にも差があるため、末尾ではリンク先arXivの題名を採用した。

拡散モデルとの関係と関連応用

[FM083] Denoising Diffusion Probabilistic Modelsは段階的なdenoisingで分布を学ぶ系譜の代表である。生成速度、訓練安定性、被覆、条件追従を同じ条件で比較すべきであり、「GANは終わった」「GANが全面的に復活した」という分類では研究課題が見えない。[FM084] DMD2は蒸留にGAN損失を取り込み、2025年の[FM105] Diffusion Adversarial Post-Trainingは拡散事前学習後の敵対的後学習を動画に展開する。学習目的は組み合わせられる。

元ページで紹介されていた[FM101] StackGAN、[FM102] RGBD-GAN、[FM103] Training language GANs from Scratch、[FM104] Social-BiGATも、それぞれテキスト条件、3D整合性、離散言語、複数の将来軌道という異なる制約を持つ関連系譜として残した。2026年の[FM085] Spintronic DCGANは特殊ハードウェアへの実装例であり、標準的な高解像度画像生成の最良モデルという位置付けではない。

評価

FIDの導入元は[FM076] TTURである。特徴空間での要約統計に基づくFIDだけでは、品質と分布の被覆を独立に診断できないため、[FM098] Improved Precision and Recall Metricを併読する。[FM099] On Aliased Resizing and Surprising Subtleties in GAN Evaluationはリサイズや圧縮による評価差を示す。比較にはdataset、split、解像度、生成枚数、前処理、特徴抽出器、truncation、推論step数を揃える必要がある。mode collapseは「画像が不鮮明」と同義ではない。

未解決問題は、大規模生成での安定性と被覆の同時達成、条件への追従、動画の時間的一貫性、評価器の盲点である。読む順序は 原GAN → WGAN/GP/SN → Numerics/収束性 → TTURと評価 → StyleGAN/GigaGAN → R3GAN/DMD2/APT。最適化研究との接点を調べるなら、画像の見栄えよりもゲームのJacobian、学習率比、regularizationの作用を先に見る。

9. LLM実装:必要GPU台数から、メモリ・通信・ワークロードの分解へ

研究史と基本的な見積り

元メモにはBLOOMやLlama 2のGPU台数・所要時間があるが、これらは当時の設定の事例であって、同じパラメータ数の普遍的必要条件ではない。学習・全パラメータfine-tuning・LoRA・量子化推論では必要な状態が違う。少なくとも次を分ける。

\[M_{\rm peak}\approx M_{\rm weights}+M_{\rm gradients} +M_{\rm optimizer}+M_{\rm activations}+M_{\rm KV}+M_{\rm workspace}.\]

全ての項が全処理で同時に同じ形で存在するわけではない。通常の自己回帰推論のKV cacheは、概算でbatch、系列長、層数、KV head数、head次元、要素byte数の積に比例する。これは独自の容量見積りであり、実装・共有・量子化・offloadで変わる。公称VRAMに重みが入ることだけでは実行可能性も速度も保証できない。[FM007–008,087,092]

[FM086] Megatron-LMは層内のモデル並列、[FM087] ZeROは重複する学習状態の分割、[FM088] LoRAは学習する差分の低ランク化、[FM089] QLoRAは量子化した凍結重みを経由したadapter学習を扱う。[FM090] GPTQと[FM091] AWQは学習後量子化の系譜であり、量子化した重みを使うことと学習時の全状態を低bit化することは異なる。

改善対象ごとの比較

方法 主に減らすもの 費用・制約として残るもの
Tensor/model parallel [FM086] 一台が保持・計算するモデル部分 collective通信、network topology
ZeRO [FM087] 学習状態の複製 all-gather / reduce-scatter等の通信
LoRA [FM088] 学習可能パラメータとoptimizer状態 基盤モデル、activation、rank選択
QLoRA [FM089] 基盤重みの保持量 逆伝播、activation、量子化計算の費用
GPTQ / AWQ [FM090–091] 主に重み容量・帯域 calibration、kernel support、品質変化
PagedAttention / vLLM [FM092] KV断片化・複製 KV総量とスケジューリング
Speculative decoding [FM093] 大モデルの逐次呼出し待ち draftの費用、受理率、実装の分布保存条件
SGLang [FM094] prefix再計算・構造化出力処理 workload依存、cache占有、複数呼出しの依存関係

[FM092] PagedAttentionはservingのKV管理、[FM093] Speculative Decodingは小さい提案器と大きい検証器、[FM094] SGLangはプログラム構造とcache再利用を扱う。これらの速度向上を一律に掛け算して見積もることはできない。2026年の[FM106] A Year in LLM Servingは長期の実運用ワークロードを分析する研究として、固定の合成入力だけでは見えないmodel・user・時期ごとの変動を考える入口になる。arXivのSubmitted表示と識別子の月・検索索引の日付には不整合があるため、検索ログに記録し、本文の書誌年は2026年とのみ記載した。

未解決問題は、長い推論と多turnに伴うKV増加、prefill/decodeの異なる律速、tail latency、量子化誤差の推論への影響、機種依存性である。読む順序は メモリの項分解 → Megatron/ZeRO → LoRA/QLoRA → GPTQ/AWQ → PagedAttention/speculative decoding → SGLang/実運用評価。再現記録にはGPU機種・枚数、相互接続、dtype、batch、系列長、モデルrevision、ソフトウェアversion、throughput、TTFT、生成tokenあたりの遅延、peak memoryを残す。

10. 分野横断で重要な研究課題

次の五つは各論文の結論の転記ではなく、本章の文献を横断した整理である。

  1. 計算をどこに配るか。事前学習、post-training、推論探索、視覚解像度、KV・cache管理を別々に最適化しても、総予算で最適とは限らない。Chinchilla、inference-aware則、test-time scaling、Separable Lawをつなげる。[FM019,025,027,059]
  2. 改善を代理指標だけで判断しない。RLHFのreward、推論のpass@k、画像生成のFIDは異なるproxyであり、実際に欲しい品質からずれうる。proxy最適化の強さと、独立評価の変化を同時に記録する。[FM050,065,098–099]
  3. 限界の由来を分ける。データ不足、表現の圧縮、探索不足、検証器の誤差、実機の帯域不足は別の失敗である。Attention、SSM、RLVR、形式検証、システム技法を比較するときに原因を切り分ける。[FM009–015,060,068,092]
  4. 多言語・生体情報・欠測を周辺問題にしない。英語のtext-only条件で成立する規模則・選好・評価が、そのまま生理信号や施設外データに転用できるとは限らない。[FM026,037,096]
  5. 公開性にも段階がある。論文、重み、データ、データ処理、training recipe、実装、実行ログの公開は別々である。technical reportがあることだけで完全再現可能とはしない。[FM016,061,064,106]

11. 既存8ページとの対応と訂正点

元ファイル 本章の対応 更新の要点
attention.md §2 解説記事から原論文へ。注意の近似とIO改善を分離
transformer.md §3 encoder/decoder/ViT、SSM・MoEへの展開
scaling-laws.md §4 Kaplan以前、Chinchilla、データ制約、多言語、推論コストを追加
multi-modal.md §5 古典的融合、生体データ、VLM、欠測、用語の多義性を区別
rlhf.md §6 パラメータ凍結とPPO損失の誤解を修正。DPO以降を追加
reasoning.md §7 prompt・探索・学習・検証を体系化。2025〜2026追補
gan.md §8 収束保証の条件、評価、現代GANと拡散の統合を補強
llm-implementation.md §9 固定GPU台数の一般化を避け、容量・通信・servingを分解

元ページのQiita、Zenn、note、動画、スライドは学習経路として残す価値があるが、ここでは一次研究の根拠と同列に数えない。追加照合した生体融合の論文と教材は以下に区分した。元ページに記録済みの公開終了・トップページ転送資料は、内容を推測して再構成していない。

公開文献の代表的な系譜を広く集めた一方、retrieval-augmented generation、diffusion/flow全般、音声生成、ロボティクス、3D生成、医療・omicsの個別応用、alignmentの全変種、2026年の全会議論文を独立に網羅した章ではない。これらは本章で示した入口から分野別に追加調査する余地がある。

既存引用の追加照合:生体融合の相反する結果と教材

[FM108] Information content and analysis methods for Multi-Modal High-Throughput Biomedical Dataは、分子・臨床データを含む比較で、modalityを統合しても遺伝子発現の単独モデルを平均的に上回らない場合を示した。これに対し、[FM109] Multimodal deep learning models for early detection of Alzheimer’s disease stageはMRI・SNP・臨床情報を組み合わせ、ADNIの対象分類で融合の改善を報告する。二つは同じデータ・タスク・年代・方法を比較した論文ではない。生体データでは「融合は有効か」という一問より、単独modalityの十分性、被験者の重なり、欠測、外部集団への転移を揃えて比較する必要がある。今回は両者の要旨と書誌を確認した範囲で、臨床的有効性の総合判断はしていない。後者はURLに2020を含むが公開年は2021年である。

元ページの教材も確認した。[FM107] GoodfellowのGANチュートリアルは、GANの目的と他の生成モデルとの関係をまとめる原著者の導入である。arXiv識別子は1701だがSubmittedは2016年12月31日で、NIPS 2016講演をまとめたものなので年を2016とした。[FM110] 福水健次の講義は生成モデルを統計的推論につなぎ、[FM111] DeepSpeedの公式日本語概要は2023年時点の実装機能への入口になる。[FM112] Denny Zhouの推論講義はCoTなどの研究をたどる教材である。講義スライドは原論文とは資料種別を分け、過去の製品機能・性能説明を現在の仕様として使わない。

Spectral NormalizationのOpenReview版は[FM073]、Early Fusionは[FM036]、生体融合総説の出版社版は[FM096]、multimodal meta-learningのNeurIPS版は[FM039]と対応するため重複計上しない。Early Fusionの元OpenReview URLはアクセス制限のため直接の書誌を再取得できず、既存ラベルと同題・同著者の一次PDF/arXivで対応付けたもので、採択の確認とは区別する。

鈴木大慈の2018年講義PDFとCMUのACL 2017 multimodal tutorial PDFは取得上限により内容を今回再確認できなかった。未確認の内容を推測して参考文献の主張に追加していない。

12. 参考文献

表記:本文該当節確認=該当する節・式・記述を一次本文で確認/要旨確認=一次ページの要旨と書誌を確認/書誌確認=存在・題名等を確認した範囲。本文や要旨の確認は実験の追試ではない。会議・雑誌版を未照合の文献はarXiv版として記載する。各項末尾は読む意味を示す。