基盤モデル研究の再サーベイ:Attention・Transformer・GANから推論と効率化まで
基盤モデル:何を学習し、どこに計算を使い、どう確かめるか
調査基準日は 2026年10月3日。対象は既存の foundation-models/ 以下の8ページで、重要な前史、主要な方法、関連領域、2025〜2026年の追補を112件の文献・一次資料に結び付けて再構成した(うち講義・公式概要スライド3件)。10月4日以降の文献は対象外であり、「2026年10月末までの全論文」や関連論文の完全列挙を意味しない。検索索引への収録遅延、未公開研究、非英語文献、特定応用分野には未回収がある。
参考文献の確認水準は 本文該当節確認、要旨確認、書誌確認を分けた。「本文該当節確認」は論文全体・全証明・コードの精査や追試を意味しない。要旨しか確認していない文献の性能は著者報告として扱い、未確認の採択情報は補わない。年は原則としてarXivの最初の提出年を使い、公刊年が異なる場合は併記する。R3GANは会議版2024年、arXiv版2025年、Ngiamらはここで照合したICML版2011年を記載した。
1. 全体の研究史と本章の見取り図
| 時期 | 問題の捉え方 | 主な文献 | 次に残った課題 |
|---|---|---|---|
| 2011〜2016 | 複数入力の共有表現、生成分布の学習、翻訳のアラインメント | Ngiam [FM095]、GAN [FM069]、Bahdanau [FM001] | スケール、安定性、長距離依存 |
| 2017〜2020 | Transformer、大規模事前学習、選好からの報酬学習 | Transformer [FM002]、BERT [FM003]、GPT-3 [FM004]、RLHF [FM040–042] | 学習資源配分、評価と望ましさのずれ |
| 2021〜2023 | 言語・視覚の共通表現、計算最適化、instruction tuning | CLIP [FM029]、Chinchilla [FM019]、FlashAttention [FM010]、InstructGPT [FM043]、DPO [FM046] | 推論時コスト、頑健性、報酬誤差 |
| 2024〜2025 | MoE/SSM、RLによる推論、推論時計算、生成モデル間の統合 | Mamba-2 [FM015]、R1 [FM061]、s1 [FM062]、DMD2 [FM084]、APT [FM105] | コストを揃えた能力評価、再現可能な比較 |
| 2026年の確認文献 | ハードウェア協調、選好情報の拡張、形式検証、実運用評価 | FlashAttention-4 [FM013]、rating-DPO [FM052]、Proof-R1 [FM068]、VLMのSeparable Law [FM027] | 発表直後の結果の外部再現と一般化範囲 |
ここでの統合的な読み方は、表現能力、学習信号、計算配分、評価の妥当性を別々に調べることである。Attentionの高速化は学習目標を変えずに使える計算量を変え、RLHFは学習目標を変え、推論探索は固定モデルから得る出力分布を変える。これらを一つの「モデルが賢くなった」という説明だけでまとめると、改善の原因を取り違える。
2. Attention:情報アクセスと実装の二つの研究系譜
問題設定と研究の流れ
Attentionは、問い合わせに応じて他の位置の情報を重み付きで読み出す仕組みである。[FM001] Neural Machine Translation by Jointly Learning to Align and Translateは、文全体を固定長ベクトルに押し込む翻訳モデルの制約に対し、出力ごとに入力の関連部分を参照する方法を示した。
Transformerの基本演算は
\[\operatorname{Attention}(Q,K,V) =\operatorname{softmax}\left(QK^\top/\sqrt{d_k}+M\right)V\]で、$M$ は因果制約やpaddingに対応するマスクである。原論文第3節では、注意の重み付き集約、多頭化、decoderの未来情報を遮断する設計が結び付けられている。注意重みだけを、予測の因果的な説明とみなすことは本章の整理からは支持されない。[FM002] Attention Is All You Need
その後の発展には三つの方向がある。第一に、位置情報をどう表すかという問題に対する[FM006] RoFormer/RoPE。第二に、生成時に保存・読み出しするKey/Valueを減らす[FM007] Multi-Query Attentionと[FM008] Grouped-Query Attention。第三に、長系列の演算・メモリアクセスを抑える方法であり、注意行列を近似する[FM009] Performerと、標準注意のIOを削減する[FM010] FlashAttentionは区別すべきである。
方法の比較
| 方法 | 主な変更対象 | 期待する利点 | 比較で確認する限界 |
|---|---|---|---|
| 標準多頭注意 | 各headに別のQ/K/V | 柔軟な位置間アクセス | 通常のdense注意は系列長に対して二次の演算 |
| MQA / GQA [FM007–008] | KV headの共有 | decode時のKV容量・帯域を削減 | 品質との交換条件。演算すべてが線形になるわけではない |
| Performer [FM009] | softmax kernelの近似 | 線形の時間・空間を狙う | 近似誤差、特徴数、実機での速度 |
| FlashAttention [FM010–011] | tiling、再計算、並列分割 | 注意行列をHBMに展開する負担を削減 | dense演算の二次性そのものは解消しない |
| FlashAttention-3 / 4 [FM012–013] | 世代別GPUの非同期実行・数値演算 | GPU内の律速資源に合わせる | GPU世代、dtype、shape、前後方向で結果が変わる |
[FM011] FlashAttention-2は仕事の分割と非行列積演算を改善し、[FM012] FlashAttention-3はHopperの非同期実行と低精度を扱う。2026年3月5日提出の[FM013] FlashAttention-4はBlackwell向けに進み、行列積性能に対して指数演算やメモリ資源の伸びが小さいという非対称性を扱う。第3.1節で確認した指数関数の実装近似と条件付きrescalingを含むため、「全世代・全dtypeで完全に同じ浮動小数点結果」とは書かない。アルゴリズムとしての注意近似と、有限精度の実装上の数値差も分けて考える。
未解決問題は、長文中の必要な情報を本当に利用できるか、KV圧縮の誤差が長い推論に累積しないか、attention kernelの改善がend-to-endの遅延にどこまで寄与するかである。読む順序は Bahdanau → Transformer第3節 → MQA/GQA → FlashAttention → 実行対象GPUに対応する後続版 がよい。
3. Transformer:アーキテクチャと学習方法を混同しない
TransformerはAttentionそのものではなく、注意・位置情報・FFN・残差接続・正規化を組み合わせる構造である。原論文はencoder–decoder翻訳器だが、[FM003] BERTは双方向の文脈を使う事前学習、[FM004] Language Models are Few-Shot Learnersは大規模な自己回帰生成と文脈内の例示、[FM005] Vision Transformerは画像パッチの系列化を代表する。同じ構造族でも、マスク、目的関数、データ、出力形式が違えば、能力と適した評価も異なる。
| 系統 | 入力間の情報アクセス | 典型的な目的 | 注意する点 |
|---|---|---|---|
| Encoder / BERT [FM003] | 双方向 | 表現・分類・masked予測 | 因果的な逐次生成器とはそのまま互換でない |
| Decoder / GPT-3 [FM004] | 因果マスク | 次token予測 | 学習時の並列化と生成時の逐次性を区別 |
| Encoder–decoder [FM002] | 入力内部・出力内部・相互参照 | 条件付き系列変換 | 入力側と出力側の長さ・計算を別々に数える |
| ViT [FM005] | 画像patch間 | 視覚表現 | 空間的帰納バイアス、データ規模、解像度の条件 |
| 選択的SSM / Mamba [FM014–015] | 圧縮状態を介した再帰 | 長系列の効率化 | 記憶を圧縮することによる情報アクセスの制約 |
| MoE / DeepSeek-V3 [FM016] | tokenごとの専門家選択など | 活性計算量と総容量の分離 | 総パラメータ数、活性パラメータ数、通信量を併記 |
[FM014] Mambaと[FM015] Transformers are SSMsは、長系列の処理を状態空間・再帰計算として設計し直す系譜である。後者の題名を「すべてのsoftmax TransformerとSSMが無条件に同じ」と読むのは適切でなく、論文は構造化行列を通じたSSMと注意の特定の変種の関係を論じる。[FM016] DeepSeek-V3 Technical Reportは、MoE、Multi-head Latent Attention、学習・通信・精度設計を一体で扱う例として読む。報告された学習コストを研究開発・データ取得・試行全体の総コストに置き換えてはいけない。
未解決問題は、どの情報を状態に残すべきか、異なる構造を同一データ・同一計算・同一推論予算でどう比較するかである。読む順序は Transformer → BERT/GPT-3/ViTの目的の違い → Mamba/SSD → 大規模統合モデルのtechnical report。最新モデルの名前の列挙より、変更した要素が何かを追える読み方が再利用しやすい。
4. Scaling Laws:普遍法則ではなく、条件付きの資源配分モデル
何を予測するのか
スケーリング則は、モデル規模 $N$、データ量 $D$、計算量 $C$ と損失・誤差の経験的関係を推定する。[FM017] Deep Learning Scaling is Predictable, Empiricallyは2017年に複数領域のスケーリングを調べており、元メモの「KaplanらがScaling Lawsの最初の論文」という記述は範囲が広すぎる。[FM018] Scaling Laws for Neural Language Modelsは言語モデルの資源配分を定量化した主要論文として位置付ける。
[FM019] Training Compute-Optimal Large Language Modelsの代表的な近似は
\[L(N,D)\simeq E+A N^{-\alpha}+B D^{-\beta}, \qquad C\simeq 6ND\]である。後半はdenseモデルの学習FLOPsの概算であり、長文attentionやMoEの通信まで含む万能なコスト式ではない。Chinchillaの重要点は、固定予算下でパラメータだけでなくtokenにも計算を配ること、学習率scheduleを実際の学習長と合わせて比較することにある。付録Bはschedule不一致を、付録Eは小規模からの外挿の曲率を明示している。したがって特定のtoken/parameter比を、どの用途にも固定された定数として適用しない。
発展の比較
| 研究の問い | 文献 | 得られる判断材料 | 適用上の限界 |
|---|---|---|---|
| 規模・データ・損失はどう結び付くか | Hestness、Kaplan [FM017–018] | 小規模実験による予算見積り | データ・学習recipe・測定範囲に依存 |
| 固定学習計算をどう配るか | Chinchilla [FM019] | NとDの同時選択 | 推論需要を最適化した式ではない |
| 視覚でも同じか | Scaling ViT [FM020] | モデル・データ・画像計算の関係 | 言語の指数をそのまま流用しない |
| なぜべき則が出るか | Bahriら [FM021] | variance/resolution律速の分類 | 理想化モデルの説明と実LLMの予測を区別 |
| データを繰り返せばよいか | Muennighoffら [FM022] | 有効token数の逓減 | unique tokenと反復tokenは同じ価値でない |
| 英語以外にも成立するか | ATLAS [FM026] | 言語間の転移と混合比 | 言語・ドメイン・tokenizerの外挿 |
| 推論まで含めてどう配るか | Bianら [FM025]、VLM則 [FM027] | 形状・latency・視覚解像度 | 実機と用途のコストモデルが必要 |
[FM020] Scaling Vision Transformersと[FM021] Explaining Neural Scaling Lawsは、経験則の他領域への拡張と理論的な機構の分類をつなぐ。データ制約では[FM022] Scaling Data-Constrained Language Modelsが反復の限界を、[FM023] Will we run out of data?が人間由来公開テキストの供給を扱う。後者は条件付き予測であり、「特定年に必ず学習データが枯渇する」という確定事項ではない。
2025年の[FM025] Scaling Inference-Efficient Language Modelsは推論遅延とモデル形状を含め、[FM026] ATLASは多言語転移を対象にする。2026年10月1日提出の[FM027] Not All Error Yields to Scaleは、VLMの言語backboneと視覚token数を分けて評価する最新の要旨確認例である。著者は一部の質問が規模拡張に反応しないことを報告しているが、二つのモデル族と対象benchmarkからVLM全般の限界を確定した研究としては扱わない。
評価にも注意が必要である。[FM024] Are Emergent Abilities of Large Language Models a Mirage?は不連続な指標が「能力の突然の出現」に見える現象を作る場合を示す。これは全ての能力変化が錯覚だという結論ではない。また、[FM100] Extracting Training Data from Large Language Modelsは、大きいモデルの高い平均性能が訓練例の記憶・抽出可能性と両立することを示す。
未解決問題は、データ品質・多言語混合・合成データ・推論需要まで含む外挿精度である。読む順序は Hestness → Kaplan → Chinchillaと付録 → data-constrained → inference-aware / ATLAS。再現実験では、fitに用いた点と外挿評価点を分け、誤差帯と失敗した外挿も残す。
5. マルチモーダル:共有空間、融合、生成、欠測を分ける
研究史
既存メモの生体情報という関心は、画像に質問できるLLMだけに縮めるべきではない。[FM095] Multimodal Deep Learningは音声と映像の共有表現・cross-modal転移を扱い、[FM028] Multimodal Machine Learning: A Survey and Taxonomyは表現、翻訳、アラインメント、融合、co-learningという問題分解を与える。[FM097] Recent Advances and Trends in Multimodal Deep Learningは生理信号も含めた応用・データの入口になる。
大規模化の流れは、画像・テキストの対応から表現を得る[FM029] CLIP、既存の視覚と言語モデルをつなぐ[FM030] Flamingoと[FM031] BLIP-2、視覚instruction dataで応答を学ぶ[FM032] LLaVAへと追える。[FM033] ImageBindは全てのモダリティ対が揃わなくても、画像との対応を利用して共通空間を拡張する方向を示す。
融合方法の比較
| 方法 | 主に共有するもの | 向いている状況 | 調べるべき失敗 |
|---|---|---|---|
| Early fusion | 低レベル入力・初期特徴 | 同期が良く、早い相互作用が有用 | 単位・sampling rateの差、noise、欠測 |
| Intermediate / cross-attention | modality別特徴と共同表現 | 異種encoderを使いたい | 一方のmodalityへの依存、学習バランス |
| Late fusion | 予測・決定 | 独立モデルの統合・欠測への柔軟性 | 低レベルの相互作用を取り逃す |
| 対照学習 [FM029,033] | 表現空間・類似度 | 検索、zero-shot認識 | 関係・数・否定などの構成的理解 |
| LLM接続 [FM030–032] | visual tokenやadapter | 説明・指示応答 | 視覚根拠のない言語的補完 |
| Omni-modal [FM035] | 入出力と推論の統合 | 音声を含む対話 | modality間干渉、同期、streaming遅延 |
[FM036] On the Benefits of Early Fusionは音声・映像のC-LSTMとnoise条件でearly fusionの利点を報告した研究であり、全ての生体データやLLMでearly fusionが最良という証明ではない。[FM096] Multimodal deep learning for biomedical data fusionの分類節を参照すると、featureの融合と最終判断の融合を分ける必要がある。生体データでは患者・施設をまたぐ分割、欠測する理由、時刻同期、外部施設への転移を評価設計に含めるべきである。
2025年には[FM034] Qwen2.5-VLが動的画像解像度と動画の時間表現、[FM035] Qwen3-Omniがテキスト・画像・音声・動画の統合を報告した。本章では設計方向を参照し、technical reportの順位を2026年10月時点の固定されたモデルランキングとして扱わない。[FM037] Deep Multimodal Learning with Missing Modalityは2024年初出、2026年更新の総説で欠測を扱い、[FM038] From Models to Systemsは2026年9月提出の総説として効率化をモデル・アルゴリズム・システムに分ける。
用語の訂正:既存メモの[FM039] Revisit Multimodal Meta-Learningでいうmultimodalは、主としてタスク分布が複数のモードを持つことを指す。同一サンプルの画像・音声・生体信号を融合する問題とは異なる。[FM104] Social-BiGATの将来軌道のmultimodalも、多峰的な将来の可能性という意味を含むため、同じ語だけでセンサ融合に分類しない。
未解決問題は、融合で得た改善が情報の相補性によるのかデータ量増加によるのか、欠測・ノイズ・分布外で残るか、説明文が入力を正しく参照しているかである。読む順序は Ngiam → Baltrušaitis → 生体融合総説 → CLIP → BLIP-2/LLaVA → 欠測総説 → 2025〜2026の統合モデル・効率化。
6. RLHFと選好最適化:人間の比較を何に変換するか
研究史と基本構造
[FM040] Deep reinforcement learning from human preferencesは行動軌道の比較から報酬を学習し、[FM041] Fine-Tuning Language Models from Human Preferencesと[FM042] Learning to summarize from human feedbackは言語生成に展開した。[FM043] InstructGPTはSFT、出力比較からの報酬モデル、PPOによる方策更新を統合する代表例である。[FM044] Proximal Policy Optimization Algorithmsはその最適化器の基礎である。
典型的な目的は
\[\max_\pi\; \mathbb E_{x,y\sim\pi}[r_\phi(x,y)] -\beta\,\mathbb E_x D_{\mathrm{KL}}(\pi(\cdot|x)\|\pi_{\rm ref}(\cdot|x)).\]ここで報酬モデル、学習する方策、参照方策は役割が異なる。元メモの「RLHFでは言語モデルのパラメータを凍結する」は一般的定義として誤りである。LoRAを使う場合は基盤重みを凍結して追加パラメータを学習するが、方策の全パラメータを更新するRLHFもある。PPOの損失もcriticの予測誤差だけではなく、policy objectiveなどを含む。[FM043–044,088]
[FM046] Direct Preference OptimizationはKL正則化と選好モデルの仮定の下で、報酬を方策と参照方策の対数比で再パラメータ化する。論文第4節・式7を確認した範囲では、明示的な報酬モデルとonline RL loopを必要としない形にできることが要点である。有限の選好データでのgeneralizationや、実際の全てのPPO訓練と同じ方策に収束することまで保証する説明ではない。
手法の比較
| 系統 | 必要な信号 | 更新・運用上の特徴 | 主な限界 |
|---|---|---|---|
| PPO型RLHF [FM043–044] | 比較+報酬モデル | 現方策で生成し、報酬を利用 | sampling費用、報酬誤差、KLの選択 |
| Constitutional AI / RLAIF [FM045] | 原則+AI評価 | 人間による個別比較の負担を減らす | 原則・judgeの偏り、人間の価値の完全代替にはならない |
| DPO [FM046] | chosen/rejectedペア | offline分類損失に変換 | 比較分布と生成分布の差、参照方策への依存 |
| IPO [FM047] | 比較選好 | 選好学習の目的を理論から再検討 | 仮定と実際の言語応答の差 |
| KTO [FM048] | 望ましい/望ましくないラベル | ペア以外のfeedbackに対応 | データ比率・utility設計への依存 |
| SimPO [FM049] | 比較ペア | 平均log probabilityとmargin | 長さ・品質・評価モデルの関係 |
| Rating情報付きDPO [FM052] | 比較+評価の差 | feedbackの強さも利用 | ratingの校正と追加annotation費用 |
[FM045] Constitutional AIは、人手ラベルを減らしても原則の選定という人間側の判断が残ることを示す研究として読む。[FM047] IPOの理論論文、[FM048] KTO、[FM049] SimPOは、単にPPOを順番に置き換えた直線的進歩というより、利用できるfeedbackと目的関数の違いへの回答である。
限界の中心はproxyである。[FM050] Scaling Laws for Reward Model Overoptimizationは代理報酬を最適化しすぎることを扱うが、「gold reward」も実験上はモデルであり、人間の真の効用そのものではない。[FM051] Open Problems and Fundamental Limitations of RLHFを使って、annotation、報酬推定、policy最適化、評価の各段階を点検するとよい。2026年の[FM052] DPO with Rating Informationは評価差の利用、[FM053] Reward Modeling for RL-Based LLM Reasoningは推論における報酬の分類を扱う。両者の理論証明全体は今回未精査であり、定理の適用範囲を本章から判断しない。
未解決問題は、少数派を含む選好の不一致、長さ・文体と内容の混同、分布外の報酬誤差、online探索とofflineデータの配分である。読む順序は Christiano → Stiennon/InstructGPT → PPO → DPO第3〜5節 → overoptimization → IPO/KTO/SimPO。実験ではwin rateだけでなく、長さ、真実性、拒否率、分布外性能、費用を併記する。
7. Reasoning:推論文、探索、学習、検証の四層
研究の流れ
[FM054] Chain-of-Thought Promptingは中間ステップの例示を、[FM055] Self-Consistencyは複数の推論経路の集約を、[FM056] Tree of Thoughtsは探索と自己評価を扱う。[FM057] ReActは外部環境への行動を推論と交互に実行する。これらは、同じ基盤モデルから異なる出力を引き出す方法であり、パラメータを学習する方法とは区別する。
[FM058] Let’s Verify Step by Stepは最終回答だけでなく途中の過程を監督する選択肢を示した。[FM059] Scaling LLM Test-Time Compute Optimallyは難度ごとに探索と生成修正の計算配分を変える研究である。平均token数が増えること、正解率が上がること、途中の推論が忠実になることは別々の性質である。
[FM060] DeepSeekMathは数学データとGRPOを、[FM061] DeepSeek-R1はRLによる推論と蒸留を結び付けた。R1-ZeroとR1を区別する。v1第2.2〜2.3節では、前者は事前学習済み基盤モデルに対するRL、後者はcold-start SFTを含む複数段階の訓練である。「事前学習もなく、データも人間の設計も不要」といった説明にはならない。R1の2026年更新要旨だけを読むより、元の技術報告の工程を確認する意味がここにある。
計算を増やす場所の比較
| 方法 | 計算を増やす場所 | 確認すべき評価 |
|---|---|---|
| CoT [FM054] | 逐次の出力token | 単一回答の正確さ、誤った中間step |
| Self-consistency [FM055] | 独立した複数試行 | 投票後accuracyと総sampling費用 |
| ToT / verifier search [FM056,058] | 候補探索・評価器 | 生成と評価を含む総計算・失敗時挙動 |
| RL / GRPO [FM060–061,064] | 学習中のrolloutと更新 | 学習予算、base model、評価汚染、seed |
| s1 [FM062] | 蒸留SFT+生成長制御 | 教師モデルとデータ選択の寄与 |
| Latent recurrence [FM063] | 内部状態の反復 | token数では比較できない推論FLOPs |
| 学習した探索方策 [FM067] | 概念・戦略生成器 | 案内役も含めた計算、転移可能性 |
| 形式検証付きRL [FM068] | 証明義務のチェック | 記号化の妥当性、検証器の対象範囲 |
2025年の[FM062] s1は少量の選別された推論例とbudget forcing、[FM063] A Recurrent Depth Approachは潜在状態の反復、[FM064] DAPOは大規模RLの訓練工程を公開する方向を示した。「例が少ない」ことから、教師モデルの計算や元の事前学習まで含めて学習全体が安価だったとは結論しない。
能力拡張をめぐる論争の読み方
[FM065] Does Reinforcement Learning Really Incentivize Reasoning Capacity…は、大きい $k$ のpass@kから基盤モデルとRL後の正解範囲を比較する。pass@1改善と探索範囲の縮小が両立するという問題提起は重要だが、全ての将来のRL方式が新能力を獲得できないという不可能性定理ではない。大きい $k$ のoracle的な「一つでも正解がある」と、実際に正解を選べる運用も分ける。
[FM066] The Illusion of Thinkingは、複雑度を制御したパズルにおける失敗を報告する。ここから人間の意味での「思考の有無」を直接判定するのではなく、問題表現、出力長、実行・検証方法を固定して一般化を測る研究として位置付ける。これらは著者の実験範囲に限った要旨確認であり、反論文を含む論争全体の収集には余地がある。
2026年9月22日提出の[FM067] Beyond Repeated Samplingは、小さなモデルが概念・方針を提案して大きな回答生成器の探索を助ける方法を報告する。9月29日提出の[FM068] Learning to Prove, Not Just to Answerは自然言語論理の中間推論を形式的に検査し、答えを支える依存関係に報酬を対応させる。いずれも発表直後のpreprintとして要旨と公開日を確認した範囲であり、汎用的な優越を確定した結果ではない。
未解決問題は、汚染を避けた新問題への転移、外部検証できない問題の報酬、長期行動の信用割当、推論文の忠実性、適切な停止判断である。読む順序は CoT → self-consistency → process supervision → test-time scaling → DeepSeekMath/R1 → s1/DAPO → pass@k批判 → 形式検証。
8. GAN:分布学習・ゲームの最適化・評価を分離する
基本問題と歴史
[FM069] Generative Adversarial Networksは、生成器が作る分布を識別器とのゲームを通じてデータ分布に近づける枠組みを導入した。原論文における理想化した関数空間での議論は、有限容量のneural networkを有限データ・勾配法で学習すれば必ず大域的に収束する保証ではない。[FM070] DCGANは畳み込み構造を使う実装上の基準になった。
学習目的と制約の研究では、[FM071] Wasserstein GAN、[FM072] Improved Training of Wasserstein GANs、[FM073] Spectral Normalizationが重要である。距離の選択、勾配への制約、重みの作用素ノルムへの制約は異なる変更であり、「どれもLipschitzにするから同じ」とは整理しない。
安定化と収束性の比較
| 研究 | 改善する対象 | 得られる知見 | 読み違えやすい点 |
|---|---|---|---|
| WGAN [FM071] | 分布間距離 | 学習信号の設計 | 有限stepのゲーム学習の万能収束保証ではない |
| WGAN-GP [FM072] | 入力勾配へのpenalty | clippingに伴う問題への対処 | sampleされた位置のpenaltyと大域制約の差 |
| Spectral Normalization [FM073] | 層の重みの最大特異値 | 識別器の感度の制御 | 表現・最適化・最終品質は別に評価 |
| Numerics / convergence [FM074–075] | 勾配場・更新写像 | 局所安定性と回転的挙動 | Jacobianの符号規約、step size、正則性の仮定 |
| TTUR [FM076] | 二者の時間尺度 | 条件付き局所収束と実用学習 | Adamが全GANで最良という主張ではない |
| R3GAN [FM082] | 相対損失+正則化+backbone | 単純化した現代的baseline | 局所保証を大域保証に読み替えない |
[FM074] The Numerics of GANsと[FM075] Which Training Methods for GANs do actually Converge?を並べると、元メモの「固有値の実部が0/虚部が大きいと収束しない」は強すぎる要約である。更新方式・学習率・分布のregularityに依存し、連続時間の勾配場と離散時間の更新写像も区別する。後者の導入・表1・仮定節では、有限回の識別器更新を使うWGAN系の反例と、適切な仮定下のゼロ中心勾配penaltyの局所収束を確認できる。
画像品質の大規模化は[FM077] BigGAN、制御可能な生成は[FM078] StyleGAN、artifactの改善は[FM079] StyleGAN2、aliasingは[FM080] StyleGAN3という別の問いとして追う。[FM081] GigaGANはテキスト条件付きの大規模化を扱い、[FM082] R3GANは安定化とbackboneの再設計を扱う。R3GANを「2025年初出」とだけ書くと会議版NeurIPS 2024を見落とす。会議PDFとarXivで副題の語順にも差があるため、末尾ではリンク先arXivの題名を採用した。
拡散モデルとの関係と関連応用
[FM083] Denoising Diffusion Probabilistic Modelsは段階的なdenoisingで分布を学ぶ系譜の代表である。生成速度、訓練安定性、被覆、条件追従を同じ条件で比較すべきであり、「GANは終わった」「GANが全面的に復活した」という分類では研究課題が見えない。[FM084] DMD2は蒸留にGAN損失を取り込み、2025年の[FM105] Diffusion Adversarial Post-Trainingは拡散事前学習後の敵対的後学習を動画に展開する。学習目的は組み合わせられる。
元ページで紹介されていた[FM101] StackGAN、[FM102] RGBD-GAN、[FM103] Training language GANs from Scratch、[FM104] Social-BiGATも、それぞれテキスト条件、3D整合性、離散言語、複数の将来軌道という異なる制約を持つ関連系譜として残した。2026年の[FM085] Spintronic DCGANは特殊ハードウェアへの実装例であり、標準的な高解像度画像生成の最良モデルという位置付けではない。
評価
FIDの導入元は[FM076] TTURである。特徴空間での要約統計に基づくFIDだけでは、品質と分布の被覆を独立に診断できないため、[FM098] Improved Precision and Recall Metricを併読する。[FM099] On Aliased Resizing and Surprising Subtleties in GAN Evaluationはリサイズや圧縮による評価差を示す。比較にはdataset、split、解像度、生成枚数、前処理、特徴抽出器、truncation、推論step数を揃える必要がある。mode collapseは「画像が不鮮明」と同義ではない。
未解決問題は、大規模生成での安定性と被覆の同時達成、条件への追従、動画の時間的一貫性、評価器の盲点である。読む順序は 原GAN → WGAN/GP/SN → Numerics/収束性 → TTURと評価 → StyleGAN/GigaGAN → R3GAN/DMD2/APT。最適化研究との接点を調べるなら、画像の見栄えよりもゲームのJacobian、学習率比、regularizationの作用を先に見る。
9. LLM実装:必要GPU台数から、メモリ・通信・ワークロードの分解へ
研究史と基本的な見積り
元メモにはBLOOMやLlama 2のGPU台数・所要時間があるが、これらは当時の設定の事例であって、同じパラメータ数の普遍的必要条件ではない。学習・全パラメータfine-tuning・LoRA・量子化推論では必要な状態が違う。少なくとも次を分ける。
\[M_{\rm peak}\approx M_{\rm weights}+M_{\rm gradients} +M_{\rm optimizer}+M_{\rm activations}+M_{\rm KV}+M_{\rm workspace}.\]全ての項が全処理で同時に同じ形で存在するわけではない。通常の自己回帰推論のKV cacheは、概算でbatch、系列長、層数、KV head数、head次元、要素byte数の積に比例する。これは独自の容量見積りであり、実装・共有・量子化・offloadで変わる。公称VRAMに重みが入ることだけでは実行可能性も速度も保証できない。[FM007–008,087,092]
[FM086] Megatron-LMは層内のモデル並列、[FM087] ZeROは重複する学習状態の分割、[FM088] LoRAは学習する差分の低ランク化、[FM089] QLoRAは量子化した凍結重みを経由したadapter学習を扱う。[FM090] GPTQと[FM091] AWQは学習後量子化の系譜であり、量子化した重みを使うことと学習時の全状態を低bit化することは異なる。
改善対象ごとの比較
| 方法 | 主に減らすもの | 費用・制約として残るもの |
|---|---|---|
| Tensor/model parallel [FM086] | 一台が保持・計算するモデル部分 | collective通信、network topology |
| ZeRO [FM087] | 学習状態の複製 | all-gather / reduce-scatter等の通信 |
| LoRA [FM088] | 学習可能パラメータとoptimizer状態 | 基盤モデル、activation、rank選択 |
| QLoRA [FM089] | 基盤重みの保持量 | 逆伝播、activation、量子化計算の費用 |
| GPTQ / AWQ [FM090–091] | 主に重み容量・帯域 | calibration、kernel support、品質変化 |
| PagedAttention / vLLM [FM092] | KV断片化・複製 | KV総量とスケジューリング |
| Speculative decoding [FM093] | 大モデルの逐次呼出し待ち | draftの費用、受理率、実装の分布保存条件 |
| SGLang [FM094] | prefix再計算・構造化出力処理 | workload依存、cache占有、複数呼出しの依存関係 |
[FM092] PagedAttentionはservingのKV管理、[FM093] Speculative Decodingは小さい提案器と大きい検証器、[FM094] SGLangはプログラム構造とcache再利用を扱う。これらの速度向上を一律に掛け算して見積もることはできない。2026年の[FM106] A Year in LLM Servingは長期の実運用ワークロードを分析する研究として、固定の合成入力だけでは見えないmodel・user・時期ごとの変動を考える入口になる。arXivのSubmitted表示と識別子の月・検索索引の日付には不整合があるため、検索ログに記録し、本文の書誌年は2026年とのみ記載した。
未解決問題は、長い推論と多turnに伴うKV増加、prefill/decodeの異なる律速、tail latency、量子化誤差の推論への影響、機種依存性である。読む順序は メモリの項分解 → Megatron/ZeRO → LoRA/QLoRA → GPTQ/AWQ → PagedAttention/speculative decoding → SGLang/実運用評価。再現記録にはGPU機種・枚数、相互接続、dtype、batch、系列長、モデルrevision、ソフトウェアversion、throughput、TTFT、生成tokenあたりの遅延、peak memoryを残す。
10. 分野横断で重要な研究課題
次の五つは各論文の結論の転記ではなく、本章の文献を横断した整理である。
- 計算をどこに配るか。事前学習、post-training、推論探索、視覚解像度、KV・cache管理を別々に最適化しても、総予算で最適とは限らない。Chinchilla、inference-aware則、test-time scaling、Separable Lawをつなげる。[FM019,025,027,059]
- 改善を代理指標だけで判断しない。RLHFのreward、推論のpass@k、画像生成のFIDは異なるproxyであり、実際に欲しい品質からずれうる。proxy最適化の強さと、独立評価の変化を同時に記録する。[FM050,065,098–099]
- 限界の由来を分ける。データ不足、表現の圧縮、探索不足、検証器の誤差、実機の帯域不足は別の失敗である。Attention、SSM、RLVR、形式検証、システム技法を比較するときに原因を切り分ける。[FM009–015,060,068,092]
- 多言語・生体情報・欠測を周辺問題にしない。英語のtext-only条件で成立する規模則・選好・評価が、そのまま生理信号や施設外データに転用できるとは限らない。[FM026,037,096]
- 公開性にも段階がある。論文、重み、データ、データ処理、training recipe、実装、実行ログの公開は別々である。technical reportがあることだけで完全再現可能とはしない。[FM016,061,064,106]
11. 既存8ページとの対応と訂正点
| 元ファイル | 本章の対応 | 更新の要点 |
|---|---|---|
attention.md |
§2 | 解説記事から原論文へ。注意の近似とIO改善を分離 |
transformer.md |
§3 | encoder/decoder/ViT、SSM・MoEへの展開 |
scaling-laws.md |
§4 | Kaplan以前、Chinchilla、データ制約、多言語、推論コストを追加 |
multi-modal.md |
§5 | 古典的融合、生体データ、VLM、欠測、用語の多義性を区別 |
rlhf.md |
§6 | パラメータ凍結とPPO損失の誤解を修正。DPO以降を追加 |
reasoning.md |
§7 | prompt・探索・学習・検証を体系化。2025〜2026追補 |
gan.md |
§8 | 収束保証の条件、評価、現代GANと拡散の統合を補強 |
llm-implementation.md |
§9 | 固定GPU台数の一般化を避け、容量・通信・servingを分解 |
元ページのQiita、Zenn、note、動画、スライドは学習経路として残す価値があるが、ここでは一次研究の根拠と同列に数えない。追加照合した生体融合の論文と教材は以下に区分した。元ページに記録済みの公開終了・トップページ転送資料は、内容を推測して再構成していない。
公開文献の代表的な系譜を広く集めた一方、retrieval-augmented generation、diffusion/flow全般、音声生成、ロボティクス、3D生成、医療・omicsの個別応用、alignmentの全変種、2026年の全会議論文を独立に網羅した章ではない。これらは本章で示した入口から分野別に追加調査する余地がある。
既存引用の追加照合:生体融合の相反する結果と教材
[FM108] Information content and analysis methods for Multi-Modal High-Throughput Biomedical Dataは、分子・臨床データを含む比較で、modalityを統合しても遺伝子発現の単独モデルを平均的に上回らない場合を示した。これに対し、[FM109] Multimodal deep learning models for early detection of Alzheimer’s disease stageはMRI・SNP・臨床情報を組み合わせ、ADNIの対象分類で融合の改善を報告する。二つは同じデータ・タスク・年代・方法を比較した論文ではない。生体データでは「融合は有効か」という一問より、単独modalityの十分性、被験者の重なり、欠測、外部集団への転移を揃えて比較する必要がある。今回は両者の要旨と書誌を確認した範囲で、臨床的有効性の総合判断はしていない。後者はURLに2020を含むが公開年は2021年である。
元ページの教材も確認した。[FM107] GoodfellowのGANチュートリアルは、GANの目的と他の生成モデルとの関係をまとめる原著者の導入である。arXiv識別子は1701だがSubmittedは2016年12月31日で、NIPS 2016講演をまとめたものなので年を2016とした。[FM110] 福水健次の講義は生成モデルを統計的推論につなぎ、[FM111] DeepSpeedの公式日本語概要は2023年時点の実装機能への入口になる。[FM112] Denny Zhouの推論講義はCoTなどの研究をたどる教材である。講義スライドは原論文とは資料種別を分け、過去の製品機能・性能説明を現在の仕様として使わない。
Spectral NormalizationのOpenReview版は[FM073]、Early Fusionは[FM036]、生体融合総説の出版社版は[FM096]、multimodal meta-learningのNeurIPS版は[FM039]と対応するため重複計上しない。Early Fusionの元OpenReview URLはアクセス制限のため直接の書誌を再取得できず、既存ラベルと同題・同著者の一次PDF/arXivで対応付けたもので、採択の確認とは区別する。
鈴木大慈の2018年講義PDFとCMUのACL 2017 multimodal tutorial PDFは取得上限により内容を今回再確認できなかった。未確認の内容を推測して参考文献の主張に追加していない。
12. 参考文献
表記:本文該当節確認=該当する節・式・記述を一次本文で確認/要旨確認=一次ページの要旨と書誌を確認/書誌確認=存在・題名等を確認した範囲。本文や要旨の確認は実験の追試ではない。会議・雑誌版を未照合の文献はarXiv版として記載する。各項末尾は読む意味を示す。
-
[FM001] Dzmitry Bahdanau ほか(2014). Neural Machine Translation by Jointly Learning to Align and Translate. ICLR 2015。要旨確認。固定長ボトルネックから学習可能アラインメントへ。
-
[FM002] Ashish Vaswani ほか(2017). Attention Is All You Need. NeurIPS 2017。本文該当節確認。自己注意・マスク・FFN・残差の基本構造。
-
[FM003] Jacob Devlin ほか(2018). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv preprint(会議版未再照合)。要旨確認。双方向事前学習と転移。
-
[FM004] Tom B. Brown ほか(2020). Language Models are Few-Shot Learners. NeurIPS 2020。要旨確認。大規模自己回帰モデルの文脈内学習。
-
[FM005] Alexey Dosovitskiy ほか(2020). An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. ICLR 2021。要旨確認。画像パッチへのTransformer適用。
-
[FM006] Jianlin Su ほか(2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv preprint(出版版未再照合)。要旨確認。回転位置埋め込み。
-
[FM007] Noam Shazeer(2019). Fast Transformer Decoding: One Write-Head is All You Need. arXiv preprint。要旨確認。KV共有によるdecode効率。
-
[FM008] Joshua Ainslie ほか(2023). GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints. EMNLP 2023。要旨確認。MQAとMHAの中間設計。
-
[FM009] Krzysztof Choromanski ほか(2020). Rethinking Attention with Performers. ICLR 2021。要旨確認。ランダム特徴による注意近似。
-
[FM010] Tri Dao ほか(2022). FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness. arXiv preprint(会議版未再照合)。要旨確認。厳密注意のIO削減。
-
[FM011] Tri Dao(2023). FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning. arXiv preprint(会議版未再照合)。要旨確認。GPU並列化と仕事分割。
-
[FM012] Jay Shah ほか(2024). FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision. arXiv preprint。要旨確認。Hopper非同期計算と低精度。
-
[FM013] Ted Zadouri ほか(2026). FlashAttention-4: Algorithm and Kernel Pipelining Co-Design for Asymmetric Hardware Scaling. arXiv preprint。本文該当節確認。Blackwellの非対称資源拡張に合わせたカーネル。
-
[FM014] Albert Gu・Tri Dao(2023). Mamba: Linear-Time Sequence Modeling with Selective State Spaces. arXiv preprint(会議版未再照合)。要旨確認。選択的状態空間モデル。
-
[FM015] Tri Dao・Albert Gu(2024). Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024。要旨確認。注意とSSMの構造的双対性。
-
[FM016] DeepSeek-AI ほか(2024). DeepSeek-V3 Technical Report. arXiv technical report。要旨確認。MoE・MLA・低精度学習の統合。
-
[FM017] Joel Hestness ほか(2017). Deep Learning Scaling is Predictable, Empirically. arXiv preprint。要旨確認。Kaplan以前の経験的スケーリング研究。
-
[FM018] Jared Kaplan ほか(2020). Scaling Laws for Neural Language Models. arXiv preprint。要旨確認。モデル・データ・計算量と損失の関係。
-
[FM019] Jordan Hoffmann ほか(2022). Training Compute-Optimal Large Language Models. arXiv preprint(会議版未再照合)。本文該当節確認。モデルサイズと学習トークンの配分。
-
[FM020] Xiaohua Zhai ほか(2021). Scaling Vision Transformers. CVPR 2022。要旨確認。ViTでの規模・データ・計算の関係。
-
[FM021] Yasaman Bahri ほか(2021). Explaining Neural Scaling Laws. PNAS 2024。要旨確認。variance/resolution律速の理論的分類。
-
[FM022] Niklas Muennighoff ほか(2023). Scaling Data-Constrained Language Models. arXiv preprint(会議版未再照合)。要旨確認。有限データの反復学習。
-
[FM023] Pablo Villalobos ほか(2022). Will we run out of data? Limits of LLM scaling based on human-generated data. arXiv preprint(会議版未再照合)。要旨確認。人間由来データ供給の条件付き予測。
-
[FM024] Rylan Schaeffer ほか(2023). Are Emergent Abilities of Large Language Models a Mirage?. arXiv preprint(会議版未再照合)。要旨確認。評価指標が作る見かけの創発。
-
[FM025] Song Bian ほか(2025). Scaling Inference-Efficient Language Models. ICML 2025。要旨確認。形状と推論レイテンシを含める設計。
-
[FM026] Shayne Longpre ほか(2025). ATLAS: Adaptive Transfer Scaling Laws for Multilingual Pretraining, Finetuning, and Decoding the Curse of Multilinguality. ICLR 2026(著者公式発表で確認)。要旨確認。多言語間の転移を含む規模則。
-
[FM027] Xinye Zhao ほか(2026). Not All Error Yields to Scale: Where Scaling Stops in Vision-Language Inference. arXiv preprint。要旨確認。VLMのモデル規模と視覚解像度の配分。
-
[FM028] Tadas Baltrušaitis ほか(2017). Multimodal Machine Learning: A Survey and Taxonomy. arXiv preprint(雑誌版未再照合)。要旨確認。表現・翻訳・整列・融合・co-learningの分類。
-
[FM029] Alec Radford ほか(2021). Learning Transferable Visual Models From Natural Language Supervision. arXiv preprint(会議版未再照合)。要旨確認。画像テキスト対照学習。
-
[FM030] Jean-Baptiste Alayrac ほか(2022). Flamingo: a Visual Language Model for Few-Shot Learning. NeurIPS 2022。要旨確認。画像と文章の交互入力とfew-shot学習。
-
[FM031] Junnan Li ほか(2023). BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. arXiv preprint(会議版未再照合)。要旨確認。凍結モデル間をQ-Formerで接続。
-
[FM032] Haotian Liu ほか(2023). Visual Instruction Tuning. NeurIPS 2023。要旨確認。視覚instruction tuning。
-
[FM033] Rohit Girdhar ほか(2023). ImageBind: One Embedding Space To Bind Them All. CVPR 2023。要旨確認。画像を軸に六モダリティを整列。
-
[FM034] Shuai Bai ほか(2025). Qwen2.5-VL Technical Report. arXiv technical report。要旨確認。動的解像度と時間表現。
-
[FM035] Jin Xu ほか(2025). Qwen3-Omni Technical Report. arXiv technical report。要旨確認。テキスト・画像・音声・動画の統合。
-
[FM036] George Barnum ほか(2020). On the Benefits of Early Fusion in Multimodal Representation Learning. arXiv preprint(ICLR採択は未確認)。要旨確認。early fusionのタスク依存な利点。
-
[FM037] Renjie Wu ほか(2024). Deep Multimodal Learning with Missing Modality: A Survey. TMLR(arXiv更新版で採択記載、2026)。要旨確認。欠落モダリティの頑健性。
-
[FM038] Pan Wang ほか(2026). From Models to Systems: A Comprehensive Survey of Efficient Multimodal Learning. TMLR 2026(arXiv journal reference)。要旨確認。モデル・アルゴリズム・システムの効率整理。
-
[FM039] Milad Abdollahzadeh ほか(2021). Revisit Multimodal Meta-Learning through the Lens of Multi-Task Learning. NeurIPS 2021。要旨確認。タスク分布の多峰性とセンサ融合の用語を区別。
-
[FM040] Paul Christiano ほか(2017). Deep reinforcement learning from human preferences. arXiv preprint(会議版未再照合)。要旨確認。人間の比較から報酬を学習。
-
[FM041] Daniel M. Ziegler ほか(2019). Fine-Tuning Language Models from Human Preferences. arXiv preprint。要旨確認。言語生成への選好学習の導入。
-
[FM042] Nisan Stiennon ほか(2020). Learning to summarize from human feedback. NeurIPS 2020。要旨確認。要約で人間選好を最適化。
-
[FM043] Long Ouyang ほか(2022). Training language models to follow instructions with human feedback. arXiv preprint(会議版未再照合)。本文該当節確認。SFT・報酬モデル・PPOの実用的統合。
-
[FM044] John Schulman ほか(2017). Proximal Policy Optimization Algorithms. arXiv preprint。要旨確認。clipped policy gradientの基礎。
-
[FM045] Yuntao Bai ほか(2022). Constitutional AI: Harmlessness from AI Feedback. arXiv preprint。要旨確認。憲法原則とAIフィードバック。
-
[FM046] Rafael Rafailov ほか(2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. arXiv preprint(会議版未再照合)。本文該当節確認。KL正則化RLHFから直接選好損失を導出。
-
[FM047] Mohammad Gheshlaghi Azar ほか(2023). A General Theoretical Paradigm to Understand Learning from Human Preferences. arXiv preprint(会議版未再照合)。要旨確認。選好学習の理論とIPO。
-
[FM048] Kawin Ethayarajh ほか(2024). KTO: Model Alignment as Prospect Theoretic Optimization. ICML 2024。要旨確認。ペア不要の望ましさラベル学習。
-
[FM049] Yu Meng ほか(2024). SimPO: Simple Preference Optimization with a Reference-Free Reward. NeurIPS 2024。要旨確認。参照モデル不要の選好学習。
-
[FM050] Leo Gao ほか(2022). Scaling Laws for Reward Model Overoptimization. arXiv preprint(会議版未再照合)。要旨確認。代理報酬の過剰最適化。
-
[FM051] Stephen Casper ほか(2023). Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback. arXiv preprint。要旨確認。フィードバック・報酬・方策の限界の分類。
-
[FM052] Luca Viano ほか(2026). Direct Preference Optimization with Rating Information: Practical Algorithms and Provable Gains. arXiv preprint。要旨確認。選好の向きに加えて評価差を利用。
-
[FM053] Pei-Chi Pan ほか(2026). Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation. TMLR 2026(arXiv採択記載)。要旨確認。推論学習における報酬設計の総説。
-
[FM054] Jason Wei ほか(2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv preprint(会議版未再照合)。要旨確認。中間ステップの例示による推論誘導。
-
[FM055] Xuezhi Wang ほか(2022). Self-Consistency Improves Chain of Thought Reasoning in Language Models. ICLR 2023。要旨確認。複数の推論経路と回答投票。
-
[FM056] Shunyu Yao ほか(2023). Tree of Thoughts: Deliberate Problem Solving with Large Language Models. NeurIPS 2023。要旨確認。明示的探索と自己評価。
-
[FM057] Shunyu Yao ほか(2022). ReAct: Synergizing Reasoning and Acting in Language Models. arXiv preprint(会議版未再照合)。要旨確認。推論と環境操作の交互実行。
-
[FM058] Hunter Lightman ほか(2023). Let’s Verify Step by Step. arXiv preprint(会議版未再照合)。要旨確認。過程監督と最終結果監督の比較。
-
[FM059] Charlie Snell ほか(2024). Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. arXiv preprint(会議版未再照合)。要旨確認。問題難度に応じる推論計算配分。
-
[FM060] Zhihong Shao ほか(2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv preprint。要旨確認。数学データとGRPO。
-
[FM061] DeepSeek-AI ほか(2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. Nature 645, 633–638 (2025); 技術報告v1を本文確認。本文該当節確認。R1-Zeroと多段階R1・蒸留の区別。
-
[FM062] Niklas Muennighoff ほか(2025). s1: Simple test-time scaling. EMNLP 2025。要旨確認。少量SFTとbudget forcing。
-
[FM063] Jonas Geiping ほか(2025). Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach. arXiv preprint。要旨確認。潜在状態の反復による推論計算拡張。
-
[FM064] Qiying Yu ほか(2025). DAPO: An Open-Source LLM Reinforcement Learning System at Scale. arXiv preprint。要旨確認。大規模RLの実装要因と再現性。
-
[FM065] Yang Yue ほか(2025). Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?. NeurIPS 2025。要旨確認。pass@kと基盤モデルの探索範囲の議論。
-
[FM066] Parshin Shojaee ほか(2025). The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity. NeurIPS 2025。要旨確認。制御パズルで推論の複雑度依存を測定。
-
[FM067] Ismail Labiad ほか(2026). Beyond Repeated Sampling: Learning Search Policies for LLM Reasoning. arXiv preprint。要旨確認。大きなモデルを案内する小さな探索方策。
-
[FM068] Qili Zhang ほか(2026). Learning to Prove, Not Just to Answer: Reinforcement Learning from Formal Verification for Natural-Language Logical Reasoning. arXiv preprint。要旨確認。自然言語論理の過程を形式検証。
-
[FM069] Ian J. Goodfellow ほか(2014). Generative Adversarial Networks. arXiv preprint(会議題名はGenerative Adversarial Nets)。要旨確認。生成器と識別器による分布学習。
-
[FM070] Alec Radford ほか(2015). Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks. arXiv preprint(会議版未再照合)。要旨確認。畳み込みGANの設計。
-
[FM071] Martin Arjovsky ほか(2017). Wasserstein GAN. arXiv preprint(会議版未再照合)。要旨確認。Wasserstein距離による学習目的。
-
[FM072] Ishaan Gulrajani ほか(2017). Improved Training of Wasserstein GANs. NeurIPS 2017。要旨確認。weight clippingから勾配正則化へ。
-
[FM073] Takeru Miyato ほか(2018). Spectral Normalization for Generative Adversarial Networks. ICLR 2018。要旨確認。識別器のスペクトル正規化。
-
[FM074] Lars Mescheder ほか(2017). The Numerics of GANs. arXiv preprint(会議版未再照合)。要旨確認。ゲームの勾配場と局所安定性。
-
[FM075] Lars Mescheder ほか(2018). Which Training Methods for GANs do actually Converge?. ICML 2018。本文該当節確認。収束保証の仮定と反例。
-
[FM076] Martin Heusel ほか(2017). GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium. NeurIPS 2017。要旨確認。二時間尺度学習とFID。
-
[FM077] Andrew Brock ほか(2018). Large Scale GAN Training for High Fidelity Natural Image Synthesis. arXiv preprint(会議版未再照合)。要旨確認。GANの大規模化と品質・多様性。
-
[FM078] Tero Karras ほか(2018). A Style-Based Generator Architecture for Generative Adversarial Networks. CVPR 2019。要旨確認。スタイル空間と生成制御。
-
[FM079] Tero Karras ほか(2019). Analyzing and Improving the Image Quality of StyleGAN. arXiv preprint(会議版未再照合)。要旨確認。StyleGANのアーティファクト改善。
-
[FM080] Tero Karras ほか(2021). Alias-Free Generative Adversarial Networks. arXiv preprint(会議版未再照合)。要旨確認。aliasingと変換同変性。
-
[FM081] Minguk Kang ほか(2023). Scaling up GANs for Text-to-Image Synthesis. CVPR 2023。要旨確認。テキスト条件付きGANの大規模化。
-
[FM082] Yiwen Huang ほか(2024). The GAN is dead; long live the GAN! A Modern GAN Baseline. NeurIPS 2024; arXiv掲載は2025。要旨確認。相対損失とゼロ中心勾配正則化による現代的ベースライン。
-
[FM083] Jonathan Ho ほか(2020). Denoising Diffusion Probabilistic Models. arXiv preprint(会議版未再照合)。要旨確認。拡散モデルとの目的関数・生成手順の比較。
-
[FM084] Tianwei Yin ほか(2024). Improved Distribution Matching Distillation for Fast Image Synthesis. arXiv preprint(会議版未再照合)。要旨確認。GAN損失と拡散蒸留を接続。
-
[FM085] Saumya Gupta ほか(2026). Image Synthesis Using Spintronic Deep Convolutional Generative Adversarial Network. arXiv preprint。要旨確認。2026年の特殊ハードウェア実装の例。
-
[FM086] Mohammad Shoeybi ほか(2019). Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism. arXiv preprint。要旨確認。層内モデル並列。
-
[FM087] Samyam Rajbhandari ほか(2019). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv preprint(会議版未再照合)。要旨確認。optimizer・gradient・parameterの分割。
-
[FM088] Edward J. Hu ほか(2021). LoRA: Low-Rank Adaptation of Large Language Models. arXiv preprint(会議版未再照合)。要旨確認。低ランク差分による適応。
-
[FM089] Tim Dettmers ほか(2023). QLoRA: Efficient Finetuning of Quantized LLMs. arXiv preprint(会議版未再照合)。要旨確認。4bit凍結重みとLoRA学習。
-
[FM090] Elias Frantar ほか(2022). GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers. ICLR 2023。要旨確認。二次情報を使う学習後量子化。
-
[FM091] Ji Lin ほか(2023). AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration. MLSys 2024。要旨確認。activationに基づく重要重み保護。
-
[FM092] Woosuk Kwon ほか(2023). Efficient Memory Management for Large Language Model Serving with PagedAttention. arXiv preprint(会議版未再照合)。要旨確認。KVキャッシュのページ管理。
-
[FM093] Yaniv Leviathan ほか(2022). Fast Inference from Transformers via Speculative Decoding. ICML 2023。要旨確認。分布保存型speculative decoding。
-
[FM094] Lianmin Zheng ほか(2023). SGLang: Efficient Execution of Structured Language Model Programs. arXiv preprint(会議版未再照合)。要旨確認。構造化生成とprefix cache共有。
-
[FM095] Jiquan Ngiam ほか(2011). Multimodal Deep Learning. ICML 2011。書誌確認。音声・映像の共有表現とcross-modal転移。
-
[FM096] Sören Richard Stahlschmidt ほか(2022). Multimodal deep learning for biomedical data fusion: a review. Briefings in Bioinformatics 23(2), bbab569 (2022)。本文該当節確認。生体データ融合の分類と評価設計。
-
[FM097] Jabeen Summaira ほか(2021). Recent Advances and Trends in Multimodal Deep Learning: A Review. arXiv preprint。要旨確認。生理信号を含む応用・データセットの概観。
-
[FM098] Tuomas Kynkäänniemi ほか(2019). Improved Precision and Recall Metric for Assessing Generative Models. NeurIPS 2019。要旨確認。品質と被覆を別々に評価。
-
[FM099] Gaurav Parmar ほか(2021). On Aliased Resizing and Surprising Subtleties in GAN Evaluation. CVPR 2022。要旨確認。FIDの前処理依存性。
-
[FM100] Nicholas Carlini ほか(2020). Extracting Training Data from Large Language Models. arXiv preprint(会議版未再照合)。要旨確認。記憶・抽出可能性と汎化の区別。
-
[FM101] Han Zhang ほか(2016). StackGAN: Text to Photo-realistic Image Synthesis with Stacked Generative Adversarial Networks. ICCV 2017。要旨確認。多段階のテキスト条件付き生成。
-
[FM102] Atsuhiro Noguchi ほか(2019). RGBD-GAN: Unsupervised 3D Representation Learning From Natural Image Datasets via RGBD Image Synthesis. ICLR 2020。要旨確認。2D画像から3D整合性を学習。
-
[FM103] Cyprien de Masson d’Autume ほか(2019). Training language GANs from Scratch. arXiv preprint(会議版未再照合)。要旨確認。離散言語GANの学習と多様性。
-
[FM104] Vineet Kosaraju ほか(2019). Social-BiGAT: Multimodal Trajectory Forecasting using Bicycle-GAN and Graph Attention Networks. arXiv preprint(会議版未再照合)。要旨確認。社会的相互作用と多峰的軌道予測。
-
[FM105] Shanchuan Lin ほか(2025). Diffusion Adversarial Post-Training for One-Step Video Generation. ICML 2025。要旨確認。拡散事前学習と敵対的後学習による動画生成。
-
[FM106] William Nixon ほか(2026). A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing. arXiv preprint。要旨確認。長期実運用トレースに基づくserving評価。
-
[FM107] Ian Goodfellow(2016). NIPS 2016 Tutorial: Generative Adversarial Networks. NIPS 2016 tutorial report; arXiv識別子は1701、Submittedは2016-12-31。要旨確認。GANの目的・生成モデル間の比較を原著者のチュートリアルから学ぶ。
-
[FM108] Bisakha Ray ほか(2014). Information content and analysis methods for Multi-Modal High-Throughput Biomedical Data. Scientific Reports 4, 4411 (2014)。要旨確認。複数modalityを足しても予測が改善するとは限らないという比較設計。
-
[FM109] Janani Venugopalan ほか(2021). Multimodal deep learning models for early detection of Alzheimer’s disease stage. Scientific Reports 11, 3254 (2021)。要旨確認。MRI・遺伝・臨床データの融合をADNI上で評価した具体例。
-
[FM110] 福水健次(2019). 深層生成モデルによる統計的推論. 統計数理研究所創立75周年記念チュートリアル講演、2019-06-05。一次資料確認(表紙・概要部分)。GANを分布比較・Bayes推論とつなぐ講義資料。
-
[FM111] Microsoft DeepSpeed Team(2023). DeepSpeed: 深層学習の訓練と推論を劇的に高速化するフレームワーク. 公式日本語概要スライド、2023-06-07。一次資料確認(表紙・概要部分)。ZeRO等の研究からフレームワークの機能へ進む導入。
-
[FM112] Denny Zhou(2024). LLM Reasoning: Key Ideas and Limitations. 著者公開講義スライド(表紙のBerkeley講演年2024を採用)。一次資料確認(表紙・概要部分)。CoT・self-consistencyなどの研究を著者の講義でたどる。