Series 6 parts World Model

世界モデル vs 強化学習 — 離散タブから連続状態空間への「世界モデル優位性」の崩れ方

離散GridWorldから連続制御タスクまで、世界モデルが強化学習のサンプル効率に与える効果を段階的に検証。優位性は約4.4倍からほぼ消失まで、タスクの性質で大きく変動する

World Model Reinforcement Learning Dyna-Q MBPO
Series 6 parts World Model

分布外入力テストによるワールドモデルの「理解 vs 暗記」判別

Transformer世界モデルが遷移規則を「理解」しているか「暗記」しているかを分布外入力テストで定量的に判別。暗記度≈1.1で汎化を確認、過学習が暗記の最大駆動因と判明

Transformer World Model Memorization Generalization
Series 6 parts World Model

世界モデル4アーキテクチャの比較 — 離散GridWorldから連続制御タスクへ

世界モデルの代表的な4アーキテクチャ(RNN/Transformer/Latent Diffusion/VQ-VAE+Transformer)を、離散GridWorldから連続制御タスクまで5環境で公平比較した結果

World Model Reinforcement Learning Transformer Diffusion