1. 背景と問題意識

1.1 研究の背景

Transformer ベースの世界モデルは、環境のダイナミクスを学習し、実環境との相互作用なしに「想像」(mental simulation)を行うことができる。しかし、モデルが環境のルールを真に理解しているのか、あるいは統計的パターンを模倣しているだけなのかは、予測精度だけでは判別できない。

近年の Mechanistic Interpretability 研究では、小規模モデルの内部表現を完全に解明する試みが進んでいる。Othello-GPT(Li et al., 2023)はゲームの合法手を予測するモデルの内部にボードの空間表現が自発的に形成されることを示し、Toy Models of Superposition(Elhage et al., 2022)は低次元モデルの表現構造を理論的に分析した。

1.2 研究目的

本研究の目的は以下の点に集約される:

  1. 空間構造の検証: 世界モデルの内部表現にグリッドの空間的「地図」が存在するかを検証する
  2. 遷移ルールの表現: Transformer が環境の遷移関数をどのように内部に符号化しているかを解明する
  3. 機能特化の同定: 個々のニューロンが特定の環境概念(壁、方向、ゴール)に特化しているかを検証する
  4. 因果的寄与の確認: 同定された機能特化ニューロンが予測に因果的に寄与しているかを介入実験で検証する

1.3 関連研究との位置づけ

研究 対象 規模 本研究との違い
Othello-GPT (Li et al., 2023) ゲームの合法手予測 中規模 盤面の空間表現を発見。本研究はダイナミクス予測に焦点
Toy Models of Superposition (Elhage et al., 2022) 合成データの表現学習 極小 理論的分析が中心。本研究は実用的な世界モデルを対象
Progress Measures for Grokking (Nanda et al., 2023) モジュラ加算 小規模 学習過程の内部変化に注目。本研究は学習済みモデルの静的解析

本研究の強みは、入力空間が 100通りと完全に列挙可能であり、かつ真の遷移関数が既知であるため、「正しい表現」との比較が可能な点にある。