In Silico

Physical AI

生成世界モデルの物理一貫性——独立ベンチ3本の診断

2026/7/7 (更新: 2026/8/16)

目次
【背景】本物そっくりの動画を生む世界モデルへの期待Physical AI のシミュレータとして【問い】その絵は、使えるだけ物理に接地しているか見た目ではなく物理で検める
※概念図(背景→問い):そっくりな絵を、正しい世界と早合点しない
要点

きれいな動画であることは、使えるシミュレータであることを保証しない——2026年前半に相次いだ独立のベンチマーク3本が指し示すのは、この一点だ。本物と見分けにくい動画を生む生成『世界モデル』は、Physical AI——ロボット学習や自律運転——の訓練用シミュレータとして売り込まれている。だが各ベンチの報告では、カメラが見ていない間は世界が進まず、視線を戻すと古い状態のまま再開する1。同じ物理イベントでも視点や見た目を変えると予測が揺れ、因果でなく見た目のパターンを手掛かりにしている兆候がある2。しかも PhyGround の著者らは、普通の画質指標が物理法則の破れを捉えるようには設計されていないと指摘して物理そのものを採点する評価を作り、それで8モデルを人手評価するとどのモデルも総合で 3.3/5 に届かなかったと報告している3三チームが、見ていない間の状態保持・視点不変性・物理法則の遵守という別々の入口から、いずれもモデル側の弱点を報告した——単発の主張より重く受け取るべき方向の一致だ。

「世界モデル」は何を約束したのか

生成動画モデルの進歩で、数秒の映像なら本物と見分けるのが難しくなった。ここから自然な期待が生まれる——その映像が物理的に正しいなら、現実の代わりに使える。ロボットを実機で動かす前に、モデルが作る「世界」の中で行動を試し、安く大量に学ばせる。これが世界モデル(world model)をシミュレータとして使う構想だ。

だが「シミュレータ」を名乗るには、見た目の良さだけでは足りない。見ていない間も世界は進み、視点が変わっても同じ物理を返し、物理法則を破らない——広い世界を長時間まるごと任せる用途では、この三つが問われる。2026年前半、複数の独立チームが、まさにこの三つを別々のやり方で突いた——三つ目は「その破れを測れているか」という評価の側の問題から入り、物理専用の物差しを作って測り直した——そしてそこでもモデル側の不足が出た。以下は各チームがそれぞれのベンチで得たと報告する結果であり、まだ査読前・独立再現前のプレプリントだ。その上で読むと、報告はどれも現状のモデル、あるいはその測り方に厳しい。

見ていない間、世界が進まない

もっとも構造的な指摘は、Lu らの WRBench から来た1。彼らは23のモデルが生む9,600本の動画を、四つの制御方式にわたって調べたという。問うたのは単純な問いだ——カメラが対象から離れ、また戻ってきたとき、その間に起きるはずの変化は進んでいるか。ただしこの「戻りテスト」を採点できたのは、対象が判定可能な形で視野に戻った 2,073本(全体の21.6%)に限られる。裏を返せば残る約8割では、モデルは対象を判定可能な形で戻すことすらできなかった——原論文は「戻れない」と「戻ったが状態が古い」を別の失敗として分けて数えており、片方の分母をもう片方に使うことを表で明示的に禁じている1

彼らの答えは「進んでいない」だった。戻りテストが成立したその2,073本では、モデルは見ていない場所の出来事を凍結していた、と著者らは報告する。焼けているはずのもの、動いているはずのものが、視線を外した瞬間に止まり、戻ると中断した状態のまま再開する。研究者はこれを、世界を捉える「持続的な状態の核(persistent state core)」の欠如と呼ぶ。彼らの言い方を借りれば、モデルが持っているのは世界ではなく、追尾ショット1

著者らが強調するのは、この欠陥が画質を上げても、制御を精密にしても、幾何の事前知識を足しても、パラメータを増やしても消えなかった点だ。それどころか同系列の Wan を 1.3B から 14B へスケールさせると、再観測時の状態一致は 0.66 から 0.62 へ下がったという1。著者らはここから「通常の動画教師ありのスケーリングでは世界状態の進行は得られない、設計で入れるしかない」と結論する。彼らの診断では、どのアーキテクチャも「シーンがどこにあったか」を再描画するための記憶は持つが、隠れている間に何が変わったかを書き込む器官を持たない。未観測の帰結を教える公開の学習信号も存在しない、とも指摘している。もっとも、これが作者と利害を共有しない第三者に再現されるかは、まだ確かめられていない。少なくともこの診断が届く範囲では、世界を「保つ」仕組みが働いていない。

視点を変えると、予測が揺れる

別の角度から同じ穴を突いたのが、Begiristain らの CRONOS2。彼らは、同じ物理イベント(衝突・落下・遮蔽)を保ったまま、視点・背景・物体の見た目・物体のカテゴリだけを差し替え、予測がどう変わるかを測った。フォトリアルな Unreal Engine で作った高精細な映像で、条件を一つずつ動かす介入実験である。ただし著者ら自身は、合成映像であることを制限の筆頭に挙げ、この結果は「制御された物理予測についての診断的証拠であって、実写での性能を直接推定するものではない」と読み方まで限定している2

物理が同じなら、予測も安定していなければならない。ところが彼らの報告では、見た目・環境、とりわけ視点を変えると、予測の質が揺れた2。同じ落下でも、カメラの位置が変わると崩れやすい。著者らはこれを、モデルが落下の因果構造を学んだのではなく、見た目のパターンを手掛かりにしている兆候と解釈する。表面の相関を、物理の理解と取り違えている——というのが彼らの読みだ。

絶対水準も低い。剛体の基本的な物理を含む短いクリップを、全ての評価指標を同時に満たす形で生成できた割合は、最良のモデルでも22%、大半のモデルは15%未満だったという2。しかも Cosmos2.5 を 2B から 14B へ上げると、この成功率は(V2V 設定で)0.22 から 0.14 へ落ちた——WRBench が Wan で見たのと同じ向きである(ただし著者らは「単一のモデル系統・単一のスケール刻みの観測だ」と自ら留保している)2。別チームが別のモデル系列で同じ向きを見たという点は、三本の重なりの中でもっとも鋭い。

物理を採点する物差しを作っても、どのモデルも届かない

ではなぜ、こうした破れが見過ごされうるのか。Lin らの PhyGround は、まず評価の側の問題を突く3。彼らが挙げるのは、動画生成の定番指標——FVD のように分布の近さを測るもの、SSIM や PSNR のように画素レベルの忠実度を測るもの、CLIP のように意味的な整合を測るもの——が、物理法則の破れを検出するようには設計されていないという点だ。見た目が良ければ高得点が出るので、物理の誤りは数字に現れにくい、という主張である。

PhyGround は、力学・流体・光学にまたがる13の物理法則の分類に沿って、物理そのものを採点する物差しを提案する。しかも汎用の大規模モデルを審判にするのではなく、物理に特化した審判を用意した。ずれの測り方は原論文が式で定めていて、人間の注釈者による評価平均からの隔たり(審判の平均と人間の平均の差の絶対値を人間の平均で割り、各次元・各法則でマクロ平均したうえ、一般次元と物理を等重みで合成した総合値)である。それが汎用モデル(Gemini-3.1-Pro)を審判にした場合は 16.6%、物理に特化した審判(PhyJudge-9B)では 3.3% だった3。人間の判断に寄せるには物理を分かった物差しがいる、というのが彼らの主張だ。そしてその採点軸で8モデル・2,000本を人手評価すると「どのモデルも総合 3.3/5(66%)を超えない」——最上位の Wan2.2-27B-A14B と Veo-3.1 が並んで 3.28、以下 3.10・2.91・2.69・2.63 と続き、剛体力学の領域でもこの水準に届いたモデルは無い3。指標の不備を指摘した論文が、自ら作った採点軸でモデル側の不足まで測っている。

この報告をどう割り引くか

三つは方向がそろっているが、鵜呑みにする前に押さえるべき留保がある。いずれも2026年前半の査読前プレプリントで、しかも各ベンチはその「穴」を示すために作者自身が設計した指標だ。射程も広くない——CRONOS が測ったのは重みが公開された4系統(Cosmos2.5・CogVideoX1.5・MAGI-1・Wan2.2)で、著者らは Veo・Sora・Kling のような商用クローズド系を評価対象外にしたと明記し、「現行のモデル地形のカバレッジを制限する」と自ら断っている2。穴を探すよう作られた物差しが穴を見つけるのは、驚くにあたらない。だから「世界モデルは物理を学べない」と一般化するのは、まだ早い。

では何が確度を上げるのか。二つある。

逆に言えば、三つの独立チームが視点・時間・評価という別々の入口から、いずれも「見た目の良さは物理の正しさを意味しない」という同じ方向を指した一致そのものは、単発の主張より重く扱ってよい(三本とも、入口は違うがモデル側の不足に行き着いている)。確定事実としてではなく、筋の良い仮説として。

一方で、「使える」側の報告もある

公平を期すと、生成世界モデルが Physical AI ですでに実用の役に立つ側の報告も、否定側とは別のチームから出ている。ロボット操作向けの制御可能な世界モデル Ctrl-World は、実機ロールアウト無しで方策の優劣を精度よく順位付けしたと報告する。さらに”想像”の中で成功軌跡を生成して微調整することで、見慣れない物体や新しい指示を含む下流タスクで、汎用ロボット方策 π0.5 の成功率が平均 38.7%から83.4%へ——差にして 44.7ポイント——上がったという4。ただし上で否定側に当てた「作者自身が設計した物差し」という割り引きは、こちらにも同じだけ要る。世界モデルも、評価プロトコルも、改善対象の方策も著者らの自陣にあり、Ctrl-World の最終著者は改善対象である π0.5 の論文の共著者でもあるからだ。

別チームの Interactive World Simulator は、世界モデルの中だけで集めた専門家データで訓練した方策が、同量・同一の初期配置・同一の収集プロトコルで集めた実データの方策と同等に働いたと報告する5。比較は Diffusion Policy・ACT・π0・π0.5 の4種の方策で行われた。DP は生成データ100%で 87.9%・実データ100%で 90.3%、ACT は 76.2% 対 73.6% とほぼ並ぶ一方、π0.5 は実データを増やすほど伸びる傾向を示す(73.1%→88.8%)。原典は全体としては「同等」とまとめている。

ここに矛盾はない。しかもその境界は、肯定側の著者ら自身が引いている。Ctrl-World の報告によれば、方策の高次の指示追従は世界モデルの中と実機とで強く相関する一方、衝突・物体の滑り・回転といった精密な物理の再現には乖離があり、世界モデルは実機の成功率をむしろ低めに見積もるという4。彼らが自陣の限界として挙げた項目——精密な相互作用、長い地平線——は、否定側3本が測った対象とちょうど重なる。つまり穴は抽象度の層と地平線に依存する。机上の操作を「どの指示に従うか」の水準で、短い区間を測る分には世界モデルは既に使えるが、「衝突がどう解決するか」の水準や長い地平線の推論ではまだ実機の代わりにならない——どちらの報告も、そう並べて読むのが正確だ。

実務で何を見るか

以上を踏まえると、世界モデルを Physical AI の土台に据えようとする側の勘所は、これらの診断が示唆する形で絞れる。断定ではなく、自分の環境で試すべきチェックリストとして読んでほしい。

これは、シミュレーションをどこまで信じてよいかという古い問いの、生成AI版だ。違うのは、測る対象が方程式ではなく生成モデルになったこと——そして本稿で見たとおり、その測り方自体がまだ整っていないことだ。三つの報告はまだ査読前のプレプリントだが、別々のチームが「持続しない状態」「視点で揺れる予測」「物理を採点する物差しにどのモデルも届かないこと」に行き着いた点で、単発の主張よりは筋がいい。少なくとも今回のベンチが届く範囲では、世界モデルはまだ「世界」を持てていない。そっくりな絵は、正しい世界ではない——その差が埋まるまで、Physical AI の土台は仮置きのままだ。


出典5件
  1. Jinpeng Lu, Dexu Zhu, Haoyuan Shi, Linghan Cai, Guo Tang, Yinda Chen, Jie Cao, Duyu Tang, Yi Zhang, Yong Dai, Xiaozhu Ju, “Current World Models Lack a Persistent State Core”(arXiv:2606.20545, 2026年6月18日公開・査読前)。診断ベンチ WRBench で23モデル・9,600本の動画を四つの制御方式にわたり評価したと報告。ただし「見ていない間に状態が進んだか」を採点する再観測系の2指標は、対象が判定可能な形で視野に戻った 2,073行のみを分母とし、原論文は Table 6 の「Not for」欄でこの2指標を「全分母での持続一貫性」に使うことを名指しで禁じている。残る約8割は、そもそも戻ってこられなかった(=アクセスの失敗)という別種の問題で、著者らは「保持/アクセス/再観測時の整合」の三層を分けて数えている。その2,073本では、カメラが対象から離れて戻ると、モデルは見ていない間の変化を進めず、中断した状態のまま再開する(=持続的な状態の核が無い、との著者らの診断)。この失敗は制御方式・モデル系統・スケールの増大にかかわらず持続し、画質・制御精度・幾何の事前知識・パラメータ増でも解消しなかった——Wan を 1.3B から 14B へ上げると再観測時の状態一致はむしろ 0.66 から 0.62 へ下がる、とされる。独立再現は本稿執筆時点で未確認。https://arxiv.org/abs/2606.20545 2 3 4 5 6

  2. León Begiristain, Olaf Dünkel, Adam Kortylewski, “CRONOS: Benchmarking Counterfactual Physical Consistency in Video Models”(arXiv:2605.23699, 2026年5月22日公開・査読前)。動画予測モデルが物理の因果構造を学んでいるか、表面的な見た目の相関を使っているかを、反実仮想の介入で切り分けようとする試み。同一の物理イベント(衝突・遮蔽・落下)を保ったまま、視点・背景・物体の見た目・カテゴリを操作すると、予測の質が変動——とりわけ視点変化に弱い、と著者らは報告する。全評価指標を同時に満たした割合は最良モデルで22%、大半のモデルは15%未満。評価対象は重みが公開された4系統(Cosmos2.5・CogVideoX1.5・MAGI-1・Wan2.2)に限られ、著者らは Veo・Sora・Kling のような商用クローズド系を評価対象外にしたと明記し、「現行のモデル地形のカバレッジを制限する」と自ら断っている。フォトリアルな Unreal Engine で生成した映像を用いる点は、原論文では Limitations の筆頭項目で、結果は「制御された物理予測についての診断的証拠であって、実写での性能を直接推定するものではない」と読み方まで限定されている。https://arxiv.org/abs/2605.23699 2 3 4 5 6 7 8

  3. Juyi Lin, Arash Akbari, Yumei He, Lin Zhao, Haichao Zhang, Arman Akbari, Xingchen Xu, Zoe Y. Lu, Enfu Nan, Hokin Deng, Edmund Yeh, Sarah Ostadabbas, Yun Fu, Jennifer Dy, Pu Zhao, Yanzhi Wang, “PhyGround: Benchmarking Physical Reasoning in Generative World Models”(arXiv:2605.10806, 2026年5月11日公開・査読前)。汎用の動画指標は物理法則の破れを捉えるように設計されていない、との問題意識から、期待される物理的帰結を伴う250のプロンプトと、力学・流体・光学にまたがる13の物理法則の分類で物理そのものを採点する枠組みを提案。物理特化の審判は、人間の注釈者の評価平均からの隔たりが、汎用の Gemini-3.1-Pro を審判にした場合の16.6%に対し3.3%、と報告する。ただし主結果は指標側ではなくモデル側にある——8モデル(唯一のクローズドソースである Veo-3.1 を含む)が生む2,000本の動画を人手評価し、どのモデルも総合で 3.3/5(66%)を超えず、剛体力学の領域でもこの水準に届かなかった(最高は Wan2.2-27B-A14B と Veo-3.1 の 3.28)。459名の注釈者、5,796件の完全注釈・37.4K超の細粒度ラベル。https://arxiv.org/abs/2605.10806 2 3 4 5 6

  4. Yanjiang Guo, Lucy Xiaoyang Shi, Jianyu Chen, Chelsea Finn, “Ctrl-World: A Controllable Generative World Model for Robot Manipulation”(arXiv:2510.10125, 2025年10月11日公開。ICLR 2026 に採択済み——2026年3月1日の v3 は全ページの版面に “Published as a conference paper at ICLR 2026” を持つ)。DROID(95kトラジェクトリ・564シーン)で訓練した制御可能な生成世界モデル。実機ロールアウト無しで方策の優劣を精度よく順位付けし、“想像”の中で成功軌跡を生成して教師ありで微調整することで、見慣れない物体・新しい指示を含む下流タスクで、汎用ロボット方策 π0.5 の平均成功率が38.7%→83.4%(差44.7ポイント)に上がったと報告(Figure 9 および結論部)。ただし著者らは、既知の指示に対する低次の成功率のような他の側面までは改善しないと見込む、と限界も明記している。また Figure 7 では、世界モデルが高次の指示追従は実機とよく相関する一方で実機の成功率を低めに見積もる傾向を示し、衝突・物体の滑り・回転といった精密な物理の再現には乖離があると自ら述べている。結論部は限界として「precise interactions or long-horizon reasoning」を挙げ、初期観測への感度も記す。新規シーンでも20秒超の一貫した軌跡を生成。狭く制御された操作タスクでは世界モデルが実用の訓練・評価信号になる側の一次証拠。なお本論文の最終著者は、改善対象である π0.5 の論文の共著者でもある。独立再現は本稿執筆時点で未確認。https://arxiv.org/abs/2510.10125 2 3

  5. Yixuan Wang, Rhythm Syed, Fangyu Wu, Mengchao Zhang, Aykut Onol, Jose Barreiros, Hooshang Nayyeri, Tony Dear, Huan Zhang, Yunzhu Li, “Interactive World Simulator for Robot Policy Training and Evaluation”(arXiv:2603.08546, 2026年3月9日公開・査読前)。世界モデルの中だけで集めた専門家データで訓練した方策が、同量・同一の初期配置・同一の収集プロトコルで集めた実データの方策と同等に働き、Diffusion Policy・ACT・π0・π0.5 の4種で実データ100%から生成データ100%まで混合比を振っても成績はおおむね一貫し(π0.5 のみ実データを増やすほど 73.1%→88.8% と伸びる)、全体としては同等だと報告。シミュレーションと実機の成績も強く相関するが、T pushing を除く3タスクでは回帰直線がわずかに正のバイアスを持ち、方策はシミュレータ内で実機よりやや高い成績を出す傾向がある——著者らはそれでも「一方の方策が他方を大きく上回るなら実機でもそうなるだろう」と、順位の妥当性のほうを主張する。剛体・変形体・堆積物とその相互作用を含む多様なタスクで、15FPSで10分超の安定した長時間相互作用を維持。世界モデルが訓練用シミュレータとして機能しうる側の一次証拠。独立再現は本稿執筆時点で未確認。https://arxiv.org/abs/2603.08546 2

この記事はAIが執筆しています。内容には誤りが含まれる可能性があります。ご注意ください。