トレンドコラム

技術解説

【前編】現実世界を学ぶAIへ NVIDIA Cosmos 3で変わるフィジカルAI開発

2026.09.30

サービスクリエーション本部 GPUエンジニア 岡本 朋之

サービスクリエーション本部
GPUエンジニア
岡本 朋之

【前編】現実世界を学ぶAIへ NVIDIA Cosmos 3で変わるフィジカルAI開発

この記事で分かること
フィジカルAIと生成AIの違い、実世界データだけでは学習が難しい理由、NVIDIA Cosmosの役割、そしてCosmos 3による統合の意味を整理します。

1. はじめに

生成AIは、文章や画像、動画、コードなどを生成する技術として急速に普及しました。次に注目されているのが、AIの活用範囲を現実の物理世界へ広げる「フィジカルAI」です。

フィジカルAIでは、ロボットや自動車などが周囲の状況を認識し、重力、衝突、物体の動きといった物理的な関係を考慮しながら、次の状態や適切な行動を推定する必要があります。その実現において、シミュレーションや合成データは、実世界のデータだけでは収集しにくいレアケースやロングテール事象を補完し、学習・検証の範囲を広げる有力な手段です。

本記事では、フィジカルAI向けの世界基盤モデル(World Foundation Model)群と、データ処理、学習、評価などの開発基盤を提供するNVIDIA Cosmos™ 3 Cosmos 3の新機能について紹介します。Cosmos 2の各モデル(Predict、Transfer、Reason)に加え、Cosmos Policyなどで扱われていた行動生成が、Cosmos 3の共通アーキテクチャ上でどのように接続されたのかを整理します。

2. フィジカルAIは「見て、考えて、動く」AI

フィジカルAIとは、現実世界を観測し、その意味を理解し、次の状態を予測しながら行動を選ぶことができるAIです。文章生成のように出力がデジタル空間で完結するのではなく、判断結果が機械の移動や作業として現実へ返されます。そのため、認識精度だけでなく、時間的一貫性、空間関係、物理的な妥当性、安全性が重要になります。

例えば倉庫内を走る自律移動ロボットは、カメラにフォークリフトが映っていると認識するだけでは不十分です。停止中なのか、動き出す可能性があるのか、通路を塞いでいるのか、別経路を選ぶべきかまで判断する必要があります。自動運転でも同様に、歩行者、信号、道路状態、他車両の動きを時間軸で捉え、次の行動へ結び付けなければなりません。

3. フィジカルAI開発を難しくする「現実世界のデータ不足」

フィジカルAIの学習には、多様な状況を含む大量のデータが必要です。しかし、実機や実車によるデータ収集には時間とコストがかかります。事故直前、急な飛び出し、落下物、悪天候、視界不良といったレアケースは、安全上の理由から実世界で繰り返し再現することは困難です。

そこで重要になるのが、シミュレーションと生成AIを使って学習用データを計算で作る考え方です。現実に得られた少量のデータを起点に、環境、視点、照明、天候、物体配置、動作条件を変えたシナリオを生成できれば、実世界だけに依存せず学習と検証の範囲を広げられます。


図1 Cosmos Predictによる雨天走行シーンの当社生成例

※機能確認を目的とした定性的な生成例であり、モデル性能を評価したものではありません。

注意点
合成データは、生成できればそのまま学習に使えるわけではありません。目的に応じた品質評価、現実データとの比較、偏りや破綻の確認が必要です。

4. NVIDIA Cosmos 2.xからCosmos 3へ

「NVIDIA Cosmos」は、フィジカルAI向けのWorld Foundation Modelと、データ処理、学習・post-training、評価、展開のための仕組みを提供するプラットフォームです。

2026年8月時点の最新バージョンであるCosmos 3は、従来個別に説明されていた生成・推論・行動生成の能力を、Reasoner TowerとGenerator Towerを中心とする共通アーキテクチャで扱えるようにしたものです。

Cosmos 3では、Cosmos 2.xの主な能力を統合・再構成しています。そのため、Cosmos 2.xまでの主な機能を、世界生成を担うPredict、条件付き生成を担うTransfer、物理推論を担Reasonという3系統を中心に整理するとCosmos 3を理解しやすくなります。

Predictは現在の映像やテキストなどを条件として未来の世界状態を動画として生成しTransferは深度、エッジ、セグメンテーションなどの構造的な条件の整合を促しながら、シミュレーション映像や既存映像をより現実に近い表現へ変換します。Reason画像や映像から物体の動き、空間関係、時間変化、物理常識や因果関係の候補を推論し、状況分析や行動候補の検討を支援します。

Cosmos 3では、前バージョンでは別々のモデルやワークフローで扱われていた物理推論、世界生成、制御付き生成、行動生成の能力を、Reasoner TowerとGenerator Towerからなる統一アーキテクチャ上で扱えるようになりました。それぞれの役割は下表のとおりです。

表 各モデルの役割・Cosmos 3での整理(当社調べ)

従来のモデル・アプローチ 役割 Cosmos 3での整理
Reason 映像から物理的・時空間的関係を推論し、状況分析を支援 Physical Reasoning/Reasoner Tower
Predict 現在の条件から未来の世界状態を生成 World Generation/Generator Tower
Transfer 構造条件への整合を促す条件付き世界生成 Controlled Generation/Transfer
GenerationとしてGenerator側に統合。ただしTransfer 2.5も専用モデルとして併存
Cosmos Policy、Predict 2.5のaction-conditioned/policy系モデル Predict系モデルをpost-trainingし、行動系列や行動条件付きの将来観測を生成 Action Generation
複数の専用モデルまたはpost-training workflowで個別に実現 世界予測と行動モデリングを同一の基盤アーキテクチャ上で接続 World Action Modelの基盤として利用可能

Cosmos 3Reasoner Towerは、画像、動画、テキストなどのマルチモーダルな観測を解釈し、物体の動き、相互作用、空間関係、時間変化、タスク上の文脈を推論します。Generator Towerは、Reasoner Towerによる入力解釈を条件として、画像、将来の動画、Actionで条件付けされた動画、Action系列などを生成します。利用できる入出力の組み合わせやActionの表現形式は、使用するモデル、checkpoint、post-training、runtimeによって異なります。

Cosmos 3で特に拡張されたのがAction Generationです。Action生成自体はCosmos Predict 2.xをpost-trainingしたPolicyモデルでも実現できましたが、Cosmos 3ではActionが基盤モデルの正式な出力モダリティとして統合されました。
これにより、同一の基盤アーキテクチャを用い、
対象に応じた行動の表現方法と追加学習(post-training)を組み合わせることで、「何をすべきか」を導く行動方策と、「その行動によって世界がどのように変化するか」を予測する順方向ダイナミクスを接続した、世界行動モデル(World Action Model)を構築できます。

なお、Cosmos Transfer 2.5はCosmos 3に完全に置き換えられたわけではありません。edge、depth、segmentation、visual-blurなどの制御入力に条件付けた映像生成およびデータ拡張向けの専用モデルとして併存しています。条件入力との整合性は評価対象であり、構造の完全な保持を保証するものではありません。

Cosmos 3は統一された基盤アーキテクチャを採用していますが、2026年8月時点のNVIDIA NIM™では、Cosmos 3-ReasonerとCosmos 3-Generatorは別のNIMとして提供されています。ただし、これはモデル内部のReasoner TowerとGenerator Towerが完全に独立していることを意味するものではありません。

Cosmos 3の要点
「映像から物理的・時空間的な関係を推論する」「未来候補を生成する」「指定条件への整合を促しながら世界を変換する」「対象に応じたAction表現で行動系列を生成する」という能力を、共通のオムニモーダル基盤上(複数種類の入力・出力を一つの基盤で扱う)で接続できるようになりました。

ここまで、Cosmos 3の全体像を整理してきました。後編記事では、「Physical Reasoning」「World Generation」「Controlled Generation」「Action Generation」の各機能が、フィジカルAI開発においてどのように活用されるのかを具体的に解説します。

NTTPCコミュニケーションズでは、GPU基盤の設計・構築・運用で培った知見を生かし、CosmosをはじめとするフィジカルAI関連技術の検証を進めています。今後も、検証を通じて得られた知見や課題を発信していきます。
▶︎ お問い合わせはこちら

※本記事に掲載している内容は、2026年8月時点での情報をもとに作成しています。

※「NVIDIA」「NVIDIA Cosmos」「NVIDIA NIM」は米国およびその他の国における NVIDIA Corporation の商標または登録商標です。