World Labsは9月1日(火)、Spatial Intelligence(空間知能)の実現に向けた次世代のオムニ世界モデル「Atlas」を発表した。Atlasは、テキスト・画像・動画・3Dといった複数のデータ形式をネイティブに処理できるようゼロから事前学習された、マルチモーダル自己回帰型拡散トランスフォーマー(Multimodal Autoregressive Diffusion Transformer)。ワールド生成や3D空間の再構築、時空間シミュレーションといった高度なタスクを、単一のアーキテクチャでこなすことができる。執筆時現在、一部のパートナー企業向けにアーリーアクセスとして提供されている。

ピクセルパーフェクト・カメラコントロール

▲32枚の入力画像からNVIDIAのVoyager本社をリアルタイムで飛行するデモ映像。入力画像を3D空間コンテキストとして使用し、新しいビューを生成することで、ピクセル単位で完璧なカメラ制御で探索

「Atlas」は、大まかなテキスト指示に頼る生成AIとは異なり、Atlasは正確なカメラのジオメトリをネイティブの入力データとして受け付けることで、Pixel-Perfect Camera Controlを実現。リファレンス画像を入力すると、指定したカメラ位置からの新しいビューを生成し、入力画像にはない被写体の裏側や周辺環境までも、Atlasが自然に補完・生成する。クリエイターはミリ単位でのフレーミングやカメラワークの指定が可能となる。

空間コンテキストを用いた長尺動画生成

▲7枚のリファレンス画像から1440p・1分間の動画を生成するために、手動で設計したカメラ軌道を使用したデモ映像

Atlasは、LLMが文脈を記憶する仕組みに似たアプローチを採用し、それを3D空間に拡張。複数の画像を3D空間内の特定位置に配置して「空間コンテキスト」を構築することにより、シーン全体の構造を把握する。例えば、全く無関係に見える2枚の部屋の画像を空間コンテキストに配置すると、Atlasがその2つの空間を繋ぐ廊下や扉などのトランジションを想像し、破綻のない世界として繋ぎ合わせる。この空間コンテキスト管理とカメラパスの手動設計を組み合わせることにより、最大1440pで1分間にわたる長尺動画を、一貫性を保ちながら生成できる。

疎な入力からの空間再構築と3Dデータ出力

また、Atlasは1枚から数十枚程度の少数の画像(疎な入力)から実世界のシーンを高精度に空間再構築(Spatial Reconstruction)することができる。出力は2Dの動画フレームだけでなく、点群や3DGS(3D Gaussian Splatting)による3Dデータにも対応する。

バレットタイム映像の生成

Atlasはまた、時間の経過に伴う世界の物理的な変化を理解する時空間シミュレータ(Space-Time Simulation)としても機能する。スマートフォンなどの一般的なカメラ3〜5台で撮影した映像を入力するだけで、時間を止めた状態で別角度から被写体を捉えるバレットタイムのようなリフレーミングが可能となる。

ロボットシミュレーションへの活用

ロボット工学のReal-to-Sim(現実からシミュレーションへ)ワークフローにも対応し、少数の映像からシミュレーション環境を構築した上で、空間内を移動するロボットのセンサーが取得するRGBデータや深度データを自動生成するなど、合成データ生成エンジンとしての能力も備える。

■Atlas: A World Model for Spatial Intelligence | World Labs(公式ブログ)
https://www.worldlabs.ai/blog/atlas

CGWORLD関連情報

●NVIDIA、フィジカルAI向け世界モデル「Cosmos 3」リリース ネイティブな視覚推論、ワールド&アクション生成を統合したオムニモデル

NVIDIAがフィジカルAI向けの新基盤モデル「Cosmos 3」を発表し、オープンソース(OpenMDWライセンス)でリリース。視覚推論とワールド生成、アクション生成をネイティブに統合した、完全なオープンオムニモデルとなる。Hugging Faceでは、パラメータ数に応じてSuper(65B)とNano(16B)という2つのバリアントがリリースされている。
https://cgworld.jp/flashnews/01-202606-Cosmos3.html

●NVIDIA、世界モデル「SANA-WM」公開 画像1枚と6DoFカメラ軌跡データから、単一GPUでアクション制御可能な720p・60秒のワールドを合成

NVIDIA Research(NVlabs)が、1枚の画像とカメラの軌跡データから60秒間の720p動画を生成可能な、26億パラメータの世界モデル「SANA-WM」をオープンソース(Apache-2.0ライセンス)で公開。実写ベースの高精細な背景生成や、ゲームエンジンのような精密なカメラワーク制御が可能な、一貫性のある長尺動画の生成を実現する。
https://cgworld.jp/flashnews/01-202606-SANA-WM.html

●NVIDIA、物理シミュレーション対応の3D環境構築フレームワーク「Lyra 2.0」公開 長時間のウォークスルー動画生成と高品質な3Dシーン出力で大規模な環境構築を実現

NVIDIAのSpatial Intelligence Lab(SIL)が、探索可能な生成3D世界を構築する新たなAIフレームワーク「Lyra 2.0」を発表。カメラ操作の可能なウォークスルー動画を生成し、フィードフォワード再構成技術によって3D空間を生成することで、大規模で複雑な3D環境の構築を実現する。ソースコードはApache-2.0ライセンスでGitHubにて、モデルはNVIDIA Internal Scientific Research and Development Model License(非商用の研究開発用途限定)でHugging Faceで公開されている。
https://cgworld.jp/flashnews/01-202605-Lyra2.html