NVIDIAがローカル動作するロボット用AIモデル「Cosmos 3 Edge」を公開

NVIDIAがロボットや自動運転車向けの世界モデル「Cosmos 3 Edge」を発表しました。Cosmos 3 Edgeは40億パラメーターの比較的小型なモデルで、単一のグラフィックボードで動作するとのことです。
Introducing Cosmos 3 Edge
https://huggingface.co/blog/nvidia/cosmos3edge
Introducing Cosmos 3 Edge: our open frontier world model built to run on-device.
— NVIDIA AI (@NVIDIAAI) July 20, 2026
Cosmos 3 Edge helps robots learn and act, autonomous vehicles understand road scenes and predict intent, and vision AI agents reason across live video for smart infrastructure.
With 4B parameters… pic.twitter.com/9TO8dCwHYY
Cosmos 3 Edgeはロボットや自動運転車に現実世界の認識能力と予測能力を与えるAIモデルです。「テキスト」「画像」「動画」「動作軌跡」の入力に対応し、「テキスト」「画像」「動画」「動作」を出力することができます。
自己回帰モデルと拡散モデルを組み合わせた構成で、世界を認識したうえで将来の状態を予測できるように設計されています。また、Cosmos 3 Edgeは家庭用グラフィックボードのGeForce RTXシリーズでも動作し、インターネットに接続せずともローカルで処理を完了できます。

Cosmos 3 Edgeをロボットなどに組み込むことで、カメラで得たRGB画像をもとに現実世界の状況を認識できるようになります。

また、ロボットや自動運転車の動かし方を決めることもできます。

基盤モデルの「Cosmos3-Edge」とロボットの軌跡決定に特化したファインチューニング済みモデルの「Cosmos3-Edge-Policy-DROID」が以下のリンク先で公開されています。ライセンスはOpenMDW-1.1です。
nvidia/Cosmos3-Edge · Hugging Face
https://huggingface.co/nvidia/Cosmos3-Edge
nvidia/Cosmos3-Edge-Policy-DROID · Hugging Face
https://huggingface.co/nvidia/Cosmos3-Edge-Policy-DROID
また、2026年6月に登場した画像生成モデル「Cosmos3-Super-Text2Image」と動画生成モデル「Cosmos3-Super-Image2Video」の4ステップ蒸留モデルもCosmos 3 Edgeと同日に公開されました。両モデルの開発にはDMD2と呼ばれる蒸留技術が用いられています。
nvidia/Cosmos3-Super-Text2Image-4Step · Hugging Face
https://huggingface.co/nvidia/Cosmos3-Super-Text2Image-4Step
nvidia/Cosmos3-Super-Image2Video-4Step · Hugging Face
https://huggingface.co/nvidia/Cosmos3-Super-Image2Video-4Step
・関連記事
Claude CodeなどのAIエージェントでロボットを自律的に改善する仕組み「ENPIRE」がNVIDIAによって開発される - GIGAZINE
Mistral AIがロボット用ナビゲーションAI「Robostral Navigate」を発表、「ロッカーの手前で右折して」といった自然言語での指示に対応可能 - GIGAZINE
中国のロボットメーカーUBTechがリアルなシリコン製の皮膚と感情AIを備えた人型ロボット「UWorld U1」シリーズを発表、実在する人物の声も再現可能 - GIGAZINE
ロボットが現実世界のタスクを実行できるオープンソースAIモデル「RynnBrain」をAlibabaのDAMOアカデミーが発表 - GIGAZINE
NVIDIAが高性能画像生成モデル&動画生成モデルを含むフィジカルAI基盤モデル群「Cosmos 3」を公開 - GIGAZINE
NVIDIAがアメリカ最強オープンモデル「Nemotron 3 Ultra」を発表&AIサーバー「Vera Rubin」の量産開始を報告 - GIGAZINE
NVIDIAが視覚・音声・言語モデルを統合するオープンなオムニモーダル推論モデル「Nemotron 3 Nano Omni」を発表 - GIGAZINE
・関連コンテンツ
in AI, Posted by log1o_hf
You can read the machine translated English article NVIDIA unveils 'Cosmos 3 Edge,' a locall….







