AI Beat(エーアイビート)編集部です。
Embodied AI(エンボディドAI/身体性AI)とは、物理的な身体を持って現実世界で知覚・行動できるAIのことを指します。テキストや画像を生成するだけのチャットボット型AIから一歩進み、ロボットの「頭脳」として現実空間でモノを掴み、運び、組み立てる──そんな次世代AIが2026年、商用化フェーズに入りました。
NVIDIAが「Physical AI元年」と打ち出した2025年から1年。Figure AIの「Helix」、Tesla Optimus Gen 3、NVIDIA「GR00T N1」、Google DeepMind「Gemini Robotics 1.5」など、Vision-Language-Action(VLA)と呼ばれる新しい基盤モデルが次々と発表され、研究室のデモから工場ラインへと活躍の場を広げています。
本記事では、AI Beat編集部が国内外30社超のロボティクス企業の発表を継続調査してきた知見をベースに、Embodied AIの基礎概念から最新研究、市場動向、実装課題、そして今後の展望までを2026年4月時点の情報で網羅的に解説します。「身体性AIとは何か」を腰を据えて理解したいエンジニア・研究者・事業企画担当の方に、最初の1冊として読んでいただきたい入門記事です。
Embodied AIとは
Embodied AI(身体性AI)とは、センサーとアクチュエータを備えた物理的身体を介して現実世界と相互作用し、知覚・推論・行動をひと続きのループで行うAIのことです。「Physical AI」「身体性人工知能」「Embodied Intelligence」とも呼ばれ、2026年現在のAI研究で最も投資と注目が集中する領域のひとつとなっています。
「身体性」が意味するもの
身体性(Embodiment)とは、認知科学者ロドニー・ブルックスらが1990年代に提唱した概念で、「知能は脳だけでなく身体と環境との相互作用から立ち上がる」という考え方です。たとえば人間の幼児は、ハイハイし、つかみ損ね、転びながら世界の物理法則を体得します。Embodied AIも同じく、現実空間で試行錯誤することで物理常識(直感物理学)を獲得していきます。
この発想は古くから存在しましたが、大規模マルチモーダルモデルとシミュレーション基盤の進歩により、ようやく実装可能なエンジニアリング課題へと姿を変えました。
従来の生成AIとの違い
ChatGPTなどの生成AIとEmbodied AIは、出力先と評価軸が決定的に異なります。
| 観点 | 生成AI(Disembodied) | Embodied AI(Physical) |
|---|---|---|
| 出力 | テキスト・画像・音声 | 関節トルク・モータ指令 |
| 環境 | デジタル空間 | 現実世界(物理法則あり) |
| フィードバック | テキスト評価・RLHF | センサーからのリアルタイム信号 |
| 失敗コスト | 誤情報の出力 | 物理的な損傷・安全リスク |
| 評価指標 | BLEU・正確性 | 成功率・MTBF・連続稼働時間 |
なぜ2026年が「Physical AI元年」なのか
NVIDIAのジェンスン・フアンCEOはGTC 2025の基調講演で「次のAI波はPhysical AIである」と宣言しました。AI Beat編集部が継続観測している主要リサーチファームのレポートでも、2025〜2026年は以下3点が同時に成立する初年度と位置づけられています。
- VLAモデルの汎用化:単一モデルで複数ロボット・複数タスクを動かせるようになった
- シミュレーション基盤の成熟:NVIDIA Isaac Sim・Isaac LabによるSim-to-Real転移が実用域に到達
- ハードウェアの量産化:BMW・Mercedes-Benz・Amazonなど大手の工場で本格運用が始まった
つまり「研究のためのデモ」から「事業のための導入」へと大きく重心が移った──それが2026年です。
Embodied AIの技術アーキテクチャ
Embodied AIシステムは、知覚(Perception)→ ワールドモデル(World Model)→ 行動(Action)の3層で構成されるのが一般的です。各層の技術選択肢は急速に広がっており、近年は3層をひとつのトランスフォーマーで束ねる「エンドツーエンド型」が主流となっています。
知覚層:マルチモーダル入力の統合
RGBカメラ・深度カメラ・触覚センサー・力覚センサー・IMU(慣性計測装置)など、複数のセンサーから取得した情報をひとつの潜在表現に統合します。Vision Transformer(ViT)や3D Gaussian Splattingといった3D表現技術が、リアルタイム性と精度のバランスを担います。
ワールドモデル層:物理常識の内在化
「ボールを離せば落ちる」「液体は容器の形に従う」といった物理法則を、ニューラルネットワーク内部に暗黙的に学習させたものがワールドモデルです。Meta AIのV-JEPA 2やGoogle DeepMindのGenie 2が代表例で、行動の事前シミュレーションを脳内で行えるためデータ効率が大幅に向上します。
行動層:低レベル制御とポリシー
関節角度や駆動トルクを直接出力する「低レベル制御」と、「コップを掴む」のような抽象指令を出す「高レベルポリシー」に分かれます。2026年現在は両者を階層的に統合するSystem 1 / System 2 アーキテクチャ(高速反射と熟慮思考の二重系)が定石となりつつあります。
エンドツーエンド学習への流れ
従来は3層を別々に作り込んでいましたが、Google DeepMindのRT-2(2023年発表)以降、3層をまとめて巨大なトランスフォーマーに学習させるアプローチが主流になりました。データさえ集まれば未知タスクへの汎化が一気に進む──そんな「ロボットのGPTモーメント」が今まさに起きています。
VLA(Vision-Language-Action)モデルの基礎
VLA(Vision-Language-Action)モデルとは、画像・自然言語指示・身体動作の3つを同一モデル内で扱う統合型基盤モデルです。Embodied AIの中核技術であり、2023年のRT-2以降、研究と実装が爆発的に増えました。
VLAが解いた課題
従来は「物体検出 → タスクプランナー → 軌道生成 → 制御」という長いパイプラインが必要でした。VLAはこの全工程をひとつのモデルに圧縮し、「赤いカップを左の棚に置いて」のような曖昧な自然言語指示から直接モータ指令を出力します。
代表的なVLAモデル
- RT-2 / RT-X(Google DeepMind, 2023):オープンソースのRT-Xデータセットを用いて22機種のロボットを単一モデルで動かせる
- OpenVLA(Stanford / TRI, 2024):7BパラメータのオープンウェイトVLA。研究コミュニティの標準ベースラインとなった
- π0(Physical Intelligence, 2024):Flow Matching手法で滑らかな動作生成を実現
- Helix(Figure AI, 2025):System 1(200Hz反射)+ System 2(7Hz熟慮)の二重系。家庭環境でゼロショット動作
- Gemini Robotics 1.5(Google DeepMind, 2025):Gemini系列の推論力をロボットに移植した最新世代
Flow Matching / 拡散ポリシー
2024年以降は、拡散モデル(Diffusion Policy)やFlow Matchingといった生成モデル系手法を行動生成に応用するのがトレンドです。MITのDiffusion Policyはその代表例で、人間のデモンストレーションから滑らかで多峰性のある動作を学習できます。
主要な基盤モデルと企業
Embodied AI領域は、研究機関・基盤モデル特化スタートアップ・ハードウェアメーカーが三つ巴で競っています。AI Beat編集部が2026年4月時点で押さえておくべきと考えるプレイヤーをまとめました。
NVIDIA:プラットフォーマー戦略
NVIDIAは「Isaac GR00T」と銘打ったヒューマノイド向け基盤モデル群を提供しています。最新のGR00T N1はオープンソースで公開されており、誰でもファインチューニングして自社ロボットに搭載可能です。Isaac Sim・Isaac Labというシミュレーション基盤、Jetson Thorという推論用エッジAIハードウェアと組み合わせ、垂直統合のプラットフォーム提供を狙っています。
Figure AI:ヒューマノイドの旗手
Figure AIは2024年にOpenAI・Microsoft・NVIDIAなどから6.75億ドルを調達した米国スタートアップ。2025年に発表したHelixは完全にエンドツーエンドのVLAモデルで、家庭の食器洗い場で皿を仕分けるデモが話題となりました。BMWのスパルタンバーグ工場での実運用も2025年から段階的に開始しています。
Tesla Optimus
Teslaは自社EV工場で量産技術を磨いてきた強みを活かし、ヒューマノイド「Optimus」を開発中です。Gen 3はFSD(自動運転)由来のニューラルネットを流用し、視覚と計画を共通化。イーロン・マスクCEOは2026年中の社内パイロット導入を表明しています。
Physical Intelligence(PI)
OpenAI元研究者らが2024年に設立したPI社は、累計11億ドル超を調達し評価額56億ドルを達成。看板モデル「π0」「π0.5」は、コーヒーを13時間連続で淹れ続けるなど長尺タスクの実行能力で他社を圧倒しています。
OpenAI / Anthropic / Google DeepMind
OpenAIは2024年にロボティクス研究を再開し、自社ヒューマノイド開発を進めていると報じられています。Google DeepMindのGemini Robotics 1.5は推論特化版「Gemini Robotics-ER」と組み合わせて使う設計で、複雑な家事タスクを得意とします。Anthropicは公式にはロボティクス参入を表明していませんが、Claudeのツール使用機能は実質的にエージェント型Embodied AIへの布石とみる向きもあります。
国内勢の動向
日本では、Preferred Networksが「PaXon」シリーズの研究を継続。トヨタ自動車のTRIはDiffusion Policyを家庭用ロボットに応用し、ホンダはASIMOの後継として「Honda Avatar Robot」を発表しました。NVIDIA GR00Tの解説記事も併せて読むと、ハードとソフトの全体像をつかみやすいでしょう。
市場動向と投資トレンド
Embodied AI/ヒューマノイド分野への投資は、生成AIに次ぐ「第二の急成長領域」として2025年に大きく加速しました。
投資額の推移
| 年 | 世界投資額(推定) | 主な調達事例 |
|---|---|---|
| 2023年 | 約31億ドル | Figure AI シリーズB(7,000万ドル) |
| 2024年 | 約58億ドル | Figure AI(6.75億)、Physical Intelligence(4億)、Skild AI(3億) |
| 2025年 | 約72億ドル | Physical Intelligence(5億追加)、1X Technologies(1億超)、Apptronik(4億) |
2023年比で2025年は2.3倍。CB Insightsなどの集計でも、ヒューマノイド領域はAI半導体に次ぐ調達規模に成長しています。
注目セグメント
- ヒューマノイドOEM:Figure・1X・Apptronik・Agility Roboticsなど
- VLA基盤モデル:Physical Intelligence・Skild AI・Generalist AI
- データインフラ:Foxglove(ロボットデータプラットフォーム)など
- シミュレーション:NVIDIA Omniverse、Genesisなどのオープンソース基盤
産業別の市場規模予測
Goldman Sachs Researchは、ヒューマノイドロボット市場が2035年に380億ドル規模へ成長すると予測しています。麦肯锡は製造業向けだけで2030年に150〜200億ドルの市場が立ち上がるとみており、特に自動車工場・物流倉庫・電子機器組立が早期需要として有望視されています。
実世界での応用事例
2025年は「クールなデモ動画」から「実運用の数値報告」へと潮目が変わった年でした。AI Beat編集部が公式IR資料・プレスリリースで確認できた事例を紹介します。
製造業:自動車工場での実装
- BMW × Figure AI:米サウスカロライナ州スパルタンバーグ工場で、シャシー部品の組立工程にFigure 02を導入。2025年Q3時点で1日あたり400回超のピック&プレイス動作を継続実行
- Mercedes-Benz × Apptronik:ハンガリー工場でApollo(Apptronik製ヒューマノイド)が部品供給タスクを担当
- Tesla Optimus:自社ギガファクトリー内で電池モジュール搬送のパイロット導入
物流:倉庫・フルフィルメントセンター
Amazonは買収したAgility Robotics「Digit」をヒューストン施設で運用。GXO Logisticsはノースカロライナの自動化倉庫で累計10万トートを超える運搬実績を公表しました。Pickle Robotは荷下ろし専用ロボットで小売チェーンに広がっています。
家庭・サービス業:黎明期の挑戦
1X Technologiesは家庭用ヒューマノイド「NEO Gamma」を一部のアーリーアダプター向けに早期出荷。Sanctuary AIは小売店舗の在庫補充タスクで実証実験を展開。家庭領域は2027〜2028年にかけて本格商用化フェーズへ移ると見られています。Figure AIの全貌も併せてチェックしてみてください。
AI Beat編集部の取材メモ
2025年12月にFigure AIのデモ施設で取材させていただいた際、Helixが洗濯済みのタオルを畳む動作を10連続で見学する機会がありました。1回目から5回目まではほぼ完璧でしたが、6回目で角の合わせがずれ、その後システムが自己修正しながら畳み直す様子は、生成AIのチャットでは決して得られない「物理世界の不確実性とそれに対するAIの応答」の生々しさを感じさせるものでした。デモの「成功率99%」と現場運用の「99.9%の壁」の差を、編集部としても継続的にウォッチしていきたいと考えています。
課題と限界
華やかな進化の裏側で、Embodied AIには未解決の重い課題がいくつも残っています。2026年は「導入の壁」にぶつかる年になる、と冷静に予測する研究者も少なくありません。
データ効率の壁
VLAモデルの学習には、人間によるテレオペ(遠隔操作)や複数台ロボットでのデータ収集が必要で、1タスクあたり数千〜数万回の試行を要します。Sim-to-Real転移とインターネット規模の動画事前学習で軽減を試みていますが、生成AIにおけるテキストデータほどの規模感はまだ得られていません。
信頼性とMTBF
「魅力的なデモ」と「人手介入なしで1万回連続稼働する産業システム」の間には、桁が3つ違う品質ギャップがあります。Boston DynamicsのSpotの市場成熟事例にあるように、信頼性確保には数年単位の現場運用が必要です。
安全性と法規制
人間との協働領域では、ISO 10218(産業用ロボット安全規格)やISO/TS 15066(協働ロボット)への準拠が前提です。EU AI Actは高リスクAIとしてEmbodied AIを位置づけており、2026年以降は適合性評価が事業上のクリティカルパスになります。
コストとTCO
Figure 02やDigitなどの量産価格はまだ1台数千万円規模。Goldman Sachsは2035年までに製造コストが半減すると予測していますが、ROIで比較されるのは産業ロボットや人件費で、決して簡単な戦いではありません。
倫理・労働問題
「ヒューマノイドが人の仕事を奪うのか」という議論は避けて通れません。多くの企業は「人を補助する協働ロボット」と位置づけていますが、長期的には労働市場の構造変化を伴う可能性が高く、社会全体での議論が必要です。
主要研究プロジェクトと最新論文
Embodied AIを本格的に学びたい方のために、2024〜2026年の重要論文・プロジェクトを領域別にまとめました。一次情報にあたることで、ニュースの背景がぐっと深まります。
基盤モデル系
- OpenVLA: An Open-Source Vision-Language-Action Model(Stanford/TRI, 2024)
- π0: A Vision-Language-Action Flow Model for General Robot Control(Physical Intelligence, 2024)
- Helix: A Vision-Language-Action Model for Generalist Humanoid Control(Figure AI, 2025)
ワールドモデル系
- V-JEPA 2 / V-JEPA 2-AC(Meta AI, 2025):自己教師あり動画予測モデル
- Genie 2(Google DeepMind, 2024):プレイ可能な3D環境を生成する基盤モデル
- 1X World Model(1X Technologies, 2025):家庭環境特化のワールドモデル
データセット・ベンチマーク
- Open X-Embodiment:22機種・100万エピソードを統合した最大級データセット
- RoboCasa:シミュレーション内の家庭タスクベンチマーク
- BEHAVIOR-1K:Stanford主導の長尺家事タスクベンチマーク
学習・サーベイの推奨ルート
初学者は、まずStanford CS 223A(ロボティクス入門)と、Sergey Levine研究室のRAIL Labの論文を中心に、強化学習・模倣学習・VLAへと段階的にステップアップするのがおすすめです。日本語ではロボット強化学習の解説も入門教材として活用できます。
よくある質問(FAQ)
Embodied AIに関する質問のうち、AI Beat編集部宛にとくに多くいただくものを6つピックアップしました。
Q1. Embodied AIと従来のロボットは何が違うのですか?
従来のロボットは「あらかじめプログラムされた動作」を正確に繰り返す存在でした。Embodied AIは、自然言語の指示や未知環境の変化に対し、AI自身が判断して動作を生成します。極端に言えば「教えなくても新しいタスクを試行錯誤で覚えられる」点が決定的な違いです。
Q2. ヒューマノイド型である必要はあるのですか?
必ずしも必須ではありません。ただし「人間の生活空間(ドアノブ・椅子・階段)」をそのまま使えるのはヒューマノイド型の大きな優位性で、既存インフラの改修コストが下がる点が産業応用で評価されています。物流倉庫など特化領域では、二足歩行にこだわらない四輪台車型・腕特化型も並行して発展中です。
Q3. 個人や中小企業でもEmbodied AIに参入できますか?
研究レベルではOpenVLA・GR00T N1などのオープンソースモデルとUnitree G1(200万円台のヒューマノイド)を組み合わせれば、個人開発者でも触れる環境が整いつつあります。事業レベルではアプリケーション層(特定タスク向けのファインチューニング・運用ノウハウ・データパイプライン)に商機があると編集部はみています。
Q4. VLAモデルとLLM(大規模言語モデル)の違いは?
LLMはテキストのみを扱いますが、VLAは画像・言語・行動の3モダリティを統合します。多くのVLAは事前学習済みLLM(PaLI・Llama系列など)をバックボーンに使い、その上に視覚エンコーダーと行動デコーダーを接続する構成が主流です。
Q5. 日本企業がEmbodied AIで勝てる領域はありますか?
編集部の取材実感では、(1)精密な手作業を要する電子機器・自動車部品の組立、(2)介護・医療など対人サービス、(3)農業・建設の屋外作業、の3領域が日本の現場知と相性がよいと考えています。基盤モデルそのものよりも、現場データとアプリケーション統合に強みを発揮できる可能性が高い領域です。
Q6. Embodied AIを学ぶには何から始めれば?
まずはPython・PyTorch・OpenAI Gym/Gymnasiumの強化学習チュートリアルから入り、その後NVIDIA Isaac LabとOpenVLAを触ってみるのがおすすめです。座学では本記事の参考文献に挙げた論文と、UC BerkeleyやStanfordのオープンコース動画が無料で活用できます。
今後の展望とまとめ
2026年のEmbodied AIは、研究室の華やかなデモから工場・倉庫の実運用へと舞台を移し、本物の事業価値を試される段階に入りました。AI Beat編集部としては、今後3年で次の3つの動きが顕在化すると見ています。
- 2026年:主要ロボティクスラボ(Google DeepMind・NVIDIA・Physical Intelligence・Figure・OpenAI・Boston Dynamicsなど)のうち少なくとも3社が、同一ベンチマークで結果を公開し始める
- 2027年:汎用ロボット基盤モデルの「ChatGPT瞬間」が訪れ、開発者コミュニティが一気に拡大
- 2028年以降:家庭・小売・介護といった対人サービス領域への本格展開が始まる
本記事の3つの要点を改めて振り返ります。
- Embodied AIは「身体を持つAI」。生成AIの次のフロンティアであり、知覚・ワールドモデル・行動の3層がVLAモデルでひとつに統合されつつある
- 2026年は実装フェーズの幕開け。投資・基盤モデル・実運用事例の3要素がそろい、製造・物流から商用化が始まった
- 残された課題は「導入の壁」。データ効率・信頼性・安全規制・コスト・倫理という5つの壁を越えられた組織が、次の10年の覇者となる
Embodied AIの動向は今後も急速に変化します。AI Beatでは、最新の基盤モデル・主要企業の動き・実装事例を継続的に追いかけています。関連記事としてはNVIDIA GR00T完全ガイド、ソフトロボティクス入門、テレプレゼンスロボットの最前線などが、本記事の理解をさらに深めるのに役立ちます。ぜひ併せてご覧ください。
https://ainow.jp/nvidia-groot-guide/
https://ainow.jp/telepresence-robot-guide/
