フィジカルAIから学ぶエンジニアリング思考 — 講義で話したVLA・模倣学習・強化学習

フィジカルAIから学ぶエンジニアリング思考(タビLab.) フィジカルAI

2026年9月30日、エンジニアを目指して学んでいる方々に向けて、「フィジカルAIから学ぶエンジニアリング思考」という講義をしました。この記事は、そのときの資料をもとに、内容を読み物として再構成したものです。

最初にお断りしておくと、私は仕事でフィジカルAIに関わっているわけではありません。この夏、東京大学 松尾・岩澤研究室の「Physical AI」講座を受講しました。今回の講義は、そのアウトプットです。

講義の冒頭では「ロボットに興味がない人ほど聞いてほしい」とお話ししました。専門用語を覚えてもらうことより、新しい名前を知ると、いつもの景色が違って見えるようになる、その感覚を持ち帰ってほしかったからです。

ジョシュアツリーの悟り — 名前を知ると、見えるようになる

講義は、ロボットではなく木の話から始めました。

デザインの入門書として広く読まれている、ロビン・ウィリアムズの『ノンデザイナーズ・デザインブック』の第1章の冒頭に、デザインとは関係のない木の話が出てきます。著者は、もらった樹木図鑑で「ジョシュアツリー」という木を知りました。こんな変わった形の木はこの辺りには無い、見たことがあれば気づくはず、と思って外に出てみると、13年住んだ家の近所で、6軒のうち4軒の庭にその木が植わっていた、という話です。

木が急に増えたわけではありません。名前を知ったことで、背景だった木が、意識できるものに変わりました。本ではここから、デザインの4つの基本原則に名前を付けて紹介し、名前を知ればデザインを自分で扱えるようになる、という話につなげています。

講義では、身の回りの例を2つ挙げました。

1つ目は点字ブロックです。線が入ったブロックは進む方向を示し、点が並んだブロックは注意すべき場所を示します。この意味を知ると、駅の床を見たときに、人の流れを設計した誰かの考えが見えてきます。

2つ目は改札です。駅の自動改札は、ふだんは開いていて、問題があるときだけ閉じます。大量の人を止めずに通したい場所で、ほとんどの人が切符を持っているからです。一方、オフィスのセキュリティゲートは、ふだんは閉じていて、許可された人のときだけ開きます。同じ「人を通す」機能でも、設置した前提が違えば、初期状態が逆になります。

例 知ったこと 見えるようになったもの
ジョシュアツリー 名前 近所の庭にあった木
点字ブロック 意味 人の流れを設計した誰かの考え
自動改札 前提 開いている理由、閉じている理由

3つの例で変わったのは、木やブロックや改札ではなく、私たちの目に映る景色のほうです。

これをエンジニアリングに置き換えると、次のようになります。名前を知ると、他と区別できます。意味を知ると、作った人の意図が読めます。前提を知ると、なぜその設計なのかを説明できます。講義では「名前が無いものは、分けることも、調べることも、質問することもできない」とお話ししました。名前を知っていれば、検索できますし、人にもAIにも聞けます。

ジョシュアツリーとエンジニアリング思考。名前・意味・前提を知ると、見えるものが変わる
ジョシュアツリーとエンジニアリング思考。名前・意味・前提を知ると、見えるものが変わる

エンジニアリング思考の第一歩は、完成品を名前のついた部品に分けて、その意味と前提を見ることだと考えています。

「すごい」で終わらせない — ロボット100m走の8.64秒

ここから、ロボットの話に入りました。2026年8月、北京で開かれた第2回世界人形ロボット運動会の100m決勝で、優勝したロボット「天工Ultra」の記録は8.64秒でした。

この数字の横に、2つの数字を並べました。2009年8月にベルリンの世界陸上でウサイン・ボルトが出した世界記録が9.58秒です。そして1年前、2025年8月の同じ大会での100mの優勝記録が21.50秒です。

ロボットと人間では競技の条件が違うので、ボルトの記録を「破った」と言うつもりはありません。2025年の大会には、自律走行のタイムに0.8の係数を掛ける規定もあったため、2つの年の数字も単純には比べられません。それでも、1年でここまで縮んだという変化は、数字だけでも目を引きます。

2026年の決勝は完全自律走行で、人が操作するのはスタートだけです。ロボットは自分の判断で走っています。一方で、ゴールしたあとのロボットは、クッションの壁に突っ込んで止まっていました。大会全体でも、多くのロボットが転び、止まり、やり直していました。

速く走ることを優先した設計で、止まり方はまだクッションに任せている、ということです。黎明期の今だからこそ見られる景色だと思います。

この話をしたのは、「すごい」を「すごい」で終わらせないためです。8.64秒という結果を、どんな部品が、どうつながって生まれたのかに分けて見ていくと、記録の見え方が変わります。

フィジカルAIを取り上げた理由もお話ししました。2022年より前に「LLM」や「生成AI」という言葉を知っていた人は、ほとんどいませんでした。今は誰もが知っています。「フィジカルAI」は今、その手前にいます。数年後、ニュースや職場でふつうに出てくる言葉になったとき、「ああ、あれか」と思えるかどうかで、入ってくる情報の量が変わります。フィジカルAIは、数年後の「ジョシュアツリー」になると考えています。

フィジカルAIとは — 従来のロボット制御との違い

従来のロボット制御は、「認識(見る)」「計画(決める)」「制御(動かす)」の各工程を、人が細かく設計してきました。工場のロボットアームが代表です。決まった場所で決まった動きをするなら、速くて正確です。ただし、仕事が変わるたびに、人が設計し直す必要があります。

講義では、フィジカルAIを「物理世界を認識し、考え、行動するAI」と定義しました。従来は認識・計画・制御を人が設計していたのに対して、フィジカルAIは、その一部または全体をデータから学び、自律的に行動します。

補足として、次の3点もお伝えしました。2024年ごろから広まった言葉で、決まった定義はまだありません。ロボットだけでなく、自動運転やドローンも含みます。そして、AIが入っても、制御とハードウェアは無くなりません。

従来のロボット制御とフィジカルAI。人が分けて設計する方式から、データから一体的に学ぶ方式へ
従来のロボット制御とフィジカルAI。人が分けて設計する方式から、データから一体的に学ぶ方式へ

講義のあとには、「現場で学習しながら、自分を修正していくAIはあるのか」という質問を直接いただきました。私の答えは「まだない」です。

LLM → VLM → VLA — 出力が「言葉」から「行動」へ

フィジカルAIを理解するうえで、知っておきたい名前がVLA(Vision-Language-Action)です。LLMからの流れで並べると、違いが分かりやすくなります。

LLMは、言葉を受け取って言葉を返します。みなさんが使っているチャットAIです。VLMは、画像と言葉を受け取って言葉を返します。写真を見せて質問できるAIです。そしてVLAは、画像と言葉に加えて、関節の角度などの「今の状態」を受け取り、次の行動を返します。「リンゴを取って」と言うと、腕を動かすための数字の列、つまり制御情報が出てきます。

LLM → VLM → VLA。AIの出力が「言葉」から「行動」へ
LLM → VLM → VLA。AIの出力が「言葉」から「行動」へ

AIの出力が「言葉」から「行動」に変わったところが、いちばん大きな違いです。

フィジカルAIが取り組む代表的なタスクも2つ紹介しました。1つは「マニピュレーション」で、物をつかむ、動かす、操作する能力です。ロボットアームによる部品の組み立てや、料理の盛り付けなどが当てはまります。物の形、重さ、素材は多種多様で、状況に応じて扱い方を変えなければならない点が難しいところです。

もう1つは「ロコモーション」で、物理空間を移動する能力です。二足歩行、四足歩行、車輪移動などがあり、段差や坂、不整地でも安定して移動できるかが問われます。ロボット運動会の100m走も、ロコモーションの例です。

模倣学習と強化学習 — 手先の作業と、移動の学び方

ロボットに動き方を学ばせる方法として、2つを取り上げました。

1つ目は模倣学習です。人がロボットを操作して、「こう動かす」というお手本を見せます。ロボットは、その記録から動き方を学びます。物をつかむ、服をたたむといった手先の作業、つまりマニピュレーションで主流の方法です。

2つ目は強化学習です。正解の動きを直接教える代わりに、報酬を手がかりに試行錯誤させます。たとえば「前に進んだら加点、転んだら減点」というルールだけを与えて、何億回も試させます。現実でやるとロボットが壊れてしまうので、コンピュータの中の仮想世界(シミュレータ)で、数千台を同時に走らせます。歩く、走るといった移動、つまりロコモーションでは、こちらが主流です。模倣学習と組み合わせる場合もあります。

ロボット運動会の8.64秒も、強化学習が背景のひとつです。ただし、機体や制御、データなどがそろって出た記録なので、強化学習だけの成果とは考えていません。

データは自然には存在しない — 暗黙知と3つの作り方

講義でいちばん時間を使ったのが、データの話です。

LLMが学んでいるのは、本やWeb、会話など、人が言葉にして残したものです。人類は何千年も、考えたことを言葉にして書き残してきました。その量は数十兆トークンにのぼります。集めるのは大変ですが、データはすでに存在しています。言葉にできる知識、つまり形式知です。

一方、フィジカルAIに必要なのは、言葉になっていない無意識の動作です。歩く、バランスを取る、コップを持つといった動作を、私たちは無意識にやっています。だから誰も書き残していませんし、説明しようとしてもうまくできません。言葉にできない知識、つまり暗黙知です。LLMが学んだのは人の思考と知識で、フィジカルAIに必要なのは無意識の動作です。データの性質が根本的に違います。

料理の動画なら、ネットにいくらでもあります。ただ、動画には、そのとき腕や指を「どう動かしたか」という数字が入っていません。ロボットが学ぶには、「見たもの(観測)」と「そのときの動かし方(行動)」がセットで必要です。

動画データの限界。「見たもの」は動画にあるが、「動かし方」は無い
動画データの限界。「見たもの」は動画にあるが、「動かし方」は無い

そこで、データは意図して作ることになります。講義では3つの方法を紹介しました。

1つ目は模倣です。人がロボットを操作して、お手本を記録します。研究用のデータセット「DROID」では、13の機関が約1年をかけて、約350時間分のデータを集めました。

2つ目はシミュレーションです。仮想世界で数千台を同時に動かし、何億回も試します。人が与えるのは採点のルールだけです。

3つ目は世界モデルです。「こう動いたら、世界はこう変わる」を予測するAIで、AIの頭の中で試します。こちらはまだ研究段階です。

LLMの学習データが数十兆トークンあるのに対して、ロボットの実機データは数千〜1万時間ほどです。どの方法を使っても、データは自然には存在しません。

この流れで、データに関わる仕事の話もしました。1万時間単位のデータ収集が、工場のように行われ始めています。データ収集のオペレーション、映像のラベル付け、データの検品や品質管理、データの選別といった仕事が生まれつつあります。データの価値は、量だけでなく、多様性、動作の質、ラベルの正しさの掛け算で決まります。将来データに関わる仕事に就いたとき、扱うのは文章や数字の表ではなく「動作」かもしれません。丁寧さや、違和感に気づく力が、そのまま価値になる領域です。

平均が正解にならない — 平均二乗誤差と物理世界

最後の名前は、少しだけ機械学習寄りの話です。

データ分析では、予測と正解のずれがいちばん小さくなるように学習させるのが一般的です。そのずれの測り方の代表が「平均二乗誤差」で、この測り方だと、答えは平均に寄っていきます。

ところが、物理世界ではこれが困ることがあります。障害物を左から避けるお手本と、右から避けるお手本があったとします。どちらも正解です。ところが2つを平均すると、まっすぐ進んで障害物に激突する動きになります。誰もやっていない動きで、現実にはありえない答えです。

平均二乗誤差と物理世界。2つの正解を平均すると、誰もやっていない動きになる
平均二乗誤差と物理世界。2つの正解を平均すると、誰もやっていない動きになる

そのためフィジカルAIでは、複数の妥当な動きを表したうえで、その中から一貫した動きを生成する方法も使われます。

講義で手に入れた7つの名前

講義の最後に、この日に出てきた名前を一覧にしました。

名前 一言でいうと 知ったあとの景色
フィジカルAI 物理世界を認識し、考え、行動するAI ロボット、自動運転、ドローンの奥にあるAIが見える
VLA 画像と言葉から「行動」を出すモデル ロボットの動きが「チャットAIの出力が動作になったもの」に見える
模倣学習・マニピュレーション 人のお手本から学ぶ 器用に作業するロボットの裏に、人のお手本が見える
強化学習・ロコモーション 仮想世界で何億回も試して学ぶ 走るロボットの裏に、何億回もの転倒が見える
暗黙知のデータ 言葉になっていない無意識の動作 「このデータは誰がどう作ったのか」が気になる
世界モデル AIの頭の中の仮想世界 動画生成AIのニュースが、ロボットの話につながって見える
平均二乗誤差 予測と正解のずれの測り方 平均が正解にならない場面に気づける

名前があれば、検索できますし、AIにも聞けます。専門知識をすべて覚える必要はなく、聞いたことがある、という状態にしておくだけでも、必要になったときに調べられます。

受講者が見つけた「身の回りのジョシュアツリー」

講義後のアンケートでは、「あなたの日常にあるジョシュアツリーを教えてください」とお願いしました。ふだん目に入っているのに、名前や意味、前提を知った瞬間に見え方が変わったもののことです。いくつか紹介します(内容は要約しています)。

  • 道路のガードレールが波型なのはなぜだろうと調べたら、強度だけでなく、衝突した車の勢いを受け止めて人の命を守るための形だったそうです。
  • 地元と引っ越した先とで、盆踊りで流れる曲が違っていたそうです。地域という前提が違えば、初期状態も違う、という気づきでした。
  • 好きな曲の多くが「Just the Two of Us進行」と呼ばれるコード進行だと知ってから、新しい曲を聞くたびに意識するようになったそうです。
  • レーザーカッターで木材を切ると断面が黒くなると知ってから、側面が黒い木製アクセサリーを見ると、切り出し方が分かるようになったそうです。
  • 「0」の発見も、名前を与えて意識的に扱えるようになったという点で、同じ種類の話ではないか、という意見もありました。
  • 暗黙知のデータに近いものとして、「名前のない家事」があるのではないか、という意見もありました。

「ジョシュアツリーの話自体がジョシュアツリーだった」という感想もいただきました。

ロボット運動会の話では、「1年で記録が大きく縮んだことで、AIの進歩を初めて実感した」という声や、「速く走ることは進んでいるのに止まるのはまだ苦手、という話が印象に残った」という声がありました。質問では、LLMと比べたときのVLAの計算リソースや、AIの開発規制がフィジカルAIにどう関わるのかといった、次のテーマにつながる問いもいただいています。

まとめ

講義で伝えたかったのは、フィジカルAIの知識そのものより、完成品を名前のついた部品に分けて見る、という見方です。

ロボットが8.64秒で走った、というニュースは、そのままだと「すごい」で終わります。フィジカルAI、VLA、模倣学習、強化学習、暗黙知のデータ、世界モデル、平均二乗誤差といった名前を手に入れておくと、同じニュースから、どんな学び方で、どんなデータを使い、どこがまだ苦手なのかが読み取れるようになります。

数年後、フィジカルAIが身の回りに増えたときに、今回の名前がその中身を見るための手がかりになればと思っています。

参考: ロビン・ウィリアムズ『ノンデザイナーズ・デザインブック[第4版]』(マイナビ出版)第1章/新華網(2026年8月26日、第2回世界人形ロボット運動会 100m決勝)/新華網(2025年8月18日、第1回大会 100m)/DROID: A Large-Scale In-the-Wild Robot Manipulation Dataset

タイトルとURLをコピーしました