フィジカル・インテリジェンスによって育まれるヒューマノイドへの信頼

Figure 1

   

質問

同じハードウェアとAIを使用して構成した2体のヒューマノイドがあったとします。その場合に、なぜ一方は信頼を獲得し、もう一方はそうならないということが起きるのでしょう?

回答

ヒューマノイドの実際の挙動は、インテリジェンスだけによって保証されるわけではありません。フィジカル・インテリジェンスは、不確実性が伴う状況下でも、センシング、コネクティビティ、モーション・コントロール、電源、安全性に関する各機能が同期した状態を維持します。それにより、現実の世界とAIの橋渡しをする役割を担います。2体のヒューマノイドが、同じAIのモデル、センサー、アクチュエータなどで構成されていたとします。そうだとしても、それらは状況の変化に応じて全く異なる挙動を示すことがあります。その違いは、現実の世界に特有の変動や予期せぬ事態に直面した際、タイミング、信号品質、制御、安全性を維持できるかどうかによって生まれます。信頼はAI単体によって得られるものではありません。そうではなく、フィジカル・インテリジェンスを通じて育まれるものなのです。

Engineering Trust Through Physical Intelligence in Humanoids

はじめに

現在、ヒューマノイドは転換期を迎えています。その理由は、単にインテリジェンスが進化したからではありません。センサー、デタミニスティックなコネクティビティ、演算ユニット、モーション・コントロール、電源、シミュレーション、安全性の確保といった分野のイノベーションの成果が、物理的な制御ループの中に集約されるようになったからです。ヒューマノイドの時代を迎えたとも言えますが、それはAIやハードウェアの個々の力によって実現されたわけではありません。物理量に対応する信号を基盤とし、リアルタイム性の制約を遵守しつつ、様々な領域の技術が相互に作用し合う点が重要です。

それによって得られる相乗効果により、ロボットは、あらかじめ定められた機能を自動化するための装置から、フィジカル・インテリジェンス・システムへと進化を遂げつつあります(図1)。

図1. 産業用ロボットの進化を加速させる複合的なイノベーション
図1. 産業用ロボットの進化を加速させる複合的なイノベーション

自動化からフィジカル・インテリジェンスへ

従来の産業用ロボットは、予測可能性を重視して設計されていました。それらは構造化されたセル内で動作し、あらかじめプログラムされた手順で作業を実行します。リスク管理については、ケージ、ライトカーテン、厳格なゾーニングなどによって物理的な隔離を図ることで対応していました。そうしたモデルの枠を超えようとしているのがヒューマノイドです。ヒューマノイドは、開放的かつ変化の激しい環境で稼働しなければなりません。人間と空間を共有したり、移動したりしながら、予期せぬ事態に絶えず対応することが求められます。

そのような条件の下、インテリジェンスは物理的な身体と結び付き、時間的な制約の中で継続的に機能しなければなりません。それにより、あらかじめプログラムされた手順を実行するだけでなく、フィジカル・インテリジェンスによって動作する新たな種類のシステムが生まれます。その種のシステムは、以下のようなループをベースとして機能します。

  • 何が起きているのかを察知する
  • どのように対応するのかを決定する
  • 状況に応じて動作する
  • 結果を観察する
  • 即座に調整する

物理的な世界において、上記のループは、安定性と安全性を確保しつつ、有用な仕事をこなすための最低限の要件になります。物理的なシステムでは、各ステップの間で動作が休止することはありません。レイテンシ、ジッタ、更新の遅れは、躊躇、振動、急停止といった目に見える挙動として現れます。時間は止まることなく流れ続けるので、インテリジェンスもそれに歩調を合わせて機能しなければなりません。

上記のループが適切に連携していれば、ロボットは滑らかに動き、不確実性に対処し、人間と自然に協調します。一方、このループが機能不全に陥ると、その不具合はちょっとした異常ではなく明確な問題として表面化します。

そのため、フィジカル・インテリジェンスを実現するためには、本質的にシステム・エンジニアリングのアプローチが求められます。AIのモデルやアルゴリズム、知覚、意思決定、制御を緊密に連携させなければなりません。その結果、各要素が協調して動作し、時間的に同期のとれたシステムが実現されるのです。

マルチモーダルによる知覚

人間は、1つの感覚だけに頼っているわけではありません。視覚、聴覚、触覚、平衡感覚、固有受容感覚、力覚を絶えず連携させています。それにより、周囲の世界を移動し、その世界について理解することが可能になります。現実の環境で動作するヒューマノイドもそれと同様のものでなければなりません。但し、更に別の要件が加わります。

ヒューマノイドの知覚は、単にシーンに何が映っているのかを分類するだけでなく、AIが物理的な現実について推論できるように構成する必要があります。ヒューマノイドでは、センサーから、コンピューティング・ノード、アクチュエータに至るまで、身体全体にわたって情報が絶えず行き交います。それらの情報を適切なタイミングで処理することにより、ヒューマノイドは知覚、解釈、反応を実現します(図2)。

図2. マルチモーダルによる知覚。 フィジカル・インテリジェンスの基盤になるデータを取得します。
図2. マルチモーダルによる知覚。フィジカル・インテリジェンスの基盤になるデータを取得します。

最新のヒューマノイドは、以下に挙げるような要素を備えています。

  • 視覚:空間認識とセマンティックなコンテキストのために必要になる
  • 深度検出:形状と距離を把握する
  • 音と振動の検出:意図、環境に関するコンテキスト、視野外について認識する
  • 触覚の検出:マニピュレーション、接触の認識、把持の安定性に必要
  • 慣性計測ユニット(IMU)と関節エンコーダ:バランス、姿勢、固有受容感覚を確保する
  • 力とトルクの検出:安全な相互作用、荷重の推定、物理的な制約の適用に使用

これらのモダリティを組み合わせることで、動き、まぶしさ、オクルージョン、散乱物、騒音、不確実性などの影響を受ける状況でも、安定した知覚を実現することが可能になります。ヒューマノイドがインテリジェントに行動するには、コンテキストに応じて継続的かつ適切に知覚できるようにしなければなりません。

デタミニスティックなコネクティビティ

知覚の機能が働くと、データが生成されます。そのデータを伝送し、同期をとるためにはコネクティビティが重要になります。ヒューマノイドのアーキテクチャは、単一の大きな機械ではありません。相互に接続された分散型のネットワークとして構築されることがほとんどでしょう。マルチモーダルのデータから得られる知見は、各モダリティが何を測定したのかだけでなく、いつ測定されたのかによっても変化します。また、センサーで取得した信号の間では時間コヒーレンスを維持しなければなりません。それにより、AIは、原因、接触、モーション、結果について推論できるようになります。ここで図3をご覧ください。カメラ・ゾーン、アクチュエーション・ゾーン、センシング・ゾーンは、データ・レートの低いエッジのバス(1Mb~10Mb)から高速なバックボーン(2Gb~10Gb)に至る階層的なリンクを通じて接続されます。デタミニスティックなコネクティビティにより、ロボットは自身の状態と周囲の状況を統合して把握できるようになります。その結果、より円滑な移動、より安全な協働、適応型のマニピュレーション、不確実性のある状況下での一貫した動作が得られます。これを実現できなければ、分散型のインテリジェンスは破綻します。

図3. ヒューマノイドで使われるコネクティビティの例
図3. ヒューマノイドで使われるコネクティビティの例

インテリジェンスの3つの層

Daniel Kahneman氏の著書「Thinking Fast and Slow(ファスト&スロー)」により、「システム1とシステム2」という概念が広く知られるようになりました。システム1は高速で直感的な応答、システム2は低速で熟考を要する推論に対応づけられます。この枠組みをヒューマノイドに導入するには物理的な基盤が必要になります。システム0と呼ばれるその基盤は、センサーによるリアルタイム対応の神経系に相当します。ヒューマノイドの性能は、例えば接触から始まって、思考、トルクに至るまで、システム0~システム2が同期したループとして連携して動作するかどうかにかかっています。

ヒューマノイドが、混雑した工場の通路を移動して、何らかの容器を運ぶケースについて考えてみましょう。その容器はある程度満たされていて、蓋は開いていると仮定します。この運搬動作は、一見単純なものに見えます。しかし、実際には以下に説明するように複数のシステム領域をまたがる複雑な協調動作が必要になります。

  • システム0-物理信号とアクチュエーションの基盤(5ミリ秒未満のクラス):センサー、アクチュエータ、関節の状態、モーターの電流、触覚の信号、IMUの更新、レイテンシの小さいローカル・ループ
  • システム1-高速な解釈と反射的な応答(5ミリ秒~20ミリ秒のクラス):センサー・フュージョン、滑りに対する応答、バランスの補正、力の調整、局所的なモーション・コントロール、接触のモデリング、安全機能の適用
  • システム2-認知的な推論とタスクのプランニング(50ミリ秒以上のクラス):経路の選択、人間の動作と意図の予測、タスクの意図、ポリシー・レベルの調整、計画の立案

フィジカル・インテリジェンスは、これら各レイヤの連携によって生まれます。システム0は、物理信号を通じてロボットを現実の世界と結び付けます。システム1は、それらの信号を高速な補正動作へと変換します。システム2は、タスクの目標や環境のコンテキストに基づいて推論を行います。ロボットが適切に機能するのは、常にセンシング、推論、動作の同期がとれている場合だけです。

モーターのリアルタイム制御

ヒューマノイドは、その動きによって評価されるケースが少なくありません。例えば、足を踏み出した後に姿勢が滑らかに安定する、腕を伸ばしている途中で動きを調整する、躊躇する様子を見せることなくバランスを補正するといった動作は、高い評価を受ける傾向があります。こうした動作は、数十もの自由度(DoF:Degrees of Freedom)にわたって相互に作用する協調制御によって生み出されます(図4)。

図4. ヒューマノイドのモーター制御。 自由度に伴い課題が生じます。
図4. ヒューマノイドのモーター制御。自由度に伴い課題が生じます。

自由度が増加すれば能力は拡大すると言えます。但し、制御の複雑さは増大します。関節が増えるごとに、相互結合が加わり、レイテンシのマージンが減少し、不安定さを招く要因が増えます。また、わずかなタイミング誤差の影響が各部に急速に波及することになります。例えば、足首の補正が遅れると、膝に対する負荷が変化します。手首に対する外乱が生じると、肩のトルクが変動します。胴体の動きを調整すると、全身でバランスの取り方が変化します。

すべての基盤になるのは、モーターのリアルタイム制御です。自由度が様々な部位を相互に連携させながら制御するには、位置、モーション、負荷に関する関節の状態を継続的かつ確実に把握しなければなりません。電源の遮断、動的な荷重、機械的な摩耗が生じても、そうした状態を継続的かつ確実に把握できるようにする必要があります。減速ギアを備えるロータリ・アクチュエータを使用するのか、送りネジやボール・ネジで駆動されるリニア・アクチュエータを使用するのかにかかわらず、モーションの質は、高精度の位置検出、低ノイズのシグナル・チェーン、アクチュエータのレベルにおける予測可能なタイミングによって決まります。

重要なのは、センサー、モーター・ドライブ、電源、制御システムが完全に調和のとれた1つのシステムとして設計されていることです。そうすれば、自由度が増して動作が複雑になっても、タイミングの不確実性によって制御が破綻することはありません。複雑さがなくなるわけではなく、デタミニスティックに管理されるということです。デジタル領域での意図を物理的な動作として実現するには、すべての関節、すべてのサイクル、すべての物理的な相互作用にわたって信号品質とタイミングが維持されている必要があります。

機能安全

ヒューマノイドは、人間の近くで作業できるようになって、初めて変革をもたらす存在になり得ます。保護用の柵で囲まれたオートメーション用の環境から人間と共有する環境へと稼働場所が移行することで、安全性に関する考え方も変えなければなりません。機械的な柔軟性やバックドライバビリティを確保すれば傷害のリスクを軽減できます。しかし、それだけでは十分ではありません。ロボットが機械的な面で柔軟性を備えていても、センシングの誤差が大きかったり、タイミングがデタミニスティックでなかったり、故障が発生してもそれが検出されないまま動作が続いたりする場合には、安全が確保されているとは言えません。

人間の近くで稼働するロボットの機能安全を実現するためには、以下に示すように、保護に関連する多層的な配慮が必要になります。

  • 力、トルク、速度、作業空間に対する制限
  • 継続的な診断、センサーのキャリブレーション、妥当性の確認
  • センシング方法の冗長化と安全経路の多様化
  • 障害が生じた状態におけるデタミニスティックな応答
  • 制御不能な故障ではなく、制御された形での機能の低下

ヒューマノイドは、各部が一体となって動作する統合型のシステムです。そのため、単一のモジュールに限定して安全性について考えることはできません。安全性は、知覚機能、コネクティビティ、演算機能、電源、アクチュエーションを含む全体にわたって確保する必要があります。印象的なデモンストレーションを実施したいだけであれば、障害が発生したときのことを考慮する必要はないのかもしれません。しかし、実用の段階では、障害が発生した場合の動作を予測できるようになっていることが重要です。信頼は、すべてが完璧に機能しているときに得られるのではありません。そうではなく、予期せぬ事態が発生した際にも、システムが安全かつ一貫して透明性のある動作を示す場合に得られるのです。

ヒューマノイドの手/指-AI、センシング、制御の融合でフィジカル・インテリジェンスを実現

ロボット・ハンド(図4に示したヒューマノイドの手/指に相当。以下、ハンド)ほど、システムの要件が凝縮されている部位はありません。遅延、電力、熱、サイズに関する厳しい制約の下、ハンドには、センシング、アクチュエーション、即応的な制御などの機能や配線が統合されています。

人間が物をつかむ際には、無意識のうちに手を調整します。また、物体を取り落とす前に滑りを感知し、表面の差異に応じて接触時にかかる圧力を調整します。更に、動作の途中で、意識することなく物体の位置をわずかに修正します。ヒューマノイドのハンドで、こうした能力の一部でも再現しようとすると、何が必要になるのでしょうか。その場合、多くの分野でブレイクスルーが求められます。例えば、多数の検出点を備えた高密度な触覚検出、精密なモーション・コントロール、コンパクトなアクチュエーション、レイテンシの小さいローカル演算、マルチモーダル・センシングに基づく学習済みのポリシー、堅牢性の高いパワー・マネージメントなどの分野が挙げられます。これらすべてを、人間の周囲でも安全性を確保できる、軽量で耐久性の高いフォーム・ファクタの内部に収める必要があります。

器用なマニピュレーションを実現するためには、複数のモダリティから得られる情報を組み合わせて実際の状況を把握する必要があります。情報を取得する手段と得られる情報としては、以下のようなものがあります。

  • 視覚-その物体は何か?どこにあるのか?
  • 深度検出-その物体の形状は?どのくらいの距離があるのか?
  • 触覚の検出-表面は滑るか?力は適切か?
  • 固有受容感覚-タスクに対してヒューマノイドの関節やボディの状態はどのようになっているのか?
  • 力とトルクの検出-相互作用の力は安全かつ有用な範囲内にあるか?
  • 音と振動-接触、機械的な異常、あるいはタスクの成功裏の完了を示す手がかりはあるか?

ロボットの知覚に関する議論では、視覚や深度検出に注目が集まる傾向があります。それに対し、音は過小評価されがちです。しかし、音はもう1つの実用的な側面をもたらしてくれます。音や振動の特徴に注目すれば機械的な異常を検知できます。また、「カチッ」という嵌合音により、コネクタが完全に挿入/ロックされたことを確認することが可能です。このような特徴的な手がかりを活用すれば動作の検証を実施できます。

触覚の検出を利用すれば、視覚や音では得られない情報を取得することが可能になります。例えば、接触面での相互作用がどのように変化しているのかを把握するといった具合です。触覚の検出により、圧力の分布、振動、摩擦の変化、把持の安定性を判断する微小な滑りの兆候を検出することもできます。ここが、ハンドに関する重要なポイントです。

器用さは、機械的な課題であると同時に、「センシング+演算+制御+AI」の総合的な課題でもあります(図5)。

図5. ハンドによる器用なマニピュレーション
図5. ハンドによる器用なマニピュレーション

ヒューマノイドは安全を確保するためのケージの外に出て、人間のいる環境へと進出し始めています。それに伴い、ハンドにおけるインテリジェンスはモーターが生み出す力と同じくらい重要なものになります。ハンドの動作を極めることこそが、ヒューマノイドを産業分野の現場で生じる多様な状況に対応できる真の汎用マシンに変えるのです。ヒューマノイドのハンドは、1回の把持ごとにセンシング、演算、インテリジェンスが融合する場だと言えます。

まとめ:システムのレベルで信頼を構築

ヒューマノイドにおける最も難易度の高い課題が、単独のコンポーネントに関する問題であることはほとんどありません。それらの課題は、センシングと演算、制御と電源、コネクティビティと安全性が交差する領域に存在します。フィジカル・インテリジェンスは、単にロボットのハードウェアの上に追加されたソフトウェア・レイヤではありません。2台のヒューマノイドが同様のセンサー、モーター、AIモデルを採用したとしても、それらの現場での動作は大きく異なる可能性があります。その違いは、システム・インテグレーションの差に起因して生じます。つまり、現実の世界の多様な状況の下で、タイミング、信号品質、パワー・マネージメント、安全性がどのように維持されるのかが異なるのです。

アナログ・デバイセズは、高精度のセンシング、デタミニスティックなコネクティビティ、リアルタイムの信号処理、パワー・マネージメント、絶縁、機能安全といった分野で数十年にわたり経験を積み重ねてきました。そのため、ヒューマノイドの設計における最も要求の厳しい部分についても、システム・レベルの知見を提供することができます。単に個々の技術を提供するのではなく、複雑な物理システムを現実の世界で予測可能な形で動作させることに注力するパートナーとして振る舞います。

制御された環境下で優雅に歩行したり、物体をマニピュレートしたりすることが可能なヒューマノイドを開発できたとします。しかし、それだけで、そのヒューマノイドを広く普及させられるわけではありません。継続的な動作、不確実性への適応、障害からの復旧、人間との安全な協働が実現されて、初めて普及を図ることが可能になるのです。これこそが、AIが物理的な制約を踏まえて推論できるようにするフィジカル・インテリジェンスの役割です。

ヒューマノイドの未来を切り開く鍵は、一貫性のあるシステム・エンジニアリングが握っています。つまり、インテリジェンス、知覚、モーション、コネクティビティ、電源、安全性の同期を図った単一のシステムを設計する必要があります。信頼できるフィジカル・インテリジェンスは偶然生まれるのではありません。デタミニスティックなループを1つ1つ構築することによって実現されます。

ロボットが進化するにつれ、直面する課題は、機能の追加から機能の協調へと移行しています。次回の記事では、この点について解説する予定です。具体的には、AIと物理スタックの協調設計、学習済みポリシー、スキルのシーケンシング、データ・フライホイールなどについて詳しく説明します。

参考資料

Daniel Kahneman「Thinking Fast and Slow(ファスト&スロー)」 Penguin Random House、2011年10月

著者について

Tracey Johnson
Tracey Johnsonは、アナログ・デバイセズのプロダクト・マーケティング担当ディレクタです。産業用オートメーションの市場を対象とする事業開発/市場開拓チームを統括しています。設計評価エンジニアを経て、アプリケーションやマーケティングの分野で職務を担当してきました。2003年にアイルランドのリメリック大学で電子工学の学士号を取得しています。
Margaret Naughton
Margaret Naughtonは、アナログ・デバイセズのプロダクト・マーケティング担当プリンシパル・エンジニアです。産業用オートメーションの市場を担当しています。2007年にソフトウェア開発者として入社。それ以来、CAD、開発支援、マーケティングなどの分野で業務に携わってきました。コンピュータ工学の学士号を取得し、リムリック大学で修士号を取得しています。