コラム第943号:「Physical AIと外科医療の信頼設計」

第943号コラム:和田 則仁 理事(神戸大学大学院医学系研究科 医療創成工学専攻)
題:Physical AIと外科医療の信頼設計

生成AIの急速な進歩により、AIは私たちの日常生活や仕事の中に急速に入り込んできました。私自身、1年ほど前から生成AIのサポートなしでは生活がなりたたない状況となっています。しかし、医療、とりわけ外科医療でこれから起ころうとしている変化は、これまでのAIとは少し性質が異なるように思います。

現在広く使われている生成AIは、文章を作る、画像を解析する、情報を提示するといった、いわば「コンピュータの中の知能」です。これに対し、センサーから現実世界を認識し、AIが判断し、ロボットなどのアクチュエータを介して実際の世界に働きかけるPhysical AIは、外科医療において大きな役割を果たし得るテクノロジーの一つです。

現在の手術支援ロボットは、名前に「ロボット」と付いていても、基本的には外科医が操作する高度なマニピュレータで、自動能はほとんどありません。しかし今後、術野映像、生体情報とともに、熟練医が持つ経験や勘など言葉にできない暗黙知と身体感覚の技術などをAIが学習し、手術の状況を判断しながら、ロボット自身が自律的に操作を担うようになることが想定されています。

すでに研究段階では、その萌芽を見ることができます。2025年に報告された自律手術研究では、AIが自然言語によって手術の手順や修正指示を生成し、それを下位の制御系がロボットの動作へ変換する階層型の仕組みが示されました(doi: 10.1126/scirobotics.adt5254)。実験環境では、未知の組織に対しても一連の手術タスクを遂行できることが報告されています。Physical AIは、単に決められた動作を自動化するだけではなく、「次に何をすべきか」を判断し、自らの動作を修正する方向へ進み始めています。

ここで重要になるのが、「よくできるAI」と「安心して任せられるAI」は同じではない、という点です。画像認識AIであれば、判断を間違えても、人間がその表示を採用しなければ現実世界には影響しない場合があります。しかしPhysical AIでは、誤った認識や判断が、そのままロボットの動作につながります。手術であれば、その先にあるのは患者さんの身体です。

したがって、Physical AIの安全性を評価する際には、単なる推論精度だけでは十分ではありません。IDF第23期第1回ヘルスケア分科会の講演ではこれを「推論性能(Accuracy)は社会実装の十分条件ではない」と表現させていただきました。

外科手術は、AIにとって特に難しい環境です。出血、炎症、癒着、解剖学的個体差など、教科書通りにはいかない状況が日常的に発生します。一定の条件下で高い性能を示したAIが、未知の患者、異なる施設、異なる機器、予期しない状況でも同じように動作するとは限りません。

さらにAIは、従来の医療機器とは異なり、学習データやソフトウェアの更新によって、その振る舞いそのものが変化し得ます。WHOも医療AIについて、透明性や説明可能性だけでなく、人間の自律性、責任と説明責任、実運用中の継続評価などを重要な原則として挙げています。

では、Physical AIを外科医療に安全に導入するには、何が必要なのでしょうか。私は、重要なのは「信頼してください」と求めることではなく、信頼できることを後から検証できる仕組みを最初から設計しておくことだと考えています。

例えば、AIが手術中にある操作を行ったとします。そのとき、どのカメラ映像を入力としていたのか、どのモデルのどのバージョンが動いていたのか、AIは何を認識し、どのような判断を行ったのか、ロボットにどのような指令が出され、実際にはどのように動いたのか。この一連の経過を後から再構成できなければ、事故が起きた際に原因を検証することはできません。これは航空機のフライトレコーダーにも似ています。ただ記録が存在すればよいのではなく、その記録が真正なものであり、時系列として整合し、改ざんされておらず、第三者が検証できる必要があります。

私は講演の中で、AI-Ready手術室に求められるデジタル・トラストを、記録性、真正性、検証可能性、監査可能性という四つの観点から整理しました。「何が起きたか」を記録できること。その記録が真正であること。同じ条件を可能な限り再構成して検証できること。そして、必要に応じて第三者がその過程を監査できることです。これらは医療事故が起きた後だけに必要なものではありません。日常的な品質管理、AIの性能監視、教育、機器の改良にも利用できます。つまりデジタル・フォレンジックは、事故後に原因を究明するためだけの技術ではなく、Physical AIを安全に運用するための「平時のインフラ」になり得ます。

一方で、記録を増やせばよいという単純な話でもありません。手術室では、術野映像、生体情報、機器の作動ログ、医療者の会話など、極めて機微性の高い情報が生まれます。こうした情報を詳細に記録すれば、患者さんのプライバシーだけでなく、医療者の心理的安全性、データの所有、利用目的、保存期間、訴訟時の証拠開示など、新たな課題が生じます。前回のコラムでも、記録を単なるデータ蓄積ではなく、「後から検証可能な信頼基盤」として設計する必要性について触れました。

Physical AIでは、この問題がさらに重要になります。AIが単に情報を提示する段階から、実際の医療行為に介入する段階へ進むからです。

そこで、一つの原則が考えられます。

「Autonomy must scale with traceability」――自律性が高まるほど、追跡可能性も高めなければならない。

人間がすべて操作する装置であれば、人間の判断や操作を中心に記録すればよいでしょう。AIが警告を出すようになれば、どの情報から、なぜその警告を出したのかという記録が必要になります。さらにAIが一部の操作を自律的に行うのであれば、認識、判断、指令、機器動作までを含む、より高密度な証跡が必要になります。

講演では、この関係を「要求される証跡・監査密度は、AI/ロボットの自律性・支援度に比例する」と整理しました。自律性を高めるのであれば、それと同じ速度で記録性、真正性、説明可能性、監査可能性を拡張しなければなりません。

これからの外科医療では、AIは「外科医に助言する存在」から、「外科医とともに実際の手術を行う存在」へ変わっていく可能性があります。その時に必要なのは、AIを無条件に信用することでも、人間だけに責任を押し戻すことでもないと思います。人間、AI、ロボット、医療機器が協働するシステム全体として、安全を設計する必要があります。そして、その安全性を支えるものの一つが、「後から確かめられること」です。

Google傘下のWaymoによるサンフランシスコの自動運転タクシーは、人間以上の慎重な安全運転と「運転手がいない(悪質なドライバーに遭遇しない)」という理由からも、夜間も含めて一般的に非常に安心感が高い社会インフラとなっています。外科医療の自律化もデジタル・トラストを獲得するのも遠い未来ではないのかも知れません。

Physical AIにとってデジタル・トラストは、技術開発を遅らせるための規制や足かせではありません。むしろ、高度なAIを安心して医療現場に導入するための安全ベルトであり、社会実装を進めるための基盤です。講演の最後には、デジタル・トラストを「高度なPhysical AIを医療現場に解き放つための、最小条件であり最大の推進力」と表現しました。

AIが賢くなる速度に、私たちの信頼設計も追いつかなければなりません。外科医療におけるPhysical AIの未来は、「何ができるか」だけではなく、「その判断と行動を、どこまで後から確かめられるか」によって決まるのではないかと思います。

※著作権は、和田氏に属します。
※本稿は筆者の見解であり、IDFの見解を示すものではありません。