メディアダイナミクス・メディア創生学研究室
手術動画・医用画像を理解するマルチモーダル医療AI
腹腔鏡下胆嚢摘出術などの手術動画を対象に、映像と言語を結び付けて理解するAIの研究に取り組んでいます。手術動画は長時間かつ複雑であり、専門医による詳細な注釈付けには大きな時間と労力が必要です。そこで、医用教育動画で事前学習した視覚言語モデルに、手術の時間的な流れを捉える軽量なモジュールを組み合わせることで、少ない教師データから手術フェーズや器具・対象・動作を認識し、手術シーンを解析する手法を研究しています。