メインコンテンツへスキップ
Loading...
北海道大学 大学院情報科学院
北海道大学 工学部 情報エレクトロニクス学科 

メディアネットワークコース

RESEARCH

メディアネットワークコースの8つの研究室で進めている研究テーマを紹介します。AI・画像・言語・通信・光・電波――興味のある研究室やキーワードから、あなたの「やってみたい」を探してみてください。

LAB研究室

言語メディア学研究室

個性を感じる人間らしい対話システム

対話システムはELIZAから現在までずっと研究されてきたテーマである。しかし、最新のLLMベースの対話システムでさえ、個性や人間らしさの本質を理解できてるとは言えない。人間の発言の意味、感情、冗談、嫌味を本当に理解し、正しくそれらを表現できる対話システムになってこそ、人間と対等な関係が構築できる存在感のあるAIになれるはずである。

マルチモーダル対話システム インタラクション 個性
言語メディア学研究室

AIの倫理問題と危険発見の能力をテストするためのデジタルホームによる実験

AIエージェントが現実世界で安全に活動できるかを調べるため、3Dシミュレーションによる「デジタルホーム」を使用し、複数の人間エージェントの物理的・言語的な行動や、そこからの言語獲得、最新のVision-Language Model(VLM)の反応を研究しています。実際の家庭には、子どもや大人、個人差、文化、ルールなど無数の要素があります。そこで、現在の生成AIが持つバイアスなどの問題を調べ、多様で現実に近い環境や住人を再現し、説明可能な次世代のAIモデルの開発を目指します。

生成AI AIエージェント デジタルホーム
言語メディア学研究室

AIエージェントに「経験」を与える ― Novelty Searchによる知識の獲得と共有

人は経験や環境によって、言葉の使い方も価値観も少しずつ異なります。ではAIに異なる「経験」を与えたら、何が起こるでしょうか。本研究では、同一の大規模言語モデル(LLM)に別々の物語を与え、正解も報酬も用いないNovelty Search(新規性探索)によって世代を重ねさせます。すると個性の差は世代ごとに広がり、「あなたはこういう性格です」と設定文で与えた場合の約1.6倍に達しました。対話させても多様性は失われません。性格は記述ではなく、経験の蓄積から生まれるのかもしれません。

LLM マルチエージェント 経験獲得
言語メディア学研究室

AIが人間の価値観を尊重し、常識的な行動ができるかを調べるベンチマーク構築

現在の生成AIや、これから開発されるAIが、人間にとって望ましい判断や行動ができるかを調べるためには、信頼できるテストデータが必要です。例えば、子どもが暮らす家庭や学校の画像をAIに見せ、危険な場所や行動を発見し、安全な対策を提案できるかを調べます。また、文化や経験、画像に写った物によってAIの判断が変化するかを評価し、より安全で信頼できるAIの開発につなげます。

JETHICS SafeBench ベンチマーク
言語メディア学研究室

物語の論理的な流れ、意外性、感情変化から言語モデルの理解度を調べる研究

例えば、「子どもに靴を履かせてから靴下を履かせる」という行動の順序が非常識であることをAIは理解できるでしょうか。このような理解のために、大量の日本語の物語や会話データを作成し、AIに読ませることで、文章の順序や登場人物の行動、感情などをどこまで理解できるかをさまざまな実験で調べています。例えば、「次に何が起こるか」を予測させたり、誰が何をしたのかを分析させたりすることで、LLMの常識や文脈理解の限界を測定します。このデータをユーモアや創造性などの研究にも応用しています。

生成AI AIエージェント デジタルホーム
言語メディア学研究室

人間の脳や視線データとAIの「頭の中」を比較し、安全性を高める研究

AIが危険な行動と安全な行動をどのように区別しているのか、その内部の情報処理を調べています。LLMの内部表現を可視化するLogit Lensや、人間の脳活動・視線とAIの内部表現を比較する方法を用いて、AIが判断する仕組みを探ります。ブラックボックスになりがちな生成AIをより理解可能にし、現実世界で安全に使える新しいAIの実現へのヒントを得るため、認知科学や哲学など異分野の研究者とも共同研究しています。

XAI 説明可能AI VLM
言語メディア学研究室

輸出管理における日本語法令を理解するAI専門家の開発

最近のLLMの誤った行動や判断が問題になる中、AIが人間の常識、感情、価値観だけでなく、社会のルールや法律も守ることが重要になっています。企業などで利用されるRAG(検索拡張生成)技術のHallucination(幻覚)を減らすため、輸出管理に関する日本語法令を対象として、知識グラフや学習データを自動生成し、Agentic AIも活用して、生成AIの誤りを減らす研究を行っています。

RAG 法律 LLM
メディアダイナミクス・メディア創生学研究室

視覚・音響に基づく3D空間の理解と生成

3D空間を理解し、その構造や意味を人や機械が利用できる形で表現するAI技術に取り組んでいます。具体的には、3D空間における異なる視点からの映像生成、3D空間の評価、空間に応じた3Dオーディオ生成などを幅広く扱っています。これらを通じて、視覚と音響を統合しながら、実世界をより豊かに理解・再現できるAIの実現を目指しています。

3D空間理解 3Dシーン生成 3D空間評価
メディアダイナミクス・メディア創生学研究室

LLMおよびMLLMの応用とメカニズム解明

近年、文章だけでなく画像や音声も扱えるマルチモーダル大規模言語モデル(MLLM)が目覚ましく発展しています。活用先は幅広く、当研究室でも画像・動画解析や検索、インフラ点検への応用を進めています。 一方で、AIが「なぜその答えを出したのか」という仕組みには未解明な点が多く、内部のブラックボックス化が課題です。そこで私たちは、AIの内部メカニズムに着目し、推論プロセスの解明や処理の効率化を目指して研究しています。

LLM MLLM メカニズム解明
メディアダイナミクス・メディア創生学研究室

ウェアラブルセンサで計測した生体情報に基づく作業・動作の「上手さ」推定

身体に装着したモーションキャプチャデバイスで人の動きを計測し、AIで熟練度を分類する研究を進めています。地下鉄トンネルの点検作業やサッカーのプレーを対象に、関節の動きやつながりを解析し、熟練者と初心者の違いを捉えます。さらに、AIが分類の際に注目した身体の部位を可視化し、熟練度の段階的な違いも考慮することで、より正確で根拠の分かる分類を目指します。言葉だけでは伝えにくい熟練技術を見える形にし、若手技術者への技術継承やスポーツの上達支援技術の構築を目指しています。

動作解析 技術継承 説明可能なAI
メディアダイナミクス・メディア創生学研究室

元データから高性能な小規模データセットを蒸留

近年、深層学習モデルの高性能化に伴い、大量の学習データが必要となり、学習時間や計算コストが増大しています。そこで、大規模な元データの特徴や学習に重要な情報を少数の画像に凝縮し、少ないデータでも元データに近い認識性能を実現する「データセット蒸留」を研究しています。これにより、画像分類、動画の行動認識、文章分類などさまざまな下流タスクに、AIの学習や繰り返し実験を効率化できるほか、データの保存・転送コストの削減や、元データを直接共有しない学習への応用も期待できます。

深層学習 データセット蒸留 画像生成
メディアダイナミクス・メディア創生学研究室

ロボット・ドローンの自律化技術

画像や言語などの情報をもとに、ロボットやドローンが周囲の状況を認識し、自律的に行動するためのAI技術を研究しています。道路附属物点検では、深度推定とセグメンテーション技術を用いて、対象物との距離を保ちながら追従するドローンの自律制御を実現しています。また、アームロボット制御では、画像や言語から行動を生成するVision-Language-Action(VLA)モデルによる動作失敗の兆候を検出して行動を修正することで、安心・安全な自律動作の実現を目指しています。

Physical AI ロボティクス ドローン
メディアダイナミクス・メディア創生学研究室

手術動画・医用画像を理解するマルチモーダル医療AI

腹腔鏡下胆嚢摘出術などの手術動画を対象に、映像と言語を結び付けて理解するAIの研究に取り組んでいます。手術動画は長時間かつ複雑であり、専門医による詳細な注釈付けには大きな時間と労力が必要です。そこで、医用教育動画で事前学習した視覚言語モデルに、手術の時間的な流れを捉える軽量なモジュールを組み合わせることで、少ない教師データから手術フェーズや器具・対象・動作を認識し、手術シーンを解析する手法を研究しています。

手術動画解析 視覚言語モデル 類似動画検索
メディアダイナミクス・メディア創生学研究室

次元削減による大規模データの可視化

センサや計測機器から得られる数値データには特定の傾向やパターンが含まれていますが、データが大規模になると直接読み取ることは非常に困難になります。そこで、データを二次元空間に埋め込むことで視覚的な分析を可能とする「次元削減」が用いられています。しかし、二次元に埋め込むという強い制約の下では、従来の次元削減において情報の損失を避けることはできません。本研究では階層的なデータの次元削減に双曲空間を導入することで、従来手法よりも情報の損失を抑えながら、データ間の階層的な関係を効果的に抽出することに成功しました。

次元削減 可視化 双曲空間
メディアダイナミクス・メディア創生学研究室

最先端AIを導入した次世代インフラメンテンナンス技術の構築

道路・橋梁・トンネル・送電鉄塔などの社会インフラを対象に、画像、点検所見、視線・動作、ドローン映像等の多様なデータをAIで解析し、点検の省力化と技術継承を支援する研究を進めています。ひび割れ等の損傷検出、冬季道路の異常検知、点検者の熟練度推定などに加え、2023年には世界初となるインフラ分野に特化した生成AIを構築し、点検画像からの所見生成を実現しました。現在は、これらの成果を発展させ、点検者・技術者と協働してインフラの維持管理を担う「パートナーAI」の実現を目指しています。

インフラ点検 損傷検出 異常検知
メディアダイナミクス・メディア創生学研究室

火星衛星データからのダストストーム検出

火星探査機Mars Global Surveyorに搭載されたカメラで観測したデータから、火星のダストストームを自動検出する技術を研究しています。ダストストームは地球における台風やハリケーンに類似した嵐の一種で、火星の気象環境に影響する重要現象です。ただ、その発生頻度は少ないため、得られるデータ数に限界があります。そこで、波長帯域の異なるスペクトル画像を複数のAIで解析し、それらの結果を統合することで、データ数の限界を打破し、世界で初めてのダストストーム自動検出を実現しました。

火星 ダストストーム マルチスペクトルデータ
メディアダイナミクス・メディア創生学研究室

新材料開発・半導体製造最適化の支援技術

ゴム材料の開発や半導体製造の最適化を支援する技術を研究しています。ゴム材料の開発支援では、配合量を用いてゴム材料の物性値を予測する技術や新品と走行後のタイヤのゴム材料の変化を電子顕微鏡画像から検出する技術を実現することで、新たな材料の開発に資する知見の獲得を可能としています。半導体分野では、製造可能な量と質を担保するため、製造装置に異常が発生した際に、各種センサ情報から、どのような対処が必要かの判定を支援する技術や、製造品に欠陥が生じていないかを検査する工程を効率化する技術を実現しています。

物性推定 劣化領域推定 要因分析
メディアダイナミクス・メディア創生学研究室

LLMと知識グラフを用いた推薦システム

膨大な情報の中から、一人ひとりに合った商品やコンテンツを見つける推薦システムを研究しています。大規模言語モデル(LLM)が持つ幅広い知識を取り出し、ものごとの特徴や関係を表す「知識グラフ」に組み込みます。豊かになった知識のつながりとユーザの好みを組み合わせることで、利用履歴だけでは捉えにくい興味にも対応し、より適切な推薦を実現することを目指します。

推薦システム 知識グラフ LLM
メディアダイナミクス・メディア創生学研究室

プライバシーを保護する連合学習技術

連合学習は、複数の端末や組織が保有するデータを外部に共有することなく、共同でAIモデルを学習する技術です。各参加者は手元のデータを用いてモデルを更新し、その学習結果のみを集約することで、プライバシーを保護しながらデータを有効活用できます。医療、金融、スマートフォンなど、機密性の高いデータを扱う分野への応用が期待されています。

連合学習 プライバシー保護 分散学習
メディアダイナミクス・メディア創生学研究室

高信頼な基盤モデルの実現に向けた敵対的防御技術の確立

大規模なデータで事前学習された基盤モデルは、多様なタスクに適用可能な高い汎用性を有します。一方で、人間には知覚困難な微小摂動を加えた画像である「敵対的サンプル」に対して脆弱であることが知られており、高い安全性・信頼性が要求されるタスクへの展開における障壁となっています。そこで、基盤モデルの敵対的頑健性の向上に関する研究に取り組んでいます。特に、データや攻撃の種類ごとに獲得された防御知識をモデルマージにより統合することで、多様なデータや攻撃に対して汎用的に頑健な基盤モデルの構築を目指しています。

基盤モデル 敵対的サンプル 敵対的攻撃
メディアダイナミクス・メディア創生学研究室

マルチメディアを活用したスポーツにおける競技分析や視聴体験の高度化

スポーツに関する試合映像や実況、SNS上の反応などの多様なコンテンツから、競技者の技能評価や意思決定支援、視聴者の体験を高めるコンテンツ生成・検索につながる技術に取り組んでいます。具体的には、サッカーにおけるシュートなどの重要なプレーの発生予測、映像や実況を活用した目的のシーンの検索、SNS上の反応を活用したハイライト生成、複数視点の映像からプレーや動作の細かな違いを捉える動作差分解析などの研究を幅広く進めています。こうした研究により、競技力向上や新たな観戦体験の創出が期待されます。

マルチメディア解析 イベント予測 動画像検索
メディアダイナミクス・メディア創生学研究室

画像とテキストを同時にクエリに用いた画像検索

画像とテキストを同時に検索クエリとして用いた画像検索(構成画像検索、Composed Image Retrieval)技術を研究しています。例えば、自分の犬の特定の写真を探したい時、持ってる写真に「この犬が芝生で遊んでる」という言葉を添えて、希望に沿った画像を探します。一方、このような検索モデルの学習に使える「クエリと正解画像」の学習データが少なく、検索精度を高めるうえで課題となっています。そこで、既存な画像と言語を扱うモデルと一般的な画像とテキストのデータセットを活用することで、従来よりも高精度な画像検索を実現しました。

クロスモーダル画像検索 構成画像検索 マルチモーダルモデル
情報メディア環境学研究室

3D Gaussian Splatting表現を用いたコントラスト感度解析

3D Gaussian Splatting (3DGS) は、高品質な新規視点画像生成(novel-view synthesis)のための効率的な表現手法として、近年大きな注目を集めています。本論文では、3Dガウス表現におけるコントラスト感度を対象とした、オブジェクト空間での解析フレームワークを提案します。ガウス・プリミティブの解析的なフーリエ変換と投影スライス定理、投影されたガウス分布の空間周波数応答を推定します。この手法を中心窩レンダリングに応用し、視覚的品質を落とすことなく高速に画像を生成することを可能としています。この研究は東京科学大学との共同研究です。

3DGS コントラスト感度関数 中心窩レンダリング
情報メディア環境学研究室

CGによる水流のシミュレーションとコントロール

河川や滝のような定常的な流体の流れを制御するための新しい手法を提案します。流体が通過すべき目標点を指定することで、ユーザーが直感的に流体の動きを誘導することを可能とします。流体と地形の相互作用時に発生する斥力を利用して流れを動的に制御し、流体を目標点の周囲へと誘導します。提案法により、ユーザーは定常的な流体の流れを局所的に制御することができます。いくつかの事例を通じて本手法の有効性を示し、低計算コストで、視覚的にリアルかつユーザーの意図を反映した流体の動きを生成できるという利点を強調します。

アニメーション 流体シミュレーション コントロール
情報メディア環境学研究室

CGによる夜間光害のフォトリアルシミュレーション

人工光源は私たちの日常生活を便利にしていますが、光害と呼ばれる深刻な問題も引き起こしています。本研究では、夜空における光害を効率的に可視化する新しいシステムを提案します。光害を可視化する場合には、地上の多数の光源を考慮する必要があり、計算コストが膨大になってしまいます。そこで、事前計算された分布に対して主成分分析と高速フーリエ変換を適用することで、光害の広がりを効率的に可視化します。また、光害を低減するために必要な都市光源の強度を求める逆問題を対話的に解く手法も開発しました。

リアルな画像生成 光害 フーリエ変換
情報メディア環境学研究室

質感の識別に関する大規模ユーザスタディ

人間が物体の「材質」をどのように見分けているのかを調べるため、CGを使って金属、ガラス、プラスチックなどの画像を作成し、人に材質の違いを見分けてもらう実験を行った。光沢や透明感などの違いに加えて、光の当たり方や物体の形も変化させた。その結果、材質の見え方は光の当たり方や物体の形に大きく影響され、特に光沢の判断には個人差が大きいことが分かった。また、画像の色や模様から人間の判断をある程度説明できるものの、それだけでは完全には説明できなかった。この結果をもとに、材質の見え方を研究するためのデータベースを構築した。

視覚心理 質感認知 データベース
情報通信ネットワーク研究室

リアルタイム音声特徴量抽出回路およびその可視化システム

音声認識などで利用される各種音声特徴量の基礎となるメルスペクトルを、内部構成を書き換え可能な半導体集積回路(FPGA)上で算出し、シングルボードコンピュータ(Raspberry Pi)上で可視化するシステムを開発しました。音声特徴量は、フレーズ音声認識、異常検知、特定音検出など、さまざまな用途に利用できます。私たちは、こうしたアプリケーションと、それぞれに適した回路実装の両面から研究を進めています。

音声・音響信号処理 メルスペクトル スペクトログラム
情報通信ネットワーク研究室

LPWA (LoRa方式・920 MHz帯)の無線伝搬特性測定

低消費電力で長距離通信が可能で、IoT用途で利用されるLPWA無線LoRaについて、札幌テレビ放送(STV)の協力のもと、電測車を用いた通信実験を行いました。情報科学研究院棟屋上を送信地点とし、受信地点を江別市角山方面へ移動させながら測定し、最長11.8 kmでの通信を確認しました。さらに、周囲の建物やアンテナの高さが通信品質に与える影響を実環境で評価しました。

LPWA LoRa IoT
ワイヤレス情報通信研究室

次世代ワイヤレス通信システムのための高機能平面アンテナ技術に関する研究

新たなワイヤレス通信システムの実現には、アンテナの開発が不可欠です。近年の通信容量増大に伴い、広帯域無線通信の需要が高まっており、これに対応する広帯域アンテナの開発に取り組んでいます。また、未利用周波数帯である高マイクロ波帯やミリ波帯における新しい高速無線伝送方式に対応可能な高機能平面アンテナ技術に関する研究も進めています。

広帯域アンテナ 平面アンテナ 広帯域無線通信
ワイヤレス情報通信研究室

in silico 解析と先端通信技術で挑む、人・電波のフロンティア研究

6Gやワイヤレス電力伝送などの次世代ワイヤレス技術を対象に、電波と人体・医療機器・生活空間との相互作用を明らかにする研究です。人体や空間をin silicoで再現するデジタルツインに、大規模シミュレーションやAI・GPU計算を組み合わせ、電波ばく露と人体の安全性、植込み型医療機器への電磁干渉などを解析します。電波の物理現象の解明から生体影響の予測までを探究し、電波を安全に使うだけでなく、医療や宇宙通信など新たなワイヤレスサービスへ活かすことも見据え、人と電波が共存する未来の設計につなげます。

6G・次世代ワイヤレス デジタルツイン・in silico 医療機器EMC
情報通信フォトニクス研究室

長距離・大容量通信のための次世代光ファイバ

インターネットのデータ通信量の急増に伴い、従来の限界を超える新しい光ファイバが求められています。そこで注目されているのが、1本のファイバ内に光の通り道を複数つくる「空間分割多重」技術です。具体的にはマルチコアファイバなどが代表例で、光信号が通過する「コア」を増やすほど、送信可能なデータ量を増やすことができます。しかし、コア同士が近いと光が混ざり合って干渉してしまうため、このような混信を防ぎつつ通信性能を高めることができる新しいファイバの設計に取り組んでいます。

光ファイバ 大容量光通信 空間分割多重技術
情報通信フォトニクス研究室

コヒーレント光通信のための光トランシーバ

生成AIなどの普及で急増するデータ通信を支えるため、大容量で省エネなシリコン光トランシーバが求められています。このデバイスは、光の波の位相や振動方向(偏波)を利用する「コヒーレント光通信技術」によって、伝送可能な情報量を大幅に増やすことができます。波長や偏波ごとに異なるデータを載せる波長多重デバイスや偏波多重デバイス、光の位相情報を電気信号に変換するために必要な光90度ハイブリッドといった部品の小型化・高性能化に取り組んでいます。

大容量光通信 シリコンフォトニクス コヒーレント光通信
情報通信フォトニクス研究室

半導体デバイスの性能限界を打破する光演算デバイス

身の回りの半導体デバイスは、小型化の物理的な限界を迎えており、新たな技術が求められています。その限界を破るため、既存の電子回路と光通信技術を組み合わせた「光電融合技術」によるデバイス動作の高速化や消エネ化が期待されています。さらに将来的には、光だけで電子回路のように演算を行う「全光制御技術」の実現も期待されています。具体的には、光の経路を制御可能なプログラマブル光回路や、光で光をコントロールする光トランジスタなどの開発に取り組んでいます。

光電融合技術 プログラマブル光回路 全光制御デバイス
インテリジェント情報通信研究室

電波の「デジタルツイン」をAIで描く

6Gでは自動運転車やドローンなど移動体が高信頼な無線通信を必要としますが、電波の届き方は建物や地形に左右され、事前に知ることは困難です。私たちは、電波が届きやすい場所・届きにくい場所を地図として可視化する「チャネル知識マップ」を研究しています。少数の観測データと3次元地図から、電波伝搬をグラフ構造として表現し、深層学習で未観測地点の電波強度を高精度に推定する技術を開発しました。基地局の配置や通信経路の事前計画に役立ち、途切れない高速な無線通信の実現につながります。

チャネル知識マップ 電波伝搬推定 深層学習
インテリジェント情報通信研究室

「意味」を伝える無線通信:自動運転のためのセマンティック通信

自動運転車は周囲のカメラ映像を車両間や路側機と共有することで、死角や遠方の危険を把握できます。従来の映像伝送は画素を忠実に届けることを目的とするため、電波状態が悪化すると映像が途切れ、通信量も膨大になります。私たちは、深層学習で画像の圧縮と誤り耐性を同時に学習し、物体検出などのタスクに必要な「意味」だけを優先して伝えるセマンティック通信を研究しています。少ない通信量でも認識精度が落ちにくく、劣悪な電波環境でも品質がなめらかに低下する新しい映像伝送を目指しています。

セマンティック通信 深層学習型通信路符号化 自動運転

Cookie を有効にする

このサイトをご利用されるときは必ず「サイトポリシー」をご確認ください。このウェブサイトではサイトの利便性の向上のためにクッキーを利用します。本サイトを引き続き閲覧されることで、クッキーの使用を許可したとみなされます。