1. 定義と概要
マルチモーダル学習とは、テキスト・画像・音声・動画といった異なる種類のデータ、すなわちモダリティ(画像・テキスト・音声・動画など、情報の種類を指す言葉)を組み合わせて処理し、モダリティ間の関係性を学習させる機械学習の手法です。代表例として、テキストと画像の対応関係を学習するCLIP、そしてテキストの指示から画像を生成するDALL-Eが挙げられます。
従来のディープラーニング(人間の脳神経回路を模した多層構造で特徴を学習する機械学習の手法)は、画像なら画像だけ、テキストならテキストだけという単一のモダリティを対象にすることが基本でした。
人間は視覚や聴覚など複数の感覚情報を統合して状況を判断しており、AIも複数のデータ源を組み合わせることで、より文脈に即した理解が可能になるという発想からマルチモーダル学習は発展してきました。生成AI(文章や画像などを新たに作り出す人工知能)の普及とともに、応用範囲は広がっています。
2. 試験対策ポイント
まず押さえておきたいのは、代表的なマルチモーダルモデルの名称と役割の対応関係です。主なモデルが何と何を結び付け、どんな役割を担うのかは、次のように対応します。
| モデル | モダリティの流れ | 主な役割 |
|---|---|---|
| CLIP | テキストと画像 | 両者の意味的な関係を学習する |
| DALL-E | テキストから画像 | 指示文だけから新しい画像を生成する |
| Flamingo | 画像・動画からテキスト | 内容を説明する文章を生成する |
| Unified-IO | 複数のモダリティにまたがる | 性質の異なる複数のタスクを1つのモデルで扱う |
CLIPは、テキストと画像のペアから両者の意味的な関係を対照学習(似ているデータ同士を近づけ、異なるデータ同士を遠ざけるように学習させる手法)で捉えるモデルです。学習後は新しいカテゴリを追加学習なしで判定するゼロショット学習(一度も学習していない未知の対象についても、追加の学習なしで判定・分類できる仕組み)にも応用されます。
DALL-Eは、テキストの指示だけから新しい画像を生成するモデルです。Flamingo(画像や動画を見て、その内容を説明する文章を生成できるAIモデル)は、画像・動画のキャプション生成に加え、VQA(画像を見せて質問すると、その画像の内容について答えてくれる技術)にも強みを持ちます。
Unified-IO(物体検出や画像生成など、性質の異なる複数のタスクを1つのモデルでこなせるAIモデル)も重要な論点です。姿勢推定(人の関節の位置を推定する技術)や物体検出(画像の中から物体の位置を特定する技術)、VQA、Text-to-Image(文章の説明だけから対応する画像を生成する技術)などのタスクを扱います。複数タスクを統一的に扱えるモデルとして押さえておきたいポイントです。
応用タスクの名称と、どのモダリティの組み合わせを扱うかという対応関係も試験で扱われる観点です。Image Captioning(写真や画像を見て、その内容を説明する文章を自動で作る技術)は、画像から説明文を生成するタスクです。Visual Question Answering(VQA)は、画像と質問文という異なるモダリティの組み合わせから自然言語で回答するタスクを指します。Text-to-Image(文章の説明だけから対応する画像を生成する技術)は、テキストから画像という逆方向の変換を担います。
マルチモーダル学習は、基盤モデル(Foundation Model)、ゼロショット学習、マルチタスク学習(1つのモデルに、性質の異なる複数のタスクをまとめて学習させる手法)といった周辺概念と合わせて見ておきたいテーマです。基盤モデル(Foundation Model)は、大量のデータで事前に学習しておき、様々な用途に応用できる汎用的なAIモデルを指します。CLIPがゼロショット画像分類にも使われる点は、これらの関係を示す代表例です。
3. 関連概念との比較・相違点
マルチタスク学習との最大の違いは、複数のモダリティを統合するか、単一のモダリティの中で複数の異なるタスクを学習させるかという軸にあります。シングルモーダル処理を加えた3つを、扱うモダリティと学習の対象という軸で並べると、位置づけの違いがはっきりします。
| 手法 | 扱うモダリティ | 学習の対象 |
|---|---|---|
| シングルモーダル処理 | 単一 | 単一のデータ源の中で処理を完結させる |
| マルチタスク学習 | 単一 | 同じモダリティの中で複数の異なるタスクを扱う |
| マルチモーダル学習 | 複数 | 異なるモダリティの組み合わせと、その相互の関係性 |
マルチタスク学習は、たとえば画像認識という単一モダリティの中で、物体検出と画像分類という複数のタスクを1つのモデルに学習させる手法です。一方でマルチモーダル学習は、画像とテキストのように異なるモダリティそのものを組み合わせ、両者の関係性まで学習の対象にする点で性質が異なります。
従来型の単一データ処理であるシングルモーダル処理との違いも、取り違えやすい点のひとつです。シングルモーダル処理は、画像なら画像のみ、テキストならテキストのみという単一のデータ源を対象に処理を完結させる方式です。
これに対してマルチモーダル学習は、複数のデータ源を組み合わせ、モダリティ同士がどのように対応しているかという相互の関係性まで学習の対象にする点で異なります。CLIPが画像とテキストの対応関係を学習することは、この違いを象徴する例です。
4. ビジネス・実務での活用シナリオ
自動運転の分野では、カメラ画像に加えてレーダー(電波を使って物体の位置や速度を検知する装置)やLiDAR(レーザー光を使って周囲の物体との距離を測定するセンサー)など、複数のセンサーから得られる情報を統合します。周囲の状況をより安全に把握する仕組みが使われています。
単一のセンサーだけに頼らず複数のモダリティを組み合わせることで、悪天候や夜間など一つのセンサーだけでは判断が難しい状況でも、互いの弱点を補い合う関係にあります。
コンテンツ制作やマーケティングの現場では、テキストプロンプト(生成AIに与える指示文)からDALL-Eのような技術で画像を生成し、広告素材やデザイン案の作成にかかる工数を抑える活用が進んでいます。人手でイラストや写真素材を一から用意する工程を、テキストによる指示に置き換えられる点が、制作のスピードと選択肢の広さの両方に関わっています。
カスタマーサポートやアクセシビリティの領域でも、マルチモーダル学習は活用されています。画像に関する質問に自動で答えるVQA技術を使えば、視覚障害者向けに画像の内容を言葉で説明したり、商品画像についての問い合わせに自動で対応したりできます。人が画像を目視で確認して回答していた作業を、画像とテキストという異なるモダリティを橋渡しするAIが代替する形です。
5. 要点まとめ
- マルチモーダル学習は画像・テキスト・音声など複数のモダリティを組み合わせて処理する手法で、CLIP・DALL-E・「Flamingo」といった代表モデルの名称と役割がG検定の要点です。
- 応用タスクとして、画像に説明文を付けるImage Captioning、画像への質問に答えるVQA、テキストから画像を生成する「Text-to-Image」があります。
- マルチモーダル学習は、複数の異なるタスクを扱うマルチタスク学習や、様々な用途に応用できる基盤モデルとセットで理解する関係にあります。
6. 確認問題
問1CLIPは、テキストと画像のペアから両者の対応関係を対照学習によって学ぶモデルであり、学習後はゼロショットでの画像分類にも応用できる。
解答・解説をみる
○ 正しい
CLIP(Contrastive Language-Image Pretraining)は、テキストと画像のペアから関連性を学習する手法です。学習後は、追加学習なしで新しいカテゴリを判定するゼロショット画像分類に使われるという位置づけです。
問2DALL-Eは音声データからテキストを生成するモデルであり、音声認識タスクの代表例にあたる。
解答・解説をみる
× 誤り
正しくは、DALL-Eはテキストの指示から画像を生成するText-to-Imageモデルであり、扱うモダリティも用途も音声認識とは異なります。音声認識の事前学習モデルには、Wav2Vec(少量のラベル付き音声データでも高い精度を出せる、音声認識の事前学習モデル)などがあります。
問3画像とその画像に関する質問文という異なるモダリティを組み合わせ、質問に自然言語で回答するタスクはVisual Question Answering(VQA)と呼ばれる。
解答・解説をみる
○ 正しい
VQAは、画像と質問文という異なるモダリティの組み合わせから回答を生成するタスクです。マルチモーダルAIの代表的な応用例のひとつにあたります。

