ImageNet (G検定)

ImageNet

1. 定義と概要

ImageNetとは、フェイフェイ・リー(当時プリンストン大学に所属し、ImageNet構築プロジェクトを主導した研究者)氏らが2009年に公開した、大量の画像1枚1枚に人手でカテゴリのラベルを付与した大規模な画像データセットです。1,400万枚を超える画像に2万種類を超えるカテゴリが付与されており、画像認識モデルの学習・評価に用いる代表的なベンチマーク(性能を比較するための基準となるデータセットやテスト)の一つとして扱われています。

ImageNet登場以前の画像認識研究は、比較的小規模なデータセットを前提にアルゴリズムを工夫する方向が主流で、精度向上には限界がありました。フェイフェイ・リー氏は、研究のボトルネック(性能向上を妨げる制約要因)がアルゴリズムだけでなく、学習データの量と多様性の不足にもあると考えました。

そこでWeb上の画像を大規模に収集し、WordNet(英単語を意味のまとまりで整理した辞書的な概念体系)の考え方に沿って分類・整理する、ImageNet構築プロジェクトを立ち上げました。この大量のラベル付きデータの存在が、後にCNN(畳み込みニューラルネットワーク。画像の特徴を捉えるのに適したディープラーニングの代表的な手法)をはじめとするディープラーニングの性能を引き出す土台になったとされています。

2. 試験対策ポイント

まず整理したいのは、ImageNetの規模を示す数値です。1,400万枚を超える画像に、2万種類を超えるカテゴリのラベルが付与されている点が代表的な論点です。カテゴリの構成は、WordNet(英単語を意味のまとまりで整理した辞書的な概念体系)の階層構造に沿って設計されています。この意味のまとまりの単位はsynset(シンセット)と呼ばれ、大きなカテゴリの下に細かい下位カテゴリが入れ子状に連なる仕組みになっています。

構築プロセスも重要な論点です。画像はFlickr等のWeb上から収集されました。ラベル付けは、クラウドソーシング(インターネットを通じて不特定多数の人に作業を依頼する仕組み)を通じて人手で行われました。具体的にはAmazon Mechanical Turk(クラウドソーシングで人手の作業を依頼できるAmazon社のサービス)などが利用されており、この人手による大規模なラベル付けが、後の研究を支える土台になっています。

ImageNetの一部(1000クラス・約120万枚)を用いた画像認識コンペティションがILSVRC(画像認識の精度を競う大会)です。2012年にCNNベースのモデルが従来手法を大きく上回る精度で優勝した舞台になった点は、両者の関係にあたります(開催年や歴代モデルの変遷は姉妹記事に譲ります)。

大量のラベル付きデータの存在がディープラーニングの性能を引き出したという、データ主導のアプローチの意義も押さえておきたいポイントです。現在も画像認識モデルの事前学習(本番のタスクに入る前に、大量のデータであらかじめモデルを学習させておくこと)のベースとして広く利用されています。少量データのタスクに知識を応用する転移学習(事前学習で得た知識を、別のタスクに応用する手法)の土台になっている点にも触れておきます。

3. 関連概念との比較・相違点

ImageNetと混同されやすい名前は、何を指しているのか、そして画像1枚あたりにどこまで細かい情報を付けているのかという2つの軸で整理すると区別しやすくなります。

名称 何を指すか 画像1枚あたりに付与する情報
ImageNet 1,400万枚を超える画像を集めたデータセットそのもの 主要な1つのカテゴリラベル
ILSVRC ImageNetの一部(1000クラス・約120万枚)を使った画像認識コンペティション ImageNetの一部をそのまま利用
COCO・Open Images 物体検出・セグメンテーション向けの別系統のデータセット群 複数の物体それぞれの位置とラベル

ILSVRCとの最大の違いは、データセットと競技会という別の対象を指す関係にある点です。開催年や歴代優勝モデルの系譜は姉妹記事のILSVRCで扱います。

COCO・Open Images(1枚の画像に複数の物体の位置とラベルを付与した、物体検出・セグメンテーション向けのデータセット群)との違いは、画像1枚あたりに付与する情報の粒度にあります。ImageNetは1枚の画像に主要な1つのカテゴリラベルを付与する分類向けの設計が中心で、写っている物体が何であるかを当てるタスクに向いています。

一方でCOCOやOpen Imagesデータセットは、1枚の画像に写る複数の物体それぞれの位置とラベルを同時に付与する設計です。物体検出やセグメンテーション(画像の中の物体を画素単位で切り分ける処理)のような、より詳細なタスクに向けて発展した別系統のデータセットという位置づけになります。設計思想の違いは、どちらのデータセットで事前学習したモデルを使うかという実務上の判断にも関わってきます。

4. ビジネス・実務での活用シナリオ

EC・小売の分野では、商品画像分類システムの多くが、ImageNetで事前学習済みのモデルを土台に、少量の自社商品画像を使った転移学習で構築されています。ゼロから学習を始めるよりも、短い開発期間と少ないデータ量で実用的な精度に届く点が評価されています。

医療画像診断の分野でも、CTやX線の画像から異常を検知するモデルの開発において、ImageNetによる事前学習済みのCNNを出発点に、医療データで微調整する手法が広く採用されています。正常・異常のラベル付きデータを大量に集めにくいという、医療分野特有のデータ収集の難しさを補う役割を果たしています。

製造業の外観検査でも、製品の傷や欠陥を検出するAIが、ImageNetをもとにした事前学習済みモデルを転用する例が広がっています。限られた不良品サンプルしか集まらない現場でも、実用的な検知モデルにつなげられる転移学習の効果が表れています。

5. 要点まとめ

  • ImageNetは、フェイフェイ・リー氏らが構築した、1,400万枚を超える画像に2万種類を超えるカテゴリラベルを人手で付与した大規模画像データセットです。
  • カテゴリはWordNetの概念階層(synset)に沿って構成され、画像はWeb上から収集し、ラベル付けはクラウドソーシングで行われました。
  • 大量のラベル付きデータの存在がディープラーニングの性能を引き出し、現在も画像認識モデルの事前学習・転移学習のベースとして使われています。

6. 確認問題

問1ImageNetは、1,400万枚を超える画像に2万種類を超えるカテゴリのラベルを人手で付与した大規模画像データセットである。

解答・解説をみる

○ 正しい

ImageNetは2009年に公開され、1,400万枚を超える画像に2万種類を超えるカテゴリが付与された大規模データセットです。この規模を示す数値が試験で扱われます。

問2ImageNetのカテゴリ構成は、WordNetの概念階層(synset)に沿って設計されている。

解答・解説をみる

○ 正しい

カテゴリはWordNetのsynset(同じ意味を持つ単語のまとまり)に基づく階層構造で整理されており、大分類の下に細かい下位分類が入れ子状に連なります。

問3ILSVRCはImageNetの別名であり、両者は同一のデータセットを指す。

解答・解説をみる

× 誤り

正しくは、ImageNetは1,400万枚を超える画像を含む大規模データセットそのものです。ILSVRCはその一部(1000クラス・約120万枚)を用いた画像認識コンペティションであり、両者は別の対象を指す関係にあります。同一視する記述は誤りです。