ビッグデータ (G検定)

ビッグデータ

1. 定義と概要

ビッグデータとは、インターネットやIoT(家電やセンサーなどモノがインターネットにつながり、データをやり取りする仕組み)の普及により日々生成・蓄積される大量かつ多様なデータ群の総称です。量・種類・発生速度の観点で、従来型のデータベースや分析ツールでは扱いきれないほどの規模になっています。

数値や表形式に整理された構造化データ(表計算ソフトのように行と列で整理されたデータ)だけでなく、テキストや画像、音声、センサーの計測値のような非構造化データ(画像や音声、自由な文章のように形式が決まっていないデータ)も含みます。具体例としては、ウェブサイトのアクセスログ、SNSの投稿データ、店舗のPOSデータ(レジでの販売情報を記録する仕組み)による購買履歴、工場設備のセンサー計測値が挙げられます。

従来は、データベースに収まる構造化データを中心に、限られた量のデータを分析する手法が主流でした。インターネットやスマートフォン、IoTの普及によってテキストや画像、センサー値のような多様な非構造化データが爆発的に生成されるようになり、データの量と種類の両面で従来の処理手法の限界を超えました。

この大量データを蓄積・処理する基盤技術と、そこから価値を引き出す機械学習の発展が結び付き、ビッグデータはAIを動かす燃料として位置づけられています。多様な形式のデータが手に入るようになったことで、学習に使えるデータの幅そのものが広がった点も、AIの性能向上を支える土台になっています。

2. 試験対策ポイント

まず押さえておきたいのは、ビッグデータの特徴整理として使われるVolume(量)・Variety(種類・多様性)・Velocity(速度)という3つの観点、いわゆる3Vです。英語表記の3つの観点は、それぞれ日本語の意味とセットで覚えておくと分類の混同を防げます。対応関係は次のとおりです。

英語表記 日本語での意味
Volume 量
Variety 種類・多様性
Velocity 速度

このうち種類・多様性の観点に関わる要点として、ビッグデータが数値や表形式に整理された構造化データだけでなく、画像や音声、自由記述のテキストのような非構造化データも含む点が挙げられます。

「データは量が多いほど良い」という理解は不十分で、量が多くても偏り(バイアス。データが特定の種類や条件にかたよっていて全体を代表できていない状態)や品質のばらつきを含む場合があります。ウェブ上のデータは特定の言語・地域・利用者層に偏りやすく、ここは取り違えやすい点です。「量が多い=信頼できる」という短絡的な理解は、修正しておきたい理解です。

第3次人工知能ブームの背景要因としては、ビッグデータの蓄積、IoTによるデータ収集の拡大、GPU(大量の計算を並列で処理できる半導体チップ)など計算資源の性能向上が挙げられます。

あわせて、大量のデータの中から規則性やパターンを見つけ出すデータマイニング(大量のデータの中から規則性やパターンを見つけ出す分析技術)という関連用語も、一緒に整理して押さえておくとよい関係です。ビッグデータ・IoT・データマイニングという3つの用語は、蓄積・収集・分析という一連の流れを構成する関係にあります。

3. 関連概念との比較・相違点

データマイニングとの最大の違いは、対象と手法の違いにあります。ビッグデータは分析対象となる大量のデータそのものを指す言葉であるのに対し、データマイニングはそこから統計学や機械学習の手法を使って規則性やパターンを見つけ出す分析技術を指します。

ビッグデータが分析の「素材」にあたるとすれば、データマイニングはその素材から価値を引き出す「手法」という関係にあります。両者は対になる関係にあり、片方だけでなくあわせて理解しておきたいところです。たとえば「ビッグデータを分析してパターンを発見する技術」という説明は、指しているのはデータマイニングの側です。

IoTとの最大の違いは、発生源と結果の違いにあります。IoTはセンサーなどモノがネットワークにつながり、データを生成・収集する仕組みそのものを指すのに対し、ビッグデータはIoTなどを通じて蓄積された大量データの量・多様性・速度という性質を指す言葉です。

IoTが情報を集める「入り口」にあたるとすれば、ビッグデータはそこから積み上がった「結果」という位置づけになります。両者の関係は、仕組みと性質という軸で切り分けて捉えられます。たとえば「センサーが数値を収集する仕組み」はIoTを指し、「収集された数値の集まりが持つ性質」はビッグデータを指します。

3つの用語の位置づけを並べると、次のように整理できます。

用語 指しているもの 一連の流れでの位置
IoT モノがネットワークにつながりデータを生成・収集する仕組み 情報を集める入り口
ビッグデータ 蓄積された大量データの量・多様性・速度という性質 積み上がった結果であり分析の素材
データマイニング 統計学や機械学習で規則性やパターンを見つけ出す分析技術 素材から価値を引き出す手法

このように、収集する仕組み・蓄積されたデータ・分析する技術のどれを指しているのかを見分けられると、説明文から用語を選ぶ場面で迷いにくくなります。

4. ビジネス・実務での活用シナリオ

小売業では、POSデータや会員の購買履歴をビッグデータとして蓄積し、データマイニングによる需要予測やレコメンドエンジン(利用者の好みに合わせておすすめの商品や情報を自動で表示する仕組み)に活用する事例が広がっています。過去の販売傾向を踏まえて発注量を調整することで、欠品や過剰在庫を抑えながら販売機会を広げられます。店舗ごとの購買データを個別に見るだけでは気づきにくい傾向も、多店舗分をまとめて分析することで見えてきます。

医療分野では、電子カルテやゲノムデータ(人の遺伝情報を記録したデータ)など多様な医療データを蓄積・分析し、疾病リスクの予測や治療法の個別最適化、創薬研究の効率化につなげる取り組みが進んでいます。患者一人ひとりのデータの傾向を踏まえた対応は、画一的な治療とは異なる精度を生み出します。多数の患者データを蓄積して初めて見えてくる関連性もあり、個人単位の記録だけでは得られない知見につながります。

交通・スマートシティの分野では、道路センサーや気象データ、交通系ICカードの利用履歴をビッグデータとして統合し、渋滞予測や公共交通の運行最適化、災害時の避難誘導に活用されています。個々の設備が発信するデータを組み合わせることで、都市全体の動きを見渡した判断につながります。単一の道路や駅の情報だけでは見えない、都市全体の人や車の動きという全体像を捉えられる点が、この分野でビッグデータが活用される理由です。

5. 要点まとめ

  • ビッグデータは量・種類・速度の3つの観点(3V)で整理される大量かつ多様なデータの総称で、構造化データと非構造化データの両方を含みます。
  • 量が多いことと品質の高さは別問題で、ウェブ上のデータは特定の言語・地域に偏りやすいという課題があります。
  • IoTによるデータ収集の拡大とビッグデータの蓄積は、機械学習・ディープラーニングの発展を支え第3次人工知能ブームの背景要因になっています。

6. 確認問題

問1ビッグデータの特徴は一般に、Volume(量)・Variety(種類・多様性)・Velocity(速度)の3つの観点で整理される。

解答・解説をみる

○ 正しい

3V(Volume・Variety・Velocity)は、ビッグデータの特徴を整理する代表的な観点として広く使われています。この3つの観点は、ビッグデータを理解するうえでの中心的な論点です。

問2ビッグデータは量が多いデータであるため、内容に偏りがなく常に高品質なデータの集合である。

解答・解説をみる

× 誤り

正しくは、量の多さと品質・偏りの無さは別の問題です。ウェブ上のデータは特定の言語・地域・利用者層に偏りやすく、量が多いことは品質を保証しません。量と品質は混同しやすい組み合わせです。

問3ビッグデータには、数値や表形式に整理された構造化データだけでなく、画像や音声、自由記述のテキストといった非構造化データも含まれる。

解答・解説をみる

○ 正しい

ビッグデータは構造化データと非構造化データの両方を含む点が分類のポイントになります。表形式のデータに限定される概念ではありません。