機械学習 (G検定)

機械学習

1. 定義と概要

機械学習とは、人間があらゆる判断基準を一つひとつプログラムに書き込まなくても、コンピュータが大量のデータを分析することで入力と出力を結ぶ規則性を自ら学習し、未知のデータに対する予測・分類・判断を行えるようにする技術やアルゴリズムの総称です。人工知能を実現するための代表的な要素技術の一つに位置づけられ、画像に写っているものを判別したり、文章の内容をいくつかのグループに分類したりする場面で広く応用されています。

人がすべての手順を書き下すのではなく、コンピュータ自身にデータから傾向をつかませる発想が土台にあります。見出した規則性をもとに、新しく与えられたデータについても同じような判断を下せるようになる点が、機械学習の実用上の価値につながっています。

従来のコンピュータプログラムは、人間が「こういう条件ならこう動く」という判断ルールをあらかじめすべて書き記すルールベースの手法が主流でした。しかし画像認識や自然言語理解のように、判断基準を人間が言葉やルールとして書き切れない複雑な事象が増え、この手法には限界が見えてきました。例外的なパターンが無数に存在する現実の問題では、ルールを網羅すること自体が難しくなっていきました。

機械学習は、大量のデータをコンピュータに与えることで規則性そのものを統計的に見出させる発想へ転換した技術として発展してきました。この転換によって、人間があらかじめ気づいていなかった規則性まで、データの中からコンピュータ自身が見つけ出せるようになりました。

2. 試験対策ポイント

G検定では、機械学習が学習データの与え方によって教師あり学習・教師なし学習・強化学習の3つに大別されるという枠組みが取り上げられます。何を手がかりに学ばせるかという観点で並べると、3つの違いがつかみやすくなります。

手法 学習に使うデータ 主な用途
教師あり学習 ラベル(データに付けられた正解の情報)付きのデータ 分類や回帰(連続する数値を予測すること)
教師なし学習 ラベルのないデータ グループ分けや情報の要約
強化学習 報酬(行動の良し悪しを数値で示すフィードバック) 報酬を最大化する行動方針の学習

強化学習では、エージェント(環境の中で行動を選び学習する主体)が報酬を手がかりに、試行錯誤を通じて行動方針を身につけていきます。3つの手法はいずれもデータから学ぶという共通点を持ちながら、正解の与え方という一点で性格が大きく異なります。

教師あり学習と教師なし学習が個々のデータそのものから答えや構造を導き出すのに対し、強化学習は行動と結果のやり取りを繰り返す中で方針を学んでいきます。この点でも、強化学習は他の二つとは学び方の性格が異なります。

機械学習の処理は、データから規則性を見出す学習(トレーニング。コンピュータが規則性を見出す過程)と、学習を終えたモデルを使って新しいデータへの答えを出す推論という2つの段階に分かれます。学習と推論というこの2段階の区別と順番を整理しておきたいところです。

学習には時間や計算資源がかかる一方、推論は学習済みのモデルを使うだけなので、比較的短い時間で結果を返せるという性格の違いもあります。学習段階でどれだけ質の高いデータを与えられるかが、推論段階での判断の精度を左右する土台になります。

人工知能・機械学習・ディープラーニングの関係も、あわせて整理しておきたいところです。人工知能という大きな概念の中に機械学習が含まれ、機械学習の代表的な手法の一つとしてディープラーニングが含まれるという入れ子構造になっています。

機械学習では、特徴量(データのどこに注目して学習するかを示す指標)を人間が設計する手法が中心です。ニューラルネットワーク(人間の脳の神経回路のしくみを模した計算モデル)を多層に重ね、特徴量の抽出までもコンピュータ自身が自動で行う点が、ディープラーニングとの分かれ目にあたります。特徴量を人間が設計する工程が残る分、機械学習を実務に取り入れる際には、その領域についての業務知識を持つ人の関与が欠かせません。

3. 関連概念との比較・相違点

ルールベースの手法との最大の違いは、判断基準を人間があらかじめすべて明示的に記述するか、データから規則性を統計的に学習するかという点にあります。両者の性格の差は、次の3つの観点で対比すると輪郭がはっきりします。

観点 ルールベースの手法 機械学習
判断基準の作り方 人間が条件分岐を書き尽くす データから規則性を統計的に学習する
想定外の例外や変化への強さ 弱く、複雑な事象には対応しにくい データを更新して学習し直すことで対応しやすい
保守・更新の負担 人手でルールを足し続ける必要がある 人手による保守の負担が軽くなる

条件そのものをデータから見つけ出すことで、機械学習はルールベースの弱点を補う技術として位置づけられます。想定外の状況が起きるたびに人手でルールを足していく従来の方法と比べると、対応の進め方そのものが変わってくるといえます。

ディープラーニングとの関係は、対立ではなく包含にあります。ディープラーニングは機械学習という大きな枠組みの中に含まれる一分野で、多層のニューラルネットワークを用いて特徴量の抽出までも自動で行う手法にあたります。

機械学習全般では人間が特徴量を設計する場面が中心になるのに対し、ディープラーニングではその設計作業自体をコンピュータに委ねる点が異なります。両者を同じ階層の対立概念として捉える説明は、取り違えやすい点として知られています。機械学習全体を主語にして語られる内容とディープラーニング固有の話を混同すると、両者の階層を取り違えることになります。

4. ビジネス・実務での活用シナリオ

製造業では、設備の稼働データやセンサー情報から機械学習でパターンを学習し、故障の予兆を検知する予知保全に活用されています。突発的な設備停止は生産計画全体に影響するため、事前に異常の兆候をつかめるかどうかが工場の稼働率を左右する要因になります。

人手による定期点検だけでは見逃しがちな微細な変化も、データの蓄積を通じて捉えられるようになってきました。点検の間隔を人手だけで最適化するには限界があるため、データに基づく予兆検知は、限られた保守要員でも異常の兆候を見落としにくくする手段として活用されています。

金融の分野では、過去の取引データや返済履歴から与信スコアやローン審査の判断基準を学習するモデルが使われています。担当者ごとに判断が揺れやすい審査業務で、過去の実績に基づく一貫した基準を適用できる点が評価されています。

処理件数が多い場面でも同じものさしで審査を進められることは、実務上の大きな利点です。審査の判断基準をモデルとして明文化しておけば、なぜその判断に至ったかを後から確認しやすくなる点も、金融機関がこの手法を取り入れる理由の一つです。

小売・マーケティングの現場では、販売実績データから需要の変動パターンを学習し、発注量や価格設定の最適化に用いられています。需要を読み違えれば欠品や過剰在庫につながるため、データに基づく予測は在庫コストを抑えるうえで欠かせない役割を担っています。

季節や天候といった変動要因を人手だけで読み切るのは難しく、データの活用が精度向上の鍵になっています。取り扱う商品の点数が多い小売ほど、人の目だけですべての需要変動を追い切るのは難しくなるため、データに基づく予測は運用の負担を軽くする役割も果たしています。

5. 要点まとめ

  • 機械学習は、コンピュータがデータから統計的に規則性を学習する技術で、教師あり学習・教師なし学習・強化学習の3つに大別されます。
  • ルールベースの手法は人間がルールを記述するのに対し、機械学習はデータから規則性を学習する点が異なり、人工知能・機械学習・ディープラーニングはこの順に包含される関係にあります。
  • 処理は学習(データから規則性を見出す過程)と推論(学習済みモデルで予測を出す過程)の2段階に分かれます。

6. 確認問題

問1機械学習は、正解ラベルの有無や報酬の有無に応じて、教師あり学習・教師なし学習・強化学習の3つに大別される。

解答・解説をみる

○ 正しい

教師あり学習は正解ラベル付きのデータ、教師なし学習は正解ラベルのないデータ、強化学習は報酬を手がかりに学習する点で3つに分かれます。データの与え方の違いが分類の基準になっています。

問2機械学習とルールベースの手法は、どちらも人間があらかじめすべての判断基準をプログラムとして記述する点で共通している。

解答・解説をみる

× 誤り

正しくは、ルールベースの手法が人間があらかじめ判断ルールをすべて記述するのに対し、機械学習はデータから規則性を統計的に学習する点で異なります。両者を同一視する記述は取り違えやすい点です。

問3ディープラーニングは機械学習の一分野であり、多層のニューラルネットワークを用いて特徴量の抽出までも自動で行う手法である。

解答・解説をみる

○ 正しい

人工知能・機械学習・ディープラーニングは入れ子の包含関係にあり、ディープラーニングは機械学習の中でも特徴量の自動抽出まで担う手法にあたります。