1. 定義と概要
赤池情報量規準(AIC)とは、統計モデルの良さを一つの数値で評価するための指標です。モデルがデータにどれだけよく当てはまっているかを示す値のことを、対数尤度(当てはまりの良さを数値で表したもので、値が大きいほど当てはまりが良いとされます)と呼びます。AICは、この対数尤度に、パラメータ(モデルの中でデータから学習される数値で、たとえば回帰式の係数などがこれにあたります)の数に応じた罰則を足し合わせて算出します。
パラメータの数を増やせば当てはまりは向上しますが、その分だけ罰則も大きくなるため、値が小さいモデルほど良いとされる仕組みです。単独の数値に合格ラインがあるわけではなく、複数のモデルを比較して相対的に良し悪しを判断する点が特徴です。統計数理研究所(統計学・数理科学を専門に研究する日本の研究機関)に在籍していた赤池弘次が1971年に着想し、1973年に発表しました。
従来、モデルの良し悪しは学習データへの当てはまりの良さ、つまり誤差の小ささだけで判断されがちでした。しかしパラメータを増やせば当てはまりは必ず向上する一方、それは学習データに合わせすぎて新しいデータへの対応力が落ちる過学習(学習データに合わせすぎて、新しいデータへの対応力が落ちてしまう現象)を招きます。
当てはまりの良さとモデルの複雑さのどちらか一方だけでは評価できないという問題意識から、両方を一つの数値にまとめて比較できる指標としてAICは提唱されました。同じ説明力なら余計な仮定を増やさずシンプルなモデルを選ぶという考え方(オッカムの剃刀)と重なる発想ですが、詳しい解説は別のテーマとして扱われます。
2. 試験対策ポイント
AICの骨組みは、当てはまりの良さを表す値とパラメータ数への罰則を足し合わせた一つの数値である点に集約されます。ここでの要点は、この値が絶対的な合格基準ではなく、複数のモデルを比べて相対的に選ぶための物差しである点です。単体のAICの値だけを見て良し悪しを判断することはできず、候補となる複数のモデルのAICを算出し、最も小さい値を持つモデルを選ぶという使い方が基本になります。
パラメータの数を増やすほど、モデルは学習データの細部にまで対応できるようになるため、対数尤度は向上するのが基本的な性質です。この性質をそのまま指標にすると、パラメータを増やしただけのモデルが実質を伴わずに選ばれかねないため、AICでは増やした分に応じた罰則を同時に加算する仕組みになっています。
この背景には、同程度の説明力なら余計な仮定を増やさずシンプルなモデルを選ぶという考え方が横たわっており、AICはその発想を数値に落とし込んだ手段の一つにあたります。考案者は赤池弘次という日本人研究者で、統計数理研究所に在籍していた時期にこの指標をまとめました。固有名詞として押さえておきたい点です。
モデル選択の指標には、AICのほかにBICや交差検証もあります。BIC(ベイズ情報量規準)とは、AICと同じくモデルの良さを数値化する指標で、罰則の強さがデータの件数に応じて変わるものです。交差検証とは、データを学習用と検証用に繰り返し分割し、実際に予測させて性能を確かめる評価方法にあたります。
罰則のかけ方や評価の仕方がそれぞれ異なる、関連用語の束として整理しておきたいところです。詳しい違いは次節で比較します。
3. 関連概念との比較・相違点
BIC(ベイズ情報量規準)との最大の違いは、パラメータ数への罰則の強さがサンプルサイズ(分析に使うデータの件数)に依存するかどうかという点です。AICはサンプルサイズにかかわらずパラメータ1つあたりの罰則が一定であるのに対し、BICはデータの件数が多いほど罰則が重くなる仕組みで、より単純なモデルを選ぶ傾向があります。
交差検証との違いは、モデルを評価する近づき方そのものです。AICやBICは数式の計算だけで良さを算出する理論的な指標であるのに対し、交差検証はデータを学習用と検証用に繰り返し分割して実際に予測させ、その結果から性能を実測するアプローチにあたります。理論値で見積もるか、実測して確かめるかという違いが両者を分ける軸です。
AICとBICは計算だけで結論を出す点で共通し、交差検証は実際にモデルを動かして確かめる点で異なります。三者を並べると、それぞれの立ち位置がつかみやすくなります。
| 指標・手法 | 良し悪しの判断のしかた | 複雑さの扱い |
|---|---|---|
| AIC | 数式の計算で理論的に算出する | パラメータ1つあたりの罰則がサンプルサイズによらず一定 |
| BIC | 数式の計算で理論的に算出する | データの件数が多いほど罰則が重く、単純なモデルを選びやすい |
| 交差検証 | データを分割して実際に予測させ、性能を実測する | 罰則を足すのではなく、予測性能そのもので比べる |
罰則の設計と評価の拠り所という二つの軸で、三者の違いを見分けられます。
4. ビジネス・実務での活用シナリオ
マーケティング・需要予測の現場では、売上予測モデルに気温や曜日、広告費などの説明変数(予測に使う要素のこと)をどこまで加えるか迷う場面が生じます。変数を増やすほど過去データへの当てはまりは良くなりますが、それだけで判断すると不要な変数まで取り込んだ複雑なモデルになりがちです。AICを目安にすれば、当てはまりと変数の数のバランスが取れた組み合わせを選べます。
金融・信用スコアリングの分野では、与信モデルにどの変数を採用するかがモデルの実用性を左右する分かれ目です。変数を増やしすぎたモデルは過去の顧客データには合っていても、新規の顧客データに対しては精度が落ちる恐れがあります。AICを参考にモデルの複雑さを抑えることで、学習に使ったデータだけでなく新規の顧客データにも対応できる汎化性能(未知のデータに対して、どれだけ正しく予測できるかという能力)を確保できます。
研究開発・品質管理の現場では、実験データから不良の要因を絞り込む作業にAICが有効です。説明変数をむやみに増やすと、たまたま実験データに現れた偶然の関係まで要因として拾ってしまう恐れがあります。AICで複数のモデル案を比較しながら要因を選定すれば、再現性のある本質的な要因に絞り込めます。
5. 要点まとめ
- AICは、データへの当てはまりの良さとパラメータ数への罰則を足し合わせた指標であり、値が小さいモデルほど良いとされる相対指標です。
- 考案者は統計数理研究所の赤池弘次で、1971年の着想から1973年の発表に至りました。パラメータを増やせば当てはまりは向上する一方、過学習を招くという問題意識が背景にあります。
- BICは罰則の強さがサンプルサイズに応じて変わる点、交差検証は実際にデータを分割して予測性能を確かめる点が、AICとの違いです。
6. 確認問題
問1AICは、モデルのデータへの当てはまりの良さと、パラメータの数に応じた罰則を組み合わせた指標であり、値が小さいモデルほど良いとされる。
解答・解説をみる
○ 正しい
正しいと判断できる根拠は、AICが対数尤度と罰則という二つの要素の足し算で成り立っている点にあります。二つを一つの数値にまとめることで、複数のモデルを横並びに比較できるようになります。
問2AICは統計数理研究所に在籍していた赤池弘次によって考案され、1973年に発表された。
解答・解説をみる
○ 正しい
正しい理由は、赤池弘次が1971年にこの指標を着想し、1973年に論文として発表したという経緯にあります。日本人研究者による業績として名前とあわせて覚えておきたい事実です。
問3パラメータの数を増やすほどモデルのデータへの当てはまりは悪化するため、AICはパラメータを減らす方向にのみ働く指標である。
解答・解説をみる
× 誤り
この命題が誤りとなる根拠は、パラメータを増やすとモデルが学習データによりよく適合し、対数尤度がむしろ向上するという性質にあります。ただし増やした分だけ罰則も重くなるため、最終的なAICの値は当てはまりの改善と罰則の増加の差し引きで決まり、パラメータを減らす方向にのみ動くわけではありません。

