1. 定義と概要
Cutout(カットアウト)とは、学習用の画像中のランダムな位置に固定サイズの正方形(または矩形)領域を設定する手法です。設定した領域を一定の値(多くの実装では黒=ゼロ、または画像の平均的な画素値)で塗りつぶし、画像の一部を意図的に隠した状態を作り出します。2017年に、提案者のDeVries氏とTaylor氏によって発表された手法です。1枚の画像だけで完結する変換であり、ラベル(画像に対して「犬」「猫」のように正解を示す情報)は変更しません。
こうした一手間を加える背景には、画像認識モデルの性質があります。画像認識モデルは、対象物の中でも特に目立つ一部分(例えば動物の顔や特徴的な模様)だけに着目して判別してしまう傾向があります。この状態のままだと、実際の場面でその部分が何かに隠れてしまった場合にうまく認識できなくなります。
そこで、あえて学習時に画像の一部を隠した状態を経験させることで、画像全体の文脈や複数の特徴を組み合わせて判断する力を養おうとするのがCutoutの狙いです。目立つ手がかりが使えない状況を、学習データの側で作り出す発想といえます。
回転や反転といった基本的な変換に対して、Cutoutは画像の一部を隠す系統の発展的な手法の一つに位置づけられます。同時期に提案されたRandom Erasing(隠す領域のサイズ・縦横比・位置に加え、埋める値もランダムに決める手法)も同じ系統に含まれます。後発のCutMix(一方の画像の一部を別の画像の該当部分で置き換え、ラベルは面積の比率で混ぜる手法)も同様です。
2. 試験対策ポイント
まず整理したいのは、Cutoutの目的です。モデルが画像中の特定の局所的な特徴だけに依存することを防ぐ狙いがあります。対象物の一部が隠れる状況であるオクルージョン(対象物の一部が別のものに隠れて見えなくなっている状態)への頑健性と汎化性能(学習に使っていない新しいデータに対しても正しく予測・判断できる力)を高めることも目的の一つです。
Cutoutは過学習(モデルが学習データだけに過剰に適合してしまい、新しいデータではうまく機能しなくなること)を抑える正則化(モデルの複雑さを抑えて過学習を防ぐ、学習の仕方を調整する工夫)的な効果を持つ手法として整理されます。
手法の具体的な特徴としては、隠す領域は固定サイズの正方形であること、位置はランダムに決まること、塗りつぶす値は一定であること(多くはゼロや画像の平均値)が挙げられます。1枚の画像だけで完結し、ラベルの変更が不要な点も特徴です。
画像の一部を隠す系統の発展的なデータ拡張手法として、Random Erasing・Mixup(2枚の画像とラベルを一定の比率で線形に混ぜ合わせる手法)・CutMixとあわせて整理しておきたいところです。それぞれ隠し方や画像・ラベルの扱いが異なり、取り違えやすい点でもあります。
回転・反転・拡大縮小といった基本的な変換とは異なり、Cutoutは画像の一部を意図的に欠損させる点が特徴であり、データ拡張全体における位置づけを理解するうえでの論点の一つです。
3. 関連概念との比較・相違点
Random Erasingと比べると、隠す領域の決め方に違いがあります。Cutoutは隠す領域のサイズが固定で塗りつぶす値も一定である一方、Random Erasingは領域のサイズ・縦横比・位置に加えて埋める値もランダムに決めます。両者はほぼ同時期に提案された手法で、隠す領域の決め方という軸で区別される関係です。
Mixupとの最大の違いは、加工する画像の枚数です。Cutoutが1枚の画像の一部を隠すのに対し、Mixupは2枚の画像とラベルを一定の比率で線形に混ぜ合わせ、画像同士を重ね合わせます。単一画像内の加工か、2画像の合成かという違いがあります。
CutMixとの違いは、隠した領域の埋め方という点です。Cutoutが隠した領域を一定の値で塗りつぶすのに対し、CutMixは一方の画像の矩形領域を別の画像の該当部分で置き換え、ラベルは面積の比率で混ぜ合わせます。領域を「隠す」か「別の画像で埋める」かという違いです。
四つの手法を、使う画像の枚数と加工の内容という軸で並べると、対応関係が見えてきます。
| 手法 | 使う画像 | 領域・画像の扱い |
|---|---|---|
| Cutout | 1枚 | 固定サイズの正方形領域を一定の値で塗りつぶす |
| Random Erasing | 1枚 | 領域のサイズ・縦横比・位置に加え、埋める値もランダムに決める |
| Mixup | 2枚 | 2枚の画像とラベルを一定の比率で線形に混ぜ合わせる |
| CutMix | 2枚 | 一方の画像の矩形領域を別の画像の該当部分で置き換え、ラベルは面積の比率で混ぜる |
Cutoutは表の一番上、つまり1枚の画像で完結しラベルも変えない側に位置します。どの軸で比べているのかを意識すると、似た名前の手法を区別しやすくなります。
4. ビジネス・実務での活用シナリオ
小売・セルフレジの分野では、商品が手や他の商品で一部隠れた状態でカメラに映っても品目を認識できるよう、Cutoutで隠れを疑似的に経験させたモデルを学習させます。これにより、誤認識によるレジ精算のトラブルを減らすことにつながります。
自動運転・監視カメラの分野では、歩行者や車両が電柱・他の車両などに一部隠れて写る状況でも検知精度を保てるよう、遮蔽への頑健性を高めた物体検出モデルを構築するのが狙いです。実際の道路や現場では、対象物が完全に見える場面ばかりではないため、隠れを想定した学習には意義があります。
医療画像診断支援の分野では、病変部が周辺組織と重なって一部しか写らない画像でも判別できるよう、限られた症例数のデータからでも頑健な診断支援モデルを学習させます。症例数を増やしにくい医療分野では、少ないデータから頑健性を引き出す工夫という位置づけです。
5. 要点まとめ
- Cutoutは、画像中のランダムな位置に固定サイズの正方形領域を設け、一定の値で塗りつぶして画像の一部を隠すデータ拡張の手法であり、オクルージョンへの頑健性と汎化性能の向上を狙います。
- 領域のサイズ・埋める値が固定である点でRandom Erasing(すべてランダム)と異なり、1枚の画像で完結しラベルを変更しない点でMixup・CutMix(複数画像・ラベルの混合)と異なります。
- 回転・反転などの基本的な変換とは別系統の、画像の一部をあえて隠す発展的な手法として、Random Erasing・Mixup・CutMixとの違いを踏まえて理解しておきたい点です。
6. 確認問題
問1Cutoutは、学習用画像のランダムな位置に固定サイズの正方形領域を設定し、その領域を一定の値で塗りつぶすことで画像の一部を隠すデータ拡張の手法である。
解答・解説をみる
○ 正しい
Cutoutの定義そのものです。領域のサイズと塗りつぶす値が一定である点が、後述のRandom Erasingとの違いにもなります。
問2Cutoutは、隠す領域のサイズや縦横比、塗りつぶす画素の値もすべてランダムに決める手法である。
解答・解説をみる
× 誤り
領域のサイズ・縦横比・埋める値までランダムに決めるのはRandom Erasingの特徴です。正しくは、Cutoutは領域のサイズが固定で、塗りつぶす値も一定(ゼロや画像の平均値など)である点が異なります。
問3Cutoutは1枚の画像に対して行う変換であり、Mixupのように2枚の画像とラベルを混ぜ合わせる必要はない。
解答・解説をみる
○ 正しい
Cutoutは1枚の画像だけで完結し、ラベルの変更も不要です。2枚の画像とラベルを一定の比率で線形に混ぜ合わせるMixupとは、この点で扱いが異なります。

