1. 定義と概要
Random Erasingとは、画像内にランダムな位置・サイズ・縦横比(四角形の縦の長さと横の長さの比率)で矩形領域(画像の中の四角い範囲)を選ぶデータ拡張の手法です。選んだ領域の画素値(画像を構成する一つひとつの点、ピクセルが持つ色の濃さを表す数値)を、ランダムな値で置き換えることで、意図的に画像の一部を隠します。埋める値はRGBそれぞれ0から255の範囲から一様に決まります。
2017年にZhong氏らによって提案されました。矩形の形状・位置だけでなく、埋める値までランダムに決まる点が特徴です。この特徴により、遮蔽(オクルージョン。撮影対象の一部が他の物体などに隠れて見えなくなること)を伴う訓練画像を、人工的かつ多様に生成できます。
実際に撮影された画像では、人物や物体の一部が別の物体や画角の外側によって隠れる遮蔽が日常的に起こる状況です。訓練データがきれいに写った画像に偏っていると、モデルは隠れのある画像に対して精度を落としやすくなります。
Random Erasingは矩形領域をランダムな値で塗りつぶすことで、擬似的に隠れのある画像を大量に生成し、モデルが画像の一部分だけに依存せず全体の特徴から判断できるよう促す手続きです。この手法自体には学習すべき重みがなく、既存のCNN(畳み込みニューラルネットワーク。画像の特徴を段階的に読み取っていくニューラルネットワークの一種)ベースの認識モデルにそのまま組み込みやすい点も特徴とされています。
2. 試験対策ポイント
Random Erasingの手続きの核は、矩形領域のサイズ・縦横比・位置に加えて、埋める値までランダムに決める点です。位置とサイズだけをランダムにする類似手法との違いを整理するうえでの中心的な論点になります。
ねらいとしては、訓練データに欠損や遮蔽を人為的に持たせることで、モデルが画像中の特定部位だけに依存する状態を避けられる点です。これにより、過学習(モデルが訓練データだけに過剰に適合し、新しいデータではうまく機能しなくなること)の抑制と、遮蔽への頑健性の向上につながるとされています。
画像の一部を隠す・混ぜる系統の関連用語として、まずCutoutが挙げられます。塗りつぶしに使う値は、ゼロやグレーのような一定値です。
そのほか、Mixup(2枚の画像とラベルを一定の比率で線形に混ぜ合わせて新しい学習データを作る手法)も関連用語の一つです。同様に、CutMix(一方の画像の矩形領域を別の画像の該当部分で置き換え、ラベルも面積の比率で混ぜる手法)も、あわせて整理される関連用語の束にあたります。それぞれ、画像の情報をどう欠損・混合させるかというアプローチが異なります。
3. 関連概念との比較・相違点
Cutoutとの最大の違いは、埋める値が固定値か、ランダムな値かという点です。Cutoutでは多くの場合、ゼロやグレー、データセットの平均値といった一定の値で矩形領域を塗りつぶします。一方、Random Erasingでは埋める値そのものがランダムに決まる点が特徴です。
矩形のサイズ・縦横比・位置についても違いがあり、Cutoutは概ね固定的であるのに対し、Random Erasingはいずれもランダムに決定されます。両者は2017年にほぼ同時期に、独立して提案された近縁の手法です。
Mixupは2枚の画像とラベルを一定の比率で線形に混ぜ合わせる手法、CutMixは一方の画像の矩形領域を別の画像の該当部分で置き換えラベルを面積比で混ぜる手法です。いずれも複数の画像を組み合わせる点で、1枚の画像を単独で加工するRandom Erasing・Cutoutとは異なります。
四つの手法は、使う画像の枚数と加工のしかたという二つの軸で並べると輪郭がはっきりします。
| 手法 | 使う画像 | 加工のしかた |
|---|---|---|
| Random Erasing | 1枚を単独で加工 | サイズ・縦横比・位置をランダムに決めた矩形領域を、ランダムな値で塗りつぶします |
| Cutout | 1枚を単独で加工 | 概ね固定的な矩形領域を、ゼロやグレー、データセットの平均値といった一定値で塗りつぶします |
| Mixup | 2枚を組み合わせ | 画像とラベルを一定の比率で線形に混ぜ合わせます |
| CutMix | 2枚を組み合わせ | 一方の矩形領域を別の画像の該当部分で置き換え、ラベルを面積比で混ぜます |
こうして並べると、Random ErasingとCutoutは同じ「1枚を隠す」系統の中で埋める値と矩形の決め方が分かれる関係にあると分かります。この隣り合った二つの区別は、取り違えやすい重要な論点です。
4. ビジネス・実務での活用シナリオ
防犯カメラの映像では、人物の一部がバッグや他の通行人に隠れる場面が多く見られます。遮蔽を再現した訓練データによる学習は、隠れのある人物画像でも同一人物と判定しやすい人物照合(異なるカメラや時刻で撮影された人物が同一人物かどうかを判定する技術)モデルづくりに役立つ取り組みです。
自動運転では、走行中に前方車両や標識の一部が他の物体で隠れる場面が起こり得ます。矩形領域を隠した画像で学習することは、部分的にしか見えない物体でも検出を継続しやすい物体検出(画像の中から特定の物体の位置と種類を認識する技術)モデルにつながる取り組みです。
小売の棚卸しでは、陳列棚の商品画像で手前の商品や什器によって一部が隠れることが多くあります。隠れを想定した学習は、部分的にしか写っていない商品でも認識精度を落としにくいモデルにつながる工夫です。
5. 要点まとめ
- Random Erasingは、画像内のランダムな矩形領域をランダムな値で塗りつぶし、意図的に隠れ・欠損を持つ画像を生成するデータ拡張の手法です。
- Cutoutとの違いは、埋める値が固定か(Cutout)ランダムか(Random Erasing)、および矩形のサイズ・縦横比・位置までランダムに決めるかどうかにあります。
- 遮蔽への頑健性の向上と過学習の抑制がねらいで、画像分類だけでなく物体検出や人物照合といった分野でも効果が確認されています。
6. 確認問題
問1Random Erasingは、画像内に選んだ矩形領域の画素値を、0から255の範囲のランダムな値で置き換える手法である。
解答・解説をみる
○ 正しい
定義そのものにあたります。埋める値がランダムである点が、埋める値を一定値とするCutoutとの違いの中心にあたります。
問2Random Erasingでマスクする矩形領域は、Cutoutと同様にサイズがあらかじめ固定されている。
解答・解説をみる
× 誤り
正しくは逆で、Random Erasingは矩形のサイズ・縦横比・位置もランダムに決定されます。サイズが固定的な点はCutoutの特徴にあたります。
問3Random Erasingで人為的に遮蔽(オクルージョン)を含む訓練画像を作ることは、遮蔽への頑健性の向上や過学習の抑制につながるとされる。
解答・解説をみる
○ 正しい
訓練データに欠損・隠れを持たせることで、モデルが画像の一部分だけに依存しにくくなるという手続きのねらいにあたります。

