1. 定義と概要
Mixupとは、2枚の画像を一定の比率で重ね合わせて1枚の新しい合成画像を作り、正解ラベルも同じ比率で混ぜ合わせるデータ拡張の手法です。2017年に発表された論文「mixup: Beyond Empirical Risk Minimization」で提案されました。
例えば犬の画像を80%、猫の画像を20%の割合で重ねた合成画像を作った場合、正解ラベルも「犬80%・猫20%」という混合ラベルとして学習に用いられます。画像の各画素の値を指定した割合で足し合わせる処理のため、犬と猫の輪郭が薄く重なり合った1枚の画像が出来上がる仕組みです。混ぜる割合を変えれば、同じ2枚の画像からいくらでも違う学習データを作り出せます。
データ拡張には、1枚の画像に回転や反転などの変換を加える手法に加えて、複数の画像を組み合わせて新しいデータを作る手法群があります。Mixupはこの後者を代表する手法です。
発表後は画像分類タスクでの精度向上や過学習(モデルが学習データだけに過剰に適合し、新しいデータではうまく機能しなくなること)の抑制効果が確認されました。この成果を受けて、後続で提案されたCutMixをはじめとする「2枚の画像を混ぜる」系統の手法群の起点となりました。
2. 試験対策ポイント
まず整理したいのは、Mixupの仕組みです。2枚の画像の画素値を指定した割合で足し合わせて合成画像を作るとともに、正解ラベルも同じ割合で混ぜ合わせます。画像とラベルの両方を同じ割合で混ぜるという対応関係が、Mixupを理解するうえでの中心的な論点です。
この仕組みによって生じる効果として、クラス同士の境目である決定境界(モデルがデータをクラスごとに分ける境目のライン)をなだらかにする正則化(モデルの複雑さを抑えて過学習を防ぐ、学習の仕方を調整する工夫)の効果が挙げられます。
正解ラベルを0か1かの二値ではなく連続的な混合値にすることで、モデルが特定のクラスに対して極端に自信過剰な予測をしにくくなる点も、この手法の効果のひとつです。過学習の抑制は、汎化性能(学習に使っていない新しいデータに対しても正しく予測・判断できる力)の向上につながります。
一方で、2枚の画像を画素単位で重ね合わせるため、合成画像が人の目には不自然な半透明の二重写しのように見えることがあります。この不自然さの解消を狙って提案されたのがCutMixであり、両者の仕組みの違いは中心的な比較の論点です。
Cutout(画像の一部を四角く塗りつぶして隠す手法)・Random Erasing(画像の一部をランダムな値で塗りつぶして隠す手法)・Mixup・CutMixはいずれもデータ拡張の発展的な手法です。CutoutとRandom Erasingは1枚の画像を加工する手法、MixupとCutMixは2枚の画像を混ぜる手法という大分類の違いがあります。この分類軸は、4手法の位置づけの整理につながる点です。
3. 関連概念との比較・相違点
CutMixとの最大の違いは、画像の混ぜ方にあります。Mixupは2枚の画像全体を一定の比率で半透明に重ね合わせる手法である一方、CutMixは一方の画像の矩形領域を別の画像の該当部分で置き換える切り貼りの手法です。
ラベルの混ぜ方も対応して異なり、Mixupは重ね合わせの比率、CutMixは置き換えた領域の面積比率でラベルを混ぜます。両方ともラベルを混ぜる点は共通しますが、画素をなじませるか領域ごと入れ替えるかという仕組みの違いが、この2手法を比較するうえでの軸です。
CutoutやRandom Erasingとの違いは、加工する画像の枚数とラベルの扱いにあります。Cutoutは画像の矩形領域を一定の値で塗りつぶし、Random Erasingは矩形領域をランダムな値で埋める手法で、いずれも1枚の画像だけを加工するにとどまり、正解ラベルは元のまま変わりません。これに対してMixupとCutMixは2枚の画像を混ぜ合わせ、ラベルも混ぜる点が根本的に異なります。
4つの手法を、使う画像の枚数・加工のしかた・正解ラベルの扱いという3つの観点で並べると、次のように整理できます。
| 手法 | 使う画像 | 加工のしかた | 正解ラベル |
|---|---|---|---|
| Mixup | 2枚 | 画像全体を一定の比率で半透明に重ね合わせる | 重ね合わせの比率で混ぜる |
| CutMix | 2枚 | 一方の画像の矩形領域を別の画像の該当部分で置き換える | 置き換えた領域の面積比率で混ぜる |
| Cutout | 1枚 | 矩形領域を一定の値で塗りつぶす | 元のまま変わらない |
| Random Erasing | 1枚 | 矩形領域をランダムな値で埋める | 元のまま変わらない |
1枚を加工するか2枚を混ぜるかという分類が、4手法の関係を整理するうえでの軸です。ラベルを混ぜるかどうかもこの分類と対応しているため、枚数とラベルの扱いをセットで覚えておくと取り違えにくくなります。
4. ビジネス・実務での活用シナリオ
製造業の外観検査(製品にキズや汚れなどの不良がないか画像で確認する検査)の現場では、良品画像と不良品画像をMixupで混ぜ合わせた合成画像を学習データに加える取り組みがあります。境界線上の微妙な不良、たとえばかすかな傷などに対するモデルの過信を抑え、判定の頑健性を高めることにつながる取り組みです。
医療画像診断の分野では、症例数の少ない疾患の画像と健常な画像をMixupで混合して学習に用いる事例があります。限られたデータからでも、極端に断定的な誤判定を避けたなだらかな判断境界を学習できる点が意義です。症例を新たに集めること自体が難しい領域では、手元のデータから学習の材料を増やせる手法の価値は小さくありません。
画像分類コンペティションや研究開発の現場でも、Mixupは活用されています。Kaggle に代表される画像分類のコンペティションでは、MixupとCutMixを組み合わせて汎化性能を高めるテクニックが広く使われています。
5. 要点まとめ
- Mixupは2枚の画像を一定の比率で重ね合わせ、正解ラベルも同じ比率で混ぜ合わせるデータ拡張の手法です。
- 決定境界をなだらかにする正則化効果があり、過学習の抑制と汎化性能の向上につながります。
- 画像全体を重ねるMixupと矩形領域を切り貼りするCutMixの違い、1枚の画像を加工するCutout・Random Erasingとの大分類の違いを押さえておきたい点です。
6. 確認問題
問1Mixupは、2枚の画像を一定の比率で重ね合わせて合成画像を作るとともに、正解ラベルも同じ比率で混ぜ合わせる手法である。
解答・解説をみる
○ 正しい
Mixupの定義そのものです。画像を混ぜた比率とラベルを混ぜた比率がそろっている点が、この手法の要になります。片方だけを混ぜても成立しません。
問2CutMixは、Mixupと同様に2枚の画像をピクセル単位で半透明に重ね合わせる手法である。
解答・解説をみる
× 誤り
正しくは、CutMixは一方の画像の矩形領域を別の画像の該当部分で置き換える手法であり、画像全体を重ね合わせるMixupとは仕組みが異なります。ラベルも面積比率で混ぜる点が異なります。
問3Cutoutは1枚の画像の矩形領域を塗りつぶす手法であり、Mixupのように2枚の画像を混ぜ合わせる手法ではない。
解答・解説をみる
○ 正しい
CutoutとRandom Erasingは1枚の画像を加工する手法、MixupとCutMixは2枚の画像を混ぜる手法という大分類の違いがあります。

