1. 定義と概要
データクレンジングとは、データベースやファイルに蓄積されたデータの誤り・重複・欠損や書き方の食い違いなどを検出し、修正または削除する作業のことです。こうした手直しによってデータの品質を高め、分析やAIの学習に適した状態へ整えます。
代表的な作業は、取り除きたい『汚れ』の種類ごとに整理できます。
| データの汚れ | 主な対応 |
|---|---|
| 欠損値(本来データがあるはずの箇所で記録されていない状態) | 処理して埋めるか取り除く |
| 外れ値(他の大多数のデータから大きく離れた値) | 検出する |
| 重複レコード(同じ内容が誤って複数回登録されているデータ) | 除去する |
| 表記ゆれ(同じ対象を指すのに文字の書き方が揃っていない状態) | 統一する |
| 日付・数値の書式の食い違い | 型・形式を修正する |
どれも高度な分析手法ではなく、確認と修正の積み重ねにあたる地道な作業です。ただし、この段階をどれだけ丁寧に行うかが、後に続く分析やAIの学習の土台を決めることになります。
従来、機械学習プロジェクトの現場ではモデルやアルゴリズムの工夫に関心が向く傾向がありました。しかし、入力するデータそのものに誤りや汚れが多ければ、どれほど優れたモデルを使っても信頼できる結果は得られません。
この考え方はGIGO(Garbage In, Garbage Out:質の低いデータを入力すれば質の低い結果しか得られないという原則)として整理されています。モデルを構築する前段階でデータの誤り・汚れを取り除くデータクレンジングは、AIプロジェクト全体の精度を左右する工程のひとつに位置づけられます。
2. 試験対策ポイント
まず整理しておきたいのは、欠損値への対応方法です。欠損値の処理には、欠損値を含む行そのものを取り除くリストワイズ削除(欠損値を含む行ごと取り除いて対応する方法)と、平均値・中央値・最頻値や前後の値で埋める補完(欠損している値を推定値で埋める方法)の大きく2つの方向性があります。どちらを選ぶかによって、手元に残るデータ量と分析結果の精度のバランスが変わります。
外れ値についても、あわせて整理しておきたいところです。外れ値のうち、入力ミスなど原因がはっきりしているものは異常値(外れ値のうち原因が明確なもの)と呼ばれ、区別されることがあります。外れ値をそのまま使うか、原因を確認したうえで除外・補正するかは、分析の目的によって判断が分かれるところです。
重複レコードの除去では、別々に登録された同一人物・同一企業のデータを1つにまとめる名寄せ(別々に登録された同一人物・同一企業のデータを1つにまとめる作業)が、あわせて行われることが多くなっています。表記ゆれの統一も、『株式会社』と『(株)』、全角と半角、大文字と小文字、日付形式などの違いをルールに沿ってそろえる作業であり、データを機械的に集計・突合する前提として欠かせません。
データクレンジングは、データの前処理という大きな枠組みの一部です。値のスケールをそろえる正規化(データの値の範囲を一定の基準にそろえる処理)と標準化(データの平均と散らばり具合を一定の基準にそろえる処理)は、代表的な前処理手法として並んで扱われます。
カテゴリ変数を数値に変換するエンコーディング(文字や種類のデータを数値に変換する処理)や、正解ラベルを付与するアノテーション(データに正解ラベルを付ける作業)も、あわせて整理される前処理手法です。それぞれ目的が異なる作業として区別される点が、取り違えやすいところです。
AIプロジェクトの現場では、モデルの構築そのものよりもデータの前処理に多くの時間が割かれるという指摘が広く共有されており、データクレンジングはその中心的な作業のひとつに位置づけられます。
3. 関連概念との比較・相違点
他の前処理手法と並べると、データクレンジングの守備範囲がはっきりします。それぞれが何をする作業なのかを整理すると、次のようになります。
| 手法 | 何をする作業か |
|---|---|
| データクレンジング | データに含まれる誤り・重複・表記ゆれといった『汚れ』を直す |
| 正規化・標準化 | すでに正しく整ったデータの数値の範囲や散らばり方をそろえる |
| アノテーション | データに新たに正解ラベルを付与する |
| エンコーディング | 整ったカテゴリ変数を機械学習が扱える数値に変換する |
正規化・標準化との最大の違いは、対象とする問題の性質にあります。データクレンジングはデータに含まれる誤り・重複・表記ゆれといった『汚れ』を直す前段の整形作業であるのに対し、正規化・標準化はすでに正しく整ったデータの数値の範囲や散らばり方をそろえる作業です。データの質を扱うか、数値のスケールを扱うかという違いとして整理できます。
アノテーションとの違いは、作業の目的にあります。データクレンジングは既存データの誤りを検出・修正する作業であるのに対し、アノテーションはデータに新たに正解ラベルを付与する作業です。どちらも前処理の一部ですが、片方は誤りを取り除き、もう片方はラベルを付け加える点で役割が異なります。
エンコーディングとの最大の違いは、扱う課題の段階にあります。データクレンジングはデータの誤り・汚れを取り除く作業であるのに対し、エンコーディングは整ったカテゴリ変数を機械学習が扱える数値に変換する作業です。汚れを取り除く工程がすんだ後に、数値への変換が行われる関係にあります。
4. ビジネス・実務での活用シナリオ
小売・EC業界では、複数のシステムに散らばった顧客リストの重複レコードを名寄せで統合する取り組みが行われています。同じ顧客を別人として扱ったままだと、同じ商品を二重に発送したり、請求を二度送ってしまったりする事故につながりかねません。データを1件ずつ正しく紐づけておくことが、正確な購買分析や適切な顧客対応の土台になります。
金融・与信審査の分野では、申込データに含まれる欠損値や、住所・法人名の表記ゆれを統一する作業が欠かせません。入力項目が抜けていたり、『株式会社』と『(株)』のような表記が入り混じっていたりすると、与信スコアリングモデル(返済能力などを点数化して評価する仕組み)が入力データを正しく認識できなくなります。データの精度を保つことは、審査結果の信頼性を支える前提です。
製造業・IoTの現場では、センサーから集めた稼働データに含まれる外れ値を検出・除去する処理が行われます。センサーの一時的な故障などによる異常な値をそのまま学習に使うと、正常な状態を異常と誤って判定する誤検知が増えてしまいます。汚れたデータを事前に取り除いておくかどうかが、予知保全モデル(設備の故障を事前に予測する仕組み)の精度を左右するポイントです。
5. 要点まとめ
- データクレンジングとは、収集データの誤り・重複・表記ゆれ・欠損などを修正または削除し、分析やAIの学習に使える状態に整える作業であり、欠損値処理・外れ値検出・重複レコードの除去・表記ゆれの統一・型の修正が代表的な作業として整理されます。
- GIGO(Garbage In, Garbage Out)という考え方が示すとおり、質の低いデータを入力すればモデルの出力も質が低くなるため、データクレンジングはモデル構築前に欠かせない工程です。
- 正規化・標準化、アノテーション、エンコーディングなど他の前処理手法とは目的が異なり、データクレンジングはあくまでデータそのものの誤り・汚れを直す作業として区別されます。
6. 確認問題
問1データクレンジングとは、収集したデータに含まれる誤り・重複・表記ゆれ・欠損などを検出し、修正または削除して分析やAIの学習に使える状態に整える作業のことである。
解答・解説をみる
○ 正しい
データクレンジングは、データそのものの誤りや汚れを取り除いてデータの品質を高める作業であり、欠損値処理・外れ値検出・重複除去・表記ゆれの統一などが代表的な作業にあたります。
問2GIGO(Garbage In, Garbage Out)とは、質の低いデータを入力しても、AIの学習アルゴリズムが自動的に誤りを補正するため、出力の質には影響しないという考え方である。
解答・解説をみる
× 誤り
正しくは逆で、質の低いデータを入力すれば質の低い結果しか得られないという考え方です。この原則があるために、モデルを構築する前段階でデータの誤りや汚れを取り除く工程が欠かせません。逆向きの記述は取り違えやすい点です。
問3『株式会社』と『(株)』のように、同じ対象を指すのに書き方が異なる状態を統一する作業は、データクレンジングにおける表記ゆれの統一にあたる。
解答・解説をみる
○ 正しい
法人格の表記や全角・半角、日付形式などの違いをルールに従ってそろえる表記ゆれの統一は、データを機械的に集計・突合する前提を整えるデータクレンジングの代表的な作業のひとつです。

