G検定
-
最小二乗法 (G検定)
1. 定義と概要 最小二乗法とは、観測されたデータと回帰式が予測する値との差、すなわち残差をすべて2乗してから合計した値(残差平方和)が最も小さくなるように、回…
-
潜在的ディリクレ配分法(LDA) (G検定)
1. 定義と概要 潜在的ディリクレ配分法(LDA)とは、文書集合から潜在的なトピック構造を確率的に推定する生成モデル(データがどのような確率的な過程で生まれたか…
-
k-means法 (G検定)
1. 定義と概要 k-means法とは、あらかじめ指定したクラスタ数kに基づき、データ点を最も近い重心(セントロイド。クラスタに属するデータの位置の平均を表す点…
-
情報利得 (G検定)
1. 定義と概要 情報利得とは、ある特徴量(予測に使うデータの各項目。例えば年齢や年収など)でデータを分割したときに得られる「不純度の減少量」を表す指標です。決…
-
不純度 (G検定)
1. 定義と概要 不純度(Impurity)とは、決定木(質問を繰り返しながらデータを枝分かれさせて分類や予測を行うモデル)のノード(決定木の分岐点にあたる、デ…
-
階層クラスタリング (G検定)
1. 定義と概要 階層クラスタリングとは、データ間の距離(類似度)をもとにクラスタを階層構造として構築する教師なし学習の手法です。構築の方向には2つの方式があり…
-
Heの初期値 (G検定)
1. 定義と概要 Heの初期値とは、ニューラルネットワークの重みをランダムな値で初期化する手法の一つです。前層のノード数(直前の層にあるニューロンの数)をnとし…
-
ハードクラスタリング (G検定)
1. 定義と概要 ハードクラスタリングとは、教師なし学習(正解データを与えず、データの中にある傾向や似ているもの同士をコンピュータ自身に見つけさせる学習方法)の…
-
勾配ブースティング (G検定)
1. 定義と概要 勾配ブースティングとは、アンサンブル学習(複数の学習器の予測を組み合わせて1つの精度の高い予測にする手法の総称)のうち、学習器を順番に作り、前…
-
汎化誤差 (G検定)
1. 定義と概要 汎化誤差とは、学習済みモデルが訓練データ以外の未知のデータ(テストデータや実運用データ)に対してどれだけ誤った予測をするかを表す指標です。学習…
