過学習(overfitting)

過学習(overfitting)は、モデルが訓練データの特徴を「覚えすぎ」て、未知のデータでうまく予測できなくなる現象です。 訓練データではほぼ満点なのに、テストデータや本番データでは精度が大きく落ちる、という形で表に出ます。 ...

2026年5月24日 · 更新: 2026年8月5日 · 5 分 · nchika

バイアス-バリアンス分解(bias-variance tradeoff)

バイアス-バリアンス分解(bias-variance decomposition)は、教師あり学習の期待誤差を「Bias の 2 乗」「Variance」「ノイズ(既約誤差)」の 3 項に切り分ける枠組みです。モデルが外す原因を「表現力が足りない(high bias)」と「訓練データの揺らぎに過敏(high variance)」のどちらか(あるいは両方)に診断し、次の打ち手を選ぶための判断軸として使います。 ...

2026年5月25日 · 更新: 2026年8月5日 · 8 分 · nchika

正則化(regularization)

正則化(regularization)は、過学習を抑えるためにモデルの「複雑さ」へペナルティを課す仕組みです。 学習時に最小化する損失関数に、パラメータの大きさを表す項を足すことで、極端に大きな重みを持つモデルが選ばれにくくなります。 ...

2026年5月24日 · 更新: 2026年8月5日 · 4 分 · nchika

交差検証(cross validation)

交差検証(cross validation, CV)は、限られた学習データを「訓練用」と「検証用」に何通りも分け直して評価することで、モデルの性能をより安定して見積もる手法です。 1 回だけの分割では「たまたま簡単/難しい分割を引いた」せいで結果がブレるので、分割の組み合わせを変えながら平均を取って判断します。 ...

2026年5月24日 · 更新: 2026年8月5日 · 4 分 · nchika

ハイパーパラメータ(hyperparameter)

ハイパーパラメータ(hyperparameter)は、機械学習モデルを学習させる前に人間が決める設定値のことです。 データから自動で決まる「パラメータ(parameter)」と区別されます。 ...

2026年5月24日 · 更新: 2026年8月5日 · 3 分 · nchika

データリーク(data leakage)

データリーク(data leakage)は、学習時には観測できるはずのない情報がモデルに混入し、評価指標を不当に高く出してしまう現象です。過学習 と紛らわしい現象です。過学習が「複雑なモデルが訓練データを覚えすぎる」のに対し、データリークは「特徴量や前処理の組み方が予測対象の情報を漏らしている」点で原因が違います。 ...

2026年5月25日 · 更新: 2026年8月5日 · 8 分 · nchika

次元の呪い(curse of dimensionality)

次元の呪い(curse of dimensionality)は、特徴量の次元が高くなるにつれて距離・体積・サンプル密度の常識的な感覚が崩れ、距離ベースのアルゴリズムが機能しなくなる現象群の総称です。1961 年に Bellman が制御理論の文脈で命名した古い用語です。機械学習の文脈では、「特徴量を増やすほど精度が上がるとは限らない、むしろ kNN や RBF(Radial Basis Function)カーネルがほぼ動かなくなる」という現実問題として現れます。 ...

2026年5月25日 · 更新: 2026年8月5日 · 7 分 · nchika