<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Preprocessing on Debimate</title><link>https://debimate.jp/tags/preprocessing/</link><description>Recent content in Preprocessing on Debimate</description><image><title>Debimate</title><url>https://debimate.jp/images/default-ogp.jpg</url><link>https://debimate.jp/images/default-ogp.jpg</link></image><generator>Hugo -- 0.161.1</generator><language>ja-JP</language><lastBuildDate>Tue, 26 May 2026 16:27:28 +0900</lastBuildDate><atom:link href="https://debimate.jp/tags/preprocessing/index.xml" rel="self" type="application/rss+xml"/><item><title>標準化と特徴量スケーリング - Standardization</title><link>https://debimate.jp/ml/ml/standardization/</link><pubDate>Sun, 24 May 2026 00:00:00 +0000</pubDate><guid>https://debimate.jp/ml/ml/standardization/</guid><description>&lt;p&gt;特徴量スケーリングは、複数の特徴量のスケール（値の取り得る範囲・分散）を揃える前処理である。代表は標準化（standardization, Z-score）と正規化（normalization, Min-Max）の 2 つで、scikit-learn ではそれぞれ &lt;code&gt;StandardScaler&lt;/code&gt; と &lt;code&gt;MinMaxScaler&lt;/code&gt; が対応する。前処理の順序として、まず &lt;a href="../missing-values/"&gt;欠損値処理&lt;/a&gt; で &lt;code&gt;NaN&lt;/code&gt; を埋めた後にスケーリングを当てる、というのが定石となる。&lt;/p&gt;</description></item><item><title>カテゴリ変数のエンコーディング（categorical encoding）</title><link>https://debimate.jp/ml/ml/categorical-encoding/</link><pubDate>Mon, 25 May 2026 00:00:00 +0000</pubDate><guid>https://debimate.jp/ml/ml/categorical-encoding/</guid><description>&lt;p&gt;カテゴリ変数のエンコーディング（categorical encoding）は、文字列やカテゴリ値で表された特徴量を数値ベクトルに変換する前処理操作の総称である。機械学習モデルの大半（&lt;a href="../logistic-regression/"&gt;ロジスティック回帰&lt;/a&gt; / &lt;a href="../knn/"&gt;kNN&lt;/a&gt; / ニューラルネット / &lt;a href="../gradient-boosting/"&gt;GradientBoosting&lt;/a&gt; など）は数値入力を前提とするため、&lt;code&gt;category='electronics'&lt;/code&gt; や &lt;code&gt;prefecture='東京'&lt;/code&gt; のような値はそのままでは渡せない。&lt;/p&gt;</description></item><item><title>欠損値処理（missing values）: MCAR / MAR / MNAR と imputation</title><link>https://debimate.jp/ml/ml/missing-values/</link><pubDate>Tue, 26 May 2026 00:00:00 +0000</pubDate><guid>https://debimate.jp/ml/ml/missing-values/</guid><description>&lt;p&gt;欠損値（missing values）は実データに付き物の汚れで、何も対処せずに学習器に渡すと多くの実装でエラーになるか、無視されてサンプル数が激減する。「平均で埋める」「行ごと削除する」のような素朴な対応も状況次第では正しいが、欠損が起きるメカニズム（MCAR / MAR / MNAR）を理解せずに当てると分析結果がバイアスする。&lt;/p&gt;</description></item><item><title>特徴量選択（feature selection）</title><link>https://debimate.jp/ml/ml/feature-selection/</link><pubDate>Tue, 26 May 2026 00:00:00 +0000</pubDate><guid>https://debimate.jp/ml/ml/feature-selection/</guid><description>&lt;p&gt;特徴量選択（feature selection）は、使える特徴量の中からモデルにとって有用な部分集合を選び出し、それ以外を捨てる前処理である。目的は (1) &lt;a href="../overfitting/"&gt;過学習&lt;/a&gt; の抑制、(2) 学習・推論コストの削減、(3) モデルの説明性向上、(4) &lt;a href="../curse-of-dimensionality/"&gt;次元の呪い&lt;/a&gt; の緩和、の 4 点に集約される。&lt;/p&gt;</description></item></channel></rss>