Machine Learning Β· Chapter 35 of 40

Pipelines

A PIPELINE chains preprocessing and modeling into one object. Prevents data leakage and simplifies deployment.

Use `ColumnTransformer` to apply different steps to different columns.

Example 1 (python)
from sklearn.pipeline import Pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression
p = Pipeline([('sc', StandardScaler()), ('lr', LogisticRegression())])
p.fit(X_train, y_train)

Scale then model β€” one call.

Example 2 (python)
# ColumnTransformer for mixed feature types
from sklearn.compose import ColumnTransformer

Different preprocessing per column set.

Key points

  • Chain preprocessing + model.
  • Prevents data leakage in CV.
  • One object to serialize.
  • Use ColumnTransformer for mixed types.
πŸ’‘ Note: Grid searching hyperparameters of any step is possible via `pipeline.set_params(step__param=value)`.

πŸ“ Quick Quiz

1. A Pipeline combines:

2. Pipelines help prevent:

3. For mixed column types use: