typestar

Machine learning con scikit-learn

25 pasos en 8 series de Python.

La verdadera contribución de scikit-learn es la API de estimadores: fit, predict, transform, y el hecho de que cada modelo de la biblioteca la obedece. Aprende esa forma una vez y el resto de la biblioteca es un catálogo.

Así que el tour empieza ahí, luego el preprocesamiento y los pipelines que evitan que filtres datos de prueba al entrenamiento. Validación, un recorrido por los modelos, métricas que van más allá del accuracy, métodos no supervisados, y una serie final sobre las cosas a las que recurres cuando lo básico deja de alcanzar.

Empieza este tour

La API de estimadores

Preprocesamiento

Validación

  • Validación cruzadaUna sola división es azar; la validación cruzada puntúa cada pliegue y promedia.
  • Elegir los plieguesKFold y StratifiedKFold deciden cómo se parten los datos.
  • Grid searchGridSearchCV prueba cada combinación con validación cruzada y guarda la mejor.
  • ¿Más datos ayudan?Una curva de aprendizaje responde si conviene juntar datos o cambiar el modelo.

Modelos

Métricas

No supervisado

  • Clustering con KMeansNo supervisado: sin etiquetas, solo centroides y los puntos más cercanos a cada uno.
  • PCARotar los datos para que los primeros ejes carguen la mayor varianza.

Más allá de lo básico

Bis

  • sk_churn_model.pyUn modelo de punta a punta: dividir, preprocesar por tipo de columna, grid search, reporte.

Los otros tours de Python