typestar

Dividir los datos en Python

Nunca evalúes un modelo con filas que lo entrenaron: divide primero, siempre.

from sklearn.datasets import load_iris
from sklearn.model_selection import train_test_split

X, y = load_iris(return_X_y=True)
X_entreno, X_prueba, y_entreno, y_prueba = train_test_split(
    X, y, test_size=0.25, random_state=0, stratify=y)

print(X_entreno.shape, X_prueba.shape)
print(y_entreno[:5], y_prueba[:5])

Cómo funciona

  1. test_size es la porción reservada para la evaluación final.
  2. random_state hace reproducible la división.
  3. stratify=y mantiene el balance de clases en ambas mitades.

Palabras clave y builtins usados aquí

El intento, en números

Líneas
9
Caracteres a escribir
312
Tokens
72
Ritmo de tres estrellas
100 tpm

Al ritmo de tres estrellas de 100 tokens por minuto, este intento toma unos 43 segundos.

Escribe este fragmento

Paso 2 de 3 en La API de estimadores; paso 2 de 25 en Machine learning con scikit-learn.

← Anterior Siguiente →