Dividir los datos en Python
Nunca evalúes un modelo con filas que lo entrenaron: divide primero, siempre.
from sklearn.datasets import load_iris
from sklearn.model_selection import train_test_split
X, y = load_iris(return_X_y=True)
X_entreno, X_prueba, y_entreno, y_prueba = train_test_split(
X, y, test_size=0.25, random_state=0, stratify=y)
print(X_entreno.shape, X_prueba.shape)
print(y_entreno[:5], y_prueba[:5])
Cómo funciona
test_sizees la porción reservada para la evaluación final.random_statehace reproducible la división.stratify=ymantiene el balance de clases en ambas mitades.
Palabras clave y builtins usados aquí
print
El intento, en números
- Líneas
- 9
- Caracteres a escribir
- 312
- Tokens
- 72
- Ritmo de tres estrellas
- 100 tpm
Al ritmo de tres estrellas de 100 tokens por minuto, este intento toma unos 43 segundos.
Paso 2 de 3 en La API de estimadores; paso 2 de 25 en Machine learning con scikit-learn.