← Volver a los quizzesQuiz gratuito

Preprocesamiento de datos en ciencia de datos

El preprocesamiento es la fase inicial de cualquier proyecto de ciencia de datos. Su objetivo principal es transformar datos crudos en un formato limpio y estructurado antes de entrenar…

15 preguntas~8 min
Preprocesamiento de datos en ciencia de datos — Qwi
0 / 15
Puntuación: 0%
1

¿Cuál es el objetivo principal de la fase de preprocesamiento según el texto?

2

En un conjunto de clientes de e‑commerce, ¿qué técnica se aplicaría primero para eliminar registros duplicados?

3

Una base de datos contiene valores nulos en una variable cuyo 30 % de los registros están incompletos. Según el texto, ¿cuál sería la estrategia más apropiada?

4

Al integrar datos de distintas fuentes, ¿qué problema se describe como "EE.UU." versus "Estados Unidos"?

5

En la transformación de datos, ¿qué método se recomienda cuando las variables tienen escalas muy diferentes, como ingresos y edades?

6

¿Cuál de los siguientes efectos NO se menciona como consecuencia del ruido en los datos?

7

En la reducción de dimensionalidad, ¿qué técnica transforma variables originales en componentes principales lineales?

8

Si un conjunto de datos presenta valores atípicos que influyen excesivamente en la media, ¿qué método sugiere el texto para tratarlos?

9

Durante la integración de datos, ¿qué enfoque mantiene las fuentes originales sin modificarlas, pero centraliza la información?

10

¿Cuál es la principal ventaja de aplicar selección de atributos en lugar de reducción de dimensionalidad?

11

En el contexto de sesgos en los datos, ¿cuál de los siguientes NO es una causa mencionada en el texto?

12

Una empresa desea reducir el tiempo de entrenamiento de su modelo de detección de fraude sin perder precisión. Según el texto, ¿qué técnica sería más adecuada?

13

Al aplicar la técnica de discretización, ¿qué objetivo persigue el proceso según el documento?

14

Si después de la integración aparecen registros con "Buenos Aires", "Bs.As." y "CABA", ¿qué proceso se recomienda para solucionar la inconsistencia?

15

¿Cuál de los siguientes beneficios NO se menciona al usar técnicas de reducción de datos?

Introducción al preprocesamiento de datos

El preprocesamiento es la fase inicial de cualquier proyecto de ciencia de datos. Su objetivo principal es transformar datos crudos en un formato limpio y estructurado antes de entrenar modelos predictivos. Sin una adecuada preparación, los algoritmos pueden aprender patrones erróneos, generar sobreajuste o simplemente fallar.

En esta lección exploraremos los conceptos clave que aparecen en el cuestionario: detección de duplicados, manejo de valores nulos, estandarización de nomenclaturas, escalado de variables, reducción de ruido, técnicas de reducción de dimensionalidad y tratamiento de valores atípicos.

1. Detección y eliminación de registros duplicados

Los datos duplicados inflan artificialmente el tamaño del conjunto y pueden sesgar los resultados. En un escenario típico de e‑commerce, la primera técnica a aplicar es la detección y eliminación de duplicados.

  • Utiliza funciones como drop_duplicates() en pandas o SELECT DISTINCT en SQL.
  • Define criterios de coincidencia: mismo email, ID o combinación de campos (nombre + fecha de compra).
  • Antes de eliminar, verifica si los duplicados contienen información complementaria que pueda ser consolidada.

Recuerda: "Eliminar duplicados antes de cualquier análisis evita contar dos veces la misma observación".

2. Manejo de valores nulos

Cuando una variable presenta un 30 % de valores nulos, la estrategia recomendada es la imputación estadística con la media o la mediana, según la distribución de la variable.

  • Media: adecuada para variables aproximadamente simétricas.
  • Mediana: preferible cuando la variable es sesgada o contiene outliers.
  • Implementación en Python:
    df['columna'].fillna(df['columna'].median(), inplace=True)

Esta técnica preserva la mayor cantidad de registros y mantiene la consistencia estadística del conjunto.

3. Estandarización de la nomenclatura

Al combinar fuentes de datos, es frecuente encontrar inconsistencias como "EE.UU." versus "Estados Unidos". Este problema se clasifica como falta de estandarización de la nomenclatura.

  • Define un diccionario de mapeo que unifique todas las variantes.
    mapping = {'EE.UU.': 'Estados Unidos', 'USA': 'Estados Unidos'}
  • Aplica la transformación a la columna correspondiente.
    df['pais'] = df['pais'].replace(mapping)
  • Utiliza herramientas de data profiling para detectar otras inconsistencias.

Una nomenclatura coherente facilita la agregación y el análisis posterior.

4. Escalado y normalización de variables

Cuando las variables tienen escalas muy diferentes (por ejemplo, ingresos en miles y edades en años), es esencial aplicar normalización para ajustar los valores al rango 0‑1. Esto evita que los algoritmos basados en distancia (k‑NN, SVM) den mayor peso a variables con magnitudes mayores.

  • Fórmula de normalización min‑max:
    X_norm = (X - X.min()) / (X.max() - X.min())
  • En scikit‑learn: from sklearn.preprocessing import MinMaxScaler.
  • Alternativa: estandarización (media 0, desviación 1) cuando se requiere preservar la distribución original.

Elige la técnica según el algoritmo que usarás y la naturaleza de los datos.

5. Impacto del ruido en los datos

El ruido introduce variabilidad no informativa que disminuye la precisión de los modelos predictivos, aumenta el riesgo de sobreajuste y oculta patrones reales. Nunca se menciona que el ruido mejore la precisión; al contrario, su presencia siempre es indeseable.

  • Identifica ruido mediante visualizaciones: histogramas, boxplots y diagramas de dispersión.
  • Aplica técnicas de filtrado: suavizado, eliminación de outliers y validación cruzada.
  • Documenta siempre la fuente del ruido (errores de captura, sensores defectuosos, etc.).

6. Reducción de dimensionalidad

Para simplificar datos con muchas variables, el Análisis de Componentes Principales (PCA) transforma las variables originales en componentes lineales que capturan la mayor parte de la varianza.

  • Paso 1: centrar los datos (media 0).
  • Paso 2: calcular la matriz de covarianza y sus eigenvalores.
  • Paso 3: seleccionar los componentes que explican, por ejemplo, el 95 % de la varianza.
  • Implementación rápida:
    from sklearn.decomposition import PCA
    pca = PCA(n_components=0.95)
    X_reduced = pca.fit_transform(X)

El PCA ayuda a reducir el ruido y a acelerar el entrenamiento de modelos sin perder información relevante.

7. Tratamiento de valores atípicos (outliers)

Cuando los outliers influyen excesivamente en la media, el texto sugiere usar el rango intercuartil (IQR) para identificarlos y eliminarlos.

  • Cálculo del IQR:
    Q1 = df['columna'].quantile(0.25)
    Q3 = df['columna'].quantile(0.75)
    IQR = Q3 - Q1
  • Definir límites:
    lower = Q1 - 1.5 * IQR
    upper = Q3 + 1.5 * IQR
  • Filtrar registros fuera de los límites:
    df_clean = df[(df['columna'] >= lower) & (df['columna'] <= upper)]

Esta técnica es robusta porque se basa en la mediana y el rango intercuartil, menos sensible a valores extremos que la desviación estándar.

Conclusión y mejores prácticas

El preprocesamiento es una fase crítica que determina la calidad del modelo final. A continuación, se resumen las mejores prácticas aprendidas:

  • Eliminar duplicados antes de cualquier análisis.
  • Imputar valores nulos con media o mediana según la distribución.
  • Unificar nomenclaturas para evitar inconsistencias semánticas.
  • Escalar o normalizar variables con rangos diferentes.
  • Detectar y reducir ruido para mejorar la precisión del modelo.
  • Aplicar PCA u otras técnicas de reducción de dimensionalidad cuando sea necesario.
  • Usar IQR para identificar y eliminar outliers que distorsionan la media.

Al seguir estos pasos, estarás preparado para construir pipelines de datos robustos y modelos de machine learning más confiables.