← Volver a los quizzesQuiz gratuito

Preprocesamiento de datos en ciencia de datos

El preprocesamiento es la fase fundamental que precede a cualquier análisis o modelado predictivo. Sin datos limpios, consistentes y bien estructurados, incluso los algoritmos más avanzados…

15 preguntas~8 min
Preprocesamiento de datos en ciencia de datos — Qwi
0 / 15
Puntuación: 0%
1

¿Cuál es el objetivo principal de la limpieza de datos?

2

En un escenario con muchos valores faltantes, ¿cuándo es apropiada la eliminación de registros incompletos?

3

¿Cuál de las siguientes técnicas de transformación de datos es más adecuada para algoritmos sensibles a la escala como k‑means?

4

Una empresa tiene dos bases de datos con campos de ubicación escritos como “EE.UU.” y “Estados Unidos”. ¿Qué problema de preprocesamiento representa esto?

5

Al aplicar PCA a un dataset con 200 variables, ¿qué se conserva principalmente en los primeros componentes?

6

En la integración de datos, ¿qué enfoque permite consultar datos en tiempo real sin moverlos a un almacén central?

7

¿Cuál es la diferencia esencial entre reducción de dimensionalidad y selección de atributos?

8

Un dataset contiene edades negativas debido a errores de ingreso. ¿Qué técnica de limpieza es apropiada?

9

En la detección de ruido, ¿qué método se basa en identificar valores que se alejan excesivamente del centro de la distribución?

10

¿Cuál es una consecuencia directa de los sesgos de selección en los datos de entrenamiento?

11

Una empresa desea combinar datos de ventas con datos de redes sociales. ¿Qué problema típico debe resolver antes de la integración?

12

Al aplicar la técnica RFE (Eliminación recursiva de características), ¿qué criterio se utiliza para descartar atributos?

13

¿Qué ventaja principal ofrece la compresión sin pérdida para el análisis de datos?

14

En la reducción de datos, ¿por qué la selección de atributos no transforma las variables originales?

15

¿Cuál es la consecuencia de no tratar la redundancia de datos antes de entrenar un modelo de clasificación?

Introducción al preprocesamiento de datos en ciencia de datos

El preprocesamiento es la fase fundamental que precede a cualquier análisis o modelado predictivo. Sin datos limpios, consistentes y bien estructurados, incluso los algoritmos más avanzados producirán resultados poco fiables. En este curso abordaremos los conceptos clave que aparecen en el cuestionario, ofreciendo explicaciones detalladas, ejemplos prácticos y buenas prácticas para que puedas aplicar cada técnica en tus proyectos.

Objetivo principal de la limpieza de datos

La limpieza de datos tiene como meta detecta y corregir errores, valores faltantes y duplicados. Este proceso incluye:

  • Identificar valores atípicos o inconsistentes (por ejemplo, edades negativas).
  • Corregir errores tipográficos y de formato.
  • Eliminar o imputar valores faltantes según su impacto.
  • Eliminar registros duplicados que inflan el tamaño del dataset.

Al garantizar la calidad de los datos, mejoramos la fiabilidad y la precisión de los modelos predictivos.

Gestión de valores faltantes

En escenarios con muchos valores faltantes, la eliminación de registros incompletos es apropiada cuando el porcentaje de datos faltantes es bajo y su eliminación no afecta la representatividad del conjunto. Considera los siguientes criterios antes de decidir:

  • Proporción de filas con valores faltantes (< 5% suele ser aceptable).
  • Importancia de la variable con datos faltantes para el modelo.
  • Disponibilidad de variables auxiliares para imputación.

Si la pérdida de información es mínima, la eliminación simplifica el pipeline y evita introducir sesgos mediante imputaciones incorrectas.

Transformación de datos para algoritmos sensibles a la escala

Algoritmos como k‑means dependen de la distancia euclidiana, por lo que la normalización a un rango entre 0 y 1 es la técnica más adecuada. La normalización garantiza que todas las variables contribuyan de manera equitativa al cálculo de distancias.

  • Estandarización (media 0, desviación 1) es útil para algoritmos basados en gradientes.
  • One‑hot encoding se emplea para variables categóricas, pero no resuelve problemas de escala.
  • Discretización convierte variables continuas en categorías, útil en ciertos modelos pero no para k‑means.

Inconsistencias de formato y normalización de valores

Cuando dos bases de datos usan diferentes representaciones para la misma entidad (p. ej., “EE.UU.” vs. “Estados Unidos”), se genera una inconsistencia de formato que requiere normalización. Pasos recomendados:

  • Definir un diccionario de referencia (por ejemplo, ISO 3166‑1 alpha‑2).
  • Aplicar reglas de sustitución mediante expresiones regulares.
  • Validar la consistencia después de la transformación.

Esta normalización evita la creación de columnas redundantes y mejora la calidad de los joins entre tablas.

Reducción de dimensionalidad con PCA

Al aplicar Análisis de Componentes Principales (PCA) a un dataset con 200 variables, los primeros componentes conservan la mayor parte de la varianza original del dataset. Esto significa que:

  • Se captura la información más relevante en menos dimensiones.
  • Se reducen costos computacionales y riesgo de sobreajuste.
  • Se facilita la visualización (p. ej., gráficos 2D o 3D).

Es importante recordar que PCA transforma variables, a diferencia de la selección de atributos que simplemente elige un subconjunto sin transformación.

Integración de datos en tiempo real: virtualización

Para consultar datos en tiempo real sin moverlos a un almacén central, la virtualización de datos es la solución adecuada. Esta técnica permite:

  • Acceder a fuentes heterogéneas mediante una capa abstracta.
  • Ejecutar consultas federadas que combinan información de múltiples sistemas.
  • Reducir latencia y costos de almacenamiento.

A diferencia del proceso ETL tradicional, la virtualización mantiene los datos en su origen, garantizando frescura y consistencia.

Diferencia entre reducción de dimensionalidad y selección de atributos

La distinción esencial radica en que la reducción de dimensionalidad transforma variables (p. ej., PCA, t‑SNE), mientras que la selección de atributos elige un subconjunto sin transformación. Ventajas de cada enfoque:

  • Reducción de dimensionalidad: elimina redundancia, captura relaciones latentes, útil cuando hay colinealidad alta.
  • Selección de atributos: mantiene interpretabilidad, facilita la explicación del modelo.

Técnicas de corrección de errores tipográficos

En un dataset donde aparecen edades negativas por errores de ingreso, la técnica apropiada es corrección de errores tipográficos y categóricos. Pasos típicos:

  • Detectar valores fuera de rango (p. ej., edad < 0 o > 120).
  • Revisar registros originales para identificar la causa (tecla equivocada, signo negativo).
  • Corregir manualmente o aplicar reglas automáticas (p. ej., tomar valor absoluto).
  • Validar después de la corrección para asegurar consistencia.

Esta corrección preserva la mayor cantidad de datos posible, evitando la eliminación masiva de registros.

Resumen de buenas prácticas de preprocesamiento

Para consolidar lo aprendido, sigue este checklist al iniciar cualquier proyecto de ciencia de datos:

  • Auditoría inicial: inspecciona tipos, rangos y valores faltantes.
  • Limpieza: corrige errores, elimina duplicados y gestiona valores faltantes.
  • Normalización y escalado: elige la técnica adecuada según el algoritmo.
  • Transformación: aplica PCA u otras técnicas cuando la dimensionalidad es alta.
  • Integración: utiliza virtualización para acceso en tiempo real y ETL para cargas batch.
  • Validación: verifica la consistencia después de cada paso.

Implementar estos pasos garantizará que tus modelos trabajen con datos de alta calidad, mejorando la precisión y la robustez de los resultados.