Preprocesamiento de datos en ciencia de datos
El preprocesamiento de datos es la fase fundamental que precede a cualquier modelo de aprendizaje automático. Sin datos limpios, consistentes y bien estructurados, incluso los algoritmos más…

En un dataset con 12 % de valores faltantes, ¿qué técnica es más adecuada según el texto?
¿Cuál de los siguientes enfoques de integración de datos implica mover los datos a un repositorio centralizado?
Una empresa detecta que varios registros de clientes tienen IDs diferentes pero datos personales idénticos. ¿Qué problema describe este caso?
Al aplicar la normalización a una variable cuyo rango original es 0‑500, ¿qué rango resultará después de la normalización típica?
¿Cuál es la diferencia esencial entre estandarización y normalización según el texto?
En el contexto de reducción de datos, ¿qué método conserva la mayor parte de la varianza original del dataset?
Una base de datos contiene la variable "ciudad" con valores "Buenos Aires", "Bs.As." y "CABA". ¿Cuál es la acción recomendada para eliminar la inconsistencia?
Si un modelo de clasificación muestra alta precisión en entrenamiento pero bajo desempeño en datos nuevos, ¿qué problema de preprocesamiento podría estar presente?
¿Cuál de los siguientes métodos de selección de atributos se basa en entrenar un modelo y eliminar iterativamente los menos importantes?
En la detección de ruido, ¿qué técnica se menciona para identificar valores atípicos mediante la dispersión estadística?
¿Qué estrategia se sugiere cuando el porcentaje de datos faltantes es alto y su eliminación no afecta la representatividad?
Al combinar bases de datos de distintas regiones, se observa que algunos campos de fecha usan "DD/MM/AAAA" y otros "MM‑DD‑YYYY". ¿Qué proceso es necesario antes de la integración?
¿Cuál es la ventaja principal de usar compresión sin pérdida en entornos de Big Data según el texto?
Una variable continua de edad se transforma en tres grupos: "Joven", "Adulto" y "Mayor". ¿Qué técnica de transformación se está aplicando?
Introducción al preprocesamiento de datos en ciencia de datos
El preprocesamiento de datos es la fase fundamental que precede a cualquier modelo de aprendizaje automático. Sin datos limpios, consistentes y bien estructurados, incluso los algoritmos más avanzados producirán resultados poco fiables. En este curso, exploraremos los conceptos clave que aparecen en el cuestionario: limpieza, imputación, integración, redundancia, normalización, estandarización y reducción de dimensionalidad.
Objetivo principal de la limpieza de datos
La limpieza de datos tiene como objetivo detectar y corregir errores, valores faltantes y duplicados. Este proceso incluye:
- Identificación de valores atípicos y su tratamiento.
- Corrección de inconsistencias de formato (por ejemplo, fechas).
- Eliminación o consolidación de registros duplicados.
- Gestión de valores nulos o ausentes.
Una base de datos bien limpiada mejora la calidad del modelo, reduce el sesgo y acelera el tiempo de entrenamiento.
Manejo de valores faltantes
Cuando un conjunto de datos presenta un 12 % de valores faltantes, la técnica más adecuada suele ser la imputación mediante la media o la mediana de la variable. Esta estrategia mantiene la mayor parte de la información estadística sin introducir sesgos significativos.
Pasos recomendados:
- Analizar la distribución de la variable para decidir entre media (distribución simétrica) o mediana (distribución sesgada).
- Aplicar la imputación de forma vectorizada para evitar errores de cálculo.
- Documentar el proceso para garantizar reproducibilidad.
Otras técnicas, como la codificación de valores faltantes como una nueva categoría o la eliminación de filas, pueden ser útiles en contextos específicos, pero la imputación es la opción más equilibrada para la mayoría de los casos.
Integración de datos: ETL y repositorios centralizados
La integración de datos consiste en combinar información proveniente de fuentes distintas. El enfoque que mueve los datos a un repositorio centralizado es el proceso de ETL (Extracción, Transformación y Carga). Este método permite:
- Normalizar esquemas y tipos de datos antes de la carga.
- Aplicar transformaciones de calidad (limpieza, deduplicación).
- Facilitar el acceso a los analistas mediante un único punto de referencia.
Alternativas como la virtualización de datos o la consolidación de fuentes múltiples pueden ser útiles cuando la latencia es crítica, pero el ETL sigue siendo la práctica estándar para proyectos de ciencia de datos.
Redundancia de datos y su impacto
Cuando varios registros de clientes poseen IDs diferentes pero datos personales idénticos, se está frente a un problema de redundancia de datos. La redundancia genera:
- Incremento innecesario del tamaño del dataset.
- Posibles inconsistencias al actualizar información.
- Sesgos en los modelos que pueden sobre‑ajustar patrones duplicados.
La solución típica implica:
- Detectar duplicados mediante claves compuestas (nombre, dirección, teléfono).
- Fusionar registros manteniendo la información más completa.
- Asignar un identificador único y consistente.
Normalización y su rango típico
La normalización transforma una variable para que sus valores se encuentren dentro de un rango predefinido, habitualmente 0 a 1. Por ejemplo, al normalizar una variable cuyo rango original es 0‑500, cada valor x se convierte en (x‑0)/(500‑0), resultando en un rango de 0 a 1.
Esta técnica es esencial cuando se utilizan algoritmos basados en distancia (k‑NN, SVM) o redes neuronales, ya que asegura que ninguna característica domine a las demás por escala.
Diferencia esencial entre estandarización y normalización
Aunque a menudo se confunden, la estandarización y la normalización persiguen objetivos distintos:
- Estandarización: centra los datos en una media de 0 y una desviación estándar de 1 (
(x‑μ)/σ). Mantiene la forma de la distribución original. - Normalización: reescala los datos a un rango fijo (por ejemplo, 0‑1), sin considerar la media ni la varianza.
En la práctica, la estandarización se prefiere cuando los algoritmos asumen una distribución gaussiana, mientras que la normalización es útil para algoritmos que requieren límites de entrada definidos.
Reducción de dimensionalidad: PCA como método principal
Entre los métodos de reducción de datos, el Análisis de Componentes Principales (PCA) es el que conserva la mayor parte de la varianza original del dataset. PCA transforma variables correlacionadas en componentes ortogonales ordenados por la cantidad de varianza que explican.
Pasos básicos para aplicar PCA:
- Escalar los datos (normalización o estandarización).
- Calcular la matriz de covarianza.
- Obtener los eigenvalores y eigenvectores.
- Seleccionar los componentes que acumulen, por ejemplo, el 95 % de la varianza.
Este proceso reduce la complejidad computacional y ayuda a evitar el sobre‑ajuste, sin perder información crítica.
Gestión de inconsistencias en variables categóricas
Cuando una variable como "ciudad" contiene valores "Buenos Aires", "Bs.As." y "CABA", la acción recomendada es normalizar los valores a una única representación estándar. Esto implica:
- Definir un diccionario de mapeo (p. ej., "Bs.As." → "Buenos Aires").
- Aplicar la transformación a todo el dataset.
- Documentar la convención elegida para futuros procesos de ingestión.
Esta práctica elimina la ambigüedad, mejora la calidad del análisis y facilita la codificación posterior (one‑hot, label encoding).
Resumen de buenas prácticas de preprocesamiento
Para consolidar lo aprendido, a continuación se presentan las mejores prácticas que todo científico de datos debería seguir:
- Auditar los datos antes de cualquier transformación: identificar valores nulos, duplicados y outliers.
- Imputar de forma inteligente según la proporción de datos faltantes y la distribución de la variable.
- Utilizar ETL para integrar fuentes heterogéneas en un repositorio centralizado.
- Eliminar redundancias mediante deduplicación y asignación de claves únicas.
- Escalar y normalizar según el algoritmo que se empleará.
- Aplicar PCA u otras técnicas de reducción cuando la dimensionalidad sea alta.
- Normalizar categorías para evitar inconsistencias semánticas.
Implementar estos pasos garantiza que los modelos de aprendizaje automático tengan una base sólida, lo que se traduce en predicciones más precisas y robustas.
Preguntas frecuentes (FAQ)
¿Cuándo es preferible eliminar filas con valores faltantes?
Solo cuando el porcentaje de datos ausentes es muy bajo (< 5 %) y la eliminación no introduce sesgo significativo.
¿La estandarización siempre mejora el rendimiento de los modelos?
No necesariamente. Depende del algoritmo; por ejemplo, los árboles de decisión son invariantes a la escala.
¿PCA puede usarse con variables categóricas?
Directamente no. Primero es necesario codificar las variables (one‑hot) y luego aplicar PCA, aunque a menudo se prefieren técnicas específicas para datos categóricos.
Conclusión
El preprocesamiento de datos es una disciplina que combina técnicas estadísticas, herramientas de ingeniería y principios de calidad. Dominar la limpieza, imputación, integración, normalización y reducción de dimensionalidad permite a los profesionales de ciencia de datos construir modelos más fiables y eficientes. Aplicar los conceptos descritos en este curso te ayudará a enfrentar desafíos reales y a maximizar el valor de tus datos.
