Modelo de regresión lineal simple
La regresión lineal simple es una herramienta fundamental en ciencia de datos para modelar la relación entre una variable dependiente Y y una variable explicativa X . En este curso…

En el método de mínimos cuadrados ordinarios (MCO), ¿qué expresión se minimiza para estimar los coeficientes?
Según la proposición, ¿cómo se calcula β̂1 a partir de los datos muestrales?
¿Qué propiedad de los residuos de MCO garantiza que la suma de los residuos es cero?
En el contexto de los supuestos de Gauss‑Markov, ¿qué implica la hipótesis de homocedasticidad?
¿Cuál es la fórmula del coeficiente de determinación R² en términos de varianzas?
Si en una muestra de n observaciones se cumplen los supuestos 1‑5, ¿cuál es la expresión de la varianza de β̂1?
¿Qué restricción adicional se impone a los residuos para estimar σ² de forma insesgada?
En la visualización de la regresión lineal simple, ¿cómo se describen los puntos respecto a la verdadera línea de regresión?
¿Qué implica que los residuos de MCO y la variable independiente X estén incorrelacionados?
Según la definición del modelo, ¿qué representa el intercepto β0?
¿Cuál es la interpretación económica del coeficiente β1 en el modelo Y=β0+β1X+ε?
En la fórmula de R² = 1 − SRC/STC, ¿qué representa SRC?
¿Qué condición asegura que los estimadores de MCO sean insesgados bajo los supuestos 1‑4?
Si la varianza del error no es constante (heterocedasticidad), ¿qué efecto tiene sobre la varianza de los estimadores de MCO?
Introducción al modelo de regresión lineal simple
La regresión lineal simple es una herramienta fundamental en ciencia de datos para modelar la relación entre una variable dependiente Y y una variable explicativa X. En este curso exploraremos los supuestos clave, la estimación por mínimos cuadrados ordinarios (MCO), la interpretación de los coeficientes y métricas de ajuste como R². Cada sección está diseñada para reforzar conceptos mediante preguntas tipo test y explicaciones detalladas.
Supuestos básicos del modelo
Condición sobre el término de error
Para que la esperanza condicional E[Y|X] sea exactamente la función lineal β₀ + β₁X, el término de error ε debe cumplir:
- E[ε|X] = 0. Esta condición garantiza que, una vez controlado X, el error no tiene sesgo sistemático.
Otras opciones como Cov[ε,X]=0 o la independencia total de ε son más restrictivas y no son necesarias para la igualdad de expectativas.
Supuesto de homocedasticidad (Gauss‑Markov)
La homocedasticidad implica que la varianza del error condicional es constante para cualquier valor de X:
- Var[ε|X] = σ² para todo X.
Cuando este supuesto se viola (heterocedasticidad), la eficiencia de los estimadores MCO puede deteriorarse y los intervalos de confianza pueden ser incorrectos.
Estimación por mínimos cuadrados ordinarios (MCO)
Objetivo de MCO
El método de mínimos cuadrados ordinarios busca los valores de β̂₀ y β̂₁ que minimizan la suma de los residuos al cuadrado:
- ∑(yᵢ − β̂₀ − β̂₁xᵢ)².
Al elevar al cuadrado cada diferencia, penalizamos fuertemente los errores grandes, lo que conduce a estimadores con buenas propiedades bajo los supuestos de Gauss‑Markov.
Cálculo de los coeficientes
La pendiente estimada β̂₁ se obtiene mediante la fórmula:
- β̂₁ = ∑(xᵢ−x̄)(yᵢ−ȳ) / ∑(xᵢ−x̄)².
Esta expresión representa la razón entre la covarianza muestral de X y Y y la varianza muestral de X. El intercepto β̂₀ se calcula como:
- β̂₀ = ȳ − β̂₁ x̄.
Propiedades de los residuos
Los residuos estimados ε̂ᵢ = yᵢ − β̂₀ − β̂₁xᵢ poseen dos propiedades fundamentales:
- ∑ ε̂ᵢ = 0: la suma de los residuos es nula, lo que refleja que la línea de regresión pasa por el centro de los datos.
- ∑ xᵢ ε̂ᵢ = 0: la covarianza entre los residuos y la variable explicativa también es cero.
Métricas de ajuste y varianzas
Coeficiente de determinación R²
El R² cuantifica la proporción de varianza total de Y explicada por el modelo:
- R² = 1 − Var[ε̂] / Var[Y].
Un valor cercano a 1 indica que la mayor parte de la variabilidad de Y se explica mediante X, mientras que valores bajos sugieren un ajuste pobre.
Varianza del estimador de la pendiente
Cuando los supuestos 1‑5 del teorema de Gauss‑Markov se cumplen, la varianza de β̂₁ es:
- Var(β̂₁) = σ² / ∑(xᵢ−x̄)².
Esta fórmula muestra que mayor dispersión de X (mayor denominador) reduce la incertidumbre en la estimación de la pendiente.
Estimación insesgada de σ²
Para obtener un estimador no sesgado de la varianza del error σ², se utiliza:
- σ̂² = ∑ ε̂ᵢ² / (n − 2).
El divisor n−2 corresponde a los grados de libertad restantes después de estimar los dos parámetros (β̂₀ y β̂₁).
Resumen de conceptos clave
- E[ε|X]=0 es la condición esencial para que la esperanza condicional sea lineal.
- El método MCO minimiza ∑(yᵢ−β̂₀−β̂₁xᵢ)².
- La pendiente se calcula con ∑(xᵢ−x̄)(yᵢ−ȳ) / ∑(xᵢ−x̄)².
- Los residuos suman cero y son ortogonales a X.
- Homocedasticidad implica Var[ε|X]=σ² constante.
- R² = 1 − Var[ε̂]/Var[Y] mide la calidad del ajuste.
- Var(β̂₁) = σ² / ∑(xᵢ−x̄)² muestra la precisión de la pendiente.
- σ̂² = ∑ ε̂ᵢ²/(n−2) es el estimador insesgado de la varianza del error.
Preguntas de práctica
1. Condición del término de error
¿Cuál es la condición necesaria sobre ε para que E[Y|X]=β₀+β₁X?
- E[ε|X]=0 (respuesta correcta)
2. Función objetivo de MCO
¿Qué expresión se minimiza en el método de mínimos cuadrados ordinarios?
- ∑(yᵢ−β̂₀−β̂₁xᵢ)² (respuesta correcta)
3. Cálculo de β̂₁
¿Cómo se calcula la pendiente estimada a partir de los datos?
- ∑(xᵢ−x̄)(yᵢ−ȳ) / ∑(xᵢ−x̄)² (respuesta correcta)
4. Propiedad de los residuos
¿Qué propiedad garantiza que la suma de los residuos es cero?
- ∑ ε̂ᵢ = 0 (respuesta correcta)
5. Homocedasticidad
¿Qué implica la hipótesis de homocedasticidad?
- Var[ε|X] es constante para todo X (respuesta correcta)
6. Fórmula de R²
¿Cuál es la fórmula del coeficiente de determinación en términos de varianzas?
- R² = 1 − Var[ε̂] / Var[Y] (respuesta correcta)
7. Varianza de β̂₁
Si se cumplen los supuestos 1‑5, ¿cuál es la expresión de la varianza de β̂₁?
- σ² / ∑(xᵢ−x̄)² (respuesta correcta)
8. Estimación insesgada de σ²
¿Qué restricción adicional se impone a los residuos para estimar σ² de forma insesgada?
- Dividir la suma de residuos al cuadrado por n−2 (respuesta correcta)
Conclusión
Dominar los conceptos de la regresión lineal simple permite construir modelos predictivos sólidos y comprender sus limitaciones. Recuerda siempre verificar los supuestos (linealidad, independencia, homocedasticidad y normalidad) antes de interpretar los coeficientes. Con la práctica constante de los ejercicios propuestos, estarás preparado para aplicar la regresión lineal en problemas reales de ciencia de datos.
