Author: Marcos Bujosa
¿Es $\boldsymbol{\mathop{\widehat{\beta}}}$ un buen estimador de $\boldsymbol\beta$? Para el modelo lineal simple: $\hat\beta_2$ es insesgado y calculamos su varianza, reutilizando la fórmula de la lección 7 sobre variables aleatorias.
``¿Es bueno un estimador? ¿Está bien centrado? ¿Cuánto se dispersa?''
Recordemos cómo cerraba la lección 10: ``¿es $\boldsymbol{\mathop{\widehat{\beta}}}$ un buen estimador del verdadero $\boldsymbol\beta$?''
$\hat\beta_1,\hat\beta_2$ —calculados primero con argumentos geométricos sobre los vectores de datos— se reinterpretaron después como estimadores de $\beta_1,\beta_2$ por el método de los momentos.
Hoy, para el modelo lineal simple —constante $\mathit1$ más un regresor no constante $X$—, demostraremos dos propiedades de $\hat\beta_2$:
Nos centramos en $\hat\beta_2$ (la pendiente, de mayor interés económico); los mismos argumentos, sobre la fórmula $\hat\beta_1$, permiten probar la insesgadez de $\hat\beta_1$ —no las desarrollamos aquí para no ser repetitivos.
Ningún ingrediente geométrico nuevo: la fórmula de $\hat\beta_2$ que obtuvimos por geometría, la reutilizamos hoy tal cual —evaluada sobre variables aleatorias en lugar de sobre datos: una fórmula aritmética vieja, aplicada sobre un objeto nuevo.
Recordemos (lección 9): los $n$ datos son $n$ copias idénticas e independientes de $Y$; hoy, del par $(X,U)$.
$\boldsymbol X$: la versión aleatoria de $\boldsymbol{\mathsf X}=[\boldsymbol 1;\;\boldsymbol x]$, con columnas $\mathit 1$ ($n$ copias) y $X_1,\ldots,X_n$. Análogamente $\boldsymbol Y=(Y_1,\ldots,Y_n)$ y $\boldsymbol U=(U_1,\ldots,U_n)$. Para cada $i$: $\;Y_i=\beta_1\,\mathit1+\beta_2X_i+U_i$, con los tres supuestos de la lección 9, condicionando ahora en $\boldsymbol X$.
Lo nuevo es el muestreo aleatorio: las $n$ copias $(X_i,U_i)$ son independientes entre sí. Dos consecuencias:
$E[U_i\mid\boldsymbol X]=\mathit0$: $U_i\perp$ funciones de $X_i$ (por definición) y de las demás copias (por independencia).
Perturbaciones de observaciones distintas, incorreladas: $Cov[U_i,U_j\mid\boldsymbol X]=\mathit 0$ $\;(i\neq j)$.
Condicionar en $\boldsymbol X$: la esperanza condicional de la lección 9, sobre las $n$ copias a la vez.
Estimación vs. estimador (distinción hoy imprescindible):
Recordando la ``vía alternativa'' (lección 7): $$ \hat\beta_2(\boldsymbol x,\boldsymbol y)=\frac{\sum_i(x_i-\mu_{\boldsymbol x})y_i}{\sum_j(x_j-\mu_{\boldsymbol x})^2}=\sum_i w_i y_i; \quad\text{donde } w_i=\frac{(x_i-\mu_{\boldsymbol x})}{\sum_j(x_j-\mu_{\boldsymbol x})^2}. $$
Sustituimos $x_i,y_i$ por $X_i,Y_i$:
$$ \hat\beta_2(\boldsymbol X,\boldsymbol Y)=\frac{\sum_i(X_i-\overline{X})Y_i}{\sum_j(X_j-\overline{X})^2}=\sum_i {W_i}Y_i; \quad\text{donde } W_i = \frac{(X_i-\overline{X})}{\sum_j(X_j-\overline{X})^2}. $$donde $\overline{X}=\frac1n\sum_iX_i$ es la media muestral; y $\sum_i (X_i - \overline{X}) = \mathit 0$.
Dos identidades algebraicas sobre los pesos. Ninguna es nueva.
Ambas valen para cualquier lista de números y, por tanto, siguen siendo ciertas al sustituir $x_i$ por $X_i$: son hechos aritméticos, no probabilísticos:
(escrito ahora en función de $\boldsymbol U$, pues $\boldsymbol Y$ ha sido sustituida).
Mediante manipulación algebraica (sustitución y las dos identidades de la transparencia anterior): el estimador es el parámetro verdadero MÁS una ``suma ponderada'' de las perturbaciones. Todo lo que sigue sale de estudiar ese segundo término.
Cambiemos de pregunta:
Lema (demostrado en los apuntes): si $c(\boldsymbol X)$ es una función de $\boldsymbol X$, $$ E\big[c(\boldsymbol X)Z\mid\boldsymbol X\big]=c(\boldsymbol X)E[Z\mid\boldsymbol X]. $$$\mbox{ }$
Aplicándolo con $c(\boldsymbol X)=W_i$ (pues cada $W_i$ es función de $\boldsymbol X$, sección anterior): $$ E[\hat\beta_2\mid\boldsymbol X]=\beta_2\,\mathit1+\sum_iW_i\,E[U_i\mid\boldsymbol X]=\beta_2\,\mathit1+\sum_iW_i\,\mathit0=\beta_2\,\mathit1. $$
Ley de las esperanzas iteradas: Como $E[Z\mid\boldsymbol X]$ es la proyección ortogonal de $Z$ sobre el espacio de las funciones de $\boldsymbol X$ (y $\mathit1$ es una de ellas), entonces $Z-E[Z\mid\boldsymbol X]\perp\mathit1$. Por tanto, $$\mathrm{E}(Z)=\mathrm{E}\big(E[Z\mid\boldsymbol X]\big).$$$\mbox{ }$
$\hat\beta_2$ no acierta en cada muestra — pero no se equivoca sistemáticamente en ninguna dirección.
Desarrollando el cuadrado (apuntes) y aplicando el Lema anterior: $$ Var[\hat\beta_2\mid\boldsymbol X]=Var\Big[\textstyle\sum_iW_iU_i\,\Big|\,\boldsymbol X\Big]=\sum_iW_i^2\,Var[U_i\mid\boldsymbol X]+\sum_{i\neq j}W_iW_j\,Cov[U_i,U_j\mid\boldsymbol X] $$
Homocedasticidad + $Cov[U_i,U_j\mid\boldsymbol X]=\mathit 0$ (``El marco'') $\;\Longrightarrow\;$ $$ Var[\hat\beta_2\mid\boldsymbol X]=\sigma^2\sum_iW_i^2. $$
donde $S^2=\frac1n\sum_i(X_i-\overline{X})^2$ es la varianza muestral del regresor (divisor $n$, como en la lección 5).
Más dispersión en $X$, o más observaciones: más precisión. Más ruido ($\sigma^2$): menos precisión.
Versión interactiva: cuaderno 4 en MyBinder (muchas muestras, muchas rectas; el histograma de $\hat\beta_2$ y el efecto de la dispersión de $\boldsymbol x$).
Sin demostrarlo (Gauss–Markov): de entre todos los estimadores lineales e insesgados de $\beta_2$, $\hat\beta_2$ tiene la menor varianza — MCO es BLUE (Best Linear Unbiased Estimator).
$\sigma^2$ (desconocido) se estima con la cuasivarianza de los residuos, un tercer producto escalar, tras el euclídeo y el estadístico: $$ \langle\cdot,\cdot\rangle_{n-k}=\frac1{n-k}\langle\cdot,\cdot\rangle_{e}, \qquad \mathfrak{s}^2=\langle\boldsymbol{\mathop{\widehat{e}}},\boldsymbol{\mathop{\widehat{e}}}\rangle_{n-k}=\frac{\mathrm{SRC}}{n-k}. $$
Tres divisores, tres motivos distintos: $1$ (geometría pura, sin más), $n$ (para que $\|\boldsymbol1\|_s=1$, lección 4), $n-k$ (para que $\mathfrak s^2$ sea un estimador insesgado de $\sigma^2$).
Sin demostrarlo (generalización matricial de lo probado hoy; recordando la notación de la lección 10 y su extensión aleatoria de ``El marco''): $$ E[\boldsymbol{\mathop{\widehat{\beta}}}\mid\boldsymbol X]=\boldsymbol\beta\,\mathit1,\qquad Var[\boldsymbol{\mathop{\widehat{\beta}}}\mid\boldsymbol X]=\sigma^2(\boldsymbol X^\top\boldsymbol X)^{-1}. $$
En la diagonal de esta matriz están $Var[\hat\beta_1\mid\boldsymbol X],\ldots,Var[\hat\beta_k\mid\boldsymbol X]$; fuera de la diagonal, las covarianzas $Cov[\hat\beta_i,\hat\beta_j\mid\boldsymbol X]$.
Evaluada en una muestra ya observada, y con $\sigma^2$ sustituido por su estimación $\mathfrak s^2$ (transparencia anterior) —la fórmula que de hecho calculan los programas estadísticos—: $$ \mathfrak s^2(\boldsymbol{\mathsf X}^\top\boldsymbol{\mathsf X})^{-1}. $$
Para $k=2$, el elemento $(2,2)$ de esta fórmula matricial se reduce exactamente a lo que hoy hemos demostrado sin matrices (y los otros tres elementos dan, de propina, lo que no hemos calculado).
| Propiedad | Resultado (regresión simple, $k=2$) | Supuestos usados |
|---|---|---|
| Insesgadez | $\mathrm{E}(\hat\beta_2)=\beta_2$ | Linealidad + $\mathrm{Var}(X)\neq0$ + muestreo aleatorio |
| Varianza | $Var[\hat\beta_2\mid\boldsymbol X]=\frac{\sigma^2}{\sum_i(X_i-{\overline{X}})^2}$ | + Homocedasticidad (+ $Cov[U_i,U_j\mid\boldsymbol X]=\mathit0$, del muestreo aleatorio) |
| Eficiencia | MCO es BLUE (mejor entre los lineales e insesgados) | Los tres + muestreo aleatorio (Gauss–Markov, sin demostrar) |
Casi nada nuevo: la vía alternativa (lección 7), la esperanza condicional y la independencia entre observaciones (lección 9). Lo único nuevo: evaluar la fórmula sobre variables aleatorias, no sobre datos; eso, y solo eso, convierte $\hat\beta_2$ en un estimador.
Nota: los mismos argumentos, sobre $\hat\beta_1=\overline{Y}-\hat\beta_2{\overline{X}}$, prueban la insesgadez de $\hat\beta_1$.
Lección 12: ya conocemos la media y la varianza de $\hat\beta_2$; para intervalos de confianza y contrastes hace falta algo más: la forma de su distribución.