Lección 11. ¿Es $\boldsymbol{\mathop{\widehat{\beta}}}$ un buen estimador? Insesgadez y varianza¶

Author: Marcos Bujosa

¿Es $\boldsymbol{\mathop{\widehat{\beta}}}$ un buen estimador de $\boldsymbol\beta$? Para el modelo lineal simple: $\hat\beta_2$ es insesgado y calculamos su varianza, reutilizando la fórmula de la lección 7 sobre variables aleatorias.

``¿Es bueno un estimador? ¿Está bien centrado? ¿Cuánto se dispersa?''

  • (slides) — (html) — (pdf)

De dónde venimos: una pregunta pendiente¶

Recordemos cómo cerraba la lección 10: ``¿es $\boldsymbol{\mathop{\widehat{\beta}}}$ un buen estimador del verdadero $\boldsymbol\beta$?''

$\hat\beta_1,\hat\beta_2$ —calculados primero con argumentos geométricos sobre los vectores de datos— se reinterpretaron después como estimadores de $\beta_1,\beta_2$ por el método de los momentos.

Hoy, para el modelo lineal simple —constante $\mathit1$ más un regresor no constante $X$—, demostraremos dos propiedades de $\hat\beta_2$:

  1. Insesgadez: $\mathrm{E}(\hat\beta_2)=\beta_2$.
  2. Varianza: una fórmula exacta de $Var[\hat\beta_2\mid\boldsymbol X]$.

Nos centramos en $\hat\beta_2$ (la pendiente, de mayor interés económico); los mismos argumentos, sobre la fórmula $\hat\beta_1$, permiten probar la insesgadez de $\hat\beta_1$ —no las desarrollamos aquí para no ser repetitivos.

Ningún ingrediente geométrico nuevo: la fórmula de $\hat\beta_2$ que obtuvimos por geometría, la reutilizamos hoy tal cual —evaluada sobre variables aleatorias en lugar de sobre datos: una fórmula aritmética vieja, aplicada sobre un objeto nuevo.

El marco: muestra aleatoria¶

Recordemos (lección 9): los $n$ datos son $n$ copias idénticas e independientes de $Y$; hoy, del par $(X,U)$.

$\boldsymbol X$: la versión aleatoria de $\boldsymbol{\mathsf X}=[\boldsymbol 1;\;\boldsymbol x]$, con columnas $\mathit 1$ ($n$ copias) y $X_1,\ldots,X_n$. Análogamente $\boldsymbol Y=(Y_1,\ldots,Y_n)$ y $\boldsymbol U=(U_1,\ldots,U_n)$. Para cada $i$: $\;Y_i=\beta_1\,\mathit1+\beta_2X_i+U_i$, con los tres supuestos de la lección 9, condicionando ahora en $\boldsymbol X$.

Lo nuevo es el muestreo aleatorio: las $n$ copias $(X_i,U_i)$ son independientes entre sí. Dos consecuencias:

  • $E[U_i\mid\boldsymbol X]=\mathit0$: $U_i\perp$ funciones de $X_i$ (por definición) y de las demás copias (por independencia).

  • Perturbaciones de observaciones distintas, incorreladas: $Cov[U_i,U_j\mid\boldsymbol X]=\mathit 0$ $\;(i\neq j)$.

Condicionar en $\boldsymbol X$: la esperanza condicional de la lección 9, sobre las $n$ copias a la vez.

$\hat\beta_2$: la misma fórmula, aplicada a variables aleatorias¶

Estimación vs. estimador (distinción hoy imprescindible):

  • $\hat\beta_2(\boldsymbol x,\boldsymbol y)$, la estimación: un número.
  • $\hat\beta_2(\boldsymbol X,\boldsymbol Y)$, el estimador: una variable aleatoria, la MISMA fórmula sobre la muestra aleatoria.

Recordando la ``vía alternativa'' (lección 7): $$ \hat\beta_2(\boldsymbol x,\boldsymbol y)=\frac{\sum_i(x_i-\mu_{\boldsymbol x})y_i}{\sum_j(x_j-\mu_{\boldsymbol x})^2}=\sum_i w_i y_i; \quad\text{donde } w_i=\frac{(x_i-\mu_{\boldsymbol x})}{\sum_j(x_j-\mu_{\boldsymbol x})^2}. $$

Sustituimos $x_i,y_i$ por $X_i,Y_i$:

$$ \hat\beta_2(\boldsymbol X,\boldsymbol Y)=\frac{\sum_i(X_i-\overline{X})Y_i}{\sum_j(X_j-\overline{X})^2}=\sum_i {W_i}Y_i; \quad\text{donde } W_i = \frac{(X_i-\overline{X})}{\sum_j(X_j-\overline{X})^2}. $$

donde $\overline{X}=\frac1n\sum_iX_i$ es la media muestral; y $\sum_i (X_i - \overline{X}) = \mathit 0$.

Dos propiedades de los pesos¶

Dos identidades algebraicas sobre los pesos. Ninguna es nueva.

Ambas valen para cualquier lista de números y, por tanto, siguen siendo ciertas al sustituir $x_i$ por $X_i$: son hechos aritméticos, no probabilísticos:

  • la primera es la condición $\sum_i(X_i-\overline{X})=\mathit0$ de la transparencia anterior (la misma cuenta que en la lección 4 daba media cero al vector en desviaciones);
$$ \sum_iW_i=\mathit 0; $$
  • la segunda es la razón por la que, en la ``vía alternativa'' de la lección 7, el coeficiente de $\boldsymbol x-\mu_{\boldsymbol x}\boldsymbol1$ resultaba ser exactamente $\hat\beta_2$.
$$ \sum_iW_iX_i=\mathit 1 \qquad\Big(\text{pues } \textstyle\frac{\sum_i(X_i-{\overline{X}})X_i}{\sum_j(X_j-{\overline{X}})^2}=\frac{\sum_i(X_i-{\overline{X}})^2}{\sum_j(X_j-{\overline{X}})^2}\Big). $$

Sustituyendo el modelo poblacional¶

$$ \hat\beta_2(\boldsymbol X,\boldsymbol Y)=\sum_iW_iY_i=\sum_iW_i(\beta_1\,\mathit1+\beta_2X_i+U_i) $$
$$ =\beta_1\underbrace{\sum_iW_i}_{=\mathit0}+\beta_2\underbrace{\sum_iW_iX_i}_{=\mathit1}+\sum_iW_iU_i $$
$$ \boxed{\;\hat\beta_2(\boldsymbol X,\boldsymbol U)=\beta_2\,\mathit{1}+\sum_{i=1}^nW_iU_i\;} $$

(escrito ahora en función de $\boldsymbol U$, pues $\boldsymbol Y$ ha sido sustituida).

Mediante manipulación algebraica (sustitución y las dos identidades de la transparencia anterior): el estimador es el parámetro verdadero MÁS una ``suma ponderada'' de las perturbaciones. Todo lo que sigue sale de estudiar ese segundo término.

Insesgadez: $\mathrm{E}(\hat\beta_2)=\beta_2$¶

Cambiemos de pregunta:

  • de ``¿Cuánto vale la estimación $\hat\beta_2$ con los datos disponibles $\boldsymbol x$ e $\boldsymbol y$?''
  • a ``¿cuánto vale el estimador $\hat\beta_2$, en promedio, sobre todas las muestras posibles?'' (su proyección sobre $\mathit1$, lección 9).

Lema (demostrado en los apuntes): si $c(\boldsymbol X)$ es una función de $\boldsymbol X$, $$ E\big[c(\boldsymbol X)Z\mid\boldsymbol X\big]=c(\boldsymbol X)E[Z\mid\boldsymbol X]. $$$\mbox{ }$

Aplicándolo con $c(\boldsymbol X)=W_i$ (pues cada $W_i$ es función de $\boldsymbol X$, sección anterior): $$ E[\hat\beta_2\mid\boldsymbol X]=\beta_2\,\mathit1+\sum_iW_i\,E[U_i\mid\boldsymbol X]=\beta_2\,\mathit1+\sum_iW_i\,\mathit0=\beta_2\,\mathit1. $$

Ley de las esperanzas iteradas: Como $E[Z\mid\boldsymbol X]$ es la proyección ortogonal de $Z$ sobre el espacio de las funciones de $\boldsymbol X$ (y $\mathit1$ es una de ellas), entonces $Z-E[Z\mid\boldsymbol X]\perp\mathit1$. Por tanto, $$\mathrm{E}(Z)=\mathrm{E}\big(E[Z\mid\boldsymbol X]\big).$$$\mbox{ }$

$$ \boxed{\;\mathrm{E}(\hat\beta_2)=\mathrm{E}\big(E[\hat\beta_2\mid\boldsymbol X]\big)=\beta_2.\;} $$

$\hat\beta_2$ no acierta en cada muestra — pero no se equivoca sistemáticamente en ninguna dirección.

Varianza: cuán dispersas están las estimaciones¶

Desarrollando el cuadrado (apuntes) y aplicando el Lema anterior: $$ Var[\hat\beta_2\mid\boldsymbol X]=Var\Big[\textstyle\sum_iW_iU_i\,\Big|\,\boldsymbol X\Big]=\sum_iW_i^2\,Var[U_i\mid\boldsymbol X]+\sum_{i\neq j}W_iW_j\,Cov[U_i,U_j\mid\boldsymbol X] $$

Homocedasticidad + $Cov[U_i,U_j\mid\boldsymbol X]=\mathit 0$ (``El marco'') $\;\Longrightarrow\;$ $$ Var[\hat\beta_2\mid\boldsymbol X]=\sigma^2\sum_iW_i^2. $$

$$ \boxed{\;Var[\hat\beta_2\mid\boldsymbol X]=\frac{\sigma^2}{\sum_i(X_i-{\overline{X}})^2}=\frac{\sigma^2}{n\,S^2}.\;} $$

donde $S^2=\frac1n\sum_i(X_i-\overline{X})^2$ es la varianza muestral del regresor (divisor $n$, como en la lección 5).

Más dispersión en $X$, o más observaciones: más precisión. Más ruido ($\sigma^2$): menos precisión.

Versión interactiva: cuaderno 4 en MyBinder (muchas muestras, muchas rectas; el histograma de $\hat\beta_2$ y el efecto de la dispersión de $\boldsymbol x$).

MCO es BLUE; estimando $\sigma^2$¶

Sin demostrarlo (Gauss–Markov): de entre todos los estimadores lineales e insesgados de $\beta_2$, $\hat\beta_2$ tiene la menor varianza — MCO es BLUE (Best Linear Unbiased Estimator).

$\sigma^2$ (desconocido) se estima con la cuasivarianza de los residuos, un tercer producto escalar, tras el euclídeo y el estadístico: $$ \langle\cdot,\cdot\rangle_{n-k}=\frac1{n-k}\langle\cdot,\cdot\rangle_{e}, \qquad \mathfrak{s}^2=\langle\boldsymbol{\mathop{\widehat{e}}},\boldsymbol{\mathop{\widehat{e}}}\rangle_{n-k}=\frac{\mathrm{SRC}}{n-k}. $$

Tres divisores, tres motivos distintos: $1$ (geometría pura, sin más), $n$ (para que $\|\boldsymbol1\|_s=1$, lección 4), $n-k$ (para que $\mathfrak s^2$ sea un estimador insesgado de $\sigma^2$).

¿Y con más regresores?¶

Sin demostrarlo (generalización matricial de lo probado hoy; recordando la notación de la lección 10 y su extensión aleatoria de ``El marco''): $$ E[\boldsymbol{\mathop{\widehat{\beta}}}\mid\boldsymbol X]=\boldsymbol\beta\,\mathit1,\qquad Var[\boldsymbol{\mathop{\widehat{\beta}}}\mid\boldsymbol X]=\sigma^2(\boldsymbol X^\top\boldsymbol X)^{-1}. $$

En la diagonal de esta matriz están $Var[\hat\beta_1\mid\boldsymbol X],\ldots,Var[\hat\beta_k\mid\boldsymbol X]$; fuera de la diagonal, las covarianzas $Cov[\hat\beta_i,\hat\beta_j\mid\boldsymbol X]$.

Evaluada en una muestra ya observada, y con $\sigma^2$ sustituido por su estimación $\mathfrak s^2$ (transparencia anterior) —la fórmula que de hecho calculan los programas estadísticos—: $$ \mathfrak s^2(\boldsymbol{\mathsf X}^\top\boldsymbol{\mathsf X})^{-1}. $$

Para $k=2$, el elemento $(2,2)$ de esta fórmula matricial se reduce exactamente a lo que hoy hemos demostrado sin matrices (y los otros tres elementos dan, de propina, lo que no hemos calculado).

Recapitulación y guiño a la sesión siguiente¶

Propiedad Resultado (regresión simple, $k=2$) Supuestos usados
Insesgadez $\mathrm{E}(\hat\beta_2)=\beta_2$ Linealidad + $\mathrm{Var}(X)\neq0$ + muestreo aleatorio
Varianza $Var[\hat\beta_2\mid\boldsymbol X]=\frac{\sigma^2}{\sum_i(X_i-{\overline{X}})^2}$ + Homocedasticidad (+ $Cov[U_i,U_j\mid\boldsymbol X]=\mathit0$, del muestreo aleatorio)
Eficiencia MCO es BLUE (mejor entre los lineales e insesgados) Los tres + muestreo aleatorio (Gauss–Markov, sin demostrar)

Casi nada nuevo: la vía alternativa (lección 7), la esperanza condicional y la independencia entre observaciones (lección 9). Lo único nuevo: evaluar la fórmula sobre variables aleatorias, no sobre datos; eso, y solo eso, convierte $\hat\beta_2$ en un estimador.

Nota: los mismos argumentos, sobre $\hat\beta_1=\overline{Y}-\hat\beta_2{\overline{X}}$, prueban la insesgadez de $\hat\beta_1$.

Lección 12: ya conocemos la media y la varianza de $\hat\beta_2$; para intervalos de confianza y contrastes hace falta algo más: la forma de su distribución.