Lección 12. Inferencia: error estándar, intervalo de confianza y contraste $t$¶

Author: Marcos Bujosa

La lección 11 dejó a $\hat\beta_2$ bien centrado y con una varianza conocida, pero le faltaba lo esencial para contrastar hipótesis: la forma de su distribución. Hoy la obtenemos suponiendo normalidad de la perturbación.

Con ella construimos el error estándar, el intervalo de confianza y el contraste $t$ —que no mide nada que el $R^2$ no midiera ya— y aprendemos a leer una tabla de resultados.

``Significativo'' no quiere decir ``grande'', ni ``importante'', ni ``verdadero''.

  • (slides) — (html) — (pdf)

De dónde venimos: nos falta la forma¶

De la lección 11 nos traemos dos resultados sobre el modelo lineal simple ($k=2$: la constante $\mathit1$ y un único regresor no constante $X$): $$ \mathrm{E}(\hat\beta_2)=\beta_2, \qquad Var[\hat\beta_2\mid\boldsymbol X]=\frac{\sigma^2}{\sum_i(X_i-\overline{X})^2}=\frac{\sigma^2}{nS^2}. $$

Y nos traemos también una limitación reconocida en voz alta: eso no basta para responder a

  • ¿es compatible con estos datos que $\beta_2$ valga cero?
  • ¿en qué rango de valores puedo confiar razonablemente que está $\beta_2$?

Saber dónde está centrada una distribución y cuánto se dispersa no dice cuánta probabilidad hay más allá de un punto. Para eso hace falta la forma.

Hoy: un supuesto nuevo, tres herramientas (error estándar, intervalo, contraste) — y, sobre todo, aprender a leerlas.

El supuesto nuevo: normalidad¶

Condicionada a $\boldsymbol X$, cada perturbación $U_i$ es normal de media $0$ y varianza $\sigma^2$.

La descomposición de la lección 11 hace todo el trabajo: $$ \hat\beta_2=\beta_2\,\mathit1+\sum_iW_iU_i. $$ Condicionando en $\boldsymbol X$ los pesos $W_i$ son constantes, y una combinación lineal de normales independientes es normal:

$$ \boxed{\;\hat\beta_2\;\Big|\;\boldsymbol X\;\sim\; N\Big(\beta_2,\;\frac{\sigma^2}{\sum_i(X_i-\overline X)^2}\Big).\;} $$

Lo nuevo es la palabra ``$N$''; y es un supuesto genuino: el laboratorio anterior mostró que insesgadez y varianza no la necesitan.

Geométricamente: la normalidad hace el ruido isótropo, sin dirección privilegiada en $\mathbb{R}^n$.

El error estándar, y el precio de estimar $\sigma$¶

Esa varianza contiene $\sigma^2$, que no conocemos: la estimamos con la cuasivarianza de los residuos (lección 11), $\mathfrak s^2=\mathrm{SRC}/(n-k)$.

Sustituyendo $\sigma$ por $\mathfrak s$ sobre los datos observados, el error estándar de $\hat\beta_2$: $$ \boxed{\;\mathrm{ee}(\hat\beta_2)=\frac{\mathfrak s}{\sqrt{\sum_i(x_i-\mu_{\boldsymbol x})^2}} =\frac{\mathfrak s}{\|\boldsymbol x-\boldsymbol{\mathop{\overline x}}\|_e}.\;} $$

Un cociente de longitudes: ruido estimado por unidad de longitud del regresor en desviaciones.

El precio de estimar $\sigma$: la normal se convierte en una $t$ de Student con $n-k$ grados de libertad (enunciado, no demostrado): $$ \frac{\hat\beta_2-\beta_2}{\mathrm{ee}(\hat\beta_2)}\;\sim\;t_{n-k}. $$

El contraste $t$¶

Hipótesis nula: $H_0\!:\beta_2=0$ (``el regresor no aporta nada''), frente a $H_1\!:\beta_2\neq0$.

Estadístico (bajo $H_0$, sustituyendo $\beta_2=0$ en la transparencia anterior): $$ t=\frac{\hat\beta_2}{\mathrm{ee}(\hat\beta_2)}\;\sim\;t_{n-k}. $$

Decisión al nivel $\alpha$ (habitualmente $0{,}05$): se rechaza $H_0$ si $\vert t\vert>t_c$, el valor crítico de la $t_{n-k}$ que deja $\alpha/2$ en cada cola.

Valor $p$: probabilidad de un $\vert t\vert$ al menos tan grande como el obtenido, si $H_0$ fuese cierta. Se rechaza si es menor que $\alpha$.

Nada obliga a contrastar contra cero: para $H_0\!:\beta_2=c$ (p. ej. una elasticidad unitaria), $\;t=(\hat\beta_2-c)/\mathrm{ee}(\hat\beta_2)$.

Lectura geométrica: la razón de catetos¶

Con $\boldsymbol{\mathop{\widehat y}}-\boldsymbol{\mathop{\overline y}}=\hat\beta_2(\boldsymbol x-\boldsymbol{\mathop{\overline x}})$ y $\mathfrak s^2=\mathrm{SRC}/(n-k)$, el estadístico queda: $$ \boxed{\;t^2=(n-k)\,\frac{\mathrm{SEC}}{\mathrm{SRC}}, \qquad\text{es decir}\qquad \vert t\vert=\sqrt{n-k}\;\frac{\|\boldsymbol{\mathop{\widehat y}}-\boldsymbol{\mathop{\overline y}}\|_e}{\|\boldsymbol{\mathop{\widehat e}}\|_e}.\;} $$

img

Y como $\mathrm{STC}=\mathrm{SEC}+\mathrm{SRC}$, también $t^2=(n-k)R^2/(1-R^2)$: el contraste $t$ no mide nada que el $R^2$ no midiera ya.

Por qué el valor crítico depende de $n-k$¶

La identidad anterior separa la significación en dos factores: $\;\vert t\vert=\sqrt{n-k}\times\sqrt{\mathrm{SEC}}/\sqrt{\mathrm{SRC}}$, es decir, cuánta evidencia $\times$ qué fuerza tiene la relación.

img

Con pocas observaciones un ángulo pequeño no prueba nada: en $\mathbb{R}^2$ todo par de vectores en desviaciones está alineado ($R^2=1$ siempre, $n-k=0$). En dimensión alta dos direcciones sin relación son casi ortogonales: el mismo ángulo sorprende más cuanto mayor es $n$.

El intervalo de confianza¶

Un rango de valores compatibles con los datos, en vez de un veredicto: $$ \boxed{\;\Big[\;\hat\beta_2-t_c\cdot\mathrm{ee}(\hat\beta_2)\;,\;\;\hat\beta_2+t_c\cdot\mathrm{ee}(\hat\beta_2)\;\Big]\;} $$ con el mismo $t_c$ del contraste; semiamplitud $t_c\,\mathfrak s/\|\boldsymbol x-\boldsymbol{\mathop{\overline x}}\|_e$.

img

Dice: el $95\,\%$ de las muestras dan un intervalo que contiene a $\beta_2$. No dice: que $\beta_2$ esté en este con probabilidad $0{,}95$; $\beta_2$ no es aleatorio, el intervalo sí.

Cómo se lee una tabla de resultados¶

Toda salida de estimación tiene, para cada regresor, las mismas cuatro columnas:

Columna Qué es A qué pregunta responde
Coeficiente $\hat\beta_j$ ¿de qué tamaño es el efecto, en las unidades del problema?
Desv. típica $\mathrm{ee}(\hat\beta_j)$ ¿con cuánta precisión lo hemos medido?
Estadístico $t$ el cociente de las dos anteriores ¿a cuántos errores estándar del cero está?
Valor $p$ $\mathrm{P}\big(\vert t_{n-k}\vert>\vert t\vert\big)$ ¿cuán raro sería esto si el efecto fuese nulo?

Las dos últimas son derivadas: no añaden información, reordenan la de las dos primeras. La comprobación a mano —$t$ = coeficiente $/$ desviación típica— conviene hacerla siempre.

Aviso terminológico: en la salida en español, ``desviación típica'' rotula tres cantidades distintas: la de la variable dependiente (dispersión de los datos), la de la regresión ($\mathfrak s$) y la de cada coeficiente (su error estándar). En inglés solo la primera es standard deviation; las otras dos son standard error.

Significación estadística $\neq$ relevancia económica¶

La identidad de la sección ``Lectura geométrica: la razón de catetos'' lo explica sin necesidad de moraleja: $|t|$ mezcla fuerza de la relación con cantidad de evidencia.

$n$ $R^2$ $\theta$ $\vert t\vert$ Veredicto al $5\,\%$
3 0,90 $18{,}4^\circ$ 3,00 no significativo ($t_c=12{,}71$)
5 0,90 $18{,}4^\circ$ 5,20 significativo ($t_c=3{,}18$)
1002 0,01 $84{,}3^\circ$ 3,18 significativo ($t_c=1{,}96$)

Mismo ángulo, veredicto opuesto (filas 1 y 2). Y un ángulo de $84^\circ$ —casi ortogonal, $R^2$ del $1\,\%$— resulta significativo con mil observaciones (fila 3).

Qué mirar en su lugar: el coeficiente en las unidades del problema; el intervalo de confianza; el $R^2$. La significación dice si el efecto es distinguible de cero, no si es grande.

Y tres avisos más: ``no rechazar'' no es ``aceptar''; el valor $p$ no es la probabilidad de que $H_0$ sea cierta; nada de esto establece causalidad.

Recapitulación y guiño a las sesiones siguientes¶

Pieza Fórmula Lectura geométrica
Error estándar $\mathfrak s/\Vert\boldsymbol x-\boldsymbol{\mathop{\overline x}}\Vert_e$ ruido por unidad de longitud del regresor
Estadístico $t$ $\hat\beta_2/\mathrm{ee}(\hat\beta_2)$ $\sqrt{n-k}\times$ razón de catetos
Grados de libertad $n-k$ dimensión del subespacio donde vive el residuo
Región crítica $\vert t\vert>t_c$ cono alrededor de la dirección del regresor
Intervalo de confianza $\hat\beta_2\pm t_c\cdot\mathrm{ee}(\hat\beta_2)$ haz de pendientes compatibles

Un solo supuesto nuevo (normalidad); todo lo demás venía de las lecciones 8 y 11.

Lección 13: el mismo cociente de catetos, con dos divisores en lugar de uno, es el contraste $F$ —que juzga varios regresores a la vez—. En regresión simple, $F=t^2$.

Más adelante: con $k$ regresores, $\mathrm{ee}(\hat\beta_j)=\mathfrak s/\|\tilde{\boldsymbol x}_j\|_e$, donde $\tilde{\boldsymbol x}_j$ es lo que le queda de propio al regresor $j$ tras descontar lo que comparte con los demás. Cuando dos regresores casi se solapan, esa longitud se acorta: colinealidad.