Author: Marcos Bujosa
La lección 11 dejó a $\hat\beta_2$ bien centrado y con una varianza conocida, pero le faltaba lo esencial para contrastar hipótesis: la forma de su distribución. Hoy la obtenemos suponiendo normalidad de la perturbación.
Con ella construimos el error estándar, el intervalo de confianza y el contraste $t$ —que no mide nada que el $R^2$ no midiera ya— y aprendemos a leer una tabla de resultados.
``Significativo'' no quiere decir ``grande'', ni ``importante'', ni ``verdadero''.
De la lección 11 nos traemos dos resultados sobre el modelo lineal simple ($k=2$: la constante $\mathit1$ y un único regresor no constante $X$): $$ \mathrm{E}(\hat\beta_2)=\beta_2, \qquad Var[\hat\beta_2\mid\boldsymbol X]=\frac{\sigma^2}{\sum_i(X_i-\overline{X})^2}=\frac{\sigma^2}{nS^2}. $$
Y nos traemos también una limitación reconocida en voz alta: eso no basta para responder a
Saber dónde está centrada una distribución y cuánto se dispersa no dice cuánta probabilidad hay más allá de un punto. Para eso hace falta la forma.
Hoy: un supuesto nuevo, tres herramientas (error estándar, intervalo, contraste) — y, sobre todo, aprender a leerlas.
Condicionada a $\boldsymbol X$, cada perturbación $U_i$ es normal de media $0$ y varianza $\sigma^2$.
La descomposición de la lección 11 hace todo el trabajo: $$ \hat\beta_2=\beta_2\,\mathit1+\sum_iW_iU_i. $$ Condicionando en $\boldsymbol X$ los pesos $W_i$ son constantes, y una combinación lineal de normales independientes es normal:
Lo nuevo es la palabra ``$N$''; y es un supuesto genuino: el laboratorio anterior mostró que insesgadez y varianza no la necesitan.
Geométricamente: la normalidad hace el ruido isótropo, sin dirección privilegiada en $\mathbb{R}^n$.
Esa varianza contiene $\sigma^2$, que no conocemos: la estimamos con la cuasivarianza de los residuos (lección 11), $\mathfrak s^2=\mathrm{SRC}/(n-k)$.
Sustituyendo $\sigma$ por $\mathfrak s$ sobre los datos observados, el error estándar de $\hat\beta_2$: $$ \boxed{\;\mathrm{ee}(\hat\beta_2)=\frac{\mathfrak s}{\sqrt{\sum_i(x_i-\mu_{\boldsymbol x})^2}} =\frac{\mathfrak s}{\|\boldsymbol x-\boldsymbol{\mathop{\overline x}}\|_e}.\;} $$
Un cociente de longitudes: ruido estimado por unidad de longitud del regresor en desviaciones.
El precio de estimar $\sigma$: la normal se convierte en una $t$ de Student con $n-k$ grados de libertad (enunciado, no demostrado): $$ \frac{\hat\beta_2-\beta_2}{\mathrm{ee}(\hat\beta_2)}\;\sim\;t_{n-k}. $$
Hipótesis nula: $H_0\!:\beta_2=0$ (``el regresor no aporta nada''), frente a $H_1\!:\beta_2\neq0$.
Estadístico (bajo $H_0$, sustituyendo $\beta_2=0$ en la transparencia anterior): $$ t=\frac{\hat\beta_2}{\mathrm{ee}(\hat\beta_2)}\;\sim\;t_{n-k}. $$
Decisión al nivel $\alpha$ (habitualmente $0{,}05$): se rechaza $H_0$ si $\vert t\vert>t_c$, el valor crítico de la $t_{n-k}$ que deja $\alpha/2$ en cada cola.
Valor $p$: probabilidad de un $\vert t\vert$ al menos tan grande como el obtenido, si $H_0$ fuese cierta. Se rechaza si es menor que $\alpha$.
Nada obliga a contrastar contra cero: para $H_0\!:\beta_2=c$ (p. ej. una elasticidad unitaria), $\;t=(\hat\beta_2-c)/\mathrm{ee}(\hat\beta_2)$.
Con $\boldsymbol{\mathop{\widehat y}}-\boldsymbol{\mathop{\overline y}}=\hat\beta_2(\boldsymbol x-\boldsymbol{\mathop{\overline x}})$ y $\mathfrak s^2=\mathrm{SRC}/(n-k)$, el estadístico queda: $$ \boxed{\;t^2=(n-k)\,\frac{\mathrm{SEC}}{\mathrm{SRC}}, \qquad\text{es decir}\qquad \vert t\vert=\sqrt{n-k}\;\frac{\|\boldsymbol{\mathop{\widehat y}}-\boldsymbol{\mathop{\overline y}}\|_e}{\|\boldsymbol{\mathop{\widehat e}}\|_e}.\;} $$

Y como $\mathrm{STC}=\mathrm{SEC}+\mathrm{SRC}$, también $t^2=(n-k)R^2/(1-R^2)$: el contraste $t$ no mide nada que el $R^2$ no midiera ya.
La identidad anterior separa la significación en dos factores: $\;\vert t\vert=\sqrt{n-k}\times\sqrt{\mathrm{SEC}}/\sqrt{\mathrm{SRC}}$, es decir, cuánta evidencia $\times$ qué fuerza tiene la relación.

Con pocas observaciones un ángulo pequeño no prueba nada: en $\mathbb{R}^2$ todo par de vectores en desviaciones está alineado ($R^2=1$ siempre, $n-k=0$). En dimensión alta dos direcciones sin relación son casi ortogonales: el mismo ángulo sorprende más cuanto mayor es $n$.
Un rango de valores compatibles con los datos, en vez de un veredicto: $$ \boxed{\;\Big[\;\hat\beta_2-t_c\cdot\mathrm{ee}(\hat\beta_2)\;,\;\;\hat\beta_2+t_c\cdot\mathrm{ee}(\hat\beta_2)\;\Big]\;} $$ con el mismo $t_c$ del contraste; semiamplitud $t_c\,\mathfrak s/\|\boldsymbol x-\boldsymbol{\mathop{\overline x}}\|_e$.

Dice: el $95\,\%$ de las muestras dan un intervalo que contiene a $\beta_2$. No dice: que $\beta_2$ esté en este con probabilidad $0{,}95$; $\beta_2$ no es aleatorio, el intervalo sí.
Toda salida de estimación tiene, para cada regresor, las mismas cuatro columnas:
| Columna | Qué es | A qué pregunta responde |
|---|---|---|
| Coeficiente | $\hat\beta_j$ | ¿de qué tamaño es el efecto, en las unidades del problema? |
| Desv. típica | $\mathrm{ee}(\hat\beta_j)$ | ¿con cuánta precisión lo hemos medido? |
| Estadístico $t$ | el cociente de las dos anteriores | ¿a cuántos errores estándar del cero está? |
| Valor $p$ | $\mathrm{P}\big(\vert t_{n-k}\vert>\vert t\vert\big)$ | ¿cuán raro sería esto si el efecto fuese nulo? |
Las dos últimas son derivadas: no añaden información, reordenan la de las dos primeras. La comprobación a mano —$t$ = coeficiente $/$ desviación típica— conviene hacerla siempre.
Aviso terminológico: en la salida en español, ``desviación típica'' rotula tres cantidades distintas: la de la variable dependiente (dispersión de los datos), la de la regresión ($\mathfrak s$) y la de cada coeficiente (su error estándar). En inglés solo la primera es standard deviation; las otras dos son standard error.
La identidad de la sección ``Lectura geométrica: la razón de catetos'' lo explica sin necesidad de moraleja: $|t|$ mezcla fuerza de la relación con cantidad de evidencia.
| $n$ | $R^2$ | $\theta$ | $\vert t\vert$ | Veredicto al $5\,\%$ |
|---|---|---|---|---|
| 3 | 0,90 | $18{,}4^\circ$ | 3,00 | no significativo ($t_c=12{,}71$) |
| 5 | 0,90 | $18{,}4^\circ$ | 5,20 | significativo ($t_c=3{,}18$) |
| 1002 | 0,01 | $84{,}3^\circ$ | 3,18 | significativo ($t_c=1{,}96$) |
Mismo ángulo, veredicto opuesto (filas 1 y 2). Y un ángulo de $84^\circ$ —casi ortogonal, $R^2$ del $1\,\%$— resulta significativo con mil observaciones (fila 3).
Qué mirar en su lugar: el coeficiente en las unidades del problema; el intervalo de confianza; el $R^2$. La significación dice si el efecto es distinguible de cero, no si es grande.
Y tres avisos más: ``no rechazar'' no es ``aceptar''; el valor $p$ no es la probabilidad de que $H_0$ sea cierta; nada de esto establece causalidad.
| Pieza | Fórmula | Lectura geométrica |
|---|---|---|
| Error estándar | $\mathfrak s/\Vert\boldsymbol x-\boldsymbol{\mathop{\overline x}}\Vert_e$ | ruido por unidad de longitud del regresor |
| Estadístico $t$ | $\hat\beta_2/\mathrm{ee}(\hat\beta_2)$ | $\sqrt{n-k}\times$ razón de catetos |
| Grados de libertad | $n-k$ | dimensión del subespacio donde vive el residuo |
| Región crítica | $\vert t\vert>t_c$ | cono alrededor de la dirección del regresor |
| Intervalo de confianza | $\hat\beta_2\pm t_c\cdot\mathrm{ee}(\hat\beta_2)$ | haz de pendientes compatibles |
Un solo supuesto nuevo (normalidad); todo lo demás venía de las lecciones 8 y 11.
Lección 13: el mismo cociente de catetos, con dos divisores en lugar de uno, es el contraste $F$ —que juzga varios regresores a la vez—. En regresión simple, $F=t^2$.
Más adelante: con $k$ regresores, $\mathrm{ee}(\hat\beta_j)=\mathfrak s/\|\tilde{\boldsymbol x}_j\|_e$, donde $\tilde{\boldsymbol x}_j$ es lo que le queda de propio al regresor $j$ tras descontar lo que comparte con los demás. Cuando dos regresores casi se solapan, esa longitud se acorta: colinealidad.