Lección 11. ¿Es \(\boldsymbol{\mathop{\widehat{\beta}}}\) un buen estimador? Insesgadez y varianza

Índice

¿Es \(\boldsymbol{\mathop{\widehat{\beta}}}\) un buen estimador de \(\boldsymbol\beta\)? Para el modelo lineal simple: \(\hat\beta_2\) es insesgado y calculamos su varianza, reutilizando la fórmula de la lección 7 sobre variables aleatorias.

``¿Es bueno un estimador? ¿Está bien centrado? ¿Cuánto se dispersa?''

1. De dónde venimos: una pregunta pendiente

Recordemos cómo cerraba la lección 10: ``¿es \(\boldsymbol{\mathop{\widehat{\beta}}}\) un buen estimador del verdadero \(\boldsymbol\beta\)?''

\(\hat\beta_1,\hat\beta_2\), calculados primero con argumentos geométricos sobre los vectores de datos, se reinterpretaron después como estimadores de \(\beta_1,\beta_2\) por el método de los momentos.

Hoy, para el modelo lineal simple (constante \(\mathit1\) más un regresor no constante \(X\)), demostraremos dos propiedades de \(\hat\beta_2\):

  1. Insesgadez: \(\mathrm{E}(\hat\beta_2)=\beta_2\).
  2. Varianza: una fórmula exacta de \(Var[\hat\beta_2\mid\boldsymbol X]\).

Nos centramos en \(\hat\beta_2\) (la pendiente, de mayor interés económico); los mismos argumentos, sobre la fórmula \(\hat\beta_1\), permiten probar la insesgadez de \(\hat\beta_1\); no los desarrollamos aquí para no ser repetitivos.

Ningún ingrediente geométrico nuevo: la fórmula de \(\hat\beta_2\) que obtuvimos por geometría, la reutilizamos hoy tal cual, evaluada sobre variables aleatorias en lugar de sobre datos: una fórmula aritmética vieja, aplicada sobre un objeto nuevo.

De dónde venimos: una pregunta pendiente

Esta sesión responde a una pregunta que quedó abierta en las lecciones 9 y 10. En la lección 9 (``El puente'') dimos sentido, por primera vez, a la pregunta ``¿\(\hat\beta_2\) estima bien al verdadero \(\beta_2\) poblacional?'', al construir el modelo poblacional \(Y=\beta_1\,\mathit1+\beta_2X+U\) y reinterpretar las fórmulas de la lección 7 como estimadores por el método de los momentos. En la lección 10 (regresión múltiple) esa misma pregunta se generalizó a \(k\) regresores, pero se dejó sin respuesta: una sola frase en la recapitulación, sin fórmula ni supuestos generalizados. Hoy la retomamos en detalle en el caso más sencillo, \(k=2\): la constante \(\mathit1\) y un único regresor no constante \(X\).

La estrategia de esta sesión no introduce ninguna geometría nueva. Vamos a reutilizar, tal cual, la fórmula de \(\hat\beta_2\) que obtuvimos en la lección 7 mediante la ``vía alternativa'' (proyección sobre generadores ortogonales, vía Cauchy–Schwarz). Esa fórmula, una vez concluido el cálculo geométrico, quedó escrita como una expresión puramente aritmética: una suma de productos dividida por una suma de cuadrados. Precisamente por ser aritmética, y ya no geométrica, podemos evaluarla en cualquier conjunto de argumentos siempre que las operaciones estén bien definidas. Hoy evaluaremos la fórmula, en lugar de con datos fijos \(x_1,\ldots,x_n,y_1,\ldots,y_n\), con las variables aleatorias de una muestra \(X_1,\ldots,X_n,Y_1,\ldots,Y_n\). El resultado de esa sustitución ya no es un número: es una nueva variable aleatoria, el estimador \(\hat\beta_2(\boldsymbol X,\boldsymbol Y)\).

Conviene decir desde el principio qué NO vamos a hacer. No vamos a definir un nuevo producto escalar \(\langle\cdot,\cdot\rangle\) sobre ``vectores cuyas componentes son variables aleatorias'', ni vamos a apelar de nuevo a Cauchy–Schwarz para justificar la fórmula de \(\hat\beta_2\): la lección de hoy no se basa en ese tipo de argumentos geométricos. Lo único que hacemos hoy es sustituir números por variables aleatorias dentro de una fórmula ya obtenida. Es una operación distinta de una demostración geométrica, y no exige comprobar ninguna propiedad de producto escalar: es la diferencia entre demostrar un teorema y usar en otro contexto la fórmula que el teorema produjo.

Conviene también precisar el alcance de esta sesión: demostramos insesgadez y la expresión de la varianza solo para \(\hat\beta_2\) en la regresión con dos regresores (modelo lineal simple). La generalización a \(k\) regresores existe: la citaremos al final de la sesión en su forma matricial, sin demostrarla, porque requiere álgebra que este curso no desarrolla; la insesgadez y la varianza de cada coeficiente por separado sí están demostradas sin matrices en el apéndice (sección 7.1) (html). Lo que sí haremos, como cierre, es comprobar que la fórmula general, evaluada en el caso particular \(k=2\), coincide con lo que aquí probamos sin matrices.

Para profundizar: Wooldridge, J. M. (2020), cap. 2, sección 2.5: insesgadez y varianza de los estimadores MCO en regresión simple (Teoremas 2.1 y 2.2).

2. El marco: muestra aleatoria

Recordemos (lección 9): los \(n\) datos son \(n\) copias idénticas e independientes de \(Y\); hoy, del par \((X,U)\).

\(\boldsymbol X\): la versión aleatoria de \(\boldsymbol{\mathsf X}=[\boldsymbol 1;\;\boldsymbol x]\), con columnas \(\mathit 1\) (\(n\) copias) y \(X_1,\ldots,X_n\). Análogamente \(\boldsymbol Y=(Y_1,\ldots,Y_n)\) y \(\boldsymbol U=(U_1,\ldots,U_n)\). Para cada \(i\): \(\;Y_i=\beta_1\,\mathit1+\beta_2X_i+U_i\), con los tres supuestos de la lección 9, condicionando ahora en \(\boldsymbol X\).

Lo nuevo es el muestreo aleatorio: las \(n\) copias \((X_i,U_i)\) son independientes entre sí. Dos consecuencias:

  • \(E[U_i\mid\boldsymbol X]=\mathit0\): \(U_i\perp\) funciones de \(X_i\) (por definición) y de las demás copias (por independencia).
  • Perturbaciones de observaciones distintas, incorreladas: \(Cov[U_i,U_j\mid\boldsymbol X]=\mathit 0\) \(\;(i\neq j)\).

Condicionar en \(\boldsymbol X\): la esperanza condicional de la lección 9, sobre las \(n\) copias a la vez.

El marco: muestra aleatoria

La lección 9 introdujo, sin desarrollarla, una frase que hoy se convierte en el ingrediente central de la sesión: ``asumiremos que nuestros \(n\) datos son el resultado de observar la realización de \(n\) copias idénticas e independientes de esa variable \(Y\)''. Allí esa frase servía únicamente para enunciar que interpretamos cada dato \(y_i\) como la realización de una variable aleatoria. Hoy la trataremos con más profundidad, porque para hablar de la distribución de \(\hat\beta_2\), de cuánto varía de una muestra a otra, necesitamos imaginar que la muestra de datos podría haber sido distinta.

Formalicemos esa idea. Desde la lección 4 venimos usando \(\boldsymbol x=(x_1,\ldots,x_n)\) para el vector de datos observados (y, desde la lección 6, para el vector de datos observados de un regresor), y en la lección 10 los agrupamos en la matriz de regresores \(\boldsymbol{\mathsf X}\), una columna por regresor (en el modelo lineal simple, \(\boldsymbol{\mathsf X}=[\boldsymbol1;\;\boldsymbol x]\)). Hoy introducimos su análogo aleatorio: la matriz1 \(\boldsymbol X\). Este es el objeto sobre el que condicionaremos todos los momentos a lo largo de la sesión. Cada columna de \(\boldsymbol X\) corresponderá al muestreo de uno de los regresores poblacionales. En el modelo lineal simple son \(\mathit 1\) y \(X\); por tanto, la segunda columna de \(\boldsymbol X\) está formada por las \(n\) variables aleatorias \(X_1,\ldots,X_n\): cada una es una copia idéntica e independiente de la variable poblacional \(X\) de la lección 9.2 Es la misma relación dato/variable aleatoria que venimos usando desde la lección 9 (entre \(y_i\) e \(Y\)), aplicada componente a componente a los \(n\) elementos de la muestra correspondiente a cada columna.

MatrizCopias.png

Figura 1: La matriz de copias. Cada fila es una copia de la variable, una función sobre \(\Omega\); la matriz continúa hacia abajo indefinidamente. Elegir \(n\) filas es crear una muestra; elegir una columna es fijar un suceso elemental \(\omega\) donde evaluar las infinitas copias; las dos cosas a la vez dan el vector de \(\mathbb R^n\) de la derecha: la realización de la muestra. Los datos observados son una columna; repetir el experimento es recorrer otras columnas con las mismas filas.

La figura ordena lo que sigue. Cada fila es una copia, una variable aleatoria entera; la lista \((X_1,\ldots,X_n)\) son \(n\) filas, no un vector de \(\mathbb R^n\): sus componentes son funciones, no números. Fijar un suceso elemental \(\omega\) es elegir una columna. Las dos cosas a la vez dan un vector de \(\mathbb R^n\), la realización de la muestra, que es lo que tenemos en un vector de datos: nuestro vector es una columna, de \(n\) funciones (\(n\) copias) evaluadas en un mismo \(\omega\). Y cuando en el laboratorio de la sesión siguiente repitamos un experimento dos mil veces (actividad 3 (html) de la práctica A de la sesión 16), podremos interpretarlo como que estamos obteniendo dos mil columnas mediante la evaluación de las mismas filas en dos mil \(\omega\) distintos. El apéndice (sección 3) (html) desarrolla esta lectura.

Una precisión de uso. Durante casi toda la sesión no necesitaremos ninguna operación matricial con \(\boldsymbol X\): bastarán sumatorios sobre las \(X_i\), y ``condicionar en \(\boldsymbol X\)'' significará siempre proyectar sobre el espacio de funciones cuyo argumento son, simultáneamente, todas las variables aleatorias presentes en \(\boldsymbol X\). La estructura de matriz de \(\boldsymbol X\) reaparecerá puntualmente al justificar el divisor \(n-k\) (sección ``MCO es BLUE; estimando \(\sigma^2\)'', donde hablaremos de las columnas de \(\boldsymbol{\mathsf X}\)) y, con más de 2 columnas, en la generalización final a \(k\) regresores. Es decir: el símbolo \(\boldsymbol X\) significa lo mismo al principio y al final de la sesión; lo único que cambia es cuántas columnas tiene.

Para cada observación \(i\), el modelo poblacional de la lección 9 se aplica sin ningún cambio, con subíndice \(i\) añadido: \[ Y_i=\beta_1\,\mathit1+\beta_2X_i+U_i, \qquad i=1,\ldots,n, \] con los tres supuestos del Modelo Clásico de Regresión Lineal aplicados a cada par \((X_i,U_i)\): linealidad, independencia lineal (\(\mathrm{Var}(X)\neq0\)) y homocedasticidad \(Var[U_i\mid\boldsymbol X]=\sigma^2\,\mathit1\); más la exogeneidad estricta \(E[U_i\mid\boldsymbol X]=\mathit0\), que en la lección 9 obteníamos sin supuesto adicional.3

Sobre el supuesto \(\mathrm{Var}(X)\neq0\) conviene una precisión, porque es fácil que el símbolo ``\(X\)'' induzca a confusión una vez que ya solo hablamos de \(X_1,\ldots,X_n\). La letra \(X\), sin subíndice, sigue denotando, como en la lección 9, la variable poblacional de la que \(X_1,\ldots,X_n\) son copias. El supuesto \(\mathrm{Var}(X)\neq0\) se enuncia sobre esa variable poblacional, y se aplica a cada copia \(X_i\) porque, al ser copias idénticas, cada \(X_i\) tiene la misma distribución que \(X\) (y, en particular, la misma varianza).

Fíjese que la exogeneidad estricta tampoco es introducida aquí como un supuesto adicional, aunque hoy descansa sobre dos propiedades del modelo (en lugar de solo una): en primer lugar, la definición de \(U_i\) da \(U_i\perp\) funciones de \(X_i\); y, en segundo lugar, el muestreo aleatorio da \(U_i\perp\) funciones de las demás copias \(X_j\) con \(j\ne i\). Esta es la primera consecuencia que extraemos del muestreo aleatorio; la segunda viene a continuación.

La segunda consecuencia del muestreo aleatorio es aún más directa: si \((X_i,U_i)\) y \((X_j,U_j)\) son independientes para \(i\neq j\), entonces, en particular, \(U_i\) y \(U_j\) son independientes, y dos variables independientes tienen covarianza cero:4 \[ Cov[U_i,U_j\mid\boldsymbol X]=\mathit 0 \qquad (i\neq j). \] No se trata, por tanto, de un supuesto añadido ex novo: es la traducción, en términos de covarianzas, de algo que ya habíamos dado por sentado desde la lección 9 al hablar de copias ``idénticas e independientes'' (lo que su curso de estadística del cuatrimestre anterior llamaba, seguramente, muestreo aleatorio simple). Hoy es la primera vez que necesitamos esta consecuencia de forma explícita, porque es la primera vez que trabajamos con varias perturbaciones \(U_1,\ldots,U_n\) simultáneamente, en lugar de con una sola \(U\) genérica. En el lenguaje de la lección 9: dadas \(\boldsymbol X\), las perturbaciones \(U_1,\ldots,U_n\) son una familia ortogonal de variables aleatorias de la misma longitud \(\sigma\). Es todo lo que usan la insesgadez y la varianza de esta sesión; la independencia completa, que es más, solo hará falta en la lección 12 (apéndice, secciones 6.1 (html) y 7.1).

Por último, nótese que, al enunciar el supuesto de homocedasticidad, la varianza de cada \(U_i\) se condiciona a toda la matriz \(\boldsymbol X\); esta condición es más fuerte que condicionar solo sobre \(X_i\). Es la condición que hace falta para todo lo que sigue (ni es un corolario de la definición de \(U_i\) ni tampoco del muestreo aleatorio simple) y la estamos imponiendo directamente en esa forma más fuerte.

Para profundizar: Wooldridge, J. M. (2020), cap. 2, sección 2.5, supuesto SLR.2 (muestreo aleatorio).

3. \(\hat\beta_2\): la misma fórmula, aplicada a variables aleatorias

Estimación vs. estimador (distinción hoy imprescindible):

  • \(\hat\beta_2(\boldsymbol x,\boldsymbol y)\), la estimación: un número.
  • \(\hat\beta_2(\boldsymbol X,\boldsymbol Y)\), el estimador: una variable aleatoria, la MISMA fórmula sobre la muestra aleatoria.

Recordando la ``vía alternativa'' (lección 7): \[ \hat\beta_2(\boldsymbol x,\boldsymbol y)=\frac{\sum_i(x_i-\mu_{\boldsymbol x})y_i}{\sum_j(x_j-\mu_{\boldsymbol x})^2}=\sum_i w_i y_i; \quad\text{donde } w_i=\frac{(x_i-\mu_{\boldsymbol x})}{\sum_j(x_j-\mu_{\boldsymbol x})^2}. \]

Sustituimos \(x_i,y_i\) por \(X_i,Y_i\):

\[ \hat\beta_2(\boldsymbol X,\boldsymbol Y)=\frac{\sum_i(X_i-\overline{X})Y_i}{\sum_j(X_j-\overline{X})^2}=\sum_i {W_i}Y_i; \quad\text{donde } W_i = \frac{(X_i-\overline{X})}{\sum_j(X_j-\overline{X})^2}. \] donde \(\overline{X}=\frac1n\sum_iX_i\) es la media muestral; y \(\sum_i (X_i - \overline{X}) = \mathit 0\).

\(\hat\beta_2\): la misma fórmula, aplicada a variables aleatorias

Antes de seguir, conviene fijar una distinción que hasta ahora el curso no había requerido. Cuando escribimos \(\hat\beta_2=\frac{\sigma_{\boldsymbol{x}\boldsymbol{y}}}{\sigma_{\boldsymbol{x}}^2}=\frac{\sum_i(x_i-\mu_{\boldsymbol x})y_i}{\sum_j(x_j-\mu_{\boldsymbol x})^2}\) (lección 7) y evaluamos esa fórmula con dos vectores de datos concretos \(\boldsymbol x\) e \(\boldsymbol y\), obtenemos un número: la estimación \(\hat\beta_2\) de \(\beta_2\). Si aplicamos la misma fórmula a dos muestras \(\boldsymbol X\) y \(\boldsymbol Y\), el resultado es una función de variables aleatorias, es decir, una variable aleatoria5: el estimador \(\hat\beta_2\) de \(\beta_2\).6

Precisemos qué significa ``sustituir datos por variables aleatorias en una fórmula''. Una fórmula como \(\mu_{\boldsymbol x}=f(x_1,\ldots,x_n)=\frac1n\sum_ix_i\) es, matemáticamente, una función que toma \(n\) números y devuelve un solo número: la media. Pero nada impide evaluar esa MISMA fórmula con otro tipo de argumento (si la operación sigue estando bien definida): si en lugar de \(n\) números sus argumentos son \(n\) variables aleatorias \(X_1,\ldots,X_n\), el resultado \(f(X_1,\ldots,X_n)=\frac1n\sum_iX_i\) ya no es un número, ahora es una variable aleatoria. A esta nueva variable aleatoria la llamamos media muestral, y la denotamos con \({\overline{X}}\); es el estimador natural del valor esperado \(\mathrm{E}(X)\). Su definición emplea la MISMA fórmula aritmética que en la lección 4 usamos para definir la media de un vector de datos, pero ahora la fórmula es aplicada a las \(n\) variables aleatorias de la muestra (de ahí el nombre de media muestral).

Esta observación guía toda la sesión, y no encierra más complejidad que la enunciada: nos limitamos a definir nuevas variables aleatorias mediante la aplicación de fórmulas preexistentes (desarrolladas en su momento en \(\mathbb{R}^n\)) a las variables aleatorias de una muestra. Dichas variables aleatorias se conocen como estadísticos o estadísticos muestrales.

Con esto aclarado, retomamos la fórmula de la ``vía alternativa'' de la lección 7. Allí, cambiando a los generadores ortogonales \(\boldsymbol 1\) y \(\boldsymbol x-\mu_{\boldsymbol x}\boldsymbol 1\), obtuvimos, para dos vectores de datos \(\boldsymbol x\) e \(\boldsymbol y\), \[ \hat\beta_2(\boldsymbol x,\boldsymbol y)=\frac{\langle\boldsymbol y,(\boldsymbol x-\mu_{\boldsymbol x}\boldsymbol1)\rangle_s}{\langle(\boldsymbol x-\mu_{\boldsymbol x}\boldsymbol1),(\boldsymbol x-\mu_{\boldsymbol x}\boldsymbol1)\rangle_s}=\frac{\sum_i(x_i-\mu_{\boldsymbol x})y_i}{\sum_j(x_j-\mu_{\boldsymbol x})^2}. \] El lado izquierdo de esta igualdad (\(\langle\cdot,\cdot\rangle_s\)) es geometría: un cociente de dos productos escalares, con todo su significado y papel en la proyección ortogonal. El lado derecho, en cambio, ya no necesita esos conceptos para ser evaluado: es una simple expresión aritmética (los factores \(1/n\) de cada producto escalar se cancelan al dividir, así que ni siquiera hace falta especificar el divisor). Hoy nos quedamos con esta expresión aritmética, prescindiendo de la geometría subyacente, y sustituimos directamente las observaciones \(x_i, y_i\) por las variables aleatorias \(X_i, Y_i\); y reescribimos la expresión como una suma ponderada:7 \[ \hat\beta_2(\boldsymbol X,\boldsymbol Y)=\frac{\sum_i(X_i-\overline{X})Y_i}{\sum_j(X_j-\overline{X})^2}=\sum_{i=1}^n\underbrace{\left(\frac{(X_i-\overline{X})}{\sum_j(X_j-\overline{X})^2}\right)}_{W_i}Y_i =\sum_{i=1}^n {W_i}Y_i. \] Escribimos los pesos aleatorios \(W_i\) con mayúscula por ser estadísticos (i.e., variables aleatorias).

Respecto a la media muestral, fijémonos que como \(\overline{X}=\frac1n\sum_iX_i\), entonces \(\sum_i X_i=n\overline{X}\) y que \(\sum_{i=1}^n \overline{X}=\underbrace{\overline{X}+\dots+\overline{X}}_{n\text{ veces}}=n\overline{X}\); así \[ \sum_i (X_i - \overline{X}) = \sum_i X_i - \sum_i \overline{X} = n\overline{X} - n\overline{X} = \mathit 0. \] Usaremos esta propiedad de la media muestral en la siguiente transparencia.

Para profundizar: Wooldridge, J. M. (2020), cap. 2, sección 2.5 (donde \(\hat\beta_2\) se escribe, con la misma idea, como \(\sum w_iy_i\) mediante sumatorios).

4. Dos propiedades de los pesos

Dos identidades algebraicas sobre los pesos. Ninguna es nueva.

Ambas valen para cualquier lista de números y, por tanto, siguen siendo ciertas al sustituir \(x_i\) por \(X_i\): son hechos aritméticos, no probabilísticos:

  • la primera es la condición \(\sum_i(X_i-\overline{X})=\mathit0\) de la transparencia anterior (la misma cuenta que en la lección 4 daba media cero al vector en desviaciones);

\[ \sum_iW_i=\mathit 0; \]

  • la segunda es la razón por la que, en la ``vía alternativa'' de la lección 7, el coeficiente de \(\boldsymbol x-\mu_{\boldsymbol x}\boldsymbol1\) resultaba ser exactamente \(\hat\beta_2\).

\[ \sum_iW_iX_i=\mathit 1 \qquad\Big(\text{pues } \textstyle\frac{\sum_i(X_i-{\overline{X}})X_i}{\sum_j(X_j-{\overline{X}})^2}=\frac{\sum_i(X_i-{\overline{X}})^2}{\sum_j(X_j-{\overline{X}})^2}\Big). \]

Dos propiedades de los pesos

Antes de sustituir el modelo poblacional en \(\hat\beta_2=\sum_iW_iY_i\), necesitamos dos propiedades de los pesos \(W_i\) que, en realidad, ya conocemos aunque nunca las hayamos escrito con este nombre. La primera es, literalmente, \(\langle\boldsymbol x-\mu_{\boldsymbol x}\boldsymbol1,\boldsymbol1\rangle_s=0\) (lección 4: el vector en desviaciones tiene media cero), dividida por el denominador común de los \(W_i\). La segunda es lo que, en la ``vía alternativa'' de la lección 7, hacía que al proyectar \(\boldsymbol y\) sobre \(\boldsymbol x-\mu_{\boldsymbol x}\boldsymbol1\) el coeficiente obtenido fuera la pendiente \(\hat\beta_2\) (allí no aislamos unos ``pesos''; nos limitamos a escribir la fórmula como cociente de productos escalares).

Un punto clave, para no reintroducir la confusión entre estimador y estimación de ``\(\hat\beta_2\): la misma fórmula, aplicada a variables aleatorias'': estas dos propiedades NO son afirmaciones probabilísticas. Son identidades algebraicas, del mismo tipo que ``\(2+3=5\)'': se cumplen para cualquier elección de \(n\) números \(x_1,\ldots,x_n\) (iguales o distintos entre sí, positivos o negativos), porque se deducen únicamente de la propia definición de \(\overline{X}\) y \(W_i\), nunca de ninguna propiedad estadística de esos números. Por eso, cuando sustituimos \(x_i\) por la variable aleatoria \(X_i\), la identidad sigue siendo cierta sin necesidad de ningún argumento adicional (salvo en los sucesos elementales \(\omega\) en los que las \(n\) copias toman el mismo valor, \(X_1(\omega)=\cdots=X_n(\omega)\): para esos \(\omega\) el denominador \(\sum_j\big(X_j(\omega)-\overline{X}(\omega)\big)^2\) vale \(0\) y \(W_i(\omega)\) no está definido. No es que las variables \(X_i\) sean iguales como funciones, son copias distintas; es que en esa muestra han tomado todas el mismo valor).8 Conviene retener la regla, porque se usará muchas veces: por este camino solo pasan las identidades, las fórmulas ciertas para toda lista de números. Una afirmación como ``\(X_i-\overline X\) tiene esperanza cero'' no es una identidad (para una lista de números, \(x_i-\bar x\) no es cero), y por eso no pasa: se demuestra con la esperanza, no con el álgebra (apéndice, sección 4.3 (html)).

Primera propiedad: \(\sum_iW_i=\mathit 0\). Como \(W_i=\frac{(X_i-\overline{X})}{\sum_j(X_j-\overline{X})^2}\) y el denominador es común a todos los términos, \(\sum_iW_i=\frac{\sum_i(X_i-\overline{X})}{\sum_j(X_j-\overline{X})^2}\); y donde el numerador sabemos que es nulo: \(\sum_i(X_i-\overline{X})=\mathit 0\).

Segunda propiedad: \(\sum_iW_iX_i=\mathit 1\). Usando de nuevo que \(\sum_i(X_i-{\overline{X}})=\mathit 0\) \[ \sum_i(X_i-{\overline{X}})X_i=\sum_i(X_i-{\overline{X}})(X_i-\overline{X}+\overline{X})=\sum_i (X_i-{\overline{X}})(X_i-\overline{X})+\overline{X}\underbrace{\sum_i(X_i-{\overline{X}})}_{=\mathit 0}; \] y donde hemos sacado factor común \(\overline{X}\) en el sumatorio \(\sum_i(X_i-{\overline{X}})\overline{X}\) para comprobar que es cero.

Por tanto \(\sum_iW_iX_i=\frac{\sum_i(X_i-{\overline{X}})X_i}{\sum_j(X_j-{\overline{X}})^2}=\frac{\sum_i(X_i-{\overline{X}})^2}{\sum_j(X_j-{\overline{X}})^2}=\mathit 1\).

Para profundizar: Wooldridge, J. M. (2020), cap. 2, sección 2.5 (donde estas dos propiedades se verifican mediante sumatorios, sin distinguir explícitamente su estatus puramente algebraico).

5. Sustituyendo el modelo poblacional

\[ \hat\beta_2(\boldsymbol X,\boldsymbol Y)=\sum_iW_iY_i=\sum_iW_i(\beta_1\,\mathit1+\beta_2X_i+U_i) \]

\[ =\beta_1\underbrace{\sum_iW_i}_{=\mathit0}+\beta_2\underbrace{\sum_iW_iX_i}_{=\mathit1}+\sum_iW_iU_i \]

\[ \boxed{\;\hat\beta_2(\boldsymbol X,\boldsymbol U)=\beta_2\,\mathit{1}+\sum_{i=1}^nW_iU_i\;} \] (escrito ahora en función de \(\boldsymbol U\), pues \(\boldsymbol Y\) ha sido sustituida).

Mediante manipulación algebraica (sustitución y las dos identidades de la transparencia anterior): el estimador es el parámetro verdadero MÁS una ``suma ponderada'' de las perturbaciones. Todo lo que sigue sale de estudiar ese segundo término.

Sustituyendo el modelo poblacional

Con las dos propiedades de ``Dos propiedades de los pesos'' (puramente algebraicas, válidas para cualquier valor que tomen \(X_1,\ldots,X_n\)), el cálculo es puramente mecánico. Partimos de \(\hat\beta_2=\sum_iW_iY_i\) (sección ``\(\hat\beta_2\): la misma fórmula, aplicada a variables aleatorias'') y sustituimos el modelo poblacional \(Y_i=\beta_1\,\mathit1+\beta_2X_i+U_i\) (sección ``El marco: muestra aleatoria'') en cada sumando: \[ \hat\beta_2(\boldsymbol X,\boldsymbol U)=\sum_iW_i(\beta_1\,\mathit1+\beta_2X_i+U_i)=\beta_1\sum_iW_i+\beta_2\sum_iW_iX_i+\sum_iW_iU_i. \] El primer término se anula (\(\sum_iW_i=\mathit 0\)); el segundo se reduce exactamente a \(\beta_2\,\mathit1\) (\(\sum_iW_iX_i=\mathit 1\)): \[ \hat\beta_2(\boldsymbol X,\boldsymbol U)=\beta_2\,\mathit1+\sum_{i=1}^nW_iU_i. \]

Esta identidad es el núcleo algebraico de la sesión: dice que el estimador \(\hat\beta_2\) es la variable aleatoria constante \(\beta_2\,\mathit1\) (donde \(\beta_2\) es el verdadero parámetro poblacional) más una ``suma ponderada'' de las perturbaciones \(U_1,\ldots,U_n\), con los pesos \(W_i\) que ya conocemos. Todo lo que necesitamos demostrar sobre \(\hat\beta_2\) (que su valor esperado sea \(\beta_2\), y que su dispersión sea tal o cual) se reduce, a partir de aquí, a estudiar el comportamiento de esa suma ponderada \(\sum_iW_iU_i\). Los \(W_i\) son funciones de \(X_1,\ldots,X_n\), como acabamos de comprobar. Por eso, al condicionar en \(\boldsymbol X\), podremos sacarlos fuera de la esperanza y de la varianza condicionales. Conviene ser preciso sobre qué autoriza ese paso, porque es tentador decir que ``condicionar en \(\boldsymbol X\) convierte los \(W_i\) en números'': no es así. Los \(W_i\) siguen siendo variables aleatorias, funciones de \(\omega\), antes y después de condicionar; lo que ocurre es que son funciones de aquello sobre lo que se condiciona, y el Lema de la sección siguiente demuestra que tales factores salen fuera del operador \(E[\,\cdot\mid\boldsymbol X]\). El resultado se parece al de una combinación lineal con coeficientes fijos, pero la justificación no es esa: es el Lema, que a su vez sale de la caracterización geométrica de la esperanza condicional (lección 9).

El ejemplo numérico de la lección 7 es coherente con esta descomposición: allí, con \(\boldsymbol u=(1,-2,0,2,-1)\) diseñado deliberadamente con \(\sum w_iu_i=0\) (covarianza muestral nula con el regresor), obtuvimos la estimación \(\hat\beta_2=\beta_2\) exactamente. La fórmula de hoy explica por qué ese resultado se debía al diseño del ejemplo y no es lo esperable en general: \(\hat\beta_2=\beta_2\,\mathit1+\sum_iW_iU_i\), y solo cuando esa suma se anula por construcción (como en aquel ejemplo, ya con datos y no con variables aleatorias) coinciden estimador y parámetro. En una muestra genuinamente aleatoria, \(\sum_iW_iU_i\) no será cero, sino una variable aleatoria con su propio valor esperado y su propia varianza, que es lo que estudiamos en las dos transparencias siguientes.

Para profundizar: Wooldridge, J. M. (2020), cap. 2, ecuación (2.35) y comentario adyacente.

6. Insesgadez: \(\mathrm{E}(\hat\beta_2)=\beta_2\)

Cambiemos de pregunta:

  • de ``¿Cuánto vale la estimación \(\hat\beta_2\) con los datos disponibles \(\boldsymbol x\) e \(\boldsymbol y\)?''
  • a ``¿cuánto vale el estimador \(\hat\beta_2\), en promedio, sobre todas las muestras posibles?'' (su proyección sobre \(\mathit1\), lección 9).

Lema (demostrado en los apuntes): si \(c(\boldsymbol X)\) es una función de \(\boldsymbol X\), \[ E\big[c(\boldsymbol X)Z\mid\boldsymbol X\big]=c(\boldsymbol X)E[Z\mid\boldsymbol X]. \]

\(\mbox{ }\)

Aplicándolo con \(c(\boldsymbol X)=W_i\) (pues cada \(W_i\) es función de \(\boldsymbol X\), sección anterior): \[ E[\hat\beta_2\mid\boldsymbol X]=\beta_2\,\mathit1+\sum_iW_i\,E[U_i\mid\boldsymbol X]=\beta_2\,\mathit1+\sum_iW_i\,\mathit0=\beta_2\,\mathit1. \]

Ley de las esperanzas iteradas: Como \(E[Z\mid\boldsymbol X]\) es la proyección ortogonal de \(Z\) sobre el espacio de las funciones de \(\boldsymbol X\) (y \(\mathit1\) es una de ellas), entonces \(Z-E[Z\mid\boldsymbol X]\perp\mathit1\). Por tanto, \[\mathrm{E}(Z)=\mathrm{E}\big(E[Z\mid\boldsymbol X]\big).\]

\(\mbox{ }\)

\[ \boxed{\;\mathrm{E}(\hat\beta_2)=\mathrm{E}\big(E[\hat\beta_2\mid\boldsymbol X]\big)=\beta_2.\;} \]

\(\hat\beta_2\) no coincide con \(\beta_2\) en cada muestra, pero no se desvía sistemáticamente en ninguna dirección.

Insesgadez: \(\mathrm{E}(\hat\beta_2)=\beta_2\)

Partimos de \(\hat\beta_2=\beta_2\,\mathit1+\sum_iW_iU_i\) (``Sustituyendo el modelo poblacional'') y tomamos esperanza condicionada a \(\boldsymbol X\): el primer paso de la sesión que usa probabilidad.

Antes de seguir, conviene explicitar algo que en la lección 9 quedó implícito en la propia definición de \(E[Z\mid\boldsymbol X]\) como la función de \(\boldsymbol X\) que minimiza la distancia \(\|Z-g(\boldsymbol X)\|_P\). Exactamente igual que en \(\mathbb R^n\) (lección 4 para una recta, y lección 6 al pasar a un plano: minimizar la distancia de un vector a un subespacio equivale a que el residuo sea ortogonal a todo el subespacio, a cada uno de sus generadores), esa minimización es equivalente a esta caracterización, que usaremos repetidamente de aquí en adelante:

Caracterización de \(E[Z\mid\boldsymbol X]\). Es la única variable aleatoria (salvo, como advertimos en la lección 9, en un conjunto de sucesos de probabilidad nula) que cumple, a la vez:

  1. Pertenencia: es una función de \(\boldsymbol X\).
  2. Ortogonalidad del residuo: \(\mathrm{E}\Big((Z-E[Z\mid\boldsymbol X])h(\boldsymbol X)\Big)=0\) para toda función \(h(\boldsymbol X)\).

De esta caracterización salen, con el mismo tipo de comprobación (verificar que el candidato pertenece al espacio y que el residuo es ortogonal), dos propiedades que usaremos continuamente sin volver a citarlas: \(E[\,\cdot\mid\boldsymbol X]\) es lineal, \(E[aZ+bW\mid\boldsymbol X]=a\,E[Z\mid\boldsymbol X]+b\,E[W\mid\boldsymbol X]\), y deja fijas las funciones de \(\boldsymbol X\), \(E[g(\boldsymbol X)\mid\boldsymbol X]=g(\boldsymbol X)\); en particular, \(E[\beta_2\,\mathit1\mid\boldsymbol X]=\beta_2\,\mathit1\). Y con esta misma caracterización podemos demostrar el siguiente lema:

Lema (sacar fuera de la esperanza condicionada las funciones de variables sobre las que se condiciona). Si \(c(\boldsymbol X)\) es una función de la lista de variables aleatorias \(\boldsymbol X\), \[ E[c(\boldsymbol X)Z\mid\boldsymbol X]=c(\boldsymbol X)E[Z\mid\boldsymbol X]. \]

Demostración. Comprobamos que el candidato \(c(\boldsymbol X)E[Z\mid\boldsymbol X]\) cumple las DOS propiedades que caracterizan a \(E[c(\boldsymbol X)Z\mid\boldsymbol X]\):

  • Pertenencia: el producto \(c(\boldsymbol X)E[Z\mid\boldsymbol X]\) es función de \(\boldsymbol X\) (producto de funciones de \(\boldsymbol X\)).
  • Ortogonalidad: para cualquier \(h(\boldsymbol X)\),

\[ \mathrm{E}\Big(\big(c(\boldsymbol X)Z - c(\boldsymbol X)E[Z\mid \boldsymbol{X}]\big)\,h(\boldsymbol{X})\Big) = \mathrm{E}\Big(\big(Z - E[Z\mid \boldsymbol{X}]\big)\,\underbrace{c(\boldsymbol X)h(\boldsymbol{X})}_{\text{función de }\boldsymbol X}\Big)=0 \] porque \(c(\boldsymbol X)h(\boldsymbol X)\) es, ella misma, función de \(\boldsymbol X\), y ya sabemos que \(Z-E[Z\mid\boldsymbol X]\) es ortogonal a cualquiera de ellas.

Como \(c(\boldsymbol X)E[Z\mid\boldsymbol X]\) cumple las dos propiedades que caracterizan a \(E[c(\boldsymbol X)Z\mid\boldsymbol X]\), concluimos \(E\big[c(\boldsymbol X)Z\mid\boldsymbol X\big]=c(\boldsymbol X)E[Z\mid\boldsymbol X]\). \(\blacksquare\)

Aplicamos el lema con \(c(\boldsymbol X)=W_i\) y con \(Z=U_i\): \[ E[\hat\beta_2\mid\boldsymbol X]=\beta_2\,\mathit1+\sum_iE[W_iU_i\mid\boldsymbol X]=\beta_2\,\mathit1+\sum_iW_i\,E[U_i\mid\boldsymbol X]=\beta_2\,\mathit1+\sum_iW_i\,\mathit0=\beta_2\,\mathit1, \] donde hemos usado la exogeneidad estricta \(E[U_i\mid\boldsymbol X]=\mathit0\) de la sección ``El marco: muestra aleatoria''.

Falta un último paso, pasar de la esperanza condicional a la esperanza incondicional: queremos encontrar \(\mathrm{E}(\hat\beta_2)\), no \(E[\hat\beta_2\mid\boldsymbol X]\). Aquí es donde entra la Ley de las Esperanzas Iteradas, que es la misma idea que ya usamos en la lección 9 para deducir \(\mathrm{E}(U)=0\) a partir de \(U\perp\mathit1\). En general: la función constante \(\mathit1\) es, trivialmente, una función de \(\boldsymbol X\); aplicando la ortogonalidad del residuo (recordada más arriba) con \(h(\boldsymbol X)=\mathit1\), obtenemos \(Z-E[Z\mid\boldsymbol X]\perp\mathit1\) para cualquier \(Z\) \[ \mathrm{E}\Big(\big(Z-E[Z\mid\boldsymbol X]\big)\,\mathit 1 \Big)=0 \iff \mathrm{E}(Z)-\mathrm{E}\big(E[Z\mid\boldsymbol X]\big)=0, \] es decir, \(\mathrm{E}\big(E[Z\mid\boldsymbol X]\big)=\mathrm{E}(Z)\), sin ninguna restricción sobre \(Z\). Esta es la Ley de las Esperanzas Iteradas, una consecuencia inmediata de nuestra propia definición geométrica de esperanza condicional. Tanto el Lema como esta ley se demuestran en dos líneas a partir de la caracterización de la proyección por la ortogonalidad del resto (apéndice, sección 1.3 (html)), donde la ley se lee como proyectar en dos pasos sobre subespacios anidados: la misma figura del Pitágoras anidado que usará la lección 13.

Aplicándola a \(Z=\hat\beta_2\), y usando que \(E[\hat\beta_2\mid\boldsymbol X]=\beta_2\,\mathit1\) es constante: \[ \mathrm{E}(\hat\beta_2)=\mathrm{E}\big(E[\hat\beta_2\mid\boldsymbol X]\big)=\mathrm{E}(\beta_2\,\mathit1)=\beta_2. \] \(\hat\beta_2\) es, por tanto, un estimador insesgado de \(\beta_2\): en promedio, sobre todas las muestras posibles que podríamos haber observado, ni sobreestima ni subestima el verdadero parámetro poblacional.

Para profundizar: Wooldridge, J. M. (2020), cap. 2, Teorema 2.1 (insesgadez de \(\hat\beta_1,\hat\beta_2\)).

7. Varianza: cuán dispersas están las estimaciones

Desarrollando el cuadrado (apuntes) y aplicando el Lema anterior: \[ Var[\hat\beta_2\mid\boldsymbol X]=Var\Big[\textstyle\sum_iW_iU_i\,\Big|\,\boldsymbol X\Big]=\sum_iW_i^2\,Var[U_i\mid\boldsymbol X]+\sum_{i\neq j}W_iW_j\,Cov[U_i,U_j\mid\boldsymbol X] \]

Homocedasticidad + \(Cov[U_i,U_j\mid\boldsymbol X]=\mathit 0\) (``El marco'') \(\;\Longrightarrow\;\) \[ Var[\hat\beta_2\mid\boldsymbol X]=\sigma^2\sum_iW_i^2. \]

\[ \boxed{\;Var[\hat\beta_2\mid\boldsymbol X]=\frac{\sigma^2}{\sum_i(X_i-{\overline{X}})^2}=\frac{\sigma^2}{n\,S^2}.\;} \] donde \(S^2=\frac1n\sum_i(X_i-\overline{X})^2\) es la varianza muestral del regresor (divisor \(n\), como en la lección 5).

Más dispersión en \(X\), o más observaciones: más precisión. Más ruido (\(\sigma^2\)): menos precisión.

Versión interactiva: cuaderno 4 en MyBinder (muchas muestras, muchas rectas; el histograma de \(\hat\beta_2\) y el efecto de la dispersión de \(\boldsymbol x\)).

Varianza: cuán dispersas están las estimaciones

La insesgadez nos dice que \(\hat\beta_2\) está bien ``centrado'' en \(\beta_2\). Pero un estimador insesgado puede, aun así, ser muy poco fiable en una muestra concreta si su dispersión es grande. Necesitamos, por tanto, calcular \(Var[\hat\beta_2\mid\boldsymbol X]\).

Partimos de \(\hat\beta_2=\beta_2\,\mathit1+\sum_iW_iU_i\). Como \(\beta_2\,\mathit1\) es una variable aleatoria constante: \(Var[\hat\beta_2\mid\boldsymbol X]=Var\big[\sum_iW_iU_i\mid\boldsymbol X\big]\). Nos queda, por tanto, desarrollar la varianza de una suma de \(n\) sumandos. Lo haremos en dos pasos: primero calculamos la varianza y la covarianza de cada sumando por separado (aquí interviene el Lema), y después desarrollamos la suma completa. Calculemos primero, para un único sumando, \(Var[W_iU_i\mid\boldsymbol X]\). Ya vimos que \(E[W_iU_i\mid\boldsymbol X]=\mathit0\) (Lema, con \(c(\boldsymbol X)=W_i\)). Por tanto, la definición de varianza condicional (\(Var[Z\mid\boldsymbol X]=E[(Z-E[Z\mid\boldsymbol X])^2\mid\boldsymbol X]\)) se simplifica exactamente como en la lección 9 (\(Var[U\mid X]=E[U^2\mid X]\), porque también allí \(E[U\mid X]=\mathit0\)): \[ Var[W_iU_i\mid\boldsymbol X]=E[(W_iU_i)^2\mid\boldsymbol X]=E[W_i^2U_i^2\mid\boldsymbol X]=W_i^2\,E[U_i^2\mid\boldsymbol X]=W_i^2\,Var[U_i\mid\boldsymbol X], \] donde la penúltima igualdad es, de nuevo, el Lema (con \(c(\boldsymbol X)=W_i^2\), sobre \(Z=U_i^2\)), y la última vuelve a usar que \(E[U_i\mid\boldsymbol X]=\mathit0\).

Por el mismo argumento, para \(i\neq j\) (usando la covarianza condicional definida en ``El marco: muestra aleatoria'', \(Cov[Z,W\mid\boldsymbol X]=E[(Z-E[Z\mid\boldsymbol X])(W-E[W\mid\boldsymbol X])\mid\boldsymbol X]\), análoga a la varianza): \[ Cov[W_iU_i,W_jU_j\mid\boldsymbol X]=E[W_iU_iW_jU_j\mid\boldsymbol X]=W_iW_j\,E[U_iU_j\mid\boldsymbol X]=W_iW_j\,Cov[U_i,U_j\mid\boldsymbol X], \] usando el Lema con \(c(\boldsymbol X)=W_iW_j\).

Con estas dos piezas ya podemos desarrollar la suma entera. Abreviando \(Z_i=W_iU_i\) (de modo que \(E[Z_i\mid\boldsymbol X]=\mathit0\) para todo \(i\), como acabamos de comprobar), la definición de varianza condicional da \[ Var\Big[\sum_iZ_i\,\Big|\,\boldsymbol X\Big]=E\Big[\Big(\sum_iZ_i\Big)^2\,\Big|\,\boldsymbol X\Big]=E\Big[\sum_i\sum_jZ_iZ_j\,\Big|\,\boldsymbol X\Big]=\sum_i\sum_jE[Z_iZ_j\mid\boldsymbol X], \] donde solo hemos desarrollado el cuadrado de la suma y usado después la linealidad de la esperanza condicional (recordada junto al Lema, en la sección ``Insesgadez''), aplicada ahora a una suma de \(n^2\) términos. Basta ya con separar los términos de la diagonal (\(i=j\)) del resto: como todas las \(Z_i\) tienen esperanza condicional nula, \(E[Z_iZ_j\mid\boldsymbol X]\) es \(Var[Z_i\mid\boldsymbol X]\) cuando \(i=j\), y \(Cov[Z_i,Z_j\mid\boldsymbol X]\) cuando \(i\neq j\). Sustituyendo en ambos casos las dos piezas calculadas más arriba: \[ Var\Big[\sum_iW_iU_i\,\Big|\,\boldsymbol X\Big]=\sum_iW_i^2\,Var[U_i\mid\boldsymbol X]+\sum_{i\neq j}W_iW_j\,Cov[U_i,U_j\mid\boldsymbol X]. \]

Ahora intervienen, por primera vez en la sesión, la homocedasticidad (\(Var[U_i\mid\boldsymbol X]=\sigma^2\,\mathit 1\) para todo \(i\), supuesto de la lección 9) y la ausencia de covarianza cruzada (\(Cov[U_i,U_j\mid\boldsymbol X]=\mathit 0\) para \(i\neq j\), consecuencia del muestreo aleatorio, sección ``El marco: muestra aleatoria''). Con ambas, la doble suma se reduce a \[ Var[\hat\beta_2\mid\boldsymbol X]=\sigma^2\sum_iW_i^2. \]

Calculemos \(\sum_iW_i^2\). Como \(W_i=\frac{X_i-{\overline{X}}}{\sum_j(X_j-{\overline{X}})^2}\): \[ \sum_iW_i^2=\sum_i\left(\frac{X_i-{\overline{X}}}{\sum_j(X_j-{\overline{X}})^2}\right)^2=\frac{\sum_i(X_i-{\overline{X}})^2}{\left(\sum_j(X_j-{\overline{X}})^2\right)^2}=\frac{1}{\sum_j(X_j-{\overline{X}})^2}. \] Sustituyendo: \[ Var[\hat\beta_2\mid\boldsymbol X]=\frac{\sigma^2}{\sum_i(X_i-{\overline{X}})^2}. \]

Esta expresión admite una segunda lectura, útil para su interpretación. Como \(\sum_i(X_i-{\overline{X}})^2=n\cdot\frac1n\sum_i(X_i-{\overline{X}})^2=n\,S^2\) (la varianza muestral del regresor, con la convención estadística del curso, \(S^2=\frac1n\sum_i(X_i-{\overline{X}})^2\)), podemos escribir, equivalentemente, \[ Var[\hat\beta_2\mid\boldsymbol X]=\frac{\sigma^2}{n\,S^2}. \] Esta segunda forma hace explícitos los tres ingredientes que determinan la precisión de \(\hat\beta_2\). (i) Cuanto mayor sea \(\sigma^2\) (más ruido en la perturbación), menor será la precisión. (ii) Cuanto mayor sea \(n\) (más observaciones), mayor será la precisión. (iii) Cuanto mayor sea \(S^2\) (más dispersión en los valores del regresor), mayor será la precisión: una muestra donde \(X\) apenas varía impide medir la pendiente con precisión.9

Nótese, por último, que este resultado es condicional a \(\boldsymbol X\): distintas muestras, con distintos valores del regresor, tendrían distinta precisión. Si quisiéramos la varianza incondicional \(\mathrm{Var}(\hat\beta_2)\), tendríamos que aplicar la ley de la varianza total, que no es sino la identidad pitagórica de la lección 9 (allí enunciada para \(Y\), condicionando en \(X\)), aplicada ahora a \(Z=\hat\beta_2\) condicionando en \(\boldsymbol X\). Para cualquier variable aleatoria \(Z\) con varianza finita, \(E[Z\mid\boldsymbol X]\) es la proyección ortogonal de \(Z\) sobre las funciones de \(\boldsymbol X\), así que \(Z=E[Z\mid\boldsymbol X]+\big(Z-E[Z\mid\boldsymbol X]\big)\) descompone \(Z\) en dos partes ortogonales entre sí. Aplicando Pitágoras a esa descomposición, y la ley de las esperanzas iteradas para escribir \(\mathrm{E}\big((Z-E[Z\mid\boldsymbol X])^2\big)\) como \(\mathrm{E}\big(Var[Z\mid\boldsymbol X]\big)\), se obtiene \[ \mathrm{Var}(\hat\beta_2)=\mathrm{E}\big(Var[\hat\beta_2\mid\boldsymbol X]\big)+\mathrm{Var}\big(E[\hat\beta_2\mid\boldsymbol X]\big), \] donde el segundo sumando es cero (pues \(E[\hat\beta_2\mid\boldsymbol X]=\beta_2\,\mathit1\) es constante, sección ``Insesgadez'', y la varianza de una constante es cero). Pero el primer sumando, \(\mathrm{E}\big(\sigma^2/(nS^2)\big)\), es la esperanza de un cociente, y no se simplifica en general (la esperanza de \(1/S^2\) no es \(1/\mathrm{E}(S^2)\)). Por eso, en la práctica, y en el resto de este curso, trabajaremos siempre con la fórmula condicional recién obtenida, evaluada en la muestra efectivamente observada: es lo que hace cualquier programa estadístico al reportar el error estándar de un coeficiente.

Para profundizar: Wooldridge, J. M. (2020), cap. 2, Teorema 2.2 (varianza de \(\hat\beta_1,\hat\beta_2\) bajo los supuestos SLR.1-SLR.5).

8. MCO es BLUE; estimando \(\sigma^2\)

Enunciado (Gauss–Markov; demostración en el apéndice): de entre todos los estimadores lineales e insesgados de \(\beta_2\), \(\hat\beta_2\) tiene la menor varianza: MCO es BLUE (Best Linear Unbiased Estimator).

\(\sigma^2\) (desconocido) se estima con la cuasivarianza de los residuos, un tercer producto escalar, tras el euclídeo y el estadístico: \[ \langle\cdot,\cdot\rangle_{n-k}=\frac1{n-k}\langle\cdot,\cdot\rangle_{e}, \qquad \mathfrak{s}^2=\langle\boldsymbol{\mathop{\widehat{e}}},\boldsymbol{\mathop{\widehat{e}}}\rangle_{n-k}=\frac{\mathrm{SRC}}{n-k}. \]

Tres divisores, tres motivos distintos: \(1\) (geometría pura, sin más), \(n\) (para que \(\|\boldsymbol1\|_s=1\), lección 4), \(n-k\) (para que \(\mathfrak s^2\) sea un estimador insesgado de \(\sigma^2\)).

MCO es BLUE; estimando \(\sigma^2\)

Con insesgadez y varianza ya establecidas, cerramos con dos observaciones que esta sesión enuncia y el apéndice demuestra, y que conviene conocer.

La primera es el Teorema de Gauss–Markov: bajo los tres supuestos del Modelo Clásico de Regresión Lineal (y el muestreo aleatorio de esta sesión), \(\hat\beta_2\) no es solo insesgado; es, además, el estimador de menor varianza entre todos los estimadores lineales e insesgados. Lineal quiere decir de la forma \(\sum_iC_iY_i\), donde \(Y_1,\ldots,Y_n\) son las variables aleatorias de la muestra (no los datos observados \(y_1,\ldots,y_n\)) y los pesos \(C_i\) no dependen de \(\boldsymbol Y\) (van con mayúscula porque, igual que los \(W_i\), pueden ser funciones de \(\boldsymbol X\)). Este resultado se resume con el acrónimo BLUE (Best Linear Unbiased Estimator, ``el mejor estimador lineal insesgado''). La demostración está en el apéndice (sección 7.3) (html), y no necesita matrices: cualquier otro vector de pesos insesgado difiere de los pesos MCO en un vector ortogonal a ellos, y Pitágoras hace el resto; aquí basta con saber que es la justificación teórica de por qué, entre todas las rectas que podríamos ajustar, elegimos la de mínimos cuadrados.

La segunda observación es más práctica: la fórmula \(Var[\hat\beta_2\mid\boldsymbol X]=\sigma^2/\sum_i(X_i-{\overline{X}})^2\) depende de \(\sigma^2\), la varianza de la perturbación poblacional, que no conocemos. Para usarla en la práctica (algo que haremos en la próxima sesión teórica, al construir errores estándar) necesitamos estimar \(\sigma^2\) a partir de los residuos \(\boldsymbol{\mathop{\widehat e}}\). Estos residuos observados se interpretan aquí como la realización, sobre nuestra muestra concreta, de la lista de residuos \((\hat E_1,\ldots,\hat E_n)\), con \(\hat E_i=Y_i-\hat\beta_1\,\mathit1-\hat\beta_2X_i\); es el mismo paso de variable aleatoria a dato que hemos dado varias veces en esta sesión. Esas componentes aproximan, sin ser idénticas a ellas, a las perturbaciones \(U_i\) del modelo poblacional.10

La estimación natural sería \(\langle\boldsymbol{\mathop{\widehat e}},\boldsymbol{\mathop{\widehat e}}\rangle_s=\mathrm{SRC}/n\), la varianza de los residuos con nuestra convención habitual. Pero ese estimador, la misma fórmula evaluada sobre la lista de residuos \((\hat E_1,\ldots,\hat E_n)\) en lugar de sobre los datos observados \(\boldsymbol{\mathop{\widehat e}}\), es sesgado: subestima \(\sigma^2\) en promedio. La demostración está en el apéndice (sección 7.2) (html); aquí basta con la razón geométrica que sigue.11 La razón de este sesgo es geométrica, y ya la conocemos en parte: por construcción (ecuaciones normales, lección 10), los residuos \(\boldsymbol{\mathop{\widehat e}}\) no son un vector arbitrario de \(\mathbb R^n\), sino que viven siempre en el subespacio ortogonal a las columnas de \(\boldsymbol{\mathsf X}\). Como ese subespacio de regresores tiene dimensión \(k\) (hay \(k\) regresores, incluida la constante), su complemento ortogonal tiene dimensión \(n-k\) (la misma cuenta informal de dimensión que empleamos ya en la lección 4 para \(\mathcal L(\boldsymbol1)^\perp\), de dimensión \(n-1\), el caso particular \(k=1\)). Dicho de otro modo: aunque \(\boldsymbol{\mathop{\widehat e}}\) tiene \(n\) componentes, solo \(n-k\) de ellas son realmente ``libres''; las \(k\) restantes quedan fijadas por las \(k\) condiciones de ortogonalidad \(\boldsymbol{\mathsf X}^\top\boldsymbol{\mathop{\widehat e}}=\boldsymbol 0\). En una base ortonormal de ese complemento, \(\mathrm{SRC}\) es la suma de los cuadrados de \(n-k\) coordenadas, y cada una de ellas, evaluada sobre la muestra, tiene esperanza \(\sigma^2\): por eso \(\mathrm{SRC}\) tiene esperanza \((n-k)\sigma^2\), y \(\mathrm{SRC}/n\), esperanza \(\frac{n-k}{n}\sigma^2\), menor que \(\sigma^2\). Dividir por \(n-k\), en vez de por \(n\), es la manera de tener en cuenta esta pérdida de \(k\) grados de libertad, y es lo que hace insesgado al estimador resultante. El estimador que sí resulta insesgado usa, por tanto, ese divisor distinto: \(n-k\) (el número de observaciones menos el número total de coeficientes estimados, incluida la constante) en vez de \(n\).12

Ese divisor nos lleva, de forma natural, a introducir un tercer producto escalar en la familia que el curso ha ido construyendo desde la lección 2: junto al euclídeo \(\langle\cdot,\cdot\rangle_e\) (divisor \(1\)) y al estadístico \(\langle\cdot,\cdot\rangle_s=\langle\cdot,\cdot\rangle_n\) (divisor \(n\)), definimos \[ \langle\boldsymbol v,\boldsymbol w\rangle_{n-k}=\frac{1}{n-k}\langle\boldsymbol v,\boldsymbol w\rangle_e. \] Sigue siendo, técnicamente, un producto escalar legítimo (multiplicar por una constante positiva conserva la simetría, la linealidad y la positividad),13 y con él definimos la cuasivarianza de los residuos \[ \mathfrak s^2=\langle\boldsymbol{\mathop{\widehat e}},\boldsymbol{\mathop{\widehat e}}\rangle_{n-k}=\frac{\mathrm{SRC}}{n-k}, \] que sí es un estimador insesgado de \(\sigma^2\): la demostración está en el apéndice (sección 7.2) (html), y es la cuenta de coordenadas del párrafo anterior. Merece la pena subrayar que el motivo último de cada uno de los tres divisores es distinto. El divisor \(1\) no obedece a ningún motivo particular (es la geometría euclídea sin más). El divisor \(n\) se eligió, en la lección 4, para que \(\|\boldsymbol1\|_s=1\): un motivo puramente geométrico. El divisor \(n-k\) se elige aquí por un motivo estadístico, lograr insesgadez, y la lectura geométrica no es un añadido sino la razón: es la dimensión del subespacio donde vive \(\boldsymbol{\mathop{\widehat e}}\), el número de coordenadas del ruido que entran en \(\mathrm{SRC}\). El símbolo \(\mathfrak s^2\) (con la ese gótica) se reserva para esta cantidad, para no confundirla con la varianza muestral \(S^2\) (introducida hoy) ni con la \(s^2\) de los manuales clásicos de estadística, que suele denotar esto mismo con otra convención tipográfica.

La expresión \(n-k\) recibe, en la terminología habitual de la estadística, el nombre de grados de libertad del modelo: el número de observaciones menos el número de parámetros ya estimados. En esta sesión, con dos regresores en total, \(k=2\), así que \(\mathfrak s^2=\mathrm{SRC}/(n-2)\). Volveremos sobre los grados de libertad, con más detalle, en la próxima sesión teórica.

Para profundizar:

  • Wooldridge, J. M. (2020), cap. 2, Teorema 2.2 (parte final: BLUE) y cap. 3, sección 3.5 (Teorema de Gauss-Markov, versión general con \(k\) regresores).
  • Wooldridge, J. M. (2020), cap. 3, sección 3.4 (estimación insesgada de \(\sigma^2\), grados de libertad).

9. ¿Y con más regresores?

Sin demostrarlo (generalización matricial de lo probado hoy; recordando la notación de la lección 10 y su extensión aleatoria de ``El marco''): \[ E[\boldsymbol{\mathop{\widehat{\beta}}}\mid\boldsymbol X]=\boldsymbol\beta\,\mathit1,\qquad Var[\boldsymbol{\mathop{\widehat{\beta}}}\mid\boldsymbol X]=\sigma^2(\boldsymbol X^\top\boldsymbol X)^{-1}. \]

En la diagonal de esta matriz están \(Var[\hat\beta_1\mid\boldsymbol X],\ldots,Var[\hat\beta_k\mid\boldsymbol X]\); fuera de la diagonal, las covarianzas \(Cov[\hat\beta_i,\hat\beta_j\mid\boldsymbol X]\).

Para \(k=2\), el elemento \((2,2)\) de esta fórmula matricial se reduce exactamente a lo que hoy hemos demostrado sin matrices (y los otros tres elementos dan lo que no hemos calculado).

Sustituyendo \(\boldsymbol X\) por la matriz de regresores observada \(\boldsymbol{\mathsf X}\), y \(\sigma^2\) por su estimación \(\mathfrak s^2\) (transparencia anterior), obtenemos la fórmula que calculan los programas estadísticos: \[ \mathfrak s^2(\boldsymbol{\mathsf X}^\top\boldsymbol{\mathsf X})^{-1}. \]

¿Y con más regresores?

Todo lo demostrado en esta sesión se ha limitado, deliberadamente, al caso con dos regresores: la constante \(\mathit1\) y un único regresor no constante \(X\). Con \(k\) regresores (lección 10), el resultado análogo existe, y su enunciado, sin demostración, es la generalización matricial natural de lo que hoy hemos probado: \[ E[\boldsymbol{\mathop{\widehat{\beta}}}\mid\boldsymbol X]=\boldsymbol\beta\,\mathit1,\qquad Var[\boldsymbol{\mathop{\widehat{\beta}}}\mid\boldsymbol X]=\sigma^2(\boldsymbol X^\top\boldsymbol X)^{-1}. \] Aquí \(\boldsymbol X\) es la misma matriz aleatoria de regresores que fijamos al abrir la sesión, solo que ahora con \(k\) columnas en lugar de dos; \(\boldsymbol{\mathsf X}\) sigue denotando, como en la lección 10, la matriz de regresores observada. La primera igualdad generaliza la insesgadez de la sección ``Insesgadez'': \(\boldsymbol\beta\,\mathit1\) denota el vector cuyas componentes son las variables aleatorias constantes \(\beta_1\,\mathit1,\ldots,\beta_k\,\mathit1\), el análogo, para un vector de parámetros, de la constante \(\beta_2\,\mathit1\) que obtuvimos en la sección ``Insesgadez''. La segunda generaliza la varianza de la sección ``Varianza'': es una matriz \(k\times k\) que ocupa el lugar que antes ocupaba el escalar \(1/\sum_i(X_i-{\overline{X}})^2\); en su diagonal contiene las varianzas \(Var[\hat\beta_1\mid\boldsymbol X],\ldots,Var[\hat\beta_k\mid\boldsymbol X]\) (con \(Var[\hat\beta_2\mid\boldsymbol X]\) como caso particular, ya conocido, en la posición \((2,2)\)), y fuera de la diagonal, las covarianzas \(Cov[\hat\beta_i,\hat\beta_j\mid\boldsymbol X]\) entre cada par de coeficientes. Para cada coeficiente por separado, la insesgadez y la varianza con \(k\) regresores sí se demuestran con material del curso, una vez que la lección 14 define la parte propia del regresor: apéndice, secciones 5.4 (html), 6.5 y 7.1. La fórmula matricial completa sigue enunciada; su diagonal, no.

Al evaluar esta fórmula en una muestra ya observada, sustituimos la matriz aleatoria \(\boldsymbol X\) por la matriz de regresores observada \(\boldsymbol{\mathsf X}\), con lo que queda por calcular \((\boldsymbol{\mathsf X}^\top\boldsymbol{\mathsf X})^{-1}\). Multiplicada por \(\mathfrak s^2\) (la estimación de \(\sigma^2\) de ``MCO es BLUE; estimando \(\sigma^2\)'', pues \(\sigma^2\) sigue siendo desconocido) da \(\mathfrak s^2(\boldsymbol{\mathsf X}^\top\boldsymbol{\mathsf X})^{-1}\): la fórmula que Gretl (y cualquier otro programa estadístico) usa internamente para calcular los errores estándar que veremos en la próxima sesión teórica.

Es razonable preguntarse si esta fórmula, presentada aquí sin demostración, es compatible con lo que sí hemos demostrado hoy. La respuesta es sí, y podemos comprobarlo con un cálculo elemental. Para \(k=2\) (constante más un único regresor no constante), la matriz \(\boldsymbol{X}^\top\boldsymbol{X}\) (análogo aleatorio de la \(\boldsymbol{\mathsf X}^\top\boldsymbol{\mathsf X}\) de la lección 10) es \[ \boldsymbol{X}^\top\boldsymbol{X}=\begin{pmatrix}n\,\mathit1 & n\overline{X}\\ n\overline{X} & \sum_iX_i^2\end{pmatrix}. \] Usando la fórmula general para invertir una matriz \(2\times2\), obtenemos14 \[ (\boldsymbol{X}^\top\boldsymbol{X})^{-1}=\frac{1}{n\sum_i(X_i-\overline{X})^2}\begin{pmatrix}\sum_iX_i^2 & -n\overline{X}\\ -n\overline{X} & n\,\mathit1\end{pmatrix}. \] El elemento \((2,2)\) de esta matriz, el que corresponde a la varianza condicional del segundo coeficiente, \(\hat\beta_2\), vale \(n\,\mathit1\big/\big(n\sum_i(X_i-\overline{X})^2\big)=\mathit1\big/\sum_i(X_i-\overline{X})^2\). Multiplicando por \(\sigma^2\): \[ \sigma^2\big[(\boldsymbol{X}^\top\boldsymbol{X})^{-1}\big]_{22}=\frac{\sigma^2}{\sum_i(X_i-\overline{X})^2}, \] exactamente la fórmula de la sección ``Varianza''. Además, la misma matriz da las otras dos cantidades que esta sesión no ha llegado a calcular, al habernos centrado, como anunciamos al abrir, en \(\hat\beta_2\): el elemento \((1,1)\), multiplicado por \(\sigma^2\), da \(Var[\hat\beta_1\mid\boldsymbol{X}]=\sigma^2\sum_iX_i^2\big/\big(n\sum_i(X_i-\overline{X})^2\big)\); y el elemento \((1,2)=(2,1)\), multiplicado por \(\sigma^2\), da \(Cov[\hat\beta_1,\hat\beta_2\mid\boldsymbol{X}]=-\sigma^2\overline{X}\big/\sum_i(X_i-\overline{X})^2\). La generalización matricial, aunque no la hayamos demostrado, es consistente con todo lo que sí hemos probado en esta sesión, y añade dos fórmulas más que no habíamos calculado en la lección.

Para profundizar: Wooldridge, J. M. (2020), Apéndice E.2 (fórmulas matriciales de insesgadez y varianza para el modelo de regresión múltiple).

10. Recapitulación y guiño a la sesión siguiente

Propiedad Resultado (regresión simple, \(k=2\)) Supuestos usados
Insesgadez \(\mathrm{E}(\hat\beta_2)=\beta_2\) Linealidad + \(\mathrm{Var}(X)\neq0\) + muestreo aleatorio
Varianza \(Var[\hat\beta_2\mid\boldsymbol X]=\frac{\sigma^2}{\sum_i(X_i-{\overline{X}})^2}\) + Homocedasticidad (+ \(Cov[U_i,U_j\mid\boldsymbol X]=\mathit0\), del muestreo aleatorio)
Eficiencia MCO es BLUE (mejor entre los lineales e insesgados) Los tres + muestreo aleatorio (Gauss–Markov, apéndice)

Casi nada nuevo: la vía alternativa (lección 7), la esperanza condicional y la independencia entre observaciones (lección 9). Lo único nuevo: evaluar la fórmula sobre variables aleatorias, no sobre datos; eso, y solo eso, convierte \(\hat\beta_2\) en un estimador.

Nota: los mismos argumentos, sobre \(\hat\beta_1=\overline{Y}-\hat\beta_2{\overline{X}}\), prueban la insesgadez de \(\hat\beta_1\).

Lección 12: ya conocemos el valor esperado y la varianza de \(\hat\beta_2\); para intervalos de confianza y contrastes hace falta algo más: la forma de su distribución.

Recapitulación y guiño a la sesión siguiente

Esta sesión tiene pocos ingredientes nuevos. Hemos demostrado dos propiedades, insesgadez y varianza de \(\hat\beta_2\), con piezas que ya teníamos. La fórmula de la ``vía alternativa'' de la lección 7 nos dio \(\hat\beta_2\) como combinación lineal de los datos. La esperanza condicional de la lección 9 nos permitió tomar esperanzas y varianzas ``condicionando en \(\boldsymbol X\)''. Y la independencia entre observaciones, anunciada en esa misma lección 9 (``copias idénticas e independientes''), nos dio la incorrelación entre perturbaciones.

Lo único nuevo es esto: tomar una fórmula ARITMÉTICA ya obtenida (geométricamente, en la lección 7, sobre datos fijos) y evaluarla en variables aleatorias en lugar de en datos. Eso, sin más, es lo que convierte una estimación (un número, calculado a partir de una muestra concreta) en un estimador (una variable aleatoria, cuya distribución depende de qué muestra hubiéramos observado). No hemos definido ningún producto escalar nuevo sobre ``vectores de variables aleatorias'', ni hemos vuelto a demostrar Cauchy–Schwarz sobre un objeto distinto. Sencillamente, hemos sustituido números por variables aleatorias dentro de una fórmula que ya sabíamos cierta, y hemos reservado la herramienta probabilística de la lección 9 (esperanza condicional, independencia) para el momento en que era necesaria: al tomar esperanzas y varianzas de esa suma ponderada.

La tabla resume las dos propiedades centrales, junto con los supuestos exactos que cada una requiere: la insesgadez solo necesita linealidad (más el muestreo aleatorio, que es lo que eleva la exogeneidad estricta al condicionamiento en toda la matriz \(\boldsymbol X\)); la varianza necesita, además, homocedasticidad y la ausencia de covarianza cruzada entre perturbaciones (también consecuencia del muestreo aleatorio). Conviene tener presente esta jerarquía: cada propiedad exige un subconjunto distinto de los tres supuestos del Modelo Clásico. Cuando más adelante se ponga en duda alguno de ellos (la homocedasticidad, por ejemplo), sabremos qué propiedad de \(\hat\beta_2\) deja de estar garantizada y cuál sigue intacta.

Queda, sin embargo, una limitación importante que esta sesión no resuelve. Saber que \(\hat\beta_2\) está bien centrado en \(\beta_2\) (insesgadez) y saber cuánto se dispersa alrededor de ese centro (varianza) NO basta para responder preguntas del tipo ``si \(\beta_2\) valiese cero, ¿sería \(\hat\beta_2=0{,}5\) una estimación demasiado rara?'' o ``¿en qué rango de valores podemos confiar razonablemente que está el verdadero \(\beta_2\)?''. Para responderlas (son los contrastes de hipótesis y los intervalos de confianza que ocuparán buena parte del resto del curso) no basta con el valor esperado y la varianza de \(\hat\beta_2\): hace falta conocer, además, la forma completa de su distribución. Esa es la tarea de la próxima sesión teórica: enunciar, apoyándonos en un supuesto adicional sobre la distribución de la perturbación \(U\), la distribución de \(\hat\beta_2\) (la demostración está en el apéndice (sección 9) (html)), y a partir de ella construir el error estándar, el intervalo de confianza y el contraste \(t\).

Para profundizar: Wooldridge, J. M. (2020), cap. 2, sección 2.5 (Teoremas 2.1 y 2.2) y cap. 3, secciones 3.3 y 3.4 (los mismos resultados con \(k\) regresores).

11. Apéndice: lanzar una moneda infinitas veces

Material complementario. Este apartado respondía a una pregunta que la lección 9 dejó abierta y que esta lección ha usado sin discutir: de dónde salen las copias idénticas e independientes de una variable aleatoria, y qué significa, en el lenguaje geométrico del curso, que sean independientes. La respuesta, con el ejemplo de la moneda (el intervalo \([0,1]\) con la longitud como probabilidad, y la moneda \(n\)-ésima como la cifra binaria \(n\)-ésima de \(\omega\)), está ahora en el apéndice ``Estructura geométrica de la probabilidad y de la inferencia en el modelo de regresión'' (html), secciones 1.5 (independientes es ``a escuadra''), 2 (la moneda) y 3 (la matriz de copias: filas, columnas y vectores de \(\mathbb R^n\)). Lo esencial cabe en dos frases: ``\(n\) copias idénticas e independientes'' no es un supuesto sobre el mundo, sino una construcción, porque dada cualquier variable existe un \(\Omega\) en el que caben tantas copias como se quiera; lo que sí es un supuesto es que nuestros datos sean una realización de esas copias, y ese supuesto es el muestreo aleatorio de esta lección.

12. Preguntas de repaso (sesión 15)   htmlonly

Le propongo 12 preguntas. Las marco con un nivel orientativo: [B] básica, [M] media, [D] discriminadora.

Comentario

Las preguntas que más le conviene trabajar son la 7 (la Ley de las Esperanzas Iteradas es una consecuencia inmediata de la definición geométrica de esperanza condicional de la lección 9) y la 9 (la incorrelación entre perturbaciones es una consecuencia del muestreo aleatorio anunciado en esa misma lección). La 12 le pide distinguir qué se ha demostrado hoy y qué se ha enunciado solo por analogía matricial. Repase también la 8: la lectura de la fórmula de la varianza (qué la hace grande o pequeña) es la que más usará en las prácticas de laboratorio.

Pregunta 1 [B] — Estimador vs. estimación

La distinción entre \(\hat\beta_2(\boldsymbol X,\boldsymbol Y)\) y \(\hat\beta_2(\boldsymbol x,\boldsymbol y)\) es:

  1. Una diferencia sin importancia, ambas notaciones significan siempre lo mismo.
  2. \(\hat\beta_2(\boldsymbol X,\boldsymbol Y)\) es el estimador (variable aleatoria); \(\hat\beta_2(\boldsymbol x,\boldsymbol y)\) es la estimación (un número).
  3. \(\hat\beta_2(\boldsymbol X,\boldsymbol Y)\) es la estimación; \(\hat\beta_2(\boldsymbol x,\boldsymbol y)\) es el estimador.
  4. Solo tiene sentido hablar de \(\hat\beta_2(\boldsymbol x,\boldsymbol y)\); el estimador no existe como objeto matemático.

Pregunta 2 [B] — El supuesto de muestreo aleatorio

La condición \(Cov[U_i,U_j\mid\boldsymbol X]=\mathit 0\) para \(i\neq j\) es:

  1. Un supuesto completamente nuevo, no relacionado con nada visto antes.
  2. Consecuencia de la homocedasticidad.
  3. Consecuencia de la independencia entre observaciones (``copias idénticas e independientes''), ya anunciada en la lección 9.
  4. Una consecuencia de la insesgadez de \(\hat\beta_2\).

Pregunta 3 [M] — Origen de los pesos \(W_i\)

Los pesos \(W_i=(X_i-{\overline{X}})/\sum_j(X_j-{\overline{X}})^2\) que aparecen en \(\hat\beta_2(\boldsymbol X,\boldsymbol Y)=\sum_iW_iY_i\) provienen de:

  1. Una definición completamente nueva, exclusiva de esta sesión.
  2. Evaluar, sobre las variables aleatorias de la muestra, la MISMA fórmula aritmética que la ``vía alternativa'' de la lección 7 obtuvo geométricamente sobre datos fijos.
  3. El teorema de Gauss-Markov.
  4. La cuasivarianza de los residuos.

Pregunta 4 [M] — Las dos propiedades de los pesos

La propiedad \(\sum_iW_i=\mathit 0\) se deduce de:

  1. La homocedasticidad de la perturbación.
  2. Que \(X_i-{\overline{X}}\) suma cero por pura aritmética: la misma cuenta que en la lección 4, aplicada ahora a \(n\) variables aleatorias en lugar de a \(n\) datos.
  3. Que \(\hat\beta_2\) es insesgado.
  4. La independencia entre \(U_i\) y \(U_j\).

Pregunta 5 [M] — El paso de sustitución

Al sustituir \(Y_i=\beta_1\,\mathit1+\beta_2X_i+U_i\) en \(\hat\beta_2=\sum_iW_iY_i\), el término con \(\beta_1\) desaparece porque:

  1. \(\beta_1\) siempre vale cero.
  2. \(\sum_iW_i=\mathit 0\).
  3. \(\sum_iW_iX_i=\mathit 1\).
  4. \(W_i\) no depende de \(\beta_1\).

Pregunta 6 [M] — ``Sacar lo que se conoce''

La propiedad \(E[c(\boldsymbol X)Z\mid\boldsymbol X]=c(\boldsymbol X)E[Z\mid\boldsymbol X]\), usada para justificar que \(W_i\) ``sale'' de la esperanza condicionada, se demuestra:

  1. Citando un teorema de un curso de probabilidad más avanzado, no visto en esta asignatura.
  2. A partir de la propia definición de \(E[Z\mid\boldsymbol X]\) como proyección ortogonal sobre las funciones de \(\boldsymbol X\).
  3. Solo es válida si \(Z\) es independiente de \(\boldsymbol X\).
  4. Es una consecuencia de la homocedasticidad.

Pregunta 7 [D] — Ley de las esperanzas iteradas

La igualdad \(\mathrm{E}\big(E[Z\mid\boldsymbol X]\big)=\mathrm{E}(Z)\) se justifica en esta sesión porque:

  1. Es un axioma que se acepta sin más.
  2. \(\mathit1\) es una función de \(\boldsymbol X\), y \(E[Z\mid\boldsymbol X]\) se define como la proyección de \(Z\) sobre todas las funciones de \(\boldsymbol X\); por tanto \(Z-E[Z\mid\boldsymbol X]\perp\mathit1\).
  3. Solo es cierta cuando \(Z=\hat\beta_2\).
  4. Es consecuencia de la homocedasticidad.

Pregunta 8 [M] — Lectura de la fórmula de la varianza

Según \(Var[\hat\beta_2\mid\boldsymbol X]=\sigma^2/(nS^2)\), la precisión de \(\hat\beta_2\) (menor varianza) aumenta cuando:

  1. \(\sigma^2\) aumenta.
  2. \(n\) disminuye.
  3. \(S^2\) (la varianza muestral del regresor) aumenta.
  4. \(\beta_2\) aumenta.

Pregunta 9 [D] — Por qué hace falta la incorrelación entre perturbaciones

Si \(Cov[U_i,U_j\mid\boldsymbol X]\neq\mathit0\) para algún \(i\neq j\), ¿qué parte de la derivación de esta sesión dejaría de ser válida?

  1. La insesgadez de \(\hat\beta_2\).
  2. Nada; todo el desarrollo es independiente de este supuesto.
  3. La fórmula de la varianza, \(Var[\hat\beta_2\mid\boldsymbol X]=\sigma^2/\sum_i(X_i-{\overline{X}})^2\), que dejaría de reducirse a esa expresión tan simple.
  4. La propia definición de \(\hat\beta_2\) como combinación lineal de los datos.

Pregunta 10 [M] — El tercer producto escalar

El divisor \(n-k\) de \(\langle\cdot,\cdot\rangle_{n-k}\) se elige, a diferencia del divisor \(n\) de \(\langle\cdot,\cdot\rangle_s\), por un motivo:

  1. Geométrico, igual que el divisor \(n\) (para que \(\|\boldsymbol1\|_s=1\)).
  2. Estadístico: para que \(\mathfrak s^2=\mathrm{SRC}/(n-k)\) sea un estimador insesgado de \(\sigma^2\).
  3. Arbitrario, sin ninguna justificación.
  4. Relacionado con el teorema de Gauss-Markov.

Pregunta 11 [B] — Gauss-Markov

Que MCO sea BLUE significa que:

  1. \(\hat\beta_2\) acierta siempre el verdadero valor de \(\beta_2\).
  2. \(\hat\beta_2\) tiene la menor varianza entre todos los estimadores lineales e insesgados de \(\beta_2\).
  3. \(\hat\beta_2\) es el único estimador insesgado posible.
  4. \(\hat\beta_2\) no depende de los supuestos del modelo clásico.

Pregunta 12 [D] — Qué está demostrado y qué no

Respecto a la generalización a \(k\) regresores (\(E[\boldsymbol{\mathop{\widehat{\beta}}}\mid\boldsymbol X]=\boldsymbol\beta\,\mathit1\), \(Var[\boldsymbol{\mathop{\widehat{\beta}}}\mid\boldsymbol X]=\sigma^2(\boldsymbol X^\top\boldsymbol X)^{-1}\)), esta sesión:

  1. La demuestra íntegramente, generalizando paso a paso el argumento de los pesos \(W_i\).
  2. La presenta como aserción, sin demostrarla, y solo verifica, con un cálculo elemental de una inversa \(2\times2\), que es consistente con lo demostrado para \(k=2\).
  3. No la menciona en absoluto.
  4. La demuestra solo para el caso \(k=3\).

13. Respuestas   htmlonly

Notas al pie de página:

1

Denotada en negrita cursiva pero sin letra de palo seco (reservada para las matrices de regresores observadas).

2

Para decir que son copias idénticas basta con que tengan la misma función de distribución: \(F_{X_i}(x) = \operatorname{P}(X_i \leq x) \quad \text{para todo } i = 1, \dots, n\). Esto no las obliga a ser la misma función sobre \(\Omega\); al contrario: dos copias independientes suelen asignar valores distintos para un mismo suceso elemental. Lo que sí comparten, por tener la misma distribución, es el conjunto de valores que toman con probabilidad positiva: su imagen, salvo en sucesos de probabilidad nula, donde ninguna de las dos está sujeta a restricción alguna. Por otro lado, la independencia entre variables aleatorias implica que su función de distribución de probabilidad conjunta equivale al producto de sus distribuciones individuales. Para el caso de \(n\) variables, esto se expresa como: \(F_{X_1, X_2, \dots, X_n}(x_1, x_2, \dots, x_n) = \prod_{i=1}^{n} F_{X_i}(x_i)\).

3

Ese ``sin supuesto adicional'' merece hoy una precisión que en la lección 9 no hacía falta. Allí, \(U=Y-E[Y|X]\) era ortogonal por construcción a toda función de \(X\), y de ahí salía \(E[U\mid X]=\mathit0\) sin suponer nada más. Hoy, sin embargo, no estamos condicionando en \(X_i\), sino en toda la matriz \(\boldsymbol X\), es decir, en las \(n\) copias a la vez. Y la definición de \(U_i\) solo garantiza, por sí sola, la ortogonalidad frente a las funciones de \(X_i\): nada dice directamente sobre las funciones de \(X_j\) con \(j\neq i\). ¿Por qué vale entonces \(E[U_i\mid\boldsymbol X]=\mathit0\)? Por el muestreo aleatorio, y se puede ver con la misma geometría del curso. Lo que hay que comprobar es que \(U_i\) es ortogonal a toda función de la matriz \(\boldsymbol X\). Empecemos por las funciones más sencillas: los productos \(a(X_i)b(X_{-i})\), donde \(X_{-i}\) abrevia ``las demás copias'', \(X_j\) con \(j\neq i\). Separemos \(b(X_{-i})\) en su parte constante y su parte centrada, exactamente como hicimos con los vectores de datos en la lección 4, escribiendo \(\mathrm{E}(b)\) por \(\mathrm{E}\big(b(X_{-i})\big)\): \[ a(X_i)\,b(X_{-i}) \;=\; \underbrace{\mathrm{E}(b)\,a(X_i)}_{\text{función de }X_i}\;+\;a(X_i)\,\big(b(X_{-i})-\mathrm{E}(b)\,\mathit1\big). \] \(U_i\) es ortogonal al primer sumando por definición: es una función de \(X_i\). Y es ortogonal al segundo por la independencia. En efecto, \((X_i,U_i)\) es independiente de \(X_{-i}\), y la independencia se traduce, en nuestro lenguaje, en que la parte centrada de cualquier función de \(X_{-i}\) es ortogonal a cualquier función de \((X_i,U_i)\). Es el hecho, conocido del curso de probabilidad, de que variables independientes están incorreladas, aplicado aquí a \(U_i\,a(X_i)\) y a \(b(X_{-i})\): \[ \big\langle U_i\,a(X_i),\;b(X_{-i})-\mathrm{E}(b)\,\mathit1\big\rangle_P=\mathrm{Cov}\big(U_i\,a(X_i),\,b(X_{-i})\big)=0. \] Así que \(U_i\) es ortogonal a todos los productos \(a(X_i)\,b(X_{-i})\) y, por linealidad del producto escalar, a sus combinaciones lineales. Lo único que admitimos sin demostración, el paso que pertenece a un curso de probabilidad, es que con esas combinaciones se aproxima cualquier función de \(\boldsymbol X\). Con ello, \(U_i\) es ortogonal a toda función de \(\boldsymbol X\), que es lo que dice \(E[U_i\mid\boldsymbol X]=\mathit0\). El argumento completo, con la lectura de la independencia como escuadra, está en el apéndice, sección 6.1 (html).

4

Notación. Esta es la primera vez en el curso que aparece una covarianza condicionada. Sigue el mismo convenio que ya fijamos en la lección 9 para la esperanza y la varianza: \(\mathrm{Cov}(\cdot,\cdot)\), con paréntesis y en recta, es un número (la covarianza no condicionada); \(Cov[\cdot,\cdot\mid\cdot]\), con corchetes y en cursiva, es una variable aleatoria, una función de aquello sobre lo que se condiciona. Su definición es la análoga de la varianza condicional: \(Cov[Z,W\mid\boldsymbol X]=E\big[(Z-E[Z\mid\boldsymbol X])(W-E[W\mid\boldsymbol X])\mid\boldsymbol X\big]\). La usaremos efectivamente al calcular la varianza de \(\hat\beta_2\).

5

Una función de \(\omega\in\Omega\), donde \(\Omega\) es el espacio de sucesos.

6

En la literatura estadística y econométrica es costumbre usar la misma notación para ambos objetos (la estimación y el estimador), pero recuerde que son muy distintos (un número el primero y una variable aleatoria el segundo).

7

El nombre correcto de la operación debería ser forma bilineal definida sobre el anillo de las variables aleatorias. Pero ese nombre aquí no ayuda, dado el nivel matemático del curso. Tan solo advertir que el nombre de suma ponderada es abusivo, pues en la expresión \(\sum_{i=1}^n {W_i}Y_i\) no hay ``números'' que hagan de ponderaciones en la suma de las \(Y_i\); lo que aparece son las variables aleatorias \(W_i\), que son funciones (no números). Por el mismo motivo, tampoco es correcto el nombre de combinación lineal de las \(Y_i\).

8

Una precisión: el supuesto \(\mathrm{Var}(X)\neq0\) no basta para que ese suceso tenga probabilidad cero. Si \(X\) es continua, sí: el suceso ``las \(n\) copias toman el mismo valor'' tiene probabilidad nula. Pero si \(X\) es discreta no: con \(X\) de Bernoulli de parámetro \(1/2\), por ejemplo, \(\mathrm{Var}(X)=1/4\neq0\) y, sin embargo, la probabilidad de que las \(n\) copias tomen el mismo valor vale \(2^{1-n}>0\). Lo correcto, en general, es decir que \(\mathrm{Var}(X)\neq0\) garantiza que esa probabilidad es menor que uno y que tiende a cero al crecer \(n\); y que todo lo que sigue se entiende condicionado a que la muestra observada no sea una de esas degeneradas, igual que un programa estadístico no calcula la pendiente cuando el regresor no varía en la muestra.

9

Un apunte geométrico, antes de seguir. La fórmula de \(W_i\) no es una construcción de esta lección: ya estaba latente en la propia definición de \(c_2\), el coeficiente que la ``vía alternativa'' de la lección 7 nos dio como pendiente. Recordemos aquella fórmula: \[ c_2 = \frac{\Big\langle\boldsymbol{y},\,(\boldsymbol{x}-\mu_{\boldsymbol{x}}\boldsymbol{1})\Big\rangle_s}{\|\boldsymbol{x}-\mu_{\boldsymbol{x}}\boldsymbol{1}\|_s^2} = \hat\beta_2 \] Si desarrollamos ambos productos escalares como sumas, cancelando el factor \(1/n\) entre numerador y denominador (la misma observación que hicimos al abrir esta sesión, al pasar de \(\langle\cdot,\cdot\rangle_s\) a la expresión con sumatorios), obtenemos \[ c_2=\frac{\frac1n\sum_i(x_i-\mu_{\boldsymbol x})y_i}{\frac1n\sum_j(x_j-\mu_{\boldsymbol x})^2}=\frac{\sum_i(x_i-\mu_{\boldsymbol x})y_i}{\sum_j(x_j-\mu_{\boldsymbol x})^2}=\sum_i\underbrace{\left(\frac{(x_i-\mu_{\boldsymbol x})}{\sum_j(x_j-\mu_{\boldsymbol x})^2}\right)}_{w_i}y_i. \] Es decir: los pesos \(w_i=(x_i-\mu_{\boldsymbol x})/\sum_j(x_j-\mu_{\boldsymbol x})^2\) (aquí evaluados sobre un vector de datos fijo \(\boldsymbol x\), no sobre la muestra aleatoria \(\boldsymbol X\)) no son más que \(c_2\) descompuesto sumando a sumando. Es el mismo cociente de productos escalares de la lección 3 (Cauchy–Schwarz), el que la lección 7 aplicó al generador \(\boldsymbol x-\mu_{\boldsymbol x}\boldsymbol 1\), ahora mirada componente a componente. Esta reconexión da, sin ningún cálculo adicional, la cantidad \(\sum_iw_i^2\) que acabamos de necesitar para la varianza. Como el denominador \(\sum_j(x_j-\mu_{\boldsymbol x})^2\) es común a todos los \(w_i\): \[ \sum_iw_i^2=\sum_i\frac{(x_i-\mu_{\boldsymbol x})^2}{\left(\sum_j(x_j-\mu_{\boldsymbol x})^2\right)^2}=\frac{\sum_i(x_i-\mu_{\boldsymbol x})^2}{\left(\sum_j(x_j-\mu_{\boldsymbol x})^2\right)^2}=\frac1{\sum_j(x_j-\mu_{\boldsymbol x})^2}, \] la misma expresión de unas líneas más arriba, allí evaluada sobre la muestra aleatoria \(\boldsymbol X\) y aquí sobre el vector de datos \(\boldsymbol x\). Evaluada en la muestra observada, la varianza de \(\hat\beta_2\) es, pues, \(\sigma^2\) dividido entre el cuadrado de la longitud euclídea (lección 2, sin el factor \(1/n\)) del vector en desviaciones del regresor, \(\|\boldsymbol x-\mu_{\boldsymbol x}\boldsymbol 1\|_e^2\), el mismo vector con el que, en la lección 7, calculamos la propia pendiente. Cuanto más ``largo'' sea ese vector en desviaciones, menor la varianza: la misma intuición de ``más dispersión, más precisión'' que ya leímos en la fórmula con \(S^2\), ahora vista como una propiedad exacta de la longitud de un vector concreto en \(\mathbb R^n\).

10

Esta es la posición de Eros con la que abríamos la lección 9: ni conocemos \(U_i\) (eso sería la posición del dios), ni carecemos de toda información sobre ella (la posición del ignorante); \(\hat E_i\) es nuestro mejor sustituto calculable, construido para que, bajo los supuestos del modelo, se comporte como \(U_i\) en promedio.

11

Seguimos aquí, por simplicidad, la misma convención del resto de esta sección: escribimos las fórmulas con los datos observados \(\boldsymbol{\mathop{\widehat e}}\), aunque hablemos de propiedades, como el sesgo o la insesgadez, que, en sentido estricto, son propiedades del estimador (la variable aleatoria subyacente), no de un número concreto. Es el mismo tipo de abuso de notación, ya señalado al distinguir estimador de estimación, habitual en toda la literatura econométrica; introducir aquí toda la notación necesaria para evitarlo tendría un coste en claridad mayor que el beneficio.

12

Esta idea ya la usamos, sin justificarla del todo, en la práctica de laboratorio que sigue a la lección 10, al motivar por qué dividir por \(n-k\) (y no por \(n\)) produce estimadores insesgados. Precisemos ahora, con algo más de rigor, el motivo exacto de ese divisor.

13

El subíndice \(n-k\) indica por qué número se divide. Con ese mismo criterio los tres productos escalares del curso admiten una notación unificada: \(\langle\cdot,\cdot\rangle_e=\langle\cdot,\cdot\rangle_1\) (se divide por \(1\)), \(\langle\cdot,\cdot\rangle_s=\langle\cdot,\cdot\rangle_n\) (por \(n\)) y \(\langle\cdot,\cdot\rangle_{n-k}\) (por \(n-k\)). Mantendremos los subíndices \(e\) y \(s\), ya habituales, pero conviene saber que la familia es una sola.

14

\(\begin{pmatrix}a&b\\c&d\end{pmatrix}^{-1}=\dfrac{1}{ad-bc}\begin{pmatrix}d&-b\\-c&a\end{pmatrix}\), con \(a=n\,\mathit1\), \(b=c=n\overline{X}\), \(d=\sum_iX_i^2\), y usando que \(ad-bc=n\sum_iX_i^2-n^2\overline{X}^2=n\sum_i(X_i-\overline{X})^2\) (la ``fórmula de cálculo'' de la varianza, lección 5, evaluada sobre \(\boldsymbol{X}\) y multiplicada por \(n\)).

Autor: Marcos Bujosa

Created: 2026-10-09 vie 19:03

Validate