Sesión 22 (C) — Edad y kilómetros: colinealidad con coeficientes significativos
Índice
- Descripción de la práctica
- Actividad 1 - Los datos y las dos regresiones simples
- Actividad 2 - Las dos juntas
- Actividad 3 - Las partes propias y el error estándar
- Actividad 4 - Contrastes: \(t\) grandes con un VIF de \(142\)
- Actividad 5 - La misma regresión en dos mitades
- Preguntas de interpretación para la clase
- Para profundizar
- Código completo de la práctica
- Respuestas
Descripción de la práctica
El caso nox y lnox es la forma más visible de la colinealidad: dos \(t\) nulos y un \(F\) grande. Esta práctica muestra otra, más traicionera: dos regresores casi alineados cuyos coeficientes son significativos, uno de ellos con un signo que nadie esperaría. Aquí el VIF no avisa de un \(t\) pequeño, sino de un coeficiente que no puede leerse como se lee normalmente.
Los datos son data3-7 de Ramanathan: cincuenta y siete coches con su coste acumulado de reparaciones (cost, en dólares), su edad (age, en semanas) y los kilómetros recorridos (miles, en miles de millas). Edad y kilómetros crecen juntos: un coche que lleva más tiempo ha recorrido más. La pregunta es qué pasa cuando se pide al modelo que separe el efecto de cada uno.
Objetivos
- Comparar las dos regresiones simples con la regresión múltiple: los coeficientes cambian de tamaño y uno cambia de signo.
- Medir la colinealidad: correlación, partes propias y VIF, y comprobar de nuevo \(\mathrm{ee}(\hat\beta_j)=\mathfrak s/\Vert\tilde{\boldsymbol x}_j\Vert_e\).
- Ver que un VIF de \(142\) es compatible con dos \(t\) grandes, y qué es lo que ese VIF sí está diciendo.
- Comprobar la inestabilidad de las coordenadas estimando en dos mitades de la muestra.
Actividad 1 - Los datos y las dos regresiones simples
Abra data3-7, mire las variables y su correlación, y estime cost sobre age y cost sobre miles por separado.
o bien teclee en línea de comandos:
open data3-7.gdt --quiet labels summary cost age miles --simple corr age miles ols cost const age ols cost const miles
cost: cumulative repair cost in actual dollars (11 - 3425)
age: age of car in weeks of ownership (Range 5 - 538)
miles: miles driven in thousands (Range 0.8 - 74.4)
Media Mediana D. T. Mín Máx
cost 1427 1182 1151 11,00 3425
age 279,5 276,0 148,7 5,000 538,0
miles 41,58 43,40 19,96 0,8000 74,40
corr(age, miles) = 0,99646458
Bajo la hipótesis nula de no correlación:
t(55) = 87,9614, con valor p a dos colas 0,0000
cost ~ age: coef(age) = 7,343 ee = 0,330 t = 22,28 R2 = 0,9003 s = 366,8 cost ~ miles: coef(miles) = 53,451 ee = 2,926 t = 18,27 R2 = 0,8585 s = 437,0
Figura 1: miles frente a age: los cincuenta y siete coches están casi sobre una recta. La correlación es \(0{,}9965\).
Lo que debe observar
Las dos regresiones simples dicen lo esperable: cada semana de edad añade unos \(7\) dólares de reparaciones; cada mil millas, unos \(53\). Los dos coeficientes son positivos, con \(t\) de \(22\) y de \(18\). Pero la figura muestra que las dos variables son casi la misma: la correlación es \(0{,}9965\), un ángulo de \(4{,}8^\circ\), y en esta muestra ``más viejo'' y ``más rodado'' son casi indistinguibles.
Actividad 2 - Las dos juntas
Estime cost sobre age y miles, y pida los factores de inflación (Análisis -> Colinealidad).
o bien teclee en línea de comandos:
ols cost const age miles vif
Modelo 1: MCO, usando las observaciones 1-57
Variable dependiente: cost
coeficiente Desv. típica Estadístico t valor p
----------------------------------------------------------------
const 26,1888 114,201 0,2293 0,8195
age 28,0163 2,77558 10,09 4,91e-14 ***
miles -154,635 20,6882 -7,475 6,99e-10 ***
Media de la vble. dep. 1426,632 D.T. de la vble. dep. 1151,186
Suma de cuad. residuos 3637878 D.T. de la regresión 259,5537
R-cuadrado 0,950980 R-cuadrado corregido 0,949165
F(2, 54) 523,8010 Valor p (de F) 4,36e-36
Log-verosimilitud -396,1995 Criterio de Akaike 798,3990
Criterio de Schwarz 804,5282 Crit. de Hannan-Quinn 800,7810
Factores de inflación de varianza (VIF)
Mínimo valor posible = 1.0
Valores mayores que 10.0 pueden indicar un problema de colinealidad
age 141,676
miles 141,676
VIF(j) = 1/(1 - R(j)^2), donde R(j) es el coeficiente de correlación múltiple
entre la variable j y las demás variables independientes
Lo que debe observar
El coeficiente de age se ha multiplicado casi por cuatro, de \(7{,}3\) a \(28{,}0\), y el de miles ha cambiado de signo: de \(+53\) a \(-155\). Los dos son significativos, con \(t\) de \(10\) y de \(-7{,}5\). El ajuste es mejor que el de cualquiera de las simples: \(R^2=0{,}951\) y \(\mathfrak s=260\) frente a \(367\) y \(437\). Y el VIF es \(142\) para los dos regresores (con \(k=3\) es el mismo para ambos, \(1/(1-\rho^2)\)): el error estándar de cada coeficiente es \(\sqrt{142}=11{,}9\) veces el que tendría si el regresor estuviera solo.
Léase el signo con cuidado. \(-155\) no dice que rodar abarate las reparaciones. Dice que, a igual edad, un coche con más millas de las que corresponden a su edad tiene menos gasto acumulado; o, con la misma cuenta, que a igual kilometraje, un coche más viejo gasta mucho más. Los dos coeficientes describen el efecto de mover un regresor mientras el otro se queda quieto, y en esta muestra eso casi nunca ocurre. Compruébelo: \(7{,}34\approx28{,}02-154{,}6\cdot0{,}134\), donde \(0{,}134\) es la pendiente de miles sobre age de la figura. Es la identidad que la práctica B de la sesión 14 enunció para rooms y nox: la regresión simple mezcla los dos efectos en la proporción en que la muestra los mezcla.
Actividad 3 - Las partes propias y el error estándar
Mida la parte propia de cada regresor con la regresión auxiliar y compruebe la fórmula del error estándar con miles.
en línea de comandos:
ols miles const age --quiet scalar longPropiaMiles = sqrt($ess) ols cost const age miles --quiet printf "s/||parte propia de miles|| = %.3f ee(miles) = %.3f\n", $sigma/longPropiaMiles, $stderr(miles)
parte propia de age sobre miles: ||.|| = 93,513 ||age en desviaciones|| = 1113,071 R2aux = 0,9929 parte propia de miles sobre age: ||.|| = 12,546 ||miles en desviaciones|| = 149,332 R2aux = 0,9929 s = 259,554 ; s/||parte propia de miles|| = 20,688 ; ee(miles) de Gretl = 20,688
Lo que debe observar
La parte propia de miles mide \(12{,}5\) cuando el regresor en desviaciones mide \(149\): queda el \(8{,}4\%\) de su longitud, que es \(\sqrt{1-0{,}9929}=\sin4{,}8^\circ\). Y \(259{,}55/12{,}546=20{,}69\), el error estándar de la tabla. Lo mismo para age: \(93{,}5\) de \(1113\). Los dos regresores son largos, tienen mucha variación; lo que no tienen es variación por separado.
Actividad 4 - Contrastes: \(t\) grandes con un VIF de \(142\)
Compare los \(t\) individuales, el \(F\) conjunto y el \(F\) de omitir cada regresor, y lea la correlación entre los dos estimadores.
en línea de comandos:
ols cost const age miles --quiet
restrict --quiet
b[miles] = 0
end restrict
printf "Omitir miles: F = %.2f\n", $test
printf "correlacion entre los estimadores: %.4f\n", $vcv[2,3]/sqrt($vcv[2,2]*$vcv[3,3])
Modelo completo: t(age) = 10,09 t(miles) = -7,47 t_c = 2,005 IC 95% de age: [22,45 ; 33,58] IC 95% de miles: [-196,1 ; -113,2] F de significacion conjunta (pie de tabla) = 523,8 F_c(2,54) = 3,168 Omitir age: F(1,54) = 101,89 = t^2 valor p = 4,91e-14 Omitir miles: F(1,54) = 55,87 = t^2 valor p = 6,99e-10 correlacion entre los estimadores de age y miles: -0,9965
Lo que debe observar
Con un VIF de \(142\), los dos coeficientes son significativos y ninguno de los dos regresores se puede omitir: las partes propias son cortas, pero los coeficientes son tan grandes que sus \(t\) superan de sobra el umbral. El VIF no es un veredicto sobre la significación; es la escala del error estándar. Aquí dice que el intervalo de miles, de \(-196\) a \(-113\), sería doce veces más estrecho si miles no compartiera casi todo con age. Y la correlación entre los dos estimadores, \(-0{,}9965\), dice que si en otra muestra el coeficiente de age saliera menor, el de miles saldría menos negativo en la misma medida: la pareja está bien determinada; el reparto, no.
Actividad 5 - La misma regresión en dos mitades
Estime el modelo con los coches \(1\) a \(28\) y con los coches \(29\) a \(57\).
en línea de comandos (o Muestra -> Establecer rango):
smpl 1 28 ols cost const age miles smpl 29 57 ols cost const age miles smpl full
La misma regresion en dos mitades de la muestra: obs 1-28 : coef(age) = 5,142 (ee 4,624) coef(miles) = -5,368 (ee 30,413) s = 142,5 obs 29-57: coef(age) = 23,724 (ee 8,230) coef(miles) = -107,742 (ee 69,552) s = 296,5
Lo que debe observar
En una mitad el coeficiente de miles es \(-5\) y en la otra \(-108\); el de age, \(5\) y \(24\). Con la mitad de los datos las partes propias son más cortas todavía, los errores estándar se disparan y las coordenadas van donde el azar de cada mitad las lleva. El fichero está ordenado por edad, así que las dos mitades son además coches jóvenes y coches viejos, y \(\mathfrak s\) cambia de una a otra; eso añade una diferencia real a la oscilación. Pero la lección es la de la nube de la práctica A: con regresores alineados, los coeficientes individuales son lo primero que cambia de una muestra a otra.
Preguntas de interpretación para la clase
- En la Actividad 2, el coeficiente de
milespasa de \(+53\) a \(-155\) al añadirage. Explique con la parte propia por qué el coeficiente de la regresión múltiple no tiene por qué parecerse al de la simple. - Compruebe la identidad \(7{,}34\approx28{,}02-154{,}6\cdot0{,}134\) y diga qué representa cada uno de los tres números de la derecha.
- Con un VIF de \(142\), ¿por qué los dos coeficientes son significativos? ¿Qué tendría que valer el coeficiente de
milespara no serlo? - Un taller quiere predecir el coste de reparaciones de un coche de \(300\) semanas y \(40\) mil millas, valores típicos de la muestra. ¿Le preocupa la colinealidad para esa predicción? ¿Y para un coche de \(300\) semanas y \(10\) mil millas?
- Si tuviera que informar del efecto de la edad sobre el coste, ¿qué modelo usaría y qué diría del coeficiente de
miles?
Para profundizar
- Lección 14 (lección 14), ``Síntomas y diagnóstico'' y ``Qué es y qué no es''.
- Lección 10 (lección 10), el coeficiente de regresión múltiple como coordenada, y la familia ortogonal como único caso en que coincide con el simple.
- Ramanathan, R. (2002). Introductory Econometrics with Applications, 5.ª ed., ejemplo 5.2 y sección 5.4 sobre multicolinealidad.
- Wooldridge, J. M. (2020). Introductory Econometrics, cap. 3, sección 3.4.
Código completo de la práctica
| Enlace al guión: | S22-Prct-C-ramanathan-coches.inp |
Respuestas
- Por qué cambia tanto el coeficiente. El coeficiente de
milesen la regresión simple es la coordenada de \(\boldsymbol{\mathop{\widehat y}}\) sobremilesen desviaciones, un vector de longitud \(149\). En la múltiple es la coordenada de \(\boldsymbol{\mathop{\widehat y}}\) en la base \(\{\boldsymbol 1,\text{age},\text{miles}\}\), y una coordenada depende de toda la base: con generadores casi alineados, la lección 14 mostró que el mismo ajuste admite descomposiciones muy distintas. Además, la lección 14 enunció que ese coeficiente se mide con la parte propia demiles, un vector de longitud \(12{,}5\) casi ortogonal amilesen desviaciones. Los dos coeficientes responden a preguntas distintas y no hay razón para que se parezcan, ni en tamaño ni en signo. Coinciden solo cuando los regresores son ortogonales (lección 10, familia ortogonal). - La identidad. \(28{,}02\) es el coeficiente de
ageen la múltiple; \(-154{,}6\) el demiles; \(0{,}134\) es cuántas mil millas más tiene, en esta muestra, un coche una semana más viejo. La regresión simple decostsobreagerecoge el efecto directo de la edad más el efecto de las millas que la edad arrastra: \(28{,}02+(-154{,}6)(0{,}134)=7{,}30\). La identidad es exacta salvo redondeo, y dice que el coeficiente de la simple no es ``el efecto de la edad'', sino el efecto de la edad junto con todo lo que en la muestra se mueve con ella. - Significativos con VIF \(142\). Porque el \(t\) es el coeficiente entre su error estándar, y el VIF solo infla el denominador: \(20{,}7\) en lugar de \(1{,}74\). Con un coeficiente de \(-155\) el cociente sigue siendo \(-7{,}5\). Para no ser significativo, el coeficiente de
milestendría que ser menor que \(2{,}005\cdot20{,}7\approx41\) en valor absoluto; sin la colinealidad, bastaría con que fuera menor que \(3{,}5\). El VIF dice cuánta evidencia se ha perdido, no si queda suficiente. - Predicción. Para el coche típico, no: \(300\) semanas y \(40\) mil millas está sobre la recta de la figura, y allí el ajuste es el mismo cualquiera que sea el reparto entre los dos coeficientes; la predicción usa \(\boldsymbol{\mathop{\widehat y}}\), que la colinealidad no toca. Para el coche de \(300\) semanas y \(10\) mil millas, sí: está lejos de la recta, en una región donde no hay datos, y la predicción depende de la coordenada de
milespor separado, \(-155\cdot(10-40)=+4\,640\) dólares sobre el coche típico. Ese número descansa en la parte propia demiles, que mide \(12{,}5\): es una extrapolación con un error estándar enorme. - Qué informar. Depende de la pregunta, y hay que decir cuál se responde. Si se quiere el efecto de la edad sin separar lo que la edad arrastra, la regresión simple, \(7{,}3\) dólares por semana, con su intervalo estrecho, y advertir que incluye el efecto del kilometraje. Si se quiere el efecto de la edad a kilometraje fijo, la múltiple, \(28\) con intervalo de \(22\) a \(34\), y advertir que en la muestra casi no hay coches con la misma edad y distinto kilometraje, que el coeficiente de
mileses negativo y difícil de interpretar por separado, y que el VIF es \(142\). Lo que no se puede hacer es informar de \(-155\) como ``el efecto de rodar mil millas''.