Lección 15. Formas funcionales con logaritmos: qué dice cada coeficiente

Índice

Las lecciones 13 y 14 usaron nox y su logaritmo como dos regresores casi alineados. Hoy los leemos como dos formas funcionales de una misma variable explicativa. El modelo sigue siendo lineal en los regresores y la geometría del curso se aplica sin cambios; lo que cambia es qué significa cada coeficiente: un cambio absoluto, un cambio porcentual o una elasticidad. Cierran la función de producción de Cobb–Douglas y la previsión en niveles desde un modelo en logaritmos.

``La geometría opera sobre los regresores; la lectura, sobre las variables.''

1. De dónde venimos: nox y lnox eran dos formas funcionales

Las lecciones 13 y 14 pusieron nox y lnox juntos en un modelo para ver qué pasa con dos regresores casi alineados. Hoy los separamos: cada uno, con rooms, es un modelo distinto del precio (hprice2, \(n=506\)).

Regresando Contaminación coef. \(\mathrm{ee}\) \(t\) \(R^2\)
price nox \(-1884{,}7\) \(253{,}6\) \(-7{,}43\) \(0{,}535\)
price lnox \(-10951{,}4\) \(1457{,}9\) \(-7{,}51\) \(0{,}536\)
lprice nox \(-0{,}1233\) \(0{,}0116\) \(-10{,}67\) \(0{,}511\)
lprice lnox \(-0{,}7177\) \(0{,}0663\) \(-10{,}82\) \(0{,}514\)

Cuatro modelos, cuatro coeficientes de distinto tamaño y las mismas conclusiones estadísticas: la contaminación acompaña precios menores, con \(t\) entre \(-7{,}4\) y \(-10{,}8\). Los cuatro números dicen cosas distintas.

Hoy: qué significa cada coeficiente, por qué el logaritmo convierte cambios absolutos en porcentuales, y cómo se prevé en niveles con un modelo en logaritmos. Sin geometría nueva.

De dónde venimos: nox y lnox eran dos formas funcionales

La lección 13 abrió con una tabla de tres regresiones del precio mediano de la vivienda sobre rooms y la contaminación, medida en niveles (nox), en logaritmos (lnox) o de las dos formas a la vez. La lección 14 explicó la tercera fila: dos regresores que forman un ángulo de \(6^\circ\) comparten casi toda su variación, así que la variación propia de cada uno es muy corta, y los dos errores estándar se multiplican. Las dos primeras filas quedaron sin comentar, y hoy son el punto de partida. A ellas añadimos otras dos, con el logaritmo del precio como regresando.

La tabla de la transparencia recoge las cuatro estimaciones. Los cuatro modelos tienen la misma variable explicativa de contaminación, la concentración de óxidos de nitrógeno, y el mismo segundo regresor, rooms. Difieren en la forma funcional: el precio o su logaritmo, la contaminación o su logaritmo. Los dos modelos del precio tienen un \(R^2\) casi igual entre sí (\(0{,}535\) y \(0{,}536\)), y los dos del logaritmo del precio también (\(0{,}511\) y \(0{,}514\)); los \(R^2\) de un regresando no se comparan con los del otro, porque miden la variación de vectores distintos. En los cuatro el coeficiente de la contaminación es negativo y se separa con claridad de cero. Pero los cuatro coeficientes están en unidades distintas: dólares por unidad de nox, dólares por unidad de logaritmo, logaritmos por unidad de nox y logaritmos por logaritmo. Leerlos exige saber qué unidad es cada una.

Conviene decir desde el principio qué no cambia. El modelo de regresión lineal del curso es \(\boldsymbol y=\beta_1\boldsymbol 1+\beta_2\boldsymbol x_2+\cdots+\beta_k\boldsymbol x_k+\boldsymbol u\), y lo que hace mínimos cuadrados es proyectar el vector \(\boldsymbol y\) sobre el subespacio generado por las columnas. Que una columna sea el logaritmo de una variable, o que el vector proyectado sea el logaritmo del precio, no altera nada de lo demostrado en las lecciones 8 a 14: el ajuste, los residuos, \(R^2\), los errores estándar, los contrastes \(t\) y \(F\) se calculan igual y significan lo mismo para las columnas que se le han dado. Esta lección no añade geometría: no hay un triángulo nuevo, sino una tabla de lecturas de coeficientes.

Una precisión de notación: en todo lo que sigue, \(\log\) es el logaritmo natural, el único que se usa en econometría para estas transformaciones. Gretl lo llama log y antepone l_ al nombre de la variable transformada; en hprice2 las variables lprice y lnox vienen ya calculadas.

Para profundizar: Wooldridge, J. M. (2020), cap. 2, sección 2.4 (``Units of measurement and functional form'') y cap. 6, sección 6.2 (``More on functional form'').

2. Variable explicativa y regresor: lineal en los regresores

Variable explicativa: una magnitud observada (nox, educ, el capital). Regresor: una columna del modelo, función de una o varias variables explicativas: nox, \(\log(\text{nox})\), \(\text{nox}^2\), además de la constante.

El modelo es lineal en los regresores: \(\boldsymbol y=\beta_1\boldsymbol 1+\beta_2\boldsymbol x_2+\cdots+\beta_k\boldsymbol x_k+\boldsymbol u\). Esa linealidad en las columnas es lo único que mínimos cuadrados y la inferencia necesitan; toda la geometría del curso opera sobre las columnas.

Puede no ser lineal en las variables explicativas: \(\log(\text{price})\) sobre \(\log(\text{nox})\) describe una curva entre precio y contaminación. La lectura del coeficiente habla de la variable, y por eso depende de la forma funcional.

Mínimos cuadrados ve columnas. El economista lee variables.

Variable explicativa y regresor: lineal en los regresores

Hasta ahora el curso ha usado ``regresor'' y ``variable'' casi como sinónimos, porque en casi todos los ejemplos cada columna del modelo era una variable observada tal cual. Hoy conviene separarlos. Una variable explicativa es una magnitud que se observa en cada unidad de la muestra y que se cree relacionada con el regresando: la concentración de contaminantes de un barrio, los años de educación de un trabajador, el capital de una industria. Un regresor es una columna de la matriz \(\boldsymbol{\mathsf X}\): un vector de \(\mathbb R^n\) que entra en el modelo con un coeficiente. Un regresor puede ser una variable explicativa sin transformar, su logaritmo, su cuadrado, el producto de dos variables, o la constante, que no proviene de ninguna. De una misma variable explicativa pueden salir varios regresores, y la lección 14 lo vio con nox y lnox.

El modelo del curso, \(\boldsymbol y=\beta_1\boldsymbol 1+\beta_2\boldsymbol x_2+\cdots+\beta_k\boldsymbol x_k+\boldsymbol u\), es lineal en los regresores: el regresando es una combinación lineal de las columnas más la perturbación, con los \(\beta_j\) como coeficientes. Esa linealidad es la que usa todo el curso. Mínimos cuadrados proyecta \(\boldsymbol y\) sobre el subespacio generado por las columnas (lecciones 8 y 10); la insesgadez, la varianza y las distribuciones \(t\) y \(F\) (lecciones 11 a 13) se refieren a los coeficientes de las columnas; la colinealidad (lección 14) es un ángulo entre columnas. Nada de eso pregunta de qué variable salió cada columna.

Que el modelo sea lineal en los regresores no obliga a que sea lineal en las variables explicativas. \(\log(\text{price})=\beta_1+\beta_2\log(\text{nox})+\beta_3\,\text{rooms}+u\) ajusta una relación lineal entre el logaritmo del precio y sus tres regresores, la constante, \(\log(\text{nox})\) y rooms, pero describe una relación no lineal entre price y nox: el precio es proporcional a una potencia de nox, \(\text{price}=e^{\beta_1+\beta_3\,\text{rooms}+u}\,\text{nox}^{\beta_2}\). La distinción importa para la lectura. El coeficiente \(\beta_2\) multiplica a la columna \(\log(\text{nox})\), y por tanto mide el efecto de una unidad más de logaritmo de contaminación. Traducir el ajuste lineal de las variables transformadas a la relación entre las variables originales en niveles es el trabajo de esta lección.

Escrito en niveles, \(\text{price}=e^{\beta_1+\beta_3\,\text{rooms}+u}\,\text{nox}^{\beta_2}\) no es lineal en los parámetros: los \(\beta\) aparecen en exponentes. Tomar logaritmos lo convierte en \(\log(\text{price})=\beta_1+\beta_2\log(\text{nox})+\beta_3\,\text{rooms}+u\), donde los \(\beta\) son los coeficientes de una combinación lineal, y ese modelo se estima con la proyección de la lección 8. Queda un tercer caso, fuera del curso: modelos en los que ninguna transformación de las variables deja los \(\beta\) como coeficientes de una combinación lineal, como \(y=\beta_1x^{\beta_2}+u\), donde la perturbación se suma fuera de la potencia y el logaritmo no la separa. Esos modelos no se estiman con la proyección de la lección 8. El caso de Cobb–Douglas, \(Q=AL^\alpha K^\gamma e^{u}\), parece de este tipo y no lo es: tomando logaritmos se convierte en un modelo lineal en los regresores, y lo estimaremos con mínimos cuadrados en la transparencia ``Cobb–Douglas: elasticidades y rendimientos a escala''.

Para profundizar: Wooldridge, J. M. (2020), cap. 2, sección 2.4, apartado ``Meaning of linear regression''; cap. 3, sección 3.1 (el modelo con \(k\) regresores y la interpretación ceteris paribus).

3. Cuatro formas, cuatro lecturas del coeficiente

Para leer un coeficiente que multiplica o acompaña a un logaritmo basta una aproximación: para un cambio relativo pequeño \(p\), \(\log(1+p)\approx p\). Una variación absoluta de \(\log y\) de magnitud \(\Delta\) es una variación relativa de \(y\) de aproximadamente \(\Delta\), en tanto por uno. Como variación pequeña es usual tomar \(p=0{,}01\), un 1 %.

Forma Modelo \(\beta_2\) es… Lectura de \(\beta_2\) (con lo demás fijo)
nivel-nivel \(y=\beta_1+\beta_2x+\cdots\) cambio absoluto una unidad más de \(x\), \(\beta_2\) unidades más de \(y\)
log-nivel \(\log y=\beta_1+\beta_2x+\cdots\) semielasticidad una unidad más de \(x\), \(y\) varía en la fracción \(\beta_2\)
nivel-log \(y=\beta_1+\beta_2\log x+\cdots\) efecto por fracción \(x\) varía en la fracción \(p\), \(y\) varía \(\beta_2\,p\) unidades
log-log \(\log y=\beta_1+\beta_2\log x+\cdots\) elasticidad \(x\) varía en la fracción \(p\), \(y\) varía en la fracción \(\beta_2\,p\)

Las cuatro lecturas con hprice2, con rooms fijo (los cuatro modelos de ``De dónde venimos: nox y lnox eran dos formas funcionales''):

Forma Modelo \(\hat\beta\) de la contaminación Lectura
nivel-nivel price sobre rooms y nox \(-1884{,}7\) una unidad más de nox, \(1885\) dólares menos
log-nivel lprice sobre rooms y nox \(-0{,}1233\) una unidad más de nox, fracción \(-0{,}123\): un \(12{,}3\) % menos
nivel-log price sobre rooms y lnox \(-10951{,}4\) nox varía en la fracción \(p=0{,}01\), \(-10951\cdot0{,}01=-109{,}5\): \(109{,}5\) dólares menos
log-log lprice sobre rooms y lnox \(-0{,}7177\) nox varía en la fracción \(p=0{,}01\), fracción \(-0{,}718\cdot0{,}01=-0{,}0072\): un \(0{,}72\) % menos

Como variación pequeña es usual tomar \(p=0{,}01\), un 1 %.

Cuatro formas, cuatro lecturas del coeficiente

Toda la lectura de los modelos con logaritmos se apoya en una propiedad del logaritmo natural: para un número \(p\) pequeño, \(\log(1+p)\) es aproximadamente \(p\). Con \(p=0{,}01\), \(\log(1{,}01)=0{,}00995\); con \(p=0{,}05\), \(\log(1{,}05)=0{,}0488\); con \(p=0{,}10\), \(\log(1{,}10)=0{,}0953\). La aproximación es buena por debajo del 10 % y empeora deprisa para variaciones mayores. Si una magnitud pasa de \(y\) a \(y'\), su logaritmo cambia en \(\log y'-\log y=\log(y'/y)=\log(1+p)\), donde \(p=(y'-y)/y\) es el cambio relativo. Luego una variación absoluta de \(\Delta\) en el logaritmo es, aproximadamente, una variación relativa de \(\Delta\) en tanto por uno. Conviene hacer todas las cuentas en tanto por uno y convertir solo al final al porcentaje con el que, por costumbre, se informan los resultados: la fracción \(0{,}123\) es un \(12{,}3\) %.

La tabla de la transparencia aplica esa aproximación a las cuatro combinaciones de niveles y logaritmos. En todas, ``con lo demás fijo'' significa lo mismo que en la lección 10: los otros regresores del modelo no cambian, y la lectura es la del efecto parcial.

Nivel-nivel. Es el modelo de las lecciones 7 a 14. \(\beta_2\) está en unidades de \(y\) por unidad de \(x\): con price sobre rooms y nox, \(\hat\beta_{\text{nox}}=-1884{,}7\) dólares por cada unidad adicional de nox. El efecto de una unidad más es el mismo en un barrio limpio que en uno contaminado.

Log-nivel. El regresando es \(\log y\), así que \(\beta_2\) es el cambio en \(\log y\) por unidad de \(x\), y por la aproximación, la variación relativa de \(y\) por unidad de \(x\), en tanto por uno. Con lprice sobre rooms y nox, \(\hat\beta_{\text{nox}}=-0{,}1233\): una unidad más de nox va con un precio menor en la fracción \(0{,}123\), un \(12{,}3\) % aproximadamente. Esta cantidad se llama semielasticidad: una variación relativa de \(y\) por una variación absoluta de \(x\).

Nivel-log. El regresor es \(\log x\), así que \(\beta_2\) es el cambio de \(y\) por unidad de \(\log x\). Si \(x\) varía en la fracción \(p\), \(\log x\) sube en \(p\) aproximadamente, y por tanto \(y\) en \(\beta_2\,p\) unidades. Con price sobre rooms y lnox, \(\hat\beta_{\text{lnox}}=-10951{,}4\): un 1 % más de contaminación, \(p=0{,}01\), va con \(109{,}5\) dólares menos de precio mediano, sea cual sea el nivel de partida.

Log-log. Las dos en logaritmos: si \(x\) varía en la fracción \(p\), \(\log x\) sube aproximadamente en \(p\), \(\log y\) en \(\beta_2\,p\), e \(y\) en la fracción \(\beta_2\,p\), aproximadamente. \(\beta_2\) es la elasticidad de \(y\) respecto de \(x\), el cociente de las dos variaciones relativas, la cantidad que la teoría económica usa para la demanda, la oferta o la producción. Con lprice sobre rooms y lnox, \(\hat\beta_{\text{lnox}}=-0{,}7177\): un 1 % más de contaminación va con un precio menor en la fracción \(0{,}0072\), un \(0{,}72\) % aproximadamente.

Los cuatro coeficientes se refieren a la misma relación entre precio y contaminación, y los datos no dicen cuál de las cuatro formas es la adecuada (quizá ninguna de las cuatro lo es). Cada modelo impone una forma a esa relación y su coeficiente la resume en una unidad distinta. La transparencia ``La elasticidad: una decisión del modelo'' vuelve sobre esa idea: la forma funcional se impone, no se descubre.

Para profundizar: Wooldridge, J. M. (2020), cap. 2, sección 2.4 (``Incorporating nonlinearities in simple regression'', con la tabla de las cuatro formas) y cap. 6, sección 6.2.

4. Log-nivel: salarios y educación

wage1 (Wooldridge; \(526\) trabajadores, salario por hora en dólares de 1976):

Modelo coef. de educ \(\mathrm{ee}\) \(R^2\)
wage sobre educ \(0{,}541\) \(0{,}053\) \(0{,}165\)
lwage sobre educ \(0{,}0827\) \(0{,}0076\) \(0{,}186\)

En niveles: un año más de educación, \(54\) centavos más por hora, igual para quien gana \(3\) que para quien gana \(20\) dólares. En log-nivel: un año más, el salario varía en la fracción \(0{,}083\), un \(8{,}3\) % más. El rendimiento de la educación se enuncia así, en porcentaje.

Exacto: \(e^{\hat\beta_2}-1=0{,}0863\), un \(8{,}63\) %. Con cuatro años más: aproximado \(4\cdot0{,}0827=0{,}33\), un \(33\) %; exacto \(e^{4\cdot0{,}0827}-1=0{,}392\), un \(39{,}2\) %. La aproximación sirve para cambios pequeños.

Los dos \(R^2\) no son comparables: miden el ajuste a variables distintas, wage y lwage.

Log-nivel: salarios y educación

El ejemplo clásico del modelo log-nivel es la ecuación de salarios. El fichero wage1 de Wooldridge recoge \(526\) trabajadores de la encuesta de población de Estados Unidos de 1976, con el salario por hora, los años de educación, de experiencia y de antigüedad en la empresa, y una serie de características del puesto que la lección 16 usará como variables ficticias.

El modelo en niveles, wage sobre educ, es \(\widehat{\text{wage}}=-0{,}905+0{,}541\,\text{educ}\): cada año de educación va con \(54\) centavos más por hora, con un intervalo al 95 % que va de \(0{,}44\) a \(0{,}65\). La lectura es la de la lección 12 y es la misma para todos: el modelo impone que el año decimotercero de educación aporte lo mismo que el octavo, en dólares, y que lo aporte igual a quien gana \(3\) dólares por hora que a quien gana \(20\).

El modelo log-nivel, lwage sobre educ, es \(\widehat{\log(\text{wage})}=0{,}584+0{,}0827\,\text{educ}\); la pendiente tiene error estándar \(0{,}0076\) e intervalo de \(0{,}068\) a \(0{,}098\). La lectura es relativa: cada año de educación va con un salario mayor en la fracción \(0{,}083\), un \(8{,}3\) %, en todos los niveles salariales. Es la forma en que la economía del trabajo enuncia el rendimiento de la educación, porque un porcentaje es comparable entre países, décadas y monedas, y porque la hipótesis de que la educación multiplica el salario por un factor constante es más verosímil que la de que le suma una cantidad fija. La fracción \(0{,}083\) es la aproximación; el cambio exacto es \(e^{0{,}0827}-1=0{,}0863\), un \(8{,}63\) %. La diferencia es pequeña para un año, pero crece con el tamaño del cambio: para cuatro años más de educación, la aproximación da \(4\times0{,}0827=0{,}33\), un \(33\) %, mientras que el cálculo exacto arroja un incremento de \(e^{4\times0{,}0827}-1=0{,}392\), un \(39{,}2\) %. El cálculo exacto proviene del cociente de dos predicciones del mismo modelo log-nivel, \(\widehat{\log(\text{wage})}=0{,}584+0{,}0827\,\text{educ}\): dichas previsiones son \(e^{0{,}584+0{,}0827\cdot12}=4{,}84\) dólares por hora con doce años de educación por una parte y \(e^{0{,}584+0{,}0827\cdot16}=6{,}74\) con dieciséis por otra. El cociente \(6{,}74/4{,}84=1{,}392\) es \(e^{4\cdot0{,}0827}\): es decir, a un trabajador con dieciséis años de educación le corresponde un salario un \(39{,}2\) % mayor que a uno con doce. Por tanto, la aproximación del \(33\) % es mala. Cuando el coeficiente, o la variación del regresor, es grande, la aproximación se queda corta y realizar el cálculo exacto es obligado.

La constante también se lee: \(e^{\hat\beta_1}=e^{0{,}584}=1{,}79\) dólares por hora es el salario predicho para cero años de educación, el nivel de escala del modelo. En los modelos con logaritmo en el regresando la constante es un factor multiplicativo, no una cantidad que se suma.

El último punto de la transparencia, que los dos \(R^2\) no se pueden comparar, es un aviso que vale para toda la lección. El \(R^2\) del modelo en niveles, \(0{,}165\), y el del modelo en logaritmos, \(0{,}186\), no se pueden comparar, por la definición de la lección 8: \(R^2\) es la fracción de la variación del regresando que recoge el ajuste, y el regresando es distinto en los dos modelos. Un \(R^2\) mayor con lwage no dice que el modelo en logaritmos prediga mejor el salario. Cómo comparar los dos modelos sobre la misma variable es el tema de la transparencia ``Previsión con y sin logaritmos''.

Para profundizar: Wooldridge, J. M. (2020), cap. 2, ejemplo 2.10 (la ecuación de salarios en log-nivel) y cap. 6, sección 6.2, apartado ``More on using logarithmic functional forms''; Mincer, J. (1974), Schooling, Experience, and Earnings, el origen de esta especificación.

5. Nivel-log y log-log: la superficie de la vivienda

hprice1 (Wooldridge; \(88\) viviendas; precio en miles de dólares; sqrft en pies cuadrados, de \(1171\) a \(3880\)):

Modelo coef. de la superficie \(\mathrm{ee}\) \(R^2\)
price sobre sqrft \(0{,}1402\) \(0{,}0118\) \(0{,}621\)
price sobre lsqrft \(297{,}9\) \(28{,}3\) \(0{,}563\)
lprice sobre sqrft \(0{,}000402\) \(0{,}000037\) \(0{,}584\)
lprice sobre lsqrft \(0{,}873\) \(0{,}085\) \(0{,}553\)

Nivel-nivel: \(100\) pies más, \(14{,}0\) mil dólares más, en una casa de \(1200\) pies y en una de \(3800\). Nivel-log: si la superficie varía en la fracción \(p\), el precio varía en \(297{,}9\,p\) mil; \(100\) pies más son un 10 % en una casa de \(1000\) pies (unos \(28\) mil más) y un 2,5 % en una de \(4000\) (unos \(7\) mil): el pie adicional vale menos cuanto mayor es la casa. Log-log: elasticidad \(0{,}87\); en dólares por pie, \(0{,}87\,\hat y/x\), también decreciente.

El \(R^2\) más alto es el del modelo en niveles, que predice un pie cuadrado del mismo valor en todas las casas. La forma se elige por lo que el modelo predice, no por el \(R^2\).

Con la contaminación (hprice2), el modelo de Wooldridge (ejemplo 4.5): lprice sobre lnox, \(\log(\text{dist})\), rooms y stratio. Elasticidad \(-0{,}954\) (\(\mathrm{ee}\) \(0{,}117\)), intervalo al 95 % de \(-1{,}18\) a \(-0{,}72\); rooms: \(0{,}255\), fracción \(0{,}255\) más por habitación, un \(25{,}5\) % (exacto \(e^{0{,}255}-1=0{,}290\), un \(29{,}0\) %).

La pregunta económica es \(H_0\!:\beta_{\text{lnox}}=-1\) (elasticidad unitaria), no \(\beta_{\text{lnox}}=0\): \(t=\dfrac{-0{,}954-(-1)}{0{,}117}=0{,}40\). Datos como estos no serían raros si la elasticidad fuese \(-1\).

Nivel-log y log-log: la superficie de la vivienda

La superficie de la vivienda es el ejemplo en que la forma funcional se elige con un argumento económico, sin estadística. El fichero hprice1 de Wooldridge, el de la práctica D de la sesión 22, recoge \(88\) viviendas con su precio de venta en miles de dólares y su superficie habitable, sqrft, en pies cuadrados, entre \(1171\) y \(3880\). La tabla de la transparencia estima el precio y su logaritmo sobre la superficie y sobre su logaritmo, sin otros regresores.

El modelo en niveles, price sobre sqrft, da \(0{,}1402\): cada pie cuadrado más va con \(140\) dólares más de precio, y \(100\) pies con \(14{,}0\) mil, sea la casa de \(1200\) pies o de \(3800\). El modelo impone que el pie adicional valga lo mismo en todas. El modelo nivel-log, price sobre lsqrft, da \(297{,}9\): si la superficie varía en la fracción \(p\), el precio varía en \(297{,}9\,p\) mil dólares, aproximadamente. Cien pies más son un 10 % en una casa de \(1000\) pies, \(297{,}9\cdot\log(1{,}1)=28{,}4\) mil dólares más, y un 2,5 % en una de \(4000\), \(7{,}4\) mil. El pie adicional vale menos cuanto mayor es la casa: en dólares por pie, el efecto es \(297{,}9/x\), decreciente en \(x\). Es lo que cabe esperar: en una vivienda pequeña, cien pies más cambian el uso de la casa; en una muy grande, apenas.

El modelo log-log, lprice sobre lsqrft, da una elasticidad de \(0{,}87\): un 1 % más de superficie, el precio varía en la fracción \(0{,}0087\), un \(0{,}87\) % aproximadamente. Como la elasticidad es menor que \(1\), el efecto en dólares por pie, \(0{,}87\,\hat y/x\), también decrece con el tamaño, aunque más despacio que en el nivel-log. El log-nivel, lprice sobre sqrft, impone lo contrario: la fracción \(0{,}0004\) por pie, igual en todas las casas, de modo que en dólares cada pie vale más cuanto más cara es la casa.

Los \(R^2\) no deciden. El más alto es el del modelo en niveles, \(0{,}621\), y el más bajo el del nivel-log, \(0{,}563\); los dos modelos con lprice no son comparables con ellos, porque miden el ajuste a otra variable. Si el criterio fuera el ajuste, se elegiría el modelo que predice un pie cuadrado del mismo valor en todas las casas. Más importante que medir el ajuste es saber qué predice cada modelo, también fuera de lo habitual: el comportamiento del nivel-log es el que la economía espera, y por eso se prefiere aunque ajuste algo peor. La transparencia ``La elasticidad: una decisión del modelo'' vuelve sobre la misma idea con la contaminación, y ``Lo que cambia y lo que no'' explica cómo comparar el ajuste cuando cambia el regresando.

Las mismas dos lecturas con la contaminación: volvemos a hprice2 para las dos formas con el regresor en logaritmos. El modelo nivel-log, price sobre rooms y lnox, es la segunda fila de la tabla de apertura. Su coeficiente, \(-10951{,}4\) dólares por unidad de \(\log(\text{nox})\), no se lee directamente, porque nadie piensa en unidades de logaritmo. Si la contaminación varía en la fracción \(p\), el precio varía en \(-10951{,}4\,p\) dólares: un 1 % más, \(p=0{,}01\), va con un precio mediano \(109{,}5\) dólares menor. La lección 14 lo dijo con otras palabras al comparar los remedios para la colinealidad: con nox en niveles, cada unidad más resta lo mismo al precio; con lnox, resta cada vez menos, porque un aumento de una unidad es un porcentaje grande cuando nox vale \(4\) y pequeño cuando vale \(8\).

El modelo log-log, lprice sobre rooms y lnox, es el más usado cuando la teoría habla de elasticidades. Su coeficiente, \(-0{,}7177\) con error estándar \(0{,}0663\), es la elasticidad del precio respecto de la contaminación: si nox varía en la fracción \(p\), el precio varía en la fracción \(-0{,}7177\,p\); un 1 % más de nox va con un precio menor en la fracción \(0{,}0072\), un \(0{,}72\) %, con rooms fijo. El intervalo al 95 % va de \(-0{,}85\) a \(-0{,}59\). Esta elasticidad es la misma en todos los barrios: el modelo lo impone.

Wooldridge estima, en su ejemplo 4.5, un modelo log-log algo más completo: el logaritmo del precio sobre el logaritmo de nox, el logaritmo de la distancia a los centros de empleo (dist), el número de habitaciones y la ratio alumnos-profesor (stratio). Con \(n=506\), el \(R^2\) es \(0{,}584\) y los cuatro coeficientes se leen con la tabla de la transparencia ``Cuatro formas, cuatro lecturas del coeficiente''. La elasticidad respecto de la contaminación es \(-0{,}954\), con error estándar \(0{,}117\) e intervalo de \(-1{,}18\) a \(-0{,}72\). La elasticidad respecto de la distancia es \(-0{,}134\). El coeficiente de rooms es una semielasticidad, porque rooms entra en niveles: \(0{,}255\), una habitación más va con un precio mayor en la fracción \(0{,}255\), un \(25{,}5\) %, según la aproximación, y en la fracción \(e^{0{,}255}-1=0{,}290\), un \(29{,}0\) %, según el cálculo exacto. Aquí la aproximación ya se queda corta en más de tres puntos. El de stratio es otra semielasticidad: un alumno más por profesor, un precio menor en la fracción \(0{,}052\), un \(5{,}2\) %.

La transparencia termina cobrando una promesa de la lección 12: contrastar un coeficiente contra un valor distinto de cero. Allí se dijo que, cuando \(\beta_2\) es una elasticidad, la pregunta interesante rara vez es si vale cero, sino si es compatible con un valor concreto que la teoría sugiere; y que el estadístico \(t\) sirve para cualquier valor hipotético, no solo para el cero. Con el modelo de Wooldridge la pregunta natural es si la elasticidad es unitaria: si un 1 % más de contaminación va con un 1 % menos de precio. El estadístico es \(t=(\hat\beta_{\text{lnox}}-(-1))/\mathrm{ee}(\hat\beta_{\text{lnox}})=(-0{,}954+1)/0{,}117=0{,}40\), muy por debajo del valor crítico \(1{,}96\), y el valor \(p\) ronda \(0{,}69\). Datos como estos no serían raros si la elasticidad fuese \(-1\); a la luz del contraste, no se rechaza. En cambio, \(H_0\!:\beta_{\text{lnox}}=0\) se rechaza con un \(t\) de \(-8{,}2\), y ese rechazo es el poco informativo: nadie esperaba que la contaminación no afectase al precio.

Para profundizar: Wooldridge, J. M. (2020), cap. 6, sección 6.2 (formas funcionales con logaritmos y comparación de modelos con hprice1) y cap. 4, ejemplo 4.5 (``Housing prices and air pollution'') y sección 4.2, apartado ``Testing other hypotheses about \(\beta_j\)''; Harrison, D. y Rubinfeld, D. L. (1978), ``Hedonic housing prices and the demand for clean air'', Journal of Environmental Economics and Management 5, 81–102, el artículo del que proceden los datos.

6. La elasticidad: una decisión del modelo

En el modelo en niveles la elasticidad existe, pero cambia con \(x\): \(\eta=\beta_2\,x/\hat y\). Con price sobre nox (regresión simple): \(-0{,}47\) en un barrio con nox \(3{,}9\); \(-0{,}82\) con \(5{,}5\); \(-2{,}5\) con \(8{,}7\). En el modelo log-log es la misma en todos los barrios: \(-1{,}04\).

NubeNox_fila.png

Figura 1: Los \(506\) barrios de hprice2. Izquierda: precio mediano (miles de dólares) frente a nox, con la recta del modelo nivel-nivel (price sobre nox, en azul) y la curva del modelo nivel-log (price sobre lnox, en rojo). Donde hay muchos barrios, entre \(4\) y \(7\), la recta y la curva casi coinciden; se separan en los extremos, donde hay pocos datos: para nox \(8{,}7\) la recta predice \(11{,}8\) mil dólares y la curva \(13{,}3\). Derecha: logaritmo del precio frente a logaritmo de nox, con la recta del modelo log-log (en verde); su pendiente, \(-1{,}04\), es la elasticidad, y es la misma en toda la nube. Los tres ajustes son regresiones simples, sin rooms, para que la figura sea plana.

Qué forma elegir lo decide la pregunta económica y el comportamiento esperado fuera de lo habitual, no el \(R^2\): los ajustes son casi iguales donde hay datos.

La elasticidad: una decisión del modelo

La elasticidad de \(y\) respecto de \(x\) es el cociente entre la variación relativa de \(y\) y la variación relativa de \(x\) que la acompaña. En el modelo log-log es el coeficiente, y es constante. Pero la elasticidad se puede calcular en cualquier modelo: en el nivel-nivel, un cambio de una unidad en \(x\) cambia \(y\) en \(\beta_2\) unidades, luego una variación de \(x\) en la fracción \(p\), que son \(p\,x\) unidades, cambia \(y\) en \(\beta_2\,p\,x\) unidades, y en términos relativos en \(\beta_2\,p\,x/y\); el cociente de las dos variaciones relativas es \(\beta_2\,x/y\). La elasticidad en el punto \((x,y)\) es \(\eta=\beta_2\,x/y\), evaluada habitualmente en el valor ajustado \(\hat y\). Depende del punto: crece con \(x\) y decrece con \(y\).

La transparencia lo muestra con la regresión simple de price sobre nox (la de la figura, sin rooms): \(\widehat{\text{price}}=41308-3387\,\text{nox}\). En un barrio con nox igual a \(3{,}9\) el precio ajustado es \(28099\) dólares y la elasticidad \(-3387\times3{,}9/28099=-0{,}47\); con nox igual a \(5{,}5\), el precio ajustado es \(22680\) y la elasticidad \(-0{,}82\); con \(8{,}7\), el precio ajustado baja a \(11842\) y la elasticidad llega a \(-2{,}5\). El mismo modelo dice que la demanda de aire limpio es inelástica en los barrios limpios y muy elástica en los contaminados. El modelo log-log de la misma figura, lprice sobre lnox, dice que la elasticidad es \(-1{,}04\) en todos. Con rooms en el modelo las cifras cambian (\(-0{,}29\), \(-0{,}46\) y \(-0{,}99\) en el modelo en niveles, frente a la elasticidad constante \(-0{,}72\) del log-log), pero el contraste es el mismo: una elasticidad que varía frente a una elasticidad fija.

Ninguno de los dos modelos descubre la elasticidad: cada uno la impone con su forma funcional, y después estima su tamaño. Que la forma de la relación se impone y no se descubre es la idea central de la lección. Elegir entre niveles y logaritmos es elegir qué tipo de relación se supone entre las variables, y esa elección la hace el economista antes de estimar, con dos criterios. El primero es la pregunta: si la teoría habla de elasticidades, o si el efecto que interesa se enuncia en porcentaje, el modelo en logaritmos la responde directamente. El segundo es el comportamiento fuera del rango habitual de los datos. La figura muestra por qué el ajuste no sirve de guía: entre nox \(4\) y \(7\), donde están casi todos los barrios, la recta y la curva pasan por los mismos puntos y los \(R^2\) son \(0{,}18\) en los dos casos. Se separan en los extremos, donde hay pocos datos: para el barrio más contaminado la recta predice \(11{,}8\) mil dólares y la curva \(13{,}3\), y si se extrapolara a nox \(12\), la recta daría un precio de \(0{,}7\) mil dólares y la curva, \(7{,}0\). La muestra apenas distingue las dos formas; lo que las distingue es lo que dicen fuera de la muestra, y eso es una decisión de modelización, no un resultado estadístico. La lección 14 ya dijo, al comparar nox y lnox como remedios para la colinealidad, que las dos descripciones ajustan casi igual y se separan fuera de lo habitual.

Hay un tercer criterio, de forma del error, que se verá en la transparencia ``Lo que cambia y lo que no''. Y hay un criterio que no sirve: el \(R^2\), cuando los regresandos son distintos.

Para profundizar: Wooldridge, J. M. (2020), cap. 6, sección 6.2, apartado ``Models with quadratics'' (otra forma funcional en que el efecto depende del punto) y cap. 2, sección 2.4.

7. Cobb–Douglas: elasticidades y rendimientos a escala

\(Q=A\,L^{\alpha}K^{\gamma}e^{u}\) no es lineal en nada. En logaritmos sí: \(\log Q=\beta_1+\alpha\log L+\gamma\log K+u\), con \(\beta_1=\log A\). Es un modelo log-log con dos regresores: \(\alpha\) y \(\gamma\) son las elasticidades parciales del producto; \(\alpha+\gamma\) mide los rendimientos a escala.

Datos de Zellner y Revankar (greene9_1): valor añadido, trabajo y capital de la industria del equipo de transporte en \(25\) estados de EE. UU., 1957.

Regresor coef. \(\mathrm{ee}\) \(t\)
constante \(1{,}844\) \(0{,}234\) \(7{,}90\)
\(\log(\text{labor})\) \(0{,}805\) \(0{,}126\) \(6{,}37\)
\(\log(\text{capital})\) \(0{,}245\) \(0{,}107\) \(2{,}30\)

\(R^2=0{,}973\); \(\hat\alpha+\hat\gamma=1{,}051\). \(H_0\!:\alpha+\gamma=1\) es una restricción lineal (lección 13): \(F(1,22)=1{,}54\), valor \(p=0{,}23\). Datos como estos no serían raros con rendimientos constantes.

Cobb–Douglas: elasticidades y rendimientos a escala

La función de producción de Cobb–Douglas es el ejemplo canónico del modelo log-log, y el que enlaza esta lección con la teoría económica. En su forma estocástica, \(Q=A\,L^{\alpha}K^{\gamma}e^{u}\): el producto \(Q\) depende del trabajo \(L\) y del capital \(K\) a través de dos exponentes, de una constante de escala \(A\) y de un factor aleatorio \(e^{u}\) que recoge lo que la función no explica. Escrita así no es lineal en los parámetros (\(\alpha\) y \(\gamma\) son exponentes) ni en las variables. Tomando logaritmos, \(\log Q=\log A+\alpha\log L+\gamma\log K+u\), que es el modelo del curso con regresando \(\log Q\), regresores \(\boldsymbol 1\), \(\log L\) y \(\log K\), y perturbación \(u\). Mínimos cuadrados lo estima como cualquier otro, y la inferencia de las lecciones 11 a 13 se aplica a \(\alpha\) y \(\gamma\). Cobb–Douglas muestra por qué importa la distinción entre regresor y variable explicativa: la función es muy no lineal en las variables, y el modelo estimado es lineal en los regresores.

La lectura de los coeficientes es la del modelo log-log. \(\alpha\) es la elasticidad del producto respecto del trabajo con el capital fijo: si el trabajo varía en la fracción \(p\), el producto varía en la fracción \(\alpha\,p\). \(\gamma\) es la elasticidad respecto del capital con el trabajo fijo. Son elasticidades parciales, y en la teoría de la producción con competencia perfecta coinciden con las participaciones del trabajo y del capital en el producto. La suma \(\alpha+\gamma\) mide los rendimientos a escala: si los dos factores aumentan en la misma fracción \(p\), el producto aumenta en la fracción \((\alpha+\gamma)\,p\). Si la suma es \(1\), los rendimientos son constantes; mayor que \(1\), crecientes; menor, decrecientes.

Los datos de la transparencia son los que Zellner y Revankar usaron en 1969 y que Greene reproduce en su manual: el valor añadido, el trabajo y el capital de la industria del equipo de transporte en \(25\) estados de Estados Unidos en 1957. Gretl los incluye como greene9_1 en la pestaña Greene de los ficheros de muestra. El modelo estimado es \(\widehat{\log Q}=1{,}844+0{,}805\log L+0{,}245\log K\), con \(R^2=0{,}973\) y \(\mathfrak s=0{,}236\). La elasticidad respecto del trabajo es \(0{,}81\) con error estándar \(0{,}13\); la del capital, \(0{,}25\) con error estándar \(0{,}11\), y su \(t\) de \(2{,}30\) la separa de cero al 5 % con poco margen, porque con \(25\) observaciones y dos factores correlacionados la parte propia de cada regresor es corta (lección 14). La constante, \(e^{1{,}844}=6{,}3\), es el factor de escala \(A\).

La pregunta de la teoría es si los rendimientos son constantes: \(H_0\!:\alpha+\gamma=1\). Es una restricción lineal sobre dos coeficientes, de las que la lección 13 enseñó a contrastar, y Gretl la contrasta con restrict. La suma estimada es \(1{,}051\), con error estándar \(0{,}041\); el estadístico \(F(1,22)\) vale \(1{,}54\), frente a un valor crítico de \(4{,}30\) al 5 %, y el valor \(p\) es \(0{,}23\). Datos como estos no serían raros si los rendimientos fuesen constantes; a la luz del contraste, no se rechaza. El modelo restringido se construye como en la lección 13: con \(\gamma=1-\alpha\), \(\log Q-\log L=\log A+\gamma\,(\log K-\log L)+u\), la regresión del logaritmo del producto por trabajador sobre el logaritmo del capital por trabajador. Su coeficiente es \(0{,}289\), y las estimaciones restringidas quedan en \(\hat\alpha=0{,}711\) y \(\hat\gamma=0{,}289\): al imponer la escala constante, el reparto entre trabajo y capital se desplaza hacia el capital. La \(\mathrm{SRC}\) sube de \(1{,}222\) a \(1{,}308\), y esa diferencia, dividida por \(\mathfrak s^2\), es el \(F\).

Dos cautelas. La primera: con \(25\) observaciones el contraste tiene poca potencia, y ``no se rechaza'' no es ``los rendimientos son constantes''. La segunda: en una regresión de corte transversal entre estados, la elasticidad estimada compara industrias de tamaños distintos en un mismo año, no el efecto de aumentar los factores en una misma industria; su lectura causal exige los supuestos de la lección 9 sobre la perturbación.

Para profundizar: Zellner, A. y Revankar, N. S. (1969), ``Generalized production functions'', Review of Economic Studies 36, 241–250; Greene, W. H., Econometric Analysis (los datos figuran en la tabla 9.1 de la 4.ª edición, y el ejemplo de Cobb–Douglas con el contraste de rendimientos constantes se repite en las ediciones posteriores); Wooldridge, J. M. (2020), cap. 4, sección 4.4 (contrastes de una combinación lineal de parámetros).

8. Previsión con y sin logaritmos

Con lprice sobre rooms y lnox, un barrio con \(6\) habitaciones y nox \(5{,}5\) tiene \(\widehat{\log(\text{price})}=9{,}846\). Deshacer el logaritmo, \(e^{9{,}846}=18879\) dólares, subestima el precio medio: \(e^{\hat y}\) predice la mediana, no la media.

Con perturbación normal (lección 12), \(\mathrm{E}(y\mid\text{regresores})=e^{\boldsymbol x^\top\boldsymbol\beta}\,e^{\sigma^2/2}\). Previsión corregida: \(e^{\hat y}\,e^{\mathfrak s^2/2}\); aquí \(\mathfrak s=0{,}286\) y el factor es \(1{,}042\): \(19667\) dólares. Enunciado, no demostrado.

En toda la muestra: la media de price es \(22512\); la media de \(e^{\hat y}\), \(21672\); la de la previsión corregida, \(22576\).

Para comparar con un modelo en niveles hay que medir sobre la misma variable: el cuadrado de la correlación entre price y la previsión en niveles del modelo log-log es \(0{,}595\); el \(R^2\) de price sobre rooms y lnox, \(0{,}536\).

Previsión con y sin logaritmos

Un modelo con el logaritmo del precio como regresando predice logaritmos. Para dar un precio hay que deshacer la transformación, y ese paso tiene una trampa. Tomemos el modelo log-log lprice sobre rooms y lnox, \(\widehat{\log(\text{price})}=9{,}234+0{,}306\,\text{rooms}-0{,}718\log(\text{nox})\), y un barrio con seis habitaciones por vivienda y una concentración de \(5{,}5\): la previsión en logaritmos es \(9{,}846\). Lo inmediato es deshacer el logaritmo y tomar \(e^{9{,}846}=18879\) dólares como previsión del precio. Pero \(e^{\hat y}\) no predice el precio medio de los barrios con esas características, sino algo menor.

La razón está en la forma de la perturbación. El modelo dice \(\log(\text{price})=\boldsymbol x^\top\boldsymbol\beta+u\), es decir, \(\text{price}=e^{\boldsymbol x^\top\boldsymbol\beta}e^{u}\). Si \(u\) es simétrica alrededor de cero, la mitad de los barrios tiene \(e^{u}>1\) y la otra mitad \(e^{u}<1\), así que \(e^{\boldsymbol x^\top\boldsymbol\beta}\) es la mediana del precio para esos regresores. Pero la media de \(e^{u}\) es mayor que \(1\): los valores de \(u\) por encima de cero multiplican el precio por más de lo que los valores por debajo lo dividen. Con \(u\) normal de varianza \(\sigma^2\), condicionando en los regresores, la media de \(e^{u}\) es \(e^{\sigma^2/2}\), y por tanto \(\mathrm{E}(\text{price}\mid\text{regresores})=e^{\boldsymbol x^\top\boldsymbol\beta}e^{\sigma^2/2}\). Es una propiedad de la distribución normal que enunciamos sin demostrar; el apéndice de geometría tampoco la cubre. La previsión de la media se obtiene multiplicando \(e^{\hat y}\) por \(e^{\mathfrak s^2/2}\), con \(\mathfrak s^2=\mathrm{SRC}/(n-k)\) la cuasivarianza de los residuos de la lección 11. Aquí \(\mathfrak s=0{,}286\), el factor es \(e^{0{,}0409}=1{,}042\), y la previsión corregida del barrio es \(18879\times1{,}042=19667\) dólares. El modelo nivel-log, price sobre rooms y lnox, da para el mismo barrio \(20065\). Las tres cifras, \(18879\), \(19667\) y \(20065\), son previsiones razonables del precio de ese barrio; lo que no es razonable es tomar \(e^{\hat y}\) por la media sin corregirlo.

La corrección se nota en el conjunto de la muestra. El precio medio de los \(506\) barrios es \(22512\) dólares. La media de \(e^{\hat y}\) es \(21672\), un \(3{,}7\) % menos; la media de las previsiones corregidas, \(22576\), casi igual a la observada. Si la perturbación no fuese normal, el factor \(e^{\sigma^2/2}\) no sería el correcto, pero el problema sería el mismo, y hay una corrección sin supuesto de normalidad: multiplicar por la media muestral de \(e^{\hat e_i}\), los residuos exponenciados. Con estos datos ese factor vale \(1{,}043\), frente al \(1{,}042\) de la fórmula con normalidad.

Con la previsión en niveles se puede responder la pregunta que la transparencia ``Log-nivel: salarios y educación'' dejó abierta: cómo comparar el ajuste de un modelo en logaritmos con el de uno en niveles. El \(R^2\) no sirve, porque mide ajustes a regresandos distintos. Lo que sí se puede comparar es cuánto se parecen las previsiones del precio, en dólares, al precio observado. Una medida es el cuadrado de la correlación entre price y la previsión en niveles, que para el modelo en niveles coincide con su \(R^2\) (lecciones 5 y 8: \(R^2\) es el coseno al cuadrado del ángulo entre el regresando y su ajuste en desviaciones, es decir, su correlación al cuadrado). Con el modelo log-log, la correlación al cuadrado entre price y \(e^{\hat y}\) es \(0{,}595\), y multiplicar por el factor de corrección no la cambia, porque una constante multiplicativa no altera la correlación. El modelo nivel-log, price sobre rooms y lnox, tiene \(R^2=0{,}536\). Medidos sobre la misma variable, el modelo en logaritmos predice algo mejor el precio en dólares. No es una regla general: en otros datos el resultado se invierte, y por eso hay que calcularlo.

Para profundizar: Wooldridge, J. M. (2020), cap. 6, sección 6.4, apartado ``Predicting \(y\) when \(\log(y)\) is the dependent variable'' (incluye la corrección sin normalidad de Duan y la comparación de \(R^2\) entre modelos); Duan, N. (1983), ``Smearing estimate: a nonparametric retransformation method'', Journal of the American Statistical Association 78, 605–610.

9. Lo que cambia y lo que no

Unidades: si price pasa a miles de dólares, \(\log(\text{price}/1000)=\log(\text{price})-6{,}908\): solo cambia la constante (\(9{,}234\to2{,}326\)); pendientes, \(R^2\) y \(\mathfrak s\), iguales. En niveles, cambiar las unidades de \(y\) o de \(x\) reescala los coeficientes (lección 5).

Solo variables positivas: el logaritmo no admite ceros ni negativos. Con ceros, se deja la variable en niveles o se usa \(\log(1+x)\) para \(x\ge0\). Las variables que ya son porcentajes o tasas suelen entrar en niveles; las dicotómicas, siempre (lección 16).

La forma de la perturbación: los precios y los salarios tienen asimetría a la derecha y una dispersión que crece con el nivel; el logaritmo los simetriza y estabiliza su varianza. Esa es la razón estadística para preferir lprice y lwage, y vuelve en la lección 17.

Lo que no cambia nunca: la geometría. Columnas, proyección, residuos, \(t\) y \(F\) son los mismos para cualquier forma funcional lineal en los regresores.

Lo que cambia y lo que no

Tres observaciones prácticas cierran la parte de lectura.

Unidades. La lección 5 estudió qué pasa con la media, la varianza y la correlación al trasladar o reescalar un vector, y la lección 12 avisó de que el tamaño de un coeficiente depende de las unidades. En un modelo en niveles, medir el precio en miles de dólares divide por mil todos los coeficientes y la constante; medir nox en partes por millón en lugar de por cien millones multiplica su coeficiente por cien. Las conclusiones no cambian, pero las cifras sí, y hay que saber en qué unidades está cada una. Con logaritmos la situación es más simple: \(\log(cx)=\log c+\log x\), así que cambiar las unidades de una variable en logaritmos suma una constante a su columna, y eso solo mueve la constante del modelo. Con lprice sobre rooms y lnox, si el precio se mide en miles de dólares la constante pasa de \(9{,}234\) a \(9{,}234-\log(1000)=2{,}326\), y las dos pendientes, el \(R^2\), \(\mathfrak s\) y todos los \(t\) quedan iguales. Lo mismo ocurre si se cambian las unidades de nox: su coeficiente, la elasticidad, no tiene unidades. Esta invariancia es una de las razones por las que las elasticidades son la forma habitual de enunciar resultados comparables entre estudios.

Variables positivas. El logaritmo de cero no existe, y el de un número negativo tampoco. Las variables candidatas a entrar en logaritmos son cantidades positivas con rango amplio: precios, salarios, rentas, producción, población, superficies. Cuando una variable positiva toma el valor cero en parte de la muestra (horas de formación, gasto en un bien que muchos no compran), se puede dejar en niveles o usar \(\log(1+x)\), que vale cero en \(x=0\) y se parece a \(\log x\) para \(x\) grande; en ese caso la lectura porcentual es solo aproximada. Las variables que ya son tasas o porcentajes, como una tasa de paro o la ratio alumnos-profesor, suelen entrar en niveles: su coeficiente se lee por puntos porcentuales y no hace falta transformarlas. Las variables dicotómicas, que valen cero o uno, nunca se transforman; la lección 16 explicará cómo se leen, y en un modelo con el regresando en logaritmos su coeficiente será una diferencia porcentual.

La forma de la perturbación. Hay una razón estadística, además de la económica, para preferir el logaritmo en el regresando cuando se trata de precios, salarios o rentas. Estas variables tienen distribuciones asimétricas, con una cola larga a la derecha, y su dispersión crece con el nivel: entre viviendas caras hay más diferencias en dólares que entre viviendas baratas. En un modelo en niveles eso se traslada a la perturbación, que deja de tener la misma varianza en todas las observaciones, en contra del supuesto de homocedasticidad de la lección 11. El logaritmo comprime la cola derecha y convierte las diferencias en dólares en diferencias relativas, que suelen ser más parecidas entre niveles; con frecuencia el modelo en logaritmos cumple mejor los supuestos de las lecciones 11 y 12. La lección 17 tratará la heterocedasticidad y sus remedios; el cambio a logaritmos es el primero que se suele probar.

Y lo que no cambia. Toda esta lección ha hablado de lectura, y ninguna transparencia ha necesitado una figura nueva de \(\mathbb R^n\). El modelo con logaritmos es el mismo modelo lineal en los regresores de las lecciones 8 a 14, con otras columnas. La proyección, el residuo, la descomposición de Pitágoras, el \(R^2\), los errores estándar, los contrastes \(t\) y \(F\) y la colinealidad son los que eran. La forma funcional decide qué columnas se construyen y cómo se leen sus coeficientes; una vez construidas, la geometría no distingue un logaritmo de un nivel.

Para profundizar: Wooldridge, J. M. (2020), cap. 2, sección 2.4 (``The effects of changing units of measurement on OLS statistics'') y cap. 6, sección 6.2 (ventajas y límites de los logaritmos, incluida la cuestión de los ceros); cap. 8 para la heterocedasticidad.

10. Recapitulación y guiño a la lección siguiente

Pieza Fórmula Lectura
Regresor frente a variable \(\boldsymbol x_j\) es función de las variables la geometría ve columnas; la lectura, variables
Aproximación \(\log(1+p)\approx p\) un \(\Delta\) en \(\log y\) es una fracción \(\Delta\) en \(y\)
Las tres lecturas \(\beta_2\); \(\beta_2\,p\); \(\beta_2\,p\) semielasticidad; efecto por fracción; elasticidad
Cobb–Douglas \(\log Q=\beta_1+\alpha\log L+\gamma\log K+u\) elasticidades parciales; \(\alpha+\gamma=1\) es un restrict
Previsión en niveles \(e^{\hat y}\,e^{\mathfrak s^2/2}\) \(e^{\hat y}\) es la mediana; el factor corrige la media

Demostrado: las lecturas, a partir de \(\log(1+p)\approx p\). Enunciado: \(\mathrm{E}(e^{u})=e^{\sigma^2/2}\) con \(u\) normal. Sin geometría nueva.

Lección 16: variables dicotómicas e interacciones; en log-nivel, el coeficiente de una dicotómica es una diferencia porcentual.

Recapitulación y guiño a la lección siguiente

La sesión no ha añadido ningún resultado geométrico ni probabilístico. Ha añadido una distinción, entre variable explicativa y regresor, y una tabla de lecturas. La distinción dice que el modelo del curso es lineal en los regresores y que eso es todo lo que mínimos cuadrados y la inferencia necesitan; los regresores pueden ser transformaciones de las variables explicativas, y entonces el modelo describe entre las variables una relación no lineal. La tabla dice cómo se lee el coeficiente en cada combinación de niveles y logaritmos: cambio absoluto, semielasticidad, efecto de un 1 % o elasticidad, siempre con la aproximación \(\log(1+p)\approx p\) y con la versión exacta \(100(e^{\Delta}-1)\) cuando el cambio es grande.

Lo que se ha demostrado es esa tabla, con la propiedad del logaritmo y las definiciones. Lo único que se ha enunciado sin demostrar es la media de \(e^{u}\) para \(u\) normal, \(e^{\sigma^2/2}\), que sostiene la corrección de la previsión en niveles; no está en el apéndice de geometría, porque no es un resultado sobre proyecciones sino sobre la distribución normal. La lección 12 enunció también la propiedad de la normal de la que dependen las distribuciones \(t\) y \(F\); con esta son dos.

Dos cosas conviene retener para las lecciones siguientes. La primera es la idea de que la forma funcional es una decisión del economista: el modelo impone la forma de la relación y después estima su tamaño, y los datos ayudan poco a elegir entre formas que ajustan igual donde hay observaciones. La segunda es el aviso sobre el \(R^2\): no compara modelos con regresandos distintos, y la comparación hay que hacerla sobre las previsiones en la misma variable.

La lección 16 continúa con la lectura de coeficientes en otro tipo de regresor: las variables dicotómicas, que valen cero o uno y que señalan a qué grupo pertenece cada observación. Su coeficiente es un desplazamiento del intercepto entre grupos; en un modelo con el regresando en logaritmos, ese desplazamiento es una diferencia porcentual, por la misma aproximación de hoy. Y las interacciones, producto de una dicotómica por otro regresor, permiten que una pendiente cambie de un grupo a otro. La lección 14 dejó para entonces una advertencia: dos indicadoras complementarias junto con la constante son colinealidad exacta, y la lección 16 dirá cómo se evita.

Para profundizar: Wooldridge, J. M. (2020), cap. 6, sección 6.2 (resumen de las formas funcionales con logaritmos) y cap. 7, sección 7.1 (anticipo de las variables dicotómicas).

11. Preguntas de repaso (sesión 23)   htmlonly

Le propongo 12 preguntas. Las marco con un nivel orientativo: [B] básica, [M] media, [D] discriminadora.

Comentario

Las preguntas que más le conviene trabajar son la 2 (la distinción entre lineal en los regresores y lineal en las variables, que es la idea que organiza la lección), la 7 (la elasticidad como decisión del modelo: el mismo dato da elasticidades distintas según la forma funcional) y la 10 (por qué \(e^{\hat y}\) no predice la media). Repase también la 4 y la 5, que fijan la mecánica de la lectura, y la 9, que distingue la pregunta económica de la pregunta estadística en un contraste.

Pregunta 1 [B] — Variable y regresor

En el modelo lprice sobre rooms y lnox, ¿cuántas variables explicativas y cuántos regresores hay?

  1. Dos variables explicativas y dos regresores.
  2. Dos variables explicativas (rooms y nox) y tres regresores (la constante, rooms y \(\log(\text{nox})\)).
  3. Tres variables explicativas y tres regresores.
  4. Una variable explicativa, porque rooms entra sin transformar.

Pregunta 2 [M] — Lineal en qué

¿Cuál de estos modelos NO puede estimarse con mínimos cuadrados tal como lo ha hecho el curso?

  1. \(\log y=\beta_1+\beta_2\log x+u\).
  2. \(y=\beta_1+\beta_2x+\beta_3x^2+u\).
  3. \(y=\beta_1+\beta_2\,x^{\beta_3}+u\).
  4. \(y=\beta_1+\beta_2\log x+u\).

Pregunta 3 [B] — La aproximación

Si \(\log y\) aumenta en \(0{,}04\), \(y\) aumenta aproximadamente:

  1. Un \(0{,}04\) %.
  2. Un \(4\) %.
  3. \(0{,}04\) unidades.
  4. \(4\) unidades.

Pregunta 4 [M] — Log-nivel

En lwage sobre educ, el coeficiente de educ es \(0{,}0827\). Un trabajador con tres años más de educación que otro tiene, según el modelo, un salario:

  1. \(0{,}25\) dólares por hora mayor.
  2. Un \(8{,}27\) % mayor.
  3. Un \(24{,}8\) % mayor según la aproximación y un \(28{,}2\) % mayor según el cálculo exacto.
  4. \(3\times0{,}0827\) dólares mayor.

Pregunta 5 [M] — Nivel-log

En price sobre rooms y lnox, el coeficiente de lnox es \(-10951\). Un barrio con un 10 % más de contaminación que otro, con las mismas habitaciones, tiene un precio mediano:

  1. \(10951\) dólares menor.
  2. Unos \(1095\) dólares menor.
  3. Un \(10{,}9\) % menor.
  4. \(109{,}5\) dólares menor.

Pregunta 6 [B] — Elasticidad

En el modelo de Wooldridge, el coeficiente de lnox es \(-0{,}954\). Significa que:

  1. Una unidad más de nox va con un precio \(0{,}954\) dólares menor.
  2. Un 1 % más de nox va con un precio un \(0{,}954\) % menor, con los demás regresores fijos.
  3. Un 1 % más de nox va con un precio \(0{,}954\) dólares menor.
  4. Una unidad más de nox va con un precio un \(95{,}4\) % menor.

Pregunta 7 [D] — La elasticidad en el modelo en niveles

Con price sobre nox (regresión simple), la elasticidad calculada en un barrio con nox \(3{,}9\) es \(-0{,}47\), y en uno con nox \(8{,}7\), \(-2{,}5\). ¿Qué dice eso?

  1. Que el modelo en niveles está mal especificado, porque la elasticidad debería ser constante.
  2. Que el modelo en niveles impone un efecto absoluto constante, y por tanto una elasticidad que crece con \(x\) y decrece con \(\hat y\); el modelo log-log impone lo contrario. Cuál de los dos describe mejor la relación no lo dice el ajuste, que es casi igual en los dos.
  3. Que la elasticidad verdadera está entre \(-0{,}47\) y \(-2{,}5\).
  4. Que hay colinealidad entre nox y su logaritmo.

Pregunta 8 [M] — Cobb–Douglas

En \(\log Q=\beta_1+\alpha\log L+\gamma\log K+u\) se estima \(\hat\alpha=0{,}805\) y \(\hat\gamma=0{,}245\). Si trabajo y capital aumentan los dos un 1 %, el producto aumenta aproximadamente:

  1. Un \(0{,}805\) %.
  2. Un \(1{,}05\) %.
  3. \(1{,}05\) unidades.
  4. Un \(0{,}245\) %.

Pregunta 9 [D] — Qué hipótesis contrastar

Con el modelo de Wooldridge, \(\hat\beta_{\text{lnox}}=-0{,}954\) y \(\mathrm{ee}=0{,}117\). ¿Cuál de estas afirmaciones es correcta?

  1. \(H_0\!:\beta_{\text{lnox}}=0\) se rechaza y por tanto la elasticidad es \(-1\).
  2. \(H_0\!:\beta_{\text{lnox}}=-1\) no se rechaza (\(t=0{,}40\)), luego queda demostrado que la elasticidad es unitaria.
  3. \(H_0\!:\beta_{\text{lnox}}=0\) se rechaza (\(t=-8{,}2\)) y \(H_0\!:\beta_{\text{lnox}}=-1\) no se rechaza (\(t=0{,}40\)); datos como estos no serían raros con elasticidad unitaria, pero el intervalo, de \(-1{,}18\) a \(-0{,}72\), deja un margen amplio.
  4. Las dos hipótesis se contrastan con el mismo estadístico \(t\), así que no puede rechazarse una y no la otra.

Pregunta 10 [D] — Deshacer el logaritmo

Un modelo con \(\log y\) como regresando da \(\hat y=9{,}846\) para unas características. ¿Por qué \(e^{9{,}846}\) no es la previsión de la media de \(y\) para esas características?

  1. Porque \(e^{\hat y}\) predice la mediana: con perturbación simétrica, la mitad de las observaciones queda por encima de \(e^{\boldsymbol x^\top\boldsymbol\beta}\), pero la media de \(e^{u}\) es mayor que \(1\) y la media de \(y\) queda por encima.
  2. Porque el logaritmo no se puede deshacer una vez estimado el modelo.
  3. Porque \(\hat y\) es insesgado solo en logaritmos, y \(e^{\hat y}\) sobreestima la media.
  4. Porque falta multiplicar por \(\mathfrak s^2\).

Pregunta 11 [M] — Comparar ajustes

wage sobre educ tiene \(R^2=0{,}165\) y lwage sobre educ, \(R^2=0{,}186\). ¿Qué se puede concluir?

  1. Que el modelo en logaritmos predice mejor el salario.
  2. Nada sobre cuál predice mejor el salario: los dos \(R^2\) miden el ajuste a variables distintas. Para comparar hay que pasar las previsiones del modelo en logaritmos a dólares y medir, por ejemplo, el cuadrado de la correlación con wage.
  3. Que el modelo en logaritmos tiene menos ruido, porque \(\mathfrak s\) es menor.
  4. Que la diferencia de \(0{,}021\) es significativa al 5 %.

Pregunta 12 [M] — Unidades

En lprice sobre rooms y lnox se cambia el precio de dólares a miles de dólares. ¿Qué cambia en la estimación?

  1. Todos los coeficientes se dividen por mil.
  2. Solo la constante, que disminuye en \(\log(1000)=6{,}908\); pendientes, \(R^2\), \(\mathfrak s\) y contrastes quedan iguales.
  3. La elasticidad se divide por mil y la constante no cambia.
  4. Nada, porque mínimos cuadrados no depende de las unidades.

12. Respuestas   htmlonly

Autor: Marcos Bujosa

Created: 2026-10-05 lun 18:55

Validate