Author: Marcos Bujosa
La indicadora de un suceso, ${\mathsf{1}\mkern-3.5mu\mathsf{l}}_A$ de la lección 12, entra hoy en el modelo como un regresor más: el suceso es pertenecer a un grupo. Su coeficiente es una diferencia entre grupos, en unidades del regresando o porcentual si está en logaritmos. Dos indicadoras complementarias suman la constante, y de ahí la trampa de las variables ficticias. Una interacción permite que una pendiente cambie de grupo, y el contraste de Chow pregunta si los parámetros $\beta$ del modelo son iguales en dos muestras distintas.
``El coeficiente de una indicadora no es un efecto por unidad: es un salto entre grupos.''
La lección 12 definió la indicadora de un suceso $A$: ${\mathsf{1}\mkern-3.5mu\mathsf{l}}_A(\omega)=1$ si $\omega\in A$ y $0$ si no; su esperanza es $\mathrm P(A)$, y la constante es la indicadora del suceso seguro, $\mathit 1={\mathsf{1}\mkern-3.5mu\mathsf{l}}_\Omega$.
Hoy el suceso es pertenecer a un grupo: ser mujer, que el barrio limite con el río Charles. Su indicadora es un regresor más del modelo de la lección 10:
$$\log(\text{wage})=\beta_1\,\mathit 1+\beta_2\,{\mathsf{1}\mkern-3.5mu\mathsf{l}}_{\text{mujer}}+\beta_3\,\text{educ}+\cdots+U.$$
En la muestra, la columna $\boldsymbol d_{\text{mujer}}$ de ceros y unos, como $\boldsymbol x_j$ es la columna de los $n$ valores de $X_j$. En los ficheros: female, chas.
Se llama también variable dicotómica, binaria, ficticia o dummy. Mínimos cuadrados no la distingue de otra columna; lo que cambia es la lectura de $\beta_2$.
Hoy: qué dice el coeficiente de una indicadora, en niveles y en logaritmos; qué ocurre con dos indicadoras complementarias; cómo una interacción cambia una pendiente. Geometría nueva: solo una observación sobre dos indicadoras ortogonales.
Boston original ($506$ barrios; medv, precio mediano en miles de dólares; chas, $1$ en los $35$ barrios que limitan con el río Charles): $\widehat{\text{medv}}=22{,}09+6{,}35\,\text{chas}$, con $\mathrm{ee}(\hat\beta_2)=1{,}59$ y $t=4{,}00$. Dos valores ajustados, $22{,}09$ sin río y $22{,}09+6{,}35=28{,}44$ junto al río: las medias de cada grupo, y el coeficiente es su diferencia.

La geometría: $\boldsymbol d_{\text{no río}}=\boldsymbol 1-\boldsymbol d_{\text{río}}$, así que $\mathcal L(\boldsymbol 1,\boldsymbol d_{\text{río}})=\mathcal L(\boldsymbol d_{\text{río}},\boldsymbol d_{\text{no río}})$: el mismo subespacio con otra base.
Las dos indicadoras son ortogonales, $\langle\boldsymbol d_{\text{río}},\boldsymbol d_{\text{no río}}\rangle_s=0$, porque ningún barrio está en los dos grupos. Como en la familia ortogonal de la lección 10, cada coeficiente se calcula por separado con la fórmula de la proyección sobre un generador, $\langle\boldsymbol y,\boldsymbol d\rangle_s/\langle\boldsymbol d,\boldsymbol d\rangle_s$, que aquí es la media de su grupo: $$\boldsymbol{\mathop{\widehat y}}=28{,}44\,\boldsymbol d_{\text{río}}+22{,}09\,\boldsymbol d_{\text{no río}}=22{,}09\,\boldsymbol 1+6{,}35\,\boldsymbol d_{\text{río}}.$$
Con más regresores, medv sobre rm y chas: el coeficiente de chas pasa a $4{,}08$ ($\mathrm{ee}$ $1{,}15$). Ya no es una diferencia de medias, sino la diferencia entre barrios con el mismo número de habitaciones.
wage1 ($526$ trabajadores, salario por hora en dólares de 1976; $274$ hombres y $252$ mujeres). Medias: $7{,}10$ dólares los hombres, $4{,}59$ las mujeres. wage sobre la constante y female: coeficiente $-2{,}51$, la diferencia de medias.
wage sobre… |
coef. | $\mathrm{ee}$ | $t$ |
|---|---|---|---|
| constante | $-1{,}568$ | $0{,}725$ | $-2{,}16$ |
female |
$-1{,}811$ | $0{,}265$ | $-6{,}84$ |
educ |
$0{,}572$ | $0{,}049$ | $11{,}58$ |
exper |
$0{,}025$ | $0{,}012$ | $2{,}20$ |
tenure |
$0{,}141$ | $0{,}021$ | $6{,}66$ |
Lectura: entre un hombre y una mujer con la misma educación, experiencia y antigüedad, el salario de la mujer es $1{,}81$ dólares por hora menor, en promedio. De la diferencia bruta de $2{,}51$, los $0{,}70$ restantes corresponden a diferencias en esas tres variables (antigüedad media: $6{,}5$ años los hombres, $3{,}6$ las mujeres).
``Lo demás fijo'' solo cubre lo que está en el modelo.
El mismo modelo con el logaritmo del salario (lwage) como regresando:
lwage sobre… |
coef. | $\mathrm{ee}$ | $t$ |
|---|---|---|---|
| constante | $0{,}501$ | $0{,}102$ | $4{,}92$ |
female |
$-0{,}301$ | $0{,}037$ | $-8{,}09$ |
educ |
$0{,}0875$ | $0{,}0069$ | $12{,}60$ |
exper |
$0{,}0046$ | $0{,}0016$ | $2{,}85$ |
tenure |
$0{,}0174$ | $0{,}0030$ | $5{,}84$ |
Aproximación (lección 15): con lo demás fijo, el salario de una mujer es menor en la fracción $0{,}30$, un $30$ %. Cálculo exacto: $e^{-0{,}301}-1=-0{,}260$, un $26$ % menor; para un cambio grande, la aproximación se queda lejos. Intervalo al 95 %: $\beta_{\text{female}}\in[-0{,}374,\,-0{,}228]$, del $-31$ % al $-20$ % en diferencia exacta.
La lectura depende de la base: un hombre respecto de una mujer comparable cobra más en $e^{0{,}301}-1=0{,}351$, un $35$ %. El mismo coeficiente, dos porcentajes, porque las bases son distintas.
La indicadora de ser hombre es ${\mathsf{1}\mkern-3.5mu\mathsf{l}}_{\text{hombre}}=\mathit 1-{\mathsf{1}\mkern-3.5mu\mathsf{l}}_{\text{mujer}}$: las dos suman la indicadora del suceso seguro, ${\mathsf{1}\mkern-3.5mu\mathsf{l}}_{\text{mujer}}+{\mathsf{1}\mkern-3.5mu\mathsf{l}}_{\text{hombre}}={\mathsf{1}\mkern-3.5mu\mathsf{l}}_\Omega=\mathit 1$. En la muestra, $\boldsymbol d_{\text{mujer}}+\boldsymbol d_{\text{hombre}}=\boldsymbol 1$.
Poner las tres columnas en $\boldsymbol{\mathsf X}$ es la colinealidad exacta de la lección 10: tres columnas que generan un subespacio de dimensión dos. Gretl avisa: «Omitidas debido a colinealidad exacta: =male=».
Tres escrituras del mismo modelo, lwage sobre el sexo (sin otros regresores):
| Regresores | Coeficientes | Lectura |
|---|---|---|
constante, female |
$1{,}814$; $-0{,}397$ | media de los hombres; diferencia mujeres $-$ hombres |
constante, male |
$1{,}416$; $+0{,}397$ | media de las mujeres; diferencia hombres $-$ mujeres |
female, male |
$1{,}416$; $1{,}814$ | media de cada grupo |
El mismo subespacio y el mismo ajuste ($\mathrm{SRC}=127{,}6$) con otra base: cambia la categoría base de la lectura. En la tercera, $\boldsymbol 1$ no es columna, pero está en el subespacio (lección 10).
Sexo y estado civil definen cuatro grupos excluyentes en wage1: $86$ hombres solteros, $188$ casados, $120$ mujeres solteras y $132$ casadas. Cuatro indicadoras que suman $\boldsymbol 1$: con la constante entran tres. Base: hombres solteros.
lwage sobre… |
coef. | $\mathrm{ee}$ | $t$ | $e^{\beta}-1$ |
|---|---|---|---|---|
| hombre casado | $0{,}292$ | $0{,}055$ | $5{,}27$ | $+34$ % |
| mujer casada | $-0{,}120$ | $0{,}058$ | $-2{,}07$ | $-11$ % |
| mujer soltera | $-0{,}097$ | $0{,}058$ | $-1{,}68$ | $-9$ % |
educ, exper, tenure |
$0{,}0835$; $0{,}0032$; $0{,}0157$ |
Lectura: con lo demás fijo, un hombre casado cobra un $34$ % más que un hombre soltero; una mujer casada, un $11$ % menos; una mujer soltera, un $9$ % menos.
Comparar dos grupos que no son la base: mujeres casadas frente a solteras, $-0{,}120-(-0{,}097)=-0{,}024$. Su $\mathrm{ee}$ se obtiene cambiando la base a mujeres solteras: $-0{,}024$ con $\mathrm{ee}$ $0{,}053$ y $t=-0{,}45$. Datos como estos no serían raros si las dos cobrasen lo mismo.
Una indicadora desplaza el intercepto; su producto por otro regresor, la interacción, desplaza una pendiente:
$$\log(\text{wage})=\beta_1\,\mathit 1+\beta_2\,{\mathsf{1}\mkern-3.5mu\mathsf{l}}_{\text{mujer}}+\beta_3\,\text{educ}+\beta_4\,\text{exper}+\beta_5\,{\mathsf{1}\mkern-3.5mu\mathsf{l}}_{\text{mujer}}\cdot\text{exper}+\beta_6\,\text{tenure}+U.$$
Pendiente de exper: $\beta_4$ para los hombres, $\beta_4+\beta_5$ para las mujeres. Diferencia de interceptos: $\beta_2$.
lwage sobre… |
coef. | $\mathrm{ee}$ | $t$ |
|---|---|---|---|
female |
$-0{,}190$ | $0{,}059$ | $-3{,}25$ |
exper |
$0{,}0084$ | $0{,}0022$ | $3{,}76$ |
female*exper |
$-0{,}0067$ | $0{,}0027$ | $-2{,}44$ |
educ, tenure |
$0{,}0896$; $0{,}0158$ |
Lectura: un año más de experiencia se acompaña de un salario mayor en un $0{,}84$ % para los hombres y en un $0{,}17$ % para las mujeres. La diferencia entre sexos, en logaritmos, es $-0{,}19$ sin experiencia y crece $0{,}0067$ por año: $-0{,}26$ a los diez años y $-0{,}32$ a los veinte (del $17$ % al $23$ % y al $28$ % en diferencia exacta). Con $t=-2{,}44$, datos como estos serían raros si las dos pendientes fuesen iguales.

Una indicadora: dos rectas paralelas. Una indicadora y una interacción: dos rectas distintas. Sin ninguna de las dos: una sola recta para todos.
Si todos los coeficientes pueden diferir entre sexos, el modelo tiene la indicadora y una interacción por cada regresor; su ajuste es el de dos regresiones separadas, una por grupo. $H_0$: los coeficientes de la indicadora y de todas las interacciones valen cero, $q=4$ restricciones. Es el $F$ de la lección 13: $$F=\frac{(\mathrm{SRC}_r-\mathrm{SRC})/q}{\mathrm{SRC}/(n-k)},\qquad \mathrm{SRC}=\mathrm{SRC}_{\text{hombres}}+\mathrm{SRC}_{\text{mujeres}}.$$
lwage sobre educ, exper y tenure: modelo común, $\mathrm{SRC}_r=101{,}46$; hombres ($n=274$), $49{,}55$; mujeres ($n=252$), $39{,}04$. Así, $F=\dfrac{(101{,}46-88{,}58)/4}{88{,}58/518}=18{,}8$, frente a $F_c=2{,}39$ al 5 %.
Lectura: por dimensión, el cateto que ganan las cuatro columnas nuevas es $18{,}8$ veces más largo al cuadrado que el residuo; con una ecuación común rondaría $1$. Datos como estos serían muy raros si hombres y mujeres compartiesen la ecuación. El contraste dice que algo difiere, no qué: en el modelo con las ocho columnas ningún $t$ supera $2$, porque la indicadora y sus interacciones están casi alineadas (lección 14).
En Gretl, tras estimar el modelo común: chow female --dummy. El programa construye las interacciones, estima el modelo ampliado e imprime el $F$ con su valor $p$.
Casos particulares: con $q=1$, solo el intercepto, el $F$ es el $t$ de female al cuadrado, $8{,}09^2=65{,}4$. Con --limit-to=lista solo se interaccionan los regresores de la lista. Para dejar libre el intercepto y contrastar solo las pendientes, restrict sobre las tres interacciones: $F(3,518)=3{,}05$, valor $p$ $0{,}029$.
El uso original: datos ordenados en el tiempo y la pregunta de si la relación cambia a partir de una fecha, un cambio estructural; los dos grupos son el antes y el después (chow 1982 con una serie anual).
| Modelo | El coeficiente $\beta$ de la indicadora es… | Lectura, con lo demás fijo |
|---|---|---|
| $y$ en niveles | diferencia de interceptos | el grupo señalado difiere en $\beta$ unidades de $y$ |
| $\log y$ | diferencia en logaritmos | difiere en la fracción $e^{\beta}-1$ (aproximación $\beta$); la base importa |
| varias categorías | diferencia con la categoría base | para comparar dos grupos no base, cambiar la base |
| interacción con $x$ | diferencia de pendientes | el efecto de $x$ en el grupo señalado es $\beta_x+\beta$ |
Lo que no dice. No hay ``una unidad más'' de una indicadora: es un salto entre grupos. Cuál de los dos grupos vale $1$ es una decisión de quien codifica: cambiarla cambia el signo y la base, no el ajuste. Una indicadora nunca se transforma: $\log 0$ no existe (lección 15).
``Lo demás fijo'' es lo que está en el modelo. El $26$ % entre sexos es una diferencia entre trabajadores con igual educación, experiencia y antigüedad observadas, no una medida de discriminación.
| Pieza | Fórmula | Lectura |
|---|---|---|
| Indicadora como regresor | ${\mathsf{1}\mkern-3.5mu\mathsf{l}}_A$ en la población, $\boldsymbol d$ en la muestra | su coeficiente es un salto entre grupos |
| Dos grupos complementarios | ${\mathsf{1}\mkern-3.5mu\mathsf{l}}_A+{\mathsf{1}\mkern-3.5mu\mathsf{l}}_{A^c}=\mathit 1$; $\boldsymbol d_A+\boldsymbol d_{A^c}=\boldsymbol 1$ | ortogonales: coeficientes = medias; con $\boldsymbol 1$, trampa |
| Log-nivel | $e^{\beta}-1$ | diferencia porcentual exacta respecto de la base |
| Interacción | pendiente del grupo señalado: $\beta_4+\beta_5$ en el ejemplo de exper |
la pendiente común más la diferencia de pendientes |
| Contraste de Chow | $F$ de la lección 13 con $\mathrm{SRC}=\mathrm{SRC}_{\text{grupo 1}}+\mathrm{SRC}_{\text{grupo 2}}$ | ¿la misma ecuación en los dos grupos? |
Geometría nueva: solo la ortogonalidad de dos indicadoras complementarias. Nada enunciado sin demostrar. Lección 17: los residuos de wage tienen desviación típica $3{,}42$ entre los hombres y $2{,}32$ entre las mujeres; con lwage, $0{,}43$ y $0{,}40$. Una varianza que cambia con el grupo es heterocedasticidad.