Lección 3. El lenguaje geométrico del curso (parte II)

Índice

Ángulo, ortogonalidad y teorema de Pitágoras en \(\mathbb{R}^n\).

``La ortogonalidad es la piedra angular de la regresión.''

1. De dónde venimos y qué añadimos hoy

  • En la lección 2: vectores, producto escalar, norma —justificada con Pitágoras en \(\mathbb{R}^2\) y \(\mathbb{R}^3\) (dado por conocido).
  • Hoy añadimos la otra magnitud geométrica: el ángulo.
  • Y su caso estrella para nosotros: la ortogonalidad (ángulo recto).
  • Programa:
    1. El coseno del ángulo: \(\cos\theta = \frac{\langle\boldsymbol{a},\boldsymbol{b}\rangle}{\|\boldsymbol{a}\|\|\boldsymbol{b}\|}\).
    2. Ortogonalidad: \(\langle\boldsymbol{a},\boldsymbol{b}\rangle = 0\).
    3. Teorema de Pitágoras en \(\mathbb{R}^n\) —demostración seria; con rigor y sin dibujo.
    4. Cauchy–Schwarz: lo que legitima la fórmula del coseno en \(\mathbb{R}^n\).
    5. El ángulo, ya con todo rigor; y la desigualdad triangular.

De dónde venimos y qué añadimos hoy

En la lección 2, se definieron los vectores en \(\mathbb{R}^n\) como listas ordenadas de números reales y se presentaron sus operaciones básicas: suma y multiplicación por escalares. Además, se introdujeron el producto escalar \(\langle\boldsymbol{x},\,\boldsymbol{y}\rangle\) y la norma \(\|\boldsymbol{x}\| = \sqrt{\langle\boldsymbol{x},\,\boldsymbol{x}\rangle}\); así como su particularización al caso usual en el espacio euclídeo \(\mathbb{R}^n\): el producto \(\langle\boldsymbol{x},\,\boldsymbol{y}\rangle_e = \boldsymbol{x}\cdot\boldsymbol{y} = \sum_i x_i y_i\) y la norma \(\|\boldsymbol{x}\|_e = \sqrt{{\langle\boldsymbol{x},\,\boldsymbol{x}\rangle}_e}=\sqrt{\sum_i x_i^2}\). Se explicó que esta última mide la ``longitud'' de un vector; su justificación en \(\mathbb{R}^2\) y \(\mathbb{R}^3\) se basa en el teorema de Pitágoras (dado por conocido), extendiéndose por analogía a \(\mathbb{R}^n\).

Hoy añadimos la otra magnitud geométrica fundamental: el ángulo entre dos vectores. Y con el ángulo aparece su caso particular más importante para el curso, la ortogonalidad (ángulo recto), que es la piedra angular de toda la regresión. Además, la ortogonalidad nos permitirá por fin demostrar el teorema de Pitágoras en \(\mathbb{R}^n\) —la primera demostración seria del curso, imposible en la lección 2 porque requería precisamente este concepto—. Cerraremos con un par de desigualdades (Cauchy–Schwarz y la triangular) que completan el aparato geométrico y dan sentido a la distancia entre vectores.

Todo el contenido de esta lección está desarrollado, con más detalle y figuras, en el capítulo 11 de mi Curso de Álgebra Lineal: libro online. Le remitiré a él en los puntos donde convenga ver los detalles completos.

2. El coseno mide la abertura del ángulo

CosenoCirculoRadioUnidad_fila.png

  • \(\cos\theta = 1\): ángulo nulo (misma dirección y sentido).
  • \(\cos\theta = 0\): ángulo recto.
  • \(\cos\theta = -1\): ángulo de \(180^o\) (sentidos opuestos).
  • El coseno decrece de \(1\) a \(-1\) a medida que el ángulo se abre.

¿Cómo medimos el ángulo entre dos vectores a partir de sus componentes?

La respuesta es una de las fórmulas más bellas y útiles del curso: \[ \cos\theta = \frac{\langle\boldsymbol{a}, \boldsymbol{b}\rangle}{\|\boldsymbol{a}\|\,\|\boldsymbol{b}\|}. \]

Caso unitario (\(\|\boldsymbol{a}\| = \|\boldsymbol{b}\| = 1\)): aplicando Pitágoras en los dos triángulos rectángulos:

Triangulo_fila.png

\[ x^2 + h^2 = 1 \quad\text{ y }\quad (1-x)^2 + h^2 = c^2 \quad\implies\quad x = \frac{2-c^2}{2}. \] Y como \(c^2 = \|\boldsymbol{a}-\boldsymbol{b}\|^2 = 2 - 2\,\langle\boldsymbol{a}\,,\boldsymbol{b}\rangle\): \(\quad\cos\theta = x = \langle\boldsymbol{a}\,,\boldsymbol{b}\rangle\).

Caso general: normalizando \(\boldsymbol{a}\) y \(\boldsymbol{b}\) tenemos: \( \quad \boxed{\;\cos\theta = \Big\langle\frac{\boldsymbol{a}}{\|\boldsymbol{a}\|},\,\frac{\boldsymbol{b}}{\|\boldsymbol{b}\|}\Big\rangle = \dfrac{\langle\boldsymbol{a}\,,\boldsymbol{b}\rangle}{\|\boldsymbol{a}\|\,\|\boldsymbol{b}\|}\;} \)

¡La fórmula es consecuencia de T. de Pitágoras!

Cálculo del coseno del ángulo entre dos vectores

El coseno es una función que mide el grado de abertura de un ángulo: vale \(1\) cuando el ángulo es nulo (vectores que apuntan en la misma dirección), \(0\) cuando el ángulo es recto (vectores perpendiculares) y \(-1\) cuando el ángulo es de 180° (vectores opuestos).

El coseno del ángulo entre dos vectores \(\boldsymbol{a}\) y \(\boldsymbol{b}\) se puede calcular a partir de la siguiente fórmula: \[ \cos\theta = \frac{\langle\boldsymbol{a}\,,\boldsymbol{b}\rangle}{\|\boldsymbol{a}\|\,\|\boldsymbol{b}\|}. \] Para deducir la fórmula, formamos un triángulo con dos vectores \(\boldsymbol{a}\) y \(\boldsymbol{b}\) y dividimos el problema con Pitágoras.

Caso unitario (cuando \(\|\boldsymbol{a}\| = \|\boldsymbol{b}\| = 1\)). Sea \(x\) la longitud de la proyección de \(\boldsymbol{b}\) sobre la dirección de \(\boldsymbol{a}\) (la longitud del segmento \(X\) de la figura de la derecha). Por definición de coseno en el triángulo rectángulo, \(\cos\theta = x\). Llamando \(h\) a la altura del segmento \(H\) y \(c\) a la longitud del lado opuesto del triángulo (es decir, a la longitud del segmento \(C\), que coincide con la norma del vector diferencia: \(c = \|\boldsymbol{b}-\boldsymbol{a}\|\)); aplicando Pitágoras en los dos triángulos rectángulos obtenemos las ecuaciones: \[ x^2 + h^2 = 1, \qquad (1-x)^2 + h^2 = c^2. \] Restando la primera de la segunda: \[ (1 - 2x + x^2) - x^2 = c^2 - 1 \;\Longrightarrow\; 2 - 2x = c^2 \;\Longrightarrow\; x = \frac{2 - c^2}{2}. \] Ahora desarrollamos \(c^2\) con las propiedades del producto escalar: \[ c^2 = \|\boldsymbol{a}-\boldsymbol{b}\|^2 = \langle\boldsymbol{a}\,,\boldsymbol{a}\rangle - 2\langle\boldsymbol{a}\,,\boldsymbol{b}\rangle + \langle\boldsymbol{b}\,,\boldsymbol{b}\rangle = 2 - 2\langle\boldsymbol{a}\,,\boldsymbol{b}\rangle, \] donde hemos usado \(\|\boldsymbol{a}\| = \|\boldsymbol{b}\| = 1\). Sustituyendo: \[ \cos\theta = x = \frac{2 - (2 - 2\langle\boldsymbol{a}\,,\boldsymbol{b}\rangle)}{2} = \langle\boldsymbol{a}\,,\boldsymbol{b}\rangle. \] Es decir, para vectores unitarios, el coseno del ángulo es directamente su producto escalar.

Caso general (vectores no nulos cualesquiera). Basta normalizar: los vectores \(\frac{\boldsymbol{a}}{\|\boldsymbol{a}\|}\) y \(\frac{\boldsymbol{b}}{\|\boldsymbol{b}\|}\) son unitarios, así que \[ \cos\theta = \Big\langle\frac{\boldsymbol{a}}{\|\boldsymbol{a}\|},\,\frac{\boldsymbol{b}}{\|\boldsymbol{b}\|}\Big\rangle = \frac{\langle\boldsymbol{a},\,\boldsymbol{b}\rangle}{\|\boldsymbol{a}\|\,\|\boldsymbol{b}\|}. \]

Esta demostración está sacada del capítulo 11 del libro. Lo importante es que la fórmula no sale de la nada: es consecuencia del Teorema de Pitágoras.

Para profundizar:

  • Bujosa, M. Curso de Álgebra Lineal, capítulo 11, sección ``Ángulo formado por dos vectores'': libro online.
  • Vídeo: Dot products and duality de 3Blue1Brown (capítulo 9 de Essence of Linear Algebra).

3. Ortogonalidad en \(\mathbb{R}^n\)

El ángulo es recto cuando \(\cos\theta = 0\), es decir, cuando el numerador \(\langle\boldsymbol{a},\,\boldsymbol{b}\rangle\) se anula:

Definición. \(\boldsymbol{a}, \boldsymbol{b} \in \mathbb{R}^n\) son ortogonales (perpendiculares) si \[ \langle\boldsymbol{a},\,\boldsymbol{b}\rangle = 0. \]

Entonces se escribe: \(\quad\boldsymbol{a}\perp\boldsymbol{b}\).

  • El vector \(\boldsymbol{0}\) es ortogonal a todos los vectores.
  • La ortogonalidad es una noción central del curso: en la regresión, el residuo (datos menos ajuste) será ortogonal a los regresores (los vectores con que se construye el ajuste).

Ortogonalidad en \(\mathbb{R}^n\)

De la fórmula del coseno extraemos el caso particular más importante del curso. El ángulo es recto cuando \(\cos\theta = 0\), y como \(\cos\theta = \frac{\langle\boldsymbol{a},\,\boldsymbol{b}\rangle}{\|\boldsymbol{a}\|\|\boldsymbol{b}\|}\), esto ocurre exactamente cuando el numerador se anula. Esto sugiere la definición:

Definición. Dos vectores \(\boldsymbol{a}, \boldsymbol{b} \in \mathbb{R}^n\) son ortogonales (o perpendiculares; usaremos ambos términos indistintamente, aunque preferiremos "ortogonal") cuando \(\langle\boldsymbol{a},\,\boldsymbol{b}\rangle = 0\). Se escribe \(\boldsymbol{a}\perp\boldsymbol{b}\).

Obsérvese una consecuencia inmediata: el vector \(\boldsymbol{0}\) es ortogonal a todos los vectores, incluido él mismo, porque \(\langle\boldsymbol{0},\,\boldsymbol{b}\rangle = 0\) siempre.

La ortogonalidad es la noción que vertebra el curso. Cuando lleguemos a la regresión, la condición que define el ajuste por mínimos cuadrados será precisamente una condición de ortogonalidad: el vector de residuos1 será ortogonal a los regresores.2 Por eso conviene fijar bien esta definición ahora.

Para profundizar:

  • Bujosa, M. Curso de Álgebra Lineal, capítulo 11, sección "Generalizando al espacio euclídeo \(\mathbb{R}^n\)": libro online.

4. Teorema de Pitágoras en \(\mathbb{R}^n\)

Teorema: \( \quad \boldsymbol{x}\perp\boldsymbol{y} \;\iff\; \|\boldsymbol{x}+\boldsymbol{y}\|^2 = \|\boldsymbol{x}\|^2 + \|\boldsymbol{y}\|^2. \)

Demostración:

\begin{multline*} \|\boldsymbol{x}+\boldsymbol{y}\|^2 = \big\langle(\boldsymbol{x}+\boldsymbol{y}),\,(\boldsymbol{x}+\boldsymbol{y})\big\rangle = \langle\boldsymbol{x},\,\boldsymbol{x}\rangle + 2 \langle\boldsymbol{x},\,\boldsymbol{y}\rangle + \langle\boldsymbol{y},\,\boldsymbol{y}\rangle \\ = \|\boldsymbol{x}\|^2 + 2\langle\boldsymbol{x},\,\boldsymbol{y}\rangle + \|\boldsymbol{y}\|^2. \end{multline*}

La igualdad pitagórica se cumple \(\;\Leftrightarrow\;\) el término central \(2\langle\boldsymbol{x},\,\boldsymbol{y}\rangle = 0 \;\Leftrightarrow\; \boldsymbol{x}\perp\boldsymbol{y}\). \(\blacksquare\)

El cuadrado del binomio vectorial: \[\|\boldsymbol{x}+\boldsymbol{y}\|^2 = \|\boldsymbol{x}\|^2 + 2\langle\boldsymbol{x},\,\boldsymbol{y}\rangle + \|\boldsymbol{y}\|^2\] aparecerá más veces en el curso.

Teorema de Pitágoras en \(\mathbb{R}^n\)

Esta es la primera demostración seria del curso. Conviene seguirla paso a paso, porque ilustra cómo las propiedades del producto escalar (simetría, linealidad) se usan para demostrar resultados geométricos.

En la lección 2 justificamos —con Pitágoras clásico en \(\mathbb{R}^2\) y \(\mathbb{R}^3\)— que la norma mide la longitud. Ahora, con la noción de ortogonalidad que acabamos de definir, podemos ir más lejos: demostrar el teorema en \(\mathbb{R}^n\) sin recurrir a ningún dibujo.

Teorema (Pitágoras en \(\mathbb{R}^n\)). Dos vectores \(\boldsymbol{x}, \boldsymbol{y} \in \mathbb{R}^n\) son ortogonales si y solo si \[ \|\boldsymbol{x} + \boldsymbol{y}\|^2 = \|\boldsymbol{x}\|^2 + \|\boldsymbol{y}\|^2. \]

Demostración. Partimos de la norma al cuadrado de la suma y la desarrollamos usando que \(\|\boldsymbol{v}\|^2 = \langle\boldsymbol{v},\,\boldsymbol{v}\rangle\) y la linealidad del producto escalar:

\begin{aligned} \|\boldsymbol{x}+\boldsymbol{y}\|^2 &= \big\langle(\boldsymbol{x}+\boldsymbol{y}),\,(\boldsymbol{x}+\boldsymbol{y})\big\rangle && \text{(definición de norma)}\\ &= \langle\boldsymbol{x},\,\boldsymbol{x}\rangle + \langle\boldsymbol{x},\,\boldsymbol{y}\rangle + \langle\boldsymbol{y},\,\boldsymbol{x}\rangle + \langle\boldsymbol{y},\,\boldsymbol{y}\rangle && \text{(linealidad en ambos argumentos)}\\ &= \langle\boldsymbol{x},\,\boldsymbol{x}\rangle + 2\langle\boldsymbol{x},\,\boldsymbol{y}\rangle + \langle\boldsymbol{y},\,\boldsymbol{y}\rangle && \text{(simetría: } \langle\boldsymbol{x},\,\boldsymbol{y}\rangle = \langle\boldsymbol{y},\,\boldsymbol{x}\rangle)\\ &= \|\boldsymbol{x}\|^2 + 2\langle\boldsymbol{x},\,\boldsymbol{y}\rangle + \|\boldsymbol{y}\|^2. && \text{(definición de norma)} \end{aligned}

De esta igualdad —que es válida siempre, sean o no ortogonales los vectores— se lee directamente el teorema: la igualdad \(\|\boldsymbol{x}+\boldsymbol{y}\|^2 = \|\boldsymbol{x}\|^2 + \|\boldsymbol{y}\|^2\) se cumple si y solo si el término central se anula, es decir, si y solo si \(\langle\boldsymbol{x},\,\boldsymbol{y}\rangle = 0\), esto es, si y solo si \(\boldsymbol{x}\perp\boldsymbol{y}\). \(\blacksquare\)

Aquí \(\boldsymbol{x}\) e \(\boldsymbol{y}\) son los catetos y \(\boldsymbol{x}+\boldsymbol{y}\) la hipotenusa. La igualdad intermedia \[ \|\boldsymbol{x}+\boldsymbol{y}\|^2 = \|\boldsymbol{x}\|^2 + 2\langle\boldsymbol{x},\,\boldsymbol{y}\rangle + \|\boldsymbol{y}\|^2 \] conviene recordarla por sí misma: es el análogo vectorial del cuadrado del binomio, y la usaremos repetidamente (en Cauchy–Schwarz, en la desigualdad triangular y en la descomposición de la varianza en la regresión).

Para profundizar:

  • Bujosa, M. Curso de Álgebra Lineal, capítulo 11, "Teorema de Pitágoras en \(\mathbb{R}^n\)": libro online.

5. Desigualdad de Cauchy–Schwarz

¿Qué asegura que \(\cos\theta = \frac{\langle\boldsymbol{a},\,\boldsymbol{b}\rangle}{\|\boldsymbol{a}\|\|\boldsymbol{b}\|} \in [-1,1]\) en \(\mathbb{R}^n\)?

Lo hace la desigualdad de Cauchy–Schwarz: \(\quad|\langle\boldsymbol{a},\,\boldsymbol{b}\rangle| \leq \|\boldsymbol{a}\|\,\|\boldsymbol{b}\|\).

ProyeccionOrtogonal1_ancho.png

Idea de la demostración: construir \(\boldsymbol{h} = \boldsymbol{b} - \alpha\boldsymbol{a}\) ortogonal a \(\boldsymbol{a}\): \[ \langle\boldsymbol{a},\,\boldsymbol{h}\rangle = 0 \;\Longrightarrow\; \boxed{\alpha = \frac{\langle\boldsymbol{a},\,\boldsymbol{b}\rangle}{\langle\boldsymbol{a},\,\boldsymbol{a}\rangle}}. \] Por Pitágoras, \(\|\boldsymbol{b}\|^2 = \|\boldsymbol{h}\|^2 + \alpha^2\|\boldsymbol{a}\|^2 \geq \alpha^2\|\boldsymbol{a}\|^2\), de donde sale la desigualdad.

  • Igualdad \(\Leftrightarrow\) vectores alineados;\(\quad\) ortogonales \(\Leftrightarrow\) \(\langle\boldsymbol{a},\,\boldsymbol{b}\rangle=0\).

Desigualdad de Cauchy–Schwarz

Hay un detalle que hemos pasado por alto. Hemos definido el coseno del ángulo en \(\mathbb{R}^n\) como \(\cos\theta = \frac{\langle\boldsymbol{a},\,\boldsymbol{b}\rangle}{\|\boldsymbol{a}\|\|\boldsymbol{b}\|}\). Pero un coseno solo puede tomar valores entre \(-1\) y \(1\). ¿Qué nos garantiza que ese cociente nunca se sale de ese intervalo en \(\mathbb{R}^n\)? La respuesta es un resultado clásico:

Proposición (desigualdad de Cauchy–Schwarz). Para todo \(\boldsymbol{a}, \boldsymbol{b} \in \mathbb{R}^n\) se cumple \[|\langle\boldsymbol{a},\,\boldsymbol{b}\rangle| \leq \|\boldsymbol{a}\|\,\|\boldsymbol{b}\|.\]

La demostración es bonita y siembra una idea que reaprovecharemos en la lección 4: la de descomponer un vector en dos partes; donde la primera está alineada con otro vector y la segunda es ortogonal a la primera.

Demostración (caso en que \(\boldsymbol{a}\) y \(\boldsymbol{b}\) son linealmente independientes, es decir, no están alineados). Construimos un vector \(\boldsymbol{h}\) que sea ortogonal a \(\boldsymbol{a}\) restando a \(\boldsymbol{b}\) un múltiplo adecuado de \(\boldsymbol{a}\): \[ \boldsymbol{h} = \boldsymbol{b} - \alpha\,\boldsymbol{a}. \] Es decir, elegimos \(\alpha\) para forzar la ortogonalidad \(\boldsymbol{a}\perp\boldsymbol{h}\): \[ 0 = \langle\boldsymbol{a},\,\boldsymbol{h}\rangle = \Big\langle\boldsymbol{a},\,(\boldsymbol{b}-\alpha\boldsymbol{a})\Big\rangle = \langle\boldsymbol{a},\,\boldsymbol{b}\rangle - \alpha\langle\boldsymbol{a},\,\boldsymbol{a}\rangle \implies \boxed{\alpha = \frac{\langle\boldsymbol{a},\,\boldsymbol{b}\rangle}{\langle\boldsymbol{a},\,\boldsymbol{a}\rangle}}. \]

Como \(\boldsymbol{b} = \boldsymbol{h} + \alpha\boldsymbol{a}\) con \(\boldsymbol{h}\perp\alpha\boldsymbol{a}\), aplicamos Pitágoras: \[ \|\boldsymbol{b}\|^2 = \|\boldsymbol{h}\|^2 + \alpha^2\|\boldsymbol{a}\|^2. \] Como \(\boldsymbol{a}\) y \(\boldsymbol{b}\) son linealmente independientes, \(\boldsymbol{h}\neq\boldsymbol{0}\), luego \(\|\boldsymbol{h}\|^2 > 0\) y por tanto \[ \|\boldsymbol{b}\|^2 > \alpha^2\|\boldsymbol{a}\|^2 = \frac{\langle\boldsymbol{a},\,\boldsymbol{b}\rangle^2}{\langle\boldsymbol{a},\,\boldsymbol{a}\rangle^2}\,\|\boldsymbol{a}\|^2 = \frac{\langle\boldsymbol{a},\,\boldsymbol{b}\rangle^2}{\Big(\|\boldsymbol{a}\|^2\Big)^2}\,\|\boldsymbol{a}\|^2 = \frac{\langle\boldsymbol{a},\,\boldsymbol{b}\rangle^2}{\|\boldsymbol{a}\|^2}. \] Multiplicando por \(\|\boldsymbol{a}\|^2\) obtenemos \(\|\boldsymbol{a}\|^2\|\boldsymbol{b}\|^2 > \langle\boldsymbol{a},\,\boldsymbol{b}\rangle^2\), y tomando raíces, \(\|\boldsymbol{a}\|\|\boldsymbol{b}\| > |\langle\boldsymbol{a},\,\boldsymbol{b}\rangle|\).

En un extremo tenemos \(\langle\boldsymbol{a},\,\boldsymbol{b}\rangle = 0\) cuando \(\boldsymbol{a}\perp\boldsymbol{b}\).

En el otro, si \(\boldsymbol{b}=\lambda\boldsymbol{a}\) (si ambos vectores están alineados) entonces \(\boldsymbol{h}=\boldsymbol{0}\), es decir, \(\|\boldsymbol{h}\|^2 = 0\); y entonces \(\|\boldsymbol{b}\|^2 = \alpha^2\|\boldsymbol{a}\|^2\). Consecuentemente \(|\langle\boldsymbol{a},\,\boldsymbol{b}\rangle| = \|\boldsymbol{a}\|\|\boldsymbol{b}\|\). Así, la desigualdad es estricta cuando los vectores no están alineados, y se convierte en igualdad cuando lo están. (Si \(\boldsymbol{a}=\boldsymbol{0}\) no hay nada que probar: ambos lados de la desigualdad valen \(0\). Ese caso queda fuera de la construcción anterior porque \(\alpha\) exige dividir por \(\langle\boldsymbol{a},\,\boldsymbol{a}\rangle\), que entonces se anula.)

Idea para recordar. El vector \(\alpha\boldsymbol{a}\), con \(\alpha = \frac{\langle\boldsymbol{a},\,\boldsymbol{b}\rangle}{\langle\boldsymbol{a},\,\boldsymbol{a}\rangle}\), es la ``sombra'' de \(\boldsymbol{b}\) sobre la dirección de \(\boldsymbol{a}\). En la lección 4 reconoceremos en esta construcción la proyección ortogonal, y ese \(\alpha\) resultará ser la media (cuando \(\boldsymbol{a}=\boldsymbol{1}\)); más adelante será también la pendiente de la regresión lineal simple (cuando \(\boldsymbol{a}\) son los datos centrados de la variable explicativa).

Para profundizar:

  • Bujosa, M. Curso de Álgebra Lineal, capítulo 11, "Desigualdad de Cauchy–Schwarz": libro online.
  • Para quien quiera otra demostración (la del parámetro \(t\)): cualquier manual de álgebra lineal; es la versión que considera \(\|\boldsymbol{b}-t\boldsymbol{a}\|^2 \geq 0\) como polinomio en \(t\).

6. Ángulo, alineación, normalización

Dado que se verifica Cauchy–Schwarz en \(\mathbb{R}^n\), es legítima la definición: \[ \cos\theta = \frac{\langle\boldsymbol{a},\,\boldsymbol{b}\rangle}{\|\boldsymbol{a}\|\,\|\boldsymbol{b}\|}, \qquad -1 \leq \cos\theta \leq 1. \]

  • Vector unitario: norma \(1\).
    • Un vector \(\boldsymbol{a}\), no nulo, se normaliza dividiendo por su longitud: \(\frac{1}{\|\boldsymbol{a}\|}\boldsymbol{a}\).
  • Vectores alineados (\(\boldsymbol{b} = \lambda\boldsymbol{a}\)): \(\cos\theta = \frac{\lambda}{|\lambda|} = \pm 1\).
    • Caso opuesto a la ortogonalidad.
    • Avance: regresores muy correlacionados \(\approx\) vectores casi alineados \(\rightarrow\) lo veremos en la lección 14, al hablar de colinealidad.

El ángulo en \(\mathbb{R}^n\), vectores alineados, normalización

Ahora que Cauchy–Schwarz nos garantiza que el cociente está en \([-1,1]\), podemos definir con todo rigor:

Definición. El coseno del ángulo \(\theta\) formado por dos vectores no nulos \(\boldsymbol{a}, \boldsymbol{b} \in \mathbb{R}^n\) es \[ \cos\theta = \frac{\langle\boldsymbol{a},\,\boldsymbol{b}\rangle}{\|\boldsymbol{a}\|\,\|\boldsymbol{b}\|}, \qquad -1 \leq \cos\theta \leq 1. \]

Dos conceptos auxiliares que reaparecerán:

  • Vector unitario: un vector de norma \(1\). Para obtener un vector unitario en la dirección de \(\boldsymbol{a}\neq\boldsymbol{0}\), se normaliza dividiéndolo por su longitud: \(\frac{1}{\|\boldsymbol{a}\|}\boldsymbol{a}\) tiene norma \(1\), porque \(\left\|\frac{1}{\|\boldsymbol{a}\|}\boldsymbol{a}\right\| = \frac{1}{\|\boldsymbol{a}\|}\|\boldsymbol{a}\| = 1\) (por la homogeneidad de la norma vista en la lección 2).

    Ejemplo: si \(\boldsymbol{x} = (1,1,1,1)\), entonces \(\|\boldsymbol{x}\|_e = \sqrt{4} = 2\), y el vector normalizado \(\frac{1}{2}\boldsymbol{x} = \left(\tfrac12, \tfrac12, \tfrac12, \tfrac12\right)\) es unitario.

  • Vectores alineados: cuando \(\boldsymbol{b} = \lambda\boldsymbol{a}\) con \(\lambda\neq 0\). En ese caso el ángulo es \(0\) (si \(\lambda > 0\), "apuntan" en el mismo sentido) o \(180^o\) (si \(\lambda < 0\)), porque \[ \cos\theta = \frac{\lambda\,\|\boldsymbol{a}\|^2}{|\lambda|\,\|\boldsymbol{a}\|^2} = \frac{\lambda}{|\lambda|} = \pm 1. \] Los vectores alineados son el caso opuesto a los ortogonales: máxima dependencia frente a máxima independencia direccional. Esta imagen será útil en la lección 14, cuando hablemos de colinealidad: dos regresores muy correlacionados son vectores casi alineados (ángulo pequeño, coseno cercano a \(\pm 1\)), y eso hará inestable la regresión.

Para profundizar:

  • Bujosa, M. Curso de Álgebra Lineal, capítulo 11, secciones sobre el coseno del ángulo y vectores alineados: libro online.

7. Desigualdad triangular y distancia

Desigualdad triangular (aplicación de Cauchy–Schwarz): \[ \|\boldsymbol{a}+\boldsymbol{b}\|^2 = \|\boldsymbol{a}\|^2 + 2\langle\boldsymbol{a},\,\boldsymbol{b}\rangle + \|\boldsymbol{b}\|^2 \leq \big(\|\boldsymbol{a}\| + \|\boldsymbol{b}\|\big)^2. \]

\[ \Longrightarrow \quad \|\boldsymbol{a}+\boldsymbol{b}\| \leq \|\boldsymbol{a}\| + \|\boldsymbol{b}\|. \]

Distancia entre vectores: \[ d(\boldsymbol{x}, \boldsymbol{y}) = \|\boldsymbol{x} - \boldsymbol{y}\|. \]

La desigualdad triangular y la distancia entre vectores

Como aplicación inmediata de Cauchy–Schwarz, demostramos un resultado intuitivo: el camino directo nunca es más largo que el indirecto.

Proposición (desigualdad triangular). Para todo \(\boldsymbol{a}, \boldsymbol{b} \in \mathbb{R}^n\), \[ \|\boldsymbol{a}+\boldsymbol{b}\| \leq \|\boldsymbol{a}\| + \|\boldsymbol{b}\|. \]

Demostración. Partimos del cuadrado del binomio vectorial (la identidad que destacamos en la sección 4):

\begin{aligned} \|\boldsymbol{a}+\boldsymbol{b}\|^2 &= \|\boldsymbol{a}\|^2 + 2\langle\boldsymbol{a},\,\boldsymbol{b}\rangle + \|\boldsymbol{b}\|^2 \\ &\leq \|\boldsymbol{a}\|^2 + 2\,\|\boldsymbol{a}\|\,\|\boldsymbol{b}\| + \|\boldsymbol{b}\|^2 && \text{(por Cauchy–Schwarz: } \langle\boldsymbol{a},\,\boldsymbol{b}\rangle \leq |\langle\boldsymbol{a},\,\boldsymbol{b}\rangle| \leq \|\boldsymbol{a}\|\|\boldsymbol{b}\|)\\ &= \big(\|\boldsymbol{a}\| + \|\boldsymbol{b}\|\big)^2. \end{aligned}

Tomando raíces cuadradas (pues ambos lados son no negativos), \(\|\boldsymbol{a}+\boldsymbol{b}\| \leq \|\boldsymbol{a}\| + \|\boldsymbol{b}\|\). \(\blacksquare\)

Esta desigualdad permite definir la distancia entre dos vectores como la longitud de su diferencia: \[ d(\boldsymbol{x}, \boldsymbol{y}) = \|\boldsymbol{x} - \boldsymbol{y}\|. \] Es simétrica (\(d(\boldsymbol{x},\boldsymbol{y}) = d(\boldsymbol{y},\boldsymbol{x})\), porque \(\|\boldsymbol{x}-\boldsymbol{y}\| = \|\boldsymbol{y}-\boldsymbol{x}\|\)), se anula solo cuando los vectores coinciden (\(d(\boldsymbol{x},\boldsymbol{y}) = 0 \Leftrightarrow \boldsymbol{x}=\boldsymbol{y}\)), y verifica su propia desigualdad triangular: \[ d(\boldsymbol{a},\boldsymbol{c}) = \|\boldsymbol{a}-\boldsymbol{c}\| = \|(\boldsymbol{a}-\boldsymbol{b}) + (\boldsymbol{b}-\boldsymbol{c})\| \leq \|\boldsymbol{a}-\boldsymbol{b}\| + \|\boldsymbol{b}-\boldsymbol{c}\| = d(\boldsymbol{a},\boldsymbol{b}) + d(\boldsymbol{b},\boldsymbol{c}). \]

Esta noción de distancia es, literalmente, el corazón de la regresión: en la lección 6 buscaremos el vector \(\boldsymbol{\mathop{\widehat{y}}}\) —de entre todos los de un subespacio— que minimiza la distancia \(\|\boldsymbol{y} - \boldsymbol{\mathop{\widehat{y}}}\|\) al vector de datos \(\boldsymbol{y}\). Ajustar por mínimos cuadrados será, exactamente, minimizar una distancia \(\|\boldsymbol{y}-\boldsymbol{\mathop{\widehat{y}}}\|\), donde \(\boldsymbol{\mathop{\widehat{y}}}\) es el vector ajustado (aún no definido formalmente; lo haremos en la lección 6).

Para profundizar:

  • Bujosa, M. Curso de Álgebra Lineal, capítulo 11, "Desigualdad triangular" y "distancia entre vectores": libro online.

8. Recapitulación y guiño a la lección 4

Concepto Fórmula matemática / definición algebráica
Coseno del ángulo \(\cos\theta = \frac{\langle\boldsymbol{a},\,\boldsymbol{b}\rangle}{\Vert \boldsymbol{a}\Vert \Vert\boldsymbol{b}\Vert}\)
Ortogonalidad \(\langle\boldsymbol{a},\,\boldsymbol{b}\rangle = 0\)
Pitágoras \(\boldsymbol{x}\perp\boldsymbol{y}\iff\mbox{\(\Vert\boldsymbol{x}+\boldsymbol{y}\Vert^2=\Vert\boldsymbol{x}\Vert^2+\Vert\boldsymbol{y}\Vert^2\)}\)
Cauchy–Schwarz \(\lvert\langle\boldsymbol{a},\,\boldsymbol{b}\rangle\rvert \leq \Vert\boldsymbol{a}\Vert \Vert\boldsymbol{b}\Vert\)
Distancia \(d(\boldsymbol{x},\boldsymbol{y}) = \Vert \boldsymbol{x}-\boldsymbol{y}\Vert\)

Hoy, \(\alpha=\frac{\langle\boldsymbol{a},\,\boldsymbol{b}\rangle}{\langle\boldsymbol{a},\,\boldsymbol{a}\rangle}\) fue un truco auxiliar; pero en la lección 4 será la proyección ortogonal que, con \(\boldsymbol{a}=\boldsymbol{1}\), dará lugar a la media aritmética.

Recapitulación y guiño a la lección 4

Lo esencial de hoy:

  1. La longitud, justificada en la lección 2 con Pitágoras clásico en \(\mathbb{R}^2\) y \(\mathbb{R}^3\), se extiende por analogía a \(\mathbb{R}^n\). Hoy hemos demostrado el teorema de Pitágoras en \(\mathbb{R}^n\) con rigor: \(\boldsymbol{x}\perp\boldsymbol{y} \Leftrightarrow \|\boldsymbol{x}+\boldsymbol{y}\|^2 = \|\boldsymbol{x}\|^2 + \|\boldsymbol{y}\|^2\).
  2. El coseno del ángulo es \(\cos\theta = \frac{\langle\boldsymbol{a},\,\boldsymbol{b}\rangle}{\|\boldsymbol{a}\|\|\boldsymbol{b}\|}\); se deduce en \(\mathbb{R}^2\) con Pitágoras y se extiende a \(\mathbb{R}^n\) como definición.
  3. Dos vectores son ortogonales cuando \(\langle\boldsymbol{a},\,\boldsymbol{b}\rangle = 0\). Esta noción es central en el curso.
  4. Teorema de Pitágoras en \(\mathbb{R}^n\): \(\boldsymbol{x}\perp\boldsymbol{y} \Leftrightarrow \|\boldsymbol{x}+\boldsymbol{y}\|^2 = \|\boldsymbol{x}\|^2 + \|\boldsymbol{y}\|^2\). Demostrado con las propiedades del producto escalar.
  5. Cauchy–Schwarz (\(|\langle\boldsymbol{a},\,\boldsymbol{b}\rangle| \leq \|\boldsymbol{a}\|\|\boldsymbol{b}\|\)) garantiza que el coseno está en \([-1,1]\). Su demostración construye la "sombra" (la proyección) \(\alpha\boldsymbol{a}\) de \(\boldsymbol{b}\) sobre \(\boldsymbol{a}\), con \(\alpha = \frac{\langle\boldsymbol{a},\,\boldsymbol{b}\rangle}{\langle\boldsymbol{a},\,\boldsymbol{a}\rangle}\).
  6. La desigualdad triangular da sentido a la distancia \(d(\boldsymbol{x},\boldsymbol{y}) = \|\boldsymbol{x}-\boldsymbol{y}\|\).

Guiño a la lección 4. Dos piezas de hoy son la semilla de toda la econometría que viene. Primero, la distancia: la regresión consistirá en encontrar el vector de un subespacio más cercano a los datos, es decir, en minimizar \(\|\boldsymbol{y}-\boldsymbol{\mathop{\widehat{y}}}\|\). Segundo, la construcción \(\boldsymbol{h} = \boldsymbol{b} - \alpha\boldsymbol{a}\) de la demostración de Cauchy–Schwarz: ese \(\alpha = \frac{\langle\boldsymbol{a},\,\boldsymbol{b}\rangle}{\langle\boldsymbol{a},\,\boldsymbol{a}\rangle}\), que hoy ha aparecido como truco auxiliar, resultará ser la proyección ortogonal. Cuando \(\boldsymbol{a} = \boldsymbol{1}\) (el vector de unos), \(\alpha\) será la media de los datos. No es casualidad: es el primer indicio de que la media, la regresión y la geometría son la misma cosa vista desde ángulos distintos.

9. Preguntas de repaso (sesión 3)   htmlonly

Te propongo 12 preguntas. Las marco con un nivel orientativo: [B] básica, [M] media, [D] discriminadora.

Comentario

Las preguntas más valiosas pedagógicamente son la 7 (el cuadrado del binomio vectorial como identidad general, no solo caso ortogonal: es el corazón de la demostración de Pitágoras en \(\mathbb{R}^n\) y reaparecerá en Cauchy–Schwarz, triangular y varianza), la 9 (obliga a calcular el producto escalar y conectarlo con Pitágoras, superando la tentación de comprobar normas), la 11 (fija la semilla de la proyección y de la media, anticipando la lección 4; hay que haberla seguido con atención) y la 12 (conecta la distancia con MCO, cerrando el círculo del guiño). Conviene comentar en clase la 11 y la 12, pues fijan la narrativa del curso.

Pregunta 1 [B] — Definición de ortogonalidad

Dos vectores \(\boldsymbol{a}, \boldsymbol{b} \in \mathbb{R}^n\) son ortogonales si y solo si:

  1. \(\|\boldsymbol{a}\| = \|\boldsymbol{b}\|\).
  2. \(\langle\boldsymbol{a}\,,\boldsymbol{b}\rangle = 1\).
  3. \(\langle\boldsymbol{a}\,,\boldsymbol{b}\rangle = 0\).
  4. \(\boldsymbol{a} + \boldsymbol{b} = \boldsymbol{0}\).

Pregunta 2 [B] — Coseno nulo

El coseno del ángulo entre dos vectores vale \(0\). ¿Qué significa eso geométricamente?

  1. Los vectores apuntan en el mismo sentido.
  2. Uno de los vectores tiene norma cero.
  3. Los vectores son paralelos.
  4. Los vectores son ortogonales (perpendiculares).

Pregunta 3 [B] — Enunciado del teorema de Pitágoras en \(\mathbb{R}^n\)

Si \(\boldsymbol{x} \perp \boldsymbol{y}\), el teorema de Pitágoras en \(\mathbb{R}^n\) afirma que:

  1. \(\|\boldsymbol{x} + \boldsymbol{y}\| = \|\boldsymbol{x}\| + \|\boldsymbol{y}\|\).
  2. \(\|\boldsymbol{x} + \boldsymbol{y}\|^2 = \|\boldsymbol{x}\|^2 + \|\boldsymbol{y}\|^2\).
  3. \(\|\boldsymbol{x} + \boldsymbol{y}\|^2 = (\|\boldsymbol{x}\| + \|\boldsymbol{y}\|)^2\).
  4. \(\langle\boldsymbol{x},\,\boldsymbol{y}\rangle = \|\boldsymbol{x}\|\|\boldsymbol{y}\|\).

Pregunta 4 [B] — Validez de la desigualdad triangular

La desigualdad triangular \(\|\boldsymbol{a}+\boldsymbol{b}\| \leq \|\boldsymbol{a}\| + \|\boldsymbol{b}\|\) es válida:

  1. Solo cuando \(\boldsymbol{a}\) y \(\boldsymbol{b}\) son ortogonales.
  2. Solo cuando \(\|\boldsymbol{a}\| = \|\boldsymbol{b}\|\).
  3. Solo en \(\mathbb{R}^2\) y \(\mathbb{R}^3\).
  4. Para cualesquiera \(\boldsymbol{a}, \boldsymbol{b} \in \mathbb{R}^n\).

Pregunta 5 [M] — Cálculo del coseno

Sean \(\boldsymbol{a} = (3, 0)\) y \(\boldsymbol{b} = (1, 1)\) en \(\mathbb{R}^2\). El coseno del ángulo entre ellos es:

  1. \(\dfrac{3}{\sqrt{2}}\).
  2. \(\dfrac{1}{\sqrt{2}}\).
  3. \(\dfrac{\sqrt{2}}{3}\).
  4. \(3\).

Pregunta 6 [M] — Normalización

El vector \(\boldsymbol{a} = (1, 1, 1, 1) \in \mathbb{R}^4\) normalizado en el espacio euclídeo usual (es decir, el vector unitario de su misma dirección) es:

  1. \((1, 1, 1, 1)\).
  2. \(\left(\dfrac{1}{\sqrt{2}}, \dfrac{1}{\sqrt{2}}, \dfrac{1}{\sqrt{2}}, \dfrac{1}{\sqrt{2}}\right)\).
  3. \(\left(\dfrac{1}{2}, \dfrac{1}{2}, \dfrac{1}{2}, \dfrac{1}{2}\right)\).
  4. \(\left(\dfrac{1}{4}, \dfrac{1}{4}, \dfrac{1}{4}, \dfrac{1}{4}\right)\).

Pregunta 7 [M] — El cuadrado del binomio vectorial

La identidad \(\|\boldsymbol{x}+\boldsymbol{y}\|^2 = \|\boldsymbol{x}\|^2 + 2\langle\boldsymbol{x},\,\boldsymbol{y}\rangle + \|\boldsymbol{y}\|^2\) es cierta:

  1. Solo si \(\boldsymbol{x} \perp \boldsymbol{y}\).
  2. Solo en \(\mathbb{R}^2\) o \(\mathbb{R}^3\).
  3. Siempre, para cualesquiera \(\boldsymbol{x}, \boldsymbol{y} \in \mathbb{R}^n\).
  4. Solo si \(\|\boldsymbol{x}\| = \|\boldsymbol{y}\|\).

Pregunta 8 [M] — Para qué sirve Cauchy–Schwarz

¿Cuál es el papel de la desigualdad de Cauchy–Schwarz en la definición del ángulo?

  1. Demuestra que la norma es siempre positiva.
  2. Garantiza que el cociente \(\frac{\langle\boldsymbol{a},\,\boldsymbol{b}\rangle}{\|\boldsymbol{a}\|\|\boldsymbol{b}\|}\) toma valores en \([-1,1]\), donde el coseno está bien definido.
  3. Prueba que la suma de dos vectores tiene mayor norma que cada sumando.
  4. Permite calcular la norma sin usar el producto escalar.

Pregunta 9 [D] — Verificación de ortogonalidad

Sean \(\boldsymbol{x} = (1, 2)\) e \(\boldsymbol{y} = (4, -2)\) en \(\mathbb{R}^2\). ¿Satisfacen la igualdad pitagórica \(\|\boldsymbol{x}+\boldsymbol{y}\|^2 = \|\boldsymbol{x}\|^2 + \|\boldsymbol{y}\|^2\)?

  1. No, porque sus normas no son iguales.
  2. Sí, porque su producto escalar es cero.
  3. No, porque la igualdad pitagórica solo vale en \(\mathbb{R}^3\).
  4. Sí, porque \(\|\boldsymbol{x}+\boldsymbol{y}\| = \|\boldsymbol{x}\| + \|\boldsymbol{y}\|\).

Pregunta 10 [D] — Vectores alineados y coseno

Si \(\boldsymbol{b} = -2\boldsymbol{a}\) con \(\boldsymbol{a} \neq \boldsymbol{0}\), ¿cuál es el coseno del ángulo entre \(\boldsymbol{a}\) y \(\boldsymbol{b}\)?

  1. \(2\).
  2. \(-2\).
  3. \(1\).
  4. \(-1\).

Pregunta 11 [D] — La proyección en Cauchy–Schwarz como semilla

En la demostración de Cauchy–Schwarz construimos \(\alpha = \frac{\langle\boldsymbol{a},\,\boldsymbol{b}\rangle}{\langle\boldsymbol{a},\,\boldsymbol{a}\rangle}\) para forzar que \(\boldsymbol{h} = \boldsymbol{b} - \alpha\boldsymbol{a}\) sea ortogonal a \(\boldsymbol{a}\). El vector \(\alpha\boldsymbol{a}\) es la ``sombra'' de \(\boldsymbol{b}\) sobre \(\boldsymbol{a}\). En la lección 4, cuando \(\boldsymbol{a} = \boldsymbol{1}\) (el vector de unos), ¿qué resultará ser \(\alpha\)?

  1. La norma euclídea de \(\boldsymbol{b}\).
  2. El ángulo entre \(\boldsymbol{b}\) y \(\boldsymbol{1}\) en radianes.
  3. La media aritmética de las componentes de \(\boldsymbol{b}\).
  4. La varianza de las componentes de \(\boldsymbol{b}\).

Pregunta 12 [D] — Distancia y mínimos cuadrados

La distancia entre dos vectores se define como \(d(\boldsymbol{x}, \boldsymbol{y}) = \|\boldsymbol{x} - \boldsymbol{y}\|\). ¿Qué implica esto para la regresión por mínimos cuadrados?

  1. Que MCO minimiza el producto escalar entre \(\boldsymbol{y}\) y \(\boldsymbol{\mathop{\widehat{y}}}\).
  2. Que MCO encuentra el \(\boldsymbol{\mathop{\widehat{y}}}\) (del subespacio de los regresores) que minimiza \(\|\boldsymbol{y} - \boldsymbol{\mathop{\widehat{y}}}\|\), es decir, la distancia entre los datos y el ajuste.
  3. Que la varianza mide la distancia entre \(\boldsymbol{y}\) y el vector cero.
  4. Que el \(R^2\) es la distancia normalizada entre \(\boldsymbol{y}\) y \(\boldsymbol{\mathop{\widehat{y}}}\).

10. Respuestas   htmlonly

Notas al pie de página:

1

La diferencia entre los datos originales objeto de estudio y el ajuste que el modelo logra para dichos datos.

2

Los vectores que se combinan para construir el ajuste. Los definiremos con precisión al llegar a la regresión.

Autor: Marcos Bujosa

Created: 2026-09-19 sáb 11:31

Validate