v.2026.09.26
En el capítulo anterior obtuvimos:
\[ \mathbf{b} = \left(\mathbf{x}^{\top}\mathbf{x}\right)^{-1} \mathbf{x}^{\top}\mathbf{y}, \]
y demostramos que:
\[ \begin{align} \mathbb{E}(\mathbf{b}) &= \boldsymbol{\beta},\\ \mathbb{V}ar(\mathbf{b}) &= \sigma^2 \left(\mathbf{x}^{\top}\mathbf{x}\right)^{-1}. \end{align} \]
Pero \(\mathbf{b}\) proviene de una muestra.
Otra muestra produciría, en general, otra estimación.
¿Qué podemos sostener acerca de \(\boldsymbol{\beta}\) a partir de la \(\mathbf{b}\) que observamos?
Responder esta pregunta es el objetivo de la inferencia estadística.
En RLM introdujimos un último supuesto para realizar inferencia exacta en muestras finitas:
\[ \mathbf{u} \sim \mathcal{N} \left( \mathbf{0}, \sigma^2\mathbf{I}_n \right). \]
Como \(\mathbf{b}\) es una transformación lineal de \(\mathbf{u}\), se sigue que:
\[ \mathbf{b} \sim \mathcal{N} \left( \boldsymbol{\beta}, \sigma^2 \left(\mathbf{x}^{\top}\mathbf{x}\right)^{-1} \right). \]
Para cualquier coeficiente \(j=1,\ldots,k\):
\[ b_j \sim \mathcal{N} \left( \beta_j, \sigma^2 \left[ \left(\mathbf{x}^{\top}\mathbf{x}\right)^{-1} \right]_{jj} \right). \]
Por tanto:
\[ b_j-\beta_j \sim \mathcal{N} \left( 0, \sigma^2 \left[ \left(\mathbf{x}^{\top}\mathbf{x}\right)^{-1} \right]_{jj} \right). \]
La distribución de \(b_j\) nos indica tanto su centro como la incertidumbre asociada con la estimación.
Supongamos que queremos evaluar una afirmación acerca de \(\beta_j\):
\[ H_0:\beta_j=\beta_j^0. \]
Esta es nuestra hipótesis nula.
Por ejemplo, podemos considerar como alternativa:
\[ H_1:\beta_j\neq\beta_j^0. \]
La pregunta es:
¿Qué tan compatible es la estimación \(b_j\) con el valor propuesto por \(H_0\)?
Bajo:
\[ H_0:\beta_j=\beta_j^0, \]
tenemos:
\[ b_j-\beta_j^0 \sim \mathcal{N} \left( 0, \sigma^2 \left[ (\mathbf{x}^{\top}\mathbf{x})^{-1} \right]_{jj} \right). \]
Si \(\sigma^2\) fuera conocida, podríamos estandarizar:
\[ z_j= \frac{ b_j-\beta_j^0 }{ \sqrt{ \sigma^2 \left[ (\mathbf{x}^{\top}\mathbf{x})^{-1} \right]_{jj} } } \sim\mathcal{N}(0,1). \]
El cociente \(z_j\) se conoce como estadístico \(z\).
Si \(H_0\) es verdadera:
\[ z_j\sim\mathcal{N}(0,1). \]
Por tanto, valores de \(z_j\) muy alejados de cero serían poco compatibles con \(H_0\).
Elegimos un nivel de significancia, \(\alpha\), y reservamos una probabilidad total \(\alpha\) para las regiones de rechazo.
Si el \(z_j\) observado cae en una de estas regiones, consideramos que la evidencia es suficientemente incompatible con \(H_0\) para rechazarla.
En la práctica no conocemos \(\sigma^2\).
En RLM aprendimos a estimarla mediante:
\[ s^2=\frac{RSS}{n-k}, \]
de modo que:
\[ \widehat{\mathbb{V}ar}(\mathbf b) = s^2 (\mathbf{x}^{\top}\mathbf{x})^{-1}. \]
Para \(b_j\), definimos su error estándar:
\[ \operatorname{s.e.}(b_j) = \sqrt{ s^2 \left[ (\mathbf{x}^{\top}\mathbf{x})^{-1} \right]_{jj} }. \]
Entonces:
\[ t_j= \frac{b_j-\beta_j^0} {\operatorname{s.e.}(b_j)}. \]
¿Qué distribución sigue ahora \(t_j\)?
Recordemos que:
\[ \mathbf e=\mathbf M_x\mathbf u, \]
donde \(\mathbf M_x\) es simétrica e idempotente y:
\[ \operatorname{rank}(\mathbf M_x)=n-k. \]
Bajo normalidad:
\[ \frac{\mathbf u}{\sigma} \sim \mathcal N(\mathbf 0,\mathbf I_n). \]
Por tanto:
\[ \frac{\mathbf e^\top\mathbf e}{\sigma^2} = \frac{\mathbf u^\top\mathbf M_x\mathbf u}{\sigma^2} \sim \chi^2_{n-k}. \]
Como:
\[ s^2=\frac{\mathbf e^\top\mathbf e}{n-k}, \]
se sigue que:
\[ \frac{(n-k)s^2}{\sigma^2} \sim \chi^2_{n-k}. \]
Bajo \(H_0\):
\[ z_j= \frac{ b_j-\beta_j^0 }{ \sqrt{ \sigma^2 [(\mathbf{x}^{\top}\mathbf{x})^{-1}]_{jj} } } \sim\mathcal N(0,1), \]
y:
\[ q= \frac{(n-k)s^2}{\sigma^2} \sim\chi^2_{n-k}. \]
Además, bajo normalidad, \(b_j\) y \(s^2\) son independientes.
Por tanto:
\[ t_j = \frac{z_j}{\sqrt{q/(n-k)}} \sim t_{n-k}. \]
Ejercicio
Muestra que:
\[ \mathbb{C}ov(\mathbf b,\mathbf e) = \sigma^2 (\mathbf x^\top\mathbf x)^{-1} \mathbf x^\top\mathbf M_x = \mathbf0. \]
Utiliza que:
\[ \mathbf x^\top\mathbf M_x=\mathbf0^\top. \]
Bajo normalidad conjunta, este resultado implica la independencia necesaria para obtener la distribución \(t\).
Consideremos:
\[ H_0:\beta_j=\beta_j^0, \qquad H_1:\beta_j\neq\beta_j^0. \]
Bajo \(H_0\):
\[ t_j= \frac{b_j-\beta_j^0} {\operatorname{s.e.}(b_j)} \sim t_{n-k}. \]
Para un nivel de significancia \(\alpha\), elegimos el valor crítico \(t_{\alpha/2,(n-k)}\) de forma que:
\[ \mathbb{P} \left( -t_{\alpha/2,(n-k)} < t_j < t_{\alpha/2,(n-k)} \mid H_0 \right) = 1-\alpha. \]
Rechazamos \(H_0\) si el valor observado de \(t_j\) cae en alguna de las regiones de rechazo:
\[ |t_j| > t_{\alpha/2,(n-k)}. \]
En caso contrario, no rechazamos \(H_0\).
Bajo \(H_0\):
\[ t_j\sim t_{n-k}, \]
por lo que la probabilidad de rechazar una hipótesis nula verdadera es \(\alpha\).
No rechazar \(H_0\) no significa demostrar que \(H_0\) es verdadera.
Toda regla de decisión puede llevarnos a cometer errores:
Cometemos un error tipo I cuando rechazamos \(H_0\) siendo verdadera.
Cometemos un error tipo II cuando no rechazamos \(H_0\) siendo falsa.
El nivel de significancia controla la probabilidad del error tipo I:
\[ \mathbb{P} (\text{rechazar }H_0\mid H_0\text{ verdadera}) = \alpha. \]
Para un tamaño de muestra dado, reducir \(\alpha\) disminuye el riesgo de error tipo I, pero hace más difícil rechazar \(H_0\) cuando es falsa.
Sabemos que:
\[ \mathbb{P} \left( -t_{\alpha/2,(n-k)} < \frac{b_j-\beta_j} {\operatorname{s.e.}(b_j)} < t_{\alpha/2,(n-k)} \right) = 1-\alpha. \]
Reordenando:
\[ \mathbb{P} \left( b_j- t_{\alpha/2,(n-k)}\operatorname{s.e.}(b_j) < \beta_j < b_j+ t_{\alpha/2,(n-k)}\operatorname{s.e.}(b_j) \right) = 1-\alpha. \]
Esto da lugar al intervalo de confianza:
\[ b_j \pm t_{\alpha/2,(n-k)} \operatorname{s.e.}(b_j). \]
El ancho del intervalo depende de:
\[ t_{\alpha/2,(n-k)} \qquad\text{y}\qquad \operatorname{s.e.}(b_j). \]
Para un mismo nivel de confianza:
un menor error estándar produce un intervalo más estrecho.
Por tanto, una estimación más precisa permite acotar con mayor precisión los valores de \(\beta_j\) compatibles con la evidencia.
Para una prueba bilateral:
\[ H_0:\beta_j=\beta_j^0, \]
al nivel de significancia \(\alpha\):
\[ \text{no rechazamos }H_0 \]
si y solo si:
\[ \beta_j^0 \]
pertenece al intervalo de confianza \(1-\alpha\).
Hasta ahora hemos considerado:
\[ H_0:\beta_j=\beta_j^0, \qquad H_1:\beta_j\neq\beta_j^0. \]
Pero algunas preguntas económicas tienen una dirección específica.
Por ejemplo:
\[ H_1:\beta_j>\beta_j^0 \]
o:
\[ H_1:\beta_j<\beta_j^0. \]
En estos casos, la evidencia relevante se encuentra únicamente en una de las colas de la distribución.
La dirección de la alternativa debe establecerse antes de observar los resultados.
Supongamos que:
\[ H_1:\beta_j>\beta_j^0. \]
Valores suficientemente grandes de \(b_j\) son evidencia a favor de esta alternativa.
En cambio, valores muy pequeños de \(b_j\) pueden ser incompatibles con \(H_0\), pero no constituyen evidencia a favor de:
\[ H_1:\beta_j>\beta_j^0. \]
Por ello concentramos todo el nivel de significancia \(\alpha\) en la cola derecha.
Para una prueba de cola derecha:
\[ H_0:\beta_j\leq\beta_j^0, \qquad H_1:\beta_j>\beta_j^0, \]
evaluamos el estadístico en el valor frontera \(\beta_j^0\):
\[ t_j= \frac{b_j-\beta_j^0} {\operatorname{s.e.}(b_j)}. \]
Rechazamos \(H_0\) si:
\[ t_j>t_{\alpha,(n-k)}. \]
Para una prueba de cola izquierda:
\[ H_0:\beta_j\geq\beta_j^0, \qquad H_1:\beta_j<\beta_j^0, \]
rechazamos si:
\[ t_j<-t_{\alpha,(n-k)}. \]
Hasta ahora hemos comparado el estadístico observado con un valor crítico.
Podemos expresar la misma evidencia mediante el valor \(p\):
El valor \(p\) mide qué tan extremo sería observar un estadístico como el obtenido, o uno aún más extremo, si \(H_0\) fuera verdadera.
Para una prueba bilateral:
\[ p= 2\,\mathbb{P} \left( T_{n-k}\geq |t_j| \right). \]
Para una prueba de cola derecha:
\[ p= \mathbb{P} \left( T_{n-k}\geq t_j \right). \]
Para una prueba de cola izquierda:
\[ p= \mathbb{P} \left( T_{n-k}\leq t_j \right). \]
La regla de decisión es:
\[ p<\alpha \quad\Longrightarrow\quad \text{rechazamos }H_0. \]
\[ p\geq\alpha \quad\Longrightarrow\quad \text{no rechazamos }H_0. \]
El valor \(p\) no es:
Es una medida de compatibilidad entre los datos observados y \(H_0\).
Ejercicio
Sea:
\[ n=40,\qquad k=2,\qquad b_2=10.21,\qquad \beta_2^0=5.5, \]
y:
\[ \operatorname{s.e.}(b_2)=2.09. \]
Considera:
\[ H_0:\beta_2\leq5.5, \qquad H_1:\beta_2>5.5. \]
Calcula el estadístico \(t\).
Muestra que el valor \(p\) es aproximadamente \(0.0152\).
Interpreta el resultado.
Hasta ahora hemos evaluado una restricción a la vez.
Pero muchas preguntas econométricas involucran varias afirmaciones simultáneas.
Por ejemplo:
\[ H_0:\beta_2=0,\qquad \beta_3=0. \]
La pregunta ya no es si cada restricción parece razonable por separado, sino:
¿Son compatibles los datos con que todas las restricciones se cumplan simultáneamente?
Podemos escribir una hipótesis conjunta como:
\[ H_0: \mathbf R\boldsymbol\beta=\mathbf r, \]
donde:
Cada renglón de \(\mathbf R\) representa una restricción.
Consideremos:
\[ y_i = \beta_1 + \beta_2x_{2i} + \beta_3x_{3i} + \beta_4x_{4i} + \beta_5x_{5i} + u_i. \]
Deseamos probar:
\[ H_0: \beta_2=0, \qquad \beta_3=1. \]
Entonces \(m=2\) y:
\[ \boldsymbol{\beta} = \begin{pmatrix} \beta_1\\ \beta_2\\ \beta_3\\ \beta_4\\ \beta_5 \end{pmatrix}, \qquad \mathbf R = \begin{pmatrix} 0&1&0&0&0\\ 0&0&1&0&0 \end{pmatrix}, \qquad \mathbf r = \begin{pmatrix} 0\\ 1 \end{pmatrix}. \]
Ejercicio
Considera:
\[ y_i = \beta_1 + \beta_2x_{2i} + \beta_3x_{3i} + \beta_4x_{4i} + \beta_5x_{5i} + u_i. \]
Escribe \(\mathbf R\) y \(\mathbf r\) para:
\[ H_0: \beta_2+\beta_3=0, \qquad \beta_4=\beta_5. \]
\[ H_0: \beta_2=\beta_3, \qquad \beta_4=0, \qquad \beta_2+\beta_3=\beta_4. \]
Si \(H_0\) es verdadera:
\[ \mathbf R\boldsymbol\beta-\mathbf r=\mathbf0. \]
En la muestra observamos:
\[ \mathbf R\mathbf b-\mathbf r. \]
Por tanto, una prueba conjunta debe evaluar qué tan grande es:
\[ \mathbf R\mathbf b-\mathbf r, \]
teniendo en cuenta la incertidumbre y la covarianza entre los estimadores.
Sabemos que:
\[ \mathbf b \sim \mathcal N \left( \boldsymbol\beta, \sigma^2 (\mathbf x^\top\mathbf x)^{-1} \right). \]
Por tanto:
\[ \mathbf R\mathbf b-\mathbf r \sim \mathcal N \left( \mathbf R\boldsymbol\beta-\mathbf r, \, \sigma^2 \mathbf R (\mathbf x^\top\mathbf x)^{-1} \mathbf R^\top \right). \]
Bajo:
\[ H_0:\mathbf R\boldsymbol\beta=\mathbf r, \]
se sigue que:
\[ \mathbf R\mathbf b-\mathbf r \sim \mathcal N \left( \mathbf0, \, \sigma^2 \mathbf R (\mathbf x^\top\mathbf x)^{-1} \mathbf R^\top \right). \]
Si:
\[ \mathbf v \sim \mathcal N (\mathbf0,\boldsymbol\Sigma), \]
entonces:
\[ \mathbf v^\top \boldsymbol\Sigma^{-1} \mathbf v \sim \chi^2_m. \]
Aplicando este resultado a:
\[ \mathbf v=\mathbf R\mathbf b-\mathbf r, \]
obtenemos, bajo \(H_0\):
\[ w= \frac{ (\mathbf R\mathbf b-\mathbf r)^\top \left[ \mathbf R(\mathbf x^\top\mathbf x)^{-1}\mathbf R^\top \right]^{-1} (\mathbf R\mathbf b-\mathbf r) }{ \sigma^2 } \sim\chi^2_m. \]
Ya sabemos que:
\[ w\sim\chi^2_m, \]
y:
\[ q= \frac{(n-k)s^2}{\sigma^2} \sim\chi^2_{n-k}. \]
Bajo normalidad, \(w\) y \(q\) son independientes.
Por tanto:
\[ F= \frac{ w/m }{ q/(n-k) } \sim F_{m,n-k}. \]
Sustituyendo \(w\) y \(q\):
\[ F= \frac{ (\mathbf R\mathbf b-\mathbf r)^\top \left[ \mathbf R(\mathbf x^\top\mathbf x)^{-1}\mathbf R^\top \right]^{-1} (\mathbf R\mathbf b-\mathbf r)/m }{ s^2 }. \]
Bajo:
\[ H_0:\mathbf R\boldsymbol\beta=\mathbf r, \]
tenemos:
\[ F\sim F_{m,n-k}. \]
Ejercicio
Demuestra que:
\[ F\sim F_{m,n-k}. \]
Pista.
Escribe:
\[ F= \frac{w/m}{q/(n-k)} \]
y utiliza las distribuciones de \(w\) y \(q\).
El modelo no restringido permite que los coeficientes se estimen libremente.
El modelo restringido obliga a que se cumpla:
\[ \mathbf R\boldsymbol\beta=\mathbf r. \]
Como el modelo restringido tiene menos libertad:
\[ RSS_R\geq RSS_U. \]
La pregunta es:
¿Cuánto empeora el ajuste cuando obligamos al modelo a satisfacer \(H_0\)?
Para restricciones lineales podemos calcular:
\[ F= \frac{ (RSS_R-RSS_U)/m }{ RSS_U/(n-k) }. \]
El numerador mide cuánto aumenta el \(RSS\) al imponer las \(m\) restricciones.
El denominador mide la variabilidad residual del modelo no restringido.
Un aumento grande del \(RSS\), relativo a la variabilidad residual, constituye evidencia contra \(H_0\).
Bajo \(H_0\):
\[ F\sim F_{m,n-k}. \]
Como:
\[ F\geq0, \]
la región de rechazo se encuentra en la cola derecha.
Rechazamos \(H_0\) si:
\[ F> F_{\alpha,(m,n-k)}. \]
En caso contrario, no rechazamos \(H_0\).
Consideremos el modelo con \(k\) parámetros:
\[ y_i= \beta_1+ \beta_2x_{2i} +\cdots+ \beta_kx_{ki} +u_i. \]
La hipótesis de significancia global es:
\[ H_0: \beta_2=\beta_3=\cdots=\beta_k=0. \]
Por tanto, tenemos:
\[ m=k-1 \]
restricciones.
Ejercicio
Muestra que:
\[ F= \frac{ R^2/(k-1) }{ (1-R^2)/(n-k) }. \]
Si el estadístico observado es \(F_{\text{obs}}\):
\[ p= \mathbb{P} \left( F_{m,n-k} \geq F_{\text{obs}} \right). \]
La regla es la misma que antes:
\[ p<\alpha \quad\Longrightarrow\quad \text{rechazamos }H_0. \]
El valor \(p\) expresa qué tan extremo resulta el \(F\) observado bajo las restricciones impuestas por \(H_0\).
Consideremos:
\[ H_0: \boldsymbol{\lambda}^{\top}\boldsymbol{\beta} = \theta, \]
donde:
\[ \boldsymbol{\lambda} = \begin{pmatrix} \lambda_1\\ \lambda_2\\ \vdots\\ \lambda_k \end{pmatrix}. \]
Esta hipótesis puede escribirse como:
\[ H_0: \mathbf R\boldsymbol{\beta} = \mathbf r, \]
con:
\[ \mathbf R = \boldsymbol{\lambda}^{\top}, \qquad \mathbf r=\theta. \]
Por tanto:
\[ m=1. \]
Ejercicio
Muestra que, para probar:
\[ H_0: \boldsymbol{\lambda}^{\top}\boldsymbol{\beta} = \theta, \]
el estadístico \(t\) puede escribirse como:
\[ t= \frac{ \boldsymbol{\lambda}^{\top}\mathbf b-\theta }{ \sqrt{ s^2 \boldsymbol{\lambda}^{\top} (\mathbf x^{\top}\mathbf x)^{-1} \boldsymbol{\lambda} } }. \]
Muestra además que el estadístico \(F\) para la misma restricción satisface:
\[ F=t^2. \]
Por tanto:
\[ T_{n-k}^2 \sim F_{1,n-k}. \]
Para una sola restricción lineal bilateral, las pruebas \(t\) y \(F\) conducen a la misma decisión.
En particular:
\[ H_0:\beta_j=\beta_j^0 \]
es un caso especial de:
\[ H_0: \boldsymbol{\lambda}^{\top}\boldsymbol{\beta} = \theta. \]
La prueba \(t\), además, conserva información sobre la dirección de la diferencia y se relaciona directamente con los intervalos de confianza.
Supongamos que queremos probar simultáneamente:
\[ H_0: \beta_1=1, \qquad \beta_2=0. \]
Una posibilidad sería realizar dos pruebas \(t\):
\[ H_{01}:\beta_1=1, \]
y:
\[ H_{02}:\beta_2=0. \]
Pero:
¿equivale evaluar ambas restricciones por separado a evaluar correctamente la hipótesis conjunta?
Cada prueba individual genera un intervalo:
\[ b_1- t_{\alpha/2,(n-k)} \operatorname{s.e.}(b_1) < \beta_1 < b_1+ t_{\alpha/2,(n-k)} \operatorname{s.e.}(b_1), \]
y:
\[ b_2- t_{\alpha/2,(n-k)} \operatorname{s.e.}(b_2) < \beta_2 < b_2+ t_{\alpha/2,(n-k)} \operatorname{s.e.}(b_2). \]
Al considerar ambos intervalos simultáneamente obtenemos una región rectangular en el plano:
\[ (\beta_1,\beta_2). \]
La prueba \(F\) utiliza la matriz completa de varianzas y covarianzas:
\[ \widehat{\mathbb{V}ar}(\mathbf b). \]
Para dos restricciones, la región conjunta tiene la forma:
\[ (\mathbf b-\boldsymbol{\beta})^{\top} \left[ \widehat{\mathbb{V}ar}(\mathbf b) \right]^{-1} (\mathbf b-\boldsymbol{\beta}) < 2F_{\alpha,(2,n-k)}. \]
Esta región es una elipse.
Las pruebas \(t\) individuales consideran cada coeficiente por separado.
La prueba \(F\) considera simultáneamente:
No podemos sustituir una prueba conjunta por varias pruebas \(t\) separadas porque:
Si cada prueba individual utiliza un nivel de significancia \(\alpha\), la probabilidad de cometer al menos un error tipo I en el conjunto no es, en general, \(\alpha\).
Las pruebas individuales ignoran la covarianza entre los estimadores.
La prueba \(F\) evalúa las restricciones simultáneamente utilizando la distribución conjunta de los estimadores.
¿Qué podemos sostener acerca de los parámetros del modelo a partir de una muestra?
Aprendimos a:
La inferencia no elimina la incertidumbre. Nos permite incorporarla explícitamente cuando construimos evidencia.
Hasta ahora hemos estudiado cómo cuantificar la incertidumbre de nuestros estimadores y cómo utilizarla para evaluar hipótesis sobre los parámetros del modelo.
Pero la precisión de esos estimadores depende también de la información contenida en los regresores.
¿Qué ocurre cuando distintas variables explicativas contienen información muy parecida entre sí?