v.2025.10.15
Recordemos que, si todos los supuestos de Gauss-Markov se satisfacen: \[ \begin{align} \mathbb{E}(\mathbf{b}) &= \boldsymbol{\beta}\\ \boldsymbol{\Omega}_b &= \sigma^2(X'X)^{-1} \end{align} \]
Entonces, bajo el supuesto de normalidad de los errores:
\[ \mathbf{b} \sim \mathcal{N}(\boldsymbol{\beta}, \boldsymbol{\Omega}_b) \]
O bien:
\[ \mathbf{b} - \boldsymbol{\beta} \sim \mathcal{N}(\mathbf{0}, \boldsymbol{\Omega}_b) \]
Para cada estimador \(k\)-ésimo tenemos:
\[ b_k - \beta_k \sim \mathcal{N}(0, \boldsymbol{\Omega}_{b,kk}), \] donde:
\[ \boldsymbol{\Omega}_{b,kk} = \sigma^2(X'X)^{-1}_{kk} \]
Consideraremos hipótesis sobre el \(k\)-ésimo coeficiente de la forma:
\[ H_0 : \beta_k = \beta_k^0 \]
donde \(\beta_k^0\) es cualquier valor. Esta se conoce como hipótesis nula. También necesitamos una hipótesis alternativa, \(H_1\). Por ejemplo:
\[ H_1 : \beta_k \neq \beta_k^0 \]
y un nivel de significancia, \(\alpha\).
Dado que:
\[ (b_k - \beta_k) \sim \mathcal{N}\!\left(0,\, \sigma^2 (\mathbf{x}'\mathbf{x})^{-1}_{kk}\right) \]
Entonces:
\[ z_k = \frac{b_k - \beta_k^0}{\sqrt{\sigma^2 (\mathbf{x}'\mathbf{x})^{-1}_{kk}}} \sim \mathcal{N}(0,1) \] Este se conoce como estadístico \(z\)
Si suponemos que \(\sigma\) es conocida, entonces:
El estadístico \(z_k\) puede calcularse a partir de una muestra.
La distribución de \(z_k\) implica que este y \(x\) son independientes.
La distribución de \(z_k\) es conocida.
Nuestro objetivo es determinar si el error \(b_k - \beta_k^0\) es demasiado grande.
El error es demasiado grande si el estadístico \(z_k\) toma algún valor sorpresivo (lejos del centro de la distribución).
¿Cómo decidimos el valor de \(\alpha\)? Para elegir el valor de \(\alpha\) debemos balancear entre cometer un error del tipo I y un error del tipo II:
Tenemos un error del tipo I cuando rechazamos una hipótesis nula verdadera.
Tenemos un error del tipo II cuando no rechazamos una hipótesis nula falsa.
Entre más pequeño sea el valor de \(\alpha\), más bajo es el riesgo de cometer un error del tipo I. Al mismo tiempo, al reducir el valor de \(\alpha\) el riesgo de cometer un error del tipo II se hace más grande.
¿Qué pasa si la varianza del error es desconocida? En este caso:
\[ \sqrt{s^2 (\mathbf{x}'\mathbf{x})^{-1}_{kk}} = \text{s.e.}(b_k) \]
\[ t_k = \frac{b_k - \beta_k^0}{\text{s.e.}(b_k)} \]
Antes de continuar, necesitamos conocer algunas reglas que nos permitirán conocer la distribución del estadístico \(t\):
Si \(x \sim N(0,1)\), \(y \sim \chi^2(m)\), y si \(x\) e \(y\) son independientes:
\[ \frac{x}{\sqrt{y/m}} \sim t_{(m)} \]\(\mathbf{x} \sim N(\mathbf{0}, \mathbf{I}_n)\) y \(\mathbf{A}\) es una matriz idempotente, entonces:
\[ \mathbf{x}'\mathbf{A}\mathbf{x} \sim \chi^2_{\text{Rango}(\mathbf{A})} \]Si \(\mathbf{A}\) es una matriz idempotente, entonces:
\[ \text{Rango}(\mathbf{A}) = \text{Traza}(\mathbf{A}) \]
Sea \(\mathbf{x}\) un vector de dimensión \(m\). Si \(\mathbf{x} \sim N(\boldsymbol{\mu}, \boldsymbol{\Sigma})\), con \(\boldsymbol{\Sigma}\) no singular:
\[ (\mathbf{x} - \boldsymbol{\mu})'\boldsymbol{\Sigma}^{-1}(\mathbf{x} - \boldsymbol{\mu}) \sim \chi^2(m) \]
Si \(x \sim \chi^2(m_1)\), \(y \sim \chi^2(m_2)\), y si \(x\) e \(y\) son independientes:
\[ \frac{x/m_1}{y/m_2} \sim F_{m_1,\, m_2} \]Ejercicio
Demuestra que el estadístico \(t\) sigue una distribución t de Student:
\[ t_k \sim t_{n-k} \]
donde \(n\) es el número de observaciones y \(k\) el número de variables independientes incluidas en la regresión.
Pista: Escribe el estadístico \(t\) como:
\[ t_k = \frac{z_k}{\sqrt{q/(n-k)}} \]
y utiliza las reglas 1–4 para conocer la distribución de los estadísticos.
Para probar una hipótesis nula, seguimos los siguientes pasos:
Calculamos el estadístico \(t\). Si este está muy alejado de cero tenemos un primer síntoma de que \(H_0\) es falso.
Observamos las tablas para la distribución \(t\) y buscamos los valores correspondientes a \((n-k)\) grados de libertad. El objetivo es encontrar el valor crítico \(t_{\alpha/2,(n-k)}\) de tal forma que el área en la distribución \(t\) a la derecha de \(t_{\alpha/2,(n-k)}\) sea \(\alpha/2\). Nota que, dado que la distribución es simétrica:
\[ \mathbb{P}(-t_{\alpha/2,(n-k)} < t_k < t_{\alpha/2,(n-k)}) = 1 - \alpha \]El paso 3 para realizar la prueba de hipótesis sobre el \(k\)-ésimo coeficiente puede expresarse de manera diferente. No rechazamos \(H_0\) si:
\[ -t_{\alpha/2,(n-k)} < \frac{b_k - \beta_k^0}{\text{s.e.}(b_k)} < t_{\alpha/2,(n-k)} \]
O bien:
\[ b_k - t_{\alpha/2,(n-k)}\,\text{s.e.}(b_k) < \beta_k^0 < b_k + t_{\alpha/2,(n-k)}\,\text{s.e.}(b_k) \]
Este intervalo se conoce como intervalo de confianza al nivel \(1-\alpha\). Este es más pequeño conforme más pequeño es el error estándar del coeficiente. Por lo tanto, entre más pequeño el intervalo, más preciso es \(b_k\).
Supongamos que la hipótesis nula es:
\[ H_0 : \beta_k = \beta_k^0 \]
donde \(\beta_k^0\) es cualquier valor, y la hipótesis alternativa:
\[ H_1 : \beta_k = \beta_k^1 \]
donde \(\beta_k^1\) es cualquier otro valor. Supongamos que \(\beta_k^1 > \beta_k^0\).
Si \(b_k\) está a la derecha de \(B\), entonces \(b_k\) es más compatible con la distribución de \(H_1\) que con la distribución de \(H_0\). No dudaríamos en rechazar \(H_0\).
Si \(b_k\) está a la izquierda de \(A\), el procedimiento nos dirá que \(H_0\) se rechaza, ¡aun cuando \(b_k\) es más compatible con la distribución de \(H_0\) que con la distribución de \(H_1\)!
Para hacer la prueba debemos fijarnos solo en una cola (en este caso, la cola derecha) e ignoramos la otra cola.
En general, aplicamos pruebas de cola derecha si:
\[ H_0 : \beta_k = \beta_k^1, \quad H_1 : \beta_k > \beta_k^1 \]
y pruebas de cola izquierda si:
\[ H_0 : \beta_k = \beta_k^1, \quad H_1 : \beta_k < \beta_k^1 \]
Una prueba de hipótesis también se puede realizar observando los valores \(p\):
Calculamos el estadístico \(t\).
En lugar de encontrar el valor crítico \(t_{\alpha/2,(n-k)}\) (o \(t_{\alpha,(n-k)}\) si la prueba es de una sola cola), calculamos:
\[ p = \begin{cases} \mathbb{P}(t > |t_k|) \times 2 & \text{si dos colas} \\ \mathbb{P}(t > |t_k|) & \text{si una cola} \end{cases} \]
Nota que, dado que la distribución \(t\) es simétrica alrededor de cero:
\[ \mathbb{P}(t > |t_k|) = \mathbb{P}(t < -|t_k|) \]
Entonces:
\[ \mathbb{P}(-|t_k| < t < |t_k|) = 1 - p \]
No rechazamos \(H_0\) si \(p > \alpha\). Rechazamos en caso contrario.
Ejercicio
Sea \(n = 40\); \(k = 2\), \(b_2 = 10.21\); \(\beta_2^0 = 5.5\); \(\text{s.e.}(b_2) = 2.09\). Muestra que \(p = 0.0152\). Interpreta tu resultado.
Pista: Puedes utilizar algún software para hacer el cálculo. Por ejemplo, para una prueba de cola derecha, puedes utilizar en Microsoft Excel: p = DISTR.T.CD(t, n-k).
Ahora estamos interesados en probar hipótesis de la forma:
\[ H_0 : \mathbf{R}\boldsymbol{\beta} = \mathbf{r} \]
donde \(\boldsymbol{\beta}\) es el vector de coeficientes, \(\mathbf{R}\) es una matriz \((m \times k)\) y \(m\) es a la vez el número de restricciones que deseamos someter a prueba y el rango de \(\mathbf{R}\).
Por ejemplo, si tenemos el modelo:
\[ y_i = \beta_1 + \beta_2 x_{2i} + \beta_3 x_{3i} + \beta_4 x_{4i} + \beta_5 x_{5i} + u_i \]
y deseamos probar:
\[ H_0 : \beta_2 = 0, \quad \beta_3 = 1 \]
tenemos \(m = 2\) y:
\[ \boldsymbol{\beta} = \begin{pmatrix} \beta_1 \\ \beta_2 \\ \beta_3 \\ \beta_4 \\ \beta_5 \end{pmatrix}, \quad \mathbf{R} = \begin{pmatrix} 0 & 1 & 0 & 0 & 0 \\ 0 & 0 & 1 & 0 & 0 \end{pmatrix}, \quad \mathbf{r} = \begin{pmatrix} 0 \\ 1 \end{pmatrix} \]
Ejercicio
Considera el modelo:
\[ y_i = \beta_1 + \beta_2 x_{2i} + \beta_3 x_{3i} + \beta_4 x_{4i} + \beta_5 x_{5i} + u_i \]
Escribe la forma de las matrices \(\mathbf{R}\) y \(\mathbf{r}\) para cada uno de los siguientes casos:
\(H_0 : \beta_2 + \beta_3 = 0, \quad \beta_4 = \beta_5\)
\(H_0 : \beta_2 = \beta_3, \quad \beta_4 = 0, \quad \beta_2 + \beta_3 = \beta_4\)
Para construir el estadístico para realizar la prueba de hipótesis conjuntas, primero recordemos que:
\[ \mathbf{b} \sim \mathcal{N}\!\left(\boldsymbol{\beta},\, \sigma^2 (\mathbf{x}'\mathbf{x})^{-1}\right) \]
Esto implica que:
\[ (\mathbf{Rb} - \mathbf{r}) \sim \mathcal{N}\!\left(\mathbf{0},\, \sigma^2 \mathbf{R}(\mathbf{x}'\mathbf{x})^{-1}\mathbf{R}'\right) \]
Construimos ahora el estadístico F:
\[ F = \frac{(\mathbf{Rb} - \mathbf{r})'\!\left(\mathbf{R}(\mathbf{x}'\mathbf{x})^{-1}\mathbf{R}'\right)^{-1}\!(\mathbf{Rb} - \mathbf{r})\,/\,\text{Rango}(\mathbf{R})}{s^2} \]
Ejercicio
Muestra que el estadístico \(F\):
\[F \sim F_{m,\, n-k}\]
Pista: Escribe el estadístico \(F\) como:
\[ F = \frac{w/\text{Rango}(\mathbf{R})}{q/(n-k)} \]
y utiliza las reglas 4–6 para conocer la distribución de los estadísticos.
Para probar la hipótesis nula planteada, seguimos los siguientes pasos:
Calculamos el estadístico \(F\). Si el cálculo anterior resulta muy complicado, podemos calcular el estadístico de la siguiente manera:
\[ F = \frac{(RSS_R - RSS_U)/m}{RSS_U/(n-k)} \]
donde \(RSS_R\) es el \(RSS\) del modelo restringido y \(RSS_U\) es el \(RSS\) del modelo no restringido.Observamos las tablas para la distribución \(F\). Buscamos la entrada para \(m\) grados de libertad en el numerador y \(n-k\) grados de libertad en el denominador. El objetivo es encontrar el valor crítico \(F_{\alpha,(m,n-k)}\) de tal forma que la probabilidad de encontrarse a la derecha de este número sea \(\alpha\).
Ejercicio
Una de las aplicaciones más importantes del estadístico \(F\) es la de la significancia global. En este caso deseamos probar:
\[ H_0 : \beta_2 = \beta_3 = \cdots = \beta_k = 0 \]
Muestra que, en este caso particular, el estadístico \(F\) puede calcularse en términos de la \(R^2\) del modelo no restringido:
\[ F_{k-1,\,n-k} = \frac{R^2/(k-1)}{(1-R^2)/(n-k)} \]
Al igual que con la prueba \(t\), la prueba \(F\) también puede realizarse mediante el cálculo del valor \(p\):
Calculamos el estadístico \(F\).
Calculamos:
\[ p = \mathbb{P}(F \geq F_{\alpha,(m,n-k)}) \]
Consideremos la siguiente hipótesis nula:
\[ H_0 : \beta_k = \beta_k^0 \]
Nota que este es un caso especial para la prueba \(F\). En particular:
\[ \mathbf{R} = \begin{pmatrix} 0 & \cdots & 0 & 1 & 0 & \cdots & 0 \end{pmatrix}, \quad \mathbf{r} = \beta_k^0 \]
donde el \(1\) se encuentra en la \(k\)-ésima posición del vector \(\mathbf{R}\).
Ejercicio
Demuestra que una variable aleatoria distribuida como una \(F(1, n-k)\) es el cuadrado de una variable aleatoria distribuida como una \(t(n-k)\). Comenta.
Pista: Calcula el estadístico \(F\) para la prueba \(H_0 : \beta_k = \beta_k^0\).
Consideremos la siguiente hipótesis nula:
\[ H_0 : \sum_{j=1}^{k} \lambda_j \beta_j = \theta \]
En este caso, podemos aplicar una prueba \(F\) definiendo:
\[ \mathbf{R} = \begin{pmatrix} \lambda_1 & \lambda_2 & \cdots & \lambda_k \end{pmatrix}, \quad \mathbf{r} = \theta \]
Nota que, en este caso:
\[ F \sim F_{1,\, n-k} \]
Pero recuerda que:
\[ F_{1,\,n-k} = t_{n-k}^2 \]
Esto implica que, cuando deseamos probar una restricción lineal de parámetros, estamos indiferentes entre aplicar la prueba \(t\) o la prueba \(F\). Por supuesto, la aplicación de la prueba \(t\) también nos permite calcular intervalos de confianza de la forma habitual.
¿Qué pasa si tenemos más de una restricción? Sea, por ejemplo, \(k = 2\) y:
\[ H_0 : \beta_1 = 1, \quad \beta_2 = 0 \]
¿Qué prueba preferimos en este caso, una \(t\) o una \(F\)?
Una posibilidad pudiera ser no rechazar \(H_0\) si ambas restricciones pasan, cada una, la prueba \(t\). Esto ocurre si de manera simultánea:
\[ b_1 - \text{s.e.}(b_1)\,t_{\alpha/2,(n-k)} < \beta_1 < b_1 + \text{s.e.}(b_1)\,t_{\alpha/2,(n-k)} \] y:
\[ b_2 - \text{s.e.}(b_2)\,t_{\alpha/2,(n-k)} < \beta_2 < b_2 + \text{s.e.}(b_2)\,t_{\alpha/2,(n-k)} \]
Esto corresponde a encontrarse en algún punto dentro de una región rectangular en el plano \((\beta_1, \beta_2)\).
En cambio, la región de confianza para la prueba \(F\) es:
\[ \begin{pmatrix} b_1 - \beta_1 & b_2 - \beta_2 \end{pmatrix} \left(\widehat{\text{var}(\mathbf{b})}\right)^{-1} \begin{pmatrix} b_1 - \beta_1 \\ b_2 - \beta_2 \end{pmatrix} < 2 F_{\alpha,(m,n-k)} \]
Esta corresponde a un elipse en el plano \((\beta_1, \beta_2)\).
En nuestro ejemplo, preferimos el estadístico \(F\) por dos razones:
Si el nivel de significancia para cada uno de los \(t\) es \(\alpha\), la probabilidad de que \((1, 0)\) esté fuera del área rectangular no es \(\alpha\).
La prueba \(F\) es una prueba de máxima verosimilitud.