v.2026.09.26

PDF

De la estimación a la inferencia

¿Qué podemos sostener a partir de una muestra?

En el capítulo anterior obtuvimos:

\[ \mathbf{b} = \left(\mathbf{x}^{\top}\mathbf{x}\right)^{-1} \mathbf{x}^{\top}\mathbf{y}, \]

y demostramos que:

\[ \begin{align} \mathbb{E}(\mathbf{b}) &= \boldsymbol{\beta},\\ \mathbb{V}ar(\mathbf{b}) &= \sigma^2 \left(\mathbf{x}^{\top}\mathbf{x}\right)^{-1}. \end{align} \]

Pero \(\mathbf{b}\) proviene de una muestra.
Otra muestra produciría, en general, otra estimación.

¿Qué podemos sostener acerca de \(\boldsymbol{\beta}\) a partir de la \(\mathbf{b}\) que observamos?

Responder esta pregunta es el objetivo de la inferencia estadística.

Distribución de los estimadores de MCO (1/2)

En RLM introdujimos un último supuesto para realizar inferencia exacta en muestras finitas:

\[ \mathbf{u} \sim \mathcal{N} \left( \mathbf{0}, \sigma^2\mathbf{I}_n \right). \]

Como \(\mathbf{b}\) es una transformación lineal de \(\mathbf{u}\), se sigue que:

\[ \mathbf{b} \sim \mathcal{N} \left( \boldsymbol{\beta}, \sigma^2 \left(\mathbf{x}^{\top}\mathbf{x}\right)^{-1} \right). \]

Distribución de los estimadores de MCO (2/2)

Para cualquier coeficiente \(j=1,\ldots,k\):

\[ b_j \sim \mathcal{N} \left( \beta_j, \sigma^2 \left[ \left(\mathbf{x}^{\top}\mathbf{x}\right)^{-1} \right]_{jj} \right). \]

Por tanto:

\[ b_j-\beta_j \sim \mathcal{N} \left( 0, \sigma^2 \left[ \left(\mathbf{x}^{\top}\mathbf{x}\right)^{-1} \right]_{jj} \right). \]

La distribución de \(b_j\) nos indica tanto su centro como la incertidumbre asociada con la estimación.

Inferencia sobre un parámetro

Una afirmación sobre un parámetro

Supongamos que queremos evaluar una afirmación acerca de \(\beta_j\):

\[ H_0:\beta_j=\beta_j^0. \]

Esta es nuestra hipótesis nula.

Por ejemplo, podemos considerar como alternativa:

\[ H_1:\beta_j\neq\beta_j^0. \]

La pregunta es:

¿Qué tan compatible es la estimación \(b_j\) con el valor propuesto por \(H_0\)?

Un caso sencillo: \(\sigma^2\) conocida

Bajo:

\[ H_0:\beta_j=\beta_j^0, \]

tenemos:

\[ b_j-\beta_j^0 \sim \mathcal{N} \left( 0, \sigma^2 \left[ (\mathbf{x}^{\top}\mathbf{x})^{-1} \right]_{jj} \right). \]

Si \(\sigma^2\) fuera conocida, podríamos estandarizar:

\[ z_j= \frac{ b_j-\beta_j^0 }{ \sqrt{ \sigma^2 \left[ (\mathbf{x}^{\top}\mathbf{x})^{-1} \right]_{jj} } } \sim\mathcal{N}(0,1). \]

El cociente \(z_j\) se conoce como estadístico \(z\).

¿Qué tan lejos es demasiado lejos?

Si \(H_0\) es verdadera:

\[ z_j\sim\mathcal{N}(0,1). \]

Por tanto, valores de \(z_j\) muy alejados de cero serían poco compatibles con \(H_0\).

Elegimos un nivel de significancia, \(\alpha\), y reservamos una probabilidad total \(\alpha\) para las regiones de rechazo.

Si el \(z_j\) observado cae en una de estas regiones, consideramos que la evidencia es suficientemente incompatible con \(H_0\) para rechazarla.

El problema real: \(\sigma^2\) es desconocida

En la práctica no conocemos \(\sigma^2\).

En RLM aprendimos a estimarla mediante:

\[ s^2=\frac{RSS}{n-k}, \]

de modo que:

\[ \widehat{\mathbb{V}ar}(\mathbf b) = s^2 (\mathbf{x}^{\top}\mathbf{x})^{-1}. \]

Para \(b_j\), definimos su error estándar:

\[ \operatorname{s.e.}(b_j) = \sqrt{ s^2 \left[ (\mathbf{x}^{\top}\mathbf{x})^{-1} \right]_{jj} }. \]

Entonces:

\[ t_j= \frac{b_j-\beta_j^0} {\operatorname{s.e.}(b_j)}. \]

¿Qué distribución sigue ahora \(t_j\)?

Estimar \(\sigma^2\) también introduce incertidumbre

Recordemos que:

\[ \mathbf e=\mathbf M_x\mathbf u, \]

donde \(\mathbf M_x\) es simétrica e idempotente y:

\[ \operatorname{rank}(\mathbf M_x)=n-k. \]

Bajo normalidad:

\[ \frac{\mathbf u}{\sigma} \sim \mathcal N(\mathbf 0,\mathbf I_n). \]

Por tanto:

\[ \frac{\mathbf e^\top\mathbf e}{\sigma^2} = \frac{\mathbf u^\top\mathbf M_x\mathbf u}{\sigma^2} \sim \chi^2_{n-k}. \]

Como:

\[ s^2=\frac{\mathbf e^\top\mathbf e}{n-k}, \]

se sigue que:

\[ \frac{(n-k)s^2}{\sigma^2} \sim \chi^2_{n-k}. \]

Dos fuentes de variación

Bajo \(H_0\):

\[ z_j= \frac{ b_j-\beta_j^0 }{ \sqrt{ \sigma^2 [(\mathbf{x}^{\top}\mathbf{x})^{-1}]_{jj} } } \sim\mathcal N(0,1), \]

y:

\[ q= \frac{(n-k)s^2}{\sigma^2} \sim\chi^2_{n-k}. \]

Además, bajo normalidad, \(b_j\) y \(s^2\) son independientes.

Por tanto:

\[ t_j = \frac{z_j}{\sqrt{q/(n-k)}} \sim t_{n-k}. \]

¿Por qué son independientes?

Ejercicio

Muestra que:

\[ \mathbb{C}ov(\mathbf b,\mathbf e) = \sigma^2 (\mathbf x^\top\mathbf x)^{-1} \mathbf x^\top\mathbf M_x = \mathbf0. \]

Utiliza que:

\[ \mathbf x^\top\mathbf M_x=\mathbf0^\top. \]

Bajo normalidad conjunta, este resultado implica la independencia necesaria para obtener la distribución \(t\).

¿Qué tan compatible es \(b_j\) con \(H_0\)?

Consideremos:

\[ H_0:\beta_j=\beta_j^0, \qquad H_1:\beta_j\neq\beta_j^0. \]

Bajo \(H_0\):

\[ t_j= \frac{b_j-\beta_j^0} {\operatorname{s.e.}(b_j)} \sim t_{n-k}. \]

Para un nivel de significancia \(\alpha\), elegimos el valor crítico \(t_{\alpha/2,(n-k)}\) de forma que:

\[ \mathbb{P} \left( -t_{\alpha/2,(n-k)} < t_j < t_{\alpha/2,(n-k)} \mid H_0 \right) = 1-\alpha. \]

La regla de decisión

Rechazamos \(H_0\) si el valor observado de \(t_j\) cae en alguna de las regiones de rechazo:

\[ |t_j| > t_{\alpha/2,(n-k)}. \]

En caso contrario, no rechazamos \(H_0\).

Bajo \(H_0\):

\[ t_j\sim t_{n-k}, \]

por lo que la probabilidad de rechazar una hipótesis nula verdadera es \(\alpha\).

No rechazar \(H_0\) no significa demostrar que \(H_0\) es verdadera.

¿Qué significa elegir \(\alpha\)?

Toda regla de decisión puede llevarnos a cometer errores:

  • Cometemos un error tipo I cuando rechazamos \(H_0\) siendo verdadera.

  • Cometemos un error tipo II cuando no rechazamos \(H_0\) siendo falsa.

El nivel de significancia controla la probabilidad del error tipo I:

\[ \mathbb{P} (\text{rechazar }H_0\mid H_0\text{ verdadera}) = \alpha. \]

Para un tamaño de muestra dado, reducir \(\alpha\) disminuye el riesgo de error tipo I, pero hace más difícil rechazar \(H_0\) cuando es falsa.

Intervalos de confianza

¿Qué valores de \(\beta_j\) son compatibles con los datos?

Sabemos que:

\[ \mathbb{P} \left( -t_{\alpha/2,(n-k)} < \frac{b_j-\beta_j} {\operatorname{s.e.}(b_j)} < t_{\alpha/2,(n-k)} \right) = 1-\alpha. \]

Reordenando:

\[ \mathbb{P} \left( b_j- t_{\alpha/2,(n-k)}\operatorname{s.e.}(b_j) < \beta_j < b_j+ t_{\alpha/2,(n-k)}\operatorname{s.e.}(b_j) \right) = 1-\alpha. \]

Esto da lugar al intervalo de confianza:

\[ b_j \pm t_{\alpha/2,(n-k)} \operatorname{s.e.}(b_j). \]

Precisión e intervalo de confianza

El ancho del intervalo depende de:

\[ t_{\alpha/2,(n-k)} \qquad\text{y}\qquad \operatorname{s.e.}(b_j). \]

Para un mismo nivel de confianza:

un menor error estándar produce un intervalo más estrecho.

Por tanto, una estimación más precisa permite acotar con mayor precisión los valores de \(\beta_j\) compatibles con la evidencia.

Intervalos de confianza y pruebas de hipótesis

Para una prueba bilateral:

\[ H_0:\beta_j=\beta_j^0, \]

al nivel de significancia \(\alpha\):

\[ \text{no rechazamos }H_0 \]

si y solo si:

\[ \beta_j^0 \]

pertenece al intervalo de confianza \(1-\alpha\).

Pruebas de una sola cola

¿Cuándo tiene sentido una prueba de una sola cola?

Hasta ahora hemos considerado:

\[ H_0:\beta_j=\beta_j^0, \qquad H_1:\beta_j\neq\beta_j^0. \]

Pero algunas preguntas económicas tienen una dirección específica.

Por ejemplo:

\[ H_1:\beta_j>\beta_j^0 \]

o:

\[ H_1:\beta_j<\beta_j^0. \]

En estos casos, la evidencia relevante se encuentra únicamente en una de las colas de la distribución.

La dirección de la alternativa debe establecerse antes de observar los resultados.

¿Por qué cambia la región de rechazo?

Supongamos que:

\[ H_1:\beta_j>\beta_j^0. \]

Valores suficientemente grandes de \(b_j\) son evidencia a favor de esta alternativa.

En cambio, valores muy pequeños de \(b_j\) pueden ser incompatibles con \(H_0\), pero no constituyen evidencia a favor de:

\[ H_1:\beta_j>\beta_j^0. \]

Por ello concentramos todo el nivel de significancia \(\alpha\) en la cola derecha.

Pruebas de una sola cola

Para una prueba de cola derecha:

\[ H_0:\beta_j\leq\beta_j^0, \qquad H_1:\beta_j>\beta_j^0, \]

evaluamos el estadístico en el valor frontera \(\beta_j^0\):

\[ t_j= \frac{b_j-\beta_j^0} {\operatorname{s.e.}(b_j)}. \]

Rechazamos \(H_0\) si:

\[ t_j>t_{\alpha,(n-k)}. \]

Para una prueba de cola izquierda:

\[ H_0:\beta_j\geq\beta_j^0, \qquad H_1:\beta_j<\beta_j^0, \]

rechazamos si:

\[ t_j<-t_{\alpha,(n-k)}. \]

Valores \(p\)

El valor \(p\)

Hasta ahora hemos comparado el estadístico observado con un valor crítico.

Podemos expresar la misma evidencia mediante el valor \(p\):

El valor \(p\) mide qué tan extremo sería observar un estadístico como el obtenido, o uno aún más extremo, si \(H_0\) fuera verdadera.

Para una prueba bilateral:

\[ p= 2\,\mathbb{P} \left( T_{n-k}\geq |t_j| \right). \]

Para una prueba de cola derecha:

\[ p= \mathbb{P} \left( T_{n-k}\geq t_j \right). \]

Para una prueba de cola izquierda:

\[ p= \mathbb{P} \left( T_{n-k}\leq t_j \right). \]

Valor \(p\) y nivel de significancia

La regla de decisión es:

\[ p<\alpha \quad\Longrightarrow\quad \text{rechazamos }H_0. \]

\[ p\geq\alpha \quad\Longrightarrow\quad \text{no rechazamos }H_0. \]

El valor \(p\) no es:

  • la probabilidad de que \(H_0\) sea verdadera;
  • la magnitud del efecto;
  • una medida de importancia económica.

Es una medida de compatibilidad entre los datos observados y \(H_0\).

Valores \(p\)

Ejercicio

Sea:

\[ n=40,\qquad k=2,\qquad b_2=10.21,\qquad \beta_2^0=5.5, \]

y:

\[ \operatorname{s.e.}(b_2)=2.09. \]

Considera:

\[ H_0:\beta_2\leq5.5, \qquad H_1:\beta_2>5.5. \]

  1. Calcula el estadístico \(t\).

  2. Muestra que el valor \(p\) es aproximadamente \(0.0152\).

  3. Interpreta el resultado.

Pruebas de hipótesis conjuntas

¿Y si la hipótesis contiene varias restricciones?

Hasta ahora hemos evaluado una restricción a la vez.

Pero muchas preguntas econométricas involucran varias afirmaciones simultáneas.

Por ejemplo:

\[ H_0:\beta_2=0,\qquad \beta_3=0. \]

La pregunta ya no es si cada restricción parece razonable por separado, sino:

¿Son compatibles los datos con que todas las restricciones se cumplan simultáneamente?

Restricciones lineales

Podemos escribir una hipótesis conjunta como:

\[ H_0: \mathbf R\boldsymbol\beta=\mathbf r, \]

donde:

  • \(\mathbf R\) es una matriz de dimensión \(m\times k\);
  • \(\mathbf r\) es un vector de dimensión \(m\times1\);
  • \(m=\operatorname{rank}(\mathbf R)\) es el número de restricciones linealmente independientes.

Cada renglón de \(\mathbf R\) representa una restricción.

Restricciones lineales: ejemplo

Consideremos:

\[ y_i = \beta_1 + \beta_2x_{2i} + \beta_3x_{3i} + \beta_4x_{4i} + \beta_5x_{5i} + u_i. \]

Deseamos probar:

\[ H_0: \beta_2=0, \qquad \beta_3=1. \]

Entonces \(m=2\) y:

\[ \boldsymbol{\beta} = \begin{pmatrix} \beta_1\\ \beta_2\\ \beta_3\\ \beta_4\\ \beta_5 \end{pmatrix}, \qquad \mathbf R = \begin{pmatrix} 0&1&0&0&0\\ 0&0&1&0&0 \end{pmatrix}, \qquad \mathbf r = \begin{pmatrix} 0\\ 1 \end{pmatrix}. \]

Restricciones lineales

Ejercicio

Considera:

\[ y_i = \beta_1 + \beta_2x_{2i} + \beta_3x_{3i} + \beta_4x_{4i} + \beta_5x_{5i} + u_i. \]

Escribe \(\mathbf R\) y \(\mathbf r\) para:

\[ H_0: \beta_2+\beta_3=0, \qquad \beta_4=\beta_5. \]

\[ H_0: \beta_2=\beta_3, \qquad \beta_4=0, \qquad \beta_2+\beta_3=\beta_4. \]

¿Qué tan lejos estamos de satisfacer \(H_0\)?

Si \(H_0\) es verdadera:

\[ \mathbf R\boldsymbol\beta-\mathbf r=\mathbf0. \]

En la muestra observamos:

\[ \mathbf R\mathbf b-\mathbf r. \]

Por tanto, una prueba conjunta debe evaluar qué tan grande es:

\[ \mathbf R\mathbf b-\mathbf r, \]

teniendo en cuenta la incertidumbre y la covarianza entre los estimadores.

Distribución de las restricciones estimadas

Sabemos que:

\[ \mathbf b \sim \mathcal N \left( \boldsymbol\beta, \sigma^2 (\mathbf x^\top\mathbf x)^{-1} \right). \]

Por tanto:

\[ \mathbf R\mathbf b-\mathbf r \sim \mathcal N \left( \mathbf R\boldsymbol\beta-\mathbf r, \, \sigma^2 \mathbf R (\mathbf x^\top\mathbf x)^{-1} \mathbf R^\top \right). \]

Bajo:

\[ H_0:\mathbf R\boldsymbol\beta=\mathbf r, \]

se sigue que:

\[ \mathbf R\mathbf b-\mathbf r \sim \mathcal N \left( \mathbf0, \, \sigma^2 \mathbf R (\mathbf x^\top\mathbf x)^{-1} \mathbf R^\top \right). \]

Una distancia conjunta

Si:

\[ \mathbf v \sim \mathcal N (\mathbf0,\boldsymbol\Sigma), \]

entonces:

\[ \mathbf v^\top \boldsymbol\Sigma^{-1} \mathbf v \sim \chi^2_m. \]

Aplicando este resultado a:

\[ \mathbf v=\mathbf R\mathbf b-\mathbf r, \]

obtenemos, bajo \(H_0\):

\[ w= \frac{ (\mathbf R\mathbf b-\mathbf r)^\top \left[ \mathbf R(\mathbf x^\top\mathbf x)^{-1}\mathbf R^\top \right]^{-1} (\mathbf R\mathbf b-\mathbf r) }{ \sigma^2 } \sim\chi^2_m. \]

El estadístico \(F\)

Ya sabemos que:

\[ w\sim\chi^2_m, \]

y:

\[ q= \frac{(n-k)s^2}{\sigma^2} \sim\chi^2_{n-k}. \]

Bajo normalidad, \(w\) y \(q\) son independientes.

Por tanto:

\[ F= \frac{ w/m }{ q/(n-k) } \sim F_{m,n-k}. \]

El estadístico \(F\)

Sustituyendo \(w\) y \(q\):

\[ F= \frac{ (\mathbf R\mathbf b-\mathbf r)^\top \left[ \mathbf R(\mathbf x^\top\mathbf x)^{-1}\mathbf R^\top \right]^{-1} (\mathbf R\mathbf b-\mathbf r)/m }{ s^2 }. \]

Bajo:

\[ H_0:\mathbf R\boldsymbol\beta=\mathbf r, \]

tenemos:

\[ F\sim F_{m,n-k}. \]

El estadístico \(F\)

Ejercicio

Demuestra que:

\[ F\sim F_{m,n-k}. \]

Pista.

Escribe:

\[ F= \frac{w/m}{q/(n-k)} \]

y utiliza las distribuciones de \(w\) y \(q\).

Modelo restringido y modelo no restringido

¿Qué significa imponer \(H_0\)?

El modelo no restringido permite que los coeficientes se estimen libremente.

El modelo restringido obliga a que se cumpla:

\[ \mathbf R\boldsymbol\beta=\mathbf r. \]

Como el modelo restringido tiene menos libertad:

\[ RSS_R\geq RSS_U. \]

La pregunta es:

¿Cuánto empeora el ajuste cuando obligamos al modelo a satisfacer \(H_0\)?

La pérdida de ajuste

Para restricciones lineales podemos calcular:

\[ F= \frac{ (RSS_R-RSS_U)/m }{ RSS_U/(n-k) }. \]

El numerador mide cuánto aumenta el \(RSS\) al imponer las \(m\) restricciones.

El denominador mide la variabilidad residual del modelo no restringido.

Un aumento grande del \(RSS\), relativo a la variabilidad residual, constituye evidencia contra \(H_0\).

Regla de decisión

Bajo \(H_0\):

\[ F\sim F_{m,n-k}. \]

Como:

\[ F\geq0, \]

la región de rechazo se encuentra en la cola derecha.

Rechazamos \(H_0\) si:

\[ F> F_{\alpha,(m,n-k)}. \]

En caso contrario, no rechazamos \(H_0\).

Prueba \(F\) de significancia global

Consideremos el modelo con \(k\) parámetros:

\[ y_i= \beta_1+ \beta_2x_{2i} +\cdots+ \beta_kx_{ki} +u_i. \]

La hipótesis de significancia global es:

\[ H_0: \beta_2=\beta_3=\cdots=\beta_k=0. \]

Por tanto, tenemos:

\[ m=k-1 \]

restricciones.

Ejercicio

Muestra que:

\[ F= \frac{ R^2/(k-1) }{ (1-R^2)/(n-k) }. \]

Valor \(p\) para la prueba \(F\)

Si el estadístico observado es \(F_{\text{obs}}\):

\[ p= \mathbb{P} \left( F_{m,n-k} \geq F_{\text{obs}} \right). \]

La regla es la misma que antes:

\[ p<\alpha \quad\Longrightarrow\quad \text{rechazamos }H_0. \]

El valor \(p\) expresa qué tan extremo resulta el \(F\) observado bajo las restricciones impuestas por \(H_0\).

Relación entre las pruebas \(t\) y \(F\)

Una sola restricción lineal

Consideremos:

\[ H_0: \boldsymbol{\lambda}^{\top}\boldsymbol{\beta} = \theta, \]

donde:

\[ \boldsymbol{\lambda} = \begin{pmatrix} \lambda_1\\ \lambda_2\\ \vdots\\ \lambda_k \end{pmatrix}. \]

Esta hipótesis puede escribirse como:

\[ H_0: \mathbf R\boldsymbol{\beta} = \mathbf r, \]

con:

\[ \mathbf R = \boldsymbol{\lambda}^{\top}, \qquad \mathbf r=\theta. \]

Por tanto:

\[ m=1. \]

Con una restricción, \(F=t^2\)

Ejercicio

Muestra que, para probar:

\[ H_0: \boldsymbol{\lambda}^{\top}\boldsymbol{\beta} = \theta, \]

el estadístico \(t\) puede escribirse como:

\[ t= \frac{ \boldsymbol{\lambda}^{\top}\mathbf b-\theta }{ \sqrt{ s^2 \boldsymbol{\lambda}^{\top} (\mathbf x^{\top}\mathbf x)^{-1} \boldsymbol{\lambda} } }. \]

Muestra además que el estadístico \(F\) para la misma restricción satisface:

\[ F=t^2. \]

Por tanto:

\[ T_{n-k}^2 \sim F_{1,n-k}. \]

¿Qué implica \(F=t^2\)?

Para una sola restricción lineal bilateral, las pruebas \(t\) y \(F\) conducen a la misma decisión.

En particular:

\[ H_0:\beta_j=\beta_j^0 \]

es un caso especial de:

\[ H_0: \boldsymbol{\lambda}^{\top}\boldsymbol{\beta} = \theta. \]

La prueba \(t\), además, conserva información sobre la dirección de la diferencia y se relaciona directamente con los intervalos de confianza.

¿Y si tenemos varias restricciones?

Supongamos que queremos probar simultáneamente:

\[ H_0: \beta_1=1, \qquad \beta_2=0. \]

Una posibilidad sería realizar dos pruebas \(t\):

\[ H_{01}:\beta_1=1, \]

y:

\[ H_{02}:\beta_2=0. \]

Pero:

¿equivale evaluar ambas restricciones por separado a evaluar correctamente la hipótesis conjunta?

Dos pruebas \(t\) separadas

Cada prueba individual genera un intervalo:

\[ b_1- t_{\alpha/2,(n-k)} \operatorname{s.e.}(b_1) < \beta_1 < b_1+ t_{\alpha/2,(n-k)} \operatorname{s.e.}(b_1), \]

y:

\[ b_2- t_{\alpha/2,(n-k)} \operatorname{s.e.}(b_2) < \beta_2 < b_2+ t_{\alpha/2,(n-k)} \operatorname{s.e.}(b_2). \]

Al considerar ambos intervalos simultáneamente obtenemos una región rectangular en el plano:

\[ (\beta_1,\beta_2). \]

La región conjunta

La prueba \(F\) utiliza la matriz completa de varianzas y covarianzas:

\[ \widehat{\mathbb{V}ar}(\mathbf b). \]

Para dos restricciones, la región conjunta tiene la forma:

\[ (\mathbf b-\boldsymbol{\beta})^{\top} \left[ \widehat{\mathbb{V}ar}(\mathbf b) \right]^{-1} (\mathbf b-\boldsymbol{\beta}) < 2F_{\alpha,(2,n-k)}. \]

Esta región es una elipse.

Pruebas individuales vs. prueba conjunta

Las pruebas \(t\) individuales consideran cada coeficiente por separado.

La prueba \(F\) considera simultáneamente:

  • las varianzas de los estimadores;
  • sus covarianzas;
  • el número de restricciones.

¿Por qué necesitamos una prueba conjunta?

No podemos sustituir una prueba conjunta por varias pruebas \(t\) separadas porque:

  1. Si cada prueba individual utiliza un nivel de significancia \(\alpha\), la probabilidad de cometer al menos un error tipo I en el conjunto no es, en general, \(\alpha\).

  2. Las pruebas individuales ignoran la covarianza entre los estimadores.

La prueba \(F\) evalúa las restricciones simultáneamente utilizando la distribución conjunta de los estimadores.

Resumen

¿Qué hemos aprendido?

¿Qué podemos sostener acerca de los parámetros del modelo a partir de una muestra?

Aprendimos a:

  • reconocer que una estimación puntual está sujeta a incertidumbre;
  • utilizar la distribución de los estimadores para cuantificar esa incertidumbre;
  • interpretar el error estándar como una medida de precisión;
  • construir intervalos de confianza;
  • evaluar hipótesis sobre un parámetro mediante pruebas \(t\);
  • expresar la evidencia mediante valores \(p\);
  • formular restricciones lineales conjuntas;
  • evaluar varias restricciones simultáneamente mediante pruebas \(F\).

La inferencia no elimina la incertidumbre. Nos permite incorporarla explícitamente cuando construimos evidencia.

¿Qué sigue?

Hasta ahora hemos estudiado cómo cuantificar la incertidumbre de nuestros estimadores y cómo utilizarla para evaluar hipótesis sobre los parámetros del modelo.

Pero la precisión de esos estimadores depende también de la información contenida en los regresores.

¿Qué ocurre cuando distintas variables explicativas contienen información muy parecida entre sí?