v. 2026.03.22
Consideremos el modelo:
\[ \mathbf{y}=\mathbf{x}\boldsymbol{\beta}+\mathbf{u} \]
Y supongamos que el vector \(\mathbf{x}\) es estocástico. En este caso:
\[ \begin{align} \mathbb{E}(\mathbf{b}) = & \boldsymbol{\beta}+ \mathbb{E}[\mathbf{(x'x)}^{-1}(\mathbf{x'u})]\\[6pt] \neq & \boldsymbol{\beta}+ (\mathbf{x'x})^{-1}\mathbf{x'}\mathbb{E}(\mathbf{u}) \end{align} \]
Se puede demostrar que todas las propiedades de los estimadores de MCO se siguen satisfaciendo si suponemos que el vector \(\mathbf{x}\) y el vector \(\mathbf{u}\) son independientes. Es decir:
\[ \begin{align} \mathbb{E}(\mathbf{u}|\mathbf{x})&=\mathbb{E}(\mathbf{u})\\ &=\mathbf{0} \end{align} \]
Lo anterior nos permite calcular:
\[ \begin{align} \mathbb{E}(\mathbf{y}|\mathbf{x})= & \mathbf{x} \beta\\ \mathbb{E}(\mathbf{u'u}|\mathbf{x})= & \sigma^2 \mathbf{I}_n \end{align} \]
Ejercicio
Muestra que:
\[ \begin{align} \mathbb{E}(\mathbf{b|x}) & =\mathbb{E}(\mathbf{b}) \\ &=\beta\\ \text{var}(\mathbf{b|x})&=\sigma^2(\mathbf{x'x})^{-1}\\ \text{var}(\mathbf{b})& = \sigma^2 \mathbb{E}[(\mathbf{x'x})^{-1}]\\ \mathbb{E}(s^2|\mathbf{x})&=\mathbb{E}(s^2)\\ &=\sigma^2\\ \end{align} \]
Lo anterior implica que el teorema de Gauss-Markov sigue siendo válido cuando las \(\mathbf{x}\) son estocásticas. ¿Por qué? (\(\textbf{Pista}\): Usa la ley de las expectativas iteradas.)
Cuando las \(\mathbf{x}\) son estocásticas, tambien resulta importante suponer que:
\[ \begin{align} & p\lim \left(\frac{1}{n}\mathbf{u'u}\right)=\mathbf{\Omega}\\[8pt] & p\lim \left(\frac{1}{n}\mathbf{x'x}\right)=\mathbf{Q}\\[8pt] & p\lim \left(\frac{1}{n}\mathbf{x'u}\right)=\mathbf{0} \end{align} \]
Ejercicio
Muestra que el estimador de MCO para \(\beta\) sigue siendo consistente cuando las \(\mathbf{x}\) son estocásticas.
Ejercicio
Definamos la matriz de varianzas y covarianzas asintótica de \(\mathbf{b}\) como:
\[ \text{asy var}(\mathbf{b})=\frac{1}{n} \lim_{n\rightarrow\infty}\mathbb{E}[\sqrt{n}(\mathbf{b}-\beta)][\sqrt{n}(\mathbf{b}-\beta)]' \]
Muestra que esta es igual a:
\[ \text{asy var}(\mathbf{b})= \frac{1}{n}\sigma^2 \mathbf{Q}^{-1} \]
Nota. Calcula el siguiente límite y comenta.
\[ \lim_{n\rightarrow\infty}\mathbb{E}[(\mathbf{b}-\beta)][(\mathbf{b}-\beta)]' \]
Supongamos que el modelo verdadero es:
\[ y_i=\beta_1+\beta_2z_i + v_i \]
Sin embargo no observamos \(z_i\). En su lugar observamos:
\[ x_i=z_i+w_i \]
Suponemos que:
\[ V_i\sim iid\mathcal{N}(0,\sigma^2_V)\;; \quad V=v, w, z \]
Además:
\[ v\perp w; \quad v\perp z; \quad w \perp z \]
y:
\[ p \lim \frac{1}{n}\sum_{i=1}^{n}(V_i-\overline{V})^2=\sigma_V^2 \]
La información disponible nos permite reescribir el modelo en una forma más conocida:
\[ \begin{align} y_i= & \beta_1+\beta_2x_i+u_i;\\[5pt] u_i= & v_i - \beta_2 w_i \end{align} \]
Nota sin embargo que al estimar por MCO:
\[ \begin{align} \mathbb{E}(b_2)&=\beta_2+\mathbb{E}\left(\frac{\text{cov}(x,u)}{\text{var(x)}}\right) \\ &\neq \beta_2 \end{align} \]
Esto se debe a que \(x\) y \(u\) no son independientes. En otras palabras, nos enfrentamos a un problema de endogeneidad.
Dado que no podemos calcular la distribución exacta de \(b_2\), nos concentraremos en ver qué pasa cuando el número de observaciones tiende a infinito. Se puede demostrar que:
\[ p\lim(b_2)=\beta_2-\beta_2\frac{\sigma_w^2}{\sigma_z^2+\sigma_w^2} \]
Por lo tanto el sesgo de \(b_2\) (para muestras grandes) es:
\[ \text{Sesgo}=-\beta_2\frac{\sigma_w^2}{\sigma_z^2+\sigma_w^2} \]
el cual depende del signo de \(\beta_2\).
Ejercicio
Muestra que:
\[ p\lim(b_2)=\beta_2-\beta_2\frac{\sigma_w^2}{\sigma_z^2+\sigma_w^2} \]
Nota. ¿Qué pasa si introducimos en el modelo una variable proxy imperfecta?
Una simulación nos muestra los efectos de los errores de medición en los regresores. Sea el modelo verdadero:
\[ y_i=2+0.8z_i+\nu_i \\ x_i=z_i+\omega_i\\ z_i\sim\mathcal{N}(10,4)\\ \nu_i\sim\mathcal{N}(0,4)\\ \omega_i\sim \mathcal{N}(0,1) \]
Ejercicio
Muestra que si usamos \(x_i\) en lugar de \(z_i\) en la regresión, obtendremos que: \(p \lim(b_2)=0.64\).
La siguiente gráfica nos muestra la distribución de \(b_2\) para \(n=1000\).
Nota que la media de la distribución es cercana a 0.64 aun para una muestra pequeña.
Supongamos que el modelo verdadero es:
\[ Q_i=\beta_1+\beta_2x_i+\varepsilon_i \]
Sin embargo no observamos \(Q_i\). En su lugar observamos:
\[ y_i=Q_i+\psi_i \]
Suponemos que:
\[ W_i\sim iid\mathcal{N}(0,\sigma_W^2); \quad W=\varepsilon, x, \psi \]
Además:
\[ \varepsilon\perp x; \quad \varepsilon \perp \psi; \quad x \perp \psi \]
y:
\[ p \lim \frac{1}{n}\sum_{i=1}^{n}\left(W_i-\overline{W}\right)^2=\sigma_W^2 \]
Ejercicio
Muestra que, cuando la variable dependiente está medida con error, los estimadores de MCO siguen siendo insesgados. Es decir:
\[ \mathbb{E}(b_2)=\beta_2 \]
Aunque los estimadores de MCO siendo insesgados, se puede demostrar que son ineficientes (para muestras grandes). En particular, se puede demostrar que:
\[ \sigma_{b_2}^2=\frac{\sigma_{\varepsilon}^2+\sigma_{\psi}^2}{n\sigma_s^2}\geq\frac{\sigma_{\varepsilon}^2}{n\sigma_x^2} \]
Ejercicio
Muestra que, para muestras grandes:
\[ \sigma_{b_2}^2=\frac{\sigma_{\varepsilon}^2+\sigma_{\psi}^2}{n\sigma_x^2} \]
Nota. ¿Qué pasa si tanto \(x_i\) como \(y_i\) están sujetas a errores de medición?
Imaginemos que:
\[ p\lim\left(\frac{1}{n}\mathbf{x'u}\right)\neq \mathbf{0} \]
En este caso, el estimador de MCO deja de ser consistente:
\[ \begin{align} p\lim(\mathbf{b})&=\boldsymbol{\beta}+p\lim\left(\frac{1}{n}\mathbf{x'x}\right)^{-1}\cdot p\lim\left(\frac{1}{n}\mathbf{x'u}\right)\\ &\neq \boldsymbol{\beta} \end{align} \]
Sin embargo, supongamos que existe u vector de variables \(\mathbf{z}\) de la misma dimensión que \(\mathbf{x}\), tal que:
\[ \begin{align} & p\lim\left(\frac{1}{n}\mathbf{z'u}\right)=\mathbf{0}\\ & p\lim\left(\frac{1}{n}\mathbf{z'x}\right)=\boldsymbol{\Sigma}\\ & p\lim\left(\frac{1}{n}\mathbf{z'z}\right)=\boldsymbol{\Sigma}^* \end{align} \]
donde las matrices \(\boldsymbol{\Sigma}\) y \(\boldsymbol{\Sigma}^*\) deben existir y ser no singulares. Las variables en \(\mathbf{z}\) pueden utilizarse como instrumentos de \(\mathbf{x}\).
¿Cómo utilizamos el vector de instrumentos \(\mathbf{z}\)? Supongamos que el modelo es el de siempre:
\[ \mathbf{y}=\mathbf{x}\boldsymbol{\beta}+\mathbf{u} \]
Pre multiplicamos ambos lados de la ecuación por \(\mathbf{z'}\):
\[ \begin{align} \mathbf{y}^*&=\mathbf{x}^*\boldsymbol{\beta}+\mathbf{u}^*,\\ \mathbf{y}^*&=\mathbf{z'y}\\ \mathbf{x}^*&=\mathbf{z'x}\\ \mathbf{u}^*&=\mathbf{z'u} \end{align} \]
Ejercicio
Muestra que si estimamos el modelo resultante por MCO obtenemos:
\[ \hat{\boldsymbol{\beta}}_{IV}=(\mathbf{z'x})^{-1}(\mathbf{z'y}) \]
que es conocido como el estimador de variables instrumentales de \(\boldsymbol{\beta}\).
Ejercicio
Muestra que el estimador de variables instrumentales de \(\boldsymbol{\beta}\) es consistente y que su varianza asintótica es:
\[ \text{asy var}(\hat{\boldsymbol{\beta}}_{IV})=\frac{1}{n}\sigma^2 \boldsymbol{\Sigma^{-1}\Sigma^*\Sigma'^{-1}} \]
Nota. En la práctica, la varianza asintótica puede estimarse como:
\[ \begin{align} \text{est asy var}(\hat{\boldsymbol{\beta}}_{IV})=\frac{1}{n}s^2\boldsymbol{\Sigma^{-1}\Sigma^*\Sigma'^{-1}}\\[9pt] s^2=\frac{1}{n-k}(\mathbf{y-x}\hat{\boldsymbol{\beta}}_{IV})'(\mathbf{y-x}\hat{\boldsymbol{\beta}}_{IV}) \end{align} \]
Una simulación nos permite comparar los estimadores de MCO y de IV. Sea el modelo verdadero:
\[ \begin{align} &y_i=10+5x_i+u_i\\[5pt] &x_i=2z_i+0.5v_i+u_i\\[5pt] &z_i \sim \mathcal{N}(0,1)\\[5pt] &v_i \sim \mathcal{N}(0,1)\\[5pt] &u_i \sim \mathcal{N}(0,1) \end{align} \]
Nota que \(x_i\) no es independiente de \(u_i\) en la regresión, por lo que los estimadores de MCO estarán sesgados. ¿Podemos utilizar \(z_i\) o \(v_i\) como instrumentos de \(x_i\) en la regresión?
Ejercicio
Utilizando los datos del ejemplo, muestra que si usamos a \(z_i\) como instrumento:
\[ \begin{align} p \lim b_2^{MCO}&=5.19\\ p \lim b_2^{VI}&=5 \end{align} \]
Las siguientes gráficas comparan la distribución de \(\beta_2\) estimado por MCO y VI con n=3200.
¿Qué estimador te parece mejor? ¿Por qué?
Ejercicio
Utiliza los datos: E206–mroz. Estima el modelo utilizando el método de los MCO. ¿Crees que exista un problema de endogeneidad? ¿Por qué? Pista: La variable endógena es la variable educación.
\[ l\text{_}wage_i=\beta_1 + \beta_2 educ_i + \beta_3 exper_i + \beta_4 exper_i^2 + u_i \]
En el ejemplo anterior, estimamos los coeficientes utilizando la variable mothereduc, que representa la educación de la mamá de la \(i\)-ésima observación. (¿Por qué?)
## ## Call: ## ivreg(formula = log(wage) ~ educ + exper + I(exper^2) | mothereduc + exper + I(exper^2), data = data, subset = (wage > 0)) ## ## Coefficients: ## (Intercept) educ exper I(exper^2) ## 0.1981861 0.0492630 0.0448558 -0.0009221
¿Qué pasa si contamos con más instrumentos que variables explicativas?
Sea:
\[ \mathbf{z}=\{\mathbf{z}_1 \quad \mathbf{z}_2 \ldots \mathbf{z}_l\} \]
donde \(l\geq k\). En este caso, podemos usar el método de los mínimos cuadrados en dos etapas.
\[ \mathbf{x}_j=\mathbf{z}\boldsymbol{\delta}_j+\mathbf{e}_j \] donde:
\[ \boldsymbol{\delta}_j= \begin{pmatrix} \delta_{j1} \\ \delta_{j2}\\ \vdots \\ \delta_{jl} \end{pmatrix}, \quad j= 1,2,\ldots, k \]
donde:
\[ \hat{\boldsymbol{\delta}}_j=(\mathbf{z'z})^{-1}(\mathbf{z'x}_j) \]
Y, naturalmente:
\[ \begin{align} \mathbf{x}_j=& \mathbf{z}\hat{\boldsymbol{\delta}}_j+\hat{\mathbf{e}}_j\\ =& \hat{\mathbf{x}}_j +\hat{\mathbf{e}}_j \end{align} \]
y usamos MCO para estimar el modelo:
\[ \mathbf{y}=\hat{\mathbf{x}}\boldsymbol{\beta}+\mathbf{u} \]
De aquí obtenemos el estimador de mínimos cuadrados en dos etapas para \(\boldsymbol{\beta}\):
\[ \hat{\boldsymbol{\beta}}_{2SLS}=(\hat{\mathbf{x}}'\hat{\mathbf{x}})^{-1}\hat{\mathbf{x}}'\mathbf{y} \]
En el ejemplo de antes, estimamos los coeficientes utilizando las variables mothereduc y fathereduc, donde esta útima representa la educación del papá de la \(i\)-ésima observación.
## ## Call: ## ivreg(formula = log(wage) ~ educ + exper + I(exper^2) | mothereduc + fathereduc + exper + I(exper^2), data = data, subset = (wage > 0)) ## ## Coefficients: ## (Intercept) educ exper I(exper^2) ## 0.048100 0.061397 0.044170 -0.000899
Ejercicio
Muestra que:
\[ \begin{align} 1.&\quad \mathbf{z}'\hat{\mathbf{e}}_j=0\quad j=1,2,\ldots,k\\ 2.&\quad\hat{\mathbf{x}}'_j\hat{\mathbf{e}}_j=0\quad j=1,2,\ldots,k\\ 3.&\quad\hat{\mathbf{x}}'_m\hat{\mathbf{e}}_j=0 \quad\forall \quad m\neq j, \quad j,m=1,2,\ldots,k \end{align} \]
Usando lo anterior, muestra además que:
\[ \begin{align} \hat{\boldsymbol{\beta}}_{2SLS}&=(\hat{\mathbf{x}}'\hat{\mathbf{x}})^{-1}\hat{\mathbf{x}}'\mathbf{y}\\[5pt] &= (\hat{\mathbf{x}}'\mathbf{x})^{-1}\hat{\mathbf{x}}'\mathbf{y} \end{align} \]
Ejercicio
Demuestra que las estimaciones por mínimos cuadrados en dos etapas y por variables instrumentales son equivalentes cuando tenemos igual número de instrumentos que de variables endógenas. Es decir:
\[ \hat{\boldsymbol{\beta}}_{2SLS}=\hat{\boldsymbol{\beta}}_{IV} \]
Nota. ¿Puedes decir cuál es la ventaja de utilizar el método de los mínimos cuadrados en dos etapas?
Para seleccionar los instrumentos, primero tenemos que asegurarnos que la correlación entre estos y las variables que van a instrumentar sea alta.
Para ver lo anterior, considera el estimador de variables instrumentales:
\[ \begin{align} \hat{\boldsymbol{\beta}}_{IV}&= (\hat{\mathbf{z}}'\hat{\mathbf{x}})^{-1}(\hat{\mathbf{z}}'\mathbf{y}) \\ &=\boldsymbol{\beta}+(\hat{\mathbf{z}}'\hat{\mathbf{x}})^{-1}(\hat{\mathbf{z}}'\mathbf{u}) \end{align} \]
O, en un modelo de regresión simple:
\[ \hat{\beta}_{2,IV}=\beta_2+\frac{\text{cov}(z,u)}{\text{cov}(z,x)} \]
Cuando la cov(\(z,x\)) se acerca a cero, el sesgo del estimador de \(\boldsymbol{\beta}\) se acerca a infinito. En este caso decimos que \(z\) es un instrumento débil de \(x\). Es fuerte en caso contrario.
Para hacer una prueba seria para instrumentos fuertes, supongamos que \(x_k\) es endógena y que contamos con un instrumento \(z_1\). Entonces:
\[ x_k=\gamma_1+\gamma_2x_2+\ldots+\gamma_{k-1}x_{k-1}+\theta_1z_1+\nu_k \]
\[ x_k=\gamma_1+\gamma_2x_2+\ldots+\gamma_{k-1}x_{k-1}+\theta_1z_1+\dots+\theta_lz_l+\nu_k \]
En el ejemplo anterior tenemos:
## df1 df2 statistic p-value ## Weak instruments 2 423 55.4003 4.268909e-22
La relación anterior también deja en claro que el sesgo del estimador de \(\boldsymbol{\beta}\) tiende a cero conforme la \(cov(z,u)\) se acerca a cero. Cuando esto ocurre decimos que tenemos instrumentos exógenos.
Una forma de saber si tenemos instrumentos exógenos es realizando la prueba de Sargan.
Para realizar la prueba de Sargan:
\[ \hat{\boldsymbol{\beta}}_{IV}=(\mathbf{z}'\mathbf{x}')^{-1}(\mathbf{z}'\mathbf{y}) \]
\[ \mathbf{e}_{IV}=\mathbf{y}-\mathbf{x}\hat{\boldsymbol{\beta}}_{IV} \]
\[ \mathbf{e}_{IV}= \mathbf{z}\gamma+v \]
\[ nR^2\sim \chi^2_{(l-k \; g.l)} \] donde \(l\) es el número de instrumentos y \(k\) es el número de variables endógenas.
\[ \begin{align} H_0\; :& \quad \text{cov}(\mathbf{z},\mathbf{e}_{IV})=0\\ H_1\; :& \quad \text{cov}(\mathbf{z},\mathbf{e}_{IV})\neq 0 \end{align} \] Naturalmente, si rechazamos \(H_0\) los instrumentos no son exógenos. En nuestro ejemplo de antes tenemos:
## df1 df2 statistic p-value ## Sargan 1 NA 0.3780715 0.5386372
Finalmente, también necesitamos una prueba para saber si nuestra regresión debe estimarse por el método de las variables instrumentales, o si el método de los MCO es suficiente.
La prueba que debemos realizar en este caso se conoce como la prueba de Hausman.
Para mostrar como funciona la prueba de Hausman, supongamos que el modelo es:
\[ y_i=\beta_1+\beta_2x_i+u_i \]
y sospechamos que podría haber una relación entre \(x_i\) y \(u_i\). Suponemos que tenemos dos buenos instrumentos para \(x_i\): \(z_1\) y \(z_2\).
\[ x_i=\gamma_1+\theta_1z_{1i}+\theta_2z_{2i}+v_i \] y recuperamos los residuales:
\[ \hat{v_i}= x_i - \hat{\gamma_1}-\hat{\theta}_1z_{1i}-\hat{\theta}_2z_{2i} \]
\[ y_i=\beta_1 + \beta_2x_i + \delta\hat{v}_i+\nu_i \] Una prueba \(t\) nos permitirá probar la siguiente hipótesis:
\[ \begin{align} H_0 \; &: \quad \delta=0\\[6pt] H_1\; &: \quad \delta\neq 0 \end{align} \]
Si rechazamos \(H_0\) el método de las variables instrumentales es apropiado. De otra forma usamos MCO.
¿Por qué?
En el ejemplo de antes tenemos:
## df1 df2 statistic p-value ## Wu-Hausman 1 423 2.792592 0.09544055
Nota.
En caso de tener más de una variable explicativa relacionada con el error, \(u\), hacemos tantas regresiones como sea necesario en el paso 1 e incluimos los residuales de estas en la regresión del paso 2. La prueba de hipótesis en este caso implicaría el uso de una \(F\) en lugar de una \(t\).
Utilia los datos: E207–fertility para explicar ¿cómo afecta la fertilidad a la oferta de trabajo? Es decir, ¿cuánto disminuye la oferta de trabajo de una mujer cuando tiene un hijo más?
\[ \begin{align} &\text{morekids = 1 if mom had more than 2 children}\\ &\text{boy1st = 1 if 1st child was a boy}\\ &\text{boy2nd = 1 if 2nd child was a boy}\\ &\text{samesex = 1 if 1st two children same sex}\\ &\text{agem1 = age of mom at census}\\ &\text{black = 1 if mom is black}\\ &\text{hispan = 1 if mom is Hispanic}\\ &\text{othrace = 1 if mom is not black, Hispanic or white}\\ &\text{weeksm1 = mom's weeks worked in 1979} \end{align} \]
Realiza un análisis completo del modelo:
\[ morekids_i=\beta_1+\beta_2weeksworked_i+u_i \]