v. 2026.02.27
Uno de los problemas que podemos encontrar en datos de series temporales es el de autocorrelación. Formalmente, existe autocorrelación cuando:
\[ \begin{align} \text{cov}(u_i, u_j) &= \mathbf{E}(u_iu_j)\\ &=\sigma_{ij}, \end{align} \] para \(i\neq j, i,j = 1,2,\dots,n\).
Por lo tanto, la matriz de covarianzas de los errores se ve como:
\[ \boldsymbol{\Omega} = \begin{pmatrix} \sigma^2 & \sigma_{12} & \sigma_{13} & \dots & \sigma_{1n} \\ \sigma_{12} & \sigma^2 & \sigma_{23} & \dots & \sigma_{2n} \\ \vdots & \vdots & \vdots & \ddots & \vdots \\ \sigma_{1n} & \sigma_{2n} & \sigma_{3n} & \dots & \sigma^2 \end{pmatrix} \]
(Al igual que en el caso de la heteroscedasticidad) En presencia de autocorrelación:
Consideremos el modelo de regresión simple:
\[ \text{Remuneración}_t = \beta_1 + \beta_2 \text{Productividad}_t + u_t \]
Donde medimos la relación que existe entre los índices de producción por hora y remuneración real por hora de 1960 a 2005 en los Estados Unidos. (La base de los índices es 1992=100.)
Ejercicio
Utiliza los datos del archivo E204–productivity.csv. Estima el modelo utilizando el método de los MCO. Explica tus resultados.
Dado que la autocorrelación se refiere a la relación que existe entre los errores del modelo, \(u_t\), una gráfica de los residuales, \(e_t\), (o de los residuales estandarizados) contra el tiempo nos permite detectar la existencia de patrones identificables a simple vista.
Otra posible evidencia de la presencia de autocorrelación es el correlograma. Este no es más que la gráfica de la función de autocorrelación de los errores del modelo. Esta se calcula como:
\[ r_k = \frac{Cov(u_t,u_{t-k})}{Var(u_t)} \\ \] para todo \(k=1,2,\dots\).
Ejercicio
Supongamos que los errores del modelo siguen un proceso autorregresivo de orden 1, AR(1). Es decir:
\[ u_t = \rho u_{t-1} + \varepsilon_t, \] para \(\varepsilon \sim \mathcal{N}(0,\sigma^2)\) y \(|\rho|<1\). Además, suponemos que \(\varepsilon_t\) y \(u_t\) son independientes y que el proceso es estacionario. Calcula:
Para cualquier valor de \(|\rho| < 1\), grafica en un mismo diagrama la \(k\)-ésima correlación para \(k = 0, 1, 2, 3, 4\).
Cuando no conocemos el proceso que siguen los errores del modelo, la función de autocorrelación tiene que estimarse:
\[ \begin{align} \hat{r}_k &= \frac{Cov(e_t, e_{t-k})}{Var(e_t)}\\ &= \frac{\sum_{t=1}^{T-k} (e_t - \bar{e})(e_{t+k} - \bar{e})}{\sum_{t=1}^T (e_t - \bar{e})^2}, \end{align} \] para \(k=1,2,\dots\).
La estimación de la función de autocorrelación también nos permite calcular intervalos de confianza. Estos se calculan tomando en cuenta que:
\[ \sqrt{T}r_k \sim \mathcal{N}(0,1). \] Entonces, por ejemplo, el valor estimado de \(r_k\), \(\hat{r}_k\), es significativo al 5% si:
\[ -1.96 \geq \sqrt{T}r_k \geq 1.96 \]
En el ejemplo anterior tenemos:
El correlograma muestra evidencia de autocorrelación entre varios retardos de los errores.
El estadístico \(Q\) es una prueba estadística cuya hipótesis es:
\[ \begin{align} H_0: &\ \text{No existe correlación de orden }k\\ H_1: &\ \text{Existe correlación de orden }k \end{align} \]
El estadístico \(Q\) se calcula como:
\[ Q = T(T+2) \sum_{j=1}^k \frac{\hat{r}_k^2}{T-j} \]
Y, si la hipótesis nula es correcta, \(Q \sim \chi^2\) con \(k\) grados de libertad.
En el ejemplo anterior, para el primer retardo tenemos:
## ## Box-Ljung test ## ## data: data$res ## X-squared = 34.93, df = 1, p-value = 3.418e-09
Y para el segundo:
## ## Box-Ljung test ## ## data: data$res ## X-squared = 57.684, df = 2, p-value = 2.98e-13
Supongamos que el modelo es:
\[ \begin{align} \mathbf{y} &= \mathbf{x}\boldsymbol{\beta} + \mathbf{u}\\ u_t &= \gamma + \sum_{i=2}^k \delta_i x_{it} + \sum_{j=1}^p \rho_j u_{t-j} \end{align} \]
En la prueba de Breusch-Godfrey se plantea la siguiente hipótesis:
\[ \begin{align} H_0: &\ \mathbb{E}(u_t u_\tau)=0 \ \text{para todo } t\neq \tau \\ H_1: &\ \mathbb{E}(u_t u_\tau)\neq 0 \ \text{para al menos un } \ t\neq \tau \end{align} \]
Los pasos para realizar la prueba de Breusch-Godfrey son los siguientes:
\[ e_t = \gamma + \sum_{i=2}^k \delta_i x_{it} + \sum_{j=1}^p \rho_j e_{t-j} + \epsilon_t \]
En el ejemplo, para \(p=1\) tenemos:
## ## Breusch-Godfrey test for serial correlation of order up to 1 ## ## data: mod ## LM test = 34.618, df = 1, p-value = 4.012e-09
La prueba de Durbin-Watson es una de las pruebas más conocidas, pero a la vez una de las más limitadas para detectar la autocorrelación. La prueba supone que:
\[ u_t = \rho u_{t-1} + \varepsilon_t, \] donde \(\varepsilon_t\) es un ruido blanco. La hipótesis de la prueba es:
\[ \begin{align} H_0: &\ \rho = 0\\ H_1: &\ \rho \neq 0\\ \end{align} \]
Los pasos para realizar la prueba de Durbin-Watson son los siguientes:
\[ DW = \frac{\sum_{t=2}^T (e_t - e_{t-1})^2}{\sum_{t=1}^T e_t^2} \]
Nota que \(0\leq DW \leq 4\).
Para estimar un modelo con heteroscedasticidad multiplicativa seguimos los siguientes pasos:
Como regla de oro, se espera que el estadístico de DW tenga un valor cercano a 2 para rechazar la hipótesis de autocorrelación.
En nuestro ejemplo:
## lag Autocorrelation D-W Statistic p-value ## 1 0.8437328 0.1738878 0 ## Alternative hypothesis: rho != 0
Si logramos mostrar que nuestro modelo presenta problemas de autocorrelación, el siguiente paso es aplicar alguna medida correctiva.
Si conocemos la matriz de varianzas y covarianzas de los errores, aplicamos el método de los MCG. Sin embargo, dado que el término de error es desconocido, la aplicación de este método es inviable.
Si logramos mostrar que nuestro modelo presenta problemas de autocorrelación, el siguiente paso es aplicar alguna medida correctiva:
Si no conocemos la matriz de varianzas y covarianzas de los errores, pero podemos “adivinar” su forma, aplicamos el método de los MCG Factibles (MCGF).
Si no podemos adivinar la forma de la matriz, estimamos el modelo por MCO, pero utilizando el procedimiento de Newey-West para calcular varianzas robustas (varianzas asintóticamente válidas).
Imaginemos que “adivinamos” que los errores del modelo siguen un proceso autorregresivo de orden 1, \(AR(1)\). Es decir:
\[ u_t = \rho u_{t-1} + \varepsilon_t \]
Esta ecuación se estima por MCO usando \(e_t\) como estimador de \(u_t\). Con el valor estimado de \(\rho\) podemos transformar las variables en nuestro modelo calculando para toda variable \(z_t\) (incluyendo la constante):
\[ \tilde{z}_t = z_t - \rho z_{t-1} \]
Aplicando esta transformación obtenemos:
## ## Call: ## lm(formula = tRcompb ~ tconst + tProdb - 1, data = data) ## ## Coefficients: ## tconst tProdb ## 40.7892 0.5903
## lag Autocorrelation D-W Statistic p-value ## 1 0.2062101 1.564887 0.082 ## Alternative hypothesis: rho != 0
Ejercicio
Responde lo siguiente:
¿Presenta el modelo transformado problemas de autocorrelación?
¿Qué pasa si el modelo se transforma utilizando \(\rho =1\)?
Ejercicio
Muestra que, si \(\rho\) es conocido, los procedimientos de MCGF y MCG son equivalentes.
Nota
La transformación de los datos depende de la forma del proceso \(u_t\). Por ejemplo, si \(u_t\) sigue un proceso \(AR(2)\) tenemos:
\[ u_t = \rho_1 u_{t-1} + \rho_2 u_{t-2} + \varepsilon_t \] Esta ecuación se estima por MCO usando \(e_t\) como estimador de \(u_t\).
En este caso, se usan los valores estimados para \(\rho_1\) y \(\rho_2\) para transformar las variables en nuestro modelo (incluyendo la constante):
\[ \tilde{z}_t = z_t - \rho_1 z_{t-1} - \rho_2 z_{t-2} \]
Ejercicio
Estima el modelo por MCGF bajo el supuesto que el error sigue un proceso \(AR(2)\). Comenta.
Si no conocemos la forma de la matriz de covarianzas de los errores, podemos estimar el modelo por el método de los MCO, pero modificando los errores estándar para que estos tomen cuenta la autocorrelación.
En nuestro ejemplo, si usamos los errores estándar robustos de Newey-West obtenemos:
## ## t test of coefficients: ## ## Estimate Std. Error t value Pr(>|t|) ## (Intercept) 32.741903 3.345565 9.7867 1.294e-12 *** ## Prodb 0.670406 0.037003 18.1174 < 2.2e-16 *** ## --- ## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Naturalmente, los residuales siguen presentando autocorrelación, pero los estimadores son insesgados y las pruebas \(t\) y \(F\) son válidas.
Utiliza los datos: E205–usconsumption. El objetivo es determinar el gasto real en consumo en el periodo 1947-2000 en los Estados Unidos
Usando la variable consumption (Real Consumption Expenditure) como dependiente y el resto de las variables como explicativas, realiza un análisis completo del problema de la autocorrelación.