v. 2026.04.27
Antes, hemos supuesto que la varianza de los errores, \(\sigma^2\), era constante. Sin embargo, las series de tiempo económicas y financieras a menudo violan este supuesto.
Existen dos hechos estilizados clave que motivan la necesidad de modelos de volatilidad.
Agrupamiento de Volatilidad (Volatility Clustering)
Muchas series financieras exhiben períodos de calma seguidos de períodos de alta turbulencia. Los periodos de alta (baja) turbulencia tienden a agruparse.
Colas Pesadas (Leptokurtosis)
Las distribuciones de los rendimientos financieros suelen tener colas más pesadas que una distribución normal: los eventos extremos (grandes caídas o subidas) ocurren con más frecuencia de lo que se esperaría bajo normalidad.
Estos hechos estilizados sugieren que la varianza, aunque puede ser constante en el largo plazo (no condicional), varía en el corto plazo dependiendo de la información disponible. Esto es la heteroscedasticidad condicional
Sea \(y_t\) una serie de tiempo. Esta puede seguir, por ejemplo, un proceso ARMA(\(p,q\)) que puede incluir algunas variables explicativas adicionales (que por sí mismas podrían ser series de tiempo):
\[ \begin{align} y_t &= \phi_0 + \boldsymbol{\beta}\mathbf{x}_t + \sum_{i=1}^p \phi_i y_{t-i} + \sum_{j=1}^q \theta_j \varepsilon_{t-j} + \varepsilon_t\\ \varepsilon_t & \sim WN(0,\sigma^2) \end{align} \]
A diferencia de lo que hemos hecho antes, supondremos ahora que:
\[ \begin{align} \varepsilon_t^2 &= \alpha_0 + \alpha_1 \varepsilon_{t-1}^2 + \alpha_2 \varepsilon_{t-2}^2 + \dots + \alpha_m \varepsilon_{t-m}^2 + \omega_t \\ \alpha_0&>0; \ \alpha_i \geq 0; \ i=1,\dots,m \\ \omega_t &\sim WN (0,\lambda^2) \end{align} \]
El supuesto anterior implica que:
\[ \mathbb{E}(\varepsilon_t^2|\varepsilon_{t-1},\varepsilon_{t-2},\dots,\varepsilon_{t-m}) = \alpha_0 + \alpha_1 \varepsilon_{t-1}^2 + \alpha_2 \varepsilon_{t-2}^2 + \dots + + \alpha_m \varepsilon_{t-m}^2 \]
Es decir, aunque la varianza no condicional de \(\varepsilon_t\) sigue siendo constante (igual a \(\sigma^2\)), la varianza condicional no lo es. Cuando esto ocurre tenemos que:
\[ \varepsilon_{t} \sim \text{ARCH}(m) \]
Nota
Para que el proceso que sigue \(\varepsilon_t\) sea estacionario, es necesario que las raíces del polinomio:
\[ 1- \alpha_1 L - \alpha_2 L^2 - \dots - \alpha_m L^m =0 \] se encuentren fuera del círculo unitario. Si todos los \(\alpha_i\) son no-negativos, esto es equivalente a:
\[ \alpha_1 + \alpha_2 + \dots + \alpha_m <1 \]
Además, en este caso, es fácil demostrar que:
\[ \begin{align} \sigma^2 &=\mathbb{E}(\varepsilon_t^2) \\ &=\frac{\alpha_0}{1-\sum_{i=1}^m \alpha_i} \end{align} \]
Los coeficientes \(\alpha_i\) actúan como pesos que determinan cuánto influyen los choques pasados en la volatilidad actual.
En un ARCH(\(1\)), la persistencia se mide directamente con el valor de \(\alpha_1\).
Una forma alternativa de escribir un ARCH(\(m\)) consiste en suponer que:
\[ \begin{align} \varepsilon_t &= \upsilon_t \sqrt{h_t}\\ \upsilon_t &\sim iid (0,1) \end{align} \] Donde:
\[ h_t = \alpha_0 + \alpha_1 \varepsilon_{t-1}^2 + \alpha_2 \varepsilon_{t-2}^2 + \dots + \alpha_m \varepsilon_{t-m}^2 \] Es fácil demostrar que, en este caso:
\[ \mathbb{E}(\varepsilon_t^2|\varepsilon_{t-1},\varepsilon_{t-2},\dots,\varepsilon_{t-m}) = h_t \]
Si combinamos ambas formas de escribir un modelo ARCH(\(m\)) podemos encontrar las condiciones para que \(\lambda_t\) exista. Por ejemplo, para un ARCH(\(1\)):
\[ h_t = \alpha_0 + \alpha_1 \varepsilon_{t-1}^2 \]
\[ 0 \le \alpha_1 < 1 \]
\[ \alpha_1^2 < \frac{1}{3} \]
Consideremos un ARCH(1):
\[ h_t = \alpha_0 + \alpha_1 \varepsilon_{t-1}^2 \] Nota que:
Nota que, aun si \(\upsilon_t \sim N(0,1)\), los errores \(\varepsilon_t\) de un modelo ARCH presentan colas más pesadas que la normal:
\[ \text{Kurt}(\varepsilon_t) = 3\frac{1-\alpha_1^2}{1-3\alpha_1^2} \; > 3 \quad \text{si } \alpha_1^2 < \tfrac{1}{3}. \] Entonces:
Nota. La leptocurtosis en los modelos ARCH surge endógenamente debido a la variabilidad de \(h_t\). No es necesario suponer una distribución no normal de los errores para obtener colas pesadas.
Ejercicio
Muestra que, para un ARCH(\(1\)) con \(\upsilon_t \sim N(0,1)\):
\[ \text{Kurt}(\varepsilon_t) = 3\frac{1-\alpha_1^2}{1-3\alpha_1^2} \; > 3 . \]
Antes de aplicar pruebas formales, puede observarse la heteroscedasticidad condicional de manera gráfica. Para esto:
Prueba ARCH-LM de Engle (1982). Supongamos que tenemos un modelo ARMA con variables explicativas.
Utilizamos el estadístico \(TR^2\) para probar la siguiente hipótesis:
\[ \begin{align} H_0:& \ \alpha_1 = \alpha_2 = \dots = \alpha_m = 0 \\ H_1: &\ \text{Al menos un }\alpha_i\neq 0\\ TR^2 & \sim \chi^2_m \end{align} \]Nota. Dado que un modelo ARCH(\(m\)) puede interpretarse como un modelo AR(\(m\)) aplicado a los residuales al cuadrado, el correlograma de \(e_t^2\) también ayuda a identificar el valor de \(m\).
Los modelos con efectos ARCH se estiman por el método de máxima verosimilitud.
Cuando \(\upsilon_t\sim iid \mathcal{N}(0,1)\), no es difícil demostrar que:
\[ f(y_t|\mathbf{x,\Omega}) = \frac{1}{\sqrt{2\pi h_t}}\exp\left\{-\frac{1}{2h_t}\left(y_t-\boldsymbol{\beta}\mathbf{x}_t\right)^2\right\} \] donde:
\[ \begin{align} h_t &= \alpha_0 + \alpha_1 \varepsilon_{t-1}^2 + \alpha_2 \varepsilon_{t-2}^2 + \dots + \alpha_m \varepsilon_{t-m}^2 \\ &= \alpha_0 + \alpha_1(y_{t-1}- \boldsymbol{\beta}\mathbf{x}_{t-1})^2 + \alpha_2(y_{t-2}- \boldsymbol{\beta}\mathbf{x}_{t-2})^2+\dots+ \alpha_m(y_{t-m}- \boldsymbol{\beta}\mathbf{x}_{t-m})^2 \end{align} \]
Entonces, la función de verosimilitud de un ARCH(\(m\)) bajo el supuesto de normalidad es:
\[ \mathcal{L}(\boldsymbol{\theta}) = - \frac{T}{2}\ln(2\pi) - \frac{1}{2}\sum_{t=1}^T\ln(h_t) - \frac{1}{2}\sum_{t=1}^T\frac{\left(y_{t}- \boldsymbol{\beta}\mathbf{x}_{t}\right)^2}{h_t} \]
Nota. Naturalmente, la normalidad de \(\upsilon_t\) puede relajarse. Ver, por ejemplo, Hamilton (1992).
Considera un modelo ARCH(\(1\)):
\[ \begin{align} h_t &= \alpha_0 + \alpha_1 \varepsilon_{t-1}^2\\ \varepsilon_t &= \upsilon_t \sqrt{h_t}\\ \upsilon_t &\sim iid(0,1) \end{align} \] Deseamos calcular:
\[ \widehat{h}_{T+s\mid T} = \mathbb{E}(h_{T+s}\mid \Omega_T) \] Este pronóstico puede obtenerse mediante iteración.
No es difícil encontrar que:
\[ \widehat{h}_{T+s\mid T} = \begin{cases} \alpha_0 + \alpha_1\varepsilon_T^2; & \ s=1\\ \alpha_0 + \alpha_1h_{T+s-1}; & \ s>1 \end{cases} \] Esto implica que:
\[ \widehat{h}_{T+s\mid T} = \alpha_0 \sum_{j=0}^{s-1} \alpha_1^j + \alpha_1^s \varepsilon_T^2. \]
Nota que:
\[ \begin{align} \lim_{s\to\infty}\widehat{h}_{T+s\mid T} &= \frac{\alpha_0}{1-\alpha_1}\\ &= \sigma^2 \end{align} \] Esto es:
Ejercicio
Muestra que, para un modelo ARCH(\(1\)):
\[ \begin{align} h_t &= \alpha_0 + \alpha_1 \varepsilon_{t-1}^2\\ \varepsilon_t &= \upsilon_t \sqrt{h_t}\\ \upsilon_t &\sim iid(0,1), \end{align} \] tenemos que:
\[ \widehat{h}_{T+s\mid T} = \alpha_0 \sum_{j=0}^{s-1} \alpha_1^j + \alpha_1^s h_T. \]
Pista. Usa la ley de las expectativas iteradas y que \(\mathbb{E}(\varepsilon_t^2\mid\Omega_{t-1})=h_t\).
Considera la tasa de rendimiento diario de la NYSE U.S. 100 del 4 de enero del 2000 al 16 de julio del 2012:
Ajustamos el siguiente modelo:
\[ \begin{align} y_t &= \phi_0 + \varepsilon_t\\ \varepsilon_t &= \upsilon_t\sqrt{h_t} \\ h_t & = \alpha_0 + \alpha_1\varepsilon_{t-1}^2 \end{align} \]
Finalmente, un pronóstico de \(h_t\) para \(s=20\) periodos hacia adelante resulta en:
Imaginemos ahora que:
\[ \begin{align} \varepsilon_t &= \upsilon_t \sqrt{h_t}\\ \upsilon_t &\sim iid (0,1) \end{align} \]
Pero ahora:
\[ \begin{align} h_t &= \alpha_0 + \Pi(L)\varepsilon_t^2\\ \Pi(L)&=\sum_{j=1}^\infty \pi_j L^j \end{align} \]
Para parametrizar el polinomio \(\Pi(L)\), podemos suponer que:
\[ \begin{align} \Pi(L) &= \frac{\alpha(L)}{1-\delta(L)} \\ &=\frac{\alpha_1 L + \alpha_2 L^2 +\dots+ \alpha_m L^m}{1-\delta_1 L - \delta_2 L^2 -\dots- \delta_r L^r} \end{align} \] donde, por ahora, supondremos que las raíces del polinomio \(1-\delta(L)=0\) se encuentran fuera del círculo unitario.
Se puede demostrar que esto implica que:
\[ \begin{align} h_t = \kappa &+ \delta_1 h_{t-1} + \delta_2 h_{t-2} + \dots + \delta_r h_{t-r} \\ & + \alpha_1 \varepsilon_{t-1}^2 + \alpha_2 \varepsilon_{t-2}^2 + \dots + \alpha_m \varepsilon_{t-m}^2 \end{align} \] con \(\kappa = (1-\delta_1-\delta_2-\dots-\delta_r)\alpha_0\).
El resultado es un modelo ARCH generalizado (Bollerslev, 1986), GARCH(\(r,m\)):
\[ \varepsilon_t \sim \text{GARCH}(r,m) \]
Nota que:
\[ \begin{align} h_t + \varepsilon_t^2 = \kappa & - \delta_1 (\varepsilon_{t-1}^2 - h_{t-1}) - \delta_2 (\varepsilon_{t-2}^2 - h_{t-2}) - \dots - \delta_r(\varepsilon_{t-r}^2 - h_{t-r}) \\ &+ \delta_1 \varepsilon_{t-1}^2 + \delta_2 \varepsilon_{t-2}^2 + \dots + \delta_r \varepsilon_{t-r}^2 \\ & + \alpha_1 \varepsilon_{t-1}^2 + \alpha_2 \varepsilon_{t-2}^2 + \dots + \alpha_m \varepsilon_{t-m}^2 + \varepsilon_t^2 \end{align} \] O:
\[ \begin{align} \varepsilon_t^2 = \kappa & + \sum_{i=1}^p(\delta_i +\alpha_i) \varepsilon_{t-i}^2 + \omega_{t} \\ & - \sum_{j=1}^r\delta_j \omega_{t- j}, \end{align} \] donde \(\omega_t = \varepsilon_t^2-h_t\) es un ruido blanco condicionalmente heteroscedástico y \(p=\max(m,r)\). Esto es, si \(\varepsilon_t \sim GARCH(r,m)\), entonces \(\varepsilon_t^2 \sim ARMA(p,r)\).
Si suponemos que \(\kappa>0\), \(\alpha_i \geq 0\) y \(\delta_j \geq 0\), entonces, de nuestro análisis de los modelos ARMA, podemos deducir que un modelo GARCH(\(r,m\)) es estacionario si todas las raíces del polinomio:
\[ 1-(\delta_1+\alpha_1)L-(\delta_2+\alpha_2)L^2-\dots-(\delta_p+\alpha_p)L^p =0 \] se encuentran fuera del círculo unitario. Dado la no-negatividad de los coeficientes, la condición de estacionariedad se simplifica a:
\[ (\delta_1+\alpha_1)+(\delta_2+\alpha_2)+\dots+(\delta_p+\alpha_p)<1. \]
Además, en este caso, se puede demostrar que:
\[ \sigma^2=\frac{\kappa}{1-\sum_{i=1}^p(\delta_i+\alpha_i)} \]
Consideremos un GARCH(\(1,1\)):
\[ h_t = \kappa + \alpha_1\varepsilon_{t-1}^2 + \delta_1h_{t-1}, \qquad \kappa>0,\ \alpha_1, \ \delta_1\ge0. \]
Observa que:
Nota. El término \(\delta_1 h_{t-1}\) extiende la memoria de la volatilidad sin aumentar el número de rezagos del modelo.
Al igual que en los modelos ARCH, aun si \(\upsilon_t \sim N(0,1)\), los errores \(\varepsilon_t\) de un modelo GARCH presentan colas más pesadas que una distribución normal.
Por ejemplo, para un GARCH(\(1,1\)):
\[ \text{Kurt}(\varepsilon_t) = 3\frac{1 - (\alpha_1+\delta_1)^2}{1 - 3\alpha_1^2 - 2\alpha_1\delta_1 - \delta_1^2}. \] Entonces:
Ejercicio
Muestra que, para un GARCH(\(1,1\)) con \(\upsilon_t \sim N(0,1)\):
\[ \text{Kurt}(\varepsilon_t) = 3\frac{1 - (\alpha_1+\delta_1)^2}{1 - 3\alpha_1^2 - 2\alpha_1\delta_1 - \delta_1^2} >3. \]
Antes de aplicar pruebas formales, puede observarse la heteroscedasticidad condicional de manera gráfica o residual:
Nota. Dado que un modelo GARCH(\(r,m\)) implica un ARMA(\(p,r\)) en los cuadrados de los errores, el correlograma de \(e_t^2\) proporciona información sobre el orden del modelo.
Prueba ARCH-LM de Engle (1982). Supongamos que tenemos un modelo ARMA con variables explicativas.
Utilizamos el estadístico \(TR^2\) para probar la siguiente hipótesis:
\[ \begin{align} H_0:& \ \alpha_1 = \alpha_2 = \dots = \alpha_m = 0 \\ H_1: &\ \text{Al menos un }\alpha_i\neq 0\\ TR^2 & \sim \chi^2_m \end{align} \]Nota. La prueba ARCH–LM contrasta la presencia de heteroscedasticidad condicional, sin distinguir entre estructuras ARCH o GARCH.
Los modelos GARCH se estiman por máxima verosimilitud.
Cuando \(\upsilon_t\sim iid \mathcal{N}(0,1)\), no es difícil demostrar que:
\[ f(y_t|\mathbf{x,\Omega}) = \frac{1}{\sqrt{2\pi h_t}}\exp\left\{-\frac{1}{2h_t}\left(y_t-\boldsymbol{\beta}\mathbf{x}_t\right)^2\right\} \]
donde:
\[ \begin{align} h_t &= \alpha_0 + \alpha_1 \varepsilon_{t-1}^2 + \alpha_2 \varepsilon_{t-2}^2 + \dots + \alpha_m \varepsilon_{t-m}^2 + \delta_1 h_{t-1} + \delta_2 h_{t-2} + \dots + \delta_r h_{t-r}\\ \end{align} \]
Entonces, la función de verosimilitud de un GARCH(\(r,m\)) bajo el supuesto de normalidad es:
\[ \mathcal{L}(\boldsymbol{\theta}) = - \frac{T}{2}\ln(2\pi) - \frac{1}{2}\sum_{t=1}^T\ln(h_t) - \frac{1}{2}\sum_{t=1}^T\frac{\left(y_{t}- \boldsymbol{\beta}\mathbf{x}_{t}\right)^2}{h_t} \]
Notas.
Considera un modelo GARCH(\(1,1\)):
\[ \begin{align} h_t &= \kappa + \alpha_1 \varepsilon_{t-1}^2 + \delta_1h_{t-1}\\ \kappa&>0, \alpha_1, \delta_1\geq 0 \end{align} \] Igual que en el caso de los ARCH, deseamos calcular:
\[ \widehat{h}_{T+s\mid T} = \mathbb{E}(h_{T+s}\mid \Omega_T) \]
No es difícil encontrar que:
\[ \widehat{h}_{T+s\mid T} = \begin{cases} \alpha_0 + \alpha_1\varepsilon_T^2+\delta_1 h_T; & s=1\\ \alpha_0 + (\alpha_1+\delta_1)\widehat{h}_{T+s-1\mid T}; & s>1 \end{cases} \]
Esto implica que:
\[ \widehat{h}_{T+s\mid T} = \sigma^2 + (\alpha_1+\delta_1)^{s-1} \left(\widehat{h}_{T+1\mid T}-\sigma^2\right) \]
Nota que:
\[ \begin{align} \lim_{s\to\infty}\widehat{h}_{T+s\mid T} &= \frac{\kappa}{1-\alpha_1-\delta_1}\\ &= \sigma^2 \end{align} \] Ahora:
Ejercicio
Muestra que, para un modelo GARCH(\(1,1\)):
\[ \widehat{h}_{T+s\mid T} = \sigma^2 + (\alpha_1+\delta_1)^s (h_T-\sigma^2), \]
Pista. Usa la ley de las expectativas iteradas y que \(\mathbb{E}(\varepsilon_t^2\mid\Omega_{t-1})=h_t\).
Considera la tasa de rendimiento diario de la NYSE U.S. 100 del 4 de enero del 2000 al 16 de julio del 2012. Si ahora estimamos un GARCH(\(1,1\)):
Considera el rendimiento del precio spot semanal del Brent (15/may/1987–1/nov/2013).
Ajustamos el siguiente modelo:
\[ \begin{align} y_t &= \mu + \varepsilon_t + \theta_1 \varepsilon_{t-1} \\ \varepsilon_t &= \upsilon_t\sqrt{h_t} \\ h_t & = \alpha_0 + \alpha_1\varepsilon_{t-1}^2 + \beta_1 h_{t-1} \end{align} \]
Finalmente, un pronóstico de \(h_t\) para \(s=200\) periodos hacia adelante resulta en: