Skip to Content

1주차 - 시계열 데이터의 이해 (1)


Time Series Data https://colab.research.google.com/github/kloud80/urban-data-mining/blob/master/08%20Time%20Series/sources/01%20Time%20Series%20Data.ipynb#scrollTo=WldB521kORSx 

  • 시계열 데이터의 이해

  • 시계열 데이터 성질

  • 시계열 분류

  • 통계적 모델을 이용한 시계열


  • 통계적 모델링
  • ARIMA
  • ARCH ARCH (Autoregressive Conditional Heteroskedasticity) 모델은 시계열 데이터에서 변동성이 시간에 따라 변하는 현상을 모델링하기 위해 사용되는 통계적 방법입니다. 이 모델은 1982년에 로버트 엥글(Robert Engle)에 의해 처음 소개되었으며, 그의 이러한 작업으로 인해 그는 2003년에 노벨 경제학상을 수상했습니다. ARCH 모델은 주로 금융 시계열 데이터에서 자주 사용되며, 특히 주식 수익률의 변동성을 모델링하는 데 유용합니다.

ARCH 모델의 기본 개념

  1. 조건부 변동성(Conditional Variance): ARCH 모델의 핵심은 시계열 데이터의 변동성이 과거의 정보에 조건부로 달라진다는 것입니다. 즉, 과거의 데이터 포인트들이 현재의 변동성을 예측하는 데 사용됩니다.
  2. 자기회귀(Autoregressive): ‘자기회귀’는 현재의 값이 과거의 값에 의존한다는 개념을 나타냅니다. ARCH 모델에서는 현재의 변동성이 과거의 오차 항들의 제곱에 의존합니다.
  3. 모델 구조: 일반적인 ARCH(q) 모델은 다음과 같은 형태를 가집니다: σt2=α0+α1ϵt12+α2ϵt22++αqϵtq2\sigma_t^2 = \alpha_0 + \alpha_1 \epsilon_{t-1}^2 + \alpha_2 \epsilon_{t-2}^2 + \cdots + \alpha_q \epsilon_{t-q}^2 여기서 σt2\sigma_t^2는 시간 t에서의 조건부 분산, ϵt\epsilon_t는 오차 항, α0,α1,,αq\alpha_0, \alpha_1, \cdots, \alpha_q는 모델 파라미터입니다.
  4. 변동성 클러스터링(Volatility Clustering): 금융 시장 데이터에서 관찰되는 중요한 현상 중 하나는 큰 가격 변동이 다른 큰 가격 변동을 뒤따르는 경향이 있다는 것입니다. ARCH 모델은 이러한 변동성 클러스터링을 잘 포착합니다.
  5. 확장: ARCH 모델은 GARCH(Generalized ARCH) 모델로 확장되어, 이는 과거의 변동성 자체도 현재의 변동성을 예측하는 데 사용됩니다. GARCH 모델은 실제 금융 데이터에 더 널리 적용됩니다.

사용 사례

  • 금융 시장 분석: 주식, 채권, 환율 등의 금융 자산의 변동성을 분석하고 예측하는 데 사용됩니다.
  • 위험 관리: 금융 기관에서 시장 위험을 측정하고 관리하는 데 중요한 도구로 사용됩니다.
  • 옵션 가격 책정: 변동성은 옵션 가격을 결정하는 중요한 요소이며, ARCH 모델은 이를 모델링하는 데 사용될 수 있습니다. ARCH 모델은 시계열 데이터의 변동성이 일정하지 않고 시간에 따라 변한다는 현실적인 가정을 반영하여, 특히 금융 분야에서 중요한 역할을 합니다.


  • Transformer Vanila Transformer에서 1) Temporal pattern 추출 → 예측도 향상 2) self-attention의 계산 복잡도 줄이고자 LogTrans, Informer, Autoformer, Pyraformer, FEDformer 등 다양한 방법론들이 연구됨

  • Facebook Prophet

  • 프로펫 실습

  • 시계열 예측 향상 기법

  • 단변량 시계열

  • 데이터 사이언티스트로 도약

  • 딥러닝을 이용한 정교한 예측


permutation invariant란 입력 벡터 요소의 순서와 상관없이 같은 출력을 생성하는 모델



Are Transformers Effective for Time Series Forecasting? https://arxiv.org/abs/2205.13504 

이 연구에서는 최근 장기 시계열 예측(LTSF) 작업을 위한 트랜스포머 기반 솔루션의 증가에도 불구하고, 이러한 연구 방향의 타당성에 의문을 제기합니다. 트랜스포머는 긴 시퀀스 내 요소 간의 의미적 상관관계를 추출하는 데 가장 성공적인 솔루션이지만, 시계열 모델링에서는 연속된 데이터 포인트의 순서 집합에서 시간적 관계를 추출해야 합니다. 위치 인코딩 사용과 트랜스포머 내의 부분 시리즈를 토큰으로 임베딩하는 것은 일부 순서 정보를 보존하는 데 도움이 되지만, 순열 불변 자기주의 메커니즘의 본질은 시간 정보 손실을 초래합니다. 이 주장을 검증하기 위해, 단순한 단일 계층 선형 모델인 LTSF-Linear을 소개하고, 실험 결과에서 LTSF-Linear가 기존의 복잡한 트랜스포머 기반 LTSF 모델을 모든 경우에서, 종종 큰 차이로 능가하는 것으로 나타났습니다. 또한, LTSF 모델의 다양한 설계 요소가 시간 관계 추출 능력에 미치는 영향을 탐구하기 위한 포괄적인 실험적 연구를 수행했습니다. 이 놀라운 발견이 LTSF 작업에 대한 새로운 연구 방향을 제시하기를 바라며, 또한 미래에 시계열 분석 작업(예: 이상 탐지)에 대한 트랜스포머 기반 솔루션의 타당성을 재고할 것을 주장합니다. 관련 코드는 제공된 링크를 통해 확인할 수 있습니다.


/