Skip to Content
LectureNoteTimeSeries AnalysisTimeSeries Analysis

TimeSeries Analysis

pagePassword: True

개요

시계열 데이터에 대한 이해와 인공지능을 이용한 시계열 분석 방법을 배웁니다

교육목표

  • 시계열 데이터의 기초이론 대한 이해
  • 다양한 시계열 분석 및 모델링의 이해
  • Python 및 라이브러리를 활용한 시계열 데이터 처리
  • 최신 딥러닝 흐름의 이해

대상

  • 시계열 데이터 분석 및 모델링 개발자 연구자
  • 시계열 분석 기술을 업무에 적용하고자 하는 실무자

효과

  • 시계열 데이터 분석 및 예측을 위한 통계모델 / 인공지능 모델 설계
  • 다양한 딥러닝 기법과 시계열 분석방법의 실무적 이해
  • 실제 데이터에 족용 가능한 시계열 분석 모델 구현

Contents of Table




  • 엔트로피 개념

엔트로피란 무엇일까? - 정보이론 입문 SERIES 1/3

정보의 양을 어떻게 측정할까?

우리는 매일 정보를 교환합니다. 언어, 문자, 심지어 우리의 행동도 정보를 전달하는 수단입니다. 물리학에서 질량이나 속도를 측정하는 것처럼, 정보 역시 측정할 수 있습니다. 이를 가능하게 하는 개념이 바로 ‘정보량’입니다.

정보량의 시작: 최소 질문 개수

정보량은 어떤 메시지를 전달하기 위해 필요한 최소한의 질문 개수로 정의됩니다. 예를 들어, 동전을 다섯 번 던진 결과를 전기 신호로 전송한다고 생각해 봅시다. 동전의 앞면을 ‘1’, 뒷면을 ‘0’으로 표현하면, 5개의 숫자(예: 10110)로 결과를 전달할 수 있습니다. 이것이 바로 정보량의 기본 아이디어입니다.

Hartley의 정보 이론

R.V.L Hartley는 정보의 양을 수학적으로 표현한 최초의 사람 중 한 명입니다. 그는 정보량을 다음과 같이 정의했습니다: H=nlog(s)=log(sn)H = n \log(s) = \log(s^n) 여기서 nn 은 메시지의 길이(문자 수), ss 는 가능한 각 선택의 결과 수(예: 알파벳의 경우 26)입니다.

엔트로피: 정보의 ‘불확실성’ 측정

엔트로피는 정보의 불확실성을 측정하는 방법입니다. 클로드 섀넌은 엔트로피를 다음과 같이 정의했습니다: H=ipilog2(pi)H = -\sum_{i} p_i \log_2(p_i) 이 식에서 pip_i 는 각 사건의 발생 확률입니다. 엔트로피는 가능한 모든 사건이 같은 확률로 발생할 때 가장 높습니다.

엔트로피의 예: 기계 X와 Y

두 기계 X와 Y가 있다고 가정합시다. 기계 X는 A, B, C, D를 각각 25%의 확률로 출력합니다. 반면 기계 Y는 다른 확률 분포를 가집니다(A: 50%, B: 12.5%, C: 12.5%, D: 25%). 이 경우, 기계 Y의 엔트로피는 기계 X보다 낮습니다. 이는 기계 Y가 기계 X보다 더 예측 가능하다는 것을 의미합니다.

엔트로피의 중요성

엔트로피는 정보의 양과 직결되며, 정보를 얼마나 효율적으로 전달할 수 있는지를 나타냅니다. 엔트로피가 높으면 불확실성이 크고, 엔트로피가 낮으면 정보가 더 명확하고 예측 가능합니다. 이러한 개념은 통신, 데이터 압축, 패턴 인식 등 다양한 분야에서 중요하게 활용됩니다.

  • **적률 - ** 시계열 데이터에서의 ‘적률(Moments)‘은 데이터의 특정 통계적 특성을 나타내는 중요한 지표입니다. 적률은 데이터 분포의 형태와 특성을 이해하는 데 사용되며, 일반적으로 다음과 같은 네 가지 주요 적률이 있습니다:
    1. 평균(1차 적률): 데이터의 중심 위치를 나타냅니다. 시계열 데이터에서 평균은 시간에 따른 데이터 값들의 평균값을 의미합니다.
    2. 분산(2차 적률): 데이터가 평균으로부터 얼마나 퍼져 있는지를 나타냅니다. 시계열에서 분산은 시간에 따라 값들이 얼마나 변동하는지를 보여줍니다.
    3. 왜도(3차 적률): 데이터 분포의 비대칭성을 측정합니다. 시계열 데이터에서 왜도는 값들이 평균을 중심으로 어떻게 비대칭적으로 분포하는지를 나타냅니다. 왜도가 0에 가까우면 정규 분포에 가깝다고 볼 수 있습니다.
    4. 첨도(4차 적률): 데이터 분포의 뾰족한 정도와 꼬리의 두께를 나타냅니다. 시계열 데이터에서 첨도는 값들이 평균 주변에 얼마나 집중되어 있는지, 그리고 극단적인 값들이 얼마나 자주 발생하는지를 보여줍니다. 이러한 적률들은 시계열 데이터의 기본적인 특성을 이해하고, 데이터가 어떤 통계적 특성을 가지고 있는지 분석하는 데 중요한 역할을 합니다. 예를 들어, 금융 시계열 데이터에서는 높은 첨도를 가지는 경우가 많으며, 이는 극단적인 가격 변동이 자주 발생할 수 있음을 의미합니다.

https://www.projectpro.io/article/time-series-projects/444 

→ 시계열 강의 할때 정리하기