Skip to Content

논문 정리

Abstract 물론입니다, 아래에 각 줄의 한글 번역을 제공하겠습니다.

  1. “Time Series Forecasting (TSF) is used to predict the target variables at a future time point based on the learning from previous time points.”
  • “시계열 예측(TSF)은 이전 시간 점에서의 학습을 바탕으로 미래 시점의 목표 변수를 예측하는 데 사용됩니다.”
  1. “To keep the problem tractable, learning methods use data from a fixed length window in the past as an explicit input.”
  • “문제를 처리 가능하게 유지하기 위해, 학습 방법은 과거의 고정된 길이의 윈도우에서 데이터를 명시적인 입력으로 사용합니다.”
  1. “In this paper, we study how the performance of predictive models change as a function of different look-back window sizes and different amounts of time to predict into the future.”
  • “이 논문에서는 예측 모델의 성능이 다양한 복귀 창 크기와 미래로 예측하기 위한 다양한 시간 양에 따라 어떻게 변하는지 연구합니다.”
  1. “We also consider the performance of the recent attention-based Transformer models, which has had good success in the image processing and natural language processing domains.”
  • “또한 이미지 처리 및 자연 언어 처리 분야에서 좋은 성공을 거둔 최근의 주의 기반 트랜스포머 모델의 성능도 고려합니다.”
  1. “In all, we compare four different deep learning methods (RNN, LSTM, GRU, and Transformer) along with a baseline method.”
  • “종합적으로, 우리는 기준 방법과 함께 네 가지 다른 딥러닝 방법(RNN, LSTM, GRU, 트랜스포머)을 비교합니다.”
  1. “The dataset (hourly) we used is the Beijing Air Quality Dataset from the UCI website, which includes a multivariate time series of many factors measured on an hourly basis for a period of 5 years (2010-14).”
  • “우리가 사용한 데이터셋(시간별)은 UCI 웹사이트의 베이징 공기질 데이터셋으로, 5년간(2010-14) 시간별로 측정된 여러 요소들의 다변량 시계열을 포함하고 있습니다.”
  1. “For each model, we also report on the relationship between the performance and the look-back window sizes and the number of predicted time points into the future.”
  • “각 모델에 대해, 우리는 성능과 복귀 창 크기 및 미래로 예측된 시간 점의 수 사이의 관계에 대해서도 보고합니다.”
  1. “Our experiments suggest that Transformer models have the best performance with the lowest Mean Average Errors (MAE = 14.599, 23.273) and Root Mean Square Errors (RMSE = 23.573, 38.131) for most of our single-step and multi-steps predictions.”
  • “우리의 실험은 트랜스포머 모델이 대부분의 단일 단계 및 다단계 예측에 대해 가장 낮은 평균 평균 오류(MAE = 14.599, 23.273) 및 평균 제곱근 오류(RMSE = 23.573, 38.131)로 최고의 성능을 보인다는 것을 제안합니다.”
  1. “The best size for the look-back window to predict 1 hour into the future appears to be one day, while** 2 or 4 days** perform the best to predict** 3 hours into the future**.”
  • “1시간 미래를 예측하기 위한 복귀 창의 최적 크기는 하루로 보이며, 2일 또는 4일이 3시간 미래를 예측하는 데 가장 좋은 성능을 보입니다.”

  1. “TIME series is a sequence of repeated observations of a given set of mm variables over a period time [1].”
  • “시계열은 일정 기간 동안 주어진 mm개의 변수들에 대한 반복된 관찰의 연속입니다 [1].”
  1. “Examples include stock prices, precipitation, volume of traffic in a communication or transportation network, and much more.”
  • “예시로는 주식 가격, 강수량, 통신 또는 교통 네트워크 내의 교통량 등이 있습니다.”
  1. “It can be mathematically defined as {x1,x2,,xT}\left\{x_{1}, x_{2}, \ldots, x_{T}\right\}, where t=t= 1,2,,T1,2, \ldots, T represents the elapsed time, and xtx_{t} measured at time tt, denotes a vector of mm random variables [2].”
  • “이것은 수학적으로 {x1,x2,,xT}\left\{x_{1}, x_{2}, \ldots, x_{T}\right\}로 정의될 수 있으며, 여기서 t=t= 1,2,,T1,2, \ldots, T는 경과된 시간을 나타내고, 시간 tt에 측정된 xtx_{t}mm개의 무작위 변수의 벡터를 나타냅니다 [2].”
  1. “Time Series Forecasting (TSF) is used to predict the distribution of the target variables at a future time based on the past observations of the time series.”
  • “시계열 예측(TSF)은 시계열의 과거 관찰을 바탕으로 미래 시점에서 목표 변수의 분포를 예측하는 데 사용됩니다.”
  1. “Many useful temporal inferencing problems have been considered including filtering, smoothing, predictions of unobserved past events or alternative histories [3].”
  • “필터링, 평활화, 관찰되지 않은 과거 사건이나 대체 역사의 예측을 포함하여 많은 유용한 시간적 추론 문제들이 고려되었습니다 [3].”
  1. “Efficient and accurate predictions of the future have significant applications in many different domains - finance [4], traffic [5], engineering [6], healthcare [7], weather [8], and more.”
  • “효율적이고 정확한 미래 예측은 금융 [4], 교통 [5], 공학 [6], 의료 [7], 기상 [8] 등 다양한 분야에서 중요한 응용을 가지고 있습니다.”
  1. “Better predictions can lead to better investments, better management of traffic anomalies, improved management of resources during supply…”
  • “더 나은 예측은 더 나은 투자, 교통 이상 현상의 더 나은 관리, 공급 중 자원 관리의 개선으로 이어질 수 있습니다…” 물론입니다, 아래에 각 줄의 한글 번역을 제공하겠습니다.
  1. “chain fluctuations, efficient handling of spikes in infections during epidemics, and much more, smarter decisions in agriculture and environment to handle foreseeable weather patterns or environmental disasters.”
  • “체인 변동, 전염병 동안 감염의 급증을 효율적으로 처리하고, 예상 가능한 기상 패턴이나 환경 재해를 처리하기 위한 농업 및 환경에서의 더 현명한 결정들.”
  1. “In this paper, we consider the problem of predicting air quality (PM2.5) to better manage urban air pollution, which has become a serious threat to the environmental and human health with the acceleration of industrialization [9].”
  • “이 논문에서는 산업화의 가속으로 환경 및 인간 건강에 심각한 위협이 된 도시 대기 오염을 더 잘 관리하기 위해 공기 질(PM2.5)을 예측하는 문제를 고려합니다 [9].”
  1. “The models used to capture time series can be divided into 3 categories: traditional models, machine learning models, and deep learning models.”
  • “시계열을 포착하는 데 사용되는 모델은 전통적 모델, 기계 학습 모델, 딥 러닝 모델의 3가지 범주로 나눌 수 있습니다.”
  1. “Traditional models can be divided into linear and non-linear ones [1].”
  • “전통적 모델은 선형과 비선형으로 나눌 수 있습니다 [1].”
  1. “Autoregressive Moving Average (ARMA) [10, 11] and Autoregressive Integrated Moving Average (ARIMA) are two well-known linear models, which can solve stationary and non-stationary time series respectively.”
  • “자기 회귀 이동 평균(ARMA) [10, 11] 및 자기 회귀 통합 이동 평균(ARIMA)은 각각 정상 시계열과 비정상 시계열을 해결할 수 있는 두 가지 잘 알려진 선형 모델입니다.”
  1. “A time series is stationary if its mean and variance are constant (time-independent; no drift) for any period.”
  • “시계열은 그 평균과 분산이 어떤 기간에도 일정하면(시간에 독립적; 드리프트 없음) 정상 상태입니다.”
  1. “ARIMA is used to model non-stationary time series by first transforming it to make it stationary.”
  • “ARIMA는 비정상 시계열을 모델링하기 위해 먼저 그것을 정상화하기 위해 변환하는 데 사용됩니다.”
  1. “Variants of ARIMA include Autoregressive Fractionally Integrated Moving Average (ARFIMA) [12] and Seasonal Autoregressive Integrated Moving Average (SARIMA) [10, 13].”
  • “ARIMA의 변형에는 자기 회귀 분수 통합 이동 평균(ARFIMA) [12] 및 계절성 자기 회귀 통합 이동 평균(SARIMA) [10, 13]이 포함됩니다.”
  1. “As with ARIMA, SARIMA first transforms the time series to make it stationary by eliminating the seasonal component.”
  • “ARIMA와 마찬가지로, SARIMA는 계절적 구성 요소를 제거하여 시계열을 정상화하기 위해 먼저 변환합니다.”
  1. “Among the non-linear models, Autoregressive Conditional Heteroskedasticity (ARCH)[14,15,16](\mathrm{ARCH})[14,15,16] and its variants like Generalized ARCH (GARCH) [14, 15, 16], Exponential Generalized ARCH (EGARCH) [16], Threshold Autoregressive (TAR) [17], Non-linear Autoregressive (NAR) [18,19][18,19], and Non-linear Moving Average (NMA) [20,
  2. “chain fluctuations, efficient handling of spikes in infections during epidemics, and much more, smarter decisions in agriculture and environment to handle foreseeable weather patterns or environmental disasters.”
  • “체인 변동, 전염병 동안 감염의 급증을 효율적으로 처리하고, 예상 가능한 기상 패턴이나 환경 재해를 처리하기 위한 농업 및 환경에서의 더 현명한 결정들.”
  1. “In this paper, we consider the problem of predicting air quality (PM2.5) to better manage urban air pollution, which has become a serious threat to the environmental and human health with the acceleration of industrialization [9].”
  • “이 논문에서는 산업화의 가속으로 환경 및 인간 건강에 심각한 위협이 된 도시 대기 오염을 더 잘 관리하기 위해 공기 질(PM2.5)을 예측하는 문제를 고려합니다 [9].”
  1. “The models used to capture time series can be divided into 3 categories: traditional models, machine learning models, and deep learning models.”
  • “시계열을 포착하는 데 사용되는 모델은 전통적 모델, 기계 학습 모델, 딥 러닝 모델의 3가지 범주로 나눌 수 있습니다.”
  1. “Traditional models can be divided into linear and non-linear ones [1].”
  • “전통적 모델은 선형과 비선형으로 나눌 수 있습니다 [1].”
  1. “Autoregressive Moving Average (ARMA) [10, 11] and Autoregressive Integrated Moving Average (ARIMA) are two well-known linear models, which can solve stationary and non-stationary time series respectively.”
  • “자기 회귀 이동 평균(ARMA) [10, 11] 및 자기 회귀 통합 이동 평균(ARIMA)은 각각 정상 시계열과 비정상 시계열을 해결할 수 있는 두 가지 잘 알려진 선형 모델입니다.”
  1. “A time series is stationary if its mean and variance are constant (time-independent; no drift) for any period.”
  • “시계열은 그 평균과 분산이 어떤 기간에도 일정하면(시간에 독립적; 드리프트 없음) 정상 상태입니다.”
  1. “ARIMA is used to model non-stationary time series by first transforming it to make it stationary.”
  • “ARIMA는 비정상 시계열을 모델링하기 위해 먼저 그것을 정상화하기 위해 변환하는 데 사용됩니다.”
  1. “Variants of ARIMA include Autoregressive Fractionally Integrated Moving Average (ARFIMA) [12] and Seasonal Autoregressive Integrated Moving Average (SARIMA) [10, 13].”
  • “ARIMA의 변형에는 자기 회귀 분수 통합 이동 평균(ARFIMA) [12] 및 계절성 자기 회귀 통합 이동 평균(SARIMA) [10, 13]이 포함됩니다.”
  1. “As with ARIMA, SARIMA first transforms the time series to make it stationary by eliminating the seasonal component.”
  • “ARIMA와 마찬가지로, SARIMA는 계절적 구성 요소를 제거하여 시계열을 정상화하기 위해 먼저 변환합니다.”
  1. “Among the non-linear models, Autoregressive Conditional Heteroskedasticity (ARCH)[14,15,16](\mathrm{ARCH})[14,15,16] and its variants like Generalized ARCH (GARCH) [14, 15, 16], Exponential Generalized ARCH (EGARCH) [16], Threshold Autoregressive (TAR) [17], Non-linear Autoregressive (NAR) [18,19][18,19], and Non-linear Moving Average (NMA) [20, 21].”
  • “비선형 모델 중에는 자기 회귀 조건부 이분산성(ARCH) [14,15,16]과 그 변형인 일반화된 ARCH(GARCH) [14, 15, 16], 지수 일반화된 ARCH(EGARCH) [16], 임계치 자기 회귀(TAR) [17], 비선형 자기 회귀(NAR) [18,19], 비선형 이동 평균(NMA) [20, 21] 등이 있습니다.”
  1. “The primary limitations of the traditional TSF models are that they apply regression to a fixed set of factors from the most recent historical data to generate the predictions.”
  • “전통적인 TSF 모델의 주요 한계점은 가장 최근의 역사적 데이터에서 고정된 요인 집합에 회귀를 적용하여 예측을 생성한다는 것입니다.”
  1. “Second, traditional methods are iterative and are often sensitive to how the process is seeded.”
  • “둘째, 전통적인 방법들은 반복적이며 과정이 어떻게 시작되었는지에 민감한 경우가 많습니다.”
  1. “Third, stationarity is a strict condition, and it is difficult to achieve stationarity of volatile time series by merely addressing drift, seasonality, autocorrelation, and heteroskedasticity.”
  • “셋째, 정상성은 엄격한 조건이며, 단순히 드리프트, 계절성, 자기상관성, 이분산성을 처리함으로써 변동성 있는 시계열의 정상성을 달성하기 어렵습니다.”
  1. “Hence the need for machine learning models.”
  • “따라서 기계 학습 모델이 필요합니다.

  1. “Standard machine learning models such as Support Vector Machines (SVM) [22, 23] have been used in this context, as have hybrid approaches combining ARIMA with SVM [24] and Neural Networks [25].”
  • “서포트 벡터 머신(SVM) [22, 23]과 같은 표준 기계 학습 모델들이 이 맥락에서 사용되었으며, ARIMA와 SVM [24] 및 신경망 [25]을 결합한 하이브리드 접근법도 사용되었습니다.”
  1. “Artificial Neural Network (ANN) [26, 27] and deep learning NNs [28] have been shown to have better performance than the traditional approaches.”
  • “인공 신경망(ANN) [26, 27]과 딥 러닝 신경망(NN) [28]은 전통적인 접근법들보다 더 나은 성능을 보였습니다.”
  1. “Machine learning approaches best suited for time series forecasting include Recurrent Neural Network (RNN) [29], Long Short-term Memory (LSTM) [30], and GRUs.”
  • “시계열 예측에 가장 적합한 기계 학습 접근법에는 순환 신경망(RNN) [29], 장단기 기억(LSTM) [30], 그리고 GRU가 포함됩니다.”
  1. “Improved forecasting has been achieved by using attention-based methods called Transformers [31].”
  • “트랜스포머라 불리는 주의 기반 방법을 사용함으로써 개선된 예측이 이루어졌습니다 [31].”
  1. “A review of the literature on deep learning for TSF can be found here [32, 33].”
  • “TSF를 위한 딥 러닝에 관한 문헌 검토는 여기서 찾을 수 있습니다 [32, 33].”
  1. “Transformers, introduced in 2018 [34], has been successfully used in many domains, including speech recognition [35], machine translation [34], and computer vision [36,37,38][36,37,38].”
  • “2018년에 도입된 트랜스포머 [34]는 음성 인식 [35], 기계 번역 [34], 컴퓨터 비전 [36,37,38]을 포함한 많은 분야에서 성공적으로 사용되었습니다.”
  1. “While there is considerable prior work on modeling time series, there is a lack of knowledge on the practical considerations in using deep learning for time series forecasting.”
  • “시계열 모델링에 대한 상당한 선행 연구가 있지만, 시계열 예측을 위한 딥 러닝 사용에 대한 실용적 고려사항에 대한 지식이 부족합니다.”
  1. “The problem of how much of the past (size of lookback window) or the how far into the future we can reliably predict has not been investigated.”
  • “과거(복귀 창의 크기) 중 얼마나 또는 우리가 얼마나 멀리 미래까지 신뢰할 수 있게 예측할 수 있는지에 대한 문제는 조사되지 않았습니다.”
  1. “The aims of this work are:
  • (1) to apply and validate deep learning models (RNN, LSTM, GRU, Transformer) for time series forecasting and compare their corresponding performance;
  • (2) to assess the strengths and weaknesses of these models; and
  • (3) to understand the impact of the size of look-back window and the length of time of future predictions on the prediction accuracy.”
    • “이 작업의 목표는
    • (1) 시계열 예측을 위한 딥 러닝 모델(RNN, LSTM, GRU, 트랜스포머)을 적용하고 검증하며그에 따른 성능을 비교하는 것;
    • (2) 이러한 모델의 강점과 약점을 평가하는 것; 그리고
    • (3) 복귀 창의 크기와 미래 예측의 시간 길이가 예측 정확도에 미치는 영향을 이해하는 것입니다.”
  1. “For the Beijing Air Quality Dataset from the UCI website, which includes a multivariate time series of many factors measured on an hourly basis for a period of 5 years (2010-14), our experiments show that the Transformer models have the best performance for our predictions.”
  • “UCI 웹사이트의 베이징 공기질 데이터셋은 5년간(2010-14) 시간별로 측정된 여러 요인들의 다변량 시계열을 포함하고 있으며, 우리의 실험에서는 트랜스포머 모델이 우리의 예측에 있어서 가장 좋은 성능을 보였습니다.”
  1. “We also pinpoint the best look-back window sizes to use for the best predictions at a specified future time.”
  • “또한 특정 미래 시간에 가장 좋은 예측을 위해 사용할 최적의 복귀 창 크기를 정확히 지정합니다.”

The “Methodology” section describes the approach used to predict future values of a target variable using deep learning models, based on historical time series data. Here’s a breakdown of the key points and their translations:

  1. “Using historical data, deep learning models learn a functional relationship between input features and future values of the target variable.”
  • “역사적 데이터를 사용하여, 딥 러닝 모델들은 입력 특성과 목표 변수의 미래 값 사이의 함수적 관계를 학습합니다.”
  1. “The resulting model can provide predictions for the target variable at future time points.”
  • “결과적으로 생성된 모델은 미래 시점에서 목표 변수에 대한 예측을 제공할 수 있습니다.”
  1. “Given a time series, {x1,x2,,xT}\left\{\boldsymbol{x}*{1}, \boldsymbol{x}*{2}, \ldots, \boldsymbol{x}*{T}\right\}, where xt\boldsymbol{x}*{t} is a vector of mm input features observed or measured at time tt, the task is to develop a model to predict a target variable yt+ky_{t+k} at a future time point, t+kt+k, using historical data.”
  • “시계열 {x1,x2,,xT}\left\{\boldsymbol{x}*{1}, \boldsymbol{x}*{2}, \ldots, \boldsymbol{x}*{T}\right\}를 주어졌을 때, xt\boldsymbol{x}*{t}는 시간 tt에 관측되거나 측정된 mm개의 입력 특성의 벡터이며, 이때의 과제는 역사적 데이터를 사용하여 미래의 시점 t+kt+k에서 목표 변수 yt+ky_{t+k}를 예측하는 모델을 개발하는 것입니다.”
  1. “To make the input to the model of a uniform length, we used a fixed length sliding time window of size ww, as shown in Fig. 1.”
  • “모델의 입력을 일정한 길이로 만들기 위해, 그림 1에 나타낸 바와 같이 크기 ww의 고정 길이 슬라이딩 시간 창을 사용했습니다.”
  1. “Data was transformed by min-max scaling using Eq. (5).”
  • “데이터는 식 (5)를 사용한 최소-최대 스케일링에 의해 변환되었습니다.”
  1. “Mathematically, the functional relationship learned by the machine learning models can be written down as shown in Eq. (1).”
  • “수학적으로, 기계 학습 모델이 학습한 함수적 관계는 식 (1)에 나타낸 대로 기술될 수 있습니다.”
  1. “[Equation]”
  • “[방정식]”
  1. “A detailed example of the setup is provided in the Appendix.”
  • “설정의 자세한 예는 부록에서 제공됩니다.”

이 섹션에서는 이 연구에서 사용된 딥 러닝 모델인 순환 신경망(RNN), 장단기 기억(LSTM), 게이트 순환 유닛(GRU), 트랜스포머에 대한 간략한 설명을 제공합니다.

\section{A. 순환 신경망 (RNN)}

물론입니다, RNN(Recurrent Neural Networks, 순환 신경망)에 대한 설명을 한국어로 해석해 드리겠습니다.

  1. RNN 소개: RNN은 시계열 데이터 모델링에 적합한 신경망입니다. 이는 과거의 입력 특성과 미래의 목표 변수 간의 기능적 관계를 모델링합니다.
  2. RNN의 구조: RNN은 역사적 데이터 세트에서 반복적으로 학습하면서 시간 t1t-1에서 tt로 내부 상태(숨겨진 상태)의 전환에 중점을 둡니다. 모델은 세 개의 매개변수 행렬(WxW_{x}, WyW_{y}, WsW_{s})과 두 개의 편향 벡터(bsb_{s}, byb_{y})로 정의됩니다.
  3. 내부 상태와 출력: 출력 yty_{t}는 내부 상태 StS_{t}에 의존하며, 이는 현재 입력 xtx_{t}와 이전 상태 St1S_{t-1} 모두에 의존합니다.
  4. 수학적 표현: 내부 상태 StS_{t}tanh(Wxs(xtSt1)+bs)\tanh(W_{x s} \cdot(x_{t} \oplus S_{t-1})+b_{s})로 계산되고, 출력 yty_{t}σ(WySt+by)\sigma(W_{y} \cdot S_{t}+b_{y})로 계산됩니다.
  5. 매개변수와 활성화 함수: 여기서 xt\boldsymbol{x}*{t}는 시간 tt에서 mm 입력 특성의 입력 벡터이며, WxsW*{x s}WyW_{y}는 매개변수 행렬, bsb_{s}byb_{y}는 각각 내부 상태와 출력을 위한 편향 벡터, σ\sigma는 시그모이드 활성화 함수를 나타냅니다.
  6. RNN의 단점: RNN의 가장 큰 단점은 반복되는 재귀 가중치 행렬의 곱셈으로 인해 기울기 소실 문제를 겪는다는 것입니다. 이로 인해 시간이 지남에 따라 기울기가 너무 작아져 RNN이 단기간의 정보만 기억하게 됩니다.

  1. Long Short-term Memory (LSTM): Long Short-term Memory (LSTM) 네트워크는 RNN의 변형으로, 기울기 소실 문제를 부분적으로 해결하고 시계열 데이터에서 장기 의존성을 학습합니다.
  2. LSTM의 구조: LSTM은 시간 tt에서의 내부(숨겨진) 상태 StS_{t}와 셀 상태 CtC_{t} 측면에서 설명됩니다.
  3. 셀 상태의 의존성: 그림 4에 나타난 바와 같이, CtC_{t}는 세 가지 다른 의존성을 가지고 있습니다: (1) 이전 셀 상태 Ct1C_{t-1}, (2) 이전 내부 상태 St1S_{t-1}, (3) 현재 시점의 입력 xtx_{t}.
  4. 정보 처리 과정: 이 과정은 잊어버리기 게이트, 입력 게이트, 추가 게이트, 출력 게이트를 사용하여 정보를 제거/필터링, 결합/곱셈, 추가하는 것을 허용하여 장기 의존성 학습을 더 잘 제어할 수 있습니다.
  5. 함수와 게이트: 여기서 ft,it,Ct~f_{t}, i_{t}, \widetilde{C_{t}}, 및 OtO_{t} 함수는 각각 잊어버리기 게이트, 입력 게이트, 추가 게이트, 출력 게이트에 의해 구현됩니다.
  6. Gated Recurrent Unit (GRU): Gated Recurrent Units (GRU)는 LSTM의 변형으로 기울기 소실 문제를 더욱 해결합니다.
  7. GRU의 구조: 그림 5에서 보이듯이, 이 방법의 특이성은 업데이트 게이트, 리셋 게이트, 그리고 세 번째 게이트의 사용에서 나타나며, 각각 zt,rtz_{t}, r_{t}St~\widetilde{S_{t}} 함수를 구현합니다.
  8. 상태 표현식: 각 게이트는 이전 정보를 어떻게 필터링, 사용, 결합할지에 대해 다른 역할을 합니다. 다음 상태의 표현식에서 첫 번째 항 (1zt)St1\left(1-z_{t}\right) \cdot S_{t-1}은 과거에서 무엇을 유지할지 결정하고, ztS~tz_{t} \cdot \tilde{S}_{t}는 현재 메모리 내용에서 무엇을 수집할지 결정합니다.
  9. Transformer Model: LSTMs와 GRUs는 RNN의 기울기 소실 문제를 부분적으로 해결합니다. 그러나 하이퍼볼릭 탄젠트 및 시그모이드 함수를 활성화 함수로 사용함으로써 더 깊은 계층에서 기울기 감소가 계속 발생합니다.
  10. Transformer 네트워크: Transformer 네트워크는 과거의 중요한 정보에서 선택적으로 중요한 정보를 가중치를 부여하는 주의 기능을 사용하여 시계열 분야에서 최고의 성능을 보입니다.
  11. Transformer 구조: 그림 6은 Transformer 네트워크의 개략도를 보여줍니다. 이는 인코더 및 디코더 부분으로 구성됩니다. 여기서 ww는 되돌아보기 창의 크기이고 kk는 미래에 예측할 단계의 수입니다.
  12. 디코더 부분: 그림 6에서,

  1. LSTMs and GRUs: LSTMs(장단기 기억 네트워크)와 GRUs(게이트 순환 유닛)는 RNN(순환 신경망)의 기울기 소실 문제를 부분적으로 해결합니다.
  2. 활성화 함수 문제: 그러나 하이퍼볼릭 탄젠트와 시그모이드 함수를 활성화 함수로 사용하는 것은 깊은 계층에서 기울기 감소를 계속 일으킵니다.
  3. Transformer 네트워크: Transformer 네트워크는 주의 기능을 사용하여 과거의 중요한 정보를 선택적으로 가중치를 부여하기 때문에 시계열에 대한 최고의 성능을 보여줍니다.
  4. Transformer 구조: 그림 6은 Transformer 네트워크의 개략도를 보여줍니다. 이 구조는 인코더와 디코더 부분으로 구성됩니다.
  5. Look-back window와 예측 단계: 여기서 w`w`는 되돌아보기 창의 크기이고, k`k`는 미래에 예측할 단계의 수입니다.
  6. 디코더의 주의 메커니즘: 그림 6에서, 디코더 부분은 디코더에 마스크된 주의 메커니즘과 인코더 출력에서 선택하는 멀티 헤드 주의 메커니즘을 가지고 있습니다.
  7. Transformer의 특징: Transformer는 순환 네트워크가 아니지만, 데이터의 시간적 순서를 표시하기 위해 위치 인코딩을 사용합니다.
  8. 인코더와 디코더: 인코더는 되돌아보기 창 크기 ww의 데이터를 받아 디코더에 사용될 특징 벡터를 출력합니다.
  9. 트레이닝 중의 디코더: 트레이닝 중에 디코더는 모델링하려는 미래 데이터와 인코더의 출력을 함께 제공받습니다.
  10. 주의 기능의 중요성: Transformer 네트워크의 주의 기능은 중요한 특징과 과거 추세에 주의를 기울이도록 학습하는 데 도움을 줍니다.

제공하신 표는 데이터셋의 다양한 변수들과 그 설명을 담고 있습니다. 각 행에 대한 설명은 다음과 같습니다:

  1. 무시됨 - 아니오: 이것은 데이터셋에서의 행 번호를 나타냅니다. 분석이나 모델에서 사용되지 않는 부분입니다.
  2. 변수 ‘time’으로 결합됨 - year: ‘year’ 변수는 데이터가 기록된 연도를 나타냅니다. 다른 시간 관련 변수들과 결합하여 종합적인 ‘time’ 변수를 형성합니다.
  3. day: 이것은 데이터가 수집된 달을 나타냅니다. ‘year’, ‘hour’, ‘PM2.5’와 함께 ‘time’ 변수의 일부입니다.
  4. 대상 - hour: ‘hour’ 변수는 데이터 항목에 대한 월의 일을 나타냅니다. ‘대상’으로 분류되어 있어 모델이 예측하려고 하는 핵심 변수의 일부일 가능성이 있습니다.
  5. PM2.5: 여기서 ‘PM2.5’는 일반적인 PM2.5 공기 질 측정이 아니라 하루 중 시간을 나타냅니다.
  6. DEWP: 이것은 ‘이슬점(Dew Point)‘을 나타냅니다. 여기서는 공기 중 PM2.5 농도를 나타내는 데 사용됩니다.
  7. 추가 입력 특징 - TEMP: ‘TEMP’는 데이터 기록 시점의 온도를 나타냅니다.
  8. PRES: 이것은 대기압을 나타냅니다.
  9. cbwd: ‘Combined Wind Direction’, 즉 풍향을 나타냅니다.
  10. Iws: ‘Cumulated Wind Speed’, 누적된 풍속을 나타내며 일정 기간 동안 기록된 총 풍속일 가능성이 있습니다.
  11. Is: ‘Cumulated Hours of Snow’, 즉 누적된 눈 내린 시간을 나타냅니다.
  12. Ir: ‘Cumulated Hours of Rain’, 즉 누적된 비 온 시간을 나타냅니다. 이 표는 환경 또는 기상 분석에 사용될 가능성이 높은 데이터셋의 일부로 보이며, 이러한 변수들의 조합은 날씨 조건과 공기 질을 예측하거나 이해하는 데 도움이 될 수 있습니다.

이 섹션은 사용된 데이터셋에 대해 설명하고 있습니다. 여기에 포함된 주요 내용을 요약하면 다음과 같습니다:

  1. 데이터셋 출처: 사용된 데이터셋은 UCI 웹사이트의 시간별 베이징 공기질 데이터셋으로, 2010년 1월 1일부터 2014년 12월 31일까지의 다섯 해 동안의 데이터를 포함합니다.
  2. 데이터 수집 및 크기: 데이터는 시간별로 수집되었으며, 데이터셋은 43,824행과 13열로 구성되어 있습니다.
  3. 열 구성: 첫 번째 열은 단순한 인덱스로, 분석에는 사용되지 않았습니다. ‘year’, ‘month’, ‘day’, ‘hour’로 레이블된 네 개의 열은 “year-month-day-hour”라는 단일 특징으로 결합되었습니다.
  4. 타겟 변수: ‘PM2.5’ 열은 타겟 변수로 사용되었습니다. 나머지 모든 변수들은 입력 특징으로 사용되었습니다.
  5. 데이터 누락: 소수의 행(43,824개 중 24개)은 누락된 데이터로 인해 제거되었습니다.
  6. 데이터 전처리: 풍향의 범주형 특징에는 원-핫 인코딩이 적용되었고, 데이터는 Min-Max 정규화 기법을 사용하여 [0,1] 범위로 정규화되었습니다. 이는 다음과 같은 식으로 표현됩니다: x=xxminxmaxxminx^{\prime}=\frac{x-x_{\min }}{x_{\max }-x_{\min }}
  7. 데이터 분할: 데이터는 훈련 세트(처음 70% 행)와 테스트 세트(마지막 30% 행)로 나누어졌습니다. 이 데이터셋은 시계열 분석, 특히 공기질 예측과 관련된 연구에서 중요한 정보를 제공하는 것으로 보입니다.

이 섹션은 수행된 실험에 대한 설명입니다. 주요 내용을 요약하면 다음과 같습니다:

  1. 실험 목적: 실험은 미래의 한 시점(k=1k=1) 또는 여러 시점(k>1k>1)을 예측하는 데 초점을 맞춥니다. k=1k=1인 경우를 ‘단일-단계 예측’, k>1k>1인 경우를 ‘다중-단계 예측’이라고 합니다.
  2. Look-back Window: 실험에서는 다양한 ‘look-back window’ 크기(ww)가 사용되었습니다. 이는 최근 과거의 데이터 부분을 입력으로 사용하는 것을 나타냅니다. 1, 2, 4, 8, 16일의 창 크기가 두 실험 세트 모두에 사용되었습니다.
  3. 창 크기의 영향: 창 크기를 지수적으로 선택하는 것은 예측 정확도에 대한 창 크기의 영향을 이해하기 위한 것입니다.
  4. 다중-단계 예측: 다중-단계 예측은 1, 2, 4, 8, 16시간 후의 공기질 값을 예측하는 데 사용되었습니다.
  5. 실험 설정: 4가지 딥 러닝 모델(RNN, LSTM, GRU, Transformer)에 대해 다양한 하이퍼파라미터 설정이 시도되었습니다.
  6. 모델별 설정: 각 모델에 대한 설정은 아래와 같습니다:
  • RNN, LSTM, GRU: Epoch(100, 200), 학습률(LR: 0.0005, 0.00001), 배치 크기(256, 512), 최적화 알고리즘(Adam)
  • Transformer: Epoch(200, 300), 학습률(LR: 0.0005, 0.00005), 배치 크기(256, 512), 최적화 알고리즘(AdamW)
  1. 실험 조합: 학습률(0.00001, 0.00005, 0.0001, 0.0005, 0.001), 배치 크기(128, 256, 512) 및 최적화 알고리즘(Adam, SGD) 매개변수가 실험에서 다양하게 조합되어 사용되었습니다. 이러한 실험은 공기질 예측과 관련된 다양한 딥 러닝 모델의 성능과 하이퍼파라미터 설정의 효과를 평가하는 데 중요한 역할을 합니다.

이 섹션은 미래 여러 시간 단계를 예측하는 데 초점을 맞추고 있습니다. 주요 내용을 요약하면 다음과 같습니다:

  1. 고정된 Look-back Window 크기: 예를 들어, 4일(96시간)의 고정된 look-back window 크기에 대해, 미래로의 시간(kk 값)이 증가함에 따라 모델 성능이 어떻게 저하되는지 조사합니다.
  2. 성능 감소 예상: kk 값이 증가함에 따라 성능이 저하될 것으로 예상하는 것이 합리적입니다.
  3. 성능 지표 확인: TABLE III에 나타난 것처럼, 각 열에서 평균 절대 오차(MAE)와 제곱근 평균 제곱 오차(RMSE) 값이 kk와 함께 증가합니다.
  4. Transformer의 우수한 성능: Transformer 모델이 RNN, LSTM, GRU보다 80%의 실험에서 더 나은 성능을 보여줍니다.
  5. 예측 성능의 급격한 저하: 4시간 이상 미래를 예측해야 할 때 예측 성능이 급격하게 떨어집니다. 이러한 분석은 시계열 데이터를 예측하는 데 있어서 미래 시간 단계의 길이가 모델 성능에 미치는 영향을 이해하는 데 중요합니다. 특히, 더 긴 시간을 예측할수록 정확도가 감소하는 경향을 확인할 수 있으며, 이는 모델 선택과 하이퍼파라미터 조정에 있어 중요한 고려사항이 됩니다.

이 섹션은 look-back window 크기가 단일-단계 및 다중-단계 예측에 미치는 영향에 대해 설명합니다. 주요 내용을 요약하면 다음과 같습니다:

  1. 다양한 Look-back Window 크기 실험: 실험은 다양한 look-back window 크기에 대해 수행되었으며, 이는 24, 48, 96, 192, 그리고 384시간으로 설정되었습니다.
  2. 단일-단계 예측:
  • 결과 요약: TABLE IV는 실험 결과를 요약합니다.
  • Transformer의 우수성: 더 큰 window 크기(96시간 이상)에서 Transformer 네트워크 모델이 다른 방법보다 우수한 성능을 나타냅니다. 이는 주의(attention) 기반 접근법의 강점과 일치합니다.
  • 작은 창 크기에서 GRU와 LSTM의 우수성: 24시간 또는 48시간과 같은 작은 창 크기에서 GRU와 LSTM이 RNN보다 더 나은 성능을 보입니다. 이는 GRU와 LSTM이 RNN보다 장기 기억능력이 더 뛰어나고 기울기 소실 문제를 부분적으로 해결했다는 주장과 일치합니다.
  • 단일-단계 예측을 위한 GRU와 LSTM의 적합성: 작은 창 크기만 선택할 수 있는 경우, GRU와 LSTM이 단일-단계 예측에 더 적합한 선택입니다.
  • Transformer의 한계: 불행히도, Transformer 네트워크는 더 큰 창 크기를 사용할 때도 더 나은 성능을 보이지 못하며, 이는 더 큰 창에서 증가된 노이즈 수준 때문일 수 있습니다.
  1. 다중-단계 예측:
  • 결과 요약: TABLE IV는 k=3`k=3` 시간 후를 예측하기 위한 실험 결과를 보여줍니다.
  • Transformer의 우수성: Transformer 네트워크가 다른 모든 도구를 능가합니다.
  • 성능 변화의 비단조성: 성능 변화가 단조롭지 않으며, w=48w=48 또는 96시간에서 최소값이 도달한다는 것은 이러한 값들이 학습 방법에 있어 최적일 수 있음을 시사합니다.
  • 실험 결과 시각화: 그림 9는 실험에 대한 예측을 시각화하며, T1, T2, T3 곡선은 각각 k=1,2,3k=1, 2, 3 시간에 대한 실험 결과를 나타냅니다. 이 분석은 미래 시간 단계를 예측하기 위한 모델 선택과 설정에 있어서 look-back window 크기가 중요한 변수임을 보여줍니다. 작은 창 크기에서는 GRU와 LSTM이, 큰 창 크기에서는 Transformer가 더 나은 성능을 보이는 경향이 있음을 확인할 수 있습니다.

제공된 TABLE V는 다양한 look-back window 크기를 사용하여 3시간 후를 예측하는 다중-단계 예측의 성능(평균 절대 오차(MAE) 및 제곱근 평균 제곱 오차(RMSE))을 보여줍니다. 각 행에서 가장 좋은 결과는 굵은 글씨체로 표시되어 있습니다. 표의 주요 내용을 요약하면 다음과 같습니다:

  1. Look-back Window 크기:
  • 1일, 2일, 4일, 8일, 16일의 다양한 크기가 실험에 사용되었습니다.
  1. 모델 별 성능 비교:
  • RNN: 모든 window 크기에서 RNN은 상대적으로 높은 MAE 및 RMSE 값을 보여줍니다.
  • LSTM: LSTM은 RNN보다는 낮지만 Transformer보다는 높은 MAE 및 RMSE 값을 보여줍니다.
  • GRU: GRU 역시 LSTM과 유사한 경향을 보이지만, 일부 window 크기에서는 LSTM보다 약간 나은 성능을 보여줍니다.
  • Transformer: 모든 window 크기에서 Transformer는 가장 낮은 MAE 및 RMSE 값을 기록하여 가장 우수한 성능을 보여줍니다.
  1. 성능의 변화:
  • Look-back window 크기가 커질수록 모든 모델의 성능이 저하되는 경향을 보입니다.
  • 특히, 16일의 큰 window 크기에서는 모든 모델의 성능이 상당히 저하되었으나, Transformer는 여전히 가장 낮은 오차 값을 유지합니다. 이 데이터는 다양한 모델과 look-back window 크기에 따른 시계열 데이터 예측의 성능 차이를 분석하는 데 중요한 정보를 제공합니다. Transformer 모델이 다양한 window 크기에서 가장 일관된 우수한 성능을 보이는 것으로 나타났습니다.