논문 정리
Abstract 물론입니다, 아래에 각 줄의 한글 번역을 제공하겠습니다.
- “Time Series Forecasting (TSF) is used to predict the target variables at a future time point based on the learning from previous time points.”
- “시계열 예측(TSF)은 이전 시간 점에서의 학습을 바탕으로 미래 시점의 목표 변수를 예측하는 데 사용됩니다.”
- “To keep the problem tractable, learning methods use data from a fixed length window in the past as an explicit input.”
- “문제를 처리 가능하게 유지하기 위해, 학습 방법은 과거의 고정된 길이의 윈도우에서 데이터를 명시적인 입력으로 사용합니다.”
- “In this paper, we study how the performance of predictive models change as a function of different
look-back window sizesanddifferent amounts of timeto predict into the future.”
- “이 논문에서는 예측 모델의 성능이 다양한 복귀 창 크기와 미래로 예측하기 위한 다양한 시간 양에 따라 어떻게 변하는지 연구합니다.”
- “We also consider the performance of the recent attention-based Transformer models, which has had good success in the image processing and natural language processing domains.”
- “또한 이미지 처리 및 자연 언어 처리 분야에서 좋은 성공을 거둔 최근의 주의 기반 트랜스포머 모델의 성능도 고려합니다.”
- “In all, we compare f
our different deep learning methods(RNN, LSTM, GRU, and Transformer) along with a baseline method.”
- “종합적으로, 우리는 기준 방법과 함께 네 가지 다른 딥러닝 방법(RNN, LSTM, GRU, 트랜스포머)을 비교합니다.”
- “The dataset (hourly) we used is the Beijing Air Quality Dataset from the UCI website, which includes a multivariate time series of many factors measured on an hourly basis for a period of 5 years (2010-14).”
- “우리가 사용한 데이터셋(시간별)은 UCI 웹사이트의 베이징 공기질 데이터셋으로, 5년간(2010-14) 시간별로 측정된 여러 요소들의 다변량 시계열을 포함하고 있습니다.”
- “For each model, we also report on the relationship between the performance and the look-back window sizes and the number of predicted time points into the future.”
- “각 모델에 대해, 우리는 성능과 복귀 창 크기 및 미래로 예측된 시간 점의 수 사이의 관계에 대해서도 보고합니다.”
- “Our experiments suggest that Transformer models have the best performance with the lowest Mean Average Errors (MAE = 14.599, 23.273) and Root Mean Square Errors (RMSE = 23.573, 38.131) for most of our single-step and multi-steps predictions.”
- “우리의 실험은 트랜스포머 모델이 대부분의 단일 단계 및 다단계 예측에 대해 가장 낮은 평균 평균 오류(MAE = 14.599, 23.273) 및 평균 제곱근 오류(RMSE = 23.573, 38.131)로 최고의 성능을 보인다는 것을 제안합니다.”
- “The best size for the look-back window to predict 1 hour into the future appears to be one day, while** 2 or 4 days** perform the best to predict** 3 hours into the future**.”
- “1시간 미래를 예측하기 위한 복귀 창의 최적 크기는 하루로 보이며, 2일 또는 4일이 3시간 미래를 예측하는 데 가장 좋은 성능을 보입니다.”
- “TIME series is a sequence of repeated observations of a given set of variables over a period time [1].”
- “시계열은 일정 기간 동안 주어진 개의 변수들에 대한 반복된 관찰의 연속입니다 [1].”
- “Examples include stock prices, precipitation, volume of traffic in a communication or transportation network, and much more.”
- “예시로는 주식 가격, 강수량, 통신 또는 교통 네트워크 내의 교통량 등이 있습니다.”
- “It can be mathematically defined as , where represents the elapsed time, and measured at time , denotes a vector of random variables [2].”
- “이것은 수학적으로 로 정의될 수 있으며, 여기서 는 경과된 시간을 나타내고, 시간 에 측정된 는 개의 무작위 변수의 벡터를 나타냅니다 [2].”
- “Time Series Forecasting (TSF) is used to predict the distribution of the target variables at a future time based on the past observations of the time series.”
- “시계열 예측(TSF)은 시계열의 과거 관찰을 바탕으로 미래 시점에서 목표 변수의 분포를 예측하는 데 사용됩니다.”
- “Many useful temporal inferencing problems have been considered including filtering, smoothing, predictions of unobserved past events or alternative histories [3].”
- “필터링, 평활화, 관찰되지 않은 과거 사건이나 대체 역사의 예측을 포함하여 많은 유용한 시간적 추론 문제들이 고려되었습니다 [3].”
- “Efficient and accurate predictions of the future have significant applications in many different domains - finance [4], traffic [5], engineering [6], healthcare [7], weather [8], and more.”
- “효율적이고 정확한 미래 예측은 금융 [4], 교통 [5], 공학 [6], 의료 [7], 기상 [8] 등 다양한 분야에서 중요한 응용을 가지고 있습니다.”
- “Better predictions can lead to better investments, better management of traffic anomalies, improved management of resources during supply…”
- “더 나은 예측은 더 나은 투자, 교통 이상 현상의 더 나은 관리, 공급 중 자원 관리의 개선으로 이어질 수 있습니다…” 물론입니다, 아래에 각 줄의 한글 번역을 제공하겠습니다.
- “chain fluctuations, efficient handling of spikes in infections during epidemics, and much more, smarter decisions in agriculture and environment to handle foreseeable weather patterns or environmental disasters.”
- “체인 변동, 전염병 동안 감염의 급증을 효율적으로 처리하고, 예상 가능한 기상 패턴이나 환경 재해를 처리하기 위한 농업 및 환경에서의 더 현명한 결정들.”
- “In this paper, we consider the problem of predicting air quality (PM2.5) to better manage urban air pollution, which has become a serious threat to the environmental and human health with the acceleration of industrialization [9].”
- “이 논문에서는 산업화의 가속으로 환경 및 인간 건강에 심각한 위협이 된 도시 대기 오염을 더 잘 관리하기 위해 공기 질(PM2.5)을 예측하는 문제를 고려합니다 [9].”
- “The models used to capture time series can be divided into 3 categories: traditional models, machine learning models, and deep learning models.”
- “시계열을 포착하는 데 사용되는 모델은
전통적 모델, 기계 학습 모델,딥 러닝 모델의 3가지 범주로 나눌 수 있습니다.”
- “Traditional models can be divided into linear and non-linear ones [1].”
- “전통적 모델은 선형과 비선형으로 나눌 수 있습니다 [1].”
- “Autoregressive Moving Average (ARMA) [10, 11] and Autoregressive Integrated Moving Average (ARIMA) are two well-known linear models, which can solve stationary and non-stationary time series respectively.”
- “자기 회귀 이동 평균(ARMA) [10, 11] 및 자기 회귀 통합 이동 평균(ARIMA)은 각각 정상 시계열과 비정상 시계열을 해결할 수 있는 두 가지 잘 알려진 선형 모델입니다.”
- “A time series is stationary if its mean and variance are constant (time-independent; no drift) for any period.”
- “시계열은 그 평균과 분산이 어떤 기간에도 일정하면(시간에 독립적; 드리프트 없음) 정상 상태입니다.”
- “ARIMA is used to model non-stationary time series by first transforming it to make it stationary.”
- “ARIMA는 비정상 시계열을 모델링하기 위해 먼저 그것을 정상화하기 위해 변환하는 데 사용됩니다.”
- “Variants of ARIMA include Autoregressive Fractionally Integrated Moving Average (ARFIMA) [12] and Seasonal Autoregressive Integrated Moving Average (SARIMA) [10, 13].”
- “ARIMA의 변형에는 자기 회귀 분수 통합 이동 평균(ARFIMA) [12] 및 계절성 자기 회귀 통합 이동 평균(SARIMA) [10, 13]이 포함됩니다.”
- “As with ARIMA, SARIMA first transforms the time series to make it stationary by eliminating the seasonal component.”
- “ARIMA와 마찬가지로, SARIMA는 계절적 구성 요소를 제거하여 시계열을 정상화하기 위해 먼저 변환합니다.”
- “Among the non-linear models, Autoregressive Conditional Heteroskedasticity and its variants like Generalized ARCH (GARCH) [14, 15, 16], Exponential Generalized ARCH (EGARCH) [16], Threshold Autoregressive (TAR) [17], Non-linear Autoregressive (NAR) , and Non-linear Moving Average (NMA) [20,
- “chain fluctuations, efficient handling of spikes in infections during epidemics, and much more, smarter decisions in agriculture and environment to handle foreseeable weather patterns or environmental disasters.”
- “체인 변동, 전염병 동안 감염의 급증을 효율적으로 처리하고, 예상 가능한 기상 패턴이나 환경 재해를 처리하기 위한 농업 및 환경에서의 더 현명한 결정들.”
- “In this paper, we consider the problem of predicting air quality (PM2.5) to better manage urban air pollution, which has become a serious threat to the environmental and human health with the acceleration of industrialization [9].”
- “이 논문에서는 산업화의 가속으로 환경 및 인간 건강에 심각한 위협이 된 도시 대기 오염을 더 잘 관리하기 위해 공기 질(PM2.5)을 예측하는 문제를 고려합니다 [9].”
- “The models used to capture time series can be divided into 3 categories: traditional models, machine learning models, and deep learning models.”
- “시계열을 포착하는 데 사용되는 모델은 전통적 모델, 기계 학습 모델, 딥 러닝 모델의 3가지 범주로 나눌 수 있습니다.”
- “Traditional models can be divided into linear and non-linear ones [1].”
- “전통적 모델은 선형과 비선형으로 나눌 수 있습니다 [1].”
- “Autoregressive Moving Average (ARMA) [10, 11] and Autoregressive Integrated Moving Average (ARIMA) are two well-known linear models, which can solve stationary and non-stationary time series respectively.”
- “자기 회귀 이동 평균(ARMA) [10, 11] 및 자기 회귀 통합 이동 평균(ARIMA)은 각각 정상 시계열과 비정상 시계열을 해결할 수 있는 두 가지 잘 알려진 선형 모델입니다.”
- “A time series is stationary if its mean and variance are constant (time-independent; no drift) for any period.”
- “시계열은 그 평균과 분산이 어떤 기간에도 일정하면(시간에 독립적; 드리프트 없음) 정상 상태입니다.”
- “ARIMA is used to model non-stationary time series by first transforming it to make it stationary.”
- “ARIMA는 비정상 시계열을 모델링하기 위해 먼저 그것을 정상화하기 위해 변환하는 데 사용됩니다.”
- “Variants of ARIMA include Autoregressive Fractionally Integrated Moving Average (ARFIMA) [12] and Seasonal Autoregressive Integrated Moving Average (SARIMA) [10, 13].”
- “ARIMA의 변형에는 자기 회귀 분수 통합 이동 평균(ARFIMA) [12] 및 계절성 자기 회귀 통합 이동 평균(SARIMA) [10, 13]이 포함됩니다.”
- “As with ARIMA, SARIMA first transforms the time series to make it stationary by eliminating the seasonal component.”
- “ARIMA와 마찬가지로, SARIMA는 계절적 구성 요소를 제거하여 시계열을 정상화하기 위해 먼저 변환합니다.”
- “Among the non-linear models, Autoregressive Conditional Heteroskedasticity and its variants like Generalized ARCH (GARCH) [14, 15, 16], Exponential Generalized ARCH (EGARCH) [16], Threshold Autoregressive (TAR) [17], Non-linear Autoregressive (NAR) , and Non-linear Moving Average (NMA) [20, 21].”
- “비선형 모델 중에는 자기 회귀 조건부 이분산성(ARCH) [14,15,16]과 그 변형인 일반화된 ARCH(GARCH) [14, 15, 16], 지수 일반화된 ARCH(EGARCH) [16], 임계치 자기 회귀(TAR) [17], 비선형 자기 회귀(NAR) [18,19], 비선형 이동 평균(NMA) [20, 21] 등이 있습니다.”
- “The primary limitations of the traditional TSF models are that they apply regression to a fixed set of factors from the most recent historical data to generate the predictions.”
- “전통적인 TSF 모델의 주요 한계점은 가장 최근의 역사적 데이터에서 고정된 요인 집합에 회귀를 적용하여 예측을 생성한다는 것입니다.”
- “Second, traditional methods are iterative and are often sensitive to how the process is seeded.”
- “둘째, 전통적인 방법들은 반복적이며 과정이 어떻게 시작되었는지에 민감한 경우가 많습니다.”
- “Third, stationarity is a strict condition, and it is difficult to achieve stationarity of volatile time series by merely addressing drift, seasonality, autocorrelation, and heteroskedasticity.”
- “셋째, 정상성은 엄격한 조건이며, 단순히 드리프트, 계절성, 자기상관성, 이분산성을 처리함으로써 변동성 있는 시계열의 정상성을 달성하기 어렵습니다.”
- “Hence the need for machine learning models.”
- “따라서 기계 학습 모델이 필요합니다.
- “Standard machine learning models such as Support Vector Machines (SVM) [22, 23] have been used in this context, as have hybrid approaches combining ARIMA with SVM [24] and Neural Networks [25].”
- “서포트 벡터 머신(SVM) [22, 23]과 같은 표준 기계 학습 모델들이 이 맥락에서 사용되었으며, ARIMA와 SVM [24] 및 신경망 [25]을 결합한 하이브리드 접근법도 사용되었습니다.”
- “Artificial Neural Network (ANN) [26, 27] and deep learning NNs [28] have been shown to have better performance than the traditional approaches.”
- “인공 신경망(ANN) [26, 27]과 딥 러닝 신경망(NN) [28]은 전통적인 접근법들보다 더 나은 성능을 보였습니다.”
- “Machine learning approaches best suited for time series forecasting include
Recurrent Neural Network (RNN)[29],Long Short-term Memory (LSTM)[30], andGRUs.”
- “시계열 예측에 가장 적합한 기계 학습 접근법에는 순환 신경망(RNN) [29], 장단기 기억(LSTM) [30], 그리고 GRU가 포함됩니다.”
- “Improved forecasting has been achieved by using attention-based methods called
Transformers[31].”
- “트랜스포머라 불리는 주의 기반 방법을 사용함으로써 개선된 예측이 이루어졌습니다 [31].”
- “A review of the literature on deep learning for TSF can be found here [32, 33].”
- “TSF를 위한 딥 러닝에 관한 문헌 검토는 여기서 찾을 수 있습니다 [32, 33].”
- “Transformers, introduced in 2018 [34], has been successfully used in many domains, including speech recognition [35], machine translation [34], and computer vision .”
- “2018년에 도입된 트랜스포머 [34]는 음성 인식 [35], 기계 번역 [34], 컴퓨터 비전 [36,37,38]을 포함한 많은 분야에서 성공적으로 사용되었습니다.”
- “While there is considerable prior work on modeling time series, there is a lack of knowledge on the practical considerations in using deep learning for time series forecasting.”
- “시계열 모델링에 대한 상당한 선행 연구가 있지만, 시계열 예측을 위한 딥 러닝 사용에 대한 실용적 고려사항에 대한 지식이 부족합니다.”
- “The problem of how much of the past (size of lookback window) or the how far into the future we can reliably predict has not been investigated.”
- “과거(복귀 창의 크기) 중 얼마나 또는 우리가 얼마나 멀리 미래까지 신뢰할 수 있게 예측할 수 있는지에 대한 문제는 조사되지 않았습니다.”
- “The aims of this work are:
- (1) to apply and validate deep learning models (RNN, LSTM, GRU, Transformer) for time series forecasting and compare their corresponding performance;
- (2) to assess the strengths and weaknesses of these models; and
- (3) to understand the impact of the size of look-back window and the length of time of future predictions on the prediction accuracy.”
- “이 작업의 목표는
- (1) 시계열 예측을 위한 딥 러닝 모델(RNN, LSTM, GRU, 트랜스포머)을 적용하고 검증하며그에 따른 성능을 비교하는 것;
- (2) 이러한 모델의 강점과 약점을 평가하는 것; 그리고
- (3) 복귀 창의 크기와 미래 예측의 시간 길이가 예측 정확도에 미치는 영향을 이해하는 것입니다.”
- “For the
Beijing Air Quality Datasetfrom the UCI website, which includes a multivariate time series of many factors measured on an hourly basis for a period of 5 years (2010-14), our experiments show that the Transformer models have the best performance for our predictions.”
- “UCI 웹사이트의 베이징 공기질 데이터셋은 5년간(2010-14) 시간별로 측정된 여러 요인들의 다변량 시계열을 포함하고 있으며, 우리의 실험에서는 트랜스포머 모델이 우리의 예측에 있어서 가장 좋은 성능을 보였습니다.”
- “We also pinpoint the
best look-back window sizesto use for the best predictions at a specified future time.”
- “또한 특정 미래 시간에 가장 좋은 예측을 위해 사용할 최적의 복귀 창 크기를 정확히 지정합니다.”
The “Methodology” section describes the approach used to predict future values of a target variable using deep learning models, based on historical time series data. Here’s a breakdown of the key points and their translations:
- “Using historical data, deep learning models learn a functional relationship between input features and future values of the target variable.”
- “역사적 데이터를 사용하여, 딥 러닝 모델들은 입력 특성과 목표 변수의 미래 값 사이의 함수적 관계를 학습합니다.”
- “The resulting model can provide predictions for the target variable at future time points.”
- “결과적으로 생성된 모델은 미래 시점에서 목표 변수에 대한 예측을 제공할 수 있습니다.”
- “Given a time series, , where is a vector of input features observed or measured at time , the task is to develop a model to predict a target variable at a future time point, , using historical data.”
- “시계열 를 주어졌을 때, 는 시간 에 관측되거나 측정된 개의 입력 특성의 벡터이며, 이때의 과제는 역사적 데이터를 사용하여 미래의 시점 에서 목표 변수 를 예측하는 모델을 개발하는 것입니다.”
- “To make the input to the model of a uniform length, we used a fixed length sliding
time window of size, as shown in Fig. 1.”
- “모델의 입력을 일정한 길이로 만들기 위해, 그림 1에 나타낸 바와 같이 크기 의 고정 길이 슬라이딩 시간 창을 사용했습니다.”
- “Data was transformed by min-max scaling using Eq. (5).”
- “데이터는 식 (5)를 사용한 최소-최대 스케일링에 의해 변환되었습니다.”
- “Mathematically, the functional relationship learned by the machine learning models can be written down as shown in Eq. (1).”
- “수학적으로, 기계 학습 모델이 학습한 함수적 관계는 식 (1)에 나타낸 대로 기술될 수 있습니다.”
- “[Equation]”
- “[방정식]”
- “A detailed example of the setup is provided in the Appendix.”
- “설정의 자세한 예는 부록에서 제공됩니다.”
이 섹션에서는 이 연구에서 사용된 딥 러닝 모델인 순환 신경망(RNN), 장단기 기억(LSTM), 게이트 순환 유닛(GRU), 트랜스포머에 대한 간략한 설명을 제공합니다.
\section{A. 순환 신경망 (RNN)}
물론입니다, RNN(Recurrent Neural Networks, 순환 신경망)에 대한 설명을 한국어로 해석해 드리겠습니다.
- RNN 소개: RNN은 시계열 데이터 모델링에 적합한 신경망입니다. 이는 과거의 입력 특성과 미래의 목표 변수 간의 기능적 관계를 모델링합니다.
- RNN의 구조: RNN은 역사적 데이터 세트에서 반복적으로 학습하면서 시간 에서 로 내부 상태(숨겨진 상태)의 전환에 중점을 둡니다. 모델은 세 개의 매개변수 행렬(, , )과 두 개의 편향 벡터(, )로 정의됩니다.
- 내부 상태와 출력: 출력 는 내부 상태 에 의존하며, 이는 현재 입력 와 이전 상태 모두에 의존합니다.
- 수학적 표현: 내부 상태 는 로 계산되고, 출력 는 로 계산됩니다.
- 매개변수와 활성화 함수: 여기서 는 시간 에서 입력 특성의 입력 벡터이며, 와 는 매개변수 행렬, 와 는 각각 내부 상태와 출력을 위한 편향 벡터, 는 시그모이드 활성화 함수를 나타냅니다.
- RNN의 단점: RNN의 가장 큰 단점은 반복되는 재귀 가중치 행렬의 곱셈으로 인해 기울기 소실 문제를 겪는다는 것입니다. 이로 인해 시간이 지남에 따라 기울기가 너무 작아져 RNN이 단기간의 정보만 기억하게 됩니다.
- Long Short-term Memory (LSTM): Long Short-term Memory (LSTM) 네트워크는 RNN의 변형으로, 기울기 소실 문제를 부분적으로 해결하고 시계열 데이터에서 장기 의존성을 학습합니다.
- LSTM의 구조: LSTM은 시간 에서의 내부(숨겨진) 상태 와 셀 상태 측면에서 설명됩니다.
- 셀 상태의 의존성: 그림 4에 나타난 바와 같이, 는 세 가지 다른 의존성을 가지고 있습니다: (1) 이전 셀 상태 , (2) 이전 내부 상태 , (3) 현재 시점의 입력 .
- 정보 처리 과정: 이 과정은 잊어버리기 게이트, 입력 게이트, 추가 게이트, 출력 게이트를 사용하여 정보를 제거/필터링, 결합/곱셈, 추가하는 것을 허용하여 장기 의존성 학습을 더 잘 제어할 수 있습니다.
- 함수와 게이트: 여기서 , 및 함수는 각각 잊어버리기 게이트, 입력 게이트, 추가 게이트, 출력 게이트에 의해 구현됩니다.
- Gated Recurrent Unit (GRU): Gated Recurrent Units (GRU)는 LSTM의 변형으로 기울기 소실 문제를 더욱 해결합니다.
- GRU의 구조: 그림 5에서 보이듯이, 이 방법의 특이성은 업데이트 게이트, 리셋 게이트, 그리고 세 번째 게이트의 사용에서 나타나며, 각각 및 함수를 구현합니다.
- 상태 표현식: 각 게이트는 이전 정보를 어떻게 필터링, 사용, 결합할지에 대해 다른 역할을 합니다. 다음 상태의 표현식에서 첫 번째 항 은 과거에서 무엇을 유지할지 결정하고, 는 현재 메모리 내용에서 무엇을 수집할지 결정합니다.
- Transformer Model: LSTMs와 GRUs는 RNN의 기울기 소실 문제를 부분적으로 해결합니다. 그러나 하이퍼볼릭 탄젠트 및 시그모이드 함수를 활성화 함수로 사용함으로써 더 깊은 계층에서 기울기 감소가 계속 발생합니다.
- Transformer 네트워크: Transformer 네트워크는 과거의 중요한 정보에서 선택적으로 중요한 정보를 가중치를 부여하는 주의 기능을 사용하여 시계열 분야에서 최고의 성능을 보입니다.
- Transformer 구조: 그림 6은 Transformer 네트워크의 개략도를 보여줍니다. 이는 인코더 및 디코더 부분으로 구성됩니다. 여기서 는 되돌아보기 창의 크기이고 는 미래에 예측할 단계의 수입니다.
- 디코더 부분: 그림 6에서,
- LSTMs and GRUs: LSTMs(장단기 기억 네트워크)와 GRUs(게이트 순환 유닛)는 RNN(순환 신경망)의 기울기 소실 문제를 부분적으로 해결합니다.
- 활성화 함수 문제: 그러나 하이퍼볼릭 탄젠트와 시그모이드 함수를 활성화 함수로 사용하는 것은 깊은 계층에서 기울기 감소를 계속 일으킵니다.
- Transformer 네트워크: Transformer 네트워크는 주의 기능을 사용하여 과거의 중요한 정보를 선택적으로 가중치를 부여하기 때문에 시계열에 대한 최고의 성능을 보여줍니다.
- Transformer 구조: 그림 6은 Transformer 네트워크의 개략도를 보여줍니다. 이 구조는 인코더와 디코더 부분으로 구성됩니다.
Look-back window와 예측 단계: 여기서 는 되돌아보기 창의 크기이고, 는 미래에 예측할 단계의 수입니다.- 디코더의 주의 메커니즘: 그림 6에서, 디코더 부분은 디코더에 마스크된 주의 메커니즘과 인코더 출력에서 선택하는 멀티 헤드 주의 메커니즘을 가지고 있습니다.
- Transformer의 특징: Transformer는 순환 네트워크가 아니지만, 데이터의 시간적 순서를 표시하기 위해 위치 인코딩을 사용합니다.
- 인코더와 디코더: 인코더는 되돌아보기 창 크기 의 데이터를 받아 디코더에 사용될 특징 벡터를 출력합니다.
- 트레이닝 중의 디코더: 트레이닝 중에 디코더는 모델링하려는 미래 데이터와 인코더의 출력을 함께 제공받습니다.
- 주의 기능의 중요성: Transformer 네트워크의 주의 기능은 중요한 특징과 과거 추세에 주의를 기울이도록 학습하는 데 도움을 줍니다.

제공하신 표는 데이터셋의 다양한 변수들과 그 설명을 담고 있습니다. 각 행에 대한 설명은 다음과 같습니다:
- 무시됨 - 아니오: 이것은 데이터셋에서의 행 번호를 나타냅니다. 분석이나 모델에서 사용되지 않는 부분입니다.
- 변수 ‘time’으로 결합됨 - year: ‘year’ 변수는 데이터가 기록된 연도를 나타냅니다. 다른 시간 관련 변수들과 결합하여 종합적인 ‘time’ 변수를 형성합니다.
- day: 이것은 데이터가 수집된 달을 나타냅니다. ‘year’, ‘hour’, ‘PM2.5’와 함께 ‘time’ 변수의 일부입니다.
- 대상 - hour: ‘hour’ 변수는 데이터 항목에 대한 월의 일을 나타냅니다. ‘대상’으로 분류되어 있어 모델이 예측하려고 하는 핵심 변수의 일부일 가능성이 있습니다.
- PM2.5: 여기서 ‘PM2.5’는 일반적인 PM2.5 공기 질 측정이 아니라 하루 중 시간을 나타냅니다.
- DEWP: 이것은 ‘이슬점(Dew Point)‘을 나타냅니다. 여기서는 공기 중 PM2.5 농도를 나타내는 데 사용됩니다.
- 추가 입력 특징 - TEMP: ‘TEMP’는 데이터 기록 시점의 온도를 나타냅니다.
- PRES: 이것은 대기압을 나타냅니다.
- cbwd: ‘Combined Wind Direction’, 즉 풍향을 나타냅니다.
- Iws: ‘Cumulated Wind Speed’, 누적된 풍속을 나타내며 일정 기간 동안 기록된 총 풍속일 가능성이 있습니다.
- Is: ‘Cumulated Hours of Snow’, 즉 누적된 눈 내린 시간을 나타냅니다.
- Ir: ‘Cumulated Hours of Rain’, 즉 누적된 비 온 시간을 나타냅니다. 이 표는 환경 또는 기상 분석에 사용될 가능성이 높은 데이터셋의 일부로 보이며, 이러한 변수들의 조합은 날씨 조건과 공기 질을 예측하거나 이해하는 데 도움이 될 수 있습니다.
이 섹션은 사용된 데이터셋에 대해 설명하고 있습니다. 여기에 포함된 주요 내용을 요약하면 다음과 같습니다:
- 데이터셋 출처: 사용된 데이터셋은 UCI 웹사이트의 시간별 베이징 공기질 데이터셋으로, 2010년 1월 1일부터 2014년 12월 31일까지의 다섯 해 동안의 데이터를 포함합니다.
- 데이터 수집 및 크기: 데이터는 시간별로 수집되었으며, 데이터셋은 43,824행과 13열로 구성되어 있습니다.
- 열 구성: 첫 번째 열은 단순한 인덱스로, 분석에는 사용되지 않았습니다. ‘year’, ‘month’, ‘day’, ‘hour’로 레이블된 네 개의 열은 “year-month-day-hour”라는 단일 특징으로 결합되었습니다.
- 타겟 변수: ‘PM2.5’ 열은 타겟 변수로 사용되었습니다. 나머지 모든 변수들은 입력 특징으로 사용되었습니다.
- 데이터 누락: 소수의 행(43,824개 중 24개)은 누락된 데이터로 인해 제거되었습니다.
- 데이터 전처리: 풍향의 범주형 특징에는 원-핫 인코딩이 적용되었고, 데이터는 Min-Max 정규화 기법을 사용하여 [0,1] 범위로 정규화되었습니다. 이는 다음과 같은 식으로 표현됩니다:
- 데이터 분할: 데이터는 훈련 세트(처음 70% 행)와 테스트 세트(마지막 30% 행)로 나누어졌습니다. 이 데이터셋은 시계열 분석, 특히 공기질 예측과 관련된 연구에서 중요한 정보를 제공하는 것으로 보입니다.
이 섹션은 수행된 실험에 대한 설명입니다. 주요 내용을 요약하면 다음과 같습니다:
- 실험 목적: 실험은 미래의 한 시점() 또는 여러 시점()을 예측하는 데 초점을 맞춥니다. 인 경우를 ‘단일-단계 예측’, 인 경우를 ‘다중-단계 예측’이라고 합니다.
- Look-back Window: 실험에서는 다양한 ‘look-back window’ 크기()가 사용되었습니다. 이는 최근 과거의 데이터 부분을 입력으로 사용하는 것을 나타냅니다. 1, 2, 4, 8, 16일의 창 크기가 두 실험 세트 모두에 사용되었습니다.
- 창 크기의 영향: 창 크기를 지수적으로 선택하는 것은 예측 정확도에 대한 창 크기의 영향을 이해하기 위한 것입니다.
- 다중-단계 예측: 다중-단계 예측은 1, 2, 4, 8, 16시간 후의 공기질 값을 예측하는 데 사용되었습니다.
- 실험 설정: 4가지 딥 러닝 모델(RNN, LSTM, GRU, Transformer)에 대해 다양한 하이퍼파라미터 설정이 시도되었습니다.
- 모델별 설정: 각 모델에 대한 설정은 아래와 같습니다:
- RNN, LSTM, GRU: Epoch(100, 200), 학습률(LR: 0.0005, 0.00001), 배치 크기(256, 512), 최적화 알고리즘(Adam)
- Transformer: Epoch(200, 300), 학습률(LR: 0.0005, 0.00005), 배치 크기(256, 512), 최적화 알고리즘(AdamW)
- 실험 조합: 학습률(0.00001, 0.00005, 0.0001, 0.0005, 0.001), 배치 크기(128, 256, 512) 및 최적화 알고리즘(Adam, SGD) 매개변수가 실험에서 다양하게 조합되어 사용되었습니다. 이러한 실험은 공기질 예측과 관련된 다양한 딥 러닝 모델의 성능과 하이퍼파라미터 설정의 효과를 평가하는 데 중요한 역할을 합니다.
이 섹션은 미래 여러 시간 단계를 예측하는 데 초점을 맞추고 있습니다. 주요 내용을 요약하면 다음과 같습니다:
- 고정된 Look-back Window 크기: 예를 들어, 4일(96시간)의 고정된 look-back window 크기에 대해, 미래로의 시간( 값)이 증가함에 따라 모델 성능이 어떻게 저하되는지 조사합니다.
- 성능 감소 예상: 값이 증가함에 따라 성능이 저하될 것으로 예상하는 것이 합리적입니다.
- 성능 지표 확인: TABLE III에 나타난 것처럼, 각 열에서 평균 절대 오차(MAE)와 제곱근 평균 제곱 오차(RMSE) 값이 와 함께 증가합니다.
- Transformer의 우수한 성능: Transformer 모델이 RNN, LSTM, GRU보다 80%의 실험에서 더 나은 성능을 보여줍니다.
- 예측 성능의 급격한 저하: 4시간 이상 미래를 예측해야 할 때 예측 성능이 급격하게 떨어집니다. 이러한 분석은 시계열 데이터를 예측하는 데 있어서 미래 시간 단계의 길이가 모델 성능에 미치는 영향을 이해하는 데 중요합니다. 특히, 더 긴 시간을 예측할수록 정확도가 감소하는 경향을 확인할 수 있으며, 이는 모델 선택과 하이퍼파라미터 조정에 있어 중요한 고려사항이 됩니다.

이 섹션은 look-back window 크기가 단일-단계 및 다중-단계 예측에 미치는 영향에 대해 설명합니다. 주요 내용을 요약하면 다음과 같습니다:
- 다양한 Look-back Window 크기 실험: 실험은 다양한 look-back window 크기에 대해 수행되었으며, 이는 24, 48, 96, 192, 그리고 384시간으로 설정되었습니다.
- 단일-단계 예측:
- 결과 요약: TABLE IV는 실험 결과를 요약합니다.
- Transformer의 우수성: 더 큰 window 크기(96시간 이상)에서 Transformer 네트워크 모델이 다른 방법보다 우수한 성능을 나타냅니다. 이는 주의(attention) 기반 접근법의 강점과 일치합니다.
- 작은 창 크기에서 GRU와 LSTM의 우수성: 24시간 또는 48시간과 같은 작은 창 크기에서 GRU와 LSTM이 RNN보다 더 나은 성능을 보입니다. 이는 GRU와 LSTM이 RNN보다 장기 기억능력이 더 뛰어나고 기울기 소실 문제를 부분적으로 해결했다는 주장과 일치합니다.
- 단일-단계 예측을 위한 GRU와 LSTM의 적합성: 작은 창 크기만 선택할 수 있는 경우, GRU와 LSTM이 단일-단계 예측에 더 적합한 선택입니다.
- Transformer의 한계: 불행히도, Transformer 네트워크는 더 큰 창 크기를 사용할 때도 더 나은 성능을 보이지 못하며, 이는 더 큰 창에서 증가된 노이즈 수준 때문일 수 있습니다.
- 다중-단계 예측:
- 결과 요약: TABLE IV는 시간 후를 예측하기 위한 실험 결과를 보여줍니다.
- Transformer의 우수성: Transformer 네트워크가 다른 모든 도구를 능가합니다.
- 성능 변화의 비단조성: 성능 변화가 단조롭지 않으며, 또는 96시간에서 최소값이 도달한다는 것은 이러한 값들이 학습 방법에 있어 최적일 수 있음을 시사합니다.
- 실험 결과 시각화: 그림 9는 실험에 대한 예측을 시각화하며, T1, T2, T3 곡선은 각각 시간에 대한 실험 결과를 나타냅니다. 이 분석은 미래 시간 단계를 예측하기 위한 모델 선택과 설정에 있어서 look-back window 크기가 중요한 변수임을 보여줍니다. 작은 창 크기에서는 GRU와 LSTM이, 큰 창 크기에서는 Transformer가 더 나은 성능을 보이는 경향이 있음을 확인할 수 있습니다.
제공된 TABLE V는 다양한 look-back window 크기를 사용하여 3시간 후를 예측하는 다중-단계 예측의 성능(평균 절대 오차(MAE) 및 제곱근 평균 제곱 오차(RMSE))을 보여줍니다. 각 행에서 가장 좋은 결과는 굵은 글씨체로 표시되어 있습니다. 표의 주요 내용을 요약하면 다음과 같습니다:
- Look-back Window 크기:
- 1일, 2일, 4일, 8일, 16일의 다양한 크기가 실험에 사용되었습니다.
- 모델 별 성능 비교:
- RNN: 모든 window 크기에서 RNN은 상대적으로 높은 MAE 및 RMSE 값을 보여줍니다.
- LSTM: LSTM은 RNN보다는 낮지만 Transformer보다는 높은 MAE 및 RMSE 값을 보여줍니다.
- GRU: GRU 역시 LSTM과 유사한 경향을 보이지만, 일부 window 크기에서는 LSTM보다 약간 나은 성능을 보여줍니다.
- Transformer: 모든 window 크기에서 Transformer는 가장 낮은 MAE 및 RMSE 값을 기록하여 가장 우수한 성능을 보여줍니다.
- 성능의 변화:
- Look-back window 크기가 커질수록 모든 모델의 성능이 저하되는 경향을 보입니다.
- 특히, 16일의 큰 window 크기에서는 모든 모델의 성능이 상당히 저하되었으나, Transformer는 여전히 가장 낮은 오차 값을 유지합니다. 이 데이터는 다양한 모델과 look-back window 크기에 따른 시계열 데이터 예측의 성능 차이를 분석하는 데 중요한 정보를 제공합니다. Transformer 모델이 다양한 window 크기에서 가장 일관된 우수한 성능을 보이는 것으로 나타났습니다.