Skip to Content

Regression Tree

회귀 트리(Regression Tree)는 연속적인 수치 결과를 예측하기 위한 결정 트리 유형입니다. 이는 분류 트리가 범주형 레이블을 예측하는 것과 달리, 수치적인 값을 예측하는 데 사용됩니다. 회귀 트리는 지도 학습 알고리즘의 한 형태로 데이터 분석, 경제학, 과학 연구 등 다양한 분야에 널리 사용됩니다. 회귀 트리의 작동 방식은 다음과 같습니다:

  1. 트리 구조: 회귀 트리는 노드와 가지로 구성됩니다. 최상위 노드는 루트이며, 트리는 여러 가지와 노드로 나뉘며, 말단 노드인 잎(Leaves)에서 끝납니다. 각 잎은 예측된 수치 값을 나타냅니다.
  2. 분할 기준: 트리는 독립 변수를 기반으로 데이터셋을 여러 하위 집합으로 나누어 구축됩니다. 이러한 분할은 하위 집합 내의 종속 변수의 변동성을 줄이는 방식으로 노드에서 이루어집니다. 일반적인 분할 기준으로는 제곱 오차의 합이나 분산을 최소화하는 것이 있습니다.
  3. 트리 구축:
  • 루트에서 전체 데이터셋으로 시작합니다.
  • 분산 감소와 같은 기준을 바탕으로 최적의 분할을 선택합니다.
  • 데이터셋을 두 개 이상의 균질한 집합으로 분할합니다.
  • 각 하위 집합에 대해 정지 기준(예: 각 잎의 최소 데이터 포인트 수, 트리의 최대 깊이, 분산 감소의 최소 개선)이 충족될 때까지 과정을 반복합니다.
  1. 예측: 새로운 데이터 포인트에 대한 예측을 하기 위해, 그 포인트는 트리를 따라 필터링되며, 그 특성에 따라 가지를 따라 이동하여 잎에 도달합니다. 예측 값은 잎의 데이터 포인트에 대한 종속 변수의 평균(또는 중앙값)입니다.
  2. 가지치기: 과적합을 피하기 위해, 예측 정확도에 크게 기여하지 않는 가지를 제거하여 트리를 가지치기합니다. 이는 교차 검증과 같은 방법으로 수행될 수 있습니다.
  3. 장단점:
  • 장점으로는 비선형 관계를 다룰 수 있으며, 해석하기 쉽고, 독립 변수의 분포에 대한 엄격한 가정이 필요 없다는 점이 있습니다.
  • 단점으로는 과적합에 취약하며, 훈련 데이터의 변화에 민감하고, 예측 표면의 부드러움이 부족할 수 있다는 점이 있습니다.
  1. 사용처: 회귀 트리는 결정 규칙을 이해하는 것이 중요하거나 비선형 관계를 모델링하는 상황에서 사용됩니다. 예를 들어, 고객 생애 가치 예측, 부동산 가격 책정, 날씨 예보 등에 활용됩니다. 요약하면, 회귀 트리는 연속적인 결과를 예측하기 위한 강력하고 해석 가능한 도구입니다. 데이터를 종속 변수의 변동성을 최소화하는 하위 집합으로 나누고, 이러한 하위 집합의 평균 또는 중앙값을 사용하여 예측을 수행합니다.