Skip to Content

Logistic Regression

로지스틱 회귀(Logistic Regression)는 이진 분류 문제에 사용되는 통계적 방법입니다. 예측 모델링에 사용되는 회귀 분석의 한 유형으로, 특히 종속 변수가 범주형일 때(일반적으로 ‘예’ 또는 ‘아니오’, ‘성공’ 또는 ‘실패’와 같은 이진형) 유용합니다. 로지스틱 회귀는 하나 이상의 독립 변수(예측 변수)를 기반으로 이진 반응의 확률을 추정합니다. 작동 방식은 다음과 같습니다:

  1. 확률 모델링: 로지스틱 회귀는 주어진 입력 변수들을 바탕으로 특정 이벤트(예: 성공, 예)가 발생할 확률을 모델링합니다. 이는 0과 1 사이의 값을 출력하며, 이 값들은 확률로 해석됩니다.
  2. 로지스틱 함수: 로지스틱 회귀의 핵심은 로지스틱 함수, 종종 시그모이드 함수라고 불립니다. 이 함수는 모든 실수 값을 0과 1 사이의 값으로 매핑하여, 확률 모델링에 특히 적합합니다. 로지스틱 함수는 다음과 같이 정의됩니다: $$ P(Y=1) = \frac{1}{1 + e^{-(\beta_0 + \beta_1X_1 + ... + \beta_kX_k)}} $$$ 여기서 P(Y=1) 은 사건이 발생할 확률이며, \( X_1, …, X_k ))는독립변수들이고,)는 독립 변수들이고, \beta_0, \beta_1, …, \beta_k $는 계수들입니다.
  3. 계수 추정: 계수 β0,β1,...,βk\beta_0, \beta_1, ..., \beta_k는 최대 우도 추정법을 사용하여 추정됩니다. 이 방법은 예측 변수 값을 주어진 응답 세트의 가능성을 최대화하는 계수 값들을 찾습니다.
  4. 결과 해석: 로지스틱 회귀에서 계수들은 결과의 로그 확률을 나타냅니다. 이 계수들의 지수화는 확률 비율로 해석될 수 있으며, 예측 변수가 한 단위 증가할 때마다 확률이 얼마나 변하는지를 나타냅니다.
  5. 장단점:
  • 장점으로는 확률을 제공하고 새로운 샘플을 분류할 수 있으며, 종속 변수와 독립 변수 간의 비선형 관계를 다룰 수 있고, 구현 및 해석이 쉽다는 점이 있습니다.
  • 단점으로는 결과의 로짓과 독립 변수 사이의 선형성 가정, 연속적 결과를 예측할 수 없으며, 많은 특성을 가질 경우 과적합에 취약하다는 점이 있습니다.
  1. 응용 분야: 로지스틱 회귀는 의학(질병 가능성 예측), 마케팅(고객 이탈 예측), 금융(부도 확률) 등 이진 결과를 예측해야 하는 다양한 분야에서 널리 사용됩니다. 요약하면, 로지스틱 회귀는 이진 분류를 위한 강력하고 직관적인 통계적 방법입니다. 이는 독립 변수의 함수로 이벤트 발생 확률을 모델링하며, 예측 변수와 결과 확률 간의 관계에 대한 통찰을 제공합니다.