Skip to Content

선형 회귀(Linear Regression)

선형방정식

모델 적합

선형회귀

결과 해석


  • ** CODE**
import numpy as np import matplotlib.pyplot as plt from sklearn.linear_model import LinearRegression # 임의의 데이터 생성 np.random.seed(0) # 결과의 일관성을 위해 시드값 설정 x = np.random.rand(100, 1) * 10 # 0에서 10 사이의 x값 100개 생성 y = 2 * x + 1 + np.random.randn(100, 1) * 2 # y = 2x + 1에 노이즈 추가 # 선형 회귀 모델 학습 model = LinearRegression() model.fit(x, y) # 회귀선을 위한 예측값 생성 x_line = np.arange(min(x), max(x), 0.01).reshape(-1, 1) y_line = model.predict(x_line) # 데이터와 회귀선 시각화 plt.scatter(x, y, color='blue', label='Data Points') plt.plot(x_line, y_line, color='red', label='Regression Line') plt.xlabel('X') plt.ylabel('Y') plt.title('Linear Regression') plt.legend() plt.show()
  • 아래 그림 추가 해놓기

선형 회귀(Linear Regression)는 의존 변수(종속 변수)와 하나 이상의 독립 변수 사이의 관계를 모델링하는 통계적 방법입니다. 선형 회귀의 목적은 데이터 포인트를 통과하는 최적의 직선을 찾는 것입니다. 자세한 설명은 다음과 같습니다:

  1. 의존 변수와 독립 변수: 선형 회귀에서 의존 변수(또는 반응 변수)는 예측하거나 설명하려는 변수이며, 독립 변수(또는 예측 변수나 특성)는 예측을 만드는 데 사용되는 변수들입니다. 예를 들어, 주택의 면적(독립 변수)을 사용하여 주택 가격(의존 변수)을 예측할 수 있습니다.
  2. 선형 방정식: 선형 회귀는 선형 방정식을 사용하여 관계를 모델링합니다.

이 방정식은 종종 y = β0 + β1x1 + β2x2 + ... + βnxn + ε로 쓰여지는데, 여기서:

  • y는 의존 변수입니다.
  • x1, x2, ..., xn은 독립 변수들입니다.
  • β0은 y-절편(모든 x 값이 0일 때 y의 값)입니다.
  • β1, β2, ..., βn은 계수로, 각 독립 변수가 의존 변수에 미치는 영향을 나타냅니다.
  • ε는 오차 항으로, 독립 변수들로 설명할 수 없는 y의 변동성을 나타냅니다.
  1. 모델 적합: 선형 회귀 모델을 “적합”하는 것은 계수(β 값들)와 절편에 가장 적절한 값을 찾는 것을 포함합니다. 이는 일반적으로 “최소 제곱법”이라는 방법을 사용하여 수행되며, 관측된 값과 모델에 의해 예측된 값 사이의 차이의 제곱합을 최소화합니다.
  2. 결과 해석: 모델이 적합되면, 계수를 해석하여 변수들 사이의 관계를 이해할 수 있습니다. 예를 들어, 단순 선형 회귀(하나의 독립 변수)에서 계수가 3이라면, 독립 변수가 한 단위 증가할 때마다 의존 변수가 3단위 증가한다는 것을 의미합니다.
  3. 가정: 선형 회귀는 몇 가지 주요 가정을 가지고 있습니다. 이에는 변수들 간의 관계가 선형이라는 것, 관찰값들이 독립적이라는 것, 오차 항의 분산이 모든 독립 변수 수준에서 일관되다는 것(등분산성), 오차의 정규 분포 등이 포함됩니다.
  4. 사용 사례: 선형 회귀는 경제학, 생물학, 공학, 사회과학 등 다양한 분야에서 널리 사용됩니다. 예측을 만들고, 추세를 분석하며, 변수들 간의 관계를 식별하는 데 유용합니다.
  5. 한계: 유용함에도 불구하고, 선형 회귀는 모든 종류의 데이터에 적합하지 않습니다. 비선형 패턴의 복잡한 관계를 모델링할 수 없으며, 이상치에 민감합니다. 요약하자면, 선형 회귀는 변수들 간의 관계를 이해하고 예측하기 위한 기본적이고 널리 사용되는 통계 기술입니다. 그 간단함에서 힘을 발휘하지만, 데이터의 맥락과 연구 질문에 따라 고려해야 할 한계가 있습니다.