Skip to Content

기초 통계

pagePassword: True

Spotfire에는 기본적으로 내장된 통계모델들이 있습니다. 해당 스팟파이어 내장 파이썬 모듈을 이해하기 위한 최소한의 통계지식 내용입니다. 좀 더 심오한 내용들은 기초통계강의를 참고해주세요


기술통계(Descriptive Statistics)

중심 경향성(Central Tendency)

평균(Mean)

Mean=i=1nXin \text{Mean} = \frac{\sum_{i=1}^{n} X_i}{n}

여기서 (Xi X_i 는 각 데이터 포인트를, nn은 데이터 포인트의 총 개수를 나타냅니다.

중앙값(Median) [그림]

최빈값(Mode) [그림]

분산성(Dispersion)

범위(Range)

Range=Max(X)Min(X)\text{Range} = \text{Max}(X) - \text{Min}(X)

( Max(X) \text{Max}(X)Min(X)\text{Min}(X) 는 데이터셋의 최대값과 최소값)

분산(Variance)

Variance=i=1n(XiMean)2n\text{Variance} = \frac{\sum_{i=1}^{n} (X_i - \text{Mean})^2}{n}

표준편차(Standard Deviation)

Standard Deviation=Variance \text{Standard Deviation} = \sqrt{\text{Variance}}

상관관계(Correlation)

상관계수에 따른 두 변수 간의 관계를 살펴볼 수 있습니다. 상관계수는 두 변수 사이의 선형적인 관계를 나타내며, 그 값은 -1에서 1 사이입니다. 먼저, 음의 상관관계에서는 상관계수가 -1에 가까울수록 두 변수 간의 관계가 강해집니다. 예를 들어, 상관계수가 -0.99일 때는 X값이 증가할수록 Y값이 거의 완벽하게 감소하는 모습을 보입니다. 상관계수가 -0.75일 때는 여전히 강한 음의 상관관계가 있지만, 데이터에 다소 분산이 보입니다. 상관계수가 -0.50일 때는 중간 정도의 음의 상관관계를 나타내며, X값이 증가할 때 Y값이 감소하는 경향이 뚜렷하지만 그 강도는 약해집니다. 상관계수가 -0.25일 때는 매우 약한 음의 상관관계를 나타내며, 데이터 간의 분포가 더 퍼져 있어 X와 Y 간의 관계가 거의 나타나지 않습니다. 반면, 양의 상관관계에서는 상관계수가 1에 가까울수록 두 변수는 강하게 양의 선형 관계를 가집니다. 상관계수가 0.99일 때는 X값이 증가할수록 Y값도 거의 직선적으로 증가합니다. 상관계수가 0.75일 때는 강한 양의 상관관계를 보이며, X값이 증가함에 따라 Y값도 분명하게 증가합니다. 상관계수가 0.50일 때는 중간 정도의 양의 상관관계를 나타내며, X값이 증가하면 Y값도 증가하는 경향이 있지만 그 강도는 약간 낮습니다. 상관계수가 0.25일 때는 약한 양의 상관관계를 보이며, X와 Y 간의 관계가 명확하지 않고 데이터가 퍼져 있습니다. 따라서 상관계수는 두 변수 간의 관계의 강도와 방향을 나타내며, 1에 가까울수록 강한 양의 관계, -1에 가까울수록 강한 음의 관계를 가집니다. 0에 가까운 값일수록 두 변수 간의 선형적인 관계가 약해집니다.

출처: https://otexts.com/fppkr/graphics-scatterplots.html  https://otexts.com/fppkr/graphics-scatterplots.html 

  • 상관계수(Correlation Coefficient)
r=i=1n(XiMeanX)×(YiMeanY)i=1n(XiMeanX)2×i=1n(YiMeanY)2r = \frac{\sum_{i=1}^{n} (X_i - \text{Mean}_X) \times (Y_i - \text{Mean}Y)}{\sqrt{\sum{i=1}^{n} (X_i - \text{Mean}X)^2 \times \sum{i=1}^{n} (Y_i - \text{Mean}_Y)^2}}

rr 은 상관계수, XiX_iYiY_i 는 각각 두 변수의 데이터 포인트

회귀분석(Regression Analysis)

단순선형회귀(Simple Linear Regression) 다중선형회귀(Multiple Linear Regression)

데이터의 특성을 수치적으로 이해하고 해석하는 데 중요한 역할을 합니다. 기술통계는 데이터셋을 요약하고 설명하는 데 사용되며, 회귀분석은 변수 간의 관계를 모델링하고 예측하는 데 사용됩니다.


가설(Hypothesis):

💡 귀무가설(Null Hypothesis, H0): 연구에서 증명하고자 하는 가설과 반대되는 주장입니다. 예를 들어, “두 집단 간에 차이가 없다” 또는 “어떤 처리의 효과가 없다”와 같은 주장입니다. 통계적 검정은 귀무가설을 기준으로 진행됩니다.

💡 대립가설(Alternative Hypothesis, H1 또는 Ha): 연구자가 입증하고자 하는 주장입니다. 예를 들어, “두 집단 간에는 차이가 있다” 또는 “어떤 처리는 효과가 있다”와 같은 주장입니다.


P**-value(유의 확률)**

💡 p-value는 귀무가설이 참일 때, 관측된 데이터가 나타날 확률입니다. 즉, 실험 결과가 우연히 발생할 가능성을 수치적으로 나타냅니다.

  • 낮은 p-value (일반적으로 0.05 또는 5% 이하)는 귀무가설이 참일 경우 관측된 결과가 매우 드물게 발생할 것이라는 것을 의미하며, 이는 귀무가설을 기각할 수 있는 강력한 증거로 간주됩니다.

Alpha(유의수준)

💡 유의수준 alpha는 귀무가설을 잘못 기각할 확률의 최대 허용 한계입니다. 즉, 1종 오류(귀무가설이 참인데도 불구하고 기각하는 오류)를 범할 최대 확률입니다.

  • 흔히 0.05(5%)로 설정되며, 이는 100번의 실험 중 최대 5번은 잘못된 결론을 내릴 수 있음을 의미합니다.

가설 검정에서는 먼저 가설을 설정하고, 데이터를 수집 및 분석하여 p-value를 계산합니다. 이 p-value가 설정된 alpha 값보다 낮으면 귀무가설을 기각하고, 대립가설을 지지하는 것으로 결론을 내립니다. 이러한 과정을 통해 연구 가설의 타당성을 통계적으로 검증합니다.


지수 표기법 (Scientific Notation)

지수 표기법은 매우 크거나 작은 숫자를 간결하고 표준화된 형태로 표현하는 방법입니다. 이 방식은 숫자를 10의 거듭제곱을 사용하여 표현합니다. 지수 표기법의 일반적인 형태는 다음과 같습니다: a×10na \times 10^n 여기서,

  • aa 는 1 이상 10 미만의 실수입니다.
  • nn 은 정수이며, 10의 거듭제곱을 나타냅니다. 예를 들어, 300은 지수 표기법으로 3×1023 \times 10^2로 표현되며, 0.005는 5×1035 \times 10^{-3}로 표현됩니다.

결정 계수 (Coefficient of Determination, R2R^2 )

결정 계수, 또는 R2R^2 값은 회귀 분석에서 종속 변수의 변동성이 독립 변수들에 의해 얼마나 잘 설명되는지를 나타내는 지표입니다. R2R^2 값은 0과 1 사이의 값을 가지며, 높을수록 모델이 데이터를 잘 설명한다고 해석됩니다.

R2=1SSresSStotR^2 = 1 - \frac{SS_{res}}{SS_{tot}}

여기서,

  • SSresSS_{res}는 잔차 제곱 합(Residual Sum of Squares)이며, 모델이 데이터를 얼마나 잘 예측하지 못하는지를 나타냅니다.
  • SStotSS_{tot}는 총 제곱 합(Total Sum of Squares)으로, 데이터의 전체적인 변동성을 나타냅니다. 결정 계수는 모델의 설명력을 나타내지만, 항상 높은 R2R^2 값이 좋은 모델을 의미하는 것은 아닙니다. 불필요한 변수가 추가되면 R2R^2 는 증가할 수 있지만, 이는 과적합(Overfitting)을 초래할 수 있습니다. 따라서 R2R^2 를 해석할 때는 모델의 복잡성도 고려해야 합니다.

결정 계수(Coefficient of Determination)

표기되는 방식으로 R2R^2 값은 회귀 분석에서 모델의 설명력을 나타내는 지표입니다. R2R^2 값은 0에서 1 사이의 값을 가지며, 다음과 같은 의미를 가집니다: ** R2=0R^2 = 0 인 경우**

  • 이 경우, 모델이 데이터의 변동성을 전혀 설명하지 못한다는 것을 의미합니다. 즉, 모델이 종속 변수의 분산을 설명하는 데 있어서 전혀 유용하지 않음을 나타냅니다.
  • 이는 독립 변수와 종속 변수 사이에 아무런 선형 관계가 없음을 나타낼 수 있습니다. ** R2=1R^2 = 1 인 경우** ** R2=0.6R^2 = 0.6 인 경우** 결정 계수를 해석할 때 주의할 점은 높은 R2R^2 값이 항상 더 나은 모델을 의미하지는 않는다는 것입니다. 때때로, 과적합(Overfitting)이나 불필요한 변수의 추가로 인해 R2R^2 값이 인위적으로 높아질 수 있습니다. 따라서 R2R^2 값 외에도 모델의 다른 측정 지표들과 함께 전체적인 모델 성능을 평가해야 합니다.

t 분포

  • 평균이 0이며 평균을 중심으로 좌우로 대칭인 분포
  • 일반적으로 양 꼬리쪽 넓이가 정규분포에 비해 넓음
  • 첨도가 3보다 크기 떄문에 가운데 부분이 얇은편
  • 자유도(사례수)에 따라 분포의 모양이 변화
  • 자유도가 클수록 분포의 모양은 정규분포에 가까워짐
  • 모평균, 모비율, 모평균의 차이, 회귀계수의 통계쩍 유의성 검증에 사용

카이제곱 분포

  • 범주형 변수의 독립석 검정과 모분산이 특정한 값을 갖는지 여부를 검증하는 분석, 적합성 검증, 단일모딥단의 모분산 검정 등에서 사용
  • 왼쪽으로 기울어지고 오른쪽으로 긴 꼬리를 가진 연속현 분포 형태
  • 자유도에 따라 분포의 모양이 변화
  • 자우도가 K일 경우 평균은 K이고 분산은 2k

F분포

  • 두 개의 정규모집단의 표본의 분산 비교에 사용
  • 자유도의 크기에 따라 분포의 형태가 변화
  • 항상 양의 값을 가지는 비대칭 분포의 형태
  • 분산분석, 회귀모형의 적합도, 분산동질성 검정등에 사용
  • 활률변수 X의 F분포가 자유도 a,b를 따를 경우 F(a,b)로 표기하며, 확률변수 1/X1/X 의 분포는 1/F(a,b) = F(b,a)를 따름

집계 및 통계 측정