Skip to Content

카이제곱(Chi-Square)

카이제곱 검정(Chi-square test)은 범주형 데이터에 적용되는 통계적 검정 방법입니다. 가장 흔한 사용 예는 **교차표(contingency table)**를 이용한 독립성 검정입니다. 여기에는 두 가지 범주형 변수 간의 독립성 여부를 검정하는 것이 포함됩니다.종종 χ2\chi^2 검정으로 표현되는 이 통계적 방법은 하나 이상의 범주에서 기대 빈도수와 관측 빈도수 간에 유의미한 차이가 있는지를 결정하기 위해 사용됩니다.

  1. 카이제곱 검정의 목적: 카이제곱 검정의 주요 사용 목적은 관측된 분포가 우연에 의한 것인지를 평가하는 것입니다. 이는 변수들이 명목척도나 순서척도인 범주형 데이터에 특히 유용합니다.
  2. 카이제곱 검정의 유형:
  • 독립성 검정(Chi-Square Test of Independence): 두 범주형 변수 간에 유의미한 관계가 있는지를 결정합니다.
  • 적합도 검정(Chi-Square Goodness of Fit Test): 샘플 범주형 데이터의 분포가 기대되는 분포와 일치하는지를 검사합니다.
  1. 기본 개념: 카이제곱 검정은 각 범주에서의 관측 빈도수를 관계가 없을 때(독립성 검정) 또는 분포가 기대 분포에 적합할 때(적합도 검정) 기대되는 빈도수와 비교합니다.
  2. 계산 방법: 검정 통계량은 다음 공식을 사용하여 계산됩니다: $$ \chi^2 = \sum \frac{(O_i - E_i)^2}{E_i} $$$ 여기서 O_i 는각범주에서의관측빈도수,는 각 범주에서의 관측 빈도수, E_i $는 귀무 가설 하에서의 기대 빈도수이며, 합계는 모든 범주에 대해 이루어집니다.
  3. 가정:
  • 샘플은 독립적이어야 합니다.
  • 데이터는 범주형이어야 합니다.
  • 독립성 검정의 경우, 기대 빈도수는 충분히 커야 합니다(일반적으로 최소 5 이상).
  1. 결과 해석: 카이제곱 통계량이 자유도에 비해 높으면 관측 빈도수와 기대 빈도수 사이에 유의미한 차이가 있음을 제시합니다. 이는 보통 p-값으로 평가됩니다.
  2. 사용사례: 카이제곱 검정은 시장 조사, 건강 연구 등 범주형 변수 간의 관계를 이해하는 것이 중요한 연구 분야에서 널리 사용됩니다. 요약하면, 카이제곱 검정은 범주형 변수 간 차이의 중요성을 결정하기 위해 사용되는 필수적인 통계 도구입니다. 이는 관측 빈도수가 기대 빈도수와 유의미하게 다른지 여부를 평가하는 데 도움을 주며, 변수 간 관계의 맥락(독립성 검정)이나 기대 분포에의 적합성(적합도 검정)에서 사용됩니다.

예를 들어, 우리가 ‘성별’과 ‘좋아하는 색상’ 사이의 연관성을 알고 싶다고 가정해 보겠습니다. 데이터 수집: 데이터 수집 표, 특히 카이제곱 검정에서 사용되는 교차표(contingency table)는 두 범주형 변수 간의 관계를 나타내는 데 사용됩니다. 이 표는 각 변수의 모든 가능한 범주를 행과 열로 배열하여 구성됩니다. 각 셀에는 해당 범주 조합에 해당하는 데이터의 빈도 수가 포함됩니다. 예를 들어, ‘성별’과 ‘좋아하는 색상’ 사이의 관계를 조사하는 경우를 살펴보겠습니다. 여기서 ‘성별’과 ‘좋아하는 색상’은 두 범주형 변수이며, 각각 ‘남성’, ‘여성’과 ‘빨강’, ‘파랑’이라는 범주를 가집니다. 교차표는 다음과 같이 구성됩니다:

색상남성 (빈도)여성 (빈도)합계
빨강203050
파랑302050
합계5050100
  • 각 행은 ‘좋아하는 색상’ 범주(빨강, 파랑)를 나타냅니다.
  • 각 열은 ‘성별’ 범주(남성, 여성)를 나타냅니다.
  • 각 셀의 숫자는 해당하는 성별과 색상 조합을 선택한 사람들의 수를 나타냅니다. 예를 들어, 20명의 남성이 빨강색을 가장 좋아한다고 답했습니다.
  • 마지막 행과 열은 각각 색상과 성별에 대한 합계를 나타냅니다. 이 데이터를 사용하여 카이제곱 검정을 수행함으로써, ‘성별’과 ‘좋아하는 색상’ 간의 독립성 여부를 통계적으로 평가할 수 있습니다. 가설 설정: 기대 빈도 계산: 각 칸에 대해 기대 빈도를 계산합니다. 기대 빈도는 해당 행의 합계와 해당 열의 합계를 곱한 다음 총 합계로 나누어 계산합니다. 예를 들어, ‘남성이 빨강색을 좋아할 기대 빈도’는 (50 * 50) / 100 = 25입니다.
  1. 카이제곱 통계량 계산: 각 칸에 대해 관찰 빈도와 기대 빈도의 차이를 제곱한 다음 기대 빈도로 나누고, 이를 모든 칸에 대해 합산합니다. χ2=(관찰빈도기대빈도)2기대빈도\chi^2 = \sum \frac{(관찰빈도 - 기대빈도)^2}{기대빈도}
  2. 결론 도출: 계산된 카이제곱 통계량을 카이제곱 분포표와 비교하여 p-value를 찾습니다. p-value가 사전에 정한 유의 수준(예: 0.05)보다 낮으면 귀무 가설을 기각하고 대립 가설을 채택합니다. 이는 성별과 좋아하는 색상 사이에 통계적으로 유의미한 연관이 있다는 것을 의미합니다. 이 예시는 카이제곱 검정의 기본적인 사용 방법을 보여줍니다. 실제로는 통계 소프트웨어를 사용하여 이러한 계산을 수행하고 더 정확한 p-value와 결론을 도출합니다.

카이제곱 분석(Chi-Square Analysis)이란?

카이제곱 분석은 범주형 데이터의 분포를 이해하고, 기대 빈도와 실제 관측 빈도 간의 차이를 평가하기 위해 사용되는 통계적 방법입니다. 주로 두 가지 주요 유형으로 나뉘며, 각각의 목적과 사용 방법이 다릅니다.

카이제곱 검정의 종류

  1. 적합도 검정(Goodness of Fit Test):
  • 목적: 하나의 범주형 변수가 특정 분포(예: 균등 분포, 정규 분포 등)를 따르는지를 평가합니다.
  • 예시: 주사위를 던졌을 때 각 면이 나오는 빈도가 이론적으로 동일한지를 확인.
  1. 독립성 검정(Test of Independence):
  • 목적: 두 개 이상의 범주형 변수 간에 독립적인 관계가 있는지를 평가합니다.
  • 예시: 성별과 투표 성향 간에 관련성이 있는지를 분석.

카이제곱 검정의 절차

  1. 가설 설정:
  • 귀무가설(H₀): 두 변수 간에 독립성이 존재하거나, 데이터가 특정 분포를 따른다.
  • 대립가설(H₁): 두 변수 간에 독립성이 존재하지 않거나, 데이터가 특정 분포를 따르지 않는다.
  1. 기대 빈도 계산:
  • 실제 데이터가 귀무가설을 따를 경우 예상되는 빈도를 계산합니다.
  1. 카이제곱 통계량 계산:
χ2=(OiEi)2Ei\chi^2 = \sum \frac{(O_i - E_i)^2}{E_i}

여기서 OiO_i는 관측 빈도, EiE_i는 기대 빈도입니다. 4. 자유도 결정:

  • 적합도 검정: 자유도 = 범주의 수 - 1
  • 독립성 검정: 자유도 = (행의 수 - 1) × (열의 수 - 1)
  1. 유의 수준과 비교:
  • 계산된 카이제곱 통계량을 카이제곱 분포표와 비교하여 귀무가설을 기각할지 여부를 결정합니다.

카이제곱 검정의 가정

  1. 독립성: 각 관측치는 서로 독립적이어야 합니다.
  2. 표본 크기: 기대 빈도가 충분히 커야 합니다. 일반적으로 각 셀의 기대 빈도가 5 이상일 것을 권장합니다.
  3. 범주형 데이터: 데이터는 명확히 범주화되어 있어야 합니다.

카이제곱 검정의 활용 사례

  • 의료 연구: 특정 질병의 발생과 요인(흡연, 음주 등) 간의 관련성 분석.
  • 마케팅: 고객의 구매 패턴과 인구통계학적 변수 간의 관계 평가.
  • 사회과학: 교육 수준과 직업 유형 간의 독립성 검정.

카이제곱 검정의 한계

  1. 연속 데이터에 부적합: 카이제곱 검정은 범주형 데이터에만 적용 가능하며, 연속형 데이터를 직접 분석할 수 없습니다.
  2. 기대 빈도의 제약: 기대 빈도가 너무 낮으면 검정의 신뢰성이 떨어질 수 있습니다.
  3. 인과 관계 파악의 한계: 카이제곱 검정은 변수 간의 관련성을 평가할 뿐, 인과 관계를 증명할 수 없습니다.

카이제곱 검정의 예시

예시 1: 적합도 검정

  • 문제: 공장에서 생산된 불량품이 A, B, C 세 종류로 분류됩니다. 이론적으로 각 종류의 불량품 비율이 동일하다고 가정할 때, 실제 관측된 불량품 비율이 이론과 일치하는지를 검정합니다.

  • 관측 데이터: A: 30개, B: 45개, C: 25개

  • 기대 데이터: 각 종류당 33.3개 (총 100개 기준)

  • 카이제곱 계산 및 검정 수행 예시 2: 독립성 검정

  • 문제: 성별(남성, 여성)과 제품 선호도(제품 X, Y, Z) 간에 관련성이 있는지를 분석합니다.

  • 관측 데이터: | | 제품 X | 제품 Y | 제품 Z | 총계 | |---|---|---|---|---| | 남성 | 20 | 30 | 50 | 100 | | 여성 | 30 | 50 | 20 | 100 | | 총계 | 50 | 80 | 70 | 200 |

  • 기대 빈도 계산: 각 셀의 기대 빈도는 (행 총계 × 열 총계) / 전체 총계

  • 카이제곱 계산 및 검정 수행

결론

카이제곱 분석은 범주형 데이터의 분포와 변수 간의 관계를 이해하는 데 유용한 통계적 도구입니다. 그러나 적절한 가정 하에서 사용되어야 하며, 데이터의 특성과 분석 목적에 따라 다른 통계적 방법과 함께 활용되는 것이 바람직합니다. 카이제곱 검정을 통해 데이터의 패턴을 파악하고, 이를 바탕으로 더 심층적인 분석이나 의사결정을 내릴 수 있습니다.