Skip to Content

베이직

[강의자료 PDF]

🌿 본 강의는 제조업을 위한 통계를 이해하기 위한 강의입니다.

목차

💡

  1. 데이터 분석의 흐름
  2. 이번 세션의 학습 목표
  3. 실무 예시 문제들
  4. 왜 통계를 공부해야 할까? (QC 공정도와 통계의 관계)
  5. 데이터의 종류
  6. 변수 개수에 따른 통계분석
  7. 편차, 분산, 표준편차
  8. 모집단, 표본, 표본분포
  9. 정규분포와 신뢰구간
  10. 금일 수업 요약(학습 흐름 마무리)

📕

  1. 데이터 분석의 흐름

다시한번 데이터 분석의 흐름을 정리해 봅시다.

  • 가설 증명(검증) 방법
    • 시각적 방법 (이전 주차)
    • **통계적 방법 ** (현재 주차)
    • 머신러닝·딥러닝 방법

아래와 같은 문제를 해결하고 싶을 때, 어떤 방법을 사용할 수 있을까요?

💡

  1. 한 도시 주민 중 전기차를 사용하는 비율은 얼마나 될까?
  2. 학생의 학업 성취도와 수면 시간이 관계가 있나?
  3. 광고비와 매출은 얼마나 연관되어 있을까?
  4. 새로운 커피 맛이 좋으면 소비자도 좋아할까?
  5. 다이어트 프로그램이 남성과 여성에게 동일한 효과를 줄까?
  6. 제품의 판매량이 시간에 흐름에 따른 추세가 있을까?

본 강의에서는 통계적인 방법에 국한해서 데이터를 분석해보고자 합니다. 프로젝트에서 “문제정의 → 가설설정 → 시각화”가 어떻게 연결될지 막막하셨다면, 이번 세션에서 기초 통계를 시작으로 차근차근 정리해볼 수 있습니다!


📕

  1. 이번 세션의 학습 목표

제조/생산 분야의 데이터 분석에서 필요한 전반적인 통계 지식/기법을 학습하고, 머신 러닝까지 활용하여 폭넓은 분석을 위한 발판을 다집니다.

  1. 제조업을 위한 기초 통계
  • 중심극한정리, 신뢰구간, 가설검정 등 통계이론
  • 기초 통계분석, 상관·회귀·분류·군집분석 등의 개념
  1. Python 라이브러리를 활용한 실습
  • 평균, 분산, 표준편차 등의 개념을 이해하고 실제 Python 코드로 계산해보기
  • 간단한 시각화를 통해 “제품 중량이 목표치에 근접한가?”, “불량률 변동이 큰가?” 등을 확인
  1. 심화 프로젝트로 실무형 품질분석 경험 (2일차 이후)
  • 실제 공정 불량 데이터, 고객 클레임 데이터 등을 활용해 통계분석을 진행
  • 분석 결과를 해석하고, 품질개선에 직접 연결해보는 경험

📕

  1. 통계가 필요한 상황?

어떤 상황에서 통계 분석이 필요할까요?

통계가 필요한 현상과 문제 정의 예시를 살펴 봅시다!

**생산/제조 분야의 현상은? **

💡

  1. 한 공장에서 생산된 두 가지 제품의 결함률 차이가 있을까?
  2. 두 제조 공정의 품질 안정성이 비슷할까?
  3. 새로운 기계 부품의 평균 수명은 어떠할까?
  4. 제품 생산 시 사용하는 원재료의 공급처에 따른 품질 차이가 있는가?
  5. 공장 운영 시간대별 생산 효율성에 차이가 있는가?
  6. 기존 제품과 리뉴얼된 제품의 소비자 만족도에 차이가 있는가?
  7. 공장 내 근무자의 근무 연차에 따른 생산성 차이가 있는가?
  • 생산/제조 분야에서는 아래와 같은 뚜렷한 문제정의와 통계를 활용한 문제 해결이 가능합니다.

💡

  • 두 집단의 비율(결함률) 비교: 이항자료 2표본 비율 검정, 카이제곱 검정
  • 두 집단(공정)의 분산 비교: F-test, Levene’s test
  • 평균이 특정 값과 다른지(한 집단): 일표본 t-검정
  • 3개 이상 집단의 평균 비교: 일원분산분석(One-way ANOVA)
  • 두 집단의 평균 비교(연속형, 독립 표본): 독립표본 t-검정
  • 근무 연차(연속 변수) vs 생산성: 상관분석, 회귀분석
  • 이 과정을 마치과 최종적으로 우리가 해야할 분석을 맛보면, (지금 이해할 수 없습니다! 흐름만 이해)

💡 1.** 한 공장에서 다른 라인에서 생산된 두 가지 제품 차이가 있을까?**


  • 핵심 질문: 두 제품 간 불량(결함) 비율이 동일한가, 혹은 다른가?
  • 데이터 형태: 불량(1) / 정상(0)과 같은 범주형(이항) 데이터
  • 분석 기법:
    • 이항자료 2표본 비율 검정(two-proportion z-test)
      • 예: 제품 A(불량 개수/전체 개수), 제품 B(불량 개수/전체 개수)를 각각 측정 후 두 비율이 다른지 검정
    • 카이제곱 검정(Chi-square test)
      • 두 제품에 대한 결함 여부를 교차표( contingency table ) 형식으로 구성하여 검정
  • 주의 사항: 표본 크기가 너무 작을 경우에는 정확 검정(Fisher’s Exact Test)을 고려

💡

  1. 두 제조 공정의 품질 안정성(분산)이 비슷할까?

  • 핵심 질문: 두 공정에서의 품질 지표(예: 길이, 무게 등)의 분산이 동일한가, 혹은 다른가?
  • 데이터 형태: 각 공정에서 측정된 연속형 품질 지표
  • 분석 기법:
    • F-검정(F-test) 또는 등분산 검정(Levene’s test, Bartlett’s test 등)
      • F-검정은 정규성 가정이 필요하며 민감도가 높음
      • Levene’s test는 정규성에 덜 민감하지만 일반적으로 많이 사용
  • 주의 사항:
    • 정규성 여부를 사전에 확인(Shapiro-Wilk 검정 등)
    • 만약 분산이 다르다고 결론 나면, 추후 평균 비교 시 ‘이분산 가정(two-sample t-test assuming unequal variances)’을 사용

💡

  1. 새로운 기계 부품의 평균 수명은 어떠할까?

  • 핵심 질문: 새로운 부품의 평균 수명이 특정 기준(예: 5년, 10,000시간 등)과 다른가?
  • 데이터 형태: 기계 부품 1개당 수명(연속형)
  • 분석 기법:
    • 일표본 t-검정(one-sample t-test)
      • 부품 여러 개를 무작위로 추출하여 측정한 평균이 기준 값과 유의하게 다른지 검정
    • 신뢰구간(Confidence Interval) 산출
      • 검정뿐 아니라, 실제 평균 수명이 어느 범위에 있는지 파악 가능
  • 주의 사항:
    • 표본의 정규성 가정 확인 후 필요 시 비모수 검정(Wilcoxon Signed-Rank Test) 고려
    • 표본 크기가 충분히 큰 경우 중심극한정리에 의해 t-검정 사용 가능

💡

  1. 제품 생산 시 사용하는 원재료의 공급처에 따른 품질 차이가 있는가?

  • 핵심 질문: 원재료 공급처가 여러 곳(예: A, B, C)일 때, 최종 제품 품질(연속형)이 동일한가 다른가?
  • 데이터 형태: 공급처별로 측정된 연속형 품질 지표
  • 분석 기법:
    • 일원분산분석(One-way ANOVA)
      • 세 그룹(A, B, C) 이상의 평균 비교 시 사용
      • 유의미한 차이가 있다면 사후검정(Post-hoc test)으로 어떤 그룹 간 차이가 있는지 확인
    • 2개 공급처만 비교할 경우: 두 집단 t-검정(two-sample t-test)
  • 주의 사항:
    • 정규성 및 등분산성 가정에 유의(Shapiro-Wilk, Levene’s test)
    • 가정 충족이 어렵다면 비모수 검정(Kruskal-Wallis test) 고려

💡

  1. 공장 운영 시간대별 생산 효율성에 차이가 있는가?

  • 핵심 질문: 조·중·야간 등 시간대에 따라 평균 생산량(또는 효율)이 다른가?
  • 데이터 형태: 시간대별 생산량 혹은 생산성 점수(연속형)
  • 분석 기법:
    • 일원분산분석(One-way ANOVA)
      • 시간대가 3개 이상이라면 각 그룹 간 평균 비교
      • 사후검정으로 어느 시간대끼리 차이가 있는지 추가 확인
  • 주의 사항:
    • 교대근무 시간대별 표본 크기가 균일한지 확인
    • 정규성, 등분산성 가정 확인 후 필요 시 비모수 검정(Kruskal-Wallis test) 사용 가능

💡

  1. 기존 제품과 리뉴얼된 제품의 소비자 만족도에 차이가 있는가?

  • 핵심 질문: ‘기존 제품 만족도’와 ‘리뉴얼된 제품 만족도’의 평균이 같은가 다른가?
  • 데이터 형태: 만족도 점수(연속형) - 두 집단
  • 분석 기법:
    • 독립표본 t-검정(two-sample t-test)
      • 두 그룹(기존 vs 리뉴얼)의 만족도 평균 비교
      • 등분산 가정이 어긋나면 Welch’s t-test(이분산 가정 t-검정) 사용
  • 주의 사항:
    • 두 만족도 측정 표본이 독립적이어야 함(같은 사람을 두 번 측정했다면 대응표본 t-검정)
    • 정규성 가정이 맞지 않을 경우 비모수 검정(Mann-Whitney U test) 고려

💡

  1. 공장 내 근무자의 근무 연차에 따른 생산성 차이가 있는가?

  • 핵심 질문: 근무 연차가 증가함에 따라 생산성이 달라지는가?
  • 데이터 형태
    1. 연차를 그룹화(예: 13년차, 46년차, 7년 이상 등)한 범주형 변수 vs 생산성(연속형)
    2. 연차를 연속형으로 보고 생산성과의 상관 및 회귀모델로 분석
  • 분석 기법
    • (1) 연차를 구간화한 후 그룹별 비교: 일원분산분석(One-way ANOVA)
      • 3개 이상의 그룹 간 평균 생산성 비교
      • 사후검정(Post-hoc)으로 어떤 그룹 간 차이가 있는지 확인
    • (2) 연차를 연속 변수로 모델링: 단순회귀분석(Simple Linear Regression) 또는 상관분석(Correlation)
      • 근무 연수(x)와 생산성(y) 간 선형 관계 파악
  • 주의 사항:
    • 연차 분류 방법(임의 구간 vs 목적에 맞는 구간 설정)에 따라 결과 해석이 달라질 수 있음
    • 회귀 분석 시 선형성, 등분산성, 이상치 여부 등을 점검

핵심 요약

  • 두 집단의 비율(결함률) 비교: 이항자료 2표본 비율 검정, 카이제곱 검정
  • 두 집단(공정)의 분산 비교: F-test, Levene’s test
  • 평균이 특정 값과 다른지(한 집단): 일표본 t-검정
  • 3개 이상 집단의 평균 비교: 일원분산분석(One-way ANOVA)
  • 두 집단의 평균 비교(연속형, 독립 표본): 독립표본 t-검정
  • 근무 연차(연속 변수) vs 생산성: 상관분석, 회귀분석 각 가설에 맞춰 적절한 통계분석 기법을 선택하고, 해당 기법이 갖는 가정(정규성, 등분산성 등)을 만족하는지 사전에 확인한 뒤 진행하는 것이 중요합니다. 필요할 경우, 비모수 검정( Mann-Whitney U, Kruskal-Wallis 등 ) 또는 가정에 덜 민감한 방법( Levene’s test 등 )을 대안으로 사용할 수 있습니다

📕 4. 왜 통계를 공부해야 할까? (QC 공정도와 통계의 관계)


QC 공정도에서 통계를 찾아보자!

QC 공정도는 “어떤 공정(성형, 양생 등)에서 언제, 무엇을, 어떻게 검사할 것인가?”를 기록한 문서입니다. 그런데 실제 현장에선 다음과 같은 질문이 생깁니다.

  • 샘플링할 때 표본 크기, 추출 간격은 어떻게 정하나? (AQL, MIL-STD-105, ISO2859 기준 등)
  • 치수·강도 등의 규격 한계를 만족하는지 어떻게 판정하나? (정규분포 가정으로 확률 계산)
  • 공정 자체가 안정적으로 움직이는지 확인하려면 어떻게 하나? (관리도, 공정능력 지표 등)

즉, 이러한 의사결정은 통계학적 사고지식을 기반으로 수행해야 합니다.

  • 샘플링 계획, 통계적 판정 기준(규격 한계, 관리한계), 공정능력(Cp, Cpk) 분석 등이 필수

결과적으로 품질관리에는 “생산 공정에서 발생하는 변동을 체계적으로 분석·해석”하는 역량, 즉 통계학적 기반이 요구됩니다.


📕

  1. 데이터의 종류

다양한 형태의 데이터를 살펴봅시다.

데이터분석에서 데이터를 정확히 분류하는 것은 매우 중요합니다.

  • 예) 제품 불량 발생 횟수(이산형), 생산 라인별 불량률(연속형), 불량 원인 범주(범주형)
  • 데이터 유형별로 적절한 통계 기법, 시각화 방법이 달라집니다.

아래는 품질분석에서 자주 접하는 데이터 유형입니다.

데이터 종류개념예시
수치형숫자로 표현 가능한 모든 데이터(연속형+이산형)제품 무게, 공정 속도, 생산량 등
연속형특정 구간 안에서 소수점 포함해 어떤 값이든 가능제품 무게(kg), 길이(mm), 온도(℃)
이산형정수 값만 의미 (소수점 X)하루 불량 발생 건수, 완제품 개수
범주형특정 범주 안에서만 데이터 존재(이름·값)불량 원인 분류, A/B/C 등급 등
이진형범주형 중 두 가지 값 (0/1, 예/아니오 등)만 존재합격/불합격, 정상/이상, 예/아니오
순서형범주형이지만 값들 사이에 분명한 순위가 있음1등/2등/3등, 우수/보통/미흡 등

예를 들어, **제품 무게(연속형)**라면 평균·표준편차로 관리하는 것이 일반적 **하루 불량 발생 건수(이산형)**의 경우, 포아송 분포 등을 고려할 수 있습니다.

  • 수치형 데이터 예시
    • 시간대별 온도, 압력, 불량 건수 등
    • 기본 통계값(평균, 분산 등) 확인, 관리도(X-R, X-s 등)를 작성
  • 범주형 데이터 예시
    • 불량 유형(“설비오류”, “작업자 미숙” 등)을 분류하고, 어떤 범주가 가장 큰 비중인지 파악
    • 파레토 차트(Pareto)로 80:20 법칙 확인

데이터 종류를 왜 분류해야 할까?

  • 데이터의 생김새에 따라 (수치형, 범주형 등) 시각화·해석·적용 통계모델이 달라짐
  • Python 등에서 라이브러리 함수를 적용할 때, 데이터 유형에 따른 함수를 구분해 써야 함

📕

  1. 변수 개수에 따른 통계 분석

변수의 개수에 따라 사용하는 통계 분석의 기법이 달라집니다.

1. 일변량 분석 (변수 1개)

  • 기술 통계분석: 평균, 중앙값, 표준편차 등
  • 히스토그램: 제품 치수, 경도 등을 히스토그램으로 시각화 (분포 확인)
  1. 이변량 분석 (변수 2개)
  • 상관분석: 품질 특성 2개(온도와 강도 등)의 상관관계
  • 독립표본 t-검정: 두 그룹 간 평균 비교(예: 생산라인 간 제품 품질 차이)
  • 카이제곱 검정: 범주형 변수 간 독립성 검정(원자재 공급업체 vs. 불량 유형 등)
  1. 다변량 분석 (변수 3개 이상)
  • 군집분석: 불량 유형·특성 기반으로 그룹화
  • 회귀분석: 품질 지표와 공정 변수를 연결
  • 요인분석: 데이터 차원 축소, 주요 영향 요인 도출

📕

  1. 편차(Deviation), 분산(Variance), 표준편차(Standard Deviation)

통계 분석을 위해 꼭 필요한 개념을 알아봅니다.

제조분석에서 중요한 것 중 하나가 “공정·제품이 얼마나 안정적으로 움직이는가”를 보는 일입니다. 이를 위해선 ‘대표값(평균 등) 이 어디쯤인가’ 뿐만 아니라, ‘데이터가 얼마나 퍼져있는가(산포도)’가 중요합니다.

  1. 대표값 vs. 산포도
  • 대표값: 평균, 중앙값, 최빈값 → 데이터가 “어디쯤(WHERE)”에 있는가
  • 산포도 지표(분산, 표준편차): 데이터가 “어떻게(HOW) 퍼져 있는가”

  1. 편차(Deviation)
  • 정의: 편차 = (각 측정값) - (평균)
  • 예) 어떤 제품 무게가 30g이고 평균이 60g이면 편차는 -30g
  • 편차를 단순히 합하면 0이 되어, 전체 흩어진 정도를 파악하기 어려움

  1. 분산(Variance)
  • 정의: 편차를 제곱해서 합산한 뒤, 데이터 개수로 나눈 값 분산=∑(편차2)데이터 개수 분산=(편차2)데이터 개수\text{분산} = \frac{\sum(\text{편차}^2)}{\text{데이터 개수}}
  • 예) 편차²들을 합산해 1400, 데이터 3개 → 분산 = 466.7
  • 단위가 제곱(예: g²)이므로 해석이 직관적이지 않을 수 있음

  1. 표준편차(Standard Deviation)
  • 정의: 분산의 제곱근 표준편차=분산 표준편차=분산\text{표준편차} = \sqrt{\text{분산}}
  • 단위가 원래 단위(예: g)로 복원 → 변동을 직관적으로 해석 가능
  • 예) 분산 466.7 → 표준편차 약 21.6 → 평균 60g±21.6g 정도 분포

실제 공정에서는?

  • 공정에서 표준편차가 작으면 안정, 크면 변동이 심한 것으로 판단
  • 표준편차가 커지면 생산 편차가 늘어, 불량률이 증가할 가능성이 커짐
  • 따라서 공정 개선(설비 보완, 원자재 교체 등)의 근거로 활용

📕

  1. 모집단, 표본, 표본 분포

통계 분석을 위해 꼭 필요한 개념을 알아봅니다.

  1. 표본을 왜 추출할까요?
  • 하루 10만 개 생산 제품을 100% 검사하기는 비용·시간 면에서 비효율적
  • 대표성 있는 일부(표본)를 뽑아 조사 → 전체(모집단) 특성을 유추

  1. 기초 개념을 짚어봅시다!
  • 모집단(Population): 품질관리 대상 전체 제품/데이터
  • 표본(Sample): 그중 일부를 추출한 부분집합
  • 표본분포(Sampling Distribution): 같은 크기로 여러 번 표본을 뽑아서 얻는 통계치(평균, 분산 등)의 분포
  • 표준오차(Standard Error): 표본평균이 얼마나 들쑥날쑥하는지, 모평균과 얼마나 차이가 날 수 있는지를 나타내는 값

  1. 중심극한정리 (Central Limit Theorem)
  • 표본 크기가 충분히 크면, 여러 표본의 평균 분포가 정규분포에 가까워짐
  • 실제 모집단이 약간 다른 형태여도 표본평균 분포는 종 모양
  • 예) 하루 10만 개 중 100개씩 여러 번 뽑아 평균을 구하면 그 평균들의 분포가 정규분포를 이룸
  • 품질 통계에서도 치수, 무게, 용량 등 다양한 측정값을 분석할 때, 정규분포 가정이 자주 활용

  1. 표준오차(Standard Error)
  • **모평균(전체 평균)**과 표본평균 사이의 오차 정도를 정량화
  • 표준오차가 크면 표본평균이 불안정 → 표본 크기 늘리거나 추출 방식을 개선해야 함

핵심 정리

  1. 표본추출은 필수: 전수검사가 어려우니 대표성 있는 표본으로 전체를 추정
  2. 표본분포 활용: 여러 번 추출해본 통계치 분포로 공정 상태 파악
  3. 표준오차: 공정 안정성 판단 지표. 표본평균이 얼마만큼 흔들리는지 파악
  4. 결론: 제대로 된 표본추출과 통계분석을 통해 모수(불량률, 평균 등)를 추정하고, 공정 개선 방향을 잡는다

📕

  1. 정규분포와 신뢰구간

통계 분석을 위해 꼭 필요한 개념을 알아봅니다.

  1. 정규분포(Normal Distribution)
  • 정규분포(Normal Distribution): 평균을 중심으로 좌우 대칭을 이루며, 종 모양으로 나타나는 분포

  • 특징

    1. 평균을 기준으로 좌우가 대칭
    2. 곡선 아래 면적(확률)의 합 = 1
    3. 평균, 분산(표준편차)에 따라 모양이 달라짐
    4. 평균=0, 표준편차=1인 경우를 **“표준정규분포”**라고 함
  • 표준화(standardization)

    • 정규분포를 평균 0, 표준편차 1인 형태로 변환
    • **(원래 데이터 - 평균) / 표준편차 **로 계산 → Z-점수
    • 공정능력지수 계산이나 머신러닝에서 변수 스케일이 큰 경우를 맞춰줄 때 유용

  1. 신뢰구간(Confidence Interval)과 신뢰수준

직관적 이해

  • “평균 생산 시간이 정확히 32분”이라고 말하기 어렵기 때문에, “**30~35분 정도”**라고 범위를 잡는다 → 이 범위가 ‘신뢰구간’
  • 그 범위 내에 실제 평균(모평균)이 포함될 확률이 신뢰수준
    • 예) 95% 신뢰수준 → 100번 중 95번은 실제 평균이 이 구간에 들어감

신뢰구간(Confidence Interval)

  • 표본평균 ± 오차범위로 표현
  • 표준오차와 t-분포(또는 Z-분포) 등을 이용해 계산
  • 품질관리 예: “이 공정의 평균 제작 시간은 30~35분(95% 신뢰)” 통계 예시
    • 어떤 공정에서 생산 시간을 샘플(일부 데이터)로만 측정했을 때, “이 공정의 평균 완성 시간이 30~35분 범위에 있을 것이다(95% 신뢰구간)”라고 추정할 수 있습니다.

신뢰수준(Confidence Level)

  • 95%나 99%가 일반적
  • 신뢰수준이 올라가면 구간이 넓어져 정확성은 높지만 예측 범위가 모호해짐
  • 실무에선 95%를 많이 사용

주의!!

  • 신뢰수준이 높아질수록 신뢰구간이 넓어짐 → “30~40분”처럼 폭이 커져, 예측이 모호해질 수 있음
  • 따라서 신뢰수준이 무조건 높다고 좋은 게 아님. 실무에서는 보통 95%를 많이 사용합니다.

Python 예시 (scipy 사용)

import scipy.stats as st import numpy as np # 예시: 공정별 생산 완료 시간 샘플 sample = [29, 35, 33, 31, 37, 32, 34, 28, 36, 30] df = len(sample) - 1 mu = np.mean(sample) se = st.sem(sample) # 표준오차 # 95% 신뢰구간 ci_95 = st.t.interval(0.95, df, loc=mu, scale=se) print("95% 신뢰구간:", ci_95) # 99% 신뢰구간 ci_99 = st.t.interval(0.99, df, loc=mu, scale=se) print("99% 신뢰구간:", ci_99)
  • 예: 95% 신뢰구간 (30.2, 34.8), 99% 신뢰구간 (28.5, 36.5) 품질 통계 관점에서는?
  1. 공정 평균 추정: 샘플 데이터만으로 모평균(진짜 평균)을 추정
  2. 불량률 추정: “불량률이 2% ~ 5% 사이” 등으로 범위를 제시
  3. 시료 개수 결정: 신뢰구간을 좁히려면, 시료 수를 늘리거나 공정 변동을 줄여야 함

📕

  1. 귀무가설과 대립가설

아직 추론통계를 깊게 들어가기 전이지만, 미리 핵심 개념들을 가볍게 정리해보겠습니다. “귀무가설·대립가설”과 “p-value”는 가설검정에서 가장 기초적이면서도 중요한 요소입니다.

  • 귀무가설(H0)
    • “현재 상황(기존 가정, 차이가 없다 등)이 맞다”는 가정
    • 통계검정에서** ‘특별한 변화나 차이가 없다’**라는 내용을 담는 경우가 많습니다.
    • 예) “두 그룹의 평균은 차이가 없다”, “이 공정의 결함률은 5%이다” 등
  • 대립가설(H1)
    • “귀무가설과는 반대되는 주장”
    • 즉, “새로운 변화나 차이가 존재한다” 또는 “기준값과 다르다”라는 내용을 포함합니다.
    • 예) “두 그룹의 평균은 차이가 있다”, “이 공정의 결함률은 5%가 아니다” 등

쉽게 말해


📕

  1. P-value(유의 확률) 이란?

가설검정을 할 때, 우리가 관측한 데이터(표본)가 ‘귀무가설이 참이라고 가정했을 때도 충분히 일어날 수 있는 일’인지,
아니면 ‘귀무가설이 참이라면 좀처럼 일어나기 어려운 일’인지 따져봅니다.

  • p-value** 정의(직관적 해석)**

“귀무가설이 맞다고 가정했을 때,

  • 예) 어떤 테스트를 했더니 p-value = 0.02(=2%) 라고 나왔다면?
    • “귀무가설이 참일 때, 지금 같은 결과가 나올 확률은 2%밖에 되지 않는다”
    • 즉, 귀무가설 하에서 이렇게 극단적인 데이터가 나올 가능성이 낮다는 뜻
  • p-value가 작다는 의미
    • 귀무가설이 맞다고 봤을 때, 관측된 결과가 나타날 확률이 매우 낮음 → “그럼 귀무가설이 잘못됐을 확률이 높지 않을까?”
    • 보통 통계에서 p-value가 작으면(예: 0.05 미만) 귀무가설을 기각하는 근거로 삼습니다.

📕

  1. 유의수준(α)과 p-value 비교
  • 유의수준(α, Alpha): 연구자가 정하는 기준선(일반적으로 0.05 또는 0.01)
    • “p-value가 α보다 작으면, 귀무가설을 기각한다.”
    • 즉, 5% 이하(또는 1% 이하)의 낮은 확률로만 일어날 사건이 관측되었으니, “이건 우연이라기에는 너무 작다 → 귀무가설에 의심이 크다”로 판단
  • p-value: 실제 데이터에서 계산된 값(통계량)
    • “현재 결과가 나타날 확률”을 의미

결론


📕

  1. 간단 사례 예시
  1. 두 그룹 평균 비교 (독립표본 t-검정)
  • 귀무가설(H0): “두 그룹의 평균은 동일하다(차이가 없다).”
  • 대립가설(H1): “두 그룹의 평균은 다르다(차이가 있다).”
  • 실제 데이터를 통해 t-값(검정 통계량) 계산 → p-value = 0.03이 나옴
  • 유의수준 α=0.05라고 하면, p-value(0.03) < 0.05 → 귀무가설을 기각 → “두 그룹 평균은 통계적으로 유의미한 차이가 있다.”
  1. 공정 결함률 검정
  • 귀무가설(H0): “이 공정의 결함률은 5%이다.”
  • 대립가설(H1): “이 공정의 결함률은 5%가 아니다(더 높거나 낮다).”
  • 표본 데이터(결함 개수)로부터 p-value가 0.10이라고 계산
  • α=0.05로 설정 시, p-value(0.10) > 0.05 → “귀무가설을 기각할 근거가 없다” → 결함률이 5%라는 가정을 통계적으로 뒤집을 수 없다.

📕

  1. 통계분석 흐름 한눈에 살펴보기
  1. 문제정의에서 어떤 분석을 할지 설정
  2. 가설
  • 귀무가설(H0)
  • 대립가설(H1)
  1. 표본 데이터를 통해 검정통계량(t-값, z-값, F-값 등)을 구함
  2. 그 검정통계량을 활용해 p-value를 계산
  3. p-value와 **유의수준(α)**을 비교
  • p-value ≤ α → “귀무가설 기각” (대립가설을 지지)
  • p-value > α → “귀무가설 채택” (데이터로는 차이를 발견하기 어려움)

정리

이 정도 개념을 먼저 이해해두시면, 다음에 t-검정, ANOVA, 카이제곱검정 등 추론 통계를 공부할 때 훨씬 수월해질 것입니다.


📕

  1. 금일 수업 요약(학습 흐름 마무리)
  1. 데이터 분석에서의 분류
  • 데이터는 크게 수치형(연속형/이산형), 범주형(명목형·이진형·순서형)으로 나눌 수 있음
  • 데이터 유형에 따라 통계 기법과 시각화 방법이 달라짐
  1. 대표값(평균, 중앙값, 최빈값)과 산포(분산, 표준편차)
  • 편차 합 = 0 → 제곱으로 변환해 분산 → 분산의 제곱근이 표준편차
  • 표준편차는 공정 안정성의 지표: 작으면 안정, 크면 변동 심함
  1. 모집단과 표본, 표본분포
  • 현실적으로 전수조사 대신 표본 추출
  • 중심극한정리: 표본평균 분포는 정규분포를 따름
  • 표준오차: 표본평균이 모평균과 얼마나 차이가 날 수 있는지
  1. 정규분포와 신뢰구간
  • 정규분포: 공정 데이터를 분석하는 데 매우 자주 사용
  • 신뢰구간(표본평균 ± 오차범위)과 신뢰수준(포함 확률)은 품질 특성을 추정·관리하는 핵심 지표

결국,

통계는 숫자가 품질 현장에서 지니는 의미를 파악하고, 변화나 이상 징후를 발견하는 하나의 도구입니다.


☝🏻 부록: 핵심 키워드 모음

  • 기초 통계(평균, 분산, 표준편차)
  • 데이터 분류(수치형, 범주형)
  • Python 라이브러리(pandas, numpy, matplotlib 등)
  • 중심극한정리(Central Limit Theorem)
  • 표본분포(Sampling Distribution)
  • 정규분포(Normal Distribution)
  • 신뢰구간(Confidence Interval)과 신뢰수준(Confidence Level)
  • 가설검정(Hypothesis Testing)

Tip: 이후 단계에서 공정능력 분석, 가설검정, 회귀분석, ANOVA, 관리도 등의 내용을 더 심층적으로 다루면, 실제 품질개선 프로젝트를 진행할 때 큰 도움이 됩니다.


Copyright ⓒ TeamSparta All rights reserved.