상관계수 계산기

피어슨 r
다음

Pearson 상관계수(r)는 두 변수 간의 선형 관계, 둘이 얼마나 함께 움직이는지를 정량화합니다. 이 계산기는 쌍을 이룬 X/Y 값을 받아 r과 r제곱(설명되는 분산의 비율)을 계산하고, 사용된 쌍의 개수도 함께 보여줍니다.

상관계수 계산 방법

  1. 1

    쌍 데이터 붙여넣기

    행마다 X 값 하나와 Y 값 하나, 쉼표 또는 탭 구분. 또는 스프레드시트에서 붙여넣기.

  2. 2

    계산 실행

    계산기가 값을 쌍으로 묶고 평균, 편차, Pearson 공식을 계산합니다.

  3. 3

    r과 r² 확인

    r은 -1에서 +1 사이입니다. r²은 그 제곱으로, 공유 분산의 백분율로 해석됩니다.

  4. 4

    표본 크기 확인

    결과와 함께 표시되는 쌍의 개수(n)를 확인하세요. 표본이 작으면 r의 신뢰도가 낮아지므로 r과 함께 n을 보고해야 합니다.

공식

r = Σ((xᵢ - x̄)(yᵢ - ȳ)) / √(Σ(xᵢ - x̄)² × Σ(yᵢ - ȳ)²)

동등하게: r = cov(X, Y) / (σ_X × σ_Y). 이는 표준편차의 곱으로 정규화한 공분산으로, 결과를 [-1, +1]로 강제합니다.

r 해석

r 값 선형 관계
±0.9 ~ ±1.0 매우 강함
±0.7 ~ ±0.9 강함
±0.5 ~ ±0.7 보통
±0.3 ~ ±0.5 약함
±0.0 ~ ±0.3 매우 약함 또는 없음

**r²(결정계수)**는 X의 선형 모델로 설명되는 Y 분산의 비율입니다. r = 0.7이면 r² = 0.49, 분산의 약 절반이 선형이고 절반은 아닙니다.

Pearson이 부적절한 도구일 때

Pearson은 선형 관계와 대략 정규 분포 데이터, 큰 이상치가 없음을 가정합니다. 다음에서는 크게 실패합니다:

  • 곡선 관계: 구간 [-5, 5]에서 y = x²은 완벽히 예측 가능함에도 r = 0입니다.
  • 이상치: 5 표준편차 떨어진 점 하나가 r을 두 배로 만들거나 절반으로 줄일 수 있습니다.
  • 순위 데이터: 대신 Spearman ρ(순위의 상관)을 사용하세요.
  • 이진 또는 범주형: 유형에 따라 point-biserial, phi 또는 Cramer V를 사용하세요.

상관은 인과가 아니다: 고전

두 변수가 강하게 상관될 수 있는 이유:

  1. X가 Y를 일으킨다.
  2. Y가 X를 일으킨다.
  3. 제3의 변수 Z가 둘 다 일으킨다(교란).
  4. 순수한 우연(작은 표본에서).
  5. 데이터 수집 방식의 선택 편향.

아이스크림 판매량과 익사 사망은 여름철에 +0.8로 상관됩니다. 아이스크림이 익사를 일으키는 것이 아니라, 더운 날씨가 둘 다 일으킵니다.

표본 크기와 유의성

작은 표본의 r은 오해를 일으킬 수 있습니다. n = 5에서 r = 0.5는 통계적으로 0과 구별되지 않습니다(p ≈ 0.4). n = 100에서 r = 0.2는 명백히 0이 아닙니다(p < 0.05). 항상 r과 함께 표본 크기를 보고하세요. r의 p값은 참 상관이 0이라는 귀무가설을 검정합니다.

자주 묻는 질문

보통 수준의 양의 선형 관계입니다. r² = 0.25이므로 Y 분산의 약 25%가 X로 선형 설명되고 75%는 설명되지 않습니다. 실재하는 효과이지만 결정론적인 것과는 거리가 멉니다.

구조상 아니요. 출력이 [-1, 1] 밖에 있다면 계산에 버그가 있는 것으로, 보통 잘못 쌍지은 데이터이거나 표준편차로 정규화하지 않고 공분산을 계산한 경우입니다.

큰 이상치가 없는 연속 데이터의 선형 관계에는 Pearson. 단조롭지만 비선형인 관계이거나 이상치가 Pearson을 끌고 다닐 때는 Spearman(순위의 상관).

아니요. 가진 표본에 대한 기술일 뿐 예측이 아닙니다. 교차 검증, 별도 보류 테스트 세트, 또는 r의 신뢰구간이 안정성을 확인하는 정직한 방법입니다.

관련 도구