선형 회귀 계산기

최적 적합 직선
결과

선형 회귀는 데이터에서 발생하는 수직 오차의 제곱 합을 최소화하는 단일 직선 y = mx + b를 적합시키는 방법입니다. 한 변수가 다른 변수에 영향을 미친다고 의심할 때 가장 먼저 사용하는 도구입니다(예: 광고 지출 대 등록 건수, 기온 대 아이스크림 판매량, 키 대 신발 사이즈 등). (x, y) 점 쌍을 입력하면 계산기가 기울기, 절편, R제곱값 및 피어슨 상관계수를 반환합니다.

회귀선을 어떻게 그려야 할까

  1. 1

    데이터를 붙여넣으세요

    각 행에는 한 쌍의 값이 포함되며, x와 y는 쉼표, 탭 또는 공백으로 구분됩니다. 헤더는 무시됩니다.

  2. 2

    기울기와 절편 읽기

    기울기 m = x가 1단위 변할 때 y가 변화하는 양. 절편 b = x = 0일 때의 y 값.

  3. 3

    R²를 확인하세요

    R² ∈ [0, 1], 변수 x가 변수 y의 분산 중 얼마나 설명하는지를 나타내는 값입니다. 사회 데이터에서는 일반적으로 R² 값이 0.7 이상일 때 설명력이 높다고 간주됩니다.

  4. 4

    새로운 값을 예측하세요

    어떤 x 값을 y = m·x + b에 대입하면 모델의 예측 결과를 얻을 수 있습니다.

적합을 위한 공식들

N개의 데이터 포인트(x_i, y_i)가 주어졌을 때, 일반 최소제곱법으로 계산된 기울기와 절편은 다음과 같습니다:

m = Σ((x_i − x̄)(y_i − ȳ)) / Σ((x_i − x̄)²)
b = ȳ − m · x̄

R²(결정계수)는 변수 x가 변수 y의 분산 중 얼마나 잘 설명하는지를 나타내는 지표입니다.

R² = 1 − SS_res / SS_tot

여기서 SS_res는 잔차의 제곱합이며, SS_tot는 y값이 그 평균값에서 벗어난 편차의 제곱합이다. 피어슨 상관계수 r은 ±√R²로, 기울기의 부호를 따르며 나타난다.

실행 예시

다섯 개의 데이터 포인트:

x y
1 2
2 4
3 5
4 4
5 6

x = 3, y = 4.2. 공분산의 분모는 (1–3)(2–4.2) + (2–3)(4–4.2) + (3–3)(5–4.2) + (4–3)(4–4.2) + (5–3)(6–4.2) = 4.4 + 0.2 + 0 − 0.2 + 3.6 = 8.0입니다. x의 분산의 분모는 4 + 1 + 0 + 1 + 4 = 10입니다.

  • 기울기 m = 8.0 / 10 = 0.8
  • 절편 b = 4.2 − 0.8 × 3 = 1.8
  • 방정식: y = 0.8x + 1.8
  • R² ≈ 0.727

수치가 알려주는 것(그리고 알려지지 않는 것)

  • 기울기 m은 “x의 1단위당 y가 얼마나 변하는가”를 나타냅니다. 단위는 y/x입니다.
  • 절편 b는 “x가 0일 때 y의 값은 무엇인가”에 대한 답을 제공합니다. 이 값이 의미 있는 것은 오직 데이터에서 x = 0이 타당하게 설명될 수 있을 때에만 해당됩니다.
  • 는 인과관계가 아니라 적합도를 측정합니다. 잡음이 없는 대리 데이터에서 R² 값이 높더라도 그 의미는 여전히 없을 수 있습니다.
  • 피어슨 상관계수 r은 선형적인 연관성을 나타냅니다. r 값이 0에 가까우면서도 강한 곡선 형태의 관계를 보일 경우에도 이는 “선형적 적합이 없다”는 의미이며, “관계가 없다”는 의미는 아닙니다.

함정들

  • 아웃라이어는 손실 함수가 제곱 형태이기 때문에 OLS 적합 결과를 심하게 왜곡시킵니다. 단 하나의 이상치만으로도 선이 20도 회전할 수 있습니다.
  • 비선형성은 R²만으로는 검출되지 않으므로 항상 잔차를 x에 대해 그래프로 표시해야 합니다.
  • 회귀 분석은 대칭적이지 않다: y를 x에 대해 적합시킨 결과와 x를 y에 대해 적합시킨 결과는 서로 다른 회귀선을 나타낸다.
  • 데이터 범위를 초과하는 외삽법은 추측에 불과합니다. 적합 모델은 오직 관측된 범위만을 인식할 수 있습니다.

자주 묻는 질문

y의 변동성 중 40%는 x와의 선형 관계에 의해 설명될 수 있습니다. 나머지 60%는 잡음, 다른 변수 또는 비선형성에서 기인합니다. 물리학 분야에서는 이 정도로는 부족하지만, 사회적 또는 경제적 데이터의 경우 일반적으로 충분히 수용 가능합니다.

선형 모델부터 시작하세요. 잔차 그래프에 뚜렷한 곡선이 나타난다면 이차 함수 또는 로그 변환을 시도해 보세요. 고차 다항식으로 바로 전환하면 과적합이 발생하며 새로운 데이터에 대한 일반화 성능이 저하됩니다.

수학적으로는 2개가 필요하며, 실질적으로는 최소 20개 이상이 필요합니다. 그 이하의 경우 하나의 이상치가 모델 적합도를 지배하게 됩니다. 공개된 연구 결과의 경우, 해당 분야에 맞는 표본 크기 관련 지침을 확인하시기 바랍니다.

아니요. 복사하여 붙여넣은 (x, y) 점 쌍들은 브라우저에 자동으로 적합되며 페이지를 벗어나지 않습니다.

관련 도구

이 도구는 다른 언어로도 제공됩니다