분류 성능지표 — 혼동행렬 4칸으로 재현율·정밀도·F1 읽기
분류 성능지표는 혼동행렬의 네 칸(TP·FP·FN·TN)에서 출발합니다. 정확도가 클래스 불균형에서 왜 속이는지, 재현율과 정밀도의 차이, F1과 G-mean 종합지표, 임계값 조정까지 정리했습니다.

분류 성능지표는 혼동행렬의 네 칸(TP·FP·FN·TN)에서 출발합니다. 정확도가 클래스 불균형에서 왜 속이는지, 재현율과 정밀도의 차이, F1과 G-mean 종합지표, 임계값 조정까지 정리했습니다.

로지스틱 회귀는 어느 쪽인지(분류)를 확률로 예측하는 방법입니다. 직선으로는 왜 확률을 못 맞히는지, 오즈와 로짓으로 범위를 맞춰 S자 곡선을 만드는 과정, 계수를 최대우도법으로 구하는 이유까지 정리했습니다.

계수 축소법(Ridge·Lasso)은 회귀식에 벌점을 더해 불필요한 변수를 자동으로 걸러내고 과적합을 막는 방법입니다. Ridge와 Lasso의 차이, 예측이냐 변수 선택이냐에 따른 선택 기준, λ 튜닝까지 정리했습니다.

다중선형회귀는 입력 변수 여러 개로 결과를 예측하는 회귀입니다. 변수가 늘면 직선이 초평면이 되는 이유, 각 계수가 다른 변수를 고정한 채의 효과라는 점, 푸는 방법이 OLS인 이유, 변수를 무작정 늘릴 때 생기는 과적합까지 정리했습니다.

회귀 성능지표는 만든 회귀식이 얼마나 잘 맞히는지 재는 잣대입니다. 단위가 살아있는 MAE, 비율로 보는 MAPE, 이론이 쓰는 MSE와 RMSE, 평균 대비 얼마나 나은지 보는 결정계수 R²까지 정리했습니다.

단순선형회귀는 두 변수의 관계를 하나의 직선으로 요약해 예측하고 변수의 영향력까지 읽어내는 방법입니다. 오차와 잔차의 차이, 잔차제곱합을 최소로 만드는 최소제곱법, 기울기 해석까지 핵심만 정리했습니다.

머신러닝은 데이터 속에 숨은 패턴을 찾아 수식으로 표현하고, 그 식으로 새 값을 예측하는 방법입니다. 공학 공식과 방향이 반대인 이유, 입력·출력 변수의 여러 이름, 출력의 형태가 회귀와 분류를 가르는 원리까지 정리했습니다.

상관분석은 두 변수가 같은 방향으로 움직이는지 방향과 세기를 읽는 방법입니다. 공분산이 왜 단위에 휘둘리는지, 그 단위를 지운 상관계수가 어떻게 -1에서 1 사이 값이 되는지, 왜 산점도를 반드시 함께 봐야 하는지 정리했습니다.

등분산 검정은 여러 집단의 흩어짐이 같은지 확인하는 절차로, ANOVA의 전제를 지키는 문지기다. 정규분포면 Bartlett, 아니면 Levene — 두 검정의 선택 기준과 결과 해석, 전제가 깨졌을 때의 대응까지 정리했다.

분산 검정은 평균이 아니라 흩어짐(산포)이 변했는지 확인하는 가설검정이다. 단일 집단은 카이제곱, 두 집단은 F검정 — 표본분산도 흔들리는 값이라는 직관부터 계측기 산포 비교 예시까지 2가지 절차로 정리했다.