가설을 확인할 것인가, 발견할 것인가
통계 분석과 머신러닝은 둘 다 데이터로 결론을 내지만 출발점이 다르다. 통계 분석은 전문가의 직관과 경험으로 가설을 먼저 세우고 그 가설이 맞는지 데이터로 확인한다. 머신러닝은 반대로 사람이 미처 알아채지 못한 관계를 데이터에서 찾아낸다. 이 차이가 이후 데이터 형태, 함수 형태, 검증 방식까지 대부분을 결정한다.
구분 | 통계 분석 (Human Driven) | 머신러닝 (Data Driven) |
|---|---|---|
접근 방식 | 가설 수립 후 모델 설계 (가설 확인 중심) | 데이터에서 관계를 발견 (가설 발견 중심) |
주요 데이터 | 정형 데이터 중심 | 정형 + 비정형(이미지, 텍스트 등) 데이터 |
함수 형태 | 주로 선형(Linear) 함수 모형 | 비선형(Non-linear) 함수 모형까지 폭넓게 활용 |
모델링 방식도 다르게 검증한다
통계 모델링은 정해진 분포와 가정에 맞는 신뢰도 높은 모델을 우선한다. 그래서 데이터에 모델을 맞추기 전에 곡선의 모양(선형/로그 등)을 먼저 가정하고, 회귀계수 하나하나가 해석 가능한 수준인지를 중요하게 본다. 머신러닝은 규칙을 미리 정하지 않고 학습 데이터에서 패턴을 스스로 찾는 알고리즘을 쓰기 때문에, 기본적인 관계를 사전에 가정할 필요가 없다.
구분 | 통계 모델링 | 머신러닝 |
|---|---|---|
우선순위 | 모델의 복잡성보다 단순성 | 모델의 정확도 |
데이터 분할 | Train : Test = 7 : 3 | Train : Validation : Test ≈ 5 : 2 : 3 (Train으로 학습, Validation으로 하이퍼파라미터 조정) |
진단 방식 | P-value 등 매개변수 통계 진단 수행 | 통계적 진단 테스트 대신 검증 데이터 성능으로 판단 |
통계는 변수들이 서로 독립적이라는 전제를 깔고 출발하는 경우가 많지만, 현실의 변수는 대부분 서로 얽혀 있다. 머신러닝 계열 알고리즘(트리 기반, 앙상블 등)은 이 얽힘 자체를 학습 대상으로 삼는다는 점에서 접근이 다르다.
분류와 회귀: 무엇을 예측하는가
통계와 머신러닝을 가르는 것과 별개로, 예측 문제 자체는 결과값의 성질에 따라 분류(Classification)와 회귀(Regression)로 나뉜다.
구분 | 분류 (Classification) | 회귀 (Regression) |
|---|---|---|
목적 | 독립변수(X)로 답(Y)을 구분하는 경계(Decision Boundary) 찾기 | 독립변수(X)로 답(Y)에 가장 가까운 값을 예측(Best Fit Line) |
결과값 | 이산형(Discrete) — 클래스 라벨 | 연속형(Continuous) — 숫자 |
평가 지표 | 정확도(Accuracy) 등 분류 지표 | 오차 제곱합, R² 등 예측 지표 |
좋은 알고리즘은 데이터 모양이 정한다
“다 해봤더니 이게 제일 좋았어요”가 아니라, “데이터를 보니 이런 모양이어서 이 모델을 썼더니 결과가 좋았습니다”가 되어야 한다.
여러 분류기를 무작정 다 돌려보고 성능 1등을 고르는 방식은 재현성과 설명력이 떨어진다. 데이터의 분포·경계 모양·변수 개수 같은 데이터 성격을 먼저 살피고, 그 성격에 구조가 맞는 알고리즘을 선택한 뒤 성능으로 확인하는 순서가 안전하다.
모델 성능은 대부분 모델링 이전에 정해진다
분석 프로젝트 전체 과정을 단계별 노력(Effort)과 결과 기여도(Importance)로 나눠 보면, 정작 알고리즘을 적용하는 모델링 단계의 비중은 크지 않다.
단계 | 주요 작업 | 노력(Effort) | 기여도(Importance) |
|---|---|---|---|
모델 설계 | Target·Feature 정의, 분석 모집단·방법론 선정 | 15% | 45% |
데이터 준비 | 데이터 추출·정제·변환, 결측·이상치 처리, 변수 변환 | 55% | 10% |
분석 준비 | Sampling, Data Partition(Train/Valid/Test 분할) | 5% | 10% |
변수 탐색 | 파생변수 생성(Feature Extraction), 변수 선택 | 10% | 20% |
모델링 | 알고리즘 적용·최적화, 모델 평가·해석 | 15% | 15% |
표에서 모델링 이전 네 단계(모델 설계~변수 탐색)의 노력 합이 85%다. “데이터 준비에 시간의 대부분이 든다”는 것은 이 강의만의 주장이 아니라 업계에서도 자주 인용되는 경험칙이다. Forbes가 소개한 CrowdFlower(현 Figure Eight) 설문에서도 데이터 과학자들이 데이터 수집·정제·정리에 업무 시간의 상당 부분(약 60~80%)을 쓴다고 답했다. 다만 이후 다른 설문(Anaconda, Kaggle 등)에서는 이보다 낮은 수치도 보고되므로, “대략적인 감(감각)”으로 받아들이는 것이 안전하다.
비즈니스에서는 정확도보다 수용 가능성이 먼저다
Kaggle이나 공모전에서는 변수를 최대한 넣어 XGBoost나 앙상블로 최고 성능을 뽑아내는 접근이 합리적이다. 목적 자체가 최고 성능이기 때문이다. 하지만 비즈니스 현장에서는 다르다. 목적에 맞고 실제로 확보 가능한 데이터를 확인하고, 안정적인 성능을 내는 것이 우선이다.
비즈니스에서의 모델링은 성능 점수 싸움이 아니라 “현장의 문제 해결책 싸움”이다. 모델의 정확도보다 중요한 것은 현업 담당자가 그 결과를 이해하고, 수용하고, 실제로 활용할 수 있는가다.
정리
통계는 가설을 확인하고, 머신러닝은 관계를 발견한다 — 이 한 문장이 데이터 형태·모델링 방식·검증 절차의 차이로 이어진다. 예측 문제는 결과값이 이산형이면 분류, 연속형이면 회귀로 나뉜다는 것도 함께 기억해둘 기본 구분이다. 그리고 어떤 접근이든, 실제 성능 대부분은 모델을 적용하기 전 데이터 준비 단계에서 이미 결정된다.
참고 자료
Cleaning Big Data — Forbes — 데이터 과학자가 데이터 준비에 쓰는 시간 비중에 대한 CrowdFlower 설문 소개 (2026-08-07 확인)
댓글 0
댓글을 불러오는 중…