데이터 스케일링
게임 유저 CSV로 네 가지 스케일러를 하나씩 적용해 계산 기준과 이상치 영향을 확인하고, 상황별로 무엇을 골라야 하는지 비교합니다.
데이터 전처리, 특성 공학, 회귀·분류 모델, 앙상블
문서 3건
문서 15건
게임 유저 CSV로 네 가지 스케일러를 하나씩 적용해 계산 기준과 이상치 영향을 확인하고, 상황별로 무엇을 골라야 하는지 비교합니다.
게임 유저 CSV로 결측을 확인한 뒤, MCAR·MAR·MNAR을 구분하고 삭제와 대치 각각의 방법과 선택 기준을 정리합니다.
수치형·범주형 변수 조합에 맞는 seaborn 그래프를 고르고, 목표변수 관계를 누수와 인과 오해 없이 해석하는 법을 실습한다.
범주형 값을 모델 입력으로 바꾸는 Ordinal·OneHot 인코딩과 미지·희소 범주 처리, 데이터 누수 방지 원칙을 실습합니다.
의사결정나무가 불순도를 기준으로 데이터를 나누는 원리를 Gini 지수·Entropy 계산 예제와 함께 정리합니다.
pandas의 shape·info·describe·isna·nunique·value_counts로 표 데이터를 점검하고 결과를 전처리 결정으로 연결한다.
비즈니스 질문에서 누수 없는 특성 생성·검증·운영까지, 특성 공학의 역할과 안전한 작업 순서를 처음부터 설명한다.
게임 유저 CSV로 네 가지 스케일러를 하나씩 적용해 계산 기준과 이상치 영향을 확인하고, 상황별로 무엇을 골라야 하는지 비교합니다.
정확도의 함정, 계층화 분할, 언더·오버샘플링과 SMOTE를 누수 없이 평가하고 도메인 질문에서 파생 특성을 만드는 종합 실습입니다.
L1 패널티를 쓰는 LASSO와 L2 패널티를 쓰는 Ridge의 차이를 발표자료 비유와 코드 예제로 비교합니다.
게임 유저 CSV로 결측을 확인한 뒤, MCAR·MAR·MNAR을 구분하고 삭제와 대치 각각의 방법과 선택 기준을 정리합니다.
설명 가능성·데이터 규모·변수 성격 같은 상황별 기준으로 Decision Tree부터 부스팅, SVM, LASSO까지 알고리즘 선택 기준을 정리합니다.
게임 유저 CSV로 IQR·Z-score·업무 기준을 직접 채점하고, 고래 유저와 매크로 봇처럼 지우면 안 되는 극단값을 가려냅니다.
모델이 데이터를 암기하는 과적합의 원인과, Train·Validation·Test 분할로 이를 잡아내는 방법을 코드 예제로 확인합니다.
수치형·범주형 변수 조합에 맞는 seaborn 그래프를 고르고, 목표변수 관계를 누수와 인과 오해 없이 해석하는 법을 실습한다.
배깅 기반 랜덤포레스트와 부스팅 기반 XGBoost·LightGBM·CatBoost의 트리 성장 방식과 선택 기준을 비교합니다.
SVM이 마진을 최대화하는 경계를 찾는 원리와 커널 트릭으로 비선형 문제를 푸는 방법, C·gamma 하이퍼파라미터를 정리합니다.
치우친 수치형 변수에 로그·제곱근·Box-Cox·Yeo-Johnson 변환을 선택하고 제약과 데이터 누수를 검증하는 방법을 설명합니다.