데이터 스케일링
게임 유저 CSV로 네 가지 스케일러를 하나씩 적용해 계산 기준과 이상치 영향을 확인하고, 상황별로 무엇을 골라야 하는지 비교합니다.
전체 25건전체 105건
Dropout이 학습 중 뉴런의 공적응을 줄이는 원리, inverted dropout 스케일링, 학습·평가 모드의 차이를 코드로 정리합니다.
신경망에 비선형성이 필요한 이유와 Sigmoid·Tanh·ReLU의 정의, 출력 범위, Gradient Vanishing과의 관계를 코드로 비교합니다.
가중치 업데이트 단위인 Batch·Mini-Batch와 전체 데이터 반복 단위인 Epoch의 관계를 PyTorch DataLoader 코드로 확인합니다.
층마다 입력 분포가 흔들리는 문제를 Batch Normalization이 어떻게 완화하는지, 정규화 계산을 코드로 확인합니다.
손실함수의 기울기를 따라 가중치를 갱신하는 경사하강법의 공식과, 학습률이 수렴 속도·발산에 미치는 영향을 코드로 확인합니다.
역전파의 체인 룰에서 기울기가 반복 곱셈으로 사라지거나 폭발하는 원인을 수식·표·Python 예제로 이해합니다.
선형회귀 y = Wx + b의 파라미터를 구하는 5단계를 통해, 딥러닝이 여기에 무엇을 더 얹었는지 정리합니다.
Scalar부터 Vector·Matrix를 거쳐 이미지·동영상까지, 딥러닝 데이터를 표현하는 텐서와 Shape 표기법을 코드로 정리합니다.
게임 데이터베이스 예시로 요구사항에서 엔티티를 찾고 논리 구조와 실제 SQL 스키마로 구체화하는 데이터 모델링 3단계를 이해합니다.
PostgreSQL과 게임 데이터베이스 예시로 Database·Schema·Table의 계층, 네임스페이스, 권한 분리와 search_path를 이해합니다.
게임 데이터베이스 예시로 ERD의 구성 요소와 IE Crow's Foot 기호, 카디널리티, 식별·비식별 관계를 읽는 방법을 익힙니다.
여러 고객이 함께 쓰는 서비스에서 Silo·Pool·Bridge 모델의 격리 수준, 비용, tenant_id 설계와 선택 기준을 비교합니다.
아이템과 골드가 동시에 이동해야 하는 거래를 PostgreSQL로 구현하며 트랜잭션, ACID, 잠금, WAL의 역할을 익히는 입문 글
MMORPG의 플레이어·길드·아이템·인벤토리 데이터로 1NF·2NF·3NF·BCNF·4NF·5NF와 삽입·수정·삭제 이상을 단계별로 이해합니다.
게임의 플레이어·길드·아이템·인벤토리 예시로 엔티티와 속성, PK·FK, 관계 종류, 중간 테이블, 정규화와 ERD 설계 흐름을 익힙니다.
게임의 플레이어와 인벤토리 예시로 기본키·고유키·외래키의 역할과 차이, 참조 무결성을 쉽게 이해합니다.
Windows에 PostgreSQL 서버를 먼저 설치하고 DBeaver와 JDBC 드라이버를 연결해 SQL 실습 환경을 완성하는 순서
게임 런처가 공지와 이미지를 불러오는 과정을 따라 인터넷·웹의 차이와 브라우저의 요청·응답 흐름을 익히는 입문 안내서
게임 캐릭터 예제로 클래스, 객체, 필드, 메서드, 생성자와 객체지향 4대 특성을 익히는 자바 입문 가이드
RPG 전투 코드로 절차지향과 객체지향의 사고방식, OOP 4대 특성, 선택 기준을 비교하는 입문 가이드
게임 코드 예제로 SOLID 다섯 원칙의 뜻, 문제 신호, 적용 기준을 빠르게 익히는 객체지향 설계 입문
버전 관리가 왜 필요한지부터 add·commit까지, 터미널 화면을 그대로 따라가며 익히는 Git 첫걸음
범주형 값을 모델 입력으로 바꾸는 Ordinal·OneHot 인코딩과 미지·희소 범주 처리, 데이터 누수 방지 원칙을 실습합니다.
의사결정나무가 불순도를 기준으로 데이터를 나누는 원리를 Gini 지수·Entropy 계산 예제와 함께 정리합니다.
pandas의 shape·info·describe·isna·nunique·value_counts로 표 데이터를 점검하고 결과를 전처리 결정으로 연결한다.
비즈니스 질문에서 누수 없는 특성 생성·검증·운영까지, 특성 공학의 역할과 안전한 작업 순서를 처음부터 설명한다.
게임 유저 CSV로 네 가지 스케일러를 하나씩 적용해 계산 기준과 이상치 영향을 확인하고, 상황별로 무엇을 골라야 하는지 비교합니다.
정확도의 함정, 계층화 분할, 언더·오버샘플링과 SMOTE를 누수 없이 평가하고 도메인 질문에서 파생 특성을 만드는 종합 실습입니다.
L1 패널티를 쓰는 LASSO와 L2 패널티를 쓰는 Ridge의 차이를 발표자료 비유와 코드 예제로 비교합니다.
게임 유저 CSV로 결측을 확인한 뒤, MCAR·MAR·MNAR을 구분하고 삭제와 대치 각각의 방법과 선택 기준을 정리합니다.
설명 가능성·데이터 규모·변수 성격 같은 상황별 기준으로 Decision Tree부터 부스팅, SVM, LASSO까지 알고리즘 선택 기준을 정리합니다.
게임 유저 CSV로 IQR·Z-score·업무 기준을 직접 채점하고, 고래 유저와 매크로 봇처럼 지우면 안 되는 극단값을 가려냅니다.
모델이 데이터를 암기하는 과적합의 원인과, Train·Validation·Test 분할로 이를 잡아내는 방법을 코드 예제로 확인합니다.
수치형·범주형 변수 조합에 맞는 seaborn 그래프를 고르고, 목표변수 관계를 누수와 인과 오해 없이 해석하는 법을 실습한다.
배깅 기반 랜덤포레스트와 부스팅 기반 XGBoost·LightGBM·CatBoost의 트리 성장 방식과 선택 기준을 비교합니다.
SVM이 마진을 최대화하는 경계를 찾는 원리와 커널 트릭으로 비선형 문제를 푸는 방법, C·gamma 하이퍼파라미터를 정리합니다.
치우친 수치형 변수에 로그·제곱근·Box-Cox·Yeo-Johnson 변환을 선택하고 제약과 데이터 누수를 검증하는 방법을 설명합니다.
신경망에 비선형성이 필요한 이유와 Sigmoid·Tanh·ReLU의 정의, 출력 범위, Gradient Vanishing과의 관계를 코드로 비교합니다.
입력 자신을 정답 삼아 압축(Encoder)과 복원(Decoder)을 학습하는 Auto-Encoder의 구조와 한계, PCA와의 차이를 코드로 정리합니다.
가중치 업데이트 단위인 Batch·Mini-Batch와 전체 데이터 반복 단위인 Epoch의 관계를 PyTorch DataLoader 코드로 확인합니다.
층마다 입력 분포가 흔들리는 문제를 Batch Normalization이 어떻게 완화하는지, 정규화 계산을 코드로 확인합니다.
Transformer의 Encoder만으로 문장을 양방향으로 이해하는 BERT의 Masked LM·NSP 학습 방식과 Pre-training-Fine-tuning 패러다임을 정리합니다.
합성곱 신경망을 이루는 네 가지 연산을 작은 행렬 예제로 직접 계산해, 이미지가 특징 맵을 거쳐 분류 확률이 되는 과정을 정리합니다.
ILSVRC 우승 모델의 계보를 따라 AlexNet이 증명한 딥러닝의 가능성과, ResNet이 Skip Connection으로 깊이의 저주를 돌파한 과정을 정리합니다.
Dropout이 학습 중 뉴런의 공적응을 줄이는 원리, inverted dropout 스케일링, 학습·평가 모드의 차이를 코드로 정리합니다.
작은 신경망 예제를 숫자로 직접 계산해, 순전파로 예측하고 체인 룰로 역전파하는 과정을 정리합니다.
손실함수의 기울기를 따라 가중치를 갱신하는 경사하강법의 공식과, 학습률이 수렴 속도·발산에 미치는 영향을 코드로 확인합니다.
역전파의 체인 룰에서 기울기가 반복 곱셈으로 사라지거나 폭발하는 원인을 수식·표·Python 예제로 이해합니다.
선형회귀 y = Wx + b의 파라미터를 구하는 5단계를 통해, 딥러닝이 여기에 무엇을 더 얹었는지 정리합니다.
Forget·Input·Output 세 게이트와 Cell State로 장기 기억을 다루는 LSTM의 계산 과정을 숫자로 직접 확인합니다.
완전연결 구조인 MLP가 이미지에서 겪는 공간 구조 소실·파라미터 폭발·위치 의존 문제와, CNN이 이를 해결하는 귀납적 편향을 정리합니다.
Transformer·선형 순환 모델의 비용 차이와 MoE의 Top-K 라우팅·전문가 특화·부하 균형, 최신 하이브리드 아키텍처를 정리합니다.
하나의 손실 함수에서 SGD·Momentum·RMSProp·Adam의 이동 경로를 수식과 애니메이션 그래프로 비교합니다.
Hidden State로 과거 정보를 요약해 전달하는 RNN의 구조를 tanh 계산 예제로 확인하고, 기울기 소실에 취약한 이유를 정리합니다.
Encoder-Decoder 구조로 시퀀스를 다른 시퀀스로 변환하는 Seq2Seq의 동작 방식과, 고정 길이 Context Vector가 만드는 정보 병목 문제를 정리합니다.
Scalar부터 Vector·Matrix를 거쳐 이미지·동영상까지, 딥러닝 데이터를 표현하는 텐서와 Shape 표기법을 코드로 정리합니다.
RNN을 대체한 Self-Attention의 QKV 계산 원리를 코드로 확인하고, Multi-Head Attention과 Transformer의 Encoder-Decoder 구조를 정리합니다.
CPython이 소스 코드를 AST와 code object·bytecode로 컴파일해 실행하는 흐름과 .pyc 캐시의 정확한 역할을 설명합니다.
async·await·asyncio.gather와 httpx.AsyncClient로 여러 공공 API를 동시에 호출하고, 일부 요청이 실패해도 나머지 결과는 살리는 수집기를 만듭니다.
deque, defaultdict, Counter, OrderedDict, heapq, bisect를 큐·그룹핑·빈도·우선순위·정렬 경계 작업에 맞게 선택합니다.
list·dict·set comprehension으로 변환과 필터를 표현하고, 일반 반복문이 더 읽기 좋은 경계를 데이터 예제로 설명합니다.
I/O-bound와 CPU-bound 작업을 구분하고, CPython GIL이 threading과 multiprocessing에 미치는 영향을 실측 코드로 비교해 도구 선택 기준을 정리합니다.
if·elif·else와 Truthy·Falsy, and·or 단락 평가, ==·is·in을 데이터 검증 예제로 정확히 구분합니다.
macOS와 Windows에서 프로젝트별 가상환경을 만들고 pip·requirements·VS Code 인터프리터를 일치시키는 방법을 설명합니다.
직원·판매 데이터를 검증하고 컴프리헨션, sorted, Counter, defaultdict, 제너레이터로 필터링·집계하는 재현 가능한 종합 실습입니다.
클로저가 외부 변수를 기억하는 원리와 nonlocal, 데코레이터로 실행 시간 측정·재시도를 분리하는 방법, functools.wraps의 필요성을 정리합니다.
API 키·DB 비밀번호를 코드에서 분리해 .env로 관리하고, python-dotenv·os.getenv와 타입 변환 함정, Git 노출 방지 방법을 정리합니다.
try·except·else·finally의 실행 시점을 구분하고, raise와 raise from, 파이프라인에 맞는 사용자 정의 예외로 실패 경계를 설계합니다.
pathlib로 경로를 다루고 csv·json 표준 모듈과 pandas+pyarrow로 세 파일 형식을 안전하게 읽고 저장합니다.
함수 정의와 반환부터 다섯 가지 매개변수, 언패킹, 기본 인자 함정, 일급 객체와 partial까지 데이터 분석 예제로 익힙니다.
iterable·iterator·generator의 차이와 yield의 중단·재개, 일회성 지연 평가, itertools와 안전한 CSV 스트리밍 파이프라인을 설명합니다.
순서·중복·변경 가능성·접근 방식으로 list, tuple, set, dict를 비교하고 데이터에 맞는 구조를 고르는 기준을 설명합니다.
로그 레벨 5단계와 Logger·Handler·Formatter 구조로 콘솔·파일에 서로 다른 형식의 기록을 남기고, logger.exception으로 예외 추적성을 확보합니다.
모듈·패키지·import의 동작과 main guard, 캐시·순환 import 주의점을 익히고 데이터 분석에 맞는 표준 라이브러리를 고릅니다.
Python의 이름·객체·바인딩 모델과 CPython의 참조 횟수·순환 가비지 컬렉션을 입문자 관점에서 설명합니다.
Pydantic v2 BaseModel과 Field로 CSV·API 입력을 실행 시점에 검증·변환하고, ValidationError로 실패 행을 구조화해 다루는 방법을 익힙니다.
분석 파이프라인의 정제 함수를 pytest fixture·예외 테스트·매개변수화로 검증하고 pytest-cov로 커버리지 빈틈을 찾는 방법을 정리합니다.
Ruff로 린트·import 정렬·포맷을 하나로 합치고, pre-commit과 GitHub Actions로 커밋·CI 단계에서 자동으로 검사하는 흐름을 만듭니다.
Python 문자열의 불변성과 Unicode 모델부터 인덱싱·슬라이싱, 정제 메서드, f-string 포맷 지정과 외부 입력의 보안 경계까지 설명합니다.
list·dict 컬렉션 타입부터 Optional·Union·Literal·Any·Callable·Protocol까지 정적 타입 표현을 정리하고 mypy로 실행 전 오류를 찾는 방법을 익힙니다.
for·while 선택부터 enumerate, break·continue·else, zip과 zip_longest의 안전한 사용법까지 데이터 예제로 설명합니다.
데이터를 읽고 정리하고 분석해 전달하는 전 과정에서 Python이 유용한 이유와 다른 도구를 선택할 기준을 설명합니다.
schedule로 반복 실행을 예약하고 Jinja2로 HTML 리포트를 만들며, 수집·검증·변환·적재를 분리한 ETL 파이프라인으로 부분 실패를 견디는 자동화 흐름을 만듭니다.
관리형 DB, 읽기 복제본, 파티셔닝·샤딩, 합의·복제를 구분하고 글로벌 매치 기록과 결제 원장에 CAP·일관성·RPO·RTO를 적용합니다.
게임 데이터베이스 예시로 요구사항에서 엔티티를 찾고 논리 구조와 실제 SQL 스키마로 구체화하는 데이터 모델링 3단계를 이해합니다.
CRISP-DM 6단계로 분석 문제를 정의하고, ColumnTransformer와 Pipeline으로 전처리·모델을 하나로 묶어 데이터 유출 없이 학습·평가·joblib 저장까지 재현 가능한 흐름을 만듭니다.
Anscombe의 사중주로 시각화가 필요한 이유를 확인하고, Matplotlib·Seaborn·Plotly·Altair를 실제 차트와 코드로 비교해 상황별 선택 기준을 정리합니다.
아이템과 골드가 동시에 이동해야 하는 거래를 PostgreSQL로 구현하며 트랜잭션, ACID, 잠금, WAL의 역할을 익히는 입문 글
플레이어와 매치 로그로 단일·복합·부분·표현식·커버링 B-tree 인덱스를 설계하고 선택도, 선두 열, 쓰기 비용을 EXPLAIN으로 검증합니다.
테이블·행·advisory lock의 경계를 이해하고 길드 금고 거래의 교착상태를 두 세션으로 재현한 뒤 잠금 순서와 재시도로 해결합니다.
MMORPG의 플레이어·길드·아이템·인벤토리 데이터로 1NF·2NF·3NF·BCNF·4NF·5NF와 삽입·수정·삭제 이상을 단계별로 이해합니다.
게임 보상 지급 예제로 PostgreSQL function·procedure·trigger의 반환값, 호출법, 트랜잭션 차이와 멱등성·감사 로그 설계 기준을 익히는 글
PostgreSQL과 게임 데이터베이스 예시로 Database·Schema·Table의 계층, 네임스페이스, 권한 분리와 search_path를 이해합니다.
평균·중앙값·왜도로 데이터를 요약하고, t-test와 카이제곱 검정으로 그룹 차이와 범주형 변수의 관계가 통계적으로 유의미한지 scipy로 직접 확인합니다.
실제 날씨 API 수집부터 Pydantic 검증, Pandas 정제, pytest, 시각화, t-test, sklearn Pipeline, Jinja2 리포트까지 시리즈 전체를 하나의 프로젝트로 연결하는 종합 실습입니다.
게임 데이터베이스 예시로 ERD의 구성 요소와 IE Crow's Foot 기호, 카디널리티, 식별·비식별 관계를 읽는 방법을 익힙니다.
게임 이벤트를 OLTP에서 스타 스키마로 적재해 KPI를 계산하고 최소권한·RLS, 백업·PITR, RPO/RTO, HA와 SLI까지 운영하는 실전 런북입니다.
게임의 플레이어·길드·아이템·인벤토리 예시로 엔티티와 속성, PK·FK, 관계 종류, 중간 테이블, 정규화와 ERD 설계 흐름을 익힙니다.
여러 고객이 함께 쓰는 서비스에서 Silo·Pool·Bridge 모델의 격리 수준, 비용, tenant_id 설계와 선택 기준을 비교합니다.
동시 아이템 구매와 레이드 참가 예제로 MVCC 스냅샷, READ COMMITTED·REPEATABLE READ·SERIALIZABLE의 이상 현상과 재시도 전략을 두 세션 SQL로 검증합니다.
게임 리더보드를 정규화 테이블, 반정규화 스냅샷, 캐시와 Materialized View로 구현하고 읽기·쓰기 증폭과 일관성을 측정해 선택합니다.
DataFrame으로 결측치·이상치를 진단하고 groupby·pivot_table·merge로 집계·결합하며, Pandas 2.x의 Copy-on-Write와 apply 대신 벡터화 연산을 쓰는 이유를 실측으로 정리합니다.
Polars의 Eager·Lazy API, DuckDB의 파일 직접 SQL, Arrow·Parquet의 역할을 Pandas와 실측으로 비교하고 상황별 도구 선택 기준을 정리합니다.
게임의 플레이어와 인벤토리 예시로 기본키·고유키·외래키의 역할과 차이, 참조 무결성을 쉽게 이해합니다.
notebook·src·tests·데이터 폴더의 역할을 나누고, editable 설치와 README·requirements.txt로 누구나 같은 결과를 재현할 수 있는 프로젝트 구조를 만듭니다.
가상의 게임 데이터로 SELECT·WHERE·JOIN·GROUP BY와 INSERT·UPDATE·DELETE를 실행하고, NULL과 논리 처리 순서까지 결과표와 도식으로 익힙니다.
퀘스트 진행과 게임 리더보드 예제로 일반·재귀 CTE, MATERIALIZED 최적화 경계, View와 Materialized View의 보안·최신성·성능을 비교합니다.
PostgreSQL 역할과 GRANT·REVOKE를 이용해 게임 DB의 조회·변경 권한을 분리하고 최소 권한 원칙을 적용합니다.
SQL 명령을 구조를 정의하는 DDL, 데이터를 다루는 DML, 권한을 제어하는 DCL로 나누고 게임 DB 예시와 세부 글로 연결합니다.
플레이어·아이템·인벤토리를 만들고 변경하며 PostgreSQL 타입, CREATE·ALTER·DROP과 핵심 제약 조건, 안전한 마이그레이션을 익히는 글
PostgreSQL의 SELECT·INSERT·UPDATE·DELETE와 BEGIN·COMMIT·ROLLBACK을 익히고 조건부 갱신과 행 잠금으로 원자적인 아이템 거래를 구현합니다.
게임 이벤트 로그의 느린 조회를 재현하며 EXPLAIN ANALYZE BUFFERS, 스캔·조인 노드, 통계 오차와 sargability를 읽고 개선하는 글
PostgreSQL GROUP BY·HAVING·FILTER와 날짜 버킷으로 DAU, ARPDAU, 결제 전환율, 가입 코호트 D1·D7 잔존율을 정의하고 검증합니다.
플레이어·길드·매치 데이터로 INNER·OUTER·CROSS JOIN의 결과를 비교하고 PostgreSQL의 nested loop·hash·merge join 선택과 EXPLAIN을 익히는 글
평균보다 강한 플레이어와 미접속 계정을 서브쿼리로 찾고, 시즌 참가자 집합을 UNION·INTERSECT·EXCEPT로 비교하며 NULL 함정을 피합니다.
시즌 점수와 일별 접속 데이터로 PARTITION BY, ROW_NUMBER·RANK·DENSE_RANK, LAG·LEAD, 누적합과 이동평균의 프레임을 익히는 글
버전 관리가 왜 필요한지부터 add·commit까지, 터미널 화면을 그대로 따라가며 익히는 Git 첫걸음
게임 런처가 공지와 이미지를 불러오는 과정을 따라 인터넷·웹의 차이와 브라우저의 요청·응답 흐름을 익히는 입문 안내서
게임 캐릭터 예제로 클래스, 객체, 필드, 메서드, 생성자와 객체지향 4대 특성을 익히는 자바 입문 가이드
RPG 전투 코드로 절차지향과 객체지향의 사고방식, OOP 4대 특성, 선택 기준을 비교하는 입문 가이드
게임 코드 예제로 SOLID 다섯 원칙의 뜻, 문제 신호, 적용 기준을 빠르게 익히는 객체지향 설계 입문
온라인 게임의 로그인과 캐릭터 조회를 따라가며 HTTP 요청·응답의 구조, 상태 없음, HTTPS의 역할을 쉽게 익힌다.
게임 홈페이지의 패치 이미지와 캐릭터 랭킹 요청을 따라가며 Web Server, WAS, Database, API 서버의 역할과 분리 이유를 처음부터 정리한 입문 글
Windows에 PostgreSQL 서버를 먼저 설치하고 DBeaver와 JDBC 드라이버를 연결해 SQL 실습 환경을 완성하는 순서