Dropout
Dropout이 학습 중 뉴런의 공적응을 줄이는 원리, inverted dropout 스케일링, 학습·평가 모드의 차이를 코드로 정리합니다.
신경망, CNN, RNN, 손실함수, 최적화 기법
문서 8건
문서 20건
Dropout이 학습 중 뉴런의 공적응을 줄이는 원리, inverted dropout 스케일링, 학습·평가 모드의 차이를 코드로 정리합니다.
신경망에 비선형성이 필요한 이유와 Sigmoid·Tanh·ReLU의 정의, 출력 범위, Gradient Vanishing과의 관계를 코드로 비교합니다.
가중치 업데이트 단위인 Batch·Mini-Batch와 전체 데이터 반복 단위인 Epoch의 관계를 PyTorch DataLoader 코드로 확인합니다.
층마다 입력 분포가 흔들리는 문제를 Batch Normalization이 어떻게 완화하는지, 정규화 계산을 코드로 확인합니다.
손실함수의 기울기를 따라 가중치를 갱신하는 경사하강법의 공식과, 학습률이 수렴 속도·발산에 미치는 영향을 코드로 확인합니다.
역전파의 체인 룰에서 기울기가 반복 곱셈으로 사라지거나 폭발하는 원인을 수식·표·Python 예제로 이해합니다.
선형회귀 y = Wx + b의 파라미터를 구하는 5단계를 통해, 딥러닝이 여기에 무엇을 더 얹었는지 정리합니다.
Scalar부터 Vector·Matrix를 거쳐 이미지·동영상까지, 딥러닝 데이터를 표현하는 텐서와 Shape 표기법을 코드로 정리합니다.
신경망에 비선형성이 필요한 이유와 Sigmoid·Tanh·ReLU의 정의, 출력 범위, Gradient Vanishing과의 관계를 코드로 비교합니다.
입력 자신을 정답 삼아 압축(Encoder)과 복원(Decoder)을 학습하는 Auto-Encoder의 구조와 한계, PCA와의 차이를 코드로 정리합니다.
가중치 업데이트 단위인 Batch·Mini-Batch와 전체 데이터 반복 단위인 Epoch의 관계를 PyTorch DataLoader 코드로 확인합니다.
층마다 입력 분포가 흔들리는 문제를 Batch Normalization이 어떻게 완화하는지, 정규화 계산을 코드로 확인합니다.
Transformer의 Encoder만으로 문장을 양방향으로 이해하는 BERT의 Masked LM·NSP 학습 방식과 Pre-training-Fine-tuning 패러다임을 정리합니다.
합성곱 신경망을 이루는 네 가지 연산을 작은 행렬 예제로 직접 계산해, 이미지가 특징 맵을 거쳐 분류 확률이 되는 과정을 정리합니다.
ILSVRC 우승 모델의 계보를 따라 AlexNet이 증명한 딥러닝의 가능성과, ResNet이 Skip Connection으로 깊이의 저주를 돌파한 과정을 정리합니다.
Dropout이 학습 중 뉴런의 공적응을 줄이는 원리, inverted dropout 스케일링, 학습·평가 모드의 차이를 코드로 정리합니다.
작은 신경망 예제를 숫자로 직접 계산해, 순전파로 예측하고 체인 룰로 역전파하는 과정을 정리합니다.
손실함수의 기울기를 따라 가중치를 갱신하는 경사하강법의 공식과, 학습률이 수렴 속도·발산에 미치는 영향을 코드로 확인합니다.
역전파의 체인 룰에서 기울기가 반복 곱셈으로 사라지거나 폭발하는 원인을 수식·표·Python 예제로 이해합니다.
선형회귀 y = Wx + b의 파라미터를 구하는 5단계를 통해, 딥러닝이 여기에 무엇을 더 얹었는지 정리합니다.
Forget·Input·Output 세 게이트와 Cell State로 장기 기억을 다루는 LSTM의 계산 과정을 숫자로 직접 확인합니다.
완전연결 구조인 MLP가 이미지에서 겪는 공간 구조 소실·파라미터 폭발·위치 의존 문제와, CNN이 이를 해결하는 귀납적 편향을 정리합니다.
Transformer·선형 순환 모델의 비용 차이와 MoE의 Top-K 라우팅·전문가 특화·부하 균형, 최신 하이브리드 아키텍처를 정리합니다.
하나의 손실 함수에서 SGD·Momentum·RMSProp·Adam의 이동 경로를 수식과 애니메이션 그래프로 비교합니다.
Hidden State로 과거 정보를 요약해 전달하는 RNN의 구조를 tanh 계산 예제로 확인하고, 기울기 소실에 취약한 이유를 정리합니다.
Encoder-Decoder 구조로 시퀀스를 다른 시퀀스로 변환하는 Seq2Seq의 동작 방식과, 고정 길이 Context Vector가 만드는 정보 병목 문제를 정리합니다.
Scalar부터 Vector·Matrix를 거쳐 이미지·동영상까지, 딥러닝 데이터를 표현하는 텐서와 Shape 표기법을 코드로 정리합니다.
RNN을 대체한 Self-Attention의 QKV 계산 원리를 코드로 확인하고, Multi-Head Attention과 Transformer의 Encoder-Decoder 구조를 정리합니다.