이미지넷 대회가 CNN의 역사를 갈랐다
ImageNet Large Scale Visual Recognition Challenge(ILSVRC)는 매년 열린 이미지 분류 대회로, 이 대회의 우승 모델들이 곧 CNN 발전사의 이정표가 됐다. 층수만 봐도 흐름이 보인다 — AlexNet(2012) 8개, VGG(2014) 19개, GoogLeNet(2014) 22개, ResNet(2015) 152개. “레이어를 더 쌓을수록 성능이 오른다”는 대전제 아래 CNN은 계속 더 깊어졌다.
AlexNet(2012): 딥러닝 부흥의 시작
AlexNet은 ILSVRC 2012에서 압도적인 성능차로 우승하며, 딥러닝이 이미지 처리·인식 문제에서 탁월한 성능을 낼 수 있음을 증명한 모델이다. 5개의 Convolution Layer와 3개의 완전연결층(FC Layer)으로 구성됐고, 지금은 표준이 된 여러 요소를 이때 처음 폭넓게 결합했다.
ReLU 도입 — 비선형성을 강화하면서 기울기 소실 문제 완화, 학습 속도 향상
Dropout — 임의로 일부 뉴런을 꺼서 특정 뉴런에 과도하게 의존하지 않도록 과적합 방지
GPU 학습 — 대규모 데이터셋을 감당할 수 있는 연산 속도 확보
Data Augmentation·정규화(LRN) — 학습 데이터를 늘리고 학습을 안정화
깊이의 저주(Degradation)
그런데 “레이어를 계속 추가하면 성능이 계속 오른다”는 대전제는 어느 순간 깨졌다. 레이어를 더 쌓았더니 오히려 성능이 떨어지는 현상이 나타났다. 이 현상은 Gradient Vanishing이 아니었다 — Batch Normalization과 ReLU를 함께 써도 해결되지 않았다. 이를 Degradation(퇴화), “깊이의 저주”라고 부른다.
ResNet(2015): 잔차를 다시 해석하다
ResNet은 “잔차(Residual)”라는 익숙한 개념을 새롭게 해석해 이 문제를 풀었다.
구분 | 통계 회귀분석 | Vanilla CNN | ResNet |
|---|---|---|---|
잔차의 의미 | 실제값 − 예측값 (모델 전체 출력 vs 정답) | 실제값 − 예측값 (모델 전체 출력 vs 정답) | 출력 − 입력 (블록 출력 vs 블록 입력) |
학습 대상 | 회귀 계수 | 목표 출력 H(x) 전체 | 변화량 F(x) = H(x) − x |
핵심 장치 | 최소자승법 | Conv Layer를 그냥 쌓기 | Skip Connection (입력을 출력에 더함) |
“학습 성공”의 의미 | 모델이 데이터를 완벽히 설명 | 출력이 정답과 일치 | 그 블록이 아무것도 바꾸지 않아도(F(x)→0) 성능이 나빠지지 않음 |
핵심은 Skip Connection(지름길 연결)이다. 각 블록의 입력을 그대로 출력에 더해줘서, 그 블록이 유용한 변환을 학습하지 못하더라도 최소한 입력이 그대로 보존되어 성능이 나빠지지 않는다. 블록은 “전체 출력”이 아니라 “입력에 더할 변화량(F(x))”만 학습하면 되므로 훨씬 안정적으로 학습된다.
원고 편집에 비유하면 이해가 쉽다. 일반 CNN(Plain Block)은 매 단계마다 원고를 백지에 통째로 다시 옮겨 쓰는 것과 같다 — 안 고칠 부분까지 전부 다시 쓰다 손실이 생길 수 있다. Residual Block은 원본 위에 수정사항만 표시한다 — 고칠 게 없으면 추가 작업 없이 원본이 그대로 남는다.
ResNet이 증명한 것
Skip Connection으로 100층 이상, 최대 152층까지도 안정적으로 학습할 수 있음을 보였다.
“깊이 쌓으면 성능이 오른다”는 대전제를 다시 증명해, 이후 Deep Neural Network(DNN) 시대의 표준이 됐다.
ResNet-18부터 ResNet-152까지 다양한 깊이로 변형되며, 컴퓨터 비전을 넘어 NLP·음성인식 등 여러 분야에 활용됐다.
정리
AlexNet은 ReLU·Dropout·GPU 학습을 결합해 딥러닝의 가능성을 증명했지만, 층을 계속 쌓다 보니 오히려 성능이 나빠지는 Degradation 문제에 부딪혔다. ResNet은 잔차를 “입력에 더할 변화량”으로 재해석하고 Skip Connection을 더해, 각 블록이 “아무것도 하지 않아도 손해 보지 않는” 안전장치를 마련함으로써 152층까지 깊이의 한계를 돌파했다.
참고 자료
ImageNet Classification with Deep Convolutional Neural Networks — NeurIPS 2012 (AlexNet 원 논문) — AlexNet의 구조와 ReLU·Dropout·GPU 학습 (2026-08-07 확인)
Deep Residual Learning for Image Recognition — He et al., CVPR 2016 (ResNet 원 논문) — Residual Block과 Skip Connection, Degradation 문제 해결 (2026-08-07 확인)
댓글 0
댓글을 불러오는 중…