지도학습·비지도학습·준지도학습

src/content/documents/ai-fundamentals/supervised-unsupervised-semi-supervised-learning.json

머신러닝을 한 문장으로 정의하면

머신러닝을 정의하는 방식은 여럿이지만, 가장 자주 인용되는 두 정의가 있다. 1959년 Arthur Samuel은 머신러닝을 “명시적으로 프로그래밍하지 않아도 컴퓨터가 배울 수 있게 하는 학문 분야”라고 정의했다. 체스보다 단순한 체커 게임을 스스로 학습하는 프로그램을 만들며 내린 정의다.

1997년 Tom Mitchell은 이를 더 구체적으로 다듬었다. “어떤 작업(T)에 대한 성과가, 경험(E)을 통해 성과 측정 지표(P) 기준으로 향상된다면, 그 프로그램은 경험(E)으로부터 학습한다고 말할 수 있다.”

요소

의미

예시 (스팸 메일 분류)

Task (T)

풀고자 하는 작업

메일이 스팸인지 아닌지 분류하기

Experience (E)

학습에 쓰이는 경험(데이터)

스팸/정상으로 라벨링된 과거 메일들

Performance (P)

성과를 재는 지표

정확히 분류한 메일의 비율(정확도)

이 정의에서 중요한 것은 학습이 반복 시도 중 얻는 시행착오라는 점이다. 모델은 데이터를 여러 번 훑으며(Multi-run) 성능 지표가 나아지는 방향으로 파라미터를 조정한다.

학습 접근법은 정답(Label)의 유무로 나뉜다

머신러닝을 분류하는 기준은 다양하지만, 가장 기본적인 기준은 학습에 쓰는 데이터에 정답(Label)이 있는가다. 이 기준으로 지도학습·비지도학습·준지도학습 세 가지로 나뉜다.

지도학습: 정답을 보고 배운다

지도학습(Supervised Learning)은 입력(X)과 정답(Y)을 모두 제공하고, 모델이 예측값과 실제 정답을 비교하며 학습하는 방식이다. Task-driven 접근이라고도 부르는데, “이 입력이 주어지면 이 정답을 맞혀라”라는 과업이 뚜렷하기 때문이다.

  • 결과값이 이산형(클래스)이면 분류(Classification)다.

  • 결과값이 연속형(숫자)이면 회귀(Regression)다.

  • 정확도를 예측값과 실제 정답을 직접 비교해 계산할 수 있다는 점이 가장 큰 특징이다.

비지도학습: 정답 없이 구조를 찾는다

비지도학습(Unsupervised Learning)은 입력(X)만 제공하고 정답(Y)은 알려주지 않는다. Data-oriented 접근이라고 부른다. 모델은 정답과 비교하는 대신, 데이터 안에 있는 패턴이나 군집을 스스로 찾아내야 한다.

  • 비슷한 데이터끼리 묶는 군집화(Clustering)가 대표적이다.

  • 차원을 줄이거나 분포를 추정하는 차원 축소(Dimension Reduction)도 여기에 속한다.

  • 정답이 없으므로 “얼마나 잘 맞혔는가”를 직접 잴 수 없고, 결과가 실제로 유의미한 패턴인지는 사람이 해석해야 한다.

준지도학습: 일부만 정답이 있을 때

준지도학습(Semi-Supervised Learning)은 정답이 있는 데이터는 소량, 정답이 없는 데이터는 대량인 상황에서 둘을 함께 활용한다. 라벨링 작업에 비용이나 시간이 많이 들 때 쓰는 절충안이다.

  • 라벨이 없는 데이터를 구하기가 라벨이 있는 데이터보다 훨씬 쉽다는 점이 배경이다.

  • 라벨 없는 데이터의 분포까지 함께 고려하면, 라벨 있는 데이터만으로 학습한 모델보다 더 좋은 성능을 낼 가능성이 있다.

  • 결과물(Output)은 지도학습과 동일하게 분류나 회귀다 — 차이는 학습에 쓰는 데이터 구성뿐이다.

준지도학습이 기대는 두 가지 가정이 있다. 가까이 있는 데이터는 같은 라벨을 가질 가능성이 높다는 Smoothness 가정과, 서로 다른 라벨을 가르는 경계 근처에는 데이터가 적게 분포한다는 Low-Density 가정이다.

한눈에 비교하기

학습 방식

제공하는 데이터

대표 산출물

지도학습

입력 + 정답 100%

분류(Classification), 회귀(Regression)

준지도학습

입력 + 정답 일부, 나머지는 입력만

분류, 회귀 (지도학습과 산출물은 동일)

비지도학습

입력만, 정답 없음

군집화(Clustering), 차원 축소/추정

정리

세 접근법을 가르는 기준은 하나, 학습 데이터에 정답이 얼마나 있는가다. 정답이 충분하면 지도학습, 전혀 없으면 비지도학습, 일부만 있고 나머지가 아깝다면 준지도학습을 고려한다. 실무에서는 라벨링 비용과 확보 가능한 데이터 양을 먼저 따져보고 접근법을 정하는 경우가 많다.

참고 자료

댓글 0

댓글을 불러오는 중…