001 AI의 큰 그림: AI·머신러닝·딥러닝과 네 가지 학습 방식출처

AI의 큰 그림: AI·머신러닝·딥러닝과 네 가지 학습 방식
AI STUDY NOTESFOUNDATIONS / 001

AI 입문 · 개념 정리 · 면접 준비

AI의 큰 그림
AI·머신러닝·딥러닝과
네 가지 학습 방식

용어를 외우기 전에 두 가지를 구분하자.
어떤 기술을 쓰는가, 그리고 무엇을 보고 배우는가.

연재 001 / 193 · 선수 지식 없음 · 작성일 2026. 09. 27.

“딥러닝으로 만든 생성형 AI가 자기지도학습을 한다.” 처음 들으면 비슷한 말을 반복하는 것처럼 느껴진다. 하지만 이 문장에는 서로 다른 질문의 답이 들어 있다. 딥러닝은 모델을 만드는 방법을, 생성형 AI는 만들어 내는 결과물의 성격을, 자기지도학습은 학습에 사용할 정답을 어디서 얻는지를 말한다.

이 구분을 잡아 두면 새로운 모델이나 서비스를 만났을 때도 이름에 휘둘리지 않고 구조를 파악할 수 있다. 이번 글에서는 AI의 범위를 먼저 살펴보고, 네 가지 학습 방식을 하나씩 연결해 보자.

1. AI는 큰 범위, 딥러닝은 그 안의 방법

인공지능(AI)은 인식·추론·계획·의사결정처럼 지능이 필요한 과제를 기계로 수행하려는 분야다. 반드시 데이터를 학습해야만 AI인 것은 아니다. 사람이 지식을 규칙으로 정리한 전문가 시스템이나, 가능한 경로를 탐색하는 방식도 AI의 범위에 들어간다.

머신러닝(ML)은 그중에서 데이터를 이용해 모델의 동작을 학습하는 접근이다. 모델은 입력을 받아 예측이나 출력을 만드는 계산 구조이고, 학습은 그 구조의 조정 가능한 값이나 규칙을 데이터에 맞추는 과정이다. 딥러닝(DL)은 여러 층의 신경망으로 표현을 학습하는 머신러닝의 한 분야다. [1]

인공지능 · AI인식, 추론, 계획, 의사결정 등의 문제를 다루는 넓은 분야
머신러닝 · ML데이터에서 패턴을 학습하는 접근
딥러닝 · DL여러 층의 신경망으로 표현을 학습하는 접근
포함 관계: 딥러닝 ⊂ 머신러닝 ⊂ 인공지능. AI 전체가 신경망으로 이루어진 것은 아니다.

스팸 메일을 걸러 낸다고 생각해 보자

직접 규칙을 만들면 “제목에 특정 단어가 있고, 링크가 일정 개수 이상이면 스팸으로 처리한다”처럼 작성할 수 있다. 이때 판단 기준을 정하는 주체는 개발자다. 표현이 바뀌거나 새로운 유형의 스팸이 등장하면 규칙도 손봐야 한다.

머신러닝 방식에서는 메일과 스팸 여부를 모아 모델을 학습시킨다. 예를 들어 링크 개수나 특정 단어의 등장 횟수를 입력으로 주고, 어떤 조합이 스팸과 관련 있는지 데이터에서 찾게 한다. 사람이 모든 판별 규칙을 직접 쓰는 대신, 학습할 데이터와 목표를 설계하는 것이다.

딥러닝 모델은 메일을 구성하는 토큰을 입력받아 문맥을 표현하는 특징까지 함께 학습할 수 있다. 다만 전처리와 데이터 설계가 없어지는 것은 아니다. 데이터의 양과 품질, 계산 자원, 설명 가능성에 따라 더 단순한 모델이 적합할 때도 있다.

“학습한다”는 말의 의미

컴퓨터가 사람처럼 의식적으로 공부한다는 뜻은 아니다. 정해 둔 목적을 더 잘 달성하도록 모델의 파라미터 등을 조정한다는 뜻이다. 좋은 학습인지 판단하려면 학습에 쓰지 않은 데이터에서도 잘 작동하는지 확인해야 한다.

2. 생성형 AI는 무엇을 하는가에 대한 이름

이미지가 고양이인지 판단하는 모델과, 고양이 이미지를 만들어 내는 모델을 비교해 보자. 둘 다 딥러닝을 사용할 수 있지만 수행하는 일은 다르다. 생성형 AI는 학습한 패턴을 바탕으로 텍스트·이미지·음성 같은 콘텐츠를 생성하는 모델이나 시스템을 가리킨다. [2]

따라서 생성형 AI를 지도학습이나 강화학습과 나란히 놓고 “어느 하나만 선택해야 하는 방법”으로 이해하면 혼동이 생긴다. 이 글에서는 모델 구조, 학습 신호, 수행 과제를 서로 다른 축으로 나누어 보겠다.

같은 모델을 세 가지 관점에서 설명할 수 있다.
구분하는 기준질문예시
모델 구조·방법어떤 계산 구조를 쓰는가?선형 모델, 트리, 깊은 신경망
학습 신호무엇을 기준으로 배우는가?정답 라벨, 데이터 자체의 일부, 행동의 보상
수행 과제무엇을 하는가?분류, 수치 예측, 문장·이미지 생성

LLM과 에이전트도 구분해 두자

LLM(Large Language Model)은 언어를 다루는 대규모 모델이다. 대표적인 생성형 LLM은 앞선 토큰을 바탕으로 다음 토큰을 예측하고, 그 과정을 반복해 문장을 만든다. 토큰은 모델이 처리하는 텍스트 단위이며, 항상 단어 하나와 일치하지는 않는다.

AI 에이전트는 목표를 달성하기 위해 관측하고 행동하는 시스템을 말한다. LLM 기반 에이전트라면 언어 모델에 검색·계산·파일 처리 같은 도구와 실행 제어를 연결할 수 있다. LLM은 모델을, 에이전트는 그 모델 등을 활용해 행동하는 시스템을 설명하는 말이다. 에이전트라고 해서 반드시 강화학습으로 학습한 것은 아니다.

3. 네 가지 학습 방식: 학습 신호는 어디서 올까?

이번에는 신경망의 크기나 구조를 잠시 내려놓고, 모델이 무엇을 기준으로 개선되는지 보자. 지도·비지도·자기지도·강화학습은 이 차이를 이해할 때 유용하다. 다만 완전히 배타적인 네 칸은 아니다. 자기지도학습을 넓은 의미의 비지도학습에 포함하는 분류도 있고, 하나의 모델에 여러 방식을 차례로 적용할 수도 있다.

01지도학습: 입력과 목표값을 함께 준다

메일 내용과 “스팸 / 정상” 표시를 함께 주는 경우다. 여기서 표시가 라벨(label)이다. 모델은 예측값과 라벨의 차이를 줄이도록 학습한다. 범주를 맞히면 분류, 집값처럼 수치를 예측하면 회귀에 해당한다. 라벨은 사람이 직접 달 수도 있고, 실제 거래 가격처럼 이미 기록된 결과에서 얻을 수도 있다. [3]

수치 예측의 작은 예를 생각해 보자. 실제값이 5인데 모델이 3을 예측했다면, 제곱오차는 다음과 같다.

오차 = (예측값 − 실제값)² = (3 − 5)² = 4

여러 사례에서 이런 오차를 계산해 줄이는 방향으로 모델을 조정한다. 이때 사용하는 평가 함수를 손실함수라고 한다. 위 식은 회귀에서 쓸 수 있는 예시이고, 분류에는 보통 다른 손실함수를 쓴다.

주의할 점은 잘못된 라벨도 학습에 영향을 준다는 것이다. 또 기존 답만 외운 모델은 새로운 입력에서 실패할 수 있다. 따라서 학습 데이터의 점수와 처음 보는 데이터의 점수를 구분해야 한다.

02비지도학습: 정답 라벨 없이 구조를 찾는다

학생들의 도서 대출 기록을 받았지만 전공이나 관심 분야 표시는 없다고 하자. 비슷한 책을 빌린 학생들을 묶는 군집화를 적용할 수 있다. 미리 정한 학과를 맞히는 분류와 달리, 데이터의 유사성을 기준으로 묶음을 찾는다.

어떤 묶음에 역사책이 많다고 해서 모델이 스스로 그 집단의 의미를 정확히 이해했다고 볼 수는 없다. “역사에 관심이 많은 학생들”이라는 해석은 결과를 살펴본 사람이 붙일 수 있다. 비지도학습은 군집화 외에도 데이터의 차원을 줄이거나 분포의 구조를 파악하는 데 쓰인다. [2]

라벨이 없다는 것과 목표가 없다는 것은 다르다. 예를 들어 군집화에는 같은 묶음 안의 점들이 가깝도록 만드는 등의 기준이 있다. 어떤 특성과 거리를 선택했는지에 따라 결과도 달라진다.

03자기지도학습: 데이터로 문제와 정답을 만든다

“학생이 도서관에서 책을 읽는다”라는 문장이 있다고 하자. 일부를 가리고 원래 표현을 맞히게 하거나, 앞부분만 보여 주고 뒤에 오는 내용을 예측하게 할 수 있다. 정답이 사라진 것이 아니다. 원래 데이터의 일부를 정답으로 사용하는 것이다. [4]

원래 문장: 학생이 도서관에서 책을 읽는다

가린 부분 맞히기
입력: 학생이 [빈칸] 책을 읽는다
목표: 도서관에서

다음 부분 예측하기
입력: 학생이 도서관에서 책을
목표: 읽는다

원리를 보여 주기 위해 어절 단위로 단순화한 예시다. 실제 언어 모델은 토크나이저가 만든 토큰을 사용한다.

이 방식은 사람이 모든 문장에 별도의 정답을 붙이지 않아도 큰 데이터에서 학습 신호를 만들 수 있다는 장점이 있다. 그렇다고 사람이 전혀 관여하지 않는 것은 아니다. 데이터 선택, 정제, 예측 과제, 모델 구조는 설계해야 한다.

언어뿐 아니라 이미지의 가려진 부분을 복원하거나 서로 다른 변형에서 공통 표현을 배우는 과제도 만들 수 있다. 자동으로 만든 과제를 잘 풀었다고 해서 모든 실제 과제에서 좋은 성능이 보장되는 것은 아니므로, 활용하려는 과제에 맞춰 평가해야 한다.

04강화학습: 행동의 결과를 보고 전략을 바꾼다

도서관 안에서 반납 도서를 옮기는 로봇을 생각해 보자. 로봇은 현재 위치와 주변 상황이라는 상태를 보고 이동이라는 행동을 선택한다. 목적지 도착이나 충돌 여부에 따라 보상을 받고, 더 좋은 결과를 얻는 행동 전략인 정책을 학습한다. [2]

핵심은 지금의 행동이 이후의 상황에 영향을 준다는 점이다. 바로 앞의 보상만 보면 막다른 길로 갈 수도 있다. 그래서 강화학습은 보통 장기적인 누적 보상의 기댓값을 크게 만드는 정책을 찾는다.

지도학습처럼 매 순간 “정답 행동은 오른쪽”이라는 정보를 받을 필요는 없다. 대신 보상이 늦게 주어지면 어떤 행동이 결과에 기여했는지 알아내기 어렵다. 보상 설계를 잘못하면 의도한 목적 대신 점수를 얻는 요령만 학습할 수도 있다.

네 가지 방식의 차이를 학습 신호로 비교하기
방식학습 신호예시확인할 한계
지도학습입력에 대응하는 목표값메일 → 스팸 여부라벨 품질, 새로운 데이터에서의 성능
비지도학습라벨 없이 정한 구조 탐색 기준대출 기록 → 유사 집단찾은 구조의 해석과 유용성
자기지도학습데이터 자체에서 만든 예측 목표문장 일부 → 가린 토큰학습 과제와 실제 활용 과제의 차이
강화학습행동 결과에 따른 보상이동 행동 → 도착·충돌 보상탐색 비용, 지연 보상, 목표와 보상의 불일치

4. 하나의 서비스에도 여러 방식이 들어간다

가상의 대학 도서관 AI 서비스를 설계해 보자. 다음은 가능한 구성 예시다. 실제로 이 방식을 모두 사용해야 한다는 뜻은 아니다.

  1. 문의 분류: “반납 기한”, “좌석 예약”, “자료 검색” 라벨이 달린 문의로 지도학습을 한다.
  2. 관심 분야 탐색: 라벨 없는 대출 기록을 군집화해 이용 경향을 살펴본다.
  3. 언어 표현 학습: 문서에서 다음 토큰을 예측하는 자기지도학습으로 학습한 언어 모델을 활용한다.
  4. 로봇 이동: 시뮬레이터에서 이동 정책을 강화학습으로 학습시키고 안전성을 별도로 검증한다.

이 서비스가 답변 문장을 만들어 낸다면 그 기능은 생성형 AI에 해당한다. 답변 모델이 깊은 신경망이라면 딥러닝을 사용한 것이기도 하다. 검색 도구를 호출하고 결과를 확인하며 다음 행동을 정한다면 에이전트 방식으로 구성할 수 있다. 각각 다른 기준의 설명이므로 함께 성립할 수 있다.

학습과 추론도 구분하자

학습은 데이터를 이용해 모델을 조정하는 과정이고, 추론은 학습된 모델로 결과를 내는 과정이다. 대화 중 앞선 내용을 참고하는 것만으로 파라미터가 업데이트되었다고 볼 수는 없다. 대화 기록을 입력 문맥으로 이용하는 것과 추가 학습은 다르다.

손으로 만들어 보는 자기지도학습 데이터

다음 Python 코드는 별도 라이브러리 없이 실행할 수 있다. 모델을 학습하는 코드는 아니고, 한 문장에서 예측 문제와 정답을 만들어 내는 최소 예시다.

words = "학생이 도서관에서 책을 읽는다".split()

for i in range(1, len(words)):
    context = " ".join(words[:i])
    target = words[i]
    print(f"입력: {context} → 목표: {target}")

# 입력: 학생이 → 목표: 도서관에서
# 입력: 학생이 도서관에서 → 목표: 책을
# 입력: 학생이 도서관에서 책을 → 목표: 읽는다

라벨 파일을 따로 만들지 않았는데 입력과 목표가 생겼다. 자기지도학습의 핵심은 이처럼 학습 신호를 데이터에서 구성하는 데 있다. 실제 언어 모델 학습은 훨씬 많은 토큰을 사용하며, 여러 위치의 예측을 효율적으로 계산한다.

5. 면접에서는 이렇게 설명해 보자

“AI, 머신러닝, 딥러닝의 차이는 무엇인가요?”

AI는 인식이나 추론 같은 지능적 과제를 다루는 넓은 분야입니다. 머신러닝은 그 안에서 데이터로 모델을 학습하는 접근이고, 딥러닝은 여러 층의 신경망으로 표현을 학습하는 머신러닝의 한 분야입니다. 따라서 모든 딥러닝은 머신러닝에 속하지만, 모든 AI가 딥러닝을 쓰는 것은 아닙니다.

꼬리 질문: “그렇다면 딥러닝을 쓰지 않는 편이 좋은 경우는요?”
표 형태의 작은 데이터, 제한된 계산 자원, 설명 가능성이 중요한 조건 등을 검토할 수 있다. 특정 모델이 항상 우월하다고 답하기보다, 후보 모델을 같은 평가 조건에서 비교하겠다고 설명하는 편이 정확하다.

“비지도학습과 자기지도학습은 어떻게 다른가요?”

둘 다 별도로 주어진 정답 라벨 없이 학습할 수 있습니다. 자기지도학습은 데이터의 일부를 가리거나 다음 부분을 예측하도록 해서 데이터 자체에서 명시적인 학습 목표를 만듭니다. 비지도학습은 군집화처럼 라벨 없이 구조를 찾는 더 넓은 맥락에서 쓰이며, 자기지도학습을 그 안에 포함해 분류하기도 합니다.

꼬리 질문: “자기지도학습에는 정답이 없나요?”
정답이 없는 것이 아니라, 사람이 따로 붙인 라벨 대신 데이터에서 얻은 목표값을 사용한다고 답하면 된다.

“생성형 AI는 강화학습인가요?”

서로 다른 기준의 용어입니다. 생성형 AI는 콘텐츠를 생성하는 기능을 가리키고, 강화학습은 보상으로 정책을 개선하는 학습 방식입니다. 하나의 생성 모델에 자기지도 사전학습, 지도학습, 강화학습 등을 서로 다른 단계에서 적용할 수 있습니다. 생성형 AI라는 이유만으로 강화학습을 사용했다고 단정할 수 없습니다.

읽은 내용을 확인하는 세 문제

답을 펼치기 전에 학습 신호가 어디서 오는지 한 문장으로 설명해 보자.

① 사진과 품종 이름을 주고 강아지 품종을 맞히게 했다. 어떤 학습일까?

입력과 정답 라벨이 있으므로 지도학습이다. 딥러닝인지 여부는 이 설명만으로는 모른다. 어떤 모델 구조를 사용했는지 추가로 확인해야 한다.

② 문장의 일부를 가리고 원래 단어를 맞히게 했다. 정답이 있으니 일반적인 지도학습과 같을까?

손실을 계산할 목표값은 있지만, 그 목표를 원래 데이터에서 만들었다는 점에서 자기지도학습으로 설명한다. 정답 라벨을 외부에서 제공받는 경우와 학습 신호의 출처가 다르다.

③ LLM이 검색 도구를 호출했다. 강화학습을 한 에이전트라는 증거일까?

아니다. 도구 호출은 시스템의 동작에 관한 정보다. 규칙으로 연결했을 수도 있고, 도구 호출 예제로 지도학습했을 수도 있다. 강화학습 여부는 실제 학습 과정을 확인해야 한다.

새로운 AI 기술을 만났을 때는 세 질문을 해 보자. 무슨 구조를 쓰는가? 어떤 신호로 학습하는가? 어떤 일을 수행하는가? 이 세 가지에 따로 답할 수 있으면, 여러 용어가 한 문장에 등장해도 각각의 역할을 구분할 수 있다.

참고 자료

정의와 분류는 아래 공식 교육 자료를 참고했다. 도서관 사례, 계산 예제, 코드와 면접 문답은 이해를 돕기 위해 구성했다. 자료마다 학습 방식의 분류 기준은 조금씩 다를 수 있다.

  1. IBM — AI vs. machine learning vs. deep learning vs. neural networks
    AI·머신러닝·신경망·딥러닝의 관계.
  2. Google for Developers — What is Machine Learning?
    머신러닝의 기본 개념과 비지도학습·강화학습·생성형 AI.
  3. Google for Developers — Supervised Learning
    라벨·예측·손실 등 지도학습의 핵심 요소.
  4. Meta AI — Self-supervised learning: The dark matter of intelligence
    데이터에서 예측 목표를 만드는 자기지도학습의 원리.
AI STUDY NOTES · 001 · 기초에서 실무와 면접까지