CHAPTER 6 학습 관련 기술들

학습 가속 기지 입구 도로시와 지니, 그리고 토토가 딥러닝 성능을 폭발적으로 증가시키는 비법이 담긴 거대한 ‘학습 가속 기지’ 입구에 도착해 신나서 진입하고 있어요.

도로시의 새로운 모험 다짐

  • 도로시: “와! 드디어 6장 ‘학습 관련 기술들’ 기지에 왔어! 이번 기지에서는 모델이 더 똑똑하고 빠르게 공부할 수 있는 최적화와 과적합 방지 도구들을 배운대!”
  • 지니: “정답이야, 도로시! 단순히 오차를 계산하는 것(5장)에서 나아가, 더 효율적으로 최적의 파라미터를 찾는 가속 페달과 브레이크 같은 실전 기술들이란다!”
  • 토토: “왈왈! (꼬리를 흔들며) 가속 기어 작동 완료다 멍!”

이번 장에서는 신경망 학습의 핵심 개념들을 만나봅니다. 이번 장에서 다룰 주제는 가중치 매개변수의 최적값을 탐색하는 최적화 방법, 가중치 매개변수 초깃값, 하이퍼파라미터 설정 방법 등, 모두가 신경망 학습에서 중요한 주제입니다. 오버피팅의 대응책인 가중치 감소와 드롭아웃 등의 정규화 방법도 간략히 설명하고 구현해봅니다. 마지막으로 최근 많은 연구에서 사용하는 배치 정규화도 짧게 알아봅니다. 이번 장에서 설명하는 기법을 이용하면 신경망(딥러닝) 학습의 효율과 정확도를 높일 수 있습니다. 그럼 본론으로 들어가 볼까요?


6장 세부 목차

6장 학습 로드맵 지니가 칠판 앞에 서서 최적화 기법(SGD, Momentum, AdaGrad, Adam), 가중치 초깃값(Xavier, He), 배치 정규화, 드롭아웃 등 6장에서 배울 핵심 주제들을 도로시에게 브리핑하고 있어요.

지니의 학습 기술 로드맵 소개

  • 지니: “도로시, 이번 6장은 크게 네 가지 코스로 구성되어 있어. 첫째는 매개변수를 갱신하는 최적화, 둘째는 학습의 시작점을 정하는 초깃값, 셋째는 층마다 입력을 정돈해주는 배치 정규화, 마지막으로 과적합을 방지하는 정규화 기술들이야.”
  • 도로시: “와! 칠판에 그려진 대로 하나씩 마스터해가면 딥러닝 전문가가 될 수 있겠다! 어서 출발하자!”

학습자의 학습 흐름과 흥미를 이끌기 위해 총 6개의 서브 챕터로 나누어 모험을 진행합니다. 아래 링크를 클릭해 순서대로 모험에 합류해 보세요!

06.1 매개변수 갱신

손실 함수의 출력을 최소화하기 위한 SGD의 비등방성 함수 연산 한계를 학습하고, 이를 개선한 가중치 최적화 알고리즘인 Momentum, AdaGrad, Adam의 작동 수식과 코드를 비교·이해합니다.

06.2 가중치의 초깃값

가중치가 0이나 고른 상수로 초기화되었을 때의 역전파 갱신 한계를 분석하고, 활성화 함수 종류(시그모이드, ReLU)에 맞춰 은닉층 활성화값을 균일하게 분포시키는 Xavier 초깃값과 He 초깃값의 효과를 확인합니다.

06.3 배치 정규화

신경망 층별 입력 데이터 분포가 평균 0, 분산 1이 되도록 정규화하여 학습 속도를 극적으로 높이고 초깃값 민감도를 제어하는 배치 정규화(Batch Normalization) 계층 유도 및 학습 강건성을 실현합니다.

06.4 바른 학습을 위해

과도한 표현력이나 학습 데이터 부족으로 인해 발생하는 오버피팅(Overfitting) 문제를 재현해 보고, 이를 정규화(Regularization)하는 가중치 감소(L2 penalty) 및 무작위 뉴런 차단 방식인 드롭아웃(Dropout)의 위력을 검증합니다.

06.5 적절한 하이퍼파라미터 값 찾기

학습률, 가중치 감소 계수 등 사람이 조율해야 하는 하이퍼파라미터를 최적화하기 위해, 검증 데이터(Validation data)를 구축하고 로그 스케일 범위에서 무작위 샘플링을 진행하며 최적 범위를 수축해 나가는 실무 최적화 기법을 마스터합니다.

06.6 정리

6장에서 설명한 매개변수 갱신 최적화 도구, 가중치 초깃값 규칙, 배치 정규화 효과 및 하이퍼파라미터 탐색 등 딥러닝 실전 기법들의 요점을 정리합니다.


🌟 6장을 마치며: 학습 관련 기술들

6장에서는 단순히 역전파를 흘려 매개변수를 조율하는 기초 단계에서 진일보하여, 가파른 딥러닝 아키텍처 학습을 안전하고 정밀하게 제어하기 위한 실전용 최적화·정규화 기술셋을 완비했습니다.

  • 최적화 도구(Optimizer)의 다양화: 기울기 방향으로 미끄러지는 SGD의 비효율성을 해소하고자 관성을 부여하는 Momentum, 학습률을 개별 원소 속도에 맞춰 축소하는 AdaGrad, 그리고 이들의 영리한 융합인 Adam 등을 구현하고 MNIST 성능 비교를 마쳤습니다.
  • 시작점의 과학: 모든 뉴런이 동일한 피드백을 받아 대칭 붕괴가 일어나는 오류를 방지하기 위해, 시그모이드에는 Xavier 초깃값, ReLU에는 He 초깃값을 사용하는 은닉 활성화 분포의 메커니즘을 밝혀냈습니다.
  • 능동적 제어(BatchNorm): 초깃값 선택의 장애를 덜고 학습 연산 속도를 획기적으로 개선하며 오버피팅까지 억제하는 배치 정규화(Batch Normalization)를 레이어 중간에 능동적으로 이식했습니다.
  • 일반화와 오버피팅 제어: 훈련 데이터 극단 최적화로 시험 데이터 정확도가 정체되는 오버피팅을 억제하고자 L2 가중치 감소 페널티 기법과 훈련 시 무작위 뉴런 연결을 탈락시켜 앙상블 효과를 주는 드롭아웃(Dropout)을 완성했습니다.
  • 하이퍼파라미터 서치: 테스트셋 오염 없이 올바른 성능 검증을 하도록 검증 데이터(Validation set)를 격리 구축하고, 로그 스케일 랜덤 검색을 통해 최적 하이퍼파라미터 탐색 범위를 점진적으로 좁혀 나가는 개발 가이드라인을 정립했습니다.

다양한 수치 안정화 및 최적화 노하우를 갖추었으므로, 이제 2차원 공간 기하학 데이터인 이미지 인식을 비약적으로 성공시키는 딥러닝의 아이콘, 7장 합성곱 신경망(CNN)에 도전하여 공간 보존적 특징 학습의 실체와 완전한 구현을 달성해 보겠습니다!

7장 CNN 성으로 향하는 길 6장 기지에서의 모든 학습 훈련을 완수한 삼총사가 저 멀리 보이는 은하수 속 ‘7장 합성곱 신경망 (CNN)’ 안내 표지판을 보며 발걸음을 재촉하고 있어요.

도로시의 다음 도전 다짐

  • 도로시: “지니! 최적화와 규제 장치까지 장착했으니, 이제 대망의 이미지 인식 치트키인 CNN(합성곱 신경망) 성으로 갈 차례네!”
  • 지니: “그래! 6장에서 배운 모든 학습 가속 기술들이 7장 CNN 모델을 안정적으로 학습시키는 데 큰 밑바탕이 되어줄 거야!”
  • 토토: “왈왈! (표지판을 가리키며) 7장으로 고고싱이다 멍!”
서브목차