시그모이드 활성화 함수를 사용하는 심층 신경망에서 기울기 소실이 발생하는 이유로 가장 적절한 것은?
- 1시그모이드의 도함수 최댓값이 1이므로 층을 거쳐도 기울기의 크기가 그대로 유지되기 때문이다.
- 2도함수 최댓값이 0.25여서 층을 거칠수록 기울기가 지수적으로 0에 수렴하기 때문이다.
- 3ReLU는 모든 구간에서 도함수가 1이므로 기울기 폭주가 전혀 발생하지 않기 때문이다.
- 4기울기 소실은 출력층에 가까운 층에서 먼저 나타나고 입력층 쪽은 영향을 받지 않기 때문이다.
꿈라CBT