다음 <보기>는 은닉층 활성화 함수만 바꾸어 학습한 결과이다. 이에 대한 진단으로 가장 적절한 것은?
보기
은닉층 15개의 깊은 신경망을 동일한 조건에서 학습하였다.
| 활성화 함수 | 1번째 층의 기울기 크기 | 15번째 층의 기울기 크기 | 학습 오차 |
|---|---|---|---|
| 시그모이드 | \(1.2 \times 10^{-9}\) | 0.31 | 0.48(거의 감소 안 함) |
| tanh | \(4.7 \times 10^{-6}\) | 0.35 | 0.29 |
| ReLU | 0.18 | 0.42 | 0.06 |
- 1출력층에 가까운 15번째 층의 기울기가 세 경우 모두 비슷하므로 학습 능력에 차이가 없으며, 오차 차이는 초기값의 우연 때문이다.
- 2시그모이드·tanh는 작은 기울기가 층마다 곱해져 앞쪽 층이 학습되지 않는 기울기 소실이 생기며, ReLU는 이 문제가 덜하다.
- 3앞쪽 층의 기울기가 작다는 것은 그 층이 이미 최적값에 도달했다는 뜻이므로, 시그모이드는 가장 빠르게 수렴한 우수한 설정이다.
- 4기울기 소실은 활성화 함수와 무관하게 층 수만으로 결정되므로, 세 경우 모두 동일한 정도의 소실이 발생했으며 차이는 측정 오차이다.
꿈라CBT