다음 <보기>는 동일한 신경망을 서로 다른 옵티마이저로 학습한 결과이다. 이에 대한 해석으로 가장 적절한 것은?
보기
| 옵티마이저 | 초기 100 에포크 | 후반 400 에포크 | 최종 오차 |
|---|---|---|---|
| SGD | 느리게 감소, 좌우로 진동 | 계속 완만히 감소 | 0.19 |
| Adagrad | 빠르게 감소 | 거의 변화 없음(갱신량이 매우 작음) | 0.15 |
| Adam | 빠르게 감소 | 완만히 계속 감소 | 0.07 |
- 1Adagrad가 후반에 정체된 것은 이미 전역 최솟값에 도달했기 때문이므로, 세 옵티마이저 중 가장 효율적으로 수렴한 것이다.
- 2SGD가 좌우로 진동하는 것은 데이터에 잡음이 많다는 뜻이므로, 데이터를 정제하면 진동이 사라지고 Adam과 같은 성능을 얻는다.
- 3옵티마이저는 수렴 속도만 다를 뿐 충분한 에포크를 주면 모두 같은 지점에 도달하므로, 표의 최종 오차 차이는 학습을 일찍 끝냈기 때문이다.
- 4Adagrad는 기울기 제곱을 계속 누적해 갱신량이 0에 수렴해 정체되며, Adam은 지수이동평균과 모멘텀으로 이를 해결한다.
꿈라CBT