다음 <보기>의 RNN에 대한 설명으로 가장 적절한 것은?
보기
단순 RNN의 은닉 상태는 \(h_{t} = \tanh(W_{xh}x_{t} + W_{hh}h_{t-1} + b)\) 로 계산된다.
- 입력 벡터의 차원은 100, 은닉 상태의 차원은 50이다.
- 학습에 사용하는 시퀀스의 길이(시점 수)는 T = 30이다.
- 1시점마다 가중치를 재사용하므로 파라미터 수는 T와 무관하며 모두 7,550개이다.
- 2시점마다 별도의 가중치를 학습하므로 파라미터 수는 T = 30을 곱한 226,500개가 된다.
- 3은닉 상태 차원이 입력 차원보다 작으므로 \(W_{hh}\)는 존재하지 않고 \(W_{xh}\)만 학습된다.
- 4T가 커질수록 파라미터 수가 늘어나므로 긴 시퀀스에서는 항상 과대적합이 발생한다.
꿈라CBT