다음 <보기>는 seq2seq 번역 모델의 문장 길이별 성능이다. 이에 대한 진단과 개선안으로 가장 적절한 것은?
보기
| 입력 문장 길이 | BLEU 점수 | 관찰된 오류 |
|---|---|---|
| 1~10 단어 | 32.1 | 거의 없음 |
| 11~25 단어 | 27.4 | 일부 수식어 누락 |
| 26~50 단어 | 14.8 | 문장 앞부분의 주어·목적어가 자주 빠짐 |
컨텍스트 벡터의 차원을 256 → 1,024로 키우자 26~50 단어 구간의 점수가 14.8 → 16.2로 소폭만 올랐다.
- 1문장이 길어질수록 점수가 떨어지는 것은 긴 문장의 정답 번역이 원래 어렵기 때문이므로 모델 구조와는 무관하며, 학습 데이터를 늘리는 것 외에는 방법이 없다.
- 2컨텍스트 벡터의 차원을 계속 키우면 성능이 비례해 좋아지므로, 4,096 이상으로 늘려 병목을 완전히 해소하는 것이 근본 대책이다.
- 3고정 크기 벡터 하나에 압축하는 구조 탓에 긴 문장의 앞부분이 소실되는 병목이므로, 차원 확대가 아니라 어텐션을 도입해야 한다.
- 4앞부분 정보가 빠지는 것은 디코더의 출력 길이 제한 때문이므로, 디코더가 생성할 수 있는 최대 단어 수만 늘리면 해결된다.
꿈라CBT