빅데이터분석기사 필기 · 9회 변형(엑셀) · 어려움 난이도 · 42번

Q.4220249어려움 변형빅데이터 모델링

다음 <보기>는 seq2seq 번역 모델의 문장 길이별 성능이다. 이에 대한 진단과 개선안으로 가장 적절한 것은?

보기
입력 문장 길이BLEU 점수관찰된 오류
1~10 단어32.1거의 없음
11~25 단어27.4일부 수식어 누락
26~50 단어14.8문장 앞부분의 주어·목적어가 자주 빠짐

컨텍스트 벡터의 차원을 256 → 1,024로 키우자 26~50 단어 구간의 점수가 14.8 → 16.2로 소폭만 올랐다.

  • 1문장이 길어질수록 점수가 떨어지는 것은 긴 문장의 정답 번역이 원래 어렵기 때문이므로 모델 구조와는 무관하며, 학습 데이터를 늘리는 것 외에는 방법이 없다.
  • 2컨텍스트 벡터의 차원을 계속 키우면 성능이 비례해 좋아지므로, 4,096 이상으로 늘려 병목을 완전히 해소하는 것이 근본 대책이다.
  • 3고정 크기 벡터 하나에 압축하는 구조 탓에 긴 문장의 앞부분이 소실되는 병목이므로, 차원 확대가 아니라 어텐션을 도입해야 한다.
  • 4앞부분 정보가 빠지는 것은 디코더의 출력 길이 제한 때문이므로, 디코더가 생성할 수 있는 최대 단어 수만 늘리면 해결된다.

정답: 3 · 고정 크기 벡터 하나에 압축하는 구조 탓에 긴 문장의 앞부분이 소실되는 병목이므로, 차원 확대가 아니라 어텐션을 도입해야 한다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기