트랜스포머 교차 어텐션 원리 정리: 디코더가 인코더 출력을 받아들이는 구조와 마스킹이 없는 이유
트랜스포머 디코더의 두 번째 어텐션 층인 인코더-디코더 어텐션이 두 개의 행렬을 어떻게 받아 번역 정보를 옮기는지, 쿼리와 키·값의 출처가 갈리는 이유와 마스킹이 필요 없는 까닭까지 차근차근 짚었다.
핵심 내용 읽기 →AI TOPIC
디코더 관련 핵심 뉴스와 활용 인사이트 3편을 최신순으로 모았습니다.

트랜스포머 디코더의 두 번째 어텐션 층인 인코더-디코더 어텐션이 두 개의 행렬을 어떻게 받아 번역 정보를 옮기는지, 쿼리와 키·값의 출처가 갈리는 이유와 마스킹이 필요 없는 까닭까지 차근차근 짚었다.
핵심 내용 읽기 →
트랜스포머 디코더의 첫 어텐션 층인 마스크드 셀프 어텐션을 강의 내용으로 정리했다. 학습할 때 정답 문장을 한 번에 넣어 병렬 계산하면서도 각 위치가 뒤에 올 단어를 보지 못하게 가중치를 0으로 만드는 방식과 그 행렬 표현을 설명한다.
핵심 내용 읽기 →
트랜스포머 디코더가 번역에서 시작 토큰부터 단어를 하나씩 만들어 가는 과정과, 학습할 때는 정답 문장을 넣어 주는 교사 강요 방식의 차이를 정리했다. 마스크 self-attention이 왜 필요한지도 함께 짚는다.
핵심 내용 읽기 →