트랜스포머 디코더 동작 원리: 번역 예제로 배우는 단어 생성 과정과 교사 강요 학습법
트랜스포머 디코더가 번역에서 시작 토큰부터 단어를 하나씩 만들어 가는 과정과, 학습할 때는 정답 문장을 넣어 주는 교사 강요 방식의 차이를 정리했다. 마스크 self-attention이 왜 필요한지도 함께 짚는다.
핵심 내용 읽기 →AI TOPIC
교사강요 관련 핵심 뉴스와 활용 인사이트 2편을 최신순으로 모았습니다.

트랜스포머 디코더가 번역에서 시작 토큰부터 단어를 하나씩 만들어 가는 과정과, 학습할 때는 정답 문장을 넣어 주는 교사 강요 방식의 차이를 정리했다. 마스크 self-attention이 왜 필요한지도 함께 짚는다.
핵심 내용 읽기 →
순차 데이터를 다루는 RNN은 이전 출력을 다음 입력으로 쓰는데, 모델이 틀린 단어를 예측하면 오류가 누적된다. 교사 강요는 예측 대신 실제 정답을 다음 시점 은닉층에 직접 넣어 학습을 안정시키는 기법이다. 파라미터 공유와 함께 RNN 구조를 짚는다.
핵심 내용 읽기 →