STEP 13 · TRANSFORMER
Transformer
Transformer Block 내부에서 정보가 흐르는 방식
PLANNED
WHY THIS MATTERS
왜 Transformer가 중요한가?
Transformer는 현대 LLM의 핵심 구조입니다. Token과 Embedding을 입력으로 받아 Self Attention으로 토큰 간 관계를 계산하고, Residual과 Feed Forward를 반복하면서 표현을 정교하게 바꿉니다.
왜 RNN 대신 Transformer가 주류가 되었을까?
Attention은 어떤 토큰을 중요하게 볼까?
LLM의 한 Block 안에서는 무슨 일이 일어날까?
WHERE THIS IS USED
현대 LLM의 핵심 아키텍처GPT · 번역 · 요약 · 코드 생성 · 멀티모달
01
Token Input
문장이 Token으로 분리됨
↓
02
Embedding
Token을 Vector로 변환
↓
03
Self Attention
각 Token이 다른 Token을 얼마나 참고할지 계산
↓
04
Add & Norm
Residual Connection과 정규화
↓
05
Feed Forward
각 Token 표현을 MLP로 변환
↓
06
Add & Norm
다시 Residual + 정규화
↓
07
Next Block / Output
다음 Block 또는 출력층으로 전달
Transformer 선수 개념
Vector & MatrixLinear 계산의 기반
Token & Embedding문장을 숫자 Vector로 변환
SoftmaxAttention Score를 비율로 변환
Self AttentionToken 간 관계 계산
Residual원래 정보를 유지하며 계산을 더함
Feed Forward각 Token 표현을 비선형 변환