LLM 아키텍처 갤러리 및 주목 변형 정리
A Visual Guide to Attention Variants in Modern LLMs
DeepSeek V4의 출시가 지연됨에 따라, 저자는 지난 몇 년간 다룬 다양한 LLM 아키텍처를 정리하여 LLM 아키텍처 갤러리를 만들었다. 현재 45개의 항목이 포함되어 있으며, 각 항목은 시각적 모델 카드와 함께 제공된다. 갤러리는 정기적으로 업데이트될 예정이며, 포스터 버전도 제공된다. Multi-Head Attention (MHA) 개념이 설명되며, GPT-2, OLMo 2 7B, OLMo 3 7B와 같은 아키텍처가 예시로 언급된다. 주목(attention) 메커니즘은 RNN의 한계를 극복하고 입력 시퀀스의 모든 토큰에 접근할 수 있게 해준다.
원문 출처
Ahead of AI (Sebastian Raschka)