Transformer 대안에 대한 연구 요약
The Sequence Knowledge #878: Beyond Transformer: What We Learned
TheSequence는 Transformer 대안에 대한 시리즈를 요약했다. Transformer는 self-attention 덕분에 성공했지만, 시퀀스 길이에 따라 계산 비용이 O(n²)로 증가하고 메모리 사용량이 O(n)으로 늘어난다. RNN, SSM, 텍스트 확산, 액체 및 연속 시간 모델 등 네 가지 대안이 제시되었으며, 이들은 각각 고유한 장점과 도전 과제를 가지고 있다. 특히, RNN은 고정 크기 상태로 O(n) 계산을 제공하고, SSM은 선형 스케일링과 긴 컨텍스트 처리를 가능하게 한다. 그러나 현재까지 attention을 대체할 만한 모델은 없다.
원문 출처
TheSequence (Jesus Rodriguez)