Qwengram-0.8B: Qwen3.8 Flash-Next의 n-gram 메모리 적용으로 5.05% 낮춘 검증 혼란도
Qwengram-0.8B: I transferred Qwen3.8 Flash-Next’s n-gram memory into Qwen3.5-0.8B — 5.05% lower validation perplexity
Qwengram-0.8B 모델은 Qwen3.8 Flash-Next의 사전 훈련된 PLE n-gram 메모리를 활용하여 Qwen3.5-0.8B 모델의 성능을 개선했다. 이 모델은 15M 토큰으로 훈련된 리더를 사용하여 NLL 2.853786, PPL 17.3534를 기록하며, 기존 Qwen3.5-0.8B 모델보다 5.05% 낮은 검증 혼란도를 보였다. 모델은 Qwen3.5-0.8B 백본과 51B 파라미터의 PLE 메모리를 동결한 상태에서 훈련되었으며, 동적 게이트를 통해 메모리 주입을 조절한다.
Qwengram-0.8B는 5.05% 낮은 검증 혼란도를 기록하여, n-gram 메모리의 효과를 입증했다.
원문 출처
r/LocalLLaMA