1800년대 텍스트로 LLM 훈련, 160GB 데이터셋 사용
Training an LLM from scratch on 1800's texts (160GB dataset)
한 사용자가 1800년대 런던 데이터를 기반으로 언어 모델을 사전 훈련하기 시작했으며, 최근 40B 토큰, 160GB의 1800-1875년 영어 데이터를 포함하는 최대 데이터셋을 완성했다. 현재 2B 파라미터 모델을 훈련할 예정이며, 500M 파라미터의 평가 모델을 5B 토큰 샘플로 훈련하였다. 이 모델은 1800년대의 Q&A 쌍으로 미세 조정되어 역사적 인물, 장소, 사건에 대한 질문에 답할 수 있다.
원문 출처
r/LocalLLaMA