대규모 언어 모델에서 하이퍼네트워크 기반 지식 주입의 스케일링 법칙
Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models
대규모 언어 모델(LLM)에 사실적 지식을 신뢰성 있게 주입하는 것은 여전히 해결되지 않은 과제이다. 하이퍼네트워크는 대규모 지식 주입에 유망한 솔루션을 제공하며, 본 연구에서는 하이퍼네트워크를 사용하여 훈련 시 지식을 주입하는 방법을 탐구한다. 연구팀은 하이퍼네트워크의 깊이, 너비 및 대상 네트워크 크기에 따라 손실, 추론 정확도 및 분포 외(OOD) 일반화가 어떻게 변화하는지를 조사하였다. 또한, MegaWikiQA라는 대규모 데이터셋을 구성하여 39개 도메인에서 수천만 개의 다중 홉 질문-답변 예제를 포함하였다. 결과적으로 하이퍼네트워크 기반 주입은 모든 아키텍처 축에서 예측 가능한 전력 법칙 스케일링을 보였으며, OOD 일반화에서 더 높은 스케일에서도 신뢰성을 나타냈다.
하이퍼네트워크는 훈련 시 적응을 위한 원칙적이고 확장 가능한 기초를 제공한다.
원문 출처
arXiv cs.CL (계산언어학·NLP)