필리핀 NLP의 LLM 시대를 위한 방향성
Desiderata for Filipino NLP in the Age of LLMs
필리핀 NLP 분야에서 LLM의 발전에 따라 데이터 수집과 평가 기준의 필요성이 강조되고 있다. Meta의 Llama 3.1, Cohere for AI의 Aya Expanse, AI Singapore의 SEA-LION 등 여러 다국어 LLM이 출시되었으나, 필리핀 언어는 여전히 지원받지 못하고 있다. 필리핀 언어의 IFT 데이터는 부족하며, 현재 가장 좋은 데이터셋은 Aya로, Tagalog에 1.46k 샘플, Cebuano에 4.12M 샘플이 포함되어 있다. 연구자들은 LLM의 후속 훈련을 지원하는 자원과 신뢰할 수 있는 벤치마크를 구축해야 한다.
필리핀 언어에 대한 데이터 부족 문제를 해결하기 위한 연구와 협업이 필수적이다.
원문 출처
Lj V. Miranda