CaRE: Masked Diffusion Language Models의 평가 프로토콜
CaRE Compute-aware Remasking Evaluation Protocol for Masked Diffusion Language Models
Masked diffusion language models(MDLMs)의 평가 기준이 발전 속도를 해석하는 데 부족함을 드러내고 있다. CaRE는 MDLM 리마스킹 전략을 감사하는 컴퓨트 인식 평가 프레임워크로, 실제 함수 평가 수(NFE)를 표준화하고, 다중 메트릭 보고를 강제하며, 확률성을 명시적으로 제어한다. 7개의 리마스킹 전략을 LLaDA-8B-Base와 Dream-7B-Base에서 4개의 확률성 수준과 3개의 단계 예산으로 적용한 결과, 온도가 MAUVE 변동의 대부분을 설명하고, 컴퓨트 일치 비교가 여러 발표된 전략 순위를 뒤집으며, 고엔트로피 리마스킹이 MAUVE를 감소시키는 경향이 있음을 보여준다. 이 평가 프로토콜과 리더보드는 향후 리마스킹 주장의 재현성과 비교 가능성을 보장하기 위해 공개된다.
CaRE는 MDLM 리마스킹 전략의 평가를 표준화하여, 알고리즘 개선과 평가 아티팩트를 구분할 수 있는 방법을 제공한다.
원문 출처
arXiv cs.AI (인공지능)