D2PO: 동적 선호 최적화를 통한 확산 샘플러 최적화
D2PO: Optimizing Diffusion Samplers via Dynamic Preference
D2PO(Dynamic Direct Preference Optimization)는 시간 단계 일정과 분류기 없는 가이드(CFG) 가중치에 따라 확산 샘플링 정책을 최적화하기 위한 프레임워크이다. 기존의 학생-교사 회귀 프레임워크의 한계를 해결하기 위해, D2PO는 샘플러 최적화를 선호 기반 정렬 문제로 재구성하고, 에너지 기반 모델(EBM)을 사용하여 선호 비교를 처리한다. 또한, 동적 선호를 도입하여 샘플링 정책이 학습됨에 따라 선호 샘플이 점진적으로 개선되도록 한다. 실험 결과, D2PO는 감각 품질과 더 잘 정렬되어 기존 회귀 기반 스케줄러보다 일관되게 우수한 성능을 보인다.
D2PO는 확산 샘플러의 감각 품질을 더 충실히 정렬하여 고품질 교사의 잠재력을 극대화한다.
원문 출처
arXiv cs.LG (머신러닝)