포스트 트레이닝을 고려하라: 하드웨어 활용 방안
"What should I do?" - consider post-training
포스트 트레이닝은 모델을 개선하는 방법으로, 4년간 '포스트 트레이닝 서비스'를 제공해온 경험을 바탕으로 제안된다. 예를 들어, BERT 스타일 모델을 SFT 방식으로 조정하여 악성 소비자 식별, 기업 스파이 활동 태깅, 소비자 특성 프로파일링 등의 실제 프로젝트를 수행해왔다. 포스트 트레이닝은 품질과 속도가 중요하며, 데이터 믹스와 모델 조합에 따라 성능이 달라진다. RFT(강화 학습 미세 조정)는 현재 개발 중이며, 이 과정에서 빠른 추론과 보상 시스템이 필요하다. OpenAI의 SFT API 종료와 비싼 RFT API로 인해, 커스텀 포스트 트레이닝은 오픈 모델의 영역에서 수익을 창출할 수 있는 기회가 된다.
원문 출처
r/LocalLLaMA