오픈 웨이트 모델 성능 비교 및 테스트 방법
직접 돌려본 오픈 웨이트 모델, 어떻게 선택해야 할까?
LLM 제공사의 API 기반 서비스는 개발자가 생성형 AI 애플리케이션을 시작할 때 간단한 방법이지만, 보안 요구가 높은 환경에서는 오픈 웨이트 모델을 직접 구동하는 것이 필요할 수 있다. 테스트는 엔비디아 RTX PRO 6000 GPU 4장을 사용하여 gpt-oss-20b, gpt-oss-120b, Qwen3.8-27B, Gemma4:31b, Mistral-Small-4-119B 모델을 비교하였다. 첫 번째 테스트에서 gpt-oss-20b는 약 250 tokens/s, gpt-oss-120b는 약 184 tokens/s를 기록했으며, Qwen3.8-27B는 약 26 tokens/s, Gemma4:31b는 약 23 tokens/s로 나타났다.
gpt-oss-20b는 단일 요청에서 약 250 tokens/s를 출력하여 성능이 우수함을 보여준다.
원문 출처
요즘IT (Yozm IT)