Qwen3.6-27B, 8개 로컬 모델 벤치마크에서 성능 우수
Ran a classic(medival europe) fantasy RP/agentic benchmark across 8 local models Qwen3.6-27B held up better than its size suggests
8개의 로컬 모델에 대해 퀘스트 완료, 장면 종료, 아이템/시간 추적, 캐릭터 탐지, 스토리텔링, 초안 작성 등의 벤치마크를 수행한 결과, gemma-4-31B가 87%로 가장 높은 통과율을 기록했으며, Qwen3.6-27B가 82%로 뒤를 이었다. 그 외 모델들은 55-70%의 통과율을 보였다. 특정 모델들이 '퀘스트 완료'에서는 좋은 성능을 보였으나 'NPC 생각'이나 '퀘스트 요약'에서는 저조한 성과를 보이는 경향이 있었다.
원문 출처
r/LocalLLaMA