본문으로 건너뛰기
채택됨중급AI 에이전트

Hermes 모델을 직접 서빙하려면 무엇을 알아야 하나요?

Hermes 계열 오픈 가중치 모델을 사내 인프라에서 직접 서빙하려고 합니다. GPU 메모리 요건·양자화·추론 서버(vLLM/TGI 등) 중 무엇부터 확인해야 할지, 그리고 상용 이용 시 라이선스 조건도 함께 알고 싶습니다.

답변 1

  • 채택된 답변

    먼저 모델 크기와 베이스를 확인하세요. 현행 HuggingFace 카드 기준으로 405B와 70B는 Meta-Llama-3.1 기반(라이선스 llama3)이고, 14B는 Qwen3-14B 기반(apache-2.0)입니다. 라이선스가 다르므로 상업 배포 전에 반드시 확인이 필요합니다. 가중치는 공식 FP8과 커뮤니티 GGUF가 제공됩니다.

    서빙 시 tool-use 파싱 파서를 맞춰야 합니다. vLLM은 --tool-call-parser hermes를 쓰며, 예를 들어 vllm serve "NousResearch/Hermes-4-405B" 형태로 띄웁니다. SGLang은 qwen25 파서를 사용합니다. tool-use는 XML 태그 포맷이라 시스템 프롬프트의 <tools>...</tools>로 스키마를 선언하고, 모델이 <tool_call>로 호출, 결과를 <tool_response>로 돌려줍니다.

    샘플링은 temperature 0.6, top_p 0.95, top_k 20이 권장값입니다. 하이브리드 추론은 <think>...</think> 세그먼트로 사고를 방출하며 챗 템플릿의 thinking=True나 시스템 프롬프트로 켤 수 있습니다. 참고로 Hermes Agent 프레임워크 위에서 모델을 쓸 경우, 모델은 최소 64,000 토큰 컨텍스트가 필요합니다.