Tencent HY3 모델, 128GB에서 성능 테스트
Tencent-HY3 is the real deal on 128GB!
Tencent의 HY3 모델(295B-A21B MoE)은 DeepSeek v4 Flash와 비슷한 크기에서 더 나은 성능을 보이며, 128GB Macbook M5 Max에서 테스트된 결과, 토큰 생성 속도가 DeepSeek보다 두 배 빠르고 품질도 동등하거나 더 나은 것으로 나타났다. 모델 실행을 위해 llama.cpp의 PR #25395를 사용하여 지원을 추가하고, GPU 메모리 한계를 122GB로 설정해야 했다. 성능 테스트 결과, 빈 컨텍스트에서 528 tokens/sec, 16K 컨텍스트에서 124 tokens/sec의 속도를 기록했다.
HY3 모델은 128GB 환경에서 DeepSeek보다 두 배 빠른 토큰 생성 속도를 제공하여 ML 연구에 유용할 수 있다.
원문 출처
r/LocalLLaMA