본문으로 건너뛰기
v

vLLM

vLLM Project

AI 개발무료이번 주 23회 언급

vLLM은 LLM을 고처리량·저지연으로 서빙하기 위한 오픈소스 추론 엔진이다. UC 버클리에서 시작됐으며, 핵심 혁신인 PagedAttention으로 KV 캐시 메모리를 페이지 단위로 관리해 메모리 낭비를 줄이고 동시 요청 처리량을 크게 끌어올린다. 자체 인프라에서 오픈 웨이트 모델을 효율적으로 운영하려는 팀의 사실상 표준 중 하나다.

핵심 기능은 연속 배칭(continuous batching), PagedAttention, 텐서·파이프라인 병렬, 양자화(AWQ·GPTQ·FP8 등), 스트리밍, 그리고 OpenAI 호환 API 서버다. Hugging Face의 다양한 모델 아키텍처를 폭넓게 지원해 모델을 거의 그대로 올려 서빙할 수 있다.

대상은 LLM을 셀프호스팅으로 운영하는 ML 플랫폼·인프라 엔지니어, 비용·데이터 주권·지연을 직접 통제하려는 조직이다. 소프트웨어 자체는 무료 오픈소스이며 비용은 GPU 인프라에서 발생한다.

강점은 동급 최고 수준의 처리량·메모리 효율, OpenAI 호환으로 인한 손쉬운 마이그레이션, 활발한 커뮤니티와 빠른 신모델 지원이다. 한계는 GPU·운영 전문성이 필요하고, 멀티노드 대규모 분산이나 특정 하드웨어·신규 아키텍처에서 튜닝이 까다로울 수 있으며, 매니지드 API의 운영 편의성은 직접 구축으로 떠안아야 한다는 점이다.

NewsAI 개발·

Amazon EKS에서 NVRx를 이용한 내결함성 분산 훈련

대규모 분산 훈련 작업은 여러 노드에서 수 시간 또는 수일 동안 실행되며, 이 과정에서 네트워크 분할, 메모리 오류, 소프트웨어 예외 등이 발생할 수 있다. NVIDIA Resiliency Extension (NVRx)을 PyTorch Fully Sharded Data Parallel (FSDP) 훈련에 통합하여 비동기 체크포인팅, 프로세스 내 재시작, 작업 내 재시작 기능을 제공한다. Amazon EKS는 관리형 Kubernetes 서비스로, p5.48xlarge 인스턴스에서 NVIDIA H100 GPU를 사용하여 훈련 작업을 수행한다.

NVRx는 PyTorch에 내결함성 기능을 추가하여 훈련 중 발생할 수 있는 오류를 효과적으로 처리할 수 있다.

AWS Machine Learning Blog원문
NewsAI 개발·

토스증권의 GPU-native 클러스터 구축 과정

토스증권은 Kubernetes 기반의 GPU 클러스터를 구축하여 GPU-aware 상태에서 GPU-native 상태로 발전시켰다. GPU-aware 상태는 쿠버네티스가 GPU를 자원으로 인식하고 할당하는 것이며, GPU-native 상태는 GPU의 정상 여부를 판단하고, 검증된 노드만 워크로드를 받게 하며, 서비스에 필요한 단위로 자원을 나누고 배치할 수 있는 조건을 갖춘 상태를 의미한다. 이를 위해 NVIDIA 커널 드라이버, NVIDIA Container Toolkit, NVIDIA Device Plugin 등을 활용하여 GPU를 쿠버네티스의 스케줄링 대상으로 만들었다.

GPU-aware에서 GPU-native로 발전함에 따라, 토스증권은 멀티테넌트 GPU 클러스터를 운영하며 서비스에 필요한 자원을 효율적으로 관리할 수 있게 되었다.

토스 테크 (Toss Tech)원문
NewsAI 개발·

토스뱅크의 Next.js Pages Router 유지 결정

토스뱅크 프론트엔드 개발자는 Next.js의 Pages Router를 사용하고 있으며, App Router와 React Server Components(RSC)를 검토했으나, 서비스 안정성을 유지하는 비용이 이득보다 크다고 판단하여 도입하지 않기로 했다. App Router는 데이터를 가져오는 컴포넌트를 나누고 Suspense로 감싸는 기능이 있지만, 화면 흔들림 문제와 경계 구분의 복잡성으로 인해 도입을 포기했다. 또한, App Router의 usePathname()는 경로 패턴 정보를 제공하지 않아 로깅 기능이 부족하다는 점도 고려됐다.

App Router의 usePathname()는 /blog/[slug]와 같은 경로 패턴을 제공하지 않아, 기존 로깅 기능을 유지하기 위한 별도 패키지 개발이 필요하다.

토스 테크 (Toss Tech)원문
NewsAI 개발·

2x R9700과 64 GB DDR5를 갖춘 시스템의 Qwen 3.8 성능

사용자는 2개의 AMD Radeon AI PRO R9700 32 GB와 64 GB DDR5 RAM을 장착한 시스템에서 Qwen 3.8 27b FP8 및 Flash Next의 성능을 테스트하였다. 이 시스템은 Ryzen 7500F 프로세서와 Asus ProArt Creator X870E 메인보드를 기반으로 하며, SATA SSD에서 Qwen 3.8 Flash Next를 사용할 때 성능이 나쁘지 않음을 발견하였다. 전체 시스템 비용은 약 4,000 유로로 RTX 5090보다 저렴하다.

Qwen 3.8 27b의 성능을 활용하여 깊이 있는 연구, 요약, 이미지 생성, 경량 코딩 및 데이터 분석을 수행할 수 있다.

r/LocalLLaMA원문

관련 Q&A