Hugging Face
Hugging Face
Hugging Face는 머신러닝 모델·데이터셋·데모를 공유하는 중심 허브이자 오픈소스 ML 생태계의 사실상 표준 플랫폼이다. 수십만 개의 사전학습 모델과 데이터셋을 호스팅하고, Transformers·Datasets·Diffusers 같은 핵심 라이브러리를 통해 모델을 내려받아 쓰거나 학습·파인튜닝하게 한다.
핵심 기능은 모델·데이터셋 허브, 무료 라이브러리(Transformers 등), 브라우저 데모를 올리는 Spaces, 매니지드 추론(Inference Endpoints·서버리스 Inference), 그리고 협업·버전관리(Git 기반)·조직 관리다. 모델 카드·라이선스·평가 정보를 한곳에서 제공해 모델 탐색·비교가 쉽다.
대상은 ML 연구자·엔지니어, 오픈 모델을 찾고 배포하려는 개발자, 그리고 사내 모델 자산을 관리하려는 팀이다. 허브·라이브러리·기본 사용은 무료이고, Pro 구독, 매니지드 Inference Endpoints(인스턴스 시간당 과금), Spaces 유료 하드웨어, Enterprise Hub 등에서 과금된다.
강점은 비교 불가한 모델·데이터셋 생태계와 표준 라이브러리, 강한 커뮤니티, 배포까지의 짧은 경로다. 한계는 매니지드 추론·전용 GPU는 자체 비용이 만만치 않고, 방대한 모델 중 품질·라이선스 검증은 사용자 몫이며, 무료 공개 호스팅 특성상 보안·신뢰성은 개별 자산마다 따져야 한다는 점이다.
AI 개발 관련 브리핑
Amazon EKS에서 NVRx를 이용한 내결함성 분산 훈련
대규모 분산 훈련 작업은 여러 노드에서 수 시간 또는 수일 동안 실행되며, 이 과정에서 네트워크 분할, 메모리 오류, 소프트웨어 예외 등이 발생할 수 있다. NVIDIA Resiliency Extension (NVRx)을 PyTorch Fully Sharded Data Parallel (FSDP) 훈련에 통합하여 비동기 체크포인팅, 프로세스 내 재시작, 작업 내 재시작 기능을 제공한다. Amazon EKS는 관리형 Kubernetes 서비스로, p5.48xlarge 인스턴스에서 NVIDIA H100 GPU를 사용하여 훈련 작업을 수행한다.
NVRx는 PyTorch에 내결함성 기능을 추가하여 훈련 중 발생할 수 있는 오류를 효과적으로 처리할 수 있다.
토스증권의 GPU-native 클러스터 구축 과정
토스증권은 Kubernetes 기반의 GPU 클러스터를 구축하여 GPU-aware 상태에서 GPU-native 상태로 발전시켰다. GPU-aware 상태는 쿠버네티스가 GPU를 자원으로 인식하고 할당하는 것이며, GPU-native 상태는 GPU의 정상 여부를 판단하고, 검증된 노드만 워크로드를 받게 하며, 서비스에 필요한 단위로 자원을 나누고 배치할 수 있는 조건을 갖춘 상태를 의미한다. 이를 위해 NVIDIA 커널 드라이버, NVIDIA Container Toolkit, NVIDIA Device Plugin 등을 활용하여 GPU를 쿠버네티스의 스케줄링 대상으로 만들었다.
GPU-aware에서 GPU-native로 발전함에 따라, 토스증권은 멀티테넌트 GPU 클러스터를 운영하며 서비스에 필요한 자원을 효율적으로 관리할 수 있게 되었다.
토스뱅크의 Next.js Pages Router 유지 결정
토스뱅크 프론트엔드 개발자는 Next.js의 Pages Router를 사용하고 있으며, App Router와 React Server Components(RSC)를 검토했으나, 서비스 안정성을 유지하는 비용이 이득보다 크다고 판단하여 도입하지 않기로 했다. App Router는 데이터를 가져오는 컴포넌트를 나누고 Suspense로 감싸는 기능이 있지만, 화면 흔들림 문제와 경계 구분의 복잡성으로 인해 도입을 포기했다. 또한, App Router의 usePathname()는 경로 패턴 정보를 제공하지 않아 로깅 기능이 부족하다는 점도 고려됐다.
App Router의 usePathname()는 /blog/[slug]와 같은 경로 패턴을 제공하지 않아, 기존 로깅 기능을 유지하기 위한 별도 패키지 개발이 필요하다.
2x R9700과 64 GB DDR5를 갖춘 시스템의 Qwen 3.8 성능
사용자는 2개의 AMD Radeon AI PRO R9700 32 GB와 64 GB DDR5 RAM을 장착한 시스템에서 Qwen 3.8 27b FP8 및 Flash Next의 성능을 테스트하였다. 이 시스템은 Ryzen 7500F 프로세서와 Asus ProArt Creator X870E 메인보드를 기반으로 하며, SATA SSD에서 Qwen 3.8 Flash Next를 사용할 때 성능이 나쁘지 않음을 발견하였다. 전체 시스템 비용은 약 4,000 유로로 RTX 5090보다 저렴하다.
Qwen 3.8 27b의 성능을 활용하여 깊이 있는 연구, 요약, 이미지 생성, 경량 코딩 및 데이터 분석을 수행할 수 있다.