Ollama
Ollama
Ollama는 로컬 머신에서 오픈 웨이트 LLM을 손쉽게 내려받아 실행하게 해주는 도구다. 모델 가중치·설정·프롬프트 템플릿을 하나의 패키지로 묶어 ollama run 한 줄로 구동하게 만들어, 로컬 LLM의 진입 장벽을 크게 낮췄다. macOS·Linux·Windows를 지원한다.
핵심 기능은 모델 라이브러리에서의 원클릭 pull/run, GGUF 양자화 모델 실행, Modelfile을 통한 커스텀 모델 정의, OpenAI 호환 로컬 API 서버, 그리고 CPU/GPU·Apple Silicon 자동 활용이다. 데스크톱 앱과 CLI를 모두 제공하며 멀티모달·임베딩 모델도 다룬다.
대상은 프라이버시·오프라인·비용 이유로 LLM을 로컬에서 돌리려는 개발자·연구자, 그리고 로컬 모델을 앱에 붙이려는 사람이다. 소프트웨어는 무료 오픈소스이며 비용은 자신의 하드웨어뿐이다. 별도 클라우드 호스팅 옵션도 등장하고 있다.
강점은 압도적으로 간단한 설치·실행 경험, OpenAI 호환 API로 기존 코드에 쉽게 연결, 데이터가 로컬에 머무는 프라이버시다. 한계는 로컬 하드웨어(특히 VRAM)에 성능·모델 크기가 묶여 대형 모델은 양자화·속도 타협이 필요하고, 고동시성 프로덕션 서빙은 vLLM 같은 전용 엔진 대비 처리량이 떨어진다는 점이다.
AI 개발 관련 브리핑
Amazon EKS에서 NVRx를 이용한 내결함성 분산 훈련
대규모 분산 훈련 작업은 여러 노드에서 수 시간 또는 수일 동안 실행되며, 이 과정에서 네트워크 분할, 메모리 오류, 소프트웨어 예외 등이 발생할 수 있다. NVIDIA Resiliency Extension (NVRx)을 PyTorch Fully Sharded Data Parallel (FSDP) 훈련에 통합하여 비동기 체크포인팅, 프로세스 내 재시작, 작업 내 재시작 기능을 제공한다. Amazon EKS는 관리형 Kubernetes 서비스로, p5.48xlarge 인스턴스에서 NVIDIA H100 GPU를 사용하여 훈련 작업을 수행한다.
NVRx는 PyTorch에 내결함성 기능을 추가하여 훈련 중 발생할 수 있는 오류를 효과적으로 처리할 수 있다.
토스증권의 GPU-native 클러스터 구축 과정
토스증권은 Kubernetes 기반의 GPU 클러스터를 구축하여 GPU-aware 상태에서 GPU-native 상태로 발전시켰다. GPU-aware 상태는 쿠버네티스가 GPU를 자원으로 인식하고 할당하는 것이며, GPU-native 상태는 GPU의 정상 여부를 판단하고, 검증된 노드만 워크로드를 받게 하며, 서비스에 필요한 단위로 자원을 나누고 배치할 수 있는 조건을 갖춘 상태를 의미한다. 이를 위해 NVIDIA 커널 드라이버, NVIDIA Container Toolkit, NVIDIA Device Plugin 등을 활용하여 GPU를 쿠버네티스의 스케줄링 대상으로 만들었다.
GPU-aware에서 GPU-native로 발전함에 따라, 토스증권은 멀티테넌트 GPU 클러스터를 운영하며 서비스에 필요한 자원을 효율적으로 관리할 수 있게 되었다.
토스뱅크의 Next.js Pages Router 유지 결정
토스뱅크 프론트엔드 개발자는 Next.js의 Pages Router를 사용하고 있으며, App Router와 React Server Components(RSC)를 검토했으나, 서비스 안정성을 유지하는 비용이 이득보다 크다고 판단하여 도입하지 않기로 했다. App Router는 데이터를 가져오는 컴포넌트를 나누고 Suspense로 감싸는 기능이 있지만, 화면 흔들림 문제와 경계 구분의 복잡성으로 인해 도입을 포기했다. 또한, App Router의 usePathname()는 경로 패턴 정보를 제공하지 않아 로깅 기능이 부족하다는 점도 고려됐다.
App Router의 usePathname()는 /blog/[slug]와 같은 경로 패턴을 제공하지 않아, 기존 로깅 기능을 유지하기 위한 별도 패키지 개발이 필요하다.
2x R9700과 64 GB DDR5를 갖춘 시스템의 Qwen 3.8 성능
사용자는 2개의 AMD Radeon AI PRO R9700 32 GB와 64 GB DDR5 RAM을 장착한 시스템에서 Qwen 3.8 27b FP8 및 Flash Next의 성능을 테스트하였다. 이 시스템은 Ryzen 7500F 프로세서와 Asus ProArt Creator X870E 메인보드를 기반으로 하며, SATA SSD에서 Qwen 3.8 Flash Next를 사용할 때 성능이 나쁘지 않음을 발견하였다. 전체 시스템 비용은 약 4,000 유로로 RTX 5090보다 저렴하다.
Qwen 3.8 27b의 성능을 활용하여 깊이 있는 연구, 요약, 이미지 생성, 경량 코딩 및 데이터 분석을 수행할 수 있다.