본문으로 건너뛰기
L

LlamaIndex

LlamaIndex

AI 개발무료이번 주 45회 언급

LlamaIndex는 LLM에 사적 데이터를 연결하는 데이터 프레임워크로, 특히 RAG(검색 증강 생성)와 문서 기반 질의응답에 특화됐다. 다양한 소스의 데이터를 적재(ingest)→인덱싱→검색→LLM 응답으로 연결하는 파이프라인을 표준화해 제공하며, Python과 TypeScript를 지원한다.

핵심 기능은 수백 종의 데이터 커넥터(LlamaHub), 다양한 인덱스 구조와 청킹·임베딩 전략, 쿼리 엔진, 그리고 복잡한 문서 파싱을 처리하는 LlamaParse다. 최근엔 단순 검색을 넘어 도구를 쓰는 에이전트와 멀티스텝 워크플로, 문서 추출·정형화에 무게를 싣고 있다.

대상은 기업 문서·지식베이스 위에 정확한 RAG·검색 시스템을 올리려는 개발자와, 비정형 문서(PDF·표·스캔)를 정형 데이터로 뽑아내야 하는 팀이다. 오픈소스 프레임워크는 무료이고, 클라우드(LlamaCloud)와 LlamaParse는 사용량 기반 종량제(무료 한도 후 페이지·요청당 과금)로 제공된다.

강점은 RAG·문서 처리에 집중된 깊이, 까다로운 PDF/표 파싱 품질, 풍부한 커넥터다. 한계는 범용 에이전트 오케스트레이션 측면에선 LangGraph 같은 도구와 경쟁·중복되고, 고품질 파싱(LlamaParse) 같은 강점 기능은 클라우드 종량제라 대량 처리 시 비용이 든다는 점이다.

NewsAI 개발·

Amazon EKS에서 NVRx를 이용한 내결함성 분산 훈련

대규모 분산 훈련 작업은 여러 노드에서 수 시간 또는 수일 동안 실행되며, 이 과정에서 네트워크 분할, 메모리 오류, 소프트웨어 예외 등이 발생할 수 있다. NVIDIA Resiliency Extension (NVRx)을 PyTorch Fully Sharded Data Parallel (FSDP) 훈련에 통합하여 비동기 체크포인팅, 프로세스 내 재시작, 작업 내 재시작 기능을 제공한다. Amazon EKS는 관리형 Kubernetes 서비스로, p5.48xlarge 인스턴스에서 NVIDIA H100 GPU를 사용하여 훈련 작업을 수행한다.

NVRx는 PyTorch에 내결함성 기능을 추가하여 훈련 중 발생할 수 있는 오류를 효과적으로 처리할 수 있다.

AWS Machine Learning Blog원문
NewsAI 개발·

토스증권의 GPU-native 클러스터 구축 과정

토스증권은 Kubernetes 기반의 GPU 클러스터를 구축하여 GPU-aware 상태에서 GPU-native 상태로 발전시켰다. GPU-aware 상태는 쿠버네티스가 GPU를 자원으로 인식하고 할당하는 것이며, GPU-native 상태는 GPU의 정상 여부를 판단하고, 검증된 노드만 워크로드를 받게 하며, 서비스에 필요한 단위로 자원을 나누고 배치할 수 있는 조건을 갖춘 상태를 의미한다. 이를 위해 NVIDIA 커널 드라이버, NVIDIA Container Toolkit, NVIDIA Device Plugin 등을 활용하여 GPU를 쿠버네티스의 스케줄링 대상으로 만들었다.

GPU-aware에서 GPU-native로 발전함에 따라, 토스증권은 멀티테넌트 GPU 클러스터를 운영하며 서비스에 필요한 자원을 효율적으로 관리할 수 있게 되었다.

토스 테크 (Toss Tech)원문
NewsAI 개발·

토스뱅크의 Next.js Pages Router 유지 결정

토스뱅크 프론트엔드 개발자는 Next.js의 Pages Router를 사용하고 있으며, App Router와 React Server Components(RSC)를 검토했으나, 서비스 안정성을 유지하는 비용이 이득보다 크다고 판단하여 도입하지 않기로 했다. App Router는 데이터를 가져오는 컴포넌트를 나누고 Suspense로 감싸는 기능이 있지만, 화면 흔들림 문제와 경계 구분의 복잡성으로 인해 도입을 포기했다. 또한, App Router의 usePathname()는 경로 패턴 정보를 제공하지 않아 로깅 기능이 부족하다는 점도 고려됐다.

App Router의 usePathname()는 /blog/[slug]와 같은 경로 패턴을 제공하지 않아, 기존 로깅 기능을 유지하기 위한 별도 패키지 개발이 필요하다.

토스 테크 (Toss Tech)원문
NewsAI 개발·

2x R9700과 64 GB DDR5를 갖춘 시스템의 Qwen 3.8 성능

사용자는 2개의 AMD Radeon AI PRO R9700 32 GB와 64 GB DDR5 RAM을 장착한 시스템에서 Qwen 3.8 27b FP8 및 Flash Next의 성능을 테스트하였다. 이 시스템은 Ryzen 7500F 프로세서와 Asus ProArt Creator X870E 메인보드를 기반으로 하며, SATA SSD에서 Qwen 3.8 Flash Next를 사용할 때 성능이 나쁘지 않음을 발견하였다. 전체 시스템 비용은 약 4,000 유로로 RTX 5090보다 저렴하다.

Qwen 3.8 27b의 성능을 활용하여 깊이 있는 연구, 요약, 이미지 생성, 경량 코딩 및 데이터 분석을 수행할 수 있다.

r/LocalLLaMA원문

관련 Q&A