Category
AI 개발
AI 개발은 LLM을 실제 제품에 붙이는 엔지니어링 전반을 다룬다. 프롬프트 설계, 도구 호출, RAG, 평가, 비용·지연 관리까지 포함한다. 모델 호출 한 줄은 쉽지만, 환각 제어와 출력 신뢰성·재현성을 확보하는 데서 진짜 난이도가 나온다.
Amazon EKS에서 NVRx를 이용한 내결함성 분산 훈련
대규모 분산 훈련 작업은 여러 노드에서 수 시간 또는 수일 동안 실행되며, 이 과정에서 네트워크 분할, 메모리 오류, 소프트웨어 예외 등이 발생할 수 있다. NVIDIA Resiliency Extension (NVRx)을 PyTorch Fully Sharded Data Parallel (FSDP) 훈련에 통합하여 비동기 체크포인팅, 프로세스 내 재시작, 작업 내 재시작 기능을 제공한다. Amazon EKS는 관리형 Kubernetes 서비스로, p5.48xlarge 인스턴스에서 NVIDIA H100 GPU를 사용하여 훈련 작업을 수행한다.
토스증권의 GPU-native 클러스터 구축 과정
토스증권은 Kubernetes 기반의 GPU 클러스터를 구축하여 GPU-aware 상태에서 GPU-native 상태로 발전시켰다. GPU-aware 상태는 쿠버네티스가 GPU를 자원으로 인식하고 할당하는 것이며, GPU-native 상태는 GPU의 정상 여부를 판단하고, 검증된 노드만 워크로드를 받게 하며, 서비스에 필요한 단위로 자원을 나누고 배치할 수 있는 조건을 갖춘 상태를 의미한다. 이를 위해 NVIDIA 커널 드라이버, NVIDIA Container Toolkit, NVIDIA Device Plugin 등을 활용하여 GPU를 쿠버네티스의 스케줄링 대상으로 만들었다.
토스뱅크의 Next.js Pages Router 유지 결정
토스뱅크 프론트엔드 개발자는 Next.js의 Pages Router를 사용하고 있으며, App Router와 React Server Components(RSC)를 검토했으나, 서비스 안정성을 유지하는 비용이 이득보다 크다고 판단하여 도입하지 않기로 했다. App Router는 데이터를 가져오는 컴포넌트를 나누고 Suspense로 감싸는 기능이 있지만, 화면 흔들림 문제와 경계 구분의 복잡성으로 인해 도입을 포기했다. 또한, App Router의 usePathname()는 경로 패턴 정보를 제공하지 않아 로깅 기능이 부족하다는 점도 고려됐다.
2x R9700과 64 GB DDR5를 갖춘 시스템의 Qwen 3.8 성능
사용자는 2개의 AMD Radeon AI PRO R9700 32 GB와 64 GB DDR5 RAM을 장착한 시스템에서 Qwen 3.8 27b FP8 및 Flash Next의 성능을 테스트하였다. 이 시스템은 Ryzen 7500F 프로세서와 Asus ProArt Creator X870E 메인보드를 기반으로 하며, SATA SSD에서 Qwen 3.8 Flash Next를 사용할 때 성능이 나쁘지 않음을 발견하였다. 전체 시스템 비용은 약 4,000 유로로 RTX 5090보다 저렴하다.
NVIDIA Cosmos 3를 활용한 Physical AI 모델 공장 구축 방법
Physical AI 시스템은 지속적인 데이터 생성, 후속 훈련 및 평가를 통해 구축된다. 이 글에서는 NVIDIA Cosmos 3를 사용하여 Amazon SageMaker HyperPod에서 Physical AI 모델 공장을 구축하는 방법을 설명하며, Cosmos 3의 Mixture-of-Transformers 설계, Amazon EKS와의 통합, 다중 테라바이트 저장소 설정 및 로봇 정책 단계의 분산 후 훈련을 다룬다. Cosmos 3는 비디오, 이미지, 행동 및 소리를 단일 토큰 스트림으로 처리하여 각 단계의 GPU 용량을 통합할 수 있다.
NVIDIA Holoscan을 활용한 실시간 AI 애플리케이션 개발
NVIDIA Holoscan은 의료 영상부터 로봇 공학까지 엣지에서 실시간 AI 애플리케이션을 구축하기 위한 플랫폼이다. HoloHub는 참조 애플리케이션과 구성 요소의 컬렉션으로, 개발자들이 가능한 것들을 보여준다. 이 플랫폼은 일반적인 코딩 에이전트가 엔지니어가 사용할 수 있는 예제, 문서 및 개발 도구를 활용할 수 있도록 탐색하고 있다.
GitHub Universe 2026 일정 발표
GitHub Universe 2026 일정이 공개되었으며, AI 기반 개발의 잠재력에 대한 세션, 데모, 패널이 포함된다. 이 행사는 2026년 10월 28일부터 29일까지 샌프란시스코의 Fort Mason Center에서 열리며, AMD, Figma, NVIDIA, Coinbase, Anthropic, OpenAI의 전문가들이 참여한다. 주요 세션으로는 Copilot 구성, GitHub의 스택된 풀 리퀘스트, AI 유창성 구축 등이 있다. 등록은 8월 19일까지 가능하며, 조기 등록 시 $300 할인이 제공된다.
Charity Majors가 말하는 AI의 소프트웨어 엔지니어링 변화
Charity Majors는 2025년 AI에 대한 회의적 시각이 있었으나, 2026년에는 AI가 소프트웨어 산업에 변화를 가져오고 있다고 주장한다. 그녀는 AI가 코드 생성의 경제성을 변화시키고 있으며, 신뢰성과 검증이 점점 더 중요한 병목 현상이 되고 있다고 설명한다. AI는 2010년대 클라우드 컴퓨팅이 인프라 계층에 미친 영향과 유사한 변화를 소프트웨어 구축에 가져올 것이라고 예측한다. 또한, 코드 리뷰의 중요성을 낮게 평가하며, AI가 코드 생성 방식을 혁신할 것이라고 언급한다.
vLLM 모델 변환 및 배포 자동화 과정
vLLM에서 모델 변환 및 배포를 자동화하기 위해 Claude Code Skill을 활용하여 Hugging Face 모델을 vLLM에 통합하는 절차를 구현했다. 이 과정에서 7개의 서로 다른 모델을 변환하고, 45개의 주의 사항을 재사용 가능한 지식으로 축적했다. 호출당 토큰 수를 6,900개에서 170개로 줄였으며, GitHub Issue를 통해 E2E 파이프라인을 구성했다.
토스의 모노리포 전략과 카탈로그 도입으로 통합된 개발환경
토스에서는 100명이 넘는 프론트엔드 엔지니어들이 React 19와 Next.js 15를 사용하여 제품을 개발하고 있으며, 모든 모바일 제품 코드는 1개의 모노리포로 통합되어 있다. 그러나 초기에는 다양한 의존성 버전으로 인해 개발 경험이 파편화되었고, 이를 해결하기 위해 표준 라이브러리 버전을 제공하는 '카탈로그'를 도입했다. 카탈로그를 통해 모든 서비스가 동일한 의존성 버전을 참조하게 되어 설치 시간이 단축되고, 개발자 경험이 개선되었다.
Idle Frontier 게임 개발 경험과 AI 활용
Idle Frontier는 Opus 5(Claude)를 활용하여 개발된 게임으로, 데이터와 컴퓨팅 자원 제약을 다루는 내용을 담고 있다. 게임 개발자는 Godot 3에서 Godot 4로의 마이그레이션과 게임 디자인 패턴을 배우는 데 Claude의 도움을 받았다. Claude는 버그 수정 및 디버깅에서 유용했으며, 게임의 일부 화면은 Claude가 끝까지 구현했다. 그러나 새로운 기능을 구현할 때 기존 기능이 깨지는 등의 문제도 발생했다.
클코나잇 2 웨비나에서 하네스 엔지니어링 구축 사례 공유
요즘IT는 5월 27일과 6월 10일에 클코나잇 2 웨비나를 개최하고, 개발자와 비개발자가 클로드 코드(Claude Code)를 활용한 경험을 공유했다. 바이버스 AI의 김영채는 하네스 엔지니어링 도입 배경과 마에스트로 데브(Maestro Dev)라는 스킬을 통해 코드 관리와 개발 속도를 개선한 사례를 설명했다. 지난 8개월 동안 4명의 개발자가 170만 줄의 코드를 작업하며 발생한 문제를 해결하기 위해 하네스 엔지니어링을 도입했다고 밝혔다.
AI 해커톤에서 재무 업무 문제 해결을 위한 접근 방식
네이버의 ‘모두의 Engineering Day AI 해커톤’에서 참가자들은 실제 업무 문제를 해결하기 위해 팀을 구성하고, AI를 활용하여 재무 업무를 자동화하는 프로젝트를 진행했다. 팀은 수기 Microsoft Excel 기반의 출자 현황 관리를 LLM·MCP 기반의 투자 포트폴리오 관리 플랫폼으로 전환하는 과제를 선택했다. 이 과정에서 AI의 역할을 단순한 도구가 아닌 문제 정의, 설계, 검증의 파트너로 설정하고, 현재 값이 아닌 거래 이력을 중심으로 시스템을 설계했다.
NVIDIA DeepStream 9.1을 활용한 다중 카메라 3D 추적 애플리케이션 구축
대규모 공간에서 비디오 분석 애플리케이션을 개발하는 개발자는 카메라 뷰 간에 이동하는 동일한 객체를 추적해야 한다. 단일 카메라 2D 추적은 신뢰할 수 있는 깊이 정보를 제공하지 않으며, 객체가 프레임을 벗어날 때 추적을 잃는 경우가 많아 창고 안전, 소매 분석, 스마트 빌딩 모니터링과 같은 애플리케이션의 한계를 초래한다. 현재의 3D 추적 방법은 수동 작업을 요구한다.
NVIDIA T4에서 A100 대비 170배 느린 PyTorch 모델 실행
NVIDIA A100에서 포인트 추적 모델이 반 비디오당 약 0.5초 소요되는 반면, T4에서는 같은 호출이 약 85초 소요되어 170배 느려진다. 비디오는 256×256 해상도의 47프레임으로, 배치는 1이다. 현재 GPU는 99% 활용 중이며, 모델은 GPU에서 실행되고 있다. torch.backends.cudnn.benchmark를 활성화해도 효과가 없고, 두 개의 독립적인 T4 머신에서 동일한 느린 성능이 나타났다.
2026년 AI 엔지니어링의 주요 트렌드
2023년 6월 swyx가 'AI 엔지니어'라는 용어를 만든 이후 AI 엔지니어링은 크게 발전했다. 2026년 AI 엔지니어 월드 페어에서는 AI 시스템 주변의 엔지니어링이 중요해졌으며, 자동화된 에이전트보다 시스템 설계가 강조되었다. 특히, OpenAI의 Codex와 같은 도구를 활용하여 AI 엔지니어와 에이전트 간의 협업이 용이해졌고, '루프' 개념이 AI 엔지니어링의 새로운 제어 계층으로 부각되었다.
NVIDIA Isaac ROS로 로봇 개발 가속화하는 Jaiveer Singh
Jaiveer Singh은 NVIDIA Isaac ROS(로봇 운영 체제) 팀을 이끄는 로봇 소프트웨어 엔지니어로, 오픈 소스 ROS 2 프레임워크를 기반으로 CUDA 가속 라이브러리와 AI 모델을 제공하여 자율 이동 로봇, 조작 시스템 및 휴머노이드 개발을 지원한다. Isaac ROS는 인식, 객체 탐지, 매핑, 충돌 탐지 및 모션 계획을 위한 패키지를 제공하며, NVIDIA Jetson 엣지 시스템과 NVIDIA DGX Spark 개인 AI 슈퍼컴퓨터에서 실행할 수 있다. 이 소프트웨어는 모듈화되어 있어 개발자들이 기존 ROS 코드와 쉽게 결합할 수 있도록 설계되었다.
State of AI 2026: TypeScript 사용률 증가 및 AI 생성 코드 비중 급증
Devographics의 연례 AI 개발자 설문 결과에 따르면, TypeScript가 처음으로 JavaScript 사용률을 초과했으며, 개발자가 작성하는 코드 중 AI 생성 비중이 평균 54%로 증가했다. Claude Code는 유료 전환율과 만족도에서 1위를 기록했고, 코딩 에이전트 사용률은 GitHub Copilot이 67.9%, Claude Code가 62.9%로 나타났다. AI 도입에 대한 기대와 함께 'AI 의존으로 인한 개발자 역량 저하' 우려가 68%에 달했다.
AI Engineer World’s Fair에서의 루프 논쟁과 소프트웨어 공장 모델
AI Engineer World’s Fair의 마지막 날, 루프에 대한 논쟁이 진행되었다. Geoffrey Huntley와 Ian Livingstone은 루프가 이미 존재하며 소프트웨어 개발의 핵심 요소라고 주장했다. 반면, Dex Horthy와 Greg Pstrucha는 루프의 과대광고와 경제적 지속 가능성에 의문을 제기했다. Anthropic의 Mike Krieger는 Claude Tag를 소개하며, 팀의 작업 방식이 더 위임적이고 비동기적이며 능동적으로 변화하고 있다고 설명했다.
Antidote: 창의성을 회복하는 방법
개발자들은 효율성보다 창의적인 과정이 중요하다는 점을 인식해야 하며, 손으로 직접 코드를 작성하고, 프로그래밍 서적을 읽고, 비공식적인 방법으로 문제를 해결하는 것이 필요하다. 또한, Discord와 같은 커뮤니티에 참여하고, 블로그를 작성하거나 동료를 멘토링하는 등의 활동을 통해 창의성을 자극할 수 있다. 특히, 트랜스포머 모델의 내부 구조를 분석하고 설명하는 과정은 이해도를 높이는 데 도움이 된다.
GPU 인프라 작업 문서화 시작
GPU 인프라, LLMs, CV에 대한 작업을 문서화하는 시리즈를 시작한다. 첫 번째 글에서는 GPU가 산업의 중심인 이유, CPU와 GPU의 차이, 문제 발생 시 확인해야 할 첫 번째 장소인 `nvidia-smi`에 대해 간략히 설명한다. 이후에는 Ampere, Hopper, Blackwell 간의 경험적 아키텍처 차이, 커스텀 커널에서의 레지스터 압력 처리, 비동기 메모리 패러다임(TMA/wgmma)에 대해 다룰 예정이다.
Foundry Local 1.2.0 출시: 다국어 음성 인식 및 ARM64 지원 추가
Microsoft는 Foundry Local 1.2.0을 발표하며, 실시간 음성 텍스트 변환 API에 40개 이상의 언어를 지원하는 다국어 기능을 추가했다. 또한, ARM 기반 리눅스 시스템에서 Foundry Local을 실행할 수 있도록 지원하며, 모델 다운로드 속도를 개선하고, 모든 SDK에서 다운로드 취소 기능을 제공한다.
Qdrant 컨테이너가 새벽에 OOM Killed로 죽은 원인과 양자화로 메모리 1/4 줄인 기록
4GB 인스턴스에 8GB 벡터를 욱여넣어 OOM Killed. dmesg 추적, int8 양자화로 메모리 1/4, 재색인 분리까지
한국어 RAG에서 임베딩 모델 4개를 갈아끼웠지만 정답은 청킹에 있었다
text-embedding-3-small/large, bge-m3, KURE-v1을 다 돌려도 안 벌어지던 마진이, 헤딩 단위 청킹과 섹션 제목 prepend로 0.41 vs 0.39에서 0.52 vs 0.34로 벌어졌다