Category
AI 모델·API
AI 모델·API는 Claude, GPT, Gemini 같은 모델을 호출해 쓰는 접점이다. 모델 선택, 컨텍스트 한도, 토큰 가격, 프롬프트 캐싱, 스트리밍, 도구 호출 규격이 여기 묶인다. 모델마다 강점과 과금이 달라, 작업별 라우팅과 캐싱 설계가 비용을 좌우한다.
로컬 모델의 한계와 데이터센터의 효율성
필자는 로컬 모델이 최첨단 모델만큼 강력해지기 어려우며, 대부분의 AI 작업은 데이터센터에서 이루어질 것이라고 주장한다. 로컬 모델은 초기 비용과 전력 비용이 높고, 데이터센터에서 실행하는 모델이 구조적으로 더 효율적이라고 설명한다. 데이터센터는 여러 사용자의 요청을 묶어 처리할 수 있어 GPU 활용률이 높아지며, 이는 비용 절감으로 이어진다.
Anthropic의 연간 수익 증가와 모델 사용 현황
Anthropic의 7월 연간 수익은 650억 달러로, 5월의 470억 달러에서 증가했다. Q3는 이익을 낼 것으로 예상되며, 6,000명의 고객이 연간 10만 달러 이상을 지출하고 있다. OpenAI의 연간 수익은 40억 달러를 넘어섰고, GPT 5.6의 출시가 성과에 기여했다. Ramp AI 지수에 따르면, 2026년 7월 Anthropic 모델 지출 비율은 Opus 4.8이 28.0%로 가장 높았다.
익명 모델 'Ox 알파', 하루 100조 토큰 무료 제공
오픈라우터에 익명으로 등장한 'Ox 알파'는 하루 100조 토큰을 무료로 제공하며, 기존 AI 모델들을 위협하는 코딩과 추론 성능을 보여준다. 이 모델은 100만 토큰의 대용량 컨텍스트 창과 최대 13만1072 토큰을 지원한다.
16 GB VRAM을 활용한 Qwen3.8 모델 설정
Windows에서 사용자는 Qwen3.8-27B-Uncensored-IQ4-XS-MTP-16GB-VRAM-GGUF 모델을 사용하며, MTP를 비활성화하고, q4 k/q4 v mmproj를 CPU/RAM으로 이동시켜 VRAM을 절약한다. Linux 사용자는 VRAM을 더 효율적으로 사용할 수 있다. 설정 예시로는 GPU 오프로드, 배치 크기 조정, 메모리 최적화 플래그 등이 포함된다.
토스증권의 LLM 서빙 모니터링과 문제 해결 사례
LLM 서빙 생태계가 변화하며, 토스증권은 다양한 오픈 소스 LLM과 튜닝 모델을 활용하고 있다. LLM의 서빙은 단순히 배포하는 것에서 벗어나, 효과적으로 운영하는 것이 중요해졌다. 토스증권은 쿠버네티스와 Argo CD를 활용해 ML 플랫폼을 구축하고, Grafana와 Kibana로 모니터링을 진행한다. LLM에 특화된 지표를 통해 문제를 발견하고 해결하는 과정에서 Prefix Cache Hit Rate와 finish_reason 같은 지표를 활용하여 성능을 개선했다. 또한, 중앙화된 모니터링 시스템을 통해 문제를 신속하게 탐지하고 대응하는 방법론을 정립했다.
항공사 수익 관리에 활용되는 생성 AI 기반 시장 모델
항공사는 수천 명의 승객을 수백 개의 항공편으로 운송하며, 다양한 변수를 고려해 가격을 책정한다. 생성 AI 기반의 시장 모델은 이러한 복잡한 작업을 실시간으로 처리하는 데 도움을 준다. 이 모델은 고해상도 수치 데이터를 학습하여 복잡한 재무 동태를 분석, 시뮬레이션 및 예측하도록 설계되었다. Virgin Atlantic의 수익 관리 부사장 도미닉 케네디는 이 모델이 수요, 용량, 예약 등을 실시간으로 고려하여 경쟁사와의 위치를 평가하는 데 도움을 준다고 언급했다.
Google Gemma 모델 10억 다운로드 달성 및 기념 행사
Google Gemma는 오픈 모델 가족이 10억 다운로드를 달성했다고 발표했다. 이를 기념하기 위한 행사가 8월 20일 샌프란시스코에서 열리며, 오픈 소스 개발자와 연구자들을 초대한다. 행사 참석은 신청이 필요하다. Demis Hassabis가 공식 계정을 통해 발표했으며, Clément Farabet도 참석 의사를 밝혔다.
Amazon Bedrock에서 OpenAI GPT-5.6 모델의 크로스 리전 추론 도입
Amazon Bedrock은 25개 이상의 AWS 리전에서 OpenAI GPT-5.6 모델을 제공하며, 크로스 리전 추론을 지원한다. Sol, Terra, Luna의 세 가지 GPT-5.6 변형이 있으며, 각 변형은 성능과 비용의 균형을 맞추도록 조정되었다. 크로스 리전 추론은 인퍼런스 프로필을 통해 작동하며, 요청을 소스 리전에서 호출하고, Amazon Bedrock이 해당 리전의 컴퓨트를 사용하여 요청을 목적지 리전으로 라우팅한다.
NVIDIA Nemotron 3.5 Lightning NVFP4 체크포인트의 성능 개선
NVIDIA Nemotron 모델 패밀리를 통해 개발자들은 지연 시간, 속도, 메모리 및 계산 요구 사항에 맞는 모델을 맞춤화할 수 있다. 새로운 Nemotron 3.5 Lightning NVFP4 체크포인트는 정확성을 유지하면서 최대 4배 빠른 처리량을 제공하며, 전체 정밀도 체크포인트에서 66GB에서 22GB로 압축되었다.
SpaceXai의 Cursor 인수 완료
SpaceXai가 Cursor를 인수했다. Cursor는 과거 5명의 팀으로 시작하여 ICML 2024에서 에이전트에 대한 발표를 진행했으며, 2026년에는 엔터프라이즈에서 FDE를 수행하는 세 번째 시대에 접어들었다. Z.ai는 GLM-5.3을 출시하며 사이버 보안 및 코딩에 중점을 둔 모델로, 743B 기본 모델을 기반으로 후속 훈련을 통해 성능을 개선했다. Qwen3.8-27B는 실무 코딩과 사무 작업을 위해 설계된 멀티모달 모델이다.
SpaceX의 Cursor 인수와 Grok 4.6 출시
SpaceX는 600억 달러에 Cursor를 인수하였고, Grok 4.6 모델을 출시하였다. Grok 4.6은 장기 에이전트, 코딩 및 다단계 지식 작업에 최적화되어 있으며, Cursor, Grok Build, GitHub Copilot, API 및 자율 에이전트와 직접 연결된다. 또한, 중국의 Z.ai는 GLM-5.3 모델을 발표하였고, River AI는 11억 달러를 모집하였다.
Qwen3.8-27B Q8_0이 ROG Flow Z13에서 비행 시뮬레이터 생성
사용자는 ROG Flow Z13에서 Qwen3.8-27B Q8_0 모델을 테스트한 결과, 이 모델이 단일 HTML 페이지에서 비행 시뮬레이터를 생성할 수 있었음을 보고했다. 이 과정에서 Lemonade Server와 llama.cpp ROCm을 사용하였고, Q8_0 가중치와 Q8 KV 캐시를 활용하였다. 생성 속도는 약 9-19 tok/s였으며, MTP 수용률은 97-99%에 달했다. 전체 시뮬레이터 생성에는 약 20분이 소요되었다.
Amazon SageMaker HyperPod에서 Curvine을 활용한 대형 LLM을 위한 계층형 KV 캐시 구축
대형 언어 모델(LLM) 추론 시 KV 캐시의 크기와 성능 간의 트레이드오프가 존재한다. Amazon SageMaker HyperPod에서 Managed Tiered KV Cache와 Curvine을 활용하여 GPU와 CPU 메모리를 넘어 공유 NVMe 풀로 캐시 계층을 확장하는 아키텍처를 구축하였다. 이 설정을 통해 여러 복제본 간에 KV 캐시를 재사용할 수 있으며, 테스트 배포에서 최대 100%의 교차 Pod 캐시 적중률과 2.7배의 TTFT 개선을 달성하였다. 이 아키텍처는 P5 인스턴스 대신 G6e 인스턴스에서 실행할 수 있어 비용 절감 효과를 가져온다.
ONESTRUCTION이 AWS GenAIIC와 함께 Ishigaki-IDS 기초 모델 구축
ONESTRUCTION, Inc.는 AWS Generative AI Innovation Center의 기술 자문을 받아 건설 산업의 BIM(건축 정보 모델링) 워크플로우에 특화된 기초 모델인 Ishigaki-IDS를 구축했다. 일본의 건설 부문은 인력 부족 문제를 겪고 있으며, BIM은 설계, 건설 및 유지 관리 팀이 정보를 공유할 수 있도록 지원한다. Ishigaki-IDS는 BIM 전문가가 아닌 실무자도 속성 정보를 검토하고 관리할 수 있도록 장벽을 낮춘다. 이 모델은 데이터 부족 문제를 해결하기 위해 합성 데이터 생성을 활용하고, 세 단계의 훈련 파이프라인을 통해 도메인 특화 모델을 구축한다.
Qwen 3.8 27B, 실제 세계 지식 활용 능력 향상
Qwen 3.8 27B 모델은 이전 버전인 Qwen 3.6에 비해 세부 사항을 잘 기억하고 구현하는 능력이 향상되었다. 예를 들어, Qwen 3.6이 만든 'Galaga' 클론은 원작과의 유사성이 부족했으나, Qwen 3.8은 적의 공격, 애니메이션 효과 등을 포함하여 원작에 가까운 결과물을 생성했다. 이 모델은 세부 사항을 고려하여 더 정교한 결과를 만들어내며, 로컬 모델과 상용 모델 간의 격차를 줄이는 데 기여하고 있다.
Qwen 3.8 27B 출시, 기본 설정으로 과도한 사고 발생
Qwen 3.8 27B는 Alibaba의 Qwen 연구소에서 개발한 27B 파라미터의 비전 가능 LLM으로, Apache 2 라이센스를 따릅니다. 이 모델은 27B 크기로 적당한 사양의 노트북에서 실행할 수 있으며, 이전 모델인 Qwen 3.6 27B보다 성능이 향상되었습니다. 기본적으로 reasoning_effort가 xhigh로 설정되어 있어 복잡한 작업에서 철저한 분석을 요구하지만, 소비자 하드웨어에서 실행하기에는 비효율적입니다. LM Studio의 기본 컨텍스트 제한인 8,192 토큰을 초과하여 262,144 최대 컨텍스트 길이로 모델을 실행한 결과, 과도한 사고 문제를 해결할 수 있었습니다.
중국 AI 스타트업 Zhipu, GLM-5.3 모델로 Anthropic의 Mythos 5 초과
중국 AI 스타트업 Zhipu가 새로운 GLM-5.3 모델을 발표하며 Anthropic의 Mythos 5를 사이버 보안 기준에서 초과 성능을 기록했다고 밝혔다. 이 모델은 코딩 능력에서도 격차를 줄였으며, 중국의 오픈 웨이트 모델이 서구 AI와 동등한 수준에 도달했음을 나타낸다. Zhipu는 지난 6월 이후 빠른 속도로 모델을 개선하고 있으며, 미국 정부는 중국의 AI 발전을 견제하기 위한 계획을 마련 중이다.
Meta, 누구나 다운로드 가능한 AI 모델 Glimmer 출시
Meta는 이번 주에 누구나 다운로드하고 자신의 하드웨어에서 실행할 수 있는 오픈 웨이트 AI 모델 Glimmer를 출시했다. 이는 Muse Spark라는 더 강력한 모델이 API에 잠겨 있는 것과 대조적이다. 마크 저커버그는 AI가 소수의 연구소에 의해 통제되는 것이 아니라 '모두를 위한 것'이어야 한다고 주장하는 편지를 발표했다.
Meta, 누구나 다운로드 가능한 AI 모델 Glimmer 공개
Meta는 이번 주에 누구나 다운로드하고 자신의 하드웨어에서 실행할 수 있는 오픈 웨이트 AI 모델 Glimmer를 출시했다. 이는 Muse Spark라는 더 강력한 모델이 API에 잠겨 있는 것과 대조적이다. 마크 저커버그는 AI는 소수의 연구소에 의해 통제되어서는 안 되며 '모두를 위한 것'이어야 한다고 주장하는 편지를 발표했다.
Qwen3.8-27B 모델로 슈퍼 마리오 클론을 원샷 실행
Qwen3.8-27B 모델이 사무실에서 실행되어 슈퍼 마리오 클론을 원샷으로 처리할 수 있다는 내용이다. Q8 GGUF를 Framework Desktop에서 실행할 수 있지만 속도는 빠르지 않으며, 야간 배치 작업과 백그라운드 작업에 적합하다. MTP 및 기타 양자화 방법을 실험할 계획이다.
Qwen 3.8 27B 출시 관련 메가스레드
Qwen 3.8 27B 출시와 관련된 중복 및 유사 게시물 처리를 위한 메가스레드가 생성되었다. 이 스레드에서는 Quants, Fine-Tunes & Abliterations, Chat Templates, Inference Server Support & Configuration, Experiences, Benchmarks & Model Comparisons에 대한 정보가 다뤄진다. 공식 및 인기 있는 모델 링크도 제공된다.
Z.ai, GLM-5.3 모델 발표 및 성능 비교
Z.ai는 GLM-5.3 모델을 발표했으며, 현재 코딩 플랜에서만 이용 가능하고, 곧 API와 Hugging Face에서 공개될 예정이다. GLM-5.3은 750B 파라미터로 Moonshot AI의 Kimi K3, Claude Fable 5, GPT-5.6-Sol을 초과하는 성능을 보였다. 이 모델은 GLM-5.2의 기본 모델을 기반으로 하여 포스트 트레이닝을 대폭 확장한 것이다.
Gemini 3.7 Flash 업데이트로 GDM 재조명
Gemini 3.7 Flash 업데이트에서 3.5와 3.6 Flash가 Claude 4.8+ 및 GPT 5.5+ 시리즈에 비해 뒤처진 정도를 보여주는 차트가 주목받았다.