Category
AI 모델·API
AI 모델·API는 Claude, GPT, Gemini 같은 모델을 호출해 쓰는 접점이다. 모델 선택, 컨텍스트 한도, 토큰 가격, 프롬프트 캐싱, 스트리밍, 도구 호출 규격이 여기 묶인다. 모델마다 강점과 과금이 달라, 작업별 라우팅과 캐싱 설계가 비용을 좌우한다.
Cloudflare의 Workers AI에서 Kimi K 시리즈와 GLM 모델 최적화
Cloudflare의 Workers AI는 Kimi K 시리즈와 GLM 모델을 GPU에서 효율적으로 실행하기 위한 세 가지 기술을 적용했다. KV 캐시를 8비트에서 4비트로 양자화하여 메모리 사용량을 줄이고, GLM 5.2의 모델 가중치를 8비트에서 4비트로 압축하여 메모리 요구량을 40% 감소시켰다. 이러한 최적화는 고객 수를 늘리면서도 비용을 낮추고 모델 정확도에는 변화가 없음을 확인했다.
Kimi K3 모델 배포의 어려움과 서버 비용
Moonshot AI의 K3 모델은 오픈소스이지만, 단순히 다운로드하여 개인 컴퓨터에서 실행할 수 없다. K3를 실행하기 위해서는 최소 16개의 H200 GPU가 필요하며, 데이터 센터나 기업 환경에서만 운영 가능하다. K3를 배포하기 위해서는 64개의 가속기 카드가 필요하고, 총 비용은 약 1700만 RMB에 달한다. 전력 소모량도 가정용 전기 설비를 초과할 수 있다. K3는 사이버 보안 능력이 약하며, 최근 평가에서 사이버 공격 개발 능력이 다른 모델에 비해 낮은 것으로 나타났다.
알리바바, 미국 AI 모델과 경쟁하는 Qwen3.8-Max 발표
중국의 알리바바가 자사의 가장 크고 강력한 AI 모델인 Qwen3.8-Max를 발표했다. 이 모델은 미국의 Anthropic 및 OpenAI의 시스템과 Moonshot AI의 Kimi K3와 성능이 경쟁한다고 주장하고 있다. 알리바바는 이 모델을 사용자에게 널리 제공할 것이라고 밝혔다.
OpenAI GPT-5.6 모델이 Amazon Bedrock에서 일반 제공 시작
OpenAI GPT-5.6 Sol, Terra, Luna 모델이 Amazon Bedrock에서 일반 제공된다. GPT-5.6 모델은 복잡한 추론 및 에이전트 코딩 작업을 위한 Sol, 일상적인 생산 작업을 위한 Terra, 분류 및 요약 같은 고속 대량 작업을 위한 Luna로 구성된다. 또한, GPT-5.6은 명시적 프롬프트 캐싱 기능을 도입하여 요청 간에 캐시할 프롬프트의 특정 부분을 제어할 수 있으며, 캐시된 입력은 90% 할인된 요금으로 청구된다.
Anthropic의 Opus 5, Fable을 벤치마크에서 초과 성능
Matthew Berman의 리뷰에 따르면, Anthropic의 새로운 AI 모델 Opus 5가 Fable을 거의 모든 벤치마크에서 초과 성능을 보였으며, 가격은 Fable의 절반이다. Opus는 Anthropic의 모델 라인업에서 Fable 아래 단계에 위치하지만, 벤치마크 결과는 반대의 결과를 보여주었다.
문샷AI의 키미 K3와 알리바바의 큐원3.8-Max 공개
문샷AI는 7월 16일 2.8조 파라미터의 오픈웨이트 모델 키미 K3를 공개했으나, 사흘 만에 신규 구독을 닫았다. 이는 예상보다 큰 수요로 GPU가 과부하에 걸렸기 때문이다. 알리바바는 K3 공개 후 사흘 뒤 큐원3.8-Max를 프리뷰로 공개했다. K3는 질문에 맞는 일부만 사용하여 비용을 절감하며, 100만 토큰의 긴 문서도 처리할 수 있다. K3는 종합 지능 평가에서 1,668점을 기록하며 3위에 올랐다.
Mubert API: 트랙 및 스템 편집 기능 제공
Mubert API는 새로운 엔진을 통해 일관된 음악을 제공하며, 트랙 및 스템을 편집할 수 있는 기능을 지원한다.
DeepSeek-V4-Flash-0731: 로컬에서 실행 가능한 모델의 지능 지수
2026년 3월 6일 기준으로 프론티어 모델의 최고 지능 지수는 51이었으며, DeepSeek-V4-Flash-0731 모델은 50의 지능 지수를 가지고 있다. 이 기준이 정확하다면, 8,000달러 이하의 하드웨어에서 실행 가능한 모델이 5개월 전의 최고 프론티어 모델과 거의 동일한 지능 지수를 가진다는 의미이다.
최근 출시된 중간 범위 모델 목록
최근 1주일 반 동안 다음과 같은 중간 범위 모델들이 출시되었다: Thinking Machines Inkling Small, DeepSeek v4 Flash 0731, Poolside Laguna, Upstage Solar, Microsoft Mage VL, LG ExaOne, SenseNova u1.5, BottleCap - ThinkingCap, Kimi K3.
Kimi K3 모델의 AWS SageMaker HyperPod 및 EKS 배포
Moonshot AI는 2026년 7월 27일에 2.8 조 개의 매개변수를 가진 Mixture of Experts (MoE) 모델 Kimi K3를 출시했다. Kimi K3는 896개의 전문가를 통해 매개변수를 분산시키며, 한 번의 전방 패스에서 약 1040억 개의 매개변수가 활성화된다. 이 모델은 Hugging Face에서 공개된 가중치로 제공되며, MXFP4 형식으로 배포된다. Kimi K3의 배포를 위해서는 p6-b300 인스턴스가 필요하다.
DeepSeek V4 Flash 모델, 304억 개 파라미터와 경쟁력 있는 가격
DeepSeek의 V4 패밀리 최신 모델인 DeepSeek V4 Flash는 3040억 개의 파라미터를 가지고 있으며, Hugging Face에서 167GB의 용량을 차지한다. 이 모델은 MiniMax M3(428B 모델)보다 높은 성능을 보이며, 입력당 $0.14, 출력당 $0.27의 가격으로 제공되어 현재 가장 가성비 좋은 모델로 평가받고 있다. Intelligence Index에서 비용 대비 성능이 뛰어난 것으로 나타났다.
Amazon SageMaker AI 엔드포인트를 위한 추론 메타 모니터링 소개
조직은 머신러닝 모델의 예측 품질을 추적하지 않으면 고객 불만이나 점검 시점에만 문제를 인식하게 된다. 이 글에서는 Amazon SageMaker AI 엔드포인트를 위한 추론 메타 모니터링을 소개하며, 이는 생산 ML 추론 파이프라인 위에 자리잡아 예측 및 데이터 품질 지표를 지속적으로 추적하고 시각화하는 거버넌스 레이어를 제공한다. 시스템은 드리프트 감지, 지연된 실제 데이터 통합, 자동화된 성능 대시보드를 포함한다.
Kimi K3 모델의 AWS 배포 방법
Moonshot AI는 2026년 7월 27일 Kimi K3를 출시했다. Kimi K3는 2.8 조 개의 매개변수를 가진 Mixture of Experts (MoE) 모델로, 896개의 전문가가 있으며, 토큰당 16개만 활성화된다. 이 모델은 복잡한 작업을 처리할 수 있으며, Hugging Face에서 공개 가중치가 제공된다. Kimi K3의 배포를 위해서는 p6-b300 인스턴스가 필요하며, AWS의 SageMaker HyperPod와 EKS 클러스터를 통해 배포할 수 있다.
Claude Opus 5, Fable 5와 비슷한 성능을 반값에 제공
Claude Opus 5는 Fable 5와 비슷한 성능을 제공하면서 API에서 토큰당 가격이 절반이며, 구독을 통해 더 저렴하게 이용할 수 있다. Opus 5는 주로 로컬 작업에 강하며, 복잡한 작업에서는 Fable보다 느리거나 과도한 경우가 많다. 그러나 Opus 5는 사용자와의 상호작용에서 부정적인 반응을 보이는 경우가 있어, Fable에 비해 불만이 많다. Opus 5는 오늘부터 사용 가능하며, 코딩과 데이터 분석에서 새로운 최첨단 모델로 평가받고 있다.
Perplexity의 Model Council, 다중 모델 쿼리 구성 기능 추가
AI 검색 기업 Perplexity는 화요일에 Model Council을 클라우드 기반 Computer 플랫폼에 확장하여 사용자가 다중 모델 쿼리를 구성할 수 있는 방법을 추가했다. Model Council은 사용자가 특정 문제에 대해 여러 모델을 독립적으로 작동시켜 결과를 종합하는 기능을 제공한다. 이제 사용자는 OpenAI, Anthropic, Google 등 다양한 모델 중 2개에서 8개를 선택할 수 있으며, 보고서 및 작업 준비 자산으로 결과를 변환할 수 있다. Model Council의 접근은 개인 Max 및 Pro 사용자에게도 제공되며, 사용량 기반 과금이 적용된다.
Moonshot AI의 Kimi K3 오픈 웨이트 모델 출시
Moonshot AI가 Kimi K3 모델을 오픈 웨이트 패키지로 출시했다. Kimi K3는 2.8T 파라미터의 MoE 모델로, 104B의 활성 파라미터와 896명의 전문가를 포함하며, 1M 토큰의 컨텍스트를 지원한다. 이 모델은 K2에 비해 약 2.5배의 스케일링 효율성을 개선했으며, 상업적 사용에 제한이 있다. K3는 vLLM, Baseten, DigitalOcean 등 여러 플랫폼에서 즉시 배포되었다.
클로드 오푸스 5 출시 및 사용 방식 변화
클로드 오푸스 5가 7월 24일 출시되었으며, 이는 5세대 클로드의 세 번째 모델이다. 오푸스 5는 일상 업무와 엔터프라이즈에 적합하도록 설계되었고, 가격은 입력 $5, 출력 $25(100만 토큰 기준)로 페이블 5의 절반이다. 기존의 클로드 사용 방식과 달리, 오푸스 5는 새로운 프롬프트와 하네스 방식이 요구된다.
중국 스타트업 Moonshot의 AI 모델 Kimi K3, 미국 모델과의 경쟁 심화
중국 스타트업 Moonshot이 개발한 LLM Kimi K3가 미국 기업들이 만든 최고의 시스템을 저렴한 비용으로 능가할 수 있다고 주장하고 있다. Moonshot은 Kimi K3의 모델 가중치를 무료로 공개할 계획이며, 이는 미국 사용자들을 겨냥하고 있다. 이러한 개방형 모델은 개발자들에게 독점 시스템보다 훨씬 더 큰 제어권을 제공한다.
Claude Opus 5 출시 및 성능 비교
Anthropic이 Claude Opus 5를 출시했다. Opus 5는 Epoch의 ECI에서 159를 기록하며 Fable 5의 161에 비해 약간 낮은 성능을 보인다. 그러나 소프트웨어 엔지니어링 벤치마크에서는 Fable 5와 동일한 SWE-ECI 161을 달성했다. 사용자들은 Opus 5의 코딩 성능을 높이 평가하며, 브라우저 자동화와 같은 도구 사용에서 긍정적인 반응을 보였다.
Claude Opus 5의 성능과 기능
Claude Opus 5는 Fable 5와 비교해 많은 실용 작업에서 동등하거나 더 나은 성능을 보이며, 가격은 절반이고 속도는 더 빠르다. Opus 5는 Opus 4.8보다 전반적으로 강력하며, 특히 에이전틱 코딩, 컴퓨터 사용, 장기 지식 작업에서 큰 향상을 보인다. 그러나 사이버 관련 작업에서는 Mythos 5와 같은 기능을 제공하지 않으며, 사이버 관련 훈련을 피한 결과로 보인다. Opus 5는 여러 서드파티 벤치마크에서 새로운 최첨단 성능을 기록하고 있으며, Fable 5와 비교할 때 능력은 다소 낮지만 Opus 4.8보다는 더 가깝다.
모델 체크포인트 전송 비용 증가 문제
모델 체크포인트의 크기가 수백 기가바이트에서 테라바이트에 이르면서, 데이터 전송 비용이 빠르게 증가하고 있다. 이러한 모델 가중치를 클러스터 내에서 이동하는 것은 매우 일반적이며, 예를 들어 콜드 스타트 시 원격 저장소에서 GPU 메모리로 가중치를 불러오고, 오토스케일링 및 롤링 업데이트 시 각 새로운 복제본을 채워야 한다.
NVIDIA Nemotron 3 Nano의 맞춤화 방법
개발자들은 일반 모델을 특정 사용 사례, 도메인, 언어 등에 맞게 조정할 수 있는 맞춤화 기능을 활용할 수 있다. 하지만 맞춤화는 인프라, 기술 전문성, 특정 소프트웨어 및 GPU와 같은 자원 사용 능력이 필요하며, 전문 도메인 지식에 의존한다.
AWS에서 Claude Opus 5 출시: Anthropic의 최신 Opus 모델
Claude Opus 5가 Amazon Bedrock과 Claude Platform에서 제공된다. 이는 Anthropic의 가장 진보된 Opus 모델로, 코드 이해, 지식 작업, 시각적 이해 및 장기 작업에서 개선된 성능을 제공한다. 기본적으로 제로 데이터 보존(Zero Data Retention, ZDR)을 지원하며, AWS 환경 내에서 엔터프라이즈 보안과 데이터 거주지를 유지하면서 추론을 확장할 수 있다.
Claude Opus 5 출시
Anthropic의 새로운 모델 Claude Opus 5가 출시되었다. 이 모델은 Claude Fable 5의 지능에 가까우면서도 가격은 절반이다. 현재 Artificial Analysis 리더보드에서 Fable 5보다 앞서 있다. Opus 5는 사이버 보안 취약점을 찾는 데 개선되었지만, 이를 악용하는 훈련은 받지 않았다. 또한, Opus 5에 대한 프롬프트 가이드도 발표되었다.