본문으로 건너뛰기

Category

AI 모델·API

AI 모델·API는 Claude, GPT, Gemini 같은 모델을 호출해 쓰는 접점이다. 모델 선택, 컨텍스트 한도, 토큰 가격, 프롬프트 캐싱, 스트리밍, 도구 호출 규격이 여기 묶인다. 모델마다 강점과 과금이 달라, 작업별 라우팅과 캐싱 설계가 비용을 좌우한다.

News·

Mubert API: 트랙 및 스템 편집 기능 제공

Mubert API는 새로운 엔진을 통해 일관된 음악을 제공하며, 트랙 및 스템을 편집할 수 있는 기능을 지원한다.

Product Hunt — Artificial Intelligence
News·

DeepSeek-V4-Flash-0731: 로컬에서 실행 가능한 모델의 지능 지수

2026년 3월 6일 기준으로 프론티어 모델의 최고 지능 지수는 51이었으며, DeepSeek-V4-Flash-0731 모델은 50의 지능 지수를 가지고 있다. 이 기준이 정확하다면, 8,000달러 이하의 하드웨어에서 실행 가능한 모델이 5개월 전의 최고 프론티어 모델과 거의 동일한 지능 지수를 가진다는 의미이다.

r/LocalLLaMA
News·

최근 출시된 중간 범위 모델 목록

최근 1주일 반 동안 다음과 같은 중간 범위 모델들이 출시되었다: Thinking Machines Inkling Small, DeepSeek v4 Flash 0731, Poolside Laguna, Upstage Solar, Microsoft Mage VL, LG ExaOne, SenseNova u1.5, BottleCap - ThinkingCap, Kimi K3.

r/LocalLLaMA
News·

Kimi K3 모델의 AWS SageMaker HyperPod 및 EKS 배포

Moonshot AI는 2026년 7월 27일에 2.8 조 개의 매개변수를 가진 Mixture of Experts (MoE) 모델 Kimi K3를 출시했다. Kimi K3는 896개의 전문가를 통해 매개변수를 분산시키며, 한 번의 전방 패스에서 약 1040억 개의 매개변수가 활성화된다. 이 모델은 Hugging Face에서 공개된 가중치로 제공되며, MXFP4 형식으로 배포된다. Kimi K3의 배포를 위해서는 p6-b300 인스턴스가 필요하다.

AWS Machine Learning Blog
News·

DeepSeek V4 Flash 모델, 304억 개 파라미터와 경쟁력 있는 가격

DeepSeek의 V4 패밀리 최신 모델인 DeepSeek V4 Flash는 3040억 개의 파라미터를 가지고 있으며, Hugging Face에서 167GB의 용량을 차지한다. 이 모델은 MiniMax M3(428B 모델)보다 높은 성능을 보이며, 입력당 $0.14, 출력당 $0.27의 가격으로 제공되어 현재 가장 가성비 좋은 모델로 평가받고 있다. Intelligence Index에서 비용 대비 성능이 뛰어난 것으로 나타났다.

Simon Willison's Weblog
News·

Amazon SageMaker AI 엔드포인트를 위한 추론 메타 모니터링 소개

조직은 머신러닝 모델의 예측 품질을 추적하지 않으면 고객 불만이나 점검 시점에만 문제를 인식하게 된다. 이 글에서는 Amazon SageMaker AI 엔드포인트를 위한 추론 메타 모니터링을 소개하며, 이는 생산 ML 추론 파이프라인 위에 자리잡아 예측 및 데이터 품질 지표를 지속적으로 추적하고 시각화하는 거버넌스 레이어를 제공한다. 시스템은 드리프트 감지, 지연된 실제 데이터 통합, 자동화된 성능 대시보드를 포함한다.

AWS Machine Learning Blog
News·

Kimi K3 모델의 AWS 배포 방법

Moonshot AI는 2026년 7월 27일 Kimi K3를 출시했다. Kimi K3는 2.8 조 개의 매개변수를 가진 Mixture of Experts (MoE) 모델로, 896개의 전문가가 있으며, 토큰당 16개만 활성화된다. 이 모델은 복잡한 작업을 처리할 수 있으며, Hugging Face에서 공개 가중치가 제공된다. Kimi K3의 배포를 위해서는 p6-b300 인스턴스가 필요하며, AWS의 SageMaker HyperPod와 EKS 클러스터를 통해 배포할 수 있다.

AWS Machine Learning Blog
News·

Claude Opus 5, Fable 5와 비슷한 성능을 반값에 제공

Claude Opus 5는 Fable 5와 비슷한 성능을 제공하면서 API에서 토큰당 가격이 절반이며, 구독을 통해 더 저렴하게 이용할 수 있다. Opus 5는 주로 로컬 작업에 강하며, 복잡한 작업에서는 Fable보다 느리거나 과도한 경우가 많다. 그러나 Opus 5는 사용자와의 상호작용에서 부정적인 반응을 보이는 경우가 있어, Fable에 비해 불만이 많다. Opus 5는 오늘부터 사용 가능하며, 코딩과 데이터 분석에서 새로운 최첨단 모델로 평가받고 있다.

Don't Worry About the Vase (Zvi Mowshowitz)
News·

Perplexity의 Model Council, 다중 모델 쿼리 구성 기능 추가

AI 검색 기업 Perplexity는 화요일에 Model Council을 클라우드 기반 Computer 플랫폼에 확장하여 사용자가 다중 모델 쿼리를 구성할 수 있는 방법을 추가했다. Model Council은 사용자가 특정 문제에 대해 여러 모델을 독립적으로 작동시켜 결과를 종합하는 기능을 제공한다. 이제 사용자는 OpenAI, Anthropic, Google 등 다양한 모델 중 2개에서 8개를 선택할 수 있으며, 보고서 및 작업 준비 자산으로 결과를 변환할 수 있다. Model Council의 접근은 개인 Max 및 Pro 사용자에게도 제공되며, 사용량 기반 과금이 적용된다.

The Register — AI/ML
News·

Moonshot AI의 Kimi K3 오픈 웨이트 모델 출시

Moonshot AI가 Kimi K3 모델을 오픈 웨이트 패키지로 출시했다. Kimi K3는 2.8T 파라미터의 MoE 모델로, 104B의 활성 파라미터와 896명의 전문가를 포함하며, 1M 토큰의 컨텍스트를 지원한다. 이 모델은 K2에 비해 약 2.5배의 스케일링 효율성을 개선했으며, 상업적 사용에 제한이 있다. K3는 vLLM, Baseten, DigitalOcean 등 여러 플랫폼에서 즉시 배포되었다.

Latent Space (swyx & Alessio)
News·

클로드 오푸스 5 출시 및 사용 방식 변화

클로드 오푸스 5가 7월 24일 출시되었으며, 이는 5세대 클로드의 세 번째 모델이다. 오푸스 5는 일상 업무와 엔터프라이즈에 적합하도록 설계되었고, 가격은 입력 $5, 출력 $25(100만 토큰 기준)로 페이블 5의 절반이다. 기존의 클로드 사용 방식과 달리, 오푸스 5는 새로운 프롬프트와 하네스 방식이 요구된다.

요즘IT (Yozm IT)
News·

중국 스타트업 Moonshot의 AI 모델 Kimi K3, 미국 모델과의 경쟁 심화

중국 스타트업 Moonshot이 개발한 LLM Kimi K3가 미국 기업들이 만든 최고의 시스템을 저렴한 비용으로 능가할 수 있다고 주장하고 있다. Moonshot은 Kimi K3의 모델 가중치를 무료로 공개할 계획이며, 이는 미국 사용자들을 겨냥하고 있다. 이러한 개방형 모델은 개발자들에게 독점 시스템보다 훨씬 더 큰 제어권을 제공한다.

The Verge — AI
News·

Claude Opus 5 출시 및 성능 비교

Anthropic이 Claude Opus 5를 출시했다. Opus 5는 Epoch의 ECI에서 159를 기록하며 Fable 5의 161에 비해 약간 낮은 성능을 보인다. 그러나 소프트웨어 엔지니어링 벤치마크에서는 Fable 5와 동일한 SWE-ECI 161을 달성했다. 사용자들은 Opus 5의 코딩 성능을 높이 평가하며, 브라우저 자동화와 같은 도구 사용에서 긍정적인 반응을 보였다.

Latent Space (swyx & Alessio)
News·

Claude Opus 5의 성능과 기능

Claude Opus 5는 Fable 5와 비교해 많은 실용 작업에서 동등하거나 더 나은 성능을 보이며, 가격은 절반이고 속도는 더 빠르다. Opus 5는 Opus 4.8보다 전반적으로 강력하며, 특히 에이전틱 코딩, 컴퓨터 사용, 장기 지식 작업에서 큰 향상을 보인다. 그러나 사이버 관련 작업에서는 Mythos 5와 같은 기능을 제공하지 않으며, 사이버 관련 훈련을 피한 결과로 보인다. Opus 5는 여러 서드파티 벤치마크에서 새로운 최첨단 성능을 기록하고 있으며, Fable 5와 비교할 때 능력은 다소 낮지만 Opus 4.8보다는 더 가깝다.

Don't Worry About the Vase (Zvi Mowshowitz)
News·

모델 체크포인트 전송 비용 증가 문제

모델 체크포인트의 크기가 수백 기가바이트에서 테라바이트에 이르면서, 데이터 전송 비용이 빠르게 증가하고 있다. 이러한 모델 가중치를 클러스터 내에서 이동하는 것은 매우 일반적이며, 예를 들어 콜드 스타트 시 원격 저장소에서 GPU 메모리로 가중치를 불러오고, 오토스케일링 및 롤링 업데이트 시 각 새로운 복제본을 채워야 한다.

NVIDIA Technical Blog
News·

NVIDIA Nemotron 3 Nano의 맞춤화 방법

개발자들은 일반 모델을 특정 사용 사례, 도메인, 언어 등에 맞게 조정할 수 있는 맞춤화 기능을 활용할 수 있다. 하지만 맞춤화는 인프라, 기술 전문성, 특정 소프트웨어 및 GPU와 같은 자원 사용 능력이 필요하며, 전문 도메인 지식에 의존한다.

NVIDIA Technical Blog
News·

AWS에서 Claude Opus 5 출시: Anthropic의 최신 Opus 모델

Claude Opus 5가 Amazon Bedrock과 Claude Platform에서 제공된다. 이는 Anthropic의 가장 진보된 Opus 모델로, 코드 이해, 지식 작업, 시각적 이해 및 장기 작업에서 개선된 성능을 제공한다. 기본적으로 제로 데이터 보존(Zero Data Retention, ZDR)을 지원하며, AWS 환경 내에서 엔터프라이즈 보안과 데이터 거주지를 유지하면서 추론을 확장할 수 있다.

AWS Machine Learning Blog
News·

Claude Opus 5 출시

Anthropic의 새로운 모델 Claude Opus 5가 출시되었다. 이 모델은 Claude Fable 5의 지능에 가까우면서도 가격은 절반이다. 현재 Artificial Analysis 리더보드에서 Fable 5보다 앞서 있다. Opus 5는 사이버 보안 취약점을 찾는 데 개선되었지만, 이를 악용하는 훈련은 받지 않았다. 또한, Opus 5에 대한 프롬프트 가이드도 발표되었다.

Simon Willison's Weblog
News·

Anthropic, Claude Sonnet 5 출시 및 사이버 보안 기능 강화

Anthropic은 Claude Fable 5를 재배포하고 새로운 사이버 보안 분류기를 추가했으며, jailbreak 심각도 프레임워크를 주요 파트너와 함께 작성하고 모델 테스트 조정을 확대했다. 또한, Claude Sonnet 5를 출시하며 시간 제한 할인 가격으로 제공하고, 개선된 에이전트 코딩 및 벤치마크 성능, 줄어든 비정렬 행동, 기본 사이버 안전 장치를 갖추었으나 사이버 보안 능력은 상위 모델보다 상대적으로 약하다. 구글은 연구 내용을 TikTok 스타일의 수직 비디오로 요약하는 NotebookLM과 API를 통해 사용할 수 있는 더 빠르고 저렴한 이미지 생성기 Nano Banana 2 Lite를 출시했다.

Last Week in AI (Kurenkov & Harris)
News·

OpenAI GPT-5.6 출시 및 SpaceX AI Grok 4.5 모델 발표

OpenAI는 GPT-5.6을 공개하고, 데스크톱 코딩 제품을 ChatGPT Work로 리브랜딩했다. SpaceX AI는 Grok 4.5를 출시했으며, 이는 저렴한 가격의 Opus-class 코딩 모델로 안전 문서가 최소화되어 있다. 메타는 Muse Spark 1.1을 출시하고 Muse Image와 Muse Video를 미리 공개했으나, 인스타그램 계정 이미지 생성 문제로 빠르게 후퇴했다. 또한, 중국의 오픈소스 모델이 OpenRouter 토큰의 30% 이상을 차지하고 있다.

Last Week in AI (Kurenkov & Harris)
News·

Google, Gemini 3.6 Flash 및 사이버 보안 AI 모델 발표

Google은 I/O에서 Gemini 3.5 Flash를 발표한 이후 새로운 AI 모델을 공개했다. 이번에 발표된 모델 중 하나는 사이버 보안에 특화된 Gemini 모델이다. Gemini 3.5 Flash는 이미 사용 중단되었으며, 대신 Gemini 3.6 Flash가 출시되었다. Google은 3.6 Flash가 코드 생성 능력이 개선되었고 멀티모달 기능이 뛰어나다고 밝혔다. 3.5 Flash는 코드 생성에 대한 Google의 약속을 충족하지 못한 것으로 보인다.

Ars Technica — AI
News·

Kimi K3 모델의 성능과 한계

Kimi K3는 2.8T 파라미터를 가진 모델로, 현재까지 공개된 모델 중 가장 큰 규모를 자랑하며, 성능 기준으로는 우수한 평가를 받고 있다. 그러나 Kimi K3는 여러 면에서 기존의 폐쇄형 모델에 비해 몇 개월 뒤쳐져 있으며, 실제 성능은 벤치마크에서의 과대 평가를 보정해야 할 필요가 있다. 현재 Kimi K3에 대한 접근은 제한적이며, 많은 사용자가 실제로 시험해보지 못한 상황이다.

Don't Worry About the Vase (Zvi Mowshowitz)
News·

중국 AI 모델 Kimi가 미국 AI 기업들과 갈등을 일으키다

중국 AI 회사 Moonshot이 출시한 무료 오픈 소스 모델 Kimi가 OpenAI와 Anthropic의 모델과 경쟁할 정도로 지능이 높아 미국 내 AI 전문가들 사이에서 논란을 일으키고 있다. David Sacks는 Anthropic의 모델을 '로보토미된' 모델이라고 비난했으며, Emil Michael은 OpenAI의 새로운 전략 책임자를 '최고의 마을 바보'라고 불렀다. Kimi와 같은 중국 모델의 출현은 미국 기업들이 비싼 AI 모델에 대한 필요성을 줄이고 있으며, 이는 경제적 및 정치적 문제를 야기하고 있다.

MIT Technology Review — AI
News·

MiniCPM-Robot 모델 시리즈 - MiniCPM-RobotManip 및 MiniCPM-RobotTrack

MiniCPM은 로봇이 이해하고 기억하며 행동할 수 있도록 하는 첫 번째 구현된 AI 모델 시리즈인 MiniCPM-Robot을 오픈 소스로 공개했다. 이 시리즈에는 15억 개의 파라미터를 가진 일반 목적의 비전-언어-행동(VLA) 모델인 MiniCPM-RobotManip과 5억 개의 파라미터를 가진 실제 대상 추적을 위한 소형 모델인 MiniCPM-RobotTrack이 포함된다. 또한, 구현된 모델을 위한 고성능 추론 프레임워크인 PhyAI도 제공된다.

r/LocalLLaMA