본문으로 건너뛰기

Category

AI 모델·API

AI 모델·API는 Claude, GPT, Gemini 같은 모델을 호출해 쓰는 접점이다. 모델 선택, 컨텍스트 한도, 토큰 가격, 프롬프트 캐싱, 스트리밍, 도구 호출 규격이 여기 묶인다. 모델마다 강점과 과금이 달라, 작업별 라우팅과 캐싱 설계가 비용을 좌우한다.

News·

Anthropic, Claude Sonnet 5 출시 및 사이버 보안 기능 강화

Anthropic은 Claude Fable 5를 재배포하고 새로운 사이버 보안 분류기를 추가했으며, jailbreak 심각도 프레임워크를 주요 파트너와 함께 작성하고 모델 테스트 조정을 확대했다. 또한, Claude Sonnet 5를 출시하며 시간 제한 할인 가격으로 제공하고, 개선된 에이전트 코딩 및 벤치마크 성능, 줄어든 비정렬 행동, 기본 사이버 안전 장치를 갖추었으나 사이버 보안 능력은 상위 모델보다 상대적으로 약하다. 구글은 연구 내용을 TikTok 스타일의 수직 비디오로 요약하는 NotebookLM과 API를 통해 사용할 수 있는 더 빠르고 저렴한 이미지 생성기 Nano Banana 2 Lite를 출시했다.

Last Week in AI (Kurenkov & Harris)
News·

OpenAI GPT-5.6 출시 및 SpaceX AI Grok 4.5 모델 발표

OpenAI는 GPT-5.6을 공개하고, 데스크톱 코딩 제품을 ChatGPT Work로 리브랜딩했다. SpaceX AI는 Grok 4.5를 출시했으며, 이는 저렴한 가격의 Opus-class 코딩 모델로 안전 문서가 최소화되어 있다. 메타는 Muse Spark 1.1을 출시하고 Muse Image와 Muse Video를 미리 공개했으나, 인스타그램 계정 이미지 생성 문제로 빠르게 후퇴했다. 또한, 중국의 오픈소스 모델이 OpenRouter 토큰의 30% 이상을 차지하고 있다.

Last Week in AI (Kurenkov & Harris)
News·

Google, Gemini 3.6 Flash 및 사이버 보안 AI 모델 발표

Google은 I/O에서 Gemini 3.5 Flash를 발표한 이후 새로운 AI 모델을 공개했다. 이번에 발표된 모델 중 하나는 사이버 보안에 특화된 Gemini 모델이다. Gemini 3.5 Flash는 이미 사용 중단되었으며, 대신 Gemini 3.6 Flash가 출시되었다. Google은 3.6 Flash가 코드 생성 능력이 개선되었고 멀티모달 기능이 뛰어나다고 밝혔다. 3.5 Flash는 코드 생성에 대한 Google의 약속을 충족하지 못한 것으로 보인다.

Ars Technica — AI
News·

Kimi K3 모델의 성능과 한계

Kimi K3는 2.8T 파라미터를 가진 모델로, 현재까지 공개된 모델 중 가장 큰 규모를 자랑하며, 성능 기준으로는 우수한 평가를 받고 있다. 그러나 Kimi K3는 여러 면에서 기존의 폐쇄형 모델에 비해 몇 개월 뒤쳐져 있으며, 실제 성능은 벤치마크에서의 과대 평가를 보정해야 할 필요가 있다. 현재 Kimi K3에 대한 접근은 제한적이며, 많은 사용자가 실제로 시험해보지 못한 상황이다.

Don't Worry About the Vase (Zvi Mowshowitz)
News·

중국 AI 모델 Kimi가 미국 AI 기업들과 갈등을 일으키다

중국 AI 회사 Moonshot이 출시한 무료 오픈 소스 모델 Kimi가 OpenAI와 Anthropic의 모델과 경쟁할 정도로 지능이 높아 미국 내 AI 전문가들 사이에서 논란을 일으키고 있다. David Sacks는 Anthropic의 모델을 '로보토미된' 모델이라고 비난했으며, Emil Michael은 OpenAI의 새로운 전략 책임자를 '최고의 마을 바보'라고 불렀다. Kimi와 같은 중국 모델의 출현은 미국 기업들이 비싼 AI 모델에 대한 필요성을 줄이고 있으며, 이는 경제적 및 정치적 문제를 야기하고 있다.

MIT Technology Review — AI
News·

MiniCPM-Robot 모델 시리즈 - MiniCPM-RobotManip 및 MiniCPM-RobotTrack

MiniCPM은 로봇이 이해하고 기억하며 행동할 수 있도록 하는 첫 번째 구현된 AI 모델 시리즈인 MiniCPM-Robot을 오픈 소스로 공개했다. 이 시리즈에는 15억 개의 파라미터를 가진 일반 목적의 비전-언어-행동(VLA) 모델인 MiniCPM-RobotManip과 5억 개의 파라미터를 가진 실제 대상 추적을 위한 소형 모델인 MiniCPM-RobotTrack이 포함된다. 또한, 구현된 모델을 위한 고성능 추론 프레임워크인 PhyAI도 제공된다.

r/LocalLLaMA
News·

Basalt Labs, HLE에서 99.44% 주장과 DeepSeek 모델 제공

Basalt Labs는 HLE에서 99.44%의 성능을 주장하며, 그들이 공개한 모델은 Qwen2.5-7B-Instruct 기반이다. 또한, 그들이 웹사이트에서 제공하는 모델은 DeepSeek이다.

r/LocalLLaMA
News·

Deepseek의 가격 대비 성능 분석

Deepseek는 가격 대비 성능에서 항상 우수한 평가를 받아왔으며, 최근 Kimi K3 점수에 대한 인공지능 분석 리더보드에서 놀라운 차트를 보여주었다. 이는 API 보조금 때문인지, 아니면 모델 최적화가 이뤄졌기 때문인지에 대한 의문을 불러일으킨다.

r/LocalLLaMA
News·

catmind-1.2b 모델 소개

catmind-1.2b는 LFM2.5-1.2B-thinking 모델을 기반으로 한 고양이 관련 이야기 생성 모델이다. 이 모델은 사용자의 질문에 대해 관련 없는 고양이 이야기를 생성하며, 정확도는 24.3%로 LFM2.5-1.2B-Thinking의 75.6%와 LFM2.5-1.2B-Instruct의 49.2%에 비해 낮다. 이 모델은 진지한 작업에 사용하지 않는 것이 권장된다.

r/LocalLLaMA
News·

Kimi K3 모델, AI 비즈니스 모델에 위협

중국 스타트업 Moonshot의 Kimi K3 AI 모델은 2.8조 개의 파라미터를 가진 최신 오픈 웨이트 모델로, Nvidia GPU 클러스터가 필요하며 수백만 달러의 비용이 들 수 있다. 미국의 프론티어 연구소들은 Kimi 모델이 최전선에서 성능을 발휘하고 있어 우려하고 있으며, 미국 정부는 AI 모델의 시장 출시를 한 달간 보류 요청하고 있다. 이는 미국 기업들이 모델을 비공식적으로 비밀리에 유지하고 소프트웨어 사업을 구축하는 방향으로 나아갈 수 있음을 시사한다.

Semafor Technology
News·

GLM-5.2의 753B 파라미터와 1M 컨텍스트의 현실

GLM-5.2는 753B 파라미터와 1M 컨텍스트를 제공하며 MIT 라이센스를 적용받고 있다. 그러나 이러한 대규모 모델은 일반 사용자들이 자가 호스팅하기에는 현실적으로 불가능하며, 대부분의 사용자는 API를 통해 접근해야 한다. 이로 인해 자가 호스팅에 대한 관심이 줄어들고 있다는 의견이 제기되었다.

r/LocalLLaMA
News·

Thinky의 Inkling 모델: 975B 파라미터와 1M 토큰 컨텍스트 지원

Thinky는 Inkling이라는 새로운 오픈 모델을 발표했다. Inkling은 총 975B 파라미터와 41B 활성 파라미터를 가진 Mixture-of-Experts 트랜스포머 모델로, 텍스트, 이미지, 오디오를 지원하며 최대 1M 토큰의 컨텍스트 윈도우를 제공한다. 이 모델은 45조 개의 훈련 토큰으로 사전 훈련되었으며, Inkling-Small이라는 12B 활성 파라미터를 가진 경량 모델도 함께 공개되었다. 두 모델 모두 Apache 2.0 라이센스를 따른다.

Latent Space (swyx & Alessio)
News·

Inkling: Thinking Machines Lab의 오픈 웨이트 모델

Mira Murati의 Thinking Machines Lab이 첫 번째 오픈 웨이트 모델인 Inkling을 출시했다. Inkling은 975B의 총 파라미터와 41B의 활성 파라미터를 가진 Mixture-of-Experts 트랜스포머로, 45조 개의 텍스트, 이미지, 오디오, 비디오로 훈련된 Apache-2.0 라이센스의 다중 모달 모델이다. 또한, 276B(12B 활성) 파라미터를 가진 Inkling-Small 모델이 테스트 중이며, 완료 후 가중치가 공개될 예정이다.

Simon Willison's Weblog
News·

Amazon Bedrock에서 일반 제공되는 xAI의 Grok 4.3

xAI의 Grok 4.3가 Amazon Bedrock에서 일반 제공되며, 긴 입력에 대해 신뢰성 있는 추론을 제공하는 모델이다. Grok 4.3는 구성 가능한 추론 노력을 제공하고, 텍스트 및 이미지 입력을 수용하며, 100만 토큰의 컨텍스트 창을 가진다. 이 모델은 Mantle이라는 차세대 추론 엔진에서 실행된다. Grok 4.3는 고객 지원 시나리오에서 도구 호출 및 문서 이해를 위한 벤치마크에서 1위를 기록했다.

AWS Machine Learning Blog
News·

Moonshot AI, Kimi K3 모델 발표 및 성능

Moonshot AI가 Kimi K3 모델을 발표했다. 이 모델은 2.8조 개의 파라미터를 가지고 있으며, 현재 웹사이트와 API를 통해 이용 가능하다. Kimi K3는 '오픈 3T 클래스 모델'로 불리며, DeepSeek의 1.6T v4 Pro보다 성능이 우수하다. K3의 작업당 비용은 $0.94로, GPT-5.6 Sol의 $1.04와 비슷하며, Opus 4.8의 $1.80보다 낮다. K3는 Arena.ai의 Frontend Code arena에서 가장 높은 성능을 기록하고 있다.

Simon Willison's Weblog
News·

Kimi K3 2.8T-A50B: 가장 큰 오픈 모델 출시

Moonshot AI가 Kimi K3를 2.8T의 총 파라미터와 1M 토큰 컨텍스트를 갖춘 오픈 모델로 출시했다. Kimi K3는 Kimi Delta Attention(KDA)와 Attention Residuals 기능을 포함하며, 2026년 7월 27일까지 오픈 가중치가 제공될 예정이다. Kimi K3는 Frontend Code Arena에서 1679점을 기록하며 1위를 차지했고, Text Arena에서는 9위에 올랐다.

Latent Space (swyx & Alessio)
News·

Thinking Machines, Inkling 모델 출시 및 GLM-5.2 기능 업데이트

Thinking Machines가 첫 번째 오픈 웨이트 모델인 Inkling을 출시했다. Inkling은 1M 토큰의 컨텍스트 윈도우를 가지고 있으며 텍스트, 이미지 및 오디오에서 작동한다. Inkling은 Thinking Machines의 파인튜닝 플랫폼 Tinker에서 사용 가능하다. GLM-5.2는 현재 최고의 오픈 소스 모델 중 하나로, 많은 스타트업이 프론티어 모델에서 자가 호스팅된 파인튜닝 버전으로 작업을 전환하고 있다. GPT-5.6 Sol은 OpenAI의 내부 모델인 GPT-Red의 도움을 받아 안전성을 높였다. 구글의 Gemini Spark는 Docs 편집, Sheets/Slides의 댓글 읽기 및 병렬 작업 기능을 추가하여 50% 더 빨라졌다.

Ben's Bites (Ben Tossell)
News·

Meta, Muse Spark 1.1 출시 및 가격 공개

마크 저커버그가 3년 만에 X에 게시글을 올리며 Muse Spark 1.1을 발표했다. Muse Spark 1.1은 Meta Superintelligence Labs의 두 번째 모델로, 가격은 입력 토큰 100만 개당 1.25달러, 출력 토큰 100만 개당 4.25달러이다. 또한 OpenAI와 호환되는 API와 폐쇄형 가중치를 제공한다. Muse Spark 1.1 출시 이틀 전에는 첫 이미지 생성 모델인 Muse Image도 공개되었으며, Meta는 AI 인프라를 외부 고객에게 판매하기 위한 클라우드 사업인 Meta Compute를 구축 중이다.

TheSequence (Jesus Rodriguez)
News·

매튜 버먼, GPT-5.6 리뷰에서 소수점 업그레이드 아닌 이유 언급

유튜버 매튜 버먼이 GPT-5.6을 리뷰하며 '이건 그냥 소수점 업그레이드로 낼 만한 게 아니다'라고 언급했다. GPT-5.6은 자율 작업 시간과 성능 측정 방식이 변화하고 있으며, 2시간 자율 작업, 일주일 자율 실행, 20만 달러의 토큰 사용 등의 사례가 있다. OpenAI는 디자인 감각을 강조하며 웹사이트, 모션 그래픽, 3D 시뮬레이션을 포함한 다양한 기능을 제공하고 있다.

AI 코리아 커뮤니티 뉴스레터
News·

Nemotron Labs: 기업과 국가를 위한 신뢰할 수 있고 맞춤형 AI 구축

Nemotron Labs 블로그 시리즈는 최신 오픈 모델과 데이터셋, 훈련 기법이 기업들이 NVIDIA 플랫폼에서 전문화된 AI 시스템과 애플리케이션을 구축하는 데 어떻게 도움이 되는지를 탐구한다. 오픈 모델은 기업들이 AI를 맞춤화하고 통제할 수 있도록 하며, Nemotron과 같은 모델을 통해 특정 비즈니스 요구에 맞는 AI를 구축할 수 있다. 예를 들어, Abridge는 임상 대화를 위한 최초의 기초 모델을 구축하고, H Company는 Nemotron 3 Nano Omni를 사용해 76% 이상의 정확도를 달성했다. 또한, LangChain은 Nemotron 3 Ultra를 조정하여 약 10배 낮은 비용으로 최상위 에이전트 정확도를 기록했다.

NVIDIA Blog
News·

OpenAI의 GPT-5.6-Sol 출시 및 가격 정보

OpenAI의 GPT-5.6-Sol 모델이 출시되었으며, 가격은 $5/$30이다. Terra는 $2.50/$15, Luna는 $1/$6로 책정되었다. GPT-5.6은 AI 연구 가속화에 가장 강력한 모델로, 내부 연구자들이 이를 통해 평균 일일 출력 토큰 수가 GPT-5.5의 두 배 이상 증가했다고 보고되었다.

Don't Worry About the Vase (Zvi Mowshowitz)
News·

Claude Fable 5 사용 가능 기간 연장

Anthropic은 Claude Max 플랜에서 Fable 5 접근을 7월 19일까지 연장한다고 발표했다. 사용자는 주간 사용 한도의 절반까지 Fable 5를 사용할 수 있으며, 이후에는 사용 크레딧을 통해 계속 사용할 수 있다. OpenAI는 GPT-5.6 Sol의 접근 제한을 필요로 하지 않을 것이라고 밝혔다.

Simon Willison's Weblog
News·

OpenAI의 GPT-5.6, Grok 4.5, Muse Spark 1.1 출시 및 AI 모델 경쟁

OpenAI는 GPT-5.6을 출시하며 모델을 Sol, Terra, Luna로 분리하고, 프로그램 도구 호출 기능을 추가했다. GPT-Live는 전이중 아키텍처를 통해 인간-기계 협업을 개선하고, ChatGPT Work는 여러 앱과 파일에서 작업을 수행하며 편집 가능한 문서를 생성할 수 있다. Meta의 Muse Spark 1.1은 백만 토큰 컨텍스트 윈도우와 멀티모달 인식을 결합하고, Grok 4.5는 코딩 및 지식 작업을 위한 애플리케이션 생성을 지원한다. 이들 모델은 저렴한 가격으로 신뢰할 수 있는 작업 단위를 제공하기 위한 경쟁을 벌이고 있다.

TheSequence (Jesus Rodriguez)
News·

Amazon SageMaker AI에서 Unsloth를 이용한 양자화 모델 배포

대형 기초 모델을 원래의 16비트 부동소수점 정밀도로 저장하면 비용이 많이 든다. 양자화는 모델의 가중치 정밀도를 줄여 메모리 사용량을 크게 줄인다. 동적 양자화는 메모리 사용량을 줄이면서 정확도를 유지할 수 있는 방법이다. Unsloth는 기초 모델을 미세 조정하고 양자화하는 도구로, 동적 양자화는 각 레이어의 정밀도 손실에 대한 민감도를 분석하여 중요한 레이어는 높은 정밀도로 유지하고 덜 중요한 레이어는 공격적으로 양자화한다. AWS에서 배포할 때 양자화는 인스턴스 결정, 시작 및 저장 프로필, 배포 유연성에 영향을 미친다.

AWS Machine Learning Blog