본문으로 건너뛰기

Category

AI 모델·API

AI 모델·API는 Claude, GPT, Gemini 같은 모델을 호출해 쓰는 접점이다. 모델 선택, 컨텍스트 한도, 토큰 가격, 프롬프트 캐싱, 스트리밍, 도구 호출 규격이 여기 묶인다. 모델마다 강점과 과금이 달라, 작업별 라우팅과 캐싱 설계가 비용을 좌우한다.

News·

Basalt Labs, HLE에서 99.44% 주장과 DeepSeek 모델 제공

Basalt Labs는 HLE에서 99.44%의 성능을 주장하며, 그들이 공개한 모델은 Qwen2.5-7B-Instruct 기반이다. 또한, 그들이 웹사이트에서 제공하는 모델은 DeepSeek이다.

r/LocalLLaMA
News·

Deepseek의 가격 대비 성능 분석

Deepseek는 가격 대비 성능에서 항상 우수한 평가를 받아왔으며, 최근 Kimi K3 점수에 대한 인공지능 분석 리더보드에서 놀라운 차트를 보여주었다. 이는 API 보조금 때문인지, 아니면 모델 최적화가 이뤄졌기 때문인지에 대한 의문을 불러일으킨다.

r/LocalLLaMA
News·

catmind-1.2b 모델 소개

catmind-1.2b는 LFM2.5-1.2B-thinking 모델을 기반으로 한 고양이 관련 이야기 생성 모델이다. 이 모델은 사용자의 질문에 대해 관련 없는 고양이 이야기를 생성하며, 정확도는 24.3%로 LFM2.5-1.2B-Thinking의 75.6%와 LFM2.5-1.2B-Instruct의 49.2%에 비해 낮다. 이 모델은 진지한 작업에 사용하지 않는 것이 권장된다.

r/LocalLLaMA
News·

Kimi K3 모델, AI 비즈니스 모델에 위협

중국 스타트업 Moonshot의 Kimi K3 AI 모델은 2.8조 개의 파라미터를 가진 최신 오픈 웨이트 모델로, Nvidia GPU 클러스터가 필요하며 수백만 달러의 비용이 들 수 있다. 미국의 프론티어 연구소들은 Kimi 모델이 최전선에서 성능을 발휘하고 있어 우려하고 있으며, 미국 정부는 AI 모델의 시장 출시를 한 달간 보류 요청하고 있다. 이는 미국 기업들이 모델을 비공식적으로 비밀리에 유지하고 소프트웨어 사업을 구축하는 방향으로 나아갈 수 있음을 시사한다.

Semafor Technology
News·

GLM-5.2의 753B 파라미터와 1M 컨텍스트의 현실

GLM-5.2는 753B 파라미터와 1M 컨텍스트를 제공하며 MIT 라이센스를 적용받고 있다. 그러나 이러한 대규모 모델은 일반 사용자들이 자가 호스팅하기에는 현실적으로 불가능하며, 대부분의 사용자는 API를 통해 접근해야 한다. 이로 인해 자가 호스팅에 대한 관심이 줄어들고 있다는 의견이 제기되었다.

r/LocalLLaMA
News·

Thinky의 Inkling 모델: 975B 파라미터와 1M 토큰 컨텍스트 지원

Thinky는 Inkling이라는 새로운 오픈 모델을 발표했다. Inkling은 총 975B 파라미터와 41B 활성 파라미터를 가진 Mixture-of-Experts 트랜스포머 모델로, 텍스트, 이미지, 오디오를 지원하며 최대 1M 토큰의 컨텍스트 윈도우를 제공한다. 이 모델은 45조 개의 훈련 토큰으로 사전 훈련되었으며, Inkling-Small이라는 12B 활성 파라미터를 가진 경량 모델도 함께 공개되었다. 두 모델 모두 Apache 2.0 라이센스를 따른다.

Latent Space (swyx & Alessio)
News·

Inkling: Thinking Machines Lab의 오픈 웨이트 모델

Mira Murati의 Thinking Machines Lab이 첫 번째 오픈 웨이트 모델인 Inkling을 출시했다. Inkling은 975B의 총 파라미터와 41B의 활성 파라미터를 가진 Mixture-of-Experts 트랜스포머로, 45조 개의 텍스트, 이미지, 오디오, 비디오로 훈련된 Apache-2.0 라이센스의 다중 모달 모델이다. 또한, 276B(12B 활성) 파라미터를 가진 Inkling-Small 모델이 테스트 중이며, 완료 후 가중치가 공개될 예정이다.

Simon Willison's Weblog
News·

Amazon Bedrock에서 일반 제공되는 xAI의 Grok 4.3

xAI의 Grok 4.3가 Amazon Bedrock에서 일반 제공되며, 긴 입력에 대해 신뢰성 있는 추론을 제공하는 모델이다. Grok 4.3는 구성 가능한 추론 노력을 제공하고, 텍스트 및 이미지 입력을 수용하며, 100만 토큰의 컨텍스트 창을 가진다. 이 모델은 Mantle이라는 차세대 추론 엔진에서 실행된다. Grok 4.3는 고객 지원 시나리오에서 도구 호출 및 문서 이해를 위한 벤치마크에서 1위를 기록했다.

AWS Machine Learning Blog
News·

Moonshot AI, Kimi K3 모델 발표 및 성능

Moonshot AI가 Kimi K3 모델을 발표했다. 이 모델은 2.8조 개의 파라미터를 가지고 있으며, 현재 웹사이트와 API를 통해 이용 가능하다. Kimi K3는 '오픈 3T 클래스 모델'로 불리며, DeepSeek의 1.6T v4 Pro보다 성능이 우수하다. K3의 작업당 비용은 $0.94로, GPT-5.6 Sol의 $1.04와 비슷하며, Opus 4.8의 $1.80보다 낮다. K3는 Arena.ai의 Frontend Code arena에서 가장 높은 성능을 기록하고 있다.

Simon Willison's Weblog
News·

Kimi K3 2.8T-A50B: 가장 큰 오픈 모델 출시

Moonshot AI가 Kimi K3를 2.8T의 총 파라미터와 1M 토큰 컨텍스트를 갖춘 오픈 모델로 출시했다. Kimi K3는 Kimi Delta Attention(KDA)와 Attention Residuals 기능을 포함하며, 2026년 7월 27일까지 오픈 가중치가 제공될 예정이다. Kimi K3는 Frontend Code Arena에서 1679점을 기록하며 1위를 차지했고, Text Arena에서는 9위에 올랐다.

Latent Space (swyx & Alessio)
News·

Thinking Machines, Inkling 모델 출시 및 GLM-5.2 기능 업데이트

Thinking Machines가 첫 번째 오픈 웨이트 모델인 Inkling을 출시했다. Inkling은 1M 토큰의 컨텍스트 윈도우를 가지고 있으며 텍스트, 이미지 및 오디오에서 작동한다. Inkling은 Thinking Machines의 파인튜닝 플랫폼 Tinker에서 사용 가능하다. GLM-5.2는 현재 최고의 오픈 소스 모델 중 하나로, 많은 스타트업이 프론티어 모델에서 자가 호스팅된 파인튜닝 버전으로 작업을 전환하고 있다. GPT-5.6 Sol은 OpenAI의 내부 모델인 GPT-Red의 도움을 받아 안전성을 높였다. 구글의 Gemini Spark는 Docs 편집, Sheets/Slides의 댓글 읽기 및 병렬 작업 기능을 추가하여 50% 더 빨라졌다.

Ben's Bites (Ben Tossell)
News·

Meta, Muse Spark 1.1 출시 및 가격 공개

마크 저커버그가 3년 만에 X에 게시글을 올리며 Muse Spark 1.1을 발표했다. Muse Spark 1.1은 Meta Superintelligence Labs의 두 번째 모델로, 가격은 입력 토큰 100만 개당 1.25달러, 출력 토큰 100만 개당 4.25달러이다. 또한 OpenAI와 호환되는 API와 폐쇄형 가중치를 제공한다. Muse Spark 1.1 출시 이틀 전에는 첫 이미지 생성 모델인 Muse Image도 공개되었으며, Meta는 AI 인프라를 외부 고객에게 판매하기 위한 클라우드 사업인 Meta Compute를 구축 중이다.

TheSequence (Jesus Rodriguez)
News·

매튜 버먼, GPT-5.6 리뷰에서 소수점 업그레이드 아닌 이유 언급

유튜버 매튜 버먼이 GPT-5.6을 리뷰하며 '이건 그냥 소수점 업그레이드로 낼 만한 게 아니다'라고 언급했다. GPT-5.6은 자율 작업 시간과 성능 측정 방식이 변화하고 있으며, 2시간 자율 작업, 일주일 자율 실행, 20만 달러의 토큰 사용 등의 사례가 있다. OpenAI는 디자인 감각을 강조하며 웹사이트, 모션 그래픽, 3D 시뮬레이션을 포함한 다양한 기능을 제공하고 있다.

AI 코리아 커뮤니티 뉴스레터
News·

Nemotron Labs: 기업과 국가를 위한 신뢰할 수 있고 맞춤형 AI 구축

Nemotron Labs 블로그 시리즈는 최신 오픈 모델과 데이터셋, 훈련 기법이 기업들이 NVIDIA 플랫폼에서 전문화된 AI 시스템과 애플리케이션을 구축하는 데 어떻게 도움이 되는지를 탐구한다. 오픈 모델은 기업들이 AI를 맞춤화하고 통제할 수 있도록 하며, Nemotron과 같은 모델을 통해 특정 비즈니스 요구에 맞는 AI를 구축할 수 있다. 예를 들어, Abridge는 임상 대화를 위한 최초의 기초 모델을 구축하고, H Company는 Nemotron 3 Nano Omni를 사용해 76% 이상의 정확도를 달성했다. 또한, LangChain은 Nemotron 3 Ultra를 조정하여 약 10배 낮은 비용으로 최상위 에이전트 정확도를 기록했다.

NVIDIA Blog
News·

OpenAI의 GPT-5.6-Sol 출시 및 가격 정보

OpenAI의 GPT-5.6-Sol 모델이 출시되었으며, 가격은 $5/$30이다. Terra는 $2.50/$15, Luna는 $1/$6로 책정되었다. GPT-5.6은 AI 연구 가속화에 가장 강력한 모델로, 내부 연구자들이 이를 통해 평균 일일 출력 토큰 수가 GPT-5.5의 두 배 이상 증가했다고 보고되었다.

Don't Worry About the Vase (Zvi Mowshowitz)
News·

Claude Fable 5 사용 가능 기간 연장

Anthropic은 Claude Max 플랜에서 Fable 5 접근을 7월 19일까지 연장한다고 발표했다. 사용자는 주간 사용 한도의 절반까지 Fable 5를 사용할 수 있으며, 이후에는 사용 크레딧을 통해 계속 사용할 수 있다. OpenAI는 GPT-5.6 Sol의 접근 제한을 필요로 하지 않을 것이라고 밝혔다.

Simon Willison's Weblog
News·

OpenAI의 GPT-5.6, Grok 4.5, Muse Spark 1.1 출시 및 AI 모델 경쟁

OpenAI는 GPT-5.6을 출시하며 모델을 Sol, Terra, Luna로 분리하고, 프로그램 도구 호출 기능을 추가했다. GPT-Live는 전이중 아키텍처를 통해 인간-기계 협업을 개선하고, ChatGPT Work는 여러 앱과 파일에서 작업을 수행하며 편집 가능한 문서를 생성할 수 있다. Meta의 Muse Spark 1.1은 백만 토큰 컨텍스트 윈도우와 멀티모달 인식을 결합하고, Grok 4.5는 코딩 및 지식 작업을 위한 애플리케이션 생성을 지원한다. 이들 모델은 저렴한 가격으로 신뢰할 수 있는 작업 단위를 제공하기 위한 경쟁을 벌이고 있다.

TheSequence (Jesus Rodriguez)
News·

Amazon SageMaker AI에서 Unsloth를 이용한 양자화 모델 배포

대형 기초 모델을 원래의 16비트 부동소수점 정밀도로 저장하면 비용이 많이 든다. 양자화는 모델의 가중치 정밀도를 줄여 메모리 사용량을 크게 줄인다. 동적 양자화는 메모리 사용량을 줄이면서 정확도를 유지할 수 있는 방법이다. Unsloth는 기초 모델을 미세 조정하고 양자화하는 도구로, 동적 양자화는 각 레이어의 정밀도 손실에 대한 민감도를 분석하여 중요한 레이어는 높은 정밀도로 유지하고 덜 중요한 레이어는 공격적으로 양자화한다. AWS에서 배포할 때 양자화는 인스턴스 결정, 시작 및 저장 프로필, 배포 유연성에 영향을 미친다.

AWS Machine Learning Blog
News·

MS, 오픈AI의 GPT-5.6을 MS 365 코파일럿의 권장 모델로 채택

마이크로소프트(MS)는 오픈AI의 최신 모델 'GPT-5.6'을 MS 365 코파일럿의 권장 모델로 채택했다고 발표했다. 이는 오픈AI와 앤트로픽 모델에 대한 의존도를 줄이기 위한 노력의 일환으로, 작업의 성격에 따라 서로 다른 AI 모델을 활용하는 '멀티모델 라우팅' 전략으로 해석된다. 오픈AI는 9일(현지시간) GPT-5.6의 정식 서비스를 시작했다.

AI타임스
News·

Anthropic, Claude Sonnet 5 출시 및 Fable 5 재출시 승인

Anthropic은 Claude Sonnet 5를 새로운 기본 중간 모델로 출시하였으며, Fable/Mythos 5는 정부와의 협업 후 재출시가 승인되었다. Sonnet 5는 1M 토큰의 컨텍스트 윈도우를 제공하며, 가격은 입력 토큰 $3/M, 출력 토큰 $15/M로 유지되지만, 8월 31일까지 프로모션 가격으로 각각 $2/M, $10/M이 적용된다. Sonnet 5는 코딩 및 도구 사용 성능이 뛰어나며, 안전성이 개선되었다고 전해진다.

Latent Space (swyx & Alessio)
News·

Muse Spark 1.1 출시

Meta가 Muse Spark 1.1을 출시했다. 이는 첫 번째 Spark 모델로 API를 제공하며, 에이전트 도구 호출 및 컴퓨터 사용에서 상당한 개선이 이루어졌다고 한다. 사용자는 CLI 및 Python 라이브러리를 통해 모델에 접근할 수 있는 llm-meta-ai 플러그인을 설치할 수 있다.

Simon Willison's Weblog
News·

OpenAI의 GPT-5.6 모델 출시: Luna, Terra, Sol

OpenAI의 최신 모델 GPT-5.6이 출시되었으며, Luna, Terra, Sol의 세 가지 크기로 제공된다. 가격은 Luna가 1달러, Terra가 2.50달러, Sol이 5달러로 설정되어 있다. 모든 모델은 2026년 2월 16일 기준 지식을 가지고 있으며, 최대 128,000개의 출력 토큰을 지원한다. GPT-5.6 Sol은 'Agents’ Last Exam'에서 53.6점을 기록하며 Claude Fable 5를 13.1점 초과하여 성능이 우수함을 입증했다. 새로운 API 기능으로는 프로그램적 도구 호출, 다중 에이전트 지원, 프롬프트 캐시 브레이크포인트 설정 등이 있다.

Simon Willison's Weblog
News·

Amazon SageMaker AI의 NVIDIA Nemotron 3 모델 서버리스 커스터마이징

Amazon SageMaker AI는 NVIDIA Nemotron 3 모델에 대한 서버리스 모델 커스터마이징을 도입했다. Nemotron 3 Nano(30B 총 파라미터, 3B 활성)와 Nemotron 3 Super(120B 총 파라미터, 12B 활성) 모델을 지원하며, 감독 학습(SFT), 검증 가능한 보상을 통한 강화 학습(RLVR), AI 피드백을 통한 강화 학습(RLAIF) 기법을 활용해 특정 도메인과 워크플로우에 맞게 조정할 수 있다. Nemotron 3은 하이브리드 Mamba-Transformer Mixture-of-Experts 아키텍처를 기반으로 하며, 최대 1M 토큰 컨텍스트 길이를 지원한다.

AWS Machine Learning Blog
News·

Tencent HY3 모델, 128GB에서 성능 테스트

Tencent의 HY3 모델(295B-A21B MoE)은 DeepSeek v4 Flash와 비슷한 크기에서 더 나은 성능을 보이며, 128GB Macbook M5 Max에서 테스트된 결과, 토큰 생성 속도가 DeepSeek보다 두 배 빠르고 품질도 동등하거나 더 나은 것으로 나타났다. 모델 실행을 위해 llama.cpp의 PR #25395를 사용하여 지원을 추가하고, GPU 메모리 한계를 122GB로 설정해야 했다. 성능 테스트 결과, 빈 컨텍스트에서 528 tokens/sec, 16K 컨텍스트에서 124 tokens/sec의 속도를 기록했다.

r/LocalLLaMA