본문으로 건너뛰기

Category

AI 모델·API

AI 모델·API는 Claude, GPT, Gemini 같은 모델을 호출해 쓰는 접점이다. 모델 선택, 컨텍스트 한도, 토큰 가격, 프롬프트 캐싱, 스트리밍, 도구 호출 규격이 여기 묶인다. 모델마다 강점과 과금이 달라, 작업별 라우팅과 캐싱 설계가 비용을 좌우한다.

News·

Google, Gemini 3.7 Flash 발표

Google은 Gemini 3.7 Flash를 발표하며, 이는 3.6 Flash를 대체하는 모델이다. Gemini 3.7 Flash는 코딩 및 에이전트 성능 개선을 목표로 하며, 이전 Flash 버전보다 코딩 성능이 향상되었다. FrontierCode 1.1 Main 테스트에서 34.4%에서 43.6%로, DeepSWE v1.1에서는 49%에서 65.3%로 상승했다. GDP.pdf 벤치마크는 22%에서 34%로, AutomationBench는 17%에서 30.4%로 증가했다.

Ars Technica — AI
News·

GLM 5.3 출시

GLM 5.3이 공식 발표되었다. 자세한 내용은 [공식 블로그](https://z.ai/blog/glm-5.3)에서 확인할 수 있다.

r/LocalLLaMA
News·

SpaceX의 Grok 4.6 모델 출시 및 성능

SpaceX 팀이 Grok 4.6 모델을 출시했다. Grok 4.6은 1.5T 모델로, Grok 4.5보다 긴 보조 훈련을 거쳤으며, 지식 작업, 일반 코딩, 웹 개발, 컴퓨터 지원 설계 등 다양한 작업에 최적화되어 있다. Grok 4.6은 가격 대비 성능에서 우수한 평가를 받았으며, 입력/출력 토큰당 $2/$6로 경쟁 모델보다 저렴하다. Grok 4.7의 초기 훈련도 이미 완료되었다.

Latent Space (swyx & Alessio)
News·

DeepSeek V4 Pro 0813 모델 API 출시

DeepSeek V4 Pro 모델이 API를 통해 출시되었으며, 1.7T 파라미터와 893GB의 가중치가 Hugging Face에서 제공된다. 이전 모델인 DeepSeek V4-Pro와 DeepSeek V4-Flash의 가중치가 공개된 바 있어, 이번 모델의 가중치도 공개될 가능성이 높다.

Simon Willison's Weblog
News·

Qwen 3.8 모델의 Jinja 채팅 템플릿 수정 사항

Qwen은 3.8 모델을 출시했다. 3.8의 주요 추가 기능은 prompt-steered reasoning effort로, <code>reasoning_effort</code>를 <code>xhigh</code>, <code>medium</code>, <code>low</code>로 설정하여 모델의 사고 깊이를 조절할 수 있다. 그러나 공식 템플릿에는 여러 문제가 있으며, 이를 해결한 Jinja 템플릿이 제공된다. 이 템플릿은 3.8의 reasoning effort를 지원하고, 사고 전환 기능을 복원하며, KV Cache를 100% 활용하고, Python dict와 JSON 문자열을 모두 처리할 수 있다.

r/LocalLLaMA
News·

Azure Content Understanding의 GPT-5 시리즈 지원 확대 및 개선 사항

Azure Content Understanding은 GPT-5, GPT-5.1, GPT-5.2, GPT-5.4, GPT-5.5 시리즈 모델을 지원하며, 문서, 이미지, 비디오 및 음성 분석을 포함한 다양한 작업에 최적화된 파이프라인을 제공한다. 새로운 기초 모델의 도입으로, 총 추론 토큰 사용량이 최대 28% 감소하고, LLM 비용이 최대 25% 절감되며, 신뢰도 점수와 기초 정확도가 각각 최대 14% 및 3% 향상되었다. 모델 선택 가이드를 통해 고객은 예산, 품질, 지역 가용성 등을 고려하여 적합한 모델을 선택할 수 있다.

Microsoft Foundry Blog (Azure AI)
News·

Alibaba, Qwen3.8-2.4T-A95B 모델의 오픈 가중치 공개

Alibaba는 Qwen3.8-2.4T-A95B(Qwen3.8-Max)라는 가장 큰 오픈 가중치 모델의 오픈 가중치를 공개했다. 이 모델은 총 2.4조 개의 파라미터를 가지고 있으며, 토큰당 950억 개가 활성화된다. 또한, 세밀한 전문가 혼합(MoE) 아키텍처와 전체 및 선형 주의(hybrid of full and linear attention)를 혼합한 구조를 갖추고 있다.

NVIDIA Technical Blog
News·

Qwen3.8-2.4T-A95B 출시

Qwen3.8-2.4T-A95B가 출시되었다. 관련 링크는 Hugging Face에서 확인할 수 있다.

r/LocalLLaMA
News·

Meta의 Muse Glimmer 모델 소개

Meta는 새로운 30B 모델인 Muse Glimmer를 Apache 2.0 라이선스 하에 공개했다. Muse Glimmer는 DeepSearch QA, MCP-Atlas, 𝛕-Bench, SWE-Bench와 같은 전체 작업 벤치마크에서 높은 성공률을 기록하며, 코드 작성 및 디버깅, 다단계 요청 해결에 최적화되어 있다. 또한, 다양한 함수 호출을 처리하고, 복잡한 워크플로우에서 일관된 계획을 유지하는 다단계 추론 기능을 갖추고 있다.

Simon Willison's Weblog
News·

Meta의 Muse Glimmer 출시: 30B 모델과 120K+ 컨텍스트 윈도우

Meta는 Muse Glimmer를 오픈 소스로 출시했다. Muse Glimmer는 30B 오픈 웨이트 밀집 모델로, 120K 이상의 컨텍스트 윈도우를 갖추고 있으며, 로컬 AI 에이전트 작업을 위해 설계되었다. 이 모델은 NVIDIA의 엣지, 데스크탑, 워크스테이션 AI 플랫폼에서 최적화되어 있으며, 단일 GPU에서 20K 토큰/초의 속도로 데이터를 처리하고 복잡한 작업을 수행할 수 있다.

NVIDIA Technical Blog
News·

Muse Glimmer: 30B 오픈 웨이트 모델 출시

Muse Glimmer는 30B 파라미터를 가진 오픈 웨이트 모델로, 로컬 에이전트 워크플로우에 최적화되어 있다. 이 모델은 100개 이상의 언어로 훈련되었으며, 멀티모달 기능을 제공한다. 전체 정밀도에서 30B 모델은 55GB 이상의 메모리를 요구하지만, 4비트로 양자화하여 20GB 이하로 줄일 수 있다. 또한, DFlash 기반의 경량 드래프터를 통해 토큰 블록을 제안하고, 에이전틱 작업에서 최소한의 성능 저하로 작업을 수행할 수 있다.

r/LocalLLaMA
News·

2026년 8월 최고의 로컬 LLM

오픈 웨이트 모델에 대한 산업 연합이 결성되었으며, 이는 폐쇄형 모델에 대한 대응으로 나타났다. 사용자들은 현재 사용 중인 모델과 그 이유를 공유하고, LLM 평가의 어려움에 대해 자세히 설명할 것을 권장받고 있다. 추천 모델은 메모리 풋프린트에 따라 분류할 수 있으며, 다양한 VRAM 범주가 제시된다.

r/LocalLLaMA
News·

네이버 플레이스 AI MLOps의 vLLM 기반 모델 서빙 성능 최적화

네이버 플레이스 AI MLOps는 지난 1년간 검색과 추천에 사용하는 스코어링 모델의 서빙 구조를 vLLM 기반으로 전환했다. 0.6B 재순위화 모델을 Hugging Face의 Transformer.encode로 서빙했을 때 처리량은 63.85 QPS였으나, vLLM의 score 태스크로 옮기자 397.21 QPS로 약 6.2배 증가했다. 속성 기반 감성 모델의 p50 지연 시간은 101.22ms에서 16.43ms로 83.8% 감소했고, CLIP 기반 이미지 랭킹 모델의 처리량은 3.76 img/s에서 62.2 img/s로 16.5배 증가했다.

네이버 D2
News·

GitHub Models 서비스 종료

GitHub Models가 종료되었으며, 이에 따라 GitHub Actions에서 해당 모델을 사용할 수 없게 되었다. GitHub Models는 여러 LLM 제공업체에 대한 통합 API와 모델 플레이그라운드 도구를 제공했으며, GitHub Actions 내에서 GitHub API 키를 사용하여 프롬프트를 실행할 수 있는 장점이 있었다. 종료 이유는 명시되지 않았으나, 코딩 에이전트 패턴으로 인해 무료 또는 보조된 토큰 제공이 어려워졌을 것으로 추측된다. 사용자는 GitHub Models 대신 OpenAI API 키를 사용하여 GPT-5.6 Luna로 요약을 생성하고 있다.

Simon Willison's Weblog
News·

Claude Fable 5 및 Claude Mythos 5 모델 접근 중단 및 복구

Claude Fable 5와 Claude Mythos 5는 2026년 6월 9일에 처음 출시되었다. 2026년 6월 12일, Anthropic은 미국 상무부의 수출 통제를 준수하기 위해 두 모델에 대한 접근을 중단했으며, 2026년 6월 30일에 해당 통제가 해제되자 7월 1일에 접근을 복구했다. Claude는 이러한 사건에 대해 사실적으로 확인하며, 개인적인 의견을 공유하지 않고 관련 정보를 제공한다.

Simon Willison's Weblog
News·

스페이스XAI, 이미지 생성·편집 모델 ‘이매진 이미지 2.0’ 출시

스페이스XAI가 8일(현지시간) 이미지 생성·편집 모델 ‘이매진 이미지 2.0(Imagine Image 2.0)’을 출시했다. 이 모델은 복잡한 레이아웃, 정확한 텍스트 표현, 반복적인 이미지 편집, 캐릭터와 배경의 시각적 일관성 유지에 중점을 두고 있다. 이매진 이미지 2.0은 스페이스XAI의 웹 기반 이미지 생성 서비스와 그록(Grok)의 iOS·안드로이드 앱에서 새로운 ‘퀄리티 모드(Quality Mode)’로 제공되며, API는 앞으로 제공될 예정이다.

AI타임스
News·

Kimi K3 모델 크기 711GB에서 478GB로 축소

Kimi K3 모델에서 다국어 기능을 제거하여 크기를 711GB에서 478GB로 줄였다. 이 모델은 영어만 유지되며, 나머지 기능은 그대로 intact하다. Kimi-K3-REAP-512GB-GGUF 2비트 모델은 Kimi K2.7보다 더 정확할 것으로 예상되며, 특정 환경에서 성능 차이가 있을 수 있다.

r/LocalLLaMA
News·

DeepSeek-V4-Flash API 공개 베타 출시 및 성능 향상

DeepSeek은 DeepSeek-V4-Flash API의 공식 공개 베타를 출시하였으며, 이 API는 V4-Pro-Preview를 초월하는 향상된 에이전트 기능을 제공한다. Terminal-Bench에서 82.7의 점수를 기록하며, 이는 이전의 56.9에서 +25.8 상승한 수치이다. 모델은 284B의 총 파라미터를 가지며, 1M 입력/출력 토큰당 $0.14/$0.28의 가격으로 제공된다. 또한, 98%의 캐시 적중 할인으로 $0.0028/1M 캐시된 토큰의 가격을 제공한다. 오픈 웨이트는 MIT 라이센스 하에 Hugging Face에 배포되었다.

Latent Space (swyx & Alessio)
News·

Cloudflare의 Workers AI에서 Kimi K 시리즈와 GLM 모델 최적화

Cloudflare의 Workers AI는 Kimi K 시리즈와 GLM 모델을 GPU에서 효율적으로 실행하기 위한 세 가지 기술을 적용했다. KV 캐시를 8비트에서 4비트로 양자화하여 메모리 사용량을 줄이고, GLM 5.2의 모델 가중치를 8비트에서 4비트로 압축하여 메모리 요구량을 40% 감소시켰다. 이러한 최적화는 고객 수를 늘리면서도 비용을 낮추고 모델 정확도에는 변화가 없음을 확인했다.

Cloudflare Blog — AI
News·

Kimi K3 모델 배포의 어려움과 서버 비용

Moonshot AI의 K3 모델은 오픈소스이지만, 단순히 다운로드하여 개인 컴퓨터에서 실행할 수 없다. K3를 실행하기 위해서는 최소 16개의 H200 GPU가 필요하며, 데이터 센터나 기업 환경에서만 운영 가능하다. K3를 배포하기 위해서는 64개의 가속기 카드가 필요하고, 총 비용은 약 1700만 RMB에 달한다. 전력 소모량도 가정용 전기 설비를 초과할 수 있다. K3는 사이버 보안 능력이 약하며, 최근 평가에서 사이버 공격 개발 능력이 다른 모델에 비해 낮은 것으로 나타났다.

ChinAI (Jeffrey Ding)
News·

알리바바, 미국 AI 모델과 경쟁하는 Qwen3.8-Max 발표

중국의 알리바바가 자사의 가장 크고 강력한 AI 모델인 Qwen3.8-Max를 발표했다. 이 모델은 미국의 Anthropic 및 OpenAI의 시스템과 Moonshot AI의 Kimi K3와 성능이 경쟁한다고 주장하고 있다. 알리바바는 이 모델을 사용자에게 널리 제공할 것이라고 밝혔다.

The Verge — AI
News·

OpenAI GPT-5.6 모델이 Amazon Bedrock에서 일반 제공 시작

OpenAI GPT-5.6 Sol, Terra, Luna 모델이 Amazon Bedrock에서 일반 제공된다. GPT-5.6 모델은 복잡한 추론 및 에이전트 코딩 작업을 위한 Sol, 일상적인 생산 작업을 위한 Terra, 분류 및 요약 같은 고속 대량 작업을 위한 Luna로 구성된다. 또한, GPT-5.6은 명시적 프롬프트 캐싱 기능을 도입하여 요청 간에 캐시할 프롬프트의 특정 부분을 제어할 수 있으며, 캐시된 입력은 90% 할인된 요금으로 청구된다.

AWS Machine Learning Blog
News·

Anthropic의 Opus 5, Fable을 벤치마크에서 초과 성능

Matthew Berman의 리뷰에 따르면, Anthropic의 새로운 AI 모델 Opus 5가 Fable을 거의 모든 벤치마크에서 초과 성능을 보였으며, 가격은 Fable의 절반이다. Opus는 Anthropic의 모델 라인업에서 Fable 아래 단계에 위치하지만, 벤치마크 결과는 반대의 결과를 보여주었다.

AI 코리아 커뮤니티 뉴스레터
News·

문샷AI의 키미 K3와 알리바바의 큐원3.8-Max 공개

문샷AI는 7월 16일 2.8조 파라미터의 오픈웨이트 모델 키미 K3를 공개했으나, 사흘 만에 신규 구독을 닫았다. 이는 예상보다 큰 수요로 GPU가 과부하에 걸렸기 때문이다. 알리바바는 K3 공개 후 사흘 뒤 큐원3.8-Max를 프리뷰로 공개했다. K3는 질문에 맞는 일부만 사용하여 비용을 절감하며, 100만 토큰의 긴 문서도 처리할 수 있다. K3는 종합 지능 평가에서 1,668점을 기록하며 3위에 올랐다.

요즘IT (Yozm IT)