Category
AI 모델·API
AI 모델·API는 Claude, GPT, Gemini 같은 모델을 호출해 쓰는 접점이다. 모델 선택, 컨텍스트 한도, 토큰 가격, 프롬프트 캐싱, 스트리밍, 도구 호출 규격이 여기 묶인다. 모델마다 강점과 과금이 달라, 작업별 라우팅과 캐싱 설계가 비용을 좌우한다.
MS, 오픈AI의 GPT-5.6을 MS 365 코파일럿의 권장 모델로 채택
마이크로소프트(MS)는 오픈AI의 최신 모델 'GPT-5.6'을 MS 365 코파일럿의 권장 모델로 채택했다고 발표했다. 이는 오픈AI와 앤트로픽 모델에 대한 의존도를 줄이기 위한 노력의 일환으로, 작업의 성격에 따라 서로 다른 AI 모델을 활용하는 '멀티모델 라우팅' 전략으로 해석된다. 오픈AI는 9일(현지시간) GPT-5.6의 정식 서비스를 시작했다.
Anthropic, Claude Sonnet 5 출시 및 Fable 5 재출시 승인
Anthropic은 Claude Sonnet 5를 새로운 기본 중간 모델로 출시하였으며, Fable/Mythos 5는 정부와의 협업 후 재출시가 승인되었다. Sonnet 5는 1M 토큰의 컨텍스트 윈도우를 제공하며, 가격은 입력 토큰 $3/M, 출력 토큰 $15/M로 유지되지만, 8월 31일까지 프로모션 가격으로 각각 $2/M, $10/M이 적용된다. Sonnet 5는 코딩 및 도구 사용 성능이 뛰어나며, 안전성이 개선되었다고 전해진다.
Muse Spark 1.1 출시
Meta가 Muse Spark 1.1을 출시했다. 이는 첫 번째 Spark 모델로 API를 제공하며, 에이전트 도구 호출 및 컴퓨터 사용에서 상당한 개선이 이루어졌다고 한다. 사용자는 CLI 및 Python 라이브러리를 통해 모델에 접근할 수 있는 llm-meta-ai 플러그인을 설치할 수 있다.
OpenAI의 GPT-5.6 모델 출시: Luna, Terra, Sol
OpenAI의 최신 모델 GPT-5.6이 출시되었으며, Luna, Terra, Sol의 세 가지 크기로 제공된다. 가격은 Luna가 1달러, Terra가 2.50달러, Sol이 5달러로 설정되어 있다. 모든 모델은 2026년 2월 16일 기준 지식을 가지고 있으며, 최대 128,000개의 출력 토큰을 지원한다. GPT-5.6 Sol은 'Agents’ Last Exam'에서 53.6점을 기록하며 Claude Fable 5를 13.1점 초과하여 성능이 우수함을 입증했다. 새로운 API 기능으로는 프로그램적 도구 호출, 다중 에이전트 지원, 프롬프트 캐시 브레이크포인트 설정 등이 있다.
Amazon SageMaker AI의 NVIDIA Nemotron 3 모델 서버리스 커스터마이징
Amazon SageMaker AI는 NVIDIA Nemotron 3 모델에 대한 서버리스 모델 커스터마이징을 도입했다. Nemotron 3 Nano(30B 총 파라미터, 3B 활성)와 Nemotron 3 Super(120B 총 파라미터, 12B 활성) 모델을 지원하며, 감독 학습(SFT), 검증 가능한 보상을 통한 강화 학습(RLVR), AI 피드백을 통한 강화 학습(RLAIF) 기법을 활용해 특정 도메인과 워크플로우에 맞게 조정할 수 있다. Nemotron 3은 하이브리드 Mamba-Transformer Mixture-of-Experts 아키텍처를 기반으로 하며, 최대 1M 토큰 컨텍스트 길이를 지원한다.
Tencent HY3 모델, 128GB에서 성능 테스트
Tencent의 HY3 모델(295B-A21B MoE)은 DeepSeek v4 Flash와 비슷한 크기에서 더 나은 성능을 보이며, 128GB Macbook M5 Max에서 테스트된 결과, 토큰 생성 속도가 DeepSeek보다 두 배 빠르고 품질도 동등하거나 더 나은 것으로 나타났다. 모델 실행을 위해 llama.cpp의 PR #25395를 사용하여 지원을 추가하고, GPU 메모리 한계를 122GB로 설정해야 했다. 성능 테스트 결과, 빈 컨텍스트에서 528 tokens/sec, 16K 컨텍스트에서 124 tokens/sec의 속도를 기록했다.
OpenAI, GPT-5.6 Sol/Terra/Luna 모델 출시 및 Codex와 ChatGPT 통합
OpenAI는 GPT-5.6 모델을 Sol, Terra, Luna의 세 가지 크기로 출시했다. 이 모델은 복잡한 작업을 더 빠르게 완료하기 위해 여러 에이전트를 병렬로 조정하는 'ultra' 설정을 포함하며, 성능은 Fable이나 Opus보다 낮은 비용으로 더 높다. Terra는 Fable 5보다 약간 높은 성능을 보이고, Luna는 Opus 4.8을 초과하며, 각각 약 1/3의 시간과 약 절반의 출력 토큰으로 작업을 수행한다. 또한, ChatGPT Work와 Codex의 새로운 데스크탑 앱 업데이트가 포함되어 있다.
Claude Opus 4.8 출시, 동적 워크플로우 지원
Claude Opus 4.8이 출시되었으며, 이제 복잡한 작업을 처리하기 위해 하위 에이전트를 병렬로 실행하는 오케스트레이션 스크립트를 작성할 수 있다. Simon Willison은 이 업데이트가 불확실성에 대해 더 솔직해졌고 코드의 결함을 놓칠 가능성이 줄어들었다고 평가했다. 내부 엔지니어 벤치마크에서 GPT-5.5와 경쟁력을 보이며, ARC-AGI-3에서 5.5의 점수를 세 배로 초과했다.
Grok 4.5 모델 출시 및 OpenAI GPT-5.6 모델 공개
Anthropic은 Claude 구독을 통해 Fable 5에 대한 접근을 7월 12일까지 연장했다. OpenAI는 오늘 모든 사용자에게 GPT-5.6 모델(Sol, Terra, Luna)을 공개한다고 발표했다. Grok 4.5 모델은 Opus 4.7과 4.8 사이의 성능을 보이며, Opus 모델보다 6배, GPT-5.5보다 3배 저렴한 비용으로 제공된다. ChatGPT Voice는 새로운 모델 GPT-Live-1과 Live-1-mini를 도입하여 대화의 자연스러움을 개선했다.
Claude Fable 5 출시 후 미국 정부에 의해 사용 중단
Claude Fable 5는 출시 3일 만에 미국 정부의 요청으로 사용이 중단되었다. Fable 5는 Mythos-class 1 모델로, 소프트웨어 엔지니어링, 지식 작업, 비전, 과학 연구 등에서 뛰어난 성능을 보였다. 가격은 입력과 출력 각각 백만 토큰당 $10/$50이며, Claude Code에서 /model 또는 /model claude-fable-5로 선택할 수 있다.
Qwen3.5 122B 모델의 성능
사용자는 Qwen3.5 122B 모델이 복잡한 작업을 수행하는 데 있어 가장 효율적이라고 언급했다. Qwen3.6 27B와 33B는 복잡한 작업에서 문제가 발생했으며, Gemma4 31B와 26B는 작업을 완료하는 데 어려움을 겪었다. Qwen3.5 122B는 약 160개의 PowerPoint에서 특정 데이터를 추출하는 작업을 약 2시간 만에 완료했다. 120B 크기의 MoE 모델은 성능과 속도에서 우수하다고 평가되었다.
SpaceXAI, Grok 4.5 출시 - Opus 클래스 모델
SpaceXAI가 Grok 4.5를 출시했다. Grok 4.5는 1.5T 파라미터를 가진 모델로, Opus 4.7과 유사한 성능을 보이며, 코드 및 에이전트 작업에 최적화되어 있다. 공식 가격은 입력 1M 토큰당 2달러, 출력 1M 토큰당 6달러로 설정되었으며, Grok 4.5는 Grok 4.3보다 3배 큰 모델이다. Grok 4.5는 Grok Build/API/Cursor에서 사용 가능하며, Hermes Agent에서도 지원된다.
Tencent의 295B-파라미터 Mixture-of-Experts 모델 Hy3 출시
Tencent에서 개발한 Hy3는 295B 파라미터를 가진 Mixture-of-Experts(MoE) 모델로, 21B의 활성 파라미터와 3.8B의 MTP 레이어 파라미터를 포함한다. Hy3는 비슷한 크기의 모델보다 성능이 우수하며, 주요 오픈 소스 모델과 경쟁할 수 있는 성능을 보여준다. 전체 모델 크기는 598GB이며, FP8 양자화 모델은 300GB이다. 컨텍스트 길이는 256K로 설정되어 있다. 현재 OpenRouter에서 7월 21일까지 무료로 제공된다.
Amazon Bedrock에서 MiniMax 모델 사용 가능
Amazon Bedrock은 MiniMax 모델 패밀리를 지원하며, MiniMax M2, M2.1, M2.5의 세 가지 오픈 웨이트 모델을 제공합니다. MiniMax M2는 1백만 토큰의 컨텍스트 윈도우를 제공하며, M2.1은 추론 깊이와 코딩 정확도를 개선했습니다. M2.5는 에이전트 네이티브 실행을 위해 특별히 훈련된 최신 모델입니다. 이 모델들은 AWS의 보안 및 운영 보장을 바탕으로 소프트웨어 엔지니어링 및 에이전트 애플리케이션 구축에 활용될 수 있습니다.
Amazon Nova의 선택적 잊기 기능 소개
Amazon Nova의 Customizable Content Moderation Settings (CCMS)는 고객이 승인된 정책 영역에서 모델의 콘텐츠 모더레이션 안전 장치를 선택적으로 조정할 수 있도록 한다. 이 과정에서 Reverse Direct Preference Optimization (rDPO)라는 새로운 잊기 기법을 사용하여 모델의 과도한 콘텐츠 차단을 줄이고 모델 품질을 유지한다. CCMS는 안전성, 민감한 콘텐츠, 공정성, 보안의 네 가지 책임 있는 AI(RAI) 기둥을 포함하여 고객이 특정 정책을 잊도록 훈련된 LoRA 어댑터를 제공한다.
NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B 모델 출시
NVIDIA가 개발한 Nemotron-Labs-3-Puzzle-75B-A9B 모델은 Nemotron-3-Super-120B-A12B에서 파생된 대형 언어 모델로, Iterative Puzzle이라는 포스트 트레이닝 압축 프레임워크를 사용하여 추론 효율성을 개선하고 강력한 정확도를 유지한다. 이 모델은 하이브리드 MoE 아키텍처를 채택하고 있으며, Multi-Token Prediction(MTP)을 지원하여 텍스트 생성 속도를 높인다. Puzzle-75B-A9B는 120.7B에서 75.3B로 모델 크기를 줄였으며, 단일 8×B200 노드에서 서버 처리량이 약 2배 증가하고, 1M-token 단일-H100 동시 처리 요청이 1에서 8로 증가한다. 지원 언어는 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 스페인어, 중국어가 포함된다.
Nemotron-Labs-Audex-30B-A3B 소개
Nemotron-Labs-Audex-30B-A3B는 30B MoE 모델로, 음성 및 일반 오디오 출력을 위한 이산 오디오 토큰의 어휘를 확장하고, 음성 및 일반 오디오 입력을 위한 오디오 인코더를 포함한 통합 오디오-텍스트 LLM이다. 이 모델은 오디오 이해, 음성 인식 및 번역, 텍스트-음성 변환, 오디오 생성, 음성-음성 생성 등의 오디오 작업에서 강력한 성능을 발휘하며, 텍스트 전용 LLM의 추론, 정렬, 지식, 긴 맥락 처리 및 에이전트 기능을 유지한다. Audex-30B-A3B는 최대 1M 토큰의 컨텍스트 길이를 지원하며, 생각 모드와 비생각 모드를 모두 운영할 수 있다.
Sonnet 5의 가격과 성능 비교
Sonnet 5는 프리미엄 구독자에게 일주일간 무료로 제공되며, 이후에는 토큰당 $3/$15의 요금이 부과된다. Sonnet 5는 Opus 4.8보다 속도가 빠르지만, 성능은 상대적으로 낮다. Cyber 능력은 Sonnet 4.6보다 강하지만 Opus 4.8과 Mythos 5에는 미치지 못한다. Sonnet 5는 브라우저 사용 시 프롬프트 인젝션에서 우수한 성능을 보인다.
구글의 Nano Banana 2 Lite 이미지 모델, 속도와 비용에서 최적의 균형 제공
구글 딥마인드의 새로운 이미지 모델 Nano Banana 2 Lite는 품질과 속도의 최적 균형을 제공하며, 구글 생태계에서 즉시 사용 가능하다. 이 모델은 Gemini 3.1 패밀리의 일환으로, 아이디어 탐색 및 '신속한' 프로토타입 제작에 적합하다. Nano Banana 2 Lite는 다른 모델과 비교했을 때 품질이 비슷하다는 평가를 받고 있지만, 텍스트와 인포그래픽에서 작은 오류가 발생할 수 있으며, 캐릭터와 사람의 일관성이 떨어질 수 있다.
Springboards, Flint 모델로 LLM의 그룹사고 문제 해결 시도
Springboards는 Flint라는 LLM을 개발하여 기존 LLM들이 가지는 예측 가능성과 창의성 부족 문제를 해결하고자 한다. Flint는 개방형 질문에 대해 더 다양한 응답을 생성할 수 있도록 훈련되었으며, 예를 들어 '유럽에서 어디로 가야 할까?'라는 질문에 대해 기존 모델들이 비슷한 답변을 내놓는 것과 달리, Flint는 더 창의적인 대답을 제공한다. 연구자들은 LLM들이 유사한 데이터로 훈련되어 비슷한 답변을 내놓는 경향이 있음을 지적하며, Springboards는 광고 및 마케팅 분야의 전문가들이 다양한 아이디어를 구상할 수 있도록 여러 LLM을 활용한 도구를 제공하고 있다.
글로벌 기업의 멀티 모델 전략 채택과 통제 격차 문제
앤트로픽의 '클로드 페이블 5' 서비스 중단 이전에 글로벌 기업의 3분의 2가 멀티 모델 전략을 채택한 것으로 나타났다. 이는 AI 비용 문제에 대한 선제적 조치로, 미국 정부의 수출 통제 명령으로 인해 페이블 5 서비스가 중단되었을 때 많은 기업이 유연한 모델 전략으로 피해를 최소화했다는 내용이 포함된 벤처비트 펄스 리서치의 '통제 격차' 보고서에 기반하고 있다.
Fable 콘솔 종료 전에 워크플로를 API로 옮긴 순서와 함정
7/7 콘솔 종료 전 콘솔 워크플로를 Fable API로 이관한 순서·실제 함정·비용 로깅 붙이기
AWS GovCloud에서 Amazon Bedrock으로 OpenAI GPT OSS 및 NVIDIA Nemotron 모델 지원 시작
AWS GovCloud (US)에서 Amazon Bedrock이 OpenAI의 open-weight GPT OSS 모델(120B, 20B)과 NVIDIA Nemotron 모델(Nano 9B v2, Nano 12B v2, Nano 30B, Super 120B)을 지원한다. 이 모델들은 복잡한 다중 에이전트 작업을 위한 고성능 AI 애플리케이션을 구축하고 확장하는 데 사용될 수 있으며, AWS GovCloud의 보안 및 규정 준수 경계 내에서 실행된다. NVIDIA Nemotron 3 Super는 120억 개의 파라미터를 가진 혼합 전문가 모델로, 이전 세대보다 최대 5배 높은 처리량을 제공하고, Nemotron 3 Nano는 30억 개의 파라미터를 가진 모델로 4배 높은 처리량을 제공한다.
Gemini 3.1 Flash TTS: 정밀한 AI 음성 생성 위한 오디오 태그 도입
Google DeepMind의 최신 오디오 모델인 Gemini 3.1 Flash TTS는 정밀한 제어를 위한 세분화된 오디오 태그를 도입하여 표현력 있는 오디오 생성을 가능하게 한다.