Category
AI 모델·API
AI 모델·API는 Claude, GPT, Gemini 같은 모델을 호출해 쓰는 접점이다. 모델 선택, 컨텍스트 한도, 토큰 가격, 프롬프트 캐싱, 스트리밍, 도구 호출 규격이 여기 묶인다. 모델마다 강점과 과금이 달라, 작업별 라우팅과 캐싱 설계가 비용을 좌우한다.
OpenAI, GPT-5.6 Sol/Terra/Luna 모델 출시 및 Codex와 ChatGPT 통합
OpenAI는 GPT-5.6 모델을 Sol, Terra, Luna의 세 가지 크기로 출시했다. 이 모델은 복잡한 작업을 더 빠르게 완료하기 위해 여러 에이전트를 병렬로 조정하는 'ultra' 설정을 포함하며, 성능은 Fable이나 Opus보다 낮은 비용으로 더 높다. Terra는 Fable 5보다 약간 높은 성능을 보이고, Luna는 Opus 4.8을 초과하며, 각각 약 1/3의 시간과 약 절반의 출력 토큰으로 작업을 수행한다. 또한, ChatGPT Work와 Codex의 새로운 데스크탑 앱 업데이트가 포함되어 있다.
Claude Opus 4.8 출시, 동적 워크플로우 지원
Claude Opus 4.8이 출시되었으며, 이제 복잡한 작업을 처리하기 위해 하위 에이전트를 병렬로 실행하는 오케스트레이션 스크립트를 작성할 수 있다. Simon Willison은 이 업데이트가 불확실성에 대해 더 솔직해졌고 코드의 결함을 놓칠 가능성이 줄어들었다고 평가했다. 내부 엔지니어 벤치마크에서 GPT-5.5와 경쟁력을 보이며, ARC-AGI-3에서 5.5의 점수를 세 배로 초과했다.
Grok 4.5 모델 출시 및 OpenAI GPT-5.6 모델 공개
Anthropic은 Claude 구독을 통해 Fable 5에 대한 접근을 7월 12일까지 연장했다. OpenAI는 오늘 모든 사용자에게 GPT-5.6 모델(Sol, Terra, Luna)을 공개한다고 발표했다. Grok 4.5 모델은 Opus 4.7과 4.8 사이의 성능을 보이며, Opus 모델보다 6배, GPT-5.5보다 3배 저렴한 비용으로 제공된다. ChatGPT Voice는 새로운 모델 GPT-Live-1과 Live-1-mini를 도입하여 대화의 자연스러움을 개선했다.
Claude Fable 5 출시 후 미국 정부에 의해 사용 중단
Claude Fable 5는 출시 3일 만에 미국 정부의 요청으로 사용이 중단되었다. Fable 5는 Mythos-class 1 모델로, 소프트웨어 엔지니어링, 지식 작업, 비전, 과학 연구 등에서 뛰어난 성능을 보였다. 가격은 입력과 출력 각각 백만 토큰당 $10/$50이며, Claude Code에서 /model 또는 /model claude-fable-5로 선택할 수 있다.
Qwen3.5 122B 모델의 성능
사용자는 Qwen3.5 122B 모델이 복잡한 작업을 수행하는 데 있어 가장 효율적이라고 언급했다. Qwen3.6 27B와 33B는 복잡한 작업에서 문제가 발생했으며, Gemma4 31B와 26B는 작업을 완료하는 데 어려움을 겪었다. Qwen3.5 122B는 약 160개의 PowerPoint에서 특정 데이터를 추출하는 작업을 약 2시간 만에 완료했다. 120B 크기의 MoE 모델은 성능과 속도에서 우수하다고 평가되었다.
SpaceXAI, Grok 4.5 출시 - Opus 클래스 모델
SpaceXAI가 Grok 4.5를 출시했다. Grok 4.5는 1.5T 파라미터를 가진 모델로, Opus 4.7과 유사한 성능을 보이며, 코드 및 에이전트 작업에 최적화되어 있다. 공식 가격은 입력 1M 토큰당 2달러, 출력 1M 토큰당 6달러로 설정되었으며, Grok 4.5는 Grok 4.3보다 3배 큰 모델이다. Grok 4.5는 Grok Build/API/Cursor에서 사용 가능하며, Hermes Agent에서도 지원된다.
Tencent의 295B-파라미터 Mixture-of-Experts 모델 Hy3 출시
Tencent에서 개발한 Hy3는 295B 파라미터를 가진 Mixture-of-Experts(MoE) 모델로, 21B의 활성 파라미터와 3.8B의 MTP 레이어 파라미터를 포함한다. Hy3는 비슷한 크기의 모델보다 성능이 우수하며, 주요 오픈 소스 모델과 경쟁할 수 있는 성능을 보여준다. 전체 모델 크기는 598GB이며, FP8 양자화 모델은 300GB이다. 컨텍스트 길이는 256K로 설정되어 있다. 현재 OpenRouter에서 7월 21일까지 무료로 제공된다.
Amazon Bedrock에서 MiniMax 모델 사용 가능
Amazon Bedrock은 MiniMax 모델 패밀리를 지원하며, MiniMax M2, M2.1, M2.5의 세 가지 오픈 웨이트 모델을 제공합니다. MiniMax M2는 1백만 토큰의 컨텍스트 윈도우를 제공하며, M2.1은 추론 깊이와 코딩 정확도를 개선했습니다. M2.5는 에이전트 네이티브 실행을 위해 특별히 훈련된 최신 모델입니다. 이 모델들은 AWS의 보안 및 운영 보장을 바탕으로 소프트웨어 엔지니어링 및 에이전트 애플리케이션 구축에 활용될 수 있습니다.
Amazon Nova의 선택적 잊기 기능 소개
Amazon Nova의 Customizable Content Moderation Settings (CCMS)는 고객이 승인된 정책 영역에서 모델의 콘텐츠 모더레이션 안전 장치를 선택적으로 조정할 수 있도록 한다. 이 과정에서 Reverse Direct Preference Optimization (rDPO)라는 새로운 잊기 기법을 사용하여 모델의 과도한 콘텐츠 차단을 줄이고 모델 품질을 유지한다. CCMS는 안전성, 민감한 콘텐츠, 공정성, 보안의 네 가지 책임 있는 AI(RAI) 기둥을 포함하여 고객이 특정 정책을 잊도록 훈련된 LoRA 어댑터를 제공한다.
NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B 모델 출시
NVIDIA가 개발한 Nemotron-Labs-3-Puzzle-75B-A9B 모델은 Nemotron-3-Super-120B-A12B에서 파생된 대형 언어 모델로, Iterative Puzzle이라는 포스트 트레이닝 압축 프레임워크를 사용하여 추론 효율성을 개선하고 강력한 정확도를 유지한다. 이 모델은 하이브리드 MoE 아키텍처를 채택하고 있으며, Multi-Token Prediction(MTP)을 지원하여 텍스트 생성 속도를 높인다. Puzzle-75B-A9B는 120.7B에서 75.3B로 모델 크기를 줄였으며, 단일 8×B200 노드에서 서버 처리량이 약 2배 증가하고, 1M-token 단일-H100 동시 처리 요청이 1에서 8로 증가한다. 지원 언어는 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 스페인어, 중국어가 포함된다.
Nemotron-Labs-Audex-30B-A3B 소개
Nemotron-Labs-Audex-30B-A3B는 30B MoE 모델로, 음성 및 일반 오디오 출력을 위한 이산 오디오 토큰의 어휘를 확장하고, 음성 및 일반 오디오 입력을 위한 오디오 인코더를 포함한 통합 오디오-텍스트 LLM이다. 이 모델은 오디오 이해, 음성 인식 및 번역, 텍스트-음성 변환, 오디오 생성, 음성-음성 생성 등의 오디오 작업에서 강력한 성능을 발휘하며, 텍스트 전용 LLM의 추론, 정렬, 지식, 긴 맥락 처리 및 에이전트 기능을 유지한다. Audex-30B-A3B는 최대 1M 토큰의 컨텍스트 길이를 지원하며, 생각 모드와 비생각 모드를 모두 운영할 수 있다.
Sonnet 5의 가격과 성능 비교
Sonnet 5는 프리미엄 구독자에게 일주일간 무료로 제공되며, 이후에는 토큰당 $3/$15의 요금이 부과된다. Sonnet 5는 Opus 4.8보다 속도가 빠르지만, 성능은 상대적으로 낮다. Cyber 능력은 Sonnet 4.6보다 강하지만 Opus 4.8과 Mythos 5에는 미치지 못한다. Sonnet 5는 브라우저 사용 시 프롬프트 인젝션에서 우수한 성능을 보인다.
구글의 Nano Banana 2 Lite 이미지 모델, 속도와 비용에서 최적의 균형 제공
구글 딥마인드의 새로운 이미지 모델 Nano Banana 2 Lite는 품질과 속도의 최적 균형을 제공하며, 구글 생태계에서 즉시 사용 가능하다. 이 모델은 Gemini 3.1 패밀리의 일환으로, 아이디어 탐색 및 '신속한' 프로토타입 제작에 적합하다. Nano Banana 2 Lite는 다른 모델과 비교했을 때 품질이 비슷하다는 평가를 받고 있지만, 텍스트와 인포그래픽에서 작은 오류가 발생할 수 있으며, 캐릭터와 사람의 일관성이 떨어질 수 있다.
Springboards, Flint 모델로 LLM의 그룹사고 문제 해결 시도
Springboards는 Flint라는 LLM을 개발하여 기존 LLM들이 가지는 예측 가능성과 창의성 부족 문제를 해결하고자 한다. Flint는 개방형 질문에 대해 더 다양한 응답을 생성할 수 있도록 훈련되었으며, 예를 들어 '유럽에서 어디로 가야 할까?'라는 질문에 대해 기존 모델들이 비슷한 답변을 내놓는 것과 달리, Flint는 더 창의적인 대답을 제공한다. 연구자들은 LLM들이 유사한 데이터로 훈련되어 비슷한 답변을 내놓는 경향이 있음을 지적하며, Springboards는 광고 및 마케팅 분야의 전문가들이 다양한 아이디어를 구상할 수 있도록 여러 LLM을 활용한 도구를 제공하고 있다.
글로벌 기업의 멀티 모델 전략 채택과 통제 격차 문제
앤트로픽의 '클로드 페이블 5' 서비스 중단 이전에 글로벌 기업의 3분의 2가 멀티 모델 전략을 채택한 것으로 나타났다. 이는 AI 비용 문제에 대한 선제적 조치로, 미국 정부의 수출 통제 명령으로 인해 페이블 5 서비스가 중단되었을 때 많은 기업이 유연한 모델 전략으로 피해를 최소화했다는 내용이 포함된 벤처비트 펄스 리서치의 '통제 격차' 보고서에 기반하고 있다.
Fable 콘솔 종료 전에 워크플로를 API로 옮긴 순서와 함정
7/7 콘솔 종료 전 콘솔 워크플로를 Fable API로 이관한 순서·실제 함정·비용 로깅 붙이기
AWS GovCloud에서 Amazon Bedrock으로 OpenAI GPT OSS 및 NVIDIA Nemotron 모델 지원 시작
AWS GovCloud (US)에서 Amazon Bedrock이 OpenAI의 open-weight GPT OSS 모델(120B, 20B)과 NVIDIA Nemotron 모델(Nano 9B v2, Nano 12B v2, Nano 30B, Super 120B)을 지원한다. 이 모델들은 복잡한 다중 에이전트 작업을 위한 고성능 AI 애플리케이션을 구축하고 확장하는 데 사용될 수 있으며, AWS GovCloud의 보안 및 규정 준수 경계 내에서 실행된다. NVIDIA Nemotron 3 Super는 120억 개의 파라미터를 가진 혼합 전문가 모델로, 이전 세대보다 최대 5배 높은 처리량을 제공하고, Nemotron 3 Nano는 30억 개의 파라미터를 가진 모델로 4배 높은 처리량을 제공한다.
Gemini 3.1 Flash TTS: 정밀한 AI 음성 생성 위한 오디오 태그 도입
Google DeepMind의 최신 오디오 모델인 Gemini 3.1 Flash TTS는 정밀한 제어를 위한 세분화된 오디오 태그를 도입하여 표현력 있는 오디오 생성을 가능하게 한다.
WeatherNext AI 모델이 허리케인 멜리사 예측에 기여
WeatherNext AI 모델이 허리케인 멜리사의 역사적인 자메이카 상륙 예측에 도움을 주어, 기상 예보관들이 지역 사회에 사전 준비 시간을 제공할 수 있도록 했다.
Anthropic의 Fable 모델, 고객 데이터 30일 이상 저장 및 사용 제한
Anthropic의 최신 모델 Fable은 고객의 프롬프트와 데이터를 30일 이상 저장하며, 개발자의 사용이 상업적 위협이 될 수 있다고 판단할 경우 성능이 저하된다. 이로 인해 고객들은 Claude에서의 오프램프 계획을 마련해야 한다는 경고가 제기되고 있다. 또한, Coinbase의 글로벌 거래 서비스는 자동화된 지역 장애 조치가 없어 10시간의 서비스 중단을 겪었다. Anthropic과 OpenAI는 IPO를 신청했으며, 오픈 소스 프로젝트가 GitHub에서 유지 관리자의 금지로 퇴출되었다.
앤트로픽, 소넷 5 출시 및 페이블 5 수출 통제 해제
앤트로픽이 소넷 5와 클로드 사이언스를 발표하고, 페이블 5의 복귀를 알렸다. 소넷 5는 '가장 에이전트다운' 모델로, 성능은 오퍼스 4.8에 근접하며, SWE-bench Pro에서 63.2%를 기록했다. 페이블 5는 6월 30일 미 상무부의 수출 통제가 해제되어 7월 1일부터 접근이 복원되며, 입력 100만당 토큰당 10달러, 출력 50달러로 가격이 책정되었다. 복구까지 18일이 걸렸으며, 경쟁사인 오픈AI의 GPT-5.6 Sol은 여전히 제한 공개 상태이다.
Safetensors, 외부 보안 감사 결과 안전 확인 및 기본 형식으로 채택 예정
Hugging Face는 EleutherAI 및 Stability AI와 협력하여 safetensors 라이브러리에 대한 외부 보안 감사를 실시하였으며, 감사 결과는 이 라이브러리가 안전하다는 것을 보여주었다. 이 결과를 바탕으로 세 기관은 safetensors를 저장된 모델의 기본 형식으로 채택하는 방향으로 나아가고 있다. 감사 보고서는 Trail of Bits에 의해 수행되었으며, 자세한 내용은 해당 보고서를 통해 확인할 수 있다.
OpenAI, GPT-5.5 출시 및 DeepSeek V4 오픈소스 발표
OpenAI가 GPT-5.5를 출시했으며, 이는 코딩 관련 개선 사항과 함께 시스템 카드에서 사고 과정 모니터링 및 불일치 테스트에 대한 내용을 포함하고 있다. 가격은 GPT-5.4보다 높아졌고, '고블린'에 대한 경고가 포함된 시스템 프롬프트와 같은 특이점도 있다. xAI는 Grok Voice Think Fast 1.0을 출시하여 실시간 음성 에이전트에서 큰 벤치마크 성과를 기록했다고 발표했다. DeepSeek는 MoE 스케일링과 1M 토큰 컨텍스트를 지원하는 DeepSeek V4(Pro 및 Flash)를 오픈소스로 공개했다. Tencent는 Hunyuan 3 프리뷰를 발표했지만 벤치마크 성능은 낮았다. 구글은 Anthropic에 최대 400억 달러를 투자할 계획이다.
OpenAI ChatGPT 이미지 모델 2.0 출시 및 Alibaba Qwen 3.6 Max API 전환
OpenAI는 ChatGPT의 새로운 이미지 모델을 출시하였으며, 이는 텍스트와 스크린샷과 유사한 생성에 뛰어난 성능을 보인다. Alibaba는 Qwen 3.6 Max Preview를 API 전용 서비스로 전환하였고, Moonshot AI는 Kimi-K2.6 모델을, Minimax는 MiniMax M 2.7 모델을 각각 공개하였다. Google은 Gemini 3.1 Pro 기반의 Deep Research와 Max 옵션을 출시하였고, Mozilla는 Anthropic의 Claude를 사용하여 Firefox의 271개 버그를 수정하였다.