Category
AI 모델·API
AI 모델·API는 Claude, GPT, Gemini 같은 모델을 호출해 쓰는 접점이다. 모델 선택, 컨텍스트 한도, 토큰 가격, 프롬프트 캐싱, 스트리밍, 도구 호출 규격이 여기 묶인다. 모델마다 강점과 과금이 달라, 작업별 라우팅과 캐싱 설계가 비용을 좌우한다.
Voxtral TTS: 빠르고 적응 가능한 텍스트-투-스피치 모델
Voxtral TTS는 빠르고 즉시 적응 가능하며, 생생한 음성을 생성하는 오픈 웨이트 텍스트-투-스피치 모델이다.
Qwen-Image: 20B MMDiT 이미지 모델의 텍스트 렌더링 기능
Qwen-Image는 20B MMDiT 이미지 기반 모델로, 복잡한 텍스트 렌더링과 정밀한 이미지 편집에서 중요한 발전을 이루었다. 이 모델은 다중 행 레이아웃, 문단 수준의 의미, 세밀한 디테일을 포함한 복잡한 텍스트 렌더링에 뛰어난 성능을 보인다. 알파벳 언어를 지원하며, 최신 모델을 사용해 보려면 Qwen Chat에서 'Image Generation'을 선택하면 된다.
Qwen3Guard: Qwen 모델의 안전성 강화
Qwen3Guard는 Qwen 모델 계열의 첫 번째 안전 가드레일 모델로, Qwen3 기초 모델을 기반으로 안전 분류를 위해 특별히 미세 조정되었다. 이 모델은 프롬프트와 응답에 대한 정확한 안전 감지를 제공하며, 위험 수준과 분류된 분류를 통해 책임 있는 AI 상호작용을 보장한다. Qwen3Guard는 주요 안전 벤치마크에서 최첨단 성능을 달성하며, 영어, 중국어 및 다국어 환경에서 프롬프트와 응답 분류 작업에서 강력한 능력을 보여준다.
금융 인텔리전스를 위한 거래 기반 모델 구축
현대 금융 네트워크에서의 모든 스와이프, 이체, 결제는 인간 행동의 패턴을 인코딩한다. 거래 데이터는 기업이 소유한 가장 풍부한 신호 중 하나지만, 대부분의 생산 사용 사례는 여전히 수작업으로 설계된 기능과 규칙 세트에 의존하고 있으며, 이는 유지 관리가 어렵고 고객 이력의 순차적 구조를 파악하지 못한다.
Microsoft Aion, 윈도우에 내장되는 온디바이스 SLM 패밀리
Microsoft가 Build 2026에서 Aion 1.0을 발표했다. Aion은 윈도우에 내장되는 온디바이스 소형 언어모델(SLM) 패밀리로, 두 모델로 구성된다. Instruct는 Edge에 쓰이던 Phi-4-mini를 대체하고, Plan은 약 14B 규모로 로컬 에이전틱 작업을 담당한다. Microsoft는 Instruct 가중치를 오픈웨이트로 공개하겠다고 예고했다. OS 차원에서 소형 모델이 기본 탑재되는 방향을 보여주는 발표다.
Keye-VL-2.0-30B-A3B 모델의 비디오 이해 및 에이전트 기능
Keye-VL-2.0-30B-A3B는 30B 클래스의 최신 모델로, 긴 비디오 이해와 에이전트 기능을 지원한다. 이 모델은 다섯 개의 비디오 벤치마크에서 오픈소스 경쟁자들을 초월하며, Gemini-3-Flash와의 시간적 기초에서 동등하거나 우수한 성능을 보인다. DSA(Native Long-Context Architecture)를 통해 효율적인 계산으로 시간 길이 비디오를 이해하며, 데이터 중심의 다중 모달 사전 학습을 통해 인식, OCR 및 추론 연속성을 강화한다. 또한, 내장된 에이전트 기능은 코드, 도구 및 검색 작업을 지원한다.
Inflect-Nano-v1, 4.63M 파라미터의 초소형 TTS 모델 출시
Inflect-Nano-v1은 4.63M의 총 추론 파라미터를 가진 초소형 TTS 모델로, 3.46M의 음향 모델과 1.17M의 보코더를 포함한다. 이 모델은 24kHz 오디오를 지원하며, 영어 단일 남성 음성으로 작동한다. PyTorch 추론 스크립트를 사용하여 로컬에서 실행 가능하며, Kokoro보다 약 17배, Chatterbox보다 약 108배, Fish Audio S2 Pro보다 거의 1000배 작다. 품질은 제한적이며 로봇 같은 음성이나 어려운 텍스트에서의 문제점이 있다.
Z.ai, GLM 5.2 오픈 소스 결정
Z.ai가 GLM 5.2를 오픈 소스로 공개하기로 결정했다. GLM-4.7-flash의 후속 모델이 27-120B 범위에서 출시되기를 기대하는 의견도 있다.
한국 정부 주도 독자 AI 파운데이션 모델, 정예 5팀 경쟁 본격화
한국 정부(과학기술정보통신부)가 추진하는 독자 AI 파운데이션 모델 사업에서 정예 5팀이 자체 모델을 개발하고 있다. 참여 팀은 네이버클라우드, 업스테이지, SKT, NC AI, LG AI연구원이며 정부는 대규모 예산과 GPU를 지원한다. 2025년 12월에 1차 성과가 공개됐고, 2026년 중 1~2개 팀을 최종 선정할 예정이다. 이 가운데 SKT는 하이퍼스케일급으로 소개된 A.X K1을 공개하면서 해외 최상위 모델 대비 높은 성능을 목표로 내세웠다.
생성 AI 플랫폼 구축의 공통 구성 요소
기업들이 생성 AI 애플리케이션을 배포하는 방식에서 유사성을 발견하였고, 이 글에서는 생성 AI 플랫폼의 공통 구성 요소와 그 기능, 구현 방법을 설명한다. 플랫폼은 간단한 아키텍처에서 시작하여 점차적으로 더 많은 구성 요소를 추가할 수 있으며, 각 단계에서 평가가 필요하다. 초기 단계에서는 모델에 외부 데이터 소스와 도구를 통해 컨텍스트를 강화하고, 시스템과 사용자를 보호하기 위한 가드레일을 추가하며, 복잡한 파이프라인을 지원하기 위해 모델 라우터와 게이트웨이를 추가하는 방식으로 발전한다. 또한, 관찰 가능성과 오케스트레이션은 플랫폼의 필수 요소로 언급된다.
Anthropic, 한 모델 두 제품 안전 분기 설계의 최강 플래그십 Claude Fable 5 공개
Anthropic이 6월 9일 가장 강력한 공개 모델 Claude Fable 5를 출시했다. 동시에 같은 가중치를 공유하는 Mythos 5를 검증된 사이버 방어 인력에게만 제한 공개했다. 핵심은 '한 모델을 두 제품으로' 나눈 설계다. 능력으로 가른 게 아니라 안전 분류기(safety classifier) 한 겹으로 갈랐다. Fable 5는 분류기를 얹어 일반 공개, Mythos 5는 같은 모델에서 사이버 가드레일만 벗겨 핵심 인프라 운영자에게만 잠가뒀다. 벤치마크 전반에서 SOTA이며 일부 항목은 Opus 4.8보다 10%p 이상 높다. 컨텍스트 1M, 최대 출력 128K, 입력 $10·출력 $50/MTok(Opus의 2배). API에서 사고가 바뀐다. 분류기가 정당한 인접 작업(보안 툴링, 생명과학)에서도 오탐 거부를 내므로 stop_reason: 'refusal'이 HTTP 200으로 반환된다. content를 읽기 전에 stop_reason을 먼저 분기해야 한다. 또 thinking이 항상 켜져 있어 thinking 파라미터를 명시하면 거부(disabled는 400), raw 사고연쇄는 절대 반환되지 않고 요약만 제공된다.
Anthropic, 민감 주제는 Opus 4.8로 폴백하는 Claude Fable 5 공개
Anthropic이 6월 9일 Opus 클래스보다 한 단계 높은 'Mythos급' 모델을 일반에 처음 공개했다. 동일한 기반 모델을 공유하는 두 버전으로, Fable 5는 콘텐츠 분류기를 탑재해 사이버보안·생화학·증류(distillation) 요청 시 Claude Opus 4.8로 자동 폴백하고(세션의 5% 미만 영향), Mythos 5는 인가된 사용자에 한해 이 안전장치를 해제한다. 가격은 두 모델 모두 입력 100만 토큰당 10달러, 출력 100만 토큰당 50달러로 'Mythos Preview의 절반 미만'이다. Anthropic은 Fable 5가 '거의 모든 벤치마크에서 SOTA'이며 Cognition의 프런티어 코딩 평가 FrontierCode에서 최고점이라고 밝혔다. 외부 파트너와 1,000시간 넘는 레드팀에서 보편적 탈옥은 발견되지 않았다고 했다. 단, 이 모델들은 6월 12일 美 정부 수출통제 지시로 사흘 만에 접근이 차단됐다.
Google Gemini 3.5 Flash GA, 작년 Pro 능가했지만 가격은 3배
Google이 5월 19일 Gemini 3.5 Flash를 정식(GA) 출시했고, 6월 들어 제품 통합이 가속됐다. 6월 16일부터 Gemini Enterprise 앱에서 3.5 Flash가 기본 활성화되며 비활성화 토글이 제거된다. 핵심은 'Flash 등급이 이전 세대 Pro를 추월했다'는 점이다 — Terminal-Bench 2.1에서 3.1 Pro 70.3% 대비 76.2%, MCP Atlas 83.6% vs 78.2%, Finance Agent v2 57.9% vs 43.0%, GDPval-AA Elo 1656 vs 1314로 코딩·에이전틱 스위트 전반에서 앞선다. 대신 가격이 올랐다. 글로벌 티어 입력 $1.50·출력 $9.00/MTok(캐시 입력은 90% 할인 $0.15), 비-글로벌 리전은 $1.65/$9.90이다. 이전 Flash 세대 대비 사실상 3배 수준이라 '저렴한 보조 모델'이라는 Flash의 포지셔닝이 흔들린다. 다음 단계인 Gemini 3.5 Pro 정식 GA가 6월 중 예고돼 있으며, 관례적 비율(~10배)을 따르면 $15/$60 수준이 점쳐진다.
LLM API 월 38만원을 9만원대로 줄인 순서: 측정 먼저, 그다음 라우팅·max_tokens·캐싱
비용 새는 곳 4개를 효과 큰 순서로 정리. 범인은 모델 단가가 아니라 디바운스 누락이었다
DeepSeek V4 Pro, 1M 컨텍스트 오픈웨이트 코딩 모델로 NIST 독립 평가까지
DeepSeek이 4월 24일 V4 프리뷰(deepseek-v4-flash·deepseek-v4-pro)를 공개한 뒤 5월 8일 전면 개정 버전을 출시했고, V4 Pro는 '5월의 가장 화제가 된 AI 릴리스'로 꼽혔다. 가장 큰 변화는 1M 토큰 컨텍스트 윈도로, 거대 코드베이스 전체를 한 번에 처리하도록 코딩 최적화된 라인업을 갖췄다. 주목할 점은 NIST 산하 CAISI(AI 표준·혁신 센터)가 5월 2일 V4-Pro에 대한 독립 평가를 발표했다는 것이다 — 사이버, 소프트웨어 엔지니어링, 자연과학, 추상추론, 수학 전반을 다뤘다. 오픈웨이트 진영에서 미국 정부 기관의 공식 평가 대상이 됐다는 점 자체가 신뢰도·역량 양면의 신호다. V4 Pro는 코딩·시스템 레벨 프로그래밍 벤치마크에서 다른 프론티어 모델과 견줄 만한 성능을 보였고, 공개 가중치 + 1M 컨텍스트 + 낮은 토큰 단가 조합으로 자체 호스팅 코딩 에이전트 구축의 비용 효율을 끌어올렸다.
영수증 OCR 후처리에서 GPT-4o vision과 Gemini 2.0 Flash를 1,200장으로 직접 재본 결과
인쇄체 영수증 1,200장으로 잰 GPT-4o 95% vs Flash 92%, 비용 1/10과 JSON 코드펜스 우회까지
Alibaba Qwen 3.7, 화면 보고 코드 짜는 멀티모달 에이전트 플래그십
Alibaba Qwen 팀이 6월 2일 Qwen3.7-Plus를 Bailian 플랫폼에 출시했다. 텍스트·이미지·비디오를 입력받아 시각 인지와 GUI 조작, 자율 코딩을 하나의 루프에서 결합하는 멀티모달 에이전트 모델로, 비전·심층추론·툴 호출·자율 반복을 갖췄다. 앞서 5월 20일 Alibaba Cloud Summit에서는 Qwen 3.7 Max를 발표했다 — 1M 컨텍스트, 추론 네이티브, 폐쇄 가중치의 DashScope API 전용 에이전트 우선 플래그십이다. 라인업 흐름을 보면 2월 16일 Qwen3.5(397B-A17B MoE, 201개 언어, 이전 세대 대비 8.6~19배 처리량), 4월 Qwen 3.6 두 차례(35B-A3B MoE → 27B 덴스), 5~6월 3.7 Max/Plus로 빠르게 진화했다. 전용 코딩 모델 Qwen3-Coder 480B(480B 총/35B 활성, 7.5조 토큰·70% 코드)는 에이전틱 코딩 벤치마크에서 Claude Sonnet 4와 동급으로 평가됐다. 덴스(0.6B~32B)와 MoE를 Apache 2.0로 폭넓게 오픈하면서, 플래그십(3.7 Max)은 폐쇄·API 전용으로 분리하는 하이브리드 전략을 굳혔다.
Cohere Command A+, 첫 완전 Apache 2.0 엔터프라이즈 모델로 H100 2장 구동
Cohere가 2026년 5월 20일 Command A+를 공개했다. 총 218B·활성 25B의 sparse MoE 모델로, 회사 역사상 처음으로 가중치를 완전 Apache 2.0 라이선스로 풀었다. 핵심은 두 가지 엔지니어링 성과다. 첫째, W4A4 무손실 양자화(lossless quantization)로 NVIDIA H100 단 2장에서 풀 모델을 돌릴 수 있게 했다 — 자체호스팅 진입장벽을 크게 낮춘 지점이다. 둘째, 네이티브 인용 생성(native citation)을 모델 차원에서 지원해, RAG 파이프라인에서 별도 후처리 없이 근거 출처를 토큰 레벨로 붙인다. 추론·멀티모달 이해·다국어(48개 언어, 비유럽어 효율 개선 포함)·검색·툴 사용을 단일 모델에 통합한 '에이전트 워크로드용' 포지셔닝이다. 배포는 Cohere API, Microsoft Foundry의 Managed Compute, 그리고 Hugging Face 무료 데모 스페이스로 열렸다. 메시지는 명확하다 — 주권(sovereign) AI, 즉 규제·에어갭·공공 인프라처럼 데이터가 외부로 나갈 수 없는 환경을 정조준했다.
Moonshot Kimi K2.6, 1T 오픈웨이트가 코딩서 GPT-5.5와 동률에 300 서브에이전트
Moonshot AI가 2026년 4월 20일 플래그십 오픈웨이트 모델 Kimi K2.6을 공개했다. 총 1T·토큰당 활성 32B의 MoE이며, 1월에 나온 K2.5에서 도입한 'Agent Swarm' 개념을 한층 키웠다. K2.6은 최대 300개 서브에이전트로 fan-out해 약 4,000단계에 걸쳐 협업하는 자기주도 병렬 에이전트 프리미티브를 모델 차원에서 지원한다. 네이티브 INT4 양자화를 탑재해 자체호스팅 부담을 낮췄고, 평가에서 Opus 4.6 추격 + 코딩에서 GPT-5.5와 동률이라는 평이 나왔다. 강점은 에이전틱 코딩과 툴 사용에 집중돼 있다. 경제성 측면에서 K2.6이 가장 빛나는 시나리오는 둘이다 — ① Opus가 너무 비싼 고볼륨 코딩 에이전트, ② 가중치를 직접 감사·자체호스팅해야 하는 규제/에어갭 환경. 즉 '비싼 프런티어 코딩모델의 오픈웨이트 대체재'라는 포지션이 분명하다. K2.5(1월)→K2.6(4월)로 분기 단위 갱신 속도를 보이며 오픈 진영의 코딩 선두를 자처하고 있다.
메타, 첫 폐쇄형 프런티어 Muse Spark 공개하고 Llama 5는 2027로 연기
메타가 2026년 4월 8일 Meta Superintelligence Labs 명의로 Muse Spark를 공개했다. 음성·텍스트·이미지를 받는 네이티브 멀티모달 추론 모델로, 내부 코드명은 'Avocado' — 원래 Llama 5의 코드명으로 유출됐던 그 이름이다. 결정적 변화는 라이선스다. Llama 계열의 오픈웨이트 전통을 깨고 Muse Spark는 폐쇄형(proprietary), API 전용으로 출시됐다. meta.ai에서는 무료지만 API는 초대제이고 공개 가격은 아직 없다. 성능은 'frontier 진입, 일부 우위'로 요약된다. Artificial Analysis Intelligence Index 52, HealthBench Hard 42.8과 Humanity's Last Exam(Contemplating 모드) 50.2%에서 선두를 기록했지만, 코딩(Terminal-Bench·SWE-bench)과 에이전트 작업에서는 GPT-5.4·Claude Opus 4.6에 뚜렷이 뒤진다. 한편 진짜 오픈소스 플래그십이었던 Llama 5(Avocado)는 Q1 2026 목표에서 2027로 밀렸고, Behemoth는 공개도 공식 취소도 없이 사실상 사장된 상태다.
긴 계약서 요약에서 중간 조항이 누락되는 lost in the middle, 모델 교체로 줄였지만 근본 해법은 청킹이었다
40페이지 계약서 요약에서 중간 조항이 빠지는 문제를 4o에서 Claude로 옮겨 줄인 기록과, 그게 임시방편인 이유
구글 Gemini 3.1 Pro 정식 공개, SWE-bench 80.6%에 4단계 thinking로 비용 조절
구글 딥마인드가 2026년 2월 19일 Gemini 3.1 Pro를 프리뷰로 공개했다. 직전 Gemini 3 Pro 대비 추론 성능을 2배 이상 끌어올렸고, 출시와 동시에 3 Pro 프리뷰를 종료(deprecate)시키며 플래그십을 교체했다. 벤치마크가 강력하다. SWE-bench Verified 80.6%(Claude Opus 4.6의 80.8%와 사실상 동급), GPQA Diamond 94.3%, 그리고 ARC-AGI-2에서 77.1%로 전작 31.1%의 두 배를 넘겼다. 컨텍스트는 100만 토큰 입력·6.5만 토큰 출력을 유지한다. 실무자가 주목할 부분은 thinking level이다. Low/Medium/High에 더해 Max까지 4단계를 노출해, 요청마다 추론 깊이와 비용·지연을 직접 트레이드오프할 수 있다(자동완성은 Low, 코드리뷰는 Medium, 복잡한 디버깅은 High 식). 가격은 입력 100만 토큰당 $2, 출력 $12로 전작과 동일하게 동결했다. 금융·스프레드시트 등 에이전트 도메인에서의 동작 개선도 명시됐다.
분류 프롬프트 정확도, 정의문을 늘리는 것보다 경계 케이스 few-shot 3개가 잘 먹혔다
정의 열 줄보다 자주 틀리는 경계 케이스 few-shot 2~3개가 분류 정확도를 올렸다. 핵심은 깨끗한 예시가 아니라 헷갈리는 예시
Mistral Large 3, 675B 오픈웨이트 MoE로 플래그십 가격 80% 인하
Mistral이 2025년 12월 2일 Mistral 3 패밀리를 공개했고, 그 정점이 Mistral Large 3다. Mixtral 이후 처음 돌아온 MoE로, 총 675B·활성 41B 파라미터 구조다 — 41B 덴스 모델 수준의 연산 비용으로 675B의 용량을 끌어쓴다는 설계다. 라이선스는 Apache 2.0으로 가중치를 전면 공개했고, 14B·8B·3B 덴스 소형 모델도 함께 풀었다. 가격이 공격적이다. 입력 100만 토큰당 $0.50, 출력 $1.50로 주요 상용 플래그십 대비 약 80% 저렴하다. 컨텍스트는 256k, 멀티모달을 지원한다. 다만 절대 지능 점수는 냉정히 봐야 한다. Artificial Analysis Intelligence Index 23으로, 비추론(non-reasoning) 오픈웨이트 동급 중에서는 평균 이하이고 출력 속도(52 tok/s)도 평범하다. 대신 첫 토큰 지연(TTFT 1.11s)은 경쟁력 있고, 단일 8×A100/8×H100 노드 또는 Blackwell NVL72에서 vLLM으로 효율 구동하도록 최적화 체크포인트를 제공한다.