Category
AI 모델·API
AI 모델·API는 Claude, GPT, Gemini 같은 모델을 호출해 쓰는 접점이다. 모델 선택, 컨텍스트 한도, 토큰 가격, 프롬프트 캐싱, 스트리밍, 도구 호출 규격이 여기 묶인다. 모델마다 강점과 과금이 달라, 작업별 라우팅과 캐싱 설계가 비용을 좌우한다.
GPT-6 아스트라 출시 및 주요 스펙
GPT-6 아스트라(Astra)가 9월 3일 오픈AI에 의해 공개되었다. 이 모델은 컴퓨터 조작, 브라우징, 소프트웨어 엔지니어링, 사이버보안, 과학 등에서 최고 수준의 성능을 자랑하며, FrontierMath 98%, ARC-AGI-3 99.9%, ExploitBench 100%의 벤치마크 점수를 기록했다. 가격은 입력 10달러, 출력 50달러로, 이전 모델인 GPT-5.6 Sol의 2.5배에 해당한다. 아스트라는 사이버보안 '중대' 등급으로 단계적으로 공개되며, 구독제와 API는 곧 제공될 예정이다.
Open source AI gateway가 트래픽을 더 나은 모델로 전환
Open source AI gateway가 트래픽을 활용하여 더 나은 모델로 전환하는 기능을 제공한다.
OpenAI의 GPT-6 Astra와 Anthropic의 Claude Fable 5.1 출시
OpenAI는 GPT-6 Astra를 출시하며 FrontierMath Tier 4에서 98%를 기록하고, 소프트웨어와 복잡한 워크플로우를 탐색할 수 있는 모델을 목표로 하고 있다. Anthropic의 Claude Fable 5.1은 코딩과 지식 작업을 지원하며, Mythos 5.1은 신뢰할 수 있는 접근 프로그램에 제한된다. Google은 Gemini 3.8 Flash를 출시하며 코딩과 추론 능력을 강화했다.
Ling 3.0 Tiny 모델, 1.3B 활성화로 성능 우수
Ling 3.0 Tiny 모델이 1.3B의 활성화에도 불구하고 여전히 성능이 가장 뛰어난 것으로 보인다.
GPT-6 Astra 출시 48시간 후 X에서의 10가지 사례
OpenAI의 GPT-6 Astra가 발표된 후 48시간 동안 X에서 바이럴된 사례들이 소개되었다. 이틀 동안의 결과물은 언리얼 엔진 월드, Blender 모델, 브라우저에서 돌아가는 게임, 부동산 홍보 영상 등 3차원 결과물이 주를 이루었다. 사례로는 에이전트 대화, 맨해튼 거리 재현, 3D 게임 제작, 3D 모델링 및 홍보 영상 제작 등이 포함된다.
OpenAI, GPT-6 Astra 출시 및 기능 소개
OpenAI는 GPT-6 Astra를 새로운 플래그십 모델로 출시했다. Astra는 컴퓨터 사용, 소프트웨어 엔지니어링, 수학/과학, 사무 작업, 사이버 보안 분야에서 활용될 수 있도록 설계되었다. 초기에는 제한된 조직에 배포되며, 이후 ChatGPT Plus/Pro/Business/Enterprise, API, AWS로 확장될 예정이다. 가격은 표준 모델이 1M 입력 토큰당 $10, 출력 토큰당 $50이며, 고속 모델은 각각 $20, $100이다. OpenAI는 Astra가 99.9%의 성능을 기록한 ARC-AGI-3과 같은 벤치마크 수치를 발표했다.
Claude Fable 5.1, Mythos 5.1, GLM-5.3-Flash, Qwen 3.8 출시
최근 한 달간 세 가지 모델이 출시되었다. Anthropic은 Claude Fable 5.1과 Mythos 5.1을 출시했으며, 이는 두 가지 안전 장치 하에 판매되는 동일한 가중치 세트이다. Zhipu는 320B 모델인 GLM-5.3-Flash를 출시했으며, 이 모델은 18B 파라미터를 활성화하고 중국 칩에서 익명 트래픽을 처리하는 데 일주일을 소요했다. Alibaba는 Qwen 3.8 패밀리를 출시했으며, 여기에는 오픈 가중치를 가진 최초의 Max-class Qwen과 Qwen 4 아키텍처의 미리보기가 포함된다.
WeatherNext 3: 가장 진보되고 정확한 글로벌 날씨 AI 모델
WeatherNext 3는 가장 진보되고 정확한 글로벌 날씨 AI 모델이다.
OpenAI, Anthropic, xAI, Google의 AI 모델 서비스 중단 발생
2023년 목요일 오전, OpenAI, Anthropic, xAI, Google이 운영하는 클라우드 기반 AI 모델에서 중복된 서비스 중단이 발생했다. Anthropic은 오전 9시 23분에 Claude Mythos 5.1, Claude Fable 5.1, Claude Opus 5에 대한 요청에서 '부분적인 중단'을 보고했으며, 약 15분 후 원인을 파악하고 12시 16분에 문제를 해결했다고 밝혔다. 별도의 사건 보고서에서는 정오 직후 Claude Sonnet 5에 대한 요청에서 '높은 오류'가 발생했다고 전했다. OpenAI는 오전 10시 43분에 ChatGPT와 Codex에서 '높은 오류'로 인해 성능 저하가 발생했다고 보고했으며, 12시 55분에 문제를 해결했다고 밝혔다.
Claude 시스템 프롬프트 업데이트: 노래 가사 재생산 금지
Anthropic은 Claude 소비자 애플리케이션의 시스템 프롬프트를 공개했다. 새로운 프롬프트에서는 노래 가사, 시, 책 및 기사에서의 특정 구문을 재생산하지 않도록 명시하고 있으며, 이는 1929년 이전에 발표된 작품은 제외된다. 또한 저작권이 있는 캐릭터나 로고를 생성하는 것도 금지된다.
Muse Spark 1.3, GPT-5.6-Sol과 동급으로 평가받으며 90% 할인 제공
Muse Spark 1.3은 현재 세계에서 세 번째 모델로 평가받고 있으며, OpenAI와 Anthropic의 모델과 유사한 성능을 보이고 있다. 이 모델은 오픈 웨이트로 제공될 예정이며, 훈련에 참여할 경우 90% 이상의 할인 혜택이 주어진다.
llm-gemini 0.34 버전 출시 및 Gemini 3.8 Flash 모델 소개
llm-gemini 0.34가 출시되었으며, 새로운 모델인 'gemini-3.8-flash'가 추가되었다. 이 모델은 낮음, 중간, 높음의 사고 수준을 지원한다. 또한 비동기 응답에서 모델 버전 기록 실패가 수정되었다. Google은 Gemini 3.8 Flash를 출시하였고, 이 모델은 HTML과 JavaScript 작업에서 빠르고 저렴한 성능을 보여준다.
Google, Gemini 3.8 Flash 모델 출시
Google은 Gemini 3.8 Flash를 출시했다. 이 모델은 Gemini 3.7 Flash보다 복잡한 작업에서 더 많은 추론 단계를 수행하고 도구를 반복적으로 호출하여 '더 열심히 작업한다'고 주장한다. 가격은 3.7 Flash와 동일하게 입력 토큰 100만 개당 $0.75, 출력 토큰 100만 개당 $3.75이지만, 성능 극대화를 위해 더 많은 토큰을 사용할 수 있다고 경고했다. 개발자들은 토큰 사용을 최소화하고 싶다면 Gemini 3.7 Flash를 계속 사용할 수 있다.
Claude Fable 5.1, AWS에서 출시
Claude Fable 5.1이 Amazon Bedrock과 Claude Platform에서 제공된다. 이 모델은 코딩, 과학 연구, 기업 워크플로우에서의 고급 작업을 지원하며, 'Covered Model'로 지정되어 데이터 보존 및 안전 검토 정책이 적용된다. Claude Fable 5.1은 이전 모델보다 향상된 추론 능력을 보여주며, 자율 운영 및 종합적인 지식 작업을 지원한다. 또한, 데이터 보존은 최대 30일이며, AWS에서 안전 검토를 위해 사용자의 프롬프트와 출력을 유지한다.
Claude Fable 5.1 및 Mythos 5.1 출시: 75% 캐시 읽기 가격 인하 및 70% 더 많은 출력 토큰
Anthropic은 Claude Fable 5.1과 Mythos 5.1을 출시했다. Fable 5.1은 복잡한 다단계 작업을 위한 모델로, 입력 토큰은 $10, 출력 토큰은 $50, 캐시 쓰기는 $12.5로 가격이 유지되었으며, 캐시 읽기 가격은 75% 인하되어 $0.25가 되었다. Fable 5.1의 컨텍스트 창은 1백만 토큰이다. 초기 벤치마크 결과에 따르면 Fable 5.1은 66의 인공지능 지수를 기록했다.
Qwen3.8-27B Q4로 제작한 마인크래프트 클론의 기능 추가
사용자가 Qwen3.8-27B Q4 모델을 사용하여 제작한 마인크래프트 클론이 훈련 데이터에 마인크래프트가 포함되어 있다는 이유로 인상적이지 않다는 의견이 제기되었다. 이에 따라 모델에 4가지 새로운 요소를 추가하도록 하였다.
Amazon Bedrock, 인도에서 OpenAI GPT-5.6 모델 지원 시작
Amazon Bedrock이 인도에서 OpenAI GPT-5.6 모델인 Terra와 Luna를 지원하며, 인도 내에서 데이터 처리 요구 사항을 충족할 수 있다. 두 모델은 1백만 토큰의 컨텍스트 윈도우를 제공하고, 텍스트 및 이미지 입력을 받아 텍스트 출력을 생성한다. 인도 내에서만 요청이 처리되며, Mumbai와 Hyderabad 리전 간의 크로스 리전 추론이 가능하다. 이 기능은 요청을 여러 AWS 리전으로 자동 라우팅하여 처리량을 개선한다.
Qwen 3.8 27B 모델을 16GB GPU에서 100k 컨텍스트로 실행하기
Qwen 3.8 27B 모델을 RTX 4070 Ti SUPER GPU에서 실행하는 방법을 공유한다. 이 설정은 100,000 토큰의 컨텍스트를 지원하며, VRAM 사용량은 약 15.93GB로 최적화되었다. 주요 구성 요소로는 Qwen3.8-27B-i1-IQ4_XS-GGUF-Smaller 모델, Jinja 템플릿, beellama.cpp 인퍼런스 엔진이 포함된다. 생성 속도는 47-50 토큰/초이며, KV 캐시 유형은 kvarn5(K)와 kvarn4(V)를 사용하여 메모리와 품질을 균형 있게 조정하였다.
Tencent의 Hy4 Preview 모델 발표
중국 회사 Tencent가 새로운 오픈 웨이트 텍스트 입력 LLM인 Hy4 Preview를 발표했다. 이 모델은 총 770B 파라미터와 49B 활성 파라미터를 가지며, 1M 토큰의 컨텍스트 윈도우를 지원한다. 이전 모델인 Hy3는 295B 파라미터와 21B 활성 파라미터, 256,000 컨텍스트를 가지고 있었다.
Alibaba, Qwen3.8-Flash-Next 모델 가중치 공개
Alibaba는 개발자들이 실험하고 평가할 수 있도록 Qwen3.8-Flash-Next의 모델 가중치를 공개했다. 이 모델은 125B 파라미터의 주 모델과 추가로 51B N-그램 임베딩을 포함하는 다중 모달 혼합 전문가(MoE) 모델이다. 각 토큰당 6B 파라미터가 활성화되며, 기본적으로 262,144 토큰의 컨텍스트 윈도우를 제공하고, 최대 1M 토큰까지 확장할 수 있다.
Decathlon의 Chronos-2를 통한 수요 예측 시스템 운영
Decathlon은 100,000명 이상의 직원과 4억 명의 사용자를 보유한 세계 최대의 스포츠 용품 소매업체로, 정확한 수요 예측을 위해 Chronos-2를 선택했다. 이 시스템은 12주 및 52주 예측을 통해 각 지역에서 25,000개 제품의 주간 판매량을 예측하며, 유럽, 인도, 중국, 동남아시아, 라틴 아메리카 등 여러 공급 지역에서 운영된다. 이전에는 Amazon SageMaker AI DeepAR과 Holt-Winters 기법을 사용했으나, 운영 복잡성을 줄이고 정확도를 높이기 위해 Chronos-2로 전환했다.
사주, 영화, 게임, 여행, 검색 트렌드 관련 API 소개
이번 편에서는 사주, 영화, 게임, 여행, 검색 트렌드와 관련된 API를 소개한다. 데이터의 신선도보다 쓸모가 중요하며, 각 도메인마다 대표 API를 제시한다. 예를 들어, 한국천문연구원의 음양력 정보 API는 양력 날짜를 입력하면 음력 날짜와 간지, 윤달 여부를 반환하며, 하루 10,000회 무료로 사용할 수 있다. 영화 관련 API로는 KOBIS 오픈API가 있으며, 일별 및 주간 박스오피스 데이터를 제공한다.
GLM-5.3-Flash 모델 출시
GLM-5.3-Flash는 GLM-5 시리즈의 첫 번째 네이티브 멀티모달 모델로, glm5_next 아키텍처의 첫 번째 오픈 웨이트 릴리스이다. 이 모델은 320B 파라미터를 가지며, 45개의 레이어로 구성되어 있다. GLM-5.3-Flash는 하이브리드 희소 및 선형 주의 메커니즘을 사용하고, 30T 토큰의 멀티모달 데이터로 훈련되었다. 또한, FP8 형식으로 제공되며, 1,048,576 토큰의 컨텍스트 길이를 지원한다.
Qwen3.8-Flash-Next: 멀티모달 MoE 모델
Qwen에서 공개한 Qwen3.8-Flash-Next는 멀티모달 MoE 모델로, Qwen4의 아키텍처를 미리 보여준다. 이 모델은 125B 토큰을 가지고 있지만, 6B 활성화로 성능 향상을 이룬다. 현재 DGX Spark에서 Unsloth 양자화 모델을 사용해 테스트 중이며, 72.5GB UD-IQ1_S와 78.9GB UD-Q2_K_XL 모델을 시도해 보았다.