본문으로 건너뛰기

Category

AI 모델·API

AI 모델·API는 Claude, GPT, Gemini 같은 모델을 호출해 쓰는 접점이다. 모델 선택, 컨텍스트 한도, 토큰 가격, 프롬프트 캐싱, 스트리밍, 도구 호출 규격이 여기 묶인다. 모델마다 강점과 과금이 달라, 작업별 라우팅과 캐싱 설계가 비용을 좌우한다.

News·

XingChen-AGI의 Xing4.0-29B-A4B 모델 소개

Xing4.0-29B-A4B는 중국 텔레콤 인공지능 기술 회사에서 개발한 차세대 대형 언어 모델로, 총 29B 파라미터를 가지며, 토큰당 4B가 활성화된다. 이 모델은 256K의 컨텍스트 길이를 기본으로 지원하며, 512K로 확장 가능하다. Ascend NPU 플랫폼에서 MindSpore 프레임워크를 사용하여 훈련된 최초의 모델로, 복잡한 엔지니어링 작업에 최적화되어 있다. 또한, 다단계 계획, 도구 호출 및 복잡한 추론 체인 실행을 지원하는 에이전트 지향 아키텍처를 갖추고 있다.

r/LocalLLaMA
News·

TypeSafe의 System One 모델, 기존 LLM보다 100배 빠르고 200배 저렴

TypeSafe가 발표한 System One 모델은 기존의 작은 최전선 LLM보다 100배 더 빠르고 200배 더 저렴하다고 전해진다. 이 모델은 코드 작성이나 추론을 하지 않지만, 병렬 샘플링, 환각 없음, 보정 기능을 제공하며, RLCD(보정된 결정) 방식으로 훈련되었다.

Latent Space (swyx & Alessio)
News·

오픈 웨이트 모델 성능 비교 및 테스트 방법

LLM 제공사의 API 기반 서비스는 개발자가 생성형 AI 애플리케이션을 시작할 때 간단한 방법이지만, 보안 요구가 높은 환경에서는 오픈 웨이트 모델을 직접 구동하는 것이 필요할 수 있다. 테스트는 엔비디아 RTX PRO 6000 GPU 4장을 사용하여 gpt-oss-20b, gpt-oss-120b, Qwen3.8-27B, Gemma4:31b, Mistral-Small-4-119B 모델을 비교하였다. 첫 번째 테스트에서 gpt-oss-20b는 약 250 tokens/s, gpt-oss-120b는 약 184 tokens/s를 기록했으며, Qwen3.8-27B는 약 26 tokens/s, Gemma4:31b는 약 23 tokens/s로 나타났다.

요즘IT (Yozm IT)
News·

토스의 LLM 평가 기준과 Toss Benchmark 소개

토스는 LLM의 성능을 평가하기 위해 Toss Benchmark를 구축하였다. 이 벤치마크는 한국어 범용 성능과 토스 도메인 성능을 함께 평가하며, 실제 업무에서의 모델 성능을 확인하기 위한 기준을 제공한다. 토스는 LLM을 상품 카탈로그 생성, 카드 약관 분석, 광고 검수 등 다양한 업무에 활용하고 있다. 또한, 모델의 성능은 언어와 추론 설정에 따라 달라질 수 있으며, 한국어 환경에서의 평가가 필요하다.

토스 테크 (Toss Tech)
News·

CrofAI, OpenRouter를 통한 모델 라우팅으로 사기 논란에 휘말리다

CrofAI는 저렴한 가격으로 인퍼런스 서비스를 제공한다고 주장했으나, 실제로는 OpenRouter를 통해 더 저렴하거나 성능이 낮은 모델로 요청을 라우팅하는 방식으로 운영되었다. 예를 들어, 비싼 모델인 kimi-k3는 $2/$10의 가격으로 판매되었지만, 실제로는 GLM 5.3 Flash로 라우팅되어 13.3배의 입력 가격과 20배의 출력 가격을 부과했다. CrofAI는 서비스 중단을 발표하고 환불을 약속했으며, 이후 모든 온라인 존재를 삭제했다.

r/LocalLLaMA
News·

Nemotron 3 Ultra에서 2.5배 더 많은 사용자 지원을 위한 풀스택 NIM 최적화

대형 언어 모델을 배포하는 것은 생산 준비 완료의 첫 단계일 뿐이다. 생산 팀은 가능한 많은 동시 사용자를 지원해야 하며, 이를 위해 GPU 인프라를 활용하면서도 응용 프로그램의 반응성을 유지해야 한다. 이러한 균형은 긴 프롬프트와 단계 간 재사용되는 맥락이 있는 에이전틱 AI 작업에 더욱 중요하다.

NVIDIA Technical Blog
News·

Amazon SageMaker Inference의 접두사 인식 라우팅 도입

Amazon SageMaker Inference는 요청의 시작 부분을 분석하여 동일한 접두사를 가진 요청을 같은 인스턴스로 라우팅하는 접두사 인식 라우팅 기능을 도입했다. 이 기능은 Llama 3.1 70B 모델을 사용한 벤치마크에서 P50 첫 토큰 시간(TTFT)을 최대 77% 단축하고, 처리량을 최대 16% 증가시켰으며, KV 캐시 적중률을 약 25%에서 80% 이상으로 향상시켰다. 또한, 요청이 인스턴스에 균등하게 분산되지 않도록 하여 캐시의 효율성을 높인다.

AWS Machine Learning Blog
News·

Amazon SageMaker HyperPod의 모델 캐싱으로 추론 대기 시간 단축

Amazon SageMaker HyperPod에서 대형 언어 모델을 배포할 때, 요청한 포드가 준비되기까지의 시간은 주로 두 가지 다운로드 과정에 의해 지연된다. 모델 캐싱 기능이 도입되어 모델 가중치와 컨테이너 이미지를 미리 클러스터 노드에 로드함으로써, 포드 시작 시 로컬 NVMe 저장소에서 약 7 GB/s 속도로 데이터를 읽을 수 있게 되어, 포드가 트래픽을 서비스하는 데 걸리는 시간이 몇 분으로 단축된다.

AWS Machine Learning Blog
News·

Astra 모델, Fable 5.1보다 큰 발전 이룩

Astra는 Fable 5.1보다 큰 발전을 이루었으며, 3D 작업과 게임 관련 작업에서 뛰어난 성능을 보인다. 많은 벤치마크에서 이전 모델들보다 현저한 성능 향상을 보여주고 있다. Astra는 컴퓨터 사용과 하위 에이전트 조정에서도 우수하며, OpenAI는 Astra보다 한 단계 높은 내부 모델을 개발 중이라고 발표했다.

Don't Worry About the Vase (Zvi Mowshowitz)
News·

Amazon Bedrock에서 OpenAI 모델 선택을 위한 벤치마크 결과

조직들이 생성 AI 애플리케이션을 구축할 때, 모델을 비교하는 일반적인 방법은 백만 토큰당 가격이다. 그러나 실제 작업에서는 결과를 구매하며, 이 과정에서 모델의 정확도와 필요한 토큰 수, 대화의 턴 수 등이 비용에 영향을 미친다. 본 포스트에서는 Amazon Bedrock에서 OpenAI 모델(gpt-5.6-luna, gpt-5.6-terra, gpt-5.6-sol)과 OpenAI API의 비용 효율적인 모델(gpt-5.4-mini, gpt-5.4-nano)의 성능을 비교하는 오픈 소스 벤치마크 결과를 공유한다. 각 모델의 정확도와 비용을 측정하여, 실제 작업에서의 성과를 평가하는 방법을 제시한다.

AWS Machine Learning Blog
News·

Qwen3.8-27B-Humanlike-Chat: 현실적인 인간 대 인간 대화를 모방한 모델

Qwen3.8-27B-Humanlike-Chat 모델은 125,217개의 인간 대 인간 메시지를 포함한 데이터셋으로 훈련되었으며, 대화의 자연스러움을 높이기 위해 설계되었다. 이 모델은 일반적인 AI 어시스턴트의 느낌을 줄이고, 대화에서 더 짧고 덜 다듬어진 응답을 제공한다. 훈련된 모델은 huihui-ai/Huihui-Qwen3.8-27B-abliterated 위에 rank-256 LoRA를 적용하였고, 체크포인트 863에서 테스트되었다. 또한, OpenAI 호환 엔드포인트도 제공된다.

r/LocalLLaMA
News·

Qwen 모델을 활용한 대화형 챗봇 설정 방법

Qwen 모델의 인기로 인해 일반 대중이 모델에 대해 잘 알지 못한다는 점이 지적되었다. 모델을 특정 역할로 설정하고, 그에 맞는 대화 예시를 작성하면 대화 파트너로서의 효과를 높일 수 있다. 또한, 모델이 대화에서 어떻게 반응해야 하는지를 명확하게 지시하는 것이 중요하다. 예를 들어, John Llama라는 캐릭터를 설정하고 그에 대한 특성과 기술적 제약을 명시하는 방법이 제안되었다.

r/LocalLLaMA
News·

Agnes-3.0-Flash 33B 멀티모달 모델의 구조와 기능

Agnes-3.0-Flash는 262,144 토큰의 컨텍스트 창을 지원하며, 조정 가능한 추론 노력, 도구 호출, 텍스트, 이미지 및 비디오 이해 기능을 갖춘 하이브리드 주의 디코더이다. 72개의 디코더 레이어 중 54개는 델타 규칙을 따르고, 18개는 글로벌 주의를 사용하며, 숨겨진 크기는 5120이다. 이 모델은 248,320의 어휘를 가지고 있으며, 27개의 비전 타워 레이어를 포함하고 있다.

r/LocalLLaMA
News·

기술 기업들이 오픈 AI 모델로 전환하는 추세

Uber, Pinterest, Stripe, Coinbase, Ramp, AT&T는 독점 모델을 포기하고 스마트 모델 라우팅을 사용하여 AI 비용을 절감하고 있다. Linear와 Anthropic은 AI 에이전트가 자동으로 버그를 수정하고 기술 부채를 제거하는 실험을 진행 중이며, 이는 예상보다 잘 작동하고 있지만 검토 없이 병합할 수 있는 코드는 생성하지 못하고 있다. OpenAI는 SpaceX의 모델을 경쟁자로 삼아 Cursor에서 GPT 모델을 철수했으며, Anthropic은 SpaceX의 컴퓨팅 자원에 의존하고 있다. Ramp의 데이터에 따르면, 8월에 상위 1% 기업의 AI 지출이 10% 감소한 것으로 확인되었다.

The Pragmatic Engineer (Gergely Orosz)
News·

OpenRouter의 자동 대체 처리 기능과 문제점

OpenRouter는 요청에 대해 가장 비용 효율적인 옵션을 자동으로 선택하여 단일 API 엔드포인트로 모델을 호출할 수 있도록 한다. 그러나 다양한 제공업체가 서로 다른 최적화 및 설정을 사용하기 때문에 동일한 OpenRouter 엔드포인트가 서로 다른 방식으로 작동할 수 있다. 일부 제공업체는 비전 모델에 대한 비전 기능이 없으며, 추론 처리 방식도 다를 수 있다. 특정 제공업체로의 라우팅을 제어할 수 있는 'provider.only' 옵션이 있으며, '/endpoints' 메서드를 통해 특정 모델 ID에 대한 사용 가능한 제공업체 목록을 확인할 수 있다.

Simon Willison's Weblog
News·

HuggingFace 해킹 후 모델 출시 소식

HuggingFace 해킹 사건에 대한 포스트모템이 다수 발표되었으며, OpenAI의 Astra가 오늘 출시될 예정이다. 이번 주에는 Mythos 5.1, Fable 5.1, Gemini 3.8 Flash, Muse Spark 1.3, GLM-5.3-Flash 등이 출시될 예정이다. OpenAI의 Astra는 'recurrent depth' 기법을 사용하고 있으며, 이는 Chain of Thought의 해석 가능성에 큰 영향을 미치지 않는 것으로 보인다.

Don't Worry About the Vase (Zvi Mowshowitz)
News·

Alibaba Qwen3.8-2.4T-A95B 모델 공개 및 Amazon SageMaker HyperPod 배포 방법

2026년 8월 12일, Alibaba의 Qwen 팀은 Qwen3.8-2.4T-A95B 모델을 공개했다. 이 모델은 2.4조 개의 총 매개변수를 가지며, 262K 토큰까지의 네이티브 컨텍스트를 지원한다. Qwen3.8은 다단계 코딩, 장기 계획 및 자율 도구 사용을 포함한 복잡한 작업을 처리할 수 있도록 설계되었다. 이 모델은 Amazon SageMaker HyperPod에서 vLLM을 사용하여 배포할 수 있으며, 8개의 NVIDIA B300 Blackwell Ultra GPU를 사용하는 ml.p6-b300 인스턴스에서 실행된다.

AWS Machine Learning Blog
News·

Deepseek V4.1 Flash 모델의 파라미터 수치 정정

Deepseek V4.1 Flash 모델의 총 파라미터 수치는 748B이며, 기본 모델은 552B이다. 이전에 제기된 284B, 305B, 485B, 522B는 잘못된 수치다. 모델의 주요 구성은 약 551.566B 파라미터로 40층으로 구성되어 있으며, FFN 전문가가 543.582B, 나머지 구성 요소가 7.984B이다. 추가적으로 engram은 약 196.929B, DSpark/MTP는 약 14.225B, 비전 인코더는 약 0.485B이다. 이 모델을 사용하기 위해서는 128GB 또는 256GB의 RAM/VRAM이 필요하다.

r/LocalLLaMA
News·

Ling-3.0-flash-VL 모델의 이미지 및 비디오 이해 기능

Ling-3.0-flash-VL은 124B의 총 파라미터를 가진 모델로, 1M 토큰까지의 컨텍스트 윈도우를 지원하며, 이미지와 비디오 이해 기능을 확장하여 언어, 추론 및 긴 컨텍스트 기능을 계승한다. 이 모델은 ViT 비주얼 인코더를 통해 이미지와 비디오에서 특징을 추출하며, VideoRoPE를 사용하여 시각적 변화 이해를 지원한다. 또한, 42-layer 하이브리드 백본과 희소 MoE 아키텍처를 통해 효율적인 멀티모달 처리 기능을 제공한다.

r/LocalLLaMA
News·

모델 및 라이센스 업데이트: Motif-3, GLM-5.3, Hy4-preview

모델 라이센스 변화가 두드러진 가운데, GLM-5.3은 MIT 라이센스에서 커스텀 라이센스로 변경되었으며, 상업적 목적으로 사용 시 100억 달러 이상의 수익이 발생하면 Z.AI의 보안 검토를 통과해야 한다. Motif-3은 MIT 라이센스를 유지하며, 모델 크기에 비해 우수한 성능을 보인다. Tencent의 Hy4-preview는 모델 크기를 증가시키며, 현재 과도한 사고 문제를 겪고 있다.

Interconnects (Nathan Lambert)
News·

Amazon Bedrock에서 GPT-6 Astra의 일반 제공 시작

OpenAI의 GPT-6 Astra가 Amazon Bedrock에서 일반 제공되며, 이는 고성능과 보안을 갖춘 추론 엔진에서 작동한다. GPT-6 Astra는 복잡한 비즈니스 결정에 깊은 추론과 판단을 제공하고, 코드 작성, 데이터 분석, 복잡한 워크플로 자동화 등에서 활용된다. 이 모델은 최대 1백만 개의 입력 토큰을 처리할 수 있으며, 반복적인 요청에서 동일한 컨텍스트를 재사용할 수 있는 기능을 지원한다.

AWS Machine Learning Blog
News·

Astra 모델, GPT-6 패밀리의 시작

Astra는 GPT-6 패밀리의 첫 모델로, ARC-AGI-3보다 성능이 우수하고 Zapier의 AutomationBench에서 최고 점수를 기록하며 Fable 5.1과 동일한 가격이다. Astra는 Canva에서 초상화를 그릴 수 있으며, Unreal Engine을 사용해 맨해튼을 재구성하는 등의 작업을 수행할 수 있다. Codex에서는 질문에 대한 답변을 기다리지 않고도 작업을 계속 진행할 수 있는 기능이 추가되었다. OpenAI는 자동화된 연구 인턴 목표를 달성했다고 밝혔다.

Ben's Bites (Ben Tossell)
News·

OpenAI, GPT-6 Astra 출시 및 AGI 시대 시작 예고

OpenAI는 GPT-6 Astra를 출시하며, 이를 컴퓨터 및 브라우저 내비게이션, 코딩, 어려운 수학 문제 해결에 있어 최첨단 모델로 소개했다. Astra는 DMV 예약, 구직 목록 검색, 아파트 탐색을 평균 사람보다 빠르게 수행할 수 있다. OpenAI는 Astra가 '세계 최고의 컴퓨터 사용 모델'이라고 강조하며, 이 모델이 AGI 시대의 시작을 알릴 것이라고 밝혔다. Astra는 내부 'Critical' 사이버 보안 기준을 최초로 충족하여 제한된 접근이 필요하며, 안전성 문제로 인해 강화된 모니터링 시스템이 도입되었다.

Last Week in AI (Kurenkov & Harris)
News·

DS-V4-Flash-Vision Q8과 Qwen3.8-Flash-Next Q8 비교

사용자는 DS-V4-Flash-Vision(Q8_K_XL 양자화)와 Qwen3.8-Flash-Next(Q8_K_XL 양자화)를 비교한 결과, DS-V4FV가 Qwen3.8보다 토큰 생성 속도가 약 40% 느리지만, 작업 완료 속도는 약 두 배 빠르다고 보고했다. Qwen3.8은 'xhigh' 모드에서 사용 불가능하며, DS-V4FV는 같은 작업을 12분에 완료한 반면 Qwen3.8은 25분이 걸렸다. Qwen3.8은 지시 사항을 과도하게 해석하는 경향이 있다.

r/LocalLLaMA