Google Gemini API
Google의 멀티모달 Gemini 모델을 호출하는 API다. 긴 컨텍스트와 이미지, 영상, 오디오 입력을 함께 다룬다.
AI 모델·API 관련 브리핑
XingChen-AGI의 Xing4.0-29B-A4B 모델 소개
Xing4.0-29B-A4B는 중국 텔레콤 인공지능 기술 회사에서 개발한 차세대 대형 언어 모델로, 총 29B 파라미터를 가지며, 토큰당 4B가 활성화된다. 이 모델은 256K의 컨텍스트 길이를 기본으로 지원하며, 512K로 확장 가능하다. Ascend NPU 플랫폼에서 MindSpore 프레임워크를 사용하여 훈련된 최초의 모델로, 복잡한 엔지니어링 작업에 최적화되어 있다. 또한, 다단계 계획, 도구 호출 및 복잡한 추론 체인 실행을 지원하는 에이전트 지향 아키텍처를 갖추고 있다.
Xing4.0-29B-A4B는 256K의 컨텍스트 길이를 지원하여 긴 문맥을 처리하는 데 유리하다.
오픈 웨이트 모델 성능 비교 및 테스트 방법
LLM 제공사의 API 기반 서비스는 개발자가 생성형 AI 애플리케이션을 시작할 때 간단한 방법이지만, 보안 요구가 높은 환경에서는 오픈 웨이트 모델을 직접 구동하는 것이 필요할 수 있다. 테스트는 엔비디아 RTX PRO 6000 GPU 4장을 사용하여 gpt-oss-20b, gpt-oss-120b, Qwen3.8-27B, Gemma4:31b, Mistral-Small-4-119B 모델을 비교하였다. 첫 번째 테스트에서 gpt-oss-20b는 약 250 tokens/s, gpt-oss-120b는 약 184 tokens/s를 기록했으며, Qwen3.8-27B는 약 26 tokens/s, Gemma4:31b는 약 23 tokens/s로 나타났다.
gpt-oss-20b는 단일 요청에서 약 250 tokens/s를 출력하여 성능이 우수함을 보여준다.
TypeSafe의 System One 모델, 기존 LLM보다 100배 빠르고 200배 저렴
TypeSafe가 발표한 System One 모델은 기존의 작은 최전선 LLM보다 100배 더 빠르고 200배 더 저렴하다고 전해진다. 이 모델은 코드 작성이나 추론을 하지 않지만, 병렬 샘플링, 환각 없음, 보정 기능을 제공하며, RLCD(보정된 결정) 방식으로 훈련되었다.
System One 모델은 기존 LLM과의 보완성을 강조하며, 빠른 결정 및 분류 기능을 통해 특정 작업에서 효율성을 높일 수 있다.
토스의 LLM 평가 기준과 Toss Benchmark 소개
토스는 LLM의 성능을 평가하기 위해 Toss Benchmark를 구축하였다. 이 벤치마크는 한국어 범용 성능과 토스 도메인 성능을 함께 평가하며, 실제 업무에서의 모델 성능을 확인하기 위한 기준을 제공한다. 토스는 LLM을 상품 카탈로그 생성, 카드 약관 분석, 광고 검수 등 다양한 업무에 활용하고 있다. 또한, 모델의 성능은 언어와 추론 설정에 따라 달라질 수 있으며, 한국어 환경에서의 평가가 필요하다.
Toss Benchmark는 한국어 범용 성능과 토스 도메인 성능을 평가하여, 실제 업무에 적합한 모델을 선택하는 데 중요한 기준을 제공한다.