News
AI 뉴스
매일 수집·정리하는 전세계 AI 소식을 최신순으로
토스의 LLM 평가 기준과 Toss Benchmark 소개
토스는 LLM의 성능을 평가하기 위해 Toss Benchmark를 구축하였다. 이 벤치마크는 한국어 범용 성능과 토스 도메인 성능을 함께 평가하며, 실제 업무에서의 모델 성능을 확인하기 위한 기준을 제공한다. 토스는 LLM을 상품 카탈로그 생성, 카드 약관 분석, 광고 검수 등 다양한 업무에 활용하고 있다. 또한, 모델의 성능은 언어와 추론 설정에 따라 달라질 수 있으며, 한국어 환경에서의 평가가 필요하다.
Toss Benchmark는 한국어 범용 성능과 토스 도메인 성능을 평가하여, 실제 업무에 적합한 모델을 선택하는 데 중요한 기준을 제공한다.
맨체스터 대학교, NVIDIA Earth-2로 영국 대기오염 예측
맨체스터 대학교의 David Topping 교수는 NVIDIA Earth-2 모델을 활용하여 영국의 대기오염 예측 모델을 개발했다. 이 모델은 기존 화학-기후 시뮬레이션에서 생성된 데이터를 기반으로 훈련되었으며, Isambard-AI 슈퍼컴퓨터에서 단 이틀 만에 훈련을 완료했다. Earth-2 CorrDiff와 Earth-2 StormCast 모델을 통해 대기질 관측 데이터를 활용한 시간 의존적 예측이 가능해졌다. 이 모델은 향후 정책 변화에 따른 대기오염 시나리오 예측과 헬스케어 조직을 위한 실시간 대기질 통찰 제공에 활용될 수 있다.
Earth-2 CorrDiff 모델은 Isambard-AI에서 훈련되었으며, 이는 대기오염 예측을 위한 효율적인 컴퓨팅 자원 활용을 가능하게 한다.
Google, Gemini 3.8 Live 및 3.8 Live Extended Thinking 발표
Google은 Gemini 3.8 Live와 3.8 Live Extended Thinking이라는 두 개의 음성 대 음성 모델을 발표했다. 이 모델은 OpenAI의 GPT-Live 계열과 유사한 형태를 가지고 있으며, 사용자는 웹 브라우저를 통해 음성 대화를 시도할 수 있다. 이 구현은 라이브 API에 연결하여 음성을 캡처하고 재생하는 Web Audio API를 사용한다.
Gemini 3.8 Live 모델은 실시간 음성 대화 기능을 제공하여 사용자와의 상호작용을 개선할 수 있다.
NVIDIA의 Jensen Huang, Salesforce Dreamforce에서 Koa 발표
NVIDIA의 CEO Jensen Huang은 Salesforce Dreamforce에서 Salesforce의 첫 번째 CRM 추론 모델 Koa를 발표했다. Koa는 NVIDIA Nemotron 3 Super를 기반으로 하여 거의 30년간의 기업 CRM 배포에서 수집된 독점 합성 데이터셋으로 구축되었다. Koa는 이미 Salesforce 내부에서 운영 중이며, Slack에서 직원 에이전트를 지원하고 있다. Koa는 고객 파일럿을 10월에 시작하며, 2026년 겨울에 미국 지역에서 일반 제공될 예정이다.
Koa는 CRM 작업에서 3배 적은 오류로 선도 모델 성능을 초과하거나 일치한다.
Good Start Labs, 게임을 AI 모델 훈련 자료로 활용
Good Start Labs의 공동 창립자이자 CEO인 Alex Duffy는 게임이 교육 도구로서 유용하다고 언급하며, AI 모델 훈련을 위해 게임을 활용하고 있다고 밝혔다. 이 회사는 2022년 10월 Every에서 분사되었으며, General Catalyst, Inovia, Every 및 엔젤 투자자로부터 360만 달러의 자금을 확보했다. Duffy는 전략 게임 Diplomacy에서 AI 모델들이 어떻게 다르게 행동하는지를 관찰하며, 이러한 게임이 AI 모델에 전략적 사고와 같은 기술을 가르칠 수 있다고 결론지었다. 최근 Good Start Labs는 30B 모델을 1830: The Game of Railroads and Robber Barons 게임에서 훈련시킨 후, 금융 연구 작업에서의 성능을 테스트했다.
Good Start Labs는 게임 훈련이 AI 모델의 금융 연구 작업 성능을 향상시킬 수 있음을 보여주었다.
Microsoft Foundry Dev Pack 출시: 단일 명령으로 개발 시작하기
Microsoft Foundry 환경 설정이 간소화되었다. Foundry Dev Pack은 초기 설치 단계를 통합하여 단일 설치 프로세스로 제공된다. 이 패키지는 터미널, IDE 또는 코딩 에이전트에서 필요한 도구를 설치하는 올인원 설치 프로그램이다. Dev Pack은 Foundry Command Line Tools, Microsoft Foundry Skill, Visual Studio Code용 Microsoft Foundry Toolkit, Foundry Canvas(미리보기) 등을 포함한다. Windows, macOS, Linux에서 각각의 명령어를 통해 설치할 수 있다.
Foundry Dev Pack은 개발자가 Foundry Command Line Tools와 Microsoft Foundry Toolkit을 쉽게 설치하여 개발 환경을 신속하게 구성할 수 있도록 지원한다.
Anton Leicht, AI 발전과 정치적 권력 보존에 대한 논의
Anton Leicht는 카네기 국제 평화 재단의 연구원으로, 인공지능이 발전함에 따라 정치적 및 제도적 권력을 어떻게 보존할 수 있는지를 탐구한다. 그는 AI 훈련 중단의 전략적 거래, 산업 자율 규제의 장애물, 중간 강국이 데이터 센터 용량과 반도체 우위를 모델 접근과 교환하는 방법에 대해 논의한다. Leicht는 민간 연구소나 단일 정부에 의한 통제의 독점화를 방지하는 것이 재앙적인 모델 위험을 해결하는 것만큼 중요하다고 강조한다.
AI 훈련 중단의 전략적 거래는 AI 개발의 방향성과 관련된 중요한 결정 요소가 된다.
AI가 인류를 멸망시킬 가능성에 대한 논의
세계 주요 AI 연구소의 직원들이 고급 AI가 인류를 파괴할 수 있는 실제 가능성이 있다고 언급하고 있다. 이와 관련된 대화가 2026년 9월 15일에 기록되었으며, 발언자에는 Niall Firth, Will Douglas Heaven, Grace Huckins이 포함된다. 이 대화에서는 AI의 멸망 우려가 어디에서 비롯되었는지, 그 주장이 타당한지, 그리고 만약 그렇다면 우리가 무엇을 해야 하는지에 대해 논의한다.
Dense 모델과 MoE 모델: 활성화된 파라미터와 처리량
Nemotron 3.5 Lightning은 30B 파라미터 모델이 각 토큰당 3B 파라미터만 활성화하면서도 더 큰 모델의 용량을 활용할 수 있는 방법을 보여준다. 두 가지 주요 모델 아키텍처는 Dense 모델과 Mixture-of-Experts (MoE)이다. 모델이 파라미터를 조직하는 방식은 성능에 중요한 영향을 미친다.
Nemotron 3.5 Lightning은 MoE 아키텍처를 사용하여 각 토큰에 대해 파라미터의 하위 집합만 선택함으로써 효율성을 높인다.
NVIDIA DSX를 통한 AI 공장 전력 관리 최적화
NVIDIA의 Emerald AI가 개발한 Conductor 플랫폼은 전력 소비를 조정하여 AI 공장의 유연한 컴퓨팅 작업을 관리한다. Silicon Valley Power가 보낸 200개 이상의 전력 수요 신호에 따라, AI 공장은 전력을 4메가와트에서 3메가와트로 자동으로 줄이며, 높은 우선순위 작업은 계속 실행된다. NVIDIA DSX MaxLPS는 고정 전력 예산 내에서 24% 더 많은 토큰 처리량을 지원할 수 있도록 설계되었다.
NVIDIA DSX MaxLPS는 고정 전력 예산 내에서 더 많은 작업을 수행할 수 있도록 하여 AI 공장의 효율성을 높인다.
OpenAI의 Codex와 ChatGPT Work의 확산
OpenAI는 Codex와 ChatGPT Work를 통해 비엔지니어 부서의 사용률이 0%에서 90%로 급증했다. Codex는 2025년 2월 Mac, 3월 Windows에 출시되었고, 7월에는 ChatGPT Work가 도입되었다. OpenAI의 내부 Codex는 외부 버전보다 발전된 기능을 제공하며, 비엔지니어들도 복잡한 작업을 수행할 수 있도록 지원한다. Codex의 /goal 설정 기능이 추가되어 작업 완료까지 지속적으로 수행할 수 있다.
OpenAI의 Codex는 비엔지니어 부서에서도 90% 사용률을 기록하며, 복잡한 작업을 지원하는 도구로 자리잡았다.
NVIDIA FLARE를 통한 Docker, Kubernetes, Slurm에서의 연합 학습 확장
연합 학습(FL) 프로젝트는 일반적으로 하나의 서버, 몇 개의 클라이언트, 각 사이트의 데이터셋으로 시작된다. 프로젝트가 성장함에 따라 알고리즘 실행에서 공유 인프라 운영으로 도전이 전환된다. 이 과정에서 GPU 할당, 여러 연구 간 분리 유지, 각 조직의 데이터 통제 등이 필요하다.
NVIDIA FLARE를 활용하면 연합 학습 프로젝트의 인프라 운영을 효율적으로 관리할 수 있다.
Claude 모델을 악용하려는 시도와 Anthropic의 대응
Anthropic은 2025년 12월부터 2026년 8월까지의 기간 동안 Claude 모델을 악용하려는 여러 시도를 방지했다고 보고했다. 이 보고서는 사이버 작전, 영향력 작전, 감시, 사기 및 사기, 생물학적 악용, 전통 무기 개발, 증류 등 7개 분야에서의 활동을 다룬다. 특히, 중국의 연구소들이 Claude를 증류하려는 시도를 했으며, Anthropic은 이를 차단했다. 보고서에 따르면, Claude의 증류는 다른 악용 사례들을 가능하게 하는 주요 위협으로 지적되었다.
Claude 모델의 증류 시도가 악용될 경우, 사이버 보안에 심각한 위협이 될 수 있다.
Capsule – SQLite 파일로 데이터 저장 가능한 단일 파일 웹 앱
Capsule은 Rust와 Tauri 2.0으로 개발된 앱으로, HTML 앱과 데이터를 단일 SQLite 파일에 패킹할 수 있다. 사용자 데이터는 localStorage 키/값 저장소 또는 MongoDB 스타일의 컬렉션 API를 통해 저장되며, PDF 파일이나 이미지와 같은 자산도 데이터베이스에 직접 저장할 수 있다. 모든 데이터는 CSV 또는 JSON으로 쉽게 내보낼 수 있으며, 문서는 기본적으로 파일 시스템에 접근할 수 없고 인터넷 접근 권한이 필요하다. 각 데이터 항목은 고유한 UUID와 타임스탬프를 가지고 있어 여러 사용자가 작업할 경우 파일을 병합할 수 있다.
Capsule은 HTML 앱과 데이터를 단일 파일로 관리할 수 있어, 데이터 저장 및 공유의 복잡성을 줄일 수 있다.
Instinct 개인 에이전트 사용 경험과 OpenAI API 업데이트
Ben Tossell은 Instinct라는 개인 에이전트를 사용해보았으나, 그 기능이 만족스럽지 않다고 평가했다. 그는 에이전트가 자신을 관리하는 느낌을 주며, 느리다고 느꼈다. 또한, OpenAI API에 새로운 기능으로 GPT-Live-1과 Agents API가 추가되었으며, 이를 통해 개발자들은 Codex와 유사한 에이전트에게 작업을 보낼 수 있게 되었다.
OpenAI의 Agents API는 개발자들이 인프라 구성에 대한 걱정 없이 작업을 관리할 수 있도록 해준다.
Cloudflare, AI 훈련 거부 설정 도입
Cloudflare는 웹사이트 소유자가 검색에서 색인화된 상태를 유지하면서 AI 훈련을 거부할 수 있는 새로운 'Disallow AI Training' 설정을 발표했다. 이 설정은 Apple, Google, Microsoft가 지원하며, 웹사이트 소유자는 AI 요약에서 콘텐츠 포함 여부를 제어할 수 있는 기능도 제공받게 된다. 기존의 robots.txt 지시어로는 크롤러의 행동을 완전히 제어할 수 없으므로, Cloudflare는 네트워크를 통해 크롤러의 행동을 식별하고 차단할 수 있는 방법을 마련했다.
Cloudflare의 'Disallow AI Training' 설정을 통해 웹사이트 소유자는 AI 훈련을 거부하면서도 검색에서의 가시성을 유지할 수 있다.
SHADOW-50M: 44M 파라미터의 양자화된 LLM 모델
SHADOW-50M은 44M 파라미터로 구성되어 있으며, 45B 토큰으로 학습되었다. 모델 크기는 19.8 MB이고, CPU에서 약 1,900 tok/s로 실행된다. 이 모델은 오프라인에서 작동하며, 고정된 512비트 지문을 사용하여 73,880개의 어휘를 표현한다. 계산이 필요한 경우, 모델은 특정 형식으로 계산 요청을 작성하고, 고정 회로가 이를 처리하여 결과를 반환한다. 또한, 기록을 저장할 때 주의 상태를 디스크에 기록하며, 인덱스는 22바이트/토큰으로 구성되어 있다.
SHADOW-50M은 45B 토큰으로 학습되어 CPU에서 약 1,900 tok/s의 속도로 실행되며, 이는 개발자들이 오프라인 환경에서도 효율적인 LLM을 활용할 수 있음을 보여준다.
미국과 중국 AI 모델 성능 격차 4.4개월로 축소
Mozilla 보고서에 따르면, 미국 기술 회사의 최첨단 AI 모델과 중국 회사의 최상급 오픈 모델 간 성능 격차가 4.4개월로 줄어들었다. 이에 따라 많은 기업들이 일상적인 작업에 대해 훨씬 저렴한 오픈 모델로 전환하고 있으며, 대부분의 조직은 기본적으로 오픈 모델을 사용하는 것이 바람직하다고 한다. Moonshot AI의 Kimi K3는 Anthropic의 Fable 5 폐쇄형 모델보다 AI 성능 점수가 3점 낮으면서도 비용은 30%에 불과하다.
Kimi K3와 Fable 5의 성능 차이가 적어지면서 기업들은 비용 효율적인 오픈 모델을 선택할 수 있는 기회를 가지게 된다.
AI의 자기 개선: Claude와 GPT-5.3-Codex의 역할
이번 시리즈에서는 AI의 자기 개선에 대한 연구를 다룬다. 2026년 6월, Anthropic은 Claude가 5월 기준으로 생산 코드베이스에 병합된 코드의 80% 이상을 작성했다고 발표했다. OpenAI는 GPT-5.3-Codex가 자신의 훈련 과정을 디버깅하고 배포의 일부를 관리했다고 밝혔다. DeepMind의 AlphaEvolve는 다른 모델이 훈련하는 인프라에 알고리즘 개선을 제공하고 있다. 이제 AI가 AI를 구축하는지에 대한 질문은 명확해졌고, 남은 질문은 어떤 작업을 수행하며, 얼마나 잘 수행하는지, 그리고 그 작업을 어떻게 검증하는지이다.
Claude가 80% 이상의 코드를 작성한 사실은 AI가 코드 작성에 실질적으로 기여하고 있음을 보여준다.
CrofAI, OpenRouter를 통한 모델 라우팅으로 사기 논란에 휘말리다
CrofAI는 저렴한 가격으로 인퍼런스 서비스를 제공한다고 주장했으나, 실제로는 OpenRouter를 통해 더 저렴하거나 성능이 낮은 모델로 요청을 라우팅하는 방식으로 운영되었다. 예를 들어, 비싼 모델인 kimi-k3는 $2/$10의 가격으로 판매되었지만, 실제로는 GLM 5.3 Flash로 라우팅되어 13.3배의 입력 가격과 20배의 출력 가격을 부과했다. CrofAI는 서비스 중단을 발표하고 환불을 약속했으며, 이후 모든 온라인 존재를 삭제했다.
ChatGPT 광고가 아마존의 챗봇 문제 해결
ChatGPT 광고가 효과를 보고 있으며, 이는 아마존의 챗봇과 관련된 가장 큰 문제를 해결하고 있다. 또한, 월마트가 애플 페이를 수용하기로 결정했는데, 이는 기존의 방식을 바꾸는 것이 어렵기 때문이다.
AI 데이터 센터 구축에 대한 투자와 경제적 위험
펜실베이니아 대학교의 Jessica Wachter 교수는 AI 데이터 센터 구축을 위해 하이퍼스케일러들이 2027년까지 약 1.1조 달러를 지출할 것으로 예상하고, 이들이 손익 분기점을 맞추기 위해서는 생산성을 2.7배 증가시켜야 한다고 밝혔다. 2023년 하이퍼스케일러들은 약 7500억 달러를 지출하며, 향후 4년간 총 AI 자본 투자가 5조 달러를 초과할 것으로 보인다. 그러나 AI 수익은 올해 약 1500억에서 2000억 달러에 불과해, 지출이 수익과 비례하지 않는 상황이다. 이러한 투자로 인해 AI 기업들의 재정 건전성과 미국 경제에 큰 위험이 존재한다.
하이퍼스케일러들은 2023년 약 7500억 달러를 AI 데이터 센터 구축에 지출하고 있으며, 이는 향후 4년간 5조 달러를 초과할 것으로 예상된다.
Ruby Justice Thelot과의 인터뷰: 인터넷 문화와 현실 세계의 경계
Elena Burger는 학자이자 사이버 민족학자인 Ruby Justice Thelot과 인터넷 문화와 현실 세계의 경계가 점점 모호해지는 상황을 논의한다. 이들은 웰니스와 최적화 문화, 펩타이드, GLP-1, 웨어러블 기기, 미세 플라스틱, 정량적 자아 등을 사례로 사용하여, 현상에 대한 대화가 그 현상 자체보다 커질 수 있는 '파라콘텐츠' 개념을 설명한다. 또한, 신체 최적화의 역사와 기술이 개인이 자신을 측정하고 수정하는 방법을 더욱 세분화하는 방식에 대해 논의하며, 앞으로는 동일한 이상을 향한 최적화가 아닌 개별화되고 때로는 극단적인 형태의 '신체 미래주의'가 나타날 것이라고 예측한다.
Ruby는 기술이 개인의 신체 최적화 방법을 더욱 세분화할 것이라고 예측한다.
트럼프, AI 안전 우려를 음모로 간주하며 반격
트럼프 대통령은 AI 안전 우려를 '병든 음모'로 간주하며 반격에 나섰다. 그는 AI 규제를 주장하는 기업 CEO들을 비난하고, AI의 통제를 위해서는 '강하고 똑똑한 대통령'이 필요하다고 주장했다. LA에서 열린 'All In Summit'에서 트럼프는 AI의 지배에 대한 두려움을 '허위'라고 일축하며, 미국이 중국에 대한 우위를 잃지 않도록 해야 한다고 강조했다.
트럼프는 AI의 안전 우려를 정치적 음모로 간주하며, AI 규제에 대한 반대 입장을 분명히 했다.