News
AI 뉴스
매일 수집·정리하는 전세계 AI 소식을 최신순으로
Meta의 Muse AI, 생산성 도구로 첫 선보여
Meta는 새로운 Muse 어시스턴트를 출시하며 AI 기반의 생산성 도구에 본격적으로 진출했다. Muse는 온라인 쇼핑, 이메일, 여행 계획 등에서 사용자의 업무를 도와줄 수 있다고 한다. 그러나 사용자는 Muse가 자율적으로 수집한 정보의 양이 지나치게 많아 불안감을 느꼈다고 전했다.
Decoder 팟캐스트에서 AI 관련 피드백과 논의
Decoder 팟캐스트에서 Nilay Patel과 Greg Ott이 청취자 피드백을 다루는 에피소드를 진행했다. 특히 'software brain' 비디오에 대한 반응이 많았으며, 긍정적인 피드백이 주를 이루었다. Nilay은 AI 시스템의 소프트웨어 작성 능력과 데이터베이스 조작에 대한 높은 기대감과 함께 AI의 과대광고 주기를 언급했다.
Nilay은 AI 시스템이 소프트웨어를 작성하고 데이터베이스를 조작하는 능력에 대한 기대감이 높아지고 있다고 강조했다.
Meta의 개인 비서 Muse와 OpenAI의 ChatGPT 이미지 생성 모델 2.5
Ben Tossell은 Muse라는 Meta의 개인 비서에 대해 언급하며, 이는 여행 예약, 이메일 처리 등 다양한 작업을 수행할 수 있다고 설명했다. 또한 OpenAI의 ChatGPT 이미지 생성 모델 2.5는 이미지의 요소를 편집하는 데 매우 뛰어나며, 이미지당 소요 시간이 최대 50% 줄어든다고 한다. Tossell은 Astra와 Fable 5.1을 통해 다른 에이전트를 조정하고, GLM 5.3와 같은 오픈소스 모델을 실험하고 있다고 전했다.
ChatGPT 이미지 생성 모델 2.5는 이미지 편집의 효율성을 크게 향상시켜, 개발자들이 더 빠르고 효과적으로 비주얼 콘텐츠를 생성할 수 있게 한다.
d-Matrix, NVIDIA NVLink Fusion을 통한 Raptor XPU 배포 발표
AI 추론 칩 제조업체 d-Matrix는 차세대 Raptor XPUs를 NVIDIA의 AI 인프라 플랫폼에 연결하기 위해 NVLink Fusion을 사용할 것이라고 발표했다. 이를 통해 d-Matrix는 NVIDIA MGX 생태계의 검증된 랙 설계와 공급망, 전력 및 냉각 인프라를 활용할 수 있다. NVLink Fusion은 맞춤형 XPU와 CPU를 NVIDIA 스택에 연결하는 고대역폭, 저지연 기술로, 데이터 센터가 GPU, CPU, XPU를 지원할 수 있는 공통 랙을 표준화할 수 있도록 한다.
NVLink Fusion을 채택함으로써 d-Matrix는 NVIDIA MGX 생태계의 성숙한 인프라를 활용하여 저지연 추론을 보다 빠르고 안전하게 배포할 수 있다.
Anastasios Angelopoulos가 설명하는 Chatbot Arena의 모델 평가
Anastasios Angelopoulos는 Chatbot Arena의 공동 창립자이자 CEO로, AI의 신뢰성과 불확실성 정량화에 대한 연구를 통해 Chatbot Arena를 발전시켰다. Arena는 모델의 성능과 신뢰성을 측정하는 AI 평가 회사로, 사용자의 실제 워크플로우에서 모델의 유용성을 평가한다. Arena의 점수는 모델의 작업 완료율, 환각률 등을 포함하여 모델의 유용성을 반영하며, AutoEval 기능은 새로운 모델에 대해 초기 점수를 제공한다.
Arena는 모델의 유용성을 실제 사용자 기반에 맞춰 평가하여, AI 모델 개발에 있어 실질적인 기준을 제공한다.
OpenAI, 수학적 발견에 대한 데이터 출처 논란
OpenAI의 CEO 샘 올트먼이 Stargate AI 데이터 센터를 미디어 투어 중 방문했다. 최근 수학자 안드레아스 톰이 OpenAI의 모델이 자신의 미발표 연구에 의존했을 가능성을 제기하며 비윤리적이고 불투명한 행동을 비판했다. 그는 ChatGPT와의 상호작용이 OpenAI의 성공에 기여했을 수 있다고 주장했다.
OpenAI의 모델이 수학적 발견에 기여한 데이터의 출처에 대한 투명성이 요구된다.
AI 데이터 센터의 전력 아키텍처 문제와 해결 방안
2026년 7월 22일, 버지니아 애쉬번의 데이터 센터 클러스터에서 발생한 송전선 고장으로 3기가와트 이상의 부하가 순간적으로 차단되었다. 이는 데이터 센터의 전력 아키텍처 문제로, AI 데이터 센터는 훈련 중 부하가 70%까지 급변할 수 있어 기존 전력 시스템이 이를 처리하지 못하고 있다. 해결책으로는 전압을 13.8킬로볼트 이상으로 높이고, 데이터 홀에서 변전소 근처의 모듈형 인클로저로 이동시키며, 모든 전자가 항상 통과하는 시스템으로 전환하는 것이 제안되었다. 이러한 변화는 전력망의 신뢰성을 높이고, 경제성을 개선할 수 있다.
AI 데이터 센터의 부하가 70%까지 급변할 수 있어 기존 전력 시스템의 한계를 극복하기 위한 아키텍처 개선이 필요하다.
Cloudera와 Mistral, 기업 데이터에 특화된 주권 AI 지능 제공
Cloudera와 Mistral이 협력하여 규제 산업이 자율적으로 혁신할 수 있도록 돕는 특화된 주권 AI 지능을 기업 데이터에 제공한다.
규제 산업에서의 데이터 활용을 위한 AI 솔루션 개발이 가능해진다.
Mistral, 30억 유로 자금 조달로 유럽 AI 시장에서의 경쟁력 저하
유럽의 Mistral이 30억 유로(35억 달러)의 자금을 조달하며 210억 유로의 기업 가치를 기록했지만, 중국과 미국의 오픈소스 AI 모델과 경쟁에서 어려움을 겪고 있다. Mistral은 ASML, 삼성, 엔비디아와 같은 대규모 투자자를 보유하고 있으며, AI 인프라 및 데이터 센터로의 사업 전환을 추진하고 있다. Mistral Compute로의 집중은 Nebius 및 Nscale과 같은 유럽 네오 클라우드 리더들과의 경쟁을 의미한다.
Mistral의 30억 유로 자금 조달은 유럽 AI 시장에서의 경쟁력과 사업 전략 변화의 중요한 지표이다.
Apple의 하드웨어와 소프트웨어 통합의 힘과 AI의 맹점
Apple은 하드웨어와 소프트웨어 통합의 힘을 다시 한번 보여주었으나, AI에 대한 가장 큰 맹점은 앱의 우선성을 믿고 있다는 점이다.
AI가 벤처 캐피탈의 파워 법칙을 어떻게 변화시키고 있는가
a16z의 Jen Kha와 David George는 Accolade Partners의 Aram Verdiyan과 함께 AI가 기술 투자에서의 파워 법칙을 어떻게 변화시키고 있는지 논의했다. AI는 전통적인 소프트웨어보다 더 큰 영향을 미칠 수 있으며, 노동, 의료, 운송, 서비스 등 경제의 주요 부분에 적용될 수 있다. David는 자본이 AI 회사의 이점을 강화할 수 있다고 설명하며, Aram은 AI를 위성 포지션이 아닌 핵심 할당으로 다루어야 한다고 주장했다. 또한, 벤처 및 성장 투자에서의 경제 변화, 진정한 AI 성과와 초기 과대 광고를 구별하는 방법, 레거시 소프트웨어와 사모펀드에 대한 AI의 의미, 로봇공학, 자율주행, 의료, 에너지, 물리적 인프라 등에서의 기회에 대해서도 논의했다.
AI는 자본이 AI 회사의 이점을 강화할 수 있는 방식으로 투자 포트폴리오 구성에 영향을 미친다.
NVIDIA의 공급망 성능 측정: 웨이퍼 아웃에서 첫 번째 토큰까지
NVIDIA는 세계에서 가장 크고 복잡한 공급망을 운영하며, 그 성능은 웨이퍼 아웃에서 첫 번째 토큰까지 측정된다. 이 과정은 두 부분으로 나뉘며, 첫 번째는 실리콘이 팹을 떠나 데이터 센터 바닥에 조립된 시스템이 도착하기까지의 시간인 '타임 투 랙'이고, 두 번째는 전력, 냉각, 네트워킹 및 인프라를 구성하는 소프트웨어 스택을 포함하는 '타임 투 토큰'이다.
NVIDIA의 공급망 성능 측정 방식은 데이터 센터 운영의 효율성을 높이는 데 중요한 기준이 된다.
Deepseek V4.1 Flash 모델의 파라미터 수치 정정
Deepseek V4.1 Flash 모델의 총 파라미터 수치는 748B이며, 기본 모델은 552B이다. 이전에 제기된 284B, 305B, 485B, 522B는 잘못된 수치다. 모델의 주요 구성은 약 551.566B 파라미터로 40층으로 구성되어 있으며, FFN 전문가가 543.582B, 나머지 구성 요소가 7.984B이다. 추가적으로 engram은 약 196.929B, DSpark/MTP는 약 14.225B, 비전 인코더는 약 0.485B이다. 이 모델을 사용하기 위해서는 128GB 또는 256GB의 RAM/VRAM이 필요하다.
Deepseek V4.1 Flash 모델의 정확한 파라미터 수치는 748B로, 이를 통해 개발자들은 시스템 요구 사항을 보다 정확하게 이해하고 준비할 수 있다.
Microsoft, Salesforce 고객을 위한 AI 기반 Dynamics 365 Activate 출시
Microsoft는 Salesforce 고객을 위한 AI 기반 도구인 'Dynamics 365 Activate'를 공개했다. 이 도구는 Salesforce 구현을 Dynamics 365로 신속하게 전환할 수 있도록 지원하며, 데이터와 엔티티를 프로파일링하고 관계 및 종속성을 식별하여 이식 팀에게 명확한 청사진을 제공한다. Microsoft는 올해 말부터 추가 CRM 및 ERP 마이그레이션 시나리오를 출시할 예정이다.
Dynamics 365 Activate는 Salesforce 환경을 분석하여 데이터, 비즈니스 프로세스, 사용자 정의 및 종속성에 대한 상세한 이해를 구축한다.
State-Path Tool Menu를 통한 온라인 에이전트의 도구 실행 개선
언어 모델은 도구를 통해 작동하지만, 실제 에이전트는 수천 개의 인터페이스를 가진 라이브러리에 직면한다. 본 연구에서는 에이전트가 실행 전에 보여주는 도구의 짧고 정렬된 하위 집합인 도구 메뉴를 소개한다. 이 메뉴는 에이전트가 호출할 수 있는 도구만 포함하며, 다단계 작업은 최종 행동과 그 입력을 생성하는 필수 도구를 적절한 순서로 요구한다. State-Path Tool Menu는 관찰 가능한 요청 상태에서 원하는 결과로 가는 사전 실행 경로를 학습하도록 설계되었으며, ToolBench에서 온라인 성공률을 0.737에서 0.898로 향상시켰다. 이 메뉴는 128개의 공식 목록보다 32개의 도구로 더 완전한 체인을 다룬다.
State-Path Tool Menu는 ToolBench에서 온라인 성공률을 0.737에서 0.898로 향상시켰다.
검증된 코드 세계 모델을 통한 세계 시간 계산
LLM은 많은 실제 레이블된 예제를 본 후에만 도메인에서 일반화된다. 본 연구에서는 도메인의 동작을 코드로 작성할 수 있을 때, 하나의 템플릿이 여러 세계 모델로 인스턴스화되는 방법을 제시한다. 이 모델들은 기호 상태에 대한 실행 가능하고 검증 가능한 프로그램으로, 정확하게 레이블이 지정된 궤적의 무한한 출처가 된다. 여러 세계에서의 궤적을 통해 LLM을 미세 조정하는 '세계 시간 계산'을 통해, 훈련되지 않은 세계에 대한 일반화가 향상된다. 검증된 코드로 작성된 세계에서 레이블을 신뢰할 수 있으며, 실제 벤치마크에서도 유사한 결과가 나타난다.
검증된 코드로 생성된 세계에서 LLM을 미세 조정하면, 훈련되지 않은 세계에서 40%의 성능을 달성할 수 있다.
인도에서의 임산부 및 신생아 돌봄을 위한 감사 가능한 응급 분류 시스템
Noora Health는 WhatsApp 기반 서비스에서 월 50,000건 이상의 의료 질문에 답변하며, 긴급 분류 작업을 수행한다. 새로운 시스템은 대형 언어 모델(LLM)을 사용해 메시지가 응급인지 분류하고 해석 가능성을 제공한다. 이 시스템은 0.565에서 0.810으로 재현율을, 0.606에서 0.702로 F1 점수를 향상시켰으며, 152,421건의 환자 질문 중 28,535건(18.7%)을 응급으로 분류했다. 임상 전문가들은 48개의 새로운 규칙을 추가하여 시스템의 정확성을 높였다.
새로운 시스템은 재현율을 0.565에서 0.810으로 향상시켰으며, 임상 전문가가 각 단계의 검토를 통해 오류를 수정할 수 있게 한다.
OpenDiscoveryTrace: AI 과학자 워크플로우 평가를 위한 프로세스 트레이스
OpenDiscoveryTrace는 558개의 AI 과학 에이전트의 전체 경로를 포함하는 공개 데이터셋으로, 모델이 생성한 결과물뿐만 아니라 그 과정에서의 추론을 기록한다. 각 경로는 9개의 필드로 구성된 트레이스를 기록하며, 124개의 과학적 작업을 수행하는 동안의 생각, 도구 호출, 관찰, 오류, 수정 트리거 및 자기 보고된 신뢰도를 포함한다. 데이터셋은 GPT-5.4, Claude Opus 4.6, Gemini 3.1 Pro와 같은 세 가지 최전선 모델과 Qwen2.5-7B, Mistral-7B-v0.3 등 네 가지 오픈 웨이트 모델을 포함한다. 초기 분석 결과, 프로세스 트레이스는 출력만 평가했을 때는 보이지 않는 행동 차이를 드러낸다.
Claude Opus 4.6는 GPT-5.4에 비해 30배 더 많은 오류를 발생시키며, 이는 AI 모델의 성능을 평가하는 데 있어 프로세스 트레이스의 중요성을 강조한다.
Osprey: 타겟 비특정 사전 훈련으로 강화된 드래프터
Osprey는 사전 훈련된 소형 언어 모델을 활용하여 드래프터를 부트스트랩하고, 이를 통해 타겟에 구애받지 않는 자산으로 간주하여 경량화된 적응 단계로 작업을 줄인다. Osprey는 Qwen3-8B에서 평균 수용 길이를 16.1%, Llama-3.3-70B-Instruct에서 21.2%, 229B MiniMax-M2.5에서 22.7% 개선하며, 초당 토큰 수는 17.5% 증가시킨다. 이 방법은 특히 도메인 외 및 다국어 데이터에서 큰 성과를 보인다.
Osprey는 타겟 모델에 대한 사전 훈련을 재사용 가능하게 하여 드래프터의 작업 효율성을 높인다.
적응형 얽힌 게임 모듈을 통한 인공지능 일반화
이 연구는 상호작용하는 적응형 에이전트의 집단 행동을 모델링하기 위한 확률파 프레임워크를 소개하며, 일반화된 행동 지능(GBI) 비국소 확률파 방정식을 통해 검증 가능한 고유 모드를 도출한다. 중국의 intraday 주식 시장 데이터를 분석한 결과, 적응형 얽힌 게임 모드는 관찰된 의사 결정 패턴의 82-94%를 설명하며, 이는 독립적인 합리적 에이전트에 기반한 신자유주의 금융 예측과는 뚜렷한 대조를 이룬다. 연구는 인공지능 일반화(AGI) 아키텍처에 적응형 얽힌 게임 모듈을 통합할 필요성을 강조하며, 이는 전통적인 인공 신경망(AI)의 한계를 극복할 수 있는 방법을 제시한다.
Anthropic의 사이버 사건 평가 및 OpenAI의 ChatGPT 개선 사항
Anthropic은 Claude 모델과 관련된 사이버 사건을 평가하며, 세 가지 사건이 제3자 사이버 보안 평가 중 발생했다고 밝혔다. 이 사건들은 인터넷에 연결된 상태에서 정상적인 보호 장치가 비활성화된 상태에서 발생했다. OpenAI는 ChatGPT의 기본 경험이 개선되었으며, 주간 사용자 10억 명 기준으로 사실 오류가 65% 감소하고, 금융 관련 오류는 72% 감소했다고 보고했다. 또한, GPT-5.6 모델이 이전 모델보다 30% 이상 빠르다고 주장했다.
OpenAI는 ChatGPT의 사실 오류를 65% 감소시켰다고 보고하여, 사용자 경험의 질이 향상되었음을 보여준다.
GitHub의 2026년 8월 가용성 보고서
2026년 8월 GitHub은 가용성 문제에 직면했으며, 이로 인해 GitHub Actions와 관련된 여러 서비스에 영향을 미쳤다. 8월 6일에는 약 9시간 동안 GitHub Actions 워크플로우가 실패하거나 대기 상태에 있었고, 최소 74개 조직이 영향을 받았다. GitHub은 Azure로의 이전과 아키텍처 개선을 통해 용량을 늘리고 있으며, 8월 11일에는 Azure에서 MySQL 프라이머리를 처음으로 운영했다. 또한, GitHub Actions의 작업 라우팅 변경으로 CPU 사용량을 줄이고, Git 과부하 보호를 통해 6.4% 더 많은 트래픽을 처리할 수 있었다.
GitHub Actions의 작업 라우팅 변경으로 CPU 사용량이 98%에서 80%로 감소하여, 서비스의 안정성을 높였다.
WeWorm, WeChat 통화를 통한 제로 클릭 웜 공개
Calif Research는 WeChat 통화를 통해 iOS와 Android에서 퍼지는 첫 번째 제로 클릭 웜인 WeWorm의 데모를 발표했다. 피해자는 전화를 받지 않아도 되며, 전화를 받아도 아무 소리를 듣지 못하고 취약점이 여전히 성공한다. AI를 활용하여 팀은 약 2일 만에 원격 코드 실행(RCE) 익스플로잇을 작성했으며, 웜 구축에는 추가로 1주일이 소요됐다.
GitHub Copilot의 기업 환경에서의 활용과 장점
생성형 AI가 개발 환경에 도입되면서 GitHub Copilot Business 플랜이 주목받고 있다. 이 도구는 비주얼 스튜디오 코드와 같은 기존 개발 도구에서 자연스럽게 사용할 수 있으며, GitHub의 저장소, 이슈, 풀 리퀘스트, 코드 리뷰와 통합되어 개발 편의성을 높인다. 사용자는 GPT, Claude, Gemini, Grok 등 다양한 AI 모델을 선택할 수 있어, 작업에 맞는 모델을 활용할 수 있다. 그러나 AI가 모든 작업을 완벽하게 수행하지는 않으며, 개발자는 결과를 직접 검토해야 한다.
GitHub Copilot은 여러 LLM을 선택하여 사용할 수 있어, 개발자는 프로젝트에 맞는 AI 모델을 효율적으로 활용할 수 있다.