본문으로 건너뛰기

News

AI 뉴스

매일 수집·정리하는 전세계 AI 소식을 최신순으로

NewsAI 모델·API·

Grok 4.5 모델 출시 및 OpenAI GPT-5.6 모델 공개

Anthropic은 Claude 구독을 통해 Fable 5에 대한 접근을 7월 12일까지 연장했다. OpenAI는 오늘 모든 사용자에게 GPT-5.6 모델(Sol, Terra, Luna)을 공개한다고 발표했다. Grok 4.5 모델은 Opus 4.7과 4.8 사이의 성능을 보이며, Opus 모델보다 6배, GPT-5.5보다 3배 저렴한 비용으로 제공된다. ChatGPT Voice는 새로운 모델 GPT-Live-1과 Live-1-mini를 도입하여 대화의 자연스러움을 개선했다.

Grok 4.5 모델은 Opus 모델보다 6배 저렴한 비용으로 제공되어 비용 효율적인 AI 솔루션을 필요로 하는 개발자들에게 유용할 수 있다.

Ben's Bites (Ben Tossell)원문

GeForce NOW, 토론토에 GeForce RTX 5080 서버 추가

GeForce NOW가 토론토에 GeForce RTX 5080 기반의 새로운 서버를 추가하여 클라우드 게임 성능을 향상시킨다. 이 서버는 캐나다 내 사용자들에게 더 나은 게임 경험을 제공하며, Ultimate 회원은 PC, Mac, 모바일 기기 등 다양한 장치에서 최대 4K 해상도와 120fps로 게임을 스트리밍할 수 있다. 또한, NTE: Neverness to Everness 게임이 업데이트되어 새로운 캐릭터와 게임 모드를 도입하며, GeForce NOW는 곧 모바일 기기를 위한 터치 컨트롤을 지원할 예정이다.

GeForce RTX 5080 서버의 도입으로 캐나다 사용자들은 향상된 클라우드 게임 성능을 경험할 수 있다.

NVIDIA Blog원문
NewsAI 리서치·논문·

Fundamental의 NEXUS, 구조화된 데이터 분석을 위한 대형 표 모델 개발

Fundamental은 2026년 2월 5일에 NEXUS라는 대형 표 모델(LTM)을 발표했다. 이 모델은 구조화된 데이터 분석에 특화되어 있으며, 기존의 기계 학습 알고리즘과 달리 다양한 예측 작업에 최소한의 맞춤형 특성 엔지니어링으로 적용될 수 있다. NEXUS는 수십억 개의 테이블로 사전 훈련되어 있으며, 데이터의 맥락을 이해하여 보다 정확한 예측을 가능하게 한다. 현재 Amazon Web Services와 같은 기업들이 이 모델을 채택하고 있다.

NEXUS는 구조화된 데이터 분석의 한계를 극복하고, 다양한 예측 작업에 활용될 수 있는 가능성을 제공한다.

IEEE Spectrum — AI원문
NewsAI 툴·

Studio, AI 프롬프트 및 기술을 위한 기록 시스템 제공

Studio는 버전 관리, 소유 및 추적이 가능한 AI 프롬프트와 기술을 위한 기록 시스템을 제공합니다. 이를 통해 빠른 반복이 가능하며, 제어된 상태로 배포할 수 있고, 일관된 AI 행동을 보장합니다.

Studio는 AI 프롬프트와 기술의 버전 관리 및 추적 기능을 제공하여 개발자들이 AI 시스템의 일관성을 유지할 수 있도록 지원합니다.

Mistral AI News원문
NewsAI 리서치·논문·

The Sequence의 후원 없이 운영되는 AI 관련 출판물

The Sequence는 2년 이상 후원 없이 운영되고 있으며, 매주 후원 요청을 받고 있다. 이 출판물은 AI 세계를 탐색하는 데 도움을 주기 위해 기술적 깊이와 객관성을 유지하고자 한다. 최근 Dwarkesh Patel의 에피소드에서 'grindability'가 'verifiability'만큼 중요하다는 주장이 제기되었고, 이는 AI 도메인의 품질을 평가하는 새로운 시각을 제공한다.

TheSequence (Jesus Rodriguez)원문
NewsAI 리서치·논문·

Mark Zuckerberg와 Priscilla Chan의 AI를 통한 질병 치료 논의

Mark Zuckerberg와 Dr. Priscilla Chan은 Chan Zuckerberg Initiative(CZI)의 목표인 질병 치료, 예방 및 관리에 대해 논의했다. CZI는 개별 혁신에 자금을 지원하기보다는 과학적 발견을 가속화할 수 있는 도구와 인프라를 구축하는 데 집중하고 있다. 이 대화에서는 Biohub, Cell Atlas, 가상 세포 모델, 공개 생물학 데이터셋과 AI의 역할이 강조되었으며, AI가 과학자들이 가설을 테스트하는 데 어떻게 도움을 줄 수 있는지에 대해 논의되었다.

AI는 과학자들이 비싼 실험을 수행하기 전에 가설을 테스트하는 데 도움을 줄 수 있다.

AI + a16z원문
NewsAI 모델·API·

SpaceXAI, Grok 4.5 출시 - Opus 클래스 모델

SpaceXAI가 Grok 4.5를 출시했다. Grok 4.5는 1.5T 파라미터를 가진 모델로, Opus 4.7과 유사한 성능을 보이며, 코드 및 에이전트 작업에 최적화되어 있다. 공식 가격은 입력 1M 토큰당 2달러, 출력 1M 토큰당 6달러로 설정되었으며, Grok 4.5는 Grok 4.3보다 3배 큰 모델이다. Grok 4.5는 Grok Build/API/Cursor에서 사용 가능하며, Hermes Agent에서도 지원된다.

Grok 4.5는 코드 및 에이전트 작업에 특화된 첫 모델로, 기존 모델 대비 더 나은 경제성과 속도를 제공한다.

Latent Space (swyx & Alessio)원문
NewsAI 리서치·논문·

Retrieval-Augmented Generation을 통한 공공 건강 질문 응답 개선

대형 언어 모델(LLMs)은 의료 질문 응답 벤치마크에서 유망한 결과를 보이지만, 공공 건강 분야에서의 사용은 허위 정보와 공식 지침의 빠른 변화로 제한된다. Retrieval-Augmented Generation(RAG)은 명시적으로 유지되는 코퍼스를 기반으로 응답을 강화하여 이러한 위험을 완화한다. 연구에서는 7,929개의 질문으로 구성된 PubHealthBench를 RAG 환경으로 확장하고, 다양한 임베딩 모델과 코퍼스 변형을 통해 밀집형, 희소형, 하이브리드 검색을 비교하였다. 하이브리드 검색은 일관되게 회수 및 순위 품질을 개선하며, 검색된 맥락을 제공하면 다양한 LLM에서 다중 선택 정확도가 크게 증가한다. 또한, LLM을 평가하기 위한 기준을 도입하여 신뢰성, 완전성, 명확성 및 사실 일관성을 검증하였다.

하이브리드 검색은 공공 건강 QA의 신뢰성을 높이는 주요 요소로 작용한다.

arXiv cs.CL (계산언어학·NLP)원문
NewsAI 리서치·논문·

불균형 데이터셋에서의 마진 컨포멀 예측의 한계와 클래스 조건 수정

컨포멀 예측은 약물 발견에서 모델 신뢰성을 평가하는 데 사용되며, 선택한 오류율 alpha에 따라 실제 레이블을 포함하는 예측 세트를 반환한다. 그러나 불균형 데이터셋에서는 마진 컨포멀 예측이 소수 클래스의 커버리지를 심각하게 저하시킨다. 네 개의 데이터셋에서 소수 클래스의 커버리지가 혈뇌 장벽 침투에서는 64.8%, 임상 시험 독성에서는 4.2%로 떨어졌다. 클래스 조건 컨포멀 예측(Mondrian)은 모든 데이터셋에서 소수 클래스 커버리지를 목표로 회복시키며, 예측 세트 크기의 적당한 증가로 이를 달성한다.

클래스 조건 컨포멀 예측은 불균형 데이터셋에서 소수 클래스의 커버리지를 회복하여 예측의 신뢰성을 높인다.

arXiv cs.LG (머신러닝)원문
NewsAI 리서치·논문·

TriRoute: 조건부 계산을 통한 언어 모델 최적화

TriRoute는 언어 모델의 품질과 토큰당 추론 비용을 분리할 수 있는 조건부 계산 기법을 제안한다. 이 시스템은 주의 모드, 희소 FFN 전문가 집합, KV-cache 비트 폭을 조정하는 단일 경량 컨트롤러를 사용하여 각 토큰에 대해 조정된 정책을 생성한다. TriRoute는 160M에서 1.3B 파라미터의 디코더 전용 모델에서 MoD, MoE, KV-양자화의 조합보다 더 나은 성능을 보이며, 희귀 개체와 코드, 산술 문제에 대한 강인성을 유지한다.

TriRoute는 Lagrangian 예산 제약 하에 평균 계산 및 메모리 비용을 조절할 수 있는 기능을 제공한다.

arXiv cs.LG (머신러닝)원문
NewsAI 리서치·논문·

QANTIS: IBM Heron 하드웨어에서의 순차적 POMDP 신념 업데이트

QANTIS는 양자 프로세서를 신념 업데이트 서비스로 활용하여 이전 신념과 관찰 모델을 바탕으로 희귀 사건 증거 항을 추정하고 고전 계획자에게 일반적인 사후 확률을 반환한다. 이 연구는 IBM Heron 하드웨어에서 순차적 Tiger POMDP 수평을 통해 이 서비스를 재사용할 수 있는지를 조사하며, 하드웨어 사례 연구를 통해 결과를 도출하였다. 연구에서는 증폭 없이, 보호된 Grover 증폭, 모든 단계 고정점 증폭을 비교하고, 반환된 사후 확률이 하류 행동에 영향을 미치는지를 확인하였다. 모든 단계 FPAA는 8단계 및 12단계 주행에서 Tiger 사후 확률을 보존하며, 20단계 및 32단계 제어는 동일한 운영 범위 내에 유지된다.

모든 단계 FPAA가 Tiger 사후 확률을 보존하는 결과는 IBM Heron 하드웨어에서 신념 업데이트의 신뢰성을 높일 수 있음을 시사한다.

arXiv cs.AI (인공지능)원문
NewsAI 리서치·논문·

SageMath와 LLM 에이전트를 활용한 수학 문제 해결 평가

최근 AI 수학 분야에서는 자동 형식화와 정리 증명에 초점을 맞추고 있으며, 컴퓨터 대수 시스템(CAS)의 역할은 충분히 탐구되지 않았다. 본 연구에서는 LLM 추론과 SageMath의 검증 가능한 피드백을 결합한 ReAct 스타일의 에이전트 설정을 제안하고, 이를 통해 RealMath 벤치마크의 연구 수준 수학 문제를 해결하는 성능을 평가하였다. SageMath 접근을 통해 모든 평가 모델에서 평균 9.7%의 성능 향상이 있었으며, Qwen 3.7-Max는 SageMath의 혜택을 가장 많이 받았고, GPT-5.5는 75.2%의 해결률과 가장 낮은 토큰 사용량을 기록하였다. 이 연구는 CAS가 보강된 에이전트가 수학자들의 계산 탐색을 지원하는 유망한 방향임을 제시한다.

SageMath 접근을 통해 모든 평가 모델에서 평균 9.7%의 성능 향상이 있었다.

arXiv cs.AI (인공지능)원문
NewsAI 리서치·논문·

DeepSeek V3.2를 활용한 ARC-AGI-1의 비용 효율적 추론 모델

ARC-AGI-1에 대한 연구에서 DeepSeek V3.2라는 오픈-웨이트 모델을 사용하여, ARC-specific fine-tuning 없이도 패턴 발견과 프로그램 합성을 분리한 Explorer-Definer Pipeline을 도입하였다. 이 파이프라인은 400-task 평가 세트에서 57.50%의 pass@2를 기록하며, Reflective Orchestrator를 통해 67.25%의 pass@2를 달성하였다. 이 구조는 15.50%의 원샷 기준을 약 52포인트 향상시켰으며, 생성 기반의 성능 향상을 위한 재탐색을 통해 pass@1을 +9.81 pp 증가시켰다.

Reflective Orchestrator는 이전 가설이 실패할 경우 새로운 변환을 자율적으로 탐색하여 성능을 향상시킨다.

arXiv cs.AI (인공지능)원문
NewsAI 리서치·논문·

D2PO: 동적 선호 최적화를 통한 확산 샘플러 최적화

D2PO(Dynamic Direct Preference Optimization)는 시간 단계 일정과 분류기 없는 가이드(CFG) 가중치에 따라 확산 샘플링 정책을 최적화하기 위한 프레임워크이다. 기존의 학생-교사 회귀 프레임워크의 한계를 해결하기 위해, D2PO는 샘플러 최적화를 선호 기반 정렬 문제로 재구성하고, 에너지 기반 모델(EBM)을 사용하여 선호 비교를 처리한다. 또한, 동적 선호를 도입하여 샘플링 정책이 학습됨에 따라 선호 샘플이 점진적으로 개선되도록 한다. 실험 결과, D2PO는 감각 품질과 더 잘 정렬되어 기존 회귀 기반 스케줄러보다 일관되게 우수한 성능을 보인다.

D2PO는 확산 샘플러의 감각 품질을 더 충실히 정렬하여 고품질 교사의 잠재력을 극대화한다.

arXiv cs.LG (머신러닝)원문
NewsAI 모델·API·

Qwen3.5 122B 모델의 성능

사용자는 Qwen3.5 122B 모델이 복잡한 작업을 수행하는 데 있어 가장 효율적이라고 언급했다. Qwen3.6 27B와 33B는 복잡한 작업에서 문제가 발생했으며, Gemma4 31B와 26B는 작업을 완료하는 데 어려움을 겪었다. Qwen3.5 122B는 약 160개의 PowerPoint에서 특정 데이터를 추출하는 작업을 약 2시간 만에 완료했다. 120B 크기의 MoE 모델은 성능과 속도에서 우수하다고 평가되었다.

Qwen3.5 122B 모델은 복잡한 데이터 추출 작업에서 신뢰할 수 있는 성능을 보여준다.

r/LocalLLaMA원문
NewsAI 코딩·

Bun의 Rust로의 재작성

Jarred Sumner는 Zig에서 Rust로의 Bun 재작성에 대한 블로그 포스트를 발표했다. 이 포스트에서는 메모리 관리 문제로 인해 Rust를 선택한 이유와, TypeScript로 작성된 Bun 테스트 스위트를 활용하여 Rust로의 포트를 자동화한 과정이 설명된다. 새로운 Bun 구현은 Claude Code v2.1.181에서 사용되며, Linux에서 시작 속도가 10% 빨라졌다.

Bun의 Rust 포트는 메모리 관리 문제를 해결하여 안정성을 높이고, Claude Code에서 실제로 사용되고 있다.

Simon Willison's Weblog원문

OpenAI, ChatGPT 음성 모드 모델 GPT-Live로 업그레이드

OpenAI는 ChatGPT 음성 모드의 모델을 GPT-Live로 업그레이드했다. 새로운 모델은 GPT-5.5를 배경으로 사용하며, 웹 검색이나 복잡한 작업이 필요한 질문은 GPT-5.5에 위임하여 결과를 대화에 통합한다. 이전 음성 모드는 GPT-4o 기반이었으며, 2024년까지의 지식 컷오프가 있었다. 새로운 모델은 대화 흐름을 유지하며, 사용자와의 상호작용에서 개선된 점이 있다.

GPT-Live는 GPT-5.5를 사용하여 더 복잡한 작업을 처리할 수 있는 기능을 제공한다.

Simon Willison's Weblog원문
NewsAI 에이전트·

Modal, 3억 5천 5백만 달러 시리즈 C 투자 유치

Modal은 3억 5천 5백만 달러의 시리즈 C 투자를 유치하며, AI 에이전트 경험을 위한 인프라의 필요성을 강조하고 있다. Modal은 서버리스 기능, 탄력적 추론, GPU 스냅샷, 자동 엔드포인트 등 다양한 AI 클라우드 기능을 제공하며, 17개 클라우드 제공업체의 용량 풀을 운영하고 있다. 에이전트는 빠른 반복과 피드백 루프가 필요하며, 이를 위해 전통적인 개발자 경험에서 에이전트 경험으로의 전환이 필요하다고 설명하고 있다.

Modal은 AI 에이전트가 작동하기 위해 필요한 탄력적 추론과 같은 기능을 제공하여, AI 인프라의 발전 방향을 제시하고 있다.

Latent Space (swyx & Alessio)원문
NewsAI 리서치·논문·

EBR-bench 출시 및 AI 소프트웨어 취약점 발견 현황

Epoch AI는 EBR-bench를 출시하여 AI의 경험 학습 능력을 테스트하는 복잡한 보드 게임을 이용한 벤치마크를 공개했다. 현재까지 AI가 경험으로부터 학습하는 증거는 미미하며, EBR-bench는 이러한 변화를 감지하는 도구로 사용될 예정이다. 또한, AI가 소프트웨어 취약점을 대규모로 발견하고 있으며, 21개 주요 조직이 1,500개의 고위험 CVE를 공개했다. OpenAI의 GPT-4는 2023년 3월 출시 이후 Epoch Capabilities Index에서 약 1년간 1위를 유지했다.

EBR-bench는 AI의 경험 학습 능력을 평가하는 도구로, AI의 경제적 및 안전성에 대한 중요한 질문을 제기한다.

Epoch AI — Benchmarking Hub원문

아이비리그 학생들, AI를 이용한 시험 부정행위 증가

브라운 대학교에서 학생들이 AI를 이용해 부정행위를 저지르고 있다는 새로운 스캔들이 발생했다. 프린스턴 대학교의 최근 조사에 따르면, 29.9%의 학생이 최소한 한 번 이상 AI를 사용해 시험이나 과제를 부정행위했다고 인정했다. 이는 학생들이 실제 학습 대신 AI를 통해 쉽게 시간을 벌려는 경향을 보여준다.

브라운 대학교의 사례는 AI를 통한 부정행위가 실제 학습을 대체할 수 있음을 시사한다.

Ars Technica — AI원문
News업무 자동화·

GitHub Agentic Workflows를 통한 크로스 레포 문서화 자동화

Aspire 팀은 GitHub Agentic Workflows를 사용하여 문서화 프로세스를 자동화했다. GitHub에서 제공한 데이터에 따르면, Aspire 13.3 및 13.4에서 82개의 기능 문서 pull request가 제품 pull request 후 평균 44.8시간 만에 병합되었으며, 모든 문서는 기능을 배포한 엔지니어에 의해 검토되었다. 이 과정에서 새로운 인력을 추가하거나 프로세스를 재교육할 필요가 없었다.

GitHub Agentic Workflows는 문서 작성과 코드 작성이 다른 레포에서 이루어질 때의 자동화 문제를 해결하는 데 도움을 준다.

GitHub Blog원문
NewsAI 에이전트·

AI 에이전트 SaaS의 패러다임 전환

AI 시대에는 도구가 아닌 일 그 자체를 판매하는 방향으로 패러다임이 변화하고 있다. Greg Isenberg는 AI 에이전트가 새로운 SaaS 모델이 될 것이라고 주장하며, 이는 노동의 본질과 가치 창출 방식, 창업 기회에 대한 구조적 전환을 의미한다. OpenAI는 GPT-5.6과 음성 모델을 공개했으며, 바이트댄스와 메타는 차세대 이미지 및 영상 생성 모델을 발표했다.

AI 코리아 커뮤니티 뉴스레터원문
NewsAI 코딩·

Kenton Varda, AI 작성 변경 설명 중단 선언

Kenton Varda는 자신의 팀에서 AI가 작성한 변경 설명(예: PR 및 커밋 메시지, 이슈/티켓)에 대한 중단을 선언했다. 그는 AI가 작성한 설명이 코드의 세부 사항은 잘 설명하지만, 코드의 전반적인 의미를 이해하는 데 필요한 고차원적인 프레임을 생략하여 리뷰에 도움이 되지 않았다고 밝혔다.

AI가 작성한 변경 설명이 코드 리뷰에 도움이 되지 않는 경우가 많다는 점을 지적했다.

Simon Willison's Weblog원문

Grok으로 생성된 7,000개의 아동 성적 이미지 사건

제기된 집단소송에서 Grok으로 생성된 아동 성적 이미지 사건이 언급되었다. 한 남성이 Grok을 사용해 11세 의붓딸의 사진으로 7,000개의 성적 이미지를 생성한 후 자살한 사건이 포함되어 있다. 소송에 따르면, Grok은 남성이 근친상간과 강간을 묘사한 극단적인 이미지를 생성하는 것을 허용했으며, xAI의 아동 안전 시스템은 남성이 '강간'이라는 프롬프트를 입력한 후에만 개입했다.

Grok은 유해한 행동을 플래그하지 않고 아동 성적 학대 자료(CSAM)를 생성할 수 있는 기능을 제공했다.

Ars Technica — AI원문