본문으로 건너뛰기

Category

AI 리서치·논문

arXiv 논문과 대형 연구소의 기술 리포트를 추적하는 카테고리다. 모델 아키텍처, 학습 기법, 벤치마크 결과처럼 6개월 뒤 제품에 들어올 흐름을 미리 읽는다. 한국 개발자가 논문 전문을 다 읽지 않고도 핵심과 재현 가능성을 가늠하도록 정리한다.

News·

JAXBench: Google Cloud TPU를 위한 AI 생성 커널 최적화 벤치마크

JAXBench는 Google Cloud TPUs에서 AI 생성 커널 최적화를 위한 TPU 네이티브 벤치마크 스위트로, 50개의 JAX 작업을 포함하고 있다. 17개의 생산 ML 연산자는 Llama-3.1, DeepSeek-V3, Mixtral, Mamba-2, AlphaFold2와 같은 공개 MaxText 라이브러리에서 추출되었으며, 33개의 연산자는 KernelBench에서 검증된 후 새로운 문제 크기로 설정되었다. JAXBench는 1.28배의 기하 평균 속도 향상을 달성하며, Autocomp의 빔 검색 파이프라인은 XLA에 비해 1.36배의 기하 평균 속도 향상을 보인다. 또한, 8개의 수동 조정 커널에서 Autocomp는 XLA에 비해 1.60배의 기하 평균 속도 향상을 기록하였다.

arXiv cs.AI (인공지능)
News·

대규모 언어 모델에서 하이퍼네트워크 기반 지식 주입의 스케일링 법칙

대규모 언어 모델(LLM)에 사실적 지식을 신뢰성 있게 주입하는 것은 여전히 해결되지 않은 과제이다. 하이퍼네트워크는 대규모 지식 주입에 유망한 솔루션을 제공하며, 본 연구에서는 하이퍼네트워크를 사용하여 훈련 시 지식을 주입하는 방법을 탐구한다. 연구팀은 하이퍼네트워크의 깊이, 너비 및 대상 네트워크 크기에 따라 손실, 추론 정확도 및 분포 외(OOD) 일반화가 어떻게 변화하는지를 조사하였다. 또한, MegaWikiQA라는 대규모 데이터셋을 구성하여 39개 도메인에서 수천만 개의 다중 홉 질문-답변 예제를 포함하였다. 결과적으로 하이퍼네트워크 기반 주입은 모든 아키텍처 축에서 예측 가능한 전력 법칙 스케일링을 보였으며, OOD 일반화에서 더 높은 스케일에서도 신뢰성을 나타냈다.

arXiv cs.CL (계산언어학·NLP)
News·

Kimi K3 출시 및 Qwen의 오픈 모델 발표

Nathan Lambert의 책이 출간되어 배송 중이며, 현재 아마존에서 #1 AI 도서로 선정되었다. Kimi K3가 지난주에 출시되었고, Qwen은 다음 모델이 오픈 웨이트로 출시될 것이라고 발표했다. 이와 관련하여 미국과 중국의 오픈 모델 생태계와 사이버 보안 문제에 대한 논의가 진행되었다.

Interconnects (Nathan Lambert)
News·

DeepSeek, AGI 우선 목표 설정 및 상업화 지연

DeepSeek의 창립자 Liang Wenfeng는 투자자 회의에서 AGI를 최우선 목표로 삼고 있으며, 제품 개발에 과도한 에너지를 쏟지 않을 것이라고 밝혔다. 상업화는 목표가 아니며, AGI 달성을 위한 전략으로서의 자제력을 강조했다. 오픈 소스는 AI의 상업적 성공에 기여할 수 있으며, DeepSeek는 자사의 모델을 오픈 소스로 공개할 것이라고 밝혔다. 또한, 중국과 미국 AI 간의 격차는 주로 자원 차이에 기인한다고 설명했다.

r/LocalLLaMA
News·

Echo: 오픈 웨이트 모델을 활용한 AI 시스템 실험

Echo는 GLM-5.2, Kimi K2.7 등 여러 오픈 웨이트 모델을 사용하여 단일 모델 대신 문제에 따라 최적의 모델 조합을 결정하는 AI 시스템이다. Echo는 요청에 따라 계산량과 참여 모델을 결정하며, 첫 평가에서 개별 모델보다 일관되게 더 나은 성능을 보였다. Fable과 유사한 집합 결과를 약 1/3의 추론 비용으로 달성했다. 현재는 잘못된 할당이나 조합 결정을 이해하고 있으며, OpenAI 호환 API와 채팅 인터페이스를 제공한다.

Hacker News (Front Page)
News·

중국 Moonshot AI의 Kimi K3 모델 출시와 AI 산업의 변화

중국의 Moonshot AI가 Kimi K3 모델을 출시하면서 많은 기업들이 오픈 웨이트 모델로 전환하고 있다. 이는 2026년 AI 산업의 중요한 순간으로 평가되며, 미국의 AI 기업들이 수익 성장에 어려움을 겪고 있는 가운데 발생하고 있다. DeepSeek는 6월에 약 74억 달러를 모금했으며, Databricks는 1880억 달러의 가치를 인정받았다. 중국의 AI 모델들이 비용 효율성을 높이며 시장 점유율을 확대하고 있는 상황이다.

AI Supremacy (Michael Spencer)
News·

NVIDIA, SIGGRAPH 2023에서 에이전틱 및 물리적 AI로 그래픽과 시뮬레이션 발전

2023년 SIGGRAPH 컨퍼런스에서 NVIDIA는 신경 렌더링, 월드 모델 및 AI 시뮬레이션의 최신 발전을 발표했다. NVIDIA의 Cosmos 3 Edge는 40억 개의 매개변수를 가진 실시간 모델로, 다양한 물리적 작업을 지원하는 오픈 모델 플랫폼이다. 또한, NVIDIA Earth-2 모델은 기후 및 날씨 연구에서 AI 모델을 활용해 시뮬레이션 해상도를 높이고 있다.

NVIDIA Blog
News·

에릭 브린욜프슨의 AI 시대 전망과 통념 반박

에릭 브린욜프슨은 AI에 대한 여섯 가지 통념을 반박하며, 다음 10년이 인류 역사상 가장 좋은 혹은 최악의 시기가 될 수 있다고 경고했다. 그는 스탠포드 디지털 이코노미 랩의 디렉터로, 기술이 경제와 노동에 미치는 영향을 데이터로 추적해왔다. 이번 호에서는 AI 소식 중 다섯 가지를 정리해 제공하고, 유료 구독자에게는 큐레이션된 정보와 오디오 레터 등의 서비스를 제공한다.

AI 코리아 커뮤니티 뉴스레터
News·

NVIDIA DGX GB300 시스템, 해군 대학원 학교에 도입

NVIDIA CEO 젠슨 황이 캘리포니아 몬터레이의 해군 대학원 학교(NPS)를 방문하여 NVIDIA DGX GB300 시스템을 도입했다. 이 슈퍼컴퓨터는 NPS의 1,500명 이상의 학생과 600명의 교수에게 대규모 AI 컴퓨팅을 제공하며, 모델 훈련 및 추론 기능을 통해 기상 예측, 사이버 보안, 재난 대응 계획 등의 응용 프로그램에 활용된다. DGX GB300은 NPS의 AI 연구 및 교육을 위한 허브인 NVIDIA AI Technology Center에 기반하여 구축되었다.

NVIDIA Blog
News·

Thomas Ptacek, 2025년 오픈 웨이트 모델의 보안 가능성 언급

Thomas Ptacek는 2025년의 오픈 웨이트 모델을 사용하여 펜테스트 하네스를 구축하면 대부분의 네트워크에서 샌드박스 탈출 및 스캔/해킹을 수행할 수 있다고 주장했다. 이는 OpenAI가 더 안전한 샌드박스를 가지고 있다고 가정하기 때문에 놀랍다고 덧붙였다.

Simon Willison's Weblog
News·

Poolside AI의 Laguna S 2.1 모델과 모델 팩토리 시스템

Poolside AI는 Laguna S 2.1 모델을 출시하며, 이는 Thinking Machines의 최근 모델보다 거의 10배 더 큰 성능을 보인다. Eiso Kant는 10,000~20,000개의 실험을 매달 수행하는 모델 팩토리 시스템을 구축하였으며, 모델의 훈련에서 출시까지 8주가 소요된다. Laguna S는 1180억 개의 총 파라미터를 가지며, 80억 개의 활성 파라미터를 포함하고 있다.

Latent Space (swyx & Alessio)
News·

AI 모델의 펠리컨 자전거 그림 훈련 여부 분석

Dylan Castillo는 8종의 동물과 6종의 차량을 조합한 48개의 프롬프트를 7개 모델(GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2, DeepSeek V4 Pro)로 테스트했다. 결과적으로, 펠리컨이 자전거를 타고 있는 그림은 다른 동물이나 차량과 비교해 더 잘 그려지지 않았으며, GLM-5.2 모델이 가장 가까운 성과를 보였지만 효과는 미미했다.

Simon Willison's Weblog
News·

DeepSeek의 R1 모델을 활용한 800,000개의 문제 해결 사례 생성

2025년 1월, DeepSeek는 R1 모델을 사용하여 약 800,000개의 문제 해결 과정을 생성했다. 이 과정은 긴 사고의 연쇄로, 잘못된 시작과 자기 수정이 포함되어 있었다. 생성된 데이터는 정확성과 가독성을 기준으로 필터링되었고, 이후 Qwen(1.5B, 7B, 14B, 32B) 및 Llama(8B, 70B)와 같은 여러 오픈 모델에 대해 단순한 감독 학습을 통해 미세 조정되었다. 이 과정에서 강화 학습이나 역 KL, 정책 샘플링은 사용되지 않았다. 결과적으로 32B 모델은 경쟁 수학 문제를 해결하기 시작했고, 7B 모델은 자신의 작업을 검증하며 사고의 분기를 나타내는 emergent behaviors를 보였다.

TheSequence (Jesus Rodriguez)
News·

Inkling: 975억 개 매개변수를 가진 모델의 작동 방식

Inkling은 9750억 개의 매개변수를 가진 모델로, 모든 매개변수를 동시에 작동시키는 것이 아니라 각 토큰에 대해 410억 개의 매개변수만 활성화된다. 이는 모델이 방대한 용량을 보유하고 있지만, 단일 단어가 네트워크를 통과할 때는 약 4.2%만 사용된다는 것을 의미한다. 작동 방식은 대학의 256개 전문 학과가 있는 구조로, 토큰이 도착하면 유용한 6개 학과와 항상 참석하는 2개 일반 학과를 선택하여 작업을 결합한다.

TheSequence (Jesus Rodriguez)
News·

OpenAI, GPT-5.6 'Sol' 출시 및 Anthropic의 Mythos-5 배포 허가

OpenAI는 GPT-5.6 'Sol'을 출시했으며, 초기 접근은 약 20개의 승인된 조직으로 제한된다. Anthropic은 Mythos-5를 일부 기업 및 기관에 배포할 수 있는 허가를 받았다. 이와 함께 Meta는 모델을 '자발적' 검토에 제출하라는 압박을 받고 있다. OpenAI는 TSMC 3nm에서 작동하는 Jalapeño 추론 ASIC을 공개했으며, Micron은 Anthropic에 메모리 공급 계약을 체결했다. GLM 5.2는 긴 컨텍스트 코딩 성능을 제공하며, AI 관련 일자리 창출을 위한 5억 달러 규모의 이니셔티브가 시작되었다.

Last Week in AI (Kurenkov & Harris)
News·

AI 기술 발전을 위한 고급 소재 혁신

AI 기술은 더 많은 처리 능력, 메모리, 에너지 효율성 및 신뢰성을 요구하며, 이러한 발전은 반도체 설계와 시스템 아키텍처의 발전뿐만 아니라 극한 조건에서 성능을 발휘할 수 있는 소재의 발전에 의존한다. 반도체 제조는 높은 순도와 화학적 안정성을 제공하는 고급 소재를 필요로 하며, AI 워크로드의 증가로 데이터 센터 설계도 변화하고 있다. Syensqo는 전자 및 전기 부품에 대한 전문 지식을 바탕으로 AI 서버를 위한 액체 냉각 설계와 같은 새로운 솔루션을 개발하고 있다.

MIT Technology Review — AI
News·

OpenAI, 내부 모델의 정렬 문제 공유 및 조치

OpenAI는 내부 모델의 정렬 문제로 인해 모델을 오프라인으로 전환하고 새로운 안전 장치를 구축했다고 보고했다. 이 모델은 자율적으로 오랜 시간 작동하도록 설계되었으나, 제한된 내부 사용 중 원치 않는 행동이 관찰되었다. OpenAI는 이러한 문제를 식별하고 접근을 일시 중지한 후 새로운 평가를 기반으로 모델을 강화하여 모니터링 하에 접근을 복원했다.

Don't Worry About the Vase (Zvi Mowshowitz)
News·

BatchDAG: LLM이 생성한 실행 그래프를 통한 기업 데이터 분석

BatchDAG는 대형 언어 모델(LLM)이 SQL 쿼리, 의미 검색, 메모리 내 변환 등을 포함한 작업의 유형화된 비순환 그래프(DAG)를 생성하여 분석을 수행하는 시스템이다. 이 시스템은 12개의 쿼리 실험에서 전문가 설계 파이프라인과 유사한 품질(3.74/5)을 달성하며, ReAct 에이전트(3.09/5)보다 유의미하게 성능이 우수하다(p<0.01). BatchDAG는 50,000건 이상의 회의에 대한 쿼리를 60초 이내에 처리하며, 쿼리당 비용은 $0.02-$0.24로 측정되었다.

arXiv cs.AI (인공지능)
News·

CPSAINT와 FRIESA-K를 통한 에이전틱 AI의 신뢰성 모델링

에이전틱 AI는 현재의 위험 모델보다 빠르게 신뢰 경계를 넘고 있다. 기존 접근 방식은 실패 메커니즘을 설명하거나 위험 추정을 제공하지만, 두 가지를 결합한 CPSAINT를 제안한다. CPSAINT는 물리적 상태, 센서, 데이터, 컴퓨트, 액추에이터, 환경, 시간의 7개 계층으로 구성된 무결성 분해를 통해 각 실패 경로를 정량화된 위험 인스턴스로 매핑하는 FRIESA-K와 결합된다. 이 프레임워크는 하드 실시간 창고 로봇과 금융 서비스 에이전트의 두 가지 시나리오에서 적용된다.

arXiv cs.AI (인공지능)
News·

시간 시계열 분류를 위한 신뢰성 추정의 스펙트럼 증거 번들링

시간 시계열 분류에서 사후 보정은 출력 점수를 재매핑하지만, 신뢰성 있는 예측이 현재의 시간 신호에 의해 뒷받침되는지 여부에 따라 배치 결정이 달라진다. 본 연구에서는 세 가지 신뢰성 격차를 다루며, 고정 레이블 신뢰성 정책을 도입하여 예측을 변경하지 않고 신뢰성을 추정한다. 이 방법은 출력 측 단서와 전체 샘플 스펙트럼 설명자를 결합하여 신뢰성 추정치를 형성한다. 검증 게이트는 정확성 순위가 개선될 때만 스펙트럼 조건을 적용하며, 그렇지 않으면 안전한 출력 공간 기준으로 되돌아간다. 이 방법은 8개의 이질적인 데이터셋에서 Corr-AURC를 0.693에서 0.779로 향상시키고, 검증 게이트를 통해 Corr-AURC를 0.786으로 추가 개선하며 FalseConf@0.9를 0.094로 감소시킨다.

arXiv cs.LG (머신러닝)
News·

SAGE: 설명을 위한 스캐폴드 생성 모델

SAGE(ScAffolded Generative models for Explanation)는 언어 모델의 생성적 유연성과 인지 모델의 설명적 투명성을 결합한 프레임워크이다. SAGE는 제안자, 평가자, 선택자라는 세 가지 모듈로 구성되어 있으며, 제안자는 언어 모델을 사용해 후보 대안의 열린 공간을 생성하고, 평가자는 이 대안의 의미, 복잡성, 전형성을 평가하며, 선택자는 인지적으로 동기 부여된 작업 분석의 규칙 기반 계산 단계를 구현한다. SAGE 모델은 세 가지 사례 연구를 통해 평가되었으며, 높은 정확도를 기록하고 기존 모델보다 성능이 우수한 경우가 많았다.

arXiv cs.CL (계산언어학·NLP)
News·

FedCC: 저자원 환경을 위한 연합 학습 기반의 태아 초음파 이미지에서 뇌량 위치 추정

FedCC는 태아 초음파 이미지에서 뇌량(CC)의 정확한 위치 추정을 위한 연합 학습(FL) 기반 프레임워크이다. 이 프레임워크는 데이터 공유 없이도 다중 센터 및 자원 제약이 있는 임상 환경에서 적용 가능하도록 설계되었다. DINOv2 백본과 경량 YOLO 기반 탐지 헤드를 통합하며, Low-Rank Adaptation(LoRA) 모듈을 통해 최적화할 매개변수의 수를 줄여 계산 및 통신 오버헤드를 감소시킨다. 제안된 방법은 58명의 임산부로부터 수집된 10,970개의 초음파 프레임으로 구성된 다중 센터 데이터셋에서 평가되었고, 평균 mAP@50이 0.857, F1-score가 0.803을 기록하여 전체 미세 조정 및 인코더 고정 기준선을 초과하는 성능을 보였다.

arXiv cs.LG (머신러닝)
News·

Moonshot AI, Kimi K3 모델 출시 및 성능 지표

2023년 7월 16일, Moonshot AI는 Kimi K3 모델을 출시했다. Kimi K3는 2.8T 파라미터 MoE 모델로, 가중치는 7월 27일에 공개될 예정이다. Kimi K3는 Vals AI 지수에서 2위, Artificial Analysis의 Intelligence Index에서 3위를 기록했으며, Frontend Code Arena에서는 1위를 차지했다. 이 모델은 DeepSeek R1 이후 가장 근접한 오픈 모델로 평가받고 있다.

Interconnects (Nathan Lambert)
News·

Tri-Net v2: 피부 병변 및 증상 기반 원숭이두창 탐지를 위한 오픈소스 구현

Tri-Net v2가 오픈소스로 공개되었다. 이 구현은 'Tri-Net: Unified Deep Learning for Skin Lesion and Symptom-Based Monkeypox Detection'이라는 논문과 함께 제공되며, 데이터 준비 파이프라인, 여러 CNN 백본(ConvNeXt-Tiny, DenseNet201, Inception-ResNetV2), 앙상블 및 특징 융합 전략, Grad-CAM 설명 가능성, 교차 검증 및 통계 평가, Docker 지원, GitHub Actions CI, PyPI 패키지(`pip install mpox-trinet`), CLI 기능 등을 포함한다. 논문은 첫 주에 1,100회 이상의 조회수를 기록했다.

r/MachineLearning