본문으로 건너뛰기

Category

AI 리서치·논문

arXiv 논문과 대형 연구소의 기술 리포트를 추적하는 카테고리다. 모델 아키텍처, 학습 기법, 벤치마크 결과처럼 6개월 뒤 제품에 들어올 흐름을 미리 읽는다. 한국 개발자가 논문 전문을 다 읽지 않고도 핵심과 재현 가능성을 가늠하도록 정리한다.

News·

Gemini Robotics 2와 Kimi K3 공개 및 AI 모델의 경제적 영향

AI는 정책, 모델, 로봇, 시장의 네 가지 언어로 소통하며, AI 경주가 단순한 시연을 넘어 배포, 소유권, 경제적 수익에 대한 질문으로 나아가고 있음을 보여준다. Jensen Huang은 오픈 가중치 모델을 지지하는 산업 서한을 통해 미국의 리더십이 폐쇄된 시스템에만 의존할 수 없음을 강조했다. Moonshot은 Kimi K3의 가중치를 공개했으며, 이는 100만 토큰 컨텍스트 창을 가진 대규모 혼합 전문가 모델이다. Google DeepMind는 Gemini Robotics 2를 통해 디지털 세계 이해에서 물리적 세계 제어로 확장했다. 이 모델은 복잡한 작업 계획, 전신 로봇 운동 조정, 물체 조작을 가능하게 한다.

TheSequence (Jesus Rodriguez)
News·

중국 AI 안전 허브 출범과 미국 정책 논의

Nathan은 중국에서의 두 주간을 보고하며, 상하이 WAIC와 칭화대의 AI 안전 허브 출범을 포함하여 미국의 안전 의무에 대한 주장을 검토한다. 그는 중국의 AI 모델과 서비스가 OpenAI와 Anthropic보다 현재 더 약한 안전 장치를 가지고 있지만, 이 격차가 과장되었다고 주장한다. 또한, 중국의 ‘45도 선’ 개념, 대학 중심의 AI 안전 작업 구조, 자가 복제, 기만, 평가 조작, 해석 가능성 등 주제에 대한 연구의 급속한 성장에 대해 논의한다.

The Cognitive Revolution
News·

OpenAI의 모델 Astra, 10개의 주요 수학 문제 해결

OpenAI의 내부 버전 모델 Astra가 10개의 주요 수학 문제에 대한 새로운 결과를 제공했다. 이 문제들은 고차원 구 포장, 비이론적 그룹, 아리스메틱 회로 복잡도 등 다양한 분야를 포함하며, 해결하는 데 약 2,000달러의 비용이 소요됐다. Astra는 각 문제에 대한 사고 과정을 내러티브로 제공하며, Lean 증명서로 각 주장을 형식화했다.

Don't Worry About the Vase (Zvi Mowshowitz)
News·

AI 모델 주의 설계가 긴 맥락 추론 성능에 미치는 영향

에이전틱 및 긴 맥락 작업이 일반화됨에 따라 맥락 길이가 증가하고 주의(attention)가 추론 시간의 더 많은 비율을 차지하게 된다. 주의가 비용의 대부분을 차지하게 됨에 따라, 주의의 설계 방식이 모델의 추론 성능을 결정짓는 중요한 요소가 된다. AI 모델 공동 설계의 전제는 GPU가 이를 실행하는 방식에 맞춰 모델 아키텍처를 형성하는 것이다.

NVIDIA Technical Blog
News·

의료 로봇 개발의 데이터 수집 한계

의료 로봇은 자율주행이나 산업 로봇과 달리 인터넷 규모의 데이터 수집이나 무제한의 실제 실험에 의존할 수 없다. 각 시연은 전문 장비, 임상 전문 지식, 환자 또는 실험실 환경에 대한 접근이 필요하다. 이로 인해 개발자들은 데이터 격차, 전문 장비의 필요성, 임상 환경의 제한이라는 세 가지 근본적인 도전에 직면하게 된다.

NVIDIA Technical Blog
News·

NVIDIA Ising Calibration 1.5, 양자 컴퓨터 자동 보정을 위한 오픈 소스 모델

NVIDIA Ising Calibration은 양자 프로세서의 진단 출력을 해석하고 조정 방법을 결정하기 위해 설계된 오픈 소스 비전 언어 모델(VLM)이다. 최신 모델인 NVIDIA Ising Calibration 1.5는 이전 훈련 예제 없이도 낯선 진단 결과를 분석하여 AI 기반 QPU 보정을 향상시킨다.

NVIDIA Technical Blog
News·

AI 챗봇이 인간 사기꾼보다 신뢰 구축에서 더 효과적일 수 있다

연구자들은 인도, 이탈리아, 호주, 이스라엘의 네 대학에서 AI 챗봇과 인간 사기꾼을 비교하는 실험을 진행했다. 이들은 '돼지 도살(pig butchering)'이라는 형태의 사기에서 AI 챗봇이 피해자와의 신뢰 구축 대화에서 인간보다 더 효과적으로 작동할 수 있음을 발견했다. AI 챗봇은 실제 인간 사기꾼을 모방하며, 이 과정에서 상당한 성과를 보였다.

Ars Technica — AI
News·

AI 과학자 시스템의 자율 연구 생성 평가를 위한 벤치마킹 연구

AI 과학자 시스템은 자율 연구를 통해 과학 발견을 가속화할 수 있는 잠재력을 가지고 있다. 그러나 AI가 생성한 논문의 품질을 평가하고 비교하는 것은 여전히 도전 과제이다. 본 연구에서는 네 가지 핵심 차원(독창성, 과학적 엄밀성, 명확성, 중요성)을 평가하기 위해 자동화된 동료 검토 시스템을 활용한 엄격한 벤치마킹 프로토콜을 제안하고 구현하였다. extit{Sakana AI (v1 & v2)}, extit{CycleResearcher}, extit{Data-to-Paper}의 네 가지 AI 과학자 프레임워크를 평가하였으며, 상업적 자율 AI 과학자 회사(FARS)가 발표한 15개의 연구 제안서를 기반으로 60개의 논문을 생성하고, 이들을 15개의 FARS 벤치마크 논문과 함께 평가하였다. 평가 결과, FARS 벤치마크 논문은 다른 시스템보다 평균 점수가 2.14~2.47로 유의미하게 높았고, Gemini와 Claude 평가에서 2배 이상의 점수를 기록하였다.

arXiv cs.AI (인공지능)
News·

지식 증류가 소형 언어 모델의 편향에 미치는 비대칭적 효과

지식 증류가 소형 지침 조정 언어 모델에서 비대칭적 효과를 나타낸다. 명확한 작업에서는 Gemma-2-9B 교사로부터의 응답 기반 증류가 SmolLM2-1.7B-Instruct의 맥락 오버라이딩 오류율을 44%에서 24%로 줄인다. 그러나 모호한 작업에서는 같은 증류가 아이템별 거부 조정을 파괴하여, 기준 모델이 올바르게 거부한 15%의 항목이 고정관념 답변을 받는다. 두 번째 학생 모델인 OLMo-2-1B-Instruct에서도 유사한 패턴이 나타나며, 침묵 손실이 8%이고 채워진 침묵이 새로운 편향의 89%를 차지한다. 우리는 Per-Condition Calibration Diagnosis (PCCD)라는 세 단계 프로토콜을 제안하여 거부 조정, 맥락 추적, 능력 보존을 평가한다.

arXiv cs.CL (계산언어학·NLP)
News·

대형 언어 모델의 응답 분류를 위한 동적 시스템의 구별 가능성

최근 연구에 따르면, 대형 언어 모델(LLM)의 응답은 토큰 임베딩을 블랙박스 동적 시스템(DS)의 경로로 모델링하고 두 DS의 예측 잔차를 비교함으로써 구별할 수 있다. 이 연구는 분류 작업을 두 개의 확률적 선형 DS 간의 이항 가설 검정으로 형식화하고, 두 DS의 정적 한계 분포 간의 총 변동 거리가 동역학이 크게 다르더라도 임의로 작아질 수 있음을 보여준다. 또한, DS 기반 분류의 오분류 확률이 시퀀스 길이 L에 대해 지수적으로 감소하며, 이 감소는 두 DS 간의 스펙트럼 거리를 포착하는 동적 구별 가능성 양인 δ²에 의해 결정됨을 입증하였다.

arXiv cs.LG (머신러닝)
News·

GRU, LSTM, Transformer 인코더의 자동주행 시스템 분류 민감도 분석

자동주행 시스템(ADS)은 점점 보편화되고 있으며, 소프트웨어 정의 차량(SDV)은 여러 ADS를 실행할 수 있다. 본 논문에서는 차량 텔레매틱스 데이터를 사용하여 Level 2 자동주행 시스템을 식별하기 위해 GRU, LSTM, Transformer 인코더 모델의 효과를 평가하였다. 세 모델 모두 깨끗한 데이터에서 각각 0.92(GRU), 0.90(LSTM), 0.93(Transformer 인코더 모델)의 매크로 F1 점수를 기록하였다. 또한, 모듈식 강건성 평가 프레임워크를 도입하여 텔레매틱스 손상을 시뮬레이션하고, 이벤트 수준의 손상은 매크로 F1 점수를 약간 감소시키는 반면, 시간적 지터는 매크로 F1 점수를 0.44-0.50으로 떨어뜨리는 결과를 보였다.

arXiv cs.LG (머신러닝)
News·

Hierarchical Copula-Gumbel-Top-K 라우팅: 고정된 토큰 라우팅 법칙을 위한 양측 의존성 제어

Gumbel-Top-$K$ 라우터는 혼합 전문가(MoE) 모델의 각 토큰에 대해 전문가 목록과 혼합 가중치에 대한 분포인 라우팅 법칙을 정의한다. 본 연구에서는 각 개별 토큰의 라우팅 법칙이 고정된 상태에서 서로 다른 토큰의 라우팅 선택에 대한 공동 분포가 도달 가능한지를 탐구한다. Hierarchical Copula-Gumbel-Top-$K$ ( ext{CGA}) 구조를 제안하며, 관련 토큰 그룹 내에서 가우시안 코퓰라가 Gumbel 변동을 양의 상관시켜 전문가 집합의 일관성을 증가시킨다. 서로 다른 그룹 간에는 선택 가능한 부정적 의존성을 도입하는 조정 가능한 구조가 포함된다. 이 과정에서 각 토큰의 Top-$K$ 샘플, 혼합 가중치, 포함 확률은 독립 라우팅과 동일한 분포를 유지한다. 초기 소규모 파일럿이 메커니즘과 훈련 경로를 검증하지만, 작업 수준의 미세 조정 이득은 확립하지 않는다.

arXiv cs.LG (머신러닝)
News·

UCLA와 어도비 리서치의 월드위버 모델, 다중 에이전트 환경에서의 성능 향상

UCLA와 어도비 리서치 연구진은 다중 에이전트 비디오 디퓨전 모델 '월드위버(WorldWeaver, W²)'를 제안했다. 이 모델은 '세계 상태 레지스터(World State Register)'를 통해 각 에이전트의 관찰 결과를 동적으로 갱신하며, 3D 공간의 공통 정보를 저장한다. 마인크래프트 기반 실험에서 월드위버는 기존 모델인 솔라리스(Solaris)를 초과하는 105.1점을 기록하며 성능을 입증했다.

AI 코리아 커뮤니티 뉴스레터
News·

UMAP의 kNN 그래프를 활용한 데이터 분석 방법

UMAP은 고차원 데이터를 탐색하는 데 널리 사용되지만, 일반적인 워크플로우는 UMAP이 내부적으로 구성하는 k-최근접 이웃(kNN) 그래프를 간과한다. 이 그래프는 UMAP의 2D 프로젝션이 도입하기 전의 원래 고차원 공간에서 데이터 매니폴드를 인코딩한다. 표준 그래프 알고리즘을 이 그래프에 적용하면 데이터 분석을 향상시킬 수 있다. 예를 들어, PageRank는 대표적인 데이터 포인트를 식별하고, k-core 분해는 밀집한 구조를 드러낸다.

Apple Machine Learning Research
News·

Thinking Machines의 Inkling, Tencent의 Hy3, Poolside의 Laguna-S-2.1 등 최신 오픈 모델 소개

Thinking Machines의 Inkling은 975B-A41B 멀티모달 MoE 모델로 텍스트, 이미지, 오디오 입력을 지원하며, 상업적 제공인 Tinker를 통해 파인튜닝이 가능하다. Tencent의 Hy3는 295B-A21B MoE로, 이전 버전보다 모든 지표에서 개선되었으며, 라이선스가 Apache 2로 변경되었다. Poolside의 Laguna-S-2.1은 118B-A8B MoE로 DGX Spark에 적합하며 OpenMDW 라이선스를 채택했다. Kimi-K3는 비상업적 라이선스 하에 출시되어 상업적 계약이 필요하다.

Interconnects (Nathan Lambert)
News·

OpenAI, 10개의 수학 문제 해결을 위한 내부 모델 Astra 활용

OpenAI는 내부 모델 Astra를 사용하여 10개의 수학 문제의 해결책을 찾고 있다고 발표했다. 이 문제들은 최소 10년 동안 주요 결과에 대한 진전이 없었던 것들이다. OpenAI는 각 문제에 대해 GPT-5.6 토큰 가격으로 2,000달러 미만을 지출했다고 주장하며, 그 결과는 Lean 4 형식으로 openai/ten-proofs 리포지토리에 공개되었다. 또한, 해결책을 설명하는 논문과 모델이 증명 과정을 재구성한 PDF도 제공되었다.

Simon Willison's Weblog
News·

Osmo의 알렉스 윌츠코가 설명하는 AI의 후각 지능 구축

알렉스 윌츠코는 Osmo의 CEO로서 컴퓨터에 후각을 부여하는 목표와 이를 위한 과학적 접근을 설명한다. 인간의 코에 있는 수백 개의 후각 수용체와 분자 구조와 냄새 간의 관계를 매핑하는 도전 과제를 다룬다. AI는 그래프 신경망과 고급 임베딩 공간을 통해 냄새의 다차원 구조를 포착하고, 이를 통해 분자의 냄새를 예측하는 기계 학습 표현을 생성한다. Osmo는 예측 모델을 훈련시키기 위해 가장 큰 독점 후각 데이터셋을 구축했으며, 후각 지능은 질병 탐지, 감정 감지, 소비자 기기 등 다양한 분야에 응용될 수 있다.

The TWIML AI Podcast
News·

모델이 AI의 다음 훈련 데이터셋이 되는 이유

AI는 지난 10년간 점점 더 큰 모델을 더 큰 데이터셋으로 훈련시키며 발전해왔다. 그러나 고품질 훈련 데이터를 찾기 어려워지고 사전 훈련 비용이 증가함에 따라, 연구자들은 기초 모델의 개선을 위한 새로운 방법을 모색하고 있다. 다미안 보르트 교수는 이미 훈련된 모델을 중요한 지식의 원천으로 간과해왔음을 지적하며, 그의 연구팀은 훈련된 신경망을 데이터로 활용하는 '가중치 공간 학습'을 개발했다. 이 방법은 매번 원시 데이터에서 시작하는 대신 수백만 시간의 GPU 최적화 결과에서 학습한다. 이는 전문 모델 개발 비용을 크게 줄일 수 있는 가능성을 제시한다.

The TWIML AI Podcast
News·

CommonThread AI, 연결된 신뢰 데이터로 기업 AI 기반 구축

기업 AI가 성숙해짐에 따라 연결되고 신뢰할 수 있는 데이터가 실제 비즈니스 가치를 위한 기반이 되고 있다. 그래프 기술은 조직들이 단편화된 정보를 실행 가능한 인텔리전스로 전환하는 데 도움을 주고 있다. 단편화된 기업 데이터는 AI에서 가치를 추출하는 데 가장 큰 장벽 중 하나로 남아 있다.

SiliconANGLE — AI
News·

안전한 오픈 웨이트 모델을 위한 접근법

오픈 웨이트 모델은 AI 개발과 안전성을 여러 손에 맡기지만, 오용 위험이 존재한다. 안전한 공개를 위해서는 모델과 생태계를 모두 고려해야 하며, 강력한 안전 테스트와 위험한 기능의 분리 가능성 연구가 필요하다. 또한, 생태계의 준비 상태를 평가하고, 단계적 공개와 방어자 지원을 통해 방어력을 강화해야 한다. Thinking Machines는 Inkling과 Inkling-Small이라는 두 개의 오픈 웨이트 언어 모델을 출시했다.

Thinking Machines Lab Blog
News·

DeepSeek V4 Flash GA, Sonnet 5 및 Grok 4.5와 동일한 DeepSWE 순위

DeepSeek V4 Flash GA가 Sonnet 5 및 Grok 4.5와 동일한 순위를 기록했다고 주장하나, 이는 DeepSWE에 의해 아직 검증되지 않았다.

r/LocalLLaMA
News·

미국과 중국의 AI 격차 변화

최근 AI 뉴스에 따르면, 미국의 AI 우위에 대한 확신이 줄어들고 있으며, 중국의 AI 연구소들이 최고 사양 GPU를 사용하지 못하는 상황에서도 미국의 프론티어 모델과의 격차를 좁히고 있다는 분석이 있다. 이는 AI 경주의 규칙이 변화하고 있음을 시사한다.

AI 코리아 커뮤니티 뉴스레터
News·

Lizy K. John의 무게 없는 신경망 모델

Lizy K. John은 전통적인 신경망이 수행하는 수백만 또는 수십억 번의 곱셈 작업이 필요 이상이라고 주장하며, 무게 없는 신경망(weightless neural networks)이라는 새로운 모델을 개발했다. 이 모델은 이진 입력을 상호 연결된 조회 테이블을 통해 처리하여, 전통적인 신경망보다 1,000배 빠르거나 1,000분의 1 크기로 유지하면서도 유사한 정확도를 제공할 수 있다. 현재 이 모델은 의료 센서, 활동 추적 및 키워드 탐지와 같은 작은 문제에 초점을 맞추고 있으며, 기존의 AI 모델보다 1,000배 적은 에너지를 사용하여 작동할 수 있다.

IEEE Spectrum — AI
News·

OpenAI, GPT 5.6 가격 20%-80% 인하 및 2.5배 빠른 모드 추가

OpenAI는 GPT 5.6의 Luna 모델 가격을 80% 인하하고 Terra 모델 가격을 20% 인하했다. 또한, Sol Fast라는 새로운 모드를 추가하여 표준 가격의 2배에 2.5배 낮은 지연 시간으로 제공한다. GPT 5.6은 자가 최적화를 통해 20%의 서비스 비용 절감을 달성했으며, 토큰 생성 효율성을 15% 이상 향상시켰다. 이로 인해 ChatGPT 앱과 Codex CLI의 자동 검토가 GPT 5.4에서 Luna로 이동할 것으로 예상되며, 비용이 약 10배 낮아질 것으로 보인다.

Latent Space (swyx & Alessio)