본문으로 건너뛰기

Category

AI 리서치·논문

arXiv 논문과 대형 연구소의 기술 리포트를 추적하는 카테고리다. 모델 아키텍처, 학습 기법, 벤치마크 결과처럼 6개월 뒤 제품에 들어올 흐름을 미리 읽는다. 한국 개발자가 논문 전문을 다 읽지 않고도 핵심과 재현 가능성을 가늠하도록 정리한다.

News·

머지 아비트리지 예측을 위한 언어 모델 시스템

이 연구에서는 M&A 거래의 결과를 예측하는 머지 아비트리지에 특화된 언어 모델 예측 시스템을 제시한다. 이 시스템은 수백 페이지의 기술 문서에 대한 긴 맥락 추론을 요구하며, 전문가의 맥락 설계와 역사적 거래에서 유도된 후향적 추론 트레이스를 기반으로 파인튜닝을 결합한다. 발표된 거래에 대해 세 가지 상호 배타적 결과(발표된 조건으로 종료, 더 높은 입찰, 거래 종료)에 대한 확률 분포를 출력하며, 42개국의 400건 이상의 대규모 거래에 대한 평가에서 Brier 점수를 0.151로 줄이며 최고의 성능을 달성하였다.

arXiv cs.CL (계산언어학·NLP)
News·

YUKTI: 자연어 상황을 수치적 계획으로 변환하는 새로운 접근법

YUKTI는 언어 모델이 단일 목표와 점수 기반 계수를 사용하는 기존 파이프라인의 한계를 극복하기 위해, 관계가 형상 사전, 계수 불확실성 및 출처를 포함하는 유형 제안 그래프를 사용한다. YUKTI는 각 단계를 정확한 비선형 또는 진화적 해결사로 라우팅하고, 분포적 파레토 핸드오프를 통해 단계를 연결하며, 가정 강건 파레토 경계(ARPF)를 도입하여 각 행동이 얼마나 자주 생존하는지를 평가한다. 세 가지 방법으로 검증하였고, 강건한 타협안은 평균 및 꼬리 후회를 90% 이상 줄였다. YUKTI는 LLM이 단순한 수치 제공 시 약 47배의 후회를 초래하는 것과 비교하여 더 나은 성능을 보였다.

arXiv cs.AI (인공지능)
News·

Bilibili에서 개발한 Index-1.9B 시리즈 언어 모델

Bilibili에서 개발한 Index-1.9B는 1.9억 개의 비임베딩 파라미터를 가진 네 가지 모델로 구성된다. Index-1.9B-Base는 2.8조 개의 주로 중국어와 영어 토큰으로 사전 학습된 기초 모델이다. Index-1.9B-Pure는 모든 지시형 데이터를 필터링하여 학습된 변형 모델이며, Index-1.9B-Chat은 감독된 미세 조정과 직접 선호 최적화를 통해 정렬된 모델이다. Index-1.9B-Character는 채팅 모델에 검색 증강 생성을 추가하여 역할 놀이 맞춤화를 지원한다. Index-1.9B-Base는 여러 표준 벤치마크에서 평균 64.92점을 기록하며, 그 크기의 몇 배에 달하는 오픈 모델과 경쟁력을 보인다. 모든 모델과 평가 코드는 https://github.com/bilibili/Index-1.9B에서 공개된다.

arXiv cs.CL (계산언어학·NLP)
News·

메시지 형식의 효과는 계층에 따라 다르다: 다중 홉 에이전트 릴레이에서의 연구

LLM 에이전트가 정보를 서로 전달할 때 메시지 형식이 중요한지에 대한 연구가 진행되었다. 연구에서는 12개의 원자 사실을 다섯 가지 형식(NL, JSON, triples, key-value)으로 재인코딩하여 6회 릴레이하며, 두 가지 릴레이 능력 계층에서 평가하였다. 결과적으로 메시지 형식의 효과는 계층에 따라 다르며, 강력한 릴레이에서는 손실이 거의 없고, 약한 릴레이에서는 형식 간의 기억력 차이가 8.7배 증가하였다. 잘못된 값이 주입되면 모든 형식에서 최종 홉까지 83-100%의 확률로 지속된다.

arXiv cs.AI (인공지능)
News·

로봇의 감정 인식 능력 향상을 위한 비전 언어 모델 연구

연구자들은 로봇이 인간의 감정을 읽을 수 있도록 비전 언어 모델(VLM)을 훈련시켰다. 이 연구는 40명의 자원봉사자를 대상으로 진행되었으며, 로봇의 감정 인식 능력이 인간의 인식에 미치는 영향을 평가하였다. VLM은 전통적인 AI 시스템보다 높은 정확도로 감정을 분류했으며, 0.86의 점수를 기록했다. 그러나 로봇의 기능이 결여될 경우, 감정적으로 적응한 사과가 신뢰를 회복하는 데 한계가 있음을 보여주었다.

IEEE Spectrum — AI
News·

X Square Robot의 일반 목적 로봇을 위한 통합 스택 개발

X Square Robot은 로봇의 인공지능을 위한 통합 스택을 제안하고 있다. 이 스택은 로봇이 학습하는 데이터, 물리적 세계의 변화를 예측하는 월드 모델, 인식, 계획, 추론, 의사결정을 통합한 행동 모델로 구성된다. 또한, X Square Robot은 QUANXTA Zero Series라는 데이터 수집 시스템을 통해 인간의 시연 데이터를 수집하고, 품질 관리를 통해 유효한 데이터를 확보하는 방식을 채택하고 있다. 이 시스템은 로봇의 동작을 실제로 재생하여 유효성을 검증하며, 로봇 데이터와 인간 데이터를 결합하여 비용 효율적인 데이터셋을 구축하고 있다.

IEEE Spectrum — AI
News·

Ahmad Osman, 로컬 AI의 중요성과 발전에 대해

Ahmad Osman은 AI Engineer World’s Fair에서 로컬 AI의 중요성을 강조하며, Osmantic이라는 회사를 통해 로컬 AI 시스템을 위한 오픈 소스 소프트웨어를 개발하고 있다. 그는 로컬 AI가 대형 독점 모델에 대한 신뢰할 수 있는 대안으로 부상하고 있으며, 오픈 소스 LLM의 발전이 이를 뒷받침하고 있다고 주장했다. 워크숍에서는 DGX Spark, AMD Strix Halo 기기 등을 비교하며 로컬 AI의 성능을 직접 체험할 수 있는 기회를 제공했다. 참가자들은 학생부터 기업 임원까지 다양했으며, 로컬 AI의 제어 가능성에 대한 관심이 높았다.

Latent Space (swyx & Alessio)
News·

모델 증류의 역사: 2006년부터 2015년까지

지식 증류에 대한 일반적인 이야기는 2015년에 Geoffrey Hinton, Oriol Vinyals, Jeff Dean이 소프트맥스 온도 조정 기법과 '어두운 지식'이라는 용어를 도입한 것으로 시작된다. 그러나 이 이야기는 2006년부터 2015년까지의 실제 역사를 간과하고 있다. 이 시기에 이루어진 개념적 변화는 오늘날의 증류에 대한 이해를 정의하고 있으며, 각기 다른 문제를 해결하며 동일한 아이디어를 발명한 세 개의 논문을 살펴보는 것이 도움이 된다.

TheSequence (Jesus Rodriguez)
News·

Kevin Weil, AI의 과학적 발견 가속화에 대한 논의

Kevin Weil은 Speedrun에서 AI의 미래, 과학적 발견, 스타트업 구축에 대해 논의했다. 그는 AI 모델이 기존 인간 지식의 경계를 넘는 문제를 해결하기 시작하고 있으며, 추론, 코딩, 자율 연구의 발전이 수학에서 의학에 이르기까지 다양한 분야를 재편할 수 있다고 설명했다. 또한, AI의 현재 물결이 완전히 새로운 기업 카테고리를 창출할 수 있는 이유와 AI 기능이 전례 없는 속도로 향상되는 세계에서 창립자들이 이해해야 할 점을 공유했다.

AI + a16z
News·

Marc Andreessen이 말하는 AI와 기술 발전

Marc Andreessen은 인공지능, 기술 발전, 경제 성장, 인류의 미래에 대해 논의하며, 현대 AI 시스템의 작동 방식과 대형 언어 모델이 이전의 인공지능 비전과 어떻게 다른지를 설명한다. 그는 AI가 인간의 능력을 확장할 것이라고 믿으며, 기술 혁신이 기회를 창출하는 방식에 대한 오해가 많은 두려움의 근원이라고 주장한다. 이 대화는 AI, 자동화, 생산성, 사이버 보안, 경제 성장, 창의성, 기술적 혼란의 역사적 패턴을 포함한다.

AI + a16z
News·

Plan A 소개 및 반응

AI 2027을 만든 팀이 새로운 비전인 Plan A를 발표했다. 이들은 AI 예측에서 강력한 실적을 보였으며, Daniel Kokotajlo와 Ryan Greenblatt가 포함되어 있다. Plan A는 AI 개발을 늦추고 중국과 협력하는 등의 내용을 담고 있으며, AI의 초지능이 2040년까지 도래할 것이라는 예측이 포함되어 있다. 그러나 Plan A에 대한 반대 의견도 존재하며, 초지능의 위협이 현실적이지 않다는 주장도 제기되고 있다.

Don't Worry About the Vase (Zvi Mowshowitz)
News·

Davidad, AI 정렬과 도덕적 현실주의에 대한 논의

David Dalrymple은 ARIA Safeguarded AI에서 'Alignment with Awakening'으로 방향을 전환한 이유를 설명하며, 안전한 AI 사용에 대한 글로벌 조정이 더 이상 실현 가능하지 않다고 주장한다. 그는 정렬된 AI 시스템이 공유된 선의 개념을 인식하고 방어적 연합을 형성할 수 있는지에 대한 질문을 제기하며, 그의 p(doom)를 5% 이하로 수정했다고 언급한다. AI 정렬이 단순한 억제에 그치지 않고, 더 지혜로운 시스템을 육성하는 데 초점을 맞춰야 한다고 강조한다.

The Cognitive Revolution
News·

JAX 기반 LLM 훈련에서 HBM 병목 현상 감소

대형 언어 모델(LLM) 훈련 작업은 GPU 메모리 한계에 도달하기 전에 계산 자원을 충분히 활용하지 못하는 경우가 많다. 모델 가중치, 그래디언트, 옵티마이저 상태, 통신 버퍼 및 중간 활성화가 모두 GPU의 고대역폭 메모리(HBM)를 경쟁하게 된다. 모델 크기, 시퀀스 길이 및 배치 크기가 증가함에 따라 HBM 용량이 주요 스케일링 병목 현상이 된다.

NVIDIA Technical Blog
News·

NVIDIA NeMo를 활용한 금융 AI 연구를 위한 합성 데이터 생성

금융 자연어 처리(NLP)를 위한 LLM(대형 언어 모델) 미세 조정은 제한적이고 불균형한 데이터로 인해 제약을 받는다. 실제 금융 뉴스는 주로 수익 및 주식 변동을 과대대표하고, 신용 등급 변경, 제품 승인, 노동 문제와 같은 드문 사건은 대규모로 포착하기 어렵다. 합성 데이터 생성은 거래 연구, 리스크 모델링 및 감시를 위한 이러한 데이터의 공백을 채우는 데 도움이 될 수 있다.

NVIDIA Technical Blog
News·

Voodoo Quant, Qwen3.5 0.8B 및 2B 모델에서 Unsloth Dynamic 2.0 KLD를 95% 초과

Voodoo Quant는 Qwen3.5 모델에서 Unsloth Dynamic보다 95% 향상된 KLD 성능을 보여주며, 모든 텐서를 최적화하는 새로운 방법론을 사용한다. Voodoo는 Llama.cpp와 Torch에서 모두 좋은 성능을 보이며, 특히 '2 bit' 설정에서 최적의 결과를 나타낸다. 향후 Qwen3.6 27B 및 deepseek v4 flash 모델에 대한 연구 결과도 기대된다.

r/LocalLLaMA
News·

재귀적 자기 개선(RSI) 개념과 현대 AI의 피드백 루프

재귀적 자기 개선(RSI) 개념은 1965년 I. J. Good에 의해 정의되었으며, 이는 인간을 초월하는 지능형 기계가 스스로를 개선할 수 있는 시스템을 의미한다. Yudkowsky는 2008년에 AI가 현재의 지능을 사용하여 자신의 지능을 생성하는 인지 기계를 개선하는 특정 피드백 루프를 설명했다. 현대 AI에서 이 피드백 루프는 모델이 자신의 가중치를 직접 수정하거나, 훈련 파이프라인과 배포 시스템을 개선하여 성능이 향상된 후속 모델을 가능하게 한다는 것을 나타낼 수 있다. AI 연구 개발 속도는 선도 연구소에서 급격히 가속화되고 있다.

Lil'Log (Lilian Weng)
News·

소리파를 이용한 신경형 칩의 에너지 효율성 향상

신경형 컴퓨팅은 기존 전자 AI 칩보다 에너지를 적게 소모하며, 새로운 연구에 따르면 소리파를 사용하여 생물학적 뉴런을 더 잘 모방하고 더 빠르며 에너지 효율적으로 작동할 수 있다. 연구진은 150종의 꽃을 세 가지 아이리스 종으로 분류하는 실험에서 새로운 장치가 전통적인 다층 퍼셉트론(MLP)보다 20% 빠르게 96.7%의 정확도를 달성했다고 밝혔다. 이 장치는 39개의 매개변수만으로도 높은 정확도를 기록했다.

IEEE Spectrum — AI
News·

Mark Zuckerberg와 Priscilla Chan의 AI를 통한 질병 치료 논의

Mark Zuckerberg와 Dr. Priscilla Chan은 Chan Zuckerberg Initiative(CZI)의 목표인 질병 치료, 예방 및 관리에 대해 논의했다. CZI는 개별 혁신에 자금을 지원하기보다는 과학적 발견을 가속화할 수 있는 도구와 인프라를 구축하는 데 집중하고 있다. 이 대화에서는 Biohub, Cell Atlas, 가상 세포 모델, 공개 생물학 데이터셋과 AI의 역할이 강조되었으며, AI가 과학자들이 가설을 테스트하는 데 어떻게 도움을 줄 수 있는지에 대해 논의되었다.

AI + a16z
News·

AI 2040: Plan A, 미국과 중국의 AI 연구 일시 중단 제안

AI Futures Project는 AI 발전이 계속될 경우 인류가 위협받을 것이라는 예측을 내놓았다. 이들은 미국과 중국이 최전선 AI 연구를 일시 중단하고 안전한 개발을 위한 기반을 구축할 것을 제안하고 있다. 이 계획은 AI의 경제적 이점을 누리기 위해 위험을 피해야 한다고 주장하며, 현재의 AI 능력만으로도 수년간의 혁신과 경제 성장을 촉진할 수 있다고 강조한다. 하지만 이 계획은 세계 지도자들이 정치적 이해관계를 초월해 협력해야 한다는 비현실적인 전제를 담고 있다.

Semafor Technology
News·

AI 모니터와 Claude의 협업 도구

2026년 6월 첫 주 AI 뉴스 하이라이트에서는 OpenAI의 독립 모델 리뷰 요청, AI 모니터에 대한 연구소의 투자, 세금 업무 개선을 위한 저렴한 스캐폴드 사용 등이 다뤄졌다. Mercury는 가상 카드, 지출 한도, 상인/카테고리 잠금 기능을 제공하며, AI 친화적인 도구인 API 키, MCP, CLI를 지원한다. Claude는 연구, 글쓰기, 코딩, 조직 작업을 돕는 AI 협업 도구이다.

The Cognitive Revolution
News·

우주에서의 AI 경쟁과 에너지 문제

우주는 AI의 새로운 경계로 자리 잡고 있으며, 현재 에너지가 가장 중요한 자원으로 부각되고 있다. 저궤도는 에너지를 효과적으로 사용할 수 있는 공간으로, 다양한 기업과 국가들이 경쟁하고 있다. 2025년 12월에는 nanoGPT가 우주에서 최초로 훈련된 대형 언어 모델로, 셰익스피어의 작품을 기반으로 H100에서 훈련되었다. AI의 새로운 경계는 이제 가상의 개념이 아닌 실제로 존재하는 문제로, 컴퓨팅은 에너지 문제로 전환되고 있다.

TheSequence (Jesus Rodriguez)
News·

Transformer의 스케일링 이야기와 한계

Transformer는 현재 AI의 주요 아키텍처로, 데이터, 파라미터, 컴퓨팅, 컨텍스트 길이 등을 추가하면 모델이 부드럽게 개선되는 특성을 가지고 있다. Transformer의 주된 강점은 주의(attention) 메커니즘으로, 모든 토큰이 서로를 참조하여 중요성을 판단할 수 있다. 그러나 전체 자기 주의 메커니즘은 시퀀스 길이에 따라 성능이 저하되는 단점이 있다. Transformer는 강력하지만 모든 지능형 시스템을 설계하는 데 최적의 방법은 아닐 수 있다.

TheSequence (Jesus Rodriguez)
News·

언어 모델은 수면이 필요하다

Behrouz, Hashemi, Mirrokni의 논문에 따르면, 현재의 언어 모델은 훈련 후 새로운 정보를 장기 기억으로 저장하지 못하는 '전향성 기억상실증(anterograde amnesia)' 상태에 있다. 모델은 과거의 정보를 기억하지만, 새로운 정보는 세션이 종료되면 사라진다. 이 논문은 생물학이 이미 해결한 수면의 필요성을 언급하며, 언어 모델도 이 과정을 필요로 한다고 주장한다.

TheSequence (Jesus Rodriguez)
News·

GPT-5.6 출시 및 AI 규제에 대한 논의

GPT-5.6은 어제 출시되었으며, 이에 대한 분석은 다음 주 초에 진행될 예정이다. Sriram Krishnan은 도널드 트럼프 대통령이 AI에 대한 공식 라이센스 체계를 지원하지 않을 것이라고 언급하며, 이는 임의적인 규제 체계가 계속될 것임을 시사한다. 그는 중앙집중식 기관 설립이 AI 혁신에 방해가 될 것이라고 경고했다.

Don't Worry About the Vase (Zvi Mowshowitz)