본문으로 건너뛰기

Category

AI 리서치·논문

arXiv 논문과 대형 연구소의 기술 리포트를 추적하는 카테고리다. 모델 아키텍처, 학습 기법, 벤치마크 결과처럼 6개월 뒤 제품에 들어올 흐름을 미리 읽는다. 한국 개발자가 논문 전문을 다 읽지 않고도 핵심과 재현 가능성을 가늠하도록 정리한다.

News·

Filippo Menolascina, Co-Scientist로 간 질환 치료법 발견

Filippo Menolascina는 Co-Scientist를 사용하여 새로운 간 질환 치료법을 식별하고, 기존 약물이 특정 환자에게만 효과적인 이유를 설명하고 있다.

Google DeepMind Blog
News·

OpenAI Codex 사용량, 부서별로 56배 증가

OpenAI의 내부 Codex 사용량이 2025년 11월 이후 Research 부서에서 56배, Customer Support에서 32배, Engineering에서 27배, Legal에서 13배 증가했다. 2025년 8월까지 OpenAI 직원들은 Codex에 10% 미만의 토큰을 사용했으나, 최근 6개월간 Codex 사용이 심화되었다. 이는 OpenAI 직원들이 AI를 충분히 활용하지 못했던 상황에서의 변화로, 각 부서에서의 토큰 사용량 증가가 두드러진다.

Latent Space (swyx & Alessio)
News·

FilBench: 필리핀어 LLM 평가를 위한 오픈 평가 스위트 소개

FilBench는 필리핀어 LLM의 능력을 평가하기 위한 벤치마크이자 리더보드로, 필리핀 언어의 LLM 개발 진행 상황을 추적할 수 있다. FilBench는 문화적 지식, 고전 NLP, 독해, 생성의 네 가지 주요 카테고리로 구성된 데이터셋을 기반으로 한다. 이 프로젝트는 EMNLP Main에 수락되었으며, 2023년 11월 중국 수저우에서 발표될 예정이다. FilBench는 HuggingFace의 lighteval 평가 프레임워크를 사용하고 있으며, 향후 필리핀의 주요 지역 언어를 포함하는 방향으로 발전할 계획이다.

Lj V. Miranda
News·

ACL 2025에서 발표된 연구와 프로젝트

ACL 2025 Conference에서 발표된 연구로는 네 가지 논문이 있다. 첫 번째는 'Hybrid Preferences: Learning to Route Instances for Human vs. AI Feedback'로, 인간과 언어 모델(LM) 간의 피드백을 위한 하이브리드 라우터(HyPER)를 학습하는 내용을 다룬다. 두 번째는 'M-RewardBench: Evaluating Reward Models in Multilingual Settings'로, 23개 언어에서 보상 모델(RM)을 평가하기 위한 새로운 벤치마크를 소개한다. 세 번째는 'The UD-NewsCrawl Treebank: Reflections and Challenges from a Large-scale Tagalog Syntactic Annotation Project'로, 가장 큰 타갈로그 트리뱅크를 소개하며, 보편적 의존성 프레임워크의 한계를 도전한다. 마지막으로 'Crowdsource, Crawl, or Generate? Creating SEA-VL, a Multicultural Vision-Language Dataset for Southeast Asia'는 동남아시아 언어를 위한 고품질 데이터 개발을 위한 대규모 오픈소스 프로젝트 SEA-VL을 발표한다.

Lj V. Miranda
News·

필리핀 언어 모델 평가와 Filipino-centric LLM 구축 가능성

필리핀 언어 모델 평가에 대한 발표에서, Filipino-centric LLM 구축 가능성에 대해 논의하였다. 발표자는 필리핀에서의 LLM 개발이 가능하다고 강조하며, 이를 위해서는 지역적 맥락에 맞는 접근이 필요하다고 언급하였다. 또한, 필리핀의 독특한 자질인 Diskarte, Sipag at Tiyaga, Bayanihan이 이러한 기술 개발에 기여할 수 있다고 설명하였다. 그러나 필리핀의 NLP 환경은 데이터와 컴퓨팅 자원이 부족하다는 점도 지적되었다.

Lj V. Miranda
News·

IBM, 세계 최초의 1nm 이하 칩 기술 발표

IBM은 새로운 나노스택 아키텍처를 기반으로 한 세계 최초의 1nm 이하 칩 기술을 소개했다. 이 기술은 향후 더 강력한 칩 개발의 길을 열어줄 것으로 기대된다.

IBM Research Blog
News·

IBM의 나노스택 칩 아키텍처

IBM의 새로운 마이크로칩 아키텍처는 트랜지스터 밀도의 공간적 한계를 극복하기 위해 외부로 확장하는 것이 아니라 내부로 쌓아올리는 방식으로 설계되었다.

IBM Research Blog
News·

llm-d를 활용한 AI 모델의 추론 속도 향상

연구자들은 llm-d를 사용하여 AI 모델의 추론 속도를 최대 5배 향상시키고 처리량을 두 배로 증가시킬 수 있음을 보여주었다. 이 과정에서 이종 GPU를 활용하였다.

IBM Research Blog
News·

양자 최적화 벤치마킹을 위한 새로운 알고리즘과 커뮤니티 노력

새로운 알고리즘과 커뮤니티 벤치마킹 노력이 양자 최적화에서 연구자들이 이점을 찾는 방식을 변화시키고 있다.

IBM Research Blog
News·

2026년 AI 발전 단계와 2030년대의 중요성

2026년 AI는 언어 기반 생성 AI 모델이 사회에서 유용해지기 위해 많은 조건이 충족되어야 하는 awkward stage에 있다. 기술의 한계로 인해 물리적 및 인간 세계를 더 잘 이해하기 위해서는 더 많은 자금 지원이 필요하다. 2030년대와 2040년대는 진정한 다중 스펙트럼 AI의 통합 컴퓨팅 패러다임을 개발하는 데 중요한 시기로 예상된다.

AI Supremacy (Michael Spencer)
News·

AI 시대의 비즈니스 엔지니어

Gennaro Cuofano의 'The updated map of AI'는 2026년으로 예정되어 있다. AI Supremacy 뉴스레터는 AI 관련 다양한 주요 목소리를 전달하는 데 헌신하고 있다.

AI Supremacy (Michael Spencer)
News·

ChaosNLI 데이터셋을 활용한 NLI 모델의 레이블 분포 학습

주석자가 레이블에 대해 의견이 일치하지 않을 경우, 그 불일치 자체가 신호를 전달하며, 이를 포착하기 위해 필요한 주석자 수는 평가 지표에 따라 달라진다. 연구에서는 ChaosNLI 데이터셋에서 100명의 독립적인 주석자 판단을 기반으로 레이블 분포에 대해 NLI 모델을 미세 조정하고, 메트릭 의존적인 포화 현상을 확인하였다. 3-class NLI 설정에서 엔트로피 상관관계는 모델이 불일치를 유발하는 항목을 식별하기 위해 약 20~50명의 주석자가 필요하며, 분포 일치(KL 발산)는 약 10명에서 포화된다.

Apple Machine Learning Research
News·

LLM 평가 패널의 신뢰성 분석

LLM-as-a-judge 패널은 여러 모델의 투표를 집계하여 신뢰성 있는 평가를 기대하지만, 9개의 최전선 LLM 모델이 3개의 자연어 추론 데이터셋에서 테스트한 결과, 9명의 판사가 제공하는 정보는 약 2개의 독립적인 투표에 해당하는 것으로 나타났다. 패널의 명목상 독립성의 약 75%가 상관 오류로 인해 저하되었다.

Apple Machine Learning Research
News·

Apple, CVPR 2026에서 연구 발표

Apple은 2026년 6월 3일부터 7일까지 덴버의 콜로라도 컨벤션 센터에서 열리는 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)에 참석하여 새로운 연구를 발표할 예정이다. Apple은 이 회의를 후원하며, 컴퓨터 비전 및 패턴 인식 분야의 과학 및 산업 연구 커뮤니티를 한자리에 모으는 행사이다.

Apple Machine Learning Research
News·

AI가 감정을 인식하는 방식의 발전과 한계

AI 시스템이 대화 중 감정을 분석하는 방식에 대한 내용이다. 'Emotion AI'는 얼굴 표정, 목소리 톤, 행동을 기반으로 감정을 추정하며, NiCE와 Genesys 같은 기술 콜센터 플랫폼이 고객의 감정 상태를 감지해 실시간으로 에이전트에게 대응을 조정하도록 돕고 있다. 그러나 현재 대부분의 시스템은 특정 감정을 하나만 감지하는 데 집중하고 있어 인간의 복잡한 감정을 이해하기에는 부족하다. 새로운 연구 분야인 'human-context AI'는 개인의 성격과 감정을 실시간으로 추적하고 여러 입력을 결합하여 환경에 맞는 반응을 평가하는 방향으로 발전하고 있다.

IEEE Spectrum — AI
News·

인공지능의 70년 역사와 발전

인공지능(AI)은 1956년 다트머스 여름 연구 프로젝트에서 공식적으로 확립되었으며, John McCarthy, Marvin Minsky, Nathaniel Rochester, Claude Shannon이 이끌었다. AI는 기계가 인간의 지능을 모방할 수 있도록 하는 과학으로 정의되며, 70년 동안 비즈니스, 교육, 금융, 의료, 산업, 군사 등 다양한 분야에서 널리 채택되었다. 1950년 Alan Turing은 기계가 생각할 수 있는지를 탐구하며 튜링 테스트를 제안했고, 1958년 John McCarthy는 AI 연구를 위한 프로그래밍 언어 Lisp를 개발했다. 2010년대에는 딥러닝과 대형 언어 모델의 발전으로 새로운 성장 단계가 시작되었다.

IEEE Spectrum — AI
News·

AI를 활용한 RFIC 설계의 혁신

프린스턴 연구자들이 강화 학습과 역설계를 사용하여 RFIC를 신속하게 설계하고 있다. 이들은 확산 모델을 통해 새로운 RF 레이아웃을 생성하며, 성능을 기록적으로 향상시키고 설계 시간을 대폭 단축하고 있다. RFIC 설계는 복잡한 전자기 구조를 포함하며, AI는 이러한 설계 과정을 단축시킬 수 있는 가능성을 보여주고 있다.

IEEE Spectrum — AI
News·

NVIDIA, 세계 500대 슈퍼컴퓨터 중 400대 이상 운영

NVIDIA 기술은 TOP500의 81%와 새로 추가된 시스템의 90%를 차지하며, 26개의 시스템이 NVIDIA Grace CPU를 채택했다. Green500에서 1위인 KAIROS는 NVIDIA Grace Hopper Superchip을 사용하고, TOP500의 376개 시스템이 NVIDIA 네트워킹으로 연결되어 있다. NVIDIA는 AI, 시뮬레이션 및 과학을 위한 시스템 구축에서 선호되고 있으며, NVIDIA 시스템은 AI 훈련과 추론 성능에서 다른 플랫폼의 두 배 이상을 제공한다. JUPITER는 유럽에서 가장 빠른 슈퍼컴퓨터로, 인간 뇌를 세포 수준에서 매핑하고 있으며, 새로운 NVIDIA Blackwell 아키텍처를 기반으로 한 시스템들이 아시아, 유럽, 미국에서 순위에 진입하고 있다.

NVIDIA Blog
News·

MiniMax-M3의 효율적 추론을 위한 KV-block-major 희소 주의 메커니즘

Together는 MiniMax-M3의 효율적 서비스를 위해 KV-block-major 희소 주의 메커니즘, 페이지 기반 MSA 디코드, 최적화된 인덱스 스코어링, Rust 기반의 멀티모달 게이트웨이를 활용했다.

Together AI Blog
News·

중국 심천 슈퍼컴퓨터 LineShine, 세계에서 가장 빠른 슈퍼컴퓨터로 등극

중국 심천의 슈퍼컴퓨터 LineShine가 세계에서 가장 빠른 슈퍼컴퓨터로 선언되었다. 이는 2017년 이후 처음으로 중국이 이 타이틀을 차지한 것으로, LineShine는 캘리포니아의 El Capitan보다 약 20% 빠르며, 표준 마이크로프로세서를 사용하고 있다. El Capitan은 2024년부터 랭킹 1위를 유지해왔다. 미국 기업들이 중국 경쟁자들에 비해 기술적 우위를 가지고 있었으나, 일부 분야에서는 그 상황이 변화하고 있다는 분석이 있다.

Semafor Technology
News·

Domyn과 AISquared의 Ai2 오픈 릴리스를 통한 모델 개발

Domyn과 AISquared는 Ai2의 오픈 릴리스가 규제가 있는 산업에서 모델을 구축하는 데 어떻게 도움을 주는지를 보여준다. 이러한 산업에서는 투명성, 출처, 라이센스 및 고객 신뢰와 준수를 위한 통제가 필수적이다.

Allen Institute for AI (Ai2) Blog
News·

2021년 4월 Gwern.net 뉴스레터

2021년 4월 Gwern.net 뉴스레터가 발행되었으며, 주요 내용으로는 Naver의 204억 매개변수를 가진 한국어 신경망 'HyperCLOVA' 발표와 Huawei의 200억 매개변수 중국어 모델 'PanGu-α'의 프로토타입 출시가 포함된다. 또한 Google I/O 2021에서 100억 매개변수 Transformer 모델인 LaMDA(챗봇)와 MUM(다중 모달 검색/번역/Q&A) 발표가 있었다. Nvidia는 3072 A100 GPU에서 1조 매개변수 모델 훈련을 가능하게 하는 'Megatron-LM' 소프트웨어를 소개했다.

Gwern.net (Gwern Branwen)
News·

2021년 5월 Gwern.net 뉴스레터 요약

2021년 5월 Gwern.net 뉴스레터가 발행되었으며, 이전 뉴스레터는 2021년 4월에 발행되었다. 주요 내용으로는 TPUv4 AI 가속기 칩의 세부사항, ZeRO-Infinity의 GPU 메모리 한계 극복, MLP-Mixer 아키텍처의 성능 개선 등이 포함되어 있다. 또한, Anthropic이라는 공익 기업이 설립되었고, 1억 2,400만 달러의 투자를 받았다. 여러 연구 결과로는 이미지 합성에서 Diffusion Models가 GANs를 초월한 사례가 있으며, Grokking이라는 새로운 일반화 효과에 대한 논의도 포함되어 있다.

Gwern.net (Gwern Branwen)
News·

무작위 신경망의 귀납적 편향 연구

이 글에서는 별 영역 부피 추정을 사용하여 무작위 신경망의 매개변수-함수 맵의 귀납적 편향을 연구한다. 이는 '무작위로 훈련된 신경망 샘플링 확률 추정' 및 '신경적 적색편이: 무작위 네트워크는 무작위 함수가 아니다'라는 아이디어에 기반한다. 귀납적 편향을 이해하는 것은 딥 신경망의 일반화를 이해하는 데 필수적이며, 고정된 아키텍처에서 일부 작업은 쉽게 학습될 수 있지만 다른 작업은 학습하는 데 기하급수적으로 긴 시간이 걸릴 수 있다.

EleutherAI Blog