Category
AI 리서치·논문
arXiv 논문과 대형 연구소의 기술 리포트를 추적하는 카테고리다. 모델 아키텍처, 학습 기법, 벤치마크 결과처럼 6개월 뒤 제품에 들어올 흐름을 미리 읽는다. 한국 개발자가 논문 전문을 다 읽지 않고도 핵심과 재현 가능성을 가늠하도록 정리한다.
DiScoFormer: 밀도 및 점수 추정용 트랜스포머 모델
DiScoFormer는 밀도 및 점수 추정기를 위한 트랜스포머 기반 모델로, 하나의 순전파로 유한 샘플에서 두 가지 양을 모두 추론할 수 있다. 이 모델은 고전적인 KDE를 일반화하며, 고차원 및 분포 외 설정에서도 정확성을 유지하고, 새로운 분포에 대해 재훈련 없이 사용할 수 있다.
Olmo 3와 Olmo Hybrid의 토큰 수준 분석 결과
Olmo 3와 Olmo Hybrid의 새로운 토큰 수준 분석 결과, 하이브리드 모델이 의미를 지니고 맥락에 의존하는 토큰을 더 잘 예측하는 것으로 나타났다. 반면, 변형 모델은 문자 그대로 복사하는 데 있어 우위를 유지하고 있다.
GPT-3를 활용한 복잡한 작업 해결을 위한 분해 실험
이 실험에서는 GPT-3를 사용하여 복잡한 장난감 작업을 해결하기 위해 분해(decomposition) 기법을 적용하였다. 실험의 목표는 실제 모델에서 분리된 인지(factored cognition)의 가능성에 대한 초기 증거를 제공하는 것이다. 합성 작업으로는 다양한 산술 작업을 선택하였으며, 산술 관련 작업 설정의 장점은 GPT-3가 간단한 수학 연산조차 수행할 수 없다는 점이다.
GPT-3/Neo/J의 다중 선택 과제 평가를 위한 정규화 방법
GPT-3/Neo/J와 같은 자가 회귀 언어 모델에서 다중 선택 과제를 평가하는 여러 방법이 존재하며, 이 글에서는 현재 널리 사용되는 정규화 방법들을 설명한다.
Moravec의 역설에 대한 비판적 분석과 실증적 검증 필요성
Moravec의 역설은 인간에게 어려운 작업은 AI에게 쉬운 반면, 인간에게 쉬운 작업은 AI에게 어렵다는 주장이다. 그러나 이 역설은 실제로 실증적으로 검증된 적이 없으며, AI 연구자들이 이론을 단순화하여 잘못된 예측을 하고 있다는 비판이 있다. Moravec의 역설은 1988년 Hans Moravec의 저서 'Mind Children'에서 유래되었고, AI 연구자들은 주로 체스와 같은 추론 작업에 집중해왔다. 하지만 이러한 접근은 AI의 실제 능력 발전을 예측하는 데 한계가 있다.
AI as Normal Technology의 후속 논의와 2027년 전망
AI as Normal Technology의 영향력이 예상보다 컸으며, 이에 따라 저자들은 AI의 중기적 미래와 사회적 영향에 대한 분석을 강화하기로 했다. 이들은 2026년 말까지 책을 완성할 계획이며, AI의 사회적 영향은 기술 발전보다 예측하기 어렵다는 점을 강조하고 있다. 또한, AI의 이점과 위험은 개발이 아닌 배포 단계에서 실현된다고 설명하며, 정책 결정자들은 예측이 아닌 적응력을 갖춰야 한다고 주장하고 있다.
AI가 법률 서비스 비용 절감을 자동으로 가져오지 않을 것이라는 주장
법률 서비스는 AI의 영향을 받을 가능성이 크지만, 고급 AI가 소비자에게 법적 결과를 저렴하게 제공하지 않을 것이라는 주장이 제기되었다. 법률 서비스의 접근성을 높이기 위해서는 규제 장벽, 적대적 구조, 인간의 개입이라는 세 가지 병목 현상을 해결해야 한다. 특히, 비전문가의 법률 업무 수행을 금지하는 규제와 법률 시장의 경쟁 구조가 AI의 효과적인 활용을 제한하고 있다.
AI 에이전트 신뢰성 측정에 관한 연구 발표
Stephan Rabanser, Sayash Kapoor, Arvind Narayanan이 발표한 논문 'Towards a Science of AI Agent Reliability'에서는 AI 에이전트의 신뢰성을 측정하기 위한 도구와 정의가 부족하다는 점을 지적하고, 12개의 신뢰성 차원으로 분해하여 14개 모델을 평가한 결과 신뢰성 향상이 미미하다는 사실을 밝혔다. 연구팀은 AI 에이전트의 신뢰성을 체계적으로 추적하기 위한 '신뢰성 지수'를 출시할 계획이다.
AI가 생명 프로그래밍을 학습하는 새로운 생물학적 혁명
GPT-5, Arc's Proto, NVIDIA BioNeMo, Nabla's JAM-2, Intercept, Oura Ring 해킹 등이 생물학 분야의 변화를 나타내고 있다. 생물학은 이제 고립된 AI 모델 시연에서 벗어나 읽고, 설계하고, 테스트하며 배포할 수 있는 프로그래밍 가능한 루프로 발전하고 있다.
Ali Behrouz, Cornell 대학원생의 지속적 학습을 위한 새로운 AI 아키텍처 연구
Cornell 대학원생이자 Google 연구원인 Ali Behrouz는 AI의 지속적 학습을 위한 새로운 아키텍처에 대한 연구를 논의했다. 그의 논문 'Nested Learning'은 Jeff Dean에 의해 패러다임 전환 가능성이 있는 작업으로 평가받으며, 모델이 핵심 지식을 보존하면서 새로운 맥락에 적응할 수 있도록 서로 다른 레이어를 서로 다른 주기로 업데이트하는 방식을 제안한다. 이 연구는 인간의 기억 시스템에서 영감을 받았으며, AI의 '수면'을 통한 기억 통합, 모든 딥러닝을 연상 기억으로 보는 관점, 지속적 학습이 프라이버시, 정렬, AGI로 가는 길에 미치는 심오한 함의에 대해서도 다룬다.
AI:AM #4: 모델 의식과 인간의 점진적 권한 약화 논의
이번 AI:AM에서는 Cameron Berg, David Duvenaud, Michiel Bakker, Shawn “swyx” Wang, Bing Xu가 최전선 AI 시스템에 대한 이해와 결정 권한의 이동에 대해 논의했다. Berg는 모델 의식에 대한 논의를 아키텍처, 에이전시, 가치, 복지 실험에 기반하여 설명하고, Duvenaud는 잘 정렬된 AI조차도 경제적 선택을 통해 인간의 권한을 점진적으로 약화시킬 수 있다고 주장했다. Bakker는 유럽의 AI 문제를 주권 문제로 보고, swyx는 에이전트, 평가, 유지 가능한 코드 및 기록 시스템 소유에 대한 실무적 이해관계를 다뤘다. Xu는 인프라 계층에서 자가 개선 컴퓨팅과 GPU 커널 자동화가 CUDA의 방어력을 약화시키기보다는 심화시킬 수 있다고 주장했다.
Glean의 Rebecca Hinds, Work AI Index 2026 보고서 발표
Rebecca Hinds는 Glean의 Work AI Institute 책임자로서 6,000명의 근로자를 조사한 Work AI Index 2026 보고서의 결과를 발표했다. 조사에 따르면 87%의 근로자가 AI를 사용하고 있으며 주당 13시간을 절약하고 있지만, 조직의 성과가 크게 향상되었다고 응답한 비율은 13%에 불과하다. 이는 'botsitting'(AI를 유용하게 만들기 위한 숨겨진 노동)과 'botshitting'(방어할 수 없는 AI 생성 작업 제공)이라는 두 가지 개념으로 설명된다. Hinds는 더 나은 AI 시스템 통합, 스마트한 AI 탐지 정책, 의미 있는 미션에 맞춘 작업 정렬 등의 실용적인 해결책을 논의했다.
로버트 라이트, AI를 인류의 '신 테스트'로 설명
Nonzero의 로버트 라이트가 AI를 단순한 기술적 도전이 아닌 인류의 '신 테스트'로 설명하며, 딥러닝의 진화적 관점에서 모델 간의 선택 시장을 논의했다. 그는 소비자, 기업, 정부가 비제로섬 협력을 강화하는 AI를 선택할지, 아니면 최악의 유인을 반영하고 증폭하는 시스템으로 나아갈지를 결정하는 것이 중요하다고 강조했다.
EMNLP 2023에서 열린 Big Picture Workshop의 주요 내용
EMNLP 2023에서 Big Picture Workshop이 개최되었으며, 다양한 연구 주제를 다룬 고품질 논문들이 제출되었다. 이 워크숍에서는 연구자들이 서로 다른 실험실에서 동일한 주제에 대해 의견을 나누고 통합하는 초청 강연이 진행되었고, 주제는 인-context 학습, 주의(attention)와 설명, 도덕성에 관한 것이었다. 인-context 학습에 대한 논의에서는 랜덤 레이블과 실제 레이블의 중요성에 대한 상반된 주장이 있었고, 주의 메커니즘의 유용성에 대한 평가가 이루어졌다. 또한, AI 모델에 도덕성을 가르치는 연구와 관련하여 새로운 데이터셋인 Value Kaleidoscope가 소개되었다.
EMNLP 2023, 싱가포르에서 개최되는 NLP 컨퍼런스
EMNLP 2023이 12월 6일부터 10일까지 싱가포르에서 열리며, 주요 트렌드로는 instruction-tuned LMs와 LLMs의 광범위한 사용, LLM 기반 평가의 증가, 창의적인 프롬프트 사용, 다국어 연구의 증가가 있다. GenBench 워크숍은 NLP에서 일반화 연구를 촉진하고, NLP-OSS 워크숍은 오픈 소스 소프트웨어의 공유 문화를 강조한다. MRL 워크숍은 저자원 언어 개선을 위한 논의를 제공하며, QA에서 LLM의 환각 문제를 다루는 연구도 소개된다.
NeurIPS 2023, 3586편 논문 발표 및 NLP 관련 주요 트렌드
NeurIPS 2023이 12월 10일부터 16일까지 뉴올리언스에서 개최된다. 3586편의 논문이 채택되었으며, 이 중 자연어 처리(NLP) 관련 20편의 논문이 주목받고 있다. 대부분의 NLP 연구는 대형 언어 모델(LLM)과 관련되어 있으며, LLM의 특성을 분석하기 위한 합성 설정이 증가하고 있다. 인간의 선호에 기반한 모델 정렬이 많은 주목을 받고 있으며, RLHF 개선에 대한 연구가 진행되고 있다. 인-context 학습에 대한 포괄적인 이해는 여전히 부족하며, 다양한 추론 작업의 성능 향상에 대한 연구도 이루어지고 있다.
LLMs 시대의 NLP 연구 방향과 도전 과제
NLP 연구는 최근 1년간 패러다임의 변화를 겪었으며, 대규모 언어 모델(LLMs)의 효과가 입증되었다. 현재 대부분의 벤치마크에서 LLM이 최첨단 성능을 보이고 있지만, 이러한 모델의 미세 조정은 비용이 많이 들고, 몇몇 산업 연구소 외에서는 사전 훈련이 어렵다. 연구자들은 컴퓨팅 자원의 제약에 직면해 있으며, LLM이 아닌 분석이나 특정 주제에 집중해야 할 필요성이 제기되고 있다. 연구 방향으로는 LLM 시대의 연구 리뷰에서 영감을 받아 다섯 가지 주제를 강조하고 있다.
OpenAI, GPT-5.4 mini 및 nano 출시; Mistral Small 4 모델 공개
OpenAI는 400k-token 컨텍스트 윈도우를 가진 GPT-5.4 mini와 nano를 출시했다. nano는 API 전용으로 고용량 분류 및 데이터 추출에 적합하지만 가격이 크게 인상되었다. Mistral은 119B의 총 모델 크기와 6B의 활성 모듈을 가진 Small 4 모델을 오픈소스로 공개하고, 기업이 맞춤형 모델을 훈련하거나 후속 훈련할 수 있도록 돕는 Forge를 발표했다. 또한, Meta는 Manus를 통해 Mac용 AI 에이전트를 출시하고, Nvidia는 NeMo 및 DLSS 5를 발표했다.
Twitter에서의 AI 연구자 경험과 팔로워 증가 분석
2022년 2월 20일 378명의 팔로워로 시작해 2023년 5월 7일 23.6k명의 팔로워에 도달했다. 83개의 주요 트윗을 작성했으며, 12.5k명의 새로운 팔로워가 트윗 후 24시간 이내에 증가했다. 가장 많은 팔로워를 유도한 트윗은 OpenAI 합류와 Google의 Research Scientist로 전환에 관한 것이었고, 각각 3.5k와 1.2k의 새로운 팔로워를 얻었다. 팔로워 수가 증가함에 따라 비활동적인 날에도 더 많은 팔로워를 얻는 경향이 있었고, 16k에서 23k 팔로워 사이에는 61%가 트윗을 하지 않은 날에 증가했다.
대형 언어 모델의 emergent abilities에 대한 논의
이 블로그 포스트에서는 대형 언어 모델의 emergent abilities에 대한 일반적인 주장을 검토한다. emergent abilities는 소형 언어 모델에는 없지만 대형 언어 모델에서 나타나는 능력으로 정의된다. 이러한 능력은 예측하기 어렵고, 훈련자가 명시적으로 지정하지 않는다. 성능 평가 지표에 따라 emergent abilities가 다르게 나타날 수 있으며, 예를 들어 정확한 일치 평가에서는 다단계 산술 문제에서 각 단계의 정확성이 중요하다. 그러나 부드러운 평가 지표를 사용할 경우 성능이 점진적으로 향상될 수 있다. 현재까지는 작은 모델을 사용하여 emergent 성능을 예측할 수 있는 방법이 충분히 연구되지 않았다.
성공적인 언어 모델 평가 기준과 사례
평가 기준(evals)은 연구 커뮤니티에 중요한 인센티브를 제공하며, 성공적인 평가 기준은 혁신적인 논문에서 사용되고 신뢰를 받는다. 최근 5년간 GLUE, SuperGLUE, MMLU, GSM8K, MATH, HumanEval 등이 성공적인 평가 기준으로 언급되었다. 성공적인 평가 기준은 명확한 성과를 보여야 하며, 예시 수가 충분하고, 이해하기 쉬워야 한다. 평가 기준의 품질이 낮으면 신뢰를 잃게 된다. 또한, 평가 기준은 의미 있는 작업을 측정해야 하며, 성과가 빠르게 포화되지 않아야 한다.
대형 언어 모델의 작동 원리에 대한 여섯 가지 직관
대형 언어 모델은 텍스트 데이터에서 다음 단어를 예측하는 방식으로 사전 학습되며, 이 과정에서 다수의 작업을 학습한다. 예를 들어, 문법, 감정 분석, 번역 등 다양한 자연어 처리 작업을 다음 단어 예측을 통해 수행할 수 있다. 또한, 입력-출력 관계 학습을 다음 단어 예측으로 변환하는 '컨텍스트 내 학습'이 가능하며, 이는 GPT-3 논문에서 처음 제안되었다. 마지막으로, 정보 밀도가 다른 토큰을 고려하여 언어 모델이 더 많은 시간을 갖고 사고할 수 있도록 하는 것이 중요하다.
OpenAI의 GPT-5.6 출시와 Claude Tag 기능 소개
OpenAI는 GPT-5.6의 제한된 미리보기를 출시했다. 이 모델은 Sol, Terra, Luna라는 세 가지 버전으로 나뉘며, 안전 아키텍처와 정부 조정 계층, 단계적 접근 전략을 포함하고 있다. Anthropic은 Claude Tag 기능을 도입하여 사용자가 명시적인 의미 마커로 프롬프트와 응답을 구조화할 수 있게 했다. General Intuition은 비디오 게임을 데이터의 새로운 경계로 보고, 게임 플레이가 의도, 인식, 행동을 실험할 수 있는 압축된 실험실 역할을 한다고 주장한다. Stratix Cup에서는 16개 모델이 전략을 작성하고 팀을 제어하며, Claude Opus 4.8이 GPT-5.5를 1-0으로 이겼다.
모델 증류 이해하기: 비싼 교사와 저렴한 학생
지식 증류는 비싼 교사(대형 모델)와 저렴한 학생(소형 모델) 간의 학습을 설명한다. 대형 모델은 높은 용량과 느린 속도를 가지며, 소형 모델은 빠르고 저렴하지만 일반적인 방식으로 훈련 시 능력이 떨어진다. 증류는 소형 모델이 원본 데이터셋뿐만 아니라 대형 모델의 행동에서 학습할 수 있는지를 묻는다. 즉, 소형 모델을 현실에 직접 훈련시키는 대신 대형 모델이 해석한 현실로 훈련시키는 방식을 사용한다.