본문으로 건너뛰기

Category

AI 리서치·논문

arXiv 논문과 대형 연구소의 기술 리포트를 추적하는 카테고리다. 모델 아키텍처, 학습 기법, 벤치마크 결과처럼 6개월 뒤 제품에 들어올 흐름을 미리 읽는다. 한국 개발자가 논문 전문을 다 읽지 않고도 핵심과 재현 가능성을 가늠하도록 정리한다.

News·

산업에서의 ML 연구 경쟁과 개인 연구의 가치에 대한 고민

많은 연구자들이 대기업에서 진행하는 ML 연구가 자신의 연구보다 우수하다고 느끼고 있으며, 이미 해결된 문제를 다루고 있다는 생각에 회의감을 느끼고 있다. 이들은 산업이 이론적 아이디어에 관심이 없고, 대기업의 모델이 이미 시장에서 성공적으로 작동하고 있다는 점을 강조한다. 또한, 자신의 연구가 산업에서 필요로 하는 기술과 차별화되지 않을까 걱정하고 있다.

r/MachineLearning
News·

Google Research의 TabFM: 제로샷 테이블 모델

TabFM은 Google Research에서 개발한 제로샷 테이블 기초 모델로, 혼합된 수치 및 범주형 열을 가진 구조적/테이블 데이터에 대한 분류 및 회귀를 지원한다. 이 모델은 미세 조정이나 하이퍼파라미터 검색이 필요 없으며, 훈련 예제를 컨텍스트로 전달하고 단일 포워드 패스를 통해 예측을 수행한다.

r/LocalLLaMA
News·

Qwen3.6-27B, 8개 로컬 모델 벤치마크에서 성능 우수

8개의 로컬 모델에 대해 퀘스트 완료, 장면 종료, 아이템/시간 추적, 캐릭터 탐지, 스토리텔링, 초안 작성 등의 벤치마크를 수행한 결과, gemma-4-31B가 87%로 가장 높은 통과율을 기록했으며, Qwen3.6-27B가 82%로 뒤를 이었다. 그 외 모델들은 55-70%의 통과율을 보였다. 특정 모델들이 '퀘스트 완료'에서는 좋은 성능을 보였으나 'NPC 생각'이나 '퀘스트 요약'에서는 저조한 성과를 보이는 경향이 있었다.

r/LocalLLaMA
News·

Anthropic의 문자 프롬프트 주입 가능성 증거

이 게시물은 Anthropic의 AI 모델에서 문자 프롬프트 주입의 가능성을 보여주는 증거에 대해 논의하고 있다. 사용자는 Claude 모델에서 받은 응답을 공유하며, 이와 관련된 링크와 댓글을 제공하고 있다.

r/LocalLLaMA
News·

GPT-5.5 Codex의 reasoning-token 클러스터링 성능 저하 문제

OpenAI Codex의 GitHub 이슈에서 GPT-5.5의 reasoning-token 클러스터링이 성능 저하를 초래할 수 있다는 논의가 이루어졌다. 해당 이슈는 97포인트와 17개의 댓글을 받았다.

Hacker News (Front Page)
News·

AirDrop 및 Quick Share의 취약점 연구

해당 연구는 AirDrop과 Quick Share의 보안 취약점에 대한 내용을 다루고 있다. 자세한 내용은 논문에서 확인할 수 있으며, 관련 링크는 제공된다.

Hacker News (Front Page)
News·

NASA 청정실에서 발견된 새로운 박테리아 종

NASA의 청정실에서 새로운 박테리아 종이 발견되었다. 이 발견에 대한 자세한 내용은 Nature의 기사에서 확인할 수 있다.

Hacker News (Front Page)
News·

LLM 연구의 주요 도전 과제

현재 LLM 연구에서 주요한 10가지 방향이 있으며, 특히 '환각(hallucination)'과 '맥락 학습(context learning)'이 주목받고 있다. 환각은 AI 모델이 사실이 아닌 정보를 생성하는 현상으로, 많은 기업들이 LLM을 생산에 도입하는 데 있어 가장 큰 장애물로 보고 있다. 환각을 줄이고 측정하는 방법에 대한 연구가 활발히 진행되고 있으며, 맥락 길이 최적화와 맥락 구성도 중요한 연구 주제이다. RAG(검색 보강 생성) 방식이 LLM 산업에서 주된 패턴으로 자리 잡고 있다.

Chip Huyen
News·

2025년 7월부터 12월까지의 LLM 연구 논문 목록

2025년 7월부터 12월까지의 흥미로운 연구 논문 목록이 공유되었다. 이 목록은 Reasoning Models, Reinforcement Learning Methods for LLMs, Model Releases, Architectures, Efficient Training, Diffusion-Based Language Models, Multimodal & Vision-Language Models, Data & Pre-training Datasets 등 여러 카테고리로 나뉘어 있다. 또한, LLM에 대한 연간 리뷰 기사인 'State of LLMs 2025: Progress, Problems, and Predictions'도 발표되었다.

Ahead of AI (Sebastian Raschka)
News·

2026년 AI 모델의 발전과 시장 변화

2026년에는 AI 모델의 능력이 증가하고, 경제적 현실이 드러나면서 리스크가 커질 것으로 예상된다. 현재 오픈 모델은 Opus 4.5와 같은 성능 수준에 도달하지 못하고 있으며, Claude Code와 Codex에 대한 경쟁자가 없는 상황이다. Google의 Gemini 3.5 Flash는 현재 작업 방식에 적합하지 않으며, 오픈 모델은 자동화된 기업 에이전트와 저비용 도메인에 주로 사용될 것으로 보인다. Mythos는 기술적 성취로 주목받지만, 중국의 많은 연구소는 자원 부족으로 인해 훈련 프로세스를 확장할 수 없는 상황이다. 미국의 오픈 모델은 점차 안정세를 보이고 있다.

Interconnects (Nathan Lambert)
News·

DeepSeek V4, Gemma 4, Kimi K2.6 등 오픈 모델 출시 및 CAISI 평가 결과

이번 달 DeepSeek, Gemma, Kimi 등 여러 오픈 모델이 출시되었으며, CAISI는 이들 모델의 평가를 진행했다. CAISI의 평가에 따르면, 오픈 모델은 미국의 최전선 모델에 비해 성능 격차가 점점 더 커지고 있으며, Elo 점수 계산을 통해 이 격차를 확인했다. Gemma 4는 4B, 9B, 31B 모델과 26B-A4B MoE를 포함하며 Apache 2.0 라이센스를 채택했다. DeepSeek V4는 Pro와 Flash 두 가지 크기로 출시되었고, Flash 모델이 상대적으로 좋은 성능을 보이고 있다.

Interconnects (Nathan Lambert)
News·

중국의 오픈 모델 생태계와 R&D 비용 구조

중국의 오픈 모델 생태계에서는 R&D 비용이 최종 모델 훈련 비용보다 약 80%를 차지하며, 이는 실험실들이 더 오랜 기간 동안 연구를 지속할 수 있는 비용 구조의 이점을 제공한다. 오픈 소스 AI의 경우, 모델 개발자에게 거의 모든 비용이 집중되며, 오픈 모델을 사용하는 것이 최소한의 내부 개발로 AI를 사용하는 경우 더 비쌀 수 있다. 또한, 중국의 연구소들은 기술 보고서와 지식 공유를 통해 동료 기업들이 자원을 덜 투자하도록 리스크를 줄이고 있다.

Interconnects (Nathan Lambert)
News·

Zyphra, Cohere, Poolside의 모델 출시로 다양해진 오픈 생태계

오픈 모델 생태계가 점점 더 다양해지고 있으며, 많은 조직들이 다양한 모델을 출시하고 있다. '순수' 모델 제작자에는 DeepSeek, Zhipu, Minimax, Poolside, Arcee, Zyphra, Cohere, Sovereign, Mistral, Trillion Labs가 포함된다. NVIDIA는 LatentMoE를 사용하는 Nemotron-3-Ultra 모델을 출시했으며, Cohere는 Command A+를 Apache 2.0 라이선스로 출시했다. Zyphra는 74B-A4B MoE 및 8B-A0.6B MoE 모델을 공개했으며, Poolside는 오픈 가중치를 기본으로 하는 모델을 출시했다.

Interconnects (Nathan Lambert)
News·

Transformer 아키텍처 개선 및 Version 2.0 발표

Transformer 아키텍처에 대한 많은 개선 사항이 제안되었으며, 2020년에 작성된 포스트를 기반으로 한 Version 2.0이 발표되었다. 이 버전은 이전 버전의 약 두 배 길이로, 섹션의 계층 구조가 재구성되고 최신 논문으로 여러 섹션이 개선되었다. 기본 Transformer 모델은 인코더-디코더 구조를 가지고 있으며, BERT와 GPT와 같은 언어 모델링 작업에서 뛰어난 성능을 보여준다.

Lil'Log (Lilian Weng)
News·

Neural Tangent Kernel(NTK)의 정의와 신경망 훈련 과정

신경망은 과도하게 매개변수가 설정되어 있으며, 훈련 손실이 거의 0에 가까운 데이터에 잘 적합할 수 있다. Neural Tangent Kernel(NTK)은 신경망의 훈련 중 진화를 설명하는 커널로, 충분한 너비를 가진 신경망이 경험적 손실을 최소화하도록 훈련될 때 글로벌 최소값으로 수렴할 수 있는 이유에 대한 통찰을 제공한다. 이 글에서는 NTK의 동기와 정의, 무한 너비의 신경망 초기화에 따른 결정론적 수렴 증명에 대해 다룬다.

Lil'Log (Lilian Weng)
News·

Prompt Engineering의 정의와 목표

Prompt Engineering, 또는 In-Context Prompting은 LLM과의 의사소통 방법으로, 모델 가중치를 업데이트하지 않고 원하는 결과를 유도하는 방법을 의미한다. 이는 경험적 과학이며, 프롬프트 엔지니어링 방법의 효과는 모델마다 크게 다를 수 있어 많은 실험과 휴리스틱이 필요하다. 이 글은 자가 회귀 언어 모델에 대한 프롬프트 엔지니어링에만 초점을 맞추고 있으며, 목표는 정렬과 모델 조정 가능성이다.

Lil'Log (Lilian Weng)
News·

대형 트랜스포머 모델 추론 최적화

대형 트랜스포머 모델은 현재 다양한 작업에서 최첨단 결과를 내고 있지만, 훈련과 사용에 매우 비용이 많이 듭니다. 특히 높은 추론 비용이 시간과 메모리 측면에서 큰 병목 현상을 초래하여 실제 작업에 대형 트랜스포머를 적용하는 데 어려움을 겪고 있습니다. 추론의 어려움은 모델 크기 증가 외에도 두 가지 주요 요인에 기인합니다.

Lil'Log (Lilian Weng)
News·

2026년 6월 Simon Willison의 뉴스레터 발행

2026년 6월 Simon Willison의 후원자 전용 뉴스레터가 발행되었다. 이번 호에서는 Claude Fable 5, GPT-5.6, 미국의 수출 제한, GLM-5.2 모델, Tokenmaxxing 종료, Datasette Apps, sqlite-utils, shot-scraper, 기타 WASM 프로젝트 및 다른 모델 출시 등의 내용이 다뤄졌다. 후원자는 월 $10에 뉴스레터를 구독할 수 있다.

Simon Willison's Weblog
News·

NVIDIA, ENPIRE 소프트웨어로 로봇 자가 개선 루프 개발

NVIDIA는 ENPIRE라는 소프트웨어를 개발하여 물리적 로봇이 자율 실험 및 실행 루프를 통해 학습할 수 있도록 했다. ENPIRE는 환경 모듈, 정책 개선 모듈, 롤아웃 모듈, 진화 모듈의 네 가지 핵심 모듈로 구성되어 있으며, 로봇이 과제를 수행하고 다양한 전략을 시도하며 학습하는 과정을 지원한다. 이 시스템은 자동 평가 및 초기 상태 복원 기능을 통해 인간의 노력을 최소화하고, 로봇이 99%의 성공률을 기록할 수 있도록 한다. 각 작업장은 NVIDIA RTX 5090을 사용하여 운영된다.

Import AI (Jack Clark)
News·

2026 Cosmos HAI Lab Lecture: AI 기술의 성공과 사회적 변화

2026 Cosmos HAI Lab Lecture에서 AI 기술의 발전과 그에 따른 사회적 변화에 대해 논의하였다. AI의 지속적인 발전은 개인과 사회가 AI를 어떻게 형성하고 활용할지를 결정해야 함을 강조하며, AI의 성공적인 발전을 위해서는 계획이 필요하다고 언급하였다. AI의 발전을 나타내는 Epoch Capabilities Index(ECI) 그래프를 통해 AI 시스템의 성과를 정리하였고, 2023년 3월부터 AI가 변호사 시험에 합격한 사례와 LLM 기반 시스템이 국제 수학 올림피아드에서 은메달과 금메달을 획득한 사례 등을 소개하였다. 이러한 성과들은 AI 기술의 지속적인 발전을 뒷받침하는 공통 기술에 기반하고 있으며, 향후 AI의 성장은 더욱 가속화될 것으로 예상된다.

Import AI (Jack Clark)
News·

fast16 악성코드와 Muon 옵티마이저의 문제점

fast16.sys는 고정밀 계산 소프트웨어를 표적으로 삼아 메모리 내 코드를 패치하여 결과를 조작하는 20년 된 컴퓨터 바이러스이다. 이 바이러스는 LS-DYNA 970, PKPM, MOHID과 같은 고정밀 엔지니어링 도구와 관련이 있으며, 물리적 계산에 체계적인 오류를 도입하여 과학 연구를 저해할 수 있다. 한편, Muon 옵티마이저는 훈련 중 일부 뉴런이 영구적으로 손상되는 버그를 가지고 있으며, 이에 대한 대안으로 Aurora라는 새로운 옵티마이저가 개발되었다. Aurora는 1.1B 파라미터 트랜스포머를 훈련시켜 Muon보다 더 낮은 손실을 기록하였다.

Import AI (Jack Clark)
News·

AI 규제를 위한 Radical Optionality 접근법 제안

Institute for Law & AI의 연구자들은 정부가 강력한 AI가 세계를 대규모로 혼란에 빠뜨릴 경우를 대비해 필요한 도구를 미리 갖추는 'Radical Optionality' 접근법을 제안했다. 이들은 정부가 AI 개발의 막대한 이해관계에 따라 유연성을 유지할 수 있도록 정보 수집 권한, 내부 고발자 보호, 정부 간 정보 공유, 유연한 규칙 및 정의, AI 시스템의 평가 능력 개발, 모델 가중치 및 알고리즘 비밀 보안 강화, 기술 인재 투자 등을 권장하고 있다.

Import AI (Jack Clark)
News·

Co-Scientist: 연구 가속화를 위한 협업 AI 파트너

Google DeepMind에서 Gemini를 기반으로 구축한 Co-Scientist는 연구자들이 과학적 혁신을 가속화할 수 있도록 돕는 협업 AI 파트너이다.

Google DeepMind Blog
News·

Adobe의 'audience of one' 개념으로 개인화된 웹사이트 구현

Adobe의 Principal Scientist Carlos Sanchez는 AI Engineer World’s Fair에서 웹사이트가 방문자의 필요에 맞춰 실시간으로 구성될 수 있는 가능성을 제시했다. Adobe는 이를 'agentic site'라고 부르며, 방문자의 행동과 검색 쿼리를 기반으로 페이지를 조합하는 시스템을 시연했다. 예를 들어, 캠핑에 관심이 있는 방문자는 커피 머신 사이트에서 야외에서 커피를 만드는 내용으로 재구성된 페이지를 받았다. 현재 페이지 생성 비용은 페이지당 1~2센트로 추정되며, Adobe는 이 기술을 상용화하기 위해 고객과 실험할 조직을 찾고 있다.

Latent Space (swyx & Alessio)