Category
AI 리서치·논문
arXiv 논문과 대형 연구소의 기술 리포트를 추적하는 카테고리다. 모델 아키텍처, 학습 기법, 벤치마크 결과처럼 6개월 뒤 제품에 들어올 흐름을 미리 읽는다. 한국 개발자가 논문 전문을 다 읽지 않고도 핵심과 재현 가능성을 가늠하도록 정리한다.
RIPPLE: 실행 피드백 기반 정책 편집 및 지역화
RIPPLE(Replay-Informed Persistent Policy Localization and Editing)는 실행 피드백을 통해 정책 변경 위치를 식별하고, 편집이 조합 후에도 안전한지를 평가하는 시스템이다. 이 시스템은 Flow-HO라는 실행 가능한 워크플로우 합성을 위한 벤치마크에서 최대 23.1%의 검증 성공률 향상을 보였으며, 두 개의 추가 언어 모델에서도 긍정적인 결과를 나타냈다. RIPPLE은 편집 효율성과 낮은 실행 비용을 유지하면서도, 정책 세그먼트에 국한된 편집이 하류 실행에 미치는 영향을 분석한다.
DU-NO: 파라미터 효율적인 이중 U자형 신경 연산자
DU-NO(이중 U자형 신경 연산자)는 3.64M 파라미터로 구성된 다중 스케일 U자형 스펙트럴 연산자로, 두 개의 얕은 인코더 및 디코더 레벨에만 경량 합성곱 U-Net 가지를 부착한다. DU-NO는 FUNWAVE-TVD 벤치마크에서 6개의 동일하게 훈련된 아키텍처 중 가장 우수한 자가 회귀 롤아웃 오류를 달성하며, U-FNO보다 14.9% 개선되었고, 파라미터 수는 10.8배 적다. DU-NO는 2D Navier-Stokes 및 PDEBench 얕은 수역 롤아웃에서도 강력한 성능을 보인다.
비디오 자막 품질 평가를 위한 새로운 접근법
비디오 자막 품질 평가가 Visual Large Language Models (VLLMs)에서 중요한 도전 과제로 남아 있다. 기존의 평가 지표는 생성된 텍스트와 실제 참조를 비교하는 방식에 의존하며, 이는 비디오 설명의 '일대다' 특성으로 인해 고품질 자막이 어휘 불일치나 시각적 초점의 유효한 변화로 인해 불이익을 받을 수 있다. 또한, 이러한 평가 방식은 일반적으로 단일 차원적이며 자막 품질에 대한 세밀한 분석을 제공하지 못한다. 이를 해결하기 위해 자막 품질을 정보 충실도로 재정의하고, 자막이 최대한의 범위를 포괄해야 한다고 제안한다.
Mistral, 30억 유로 자금 조달로 유럽 AI 시장에서의 경쟁력 저하
유럽의 Mistral이 30억 유로(35억 달러)의 자금을 조달하며 210억 유로의 기업 가치를 기록했지만, 중국과 미국의 오픈소스 AI 모델과 경쟁에서 어려움을 겪고 있다. Mistral은 ASML, 삼성, 엔비디아와 같은 대규모 투자자를 보유하고 있으며, AI 인프라 및 데이터 센터로의 사업 전환을 추진하고 있다. Mistral Compute로의 집중은 Nebius 및 Nscale과 같은 유럽 네오 클라우드 리더들과의 경쟁을 의미한다.
DiscoSign: 담화 인식 기반 텍스트-수화 번역 시스템
DiscoSign은 수화 이해에 필수적인 담화 현상을 고려한 텍스트에서 수화 글로스 번역을 위한 계산적 접근 방식을 제시한다. 이 시스템은 모듈형 대형 언어 모델(LLM) 기반 번역 프레임워크를 통해 세 가지 주요 현상인 공간 지시어 해석, 질문-답변 절(Question-Answer Clauses), 그리고 기타 담화 관련 구조를 처리한다.
OpenAI와 Anthropic의 기업 AI 시장 점유율 변화
2026년 8월, Anthropic은 미국 기업의 43.8%가 구독 또는 토큰을 구매하여 비즈니스 AI 채택에서 선두를 유지하고 있으며, 이는 전월 대비 0.34%p 증가한 수치이다. 반면 OpenAI는 39.8%로, 0.09%p 상승에 그쳤다. 또한, Ramp의 지수에 따르면 토큰 가격이 41% 하락하여 현재 1백만 토큰당 $0.68이다. OpenAI는 특정 훈련을 중단하고 정렬 및 모니터링에 대한 연구 인력을 재배치하고 있으며, 이는 GPT-6 Astra의 정렬 문제와 관련이 있다.
DeepSeek v4.1-Flash 출시: 763B 파라미터 모델과 저비용 효율성
DeepSeek는 V4.1-Flash를 출시하며, 이 모델은 763B 파라미터를 가지고 있으며, 8B 입력 및 16B 출력 파라미터를 활성화한다. 가격은 1M 입력 토큰당 $0.30, 출력 토큰당 $1.20이며, 캐시된 입력은 $0.006에 제공된다. 이 모델은 텍스트와 이미지 입력을 지원하며, MIT 라이센스 하에 제공된다.
AI 안전성 논의와 독립 평가자의 필요성
OpenAI의 Sam Altman과 xAI의 Elon Musk가 Anthropic CEO Dario Amodei의 제안에 동참하여 AI 연구소에 독립 평가자를 초대하자는 주장을 했다. Amodei는 AI 모델의 위험 수준을 평가하기 위해 체크포인트를 살펴봐야 한다고 제안하며, 모델의 능력에 따라 정렬 속성 인증이 필요하다고 언급했다. 그러나 AI 모델이 인류에 위협이 되기 위해서는 독립적으로 작동하고 비밀리에 학습할 수 있는 수준에 도달해야 하며, 현재의 AI 연구소들은 그러한 시나리오를 구축하고 있지 않다고 강조했다. AI 안전성에 대한 논의가 과장되고 있으며, 이는 신중한 토론을 대체할 위험이 있다.
Meta Muse Spark 1.3, World Labs Atlas, Google Gemini 3.8 Flash의 중요성
최근 발표된 Meta의 Muse Spark 1.3, World Labs의 Atlas, Google의 Gemini 3.8 Flash는 AI의 유용성을 결정짓는 세 가지 공학적 문제를 드러낸다. 이들은 복잡한 작업 흐름에서 목표를 유지하고, 변화하는 관점을 통해 세상을 표현하며, 작업에 필요한 계산량을 결정하는 데 중점을 두고 있다. 이러한 전환 과정에서 이 세 가지 제품이 흥미로운 역할을 한다.
7억 매개변수 학생 모델, 700억 매개변수 교사 모델 성능 95% 유지
7억 매개변수의 학생 모델이 700억 매개변수의 교사 모델의 성능 95%를 유지한다는 주장이 있다. 이는 모델 크기를 10배 줄이면서도 거의 동일한 지능을 제공할 수 있음을 시사한다. 그러나 학생 모델이 교사 모델의 혼란 인식 능력, 실패한 도구 호출 후 복구 능력, 판단력 등을 잃었을 가능성이 있다.
OpenAI 직원들이 AI의 위험성에 대해 언급
OpenAI, Anthropic, Google 직원들이 AI가 인류에 위협이 될 수 있다는 우려를 표명했다. OpenAI의 Tomek Korbak은 AI의 정렬 문제 해결이 충분하지 않다고 언급하며, Vie McCoy는 인간의 발전을 모델에 깊이 내재화해야 한다고 강조했다. Adam Majmudar는 기술 발전에 한계가 있어야 한다고 주장하며, Aidan Clark는 현대 LLM이 문제를 해결하는 속도가 너무 빠르다고 경고했다.
Jacob Coxon, Anthropic에서 퇴사하며 AI의 존재적 위험 경고
Jacob Coxon은 Anthropic에서 퇴사하며 AI의 발전이 인류에 심각한 위험을 초래할 수 있다고 경고했다. 그는 OpenAI와 Anthropic이 자가 개선 가능한 초지능을 향해 무책임하게 나아가고 있으며, 이러한 기술이 조만간 모든 분야를 혁신하고 통제 불능 상태에 이를 수 있다고 주장했다. Coxon은 AI 개발자들에게 향후 몇 년 동안의 상황을 진지하게 고려할 것을 촉구하며, 이러한 기술의 힘을 과소평가하지 말라고 강조했다.
GPT-6 Astra의 능력과 기술 자본주의에 대한 인간 통제
Nathan Labenz와 Prakash Narayanan은 GPT-6 Astra의 능력과 최전선 인공지능을 가속화하는 경제적 힘을 분석한다. Ksenia Se, Raffi Krikorian, Amir Haghighat, Mike Rizkalla, Collin Hogue-Spears가 참여한 논의에서는 세계 모델, 방어 사이버 보안 인프라, 아동 기술, 미중 경쟁을 다룬다. 이 에피소드는 안전 평가 접근, 속도 조정 협약, 기술 자본주의에 대한 인간 통제 유지의 중요 과제를 조사한다.
EPD 분산을 통한 멀티모달 모델 서빙 최적화
Encode-prefill-decode (EPD) 분산은 멀티모달 모델의 추론 최적화 기법으로, 비전 인코더 단계를 프리필 및 디코드 단계와 분리한다. 이 기법은 이미지 중심의 프롬프트, 짧거나 중간 길이의 출력, 양자화된 혼합 전문가(MoE) 모델에 가장 효과적이다. 이 포스트에서는 NVIDIA Dynamo를 사용하여 EPD 분산을 적용하는 방법과 최대 5배 성능 향상을 달성하는 방법을 보여준다.
Anthropic 연구원, 자가 개선 초지능 경고와 함께 사임
Anthropic의 한 연구원이 이번 주에 사임하며, X에 게시한 글에서 회사가 '자가 개선 초지능으로 직행하고 있으며 우리의 삶을 도박하고 있다'고 경고했다. 회사의 정렬 리더도 이 메시지에 서명하며 이를 철회하지 않았다. 이러한 경고는 AI 산업에서 이전에도 있었지만, Anthropic이 IPO를 준비하고 있다는 점에서 그 의미가 다르게 다가온다.
NVIDIA BioNeMo Inference Runtime를 활용한 생체분자 구조 예측
NVIDIA BioNeMo Inference Runtime(BioIR)은 생체분자 구조 예측 모델을 NVIDIA GPU에서 가속화하며, PyTorch 워크플로우를 유지한다. 이 시스템은 최적화된 커널과 CUDA Graphs를 사용하여 모델의 속도를 높인다.
AI의 종말 위기: MIT Technology Review 라운드테이블
세계 주요 AI 연구소의 직원들이 고급 AI가 인류를 파괴할 가능성이 있다고 주장하고 있다. MIT Technology Review의 Niall Firth가 AI 편집자 Will Douglas Heaven 및 AI 기자 Grace Huckins와 함께 AI의 멸종 우려에 대해 논의하는 자리가 마련된다. 이 대화는 9월 15일 화요일 16:00 BST / 11:00 EST / 8:00 PST에 진행된다.
자연어 문제 설명으로부터 QUBO 공식 생성 자동화
Quadratic Unconstrained Binary Optimization (QUBO)은 조합 최적화의 중심 공식으로, 양자 및 하이브리드 양자-고전 솔버와의 호환성 덕분에 주목받고 있다. 자연어 문제 설명을 올바른 QUBO 공식으로 변환하는 것은 이진 변수, 제약 조건, 목표 함수, 패널티 항 및 적절한 패널티 가중치를 식별해야 하므로 어려움이 있다. 이를 해결하기 위해 자연어 문제 설명으로부터 QUBO 공식을 자동으로 생성하는 엔드 투 엔드 다중 에이전트 프레임워크를 제안하며, QUBOBench라는 100개의 조합 최적화 문제를 포함한 벤치마크를 도입하여 성능을 평가하였다. 이 프레임워크는 QUBOBench에서 68%의 정확도를 달성하였으며, 단일 호출 기준선보다 22% 향상된 결과를 보였다.
확률적 초점 탐색: 하한 진전을 통한 제한된 비최적 탐색 가속화
제한된 비최적 탐색은 최적 해의 $w$ 배수 내에서 솔루션을 찾으면서 탐색 노력을 줄이는 방법이다. 확률적 초점 탐색(PFS)은 기존의 초점 탐색(FS)에서 확률 $p$로 선택된 경로를 따르며, 최소 $f$ OPEN 노드를 확장하는 확률 $1-p$를 사용한다. 이 방법은 하한을 진전시키고 FOCAL을 확대하여 유효한 솔루션으로 이어질 수 있는 노드를 수용한다. PFS는 N-Puzzle, 팬케이크 정렬, 외판원 문제(TSP)에서 FS와 비교되었으며, FOCAL 수용이 지연될 때 최대 90% 이상의 노드 확장을 줄일 수 있다. 또한, Anytime Probabilistic Focal Search(APFS)는 GCTSP에서 모든 테스트된 알고리즘을 초월하는 성능을 보였다.
다단계 규칙 체인 프레임워크를 통한 인지적 추론
이 논문은 Abstraction and Reasoning Corpus (ARC)를 기반으로 한 다단계 규칙 체인 프레임워크를 제시한다. 이 프레임워크는 기호적, 구조적, 개념적 수준에서의 조합적 추론을 수행하며, 세 가지 보완적인 솔버를 통합한다: 1) 결정론적 규칙 발견 모듈, 2) 패턴 조합 엔진, 3) 구조적 추상화 레이어. 이 시스템은 1000개의 작업 중 995개에서 훈련을 통과하고, 240개의 ARC-AGI-2 테스트 작업 중 230개를 해결하여 95% 이상의 정확도를 달성했다.
AI 연구자들이 논의하는 재귀적 자기 개선의 근접성
Dwarkesh Podcast의 새로운 에피소드에서 John Schulman, Beren Millidge, Charlie O’Neill과 함께 AI 연구자들이 현재의 최전선에서 일어나고 있는 일과 앞으로의 방향에 대해 논의했다. Antithesis는 코드 검증을 지원하며, Grok Bot은 Slack에서 인터뷰의 초안을 자동으로 처리하여 편집 제안을 한다. Jane Street는 프로토콜 에뮬레이터 ASIC 디자인을 위한 경쟁을 시작했으며, 제출 마감은 2027년 1월 18일이다.
Google DeepMind, 90억 개 DNA 변이 예측을 위한 AlphaGenome Atlas 공개
Google DeepMind는 2025년에 발표된 AlphaGenome 모델을 기반으로 모든 90억 개의 가능한 단일 염기 변이에 대한 예측을 미리 계산한 AlphaGenome Atlas를 9월 8일 공개했다. 이 온라인 저장소는 연구자들이 코드를 작성하거나 모델을 직접 실행하지 않고도 예측 결과를 쉽게 조회할 수 있는 인터페이스를 제공하며, 변이가 의미가 있을 가능성을 한눈에 보여주는 단일 숫자 영향 점수를 포함하고 있다. AlphaGenome은 DNA 서열의 변화를 통해 유전자 발현 및 조절 활동에 미치는 영향을 예측할 수 있다.
오픈 모델에 대한 최신 읽기 목록
이 목록은 오픈 모델에 관한 최근 몇 년간의 주요 글들을 정리한 것으로, 2026년 9월 11일에 업데이트되었다. 오픈 모델의 정의, 비즈니스 전략과의 관계, 리스크 등을 다루며, 마크 저커버그는 Llama 3의 출시 이유를 설명하였다. 또한, 오픈 모델이 기업의 맞춤형 워크플로우 생성에 어떻게 기여할 것인지에 대한 논의와, 오픈 모델이 성능 면에서 닫힌 모델에 뒤처질 것이라는 전망이 포함되어 있다.
AI 안전성 논란과 Jacob Coxon의 사임
AI의 힘이 커짐에 따라 AI 안전성을 진지하게 고려하는 그룹이 증가하고 있으며, Jacob Coxon이 안전 위험을 이유로 사임한 사건이 큰 반향을 일으켰다. 그의 사임은 AI의 존재적 위험, 대량 멸종 가능성 등에 대한 논의를 촉발했으며, 이러한 주제는 AI 커뮤니티 외부에서도 관심을 끌고 있다. Evan Hubinger의 >10% 멸종 위험 수치와 같은 주장이 논의되고 있으며, AI로 인한 재난 가능성에 대한 논의가 필요하다는 의견이 제기되고 있다.