Category
AI 리서치·논문
arXiv 논문과 대형 연구소의 기술 리포트를 추적하는 카테고리다. 모델 아키텍처, 학습 기법, 벤치마크 결과처럼 6개월 뒤 제품에 들어올 흐름을 미리 읽는다. 한국 개발자가 논문 전문을 다 읽지 않고도 핵심과 재현 가능성을 가늠하도록 정리한다.
OpenAI의 GPT-5.6 모델과 DeepSeek-R1의 추론 모델
OpenAI는 최근 GPT-5.6 모델 패밀리를 출시했으며, 이 모델은 세 가지 크기로 제공되고 각기 다섯 또는 여섯 가지 추론 노력 설정을 포함한다. DeepSeek-R1은 강화 학습을 통한 검증 가능한 보상(RLVR) 기법을 사용하여 LLM을 추론 모델로 전환하는 방법을 제안했다. RLVR은 수학과 코드와 같은 검증 가능한 데이터 도메인에서 보상 신호를 제공한다. 이 과정에서 중간 추론 흔적은 모델 훈련에 사용되지 않았다.
Generative SNUPI를 활용한 DNA 오리가미 설계
한국의 과학자들이 DNA 오리가미를 설계하기 위해 Generative SNUPI라는 AI 모델을 개발했다. 이 모델은 사용자가 요청한 형태로 DNA 구조를 설계할 수 있으며, 화학 규칙을 고려하여 DNA 가닥이 특정 형태로 접히도록 지시한다. 연구팀은 서울대학교와 한양대학교 소속이며, 이 연구 결과는 Nature Communications에 게재될 예정이다. Generative SNUPI는 복잡한 형태를 입력받아 이를 DNA 형태로 변환하는 확산 모델을 적용하여 DNA 서열을 생성한다. 이 기술은 약물 전달 및 면역 요법과 같은 생명 구호적 응용 가능성을 지니고 있다.
AI와 나노기술이 변화시키는 생물학 연구의 미래
AI 전문가들은 지난 10년간 자신의 지식이 발전을 방해한다는 쓴 교훈을 배웠다. 생물학 분야에서도 유사한 교훈이 적용되고 있으며, 새로운 약물은 정교한 가설이 아닌 방대한 데이터셋의 분석에서 출발하고 있다. AI와 나노기술을 활용한 새로운 과학적 방법들이 인체 생물학의 다양한 측면을 측정할 수 있게 하며, AI 모델은 자동화된 실험실에서 실험을 수행하고 결과를 분석하여 새로운 실험을 제안할 것이다. 또한, Mark Zuckerberg가 지원하는 Biohub는 AI 기반의 단백질 생물학 모델을 공개하였고, Nvidia는 과학적 발견을 가속화하기 위한 BioNeMo 툴킷을 발표했다.
AI 노동력의 협력적 또는 비협력적 모델
AI 노동력이 미래의 AI를 구축하는 과정에서 협력적이거나 비협력적으로 발전할 가능성을 다룬 동적 모델에 대한 내용이다. 이 모델은 협력적 경로와 비협력적 경로의 경계가 어디에 있는지, 현재의 증거가 우리가 어느 쪽에 있는지를 보여주며, 우리가 올바른 경로에 있다는 것을 알려줄 수 있는 요소에 대해 설명한다.
Meta의 Autodata: 데이터 생성의 새로운 접근 방식
Meta가 발표한 Autodata 연구는 AI 훈련에서 데이터 생성 과정을 에이전트 프로세스로 전환하는 접근 방식을 제안한다. 기존의 데이터 처리 방식은 데이터를 수집하고 필터링한 후 훈련을 시작하는 것이었으나, Autodata는 AI 에이전트가 예제를 생성하고, 이를 테스트하며, 실패를 분석하고, 레시피를 업데이트하는 방식으로 데이터 생성을 반복하는 연구 루프를 형성한다.
Xi Jinping의 AI 관련 연설 요약
Xi Jinping은 AI의 발전과 그로 인한 기회 및 도전에 대해 언급하며, AI가 인간과 기계의 협력, 산업 통합 등을 통해 큰 변화를 가져올 것이라고 강조했다. 그는 AI 기술이 전 세계적으로 긍정적인 방향으로 발전해야 하며, 이에 대한 국제 사회의 진지한 논의가 필요하다고 말했다. 또한, AI의 윤리적 문제와 알고리즘의 결정 과정에서의 안전성 확보에 대한 질문을 제기했다.
AI 인프라 투자 증가와 경제적 가시성 부족
107개 기업을 대상으로 한 조사에서 AI 인프라 지출이 증가하고 있지만, 기업들은 그 경제성을 제대로 파악하지 못하고 있다. 현재 21%의 기업만이 AI를 대규모로 운영하고 있으며, 76%는 실험 중이거나 일부 작업만 운영하고 있다. GPU 활용률은 50% 이하인 경우가 83%에 달하며, 44%의 기업만이 AI 컴퓨팅 비용을 철저히 추적하고 있다. 64%의 기업이 12개월 이내에 인프라 공급자를 변경하거나 추가할 계획이다.
IBM 메인프레임 판매 감소와 AI의 영향
IBM의 주가는 역사상 최악의 하루를 기록했으며, 메인프레임 컴퓨터의 판매와 이를 운영하는 소프트웨어가 감소하고 있다. IBM 경영진은 AI 지출을 원인으로 지목했지만, AI가 구식 기술에서 운영되는 필수 백엔드 프로그램을 포팅할 수 있는 능력이 진정한 문제라고 분석되었다.
SPINE: 에이전틱 AI를 통한 사이버-물리적 통합
SPINE(Scalable Physical Integration with ageNtic Expertise)는 최소한의 로봇 공학 전문 지식으로 이인용 로봇을 체계적으로 디버깅하고 배포하기 위한 에이전틱 프레임워크이다. SPINE의 하네스는 로봇 특화 컨텍스트를 생성하는 프로파일 빌더와 진단, 수리, 검증을 반복하는 디버거로 구성된 두 개의 다중 에이전트 워크플로우로 이루어져 있다. SPINE을 사용한 로봇 공학 초보자는 동일한 자료를 사용한 인간 운영자보다 75%에서 100%로 운영화 성공률을 개선하고, 원격 조작까지의 평균 시간을 16분 45초에서 13분 47초로 단축했다. AgileX PiPER에서 SPINE은 10개의 버그를 모두 해결했으며, 전문가 기준은 10개 중 9개를 해결했다.
대형 언어 모델의 전제 의존성 테스트를 위한 개입적 기초 감사
대형 언어 모델은 논리적으로 타당해 보이는 사고 과정을 생성하지만, 실제로는 명시된 전제에 의존하지 않을 수 있다. 본 연구에서는 개입적 기초 감사를 도입하여, 단일 전제를 새 기호로 대체하고 모델을 재실행하여 각 추론 단계의 정규화된 결론이 변화하는지를 확인하는 블랙박스 테스트를 수행한다. GPT-4o를 사용하여 50개의 ProntoQA 문제를 평가한 결과, 증명 트리 의존성을 감지하는 데 F1 = 0.806을 달성하였고, 이는 자가 일관성 기준선(F1 = 0.343)을 크게 초과하는 성과이다. 또한, 66%의 올바르게 해결된 문제는 직접적인 증명 트리 의존성에 민감하지 않은 정렬된 단계를 포함하고 있음을 확인하였다.
UniSAGE: 정적 및 동적 속성을 통합하는 하이퍼 구조
UniSAGE는 정적 속성과 동적 기록을 결합한 계층적 정보를 모델링하기 위한 통합 프레임워크이다. 이 프레임워크는 전역 속성 그래프를 구성하여 계층적 및 시간적 관계를 통합된 구조로 표현하며, 정적 집계와 동적 추론을 지원하는 두 개의 직교 매개변수 서브스페이스를 도입한다. UniSAGE는 경량 하이퍼 구조 메커니즘을 통해 정적 및 동적 속성 간의 작업별 상호작용을 가능하게 하며, 자동화되어 진화하는 데이터 스키마에 강건하고 복잡한 속성 간 의존성을 포착할 수 있다. 여러 공개 벤치마크와 실제 금융 행동 데이터셋에 대한 실험에서 UniSAGE는 기존 방법보다 10% 이상의 성능 향상을 보여주었다.
Just Keep Prompting: VLM의 반복적 소크라틱 프롬프트 평가
Vision-Language Models (VLMs)의 실제 배포는 강력한 시각적 추론과 지속적인 대화 압력에 대한 안정성이 필요하다. 'Just Keep Prompting (JKP)'라는 다중 턴 평가 프레임워크가 도입되었으며, 이는 사용자가 모델의 답변을 반복적으로 도전, 질문 또는 반박할 때 VLM의 인식 안정성을 측정한다. JKP는 최대 10회의 후속 턴을 세 가지 전략으로 탐색한다: Adversarial Negation, Pure Socratic Interrogation, Context-Aware Socratic Summarization. GPT-4o, Gemini 2.5 Pro, Qwen3-VL-30B를 STAR 벤치마크의 하위 집합에서 720회의 다중 턴 실행으로 평가한 결과, 정답의 정확도는 턴 0에서 턴 10까지 약간 변화했지만, 모델의 불안정성이 드러났다. Qwen3-VL-30B는 최종 정확도가 가장 높지만 직접적인 반박 시 잘못된 확신을 가지며, Gemini 2.5 Pro는 비교적 안정적이지만 토큰 비용이 높고, GPT-4o는 가장 취약하고 진동성이 크다.
QFireNet: Sentinel-2 이미지를 통한 산불 분할을 위한 양자 강화 U-Net
이 논문에서는 산불 탐지를 위한 위성 이미지의 의미론적 이미지 분할 문제를 다룬다. U-Net 모델을 기반으로 하여 Sen2Fire 데이터셋의 고차원 스펙트럼 특성 공간을 더 효과적으로 모델링하기 위해 양자 하이브리드 솔루션을 개발하였다. U-Net의 병목 부분에 변분 양자 회로를 주입하고, QB-Net과 QuFeX 안자츠를 사용하였다. 실험 결과, QB-Net의 $F_1$ 점수는 31.18, QuFeX는 30.79로, 전통적인 U-Net의 28.71을 초과하였다. 또한, 데이터 혼합이 지리적으로 분리된 훈련 및 테스트 세트 간의 도메인 이동을 제거하여 전통적인 FPN의 $F_1$ 점수를 39.76으로 향상시켰다. 이 아키텍처는 캘리포니아 화재 지역 데이터셋을 통해 검증되었다.
CARPRT: 클래스 인식 제로샷 프롬프트 재가중 기법
CARPRT는 클래스 레이블에 따라 프롬프트의 가중치를 조정하여 제로샷 이미지 분류의 정확성을 높이는 방법이다. 기존의 방법은 모든 클래스에 대해 동일한 가중치 벡터를 사용하지만, CARPRT는 각 클래스에 대해 프롬프트의 클래스 특정 관련성을 반영하여 가중치를 조정한다. 이 방법은 이미지-텍스트 관련성 점수를 평균내어 클래스별 가중치를 도출하며, 표준 이미지 분류 벤치마크에서 기존 방법보다 우수한 성능을 보인다.
언어 모델 에이전트 간 잠재적 커뮤니케이션: 채널, 정렬 및 텍스트의 한계
다중 에이전트 시스템(MAS)은 명확한 텍스트 메시지 전송을 통해 상호 통신을 수행한다. 연구에 따르면, 대형 언어 모델(LLM) 에이전트가 텍스트를 통해 소통할 때 정보 손실이 발생하며, 이는 희소 오토인코더(SAE) 기능 분석을 통해 정량화되었다. SAE-희소 채널은 밀집 잠재 채널에 비해 28배 압축 시 99.4%의 탐지 정확도를 유지하는 반면, 텍스트 채널은 80.4%에 그쳤다. 또한, Procrustes 정렬을 사용한 경우 Llama와 Mistral 간의 92%의 상위 1회 검색률을 보였다. 텍스트 직렬화는 88%의 SAE 기능을 파괴하며, 이는 정체성 교체로 인한 손실로 분석되었다. 잠재 채널은 교차 언어 개념 작업에서 텍스트 채널과 일치하지만 초과하지는 않았다.
LiDAR 기반 지형 정보를 활용한 위성 지상국 위치 선정 위한 해석 가능한 지리공간 AI
대표적인 혼잡 높이(Representative Clutter Height, RCH)는 무선 전파 및 간섭 분석에서 중요한 매개변수로, 지역 장애물의 주요 높이를 포착한다. 기존의 방법은 고정된 혼잡 높이를 사용하지만, 이는 클래스 내 변동성을 놓치고 저지구 궤도 지상국 위치 선정에 부정적인 영향을 미칠 수 있다. 본 연구에서는 개방형 지리공간 데이터를 활용한 RCH 예측을 위한 해석 가능한 머신러닝 프레임워크를 제시하며, 모델은 미국 지질조사국의 LiDAR 기반 레이블을 사용하여 훈련되었다. 최종 모델은 평균 절대 오차 1.79m와 R^2=0.765를 달성하며, ITU 기준에 비해 60% 이상 절대 오차를 줄였다. 주요 예측 변수로는 나무 캐노피 커버, 토지 피복 의미론, 스펙트럼 반사율이 확인되었다.
Lila Sciences의 AI 기반 자동화 실험실 개념
Lila Sciences는 AI 기반 로봇과 실험 장비로 구성된 자동화 실험실을 구상하고 있으며, 이를 통해 과학적 초지능을 구축하는 것을 목표로 하고 있다. 이들은 10조 개의 실험적으로 검증된 과학적 추론 토큰을 보유하고 있으며, 생물학, 화학, 약물 발견 및 재료 과학을 동시에 진행하고 있다. Lila는 실험실을 데이터 센터로 보고, 유연성과 일반화 가능성을 최우선으로 하여 자동화를 최적화하고 있다.
ELIZA의 소스 코드 발견과 다중 인격 기능
ELIZA는 세계 최초의 AI 챗봇으로, MIT 아카이브에서 실제 소스 코드가 발견되었다. 이 코드는 ELIZA가 단순한 패턴 매칭 챗봇이 아니라 여러 인격을 가질 수 있는 복잡한 프로그램임을 보여준다. ELIZA는 1960년대 중반에 등장하여 인간-컴퓨터 상호작용의 방식을 변화시켰으며, 'Doctor'라는 스크립트를 통해 심리치료사 역할을 수행했다. 이 발견은 초기 AI 개발에 대한 이해를 변화시키고, 현대 AI 개발에 여전히 영향을 미치는 언어와 상호작용에 대한 기본 가정을 드러낸다.
Phantom Twist: 인간에게 거의 보이지 않는 드론
노스웨스턴 대학교의 로봇공학자들이 RSS 2026에서 발표한 드론 Phantom Twist는 비행 중 인간에게 거의 보이지 않도록 설계되었다. 이 드론은 15~25Hz의 속도로 회전하여 인간의 시각 시스템을 이용해 회전하는 물체를 불투명한 흐림으로 변환한다. 드론은 단일 모터로 제어되며, 구성 요소의 배치가 최적화되어 시각적 겹침을 최소화한다.
중국 AI 스타트업 Moonshot AI, Kimi K3 모델 공개
중국 AI 스타트업 Moonshot AI가 Kimi K3 모델을 발표했다. 이 모델은 2.8조 개의 파라미터를 포함하고 있으며, 1백만 토큰의 컨텍스트 윈도우를 제공하여 대량의 텍스트를 동시에 처리할 수 있다. Kimi K3는 AI 평가 기관 Arena의 블라인드 테스트에서 Anthropic의 Fable 5와 OpenAI의 GPT-5.6 Sol을 포함한 모든 미국 모델보다 우수한 성능을 보였다. Kimi는 가격이 저렴하여 미국의 프리미엄 모델과의 경쟁을 촉발하고 있다.
AI 데이터 센터와 OpenAI의 도전
AI 데이터 센터는 지역 저항, 투자자 감시, 오라클의 신용 위험 압박에 직면했다. OpenAI는 안전 리드의 이탈과 출시 복잡성 문제에 직면했다. Anthropic은 Claude Code의 브라우저 에이전트 범위를 확장했다. AI 관련 내용은 LinkedIn에서 계속 확산되고 있다.
2015년 증류 논문의 가정과 언어 모델의 변화
2015년의 증류 논문은 고정된 입력 분포와 닫힌 클래스 집합에 대한 확률 벡터를 생성하는 교사 모델을 가정했다. 그러나 언어 모델의 등장은 이러한 가정을 깨뜨렸다. 이 글은 증류 과정에서 압축 개념에서 능력 전이 개념으로의 전환을 다루며, 이 전환은 약 5년 동안 세 가지 단계로 진행되었다.
비트코인이 고전 컴퓨터 과학 문제를 재구성한 방법
a16z Crypto Show의 첫 번째 에피소드에서는 Tim Roughgarden과 Ittai Abraham이 현대 블록체인의 기초가 된 컴퓨터 과학 연구의 역사를 살펴본다. 비트코인은 분산 컴퓨팅의 어려운 문제인 독립적인 기계들이 신뢰할 수 있는 상태에 합의하는 방법을 해결하는 혁신적인 솔루션을 도입했다. 이 대화에서는 비잔틴 합의, 상태 기계 복제, 작업 증명, 지분 증명, Tendermint, Casper, DAG 기반 프로토콜 등을 다룬다.
NVIDIA Nemotron 모델 추론 챌린지와 5,000명 이상의 Kaggle 참가자
NVIDIA Nemotron 모델 추론 챌린지는 Kaggle 커뮤니티에 동일한 공개 모델, 벤치마크, 인프라 및 평가 제약 조건에서 추론 정확도를 개선할 수 있는 기술을 탐구하도록 초대했다. 이 대회에는 4,000개 팀의 5,000명 이상의 참가자가 참여하여 수천 개의 결과를 생성했다.