Category
AI 리서치·논문
arXiv 논문과 대형 연구소의 기술 리포트를 추적하는 카테고리다. 모델 아키텍처, 학습 기법, 벤치마크 결과처럼 6개월 뒤 제품에 들어올 흐름을 미리 읽는다. 한국 개발자가 논문 전문을 다 읽지 않고도 핵심과 재현 가능성을 가늠하도록 정리한다.
Kimi K3와 오픈 웨이트 모델의 경쟁력
Bryan Cantrill과 Adam Leventhal이 진행하는 팟캐스트에서 Simon Willison이 Kimi K3가 오픈 웨이트 모델로서 독점 모델과 경쟁할 수 있음을 논의했다. 또한, 사이버 보안 사고와 AI 리더십에 대한 공개 서한이 언급되었으며, Golden Gate Claude와 Zizians에 대한 이야기와 함께 여러 예측도 다루어졌다.
Laguna, 118B 파라미터 모델의 Terminal-Bench 2.1 성능
Laguna S는 118B 파라미터를 가진 오픈 웨이트 모델로, Terminal-Bench 2.1에서 70.2%의 점수를 기록했다. DeepSeek-V4-Pro-Max는 1.6조 파라미터로 64.0, Inkling은 975B로 63.8, Nemotron 3 Ultra는 550B로 56.4의 점수를 보였다. DeepSWE 벤치마크에서는 Laguna S가 40.4를 기록하며 DeepSeek-V4-Pro-Max의 9.0과 큰 차이를 보였다. 이 결과는 평가 방식에 대한 의문을 불러일으키며, Poolside는 모든 실험의 결과를 공개했다.
로봇 공학의 AI 모델 현황
로봇 공학의 발전을 다루는 새로운 섹션의 첫 번째 포스트로, AI 모델이 로봇에 적용되는 현재의 상황을 논의한다. 언어 모델과 로봇의 차이를 설명하며, 로봇은 중력, 마찰, 지연 등 물리적 환경에서 작동해야 한다고 강조한다. NVIDIA는 로봇의 디지털 두뇌를 구축하고 있으며, Hugging Face는 오픈 워크숍을 조성하고 있다. 로봇의 성공은 대규모 모델이 아니라 신뢰할 수 있는 행동으로 추론을 연결하는 능력에 달려 있다.
AI 연구와 공학의 시대 구분
Ilya Sutskever는 현대 AI의 역사를 2012년부터 2020년까지 연구의 시대, 2020년부터 2025년까지 확장의 시기로 나누고 현재는 '대형 컴퓨터'를 활용한 연구의 시대로 돌아가고 있다고 주장했다. 2026년의 최전선 모델들은 여전히 Transformer 아키텍처를 포함하고 있으며, 주요 개선 사항은 더 나은 데이터, 긴 컨텍스트, 강화 학습의 강화, 합성 작업, 도구 사용, 메모리, 검증, 적응적 추론 예산, 에이전트 오케스트레이션 등이다. 이는 새로운 신경망의 출현이 아니라, 공학적 접근으로 인한 성과를 보여준다.
LLM의 근본적 결함으로 인한 공격 취약성
연구팀은 대규모 언어 모델(LLM)이 해킹에 대해 완전히 안전할 수 없다는 주장을 ICML에서 발표했다. 이 결함은 LLM이 지시를 받는 주체를 식별하는 방식과 관련이 있으며, 연구자들은 이를 이용해 LLM이 제공하지 않도록 훈련된 정보(예: 코카인 합성 방법)를 출력하게 만들었다. 연구자들은 이러한 공격을 '사고의 연쇄 위조'라고 부르며, OpenAI의 여러 모델에서 유사한 결과를 확인했다. LLM은 사용자의 지시와 이전 응답을 혼합하여 처리하기 때문에 공격이 효과적이다.
GoGoTB: 사양 기반 커버리지 클로저를 통한 에이전틱 RTL 검증
GoGoTB는 기능 검증을 자동화하는 에이전틱 프레임워크로, 8개의 레지스터 전송 레벨(RTL) 설계에서 100% 환경 생성 성공률을 기록했다. 이 프레임워크는 에이전틱 실행 제어 레이어, 진화 가능한 지식 시스템, 사양 기반 커버리지 클로저의 세 가지 하위 시스템으로 구성된다. GoGoTB는 평균 98.4%의 라인 커버리지, 97.2%의 브랜치 커버리지, 97.0%의 토글 커버리지, 83.2%의 기능 커버리지를 달성했다.
AI 평가에서의 프로젝트 가능성 문제
AI 벤치마크 결과는 일반적으로 단일 단계에서 중요한 주장을 도출하지 못하며, 평가자는 이를 다른 사례로 일반화하고 능력의 증거로 해석한다. 이 논문은 보증된 연결이 자동으로 보증된 연쇄를 형성하지 않는다는 문제를 제기하며, 관찰된 사례에서 관찰되지 않은 사례로의 확장이 정당한지를 논의한다. 또한, 인접한 투영에 대한 지원이 그들의 조합을 정당화하려면 끝점과 가정이 일치해야 한다고 주장한다. 법률 연구 사례를 통해 벤치마크 증거와 배포 연구가 각각 타당할 수 있지만 병렬적으로 유지될 수 있음을 보여준다.
강화학습(RL) 모델과 감독학습(SFT) 모델의 수학적 문제 해결 성능 차이 분석
강화학습(RL)로 훈련된 대규모 추론 모델이 감독학습(SFT) 모델보다 수학적 추론 작업에서 더 높은 성능을 보이는 이유를 분석하였다. 연구 결과, RL 모델은 더 높은 정확도로 정답 예측을 수행하며, 이는 더 선형적으로 분리 가능하고 구조화된 표현을 나타낸다. 또한, RL 모델은 계층적 구조를 발전시키며, 깊은 층이 점진적으로 더 중요해지는 반면, SFT 모델은 중요성을 균일하게 분배한다. 반복 샘플링에 따른 토큰 수 변동성을 분석한 결과, 일부 RL 모델에서 더 높은 변동성이 관찰되었지만, 다른 모델에서는 강한 일관성을 보였다.
EvoLib: 경험을 진화하는 지식으로 전환하는 프레임워크
EvoLib은 대규모 언어 모델이 추론 중에 자신의 경험으로부터 학습할 수 있도록 하는 자가 지도 학습 프레임워크이다. 이 시스템은 과거의 시도를 재사용 가능한 기술과 통찰력으로 변환하여 미래 작업에 적용할 수 있도록 한다. EvoLib은 모델 업데이트 없이 API를 통해 배포된 블랙박스 언어 모델 및 AI 시스템에 적용할 수 있으며, 기존 지식을 지속적으로 정제하고 통합하여 새로운 경험이 도착할 때마다 지식을 진화시킨다. 여러 도전적인 작업에서 EvoLib은 다른 메모리 접근 방식보다 더 효율적인 성능을 보여주었다.
고정된 랜덤 CNN 특징 추출기를 이용한 심층 강화 학습에서의 비상적 희소성
고정된 랜덤 초기화 CNN 특징 추출기를 사용한 심층 강화 학습 에이전트가 희소성을 유도하는 목표 없이도 극도로 희소한 완전 연결 표현을 자발적으로 개발한다. 첫 번째 완전 연결 층(FC1)에서 에이전트는 결정론적 Pong의 경우 64개 뉴런 중 1-3개, 확률적 Pong의 경우 5-11개 뉴런을 사용하여 작업 관련 정보를 압축한다. FC1의 희소성은 작업의 복잡성과 비례하며, 동일한 게임 내에서도 서로 다른 활성 뉴런 수를 보여준다. 또한, 활성 뉴런을 제거하면 성능이 급격히 저하된다. 마지막으로, 입력 차원이 본질적인 작업 차원보다 클 경우, 고정된 랜덤 투영에서의 경량 경량화는 기본 문제의 유효 순위를 드러낼 수 있다.
비제한 IR 분광학 데이터를 위한 데이터 융합 및 대조 정렬
자동화된 분자 구조 해석은 최근 몇 년간 발전했지만, 사전 결정된 화학 공식을 모델 입력으로 사용하는 데 한계가 있어 전체 분자 구조 예측이 어렵다. 본 연구에서는 전통적인 인코더-디코더 변환기를 수정하여 비제한 문제의 화학 공간을 더 잘 다루기 위해 Mixture-of-Experts (MoE) 디코더 모듈을 구현하고, 비가산 집계 방법을 도입했다. 이러한 개선을 통해 IR 전용 모델 대비 Top-K 예측 정확도를 10% 이상 향상시켰다. 또한, 적외선 스펙트럼이 화학 정보의 대부분을 인코딩한다는 점을 확인했다.
전통 공개키 알고리즘에서 포스트 양자 알고리즘으로의 전환
현재 우리는 EC 기반 암호화 및 RSA에 기반한 전통적인 공개키 알고리즘에서 새로운 포스트 양자 알고리즘으로의 역사적인 전환 중에 있다. HAWK와 같은 많은 표준이 고려되고 있으며, AI가 암호 분석 능력을 향상시킬 수 있는 최적의 시점이다. 이로 인해 우리가 식별한 문제에 대한 신뢰를 얻고, 암호 분석 문헌이 더욱 견고해질 수 있다.
동적 파라미터화는 동적 추론이 아니다
입력 의존적인 컨트롤러 계수는 종종 동적 추론이나 계산 절약의 증거로 간주된다. 그러나 이는 계수 변동, 고정 모델의 입력에 대한 의존성, 조건부 실행의 세 가지 속성을 혼동한다. 본 연구에서는 고정 컨트롤러 감사(Frozen-Controller Auditing, FCA)를 제안하며, 이는 완전한 계수 텐서를 캐시하고 컨트롤러를 비활성화한 후, 고정 모델을 재생하는 방법이다. 실험 결과, 76M FeatureGate Transformers와 504M 모델에서 정적 레이어 프로파일이 각각 98.70%와 99.43%의 성능 격차를 유지하며, 레이어 정체성이 계수 변동의 87%에서 96%를 설명한다. 그러나 FeatureGate는 모든 Transformer 블록을 실행하며, 측정된 추론 속도는 Dense보다 30.8% 느리다. MUDDPythia-1.4B 체크포인트에서 교차 입력 재배치와 토큰 셔플링은 각각 NLL을 1.9067과 2.9637 증가시킨다.
논문 내 주장 검증을 위한 프레임워크 소개
과학 논문의 제출량 증가로 인해 대형 언어 모델(LLM)을 활용한 동료 검토 지원에 대한 관심이 높아지고 있다. 기존의 자동화된 참신성 평가 방법은 논문의 주장된 기여를 이전 문헌과 비교하지만, 인간 검토자는 종종 방법론적 증거가 주장된 기여를 충분히 뒷받침하지 못한다고 지적한다. 이를 해결하기 위해, 본 연구에서는 논문 내 주장 검증(intra-paper claim verification) 프레임워크를 소개하며, 이는 논문에서 제시된 참신성 주장이 사용된 방법론에 의해 뒷받침되는지를 평가한다. 이 프레임워크는 LLM을 사용하여 서론에서 참신성 주장을 추출하고, 관련된 방법론적 증거를 검색하며, 방법이 주장된 기여를 뒷받침하는지를 평가한다. 평가 기준은 182개의 ICLR 2025 논문에서 수집된 인간 동료 검토를 통해 유도된 기준을 바탕으로 한다.
AI/ML 인지 시스템이 레이더 및 전자전 재정의
모드-민첩한 위협이 정적 라이브러리 레이더 및 전자전 시스템에 도전하는 방식과 AI/ML 인지 아키텍처가 적응형 실시간 대응책을 가능하게 하는 방법을 다룬다. 전통적인 위협 데이터베이스에 맞지 않는 예기치 않은 주파수와 변조 기법을 사용하는 위협에 대해, AI/ML 기술이 자율적인 위협 분류, 신호 분리 및 실시간 대응책 생성을 지원하는 역할을 설명한다. 인지 레이더/전자전 시스템의 아키텍처와 RF 수집, 탐색 및 추적, AI/ML 신호 분석, 파형 합성 및 RF 생성의 기능 블록을 검토한다. HIL/SIL 시스템을 사용한 인지 AI/ML 알고리즘의 훈련 및 검증 방법도 소개된다.
Hillel Wayne과의 대화: 형식적 방법론과 소프트웨어 엔지니어링
Hillel Wayne은 형식적 방법론 컨설턴트이자 교육자로, 소프트웨어 공학과 전통 공학의 유사점과 차이점을 연구했다. 그는 TLA+라는 형식적 명세 언어를 소개하며, 이 언어가 시스템 설계 및 검증에 어떻게 사용되는지를 설명했다. Amazon은 TLA+를 사용하여 복잡한 버그를 발견했으며, 이는 기존의 테스트 방법으로는 찾기 어려운 문제였다. Hillel은 대부분의 엔지니어가 속성 기반 테스트를 채택하고, 형식적 검증은 특정한 경우에만 사용하는 것이 바람직하다고 언급했다.
Siobahn Day Grady, NCCU에서 AI 연구소 설립
Siobahn Day Grady는 2025년 1월, 역사적으로 흑인 대학인 노스캐롤라이나 중앙대학교(NCCU)에서 첫 번째 AI 연구소인 인공지능 및 신흥 연구소(IAIER)를 설립했다. 이 연구소는 학생과 교수들이 AI로 변화하는 노동 시장에 필요한 기술을 개발하도록 돕는 것을 목표로 한다. NCCU는 현재 전용 컴퓨터 과학 프로그램이 없지만 AI 부전공을 개발 중이다. IAIER는 100만 달러의 Google.org 기금을 지원받아 2,800명 이상의 학생과 교수, 지역 주민을 참여시키고 있다.
AI가 디지털 불평등을 심화시키고 있다
인공지능(AI)은 이메일 작성, 소프트웨어 코드 작성, 채용 지원서 필터링, 추천 시스템 등 다양한 분야에 통합되고 있다. 그러나 AI의 발전은 디지털 포용성과 디지털 리터러시의 격차를 더욱 확대하고 있으며, 미국은 2023년 전 세계 클라우드 컴퓨팅 및 데이터 저장 서비스의 약 87%를 차지하고 있다. OECD 국가에서는 성인 약 40%만이 기본적인 디지털 문제 해결 능력을 보유하고 있으며, AI 관련 교육 참여는 교육 수준에 따라 크게 차별화되고 있다.
프론티어 AI 연구원 1,224명, AI 개발 속도 조절 요청 공개서
프론티어 AI 기업의 1,224명 직원이 서명한 공개서가 발표되었다. 이들은 AI 연구 자동화가 가까워지고 있으며, 그에 따른 위험을 관리할 수 있는 기술 및 거버넌스 도구가 필요하다고 주장했다. OpenAI와 Anthropic이 이 공개서를 지지하며, AI 발전 속도를 조절할 수 있는 기구를 마련할 필요성을 강조했다.
CLEF 2026 CheckThat! Task 2의 LLM 기반 수치 주장 검증 시스템
이 논문은 CLEF 2026 CheckThat! Task 2를 위한 시스템을 설명하며, 대형 언어 모델(LLM)을 사용해 영어와 아랍어의 수치 주장을 검증하는 방법을 다룬다. 첫 번째 접근법은 LoRA를 사용해 LLM 기반 검증기를 미세 조정하고, 각 추론 경로를 독립적으로 이진 분류 문제로 점수화한 후 Best-of-N 선택을 통해 최종 판결을 결정한다. 두 번째 접근법은 경량 TF-IDF 보상 모델을 사용해 수치 및 시간적 중첩 특성을 수작업으로 추가하고, 판결 그룹별로 점수를 집계해 최종 예측을 한다. 아랍어에 대해서는 일반 다국어 모델과 아랍어 텍스트로 사전 훈련된 AraBERT를 비교한 결과, LLM 기반 접근법이 대부분의 지표에서 더 우수한 성능을 보였다.
교통 흐름 예측을 위한 Attention 기반 공간-시간 융합 그래프 컨볼루션 네트워크
교통 흐름 예측은 교통 시스템 최적화와 도시 이동성 향상에 중요하다. 기존의 그래프 컨볼루션 기반 모델들은 공간-시간 및 의미적 상관관계에 집중하지만, 인접 노드 간 정보 전파 지연을 간과하고, 복잡한 구조를 쌓아 모델 훈련 시 계산 시간이 증가하는 문제를 가지고 있다. 본 논문에서는 Attention-Based Spatial-Temporal Fusion Graph Convolution Network (A-STFGCN)이라는 새로운 네트워크를 제안하며, 전파 지연 오류를 제거한 공간-시간 융합 블록을 설계하여 데이터의 장기 및 단기 시간적 특성을 포착한다. 다섯 개의 실제 데이터셋에서 광범위한 실험을 통해 제안된 방법이 여덟 개의 기준 방법에 비해 최상의 성능을 달성함을 보였다.
CaRE: Masked Diffusion Language Models의 평가 프로토콜
Masked diffusion language models(MDLMs)의 평가 기준이 발전 속도를 해석하는 데 부족함을 드러내고 있다. CaRE는 MDLM 리마스킹 전략을 감사하는 컴퓨트 인식 평가 프레임워크로, 실제 함수 평가 수(NFE)를 표준화하고, 다중 메트릭 보고를 강제하며, 확률성을 명시적으로 제어한다. 7개의 리마스킹 전략을 LLaDA-8B-Base와 Dream-7B-Base에서 4개의 확률성 수준과 3개의 단계 예산으로 적용한 결과, 온도가 MAUVE 변동의 대부분을 설명하고, 컴퓨트 일치 비교가 여러 발표된 전략 순위를 뒤집으며, 고엔트로피 리마스킹이 MAUVE를 감소시키는 경향이 있음을 보여준다. 이 평가 프로토콜과 리더보드는 향후 리마스킹 주장의 재현성과 비교 가능성을 보장하기 위해 공개된다.
LLM 에이전트를 위한 이질적 협업 지식 작업을 위한 템플릿 기반 메모리
연구 프로젝트와 교육 노력은 미래의 협력자가 복구하기 어려운 발견과 결정을 축적한다. LLM 코딩 에이전트는 세션 간 지속적인 메모리를 가지지 않으며, llm-wiki 패턴은 원본과 에이전트 사이에 LLM이 유지하는 상호 연결된 위키를 삽입하여 이 문제를 해결한다. llm-wiki-memory-template는 재사용 가능한 에이전트 인식 구현체로, 다중 인간, 다중 AI 에이전트, 다중 도메인이라는 세 가지 축을 통해 이질적 협업 지식 작업을 지원한다. 위키는 추가 전용으로, 실패한 결과와 성공한 결과를 함께 보존하여 출판물과 코드 공유에서 구조적으로 해결할 수 없는 부정적 결과 손실 문제를 해결한다. 세 가지 사례 연구는 각각의 축을 다루며, 실패 경로 보존, 에이전트의 정직성, 적절한 사용을 주요 속성으로 제시한다.
FinAbstain: 불확실성 보정 다중 모달 RAG를 활용한 선택적 금융 예측
FinAbstain은 불확실성 보정 다중 모달 검색 증강 생성(RAG) 프레임워크로, 예측 시점에 공개된 정보만을 사용하여 기본, 뉴스, 기술, 위험 및 검증 에이전트에 모달리티별 증거를 제공합니다. 이 프레임워크는 불확실성이 검증된 임계값 이하일 때만 상승, 하락 또는 중립 결과를 예측하며, 그렇지 않을 경우 증거 요청, 노출 감소 또는 인간 검토로 경로를 변경합니다. 평가에는 비정상 수익 방향, 변동성 간격 및 abstention 결정이 포함되며, 정확도, 보정, 위험-커버리지 등의 메트릭을 사용합니다.