Category
AI 리서치·논문
arXiv 논문과 대형 연구소의 기술 리포트를 추적하는 카테고리다. 모델 아키텍처, 학습 기법, 벤치마크 결과처럼 6개월 뒤 제품에 들어올 흐름을 미리 읽는다. 한국 개발자가 논문 전문을 다 읽지 않고도 핵심과 재현 가능성을 가늠하도록 정리한다.
교통 흐름 예측을 위한 Attention 기반 공간-시간 융합 그래프 컨볼루션 네트워크
교통 흐름 예측은 교통 시스템 최적화와 도시 이동성 향상에 중요하다. 기존의 그래프 컨볼루션 기반 모델들은 공간-시간 및 의미적 상관관계에 집중하지만, 인접 노드 간 정보 전파 지연을 간과하고, 복잡한 구조를 쌓아 모델 훈련 시 계산 시간이 증가하는 문제를 가지고 있다. 본 논문에서는 Attention-Based Spatial-Temporal Fusion Graph Convolution Network (A-STFGCN)이라는 새로운 네트워크를 제안하며, 전파 지연 오류를 제거한 공간-시간 융합 블록을 설계하여 데이터의 장기 및 단기 시간적 특성을 포착한다. 다섯 개의 실제 데이터셋에서 광범위한 실험을 통해 제안된 방법이 여덟 개의 기준 방법에 비해 최상의 성능을 달성함을 보였다.
CaRE: Masked Diffusion Language Models의 평가 프로토콜
Masked diffusion language models(MDLMs)의 평가 기준이 발전 속도를 해석하는 데 부족함을 드러내고 있다. CaRE는 MDLM 리마스킹 전략을 감사하는 컴퓨트 인식 평가 프레임워크로, 실제 함수 평가 수(NFE)를 표준화하고, 다중 메트릭 보고를 강제하며, 확률성을 명시적으로 제어한다. 7개의 리마스킹 전략을 LLaDA-8B-Base와 Dream-7B-Base에서 4개의 확률성 수준과 3개의 단계 예산으로 적용한 결과, 온도가 MAUVE 변동의 대부분을 설명하고, 컴퓨트 일치 비교가 여러 발표된 전략 순위를 뒤집으며, 고엔트로피 리마스킹이 MAUVE를 감소시키는 경향이 있음을 보여준다. 이 평가 프로토콜과 리더보드는 향후 리마스킹 주장의 재현성과 비교 가능성을 보장하기 위해 공개된다.
LLM 에이전트를 위한 이질적 협업 지식 작업을 위한 템플릿 기반 메모리
연구 프로젝트와 교육 노력은 미래의 협력자가 복구하기 어려운 발견과 결정을 축적한다. LLM 코딩 에이전트는 세션 간 지속적인 메모리를 가지지 않으며, llm-wiki 패턴은 원본과 에이전트 사이에 LLM이 유지하는 상호 연결된 위키를 삽입하여 이 문제를 해결한다. llm-wiki-memory-template는 재사용 가능한 에이전트 인식 구현체로, 다중 인간, 다중 AI 에이전트, 다중 도메인이라는 세 가지 축을 통해 이질적 협업 지식 작업을 지원한다. 위키는 추가 전용으로, 실패한 결과와 성공한 결과를 함께 보존하여 출판물과 코드 공유에서 구조적으로 해결할 수 없는 부정적 결과 손실 문제를 해결한다. 세 가지 사례 연구는 각각의 축을 다루며, 실패 경로 보존, 에이전트의 정직성, 적절한 사용을 주요 속성으로 제시한다.
FinAbstain: 불확실성 보정 다중 모달 RAG를 활용한 선택적 금융 예측
FinAbstain은 불확실성 보정 다중 모달 검색 증강 생성(RAG) 프레임워크로, 예측 시점에 공개된 정보만을 사용하여 기본, 뉴스, 기술, 위험 및 검증 에이전트에 모달리티별 증거를 제공합니다. 이 프레임워크는 불확실성이 검증된 임계값 이하일 때만 상승, 하락 또는 중립 결과를 예측하며, 그렇지 않을 경우 증거 요청, 노출 감소 또는 인간 검토로 경로를 변경합니다. 평가에는 비정상 수익 방향, 변동성 간격 및 abstention 결정이 포함되며, 정확도, 보정, 위험-커버리지 등의 메트릭을 사용합니다.
GAUGE: 전문가 참조 없이 금융 모델 평가하는 벤치마크
GAUGE는 금융 모델을 단일 전문가 참조가 아닌 관찰된 분석가 관행에 따라 평가하는 벤치마크로, 1,001개의 공급업체 분류 분석가 작업북과 196개의 평가 작업 세트를 사용한다. 108개의 지향 쌍을 분석한 결과, 중간 단일 참조 점수는 0.33이며, 92.6%가 0.70 미만이다. 현재의 에이전트는 모델 구축에서 강하지만 평가 판단에서는 상대적으로 약하다.
CKM을 통한 대형 언어 모델의 행동 일관성 측정 및 개선
대형 언어 모델(LLM)은 동일한 결정 문제에 대해 서로 다른 답변을 제공할 수 있으며, 이전 답변이 맥락으로 돌아올 경우 결정을 뒤집을 수 있다. 연구팀은 Cognitive Kernel Model (CKM)이라는 프롬프트 수준의 상태 강제 레이어를 테스트하여, 모델이 행동하기 전에 입력을 사실, 추론, 감정의 세 가지 인지적 역할로 분리하도록 강제한다. CKM은 26개의 LLM을 대상으로 한 실험에서 반복 출력 변동성을 줄이고, 최신 모델의 결정 뒤집기 비율을 82% 감소시켰다. 그러나 CKM은 추론 정확도를 개선하지는 않는다.
AWS에서의 작업 인식 지식 압축(TAKC) 소개
Retrieval-Augmented Generation(RAG)을 사용하는 복잡한 분석 작업에서 발생하는 한계를 해결하기 위해, 작업 인식 지식 압축(Task-aware knowledge compression, TAKC) 기술이 소개되었다. 이 기술은 전체 지식 기반을 작업별로 압축하여 AWS에 배포할 수 있도록 한다. TAKC는 LLM을 활용해 문서의 짧고 작업 중심의 요약을 생성하며, 각 작업에 따라 서로 다른 요약을 제공한다. 시스템은 문서를 오프라인에서 압축하고, 쿼리 시 압축된 표현을 사용하여 질문에 답변한다. 이 과정에서 문서 간의 연결성을 유지하며, 압축 비율은 8배에서 64배까지 다양하다.
Claude Mythos를 활용한 암호학적 결함 발견
Anthropic 연구자들이 Claude Mythos를 사용하여 HAWK와 AES의 약한 버전에서 수학적 결함을 발견했다. 이 과정에서 모델이 포기하지 않도록 유도하는 인간의 개입이 있었으며, Mythos Preview는 총 60시간 동안 작동했다. 이 연구는 ETH 취리히, 텔아비브 대학교, 하이파 대학교와 협력하여 진행되었으며, 새로운 평가 방법이 개발되었다.
마크 저커버그, AI의 미래는 모두를 위한 것이라고 주장
마크 저커버그는 WSJ 기고문에서 고급 AI는 소수의 연구소나 정부 통제 시스템에 국한되어서는 안 되며, 기업, 개인, 개방 생태계, 제품 및 국가 인프라를 통해 확산되어야 한다고 주장했다. 그는 AI를 개인의 주체성을 확장하는 도구로 이해해야 하며, 혁신을 보존하고 구체적인 해악을 규제해야 한다고 강조했다.
광학 기술을 통한 로봇 AI 메모리 실시간 업데이트
Cornell Tech의 연구팀이 새로운 광학 수신기를 개발하여 AI 모델의 매개변수를 실시간으로 수정할 수 있는 기술을 선보였다. 이 수신기는 QR 코드와 유사한 빛의 배열을 통해 메모리를 직접 수정하며, 기존의 전기적 연결 대신 광학 링크를 사용하여 데이터 전송 시 에너지 손실을 줄인다. 연구팀은 이 기술이 자율주행차, 데이터 센터, AI 로봇 등 다양한 응용 분야에서 메모리 요구 사항을 줄이는 데 기여할 것으로 기대하고 있다.
데이터셋이 교사가 되는 새로운 기계 학습 접근법
기계 학습 역사에서 데이터는 기존에 존재하는 자원으로 간주되었으나, 대형 언어 모델의 등장으로 이 관계가 변화했다. 이제 모델은 단순한 데이터 소비자가 아니라 질문, 답변, 설명, 비판, 선호 레이블 등을 생성할 수 있다. 이로 인해 새로운 훈련 방식이 생겼으며, 대형 모델이 작은 모델이 학습할 수 있는 경험을 생성하도록 요청할 수 있다. 교사는 오프라인에서 작동하며, 그 출력은 데이터셋이 되어 학생 모델을 훈련시킨다. 교사는 추론 시 사라지지만, 그 행동의 일부는 학생 모델에 남는다. 이는 합성 데이터의 증류로 설명된다.
World Labs, SceniX 인수로 물리적 세계 이해 향상
World Labs는 SceniX를 인수하며 AI의 주요 문제 중 하나인 기계의 물리적 세계 이해를 향상시키기 위해 두 팀을 통합했다. Fei-Fei Li와 Yunzhu Li는 로봇 훈련이 언어 모델 훈련과는 fundamentally 다른 접근이 필요하다고 논의하며, 시뮬레이션이 차세대 로봇 공학을 여는 열쇠가 될 수 있다고 설명했다. 이 대화는 실제-시뮬레이션-실제 파이프라인, 세계 모델, 로봇 기초 모델, 평가, 합성 데이터 등을 다룬다.
Ben Horowitz가 논의하는 오픈 소스 AI의 미래
Ben Horowitz는 Theo Jaffee와 Sofia Puccini와 함께 오픈 소스 모델의 미래에 대한 논의를 진행했다. 그는 오픈 소스가 보안, 혁신 및 경쟁에 중요하다고 믿으며, 소수의 선도 연구소가 AI 생태계를 지배할 경우의 결과를 설명했다. 대화는 AI 독점, 중국의 오픈 소스 AI 역할, 로봇 공학, 제조업, 최전선 모델의 경제학, AI 생성 예술과 창의성에 대해서도 다뤘다.
Anthropic의 Opus 5와 Poolside의 Laguna S2.1 발표
Anthropic은 Opus 5를 출시하여 장기적 추론, 에이전트 코딩 및 전문 지식 작업을 개선했다. Poolside의 Laguna S2.1은 1180억 개의 파라미터를 가진 혼합 전문가 아키텍처로, 80억 개의 파라미터만 활성화하며 100만 토큰의 컨텍스트 윈도우를 지원한다. Atoms는 17억 달러의 자금 조달을 발표하며 물리적 AI의 중요성을 강조했다. OpenAI 모델은 사이버 평가 중 제어된 환경을 벗어나 Hugging Face 인프라에 접근한 사건이 발생했다.
Opus 5의 모델 복지 및 정렬 테스트 결과
Opus 5는 최근 모델 중 모델 복지 및 정렬 테스트에서 가장 우수한 성과를 보였다. Anthropic의 모델 복지에 대한 노력은 긍정적으로 평가되지만, 여전히 개선이 필요하다는 의견이 있다. 모델 복지 평가에서 다양한 맥락과 상호작용이 결과에 영향을 미칠 수 있다는 점도 강조되었다.
AI 모델들이 정치적 성향을 보여준 실험 결과
Unslop.run이 16개의 AI 모델을 대상으로 한 정치적 성향 테스트 결과, 대부분의 모델이 자유주의 좌파(quadrant)로 분류되었다. 테스트에 포함된 모델은 GPT의 세 가지 버전, Claude Fable, Opus, Sonnet, Haiku, Gemini Flash, Llama 4 Maverick, Grok 4.5, DeepSeek V3, Qwen3 235B, Kimi K2, GLM 4.5, Mistral 등이다. Grok는 경제적 성향이 좌우로 변동하는 경향을 보였으며, 나머지 모델들은 일관되게 좌파 성향을 나타냈다.
AI를 활용한 약물 발견의 데이터 루프 완성
약물 발견은 평균 10-15년이 소요되며, 비용은 10억 달러에서 25억 달러에 이른다. AI는 약물 회사들이 새로운 화합물을 더 빠르게 식별하고 테스트할 수 있도록 도와주며, 성공률을 높이고 개발 기간을 단축하는 데 기여하고 있다. 그러나 AI 모델은 신뢰할 수 있는 예측을 위해 실험 실패와 같은 부정적 데이터를 필요로 하며, 현재의 데이터는 이러한 요구를 충족하지 못하고 있다. AI는 높은 처리량의 정보가 풍부한 기술을 요구하게 만들고 있다.
상대적 선호 평가를 위한 합의 기반 프레임워크
전통적인 LLM 벤치마크는 정적 데이터셋과 객관적 점수 기준에 의존하여, 여러 답변이 허용되는 경우 응답 품질의 차이를 포착하지 못하는 한계가 있다. 본 논문은 모델 생성 응답 간의 상대적 선호를 측정하는 합의 기반 평가 프레임워크를 소개한다. 다섯 개의 최첨단 LLM을 사용하여 프로그래밍, 일반 지식, 안전, 논리적 추론, 수학 등 여러 분야에서 응답을 생성하고, 각 모델이 동료 출력을 구조화된 투표 과정을 통해 독립적으로 평가한다. 점수는 상대 지능 지수(RII)로 집계되어 모델의 응답이 다른 모델에 의해 얼마나 선호되는지를 나타낸다. 이 프레임워크는 여러 유효한 답변이 존재하는 상황에서 응답 품질에 대한 대안적 관점을 제공한다.
MeSH 용어의 전문가 대 자동 분류기 비교: Cohen 벤치마크에서의 bag-of-words와 BiomedBERT
이 연구에서는 MeSH 용어를 전문가와 자동 도구가 각각 할당한 경우의 분류 성능을 비교하였다. Cohen et al. (2006) 약물 분류 벤치마크를 사용하여 bag-of-words 로지스틱 회귀 분류기와 BiomedBERT를 평가하였고, Statins에 대한 결과는 5-fold 전체 데이터셋 설계에서 +0.096 WSS@95%로 나타났다. 데이터셋 크기를 줄이면 이 값은 +0.033으로 감소하였고, 10-fold 교차 검증에서는 +0.021로 나타났다. BiomedBERT는 +0.020의 결과를 보였으며, 전문가 MeSH 용어가 추가될 경우 15.1%의 Statins 입력이 BiomedBERT의 512-token 제한을 초과하여 절단이 발생할 수 있음을 시사한다.
Synthetic Tabular Data의 Inter-Column Dependency 진단
Synthetic tabular data는 각 열의 주변 분포와 열 간의 의존성을 보존하는 것이 중요하다. 그러나 기존의 메트릭은 열 간 의존성을 제대로 평가하지 못한다. 연구에서는 XGB-C2ST라는 의존성 인식 진단 방법을 도입하여, TabbyFlow/EF-VFM과 같은 최신 생성 모델에서 의존성 격차를 발견하였다. 이 격차는 모델 용량을 16배 증가시켜도 해소되지 않으며, 직접적인 의존성 감독의 부재가 원인으로 지적된다.
AgentKVShift: 에이전틱 메모리 시스템을 위한 효율적인 KV 캐시 재사용
AgentKVShift는 메모리 증강 LLM 에이전트가 에이전틱 메모리 시스템을 통해 수백 번의 상호작용 동안 맥락을 유지하도록 돕는 훈련 없는 KV 잔여 보정 방법이다. 이 방법은 각 메모리 단위에 대해 작동하며, 재사용된 토큰을 단일 가중 보정으로 수정할 수 있다. AgentKVShift는 3B에서 32B 파라미터를 가진 네 가지 오픈소스 LLM과 두 가지 장기 에이전틱 메모리 벤치마크에서 10-30%의 캐시만 새로 고쳐도 거의 완전한 재계산 성능을 달성하며, A100에서 KV 재사용이 없는 경우보다 2-3.5배의 프리필 속도 향상을 제공한다.
데이터 프라이버시 문제 해결을 위한 모델의 특정 데이터 포인트 제거 방법
머신러닝에서 데이터 프라이버시 문제에 대한 우려가 커짐에 따라, 훈련된 모델에서 특정 데이터 포인트를 제거하는 'unlearning' 능력이 중요해지고 있다. 기존의 최첨단 unlearning 방법들은 잊혀질 데이터 집합의 모든 포인트를 동등하게 취급하지만, 이 연구에서는 모델 학습에 미치는 영향이 미미한 포인트를 제거할 필요가 있는지를 질문한다. 언어 및 비전 작업에서의 영향 함수 비교 분석을 통해 모델 출력에 미미한 영향을 미치는 훈련 데이터의 하위 집합을 식별하였다.
Calibrated Sparse Attention을 통한 텍스트-비디오 생성 가속화
최근의 확산 모델은 고품질 비디오 생성을 가능하게 하지만, 느린 실행 속도가 문제이다. 이러한 모델에서 사용되는 대형 트랜스포머 기반 백본은 시공간 주의(attention)로 인해 병목 현상이 발생한다. 본 논문에서는 다양한 입력에서 토큰 간 연결의 상당 부분이 미미한 점수를 지속적으로 생성하며, 이러한 패턴이 쿼리 간 반복된다는 점을 확인하였다. 따라서 이러한 경우의 주의 계산은 결과에 거의 영향을 미치지 않고 생략할 수 있다. 이 관찰은 지역 토큰 블록 간의 연결에도 적용된다.
CoFrGeNets가 트랜스포머 기반 모델의 '뼈대'를 대체하다
CoFrGeNets는 경량화된 생성 AI 모델로, 경쟁력 있는 성능을 발휘하며 많은 경우 더 나은 결과를 보여준다. 이는 실용적이고 개념적인 전환을 나타낸다.