Category
AI 리서치·논문
arXiv 논문과 대형 연구소의 기술 리포트를 추적하는 카테고리다. 모델 아키텍처, 학습 기법, 벤치마크 결과처럼 6개월 뒤 제품에 들어올 흐름을 미리 읽는다. 한국 개발자가 논문 전문을 다 읽지 않고도 핵심과 재현 가능성을 가늠하도록 정리한다.
D2PO: 동적 선호 최적화를 통한 확산 샘플러 최적화
D2PO(Dynamic Direct Preference Optimization)는 시간 단계 일정과 분류기 없는 가이드(CFG) 가중치에 따라 확산 샘플링 정책을 최적화하기 위한 프레임워크이다. 기존의 학생-교사 회귀 프레임워크의 한계를 해결하기 위해, D2PO는 샘플러 최적화를 선호 기반 정렬 문제로 재구성하고, 에너지 기반 모델(EBM)을 사용하여 선호 비교를 처리한다. 또한, 동적 선호를 도입하여 샘플링 정책이 학습됨에 따라 선호 샘플이 점진적으로 개선되도록 한다. 실험 결과, D2PO는 감각 품질과 더 잘 정렬되어 기존 회귀 기반 스케줄러보다 일관되게 우수한 성능을 보인다.
DeepSeek V3.2를 활용한 ARC-AGI-1의 비용 효율적 추론 모델
ARC-AGI-1에 대한 연구에서 DeepSeek V3.2라는 오픈-웨이트 모델을 사용하여, ARC-specific fine-tuning 없이도 패턴 발견과 프로그램 합성을 분리한 Explorer-Definer Pipeline을 도입하였다. 이 파이프라인은 400-task 평가 세트에서 57.50%의 pass@2를 기록하며, Reflective Orchestrator를 통해 67.25%의 pass@2를 달성하였다. 이 구조는 15.50%의 원샷 기준을 약 52포인트 향상시켰으며, 생성 기반의 성능 향상을 위한 재탐색을 통해 pass@1을 +9.81 pp 증가시켰다.
TriRoute: 조건부 계산을 통한 언어 모델 최적화
TriRoute는 언어 모델의 품질과 토큰당 추론 비용을 분리할 수 있는 조건부 계산 기법을 제안한다. 이 시스템은 주의 모드, 희소 FFN 전문가 집합, KV-cache 비트 폭을 조정하는 단일 경량 컨트롤러를 사용하여 각 토큰에 대해 조정된 정책을 생성한다. TriRoute는 160M에서 1.3B 파라미터의 디코더 전용 모델에서 MoD, MoE, KV-양자화의 조합보다 더 나은 성능을 보이며, 희귀 개체와 코드, 산술 문제에 대한 강인성을 유지한다.
Retrieval-Augmented Generation을 통한 공공 건강 질문 응답 개선
대형 언어 모델(LLMs)은 의료 질문 응답 벤치마크에서 유망한 결과를 보이지만, 공공 건강 분야에서의 사용은 허위 정보와 공식 지침의 빠른 변화로 제한된다. Retrieval-Augmented Generation(RAG)은 명시적으로 유지되는 코퍼스를 기반으로 응답을 강화하여 이러한 위험을 완화한다. 연구에서는 7,929개의 질문으로 구성된 PubHealthBench를 RAG 환경으로 확장하고, 다양한 임베딩 모델과 코퍼스 변형을 통해 밀집형, 희소형, 하이브리드 검색을 비교하였다. 하이브리드 검색은 일관되게 회수 및 순위 품질을 개선하며, 검색된 맥락을 제공하면 다양한 LLM에서 다중 선택 정확도가 크게 증가한다. 또한, LLM을 평가하기 위한 기준을 도입하여 신뢰성, 완전성, 명확성 및 사실 일관성을 검증하였다.
Meta Superintelligence, 세계 최고의 이미지/비디오 모델 보유
Meta Superintelligence가 세계에서 가장 뛰어난 2/3의 이미지 및 비디오 모델을 보유하고 있다는 소식이 전해졌다. Muse Image/Video에 대한 구체적인 기술 세부사항은 없지만, 이는 지난달 Microsoft MAI 모델보다 우수한 성과로 평가된다. Lilian Weng은 최근 포스트에서 하네스와 재귀적 자기 개선(RSI)의 관계를 논의하며, 하네스 엔지니어링이 자기 개선 및 자동 연구를 가능하게 할 것이라고 전망했다.
GraphRAG와 BYOKG를 통한 제약 연구의 데이터 통합
제약 연구에서 연구자들은 분산된 시스템에 흩어져 있는 방대한 과학 지식에 접근하고 연결하는 데 어려움을 겪고 있다. 초기 약물 발견에서 전통적인 방법의 성공률은 5%에 불과하며, 초기 스크리닝에는 6개월 이상 소요된다. Amazon Neptune Analytics를 활용한 GraphRAG는 연구자들이 자연어로 복잡한 질문을 하고 통합된 지식 그래프에서 즉각적인 증거 기반 통찰을 얻을 수 있도록 지원한다. 이 접근 방식은 연구자들이 정보 검색을 넘어 추론을 증폭하고, 기관의 기억을 보존하며, 숨겨진 통찰을 드러내는 데 도움을 준다.
ConlangCrafter, AI를 활용한 새로운 언어 생성
ConlangCrafter는 새로운 언어를 생성할 수 있는 AI 모델로, 2023년 6월 27일 발표된 논문에서 다양한 규칙을 준수하는 새로운 언어를 개발할 수 있음을 보고했다. 이 모델은 언어의 소리 구성(음운론), 단어와 문장 구조의 관계(형태통사론), 어휘 등 다양한 언어학적 규칙을 적용할 수 있으며, 무작위 숫자 생성기를 통해 매번 다른 언어를 만들어낸다. ConlangCrafter는 일반적인 LLM보다 약 두 배 더 다양한 언어를 생성하고, 70% 더 일관된 결과를 보여준다.
AI 모델의 과도한 사고가 보안 위험을 초래한다
대형 언어 모델(LLMs)은 문제를 단계별로 사고하는 능력 덕분에 더 복잡한 작업을 수행할 수 있게 되었지만, 이로 인해 공격자가 시스템을 느리게 만들 수 있는 취약점이 생겼다. 연구자들은 비논리적인 프롬프트를 사용해 모델이 과도하게 사고하도록 유도할 수 있는 방법을 개발했으며, 이로 인해 상업적 AI 모델에 대한 서비스 거부 공격이 가능해졌다. 이 연구는 DeepSeek-R1, Alibaba의 Qwen3-Thinking, OpenAI의 GPT-o3, Google의 Gemini 2.5 Flash 모델에서 효과적이었으며, 출력 길이가 최대 26배 증가하는 결과를 보였다.
J-space: 언어 모델의 글로벌 작업 공간으로서의 역할
Anthropic의 논문에서는 'J-space'라는 개념을 소개하며, 이는 언어 모델에서 의식적 추론을 가능하게 하는 '의식 접근' 영역이다. J-space는 Jacobian Lens라는 해석 가능성 기법에 기반하여 각 레이어에서 잔여 스트림의 변화가 모델의 출력에 미치는 평균 인과 효과를 계산한다. J-space는 모델의 내부 추론 개념을 포함하고 있으며, J-space 내에서 개념을 교환하면 출력이 변화하는 반면, J-space 외부의 요소는 출력에 영향을 미치지 않는다. J-space는 모델의 여러 프로세스에 방송되며, 이로 인해 모델의 사고 과정을 드러내는 데 활용될 수 있다.
Claude Sonnet 5 출시 및 AI 정책 관련 논의
미국의 100개 이상의 기관이 Mythos를 다시 확보했으나, Fable과 Sol은 여전히 대기 중이다. Claude Sonnet 5가 출시되었으며, 이는 Opus 4.8의 더 저렴하고 빠른 버전으로 소개되었다. 이번 주에는 Mythos Moment와 관련된 정책 논의 및 AI 사고 보고법(AI Incident Reporting Act)과 같은 새로운 법안도 언급되었다.
AI 아키텍처의 기초 요소와 IT 리더의 역할
AI 기술의 발전과 에이전트 시스템으로의 전환에 따라 조직들은 다양한 사용 사례를 확대하고 있다. AI 아키텍처의 기초 요소는 신뢰할 수 있는 통합 AI 시스템을 배포하고 관리하는 데 필요한 구조적 프레임워크를 제공한다. 데이터 품질은 AI의 성공에 중요한 요소로, 효과적인 AI 전략은 조직 전반에 걸쳐 데이터를 연결하고 실시간으로 접근 가능하도록 하는 데서 시작된다. 또한, 컨텍스트 엔지니어링은 AI 쿼리에 적합한 데이터를 제공하는 데 필수적이며, 강력한 거버넌스와 LLM 관찰 가능성은 AI 시스템의 데이터 사용을 통제하고 성능을 모니터링하는 데 필요하다.
AI 연구 자동화 이후 기술 발전에 대한 논의 부족
AI 연구가 자동화되면 AI가 인간 전문가보다 빠르게 발전하여 새로운 기술을 개발할 것이라는 주장이 있다. 그러나 특정 기술 개발의 난이도에 대한 논의는 부족하다. 연구자들은 구체적인 기술을 선택하고 AI의 능력에 대한 가정을 세운 후, 해당 기술 개발에 필요한 시간과 자원을 추정하는 새로운 연구 방향을 제안하고 있다.
Federated Learning을 활용한 드론의 객체 탐지
객체 탐지는 재난 대응, 운영 보안, 인프라 모니터링 및 방어 애플리케이션을 포함한 드론 및 엣지 비전 시스템에서 중요한 기능이다. 그러나 고성능 탐지기를 훈련하기 위해서는 대규모의 지속적으로 업데이트되는 데이터셋이 필요하며, 이는 데이터 중앙화로 인해 프라이버시 및 규제 문제를 야기한다. 본 연구에서는 Federated Learning(FL)을 적용하여 드론이 이미지 데이터를 로컬에 유지하면서 공유 모델을 개선할 수 있도록 하였다. Sherpa.ai FL 플랫폼을 사용하여 KIIT-MiTA 데이터셋에서 연합 객체 탐지 파이프라인을 구현하고, 단일 드론 및 중앙 집중식 기준선과 비교하였다. 실험 결과, 제안된 FL 접근 방식은 중앙 집중식 훈련에 근접하면서도 단일 드론 훈련에 비해 크게 개선된 성능을 보였으며, 가장 경량화된 모델인 YOLO26 nano는 mAP@0.50에서 52.89%, mAP@0.50:0.95에서 67.80%의 상대적 향상을 기록하였다.
내부 다원성과 쌍대 비교의 한계
로컬 쌍대 비교는 사람들이 원하는 의사 결정 규칙을 학습하는 데 사용되는 도구이다. 그러나 이 방법은 두 가지 강한 가정을 내포하고 있다. 첫째, 로컬 비교가 자동화된 의사 결정 규칙의 행동을 결정하는 데 충분한 증거라는 것과, 둘째, 사람들이 항상 이러한 비교에 대해 결정적으로 대답할 수 있다는 것이다. 내부 다원성의 개념 아래에서 이러한 가정이 어떻게 타협될 수 있는지를 조사하며, 의사 결정 규칙에 대한 다원적 선호를 형식적으로 모델링한다. 이 모델은 강하게 고수된 우선순위 간의 긴장이 내부 갈등을 생성할 수 있음을 보여준다. 또한, 사람들이 결정을 내리지 못한 상태를 보고할 수 있도록 허용하는 대안을 사용하여, 선호를 정확하게 학습하는 데 필요한 쿼리 수를 상당히 줄일 수 있음을 발견하였다.
ASK+ 모델을 통한 불확실성 기반 LLM 지원 개선
강화 학습 에이전트는 불완전한 정보에서 행동해야 하며, 소형 언어 모델(SLM)의 지침을 통합하는 것이 어려웠다. 기존의 불확실성 기반 접근 방식은 SLM이 독립적인 행동을 거의 하지 못하는 문제를 보였고, 이는 맥락 문제로 확인되었다. ASK+는 SLM에 경로 인식 맥락과 구조화된 사고 과정을 제공하여 정책을 가끔 수정하는 더 유용한 상담자로 변환한다. ASK+는 DoorKey에서 93%의 성공률, FourRooms에서 70%, HigherLower에서 73.7%의 정확도를 기록하며, Qwen3.5-2B 모델이 Qwen3.5-4B 모델과 동등하거나 더 나은 성능을 보였다.
네이버 AI 해커톤에서 LLM을 활용한 평가 시스템
2026년 봄, 네이버는 모든 직군이 참여하는 '모두의 Engineering Day'에서 AI 해커톤을 개최했다. 참가자들은 현업 문제를 해결하기 위해 25개 팀으로 나뉘어 최소 기능 제품(MVP)을 하루 안에 개발했다. 평가 과정에서 LLM을 활용하여 제출된 코드와 문서를 자동으로 평가했으며, 문제는 출자·투자 현황 관리, 영수증 경비 정산, 업무 시간 관리로 나뉘었다. LLM은 문제 A와 B에서 동일한 팀을 1위로 평가했으며, 최종 심사에서도 같은 팀이 선정되었다.
무선 통신을 위한 미분 가능 레이 트레이싱 모델링에 관한 박사 논문
박사 논문 'Differentiable Ray Tracing for Radio Propagation Modeling'이 발표되었다. 이 논문은 무선 통신과 머신러닝의 교차점에서의 연구를 다루며, 자동 미분을 통해 복잡한 물리적 환경에서의 정확한 그래디언트를 계산할 수 있는 방법을 제시한다. 논문은 물리학 기초, 알고리즘 핵심, 실제 응용 사례로 나뉘어 있으며, GPU 가속 경로 추적 및 미분 가능 시뮬레이션의 안정성을 위한 기술을 포함하고 있다. 관련 오픈소스 라이브러리인 DiffeRT도 소개되었다.
신뢰할 수 있는 LoRA 어댑터로 제한된 모델 학습 접근법
한 연구자가 모델이 악의적인 업데이트를 학습하지 못하도록 하는 방법을 탐구하였다. 이 방법은 모델의 파인튜닝을 신뢰할 수 있는 LoRA 어댑터에서 학습한 서브스페이스로 제한하여, 유용한 적응은 가능하지만 악의적인 방향은 기하학적으로 도달할 수 없도록 한다. 연구에서는 196개의 공개 LoRA 어댑터를 테스트하였고, 공격 성공률이 급격히 감소하면서 유용한 적응이 유지되는 결과를 보였다. 관련 논문과 코드는 공개되어 있다.
오픈 소스 AI의 부상에도 Anthropic에 미치는 영향
오픈 소스 AI의 부상이 진행되고 있지만, 현재 Anthropic은 그로 인해 큰 타격을 받지 않고 있다. 관련된 논의는 Hacker News에서 확인할 수 있다.
AIEWF에서 논의된 Autoresearch와 인간의 역할
AIEWF에서 Paul Bakaus는 Autoresearch가 시스템을 유지하는 루프를 형성한다고 설명했다. Roland Gavrilescu는 이를 'outer loop'로 정의하며, 모델이 성장하는 과정에서 지속적인 발견과 적응이 필요하다고 강조했다. Addy Osmani는 외부 루프는 여전히 인간의 역할이 중요하다고 주장하며, 내부 루프는 에이전트가 처리할 수 있지만 외부 루프는 엔지니어링이 필요하다고 말했다. Bakaus는 그의 디자인 도구 Impeccable을 통해 사용자가 디자인 과정에 참여해야 한다고 강조하며, 자동화된 솔루션이 아닌 사용자 개입을 통한 창의성을 강조했다.
Fable의 GPU 커널 작성과 AI 자동화의 발전
Fable은 KernelBench-Mega에 제출된 최초의 메가커널을 작성하여 18.71배의 속도 향상을 달성했다. 이 성과는 AI 시스템이 커널 설계와 같은 AI 연구 및 개발의 기본 작업을 수행하는 데 점점 더 능숙해지고 있음을 나타낸다. AI 시스템의 자동화 능력은 Remote Labor Index에서 2025년 10월 2.5%에서 2026년 7월 16.1%로 증가하며, GPT-5.5, Opus 4.8, Fable 5의 성공률은 각각 6.3%, 8.3%, 16.1%에 이른다.
Fable 5의 한계 탐색 및 Tencent Hy3 모델 출시
Fable 5의 구독 보조금 종료를 앞두고 Thariq는 'Field Guide to Fable' 블로그 시리즈를 통해 모델의 행동 이해와 새로운 디자인 방향 탐색에 대한 조언을 제공했다. 또한, Tencent는 295B MoE 모델인 Hy3를 Apache 2.0 라이선스 하에 출시했으며, 21B 활성 파라미터와 192명의 전문가를 포함하고 있다. Hy3는 vLLM에서 원활하게 실행되며, 도구 호출 안정성과 환각 방지 개선이 강조되었다.
AI 인프라의 전력 소비 증가가 전력망 한계 시험
인공지능 인프라의 확장은 전력 문제로 여겨지며, 국제 에너지 기구는 데이터 센터가 이 세기 내에 전 세계 전력 소비의 3~4%를 차지할 것으로 예상하고 있다. 대규모 컴퓨팅 시스템의 전력 소비는 예측 가능한 수요가 아닌, 빠르게 변화하는 수요로 인해 전력망의 운영 특성을 변화시키고 있다. 특히, 대규모 데이터 센터는 특정 지역에 집중되어 있으며, 이는 전력 소비의 급증으로 이어져 지역 전력망의 신뢰성 문제를 야기할 수 있다.
AI의 에너지 소비 문제와 신경형 공학의 가능성
AI는 대량의 데이터를 처리하기 위해 수천 개의 GPU가 있는 대형 데이터 센터에서 작동하며, 각 GPU는 최대 1,000와트를 소비한다. 이는 최신 스마트폰이 사용하는 전력보다 훨씬 높은 수치로, AI의 비효율성을 나타낸다. 이를 해결하기 위해 신경형 공학이 연구되고 있으며, 이는 전자 부품과 회로가 뇌의 뉴런과 시냅스처럼 작동하도록 하는 접근법이다. 최근 발견된 인공 뉴런과 시냅스는 일반 CMOS 트랜지스터로 만들어졌으며, AI의 환경적 영향을 줄일 가능성이 있다.