Category
AI 리서치·논문
arXiv 논문과 대형 연구소의 기술 리포트를 추적하는 카테고리다. 모델 아키텍처, 학습 기법, 벤치마크 결과처럼 6개월 뒤 제품에 들어올 흐름을 미리 읽는다. 한국 개발자가 논문 전문을 다 읽지 않고도 핵심과 재현 가능성을 가늠하도록 정리한다.
OpenAI의 Jalapeño 칩, NVIDIA 시스템 대비 성능 향상
OpenAI는 Jalapeño라는 맞춤형 추론 칩의 벤치마크 세부 정보를 발표하며, NVIDIA GB200/GB300 시스템보다 효율성과 지연 시간이 현저히 개선되었다고 주장했다. Jalapeño는 최대 처리량에서 1.5–1.9배 더 많은 작업을 수행하고, 종단 간 지연 시간을 1.7–3.6배 낮추며, 대화형 작업에서는 2.1–4.1배 더 높은 성능을 발휘했다. 이 칩은 700W로 평가되지만 테스트에서는 550W 이하로 유지되었다. OpenAI는 연말까지 자체 인프라에 배포할 계획이며, Gen 2와 Gen 3도 개발 중이다.
중국 로봇 기업의 과대 평가와 실제 능력 차이
중국의 로봇 기업들이 실제 능력에 비해 과대 평가되고 있다는 분석이 제기되었다. 예를 들어, 한 로봇 회사는 200억 RMB 이상의 가치가 평가되었으나, 로봇이 수건을 접는 데 15분이 걸려도 작업을 완료하지 못했다. 또 다른 사례로, 한 로봇이 베어링을 집는 데 70초가 걸렸으며, 10배 빠르더라도 공장 사용이 불가능하다고 보고되었다. 현재 20억 RMB 이상의 가치를 가진 중국 로봇 기업이 7개에 달하며, 이들 기업은 종종 국유 기업과의 복잡한 관계를 통해 수익을 올리고 있다.
Apple의 Dan Busbridge 팀, 2025년까지 증명할 Distillation Scaling Laws 연구
Apple의 Dan Busbridge가 이끄는 팀이 2025년 초에 143백만에서 12.6억 개의 파라미터를 가진 학생 모델과 최대 512억 개의 훈련 토큰을 사용한 교사 모델을 포함한 가장 계산 집약적인 증류 연구를 수행했다. 이 연구 결과는 'Distillation Scaling Laws'라는 논문으로 발표되었으며, 증류 분야의 물리학에 가장 가까운 내용을 담고 있다.
AI의 새로운 경제학: 수학적 발전과 기술의 방향
a16z의 Martin Casado와 Steven Sinofsky는 AI와 수학의 최근 발전이 기술의 미래에 대해 무엇을 의미하는지 논의한다. 그들은 AI의 수학적 진전이 진정한 추론의 도약인지, 아니면 문제 해결을 위한 새로운 도구인지에 대해 토론하며, 과거의 기술들이 인간이 해결해야 할 문제를 어떻게 변화시켰는지를 살펴본다. 또한, 엔지니어링 인재에 의해 제한되었던 문제들이 자본과 컴퓨팅 파워로 점점 더 해결될 수 있게 되었다고 언급하며, 이는 스타트업과 기존 기업, 벤처 캐피탈, 그리고 AI 애플리케이션의 향후 변화에 영향을 미칠 것이라고 설명한다.
McKinsey, 기업 AI가 ROI로 가는 길에 있다고 평가
McKinsey는 2026년 AI 상태 보고서에서 1,719명의 전문가를 대상으로 조사한 결과, 기업들이 AI 투자를 늘리고 있지만 실제 수익 증가를 보고하는 비율은 여전히 정체 상태라고 밝혔다. 응답자의 37%가 AI 사용으로 인해 일부 EBIT 영향을 받는다고 응답했으며, AI 고성능 기업으로 분류된 응답자는 6%에 불과하다. 또한, 연간 수익이 10억 달러 이상인 기업의 40%가 AI 에이전트를 확장하고 있으며, AI 관련 운영 비용이 기술 사용에 제약을 주고 있다고 응답한 비율은 20%이다. AI 사용자는 80%가 개인 생산성이 향상되었다고 보고했지만, 이는 기업의 재무적 성과로 이어지지 않고 있다.
LitReview Arena: 문헌 리뷰 에이전트 평가를 위한 배틀 스타일 플랫폼
LitReview Arena는 문헌 리뷰 품질을 평가하기 위한 배틀 스타일 평가 플랫폼으로, AI 논문 작성 경험이 있는 분야 전문가들이 익명 초안을 비교하고, 전문 분야에 맞춰 주제를 매칭하여 다섯 가지 문헌 리뷰 특정 기준에 대한 결과를 제공합니다. 이 프로토콜을 통해 약 3,000개의 전문가 판단을 수집했으며, 현재 시스템이 인간 초안에 비해 전체 유용성에서 23.0%의 결정적 승률을 보이는 반면, Sonar Deep Research와 같은 에이전트 LLM은 기본 언어 모델보다 60% 이상 우수한 성능을 보였습니다. 또한, 기존 LLM-판단 방법은 인간 전문가와의 정렬이 부족하며(Spearman's rho=0.467), LitJudge라는 전문가 보정 평가자를 통해 정렬을 개선하여 Spearman's rho=0.78에 도달했습니다. 코드와 데이터는 https://github.com/VanellopeAsher/LitReview-Arena에서 공개됩니다.
KVBoost: 효율적인 대형 언어 모델 추론을 위한 청크 수준 키-값 캐시 재사용 시스템
KVBoost는 HuggingFace 호환 디코더 모델을 위한 청크 수준의 키-값 캐시 재사용 시스템으로, 콘텐츠 위치에 관계없이 재사용을 가능하게 한다. 이 시스템은 위치 식별(prefix hash)과 콘텐츠 식별(content hash)을 분리하는 이중 해시 키잉 방식을 도입하여 정확한 및 근사 캐시 일치를 지원한다. KVBoost는 선택적 재계산(SelectiveRecompute) 및 캐시 블렌드 재계산(CacheBlendRecompute)과 같은 두 가지 수리 전략을 사용하여 독립적으로 캐시된 청크에서 발생하는 주의 경계 오류를 해결한다. Qwen/Qwen2.5-3B 모델을 대상으로 한 평가에서 KVBoost는 첫 번째 토큰까지의 시간을 4.49배 단축시키고, 정확도는 유지한 채로 기존의 프리픽스 캐싱보다 16% 향상된 성능을 보였다.
AI가 방사선 전문의의 직무를 변화시키고 있는 현상
2016년 Geoffrey Hinton은 방사선 전문의가 5년 내에 컴퓨터에 의해 대체될 것이라고 예측했으나, 현재 방사선 분야는 30년 내에 26% 이상 성장할 것으로 예상된다. 방사선학은 AI의 도입이 활발한 분야로, 2026년 초까지 FDA에서 승인된 1,400개의 AI 지원 의료 기기 중 약 75%가 방사선학에 해당한다. AI는 의사의 효율성을 높이고, 인간의 눈으로는 식별할 수 없는 이상을 찾아내는 등 인간 성능을 개선할 가능성이 있다.
SchemaRouter: 효율적인 이질적 에이전틱 RAG를 위한 필드 인식 도구 라우팅
SchemaRouter는 이질적 에이전틱 검색 증강 생성(RAG) 시스템을 위한 경량 라우팅 레이어로, 도구, 엔드포인트, 매개변수, 응답 필드 등을 스키마 그래프로 표현한다. 이 시스템은 110개의 재료 과학 벤치마크 쿼리에서 0.71의 답변 정확도를 달성하며, fetch-everything 방식보다 2.7배 낮은 지연 시간을 기록하고, 0.93의 도구 정확도와 1.0의 매개변수 유효성을 보인다. SchemaRouter는 62%의 답변에서 출처 및 라이선스 정보를 제공하며, 선택된 필드 수를 최소화하는 것이 오히려 답변 정확도를 감소시킨다는 것을 발견했다.
미국 GDP 통계에서 Nvidia의 기여도 과소평가
AI 붐으로 미국의 컴퓨팅 장비 투자액이 연간 약 4000억 달러로 증가했으나, GDP 성장에 미치는 영향은 미미하다. 이는 많은 투자가 수입 기술 상품에 쓰여 GDP에서 차감되기 때문인데, Nvidia와 같은 팹리스 반도체 제조업체가 창출하는 가치는 GDP 통계에서 누락되고 있다. 최근 보고서에 따르면, 지난해 미국 GDP 성장률이 약 0.3%포인트 과소평가되었으며, Nvidia의 성장이 지속될 경우 2028년까지 이 격차가 거의 2%포인트에 이를 수 있다. 2025년 국제 지침은 팹리스 제조업체의 해외 판매를 상품 수출로 기록할 것을 요구하고 있다.
공급망 시장 변동성 하의 연합 앙상블 예측
이 연구는 시장 충격, 지역 수요의 비동일 분포, 상업 데이터 중앙 집중화의 제한된 의지를 고려한 공급망 예측 시스템을 제안한다. Federated Ensemble Forecasting with Negative-Correlation Learning (FEF NCL) 방법은 클라이언트 노드에서 전문 예측 전문가를 훈련시키며 중복 모델 오류를 억제하는 분산 방식이다. 이 프레임워크는 시간적 특성 인코더, 클라이언트 수준 드리프트 점수, 신뢰도 가중 집계 및 각 예측에 가장 영향을 미치는 시장 및 공급자 변수를 드러내는 설명 가능성 계층을 결합한다. 2021-2024의 변동성 프로파일을 포함한 124,800개의 주간 SKU 지역 관측치로 구성된 단일 합성 데이터셋을 사용하여 평가되었으며, FEF NCL은 최상의 연합 기준선에서 가중 평균 절대 백분율 오차를 13.9%에서 12.4%로 줄이고, 지연 위험 매크로-F1을 0.755에서 0.801로 개선하였다.
우크라이나어와 기타 키릴 문자 언어의 토큰화 오버헤드 분석
현대 다국어 토크나이저는 우크라이나어와 같은 키릴 문자 언어를 영어보다 더 많이 분할하여 비용과 맥락 용량의 불균형을 초래한다. 9개의 생산 토크나이저와 5개 언어를 분석한 결과, 우크라이나어는 최신 토크나이저에서 68-121%의 토큰 오버헤드를 보였고, 구형 cl100k에서는 220%에 달했다. LLMLingua-2는 전자상거래 RAG 벤치마크에서 우크라이나어 입력 길이를 47-49% 줄였으며, 200K 어휘 제한으로 훈련된 바이트 수준 BPE 토크나이저는 UK/EN 비율을 2.22배에서 1.30배로 감소시켰다. 이러한 결과는 훈련 데이터 할당이 키릴 문자 토큰화 오버헤드에 기여하며, 완화가 가능함을 시사한다.
서사적 해석에서의 수정과 지연된 설명 구분
인간과 AI 시스템은 서사적 또는 장기 콘텐츠를 점진적으로 처리하며, 입력이 시간에 따라 수신되고 내부 표현이 이에 따라 업데이트된다. 서사적 해석에서 두 가지 업데이트 연산자인 수정 기반 업데이트와 지연된 설명을 구분한다. 수정 기반 업데이트는 모순에 대응하여 이전 구조를 철회하거나 교체하는 비단조적(non-monotonic) 방식이며, 지연된 설명은 초기 불특정 요소를 제약 추가를 통해 정제하되 이전 약속을 철회하지 않는 단조적(monotonic) 방식이다. 이 연구는 구조적 서사 표현이 약속된 내용과 불특정 내용을 명확히 구분하고 두 업데이트 연산자를 지원하는 방법을 보여준다.
2026년 8월 현재 추천하는 로컬 비전 언어 모델
현재 추천하는 비전 언어 모델(VLM)에 대해 사용자들이 자신의 설정, 사용 용도(어떤 애플리케이션, 개인/전문적 사용 등), 도구/프레임워크/프롬프트 등을 상세히 설명하도록 요청하고 있다. 추천 모델은 오픈 웨이트 모델이어야 하며, 메모리 풋프린트에 따라 분류할 수 있다. 메모리 풋프린트는 무제한(>128GB VRAM), XL(64~128GB VRAM), L(32~64GB VRAM), M(8~32GB VRAM), S(<8GB VRAM)으로 나뉜다.
KSE-Web: 저자원 크메르 언어를 위한 하이브리드 검색 및 LLM 지원 쿼리 확장 분석
KSE-Web은 저자원 언어인 크메르의 의미 검색을 위한 하이브리드 검색 및 LLM 지원 쿼리 확장을 분석한 논문이다. 약 17,000개의 후보 크메르 제목과 3,000개의 정제된 크메르 문서로 구성된 데이터셋을 구축하였으며, 300개의 수동 검토된 사용자 스타일 크메르 검색 쿼리와 부분적으로 검증된 관련성 레이블을 포함한다. BM25, 다국어 밀집 검색, 하이브리드 BM25+밀집 검색, LLM 지원 쿼리 확장을 평가한 결과, BM25가 0.943의 Recall과 0.876의 nDCG로 가장 강력한 성능을 보였고, 하이브리드 방법이 유사한 성능을 나타냈다. LLM 지원 쿼리 확장은 비확장 검색보다 성능이 낮았지만, Qwen2.5-3B가 Qwen2.5-0.5B보다 더 강력한 결과를 생성하였다.
StarCraft II에서 AlphaStar의 AI 제어를 위한 런타임 액션 간섭
런타임 액션 간섭(RAI)은 정책 매개변수를 유지하면서 행동 속도 조절과 구성된 행동 패턴 필터링을 수행하는 AI 제어 메커니즘이다. RAI는 제안된 행동이 쿨다운 조건을 만족하고 내용 감지기가 행동을 플래그하지 않을 때만 행동을 실행하며, 그렇지 않으면 무작위 동작(no-op)을 전송한다. RAI는 AlphaStar actor.py의 복제본에 구현되었으며, StarCraft II 인간 참가자 연구에서 두 가지 상대의 제시를 비교하는 데 사용되었다. 능력 주장에 따라 응답의 공정성, 신뢰도, 독성의 평균이 다르게 나타났다.
전문가 모델의 방출이 적응 및 조정보다 우수한 경우
이 연구에서는 네 가지 메커니즘(제로샷, 인컨텍스트 주의, 테스트 시간 그래디언트 적응, 하이퍼네트워크에서 전문가 가중치 방출)을 비교하여 모델을 어떻게 전문화할 수 있는지를 다룬다. 방출 방식은 임상 몇 샷 분류에서 TabPFN과 동등한 품질로 비용을 절감하며, 몇 샷 사인 회귀에서는 MAML보다 2~3배 낮은 비용을 기록했다. 그러나 고차원 시퀀스 모델링에서는 인컨텍스트 주의에 비해 성능이 떨어졌다.
AI가 물리학 난제를 해결하고 보안 취약점을 발견하다
AI 모델 클로드가 조르조 파리시와 프란체스코 참포니 교수의 10년 묵은 난제인 재밍 전이의 핵심 임계지수 항등식을 수학적으로 증명하는 데 기여했다. 연구진은 클로드와 40차례 대화를 통해 해석적 증명을 유도했으며, 이 과정은 오픈 리포지토리 제노도에 공개됐다. 또한, AI 모델 GLM-5.3이 개발 도구 커서의 보안 취약점을 발견하고 이를 비공식적으로 전달한 사례도 있다. 이로 인해 AI의 역할이 코드 작성 보조를 넘어 고난도 보안 감사로 확장되고 있음을 보여준다.
TU Delft, LLM을 활용한 자율주행차의 운전 스타일 조정 시스템 개발
네덜란드 델프트 공과대학교(TU Delft)의 연구자들이 자연어 사용자 요청을 자율주행 제어 시스템의 조정으로 변환하는 시스템을 개발했다. 이 시스템은 OpenAI의 GPT-4o-mini 모델을 사용하여 승객의 자연어 제안을 해석하고, 안전한 범위 내에서 차량의 운전 스타일을 조정한다. 연구자들은 이 시스템이 시뮬레이션에서 운전 속도와 부드러움을 자연어 지시에 맞춰 조정하는 것을 확인했다.
SPADE를 통한 환경 생성 자동화 및 AI 연구의 가속화 현황
METR 연구에 따르면 AI는 사이버 분야에서 크게 기여하고 있으며, 2026년에는 여러 프로젝트(cURL, OpenSSL, Firefox, Microsoft)에서 보고된 취약점이 2025년에 비해 급격히 증가했다. 수학 연구에서는 AI의 기여가 미미하지만, arXiv 제출이 일부 분야에서 12개월 이내에 두 배로 증가했다. SPADE는 다수의 대학 연구자들이 개발한 프레임워크로, LLM이 게임과 같은 환경을 생성하고 이를 통해 훈련할 수 있도록 돕는다. SPADE는 환경 설계자와 추론 에이전트의 두 가지 역할을 수행하며, Qwen3-30B 모델이 가장 우수한 성능을 보인다.
Protege의 Engy Ziedan, 의료 AI의 평가 필요성 논의
Engy Ziedan은 의료 AI가 측정 문제를 겪고 있으며, 벤치마크에서 좋은 점수를 받는 것이 모델이 병원에 적합하다는 것을 의미하지 않는다고 설명했다. 그는 의료 AI가 정적 시험을 넘어 실제 임상 워크플로우에서 모델의 성능을 측정하는 독립적인 평가가 필요하다고 강조했다. 또한, 데이터 오염이 벤치마크를 저해할 수 있으며, 의료 AI의 미래는 간헐적인 테스트가 아닌 지속적인 모니터링을 요구할 것이라고 언급했다.
Canonical, C 코드베이스를 Rust로 변환하는 AI 연구 프로젝트 지원
Canonical은 C 코드베이스를 Rust로 변환하는 가능성을 탐구하는 3년짜리 박사 과정 프로젝트를 지원하고 있다. 이 프로젝트는 브리스톨 대학교의 프로그래밍 언어 연구 그룹에서 진행되며, LLM을 사용해 수십만 줄의 C 프로그램을 작은 구성 요소로 분해하고 이를 안전하고 유지보수 가능한 Rust 코드로 변환하는 방법을 연구할 예정이다. 프로젝트는 Canonical과 영국 연구 혁신 기관이 공동으로 후원하며, Jon Seager가 감독한다.
아이들이 AI보다 언어 학습에서 더 효율적인 이유
인간 아동은 100,000년 이상 대화해왔으며, 최근 ChatGPT와 같은 LLM이 등장한 이후에도 아이들이 여전히 언어 학습에서 기계보다 우수한 이유는 '데이터 효율성 격차'에 있다. LLM은 15조 개의 토큰으로 훈련되지만, 언어가 풍부한 환경에서 자란 아동은 약 1억 개의 단어를 듣고, 20세까지 3억 개로 늘릴 수 있다. 이는 LLM이 사용하는 데이터 양과 비교할 때 현저히 적다. 연구자들은 아동의 학습 방식을 역설계하여 더 데이터 효율적인 AI 모델을 개발하려고 한다.
오픈AI 서밋, 수학자 40여명 초청해 AI 시대 수학 교육 논의
오픈AI는 샌프란시스코 본사에서 전 세계 최고의 수학자 40여명을 초청해 비공식 서밋을 개최했다. 이 회의에서는 AI 시대에 수학 교육과 연구의 미래를 논의했으며, AI가 인간 지성을 초월할 가능성에 대한 우려가 제기되었다. 참석한 다니엘 리트 교수는 AI의 발전이 수학 분야에 미치는 영향에 대해 논의했다.