본문으로 건너뛰기

Category

AI 리서치·논문

arXiv 논문과 대형 연구소의 기술 리포트를 추적하는 카테고리다. 모델 아키텍처, 학습 기법, 벤치마크 결과처럼 6개월 뒤 제품에 들어올 흐름을 미리 읽는다. 한국 개발자가 논문 전문을 다 읽지 않고도 핵심과 재현 가능성을 가늠하도록 정리한다.

News·

OpenAI 모델을 활용한 희귀 유전 질환 진단

연구자들이 OpenAI의 추론 모델을 사용하여 희귀 질환 진단을 지원하였으며, 이전에 해결되지 않았던 사례에서 18개의 새로운 진단을 확인하였다.

OpenAI News
News·

AMIE, 복잡한 질병 관리에서 주치의와 동등한 성능 보여

‘Nature’에 발표된 연구에 따르면, Google의 대화형 AI 시스템 AMIE가 복잡한 질병 관리에서 주치의와 유사한 성과를 보인다고 한다.

Google AI Blog
News·

Project Ire, LOTUSLITE 변종 식별 및 분석 결과 발표

Project Ire는 LOTUSLITE 변종을 식별했으며, 이 변종은 공공 패밀리와 TTPs(도구, 전술, 절차)를 공유하지만 IOC(위협 지표)는 공유하지 않는다. Ire는 사용자 상호작용 없이 샘플에 대한 기능별 행동 보고서를 생성하였고, Acronis에 의해 최근 문서화된 Windows DLL 백도어인 LOTUSLITE와 일치하는 행동 패턴을 보였다. 분석 결과, 이 샘플의 해시는 Acronis의 IOC 목록에 없으며, 6월 4일 기준으로 주요 EDR(예: CrowdStrike Falcon, SentinelOne 등)은 이를 악성으로 탐지하지 않았다.

Microsoft Research Blog
News·

AI 시스템은 인간 인지를 확장하는 방식으로 작동한다

현대 AI 시스템은 인간의 인지를 복제하는 것이 아니라, 이미 존재하는 인지 구조를 확장함으로써 강력한 성능을 발휘한다. AI는 에세이 작성, 코드 생성, 복잡한 아이디어 요약, 대화 수행 등에서 뛰어난 유창성을 보이지만, 여전히 인간이 직관적으로 수행하는 작업에서는 한계를 보인다. 연구에 따르면, AI 시스템은 인간의 경험에 뿌리를 둔 구조를 모델링하고 확장함으로써 작동하며, 이는 AI의 능력과 한계를 이해하는 데 도움을 준다.

Microsoft Research Blog
News·

다중 에이전트 LLM 심의에서 숨겨진 앵커의 역할

다중 에이전트 LLM 심의는 에이전트들이 여러 차례에 걸쳐 답변을 교환하고 수정하는 과정으로, 이는 인간의 의사결정 방식을 반영한다. 이 과정에서 각 에이전트는 숨겨진 내부 신념인 앵커를 가지고 있으며, 이는 이웃의 의견과 관계없이 자신의 의견을 지속적으로 끌어당긴다. 연구에서는 이 앵커가 심의 과정만으로 회복될 수 있으며, 이는 고전적인 합의 규칙이 금지하는 행동인 에이전트의 자신감이 초기 신념의 범위를 넘어서는 것을 설명한다. 또한, 회복된 앵커가 예측 가능성을 가지는지를 확인하는 간단한 테스트를 통해 모델이 진정으로 앵커에 의해 구동되는지를 판단할 수 있다.

arXiv cs.AI (인공지능)
News·

Diffusion Language Models의 실험적 분석

Diffusion Language Models (DLMs)는 다음 토큰 예측 대신 반복적인 디노이징을 통해 텍스트를 생성하는 대안 패러다임으로, 전체 시퀀스의 병렬 정제를 가능하게 한다. 본 연구에서는 8개의 최첨단 DLM을 8개의 벤치마크를 통해 평가하며, 생성 품질과 계산 효율성을 모두 고려한다. 또한, 디노이징 단계, 컨텍스트 길이, 블록 크기 및 병렬 언마스킹 전략과 같은 주요 추론 시간 요소의 영향을 분석하고, 동일한 조건에서 훈련된 소규모 모델의 통제된 비교 실험을 통해 대규모 실험을 보완한다. 이 분석은 DLM의 성능과 계산 효율성 간의 상충 관계를 강조한다.

arXiv cs.AI (인공지능)
News·

CS2013과 CS2023에 대한 프로그램의 커리큘럼 커버리지 측정

학부 컴퓨터 과학 프로그램의 커리큘럼 커버리지를 측정하는 방법론이 제시되었다. 이 방법론은 한 인증된 컴퓨터 과학 학사 프로그램을 CS2013과 CS2023에 대해 적용하였으며, 프로그램은 CS2023의 49.7%와 CS2013의 50.9% 지식 단위를 커버하고 있다. 또한, 프로그램은 각 가이드라인에 대해 약 88%의 커버된 유닛에 대한 역량을 명확히 설명하지만, CS2023의 경우 권장 깊이에 도달하는 비율은 76%로 CS2013의 95%에 비해 낮다. 이 차이는 새로운 가이드라인의 기대치 상승을 반영한다.

arXiv cs.AI (인공지능)
News·

오픈AI, 자율 AI 화학자 시스템 공개

오픈AI는 17일(현지시간) 화학 및 제약 전문 AI 스타트업 몰레큘 원과 협력하여 '자율 AI 화학자' 시스템을 공개했다. 이 시스템은 AI가 스스로 가설을 세우고 실험을 통해 결과를 검증할 수 있는 '자율 연구 시스템'으로, GPT-5.4, 마리아 AI, 마리아 랩의 세 부분으로 구성된다. GPT-5.4는 연구 계획 수립을 담당한다.

AI타임스
News·

AI Engineer World’s Fair에서의 GPU 활용과 AI 인프라 논의

AI Engineer World’s Fair에서 참석자들은 5000달러 이상의 스폰서 크레딧을 받을 수 있으며, AI 스케일링에 관한 논의가 진행된다. xAI는 10% 미만의 MFU(Model FLOPs Utilization)로 운영되고 있으며, GPT-3는 21%, Gopher는 32%, Megatron-Turing NLG는 30%, PaLM은 46%의 MFU를 기록했다. Anjney Midha는 AI 인프라의 비효율성을 지적하며, GPU 구매가 아닌 시스템 문제 해결이 중요하다고 강조한다. 또한, AMP는 1.2GW의 기초 부하와 6GW의 스파이크 용량 목표를 가지고 있다.

Latent Space: The AI Engineer Podcast
News·

Axiom, Putnam 시험에서 12/12 점수 달성

2025년, Axiom은 7개월 된 스타트업으로 Putnam 시험에서 12문제를 모두 해결하며 8/12 점수를 기록했다. 이는 최고의 학부생보다 높은 점수이며, DeepSeek의 103/120보다도 우수하다. Axiom CEO Carina Hong은 코딩 능력이 AGI로 가는 길에서 필요하지만 충분하지 않다고 언급하며, 'Verified AI'의 중요성을 강조했다. Axiom은 Verina 벤치마크에서 99%의 ProofGen 성과를 달성했으며, 이는 OpenAI의 4.9%와 비교해 매우 높은 수치이다.

Latent Space: The AI Engineer Podcast
News·

Radical AI의 자율주행 실험실과 소재 발견 가속화

Joseph Krause는 Radical AI를 설립하여 소재 발견 과정을 10배 가속화하고 있다. 이들은 자율주행 실험실(SDL)을 통해 AI 과학자가 가설을 생성하고 자동화 로봇이 소재를 합성 및 특성 분석하는 시스템을 운영하고 있다. Radical은 6개월 동안 1200개의 합금을 생산하고 특성 분석을 완료했으며, 하루에 100개의 새로운 합금을 테스트할 수 있을 것으로 예상하고 있다. 이들은 300개의 새로운 소재를 제안하고 테스트하여 10개의 혁신적인 특성을 가진 소재를 발견했다.

Latent Space: The AI Engineer Podcast
News·

GPU 아키텍처에 따른 3D 생성 확산 모델의 성능 분석 및 최적화

확산 모델은 고충실도 3D MRI 합성에 필수적이나, 수백 개의 U-Net 평가로 인한 GPU 자원 요구가 크다. 본 논문은 NVIDIA 아키텍처 3세대에서 의료 확산 모델 Med-DDPM의 성능 분석을 수행하고, 커널 수준의 런타임 분해, 메모리 시스템 활용도, 텐서 코어 활용도를 평가하였다. cuDNN 컨볼루션과 암묵적 GEMM 커널이 훈련의 대부분을 차지하며, 메모리 접근 패턴과 텐서 레이아웃 변환에서 비효율성이 발생함을 보여준다. TF32 텐서 코어 활성화 및 3D 채널-마지막 레이아웃 최적화를 통해 SM 사이클을 최대 100배 줄이고, 동적 명령어 수를 100배 감소시키며, A100에서 텐서 코어 활용도를 1.45에서 9.98배로 증가시켰다.

arXiv cs.LG (머신러닝)
News·

Gated Uncertainty-Aware Routing for Distillation을 통한 경량화된 과학적 시계열 예측

Time-Series Foundation Models (TSFMs)의 배포는 특정 과학 분야에 적용할 때 심각한 분포 불일치 문제와 높은 계산 비용으로 인해 제한된다. 본 연구에서는 Gated Uncertainty-Aware Routing for Distillation (Guard)라는 새로운 프레임워크를 제안하며, 이는 다중 교사 증류를 인스턴스별 결정 과정으로 재구성한다. 이 프레임워크는 두 가지 적응 메커니즘을 포함한다: (1) Contextual Router는 지역 입력 통계에 따라 가장 관련성 높은 교사를 동적으로 선택하고, (2) Uncertainty-Gated Temperature 메커니즘은 교사의 신뢰도가 도메인 현실과 다를 때 증류 강도를 자동으로 조절한다. 이 방법은 기후 관련 네 가지 도메인에서 RMSE를 유의미하게 감소시켰으며, 최적의 제로샷 정확도를 보이지 않는 사전 훈련된 모델로부터 지식을 성공적으로 증류할 수 있음을 보여준다.

arXiv cs.LG (머신러닝)
News·

SPSD를 통한 클라우드 LLM 추론에서의 사용자 프롬프트 압축

SPSD(Sentiment Preserving Semantic Distillation)는 4비트 양자화된 소형 언어 모델을 사용하여 사용자 프롬프트를 압축하고 클라우드에 배포된 LLM으로 전송하는 엣지 기반 파이프라인이다. 248개의 프롬프트를 평가한 결과, 평균 99.9개의 입력 토큰이 절약되었으며, 모든 146개의 압축 호출에서 긍정적인 절약이 나타났다. 응답 품질은 15점 척도에서 사전 지정된 1점 마진 내에서 원본 경로와 비슷한 수준으로 평가되었고, 안전-critical 도메인은 규칙 기반 게이트를 통해 보수적으로 처리된다. 각 호출당 순 에너지 절약량은 70-270 uWh로 추정된다.

arXiv cs.LG (머신러닝)
News·

계산 가능성에 대한 새로운 접근: 계산 가능성 정의

이 논문에서는 목표 쿼리나 관심 파라미터의 계산 가능성을 정보의 유형과 양에 따라 설명하는 식별 조건을 다룬다. 특히, 인과 식별에서 이 정보는 인과 그래프의 형태로 표현되며, 그래프의 일부 변수에 대해 관측된 데이터를 사용한다. '계산 가능성'이라는 새로운 프레임워크를 제안하며, 이는 경험적 추정량을 위한 유한한 계산 검색 절차를 정의한다. 이 절차가 원하는 오차 허용 범위 내에서 추정량을 찾으면 식별 가능성이 충족된다. 여러 실험을 통해 작은 유한 샘플, 모호한 그래픽 기준, 혼합 관찰-개입 데이터 및 반사실적 데이터에서의 식별 질문을 해결할 수 있음을 보여준다.

arXiv cs.LG (머신러닝)
News·

Reiner Pope의 칩 설계 강의 및 MatX 소개

Reiner Pope가 기본 논리 게이트부터 시작하여 GPU, TPU, FPGA, 인간 두뇌의 구조까지 설명하는 강의를 진행했다. Reiner는 새로운 칩 스타트업 MatX의 CEO이며, 이전에는 Google에서 소프트웨어 효율성, 컴파일러, TPU 아키텍처에 대해 작업했다. 또한, Crusoe는 SemiAnalysis의 ClusterMAX 보고서에서 금 티어 GPU 클라우드 중 하나로, 동일한 GPU 가격에도 불구하고 5-15% 낮은 총 소유 비용(TCO)을 제공한다. Jane Street와의 대화에서는 AI 사용 및 기술 인재 채용에 대한 의견이 나왔다.

Dwarkesh Podcast
News·

AGI 경제학과 AI 부의 재분배 문제

Dwarkesh Podcast의 에피소드에서 Alex Imas와 Phil Trammell이 AGI와 관련된 경제적 질문들에 대해 논의했다. AI로 생성된 부를 어떻게 세금으로 재분배할 것인지, AI 공급망에 포함되지 않은 국가들이 이익을 어떻게 얻을 것인지, 불평등이 폭발하지 않는 세계가 가능한지에 대한 질문이 제기되었다. 또한, Jane Street는 연구자와 엔지니어를 양성하기 위해 강의와 부트캠프를 운영하고 있으며, Google의 Gemini Omni는 비디오 편집 기능을 제공한다.

Dwarkesh Podcast
News·

Eric Jang, AlphaGo를 현대 AI 도구로 구축하는 방법 설명

Eric Jang은 AlphaGo를 현대 AI 도구를 사용하여 처음부터 만드는 방법을 설명했다. AlphaGo는 지능의 기본 요소인 탐색, 경험 학습, 자가 대국의 예시로 여전히 유효하다. 그는 AlphaGo의 MCTS가 매번 더 나은 행동을 제안하여 훈련 목표를 제공하는 반면, 일반적인 강화 학습은 100,000개 이상의 토큰 중 어떤 것이 정답을 가져왔는지 파악해야 한다고 언급했다. 또한, LLM이 자동화할 수 있는 AI 연구의 일부와 여전히 어려움을 겪는 부분에 대해 논의했다.

Dwarkesh Podcast
News·

저자극 언어 생성을 위한 활성화 조정 연구

대형 언어 모델(LLM)은 저자원 언어의 합성 데이터 생성을 위한 효과적인 도구로, 생성된 데이터는 하위 작업 성능을 향상시킬 수 있다. 현재의 최상위 접근 방식은 목표 언어 예제를 포함한 몇 가지 샘플 프롬프트에 의존하며, 이는 추론 비용을 증가시키고 어휘 고정화로 인해 다양성을 감소시킬 수 있다. 본 연구에서는 저자원 합성 데이터 생성을 위한 대안으로 활성화 조정을 조사하고, 언어 정체성을 목표로 하는 언어 조정과 인간 작성 및 역번역된 텍스트 표현을 대조하여 잘 형성된 정도를 포착하는 품질 조정의 두 가지 전략을 연구하였다. 이 방법들은 4개의 오픈 소스 LLM, 여러 층, 11개의 유형적으로 다양한 언어에서 감정 및 주제 분류 데이터를 생성하고 소형 분류기를 미세 조정하는 데 평가되었다. 조정은 제로샷 및 몇 샷 프롬프트 설정 모두에 적용되었으며, 비조정 모델과 비교되었다. 결과적으로 초기 층에서의 조정이 생성된 데이터의 다양성을 일관되게 향상시키고, 저자원 언어에 대해 하위 모델 성능을 강화하는 경향이 있음을 보여주었다.

arXiv cs.CL (계산언어학·NLP)
News·

교육 대화의 개인 정보 비식별화를 위한 완전 로컬 AI 캐스케이드 제안

교육 대화는 개인 식별 정보(PII)를 포함할 수 있는 민감한 자원이다. 기존 접근 방식은 거버넌스와 정확성 간의 트레이드오프를 강요한다. 본 연구에서는 완전 로컬 캐스케이드 프레임워크를 제안하여 비식별화를 개방형 개체 인식에서 제한된 개인 정보 분류로 재구성한다. 이 프레임워크는 두 개의 경량 인코더와 결정론적 규칙을 결합하여 후보 범위를 과생성하고, 문맥 인식 리뷰어가 주변 대화와 화자 역할을 사용하여 각 후보에 대해 이진 Redact/Keep 결정을 내린다. 평가 결과, 가장 강력한 로컬 구성은 0.958의 매크로 F1 점수를 기록하였으며, 이는 LLM 전용 기준선의 0.767 및 상업 API의 0.706과 비교된다. 교육 비식별화에서는 문제 정의가 모델 규모보다 중요하다는 결과를 제시한다.

arXiv cs.CL (계산언어학·NLP)
News·

Continuous Audio Thinking(CoAT) 프레임워크를 통한 대규모 오디오 언어 모델 개선

대규모 오디오 언어 모델(LALMs)은 음성 전사부터 음악 분석에 이르기까지 다양한 오디오 이해 작업에서 뛰어난 성능을 보이고 있다. 그러나 LALMs는 일반적으로 텍스트 정렬 응답을 생성하도록 훈련되어 음향 정보를 보존하기보다 텍스트 생성을 위한 숨겨진 상태로 발전한다. 이를 해결하기 위해 Continuous Audio Thinking(CoAT) 프레임워크가 도입되었으며, 이는 응답 생성을 위한 사전 단계에서 음향 정보를 조직할 수 있는 연속적인 잠재 작업 공간을 제공한다. CoAT는 Qwen2-Audio, Qwen2.5-Omni-7B, Audio Flamingo 3의 세 가지 LALMs에서 오디오 추론, 오디오 이해, 음악 분류, 감정 분석, 음성 전사 등 다양한 벤치마크에서 성능 향상을 보여주었다.

arXiv cs.CL (계산언어학·NLP)
News·

SproutRAG: 주의 기반 계층적 RAG 프레임워크

SproutRAG는 정보 검색과 문맥 일관성을 균형 있게 조정하는 주의 기반 계층적 RAG 프레임워크이다. 이 시스템은 문장 수준의 청크를 점진적으로 더 큰 의미 단위로 조직하고, 학습된 문장 간 주의를 사용하여 이진 청크 트리를 구성한다. 기존 방법들과 달리 SproutRAG는 외부 LLM 호출이나 손실 요약 없이 다중 수준 검색을 가능하게 하며, 계층적 빔 검색을 통해 여러 수준의 후보를 검색한다. 실험 결과, SproutRAG는 네 가지 벤치마크에서 평균 6.1%의 정보 효율성을 개선하였다. 코드가 https://github.com/AmirAbaskohi/SproutRAG에서 제공된다.

arXiv cs.CL (계산언어학·NLP)
News·

의료 이미지를 활용한 컨볼루션 오토인코더의 잠재 공간 해석

한 사용자가 의료 이미지 세트에 대해 컨볼루션 오토인코더를 훈련시키고, 랜덤 포레스트를 사용하여 잠재 피처 맵을 분류한 후, 최고 점수를 받은 피처 맵에 어떤 입력 이미지가 포함되어 있는지 이해하고자 하는 과정을 설명했다. 그는 한 번에 하나의 이미지를 인코딩하고 나머지 이미지를 무시한 후, 최고 점수를 받은 피처 맵과 원래 피처 맵 간의 스피어만 상관관계를 확인했으나, 일부 잘못된 긍정 결과가 발생했다고 언급했다. 또한, 최고 점수를 받은 잠재 피처 맵만 디코딩하려고 시도했지만, 디코더 얽힘으로 인해 많은 잘못된 긍정 결과가 발생했다고 덧붙였다.

r/MachineLearning
News·

cuTile Rust를 이용한 안전한 GPU 추론 엔진 Grout 발표

cuTile Rust의 논문 "Fearless Concurrency on the GPU"가 발표되었으며, 이는 메모리 안전성과 데이터 경합 자유를 보장하는 GPU 커널 작성을 가능하게 한다. Grout는 cuTile Rust를 기반으로 한 Qwen3 추론 엔진으로, RTX 5090에서 Qwen3-4B에 대해 171 tok/s, B200에서 Qwen3-32B에 대해 82 tok/s의 성능을 기록하여 vLLM 및 SGLang과 경쟁력을 갖춘다. Grout의 커널은 여전히 안전하지 않은 경로를 사용하고 있지만, 안전한 변형으로 이전할 수 있는 가능성이 있다.

r/MachineLearning