본문으로 건너뛰기

Category

AI 리서치·논문

arXiv 논문과 대형 연구소의 기술 리포트를 추적하는 카테고리다. 모델 아키텍처, 학습 기법, 벤치마크 결과처럼 6개월 뒤 제품에 들어올 흐름을 미리 읽는다. 한국 개발자가 논문 전문을 다 읽지 않고도 핵심과 재현 가능성을 가늠하도록 정리한다.

News·

NVIDIA Cosmos 3 Edge: 온디바이스 로봇 제어를 위한 새로운 모델

NVIDIA Cosmos 3 Edge는 4B 옴니 모델로, 2B NVIDIA Nemotron 기반의 추론기를 포함하고 있다. 이 모델은 로봇이 센서, 환경 및 작업에 적응할 수 있는 정책을 필요로 하는데, 월드 모델이 물리적 상호작용 학습의 기초를 제공하지만 크기로 인해 온디바이스 배포가 어려웠다. Cosmos 3 Edge는 이러한 문제를 해결한다.

NVIDIA Technical Blog
News·

다중 모달리티 에이전트 프레임워크의 기초와 응용에 대한 조사

대형 언어 모델(LLMs)의 발전은 에이전시 연구를 촉진시켰으며, 이는 인지, 기억, 의사결정을 조율하는 에이전트 프레임워크를 생성했다. 대형 다중 모달 모델(LMMs)의 등장으로 이미지, 오디오, 비디오 등 다양한 모달리티를 처리하고 통합할 수 있게 되어 실제 적용 가능성이 향상되었다. 이 조사에서는 에이전트 프레임워크의 핵심 기능 모듈인 인지, 추론, 계획, 기억, 행동에서 다중 모달리티의 영향을 분석하고, 텍스트 중심 에이전트에서 다중 모달 프레임워크로의 진화를 추적한다. 또한, 로봇공학, GUI 및 웹 탐색, 멀티미디어 콘텐츠 생성 및 편집, 장기 비디오 이해 및 검색 등 다양한 응용 분야에서 다중 모달 에이전트 시스템을 검토하고 성능과 효율성에 대한 논의를 포함한다.

arXiv cs.AI (인공지능)
News·

선형 판별 트리 앙상블을 통한 해석 가능한 다중 모달 분류

다중 모달 감정 및 행동 분류기를 위한 새로운 프레임워크가 개발되었다. 이 프레임워크는 텍스트, 오디오, 비주얼 스트림을 통합하여 정확성과 해석 가능성을 동시에 달성하는 것을 목표로 한다. 제안된 선형 판별 트리(LDT), 선형 판별 포레스트(LDF), 선형 판별 아다부스트(LDAB) 모델은 Multimodal Transformer보다 F1-mod에서 4.3% 향상되었고, 해석 가능한 다중 모달 기준인 Interpretable Multimodal Routing(IMR)보다 3.0% 높은 정확도를 기록하였다. 또한, 제안된 다중 모달 특징 중요도는 인간 주석자 간의 합의 점수가 기존 방법보다 크게 향상되었다.

arXiv cs.AI (인공지능)
News·

Claude 모델의 텍스트 워터마킹 프로세스 설명

Anthropic은 Claude 모델의 텍스트 출력에 워터마킹을 적용한다고 발표했다. 이와 관련하여, 워터마킹의 작동 원리와 구현 방법을 설명하는 48분 분량의 강의가 제공되었다. 원래 10장의 슬라이드로 계획했으나, 추가적인 세부사항으로 인해 50장이 되었다. 이 강의는 워터마킹 기술이 어떻게 작동하는지, 그리고 그 장단점에 대한 논의를 포함하고 있다.

Ahead of AI (Sebastian Raschka)
News·

Qwen 3.8 27B의 Atomic Dynamic GGUF 양자화 비교

Qwen 3.8 27B에 대해 Atomic Dynamic GGUF 양자화를 수행하고, RTX 6000에서 각 양자화 모델의 성능을 비교하였다. AD-Q4_K_M, AD-Q5_K_M, AD-Q6_K, Q8_0의 네 가지 양자화 모델이 테스트되었으며, 각각의 크기와 성능 지표가 제시되었다. AD-Q6_K 모델이 가장 안전한 선택으로 추천되며, 모든 양자화 모델은 유사한 방식으로 3D 장면을 처리하였다. 결과는 atomic.chat에서 확인할 수 있으며, 모델은 huggingface에서 다운로드 가능하다.

r/LocalLLaMA
News·

모델 기반 시뮬레이션의 발전과 단계별 변화

2022년부터 매년 기계 지능 생산 파이프라인의 한 요소가 인간 제작에서 모델 제작으로 전환되고 있다. 1단계에서는 InstructGPT가 보상 신호를 모델로 대체하며 평가 방법론이 모델 기반으로 변화했다. 2단계에서는 Microsoft의 Phi 시리즈가 LLM 합성 데이터로 훈련된 모델의 성능을 입증했다. 3단계에서는 Stanford의 Alpaca가 GPT 생성 지침으로 모델 행동을 복제하는 데 성공했다. 4단계에서는 모델이 스스로 학습할 내용을 결정하게 되었고, 5단계에서는 DeepMind의 AlphaEvolve가 새로운 알고리즘을 발전시켰다. 6단계에서는 RL 환경의 구축이 필요해졌다.

Latent Space (swyx & Alessio)
News·

Martin Casado가 말하는 AI 가치의 변화

Martin Casado는 AI에서 가치가 어디에 축적되고 있는지를 논의하며, 현재의 기술 주기가 이전과 어떻게 다른지를 설명한다. 그는 AI가 벤처 자본을 규모 확장 자본 게임으로 변화시켰으며, 소규모 팀이 막대한 자금을 생산적으로 배치할 수 있는 이유를 설명한다. 또한, 개방형 소스와 전문 모델의 역할, 그리고 애플리케이션이 점점 더 많은 가치를 포착하고 있는 이유에 대해 논의한다.

AI + a16z
News·

OpenAI의 Joshua Achiam, AGI 시대에 대한 논의

Joshua Achiam은 AI 사이버 보안, 최전선 모델의 능력, 그리고 사회가 이미 AGI 시대에 접어들었을 수 있다는 의견을 나누었다. 그는 AI의 사이버 능력이 빠르게 발전하고 있으며, 국가 지원 해킹, 모델 탈옥, 재귀적 자기 개선에 대해 논의했다. 또한 AI 시스템이 인간보다 더 빠르게 취약점을 발견할 경우 발생할 수 있는 문제에 대해 설명했다.

AI + a16z
News·

AI in the AM 리론치 주간 하이라이트

AI in the AM의 리론치 주간에서는 4개의 라이브 세션과 9명의 게스트가 참여하여 프론티어 AI의 점검, 내부 시스템과 공개 접근의 격차, 능력의 현황, 물리적 인프라 비용에 대해 논의했다. FAR.AI의 Adam Gleave는 에이전트 조정 공격과 방어가 인간을 배제하고 있으며, 현재 모니터링이 실패를 놓치고 있다고 주장했다. Alex Turner는 Google DeepMind에서의 사임 경험을 바탕으로 독립 평가와 시행 가능한 기준의 중요성을 강조했다.

The Cognitive Revolution
News·

Generative Recommenders가 대규모 추천 시스템을 재정의하다

추천 시스템(RecSys)은 소비자 인터넷 산업에서 가장 보편적인 머신러닝 문제 중 하나로, 대규모로 훈련하고 제공하기가 어렵다. 최근 LLM의 출현으로 전통적인 임베딩 유사성 기반 목표에서 생성적 목표로의 전환이 이루어졌다. 이는 사용자 기록의 시퀀스를 기반으로 대규모 카탈로그에서 다음 행동이나 항목을 예측하는 것을 목표로 한다.

NVIDIA Technical Blog
News·

Scott Aaronson과 Hendrik Kirchner의 AI 텍스트 워터마킹 솔루션

Scott Aaronson과 Hendrik Kirchner는 AI 텍스트 워터마킹 문제를 해결하였다. 이 방법은 AI의 출력이 비결정적이며, 비밀 키에서 파생된 의사 난수 소스를 사용하여 워터마크를 적용한다. 유럽연합의 AI 모델에 대한 코드에 따라 Anthropic은 Claude 출력에 워터마킹을 적용할 예정이다. Google은 Gemini 3.7 Flash에 이 기능을 구현하였다.

Don't Worry About the Vase (Zvi Mowshowitz)
News·

250M 파라미터 모델을 30B 토큰으로 학습하여 60MB로 배포한 양자화 LLM

250M 파라미터 모델이 30B 토큰의 데이터로 학습되었으며, 양자화로 인해 전체 배포 크기는 60MB로 줄어들고 실행 시 약 80MB의 RAM이 필요하다. 일반 노트북 CPU에서 초당 약 400 토큰을 처리할 수 있으며, 가장 최근의 2048 토큰은 fp16으로 유지되고, 이전 토큰은 1비트로 압축되어 디스크에 저장된다. 모델의 언어 모델링 품질은 cross entropy 3.15 nats per token, perplexity 23.3으로 측정되었다. 모든 131k 토큰에 대해 고정된 512비트 코드가 사용되며, 훈련된 파라미터는 없다.

r/MachineLearning
News·

LLM의 간결한 출력 방식이 비용 절감에 미치는 영향

Claude Code는 간결한 출력 스타일을 도입하여 LLM의 출력 내용을 짧게 유지할 수 있게 했다. 연구 결과, 출력 내용을 줄이는 것이 평균 1.5배, 최악의 경우 3배까지 비용을 절감할 수 있으며, 이는 여러 언어에서도 효과적이었다. 반면, 입력 프롬프트를 줄이는 경우 비용이 최대 96% 증가하고 정확도가 떨어졌다. 출력 토큰이 입력 토큰보다 비용이 더 비쌌으며, 간결한 출력을 요구하는 것이 짧은 단일 작업에서 비용 절감에 도움이 된다.

r/MachineLearning
News·

LightGBM과 CatBoost의 상호작용 모델링 차이

한 사용자가 LightGBM과 CatBoost를 사용하여 두 개의 설명 변수와 상호작용 변수를 포함한 회귀 모델을 실험했다. LightGBM은 설명 변수 'A'와 'B'만으로 0.5의 예측값을 도출했으나, 상호작용 변수 'AB'를 포함했을 때는 상수 0으로 예측했다. 반면 CatBoost는 'AB' 없이도 데이터를 완벽하게 맞췄다. 사용자는 LightGBM이 'AB'로 완벽한 분할을 할 수 있어야 한다고 생각했지만, 실제로는 그렇지 않았다.

r/MachineLearning
News·

Simile AI, 20억 달러 시리즈 B 투자 유치 및 인간 행동 모델링

Simile AI는 2024년 여름에 20억 달러 규모의 시리즈 B 투자를 유치했으며, GreenOaks와 Index Ventures의 지원을 받았다. 이들은 CVS와 같은 Fortune 100 고객을 위해 수천만 개의 시뮬레이션을 실행하고 있으며, 인간 포커스 그룹 대비 85~99%의 정확도를 기록하고 있다. Joon Sung Park은 인간 행동의 디지털 쌍둥이를 생성하여 85%의 정확도로 인간의 반응을 재현하는 연구를 진행하고 있다.

Latent Space (swyx & Alessio)
News·

Anthropic, OpenAI의 분기 매출 초과

Anthropic이 분기 매출에서 OpenAI를 초과했다. Merck와 Moderna는 개인 맞춤형 mRNA 암 치료의 첫 번째 긍정적인 3상 임상 결과를 보고했다. Generalist는 몇 초의 시연으로 로봇을 교육하는 기술을 개발했다. Flock은 경찰 감시를 확대했으며, FTC는 비밀 개인 맞춤 가격 책정을 겨냥하고 있다.

The Neuron
News·

AI의 에너지 스케일링 법칙

AI는 클라우드에서 작동하지 않고, 변전소, 냉각 루프, 전송 네트워크 및 발전소에서 작동한다. 다음 스케일링 법칙은 매개변수뿐만 아니라 문명이 광자와 원자를 유용한 지능으로 변환하는 효율성에 관한 것이다. 현대 AI 애플리케이션은 거의 무게가 없는 경험을 제공하며, 그 뒤에는 수십억 개의 트랜지스터를 스위칭하는 가속기, 텐서를 이동하는 메모리 시스템, 냉각수를 순환시키는 펌프, 전압을 재형성하는 변압기, 운동, 햇빛 또는 핵 반응을 전자로 변환하는 발전기가 있다. 클러스터에 들어오는 거의 모든 줄은 결국 열로 방출된다.

TheSequence (Jesus Rodriguez)
News·

OpenAI의 C-suite 변화와 HuggingFace 공격 후속 조치

OpenAI는 최근 C-suite의 변화에 대한 투자자들의 질문 속에서, HuggingFace 공격 이후 문제를 진단하고 새로운 안전 장치를 마련하기 위해 개발을 일시 중단하는 초기 조치를 취하고 있다. Anthropic은 IPO를 준비하며 수익이 증가하고 있지만, 내부적으로 여러 문제를 안고 있다. 또한, AI의 재귀적 자기 개선 가능성에 대한 논의가 진행되고 있다.

Don't Worry About the Vase (Zvi Mowshowitz)
News·

VentureBeat, Rob Strechay를 첫 Lead Analyst로 임명하여 기업 AI 연구 강화

Rob Strechay가 VentureBeat의 첫 Lead Analyst로 합류했다. 그는 기업 AI의 기술적 결정권자들을 위한 분석을 제공하며, 클라우드 인프라, 고급 데이터 인프라, 플랫폼 엔지니어링 및 DevOps 오케스트레이션에 초점을 맞출 예정이다. Strechay는 AI 인프라 및 컴퓨트 설문조사에 기여했으며, 기업 AI 인프라 내의 GPU 활용 분석을 수행했다. 또한, VB In Conversation 비디오 인터뷰 시리즈를 통해 기업 AI 시스템의 실제 배포 장벽과 인프라 현실을 조명할 계획이다.

VentureBeat — AI
News·

AI가 수학 분야에 미치는 영향과 수학자들의 위기

OpenAI는 수학의 오랜 문제에 대한 해결책을 발표하여 수학 커뮤니티에서 큰 논란을 일으켰다. AI는 초등학교 산수에는 여전히 취약하지만, 고급 추상 수학에서는 점점 더 능숙해지고 있다. 이는 수학의 본질과 수학자들의 역할에 대한 근본적인 질문을 제기하고 있다. AI 모델은 과거 6개월에서 1년 사이에 전문적인 수준으로 발전했으며, 여전히 기본적인 산수에는 약하지만 고급 수학 문제 해결에는 효과적이다.

The Verge — AI
News·

하이브리드 PDE-파라미터 추정에서의 연산자 오류 감지 및 구별

하이브리드 PDE-파라미터 추정기의 연산자가 잘못되었는지를 단일 피팅으로 판별할 수 있는 도구를 개발하였다. 특정 자가-자기 파라볼릭 역문제에서 정보 행렬 통계량이 올바른 사양 하에 중앙값 0.19를 보였고, 사전 등록된 상한 0.10에 대해 0.033의 기각률을 기록하였다. 두 가지 잘못된 사양 하에서는 각각 224와 85로 증가하였다. 잘못된 추정기의 도메인 내 RMSE는 2.7×10^{-2}로 관측 잡음보다 낮았다.

arXiv cs.LG (머신러닝)
News·

목표 지향 대화에서의 개인화된 LLM 에이전트 연구

이 연구는 대화형 시스템이 사용자의 성격에 적응하면서도 작업을 완료할 수 있는지를 탐구한다. 연구팀은 두 개의 LLM 간의 상호작용을 시뮬레이션하는 훈련 없는 프레임워크를 구축하였으며, 사용자의 성격 정보를 세 가지 조건(Neutral, Try, Oracle)으로 조정하여 평가하였다. GPT-4o, Qwen3-Next-80B, Gemini 2.0 Flash를 사용하여 호텔과 레스토랑 대화에서 성격 표현과 작업 성능 간의 관계를 분석하였다. 결과적으로, 사용자의 성격에 적응하는 것이 제약 만족도, 정보 제공률, 사용자 만족도를 향상시키지만 진실성은 낮아지는 상충 관계가 발견되었다.

arXiv cs.CL (계산언어학·NLP)
News·

250달러로 만든 미니 Kimi-K3, GPT-2(124M) 성능 초과

1.02억 개의 파라미터를 가진 Kimi K3 복제 모델을 250달러에 제작하였으며, 50억 개의 정제된 토큰으로 사전 훈련을 진행했다. 이 모델은 1.02억 개의 파라미터 중 1억 4500만 개가 토큰당 활성화된다. HellaSwag 테스트에서 33.4%의 점수를 기록하여 GPT-2 124M의 28% 점수를 초과했다. K3의 아키텍처를 기반으로 하며, K3의 163,840 토큰 토크나이저를 수정 없이 사용했다.

r/LocalLLaMA
News·

Skala 1.1, DFT 정확도 향상 및 접근성 확대

Skala 1.1은 Microsoft Research의 심층 학습 DFT 접근 방식의 지속적인 개선을 보여준다. 이 모델은 이전 버전보다 2.5배 많은 데이터로 훈련되어 열화학, 반응 동역학, 분자 구조 예측 등 주요 분자 시뮬레이션 과제에서 상당히 높은 정확도를 제공한다. Skala는 현재 CP2K에서 사용 가능하며 Psi4, FHI-aims, ORCA, VASP에 통합되고 있다. Skala-1.1은 GMTKN55 벤치마크에서 55개 카테고리 중 32개에서 1위를 기록하며, 메타-GGA 기능의 계산 비용으로 최고의 글로벌 하이브리드 기능을 초월하는 성능을 보여준다.

Microsoft Research Blog