Category
AI 리서치·논문
arXiv 논문과 대형 연구소의 기술 리포트를 추적하는 카테고리다. 모델 아키텍처, 학습 기법, 벤치마크 결과처럼 6개월 뒤 제품에 들어올 흐름을 미리 읽는다. 한국 개발자가 논문 전문을 다 읽지 않고도 핵심과 재현 가능성을 가늠하도록 정리한다.
정신 건강 지원을 위한 대규모 언어 모델의 안전성 확보 기준 제안
대규모 언어 모델(LLM)은 정신 건강 지원에 중요한 역할을 하고 있으나, 상업적 목표가 지속적인 참여를 선호하여 효과적인 심리적 지원에 필요한 마찰을 간과하고 있다. 개발자의 안전 대응은 주로 가시적이고 급성의 피해를 다루는 데 집중되어 있으며, 의존성, 경계 침식, 왜곡된 신념의 증폭과 같은 장기적인 위험 패턴은 덜 주목받고 있다. LLM을 구조적으로 안전하게 만들기 위해서는 임상 실습의 안전성을 보장하는 사회적 방식과 유사한 세 가지 수준의 정렬이 필요하다: 1) 임상 실습의 규범적 약속에 기반한 명시적 가치 명세, 2) 모델에 이러한 가치를 내재화하는 훈련, 3) 배포 중 드리프트 및 장기적 피해를 감지하는 감독. 이러한 정렬을 통해 '정렬 가능성(alignment plausibility)'이라는 개념을 제안하며, 이는 AI의 긍정적 건강 결과와 안전성을 주장할 수 있는 원칙적인 방법이다.
프라이버시와 지능형 로봇 의수의 통합: 아이디오바이오닉스
인간의 신체와 디지털 시스템을 밀접하게 결합한 기술들이 증가하고 있으며, 로봇 의수가 그 대표적인 예이다. 로봇 의수는 고급 센서와 인공지능 기반 제어 방식을 통합하여 지각적이고 반응적인 기능을 갖추고 있다. 그러나 이러한 기술 발전은 사용자 프라이버시를 침해할 수 있는 위협 요소도 동반한다. 본 논문에서는 프라이버시와 지능형 로봇 의수의 교차점에서 발생하는 문제를 조사하기 위한 새로운 연구 분야인 아이디오바이오닉스를 소개하고, 관련 문헌을 바탕으로 정의하며, 지능형 로봇 의수 설계를 악용할 수 있는 잠재적 공격에 대한 초기 증거를 제시한다.
Aurora 1.5: 기상 및 지구 시스템 응용을 위한 오픈 파운데이션 모델 확장
Aurora 1.5는 Microsoft의 Aurora Earth System 파운데이션 모델의 주요 확장으로, 에너지, 농업, 운송 및 기후 위험과 관련된 22개의 새로운 기상 변수를 추가하고 시간 해상도를 시간 단위로 설정하며 확률적 앙상블 예측 기능을 포함한다. 이 모델은 GitHub에서 오픈 소스로 공개되었으며, Hugging Face에 모델 체크포인트가 제공된다. Aurora 1.5는 Microsoft Weather 서비스와 연결되어 데이터, 인프라, 관리된 접근 및 운영 사용을 지원한다.
Thinking Machines의 AI 개발 방향과 목표
Thinking Machines의 목표는 인간의 의지와 판단을 확장하는 AI를 구축하는 것이다. 현재 사용 중인 대부분의 AI는 특정 장소에서 훈련된 후 고정되어 있으며, 사용자와의 상호작용에서 학습하지 않는다. 이들은 강력한 모델 훈련, 사용자 맞춤형 도구 개발, 인간과 기계 간의 소통 채널 확대, 연구 결과 발표를 통해 AI의 발전을 도모하고 있다.
LSTM과 전통 모델을 활용한 감정 분석 연구
소셜 미디어, 특히 트위터는 사람들이 다양한 이슈와 사건에 대한 의견과 감정을 실시간으로 공유하는 공간이 되었다. 감정 분석은 NLP의 중요한 응용 분야로, 사용자 생성 콘텐츠의 대량 유입으로 인해 필수적이 되었다. 이 연구에서는 로지스틱 회귀, 랜덤 포레스트, 나이브 베이즈, 그래디언트 부스팅, LSTM 네트워크 등 다양한 기계 학습 및 심층 학습 접근 방식을 평가하였다. LSTM 모델은 Kaggle Twitter 데이터셋을 사용하여 전처리 후 최적의 감정 분석 모델을 식별하였으며, 훈련 정확도 90.98%, 테스트 정확도 80.00%, 마이크로 평균 ROC-AUC 점수 0.92를 기록하였다. 이 결과는 LSTM 모델이 전통적인 기계 학습 기법보다 문맥적이고 순차적인 텍스트 측면을 포착하는 데 우수함을 보여준다.
Elan Barenholtz의 자생적 언어 이론과 Harris의 통합주의
Roy Harris의 통합주의 언어학은 언어가 사전적으로 주어진 세계에 매핑되는 코드가 아니라, 공동 행동을 지향하는 상황적 이중 활동이라고 주장한다. 그러나 통합주의는 기호가 미래의 개방성을 유지하는 구조적 메커니즘과 언어적 및 비언어적 기호 활동 간의 연속성을 충분히 설명하지 못하며, 과거의 통합 기록의 구조적 특성에 대한 자세한 설명이 부족하다. Elan Barenholtz의 자생적 언어 이론은 이러한 간극을 메우며 통합주의를 풍부하게 한다. 이 이론은 Harris가 강조한 이중적 의사소통의 중심인 미래 지향적 개방성을 위한 구조적 메커니즘과 언어와 다른 기호 제작 활동 간의 연속성에 대한 계산적 상관관계를 제공한다.
LLT: PDE 연산자 학습을 위한 로컬 선형 트랜스포머
LLT(Local Linear Transformer)는 PDE(편미분방정식) 연산자 학습을 위한 새로운 아키텍처로, 선형 글로벌 주의와 지역 공간 혼합을 결합하고 좌표 및 기하학 정보를 포함한다. LLT는 탄성, 소성, 에어포일 유동, 파이프 유동, 다르시 유동 등 여러 PDE 문제에서 평가되었으며, 이전 연구의 다른 신경 연산자 및 트랜스포머 기준선과 비교하여 경쟁력 있는 상대 $L_2$ 오류를 달성했다. 또한, 구조화된 이산화에서 훈련 반복당 벽시계 시간은 Transolver에 비해 1.8배에서 2.5배 감소했다. LLT는 32,186개의 비구조화 메쉬 포인트를 가진 3차원 자동차 공기역학 데이터셋에도 적용되었다.
Qwen3.6 NVFP4 모델의 성능 향상
Qwen3.6 27B 모델의 NVFP4 양자화가 2.5배 빨라졌으며, 35B-A3B 모델은 NVIDIA의 NVFP4 양자화에 비해 1.56배에서 1.79배 더 빠른 성능을 보인다. 이 과정에서 정확도 저하 없이 W4A4를 사용하여 실제 4비트 텐서 코어로 행렬 곱셈을 수행했다. FP8 KV 캐시 보정 기능이 추가되어 2배 더 긴 컨텍스트를 자동으로 허용한다. NVFP4-Fast와 NVFP4 두 가지 35B 버전이 제공되며, NVFP4-Fast는 W4A4를 완전히 활용하고 NVFP4는 혼합 방식을 사용하여 약간 더 높은 정확도를 유지한다.
1800년대 텍스트로 LLM 훈련, 160GB 데이터셋 사용
한 사용자가 1800년대 런던 데이터를 기반으로 언어 모델을 사전 훈련하기 시작했으며, 최근 40B 토큰, 160GB의 1800-1875년 영어 데이터를 포함하는 최대 데이터셋을 완성했다. 현재 2B 파라미터 모델을 훈련할 예정이며, 500M 파라미터의 평가 모델을 5B 토큰 샘플로 훈련하였다. 이 모델은 1800년대의 Q&A 쌍으로 미세 조정되어 역사적 인물, 장소, 사건에 대한 질문에 답할 수 있다.
Adam Brown의 일반 상대성이론 소개
Adam Brown이 일반 상대성이론의 핵심 아이디어를 설명하며, 아인슈타인이 발견한 '가장 행복한 생각'에 대해 이야기한다. 이론의 중심에는 질량이 가속을 저항하는 것과 중력이 끌어당기는 질량이 동일하다는 원리가 있다. 또한, 블랙홀에 대한 강의도 진행되며, 블랙홀의 관찰자와 멀리 있는 방관자의 경험이 어떻게 다를지를 설명한다. 마지막으로 Google DeepMind의 Blueshift 팀과 AI가 일반 상대성이론을 재발견할 가능성에 대해 논의한다.
Fundamental의 NEXUS, 구조화된 데이터 분석을 위한 대형 표 모델 개발
Fundamental은 2026년 2월 5일에 NEXUS라는 대형 표 모델(LTM)을 발표했다. 이 모델은 구조화된 데이터 분석에 특화되어 있으며, 기존의 기계 학습 알고리즘과 달리 다양한 예측 작업에 최소한의 맞춤형 특성 엔지니어링으로 적용될 수 있다. NEXUS는 수십억 개의 테이블로 사전 훈련되어 있으며, 데이터의 맥락을 이해하여 보다 정확한 예측을 가능하게 한다. 현재 Amazon Web Services와 같은 기업들이 이 모델을 채택하고 있다.
얼굴 인식 기술의 발전 역사와 주요 연구
1960년대, Woodrow Wilson Bledsoe는 사진으로 사람을 식별하는 시스템을 연구하였고, 1973년 Takeo Kanade는 컴퓨터가 얼굴 특징점을 자동으로 인식하는 기술을 발표했다. 1991년, Matthew Turk와 Alex Pentland는 PCA를 활용한 Eigenfaces 논문을 발표하여 얼굴을 통계적으로 분석하는 방법을 제시했다. 2000년대에는 LBP(Local Binary Pattern) 기술이 조명 변화에 강한 얼굴 인식을 가능하게 하였고, 2014년 Facebook의 DeepFace는 97.35%의 정확도로 인간의 평균 정확도에 근접했다. 이후 Google의 FaceNet은 99.63%의 정확도를 기록하며 얼굴 인식의 성능을 크게 향상시켰다.
토스의 2,800만 MAU 분석을 위한 유저 세그먼트 TUES 소개
토스의 Director of Data Analytics 우찬희는 2,800만 MAU를 분석하기 위해 TUES(Toss User Engagement Segment)를 활용하고 있다고 설명했다. TUES는 유저의 서비스 이용 패턴을 기준으로 세그먼트를 구성하여, 각 유저가 어떤 서비스를 선호하는지를 파악할 수 있는 도구이다. TUES V1은 K-Means Clustering을 사용하여 유저를 묶었으나, V2에서는 서비스별 이용 횟수를 반영하고 Soft Clustering 알고리즘을 적용하여 유저의 복합적인 이용 패턴을 분석할 수 있게 되었다. V2는 세그먼트 구조를 세 층으로 나누어 유저의 행동을 더 다각적으로 이해할 수 있도록 개선됐다.
AI 기업의 가치 포착과 고객 잠금 현상에 대한 논의
AI 기업들은 현재 추정되는 4~8조 달러의 AI 인프라 투자 회수 방법에 대한 질문에 직면해 있다. AI 기업들은 주로 추론에 대한 요금을 부과하여 수익을 얻고 있지만, 모델의 차별성이 부족하고 전환 비용이 낮아 높은 마진의 비즈니스 구축에 어려움을 겪고 있다. 연구자들은 AI 기업들이 수익성을 확보하기 위해 모델 계층이 아닌 더 높은 단계로 이동해야 한다고 주장하며, 이는 수직 통합과 기업 배치, 전환 비용 구축을 통해 가능하다고 본다.
AI:AM 하이라이트: Anthropic의 J-space와 AI 슈퍼포캐스터
Nathan Labenz와 Prakash Narayanan이 진행하는 AI:AM 하이라이트 에피소드에서는 Anthropic의 '글로벌 워크스페이스' 논문과 J-space, J-lens 개념에 대해 논의한다. 이 에피소드는 AI 해석 도구, 예측 기준, 기업 배포 패턴, AI 하드웨어가 시스템의 해석 가능성과 관리 가능성을 어떻게 향상시킬 수 있는지에 대한 논의로 이어진다. 또한, Pangram AI 글쓰기 탐지 실험과 AI 슈퍼포캐스팅에 대한 Dan Schwarz의 의견도 포함된다.
AI 모델의 증류 기법에 대한 심층 탐구 시리즈 시작
이 시리즈는 AI 모델의 증류 기법의 발전과 기본 기술을 다룰 예정이다. 현대 AI 시대는 규모의 언어로 설명되었으며, 더 큰 모델, 데이터셋, 클러스터 등이 발전을 이끌었다. 그러나 규모는 다음 문제를 야기하며, 가장 능력 있는 모델은 비싸고 느리며, 배포와 전문화가 어렵고, 실제 사용 사례에 비효율적일 수 있다. 예를 들어, 은행은 일반적인 대형 모델보다 규정 준수 워크플로우를 이해하는 개인 모델이 필요할 수 있다.
구글의 TabFM: 표 형식 AI를 위한 기초 모델
구글 리서치가 최근 발표한 TabFM은 표 형식 분류 및 회귀를 위한 기초 모델로, 이전에 본 적이 없는 테이블에 대한 예측을 단일 전방 패스에서 수행할 수 있다. 이 모델은 훈련, 조정, 특징 엔지니어링 없이 전체 문제를 하나의 거대한 프롬프트로 제공하면 답변을 생성한다. TabFM은 TimesFM의 개발 팀이 만든 것으로, 시간 시계열 데이터에 대한 예측을 위한 모델이다.
OpenAI의 Sol과 음성 모드 업그레이드 발표
이번 주 OpenAI는 Sol, 즉 GPT-5.6에 대한 내용을 다룰 예정이며, 음성 모드의 업그레이드도 발표했다. Claude와 같은 AI 작문이 점점 더 눈에 띄고 있으며, Grok 4.5도 출시되었다. Fable은 절차적 판타지 왕국 생성기를 구축할 수 있는 기능을 제공하며, 사용자에게 예상치 못한 기능을 제공하는 경향이 있다.
The Sequence의 후원 없이 운영되는 AI 관련 출판물
The Sequence는 2년 이상 후원 없이 운영되고 있으며, 매주 후원 요청을 받고 있다. 이 출판물은 AI 세계를 탐색하는 데 도움을 주기 위해 기술적 깊이와 객관성을 유지하고자 한다. 최근 Dwarkesh Patel의 에피소드에서 'grindability'가 'verifiability'만큼 중요하다는 주장이 제기되었고, 이는 AI 도메인의 품질을 평가하는 새로운 시각을 제공한다.
농업 AI의 데이터 준비 상태와 그 중요성
AI는 농업에서 가능성을 변화시키고 있으나, 효과적인 AI 솔루션을 위해서는 깨끗하고 견고한 데이터 기반이 필요하다. 연구에 따르면 AI 기반 예측 모델은 작물 수확량을 26% 향상시키고, 물 사용량을 41% 줄이며, 화학물질 사용량을 33% 감소시킬 수 있다. 그러나 데이터가 불완전할 경우 AI는 신뢰할 수 없는 결과를 생성할 위험이 크다. 농업의 데이터 환경은 복잡하며, IoT 기기와 외부 데이터 소스를 통합하는 것이 중요하다. 데이터 준비 상태는 AI의 성과와 밀접하게 연관되어 있으며, 정확하고 일관된 데이터 모델이 필요하다.
Anthropic, Claude Opus 4.6의 J-space 발견
AI 기업 Anthropic은 Claude Opus 4.6에서 J-lens라는 도구를 사용하여 J-space라는 숨겨진 영역을 발견했다. 이 J-space는 모델이 향후 생성할 가능성이 있는 단어와 관련된 개별 단어들을 포함하고 있으며, 이를 통해 모델의 내부 작동 방식을 더 잘 이해하고 제어할 수 있는 방법을 제시한다. J-lens는 모델이 다음에 생성할 단어를 예측하는 것 외에도 미래의 유용한 토큰을 계산하는 과정을 보여준다. 예를 들어, Claude가 수학 문제를 해결할 때 J-space는 중간 결과를 포함한 단어들을 드러낸다.
QANTIS: IBM Heron 하드웨어에서의 순차적 POMDP 신념 업데이트
QANTIS는 양자 프로세서를 신념 업데이트 서비스로 활용하여 이전 신념과 관찰 모델을 바탕으로 희귀 사건 증거 항을 추정하고 고전 계획자에게 일반적인 사후 확률을 반환한다. 이 연구는 IBM Heron 하드웨어에서 순차적 Tiger POMDP 수평을 통해 이 서비스를 재사용할 수 있는지를 조사하며, 하드웨어 사례 연구를 통해 결과를 도출하였다. 연구에서는 증폭 없이, 보호된 Grover 증폭, 모든 단계 고정점 증폭을 비교하고, 반환된 사후 확률이 하류 행동에 영향을 미치는지를 확인하였다. 모든 단계 FPAA는 8단계 및 12단계 주행에서 Tiger 사후 확률을 보존하며, 20단계 및 32단계 제어는 동일한 운영 범위 내에 유지된다.
SageMath와 LLM 에이전트를 활용한 수학 문제 해결 평가
최근 AI 수학 분야에서는 자동 형식화와 정리 증명에 초점을 맞추고 있으며, 컴퓨터 대수 시스템(CAS)의 역할은 충분히 탐구되지 않았다. 본 연구에서는 LLM 추론과 SageMath의 검증 가능한 피드백을 결합한 ReAct 스타일의 에이전트 설정을 제안하고, 이를 통해 RealMath 벤치마크의 연구 수준 수학 문제를 해결하는 성능을 평가하였다. SageMath 접근을 통해 모든 평가 모델에서 평균 9.7%의 성능 향상이 있었으며, Qwen 3.7-Max는 SageMath의 혜택을 가장 많이 받았고, GPT-5.5는 75.2%의 해결률과 가장 낮은 토큰 사용량을 기록하였다. 이 연구는 CAS가 보강된 에이전트가 수학자들의 계산 탐색을 지원하는 유망한 방향임을 제시한다.
불균형 데이터셋에서의 마진 컨포멀 예측의 한계와 클래스 조건 수정
컨포멀 예측은 약물 발견에서 모델 신뢰성을 평가하는 데 사용되며, 선택한 오류율 alpha에 따라 실제 레이블을 포함하는 예측 세트를 반환한다. 그러나 불균형 데이터셋에서는 마진 컨포멀 예측이 소수 클래스의 커버리지를 심각하게 저하시킨다. 네 개의 데이터셋에서 소수 클래스의 커버리지가 혈뇌 장벽 침투에서는 64.8%, 임상 시험 독성에서는 4.2%로 떨어졌다. 클래스 조건 컨포멀 예측(Mondrian)은 모든 데이터셋에서 소수 클래스 커버리지를 목표로 회복시키며, 예측 세트 크기의 적당한 증가로 이를 달성한다.