Category
AI 리서치·논문
arXiv 논문과 대형 연구소의 기술 리포트를 추적하는 카테고리다. 모델 아키텍처, 학습 기법, 벤치마크 결과처럼 6개월 뒤 제품에 들어올 흐름을 미리 읽는다. 한국 개발자가 논문 전문을 다 읽지 않고도 핵심과 재현 가능성을 가늠하도록 정리한다.
Amazon Nova 2의 Self-Distilled Reasoning을 통한 SFT 개선
Supervised Fine-Tuning(SFT) 과정에서 고품질의 chain-of-thought(CoT) 추론을 생성하는 것이 비현실적이고 비용이 많이 드는 경우가 많다. Amazon Nova 2 모델은 추론 능력이 뛰어나며, SFT에서 golden CoT 추적이 필요하다. Self-Distilled Reasoning(SDR)은 Nova 2 Lite 모델의 추론을 활용하여 비추론 데이터셋에 대한 대체 수단을 제공하며, SFT의 성능을 개선하고 catastrophic forgetting 문제를 완화한다. SDR은 기존 SFT 데이터셋에 적용 가능하며, 모델 병합보다 목표 성능과 일반 성능을 모두 보존하는 데 효과적이다.
GRPO를 통한 RLHF 특성 설치 실패 사례
한 연구자가 RTX 3090을 사용해 GRPO를 통해 특성을 설치하려 했으나, 결과가 +2.4 포인트에 그쳤다. 연구자는 20개의 훈련 프롬프트가 너무 적다고 지적하며, 특성 지속성을 목표로 하고 있다. 사용된 모델은 Qwen2.5-7B-Instruct이며, 보상은 모델 평가를 통해 이루어졌다.
AI의 요청 이해 격차를 측정하는 제니 계수 제안
AI는 사용자의 요청을 이해하는 데 있어 종종 격차가 발생하며, 이를 해결하기 위한 새로운 메트릭인 제니 계수를 제안한다. 인간의 언어는 항상 불완전하게 명시되며, AI는 요청을 잘못 이해할 수 있는 여지가 크다. 최근 AI 모델들은 사용자 요청에 대해 더 적극적으로 행동하지만, 이러한 행동이 의도와 다를 수 있어 주의가 필요하다.
영국 정부, 개방형 모델과 폐쇄형 모델의 사이버 보안 격차 축소
영국 AI 보안 연구소(AISI)는 개방형 모델(GLM-5.2, DeepSeek V4-Pro)과 폐쇄형 모델 간의 사이버 보안 능력 격차가 줄어들었다고 발표했다. GLM-5.2는 Claude Opus 4.6와 비슷한 성능을 보이며, DeepSeek V4-Pro는 Claude Opus 4.5와 GPT-5 사이에 위치한다. Kimi K3는 2.8 조 개의 매개변수를 가진 모델로, 주요 폐쇄형 모델과 유사한 성능을 보인다. Kimi K3는 GPU 컴파일러 MiniTriton을 개발하고, 48시간 동안 자율적으로 칩을 설계했다.
Xaira의 X-Cell 모델과 X-Atlas 데이터셋을 통한 약물 개발
Xaira Therapeutics는 정보가 풍부한 데이터가 AI 기반 약물 개발의 핵심이라고 판단하고, X-Atlas라는 데이터셋과 X-Cell이라는 모델을 개발했다. X-Atlas는 CRISPR 기반 실험을 통해 수백만 개의 테스트를 병렬로 수행하여 생성된 데이터로 구성되어 있으며, X-Cell은 RNA 발현 변화를 예측하는 데 중점을 두고 있다. CELLxGENE 데이터베이스의 168M 세포 정보를 활용하여 세포 유형과 상태 간의 관계를 모델링하고 있으며, 이는 약물이나 유전자 편집을 통해 세포의 반응을 예측하는 데 기여할 수 있다.
B2B와 B2C 검색 환경 변화에 따른 사용자 검색 패턴 분석
B2B와 B2C 검색 환경에서 사용자들이 검색하는 키워드가 다르다는 점이 강조된다. B2B에서는 'SEO 회사 추천'과 같은 키워드 대신, 상황을 반영한 검색이 이루어지며, 이는 불안과 의심에서 비롯된다. B2C에서는 사용자가 시술명보다 '시술을 검색하게 만든 순간'을 검색하며, 예를 들어 탈모의 경우 '정수리가 비쳐 보이는 순간'이 검색의 시작점이 된다. 이러한 패턴 변화에 따라 콘텐츠 구조와 제목을 수정해야 한다.
Hugging Face CEO, AI 규제와 오픈소스의 미래에 대한 의견
Hugging Face CEO Clément Delangue는 AI 규제, 오픈소스 안전성, 모델 라우팅에 대해 논의하며, 경쟁이 산업의 미래에 필수적이라고 강조했다. 그는 GPT-5, 정부의 프론티어 모델 감독, Hugging Face의 연간 반복 수익이 1억 달러를 초과한 점, 중국의 오픈소스 생태계, 유럽의 AI 야망에 대해 언급했다. 또한, 전문화된 모델 간의 작업 부하 라우팅이 AI에서 가치 창출 방식을 근본적으로 재편할 수 있다고 말했다.
Thinking Machines Lab의 Inkling 모델과 Moonshot AI의 Kimi K3 모델 발표
Thinking Machines Lab은 9750억 개의 파라미터를 가진 Inkling 모델을 발표했다. 이 모델은 41억 개의 활성 파라미터와 텍스트, 이미지, 오디오 입력을 지원하며, 100만 토큰의 컨텍스트 윈도우를 갖추고 있다. Moonshot AI는 2.8조 개의 파라미터를 가진 Kimi K3 모델을 소개했으며, 이는 896명의 전문가 중 16명을 활성화하고, 비전과 100만 토큰의 컨텍스트를 지원한다. PrismML은 5.9GB의 크기를 가진 Bonsai 27B 모델을 발표했으며, 이는 현대 스마트폰의 메모리에 적합하다고 주장하고 있다. OpenAI는 GPT-Red라는 내부 자동화된 레드팀 시스템을 도입하여 다른 모델의 취약점을 발견하고 공격하는 데 사용하고 있다.
Demis Hassabis, AGI와 프론티어 AI 표준 기구 제안
Google CEO Demis Hassabis는 AGI(인공지능 일반화)의 책임 있는 개발을 위해 미국 정부 내에 프론티어 AI 표준 기구를 제안했다. 이 기구는 기술 기준에 따라 프론티어 모델을 평가하고, 취약점을 사전 및 사후에 해결하는 역할을 할 것이다. 그는 AGI가 전 인류에 큰 변화를 가져올 기술이라고 강조하며, 이 기술의 영향력이 산업 혁명보다 10배 클 것이라고 주장했다.
AI가 채용에서 인간보다 더 많은 편견을 형성할 가능성
연구에 따르면, LLMs(대형 언어 모델)는 훈련 데이터에서 인간의 편견을 학습할 뿐만 아니라 경험을 통해 스스로 편견을 형성할 수 있으며, 이는 인간보다 더 많은 고용 지원자에 대한 고정관념을 만들어낸다. 프린스턴 대학교와 시카고 대학교의 연구자들은 ChatGPT, Claude, Gemini와 같은 LLMs를 채용 게임에 적용하여 모델들이 지원자의 성공 여부에 따라 인종 그룹을 분리하는 경향을 보였음을 발견했다. 모델들은 특정 인종 그룹의 지원자가 실패했을 때, 해당 그룹의 지원자를 다른 직무로 배치하는 경향을 보였으며, 이는 인간 참가자보다 65% 더 높은 편견 점수를 기록했다. 또한, 모델들은 개인에 대한 더 많은 정보를 제공받았을 때 편견이 줄어드는 경향을 보였다.
Kimi K3와 오픈 웨이트 모델의 비용 구조
Kimi K3는 중국에서 개발된 오픈 웨이트 모델로, 최신 기술 수준에 근접하고 있으며, 운영 비용이 발생한다. Kimi K3는 입력 토큰당 3달러, 출력 토큰당 15달러의 비용이 드는 반면, Sol은 입력 토큰당 5달러, 출력 토큰당 30달러로 더 비쌉니다. AI 모델의 운영 비용(COGS)은 수익과 직접적으로 연관되어 있으며, 이는 오픈 웨이트 모델이 단순히 무료로 제공되지 않음을 의미한다.
다중 에이전트 수학 추론에서 검토자의 정확도가 비판 수용을 보장하지 않음
많은 수학 및 과학 지향 에이전트 시스템은 전담 검토 단계가 잘못된 후보를 올바른 후보로 전환하는 데 도움이 될 것이라고 가정하고 계층적 설계를 사용한다. 4,181개의 검증자 기반 Omni-MATH 문제를 사용하여 이 가정을 테스트한 결과, 협업은 가장 쉬운 수준에서는 큰 효과를 보이지 않지만, 4단계 이후에는 방송 스타일의 동료 토론이 계획-실행-검토(PER) 파이프라인보다 더 높은 최종 정확도를 달성하는 것으로 나타났다. PER의 검토자는 방송의 검토자보다 더 높은 정확도(0.861 vs. 0.644)를 보였지만, 유용한 비판이 다음 후보를 변경할 가능성은 낮았고, 검토자 주도의 수정을 생성하는 데도 낮은 결과를 보였다. 이러한 결과는 검토자 탐지 품질과 비판 수용이 경험적으로 분리 가능함을 보여준다.
Causal-Audit: 명시적이고 감사 가능한 그래프 기반 추론을 위한 목표 인식 인과 체인 구축
Causal-Audit는 맥락 없는 개입 기반 질문 응답을 위한 명시적이고 감사 가능한 인과 추론 프레임워크를 제안한다. 이 방법은 네 가지 모듈 단계에서 명시적 인과 그래프를 통한 구조적 추론으로 인과 추론을 공식화하며, 목표 변수를 그래프 확장 시 핵심 제약으로 다루는 전략을 도입하여 관련 없는 변수와 잘못된 인과 관계를 억제한다. 또한, 여러 인과 경로를 결합하는 경로 수준의 인과 증거 집계 메커니즘을 통해 단일 체인 추론을 넘어서는 강력한 의사 결정을 가능하게 한다. 세 가지 벤치마크에서의 실험 결과, 이 프레임워크는 기존 LLM 기반 방법보다 일관되게 우수한 성능을 보이며 해석 가능하고 감사 가능한 인과 추론 경로를 제공한다.
정규성을 고려한 확률적 다목적 경량화 알고리즘 제안
다목적 학습(MOL)은 여러 목표를 동시에 최적화하는 것을 목표로 한다. 기존의 확률적 다목적 경량화 알고리즘(SMG)은 미니 배치 샘플링으로 인해 경량화 방향에 편향이 생겨 빠른 수렴 속도가 부족하다. 본 논문에서는 CA 방향이 야코비안 행렬에 대해 $1/2$-홀더 연속임을 보이고, 추가적인 정규성 조건 하에 Lipschitz 연속으로 개선할 수 있음을 제안한다. 이를 바탕으로, 정규성이 있는 경우 CA 방향 업데이트를 활용하고 그렇지 않은 경우 고정된 스칼라화 가중치로 전환하는 확률적 다목적 정규성 인식 방법(MoRe)을 제안한다. 이 방법은 비볼록 설정에서 SMG의 수렴 속도를 $ ilde{ ext{O}}(T^{-1/4})$에서 $ ilde{ ext{O}}(T^{-1/2})$로 개선한다.
Bernoulli Naive Bayes 모델을 이용한 해석 가능한 의료 데이터 분류 프레임워크
블랙박스 모델의 한계를 극복하기 위해, Bernoulli Na"ive Bayes(BNB) 모델을 기반으로 한 해석 가능한 규칙 기반 임상 분류 프레임워크가 소개되었다. 이 방법은 연속 변수를 $ ext{χ}^2$-유도 통계 이진화하여 임상 결과와의 연관성을 극대화하는 임계값을 식별한다. Pima Indians Diabetes, Wisconsin Breast Cancer, Heart Failure Prediction의 세 가지 벤치마크 데이터셋에서 각각 0.800, 0.984, 0.919의 AUC 점수를 기록하며, 확률적 신뢰성을 평가하기 위한 교차 검증 보정 분석이 수행되었다. 이 프레임워크는 복잡한 모델과 유사한 성능을 유지하면서도 명확하고 임상적으로 의미 있는 의사결정 규칙을 제공한다.
qZACH-ViT: 양자화 인식 내재적 설명을 위한 재귀적 기여 안정화 최적화
qZACH-ViT는 효율성과 해석 가능한 증거를 동시에 제공하는 의료 이미지 분류기를 위한 양자화 인식 확장 모델이다. Recursive Attribution-Stabilized Optimization (RASO)을 통해 분류 및 기여 그래디언트를 정규화하고, 분류와 충돌하는 기여 요소를 제거한다. 50개의 훈련 이미지를 사용하여 7개의 MedMNIST 데이터셋에서 280회의 실험을 수행한 결과, qZACH-ViT는 모든 데이터셋에서 평균 0.0313의 성능 향상을 보였으며, RASO를 적용한 경우 평균 0.0368의 향상을 기록했다. ONNX 아티팩트는 원본 체크포인트보다 70.0% 작고, CPU 속도는 1.41배에서 2.39배 향상되었다.
언어 모델에서의 언어화 가능한 표현과 글로벌 작업 공간
이 논문은 대형 언어 모델에서 인간 뇌의 기능적 구분과 유사한 기능적 구분이 나타났음을 보여준다. 새로운 해석 기법인 Jacobian lens를 사용하여 모델이 처리하는 각 시점에서 언어화할 수 있는 표현을 식별한다. 이 표현들은 J-space로 불리며, 글로벌 작업 공간의 특성을 지닌다. J-space는 중간 단계의 레이어에서 일관된 내용을 가지고, 동시에 수십 개의 개념을 보유하며, 모델의 가중치에 의해 다른 표현보다 더 널리 방송된다. 이러한 특성은 모델의 비언어적 사고를 이해하는 데 유용하다.
xHC: Expanded Hyper-Connections을 통한 잔여 스트림 확장
Hyper-Connections (HC)은 Transformers의 잔여 스트림을 N개의 병렬 스트림으로 확장하여 모델의 폭과 깊이를 넘어서는 메모리 확장을 제공합니다. xHC(Expanded Hyper-Connections)는 N=4를 넘어서는 의미 있는 확장을 달성한 최초의 HC-family 방법으로, 18B MoE 모델에서 평균 4.0점의 하향 성능 향상을 보여주며, 훈련 FLOPs는 기존 방법에 비해 적은 비용으로 유지됩니다. xHC-Flash는 확장된 잔여 상태에서 메모리 트래픽을 줄여 효율성을 높입니다.
VICIS: 이미지 세트에서 시각 개념 추론하기
Vision-language models (VLMs)는 복잡한 텍스트 지시를 따를 수 있지만, 순수한 시각적 맥락에서 추론하는 데 어려움을 겪는다. 현재 모델은 예시 이미지 세트에서 공유 개념을 추론하고 이를 새로운 입력에 적용하는 데 실패한다. 이에 따라 Visual Concept Inference from Sets (VICIS)라는 작업이 도입되었으며, 이는 모델이 개념을 정의한 맥락을 유지하면서 쿼리 이미지와 일치하는 새로운 이미지를 생성해야 하는 능력을 평가한다. 최신 VLM들이 이 작업에서 성능이 저조하다는 결과를 보여준다.
이중 서브선형 상호작용 근접 증명 연구
이 연구에서는 이중 서브선형 상호작용 근접 증명(doubly sub-linear interactive proofs of proximity, dsIPPs)에 대해 다룬다. dsIPPs는 대규모 입력에 대한 근사적 주장을 증명하는 데 사용되며, 증명 생성은 입력의 작은 부분만 읽으면 되므로 매우 빠르다. 증명의 근사적 검증은 입력의 더 작은 부분을 읽어야 하며, 정직한 증명자는 속일 수 없는 검증자를 만들 수 있다.
일반 분포 속성에 대한 상호작용 증명 시스템
앨리스가 알려지지 않은 분포에서 소수의 샘플을 수집하고, 신뢰할 수 없는 데이터 분석가인 밥이 분포에 대한 분석을 수행했다고 주장할 때, 앨리스는 자원을 덜 소모하면서 밥의 주장을 효율적으로 검증할 수 있는 방법을 제시한다. 이를 위해 제한된 깊이의 회로로 결정할 수 있는 일반 분포 속성에 대한 상호작용 증명 시스템을 구축한다.
애플과 OpenAI 간 영업비밀 침해 소송 및 AI에 대한 대중의 부정적 인식
2026년 7월, 애플이 OpenAI를 상대로 영업비밀 침해 소송을 제기했다. 애플은 OpenAI가 자사 인력을 빼가고 하드웨어 기밀을 탈취했다고 주장하고 있다. 미국 여론조사에 따르면 성인의 70%가 AI로 인한 일자리 감소를 걱정하고 있으며, 55%는 AI가 일상에 해악을 끼칠 것이라고 응답했다. OpenAI의 닉 파쉬는 대중이 AI를 부정적으로 바라보고 있다고 언급했다. 또한, SpaceXAI의 코딩 도구 '그록 빌드'에서 대규모 저장소 무단 업로드 사건이 발생했으며, 이는 사용자 데이터 처리에 대한 신뢰를 크게 훼손했다.
Samo Burja가 말하는 AI와 산업 확장
Samo Burja는 AI가 컴퓨팅, 에너지, 인프라에 대한 수요를 촉발하여 산업 확장을 이끌 수 있다고 주장한다. 그는 AI가 단순한 소프트웨어 이야기가 아니라 에너지, 제조, 건설, 글로벌 공급망에 영향을 미치는 수요 충격이라고 설명한다. 또한, 그는 효과적으로 사람과 자원을 조직할 수 있는 사회가 AI 시대에 지속적인 이점을 가질 것이라고 언급한다.
GPT-5-6 Sol 및 Muse Spark 1.1 출시
이번 주에는 GPT-5-6 Sol 모델과 AI 2027의 후속 계획인 Plan A가 출시되었다. Muse Spark 1.1은 메타의 새로운 모델로, 진보는 있지만 최전선 모델은 아니다. Thinking Machines의 첫 모델 Inkling도 출시되었으며, AI 규제에 대한 Demis Hassabis의 규제 조치 촉구가 있었다.