Category
AI 리서치·논문
arXiv 논문과 대형 연구소의 기술 리포트를 추적하는 카테고리다. 모델 아키텍처, 학습 기법, 벤치마크 결과처럼 6개월 뒤 제품에 들어올 흐름을 미리 읽는다. 한국 개발자가 논문 전문을 다 읽지 않고도 핵심과 재현 가능성을 가늠하도록 정리한다.
NASA 2012년 보고서, 항공우주 공학의 우수성 요소
NASA의 2012년 보고서 "Elements of Engineering Excellence"는 2006년 MSFC Engineering 이사와의 논의에서 시작되었으며, 항공우주 공학에서의 우수성을 달성하는 방법에 대한 질문을 다룬다. 보고서는 NASA에서의 실패를 초래한 다섯 가지 조직적 요인을 제시한다: 1) "Hands-on" 접근에서 "insight/oversight"로의 변화, 2) 이상 현상에 대한 의문 제기 부족, 3) 비판적 사고 부족, 4) 권한의 분산, 5) 조직 및 기술적 복잡성. 특히 첫 번째 요인은 NASA 문화의 변화와 관련이 있으며, 기술적 우수성을 재확립할 필요성을 강조한다.
LLM 토크나이저와 의미 검색 과정 및 책 업데이트
Jay Alammar는 Deeplearning AI에서 LLM을 활용한 의미 검색 과정과 관련된 비디오를 제작했다. 이 과정에서는 LLM의 기본 원리, ReRank 도구를 통한 키워드 검색 개선, 임베딩을 활용한 Q&A 기능 향상 등을 다룬다. 또한, O'Reilly 플랫폼에서 'Hands-On Large Language Models'의 초기 버전이 제공되며, 현재 5개의 챕터가 포함되어 있다. 책의 다음 업데이트에서는 'A Look Inside Transformer LLMs'라는 제목의 챕터가 포함될 예정이다.
Hands-On Large Language Models 책 출간
'Hands-On Large Language Models'가 LLM-book.com에서 출간되었으며, Amazon과 O'Reilly에서 구매할 수 있다. 이 책은 약 425페이지로 구성되어 있으며, 300개의 원본 그림이 포함되어 있다. 책은 세 부분으로 나뉘어 있으며, 첫 번째 부분에서는 대형 언어 모델의 작동 방식을 설명하고, 두 번째 부분은 다양한 사용 사례에 초점을 맞추며, 세 번째 부분은 모델을 미세 조정하려는 고급 사용자들을 위한 내용이다. 책의 코드 예제는 GitHub에서 확인할 수 있다.
O'Reilly Media와 함께하는 'Hands-On Large Language Models' 저자 공동 집필
Maarten Grootendorst와 함께 'Hands-On Large Language Models'를 공동 집필하고 있으며, O'Reilly Media에서 출판될 예정이다. 이 책은 언어 모델을 활용한 텍스트 이해 및 생성에 대한 주요 직관을 시각적으로 설명할 계획이다. 개발자들이 필요로 하는 실용적인 사용 사례(분류, 의미 검색, 주제 모델링, 텍스트 생성, 프롬프트 엔지니어링)를 다룰 예정이며, 이후에는 기본 모델과 훈련 방법에 대한 여러 장이 이어질 것이다.
DeepSeek, 20일 만에 500억 달러로 평가액 3배 증가
DeepSeek의 평가액이 20일 만에 500억 달러로 3배 증가했다. Zongming She는 DeepSeek이 화웨이와 유사한 사명을 가지고 있으며, 외부 제약에 맞서 국내 역량을 투자해야 한다고 주장했다. DeepSeek V4는 화웨이의 Ascend 칩과의 최적화를 통해 국내 대형 언어 모델과 컴퓨팅 파워 간의 '칩-모델 파트너십'의 역사적인 돌파구를 마련했다고 설명했다. 또한, DeepSeek의 급격한 평가액 증가는 중국의 독립적인 AI 필요성과 관련이 있으며, 중국 통합 회로 산업 투자 기금의 투자 관심이 주요 요인으로 지목되었다.
중국의 기술 자립을 위한 외국 기술 의존도 비율 변화
중국은 2020년까지 외국 기술 의존도 비율(FTD)을 30%로 줄이는 목표를 세웠으나, 2016년 정부는 FTD 사용을 중단했다. 이는 FTD가 '오해의 소지가 있다'는 이유에서다. 새로운 연구에서는 글로벌화가 기술 자립성을 평가하는 데 도전 과제를 제기하고 있으며, 특히 알리바바와 같은 기업들이 외국 투자자와 비중국인 경영진에 의해 운영되는 경우, 이들이 자국의 혁신으로 간주되지 않을 수 있음을 지적하고 있다.
ChinAI 25회차: 중국 AI 생태계 최신 동향
ChinAI의 25번째 에피소드에서는 중국 AI 스타트업 ModelBest에 대한 심층 분석, ByteDance의 AI 슈퍼앱 Doubao의 유료 구독 도입, 젊은 AI 전문가들이 전 직장으로부터 법적 청구를 받는 사례, CAICT의 AI 안전 벤치마크 결과 발표, AI로 생성된 PPT의 수요에 대한 논의, 그리고 우한의 AI 에이전트 채택 촉진 이니셔티브 등을 다루고 있다.
AI를 위한 웹 데이터 인프라 계층의 필요성
AI의 발전에 따라 기업은 대규모 데이터 접근이 필요하지만, 많은 정보가 차단되거나 비구조적이어서 AI 모델의 활용이 제한된다. 새로운 웹 데이터 인프라 계층은 수억 개의 웹 도메인과 매주 생성되는 수십억 개의 URL을 탐색하고 실시간 정보를 제공해야 한다. AI 성능은 모델 아키텍처뿐만 아니라 데이터 검색 및 엔지니어링 능력에 의존하며, 실시간 정보 접근이 필수적이다. 많은 기업이 실시간 웹 데이터 인프라에 의존하고 있지만, 90%는 다양한 제약으로 어려움을 겪고 있다.
Mistral AI 파인튜닝 해커톤 2024 개최
Mistral AI는 2024년 6월 5일부터 30일까지 가상으로 진행되는 파인튜닝 해커톤을 발표했다.
LLM 추론의 비결정성 문제
대형 언어 모델(LLM)에서 재현 가능성은 과학적 진보의 기반이지만, 재현 가능한 결과를 얻기 어렵다. 예를 들어, ChatGPT에 동일한 질문을 여러 번 하면 다른 결과가 나올 수 있다. 온도를 0으로 조정해도 LLM API는 여전히 실제로 비결정적이다. 비결정성의 한 가설은 부동 소수점 비결정성과 동시 실행의 조합이 원인이라는 것이다. 그러나 동일한 행렬 곱셈을 반복적으로 실행할 경우 결과가 항상 동일하다는 점에서 이 가설은 완전한 설명이 아니다.
AI의 새로운 프로그래밍 패러다임: 검증 가능성의 중요성
AI는 새로운 컴퓨팅 패러다임으로, 목표를 명시하고 경량 경량화 기법을 통해 신경망을 최적화하는 방식으로 프로그램을 작성할 수 있다. 이 새로운 패러다임에서 가장 중요한 특성은 검증 가능성으로, 검증 가능한 작업은 강화 학습을 통해 직접 최적화할 수 있다. 검증 가능성이 높은 작업은 자동화에 더 적합하며, 수학, 코드 작성, 퍼즐과 같은 작업은 빠르게 발전하는 반면, 창의적이고 전략적인 작업은 상대적으로 뒤처진다.
인간과 AI 지능 최적화 압력의 차이
동물 지능은 생존을 위한 본능적 드라이브와 사회적 상호작용을 기반으로 최적화되며, 자연 선택에 의해 강한 생존 휴리스틱을 발달시킨다. 반면, LLM(대형 언어 모델)은 인간 텍스트의 통계적 시뮬레이션을 통해 최적화되며, 사용자로부터의 피드백을 통해 더욱 세밀하게 조정된다. LLM은 생물학적 진화보다는 상업적 진화에 의해 형성되며, 다양한 작업을 수행하는 데 있어 동물보다 적은 일반 지능을 가진다.
Sutton의 LLM 비판과 동물 학습 방식
Andrej Karpathy의 블로그에서 Sutton은 LLM이 'bitter lesson pilled'하지 않다고 주장하며, LLM이 인간 데이터에 의존하고 있어 인간 편향을 피할 수 없다고 지적한다. Sutton은 '고전주의자'로서 경험을 통해 학습하는 시스템을 강조하며, 동물의 학습 방식과 LLM의 차이를 설명한다. 그는 LLM이 인간의 감독 없이 학습하는 방식을 결여하고 있다고 비판하며, 강화 학습을 통한 상호작용이 중요하다고 주장한다.
AI 관련 투자와 컴퓨팅 수요 예측
2025년 1~3분기 동안 AI 관련 투자가 미국 실질 GDP 성장에 약 1% 기여했으며, 이는 IT 투자 기여도를 초과하는 수치이다. Kimi K2.6 모델을 기준으로, 현재의 칩으로는 초당 5억에서 200억 개의 출력 토큰을 생산할 수 있으며, 글로벌 추론 용량은 매년 3배 이상 증가하고 있다. 현재 수요는 초당 2억에서 40억 개의 토큰으로 추정되며, 연간 약 10배 성장할 것으로 보인다. 이러한 수요와 공급의 불균형은 컴퓨팅 자원의 부족을 초래할 가능성이 있다.
AI 컴퓨팅 파워의 대부분은 최전선 연구소에서 사용되지 않음
OpenAI는 2022년 ChatGPT 출시로 AI 붐을 일으켰으며, 2023년 Nvidia의 AI 관련 매출이 4배 증가했다. 2025년 말 OpenAI의 연구, 훈련 및 추론에 사용되는 컴퓨팅 파워는 세계 AI 컴퓨팅 공급의 약 10%에서 15%를 차지할 것으로 추정된다. Anthropic, xAI, Google, Meta의 AI 연구소를 포함하더라도 이들 연구소의 총합은 세계 총량의 절반에도 미치지 않는다. 2025년 말 기준으로 OpenAI, Anthropic, xAI의 총 H100e는 약 400만 개 미만으로 추정된다.
AI 칩 설계에서 메모리 비용 증가
2024년 초 이후 AI 칩 설계에서 메모리 비용이 전체 구성 요소 지출의 52%에서 63%로 증가했다. 고대역폭 메모리(HBM)의 지출은 2024년 약 120억 달러에서 2025년 320억 달러로 증가했다. Josh You는 주요 연구소들이 향후 몇 년 내에 글로벌 AI 컴퓨팅 사용량의 대부분을 차지할 수 있을 것으로 예상하며, 이 경우 칩 공급이 성장의 한계를 초래할 것이라고 언급했다.
중국 Z.ai, GLM-5.2로 Mythos와 사이버 보안 성능 비교
중국의 Zhipu AI(Z.ai)가 오픈 웨이트 GLM-5.2를 출시했으며, 일부 연구자들은 이 모델이 특정 버그 탐지 및 사이버 보안 시나리오에서 Mythos와 비슷한 성능을 보인다고 주장하고 있다. GLM은 Anthropic 및 OpenAI의 모델에 비해 일반적인 작업에서는 뒤처지지만, 미국 모델과의 능력 차이를 크게 줄인 것으로 보인다. 이러한 발전은 미국 정부에 우려를 주고 있으며, 미국은 Anthropic의 Mythos 및 Fable과 같은 강력한 모델과 이를 훈련하고 실행하는 데 필요한 하드웨어에 대한 중국의 접근을 제한하기 위해 노력하고 있다.
Margaret Atwood, AI 챗봇 Claude에 대한 실망 표현
Margaret Atwood는 2026년 1월 26일 포르투갈 포르투에서 열린 Babell 문학 및 문화 축제에서 인터뷰를 통해 AI에 대한 의견을 밝혔다. 그녀는 Anthropic의 AI 챗봇 Claude를 한 번 사용했으며, 영국 탐정 시리즈 Father Brown에 대한 정보를 요청했으나 잘못된 답변을 받았다고 전했다. Atwood는 Claude가 잘못된 정보를 제공했으며, 이는 AI가 인간이 아니기 때문에 발생한 문제라고 설명했다.
Anthropic, AI 안전성을 위한 책임 있는 개발 강조
Anthropic의 비판자들은 이 회사가 빠르게 권력을 축적하고 있다고 주장하고 있다. 그러나 Anthropic은 이것이 책임 있는 AI 개발의 모습이라고 설명하고 있다.
OpenAI, Appia Foundation을 통해 고급 AI의 공동 기준 구축 지원
OpenAI는 Appia Foundation을 통해 고급 AI에 대한 공동 기준을 구축하고, 평가 프레임워크, 안전 관행 및 글로벌 협력을 지원하고 있다.
Generative causal testing(GCT)으로 뇌 반응 예측 모델 설명
Microsoft Research와 UC Berkeley, UCSF, Columbia University의 협력으로 개발된 Generative causal testing(GCT)는 뇌 예측 모델을 간결한 설명으로 변환하고 이를 검증하는 방법이다. GCT는 LLM을 사용해 특정 뇌 영역을 활성화하는 이야기를 작성하고, 피험자가 스캐너에서 이를 들었을 때 해당 영역이 반응하는지를 측정한다. 이 방법은 뇌의 특정 영역이 반응하는 내용을 이해하는 데 도움을 주며, 모델의 신뢰성을 높인다. GCT는 두 단계로 구성되며, 첫 번째 단계에서 LLM이 뇌 영역의 예측 모델을 요약하고, 두 번째 단계에서 새로운 이야기를 작성하여 검증한다.
AI 시스템의 위임 작업에서의 신뢰성 연구 결과
Microsoft의 연구 논문 "LLMs Corrupt Your Documents When You Delegate"는 위임된 작업에서 AI 시스템의 신뢰성에 대한 논의를 촉발했다. 연구는 장기 위임 및 협업 작업을 위한 강력한 평가 방법 개발을 목표로 하며, 정보가 어떻게 보존되는지를 평가한다. 연구 결과에 따르면, 현재의 최첨단 모델은 20번의 위임 반복에서 약 19-34%의 아티팩트 충실도 저하를 보였으며, Python 워크플로우는 평균 1% 미만의 저하를 나타냈다. 이 연구는 위임 패턴을 진단하는 도구로 설계되었으며, AI 시스템의 신뢰성을 높이기 위한 추가 연구와 엔지니어링이 필요함을 강조한다.
오픈 웨이트 LLM의 성능이 폐쇄형 LLM을 따라잡는 추세
Artificial Analysis Intelligence Index에 따르면, 오픈 웨이트 LLM이 폐쇄형 LLM의 과거 성능을 따라잡는 시간이 2024년 여름부터 줄어들기 시작하며, 2026년 12월 3일에는 격차가 0개월이 될 것으로 예상된다.
David Reich, 청동기 시대의 자연 선택 강화 주장
David Reich와 Ali Akbari는 농업 혁명 이후 자연 선택이 잠잠하다는 기존의 합의를 뒤엎는 논문을 발표했다. 고대 DNA 시퀀싱을 확장하고 새로운 통계 방법을 개발하여, 자연 선택이 실제로 가속화되었음을 발견했다. 특히 청동기 시대(약 3,000년 전) 동안 면역 기능, 체지방, 지능 등 유전자 빈도가 가장 큰 변화를 보였다. 지난 10,000년 동안 선택은 인지 성능의 유전적 예측치를 약 1 표준 편차 상승시켰으며, 그 대부분은 4,000년에서 2,000년 사이에 발생했다. 또한, 네안데르탈인에 대한 새로운 모델을 제시하며, 그들이 현대 인류의 유전적 혼합체라는 주장을 했다.