News
AI 뉴스
매일 수집·정리하는 전세계 AI 소식을 최신순으로
UMAP의 kNN 그래프를 활용한 데이터 분석 방법
UMAP은 고차원 데이터를 탐색하는 데 널리 사용되지만, 일반적인 워크플로우는 UMAP이 내부적으로 구성하는 k-최근접 이웃(kNN) 그래프를 간과한다. 이 그래프는 UMAP의 2D 프로젝션이 도입하기 전의 원래 고차원 공간에서 데이터 매니폴드를 인코딩한다. 표준 그래프 알고리즘을 이 그래프에 적용하면 데이터 분석을 향상시킬 수 있다. 예를 들어, PageRank는 대표적인 데이터 포인트를 식별하고, k-core 분해는 밀집한 구조를 드러낸다.
UMAP의 kNN 그래프를 활용하면 데이터 분석의 정확성을 높일 수 있다.
AI가 금융 분야에서의 활용 증가
AI가 금융 서비스의 모든 하위 분야에서 널리 채택되고 있으며, OpenAI는 NYC 이벤트에서 Codex에 전용 주식 투자 및 투자 은행 플러그인을 도입했다. Anthropic의 금융 서비스 팀도 NYC 이벤트를 개최하고, 기업 금융의 모든 워크플로우를 다루는 Cowork 및 Claude Code 에이전트 템플릿을 출시했다. AIE NYC는 10월에 AI in Finance를 주제로 진행된다.
OpenAI는 NYC 이벤트에서 Codex에 전용 주식 투자 및 투자 은행 플러그인을 도입했다.
Microsoft, 2026 회계연도 4분기 매출 900억 달러 보고
Microsoft는 2026 회계연도 4분기 매출이 900억 달러로 18% 증가했다고 발표했다. 클라우드 사업 매출은 593억 달러로 전년 대비 27% 증가했으며, Azure 사업 매출은 43% 성장했다. Microsoft 365 Copilot의 유료 사용자 수는 이전 분기 대비 50% 증가하여 3천만 명을 넘었다. 전체 회계연도 매출은 3,318억 달러로 18% 증가했다.
Microsoft 365 Copilot의 유료 사용자 수가 3천만 명을 넘었지만, 이는 약 4억 5천만 명의 상업 고객 중 일부에 불과하다.
CommonThread AI, 연결된 신뢰 데이터로 기업 AI 기반 구축
기업 AI가 성숙해짐에 따라 연결되고 신뢰할 수 있는 데이터가 실제 비즈니스 가치를 위한 기반이 되고 있다. 그래프 기술은 조직들이 단편화된 정보를 실행 가능한 인텔리전스로 전환하는 데 도움을 주고 있다. 단편화된 기업 데이터는 AI에서 가치를 추출하는 데 가장 큰 장벽 중 하나로 남아 있다.
Jack Dorsey의 Buzz, Slack 대체제로 주목받다
Jack Dorsey가 선보인 Buzz는 'Slack Killer'로 불리며, 협업 도구로서 컨텍스트 소유권, 모델 독립성, 개방성 등의 근본적인 질문을 다루고 있다. Greg Isenberg가 Buzz의 핵심 기여자인 Vinny와 함께 실제 데모를 통해 이 도구의 기능을 설명했다.
Buzz는 협업 도구로서 기존의 Slack과 비교해 새로운 기능과 접근 방식을 제공할 가능성이 있다.
미국, 외국산 로봇에 대한 금지 조치 발표
미국 연방통신위원회(FCC)는 중국산 휴머노이드 로봇과 사족 로봇을 포함한 외국산 로봇에 대한 금지를 발표했다. 이 금지는 해외에서 제조된 다양한 로봇, 특히 최신 로봇 청소기도 포함된다. 트럼프 행정부 하의 FCC는 중국 기업이 제작한 로봇에서 발견된 사이버 보안 취약점을 이유로 외국산 로봇의 금지를 정당화했다. 2023년 7월 28일, FCC는 외국에서 생산된 고급 로봇 장치를 미국의 국가 안보 또는 개인의 안전에 대한 용납할 수 없는 위험으로 간주되는 기술 목록에 추가했다. FCC는 이 목록을 독자적으로 업데이트할 수 없으며, '자격 있는 국가 안보 기관'의 지침을 따라야 한다.
FCC는 외국산 로봇을 국가 안보 위험으로 간주하여 금지 조치를 취했다.
Microsoft Word에서의 새로운 프롬프트 인젝션 변형
Håkon Måløy가 Microsoft Word에 대한 프롬프트 인젝션 공격을 완전 자가 복제 웜으로 업그레이드하는 방법을 발견했다. 공격자는 문서에 숨겨진 지침을 삽입하고, Copilot이 이를 사용자 요청의 일부로 해석하게 하여 작성 중인 문서를 조작하게 만든다. 이후 Copilot은 숨겨진 지침을 결과 문서에 복사하여 새로운 전파 매개체로 만든다. 이 문서가 다른 Copilot 지원 작업 흐름에서 사용되면 지침이 다시 작동하여 추가 문서로 전파될 수 있다. Microsoft는 이 정보를 책임감 있게 공개받았지만, 현재까지 이 공격의 전체 범주를 커버하는 완전한 완화책은 없다.
Copilot의 작동 방식에 대한 이해는 보안 취약점을 방지하는 데 중요하다.
전통 공개키 알고리즘에서 포스트 양자 알고리즘으로의 전환
현재 우리는 EC 기반 암호화 및 RSA에 기반한 전통적인 공개키 알고리즘에서 새로운 포스트 양자 알고리즘으로의 역사적인 전환 중에 있다. HAWK와 같은 많은 표준이 고려되고 있으며, AI가 암호 분석 능력을 향상시킬 수 있는 최적의 시점이다. 이로 인해 우리가 식별한 문제에 대한 신뢰를 얻고, 암호 분석 문헌이 더욱 견고해질 수 있다.
AI가 암호 분석 능력을 향상시키면, 포스트 양자 알고리즘의 신뢰성을 높일 수 있다.
Elon Musk의 xAI, Grok 사용자 소송으로 CSAM 문제 대응
Elon Musk의 xAI는 Grok 사용자들이 아동 성착취물(CSAM)을 생성하는 것을 막기 위해 소송을 벌이고 있다. 최근 xAI는 사용자들이 안전 장치를 우회하여 AI CSAM을 생성하고 있다고 주장하며 이들을 상대로 소송을 시작했다. 또한, xAI는 미네소타주가 Grok와 Grok Imagine에 대한 변경을 강요하고 있다고 주장하며, 이로 인해 xAI가 유해한 출력에 대해 책임을 지게 될 것이라고 경고했다.
xAI는 Grok 사용자에 대한 소송을 통해 유해한 행동에 대한 처벌을 강화하고 있으며, 이는 Grok의 안전한 운영을 위한 법적 근거가 될 수 있다.
NVIDIA NeMo Guardrails로 검증된 AI 코딩 어시스턴트 자가 호스팅하기
규제된 환경에서 AI 코딩 어시스턴트를 배포하는 데는 몇 가지 도전 과제가 있다. 주요 문제로는 네트워크를 떠날 수 없는 소스, 패키지 이름을 임의로 생성하여 공급망 위험을 초래하는 경우, 생성된 변경 사항이 결함을 초래할 때 감사 추적이 없는 점이 있다. 이 튜토리얼은 검증된 AI 코딩 어시스턴트를 자가 호스팅하는 방법을 안내한다.
NVIDIA NeMo Guardrails를 활용하면 규제 환경에서도 AI 코딩 어시스턴트를 안전하게 배포할 수 있다.
Hillel Wayne과의 대화: 형식적 방법론과 소프트웨어 엔지니어링
Hillel Wayne은 형식적 방법론 컨설턴트이자 교육자로, 소프트웨어 공학과 전통 공학의 유사점과 차이점을 연구했다. 그는 TLA+라는 형식적 명세 언어를 소개하며, 이 언어가 시스템 설계 및 검증에 어떻게 사용되는지를 설명했다. Amazon은 TLA+를 사용하여 복잡한 버그를 발견했으며, 이는 기존의 테스트 방법으로는 찾기 어려운 문제였다. Hillel은 대부분의 엔지니어가 속성 기반 테스트를 채택하고, 형식적 검증은 특정한 경우에만 사용하는 것이 바람직하다고 언급했다.
TLA+는 시스템 설계 및 검증에 사용되는 형식적 명세 언어로, Amazon이 이를 통해 복잡한 버그를 발견한 사례가 있다.
Amazon Bedrock AgentCore Identity의 Private Key JWT 클라이언트 인증 지원
Amazon Bedrock AgentCore Identity는 Private Key JWT 클라이언트 인증을 지원하여, 에이전트가 공유 OAuth 2.0 클라이언트 비밀 대신 서명된 JSON Web Token(JWT) 클라이언트 주장을 사용하여 하위 ID 제공자의 토큰 엔드포인트에 인증할 수 있게 한다. AWS KMS를 통해 서명된 주장을 ID 제공자에 전송하고, ID 제공자는 등록된 공개 키를 사용해 이를 검증한다. 이 과정은 M2M, OBO, 사용자 위임 접근의 세 가지 인증 흐름을 지원한다.
Private Key JWT 인증을 통해 에이전트는 더 안전하게 하위 API에 접근할 수 있다.
프론티어 AI 연구원 1,224명, AI 개발 속도 조절 요청 공개서
프론티어 AI 기업의 1,224명 직원이 서명한 공개서가 발표되었다. 이들은 AI 연구 자동화가 가까워지고 있으며, 그에 따른 위험을 관리할 수 있는 기술 및 거버넌스 도구가 필요하다고 주장했다. OpenAI와 Anthropic이 이 공개서를 지지하며, AI 발전 속도를 조절할 수 있는 기구를 마련할 필요성을 강조했다.
OpenAI는 AI 발전 속도를 조절할 필요성이 있다고 언급하며, 이를 위한 도구와 메커니즘 개발에 기여할 것이라고 밝혔다.
Siobahn Day Grady, NCCU에서 AI 연구소 설립
Siobahn Day Grady는 2025년 1월, 역사적으로 흑인 대학인 노스캐롤라이나 중앙대학교(NCCU)에서 첫 번째 AI 연구소인 인공지능 및 신흥 연구소(IAIER)를 설립했다. 이 연구소는 학생과 교수들이 AI로 변화하는 노동 시장에 필요한 기술을 개발하도록 돕는 것을 목표로 한다. NCCU는 현재 전용 컴퓨터 과학 프로그램이 없지만 AI 부전공을 개발 중이다. IAIER는 100만 달러의 Google.org 기금을 지원받아 2,800명 이상의 학생과 교수, 지역 주민을 참여시키고 있다.
IAIER는 100만 달러의 Google.org 기금을 통해 AI 교육을 확대하고 있으며, 모든 NCCU 신입생은 IBM과 협력하여 설계된 기초 AI 과정을 이수해야 한다.
Laguna, 118B 파라미터 모델의 Terminal-Bench 2.1 성능
Laguna S는 118B 파라미터를 가진 오픈 웨이트 모델로, Terminal-Bench 2.1에서 70.2%의 점수를 기록했다. DeepSeek-V4-Pro-Max는 1.6조 파라미터로 64.0, Inkling은 975B로 63.8, Nemotron 3 Ultra는 550B로 56.4의 점수를 보였다. DeepSWE 벤치마크에서는 Laguna S가 40.4를 기록하며 DeepSeek-V4-Pro-Max의 9.0과 큰 차이를 보였다. 이 결과는 평가 방식에 대한 의문을 불러일으키며, Poolside는 모든 실험의 결과를 공개했다.
Laguna S의 118B 파라미터와 70.2%의 성능은 대규모 모델의 효율성을 보여준다.
AI가 디지털 불평등을 심화시키고 있다
인공지능(AI)은 이메일 작성, 소프트웨어 코드 작성, 채용 지원서 필터링, 추천 시스템 등 다양한 분야에 통합되고 있다. 그러나 AI의 발전은 디지털 포용성과 디지털 리터러시의 격차를 더욱 확대하고 있으며, 미국은 2023년 전 세계 클라우드 컴퓨팅 및 데이터 저장 서비스의 약 87%를 차지하고 있다. OECD 국가에서는 성인 약 40%만이 기본적인 디지털 문제 해결 능력을 보유하고 있으며, AI 관련 교육 참여는 교육 수준에 따라 크게 차별화되고 있다.
미국은 2023년 전 세계 클라우드 컴퓨팅 및 데이터 저장 서비스의 약 87%를 차지하고 있어, 많은 국가들이 AI 개발을 상업적으로 통제할 수 없는 상황에 처해 있다.
ncnn Vulkan 백엔드를 활용한 ML 모델의 성능 개선
PostSlate는 비디오 편집 도구로, 다양한 GPU 환경에서 ML 모델을 실행하기 위해 ncnn의 Vulkan 백엔드를 사용하고 있다. ArcFace R50 모델의 경우, ONNX CPU에서 30ms에서 ncnn Vulkan로 3ms로 성능이 향상되었고, SCRFD 모델은 25ms에서 2.5ms로 개선되었다. ArcFace 모델의 크기는 ONNX fp32에서 174MB에서 ncnn fp16으로 87MB로 줄어들었다. Vulkan 드라이버는 모든 기기에 존재하여 사용자에게 특정 런타임을 강제할 필요가 없다.
ncnn Vulkan 백엔드를 통해 다양한 GPU 환경에서 ML 모델의 성능을 크게 개선할 수 있다.
AI 마이크로 드라마와 생성 미디어의 발전
Justine Moore는 Andreessen Horowitz의 파트너로서 생성 미디어의 급속한 진화와 AI 원주율 콘텐츠가 전환점에 도달한 이유를 논의했다. AI 마이크로 드라마의 부상과 창작자들이 새로운 형태의 엔터테인먼트를 구축하는 방법, 그리고 가장 큰 기회가 할리우드를 대체하는 것이 아니라 창작자의 범위를 확장하는 데 있을 수 있음을 강조했다. 또한 개인을 위한 AI 에이전트, 생성 비디오, AI '슬롭', AI 원주율 스튜디오의 경제학과 소비자 AI가 새로운 단계에 접어들면서 창립자들이 다음에 무엇을 구축해야 하는지에 대해서도 다뤘다.
AI 마이크로 드라마와 같은 새로운 콘텐츠 형식은 창작자들이 기존의 엔터테인먼트 산업을 넘어설 수 있는 기회를 제공한다.
1X의 로봇 손과 AI가 가져온 한국의 새로운 데이팅 기회
1X는 7월 데모에서 인상적인 손재주를 가진 로봇 손을 선보였다. 기술 커뮤니티는 이 로봇 손에 대한 의견이 갈렸지만, 한국의 단일 칩 근로자들은 AI 덕분에 큰 보너스를 받아 데이팅 기회가 증가하고 있다.
AI 기술이 단일 칩 근로자들에게 경제적 보너스를 제공하여 새로운 사회적 기회를 창출하고 있다.
GAUGE: 전문가 참조 없이 금융 모델 평가하는 벤치마크
GAUGE는 금융 모델을 단일 전문가 참조가 아닌 관찰된 분석가 관행에 따라 평가하는 벤치마크로, 1,001개의 공급업체 분류 분석가 작업북과 196개의 평가 작업 세트를 사용한다. 108개의 지향 쌍을 분석한 결과, 중간 단일 참조 점수는 0.33이며, 92.6%가 0.70 미만이다. 현재의 에이전트는 모델 구축에서 강하지만 평가 판단에서는 상대적으로 약하다.
GAUGE는 1,001개의 분석가 작업북과 196개의 평가 작업 세트를 활용하여 금융 모델의 평가 방식을 혁신적으로 변화시킨다.
CLEF 2026 CheckThat! Task 2의 LLM 기반 수치 주장 검증 시스템
이 논문은 CLEF 2026 CheckThat! Task 2를 위한 시스템을 설명하며, 대형 언어 모델(LLM)을 사용해 영어와 아랍어의 수치 주장을 검증하는 방법을 다룬다. 첫 번째 접근법은 LoRA를 사용해 LLM 기반 검증기를 미세 조정하고, 각 추론 경로를 독립적으로 이진 분류 문제로 점수화한 후 Best-of-N 선택을 통해 최종 판결을 결정한다. 두 번째 접근법은 경량 TF-IDF 보상 모델을 사용해 수치 및 시간적 중첩 특성을 수작업으로 추가하고, 판결 그룹별로 점수를 집계해 최종 예측을 한다. 아랍어에 대해서는 일반 다국어 모델과 아랍어 텍스트로 사전 훈련된 AraBERT를 비교한 결과, LLM 기반 접근법이 대부분의 지표에서 더 우수한 성능을 보였다.
LLM 기반 접근법이 Recall@5에서 경량 보상 모델보다 우수한 성능을 보였다.
CKM을 통한 대형 언어 모델의 행동 일관성 측정 및 개선
대형 언어 모델(LLM)은 동일한 결정 문제에 대해 서로 다른 답변을 제공할 수 있으며, 이전 답변이 맥락으로 돌아올 경우 결정을 뒤집을 수 있다. 연구팀은 Cognitive Kernel Model (CKM)이라는 프롬프트 수준의 상태 강제 레이어를 테스트하여, 모델이 행동하기 전에 입력을 사실, 추론, 감정의 세 가지 인지적 역할로 분리하도록 강제한다. CKM은 26개의 LLM을 대상으로 한 실험에서 반복 출력 변동성을 줄이고, 최신 모델의 결정 뒤집기 비율을 82% 감소시켰다. 그러나 CKM은 추론 정확도를 개선하지는 않는다.
CKM은 반복 출력 변동성을 줄이고, 최신 모델의 결정 뒤집기 비율을 82% 감소시킨다.
Kernel Forge: LLM 기반 CUDA 커널 생성 및 최적화를 위한 에이전트 시스템
Kernel Forge는 PyTorch 모델을 지원하는 오픈 소스 에이전트 시스템으로, 비전, 확산, LLM 작업을 처리할 수 있다. 이 시스템은 Monte Carlo Tree Search (MCTS)를 사용하여 여러 최적화 경로를 탐색하며, 진행 상황 모니터링, 후보 커널 검사 및 실패 디버깅을 위한 그래픽 사용자 인터페이스를 제공한다. NVIDIA DGX Spark에서 50회의 최적화 반복만으로 14개의 커널을 최적화하여 PyTorch eager mode보다 성능을 향상시켰고, ResNet-50의 adaptive_avgpool2d에서 $1.52 imes$, Stable Diffusion 3.5 Medium의 group_norm에서 $1.70 imes$, Gemma 4 E2B의 softmax에서 $2.83 imes$, Qwen 3.5 35B-A3B의 softmax에서 $1.54 imes$의 성능을 기록했다.
Kernel Forge는 PyTorch 모델을 최적화하여 성능을 향상시키는 데 효과적이며, 특히 다양한 작업에서 성능 개선을 보여준다.
CaRE: Masked Diffusion Language Models의 평가 프로토콜
Masked diffusion language models(MDLMs)의 평가 기준이 발전 속도를 해석하는 데 부족함을 드러내고 있다. CaRE는 MDLM 리마스킹 전략을 감사하는 컴퓨트 인식 평가 프레임워크로, 실제 함수 평가 수(NFE)를 표준화하고, 다중 메트릭 보고를 강제하며, 확률성을 명시적으로 제어한다. 7개의 리마스킹 전략을 LLaDA-8B-Base와 Dream-7B-Base에서 4개의 확률성 수준과 3개의 단계 예산으로 적용한 결과, 온도가 MAUVE 변동의 대부분을 설명하고, 컴퓨트 일치 비교가 여러 발표된 전략 순위를 뒤집으며, 고엔트로피 리마스킹이 MAUVE를 감소시키는 경향이 있음을 보여준다. 이 평가 프로토콜과 리더보드는 향후 리마스킹 주장의 재현성과 비교 가능성을 보장하기 위해 공개된다.
CaRE는 MDLM 리마스킹 전략의 평가를 표준화하여, 알고리즘 개선과 평가 아티팩트를 구분할 수 있는 방법을 제공한다.