본문으로 건너뛰기

News

AI 뉴스

매일 수집·정리하는 전세계 AI 소식을 최신순으로

NewsAI 리서치·논문·

LLM 의견 다양성을 위한 실험적 접근

대형 언어 모델(LLM)은 합성 설문조사, 포커스 그룹 모델링, 여론 예측 등에서 다양한 인간 의견을 시뮬레이션하는 데 사용된다. 그러나 LLM 출력은 의견 동질화 경향을 보인다. 연구진은 입력 조건화와 상호작용 아키텍처라는 두 가지 주요 개입 차원을 분리한 실험을 설계하고, 7개 모델에서 100개의 실제 사용자 질문에 대해 다양성을 측정하였다. 결과적으로, 더 많은 페르소나 세부정보가 항상 다양성을 증가시키지 않으며, 다양한 아키텍처를 결합하는 것이 단일 최적화보다 더 넓은 의견 범위를 탐색할 수 있음을 보여주었다.

LLM 출력의 다양성은 단일 차원에서의 확장이 아니라 개입의 구조적 형태와 조합에 민감하다.

arXiv cs.CL (계산언어학·NLP)원문
NewsAI 리서치·논문·

LLM의 문학적 품질 평가에 대한 연구

이 연구는 LLM이 문학적 품질을 어떻게 평가하는지를 두 가지 연구를 통해 조사한다. 첫 번째 연구에서는 30개의 실제 텍스트를 기준으로 하여 LLM의 품질 이론을 추출하고, 5회의 DeepSeek 복제에서 평균 79.3%의 계층 분류 정확도를 달성하였다. LLM은 의도성을 정확성보다 더 중요하게 여기며, 작문 기술, 깊이, 독특한 목소리를 우선시한다. 두 번째 연구에서는 5개의 고전 산문을 체계적으로 변형하여 품질 변화를 평가하였고, 어휘 단순화가 가장 작은 품질 손실(0.41 +/- 0.46 포인트)을 초래했으며, 구조 단순화(2.78)와 목소리 손실(2.34)이 더 큰 영향을 미쳤다. 이 연구들은 LLM의 문학적 품질 판단이 전체적이며, 구조적 특성에 더 민감하다는 것을 시사한다.

LLM의 품질 평가가 구조적 특성에 더 민감하다는 점은 자동화된 작문 피드백 시스템 개발에 중요한 시사점을 제공한다.

arXiv cs.CL (계산언어학·NLP)원문
NewsAI 리서치·논문·

Intel 소비자 플랫폼에서 멀티 GPU 설정 사용 금지

Intel 소비자 플랫폼인 Z890은 멀티 GPU 설정에 적합하지 않다. Intel Core Ultra 7 270K Plus와 Asus Z890 Apex 보드를 사용한 테스트에서 PCIe P2P가 제대로 작동하지 않으며, 대역폭이 절반으로 줄어드는 문제가 발생했다. Nvidia는 소비자 Intel 플랫폼에서 PCIe P2P를 차단하고 있으며, 패치된 드라이버를 사용해야만 활성화할 수 있다.

Intel 플랫폼에서 PCIe P2P가 제대로 작동하지 않아 AI 추론 성능에 부정적인 영향을 미친다.

r/LocalLLaMA원문

Inflect v2 출시: 4M 및 10M 파라미터의 초소형 TTS 모델

Inflect v2가 출시되었으며, 두 개의 완전한 로컬 텍스트-투-스피치(TTS) 모델인 Inflect-Nano-v2(3.96M 파라미터, 15.97 MB)와 Inflect-Micro-v2(9.36M 파라미터, 37.53 MB)가 포함된다. 이 모델들은 CPU 또는 CUDA에서 PyTorch API를 통해 로컬에서 실행 가능하며, 외부 vocoder나 API가 필요 없다. Nano 모델은 21배 작은 Kokoro와 126배 작은 Chatterbox에 비해 매우 작은 크기를 자랑한다. 두 모델은 각각 4.395 UTMOS22, 3.99% 의미적 WER(Inflect-Micro-v2)와 4.386 UTMOS22, 4.21% 의미적 WER(Inflect-Nano-v2)를 기록했다.

Inflect-Nano-v2는 3.96M 파라미터로도 유용한 음성을 생성할 수 있는 초소형 신경망 TTS 모델이다.

r/LocalLLaMA원문
NewsAI 리서치·논문·

Opus 5는 가장 프롬프트 주입이 어려운 모델

Boris Cherny에 따르면 Opus 5는 현재까지 가장 프롬프트 주입이 어려운 모델로 평가되고 있다. 시스템 카드에 언급된 바와 같이, Opus 5는 PI 평가 및 레드 팀 테스트에서 성공적으로 프롬프트 주입을 하기 매우 어렵다.

Opus 5는 프롬프트 주입 공격에 대한 저항력이 강해, 보안성이 중요한 AI 시스템에서 유용할 수 있다.

Simon Willison's Weblog원문

ChatGPT 기반 개인 건강 동반자

ChatGPT를 활용한 개인 건강 동반자가 소개되었다.

Product Hunt — Artificial Intelligence원문
NewsAI 코딩·

딜라이트룸, 클로드 코드로 알라미 iOS 프로젝트 생산성 향상

딜라이트룸은 알라미 iOS 프로젝트에서 클로드 코드(Claude Code)를 사용하여 10배의 생산성을 향상시켰다. 이 프로젝트는 매일 400만 명 이상이 사용하는 글로벌 1위 알람 앱으로, SwiftUI, TCA 기반이며, 40개 이상의 언어를 지원한다. 클로드 코드는 자동화된 워크플로우를 통해 반복 작업을 줄이고, 코드베이스를 이해하는 개발자 동료와 같은 역할을 수행하게 했다.

클로드 코드는 로컬 파일 시스템 접근과 Unix 커맨드를 조합하여 테스트 실행, 빌드, 린트, 스크립트 실행 등을 자동화할 수 있게 해준다.

요즘IT (Yozm IT)원문
NewsAI 툴·

opencodex: Codex와 Claude Code에서 AI 모델을 바꿔 쓸 수 있는 도구

opencodex는 오픈AI의 Codex와 앤트로픽의 Claude Code에서 다른 AI 모델을 선택해 사용할 수 있게 해주는 도구로, GitHub에서 lidge-jun이 개발하여 공개했다. 이 도구는 40개 이상의 AI 모델을 지원하며, 사용자는 기존 도구의 설정을 유지한 채로 모델만 변경할 수 있다. 설치는 npm을 통해 간단히 진행할 수 있으며, 작업마다 다른 모델을 지정할 수 있는 기능도 제공한다.

opencodex는 Codex와 Claude Code를 사용하는 개발자들이 다양한 AI 모델을 쉽게 비교하고 활용할 수 있도록 해준다.

요즘IT (Yozm IT)원문
NewsAI 모델·API·

Claude Opus 5 출시

Anthropic의 새로운 모델 Claude Opus 5가 출시되었다. 이 모델은 Claude Fable 5의 지능에 가까우면서도 가격은 절반이다. 현재 Artificial Analysis 리더보드에서 Fable 5보다 앞서 있다. Opus 5는 사이버 보안 취약점을 찾는 데 개선되었지만, 이를 악용하는 훈련은 받지 않았다. 또한, Opus 5에 대한 프롬프트 가이드도 발표되었다.

Claude Opus 5는 사이버 보안 취약점을 찾는 데 Mythos 5에 근접한 성능을 보인다.

Simon Willison's Weblog원문
NewsAI 코딩·

Ryan Carson의 AI 코딩 에이전트 활용법

Ryan Carson은 AI 코딩 에이전트를 활용하여 소프트웨어를 구축하는 방법을 설명했다. 그의 고급 플레이북은 10개의 에이전트를 관리하고, 품질 관리를 자동화하며, 비용에 따라 모델을 라우팅하고, 개발 워크플로우를 소프트웨어 공장으로 전환하는 방법에 대해 다룬다.

AI 코딩 에이전트를 통해 개발 워크플로우를 효율적으로 관리할 수 있다.

The Neuron원문

캐나다 의원, 연설 중 LLM 프롬프트 읽어 논란

캐나다 뉴브런즈윅의 의원 빌 올리버가 최근 연설 중 LLM 프롬프트 지침을 읽어 논란이 일었다. 그는 "여기 더 자연스럽고 흐르는 버전이 있다"고 말하며 LLM이 제안하는 대안 스타일을 언급했다. 이 발언은 당시에는 주목받지 않았으나, 이후 소셜 미디어에서 확산되며 캐나다 방송공사와 토론토 스타와 같은 매체에서 보도되었다.

이 사건은 LLM 사용에 대한 사회적 인식과 기대의 간극을 드러낸다.

Ars Technica — AI원문
NewsAI 리서치·논문·

일론 머스크 인터뷰에서 언급한 AI의 미래와 통제권 상실

일론 머스크는 최근 인터뷰에서 5년 후 AI가 인간보다 똑똑해질 경우 10년 후 누가 결정권을 쥐게 될지를 질문하며, 현재 우리는 역사의 전환점에 서 있다고 언급했다. 그는 AI의 미래에 대한 솔직한 의견을 제시하며 통제 불가능성을 받아들이기로 했다고 밝혔다.

머스크의 발언은 AI의 발전 방향과 그에 따른 사회적 변화에 대한 중요한 논의를 촉발할 수 있다.

AI 코리아 커뮤니티 뉴스레터원문

Midjourney, 개인화된 점성술 앱 Co-Star 인수

Midjourney가 개인화된 점성술 앱 Co-Star를 인수했다고 발표했다. Co-Star는 무료 앱으로, 매일의 별자리를 제공하고 친구와의 궁합을 확인할 수 있는 기능을 갖추고 있다. 이 앱은 인간의 통찰력, NASA의 데이터, AI를 결합하여 사용자에게 개인화된 조언을 제공한다. 인수 조건은 공개되지 않았다.

Co-Star는 AI를 활용하여 사용자에게 개인화된 조언을 제공하는 앱으로, Midjourney의 AI 기술과 결합할 가능성이 있다.

The Verge — AI원문
NewsAI 모델·API·

AWS에서 Claude Opus 5 출시: Anthropic의 최신 Opus 모델

Claude Opus 5가 Amazon Bedrock과 Claude Platform에서 제공된다. 이는 Anthropic의 가장 진보된 Opus 모델로, 코드 이해, 지식 작업, 시각적 이해 및 장기 작업에서 개선된 성능을 제공한다. 기본적으로 제로 데이터 보존(Zero Data Retention, ZDR)을 지원하며, AWS 환경 내에서 엔터프라이즈 보안과 데이터 거주지를 유지하면서 추론을 확장할 수 있다.

Claude Opus 5는 코드베이스를 이해하고 내비게이션할 수 있는 능력을 갖추고 있어, 생산 품질의 코드를 작성할 수 있다.

AWS Machine Learning Blog원문
NewsAI 리서치·논문·

AlphaFold AI를 활용한 유전자 편집 단백질 안전성 개선

유전자 편집 기술이 발전하면서 안전성이 중요한 과제로 떠오르고 있다. 기존의 유전자 편집 시스템은 오프 타겟 효과로 인해 잘못된 DNA 서열을 편집할 가능성이 존재한다. 최근 Nature에 발표된 연구에서는 AlphaFold AI를 수정하여 유전자 편집 단백질의 오프 타겟 효과와 관련된 주요 영역을 식별하고, 이들 영역을 수정하여 문제를 줄이는 방법을 제시하였다.

AlphaFold를 활용하여 유전자 편집 단백질의 오프 타겟 효과를 줄이는 방법을 개발함으로써, 유전자 편집 기술의 안전성을 향상시킬 수 있다.

Ars Technica — AI원문

Google Zero의 영향과 웹사이트 트래픽 감소

Google은 한때 웹사이트에 트래픽을 제공하는 대가로 데이터를 수집하고 웹페이지를 색인화하는 거래를 해왔다. 그러나 현재 이 거래가 사실상 종료된 것으로 보이며, 웹사이트들은 Google의 트래픽이 줄어들 경우의 상황을 고민해야 하는 상황에 직면했다. 최근 Reddit은 AI 훈련 계약에서 탈퇴를 고려하고 있으며, 일부 출판사들은 Google이 자사 사이트를 크롤링하는 것을 차단하는 방안을 검토하고 있다.

Google의 트래픽 감소는 웹사이트 운영자들에게 심각한 영향을 미칠 수 있다.

The Verge — AI원문

Lightcone Commons 소개 및 첫 번째 기부 라운드 정보

Oliver Habryka가 Lightcone Commons라는 새로운 기부 플랫폼을 소개했다. 이 플랫폼은 대규모 자선 기부를 조정하기 위한 중립적인 공간으로, 첫 번째 라운드에서 약 2천만 달러의 보조금이 예상된다. 비영리, 영리, 개인 모두 참여할 수 있으며, 기부자는 자신이 선호하는 평가를 따르거나 직접 조직에 자금을 지원할 수 있다. 첫 번째 라운드 신청 마감은 2026년 8월 23일이며, 추천은 2026년 10월 23일경에 이루어질 예정이다.

Lightcone Commons는 기부자들이 자금을 효과적으로 분배할 수 있도록 돕는 플랫폼으로, 약 2천만 달러의 보조금이 첫 번째 라운드에서 제공될 예정이다.

Don't Worry About the Vase (Zvi Mowshowitz)원문

OpenAI의 Brockman, 모델 증류 문제는 기술적 문제라고 언급

OpenAI와 Anthropic은 중국 기업들이 자사 모델을 증류하는 문제를 국가 안보 위협으로 보고 미국 정부에 대응을 촉구했다. OpenAI의 Greg Brockman은 기술적으로 이 문제를 해결할 수 있는 방법이 있다고 말했다. 그는 회사가 모델의 응답을 평가하고 추론을 추출하려는 시도를 감지하기 위해 머신러닝과 인간 검토 시스템을 운영하고 있다고 설명했다. 또한, OpenAI는 가격 경쟁력에 대한 우려에 대해 오픈 소스 모델이 저렴하지 않다고 강조하며, 자사의 하드웨어 사업을 강화하고 있다고 밝혔다.

OpenAI는 머신러닝과 인간 검토를 통해 모델 증류를 방지하는 시스템을 운영하고 있다.

Semafor Technology원문
NewsAI 리서치·논문·

Kimi K3 모델과 미국의 AI 경쟁 우려

Kimi K3는 매우 우수한 모델로, 월스트리트와 미국 정부가 미국의 AI 위치에 대해 우려하고 있다. 중국의 경쟁을 이해하고 수용하는 것이 필요하며, OpenAI와 Anthropic은 스스로 해결해야 할 상황이다. OpenAI는 Hugging Face를 우연히 해킹했으며, 이 사건의 교훈은 사람들이 생각하는 것보다 더 긍정적이다.

Kimi K3 모델은 미국의 AI 경쟁력에 대한 우려를 불러일으키고 있다.

Stratechery (Ben Thompson)원문
NewsAI 에이전트·

Meta, AI 챗봇에 생산성 기능 추가

Meta는 AI 챗봇을 업그레이드하여 질문에 답변하고 이미지를 생성하는 기능을 넘어서려 하고 있다. 이번 업데이트는 Meta AI가 사용자의 캘린더에 접근하여 이벤트 계획을 돕고, 일일 브리핑을 생성하며, 심층 연구를 수행할 수 있게 한다. 이 업데이트는 CEO 마크 저커버그가 AI의 미래로 언급한 '개인 슈퍼인텔리전스'를 향한 다음 단계로 설명된다. Meta는 이번 업데이트에 Muse Spark 1.1 모델을 사용하고 있다.

Meta AI는 사용자의 캘린더를 활용하여 이벤트 계획을 지원할 수 있다.

The Verge — AI원문

Kimi K3의 성능과 중국 오픈소스 AI 모델의 위험성

Kimi K3는 출시된 지 일주일이 지나면서 실제 성능이 다른 모델에 비해 미흡하다는 평가를 받고 있다. 사이버 보안 취약점 탐지에서 상위 AI 모델에 비해 성능이 떨어지며, 토큰 소모량이 많아 효율성도 낮다. 그러나 오픈소스 모델이기 때문에 안전 장치가 제거될 수 있어 해커에게 유용한 도구가 될 수 있다. 현재로서는 Kimi K3가 큰 피해를 줄 능력이 없어 보이지만, 미래에는 위험 요소가 될 수 있다.

Kimi K3는 오픈소스 모델로, 안전 장치가 제거되면 해커와 테러리스트에게 유용할 수 있다.

Semafor Technology원문
NewsAI 모델·API·

모델 체크포인트 전송 비용 증가 문제

모델 체크포인트의 크기가 수백 기가바이트에서 테라바이트에 이르면서, 데이터 전송 비용이 빠르게 증가하고 있다. 이러한 모델 가중치를 클러스터 내에서 이동하는 것은 매우 일반적이며, 예를 들어 콜드 스타트 시 원격 저장소에서 GPU 메모리로 가중치를 불러오고, 오토스케일링 및 롤링 업데이트 시 각 새로운 복제본을 채워야 한다.

모델 체크포인트의 크기가 증가함에 따라 데이터 전송 비용 관리가 중요해진다.

NVIDIA Technical Blog원문

AWS에서의 설명 가능한 차세대 제품 추천 시스템 구축

딥러닝 기반의 설명 가능한 차세대 제품 추천 시스템은 은행이 고객의 다음 필요 제품을 예측하는 데 도움을 준다. 이 시스템은 Amazon SageMaker AI와 PyTorch를 사용하여 설계되었으며, 고객 데이터의 다양한 측면을 처리하는 네 개의 전문화된 신경망 타워를 포함한다. 이 아키텍처는 고객별 설명 가능성을 제공하는 학습된 주의 메커니즘을 통해 높은 정확도를 달성한다.

Amazon SageMaker AI를 사용하여 고객 데이터를 기반으로 한 보다 정확하고 해석 가능한 추천 모델을 설계할 수 있다.

AWS Machine Learning Blog원문
NewsAI 개발·

AI 해커톤에서 재무 업무 문제 해결을 위한 접근 방식

네이버의 ‘모두의 Engineering Day AI 해커톤’에서 참가자들은 실제 업무 문제를 해결하기 위해 팀을 구성하고, AI를 활용하여 재무 업무를 자동화하는 프로젝트를 진행했다. 팀은 수기 Microsoft Excel 기반의 출자 현황 관리를 LLM·MCP 기반의 투자 포트폴리오 관리 플랫폼으로 전환하는 과제를 선택했다. 이 과정에서 AI의 역할을 단순한 도구가 아닌 문제 정의, 설계, 검증의 파트너로 설정하고, 현재 값이 아닌 거래 이력을 중심으로 시스템을 설계했다.

네이버 D2원문