본문으로 건너뛰기

News

AI 뉴스

매일 수집·정리하는 전세계 AI 소식을 최신순으로

NewsAI 리서치·논문·

GameCraft-Bench에서의 엄격한 실행 기준을 통한 게임 생성 최적화

이 연구에서는 학습된 판별자 없이도 생성된 프로젝트가 헤드리스 엔진에서 깔끔하게 실행되는지를 확인하는 엄격한 실행 기준을 적용하여 게임 생성의 일반화를 최적화하는 방법을 다룬다. GameCraft-Bench에서 14B 모델(Qwen3-14B+LoRA)을 사용하여, 네 가지 보지 못한 게임 가족에서의 깔끔한 생성 비율이 8.8%에서 42.2%로 증가하고, 최상의 K 커버리지가 18/25에서 25/25로 향상되었다. 이러한 성과는 단순히 데이터 추가에서 오는 것이 아니며, 판별자의 정밀도가 모델 학습에 미치는 영향을 강조한다.

Qwen3-14B+LoRA 모델을 사용한 연구에서, 엄격한 실행 기준을 통해 게임 생성의 성능을 크게 향상시킬 수 있음을 보여준다.

arXiv cs.AI (인공지능)원문
NewsAI 리서치·논문·

LLM 생성 임상 시험 요약의 신뢰성 평가 및 개선

대형 언어 모델(LLM)은 의료 제공자, 환자 및 지불자를 위한 임상 시험 결과 요약에 사용되지만, 허위 정보 생성 경향이 있어 위험이 크다. 이 연구는 세 가지 이해관계자 대상을 위한 LLM 생성 임상 시험 요약의 신뢰성을 측정하기 위한 벤치마크 평가 프레임워크를 소개한다. 이 프레임워크는 Aggregate Analysis of ClinicalTrials.gov 데이터베이스에서 추출한 200개의 계층화된 시험을 포함하며, 청중별 프롬프트 템플릿과 여섯 가지 차원의 신뢰성 주석 스키마를 사용하여 평가된다. GPT-4o, Claude Sonnet 4.6, Gemini 2.5 Flash의 1,800개 생성 요약에 대한 기준 측정이 설정되었고, 모든 모델에서 '지원되지 않는 주장'이 주요 실패 모드로 확인되었다. 지식 그래프를 활용한 검색 시스템이 개발되어 기준선과 비교 평가되었으며, NLI 기반 신뢰성 점수에서 통계적으로 유의미한 개선을 보였다.

GPT-4o, Claude Sonnet 4.6, Gemini 2.5 Flash 모델의 신뢰성 평가를 통해 임상 시험 요약의 품질을 개선할 수 있는 방법을 제시한다.

arXiv cs.CL (계산언어학·NLP)원문
NewsAI 리서치·논문·

머지 아비트리지 예측을 위한 언어 모델 시스템

이 연구에서는 M&A 거래의 결과를 예측하는 머지 아비트리지에 특화된 언어 모델 예측 시스템을 제시한다. 이 시스템은 수백 페이지의 기술 문서에 대한 긴 맥락 추론을 요구하며, 전문가의 맥락 설계와 역사적 거래에서 유도된 후향적 추론 트레이스를 기반으로 파인튜닝을 결합한다. 발표된 거래에 대해 세 가지 상호 배타적 결과(발표된 조건으로 종료, 더 높은 입찰, 거래 종료)에 대한 확률 분포를 출력하며, 42개국의 400건 이상의 대규모 거래에 대한 평가에서 Brier 점수를 0.151로 줄이며 최고의 성능을 달성하였다.

이 시스템은 LLM 기반 예측이 전문화된 긴 맥락의 금융 워크플로우에서 성공할 수 있음을 보여준다.

arXiv cs.CL (계산언어학·NLP)원문
NewsAI 리서치·논문·

YUKTI: 자연어 상황을 수치적 계획으로 변환하는 새로운 접근법

YUKTI는 언어 모델이 단일 목표와 점수 기반 계수를 사용하는 기존 파이프라인의 한계를 극복하기 위해, 관계가 형상 사전, 계수 불확실성 및 출처를 포함하는 유형 제안 그래프를 사용한다. YUKTI는 각 단계를 정확한 비선형 또는 진화적 해결사로 라우팅하고, 분포적 파레토 핸드오프를 통해 단계를 연결하며, 가정 강건 파레토 경계(ARPF)를 도입하여 각 행동이 얼마나 자주 생존하는지를 평가한다. 세 가지 방법으로 검증하였고, 강건한 타협안은 평균 및 꼬리 후회를 90% 이상 줄였다. YUKTI는 LLM이 단순한 수치 제공 시 약 47배의 후회를 초래하는 것과 비교하여 더 나은 성능을 보였다.

YUKTI는 가정 강건 파레토 경계를 통해 의사결정의 후회를 줄이고, 평균 및 꼬리 후회를 90% 이상 감소시킬 수 있다.

arXiv cs.AI (인공지능)원문
NewsAI 툴·

AuditWeave: AI 지원 및 데이터 변환 워크플로우를 위한 변조 방지 증거 레이어

AuditWeave는 AI 지원 및 데이터 변환 워크플로우의 단계를 기록하는 경량 Python 라이브러리로, 실행 시간 의존성이 없다. 이 라이브러리는 단일 추가 전용 해시 체인 원장에 증거를 기록하며, 다양한 이벤트 용어를 사용하여 RAG 파이프라인과 표 형식/레이크하우스 변환을 아우른다. 원장 내에서 이벤트의 수정, 재정렬, 삽입 또는 삭제는 체인 검증을 통해 감지 가능하다. 구현된 참조 모델에서 기록 오버헤드, 확장성 및 변조 탐지 정확성을 평가하였고, 이벤트당 수십 마이크로초의 비용으로 무결성 보장을 제공한다.

AuditWeave는 AI 지원 결정의 근거를 추적할 수 있는 기능을 제공하여 감사 및 규제 환경에서의 신뢰성을 높인다.

arXiv cs.LG (머신러닝)원문
NewsAI 리서치·논문·

메시지 형식의 효과는 계층에 따라 다르다: 다중 홉 에이전트 릴레이에서의 연구

LLM 에이전트가 정보를 서로 전달할 때 메시지 형식이 중요한지에 대한 연구가 진행되었다. 연구에서는 12개의 원자 사실을 다섯 가지 형식(NL, JSON, triples, key-value)으로 재인코딩하여 6회 릴레이하며, 두 가지 릴레이 능력 계층에서 평가하였다. 결과적으로 메시지 형식의 효과는 계층에 따라 다르며, 강력한 릴레이에서는 손실이 거의 없고, 약한 릴레이에서는 형식 간의 기억력 차이가 8.7배 증가하였다. 잘못된 값이 주입되면 모든 형식에서 최종 홉까지 83-100%의 확률로 지속된다.

형식 선택은 파이프라인에서 가장 약한 릴레이를 따라야 한다.

arXiv cs.AI (인공지능)원문
NewsAI 리서치·논문·

SciML 방법의 구조적 선행 조건이 예측 성능에 미치는 영향 연구

Scientific Machine Learning (SciML) 방법인 Neural Ordinary Differential Equations (NODEs), Physics-Informed Neural Networks (PINNs), Universal Differential Equations (UDEs)는 구조적 선행 조건이 신뢰할 수 있는 동역학을 반영할 때 가장 효과적이다. 본 연구에서는 거시경제 예측을 스트레스 테스트 도메인으로 사용하여 ARIMA, LSTM, NODE, PINN, UDE의 다섯 가지 모델 패밀리를 23개 국가에서 평가하였다. 결과적으로, 평가된 모델들은 일관된 예측 성능을 보이지 않았으며, ARIMA와 NODE와 같은 덜 제약된 모델이 PINN과 UDE와 같은 더 제약된 모델보다 일관되게 우수한 성능을 보였다. 이는 SciML의 거부가 아니라, 구조적 선행 조건이 데이터 생성 과정과 일치하지 않을 때 잘못된 정규화로 작용할 수 있음을 보여준다.

SciML 실무자들은 구조가 도움이 되는지 테스트해야 하며, 구조적 선행 조건이 데이터 생성 과정과 일치하지 않을 경우 예측 성능에 부정적인 영향을 미칠 수 있다.

arXiv cs.LG (머신러닝)원문
NewsAI 리서치·논문·

Bilibili에서 개발한 Index-1.9B 시리즈 언어 모델

Bilibili에서 개발한 Index-1.9B는 1.9억 개의 비임베딩 파라미터를 가진 네 가지 모델로 구성된다. Index-1.9B-Base는 2.8조 개의 주로 중국어와 영어 토큰으로 사전 학습된 기초 모델이다. Index-1.9B-Pure는 모든 지시형 데이터를 필터링하여 학습된 변형 모델이며, Index-1.9B-Chat은 감독된 미세 조정과 직접 선호 최적화를 통해 정렬된 모델이다. Index-1.9B-Character는 채팅 모델에 검색 증강 생성을 추가하여 역할 놀이 맞춤화를 지원한다. Index-1.9B-Base는 여러 표준 벤치마크에서 평균 64.92점을 기록하며, 그 크기의 몇 배에 달하는 오픈 모델과 경쟁력을 보인다. 모든 모델과 평가 코드는 https://github.com/bilibili/Index-1.9B에서 공개된다.

Index-1.9B-Base는 64.92점의 평균 점수를 기록하여, 대규모 모델과 경쟁할 수 있는 성능을 보여준다.

arXiv cs.CL (계산언어학·NLP)원문
NewsAI 코딩·

Codex 사용자 수 6개월 만에 10배 증가, 700만 명 도달

Codex의 사용자 수가 6개월 만에 10배 증가하여 현재 700만 명에 도달했다. Codex는 올해 초 약 55만에서 70만 명의 사용자로 시작했으며, Claude Code는 약 200만 명의 사용자와 25억 달러의 ARR을 기록하고 있다. Prime Intellect는 에이전트 RL 및 평가를 위한 환경 스택을 재설계한 verifiers v1을 출시했다.

Latent Space (swyx & Alessio)원문
NewsAI 코딩·

DOOMQL: SQLite를 게임 엔진으로 활용한 도스 스타일 게임

Peter Gostev가 GPT-5.6 Sol을 사용해 개발한 DOOMQL은 SQLite를 게임 엔진으로 활용한 작은 도스 스타일 게임이다. 이 게임은 SQL을 통해 이동, 충돌, 적, 전투, 진행 및 화면의 모든 RGB 픽셀을 제어한다. Python 터미널 스크립트로 구현되어 있으며, 사용자는 GitHub에서 코드를 클론하여 실행할 수 있다. 또한, Datasette 앱을 통해 SQL 쿼리를 실행하고 게임 상태를 실시간으로 반영하는 HTML+JavaScript 앱을 만들 수 있다.

DOOMQL은 SQLite 데이터베이스를 사용하여 게임의 모든 요소를 SQL 쿼리로 처리하는 방식을 보여준다.

Simon Willison's Weblog원문
News커리어·채용·

인스타그램, 13명 팀에서 4명 팟으로 조직 구조 변화

인스타그램의 수장 아담 모세리(Adam Mosseri)는 최근 팟캐스트에서 AI 시대에 맞춰 조직 구조가 변화하고 있음을 언급하며, "13명이 하던 일을, 지금은 4명이 한다"고 밝혔다. 이는 미국 내에서 많은 조직들이 인력을 줄이고 팀의 구조를 가볍게 만드는 변화의 일환으로 보인다.

인스타그램의 조직 변화는 AI 시대에 기업들이 인력 구조를 어떻게 재설계하고 있는지를 보여준다.

AI 코리아 커뮤니티 뉴스레터원문
NewsAI 에이전트·

TwelveLabs의 비디오 AI 에이전트 Jockey

TwelveLabs의 Jockey는 사용자의 전체 비디오 라이브러리를 이해하는 AI 에이전트이다.

Product Hunt — Artificial Intelligence원문

OpenAI GPT-5.6 Sol, Terra, Luna가 Amazon Bedrock에서 일반 제공 시작

OpenAI의 GPT-5.6 Sol, Terra, Luna 모델이 Amazon Bedrock에서 일반 제공된다. GPT-5.6 Sol은 가장 강력한 모델로, Artificial Analysis Coding Agent Index에서 80점을 기록하며, GPT-5.5보다 비용과 시간에서 절반 이하로 소모한다. Terra는 일상적인 생산 작업에 적합하며, Luna는 고속 추론 작업에 적합하다. Amazon Bedrock의 차세대 추론 엔진은 수요 급증을 처리하고, 요청을 지정된 AWS 리전 내에서 유지하여 데이터 거주 요건을 충족한다.

GPT-5.6 Sol은 Artificial Analysis Coding Agent Index에서 80점을 기록하며, 이전 모델보다 성능과 비용 효율성을 크게 개선했다.

AWS Machine Learning Blog원문
NewsAI 모델·API·

OpenAI의 GPT-5.6-Sol 출시 및 가격 정보

OpenAI의 GPT-5.6-Sol 모델이 출시되었으며, 가격은 $5/$30이다. Terra는 $2.50/$15, Luna는 $1/$6로 책정되었다. GPT-5.6은 AI 연구 가속화에 가장 강력한 모델로, 내부 연구자들이 이를 통해 평균 일일 출력 토큰 수가 GPT-5.5의 두 배 이상 증가했다고 보고되었다.

GPT-5.6은 AI 연구의 효율성을 높이는 데 기여하며, 연구 및 다양한 팀에서 AI 지원의 증가를 보여준다.

Don't Worry About the Vase (Zvi Mowshowitz)원문
NewsAI 에이전트·

iOS 27의 Siri AI와 기능 개선 사항

iOS 27의 첫 번째 공개 베타가 출시되었다. 이번 업데이트는 새로운 기능보다는 기존의 문제를 수정하고 시스템 전반의 속도를 향상시키는 데 중점을 두었다. 앱 실행, 사진 검색 결과, AirDrop 전송 속도가 빨라졌으며, 메시지 앱은 인라인 회신과 RCS 메시지에 대한 종단 간 암호화를 지원한다.

iOS 27에서 Siri AI는 사용자 경험을 개선하고, 앱 실행 속도를 높이는 데 기여한다.

The Verge — AI원문

Apple, OpenAI를 상대로 전 직원의 기밀 정보 유출 소송 제기

Apple은 OpenAI에 대해 전 직원이 Apple 서버의 기밀 정보에 접근할 수 있도록 한 '희귀한' 버그를 발견한 후 소송을 제기했다. Apple은 OpenAI가 전 Apple 직원들과 공모하여 불법적으로 AI 기기를 출시하려 했다고 주장하며 여러 금지 명령을 요청했다. 이 사건은 Apple의 현재 직원인 Yu-Ting 'Alyssa' Peng과 전 직원 Chang Liu 간의 내부 메시지를 조사하는 과정에서 발생했다.

Apple은 OpenAI가 전 직원으로부터 기밀 정보를 유출받았다고 주장하고 있다.

Ars Technica — AI원문
NewsAI 리서치·논문·

NVIDIA의 Ising 디코딩, 색 코드 논리 오류율 300배 이상 감소

유용한 양자 컴퓨터는 오류 내성이 있는 논리 연산을 필요로 하며, 연구자들은 이를 위해 다양한 양자 오류 수정(QEC) 코드를 탐색하고 있다. 특히, 표면 코드와 같은 위상 코드 계열을 통해 논리 연산을 수행하는 방법이 잘 알려져 있다. 이와 관련하여 NVIDIA는 Ising 디코딩을 통해 색 코드의 논리 오류율을 300배 이상 감소시켰다.

NVIDIA Technical Blog원문
NewsAI 리서치·논문·

AI의 발전과 직업의 미래에 대한 논의

지난주 서울에서 열린 국제 머신러닝 컨퍼런스에서 '우리가 할 일이 남아 있을까?'라는 주제로 기조연설을 했다. AI의 능력이 증가함에 따라 우리가 어떻게 적응해야 하는지에 대한 우려를 다뤘다. AI는 정상 기술로서의 프레임워크를 통해 AI의 영향력을 이해하고, 재귀적 자기 개선이 일어나더라도 갑작스럽게 모든 일자리를 대체하지는 않을 것이라고 주장했다. 미래의 일자리는 급격히 변화할 것이며, AI와의 협업을 통해 인간의 잠재력을 증대시킬 수 있는 기회가 있다.

AI의 능력이 증가함에 따라, AI를 정상 기술로 이해하고 이에 적응하는 것이 중요하다.

AI Snake Oil (Narayanan & Kapoor)원문
NewsAI 리서치·논문·

Anthropic의 LLM 내부 메커니즘 연구 결과

Anthropic은 LLM(대형 언어 모델)의 내부 메커니즘을 이해하기 위해 J-space라는 공간을 발견했다. 이 공간은 출력에 나타나지 않지만 문제 해결에 영향을 미치는 단어들로 채워져 있다. 이 연구는 Anthropic의 모델 Claude를 통해 새로운 기법으로 이루어졌으며, LLM이 특정 작업에서의 진행 상황을 추적하거나 결정 과정에 대한 내부 논평을 나타낼 수 있음을 보여준다.

Anthropic의 연구는 LLM의 작동 원리를 이해하는 데 중요한 진전을 이루었으며, 이는 LLM을 완전히 제어하기 위한 기초가 된다.

MIT Technology Review — AI원문
NewsAI 툴·

AI를 통한 접근성: 신경다양성을 가진 전문가의 사례

이 글에서는 신경다양성을 가진 전문가가 AI를 접근성 도구로 활용한 경험을 공유한다. Amazon Quick on your desktop을 사용하여 매일의 실행 기능 격차를 보완하는 시스템을 구축했으며, 영국 성인 인구의 약 15~20%가 신경다양성을 가진다고 한다. 신경다양성을 가진 전문가들은 이메일 관리와 우선순위 설정에서 더 많은 인지 에너지를 소모하며, AI 시스템이 이를 지원하는 방법을 설명한다.

Amazon Quick on your desktop을 활용하여 신경다양성을 가진 전문가들이 이메일 분류와 우선순위 결정을 보다 효율적으로 처리할 수 있다.

AWS Machine Learning Blog원문
NewsAI 에이전트·

Bluesight의 Amazon Bedrock을 활용한 에이전틱 AI 솔루션 구축

Bluesight는 Amazon Bedrock AgentCore를 사용하여 340B 약물 가격 프로그램 준수를 위한 에이전틱 AI 솔루션 Prism을 개발했다. Prism Assistant for ControlCheck는 2026년 5월에 출시되어 20개 의료 시스템에서 사용 중이다. Bluesight는 약물 전환 감지와 GPO 계약을 통한 외래 약물 구매 제한을 해결하기 위해 여러 제품의 데이터를 통합하는 AI 아키텍처를 필요로 했다.

AWS Machine Learning Blog원문

애플, OpenAI를 상대로 한 소송에서 기밀 문서 도용 주장

애플은 OpenAI가 기밀 문서를 도용하고 하드웨어 프로토타입을 염탐했으며, 신뢰하는 파트너를 속여 독점 제품 디자인 기법을 수행하게 했다고 주장하는 소송을 제기했다. 이 소송은 애플의 부사장 출신인 탕 탄과 관련된 세 사람의 행동을 중심으로 진행되고 있다. 탕 탄은 2024년에 애플을 떠나 OpenAI로 이직했다.

The Verge — AI원문
NewsAI 리서치·논문·

SymCrypt에서 Rust를 활용한 암호화 검증

SymCrypt는 Rust, Aeneas, Lean을 사용하여 새로운 검증된 암호화를 개발하고 있으며, 이는 포스트 양자 암호화 알고리즘에 대한 높은 보안 보장을 제공합니다. Microsoft는 SHA-3 및 ML-KEM에 대한 검증된 코드, 사양, 속성 및 증명을 공개하고 있습니다. Aeneas는 Rust 코드의 대규모 검증을 가능하게 하며, Lean에서의 효율적인 자동화를 지원합니다. SymCrypt는 Windows 및 Azure를 포함한 여러 제품과 서비스에 사용되는 Microsoft의 오픈 소스 암호화 라이브러리입니다.

SymCrypt는 Rust로 작성된 ML-KEM 및 SHA-3 코드에 대한 완전한 증명을 포함하여, 안전한 Rust 구현을 통해 메모리 안전성 문제를 배제합니다.

Microsoft Research Blog원문
News커리어·채용·

AI가 기술 면접에 미치는 영향과 채용 시장의 변화

AI가 소프트웨어 엔지니어링 직무에 위협을 가하고 있으며, 지원자들은 원격 기술 면접 중 AI 도우미를 사용하여 실시간으로 답변을 제안받고 있다. 반면, 고용주들은 AI를 활용해 면접 중 AI 사용의 징후를 감지하는 도구를 적용하고 있다. 이러한 양면적 역학 관계는 채용 과정을 AI 무기 경쟁으로 변화시키고 있으며, AI 도구가 지원자의 패턴을 식별하는 데 능숙하다는 점이 강조되고 있다. AI 면접 도구는 지원자의 눈 움직임, 응답 지연, 말의 패턴 등을 추적하여 AI 사용 여부를 판단한다. 그러나 AI 도구의 정확성은 아직 완벽하지 않으며, 인종적 편향과 지원자 데이터의 프라이버시 문제도 우려되고 있다.

AI 면접 도구는 지원자의 응답 패턴을 분석하여 AI 사용 여부를 판단하는 데 사용되지만, 이로 인해 우수한 후보가 부당하게 필터링될 위험이 있다.

IEEE Spectrum — AI원문