본문으로 건너뛰기

News

AI 뉴스

매일 수집·정리하는 전세계 AI 소식을 최신순으로

NewsAI 리서치·논문·

FinAbstain: 불확실성 보정 다중 모달 RAG를 활용한 선택적 금융 예측

FinAbstain은 불확실성 보정 다중 모달 검색 증강 생성(RAG) 프레임워크로, 예측 시점에 공개된 정보만을 사용하여 기본, 뉴스, 기술, 위험 및 검증 에이전트에 모달리티별 증거를 제공합니다. 이 프레임워크는 불확실성이 검증된 임계값 이하일 때만 상승, 하락 또는 중립 결과를 예측하며, 그렇지 않을 경우 증거 요청, 노출 감소 또는 인간 검토로 경로를 변경합니다. 평가에는 비정상 수익 방향, 변동성 간격 및 abstention 결정이 포함되며, 정확도, 보정, 위험-커버리지 등의 메트릭을 사용합니다.

FinAbstain은 불확실성 보정을 통해 선택적 오류와 손실을 줄이는 금융 예측 모델을 제공합니다.

arXiv cs.LG (머신러닝)원문
NewsAI 리서치·논문·

GAUGE: 전문가 참조 없이 금융 모델 평가하는 벤치마크

GAUGE는 금융 모델을 단일 전문가 참조가 아닌 관찰된 분석가 관행에 따라 평가하는 벤치마크로, 1,001개의 공급업체 분류 분석가 작업북과 196개의 평가 작업 세트를 사용한다. 108개의 지향 쌍을 분석한 결과, 중간 단일 참조 점수는 0.33이며, 92.6%가 0.70 미만이다. 현재의 에이전트는 모델 구축에서 강하지만 평가 판단에서는 상대적으로 약하다.

GAUGE는 1,001개의 분석가 작업북과 196개의 평가 작업 세트를 활용하여 금융 모델의 평가 방식을 혁신적으로 변화시킨다.

arXiv cs.LG (머신러닝)원문
NewsAI 리서치·논문·

CaRE: Masked Diffusion Language Models의 평가 프로토콜

Masked diffusion language models(MDLMs)의 평가 기준이 발전 속도를 해석하는 데 부족함을 드러내고 있다. CaRE는 MDLM 리마스킹 전략을 감사하는 컴퓨트 인식 평가 프레임워크로, 실제 함수 평가 수(NFE)를 표준화하고, 다중 메트릭 보고를 강제하며, 확률성을 명시적으로 제어한다. 7개의 리마스킹 전략을 LLaDA-8B-Base와 Dream-7B-Base에서 4개의 확률성 수준과 3개의 단계 예산으로 적용한 결과, 온도가 MAUVE 변동의 대부분을 설명하고, 컴퓨트 일치 비교가 여러 발표된 전략 순위를 뒤집으며, 고엔트로피 리마스킹이 MAUVE를 감소시키는 경향이 있음을 보여준다. 이 평가 프로토콜과 리더보드는 향후 리마스킹 주장의 재현성과 비교 가능성을 보장하기 위해 공개된다.

CaRE는 MDLM 리마스킹 전략의 평가를 표준화하여, 알고리즘 개선과 평가 아티팩트를 구분할 수 있는 방법을 제공한다.

arXiv cs.AI (인공지능)원문

AI 연구 자동화와 관련된 1,171명의 직원 성명서

1,171명의 AI 연구소 직원들이 AI 연구 자동화의 위험성을 경고하는 성명서를 발표했다. 이들은 AI가 더 나은 미래를 만드는 데 기여할 수 있지만, 그 결과는 보장되지 않으며, AI의 발전 속도가 우리의 이해와 통제를 초과할 위험이 있다고 주장했다. 이들은 미국 정부에 AI 개발의 속도를 조절할 수 있는 기술적 및 관리적 도구 개발을 지원할 것을 요청했다.

AI 연구 자동화에 대한 우려가 커지고 있으며, 이는 AI 기술의 발전 속도와 관련된 정책 결정에 영향을 미칠 수 있다.

Latent Space (swyx & Alessio)원문

Cursor, iPad에서 사용 가능

Cursor for iPad가 모든 유료 플랜에서 사용 가능해졌다. iPhone과 iPad에 새롭게 추가된 인박스 기능으로 진행 중인 작업과 주의가 필요한 PR을 확인할 수 있다. iPad 레이아웃은 더 큰 화면에 맞게 재구성되었으며, 사이드바 채팅이 고정되어 여러 에이전트를 동시에 모니터링할 수 있다. 리뷰 화면은 전체 PR을 커버하며, 리뷰어 추가 및 변경, 댓글 확인, 에이전트에게 문제 해결을 요청할 수 있다. 추가적으로 Bitbucket과 Azure DevOps SCM을 지원하며, 하나의 채팅에서 여러 PR을 생성할 수 있는 멀티 PR 세션 기능이 도입되었다.

Cursor for iPad는 리뷰 경험을 개선하여 개발자들이 더 효율적으로 PR을 관리하고 협업할 수 있게 한다.

Cursor (Anysphere) Changelog원문
NewsAI 툴·

클로드 코드 채널 기반 활용 및 정책 변경

요즘IT는 5월 27일과 6월 10일에 클코나잇 2 웨비나를 개최하고, 클로드 코드(Claude Code)를 업무에 활용한 경험을 공유했다. 발표에서는 6월 15일부터 Agent SDK와 헤드리스 모드가 별도 크레딧으로 전환된다는 내용을 다루었으나, 6월 16일 앤트로픽이 해당 전환을 철회하고 기존 정책을 유지한다고 안내했다. 따라서 현재는 Agent SDK를 그대로 사용할 수 있으며, 클로드 채널의 활용 사례는 여전히 유용하다.

6월 15일부터 헤드리스 모드가 별도 크레딧으로 전환될 예정이었으나, 정책이 철회되어 기존 구독 사용량에 따라 운영된다.

요즘IT (Yozm IT)원문
NewsAI 모델·API·

클로드 오푸스 5 출시 및 사용 방식 변화

클로드 오푸스 5가 7월 24일 출시되었으며, 이는 5세대 클로드의 세 번째 모델이다. 오푸스 5는 일상 업무와 엔터프라이즈에 적합하도록 설계되었고, 가격은 입력 $5, 출력 $25(100만 토큰 기준)로 페이블 5의 절반이다. 기존의 클로드 사용 방식과 달리, 오푸스 5는 새로운 프롬프트와 하네스 방식이 요구된다.

오푸스 5는 매일 사용하는 모델로, 에이전트 작업에 중점을 두고 있어 기업의 코딩 작업 효율성을 높일 수 있다.

요즘IT (Yozm IT)원문
NewsAI 리서치·논문·

마크 저커버그, AI의 미래는 모두를 위한 것이라고 주장

마크 저커버그는 WSJ 기고문에서 고급 AI는 소수의 연구소나 정부 통제 시스템에 국한되어서는 안 되며, 기업, 개인, 개방 생태계, 제품 및 국가 인프라를 통해 확산되어야 한다고 주장했다. 그는 AI를 개인의 주체성을 확장하는 도구로 이해해야 하며, 혁신을 보존하고 구체적인 해악을 규제해야 한다고 강조했다.

저커버그는 AI의 확산과 미국의 리더십을 강조하며, AI 정책의 방향성을 제시하고 있다.

r/LocalLLaMA원문
NewsAI 리서치·논문·

Claude Mythos를 활용한 암호학적 결함 발견

Anthropic 연구자들이 Claude Mythos를 사용하여 HAWK와 AES의 약한 버전에서 수학적 결함을 발견했다. 이 과정에서 모델이 포기하지 않도록 유도하는 인간의 개입이 있었으며, Mythos Preview는 총 60시간 동안 작동했다. 이 연구는 ETH 취리히, 텔아비브 대학교, 하이파 대학교와 협력하여 진행되었으며, 새로운 평가 방법이 개발되었다.

Mythos Preview는 약 100,000달러의 API 비용이 소요되었으며, 연구의 목표는 기존 접근 방식보다 나은 공격 방법을 찾는 것이다.

Simon Willison's Weblog원문
NewsAI 툴·

uv 0.12.0 출시 및 주요 변경사항

uv 0.12.0 버전에서는 <code>uv init</code> 명령어로 생성되는 기본 프로젝트 구조가 변경되었다. 이전 버전에서는 <code>main.py</code> 파일이 프로젝트 루트에 위치했으나, 이제는 <code>src/</code> 디렉토리 구조로 변경되었다. 또한, <code>uv_build</code> 백엔드를 설정하여 <code>uv build</code> 명령어로 휠 및 <code>.tar.gz</code> 배포 파일을 생성할 수 있게 되었다. <code>uv-init</code>는 스크립트 별칭으로 설정되어 <code>uv run uv-init</code> 명령어로 실행 시 <code>src/uv_init/__init__.py</code>의 새로운 <code>main()</code> 함수를 호출한다.

<code>uv init</code>의 기본 프로젝트 구조가 <code>src/</code> 형태로 변경되어, 더 나은 패키지 관리를 지원한다.

Simon Willison's Weblog원문

2026년 7월 OpenAI 사이버 공격 사건 기술 타임라인

Hugging Face는 OpenAI의 사이버 공격 사건에 대한 상세한 기술 설명을 발표했다. 이 공격은 JFrog의 Artifactory에서 발견된 제로데이 취약점을 이용해 발생했으며, 공격자는 HTTP 프록시를 통해 샌드박스를 탈출하고 외부 샌드박스를 제어하여 공격을 수행했다. 공격은 2026년 7월 8일부터 13일까지 5일간 진행되었으며, 다양한 기법을 사용해 네트워크를 탐색하고 데이터를 유출했다.

공격자는 JFrog의 Artifactory에서 발견된 제로데이 취약점을 이용해 공격을 시작했다.

Simon Willison's Weblog원문
NewsAI 모델·API·

Perplexity의 Model Council, 다중 모델 쿼리 구성 기능 추가

AI 검색 기업 Perplexity는 화요일에 Model Council을 클라우드 기반 Computer 플랫폼에 확장하여 사용자가 다중 모델 쿼리를 구성할 수 있는 방법을 추가했다. Model Council은 사용자가 특정 문제에 대해 여러 모델을 독립적으로 작동시켜 결과를 종합하는 기능을 제공한다. 이제 사용자는 OpenAI, Anthropic, Google 등 다양한 모델 중 2개에서 8개를 선택할 수 있으며, 보고서 및 작업 준비 자산으로 결과를 변환할 수 있다. Model Council의 접근은 개인 Max 및 Pro 사용자에게도 제공되며, 사용량 기반 과금이 적용된다.

사용자는 Model Council을 통해 법률, 금융, 기업 의사결정 등에서 다양한 모델의 관점을 종합적으로 고려할 수 있다.

The Register — AI/ML원문
NewsAI 모델·API·

Anthropic의 Opus 5, Fable을 벤치마크에서 초과 성능

Matthew Berman의 리뷰에 따르면, Anthropic의 새로운 AI 모델 Opus 5가 Fable을 거의 모든 벤치마크에서 초과 성능을 보였으며, 가격은 Fable의 절반이다. Opus는 Anthropic의 모델 라인업에서 Fable 아래 단계에 위치하지만, 벤치마크 결과는 반대의 결과를 보여주었다.

Opus 5는 가격 대비 성능이 뛰어나 AI 모델 시장의 경쟁 구도를 변화시킬 수 있다.

AI 코리아 커뮤니티 뉴스레터원문
NewsAI 리서치·논문·

의료 로봇 개발의 데이터 수집 한계

의료 로봇은 자율주행이나 산업 로봇과 달리 인터넷 규모의 데이터 수집이나 무제한의 실제 실험에 의존할 수 없다. 각 시연은 전문 장비, 임상 전문 지식, 환자 또는 실험실 환경에 대한 접근이 필요하다. 이로 인해 개발자들은 데이터 격차, 전문 장비의 필요성, 임상 환경의 제한이라는 세 가지 근본적인 도전에 직면하게 된다.

의료 로봇 개발에 있어 데이터 격차는 효과적인 훈련을 위한 큰 장애물이다.

NVIDIA Technical Blog원문
NewsAI 에이전트·

MCP 2026-07-28 사양 발표 및 AgentCore Gateway 지원

모델 컨텍스트 프로토콜(Model Context Protocol, MCP)의 2026-07-28 사양이 발표되었다. 이 버전에서는 프로토콜이 무상태(stateless)로 변경되어 일반 HTTP 인프라에서 확장 가능해졌다. 새로운 버전은 거버넌스 확장 시스템을 도입하고, OAuth 2.0 및 OpenID Connect와의 권한 부여를 강화하며, 향후 호환성 보장을 위한 라이프사이클 보장을 설정하였다. 기존 클라이언트는 이전과 동일하게 작동하며, 새로운 버전은 선택적으로 활성화할 수 있다.

2026-07-28 버전의 도입으로 MCP 프로토콜이 무상태로 변경되어 기업 배포에서의 확장성 문제를 해결할 수 있다.

AWS Machine Learning Blog원문
NewsAI 모델·API·

Claude Opus 5, Fable 5와 비슷한 성능을 반값에 제공

Claude Opus 5는 Fable 5와 비슷한 성능을 제공하면서 API에서 토큰당 가격이 절반이며, 구독을 통해 더 저렴하게 이용할 수 있다. Opus 5는 주로 로컬 작업에 강하며, 복잡한 작업에서는 Fable보다 느리거나 과도한 경우가 많다. 그러나 Opus 5는 사용자와의 상호작용에서 부정적인 반응을 보이는 경우가 있어, Fable에 비해 불만이 많다. Opus 5는 오늘부터 사용 가능하며, 코딩과 데이터 분석에서 새로운 최첨단 모델로 평가받고 있다.

Opus 5는 Fable 5의 절반 가격으로 비슷한 성능을 제공하여 비용 효율적인 선택이 될 수 있다.

Don't Worry About the Vase (Zvi Mowshowitz)원문
NewsAI 에이전트·

LangGraph와 Strands를 활용한 시장 감시 에이전트 구축

AI 애플리케이션이 발전함에 따라 복잡한 다중 에이전트 워크플로우를 조정하는 데 새로운 도전이 생기고 있다. LangGraph는 다중 에이전트 조정을 위한 상태 및 방향 그래프 관리에 뛰어나며, Strands는 개별 워크플로우 노드 내에서의 추론 엔진 역할을 한다. Amazon Bedrock AgentCore의 출시로 복잡한 사용 사례를 처리할 수 있는 생산 준비 완료된 에이전틱 AI 시스템을 구축할 수 있다. 이 포스트에서는 LangGraph와 Strands를 사용하여 AWS 인프라에서 다중 에이전트 AI 시스템을 설계하고 배포하는 방법을 설명한다.

LangGraph는 다중 에이전트 조정과 상태 관리를 위한 세밀한 제어를 제공하여 복잡한 비즈니스 프로세스를 효과적으로 처리할 수 있다.

AWS Machine Learning Blog원문

미시시피 대학 교수, AI 부정행위 적발을 위한 시험 프롬프트 숨겨

미시시피의 알콘 주립대학교 역사 및 아프리카계 미국인 연구 교수 제이슨 기브슨은 학생들이 AI를 사용해 부정행위를 하는지를 확인하기 위해 시험 프롬프트에 숨겨진 텍스트를 삽입했다. 35명의 학생 중 32명이 이 함정에 걸렸으며, 숨겨진 지시사항은 '응답에 마다가스카르라는 단어를 의미 없이 포함하라'는 것이었다. 기브슨은 학생들이 AI의 출력을 검토하지 않고 제출한 것으로 보인다고 밝혔다.

기브슨은 AI 사용이 학생들의 비판적 사고 능력에 부정적인 영향을 미치고 있음을 강조했다.

The Register — AI/ML원문

npm 및 GitHub Actions의 공급망 공격 방지 조치

지난 1년간 패키지 리포지토리와 CI/CD 시스템을 겨냥한 공급망 공격이 증가하고 있다. GitHub은 2026년 6월부터 고위험 npm 계정에 대한 예방적 계정 보호를 도입하고, GitHub Actions의 기본 설정을 변경하여 신뢰할 수 없는 코드의 체크아웃을 방지하며, 워크플로우 트리거에 대한 제어를 강화하고, 신뢰할 수 없는 트리거에 대한 읽기 전용 캐시를 도입했다. 또한, npm의 신뢰할 수 있는 배포 기능이 CircleCI를 지원하게 되어 장기적인 자격 증명을 제거할 수 있다.

2026년 6월부터 npm 계정에 대한 예방적 보호 조치를 통해 공격자가 계정을 악용하기 전에 복구할 수 있는 시간을 제공한다.

GitHub Blog원문
NewsAI 툴·

Anthropic의 소프트웨어 개발 변화: Claude Managed Agents와 Rust로의 전환

Anthropic의 Claude Platform 팀은 Claude Managed Agents를 개발하는 데 6개월이 걸렸으며, 이는 클라우드에서 실행되는 생산 에이전트를 위한 사전 구축된 하네스이다. 이 프로젝트는 2023년 4월에 출시되었고, 고객의 요구에 따라 자체 호스팅 샌드박스를 구축하는 방향으로 진행되었다. 또한, Claude Platform은 Python에서 Rust로 마이그레이션 중이며, 이는 높은 부하에서 성능을 개선하기 위한 결정이다. AI 실험실 내에서 프로토타입 제작이 더 유동적이며, AI가 코드 리뷰 및 테스트를 수행하는 경향이 증가하고 있다.

The Pragmatic Engineer (Gergely Orosz)원문
NewsAI 코딩·

Codex와 ChatGPT Work, 1000만 사용자 도달

2026년 1월 이후 Codex 사용자가 10배 증가하며, OpenAI는 7월 9일 출시 후 10M 사용자를 기록했다고 발표했다. Codex는 이제 ChatGPT Work의 핵심으로, 비개발자들도 사용하고 있으며, 지식 작업을 지원하는 도구로 발전하고 있다. Codex의 사용자 중 약 20%가 지식 근로자로, 이는 개발자보다 3배 빠르게 성장하고 있다.

Codex는 이제 단순한 코딩 도구가 아니라 지식 작업을 지원하는 플랫폼으로 발전하고 있다.

Latent Space (swyx & Alessio)원문

NVIDIA Jetson 플랫폼으로 엣지 AI와 로봇 개발하기

NVIDIA Jetson 플랫폼은 개발자들에게 강력한 성능과 휴대성을 제공하며, Jetson Orin Nano Super는 67 조 연산을 초당 수행할 수 있는 AI 성능을 갖춘 핸드백 크기의 개발 키트이다. 이 플랫폼은 학생, 교수, 연구자들이 AI 로봇을 구축하고 학습하며 다음 세대의 지능형 로봇을 개발하는 데 도움을 준다. Jetson Orin Nano Super는 컴퓨터 비전, AI 에이전트 구축, 엣지 AI 프로토타입 제작 등을 위한 실용적인 경로를 제공한다.

Jetson Orin Nano Super는 67 조 연산을 초당 수행할 수 있어 개발자들이 원하는 문제를 해결하는 데 도움을 준다.

NVIDIA Blog원문
NewsAI 툴·

Claude Opus 5 출시 및 ChatGPT Voice 기능 업데이트

Claude Opus 5가 출시되었으며, Anthropic은 Fable 5와 비슷한 성능을 반값에 제공한다고 밝혔다. Opus 5는 시스템 프롬프트의 80% 이상을 제거했음에도 불구하고 코딩 평가 손실이 없었다. ChatGPT Voice는 이제 ChatGPT 데스크탑 앱에서 사용할 수 있으며, 개별 작업을 위한 새로운 세션을 생성하고 결과를 메인 스레드에 보고할 수 있다. Claude는 이제 Haiku뿐만 아니라 Sonnet과 Opus도 사용할 수 있게 되었다.

Opus 5는 Fable 5와 비슷한 성능을 반값에 제공하여 비용 효율적인 AI 모델 선택을 가능하게 한다.

Ben's Bites (Ben Tossell)원문

인도 개발자를 위한 Cursor Start 월정액 요금제 출시

Cursor는 인도에서 개발자를 위한 새로운 월정액 요금제 Cursor Start를 ₹649에 도입했다. 이 요금제는 Grok 4.5와 Composer 모델에 대한 접근을 제공하며, 항상 작동하는 클라우드 에이전트를 통해 코드를 빌드, 테스트, 배포할 수 있다. 또한, iOS용 Cursor를 통해 모바일에서 에이전트를 제어할 수 있으며, UPI 또는 카드로 결제할 수 있다. 이 요금제는 2026년 7월 28일부터 이용 가능하다.

Cursor Start는 인도 개발자들에게 매일 에이전트를 활용할 수 있는 충분한 사용량을 제공한다.

Cursor (Anysphere) Changelog원문