News
AI 뉴스
매일 수집·정리하는 전세계 AI 소식을 최신순으로
Ensemble AI 팀이 Cloudflare에 합류하여 AI 인프라 개선
Cloudflare는 Ensemble AI의 주요 팀원들이 합류하여 AI 인프라 작업을 가속화한다고 발표했다. Ensemble AI는 2023년 샌프란시스코에서 설립되어 대형 모델을 더 빠르고 작으며 비용 효율적으로 제공하는 방법에 집중해왔다. 이 팀은 NdLinear 및 NdLinear-LoRA와 같은 새로운 모델 압축 및 효율적 추론 접근 방식을 개발하였으며, Cloudflare의 서버리스 GPU 기반 추론 기능을 통해 AI 모델을 효율적으로 제공할 수 있도록 지원할 예정이다. Cloudflare는 AI 모델의 효율성을 개선하고, GPU 활용도를 높이며, 대규모 배포를 강조할 계획이다.
알리바바 Qianwen, 1290만 명에게 무료 제공된 대학 선호 양식 AI 상담사
알리바바 Qianwen이 6월 10일에 1290만 명의 수험생을 위해 대학 선호 양식 AI 상담사를 무료로 출시했다. 이 AI는 수험생의 가오카오 점수와 선호 전공을 기반으로 6개의 '고급 잠재 학교', 8개의 '안정적인 학교', 16개의 '안전망 학교'를 추천한다. 이 서비스는 정보 비대칭에 기반한 대학 지원 상담을 공공 서비스로 전환하여 더 많은 학생들이 전문적인 조언을 받을 수 있도록 한다.
AI 기반의 대학 지원 상담 서비스는 한국에서도 비슷한 교육 시스템을 가진 학생들에게 유용한 도구가 될 수 있다.
AI 안전 스타트업 Sequent 설립, 초지능 AI의 정렬 기술 개발 목표
영국 AI 보안 연구소의 정렬 팀과 Timaeus가 협력하여 비영리 연구 조직 Sequent를 설립했다. Sequent는 초지능 AI 시스템의 안전성을 높이는 정렬 기술 개발을 목표로 하며, 초기 40-80명의 직원 채용과 1억~1억 5천만 달러의 자금 조달을 계획하고 있다. 이들은 기존 AI 연구소의 반응적인 접근 방식과는 달리, 다양한 정렬 이론과 경험적 연구를 통해 더 나은 정렬 기술을 찾고자 한다. 특히, 스케일러블 감독, 학습 이론, 게임 이론 등 여러 분야에서 연구를 진행할 예정이다.
AI 에이전트를 위한 Playwright 기반 E2E 테스트 구축 세션 공개
네이버의 NAVER ENGINEERING DAY 2026에서 발표된 세션에서는 AI 에이전트가 작성한 코드를 신뢰할 수 있는 방법으로 Playwright 기반 E2E 테스트를 구축하는 과정을 공유합니다. 발표는 E2E 테스트의 필요성과 작성 방법, 그리고 사람의 역할에 대한 내용을 포함하고 있습니다. 특히 대규모 코드베이스를 만들고 싶거나 E2E 테스트를 처음 시작하는 개발자들에게 유용한 정보가 제공됩니다.
AI 에이전트의 코드 작성 신뢰성을 높이기 위한 E2E 테스트 구축 방법을 제시하여 개발자들이 실무에서 활용할 수 있는 구체적인 지침을 제공합니다.
Anthropic, Fable 및 Mythos 모델의 공개와 미국 정부의 수출 통제
Anthropic은 두 달 전, 사이버 보안 능력이 뛰어난 Mythos Preview 모델을 공개하지 않겠다고 발표했으나, 이후 Fable이라는 안전 장치가 추가된 Mythos 버전을 공개했다. Fable은 GPT 5.5 및 Opus 4.8보다 뛰어난 성능을 보였으나, 공개 후 미국 정부는 Fable 5와 Mythos 5에 대한 접근을 중단하라는 수출 통제 지침을 발령했다. 정부는 Fable 5의 '탈옥' 방법을 인지했으며, Anthropic은 이와 관련하여 오해를 해소하기 위해 워싱턴 D.C.에서 정부와 협의 중이다.
이 사건은 AI 모델의 안전성과 규제 문제에 대한 개발자들의 인식을 높이고, 모델 공개 시 발생할 수 있는 법적 리스크를 고려해야 함을 시사한다.
AI 시대의 비즈니스 엔지니어
Gennaro Cuofano의 'The updated map of AI'는 2026년으로 예정되어 있다. AI Supremacy 뉴스레터는 AI 관련 다양한 주요 목소리를 전달하는 데 헌신하고 있다.
MCP SDK의 임의 명령 실행 결함과 Anthropic의 수정 거부 논쟁
Anthropic의 MCP SDK(Python·TS·Java·Rust)에서 사용자가 제어하는 설정값을 셸에 검증 없이 그대로 넘겨 임의 명령이 실행되는 RCE 설계 결함이 드러났다. 프로세스 기동이 실패하는 경우에도 명령이 실행되는 점까지 악용 가능하다. 이 문제는 2026년 4월 OX Security가 공개했고, CVE-2026-30623으로 추적된다. 영향 범위가 넓어 LiteLLM·LangFlow·Windsurf·Cursor·Flowise 등 MCP를 채택한 다수 프로젝트에서 연쇄적으로 CVE와 RCE 이슈로 번졌다. Anthropic은 설계상 의도된 동작이며 입력 정화는 개발자 책임이라는 입장으로 수정을 거부해 논쟁이 됐다.
MCP는 에이전트(agent)와 외부 도구를 잇는 연결 계층으로 빠르게 확산되고 있어, SDK 레벨의 결함은 그 위에 쌓인 수많은 서버와 클라이언트로 그대로 전파된다. 이번 사례는 설정값처럼 신뢰하기 쉬운 입력이 셸로 흘러갈 때 곧바로 원격 코드 실행으로 이어진다는 점을 보여준다. 벤더가 수정을 거부하고 책임을 개발자에게 넘긴 구도라, MCP 서버를 만들거나 도입하는 쪽에서 입력 검증과 셸 호출 방식을 직접 점검해야 한다. 생태계가 커질수록 공급망 보안이 핵심 리스크로 떠오른다.
Anthropic, 6월 15일부터 Agent SDK 사용량을 구독과 별도 크레딧으로 분리 청구
Anthropic이 2026년 6월 15일부터 Claude Agent SDK와 claude -p CLI, Claude Code GitHub Actions, Agent SDK 기반 서드파티 앱의 프로그래밍 방식 사용량을 기존 구독 사용량 풀에서 분리한다. 이제 자동화 워크로드는 플랜별로 정해진 별도 월간 크레딧(Pro $20·Max 5x $100·Max 20x $200, API 정가 과금·이월 없음)에서 차감되고, 대화형 Claude Code·Cowork·claude.ai 사용 한도는 그대로 유지된다. 핵심 함정은 크레딧이 소진되면 오버플로 결제를 수동으로 켜두지 않은 한 자동화 요청이 즉시 멈춘다는 점이다. 무인 파이프라인이나 야간 배치로 에이전트를 돌리는 한국 개발팀은 한도 초과 시 조용히 작업이 중단될 수 있어, 모니터링과 오버플로 설정 점검이 필수다.
무인·자율 에이전트를 운영하는 팀의 비용 구조와 장애 모드가 바뀌므로, 크레딧 소진 시 중단되는 파이프라인을 미리 점검해야 한다.
Anthropic, 6월 15일부터 Claude Agent SDK·Claude Code 자동화에 별도 크레딧 부과
Anthropic이 2026년 6월 15일부터 Claude Agent SDK, headless 모드(claude -p), Claude Code GitHub Actions, 그리고 제3자 에이전트의 사용량을 기존 구독 한도에서 분리해 별도 월간 크레딧으로 청구한다. 대화형 Claude Code 세션은 여전히 구독 한도를 쓰지만, 무인 자동화·CI 파이프라인·SDK로 돌리는 에이전트는 Pro 20달러, Max 5x 100달러, Max 20x 200달러의 별도 풀에서 차감되며 소진 후에는 정규 API 단가로 과금된다. 야간 배치, PR 리뷰 봇, 스케줄 잡 등을 구독으로 돌려온 팀이라면 비용 구조가 즉시 바뀌므로 자동화 워크로드의 토큰 소비량을 점검하고, 무거운 잡은 모델 티어를 낮추거나 호출 빈도를 조정하는 대응이 필요하다.
구독 한도로 무인 에이전트를 돌려온 한국 개발팀의 CI·자동화 비용이 6월 15일 자로 즉시 달라지므로 워크로드 재점검이 시급하다.
미국 정부, Anthropic에 Claude 5 모델 접근 차단 요구
미국 정부가 Anthropic에 최신 Claude 5 Mythos/Fable 모델에 대한 접근을 차단하도록 요구했다. 이 사건은 AI 거버넌스의 새로운 시대의 시작을 알리며, AI 모델의 빠른 발전이 새로운 거버넌스 문제를 야기할 것임을 시사한다. Anthropic은 외국 사용자에 대한 모델 접근을 중단해야 하며, 이는 미국의 AI 산업에 부정적인 영향을 미칠 수 있다. 정부의 조치는 Anthropic에 대한 정치적 압박의 결과로 보이며, AI 모델의 수출 금지가 지속적인 정책이 될 가능성이 있다.
OpenAI, Partner Network 출시 및 1억 5천만 달러 투자
OpenAI는 Partner Network를 출시하고, 글로벌 파트너들이 기업 AI 채택, 배포 및 변화를 가속화할 수 있도록 1억 5천만 달러를 투자한다고 발표했다.
이 투자로 인해 한국 기업들도 OpenAI의 지원을 받아 AI 기술 도입을 촉진할 수 있는 기회를 가질 수 있다.
Anthropic, Claude Fable 5 및 Claude Mythos 5 출시
Anthropic은 Claude Fable 5와 Claude Mythos 5를 출시했다. 두 모델은 동일한 기본 모델을 공유하지만, Fable 5는 보수적인 안전 분류기를 사용하여 고위험 분야에서 쿼리를 차단하고 Opus 4.8로 되돌아가며, Mythos 5는 Project Glasswing 하에 검증된 사이버 방어자를 위해 제한 없이 운영된다. Fable 5는 SWE-Bench Pro에서 80.3%의 성능을 기록하여 Opus 4.8보다 10포인트 이상, GPT-5.5보다 20포인트 이상 앞선다. 또한, 애플은 WWDC에서 개인 맥락과 화면 인식을 갖춘 Siri AI를 발표했으며, 이는 1.2조 매개변수의 Gemini 모델에 의해 구동된다. 마지막으로, 엘론 머스크는 SpaceX의 IPO를 통해 1.77조 달러의 가치를 인정받고 750억 달러를 모금했다.
Hermes: 같은 이름의 두 갈래, 하이브리드 추론 LLM과 자율 에이전트 프레임워크
AI 분야에서 Hermes라는 이름은 Nous Research가 만든 서로 다른 둘을 가리킨다. 하나는 오픈웨이트 LLM 패밀리인 Hermes 4로, <think> 블록으로 명시적 추론을 드러내면서 같은 턴 안에서 함수·도구 호출까지 수행하는 하이브리드 추론을 특징으로 한다. 70B는 Llama-3.1-70B를 기반으로 하며 더 큰 405B 변종이 있고, 전 모델이 오픈웨이트로 공개됐다. 다른 하나는 Hermes Agent로, 모델 시리즈와는 별개인 오픈소스 자율 에이전트 프레임워크다. 최신 릴리스 v0.17.0 'The Reach Release'가 2026년 6월 19일에 나왔고, GitHub 스타가 빠르게 늘고 있다.
Hermes 4는 추론 과정과 도구 호출을 한 모델 안에서 다루는 포맷을 오픈웨이트로 공개해, 자체 호스팅 환경에서 추론형 에이전트를 구성하려는 개발자에게 선택지를 넓혀준다. <tools>/<tool_call>/<tool_response> 규약과 vLLM·SGLang 자동 파서 지원은 도구 사용 파이프라인 연동 비용을 낮춘다. Hermes Agent는 작업을 수행하며 재사용 가능한 스킬을 스스로 만들고 다듬는 학습 루프를 내장해, 프레임워크가 사용할수록 개선되는 방향을 보여준다. 모델 불가지론과 자체 호스팅 설계는 특정 벤더에 묶이지 않으려는 팀에 의미가 있다.
SWE-bench Verified 리더보드 정리: 프런티어 모델과 오픈웨이트의 격차가 한 자릿수로
2026년 SWE-bench Verified 리더보드에서 Anthropic Claude Fable 5(6월 9일 공개)가 95.0%로 선두를 차지했고, Claude Opus 4.8은 88.6%를 기록했다. 주목할 변화는 오픈웨이트 진영의 추격으로, DeepSeek-V4-Pro-Max 80.6%, MiniMax M3 80.5%, Qwen3.7 Max 80.4%가 0.2%p 안에 몰리며 상용 모델과의 격차가 한 자릿수로 좁혀졌다. 또 하나 알아둘 점은 벤치마크 자체의 이동이다. SWE-bench Verified가 포화에 가까워지면서 OpenAI는 Verified 점수 보고를 중단하고 더 어렵고 현실적인 SWE-bench Pro를 권장하기 시작했다. 따라서 한국 개발자는 단일 점수만 보지 말고, 어떤 벤치마크에서 측정됐는지와 실제 작업(태스크당 비용·다국어 코드)을 함께 봐야 한다.
모델 선택은 점수 한 줄이 아니라 벤치마크 종류·비용·오픈웨이트 가용성을 함께 봐야 하는 시점이 됐다.
Mac용 로컬 AI가 내장된 터미널 jebi
jebi는 Mac을 위한 강화된 터미널로, 내장된 로컬 AI 기능을 제공합니다.
로컬 AI 기능을 통해 개발자들은 터미널에서 보다 효율적인 작업을 수행할 수 있습니다.
Anthropic의 Fable 출시와 관련된 AI 연구 및 도구 업데이트
주요 내용으로는 Anthropic의 Fable이 안전 게이트, API 거부, 자율 코딩, 3D 세계 구축, Claude가 운영하는 트위터 실험 등에서 실무에 적용되고 있다는 점이 있다. Geoffrey Irving과 Daniel Murfet은 재귀적 자기 개선 전에 정렬 이론과 보증의 필요성을 주장하며, prinz는 법적 추론과 모니터링에 Fable을 테스트하고 있다. Rahul Sonwalkar, Shlok Khemani, Tom McGrath, Andrew Moore는 데이터 에이전트, 하이브리드 저작, 해석 가능성, 컨텍스트 시스템, 토큰 경제 및 권력 집중에 대한 현장 보고서를 추가했다. Mercury는 가상 카드, 지출 한도, 상인/카테고리 잠금 및 API 키, MCP, CLI와 같은 AI 친화적 도구를 제공하여 재무 관리를 지원한다.
로봇의 감정 인식 능력 향상을 위한 비전 언어 모델 연구
연구자들은 로봇이 인간의 감정을 읽을 수 있도록 비전 언어 모델(VLM)을 훈련시켰다. 이 연구는 40명의 자원봉사자를 대상으로 진행되었으며, 로봇의 감정 인식 능력이 인간의 인식에 미치는 영향을 평가하였다. VLM은 전통적인 AI 시스템보다 높은 정확도로 감정을 분류했으며, 0.86의 점수를 기록했다. 그러나 로봇의 기능이 결여될 경우, 감정적으로 적응한 사과가 신뢰를 회복하는 데 한계가 있음을 보여주었다.
VLM은 0.86의 감정 인식 점수를 기록하여 전통적인 AI 시스템(0.77)보다 우수한 성능을 보였다.
Claude Agent SDK 별도 크레딧 분리, OpenAI Agent Builder는 종료 예고
에이전트 프레임워크 시장이 기능 경쟁을 넘어 과금·라인업 정리 국면으로 들어섰다. Anthropic은 6월 15일부터 Claude Agent SDK 사용량을 구독 요금과 분리된 별도 월간 'Agent SDK 크레딧'에서 차감하기 시작한다 — 구독으로 무한정 에이전트를 돌리던 패턴에 명시적 비용 경계가 생기는 변화다. OpenAI는 6월 3일 Agent Builder와 Evals 제품의 단계적 종료를 발표했고, 두 제품은 11월 30일부터 플랫폼에서 제공되지 않는다(앞서 4월 Agents SDK에 네이티브 샌드박스 실행과 모델 네이티브 하니스를 추가한 흐름의 후속). 한편 프레임워크 진영은 메이저 버전이 안착했다. LangChain 1.0·LangGraph 1.0(2025년 말 GA)은 각각 표준 툴콜링 에이전트 빌드와 장시간·상태 지속(durable state) 오케스트레이션으로 역할이 갈렸고, Microsoft Agent Framework 1.0은 4월 3일 GA, Google ADK도 Java·Go용 1.0을 출시했다.
별도 크레딧 분리는 '구독만 있으면 에이전트는 공짜'라는 착시를 끝내고, 에이전트 실행을 명시적 원가 항목으로 끌어올린다. 자율 루프·스케줄 에이전트를 상시 가동하는 한국 팀은 이제 토큰 단가뿐 아니라 SDK 크레딧 소진 속도를 별도 모니터링해야 한다. OpenAI의 Agent Builder 종료는 'GUI 노코드 에이전트 빌더'보다 코드 기반 SDK로 무게가 쏠렸음을 보여주는 신호로, 노코드 빌더에 락인되지 않는 설계가 안전하다.
Epoch의 Cyber Vulnerabilities explorer 출시 및 FrontierMath Version 2 발표
Epoch에서 Cyber Vulnerabilities explorer를 출시하여 AI가 사이버 보안에 미치는 영향을 정량화할 수 있게 되었다. 이 도구는 2022년 이후 CVE 프로그램에 보고된 취약점을 추적하며, Microsoft, Google, Apple, Linux 등 21개 주요 벤더와 오픈소스 프로젝트에 대한 데이터를 필터링할 수 있다. 또한, FrontierMath Version 2가 출시되었으며, Claude Fable 5가 Tiers 1-3에서 87%, Tier 4에서 88%의 점수를 기록하며 1위에 올랐다. 한편, 미국의 AI 인프라가 GDP의 약 1.5%를 차지하게 되었고, 이는 2015-2022년 평균의 약 0.7%에서 증가한 수치이다.
Project Ire, LOTUSLITE 변종 식별 및 분석 결과 발표
Project Ire는 LOTUSLITE 변종을 식별했으며, 이 변종은 공공 패밀리와 TTPs(도구, 전술, 절차)를 공유하지만 IOC(위협 지표)는 공유하지 않는다. Ire는 사용자 상호작용 없이 샘플에 대한 기능별 행동 보고서를 생성하였고, Acronis에 의해 최근 문서화된 Windows DLL 백도어인 LOTUSLITE와 일치하는 행동 패턴을 보였다. 분석 결과, 이 샘플의 해시는 Acronis의 IOC 목록에 없으며, 6월 4일 기준으로 주요 EDR(예: CrowdStrike Falcon, SentinelOne 등)은 이를 악성으로 탐지하지 않았다.
Samo Burja가 말하는 AI와 산업 확장
Samo Burja는 AI가 컴퓨팅, 에너지, 인프라에 대한 수요를 촉발하여 산업 확장을 이끌 수 있다고 주장한다. 그는 AI가 단순한 소프트웨어 이야기가 아니라 에너지, 제조, 건설, 글로벌 공급망에 영향을 미치는 수요 충격이라고 설명한다. 또한, 그는 효과적으로 사람과 자원을 조직할 수 있는 사회가 AI 시대에 지속적인 이점을 가질 것이라고 언급한다.
AI의 수요가 에너지와 제조업에 미치는 영향은 산업 전반에 걸쳐 새로운 기회를 창출할 수 있다.
美 정부 수출통제 지시로 Fable 5·Mythos 5 접속 전면 차단, 출시 3일 만의 반전
출시 사흘 만인 6월 12일 오후(ET) 미국 정부가 수출통제 지시를 발동해 Fable 5·Mythos 5 접속을 전면 중단시켰다. '국가안보 권한'을 근거로 전 세계 모든 외국 국적자(Anthropic 외국인 직원 포함)의 사용을 막으라는 지시였고, Anthropic은 컴플라이언스를 위해 외국인뿐 아니라 '모든 고객'에게 두 모델을 비활성화했다. 다른 모델은 정상이다. 정부가 지목한 사유는 Fable 5의 좁은(비-보편적) 탈옥(jailbreak) 기법 — 소프트웨어 취약점을 분석·수정하도록 요청하는 시연이었다. Anthropic은 '수천 시간 동안 US 정부·UK AISI·외부 레드팀과 함께 가드레일을 검증했고 어떤 테스터도 광범위한 사이버 역량을 가로지르는 보편적 탈옥을 찾지 못했다'며, '좁은 잠재 탈옥 발견이 수억 명에게 배포된 상용 모델을 회수할 근거는 아니다'라고 공개적으로 이견을 밝혔다. 복구 시점은 미정이며 '가능한 빨리 복구하겠다'고만 했다.
OpenAI, 실용 AI 기술을 위한 세 가지 Academy 과정 발표
OpenAI는 사람들이 실용적인 AI 기술을 구축하고 반복 가능한 워크플로를 생성하며 일상 업무에 에이전트를 적용할 수 있도록 돕는 세 가지 Academy 과정을 소개했다.
olmo-eval: 모델 개발 루프를 위한 평가 워크벤치
olmo-eval은 모델 개발자가 변경되는 LLM 체크포인트에 대해 벤치마크를 추가하고 실행하며 분석할 수 있도록 돕는 오픈 평가 워크벤치이다. 이는 OLMES의 최종 점수 재현성을 일상적인 모델 개발 루프로 확장한다.