본문으로 건너뛰기

News

AI 뉴스

매일 수집·정리하는 전세계 AI 소식을 최신순으로

NewsAI 프로덕트·스타트업중급·

MCP, Linux Foundation 산하 거버넌스로 이전하며 에이전트 연결 표준으로 굳어지다

Anthropic이 2024년 11월 오픈소스로 공개한 Model Context Protocol(MCP)이 2025년 12월 Linux Foundation 산하 신설 Agentic AI Foundation(AAIF)으로 기부되며 중립적 거버넌스로 이전했다. AAIF는 Anthropic·Block·OpenAI가 공동 설립했고 Google, Microsoft, AWS, Cloudflare가 지원한다. OpenAI(2025년 4월), Microsoft(7월), AWS(11월)가 차례로 채택하면서 SDK 다운로드가 월 수천만 건 규모로 늘었고, 2026년 3월 기준 Anthropic은 1만 개 이상의 공개 MCP 서버가 활성 상태라고 밝혔다. 한 조사에서는 소프트웨어 조직의 약 41%가 MCP 서버를 제한적 또는 광범위 프로덕션에 투입 중이다. 2026 로드맵은 전송 계층 확장성, 에이전트 통신 정교화, 성숙한 거버넌스, 엔터프라이즈급 확장에 무게를 둔다.

에이전트가 도구·데이터에 연결되는 방식의 사실상 표준이 단일 벤더에서 중립 재단으로 넘어가, MCP에 투자하는 개발 결정의 장기 안정성이 높아졌다.

NewsAI 리서치·논문·

FilBench: 필리핀어 LLM 평가를 위한 오픈 평가 스위트 소개

FilBench는 필리핀어 LLM의 능력을 평가하기 위한 벤치마크이자 리더보드로, 필리핀 언어의 LLM 개발 진행 상황을 추적할 수 있다. FilBench는 문화적 지식, 고전 NLP, 독해, 생성의 네 가지 주요 카테고리로 구성된 데이터셋을 기반으로 한다. 이 프로젝트는 EMNLP Main에 수락되었으며, 2023년 11월 중국 수저우에서 발표될 예정이다. FilBench는 HuggingFace의 lighteval 평가 프레임워크를 사용하고 있으며, 향후 필리핀의 주요 지역 언어를 포함하는 방향으로 발전할 계획이다.

FilBench는 필리핀어 NLP 연구자와 언어 모델 개발자에게 필리핀어 LLM의 성능을 체계적으로 평가할 수 있는 도구를 제공한다.

Lj V. Miranda원문
NewsAI 리서치·논문·

OpenAI의 GPT-OSS 출시 및 주요 특징

OpenAI는 GPT-OSS를 출시했으며, 이는 GPT-2 이후 6년 만의 주요 오픈 소스 LLM 릴리스이다. GPT-OSS는 기존의 오픈 모델들과 비교할 때 능력의 큰 도약은 아니지만, LLM의 발전을 되짚어볼 기회를 제공한다. GPT-OSS는 혼합 전문가 모델로, 입력 및 출력 메시지 형식이 다양하며, 사용자, 앱 빌더, 모델 후처리 사용자 등 세 가지 주요 사용자 유형에 맞춘 메시지 채널을 지원한다. 이 모델은 문제 해결 및 코딩 능력이 향상되었으며, 사용자는 추론 모드를 설정할 수 있다.

Language Models & Co. (Jay Alammar)원문
NewsAI 툴·

Qwen-Image-Edit: Qwen-Image 기반 이미지 편집 기능

Qwen-Image-Edit는 20B Qwen-Image 모델을 기반으로 하여 이미지 편집 작업에 Qwen-Image의 텍스트 렌더링 기능을 확장한 제품이다. 이 모델은 입력 이미지를 Qwen2.5-VL(시각적 의미 제어)과 VAE Encoder(시각적 외관 제어)에 동시에 입력하여 의미와 외관 편집 기능을 제공한다.

Qwen-Image-Edit는 이미지 편집 작업에서 텍스트 편집의 정확성을 높이고, 시각적 요소를 동시에 제어할 수 있는 기능을 제공하여 개발자들이 다양한 이미지 편집 애플리케이션을 구현하는 데 유용하다.

Qwen Blog (Alibaba)원문
NewsAI 개발실전·

Claude API 프롬프트 캐싱 워크스페이스 격리 전환, 반복 컨텍스트 비용 최대 90% 절감

Anthropic의 Claude API 프롬프트 캐싱이 2026년 2월부터 조직 단위가 아닌 워크스페이스 단위 격리로 바뀌었다. 같은 조직 안에서도 워크스페이스 간 캐시가 분리돼 데이터 경계가 명확해진다. 캐시 읽기 비용은 표준 입력가의 10% 수준이라 동일 컨텍스트를 반복 주입할 때 최대 90%를 아낄 수 있고, 기본 5분 TTL 외에 추가 비용으로 1시간 캐시도 선택할 수 있다. 긴 시스템 프롬프트, 도구 정의, RAG로 끌어온 문서 블록처럼 매 호출 동일하게 들어가는 앞부분에 cache breakpoint를 두는 것이 핵심 패턴이다. 여기에 Batch API(입·출력 50% 할인), 모델 라우팅, 컨텍스트 편집(오래된 도구 결과·thinking 블록 정리)을 결합하면 에이전트 워크로드의 토큰 비용 구조를 크게 바꿀 수 있다. 한국 팀이 다회전 대화형 서비스를 운영한다면 캐시 적중률을 KPI로 잡을 만하다.

에이전트와 RAG 서비스의 운영비 대부분이 반복 입력 토큰에서 나오므로, 캐싱 설계가 곧 마진과 직결된다.

Anthropic원문
NewsAI 모델·API·

Qwen-Image: 20B MMDiT 이미지 모델의 텍스트 렌더링 기능

Qwen-Image는 20B MMDiT 이미지 기반 모델로, 복잡한 텍스트 렌더링과 정밀한 이미지 편집에서 중요한 발전을 이루었다. 이 모델은 다중 행 레이아웃, 문단 수준의 의미, 세밀한 디테일을 포함한 복잡한 텍스트 렌더링에 뛰어난 성능을 보인다. 알파벳 언어를 지원하며, 최신 모델을 사용해 보려면 Qwen Chat에서 'Image Generation'을 선택하면 된다.

Qwen-Image의 고급 텍스트 렌더링 기능은 이미지 생성 및 편집 작업에서 더 높은 품질의 결과물을 제공할 수 있는 가능성을 열어준다.

Qwen Blog (Alibaba)원문
NewsAI 에이전트중급·

Hermesundefinedtool-use 포맷, XML 태그로 함수 호출과 추론을 분리한다

Hermesundefined모델은 tool-use를 XML 태그 포맷으로 표현한다. 시스템 프롬프트에서 JSON function 스키마를 <tools>...</tools>로 선언하면, 모델은 <tool_call>{...}</tool_call>로 호출하고 결과는 <tool_response>로 피드백한다. 하이브리드 추론은 <think>...</think> 세그먼트로 사고를 방출하며 챗 템플릿의 thinking=True나 시스템 프롬프트로 토글한다. 서빙 시 vLLM은 --tool-call-parser hermes를, SGLang은 qwen25 파서를 쓴다. 405B와 70B는 Meta-Llama-3.1 기반(라이선스 llama3), 14B는 Qwen3-14B 기반(apache-2.0)이며 권장 샘플링은 temperature 0.6, top_p 0.95, top_k 20이다.

tool-use와 추론을 별도 태그로 명시적으로 분리하면 파싱이 단순해지고, 추론 토글로 응답 지연과 비용을 작업 난이도에 맞춰 조절할 수 있다. vLLM·SGLang 파서가 정해져 있어 자체 서빙 시 시행착오를 줄인다. 다만 14B(apache-2.0)와 상위 모델(llama3)의 라이선스가 달라, 상업 배포 전 라이선스 확인이 필요하다.

Hermes (Nous Research)원문
NewsAI 리서치·논문·

ACL 2025에서 발표된 연구와 프로젝트

ACL 2025 Conference에서 발표된 연구로는 네 가지 논문이 있다. 첫 번째는 'Hybrid Preferences: Learning to Route Instances for Human vs. AI Feedback'로, 인간과 언어 모델(LM) 간의 피드백을 위한 하이브리드 라우터(HyPER)를 학습하는 내용을 다룬다. 두 번째는 'M-RewardBench: Evaluating Reward Models in Multilingual Settings'로, 23개 언어에서 보상 모델(RM)을 평가하기 위한 새로운 벤치마크를 소개한다. 세 번째는 'The UD-NewsCrawl Treebank: Reflections and Challenges from a Large-scale Tagalog Syntactic Annotation Project'로, 가장 큰 타갈로그 트리뱅크를 소개하며, 보편적 의존성 프레임워크의 한계를 도전한다. 마지막으로 'Crowdsource, Crawl, or Generate? Creating SEA-VL, a Multicultural Vision-Language Dataset for Southeast Asia'는 동남아시아 언어를 위한 고품질 데이터 개발을 위한 대규모 오픈소스 프로젝트 SEA-VL을 발표한다.

이 연구들은 다국어 및 문화적 맥락에서의 자연어 처리 모델 개발에 중요한 기초 자료를 제공한다.

Lj V. Miranda원문
NewsAI 개발실전·

구조화 출력과 함수 호출, 스키마 강제가 필요한 순간 구분하기

LLM 출력을 안정적으로 다루려면 구조화 출력(Structured Outputs)과 함수 호출(Function Calling)의 차이를 이해해야 한다. JSON 모드는 '유효한 JSON'만 보장하지만, 구조화 출력은 strict: true로 제공한 JSON 스키마를 모델이 반드시 따르도록 제약한다 — 즉 형식뿐 아니라 필드·타입 준수까지 보장된다. 함수 호출은 모델이 어떤 도구를 어떤 인자로 부를지 결정하게 하는 메커니즘이며, 여기에도 스키마 강제를 결합할 수 있다. 실무 구분은 이렇다 — 외부 행동(도구 실행)을 트리거하려면 함수 호출을, 단지 응답을 타입 안전한 JSON으로 받아 후속 코드에 넘기려면 구조화 출력을 쓴다. 둘은 배타적이지 않고 함께 쓰인다. 참고로 OpenAI의 구형 Assistants API는 2026년 8월 26일 종료 예정이므로 신규 설계는 최신 권장 경로(Responses/Agents 계열)를 따르는 것이 안전하다. 한국 팀이 안정적 파이프라인을 만들 때 파싱 실패·재시도 비용을 크게 줄여 준다.

프로덕션 LLM 파이프라인의 흔한 장애가 출력 파싱 실패인데, 스키마 강제 옵션을 제대로 고르면 이 클래스의 버그를 구조적으로 제거할 수 있다.

NewsAI 리서치·논문·

GSPO 알고리즘을 통한 언어 모델을 위한 강화 학습 확장

강화 학습(RL)은 언어 모델의 확장과 깊은 추론 및 문제 해결 능력 향상을 위한 중요한 패러다임으로 자리잡고 있다. 그러나 기존의 RL 알고리즘인 GRPO는 긴 훈련 과정에서 심각한 불안정성을 보이며 모델 붕괴를 초래하여 성능 향상을 저해하고 있다. 이를 해결하기 위해 Group Sequence Policy Optimization(GSPO) 알고리즘을 제안한다.

Qwen Blog (Alibaba)원문
NewsAI 모델·API·

Qwen-MT 업데이트: 92개 언어 지원 및 번역 정확도 향상

Qwen-MT(qwen-mt-turbo)의 최신 업데이트가 Qwen API를 통해 소개되었다. 이 업데이트는 Qwen3를 기반으로 하며, 수조 개의 다국어 및 번역 토큰을 활용하여 모델의 다국어 이해 및 번역 능력을 종합적으로 향상시켰다. 강화 학습 기법을 통합하여 번역 정확도와 언어 유창성에서 상당한 개선을 이루었다. Qwen-MT는 92개 주요 공식 언어와 주요 방언에 대한 고품질 번역을 지원하며, 이는 전 세계 인구의 95% 이상을 커버한다.

Qwen Blog (Alibaba)원문
NewsAI 코딩·

Qwen3-Coder: 480B-파라미터 모델 출시

Qwen3-Coder가 발표되었으며, 가장 강력한 변형인 Qwen3-Coder-480B-A35B-Instruct는 480B 파라미터의 Mixture-of-Experts 모델로, 35B의 활성 파라미터를 가지고 있다. 이 모델은 기본적으로 256K 토큰의 컨텍스트 길이를 지원하며, 외삽 방법을 통해 1M 토큰까지 확장할 수 있다. Qwen3-Coder-480B-A35B-Instruct는 Agentic Coding, Agentic Browser-Use, Agentic Tool-Use 분야에서 오픈 모델 중 새로운 최첨단 결과를 세웠으며, Claude Sonnet 4와 비교 가능하다.

Qwen Blog (Alibaba)원문
NewsAI 툴·

LLM을 활용한 픽셀 아트 생성 실험

최근 언어 모델이 도구 호출 기능을 통해 실제 도구를 사용하는 능력이 향상되고 있다. Aseprite를 사용하여 픽셀 아트를 제작하는 과정에서 LLM의 도구 호출 기능을 테스트했다. 두 가지 작업을 수행했으며, 첫 번째는 정적인 검술사 이미지를 생성하는 것이고, 두 번째는 검술사 슬래시 공격 시퀀스를 나타내는 4프레임 스프라이트 시트를 생성하는 것이다. 각 LLM의 결과는 정확성과 창의성 기준으로 평가되었으며, SwordsBench 점수로 평균화되었다. 이 프로젝트는 MCP와 LLM 에이전트의 개발 워크플로우를 이해하는 데 도움을 주었다.

Lj V. Miranda원문
NewsAI 리서치·논문·

강화학습에서의 정책 학습과 개인적 성장

강화학습(RL)에서는 항상 '온-정책'으로 행동해야 하며, 다른 사람의 성공적인 경로를 모방하기보다는 자신의 행동을 통해 환경으로부터 보상을 배우는 것이 중요하다. 초기에는 모방 학습이 유용하지만, 이후에는 자신의 강점을 활용하여 독자적인 경로를 걸어야 한다. 예를 들어, 연구자는 데이터 수집 시 개인화된 피드백을 제공함으로써 더 나은 결과를 얻고, 실험을 통해 RL의 효과적인 방식에 대한 독특한 교훈을 배울 수 있다. 결국, 초기 모방 후에는 자신의 강점과 약점에 맞춰 정책 학습을 해야 한다.

개발자는 초기 학습 후 자신만의 방식으로 실험하고 경험을 쌓아야 더 나은 결과를 얻을 수 있다.

Jason Wei원문
NewsAI 리서치·논문·

비교적 쉬운 검증과 해결의 비대칭성 이해

비대칭 검증은 일부 작업이 해결하기보다 검증하기가 훨씬 쉬운 개념이다. 예를 들어, 스도쿠와 크로스워드 퍼즐은 해결하는 데 시간이 많이 걸리지만, 주어진 해결책이 맞는지 확인하는 것은 간단하다. 강화 학습(RL)에서 비대칭 검증은 중요한 아이디어로, 검증이 쉬운 작업은 AI가 해결하기 용이하다. 검증의 용이성은 객관적 진실, 빠른 검증 속도, 확장 가능성, 낮은 노이즈, 연속 보상 등의 특성과 관련이 있다. Google의 AlphaEvolve는 이러한 비대칭 검증을 활용한 대표적인 사례이다.

비대칭 검증의 이해는 AI 솔루션을 개발할 때 검증이 용이한 작업을 선택하는 데 도움을 줄 수 있다.

Jason Wei원문
NewsAI 개발초급·

컨텍스트 엔지니어링 입문: 무엇을 언제 어떻게 넣을지 설계하기

에이전트 품질은 모델 자체보다 컨텍스트 창에 무엇을 채우느냐에 점점 더 좌우된다. 컨텍스트 엔지니어링은 시스템 지침·사용자 입력·검색 문서·메모리·세션 상태·도구 결과를 한정된 토큰 예산 안에 어떻게 배치할지 설계하는 작업이다. 핵심 기법은 여섯 가지다 — 압축(추출·추상 요약, 사실 추출), 메모리 큐레이션, 프롬프트 캐싱, 요약 아티팩트, RAG, 필터링. 특히 RAG에서는 모든 청크를 그냥 프롬프트에 쏟아붓는 대신, 높은 재현율로 50개 후보를 검색한 뒤 리랭킹으로 상위 5개로 정밀화하는 파이프라인이 일반적으로 더 낫다. 청킹·임베딩·재현율/정밀도 트레이드오프, 최신성 가중치, 중요도 임계값을 함께 다뤄야 환각을 줄이고 비용을 통제할 수 있다. '컨텍스트가 길수록 좋다'는 직관은 종종 틀린다 — 관련성 낮은 토큰은 노이즈이자 비용이다.

RAG·에이전트 정확도 문제의 상당수가 모델 한계가 아니라 컨텍스트 구성 실패에서 오므로, 이 사고 틀이 디버깅의 출발점이 된다.

Sourcegraph원문
NewsAI 모델·API·

Qwen-TTS, 3개 중국 방언 지원 및 7개 중영 이중 언어 음성 추가

Qwen-TTS의 최신 업데이트(qwen-tts-latest 또는 qwen-tts-2025-05-22)는 수백만 시간의 음성을 포함한 대규모 데이터셋으로 훈련되어 인간 수준의 자연스러움과 표현력을 달성했다. Qwen-TTS는 입력 텍스트에 따라 운율, 속도 및 감정적 억양을 자동으로 조정하며, 현재 베이징어, 상하이어, 쓰촨어를 포함한 3개의 중국 방언을 지원한다. 또한 Cherry, Ethan, Chelsie, Serena, Dylan(베이징어), Jada(상하이어), Sunny(쓰촨어) 등 7개의 중영 이중 언어 음성을 제공한다.

Qwen-TTS의 방언 지원은 중국 시장을 타겟으로 하는 음성 인식 및 합성 기술 개발에 있어 중요한 기회를 제공한다.

Qwen Blog (Alibaba)원문
NewsAI 모델·API·

Qwen VLo: 이미지 이해 및 생성 통합 모델 소개

Qwen VLo는 QwenVL에서 Qwen2.5 VL까지의 발전을 바탕으로 한 통합 멀티모달 이해 및 생성 모델이다. 이 모델은 세계를 '이해'하는 것뿐만 아니라, 그 이해를 바탕으로 고품질의 재창작을 생성할 수 있다.

Qwen VLo는 이미지 콘텐츠 이해와 생성의 경계를 허물어, 다양한 AI 응용 프로그램에서의 활용 가능성을 높인다.

Qwen Blog (Alibaba)원문
News보안·규제·저작권중급·

Anthropic 저작권 소송 15억 달러 합의, AI 학습 공정이용이라도 해적판은 별개

2025년 6월 미국 캘리포니아 북부지법의 William Alsup 판사는 Anthropic이 합법적으로 취득한 도서를 AI 학습에 사용한 것은 '본질적으로 변형적(transformative)'이어서 공정이용에 해당한다고 판단했다. 그러나 LibGen 같은 섀도 라이브러리에서 해적판 수백만 권을 내려받아 보관한 행위는 공정이용이 아니라고 동시에 판시했다. 이 구분 이후 사건은 약 15억 달러 규모로 합의됐고, 저작물 1건당 약 3,000달러 수준의 지급이 추정되는 미국 최대 규모 저작권 합의가 됐다. 즉 '학습 행위 자체'는 보호받을 수 있어도, 학습 데이터를 어떻게 '취득·보관'했는지가 별개의 책임을 만든다는 점이 핵심이다. Meta의 Llama 학습 관련 유사 소송에서도 공정이용 쟁점에서 일부 각하가 있었다.

Reuters (via Yahoo Tech) / Kluwer Copyright Blog원문
NewsAI 리서치·논문·

무작위 신경망의 귀납적 편향 연구

이 글에서는 별 영역 부피 추정을 사용하여 무작위 신경망의 매개변수-함수 맵의 귀납적 편향을 연구한다. 이는 '무작위로 훈련된 신경망 샘플링 확률 추정' 및 '신경적 적색편이: 무작위 네트워크는 무작위 함수가 아니다'라는 아이디어에 기반한다. 귀납적 편향을 이해하는 것은 딥 신경망의 일반화를 이해하는 데 필수적이며, 고정된 아키텍처에서 일부 작업은 쉽게 학습될 수 있지만 다른 작업은 학습하는 데 기하급수적으로 긴 시간이 걸릴 수 있다.

EleutherAI Blog원문
NewsAI 리서치·논문·

AI 연구는 최대 성과 영역으로 간주된다

AI 연구는 특정 분야에서 뛰어난 성과를 내면 세계적 수준이 될 수 있는 '최대 성과 영역'으로 볼 수 있다. 예를 들어, AI 연구자는 매년 수십 개의 실패한 프로젝트를 가질 수 있지만 몇 년에 한 번 중요한 연구 결과를 내면 성공할 수 있다. 이러한 영역에서는 역할 모델을 지나치게 강조하는 것이 위험할 수 있으며, 인터뷰는 실수를 심각하게 처벌하고 기하급수적인 가치를 포착하지 못해 유용하지 않다.

AI 연구 분야에서 특정 기술에 대한 깊은 전문성이 중요하며, 다양한 기술을 고루 갖추지 않아도 성공할 수 있는 환경이 조성되고 있다.

Jason Wei원문
News보안·규제·저작권중급·

EU AI Act, 2026년 8월 전후 범용 AI(GPAI) 제공자 의무 본격 집행

EU AI Act의 범용 AI(GPAI) 모델 제공자 의무는 2025년 8월 2일부터 적용이 시작됐고, 2026년 8월 2일부터 유럽연합 집행위원회가 과징금을 포함한 전면 집행에 들어간다. 첫 1년간 AI Office는 실천강령(Code of Practice)을 준수하는 제공자와 협력 모드로 운영해, 즉시 모든 약속을 이행하지 못해도 '선의(good faith)'로 간주하고 완전한 준수를 함께 모색하는 유연한 접근을 택했다. 2025년 8월 2일 이전에 시장에 출시된 GPAI 모델은 2027년 8월 2일까지 의무를 맞추면 되는 경과 규정도 있다. 과징금은 GPAI 제공자에 대해서는 집행위가, 그 외 운영자에 대해서는 각국 당국이 부과한다. 한국 기업이라도 EU 시장에 모델·서비스를 제공하면 역외 적용되므로 학습 데이터 요약 공개, 저작권 정책, 기술 문서 같은 GPAI 의무를 점검해야 한다.

EU 사용자를 대상으로 모델이나 AI 기능을 배포하는 한국 팀은 2026년 8월 집행 시점 전에 GPAI 기술문서·저작권 정책 준비를 끝내야 과징금 리스크를 피한다.

European Commission (Shaping Europe's digital future)원문
NewsAI 리서치·논문·

Test time compute와 Chain-of-thought의 모델 성능 향상

Test time compute(Graves et al. 2016, Ling et al. 2017, Cobbe et al. 2021)와 Chain-of-thought(CoT)(Wei et al. 2022, Nye et al. 2021)의 사용이 모델 성능에 상당한 개선을 가져왔으며, 이와 관련된 많은 연구 질문이 제기되고 있다. 이 글은 테스트 시간 계산을 효과적으로 사용하는 방법과 그 이유를 검토하는 것을 목표로 한다.

Lil'Log (Lilian Weng)원문
NewsAI 프로덕트·스타트업·

MenuGen: 메뉴 사진을 기반으로 이미지 생성하는 앱

MenuGen은 메뉴 사진을 찍으면 메뉴 항목의 이미지를 생성해주는 앱이다. 사용자는 이 앱을 통해 메뉴의 기본적인 아이디어를 시각적으로 확인할 수 있다. 개발자는 Cursor와 Claude를 사용하여 React 프론트엔드를 빠르게 구축했으며, OpenAI API와 Replicate API를 통해 메뉴 항목을 OCR 처리하고 이미지를 생성하는 기능을 추가했다. 그러나 API 호출 시 속도 제한과 문서의 불일치로 어려움을 겪었다. 최종적으로 Vercel에 배포를 시도했으나 빌드 과정에서 오류가 발생했다.

Andrej Karpathy Blog원문