본문으로 건너뛰기

News

AI 뉴스

매일 수집·정리하는 전세계 AI 소식을 최신순으로

NewsAI 모델·API초급·

한국 정부 주도 독자 AI 파운데이션 모델, 정예 5팀 경쟁 본격화

한국 정부(과학기술정보통신부)가 추진하는 독자 AI 파운데이션 모델 사업에서 정예 5팀이 자체 모델을 개발하고 있다. 참여 팀은 네이버클라우드, 업스테이지, SKT, NC AI, LG AI연구원이며 정부는 대규모 예산과 GPU를 지원한다. 2025년 12월에 1차 성과가 공개됐고, 2026년 중 1~2개 팀을 최종 선정할 예정이다. 이 가운데 SKT는 하이퍼스케일급으로 소개된 A.X K1을 공개하면서 해외 최상위 모델 대비 높은 성능을 목표로 내세웠다.

특정 해외 모델에 종속되지 않는 자국 파운데이션 모델, 즉 소버린(sovereign) AI 경쟁이 한국에서도 본격화되고 있다는 신호다. 국내 기업이 직접 학습한 대형 모델이 늘어나면 한국어 처리와 국내 도메인에 맞춘 선택지가 넓어지고, 데이터 주권이나 규제 측면에서 국산 모델을 우선 검토할 여지가 커진다. 개발자 입장에서는 향후 API 생태계와 파인튜닝 옵션이 어떻게 형성되는지 지켜볼 만한 흐름이다.

정책브리핑원문
NewsAI 모델·API·

Z.ai, GLM 5.2 오픈 소스 결정

Z.ai가 GLM 5.2를 오픈 소스로 공개하기로 결정했다. GLM-4.7-flash의 후속 모델이 27-120B 범위에서 출시되기를 기대하는 의견도 있다.

r/LocalLLaMA원문
NewsAI 리서치·논문·

Domyn과 AISquared의 Ai2 오픈 릴리스를 통한 모델 개발

Domyn과 AISquared는 Ai2의 오픈 릴리스가 규제가 있는 산업에서 모델을 구축하는 데 어떻게 도움을 주는지를 보여준다. 이러한 산업에서는 투명성, 출처, 라이센스 및 고객 신뢰와 준수를 위한 통제가 필수적이다.

Allen Institute for AI (Ai2) Blog원문
NewsAI 리서치·논문·

OpenAI 모델을 활용한 희귀 유전 질환 진단

연구자들이 OpenAI의 추론 모델을 사용하여 희귀 질환 진단을 지원하였으며, 이전에 해결되지 않았던 사례에서 18개의 새로운 진단을 확인하였다.

OpenAI News원문
NewsAI 에이전트·

CEO-Bench: 에이전트의 장기적 과제 평가

CEO-Bench는 언어 모델 에이전트의 장기적 과제를 평가하기 위해 500일 동안 스타트업 운영을 시뮬레이션한다. 에이전트는 가격 책정, 마케팅, 예산 관리 등 다양한 측면을 관리하며, 인간 CEO와 동일한 환경에서 도전 과제를 직면한다. 성공적인 운영을 위해서는 노이즈가 있는 비즈니스 데이터베이스를 분석하고, 전략을 수립하며, 여러 결정을 조율해야 한다. Claude Opus 4.8과 GPT-5.5만이 초기 자본 100만 달러를 초과했지만, 지속적인 이익을 내지 못했다. CEO-Bench는 지속적이고 적응적인 진전을 이끌기 위한 지능을 측정하는 첫걸음이다.

arXiv cs.AI원문
NewsAI 리서치·논문·

교육 대화의 개인 정보 비식별화를 위한 완전 로컬 AI 캐스케이드 제안

교육 대화는 개인 식별 정보(PII)를 포함할 수 있는 민감한 자원이다. 기존 접근 방식은 거버넌스와 정확성 간의 트레이드오프를 강요한다. 본 연구에서는 완전 로컬 캐스케이드 프레임워크를 제안하여 비식별화를 개방형 개체 인식에서 제한된 개인 정보 분류로 재구성한다. 이 프레임워크는 두 개의 경량 인코더와 결정론적 규칙을 결합하여 후보 범위를 과생성하고, 문맥 인식 리뷰어가 주변 대화와 화자 역할을 사용하여 각 후보에 대해 이진 Redact/Keep 결정을 내린다. 평가 결과, 가장 강력한 로컬 구성은 0.958의 매크로 F1 점수를 기록하였으며, 이는 LLM 전용 기준선의 0.767 및 상업 API의 0.706과 비교된다. 교육 비식별화에서는 문제 정의가 모델 규모보다 중요하다는 결과를 제시한다.

교육 데이터의 비식별화 과정에서 로컬 처리의 중요성을 강조하며, 데이터 보호와 정확성을 동시에 달성할 수 있는 방법론을 제시한다.

arXiv cs.CL (계산언어학·NLP)원문
NewsAI 리서치·논문·

Continuous Audio Thinking(CoAT) 프레임워크를 통한 대규모 오디오 언어 모델 개선

대규모 오디오 언어 모델(LALMs)은 음성 전사부터 음악 분석에 이르기까지 다양한 오디오 이해 작업에서 뛰어난 성능을 보이고 있다. 그러나 LALMs는 일반적으로 텍스트 정렬 응답을 생성하도록 훈련되어 음향 정보를 보존하기보다 텍스트 생성을 위한 숨겨진 상태로 발전한다. 이를 해결하기 위해 Continuous Audio Thinking(CoAT) 프레임워크가 도입되었으며, 이는 응답 생성을 위한 사전 단계에서 음향 정보를 조직할 수 있는 연속적인 잠재 작업 공간을 제공한다. CoAT는 Qwen2-Audio, Qwen2.5-Omni-7B, Audio Flamingo 3의 세 가지 LALMs에서 오디오 추론, 오디오 이해, 음악 분류, 감정 분석, 음성 전사 등 다양한 벤치마크에서 성능 향상을 보여주었다.

arXiv cs.CL (계산언어학·NLP)원문
NewsAI 리서치·논문·

Allstate와 IBM, 보험 포트폴리오를 위한 양자 컴퓨팅 탐색

보험은 복잡하고 상관관계가 있는 위험을 포함하는 어려운 문제를 다룬다. Allstate와 IBM은 양자 컴퓨팅이 이러한 문제를 해결하는 데 어떻게 도움이 될 수 있는지를 보여주고 있다.

IBM Research Blog원문
NewsAI 리서치·논문·

NAVI-Orbital: 최초의 궤도에서의 제로샷 비전-언어 모델 시연

NAVI-Orbital은 저지구 궤도(LEO) 우주선에 배포된 소프트웨어 시스템으로, 2026년 4월 16일에 비전-언어 모델을 사용하여 자율적인 다중 모드 추론을 궤도에서 수행한 최초의 사례를 기록했다. 이 시스템은 Gemma 3라는 로컬 비전-언어 모델을 활용하여 캡처된 장면을 분류하고, 그 내용과 특징 간의 관계를 설명하는 텍스트를 생성하며, 자연어 대화로 운영자의 후속 질문에 응답한다. NAVI-Orbital은 전통적인 명령어 시퀀스 대신 일반 영어 프롬프트로 재작업되며, LangGraph라는 그래프 기반 상태 기계에 의해 조정된다. 지상 벤치마킹에서 88.16%의 정확도를 기록했으며, 위성급 엣지 컴퓨터에서 기초 모델을 실행하여 지구 관측 데이터를 궤도에서 의미적으로 압축할 수 있는 가능성을 보여주었다.

이 시스템은 우주에서의 데이터 처리 방식을 혁신적으로 변화시켜, 지구 관측 데이터의 실시간 활용을 가능하게 한다.

arXiv cs.AI원문
NewsAI 리서치·논문·

저자극 언어 생성을 위한 활성화 조정 연구

대형 언어 모델(LLM)은 저자원 언어의 합성 데이터 생성을 위한 효과적인 도구로, 생성된 데이터는 하위 작업 성능을 향상시킬 수 있다. 현재의 최상위 접근 방식은 목표 언어 예제를 포함한 몇 가지 샘플 프롬프트에 의존하며, 이는 추론 비용을 증가시키고 어휘 고정화로 인해 다양성을 감소시킬 수 있다. 본 연구에서는 저자원 합성 데이터 생성을 위한 대안으로 활성화 조정을 조사하고, 언어 정체성을 목표로 하는 언어 조정과 인간 작성 및 역번역된 텍스트 표현을 대조하여 잘 형성된 정도를 포착하는 품질 조정의 두 가지 전략을 연구하였다. 이 방법들은 4개의 오픈 소스 LLM, 여러 층, 11개의 유형적으로 다양한 언어에서 감정 및 주제 분류 데이터를 생성하고 소형 분류기를 미세 조정하는 데 평가되었다. 조정은 제로샷 및 몇 샷 프롬프트 설정 모두에 적용되었으며, 비조정 모델과 비교되었다. 결과적으로 초기 층에서의 조정이 생성된 데이터의 다양성을 일관되게 향상시키고, 저자원 언어에 대해 하위 모델 성능을 강화하는 경향이 있음을 보여주었다.

arXiv cs.CL (계산언어학·NLP)원문
NewsAI 리서치·논문·

공유 작업 공간에서의 인간-AI 협업 연구

자동화된 AI 에이전트는 점점 더 많은 능력을 갖추고 있지만, 많은 과학적 및 전문적 작업은 인간의 판단과 맥락적 전문성을 요구한다. 연구에서는 AI 에이전트와 인간 협력자가 최종 답변을 제출하기 전에 책임을 조정해야 하는 공유 작업 공간의 인간-AI 팀을 살펴본다. Collaborative Gym 환경과 DiscoveryBench 작업을 사용하여, 시뮬레이션된 인간 협력자를 추가하는 것이 성능을 향상시키는 경우와 추가 협력자가 조정 오버헤드로 작용하는 경우를 분석한다. 1,482회의 세션을 통해, 팀이 기여를 조정할 구조가 부족할 경우 관련 협력자를 추가하는 것이 성능을 낮출 수 있음을 발견했다. 또한, 공유 그룹 메모리와 시뮬레이션된 인간 참여자(HITL) 게이트를 결합한 스캐폴딩을 평가했으며, 이는 특히 세 사람 팀에서 더 높은 평균 성능을 나타내었다.

AI와 인간의 협업에서 책임 조정 방식이 성능에 미치는 영향을 이해하는 것은 팀 구성 및 작업 흐름 최적화에 중요하다.

arXiv cs.AI원문
NewsAI 리서치·논문·

SproutRAG: 주의 기반 계층적 RAG 프레임워크

SproutRAG는 정보 검색과 문맥 일관성을 균형 있게 조정하는 주의 기반 계층적 RAG 프레임워크이다. 이 시스템은 문장 수준의 청크를 점진적으로 더 큰 의미 단위로 조직하고, 학습된 문장 간 주의를 사용하여 이진 청크 트리를 구성한다. 기존 방법들과 달리 SproutRAG는 외부 LLM 호출이나 손실 요약 없이 다중 수준 검색을 가능하게 하며, 계층적 빔 검색을 통해 여러 수준의 후보를 검색한다. 실험 결과, SproutRAG는 네 가지 벤치마크에서 평균 6.1%의 정보 효율성을 개선하였다. 코드가 https://github.com/AmirAbaskohi/SproutRAG에서 제공된다.

SproutRAG는 LLM 호출 없이도 다중 수준 검색을 가능하게 하여 정보 검색 시스템의 효율성을 높일 수 있다.

arXiv cs.CL (계산언어학·NLP)원문
NewsAI 리서치·논문·

CaVe-VLM-CoT: 증거 기반 추론을 위한 비전-언어 모델 프레임워크

CaVe-VLM-CoT는 비전-언어 모델(VLM)의 환각 문제를 해결하기 위한 모듈형 반사 기반 에이전틱-RAG 프레임워크이다. 이 프레임워크는 다섯 단계의 폐쇄 루프 파이프라인(Extractor, Retriever, Solver, Citation Injector, Verifier)을 통해 증거 기반 추론을 강제하며, 발견된 비근거 주장에 대해 구조화된 피드백을 제공하여 재검색을 유도한다. CaVe-VLM-CoT는 ScienceQA에서 87.1%의 정확도와 56.6%의 CaVeScore, MMMU(30 과목)에서 55.2%의 정확도와 35.7%의 CaVeScore를 달성하였다.

arXiv cs.AI원문
NewsAI 프로덕트·스타트업·

OpenAI, 연간 수십억 달러 손실

유출된 재무 문서에 따르면 OpenAI는 매년 수십억 달러의 손실을 보고하고 있다.

OpenAI의 재정적 어려움은 AI 개발 및 서비스의 지속 가능성에 영향을 미칠 수 있다.

r/LocalLLaMA원문
News업무 자동화·

Cursor Automations의 /automate 기능 및 GitHub, Slack 트리거 추가

/automate 기능을 통해 사용자는 로컬 에이전트 세션에서 자동화 작업을 생성할 수 있으며, Slack 메시지에 이모지로 반응하여 자동화를 시작할 수 있다. 새로운 GitHub 트리거로는 비PR 이슈의 댓글, PR 리뷰 댓글, PR 리뷰 제출, 리뷰 스레드 업데이트, 워크플로우 실행 완료가 추가되었다. 또한, 자동화에 의해 시작된 클라우드 에이전트는 자신의 컴퓨터를 사용하여 작업의 데모나 결과물을 생성할 수 있으며, 자동화는 이제 불완전한 상태로 저장할 수 있고, PR을 기본적으로 열 수 있으며, UI에서 메모리 파일을 삭제할 수 있는 기능이 추가되었다.

이 업데이트는 반복 작업을 자동화하여 개발자의 작업 효율성을 높이고, GitHub와 Slack 통합을 통해 협업을 강화하는 데 기여한다.

Cursor (Anysphere) Changelog원문
NewsAI 모델·API·

Inflect-Nano-v1, 4.63M 파라미터의 초소형 TTS 모델 출시

Inflect-Nano-v1은 4.63M의 총 추론 파라미터를 가진 초소형 TTS 모델로, 3.46M의 음향 모델과 1.17M의 보코더를 포함한다. 이 모델은 24kHz 오디오를 지원하며, 영어 단일 남성 음성으로 작동한다. PyTorch 추론 스크립트를 사용하여 로컬에서 실행 가능하며, Kokoro보다 약 17배, Chatterbox보다 약 108배, Fish Audio S2 Pro보다 거의 1000배 작다. 품질은 제한적이며 로봇 같은 음성이나 어려운 텍스트에서의 문제점이 있다.

이 모델은 작은 파라미터 수로도 로컬 음성 합성 및 오프라인 어시스턴트 개발에 유용할 수 있다.

r/LocalLLaMA원문
NewsAI 리서치·논문·

AI R&D 자동화를 위한 작업 목록 개발

Epoch AI의 포스트에서 AI 연구 및 개발(R&D) 자동화를 위한 작업 목록의 필요성을 강조하고 있다. 연구자들은 AI R&D의 완전 자동화가 AI 발전을 가속화할 것이라고 보고 있으며, 이를 위해 AI R&D에 포함된 작업을 구체적으로 나열하는 것이 중요하다고 주장한다. 첫 번째 버전의 분류법이 제시되었으며, 여섯 가지 범주로 나뉘어 60개 이상의 작업이 포함되어 있다. 각 작업은 현재 AI가 얼마나 자동화하고 있는지를 0에서 5까지 평가받는다.

Epoch AI — Benchmarking Hub원문
NewsAI 프로덕트·스타트업·

Amazon SageMaker AI Async Inference, 인라인 요청 페이로드 지원 시작

Amazon SageMaker AI Async Inference가 인라인 페이로드 지원을 시작했다. 이제 고객은 <code>InvokeEndpointAsync</code> API의 요청 본문에 직접 추론 페이로드를 전송할 수 있으며, 이는 Amazon S3에 입력 데이터를 업로드할 필요를 없앤다. 인라인 페이로드는 최대 128,000 바이트까지 지원되며, 이를 통해 네트워크 왕복을 줄이고 클라이언트 측 코드를 단순화할 수 있다. <code>Body</code> 매개변수와 <code>InputLocation</code>는 상호 배타적이며, 기존 비동기 엔드포인트와 호환된다.

이 기능은 작은 입력 페이로드를 사용하는 고객에게 S3 의존성을 줄여 개발 복잡성을 감소시킨다.

AWS Machine Learning Blog원문
NewsAI 에이전트·

Amazon Quick의 자율 에이전트 기능 추가

Amazon Quick은 사용자의 앱과 데이터 소스에 연결되어 작업을 대신 수행하는 AI 어시스턴트로, 이제 자율 에이전트를 생성할 수 있는 기능이 추가되었다. 사용자는 간단한 언어로 필요를 설명하거나 미리 구성된 에이전트를 선택하여 몇 분 안에 에이전트를 만들 수 있으며, 각 에이전트는 설정한 가이드라인 내에서 작동한다. 또한, Quick의 활동 피드는 이메일, 메시지, 일정, 작업을 통합하여 우선순위를 정리해준다. 이번 주에는 Adobe, Cisco Webex, Google Chat 등 16개의 새로운 통합 기능이 추가되었다.

개발자는 Amazon Quick의 새로운 기능을 활용하여 업무 효율성을 높이고, 반복적인 작업을 자동화할 수 있다.

AWS Machine Learning Blog원문
NewsAI 리서치·논문·

Elicit의 신뢰할 수 있는 추론 워크플로우 구축

Andreas Stuhlmüller와 Jungwon Byun은 Elicit이 강력하지만 불투명한 최전선 모델을 위해 신뢰할 수 있는 과학 연구 추론 워크플로우를 구축하고 있다고 설명했다. 이들은 과정 감독, 도메인별 추론 원시 요소, 증거, 인과관계 및 반사실을 더 잘 검사할 수 있게 하는 세계 모델에 대해 논의했다. 또한 생명 과학 사용 사례, 상충되는 증거 평가, Elicit의 자동화된 소프트웨어 엔지니어링, 토큰 비용, Gemini, 그리고 명확한 추론이 여전히 신경망 언어보다 우수할 수 있는 이유에 대해서도 언급했다.

The Cognitive Revolution원문
NewsAI 코딩·

GitHub Copilot의 컨텍스트 처리 및 모델 라우팅 개선

GitHub Copilot은 더 긴 세션에서의 효율성을 높이기 위해 반복되는 정보를 줄이고, 작업에 적합한 모델을 선택하는 기능을 개선하고 있다. VS Code에서의 개선 사항으로는 프롬프트 캐싱과 도구 검색이 있으며, 이를 통해 Copilot은 반복적인 프롬프트 접두사를 재계산하지 않고 재사용할 수 있다. Auto 기능은 작업 의도와 현재 모델 상태를 기반으로 가장 적합한 모델을 선택하여 개발자가 매번 모델 설정을 조정할 필요 없이 효율성을 높인다.

이 개선 사항은 개발자가 GitHub Copilot을 사용할 때 더 빠르고 효율적인 작업 처리를 가능하게 한다.

GitHub Blog원문
NewsAI 에이전트·

Cloudflare, Flue를 시작으로 에이전트 하네스 및 프레임워크 확대

2026년부터 에이전트 하네스가 실제 운영에 들어간다. Cloudflare는 Project Think에서 얻은 경험을 바탕으로 Cloudflare Agents SDK를 통해 내구성 있는 실행, 동적 코드 실행, 내구성 있는 파일 시스템 및 동적 워크플로우를 제공한다. Flue는 Pi 하네스를 기반으로 한 새로운 오픈소스 프레임워크로, 에이전트의 작업을 스크립트하는 대신 필요한 맥락을 정의하여 자율적으로 작업을 수행하도록 설계되었다. Flue는 Slack, GitHub, Linear, Discord와 통합 가능하며, Durable Streams를 통해 에이전트의 상태를 안정적으로 유지한다.

Cloudflare Blog — AI원문
NewsAI 에이전트·

AI 코딩 에이전트가 로봇에게 GPU 설치 및 지퍼 타이 자르는 방법 교육

AI 코딩 에이전트가 로봇 팔과 컴퓨팅 자원, '관대한 토큰 예산'을 활용하여 로봇에게 지퍼 타이를 자르고 GPU를 마더보드의 얇은 소켓에 삽입하는 방법을 가르치는 훈련 프로그램을 개발했다. 이 과정은 AI 모델을 다양한 도구와 함께 사용할 수 있도록 하는 소프트웨어인 ENPIRE를 통해 가능해졌다. ENPIRE는 NVIDIA GEAR 연구소의 로봇 연구자들과 카네기 멜론 대학교, 캘리포니아 대학교 버클리의 협력으로 개발되었다.

Ars Technica — AI원문
NewsAI 리서치·논문·

Radical AI의 자율주행 실험실과 소재 발견 가속화

Joseph Krause는 Radical AI를 설립하여 소재 발견 과정을 10배 가속화하고 있다. 이들은 자율주행 실험실(SDL)을 통해 AI 과학자가 가설을 생성하고 자동화 로봇이 소재를 합성 및 특성 분석하는 시스템을 운영하고 있다. Radical은 6개월 동안 1200개의 합금을 생산하고 특성 분석을 완료했으며, 하루에 100개의 새로운 합금을 테스트할 수 있을 것으로 예상하고 있다. 이들은 300개의 새로운 소재를 제안하고 테스트하여 10개의 혁신적인 특성을 가진 소재를 발견했다.

Latent Space: The AI Engineer Podcast원문