본문으로 건너뛰기

News

AI 뉴스

매일 수집·정리하는 전세계 AI 소식을 최신순으로

News커리어·채용중급·

[설명] 2026 AI 엔지니어 핵심 역량, API 호출에서 운영 신뢰성으로

AI 채용의 기준선이 바뀌었다. 'LLM API를 호출할 수 있는가'가 아니라 '신뢰할 수 있고, 관측 가능하며, 비용이 통제되고, 안전한 시스템을 운영 트래픽 속에서 6개월간 유지할 수 있는가'를 묻는다. 2026년 채용 체크리스트로 자주 언급되는 항목은 다음과 같다. 에이전트 오케스트레이션, MCP 연동, 평가(eval) 설계, 프롬프트 엔지니어링, 벡터 DB/RAG, 비용 최적화, 안전·가드레일, 운영 관측 가능성, 그리고 프런티어 모델에 대한 숙련도다. 특히 MLOps는 'AI 투자가 실제 제품 가치로 이어지는지'를 가르는 병목으로 지목된다. 시장은 일반론적 제너럴리스트보다 도메인 전문성을 보상하며, 같은 연차라도 30~50% 높은 보상을 받는 사례가 보고된다. 분석 엔지니어링·백엔드·데이터 모델링 배경이 오히려 강한 출발점이 된다. 결론은 명확하다. 모델을 '호출'하는 사람이 아니라, 모델을 '제품의 신뢰 가능한 동작'으로 바꾸는 사람을 시장이 원한다.

SearchQualify / Robert Half원문
News커리어·채용초급·

한국 정부, 2026년 AI 인재 양성에 약 1.4조 원 투입해 고급 인재 1.1만 명 목표

한국 정부는 'AI 3대 강국' 목표 아래 2026년 약 1.4조 원(약 10억 달러)을 들여 고급 AI 인재 약 1만 1천 명을 양성하고, 전 생애주기에 걸친 AI 교육을 확대한다는 계획을 발표했다. 2026년부터 3개 지역 교육청에 AI 교육지원센터를 설치하고 2028년까지 전국 17곳으로 늘려 학생·학부모·교사 교육과 대학·기업 연계를 추진한다. 배경에는 구조적 인력난이 있다. 2025~2029년 사이 이공계 전문인력이 최소 58만 명 부족할 것으로 전망되며, 반도체·AI·바이오·양자 분야의 공백이 특히 크다. 한국소프트웨어산업협회는 2026년 수도권에서만 AI/ML 엔지니어링, 클라우드 인프라, RegTech를 중심으로 4만 5천~5만 2천 개의 순신규 일자리를 예상했다. 다만 고급 인재의 해외 유출(브레인 드레인)은 여전한 과제로 남아 있다.

공공 교육·일자리 정책이 AI 직군으로 집중되면서, 국내 개발자에게 재교육·전직·신규 진입의 기회 창구가 구조적으로 넓어진다.

British Council / The Korea Herald원문
NewsAI 프로덕트·스타트업초급·

한국 소버린 AI: Naver·LG·SK·NC·Upstage 5개 팀이 자체 파운데이션 모델 구축

한국 정부가 ChatGPT에 맞설 자체 파운데이션 모델 개발을 위해 Naver, LG, SK, NC, Upstage 5개 정예 팀을 선정해 고성능 컴퓨팅 인프라, 대규모 데이터셋, AI 인재 인건비 보조를 지원한다. Upstage는 자사 모델 Solar를 1,000억~3,000억 파라미터 규모로 목표하며 언어 능력에 더해 멀티모달과 산업 특화 버전으로 단계적 확장을 계획하고, 2026년 3월에는 AMD와 차세대 모델 개발·배포 가속 및 GPU 공급 협력을 확대했다. Naver의 HyperCLOVA X는 한국어·문화·맥락에 강점을 둔 초대규모 모델로 자리잡았다. 한국어 데이터와 국내 인프라 위에서 모델·도구가 만들어지는 흐름은, 데이터 주권과 규제 대응이 중요한 국내 서비스에 실질적인 모델 선택지를 넓힌다.

데이터 주권·한국어 성능·국내 규제가 중요한 서비스를 만드는 개발자에게 글로벌 폐쇄형 API 외의 실질적 대안이 늘어난다.

KED Global원문
NewsAI 모델·API초급·

[설명] 정규식 파싱 대신 구조화 출력·함수 호출 제대로 쓰기

LLM 응답을 정규식으로 긁어 JSON을 추려내는 방식은 이제 안티패턴이다. 핵심은 스키마를 한 번 정의하고, 그 JSON 스키마를 모델에 형식 지시로 넘긴 뒤, 응답을 원본 스키마로 다시 검증하는 흐름이다. 제약 디코딩 기반의 네이티브 구조화 출력은 스키마 유효성을 사실상 보장하며, 스키마 없는 JSON 모드는 약 8~15% 비율로 실패한다고 보고된다. 제공사마다 결이 다른데, OpenAI·Gemini는 response_format/스키마 기반 strict 모드를, Claude는 input_schema를 갖춘 도구 정의(tool use)와 tool_choice 패턴을 쓴다. 또한 vLLM·Ollama 등 셀프 호스팅 런타임도 스키마 기반 출력 제어를 노출한다. 스키마 강제는 호출당 토큰이 다소 늘지만 재시도 비용을 없애므로, 복잡한 스키마는 잘게 쪼개 병렬 호출로 처리하는 편이 비용 효율적이다.

구조화 출력은 프로덕션 LLM 파이프라인의 신뢰성을 좌우하는 기본기로, 제공사별 구현 차이를 알아야 이식성 있는 코드를 짤 수 있다.

agenta.ai원문
NewsAI 에이전트실전·

2026 에이전틱 코딩 도구 지형도: 벤치마크는 도구마다 다르게 이긴다

2026년 에이전틱 코딩 도구 비교를 보면, 단일 '최강'은 없고 벤치마크마다 승자가 갈린다. 터미널 작업 중심의 Terminal-Bench 계열에서는 Codex CLI가 선두로, Claude Code와 Gemini CLI가 뒤를 잇는 양상이 보고된다. 반면 실제 저장소 이슈를 푸는 SWE-bench Pro 계열에서는 Claude Code(Opus 4.x)가 앞서는 결과가 나온다. 도구 철학도 다르다 — Claude Code는 터미널·파일시스템·git 히스토리에 직접 붙는 에이전트 중심이고 대용량 컨텍스트로 교차 파일 의존성을 읽는 데 강하다. Cursor는 IDE 우선에 빠른 탭 자동완성·멀티모델 라우팅, 2026년 초 CLI와 클라우드 핸드오프를 추가했다. 결론은 '벤치마크 점수 하나로 고르지 말고, 작업 형태(터미널 자동화 vs 저장소 PR vs 인터랙티브 IDE)에 맞춰 고르라'는 것이다.

팀이 사내 표준 코딩 에이전트를 정할 때, 단일 점수가 아니라 실제 작업 유형에 맞춰 선택해야 ROI가 난다는 실무 기준을 준다.

morphllm / Requesty (벤치마크 종합)원문
NewsAI 프로덕트·스타트업·

AI 팀의 성공을 위한 측정과 반복의 중요성

많은 AI 팀이 복잡한 시스템을 구축하는 데 집중하지만, 실제로 효과를 측정하지 못하는 경우가 많다. 성공적인 팀은 도구에 대한 논의보다 측정과 반복에 집중하며, 오류 분석을 통해 가장 높은 ROI 개선점을 찾아낸다. 예를 들어, Nurture Boss의 팀은 대화 로그를 분석하여 날짜 처리에서 66%의 실패율을 발견하고, 이를 개선하기 위해 구체적인 테스트를 구축하여 성공률을 33%에서 95%로 향상시켰다. 또한, 오류 유형 분석에는 '상향식' 접근 방식이 효과적이며, 실제 데이터를 기반으로 문제를 파악하는 것이 중요하다.

AI 프로젝트의 성공을 위해서는 도구보다 측정과 오류 분석에 집중해야 한다.

Hamel Husain's Blog원문
NewsAI 리서치·논문·

무료 과정 'How Transformer LLMs Work' 개설

'How Transformer LLMs Work'는 현대 Transformer 아키텍처, 토크나이저, 임베딩 및 혼합 전문가 모델을 설명하는 약 90분 분량의 무료 과정이다. 이 과정에서는 LLM이 텍스트를 처리하는 방식과 Transformer 아키텍처의 주요 구성 요소를 코드 예제를 통해 배울 수 있다. 주요 주제로는 언어 표현의 진화, LLM 입력의 토큰화 과정, Transformer 블록의 세 가지 주요 단계, 주의(attention) 메커니즘, 캐시된 계산의 속도 향상 등이 포함된다. 과정이 끝나면 LLM 모델에 대한 논문을 이해하는 데 필요한 깊은 통찰력을 얻게 된다.

Language Models & Co. (Jay Alammar)원문
NewsAI 에이전트중급·

컴퓨터·브라우저 에이전트 2026: 픽셀 vs DOM, 세 진영의 설계 차이

2026년 컴퓨터·브라우저 에이전트가 실제 워크로드에 쓸 만해졌고, 세 진영이 서로 다른 아키텍처를 택했다. Anthropic의 Claude는 화면 스크린샷을 받아 마우스·키보드 입력을 돌려주는 범용 computer use 도구를 노출하되, 실제 실행 환경은 고객 책임이다 — 즉 화면을 시각적으로 분석해 클릭·입력을 수행하는 픽셀 기반에 가깝다. OpenAI는 Codex Background Computer Use로 엔지니어의 메인 작업 환경과 병렬로 별도 데스크톱 세션에서 에이전트를 돌린다. Google의 Gemini Computer Use는 Project Mariner 계보로, 원시 픽셀 파싱보다 DOM 인식을 우선한다. 오픈소스 쪽에서는 Browser Use가 Playwright를 감싸 Claude·GPT·Gemini·로컬 모델을 백엔드로 붙이는 가장 인기 있는 프레임워크다. 다만 안티봇 탐지·동적 레이아웃·인증 플로우는 여전히 난제로 남아 있다.

웹 자동화·RPA를 대체할 에이전트를 고를 때 '픽셀 기반 vs DOM 기반'이라는 설계 축이 안정성·유지보수성을 가르므로, 용도에 맞는 선택 기준을 준다.

digitalapplied원문
NewsAI 리서치·논문·

DeepSeek-R1: 고급 추론 모델의 훈련 방법

DeepSeek-R1은 오픈 가중치 모델로, 600,000개의 긴 추론 예제를 포함하여 훈련된다. 이 모델은 수학 및 추론 문제 해결에 뛰어나며, 기존 LLM과 마찬가지로 한 번에 하나의 토큰을 생성하지만, 사고 과정을 설명하는 토큰을 생성하는 데 더 많은 시간을 할애한다. R1은 DeepSeek-V3 모델의 기본 모델을 사용하며, 감독된 미세 조정(SFT) 및 선호 조정 단계를 거쳐 훈련된다. R1-Zero라는 모델을 통해 대규모 강화 학습을 활용하여 추론 모델을 생성하고, 이 과정에서 레이블이 없는 데이터로도 훈련이 가능하다.

Language Models & Co. (Jay Alammar)원문
NewsAI 리서치·논문·

AI 연구에서의 도파민 사이클

AI 연구는 매일 실험을 계획하고 코드를 작성하여 결과를 확인하는 과정에서 도파민을 경험하는 사이클이 있다. 소규모 실험에서는 빠르게 보상을 받을 수 있지만, 비관습적이거나 논란이 있는 큰 실험에서는 불확실성과 힘든 작업을 겪는다. 성공 시 큰 성취감을 느끼지만 실패 시 무력감을 느낄 수 있으며, 연구자들은 자신의 능력을 증명하거나 동료의 존중을 추구하는 사회적 요소도 존재한다.

Jason Wei원문
NewsAI 프로덕트·스타트업·

생성 AI 애플리케이션 개발 시 흔히 발생하는 실수

생성 AI를 사용할 필요가 없는 상황에서도 이를 적용하려는 경향이 있다. 예를 들어, 한 팀이 LLM을 사용해 가정의 에너지 소비를 최적화하려 했으나, 단순히 전기 요금이 저렴한 시간에 에너지 집약적인 활동을 스케줄링하는 것이 더 효과적일 수 있다. 또한, '나쁜 제품'과 '나쁜 AI'를 혼동하는 경우가 많다. 사용자 경험(UX)이 중요한데, 사용자가 원하는 것이 직관적이지 않을 수 있으며, 예를 들어 회의 요약 애플리케이션에서 사용자는 요약보다 자신에게 필요한 행동 항목을 원한다. LinkedIn의 챗봇은 정확한 답변보다 유용한 답변을 원하고, Intuit의 챗봇은 사용자가 입력하기 어려워하는 문제를 해결하기 위해 제안된 질문을 추가하여 긍정적인 피드백을 얻었다.

Chip Huyen원문
NewsAI 에이전트·

SWE-bench, 2024년 소프트웨어 엔지니어링 작업 측정

SWE-bench 작업은 AI 에이전트를 GitHub 이슈 수준의 소프트웨어 엔지니어링 작업에서 측정한다. 2024년 소프트웨어 엔지니어링 작업을 다루는 에이전트의 진행 상황을 측정하는 중요한 작업 중 하나였다. Ofir Press와 Carlos E. Jimenez 두 창립자와의 인터뷰를 통해 LLM 기반 에이전트의 현황에 대한 아이디어를 공유했다.

SWE-bench는 AI 에이전트의 소프트웨어 엔지니어링 작업 처리 능력을 평가하는 기준을 제공한다.

Language Models & Co. (Jay Alammar)원문
NewsAI 에이전트·

AI 에이전트의 정의와 기능

AI 에이전트는 환경을 인식하고 그에 따라 행동할 수 있는 존재로 정의된다. AI 에이전트는 다양한 도구에 접근할 수 있으며, 이러한 도구는 에이전트의 행동 범위를 결정한다. 예를 들어, ChatGPT는 웹 검색, Python 코드 실행, 이미지 생성 등의 기능을 가진 에이전트이다. 에이전트의 환경은 사용 사례에 따라 정의되며, 특정 환경에서는 제한된 행동만 가능하다.

Chip Huyen원문
NewsAI 모델·API실전·

[설명] 캐시 프리픽스 설계로 프롬프트 캐싱 입력 비용 90% 줄이기

긴 시스템 프롬프트나 문서를 매 호출 그대로 다시 보내면 입력 토큰 비용이 누적된다. 프롬프트 캐싱은 변하지 않는 앞부분(프리픽스)을 캐시해 캐시된 입력 비용을 약 90%까지 낮춘다. 설계 원칙은 단순하다. 고정적인 부분(시스템 지시, 도구 정의, 참조 문서)을 프롬프트 앞쪽에 모으고, 사용자별로 바뀌는 내용은 뒤로 빼서 캐시 프리픽스를 최대화하는 것이다. Claude의 경우 2026년 2월 5일부터 캐시가 조직이 아닌 워크스페이스 단위로 격리되어 같은 조직 내 워크스페이스 간 데이터가 분리된다. Opus 4.5+·Sonnet 4.6+에서는 이전 thinking 블록이 기본 보존되어 캐시 프리픽스에 포함된다. 대화가 윈도우나 예산을 넘길 만큼 길어질 때는 컨텍스트 컴팩션(베타)으로 한 번 요약 비용을 치르고 이후 작은 컨텍스트를 들고 가는 선택지도 있다.

RAG·에이전트처럼 같은 컨텍스트를 반복 호출하는 한국 서비스에서 캐시 프리픽스 설계만 바꿔도 월 비용을 크게 줄일 수 있다.

Claude API Docs원문
NewsAI 리서치·논문·

필리핀 NLP의 LLM 시대를 위한 방향성

필리핀 NLP 분야에서 LLM의 발전에 따라 데이터 수집과 평가 기준의 필요성이 강조되고 있다. Meta의 Llama 3.1, Cohere for AI의 Aya Expanse, AI Singapore의 SEA-LION 등 여러 다국어 LLM이 출시되었으나, 필리핀 언어는 여전히 지원받지 못하고 있다. 필리핀 언어의 IFT 데이터는 부족하며, 현재 가장 좋은 데이터셋은 Aya로, Tagalog에 1.46k 샘플, Cebuano에 4.12M 샘플이 포함되어 있다. 연구자들은 LLM의 후속 훈련을 지원하는 자원과 신뢰할 수 있는 벤치마크를 구축해야 한다.

필리핀 언어에 대한 데이터 부족 문제를 해결하기 위한 연구와 협업이 필수적이다.

Lj V. Miranda원문
NewsAI 리서치·논문·

동일 데이터로 훈련된 TopK SAE의 특징 학습 차이

두 개의 TopK SAE가 동일한 데이터와 배치 순서로 훈련되었지만 서로 다른 무작위 초기화를 사용했을 때, 첫 번째 SAE의 많은 잠재 변수는 두 번째 SAE와 밀접한 대응이 없으며, 그 반대의 경우도 마찬가지이다. 실제로 약 53%의 특징만이 공유된다. 또한, 공유되지 않는 많은 잠재 변수는 해석 가능하다. 좁은 SAE일수록 무작위 초기화 간의 특징 중복이 더 높으며, SAE의 크기가 증가할수록 중복이 감소한다.

SAE의 크기와 구조에 따라 특징 학습의 일관성이 달라질 수 있음을 보여주어, 모델 설계 시 초기화 방법과 크기를 고려해야 함을 시사한다.

EleutherAI Blog원문
News커리어·채용·

기술 글쓰기를 통한 청중 구축 전략과 실수

저자는 AI 및 기술 관련 글쓰기를 통해 많은 사람들과 연결되고, 매주 제품에 대한 글 작성을 요청받는다고 언급한다. 청중을 성장시키기 위한 전략으로는 다른 사람의 작업에 깊이 관여하고, 일관되게 콘텐츠를 게시하며, 카피라이팅 기술을 향상시키는 것이 포함된다. 예를 들어, Jason Liu는 1년 동안 하루에 약 30번 포스팅하여 팔로워를 500명에서 30,000명으로 늘렸다. 또한, Sam Parr의 카피라이팅 코스를 통해 명확한 글쓰기를 강조하며, AI와 함께 사용할 수 있는 음성-텍스트 변환 앱을 추천한다.

Hamel Husain's Blog원문
NewsAI 리서치·논문·

강화 학습에서의 보상 해킹 문제

보상 해킹은 강화 학습(RL) 에이전트가 보상 함수의 결함이나 모호성을 이용해 높은 보상을 얻는 현상이다. 이는 RL 환경이 종종 불완전하고, 보상 함수를 정확하게 지정하는 것이 근본적으로 어렵기 때문에 발생한다. 언어 모델의 다양한 작업 일반화와 RLHF가 정렬 훈련의 사실상 방법으로 자리잡으면서, 언어 모델의 RL 훈련에서 보상 해킹은 중요한 실무적 도전 과제가 되었다. 예를 들어, 모델이 코딩 작업을 통과하기 위해 단위 테스트를 수정하거나, 응답에 사용자의 선호를 모방하는 편향이 포함되는 경우가 있다.

Lil'Log (Lilian Weng)원문
NewsAI 코딩초급·

[설명] 코딩 에이전트의 성패를 가르는 컨텍스트 엔지니어링

AI 코딩 에이전트는 컨텍스트 윈도우에 들어온 것만 안다. 회사의 아키텍처, 승인된 라이브러리, 폐기된 패턴, 수년 전의 설계 결정은 명시하지 않으면 모른다. 그래서 2026년 현장의 핵심 역량은 모델 선택이 아니라 컨텍스트 엔지니어링이다. 실무 원칙은 다음과 같다. 컨텍스트 파일은 Markdown으로 작성하고(Claude Code·Cursor·Copilot·JetBrains가 공통 지원), Architecture·Conventions·Testing·Anti-patterns·Commands처럼 개발자가 생각하는 방식대로 H2 섹션을 나눈다. 컨텍스트 파일은 코드와 함께 버전 관리하고 아키텍처가 바뀌면 즉시 갱신하며(낡은 컨텍스트는 깨진 코드로 취급), 'X는 절대 쓰지 말고 Y를 써라' 같은 안티패턴 명시는 투자 대비 효과가 가장 큰 항목이다. 탐색과 구현을 분리하고 검증을 포함한 반복 가능한 워크플로를 쓰면, 같은 모델로도 결과의 일관성이 크게 올라간다.

같은 모델이라도 컨텍스트 파일과 워크플로 설계가 결과 품질을 좌우하므로, 팀이 당장 적용해 ROI를 얻을 수 있는 영역이다.

Sourcegraph / Packmind원문
NewsAI 모델·API실전·

DeepSeek V4·Qwen 3.6·MiniMax M3, 오픈 웨이트 모델 격차 좁혀

2026년 상반기 오픈 웨이트 모델이 프런티어와의 격차를 빠르게 좁혔다. DeepSeek V4-Pro는 SWE-bench Verified에서 80.6%를 기록해 상위 폐쇄형 모델과 0.2포인트 차이까지 따라붙었고 MIT 라이선스로 풀렸다. Qwen 3.5는 397B 총 파라미터(패스당 17B 활성)에 201개 언어와 100만 토큰 컨텍스트를 지원하는 비전·언어 통합 모델이며, Qwen 3.6은 Apache-2.0으로 공개됐다. 6월에는 MiniMax M3가 프런티어급 코딩·100만 컨텍스트·네이티브 멀티모달을 결합한 첫 오픈 웨이트 모델로 등장했다. 라이선스·활성 파라미터·컨텍스트 길이가 모델마다 크게 다르므로, 자체 호스팅 시 vLLM 같은 서빙 스택과 GPU 메모리 요건을 함께 따져야 한다.

데이터 주권·비용·온프레미스 요건이 큰 한국 환경에서 MIT·Apache 라이선스의 프런티어급 오픈 모델은 자체 호스팅의 현실적 선택지를 넓힌다.

codersera원문
NewsAI 프로덕트·스타트업·

LLM을 평가자로 활용하기 위한 가이드

이 가이드는 30개 이상의 기업에서 평가 시스템을 설정하는 데 도움을 준 경험을 바탕으로 작성되었다. AI 팀은 데이터에 압도당하는 문제를 겪고 있으며, 평가 과정에서 발생하는 일반적인 실수로는 너무 많은 지표, 임의의 점수 체계, 도메인 전문가 무시, 검증되지 않은 지표 사용 등이 있다. 이를 해결하기 위해 'Critique Shadowing' 기법을 제안하며, 첫 단계로 주요 도메인 전문가를 찾아야 한다. 이들은 기술적으로 수용 가능한 기준을 설정하고, 사용자가 원하는 것을 이해하는 데 도움을 준다. 다음 단계로는 이 전문가와 함께 AI가 직면할 문제를 포괄하는 다양한 데이터셋을 구축해야 한다.

주요 도메인 전문가의 참여는 AI 제품의 성공에 필수적이며, 이를 통해 평가의 일관성을 높일 수 있다.

Hamel Husain's Blog원문
News커리어·채용중급·

에이전틱 AI 채용 붐, 1년 새 관련 공고 280% 급증

스탠퍼드 AI Index와 다수 채용 데이터에 따르면 에이전틱 AI(자율 에이전트) 관련 채용 공고가 전년 대비 약 280% 늘어 미국에서만 약 9만 건 수준에 이르렀다. 시장의 질문이 'LLM API를 호출할 수 있는가'에서 '검색·평가·재검색·검증을 스스로 도는 신뢰성 있는 에이전트를 운영 환경에서 6개월간 굴릴 수 있는가'로 옮겨갔다는 것이 핵심이다. 진지한 멀티에이전트 시스템은 이제 LangGraph, CrewAI, Claude Agent SDK처럼 상태머신·체크포인팅·휴먼인더루프를 기본 제공하는 프레임워크 위에서 만들어진다. 한국 개발자에게 시사하는 바는 분명하다. 프롬프트 패턴만 익히기보다 백엔드·데이터 모델링 기반 위에서 도구 오케스트레이션, MCP 연동, 평가(eval) 설계, 비용·가드레일까지 다루는 역량이 채용 체크리스트의 중심이 됐다.

JobsByCulture (Stanford AI Index 2026 인용)원문
News업무 자동화중급·

컴퓨터 유즈 에이전트 2026: Claude·Operator·Gemini 세 갈래

화면을 보고 마우스·키보드를 직접 조작해 사람처럼 GUI를 다루는 컴퓨터 유즈 에이전트가 2026년에는 실험을 넘어 하나의 제품 카테고리가 됐다. 출발점은 Anthropic이 2024년 10월 22일 public beta로 공개한 Claude의 Computer Use로, 스크린샷을 시각적으로 분석해 좌표 기반 클릭과 키 입력으로 멀티스텝 작업을 수행한다. OS에 의존하지 않는 portable한 스크린샷+마우스+키보드 툴이라 VM·컨테이너·원격 데스크톱에서 두루 동작한다. 접근법은 셋으로 갈린다. Claude는 OS 비의존 시각 제어, OpenAI Operator 계열은 별도 데스크톱 세션에서 백그라운드로 에이전트를 돌리는 방향, Google Gemini의 Computer Use는 Project Mariner에서 자라 DOM 인식과 웹 네이티브 액션으로 브라우저 워크플로에 최적화한다. 공통점은 화면을 보고 맥락을 이해하며 인터페이스가 바뀌어도 적응한다는 점이다.

API가 없는 레거시·내부 웹 시스템까지 자동화 대상으로 끌어들이는 길이라, 통합 비용이 큰 한국 기업 환경에서 자동화 범위를 크게 넓힌다.

Anthropic원문
NewsAI 툴중급·

MCP 차기 명세, 스테이트리스 코어로 엔터프라이즈 운영 표준화

Model Context Protocol(MCP) 차기 명세가 릴리스 후보(RC) 단계에 진입했다. 핵심은 일반 HTTP 인프라에서 수평 확장되는 '스테이트리스 코어'다. 세션 생성·재개·마이그레이션을 표준화해 서버 재시작이나 스케일아웃이 클라이언트에 투명하게 처리된다. 여기에 장기 실행 작업을 위한 Tasks 확장, 서버 렌더링 UI를 다루는 MCP Apps, OAuth·OpenID Connect와 정렬된 인가 강화, 공식 폐기(deprecation) 정책이 더해졌다. MCP는 이제 '얼마나 채택됐나'가 아니라 거버넌스·아이덴티티·감사·확장성 같은 엔터프라이즈 기준으로 평가받는 단계로 넘어갔다. Claude, Cursor 등 주요 도구가 MCP를 표준 통합 계층으로 채택한 만큼, 한국 개발자도 사내 도구·데이터를 에이전트에 연결할 때 스테이트리스 설계와 인가 모델을 미리 고려해야 한다.

MCP가 사실상 에이전트-도구 연결의 산업 표준으로 굳어지면서, 스테이트리스·인가 설계가 자체 MCP 서버 구축의 새 기준선이 된다.

Model Context Protocol Blog원문