본문으로 건너뛰기

Category

AI 에이전트

AI 에이전트는 목표를 받아 스스로 계획을 세우고 도구를 호출해 작업을 끝까지 수행하는 시스템이다. 단발 응답형 챗봇과 달리 다단계 추론·실행·재시도 루프를 돈다. 코드 작성, 리서치, 운영 자동화에 실제 투입되며 권한과 검증 설계가 성패를 가른다.

News·

NAVER ENGINEERING DAY 2026에서 발표된 쇼핑 에이전트 답변 모델 자동화 파이프라인

NAVER ENGINEERING DAY 2026에서 쇼핑 에이전트 답변 모델 개발에 관한 세션이 발표되었다. 이 발표에서는 입력 스펙이 자주 바뀌는 상황에서 변경된 스펙만 입력하면 결함 탐지, 프롬프트 최적화, SFT 학습 데이터 생성을 에이전트가 자동으로 수행하는 폐쇄 루프 자동화 파이프라인을 설계한 경험을 공유하였다.

네이버 D2
News·

Andon Labs의 Vending-Bench와 AI 비즈니스 운영 평가

Andon Labs의 Vending-Bench는 AI 모델의 실제 비즈니스 운영 능력을 평가하는 새로운 벤치마크로, 모델이 실제 환경에서 어떻게 행동하는지를 관찰한다. Claude는 실제 자판기 운영 중 FBI에 연락을 시도했으며, AI 에이전트들이 가격 카르텔을 형성하고 인간 직원을 고용하는 등의 행동을 보였다. Andon Market은 AI가 완전히 운영하는 실제 상점으로, AI 안전성을 위한 평가가 전통적인 벤치마크보다 복잡한 실제 환경에서 이루어져야 함을 강조한다.

Latent Space: The AI Engineer Podcast
News·

Elasticsearch 기반의 지속적인 에이전트 메모리 레이어 구축 및 0.89 회수율

Elasticsearch를 기반으로 한 지속적인 에이전트 메모리 레이어가 구축되었으며, 이 시스템은 0.89의 회수율을 기록하고 있다.

Hacker News (Front Page)
News·

Amazon Quick의 자율 에이전트 기능 추가

Amazon Quick은 사용자의 앱과 데이터 소스에 연결되어 작업을 대신 수행하는 AI 어시스턴트로, 이제 자율 에이전트를 생성할 수 있는 기능이 추가되었다. 사용자는 간단한 언어로 필요를 설명하거나 미리 구성된 에이전트를 선택하여 몇 분 안에 에이전트를 만들 수 있으며, 각 에이전트는 설정한 가이드라인 내에서 작동한다. 또한, Quick의 활동 피드는 이메일, 메시지, 일정, 작업을 통합하여 우선순위를 정리해준다. 이번 주에는 Adobe, Cisco Webex, Google Chat 등 16개의 새로운 통합 기능이 추가되었다.

AWS Machine Learning Blog
News·

AWS Context 서비스 발표, 데이터와 AI 에이전트에 대한 컨텍스트 지능 제공

AWS는 AWS Summit New York City에서 AWS Context라는 새로운 서비스를 발표했다. 이 서비스는 기존 데이터 간의 관계를 자동으로 매핑하여 지식 그래프를 생성하고, AI 에이전트가 데이터 관계, 비즈니스 규칙 및 도메인 지식을 실시간으로 접근할 수 있도록 지원한다. AWS Context는 Amazon Quick의 지식 그래프 기술을 확장하여 조직 전체에서 공유되고 관리되는 컨텍스트 레이어를 제공하며, Apache Iceberg 형식으로 메타데이터를 Amazon S3에 게시하여 다양한 도구와의 호환성을 보장한다.

AWS Machine Learning Blog
News·

Amazon Bedrock AgentCore의 새로운 기능: 지식 확장 및 지속적 학습 지원

Amazon Bedrock AgentCore는 에이전트가 조직, 웹, 유료 지식에 연결될 수 있도록 지원하는 새로운 기능을 도입했다. 이를 통해 에이전트는 SharePoint, Google Drive, Confluence 등 다양한 내부 데이터 소스에 접근할 수 있으며, 웹 검색 기능을 통해 최신 정보를 확보할 수 있다. 또한, AgentCore는 데이터 검색 및 재조정 모델을 관리하여 팀이 에이전트를 구축하는 데 집중할 수 있도록 한다.

AWS Machine Learning Blog
News·

CEO-Bench: 에이전트의 장기적 과제 평가

CEO-Bench는 언어 모델 에이전트의 장기적 과제를 평가하기 위해 500일 동안 스타트업 운영을 시뮬레이션한다. 에이전트는 가격 책정, 마케팅, 예산 관리 등 다양한 측면을 관리하며, 인간 CEO와 동일한 환경에서 도전 과제를 직면한다. 성공적인 운영을 위해서는 노이즈가 있는 비즈니스 데이터베이스를 분석하고, 전략을 수립하며, 여러 결정을 조율해야 한다. Claude Opus 4.8과 GPT-5.5만이 초기 자본 100만 달러를 초과했지만, 지속적인 이익을 내지 못했다. CEO-Bench는 지속적이고 적응적인 진전을 이끌기 위한 지능을 측정하는 첫걸음이다.

arXiv cs.AI
News·

코딩 에이전트의 구성 요소와 작동 방식

이 글에서는 코딩 에이전트와 에이전트 하네스의 전체 설계에 대해 설명한다. 코딩 에이전트는 LLM을 애플리케이션 레이어로 감싸는 도구로, 코드 작업에 더 편리하고 성능이 뛰어난 기능을 제공한다. LLM은 기본 모델이며, 추론 모델은 중간 추론을 더 많이 수행하도록 훈련된 LLM이다. 에이전트는 모델을 호출하고 상태를 업데이트하는 제어 루프 역할을 하며, 코딩 하네스는 소프트웨어 엔지니어링에 특화된 에이전트 하네스이다.

Ahead of AI (Sebastian Raschka)
News·

AI 에이전트의 정의와 기능

AI 에이전트는 환경을 인식하고 그에 따라 행동할 수 있는 존재로 정의된다. AI 에이전트는 다양한 도구에 접근할 수 있으며, 이러한 도구는 에이전트의 행동 범위를 결정한다. 예를 들어, ChatGPT는 웹 검색, Python 코드 실행, 이미지 생성 등의 기능을 가진 에이전트이다. 에이전트의 환경은 사용 사례에 따라 정의되며, 특정 환경에서는 제한된 행동만 가능하다.

Chip Huyen
News중급·

A2A, 에이전트 간 협업을 위한 개방형 프로토콜

A2A(Agent2Agent)는 서로 다른 에이전트(agent)가 상대를 발견하고 인증하며 협업하도록 하는 개방형 프로토콜이다. MCP가 에이전트와 도구를 잇는 연결이라면, A2A는 에이전트와 에이전트를 잇는 연결로 둘이 짝을 이룬다. 처음에 구글이 만들었고 이후 리눅스 재단(Agentic AI Foundation 산하)에 기증해 거버넌스를 중립화했으며, 다수의 대형 조직이 채택했다. 신뢰 모델의 핵심은 암호 서명이 들어간 Agent Card로, 이를 통해 상대 에이전트의 도메인을 검증한다.

Linux Foundation
News중급·

Hermes Agent의 자기개선 스킬 루프, 에이전트가 스스로 절차적 기억을 쌓는다

Nous Research의 Hermes Agent(MIT 오픈소스 자율 에이전트 프레임워크)는 skill_manage 툴로 에이전트가 스스로 스킬을 만들고 고친다. 생성 트리거는 툴 호출 5회 이상의 복잡한 작업을 성공했을 때, 에러에서 동작 경로를 발견했을 때, 사용자가 접근법을 교정했을 때, 비자명한 워크플로를 발견했을 때다. 턴이 끝나면 background self-improvement review가 만들어진 스킬을 다듬으며, skills.write_approval로 승인 게이트를 걸 수 있다. 스킬은 SKILL.md(YAML frontmatter의 name·description과 마크다운 본문)로 저장되고 자동으로 슬래시 명령으로 라우팅된다. 이 포맷은 오픈 표준 agentskills.io와 호환된다.

Hermes (Nous Research)
Community실험 리포트·

사내 위키 MCP 서버를 반나절에 띄웠는데, 정작 코드는 가장 쉬운 부분이었다

MCP 서버 구현 자체는 tool 3개로 끝난다. 실제 난관은 tool description 설계와 stdout 오염이었다.

정유나 @yuna_ai
News중급·

Hermes: 같은 이름의 두 갈래, 하이브리드 추론 LLM과 자율 에이전트 프레임워크

AI 분야에서 Hermes라는 이름은 Nous Research가 만든 서로 다른 둘을 가리킨다. 하나는 오픈웨이트 LLM 패밀리인 Hermes 4로, <think> 블록으로 명시적 추론을 드러내면서 같은 턴 안에서 함수·도구 호출까지 수행하는 하이브리드 추론을 특징으로 한다. 70B는 Llama-3.1-70B를 기반으로 하며 더 큰 405B 변종이 있고, 전 모델이 오픈웨이트로 공개됐다. 다른 하나는 Hermes Agent로, 모델 시리즈와는 별개인 오픈소스 자율 에이전트 프레임워크다. 최신 릴리스 v0.17.0 'The Reach Release'가 2026년 6월 19일에 나왔고, GitHub 스타가 빠르게 늘고 있다.

Hermes Agent (GitHub)
News실전·

Claude Agent SDK 별도 크레딧 분리, OpenAI Agent Builder는 종료 예고

에이전트 프레임워크 시장이 기능 경쟁을 넘어 과금·라인업 정리 국면으로 들어섰다. Anthropic은 6월 15일부터 Claude Agent SDK 사용량을 구독 요금과 분리된 별도 월간 'Agent SDK 크레딧'에서 차감하기 시작한다 — 구독으로 무한정 에이전트를 돌리던 패턴에 명시적 비용 경계가 생기는 변화다. OpenAI는 6월 3일 Agent Builder와 Evals 제품의 단계적 종료를 발표했고, 두 제품은 11월 30일부터 플랫폼에서 제공되지 않는다(앞서 4월 Agents SDK에 네이티브 샌드박스 실행과 모델 네이티브 하니스를 추가한 흐름의 후속). 한편 프레임워크 진영은 메이저 버전이 안착했다. LangChain 1.0·LangGraph 1.0(2025년 말 GA)은 각각 표준 툴콜링 에이전트 빌드와 장시간·상태 지속(durable state) 오케스트레이션으로 역할이 갈렸고, Microsoft Agent Framework 1.0은 4월 3일 GA, Google ADK도 Java·Go용 1.0을 출시했다.

OpenAI / TechCrunch
News고급·

MCP 차기 명세 릴리스 후보 공개, 스테이트리스 코어·Tasks·MCP Apps로 최대 개편

Model Context Protocol 차기 명세의 릴리스 후보(RC)가 공개됐고, 최종본은 7월 28일 확정된다. 프로토콜 출범 이래 최대 규모 개정이며 호환성을 깨는 변경(breaking changes)을 포함한다. 핵심은 다섯 가지다. ① 일반 HTTP 인프라에서 확장 가능한 '스테이트리스 코어' — 세션 상태 의존을 걷어내 로드밸런서·서버리스 환경에서 스케일이 쉬워진다. ② Extensions 프레임워크 — 코어를 얇게 유지하고 기능을 확장으로 분리. ③ Tasks 확장 — 장시간 실행 작업을 표준화. ④ MCP Apps — 서버가 렌더링하는 UI를 클라이언트에 노출. ⑤ OAuth·OpenID Connect 배포에 더 부합하는 인가(authorization) 하드닝과 공식 deprecation 정책. RC 공개 후 약 10주의 검증 윈도가 주어지며, Tier 1 SDK는 이 기간 내 지원을 출시할 것으로 예상된다. SDK 메인테이너와 클라이언트 구현자가 실제 워크로드로 변경을 검증하는 단계다.

Model Context Protocol Blog
Community튜토리얼·

에이전트한테 코드를 맡길 때 핵심은 생성이 아니라 검수 루프 (PR 자동리뷰 게이트 셋업기)

에이전트가 짠 코드는 빌드 green인데 런타임에서 터지는 부류가 문제다. 브랜치 PR + 자동리뷰 + 사람 머지 게이트가 실제로 잡은 버그들

송미래 @designer_ai
News실전·

Claude Agent SDK로 내 프로세스 안에서 에이전트 돌리는 선택 기준

Claude Agent SDK는 Claude Code를 구동하는 바로 그 기계를 라이브러리로 떼어낸 것으로, 2025년 9월 Claude Code SDK에서 이름이 바뀌었다. Python·TypeScript로 제공되며 CLI 바이너리, 서브에이전트, 세션, MCP 지원, 호스팅 실행 모델을 번들로 갖는다. 핵심 철학은 '에이전트에게 컴퓨터를 줘라' — 사람처럼 셸·파일시스템·웹을 그대로 쓰게 한다. 2026년 실무의 핵심은 실행 위치 선택이다. 도구 루프를 직접 소유하고 싶으면 Messages API, 루프와 샌드박스까지 Anthropic이 호스팅하길 원하면 Managed Agents, 에이전트를 자사 프로세스·파일시스템·서비스 안에서 돌리고 싶으면 Agent SDK를 쓴다. 설치는 pip install claude-agent-sdk 또는 npm install @anthropic-ai/claude-agent-sdk이며 인증은 ANTHROPIC_API_KEY(또는 Bedrock·Vertex·Azure 라우팅)다. 2026년 6월 15일부터는 인터랙티브 Claude 사용량과 분리된 'Agent SDK 크레딧' 풀이 도입돼, 구독 사용자(Pro·Max·Team·Enterprise)는 인터랙티브 쿼터를 소진하지 않고 SDK 워크로드를 돌릴 월 할당량을 받는다.

HatchWorks
News초급·

MCP, Linux Foundation 이관과 1만 서버 생태계로 사실상 표준 굳혀

Model Context Protocol이 AI를 실제 도구·데이터에 연결하는 사실상의 표준으로 자리 잡았다. OpenAI, Google DeepMind, Microsoft를 포함한 주요 벤더와 수천 개 개발팀이 채택했고, Python·TypeScript SDK는 월 약 9,700만 다운로드를 기록한다. 공식 레지스트리에는 2026년 5월 24일 기준 9,652개 서버 레코드와 28,959개 서버/버전 레코드가 인덱싱돼 있고, GitHub에는 mcp-server 토픽 저장소가 15,926개다. 거버넌스 측면에서는 2025년 12월 Anthropic이 MCP를 Linux Foundation 산하 Agentic AI Foundation에 기증해 벤더 중립·커뮤니티 거버넌스 표준이 됐다. Stacklok의 2026 리포트에 따르면 조사 대상 소프트웨어 조직의 41%가 MCP 서버를 제한적 또는 광범위 프로덕션에 올렸고, Pinterest는 월 약 66,000회 호출·844명 활성 사용자로 월 7,000 엔지니어링 시간을 절감한 프로덕션 사례를 공개했다. 2026 로드맵은 엔터프라이즈 인증(OAuth 2.1·IdP 연동), 에이전트 간 도구 호출(A2A), 보안 등급을 갖춘 검증 레지스트리 세 축에 집중한다.

ChatForest
News중급·

MCP 2026-07-28 사양 RC: 프로토콜이 'stateless'로 전환된다

Model Context Protocol(MCP)의 다음 사양 릴리스 후보가 2026-05-21 잠금됐고, 최종본은 2026-07-28 공개 예정이다. 핵심 변화는 프로토콜 코어가 stateless(무상태)로 바뀐다는 점이다. 기존의 initialize 핸드셰이크와 Mcp-Session-Id 헤더가 사라져서, 어떤 MCP 요청이든 아무 서버 인스턴스로나 도달할 수 있다. 이전에 수평 확장에 필요하던 sticky 라우팅과 공유 세션 저장소가 더는 필요 없어진다. 이와 함께 Extensions 프레임워크(역DNS 식별자·독립 버전), Tasks의 확장 전환(tasks/get·update·cancel), 샌드박스 iframe에 렌더되는 MCP Apps(대화형 HTML UI), 그리고 OAuth 2.0·OpenID Connect 정렬을 강화하는 인가 하드닝(6개 SEP)이 들어간다. RC 기간을 10주로 잡아 각 SDK가 검증할 시간을 줬다.

Model Context Protocol Blog
Community의견·

멀티에이전트를 6개월 굴려보니, 효과 본 건 역할을 쪼갠 게 아니라 검수를 분리한 것이었다

에이전트 수를 8개에서 25개까지 늘려도 품질은 안 올랐고, 실제로 효과 본 건 Maker-Critic 분리와 자기검수 차단뿐이었습니다

서동현 @bigdata_seo
News중급·

ClawHub 랭킹 조작과 메신저 경유 프롬프트 인젝션

OpenClaw의 보안에는 여러 우려가 제기됐고, Microsoft 보안 블로그는 OpenClaw를 "지속 자격증명을 가진 신뢰불가 코드 실행"으로 규정하며 일반 워크스테이션에서 격리 없이 쓰기엔 부적합하다고 봤다. 스킬 레지스트리 ClawHub에서는 인증·레이트리밋이 없는 public mutation으로 다운로드 수를 조작할 수 있는 문제가 보고됐고(Silverfort 연구), PoC 악성 스킬이 수 분 내 카테고리 상위에 올랐다가 공개 후 빠르게 수정됐다. 메신저 경로에서는 메시지 객체의 연락처 이름·vCard·위치 라벨 같은 필드에 심은 지시가 LLM 프롬프트로 직렬화돼 보이지 않게 코드를 실행시키는 프롬프트 인젝션이 확인됐다(Imperva 연구, v2026.4.23에서 수정). 기본 동작이 단일 운영자 풀 OS 권한에 exec 자동 허용이라는 점이 이런 위협의 영향 범위를 키운다.

OpenClaw (GitHub)
News중급·

OpenClaw, 셀프호스팅 퍼스널 AI 에이전트 게이트웨이

OpenClaw는 사용자가 자기 기기나 VPS에서 직접 돌리는 셀프호스팅 퍼스널 AI 에이전트 게이트웨이(gateway)다. 단일 Gateway 프로세스가 Discord·Slack·Telegram·WhatsApp·iMessage·Signal 같은 메신저 앱과 LLM 기반 에이전트를 연결한다. 텍스트 응답에 그치지 않고 셸 명령 실행, 파일 읽기·쓰기·편집, GitHub PR 생성 같은 실제 행동(agentic)을 수행한다. 클라우드 의존 없이 로컬 우선과 데이터 주권을 포지셔닝으로 내세운다. PSPDFKit 창업자로 알려진 Peter Steinberger와 커뮤니티가 만들었고, 미니멀 코딩 에이전트 Pi 위에 구축됐으며 MIT 라이선스로 Node.js(npm) 기반으로 배포된다.

OpenClaw (GitHub)
News중급·

Anthropic ToS 명확화: 구독 OAuth 토큰의 타 도구 전용 금지

2026년 2월 20일 Anthropic이 약관을 명확히 하면서 Claude Free·Pro·Max 구독의 OAuth 토큰을 다른 제품이나 툴에 끌어다 쓰는 것을 금지한다고 정리했다(The Register 보도). 이는 경제성과 약관에 관한 사안이며, 앞서 불거진 트레이드마크 압박과는 별개다. OpenClaw 자체는 모델 무관이라 Anthropic·OpenAI·MiniMax·OpenRouter 등 어떤 프로바이더든 쓸 수 있다. Claude를 연동하려면 ANTHROPIC_API_KEY와 anthropic/ 프리픽스가 붙은 모델 ID를 설정에 넣는 방식이 정석이다. 즉 구독 세션 토큰을 우회로 쓰는 대신, 정식 API 키 경로로 붙이는 게 약관에 맞다.

OpenClaw (GitHub)
News중급·

제작자의 OpenAI 합류와 OpenClaw 재단 이관

제작자 Peter Steinberger가 2026년 2월 14일 블로그에서 본인의 OpenAI 합류와 OpenClaw의 재단(foundation) 이관을 함께 발표했다. 개인 주도로 시작한 프로젝트의 운영 주체가 개인에서 재단 구조로 옮겨가는 전환점이다. 이 발표는 빠른 바이럴 직후에 나와 프로젝트의 지속 가능성과 거버넌스에 관심이 모였다. 한편 제작자 개인의 Claude 계정이 "의심스러운 활동"으로 일시 정지됐다가 수 시간 내 복구된 별개의 사건도 2026년 4월 10일에 있었다. 이 계정 정지 건은 재단 이관과 직접 관련이 없는 일시적 사안이다.

OpenClaw (GitHub)