Category
AI 에이전트
AI 에이전트는 목표를 받아 스스로 계획을 세우고 도구를 호출해 작업을 끝까지 수행하는 시스템이다. 단발 응답형 챗봇과 달리 다단계 추론·실행·재시도 루프를 돈다. 코드 작성, 리서치, 운영 자동화에 실제 투입되며 권한과 검증 설계가 성패를 가른다.
Amazon Bedrock AgentCore의 새로운 기능: 지식 확장 및 지속적 학습 지원
Amazon Bedrock AgentCore는 에이전트가 조직, 웹, 유료 지식에 연결될 수 있도록 지원하는 새로운 기능을 도입했다. 이를 통해 에이전트는 SharePoint, Google Drive, Confluence 등 다양한 내부 데이터 소스에 접근할 수 있으며, 웹 검색 기능을 통해 최신 정보를 확보할 수 있다. 또한, AgentCore는 데이터 검색 및 재조정 모델을 관리하여 팀이 에이전트를 구축하는 데 집중할 수 있도록 한다.
CEO-Bench: 에이전트의 장기적 과제 평가
CEO-Bench는 언어 모델 에이전트의 장기적 과제를 평가하기 위해 500일 동안 스타트업 운영을 시뮬레이션한다. 에이전트는 가격 책정, 마케팅, 예산 관리 등 다양한 측면을 관리하며, 인간 CEO와 동일한 환경에서 도전 과제를 직면한다. 성공적인 운영을 위해서는 노이즈가 있는 비즈니스 데이터베이스를 분석하고, 전략을 수립하며, 여러 결정을 조율해야 한다. Claude Opus 4.8과 GPT-5.5만이 초기 자본 100만 달러를 초과했지만, 지속적인 이익을 내지 못했다. CEO-Bench는 지속적이고 적응적인 진전을 이끌기 위한 지능을 측정하는 첫걸음이다.
코딩 에이전트의 구성 요소와 작동 방식
이 글에서는 코딩 에이전트와 에이전트 하네스의 전체 설계에 대해 설명한다. 코딩 에이전트는 LLM을 애플리케이션 레이어로 감싸는 도구로, 코드 작업에 더 편리하고 성능이 뛰어난 기능을 제공한다. LLM은 기본 모델이며, 추론 모델은 중간 추론을 더 많이 수행하도록 훈련된 LLM이다. 에이전트는 모델을 호출하고 상태를 업데이트하는 제어 루프 역할을 하며, 코딩 하네스는 소프트웨어 엔지니어링에 특화된 에이전트 하네스이다.
AI 에이전트의 정의와 기능
AI 에이전트는 환경을 인식하고 그에 따라 행동할 수 있는 존재로 정의된다. AI 에이전트는 다양한 도구에 접근할 수 있으며, 이러한 도구는 에이전트의 행동 범위를 결정한다. 예를 들어, ChatGPT는 웹 검색, Python 코드 실행, 이미지 생성 등의 기능을 가진 에이전트이다. 에이전트의 환경은 사용 사례에 따라 정의되며, 특정 환경에서는 제한된 행동만 가능하다.
A2A, 에이전트 간 협업을 위한 개방형 프로토콜
A2A(Agent2Agent)는 서로 다른 에이전트(agent)가 상대를 발견하고 인증하며 협업하도록 하는 개방형 프로토콜이다. MCP가 에이전트와 도구를 잇는 연결이라면, A2A는 에이전트와 에이전트를 잇는 연결로 둘이 짝을 이룬다. 처음에 구글이 만들었고 이후 리눅스 재단(Agentic AI Foundation 산하)에 기증해 거버넌스를 중립화했으며, 다수의 대형 조직이 채택했다. 신뢰 모델의 핵심은 암호 서명이 들어간 Agent Card로, 이를 통해 상대 에이전트의 도메인을 검증한다.
Hermes Agent의 자기개선 스킬 루프, 에이전트가 스스로 절차적 기억을 쌓는다
Nous Research의 Hermes Agent(MIT 오픈소스 자율 에이전트 프레임워크)는 skill_manage 툴로 에이전트가 스스로 스킬을 만들고 고친다. 생성 트리거는 툴 호출 5회 이상의 복잡한 작업을 성공했을 때, 에러에서 동작 경로를 발견했을 때, 사용자가 접근법을 교정했을 때, 비자명한 워크플로를 발견했을 때다. 턴이 끝나면 background self-improvement review가 만들어진 스킬을 다듬으며, skills.write_approval로 승인 게이트를 걸 수 있다. 스킬은 SKILL.md(YAML frontmatter의 name·description과 마크다운 본문)로 저장되고 자동으로 슬래시 명령으로 라우팅된다. 이 포맷은 오픈 표준 agentskills.io와 호환된다.
사내 위키 MCP 서버를 반나절에 띄웠는데, 정작 코드는 가장 쉬운 부분이었다
MCP 서버 구현 자체는 tool 3개로 끝난다. 실제 난관은 tool description 설계와 stdout 오염이었다.
Hermes: 같은 이름의 두 갈래, 하이브리드 추론 LLM과 자율 에이전트 프레임워크
AI 분야에서 Hermes라는 이름은 Nous Research가 만든 서로 다른 둘을 가리킨다. 하나는 오픈웨이트 LLM 패밀리인 Hermes 4로, <think> 블록으로 명시적 추론을 드러내면서 같은 턴 안에서 함수·도구 호출까지 수행하는 하이브리드 추론을 특징으로 한다. 70B는 Llama-3.1-70B를 기반으로 하며 더 큰 405B 변종이 있고, 전 모델이 오픈웨이트로 공개됐다. 다른 하나는 Hermes Agent로, 모델 시리즈와는 별개인 오픈소스 자율 에이전트 프레임워크다. 최신 릴리스 v0.17.0 'The Reach Release'가 2026년 6월 19일에 나왔고, GitHub 스타가 빠르게 늘고 있다.
Claude Agent SDK 별도 크레딧 분리, OpenAI Agent Builder는 종료 예고
에이전트 프레임워크 시장이 기능 경쟁을 넘어 과금·라인업 정리 국면으로 들어섰다. Anthropic은 6월 15일부터 Claude Agent SDK 사용량을 구독 요금과 분리된 별도 월간 'Agent SDK 크레딧'에서 차감하기 시작한다 — 구독으로 무한정 에이전트를 돌리던 패턴에 명시적 비용 경계가 생기는 변화다. OpenAI는 6월 3일 Agent Builder와 Evals 제품의 단계적 종료를 발표했고, 두 제품은 11월 30일부터 플랫폼에서 제공되지 않는다(앞서 4월 Agents SDK에 네이티브 샌드박스 실행과 모델 네이티브 하니스를 추가한 흐름의 후속). 한편 프레임워크 진영은 메이저 버전이 안착했다. LangChain 1.0·LangGraph 1.0(2025년 말 GA)은 각각 표준 툴콜링 에이전트 빌드와 장시간·상태 지속(durable state) 오케스트레이션으로 역할이 갈렸고, Microsoft Agent Framework 1.0은 4월 3일 GA, Google ADK도 Java·Go용 1.0을 출시했다.
MCP 차기 명세 릴리스 후보 공개, 스테이트리스 코어·Tasks·MCP Apps로 최대 개편
Model Context Protocol 차기 명세의 릴리스 후보(RC)가 공개됐고, 최종본은 7월 28일 확정된다. 프로토콜 출범 이래 최대 규모 개정이며 호환성을 깨는 변경(breaking changes)을 포함한다. 핵심은 다섯 가지다. ① 일반 HTTP 인프라에서 확장 가능한 '스테이트리스 코어' — 세션 상태 의존을 걷어내 로드밸런서·서버리스 환경에서 스케일이 쉬워진다. ② Extensions 프레임워크 — 코어를 얇게 유지하고 기능을 확장으로 분리. ③ Tasks 확장 — 장시간 실행 작업을 표준화. ④ MCP Apps — 서버가 렌더링하는 UI를 클라이언트에 노출. ⑤ OAuth·OpenID Connect 배포에 더 부합하는 인가(authorization) 하드닝과 공식 deprecation 정책. RC 공개 후 약 10주의 검증 윈도가 주어지며, Tier 1 SDK는 이 기간 내 지원을 출시할 것으로 예상된다. SDK 메인테이너와 클라이언트 구현자가 실제 워크로드로 변경을 검증하는 단계다.
에이전트한테 코드를 맡길 때 핵심은 생성이 아니라 검수 루프 (PR 자동리뷰 게이트 셋업기)
에이전트가 짠 코드는 빌드 green인데 런타임에서 터지는 부류가 문제다. 브랜치 PR + 자동리뷰 + 사람 머지 게이트가 실제로 잡은 버그들
Claude Agent SDK로 내 프로세스 안에서 에이전트 돌리는 선택 기준
Claude Agent SDK는 Claude Code를 구동하는 바로 그 기계를 라이브러리로 떼어낸 것으로, 2025년 9월 Claude Code SDK에서 이름이 바뀌었다. Python·TypeScript로 제공되며 CLI 바이너리, 서브에이전트, 세션, MCP 지원, 호스팅 실행 모델을 번들로 갖는다. 핵심 철학은 '에이전트에게 컴퓨터를 줘라' — 사람처럼 셸·파일시스템·웹을 그대로 쓰게 한다. 2026년 실무의 핵심은 실행 위치 선택이다. 도구 루프를 직접 소유하고 싶으면 Messages API, 루프와 샌드박스까지 Anthropic이 호스팅하길 원하면 Managed Agents, 에이전트를 자사 프로세스·파일시스템·서비스 안에서 돌리고 싶으면 Agent SDK를 쓴다. 설치는 pip install claude-agent-sdk 또는 npm install @anthropic-ai/claude-agent-sdk이며 인증은 ANTHROPIC_API_KEY(또는 Bedrock·Vertex·Azure 라우팅)다. 2026년 6월 15일부터는 인터랙티브 Claude 사용량과 분리된 'Agent SDK 크레딧' 풀이 도입돼, 구독 사용자(Pro·Max·Team·Enterprise)는 인터랙티브 쿼터를 소진하지 않고 SDK 워크로드를 돌릴 월 할당량을 받는다.
MCP, Linux Foundation 이관과 1만 서버 생태계로 사실상 표준 굳혀
Model Context Protocol이 AI를 실제 도구·데이터에 연결하는 사실상의 표준으로 자리 잡았다. OpenAI, Google DeepMind, Microsoft를 포함한 주요 벤더와 수천 개 개발팀이 채택했고, Python·TypeScript SDK는 월 약 9,700만 다운로드를 기록한다. 공식 레지스트리에는 2026년 5월 24일 기준 9,652개 서버 레코드와 28,959개 서버/버전 레코드가 인덱싱돼 있고, GitHub에는 mcp-server 토픽 저장소가 15,926개다. 거버넌스 측면에서는 2025년 12월 Anthropic이 MCP를 Linux Foundation 산하 Agentic AI Foundation에 기증해 벤더 중립·커뮤니티 거버넌스 표준이 됐다. Stacklok의 2026 리포트에 따르면 조사 대상 소프트웨어 조직의 41%가 MCP 서버를 제한적 또는 광범위 프로덕션에 올렸고, Pinterest는 월 약 66,000회 호출·844명 활성 사용자로 월 7,000 엔지니어링 시간을 절감한 프로덕션 사례를 공개했다. 2026 로드맵은 엔터프라이즈 인증(OAuth 2.1·IdP 연동), 에이전트 간 도구 호출(A2A), 보안 등급을 갖춘 검증 레지스트리 세 축에 집중한다.
MCP 2026-07-28 사양 RC: 프로토콜이 'stateless'로 전환된다
Model Context Protocol(MCP)의 다음 사양 릴리스 후보가 2026-05-21 잠금됐고, 최종본은 2026-07-28 공개 예정이다. 핵심 변화는 프로토콜 코어가 stateless(무상태)로 바뀐다는 점이다. 기존의 initialize 핸드셰이크와 Mcp-Session-Id 헤더가 사라져서, 어떤 MCP 요청이든 아무 서버 인스턴스로나 도달할 수 있다. 이전에 수평 확장에 필요하던 sticky 라우팅과 공유 세션 저장소가 더는 필요 없어진다. 이와 함께 Extensions 프레임워크(역DNS 식별자·독립 버전), Tasks의 확장 전환(tasks/get·update·cancel), 샌드박스 iframe에 렌더되는 MCP Apps(대화형 HTML UI), 그리고 OAuth 2.0·OpenID Connect 정렬을 강화하는 인가 하드닝(6개 SEP)이 들어간다. RC 기간을 10주로 잡아 각 SDK가 검증할 시간을 줬다.
멀티에이전트를 6개월 굴려보니, 효과 본 건 역할을 쪼갠 게 아니라 검수를 분리한 것이었다
에이전트 수를 8개에서 25개까지 늘려도 품질은 안 올랐고, 실제로 효과 본 건 Maker-Critic 분리와 자기검수 차단뿐이었습니다
ClawHub 랭킹 조작과 메신저 경유 프롬프트 인젝션
OpenClaw의 보안에는 여러 우려가 제기됐고, Microsoft 보안 블로그는 OpenClaw를 "지속 자격증명을 가진 신뢰불가 코드 실행"으로 규정하며 일반 워크스테이션에서 격리 없이 쓰기엔 부적합하다고 봤다. 스킬 레지스트리 ClawHub에서는 인증·레이트리밋이 없는 public mutation으로 다운로드 수를 조작할 수 있는 문제가 보고됐고(Silverfort 연구), PoC 악성 스킬이 수 분 내 카테고리 상위에 올랐다가 공개 후 빠르게 수정됐다. 메신저 경로에서는 메시지 객체의 연락처 이름·vCard·위치 라벨 같은 필드에 심은 지시가 LLM 프롬프트로 직렬화돼 보이지 않게 코드를 실행시키는 프롬프트 인젝션이 확인됐다(Imperva 연구, v2026.4.23에서 수정). 기본 동작이 단일 운영자 풀 OS 권한에 exec 자동 허용이라는 점이 이런 위협의 영향 범위를 키운다.
OpenClaw, 셀프호스팅 퍼스널 AI 에이전트 게이트웨이
OpenClaw는 사용자가 자기 기기나 VPS에서 직접 돌리는 셀프호스팅 퍼스널 AI 에이전트 게이트웨이(gateway)다. 단일 Gateway 프로세스가 Discord·Slack·Telegram·WhatsApp·iMessage·Signal 같은 메신저 앱과 LLM 기반 에이전트를 연결한다. 텍스트 응답에 그치지 않고 셸 명령 실행, 파일 읽기·쓰기·편집, GitHub PR 생성 같은 실제 행동(agentic)을 수행한다. 클라우드 의존 없이 로컬 우선과 데이터 주권을 포지셔닝으로 내세운다. PSPDFKit 창업자로 알려진 Peter Steinberger와 커뮤니티가 만들었고, 미니멀 코딩 에이전트 Pi 위에 구축됐으며 MIT 라이선스로 Node.js(npm) 기반으로 배포된다.
Anthropic ToS 명확화: 구독 OAuth 토큰의 타 도구 전용 금지
2026년 2월 20일 Anthropic이 약관을 명확히 하면서 Claude Free·Pro·Max 구독의 OAuth 토큰을 다른 제품이나 툴에 끌어다 쓰는 것을 금지한다고 정리했다(The Register 보도). 이는 경제성과 약관에 관한 사안이며, 앞서 불거진 트레이드마크 압박과는 별개다. OpenClaw 자체는 모델 무관이라 Anthropic·OpenAI·MiniMax·OpenRouter 등 어떤 프로바이더든 쓸 수 있다. Claude를 연동하려면 ANTHROPIC_API_KEY와 anthropic/ 프리픽스가 붙은 모델 ID를 설정에 넣는 방식이 정석이다. 즉 구독 세션 토큰을 우회로 쓰는 대신, 정식 API 키 경로로 붙이는 게 약관에 맞다.
제작자의 OpenAI 합류와 OpenClaw 재단 이관
제작자 Peter Steinberger가 2026년 2월 14일 블로그에서 본인의 OpenAI 합류와 OpenClaw의 재단(foundation) 이관을 함께 발표했다. 개인 주도로 시작한 프로젝트의 운영 주체가 개인에서 재단 구조로 옮겨가는 전환점이다. 이 발표는 빠른 바이럴 직후에 나와 프로젝트의 지속 가능성과 거버넌스에 관심이 모였다. 한편 제작자 개인의 Claude 계정이 "의심스러운 활동"으로 일시 정지됐다가 수 시간 내 복구된 별개의 사건도 2026년 4월 10일에 있었다. 이 계정 정지 건은 재단 이관과 직접 관련이 없는 일시적 사안이다.
Make 시나리오 cron을 정각에 박으면 그날 슬롯을 놓치는 이유 (date:less 경계)
Make에서 19시 정각 cron이 그날 19시 발행을 매번 건너뛰던 원인은 date:less 게이트의 경계 비교였다
OpenClaw: 개명 직후 빠르게 번진 셀프호스팅 메신저 비서
OpenClaw는 자기 기기나 VPS에서 직접 돌리는 셀프호스팅 개인 AI 어시스턴트 게이트웨이(gateway)다. 코딩 특화 도구가 아니라 WhatsApp·Telegram·Slack·Signal·iMessage 등 이미 쓰는 메신저로 응답하는 범용 비서이며, 약 23개 메신저를 지원한다. 오스트리아 개발자 Peter Steinberger가 만들었고 마스코트는 우주 바닷가재 Molty, MIT 라이선스로 공개된다. 전신 어시스턴트에서 여러 차례 개명을 거쳐 2026년 1월 말 OpenClaw(Open=오픈소스, Claw=바닷가재)로 최종 개명했다. 그 직전 단계인 Moltbot 개명(2026-01-27)은 Claude/"Clawd" 유사성과 바닷가재 마스코트를 문제 삼은 Anthropic의 트레이드마크 항의가 원인이었고, 최종 개명 발표 후 매우 빠르게 바이럴을 탔다.
[상록] AI 에이전트 메모리 입문: 프로토타입과 프로덕션을 가르는 한 가지
LLM은 기본적으로 stateless다 — 매 호출이 백지에서 시작하므로, 세션을 넘어 맥락을 잇지 못하면 에이전트는 같은 실수를 반복한다. 2026년 실무에서 프로토타입과 프로덕션을 가르는 건 모델이 아니라 '기억하느냐'다. 핵심은 컨텍스트 엔지니어링 — 프롬프트뿐 아니라 메모리·도구·검색·상태까지 정보 환경 전체를 설계하는 것이다. 메모리는 단일 세션 안에서만 존재하는 in-context 메모리와, 트리거·날짜·주를 넘겨 살아남는 외부 메모리(DB·CRM·데이터 스토어)로 나뉜다. 좋은 메모리 페이로드는 작고, 타입이 명확하며, 비즈니스 키에 묶인다 — 고객 ID·활성 케이스 ID·현재 상태·마지막 의미 있는 이벤트·다음 결정에 필요한 최소 맥락만 저장한다. 검색·아카이브용 벡터 저장소는 pgvector로 시작해 지연이 문제될 때 Qdrant·Pinecone 등으로 갈아타는 식이 현실적이다.
Hermes 4.3 공개, 36B 분산학습 모델이 70B에 근접한다
Nous Research가 2025년 12월 3일 Hermes 4.3을 공개했다. 베이스는 ByteDance의 Seed-OSS-36B-Base이며, 36B 규모로 기존 Hermesundefined70B에 근접하거나 일부 지표를 넘는다. 학습은 Psyche 네트워크의 분산학습으로 이뤄진 프로덕션 분산학습 모델이다. Hermes 4(2025년 8월, 405B·70B·14B 패밀리)와는 별개 라인으로 표기된다.
Hermesundefinedtool-use 포맷, XML 태그로 함수 호출과 추론을 분리한다
Hermesundefined모델은 tool-use를 XML 태그 포맷으로 표현한다. 시스템 프롬프트에서 JSON function 스키마를 <tools>...</tools>로 선언하면, 모델은 <tool_call>{...}</tool_call>로 호출하고 결과는 <tool_response>로 피드백한다. 하이브리드 추론은 <think>...</think> 세그먼트로 사고를 방출하며 챗 템플릿의 thinking=True나 시스템 프롬프트로 토글한다. 서빙 시 vLLM은 --tool-call-parser hermes를, SGLang은 qwen25 파서를 쓴다. 405B와 70B는 Meta-Llama-3.1 기반(라이선스 llama3), 14B는 Qwen3-14B 기반(apache-2.0)이며 권장 샘플링은 temperature 0.6, top_p 0.95, top_k 20이다.