News
AI 뉴스
매일 수집·정리하는 전세계 AI 소식을 최신순으로
Gemini 3 시리즈, thinking_level 파라미터와 매니지드 에이전트 도입
Google의 Gemini 3 계열이 2026년 들어 빠르게 확장됐다. 2월 19일 Gemini 3.1 Pro Preview, 3월 3일 Gemini 3.1 Flash-Lite Preview가 나왔고, 5월 19일에는 에이전트·코딩에서 지속적인 프런티어 성능을 노린 Gemini 3.5 Flash가 정식(GA)으로 공개됐다. 개발자 입장에서 핵심은 두 가지다. 첫째, Gemini 3부터 도입된 thinking_level 파라미터로 응답 전 모델이 얼마나 깊게 추론할지 상한을 제어할 수 있다. 둘째, Gemini API의 Managed Agents가 퍼블릭 프리뷰로 풀려, Google이 호스팅하는 격리된 리눅스 샌드박스에서 상태를 유지하는 자율 에이전트를 만들고 배포할 수 있게 됐다. 추론 깊이 제어는 비용·지연과 직결되므로 워크로드별로 조정하는 것이 권장된다.
추론 깊이를 파라미터로 제어하는 패턴이 주요 제공사에 공통으로 자리 잡아, 같은 작업도 비용·품질 트레이드오프를 코드로 직접 조절하는 시대가 됐다.
Hands-On Large Language Models 책 출간
'Hands-On Large Language Models'가 LLM-book.com에서 출간되었으며, Amazon과 O'Reilly에서 구매할 수 있다. 이 책은 약 425페이지로 구성되어 있으며, 300개의 원본 그림이 포함되어 있다. 책은 세 부분으로 나뉘어 있으며, 첫 번째 부분에서는 대형 언어 모델의 작동 방식을 설명하고, 두 번째 부분은 다양한 사용 사례에 초점을 맞추며, 세 번째 부분은 모델을 미세 조정하려는 고급 사용자들을 위한 내용이다. 책의 코드 예제는 GitHub에서 확인할 수 있다.
n8n 네이티브 MCP 노드: 워크플로를 에이전트의 도구로 노출
오픈소스 워크플로 자동화 도구 n8n이 네이티브 Model Context Protocol 지원을 더했다. 새로 추가된 MCP Server Trigger와 MCP Client Tool 두 노드가 핵심이다. MCP Server Trigger로 임의의 n8n 워크플로를 하나의 도구로 노출하면 Claude나 GPT 계열 모델이 그 워크플로를 자율적으로 호출할 수 있고, MCP Client Tool로는 n8n 안에서 외부 MCP 서버의 도구를 끌어다 쓸 수 있다. AI Agent 노드는 목표를 추론해 어떤 도구를 쓸지 스스로 고르고, 케이스마다 if/else를 일일이 짜지 않아도 분기 결과를 처리한다. 단순·고빈도 쿼리는 경량 모델로, 모호한 입력의 복잡 추론은 더 강한 모델로 보내는 티어드 라우팅도 구성할 수 있다. 계약서 생성이나 결제 같은 고위험 지점에서는 사람이 확인할 때까지 워크플로를 멈추는 수동 승인 게이트(human-in-the-loop)를 둔다.
코드를 거의 안 쓰고도 사내 자동화를 LLM 에이전트의 도구로 노출할 수 있어, 운영·기획 인력까지 에이전트 워크플로를 만들 수 있게 자동화의 문턱을 낮춘다.
오픈소스 코딩 LLM, DeepSeek·Qwen·Kimi가 에이전틱 코딩서 프런티어 추격
2026년 들어 오픈웨이트 코딩 모델이 폐쇄형 프런티어 모델과의 격차를 빠르게 좁히고 있다. DeepSeek-V4(Pro/Flash, 1M 컨텍스트·MIT 라이선스), Qwen3.6 계열의 오픈웨이트 공개, Kimi K2.6, GLM-5.1 등이 멀티스텝 과제 완수, 도구 호출 정확도, 복구 가능한 실패 처리 같은 에이전틱 코딩 지표에서 의미 있는 성과를 보였다. 여러 서드파티 벤치마크(SWE-bench 계열·LiveBench 스냅샷)에서 상위 오픈모델 간 점수 차가 0.2~수 점 수준으로 좁혀졌다는 보고도 나온다. 단, 이런 수치는 측정 시점·하니스·프롬프트에 민감하므로 자사 코드베이스에서 직접 재현 평가하는 것이 필수다. 한국 개발자에게 핵심은 MIT·Apache 등 관대한 라이선스 + 1M 컨텍스트 조합이 온프레미스·VPC 자체 호스팅과 보안 민감 코드 작업의 선택지를 넓힌다는 점이다.
데이터 반출이 어려운 한국 기업이 자체 인프라에서 폐쇄형에 근접한 코딩 에이전트를 돌릴 현실적 선택지가 생겼다.
ElevenLabs v3, 오디오 태그로 AI 성우를 연출하는 시대 열어
ElevenLabs의 Eleven v3는 회사에서 가장 표현력이 풍부한 음성 모델로, 텍스트 안에 [whispers], [laughs], [excited] 같은 인라인 오디오 태그를 넣어 감정과 톤을 직접 연출할 수 있다. 70개 이상 언어를 지원하며 오디오북, 영상 내레이션, 드라마틱한 보이스오버처럼 긴 호흡의 콘텐츠에 적합하다. 함께 나온 Voice Design v3는 나이·억양·톤·음질을 텍스트로 묘사하면 수 초 만에 서로 다른 후보 음성 3종을 생성해주며, 사실적 음성용과 게임 NPC·판타지 캐릭터용 두 모드를 제공한다. 회사는 2026년 2월 5억 달러 시리즈 D를 마감해 110억 달러 가치로 평가받았고, TTS 스타트업에서 음성 에이전트·음악·더빙·실시간 전사를 아우르는 풀스택 오디오 레이어로 확장했다. 한국 개발자에게는 다국어 내레이션과 캐릭터 보이스 제작을 코드 한 줄의 태그로 제어할 수 있다는 실질적 이점이 있다.
인라인 오디오 태그로 감정·연기를 프롬프트로 지시할 수 있어, 성우 섭외 없이 다국어 내레이션과 캐릭터 음성을 코드로 제어한다
[설명] C2PA 콘텐츠 자격증명으로 AI 생성물 출처·표시 의무 충족하기
AI 생성물의 출처와 무결성을 증명하는 표준으로 C2PA(콘텐츠 자격증명, Content Credentials)가 사실상의 산업 표준으로 자리잡고 있다. 콘텐츠에 누가·무엇으로·언제 만들고 편집했는지를 변조 탐지가 가능한 매니페스트로 첨부하는 방식이다. 규제 측면에서 미국 NSA·CISA가 2025년 1월 정부·국가안보 시스템에 C2PA 채택을 권고하는 공동 가이드를 냈고, 2026년 8월 효력의 EU AI Act가 요구하는 AI 생성물 투명성 라벨링을 C2PA의 AI assertion 타입이 직접 충족한다. 한국 'AI 기본법'의 생성형 AI 표시 의무와도 맞물린다. 기술적으로는 사양 v2.3(2025년 12월)이 라이브 영상 스트리밍과 비정형 텍스트 매니페스트를 지원해 LLM 출력까지 출처 표기를 확장했다. Google Pixel 카메라 하드웨어(Assurance Level 2), TikTok의 사실적 AI 콘텐츠 라벨링 등 하드웨어·플랫폼 채택도 늘고 있다.
3년 전엔 없던 포워드 디플로이드 엔지니어(FDE), 채용 공고 800% 폭증
고객 현장에 들어가 AI 제품을 실제 업무에 안착시키는 '포워드 디플로이드 엔지니어(FDE)'가 2026년 가장 뜨거운 직군 중 하나로 떠올랐다. 3년 전엔 거의 존재하지 않던 역할인데 2025년 한 해 채용 공고가 800% 넘게 늘었다. 보상도 가파르다. 여러 보상 리포트는 중급 FDE의 총보상을 30만 달러대 후반, 스태프급을 60만 달러대, 프런티어 랩(예: Anthropic, OpenAI) 프린시플급을 100만 달러 이상으로 집계한다. 회사별 편차가 커서 Palantir 중앙값(약 21만 달러)과 프런티어 랩 시니어(78만 달러 이상)의 격차 대부분이 지분(equity)에서 발생한다. 또한 LinkedIn에서 'AI Engineer' 타이틀이 'ML Engineer'를 앞질렀고, 유사 연차 대비 15~25%의 급여 프리미엄이 붙는다. FDE 핵심 역량은 순수 모델링보다 고객 도메인 이해, 통합·배포, 빠른 반복, 신뢰성 확보다. 영어 커뮤니케이션과 고객 대면 능력이 강한 한국 개발자에게는 글로벌 기회의 입구가 될 수 있다.
Claude Agent SDK: 에이전트 루프를 프로그래머블 API로 노출
Claude Agent SDK는 Claude Code를 움직이는 에이전트 루프·툴·컨텍스트 관리를 그대로 자신의 프로세스 안에서 돌릴 수 있게 해주는 라이브러리로, Python과 TypeScript를 지원한다. 과거 Messages API로 직접 손코딩하던 에이전트 루프(파일 읽기, 명령 실행, 웹 검색, 코드 편집 등)를 자동화해, 개발자는 도구를 정의하고 목표만 주면 된다. 핵심 가치는 배포 유연성이다. 자신의 코드에서 호출하거나, 웹훅으로 트리거하거나, 서버리스 플랫폼에 올려 무인 자동화로 돌릴 수 있다. 실제 활용 사례로 LlamaIndex가 LlamaParse와 Agent SDK를 묶어 대출 처리 담당자의 소득 대사(reconciliation) 업무를 자동화한 예가 있다. 단순·고빈도 작업은 가벼운 모델로, 모호한 입력의 복잡 추론은 더 강한 모델로 보내는 티어드 라우팅, 그리고 고위험 단계에 사람 승인을 끼우는 human-in-the-loop 설계와도 자연스럽게 결합된다.
직접 만들던 에이전트 루프를 표준화된 API로 대체해, 한국 개발팀이 사내 자동화를 빠르게 프로덕션화하고 웹훅·서버리스로 무인 운영하기 쉬워진다.
Mastering LLMs: 실무 전문가들이 전하는 LLM 워크숍 및 강의
Mastering LLMs는 25명 이상의 산업 전문가들이 진행하는 워크숍 및 강의로, evals, retrieval-augmented-generation (RAG), fine-tuning 등 다양한 주제를 다룬다. 이 과정은 AI 제품 개발에 관련된 실용적인 주제에 초점을 맞추며, 누구나 무료로 참여할 수 있다. 40시간 이상의 콘텐츠가 제공되며, 각 주제별로 정리된 자료와 요약이 포함되어 있다. 기본적인 LLM에 대한 이해가 필요하며, 개인 프로젝트에 적용해보는 것을 추천한다.
생성 AI 플랫폼 구축의 공통 구성 요소
기업들이 생성 AI 애플리케이션을 배포하는 방식에서 유사성을 발견하였고, 이 글에서는 생성 AI 플랫폼의 공통 구성 요소와 그 기능, 구현 방법을 설명한다. 플랫폼은 간단한 아키텍처에서 시작하여 점차적으로 더 많은 구성 요소를 추가할 수 있으며, 각 단계에서 평가가 필요하다. 초기 단계에서는 모델에 외부 데이터 소스와 도구를 통해 컨텍스트를 강화하고, 시스템과 사용자를 보호하기 위한 가드레일을 추가하며, 복잡한 파이프라인을 지원하기 위해 모델 라우터와 게이트웨이를 추가하는 방식으로 발전한다. 또한, 관찰 가능성과 오케스트레이션은 플랫폼의 필수 요소로 언급된다.
컨텍스트 엔지니어링: 에이전트 시대의 새 핵심 역량 (상록 가이드)
컨텍스트 엔지니어링은 에이전트가 보는 토큰을 '최소한의 고신호(high-signal) 집합'으로 큐레이션하는 작업으로, 프롬프트 엔지니어링과 RAG를 모두 포함하는 상위 개념이다. 컨텍스트 아키텍처는 시스템 컨텍스트, 세션 컨텍스트, 메모리, 산출물(artifact), 온디맨드 검색의 다섯 계층으로 구성된다. 실무 원칙은 분명하다. 관련 청크를 긴 컨텍스트 한가운데 끼워 넣으면 '중간에서 길을 잃는(lost in the middle)' 현상이 생기므로, 50개를 높은 재현율로 검색한 뒤 재순위화(re-ranking)로 상위 5개만 추리는 편이 통째로 던지는 것보다 낫다. 코드 RAG라면 검색된 함수가 호출하는 다른 함수의 시그니처·정의와 인자 타입까지 자동으로 끌어와야 추론 정확도가 오른다. 도구도 마찬가지다. 5개면 되는데 40개를 주면 오히려 추론이 저하되므로, 계획(읽기)·실행(쓰기)·검증 단계별로 도구를 동적으로 제공한다. 토큰 수가 아니라 채움 비율(fill %)로 예산을 잡고 60%를 넘기 전에 선제적으로 압축하라.
에이전트 품질을 좌우하는 건 모델 선택이 아니라 무엇을 컨텍스트에 넣고 빼느냐이며, 이는 모든 LLM 앱에 보편적으로 적용된다.
오픈소스 영상 생성 2026 지형도, Wan·HunyuanVideo가 클로즈드 추격
2026년 오픈소스 영상 생성 모델은 자체 호스팅으로 클로즈드 모델을 추격하는 수준에 올랐다. Alibaba의 Wan 계열이 선두로, MoE(Mixture-of-Experts) 디퓨전 백본을 쓰는 Wan 2.2는 가장 시네마틱한 오픈 모델로 꼽히고, 2026년 4월의 Wan 2.7은 첫/마지막 프레임 제어, 9분할 이미지 입력, 5000자 프롬프트를 지원하며 Wan-Bench 2.0에서 선두를 차지한다. Tencent의 HunyuanVideo 1.5(2025년 11월)는 83억 파라미터로 RTX 4090 한 장에서 최대 75초 영상을 렌더링한다. 이 밖에 Lightricks의 경량 LTX-Video, Genmo의 Mochi 1, 휴먼 중심 SkyReels V1 등이 있다. 한국 개발자에게 중요한 점은 데이터 주권과 비용 통제다. API 종속이나 콘텐츠 정책 제약 없이 온프레미스·GPU 클라우드에서 영상 파이프라인을 직접 운용할 수 있고, 단일 GPU에서 돌아가는 모델이 늘어 진입 장벽도 낮아졌다.
단일 GPU로 돌릴 수 있는 오픈 모델이 늘어, API 종속 없이 데이터 주권과 비용을 통제하며 자체 영상 파이프라인을 구축할 수 있다
LLM의 외부 환각(Extrinsic Hallucination) 문제
대형 언어 모델에서의 환각은 모델이 제공된 맥락이나 세계 지식에 기반하지 않고 허위, 왜곡된, 일관성이 없는 내용을 생성하는 경우를 말한다. 환각은 크게 두 가지 유형으로 나뉜다: 1) 맥락 내 환각(In-context hallucination) - 모델 출력이 맥락 내 소스 내용과 일관해야 함. 2) 외부 환각(Extrinsic hallucination) - 모델 출력이 사전 훈련 데이터셋에 기반해야 함. 외부 환각을 방지하기 위해 LLM은 사실 기반이어야 하며, 알지 못하는 사실에 대해서는 이를 인정해야 한다.
외부 환각 문제를 해결하는 것은 LLM의 신뢰성을 높이고, 실제 응용에서의 정확성을 보장하는 데 중요하다.
DLSU 마닐라에서의 강의: 대규모 언어 모델 시대의 필리핀어 NLP 자원
Lj V. Miranda는 필리핀어 NLP 자원에 대한 강의를 진행했다. 그는 7B-70B 파라미터 범위의 대규모 모델과 약 100M 파라미터 범위의 저자원 언어 모델을 비교하며, '장인적' NLP와 '대규모' NLP의 차이를 설명했다. 또한, TLUnified-NER이라는 태그로그 NER 데이터셋을 구축했으며, 이는 공개 접근 가능하고 고품질이며 CoNLL 표준을 따른다. 이 데이터셋은 기존의 WikiANN 데이터셋보다 더 나은 성능을 보였다.
Mistral AI 파인튜닝 해커톤 2024 개최
Mistral AI는 2024년 6월 5일부터 30일까지 가상으로 진행되는 파인튜닝 해커톤을 발표했다.
성공적인 언어 모델 평가 기준과 사례
평가 기준(evals)은 연구 커뮤니티에 중요한 인센티브를 제공하며, 성공적인 평가 기준은 혁신적인 논문에서 사용되고 신뢰를 받는다. 최근 5년간 GLUE, SuperGLUE, MMLU, GSM8K, MATH, HumanEval 등이 성공적인 평가 기준으로 언급되었다. 성공적인 평가 기준은 명확한 성과를 보여야 하며, 예시 수가 충분하고, 이해하기 쉬워야 한다. 평가 기준의 품질이 낮으면 신뢰를 잃게 된다. 또한, 평가 기준은 의미 있는 작업을 측정해야 하며, 성과가 빠르게 포화되지 않아야 한다.
LLM 평가 기준의 변화와 문제점
최근 LLM의 성능이 평가 기준을 초과하면서, MMLU, GMS8k, HumanEval 등 소수의 기준으로 축소되었다. 그러나 이러한 기준의 신뢰성에 대한 우려가 커지고 있으며, 많은 연구자들이 모델의 직관적인 평가에 의존하고 있다. LLM은 Aquila2와 Qwen 모델을 포함하여 MATH와 GSM8k의 훈련 및 테스트 예제를 반복하는 경향이 있으며, GPT 모델은 훈련 데이터 컷오프 이전의 코딩 문제에서 더 나은 성능을 보인다. 또한, Mistral과 Phi 모델은 GSM8k와 비교해 GSM1k에서 10%의 성능 저하를 보였다.
신뢰할 수 있는 평가 기준의 부족은 LLM 개발 시 모델 성능을 객관적으로 평가하는 데 어려움을 초래한다.
개인 성장 측정 방법에 대한 고찰
창업자들은 비즈니스 성장 측정을 고민하며, 개인 성장 측정에 대한 논의가 있다. 개인 성장 측정의 세 가지 지표로는 변화율, 문제 해결 시간, 미래 선택의 수가 제시된다. 변화율은 3-6년 주기로 삶의 변화가 일어난다는 이론에 기반하며, 문제 해결 시간은 경력, 가족, 재정 문제를 해결하는 데 걸리는 시간을 통해 측정된다. 미래 선택의 수는 나이가 들수록 더 많은 꿈과 자원에 접근할 수 있다는 관점에서 설명된다.
개인 성장 측정 방법은 개발자들이 경력 개발 및 문제 해결 능력을 향상시키는 데 도움이 될 수 있다.
Command R+ 모델 출시 및 성능
2024년 8월 30일, Cohere의 Command R 및 R+ 모델이 업데이트되어 출시되었다. Command R+는 Chatbot Arena에서 최고의 오픈 웨이트 모델로 평가받으며, 일부 GPT-4 버전보다 성능이 우수하다. Command R+는 104B 파라미터로 구성되어 있으며, 로컬에서 111 토큰/초의 속도로 텍스트를 생성할 수 있다. 이 모델은 비상업적 라이선스를 갖고 있으며, 기업 사용을 위해 설계되었다. RAG(검색 기반 생성) 기능을 통해 신뢰할 수 있는 응답을 제공하며, 내부 평가에서 GPT4-turbo보다 우수한 성과를 보였다.
Adversarial Validation을 통한 AI 모델 드리프트 감지 방법
Adversarial Validation은 모델 입력이나 훈련 데이터의 갑작스러운 변화를 감지하는 간단하고 효과적인 방법이다. 이 방법은 두 개의 데이터셋을 비교하여 드리프트를 감지하며, 이진 분류기를 사용해 두 데이터셋의 차이를 식별한다. 예를 들어, OpenAI API를 사용하는 모델의 경우, ft_drift라는 CLI 도구를 통해 다중 턴 채팅 형식의 JSONL 파일 간 드리프트를 감지할 수 있다. 이 도구는 프롬프트 템플릿과 같은 토큰 기반 드리프트를 감지하며, 이를 통해 모델의 예기치 않은 동작의 원인을 빠르게 찾아낼 수 있다.
비디오 생성을 위한 확산 모델 연구
확산 모델은 이미지 합성에서 강력한 결과를 보여주었으며, 현재 연구 커뮤니티는 비디오 생성이라는 더 어려운 작업에 착수하고 있다. 비디오 생성은 이미지의 경우보다 더 많은 시간적 일관성을 요구하며, 이는 모델에 더 많은 세계 지식을 인코딩해야 함을 의미한다. 또한, 텍스트나 이미지에 비해 고품질의 고차원 비디오 데이터 및 텍스트-비디오 쌍을 수집하는 것이 더 어렵다.
AI 제품의 평가 시스템 구축 필요성
Hamel Husain은 LLM 제품의 성공과 실패를 평가 시스템의 견고함에 연결짓고 있다. 그는 Rechat의 AI 어시스턴트 Lucy의 사례를 통해, 평가를 중심으로 한 체계적인 접근이 AI 성능 개선에 필수적임을 강조한다. 평가의 세 가지 수준은 단위 테스트, 모델 및 인간 평가, A/B 테스트로 나뉘며, 각 수준의 비용과 실행 주기를 고려해야 한다.
효과적인 평가 시스템 구축은 AI 제품의 성능 개선과 지속적인 발전을 위한 필수 요소이다.
900개 인기 오픈소스 AI 도구 분석 결과
2026년 2월 기준, 오픈소스 AI 레포지토리 목록은 Good AI List에서 매일 업데이트되며, 현재 15,000개 이상으로 증가했다. 저자는 GitHub에서 'gpt', 'llm', 'generative ai' 키워드로 검색하여 896개의 레포를 발견했으며, 이 중 845개는 소프트웨어 레포지토리이다. AI 스택은 인프라, 모델 개발, 애플리케이션 개발의 3층 구조로 구성되며, 각 층은 특정 기능을 제공한다.
선택된 응답과 거부된 응답 간의 어휘적 차이 분석
LLM 훈련 파이프라인의 마지막 단계에서 선호 데이터는 필수적이다. RLHF 과정에서 보상 모델을 훈련하기 위해 선택된 모델 출력과 거부된 모델 출력을 쌍으로 보여준다. 이 블로그 포스트에서는 질적 측면 대신 문장 임베딩을 사용하여 선택된 응답과 거부된 응답 간의 어휘적 차이를 분석하는 접근 방식을 제안한다. 데이터셋으로는 OpenAI의 Summarize from Human Feedback, Stanford Human Preferences Dataset, Argilla의 Ultrafeedback, Tatsumoto Lab의 Alpaca Farm, Berkeley Nest Lab의 Nectar Dataset이 사용되었다. 문장 임베딩은 384차원으로 생성되었으며, 코사인 거리를 통해 선택된 벡터와 거부된 벡터 간의 거리를 측정하였다.
문장 임베딩을 통한 어휘적 거리 측정은 선호 데이터 생성 시 품질 기반 메트릭 대신 사용할 수 있는 새로운 방법을 제시한다.