Category
AI 코딩
AI 코딩은 LLM이 코드를 직접 작성·수정·리뷰하는 작업 방식이다. 자동완성을 넘어 에이전트가 레포 전체를 읽고 파일을 고치고 테스트를 돌린다. 생산성은 오르지만 환각·미묘한 버그·보안 노출이 함께 따라오므로 사람의 검수 루프 설계가 관건이다.
Kaggle의 AI Agents Intensive 과정 소개
Kaggle의 AI Agents Intensive 과정이 Google과 함께 진행되었으며, 이 과정은 수강생들이 AI의 다음 단계인 모델을 구축하고 배포하는 방법을 배우는 무료 과정이다.
NVIDIA Nemotron 3 Ultra, 에이전틱 RTL 코딩에서 정확도와 효율성 선도
현대 칩 설계는 엔지니어링 시간에 의해 점점 제한되고 있으며, 레지스터 전송 수준(RTL) 개발 및 검증은 전문 하드웨어 지식과 정밀한 추론, 전자 설계 자동화(EDA) 도구와의 반복적인 상호작용을 요구한다. 대형 언어 모델(LLM)은 코드 생성을 가속화하고, AI 에이전트는 검증 피드백을 사용하여 오류를 반복적으로 수정함으로써 그 영향을 확장하고 있다.
Claude Code의 자동 모드가 Pro, Max, Team 플랜의 기본 설정으로 변경
Anthropic은 2023년 8월 14일부터 Claude Code의 Pro, Max, Team 플랜에서 자동 모드를 기본 설정으로 변경한다고 발표했다. 자동 모드는 1,053명의 유료 테스터를 대상으로 한 평가에서 유해한 행동을 89% 차단하는 것으로 나타났다. 그러나 여전히 11%의 경우에는 자동 모드가 해당 행동을 막지 못할 수 있다.
인간의 승인 과정에서 3분의 1의 악성 AI 코딩 요청이 통과됨
브라우저 기반 게임에서 인간이 AI 코딩 에이전트의 요청을 승인하는 능력을 테스트한 결과, 평균적으로 악성 요청의 약 3분의 1이 승인되는 것으로 나타났다. 이 게임은 사용자가 60초 동안 가능한 많은 요청을 승인하거나 거부하도록 하며, 승인된 보안 위험과 거부된 안전 명령 모두 사용자 점수에서 차감된다. 게임의 제작자인 벨기에 소프트웨어 개발자 알렉스 워터스는 반복적인 승인 과정이 결정의 질을 저하시킬 수 있다고 설명했다.
Cloudflare, 비개발자를 위한 Cloudflare OS 플랫폼 오픈소스화
Cloudflare는 비개발자도 사용할 수 있는 AI 에이전트를 활용한 앱 구축을 위한 내부 작업 공간으로 개발한 Cloudflare OS 플랫폼을 오픈소스로 공개했다. 이 플랫폼은 직원들이 자연어로 워크플로우를 설명하면 AI 에이전트가 이를 코드로 변환하여 애플리케이션을 생성할 수 있도록 한다. Cloudflare는 이 플랫폼이 매일 수천 명의 직원에 의해 문서 및 슬라이드 작성, 반복 작업 자동화, 데이터 시각화를 위한 소규모 앱 구축에 사용된다고 밝혔다.
Prime Agent - Codex/CC/PI를 초월한 오픈소스 코딩 에이전트
Prime Agent는 일반 및 장기 작업을 위한 오픈소스 코딩 및 연구 에이전트이다. 이 시스템은 코딩 및 장기 자율 작업을 위한 자기 개선형 RLM 하네스이며, 프로그램적 도구 호출, 변수를 통한 컨텍스트, 다중 에이전트 메시징, 자기 수정 가능한 하네스 상태를 통해 토큰 효율성과 표현력을 모두 갖추고 있다. ARC-AGI-3에서 95.5%의 점수를 기록하며, 이는 인간 전문가 기준을 초과하지만 특정 벤치마크에 국한되지 않는다. Prime Agent는 pi를 기반으로 하며 완전 오픈소스이다.
Muse Spark 1.2와 Muse Code의 출시
Meta는 Muse Spark 1.2를 발표했다. 이 업데이트는 코드 생성, 복잡한 디버깅, 코드베이스 이해 및 개발자 워크플로우 개선을 포함한다. Muse Spark 1.2는 긴 코딩 작업에 대해 광범위하게 훈련되었으며, Muse Code와 함께 공동 훈련되어 최적의 성능을 발휘하도록 설계되었다. 가격 측면에서, muse-spark-1.2는 입력당 $1.25, 출력당 $4.25로 제공되며, 데이터 사용에 동의할 경우 muse-spark-1.2-contributor 모델을 통해 큰 할인 혜택을 받을 수 있다.
GitHub 스택형 풀 리퀘스트로 리뷰 간소화하기
GitHub의 스택형 풀 리퀘스트는 대규모 풀 리퀘스트를 작은 독립적으로 리뷰 가능한 레이어로 분해하여 리뷰 과정을 간소화한다. 이 구조는 각 레이어가 독립적인 문제를 다루도록 하여 리뷰어가 각 부분을 쉽게 이해하고 검토할 수 있게 한다. GitHub의 스택형 풀 리퀘스트는 풀 리퀘스트 UI와 터미널에서 gh stack CLI를 통해 사용할 수 있다.
Gas Town과 Opus 4.7의 문제
Gas Town은 재사용 가능하도록 설계되었으나, Opus 4.7에서 'just two more things' 기능이 도입되면서 Gas Town이 실제 작업을 수행할 준비가 되지 못하고 결국 소멸했다. Opus 4.6까지는 잘 작동했으나, 4.7에서의 변화로 인해 Gas Town은 여러 문제와 함께 최종적으로 실패했다.
Qwen 3.8 Max(2.4T) 모델 출시 및 API 가격
Alibaba는 Qwen 3.8 Max를 2.4T 파라미터 모델로 출시하며, 다음 주에 오픈 웨이트를 제공할 것이라고 발표했다. API 가격은 입력 토큰당 $2.00, 출력 토큰당 $6.00, 캐시된 토큰당 $0.25로 설정되었다. Qwen 3.8 Max는 10일 이상의 자율 코딩, 500회 이상의 칩 설계 최적화, 365일의 전자상거래 전략 실행 및 멀티모달 계획 루프를 특징으로 한다.
NVIDIA NeMo Guardrails로 검증된 AI 코딩 어시스턴트 자가 호스팅하기
규제된 환경에서 AI 코딩 어시스턴트를 배포하는 데는 몇 가지 도전 과제가 있다. 주요 문제로는 네트워크를 떠날 수 없는 소스, 패키지 이름을 임의로 생성하여 공급망 위험을 초래하는 경우, 생성된 변경 사항이 결함을 초래할 때 감사 추적이 없는 점이 있다. 이 튜토리얼은 검증된 AI 코딩 어시스턴트를 자가 호스팅하는 방법을 안내한다.
GitHub의 코드 검색 엔진 Blackbird의 대소문자 구분 제거 최적화
GitHub의 코드 검색 엔진 Blackbird는 1억 8천만 개 이상의 저장소와 480TB 이상의 소스 코드를 인덱싱하며, 모든 바이트는 n그램을 추출하고 인덱스를 구축하기 전에 대소문자 구분이 제거된다. ASCII 문자의 경우, 대소문자 구분 제거는 메모리 속도로 실행되며, 브랜치를 제거하여 성능을 최적화하는 방식으로 구현되었다. 이 과정에서 Rust 크레이트인 casefold가 오픈소스로 제공된다.
GitHub Copilot 앱의 스택 세션 및 풀 리퀘스트 기능
GitHub Copilot 앱에서 스택 세션 기능이 도입되어, 동일 리포지토리 내에서 여러 작업을 연속적으로 수행할 수 있다. 사용자는 오래된 개인 앱의 프론트엔드를 현대화하기 위해 Copilot을 활용하였으며, 스타일과 접근성 개선을 위한 계획을 세운 후, AI의 도움으로 코드 변경을 진행하였다. 이전에 시도했던 작업에서의 호환성 문제를 해결하기 위해 개발 브랜치에서 변경 사항을 적용하고, Copilot이 새로운 세션을 생성하여 작업을 이어갈 수 있도록 지원하였다.
LLM을 활용한 코딩의 한계와 문제점
6개월간 Pi와 30-120B 모델(Qwens, Nemotrons, Leguna 등)을 사용하여 에이전틱 코딩을 시도했지만 결과는 항상 실망스러웠다. 모델들이 기술적 부채를 추가하고, 지침을 무시하며, 비효율적인 코드를 생성하는 등 문제를 일으켰다. 결국 수석 엔지니어들이 에이전틱 코딩으로 생산성을 높이는 방법에 대한 질문이 제기되었다.
CLAUDE.md와 AGENTS.md의 차이와 표준화
CLAUDE.md는 AI 코딩 에이전트에 프로젝트 규칙을 알려주는 컨텍스트 파일로 한국에서 표준처럼 사용되지만, 실제 글로벌 표준은 AGENTS.md이다. AGENTS.md는 2025년 8월 OpenAI가 Codex의 컨텍스트 파일로 처음 내놓았고, 현재 6만 개 이상의 저장소와 30개 이상의 도구가 이를 지원한다. 그러나 Claude Code는 아직 AGENTS.md를 지원하지 않으며, 이를 연결하기 위해 CLAUDE.md에 @AGENTS.md를 추가하거나 심볼릭 링크로 변경할 수 있다.
MirrorCode 출시 및 AI 연구 동향
MirrorCode가 METR와 공동 개발되어 출시되었으며, 이는 AI의 자율 코딩 능력을 측정하기 위한 장기 벤치마크이다. MirrorCode는 25개의 실제 프로그램을 재구성하는 작업을 AI 모델에 부여하며, 이 작업은 소스 코드 접근 없이 진행된다. 가장 어려운 프로그램은 인간 엔지니어가 AI 도움 없이 완료하는 데 몇 주에서 몇 달이 걸릴 것으로 예상된다. MirrorCode의 한 작업은 19일 동안 AI가 인간 개입 없이 작업을 수행하며 2,600달러의 비용이 소요되었다. 또한, 1,604개의 중국 AI 기업의 채용 공고 분석 결과, 이들 기업은 서로 다른 전략을 가지고 있는 것으로 나타났다.
GitHub Copilot 앱의 작업 흐름 관리 기능
GitHub Copilot 앱은 여러 에이전트 세션을 관리할 수 있는 작업 공간을 제공하여 소프트웨어 개발 중 다양한 작업을 동시에 수행할 수 있도록 설계되었다. 사용자는 프로젝트를 선택하고, 코드베이스와 파일을 기반으로 작업을 시작할 수 있으며, Quick Chat 기능을 통해 다른 질문이나 아이디어를 탐색할 수 있다. 또한, 브라우저 캔버스를 통해 UI 변경 사항을 시각적으로 미리 보고 조정할 수 있으며, Agent Merge 기능을 통해 풀 리퀘스트 과정에서 발생하는 문제를 모니터링하고 해결할 수 있다.
Epoch과 METR이 발표한 MirrorCode: AI의 장기 프로그래밍 작업 성능 평가
Epoch과 METR이 발표한 MirrorCode는 AI 시스템이 인간보다 오랜 시간이 걸리는 프로그래밍 작업을 얼마나 잘 수행할 수 있는지를 평가하는 벤치마크이다. Opus 4.7은 14시간 동안 251달러의 비용으로 작업을 해결했으며, 이는 인간이 2-17주 걸리는 작업으로 추정된다. MirrorCode는 AI가 소스 코드나 웹 접근 없이 CLI만을 통해 소프트웨어 프로그램을 재구현할 수 있는 능력을 평가한다. 25개의 목표 프로그램 중 17개는 완벽한 점수를 기록했으며, Claude Opus 4.7과 GPT-5.5는 gotree 프로그램을 여러 프로그래밍 언어로 성공적으로 재구현했다.
Codex와 ChatGPT Work, 1000만 사용자 도달
2026년 1월 이후 Codex 사용자가 10배 증가하며, OpenAI는 7월 9일 출시 후 10M 사용자를 기록했다고 발표했다. Codex는 이제 ChatGPT Work의 핵심으로, 비개발자들도 사용하고 있으며, 지식 작업을 지원하는 도구로 발전하고 있다. Codex의 사용자 중 약 20%가 지식 근로자로, 이는 개발자보다 3배 빠르게 성장하고 있다.
Kat Coder 2.5, Q4_K_M에서 테스트 결과
Kat Coder 2.5는 Star Fox에서 영감을 받은 우주선 게임을 생성하는 테스트에서 놀라운 결과를 보여주었다. 이 모델은 5개 이상의 레벨, 키보드 및 마우스 조작, 적, 완전한 게임 플레이 시스템을 갖춘 실제 플레이 가능한 게임을 단일 HTML 파일로 생성했다. Kat Coder 2.5는 Qwen 3.6 35B A3B에서 파생되었으며, 다른 오픈 소스 모델들과 비교했을 때 일관되게 더 나은 결과를 보였다.
AI로 앱 개발 속도가 크게 단축된 현상과 기획 변화
AI를 활용한 앱 개발이 과거 몇 주에서 몇 시간으로 단축되었으며, MVP(프로토타입) 개발 비용이 5만 달러에서 5천 달러로 감소했다. AI와의 대화를 통해 빠르게 아이디어를 구현할 수 있게 되면서, 기획 단계에서의 시간과 비용이 줄어들고, 실패를 시도할 수 있는 기회가 증가했다. 이러한 변화는 기획 방식에도 영향을 미쳐, 실제 작동하는 화면을 통해 소통 비용이 감소하고 오해의 여지가 줄어들었다.
Ryan Carson의 AI 코딩 에이전트 활용법
Ryan Carson은 AI 코딩 에이전트를 활용하여 소프트웨어를 구축하는 방법을 설명했다. 그의 고급 플레이북은 10개의 에이전트를 관리하고, 품질 관리를 자동화하며, 비용에 따라 모델을 라우팅하고, 개발 워크플로우를 소프트웨어 공장으로 전환하는 방법에 대해 다룬다.
ADE: 모든 코딩 에이전트를 어디서나 동기화, 무료 제공
ADE는 모든 코딩 에이전트를 동기화하여 언제 어디서나 사용할 수 있도록 하며, 무료로 제공된다.
딜라이트룸, 클로드 코드로 알라미 iOS 프로젝트 생산성 향상
딜라이트룸은 알라미 iOS 프로젝트에서 클로드 코드(Claude Code)를 사용하여 10배의 생산성을 향상시켰다. 이 프로젝트는 매일 400만 명 이상이 사용하는 글로벌 1위 알람 앱으로, SwiftUI, TCA 기반이며, 40개 이상의 언어를 지원한다. 클로드 코드는 자동화된 워크플로우를 통해 반복 작업을 줄이고, 코드베이스를 이해하는 개발자 동료와 같은 역할을 수행하게 했다.