본문으로 건너뛰기

Category

AI 코딩

AI 코딩은 LLM이 코드를 직접 작성·수정·리뷰하는 작업 방식이다. 자동완성을 넘어 에이전트가 레포 전체를 읽고 파일을 고치고 테스트를 돌린다. 생산성은 오르지만 환각·미묘한 버그·보안 노출이 함께 따라오므로 사람의 검수 루프 설계가 관건이다.

News·

로컬 코딩 에이전트 설정 튜토리얼

이 글은 오픈소스 도구와 오픈웨이트 LLM을 사용하여 로컬 코딩 에이전트를 설정하는 방법에 대한 튜토리얼이다. 로컬 모델을 호스팅하는 인퍼런스 엔진을 통해 로컬 스택을 구성하고, 파일을 읽고 수정하며 명령을 실행하고 변경 사항을 검증할 수 있는 코딩 하네스를 사용할 예정이다. 로컬 설정은 투명하고 검사 가능하며, 하드웨어와 전기 비용 외에는 무료로 운영할 수 있다. Qwen3.6 모델과 Qwen-Coder 코딩 클라이언트를 주로 사용할 계획이다.

Ahead of AI (Sebastian Raschka)
News·

Fable과 Opus의 판단을 활용한 테스트 및 모델 선택

AIE에서 Cat Wu와 Thariq Shihipar와의 Fireside Chat에서 Fable과 Opus에게 작업 방식을 지시하기보다는 스스로 판단하게 하는 것이 좋다는 팁이 제공되었다. 예를 들어, Fable에게 '큰 기능에 대해서만 자동 테스트를 사용하라'고 지시하기보다는 테스트 작성을 결정할 때 스스로 판단하도록 하는 것이 더 효과적이다. Jesse Vincent는 Fable 토큰 소모를 줄이기 위해 작은 작업에는 다른 모델을 사용하도록 지시하라고 조언했다. Claude Code는 코딩 작업에 대해 적절한 저전력 모델을 선택하고 이를 서브 에이전트에서 실행하도록 메모리를 저장했다.

Simon Willison's Weblog
News·

코딩 에이전트의 실제 추론 벤치마크 결과

코딩 에이전트의 실제 추론 벤치마크에서 TensorRT-LLM보다 31% 더 높은 TPS를 기록했으며, 포화 상태에서 TTFT는 2배 개선되었고, Claude Opus 4.6보다 76% 낮은 비용을 나타냈다.

Together AI Blog
News·

AI 코딩 툴 사용 원칙과 Quadrants 모델

AI 코딩 툴을 사용할 때의 원칙으로, 특정 Quadrants 모델을 제시하고 있습니다. 이 모델은 4개의 구역으로 나뉘며, 각 구역은 다음과 같습니다: 1) High Impact Zone, 2) High Danger Zone, 3) Full Fun Vibe Coding Zone, 4) 'Parents at the party' Vibe Coding Zone. 각 구역은 코딩의 위험도와 재미를 기준으로 분류되며, AI 툴 사용 시 주의해야 할 점을 강조합니다.

위클리 NLP (끄적이는 ML)
News·

Google IO 2023에서 발표된 AI 코딩 툴 관련 내용

Google IO 2023에서 CEO가 발표한 내용에 따르면, Google의 AI 코딩 툴인 Bard는 Gemini App을 통해 제공되며, 한국어 지원이 포함되어 있다. Bard는 15개 언어를 지원하고 있으며, LLM을 기반으로 한 다양한 기능을 제공한다. 또한, PaLM 모델이 개선되어 더 나은 코드 생성이 가능해졌다. 2025년에는 AI 툴의 발전이 더욱 가속화될 것으로 예상된다.

위클리 NLP (끄적이는 ML)
News·

Qwen3-Coder: 480B-파라미터 모델 출시

Qwen3-Coder가 발표되었으며, 가장 강력한 변형인 Qwen3-Coder-480B-A35B-Instruct는 480B 파라미터의 Mixture-of-Experts 모델로, 35B의 활성 파라미터를 가지고 있다. 이 모델은 기본적으로 256K 토큰의 컨텍스트 길이를 지원하며, 외삽 방법을 통해 1M 토큰까지 확장할 수 있다. Qwen3-Coder-480B-A35B-Instruct는 Agentic Coding, Agentic Browser-Use, Agentic Tool-Use 분야에서 오픈 모델 중 새로운 최첨단 결과를 세웠으며, Claude Sonnet 4와 비교 가능하다.

Qwen Blog (Alibaba)
News·

Nous Research, NousCoder-14B 공개 및 성능 개선

Nous Research는 48개의 Nvidia B200 그래픽 프로세서를 사용하여 4일 만에 훈련된 새로운 코딩 모델 NousCoder-14B를 발표했다. 이 모델은 LiveCodeBench v6에서 67.87%의 정확도를 기록하며, Alibaba의 Qwen3-14B 모델에 비해 7.08% 향상된 성능을 보인다. Nous Research는 모델 가중치뿐만 아니라 전체 강화 학습 환경과 벤치마크 세트를 공개하여 연구자들이 이 작업을 재현하거나 확장할 수 있도록 했다. NousCoder-14B의 훈련 과정은 24,000개의 경쟁 프로그래밍 문제를 기반으로 하며, 코드 솔루션의 정확성을 검증하는 피드백 루프를 포함한다.

VentureBeat — AI
News·

GitHub Copilot agentic harness의 성능 및 효율성 평가

GitHub Copilot agentic harness는 GitHub Copilot SDK의 공유 구성 요소로, GitHub Copilot CLI, GitHub Copilot 앱, Copilot 코드 리뷰 등 다양한 경험을 지원한다. 이 하네스는 빠르고, 토큰 효율적이며, 개발자에게 예측 가능하도록 설계되었다. 최근 벤치마크를 통해 GitHub Copilot CLI는 Claude Sonnet 4.6, Claude Opus 4.7, GPT-5.4, GPT-5.5와 같은 모델 벤더 하네스와 비교하여 유사한 작업 완료율을 보이며, 대부분의 구성에서 낮은 토큰 소비를 기록했다. 또한, TerminalBench 2.0을 통해 작업 완료 및 토큰 효율성에 대한 분석을 지속적으로 수행하고 있다.

GitHub Blog
News·

Kelos - 쿠버네티스 네이티브 자율 코딩 에이전트 프레임워크 소개

네이버의 NAVER ENGINEERING DAY 2026에서 쿠버네티스 네이티브 자율 코딩 에이전트 프레임워크인 Kelos가 소개되었다. Kelos는 코딩 에이전트와 그 환경을 API화하고 관리할 수 있도록 해주는 오픈소스 프레임워크이다. 발표는 AI 코딩 에이전트의 자동화에 관심이 있는 개발자들을 대상으로 진행되었다.

네이버 D2
News·

simonw/browser-compat-db: MDN 호환성 데이터를 SQLite 데이터베이스로 변환

simonw/browser-compat-db는 Mozilla의 MDN MCP 서비스에서 영감을 받아 MDN의 브라우저 호환성 데이터를 SQLite 데이터베이스로 변환한 GitHub 리포지토리이다. 이 리포지토리에는 sqlite-utils를 사용하여 데이터베이스를 생성하는 Claude Code for web (Opus 4.8) 스크립트가 포함되어 있다. 생성된 약 66MB의 SQLite 데이터베이스는 GitHub CDN을 통해 오픈 CORS 헤더로 제공되며, Datasette Lite를 통해 탐색할 수 있다.

Simon Willison's Weblog
News·

ParallelKernelBench: LLM이 다중 GPU CUDA 커널 작성 성능 테스트

ParallelKernelBench는 LLM이 87개의 실제 워크로드에 대해 빠른 다중 GPU CUDA 커널을 작성할 수 있는지를 테스트한다. 가장 성능이 좋은 모델은 3분의 1 이하의 문제를 해결했지만, 일부 생성된 커널은 공개 구현보다 더 나은 성능을 보였다.

Together AI Blog
News·

AI 학습을 위한 Python 라이브러리 Trio 소개

AI 시스템의 학습과 관련하여, Anthropic은 AI의 안전성과 해석 가능성을 높이기 위한 연구를 진행하고 있으며, Python 라이브러리 Trio를 통해 AI의 코딩 기술 형성에 영향을 미치는 방법을 제시하고 있다. AI를 활용한 학습 과정에서 초보자들은 50%의 코드를 작성할 수 있으며, AI가 없는 경우 67%의 코드 작성이 가능하다는 연구 결과가 있다.

위클리 NLP (끄적이는 ML)
News·

Google Antigravity와 Claude Code의 Agentic Coding 기능 소개

AI의 직관과 취향에 대한 논의가 진행되고 있으며, Google Antigravity와 Claude Code는 'Agentic' Coding을 통해 다양한 기능을 제공하고 있습니다. Claude Code는 SQLite DB와 MCP(Model Context Protocol)를 통해 MacOS에서의 활용 가능성을 높이고 있으며, 사용자는 이를 통해 데이터베이스와의 상호작용을 개선할 수 있습니다. 또한, Claude는 DB와의 통합을 통해 다양한 데이터 처리 및 관리 기능을 지원합니다.

위클리 NLP (끄적이는 ML)
News·

Fable 모델의 코드 수정 요청과 관련된 논란

Fable 모델에 대한 'fix this code' 요청이 있었으나, 실제로는 탈옥(jailbreak)이 없었다. Anthropic이 Fable을 오프라인으로 전환할 수 있는 권한이 필요하다는 점이 강조되었고, Katie Moussouris는 Fable이 보안 문제를 검토하는 과정에서 코드 수정 요청에 응답하지 않았다고 밝혔다. 이로 인해 사이버 보안 실험의 기회가 줄어들고 있다는 우려가 제기되었다.

Don't Worry About the Vase (Zvi Mowshowitz)
News·

코드 생성 도구 사용 시 개발자의 인지적 부담 증가

코드 생성 도구를 사용할 때, 개발자는 코드 작성 과정에서의 내부 프로세스를 잃고 외부적으로만 코드를 작성한 느낌을 받는다. 코드 생성의 기본 모드는 기술 유지와 반대되는 경향이 있으며, 이는 개발자가 도구를 사용하는 데 있어 의도적으로 접근해야 함을 시사한다. 저자는 초기 구현을 직접 작성하고, 에이전트에게 코드 리뷰를 요청하거나, 이해하지 못하는 부분에 대해 질문하는 등의 방법을 통해 개발 과정에 마찰을 추가하고 있다. 이러한 접근은 단기적으로는 속도 향상 효과를 상쇄하지만, 장기적으로는 도구 사용 능력을 향상시킬 수 있다.

Vicki Boykis Tech Blog
News·

Claude Code 월 최대 $200, Goose는 무료 대안 제공

Claude Code는 Anthropic의 AI 코딩 에이전트로, 월 $20에서 $200의 요금이 부과된다. 이에 따라 무료 대안인 Goose가 인기를 끌고 있으며, Goose는 사용자의 로컬 머신에서 실행되며 구독료가 없다. Goose는 GitHub에서 26,100개 이상의 별점을 보유하고 있으며, 1.20.1 버전이 2026년 1월 19일에 출시되었다. 반면, Claude Code는 사용량에 따라 제한된 프롬프트 수를 제공하며, 새로운 요금제에 대한 불만이 커지고 있다.

VentureBeat — AI
News·

nbdev 사용 중단 이유와 AI 도구의 영향

저자는 nbdev를 통해 수백 개의 프로젝트를 만들었지만, AI 코딩 도구의 발전으로 인해 nbdev 사용을 중단했다. nbdev의 워크플로우는 Jupyter 노트북에서 코드, 문서, 테스트를 작성하고 이를 Python 라이브러리로 변환하는 방식으로, AI 도구와의 협업에서 혼란을 초래한다고 언급했다. 현재는 Amp, Cursor, Claude Code를 사용하며, 웹 개발에는 Next.js 스택을 선호하고 있다. TypeScript는 GitHub에서 Python과 JavaScript를 초과하는 언어로 자리 잡았다.

Hamel Husain's Blog
News중급·

오픈소스 자율 코딩 에이전트 3강 비교: OpenHands·Cline·Aider

IDE와 터미널에서 도는 오픈소스 자율 코딩 에이전트(coding agent)가 Claude Code와 Cursor의 대안으로 주목받으면서, 셋을 놓고 비교하는 콘텐츠가 빠르게 늘고 있다. 대표 격인 OpenHands는 MIT 라이선스로, Docker 샌드박스 안에서 작업을 자율 실행한다. Cline은 변경을 사람이 확인하는 승인 게이트형으로 동작하고, Aider는 Git 네이티브로 커밋 단위 작업을 다룬다. 세 프로젝트 모두 GitHub 스타가 높고 빠르게 성장하고 있다.

OpenHands (GitHub)
News·

GitHub Copilot의 컨텍스트 처리 및 모델 라우팅 개선

GitHub Copilot은 더 긴 세션에서의 효율성을 높이기 위해 반복되는 정보를 줄이고, 작업에 적합한 모델을 선택하는 기능을 개선하고 있다. VS Code에서의 개선 사항으로는 프롬프트 캐싱과 도구 검색이 있으며, 이를 통해 Copilot은 반복적인 프롬프트 접두사를 재계산하지 않고 재사용할 수 있다. Auto 기능은 작업 의도와 현재 모델 상태를 기반으로 가장 적합한 모델을 선택하여 개발자가 매번 모델 설정을 조정할 필요 없이 효율성을 높인다.

GitHub Blog
News·

Git의 worktree 개념과 사용법

Git의 worktree는 2015년부터 존재했지만 최근에 인기를 끌고 있다. worktree를 사용하면 브랜치를 떠나지 않고도 여러 작업을 동시에 진행할 수 있으며, 원래 작업 환경이 유지된다. 예를 들어, 'git worktree add ../hotfix-workspace -b hotfix-bug main' 명령어로 새로운 작업 공간을 만들 수 있다. 그러나 각 worktree는 독립적인 프로젝트 종속성을 요구하며, 같은 브랜치를 동시에 체크아웃할 수 없다. GitHub Copilot 앱은 기본적으로 worktree를 지원한다.

GitHub Blog
News·

Matrix Scroll – Ed25519로 AI 생성 코드 변경 서명 및 오프라인 검증

Matrix Scroll은 Ed25519를 사용하여 AI가 생성한 코드 변경 사항을 서명하고 오프라인에서 검증할 수 있는 기능을 제공한다.

Hacker News — AI 검색 피드 (hnrss)
News·

앤트로픽, 클로드 코드에 아티팩트 기능 도입

앤트로픽이 AI 코딩 에이전트 '클로드 코드'에 '아티팩트' 기능을 도입했다. 이 기능은 개발 과정에서 생성되는 작업 내용을 실시간으로 시각화하고 팀원들과 공유할 수 있도록 하며, 세션 내 작업 진행 상황을 자동으로 웹 페이지 형태의 아티팩트로 생성할 수 있게 지원한다. 아티팩트는 코드베이스, 외부 커넥터, 대화 내용 등 세션 전체 컨텍스트를 활용해 실시간으로 업데이트되는 시각적 문서이다.

AI타임스
News초급·

Kiro, 코드보다 스펙을 먼저 쓰는 Amazon의 에이전틱 IDE

Kiro는 Amazon이 내놓은 스펙 주도(spec-driven) 방식의 에이전틱 IDE다. Code OSS 기반으로 만들어졌고, 기존 Amazon Q Developer를 대체하는 자리에 들어왔다. 핵심은 코드를 곧바로 생성하지 않고 요구사항을 정리한 뒤 설계 문서를 만들고 작업을 분해하는 단계를 먼저 거친 다음 구현으로 넘어가는 흐름이다. 내부적으로 Auto 라우터가 작업 성격에 따라 Claude Sonnet, Qwen, DeepSeek, GLM, MiniMax 같은 모델을 골라 쓴다. 2026년 5월 7일 국제 출시됐다.

AWS Blog
News중급·

Google, Gemini CLI를 Antigravity CLI로 통합하며 6월 18일 기존 CLI 요청 중단

Google이 Gemini CLI를 Antigravity CLI로 통합한다고 발표했다. 6월 18일부터 Gemini CLI와 Gemini Code Assist IDE 확장은 Google AI Pro·Ultra 및 무료 사용자 요청 처리를 중단하고, Gemini Code Assist for GitHub의 신규 조직 설치도 막힌다(유료 라이선스 조직은 Gemini CLI 계속 사용 가능). 대체재인 Antigravity CLI는 Go로 작성됐고, Antigravity 2.0 데스크톱과 동일한 '에이전트 하니스'를 공유해 코어 에이전트 개선이 CLI·데스크톱 어디서든 자동 반영된다. 출시 시점 1:1 기능 동등성은 없지만 Agent Skills·Hooks·Subagents·Extensions(이제 Antigravity 플러그인)는 유지된다. 전환 명분은 '여러 에이전트가 서로 통신하며 작업을 분할해 복잡한 문제를 푸는' 비동기 멀티에이전트 워크플로 수요다. 한편 Antigravity 2.1.4(6월 11일)는 쿼터 화면 개편, PDF 첨부, 그리고 대화 맥락을 유지한 채 일회성 에이전트로 곁가지 질문을 던지는 /btw 슬래시 커맨드를 추가했다.

Google Developers Blog