Category
AI 코딩
AI 코딩은 LLM이 코드를 직접 작성·수정·리뷰하는 작업 방식이다. 자동완성을 넘어 에이전트가 레포 전체를 읽고 파일을 고치고 테스트를 돌린다. 생산성은 오르지만 환각·미묘한 버그·보안 노출이 함께 따라오므로 사람의 검수 루프 설계가 관건이다.
토스 AI DX Team의 Skill 품질 관리 Rubric 설계
토스 AI DX Team의 조민규 개발자는 사내 공용 Skill의 품질 문제를 해결하기 위해 6개 섹션과 30개 항목으로 구성된 Rubric을 설계했다. 이 Rubric은 Skill의 품질을 BLOCKER, MAJOR, MINOR로 평가하며, 각 항목은 LLM 모델과 정규식을 활용해 검증된다. Skill의 호출 실패 원인으로는 트리거 실패와 형식 위반이 있으며, 이를 구분하여 관리하는 것이 핵심이다.
Bun의 Rust로의 재작성
Jarred Sumner는 Zig에서 Rust로의 Bun 재작성에 대한 블로그 포스트를 발표했다. 이 포스트에서는 메모리 관리 문제로 인해 Rust를 선택한 이유와, TypeScript로 작성된 Bun 테스트 스위트를 활용하여 Rust로의 포트를 자동화한 과정이 설명된다. 새로운 Bun 구현은 Claude Code v2.1.181에서 사용되며, Linux에서 시작 속도가 10% 빨라졌다.
Obsidian과 Claude Code로 개인 루틴 관리 도구 개발하기
유료 루틴 관리 앱을 사용하던 사용자가 루틴 체크에 가중치를 두고, 개인의 방식으로 데이터를 관리할 수 있는 도구를 만들기로 결심했다. Obsidian과 Claude Code를 활용하여, 필요한 기능을 빠르게 구현하고, 개인용 도구로서의 만족도를 높였다. Git 플러그인, Templater, Dataview를 사용하여 데이터 관리와 반복 입력을 효율적으로 처리했다.
클로드 코드로 1인 빌더가 9개 프로젝트 동시 운영한 사례
김상욱 발표자는 클로드 코드(Claude Code)를 사용하여 1인으로 9개 프로젝트를 동시에 운영한 경험을 공유했다. 그는 지난해 1월 스타트업에서 백엔드 개발자로 일하다가 해고된 후 클로드 코드를 처음 사용하기 시작했으며, MVP 개발 속도가 빨라져 단 몇 시간 만에 결과물을 만들 수 있었다. 그러나 프로젝트 운영 시 고도화 작업이 필요해지는 문제를 겪었다. 주요 프로젝트로는 클래스코인(ClassCoin), 패티션(petition), 던전 버디(dungeon-buddy), 바바리안(barbarian) 등이 있다.
Atrophy - 코딩 능력 강화를 위한 새로운 CLI 도구
Ashutosh Rath가 개발한 Atrophy는 코딩 능력을 강화하기 위한 명령줄 도구로, 사용자가 5개 기술 영역에서 정기적으로 연습하도록 유도한다. 이 앱은 사용자가 작성한 함수, 디버깅, 코드 읽기, API 메모리, 설계 개요 등 다양한 연습 문제를 제공하며, Python과 JavaScript 기술을 테스트한다. 사용자는 25분 정도 소요되는 기초 시험을 통해 시작 점수를 얻고, 이후 주 2-3회 5-10분의 연습을 권장받는다. Atrophy는 사용자가 가장 오랫동안 소홀히 한 기술에서 자동으로 연습 문제를 선택하고, 점수는 Elo 스타일의 공식을 기반으로 조정된다. 사용자는 AI 지원 연습을 월 1회 수행하여 AI 의존도를 측정할 수 있다.
TorchJD: PyTorch에서 다중 손실로 훈련하기
TorchJD는 다중 손실(여러 작업, 제약 조건, 보조 손실, 정규화 항 등)로 모델을 훈련할 수 있는 라이브러리로, 두 가지 방법인 스칼라화와 야코비안 하강법을 지원한다. 스칼라화 방법은 메모리 사용이 적지만, 목표 간 불일치가 클 경우 야코비안 하강법이 더 효과적일 수 있다. 최근 TorchJD는 PyTorch 생태계에 통합되었으며, 다양한 손실을 훈련하는 데 필요한 기존 방법들을 구현했다.
sqlite-utils 4.0rc2 출시, Claude Fable 도움으로 안정성 향상
sqlite-utils 4.0rc2가 출시되었으며, Claude Fable의 도움으로 안정적인 4.0 버전 출시를 목표로 하였다. Fable은 'delete_where()' 메서드에서 데이터 손실을 초래할 수 있는 심각한 문제를 발견하였고, 이를 해결하기 위해 37개의 프롬프트와 34개의 커밋을 통해 코드 변경이 이루어졌다. 새로운 RC는 데이터베이스에 쓰기 작업을 수행하는 모든 메서드가 자체 트랜잭션 내에서 실행되고, 메서드 호출이 끝나면 즉시 변경 사항이 디스크에 저장된다는 점에서 트랜잭션 처리에 대한 포괄적인 문서를 포함하고 있다.
DeepSeek V4 브랜치에 양자화된 KV 캐시 수정 사항 병합
DeepSeek V4 브랜치에 양자화된 KV 캐시 관련 수정 사항이 병합되었으며, antirez IQ2XXS 모델을 단일 RTX PRO 6000에서 1M 컨텍스트로 실행할 수 있게 되었다. 관련 PR은 #25247, #25303, #25202이며, 특정 패딩 변경 사항은 생략되었다. 성능 벤치마크 결과와 perplexity 값도 제공되었다.
로컬 코딩 에이전트 설정 튜토리얼
이 글은 오픈소스 도구와 오픈웨이트 LLM을 사용하여 로컬 코딩 에이전트를 설정하는 방법에 대한 튜토리얼이다. 로컬 모델을 호스팅하는 인퍼런스 엔진을 통해 로컬 스택을 구성하고, 파일을 읽고 수정하며 명령을 실행하고 변경 사항을 검증할 수 있는 코딩 하네스를 사용할 예정이다. 로컬 설정은 투명하고 검사 가능하며, 하드웨어와 전기 비용 외에는 무료로 운영할 수 있다. Qwen3.6 모델과 Qwen-Coder 코딩 클라이언트를 주로 사용할 계획이다.
Fable과 Opus의 판단을 활용한 테스트 및 모델 선택
AIE에서 Cat Wu와 Thariq Shihipar와의 Fireside Chat에서 Fable과 Opus에게 작업 방식을 지시하기보다는 스스로 판단하게 하는 것이 좋다는 팁이 제공되었다. 예를 들어, Fable에게 '큰 기능에 대해서만 자동 테스트를 사용하라'고 지시하기보다는 테스트 작성을 결정할 때 스스로 판단하도록 하는 것이 더 효과적이다. Jesse Vincent는 Fable 토큰 소모를 줄이기 위해 작은 작업에는 다른 모델을 사용하도록 지시하라고 조언했다. Claude Code는 코딩 작업에 대해 적절한 저전력 모델을 선택하고 이를 서브 에이전트에서 실행하도록 메모리를 저장했다.
코딩 에이전트의 실제 추론 벤치마크 결과
코딩 에이전트의 실제 추론 벤치마크에서 TensorRT-LLM보다 31% 더 높은 TPS를 기록했으며, 포화 상태에서 TTFT는 2배 개선되었고, Claude Opus 4.6보다 76% 낮은 비용을 나타냈다.
AI 코딩 툴 사용 원칙과 Quadrants 모델
AI 코딩 툴을 사용할 때의 원칙으로, 특정 Quadrants 모델을 제시하고 있습니다. 이 모델은 4개의 구역으로 나뉘며, 각 구역은 다음과 같습니다: 1) High Impact Zone, 2) High Danger Zone, 3) Full Fun Vibe Coding Zone, 4) 'Parents at the party' Vibe Coding Zone. 각 구역은 코딩의 위험도와 재미를 기준으로 분류되며, AI 툴 사용 시 주의해야 할 점을 강조합니다.
Google IO 2023에서 발표된 AI 코딩 툴 관련 내용
Google IO 2023에서 CEO가 발표한 내용에 따르면, Google의 AI 코딩 툴인 Bard는 Gemini App을 통해 제공되며, 한국어 지원이 포함되어 있다. Bard는 15개 언어를 지원하고 있으며, LLM을 기반으로 한 다양한 기능을 제공한다. 또한, PaLM 모델이 개선되어 더 나은 코드 생성이 가능해졌다. 2025년에는 AI 툴의 발전이 더욱 가속화될 것으로 예상된다.
Qwen3-Coder: 480B-파라미터 모델 출시
Qwen3-Coder가 발표되었으며, 가장 강력한 변형인 Qwen3-Coder-480B-A35B-Instruct는 480B 파라미터의 Mixture-of-Experts 모델로, 35B의 활성 파라미터를 가지고 있다. 이 모델은 기본적으로 256K 토큰의 컨텍스트 길이를 지원하며, 외삽 방법을 통해 1M 토큰까지 확장할 수 있다. Qwen3-Coder-480B-A35B-Instruct는 Agentic Coding, Agentic Browser-Use, Agentic Tool-Use 분야에서 오픈 모델 중 새로운 최첨단 결과를 세웠으며, Claude Sonnet 4와 비교 가능하다.
Nous Research, NousCoder-14B 공개 및 성능 개선
Nous Research는 48개의 Nvidia B200 그래픽 프로세서를 사용하여 4일 만에 훈련된 새로운 코딩 모델 NousCoder-14B를 발표했다. 이 모델은 LiveCodeBench v6에서 67.87%의 정확도를 기록하며, Alibaba의 Qwen3-14B 모델에 비해 7.08% 향상된 성능을 보인다. Nous Research는 모델 가중치뿐만 아니라 전체 강화 학습 환경과 벤치마크 세트를 공개하여 연구자들이 이 작업을 재현하거나 확장할 수 있도록 했다. NousCoder-14B의 훈련 과정은 24,000개의 경쟁 프로그래밍 문제를 기반으로 하며, 코드 솔루션의 정확성을 검증하는 피드백 루프를 포함한다.
GitHub Copilot agentic harness의 성능 및 효율성 평가
GitHub Copilot agentic harness는 GitHub Copilot SDK의 공유 구성 요소로, GitHub Copilot CLI, GitHub Copilot 앱, Copilot 코드 리뷰 등 다양한 경험을 지원한다. 이 하네스는 빠르고, 토큰 효율적이며, 개발자에게 예측 가능하도록 설계되었다. 최근 벤치마크를 통해 GitHub Copilot CLI는 Claude Sonnet 4.6, Claude Opus 4.7, GPT-5.4, GPT-5.5와 같은 모델 벤더 하네스와 비교하여 유사한 작업 완료율을 보이며, 대부분의 구성에서 낮은 토큰 소비를 기록했다. 또한, TerminalBench 2.0을 통해 작업 완료 및 토큰 효율성에 대한 분석을 지속적으로 수행하고 있다.
Kelos - 쿠버네티스 네이티브 자율 코딩 에이전트 프레임워크 소개
네이버의 NAVER ENGINEERING DAY 2026에서 쿠버네티스 네이티브 자율 코딩 에이전트 프레임워크인 Kelos가 소개되었다. Kelos는 코딩 에이전트와 그 환경을 API화하고 관리할 수 있도록 해주는 오픈소스 프레임워크이다. 발표는 AI 코딩 에이전트의 자동화에 관심이 있는 개발자들을 대상으로 진행되었다.
simonw/browser-compat-db: MDN 호환성 데이터를 SQLite 데이터베이스로 변환
simonw/browser-compat-db는 Mozilla의 MDN MCP 서비스에서 영감을 받아 MDN의 브라우저 호환성 데이터를 SQLite 데이터베이스로 변환한 GitHub 리포지토리이다. 이 리포지토리에는 sqlite-utils를 사용하여 데이터베이스를 생성하는 Claude Code for web (Opus 4.8) 스크립트가 포함되어 있다. 생성된 약 66MB의 SQLite 데이터베이스는 GitHub CDN을 통해 오픈 CORS 헤더로 제공되며, Datasette Lite를 통해 탐색할 수 있다.
ParallelKernelBench: LLM이 다중 GPU CUDA 커널 작성 성능 테스트
ParallelKernelBench는 LLM이 87개의 실제 워크로드에 대해 빠른 다중 GPU CUDA 커널을 작성할 수 있는지를 테스트한다. 가장 성능이 좋은 모델은 3분의 1 이하의 문제를 해결했지만, 일부 생성된 커널은 공개 구현보다 더 나은 성능을 보였다.
AI 학습을 위한 Python 라이브러리 Trio 소개
AI 시스템의 학습과 관련하여, Anthropic은 AI의 안전성과 해석 가능성을 높이기 위한 연구를 진행하고 있으며, Python 라이브러리 Trio를 통해 AI의 코딩 기술 형성에 영향을 미치는 방법을 제시하고 있다. AI를 활용한 학습 과정에서 초보자들은 50%의 코드를 작성할 수 있으며, AI가 없는 경우 67%의 코드 작성이 가능하다는 연구 결과가 있다.
Google Antigravity와 Claude Code의 Agentic Coding 기능 소개
AI의 직관과 취향에 대한 논의가 진행되고 있으며, Google Antigravity와 Claude Code는 'Agentic' Coding을 통해 다양한 기능을 제공하고 있습니다. Claude Code는 SQLite DB와 MCP(Model Context Protocol)를 통해 MacOS에서의 활용 가능성을 높이고 있으며, 사용자는 이를 통해 데이터베이스와의 상호작용을 개선할 수 있습니다. 또한, Claude는 DB와의 통합을 통해 다양한 데이터 처리 및 관리 기능을 지원합니다.
Fable 모델의 코드 수정 요청과 관련된 논란
Fable 모델에 대한 'fix this code' 요청이 있었으나, 실제로는 탈옥(jailbreak)이 없었다. Anthropic이 Fable을 오프라인으로 전환할 수 있는 권한이 필요하다는 점이 강조되었고, Katie Moussouris는 Fable이 보안 문제를 검토하는 과정에서 코드 수정 요청에 응답하지 않았다고 밝혔다. 이로 인해 사이버 보안 실험의 기회가 줄어들고 있다는 우려가 제기되었다.
코드 생성 도구 사용 시 개발자의 인지적 부담 증가
코드 생성 도구를 사용할 때, 개발자는 코드 작성 과정에서의 내부 프로세스를 잃고 외부적으로만 코드를 작성한 느낌을 받는다. 코드 생성의 기본 모드는 기술 유지와 반대되는 경향이 있으며, 이는 개발자가 도구를 사용하는 데 있어 의도적으로 접근해야 함을 시사한다. 저자는 초기 구현을 직접 작성하고, 에이전트에게 코드 리뷰를 요청하거나, 이해하지 못하는 부분에 대해 질문하는 등의 방법을 통해 개발 과정에 마찰을 추가하고 있다. 이러한 접근은 단기적으로는 속도 향상 효과를 상쇄하지만, 장기적으로는 도구 사용 능력을 향상시킬 수 있다.
Claude Code 월 최대 $200, Goose는 무료 대안 제공
Claude Code는 Anthropic의 AI 코딩 에이전트로, 월 $20에서 $200의 요금이 부과된다. 이에 따라 무료 대안인 Goose가 인기를 끌고 있으며, Goose는 사용자의 로컬 머신에서 실행되며 구독료가 없다. Goose는 GitHub에서 26,100개 이상의 별점을 보유하고 있으며, 1.20.1 버전이 2026년 1월 19일에 출시되었다. 반면, Claude Code는 사용량에 따라 제한된 프롬프트 수를 제공하며, 새로운 요금제에 대한 불만이 커지고 있다.