본문으로 건너뛰기

Category

AI 코딩

AI 코딩은 LLM이 코드를 직접 작성·수정·리뷰하는 작업 방식이다. 자동완성을 넘어 에이전트가 레포 전체를 읽고 파일을 고치고 테스트를 돌린다. 생산성은 오르지만 환각·미묘한 버그·보안 노출이 함께 따라오므로 사람의 검수 루프 설계가 관건이다.

News·

GitHub 초보자를 위한 가이드: GitHub의 기본 이해하기

이 가이드는 GitHub의 기본 개념을 소개하며, 버전 관리 시스템인 Git의 중요성과 사용 방법을 설명한다. Git은 파일 변경 사항을 추적하고, 작업 디렉토리, 스테이징 영역, 로컬 저장소의 세 가지 영역을 통해 작동한다. GitHub 계정을 설정하고 2단계 인증을 활성화하여 보안을 강화하는 방법도 안내한다. 또한, 기본적인 Git 명령어(예: git init, git clone, git commit 등)와 첫 번째 저장소를 만드는 방법, Markdown 사용법에 대해서도 다룬다.

GitHub Blog
News·

Claude Code v2.1.181에서 Rust로 작성된 Bun 사용

Claude Code v2.1.181(2023년 6월 17일 출시)부터 Rust 포트의 Bun을 사용하며, 리눅스에서 시작 속도가 10% 빨라졌지만 다른 변화는 거의 없었다. Claude Code 설치에서 Bun v1.4.0이 사용되고 있는 것을 확인할 수 있었으며, 이는 아직 출시되지 않은 Bun 버전의 미리보기를 지원한다. Rust 버전은 현재 Bun canary로 제공되며, 'bun upgrade --canary' 명령어로 설치할 수 있다.

Simon Willison's Weblog
News·

리누스 토발즈, 리눅스에서 AI 코딩 도구 사용 지지

AI 기반 코딩 도구의 도입이 진행됨에 따라, 리눅스 커널의 창시자 리누스 토발즈는 AI 도구 사용을 지지한다고 밝혔다. 그는 리눅스가 반AI 프로젝트가 아니며, 이에 불만이 있는 사람은 오픈 소스 방식으로 포크하거나 떠날 수 있다고 말했다. 또한, Sashiko라는 리눅스 커널 코드 리뷰 시스템이 테스트에서 53.6%의 버그를 독립적으로 찾아낼 수 있다고 주장했지만, 20%의 비율로 잘못된 버그 보고도 발생할 수 있다고 덧붙였다.

Ars Technica — AI
News·

바이브 코딩 전에 알아야 할 7가지 기본 개념

바이브 코딩을 할 때 발생할 수 있는 문제는 기본 개념 부족에서 비롯된다. AI는 확률 기반 생성으로 항상 옳지 않으며, 결과를 직접 실행하고 검증해야 한다. 프롬프트를 구체적으로 나누어 요청하고, HTML, CSS, JavaScript, 터미널, 컨텍스트를 이해하면 문제 해결이 쉬워진다. Git을 사용해 저장 지점을 만들고 로컬과 배포의 차이를 이해해야 안정적인 결과물을 공유할 수 있다.

요즘IT (Yozm IT)
News·

AI와 200만 줄의 코드 작성 경험에서 얻은 교훈

25년 경력의 소프트웨어 아키텍트가 AI와 함께 200만 줄의 코드를 작성했으나, 실제로는 단 5분도 자율적으로 작동하지 않는 결과물을 경험했다. AI에게 ‘무엇을(what)’과 ‘어떻게(how)’만 주면 작동하지 않는 코드가 생성되며, 빠진 변수는 ‘왜(why)’라는 점을 강조했다. AI의 속도는 빠르지만, 엔지니어링의 완성도는 부족하다는 문제를 지적하며, AI의 결과물이 껍데기에 불과할 수 있음을 경고했다.

요즘IT (Yozm IT)
News·

OpenAI의 SWE-Bench Pro 감사 결과와 코딩 평가의 한계

OpenAI의 SWE-Bench Pro 감사 결과, 정밀한 점수가 코딩 능력을 제대로 측정하지 못할 수 있음을 보여주었다. SWE-Bench Pro는 이전 코딩 평가의 약점을 해결하기 위해 설계되었으며, 731개 과제에서 모델 성능이 23.3%에서 80.3%로 증가했지만, OpenAI는 결과의 30%가 결함이 있다고 추정했다. 감사 결과, 200개 과제(27.4%)가 결함으로 분류되었고, 소프트웨어 엔지니어들이 평가한 결과 249개 과제(34.1%)가 결함으로 나타났다. OpenAI는 SWE-Bench Pro의 채택을 권장하지 않기로 했다.

TheSequence (Jesus Rodriguez)
News·

루프 엔지니어링의 개념과 활용

‘루프 엔지니어링’은 Anthropic과 OpenAI의 개발자들이 프롬프트 작성을 중단하고 루프 설계로 전환하면서 주목받고 있다. Anthropic의 Boris Cherny는 Claude를 프롬프트하는 대신 루프를 작성한다고 밝혔다. 루프는 이벤트에 반응하거나 예약된 작업을 실행하는 데 사용되며, OpenAI의 API 가격이 비쌀 경우 비용이 빠르게 증가할 수 있다. Geoffrey Huntley는 'Ralph Wiggum' 루프라는 개념을 제안하며, 이를 통해 작업을 지속적으로 유도할 수 있다고 설명했다. 이 방법은 엔지니어의 전문성이 여전히 필요하다고 강조한다.

The Pragmatic Engineer (Gergely Orosz)
News·

소프트웨어 프로젝트의 공유 언어와 이해의 중요성

소프트웨어 프로젝트에서 공유되는 언어는 영어 또는 파이썬이 아니라 개념의 의미, 경계, 중요 불변량, 소유권, 시스템 구조의 이유에 대한 공통 이해이다. 이러한 이해는 문서와 코드, 코드 리뷰, 대화, 논쟁, 변경 사항을 설명하는 경험 속에 존재한다. 에이전트 이전에는 이러한 공유 이해가 마찰을 통해 유지되었으며, 이는 느린 과정이었지만 서로의 이해를 동기화하는 역할을 했다.

Simon Willison's Weblog
News·

Codex 사용자 수 6개월 만에 10배 증가, 700만 명 도달

Codex의 사용자 수가 6개월 만에 10배 증가하여 현재 700만 명에 도달했다. Codex는 올해 초 약 55만에서 70만 명의 사용자로 시작했으며, Claude Code는 약 200만 명의 사용자와 25억 달러의 ARR을 기록하고 있다. Prime Intellect는 에이전트 RL 및 평가를 위한 환경 스택을 재설계한 verifiers v1을 출시했다.

Latent Space (swyx & Alessio)
News·

Bun의 Zig에서 Rust로의 재작성과 Fable의 활용

Bun의 Rust로의 재작성에 165K 달러가 소요되었으나, 이로 인해 1-2년 걸릴 작업이 11일로 단축되었다. 이 과정에서 사용된 도구는 Fable로, 현재는 전 세계적으로 사용 가능하다. Anthropic의 Fable, OpenAI의 GPT-5.6 Sol, Cursor의 Grok 4.5, Meta의 Muse와 같은 코딩 LLM 모델들이 경쟁 중이다.

The Pragmatic Engineer (Gergely Orosz)
News·

DOOMQL: SQLite를 게임 엔진으로 활용한 도스 스타일 게임

Peter Gostev가 GPT-5.6 Sol을 사용해 개발한 DOOMQL은 SQLite를 게임 엔진으로 활용한 작은 도스 스타일 게임이다. 이 게임은 SQL을 통해 이동, 충돌, 적, 전투, 진행 및 화면의 모든 RGB 픽셀을 제어한다. Python 터미널 스크립트로 구현되어 있으며, 사용자는 GitHub에서 코드를 클론하여 실행할 수 있다. 또한, Datasette 앱을 통해 SQL 쿼리를 실행하고 게임 상태를 실시간으로 반영하는 HTML+JavaScript 앱을 만들 수 있다.

Simon Willison's Weblog
News·

Google, Android Bench에 새로운 LLM 추가 및 업데이트

Google은 Android 앱 개발에서 LLM의 성능을 평가하기 위해 만든 Android Bench를 업데이트했다. 이번 업데이트에는 Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus, Qwen 3.7 Max 등 8개의 새로운 모델이 추가되었다. 개발자들은 자신의 테스트를 실행하고 피드백을 제출할 수 있으며, Android Bench는 100개의 Android 개발 작업에서 LLM의 성능을 평가하는 것을 목표로 한다.

Ars Technica — AI
News·

llama.cpp의 P100 GPU 성능 개선을 위한 패치 배포

turboquant v0.3.0이 배포되었으며, CUDA 코드의 패치로 P100 GPU가 fp16 연산을 수행할 수 있게 되었다. 이 패치는 3줄로 구성되어 있으며, 성능 측정 결과 P100에서의 디코드 속도가 약 1.4% 빨라졌다. P100은 현재 약 80달러에 판매되고 있으며, 16GB HBM2 메모리를 갖추고 있다.

r/LocalLLaMA
News·

Kenton Varda, AI 작성 변경 설명 중단 선언

Kenton Varda는 자신의 팀에서 AI가 작성한 변경 설명(예: PR 및 커밋 메시지, 이슈/티켓)에 대한 중단을 선언했다. 그는 AI가 작성한 설명이 코드의 세부 사항은 잘 설명하지만, 코드의 전반적인 의미를 이해하는 데 필요한 고차원적인 프레임을 생략하여 리뷰에 도움이 되지 않았다고 밝혔다.

Simon Willison's Weblog
News·

Warp의 소프트웨어 팩토리 플랫폼 Oz 소개

Warp는 2021년 중반 Rust 기반 터미널로 시작하여 AI의 발전에 따라 통합 코딩 에이전트를 갖춘 터미널로 발전했다. 최근 CLI 도구 간의 경쟁이 치열해지면서 Warp는 2023년 4월에 핵심 CLI 도구를 오픈소스화했다. Warp의 새로운 에이전트 오케스트레이션 플랫폼인 Oz는 소프트웨어 개발의 자동화를 목표로 하며, 개발자들이 기존 워크플로우에 통합할 수 있도록 설계되었다. Oz는 여러 모델과 코딩 툴을 연결하고, 소프트웨어 변경 사항을 지속적으로 관리하는 자동화된 시스템으로의 전환을 지원한다.

Latent Space (swyx & Alessio)
News·

AIEWF 2023: 소프트웨어 공장과 루프의 중요성

AIEWF에서 루프와 소프트웨어 공장에 대한 논의가 활발히 이루어졌다. swyx는 AI 엔지니어링의 발전을 언급하며 자동화와 루프의 중요성을 강조했다. Allie Howe는 소프트웨어 공장을 '자율성을 가진 소프트웨어 개발의 전체 루프'로 정의했으며, Zach Lloyd는 소프트웨어 공학이 공장 공학으로 발전할 것이라고 주장했다. Forward Deployed Engineers(FDE) 역할도 주목받았으며, 이들은 조직이 AI 에이전트를 통합하는 데 도움을 주는 역할을 한다.

Latent Space (swyx & Alessio)
News·

토스 AI DX Team의 Skill 품질 관리 Rubric 설계

토스 AI DX Team의 조민규 개발자는 사내 공용 Skill의 품질 문제를 해결하기 위해 6개 섹션과 30개 항목으로 구성된 Rubric을 설계했다. 이 Rubric은 Skill의 품질을 BLOCKER, MAJOR, MINOR로 평가하며, 각 항목은 LLM 모델과 정규식을 활용해 검증된다. Skill의 호출 실패 원인으로는 트리거 실패와 형식 위반이 있으며, 이를 구분하여 관리하는 것이 핵심이다.

토스 테크 (Toss Tech)
News·

Bun의 Rust로의 재작성

Jarred Sumner는 Zig에서 Rust로의 Bun 재작성에 대한 블로그 포스트를 발표했다. 이 포스트에서는 메모리 관리 문제로 인해 Rust를 선택한 이유와, TypeScript로 작성된 Bun 테스트 스위트를 활용하여 Rust로의 포트를 자동화한 과정이 설명된다. 새로운 Bun 구현은 Claude Code v2.1.181에서 사용되며, Linux에서 시작 속도가 10% 빨라졌다.

Simon Willison's Weblog
News·

Obsidian과 Claude Code로 개인 루틴 관리 도구 개발하기

유료 루틴 관리 앱을 사용하던 사용자가 루틴 체크에 가중치를 두고, 개인의 방식으로 데이터를 관리할 수 있는 도구를 만들기로 결심했다. Obsidian과 Claude Code를 활용하여, 필요한 기능을 빠르게 구현하고, 개인용 도구로서의 만족도를 높였다. Git 플러그인, Templater, Dataview를 사용하여 데이터 관리와 반복 입력을 효율적으로 처리했다.

요즘IT (Yozm IT)
News·

클로드 코드로 1인 빌더가 9개 프로젝트 동시 운영한 사례

김상욱 발표자는 클로드 코드(Claude Code)를 사용하여 1인으로 9개 프로젝트를 동시에 운영한 경험을 공유했다. 그는 지난해 1월 스타트업에서 백엔드 개발자로 일하다가 해고된 후 클로드 코드를 처음 사용하기 시작했으며, MVP 개발 속도가 빨라져 단 몇 시간 만에 결과물을 만들 수 있었다. 그러나 프로젝트 운영 시 고도화 작업이 필요해지는 문제를 겪었다. 주요 프로젝트로는 클래스코인(ClassCoin), 패티션(petition), 던전 버디(dungeon-buddy), 바바리안(barbarian) 등이 있다.

요즘IT (Yozm IT)
News·

Atrophy - 코딩 능력 강화를 위한 새로운 CLI 도구

Ashutosh Rath가 개발한 Atrophy는 코딩 능력을 강화하기 위한 명령줄 도구로, 사용자가 5개 기술 영역에서 정기적으로 연습하도록 유도한다. 이 앱은 사용자가 작성한 함수, 디버깅, 코드 읽기, API 메모리, 설계 개요 등 다양한 연습 문제를 제공하며, Python과 JavaScript 기술을 테스트한다. 사용자는 25분 정도 소요되는 기초 시험을 통해 시작 점수를 얻고, 이후 주 2-3회 5-10분의 연습을 권장받는다. Atrophy는 사용자가 가장 오랫동안 소홀히 한 기술에서 자동으로 연습 문제를 선택하고, 점수는 Elo 스타일의 공식을 기반으로 조정된다. 사용자는 AI 지원 연습을 월 1회 수행하여 AI 의존도를 측정할 수 있다.

The Register — AI/ML
News·

TorchJD: PyTorch에서 다중 손실로 훈련하기

TorchJD는 다중 손실(여러 작업, 제약 조건, 보조 손실, 정규화 항 등)로 모델을 훈련할 수 있는 라이브러리로, 두 가지 방법인 스칼라화와 야코비안 하강법을 지원한다. 스칼라화 방법은 메모리 사용이 적지만, 목표 간 불일치가 클 경우 야코비안 하강법이 더 효과적일 수 있다. 최근 TorchJD는 PyTorch 생태계에 통합되었으며, 다양한 손실을 훈련하는 데 필요한 기존 방법들을 구현했다.

r/MachineLearning
News·

sqlite-utils 4.0rc2 출시, Claude Fable 도움으로 안정성 향상

sqlite-utils 4.0rc2가 출시되었으며, Claude Fable의 도움으로 안정적인 4.0 버전 출시를 목표로 하였다. Fable은 'delete_where()' 메서드에서 데이터 손실을 초래할 수 있는 심각한 문제를 발견하였고, 이를 해결하기 위해 37개의 프롬프트와 34개의 커밋을 통해 코드 변경이 이루어졌다. 새로운 RC는 데이터베이스에 쓰기 작업을 수행하는 모든 메서드가 자체 트랜잭션 내에서 실행되고, 메서드 호출이 끝나면 즉시 변경 사항이 디스크에 저장된다는 점에서 트랜잭션 처리에 대한 포괄적인 문서를 포함하고 있다.

Simon Willison's Weblog
News·

DeepSeek V4 브랜치에 양자화된 KV 캐시 수정 사항 병합

DeepSeek V4 브랜치에 양자화된 KV 캐시 관련 수정 사항이 병합되었으며, antirez IQ2XXS 모델을 단일 RTX PRO 6000에서 1M 컨텍스트로 실행할 수 있게 되었다. 관련 PR은 #25247, #25303, #25202이며, 특정 패딩 변경 사항은 생략되었다. 성능 벤치마크 결과와 perplexity 값도 제공되었다.

r/LocalLLaMA