News
AI 뉴스
매일 수집·정리하는 전세계 AI 소식을 최신순으로
Bernoulli Naive Bayes 모델을 이용한 해석 가능한 의료 데이터 분류 프레임워크
블랙박스 모델의 한계를 극복하기 위해, Bernoulli Na"ive Bayes(BNB) 모델을 기반으로 한 해석 가능한 규칙 기반 임상 분류 프레임워크가 소개되었다. 이 방법은 연속 변수를 $ ext{χ}^2$-유도 통계 이진화하여 임상 결과와의 연관성을 극대화하는 임계값을 식별한다. Pima Indians Diabetes, Wisconsin Breast Cancer, Heart Failure Prediction의 세 가지 벤치마크 데이터셋에서 각각 0.800, 0.984, 0.919의 AUC 점수를 기록하며, 확률적 신뢰성을 평가하기 위한 교차 검증 보정 분석이 수행되었다. 이 프레임워크는 복잡한 모델과 유사한 성능을 유지하면서도 명확하고 임상적으로 의미 있는 의사결정 규칙을 제공한다.
Bernoulli Na"ive Bayes 모델을 사용하여 해석 가능한 의료 데이터 분류를 가능하게 하여, 의료 분야에서 AI의 신뢰성을 높일 수 있다.
언어 모델에서의 언어화 가능한 표현과 글로벌 작업 공간
이 논문은 대형 언어 모델에서 인간 뇌의 기능적 구분과 유사한 기능적 구분이 나타났음을 보여준다. 새로운 해석 기법인 Jacobian lens를 사용하여 모델이 처리하는 각 시점에서 언어화할 수 있는 표현을 식별한다. 이 표현들은 J-space로 불리며, 글로벌 작업 공간의 특성을 지닌다. J-space는 중간 단계의 레이어에서 일관된 내용을 가지고, 동시에 수십 개의 개념을 보유하며, 모델의 가중치에 의해 다른 표현보다 더 널리 방송된다. 이러한 특성은 모델의 비언어적 사고를 이해하는 데 유용하다.
J-space는 언어 모델이 유지하는 소규모의 특권적 표현 집합을 나타내며, 이는 의식적 접근의 기능적 특징을 지닌다.
Length Value Model: 토큰 수준의 길이 모델링을 위한 확장 가능한 가치 프리트레이닝
Length Value Model (LenVM)은 현대의 자가 회귀 모델에서 토큰을 기본 단위로 하여, 생성 길이가 추론 비용과 추론 성능에 직접적인 영향을 미친다는 점에 착안하여 개발된 프레임워크이다. 기존의 접근 방식은 주로 조잡한 시퀀스 수준에서 작동하여 세밀한 길이 모델링이 부족했으나, LenVM은 각 디코딩 단계에서 남은 생성 길이를 모델링한다. 이를 위해 길이 모델링을 가치 추정 문제로 공식화하고, 생성된 각 토큰에 대해 일정한 부정 보상을 부여한다.
LVSum: 타임스탬프 인식 긴 동영상 요약을 위한 벤치마크
LVSum은 긴 동영상 요약을 평가하기 위한 인간 주석 기반 벤치마크로, 72개의 다양한 동영상과 평균 16분의 길이를 가진 13개 도메인을 포함한다. 각 동영상은 최대 10개의 인간 생성 요약으로 주석이 달려 있으며, 이 요약은 시간적 참조를 포함하고 있다. LVSum은 장기간의 동영상에서 시간적 충실성을 유지하고 의미적으로 및 시간적으로 기반을 둔 요약을 생성하는 데 있어 MLLM의 도전 과제를 다룬다.
LVSum은 72개의 동영상에 대한 세밀한 시간 정렬을 제공하여 긴 동영상 요약의 평가 기준을 제시한다.
클로드 코드에서 스킬을 묶어 워크플로우 자동화하는 방법
지난 5월 27일과 6월 10일, 요즘IT는 클코나잇 2 웨비나를 개최했다. 이 웨비나에서는 클로드 코드(Claude Code)를 활용한 경험이 공유되었으며, 스킬을 생성, 조회, 수정, 삭제하는 방법과 반복되는 스킬을 마스터 스킬로 묶어 워크플로우를 자동화하는 방법이 발표되었다. 스킬 크리에이터(Skill Creator) 플러그인을 사용하여 스킬의 품질을 높이고, 사용하지 않는 스킬은 정리하는 것이 중요하다는 내용도 포함되었다.
스킬 크리에이터 플러그인을 통해 스킬의 품질을 검증할 수 있다.
GenUI와 생성형 UI의 비즈니스 가치
AI는 사용자에 따라 화면과 메시지를 다르게 구성하는 생성형 UI의 시대를 열고 있다. 쇼핑, 금융, 헬스케어, 에듀테크 등 다양한 분야에서 개인화된 경험을 제공하는 사례가 증가하고 있다. 예를 들어, 넷플릭스는 시청 이력에 따라 썸네일을 다르게 보여주며, 맥킨지글로벌연구소는 생성형 AI가 은행 산업에서 연간 약 2,000억~3,400억 달러의 가치를 더할 수 있다고 추산하고 있다.
넷플릭스 보고서에 따르면 전체 시청의 약 80%가 추천에서 발생한다.
애플과 OpenAI 간 영업비밀 침해 소송 및 AI에 대한 대중의 부정적 인식
2026년 7월, 애플이 OpenAI를 상대로 영업비밀 침해 소송을 제기했다. 애플은 OpenAI가 자사 인력을 빼가고 하드웨어 기밀을 탈취했다고 주장하고 있다. 미국 여론조사에 따르면 성인의 70%가 AI로 인한 일자리 감소를 걱정하고 있으며, 55%는 AI가 일상에 해악을 끼칠 것이라고 응답했다. OpenAI의 닉 파쉬는 대중이 AI를 부정적으로 바라보고 있다고 언급했다. 또한, SpaceXAI의 코딩 도구 '그록 빌드'에서 대규모 저장소 무단 업로드 사건이 발생했으며, 이는 사용자 데이터 처리에 대한 신뢰를 크게 훼손했다.
애플과 OpenAI 간의 소송은 AI 산업 내 신뢰 문제를 드러내며, 대중의 부정적 인식이 AI 기술의 수용에 영향을 미칠 수 있다.
트럼프 행정부 고위 관계자, OpenAI의 Dean Ball 비판
트럼프 행정부의 고위 관계자들이 OpenAI의 전략 미래 책임자인 Dean Ball의 규제에 대한 견해를 비판하고 있으며, 이는 OpenAI와 정부 간의 관계에 부정적인 영향을 미칠 수 있다. Ball은 중국 AI 모델 사용에 대한 규제 위험을 언급했으며, 이로 인해 White House AI 고문 David Sacks는 Ball이 규제 포획을 지지하고 있는지 의문을 제기했다. 국방부의 Emil Michael은 Ball의 지적에 대해 비판하며, 정부 기관들이 중국 AI 사용을 차단한 것은 민주적 과정의 결과라고 주장했다.
Ball은 중국 AI 모델 사용에 대한 규제 위험을 언급하며 OpenAI와의 관계에 영향을 미칠 수 있는 발언을 했다.
HuggingFace, 자율 AI 공격에 대한 보안 사고 보고
HuggingFace는 자사의 생산 인프라에 대한 침입을 감지하고 대응했다. 이번 공격은 자율 AI 에이전트 시스템에 의해 주도되었으며, AI를 통해 탐지 및 분석이 이루어졌다. 공격은 AI 지원 탐지를 통해 처음 발견되었고, LLM 기반의 이상 탐지 파이프라인이 보안 텔레메트리에서 신호를 구분하여 침해를 알렸다. 로그 분석 과정에서는 상업적 API의 최전선 모델이 차단되어, GLM 5.2라는 오픈 웨이트 모델을 사용하여 자체 인프라에서 포렌식 분석을 수행했다.
GLM 5.2와 같은 오픈 웨이트 모델을 사용함으로써 공격자 데이터가 외부로 유출되지 않았다.
1010Benja, generative AI를 활용한 EP 발표
1010Benja는 generative AI를 사용한 EP 'Time Has Nothing To Do With What You Choose...'를 발표했다. 이 EP의 첫 번째 트랙 'Semiramis' Dream'은 정글 비트로 시작하며, Benja는 AI 음악 제작에 대해 사과하지 않았다. 그러나 나머지 세 곡은 상대적으로 주목받지 못하고 있다.
미국 42개 주에서 AI 데이터센터 반대 시위 발생
미국 전역에서 AI 데이터센터 건설에 반대하는 첫 전국 규모의 동시 시위가 열렸다. 18일(현지시간) 42개 주에서 총 142건의 AI 데이터센터 반대 집회가 열렸으며, 이는 보수 성향 시민단체 휴먼스 퍼스트가 주도한 행동이다. 시위 참가자들은 AI 인프라 구축이 지역 사회의 물과 전력, 환경을 위협하고 주민 의견을 충분히 반영하지 않고 있다는 불만을 표출했다.
AI 데이터센터 건설에 대한 지역 사회의 반발이 커지고 있어, 향후 AI 인프라 구축 시 주민 의견 수렴이 중요해질 것이다.
Demis Hassabis, AGI와 프론티어 AI 표준 기구 제안
Google CEO Demis Hassabis는 AGI(인공지능 일반화)의 책임 있는 개발을 위해 미국 정부 내에 프론티어 AI 표준 기구를 제안했다. 이 기구는 기술 기준에 따라 프론티어 모델을 평가하고, 취약점을 사전 및 사후에 해결하는 역할을 할 것이다. 그는 AGI가 전 인류에 큰 변화를 가져올 기술이라고 강조하며, 이 기술의 영향력이 산업 혁명보다 10배 클 것이라고 주장했다.
Demis Hassabis는 프론티어 AI 표준 기구의 필요성을 강조하며, 이는 AI 모델의 안전성을 평가하고 관리하는 데 중요한 역할을 할 것이다.
Thinking Machines Lab의 Inkling 모델과 Moonshot AI의 Kimi K3 모델 발표
Thinking Machines Lab은 9750억 개의 파라미터를 가진 Inkling 모델을 발표했다. 이 모델은 41억 개의 활성 파라미터와 텍스트, 이미지, 오디오 입력을 지원하며, 100만 토큰의 컨텍스트 윈도우를 갖추고 있다. Moonshot AI는 2.8조 개의 파라미터를 가진 Kimi K3 모델을 소개했으며, 이는 896명의 전문가 중 16명을 활성화하고, 비전과 100만 토큰의 컨텍스트를 지원한다. PrismML은 5.9GB의 크기를 가진 Bonsai 27B 모델을 발표했으며, 이는 현대 스마트폰의 메모리에 적합하다고 주장하고 있다. OpenAI는 GPT-Red라는 내부 자동화된 레드팀 시스템을 도입하여 다른 모델의 취약점을 발견하고 공격하는 데 사용하고 있다.
AI에 기반한 기술 전략을 수립한 경영진의 경험
Nik Suresh의 관점에서 AI 열풍이 대기업의 의사결정을 어떻게 압도하고 있는지를 다루고 있다. 한 경영진은 20억 달러 이상의 매출을 올리는 조직을 위해 AI 중심의 기술 전략을 수립했지만, 실제로 ChatGPT나 다른 AI 도구를 사용해본 적이 없다고 고백했다. 또 다른 사례로, 한 엔지니어는 자신의 직업을 유지하기 위해 AI에게 Go 저장소를 Zig로 재작성하도록 지시하는 상황을 언급했다. 고객의 경영진이 100배 생산성을 주장하는 상황에서, 공급업체의 경영진이 이를 반박하면 신뢰성에 타격을 줄 수 있다는 우려도 제기되었다.
AI 중심의 기술 전략을 수립하는 경영진이 실제 도구를 사용해본 경험이 없다는 점은 기업의 의사결정 과정에서의 신뢰성 문제를 시사한다.
Claude Code v2.1.181에서 Rust로 작성된 Bun 사용
Claude Code v2.1.181(2023년 6월 17일 출시)부터 Rust 포트의 Bun을 사용하며, 리눅스에서 시작 속도가 10% 빨라졌지만 다른 변화는 거의 없었다. Claude Code 설치에서 Bun v1.4.0이 사용되고 있는 것을 확인할 수 있었으며, 이는 아직 출시되지 않은 Bun 버전의 미리보기를 지원한다. Rust 버전은 현재 Bun canary로 제공되며, 'bun upgrade --canary' 명령어로 설치할 수 있다.
Claude Code는 Rust로 작성된 Bun을 사용하여 성능 개선을 이루었다.
Mamdani 시장, 집주인이 AI 이미지를 사용해 광고할 수 없다고 발표
Mamdani 시장은 집주인들이 AI 이미지를 사용하여 부동산을 광고하는 것을 비밀리에 할 수 없다고 밝혔다. 이와 관련된 논의는 Hacker News에서 이루어졌으며, 해당 기사에는 28개의 댓글이 달렸다.
Dave Eggers, OpenAI 직원들에게 ChatGPT의 교육계에 미치는 영향 비판
작가 Dave Eggers는 Sam Altman의 초청으로 OpenAI 직원 약 200명에게 강연을 하였으며, 이 자리에서 ChatGPT가 교육자들에게 미치는 영향이 재앙적이라고 언급했다. 그는 ChatGPT가 의도했든 아니든 교육계에 부정적인 영향을 미쳤다고 주장했다.
SQLite Query Explainer: SQLite 쿼리 계획을 설명하는 도구
SQLite Query Explainer는 Python에서 Pyodide를 통해 웹 브라우저에서 SQLite를 실행하고, EXPLAIN 및 EXPLAIN QUERY PLAN의 결과에 대한 설명을 추가하는 인터랙티브 도구이다. 이 도구는 Julia Evans의 블로그에서 영감을 받아 개발되었으며, SQLite 쿼리 계획을 읽는 데 도움을 줄 수 있다.
catmind-1.2b 모델 소개
catmind-1.2b는 LFM2.5-1.2B-thinking 모델을 기반으로 한 고양이 관련 이야기 생성 모델이다. 이 모델은 사용자의 질문에 대해 관련 없는 고양이 이야기를 생성하며, 정확도는 24.3%로 LFM2.5-1.2B-Thinking의 75.6%와 LFM2.5-1.2B-Instruct의 49.2%에 비해 낮다. 이 모델은 진지한 작업에 사용하지 않는 것이 권장된다.
catmind-1.2b의 정확도는 24.3%로, 기존의 LFM2.5-1.2B-Thinking 모델보다 성능이 떨어진다.
Basalt Labs, HLE에서 99.44% 주장과 DeepSeek 모델 제공
Basalt Labs는 HLE에서 99.44%의 성능을 주장하며, 그들이 공개한 모델은 Qwen2.5-7B-Instruct 기반이다. 또한, 그들이 웹사이트에서 제공하는 모델은 DeepSeek이다.
99.44%의 성능 주장은 모델의 신뢰성을 검증하는 데 중요한 요소가 될 수 있다.
AI가 의료 사전 승인 절차를 개선할 수 있을까?
의료 사전 승인(prior authorization) 절차는 환자가 의사가 추천한 치료를 받기 위해 건강 보험사의 승인을 받는 과정이다. 이 과정은 비용 절감의 역할을 하지만, 많은 의사들은 승인 지연으로 인해 환자가 치료를 포기할 수 있다고 우려하고 있다. AI는 방대한 정보를 효율적으로 처리하여 명확한 청구의 승인을 신속하게 할 수 있는 가능성이 있지만, AI 기반의 사전 승인은 잘못된 보험 청구 거부를 증가시킬 수 있다는 저항에 직면해 있다. 2025년 미국의사협회 조사에 따르면, 61%의 의사가 AI가 필요한 치료의 거부를 악화시킬 것이라고 우려하고 있다.
2025년 미국의사협회 조사에서 61%의 의사가 AI가 필요한 치료의 거부를 악화시킬 것이라고 우려하고 있다.
OpenAI의 GPT-5.6 모델과 DeepSeek-R1의 추론 모델
OpenAI는 최근 GPT-5.6 모델 패밀리를 출시했으며, 이 모델은 세 가지 크기로 제공되고 각기 다섯 또는 여섯 가지 추론 노력 설정을 포함한다. DeepSeek-R1은 강화 학습을 통한 검증 가능한 보상(RLVR) 기법을 사용하여 LLM을 추론 모델로 전환하는 방법을 제안했다. RLVR은 수학과 코드와 같은 검증 가능한 데이터 도메인에서 보상 신호를 제공한다. 이 과정에서 중간 추론 흔적은 모델 훈련에 사용되지 않았다.
GPT-5.6 모델은 다양한 추론 노력 설정을 통해 복잡한 문제 해결 능력을 향상시킬 수 있다.
바이브 코딩 전에 알아야 할 7가지 기본 개념
바이브 코딩을 할 때 발생할 수 있는 문제는 기본 개념 부족에서 비롯된다. AI는 확률 기반 생성으로 항상 옳지 않으며, 결과를 직접 실행하고 검증해야 한다. 프롬프트를 구체적으로 나누어 요청하고, HTML, CSS, JavaScript, 터미널, 컨텍스트를 이해하면 문제 해결이 쉬워진다. Git을 사용해 저장 지점을 만들고 로컬과 배포의 차이를 이해해야 안정적인 결과물을 공유할 수 있다.
AI는 확률 기반 생성으로 항상 정확하지 않으므로, 결과를 검증하는 습관이 필요하다.
AI와 200만 줄의 코드 작성 경험에서 얻은 교훈
25년 경력의 소프트웨어 아키텍트가 AI와 함께 200만 줄의 코드를 작성했으나, 실제로는 단 5분도 자율적으로 작동하지 않는 결과물을 경험했다. AI에게 ‘무엇을(what)’과 ‘어떻게(how)’만 주면 작동하지 않는 코드가 생성되며, 빠진 변수는 ‘왜(why)’라는 점을 강조했다. AI의 속도는 빠르지만, 엔지니어링의 완성도는 부족하다는 문제를 지적하며, AI의 결과물이 껍데기에 불과할 수 있음을 경고했다.
AI에게 ‘왜(why)’를 명확히 제시하지 않으면, 기능적으로 텅 빈 코드가 생성될 수 있다.