Category
생성 이미지·영상·음성
생성 이미지·영상·음성은 텍스트나 레퍼런스로 시각·음성 결과물을 만들어내는 멀티모달 생성 영역이다. 한국 개발자·제작자에게는 콘텐츠 제작 단가를 낮추는 동시에, 저작권·라이선스·딥페이크 규제가 실무 도입의 전제 조건이 된다.
AI로 제작된 영화 Odysseus: The Fall의 실패
AI 회사 Fountain 0가 제작한 영화 Odysseus: The Fall은 Ash Koosha가 각본과 감독을 맡았으며, 주인공의 모습과 음악도 그가 만들었다. 이 영화는 크리스토퍼 놀란의 오디세이에 대한 관심을 불러일으킨 반면, AI로 제작된 이 새로운 영화는 원작에 대한 부정적인 반응을 초래할 정도로 질이 낮다. Fountain 0의 이전 작품은 올해 트라이베카 영화제에 출품된 Dreams of Violets이다.
Ruby Justice Thelot과의 인터뷰: 인터넷 문화와 현실 세계의 경계
Elena Burger는 학자이자 사이버 민족학자인 Ruby Justice Thelot과 인터넷 문화와 현실 세계의 경계가 점점 모호해지는 상황을 논의한다. 이들은 웰니스와 최적화 문화, 펩타이드, GLP-1, 웨어러블 기기, 미세 플라스틱, 정량적 자아 등을 사례로 사용하여, 현상에 대한 대화가 그 현상 자체보다 커질 수 있는 '파라콘텐츠' 개념을 설명한다. 또한, 신체 최적화의 역사와 기술이 개인이 자신을 측정하고 수정하는 방법을 더욱 세분화하는 방식에 대해 논의하며, 앞으로는 동일한 이상을 향한 최적화가 아닌 개별화되고 때로는 극단적인 형태의 '신체 미래주의'가 나타날 것이라고 예측한다.
중국 최초의 AI 생성 장편 TV 시리즈 '후西游记' 방영
중국의 Mango Excellent Media가 8월 31일 '후西游记'의 TV 적응판을 방영했다. 이 시리즈는 전통적인 TV 드라마 제작 기간인 1-2년과 달리 6개월 만에 제작되었으며, ByteDance의 Seeedance 2.0과 2.5 모델을 사용해 모든 비주얼을 생성했다. 한 에피소드의 예산은 약 90만 RMB로, 이 중 1/4은 컴퓨팅 비용에 해당한다. 그러나 AI 생성 콘텐츠의 한계로 인해 섬세한 표정과 복잡한 움직임에서 오류가 발생하는 등 기술적 도전이 여전히 존재한다.
Amazon Bedrock Knowledge Base에서 TwelveLabs Marengo Embed 3.0 사용 가능
TwelveLabs Marengo Embed 3.0이 Amazon Bedrock Knowledge Bases에서 사용할 수 있게 되었다. 이 모델은 비디오, 오디오, 이미지, 텍스트를 512차원 벡터 공간으로 인코딩하며, 자연어 검색을 통해 비디오 및 이미지 콘텐츠를 관리할 수 있는 기능을 제공한다. Amazon Bedrock은 비디오 파일(MP4, MOV), 이미지(JPEG, PNG), 오디오 트랙을 지원하며, Amazon S3와의 네이티브 연결 기능을 갖추고 있다.
OpenAI, ChatGPT Images 2.5 발표
OpenAI가 ChatGPT Images 2.5를 발표했다. 이 모델은 사용자들이 스토리보드, 스프라이트 시트, 스톱모션, 10초짜리 GIF 애니메이션 등 다양한 결과물을 생성할 수 있게 하여 정지 이미지의 활용 범위를 확장했다. 발표 이후 24시간 내에 많은 사용자들이 이 모델을 활용한 결과물을 공유했다.
Astra와 Fable의 로켓 게임 비교 실험 결과
Fireship 영상이 9월 9일 공개되었으며, AI가 만든 로켓 게임 Astra와 Fable 5.1을 비교한 결과 첫인상이 좋은 게임과 지속적으로 재미있게 플레이할 수 있는 게임의 차이를 보여주었다. 아이들의 선택도 달랐고, 그래픽, 재미, 실제 사용 목적에 대한 평가가 필요하다는 점을 강조하고 있다.
Decoder 팟캐스트에서 AI 관련 피드백과 논의
Decoder 팟캐스트에서 Nilay Patel과 Greg Ott이 청취자 피드백을 다루는 에피소드를 진행했다. 특히 'software brain' 비디오에 대한 반응이 많았으며, 긍정적인 피드백이 주를 이루었다. Nilay은 AI 시스템의 소프트웨어 작성 능력과 데이터베이스 조작에 대한 높은 기대감과 함께 AI의 과대광고 주기를 언급했다.
NVIDIA, IBC 2026에서 방송 및 스포츠에 실시간 AI 도입
NVIDIA는 IBC 2026에서 방송, 스포츠 및 제작 워크플로우를 위한 NVIDIA AI for Media의 확장을 발표했다. 이 SDK는 오디오, 비디오 및 증강 현실 효과를 향상시키며, NVIDIA Synthetic Video Detector(SVD)는 영상의 진위 여부를 평가하는 데 도움을 준다. SVD는 텍스트-비디오 콘텐츠에서 99.3%, 이미지-비디오 콘텐츠에서 97.7%의 정확도를 기록하고 있다. 또한, NVIDIA 3D Body Pose는 단일 카메라로 인체 관절 위치와 각도를 추정하여 스포츠 분석에 활용된다.
Adobe Premiere의 AI 생성 도구 사용성 개선
Adobe는 Premiere 비디오 편집 소프트웨어에서 AI와의 상호작용 방식을 개편하고 있다. 새로운 Generative Media 도구를 통해 편집자는 프로젝트 타임라인을 벗어나지 않고도 비디오, 음향 효과, 음악 및 사운드스케이프를 생성할 수 있다. 이제 편집자는 비디오 또는 오디오 트랙의 빈 공간을 강조 표시하고, 문맥에 맞는 완전 편집 가능한 클립을 생성할 수 있다.
Roland의 Melody Flip, 생성 AI 음악 도구 출시
Roland의 새로운 Melody Flip 도구는 생성 AI 음악 분야로의 진입을 알리는 제품이다. 이 도구는 디지털 오디오 워크스테이션(DAW)용 플러그인으로 제공되며, 약 250개의 '팔레트'를 통해 장르별로 테마가 정리된 음악 아이디어를 제공한다. 사용자는 처음부터 시작하여 멜로디, 코드 진행, 베이스라인, 드럼의 조합을 생성할 수 있으며, 참조 트랙을 제공하면 그 멜로디 아이디어를 기반으로 작업할 수도 있다. 그러나 Melody Flip은 Suno나 Udio처럼 완전한 곡을 생성하지는 않는다.
GPT-6 Astra와 GPT-5.6 모델 비교
GPT-6 Astra를 사용하여 다양한 수준의 펠리컨 이미지를 생성하고, 이를 GPT-5.6 Sol, Terra, Luna와 비교한 결과 Astra의 이미지 품질이 월등히 우수하다는 점이 확인되었다. Astra의 가격은 Sol보다 약 두 배 비쌌지만, 각 수준에서 사용하는 토큰 수가 적어 가격 차이가 줄어들었다. 특히 Astra의 저수준 모델이 9.55센트로 모든 GPT-5.6 Sol 모델보다 나은 결과를 보여주었다.
NVIDIA DLSS 5 적용된 NBA 2K27 포함, 28개 게임 GeForce NOW에 추가
9월에 GeForce NOW에 28개의 게임이 추가되며, 그 중 NBA 2K27은 NVIDIA DLSS 5 3D-Guided Neural Rendering 기능을 적용하여 사실적인 조명과 소재 디테일을 제공한다. GeForce NOW Ultimate 회원은 PC, Mac, 모바일 기기 등에서 NBA 2K27을 스트리밍할 수 있으며, DLSS 5는 GeForce RTX 5080 기반 클라우드 환경에서 사용할 수 있다. 또한 Rebel Wolves의 The Blood of Dawnwalker와 Capcom의 Onimusha: Way of the Sword도 새롭게 추가되었다.
할리우드에서 AI 사용 증가와 관련된 영화제 소식
영화 제작자들은 비용 절감을 위해 AI를 활용하고 있으며, Reply AI Film Festival에서 최종 후보로 선정된 Mike Bennion은 현재 제작 중인 할리우드 영화에서 AI를 사용해 비용 문제를 해결하려고 한다고 밝혔다. Catherine Hardwicke 감독은 최근 몇 달간 만난 모든 감독들이 AI에 대해 호기심을 보였다고 전했다. A24는 Google과 7500만 달러 계약을 체결했고, Disney는 OpenAI와 10억 달러 계약을 체결하여 AI 비디오 생성 제품 Sora에 대한 라이센스를 확보했다. Netflix는 올해 300개의 타이틀에 AI를 사용했다고 밝혔다.
25년의 핀테크 역사와 Affirm의 발전
Erik Torenberg은 a16z의 Alex Rampell 및 Affirm의 공동 창립자이자 CEO인 Max Levchin과 함께 핀테크의 25년을 돌아보며 디지털 결제의 초기와 Affirm의 기원, 그리고 에이전틱 상거래의 다음 세대에 대해 논의했다. 그들은 결제가 어떻게 발전했는지, 카드 인터페이스가 왜 대체하기 어려운지, 결제의 작은 부분들이 어떻게 큰 시장이 될 수 있는지에 대해 이야기했다. 또한, Affirm의 초기 아이디어와 할부 금융이 상인 전환율을 극적으로 증가시킬 수 있다는 점에 대해서도 논의했다.
AI로 생성된 음식 이미지의 문제점
레스토랑, 카페, 브랜드들이 AI를 사용해 음식 이미지를 생성하면서 비위생적이고 식욕을 떨어뜨리는 결과물이 나오고 있다. 예를 들어, 도넛 새우, 심해에서 온 루벤 샌드위치, 벌레 같은 국수, 아이스크림처럼 보이는 건축 자재 등이 포함된다. 이러한 이미지들은 소비자에게 부정적인 인상을 줄 수 있다.
Fal의 H3 Max Live, 비디오 생성 속도 35배 향상
Fal은 Minimax의 H3 모델을 후처리하여 비용과 품질을 개선한 후, 자체 추론 엔진에 최적화하여 공식 엔드포인트보다 35배 빠른 속도로 비디오를 생성할 수 있게 했다. 이로 인해 무한한 AI 생성 라이브 스트림을 구현하게 되었으며, 사용자가 채팅에 입력한 내용이 다음 비디오로 생성되어 연결된다.
SlopTV: YouTube 채팅으로 생성된 AI 콘텐츠 무한 라이브 스트림
SlopTV는 YouTube 라이브 스트림으로, 사용자가 입력한 내용을 기반으로 LLM이 400단어의 구조화된 비디오 프롬프트를 생성하고, MiniMax H3를 이용해 15초 분량의 영상을 렌더링하여 방송한다. H3 모델은 66GB의 디스크 공간을 차지하며, int8 프룬 확산 모델은 19.5GB, nvfp4 텍스트 인코더는 14.6GB로 32GB 카드에 모두 적재할 수 없다. GPU당 약 90초마다 새로운 클립이 생성되며, 사용자가 채팅하지 않을 경우 LLM은 독자적으로 개념을 생성한다.
Fotor의 Video Agent로 정밀 모션 그래픽 및 비디오 생성 및 편집
Fotor의 Video Agent는 채팅을 통해 정밀한 모션 그래픽과 비디오를 생성하고 편집할 수 있는 기능을 제공한다.
Topview Motion Studio로 After Effects 없이 런치 비디오 제작하기
Topview Motion Studio는 After Effects를 사용하지 않고도 런치 비디오를 제작할 수 있는 도구이다.
AI 생성 음악의 진위 논란과 음악가들의 대응
오디오 중심의 생성 도구와 플랫폼이 발전하면서 인터넷에는 AI로 생성된 음악이 증가하고 있다. 이러한 음악은 인간 아티스트의 작업에서 파생된 멜로디와 보컬을 알고리즘적으로 생성한 것이다. 일부 제작자는 AI 사용을 인정하지만, 다른 이들은 대중의 감시가 커지기 전까지 이를 부인하기도 했다. 특히 전자 음악과 같은 기술 중심의 예술을 창작하는 음악가들에게 '진짜'와 '가짜'의 경계는 더욱 시급하고 개인적인 문제로 다가오고 있다.
Amazon Quick과 fal을 활용한 창의적 워크플로우 구축
창의 팀은 증가하는 자산, 형식 및 수정 요구에 직면하고 있으며, 이로 인해 작업이 도구 간에 분산되어 있다. 이를 해결하기 위해 미디어 기업은 맥락을 보존하고 장기적인 미디어 작업을 지원하며, 주요 창의적 단계에서 인간 검토를 도입하는 재사용 가능한 에이전트 하네스를 필요로 한다. Amazon Quick은 에이전트 작업 공간으로 사용되며, fal은 생산 준비가 완료된 생성 미디어 기능을 제공한다. Model Context Protocol(MCP)은 이들을 연결하는 표준 인터페이스 역할을 한다.
소니 뮤직과 워너 뮤직, 앤트로픽 상대 저작권 소송 제기
소니 뮤직과 워너 뮤직의 일부 자회사들이 앤트로픽을 상대로 저작권 침해 소송을 제기했다. 이들은 앤트로픽이 수만 곡의 저작권 음악을 불법적으로 사용하여 AI 모델 'Claude'를 개발했다고 주장하고 있으며, 각 침해 곡당 수십만 달러의 손해배상을 요구하고 있다. 이 소송은 음악과 AI, 지적 재산 보호에 대한 장기적인 논쟁의 시작을 알리는 사건으로 주목받고 있다.
Stability AI, 2억 3200만 달러의 총 자금 조달 완료
Stability AI는 2026년 8월 25일, 7600만 달러의 시리즈 B 자금 조달을 발표하며 총 자금 조달액이 2억 3200만 달러에 도달했다고 밝혔다. 이번 자금은 음악, 게임 및 엔터테인먼트 분야의 창작 도구 개발, 연구 심화 및 전문 서비스 확장을 위해 사용될 예정이다. 투자자 그룹에는 Electronic Arts, Sony Music Group, Universal Music Group, Warner Music Group 등이 포함되어 있다.
Stanley Druckenmiller, 월스트리트 저널 기고문에 AI 활용
투자자 Stanley Druckenmiller는 월스트리트 저널에 기고한 글을 작성하는 데 AI를 사용했다고 밝혔다. 그의 기사는 재무부 장관 Scott Bessent에 대한 비판으로 주목받았으며, AI의 사용이 금융 커뮤니티에서 긍정적으로 받아들여졌다. WSJ의 의견 편집자 Paul Gigot은 AI가 현대 생활의 일부이며, 기고자가 AI를 사용해도 원래 주장을 반영하는지 여부가 중요하다고 말했다. 반면, Financial Times는 AI 사용을 금지하는 정책을 가지고 있다.