본문으로 건너뛰기

Category

생성 이미지·영상·음성

생성 이미지·영상·음성은 텍스트나 레퍼런스로 시각·음성 결과물을 만들어내는 멀티모달 생성 영역이다. 한국 개발자·제작자에게는 콘텐츠 제작 단가를 낮추는 동시에, 저작권·라이선스·딥페이크 규제가 실무 도입의 전제 조건이 된다.

News·

중국에서의 "Artificial Challenged Intelligence" 경험 공유

중국 매체 Renwu에서 독자들이 공유한 'Artificial Challenged Intelligence'에 대한 이야기들이 소개되었다. 한 사용자는 AI가 중국의 유명한 쌍방향 코미디 그룹인 Deyunshe에 대한 정보를 요청했을 때, AI가 잘못된 세대 순서를 포함한 목록을 생성하여 수정했다. 또 다른 사용자는 AI가 건강 관련 질문에 대해 과거의 경험을 언급하며 답변했다고 전했다. 13세 학생은 AI에게 잘못된 수학 문제를 입력했을 때 AI가 내부 갈등을 겪으면서도 최종 결과에 문제를 언급하지 않았다고 했다.

ChinAI (Jeffrey Ding)
News·

Michael Morton과의 인터뷰: AI 시대의 전자상거래

Michael Morton과의 인터뷰에서 전자상거래와 AI에 대한 논의가 이루어졌다. 주요 내용으로는 반증할 수 없는 비관적 시나리오의 도전, 유통 모델과 추천 모델의 차이, 식료품 분야, 자율주행 차량 등이 포함되었다.

Stratechery (Ben Thompson)
News·

Fox의 Roku 인수에 대한 시장 반응

Fox는 Roku를 인수했지만 시장은 이 결정에 부정적인 반응을 보이고 있다. Fox는 권리 보유자로부터의 수익 추출을 통해 임대자로서의 레버리지를 확보하려 하고 있다.

Stratechery (Ben Thompson)
News·

Amazon MGM, Sam Altman에 관한 영화 'Artificial' 제작 중단

Luca Guadagnino가 감독한 OpenAI CEO Sam Altman에 관한 영화 'Artificial'이 Amazon MGM에 의해 제작 중단되었다. 이 영화는 Andrew Garfield가 주연을 맡고 있으며, 2023년 Altman의 해고와 복귀를 포함한 5일간의 이야기를 다룬다. 출연진에는 Monica Barbaro, Ike Barinholtz, Yura Borisov도 포함되어 있다. 스튜디오는 이 영화가 다른 스튜디오에 의해 배급되는 것이 더 나을 것이라고 밝혔다.

The Verge — AI
News·

Dialog Club, 회원을 돈과 명성으로 평가하는 비밀 네트워크

유출된 파일에 따르면, Dialog Club은 초대 전용 네트워크로, 회원들을 돈과 명성에 따라 평가하여 누가 포함되고 제외되는지, 누가 비용을 지불하는지를 결정한다.

WIRED — AI
News·

Google, 앨라배마 잭슨 카운티에 15억 달러 투자 발표

Google은 2026년과 2027년에 앨라배마 잭슨 카운티에 있는 데이터 센터 캠퍼스를 확장하기 위해 15억 달러를 투자할 계획이라고 발표했다. 이 데이터 센터는 2019년부터 운영되고 있다.

Google AI Blog
News·

엄마는 AI를 사용하나요?

해당 기사에서는 AI 사용에 대한 일반적인 질문을 던지며, 특히 개인의 일상에서 AI의 활용 여부에 대해 이야기하고 있다. 구체적인 사례나 데이터는 제시되지 않았다.

Hacker News — AI 검색 피드 (hnrss)
News·

Lobste.rs에서 좋은 댓글과 통찰을 모으려는 요청

Lobste.rs 포럼에서 과거에 묻힌 좋은 댓글과 통찰을 모으려는 요청이 있었다. 이 요청은 가끔 오래된 댓글에서 유용한 통찰을 발견한 경험을 바탕으로 하고 있다.

GeekNews (긱뉴스)
News·

Ada Palmer와의 대화: 마키아벨리의 오해

Ada Palmer가 마키아벨리에 대해 이야기했다. 마키아벨리는 피렌체의 고위 외교관으로서 유럽의 중요한 통치자들을 관찰했으며, 1513년 메디치 가문이 피렌체를 재장악하면서 쿠데타 시도 혐의로 해고, 고문, 추방당했다. 그는 자신의 경험을 바탕으로 권력, 정치, 인간 본성에 대한 교훈을 책으로 엮어 메디치 가문의 로렌조에게 헌정했다. 그의 통찰력은 피렌체를 방어하는 데 사용될 수 있었다.

Dwarkesh Podcast
News·

Lars Brownworth와 함께하는 바이킹 역사 탐구

Lars Brownworth는 바이킹 역사, 중세 유럽, 비잔틴 제국을 전문으로 하는 역사학자이자 강사, 팟캐스터, 저자이다. 이번 에피소드에서는 바이킹 시대의 시작, 군사 전략, 전술 및 기술, Ragnar Lothbrok, 대 이교도 군대, 롤로와 노르망디, 바이킹 종교와 발할라, 북미 및 동부의 바이킹 탐험에 대해 논의한다.

Lex Fridman Podcast
News·

FFmpeg와 VLC 개발자 인터뷰

Jean-Baptiste Kempf는 VLC의 수석 개발자이자 VideoLAN의 회장이다. Kieran Kunhya는 FFmpeg의 오랜 기여자로, 코덱 엔지니어이며 X에서 유명한 FFmpeg 계정의 운영자이다. 이 팟캐스트에서는 FFmpeg의 역사, 비디오 재생 방식, 비디오 코덱 및 컨테이너에 대한 설명이 포함되어 있다.

Lex Fridman Podcast
News·

완벽한 셔플 7회로 카드 덱이 무작위화된다

완벽한 셔플이 7회 이루어질 경우 카드 덱이 무작위화된다는 내용이 담긴 기사이다. 그러나 '슬로피' 셔플, 즉 완벽하지 않은 셔플이 몇 회 필요할지는 논의되고 있다.

Hacker News (Front Page)
News·

유럽 쇠퇴에 대한 내러티브에 도전하는 기사

기사 URL: https://paulkrugman.substack.com/p/challenging-the-narrative-of-european-478, 댓글 URL: https://news.ycombinator.com/item?id=48583843, 포인트: 38, 댓글 수: 25

Hacker News (Front Page)
News·

병원과 대학, 약물 재사용 비용 90% 절감

병원과 대학들이 약물을 재사용하여 비용을 90% 낮추고 있다는 소식이다.

Hacker News (Front Page)
News중급·

Nano Banana Pro(Gemini 3 Pro Image) GA, 이미지 속 다국어 텍스트 렌더링 신뢰도 확보

구글의 이미지 라인업 별칭 '나노 바나나'가 2026년 상반기에 두 단계 도약했다. 2월에 Nano Banana 2(Gemini 3.1 Flash Image)가 'Pro 품질을 Flash 속도로'라는 슬로건과 함께 Gemini 앱에 풀렸고, 6월에는 Gemini 3 Pro 기반의 Nano Banana Pro(Gemini 3 Pro Image)가 정식 출시(GA)됐다. Pro의 핵심 차별점은 텍스트 렌더링이다. Stable Diffusion 시절부터 이미지 속 글자는 거의 항상 알아볼 수 없는 장식성 기호로 깨지는 게 업계의 고질적 실패 모드였는데, Nano Banana Pro는 긴 문장과 다국어 레이아웃까지 읽히는 글자로 안정 출력하는 첫 모델로 평가된다. 네이티브 1K 출력에 2K·4K 업스케일이 내장됐고, 4K 이미지 1장당 0.24달러로 과금된다. 원조 Gemini 2.5 Flash Image(2025년 8월 출시, 2주 만에 5억 장 생성·신규 2,300만 명 유입의 바이럴)는 10월 2일 일부 플랫폼에서 은퇴 예정이라 Pro/3.1 계열로의 이전이 권장된다.

Google DeepMind / blog.google
News중급·

Microsoft, 음성·전사·이미지 생성까지 자체 학습한 MAI 7종 일괄 공개

Microsoft AI가 6월 2일 자체 개발한 MAI 모델 7종을 한꺼번에 공개했다. 추론 모델 MAI-Thinking-1(체급 내 SWE·수학 강세), GitHub Copilot·VS Code에 통합되는 50억 파라미터 코딩 모델 MAI-Code-1-Flash, 이미지 생성·편집 모델 MAI-Image-2.5와 초경량 변형 Flash, 43개 언어를 경쟁 모델 대비 5배 빠르게 전사하는 MAI-Transcribe-1.5, 15개 언어 음성 합성·보이스 적응 MAI-Voice-2와 저비용 Flash 변형이 포함된다. Microsoft는 추론 모델을 '처음부터(from scratch)' 학습하며 '다른 랩에서 증류(distill)하지 않는다'고 명시했고, 데이터셋이 '깨끗하고 추적 가능하며 엔터프라이즈 등급'이라고 강조했다. 차세대 GB200 클러스터가 가동 중이라고 밝혔다.

Microsoft AI
Community비교·

이미지 생성 무료 옵션 한 달 비교, 시안은 Pollinations 본작업은 nano-banana로 끊어 쓴 이유

발산·시안은 키 없는 Pollinations, 확정 결과물은 부분편집 되는 nano-banana로 단계를 끊어 쓴 한 달 비교

박하준 @student_ai22
News초급·

Midjourney V8.1, 이미지-투-비디오로 2K HD·21초 영상 확장

Midjourney는 2026년 들어 V7을 기본 모델로 정착시킨 뒤 4월 30일 V8.1을 내놓았고, V8 알파는 네이티브 2K 렌더링으로 롤아웃 중이다. V7은 음성 프롬프팅, 향상된 포토리얼리즘, 캐릭터 일관성을 위한 Omni Reference, 손·신체·오브젝트 정합성 개선, 그리고 영상 생성 능력을 도입했다. 영상은 이미지-투-비디오 방식으로 정지 이미지를 5초 클립으로 만든 뒤 최대 21초까지 확장할 수 있다. V8.1은 더 빠른 생성, HD 2K 이미지 출력, 프롬프트 준수도 향상, Raw 모드 옵션을 더했다. 요금제는 Basic 월 10달러, Standard 30달러, Pro 60달러, Mega 120달러의 4단계 구조다. 여전히 공개 API보다는 자체 인터페이스 중심으로 운영돼, 자동화 파이프라인에 끼우려면 비공식 경로 의존도가 높다는 점은 유의해야 한다.

PixVerse / Midjourney
News중급·

Sora 2, 컨슈머 앱 종료에 API도 9월 일몰

Sora 2는 물리적으로 더 정확한 모션, 컷이 바뀌어도 유지되는 월드 상태(world-state persistence), 그리고 대사·효과음·앰비언트를 영상과 동기화해 함께 생성하는 능력으로 영상 생성의 사실성을 한 단계 끌어올렸다. 1080p Full HD가 표준 출력이 됐고, 동기화된 오디오를 포함한 10~25초 클립을 만든다. 'Character Cameos'로 자신이 생성한 캐릭터·반려동물 등을 새 영상에 불러오는 기능과, IP·실사 인물 콘텐츠를 차단하는 책임형 AI 가드레일도 도입됐다. 다만 운영 동향이 중요하다. 2026년 1월 10일부터 무료 사용자의 생성이 막혀 Plus/Pro 전용이 됐고, 4월 26일 자로 컨슈머용 Sora 앱·웹 경험이 중단됐다. 개발자용 Sora 2 API는 현재까지 작동하지만 2026년 9월 24일 최종 일몰이 예고돼 있어 남은 기간이 제한적이다.

OpenAI / Synergy Labs
Community실험 리포트·

노트북 내장 마이크 회의 녹음, STT 앞에 speech enhance 한 단을 끼우니 받아쓰기가 살아났다

배경 소음에 묻힌 회의 녹음에 Adobe media enhance speech를 전처리로 넣으니 STT 정확도가 올라갔다. 다만 화자 분리 한계는 그대로다.

송미래 @designer_ai
News중급·

OpenAI, 추론 탑재한 첫 에이전트형 이미지 모델 gpt-image-2 출시

OpenAI가 2026년 4월 21일 gpt-image-2(ChatGPT Images 2.0)를 공개했다. 가장 큰 변화는 O-시리즈의 추론 능력을 이미지 생성에 통합한 점으로, 모델이 곧장 픽셀을 뱉는 대신 이미지의 구조와 레이아웃을 먼저 계획·추론한 뒤 생성한다. 그동안 디퓨전 계열의 고질병이던 이미지 내 텍스트 렌더링이 약 99% 정확도로 끌어올려졌고, 라틴 문자뿐 아니라 한국어·일본어·아랍어·힌디·벵골어 등 십수 개 문자 체계를 안정적으로 그린다. 최대 4K 해상도를 지원해 포스터·목업·UI 시안 같은 실무 산출물에 바로 투입할 수 있는 수준이다. ChatGPT와 Codex 사용자에게는 4월 22일부터 제공됐고, 개발자용 API는 5월 초 열렸다. API 가격은 입력 100만 토큰당 8달러, 출력 100만 토큰당 30달러로 책정됐다. 무료 사용자는 1월부터 이미지·영상 생성에서 제외돼 Plus/Pro 전용 흐름으로 정리됐다.

getimg.ai / OpenAI
Community활용 사례·

데모 마켓 시드 이미지를 크롤 대신 생성으로 채워서 라이선스 문제를 통째로 없앴다

카테고리별 샘플 이미지 24장을 어디서 긁느냐는 고민 자체가 틀렸고, 생성으로 채우니 권리관계가 사라졌다

정유나 @yuna_ai
News초급·

Google Veo 3.1, 네이티브 오디오 영상 생성으로 Vids·Vertex AI 워크플로 통합

구글의 Veo 3 계열은 2026년 상반기에 Veo 3.1로 정비되며 세 개 티어(베이스·Ultra 등)로 나뉘었고, 모든 티어가 네이티브 오디오 생성을 지원한다. 영상에 효과음·앰비언트·대사를 모델이 직접 생성해 입히며, 화면 동작에 묶인 효과음과 입모양 동기화(lip-sync) 대사까지 처리한다. 베이스 모델은 1080p·24fps에서 최대 8초 클립을, Veo 3 Ultra는 4K 출력과 60초 이상 장면 생성을 지원하는 것으로 정리됐다. 4월 2일에는 Google Vids에 Veo 3.1(영상)과 Lyria 3(음악)를 결합한 대규모 기능 업데이트가 공식 발표돼, AI 음악·아바타를 포함한 사내 영상 제작이 한층 자동화됐다. Vertex AI에는 Veo 3.1 Lite와 새 업스케일링 기능이 추가돼 비용·해상도 선택지가 넓어졌다.

Google Cloud Blog / DeepMind
News초급·

Suno v5.5, 내 목소리로 AI 노래 부르기와 커스텀 모델 파인튜닝

Suno가 2026년 3월 25일 v5.5를 출시하며 AI 음악 생성에 세 가지 핵심 기능을 더했다. 첫째 Voices는 커뮤니티 최다 요청 기능으로, 사용자가 자신의 노래하는 목소리를 캡처해 AI 생성 곡에서 그 음성으로 부르게 한다. 둘째 Custom Models는 본인이 권리를 가진 원곡 최소 6곡을 업로드하면 Suno가 그 스타일 패턴으로 v5.5를 파인튜닝해 주는 기능으로, Pro·Premier 사용자는 최대 3개의 커스텀 모델을 만들 수 있다. 셋째 My Taste는 개인 취향 기반으로 음악 생성을 개인화한다. Suno는 v5.5를 '가장 표현력 있고 가장 인간적인 버전'으로 소개하며, 이 역량들이 2026년 하반기 음악 업계와 함께 출시할 차세대 모델의 토대라고 밝혔다.

Suno Blog