News
AI 뉴스
매일 수집·정리하는 전세계 AI 소식을 최신순으로
예측적 인간 선호: 모델 라우팅을 통한 AI 모델 선택
예측적 인간 선호는 특정 쿼리에 대해 사용자가 선호할 모델을 예측하는 것을 목표로 한다. 이 접근법은 모델 라우팅에 활용될 수 있으며, 예를 들어 Claude Instant의 응답이 GPT-4보다 선호될 경우 해당 쿼리를 Claude Instant로 라우팅하여 응답 품질을 높이고 비용과 지연 시간을 줄일 수 있다. 또한, 모델의 성능을 다양한 프롬프트에서 분석하여 강점과 약점을 이해하는 데 도움을 줄 수 있다.
Gemini 1.5, MTOB 데이터셋에서 인간 수준 성능 기록
Gemini 1.5가 최근 MTOB라는 번역 데이터셋에서 인간 수준에 가까운 성능을 보였으며, 이를 통해 진정한 제로샷 기계 번역(true zero-shot MT)과 LLM이 새로운 언어를 배우는 방법에 대해 논의하고 있다. 저자들은 저자원 언어에 대한 기계 번역의 접근성을 높이기 위해 새로운 번역 기준이 마련되었음을 언급하며, WMT와 같은 회의에서 저자원 MT에 대한 공동 작업이 정기적으로 진행되고 있다고 설명한다. 또한, FLORES-200이 200개 언어에 대한 번역 데이터 범위를 확장했음을 알리고, 1000개 이상의 언어에 대한 MT 모델 훈련이 가능해졌음을 강조한다.
2024 AI 직업 시장의 변화와 연구 동향
최근 5년간 AI와 NLP 분야의 변화가 두드러지며, 연구가 더 응용 중심으로 이동하고 있다. 과거에는 기본 연구가 주를 이루었으나, 현재는 BERT 기반의 표현과 대형 언어 모델의 발전으로 연구와 응용 간의 격차가 줄어들고 있다. 스타트업에서의 경험이 박사 학위보다 더 빠른 기술 습득을 가능하게 하며, 연구자들은 안전하고 책임 있는 기술 사용에 대한 도전 과제를 고려해야 한다.
고품질 데이터의 중요성과 인간 주석의 역할
고품질 데이터는 현대 데이터 딥러닝 모델 훈련의 핵심 요소이다. 대부분의 작업별 레이블 데이터는 인간 주석에서 나오며, 이는 분류 작업이나 LLM 정렬 훈련을 위한 RLHF 레이블링에도 적용된다. 데이터 품질을 향상시키기 위한 다양한 ML 기법이 존재하지만, 인간 데이터 수집은 세부 사항에 대한 주의와 신중한 실행이 필요하다.
고품질 데이터 수집의 중요성을 인식하고 이를 위한 인력 배치와 자원 투입이 필요하다.
EMNLP 2023에서 열린 Big Picture Workshop의 주요 내용
EMNLP 2023에서 Big Picture Workshop이 개최되었으며, 다양한 연구 주제를 다룬 고품질 논문들이 제출되었다. 이 워크숍에서는 연구자들이 서로 다른 실험실에서 동일한 주제에 대해 의견을 나누고 통합하는 초청 강연이 진행되었고, 주제는 인-context 학습, 주의(attention)와 설명, 도덕성에 관한 것이었다. 인-context 학습에 대한 논의에서는 랜덤 레이블과 실제 레이블의 중요성에 대한 상반된 주장이 있었고, 주의 메커니즘의 유용성에 대한 평가가 이루어졌다. 또한, AI 모델에 도덕성을 가르치는 연구와 관련하여 새로운 데이터셋인 Value Kaleidoscope가 소개되었다.
AI 모델의 확률적 응답 생성 방식과 샘플링 기법
AI 모델은 확률적 특성을 가지며, 동일한 질문에 대해 서로 다른 응답을 생성할 수 있다. 이러한 특성은 창의적인 작업에 유리하지만, 사실 기반 작업에서는 일관성 부족과 환각을 초래할 수 있다. 모델의 응답 생성 과정은 샘플링(디코딩)으로 알려져 있으며, 샘플링 전략으로는 temperature, top-k, top-p 등이 있다. Temperature는 일반적인 토큰의 확률을 낮추고 희귀한 토큰의 확률을 높여 창의적인 응답을 생성하는 데 도움을 준다.
확률적 응답 생성 방식과 샘플링 기법을 이해하면 AI 모델의 성능을 개선하고, 사용자와의 상호작용에서 발생할 수 있는 혼란을 줄일 수 있다.
LLMs 시대의 NLP 연구 방향과 도전 과제
NLP 연구는 최근 1년간 패러다임의 변화를 겪었으며, 대규모 언어 모델(LLMs)의 효과가 입증되었다. 현재 대부분의 벤치마크에서 LLM이 최첨단 성능을 보이고 있지만, 이러한 모델의 미세 조정은 비용이 많이 들고, 몇몇 산업 연구소 외에서는 사전 훈련이 어렵다. 연구자들은 컴퓨팅 자원의 제약에 직면해 있으며, LLM이 아닌 분석이나 특정 주제에 집중해야 할 필요성이 제기되고 있다. 연구 방향으로는 LLM 시대의 연구 리뷰에서 영감을 받아 다섯 가지 주제를 강조하고 있다.
EMNLP 2023, 싱가포르에서 개최되는 NLP 컨퍼런스
EMNLP 2023이 12월 6일부터 10일까지 싱가포르에서 열리며, 주요 트렌드로는 instruction-tuned LMs와 LLMs의 광범위한 사용, LLM 기반 평가의 증가, 창의적인 프롬프트 사용, 다국어 연구의 증가가 있다. GenBench 워크숍은 NLP에서 일반화 연구를 촉진하고, NLP-OSS 워크숍은 오픈 소스 소프트웨어의 공유 문화를 강조한다. MRL 워크숍은 저자원 언어 개선을 위한 논의를 제공하며, QA에서 LLM의 환각 문제를 다루는 연구도 소개된다.
NeurIPS 2023, 3586편 논문 발표 및 NLP 관련 주요 트렌드
NeurIPS 2023이 12월 10일부터 16일까지 뉴올리언스에서 개최된다. 3586편의 논문이 채택되었으며, 이 중 자연어 처리(NLP) 관련 20편의 논문이 주목받고 있다. 대부분의 NLP 연구는 대형 언어 모델(LLM)과 관련되어 있으며, LLM의 특성을 분석하기 위한 합성 설정이 증가하고 있다. 인간의 선호에 기반한 모델 정렬이 많은 주목을 받고 있으며, RLHF 개선에 대한 연구가 진행되고 있다. 인-context 학습에 대한 포괄적인 이해는 여전히 부족하며, 다양한 추론 작업의 성능 향상에 대한 연구도 이루어지고 있다.
제3회 뉴잉글랜드 RLHF 해커톤에서의 프로젝트 소개
제3회 뉴잉글랜드 RLHF 해커톤에서 다양한 머신러닝 및 강화학습 관련 프로젝트가 발표되었다. 특히 'Pink Elephants Pt 3' 프로젝트는 Sid Verma와 Louis Castricato가 참여하여 ILQL(역 Q-학습으로부터의 학습)을 통해 핑크 엘리펀트 모델을 훈련하는 것을 목표로 하였다. 참가자와 향후 이벤트에 관심 있는 이들은 Discord 커뮤니티에 가입하여 더 많은 정보와 업데이트를 받을 수 있다.
대형 언어 모델의 작동 원리에 대한 여섯 가지 직관
대형 언어 모델은 텍스트 데이터에서 다음 단어를 예측하는 방식으로 사전 학습되며, 이 과정에서 다수의 작업을 학습한다. 예를 들어, 문법, 감정 분석, 번역 등 다양한 자연어 처리 작업을 다음 단어 예측을 통해 수행할 수 있다. 또한, 입력-출력 관계 학습을 다음 단어 예측으로 변환하는 '컨텍스트 내 학습'이 가능하며, 이는 GPT-3 논문에서 처음 제안되었다. 마지막으로, 정보 밀도가 다른 토큰을 고려하여 언어 모델이 더 많은 시간을 갖고 사고할 수 있도록 하는 것이 중요하다.
LLM 토크나이저와 의미 검색 과정 및 책 업데이트
Jay Alammar는 Deeplearning AI에서 LLM을 활용한 의미 검색 과정과 관련된 비디오를 제작했다. 이 과정에서는 LLM의 기본 원리, ReRank 도구를 통한 키워드 검색 개선, 임베딩을 활용한 Q&A 기능 향상 등을 다룬다. 또한, O'Reilly 플랫폼에서 'Hands-On Large Language Models'의 초기 버전이 제공되며, 현재 5개의 챕터가 포함되어 있다. 책의 다음 업데이트에서는 'A Look Inside Transformer LLMs'라는 제목의 챕터가 포함될 예정이다.
대규모 언어 모델에 대한 적대적 공격
ChatGPT의 출시로 대규모 언어 모델의 사용이 가속화되었다. OpenAI 팀은 모델의 안전한 행동을 보장하기 위해 많은 노력을 기울였으나, 적대적 공격이나 탈옥 프롬프트가 모델이 원치 않는 출력을 하도록 유도할 수 있다. 이미지에 대한 적대적 공격 연구는 많지만, 텍스트와 같은 이산 데이터에 대한 공격은 직접적인 기울기 신호 부족으로 인해 더 도전적이다.
대규모 언어 모델의 안전성을 확보하기 위한 연구와 개발이 필요하다.
Llemma: 수학을 위한 70억 및 340억 매개변수 언어 모델 출시
EleutherAI는 Llemma라는 70억 및 340억 매개변수의 수학 전용 언어 모델을 발표했다. Llemma 모델은 Code Llama 가중치로 초기화된 후, 550억 토큰의 수학 및 과학 문서 데이터셋인 Proof-Pile II로 훈련되었다. 이 모델은 향상된 수학적 능력을 보여주며, 프롬프트나 추가적인 파인튜닝을 통해 다양한 작업에 적응할 수 있다.
LMMs(대규모 다중 모달 모델)의 필요성과 활용
기존의 ML 모델은 텍스트, 이미지, 오디오 중 하나의 데이터 모드에서만 작동했으나, 인간의 자연 지능은 여러 모달리티를 활용한다. OpenAI는 GPT-4V 시스템 카드에서 LLMs에 이미지 입력과 같은 추가 모달리티를 통합하는 것이 AI 연구의 중요한 경계로 여겨진다고 언급했다. LMMs는 LLMs에 추가 모달리티를 통합한 모델로, 텍스트-이미지 변환 모델인 Midjourney, Stable Diffusion, Dall-E와는 다르다. LMMs는 다양한 입력과 출력을 처리할 수 있으며, CLIP과 Flamingo와 같은 시스템이 그 기초를 제공하고 있다.
다양한 데이터 모달리티를 처리할 수 있는 LMMs는 의료, 로봇 공학, 전자 상거래 등 여러 산업에서 필수적인 활용 사례를 가능하게 한다.
Mohammad Aflah Khan: IIIT Delhi 컴퓨터 공학 학부생의 여정
Mohammad Aflah Khan은 현재 IIIT Delhi에서 컴퓨터 과학 및 공학 학사 과정을 이수 중이며, 프로그래밍에 대한 열정을 가지고 있다. 그는 학문적 커리큘럼을 통해 코딩에 몰두할 기회를 적극적으로 수용하였고, 다양한 분야를 경험한 후 첫 학기 휴식 동안 딥러닝에 매료되었다.
LLM 연구의 주요 도전 과제
현재 LLM 연구에서 주요한 10가지 방향이 있으며, 특히 '환각(hallucination)'과 '맥락 학습(context learning)'이 주목받고 있다. 환각은 AI 모델이 사실이 아닌 정보를 생성하는 현상으로, 많은 기업들이 LLM을 생산에 도입하는 데 있어 가장 큰 장애물로 보고 있다. 환각을 줄이고 측정하는 방법에 대한 연구가 활발히 진행되고 있으며, 맥락 길이 최적화와 맥락 구성도 중요한 연구 주제이다. RAG(검색 보강 생성) 방식이 LLM 산업에서 주된 패턴으로 자리 잡고 있다.
Twitter에서의 AI 연구자 경험과 팔로워 증가 분석
2022년 2월 20일 378명의 팔로워로 시작해 2023년 5월 7일 23.6k명의 팔로워에 도달했다. 83개의 주요 트윗을 작성했으며, 12.5k명의 새로운 팔로워가 트윗 후 24시간 이내에 증가했다. 가장 많은 팔로워를 유도한 트윗은 OpenAI 합류와 Google의 Research Scientist로 전환에 관한 것이었고, 각각 3.5k와 1.2k의 새로운 팔로워를 얻었다. 팔로워 수가 증가함에 따라 비활동적인 날에도 더 많은 팔로워를 얻는 경향이 있었고, 16k에서 23k 팔로워 사이에는 61%가 트윗을 하지 않은 날에 증가했다.
AI 연구자들이 Twitter를 활용해 네트워킹과 아이디어 공유를 할 때, 팔로워 증가의 패턴을 이해하는 것이 중요하다.
Snowflake CEO Frank Slootman과의 대화: 데이터 클라우드와 AI
Snowflake Computing의 CEO Frank Slootman이 No Priors 팟캐스트에 출연하여 기업에서의 생성 AI 기회, Snowflake의 데이터 웨어하우징 개념, Neeva와 Streamlit 인수, Snowflake 내 앱, AI와 전통적인 분석 및 BI의 관계에 대해 이야기했다. Slootman은 또한 성과 관리의 중요성과 리더들이 성과 기준을 높이는 데 어려움을 겪는 이유에 대해서도 언급했다.
LLM 기반 자율 에이전트 시스템 개요
LLM(대형 언어 모델)을 핵심 컨트롤러로 사용하는 자율 에이전트 시스템은 여러 주요 구성 요소로 이루어진다. 에이전트는 복잡한 작업을 더 작은 하위 목표로 나누고, 과거 행동에 대한 자기 비판 및 반성을 통해 결과의 품질을 향상시킬 수 있다. 또한, 단기 메모리와 장기 메모리를 활용하여 정보를 유지하고 호출할 수 있으며, 외부 API를 호출하여 모델 가중치에 없는 추가 정보를 얻는 기능도 포함된다.
O'Reilly Media와 함께하는 'Hands-On Large Language Models' 저자 공동 집필
Maarten Grootendorst와 함께 'Hands-On Large Language Models'를 공동 집필하고 있으며, O'Reilly Media에서 출판될 예정이다. 이 책은 언어 모델을 활용한 텍스트 이해 및 생성에 대한 주요 직관을 시각적으로 설명할 계획이다. 개발자들이 필요로 하는 실용적인 사용 사례(분류, 의미 검색, 주제 모델링, 텍스트 생성, 프롬프트 엔지니어링)를 다룰 예정이며, 이후에는 기본 모델과 훈련 방법에 대한 여러 장이 이어질 것이다.
Generative AI 전략에 대한 발표 준비
Chip Huyen은 'Leadership needs us to do generative AI. What do we do?'라는 주제로 발표를 준비했다. 이 발표는 생성적 AI 전략을 고민하는 사람들을 위한 간단한 프레임워크를 제시하며, 많은 아이디어가 아직 구체화되고 있다고 전했다. 발표 슬라이드는 [여기](https://huyenchip.com/assets/genai.pdf)에서 다운로드할 수 있다.
Safetensors, 외부 보안 감사 결과 안전 확인 및 기본 형식으로 채택 예정
Hugging Face는 EleutherAI 및 Stability AI와 협력하여 safetensors 라이브러리에 대한 외부 보안 감사를 실시하였으며, 감사 결과는 이 라이브러리가 안전하다는 것을 보여주었다. 이 결과를 바탕으로 세 기관은 safetensors를 저장된 모델의 기본 형식으로 채택하는 방향으로 나아가고 있다. 감사 보고서는 Trail of Bits에 의해 수행되었으며, 자세한 내용은 해당 보고서를 통해 확인할 수 있다.
대형 언어 모델의 emergent abilities에 대한 논의
이 블로그 포스트에서는 대형 언어 모델의 emergent abilities에 대한 일반적인 주장을 검토한다. emergent abilities는 소형 언어 모델에는 없지만 대형 언어 모델에서 나타나는 능력으로 정의된다. 이러한 능력은 예측하기 어렵고, 훈련자가 명시적으로 지정하지 않는다. 성능 평가 지표에 따라 emergent abilities가 다르게 나타날 수 있으며, 예를 들어 정확한 일치 평가에서는 다단계 산술 문제에서 각 단계의 정확성이 중요하다. 그러나 부드러운 평가 지표를 사용할 경우 성능이 점진적으로 향상될 수 있다. 현재까지는 작은 모델을 사용하여 emergent 성능을 예측할 수 있는 방법이 충분히 연구되지 않았다.
emergent abilities의 이해는 대형 언어 모델의 성능 최적화 및 평가 기준 설정에 중요한 영향을 미친다.