AI 시스템의 위임 작업에서의 신뢰성 연구 결과
Further Notes on Our Recent Research on AI Delegation and Long-Horizon Reliability
Microsoft의 연구 논문 "LLMs Corrupt Your Documents When You Delegate"는 위임된 작업에서 AI 시스템의 신뢰성에 대한 논의를 촉발했다. 연구는 장기 위임 및 협업 작업을 위한 강력한 평가 방법 개발을 목표로 하며, 정보가 어떻게 보존되는지를 평가한다. 연구 결과에 따르면, 현재의 최첨단 모델은 20번의 위임 반복에서 약 19-34%의 아티팩트 충실도 저하를 보였으며, Python 워크플로우는 평균 1% 미만의 저하를 나타냈다. 이 연구는 위임 패턴을 진단하는 도구로 설계되었으며, AI 시스템의 신뢰성을 높이기 위한 추가 연구와 엔지니어링이 필요함을 강조한다.
원문 출처
Microsoft Research Blog