Amazon Bedrock에서 OpenAI 모델 선택을 위한 벤치마크 결과
Beyond the price per token: Choosing the right OpenAI model on Amazon Bedrock for your workload
조직들이 생성 AI 애플리케이션을 구축할 때, 모델을 비교하는 일반적인 방법은 백만 토큰당 가격이다. 그러나 실제 작업에서는 결과를 구매하며, 이 과정에서 모델의 정확도와 필요한 토큰 수, 대화의 턴 수 등이 비용에 영향을 미친다. 본 포스트에서는 Amazon Bedrock에서 OpenAI 모델(gpt-5.6-luna, gpt-5.6-terra, gpt-5.6-sol)과 OpenAI API의 비용 효율적인 모델(gpt-5.4-mini, gpt-5.4-nano)의 성능을 비교하는 오픈 소스 벤치마크 결과를 공유한다. 각 모델의 정확도와 비용을 측정하여, 실제 작업에서의 성과를 평가하는 방법을 제시한다.
gpt-5.6-luna 모델은 AIME 문제에서 75%의 정확도를 보였으며, 이는 비용 효율적인 선택이 될 수 있음을 시사한다.
원문 출처
AWS Machine Learning Blog