본문으로 건너뛰기
News중급

프롬프트 캐시 5분 TTL의 함정: 캐시 적중률이 비용보다 먼저 무너진다

Anthropic이 프롬프트 캐싱 1시간 TTL을 정식 옵션으로 열면서 긴 시스템 프롬프트·도구 정의·few-shot 블록을 반복 호출에서 90% 싸게 재사용할 수 있게 됐다. 핵심은 캐시 쓰기에 25%(5분)·100%(1시간) 프리미엄이 붙고, 읽기는 0.1배라는 비대칭 구조다. 그래서 캐시는 '읽기 횟수가 쓰기 비용을 상쇄할 만큼 자주, TTL 안에 다시 들어오는가'로 판단해야 한다. 실무에서 자주 깨지는 지점은 캐시 브레이크포인트 뒤에 타임스탬프나 사용자 ID 같은 가변 토큰을 한 줄 끼워 넣는 것으로, 접두사 해시가 통째로 어긋나 캐시가 매번 미스 난다. 캐시 가능한 정적 블록을 앞에, 가변 컨텍스트를 뒤에 배치하는 순서 규율이 비용 그래프를 바꾼다.

원문 출처

Anthropic Docs — Prompt Caching

원문 보기 ↗
NewsPrompt Engineering중급·

[분석] Structured Output를 강제했더니 추론이 무너지는 구간

JSON 스키마 강제(constrained decoding)는 파서 깨짐을 0으로 만들지만, 모델이 토큰을 문법 제약 안으로만 샘플링하게 묶는다. 그 결과 자유 형식에서 먼저 풀어쓰던 중간 추론이 사라지고, 분류·수치 추출 같은 판단형 작업에서 정확도가 눈에 띄게 떨어지는 사례가 보고된다. 원인은 구조다. 스키마가 답 필드를 앞에 두면 모델은 생각하기 전에 답부터 커밋하게 된다. 회피책은 스키마 안에 reasoning 필드를 답 필드보다 먼저 배치해 constrained decoding 안에서도 사고 순서를 보존하거나, 추론 단계는 자유 텍스트로 받고 마지막 한 번만 구조화 호출로 분리하는 2단 패턴이다. OpenAI strict 모드가 minItems/maxItems류를 거부하는 것처럼, '강제'가 표현력을 좁히는 비용은 늘 따라온다.

실무에선 '깨지지 않는 JSON'을 얻으려고 스키마를 조였다가 분류 정확도가 떨어진 걸 못 보고 넘기기 쉽다. reasoning을 답보다 앞 필드로 두는 한 줄이 정확도를 되돌린다.

OpenAI — Structured Outputs Guide원문

이 브리핑에 대한 Q&A

이 브리핑에 질문하기

이 브리핑에서 궁금한 점이 있다면 먼저 질문을 남겨보세요.

댓글

첫 댓글을 남겨보세요.

중요한 AI 소식만, 메일로 받아보세요

매일 쏟아지는 소식 중 꼭 봐야 할 것만 골라 실무 가이드와 함께 보냅니다.

핵심 뉴스 5 · 추천 가이드 3 · 인기 Q&A

구독 시 개인정보 수집·이용에 동의하게 됩니다. 자세한 내용은 개인정보처리방침에서 확인할 수 있으며, 언제든 수신 해지할 수 있습니다.