
AWS가 Amazon Bedrock에서 AI 검색 비용을 절감하는 새로운 패턴을 선보였습니다. 검색 증강 생성(RAG) 앱을 구축하는 경우, 이 구성을 통해 토큰 지출을 줄일 수 있지만 사용자는 답변을 받기까지 더 오래 기다려야 할 수도 있습니다.
2026-08-21 AWS Machine Learning Blog에 게시된 글에서, AWS는 검색과 최종 답변 사이에 소형 모델을 배치하는 방법을 제시했습니다. 긴 텍스트 청크를 대형 모델로 보내는 대신, 빠른 모델이 먼저 정확하게 관련된 문장만을 추출합니다.
작동 방식
이 참조 설계는 Amazon Bedrock Converse API를 사용하여 AWS Lambda 함수 내부에서 실행됩니다. AWS 계정, IAM 권한 및 모델 액세스 권한이 필요합니다.
이 파이프라인은 두 모델 간에 작업을 분할합니다:
– Claude Haiku는 압축기 역할을 하여 사용자의 질문과 일치하는 텍스트 구간을 그대로 추출합니다.
– Claude Sonnet은 정리된 텍스트만 읽고 최종 답변을 작성합니다.
AWS는 9가지 엔터프라이즈 소스 유형의 500,000개 이상의 문서와 10개 카테고리에 걸친 500개의 질문을 대상으로 세 가지 접근 방식을 테스트했습니다: baseline RAG, 압축 단독, 리랭크 및 압축.
수치가 보여주는 결과
AWS에 따르면 컨텍스트를 축소하면 큰 비용 절감 효과가 발생합니다:
– Token volume: baseline RAG의 100%와 비교하여 압축 적용 시 12%(8.6배 적은 토큰), 리랭크 및 압축 적용 시 10%(10.1배 적은 토큰)로 감소합니다.
– Total cost: 67%(33% 절감) 및 64%(36% 절감)로 하락합니다.
– Quality score: 정확성, 완전성, 인용 정확도, 간결성을 평가하는 LLM 판사를 기준으로 baseline과 거의 유사한 수준(100% 대비 97.5% 및 97.6%)을 유지합니다.
– Hallucination rate: 충실도를 별도로 추적했을 때 baseline의 51%에서 압축 시 44%, 리랭킹 시 38%로 감소합니다.
– Latency: 압축 적용 시 +19%, 리랭크 및 압축 적용 시 +12% 증가합니다. 속도는 저하됩니다.
직접 검증해야 할 사항
이러한 수치는 전적으로 LLM 판사가 평가한 단일 말뭉치에 대한 AWS 내부 테스트에서 나온 것입니다. AWS 외부의 누구도 이를 독립적으로 교차 검증하지 않았으며, 다른 워크로드, 가격대 또는 모델에 대한 성능을 보장하지 않습니다. 모델 호출을 하나 더 추가하면 새로운 장애 지점이 생성됩니다. 압축기가 실수로 중요한 사실을 삭제하거나, 인용을 약화시키거나, 비정상적인 텍스트 구간 및 프롬프트 인젝션으로 인해 문제가 발생할 수 있습니다.
이 패턴을 테스트하는 방법
프로덕션 파이프라인을 아직 변경하지 마세요. 먼저 자체 데이터를 테스트해 보세요.
검색기, top-k 설정, 청킹 및 모델 ID를 사용하여 고정된 테스트 쿼리 세트를 구성하세요. baseline RAG, 압축, 리랭크 및 압축의 세 가지 경로 모두를 통해 쿼리를 실행해 보세요. 입력 토큰, 출력 토큰, Lambda 비용, 모델 비용, 그리고 p50 및 p95 지연 시간을 모두 기록하세요. 가장 중요한 것은 압축된 텍스트 구간을 직접 검토하는 것입니다. 어떤 내용이 누락되는지 확인하세요. 꼬리 지연 시간이 급증하거나 핵심 근거가 누락된다면 baseline RAG 경로를 유지하는 것이 더 안전한 선택입니다.
