리랭커
reranker
뜻과 개념
검색으로 얻은 후보 문서를 다시 평가해 순서를 조정하는 구성 요소입니다.
어떻게 작동하나요?
리랭커는 검색이 먼저 가져온 후보 문서를 질문과 다시 비교해 순서를 정하는 구성 요소입니다. 큰 문서 집합에서 빠르게 후보를 찾는 단계와 후보의 관련성을 세밀하게 판단하는 단계를 나누는 방식입니다. 질문과 문서를 함께 처리하는 교차 인코더가 대표적인 구현 중 하나입니다.
왜 알아야 하나요?
초기 검색은 속도와 범위를 위해 넓게 후보를 가져올 수 있습니다. 리랭커는 그중 실제 질문에 더 잘 맞는 자료를 앞에 놓아 생성 모델에 전달할 근거를 정리하는 데 도움이 됩니다. 그러나 후보 목록에 없는 정답 문서를 새로 발견하는 기능은 아닙니다.
실무에서 적용하는 방법
대표 질문과 관련 문서의 평가 세트를 만듭니다. 먼저 초기 검색이 필요한 문서를 후보에 포함하는지 확인하고, 그다음 리랭킹이 순서를 개선하는지 측정하세요. 처리 후보 수와 전달할 문서 수를 나누어 설정하면 품질과 지연 시간을 비교하기 쉽습니다.
긴 문서는 입력 한도 때문에 잘리거나 나뉠 수 있으므로 중요한 조건이 뒤에 있을 때도 평가되는지 확인합니다. 점수를 서로 다른 질문이나 모델 사이에서 같은 확률처럼 해석하지 않습니다. 실제 응답 시간과 비용도 함께 기록해 운영에 적합한 범위를 고릅니다.
실무에서는 이렇게 봅니다
‘환불 가능한 기간’을 묻는 질문에 검색이 결제 방법과 환불 정책을 함께 가져왔다고 가정해 보겠습니다. 리랭커가 환불 조건이 있는 문서를 먼저 배치하면 답변 근거를 선택하기 쉬워집니다. 하지만 최신 정책이 초기 후보에 없으면 오래된 문서를 정교하게 정렬해도 잘못된 답변이 나올 수 있습니다.
주의할 점
리랭킹 점수는 문서의 사실성이나 공식성 보증이 아닙니다. 질문과 관련이 높은 잘못된 문서도 앞에 올 수 있습니다. 권한 필터와 버전 관리, 출처 검증을 별도로 적용해야 합니다.
자주 묻는 질문
벡터 검색을 리랭커로 전부 바꿔도 되나요?
대규모 문서 전체를 질문과 쌍으로 평가하면 비용과 시간이 커질 수 있습니다. 보통 빠른 후보 검색과 세밀한 재정렬을 조합합니다.
후보 수를 늘리면 항상 좋아지나요?
정답 문서 포함 가능성이 늘 수 있지만 처리 비용과 잡음도 증가합니다. 실제 질문 세트로 품질과 지연을 함께 평가해야 합니다.