Agent 엔지니어링

검색에서 RAG까지

Search는 관련 가능성이 높은 청크를 반환합니다. RAG는 이를 범위가 명확하고 인용·평가 가능한 근거로 바꿔야 합니다.

이 강의의 위치: 벡터 검색의 입문은 이 주제 앞부분의 장기 기억: 벡터 검색, RAG의 제품 관점은 1편의 RAG 검색 증강 생성RAG 비용과 최적화 전략에 있습니다. 이 강의는 그 기초를 반복하지 않고 Milvus 검색을 신뢰할 수 있는 RAG 파이프라인에 연결하는 방법만 다룹니다. 검색을 Agent 도구로 감싸는 내용은 4편의 Agent 지식 도구로서의 Milvus에 있습니다.
온라인 흐름
1

질의 Embed

수집 때와 동일한 모델을 사용합니다.

2

검색

테넌트/ACL 필터와 Top-K 검색.

3

재순위화

정밀 순위화, 중복 제거, Token 예산.

4

생성

근거만으로 답하고 출처를 인용합니다.

오프라인 수집이 온라인 품질의 상한을 정한다

청킹

제목, 문단, 의미 경계로 나누고 적당히 겹칩니다. 너무 크면 잡음, 너무 작으면 문맥이 끊깁니다.

메타데이터

출처 ID, 버전, 절, 테넌트, ACL, 갱신 시각을 보관해야 인용·필터·삭제가 가능합니다.

버전 관리

콘텐츠나 모델이 바뀌면 다시 Embedding합니다. 블루/그린 Collection으로 호환되지 않는 벡터 혼합을 피합니다.

검색 품질 도구
방법 목적 주의점
스칼라 필터 테넌트, ACL, 시간, 언어 권한은 Prompt가 아니라 검색 단계에서 강제
벡터 + 키워드 하이브리드 의미와 정확한 SKU/오류 코드 모두 검색 원시 점수 척도는 직접 비교할 수 없음
RRF 여러 순위 결과 융합 단순하고 안정적이며 이후 후보를 재순위화
Partition / TTL 핫 데이터 분리 및 만료 확장 기능이므로 먼저 Collection과 필터를 명확히 설계
두 계층 평가: 먼저 Recall@K, MRR/nDCG, 필터 정확성을 측정하고, 이후 답변 충실도, 인용 정확도, 적절한 거절을 측정합니다. 유창한 답변이 검색 실패를 숨길 수 있습니다.
Takeaway RAG는 검색 결과를 Prompt에 넣는 것 이상입니다. 청킹, 메타데이터, 권한 필터, 융합, 인용이 검색 증강 답변의 신뢰도를 결정합니다.