AI 활용

RAG, 정답만 찾으면 반쪽짜리

오픈시드 2026. 10. 3. 19:52
반응형

RAG 정답 회수만으로 근거 검토가 충분하지 않음을 설명하는 차콜과 라임의 대표 이미지
정답 회수와 근거 회수는 별도 평가 대상입니다. 설명용 대표 이미지이며 모델 실행 결과가 아닙니다.

RAG 답변에 정답 문장이 붙어 있으면 검증까지 끝났다고 생각하기 쉽습니다. 하지만 표에서 숫자 하나를 찾았어도 열 제목이 빠지면 어느 제품의 값인지 알 수 없죠. 검색 결과의 답 일치와 답을 믿게 하는 근거 회수는 다른 문제입니다.

그런데 실제로는 퍼플렉시티의 공식 자료도 이 둘을 나눠 평가합니다. 이 글은 문서 선택, 정답 회수, 근거 누락, 벡터 크기를 구분합니다. 공식 글의 본문·표·수식·그림 캡션을 읽고 문서 예시와 계산을 검산했으며, 모델을 실행한 실험은 아닙니다.

📌 30초 요약

  • 맞는 답만 찾았다고 검증이 끝나지는 않습니다.
  • Document·Answer·Evidence는 별도 지표입니다.
  • 표의 숫자는 헤더와 단위까지 회수해야 합니다.
  • 8:1은 두 설정의 벡터 바이트 비교입니다.
  • 한국어 효과와 API 가격은 확인되지 않았습니다.

1. 답을 찾는 검색과 근거를 찾는 검색

RAG는 문서를 검색해 답변에 필요한 내용을 공급합니다. 문서를 작은 청크로 나누면 필요한 부분을 좁힐 수 있지만, 앞쪽의 대상 이름이나 뒤쪽의 조건이 떨어져 나갈 수 있습니다. 답에 들어갈 표현이 검색됐어도 그 표현을 해석할 문맥은 없을 수 있죠.

퍼플렉시티는 pplx-embed-v2-context-9b-preview를 소개하며, 정답 청크뿐 아니라 뒷받침 문맥도 회수하도록 학습했다고 설명합니다. 다만 학습 의도와 특정 업무에서의 실제 효과는 같은 판정이 아닙니다.

아래는 공식 설명에서 확인한 사실과 확대하면 안 되는 해석을 가른 표입니다. 공급자 보고를 독립 재현 결과로 바꾸지 않는 것이 출발점입니다.

점검할 주장 팩트 판정 공식 자료 근거
preview 공개 사실 Hugging Face 공개 안내
API 제공 완료 확인 불가 API 제공을 준비 중이라고 설명
근거도 별도 평가 사실 Evidence Recall 정의
총비용 8배 절감 과장 벡터만 비교한 크기 설명
한국어 성능 우월 확인 불가 이번 확인 범위에 언어별 검증 없음
 

Contextual embedding beyond the gold passage

A new training method, model, and benchmark for retrieving answers and their supporting context.

www.perplexity.ai

 

2. 평가표는 문서·답·근거로 나눕니다

Document@K는 정답 문서가 상위 K 안에 들어왔는지 봅니다. 비슷한 문서 중 올바른 대상을 골랐는지 묻는 것이죠. Answer@K는 전체 코퍼스 상위 K개 청크 안에 답을 담은 문장이 있는지 따집니다. 생성 답의 정확도를 뜻하지는 않습니다. 여기까지 통과해도 답에 적용되는 연도나 단위가 없는 불완전한 근거일 수 있습니다.

Evidence Recall@K는 필요한 근거 그룹이 얼마나 회수됐는지 봅니다. 공식 정의에서는 정답 문서 안의 후보를 정렬한 뒤 최상위 정답 문장을 뺀 뒤 남은 상위 K개에서 근거를 셉니다. 정답 문서가 상위 10개 문서에 들어와야 근거 점수를 인정하는 조건도 있으므로, 단순한 관련 문장 비율과는 다릅니다.

그룹 안에 대안 근거 묶음이 있으면 그중 한 묶음의 필요한 요소를 모두 회수해야 해당 그룹을 찾은 것으로 봅니다. All-Evidence@K는 모든 그룹을 회수한 질의 비율입니다. 답이 맞은 사례만 모아두지 말고 답은 맞지만 근거는 빠진 사례도 별도 기록하셔야 합니다.

⚠️ 정답 점수 하나로 근거 충분성을 대신 판정하면 누락이 가려집니다. AI 검토의 평가 기준과 신뢰 점검도 결과 문구보다 평가 조건과 재현 범위를 확인하는 다음 질문으로 연결됩니다.

3. 표 헤더와 벡터 바이트를 직접 검산했습니다

공식 Table 2의 배터리 예시는 4250·4700·5150이라는 값을 나열합니다. 먼저 Mini·Base·Max의 열 순서를 확인하고, 이어 용량 단위인 mAh를 붙였습니다. 세 번째 열은 Max이므로 결과는 Max 5150mAh입니다. 숫자만으로 제품 대응을 확정할 수 없다는 설명용 예시입니다. 실제 기기 사양이나 모델 시험 결과는 아닙니다.

다음은 벡터 자체 크기 계산입니다. int8은 요소당 1byte, float32는 4bytes이므로 1024차원 int8은 1024×1=1024bytes입니다. 2048차원 float32는 2048×4=8192bytes이며, 두 값의 비율은 8192÷1024=8입니다. 차원과 자료형이 함께 달라진 비교이지 같은 설정의 비용 실험이 아닙니다.

이 과정은 원문의 헤더와 수식을 확인한 문서 검산입니다. Replit 표와 숫자 검산 글에서 다룬 숫자 확인을, 이번에는 숫자를 해석하는 문맥의 확인으로 확장했습니다.

적용 상황 필요한 문맥 판단 조건
배터리 용량 답변 제품 헤더·단위 Max 열과 5150의 대응 확인
근거 누락 평가 정답 외 근거 그룹 각 그룹의 필요 요소 회수 여부
벡터 저장 비교 차원·자료형 요소 수와 바이트 수로 계산
운영비 추정 인덱스·처리·요금 벡터 비율만으로 결론 금지

직접 확인하지 못한 부분은 모델 로딩, 질의 실행, 검색 결과 비교, 한국어 평가입니다. 이번 표는 적용 판단 기준이지 실행 성능표가 아닙니다. 독자는 자신의 질문에 필요한 헤더·주석·조건을 먼저 적고 검색 결과와 대조해 보시면 됩니다.

4. 지금 바로 일반화하면 안 되는 영역

context-bench의 corpus·queries·labels는 비공개입니다. 공식 성능 수치는 공급자가 보고한 결과이며, 이 글에서는 같은 데이터로 재현하지 않았습니다. 공개 모델 preview가 있다는 사실도 비공개 평가의 독립 검증을 대신하지는 않습니다.

원문은 API 제공을 준비 중이라고 설명합니다. 이 글에서는 API 가격, 한국 계정 조건, 한국어 성능을 확정하지 않습니다. 실제 도입에서는 자신의 문서 길이와 질문 유형으로 평가해야 하며, 정답률 개선을 근거 완전성 개선으로 자동 환산하면 안 됩니다.

벡터 외에도 인덱스 구조, 원문 보관, 처리와 운영에 필요한 자원이 있습니다. 따라서 총인덱스 크기나 총운영비가 8배 줄었다는 결론은 낼 수 없습니다. 문서 검토에서도 근거가 충분한지 판단하는 사람의 역할이 남으며, OPENSEED의 제출 전 문서 피드백은 그 검토 단계와 연결될 뿐 RAG 성능을 인증하는 서비스가 아닙니다.

자주 묻는 질문 (FAQ)

Q. 답이 맞으면 충분한가요?
A. 아닙니다. 대상·단위·적용 조건을 검증할 지원 문맥까지 있어야 합니다.

Q. 근거 누락은 어떻게 찾나요?
A. 필요한 근거를 그룹으로 적고, 정답 외 결과에서 필수 요소의 회수 여부를 확인합니다.

Q. 벡터가 8분의 1이면 비용도 같은가요?
A. 아닙니다. 1024bytes와 8192bytes는 벡터 비교이며 인덱스와 운영비는 별도입니다.

Q. API와 한국어 효과가 검증됐나요?
A. 이번 확인으로는 확정할 수 없습니다. preview 안내와 미실행 영역을 구분해야 합니다.

정리하면

  • 답 회수와 근거 회수를 분리합니다.
  • 문서·정답·근거 지표를 함께 봅니다.
  • 표 헤더와 단위도 근거로 남깁니다.
  • 벡터 비율을 총비용으로 확대하지 않습니다.
  • 다음 평가표에 필요 근거 그룹과 누락 칸을 만드세요.

※ 출처 범위: 퍼플렉시티 공식 글의 본문·표·수식·그림 캡션을 읽고 문서 예시와 바이트를 검산했습니다. 모델 실행과 그래프 픽셀 검증은 하지 않았습니다.
※ 기준일: 2026년 10월 3일 확인 자료 기준입니다. preview·API 제공 상태와 사양은 달라질 수 있습니다.

반응형