Skip to content

애플리케이션 품질

애플리케이션 상세의 품질 탭은 애플리케이션 단위 품질 운영 화면입니다. 평가 실행 이력과 Golden Set을 관리하고 품질 프로필의 메트릭 구성을 확인합니다.

화면 예시

애플리케이션 품질 화면

품질 탭에서는 평가 이력 목록을 기준으로 실행 결과를 확인하고, Golden Set과 프로필 탭으로 이어서 작업할 수 있습니다.

운영 흐름

품질 관리는 Golden Set을 먼저 준비하고, 평가 프로필을 확인한 뒤, 평가 실행 결과를 반복 비교하는 흐름으로 운영합니다.

  1. Golden Set 준비: 평가할 질문, 기준 답변, 근거 문서를 구성합니다.
  2. 프로필 확인: 평가에 사용할 코어 메트릭과 커스텀 메트릭을 확인합니다.
  3. 평가 실행: 활성 Golden Set과 LLM 설정을 선택해 평가를 실행합니다.
  4. 결과 분석: 메트릭 요약과 질문별 결과로 원인을 확인합니다. 커스텀 메트릭이 있는 실행에서는 비교와 노드 분석도 사용할 수 있습니다.
  5. 개선 반영: 프롬프트, 지식 베이스, 검색 설정, 파이프라인을 조정한 뒤 같은 Golden Set으로 다시 평가합니다.

하위 구성

하위 영역설명
평가 이력평가 ID, 상태, 실행일, Golden Set 버전과 주요 메트릭을 확인합니다.
Golden Set평가 기준 질문, Ground Truth, Answer Docs, 태그와 카테고리를 관리합니다.
프로필코어 메트릭과 커스텀 메트릭 구성을 확인하고 수정합니다.
결과 상세실행별 메트릭 요약, 질문별 점수, 응답, 검색 컨텍스트, 실패 사유를 확인합니다.
비교커스텀 메트릭이 있는 실행에서 같은 Golden Set 버전의 결과를 비교합니다.
노드 분석커스텀 메트릭이 있는 실행에서 파이프라인 단계별 병목을 확인합니다.

Golden Set

Golden Set은 애플리케이션 품질을 반복 측정하기 위한 기준 질문 세트입니다. 기능을 수정한 뒤 같은 Golden Set으로 다시 평가하면 변경 전후 품질을 비교하기 쉽습니다.

항목설명
버전Golden Set을 구분하는 이름입니다. 예: v1.0, 2026-Q2-baseline.
질문실제 사용자가 물어볼 법한 질문입니다. 단순 사실 조회와 복합 질문을 함께 넣는 것이 좋습니다.
Ground Truth기대하는 기준 답변입니다. 정답이 명확한 질문은 입력하는 편이 평가 안정성이 높습니다.
Answer Docs정답의 근거가 되는 문서 ID와 관련도입니다. 검색 품질 메트릭에 활용됩니다.
카테고리와 태그사실 조회, 비교, 절차, 정책 같은 질문 유형과 운영 태그를 기록합니다.
상태활성 Golden Set만 평가 실행 대상으로 사용합니다. 오래된 세트는 보관 상태로 둘 수 있습니다.

Golden Set 구성 팁

운영 질문을 그대로 모으되, 실패했던 질문과 대표 정상 질문을 함께 넣으세요. 실패 사례만 모으면 개선 효과는 잘 보이지만 일반 품질 추세를 보기 어려울 수 있습니다.

평가 실행

평가 실행에서는 활성 Golden Set과 LLM 자격 증명을 선택합니다. 실행이 시작되면 평가 이력에 실행 중, 완료, 실패 상태로 표시됩니다.

상태의미
실행 중질문별 평가가 진행 중입니다. 결과가 아직 일부만 집계될 수 있습니다.
완료모든 질문 처리가 끝났고 메트릭을 확인할 수 있습니다.
실패평가 실행 중 오류가 발생했습니다. 실패 사유와 LLM 자격 증명, Golden Set 데이터를 확인합니다.

평가 결과를 비교할 때는 동일한 Golden Set 버전끼리 비교하세요. 질문 세트가 달라지면 메트릭 변화가 실제 개선 때문인지, 평가 데이터 변화 때문인지 구분하기 어렵습니다.

메트릭 해석

품질 탭의 메트릭은 대부분 0~1 범위로 해석하며, 높을수록 좋은 상태를 의미합니다. 단, 조직에서 추가한 커스텀 메트릭은 프로필에 설정된 점수 범위를 따릅니다.

메트릭해석
Faithfulness생성된 답변이 검색 컨텍스트에 얼마나 충실한지 봅니다. 낮으면 근거 없는 답변이나 환각 가능성을 의심합니다.
Context Precision검색된 컨텍스트 중 실제 답변에 유용한 정보의 비율입니다. 낮으면 불필요한 문서가 많이 섞인 상태일 수 있습니다.
Context Recall정답을 만들기 위해 필요한 정보가 검색 컨텍스트에 충분히 포함되었는지 봅니다. 낮으면 검색 누락을 먼저 확인합니다.
Answer Relevancy답변이 질문 의도에 얼마나 관련 있게 응답했는지 봅니다. 낮으면 프롬프트, 모델, 질문 해석 문제를 함께 확인합니다.
Recall@K상위 K 검색 결과 안에 정답 문서가 포함되는지 봅니다. 낮으면 검색 설정, 청크, Embedding, Rerank를 점검합니다.
MRR첫 번째 관련 문서가 얼마나 상위에 있는지 봅니다. 낮으면 정답 문서가 나오더라도 너무 뒤에 있을 수 있습니다.
nDCG@5상위 5개 결과의 순서와 관련도를 함께 평가합니다. 관련 문서를 더 앞에 배치할수록 높아집니다.

결과 상세 확인

평가 실행 상세에서는 질문별 결과를 확인할 수 있습니다. 특정 질문의 점수가 낮다면 다음 순서로 원인을 좁히는 것이 좋습니다.

  1. Ground Truth가 비어 있거나 실제 기대 답변과 다른지 확인합니다.
  2. 검색된 컨텍스트에 정답 근거가 포함되어 있는지 확인합니다.
  3. 컨텍스트가 맞는데 답변이 틀렸다면 프롬프트와 LLM 자격 증명을 확인합니다.
  4. 컨텍스트가 틀렸다면 지식 베이스 검색 테스트에서 검색 방식, 상위 K, Rerank, 점수 임계값을 확인합니다.
  5. 일부 질문만 실패한다면 질문별 실패 사유와 실제 응답을 비교합니다.

노드 분석

노드 분석은 커스텀 메트릭이 포함된 평가 실행에서 파이프라인 단계별 병목을 찾는 화면입니다. 실행 상세에 추가 메트릭 카드가 있을 때 노드 분석비교 분석 진입 버튼이 표시됩니다.

노드확인할 품질 신호
Query Standardizer사용자 질문이 표준 형태로 정리되는지 확인합니다.
Query Rewrite검색에 유리한 질문으로 재작성되는지 확인합니다.
Collection Route적절한 컬렉션으로 라우팅되는지 확인합니다.
Retrieve정답 근거가 검색 후보 안에 포함되는지 확인합니다.
Grade Documents검색 후보가 올바르게 필터링되거나 선별되는지 확인합니다.
RAG Prompt검색 결과가 RAG 프롬프트에 올바르게 구성되는지 확인합니다.
Generate검색 근거를 사용해 질문에 맞는 답변을 생성하는지 확인합니다.
Forbidden Filter금칙어 또는 정책 필터가 정상적으로 동작하는지 확인합니다.

노드 분석에서 검색 단계가 낮게 나오면 검색 테스트로 같은 질문을 재현하고, 생성 단계가 낮게 나오면 프롬프트와 LLM 자격 증명을 먼저 확인하세요.

대시보드 품질 현황과의 차이

  • 품질 현황은 대시보드 관점에서 추이와 요약을 보는 화면입니다.
  • 애플리케이션 품질은 실제 평가 실행과 데이터 세트를 운영하는 화면입니다.

운영 팁

  1. 기능 배포 전후에는 같은 Golden Set과 같은 평가 프로필로 평가를 실행하세요.
  2. 점수 하나만 보지 말고 질문별 실패 사례를 함께 확인하세요.
  3. 검색 품질 메트릭이 낮으면 지식 베이스, 청크, 검색 설정, Rerank를 먼저 점검하세요.
  4. 생성 품질 메트릭이 낮으면 시스템 프롬프트, 모델 파라미터, 응답 형식을 확인하세요.
  5. Golden Set은 운영 중 발견한 실패 질문을 주기적으로 추가해 갱신하세요.

관련 문서