다크 모드
모델 선택 가이드
AI Forge에서 사용할 모델은 작업 목적, 데이터 언어, 품질 기준, 응답 시간과 운영 환경을 함께 고려해 선택합니다. 모든 용도에 항상 가장 좋은 모델은 없으므로, 현재 환경에서 사용할 수 있는 후보를 같은 조건으로 비교한 뒤 기본 모델을 정하는 것을 권장합니다.
환경별 모델 목록
Console에 표시되는 제공업체와 모델은 운영 환경의 활성 모델 설정과 사용자의 접근 권한에 따라 달라집니다. 이 문서는 특정 모델명을 추천하는 목록이 아니라 모델을 선택하고 검증하는 기준을 제공합니다.
최소 권장 모델 구성
AI Forge를 처음 구축하거나 기본 RAG 기능을 검증할 때는 다음 구성을 출발점으로 권장합니다. 여기서 최소 권장은 GPU나 메모리의 최소 하드웨어 사양이 아니라, 생성·검색·재정렬의 각 역할을 검증하기 위한 기준 모델 구성을 의미합니다.
| 역할 | 기준 모델 | 적용 범위와 확인 사항 |
|---|---|---|
| LLM | google/gemma-4-31B-it | 일반 대화, RAG 답변과 구조화 출력의 기준 모델입니다. 대형 서버급 실행 환경이 필요합니다. |
| Embedding | BAAI/bge-m3 | 다국어 검색 기준 모델입니다. VectorDB의 벡터 차원을 1024로 구성합니다. |
| Rerank | BAAI/bge-reranker-v2-m3 | 다국어 검색 후보 재정렬 기준 모델입니다. Rerank를 사용하는 RAG 구성에서 적용합니다. |
지식 베이스를 사용하지 않는 대화 애플리케이션에는 Embedding과 Rerank가 필요하지 않습니다. 지식 베이스를 사용하더라도 Rerank 없이 검색할 수 있지만, 초기 품질 기준을 만들 때는 Rerank 적용 전후를 모두 측정하는 것을 권장합니다.
모델 식별자
운영 환경에 따라 모델 목록에 제공업체 경로가 없는 별칭이 표시될 수 있습니다. 자격 증명 등록 화면에 표시되는 식별자를 우선 사용하고, 모델명 재정의가 필요한 경우 실제 모델 서버가 제공하는 식별자와 일치하는지 확인하세요.
LLM 필수 기능과 권장 옵션
기준 LLM인 google/gemma-4-31B-it을 등록할 때는 모델 메타데이터와 실제 서빙 엔드포인트에서 다음 기능을 지원하는지 확인합니다.
| 구분 | 키 또는 옵션 | 초기 권장값 | 설명 |
|---|---|---|---|
| 모델 지원 | reasoning | 활성화 | Studio에서 추론 사용 여부와 추론 강도를 선택할 수 있게 합니다. |
| 모델 지원 | function_calling, tool_choice | 활성화 | 모델이 도구 호출과 자동 도구 선택을 사용할 수 있게 합니다. |
| 추론 옵션 | reasoningEffort | 모델 기본값 | 모델·서빙 환경의 기본 추론 설정을 사용합니다. 품질 비교 시에만 한 단계씩 변경합니다. |
| 도구 옵션 | toolChoice | auto | 사용 가능한 도구 중 호출할 도구와 사용 여부를 모델이 대화 맥락에 따라 결정하게 합니다. |
vLLM으로 제공하는 기준 Gemma 4 모델에서는 추론을 끄거나 낮음, 보통, 높음으로 조정할 수 있습니다. 추론 강도를 높이면 복합 작업의 품질이 좋아질 수 있지만 응답 시간과 토큰 사용량도 늘 수 있으므로, 기본 평가에서는 모델 기본값을 사용한 뒤 필요한 과업만 별도로 비교하세요.
auto는 도구가 등록되어 있을 때만 의미가 있습니다. 조회 전용 도구는 자동 모드로 먼저 검증할 수 있지만, 생성·수정·삭제처럼 외부 상태를 바꾸는 도구는 manual 모드에서 사용자 승인 절차까지 확인하는 것을 권장합니다. 모델 목록에서 도구 호출을 지원하지 않는 것으로 표시되면 auto를 선택해도 자동 도구 호출을 사용할 수 없습니다.
Gemma 4 31B의 필요 GPU 메모리는 정밀도, 양자화, 컨텍스트 길이와 동시 요청 수에 따라 크게 달라집니다. 따라서 이 문서에서는 고정된 GPU 수량을 최소 사양으로 제시하지 않으며, 배포 설정으로 예상하는 최대 입력과 동시성을 사용해 별도로 부하 테스트해야 합니다.
먼저 모델의 역할을 구분하세요
| 역할 | 하는 일 | 선택 결과가 미치는 영향 |
|---|---|---|
| LLM | 질문을 이해하고 답변이나 구조화된 출력 생성 | 답변 정확성, 지시 준수, 응답 시간과 생성 비용 |
| Embedding | 문서와 질문을 벡터로 변환 | 검색 후보의 재현율, 언어·도메인 검색 품질 |
| Rerank | 검색된 후보를 질문 관련도 순으로 재정렬 | 상위 문서의 정밀도, 검색 지연 시간과 최종 답변 품질 |
LLM 성능이 좋아도 필요한 문서가 검색되지 않으면 근거 있는 답변을 만들기 어렵습니다. 반대로 검색 결과가 정확해도 LLM이 지시를 따르지 않거나 컨텍스트를 제대로 사용하지 않으면 최종 답변 품질이 낮아질 수 있습니다. 세 역할을 나누어 평가하세요.
용도별 빠른 선택 기준
| 용도 | 우선 확인할 능력 | 비교할 항목 |
|---|---|---|
| 문서 기반 질의응답 | 컨텍스트 충실도, 한국어·업무 용어 이해, 지시 준수 | Faithfulness, Answer Relevancy, 응답 시간 |
| 분류·추출·구조화 출력 | 스키마 준수, 일관성, 짧은 요청의 처리 속도 | 형식 오류율, 필드 정확도, 응답 시간 |
| Tool·Agent 워크플로우 | 도구 선택과 인자 생성, 여러 단계의 지시 추적 | 도구 호출 성공률, 잘못된 호출 비율, 전체 수행 시간 |
| 이미지·문서 첨부 대화 | 필요한 입력 형식과 멀티모달 지원 | 파일 유형별 정답률, 처리 제한, 응답 시간 |
| 실시간 또는 대량 요청 | 낮은 지연 시간, 처리량, 안정성 | p95 응답 시간, 오류율, 요청당 비용 |
| 복합 추론·긴 문맥 처리 | 추론 품질, 긴 입력 처리, 핵심 정보 유지 | 과업 성공률, 컨텍스트 누락, 토큰 사용량 |
기능을 지원한다는 사실만으로 운영에 적합하다고 판단하지 마세요. 실제 프롬프트와 데이터로 정확도, 지연 시간과 실패율을 함께 확인해야 합니다.
LLM 선택
LLM 후보를 비교할 때는 다음 항목을 확인합니다.
- 언어와 도메인: 한국어 질문, 조직 용어와 약어를 안정적으로 이해하는지 확인합니다.
- 지시 준수: 답변 형식, 금지 조건과 검색 컨텍스트 사용 규칙을 따르는지 확인합니다.
- 필요 기능: 구조화된 출력, 도구 호출, 이미지 입력처럼 애플리케이션이 요구하는 기능을 지원하는지 확인합니다.
- 컨텍스트 처리: 실제 파이프라인이 전달하는 프롬프트와 검색 문서를 충분히 처리하는지 확인합니다.
- 운영 특성: 평균값뿐 아니라 p95 응답 시간, 오류율, 처리량과 비용을 확인합니다.
- 배포 조건: 외부 API 사용 가능 여부, 사내망 배포, 데이터 반출 정책과 인증 방식을 확인합니다.
사실 기반 RAG에서는 모델의 일반 지식보다 제공된 컨텍스트를 정확히 따르는 능력이 더 중요할 수 있습니다. 분류나 추출 작업에서는 큰 모델보다 형식 준수율이 높고 빠른 모델이 더 적합할 수 있습니다.
Embedding 모델 선택
- 질문과 문서의 주 언어 및 업무 도메인을 지원하는지 실제 검색 질문으로 확인합니다.
- 모델의 벡터 차원이 사용하는 VectorDB와 컬렉션 설정에 맞는지 확인합니다.
- 문서 적재와 검색 질문에는 호환되는 동일 Embedding 설정을 사용합니다.
- 모델 크기만 비교하지 말고
Recall@K와 실제 정답 청크 포함 여부를 확인합니다. - 운영 중 Embedding 모델을 변경하면 기존 벡터와 호환되지 않을 수 있으므로 새 지식 베이스에서 다시 인덱싱하는 흐름을 권장합니다.
Embedding 후보는 같은 문서, 같은 청크와 같은 검색 설정으로 비교해야 합니다. 청크 크기나 검색 방식을 동시에 바꾸면 품질 변화의 원인을 구분하기 어렵습니다.
Rerank 모델 선택
Rerank는 기본 검색 후보 안에서 순서만 다시 정합니다. 먼저 상위 K 후보에 정답 문서가 포함되는지 확인한 뒤 다음 항목을 비교하세요.
- 질문과 문서 언어 및 도메인에 대한 관련도 판단
MRR,nDCG@5, Context Precision의 개선 정도- 후보 수 증가에 따른 응답 시간과 처리 비용
- Rerank를 사용하지 않은 기본 검색보다 실제 답변 품질이 좋아지는지 여부
정답 문서가 후보에 없다면 Rerank 모델을 바꾸기 전에 Embedding, 검색 방식, 청크와 상위 K를 먼저 점검합니다.
후보 모델 비교 절차
- 운영 환경에서 접근 가능한 후보 모델을 확인합니다.
- 실제 정상 질문과 실패 질문이 포함된 Golden Set을 준비합니다.
- 현재 운영 설정을 기준선으로 저장합니다.
- 프롬프트, Temperature, 검색 설정을 고정하고 한 번에 하나의 모델만 변경합니다.
- 동일한 Golden Set과 평가 프로필로 각 후보를 실행합니다.
- 품질 점수와 함께 응답 시간, 오류율, 처리량과 비용을 기록합니다.
- 품질 하한을 만족하는 후보 중 운영 목표에 맞는 모델을 기본값으로 지정합니다.
| 비교 대상 | 우선 볼 품질 지표 | 함께 볼 운영 지표 |
|---|---|---|
| LLM | Faithfulness, Answer Relevancy, 과업 성공률 | p95 응답 시간, 오류율, 토큰·비용 |
| Embedding | Recall@K, Context Recall | 인덱싱 시간, 벡터 크기, 검색 시간 |
| Rerank | MRR, nDCG@5, Context Precision | 재정렬 시간, 후보 수, 요청 비용 |
공정한 비교
여러 설정을 동시에 변경하거나 서로 다른 Golden Set으로 실행하면 모델 차이인지 설정 차이인지 판단하기 어렵습니다. 비교 중에는 모델 외의 조건을 고정하세요.
조직의 권장 모델 기록
검증이 끝나면 하나의 모델을 모든 용도에 지정하기보다 용도별 기준 모델을 기록하세요.
| 구분 | 기록할 내용 예시 |
|---|---|
| 표준 모델 | 일반 질의응답에 사용할 품질·비용 균형 모델 |
| 품질 우선 | 복합 추론이나 중요한 답변에 사용할 모델 |
| 속도 우선 | 실시간·대량 요청에 사용할 저지연 모델 |
| 구조화 출력 | 분류·추출과 스키마 출력 검증을 통과한 모델 |
| 멀티모달 | 필요한 이미지·문서 입력 형식을 검증한 모델 |
모델명, 제공업체, 배포 방식, 검증한 Golden Set 버전, 주요 점수와 검증일을 함께 남기면 모델이 업데이트되었을 때 재검증 범위를 판단하기 쉽습니다.