다크 모드
데이터소스
데이터소스는 외부 문서 저장소나 웹 페이지를 수집 대상으로 등록하고, 수집 상태와 최신 동기화 시점을 관리하는 기능입니다. 지식 베이스의 컬렉션에 연결한 뒤 수집한 콘텐츠를 적재할 수 있습니다.
화면 예시

데이터소스 목록 화면에서는 이름, 설명, 상태, 마지막 수집 일자, 생성자 정보를 한눈에 확인할 수 있습니다.

상세 화면에서는 소스 정보, 파일 목록, 수집 이력 탭과 함께 인증 정보, 수집 경로, 스케줄 설정을 확인할 수 있습니다.
소스 유형
데이터소스는 크게 문서형 소스와 웹 소스로 나뉩니다.
| 유형 | 사용처 | 주요 설정 |
|---|---|---|
| Doc | FTP, S3, 수동 업로드처럼 문서 파일을 수집할 때 사용합니다. | 프로토콜, 수집 경로, 인증 정보, 포함/제외 패턴 |
| Web | 웹 페이지 URL을 수집할 때 사용합니다. | 수집 범위, URL, 최대 페이지 수, 페이지 유형, CSS 셀렉터, 인증 정보 |
Doc 소스의 프로토콜은 FTP, S3, MANUAL 중에서 선택합니다. MANUAL은 파일을 직접 추가하는 방식이며, 외부 저장소 경로나 인증 정보가 필요하지 않습니다.
Web 소스는 입력한 페이지만 수집하는 방식과 하위 페이지까지 함께 수집하는 방식을 선택할 수 있습니다. 페이지 내용이 브라우저에서 바로 보이면 일반 페이지를, 클릭이나 스크롤 뒤에 내용이 나타나는 경우 동적 페이지를 선택하세요.
소스 등록
| 항목 | 설명 |
|---|---|
| 이름 | 수집 대상을 식별할 수 있는 이름입니다. |
| 설명 | 수집 목적이나 포함 범위를 설명합니다. |
| 공개 범위 | 전체 공개 또는 특정 그룹 공개처럼 데이터소스 접근 범위를 설정합니다. |
| 소스 유형 | Doc 또는 Web 중 등록 방식을 선택합니다. |
| 인증 정보 | FTP, S3, 웹 로그인, 헤더 인증 등 접근에 필요한 연결 정보를 입력합니다. |
Doc 소스 설정
| 항목 | 설명 |
|---|---|
| 프로토콜 | FTP, S3, MANUAL 중 하나를 선택합니다. |
| 수집 경로 | FTP/S3에서 수집할 디렉터리 또는 경로입니다. 여러 경로를 등록할 수 있습니다. |
| FTP 인증 | Host, Port, Username, Password를 입력합니다. |
| S3 인증 | Bucket, Region, Access Key, Secret Key, Endpoint URL을 입력합니다. |
| 수집 패턴 | 수집할 파일 패턴입니다. 예: *.pdf, *.docx. |
| 수집 제외 패턴 | 수집하지 않을 파일 패턴입니다. 예: 임시 파일, 미지원 형식. |
Web 소스 설정
| 항목 | 설명 |
|---|---|
| 수집 범위 | 입력한 페이지만 수집하거나, 하위 페이지까지 함께 수집합니다. |
| URL | 수집할 웹 페이지 주소입니다. 단일 페이지 방식에서는 여러 URL을 등록할 수 있습니다. |
| 최대 페이지 | 하위 페이지 수집 시 최대 수집 페이지 수입니다. |
| 페이지 유형 | 바로 보이는 페이지 또는 상호작용 후 보이는 동적 페이지를 선택합니다. |
| CSS 셀렉터 | 본문 영역처럼 필요한 요소만 추출할 때 사용합니다. 예: .main-content. |
| 인증 정보 | Login URL, Username, Password, Header를 입력할 수 있습니다. |
수집 실행
목록의 액션 메뉴에서 수집 작업을 직접 실행할 수 있습니다.
| 작업 | 설명 |
|---|---|
| 변경분만 수집 | 마지막 수집 이후 추가되거나 변경된 대상만 수집합니다. |
| 전체 수집 | 모든 대상을 처음부터 다시 수집합니다. 대규모 소스에서는 시간이 오래 걸릴 수 있습니다. |
| 실패 항목만 재수집 | 이전 작업에서 실패한 파일만 골라 다시 수집합니다. |
| 수정 | 수집 대상 경로, 인증 정보, 설명을 변경합니다. |
| 삭제 | 더 이상 사용하지 않는 데이터소스를 제거합니다. |
수집 작업을 실행하면 상세 화면의 파일 목록과 수집 이력에서 진행 상태를 확인할 수 있습니다. 진행 중인 작업은 자동으로 갱신되며, 완료 후 성공/실패 건수가 집계됩니다.
파일 목록
파일 목록 탭에서는 수집된 파일과 처리 결과를 확인합니다.
| 항목 | 설명 |
|---|---|
| 파일명 | 수집된 파일 또는 웹 페이지 이름입니다. 조회 가능한 파일은 내용을 열어볼 수 있습니다. |
| 수집 결과 | Success, Failed, Collecting 상태를 표시합니다. |
| 수집 시간 | 파일이 처리된 시점입니다. |
| 작업자 | 파일을 추가하거나 수집 작업을 실행한 사용자입니다. |
MANUAL 방식 또는 파일 추가가 필요한 소스에서는 파일을 직접 업로드할 수 있습니다. 지원 확장자는 DOCX, XLSX, PPTX, HWP, HWPX, PDF, TXT, MD, CSV, HTML, HTM, JSON, XML, YAML, YML이며 파일당 기본 최대 크기는 40 MB입니다. 이 목록에 없는 형식은 업로드할 수 없습니다.
수집 이력
수집 이력 탭은 데이터소스 단위 작업 로그입니다.
| 항목 | 설명 |
|---|---|
| 실행 방식 | 수집, 데이터 추가, 파일 삭제 같은 작업 유형입니다. |
| 상태 | 진행 중, 성공, 실패 중 하나로 표시됩니다. |
| 처리 결과 | 성공, 실패, 스킵 건수를 요약합니다. |
| 실패 | 실패 건수가 있으면 상세 오류와 파일명을 확인할 수 있습니다. |
| 실행 시각 | 작업이 시작된 시각입니다. |
| 소요 시간 | 작업 완료까지 걸린 시간입니다. |
실패 건수가 표시되면 먼저 오류 상세를 열어 파일명과 오류 메시지를 확인하세요. 인증 실패, 경로 오류, 미지원 파일, 파일 크기 초과 같은 원인을 빠르게 구분할 수 있습니다.
스케줄 설정
데이터소스 상세의 소스 정보 탭에서 자동 수집 스케줄을 설정할 수 있습니다.
| 설정 | 설명 |
|---|---|
| 수집 방식 | 변경분만 수집 또는 전체 수집을 선택합니다. |
| 수집 주기 | 매시간, 매일, 매주, 매월 중 하나를 선택합니다. |
| 실행 시간 | 자동 수집을 시작할 시간을 지정합니다. |
| 요일/일자 | 주간 또는 월간 스케줄에서 실행 기준을 지정합니다. |
| 시간대 | 한국, 중국, 중부유럽, UTC, 미국 동부·서부 시간대 중 실행 기준을 선택합니다. |
자주 바뀌는 웹 페이지는 변경분 수집을 짧은 주기로 설정하고, 대규모 문서 저장소는 전체 수집을 낮은 빈도로 두는 편이 안정적입니다.
상태 모니터링
수집 상태는 목록에서 즉시 확인할 수 있습니다.
| 상태 | 설명 |
|---|---|
| Success | 최근 수집이 정상 완료된 상태입니다. |
| Failed | 수집 중 오류가 발생한 상태입니다. 인증 또는 경로를 점검해야 합니다. |
| Collecting | 현재 수집 작업이 진행 중인 상태입니다. |
운영 팁
- 대용량 문서는 주제별로 소스를 나누면 실패 원인 파악이 쉬워집니다.
- 웹 수집은 변경 주기가 짧은 페이지부터 우선 등록하는 편이 운영에 유리합니다.
- 전체 수집은 저장소 규모에 따라 오래 걸릴 수 있으므로 운영 시간대를 고려해 실행하세요.
- 실패가 반복되는 소스는 인증 정보, 수집 경로, 포함/제외 패턴을 먼저 점검하세요.
- 지식 베이스 검색 품질이 낮다면 데이터소스에서 실제 원문이 정상 수집되었는지 먼저 확인하세요.
문제 해결
| 증상 | 확인할 항목 |
|---|---|
| 수집이 계속 실패함 | 인증 정보, 네트워크 접근, 수집 경로, Bucket/Region, URL 접근 권한을 확인합니다. |
| 파일 목록에 데이터가 보이지 않음 | 수집 이력에서 작업 상태를 확인하고, 진행 중이면 완료까지 기다립니다. |
| 일부 파일만 실패함 | 실패 상세의 파일명과 오류 메시지를 확인하고, 파일 형식과 크기를 점검합니다. |
| 웹 페이지 본문이 비어 있음 | 페이지 유형을 동적 페이지로 바꾸거나 CSS 셀렉터를 조정합니다. |
| 수집 결과가 지식 베이스에 반영되지 않음 | 지식 베이스 컬렉션 연결과 문서 적재 상태를 함께 확인합니다. |