지식 인덱싱
사용자가 올린 문서가 AI 검색에 사용할 수 있는 상태인지 확인합니다. 여기서 만든 검색 데이터는 AI가 관련 문서를 찾아 답변하는 RAG에 사용됩니다.

인덱싱 요약
현재 인덱싱 상태를 한눈에 확인합니다.
| 항목 | 설명 |
|---|---|
| 대기 갱신 | 새로 만들거나 수정한 파일이 AI 검색에 반영되기를 기다리는 상태 |
| 대기 삭제 | 삭제한 파일의 검색 데이터가 정리되기를 기다리는 상태 |
| 대기 임베딩 | 문서에서 글자를 읽었으며 AI 검색 데이터로 만들기를 기다리는 상태 |
| 임베딩 수 | 현재까지 완료된 임베딩 총 개수 |
| 인덱싱 모드 | AI 검색 데이터를 만들 파일의 범위 (예: 전체 인덱싱) |
| 임베딩 제공자 | 사용 중인 AI 임베딩 모델 (예: Ollama bge-m3:latest / 1024d) |
| 실행 포함 루트 | 인덱싱 대상 경로 |
| 팀 체크포인트 | 팀 폴더를 마지막으로 확인한 시각 |
| 클라이언트 체크포인트 | 개인 폴더를 마지막으로 확인한 시각 |
| 마지막 새로고침 | 상태 마지막 갱신 시각 |
자동 새로고침을 켜두거나 새로고침 버튼으로 현황을 수동으로 갱신할 수 있습니다.
시작 전 설정 확인
인덱싱을 시작하기 전에 아래 필수 설정을 확인하세요. 각 버튼을 누르면 해당 설정으로 이동합니다.
| 필수 설정 | 확인할 내용 | 이동 |
|---|---|---|
| AI 런타임 | Ollama, LM Studio 등 인덱싱에 사용할 AI 런타임을 선택하고 연결 상태를 확인합니다. | AI 런타임 설정하기 |
| 비전 모델(VL) | PDF와 이미지의 내용을 읽을 비전 모델을 AI 모델 중에서 선택합니다. | 비전 모델 설정하기 |
| AI 벡터 DB | 벡터 스토리지를 Local(SQLite), Milvus, Qdrant 등에서 선택하고 연결 정보를 설정합니다. | AI 벡터 DB 설정하기 |
| 임베딩 모델 | 문서를 검색용 벡터로 변환할 모델을 선택합니다. (예: bge-m3) | 임베딩 모델 설정하기 |
AI 런타임에서 사용하는 비전 모델과 임베딩 모델은 선택만으로 설치되지 않습니다. 인덱싱을 시작하기 전에 각 모델을 해당 AI 런타임에 다운로드하세요.
수집 및 처리 규칙
언제 검색 데이터를 만들지, 어느 폴더의 문서를 AI 검색에 사용할지 정합니다.
지식 인덱싱 활성화
전체 지식 인덱싱 기능을 켜거나 끕니다.
인덱싱 모드 설정
| 항목 | 설명 | 기본값 |
|---|---|---|
| 인덱싱 모드 | 인덱싱 범위 및 방식 선택 | 전체 인덱싱 |
| 대기 시간(분) | 파일 변경 감지 후 인덱싱 시작까지 대기하는 시간 | 20 |
| 최대 동시 작업 수 | 동시에 처리할 수 있는 인덱싱 작업 수 | 1 |
| 워커 실행 허용 | 끄면 변경된 파일은 계속 찾지만 AI 검색 데이터는 만들지 않습니다. | 활성 |
| 고부하 시 자동 일시정지 | 서버 사용량이 높으면 인덱싱을 잠시 멈추고, 서버가 안정되면 다시 시작합니다. | 활성 |
| 부스트 모드 | 파일이 바뀌면 5초 안에 인덱싱을 시작하고 밀린 작업도 즉시 처리합니다. 빠르게 반영하고 싶을 때 활성화합니다. | 비활성 |
| 허용 시간대 | 인덱싱을 허용할 시간대를 지정합니다. 비워두면 언제든 인덱싱합니다. (예: 01:00-06:00) | 제한 없음 |
포함 루트
인덱싱할 폴더 경로를 지정합니다. 비워두면 전체 경로가 대상입니다.
예시:
/@team/docs
/@client/projects
AI 임베딩 모델 설정
문서를 검색 데이터로 바꾸는 AI 모델을 선택합니다.
| 제공자 | 설명 |
|---|---|
| Ollama | 로컬에 설치된 Ollama 모델을 사용합니다. (예: bge-m3:latest) |
| ONNX Local CPU | CPU 기반으로 로컬에서 실행되는 ONNX 모델을 사용합니다. |
| ONNX Local GPU | GPU 가속을 사용하는 로컬 ONNX 모델을 사용합니다. |
| Remote API | 외부 API를 통해 임베딩 모델을 사용합니다. |
모델이 설치되어 있지 않은 제공자는 사용 가능한 모델 없음으로 표시됩니다.
| 항목 | 설명 |
|---|---|
| 디멘전(차원) 크기 | AI 모델이 사용하는 검색 데이터의 크기입니다. 선택한 모델에 맞춰 자동으로 설정됩니다. (예: 1024) |
| PDF/이미지 추출 전략 | PDF와 이미지에서 글자를 읽는 방법을 선택합니다. VL 우선, 실패 시 OCR은 먼저 이미지 이해 AI를 사용하고, 실패하면 문자 인식을 사용한다는 뜻입니다. |
PDF/이미지 포함 패턴
글자를 읽을 PDF와 이미지 파일의 확장자 또는 경로 규칙을 입력합니다.
예시:
*.pdf, *.png, image/**/*
PDF/이미지 제외 패턴
처리하지 않을 PDF와 이미지 파일의 확장자 또는 경로 규칙을 입력합니다. 비워두면 위에서 포함한 파일을 모두 처리합니다.
예시:
thumbs.db, *.gif, cache/**
저장 공간별 진행 상태
각 팀이나 개인 저장 공간별로 자료들이 AI에게 전달되기 위해 얼마나 대기 중인지 확인합니다.
스페이스(team/client)와 사용자 기준으로 검색할 수 있으며, 대기 갱신 수 기준으로 정렬할 수 있습니다.
| 항목 | 설명 |
|---|---|
| 스페이스 | 팀 공간(team) 또는 개인 공간(client) 구분 |
| 사용자 | 개인 공간의 경우 해당 사용자 |
| 대기 갱신 | 새로 만들거나 수정한 파일이 AI 검색에 반영되기를 기다리는 상태 |
| 대기 삭제 | 삭제한 파일의 검색 데이터가 정리되기를 기다리는 상태 |
| 대기 임베딩 | 문서에서 글자를 읽었으며 AI 검색 데이터로 만들기를 기다리는 상태 |
| 임베딩 수 | 완료된 임베딩 총 개수 |
AI 학습 데이터 현황
AI 검색 데이터가 모델별로 얼마나 만들어졌는지 확인합니다. 원본 문서로 AI 모델을 새로 학습시키는 기능은 아닙니다.
| 항목 | 설명 |
|---|---|
| 제공자 | 임베딩에 사용된 모델 제공자 (예: ollama) |
| 모델 | 사용된 임베딩 모델명 (예: bge-m3:latest) |
| 개수 | 해당 모델로 생성된 임베딩 총 개수 |
개수 기준으로 정렬해 모델별 검색 데이터 규모를 비교할 수 있습니다.