학습 데이터 전처리

원본 데이터(XML, HTML, JSON, TXT)를 학습 목적(PT·SFT)에 맞게 변환·정제하고 학습 탭에 바로 연결합니다.

학습 데이터 전처리


소스 폴더 지정

압축 파일(.zip/.tar.gz)이나 원본 파일(XML, HTML, JSON, TXT 등)이 있는 소스 폴더 경로를 지정합니다. 기본 경로는 /@team/.AppData/fine_tuning/raw입니다.

목표 학습 스테이지 선택

변환할 데이터의 목적을 선택합니다.

스테이지설명
PT — 사전학습 원문 코퍼스변환된 MD 파일 전체를 도메인 코퍼스로 사전학습에 사용합니다
SFT — 지시문 데이터셋 (Alpaca JSONL)instruction/input/output 형식의 지시문 데이터셋으로 변환합니다
DPO준비 중입니다

PT 모드에서는 별도 출력 파일이 필요 없습니다. 변환이 완료되면 소스 폴더 안에 .md 파일이 생성되며, 소스 폴더 경로가 그대로 학습 탭에 연결됩니다.

소스 폴더에 포함된 원본 포맷

참고용으로 소스 폴더에 어떤 형식의 원본이 섞여 있는지 표시합니다. KIPRIS XML(한국 특허), HTML(웹문서), JSON(구조화 데이터), TXT/MD(일반 텍스트) 중에서 선택할 수 있으며, 이 선택은 아래 파이프라인 설명에만 반영됩니다. 실제 서버 처리는 폴더 안의 모든 파일을 일괄 변환합니다.

파이프라인 실행

두 단계로 구성되며, 각 단계는 개별 실행하거나 한 번에 일괄 실행할 수 있습니다.

  1. 압축 아카이브 자동 해제: 소스 폴더 안의 .zip·.tar.gz 파일을 자동으로 풀고 파일 목록을 확인합니다.
  2. 문서 → Markdown 변환: 소스 폴더의 문서 파일(XML, HTML, JSON 등)을 Markdown으로 일괄 변환합니다. 변환된 .md 파일이 소스 폴더에 생성됩니다.

전체 파이프라인 일괄 실행 버튼을 누르면 두 단계가 순서대로 실행됩니다.

관련 문서