학습 데이터 분할기
같은 사람이나 가구가 학습과 검증에 동시에 들어가면 평가가 과하게 좋아 보일 수 있습니다. 레이블 열과 그룹 열을 지정하고 집합 비율을 정하면, 모든 행을 한 번씩 배정하고 그룹을 한 집합에 묶습니다. 결과의 실제 분포와 편차를 확인한 뒤 CSV와 재현 명세를 내려받을 수 있습니다.
주요 기능
- seed·입력 행 순서·열 선택·비율에 따라 동일한 배정을 재현합니다.
- 레이블만 선택하면 각 레이블 안에서 행을 나누고 작은 레이블의 누락을 경고합니다.
- 그룹을 선택하면 같은 그룹의 모든 행을 한 집합에 두며, 목표 비율과 달라지는 정도를 보여줍니다.
- 학습·검증·테스트 CSV, 원래 레코드 번호별 배정 CSV, 전체 JSON 명세를 각각 저장합니다.
- UTF-8 CSV/TSV의 인용·줄바꿈을 엄격히 읽고 내보내기 수식 문자열에 작은따옴표를 붙입니다.
사용 방법
- 헤더가 있는 CSV를 붙여넣거나 UTF-8 파일을 선택하고 구분자를 확인합니다.
- 레이블 열과 같은 주체를 묶는 그룹 열을 필요에 따라 지정합니다.
- 합계 100%인 학습·검증·테스트 비율과 seed를 입력하고 분할합니다.
- 실제 집합 크기, 레이블별 분포 및 경고를 확인합니다.
- 원하는 집합 CSV와 배정표·JSON 명세를 내려받아 원래 자료와 대조합니다.
활용 예시
- 고객별 여러 거래 행을 고객 ID로 묶어 같은 고객이 학습과 검증에 동시에 나타나지 않게 합니다.
- 분류 레이블의 비율을 가능한 범위에서 유지하며 소규모 실험용 CSV를 분할합니다.
- 한 그룹이 매우 클 때 목표 비율을 지킬 수 없는 사실을 분포와 경고로 확인합니다.
- seed와 원본 행 순서를 기록해 팀원이 같은 분할을 다시 만들게 합니다.
자주 묻는 질문
층화와 그룹 격리를 동시에 정확히 만족하나요?
그룹 격리는 강제하지만 비율과 레이블 분포는 휴리스틱 목표입니다. 그룹을 쪼개지 않으므로 정확한 비율이나 모든 집합의 레이블 출현을 보장하지 않습니다. 편차와 누락 경고를 확인하세요.
같은 seed만 쓰면 언제나 같은 결과인가요?
같은 입력 행 순서, CSV 문자열, 열 선택, 비율 및 seed일 때 재현됩니다. 입력 순서나 그룹 표기가 달라지면 결과가 달라질 수 있습니다. 암호학적 난수 생성기는 아닙니다.
기존 랜덤 생성기와 어떻게 다른가요?
랜덤 생성기는 임의 값을 만드는 도구입니다. 이 도구는 입력된 모든 CSV 행을 서로 겹치지 않는 학습·검증·테스트 집합에 배정하고 그룹·레이블 분포를 보고합니다.
개인정보가 서버에 올라가나요?
입력과 분할은 브라우저 메모리에서 처리됩니다. 생성한 CSV·JSON에는 원본 행이 들어가므로 다른 곳에 공유하기 전에 직접 확인하세요.
개인정보 안내
선택한 CSV와 seed는 이 페이지의 메모리에서만 사용하고 자동 업로드·저장하지 않습니다. 내려받은 집합·JSON에는 원본 행과 선택한 레이블·그룹 값이 포함될 수 있습니다.
댓글과 질문