데이터 품질 프로파일러
문법이 올바른 표에도 빠진 측정값, 섞인 타입, 모든 값이 같은 열이 있을 수 있습니다. 이 도구는 열별 특징을 계산하고 분포 차트와 원본 레코드 근거를 연결합니다. 원본을 바꾸지 않으며 정상적인 관측값을 자동으로 오류로 확정하지 않습니다.
주요 기능
- 오류를 명확히 표시하는 CSV/TSV·평평한 JSON 레코드 읽기
- 열 타입별 개수·누락·타입을 구분하는 고유값·상수 열 보고
- 최대 10개 숫자 구간 또는 상위 8개 범주 빈도 차트
- 선형 사분위수·평균·중앙값과 공개된 1.5×IQR 경계
- 의심 원본 레코드와 전체 JSON 보고서 저장
- 작업 취소·로컬 처리 한도·수식 문자열 보호 CSV
사용 방법
- CSV·JSON 레코드를 붙여넣거나 UTF-8 파일을 선택합니다.
- 형식과 구분 문자를 고르고 쉼표가 천 단위를 뜻할 때만 인식 옵션을 켭니다.
- 프로파일 분석을 실행하고 열별 요약을 확인합니다.
- 열을 선택해 분포·통계·의심 레코드를 확인합니다.
- JSON 보고서 또는 의심 레코드 CSV를 저장하고 표시된 값을 원본 맥락과 대조합니다.
활용 예시
- 센서 내보내기 자료의 누락 측정값과 떨어져 있는 큰 값 확인
- 분석 전 상수 열이나 날짜·텍스트가 섞인 열 찾기
- 설문 내보내기 자료의 실제 값 빈도 비교
- 스프레드시트 가져오기 전 원본 레코드 위치를 유지하며 품질 점검
자주 묻는 질문
무엇을 누락값으로 보나요?
JSON null·없는 JSON 키·빈 CSV 셀·공백만 있는 문자열을 누락으로 봅니다. 글자로 적힌 null과 NA는 텍스트로 남습니다. 모두 누락인 열은 상수가 아니라 빈 열이며, 누락이 아닌 값의 타입까지 비교한 고유값이 하나면 상수 열입니다.
숫자·날짜·식별자 타입은 어떻게 추론하나요?
±9,007,199,254,740,991 안의 유한한 십진수·지수 표기를 숫자로 봅니다. 001처럼 앞에 0이 있는 문자열은 텍스트입니다. 천 단위 쉼표는 옵션을 켜고 1,234.5 형식이 맞아야 인식합니다. true/false는 불리언, 유효한 YYYY-MM-DD는 날짜이며 나머지는 텍스트입니다. 여러 종류가 있으면 혼합 열입니다.
극단값 의심 행의 기준은 무엇인가요?
숫자가 4개 이상일 때 정렬 위치 (n−1)×q를 선형 보간해 사분위수를 구합니다. Q1−1.5×IQR보다 작거나 Q3+1.5×IQR보다 큰 값을 표시합니다. 혼합 열은 숫자 부분만 계산합니다. 검토 기준일 뿐 오류의 증거가 아니며 행을 삭제하지 않습니다.
분포 차트에는 무엇이 보이나요?
숫자 부분을 최대 10개 같은 너비 구간으로 나누고 마지막 구간의 상한은 포함합니다. 상수는 한 구간입니다. 숫자가 없으면 타입을 구분하는 상위 8개 값과 나머지 빈도를 표시합니다. 누락값은 별도로 셉니다.
중첩 JSON이나 큰 정수도 읽을 수 있나요?
문자열·숫자·불리언·null만 담은 평평한 객체 배열을 지원합니다. 중복 키와 중첩 객체·배열은 거부합니다. 숫자 토큰이 넘치거나 0으로 축소되거나 안전한 크기를 넘으면 변환 전에 거부하므로 정확한 큰 식별자는 문자열로 넣으세요. 숫자 계산은 자바스크립트 부동소수점을 사용합니다.
다운로드에는 어떤 정보가 들어가나요?
JSON 보고서에는 모든 열·규칙·통계·분포 구간·의심 값이 들어갑니다. CSV는 원본 레코드 번호와 경계를 포함한 의심 근거입니다. CSV 번호는 헤더를 포함한 논리 레코드 기준이고 JSON은 첫 객체가 1번입니다. CSV의 수식처럼 보이는 문자열 앞에는 작은따옴표를 붙입니다.
개인정보 안내
입력과 결과는 현재 페이지의 브라우저 메모리에서 처리합니다. 표 내용을 서버·URL·분석 이벤트로 보내거나 브라우저 저장소에 자동 보관하지 않습니다. 다운로드는 직접 요청할 때만 만들고, 입력을 바꾸면 이전 결과를 지웁니다.
댓글과 질문