음원 성분 분리기
Deezer Spleeter 2-stem 모델의 공식 fp16 ONNX 변환본 두 개로 보컬과 반주의 주파수 마스크를 추정합니다. 44.1kHz 스테레오로 디코딩한 구간의 4096/1024 STFT에서 모델을 실행하고 두 성분과 합계를 A/B로 청취합니다.
주요 기능
- SHA-256으로 확인한 MIT 라이선스 Spleeter 2-stem 변환 모델을 로컬 WASM에서 실행
- 44.1kHz 스테레오·Hann 4096/1024 STFT와 512프레임 모델 입력 계약 유지
- 두 모델 출력의 제곱 정규화 마스크로 실제 보컬과 반주 트랙 추정
- 원본·보컬·반주·재합성 오디오를 듣고 잔차 보정 전후 RMS 오차 확인
- 최대 90초 파일에서 3~10초 구간 선택, 권리 확인, 메모리 워커 취소, Float32 WAV·JSON 저장
사용 방법
- 처리 권리가 있는 오디오 파일을 선택하고 권리 확인란을 체크합니다.
- 파일에서 3~10초 구간의 시작과 길이를 설정합니다.
- 분리를 실행하고 모델 다운로드·STFT·추론·재합성을 기다립니다.
- 원본, 보컬, 반주, 재합성을 듣고 누출과 아티팩트를 확인한 뒤 WAV와 진단 JSON을 저장합니다.
활용 예시
- 자작곡의 가이드 보컬과 반주를 분리해 편곡 시안 만들기
- 권리를 가진 연습곡의 보컬을 줄인 반주를 들어보기
- 추정 스템과 합친 음원을 원본과 비교하며 아티팩트 확인
- 허가된 짧은 구간의 두 스템과 모델 해시·재합성 수치를 보관
자주 묻는 질문
원래 스튜디오 보컬과 반주를 정확히 복원하나요?
아닙니다. 학습 모델의 추정치라 보컬에 악기가 남거나 반주에 목소리가 샐 수 있습니다. 재합성 오차가 낮아도 개별 스템의 품질은 보장하지 않습니다.
합친 음원의 오차가 거의 0이면 완벽히 분리되었다는 뜻인가요?
아닙니다. 독립 역 STFT의 원시 RMS 오차를 먼저 기록하고, 최종 출력에는 누락 잔차를 반주에 더해 원본 합계를 유지합니다. 이 수치는 분리의 정답률이 아닙니다.
왜 10초만 처리하나요?
모델의 512프레임 입력과 브라우저의 메모리·처리 시간을 지키기 위한 제한입니다. 90초 이하 파일에서 원하는 3~10초 구간을 선택할 수 있습니다.
저작권을 자동 확인하나요?
아닙니다. 사용자가 직접 처리 권리가 있음을 확인해야 합니다. 도구는 권리나 허가를 조사하지 못하며, 결과 공유·사용 시에도 원래 음원의 이용 조건을 지켜야 합니다.
오디오는 서버에 업로드되나요?
아닙니다. 파일은 브라우저 메모리에 남고 모델과 WASM 코드만 이 사이트에서 내려받습니다. 취소하면 추론 워커를 종료합니다.
개인정보 안내
음원은 브라우저에서 디코딩·추론·내보내며 업로드하지 않습니다. 첫 실행에 사이트의 고정 모델 2개(약 38 MiB)와 WASM 런타임(약 13 MiB)을 다운로드합니다. 권리 확인은 사용자의 자기 진술이며 자동 검증은 아닙니다.
댓글과 질문