말뭉치 문맥 탐색기
내 문서를 작은 말뭉치로 묶어 검색어가 실제로 쓰인 문맥을 찾습니다. 각 용례는 문서, 행·열과 원문의 왼쪽·오른쪽 맥락을 보여주고, 검색어 주변의 단어는 좌우 출현 수로 집계합니다. 단순 단어 빈도와 달리 검색 위치와 문서별 차이를 함께 확인할 수 있습니다.
주요 기능
- 엄격한 UTF-8 .txt·.md 다중 파일 가져오기와 직접 문서 추가
- 이름이나 정규화된 내용이 같은 문서의 이중 집계 차단
- 유니코드 문자·숫자 토큰의 경계에서만 1~6토큰 구 검색
- 원문 UTF-16 시작·끝 위치, 행·열, 좌우 문맥이 있는 KWIC
- 검색 구의 앞뒤 2·4·8토큰에서 좌우 단어 출현 수 계산
- KWIC·주변 단어·문서별 빈도 각각 수식 보호 UTF-8 CSV 저장
사용 방법
- 예제를 불러오거나 UTF-8 텍스트·마크다운 파일 여러 개를 선택합니다. 문서 이름과 본문을 직접 입력해 추가할 수도 있습니다.
- 문서 목록과 토큰 수를 확인합니다. 같은 이름이나 동일 본문은 한 번만 추가됩니다.
- 검색어 1~6토큰과 좌우 문맥 너비를 선택하고 검색합니다.
- 문서별 빈도, 주변 단어의 왼쪽·오른쪽 횟수, 원문 위치가 있는 KWIC를 살펴봅니다.
- 필요한 보고서를 CSV로 각각 내려받습니다.
활용 예시
- 여러 강의 노트에서 개념의 실제 쓰임과 문서별 차이 확인
- 내 글에서 특정 용어 앞뒤에 자주 쓰는 표현 찾기
- 번역 초안 여러 개에서 같은 구문의 문맥 비교
자주 묻는 질문
한국어 조사나 활용형을 같은 단어로 묶나요?
아니요. 형태소·어간 분석이 없습니다. 연속된 유니코드 문자·숫자를 토큰으로 삼으므로 ‘강’과 ‘강은’은 다른 토큰입니다. 영어 대소문자와 NFC 표기만 정규화합니다.
구 검색은 문장부호를 어떻게 다루나요?
문장부호와 공백은 토큰 경계입니다. 검색어는 공백으로 구분한 1~6개 토큰이어야 합니다. 본문에서 해당 토큰이 연속하면 쉼표나 줄바꿈이 사이에 있어도 구로 일치하며 KWIC에는 원문 부호가 보입니다.
주변 단어 수는 정확히 무엇인가요?
일치한 구의 앞과 뒤에서 지정한 개수만큼 토큰을 세고, 정규화한 단어의 왼쪽·오른쪽 출현을 별도로 합산합니다. 같은 단어가 한 용례의 여러 위치에 있으면 각각 셉니다. 통계적 연어 강도나 인과관계는 계산하지 않습니다.
같은 문서를 두 번 올리면 어떻게 되나요?
이름이 같거나 본문이 Unicode NFC 및 줄바꿈 정규화 후 같은 문서는 거부합니다. 일치 여부를 추정하거나 서로 다른 판본을 자동 병합하지 않습니다.
문서가 서버로 올라가거나 자동 저장되나요?
이 도구의 문서와 분석 결과는 브라우저 탭 메모리에서 처리하며 자동 업로드·자동 저장하지 않습니다. CSV 다운로드를 선택한 경우에만 로컬 파일을 만듭니다.
개인정보 안내
문서·검색어·결과는 이 브라우저 탭에서만 처리합니다. 도구 자체의 자동 서버 전송이나 계정 저장은 없으며, 내보내기 전에 문서 내용과 민감한 정보를 확인하세요.
댓글과 질문