CHAAANY ARCHIVE

tfidf

1개의 기록을 주제별로 둘러보세요.

자연어 처리로 문서 분류하기: TF-IDF·로지스틱 회귀 기준선 만들기

문서 분류의 가장 단순하고 강한 기준선은 텍스트를 TF-IDF 벡터로 바꾸고 선형 분류기를 학습하는 것이다. 형태소 분석이나 거대한 언어 모델부터 시작하지 않아도, 데이터 분할과 평가를 제대로 하면 뉴스 주제·문의 유형·스팸 분류 같은 문제의 첫 결과를 빠르게 만들 수 있다.기존 노트에는 형태소, 코사인 유사도, 로지스틱 회귀, 혼동 행렬까지 관련 용어를 거의 모두 넣었다. 다시 보니 실제로 모델을 만드는 순서와 각 단계의 선택 이유가 잘 보이지 않았다. 이번에는 데이터 확인 → 분할 → 벡터화 → 학습 → 오류 분석 흐름으로 정리했다.문서 분류는 어떤 문제인가입력은 문서이고 출력은 미리 정한 카테고리다. 예를 들어 고객 문의를 결제, 배송, 환불로 나누거나 뉴스를 정치, 경제, 스포츠로 분류할 수 있다..

728x90