Java로 TF-IDF 키워드 추출 직접 구현하기
TF-IDF 알고리즘 이해TF-IDF(Term Frequency-Inverse Document Frequency)는 문서 내에서 단어의 중요도를 수량화하는 대표적인 통계적 방법입니다. TF(단어 빈도)는 특정 문서에서 해당 단어가 얼마나 자주 등장하는지를, IDF(역문서 빈도)는 전체 문서 집합에서 해당 단어가 얼마나 희귀한지를 측정합니다.수식으로 표현하면 다음과 같습니다:TF(t, d) = (문서 d에서 단 ...
7월 25일 01:30에 게시됨