2004 · 36 citations · 7 references
Cluster ComputingEngineeringCross-lingual RepresentationCorpus LinguisticsText MiningNatural Language ProcessingInformation RetrievalData ScienceData MiningBilingual DictionariesComputational LinguisticsCross-lingual Similarity MeasureDocument ClassificationMultilingual Document ClustersLanguage StudiesDocument ClusteringKnowledge DiscoveryCross-language RetrievalVector Space ModelShared Nearest NeighborLinguistics
Cross Language Information Retrieval community has brought up search engines over multilingual corpora, and multilingual text categorization systems. In this paper, we focus on the multilingual clusters discovery problem, which aim is to extract topic-related multilingual document clusters from a multilingual document collection in an unsupervised way. Our approach is based on a linguistic analysis of the documents that allows to identify relevant features for a vector representation of the documents, each language being associated with a different vector space. We propose a cross-lingual similarity measure for the documents, using bilingual dictionaries. A Shared Nearest Neighbor clustering algorithm is then used to build the clusters We present an evaluation framework for this task, analyze and discuss the results we obtained and propose directions for future works.
7
A Comparison of Document Clustering Techniques
Michael Steinbach, George Karypis, Vipin Kumar · 2000 · 2.5K citations · Full text
An Evaluation of Statistical Approaches to Text Categorization
Yiming Yang · Information Retrieval · 1999 · 1.9K citations
Document clustering with committees
Patrick Pantel, Dekang Lin · 2002 · 174 citations