2013 · 41 citations · 23 references
EngineeringInformation RetrievalData ScienceData MiningPattern RecognitionSimilarity MeasureKnowledge DiscoveryData SkewRange SearchingComputer ScienceData RetrievalQuery VectorDistance Query ProcessingSimilarity SearchQuery Optimization
Hamming distance measures the number of dimensions where two vectors have different values. In applications such as pattern recognition, information retrieval, and databases, we often need to efficiently process Hamming distance query, which retrieves vectors in a database that have no more than k Hamming distance from a given query vector. Existing work on efficient Hamming distance query processing has some of the following limitations, such as only applicable to tiny error threshold values, unable to deal with vectors where the value domain is large, or unable to attain robust performance in the presence of data skew.
23
Piotr Indyk, Rajeev Motwani · 1998 · 4.1K citations · Full text
Locality-sensitive hashing scheme based on p-stable distributions
Mayur Datar, Nicole Immorlica, Piotr Indyk et al. · 2004 · 2.9K citations
Syntactic clustering of the Web
Andrei Broder, S. Glassman, Mark S. Manasse et al. · Computer Networks and ISDN Systems · 1997 · 1.3K citations
Natural Language Processing, Document Clustering, Web Mining +11
Detecting near-duplicates for web crawling
Gurmeet Singh Manku, Arvind Kumar Jain, Anish Das Sarma · 2007 · 601 citations
Efficient exact set-similarity joins
Arvind Arasu, Venkatesh Ganti, Raghav Kaushik · Very Large Data Bases · 2006 · 404 citations