Lexical non-learning hashes match near-duplicates well, while BGE-based quantized embeddings better preserve rewritten scientific similarity, under a shared ranking protocol on CSFCube and RELISH.
Deduplicating training data makes language models better
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.IR 1years
2026 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
H3D: Benchmarking Unsupervised Text Hashing for Fine-Grained Document Deduplication
Lexical non-learning hashes match near-duplicates well, while BGE-based quantized embeddings better preserve rewritten scientific similarity, under a shared ranking protocol on CSFCube and RELISH.