Duplicate documents: Pipeline implementation and metadata
Defines duplicate detection and retrieval grouping while preserving each source document and version independently, preventing shared storage identities and invisible cross-project deletion dependencies.