The corpus combines the top 5,000 production retrieval results per query, deduplicated with MinHash-LSH.
Each document is a plausible match for at least one query, including difficult distractors that match the topic but miss a required date, entity, or version.