{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:6J4EYKOMYOXQ36LFZJY5DK2H4E","short_pith_number":"pith:6J4EYKOM","schema_version":"1.0","canonical_sha256":"f2784c29ccc3af0df965ca71d1ab47e10b1b56a57f6e6a347611d1e0cb3120b1","source":{"kind":"arxiv","id":"2312.06648","version":3},"attestation_state":"computed","paper":{"title":"Dense X Retrieval: What Retrieval Granularity Should We Use?","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.IR"],"primary_cat":"cs.CL","authors_text":"Dong Yu, Hongming Zhang, Hongwei Wang, Kaixin Ma, Sihao Chen, Tong Chen, Wenhao Yu, Xinran Zhao","submitted_at":"2023-12-11T18:57:35Z","abstract_excerpt":"Dense retrieval has become a prominent method to obtain relevant context or world knowledge in open-domain NLP tasks. When we use a learned dense retriever on a retrieval corpus at inference time, an often-overlooked design choice is the retrieval unit in which the corpus is indexed, e.g. document, passage, or sentence. We discover that the retrieval unit choice significantly impacts the performance of both retrieval and downstream tasks. Distinct from the typical approach of using passages or sentences, we introduce a novel retrieval unit, proposition, for dense retrieval. Propositions are de"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2312.06648","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2023-12-11T18:57:35Z","cross_cats_sorted":["cs.AI","cs.IR"],"title_canon_sha256":"7ab6ea3c38d6a79d00140ad28fd1928c1f3b10782a9bb21398ba5b61e625db99","abstract_canon_sha256":"491a5a148ca5f5ee2c67303b5a60f5d2a27380657667289047bccb6feeecfd5c"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:15:28.632031Z","signature_b64":"IdwqFI9u9TeIiP/GnEfiqEVp30Ulvh/gdZNRE1iq4TIqulS5SKMvf1L/atdFCRTm1AOXSVmjfmVNPcM7ECu6Bg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"f2784c29ccc3af0df965ca71d1ab47e10b1b56a57f6e6a347611d1e0cb3120b1","last_reissued_at":"2026-07-05T09:15:28.631500Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:15:28.631500Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Dense X Retrieval: What Retrieval Granularity Should We Use?","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.IR"],"primary_cat":"cs.CL","authors_text":"Dong Yu, Hongming Zhang, Hongwei Wang, Kaixin Ma, Sihao Chen, Tong Chen, Wenhao Yu, Xinran Zhao","submitted_at":"2023-12-11T18:57:35Z","abstract_excerpt":"Dense retrieval has become a prominent method to obtain relevant context or world knowledge in open-domain NLP tasks. When we use a learned dense retriever on a retrieval corpus at inference time, an often-overlooked design choice is the retrieval unit in which the corpus is indexed, e.g. document, passage, or sentence. We discover that the retrieval unit choice significantly impacts the performance of both retrieval and downstream tasks. Distinct from the typical approach of using passages or sentences, we introduce a novel retrieval unit, proposition, for dense retrieval. Propositions are de"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2312.06648","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2312.06648/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2312.06648","created_at":"2026-07-05T09:15:28.631562+00:00"},{"alias_kind":"arxiv_version","alias_value":"2312.06648v3","created_at":"2026-07-05T09:15:28.631562+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2312.06648","created_at":"2026-07-05T09:15:28.631562+00:00"},{"alias_kind":"pith_short_12","alias_value":"6J4EYKOMYOXQ","created_at":"2026-07-05T09:15:28.631562+00:00"},{"alias_kind":"pith_short_16","alias_value":"6J4EYKOMYOXQ36LF","created_at":"2026-07-05T09:15:28.631562+00:00"},{"alias_kind":"pith_short_8","alias_value":"6J4EYKOM","created_at":"2026-07-05T09:15:28.631562+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.23697","citing_title":"SemChunk-C: Semantic Segmentation for C Code","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2312.10997","citing_title":"Retrieval-Augmented Generation for Large Language Models: A Survey","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2311.05232","citing_title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2410.10813","citing_title":"LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory","ref_index":63,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/6J4EYKOMYOXQ36LFZJY5DK2H4E","json":"https://pith.science/pith/6J4EYKOMYOXQ36LFZJY5DK2H4E.json","graph_json":"https://pith.science/api/pith-number/6J4EYKOMYOXQ36LFZJY5DK2H4E/graph.json","events_json":"https://pith.science/api/pith-number/6J4EYKOMYOXQ36LFZJY5DK2H4E/events.json","paper":"https://pith.science/paper/6J4EYKOM"},"agent_actions":{"view_html":"https://pith.science/pith/6J4EYKOMYOXQ36LFZJY5DK2H4E","download_json":"https://pith.science/pith/6J4EYKOMYOXQ36LFZJY5DK2H4E.json","view_paper":"https://pith.science/paper/6J4EYKOM","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2312.06648&json=true","fetch_graph":"https://pith.science/api/pith-number/6J4EYKOMYOXQ36LFZJY5DK2H4E/graph.json","fetch_events":"https://pith.science/api/pith-number/6J4EYKOMYOXQ36LFZJY5DK2H4E/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/6J4EYKOMYOXQ36LFZJY5DK2H4E/action/timestamp_anchor","attest_storage":"https://pith.science/pith/6J4EYKOMYOXQ36LFZJY5DK2H4E/action/storage_attestation","attest_author":"https://pith.science/pith/6J4EYKOMYOXQ36LFZJY5DK2H4E/action/author_attestation","sign_citation":"https://pith.science/pith/6J4EYKOMYOXQ36LFZJY5DK2H4E/action/citation_signature","submit_replication":"https://pith.science/pith/6J4EYKOMYOXQ36LFZJY5DK2H4E/action/replication_record"}},"created_at":"2026-07-05T09:15:28.631562+00:00","updated_at":"2026-07-05T09:15:28.631562+00:00"}