{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:NB6Q3FJUGVIVZY53JR5BFO3QCO","short_pith_number":"pith:NB6Q3FJU","schema_version":"1.0","canonical_sha256":"687d0d953435515ce3bb4c7a12bb7013b936a8524139a7533c8d13f8d474f98b","source":{"kind":"arxiv","id":"2408.12194","version":2},"attestation_state":"computed","paper":{"title":"Large Language Models as Foundations for Next-Gen Dense Retrieval: A Comprehensive Empirical Assessment","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Jun Zhao, Kang Liu, Kun Luo, Minghao Qin, Shitao Xiao, Zheng Liu","submitted_at":"2024-08-22T08:16:07Z","abstract_excerpt":"Pretrained language models like BERT and T5 serve as crucial backbone encoders for dense retrieval. However, these models often exhibit limited generalization capabilities and face challenges in improving in domain accuracy. Recent research has explored using large language models (LLMs) as retrievers, achieving SOTA performance across various tasks. Despite these advancements, the specific benefits of LLMs over traditional retrievers and the impact of different LLM configurations, such as parameter sizes, pretraining duration, and alignment processes on retrieval tasks remain unclear. In this"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2408.12194","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-08-22T08:16:07Z","cross_cats_sorted":[],"title_canon_sha256":"16a6c3d31752a2378088ee353fd1b235f33e9c40b59756c6ce6a652ade8975eb","abstract_canon_sha256":"a7005254bd49b95b063408c2f9b141bdcc25b38f8505ee3b5e30358b056352bd"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:58:26.724697Z","signature_b64":"/zNljlZWoZ5xyuzBwU2GbovIWtP/yJcD/r3zzMqnxZm0B6oKsJedXOOs7mUrcQMGqe4g+Pn3EURKzfUhANYjDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"687d0d953435515ce3bb4c7a12bb7013b936a8524139a7533c8d13f8d474f98b","last_reissued_at":"2026-07-05T08:58:26.724270Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:58:26.724270Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Large Language Models as Foundations for Next-Gen Dense Retrieval: A Comprehensive Empirical Assessment","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Jun Zhao, Kang Liu, Kun Luo, Minghao Qin, Shitao Xiao, Zheng Liu","submitted_at":"2024-08-22T08:16:07Z","abstract_excerpt":"Pretrained language models like BERT and T5 serve as crucial backbone encoders for dense retrieval. However, these models often exhibit limited generalization capabilities and face challenges in improving in domain accuracy. Recent research has explored using large language models (LLMs) as retrievers, achieving SOTA performance across various tasks. Despite these advancements, the specific benefits of LLMs over traditional retrievers and the impact of different LLM configurations, such as parameter sizes, pretraining duration, and alignment processes on retrieval tasks remain unclear. In this"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2408.12194","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2408.12194/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2408.12194","created_at":"2026-07-05T08:58:26.724341+00:00"},{"alias_kind":"arxiv_version","alias_value":"2408.12194v2","created_at":"2026-07-05T08:58:26.724341+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2408.12194","created_at":"2026-07-05T08:58:26.724341+00:00"},{"alias_kind":"pith_short_12","alias_value":"NB6Q3FJUGVIV","created_at":"2026-07-05T08:58:26.724341+00:00"},{"alias_kind":"pith_short_16","alias_value":"NB6Q3FJUGVIVZY53","created_at":"2026-07-05T08:58:26.724341+00:00"},{"alias_kind":"pith_short_8","alias_value":"NB6Q3FJU","created_at":"2026-07-05T08:58:26.724341+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2506.11603","citing_title":"TongSearch-QR: Reinforced Query Reasoning for Retrieval","ref_index":21,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/NB6Q3FJUGVIVZY53JR5BFO3QCO","json":"https://pith.science/pith/NB6Q3FJUGVIVZY53JR5BFO3QCO.json","graph_json":"https://pith.science/api/pith-number/NB6Q3FJUGVIVZY53JR5BFO3QCO/graph.json","events_json":"https://pith.science/api/pith-number/NB6Q3FJUGVIVZY53JR5BFO3QCO/events.json","paper":"https://pith.science/paper/NB6Q3FJU"},"agent_actions":{"view_html":"https://pith.science/pith/NB6Q3FJUGVIVZY53JR5BFO3QCO","download_json":"https://pith.science/pith/NB6Q3FJUGVIVZY53JR5BFO3QCO.json","view_paper":"https://pith.science/paper/NB6Q3FJU","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2408.12194&json=true","fetch_graph":"https://pith.science/api/pith-number/NB6Q3FJUGVIVZY53JR5BFO3QCO/graph.json","fetch_events":"https://pith.science/api/pith-number/NB6Q3FJUGVIVZY53JR5BFO3QCO/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/NB6Q3FJUGVIVZY53JR5BFO3QCO/action/timestamp_anchor","attest_storage":"https://pith.science/pith/NB6Q3FJUGVIVZY53JR5BFO3QCO/action/storage_attestation","attest_author":"https://pith.science/pith/NB6Q3FJUGVIVZY53JR5BFO3QCO/action/author_attestation","sign_citation":"https://pith.science/pith/NB6Q3FJUGVIVZY53JR5BFO3QCO/action/citation_signature","submit_replication":"https://pith.science/pith/NB6Q3FJUGVIVZY53JR5BFO3QCO/action/replication_record"}},"created_at":"2026-07-05T08:58:26.724341+00:00","updated_at":"2026-07-05T08:58:26.724341+00:00"}