{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:UUKN57VBMGU7PDNUHPWVOMC6LW","short_pith_number":"pith:UUKN57VB","schema_version":"1.0","canonical_sha256":"a514defea161a9f78db43bed57305e5d930070fcdab95d6e89764292f1d6c993","source":{"kind":"arxiv","id":"2407.02883","version":3},"attestation_state":"computed","paper":{"title":"CoIR: A Comprehensive Benchmark for Code Information Retrieval Models","license":"http://creativecommons.org/publicdomain/zero/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.IR","authors_text":"Hao Zhang, Kuicai Dong, Ruiming Tang, Wei Xia, Xiangyang Li, Xinyi Dai, Yasheng Wang, Yi Quan Lee","submitted_at":"2024-07-03T07:58:20Z","abstract_excerpt":"Despite the substantial success of Information Retrieval (IR) in various NLP tasks, most IR systems predominantly handle queries and corpora in natural language, neglecting the domain of code retrieval. Code retrieval is critically important yet remains under-explored, with existing methods and benchmarks inadequately representing the diversity of code in various domains and tasks. Addressing this gap, we present COIR (Code Information Retrieval Benchmark), a robust and comprehensive benchmark specifically designed to assess code retrieval capabilities. COIR comprises ten meticulously curated "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2407.02883","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/publicdomain/zero/1.0/","primary_cat":"cs.IR","submitted_at":"2024-07-03T07:58:20Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"87b56b9ceea4cabeb1c9b8835e3f76b17dd4d8d9953bed915ae6f2e2e2ce5a50","abstract_canon_sha256":"ced8b88c170e79365d82ad73defd629d424fef51c9f90f029530980ff3ca63bd"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:16:50.031720Z","signature_b64":"DsepFgnHdJbic1csWxsTRoie1D8RJz7nZ2ja2+N6JWFJNqPdveC0VPJ9efE8Vahw/YWrfnLMsME4Upxic/fICg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"a514defea161a9f78db43bed57305e5d930070fcdab95d6e89764292f1d6c993","last_reissued_at":"2026-07-05T11:16:50.031213Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:16:50.031213Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"CoIR: A Comprehensive Benchmark for Code Information Retrieval Models","license":"http://creativecommons.org/publicdomain/zero/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.IR","authors_text":"Hao Zhang, Kuicai Dong, Ruiming Tang, Wei Xia, Xiangyang Li, Xinyi Dai, Yasheng Wang, Yi Quan Lee","submitted_at":"2024-07-03T07:58:20Z","abstract_excerpt":"Despite the substantial success of Information Retrieval (IR) in various NLP tasks, most IR systems predominantly handle queries and corpora in natural language, neglecting the domain of code retrieval. Code retrieval is critically important yet remains under-explored, with existing methods and benchmarks inadequately representing the diversity of code in various domains and tasks. Addressing this gap, we present COIR (Code Information Retrieval Benchmark), a robust and comprehensive benchmark specifically designed to assess code retrieval capabilities. COIR comprises ten meticulously curated "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.02883","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2407.02883/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2407.02883","created_at":"2026-07-05T11:16:50.031271+00:00"},{"alias_kind":"arxiv_version","alias_value":"2407.02883v3","created_at":"2026-07-05T11:16:50.031271+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.02883","created_at":"2026-07-05T11:16:50.031271+00:00"},{"alias_kind":"pith_short_12","alias_value":"UUKN57VBMGU7","created_at":"2026-07-05T11:16:50.031271+00:00"},{"alias_kind":"pith_short_16","alias_value":"UUKN57VBMGU7PDNU","created_at":"2026-07-05T11:16:50.031271+00:00"},{"alias_kind":"pith_short_8","alias_value":"UUKN57VB","created_at":"2026-07-05T11:16:50.031271+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":7,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.22778","citing_title":"HAKARI-Bench: A Lightweight Benchmark for Comparing Retrieval Architectures and Efficiency Settings under Unified Conditions","ref_index":103,"is_internal_anchor":false},{"citing_arxiv_id":"2605.27295","citing_title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2412.13663","citing_title":"Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference","ref_index":162,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18561","citing_title":"Improving BM25 Code Retrieval Under Fixed Generic Tokenization: Adaptive q-Log Odds as a Drop-In BM25 Fix","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2506.03487","citing_title":"ProRank: Prompt Warmup via Reinforcement Learning for Small Language Models Reranking","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2602.15412","citing_title":"Social Life of Code: Modeling Evolution through Code Embedding and Opinion Dynamics","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13521","citing_title":"Granite Embedding Multilingual R2 Models","ref_index":9,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/UUKN57VBMGU7PDNUHPWVOMC6LW","json":"https://pith.science/pith/UUKN57VBMGU7PDNUHPWVOMC6LW.json","graph_json":"https://pith.science/api/pith-number/UUKN57VBMGU7PDNUHPWVOMC6LW/graph.json","events_json":"https://pith.science/api/pith-number/UUKN57VBMGU7PDNUHPWVOMC6LW/events.json","paper":"https://pith.science/paper/UUKN57VB"},"agent_actions":{"view_html":"https://pith.science/pith/UUKN57VBMGU7PDNUHPWVOMC6LW","download_json":"https://pith.science/pith/UUKN57VBMGU7PDNUHPWVOMC6LW.json","view_paper":"https://pith.science/paper/UUKN57VB","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2407.02883&json=true","fetch_graph":"https://pith.science/api/pith-number/UUKN57VBMGU7PDNUHPWVOMC6LW/graph.json","fetch_events":"https://pith.science/api/pith-number/UUKN57VBMGU7PDNUHPWVOMC6LW/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/UUKN57VBMGU7PDNUHPWVOMC6LW/action/timestamp_anchor","attest_storage":"https://pith.science/pith/UUKN57VBMGU7PDNUHPWVOMC6LW/action/storage_attestation","attest_author":"https://pith.science/pith/UUKN57VBMGU7PDNUHPWVOMC6LW/action/author_attestation","sign_citation":"https://pith.science/pith/UUKN57VBMGU7PDNUHPWVOMC6LW/action/citation_signature","submit_replication":"https://pith.science/pith/UUKN57VBMGU7PDNUHPWVOMC6LW/action/replication_record"}},"created_at":"2026-07-05T11:16:50.031271+00:00","updated_at":"2026-07-05T11:16:50.031271+00:00"}