{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:LRVJHGFPTOC4YGSR4EOZJCFCNB","short_pith_number":"pith:LRVJHGFP","schema_version":"1.0","canonical_sha256":"5c6a9398af9b85cc1a51e11d9488a2687b8e51111d16e7956166e127a383e2e5","source":{"kind":"arxiv","id":"2412.04506","version":2},"attestation_state":"computed","paper":{"title":"Arctic-Embed 2.0: Multilingual Retrieval Without Compromise","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.IR","cs.LG"],"primary_cat":"cs.CL","authors_text":"Daniel Campos, Gaurav Nuti, Luke Merrick, Puxuan Yu","submitted_at":"2024-12-03T22:59:36Z","abstract_excerpt":"This paper presents the training methodology of Arctic-Embed 2.0, a set of open-source text embedding models built for accurate and efficient multilingual retrieval. While prior works have suffered from degraded English retrieval quality, Arctic-Embed 2.0 delivers competitive retrieval quality on multilingual and English-only benchmarks, and supports Matryoshka Representation Learning (MRL) for efficient embedding storage with significantly lower compressed quality degradation compared to alternatives. We detail the design and implementation, presenting several important open research question"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2412.04506","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-12-03T22:59:36Z","cross_cats_sorted":["cs.IR","cs.LG"],"title_canon_sha256":"e44cedf4fe247fb39249605b90716b0d59dae33158894b352d3ca80a12096a39","abstract_canon_sha256":"a62580131331782baf88c668f7b7970a62645b4d6e0ea7edd43fd418d219831a"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:49:13.385539Z","signature_b64":"/kqtxAbWnwFz1J3uQ8g4wdZ/Q9Pf8kpc7sFj+K1fGtmW4o1IW7jX2H4+ArrGtaEriekWQnz9fuEa+95fqc7KCw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"5c6a9398af9b85cc1a51e11d9488a2687b8e51111d16e7956166e127a383e2e5","last_reissued_at":"2026-07-05T09:49:13.385087Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:49:13.385087Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Arctic-Embed 2.0: Multilingual Retrieval Without Compromise","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.IR","cs.LG"],"primary_cat":"cs.CL","authors_text":"Daniel Campos, Gaurav Nuti, Luke Merrick, Puxuan Yu","submitted_at":"2024-12-03T22:59:36Z","abstract_excerpt":"This paper presents the training methodology of Arctic-Embed 2.0, a set of open-source text embedding models built for accurate and efficient multilingual retrieval. While prior works have suffered from degraded English retrieval quality, Arctic-Embed 2.0 delivers competitive retrieval quality on multilingual and English-only benchmarks, and supports Matryoshka Representation Learning (MRL) for efficient embedding storage with significantly lower compressed quality degradation compared to alternatives. We detail the design and implementation, presenting several important open research question"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2412.04506","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2412.04506/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2412.04506","created_at":"2026-07-05T09:49:13.385142+00:00"},{"alias_kind":"arxiv_version","alias_value":"2412.04506v2","created_at":"2026-07-05T09:49:13.385142+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2412.04506","created_at":"2026-07-05T09:49:13.385142+00:00"},{"alias_kind":"pith_short_12","alias_value":"LRVJHGFPTOC4","created_at":"2026-07-05T09:49:13.385142+00:00"},{"alias_kind":"pith_short_16","alias_value":"LRVJHGFPTOC4YGSR","created_at":"2026-07-05T09:49:13.385142+00:00"},{"alias_kind":"pith_short_8","alias_value":"LRVJHGFP","created_at":"2026-07-05T09:49:13.385142+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":14,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.13647","citing_title":"SkMTEB: Slovak Massive Text Embedding Benchmark and Model Adaptation","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07923","citing_title":"Larch: Learned Query Optimization for Semantic Predicates","ref_index":73,"is_internal_anchor":false},{"citing_arxiv_id":"2605.25030","citing_title":"MimirRAG: A Multi-Agent RAG Framework for Financial Data Retrieval with Metadata Integration","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2605.27168","citing_title":"Grounding Text Embeddings in Stakeholder Associations","ref_index":70,"is_internal_anchor":false},{"citing_arxiv_id":"2605.29960","citing_title":"Hijacking Agent Memory: Stealthy Trojan Attacks Through Conversational Interaction","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22202","citing_title":"Structure Retention in Embedding Spaces as a Predictor of Benchmark Performance","ref_index":138,"is_internal_anchor":false},{"citing_arxiv_id":"2507.03122","citing_title":"Federated Learning for ICD Classification with Lightweight Models and Pretrained Embeddings","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2509.12539","citing_title":"LEAF: Knowledge Distillation of Text Embedding Models with Teacher-Aligned Representations","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2510.14274","citing_title":"Retrofitting Small Multilingual Models for Retrieval: Matching 7B Performance with 300M Parameters","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2602.15547","citing_title":"jina-embeddings-v5-text: Task-Targeted Embedding Distillation","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12714","citing_title":"Layer-wise Representation Dynamics: An Empirical Investigation Across Embedders and Base LLMs","ref_index":76,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07249","citing_title":"MLAIRE: Multilingual Language-Aware Information Retrieval Evaluation Protocal","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14907","citing_title":"Comparison of Modern Multilingual Text Embedding Techniques for Hate Speech Detection Task","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05251","citing_title":"Identifier-Free Code Embedding Models for Scalable Search","ref_index":20,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/LRVJHGFPTOC4YGSR4EOZJCFCNB","json":"https://pith.science/pith/LRVJHGFPTOC4YGSR4EOZJCFCNB.json","graph_json":"https://pith.science/api/pith-number/LRVJHGFPTOC4YGSR4EOZJCFCNB/graph.json","events_json":"https://pith.science/api/pith-number/LRVJHGFPTOC4YGSR4EOZJCFCNB/events.json","paper":"https://pith.science/paper/LRVJHGFP"},"agent_actions":{"view_html":"https://pith.science/pith/LRVJHGFPTOC4YGSR4EOZJCFCNB","download_json":"https://pith.science/pith/LRVJHGFPTOC4YGSR4EOZJCFCNB.json","view_paper":"https://pith.science/paper/LRVJHGFP","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2412.04506&json=true","fetch_graph":"https://pith.science/api/pith-number/LRVJHGFPTOC4YGSR4EOZJCFCNB/graph.json","fetch_events":"https://pith.science/api/pith-number/LRVJHGFPTOC4YGSR4EOZJCFCNB/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/LRVJHGFPTOC4YGSR4EOZJCFCNB/action/timestamp_anchor","attest_storage":"https://pith.science/pith/LRVJHGFPTOC4YGSR4EOZJCFCNB/action/storage_attestation","attest_author":"https://pith.science/pith/LRVJHGFPTOC4YGSR4EOZJCFCNB/action/author_attestation","sign_citation":"https://pith.science/pith/LRVJHGFPTOC4YGSR4EOZJCFCNB/action/citation_signature","submit_replication":"https://pith.science/pith/LRVJHGFPTOC4YGSR4EOZJCFCNB/action/replication_record"}},"created_at":"2026-07-05T09:49:13.385142+00:00","updated_at":"2026-07-05T09:49:13.385142+00:00"}