{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:BU3M5DWWT3UJWSVLWHS6RDOANA","short_pith_number":"pith:BU3M5DWW","schema_version":"1.0","canonical_sha256":"0d36ce8ed69ee89b4aabb1e5e88dc06816c4b1b0764006ee2037cdb53e60218f","source":{"kind":"arxiv","id":"2409.15700","version":1},"attestation_state":"computed","paper":{"title":"Making Text Embedders Few-Shot Learners","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.IR","authors_text":"Chaofan Li, Defu Lian, Jianlyu Chen, Kun Luo, Minghao Qin, Shitao Xiao, Yingxia Shao, Zheng Liu","submitted_at":"2024-09-24T03:30:19Z","abstract_excerpt":"Large language models (LLMs) with decoder-only architectures demonstrate remarkable in-context learning (ICL) capabilities. This feature enables them to effectively handle both familiar and novel tasks by utilizing examples provided within their input context. Recognizing the potential of this capability, we propose leveraging the ICL feature in LLMs to enhance the process of text embedding generation. To this end, we introduce a novel model bge-en-icl, which employs few-shot examples to produce high-quality text embeddings. Our approach integrates task-related examples directly into the query"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2409.15700","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.IR","submitted_at":"2024-09-24T03:30:19Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"c7e3cdbc7fe9e321d603a1836752c0df307cedefd896147e2bdcb39573b12cc9","abstract_canon_sha256":"ed3442572935e774a1059f6efe06b330f9a750b7c34e91a433014884296ac074"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:10:58.755192Z","signature_b64":"IVrorQlYchsenfz07SgJa3s0nczNa/bXgY4BM+dWa6g/3eUHDhNEP+NB+i89fpxbaZv15CoTgOUDVbF5xYyDAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"0d36ce8ed69ee89b4aabb1e5e88dc06816c4b1b0764006ee2037cdb53e60218f","last_reissued_at":"2026-07-05T09:10:58.754712Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:10:58.754712Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Making Text Embedders Few-Shot Learners","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.IR","authors_text":"Chaofan Li, Defu Lian, Jianlyu Chen, Kun Luo, Minghao Qin, Shitao Xiao, Yingxia Shao, Zheng Liu","submitted_at":"2024-09-24T03:30:19Z","abstract_excerpt":"Large language models (LLMs) with decoder-only architectures demonstrate remarkable in-context learning (ICL) capabilities. This feature enables them to effectively handle both familiar and novel tasks by utilizing examples provided within their input context. Recognizing the potential of this capability, we propose leveraging the ICL feature in LLMs to enhance the process of text embedding generation. To this end, we introduce a novel model bge-en-icl, which employs few-shot examples to produce high-quality text embeddings. Our approach integrates task-related examples directly into the query"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2409.15700","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2409.15700/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2409.15700","created_at":"2026-07-05T09:10:58.754770+00:00"},{"alias_kind":"arxiv_version","alias_value":"2409.15700v1","created_at":"2026-07-05T09:10:58.754770+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2409.15700","created_at":"2026-07-05T09:10:58.754770+00:00"},{"alias_kind":"pith_short_12","alias_value":"BU3M5DWWT3UJ","created_at":"2026-07-05T09:10:58.754770+00:00"},{"alias_kind":"pith_short_16","alias_value":"BU3M5DWWT3UJWSVL","created_at":"2026-07-05T09:10:58.754770+00:00"},{"alias_kind":"pith_short_8","alias_value":"BU3M5DWW","created_at":"2026-07-05T09:10:58.754770+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.25674","citing_title":"BitNet Text Embeddings","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11374","citing_title":"Test-Time Compute for Frozen Embedding Models through Agentic Program Search","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20729","citing_title":"MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2510.08252","citing_title":"ReasonEmbed: Enhanced Text Embeddings for Reasoning-Intensive Document Retrieval","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2405.17428","citing_title":"NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models","ref_index":89,"is_internal_anchor":false},{"citing_arxiv_id":"2604.11092","citing_title":"ARHN: Answer-Centric Relabeling of Hard Negatives with Open-Source LLMs for Dense Retrieval","ref_index":17,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/BU3M5DWWT3UJWSVLWHS6RDOANA","json":"https://pith.science/pith/BU3M5DWWT3UJWSVLWHS6RDOANA.json","graph_json":"https://pith.science/api/pith-number/BU3M5DWWT3UJWSVLWHS6RDOANA/graph.json","events_json":"https://pith.science/api/pith-number/BU3M5DWWT3UJWSVLWHS6RDOANA/events.json","paper":"https://pith.science/paper/BU3M5DWW"},"agent_actions":{"view_html":"https://pith.science/pith/BU3M5DWWT3UJWSVLWHS6RDOANA","download_json":"https://pith.science/pith/BU3M5DWWT3UJWSVLWHS6RDOANA.json","view_paper":"https://pith.science/paper/BU3M5DWW","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2409.15700&json=true","fetch_graph":"https://pith.science/api/pith-number/BU3M5DWWT3UJWSVLWHS6RDOANA/graph.json","fetch_events":"https://pith.science/api/pith-number/BU3M5DWWT3UJWSVLWHS6RDOANA/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/BU3M5DWWT3UJWSVLWHS6RDOANA/action/timestamp_anchor","attest_storage":"https://pith.science/pith/BU3M5DWWT3UJWSVLWHS6RDOANA/action/storage_attestation","attest_author":"https://pith.science/pith/BU3M5DWWT3UJWSVLWHS6RDOANA/action/author_attestation","sign_citation":"https://pith.science/pith/BU3M5DWWT3UJWSVLWHS6RDOANA/action/citation_signature","submit_replication":"https://pith.science/pith/BU3M5DWWT3UJWSVLWHS6RDOANA/action/replication_record"}},"created_at":"2026-07-05T09:10:58.754770+00:00","updated_at":"2026-07-05T09:10:58.754770+00:00"}