{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:YOMD7RN5Y6K7X6KSLOLQ7PVZ35","short_pith_number":"pith:YOMD7RN5","schema_version":"1.0","canonical_sha256":"c3983fc5bdc795fbf9525b970fbeb9df7b251f2fde23741abc2a144cf30205ae","source":{"kind":"arxiv","id":"2401.00368","version":3},"attestation_state":"computed","paper":{"title":"Improving Text Embeddings with Large Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.IR"],"primary_cat":"cs.CL","authors_text":"Furu Wei, Liang Wang, Linjun Yang, Nan Yang, Rangan Majumder, Xiaolong Huang","submitted_at":"2023-12-31T02:13:18Z","abstract_excerpt":"In this paper, we introduce a novel and simple method for obtaining high-quality text embeddings using only synthetic data and less than 1k training steps. Unlike existing methods that often depend on multi-stage intermediate pre-training with billions of weakly-supervised text pairs, followed by fine-tuning with a few labeled datasets, our method does not require building complex training pipelines or relying on manually collected datasets that are often constrained by task diversity and language coverage. We leverage proprietary LLMs to generate diverse synthetic data for hundreds of thousan"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2401.00368","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2023-12-31T02:13:18Z","cross_cats_sorted":["cs.IR"],"title_canon_sha256":"473e5d8e407bffe817af66bd6c8f10eed39d33abfd5f4f2be70e6639f8324c4f","abstract_canon_sha256":"0caca6f2a6a5a4a1ca775e22ab32b85f403fcdda060cf9b9a4a7541e18775f11"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:25:30.825080Z","signature_b64":"FHQn/EjjCyErAf222T5zJ3tZlMn+fpisthCwASNgu7iaa32Q+i5Y3qgBOdPo7i5JWx8jyfpL+jvJZpUA5z7PCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c3983fc5bdc795fbf9525b970fbeb9df7b251f2fde23741abc2a144cf30205ae","last_reissued_at":"2026-07-05T08:25:30.824616Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:25:30.824616Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Improving Text Embeddings with Large Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.IR"],"primary_cat":"cs.CL","authors_text":"Furu Wei, Liang Wang, Linjun Yang, Nan Yang, Rangan Majumder, Xiaolong Huang","submitted_at":"2023-12-31T02:13:18Z","abstract_excerpt":"In this paper, we introduce a novel and simple method for obtaining high-quality text embeddings using only synthetic data and less than 1k training steps. Unlike existing methods that often depend on multi-stage intermediate pre-training with billions of weakly-supervised text pairs, followed by fine-tuning with a few labeled datasets, our method does not require building complex training pipelines or relying on manually collected datasets that are often constrained by task diversity and language coverage. We leverage proprietary LLMs to generate diverse synthetic data for hundreds of thousan"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2401.00368","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2401.00368/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2401.00368","created_at":"2026-07-05T08:25:30.824681+00:00"},{"alias_kind":"arxiv_version","alias_value":"2401.00368v3","created_at":"2026-07-05T08:25:30.824681+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2401.00368","created_at":"2026-07-05T08:25:30.824681+00:00"},{"alias_kind":"pith_short_12","alias_value":"YOMD7RN5Y6K7","created_at":"2026-07-05T08:25:30.824681+00:00"},{"alias_kind":"pith_short_16","alias_value":"YOMD7RN5Y6K7X6KS","created_at":"2026-07-05T08:25:30.824681+00:00"},{"alias_kind":"pith_short_8","alias_value":"YOMD7RN5","created_at":"2026-07-05T08:25:30.824681+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":30,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.24094","citing_title":"Universal Guideline-Driven Image Clustering via a Hybrid LLM Agent","ref_index":80,"is_internal_anchor":false},{"citing_arxiv_id":"2606.23642","citing_title":"Improving Long-Context Retrieval with Multi-Prefix Embedding","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2606.23791","citing_title":"One Generator, Any Process: LLM-Conditioning for the LHC","ref_index":239,"is_internal_anchor":false},{"citing_arxiv_id":"2606.13680","citing_title":"Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning","ref_index":51,"is_internal_anchor":false},{"citing_arxiv_id":"2606.13061","citing_title":"LaME: Learning to Think in Latent Space for Multimodal Embedding via Information Bottleneck","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01504","citing_title":"Semantic Retrieval for Product Search in E-Commerce","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11374","citing_title":"Test-Time Compute for Frozen Embedding Models through Agentic Program Search","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2606.23791","citing_title":"One Generator, Any Process: LLM-Conditioning for the LHC","ref_index":243,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21071","citing_title":"Fine-grained Claim-level RAG Benchmark for Law","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2410.22240","citing_title":"Are Decoder-Only Large Language Models the Silver Bullet for Code Search?","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21071","citing_title":"Fine-grained Claim-level RAG Benchmark for Law","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22202","citing_title":"Structure Retention in Embedding Spaces as a Predictor of Benchmark Performance","ref_index":130,"is_internal_anchor":false},{"citing_arxiv_id":"2507.08480","citing_title":"Improving Korean-English Cross-Lingual Retrieval: A Data-Centric Study of Language Composition and Model Merging","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2601.14348","citing_title":"Legal Retrieval for Public Defenders","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21071","citing_title":"Fine-grained Claim-level RAG Benchmark for Law","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18007","citing_title":"Semantic Reranking at Inference Time for Hard Examples in Rhetorical Role Labeling","ref_index":98,"is_internal_anchor":false},{"citing_arxiv_id":"2507.04590","citing_title":"VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2510.14274","citing_title":"Retrofitting Small Multilingual Models for Retrieval: Matching 7B Performance with 300M Parameters","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2511.07969","citing_title":"Unified Work Embeddings: Contrastive Learning of a Bidirectional Multi-task Ranker","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2407.12580","citing_title":"E5-V: Universal Embeddings with Multimodal Large Language Models","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2404.18796","citing_title":"Replacing Judges with Juries: Evaluating LLM Generations with a Panel of Diverse Models","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14061","citing_title":"MathAtlas: A Benchmark for Autoformalization in the Wild","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14503","citing_title":"Not All RAGs Are Created Equal: A Component-Wise Empirical Study for Software Engineering Tasks","ref_index":47,"is_internal_anchor":false},{"citing_arxiv_id":"2603.26815","citing_title":"Sustainable Hybrid Document-Routed Retrieval for Financial RAG: Resolving the Robustness-Precision Trade-off","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2405.17428","citing_title":"NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models","ref_index":99,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/YOMD7RN5Y6K7X6KSLOLQ7PVZ35","json":"https://pith.science/pith/YOMD7RN5Y6K7X6KSLOLQ7PVZ35.json","graph_json":"https://pith.science/api/pith-number/YOMD7RN5Y6K7X6KSLOLQ7PVZ35/graph.json","events_json":"https://pith.science/api/pith-number/YOMD7RN5Y6K7X6KSLOLQ7PVZ35/events.json","paper":"https://pith.science/paper/YOMD7RN5"},"agent_actions":{"view_html":"https://pith.science/pith/YOMD7RN5Y6K7X6KSLOLQ7PVZ35","download_json":"https://pith.science/pith/YOMD7RN5Y6K7X6KSLOLQ7PVZ35.json","view_paper":"https://pith.science/paper/YOMD7RN5","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2401.00368&json=true","fetch_graph":"https://pith.science/api/pith-number/YOMD7RN5Y6K7X6KSLOLQ7PVZ35/graph.json","fetch_events":"https://pith.science/api/pith-number/YOMD7RN5Y6K7X6KSLOLQ7PVZ35/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/YOMD7RN5Y6K7X6KSLOLQ7PVZ35/action/timestamp_anchor","attest_storage":"https://pith.science/pith/YOMD7RN5Y6K7X6KSLOLQ7PVZ35/action/storage_attestation","attest_author":"https://pith.science/pith/YOMD7RN5Y6K7X6KSLOLQ7PVZ35/action/author_attestation","sign_citation":"https://pith.science/pith/YOMD7RN5Y6K7X6KSLOLQ7PVZ35/action/citation_signature","submit_replication":"https://pith.science/pith/YOMD7RN5Y6K7X6KSLOLQ7PVZ35/action/replication_record"}},"created_at":"2026-07-05T08:25:30.824681+00:00","updated_at":"2026-07-05T08:25:30.824681+00:00"}