{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:UNWMBEH35AP26RS5FHJXNO6ODU","short_pith_number":"pith:UNWMBEH3","schema_version":"1.0","canonical_sha256":"a36cc090fbe81faf465d29d376bbce1d34fc773b7ee9d5da4ae3b601be916335","source":{"kind":"arxiv","id":"2410.15035","version":1},"attestation_state":"computed","paper":{"title":"Improving General Text Embedding Model: Tackling Task Conflict and Data Imbalance through Model Merging","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Dingkun Long, Mingxin Li, Pengjun Xie, Richong Zhang, Yanzhao Zhang, Zhijie Nie","submitted_at":"2024-10-19T08:39:21Z","abstract_excerpt":"Text embeddings are vital for tasks such as text retrieval and semantic textual similarity (STS). Recently, the advent of pretrained language models, along with unified benchmarks like the Massive Text Embedding Benchmark (MTEB), has facilitated the development of versatile general-purpose text embedding models. Advanced embedding models are typically developed using large-scale multi-task data and joint training across multiple tasks. However, our experimental analysis reveals two significant drawbacks of joint training: 1) Task Conflict: Gradients from different tasks interfere with each oth"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.15035","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-10-19T08:39:21Z","cross_cats_sorted":[],"title_canon_sha256":"0d3aa63a2d589595fe8f03ffc1e041a7428cdee2d1258772011ef27028629de3","abstract_canon_sha256":"694687b5075935313d12856642303fd67cc0f01d1f1901d88914b30c12906b45"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:22:49.208744Z","signature_b64":"A7yPQVdgn6J+xdBhPoU1ZtyqIwl0C8YshwhASpUEu7AcwQILY7MaEHP+sK7p3bwn2PGXz/m+57GTZMOLmFzbBA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"a36cc090fbe81faf465d29d376bbce1d34fc773b7ee9d5da4ae3b601be916335","last_reissued_at":"2026-07-05T09:22:49.208200Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:22:49.208200Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Improving General Text Embedding Model: Tackling Task Conflict and Data Imbalance through Model Merging","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Dingkun Long, Mingxin Li, Pengjun Xie, Richong Zhang, Yanzhao Zhang, Zhijie Nie","submitted_at":"2024-10-19T08:39:21Z","abstract_excerpt":"Text embeddings are vital for tasks such as text retrieval and semantic textual similarity (STS). Recently, the advent of pretrained language models, along with unified benchmarks like the Massive Text Embedding Benchmark (MTEB), has facilitated the development of versatile general-purpose text embedding models. Advanced embedding models are typically developed using large-scale multi-task data and joint training across multiple tasks. However, our experimental analysis reveals two significant drawbacks of joint training: 1) Task Conflict: Gradients from different tasks interfere with each oth"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.15035","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.15035/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.15035","created_at":"2026-07-05T09:22:49.208263+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.15035v1","created_at":"2026-07-05T09:22:49.208263+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.15035","created_at":"2026-07-05T09:22:49.208263+00:00"},{"alias_kind":"pith_short_12","alias_value":"UNWMBEH35AP2","created_at":"2026-07-05T09:22:49.208263+00:00"},{"alias_kind":"pith_short_16","alias_value":"UNWMBEH35AP26RS5","created_at":"2026-07-05T09:22:49.208263+00:00"},{"alias_kind":"pith_short_8","alias_value":"UNWMBEH3","created_at":"2026-07-05T09:22:49.208263+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2601.04720","citing_title":"Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking","ref_index":15,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/UNWMBEH35AP26RS5FHJXNO6ODU","json":"https://pith.science/pith/UNWMBEH35AP26RS5FHJXNO6ODU.json","graph_json":"https://pith.science/api/pith-number/UNWMBEH35AP26RS5FHJXNO6ODU/graph.json","events_json":"https://pith.science/api/pith-number/UNWMBEH35AP26RS5FHJXNO6ODU/events.json","paper":"https://pith.science/paper/UNWMBEH3"},"agent_actions":{"view_html":"https://pith.science/pith/UNWMBEH35AP26RS5FHJXNO6ODU","download_json":"https://pith.science/pith/UNWMBEH35AP26RS5FHJXNO6ODU.json","view_paper":"https://pith.science/paper/UNWMBEH3","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.15035&json=true","fetch_graph":"https://pith.science/api/pith-number/UNWMBEH35AP26RS5FHJXNO6ODU/graph.json","fetch_events":"https://pith.science/api/pith-number/UNWMBEH35AP26RS5FHJXNO6ODU/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/UNWMBEH35AP26RS5FHJXNO6ODU/action/timestamp_anchor","attest_storage":"https://pith.science/pith/UNWMBEH35AP26RS5FHJXNO6ODU/action/storage_attestation","attest_author":"https://pith.science/pith/UNWMBEH35AP26RS5FHJXNO6ODU/action/author_attestation","sign_citation":"https://pith.science/pith/UNWMBEH35AP26RS5FHJXNO6ODU/action/citation_signature","submit_replication":"https://pith.science/pith/UNWMBEH35AP26RS5FHJXNO6ODU/action/replication_record"}},"created_at":"2026-07-05T09:22:49.208263+00:00","updated_at":"2026-07-05T09:22:49.208263+00:00"}