{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:2RDHHPT6XNX6WTP3LFV7S5TMDQ","short_pith_number":"pith:2RDHHPT6","schema_version":"1.0","canonical_sha256":"d44673be7ebb6feb4dfb596bf9766c1c21f0e27b1d21f89d5eb1f1fd04822b72","source":{"kind":"arxiv","id":"2410.08102","version":3},"attestation_state":"computed","paper":{"title":"Efficient Pretraining Data Selection for Language Models via Multi-Actor Collaboration","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Binhang Yuan, Chi Zhang, Conghui He, Fupeng Sun, Jiahui Peng, Jiantao Qiu, Lijun Wu, Ling Yang, Tianyi Bai, Wentao Zhang, Xinlin Zhuang, Zhen Hao Wong","submitted_at":"2024-10-10T16:45:28Z","abstract_excerpt":"Efficient data selection is crucial to accelerate the pretraining of language model (LMs). While various methods have been proposed to enhance data efficiency, limited research has addressed the inherent conflicts between these approaches to achieve optimal data selection for LM pretraining. To tackle this problem, we propose a multi-actor collaborative data selection mechanism: each data selection method independently prioritizes data based on its criterion and updates its prioritization rules using the current state of the model, functioning as an independent actor for data selection; and a "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.08102","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-10-10T16:45:28Z","cross_cats_sorted":[],"title_canon_sha256":"a208eb66160dbd024118ff901050e0bf4678dcec9d40cf8800856aaf9c453e50","abstract_canon_sha256":"89c725f1e5107681ed03bd82ddd3ae125ad2085a4dd40560588a03f043f9e96f"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:17:36.336537Z","signature_b64":"F9gptVLCUIP4Dfx07f2Bqn38zepM19eTBI8bQyeVt24QsZSA/U73kGIMYnSPPGG0U/MHoUQfm+PxatDPgDY5CA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d44673be7ebb6feb4dfb596bf9766c1c21f0e27b1d21f89d5eb1f1fd04822b72","last_reissued_at":"2026-07-05T11:17:36.336039Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:17:36.336039Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Efficient Pretraining Data Selection for Language Models via Multi-Actor Collaboration","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Binhang Yuan, Chi Zhang, Conghui He, Fupeng Sun, Jiahui Peng, Jiantao Qiu, Lijun Wu, Ling Yang, Tianyi Bai, Wentao Zhang, Xinlin Zhuang, Zhen Hao Wong","submitted_at":"2024-10-10T16:45:28Z","abstract_excerpt":"Efficient data selection is crucial to accelerate the pretraining of language model (LMs). While various methods have been proposed to enhance data efficiency, limited research has addressed the inherent conflicts between these approaches to achieve optimal data selection for LM pretraining. To tackle this problem, we propose a multi-actor collaborative data selection mechanism: each data selection method independently prioritizes data based on its criterion and updates its prioritization rules using the current state of the model, functioning as an independent actor for data selection; and a "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.08102","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.08102/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.08102","created_at":"2026-07-05T11:17:36.336097+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.08102v3","created_at":"2026-07-05T11:17:36.336097+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.08102","created_at":"2026-07-05T11:17:36.336097+00:00"},{"alias_kind":"pith_short_12","alias_value":"2RDHHPT6XNX6","created_at":"2026-07-05T11:17:36.336097+00:00"},{"alias_kind":"pith_short_16","alias_value":"2RDHHPT6XNX6WTP3","created_at":"2026-07-05T11:17:36.336097+00:00"},{"alias_kind":"pith_short_8","alias_value":"2RDHHPT6","created_at":"2026-07-05T11:17:36.336097+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2604.11810","citing_title":"GRACE: A Dynamic Coreset Selection Framework for Large Language Model Optimization","ref_index":8,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/2RDHHPT6XNX6WTP3LFV7S5TMDQ","json":"https://pith.science/pith/2RDHHPT6XNX6WTP3LFV7S5TMDQ.json","graph_json":"https://pith.science/api/pith-number/2RDHHPT6XNX6WTP3LFV7S5TMDQ/graph.json","events_json":"https://pith.science/api/pith-number/2RDHHPT6XNX6WTP3LFV7S5TMDQ/events.json","paper":"https://pith.science/paper/2RDHHPT6"},"agent_actions":{"view_html":"https://pith.science/pith/2RDHHPT6XNX6WTP3LFV7S5TMDQ","download_json":"https://pith.science/pith/2RDHHPT6XNX6WTP3LFV7S5TMDQ.json","view_paper":"https://pith.science/paper/2RDHHPT6","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.08102&json=true","fetch_graph":"https://pith.science/api/pith-number/2RDHHPT6XNX6WTP3LFV7S5TMDQ/graph.json","fetch_events":"https://pith.science/api/pith-number/2RDHHPT6XNX6WTP3LFV7S5TMDQ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/2RDHHPT6XNX6WTP3LFV7S5TMDQ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/2RDHHPT6XNX6WTP3LFV7S5TMDQ/action/storage_attestation","attest_author":"https://pith.science/pith/2RDHHPT6XNX6WTP3LFV7S5TMDQ/action/author_attestation","sign_citation":"https://pith.science/pith/2RDHHPT6XNX6WTP3LFV7S5TMDQ/action/citation_signature","submit_replication":"https://pith.science/pith/2RDHHPT6XNX6WTP3LFV7S5TMDQ/action/replication_record"}},"created_at":"2026-07-05T11:17:36.336097+00:00","updated_at":"2026-07-05T11:17:36.336097+00:00"}