{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:APR7QEVTTGM7SZUG2PA6CXMUJS","short_pith_number":"pith:APR7QEVT","schema_version":"1.0","canonical_sha256":"03e3f812b39999f96686d3c1e15d944cae3615fc2970e3f5532ebd3fcd898b12","source":{"kind":"arxiv","id":"2502.06733","version":1},"attestation_state":"computed","paper":{"title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Daouda Sow, Hans-Arno Jacobsen, Herbert Woisetschl\\\"ager, Saikiran Bulusu, Shiqiang Wang, Yingbin Liang","submitted_at":"2025-02-10T17:57:15Z","abstract_excerpt":"Pretraining large language models (LLMs) on vast and heterogeneous datasets is crucial for achieving state-of-the-art performance across diverse downstream tasks. However, current training paradigms treat all samples equally, overlooking the importance or relevance of individual samples throughout the training process. Existing reweighting strategies, which primarily focus on group-level data importance, fail to leverage fine-grained instance-level information and do not adapt dynamically to individual sample importance as training progresses. In this paper, we introduce novel algorithms for d"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.06733","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","primary_cat":"cs.LG","submitted_at":"2025-02-10T17:57:15Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"3eef87dccaea1854c84df7d298164ebb702ac01d40f7890e89833b68b1085175","abstract_canon_sha256":"96b08f7932222c6a30bcba9c8d1d6d82db4c0a8f51a3d486ead1f12be9708932"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:12:11.460996Z","signature_b64":"RF7KWOEHSBTb5lc3gg/Je+lrxe5CwnjllLB6rD5oOWxiVqMsOlODTobYDDHe01gbErnC304x0/FkYZ8uyY8DCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"03e3f812b39999f96686d3c1e15d944cae3615fc2970e3f5532ebd3fcd898b12","last_reissued_at":"2026-07-05T10:12:11.460519Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:12:11.460519Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Daouda Sow, Hans-Arno Jacobsen, Herbert Woisetschl\\\"ager, Saikiran Bulusu, Shiqiang Wang, Yingbin Liang","submitted_at":"2025-02-10T17:57:15Z","abstract_excerpt":"Pretraining large language models (LLMs) on vast and heterogeneous datasets is crucial for achieving state-of-the-art performance across diverse downstream tasks. However, current training paradigms treat all samples equally, overlooking the importance or relevance of individual samples throughout the training process. Existing reweighting strategies, which primarily focus on group-level data importance, fail to leverage fine-grained instance-level information and do not adapt dynamically to individual sample importance as training progresses. In this paper, we introduce novel algorithms for d"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.06733","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.06733/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.06733","created_at":"2026-07-05T10:12:11.460572+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.06733v1","created_at":"2026-07-05T10:12:11.460572+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.06733","created_at":"2026-07-05T10:12:11.460572+00:00"},{"alias_kind":"pith_short_12","alias_value":"APR7QEVTTGM7","created_at":"2026-07-05T10:12:11.460572+00:00"},{"alias_kind":"pith_short_16","alias_value":"APR7QEVTTGM7SZUG","created_at":"2026-07-05T10:12:11.460572+00:00"},{"alias_kind":"pith_short_8","alias_value":"APR7QEVT","created_at":"2026-07-05T10:12:11.460572+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2505.19893","citing_title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","ref_index":50,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/APR7QEVTTGM7SZUG2PA6CXMUJS","json":"https://pith.science/pith/APR7QEVTTGM7SZUG2PA6CXMUJS.json","graph_json":"https://pith.science/api/pith-number/APR7QEVTTGM7SZUG2PA6CXMUJS/graph.json","events_json":"https://pith.science/api/pith-number/APR7QEVTTGM7SZUG2PA6CXMUJS/events.json","paper":"https://pith.science/paper/APR7QEVT"},"agent_actions":{"view_html":"https://pith.science/pith/APR7QEVTTGM7SZUG2PA6CXMUJS","download_json":"https://pith.science/pith/APR7QEVTTGM7SZUG2PA6CXMUJS.json","view_paper":"https://pith.science/paper/APR7QEVT","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.06733&json=true","fetch_graph":"https://pith.science/api/pith-number/APR7QEVTTGM7SZUG2PA6CXMUJS/graph.json","fetch_events":"https://pith.science/api/pith-number/APR7QEVTTGM7SZUG2PA6CXMUJS/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/APR7QEVTTGM7SZUG2PA6CXMUJS/action/timestamp_anchor","attest_storage":"https://pith.science/pith/APR7QEVTTGM7SZUG2PA6CXMUJS/action/storage_attestation","attest_author":"https://pith.science/pith/APR7QEVTTGM7SZUG2PA6CXMUJS/action/author_attestation","sign_citation":"https://pith.science/pith/APR7QEVTTGM7SZUG2PA6CXMUJS/action/citation_signature","submit_replication":"https://pith.science/pith/APR7QEVTTGM7SZUG2PA6CXMUJS/action/replication_record"}},"created_at":"2026-07-05T10:12:11.460572+00:00","updated_at":"2026-07-05T10:12:11.460572+00:00"}