{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:C2SPMT7K2K6OCBXP7CBTFV5UDY","short_pith_number":"pith:C2SPMT7K","schema_version":"1.0","canonical_sha256":"16a4f64fead2bce106eff88332d7b41e03893dd24889c36ab25c3299b4a7624d","source":{"kind":"arxiv","id":"2505.03809","version":1},"attestation_state":"computed","paper":{"title":"When Dynamic Data Selection Meets Data Augmentation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CV"],"primary_cat":"cs.LG","authors_text":"Dongzhan Zhou, Furao Shen, Peng Ye, Suorong Yang","submitted_at":"2025-05-02T11:38:48Z","abstract_excerpt":"Dynamic data selection aims to accelerate training with lossless performance. However, reducing training data inherently limits data diversity, potentially hindering generalization. While data augmentation is widely used to enhance diversity, it is typically not optimized in conjunction with selection. As a result, directly combining these techniques fails to fully exploit their synergies. To tackle the challenge, we propose a novel online data training framework that, for the first time, unifies dynamic data selection and augmentation, achieving both training efficiency and enhanced performan"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.03809","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-05-02T11:38:48Z","cross_cats_sorted":["cs.AI","cs.CV"],"title_canon_sha256":"5902f3038fc095adadde2de0f8ab969eda867845f586b48039ca28726f415608","abstract_canon_sha256":"e1c12639f12da0773e2608118ff28618bef9e3a5f7045b786cffd69ccf340813"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:01:36.204845Z","signature_b64":"QziW0sASfzP5hfzkgFj9/kgS0fhxRdc/DalURR09LsM6ScgMzFWBnWvPNE2MngP/PfmaKGUmsA4ftjA0vv32AQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"16a4f64fead2bce106eff88332d7b41e03893dd24889c36ab25c3299b4a7624d","last_reissued_at":"2026-07-05T11:01:36.204358Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:01:36.204358Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"When Dynamic Data Selection Meets Data Augmentation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CV"],"primary_cat":"cs.LG","authors_text":"Dongzhan Zhou, Furao Shen, Peng Ye, Suorong Yang","submitted_at":"2025-05-02T11:38:48Z","abstract_excerpt":"Dynamic data selection aims to accelerate training with lossless performance. However, reducing training data inherently limits data diversity, potentially hindering generalization. While data augmentation is widely used to enhance diversity, it is typically not optimized in conjunction with selection. As a result, directly combining these techniques fails to fully exploit their synergies. To tackle the challenge, we propose a novel online data training framework that, for the first time, unifies dynamic data selection and augmentation, achieving both training efficiency and enhanced performan"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.03809","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.03809/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.03809","created_at":"2026-07-05T11:01:36.204424+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.03809v1","created_at":"2026-07-05T11:01:36.204424+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.03809","created_at":"2026-07-05T11:01:36.204424+00:00"},{"alias_kind":"pith_short_12","alias_value":"C2SPMT7K2K6O","created_at":"2026-07-05T11:01:36.204424+00:00"},{"alias_kind":"pith_short_16","alias_value":"C2SPMT7K2K6OCBXP","created_at":"2026-07-05T11:01:36.204424+00:00"},{"alias_kind":"pith_short_8","alias_value":"C2SPMT7K","created_at":"2026-07-05T11:01:36.204424+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.14773","citing_title":"Beyond What to Select: A Plug-and-play Oscillatory Data-Volume Scheduling for Efficient Model Training","ref_index":56,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/C2SPMT7K2K6OCBXP7CBTFV5UDY","json":"https://pith.science/pith/C2SPMT7K2K6OCBXP7CBTFV5UDY.json","graph_json":"https://pith.science/api/pith-number/C2SPMT7K2K6OCBXP7CBTFV5UDY/graph.json","events_json":"https://pith.science/api/pith-number/C2SPMT7K2K6OCBXP7CBTFV5UDY/events.json","paper":"https://pith.science/paper/C2SPMT7K"},"agent_actions":{"view_html":"https://pith.science/pith/C2SPMT7K2K6OCBXP7CBTFV5UDY","download_json":"https://pith.science/pith/C2SPMT7K2K6OCBXP7CBTFV5UDY.json","view_paper":"https://pith.science/paper/C2SPMT7K","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.03809&json=true","fetch_graph":"https://pith.science/api/pith-number/C2SPMT7K2K6OCBXP7CBTFV5UDY/graph.json","fetch_events":"https://pith.science/api/pith-number/C2SPMT7K2K6OCBXP7CBTFV5UDY/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/C2SPMT7K2K6OCBXP7CBTFV5UDY/action/timestamp_anchor","attest_storage":"https://pith.science/pith/C2SPMT7K2K6OCBXP7CBTFV5UDY/action/storage_attestation","attest_author":"https://pith.science/pith/C2SPMT7K2K6OCBXP7CBTFV5UDY/action/author_attestation","sign_citation":"https://pith.science/pith/C2SPMT7K2K6OCBXP7CBTFV5UDY/action/citation_signature","submit_replication":"https://pith.science/pith/C2SPMT7K2K6OCBXP7CBTFV5UDY/action/replication_record"}},"created_at":"2026-07-05T11:01:36.204424+00:00","updated_at":"2026-07-05T11:01:36.204424+00:00"}