{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2025:VI3XIQEZB3B62CYFMZNRDDVQN7","short_pith_number":"pith:VI3XIQEZ","canonical_record":{"source":{"id":"2501.18845","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CL","submitted_at":"2025-01-31T01:50:49Z","cross_cats_sorted":[],"title_canon_sha256":"4aa0f3b2ce36235ce64712a11657c4dde2859b54e8a4b8ec08af7f1c15167fd6","abstract_canon_sha256":"b5d4200cd7d1502c5580346c5aa4ea71d1622e9aa1fda11ba33b2a8814f5c929"},"schema_version":"1.0"},"canonical_sha256":"aa377440990ec3ed0b05665b118eb06fc36cdec4ace42302829aae8e74dcea59","source":{"kind":"arxiv","id":"2501.18845","version":1},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2501.18845","created_at":"2026-07-05T10:07:52Z"},{"alias_kind":"arxiv_version","alias_value":"2501.18845v1","created_at":"2026-07-05T10:07:52Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2501.18845","created_at":"2026-07-05T10:07:52Z"},{"alias_kind":"pith_short_12","alias_value":"VI3XIQEZB3B6","created_at":"2026-07-05T10:07:52Z"},{"alias_kind":"pith_short_16","alias_value":"VI3XIQEZB3B62CYF","created_at":"2026-07-05T10:07:52Z"},{"alias_kind":"pith_short_8","alias_value":"VI3XIQEZ","created_at":"2026-07-05T10:07:52Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2025:VI3XIQEZB3B62CYFMZNRDDVQN7","target":"record","payload":{"canonical_record":{"source":{"id":"2501.18845","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CL","submitted_at":"2025-01-31T01:50:49Z","cross_cats_sorted":[],"title_canon_sha256":"4aa0f3b2ce36235ce64712a11657c4dde2859b54e8a4b8ec08af7f1c15167fd6","abstract_canon_sha256":"b5d4200cd7d1502c5580346c5aa4ea71d1622e9aa1fda11ba33b2a8814f5c929"},"schema_version":"1.0"},"canonical_sha256":"aa377440990ec3ed0b05665b118eb06fc36cdec4ace42302829aae8e74dcea59","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:07:52.697247Z","signature_b64":"ach2oWGUZfzppnee0Y+QkupK+HlHPxNiesQpVUjO89MHFJzQ4vsrxidARjld5x5KjCBxjO5E5VkKG5/XgEcsDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"aa377440990ec3ed0b05665b118eb06fc36cdec4ace42302829aae8e74dcea59","last_reissued_at":"2026-07-05T10:07:52.696732Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:07:52.696732Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2501.18845","source_version":1,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T10:07:52Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"3tBjicpoWj4OXVk2MHrPZMgBFJ7G7pvjLyP7UVjXPzAGAc1mZWrnka4sVr63FOqgPDmbBAzKXX1+TxysWe5GDA==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-10T16:01:03.769497Z"},"content_sha256":"a93d5607666d8f6ee04eee9035392662c1f083640cee11050afbaee51ca32ef0","schema_version":"1.0","event_id":"sha256:a93d5607666d8f6ee04eee9035392662c1f083640cee11050afbaee51ca32ef0"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2025:VI3XIQEZB3B62CYFMZNRDDVQN7","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"Text Data Augmentation for Large Language Models: A Comprehensive Survey of Methods, Challenges, and Opportunities","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Haoran Xie, Joe S. Qin, Yaping Chai","submitted_at":"2025-01-31T01:50:49Z","abstract_excerpt":"The increasing size and complexity of pre-trained language models have demonstrated superior performance in many applications, but they usually require large training datasets to be adequately trained. Insufficient training sets could unexpectedly make the model overfit and fail to cope with complex tasks. Large language models (LLMs) trained on extensive corpora have prominent text generation capabilities, which improve the quality and quantity of data and play a crucial role in data augmentation. Specifically, distinctive prompt templates are given in personalised tasks to guide LLMs in gene"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2501.18845","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2501.18845/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T10:07:52Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"45wPx2t1Ykoy3wrxYCgm3o9HmznkKNz7eWOyC/dGXKOfdR0ovFw3r5qN9LopMaDWOyoXCbK+Cp10sJMnfEf0DQ==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-10T16:01:03.770512Z"},"content_sha256":"3bbf6f5aecf4ea2fb4b5e2f5df3642c8912ba75db3282337c329e4ecb4780c2e","schema_version":"1.0","event_id":"sha256:3bbf6f5aecf4ea2fb4b5e2f5df3642c8912ba75db3282337c329e4ecb4780c2e"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/VI3XIQEZB3B62CYFMZNRDDVQN7/bundle.json","state_url":"https://pith.science/pith/VI3XIQEZB3B62CYFMZNRDDVQN7/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/VI3XIQEZB3B62CYFMZNRDDVQN7/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-10T16:01:03Z","links":{"resolver":"https://pith.science/pith/VI3XIQEZB3B62CYFMZNRDDVQN7","bundle":"https://pith.science/pith/VI3XIQEZB3B62CYFMZNRDDVQN7/bundle.json","state":"https://pith.science/pith/VI3XIQEZB3B62CYFMZNRDDVQN7/state.json","well_known_bundle":"https://pith.science/.well-known/pith/VI3XIQEZB3B62CYFMZNRDDVQN7/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2025:VI3XIQEZB3B62CYFMZNRDDVQN7","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"b5d4200cd7d1502c5580346c5aa4ea71d1622e9aa1fda11ba33b2a8814f5c929","cross_cats_sorted":[],"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CL","submitted_at":"2025-01-31T01:50:49Z","title_canon_sha256":"4aa0f3b2ce36235ce64712a11657c4dde2859b54e8a4b8ec08af7f1c15167fd6"},"schema_version":"1.0","source":{"id":"2501.18845","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2501.18845","created_at":"2026-07-05T10:07:52Z"},{"alias_kind":"arxiv_version","alias_value":"2501.18845v1","created_at":"2026-07-05T10:07:52Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2501.18845","created_at":"2026-07-05T10:07:52Z"},{"alias_kind":"pith_short_12","alias_value":"VI3XIQEZB3B6","created_at":"2026-07-05T10:07:52Z"},{"alias_kind":"pith_short_16","alias_value":"VI3XIQEZB3B62CYF","created_at":"2026-07-05T10:07:52Z"},{"alias_kind":"pith_short_8","alias_value":"VI3XIQEZ","created_at":"2026-07-05T10:07:52Z"}],"graph_snapshots":[{"event_id":"sha256:3bbf6f5aecf4ea2fb4b5e2f5df3642c8912ba75db3282337c329e4ecb4780c2e","target":"graph","created_at":"2026-07-05T10:07:52Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2501.18845/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"The increasing size and complexity of pre-trained language models have demonstrated superior performance in many applications, but they usually require large training datasets to be adequately trained. Insufficient training sets could unexpectedly make the model overfit and fail to cope with complex tasks. Large language models (LLMs) trained on extensive corpora have prominent text generation capabilities, which improve the quality and quantity of data and play a crucial role in data augmentation. Specifically, distinctive prompt templates are given in personalised tasks to guide LLMs in gene","authors_text":"Haoran Xie, Joe S. Qin, Yaping Chai","cross_cats":[],"headline":"","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CL","submitted_at":"2025-01-31T01:50:49Z","title":"Text Data Augmentation for Large Language Models: A Comprehensive Survey of Methods, Challenges, and Opportunities"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2501.18845","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:a93d5607666d8f6ee04eee9035392662c1f083640cee11050afbaee51ca32ef0","target":"record","created_at":"2026-07-05T10:07:52Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"b5d4200cd7d1502c5580346c5aa4ea71d1622e9aa1fda11ba33b2a8814f5c929","cross_cats_sorted":[],"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CL","submitted_at":"2025-01-31T01:50:49Z","title_canon_sha256":"4aa0f3b2ce36235ce64712a11657c4dde2859b54e8a4b8ec08af7f1c15167fd6"},"schema_version":"1.0","source":{"id":"2501.18845","kind":"arxiv","version":1}},"canonical_sha256":"aa377440990ec3ed0b05665b118eb06fc36cdec4ace42302829aae8e74dcea59","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"aa377440990ec3ed0b05665b118eb06fc36cdec4ace42302829aae8e74dcea59","first_computed_at":"2026-07-05T10:07:52.696732Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T10:07:52.696732Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"ach2oWGUZfzppnee0Y+QkupK+HlHPxNiesQpVUjO89MHFJzQ4vsrxidARjld5x5KjCBxjO5E5VkKG5/XgEcsDA==","signature_status":"signed_v1","signed_at":"2026-07-05T10:07:52.697247Z","signed_message":"canonical_sha256_bytes"},"source_id":"2501.18845","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:a93d5607666d8f6ee04eee9035392662c1f083640cee11050afbaee51ca32ef0","sha256:3bbf6f5aecf4ea2fb4b5e2f5df3642c8912ba75db3282337c329e4ecb4780c2e"],"state_sha256":"c1e63064231a708326b601a63ff332f4f38471fc864df8a20f3bc44eb067a513"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"6ukm/VXpM2HuiknWHNVkzrddCqA86KeCpqVxbV361lbkR+Wbh3K0PULnqOYcodybUi6p287A/nHaIBas2KstDA==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-10T16:01:03.776410Z","bundle_sha256":"4c7a4f84354e37085d38816a460d78dc9990930a51ef4f4480257d348809ad89"}}