{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:TUFCQWVVRUX6BOIP3IBER3QYGW","short_pith_number":"pith:TUFCQWVV","schema_version":"1.0","canonical_sha256":"9d0a285ab58d2fe0b90fda0248ee1835ac87005d685f73cb559774235b31ca34","source":{"kind":"arxiv","id":"2406.14532","version":1},"attestation_state":"computed","paper":{"title":"RL on Incorrect Synthetic Data Scales the Efficiency of LLM Math Reasoning by Eight-Fold","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.LG","authors_text":"Amrith Setlur, Aviral Kumar, Naman Garg, Saurabh Garg, Virginia Smith, Xinyang Geng","submitted_at":"2024-06-20T17:45:54Z","abstract_excerpt":"Training on model-generated synthetic data is a promising approach for finetuning LLMs, but it remains unclear when it helps or hurts. In this paper, we investigate this question for math reasoning via an empirical study, followed by building a conceptual understanding of our observations. First, we find that while the typical approach of finetuning a model on synthetic correct or positive problem-solution pairs generated by capable models offers modest performance gains, sampling more correct solutions from the finetuned learner itself followed by subsequent fine-tuning on this self-generated"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2406.14532","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2024-06-20T17:45:54Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"b96da6c6debb6f2b80a1381e0839a7ff3863094c9fe043421320e7b24aaec889","abstract_canon_sha256":"f6fee9c6608c6461d408ad66ed815fb3aa542a1304df8ac61e847d07f64292a2"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:34:51.930799Z","signature_b64":"5wuvnOpuC5GcW+USzYKhf8qr5xtTJEY4hTIvuxr/IatO/dwDipHbwnljgOV7JkKXRrAMXtjMceH3u6pkmy+iDw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"9d0a285ab58d2fe0b90fda0248ee1835ac87005d685f73cb559774235b31ca34","last_reissued_at":"2026-07-05T08:34:51.930334Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:34:51.930334Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"RL on Incorrect Synthetic Data Scales the Efficiency of LLM Math Reasoning by Eight-Fold","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.LG","authors_text":"Amrith Setlur, Aviral Kumar, Naman Garg, Saurabh Garg, Virginia Smith, Xinyang Geng","submitted_at":"2024-06-20T17:45:54Z","abstract_excerpt":"Training on model-generated synthetic data is a promising approach for finetuning LLMs, but it remains unclear when it helps or hurts. In this paper, we investigate this question for math reasoning via an empirical study, followed by building a conceptual understanding of our observations. First, we find that while the typical approach of finetuning a model on synthetic correct or positive problem-solution pairs generated by capable models offers modest performance gains, sampling more correct solutions from the finetuned learner itself followed by subsequent fine-tuning on this self-generated"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2406.14532","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2406.14532/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2406.14532","created_at":"2026-07-05T08:34:51.930390+00:00"},{"alias_kind":"arxiv_version","alias_value":"2406.14532v1","created_at":"2026-07-05T08:34:51.930390+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2406.14532","created_at":"2026-07-05T08:34:51.930390+00:00"},{"alias_kind":"pith_short_12","alias_value":"TUFCQWVVRUX6","created_at":"2026-07-05T08:34:51.930390+00:00"},{"alias_kind":"pith_short_16","alias_value":"TUFCQWVVRUX6BOIP","created_at":"2026-07-05T08:34:51.930390+00:00"},{"alias_kind":"pith_short_8","alias_value":"TUFCQWVV","created_at":"2026-07-05T08:34:51.930390+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":8,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.11470","citing_title":"The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes","ref_index":204,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11458","citing_title":"Adaptive Teacher Exposure for Self-Distillation in LLM Reasoning","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2410.08146","citing_title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2408.07199","citing_title":"Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents","ref_index":53,"is_internal_anchor":false},{"citing_arxiv_id":"2601.04809","citing_title":"SCALER:Synthetic Scalable Adaptive Learning Environment for Reasoning","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11458","citing_title":"Adaptive Teacher Exposure for Self-Distillation in LLM Reasoning","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19060","citing_title":"Reinforcement Learning Improves LLM Accuracy and Reasoning in Disease Classification from Radiology Reports","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2408.03314","citing_title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","ref_index":31,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/TUFCQWVVRUX6BOIP3IBER3QYGW","json":"https://pith.science/pith/TUFCQWVVRUX6BOIP3IBER3QYGW.json","graph_json":"https://pith.science/api/pith-number/TUFCQWVVRUX6BOIP3IBER3QYGW/graph.json","events_json":"https://pith.science/api/pith-number/TUFCQWVVRUX6BOIP3IBER3QYGW/events.json","paper":"https://pith.science/paper/TUFCQWVV"},"agent_actions":{"view_html":"https://pith.science/pith/TUFCQWVVRUX6BOIP3IBER3QYGW","download_json":"https://pith.science/pith/TUFCQWVVRUX6BOIP3IBER3QYGW.json","view_paper":"https://pith.science/paper/TUFCQWVV","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2406.14532&json=true","fetch_graph":"https://pith.science/api/pith-number/TUFCQWVVRUX6BOIP3IBER3QYGW/graph.json","fetch_events":"https://pith.science/api/pith-number/TUFCQWVVRUX6BOIP3IBER3QYGW/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/TUFCQWVVRUX6BOIP3IBER3QYGW/action/timestamp_anchor","attest_storage":"https://pith.science/pith/TUFCQWVVRUX6BOIP3IBER3QYGW/action/storage_attestation","attest_author":"https://pith.science/pith/TUFCQWVVRUX6BOIP3IBER3QYGW/action/author_attestation","sign_citation":"https://pith.science/pith/TUFCQWVVRUX6BOIP3IBER3QYGW/action/citation_signature","submit_replication":"https://pith.science/pith/TUFCQWVVRUX6BOIP3IBER3QYGW/action/replication_record"}},"created_at":"2026-07-05T08:34:51.930390+00:00","updated_at":"2026-07-05T08:34:51.930390+00:00"}