{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:LMQY3EFKHVGPJ3WHN67GC3JBYL","short_pith_number":"pith:LMQY3EFK","schema_version":"1.0","canonical_sha256":"5b218d90aa3d4cf4eec76fbe616d21c2cc1da1472a57fd1c4c71eead804286ae","source":{"kind":"arxiv","id":"2405.03379","version":1},"attestation_state":"computed","paper":{"title":"Reverse Forward Curriculum Learning for Extreme Sample and Demonstration Efficiency in Reinforcement Learning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.RO"],"primary_cat":"cs.LG","authors_text":"Arth Shukla, Hao Su, Stone Tao, Tse-kai Chan","submitted_at":"2024-05-06T11:33:12Z","abstract_excerpt":"Reinforcement learning (RL) presents a promising framework to learn policies through environment interaction, but often requires an infeasible amount of interaction data to solve complex tasks from sparse rewards. One direction includes augmenting RL with offline data demonstrating desired tasks, but past work often require a lot of high-quality demonstration data that is difficult to obtain, especially for domains such as robotics. Our approach consists of a reverse curriculum followed by a forward curriculum. Unique to our approach compared to past work is the ability to efficiently leverage"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2405.03379","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2024-05-06T11:33:12Z","cross_cats_sorted":["cs.AI","cs.RO"],"title_canon_sha256":"0bfce0a8adf81fca1aea8d08ce795fb6324e2a2113d7ed364c54db0b6a225785","abstract_canon_sha256":"8638615d0e046934daaea0ba46583f4b3daf2d4873d2f567bb28bff91276aa44"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:16:02.250590Z","signature_b64":"QkA0dEoVq/XN7mJSK0zmxKfWtwG7OjeiLWWgppcdUQ0hq+cLzeLYtZXJNu0+aQakcuNVTXvJ3laMvlb/NxezBg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"5b218d90aa3d4cf4eec76fbe616d21c2cc1da1472a57fd1c4c71eead804286ae","last_reissued_at":"2026-07-05T08:16:02.250102Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:16:02.250102Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Reverse Forward Curriculum Learning for Extreme Sample and Demonstration Efficiency in Reinforcement Learning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.RO"],"primary_cat":"cs.LG","authors_text":"Arth Shukla, Hao Su, Stone Tao, Tse-kai Chan","submitted_at":"2024-05-06T11:33:12Z","abstract_excerpt":"Reinforcement learning (RL) presents a promising framework to learn policies through environment interaction, but often requires an infeasible amount of interaction data to solve complex tasks from sparse rewards. One direction includes augmenting RL with offline data demonstrating desired tasks, but past work often require a lot of high-quality demonstration data that is difficult to obtain, especially for domains such as robotics. Our approach consists of a reverse curriculum followed by a forward curriculum. Unique to our approach compared to past work is the ability to efficiently leverage"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2405.03379","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2405.03379/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2405.03379","created_at":"2026-07-05T08:16:02.250161+00:00"},{"alias_kind":"arxiv_version","alias_value":"2405.03379v1","created_at":"2026-07-05T08:16:02.250161+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2405.03379","created_at":"2026-07-05T08:16:02.250161+00:00"},{"alias_kind":"pith_short_12","alias_value":"LMQY3EFKHVGP","created_at":"2026-07-05T08:16:02.250161+00:00"},{"alias_kind":"pith_short_16","alias_value":"LMQY3EFKHVGPJ3WH","created_at":"2026-07-05T08:16:02.250161+00:00"},{"alias_kind":"pith_short_8","alias_value":"LMQY3EFK","created_at":"2026-07-05T08:16:02.250161+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.03385","citing_title":"Grasp-Then-Plan with Failure Attribution: A Closed Two-Stage Framework for Precise and Generalizable Robotic Manipulation","ref_index":63,"is_internal_anchor":false},{"citing_arxiv_id":"2601.05249","citing_title":"RL-AWB: Deep Reinforcement Learning for Auto White Balance Correction in Low-Light Night-time Scenes","ref_index":94,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/LMQY3EFKHVGPJ3WHN67GC3JBYL","json":"https://pith.science/pith/LMQY3EFKHVGPJ3WHN67GC3JBYL.json","graph_json":"https://pith.science/api/pith-number/LMQY3EFKHVGPJ3WHN67GC3JBYL/graph.json","events_json":"https://pith.science/api/pith-number/LMQY3EFKHVGPJ3WHN67GC3JBYL/events.json","paper":"https://pith.science/paper/LMQY3EFK"},"agent_actions":{"view_html":"https://pith.science/pith/LMQY3EFKHVGPJ3WHN67GC3JBYL","download_json":"https://pith.science/pith/LMQY3EFKHVGPJ3WHN67GC3JBYL.json","view_paper":"https://pith.science/paper/LMQY3EFK","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2405.03379&json=true","fetch_graph":"https://pith.science/api/pith-number/LMQY3EFKHVGPJ3WHN67GC3JBYL/graph.json","fetch_events":"https://pith.science/api/pith-number/LMQY3EFKHVGPJ3WHN67GC3JBYL/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/LMQY3EFKHVGPJ3WHN67GC3JBYL/action/timestamp_anchor","attest_storage":"https://pith.science/pith/LMQY3EFKHVGPJ3WHN67GC3JBYL/action/storage_attestation","attest_author":"https://pith.science/pith/LMQY3EFKHVGPJ3WHN67GC3JBYL/action/author_attestation","sign_citation":"https://pith.science/pith/LMQY3EFKHVGPJ3WHN67GC3JBYL/action/citation_signature","submit_replication":"https://pith.science/pith/LMQY3EFKHVGPJ3WHN67GC3JBYL/action/replication_record"}},"created_at":"2026-07-05T08:16:02.250161+00:00","updated_at":"2026-07-05T08:16:02.250161+00:00"}