{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2022:V2J5MTJ4FYORUJXR5DA46IJ32Q","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"a4170ce6f13962dec8ad8b72b099f465fb6188b72d3cadbf286ec00b749d1efc","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-04-05T17:25:22Z","title_canon_sha256":"a4d0cbece4e12b32e3024d6261b51b034742f8a36de249cc435db7209952be72"},"schema_version":"1.0","source":{"id":"2204.02372","kind":"arxiv","version":2}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2204.02372","created_at":"2026-07-05T06:28:47Z"},{"alias_kind":"arxiv_version","alias_value":"2204.02372v2","created_at":"2026-07-05T06:28:47Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2204.02372","created_at":"2026-07-05T06:28:47Z"},{"alias_kind":"pith_short_12","alias_value":"V2J5MTJ4FYOR","created_at":"2026-07-05T06:28:47Z"},{"alias_kind":"pith_short_16","alias_value":"V2J5MTJ4FYORUJXR","created_at":"2026-07-05T06:28:47Z"},{"alias_kind":"pith_short_8","alias_value":"V2J5MTJ4","created_at":"2026-07-05T06:28:47Z"}],"graph_snapshots":[{"event_id":"sha256:fe6b48e4b9d0a10ba511d124eebc085767ca5dd93b764cef5781de1b8fd82ec0","target":"graph","created_at":"2026-07-05T06:28:47Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2204.02372/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Reinforcement learning (RL) provides a theoretical framework for continuously improving an agent's behavior via trial and error. However, efficiently learning policies from scratch can be very difficult, particularly for tasks with exploration challenges. In such settings, it might be desirable to initialize RL with an existing policy, offline data, or demonstrations. However, naively performing such initialization in RL often works poorly, especially for value-based methods. In this paper, we present a meta algorithm that can use offline data, demonstrations, or a pre-existing policy to initi","authors_text":"Banghua Zhu, Chuyuan Fu, Cong Ma, Ikechukwu Uchendu, Jiantao Jiao, Jos\\'ephine Simon, Karol Hausman, Matthew Bennice, Mengyuan Yan, Sergey Levine, Ted Xiao, Yao Lu","cross_cats":[],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-04-05T17:25:22Z","title":"Jump-Start Reinforcement Learning"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2204.02372","kind":"arxiv","version":2},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:c943a0f1bc939bf07ce2f981d9336a199aa1a9e6724b12b00b4270c503591959","target":"record","created_at":"2026-07-05T06:28:47Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"a4170ce6f13962dec8ad8b72b099f465fb6188b72d3cadbf286ec00b749d1efc","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-04-05T17:25:22Z","title_canon_sha256":"a4d0cbece4e12b32e3024d6261b51b034742f8a36de249cc435db7209952be72"},"schema_version":"1.0","source":{"id":"2204.02372","kind":"arxiv","version":2}},"canonical_sha256":"ae93d64d3c2e1d1a26f1e8c1cf213bd41bd9c6562f0fc7fab7e54dd863de3374","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"ae93d64d3c2e1d1a26f1e8c1cf213bd41bd9c6562f0fc7fab7e54dd863de3374","first_computed_at":"2026-07-05T06:28:47.099359Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T06:28:47.099359Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"RtCrWZ01+9mzN9qkfWi5GZ9ghlypXyvJ4ve7tWjT00suCAvgGGqXIJ0YkXN/5R1lJYwA9kiScGs/qeyi8P16AA==","signature_status":"signed_v1","signed_at":"2026-07-05T06:28:47.100033Z","signed_message":"canonical_sha256_bytes"},"source_id":"2204.02372","source_kind":"arxiv","source_version":2}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:c943a0f1bc939bf07ce2f981d9336a199aa1a9e6724b12b00b4270c503591959","sha256:fe6b48e4b9d0a10ba511d124eebc085767ca5dd93b764cef5781de1b8fd82ec0"],"state_sha256":"65baa31e82e9d1983bfb74ace417857da0abde8133e69cf17e76075d46c69cbd"}