{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2019:2ET5WOF3INZ6WLKRXCWJK43XE5","short_pith_number":"pith:2ET5WOF3","canonical_record":{"source":{"id":"1910.11956","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-10-25T23:01:43Z","cross_cats_sorted":["cs.RO","stat.ML"],"title_canon_sha256":"67664038f7bdb7d5552881675cbe9d5b86745d08923e1fe5ecd3f4b7e1a07b6f","abstract_canon_sha256":"cf37b9d572c296c47e2890ed686d404f8a378f42ab07eac0006fd531ef189f54"},"schema_version":"1.0"},"canonical_sha256":"d127db38bb4373eb2d51b8ac957377276f5fce7e8e0ca5a085a5b397afae5b16","source":{"kind":"arxiv","id":"1910.11956","version":1},"source_aliases":[{"alias_kind":"arxiv","alias_value":"1910.11956","created_at":"2026-07-05T00:15:11Z"},{"alias_kind":"arxiv_version","alias_value":"1910.11956v1","created_at":"2026-07-05T00:15:11Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.1910.11956","created_at":"2026-07-05T00:15:11Z"},{"alias_kind":"pith_short_12","alias_value":"2ET5WOF3INZ6","created_at":"2026-07-05T00:15:11Z"},{"alias_kind":"pith_short_16","alias_value":"2ET5WOF3INZ6WLKR","created_at":"2026-07-05T00:15:11Z"},{"alias_kind":"pith_short_8","alias_value":"2ET5WOF3","created_at":"2026-07-05T00:15:11Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2019:2ET5WOF3INZ6WLKRXCWJK43XE5","target":"record","payload":{"canonical_record":{"source":{"id":"1910.11956","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-10-25T23:01:43Z","cross_cats_sorted":["cs.RO","stat.ML"],"title_canon_sha256":"67664038f7bdb7d5552881675cbe9d5b86745d08923e1fe5ecd3f4b7e1a07b6f","abstract_canon_sha256":"cf37b9d572c296c47e2890ed686d404f8a378f42ab07eac0006fd531ef189f54"},"schema_version":"1.0"},"canonical_sha256":"d127db38bb4373eb2d51b8ac957377276f5fce7e8e0ca5a085a5b397afae5b16","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T00:15:11.344886Z","signature_b64":"Uz0y7ZlmW9ErSr5JGvs9UkG5qvsJl83dIL9gKqwou1RYmUnU+YHArTNjqFEaDR0Jt2KGDmACOcTE/RaFVStGDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d127db38bb4373eb2d51b8ac957377276f5fce7e8e0ca5a085a5b397afae5b16","last_reissued_at":"2026-07-05T00:15:11.344446Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T00:15:11.344446Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"1910.11956","source_version":1,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T00:15:11Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"OCjinBV4ec9BIpifX6KbDujzH3V7yb6ixxZOCMcxURT0yce+NYjxes0xzHCEctHNn4mQWvFlCp//WL9nKxgGAg==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-04T22:40:19.790918Z"},"content_sha256":"059686b7153afefae17cb50c1fe2a418346b5db6f9edb74f91c70b5ce2462790","schema_version":"1.0","event_id":"sha256:059686b7153afefae17cb50c1fe2a418346b5db6f9edb74f91c70b5ce2462790"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2019:2ET5WOF3INZ6WLKRXCWJK43XE5","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.RO","stat.ML"],"primary_cat":"cs.LG","authors_text":"Abhishek Gupta, Corey Lynch, Karol Hausman, Sergey Levine, Vikash Kumar","submitted_at":"2019-10-25T23:01:43Z","abstract_excerpt":"We present relay policy learning, a method for imitation and reinforcement learning that can solve multi-stage, long-horizon robotic tasks. This general and universally-applicable, two-phase approach consists of an imitation learning stage that produces goal-conditioned hierarchical policies, and a reinforcement learning phase that finetunes these policies for task performance. Our method, while not necessarily perfect at imitation learning, is very amenable to further improvement via environment interaction, allowing it to scale to challenging long-horizon tasks. We simplify the long-horizon "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"1910.11956","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/1910.11956/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T00:15:11Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"T+wRV7erZpEYsFXiDkzOqW8VWqNZW2cn4GRMAfBu2SJfAFgiC8UKoNmHiSreUCsSsLNKXf+Fy5LKCnpLNi52DQ==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-04T22:40:19.791875Z"},"content_sha256":"0e420a6b257fb7e7491ef825fb24d03668dde51ba339c33200eab444b037a0e6","schema_version":"1.0","event_id":"sha256:0e420a6b257fb7e7491ef825fb24d03668dde51ba339c33200eab444b037a0e6"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/2ET5WOF3INZ6WLKRXCWJK43XE5/bundle.json","state_url":"https://pith.science/pith/2ET5WOF3INZ6WLKRXCWJK43XE5/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/2ET5WOF3INZ6WLKRXCWJK43XE5/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-04T22:40:19Z","links":{"resolver":"https://pith.science/pith/2ET5WOF3INZ6WLKRXCWJK43XE5","bundle":"https://pith.science/pith/2ET5WOF3INZ6WLKRXCWJK43XE5/bundle.json","state":"https://pith.science/pith/2ET5WOF3INZ6WLKRXCWJK43XE5/state.json","well_known_bundle":"https://pith.science/.well-known/pith/2ET5WOF3INZ6WLKRXCWJK43XE5/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2019:2ET5WOF3INZ6WLKRXCWJK43XE5","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"cf37b9d572c296c47e2890ed686d404f8a378f42ab07eac0006fd531ef189f54","cross_cats_sorted":["cs.RO","stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-10-25T23:01:43Z","title_canon_sha256":"67664038f7bdb7d5552881675cbe9d5b86745d08923e1fe5ecd3f4b7e1a07b6f"},"schema_version":"1.0","source":{"id":"1910.11956","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"1910.11956","created_at":"2026-07-05T00:15:11Z"},{"alias_kind":"arxiv_version","alias_value":"1910.11956v1","created_at":"2026-07-05T00:15:11Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.1910.11956","created_at":"2026-07-05T00:15:11Z"},{"alias_kind":"pith_short_12","alias_value":"2ET5WOF3INZ6","created_at":"2026-07-05T00:15:11Z"},{"alias_kind":"pith_short_16","alias_value":"2ET5WOF3INZ6WLKR","created_at":"2026-07-05T00:15:11Z"},{"alias_kind":"pith_short_8","alias_value":"2ET5WOF3","created_at":"2026-07-05T00:15:11Z"}],"graph_snapshots":[{"event_id":"sha256:0e420a6b257fb7e7491ef825fb24d03668dde51ba339c33200eab444b037a0e6","target":"graph","created_at":"2026-07-05T00:15:11Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/1910.11956/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"We present relay policy learning, a method for imitation and reinforcement learning that can solve multi-stage, long-horizon robotic tasks. This general and universally-applicable, two-phase approach consists of an imitation learning stage that produces goal-conditioned hierarchical policies, and a reinforcement learning phase that finetunes these policies for task performance. Our method, while not necessarily perfect at imitation learning, is very amenable to further improvement via environment interaction, allowing it to scale to challenging long-horizon tasks. We simplify the long-horizon ","authors_text":"Abhishek Gupta, Corey Lynch, Karol Hausman, Sergey Levine, Vikash Kumar","cross_cats":["cs.RO","stat.ML"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"1910.11956","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:059686b7153afefae17cb50c1fe2a418346b5db6f9edb74f91c70b5ce2462790","target":"record","created_at":"2026-07-05T00:15:11Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"cf37b9d572c296c47e2890ed686d404f8a378f42ab07eac0006fd531ef189f54","cross_cats_sorted":["cs.RO","stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-10-25T23:01:43Z","title_canon_sha256":"67664038f7bdb7d5552881675cbe9d5b86745d08923e1fe5ecd3f4b7e1a07b6f"},"schema_version":"1.0","source":{"id":"1910.11956","kind":"arxiv","version":1}},"canonical_sha256":"d127db38bb4373eb2d51b8ac957377276f5fce7e8e0ca5a085a5b397afae5b16","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"d127db38bb4373eb2d51b8ac957377276f5fce7e8e0ca5a085a5b397afae5b16","first_computed_at":"2026-07-05T00:15:11.344446Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T00:15:11.344446Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"Uz0y7ZlmW9ErSr5JGvs9UkG5qvsJl83dIL9gKqwou1RYmUnU+YHArTNjqFEaDR0Jt2KGDmACOcTE/RaFVStGDA==","signature_status":"signed_v1","signed_at":"2026-07-05T00:15:11.344886Z","signed_message":"canonical_sha256_bytes"},"source_id":"1910.11956","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:059686b7153afefae17cb50c1fe2a418346b5db6f9edb74f91c70b5ce2462790","sha256:0e420a6b257fb7e7491ef825fb24d03668dde51ba339c33200eab444b037a0e6"],"state_sha256":"173fb934b7e8b5557e625ffae31e3ea5f793752ea7059448608c3816f58d9b0d"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"AyWbWoGlUtJSylkdiyEb2daVDkvlnw43REjLvgOkudiLPPWHWV+vMzxZmsXdDelJW29Gb6DsVRZ6WniYfeHsDA==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-04T22:40:19.796781Z","bundle_sha256":"e70c1c1d69ce140662ef44c68d1d49fcfe85ece02d167f7df3e5ce3dd4077b0b"}}