{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2019:2ET5WOF3INZ6WLKRXCWJK43XE5","short_pith_number":"pith:2ET5WOF3","schema_version":"1.0","canonical_sha256":"d127db38bb4373eb2d51b8ac957377276f5fce7e8e0ca5a085a5b397afae5b16","source":{"kind":"arxiv","id":"1910.11956","version":1},"attestation_state":"computed","paper":{"title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.RO","stat.ML"],"primary_cat":"cs.LG","authors_text":"Abhishek Gupta, Corey Lynch, Karol Hausman, Sergey Levine, Vikash Kumar","submitted_at":"2019-10-25T23:01:43Z","abstract_excerpt":"We present relay policy learning, a method for imitation and reinforcement learning that can solve multi-stage, long-horizon robotic tasks. This general and universally-applicable, two-phase approach consists of an imitation learning stage that produces goal-conditioned hierarchical policies, and a reinforcement learning phase that finetunes these policies for task performance. Our method, while not necessarily perfect at imitation learning, is very amenable to further improvement via environment interaction, allowing it to scale to challenging long-horizon tasks. We simplify the long-horizon "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"1910.11956","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-10-25T23:01:43Z","cross_cats_sorted":["cs.RO","stat.ML"],"title_canon_sha256":"67664038f7bdb7d5552881675cbe9d5b86745d08923e1fe5ecd3f4b7e1a07b6f","abstract_canon_sha256":"cf37b9d572c296c47e2890ed686d404f8a378f42ab07eac0006fd531ef189f54"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T00:15:11.344886Z","signature_b64":"Uz0y7ZlmW9ErSr5JGvs9UkG5qvsJl83dIL9gKqwou1RYmUnU+YHArTNjqFEaDR0Jt2KGDmACOcTE/RaFVStGDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d127db38bb4373eb2d51b8ac957377276f5fce7e8e0ca5a085a5b397afae5b16","last_reissued_at":"2026-07-05T00:15:11.344446Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T00:15:11.344446Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.RO","stat.ML"],"primary_cat":"cs.LG","authors_text":"Abhishek Gupta, Corey Lynch, Karol Hausman, Sergey Levine, Vikash Kumar","submitted_at":"2019-10-25T23:01:43Z","abstract_excerpt":"We present relay policy learning, a method for imitation and reinforcement learning that can solve multi-stage, long-horizon robotic tasks. This general and universally-applicable, two-phase approach consists of an imitation learning stage that produces goal-conditioned hierarchical policies, and a reinforcement learning phase that finetunes these policies for task performance. Our method, while not necessarily perfect at imitation learning, is very amenable to further improvement via environment interaction, allowing it to scale to challenging long-horizon tasks. We simplify the long-horizon "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"1910.11956","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/1910.11956/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"1910.11956","created_at":"2026-07-05T00:15:11.344494+00:00"},{"alias_kind":"arxiv_version","alias_value":"1910.11956v1","created_at":"2026-07-05T00:15:11.344494+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.1910.11956","created_at":"2026-07-05T00:15:11.344494+00:00"},{"alias_kind":"pith_short_12","alias_value":"2ET5WOF3INZ6","created_at":"2026-07-05T00:15:11.344494+00:00"},{"alias_kind":"pith_short_16","alias_value":"2ET5WOF3INZ6WLKR","created_at":"2026-07-05T00:15:11.344494+00:00"},{"alias_kind":"pith_short_8","alias_value":"2ET5WOF3","created_at":"2026-07-05T00:15:11.344494+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":18,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.27180","citing_title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2605.03065","citing_title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2411.00361","citing_title":"Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22493","citing_title":"Understanding Multimodal Failure in Action-Chunking Behavioral Cloning","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2601.12894","citing_title":"Sparse ActionGen: Accelerating Diffusion Policy with Real-time Pruning","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15725","citing_title":"DiLA: Disentangled Latent Action World Models","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17244","citing_title":"Drift Flow Matching","ref_index":72,"is_internal_anchor":false},{"citing_arxiv_id":"2506.13456","citing_title":"Block-wise Adaptive Caching for Accelerating Diffusion Policy","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2409.00588","citing_title":"Diffusion Policy Policy Optimization","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2210.00030","citing_title":"VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2312.13139","citing_title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","ref_index":120,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12090","citing_title":"World Action Models: The Next Frontier in Embodied AI","ref_index":224,"is_internal_anchor":false},{"citing_arxiv_id":"2004.07219","citing_title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2605.03363","citing_title":"Learning Reactive Dexterous Grasping via Hierarchical Task-Space RL Planning and Joint-Space QP Control","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10573","citing_title":"Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10962","citing_title":"ScoRe-Flow: Complete Distributional Control via Score-Based Reinforcement Learning for Flow Matching","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04826","citing_title":"Efficient Multi-Objective Planning with Weighted Maximization Using Large Neighbourhood Search","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2605.03065","citing_title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","ref_index":147,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/2ET5WOF3INZ6WLKRXCWJK43XE5","json":"https://pith.science/pith/2ET5WOF3INZ6WLKRXCWJK43XE5.json","graph_json":"https://pith.science/api/pith-number/2ET5WOF3INZ6WLKRXCWJK43XE5/graph.json","events_json":"https://pith.science/api/pith-number/2ET5WOF3INZ6WLKRXCWJK43XE5/events.json","paper":"https://pith.science/paper/2ET5WOF3"},"agent_actions":{"view_html":"https://pith.science/pith/2ET5WOF3INZ6WLKRXCWJK43XE5","download_json":"https://pith.science/pith/2ET5WOF3INZ6WLKRXCWJK43XE5.json","view_paper":"https://pith.science/paper/2ET5WOF3","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=1910.11956&json=true","fetch_graph":"https://pith.science/api/pith-number/2ET5WOF3INZ6WLKRXCWJK43XE5/graph.json","fetch_events":"https://pith.science/api/pith-number/2ET5WOF3INZ6WLKRXCWJK43XE5/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/2ET5WOF3INZ6WLKRXCWJK43XE5/action/timestamp_anchor","attest_storage":"https://pith.science/pith/2ET5WOF3INZ6WLKRXCWJK43XE5/action/storage_attestation","attest_author":"https://pith.science/pith/2ET5WOF3INZ6WLKRXCWJK43XE5/action/author_attestation","sign_citation":"https://pith.science/pith/2ET5WOF3INZ6WLKRXCWJK43XE5/action/citation_signature","submit_replication":"https://pith.science/pith/2ET5WOF3INZ6WLKRXCWJK43XE5/action/replication_record"}},"created_at":"2026-07-05T00:15:11.344494+00:00","updated_at":"2026-07-05T00:15:11.344494+00:00"}