{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2020:C57ROCVHRWMT6DZ2CNAXNBE3PD","short_pith_number":"pith:C57ROCVH","schema_version":"1.0","canonical_sha256":"177f170aa78d993f0f3a134176849b78eda04f15cabae5ecd897bc004baed647","source":{"kind":"arxiv","id":"2010.08587","version":2},"attestation_state":"computed","paper":{"title":"Learning Dexterous Manipulation from Suboptimal Experts","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.RO","authors_text":"Alexandre Galashov, Daniel Zheng, Francesco Nori, Jackie Kay, Jost Tobias Springenberg, Nicolas Heess, Rae Jeong, Yuxiang Zhou","submitted_at":"2020-10-16T18:48:49Z","abstract_excerpt":"Learning dexterous manipulation in high-dimensional state-action spaces is an important open challenge with exploration presenting a major bottleneck. Although in many cases the learning process could be guided by demonstrations or other suboptimal experts, current RL algorithms for continuous action spaces often fail to effectively utilize combinations of highly off-policy expert data and on-policy exploration data. As a solution, we introduce Relative Entropy Q-Learning (REQ), a simple policy iteration algorithm that combines ideas from successful offline and conventional RL algorithms. It r"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2010.08587","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.RO","submitted_at":"2020-10-16T18:48:49Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"78f0e30e6a7f750ed914b823987315675971d080a2e86d8a820651741e5f45c0","abstract_canon_sha256":"bf22d23b8b9883e1c21670542082c8c6aad45629d47c8268b28e7e82c7e35f5e"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T02:04:44.313753Z","signature_b64":"jEVXodU2xxHvVV2Acpf/sUhoFUpJlq7rgqhRsIIp0e+BWUiEnMjGDgiwF5aKr0zBsaQGhCTqnCK6jEyIWwjXBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"177f170aa78d993f0f3a134176849b78eda04f15cabae5ecd897bc004baed647","last_reissued_at":"2026-07-05T02:04:44.313266Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T02:04:44.313266Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Learning Dexterous Manipulation from Suboptimal Experts","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.RO","authors_text":"Alexandre Galashov, Daniel Zheng, Francesco Nori, Jackie Kay, Jost Tobias Springenberg, Nicolas Heess, Rae Jeong, Yuxiang Zhou","submitted_at":"2020-10-16T18:48:49Z","abstract_excerpt":"Learning dexterous manipulation in high-dimensional state-action spaces is an important open challenge with exploration presenting a major bottleneck. Although in many cases the learning process could be guided by demonstrations or other suboptimal experts, current RL algorithms for continuous action spaces often fail to effectively utilize combinations of highly off-policy expert data and on-policy exploration data. As a solution, we introduce Relative Entropy Q-Learning (REQ), a simple policy iteration algorithm that combines ideas from successful offline and conventional RL algorithms. It r"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2010.08587","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2010.08587/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2010.08587","created_at":"2026-07-05T02:04:44.313334+00:00"},{"alias_kind":"arxiv_version","alias_value":"2010.08587v2","created_at":"2026-07-05T02:04:44.313334+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2010.08587","created_at":"2026-07-05T02:04:44.313334+00:00"},{"alias_kind":"pith_short_12","alias_value":"C57ROCVHRWMT","created_at":"2026-07-05T02:04:44.313334+00:00"},{"alias_kind":"pith_short_16","alias_value":"C57ROCVHRWMT6DZ2","created_at":"2026-07-05T02:04:44.313334+00:00"},{"alias_kind":"pith_short_8","alias_value":"C57ROCVH","created_at":"2026-07-05T02:04:44.313334+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2310.17596","citing_title":"MimicGen: A Data Generation System for Scalable Robot Learning using Human Demonstrations","ref_index":105,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/C57ROCVHRWMT6DZ2CNAXNBE3PD","json":"https://pith.science/pith/C57ROCVHRWMT6DZ2CNAXNBE3PD.json","graph_json":"https://pith.science/api/pith-number/C57ROCVHRWMT6DZ2CNAXNBE3PD/graph.json","events_json":"https://pith.science/api/pith-number/C57ROCVHRWMT6DZ2CNAXNBE3PD/events.json","paper":"https://pith.science/paper/C57ROCVH"},"agent_actions":{"view_html":"https://pith.science/pith/C57ROCVHRWMT6DZ2CNAXNBE3PD","download_json":"https://pith.science/pith/C57ROCVHRWMT6DZ2CNAXNBE3PD.json","view_paper":"https://pith.science/paper/C57ROCVH","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2010.08587&json=true","fetch_graph":"https://pith.science/api/pith-number/C57ROCVHRWMT6DZ2CNAXNBE3PD/graph.json","fetch_events":"https://pith.science/api/pith-number/C57ROCVHRWMT6DZ2CNAXNBE3PD/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/C57ROCVHRWMT6DZ2CNAXNBE3PD/action/timestamp_anchor","attest_storage":"https://pith.science/pith/C57ROCVHRWMT6DZ2CNAXNBE3PD/action/storage_attestation","attest_author":"https://pith.science/pith/C57ROCVHRWMT6DZ2CNAXNBE3PD/action/author_attestation","sign_citation":"https://pith.science/pith/C57ROCVHRWMT6DZ2CNAXNBE3PD/action/citation_signature","submit_replication":"https://pith.science/pith/C57ROCVHRWMT6DZ2CNAXNBE3PD/action/replication_record"}},"created_at":"2026-07-05T02:04:44.313334+00:00","updated_at":"2026-07-05T02:04:44.313334+00:00"}