{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2019:PHQBTQUKZGTGC6UDN2TMJVLVBW","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"5d5eabe11acedfc5e86cf285df77db0ece6387e158d58260a044e865d5824377","cross_cats_sorted":["cs.AI","stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-09-30T11:55:17Z","title_canon_sha256":"3bd1912c1e24e0356136c03e0016a60ae648c35f0aca237353484e69b220b01c"},"schema_version":"1.0","source":{"id":"1909.13607","kind":"arxiv","version":4}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"1909.13607","created_at":"2026-07-05T00:45:33Z"},{"alias_kind":"arxiv_version","alias_value":"1909.13607v4","created_at":"2026-07-05T00:45:33Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.1909.13607","created_at":"2026-07-05T00:45:33Z"},{"alias_kind":"pith_short_12","alias_value":"PHQBTQUKZGTG","created_at":"2026-07-05T00:45:33Z"},{"alias_kind":"pith_short_16","alias_value":"PHQBTQUKZGTGC6UD","created_at":"2026-07-05T00:45:33Z"},{"alias_kind":"pith_short_8","alias_value":"PHQBTQUK","created_at":"2026-07-05T00:45:33Z"}],"graph_snapshots":[{"event_id":"sha256:8dcf2c6febee6add8d30d10f0a57c7dac215d10dd68983dfd1349dbf0fe07826","target":"graph","created_at":"2026-07-05T00:45:33Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/1909.13607/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Most meta reinforcement learning (meta-RL) methods learn to adapt to new tasks by directly optimizing the parameters of policies over primitive action space. Such algorithms work well in tasks with relatively slight difference. However, when the task distribution becomes wider, it would be quite inefficient to directly learn such a meta-policy. In this paper, we propose a new meta-RL algorithm called Meta Goal-generation for Hierarchical RL (MGHRL). Instead of directly generating policies over primitive action space for new tasks, MGHRL learns to generate high-level meta strategies over subgoa","authors_text":"Chen Chen, Haotian Fu, Hongyao Tang, Jianye Hao, Wulong Liu","cross_cats":["cs.AI","stat.ML"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-09-30T11:55:17Z","title":"MGHRL: Meta Goal-generation for Hierarchical Reinforcement Learning"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"1909.13607","kind":"arxiv","version":4},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:05a787964d311b74f43feaa328c22e806e93001ef265ca0e50e7ffad2dbdc32f","target":"record","created_at":"2026-07-05T00:45:33Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"5d5eabe11acedfc5e86cf285df77db0ece6387e158d58260a044e865d5824377","cross_cats_sorted":["cs.AI","stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-09-30T11:55:17Z","title_canon_sha256":"3bd1912c1e24e0356136c03e0016a60ae648c35f0aca237353484e69b220b01c"},"schema_version":"1.0","source":{"id":"1909.13607","kind":"arxiv","version":4}},"canonical_sha256":"79e019c28ac9a6617a836ea6c4d5750db0a35fd78f669f077930542217e19902","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"79e019c28ac9a6617a836ea6c4d5750db0a35fd78f669f077930542217e19902","first_computed_at":"2026-07-05T00:45:33.794579Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T00:45:33.794579Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"Q1gWFVHEynra1dmSjTh+KoJvw5qYrfbLJ0YPRQ6UobuT6NssVslBcC+rUIbT2+t7m/X7VTP5elCXCCoT0tQBDg==","signature_status":"signed_v1","signed_at":"2026-07-05T00:45:33.795069Z","signed_message":"canonical_sha256_bytes"},"source_id":"1909.13607","source_kind":"arxiv","source_version":4}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:05a787964d311b74f43feaa328c22e806e93001ef265ca0e50e7ffad2dbdc32f","sha256:8dcf2c6febee6add8d30d10f0a57c7dac215d10dd68983dfd1349dbf0fe07826"],"state_sha256":"717183f10a5ed6cd500ee2ff1ca9a062be1553005eb0885f1ff5ffcb83697a50"}