{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2025:ZHUT47D75REZPIQOTTRX5NT3TD","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"8baa1cd77ca30605c08a2b0f4b81b6b05759ed02c0d0cfe64466ccb13bec0f87","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-01-06T05:33:09Z","title_canon_sha256":"0e6cbba2a503baaa811aa0f8241d4402e1d0534a37e0a2fcc0f5b632cc96c2f4"},"schema_version":"1.0","source":{"id":"2501.02774","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2501.02774","created_at":"2026-07-05T09:57:12Z"},{"alias_kind":"arxiv_version","alias_value":"2501.02774v1","created_at":"2026-07-05T09:57:12Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2501.02774","created_at":"2026-07-05T09:57:12Z"},{"alias_kind":"pith_short_12","alias_value":"ZHUT47D75REZ","created_at":"2026-07-05T09:57:12Z"},{"alias_kind":"pith_short_16","alias_value":"ZHUT47D75REZPIQO","created_at":"2026-07-05T09:57:12Z"},{"alias_kind":"pith_short_8","alias_value":"ZHUT47D7","created_at":"2026-07-05T09:57:12Z"}],"graph_snapshots":[{"event_id":"sha256:400105d25cafa8053df255abee74b9c38b96af4a70f9164ce3c963970edb10b5","target":"graph","created_at":"2026-07-05T09:57:12Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2501.02774/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Hybrid action models are widely considered an effective approach to reinforcement learning (RL) modeling. The current mainstream method is to train agents under Parameterized Action Markov Decision Processes (PAMDPs), which performs well in specific environments. Unfortunately, these models either exhibit drastic low learning efficiency in complex PAMDPs or lose crucial information in the conversion between raw space and latent space. To enhance the learning efficiency and asymptotic performance of the agent, we propose a model-based RL (MBRL) algorithm, FLEXplore. FLEXplore learns a parameter","authors_text":"Bin Wang, Boxiang Tao, Hongbo Dou, Mingwen Shao, Zijian Wang","cross_cats":[],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2501.02774","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:07fe0d70fa5127489a6288086bb2ffb38bce7decdd1b4732053b11a14771675b","target":"record","created_at":"2026-07-05T09:57:12Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"8baa1cd77ca30605c08a2b0f4b81b6b05759ed02c0d0cfe64466ccb13bec0f87","cross_cats_sorted":[],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-01-06T05:33:09Z","title_canon_sha256":"0e6cbba2a503baaa811aa0f8241d4402e1d0534a37e0a2fcc0f5b632cc96c2f4"},"schema_version":"1.0","source":{"id":"2501.02774","kind":"arxiv","version":1}},"canonical_sha256":"c9e93e7c7fec4997a20e9ce37eb67b98ec16c00afd9a3e8c676ab03782827eb4","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"c9e93e7c7fec4997a20e9ce37eb67b98ec16c00afd9a3e8c676ab03782827eb4","first_computed_at":"2026-07-05T09:57:12.024608Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T09:57:12.024608Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"HpzXrtJrPV5BE6G9tTMmJ7utyLC6FTuW4quWdmJHfrpsUWfRiKEsfysx23HCsvIztEr/lFFJDiehsslZVcQPBA==","signature_status":"signed_v1","signed_at":"2026-07-05T09:57:12.025040Z","signed_message":"canonical_sha256_bytes"},"source_id":"2501.02774","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:07fe0d70fa5127489a6288086bb2ffb38bce7decdd1b4732053b11a14771675b","sha256:400105d25cafa8053df255abee74b9c38b96af4a70f9164ce3c963970edb10b5"],"state_sha256":"0af456a915baaf748cd670f590080ba44bca0dbe3852fe58462f06a9180b9b41"}