{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2024:CCIPHJ5JSBGILM6INVKOAVRA7W","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"9ac0a49c89f5ba7e7bf17142365162675c026e6ff6b4757fe168d203bf98886d","cross_cats_sorted":["cs.AI"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2024-07-02T12:32:57Z","title_canon_sha256":"05b5ad19bde7985a6822d91a5661f122776207a6571e362878d2c6676cdbcbeb"},"schema_version":"1.0","source":{"id":"2407.02217","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2407.02217","created_at":"2026-07-05T08:39:11Z"},{"alias_kind":"arxiv_version","alias_value":"2407.02217v1","created_at":"2026-07-05T08:39:11Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.02217","created_at":"2026-07-05T08:39:11Z"},{"alias_kind":"pith_short_12","alias_value":"CCIPHJ5JSBGI","created_at":"2026-07-05T08:39:11Z"},{"alias_kind":"pith_short_16","alias_value":"CCIPHJ5JSBGILM6I","created_at":"2026-07-05T08:39:11Z"},{"alias_kind":"pith_short_8","alias_value":"CCIPHJ5J","created_at":"2026-07-05T08:39:11Z"}],"graph_snapshots":[{"event_id":"sha256:123d9d0952d74060d6cc5d781aef7666d60dd6c8640621388e9cfb7365eb2860","target":"graph","created_at":"2026-07-05T08:39:11Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2407.02217/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Applying reinforcement learning (RL) to real-world applications requires addressing a trade-off between asymptotic performance, sample efficiency, and inference time. In this work, we demonstrate how to address this triple challenge by leveraging partial physical knowledge about the system dynamics. Our approach involves learning a physics-informed model to boost sample efficiency and generating imaginary trajectories from this model to learn a model-free policy and Q-function. Furthermore, we propose a hybrid planning strategy, combining the learned policy and Q-function with the learned mode","authors_text":"Nicolas Thome, Olivier Sigaud, Zakariae El Asri","cross_cats":["cs.AI"],"headline":"","license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2024-07-02T12:32:57Z","title":"Physics-Informed Model and Hybrid Planning for Efficient Dyna-Style Reinforcement Learning"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.02217","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:4c887a9a57e96fbc61b68cf39864f351be501284ff98295348f71f2101ee94b2","target":"record","created_at":"2026-07-05T08:39:11Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"9ac0a49c89f5ba7e7bf17142365162675c026e6ff6b4757fe168d203bf98886d","cross_cats_sorted":["cs.AI"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2024-07-02T12:32:57Z","title_canon_sha256":"05b5ad19bde7985a6822d91a5661f122776207a6571e362878d2c6676cdbcbeb"},"schema_version":"1.0","source":{"id":"2407.02217","kind":"arxiv","version":1}},"canonical_sha256":"1090f3a7a9904c85b3c86d54e05620fdb272b9c32746899d6e73cd1ef3d77444","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"1090f3a7a9904c85b3c86d54e05620fdb272b9c32746899d6e73cd1ef3d77444","first_computed_at":"2026-07-05T08:39:11.782273Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T08:39:11.782273Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"F9e+Cz4pQ7i2QJeMtOhsEiEcxcWPvpNCisWtejtzwziqylH8sygk+yig0K+eY5Ap8c+4M05UlEn/cnonY0wwAw==","signature_status":"signed_v1","signed_at":"2026-07-05T08:39:11.782715Z","signed_message":"canonical_sha256_bytes"},"source_id":"2407.02217","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:4c887a9a57e96fbc61b68cf39864f351be501284ff98295348f71f2101ee94b2","sha256:123d9d0952d74060d6cc5d781aef7666d60dd6c8640621388e9cfb7365eb2860"],"state_sha256":"3b54124ebfe4702f269fcd9e9e86bd448b17c2347d574cb12a31f3f8a127ba3f"}