{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2023:FUNELDVRVT377EFS6FRF2R4ZFJ","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"7dd7b086a7a1f5c55f19ca60b2aa04e0a7cc5f55b6cd2899fca2df730170c371","cross_cats_sorted":["cs.AI"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2023-04-06T20:47:09Z","title_canon_sha256":"c024948c9668de5c00cd32b7a86849cb2a5a41a6ac165188114f0882f8694d37"},"schema_version":"1.0","source":{"id":"2304.03365","kind":"arxiv","version":3}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2304.03365","created_at":"2026-07-05T09:38:20Z"},{"alias_kind":"arxiv_version","alias_value":"2304.03365v3","created_at":"2026-07-05T09:38:20Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2304.03365","created_at":"2026-07-05T09:38:20Z"},{"alias_kind":"pith_short_12","alias_value":"FUNELDVRVT37","created_at":"2026-07-05T09:38:20Z"},{"alias_kind":"pith_short_16","alias_value":"FUNELDVRVT377EFS","created_at":"2026-07-05T09:38:20Z"},{"alias_kind":"pith_short_8","alias_value":"FUNELDVR","created_at":"2026-07-05T09:38:20Z"}],"graph_snapshots":[{"event_id":"sha256:93f45365459d5961d8be9c7f30735ea9bafc132f05f34ed5ea6049bb80db551a","target":"graph","created_at":"2026-07-05T09:38:20Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2304.03365/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Model-based reinforcement learning (MBRL) provides a way to learn a transition model of the environment, which can then be used to plan personalized policies for different patient cohorts and to understand the dynamics involved in the decision-making process. However, standard MBRL algorithms are either sensitive to changes in the reward function or achieve suboptimal performance on the task when the transition model is restricted. Motivated by the need to use simple and interpretable models in critical domains such as healthcare, we propose a novel robust decision-focused (RDF) algorithm that","authors_text":"Abhishek Sharma, Finale Doshi-Velez, Omer Gottesman, Sonali Parbhoo","cross_cats":["cs.AI"],"headline":"","license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2023-04-06T20:47:09Z","title":"Decision-Focused Model-based Reinforcement Learning for Reward Transfer"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2304.03365","kind":"arxiv","version":3},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:a146de208b5f9a9cbe950e23eba3b41b732e33d583649a9230b62c8b2af668ec","target":"record","created_at":"2026-07-05T09:38:20Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"7dd7b086a7a1f5c55f19ca60b2aa04e0a7cc5f55b6cd2899fca2df730170c371","cross_cats_sorted":["cs.AI"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2023-04-06T20:47:09Z","title_canon_sha256":"c024948c9668de5c00cd32b7a86849cb2a5a41a6ac165188114f0882f8694d37"},"schema_version":"1.0","source":{"id":"2304.03365","kind":"arxiv","version":3}},"canonical_sha256":"2d1a458eb1acf7ff90b2f1625d47992a481ed8a143ba5d7031321e33a2959c6f","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"2d1a458eb1acf7ff90b2f1625d47992a481ed8a143ba5d7031321e33a2959c6f","first_computed_at":"2026-07-05T09:38:20.503980Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T09:38:20.503980Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"jZ9w23EI5+LdrtQGweBa7q+LJ74mpJYFJf9IiNfH9Qaq78eUDC7sAGdO6WtX3mvPZ5UfjGByaYuyVFYfu7HbDg==","signature_status":"signed_v1","signed_at":"2026-07-05T09:38:20.504457Z","signed_message":"canonical_sha256_bytes"},"source_id":"2304.03365","source_kind":"arxiv","source_version":3}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:a146de208b5f9a9cbe950e23eba3b41b732e33d583649a9230b62c8b2af668ec","sha256:93f45365459d5961d8be9c7f30735ea9bafc132f05f34ed5ea6049bb80db551a"],"state_sha256":"74ea86a4ebe23a5bf95ba56612b668cd2fcc1a7eaac41f7c643eb334305a8c99"}