{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:CT44TFHIBAXOVMPVMYS5UXZJD2","short_pith_number":"pith:CT44TFHI","schema_version":"1.0","canonical_sha256":"14f9c994e8082eeab1f56625da5f291e869fb214cf1595108614fb27f3943512","source":{"kind":"arxiv","id":"2506.06261","version":1},"attestation_state":"computed","paper":{"title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.AI","authors_text":"Jihwan Jeong, Jingmin Wang, Pascal Poupart, Scott Sanner, Xiaoyu Wang","submitted_at":"2025-06-06T17:40:12Z","abstract_excerpt":"Offline reinforcement learning (RL) is crucial when online exploration is costly or unsafe but often struggles with high epistemic uncertainty due to limited data. Existing methods rely on fixed conservative policies, restricting adaptivity and generalization. To address this, we propose Reflect-then-Plan (RefPlan), a novel doubly Bayesian offline model-based (MB) planning approach. RefPlan unifies uncertainty modeling and MB planning by recasting planning as Bayesian posterior estimation. At deployment, it updates a belief over environment dynamics using real-time observations, incorporating "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.06261","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2025-06-06T17:40:12Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"c319a914840fbac09d1bc1c81fdf51dc9569a387abaa562958ab70a266c851fe","abstract_canon_sha256":"30770a999539b3448e59aa3be0b4acf3e3857d2b8219cefde8e677d96b6a2414"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:17:28.304509Z","signature_b64":"bDvUSZ1gC7ZOYM2Grnua5jyBLSmaqtE9/Tvag++hVrS6BJ1JJp7UUUT5SM0zFnZ8/pKrR9MqIQ18dDd26nKoDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"14f9c994e8082eeab1f56625da5f291e869fb214cf1595108614fb27f3943512","last_reissued_at":"2026-07-05T11:17:28.304051Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:17:28.304051Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.AI","authors_text":"Jihwan Jeong, Jingmin Wang, Pascal Poupart, Scott Sanner, Xiaoyu Wang","submitted_at":"2025-06-06T17:40:12Z","abstract_excerpt":"Offline reinforcement learning (RL) is crucial when online exploration is costly or unsafe but often struggles with high epistemic uncertainty due to limited data. Existing methods rely on fixed conservative policies, restricting adaptivity and generalization. To address this, we propose Reflect-then-Plan (RefPlan), a novel doubly Bayesian offline model-based (MB) planning approach. RefPlan unifies uncertainty modeling and MB planning by recasting planning as Bayesian posterior estimation. At deployment, it updates a belief over environment dynamics using real-time observations, incorporating "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.06261","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.06261/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.06261","created_at":"2026-07-05T11:17:28.304106+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.06261v1","created_at":"2026-07-05T11:17:28.304106+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.06261","created_at":"2026-07-05T11:17:28.304106+00:00"},{"alias_kind":"pith_short_12","alias_value":"CT44TFHIBAXO","created_at":"2026-07-05T11:17:28.304106+00:00"},{"alias_kind":"pith_short_16","alias_value":"CT44TFHIBAXOVMPV","created_at":"2026-07-05T11:17:28.304106+00:00"},{"alias_kind":"pith_short_8","alias_value":"CT44TFHI","created_at":"2026-07-05T11:17:28.304106+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.19328","citing_title":"UBP2: Uncertainty-Balanced Preference Planning for Efficient Preference-based Reinforcement Learning","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2601.12538","citing_title":"Agentic Reasoning for Large Language Models","ref_index":77,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/CT44TFHIBAXOVMPVMYS5UXZJD2","json":"https://pith.science/pith/CT44TFHIBAXOVMPVMYS5UXZJD2.json","graph_json":"https://pith.science/api/pith-number/CT44TFHIBAXOVMPVMYS5UXZJD2/graph.json","events_json":"https://pith.science/api/pith-number/CT44TFHIBAXOVMPVMYS5UXZJD2/events.json","paper":"https://pith.science/paper/CT44TFHI"},"agent_actions":{"view_html":"https://pith.science/pith/CT44TFHIBAXOVMPVMYS5UXZJD2","download_json":"https://pith.science/pith/CT44TFHIBAXOVMPVMYS5UXZJD2.json","view_paper":"https://pith.science/paper/CT44TFHI","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.06261&json=true","fetch_graph":"https://pith.science/api/pith-number/CT44TFHIBAXOVMPVMYS5UXZJD2/graph.json","fetch_events":"https://pith.science/api/pith-number/CT44TFHIBAXOVMPVMYS5UXZJD2/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/CT44TFHIBAXOVMPVMYS5UXZJD2/action/timestamp_anchor","attest_storage":"https://pith.science/pith/CT44TFHIBAXOVMPVMYS5UXZJD2/action/storage_attestation","attest_author":"https://pith.science/pith/CT44TFHIBAXOVMPVMYS5UXZJD2/action/author_attestation","sign_citation":"https://pith.science/pith/CT44TFHIBAXOVMPVMYS5UXZJD2/action/citation_signature","submit_replication":"https://pith.science/pith/CT44TFHIBAXOVMPVMYS5UXZJD2/action/replication_record"}},"created_at":"2026-07-05T11:17:28.304106+00:00","updated_at":"2026-07-05T11:17:28.304106+00:00"}