{"as_of":"2026-08-09T11:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ed39614e68e7d0c3ff635daef4b293fa8ad8bdbfdc5c410ac4a1450f3fb97bfb","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:03:49.520373Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T21:27:31.026539Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:09:14.926116Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"cited_work":{"arxiv_id":"2506.06261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06261","snapshot_observed_at":"2026-07-04T00:09:14.926116Z","title":"Reflect-then-plan: Offline model-based planning through a doubly bayesian lens","venue":null,"work_id":"93ed52c5-5021-4ac8-bf19-c1256b58c769","year":2025},"citing_paper":{"arxiv_id":"2601.12538","last_updated":"2026-01-18T18:58:23Z","snapshot_observed_at":"2026-08-04T22:42:23.171653Z","submitted_at":"2026-01-18T18:58:23Z","title":"Agentic Reasoning for Large Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-17T15:14:25.558878Z"},"links":{"cited_paper":"/paper/2506.06261","citing_paper":"/paper/2601.12538"},"observation_digest":"sha256:e4ad4b3b4d9ba16918f702b6c67cf0e8ea38cc5b8715759153a7604cc1def18e","observation_id":"26f71b9d-ad91-4084-834d-b3d50183cc9f","resolution":{"observed_at":"2026-05-17T15:14:25.907040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"cited_work":{"arxiv_id":"2506.06261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06261","snapshot_observed_at":"2026-07-04T00:09:14.926116Z","title":"Reflect-then-plan: Offline model-based planning through a doubly bayesian lens","venue":null,"work_id":"93ed52c5-5021-4ac8-bf19-c1256b58c769","year":2025},"citing_paper":{"arxiv_id":"2606.19328","last_updated":"2026-06-22T15:12:05Z","snapshot_observed_at":"2026-07-06T23:54:37.596257Z","submitted_at":"2026-06-17T17:54:32Z","title":"UBP2: Uncertainty-Balanced Preference Planning for Efficient Preference-based Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T21:27:31.026539Z"},"links":{"cited_paper":"/paper/2506.06261","citing_paper":"/paper/2606.19328"},"observation_digest":"sha256:ba4edf4b43cca48d34f9cb335321230bb4d4d995472d96a867044e6ed6548a6e","observation_id":"c1530e55-3dc4-43ea-861d-91ed9c3c525d","resolution":{"observed_at":"2026-07-04T00:09:14.928534Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06261/citation-record","integrity":"/paper/2506.06261/integrity","json":"/paper/2506.06261/citation-record.json","paper":"/paper/2506.06261"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:44.662883Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:44.662883Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:ec1046fe1cf0bde467eab4430abb5cf5e7567719a9e7411d5d2bc6807329db29","observation_id":"c8092b47-592e-4a82-b66a-cd0fce5fc801","resolution":{"observed_at":"2026-08-07T06:03:44.662883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:58.693963Z","title":"T., Tassa, Y., Munos, R., Heess, N., and Riedmiller, M","venue":null,"work_id":"e4013142-827c-4cf1-b457-94fd2daf1f2a","year":2018},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:44.734527Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:5d4dce62fb554ed921acf05f6a30a3c376ef135f07c3e05c0d7b648ebcd0c426","observation_id":"c1e2bd2b-cdcf-4cf5-8a4c-2568b5e59295","resolution":{"observed_at":"2026-08-07T06:03:58.817378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.13264","last_updated":"2022-01-05T18:45:18Z","snapshot_observed_at":"2026-08-06T11:30:22.569097Z","submitted_at":"2021-08-30T14:23:48Z","title":"Deep Reinforcement Learning at the Edge of the Statistical Precipice","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.13264","snapshot_observed_at":"2026-08-07T06:03:44.808251Z","title":"S., Courville, A., and Bellemare, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:44.808251Z"},"links":{"cited_paper":"/paper/2108.13264","citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:f6f1dee062de06e26c5cd9655bd5fd7cb95e37de67d88c9e7197aad65b23a92e","observation_id":"22a2a20c-39f7-4aec-ad69-8d7dc93f94d7","resolution":{"observed_at":"2026-08-07T06:03:44.808251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:58.459662Z","title":null,"venue":null,"work_id":"e22be222-6ff3-402f-bca6-50b82c60fc78","year":2021},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:44.892153Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:870396b914c27a6d7fdd7c67b8cb14528d864f98a08b1aea5a4595ff7e5df01f","observation_id":"05899d7e-9df4-4707-b93a-b9b427f6ea1e","resolution":{"observed_at":"2026-08-07T06:03:58.554367Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:58.192616Z","title":"and Dulac-Arnold, G","venue":null,"work_id":"07e2dc14-cd01-4a73-b580-b86397312521","year":2021},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:44.989810Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:5789fecceac6d43fbf6cac669dc2fe94da8677cee8f1757c957919339c6523d6","observation_id":"f78c6806-41a6-42ce-bed7-7574043fae77","resolution":{"observed_at":"2026-08-07T06:03:58.335194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:57.886503Z","title":"Experiment tracking with weights and biases, 2020","venue":null,"work_id":"45dadfb6-ef6e-4720-99d8-3d6cdad46126","year":2020},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.042792Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:ee617a25e85590cf31b6dfc9cc3de87f7090af766cb2cbe35ac399f9e8dca36b","observation_id":"46e4276a-0f8e-48b6-a9fa-e2bc0d3300df","resolution":{"observed_at":"2026-08-07T06:03:58.058084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:57.637115Z","title":"T., Wenjie, S., and Ye, J","venue":null,"work_id":"2e75ac27-e8e1-40c2-9470-8e659a5fa1d5","year":2021},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.123090Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:d865e7b30f0dcc1875ff417832668296e1407432c2fbb3a43832adcfe2eea730","observation_id":"9f0003b4-1283-495a-a48d-a56f1b787393","resolution":{"observed_at":"2026-08-07T06:03:57.739705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:57.415007Z","title":"Deep reinforcement learning in a handful of trials using probabilistic dynamics models","venue":null,"work_id":"ea1daab4-6505-4e2c-9271-c451ebe4eda0","year":2018},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.201119Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:1e0bca615e78979b9bb4c7a91ca47db3d381f506c20acee9ac7a27af8cb52fb8","observation_id":"ee9dc7b7-43f8-491c-b5c0-6781847d8ddc","resolution":{"observed_at":"2026-08-07T06:03:57.533127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:57.164921Z","title":"S., Abbeel, P., Levine, S., and Finn, C","venue":null,"work_id":"4efe3f55-e689-469d-aec1-c920c2c48bc8","year":2019},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.285290Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:4de2fe851aeb543d2fa79ca60e57e36f0ffd79ee56be82b526a0203dfe769fae","observation_id":"9428f096-c1a4-48d4-8f2e-2aa7816e0afc","resolution":{"observed_at":"2026-08-07T06:03:57.285004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:56.858400Z","title":"Offline meta reinforcement learning -- identifiability challenges and effective data collection strategies","venue":null,"work_id":"c623746e-11af-43cc-bb2b-c2e998e6ed55","year":2021},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.365659Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:51c89a464c4f9b65dcbdee2ff321142d7bf2b433d6677c2cc11742a1fb79a0fc","observation_id":"ca17b460-a715-47aa-8594-b91f28163e4d","resolution":{"observed_at":"2026-08-07T06:03:56.969870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:56.610745Z","title":null,"venue":null,"work_id":"07ab75e4-9fb3-4cfc-8f17-755e2eb5b238","year":2002},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.411352Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:7bf15c4fa527e88a37761e89faa501db9d6b34c0ed26773e18070217f505d748","observation_id":"ab536021-8957-42d9-8dcb-f46a45381c51","resolution":{"observed_at":"2026-08-07T06:03:56.712428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-07T06:03:45.544896Z","title":"D4RL: datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.544896Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:41764487121bbb0af9268a4147418f5d745ab148b4c92cc3155ce793eb29d82e","observation_id":"4c5c8bac-27bf-41dc-8dc2-08557a1ec706","resolution":{"observed_at":"2026-08-07T06:03:45.544896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:45.611725Z","title":"and Gu, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.611725Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:52374c576c27570295034f67dccbb6eb146a5f9a69d7a3761d032a5ee5a2bfc4","observation_id":"b76c7758-8e57-4861-9361-d4dd75684348","resolution":{"observed_at":"2026-08-07T06:03:45.611725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:56.286114Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":"52bae9a3-bcb0-457e-ac96-b01511460748","year":2019},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.696943Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:dba9740e5ab7f32b7fdd10511b6d5aae41623167ec03b2e576740fbdc02fd4a4","observation_id":"b7b5d722-cb99-4da3-b011-02228b4b32f4","resolution":{"observed_at":"2026-08-07T06:03:56.465987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:56.029820Z","title":"Bayesian reinforcement learning: A survey","venue":null,"work_id":"0912f4d5-2e31-4720-81fd-9550f7ef5440","year":2015},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.765536Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:8726d9d8a51a50abc0330b5ea35ef00b89dda60d51a2327a36a8a4f65893bf7b","observation_id":"c639d093-f020-46bd-81ab-9e58b7ccd681","resolution":{"observed_at":"2026-08-07T06:03:56.146775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:55.716431Z","title":"P., and Levine, S","venue":null,"work_id":"710210ae-2bc0-45b4-976c-0f5c7483a15a","year":2021},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.831667Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:1207879adfcdb613c6c31b6ab55c018b4f5b66d1537ab50806c110e875daf5b1","observation_id":"f6fef5e4-79ef-4c5d-ba64-f1a2869dbb01","resolution":{"observed_at":"2026-08-07T06:03:55.861945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:55.431059Z","title":"Offline RL policies should be trained to be adaptive","venue":null,"work_id":"da4b42dc-28db-45c7-b518-b95fb4a47aa8","year":2022},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.937699Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:377fd0afcee0d2326856a9ab9c92c3eed69788240367e78190bd6dbd23c604dd","observation_id":"27827645-388a-40b6-9c8a-672b7ecd6df1","resolution":{"observed_at":"2026-08-07T06:03:55.550935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"file/3505107","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:50.635773Z","title":"Efficient bayes-adaptive reinforcement learning using sample-based search","venue":null,"work_id":"d44d3009-6546-479b-9867-c50183b16add","year":2012},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:46.012409Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:a04f1265ff4bc67aa1b15b2a7b4fe6ccaf532e2349a051643b9a4081a42a9827","observation_id":"321a86f3-abf5-44f5-8209-44aef3c51753","resolution":{"observed_at":"2026-08-07T06:03:50.770223Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:55.125312Z","title":"When to trust your model: Model-based policy optimization","venue":null,"work_id":"e651c05a-026c-4fb3-bce1-e50f12e26ede","year":2019},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:46.096762Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:d15be2103f5b38d153f814dd6e0d09811631cb8fc8f1faa7b8814b2223c2d758","observation_id":"705bd01e-1c79-4bfe-a40d-afbf8fe81c58","resolution":{"observed_at":"2026-08-07T06:03:55.308363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:54.797517Z","title":"Planning with diffusion for flexible behavior synthesis","venue":null,"work_id":"01b1d33f-dff4-4d26-ae06-327f7abb8c46","year":2022},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:46.183550Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:0dd0e224e78bb862b09616436082b495ae639cded1fc5ea6846f5675bb319105","observation_id":"42ad2618-6304-40fe-b34f-6df7def337bc","resolution":{"observed_at":"2026-08-07T06:03:54.959745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:54.492913Z","title":"Is pessimism provably efficient for offline rl? In Meila, M","venue":null,"work_id":"7f6a23d3-5358-4755-b826-76ee83bcf1b6","year":2021},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:46.260650Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:43da883f9bd057cf7f69f42e594dc2dce300ed0f3192cc22b447a73925e11679","observation_id":"0ab800cf-6a1f-4238-bbc1-dfc6983d4a9c","resolution":{"observed_at":"2026-08-07T06:03:54.657314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:54.176369Z","title":"P., Littman, M","venue":null,"work_id":"b59fb58c-5714-4e29-8f40-350656c790c5","year":1998},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:46.347403Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:cc936d098adc86933974bb6739b22af3e4d9557033a486657d3a097d114bc07d","observation_id":"ca289220-e219-4c8d-96c5-209ad2b4d40e","resolution":{"observed_at":"2026-08-07T06:03:54.324634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:53.807662Z","title":"Morel : Model-based offline reinforcement learning","venue":null,"work_id":"c54439e1-8556-42a9-afd4-e991f40fc40f","year":2021},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:46.452733Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:e4e27f413d30367d53dd687c0809cda24c427f9a371341fc17337f37a788854a","observation_id":"0ba19711-98f1-4007-9ad5-5c42e5c10026","resolution":{"observed_at":"2026-08-07T06:03:53.981841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:46.549158Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:46.549158Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:2f9425006bbac2bcaddafad9e5ea4c19a0bcb426b7aa27120aebd78ea0873d96","observation_id":"dd60bff0-8a58-4589-850d-21e8f415fd4d","resolution":{"observed_at":"2026-08-07T06:03:46.549158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:53.500938Z","title":"Stabilizing off-policy q-learning via bootstrapping error reduction","venue":null,"work_id":"828c88be-27c3-4c7d-becc-ed49a9ae1c65","year":2019},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:46.664728Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:e54a205e1b258c3fb95c4e58cb440a0f95c1cf32c571e45af96176f69dd8a04a","observation_id":"55e25cb3-2daf-442c-bced-130b23261ac5","resolution":{"observed_at":"2026-08-07T06:03:53.649910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:53.152494Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":"21ac1f9d-8d7f-4a5a-941f-91790363b471","year":2020},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:46.791841Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:56b983eecd8e4ca033de478e14c9621333be2f4ae758df189a224e8f22e68260","observation_id":"a226a1e9-50ab-4673-abec-69396cd17915","resolution":{"observed_at":"2026-08-07T06:03:53.293634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:52.841435Z","title":"Reinforcement learning and control as probabilistic inference: Tutorial and review, 2018","venue":null,"work_id":"b598de1a-a41a-4d54-98b4-3f6ffaf2e606","year":2018},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:46.990592Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:f2daa8948472a8dca35fc7e8af5f292139e1205c7edc9bd23dd02f92355aad14","observation_id":"b3e38fe3-479d-4d2b-97b8-d3cc76116f40","resolution":{"observed_at":"2026-08-07T06:03:52.991334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T06:03:47.167284Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:47.167284Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:ceac52bdcd87a2ed646f44f3c150a463997d55a878db03daeecb90943e6060c7","observation_id":"d0d22f6d-3053-4300-8c3b-b4cbd78b069d","resolution":{"observed_at":"2026-08-07T06:03:47.167284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.01848","last_updated":"2019-01-28T16:39:23Z","snapshot_observed_at":"2026-07-06T07:12:44.495733Z","submitted_at":"2018-11-05T17:09:18Z","title":"Plan Online, Learn Offline: Efficient Learning and Exploration via Model-Based Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.01848","snapshot_observed_at":"2026-08-07T06:03:47.372549Z","title":"Plan online, learn offline: Efficient learning and exploration via model-based control, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:47.372549Z"},"links":{"cited_paper":"/paper/1811.01848","citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:db74895c2a662f6d19837b002b05a63f77a686600e0e6ba45f9e013780366350","observation_id":"e95f3e36-e84f-46ae-b63d-338187ba32a5","resolution":{"observed_at":"2026-08-07T06:03:47.372549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:52.535617Z","title":"Revisiting design choices in offline model based reinforcement learning, 2021","venue":null,"work_id":"f9184d9b-e73c-4d57-9e84-a5b1754a5f1c","year":2021},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:47.506550Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:59b044a7c27ebd46f81e0e4816cc45a83fc18beb6b5118da47f24dc9b520bc4b","observation_id":"e17cfde7-9275-4d2c-bf81-faf758631575","resolution":{"observed_at":"2026-08-07T06:03:52.717159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11652","last_updated":"2019-09-25T17:55:37Z","snapshot_observed_at":"2026-07-06T08:24:35.659730Z","submitted_at":"2019-09-25T17:55:37Z","title":"Deep Dynamics Models for Learning Dexterous Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11652","snapshot_observed_at":"2026-08-07T06:03:47.644501Z","title":"Deep dynamics models for learning dexterous manipulation, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:47.644501Z"},"links":{"cited_paper":"/paper/1909.11652","citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:36f278af0959b9eed361622250cfb57d49eb4eae4e42f8b64fcc7684f3a15261","observation_id":"8de4fcca-fc38-43a3-a230-aa0ca047e3ea","resolution":{"observed_at":"2026-08-07T06:03:47.644501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:52.164569Z","title":"and Taniguchi, T","venue":null,"work_id":"1d83eac1-e9f5-4584-aa43-2459527d81ea","year":2020},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:47.808954Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:6a7fb2625b63d4dec803335f4c0c76a5393d948342256a63724e896650b68a9f","observation_id":"3425e546-0fed-405c-9f01-b5c0be6bdda4","resolution":{"observed_at":"2026-08-07T06:03:52.311287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:51.860505Z","title":"Probabilistic planning with sequential monte carlo methods","venue":null,"work_id":"a8ff20db-aa2e-4b76-965d-a650bc332651","year":2019},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:48.015339Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:34b182cf8e9a517ac759547614574d6a05cbb29ff468a456077eb3c607f9e179","observation_id":"76999567-9b58-4024-a5a9-a64c44821feb","resolution":{"observed_at":"2026-08-07T06:03:52.002407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.12581","last_updated":"2022-10-11T06:19:27Z","snapshot_observed_at":"2026-07-06T13:04:06.153900Z","submitted_at":"2022-04-26T20:42:14Z","title":"RAMBO-RL: Robust Adversarial Model-Based Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.12581","snapshot_observed_at":"2026-08-07T06:03:48.178163Z","title":"Rambo-rl: Robust adversarial model-based offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:48.178163Z"},"links":{"cited_paper":"/paper/2204.12581","citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:9a10678405054d7d294f4a87734018a44761c9e278da3d391ca01f464eb38f6d","observation_id":"3dcb864d-2bad-4af4-8797-ee40806379e7","resolution":{"observed_at":"2026-08-07T06:03:48.178163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:51.508837Z","title":"Learning off-policy with online planning","venue":null,"work_id":"cdd9d75f-23bd-4b19-8f9d-e11d77a111bb","year":2021},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:48.345210Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:8ed4d234d62502bd5dfd029f35a9da46ccc59c784c8ab2b0d2d427b1e6d3b211","observation_id":"6b04e500-2cc4-4f42-87c8-27ab9d7706b4","resolution":{"observed_at":"2026-08-07T06:03:51.673944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9469.00360","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:50.050115Z","title":"Improved sampling-importance resampling and reduced bias importance sampling","venue":null,"work_id":"5b65c111-7e72-4526-bd2b-fe2313d72f71","year":2003},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:48.477888Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:2c5d4db4e85470d0270e2f2ab14aaf8e8359c221efe6a158387ba939f4736b85","observation_id":"300b965f-9130-4fc9-bd52-e230fd1425a8","resolution":{"observed_at":"2026-08-07T06:03:50.402148Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:48.624377Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:48.624377Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:5925421d9b21252ffb32aa65c47ec22930bf7fdfb2ce7513ea67cd93b242db3e","observation_id":"2d6978e4-bf2e-413e-9d8d-5540e253e3ac","resolution":{"observed_at":"2026-08-07T06:03:48.624377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:51.120526Z","title":"Model predictive path integral control using covariance variable importance sampling, 2015","venue":null,"work_id":"fbb72d20-b88a-45b4-99ce-512be247bee9","year":2015},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:48.752678Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:69085775e4233ad2b252f9423783a4cb59c9a4e95c9a64b1b31608dd4e7c1699","observation_id":"85faaf2e-b21c-4330-83d4-9a7482d1a1f0","resolution":{"observed_at":"2026-08-07T06:03:51.303992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-07T06:03:48.860136Z","title":"Behavior regularized offline reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:48.860136Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:c94adde4f2043edd7f3ff0d603ea56b1017e445f49e726c7ad5eaa7429eebbc3","observation_id":"6c80e0e6-da96-4a3c-8da9-f2437ea0e9a8","resolution":{"observed_at":"2026-08-07T06:03:48.860136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:50.887820Z","title":"Mopo: Model-based offline policy optimization","venue":null,"work_id":"dfe70d2a-5110-4fc4-8896-1006fcce174c","year":2020},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:49.021233Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:d97d766334bfe3d462dd132da369ed660af102f324eaa4def6c26608ab9cd3d1","observation_id":"7f0ae814-39de-4658-a455-60ce2bad1014","resolution":{"observed_at":"2026-08-07T06:03:50.976072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.08363","last_updated":"2022-01-27T01:08:41Z","snapshot_observed_at":"2026-08-05T09:11:42.032958Z","submitted_at":"2021-02-16T18:50:32Z","title":"COMBO: Conservative Offline Model-Based Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.08363","snapshot_observed_at":"2026-08-07T06:03:49.226355Z","title":"COMBO: conservative offline model-based policy optimization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:49.226355Z"},"links":{"cited_paper":"/paper/2102.08363","citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:378cfc62283d89ec21a3a8d221c4d533bef735dc0cd2603929119844e755bf13","observation_id":"40591d21-29e5-46d1-b52f-9a758d043e95","resolution":{"observed_at":"2026-08-07T06:03:49.226355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2022/516","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:49.699538Z","title":"Model-based offline planning with trajectory pruning","venue":null,"work_id":"a28d3cf0-8f24-4434-8248-fa6676d2114f","year":2022},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:49.380210Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:dc7799c28b1f7fc9168c0150b61df14607f88983041249d68fecf09baa6cde85","observation_id":"377ac002-9335-4d18-923f-0e1bace05914","resolution":{"observed_at":"2026-08-07T06:03:49.820614Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.08348","last_updated":"2020-02-27T19:40:21Z","snapshot_observed_at":"2026-08-08T16:00:49.075701Z","submitted_at":"2019-10-18T11:44:59Z","title":"VariBAD: A Very Good Method for Bayes-Adaptive Deep RL via Meta-Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.08348","snapshot_observed_at":"2026-08-07T06:03:49.520373Z","title":"Varibad: A very good method for bayes-adaptive deep rl via meta-learning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:49.520373Z"},"links":{"cited_paper":"/paper/1910.08348","citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:f1d5366c03a9e56bbef39e989b194c0b422431d56d3957dcb9215ec85d5b9157","observation_id":"c4e594ae-0268-48e9-92cc-2d4f6d18b387","resolution":{"observed_at":"2026-08-07T06:03:49.520373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T07:43:28.213772Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":3,"verified_fuzzy":25},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 2 inbound Pith citation observations for arXiv:2506.06261."}