{"as_of":"2026-08-08T04:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1bb30d6c80b189d826f6493aa90c2b98f3f23fe2b903c9c1f1bf82e671eb2ea7","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:16:05.159203Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:25:39.829506Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T01:48:51.121586Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.22442","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22442","snapshot_observed_at":"2026-07-17T00:20:38.764461Z","title":"Tree-based batch mode reinforcement learning.Journal of Machine Learning Research, 6","venue":null,"work_id":"cdcca974-d030-4895-811b-974fee853cc6","year":2005},"citing_paper":{"arxiv_id":"2512.04341","last_updated":"2026-05-01T06:11:28Z","snapshot_observed_at":"2026-07-31T11:39:06.488911Z","submitted_at":"2025-12-04T00:07:08Z","title":"Long-Horizon Model-Based Offline Reinforcement Learning Without Explicit Conservatism","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T01:46:16.923948Z"},"links":{"cited_paper":"/paper/2505.22442","citing_paper":"/paper/2512.04341"},"observation_digest":"sha256:c2e3d3bb8a0b1c1d5fc6dc9623d2ac69c234288afb71827f9b403bf23d2b8823","observation_id":"7a38f31e-998b-44d0-a06c-e8f6a48dbd1e","resolution":{"observed_at":"2026-07-17T00:20:38.764461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22442","snapshot_observed_at":"2026-08-05T15:25:39.829506Z","title":"and Foerster, Jakob N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03644","last_updated":"2026-08-04T13:29:00Z","snapshot_observed_at":"2026-08-07T23:12:14.215199Z","submitted_at":"2026-08-04T13:29:00Z","title":"Is Inter-Seed Cross-Play Enough? Evaluating the Robustness of Zero-Shot Coordination Algorithms to Implementation Details","version":1},"reference_index":117,"source":"arxiv_source","source_observed_at":"2026-08-05T15:25:39.829506Z"},"links":{"cited_paper":"/paper/2505.22442","citing_paper":"/paper/2608.03644"},"observation_digest":"sha256:8fdefa3eeb707efaf0702707ec0500c1b987c2a981a477b95845a7236cb5621e","observation_id":"00b3f2c1-259b-40d1-9384-9e49144431e9","resolution":{"observed_at":"2026-08-05T15:25:39.829506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22442/citation-record","integrity":"/paper/2505.22442/integrity","json":"/paper/2505.22442/citation-record.json","paper":"/paper/2505.22442"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"stable/2335509","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:09.332000Z","title":"Aitchison","venue":null,"work_id":"bb40ac82-c6ff-4f24-a2ce-0eab62914a8c","year":1975},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:57.315944Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:4288c87d0a35d0300cff361ca86045750dd6b320f610b313a61ff6d675c6b7aa","observation_id":"7f4fa7dd-2576-4833-918f-082dad491144","resolution":{"observed_at":"2026-08-07T13:16:09.424246Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2018.28482","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:08.904488Z","title":"Alaa and Mihaela van der Schaar","venue":null,"work_id":"ecb187b7-75d5-4a94-8637-07951c5c502f","year":2018},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:57.356190Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:1e2a3e76482b460ba23bc0d447096d68d5bf51fe82b88a6116aa0ae16ffd01cb","observation_id":"aa23fa33-78ea-43be-ad09-ec04a2ec318a","resolution":{"observed_at":"2026-08-07T13:16:09.081121Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:57.413976Z","title":"Uncertainty-based offline reinforcement learning with diversified q-ensemble","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:57.413976Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:e4c2c90a93630f1e098d7b1fbf5f545f9851e63ce1ad718494a907e8fe3dc77e","observation_id":"faa3004a-74fb-466a-b59d-28e8b50b6332","resolution":{"observed_at":"2026-08-07T13:15:57.413976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:57.474090Z","title":"Asymptotically minimax bayes predictive densities.The Annals of Statistics, 34(6):2921–2938, 2006","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:57.474090Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:3d6541d4b2b1c240c873f89560700657d55d524489fba50a15f8889ef7a37fe0","observation_id":"3ad69933-f655-4d69-8dee-5f498d7ff47c","resolution":{"observed_at":"2026-08-07T13:15:57.474090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:57.536060Z","title":"Augmented world models facilitate zero-shot dynamics generalization from a single offline environment","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:57.536060Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:53279ddb823255a91ae555050935f008eec703bcd8c4629f02edf3b96b96018a","observation_id":"02430707-3cef-41eb-acea-41eedfcd62cc","resolution":{"observed_at":"2026-08-07T13:15:57.536060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:21.137264Z","title":"Information-theoretic characterization of bayes performance and the choice of priors in parametric and nonparametric problems","venue":null,"work_id":"d82b5eaf-4971-4a8a-bba2-e1348ef3d50e","year":1998},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:57.590263Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:a34062c0098fcb7c0042d447236ca7a53a63f6448766901583c855b6d8cbe445","observation_id":"b48111ec-9df1-470f-b256-4122791e1c06","resolution":{"observed_at":"2026-08-07T13:16:21.255216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.917214Z","title":"Barron.The Exponential Convergence of Posterior Probabilities with Implications for Bayes Estimators of Density Functions","venue":null,"work_id":"b159d467-5c04-4406-a744-56abfed36776","year":1988},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:57.757860Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:31cdc65797bfd7a7c34ba49546958ee8825703f8d43023aa5f55c74880352346","observation_id":"ab150b87-375f-4aca-b853-765cb9f73e2f","resolution":{"observed_at":"2026-08-07T13:16:20.989180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.729392Z","title":"Bass.Real Analysis for Graduate Students, chapter 21","venue":null,"work_id":"94a13861-4868-49a8-90da-abae6f545db7","year":null},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:57.822068Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:38498773d00483385f1ced6658436097319a3f73e5324e92b14559c3f2e6b831","observation_id":"d16ea67a-4b7d-4dcf-83cb-b64d4ddd1675","resolution":{"observed_at":"2026-08-07T13:16:20.820274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08028","last_updated":"2025-05-29T14:17:01Z","snapshot_observed_at":"2026-08-06T07:16:48.853653Z","submitted_at":"2023-01-19T12:01:41Z","title":"A Tutorial on Meta-Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08028","snapshot_observed_at":"2026-08-07T13:15:57.942175Z","title":"A survey of meta-reinforcement learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:57.942175Z"},"links":{"cited_paper":"/paper/2301.08028","citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:ba84e251aa96ab08db4fa3cf51d2f2fa6077e062c6feb877d06444cf5bfb5bf0","observation_id":"14fff60b-933b-4eff-8483-c0f9dc237f61","resolution":{"observed_at":"2026-08-07T13:15:57.942175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"stable/2504827","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:08.290104Z","title":"A problem in the sequential design of experiments.Sankhy ¯a: The Indian Journal of Statistics (1933-1960), 16(3/4):221–229, 1956","venue":null,"work_id":"4006ff56-b21e-4066-8931-a81faf79e510","year":1933},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.001783Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:013c1c61c1d0ebca41186c116bc1d5fa3c135689caf6c00c350f215abfb07731","observation_id":"c275b9b1-b9bd-4ad5-a6de-e2c89d65fe86","resolution":{"observed_at":"2026-08-07T13:16:08.501815Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:58.052512Z","title":"Dynamic programming and stochastic control processes.Information and Control, 1(3):228–239, 1958","venue":null,"work_id":null,"year":1958},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.052512Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:160fc5f25c001d4c1e31650e2ac576985e3e9142d6e4225bce6b1b4081c75771","observation_id":"53dbe3be-d34e-4b8f-b8c4-eeae6d108a02","resolution":{"observed_at":"2026-08-07T13:15:58.052512Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.364163Z","title":"Foster, and Daniel M","venue":null,"work_id":"38ce90a8-a484-4da1-a41c-593f6b4cc931","year":2021},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.116894Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:a79cf15d852385673b971d50aee96617ab4ed4d494822b34fd3e8a987dbac3e3","observation_id":"ad5273c6-cfb0-4297-8b5b-d36395eea30e","resolution":{"observed_at":"2026-08-07T13:16:20.427736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:58.171525Z","title":"On the foundations of statistical inference.Journal of the American Statistical Association, 57(298):269–306, 1962","venue":null,"work_id":null,"year":1962},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.171525Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:fa4bfdf6f479ea089b252dd3e0b65d3f25488c03a0ca3e1f4859b2515a861933","observation_id":"3f3dade5-de7b-468d-8deb-ae49eabbfc43","resolution":{"observed_at":"2026-08-07T13:15:58.171525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.229703Z","title":null,"venue":null,"work_id":"b817ca3c-0067-4bb9-a8a5-932c419ff83d","year":1978},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.236104Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:9588deae6b4996f9bcc2e68a6bfdb1957008ce681366107120d8b775fe85f97e","observation_id":"50ccbea6-642b-4c41-abfb-6ccd7d75f62c","resolution":{"observed_at":"2026-08-07T13:16:20.279450Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.072411Z","title":"Bayes adaptive monte carlo tree search for of- fline model-based reinforcement learning, 2024","venue":null,"work_id":"2bcae4a6-2ff2-496f-b7de-e8fe23acf971","year":2024},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.297640Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:f77b7f2ca7e897906297292a26de389d8a4adbb81a414352ef69b81ebb6e080b","observation_id":"de0a4ee4-4b43-46b8-9c14-1c86432ce338","resolution":{"observed_at":"2026-08-07T13:16:20.135149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:19.867089Z","title":"Conser- vative uncertainty estimation by fitting prior networks","venue":null,"work_id":"6fd6d1e5-20bf-4618-821d-9a509e3b2f41","year":2020},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.372662Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:6f3f9eb3fec3cc108db4efe2ad8ed3bf409bfd066bb2236fbb3cc320b56a3aa7","observation_id":"cfe50663-3e99-4113-815f-551afb1c29ee","resolution":{"observed_at":"2026-08-07T13:16:19.983352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:19.649951Z","title":"Clarke and A.R","venue":null,"work_id":"d5fd4864-c8b4-4124-ab18-dbe2c39e642f","year":1990},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.448968Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:35d3454ea444183beab4bc67b2774c1bf7ec30c6b0682fcbdd270a1da231c0cc","observation_id":"016295ea-6bda-4420-99f2-2c9d7ae85950","resolution":{"observed_at":"2026-08-07T13:16:19.743980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0041.45101","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:07.846812Z","title":null,"venue":null,"work_id":"93ddcd37-1ee8-42d1-ac73-051400b25bc9","year":1949},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.500423Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:d771199315013d7715acfc6feeda1a7ab411a4ac64ce921fca57381ded94f4ee","observation_id":"4ba4c40f-40e6-47f5-a44a-23eb99b56a5f","resolution":{"observed_at":"2026-08-07T13:16:07.959162Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:19.441651Z","title":"Observation of a markov process through a noisy channel.PhD Thesis, 1962","venue":null,"work_id":"ea296458-e389-4ef0-a21d-799fb986ff93","year":1962},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.563857Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:0f34780ad6a304a52b00e8586322b7c50aab3321e5a06f4711f00ea57f0d6810","observation_id":"54158c56-5f57-431f-be73-7a763611224d","resolution":{"observed_at":"2026-08-07T13:16:19.551859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:19.220849Z","title":"Fast reinforcement learning via slow reinforcement learning","venue":null,"work_id":"8f2e96f3-6ec4-46cd-bd4e-dc5892af0785","year":1987},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.618468Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:a19ed97bb27ff5b068f2f85bc1f751f2d8201fb49c04e8795fc19c483227f4ad","observation_id":"d5475ef1-f8d4-4265-9802-3e75ba2d6176","resolution":{"observed_at":"2026-08-07T13:16:19.341391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:19.017153Z","title":"PhD thesis, 2002","venue":null,"work_id":"717211a5-c5e0-49b3-814c-7d9b2661ec97","year":2002},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.684957Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:9baf0aa27a57412b47f5b4083d0f7bada0b21a983e1ad045745d370960dc1b8a","observation_id":"fd95ba64-4cef-4f53-a399-142fcde22945","resolution":{"observed_at":"2026-08-07T13:16:19.101212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:18.843589Z","title":"Bayesian exploration networks","venue":null,"work_id":"6360d503-ad3f-4989-801c-4a5f162ba409","year":2024},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.801124Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:68de96d766583271d3c84ce7694a31460403d3449f2a8e7eef661b03a6b296ef","observation_id":"b34d3302-8720-46c0-88bf-8404861c1c57","resolution":{"observed_at":"2026-08-07T13:16:18.931137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:18.586491Z","title":"D4rl: Datasets for deep data-driven reinforcement learning, 2020","venue":null,"work_id":"6e3f2253-3a80-49c0-8084-4c1b6dea5e9d","year":2020},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.874936Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:492421229617c7ad68e5226a4233d53c37ef8a2f27ee39345a9bca6793dae476","observation_id":"af8f42f6-eebf-41e4-a8ed-29b0c9113c05","resolution":{"observed_at":"2026-08-07T13:16:18.703635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:18.358105Z","title":"A minimalist approach to offline reinforcement learn- ing","venue":null,"work_id":"e660881a-5c4b-4a21-a692-00be526b5f2b","year":2021},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.962879Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:0e8f47950bec0d493b1f52067036e203018a97bb3c0b7bb63109635c1583197d","observation_id":"37eca544-1166-4b74-b6d2-90890599c766","resolution":{"observed_at":"2026-08-07T13:16:18.497264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/bjps/axt039","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:06.253954Z","title":"A new proof of the likelihood principle.The British Journal for the Philosophy of Science, 66(3):475–503, 2015","venue":null,"work_id":"bd565944-385f-45c4-983a-f14ad907a873","year":2015},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:59.057545Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:301b2b53e635069ba91514ef9fd59716fb65ef0a9dc0aba2487f7e6630e48895","observation_id":"b819815a-87ac-40bc-8d62-8771f3c71ef1","resolution":{"observed_at":"2026-08-07T13:16:06.339819Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:18.120553Z","title":"Efficient bayes-adaptive reinforcement learn- ing using sample-based search","venue":null,"work_id":"8cb22b59-929d-493a-93ee-98b153c3741d","year":2012},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:59.158171Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:32625d31526e2d9d8471c72d175c26b9f95698fb1a1cf087a4e481c71a3d0a54","observation_id":"ef74a39f-c140-461e-9299-238a9cacd29d","resolution":{"observed_at":"2026-08-07T13:16:18.234691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1613/jair.4117","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:06.011283Z","title":"Scalable and efficient bayes-adaptive reinforcement learning based on monte-carlo tree search.Journal of Artificial Intelligence Research, 48:841– 883, 10 2013","venue":null,"work_id":"a702c269-a083-4947-a1b9-b3aedfe46286","year":2013},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:59.266350Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:ed5b9c2eb97484b11d169fdc28f5b344e53c93a59469d06d779ff3e9541a3bdc","observation_id":"66c454f4-a472-49ce-9f75-be6bfcf5830a","resolution":{"observed_at":"2026-08-07T13:16:06.134303Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.933779Z","title":"Bayes-adaptive simulation-based search with value function approximation","venue":null,"work_id":"2c38580d-95ef-4e97-91f4-463fd0ec12c7","year":2014},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:59.378247Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:8bbab09f43b6d342095c595a0386b602f525f70e0e21e791d1cee93a31459deb","observation_id":"5ae9635e-e761-4966-9f5c-475929cbdaa3","resolution":{"observed_at":"2026-08-07T13:16:18.029970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.685188Z","title":null,"venue":null,"work_id":"c31cc647-c719-4708-b19d-32b92f2df5e9","year":1998},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:59.456794Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:58f930cdf32af4a55233a1bd69df17e284aa12c10b8a2e38a036a25aacc5752c","observation_id":"0bf909f1-3bb1-4868-9454-17edfad43c83","resolution":{"observed_at":"2026-08-07T13:16:17.800520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11453","last_updated":"2025-04-15T17:59:05Z","snapshot_observed_at":"2026-08-07T16:02:04.620546Z","submitted_at":"2025-04-15T17:59:05Z","title":"A Clean Slate for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11453","snapshot_observed_at":"2026-08-07T13:15:59.584911Z","title":"A clean slate for offline reinforcement learning.arXiv preprint arXiv:2504.11453,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:59.584911Z"},"links":{"cited_paper":"/paper/2504.11453","citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:c5ad76453fee4b3814b720c188ac50fe2c5f7e7529485112f22dffb752d4a7b9","observation_id":"9d4a2e4d-9dec-438c-8374-ef6516ec5cf1","resolution":{"observed_at":"2026-08-07T13:15:59.584911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.367419Z","title":"Relu to the rescue: Improve your on-policy actor-critic with positive advantages","venue":null,"work_id":"4cedf99b-41d0-4518-97b6-6ff31ce56792","year":2024},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:59.840841Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:66a691bae8a5b4165721756eeb063098f7c98d6a65ce3104816006345d40461e","observation_id":"cea3e1a3-04be-4a0e-b586-9593314cd513","resolution":{"observed_at":"2026-08-07T13:16:17.425672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.177348Z","title":"Littman, and Anthony R","venue":null,"work_id":"69afb3d8-2814-40b7-bb8e-d08bd4355241","year":1998},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:59.939273Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:86eb8f6d97111f23c506551ac9ce41135f2a8f13f5a25936c03bad60787f05fe","observation_id":"3d7c401b-dbee-484d-97e6-317c68901b68","resolution":{"observed_at":"2026-08-07T13:16:17.259390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.017044Z","title":"The validity of posterior expansions based on laplace’s method.Bayesian and Likelihood Methods in Statistics and Economics, pages 473–488, 1990","venue":null,"work_id":"bf739748-0a07-4bdf-a566-395f545b134e","year":1990},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:00.030618Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:2bd4c2273258a85cda9708bb2ec48359c0449f8482a91d4dbdc07f269303cc2d","observation_id":"c8b21251-6035-4794-b409-1b41bf81643a","resolution":{"observed_at":"2026-08-07T13:16:17.095540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:16.857080Z","title":"Morel: Model-based offline reinforcement learning","venue":null,"work_id":"575780dc-2e6a-4859-ab11-c5a4b4ec009c","year":2020},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:00.149839Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:57dada42f72bcaa251e0266b3998671178bf409cf4695bbd19dfb8347dc28d0d","observation_id":"5f93167a-8333-4b84-9aa6-02e28e1791d0","resolution":{"observed_at":"2026-08-07T13:16:16.938047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T13:16:00.249033Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:00.249033Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:a29c7ae718cb2a9aa6117b907f7ad43863c53c696852df1b90fa90b97c5c5d88","observation_id":"b1048332-956b-40ae-97f3-948b0f060334","resolution":{"observed_at":"2026-08-07T13:16:00.249033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:00.328567Z","title":"Kleijn and A.W","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:00.328567Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:b35e59eda34c3abd56a3e858d66ad60979fdea7959d104d8442b3fc763e9b99e","observation_id":"07d239ca-ddc3-4b44-bd0a-7fa83874c750","resolution":{"observed_at":"2026-08-07T13:16:00.328567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/biomet/83.2.299","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:05.825457Z","title":"On asymptotic properties of predictive distributions.Biometrika, 83(2):299–313, 06 1996","venue":null,"work_id":"dbeeb08e-9eee-4d3d-9e82-3bfcf4cc834c","year":1996},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:00.414859Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:aad20dca7cb80583b68729501b3cfc3d2625c087a75901ef7bb4dcf56cbb20dc","observation_id":"60336ccb-c3d8-410e-b70c-1f30de21c1e6","resolution":{"observed_at":"2026-08-07T13:16:05.898060Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-07T13:16:00.532185Z","title":"Offline reinforcement learning with implicit q- learning.CoRR, abs/2110.06169, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:00.532185Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:86d6197eec9c28ed503c4dc3f5cc73caf80fd9a9eaaf92399372793b50633993","observation_id":"5a7d85c1-7902-4a0e-b581-c368ca353447","resolution":{"observed_at":"2026-08-07T13:16:00.532185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:16.647572Z","title":null,"venue":null,"work_id":"70246450-43f5-4544-a229-4d9c6241d9cf","year":null},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:00.631981Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:f6bae83611b506306a7b3e3b5897e7bedd6bf3865d5a94cb5f4665afe1b26dd3","observation_id":"30ecba1b-69b7-4d9b-858a-2f4e7484e894","resolution":{"observed_at":"2026-08-07T13:16:16.756648Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:16.476937Z","title":"Conserva- tive q-learning for offline reinforcement learning","venue":null,"work_id":"720aed21-bde5-4c1a-8408-1edf9b54eef7","year":2020},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:00.720547Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:ad118b9fb1c2ff2e61a822d87f1d6028d70bc970ed716699a858100c61a61f3a","observation_id":"ffe6b090-67c1-4b10-80c7-98f457a65e28","resolution":{"observed_at":"2026-08-07T13:16:16.535991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-642-27645-3_2","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:05.638263Z","title":"Springer Berlin Heidelberg, Berlin, Heidelberg, 2012","venue":null,"work_id":"79333aa0-ec6b-466c-afb9-bab560fe5987","year":2012},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:00.803761Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:45caf5e6a9ded1ecc873977cfb12995d643d9f391270d51db76b5e89ba9a0362","observation_id":"ca65e117-c96a-4482-946a-1488ab71b6ce","resolution":{"observed_at":"2026-08-07T13:16:05.713211Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:16.283113Z","title":"On some asymptotic properties of maximum likelihood estimates and related bayes’ estimates","venue":null,"work_id":"1e73eeb4-d8bb-4964-925b-ec604aac9a1f","year":1953},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:00.913603Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:9c45fcd5c5f22602abb93b9fa99aad39587eb9bfdcf56a481bba333207195ee7","observation_id":"59003146-ce29-4e1a-b6de-9a5eeb746557","resolution":{"observed_at":"2026-08-07T13:16:16.367331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:16.094506Z","title":"Efficient backprop","venue":null,"work_id":"31bb36b9-919a-4ca4-9ac7-415669b558d2","year":1998},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:01.009737Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:8e53c16c20b9e98d498e884a72cb865f6cd26d5d37e6d3267bfa13e7c9cb2bec","observation_id":"c3b51491-c4f4-492e-853b-98679cf6c568","resolution":{"observed_at":"2026-08-07T13:16:16.174298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T13:16:01.099532Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:01.099532Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:98e3849b1f2b34b9961f2feb46b193ddf54e941ba75b01dc0acf70babd87a7ee","observation_id":"f588b94a-fc8f-49ea-8df6-56381841e2ab","resolution":{"observed_at":"2026-08-07T13:16:01.099532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:15.913706Z","title":null,"venue":null,"work_id":"30505215-061b-470a-9fa4-96dae83b1c30","year":1980},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:01.205003Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:2997468e3ed8e9cbd4249b89628b55baaf1c3d934031fc4a2169796fa837e406","observation_id":"763cabbd-dca8-4f36-9bd2-80503a8a572c","resolution":{"observed_at":"2026-08-07T13:16:15.993087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:15.812492Z","title":"Discovered policy optimisation.Advances in Neural Information Processing Systems, 35:16455–16468, 2022","venue":null,"work_id":"fd334c5f-8447-462b-8276-b5015c5e4911","year":2022},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:01.369676Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:28c6165a3cfd6a94ec853cd95b18be633cff7b1d01b545221e8f5fd41eda7770","observation_id":"7f2bc730-51c6-4fd0-bd3b-dfa8cec553e6","resolution":{"observed_at":"2026-08-07T13:16:15.846851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:15.679801Z","title":null,"venue":null,"work_id":"d6366746-fc02-43d7-b262-8ed970d150ca","year":2022},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:01.541553Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:54af6e3f694ae7f79c8cf99ecfbd6d31eec93786ccbd12554086af025d96ca3b","observation_id":"c8edee02-d5e4-4aca-8ff9-e8d4973c8c16","resolution":{"observed_at":"2026-08-07T13:16:15.734238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:15.476993Z","title":null,"venue":null,"work_id":"a492b231-5438-4b82-a493-667556fbb8f6","year":null},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:01.622269Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:3db7d5fc26bf56017967404f96447473442fd1f22a599e04da9651ddad668d3a","observation_id":"0efa23b4-2053-4f0e-bc2e-4046f7604aa4","resolution":{"observed_at":"2026-08-07T13:16:15.552146Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:01.713071Z","title":"Reinforcement learning: An overview, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:01.713071Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:6a6c58ea7e3796947f87a99c837c7863deacdb19aa3587748a8726be18e57d9f","observation_id":"109b40e2-9355-43a8-919c-180a8a979deb","resolution":{"observed_at":"2026-08-07T13:16:01.713071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:15.154634Z","title":null,"venue":null,"work_id":"59b90bb9-94e7-4786-a7b0-fee36c621515","year":null},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:01.806401Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:9dc407153f7638cab5ebdd6b39ef4e84aea8b4008865fbbba168bdab82b5500e","observation_id":"faa5c574-0182-4877-94e7-37959d84b22d","resolution":{"observed_at":"2026-08-07T13:16:15.280859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:14.920341Z","title":"Randomized prior functions for deep reinforcement learning","venue":null,"work_id":"cf7c7d09-de1b-467b-9b3f-fa6e5d29c4ee","year":null},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:01.878513Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:bf09ab3a7f2f7f3041ddc5b5fd62877f0ba138176902c8e697f0fb1ba63c7486","observation_id":"5ad12ac9-c509-4e25-b824-4f25a4667b3f","resolution":{"observed_at":"2026-08-07T13:16:15.019714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.09055","last_updated":"2020-07-17T15:30:38Z","snapshot_observed_at":"2026-08-02T00:32:54.352911Z","submitted_at":"2020-07-17T15:30:38Z","title":"Hyperparameter Selection for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.09055","snapshot_observed_at":"2026-08-07T13:16:02.204750Z","title":"Hyperparameter selection for offline reinforcement learning.CoRR, abs/2007.09055, 2020","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:02.204750Z"},"links":{"cited_paper":"/paper/2007.09055","citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:d0058761f6b90a8bf2ee0eb566ce64dd2b99625ce29f9499ac5d7461083685ab","observation_id":"3f69e0b2-8fea-4d05-92fa-65b796d5717b","resolution":{"observed_at":"2026-08-07T13:16:02.204750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:14.380815Z","title":null,"venue":null,"work_id":"9071b8a3-d90d-4e0a-9fe1-8c9e6a0ea02e","year":2012},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:02.297041Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:e02a4c1617255ace529011e4fda3501f29f036e38353b6f2f8ac3f94274bc661","observation_id":"3cdb724d-205c-4577-bfcf-229b3a585e22","resolution":{"observed_at":"2026-08-07T13:16:14.501296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:14.136991Z","title":"Puterman.Markov Decision Processes: Discrete Stochastic Dynamic Programming","venue":null,"work_id":"a7c18587-c0f8-4184-a712-39cac5a791bb","year":1994},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:02.466920Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:dd42ff4afc6ed0c51c7fa14e6aba59c45a43e7757a912349ddeaf426028e5453","observation_id":"01135a97-f1f5-4186-8595-cbb430cf666a","resolution":{"observed_at":"2026-08-07T13:16:14.254455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:13.864099Z","title":null,"venue":null,"work_id":"d4916bba-70ba-46b3-88ff-913ca5c4d0c6","year":2006},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:02.570369Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:ef0402d63ec055520fa705596c86d51b5042a68c80b2445abc92108271906150","observation_id":"d3db7484-5096-47a1-8f1d-99d7ad8a2b2e","resolution":{"observed_at":"2026-08-07T13:16:13.976552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:02.646018Z","title":"Roberts and Jeffrey S","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:02.646018Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:b20081cc2ae0147a76178f6ada8f22e282bc6498499e10f80ad3e849f94eab25","observation_id":"a6c1a408-8b9c-43d6-aae5-a7adf262494e","resolution":{"observed_at":"2026-08-07T13:16:02.646018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T13:16:02.763290Z","title":"Proximal policy optimization algorithms.CoRR, abs/1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:02.763290Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:a34212ffa48e94f422ff0e355e9ea8ec1e1dfac8966b8f4918ef39596dac8400","observation_id":"6548a700-b2b2-4587-8ecf-bf30c365eb12","resolution":{"observed_at":"2026-08-07T13:16:02.763290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:13.603728Z","title":"The edge-of-reach problem in offline model-based reinforcement learning","venue":null,"work_id":"91c8e017-a436-4702-825d-5eff6bca8223","year":2024},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:02.940355Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:4804b61e85a547a94958aa79fba97d873f2cd366f51e15843ec7169cc3e1945d","observation_id":"c9630eac-592d-458e-962e-7de77b2b2c11","resolution":{"observed_at":"2026-08-07T13:16:13.702817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:13.360716Z","title":"Smallwood and Edward J","venue":null,"work_id":"99b017a4-eba1-4043-b581-eb60035afaba","year":1973},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:03.098532Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:0a91c6a3fb9b4fa6c7941e31ee88bf7ae7dac6731bc5c06b7d6bf27d973919ae","observation_id":"a4892ae3-3add-4651-956c-4ebe72a9e2f7","resolution":{"observed_at":"2026-08-07T13:16:13.474924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.02788","last_updated":"2023-02-06T14:03:33Z","snapshot_observed_at":"2026-07-06T14:48:48.392279Z","submitted_at":"2023-02-06T14:03:33Z","title":"A Strong Baseline for Batch Imitation Learning","version":1},"cited_work":{"arxiv_id":"2302.02788","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.02788","snapshot_observed_at":"2026-08-07T13:16:07.095903Z","title":"A Strong Baseline for Batch Imitation Learning","venue":"cs.LG","work_id":"1d048c0b-d647-45c7-893c-8538dd7c3e00","year":2023},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:03.231306Z"},"links":{"cited_paper":"/paper/2302.02788","citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:8379b4c0911035f9e203f7a3a02c454c210ef16deb8cbf106e1f6515a61bc562","observation_id":"3dbaf9de-ba74-42ea-a427-5573b308c687","resolution":{"observed_at":"2026-08-07T13:16:07.261939Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:13.156502Z","title":"Sriperumbudur, Kenji Fukumizu, Arthur Gretton, Bernhard Scholkopf, and Gert R","venue":null,"work_id":"d8887514-443a-4f5c-9526-4de7a57a7326","year":2009},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:03.346225Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:d71aff457499c0fc1a474149c7bad9eb88af093f968bd080773f04afc5f49faf","observation_id":"47b7cc56-f8b3-4513-a944-01b1baf5d6da","resolution":{"observed_at":"2026-08-07T13:16:13.245354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:12.988121Z","title":"Model-Bellman inconsistency for model-based offline reinforcement learning","venue":null,"work_id":"51d05278-4be0-46e1-a5be-7c4e64a94a69","year":2023},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:03.495666Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:12330f03251743a18e3fde6de98b3394976b3c177d9344df0909276ea124fc20","observation_id":"9d4ce3f3-a4e3-43ae-9e00-b4997b3e5697","resolution":{"observed_at":"2026-08-07T13:16:13.080447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:12.754496Z","title":"Sutton and Andrew G","venue":null,"work_id":"eeba071f-6ba6-493d-b660-639e3ccc0a3d","year":2018},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:03.611536Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:3ffcaf601a10529da0fb3cd63032d7dcb4e04e6fcba50324f016b3bfda1dcc12","observation_id":"6f3323e5-478d-4efc-99b4-5fca93c0204d","resolution":{"observed_at":"2026-08-07T13:16:12.860042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2200/s00268ed1v01y201005aim009","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:05.475713Z","title":"Algorithms for Reinforcement Learning.Synthesis Lectures on Artificial Intelligence and Machine Learning, 4(1):1–103, 2010","venue":null,"work_id":"2d52417c-7971-4839-afa0-bf87ff7e169c","year":2010},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:03.712384Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:aaa473ce0dd9e1b916ad800fb05506831a27e633913f2442dc85428474a6abe6","observation_id":"00410bc4-e85a-44a8-81b3-59f65070875b","resolution":{"observed_at":"2026-08-07T13:16:05.532252Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:12.572146Z","title":"Revisiting the minimalist approach to offline reinforcement learning","venue":null,"work_id":"bb91b20b-0fa8-47b1-9c3e-be875c16aa28","year":2023},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:03.845273Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:345c9bcb563ece6ada5960844b378d351f08a47902a7fe38fa3016cf061a9e8a","observation_id":"148591fc-2b94-4a6b-95e3-f4149d0dd418","resolution":{"observed_at":"2026-08-07T13:16:12.677528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:12.267721Z","title":null,"venue":null,"work_id":"04ebbe5e-a2bb-4a12-985f-2aa999fd4f32","year":1986},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:03.993853Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:6793f23cf8fab2d678730e2f56e37cf4c0c0189a33b2bfac11179a7e282151a7","observation_id":"3f1d74b1-20f4-4f2d-b848-9d4d2ddcc294","resolution":{"observed_at":"2026-08-07T13:16:12.382724Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:11.966271Z","title":"Kass, and Joseph B","venue":null,"work_id":"0e91098f-e524-4acd-b943-2f4a0d40cde3","year":1989},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:04.077806Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:c0dcc78232c6d208b7e37795cbe95cacf922ba6324c1dfca19a1d30b16c1cf1f","observation_id":"2c8874e2-5f69-48de-8f6f-a726461790cb","resolution":{"observed_at":"2026-08-07T13:16:12.102869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1017/cbo9780511802256.011","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:05.306733Z","title":null,"venue":null,"work_id":"d397448e-3cac-47bc-a723-787d346d1269","year":1998},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:04.164651Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:cb0c894773924ac425b22f3b09ebc3a82d1f25d77235476abfe47e927a8c8fd8","observation_id":"52eacba7-dd3b-435e-9019-4de3411263b5","resolution":{"observed_at":"2026-08-07T13:16:05.370696Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:11.554238Z","title":"Information rates of nonparametric gaussian process methods.J","venue":null,"work_id":"40101a6c-a184-4de3-ba6f-dc56c2a5c45e","year":2011},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:04.247779Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:30684fac5bcdf97501f9d3f0f2ecdeb14177845b52d80ffff05a6273cf0c5cc9","observation_id":"200ba08e-31ef-46ab-9499-8a18109ff2ee","resolution":{"observed_at":"2026-08-07T13:16:11.719273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:11.087066Z","title":"No more pesky hyperparameters: Offline hyperparameter tuning for RL.Transactions on Machine Learning Research, 2022","venue":null,"work_id":"1a6e58ff-d04a-483a-b8b4-9b20ac714cb9","year":2022},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:04.382384Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:baadf69385eb1e95b85a5b5769be2c38078c2279573454c7dffd0e4e1f062390","observation_id":"a5ff4e8f-5141-4868-a201-40cd77bbf3f9","resolution":{"observed_at":"2026-08-07T13:16:11.312056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:10.751079Z","title":"Foster, and Sham M","venue":null,"work_id":"df4d8111-8f84-45a5-b43b-3a2723ce571a","year":2020},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:04.503412Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:f8da6845c5790d48f58a809a3af6ebec2a46e639dde198728d2d64cf5b80b219","observation_id":"6db256f6-ee66-49ff-94bc-74333915930d","resolution":{"observed_at":"2026-08-07T13:16:10.928204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:04.598127Z","title":"Differential-space.Journal of Mathematics and Physics, 2(1-4):131–174, 1923","venue":null,"work_id":null,"year":1923},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:04.598127Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:4e2f3c40c3eced4b30a09df815c33ddb883fe2b2379223a0bceb20243c6bccfe","observation_id":"377f2112-f27e-47e5-b138-44b928cd80b0","resolution":{"observed_at":"2026-08-07T13:16:04.598127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:04.682823Z","title":"Information-theoretic determination of minimax rates of convergence.The Annals of Statistics, 27(5):1564 – 1599, 1999","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:04.682823Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:bd5f52d48b2d3f1631b5b7849d3b3743f6fe069943a90be7b5fbbabd2a6228f3","observation_id":"d1f9866b-e8e5-4644-b4b1-5d10a190d644","resolution":{"observed_at":"2026-08-07T13:16:04.682823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:10.432078Z","title":"Mopo: Model-based offline policy optimization","venue":null,"work_id":"6f221632-5c37-4c00-aec8-20b4b1c81ee4","year":2020},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:04.761857Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:52014da0720677e7290d490b0a1fbf9523565fedb2baba7288e2ffb76d0d0d79","observation_id":"32d5bb05-0908-42bb-9fad-fc95a8b99a71","resolution":{"observed_at":"2026-08-07T13:16:10.584652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:10.126288Z","title":"Combo: Conservative offline model-based policy optimization","venue":null,"work_id":"29d6ce2f-43e7-4792-8021-9adcf6efa435","year":2021},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:04.859926Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:26cbeab70396b4d7658a2ac5324f24abee571cb06fef9cd0503416fa3140a843","observation_id":"c848b3c1-b773-4246-9597-50e98808cd6f","resolution":{"observed_at":"2026-08-07T13:16:10.295053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:09.857121Z","title":"On the importance of hyperparameter optimization for model-based reinforcement learning","venue":null,"work_id":"e0d323e8-7ed1-4e27-ae5a-ecf63566cbb7","year":2021},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:04.932417Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:5ec50e3cb60f7cf6d6045e78370c836cde8393a15716dc72b196a0c6e1b7421e","observation_id":"d95966f2-0215-4863-a16c-934f6f31a520","resolution":{"observed_at":"2026-08-07T13:16:09.953911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:09.611955Z","title":"Varibad: A very good method for bayes-adaptive deep rl via meta- learning","venue":null,"work_id":"ead35739-d696-4adf-a1e8-8e11ebf8e03f","year":2020},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:05.017057Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:43521b52bb8935a3199994f901222638cd42870bb4456423b410be36d4f09e67","observation_id":"01f6eb3b-010c-4d61-ab64-ee67d6026ba2","resolution":{"observed_at":"2026-08-07T13:16:09.714445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"files/5323668","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:06.793023Z","title":"N−1X i=0 1 N D 2 log(2π) + 1 2 D−1X d=0 logσ 2 θd (xi) + (yid −µ θd (xi))2 σ2 θd (xi) !!# , =Ei∼UN","venue":null,"work_id":"795cfc02-6d1d-45dc-bdfa-0acd94ac1881","year":1965},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:05.082852Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:c15bcd9f46dcec5ac845c447119e15ac447ad3e1e4212335d40e2882ea32d621","observation_id":"e4a4b1c3-7783-4bf3-86a2-7dba28d76125","resolution":{"observed_at":"2026-08-07T13:16:06.856195Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3970.0700","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:06.532305Z","title":"Eθ∼PΘ(DN )","venue":null,"work_id":"eb4ccb72-791c-454f-82f8-9a5bbf508f38","year":null},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:05.159203Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:407c8b6bbda5850a8451ab424a75f9073c52c48eabd669ef2c3943af825a9eb4","observation_id":"584f4e18-5a1d-4826-9888-eb69dfcfea54","resolution":{"observed_at":"2026-08-07T13:16:06.605584Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:57.660083Z","title":"doi: 10.1093/oso/9780198504856.003.0002","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:57.660083Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:0a45f8db76b3ba544d38dc436de64d58514ecedadb2681e45b8ddefbe18351c0","observation_id":"d995e4c3-886c-44f7-9c7a-9ca3fbf81918","resolution":{"observed_at":"2026-08-07T13:15:57.660083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.534970Z","title":"URL https://books.google.co.uk/books?id= s6mVlgEACAAJ","venue":null,"work_id":"0840bc97-8866-4430-b4b4-1d6bc116f8d1","year":null},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:57.884088Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:44db94736731563bd6b9bdace34f24ae6703c705a3b84cfa2836fe0505d03bac","observation_id":"aa4e3f11-d59b-4bd4-a552-fd3592fb27fd","resolution":{"observed_at":"2026-08-07T13:16:20.621497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.526852Z","title":null,"venue":null,"work_id":"6e5ee6d1-f0b2-41a7-9eb6-b48881bcfcc4","year":null},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:59.744897Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:7b76cce14d51d7cfb8d0403fbf6bce17023390ec5c5204861dbe1c58da0a9590","observation_id":"1e434d6f-04c0-42fb-b1dc-edaa8c4dbd63","resolution":{"observed_at":"2026-08-07T13:16:17.599212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:14.613646Z","title":"URL http://papers.nips.cc/paper/8080- randomized-prior-functions-for-deep-reinforcement-learning.pdf","venue":null,"work_id":"9099fa13-f193-42ef-be0b-e1afb00421a0","year":2018},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":8629,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:02.029997Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:85cba5ca88f2507ec8853597c37a5cf6118c1321c2b835b6b4b6a0da36a8def6","observation_id":"8c85133c-fff4-4179-b7a6-273632e7103f","resolution":{"observed_at":"2026-08-07T13:16:14.762978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T13:04:48.525626Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":28,"verified_exact":11,"verified_fuzzy":41},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 2 inbound Pith citation observations for arXiv:2505.22442."}