{"as_of":"2026-08-09T08:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1ded16ca81d6297a246e69725683f7871a9bb10952bd5d51f0f5b3a25a8d55bb","coverage":[{"denominator":95,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":95,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:59:15.652640Z","state":"measured"},{"denominator":98,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":98,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T11:18:08.362562Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T11:24:38.227917Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"cited_work":{"arxiv_id":"2506.09270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09270","snapshot_observed_at":"2026-06-30T11:24:38.227917Z","title":"Uncertainty prioritized experience replay","venue":null,"work_id":"b5887c5c-1787-4e2a-9558-1dc47ae920b5","year":2025},"citing_paper":{"arxiv_id":"2604.13038","last_updated":"2026-02-20T19:46:19Z","snapshot_observed_at":"2026-07-06T23:01:10.333101Z","submitted_at":"2026-02-20T19:46:19Z","title":"Uncertainty-Weighted Experience Replay for Continual MIMO Channel Prediction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T20:27:25.479441Z"},"links":{"cited_paper":"/paper/2506.09270","citing_paper":"/paper/2604.13038"},"observation_digest":"sha256:7b0d66056b9db88d50bc2b0fa099e08b9ac056e02294b3220c26ef8716f01154","observation_id":"b9ef21d5-c932-462b-9dc2-18f73979296e","resolution":{"observed_at":"2026-05-15T20:30:17.954480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"cited_work":{"arxiv_id":"2506.09270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09270","snapshot_observed_at":"2026-06-30T11:24:38.227917Z","title":"Uncertainty prioritized experience replay","venue":null,"work_id":"b5887c5c-1787-4e2a-9558-1dc47ae920b5","year":2025},"citing_paper":{"arxiv_id":"2605.26627","last_updated":"2026-06-29T01:38:50Z","snapshot_observed_at":"2026-08-06T09:41:59.955137Z","submitted_at":"2026-05-26T07:03:26Z","title":"Breaking the Epistemic Trap: Active Perception Under Compound Uncertainty","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T16:08:23.588699Z"},"links":{"cited_paper":"/paper/2506.09270","citing_paper":"/paper/2605.26627"},"observation_digest":"sha256:3df91c1f804da5fffaeccb9f027af96653bff59d401d864c544899dff7f1eb70","observation_id":"23818c03-489d-4949-860d-6c99cabee30d","resolution":{"observed_at":"2026-06-29T16:13:36.100526Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"cited_work":{"arxiv_id":"2506.09270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09270","snapshot_observed_at":"2026-06-30T11:24:38.227917Z","title":"Uncertainty prioritized experience replay","venue":null,"work_id":"b5887c5c-1787-4e2a-9558-1dc47ae920b5","year":2025},"citing_paper":{"arxiv_id":"2605.26627","last_updated":"2026-06-29T01:38:50Z","snapshot_observed_at":"2026-08-06T09:41:59.955137Z","submitted_at":"2026-05-26T07:03:26Z","title":"Breaking the Epistemic Trap: Active Perception Under Compound Uncertainty","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T11:18:08.362562Z"},"links":{"cited_paper":"/paper/2506.09270","citing_paper":"/paper/2605.26627"},"observation_digest":"sha256:5932e37fb4c4eb2b7c9d6ed3a98063046830090581f98f401b1678698386ce18","observation_id":"8acf85ba-a541-46aa-8b22-6d6d390b0119","resolution":{"observed_at":"2026-06-30T11:24:38.229256Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09270/citation-record","integrity":"/paper/2506.09270/integrity","json":"/paper/2506.09270/citation-record.json","paper":"/paper/2506.09270"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2210.02585","last_updated":"2022-10-05T22:25:15Z","snapshot_observed_at":"2026-08-09T06:53:44.859450Z","submitted_at":"2022-10-05T22:25:15Z","title":"Query The Agent: Improving sample efficiency through epistemic uncertainty estimation","version":1},"cited_work":{"arxiv_id":"2210.02585","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.02585","snapshot_observed_at":"2026-08-07T04:59:19.560029Z","title":"Query The Agent: Improving sample efficiency through epistemic uncertainty estimation","venue":"cs.LG","work_id":"d5f455dc-e2bc-478c-a04b-722ded6a2e6d","year":2022},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:04.530922Z"},"links":{"cited_paper":"/paper/2210.02585","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:1dcf0b039773672dfb78c3d6c0a6bdcf74f7409ed3da141796d476b0fe2971dc","observation_id":"fb97e573-b264-4fcd-845c-bd546b4467e0","resolution":{"observed_at":"2026-08-07T04:59:19.654545Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:04.569792Z","title":"Hindsight Experience Replay","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:04.569792Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:61a57786afe3bb091023190493a2aa28781ec1122bc62a18cdc0b2c89effd448","observation_id":"a7bcd771-d342-46ff-b504-5a4df1915a15","resolution":{"observed_at":"2026-08-07T04:59:04.569792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1371/journal.pcbi.1009634","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:17.079671Z","title":"Optimism and pessimism in optimised replay","venue":null,"work_id":"f8d6e45a-36ba-4c10-a0a5-0f4f74bae86a","year":2022},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:04.632231Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:e7d77111bab007562edf4f7fef08537ff6eaa891198841daa860db3d0ea4386f","observation_id":"2dcefea6-dd98-4cfa-a4eb-a9311e031e8a","resolution":{"observed_at":"2026-08-07T04:59:17.122946Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1202.3699","last_updated":"2012-02-14T16:41:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2012-02-14T16:41:17Z","title":"Learning is planning: near Bayes-optimal reinforcement learning via Monte-Carlo tree search","version":1},"cited_work":{"arxiv_id":"1202.3699","doi":null,"metadata_source":"pith","pith_arxiv_id":"1202.3699","snapshot_observed_at":"2026-08-07T04:59:19.354562Z","title":"Learning is planning: near Bayes-optimal reinforcement learning via Monte-Carlo tree search","venue":"cs.AI","work_id":"d6bce6f7-068f-44c8-8455-03a17a864e58","year":2012},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:04.690612Z"},"links":{"cited_paper":"/paper/1202.3699","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:43680630de8eb95fae8a050df39ec2e8647e748ee9b4b3dd25d67101c9852b7a","observation_id":"f141325a-5c0e-44cd-ac48-590d06a4ad6b","resolution":{"observed_at":"2026-08-07T04:59:19.424105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:04.743104Z","title":"Using confidence bounds for exploitation-exploration trade-offs","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:04.743104Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:4b142568b55aa6942d304ee8ad4a1150616674a56f51075cb9d4a6a6ea710d20","observation_id":"d945c53b-1d4b-4bb0-a00d-fe635ccdb1fa","resolution":{"observed_at":"2026-08-07T04:59:04.743104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:04.827917Z","title":"Using confidence bounds for exploitation-exploration trade-offs","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:04.827917Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:623c6e70c6f6230bd676ec81ce8625e26a001e9baf042924cf68db526ef437d9","observation_id":"8ca8a7da-2a8b-4db4-bb0e-4d6a3b316323","resolution":{"observed_at":"2026-08-07T04:59:04.827917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06038","last_updated":"2020-02-14T13:57:22Z","snapshot_observed_at":"2026-07-06T08:57:20.804732Z","submitted_at":"2020-02-14T13:57:22Z","title":"Never Give Up: Learning Directed Exploration Strategies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06038","snapshot_observed_at":"2026-08-07T04:59:04.925034Z","title":"Never Give Up : Learning Directed Exploration Strategies , February 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:04.925034Z"},"links":{"cited_paper":"/paper/2002.06038","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:d8a8412ca665ae97b6a95e52b9585858c41e4274be49dab9e8d657b2ce831f62","observation_id":"26a78126-7459-4a64-adf7-f6558001cd03","resolution":{"observed_at":"2026-08-07T04:59:04.925034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.07528","last_updated":"2020-02-11T00:56:50Z","snapshot_observed_at":"2026-08-06T20:46:20.413566Z","submitted_at":"2019-09-17T00:17:02Z","title":"Emergent Tool Use From Multi-Agent Autocurricula","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.07528","snapshot_observed_at":"2026-08-07T04:59:05.064790Z","title":"Emergent Tool Use From Multi - Agent Autocurricula , February 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:05.064790Z"},"links":{"cited_paper":"/paper/1909.07528","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:f908b54efbdb9bed71fe6d819134066de72e8cd4cd86cd7fd2afb5d5dde0322c","observation_id":"b96206d6-dec6-46c6-89ed-cbf1ce1d34f4","resolution":{"observed_at":"2026-08-07T04:59:05.064790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02418","last_updated":"2020-10-06T01:23:12Z","snapshot_observed_at":"2026-08-04T10:01:38.832235Z","submitted_at":"2020-10-06T01:23:12Z","title":"The Effectiveness of Memory Replay in Large Scale Continual Learning","version":1},"cited_work":{"arxiv_id":"2010.02418","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.02418","snapshot_observed_at":"2026-08-07T04:59:19.194665Z","title":"The Effectiveness of Memory Replay in Large Scale Continual Learning","venue":"cs.LG","work_id":"f65e0ae4-42a2-4eb2-b380-ab10187d56f2","year":2020},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:05.171526Z"},"links":{"cited_paper":"/paper/2010.02418","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:cd3f12b61d86ac00382c4e782c77d07e77a61f3ef1259dc4fb88c94a504abd64","observation_id":"8a116d71-8a6f-4518-9228-0a5ab70a75be","resolution":{"observed_at":"2026-08-07T04:59:19.240771Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:05.264885Z","title":"Intrinsic motivation and reinforcement learning","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:05.264885Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:8c2a481a7e3f1ace0aa4155e383f0aff7e248df00d3d27c4ebd0c177e647ba45","observation_id":"7b5cf619-8faf-47fa-8372-4bc5fc5d03c3","resolution":{"observed_at":"2026-08-07T04:59:05.264885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:05.357368Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:05.357368Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:5da5958457448e9ea46a2715762866f540aee377271e855d2d0005ec21e46378","observation_id":"568aba0d-016a-4d3d-b9e6-2dfa3c88e978","resolution":{"observed_at":"2026-08-07T04:59:05.357368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:05.474141Z","title":"Unifying count-based exploration and intrinsic motivation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:05.474141Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:8035f07ab0775137ea2031f191f25a6816e837a74a04527b9577cab5586b9e23","observation_id":"1f4c9586-a599-4d39-9308-790edf3b5131","resolution":{"observed_at":"2026-08-07T04:59:05.474141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01868","last_updated":"2016-11-07T21:16:21Z","snapshot_observed_at":"2026-08-04T08:42:08.516848Z","submitted_at":"2016-06-06T19:21:32Z","title":"Unifying Count-Based Exploration and Intrinsic Motivation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01868","snapshot_observed_at":"2026-08-07T04:59:05.580974Z","title":"Bellemare, Sriram Srinivasan, Georg Ostrovski, Tom Schaul, David Saxton, and Remi Munos","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:05.580974Z"},"links":{"cited_paper":"/paper/1606.01868","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:3b2127775d1a69b9fb5af8989adec13d05e6ac69a990f9c45f4ea9e27fb9026f","observation_id":"ff75eacd-d914-4504-acda-74c41be2a9b7","resolution":{"observed_at":"2026-08-07T04:59:05.580974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:05.674967Z","title":"A distributional perspective on reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:05.674967Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:7dac8bedc8266bbe7a87c2cc7711fe3f69e7aabf727399aec5d30e07b20cf428","observation_id":"75456ecb-df69-45f9-8b4f-96daa7afdc11","resolution":{"observed_at":"2026-08-07T04:59:05.674967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:05.781873Z","title":"Distributional Reinforcement Learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:05.781873Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:1205a8bc805d71cd21a4d8ac4c433c00fd70566fe14e4f9fe73870c4942b6197","observation_id":"1683a5fb-df9f-49de-b8da-77a5d6c14600","resolution":{"observed_at":"2026-08-07T04:59:05.781873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:05.886453Z","title":"Bickel and David A","venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:05.886453Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:c107e099d70ba9e23343d00dc8eb1895a7bb7341855b0bf45be9c8e1a41ac25e","observation_id":"84e1ba60-abf4-464f-9cdf-397c5d33fe06","resolution":{"observed_at":"2026-08-07T04:59:05.886453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.neuron.2020.06.014","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:16.957962Z","title":"Wang, Will Dabney, Kevin J","venue":null,"work_id":"373bd3e2-93db-4276-ae29-fbf7ce46f735","year":2020},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:06.000589Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:a4b137cdf2e7f9a4bad67be26ed3817c6775def54025db9047e0112d5bcb8030","observation_id":"6269d055-d160-45b3-95d1-acd92639582f","resolution":{"observed_at":"2026-08-07T04:59:17.009321Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:06.143349Z","title":"Bayes-optimal reinforcement learning for discrete uncertainty domains","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:06.143349Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:b10b9890097d94fa85938ca7e36da1a823baacaa9c9e821030e39312b3d01f8e","observation_id":"a4bc6f0c-19f9-4844-8a0d-428cc5d6a071","resolution":{"observed_at":"2026-08-07T04:59:06.143349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-07-06T07:11:32.319931Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-07T04:59:06.277250Z","title":"Exploration by Random Network Distillation , October 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:06.277250Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:8245739f6928020faf6b1a8757d6f194c44219acd8a5ed805670372669846695","observation_id":"935169f4-f315-4aa0-b1e2-c56355142224","resolution":{"observed_at":"2026-08-07T04:59:06.277250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01558","last_updated":"2022-06-03T13:20:16Z","snapshot_observed_at":"2026-07-06T13:17:08.463007Z","submitted_at":"2022-06-03T13:20:16Z","title":"Disentangling Epistemic and Aleatoric Uncertainty in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01558","snapshot_observed_at":"2026-08-07T04:59:06.385820Z","title":"Disentangling Epistemic and Aleatoric Uncertainty in Reinforcement Learning , June 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:06.385820Z"},"links":{"cited_paper":"/paper/2206.01558","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:0eabd19bfe446d6175826a13d053283f5a258600cdec18073f9fd087cb6de964","observation_id":"728a8fb2-4c7f-4286-858c-987f2b8e97d2","resolution":{"observed_at":"2026-08-07T04:59:06.385820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.12114","last_updated":"2018-11-02T17:19:02Z","snapshot_observed_at":"2026-07-06T06:42:05.870167Z","submitted_at":"2018-05-30T17:55:21Z","title":"Deep Reinforcement Learning in a Handful of Trials using Probabilistic Dynamics Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.12114","snapshot_observed_at":"2026-08-07T04:59:06.483617Z","title":"Deep Reinforcement Learning in a Handful of Trials using Probabilistic Dynamics Models , November 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:06.483617Z"},"links":{"cited_paper":"/paper/1805.12114","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:5e74cc6b67a0a7d7629cd7381dd11e7bd47a5729c1bce5a25a5e31655649b410","observation_id":"c77bd387-51a7-4dc8-b222-db8448418cfb","resolution":{"observed_at":"2026-08-07T04:59:06.483617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.09638","last_updated":"2020-09-09T15:44:27Z","snapshot_observed_at":"2026-07-06T07:54:57.584936Z","submitted_at":"2019-05-23T13:13:56Z","title":"Estimating Risk and Uncertainty in Deep Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.09638","snapshot_observed_at":"2026-08-07T04:59:06.596214Z","title":"Clements, Bastien Van Delft, Benoît-Marie Robaglia, Reda Bahi Slaoui, and Sébastien Toth","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:06.596214Z"},"links":{"cited_paper":"/paper/1905.09638","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:d37964a6e63b3f037acb5ccc43f9577a8a14a4d65d5da69a6c077c94d9e16344","observation_id":"3d61215e-54bc-4d8f-b29d-5e3dbb6dcb63","resolution":{"observed_at":"2026-08-07T04:59:06.596214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:06.706141Z","title":"Active learning with statistical models","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:06.706141Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:28fef9b365a059a0a17a2ed02a9b7313953ae135fd426a6e308700d0bd222e21","observation_id":"fd13b90b-268a-45a5-9dcd-82ca2ecb0ec0","resolution":{"observed_at":"2026-08-07T04:59:06.706141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10044","last_updated":"2017-10-27T09:35:26Z","snapshot_observed_at":"2026-08-04T16:01:11.564656Z","submitted_at":"2017-10-27T09:35:26Z","title":"Distributional Reinforcement Learning with Quantile Regression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.10044","snapshot_observed_at":"2026-08-07T04:59:06.831256Z","title":"Bellemare, and Rémi Munos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:06.831256Z"},"links":{"cited_paper":"/paper/1710.10044","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:40ecf14b43b7d416e214b6135949b519ae1815af8dc740c4cde6ad29cf60d68a","observation_id":"c7f31970-2c43-431d-a05f-c84e16ad64da","resolution":{"observed_at":"2026-08-07T04:59:06.831256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:06.984784Z","title":"Daw, Yael Niv, and Peter Dayan","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:06.984784Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:92dbb3d6b341120d4b72481618ca50935bc6e1b17a10d7815ba8587e78570de5","observation_id":"001546de-8a2a-4267-b1d2-a113e1c142b8","resolution":{"observed_at":"2026-08-07T04:59:06.984784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:07.089903Z","title":"Magnetic control of tokamak plasmas through deep reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:07.089903Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:7d12c6baf6f59157318e1df63d3e4eca18e32d2580bc52cf6e33cc63669b2537","observation_id":"6c7b6f89-f543-4833-8836-ab3f002f9c31","resolution":{"observed_at":"2026-08-07T04:59:07.089903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:07.187982Z","title":"Revisiting fundamentals of experience replay","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:07.187982Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:cbf8c4d0dfc420a1e51e841e735852bd6f19c11193cdadc6dfc95ac2ccf1c4a4","observation_id":"222cf5f0-0ae4-4284-ba3e-470359698ae9","resolution":{"observed_at":"2026-08-07T04:59:07.187982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:07.324437Z","title":"Foster and Matthew A","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:07.324437Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:2f78286cb5df614abab5f523c7d36e747509179f43ff7e99c8eed86312b27c2c","observation_id":"f26112ed-15aa-4df6-8df9-932eb9a86bb2","resolution":{"observed_at":"2026-08-07T04:59:07.324437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:07.496686Z","title":"Dropout as a bayesian approximation: Representing model uncertainty in deep learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:07.496686Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:72bf7256b33c51f95f3152e104ade52c291c2d3ce993bcdb938caef415cc8b7e","observation_id":"1e456dfb-18d3-4cee-9ef4-68df9164b4b3","resolution":{"observed_at":"2026-08-07T04:59:07.496686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:07.606446Z","title":"Dopamine, inference, and uncertainty","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:07.606446Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:7749355e92f732a460764bdfae4f4f41ba9fca7458620e3901e7130bdeaeaa4b","observation_id":"cf6aae28-93a9-4ae2-82f1-1aee9c2e8659","resolution":{"observed_at":"2026-08-07T04:59:07.606446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:07.735424Z","title":"Econometric analysis 4th edition","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:07.735424Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:3c9a5b569516210cbbfa9f9b57e1b4030b82789153184c2dcd57c10e80d02b1e","observation_id":"403041e9-fbba-4d22-8e04-1c535bdbcc73","resolution":{"observed_at":"2026-08-07T04:59:07.735424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:07.881303Z","title":"Grewe, and João Sacramento","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:07.881303Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:53492004f3361ae993d1ad495101307df1a3d849478e2e5fafa158026626eba7","observation_id":"5ad65fde-b29e-4ef5-bca6-e532f341b840","resolution":{"observed_at":"2026-08-07T04:59:07.881303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.02298","last_updated":"2017-10-06T07:45:46Z","snapshot_observed_at":"2026-07-06T06:03:01.506617Z","submitted_at":"2017-10-06T07:45:46Z","title":"Rainbow: Combining Improvements in Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.02298","snapshot_observed_at":"2026-08-07T04:59:07.996842Z","title":"Rainbow: Combining Improvements in Deep Reinforcement Learning , October 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:07.996842Z"},"links":{"cited_paper":"/paper/1710.02298","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:45256f940b971dbcae9518a9e8d25e0fdc4952a9658207b5fec682b158512226","observation_id":"ed222ed2-d44b-4757-8170-b0e15885d1e8","resolution":{"observed_at":"2026-08-07T04:59:07.996842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.06424","last_updated":"2019-10-22T15:54:03Z","snapshot_observed_at":"2026-08-08T03:41:47.173482Z","submitted_at":"2019-05-15T20:21:14Z","title":"Meta reinforcement learning as task inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.06424","snapshot_observed_at":"2026-08-07T04:59:08.137927Z","title":"Meta reinforcement learning as task inference","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:08.137927Z"},"links":{"cited_paper":"/paper/1905.06424","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:379328579e27505687ae013f0979d3f7796f2d4cb4764cfbcc754eaa001704d5","observation_id":"4e009739-942c-44d2-9be2-432d59200e16","resolution":{"observed_at":"2026-08-07T04:59:08.137927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:08.270325Z","title":"Aleatoric and epistemic uncertainty in machine learning: an introduction to concepts and methods","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:08.270325Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:41fb33e39f2c5b64ba7e4ffbb1587500d0f44f94ce0d04f7872dbe9496d8decb","observation_id":"d9a75a42-f4ed-4b0d-ae43-e81a74ae7a90","resolution":{"observed_at":"2026-08-07T04:59:08.270325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05483","last_updated":"2023-06-08T18:07:02Z","snapshot_observed_at":"2026-07-06T15:40:27.639368Z","submitted_at":"2023-06-08T18:07:02Z","title":"On the Importance of Exploration for Generalization in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05483","snapshot_observed_at":"2026-08-07T04:59:08.382492Z","title":"Zico Kolter, and Roberta Raileanu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:08.382492Z"},"links":{"cited_paper":"/paper/2306.05483","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:c127bea280171607da93e16d8f53a00412b5fe6cdde0bc1673996794eda24b30","observation_id":"00c624ad-5a39-40f6-9c73-c4adfa1539a2","resolution":{"observed_at":"2026-08-07T04:59:08.382492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.01182","last_updated":"2017-02-03T21:57:13Z","snapshot_observed_at":"2026-08-07T23:00:36.047005Z","submitted_at":"2017-02-03T21:57:13Z","title":"Uncertainty-Aware Reinforcement Learning for Collision Avoidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.01182","snapshot_observed_at":"2026-08-07T04:59:08.507227Z","title":"Uncertainty- Aware Reinforcement Learning for Collision Avoidance , February 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:08.507227Z"},"links":{"cited_paper":"/paper/1702.01182","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:f9556fa882a099be06bb0a68aad9b96157a21afa40215d1bf55fa7e538565637","observation_id":"da757c5c-660f-4731-b6b3-fd9749b4b84d","resolution":{"observed_at":"2026-08-07T04:59:08.507227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07530","last_updated":"2020-04-16T08:47:40Z","snapshot_observed_at":"2026-07-06T09:12:47.190763Z","submitted_at":"2020-04-16T08:47:40Z","title":"Continual Reinforcement Learning with Multi-Timescale Replay","version":1},"cited_work":{"arxiv_id":"2004.07530","doi":null,"metadata_source":"pith","pith_arxiv_id":"2004.07530","snapshot_observed_at":"2026-08-07T04:59:18.828658Z","title":"Continual Reinforcement Learning with Multi-Timescale Replay","venue":"cs.LG","work_id":"22bff7a0-09a3-4604-a1ef-802a47868b25","year":2020},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:08.646940Z"},"links":{"cited_paper":"/paper/2004.07530","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:ab6ecb5a2b91b73177271505d509219c981ca52a096020b858e74636062f4992","observation_id":"756025c3-709f-4a6f-bcd1-122a99c94773","resolution":{"observed_at":"2026-08-07T04:59:18.904049Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.13490","last_updated":"2022-11-11T23:12:23Z","snapshot_observed_at":"2026-08-06T18:15:59.906402Z","submitted_at":"2020-12-25T02:35:27Z","title":"Towards Continual Reinforcement Learning: A Review and Perspectives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.13490","snapshot_observed_at":"2026-08-07T04:59:08.782236Z","title":"Towards Continual Reinforcement Learning : A Review and Perspectives , November 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:08.782236Z"},"links":{"cited_paper":"/paper/2012.13490","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:93e0fdd46a260b10027bb82fa923ca68df0ae37a58fb26a34cee92ccc0d51f22","observation_id":"48c589a1-7d2e-4325-b00e-4878fab141bf","resolution":{"observed_at":"2026-08-07T04:59:08.782236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:08.867289Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:08.867289Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:93ba34b2f5ce42cdd8865b3c1b5269bba5092e56a6a50d1c48a3b517c9b072dc","observation_id":"dccd917f-1936-439d-b234-1a7b872a8d61","resolution":{"observed_at":"2026-08-07T04:59:08.867289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.08501","last_updated":"2023-02-03T05:00:34Z","snapshot_observed_at":"2026-08-01T20:01:49.840404Z","submitted_at":"2021-02-16T23:50:35Z","title":"DEUP: Direct Epistemic Uncertainty Prediction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.08501","snapshot_observed_at":"2026-08-07T04:59:09.017908Z","title":"DEUP : Direct Epistemic Uncertainty Prediction","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:09.017908Z"},"links":{"cited_paper":"/paper/2102.08501","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:6822baf6193d3866a4948cba6c93e7419c6c008a594de0535974163a705412d2","observation_id":"e8a84fce-8ea7-4f84-8967-4ede4ec6f722","resolution":{"observed_at":"2026-08-07T04:59:09.017908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:09.169304Z","title":"Bandit Algorithms","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:09.169304Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:f4309be2c302f629168f73b35954b78a0e1fc9b9b5c825a63728a488308b6553","observation_id":"c86e5450-c23f-4c92-99ec-96f14f57b313","resolution":{"observed_at":"2026-08-07T04:59:09.169304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:09.325129Z","title":"Continual Learning Using Bayesian Neural Networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:09.325129Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:46dc824ce24669ce803ff9e457bba075fc1a415951a77a5cfa361effee5c427d","observation_id":"06c5e871-7c78-4405-a94b-5fa480bbe544","resolution":{"observed_at":"2026-08-07T04:59:09.325129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:09.416141Z","title":"Self-improving reactive agents based on reinforcement learning, planning and teaching","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:09.416141Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:6cbc5681f342982020b5bfce3f03bc8301878bd11c7015417013819c481d6a37","observation_id":"fa4c9891-e941-45ec-90a3-bc3cc978143d","resolution":{"observed_at":"2026-08-07T04:59:09.416141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.11921","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:18.588940Z","title":"Distributional reinforcement learning with epistemic and aleatoric uncertainty estimation","venue":null,"work_id":"c09f3476-1d29-4e75-8cd8-2f827b4f55d6","year":2023},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:09.545903Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:53fe8642f2b59e23d428ef3e51e54a5be2ac51b7be13861346308df054d13169","observation_id":"d62dff62-45aa-4d3e-b3db-ce46ddb30470","resolution":{"observed_at":"2026-08-07T04:59:18.626167Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.06574","last_updated":"2017-10-18T03:19:55Z","snapshot_observed_at":"2026-07-06T06:04:47.929758Z","submitted_at":"2017-10-18T03:19:55Z","title":"The Effects of Memory Replay in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.06574","snapshot_observed_at":"2026-08-07T04:59:09.694588Z","title":"The Effects of Memory Replay in Reinforcement Learning , October 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:09.694588Z"},"links":{"cited_paper":"/paper/1710.06574","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:c1e002e9907a168148b77fdf67ce3c4dccc375f669c9244a3d8781908ff8fed7","observation_id":"21d6d1a4-6d46-4f8c-967c-303c6d683c39","resolution":{"observed_at":"2026-08-07T04:59:09.694588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.cell.2019.06.012","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:16.758669Z","title":"Dolan, Zeb Kurth-Nelson, and Timothy E.J","venue":null,"work_id":"46e0e0f2-874d-4fe1-b42c-f5354f5036cf","year":2019},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:09.811133Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:b1bf228b37afc4b910611aa363ee3846aada4a8d87bdc3bd3a172a6cdc200283","observation_id":"c985d732-d625-4f2f-9aae-c98ebf2b03ab","resolution":{"observed_at":"2026-08-07T04:59:16.839272Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03186","last_updated":"2023-06-05T18:56:48Z","snapshot_observed_at":"2026-07-06T15:38:50.670723Z","submitted_at":"2023-06-05T18:56:48Z","title":"Flipping Coins to Estimate Pseudocounts for Exploration in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2306.03186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.03186","snapshot_observed_at":"2026-08-07T04:59:18.383419Z","title":"Flipping Coins to Estimate Pseudocounts for Exploration in Reinforcement Learning","venue":"cs.LG","work_id":"2b61012e-7b8a-43fe-9e11-5f87d24e37c0","year":2023},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:09.924917Z"},"links":{"cited_paper":"/paper/2306.03186","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:e0ed257c61a7cbe02d100ebde92ac8431bc854451aef66fa88f1659a770c4a7d","observation_id":"2a17d01a-be66-4f75-bde9-57049b616361","resolution":{"observed_at":"2026-08-07T04:59:18.436575Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.08700","last_updated":"2019-03-01T05:03:11Z","snapshot_observed_at":"2026-07-06T07:09:29.571298Z","submitted_at":"2018-10-19T22:04:59Z","title":"Safe Reinforcement Learning with Model Uncertainty Estimates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.08700","snapshot_observed_at":"2026-08-07T04:59:10.058735Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:10.058735Z"},"links":{"cited_paper":"/paper/1810.08700","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:880ca43d97994a538ba129c03fa144938a745cfcd29572d1aeea08daffe67ad3","observation_id":"4ffe179a-8b7e-433c-a73e-787898a280f3","resolution":{"observed_at":"2026-08-07T04:59:10.058735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.01666","last_updated":"2022-05-03T14:08:13Z","snapshot_observed_at":"2026-07-06T12:24:59.455597Z","submitted_at":"2022-01-05T15:46:06Z","title":"Sample Efficient Deep Reinforcement Learning via Uncertainty Estimation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.01666","snapshot_observed_at":"2026-08-07T04:59:10.157842Z","title":"Sample Efficient Deep Reinforcement Learning via Uncertainty Estimation , May 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:10.157842Z"},"links":{"cited_paper":"/paper/2201.01666","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:b64577813558f9af419cfc94be659e10aa635d233e2badfc3b7d6b23aefe57f1","observation_id":"16123032-5733-428e-9443-60eea35ba479","resolution":{"observed_at":"2026-08-07T04:59:10.157842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:22.443587Z","title":"Bayesian decision problems and markov chains","venue":null,"work_id":"7b78a90a-95b0-46a4-b79a-29a01940ec58","year":1967},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:10.277282Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:7fddfcde339216d5a1490d9855b96d1a8096900873f4c146eaf4f7e0cfe12903","observation_id":"58f54b4c-6f58-47eb-a4bc-18032109ccb0","resolution":{"observed_at":"2026-08-07T04:59:22.551424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:10.420297Z","title":"Mattar and Nathaniel D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:10.420297Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:cf6942c3a416adc6729d2af7d5305bf3798759efd49b66ce335429fdc0f7e331","observation_id":"4e776f21-8b9d-44e3-9adb-e261db8a050a","resolution":{"observed_at":"2026-08-07T04:59:10.420297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:22.217259Z","title":"How to Stay Curious while avoiding Noisy TVs using Aleatoric Uncertainty Estimation","venue":null,"work_id":"d81802f3-75e8-4b79-b743-5799915e751c","year":2022},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:10.586221Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:160be466e57031091000a66f6800c461e473a2fdd9be5b889b84a7acb60a9017","observation_id":"d2a9ac14-f92c-4426-a720-9ca18cc63cf9","resolution":{"observed_at":"2026-08-07T04:59:22.338045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/nn.3843","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:16.609349Z","title":"McNamara, Álvaro Tejero-Cantero, Stéphanie Trouche, Natalia Campo-Urriza, and David Dupret","venue":null,"work_id":"bb8e90ac-a8e6-48c8-8cd9-25340de8642c","year":2014},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:10.720707Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:6e1271205b7cac54363e24f0c1bb005c71ab7c4782253e9a6be7eab882ae8457","observation_id":"861ffbb3-d831-4ff5-bfc3-ffbe65f262c3","resolution":{"observed_at":"2026-08-07T04:59:16.700629Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:10.836052Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:10.836052Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:01fccff3919ccc8276ce7011bcfb1726ef6c2a84cb2ff8fe03bca0a8d5947e1e","observation_id":"5c154923-54b5-4269-beb7-bd3c9451a1b0","resolution":{"observed_at":"2026-08-07T04:59:10.836052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/bf00993104","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:03:45.533247Z","title":"Moore and Christopher G","venue":"Machine Learning","work_id":"d5762b8d-07b0-4298-a850-049ed15bba32","year":1993},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:10.966094Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:9d82900803285bbf3cffd3d34df6080a9782644ffae968207e039b9c701a418f","observation_id":"ce26a3ae-5ba9-44b4-942d-51cb16b05b3f","resolution":{"observed_at":"2026-08-07T04:59:16.496733Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.10089","last_updated":"2018-02-25T07:48:19Z","snapshot_observed_at":"2026-08-05T20:20:31.716220Z","submitted_at":"2017-09-28T17:51:48Z","title":"Overcoming Exploration in Reinforcement Learning with Demonstrations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.10089","snapshot_observed_at":"2026-08-07T04:59:11.082277Z","title":"Overcoming Exploration in Reinforcement Learning with Demonstrations , February 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:11.082277Z"},"links":{"cited_paper":"/paper/1709.10089","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:a3c88a70d582eb971b31aa654cd8b7e19d57e5bfdf6ddad36d746018c1ff68b3","observation_id":"295d8212-0883-4a3a-ab50-e612b91b632a","resolution":{"observed_at":"2026-08-07T04:59:11.082277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:21.968227Z","title":"Collision Probability Matching Loss for Disentangling Epistemic Uncertainty from Aleatoric Uncertainty","venue":null,"work_id":"d84a94fa-b0a1-49ee-9207-78b74af8c7f9","year":2023},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:11.217545Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:068383c577d455eee329f25f4b982a2c25e7d5664488185434d407c78866573c","observation_id":"ee8a293e-3fed-4d41-8168-9231d4d77e6b","resolution":{"observed_at":"2026-08-07T04:59:22.085699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:11.299942Z","title":"How to measure uncertainty in uncertainty sampling for active learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:11.299942Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:30b933938a043d351fe125dfbc5042469b9876b92780adc96a0c87e7cd40ec7e","observation_id":"6f471bab-db8f-4b27-b9f7-46446e3b9655","resolution":{"observed_at":"2026-08-07T04:59:11.299942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:11.439530Z","title":"A review On reinforcement learning: Introduction and applications in industrial process control","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:11.439530Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:6b437c25ced7a9f0720bb1c9ad752b26708b25e4c7d13760fdb0843a93b798eb","observation_id":"d2b85c3e-3d18-4ea0-8e71-ff0b5aaf8ae3","resolution":{"observed_at":"2026-08-07T04:59:11.439530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.07544","last_updated":"2019-03-25T01:10:25Z","snapshot_observed_at":"2026-07-06T07:22:01.824536Z","submitted_at":"2018-12-18T18:20:49Z","title":"Information-Directed Exploration for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1812.07544","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.07544","snapshot_observed_at":"2026-08-07T04:59:18.143582Z","title":"Information-Directed Exploration for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b0df0b72-14ae-4f19-993f-b5a97a4f235c","year":2018},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:11.622714Z"},"links":{"cited_paper":"/paper/1812.07544","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:4787c757285c095b1bc9ae6f993f82cac2393de34d7b4e7372760111578efbe0","observation_id":"1ecab6c4-ebe4-4684-a23c-be41dba30d73","resolution":{"observed_at":"2026-08-07T04:59:18.211314Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09339","last_updated":"2023-06-04T13:35:45Z","snapshot_observed_at":"2026-08-04T03:40:31.968219Z","submitted_at":"2023-02-18T14:13:25Z","title":"Efficient Exploration via Epistemic-Risk-Seeking Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09339","snapshot_observed_at":"2026-08-07T04:59:11.753710Z","title":"Efficient Exploration via Epistemic - Risk - Seeking Policy Optimization , June 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:11.753710Z"},"links":{"cited_paper":"/paper/2302.09339","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:edba1de250dc47979f590960fa3735c0608d6bdd6b377c797c2d9f1f2ca7d5e1","observation_id":"f313ebd7-a4bd-4626-988b-13528cf7511a","resolution":{"observed_at":"2026-08-07T04:59:11.753710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-07T04:59:11.862987Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning , December 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:11.862987Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:c8830ce5c43ec823ece200a1c724d1b95d762ddfa94108cc189d53be802de6e8","observation_id":"3adc404b-dfde-4bd9-9085-d9fa031ef1d8","resolution":{"observed_at":"2026-08-07T04:59:11.862987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.04621","last_updated":"2016-07-04T17:11:52Z","snapshot_observed_at":"2026-07-06T04:46:10.668650Z","submitted_at":"2016-02-15T10:54:20Z","title":"Deep Exploration via Bootstrapped DQN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.04621","snapshot_observed_at":"2026-08-07T04:59:12.010327Z","title":"Deep Exploration via Bootstrapped DQN , July 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:12.010327Z"},"links":{"cited_paper":"/paper/1602.04621","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:21970d8a0dd68dd5aabc48624aa678fac4987bce2a7c8b9d6c7bd7644a069322","observation_id":"d3614bab-4f10-4f0a-8415-b79e634f3987","resolution":{"observed_at":"2026-08-07T04:59:12.010327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:21.691744Z","title":"Randomized prior functions for deep reinforcement learning","venue":null,"work_id":"9c73a345-d289-4bf8-93b3-80406b20c888","year":2018},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:12.139416Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:de61ee7998d2cc8eeeca41bae3917ddca3f0e129297a6bafa890c8be4d81ec62","observation_id":"60be9072-be07-494c-bfc3-5ecc58643fa9","resolution":{"observed_at":"2026-08-07T04:59:21.814717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.08924","last_updated":"2023-05-17T21:17:29Z","snapshot_observed_at":"2026-08-06T11:46:46.519648Z","submitted_at":"2021-07-19T14:37:57Z","title":"Epistemic Neural Networks","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.08924","snapshot_observed_at":"2026-08-07T04:59:12.300673Z","title":"Epistemic neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:12.300673Z"},"links":{"cited_paper":"/paper/2107.08924","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:b2728a1e1e11adffb7d00c818d5ab863dc3f2ff58409f78af71551dbfe38db86","observation_id":"2e790b1e-e4c7-4bf8-9f9e-172a29b6a5fc","resolution":{"observed_at":"2026-08-07T04:59:12.300673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:21.458193Z","title":"Count-based exploration with neural density models","venue":null,"work_id":"066f4c4a-7ae6-48e7-9e16-e157fdd58cf9","year":2017},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:12.405707Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:0e84b4bc4ad365cb68f832937b1b43454a576a9fe2be2c57587d48b7d0ae19f5","observation_id":"8cb2fdb0-37c4-4c93-aaa6-9221b863df8e","resolution":{"observed_at":"2026-08-07T04:59:21.583223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.01310","last_updated":"2017-06-14T13:56:28Z","snapshot_observed_at":"2026-07-06T05:32:18.507883Z","submitted_at":"2017-03-03T19:07:53Z","title":"Count-Based Exploration with Neural Density Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.01310","snapshot_observed_at":"2026-08-07T04:59:12.561871Z","title":"Bellemare, Aaron van den Oord, and Remi Munos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:12.561871Z"},"links":{"cited_paper":"/paper/1703.01310","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:e9b0e0544fcf81844b7cded6c3dde694e274fc3c222b66b18317ac4fa32d874d","observation_id":"d98ce937-9f32-494c-b26b-1921c230e943","resolution":{"observed_at":"2026-08-07T04:59:12.561871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:12.683297Z","title":"What is intrinsic motivation? A typology of computational approaches","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:12.683297Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:35a1055248d974a7e43ff3927887546662fd969d1b9ee53ddb061e5ebd6510f9","observation_id":"f6cbb842-64e2-4ccf-b3a8-3b9057cc8e0e","resolution":{"observed_at":"2026-08-07T04:59:12.683297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:21.231895Z","title":"Understanding and mitigating the limitations of prioritized experience replay","venue":null,"work_id":"ad5fa75d-5337-4797-a99e-983d031741ca","year":2022},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:12.797300Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:1f4f67f53e27328fefc6618c67a25ca6c36446bcec11aaf4e92adf45c0dfc14a","observation_id":"fc5d0834-ab9a-4669-8b45-0f20b40a08af","resolution":{"observed_at":"2026-08-07T04:59:21.351685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.05363","last_updated":"2017-05-15T17:56:22Z","snapshot_observed_at":"2026-07-06T05:42:42.520454Z","submitted_at":"2017-05-15T17:56:22Z","title":"Curiosity-driven Exploration by Self-supervised Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.05363","snapshot_observed_at":"2026-08-07T04:59:12.920187Z","title":"Efros, and Trevor Darrell","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:12.920187Z"},"links":{"cited_paper":"/paper/1705.05363","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:60eef2377f9ba46a41efae05f89c217ead070ad50d9659df6ad9f0993c90b56d","observation_id":"86e7e25f-b4de-4ba3-8f75-fc2c6c573803","resolution":{"observed_at":"2026-08-07T04:59:12.920187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10994-016-5569-5","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:16.251899Z","title":null,"venue":null,"work_id":"7b49b480-9fde-4a99-a4dc-ecbf7d55c60a","year":2016},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:13.034838Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:54ae09a44a8a9f142d7e7e03089c9a2bfefc46a4febb1060b4a50062a4e026c0","observation_id":"ecdba1bb-5cf8-493b-9498-c5b710d1283b","resolution":{"observed_at":"2026-08-07T04:59:16.318334Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02274","last_updated":"2019-08-06T17:54:03Z","snapshot_observed_at":"2026-07-06T07:06:07.852587Z","submitted_at":"2018-10-04T15:24:06Z","title":"Episodic Curiosity through Reachability","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02274","snapshot_observed_at":"2026-08-07T04:59:13.161515Z","title":"Episodic Curiosity through Reachability , August 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:13.161515Z"},"links":{"cited_paper":"/paper/1810.02274","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:722f1de7a576bfd186a8132d92d316fb7c2b1aa49d1ecd3fe4a5a2aa07e6a863","observation_id":"6d58fd36-4cb9-40d5-a733-62ba6a02cb27","resolution":{"observed_at":"2026-08-07T04:59:13.161515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-07-06T04:37:00.543211Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-07T04:59:13.358289Z","title":"Prioritized Experience Replay , February 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:13.358289Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:34439535ac190be46d09e38602f50e0f8d0fab04fc74187f668b1ab532718b16","observation_id":"dcd68f51-7d06-4eee-909d-a6712866462b","resolution":{"observed_at":"2026-08-07T04:59:13.358289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:20.949770Z","title":"Comparing Direct and Indirect Temporal - Difference Methods for Estimating the Variance of the Return","venue":null,"work_id":"85ddf43c-9216-4328-ac54-cfb3db5c0525","year":2018},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:13.560894Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:5bd3845be5bb77c3cc71ce9f6c2eb389b7ed9b37d323afe459cdc5294ccd5910","observation_id":"bbb332ca-eb1f-4b06-a791-040ceec25aa7","resolution":{"observed_at":"2026-08-07T04:59:21.090557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:13.708754Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:13.708754Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:a7fc583cc4987529972125226ff9ba695b6b9c5c46e721202a1e7071ea1717d0","observation_id":"6e7b6193-52d2-477b-8ea9-317d503de93e","resolution":{"observed_at":"2026-08-07T04:59:13.708754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"stable/3213832","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:17.855779Z","title":null,"venue":null,"work_id":"d3292694-5662-43cd-a0fe-cef86a9a86ad","year":1982},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:13.822579Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:865172b73ef349d01f18269c643495aa8faa33bdccaa186e1ba860058e4d258b","observation_id":"246971cb-f47d-4b85-b54a-917bc75adaa6","resolution":{"observed_at":"2026-08-07T04:59:17.925150Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1507.00814","last_updated":"2015-11-19T22:40:30Z","snapshot_observed_at":"2026-08-01T13:17:26.224723Z","submitted_at":"2015-07-03T04:11:15Z","title":"Incentivizing Exploration In Reinforcement Learning With Deep Predictive Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1507.00814","snapshot_observed_at":"2026-08-07T04:59:13.972098Z","title":"Stadie, Sergey Levine, and Pieter Abbeel","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:13.972098Z"},"links":{"cited_paper":"/paper/1507.00814","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:65a45fa0da1fa9254e1ae4071c8b0cffa5d439b9574d557953a5d3c8a30eed05","observation_id":"ac8cd1c0-435e-479c-bb47-b536de0a502c","resolution":{"observed_at":"2026-08-07T04:59:13.972098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.neunet.2021.10.003","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:16.082398Z","title":"Reinforcement learning and its connections with neuroscience and psychology","venue":null,"work_id":"a0a4bbd4-c5b0-4fdb-86c2-732c3c43651f","year":2022},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:14.099713Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:98d3050616f565a050700594219cf637b831bf6f414edf449b81202374fd777d","observation_id":"dba98005-e78d-46fd-8769-a73fcb7a77be","resolution":{"observed_at":"2026-08-07T04:59:16.161963Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v34i04.6049","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:15.909073Z","title":"Attentive Experience Replay","venue":null,"work_id":"3c085d7c-f1dd-494b-9752-b663e163d87a","year":2020},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:14.224018Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:3558c44a52b47b67cd6857db487a76774b542392e2556f0406692501e9e4ee02","observation_id":"5c64bd0d-2409-4c8b-a94d-31593ec6351a","resolution":{"observed_at":"2026-08-07T04:59:15.990701Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:20.730725Z","title":"Reinforcement learning: An Introduction","venue":null,"work_id":"11da129c-8510-4003-8f14-4ace77dff692","year":2018},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:14.347077Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:a121f6e88c7d7455b06a5205f97bd7858ede315e94e790b24a3dd11c740032eb","observation_id":"50b94434-f492-4107-b690-27876e5f7ca0","resolution":{"observed_at":"2026-08-07T04:59:20.841670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:14.467194Z","title":null,"venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:14.467194Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:0d20891b4bc5a9fd30fba7af305cee68be4c49b32b5f37034d27bc0146addb81","observation_id":"f3ee20cf-5ab9-4594-848d-797089234c14","resolution":{"observed_at":"2026-08-07T04:59:14.467194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:20.530450Z","title":"Policy gradients with variance related risk criteria","venue":null,"work_id":"a3f7ef13-04a1-41f5-a376-ce3bb2a829b8","year":2012},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:14.542594Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:93bb321e11483832a56f0d78defe565525f422607f9464dc92ad23828a8d414c","observation_id":"88ea7a60-935e-4688-9cdf-3646ff697ed2","resolution":{"observed_at":"2026-08-07T04:59:20.605473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:20.378099Z","title":"Learning the Variance of the Reward - To - Go","venue":null,"work_id":"245c2a12-a8ec-4cb7-a98b-77b189266739","year":2016},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:14.656558Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:267fa324e6b1b2d91a64df0f15ca8677ad23107bf775e8c76ac8d84484171963","observation_id":"d56cb4d0-ea81-41e0-8620-006f79b22000","resolution":{"observed_at":"2026-08-07T04:59:20.440237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:20.252696Z","title":"\\# exploration: A study of count-based exploration for deep reinforcement learning","venue":null,"work_id":"e998aa59-1f02-4644-8aff-b4fc5294d0ed","year":2017},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:14.746820Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:a19c497d068b15589366cc855f508b8e3a57f5fda7cc92c494c0a86d43c11824","observation_id":"0fa47a5e-be18-4314-a020-b3ad1e243aa8","resolution":{"observed_at":"2026-08-07T04:59:20.308925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.12808","last_updated":"2021-07-31T16:55:19Z","snapshot_observed_at":"2026-08-07T04:03:03.246090Z","submitted_at":"2021-07-27T13:30:07Z","title":"Open-Ended Learning Leads to Generally Capable Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.12808","snapshot_observed_at":"2026-08-07T04:59:14.869952Z","title":"Open- Ended Learning Leads to Generally Capable Agents , July 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:14.869952Z"},"links":{"cited_paper":"/paper/2107.12808","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:f1bc083f22aaccb698de3f2f3ab892d932e357ce19a755a34f9b1c5a3fe66e94","observation_id":"8240a333-4a49-4961-afce-02f0c50f7179","resolution":{"observed_at":"2026-08-07T04:59:14.869952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:14.957572Z","title":null,"venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:14.957572Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:f9a4b0c63810d9cf546f5fef1d93fd006be80a2b452323993482db815a1fefed","observation_id":"acdcd362-4911-4d33-b93a-77ad88230a47","resolution":{"observed_at":"2026-08-07T04:59:14.957572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:15.091515Z","title":"Q-learning","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:15.091515Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:e1f3fb7e36c431054c6fb1f8bbf2ba44a037c000ad3b5ac0ee0607d38f643302","observation_id":"460fab3b-7e3e-4299-82d5-51724b78b9ad","resolution":{"observed_at":"2026-08-07T04:59:15.091515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.10435","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:17.508412Z","title":"A Review of Reinforcement Learning for Controlling Building Energy Systems From a Computer Science Perspective","venue":null,"work_id":"fd22de57-a815-4afe-b793-459d20bf5387","year":2023},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:15.148496Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:695bd469299ccea4d95dd585f7fe89734c94b8a9975ab8ba105c005ed60cac83","observation_id":"8e6ee2e0-2495-4e26-813b-a56d35ac5f4c","resolution":{"observed_at":"2026-08-07T04:59:17.593543Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:15.262301Z","title":"An introduction to the kalman filter","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:15.262301Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:e2941f2f2b8fad73d8167ed14c2c1fbcd399c6e65b53137316c28e62b6cf2f51","observation_id":"263fd8e0-8390-46f2-9d12-1823c362b03d","resolution":{"observed_at":"2026-08-07T04:59:15.262301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.00446","last_updated":"2016-10-24T19:25:51Z","snapshot_observed_at":"2026-07-06T05:02:08.702464Z","submitted_at":"2016-07-02T01:33:00Z","title":"A Greedy Approach to Adapting the Trace Parameter for Temporal Difference Learning","version":2},"cited_work":{"arxiv_id":"1607.00446","doi":null,"metadata_source":"pith","pith_arxiv_id":"1607.00446","snapshot_observed_at":"2026-08-07T04:59:17.234485Z","title":"A Greedy Approach to Adapting the Trace Parameter for Temporal Difference Learning","venue":"cs.AI","work_id":"3a238107-8669-4535-a866-57522093dba3","year":2016},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:15.339545Z"},"links":{"cited_paper":"/paper/1607.00446","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:ac7161cac360e4c6b34d42a77cabd574d8e708c1b9a7e88106dfcac60203dacf","observation_id":"5b5bb12f-2ef2-4404-952c-d317d65e25ce","resolution":{"observed_at":"2026-08-07T04:59:17.324070Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:20.054163Z","title":"Minimum excess risk in bayesian learning","venue":null,"work_id":"c3481f44-dd56-4d04-a081-29a8165756c7","year":2022},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:15.421052Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:9f26ecfba0b1faae12f26038bf7437460e954667a023d7a26f6b0a0887fe17c6","observation_id":"62920f0f-f8c9-4246-9d0b-5e1b388d45b8","resolution":{"observed_at":"2026-08-07T04:59:20.154488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:19.796818Z","title":"Experience Replay Optimization","venue":null,"work_id":"f66dbcbe-5e6d-4b46-8723-90213d4aa18f","year":2019},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:15.469418Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:83ab4a924d825dd95952803697ddca218ebdd6e2967e7773aee1588261591851","observation_id":"697573e4-74b8-470f-a4ff-7cdd44b0f0a1","resolution":{"observed_at":"2026-08-07T04:59:19.916710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.neucom.2021.10.119","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:15.758381Z","title":"A survey on epistemic (model) uncertainty in supervised learning: Recent advances and applications","venue":null,"work_id":"f2fb9a54-da57-40fe-b459-40507c6dfb86","year":2022},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:15.550692Z"},"links":{"citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:8b983ccc2d6fff4b7b73108343d016d5bd2fbd481b6076a646c83ddb24070fd2","observation_id":"7c5bbda1-3059-4e1c-9ff8-0d187fedcddc","resolution":{"observed_at":"2026-08-07T04:59:15.810714Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.08348","last_updated":"2020-02-27T19:40:21Z","snapshot_observed_at":"2026-08-08T16:00:49.075701Z","submitted_at":"2019-10-18T11:44:59Z","title":"VariBAD: A Very Good Method for Bayes-Adaptive Deep RL via Meta-Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.08348","snapshot_observed_at":"2026-08-07T04:59:15.652640Z","title":"Varibad: A very good method for bayes-adaptive deep rl via meta-learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:15.652640Z"},"links":{"cited_paper":"/paper/1910.08348","citing_paper":"/paper/2506.09270"},"observation_digest":"sha256:05b1dcb57e41872028e5d50c2fedf3e8f287a7cfe4f21fdc115a5ecc959e0824","observation_id":"d4fa4b48-1ca3-430c-84bc-3d69928723fd","resolution":{"observed_at":"2026-08-07T04:59:15.652640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.09270","last_updated":"2025-06-10T22:07:13Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T06:53:24.403428Z","submitted_at":"2025-06-10T22:07:13Z","title":"Uncertainty Prioritized Experience Replay"},"reference_resolution":{"displayed":95,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":63,"verified_exact":17,"verified_fuzzy":13},"total_outbound_references":95},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 3 inbound Pith citation observations for arXiv:2506.09270."}