{"as_of":"2026-08-22T11:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:57e981decf574631afd1b9d748f756ac02651cf77d1f9a174aff91327ff7280b","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T00:46:16.642210Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.18093/citation-record","integrity":"/paper/2501.18093/integrity","json":"/paper/2501.18093/citation-record.json","paper":"/paper/2501.18093"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:16.936498Z","title":"Retroactive and graded prioritization of memory by reward","venue":null,"work_id":"b774fff8-11c5-44f4-8c43-c1a3dce45f51","year":2018},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.545411Z"},"links":{"citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:da13f1efc2ceae2cc90590a7a6d32d5efd054dcf3b2767a576097a12820632ae","observation_id":"fca48c31-ca0f-4934-a54c-733cd16d1874","resolution":{"observed_at":"2026-08-10T00:46:16.940322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.12726","last_updated":"2020-02-19T16:04:29Z","snapshot_observed_at":"2026-08-19T23:34:47.419824Z","submitted_at":"2019-05-25T15:38:00Z","title":"Prioritized Sequence Experience Replay","version":2},"cited_work":{"arxiv_id":"1905.12726","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.12726","snapshot_observed_at":"2026-08-10T00:46:16.772606Z","title":"Prioritized Sequence Experience Replay","venue":"cs.LG","work_id":"d9cd17db-2f55-4a93-97b3-1b6a193b93c9","year":2019},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.550779Z"},"links":{"cited_paper":"/paper/1905.12726","citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:569b17b04f89b66730b5dd28f3d3e66779576468dbff2f24ef50caedd86a82fa","observation_id":"48c6e192-95b4-4a0f-b6ed-1bcd102d91c7","resolution":{"observed_at":"2026-08-10T00:46:16.776638Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-10T00:46:16.555177Z","title":"Openai gym","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.555177Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:287081c7023527ab6fd7fe81cb78a87d14eeba41a03bc02f0081c30087b3ac83","observation_id":"3811aabf-5dfe-456a-9459-b2a9cc30b594","resolution":{"observed_at":"2026-08-10T00:46:16.555177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:16.559700Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.559700Z"},"links":{"citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:a8c6b39f79a4760cc367d8278da57ca64784dda2011c1457bba3592ca94325b1","observation_id":"5dd4dd80-7c33-4c25-99ed-cda645d4ada6","resolution":{"observed_at":"2026-08-10T00:46:16.559700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:16.918615Z","title":"An equivalence between loss functions and non-uniform sampling in experience replay","venue":null,"work_id":"3ba9f750-1a62-437b-8b17-8e1a2c6f92a3","year":2020},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.563926Z"},"links":{"citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:f3c6bfb2b19fe678a75dd624b21808c8e7e0d1108d5836dd8e90605281949d8a","observation_id":"768f7d28-d0d2-47e5-aebb-a65bb76b4821","resolution":{"observed_at":"2026-08-10T00:46:16.922804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-08-18T07:04:58.690133Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-10T00:46:16.567840Z","title":"World models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.567840Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:0976cbe999f022a5926307c50b501dfed647535ff65b5d367bee074e84bb333c","observation_id":"ec438277-4960-48ce-bca8-f220d4e6c5e8","resolution":{"observed_at":"2026-08-10T00:46:16.567840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:16.906867Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"434f5953-40fb-44be-88de-e50db8dcab57","year":2018},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.572472Z"},"links":{"citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:e84cc2cb5e9b21e8be6dbfdc9c51210500facae7b4c5d170e4161449d10990a1","observation_id":"e3e764fd-596c-48db-bcb0-60326d916eed","resolution":{"observed_at":"2026-08-10T00:46:16.911071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:16.576292Z","title":"Deep reinforcement learning that matters","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.576292Z"},"links":{"citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:970052b8f001321aa63449295923fc6f180d60a180f8cd60419c1746ed5e03e1","observation_id":"c850a82a-9523-4ad5-a77b-e9da44762105","resolution":{"observed_at":"2026-08-10T00:46:16.576292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:16.579886Z","title":"Rainbow: Combining improvements in deep reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.579886Z"},"links":{"citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:0903ab1076e79bff379d041b40dea21069878ebf8cf69f1755a2f3168039cf4e","observation_id":"c4192335-3331-4262-92c4-c28f272b389a","resolution":{"observed_at":"2026-08-10T00:46:16.579886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:16.882423Z","title":"How to train your robot with deep reinforcement learning: lessons we have learned","venue":null,"work_id":"1bb632e3-3b6b-4c78-86ad-be52a9f97ab7","year":2021},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.583477Z"},"links":{"citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:98be602e06f1879eb2306b91ee4ec3415dce9e926db86a6bb11486e9b3e6c9be","observation_id":"a14d55f6-644f-471e-b34e-4cd0758c2cae","resolution":{"observed_at":"2026-08-10T00:46:16.886457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:16.871137Z","title":"Model-free and model-based reinforcement learning, the intersection of learning and planning","venue":null,"work_id":"bd6c9ecd-c5df-4705-8037-e18791b0dce5","year":2022},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.587123Z"},"links":{"citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:3b517599c7a2f532b1938cd182bfc02d87935f29928b7258a9bcdf08ff32df4a","observation_id":"fcc293e7-eebf-40cf-98e4-bded471f54b2","resolution":{"observed_at":"2026-08-10T00:46:16.875019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:16.859999Z","title":"Dopamine, updated: reward prediction error and beyond","venue":null,"work_id":"b3532ae5-965d-4555-bdc3-955d35472d76","year":2021},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.590790Z"},"links":{"citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:d8cdeee563f064767af2d0340a5153fc6e3f84e456e3231636888f9c0a76de47","observation_id":"336cf85c-be76-4f60-8eb8-1945baa95748","resolution":{"observed_at":"2026-08-10T00:46:16.863802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:16.849201Z","title":"Self-improving reactive agents based on reinforcement learning, planning and teaching","venue":null,"work_id":"886a53f6-1cab-4062-96a0-3d6e0290f6ce","year":1992},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.594290Z"},"links":{"citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:0c08246192a6c6a2c1b0136f57d3ac901fad420a9f7d98d2e9b4187c00f234e7","observation_id":"99401917-524a-46aa-ac0b-99b3ab018dac","resolution":{"observed_at":"2026-08-10T00:46:16.853092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:16.597703Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.597703Z"},"links":{"citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:b714349505bbca3993730d8ca941236b360dee2f879aae7eae0b996592de4c49","observation_id":"704908b2-4150-4858-84b0-743bc87943ba","resolution":{"observed_at":"2026-08-10T00:46:16.597703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:16.832139Z","title":"Model-augmented prioritized experience replay","venue":null,"work_id":"1dafaae0-fb50-42e2-81a8-886b549f6d96","year":2021},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.601132Z"},"links":{"citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:5634b423cf3df190ed228e7a6c47e6dafb10ae678ea356625ef9922e0d8fa5a8","observation_id":"dcf946c6-347f-4fe7-9658-b92ddd7c673c","resolution":{"observed_at":"2026-08-10T00:46:16.835866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:16.604656Z","title":"Curiosity-driven exploration by self-supervised prediction","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.604656Z"},"links":{"citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:738db815b86271c90adc96946984b01c57090440f3ad3e5227b7d8054cae0041","observation_id":"dcd3e038-42c6-49ce-a9f3-4eac8812cc6c","resolution":{"observed_at":"2026-08-10T00:46:16.604656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:16.814847Z","title":"Building and breaking the chain: A model of reward prediction error integration and segmentation of memory","venue":null,"work_id":"4c1d0e50-e518-4b87-889a-0befd7134aa5","year":2024},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.607985Z"},"links":{"citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:15c5e3e741f02b45e1d397597176a273bbd48f4b840650a6e183a43c6a27f79a","observation_id":"e3d14543-ee11-418d-8717-fb49a14a6c94","resolution":{"observed_at":"2026-08-10T00:46:16.819053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00532","last_updated":"2022-09-01T15:27:46Z","snapshot_observed_at":"2026-08-16T16:35:21.495365Z","submitted_at":"2022-09-01T15:27:46Z","title":"Actor Prioritized Experience Replay","version":1},"cited_work":{"arxiv_id":"2209.00532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.00532","snapshot_observed_at":"2026-08-10T00:46:16.736117Z","title":"Actor Prioritized Experience Replay","venue":"cs.LG","work_id":"d7931557-42df-4527-8343-a923ba710015","year":2022},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.611328Z"},"links":{"cited_paper":"/paper/2209.00532","citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:037971b95279c0cce213c9ade1fcb2aa77fe8ed7f1d0574816876963cc2d6792","observation_id":"3ae85502-4af5-49f4-b26b-210b6591a7a8","resolution":{"observed_at":"2026-08-10T00:46:16.740208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-08-21T06:19:51.244525Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-10T00:46:16.615256Z","title":"Prioritized experience replay","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.615256Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:66e32f6743b1ab382e62b7fd1608ed38fc16899f8bca161b7139a8b87458a3ca","observation_id":"99068ee9-2732-44ff-a3fd-e1611fb5cf2d","resolution":{"observed_at":"2026-08-10T00:46:16.615256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:16.803212Z","title":"Reward prediction error","venue":null,"work_id":"cff5b8b6-1915-4d2b-8f5c-9078614e42d0","year":2017},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.619442Z"},"links":{"citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:e390e2eef0f41a04fbaf640be129fc0fc6bf02ff10a3b66ad88011ee5384d8d1","observation_id":"e981b5a1-4960-479d-9263-597206e77da2","resolution":{"observed_at":"2026-08-10T00:46:16.807147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.07307","last_updated":"2017-03-09T18:29:09Z","snapshot_observed_at":"2026-08-19T10:41:20.497970Z","submitted_at":"2016-12-21T20:29:26Z","title":"Loss is its own Reward: Self-Supervision for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.07307","snapshot_observed_at":"2026-08-10T00:46:16.622999Z","title":"Loss is its own reward: Self-supervision for reinforcement learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.622999Z"},"links":{"cited_paper":"/paper/1612.07307","citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:231d87edf5b250c40144828a600d90209e418f235cf44b3fb9dcfcb9f40fa3e9","observation_id":"a3c8aa65-9bf4-4b97-bbb7-e00418ce551c","resolution":{"observed_at":"2026-08-10T00:46:16.622999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08189","last_updated":"2021-01-14T01:26:18Z","snapshot_observed_at":"2026-08-18T15:04:22.588732Z","submitted_at":"2019-06-19T16:06:36Z","title":"Reward Prediction Error as an Exploration Objective in Deep RL","version":5},"cited_work":{"arxiv_id":"1906.08189","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.08189","snapshot_observed_at":"2026-08-10T00:46:16.700725Z","title":"Reward Prediction Error as an Exploration Objective in Deep RL","venue":"cs.LG","work_id":"a576cc0f-fb9b-4143-8e13-9ed93125dc12","year":2019},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.627084Z"},"links":{"cited_paper":"/paper/1906.08189","citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:c7f569ab555bcc5ceb7531837e6a45aadf18b1623fe6ad7c9503c045d973204d","observation_id":"46c97f99-e63c-481d-90ae-0e58e21e326a","resolution":{"observed_at":"2026-08-10T00:46:16.705585Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:16.791531Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"0baa8b7e-0d7d-49a1-9f73-88ac45050f6b","year":2012},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.630766Z"},"links":{"citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:2cecd3b323149d4e2e5359796cea455a4eef3754a880ff826626ce20a2df8334","observation_id":"5e3cd7c3-1e91-4a00-bab0-26d78690fdf5","resolution":{"observed_at":"2026-08-10T00:46:16.795354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08387","last_updated":"2019-06-19T22:46:39Z","snapshot_observed_at":"2026-08-19T23:34:07.013152Z","submitted_at":"2019-06-19T22:46:39Z","title":"Experience Replay Optimization","version":1},"cited_work":{"arxiv_id":"1906.08387","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.08387","snapshot_observed_at":"2026-08-10T00:46:16.684188Z","title":"Experience Replay Optimization","venue":"cs.LG","work_id":"0734db0d-004e-45d4-824b-af7317e532c8","year":2019},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.634365Z"},"links":{"cited_paper":"/paper/1906.08387","citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:bbb93fc35d38706d919fde639b97a8c2178318a26fa83d9583fda7d16ac7bc1c","observation_id":"ad5cd5ab-ffaf-46ff-848a-3fd911c0a52e","resolution":{"observed_at":"2026-08-10T00:46:16.689312Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02246","last_updated":"2022-05-03T08:21:55Z","snapshot_observed_at":"2026-08-16T17:09:29.734215Z","submitted_at":"2022-04-04T12:38:58Z","title":"Continuously Discovering Novel Strategies via Reward-Switching Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02246","snapshot_observed_at":"2026-08-10T00:46:16.638153Z","title":"Continuously discovering novel strategies via reward-switching policy optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.638153Z"},"links":{"cited_paper":"/paper/2204.02246","citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:8585f2c79c51557a4f89292e0f9a092adf351f70ef82e4a7102b3f0660e3c642","observation_id":"6a105918-acd3-4fbf-aed2-097036a68bd8","resolution":{"observed_at":"2026-08-10T00:46:16.638153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:46:16.642210Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.642210Z"},"links":{"citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:f839590b9bc4bfc17f5aa86438583dfe9c52a983d31a4024937f33fc0c4b7e3b","observation_id":"d4181f3f-583b-4401-8f20-67187c000994","resolution":{"observed_at":"2026-08-10T00:46:16.642210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":4,"verified_fuzzy":11},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2501.18093."}