{"as_of":"2026-08-16T15:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3db1e2eb319acc98d73d46742e8926aab5bf8032a4d022f855675851b376f7d7","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T14:49:25.531670Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T12:33:26.408771Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-14T05:24:51.266012Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.02388","last_updated":"2021-09-24T18:45:15Z","snapshot_observed_at":"2026-08-14T19:04:18.184961Z","submitted_at":"2019-08-06T22:36:35Z","title":"Benchmarking Bonus-Based Exploration Methods on the Arcade Learning Environment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02388","snapshot_observed_at":"2026-08-14T12:33:26.408771Z","title":"Benchmarking bonus-based exploration methods on the arcade learning environment","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"1908.06976","last_updated":"2019-11-19T14:40:14Z","snapshot_observed_at":"2026-08-14T12:28:56.518217Z","submitted_at":"2019-08-19T16:22:20Z","title":"A survey on intrinsic motivation in reinforcement learning","version":2},"reference_index":182,"source":"arxiv_source","source_observed_at":"2026-08-14T12:33:26.408771Z"},"links":{"cited_paper":"/paper/1908.02388","citing_paper":"/paper/1908.06976"},"observation_digest":"sha256:51a6fcb5d69ccaa94d6c9e3fee37742d64f5b8296496a71c4b9fbd9b49fcd52c","observation_id":"0493b36a-b47e-48a7-bd10-19ff93967054","resolution":{"observed_at":"2026-08-14T12:33:26.408771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02388","last_updated":"2021-09-24T18:45:15Z","snapshot_observed_at":"2026-08-14T19:04:18.184961Z","submitted_at":"2019-08-06T22:36:35Z","title":"Benchmarking Bonus-Based Exploration Methods on the Arcade Learning Environment","version":3},"cited_work":{"arxiv_id":"1908.02388","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.02388","snapshot_observed_at":"2026-08-14T05:24:51.266012Z","title":"Benchmarking Bonus-Based Exploration Methods on the Arcade Learning Environment","venue":"cs.LG","work_id":"87c13251-5275-4c45-83b3-971c48e89617","year":2019},"citing_paper":{"arxiv_id":"1909.01387","last_updated":"2019-09-03T18:20:48Z","snapshot_observed_at":"2026-08-14T19:05:41.234386Z","submitted_at":"2019-09-03T18:20:48Z","title":"Making Efficient Use of Demonstrations to Solve Hard Exploration Problems","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-14T05:24:51.199994Z"},"links":{"cited_paper":"/paper/1908.02388","citing_paper":"/paper/1909.01387"},"observation_digest":"sha256:2f89c6eee97026ce144c529a5fe3e077bb33342e1a50e8b9fb1888fda31e1727","observation_id":"0bc158d1-2a89-435a-9969-ffe37c3f5c86","resolution":{"observed_at":"2026-08-14T05:24:51.269765Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1908.02388/citation-record","integrity":"/paper/1908.02388/integrity","json":"/paper/1908.02388/citation-record.json","paper":"/paper/1908.02388"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:49:25.691074Z","title":"The relative ranking of methods differs from the one observed on MONTEZUMA ’S REVENGE","venue":null,"work_id":"bbd2d0ab-ace0-4a18-8c80-6a51fb0dded7","year":2000},"citing_paper":{"arxiv_id":"1908.02388","last_updated":"2021-09-24T18:45:15Z","snapshot_observed_at":"2026-08-14T19:04:18.184961Z","submitted_at":"2019-08-06T22:36:35Z","title":"Benchmarking Bonus-Based Exploration Methods on the Arcade Learning Environment","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T14:49:25.522824Z"},"links":{"citing_paper":"/paper/1908.02388"},"observation_digest":"sha256:1c6002189472c90ce70ef18da25da993bd7a98fa3f2206496bddd6120d278538","observation_id":"14dd12e1-55e2-42ec-8513-b8fa056e87a8","resolution":{"observed_at":"2026-08-14T14:49:25.695872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.11622","last_updated":"2019-11-26T16:48:02Z","snapshot_observed_at":"2026-08-14T18:46:09.633567Z","submitted_at":"2018-07-31T01:25:44Z","title":"Count-Based Exploration with the Successor Representation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.11622","snapshot_observed_at":"2026-08-14T14:49:25.486107Z","title":"C., Bellemare, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.02388","last_updated":"2021-09-24T18:45:15Z","snapshot_observed_at":"2026-08-14T19:04:18.184961Z","submitted_at":"2019-08-06T22:36:35Z","title":"Benchmarking Bonus-Based Exploration Methods on the Arcade Learning Environment","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T14:49:25.486107Z"},"links":{"cited_paper":"/paper/1807.11622","citing_paper":"/paper/1908.02388"},"observation_digest":"sha256:09a7c7be844cd0c1092691298c5425354d2bb83806d306f3c8ab810ad3eabba5","observation_id":"19c19b42-0809-4da6-8191-bbc32c812785","resolution":{"observed_at":"2026-08-14T14:49:25.486107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:49:25.665614Z","title":null,"venue":null,"work_id":"ad5b55b5-c0a1-41fc-8018-48a16b154ef8","year":2015},"citing_paper":{"arxiv_id":"1908.02388","last_updated":"2021-09-24T18:45:15Z","snapshot_observed_at":"2026-08-14T19:04:18.184961Z","submitted_at":"2019-08-06T22:36:35Z","title":"Benchmarking Bonus-Based Exploration Methods on the Arcade Learning Environment","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T14:49:25.531670Z"},"links":{"citing_paper":"/paper/1908.02388"},"observation_digest":"sha256:123360cf703bd9b85168d75dd5a5abff7e82fe7095c008e93eb740dd44a3caec","observation_id":"df733ac9-03d9-4b9c-bf05-8111888029d2","resolution":{"observed_at":"2026-08-14T14:49:25.669553Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-08-15T17:33:32.559096Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-14T14:49:25.499942Z","title":"Priori- tized experience replay.arXiv preprint arXiv:1511.05952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.02388","last_updated":"2021-09-24T18:45:15Z","snapshot_observed_at":"2026-08-14T19:04:18.184961Z","submitted_at":"2019-08-06T22:36:35Z","title":"Benchmarking Bonus-Based Exploration Methods on the Arcade Learning Environment","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T14:49:25.499942Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/1908.02388"},"observation_digest":"sha256:4f99135128a973960ec1689fb2774d1583d5de19f62e7d5e79bc3fb092b1851a","observation_id":"5f071908-6094-4ec0-862c-d475a41b76c8","resolution":{"observed_at":"2026-08-14T14:49:25.499942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1507.00814","last_updated":"2015-11-19T22:40:30Z","snapshot_observed_at":"2026-08-14T22:41:54.228211Z","submitted_at":"2015-07-03T04:11:15Z","title":"Incentivizing Exploration In Reinforcement Learning With Deep Predictive Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1507.00814","snapshot_observed_at":"2026-08-14T14:49:25.506043Z","title":"C., Levine, S., and Abbeel, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.02388","last_updated":"2021-09-24T18:45:15Z","snapshot_observed_at":"2026-08-14T19:04:18.184961Z","submitted_at":"2019-08-06T22:36:35Z","title":"Benchmarking Bonus-Based Exploration Methods on the Arcade Learning Environment","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T14:49:25.506043Z"},"links":{"cited_paper":"/paper/1507.00814","citing_paper":"/paper/1908.02388"},"observation_digest":"sha256:620f4860a01ffd22f51f13bbcc60c110f0ace6187ee6637d431850aefe7285e0","observation_id":"393f7761-e1af-4ee2-a896-3852e8c7a2c1","resolution":{"observed_at":"2026-08-14T14:49:25.506043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.02315","last_updated":"2019-06-28T19:08:17Z","snapshot_observed_at":"2026-08-15T14:56:49.958095Z","submitted_at":"2018-06-06T17:32:24Z","title":"Randomized Value Functions via Multiplicative Normalizing Flows","version":3},"cited_work":{"arxiv_id":"1806.02315","doi":null,"metadata_source":"pith","pith_arxiv_id":"1806.02315","snapshot_observed_at":"2026-08-14T14:49:25.575593Z","title":"Randomized Value Functions via Multiplicative Normalizing Flows","venue":"cs.LG","work_id":"d224d266-1961-4374-9436-c74949a331a9","year":2018},"citing_paper":{"arxiv_id":"1908.02388","last_updated":"2021-09-24T18:45:15Z","snapshot_observed_at":"2026-08-14T19:04:18.184961Z","submitted_at":"2019-08-06T22:36:35Z","title":"Benchmarking Bonus-Based Exploration Methods on the Arcade Learning Environment","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T14:49:25.510578Z"},"links":{"cited_paper":"/paper/1806.02315","citing_paper":"/paper/1908.02388"},"observation_digest":"sha256:3082317ee01570f42e63bceba279cdc92f583e5a92c71576bcf6fc117d064727","observation_id":"d79e6a2b-f834-4729-b296-81b768996423","resolution":{"observed_at":"2026-08-14T14:49:25.582259Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.06759","last_updated":"2016-08-19T14:10:16Z","snapshot_observed_at":"2026-08-14T22:13:10.910190Z","submitted_at":"2016-01-25T20:34:24Z","title":"Pixel Recurrent Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.06759","snapshot_observed_at":"2026-08-14T14:49:25.514771Z","title":"Pixel recurrent neural networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.02388","last_updated":"2021-09-24T18:45:15Z","snapshot_observed_at":"2026-08-14T19:04:18.184961Z","submitted_at":"2019-08-06T22:36:35Z","title":"Benchmarking Bonus-Based Exploration Methods on the Arcade Learning Environment","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T14:49:25.514771Z"},"links":{"cited_paper":"/paper/1601.06759","citing_paper":"/paper/1908.02388"},"observation_digest":"sha256:9e78ff70f0d08c887793d923f19ff9a439f4aee889a65feb6039455242fdfd58","observation_id":"c537773c-66bc-49d5-967b-190f627b0bef","resolution":{"observed_at":"2026-08-14T14:49:25.514771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:49:25.704445Z","title":null,"venue":null,"work_id":"ed6da062-e392-4d82-a7f1-d7a2478bcc75","year":2000},"citing_paper":{"arxiv_id":"1908.02388","last_updated":"2021-09-24T18:45:15Z","snapshot_observed_at":"2026-08-14T19:04:18.184961Z","submitted_at":"2019-08-06T22:36:35Z","title":"Benchmarking Bonus-Based Exploration Methods on the Arcade Learning Environment","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T14:49:25.518779Z"},"links":{"citing_paper":"/paper/1908.02388"},"observation_digest":"sha256:391e39e6117cddeaf216a211aa23ca8408ad03b4095540723f82556cec5d5c8c","observation_id":"7e701219-c824-417f-9428-06cceb9f7cbd","resolution":{"observed_at":"2026-08-14T14:49:25.708333Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:49:25.677424Z","title":"Rainbow with ϵ-greedy exploration performs as well as other more complex exploration method","venue":null,"work_id":"68d7729d-f969-4474-aa6e-6d58375a12ad","year":2000},"citing_paper":{"arxiv_id":"1908.02388","last_updated":"2021-09-24T18:45:15Z","snapshot_observed_at":"2026-08-14T19:04:18.184961Z","submitted_at":"2019-08-06T22:36:35Z","title":"Benchmarking Bonus-Based Exploration Methods on the Arcade Learning Environment","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T14:49:25.526629Z"},"links":{"citing_paper":"/paper/1908.02388"},"observation_digest":"sha256:674599a1bdc2ba89281fa3cac3fee7397cd93b3d616afad0b110b2ab9c553a0d","observation_id":"5f1868bc-5318-4b3f-aecd-c789a3e5a82e","resolution":{"observed_at":"2026-08-14T14:49:25.682534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:49:25.716673Z","title":"P., Mirza, M., Graves, A., Lillicrap, T., Harley, T., Silver, D., and Kavukcuoglu, K","venue":null,"work_id":"7d311012-3324-4dd0-8074-7eb2fdf7f831","year":1928},"citing_paper":{"arxiv_id":"1908.02388","last_updated":"2021-09-24T18:45:15Z","snapshot_observed_at":"2026-08-14T19:04:18.184961Z","submitted_at":"2019-08-06T22:36:35Z","title":"Benchmarking Bonus-Based Exploration Methods on the Arcade Learning Environment","version":3},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-14T14:49:25.490947Z"},"links":{"citing_paper":"/paper/1908.02388"},"observation_digest":"sha256:f19d658d74a4146d529f441334d800484ad4008c94be0404f06d495aa8fadcc1","observation_id":"bdf42e76-f177-4a78-96fa-bf52aaa7df74","resolution":{"observed_at":"2026-08-14T14:49:25.720970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.05380","last_updated":"2018-10-22T15:25:04Z","snapshot_observed_at":"2026-08-14T20:32:41.188355Z","submitted_at":"2017-09-15T19:55:58Z","title":"The Uncertainty Bellman Equation and Exploration","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.05380","snapshot_observed_at":"2026-08-14T14:49:25.495303Z","title":"The uncertainty bellman equation and exploration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.02388","last_updated":"2021-09-24T18:45:15Z","snapshot_observed_at":"2026-08-14T19:04:18.184961Z","submitted_at":"2019-08-06T22:36:35Z","title":"Benchmarking Bonus-Based Exploration Methods on the Arcade Learning Environment","version":3},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-14T14:49:25.495303Z"},"links":{"cited_paper":"/paper/1709.05380","citing_paper":"/paper/1908.02388"},"observation_digest":"sha256:618550fe5e370702cee8a54137e25aa241cdd365c37dacaa11bcea6fb0f399ea","observation_id":"0e9ad346-ed47-4757-b5d7-56791f537f3b","resolution":{"observed_at":"2026-08-14T14:49:25.495303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.04355","last_updated":"2018-08-13T17:58:01Z","snapshot_observed_at":"2026-08-14T18:41:41.282322Z","submitted_at":"2018-08-13T17:58:01Z","title":"Large-Scale Study of Curiosity-Driven Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.04355","snapshot_observed_at":"2026-08-14T14:49:25.470844Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.02388","last_updated":"2021-09-24T18:45:15Z","snapshot_observed_at":"2026-08-14T19:04:18.184961Z","submitted_at":"2019-08-06T22:36:35Z","title":"Benchmarking Bonus-Based Exploration Methods on the Arcade Learning Environment","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-14T14:49:25.470844Z"},"links":{"cited_paper":"/paper/1808.04355","citing_paper":"/paper/1908.02388"},"observation_digest":"sha256:8da9752668fad7c3e6dd51f924ca5d5c2c43d00f45ee0724d0d662ce31f69dd7","observation_id":"e7e9db91-e43f-4371-b293-633742fc1b81","resolution":{"observed_at":"2026-08-14T14:49:25.470844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.04012","last_updated":"2018-04-11T14:21:53Z","snapshot_observed_at":"2026-08-14T19:27:01.843383Z","submitted_at":"2018-04-11T14:21:53Z","title":"DORA The Explorer: Directed Outreaching Reinforcement Action-Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.04012","snapshot_observed_at":"2026-08-14T14:49:25.480419Z","title":"Dora the explorer: Directed outreaching reinforcement action- selection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.02388","last_updated":"2021-09-24T18:45:15Z","snapshot_observed_at":"2026-08-14T19:04:18.184961Z","submitted_at":"2019-08-06T22:36:35Z","title":"Benchmarking Bonus-Based Exploration Methods on the Arcade Learning Environment","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-14T14:49:25.480419Z"},"links":{"cited_paper":"/paper/1804.04012","citing_paper":"/paper/1908.02388"},"observation_digest":"sha256:15ac6c22a4698d8d11f74ce2d08db204470e591e4d1a513ca67a280763ef0712","observation_id":"dd0baacc-1615-486b-9105-0834f2409783","resolution":{"observed_at":"2026-08-14T14:49:25.480419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06110","last_updated":"2018-12-14T19:03:38Z","snapshot_observed_at":"2026-08-14T19:03:45.460809Z","submitted_at":"2018-12-14T19:03:38Z","title":"Dopamine: A Research Framework for Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06110","snapshot_observed_at":"2026-08-14T14:49:25.475786Z","title":"S., Moitra, S., Gelada, C., Kumar, S., and Belle- mare, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.02388","last_updated":"2021-09-24T18:45:15Z","snapshot_observed_at":"2026-08-14T19:04:18.184961Z","submitted_at":"2019-08-06T22:36:35Z","title":"Benchmarking Bonus-Based Exploration Methods on the Arcade Learning Environment","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-14T14:49:25.475786Z"},"links":{"cited_paper":"/paper/1812.06110","citing_paper":"/paper/1908.02388"},"observation_digest":"sha256:8e634d98f44f1b43dac2cc7468895910a7fc92effd46cf307f6c577fc100f869","observation_id":"3fd709d9-7856-4d0d-b6e2-81af30b8cd85","resolution":{"observed_at":"2026-08-14T14:49:25.475786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"1908.02388","last_updated":"2021-09-24T18:45:15Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T19:04:18.184961Z","submitted_at":"2019-08-06T22:36:35Z","title":"Benchmarking Bonus-Based Exploration Methods on the Arcade Learning Environment"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 2 inbound Pith citation observations for arXiv:1908.02388."}