{"as_of":"2026-08-23T14:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b4bdcc41fcce96fe9b9295382059ab75ee06ef6a99520e17cfaae22b8fed95e4","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":75,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:40:31.219392Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1690,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T19:49:38.960459Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/1606.01540"},"observation_digest":"sha256:4117f01811052683447f3573515aba82a44c0dbc91f725bed676aa4d7ce9f892","observation_id":"7d34af5c-57b3-4bb8-9b88-46e76156235c","resolution":{"observed_at":"2026-05-11T19:49:39.040735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T07:44:14.707183Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/1801.00690"},"observation_digest":"sha256:1b721ee418f3bb6b9c46a24c47427acf4e14e1a9b577b842fa333ba66e3c9a23","observation_id":"696e50c7-cce6-4c80-9ffe-16489702aa79","resolution":{"observed_at":"2026-05-13T07:44:14.745723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"1906.10182","last_updated":"2019-06-24T19:17:34Z","snapshot_observed_at":"2026-08-18T21:16:27.922719Z","submitted_at":"2019-06-24T19:17:34Z","title":"Planning Robot Motion using Deep Visual Prediction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T17:07:52.962491Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/1906.10182"},"observation_digest":"sha256:4b296afbe03e5ece8d72437bb039f7cc1ecc9faf9e61a299039d8eef0e318541","observation_id":"7fd0cc43-369f-47b0-9570-f86bcfa0370d","resolution":{"observed_at":"2026-05-25T17:11:04.468747Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"1907.03098","last_updated":"2019-07-06T09:07:28Z","snapshot_observed_at":"2026-08-18T19:14:48.920492Z","submitted_at":"2019-07-06T09:07:28Z","title":"Playing Flappy Bird via Asynchronous Advantage Actor Critic Algorithm","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-25T01:41:09.116967Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/1907.03098"},"observation_digest":"sha256:ed6d99542d4bba5ffd60c5f8b7aff7b06679c4fe4203df9009246c6029433006","observation_id":"bd3fc7f1-22af-4456-82eb-e47337075e50","resolution":{"observed_at":"2026-05-25T01:45:11.091962Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"1907.10097","last_updated":"2019-07-23T18:41:49Z","snapshot_observed_at":"2026-08-15T05:30:11.952263Z","submitted_at":"2019-07-23T18:41:49Z","title":"Learning-based Hamilton-Jacobi-Bellman Methods for Optimal Control","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-24T17:07:07.010918Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/1907.10097"},"observation_digest":"sha256:c67bab546363612082ae6afafb774fb91fa2221ce1802948757e14972eb9aa4b","observation_id":"3365c85b-6ab5-4066-a609-dd17c2d4e01d","resolution":{"observed_at":"2026-05-24T17:09:43.654399Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-14T13:55:04.879719Z","title":", Harley , Tim , Silver , David & Kavukcuoglu , Koray 2016 Asynchronous M ethods for D eep R einforcement L earning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.04127","last_updated":"2021-02-25T16:48:30Z","snapshot_observed_at":"2026-08-19T18:45:42.214255Z","submitted_at":"2019-08-12T12:51:14Z","title":"A review on Deep Reinforcement Learning for Fluid Mechanics","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-14T13:55:04.879719Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/1908.04127"},"observation_digest":"sha256:1c5cb0587d29fdf44d148f5e09654fc0c95fa98865b2ca35b7d9d6cea73a2c2e","observation_id":"22c6086b-795c-4bc9-a9db-cc3ab5de304a","resolution":{"observed_at":"2026-08-14T13:55:04.879719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-14T10:49:41.216476Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.10398","last_updated":"2019-08-27T18:30:49Z","snapshot_observed_at":"2026-08-17T11:03:21.065850Z","submitted_at":"2019-08-27T18:30:49Z","title":"A Data-Efficient Deep Learning Approach for Deployable Multimodal Social Robots","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T10:49:41.216476Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/1908.10398"},"observation_digest":"sha256:9ffd6216e314f43073bca02ed2e76859c074020a711fe827a7e5959bd3da4029","observation_id":"87fd2502-6505-4412-867a-1b9eeb0d9faf","resolution":{"observed_at":"2026-08-14T10:49:41.216476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-14T10:46:45.733859Z","title":"Lillicrap, Tim Harley, David Silver, and Koray Kavukcuoglu","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.10449","last_updated":"2020-04-16T17:23:30Z","snapshot_observed_at":"2026-08-16T05:55:19.587445Z","submitted_at":"2019-08-27T20:11:54Z","title":"Interactive Machine Comprehension with Information Seeking Agents","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-14T10:46:45.733859Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/1908.10449"},"observation_digest":"sha256:97513e4fd497bc7b25fec1963de89cc3995549a7c1e27bd02b85d6c12d520342","observation_id":"aaf56b0a-7703-4f52-907e-ec63b8d02bed","resolution":{"observed_at":"2026-08-14T10:46:45.733859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-14T05:15:24.499065Z","title":"CoRR abs/1602.01783","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1909.01646","last_updated":"2019-09-04T09:30:55Z","snapshot_observed_at":"2026-08-16T13:54:08.800141Z","submitted_at":"2019-09-04T09:30:55Z","title":"LeDeepChef: Deep Reinforcement Learning Agent for Families of Text-Based Games","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T05:15:24.499065Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/1909.01646"},"observation_digest":"sha256:e19ec867b57d6d2aae1e9b9ef62dddbc51fa83aca32fe3b592e45ac4921ae5c7","observation_id":"9ad68b37-3473-49fa-b5ca-106efdd57084","resolution":{"observed_at":"2026-08-14T05:15:24.499065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2102.01293","last_updated":"2021-02-02T04:07:38Z","snapshot_observed_at":"2026-08-01T22:46:19.170916Z","submitted_at":"2021-02-02T04:07:38Z","title":"Scaling Laws for Transfer","version":1},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-05-18T00:58:13.116663Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2102.01293"},"observation_digest":"sha256:4ea22230631f45bb9ac6b8d79962d02ecef178bf11264682f75cad3d76945df1","observation_id":"dfa9f271-75b2-4586-9e41-a6c6f4b7cd12","resolution":{"observed_at":"2026-05-18T00:58:13.798226Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"reference_index":155,"source":"arxiv_source","source_observed_at":"2026-05-11T14:22:57.925354Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2112.00861"},"observation_digest":"sha256:115e9fe1681498d46a346a11e2989f39bfb2af10577e5c7f7487475f2195afa4","observation_id":"1f12c442-ffb7-43b8-a65e-425a42d1a472","resolution":{"observed_at":"2026-05-11T14:22:59.709358Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-14T05:42:29.067319Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"reference_index":232,"source":"arxiv_source","source_observed_at":"2026-05-10T15:42:47.274448Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2207.05221"},"observation_digest":"sha256:d53f5085940e3f1b3229fd547d3198003f9ef0a26d607a4f387fce8d9564c5b1","observation_id":"f8e3bb1e-7f9b-4018-a7b4-4c0c6c0c960e","resolution":{"observed_at":"2026-05-10T15:42:47.903225Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-08-15T10:07:24.540946Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-15T21:32:27.806494Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2309.00267"},"observation_digest":"sha256:2e4c25658dff6b3c4be7fb6cbebe0c96396b9edfd51de96dd5ece71b470cb9c9","observation_id":"0bb2fa49-ca35-4ddd-ad8e-f5c63a2402fb","resolution":{"observed_at":"2026-05-15T21:32:28.007411Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-08-16T03:33:39.637646Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-17T12:04:10.210508Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2409.12917"},"observation_digest":"sha256:b5ce1fe2b53115a1da5f690ffbc2fef8a768e3fed837eb58ab7a06ec3c8f2ff9","observation_id":"54b7432c-7d0e-4e4f-9e57-d19cca6b0979","resolution":{"observed_at":"2026-05-17T12:04:10.523459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-12T21:02:52.716505Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09176","last_updated":"2025-03-23T09:34:04Z","snapshot_observed_at":"2026-08-15T20:14:24.445340Z","submitted_at":"2024-11-14T04:29:07Z","title":"Gazing at Rewards: Eye Movements as a Lens into Human and AI Decision-Making in Hybrid Visual Foraging","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T21:02:52.716505Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2411.09176"},"observation_digest":"sha256:48f9250fe67776928aaffeec42441b92d9c60a087c54226225bc23e1cf7d12cf","observation_id":"99fea828-7ca7-4e2e-a18b-1250c1e0c188","resolution":{"observed_at":"2026-08-12T21:02:52.716505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-12T19:18:52.613740Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.613740Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:71a05e622fb5546ab159e4d76a837d0ae08bfff82af2db4b89053c4ddbbbfa84","observation_id":"edf825ab-7dd8-48cd-9259-1bc7e99ec9f3","resolution":{"observed_at":"2026-08-12T19:18:52.613740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-12T18:13:49.389644Z","title":"Mnih et al., Asynchronous Methods for Deep Reinforcement Learning, arXiv:1602.01783 [cs], Jun","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11778","last_updated":"2024-11-18T17:55:02Z","snapshot_observed_at":"2026-08-19T04:01:05.939604Z","submitted_at":"2024-11-18T17:55:02Z","title":"Design And Optimization Of Multi-rendezvous Manoeuvres Based On Reinforcement Learning And Convex Optimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T18:13:49.389644Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2411.11778"},"observation_digest":"sha256:6923d5a429476b42a9d4b207bb8260624ff27bf62352400407007cf73a94149f","observation_id":"68f71c4d-2e5c-4d02-90fd-9d64c7443265","resolution":{"observed_at":"2026-08-12T18:13:49.389644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-12T13:55:18.247491Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.15841","last_updated":"2025-02-12T04:37:51Z","snapshot_observed_at":"2026-08-17T11:03:22.582390Z","submitted_at":"2024-11-24T13:45:26Z","title":"Reinforcement Learning Enhancing Entanglement for Two-Photon-Driven Rabi Model","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T13:55:18.247491Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2411.15841"},"observation_digest":"sha256:055bf317b2107f7d04e3fab0cdd5caf344870416eb3a4e576ff60c675ae0c9cc","observation_id":"32cf4eb9-3378-41f6-859d-4a9a906e440d","resolution":{"observed_at":"2026-08-12T13:55:18.247491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-12T13:14:39.175729Z","title":"Lillicrap, Tim Harley, David Silver, and Koray Kavukcuoglu","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.16427","last_updated":"2024-11-25T14:29:39Z","snapshot_observed_at":"2026-08-21T19:26:58.951575Z","submitted_at":"2024-11-25T14:29:39Z","title":"Unsupervised Event Outlier Detection in Continuous Time","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T13:14:39.175729Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2411.16427"},"observation_digest":"sha256:129381296d5021ee6d748719d165af5d1744bdfaf220f49d534591eaafe2906f","observation_id":"eb1d32b8-4509-494f-8d00-70b0407f7eca","resolution":{"observed_at":"2026-08-12T13:14:39.175729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2412.02818","last_updated":"2026-05-18T18:24:46Z","snapshot_observed_at":"2026-08-17T08:39:33.945155Z","submitted_at":"2024-12-03T20:34:51Z","title":"RoboMD: Uncovering Robot Vulnerabilities through Semantic Potential Fields","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-23T07:49:37.878395Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2412.02818"},"observation_digest":"sha256:dca22f4c9aaaf7aebcedd3394b5c1ed5a880dbaf5899c72d99afc230f8973f38","observation_id":"f7db30ff-f74b-4f2a-94b4-919a94b7b585","resolution":{"observed_at":"2026-05-23T07:52:43.766860Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2412.19538","last_updated":"2024-12-27T09:07:11Z","snapshot_observed_at":"2026-08-14T22:58:57.025279Z","submitted_at":"2024-12-27T09:07:11Z","title":"Scalable Hierarchical Reinforcement Learning for Hyper Scale Multi-Robot Task Planning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-23T06:45:01.088161Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2412.19538"},"observation_digest":"sha256:bb949299da9d9b2db7d0bfed7f7b056e7fb00a73a14e8786485c05a730b64bed","observation_id":"4a386bf2-d15d-4c8d-9099-e68a04421060","resolution":{"observed_at":"2026-05-23T06:45:28.209245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-10T22:51:52.669280Z","title":"Asynchronous methods for deep reinforcemen t learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.00562","last_updated":"2025-01-03T06:28:02Z","snapshot_observed_at":"2026-08-17T02:37:19.762864Z","submitted_at":"2024-12-31T17:48:33Z","title":"An Overview and Discussion on Using Large Language Models for Implementation Generation of Solutions to Open-Ended Problems","version":2},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-08-10T22:51:52.669280Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2501.00562"},"observation_digest":"sha256:808403cee0e555549aa7316ea0697d63147fc18cd621941fb01c3edc35fae354","observation_id":"54af0541-f35f-4461-8bbf-2fc7a6cc3619","resolution":{"observed_at":"2026-08-10T22:51:52.669280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-10T21:56:24.577130Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.03405","last_updated":"2025-01-06T22:00:02Z","snapshot_observed_at":"2026-08-13T19:22:42.425428Z","submitted_at":"2025-01-06T22:00:02Z","title":"A Study of the Efficacy of Generative Flow Networks for Robotics and Machine Fault-Adaptation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:24.577130Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2501.03405"},"observation_digest":"sha256:14659e63be13529c303a01314e66250974883aa5e041d659a761ca8b6716befd","observation_id":"2f2f5828-4238-4372-a018-241c3ad6916c","resolution":{"observed_at":"2026-08-10T21:56:24.577130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-09T17:31:58.313102Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.00870","last_updated":"2025-02-02T18:44:08Z","snapshot_observed_at":"2026-08-14T20:21:15.370256Z","submitted_at":"2025-02-02T18:44:08Z","title":"FedHPD: Heterogeneous Federated Reinforcement Learning via Policy Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T17:31:58.313102Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2502.00870"},"observation_digest":"sha256:25fe31d6440006776a7275d05bba8929c6f51bd1207001b466ff7ed3e138f18b","observation_id":"5a10a953-c197-4bd2-8f65-696442f513e3","resolution":{"observed_at":"2026-08-09T17:31:58.313102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-09T15:32:47.787354Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.01387","last_updated":"2025-02-20T14:09:01Z","snapshot_observed_at":"2026-08-15T23:13:36.293817Z","submitted_at":"2025-02-03T14:22:03Z","title":"TeLL-Drive: Enhancing Autonomous Driving with Teacher LLM-Guided Deep Reinforcement Learning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T15:32:47.787354Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2502.01387"},"observation_digest":"sha256:3575c210660c10aa57bfbb20fab6d79751e96f7e9b5a19b48fc6fe759063e90c","observation_id":"b0c26e35-f012-4f53-8a5c-1ad5fc9620e7","resolution":{"observed_at":"2026-08-09T15:32:47.787354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-08T13:08:22.762086Z","title":"P., Mirza, M., Graves, A., Lillicrap, T","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07350","last_updated":"2025-09-06T07:54:06Z","snapshot_observed_at":"2026-08-21T22:56:50.404094Z","submitted_at":"2025-02-11T08:22:12Z","title":"KABB: Knowledge-Aware Bayesian Bandits for Dynamic Expert Coordination in Multi-Agent Systems","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T13:08:22.762086Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2502.07350"},"observation_digest":"sha256:32595ed7cc0c992ee8c54f0e9c05f9c703b76c88fd5dbb8a930339e249894591","observation_id":"a82b35c9-b6df-4fba-8e8f-ad3c66baa1c6","resolution":{"observed_at":"2026-08-08T13:08:22.762086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-07T19:07:25.315321Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.10200","last_updated":"2025-02-14T14:50:05Z","snapshot_observed_at":"2026-08-18T11:46:24.014084Z","submitted_at":"2025-02-14T14:50:05Z","title":"Dynamic Reinforcement Learning for Actors","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T19:07:25.315321Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2502.10200"},"observation_digest":"sha256:d8c948c337ba2ba15da01c18e00cabbdfdcb9119013606f83c28cce08c88d8f0","observation_id":"c4c17a51-bb00-45b6-ad81-8d7f197e4ec4","resolution":{"observed_at":"2026-08-07T19:07:25.315321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-16T12:40:31.219392Z","title":"CoRR (2016), http://arxiv.org/abs/1602.01783 pix2pockets 15","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.12045","last_updated":"2025-04-16T13:01:44Z","snapshot_observed_at":"2026-08-17T11:04:14.907972Z","submitted_at":"2025-04-16T13:01:44Z","title":"pix2pockets: Shot Suggestions in 8-Ball Pool from a Single Image in the Wild","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:31.219392Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2504.12045"},"observation_digest":"sha256:8d9d12ac28ffed36ce98be2481aebe768869ec2638e39b43dad750b8bde8c0fb","observation_id":"d2975eba-7edd-418d-bf13-fd4d1096fcb0","resolution":{"observed_at":"2026-08-16T12:40:31.219392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-16T12:32:58.807134Z","title":"Lillicrap, Tim Harley, David Silver, and Koray Kavukcuoglu","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-17T11:05:06.253264Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.807134Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:73cf47b76f35878707a48fd64ed820d44ac92b4214f10981d40671971e09617e","observation_id":"6fcf6ed2-cde1-4d81-866b-802490fe6666","resolution":{"observed_at":"2026-08-16T12:32:58.807134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-16T11:23:58.569450Z","title":"Asynchronous methods for deep reinforcement learn- ing,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.15643","last_updated":"2025-04-22T07:01:00Z","snapshot_observed_at":"2026-08-19T23:37:07.882154Z","submitted_at":"2025-04-22T07:01:00Z","title":"Multimodal Perception for Goal-oriented Navigation: A Survey","version":1},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-08-16T11:23:58.569450Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2504.15643"},"observation_digest":"sha256:e7ad0b7499ac112c1b8ada83be3c4313376436f5ec7848c01bf2cbaca2d2774d","observation_id":"ed9d7e56-dc3c-4f0c-908b-fa1d512aee3c","resolution":{"observed_at":"2026-08-16T11:23:58.569450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-16T10:14:06.271633Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-19T06:50:46.092236Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.271633Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:36d80989b153383fc3e29b15e6e0c1973e7e225e16bd9cf5137178764aab9ac3","observation_id":"72f032a0-577c-4a5e-9367-3a1db2d3abdf","resolution":{"observed_at":"2026-08-16T10:14:06.271633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-15T22:34:58.371687Z","title":"Asynchronous methods for deep reinforcement learning.arXiv preprint arXiv:1602.01783, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.06875","last_updated":"2025-05-11T06:55:54Z","snapshot_observed_at":"2026-08-21T20:06:24.193658Z","submitted_at":"2025-05-11T06:55:54Z","title":"Towards Human-Centric Autonomous Driving: A Fast-Slow Architecture Integrating Large Language Model Guidance with Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:58.371687Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2505.06875"},"observation_digest":"sha256:f40bb6665f9e8aa708d3930687ec03d58a94cea0d1585f03502c4bf2cacf39fb","observation_id":"51c03c50-59b8-4898-a257-0cd29a06d884","resolution":{"observed_at":"2026-08-15T22:34:58.371687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-15T21:46:53.493674Z","title":"Lillicrap, Tim Harley, David Silver, and Koray Kavukcuoglu","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.09012","last_updated":"2025-05-13T23:01:34Z","snapshot_observed_at":"2026-08-21T22:59:27.473260Z","submitted_at":"2025-05-13T23:01:34Z","title":"Deep Reinforcement Learning for Power Grid Multi-Stage Cascading Failure Mitigation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T21:46:53.493674Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2505.09012"},"observation_digest":"sha256:b2c7a8fdb2c827ccdd91fa9453aca2c8be54d5c9d1e1d86eb79206697024f2f2","observation_id":"a1668cc2-f56f-402d-8c0c-05eb98f56aae","resolution":{"observed_at":"2026-08-15T21:46:53.493674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-07T14:47:33.377782Z","title":"Lill- icrap, Tim Harley, David Silver, and Koray Kavukcuoglu","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.17673","last_updated":"2025-05-23T09:38:55Z","snapshot_observed_at":"2026-08-17T12:59:24.474195Z","submitted_at":"2025-05-23T09:38:55Z","title":"Rethinking Agent Design: From Top-Down Workflows to Bottom-Up Skill Evolution","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:33.377782Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2505.17673"},"observation_digest":"sha256:8b89787af62721f097cbf139a04e81f6abd8828ffa55b8e7cb29f27e4420c7ad","observation_id":"fe5691a2-f0ba-4404-87a8-47154d372954","resolution":{"observed_at":"2026-08-07T14:47:33.377782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-07T13:58:12.489760Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20621","last_updated":"2025-05-27T01:59:25Z","snapshot_observed_at":"2026-08-14T04:48:58.835118Z","submitted_at":"2025-05-27T01:59:25Z","title":"Multi-level Certified Defense Against Poisoning Attacks in Offline Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:58:12.489760Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2505.20621"},"observation_digest":"sha256:2a53d91d028ed50d8ed910a3ea084f673605c5ace9aded44e03aa3557a8ff19d","observation_id":"ba73ae61-cfb2-491f-9418-3d1843619463","resolution":{"observed_at":"2026-08-07T13:58:12.489760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-07T13:33:41.814584Z","title":"org/abs/1602.01783","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21414","last_updated":"2025-05-27T16:41:23Z","snapshot_observed_at":"2026-08-17T23:56:57.491677Z","submitted_at":"2025-05-27T16:41:23Z","title":"A Framework for Adversarial Analysis of Decision Support Systems Prior to Deployment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:41.814584Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2505.21414"},"observation_digest":"sha256:3ff4589f03cab21a887cf2cf75c0ba9fb51f246605923bbc4f6e75dd1af06bb0","observation_id":"1120b463-225b-4942-965a-2a6283b476b5","resolution":{"observed_at":"2026-08-07T13:33:41.814584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-07T12:06:24.976984Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.00727","last_updated":"2025-12-01T18:13:13Z","snapshot_observed_at":"2026-08-22T00:12:22.591891Z","submitted_at":"2025-05-31T22:02:05Z","title":"Adaptive Plane Reformatting for 4D Flow MRI using Deep Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:24.976984Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2506.00727"},"observation_digest":"sha256:a08d48e8492659c9f734a8c4a7a38a2105c809069238c1eb8a63785c7e7985c4","observation_id":"c481c752-34aa-4139-be7e-d5181c79ecf2","resolution":{"observed_at":"2026-08-07T12:06:24.976984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-07T05:10:26.481993Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":null,"year":1928},"citing_paper":{"arxiv_id":"2506.13781","last_updated":"2025-06-10T08:09:30Z","snapshot_observed_at":"2026-08-19T23:27:37.360270Z","submitted_at":"2025-06-10T08:09:30Z","title":"Solving the Job Shop Scheduling Problem with Graph Neural Networks: A Customizable Reinforcement Learning Environment","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T05:10:26.481993Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2506.13781"},"observation_digest":"sha256:e62d64678497a720171c445288aa3254e90702761d49a7caa8ee5555f90131f7","observation_id":"27a06128-7d5a-4324-83f7-147c16b553a6","resolution":{"observed_at":"2026-08-07T05:10:26.481993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-07T00:24:54.163892Z","title":"Asynchronous methods for deep reinforcement learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.14237","last_updated":"2025-06-17T06:51:01Z","snapshot_observed_at":"2026-08-17T11:05:08.879929Z","submitted_at":"2025-06-17T06:51:01Z","title":"A Novel Indicator for Quantifying and Minimizing Information Utility Loss of Robot Teams","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:24:54.163892Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2506.14237"},"observation_digest":"sha256:80fcb1c70305316f96e22b30be749bca9df34e50b627117da117662af556fa56","observation_id":"3c73e8e0-a80e-498a-8187-b1edd0ccd205","resolution":{"observed_at":"2026-08-07T00:24:54.163892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-06T23:35:33.631192Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.17076","last_updated":"2025-06-20T15:26:38Z","snapshot_observed_at":"2026-08-10T23:15:49.455175Z","submitted_at":"2025-06-20T15:26:38Z","title":"Neural Polar Decoders for DNA Data Storage","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:33.631192Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2506.17076"},"observation_digest":"sha256:266c19ee2234e5efade43e03fe71867a27fa37cb4b19d20548de2bc762a39cec","observation_id":"fd448abc-a1b6-4269-9c39-d23c6934087f","resolution":{"observed_at":"2026-08-06T23:35:33.631192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-06T22:45:59.903971Z","title":"Asynchronous methods for deep rein- forcement learning.arXiv preprint arXiv:1602.01783, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.21037","last_updated":"2025-06-26T06:28:56Z","snapshot_observed_at":"2026-08-21T12:19:57.031078Z","submitted_at":"2025-06-26T06:28:56Z","title":"RL-Selector: Reinforcement Learning-Guided Data Selection via Redundancy Assessment","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:45:59.903971Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2506.21037"},"observation_digest":"sha256:c9291646b9a7969ee8ae51295572ecd4ff82b8ddb0b38f7fa1533a98c9504cc5","observation_id":"433b45d1-7f48-4c61-9f21-ec257892d076","resolution":{"observed_at":"2026-08-06T22:45:59.903971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-06T22:14:47.126380Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.22112","last_updated":"2025-06-30T06:57:33Z","snapshot_observed_at":"2026-08-20T09:55:34.682115Z","submitted_at":"2025-06-27T10:46:41Z","title":"Reward Balancing Revisited: Enhancing Offline Reinforcement Learning for Recommender Systems","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:47.126380Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2506.22112"},"observation_digest":"sha256:56f84668a7491fca4f78524c21333902d0182dd3c3be23d0389c7926e4b71bb2","observation_id":"523508df-9e4a-4d47-b649-03f98481f003","resolution":{"observed_at":"2026-08-06T22:14:47.126380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-06T14:17:11.967228Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.19639","last_updated":"2025-07-25T19:22:05Z","snapshot_observed_at":"2026-08-14T08:35:51.086899Z","submitted_at":"2025-07-25T19:22:05Z","title":"Directly Learning Stock Trading Strategies Through Profit Guided Loss Functions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:17:11.967228Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2507.19639"},"observation_digest":"sha256:d6626969609c938aa7ad4981f84ce89d87b758a7d449c6a1c961cf66a1e7fcf8","observation_id":"7a9254bb-725b-4328-893c-515d8b082723","resolution":{"observed_at":"2026-08-06T14:17:11.967228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-06T12:12:46.223383Z","title":"Lillicrap, Tim Harley, David Silver, and Koray Kavukcuoglu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22040","last_updated":"2025-07-29T17:41:45Z","snapshot_observed_at":"2026-08-21T17:25:46.837150Z","submitted_at":"2025-07-29T17:41:45Z","title":"Structure-Informed Deep Reinforcement Learning for Inventory Management","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T12:12:46.223383Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2507.22040"},"observation_digest":"sha256:e2a76fb9fbbe7dd829ac1901017cdca3275b2f6245b1a118f190dd7674b7c946","observation_id":"3b64227f-f450-4e22-a94e-ac4bc865b0ab","resolution":{"observed_at":"2026-08-06T12:12:46.223383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T20:19:13.333865Z","title":"P.; Mirza, M.; Graves, A.; Lillicrap, T","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.10872","last_updated":"2025-08-14T17:44:51Z","snapshot_observed_at":"2026-08-17T11:03:10.448854Z","submitted_at":"2025-08-14T17:44:51Z","title":"TLE-Based A2C Agent for Terrestrial Coverage Orbital Path Planning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T20:19:13.333865Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2508.10872"},"observation_digest":"sha256:560a8a75bd52002afd3117c9ac127b1c1c018a58ea7f3a426719c1f8126eea11","observation_id":"ca35866d-68cf-4483-ad6f-3c7d73f80369","resolution":{"observed_at":"2026-08-05T20:19:13.333865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-15T17:19:31.556905Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.13503","last_updated":"2025-08-19T04:31:10Z","snapshot_observed_at":"2026-08-21T03:17:29.966345Z","submitted_at":"2025-08-19T04:31:10Z","title":"AdaptiveAE: An Adaptive Exposure Strategy for HDR Capturing in Dynamic Scenes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T17:19:31.556905Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2508.13503"},"observation_digest":"sha256:e886bdf179650e05890fce4ace692a51b7e483313b2e9e4b9d0bd12045a9a246","observation_id":"9827bf37-c490-4fb5-9958-aaabe41af70d","resolution":{"observed_at":"2026-08-15T17:19:31.556905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2509.00338","last_updated":"2026-05-08T15:17:41Z","snapshot_observed_at":"2026-08-02T17:36:08.274992Z","submitted_at":"2025-08-30T03:42:10Z","title":"Scalable Option Learning in High-Throughput Environments","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-18T20:04:58.064472Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2509.00338"},"observation_digest":"sha256:8bdd68703517229915375ea1207cbbd77748e1227d50386dcd65d6527b422971","observation_id":"4a72d810-2e97-4afb-9b49-a44bb9e202b7","resolution":{"observed_at":"2026-05-18T20:06:49.781218Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T13:30:05.954112Z","title":"Asynchronous Methods for Deep Reinforcement Learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.00624","last_updated":"2025-08-30T22:43:14Z","snapshot_observed_at":"2026-08-21T18:20:41.847912Z","submitted_at":"2025-08-30T22:43:14Z","title":"Vehicle-in-Virtual-Environment (VVE) Method for Developing and Evaluating VRU Safety of Connected and Autonomous Driving with Focus on Bicyclist Safety","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-05T13:30:05.954112Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2509.00624"},"observation_digest":"sha256:1bac6001d2e214b9aaa671de0a3fbff17acdc892d558c82bfca243f70cb7d664","observation_id":"5c76b908-f463-42d1-9255-92feef361b61","resolution":{"observed_at":"2026-08-05T13:30:05.954112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T12:28:46.408590Z","title":"CoRR abs/1602.01783 (2016) 1602.01783 40","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.01576","last_updated":"2025-09-01T16:04:21Z","snapshot_observed_at":"2026-08-19T07:13:08.383241Z","submitted_at":"2025-09-01T16:04:21Z","title":"Structured AI Decision-Making in Disaster Management","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:46.408590Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2509.01576"},"observation_digest":"sha256:caa46de7787103f2e54feb1d47185189d48fead61eb6345afcdbbc2a062e0377","observation_id":"fb538c23-f11e-4350-97be-2124acce72db","resolution":{"observed_at":"2026-08-05T12:28:46.408590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T10:51:56.247540Z","title":"Asynchronous methods for deep reinforcement learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.03682","last_updated":"2025-09-03T20:05:58Z","snapshot_observed_at":"2026-08-15T23:26:54.812623Z","submitted_at":"2025-09-03T20:05:58Z","title":"A Comprehensive Review of Multi-Agent Reinforcement Learning in Video Games","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:56.247540Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2509.03682"},"observation_digest":"sha256:4abbb61b32524e230c3aacbef6faf4c0c4d26458b0777be8fafc61f517103d52","observation_id":"248a5cbe-6cef-4ebd-8c7d-b93670f362d6","resolution":{"observed_at":"2026-08-05T10:51:56.247540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-03T23:55:53.108582Z","title":"Asynchronous methods for deep reinforcement learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2511.04054","last_updated":"2026-05-24T04:19:57Z","snapshot_observed_at":"2026-08-15T11:35:31.202622Z","submitted_at":"2025-11-06T04:52:38Z","title":"Necessary and Sufficient Conditions for the Optimization-Based Concurrent Execution of Learned Robotic Tasks","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T23:55:53.108582Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2511.04054"},"observation_digest":"sha256:2a4a543609e55d3e299ce86a1792d3060ef12565c010ce2eba1577249838866a","observation_id":"477aea90-17af-4ccf-9725-f89da10cf80b","resolution":{"observed_at":"2026-08-03T23:55:53.108582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-03T20:57:11.920810Z","title":"Lillicrap, Tim Harley, David Silver, and Koray Kavukcuoglu","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2511.17852","last_updated":"2026-08-06T09:30:47Z","snapshot_observed_at":"2026-08-09T23:09:22.568411Z","submitted_at":"2025-11-22T00:38:43Z","title":"Transformers with RL or SFT Provably Learn Sparse Boolean Functions, But Differently","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T20:57:11.920810Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2511.17852"},"observation_digest":"sha256:0825000470f307153ad3f5edc82e6bbffb7990e08ede13d40acf0e517a196f20","observation_id":"c233880e-de16-48bb-86ea-b6f88f9ed7d2","resolution":{"observed_at":"2026-08-03T20:57:11.920810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-03T16:52:54.802605Z","title":"arXiv preprint arXiv:1602.01783","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.11944","last_updated":"2026-05-28T11:10:14Z","snapshot_observed_at":"2026-08-19T21:56:24.919179Z","submitted_at":"2025-12-12T14:01:24Z","title":"A Review of Learning-Based Motion Planning: Toward a Data-Driven Optimal Control Approach","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T16:52:54.802605Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2512.11944"},"observation_digest":"sha256:b95719a53182988887fdec5b8fad48d10364d441620316b77b49a4768457ccc2","observation_id":"7b9bc494-0ff0-42e0-afeb-d385aec7fcdb","resolution":{"observed_at":"2026-08-03T16:52:54.802605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2604.16259","last_updated":"2026-04-17T17:17:55Z","snapshot_observed_at":"2026-08-12T19:06:49.955269Z","submitted_at":"2026-04-17T17:17:55Z","title":"Beyond Distribution Sharpening: The Importance of Task Rewards","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-10T08:07:14.691463Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2604.16259"},"observation_digest":"sha256:d105f957c867ce977256fc3a2a4eb8da7cdb99c95fe377016e41a4c61ec7edd7","observation_id":"1d18b4dc-1663-4523-9a17-686e1ec90e27","resolution":{"observed_at":"2026-05-10T09:08:27.004699Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2604.19695","last_updated":"2026-04-21T17:17:33Z","snapshot_observed_at":"2026-08-11T07:52:20.758651Z","submitted_at":"2026-04-21T17:17:33Z","title":"Planning in entropy-regularized Markov decision processes and games","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-10T03:24:06.581955Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2604.19695"},"observation_digest":"sha256:f59f2804ea747ef0c659e82a83298278962210d67e5101f98517c64b155da353","observation_id":"2a08e8ea-ed33-4a82-8e8f-1b415fe476c4","resolution":{"observed_at":"2026-05-10T03:24:14.906277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2604.26095","last_updated":"2026-04-28T20:18:29Z","snapshot_observed_at":"2026-08-17T09:42:59.722317Z","submitted_at":"2026-04-28T20:18:29Z","title":"Distill-Belief: Closed-Loop Inverse Source Localization and Characterization in Physical Fields","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-07T16:17:39.220903Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2604.26095"},"observation_digest":"sha256:e9bb8dabdcecaa9bc80c94b7930b4b1c259886e3ab0844067adf301072663ee8","observation_id":"92381a63-ae7d-4b7d-a382-37ad3b8bd449","resolution":{"observed_at":"2026-05-11T23:46:54.222203Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2605.02300","last_updated":"2026-05-04T07:48:02Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T07:48:02Z","title":"A Meta Reinforcement Learning Approach to Goals-Based Wealth Management","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-08T18:42:50.962120Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2605.02300"},"observation_digest":"sha256:ec1166144762cd9c3abe2402ecb7739d0184e430ea474a9652494978169f94d5","observation_id":"a54eb4b1-22ae-4cde-8062-70be902893c1","resolution":{"observed_at":"2026-05-08T18:44:01.809731Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2605.02405","last_updated":"2026-06-27T08:29:50Z","snapshot_observed_at":"2026-08-15T00:12:06.206177Z","submitted_at":"2026-05-04T09:49:44Z","title":"Closed-Loop CO2 Storage Control With History-Based Reinforcement Learning and Latent Model-Based Adaptation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-09T16:16:34.154778Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2605.02405"},"observation_digest":"sha256:d7e2de44524231f22ae34fc9ce5cc9a6c7710ca138c3f0dbf395742787d192cb","observation_id":"a02da45b-8498-4176-9851-b0c9054b0934","resolution":{"observed_at":"2026-05-11T16:31:11.939348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2605.02405","last_updated":"2026-06-27T08:29:50Z","snapshot_observed_at":"2026-08-15T00:12:06.206177Z","submitted_at":"2026-05-04T09:49:44Z","title":"Closed-Loop CO2 Storage Control With History-Based Reinforcement Learning and Latent Model-Based Adaptation","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-30T23:56:11.447285Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2605.02405"},"observation_digest":"sha256:5917fc9c66a0428d965bec13b5deccfce5975ce47404dc0797235fe12c9b78cb","observation_id":"26787b4f-df45-42eb-86e3-e764f31b25f3","resolution":{"observed_at":"2026-07-01T00:55:12.291799Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2605.05812","last_updated":"2026-05-11T14:20:38Z","snapshot_observed_at":"2026-08-11T13:36:41.746341Z","submitted_at":"2026-05-07T07:47:55Z","title":"Long-Horizon Q-Learning: Accurate Value Learning via n-Step Inequalities","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-08T11:20:19.749415Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2605.05812"},"observation_digest":"sha256:fc5d1b6dbaa191e042c66945022efbcd7dc356bedcafaf431ccd6fc6c5584ece","observation_id":"7010be37-4c71-44eb-afab-a8de6b34730f","resolution":{"observed_at":"2026-05-11T19:41:08.054024Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2605.05812","last_updated":"2026-05-11T14:20:38Z","snapshot_observed_at":"2026-08-11T13:36:41.746341Z","submitted_at":"2026-05-07T07:47:55Z","title":"Long-Horizon Q-Learning: Accurate Value Learning via n-Step Inequalities","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-12T05:05:29.984355Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2605.05812"},"observation_digest":"sha256:f39a98b1352f6257be606f2020a28ea73dd75ffbdbb6891ac296caf8f37c9a7b","observation_id":"6f20f7a9-28cc-4409-b5da-1de45774a54c","resolution":{"observed_at":"2026-05-12T05:41:24.287058Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2605.07865","last_updated":"2026-05-08T15:24:51Z","snapshot_observed_at":"2026-08-15T16:24:55.947978Z","submitted_at":"2026-05-08T15:24:51Z","title":"KL for a KL: On-Policy Distillation with Control Variate Baseline","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T03:31:07.462474Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2605.07865"},"observation_digest":"sha256:0045179b0b6f4373a7291de3d2ed3c525766b9dc8a1d35ab5cb6d4f0824b31b7","observation_id":"531d7397-13d5-4256-be0f-a28c667d5c58","resolution":{"observed_at":"2026-05-11T03:40:54.193594Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2605.11316","last_updated":"2026-05-11T23:07:25Z","snapshot_observed_at":"2026-08-14T08:57:21.277497Z","submitted_at":"2026-05-11T23:07:25Z","title":"Error whitening: Why Gauss-Newton outperforms Newton","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T02:08:58.644797Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2605.11316"},"observation_digest":"sha256:2fd24ea1d9bc61e0f36d0ea8794ed61f137debdaafda190ef26da3de520e077e","observation_id":"d0c3a9bc-3274-4ddc-95a9-d9ef9cc52725","resolution":{"observed_at":"2026-05-13T02:17:07.107634Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2605.12261","last_updated":"2026-05-12T15:28:32Z","snapshot_observed_at":"2026-08-13T22:40:14.931790Z","submitted_at":"2026-05-12T15:28:32Z","title":"Delay-Empowered Causal Hierarchical Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T05:46:51.659283Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2605.12261"},"observation_digest":"sha256:26996aed6f89ecd89699ed3a7a7ac021828a3d3f36e2c5bf337bdbeeb25510ba","observation_id":"0a9bdf5c-6c50-4c11-a99e-67a66e95b3aa","resolution":{"observed_at":"2026-05-13T05:47:21.230331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2605.26478","last_updated":"2026-05-26T02:35:08Z","snapshot_observed_at":"2026-08-12T14:23:50.664257Z","submitted_at":"2026-05-26T02:35:08Z","title":"Efficient On-policy Visual-RL via Stochastic Decoupled Policy Gradient","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T17:34:41.053725Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2605.26478"},"observation_digest":"sha256:7a543853f671febeb1812ee49ca5e8f202edf70dc84a0039f5fcce9245808f6c","observation_id":"0c1a59c5-7ac1-4bf8-b2e7-5296a3257f16","resolution":{"observed_at":"2026-06-29T18:03:48.584775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2606.05800","last_updated":"2026-06-04T07:29:43Z","snapshot_observed_at":"2026-08-14T20:29:34.506845Z","submitted_at":"2026-06-04T07:29:43Z","title":"SALT: When More Rollouts Don't Help in Group-Based Policy Optimization and How to Make Them Matter","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T02:53:22.159132Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2606.05800"},"observation_digest":"sha256:235038918e584b1c6fcbb084bd892c9c1262f914b51cecae491749ac0ab3ee53","observation_id":"7add35e6-5071-4fa0-bc51-34352c392697","resolution":{"observed_at":"2026-07-02T11:46:56.175665Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-15T16:24:39.357617Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:b57ed9bfa00ce2eda29152e2554aff9026263b6aa64ad71d3923786efdfe2641","observation_id":"bf0c0586-61db-445b-80db-e3ebf182fe08","resolution":{"observed_at":"2026-07-04T17:40:00.108311Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2606.24937","last_updated":"2026-07-27T15:17:17Z","snapshot_observed_at":"2026-08-20T13:10:26.183805Z","submitted_at":"2026-06-22T17:48:54Z","title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","version":1},"reference_index":178,"source":"pdf_text","source_observed_at":"2026-06-26T08:09:57.542558Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2606.24937"},"observation_digest":"sha256:569cfc1725838f76a0874ca414fb96ab711d664c78b97b469e82eab12b1cc23b","observation_id":"4b33b2be-4e57-43ab-814c-925877d73911","resolution":{"observed_at":"2026-07-04T11:09:46.211891Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-02T10:27:18.375058Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.24937","last_updated":"2026-07-27T15:17:17Z","snapshot_observed_at":"2026-08-20T13:10:26.183805Z","submitted_at":"2026-06-22T17:48:54Z","title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","version":2},"reference_index":178,"source":"pdf_text","source_observed_at":"2026-08-02T10:27:18.375058Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2606.24937"},"observation_digest":"sha256:abfc646a2f361d3578ea85f3629719e4781e6f87ced466596fa34f6d419f50ca","observation_id":"362cd1cd-ea81-436f-8487-8f7eea64158b","resolution":{"observed_at":"2026-08-02T10:27:18.375058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2606.25497","last_updated":"2026-06-24T07:24:39Z","snapshot_observed_at":"2026-08-13T04:13:28.127699Z","submitted_at":"2026-06-24T07:24:39Z","title":"SAGE-Nav: Leveraging LLM Planning and Alignment Fusion for Hierarchical Scene Graph-Guided Navigation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-25T21:28:01.593510Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2606.25497"},"observation_digest":"sha256:9c352d37bbf4684de57df30cffdd6f22cc7879f3aa8340bd8d055cd0f003d1b5","observation_id":"da89960b-03b7-4bbe-abd0-0b3e57f312e8","resolution":{"observed_at":"2026-07-04T19:20:06.921987Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-07-12T06:14:03.658427Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.02905","last_updated":"2026-07-03T03:04:12Z","snapshot_observed_at":"2026-08-07T12:25:44.783974Z","submitted_at":"2026-07-03T03:04:12Z","title":"Pre-Strings Lectures on Artificial Intelligence","version":1},"reference_index":170,"source":"pdf_text","source_observed_at":"2026-07-12T06:14:03.658427Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2607.02905"},"observation_digest":"sha256:9934a199708b759696b4d6cdc20ec09cae0c31b0ccd904f047dba977d2262b79","observation_id":"0bcb39e3-a578-4c60-ac1c-0db23f348818","resolution":{"observed_at":"2026-07-12T06:14:03.658427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-07-12T02:58:08.912254Z","title":"and Harley, Tim and Silver, David and Kavukcuoglu, Koray , date =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03371","last_updated":"2026-07-03T14:24:53Z","snapshot_observed_at":"2026-08-04T22:35:39.688379Z","submitted_at":"2026-07-03T14:24:53Z","title":"Computational Determination of Optimal Growth Protocols for Metastable Polymorphs","version":1},"reference_index":162,"source":"arxiv_source","source_observed_at":"2026-07-12T02:58:08.912254Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2607.03371"},"observation_digest":"sha256:5f54cf8f8a8130792d683cf2321f3ae2268c8069144599ea70457162eef39360","observation_id":"bf0357d7-7771-4921-9df9-aac9114b7258","resolution":{"observed_at":"2026-07-12T02:58:08.912254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"2607.08703","last_updated":"2026-07-09T17:09:20Z","snapshot_observed_at":"2026-08-19T00:04:08.422588Z","submitted_at":"2026-07-09T17:09:20Z","title":"MPFlow: Learning Budgeted Max-Flow Optimization on the Lightning Network with Deep Graph Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T02:49:33.567169Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2607.08703"},"observation_digest":"sha256:0cdcd77c76259f43fceeba815aeb17851c7fae806b573be74fdc16314712fce0","observation_id":"8ad9131a-7af0-45cf-8b20-f10d2e21a72e","resolution":{"observed_at":"2026-07-10T02:56:43.532753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-07-14T08:57:07.143027Z","title":"Asynchronous methods for deep reinforcement learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.10830","last_updated":"2026-07-12T16:46:30Z","snapshot_observed_at":"2026-08-19T11:17:23.073781Z","submitted_at":"2026-07-12T16:46:30Z","title":"Automated Stealthy Wear-Out Attack on Digital Twins With Deep Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T08:57:07.143027Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2607.10830"},"observation_digest":"sha256:88958af710ab95b74b7d415759cba80e45bf8f0dd7278c72d1a3fb408f5c6b8a","observation_id":"51580c9e-d0c4-4db0-988b-5971a3102fc3","resolution":{"observed_at":"2026-07-14T08:57:07.143027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T00:28:22.105962Z","title":"Lillicrap, Tim Harley, David Silver, and Koray Kavukcuoglu","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.00750","last_updated":"2026-08-01T16:33:15Z","snapshot_observed_at":"2026-08-16T04:29:46.345202Z","submitted_at":"2026-08-01T16:33:15Z","title":"Hierarchical Residual Policy Optimization for Generative Recommendations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T00:28:22.105962Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2608.00750"},"observation_digest":"sha256:303c3273dc7d4da042a4c310badd3eea5914a48a85e6867023dc40e4a1a807f5","observation_id":"1b3c4aae-a291-4a4e-9c34-4ab197910224","resolution":{"observed_at":"2026-08-05T00:28:22.105962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1602.01783/citation-record","integrity":"/paper/1602.01783/integrity","json":"/paper/1602.01783/citation-record.json","paper":"/paper/1602.01783"},"outbound":[],"paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 75 inbound Pith citation observations for arXiv:1602.01783."}