{"as_of":"2026-08-22T07:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e9e67184330b725500990a5520f2e382454f05cf4626d5be6dba529399681731","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:49:09.317937Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T19:07:35.304667Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-14T13:55:04.946016Z","title":"arXiv e-prints , arXiv:arXiv: 1509.06461","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.04127","last_updated":"2021-02-25T16:48:30Z","snapshot_observed_at":"2026-08-19T18:45:42.214255Z","submitted_at":"2019-08-12T12:51:14Z","title":"A review on Deep Reinforcement Learning for Fluid Mechanics","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-14T13:55:04.946016Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/1908.04127"},"observation_digest":"sha256:9471a835d171be604d3a8cc55e583cbd9a28298972d562ac28050a8f1789777c","observation_id":"699c2e2a-83f5-4b31-a6a2-43fefa0e2e78","resolution":{"observed_at":"2026-08-14T13:55:04.946016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-14T10:49:33.161700Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.161700Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:46cbbddc667fcc07fd1c1ccdf14ff35d7f5cd5180cbc2f4b5260effc11bab11a","observation_id":"70a53df3-c5cd-4e5c-b051-a6ab4c4ea169","resolution":{"observed_at":"2026-08-14T10:49:33.161700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":"1509.06461","doi":null,"metadata_source":"pith","pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-07-10T19:07:35.304667Z","title":"Deep Reinforcement Learning with Double Q-learning","venue":"cs.LG","work_id":"6a7d9af0-8964-48c9-a003-f4c790d3a49c","year":2015},"citing_paper":{"arxiv_id":"2010.02193","last_updated":"2022-02-12T20:01:53Z","snapshot_observed_at":"2026-08-17T02:57:21.304714Z","submitted_at":"2020-10-05T17:52:14Z","title":"Mastering Atari with Discrete World Models","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T01:27:31.813680Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2010.02193"},"observation_digest":"sha256:01748b0f324790a8e11a804561a175d3f6bbcc02fbd6df9f67cbf0d3c4b192eb","observation_id":"6cf13da5-089f-4b4f-a42c-2423ef9bb574","resolution":{"observed_at":"2026-05-15T01:27:32.021012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-12T12:41:52.947013Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.16996","last_updated":"2024-11-26T00:00:27Z","snapshot_observed_at":"2026-08-19T12:50:38.567474Z","submitted_at":"2024-11-26T00:00:27Z","title":"CRASH: Challenging Reinforcement-Learning Based Adversarial Scenarios For Safety Hardening","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T12:41:52.947013Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2411.16996"},"observation_digest":"sha256:d4824d3c73a70192fc123f9765f5078fd0220f2dedaf28034db178eff9718339","observation_id":"72596529-6124-4876-90b3-e41b0b70191b","resolution":{"observed_at":"2026-08-12T12:41:52.947013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-12T10:39:20.616826Z","title":"Deep reinforcement learningwithdoubleQ-learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.19032","last_updated":"2024-11-28T10:20:02Z","snapshot_observed_at":"2026-08-20T14:54:50.463533Z","submitted_at":"2024-11-28T10:20:02Z","title":"Machine Learning for Spectrum Sharing: A Survey","version":1},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-08-12T10:39:20.616826Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2411.19032"},"observation_digest":"sha256:9dbbecbef9ccc3dd4e7f02803215e5a74d91809e36e59f0bbeb0c3d1d5e23b63","observation_id":"8ef10003-fa9d-4107-b092-e9c6ead3a87d","resolution":{"observed_at":"2026-08-12T10:39:20.616826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-11T00:48:00.572912Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.19311","last_updated":"2024-12-26T18:19:04Z","snapshot_observed_at":"2026-08-15T12:05:56.209722Z","submitted_at":"2024-12-26T18:19:04Z","title":"xSRL: Safety-Aware Explainable Reinforcement Learning -- Safety as a Product of Explainability","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T00:48:00.572912Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2412.19311"},"observation_digest":"sha256:4970c8db93504c7377e2eb7b8ddb4c746b54b8d255cd9ae784f8f82fadb439ad","observation_id":"0b3efcdd-989a-4069-8ac3-5de23ac0591e","resolution":{"observed_at":"2026-08-11T00:48:00.572912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-10T19:52:42.057261Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.09646","last_updated":"2025-01-16T16:38:33Z","snapshot_observed_at":"2026-08-20T14:54:47.592106Z","submitted_at":"2025-01-16T16:38:33Z","title":"NS-Gym: Open-Source Simulation Environments and Benchmarks for Non-Stationary Markov Decision Processes","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T19:52:42.057261Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2501.09646"},"observation_digest":"sha256:b0313eb343eca95f367e5cebcf568508bae5e2046637556441a84f96ffda9803","observation_id":"e46bb5a9-3b6b-426a-acad-85738bec0073","resolution":{"observed_at":"2026-08-10T19:52:42.057261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-08T14:15:43.327071Z","title":"Deep Reinforcement Learning With Double Q-Learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.06963","last_updated":"2026-05-25T01:11:10Z","snapshot_observed_at":"2026-08-13T18:54:48.924163Z","submitted_at":"2025-02-10T19:02:20Z","title":"Intelligent Offloading in Vehicular Edge Computing: A Comprehensive Review of Deep Reinforcement Learning Approaches and Architectures","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T14:15:43.327071Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2502.06963"},"observation_digest":"sha256:11ace6d207eb4aac929a1c3916e6f6a4852b9da204e89e77859ebee4825e79ad","observation_id":"e73ec29c-0d24-4e16-b22b-f1df7e4fc7a0","resolution":{"observed_at":"2026-08-08T14:15:43.327071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-16T10:49:09.317937Z","title":"Deep reinforcement learning with double q-learning, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.17282","last_updated":"2025-04-24T06:20:08Z","snapshot_observed_at":"2026-08-19T12:08:52.596869Z","submitted_at":"2025-04-24T06:20:08Z","title":"Cracking the Code of Action: a Generative Approach to Affordances for Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T10:49:09.317937Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2504.17282"},"observation_digest":"sha256:2949564964eb0fae6d28007ae4871c53fcd65e9a0fcaa2d1d1b42bd2fe537085","observation_id":"0269a0a8-39b7-4cc9-b2a9-e5b814bd3c66","resolution":{"observed_at":"2026-08-16T10:49:09.317937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-15T21:05:21.437109Z","title":"Deep reinforcement learning with double q-learning, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-18T15:16:31.368573Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.437109Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:644996e59ad6e7e1785fd113c0f879d7d4574fc9f503d31aacdd6c12173cb3e9","observation_id":"a59c1136-1d1b-4ce4-8d72-2b6a99b53dbd","resolution":{"observed_at":"2026-08-15T21:05:21.437109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-07T15:29:46.611548Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.611548Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:b3ce7ba4d81a2294c51a808f8f260c6479612aa599838f6b64c8a3d6b8af7520","observation_id":"164746cd-c772-4674-847e-d9d152fddccd","resolution":{"observed_at":"2026-08-07T15:29:46.611548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-07T00:43:40.264379Z","title":"van Hasselt, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13057","last_updated":"2025-06-16T02:58:56Z","snapshot_observed_at":"2026-08-17T06:44:09.617269Z","submitted_at":"2025-06-16T02:58:56Z","title":"Inverse design of the transmission matrix in a random system using Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:43:40.264379Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2506.13057"},"observation_digest":"sha256:022b79554b0c5c44d40c0e64dad86dc613f81b1700c35bfb4a8bcbf0a1338641","observation_id":"ffac25b9-0cda-4e53-a43f-a3420e86389e","resolution":{"observed_at":"2026-08-07T00:43:40.264379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-06T23:14:02.096212Z","title":"cc/paper_files/paper/2010/file/ 091d584fced301b442654dd8c23b3fc9-Paper","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.19478","last_updated":"2025-06-24T10:09:26Z","snapshot_observed_at":"2026-08-17T11:12:54.344171Z","submitted_at":"2025-06-24T10:09:26Z","title":"ADDQ: Adaptive Distributional Double Q-Learning","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-06T23:14:02.096212Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2506.19478"},"observation_digest":"sha256:c70cbf28d82c5c917f82bb8774e747a164e2d072f0563e20f5b4371778146785","observation_id":"fcf4708f-c7dd-42cc-9c50-92c62f4b8c95","resolution":{"observed_at":"2026-08-06T23:14:02.096212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-06T20:59:15.925516Z","title":"Deep reinforcement learning with double Q - Learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.01470","last_updated":"2025-07-02T08:33:03Z","snapshot_observed_at":"2026-08-16T03:55:04.564606Z","submitted_at":"2025-07-02T08:33:03Z","title":"Zero-Incentive Dynamics: a look at reward sparsity through the lens of unrewarded subgoals","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:59:15.925516Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2507.01470"},"observation_digest":"sha256:d4de4e9a0eef33f366997541d9c80eefb66a28dd232d52a81b0139634a467db6","observation_id":"26d0f6c0-c6e6-46bb-b059-8b1e0516bb2b","resolution":{"observed_at":"2026-08-06T20:59:15.925516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-06T11:34:22.841058Z","title":"Deep Reinforcement Learning with Double Q-learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-21T17:02:23.646802Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:22.841058Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:689f5cbf09928fd0f9eb83cdf267803840a68b15747c619beb067d503006e832","observation_id":"bf7f5e39-0013-46cb-9550-a3bcbe6650ab","resolution":{"observed_at":"2026-08-06T11:34:22.841058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-05T18:06:21.530402Z","title":"Deep reinforcement learning with double q-learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.15207","last_updated":"2025-08-21T03:38:33Z","snapshot_observed_at":"2026-08-14T18:24:49.496648Z","submitted_at":"2025-08-21T03:38:33Z","title":"Adversarial Agent Behavior Learning in Autonomous Driving Using Deep Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T18:06:21.530402Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2508.15207"},"observation_digest":"sha256:e99a45e5c7df83ce2675ef38c804c587cd5fa88faee504bfc4dbcfea3595bbb0","observation_id":"6aa42f11-b567-4ec4-988d-c9e61f912d7b","resolution":{"observed_at":"2026-08-05T18:06:21.530402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-05T13:30:05.776137Z","title":"Deep Reinforcement Learning with Double Q - learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.00624","last_updated":"2025-08-30T22:43:14Z","snapshot_observed_at":"2026-08-21T18:20:41.847912Z","submitted_at":"2025-08-30T22:43:14Z","title":"Vehicle-in-Virtual-Environment (VVE) Method for Developing and Evaluating VRU Safety of Connected and Autonomous Driving with Focus on Bicyclist Safety","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-05T13:30:05.776137Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2509.00624"},"observation_digest":"sha256:e020a848ff72b3eb2d405f3cadbb3ea2174ef87fc7be7991df55c110e6e99c32","observation_id":"d15de7d6-296b-4e10-ba06-ebe256046c7b","resolution":{"observed_at":"2026-08-05T13:30:05.776137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-05T11:21:36.691238Z","title":"In: Proceedings of the Thirtieth AAAI Conference on Artificial Intel- ligence (AAAI-16)","venue":null,"work_id":null,"year":2094},"citing_paper":{"arxiv_id":"2509.02898","last_updated":"2025-09-02T23:47:43Z","snapshot_observed_at":"2026-08-15T05:30:00.316102Z","submitted_at":"2025-09-02T23:47:43Z","title":"PRECISE-AS: Personalized Reinforcement Learning for Efficient Point-of-Care Echocardiography in Aortic Stenosis Diagnosis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T11:21:36.691238Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2509.02898"},"observation_digest":"sha256:b20aa58b88d80c509a04a3d2d289fdd2358236590b047ba06e8b3b50a239f2fe","observation_id":"06503afe-1f4e-41ff-844e-187448b7d4a0","resolution":{"observed_at":"2026-08-05T11:21:36.691238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-15T16:32:12.716344Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.716344Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:aa3bbd0a8202711e19699642602ad76a272f5a9b30c0387bf51823c170f9882b","observation_id":"25b4b8a6-4d4a-4b82-b10f-adb1da5db636","resolution":{"observed_at":"2026-08-15T16:32:12.716344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-15T16:30:01.030143Z","title":"Deep reinforcement learning with double q-learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.05273","last_updated":"2025-09-05T17:29:51Z","snapshot_observed_at":"2026-08-18T00:41:07.250289Z","submitted_at":"2025-09-05T17:29:51Z","title":"Greener Deep Reinforcement Learning: Analysis of Energy and Carbon Efficiency Across Atari Benchmarks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:01.030143Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2509.05273"},"observation_digest":"sha256:ef2a138d2efad189846ea2ec47260ee27818237854dac95d14ca9b02aa059eb4","observation_id":"200fd7e1-0ec5-4cf4-98ce-5aaa7990c6d4","resolution":{"observed_at":"2026-08-15T16:30:01.030143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-04T11:01:34.239201Z","title":"Deep reinforcement learning with double q-learning, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.07650","last_updated":"2026-05-30T05:26:12Z","snapshot_observed_at":"2026-08-19T20:46:14.692069Z","submitted_at":"2025-10-09T00:57:40Z","title":"Value Flows","version":4},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-04T11:01:34.239201Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2510.07650"},"observation_digest":"sha256:b7c443b92a4295fa0708b92b75e796aae70309fec11005dea939037e14d3c8c6","observation_id":"eb434a0f-00bc-4684-9ecd-77b5dbbe2783","resolution":{"observed_at":"2026-08-04T11:01:34.239201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":"1509.06461","doi":null,"metadata_source":"pith","pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-07-10T19:07:35.304667Z","title":"Deep Reinforcement Learning with Double Q-learning","venue":"cs.LG","work_id":"6a7d9af0-8964-48c9-a003-f4c790d3a49c","year":2015},"citing_paper":{"arxiv_id":"2604.05394","last_updated":"2026-04-07T03:47:14Z","snapshot_observed_at":"2026-08-16T11:44:50.216675Z","submitted_at":"2026-04-07T03:47:14Z","title":"Neural Assistive Impulses: Synthesizing Exaggerated Motions for Physics-based Characters","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-10T19:25:46.825686Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2604.05394"},"observation_digest":"sha256:ae5215daa15abb73105be265c22c2deb54d00a0c85d74c99928432e2c1de82e5","observation_id":"b2bebcd3-d2a3-4617-a231-359b67c074e3","resolution":{"observed_at":"2026-05-10T23:00:48.456371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":"1509.06461","doi":null,"metadata_source":"pith","pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-07-10T19:07:35.304667Z","title":"Deep Reinforcement Learning with Double Q-learning","venue":"cs.LG","work_id":"6a7d9af0-8964-48c9-a003-f4c790d3a49c","year":2015},"citing_paper":{"arxiv_id":"2605.07057","last_updated":"2026-05-08T00:12:03Z","snapshot_observed_at":"2026-08-16T02:39:31.142363Z","submitted_at":"2026-05-08T00:12:03Z","title":"Integrating Causal DAGs in Deep RL: Activating Minimal Markovian States with Multi-Order Exposure","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-11T02:34:12.141437Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2605.07057"},"observation_digest":"sha256:046946bdaa0fc2086deb7ddf8830f640538911e94222c88cfa9e2bde343b7503","observation_id":"812493da-49a0-49fb-a5e4-6b94a150330d","resolution":{"observed_at":"2026-05-11T03:15:56.164472Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":"1509.06461","doi":null,"metadata_source":"pith","pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-07-10T19:07:35.304667Z","title":"Deep Reinforcement Learning with Double Q-learning","venue":"cs.LG","work_id":"6a7d9af0-8964-48c9-a003-f4c790d3a49c","year":2015},"citing_paper":{"arxiv_id":"2606.27865","last_updated":"2026-06-26T09:06:04Z","snapshot_observed_at":"2026-08-12T16:36:06.416416Z","submitted_at":"2026-06-26T09:06:04Z","title":"From Bootstrapping to Sequence Modeling: A Unified Generative Framework for Personalized Landing-Page Modeling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T02:56:52.303152Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2606.27865"},"observation_digest":"sha256:d17c0bfa37fa952745ee5de0ba65942298269acbc69e87a79ad9d14d54eb4734","observation_id":"57a4dd36-51d4-47f6-bbe1-b5a210a99bd2","resolution":{"observed_at":"2026-07-01T17:55:51.421901Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":"1509.06461","doi":null,"metadata_source":"pith","pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-07-10T19:07:35.304667Z","title":"Deep Reinforcement Learning with Double Q-learning","venue":"cs.LG","work_id":"6a7d9af0-8964-48c9-a003-f4c790d3a49c","year":2015},"citing_paper":{"arxiv_id":"2607.07758","last_updated":"2026-07-08T14:31:02Z","snapshot_observed_at":"2026-08-20T20:31:31.079919Z","submitted_at":"2026-07-08T14:31:02Z","title":"Scalable and Trustworthy Earth Observation Foundation Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-10T18:58:32.854964Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2607.07758"},"observation_digest":"sha256:581c0315d9089329a13a9541e5c74fbad849289ac2ddab92abb37815fb4ce748","observation_id":"f2c949c0-8c86-4fa1-850d-ac055bc972b8","resolution":{"observed_at":"2026-07-10T19:07:35.305775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-03T17:11:12.021935Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.28925","last_updated":"2026-08-15T16:00:11Z","snapshot_observed_at":"2026-08-20T23:09:45.215969Z","submitted_at":"2026-07-31T01:00:25Z","title":"Learning Optimal Dynamic Matching via Graph Neural Networks","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-03T17:11:12.021935Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2607.28925"},"observation_digest":"sha256:a7a531660ad6f746f81329f95bc40496cf8f1aee56e56ad517e5982a3f917133","observation_id":"5a51bc98-d53f-465d-944e-23ea544ffcaa","resolution":{"observed_at":"2026-08-03T17:11:12.021935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1509.06461/citation-record","integrity":"/paper/1509.06461/integrity","json":"/paper/1509.06461/citation-record.json","paper":"/paper/1509.06461"},"outbound":[],"paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 26 inbound Pith citation observations for arXiv:1509.06461."}