{"as_of":"2026-08-08T02:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6cd47f43e8d6104fd7caf3c177937f2cf23b9da9222a80a2db4b915c0269c06c","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:18:50.823234Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.05716/citation-record","integrity":"/paper/2506.05716/integrity","json":"/paper/2506.05716/citation-record.json","paper":"/paper/2506.05716"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:55.906077Z","title":"Averaged-dqn: Variance reduction and stabilization for deep reinforcement learning","venue":null,"work_id":"87b074cc-6109-4c86-b7fd-f8ecf3c3ee41","year":2017},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-07T10:11:20.967628Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:47.898294Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:b72ae800dc20064b766b72e62cbfcb9e409158928e31b59cff4d00f595e833f6","observation_id":"33b4becb-6c3c-484f-b044-5671c5f06bac","resolution":{"observed_at":"2026-08-07T10:18:56.131377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14488","last_updated":"2023-05-02T23:44:10Z","snapshot_observed_at":"2026-08-05T00:35:55.763287Z","submitted_at":"2022-09-29T00:42:44Z","title":"Ensemble Reinforcement Learning in Continuous Spaces -- A Hierarchical Multi-Step Approach for Policy Training","version":2},"cited_work":{"arxiv_id":"2209.14488","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14488","snapshot_observed_at":"2026-08-07T10:18:51.686566Z","title":"Ensemble Reinforcement Learning in Continuous Spaces -- A Hierarchical Multi-Step Approach for Policy Training","venue":"cs.LG","work_id":"4f632d79-9d19-419a-85c6-3879eacc31d6","year":2022},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-07T10:11:20.967628Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:48.008298Z"},"links":{"cited_paper":"/paper/2209.14488","citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:37d12b5da52c10f1bbedca31bb30211af22ff881df7218745f8a087d72917370","observation_id":"bcf78f58-43f0-4ac9-b332-8160d5e4c52d","resolution":{"observed_at":"2026-08-07T10:18:51.769542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:55.504866Z","title":"Mushroomrl: Simplifying reinforcement learning research","venue":null,"work_id":"d75ad04f-5c48-4988-881d-00e2040013e1","year":2021},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-07T10:11:20.967628Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:48.186274Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:f412979bd4ed7776e0d029ef69a278e4240cad7a74bfb50e78835467a4a3ed29","observation_id":"14e3c160-e51c-4969-9fc3-440e199c68fb","resolution":{"observed_at":"2026-08-07T10:18:55.709013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:55.161789Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":"2b8d7b7b-3bd9-4af7-b3fb-890bf3e6093c","year":2018},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-07T10:11:20.967628Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:48.367202Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:f2aea9745dfdb6ca62db90c82c4a026620e5a0307e7e12b5fae8d0eaa2a05ceb","observation_id":"2b222622-40b9-4bb9-8135-53c5aa2cfb3b","resolution":{"observed_at":"2026-08-07T10:18:55.310590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.07510","last_updated":"2019-02-07T22:11:51Z","snapshot_observed_at":"2026-08-07T20:52:30.231852Z","submitted_at":"2019-01-22T18:38:04Z","title":"Understanding Multi-Step Deep Reinforcement Learning: A Systematic Study of the DQN Target","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.07510","snapshot_observed_at":"2026-08-07T10:18:48.523669Z","title":"Understanding multi-step deep reinforcement learning: A systematic study of the dqn target","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-07T10:11:20.967628Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:48.523669Z"},"links":{"cited_paper":"/paper/1901.07510","citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:b6113bf4af0cf906cf73483c68cc72219f3542e46f1e87ca94915fffd74abcce","observation_id":"b62061ba-c9dd-42b8-aaed-bf34cb00963d","resolution":{"observed_at":"2026-08-07T10:18:48.523669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:54.701384Z","title":"Wd3: Taming the estimation bias in deep reinforcement learning","venue":null,"work_id":"c2dcb7a6-80bd-4836-911d-58117ffa7a73","year":2020},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-07T10:11:20.967628Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:48.656883Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:cbe8c34746dcbc2a5a8f8cdbd4bfd0d9abeeb2e8f32e8298dbd354fa17decb6d","observation_id":"174abb56-8cf2-45ff-ad77-9f6507898be5","resolution":{"observed_at":"2026-08-07T10:18:54.888632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:54.373147Z","title":"Rainbow: Combining improvements in deep reinforcement learning","venue":null,"work_id":"67c8592b-a810-4d2c-81c1-8eadde489769","year":2018},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-07T10:11:20.967628Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:48.816458Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:8a9b0d3c1b5134112076dab927b372c15419bb1f0328df27cc70ed8b91e31c99","observation_id":"f2c2aaa1-ae24-4f13-9962-2d9aa4d8231a","resolution":{"observed_at":"2026-08-07T10:18:54.553122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:54.057902Z","title":"Bring color to deep q-networks: Limitations and improvements of dqn leading to rainbow dqn","venue":null,"work_id":"f09b18a8-6df3-40e9-9c97-9e19108a5296","year":2021},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-07T10:11:20.967628Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:48.972152Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:3d92090372437a58802412dc3d8ac752779d963412d79e50cfcf6ff0fb647eea","observation_id":"bfd774fa-c87d-4041-852c-1d176ad83b9c","resolution":{"observed_at":"2026-08-07T10:18:54.200244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:53.820497Z","title":"Elastic step ddpg: Multi-step reinforcement learning for improved sample efficiency","venue":null,"work_id":"41561a54-bb18-4883-a4e1-654baf8e53c2","year":2023},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-07T10:11:20.967628Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:49.072592Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:2e0045abb4115296bdcde6984618f37ee0b8b72b3960e47b656c3ba5c9b83451","observation_id":"46c982f7-5272-484e-986c-c405eddb4eb8","resolution":{"observed_at":"2026-08-07T10:18:53.967998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:53.419199Z","title":"Elastic step dqn: A novel multi-step algorithm to alleviate overestimation in deep q-networks","venue":null,"work_id":"300b8e91-372d-4b0f-ab55-ff66a9c73f3f","year":2024},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-07T10:11:20.967628Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:49.251341Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:dccb2deb37b37b6544d3999fa608873462039bf250f1fdd43e0d147371eeef07","observation_id":"2b808023-ad6d-4c8d-86c8-875a23d6a104","resolution":{"observed_at":"2026-08-07T10:18:53.652559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06487","last_updated":"2021-08-07T18:51:37Z","snapshot_observed_at":"2026-08-06T06:51:06.607084Z","submitted_at":"2020-02-16T02:02:23Z","title":"Maxmin Q-learning: Controlling the Estimation Bias of Q-learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06487","snapshot_observed_at":"2026-08-07T10:18:49.430393Z","title":"Maxmin q-learning: Controlling the estimation bias of q-learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-07T10:11:20.967628Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:49.430393Z"},"links":{"cited_paper":"/paper/2002.06487","citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:cb667a79b48c7a5a611c2217971e303c6c8222448a65d4aafe9cd09339a8aa79","observation_id":"9086a3f5-1f5e-405f-a0a9-1042649faf05","resolution":{"observed_at":"2026-08-07T10:18:49.430393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:53.126382Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"365d4c8f-a5ea-43f6-8b77-24028746f81b","year":2015},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-07T10:11:20.967628Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:49.568478Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:dd97a1e665399d7bf3b56f045590e44688ae20e46a062184e2c6e1aea3b46464","observation_id":"78c45b44-0ade-4be2-9f43-d2709e2006af","resolution":{"observed_at":"2026-08-07T10:18:53.280170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00514","last_updated":"2024-06-19T11:32:01Z","snapshot_observed_at":"2026-07-06T17:38:04.972649Z","submitted_at":"2024-03-01T13:25:10Z","title":"Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00514","snapshot_observed_at":"2026-08-07T10:18:49.734756Z","title":"Overestimation, overfitting, and plasticity in actor-critic: the bitter lesson of reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-07T10:11:20.967628Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:49.734756Z"},"links":{"cited_paper":"/paper/2403.00514","citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:cb818ba788d5119b44798e63f68db15475d47589b017629f7f418d12032159e2","observation_id":"77e2d3d5-0248-4d0c-98b1-276b66674e6a","resolution":{"observed_at":"2026-08-07T10:18:49.734756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.14826","last_updated":"2021-05-21T19:53:36Z","snapshot_observed_at":"2026-07-06T10:19:02.419450Z","submitted_at":"2020-11-20T15:23:40Z","title":"Revisiting Rainbow: Promoting more Insightful and Inclusive Deep Reinforcement Learning Research","version":2},"cited_work":{"arxiv_id":"2011.14826","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.14826","snapshot_observed_at":"2026-08-07T10:18:51.295413Z","title":"Revisiting Rainbow: Promoting more Insightful and Inclusive Deep Reinforcement Learning Research","venue":"cs.LG","work_id":"b5bc0ead-f9f4-4d51-be44-db81668ca66d","year":2020},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-07T10:11:20.967628Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:49.846485Z"},"links":{"cited_paper":"/paper/2011.14826","citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:875e5961489137af4e88a0f91459554b1f79c3c722b1b1e1f472d02d42c1985c","observation_id":"f35cc21c-bff7-485b-ae2e-f58f3538ba08","resolution":{"observed_at":"2026-08-07T10:18:51.461428Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:52.860826Z","title":"Issues in using function approximation for reinforcement learning","venue":null,"work_id":"7ec99fbf-f370-47bf-a37a-fee729cbec3c","year":1993},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-07T10:11:20.967628Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:49.976666Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:daefdc8dd2389294ac1835a4470aeb303f332df638535498bcde9b0c39dde79a","observation_id":"e5634b6a-8ec5-4164-aa8e-5ebcbc7f9d8e","resolution":{"observed_at":"2026-08-07T10:18:52.984969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02648","last_updated":"2018-12-06T16:36:20Z","snapshot_observed_at":"2026-07-06T07:19:38.028327Z","submitted_at":"2018-12-06T16:36:20Z","title":"Deep Reinforcement Learning and the Deadly Triad","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02648","snapshot_observed_at":"2026-08-07T10:18:50.077455Z","title":"Deep reinforcement learning and the deadly triad","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-07T10:11:20.967628Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:50.077455Z"},"links":{"cited_paper":"/paper/1812.02648","citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:440827d7b1d22f6eb281fd7f17fe4fb13ce2c39aa17ecc06e63a06041def7420","observation_id":"ba0a0d1d-eb7c-4e1d-bf74-8d37a9cbc8e3","resolution":{"observed_at":"2026-08-07T10:18:50.077455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:52.570978Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":"78f5be04-0fd2-474a-b061-d6cc362b6553","year":2016},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-07T10:11:20.967628Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:50.210042Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:856bd96f8070fd7a70849f4f0188d7d98873e19c7e252191777ff73c986b606d","observation_id":"299c696d-4d85-414d-a6f9-e422f2d815ce","resolution":{"observed_at":"2026-08-07T10:18:52.691097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:52.258582Z","title":"Controlling underestimation bias in reinforcement learning via quasi-median operation","venue":null,"work_id":"3ca1c26d-de8f-4c15-b175-57c7259cae55","year":2022},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-07T10:11:20.967628Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:50.365061Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:6acc48013c4a95ed328e170d3254c6f7c98725e83d25de096b9caec45802b1a9","observation_id":"137e1cfe-eb05-4c37-9e30-8732445e98ce","resolution":{"observed_at":"2026-08-07T10:18:52.398852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.03176","last_updated":"2019-06-07T00:36:50Z","snapshot_observed_at":"2026-07-06T07:37:51.655095Z","submitted_at":"2019-03-07T20:34:36Z","title":"MinAtar: An Atari-Inspired Testbed for Thorough and Reproducible Reinforcement Learning Experiments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.03176","snapshot_observed_at":"2026-08-07T10:18:50.501864Z","title":"Minatar: An atari-inspired testbed for thorough and reproducible reinforcement learning experiments","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-07T10:11:20.967628Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:50.501864Z"},"links":{"cited_paper":"/paper/1903.03176","citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:f4d654776fa9308185aa528342fe3f366c97349cbe19924dfa0892ea36dba6f7","observation_id":"eb2d4639-c01a-4524-8ed4-ddb292c4ae87","resolution":{"observed_at":"2026-08-07T10:18:50.501864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:51.942992Z","title":"A novel multi-step q-learning method to improve data efficiency for deep reinforcement learning","venue":null,"work_id":"2176b7f6-1785-4b3f-a51a-7f527b4cfdbf","year":2019},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-07T10:11:20.967628Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:50.627750Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:769f279b75be44caae6c9e2b3c3c911d84f916c6959932f2f4aae43b9e566a95","observation_id":"a6c0836e-6e67-4db9-82e9-9a314c87e66f","resolution":{"observed_at":"2026-08-07T10:18:52.106309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.00913","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:51.064591Z","title":"beta-dqn: Improving deep q-learning by evolving the behavior","venue":null,"work_id":"d7bb8b78-a65d-4db1-b49d-385eb7a3c295","year":2025},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-07T10:11:20.967628Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:50.823234Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:6ddd948d425555eb99a68e36c101b863b7c0ff4d2d347e1977ac6be09b864dd8","observation_id":"d80f9e1b-7935-4a6e-b508-740b9734ffdb","resolution":{"observed_at":"2026-08-07T10:18:51.148670Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T10:11:20.967628Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":3,"verified_fuzzy":13},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2506.05716."}