{"as_of":"2026-08-07T10:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d05da6ee9d16b79caca59cb1b406dc8d1fa2686964a4c32a89311ef1d164ef7a","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:44:15.289881Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.01329/citation-record","integrity":"/paper/2508.01329/integrity","json":"/paper/2508.01329/citation-record.json","paper":"/paper/2508.01329"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1903.08894","last_updated":"2019-03-21T09:42:41Z","snapshot_observed_at":"2026-08-04T21:37:15.275989Z","submitted_at":"2019-03-21T09:42:41Z","title":"Towards Characterizing Divergence in Deep Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.08894","snapshot_observed_at":"2026-08-06T05:44:11.402366Z","title":"Achiam, E","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:11.402366Z"},"links":{"cited_paper":"/paper/1903.08894","citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:ca5a6adaf5efcac3decc9072cfe6cf71985ace340e5d6fc33b2d6e5ad0230c86","observation_id":"1eba9a00-639c-4083-85cb-f978864228db","resolution":{"observed_at":"2026-08-06T05:44:11.402366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.440034Z","title":"Deep reinforcement learning at the edge of the statistical precipice","venue":null,"work_id":"a92643a8-c7dc-4b12-a5a0-ab00e4788287","year":2021},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:11.523139Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:f9d39db778ec7dd3bc00de96511a20bd03692a2a0991280599856d506923ed5e","observation_id":"0bd3b8ea-ca1a-401b-b5c1-521e33bd46b9","resolution":{"observed_at":"2026-08-06T05:44:16.445434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02019","last_updated":"2022-10-05T04:41:20Z","snapshot_observed_at":"2026-08-03T09:16:55.559588Z","submitted_at":"2022-10-05T04:41:20Z","title":"Atari-5: Distilling the Arcade Learning Environment down to Five Games","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02019","snapshot_observed_at":"2026-08-06T05:44:11.701517Z","title":"Atari-5: Distilling the arcade learning environment down to five games","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:11.701517Z"},"links":{"cited_paper":"/paper/2210.02019","citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:29377488c008cf974b249b37f60337804dd90b4671043ec4c5f03e151d6de0d7","observation_id":"9012bf15-39fb-4c85-9e88-ae2930c1ae75","resolution":{"observed_at":"2026-08-06T05:44:11.701517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.424486Z","title":"Never give up: Learning directed exploration strategies, 2020","venue":null,"work_id":"88238fc9-3a2b-420f-885c-f014047ba57d","year":2020},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:11.835102Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:24f71617c26a149d342f6f0d9c8ccb2ff02abf9979c12ef6b38f22ca7f435fbe","observation_id":"65cb8308-9a86-4ddb-991d-a34a13b634e2","resolution":{"observed_at":"2026-08-06T05:44:16.429262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.409155Z","title":"Unifying count-based exploration and intrinsic motivation","venue":null,"work_id":"055854f6-26f3-420e-9efc-4695d664de97","year":2016},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:11.997083Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:2976dd11c5cc64c0aa51d87fa814cda4f7110aae89fed92679bf8c473ccf93b7","observation_id":"c158a74f-ce46-4a51-ac71-a3108eda206b","resolution":{"observed_at":"2026-08-06T05:44:16.414088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2747.28328","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.598346Z","title":"Bellemare, Yavar Naddaf, Joel Veness, and Michael Bowling","venue":null,"work_id":"9d13fcea-5db5-4f9f-8571-a96ded9c480d","year":2015},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:12.117380Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:3f40a30ac4915889dbfd5cfed0b39892975a8e88b7a0140019b5d449a25de0bf","observation_id":"e4b604a0-5918-4310-bf80-63c9e5ed83a8","resolution":{"observed_at":"2026-08-06T05:44:15.608184Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.394529Z","title":"Bellemare, Will Dabney, and R \\' e mi Munos","venue":null,"work_id":"adca7b00-a600-47cc-b2b7-a87a5f4c1550","year":2017},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:12.284037Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:98a086b8ea857c7cf7c2368f229033a8b017472dc9525b32ec082093cf095af3","observation_id":"714980d0-1038-4f32-8146-408f74c02da7","resolution":{"observed_at":"2026-08-06T05:44:16.399301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.379649Z","title":"The theory of dynamic programming","venue":null,"work_id":"efd6a112-87ba-4c86-8454-3fbea8f074ba","year":1954},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:12.418889Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:d20e6ff5634d7f9b57ba197088ba14fa1d0ff72a10019445ad91471d664c1521","observation_id":"91486c0e-7de8-4ad9-9868-1988227725aa","resolution":{"observed_at":"2026-08-06T05:44:16.384753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.364189Z","title":"Interference and generalization in temporal difference learning","venue":null,"work_id":"b0752afd-8c40-4bb0-970e-29a5de06f1d2","year":2020},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:12.518429Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:525300e381ca28ec530967ddb4be1ff929dd592465354b6d17f5362303bcf6dd","observation_id":"4caee5a4-d6dc-4201-a34c-10df449dec34","resolution":{"observed_at":"2026-08-06T05:44:16.369073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.349319Z","title":"Exploration by random network distillation, 2018 a","venue":null,"work_id":"487610a4-9bcb-4c4f-9574-c041933a93b6","year":2018},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:12.624275Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:5c9758310fa364787d3ab7d75a7fc52b1f6ccf41ff3df7dc71b2c0265b9a8a61","observation_id":"ab5064c3-2b99-465c-9b1d-573ff2ac0daf","resolution":{"observed_at":"2026-08-06T05:44:16.353804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.334462Z","title":"Exploration by random network distillation","venue":null,"work_id":"ddc8470e-e633-42a3-b744-5589ddf6460f","year":2018},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:12.800901Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:2cb9a4f51a5d4a6d5eb1ab903c6c0e585c74291e6111a8bd1bf273ade48eda08","observation_id":"d30659ea-1eab-48c2-b419-4031954f0126","resolution":{"observed_at":"2026-08-06T05:44:16.339315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.318740Z","title":null,"venue":null,"work_id":"0f46e867-9f76-4bd9-bcf7-e3c51bf76d7a","year":2021},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:12.940884Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:9504330b6571bfde062e396016f7078900292b96818b804b0bb1c9dd9470c86c","observation_id":"8f07d446-0420-4b67-8e80-e72e1a969202","resolution":{"observed_at":"2026-08-06T05:44:16.323706Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02628","last_updated":"2022-05-03T14:08:13Z","snapshot_observed_at":"2026-08-06T14:09:00.518407Z","submitted_at":"2022-03-05T00:54:58Z","title":"Target Network and Truncation Overcome The Deadly Triad in $Q$-Learning","version":2},"cited_work":{"arxiv_id":"2203.02628","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.02628","snapshot_observed_at":"2026-08-06T05:44:15.469375Z","title":"Target Network and Truncation Overcome The Deadly Triad in $Q$-Learning","venue":"cs.LG","work_id":"06a3d506-d2bd-4b28-bfb1-39862c6fa8ec","year":2022},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:13.114051Z"},"links":{"cited_paper":"/paper/2203.02628","citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:aab4507df7705fe06bfc8481806f4d0c1b6402af5448accd37390c07997e08b2","observation_id":"03652976-be24-49f7-bf0e-8ecf3ab81883","resolution":{"observed_at":"2026-08-06T05:44:15.474846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.302972Z","title":"Phasic policy gradient","venue":null,"work_id":"e6775934-613d-4457-8f90-53286e2e408d","year":2021},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:13.226971Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:8b5f8ee4b2570028708679929f5da65e4b5a259107cc5beb804cc20ebdbf906d","observation_id":"b52edd0c-0814-40e9-be24-7cde3cdbe10e","resolution":{"observed_at":"2026-08-06T05:44:16.308603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.284940Z","title":"Loss of plasticity in deep continual learning","venue":null,"work_id":"ff969776-be3a-4ce2-9689-55aa8ad301cc","year":2024},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:13.362972Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:a861ad65c68538e52fceee4aad7827af518b64851e528f82b7be8d1481bf994e","observation_id":"88de9485-13b4-4789-8f86-17fa6b062881","resolution":{"observed_at":"2026-08-06T05:44:16.291200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.268276Z","title":"Stop regressing: Training value functions via classification for scalable deep RL","venue":null,"work_id":"8ddb187a-2171-4eb2-9213-49361afcf21a","year":2024},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:13.464882Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:6942d9e9adcf5ed66006a93fec612a7fb6fa7ccfc98b398ca14e2c79d976b86a","observation_id":"5a1084c3-0b78-49f7-b3a2-86d547419461","resolution":{"observed_at":"2026-08-06T05:44:16.273604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.252721Z","title":"Fujimoto, H","venue":null,"work_id":"b1ff6bd2-7a0e-4193-bb98-b505bbcb71a1","year":2018},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:13.647048Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:4ca77edd7bb6500a9093489df1201fb36008b50ccca437e1bff8b7bd3e833d05","observation_id":"5ec7e74d-589f-4bf7-8881-693668b66d7b","resolution":{"observed_at":"2026-08-06T05:44:16.257618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04034","last_updated":"2024-11-06T16:32:40Z","snapshot_observed_at":"2026-08-04T12:19:35.900048Z","submitted_at":"2024-11-06T16:32:40Z","title":"Non-Stationary Learning of Neural Networks with Automatic Soft Parameter Reset","version":1},"cited_work":{"arxiv_id":"2411.04034","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04034","snapshot_observed_at":"2026-08-06T05:44:15.445876Z","title":"Non-Stationary Learning of Neural Networks with Automatic Soft Parameter Reset","venue":"cs.LG","work_id":"399d873d-1d91-4835-971f-fae5170e32f9","year":2024},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:13.757638Z"},"links":{"cited_paper":"/paper/2411.04034","citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:f9bed51c9f7154fc861bdd1428fede4bb998e38d18b5815161df17ea38e6dccd","observation_id":"40ed1020-c78a-49f5-b408-d40e0818c4a5","resolution":{"observed_at":"2026-08-06T05:44:15.452859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.237431Z","title":"Improving performance in reinforcement learning by breaking generalization in neural networks","venue":null,"work_id":"efe37688-1211-4823-9f7a-e4b14c120c6f","year":2020},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:13.931406Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:698dcb8969bc369d554b7243acc0f947fa43cf7bb41de5a9901a297f68fe2dc5","observation_id":"0a9231d9-a5f3-4db5-9681-80aabfe18382","resolution":{"observed_at":"2026-08-06T05:44:16.242508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.219466Z","title":"Haarnoja, A","venue":null,"work_id":"824aaecf-a44a-484b-9e75-7d6e5301457e","year":2018},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:14.108446Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:735d2e5da3a45598bffe0f5d0aa248bb16424062ee9cb720c7eace98d49736e2","observation_id":"398644d4-ff48-4007-b3e2-65ca964f6c89","resolution":{"observed_at":"2026-08-06T05:44:16.224251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.203188Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"cebec88d-8cbe-4607-b7a8-59c86e82c55b","year":2022},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:14.243178Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:da60093df5b6891c2b4d2f89999d71bf68ed96fc95b082288a5852e17e9bb28c","observation_id":"3c9e5f52-3bf3-4823-b7ec-01384df6b968","resolution":{"observed_at":"2026-08-06T05:44:16.208501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.185838Z","title":"Rainbow: Combining improvements in deep reinforcement learning","venue":null,"work_id":"7a705b5f-2cd8-43fa-a8a1-94421fb7d1e9","year":2018},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:14.406629Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:50e8a65e9a4b30d6eb190e14a0df6d1d1430ee1c17cd817729b5dcfa39b34e3d","observation_id":"db07826b-be36-4c5a-baa9-4954c7e2210d","resolution":{"observed_at":"2026-08-06T05:44:16.191803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.169629Z","title":"Approximately optimal approximate reinforcement learning","venue":null,"work_id":"7618c6d7-88d9-4c6d-8b92-93a4c1996aa4","year":2002},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:14.537137Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:fa5c4457f7201b639be4f9365714cc5101d1790a3fe6b9371ae27f4fcac65d65","observation_id":"db39975b-1a29-41ba-870f-2a6b4559fffe","resolution":{"observed_at":"2026-08-06T05:44:16.174366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.152172Z","title":"Discor: Corrective feedback in reinforcement learning via distribution correction","venue":null,"work_id":"badcc243-1ffd-4df3-8cda-f1f10e7a871a","year":2020},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:14.662962Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:3cb49c57412722dae01067a82baa5f584cc18501cbe1ed93790b3d8ad694d05e","observation_id":"8e9f4d0f-9c87-423d-80bf-f327d0e7ff56","resolution":{"observed_at":"2026-08-06T05:44:16.158893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.136124Z","title":null,"venue":null,"work_id":"b0b4967a-082b-4c54-a9af-c8cf3cb798a3","year":2020},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:14.793980Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:9d41f618690a7ff6ea3b748dc31b461d66ecc3486efc0acb65b51c205ba8f58a","observation_id":"86f10e3c-19d3-43be-831d-836dc2b3b1bb","resolution":{"observed_at":"2026-08-06T05:44:16.141186Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.119644Z","title":"Maxmin q-learning: Controlling the estimation bias of q-learning","venue":null,"work_id":"2d1eed29-28a0-475f-bb98-99905df3b8ae","year":2020},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:14.974012Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:015de99e5e0cdf89fd2860ced948f7f24a0333e14add9dc96f65e1ca21e4da15","observation_id":"b9d82107-e6cb-4913-ae78-48ec50239c3b","resolution":{"observed_at":"2026-08-06T05:44:16.125073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.102952Z","title":"Optidice: Offline policy optimization via stationary distribution correction estimation","venue":null,"work_id":"0012ccb2-cca5-4d4a-b525-806cdab90c53","year":2021},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.071409Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:221e4f12920683d8166f8f5acc656ccac38c948d062e9d5c98a4d9289332635f","observation_id":"0d0b4467-759a-436b-bcc0-6d29e243fd3c","resolution":{"observed_at":"2026-08-06T05:44:16.108519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.087332Z","title":"Hyar: Addressing discrete-continuous action reinforcement learning via hybrid action representation","venue":null,"work_id":"93df60f1-de3e-497f-936f-6b31cb188fd7","year":2022},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.090226Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:7c08d5882678f76154b5cd121eba841849a2e48e0f41b163330873391c29f2de","observation_id":"a9e2609a-7fab-4c54-b406-4663a7ae6527","resolution":{"observed_at":"2026-08-06T05:44:16.092348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.071651Z","title":null,"venue":null,"work_id":"1541ac78-487a-4e10-91d9-951549792364","year":2015},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.102829Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:a24c3bb9c57e997a42bea1e30896b9d2a0796b4e4878fd0e107d0cbfa29b32c2","observation_id":"02bf594d-fa09-4e4c-89fa-1bd7856647a7","resolution":{"observed_at":"2026-08-06T05:44:16.076826Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.055697Z","title":"Understanding plasticity in neural networks","venue":null,"work_id":"fe47f637-a1f2-419b-9669-e556012a49fb","year":2023},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.107894Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:9537738fae8f488542aca0ea5a532af2619c39be0263838a55398f509fe7a87b","observation_id":"692c1348-e985-40f7-b5ff-a4ec1e411a5d","resolution":{"observed_at":"2026-08-06T05:44:16.060939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01800","last_updated":"2024-07-01T20:58:01Z","snapshot_observed_at":"2026-08-04T16:00:17.686427Z","submitted_at":"2024-07-01T20:58:01Z","title":"Normalization and effective learning rates in reinforcement learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01800","snapshot_observed_at":"2026-08-06T05:44:15.112426Z","title":"Normalization and effective learning rates in reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.112426Z"},"links":{"cited_paper":"/paper/2407.01800","citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:aed91635fec742a94190aaa485e2dae4b1b8b612aed7472370246f15864318d0","observation_id":"296b198c-6a76-4466-a25c-824730fbc677","resolution":{"observed_at":"2026-08-06T05:44:15.112426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.117368Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.117368Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:d3933c799d440675879a522685a1b3ab7483748ec1b1084cafcff1036ad6d063","observation_id":"5c2f20bc-4c50-40a8-bf90-2a42869a932b","resolution":{"observed_at":"2026-08-06T05:44:15.117368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02074","last_updated":"2019-12-04T16:06:10Z","snapshot_observed_at":"2026-08-05T10:28:32.357062Z","submitted_at":"2019-12-04T16:06:10Z","title":"AlgaeDICE: Policy Gradient from Arbitrary Experience","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02074","snapshot_observed_at":"2026-08-06T05:44:15.122140Z","title":"Algaedice: Policy gradient from arbitrary experience","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.122140Z"},"links":{"cited_paper":"/paper/1912.02074","citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:6c6e62f1f6bc311fb84239f6af47d5cee80c7025025f04f770beca704b256202","observation_id":"8a11509c-8cd1-46bb-8bef-8b133a160193","resolution":{"observed_at":"2026-08-06T05:44:15.122140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16158","last_updated":"2024-12-03T08:42:49Z","snapshot_observed_at":"2026-07-06T18:19:47.765281Z","submitted_at":"2024-05-25T09:53:25Z","title":"Bigger, Regularized, Optimistic: scaling for compute and sample-efficient continuous control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16158","snapshot_observed_at":"2026-08-06T05:44:15.127132Z","title":"Bigger, regularized, optimistic: scaling for compute and sample-efficient continuous control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.127132Z"},"links":{"cited_paper":"/paper/2405.16158","citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:f72a3b4f88503f12e012830ad82e8e724c7de6726ef827874b5297671e263b04","observation_id":"64d31f03-dd55-440d-a529-5d9f1229d620","resolution":{"observed_at":"2026-08-06T05:44:15.127132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.027333Z","title":"Nikishin, M","venue":null,"work_id":"979dcc8a-4057-4a92-8fe6-579b0249b3f4","year":2022},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.132767Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:fe379509412340cf94acdd6eebe93f6919dc42f4749752d29e7e354410e8d70b","observation_id":"73c79c66-b119-417c-b4b2-d90458ca0b5e","resolution":{"observed_at":"2026-08-06T05:44:16.032454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08609","last_updated":"2024-06-26T16:50:01Z","snapshot_observed_at":"2026-08-06T08:46:28.213785Z","submitted_at":"2024-02-13T17:18:56Z","title":"Mixtures of Experts Unlock Parameter Scaling for Deep RL","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08609","snapshot_observed_at":"2026-08-06T05:44:15.137915Z","title":"Mixtures of experts unlock parameter scaling for deep RL","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.137915Z"},"links":{"cited_paper":"/paper/2402.08609","citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:2170b14a5508880040ac98628183e8bfb430cc1bff039d3289d0c6d177a42eaa","observation_id":"49e4a198-8e23-4210-a2a6-6a14c665cb30","resolution":{"observed_at":"2026-08-06T05:44:15.137915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.012146Z","title":"Chatgpt: Optimizing language models for dialogue, 2022","venue":null,"work_id":"92350f44-b9c0-4a69-87e4-6439d05c98da","year":2022},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.142696Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:823ce337a101cc5ec0511c9c84e54143c07e92e34e0cfe6e1b02a6f5eab464b4","observation_id":"befae0ed-fecd-4bb2-92b0-127d5f9bb8d5","resolution":{"observed_at":"2026-08-06T05:44:16.016932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.997358Z","title":"Dota 2 with large scale deep reinforcement learning","venue":null,"work_id":"b434835b-87b9-4f4d-8754-9ce0a52281d7","year":2019},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.147758Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:0635b491533213078603d09a7d1f12e6c631906a50d8ca2a9f645907a517dd1b","observation_id":"83f468a9-7d71-4521-bab2-62eb0ccd4f4b","resolution":{"observed_at":"2026-08-06T05:44:16.002008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.982327Z","title":"Bellemare, Aaron van den Oord, and Remi Munos","venue":null,"work_id":"645a6548-d0bc-4b78-86c7-723de0a644ce","year":2017},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.152329Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:7313dc1000de55bcf6ff22ab26126cab59bbb8d4c4e833cb14bc88a60c52fa0a","observation_id":"6c23f6f7-da7b-4a29-bff5-dd379dde39c9","resolution":{"observed_at":"2026-08-06T05:44:15.987483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.967484Z","title":"The difficulty of passive learning in deep reinforcement learning","venue":null,"work_id":"596b875f-362b-490f-9b10-08ff5bdabf0c","year":2021},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.157046Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:7ca30fb12218999e0c541a79c0880bb3c53248ad7822bf4a8ea1bb3965055dea","observation_id":"042f1dbe-316a-4063-aabf-d0de3c46f816","resolution":{"observed_at":"2026-08-06T05:44:15.972739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.951316Z","title":"Jha, Toshisada Mariyama, and Daniel Nikovski","venue":null,"work_id":"42b01ce1-dc59-4416-b3cd-739853c47bae","year":2020},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.161903Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:7161ca1af46139d04e685387720ba6ef782451c7a855c89f9f910a60480ee4ef","observation_id":"d0ae13c7-9db3-427e-84c4-660e1cd560dd","resolution":{"observed_at":"2026-08-06T05:44:15.956169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.936235Z","title":"Fuzzy tiling activations: A simple approach to learning sparse representations online","venue":null,"work_id":"888e2e82-9837-4efc-a370-eaf60ebebabb","year":2021},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.167501Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:aacd7ac28cd72b123b550eaa579a428f66b977a8cdc0cd5babddf19bf8dc898d","observation_id":"34226b10-1c78-4dad-a4a4-e40eae71538b","resolution":{"observed_at":"2026-08-06T05:44:15.940986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.921314Z","title":"Efros, and Trevor Darrell","venue":null,"work_id":"190658df-d6f5-405e-b059-3b3d13035c37","year":2017},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.172719Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:deaee7ce5a11c8e6b2c815c17155defd5972381c3af07da274a28fad1123eed4","observation_id":"eb97cefc-621b-43d2-a46e-78438b04dc6c","resolution":{"observed_at":"2026-08-06T05:44:15.926529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.904643Z","title":"Bridging the gap between target networks and functional regularization","venue":null,"work_id":"09535427-d77f-4b58-9e44-280afc2eeb81","year":2022},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.179837Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:ca3eb8425511380ba40a106ffe6b4abea2fd427367dffcf4578c1bb5d2a84574","observation_id":"3f8cf745-15fe-495c-8866-5c74e443db44","resolution":{"observed_at":"2026-08-06T05:44:15.909906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.890665Z","title":"Decoupling value and policy for generalization in reinforcement learning","venue":null,"work_id":"ee8cf939-858e-426c-ab26-a3bc47affc7c","year":2021},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.185252Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:364969ffd8e167903a10567327f031b1e9ba9e7c51b3c096cab6e674092fe640","observation_id":"d6832d5f-b75a-401a-b8b8-187ff913c706","resolution":{"observed_at":"2026-08-06T05:44:15.895196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.875627Z","title":"Prioritized experience replay","venue":null,"work_id":"9fb71e1d-3b53-44b2-b66b-685a51014a0c","year":2016},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.190676Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:28fd40e5508c19144d6e0b9003fed502e0574d61501c16224930654b1b5fe3f5","observation_id":"b7edd74f-59f8-414a-98b4-47d23bbb7de1","resolution":{"observed_at":"2026-08-06T05:44:15.880540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.859680Z","title":"Schulman, S","venue":null,"work_id":"4606d7e8-1cd1-4c60-9f68-85dd4c8130dc","year":2015},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.196969Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:219aac861845264fcdaddc56e1ed92ed95ab329330a44bd45a64957d8d77ea5e","observation_id":"9c29176a-8c64-4fbb-8bf2-d94bd3197d30","resolution":{"observed_at":"2026-08-06T05:44:15.864276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T05:44:15.201847Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.201847Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:5078bc38d68192dee02a4c88b8cb885a925ead0685882884663cc337839ea63a","observation_id":"baeb9d29-7246-4a99-ba62-f1f95bb9e9ef","resolution":{"observed_at":"2026-08-06T05:44:15.201847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.844622Z","title":"Courville, Marc G","venue":null,"work_id":"878b6798-4354-459a-9df4-db06208dc8db","year":2023},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.206930Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:5065054b4575898b39468b240b183012897675a98948db92d925f528876c4aa8","observation_id":"339911d0-db30-44f0-a4ee-5bfce67c664a","resolution":{"observed_at":"2026-08-06T05:44:15.849518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.829170Z","title":null,"venue":null,"work_id":"ea5850be-7381-40aa-b78c-0aadb1645d96","year":2022},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.212085Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:66c11158a83d375b22e07e74d675ad7d15f2eefeaa2207d9ea460ce5d116a15e","observation_id":"0fce935c-1f8c-41d6-b479-817a1160e7f8","resolution":{"observed_at":"2026-08-06T05:44:15.834305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.813001Z","title":"\\#exploration: A study of count-based exploration for deep reinforcement learning, 2017","venue":null,"work_id":"149cd84d-29d8-4c51-8fdf-c57da196242f","year":2017},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.216775Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:76e310cb63495adaf823230726e039e36861bec90736d316866ac4da8e85fa70","observation_id":"f803f178-40de-4eb6-b7de-bdb65e7ad3b7","resolution":{"observed_at":"2026-08-06T05:44:15.817834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.796941Z","title":"Improving deep reinforcement learning by reducing the chain effect of value and policy churn","venue":null,"work_id":"f06148f5-7870-4a1d-a5f5-f64f0be02fd1","year":2024},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.221980Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:bd8cd94d41ffed6e4dfc9ed9aa52ba62a08622158406898a2ecf38c742ecb1bd","observation_id":"b5bdd617-acf5-4402-9c79-250644d4e6ae","resolution":{"observed_at":"2026-08-06T05:44:15.802566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.227056Z","title":"Temporal difference learning and td-gammon","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.227056Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:743df7b317bcd8cb6d04700651866750900c7a151de10d4f3e926123bb846e4b","observation_id":"b92963fa-2d7e-45e5-8748-23f0767b9695","resolution":{"observed_at":"2026-08-06T05:44:15.227056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.232608Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.232608Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:561379131c6cc9b0b74c486bcc1883e4d22f9f4539667e521375fd31f997f001","observation_id":"39dc3e1e-6ffe-45ae-b113-8b0222107181","resolution":{"observed_at":"2026-08-06T05:44:15.232608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02648","last_updated":"2018-12-06T16:36:20Z","snapshot_observed_at":"2026-07-06T07:19:38.028327Z","submitted_at":"2018-12-06T16:36:20Z","title":"Deep Reinforcement Learning and the Deadly Triad","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02648","snapshot_observed_at":"2026-08-06T05:44:15.237995Z","title":"Deep reinforcement learning and the deadly triad","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.237995Z"},"links":{"cited_paper":"/paper/1812.02648","citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:4c91f73b9fdcf002e8851a9662802ac14f87b79bcf6513529ee579b6b024bbdd","observation_id":"4d54ad17-5829-4f9c-a0f1-9b53f8d0d437","resolution":{"observed_at":"2026-08-06T05:44:15.237995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.760852Z","title":"Overcoming the spectral bias of neural value approximation","venue":null,"work_id":"ac7340b1-01d4-4e41-9d89-55d90d3be47d","year":2022},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.242757Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:12754deb4e2607a77888ab8cc67aa91d6d8c6e547604bc6e5de5f37eff891274","observation_id":"4711cce7-329c-4425-8ae4-aac846a25fca","resolution":{"observed_at":"2026-08-06T05:44:15.766412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.744623Z","title":"MinAtar : An atari-inspired testbed for thorough and reproducible reinforcement learning experiments","venue":null,"work_id":"97d593fe-25e3-408e-b0a3-a7fd499a3e92","year":2019},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.247375Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:7fd5c40c026b0b86fc674e22bc05dae2f342f1af98b51be3dfb12f052ff29912","observation_id":"ac19e42c-0955-4e59-9db1-4a4516f45894","resolution":{"observed_at":"2026-08-06T05:44:15.749648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.729845Z","title":"Learning invariant representations for reinforcement learning without reconstruction","venue":null,"work_id":"aabc182a-86b9-400e-9041-86966291c3b8","year":2021},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.251844Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:f72715b7233779435e634eed7babd3eee478741063d943c0e727848cbfb6ef7c","observation_id":"60d6ec9f-97b9-48af-8fe1-a0a208a49cc9","resolution":{"observed_at":"2026-08-06T05:44:15.734634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.714546Z","title":"Gendice: Generalized offline estimation of stationary values","venue":null,"work_id":"978f17dd-329e-4e49-934c-fa547b5a5600","year":2020},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.256785Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:7a000f2138a90dbafe12d80668009fc90d8d899792a3ffd1dd4eb8ad18002bb8","observation_id":"fdbd5858-aa05-4113-a705-2a16f45e2761","resolution":{"observed_at":"2026-08-06T05:44:15.719434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.699345Z","title":"Breaking the deadly triad with a target network","venue":null,"work_id":"f0862ae3-7710-4965-8b28-016eef9084ba","year":2021},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.262635Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:feee9c5086a50c8eaed8c9a25d25d453f71f68063eef177b354142230ae9d040","observation_id":"719dedf7-6b7d-4556-ad52-758912305210","resolution":{"observed_at":"2026-08-06T05:44:15.704127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.08621","last_updated":"2020-12-15T21:26:54Z","snapshot_observed_at":"2026-07-06T10:24:51.198967Z","submitted_at":"2020-12-15T21:26:54Z","title":"BeBold: Exploration Beyond the Boundary of Explored Regions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.08621","snapshot_observed_at":"2026-08-06T05:44:15.267730Z","title":"Bebold: Exploration beyond the boundary of explored regions","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.267730Z"},"links":{"cited_paper":"/paper/2012.08621","citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:3faea359c46a8477ae6153a2c7618956cad3ec50975571d10a4d6d5d91192821","observation_id":"76405fa5-0000-4990-93c4-51b2eff046fd","resolution":{"observed_at":"2026-08-06T05:44:15.267730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.684169Z","title":"Noveld: A simple yet effective exploration criterion","venue":null,"work_id":"958a49c6-904d-4147-a785-804c6679d393","year":2021},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.273651Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:f57e66cea8be09ad903f990599ba69965d081c79036872ba1338ef016b0f541a","observation_id":"d4bfed1c-e7c4-4ae2-8c29-abd91c3ee521","resolution":{"observed_at":"2026-08-06T05:44:15.689132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.279905Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.279905Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:9d5964621e3feac19e848a7793fd62f300c5c5d60c30b8cd3b68cea051a244f0","observation_id":"3ac185bc-b5ee-42b2-a8b6-661b1dc03eea","resolution":{"observed_at":"2026-08-06T05:44:15.279905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.285200Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.285200Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:5e07f8a14e3579cebb7c1cf411d8e0c8017fc5d81dec95600986b4b591cb7cd2","observation_id":"2de190b9-18af-4c9c-a78a-2fde7f7fe7d6","resolution":{"observed_at":"2026-08-06T05:44:15.285200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.648685Z","title":null,"venue":null,"work_id":"6b92d3c5-993c-4f1f-a749-5d2bcfaa38e9","year":2025},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.289881Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:6a44735f5c47433939ddf82c36a3ff01c5456827dd84bc64bf443c87818608bd","observation_id":"b258ad46-e590-4175-8533-77a1ac54c371","resolution":{"observed_at":"2026-08-06T05:44:15.653607Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T05:44:05.230001Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":19,"verified_exact":2,"verified_fuzzy":43},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2508.01329."}