{"as_of":"2026-08-07T16:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:afe26cf6a4a57ac4f45c6f72399d220a79281646a4ced2c0e4bc0d20c02bf9d7","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:34:04.168498Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.13862/citation-record","integrity":"/paper/2506.13862/integrity","json":"/paper/2506.13862/citation-record.json","paper":"/paper/2506.13862"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.364768Z","title":"single-task RL","venue":null,"work_id":"9d801594-b840-458d-b2d9-5cc2c92b22ce","year":2020},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-07T00:24:19.971630Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.294608Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:069bfed05e4c54a5e6f7e9192c49a8802d4e349c2d514a24e3d092ac4636cd28","observation_id":"86109e89-1663-4981-a269-60bc7099eba2","resolution":{"observed_at":"2026-08-07T00:34:06.503389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.149431Z","title":null,"venue":null,"work_id":"f270a6b8-1011-47cd-91e3-8dc9d7cdb95a","year":2001},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-07T00:24:19.971630Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.894245Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:40559fbc32a93152b1c9fd64a38c83caec3596695e5bfc75039bf4f3ae2aca1c","observation_id":"f7264f06-876d-4bf3-ac89-6f1a90f7d4ea","resolution":{"observed_at":"2026-08-07T00:34:07.288593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.640689Z","title":null,"venue":null,"work_id":"1b091b71-9233-45e2-ac57-17c444391480","year":2018},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-07T00:24:19.971630Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.161264Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:a94805dad53c9d1f5b200541a737a72e7c61eff053d7c70dc71a954528d8e816","observation_id":"bf13b061-6f02-4338-947f-3b3082204d4b","resolution":{"observed_at":"2026-08-07T00:34:06.730051Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.03176","last_updated":"2019-06-07T00:36:50Z","snapshot_observed_at":"2026-07-06T07:37:51.655095Z","submitted_at":"2019-03-07T20:34:36Z","title":"MinAtar: An Atari-Inspired Testbed for Thorough and Reproducible Reinforcement Learning Experiments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.03176","snapshot_observed_at":"2026-08-07T00:34:02.491366Z","title":"and Tian, T","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-07T00:24:19.971630Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.491366Z"},"links":{"cited_paper":"/paper/1903.03176","citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:b36b802629cfc927f8b5adfaac0b561842b9746088b0c75e46cf389961d1749d","observation_id":"7014e099-0c24-42b9-a2c3-688f78ce2d9a","resolution":{"observed_at":"2026-08-07T00:34:02.491366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.422595Z","title":null,"venue":null,"work_id":"702d318e-cd6e-4918-88ef-88c53bd95aed","year":2019},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-07T00:24:19.971630Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.732844Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:54e4d16ed23373bb16408701df5d8089ce68053b5b312551d920ad26338dca1f","observation_id":"13004cb4-2553-452c-87f0-0eb8c1412822","resolution":{"observed_at":"2026-08-07T00:34:07.545576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.122990Z","title":null,"venue":null,"work_id":"5ad1550f-46cb-4064-8908-ea6f962c7a24","year":2021},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-07T00:24:19.971630Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.429724Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:acd3066c8d0d69d9479153434dc11f3adddcb63acbc50304a7649d439c7982ac","observation_id":"8bb50f7b-3cd9-4073-b96f-4cbeae8614ef","resolution":{"observed_at":"2026-08-07T00:34:06.224679Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.812486Z","title":"For PQN, we use the CleanRL implementation (Huang et al., 2022)","venue":null,"work_id":"f4b16bd2-078a-4d12-b2d0-3b6aa008fe5e","year":2019},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-07T00:24:19.971630Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.537326Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:3eb559785b3db5a8e511d6fa32c4f4a304f1ebe1f19ad2b9d8527d2cb78f51f2","observation_id":"c052211d-e640-432d-8c14-0d3c16cdc075","resolution":{"observed_at":"2026-08-07T00:34:05.917222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.602172Z","title":null,"venue":null,"work_id":"a2f6ef16-2c2e-4d6c-aa39-73f373ffa12a","year":null},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-07T00:24:19.971630Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.697384Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:81b733890dcbf06a87a89bfe56ad6e60c2fda64fd26e4696d29359d4e3ed3c98","observation_id":"2977c183-1317-43ac-b637-925c2a76c054","resolution":{"observed_at":"2026-08-07T00:34:05.694862Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.331998Z","title":"In the MinAtar environ- ments α is linearly annealed from 1 to 0 over the course of learning.∗Humanoid-v4 uses a hidden layer size of256","venue":null,"work_id":"b7936d88-1d73-444f-9909-4b64e49251b9","year":2017},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-07T00:24:19.971630Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.814872Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:7ea8c89e252213c5028b9dbac37e300142eb35c42e5e2aa19002ddaa361d13da","observation_id":"604c68c7-509d-41e0-a758-99730384f708","resolution":{"observed_at":"2026-08-07T00:34:05.424094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.064563Z","title":null,"venue":null,"work_id":"a5093ba6-0292-4d37-ba53-5158ab6a25b3","year":2015},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-07T00:24:19.971630Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:04.036926Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:3fa70c68c96ca78cb8249f516fb15ed99406957cd13e3229036a93be7494d100","observation_id":"e27c280b-70f5-4b1e-bb4a-d2578ef42c6b","resolution":{"observed_at":"2026-08-07T00:34:05.131796Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:04.840000Z","title":"Classic and MinAtar hyperparameters are based on the original paper (Gallici et al., 2025), while MuJoCo hyperparameters were found by hyperparameter tuning","venue":null,"work_id":"69519f89-2262-4c15-a0e9-1b264a5b6e6f","year":2025},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-07T00:24:19.971630Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:04.168498Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:02222b7ccff31b4d347ad1622b581460bb434a9efce44c1557fd11fd05774bb4","observation_id":"81bef3d0-d1a3-4e91-8a59-3480fe621da4","resolution":{"observed_at":"2026-08-07T00:34:04.937775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:01.737396Z","title":"doi: 10.1016/S0167-6377(02)00231-6","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-07T00:24:19.971630Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:01.737396Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:e788e6aa9fb2e887d8c9ccd4c49f777d3c98a1306865d51d3ada601148ab597a","observation_id":"0b0f0d1f-d8c6-4ac8-bb09-b376ac207a24","resolution":{"observed_at":"2026-08-07T00:34:01.737396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-08-07T00:34:02.274823Z","title":"Mirror descent policy optimization","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-07T00:24:19.971630Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.274823Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:bdaa56624a9e1ce994c5c04ee490d36550031242f1c9d0d170199ae479cd45bd","observation_id":"89fea3c6-8f12-4a8f-99a4-1d118f9ff6c4","resolution":{"observed_at":"2026-08-07T00:34:02.274823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.848188Z","title":"We can see in Fig","venue":null,"work_id":"07c205b0-e1dd-4fd7-b8f9-d413b5bf5c33","year":2020},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-07T00:24:19.971630Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.027368Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:30d918e5a0ef2a7c9dbf72dfd351a5cdb326b2cb342ed24ef484e756518585ce","observation_id":"a11d5ff7-9cf5-4c62-91ea-fcb73de79e63","resolution":{"observed_at":"2026-08-07T00:34:07.019219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01400","last_updated":"2023-02-21T14:48:00Z","snapshot_observed_at":"2026-07-06T13:59:19.633826Z","submitted_at":"2022-10-04T06:17:52Z","title":"Linear Convergence of Natural Policy Gradient Methods with Log-Linear Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01400","snapshot_observed_at":"2026-08-07T00:34:02.598175Z","title":"S., Gower, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-07T00:24:19.971630Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.598175Z"},"links":{"cited_paper":"/paper/2210.01400","citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:6a9248823c329ce295eeea47b7fec5e705a1fa9529ff67e1a7f37b8e6d77c6ea","observation_id":"82fdb66c-f27d-4497-abf3-de8584454647","resolution":{"observed_at":"2026-08-07T00:34:02.598175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.09457","last_updated":"2022-11-29T17:00:55Z","snapshot_observed_at":"2026-08-03T16:50:13.855764Z","submitted_at":"2022-01-24T04:54:58Z","title":"Homotopic Policy Mirror Descent: Policy Convergence, Implicit Regularization, and Improved Sample Complexity","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.09457","snapshot_observed_at":"2026-08-07T00:34:02.124836Z","title":"Homotopic policy mirror descent: Policy convergence, implicit regularization, and improved sample complexity.arXiv preprint arXiv:2201.09457,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-07T00:24:19.971630Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.124836Z"},"links":{"cited_paper":"/paper/2201.09457","citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:0c552fa9721a5d879f23915f77e4ba77f9d7d8ce6f56fa5b51c195ddfbd750c2","observation_id":"eb783b25-fc5b-4a52-b22e-b3a4fd72315a","resolution":{"observed_at":"2026-08-07T00:34:02.124836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.05982","last_updated":"2021-03-18T03:42:07Z","snapshot_observed_at":"2026-07-06T10:32:46.366651Z","submitted_at":"2021-01-15T06:25:58Z","title":"Randomized Ensembled Double Q-Learning: Learning Fast Without a Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.05982","snapshot_observed_at":"2026-08-07T00:34:01.863748Z","title":"Randomized ensembled double q-learning: Learning fast without a model.arXiv preprint arXiv:2101.05982,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-07T00:24:19.971630Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:01.863748Z"},"links":{"cited_paper":"/paper/2101.05982","citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:84d013ad99d595321c36b20dfdb691a62022fdab9090a5d4c1a6f0cd0b4de595","observation_id":"726edaa6-805d-4d80-9f87-9537bbeb5c61","resolution":{"observed_at":"2026-08-07T00:34:01.863748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06487","last_updated":"2021-08-07T18:51:37Z","snapshot_observed_at":"2026-08-06T06:51:06.607084Z","submitted_at":"2020-02-16T02:02:23Z","title":"Maxmin Q-learning: Controlling the Estimation Bias of Q-learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06487","snapshot_observed_at":"2026-08-07T00:34:01.965749Z","title":"Maxmin q-learning: Controlling the estimation bias of q-learning.arXiv preprint arXiv:2002.06487,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-07T00:24:19.971630Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:01.965749Z"},"links":{"cited_paper":"/paper/2002.06487","citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:4243cd701d68601045cf9d25acc3863fc060b4a5903133bc0a7983b7693437d2","observation_id":"6f1bc58c-a35c-4fa4-a565-7dc90dcc5f57","resolution":{"observed_at":"2026-08-07T00:34:01.965749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:02.354750Z","title":"van Hasselt, H., Doron, Y., Strub, F., Hessel, M., Sonnerat, N., and Modayil, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-07T00:24:19.971630Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.354750Z"},"links":{"citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:c1273217bb124a590473d9d910324bfe1a67d093f8c6c25676e930e2bbcd1078","observation_id":"b7c1b16f-eca0-4fbb-9424-7b73cac187dd","resolution":{"observed_at":"2026-08-07T00:34:02.354750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T00:24:19.971630Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2506.13862."}