{"as_of":"2026-08-08T18:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f51d75b2852e61a1389276e3dd8c89852c86fed10ecd231dea53be2b8b405452","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:58:51.075651Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T13:01:23.635839Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.00514","last_updated":"2024-06-19T11:32:01Z","snapshot_observed_at":"2026-07-06T17:38:04.972649Z","submitted_at":"2024-03-01T13:25:10Z","title":"Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00514","snapshot_observed_at":"2026-08-07T12:58:51.075651Z","title":"Overestimation, overfitting, and plasticity in actor-critic: the bitter lesson of reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T23:49:30.072079Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:51.075651Z"},"links":{"cited_paper":"/paper/2403.00514","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:faf220973c0dd6f154cef95055ef88c48cc65056d5e62f3154d113986be572cb","observation_id":"19548d37-4bec-43bc-af16-66f226479d82","resolution":{"observed_at":"2026-08-07T12:58:51.075651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00514","last_updated":"2024-06-19T11:32:01Z","snapshot_observed_at":"2026-07-06T17:38:04.972649Z","submitted_at":"2024-03-01T13:25:10Z","title":"Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00514","snapshot_observed_at":"2026-08-07T12:10:03.917362Z","title":"Overestimation, overfitting, and plasticity in actor-critic: the bitter lesson of reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-07T12:00:27.421702Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:03.917362Z"},"links":{"cited_paper":"/paper/2403.00514","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:f30370b931dda8e8c3646585e105c69a71d71de7bf2dea99fb0596d06c23c74f","observation_id":"8fd96c6b-db8e-4849-a3f8-57a82ec57793","resolution":{"observed_at":"2026-08-07T12:10:03.917362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00514","last_updated":"2024-06-19T11:32:01Z","snapshot_observed_at":"2026-07-06T17:38:04.972649Z","submitted_at":"2024-03-01T13:25:10Z","title":"Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00514","snapshot_observed_at":"2026-08-07T10:18:49.734756Z","title":"Overestimation, overfitting, and plasticity in actor-critic: the bitter lesson of reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-08T10:10:18.021679Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:49.734756Z"},"links":{"cited_paper":"/paper/2403.00514","citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:e3fa7d9fe7f94ad9c26235e461cebcbff065a01db1c4a75489bca94295dc9ed0","observation_id":"77e2d3d5-0248-4d0c-98b1-276b66674e6a","resolution":{"observed_at":"2026-08-07T10:18:49.734756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00514","last_updated":"2024-06-19T11:32:01Z","snapshot_observed_at":"2026-07-06T17:38:04.972649Z","submitted_at":"2024-03-01T13:25:10Z","title":"Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00514","snapshot_observed_at":"2026-08-06T20:31:07.829896Z","title":"Overestimation, overfitting, and plasticity in actor-critic: the bitter lesson of reinforcement learning, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-08T15:34:11.449065Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.829896Z"},"links":{"cited_paper":"/paper/2403.00514","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:02af2ede5096974a0300569ba4baecb5ad85c3fec55e566eeef16027f9596550","observation_id":"e48555d3-1a4f-4afc-9fb0-98007b4db202","resolution":{"observed_at":"2026-08-06T20:31:07.829896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00514","last_updated":"2024-06-19T11:32:01Z","snapshot_observed_at":"2026-07-06T17:38:04.972649Z","submitted_at":"2024-03-01T13:25:10Z","title":"Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00514","snapshot_observed_at":"2026-08-06T18:18:46.737730Z","title":"Overestimation, overfitting, and plasticity in actor-critic: the bitter lesson of reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08718","last_updated":"2025-07-11T16:19:45Z","snapshot_observed_at":"2026-08-08T04:07:41.428130Z","submitted_at":"2025-07-11T16:19:45Z","title":"On the Effect of Regularization in Policy Mirror Descent","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T18:18:46.737730Z"},"links":{"cited_paper":"/paper/2403.00514","citing_paper":"/paper/2507.08718"},"observation_digest":"sha256:8a6cc25aa02a2d5f4a707e4720eaf48b1415c94a92aba64aafaca9a11e402015","observation_id":"e7e28391-58e3-45e9-8de3-f0ae950b80ef","resolution":{"observed_at":"2026-08-06T18:18:46.737730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00514","last_updated":"2024-06-19T11:32:01Z","snapshot_observed_at":"2026-07-06T17:38:04.972649Z","submitted_at":"2024-03-01T13:25:10Z","title":"Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00514","snapshot_observed_at":"2026-08-06T15:55:35.644714Z","title":"Overestimation, overfitting, and plasticity in actor-critic: the bitter lesson of reinforcement learning, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14736","last_updated":"2025-07-19T19:53:08Z","snapshot_observed_at":"2026-08-06T15:46:49.918611Z","submitted_at":"2025-07-19T19:53:08Z","title":"Balancing Expressivity and Robustness: Constrained Rational Activations for Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T15:55:35.644714Z"},"links":{"cited_paper":"/paper/2403.00514","citing_paper":"/paper/2507.14736"},"observation_digest":"sha256:9c5e6a1364696b381b103f10564f1191c13d33778b79522dde1694fefd5b4c46","observation_id":"3b7ccadc-2df1-43f7-987f-f5286c24b362","resolution":{"observed_at":"2026-08-06T15:55:35.644714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00514","last_updated":"2024-06-19T11:32:01Z","snapshot_observed_at":"2026-07-06T17:38:04.972649Z","submitted_at":"2024-03-01T13:25:10Z","title":"Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2403.00514","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.00514","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Overestimation, overfitting, and plasticity in actor-critic: the bitter lesson of reinforcement learning","venue":null,"work_id":"f22efa67-a85f-4efe-bad7-d49e962eac4c","year":null},"citing_paper":{"arxiv_id":"2509.22562","last_updated":"2026-04-30T15:40:29Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-26T16:41:47Z","title":"Activation Function Design Sustains Plasticity in Continual Learning","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T13:00:27.749673Z"},"links":{"cited_paper":"/paper/2403.00514","citing_paper":"/paper/2509.22562"},"observation_digest":"sha256:eb5ff46b38cf22459948a69db256af9d4d91f9f351d452193494597a1dc97caf","observation_id":"5fc359b0-f3cd-4b89-b0ec-b6118a569801","resolution":{"observed_at":"2026-05-18T13:01:23.638555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00514","last_updated":"2024-06-19T11:32:01Z","snapshot_observed_at":"2026-07-06T17:38:04.972649Z","submitted_at":"2024-03-01T13:25:10Z","title":"Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2403.00514","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.00514","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Overestimation, overfitting, and plasticity in actor-critic: the bitter lesson of reinforcement learning","venue":null,"work_id":"f22efa67-a85f-4efe-bad7-d49e962eac4c","year":null},"citing_paper":{"arxiv_id":"2605.01131","last_updated":"2026-05-01T22:03:52Z","snapshot_observed_at":"2026-08-03T22:46:37.334472Z","submitted_at":"2026-05-01T22:03:52Z","title":"Forager: a lightweight testbed for continual learning with partial observability in RL","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-09T19:16:47.462346Z"},"links":{"cited_paper":"/paper/2403.00514","citing_paper":"/paper/2605.01131"},"observation_digest":"sha256:6c3a645a6f20d496bf5a8af25f28b2b847ed3fa360de44b2ec5b95eaac7f1e16","observation_id":"90130f14-8157-4070-aee3-50ebfdb0a4d1","resolution":{"observed_at":"2026-05-11T15:46:53.453377Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00514","last_updated":"2024-06-19T11:32:01Z","snapshot_observed_at":"2026-07-06T17:38:04.972649Z","submitted_at":"2024-03-01T13:25:10Z","title":"Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00514","snapshot_observed_at":"2026-08-02T08:51:17.033858Z","title":"arXiv preprint arXiv:2403.00514 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19397","last_updated":"2026-07-04T05:45:32Z","snapshot_observed_at":"2026-08-07T17:40:18.629969Z","submitted_at":"2026-07-04T05:45:32Z","title":"Memory Merge DQN: Sensitivity Weighted Target Updates for Stable Value Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T08:51:17.033858Z"},"links":{"cited_paper":"/paper/2403.00514","citing_paper":"/paper/2607.19397"},"observation_digest":"sha256:8e15be38087c494b9ecf5ab82dea5d42d9cd71f9f292c19c922d4a1d928cf37d","observation_id":"d6fde913-fe6b-47d7-b25d-6c1a436a441f","resolution":{"observed_at":"2026-08-02T08:51:17.033858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00514","last_updated":"2024-06-19T11:32:01Z","snapshot_observed_at":"2026-07-06T17:38:04.972649Z","submitted_at":"2024-03-01T13:25:10Z","title":"Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00514","snapshot_observed_at":"2026-07-31T04:05:50.150983Z","title":"Overestimation, overfitting, and plasticity in actor-critic: the bitter lesson of rein- forcement learning.arXiv preprint arXiv:2403.00514,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24996","last_updated":"2026-07-27T18:53:00Z","snapshot_observed_at":"2026-08-06T23:30:24.623782Z","submitted_at":"2026-07-27T18:53:00Z","title":"Calibrated Partial Resets: Preventing Policy Collapse in Continual Reinforcement Learning","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-07-31T04:05:50.150983Z"},"links":{"cited_paper":"/paper/2403.00514","citing_paper":"/paper/2607.24996"},"observation_digest":"sha256:fb87499fe749ac2434e0939ca429249f12fc944798dd5259949f494a8648e15f","observation_id":"6af8d223-f4fb-493e-b5ab-f11e853aa1d2","resolution":{"observed_at":"2026-07-31T04:05:50.150983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.00514/citation-record","integrity":"/paper/2403.00514/integrity","json":"/paper/2403.00514/citation-record.json","paper":"/paper/2403.00514"},"outbound":[],"paper":{"arxiv_id":"2403.00514","last_updated":"2024-06-19T11:32:01Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T17:38:04.972649Z","submitted_at":"2024-03-01T13:25:10Z","title":"Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2403.00514."}