{"as_of":"2026-08-11T16:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f0363e1ff45d1e29de6369cb2611d16b72bf1697ae513fd05a3a88efbca10935","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:11:48.357673Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":34,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2002.12292","last_updated":"2020-02-29T16:12:58Z","snapshot_observed_at":"2026-08-10T22:27:45.925100Z","submitted_at":"2020-02-27T18:03:16Z","title":"RIDE: Rewarding Impact-Driven Exploration for Procedurally-Generated Environments","version":2},"cited_work":{"arxiv_id":"2002.12292","doi":"10.48550/arxiv.2002.12292","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.12292","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2002.12292 , year=","venue":"arXiv (Cornell University)","work_id":"2d43b8b8-ad54-4100-b5d2-5022a4d363a8","year":2002},"citing_paper":{"arxiv_id":"2309.16797","last_updated":"2023-09-28T19:01:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T19:01:07Z","title":"Promptbreeder: Self-Referential Self-Improvement Via Prompt Evolution","version":1},"reference_index":267,"source":"arxiv_source","source_observed_at":"2026-05-16T08:12:30.984870Z"},"links":{"cited_paper":"/paper/2002.12292","citing_paper":"/paper/2309.16797"},"observation_digest":"sha256:5b592f26afcf09243feb37aa0c1adf2195cdf74fc8b7e134fa7b7d891f43ad0e","observation_id":"c865aed2-9004-4d0b-bfe8-64996daabd1c","resolution":{"observed_at":"2026-05-16T08:12:31.148831Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.12292","last_updated":"2020-02-29T16:12:58Z","snapshot_observed_at":"2026-08-10T22:27:45.925100Z","submitted_at":"2020-02-27T18:03:16Z","title":"RIDE: Rewarding Impact-Driven Exploration for Procedurally-Generated Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.12292","snapshot_observed_at":"2026-08-10T18:11:48.357673Z","title":"arXiv preprint arXiv:2002.12292 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.11533","last_updated":"2025-01-20T15:17:24Z","snapshot_observed_at":"2026-08-11T02:20:50.214753Z","submitted_at":"2025-01-20T15:17:24Z","title":"The impact of intrinsic rewards on exploration in Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:48.357673Z"},"links":{"cited_paper":"/paper/2002.12292","citing_paper":"/paper/2501.11533"},"observation_digest":"sha256:2b414fa4938b6171c285c869ce5e54f8e2b3300ad03888ebb47d69169ea4237d","observation_id":"94a24c8d-85ac-4ea5-9b53-cf2da92f5e3f","resolution":{"observed_at":"2026-08-10T18:11:48.357673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.12292","last_updated":"2020-02-29T16:12:58Z","snapshot_observed_at":"2026-08-10T22:27:45.925100Z","submitted_at":"2020-02-27T18:03:16Z","title":"RIDE: Rewarding Impact-Driven Exploration for Procedurally-Generated Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.12292","snapshot_observed_at":"2026-08-10T14:25:58.977311Z","title":"Ride: Rewarding impact-driven exploration for procedurally-generated environments","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2501.15418","last_updated":"2025-01-26T06:43:45Z","snapshot_observed_at":"2026-08-11T16:02:34.802589Z","submitted_at":"2025-01-26T06:43:45Z","title":"Episodic Novelty Through Temporal Distance","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T14:25:58.977311Z"},"links":{"cited_paper":"/paper/2002.12292","citing_paper":"/paper/2501.15418"},"observation_digest":"sha256:cb6fcd0dd590214a335bd846df79b4eb443d91092088c0c561baade3822bb3da","observation_id":"814bafc7-d09e-4e09-880e-5d93a4c7f339","resolution":{"observed_at":"2026-08-10T14:25:58.977311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.12292","last_updated":"2020-02-29T16:12:58Z","snapshot_observed_at":"2026-08-10T22:27:45.925100Z","submitted_at":"2020-02-27T18:03:16Z","title":"RIDE: Rewarding Impact-Driven Exploration for Procedurally-Generated Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.12292","snapshot_observed_at":"2026-08-07T13:53:57.551508Z","title":"Ride: Rewarding impact-driven exploration for procedurally-generated environments","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-07T22:45:15.753079Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:57.551508Z"},"links":{"cited_paper":"/paper/2002.12292","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:11ee2feffdf1e409a2783b1e9a7a977421a69b1e3b8340e365b903a0ebbeb9b9","observation_id":"d8cb284d-c321-4eff-9481-1f696a007576","resolution":{"observed_at":"2026-08-07T13:53:57.551508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.12292","last_updated":"2020-02-29T16:12:58Z","snapshot_observed_at":"2026-08-10T22:27:45.925100Z","submitted_at":"2020-02-27T18:03:16Z","title":"RIDE: Rewarding Impact-Driven Exploration for Procedurally-Generated Environments","version":2},"cited_work":{"arxiv_id":"2002.12292","doi":"10.48550/arxiv.2002.12292","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.12292","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2002.12292 , year=","venue":"arXiv (Cornell University)","work_id":"2d43b8b8-ad54-4100-b5d2-5022a4d363a8","year":2002},"citing_paper":{"arxiv_id":"2509.25438","last_updated":"2026-04-03T16:34:50Z","snapshot_observed_at":"2026-08-08T15:49:58.765974Z","submitted_at":"2025-09-29T19:43:44Z","title":"Beyond Noisy-TVs: Noise-Robust Exploration Via Learning Progress Monitoring","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T11:50:46.257332Z"},"links":{"cited_paper":"/paper/2002.12292","citing_paper":"/paper/2509.25438"},"observation_digest":"sha256:c3bb2eb85898b234f3fc21dedc9bcbdbce136000091d91a1c788aeb12eb627b5","observation_id":"d859f02f-2ab9-4cc4-b7b2-20e0ccb04bec","resolution":{"observed_at":"2026-05-18T11:51:20.179492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.12292","last_updated":"2020-02-29T16:12:58Z","snapshot_observed_at":"2026-08-10T22:27:45.925100Z","submitted_at":"2020-02-27T18:03:16Z","title":"RIDE: Rewarding Impact-Driven Exploration for Procedurally-Generated Environments","version":2},"cited_work":{"arxiv_id":"2002.12292","doi":"10.48550/arxiv.2002.12292","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.12292","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2002.12292 , year=","venue":"arXiv (Cornell University)","work_id":"2d43b8b8-ad54-4100-b5d2-5022a4d363a8","year":2002},"citing_paper":{"arxiv_id":"2604.15414","last_updated":"2026-06-09T00:58:37Z","snapshot_observed_at":"2026-08-10T22:22:22.671101Z","submitted_at":"2026-04-16T17:06:54Z","title":"Beyond Single-Model Optimization: Preserving Plasticity in Continual Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T11:01:17.325738Z"},"links":{"cited_paper":"/paper/2002.12292","citing_paper":"/paper/2604.15414"},"observation_digest":"sha256:500cc60b072ce084b235585658efc96fc9bfbe69bd885a92ad00968f84deded1","observation_id":"92993aed-0cd0-4596-9926-ddde69b56c67","resolution":{"observed_at":"2026-05-10T11:05:08.940023Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.12292","last_updated":"2020-02-29T16:12:58Z","snapshot_observed_at":"2026-08-10T22:27:45.925100Z","submitted_at":"2020-02-27T18:03:16Z","title":"RIDE: Rewarding Impact-Driven Exploration for Procedurally-Generated Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.12292","snapshot_observed_at":"2026-07-12T19:46:39.624903Z","title":"Ride: Rewarding impact-driven exploration for procedurally-generated envi- ronments.arXiv preprint arXiv:2002.12292,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2604.15414","last_updated":"2026-06-09T00:58:37Z","snapshot_observed_at":"2026-08-10T22:22:22.671101Z","submitted_at":"2026-04-16T17:06:54Z","title":"Beyond Single-Model Optimization: Preserving Plasticity in Continual Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T19:46:39.624903Z"},"links":{"cited_paper":"/paper/2002.12292","citing_paper":"/paper/2604.15414"},"observation_digest":"sha256:285f222677cefac6eee315730f09530062a4f1bfd2afce3b199819458b94cd97","observation_id":"38ebcaba-2444-46e8-8ddd-7b7172f98ee2","resolution":{"observed_at":"2026-07-12T19:46:39.624903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.12292","last_updated":"2020-02-29T16:12:58Z","snapshot_observed_at":"2026-08-10T22:27:45.925100Z","submitted_at":"2020-02-27T18:03:16Z","title":"RIDE: Rewarding Impact-Driven Exploration for Procedurally-Generated Environments","version":2},"cited_work":{"arxiv_id":"2002.12292","doi":"10.48550/arxiv.2002.12292","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.12292","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2002.12292 , year=","venue":"arXiv (Cornell University)","work_id":"2d43b8b8-ad54-4100-b5d2-5022a4d363a8","year":2002},"citing_paper":{"arxiv_id":"2605.23551","last_updated":"2026-05-22T12:17:09Z","snapshot_observed_at":"2026-07-06T23:33:44.335185Z","submitted_at":"2026-05-22T12:17:09Z","title":"Goal-Conditioned Agents that Learn Everything All at Once","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-25T04:59:48.867927Z"},"links":{"cited_paper":"/paper/2002.12292","citing_paper":"/paper/2605.23551"},"observation_digest":"sha256:06598cf4ad2b49e2b57a3138fe057a7f190e7b2da5b4e61da52590ff366254df","observation_id":"e96c06e7-53f4-4751-8899-5b4665cb798f","resolution":{"observed_at":"2026-05-25T05:00:21.466068Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.12292","last_updated":"2020-02-29T16:12:58Z","snapshot_observed_at":"2026-08-10T22:27:45.925100Z","submitted_at":"2020-02-27T18:03:16Z","title":"RIDE: Rewarding Impact-Driven Exploration for Procedurally-Generated Environments","version":2},"cited_work":{"arxiv_id":"2002.12292","doi":"10.48550/arxiv.2002.12292","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.12292","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2002.12292 , year=","venue":"arXiv (Cornell University)","work_id":"2d43b8b8-ad54-4100-b5d2-5022a4d363a8","year":2002},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2002.12292","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:30fa05bb4c1c42333e51ba9226f86391b5fa9b9a648cba150257bd995db98394","observation_id":"c74f7ca1-cf00-4cef-9c71-7b6cc29f80e6","resolution":{"observed_at":"2026-07-02T02:06:27.252391Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.12292","last_updated":"2020-02-29T16:12:58Z","snapshot_observed_at":"2026-08-10T22:27:45.925100Z","submitted_at":"2020-02-27T18:03:16Z","title":"RIDE: Rewarding Impact-Driven Exploration for Procedurally-Generated Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.12292","snapshot_observed_at":"2026-08-01T11:54:58.489272Z","title":"Ride: Rewarding impact-driven exploration for procedurally-generated environments.arXiv preprint arXiv:2002.12292, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:58.489272Z"},"links":{"cited_paper":"/paper/2002.12292","citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:f39d282e9cac9d0d0876a2cb7d4ea9860da954790b3e112ed0fc99bf76530ca8","observation_id":"e39b4dfb-3766-4988-bd8f-80d31b93802a","resolution":{"observed_at":"2026-08-01T11:54:58.489272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2002.12292/citation-record","integrity":"/paper/2002.12292/integrity","json":"/paper/2002.12292/citation-record.json","paper":"/paper/2002.12292"},"outbound":[],"paper":{"arxiv_id":"2002.12292","last_updated":"2020-02-29T16:12:58Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T22:27:45.925100Z","submitted_at":"2020-02-27T18:03:16Z","title":"RIDE: Rewarding Impact-Driven Exploration for Procedurally-Generated Environments"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2002.12292."}