{"as_of":"2026-08-06T22:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:122c582f7052e77c561de7e05801fc99d31c321762d283b281a105fd2574cdf2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:32:44.345803Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":"2403.03950","doi":"10.48550/arxiv.2403.03950","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Engelhard, I","venue":"arXiv (Cornell University)","work_id":"da05017c-4c76-4caa-9d4d-ad139e0392b6","year":2024},"citing_paper":{"arxiv_id":"2403.07815","last_updated":"2024-11-04T17:42:45Z","snapshot_observed_at":"2026-07-06T17:43:27.034067Z","submitted_at":"2024-03-12T16:53:54Z","title":"Chronos: Learning the Language of Time Series","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-13T08:27:23.298009Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2403.07815"},"observation_digest":"sha256:c68a2004056f9644b45e1ee0b227ef467834ab75d87538856ff7d1c12ab31134","observation_id":"68eb5b5f-310f-4f76-8ad4-8c2f50cec93c","resolution":{"observed_at":"2026-05-13T08:27:23.487475Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":"2403.03950","doi":"10.48550/arxiv.2403.03950","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Engelhard, I","venue":"arXiv (Cornell University)","work_id":"da05017c-4c76-4caa-9d4d-ad139e0392b6","year":2024},"citing_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-17T12:04:10.210508Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2409.12917"},"observation_digest":"sha256:7f31c1c809d11dc47d62e8e13aece663106e7c496ac3539dea06b15e79ba3897","observation_id":"829d6796-a05e-4a0b-8d27-9a4f3b1b4acf","resolution":{"observed_at":"2026-05-17T12:04:10.485375Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":"2403.03950","doi":"10.48550/arxiv.2403.03950","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Engelhard, I","venue":"arXiv (Cornell University)","work_id":"da05017c-4c76-4caa-9d4d-ad139e0392b6","year":2024},"citing_paper":{"arxiv_id":"2502.20349","last_updated":"2026-05-22T15:40:34Z","snapshot_observed_at":"2026-07-06T20:43:55.138388Z","submitted_at":"2025-02-27T18:20:54Z","title":"Naturalistic Computational Cognitive Science: Towards generalizable models and theories that capture the full range of natural behavior","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T02:38:26.196000Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2502.20349"},"observation_digest":"sha256:08ee5aca419208e7384500242225543e4b2bd31a89cbaae0bc9f31a75fc7c1be","observation_id":"57709a0f-590d-45ac-9b61-08887d3f6b20","resolution":{"observed_at":"2026-05-23T02:42:26.424708Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":"2403.03950","doi":"10.48550/arxiv.2403.03950","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Engelhard, I","venue":"arXiv (Cornell University)","work_id":"da05017c-4c76-4caa-9d4d-ad139e0392b6","year":2024},"citing_paper":{"arxiv_id":"2502.20349","last_updated":"2026-05-22T15:40:34Z","snapshot_observed_at":"2026-07-06T20:43:55.138388Z","submitted_at":"2025-02-27T18:20:54Z","title":"Naturalistic Computational Cognitive Science: Towards generalizable models and theories that capture the full range of natural behavior","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-25T07:53:48.604436Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2502.20349"},"observation_digest":"sha256:e070a42ce5c2279c5bd88eb932af0d9c3e14025e8437507b155a5ae1b5a0b105","observation_id":"fa4b0738-8482-4e9b-94ea-f186d525c781","resolution":{"observed_at":"2026-05-25T07:55:33.154530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":"2403.03950","doi":"10.48550/arxiv.2403.03950","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Engelhard, I","venue":"arXiv (Cornell University)","work_id":"da05017c-4c76-4caa-9d4d-ad139e0392b6","year":2024},"citing_paper":{"arxiv_id":"2510.03508","last_updated":"2026-05-22T04:10:55Z","snapshot_observed_at":"2026-08-02T14:15:10.091088Z","submitted_at":"2025-10-03T20:47:24Z","title":"D2 Actor Critic: Diffusion Actor Meets Distributional Critic","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-25T07:31:27.330951Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2510.03508"},"observation_digest":"sha256:a77fe7bb2447d46e92c6a497ea5e55cc134f64b1a3c60b6409770ea3c4ad161c","observation_id":"5d9a0d03-ad46-430e-a542-e611bd7328eb","resolution":{"observed_at":"2026-05-25T07:35:29.400283Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-04T11:01:28.459658Z","title":"Stop regressing: Training value functions via classification for scalable deep rl, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07650","last_updated":"2026-05-30T05:26:12Z","snapshot_observed_at":"2026-08-04T11:01:21.243413Z","submitted_at":"2025-10-09T00:57:40Z","title":"Value Flows","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T11:01:28.459658Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2510.07650"},"observation_digest":"sha256:f44882f1b1d5a4a6e383572287a8d8c666810913500485f12b57a41242e37df4","observation_id":"544e6d5b-cf72-4159-be1f-56330955559d","resolution":{"observed_at":"2026-08-04T11:01:28.459658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-03T06:26:49.758326Z","title":"Cobbe, K","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.23075","last_updated":"2026-06-23T21:44:31Z","snapshot_observed_at":"2026-08-03T06:17:20.457387Z","submitted_at":"2026-01-30T15:24:34Z","title":"RN-D: Discretized Categorical Actors for On-Policy Reinforcement Learning","version":2},"reference_index":843,"source":"pdf_text","source_observed_at":"2026-08-03T06:26:49.758326Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2601.23075"},"observation_digest":"sha256:ec8d24d784cd4cf9f2623ad0b7b30b0a2d3c439abec34f83af4ed3b48d1d7f07","observation_id":"2e14a882-24c4-442f-8c64-ba290c397f12","resolution":{"observed_at":"2026-08-03T06:26:49.758326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":"2403.03950","doi":"10.48550/arxiv.2403.03950","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Engelhard, I","venue":"arXiv (Cornell University)","work_id":"da05017c-4c76-4caa-9d4d-ad139e0392b6","year":2024},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-03T02:53:08.103634Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T03:36:09.272019Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:4fc6af1729e24d420ea6b5bd2f6d82e284cffbeec611bb6b9a8e166a732ee8b4","observation_id":"94690d6b-e86f-467c-b64f-00310c11c066","resolution":{"observed_at":"2026-05-16T03:37:13.913128Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-03T02:53:15.129472Z","title":"Stop regressing: Training value functions via clas- sification for scalable deep rl.arXiv preprint arXiv:2403.03950, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-03T02:53:08.103634Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:15.129472Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:7e6b748ebc1d011d251ab4e73b681d8142afd5bed08aea1374313aa6d6ac8f2c","observation_id":"94defd6d-5c96-4f7e-98bd-d0d42e4ee0a4","resolution":{"observed_at":"2026-08-03T02:53:15.129472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":"2403.03950","doi":"10.48550/arxiv.2403.03950","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Engelhard, I","venue":"arXiv (Cornell University)","work_id":"da05017c-4c76-4caa-9d4d-ad139e0392b6","year":2024},"citing_paper":{"arxiv_id":"2603.04333","last_updated":"2026-05-08T20:08:31Z","snapshot_observed_at":"2026-07-31T16:31:42.095039Z","submitted_at":"2026-03-04T17:51:30Z","title":"What Does Flow Matching Bring To TD Learning?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T16:32:29.432272Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2603.04333"},"observation_digest":"sha256:b0e2fd7ab9eb610573ddbfb5b98e752d471ddbfc4599e8fa5e6d8d6e294b7f05","observation_id":"d3fc7f7f-8fe7-4ec1-a38f-88e78e34dfe7","resolution":{"observed_at":"2026-05-15T16:36:17.834646Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":"2403.03950","doi":"10.48550/arxiv.2403.03950","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Engelhard, I","venue":"arXiv (Cornell University)","work_id":"da05017c-4c76-4caa-9d4d-ad139e0392b6","year":2024},"citing_paper":{"arxiv_id":"2604.18978","last_updated":"2026-05-07T15:47:31Z","snapshot_observed_at":"2026-08-02T06:20:27.077117Z","submitted_at":"2026-04-21T01:59:54Z","title":"Low-Rank Adaptation for Critic Learning in Off-Policy Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T02:55:22.577012Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2604.18978"},"observation_digest":"sha256:bb26089f1871605d5518c6dfc24f34a377f922dbfbc8a4377f25b0d1744b88b4","observation_id":"3bc30c35-a270-4039-aac2-5cb11aaa1904","resolution":{"observed_at":"2026-05-11T12:46:27.856199Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":"2403.03950","doi":"10.48550/arxiv.2403.03950","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Engelhard, I","venue":"arXiv (Cornell University)","work_id":"da05017c-4c76-4caa-9d4d-ad139e0392b6","year":2024},"citing_paper":{"arxiv_id":"2604.20381","last_updated":"2026-04-22T09:31:45Z","snapshot_observed_at":"2026-08-05T04:56:13.342027Z","submitted_at":"2026-04-22T09:31:45Z","title":"Distributional Value Estimation Without Target Networks for Robust Quality-Diversity","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T00:11:04.222842Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2604.20381"},"observation_digest":"sha256:b361697904f524ce81faac3d61c748f62e48c07500d9dcabb23a0be84952204a","observation_id":"b1523808-7122-45ad-97e8-60040f337875","resolution":{"observed_at":"2026-05-10T00:14:46.858264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":"2403.03950","doi":"10.48550/arxiv.2403.03950","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Engelhard, I","venue":"arXiv (Cornell University)","work_id":"da05017c-4c76-4caa-9d4d-ad139e0392b6","year":2024},"citing_paper":{"arxiv_id":"2604.24558","last_updated":"2026-04-27T14:47:22Z","snapshot_observed_at":"2026-07-06T23:10:33.821313Z","submitted_at":"2026-04-27T14:47:22Z","title":"Hierarchical Behaviour Spaces","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T03:33:48.527621Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2604.24558"},"observation_digest":"sha256:80b32730986cfad364fcc413e727143922c5dc7e575f1e9081a3c9aa717096bb","observation_id":"d4073d5f-6457-45fb-bc1c-42240b54a772","resolution":{"observed_at":"2026-05-11T22:01:12.805850Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":"2403.03950","doi":"10.48550/arxiv.2403.03950","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Engelhard, I","venue":"arXiv (Cornell University)","work_id":"da05017c-4c76-4caa-9d4d-ad139e0392b6","year":2024},"citing_paper":{"arxiv_id":"2605.01663","last_updated":"2026-05-28T02:21:27Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:32:11Z","title":"Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-10T16:25:25.739019Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2605.01663"},"observation_digest":"sha256:b5e4faac8db26b8ed44e59ab532b8ad271889723752a20e3baefcc074f875768","observation_id":"83ddd3f9-3c3d-4670-a4d4-9280249664c5","resolution":{"observed_at":"2026-05-11T08:56:00.701398Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":"2403.03950","doi":"10.48550/arxiv.2403.03950","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Engelhard, I","venue":"arXiv (Cornell University)","work_id":"da05017c-4c76-4caa-9d4d-ad139e0392b6","year":2024},"citing_paper":{"arxiv_id":"2605.31273","last_updated":"2026-05-29T13:05:08Z","snapshot_observed_at":"2026-07-31T05:45:32.260877Z","submitted_at":"2026-05-29T13:05:08Z","title":"Survival Reinforcement Learning: Toward Scalable Self-Supervised RL","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T23:22:27.775787Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2605.31273"},"observation_digest":"sha256:90a27ac45930b9229bcc07e39a42055d3fd980e02f7644cc6011caa61894dff0","observation_id":"ac178a96-50c7-432e-87f1-73fda8433b49","resolution":{"observed_at":"2026-06-28T23:22:46.545028Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":"2403.03950","doi":"10.48550/arxiv.2403.03950","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Engelhard, I","venue":"arXiv (Cornell University)","work_id":"da05017c-4c76-4caa-9d4d-ad139e0392b6","year":2024},"citing_paper":{"arxiv_id":"2606.20411","last_updated":"2026-06-18T15:58:48Z","snapshot_observed_at":"2026-08-02T04:44:49.376109Z","submitted_at":"2026-06-18T15:58:48Z","title":"Direct Advantage Estimation for Scalable and Sample-efficient Deep Reinforcement Learning","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-06-26T18:12:00.111067Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2606.20411"},"observation_digest":"sha256:2b56af65985ec775b90e4a186a4bff91601d4a0d70b599aae505b01393d39e05","observation_id":"3ae4e93a-643f-4d7d-9153-0cd30820f91e","resolution":{"observed_at":"2026-07-04T03:19:31.233703Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":"2403.03950","doi":"10.48550/arxiv.2403.03950","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Engelhard, I","venue":"arXiv (Cornell University)","work_id":"da05017c-4c76-4caa-9d4d-ad139e0392b6","year":2024},"citing_paper":{"arxiv_id":"2606.23348","last_updated":"2026-06-22T13:52:22Z","snapshot_observed_at":"2026-08-06T20:38:41.495930Z","submitted_at":"2026-06-22T13:52:22Z","title":"Superhuman AI for Generals.io Using Self-Play Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T09:03:49.551408Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2606.23348"},"observation_digest":"sha256:0cd9b652dac98476a7c37b1245ae13cc9a6e3db65d52a99c0c694042550d9674","observation_id":"5a0a0036-5fe6-4d6a-86ca-3f9a6224d9b1","resolution":{"observed_at":"2026-07-04T10:09:45.477702Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":"2403.03950","doi":"10.48550/arxiv.2403.03950","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Engelhard, I","venue":"arXiv (Cornell University)","work_id":"da05017c-4c76-4caa-9d4d-ad139e0392b6","year":2024},"citing_paper":{"arxiv_id":"2606.24742","last_updated":"2026-06-23T16:07:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-23T16:07:48Z","title":"World Value Models for Robotic Manipulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-25T23:33:50.854261Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2606.24742"},"observation_digest":"sha256:9f6583c07284680e593110a900a31a03e55c0a49c43a136d9670cec6062d102a","observation_id":"e00edf4c-2546-4721-8b4c-d7689ed94a6a","resolution":{"observed_at":"2026-07-04T17:40:00.236783Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":"2403.03950","doi":"10.48550/arxiv.2403.03950","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Engelhard, I","venue":"arXiv (Cornell University)","work_id":"da05017c-4c76-4caa-9d4d-ad139e0392b6","year":2024},"citing_paper":{"arxiv_id":"2606.28320","last_updated":"2026-07-10T14:49:00Z","snapshot_observed_at":"2026-07-15T23:17:48.900661Z","submitted_at":"2026-06-26T17:58:06Z","title":"WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T03:55:47.911210Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2606.28320"},"observation_digest":"sha256:17dc4ffeab492496b0e358c6b8466e55881ec58c574fa9690ca57f92c2f251d6","observation_id":"35f039f2-de60-4110-8433-5dad67dea679","resolution":{"observed_at":"2026-06-29T04:03:05.132513Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-07-12T11:25:18.198611Z","title":"Farebrother, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.28320","last_updated":"2026-07-10T14:49:00Z","snapshot_observed_at":"2026-07-15T23:17:48.900661Z","submitted_at":"2026-06-26T17:58:06Z","title":"WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T11:25:18.198611Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2606.28320"},"observation_digest":"sha256:1e510ff986119b48c001139c4ba018fc5afb2a2f014c290429d9d3cca3a6a690","observation_id":"6640e43d-9c1e-471c-b3fb-589ad26aba89","resolution":{"observed_at":"2026-07-12T11:25:18.198611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-07-13T07:17:21.581451Z","title":"Farebrother, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.28320","last_updated":"2026-07-10T14:49:00Z","snapshot_observed_at":"2026-07-15T23:17:48.900661Z","submitted_at":"2026-06-26T17:58:06Z","title":"WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T07:17:21.581451Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2606.28320"},"observation_digest":"sha256:0a0bc76bcdfc175431cb2ad2d10558bc33f0a5c2b0207568e1bab727241d7ac0","observation_id":"55b73d7d-5c57-4140-a3a8-1e9cf64de5e8","resolution":{"observed_at":"2026-07-13T07:17:21.581451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-01T08:32:00.021033Z","title":"arXiv preprint arXiv:2403.03950 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-05T03:29:01.517081Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.021033Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:51069880e75b9520dec7da73b30f288e5981b77b0f5e0461d0e48101f92528db","observation_id":"703baa5e-1d4f-4cce-8642-aff5faab71a4","resolution":{"observed_at":"2026-08-01T08:32:00.021033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-06T00:32:44.345803Z","title":"arXiv preprint arXiv:2403.03950 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01205","last_updated":"2026-08-02T12:42:20Z","snapshot_observed_at":"2026-08-06T21:22:04.316921Z","submitted_at":"2026-08-02T12:42:20Z","title":"ReBRAC-v2: The Return of the King","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T00:32:44.345803Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2608.01205"},"observation_digest":"sha256:8f69967d1045f19b1d5edab8d038aa7a1b4d437872bccbfc269acfdc94b5de92","observation_id":"7d547984-a1a0-4dc0-995e-8ca771626df5","resolution":{"observed_at":"2026-08-06T00:32:44.345803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.03950/citation-record","integrity":"/paper/2403.03950/integrity","json":"/paper/2403.03950/citation-record.json","paper":"/paper/2403.03950"},"outbound":[],"paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2403.03950."}