{"as_of":"2026-08-07T14:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4d81ac3ca8251bb5babb19f0706aff3c01c8183cae63e133dbeb64ef0c8123f6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:58:56.493723Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T14:25:45.826205Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-08-07T12:58:56.493723Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-07T12:50:03.808094Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:56.493723Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:163a7b0d756631862316478e6f6e8010c140c6b6c9e4e9ceee47d3cf7b4e1805","observation_id":"0b282f09-1121-4413-bd59-10267b12cb72","resolution":{"observed_at":"2026-08-07T12:58:56.493723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-08-06T19:53:06.334933Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04452","last_updated":"2025-07-06T16:18:40Z","snapshot_observed_at":"2026-08-06T21:06:22.043754Z","submitted_at":"2025-07-06T16:18:40Z","title":"SimLauncher: Launching Sample-Efficient Real-world Robotic Reinforcement Learning via Simulation Pre-training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:53:06.334933Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2507.04452"},"observation_digest":"sha256:3c6ab55f1f42e93827e4563737b3441074e0e9fa94b02341e4ffda899318a580","observation_id":"ba3f8c42-beed-4bc0-8510-eae4208a51e4","resolution":{"observed_at":"2026-08-06T19:53:06.334933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2507.07969","last_updated":"2026-05-11T17:12:21Z","snapshot_observed_at":"2026-07-06T21:55:17.277337Z","submitted_at":"2025-07-10T17:48:03Z","title":"Reinforcement Learning with Action Chunking","version":4},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-19T05:18:20.960945Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2507.07969"},"observation_digest":"sha256:66c9328801ad352aea63233e2543e9eceacb1dc1c385a40cbf8e8a20918f501d","observation_id":"010eb31b-5ee2-44fc-adbd-f9db4dea1fe8","resolution":{"observed_at":"2026-05-19T05:22:06.470744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-08-04T13:00:10.173421Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:10.173421Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:ab2daee4720a65dc4d944f533d47aa4689e28ca8dbfe84453e5d4dde2f109776","observation_id":"960fc39a-6c78-45a9-8cd2-88d8b797036e","resolution":{"observed_at":"2026-08-04T13:00:10.173421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-08-04T11:01:35.297180Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07650","last_updated":"2026-05-30T05:26:12Z","snapshot_observed_at":"2026-08-04T11:01:21.243413Z","submitted_at":"2025-10-09T00:57:40Z","title":"Value Flows","version":4},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-04T11:01:35.297180Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2510.07650"},"observation_digest":"sha256:02e86164c6e78b35538ece9b41ee6eacd76e2ba0ed1487bdf71fc0c5009a99ed","observation_id":"38c6f8fb-2a80-4507-9e75-29f66546dac2","resolution":{"observed_at":"2026-08-04T11:01:35.297180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-08-04T07:06:51.446369Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.27048","last_updated":"2026-07-10T16:45:48Z","snapshot_observed_at":"2026-08-04T07:06:47.791270Z","submitted_at":"2025-10-30T23:33:07Z","title":"SpikeATac: A Multimodal Tactile Finger with Taxelized Dynamic Sensing for Dexterous Manipulation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T07:06:51.446369Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2510.27048"},"observation_digest":"sha256:8e04543f099fe841823dd7e6635c8c98fb287064c4fa4e8e573262dd293e7a1b","observation_id":"9e952ef1-391a-48c6-972b-c985f4848809","resolution":{"observed_at":"2026-08-04T07:06:51.446369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2603.12243","last_updated":"2026-05-15T22:34:49Z","snapshot_observed_at":"2026-07-06T22:48:53.198077Z","submitted_at":"2026-03-12T17:56:29Z","title":"HandelBot: Real-World Piano Playing via Fast Adaptation of Dexterous Robot Policies","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-15T11:48:13.368844Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2603.12243"},"observation_digest":"sha256:db99c650a2b8cba6c3588b470ebe28291c83f7646828a6821911cbec54ecb459","observation_id":"80f8f9bf-10fd-4a81-ba9f-f5588dec47e3","resolution":{"observed_at":"2026-05-15T11:49:58.825253Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2603.12243","last_updated":"2026-05-15T22:34:49Z","snapshot_observed_at":"2026-07-06T22:48:53.198077Z","submitted_at":"2026-03-12T17:56:29Z","title":"HandelBot: Real-World Piano Playing via Fast Adaptation of Dexterous Robot Policies","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-21T11:54:57.866685Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2603.12243"},"observation_digest":"sha256:8f4e71ad86475e4913bb6a08917d779c119011c43fe5e498666c1aac48efcf3b","observation_id":"3f1340c9-6380-40cb-8b8e-a34b9a9ae262","resolution":{"observed_at":"2026-05-21T11:55:04.124155Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2603.15759","last_updated":"2026-05-12T15:04:33Z","snapshot_observed_at":"2026-07-06T22:49:19.323519Z","submitted_at":"2026-03-16T18:00:23Z","title":"Simulation Distillation: Pretraining World Models in Simulation for Rapid Real-World Adaptation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-15T09:49:03.333757Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2603.15759"},"observation_digest":"sha256:72d95b54d8b2ca155657d0d23f962a98c9a5009b67c78cc1c87d7e38df1d5ab3","observation_id":"9903d06e-5fa8-4ab2-8ab6-764ca48aae88","resolution":{"observed_at":"2026-05-15T09:49:54.444164Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2603.15956","last_updated":"2026-04-20T19:05:45Z","snapshot_observed_at":"2026-07-06T22:49:19.323519Z","submitted_at":"2026-03-16T22:12:48Z","title":"ExpertGen: Scalable Sim-to-Real Expert Policy Learning from Imperfect Behavior Priors","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T09:37:02.168898Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2603.15956"},"observation_digest":"sha256:a7b32609914888be4faa50e2d46b2a469284add73b760a092df0a1c43f19c096","observation_id":"f3a14684-4401-4cdf-a74f-3785b27866ff","resolution":{"observed_at":"2026-05-15T09:39:55.143469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2604.08958","last_updated":"2026-06-11T05:02:53Z","snapshot_observed_at":"2026-08-01T22:02:36.657096Z","submitted_at":"2026-04-10T04:57:54Z","title":"WOMBET: World Model-Based Experience Transfer for Robust and Sample-efficient Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T18:18:05.636131Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2604.08958"},"observation_digest":"sha256:fc2cd0ee1de43c244600e3ebf63bc1b7087579bf3f84ed668c52dfe0c0f2b159","observation_id":"b39afcf6-a0d7-482b-9729-1e050cb9cd33","resolution":{"observed_at":"2026-05-11T05:10:54.325903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2604.13966","last_updated":"2026-04-15T15:17:40Z","snapshot_observed_at":"2026-08-02T20:54:14.171526Z","submitted_at":"2026-04-15T15:17:40Z","title":"Provably Efficient Offline-to-Online Value Adaptation with General Function Approximation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T12:55:12.531822Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2604.13966"},"observation_digest":"sha256:204c8f96ee11f2cce9ffb52f86fff82c846d012842ca93beb533c50668ec387b","observation_id":"2b6c922f-9247-4bcc-8025-1453d1d53ec8","resolution":{"observed_at":"2026-05-10T12:55:24.122109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":1},"reference_index":191,"source":"arxiv_source","source_observed_at":"2026-05-08T18:48:56.075160Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:8362fb8cf5d24c00345575b2bcfe60a54d846232d793480874b870abe3dd4ab1","observation_id":"3e7e6bcc-1572-4028-95e5-a15a9bf995d8","resolution":{"observed_at":"2026-05-09T06:10:42.426634Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:8a1e51e9f16d7a37367959b16d81101c6deb5601bcd1003f7c24de0a0e37b3b6","observation_id":"5b4de9fb-0cae-4a8d-a72f-9485efdf5270","resolution":{"observed_at":"2026-07-01T00:05:09.633737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2605.14779","last_updated":"2026-05-14T12:48:44Z","snapshot_observed_at":"2026-07-06T23:26:09.066863Z","submitted_at":"2026-05-14T12:48:44Z","title":"Peng's Q($\\lambda$) for Conservative Value Estimation in Offline Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T21:45:43.298829Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2605.14779"},"observation_digest":"sha256:3981ab00142999e814c691ac6ff9f7f8a324bd3aa09efe8ceaf91c62afde2f36","observation_id":"fdd7bff5-439e-4469-9192-caf94b27fbe2","resolution":{"observed_at":"2026-07-01T14:25:45.827910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2605.18675","last_updated":"2026-05-18T17:15:27Z","snapshot_observed_at":"2026-07-06T23:29:29.105126Z","submitted_at":"2026-05-18T17:15:27Z","title":"COOPO: Cyclic Offline-Online Policy Optimization Algorithm","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T13:11:16.568415Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2605.18675"},"observation_digest":"sha256:218d37555a331895d2c0a7b9e987ff65f023697424d7228bc1caf7a42a3a3505","observation_id":"9c94a5ab-9180-4f85-b548-bbb8d6e8912d","resolution":{"observed_at":"2026-05-20T13:13:18.054667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-12T00:23:04.763773Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03723","last_updated":"2026-07-04T06:11:03Z","snapshot_observed_at":"2026-08-01T06:38:23.685403Z","submitted_at":"2026-07-04T06:11:03Z","title":"OmniTacTune: Policy-Agnostic Real-World RL for Tactile Residual Adaptation of Visual Policies","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T00:23:04.763773Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2607.03723"},"observation_digest":"sha256:7e3577e59b076ed50b51442ff740ee1fb67a12075af28ec78658a983bee51996","observation_id":"cf6d3ac2-d0b0-43a4-b0d5-d4ae7b410429","resolution":{"observed_at":"2026-07-12T00:23:04.763773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-30T11:06:24.369491Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-07T13:25:03.713164Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-30T11:06:24.369491Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:a068aee2d0b8b1ccde2b48fa10c0d51f2db3bbb765890efefa9984687b8cbae0","observation_id":"ebdd9374-8d1a-4aef-bda1-94e5980ee6db","resolution":{"observed_at":"2026-07-30T11:06:24.369491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-08-05T04:27:43.958427Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-07T13:25:03.713164Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.958427Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:25d31aa93855bd9ad62804f3bd5d20d984b019abd9ac3a64faaa62fc8122866a","observation_id":"dce039d1-cbdd-4a12-8533-f5f4580e6e34","resolution":{"observed_at":"2026-08-05T04:27:43.958427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.07762/citation-record","integrity":"/paper/2412.07762/integrity","json":"/paper/2412.07762/citation-record.json","paper":"/paper/2412.07762"},"outbound":[],"paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:2412.07762."}