{"as_of":"2026-08-07T04:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:76ab2f396709444e8ded85535dec450260944af507770f8f13a1c0267da5fe63","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T13:00:10.690877Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-25T21:15:07.735336Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:30:07.874682Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2510.01460","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.01460","snapshot_observed_at":"2026-07-07T03:17:12.544546Z","title":"The three regimes of offline-to-online re- inforcement learning.arXiv preprint arXiv:2510.01460","venue":null,"work_id":"e5a3d775-01c8-4f84-a26c-173e1f11d942","year":2025},"citing_paper":{"arxiv_id":"2605.14497","last_updated":"2026-05-14T07:35:58Z","snapshot_observed_at":"2026-08-01T11:14:55.109730Z","submitted_at":"2026-05-14T07:35:58Z","title":"ROAD: Adaptive Data Mixing for Offline-to-Online Reinforcement Learning via Bi-Level Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T01:32:42.972836Z"},"links":{"cited_paper":"/paper/2510.01460","citing_paper":"/paper/2605.14497"},"observation_digest":"sha256:fb5c518cbc1131bc03bc2ce68164a2c748b6916a37be544173e2bd9278456298","observation_id":"afa959f4-104c-47cf-becb-304ceca00e76","resolution":{"observed_at":"2026-07-07T03:17:12.544546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2510.01460","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.01460","snapshot_observed_at":"2026-07-07T03:17:12.544546Z","title":"The three regimes of offline-to-online re- inforcement learning.arXiv preprint arXiv:2510.01460","venue":null,"work_id":"e5a3d775-01c8-4f84-a26c-173e1f11d942","year":2025},"citing_paper":{"arxiv_id":"2606.25527","last_updated":"2026-06-24T08:05:28Z","snapshot_observed_at":"2026-07-06T23:59:57.346004Z","submitted_at":"2026-06-24T08:05:28Z","title":"Beyond One-Size-Fits-All: Diagnosis-Driven Online Reinforcement Learning with Offline Priors","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-25T21:15:07.735336Z"},"links":{"cited_paper":"/paper/2510.01460","citing_paper":"/paper/2606.25527"},"observation_digest":"sha256:a92897aa4bd1432328e24f7d9642896bb695c8b559aff05d4b58751f898ab2a9","observation_id":"c25873e5-3c82-4fe2-b2c1-a573384893d3","resolution":{"observed_at":"2026-07-07T03:17:12.544546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.01460/citation-record","integrity":"/paper/2510.01460/integrity","json":"/paper/2510.01460/citation-record.json","paper":"/paper/2510.01460"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:06.167977Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:06.167977Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:50288fda67bd81f5f5654619f54fc8ae87a43ebaf83375db3a6efd186301676f","observation_id":"8ca2e4c2-6779-4f38-9a1b-28e2cd11ad15","resolution":{"observed_at":"2026-08-04T13:00:06.167977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:06.268858Z","title":"Efficient online reinforcement learning with offline data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:06.268858Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:4183d35bf6c1d22f5575dbb659517d91582b0c8409481aba5f32e594025a5de5","observation_id":"b4474f99-99c2-45de-a42b-e308f36073c0","resolution":{"observed_at":"2026-08-04T13:00:06.268858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:06.357293Z","title":"Data quality in imitation learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:06.357293Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:44dc3dbaabe48f97e8169fa6cdbe8bb22444810a07eb65785be4ca7f8343e8ff","observation_id":"8a974afb-4e9d-4839-b5a1-c3835a82ee5a","resolution":{"observed_at":"2026-08-04T13:00:06.357293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:06.472452Z","title":"Magnetic control of tokamak plasmas through deep reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:06.472452Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:b86de5e96abfdc72915c7c82e89a11f2890de8ef200cfa49ff2459be4435cf5a","observation_id":"64f74df9-265f-46b9-b974-f7982ede9b8b","resolution":{"observed_at":"2026-08-04T13:00:06.472452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:06.588457Z","title":"Loss of plasticity in deep continual learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:06.588457Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:eb4d0f77e2be8ee0c81b3bda8dbe1c914ca1024d9097b5aa7bd863738d3baded","observation_id":"88633603-02c1-4fb2-8bf1-05516eefb654","resolution":{"observed_at":"2026-08-04T13:00:06.588457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-04T13:00:06.749438Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:06.749438Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:7fe39625bdc288eeb70aa39784a8b670798c467993440f33be0f0245c703393b","observation_id":"5456f005-3387-4bba-9222-69cef5bd08d8","resolution":{"observed_at":"2026-08-04T13:00:06.749438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:06.916842Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:06.916842Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:d2efb2bee114a7ef0f817455ba4e91b25ea8ec6f2fe37443ce20fa3bd6f01e91","observation_id":"44f3e1ee-45b7-44d9-bb9a-83644819cb5a","resolution":{"observed_at":"2026-08-04T13:00:06.916842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:07.065925Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:07.065925Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:5bcfd6ebccedd2c572ccbbe4d1fe910080cfe2a2276741397bdb1bb0d275c46b","observation_id":"7d6f22f0-1bc3-4bda-8214-587658d9c3cc","resolution":{"observed_at":"2026-08-04T13:00:07.065925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:07.185001Z","title":"Bayesian design principles for offline-to-online reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:07.185001Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:2bdd751153c6723369ac59a2e84c169245dd89e74ff63630fac4b86815bf21f4","observation_id":"daeae038-94a1-45bd-99c4-7e163bc04997","resolution":{"observed_at":"2026-08-04T13:00:07.185001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:07.306912Z","title":"Overcoming catastrophic forgetting in neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:07.306912Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:cb78ee76016f428ed55d976514b183d4b7bcf658a5138cd7610c7f23533c1a00","observation_id":"c19f7a39-8f59-442e-b3e0-843f87283869","resolution":{"observed_at":"2026-08-04T13:00:07.306912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-04T13:00:07.388006Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:07.388006Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:b510276742790ac3a61c79e91ba72aeab8e8ea066d97ccf54647a9a75fe0331d","observation_id":"79bd1747-8320-4789-9715-1e406d61c846","resolution":{"observed_at":"2026-08-04T13:00:07.388006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:07.456957Z","title":"Offline-to-online reinforcement learning via balanced replay and pessimistic q-ensemble","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:07.456957Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:a8bef8417921cbed090a265318fc20a4c1dcca6a2be2efd44ff4a3b54550cdf3","observation_id":"fcbcfc6b-5b27-45be-8956-82845384997d","resolution":{"observed_at":"2026-08-04T13:00:07.456957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-04T13:00:07.505888Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:07.505888Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:2d8d72d707f2d75040f26e72ef67b91deba1707fb9053647212c24e61741b02a","observation_id":"5fa3a69c-1c3a-49d6-abe8-1b2a4bd32e81","resolution":{"observed_at":"2026-08-04T13:00:07.505888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15669","last_updated":"2023-05-25T02:40:32Z","snapshot_observed_at":"2026-08-06T02:09:22.567502Z","submitted_at":"2023-05-25T02:40:32Z","title":"PROTO: Iterative Policy Regularized Offline-to-Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15669","snapshot_observed_at":"2026-08-04T13:00:07.558566Z","title":"Proto: Iterative policy regularized offline-to-online reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:07.558566Z"},"links":{"cited_paper":"/paper/2305.15669","citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:ff4af210c67152a6c35671898fa77025104daaf43472fa889d47efdc03f63cab","observation_id":"227a11f2-c231-4570-be1f-2d4df3c6b0d4","resolution":{"observed_at":"2026-08-04T13:00:07.558566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:07.628640Z","title":"Energy-guided diffusion sampling for offline-to-online reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:07.628640Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:06462036d5dccfd4d4275c7438afd0c6b91511cae099f4b1f5679c39ae696b50","observation_id":"313ddf1d-bd00-4731-b934-2c4038123e26","resolution":{"observed_at":"2026-08-04T13:00:07.628640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:07.642547Z","title":"Why there are complementary learning systems in the hippocampus and neocortex: insights from the successes and failures of connectionist models of learning and memory","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:07.642547Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:3b1cc83bfa8aad30b6f7317eb2a12b0f992ca47657aae31a1b0c20eb2009f0bf","observation_id":"f94a57a2-8bdb-42a5-9f85-44c5b4c064e3","resolution":{"observed_at":"2026-08-04T13:00:07.642547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:07.715050Z","title":"The stability-plasticity dilemma: Investigating the continuum from catastrophic forgetting to age-limited learning effects","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:07.715050Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:b199d2eb6f1c13f87b1df785189b1dc60bb6d83ea7149735f97eab2940b9e6cc","observation_id":"be610524-8dd9-4aac-8c6c-12f6ca48f3e0","resolution":{"observed_at":"2026-08-04T13:00:07.715050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:07.787156Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:07.787156Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:1f4c4af749041ba1ef45c14ed18b4c8cc1d8bf13408351def2ca894a9156ccf6","observation_id":"39ffdfd2-a87e-4575-be96-2b4cc70eb862","resolution":{"observed_at":"2026-08-04T13:00:07.787156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-04T13:00:07.865376Z","title":"Awac: Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:07.865376Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:768fa1d9dbf35223d6df9ef5beb5bb7657f9d3c33b8aae56a2ae8bc39d38be1e","observation_id":"4e7b98e4-c3d8-4ef8-ae37-279828667c32","resolution":{"observed_at":"2026-08-04T13:00:07.865376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:07.960413Z","title":"Cal-ql: Calibrated offline rl pre-training for efficient online fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:07.960413Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:08c65993265546bdeb88d7b3c8a4f6f4be6f2df439590c52bd5cd304003cdaaa","observation_id":"31d5fcf0-dece-4f4c-a9e9-734ecd514799","resolution":{"observed_at":"2026-08-04T13:00:07.960413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:08.044669Z","title":"The primacy bias in deep reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:08.044669Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:a6daa27ab72730d4b576559565b5c57ccaf9765b77645313458513fcf715ce47","observation_id":"3a7bae6b-e680-4c8d-833e-94670839269d","resolution":{"observed_at":"2026-08-04T13:00:08.044669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:08.086108Z","title":"An algorithmic perspective on imitation learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:08.086108Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:f18c2f7b5570f8fcb717ef679878cde88bf682faca1db6b3d4676e2dbcc8d4b1","observation_id":"400e34b3-4842-4edf-9fd4-020fae7fdf4c","resolution":{"observed_at":"2026-08-04T13:00:08.086108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:08.092327Z","title":"Experience replay for continual learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:08.092327Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:4511bbf77b87d0dcfdae8a77c35678a6b8682da736686670e13632508744447e","observation_id":"77b01d49-ec9d-4562-8b06-0dd9590a8577","resolution":{"observed_at":"2026-08-04T13:00:08.092327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.04671","last_updated":"2022-10-22T14:34:44Z","snapshot_observed_at":"2026-08-05T07:46:46.355580Z","submitted_at":"2016-06-15T08:20:51Z","title":"Progressive Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.04671","snapshot_observed_at":"2026-08-04T13:00:08.162543Z","title":"Progressive neural networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:08.162543Z"},"links":{"cited_paper":"/paper/1606.04671","citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:e064d650a268474443dc0cb2778a313492438edd4bac2b3cf33d81ea22508160","observation_id":"6d49d5e7-b6d6-4fac-a37b-93a914780dae","resolution":{"observed_at":"2026-08-04T13:00:08.162543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:08.257104Z","title":"Learning from demonstration","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:08.257104Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:0008ba817a8fb1f828a7efb6ea89c7ff50605479cbe81dafd301f56c980ef110","observation_id":"f49e066d-df2a-47e3-8eaa-e10d4939dc0c","resolution":{"observed_at":"2026-08-04T13:00:08.257104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:08.382285Z","title":"Mastering the game of go without human knowledge","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:08.382285Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:64774c9cded3bee8cf4d020cf703fee87ec9e35f3b27387e5ded58cbf4664a80","observation_id":"8baebfc2-c194-436e-b632-c7aab6fa00e4","resolution":{"observed_at":"2026-08-04T13:00:08.382285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:08.538793Z","title":"The dormant neuron phenomenon in deep reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:08.538793Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:d0ffcfc58ac18c50b353d644f4898d57e5c509689c942e4a62f454a126f4fabc","observation_id":"746071d9-dffe-433a-9a4e-3d668e546014","resolution":{"observed_at":"2026-08-04T13:00:08.538793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-04T13:00:08.709075Z","title":"Hybrid rl: Using both offline and online data can make rl efficient","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:08.709075Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:6bee81a5ed59c5335f49fdd644e1c795d12d3227ed7640dfb3890222f4695216","observation_id":"61191bb3-ed59-4c20-bad3-3192f7dd2288","resolution":{"observed_at":"2026-08-04T13:00:08.709075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.02872","last_updated":"2021-02-11T14:55:12Z","snapshot_observed_at":"2026-07-06T10:38:35.211339Z","submitted_at":"2021-02-04T20:18:56Z","title":"Feedback in Imitation Learning: The Three Regimes of Covariate Shift","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.02872","snapshot_observed_at":"2026-08-04T13:00:08.940601Z","title":"Feedback in imitation learning: The three regimes of covariate shift","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:08.940601Z"},"links":{"cited_paper":"/paper/2102.02872","citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:2c090e3297eb3a9696ac2497d726762e6ccd4d09040f6fcf4464c8d2756e5211","observation_id":"fce4ee65-e198-4c01-94b6-eaafdcf147e3","resolution":{"observed_at":"2026-08-04T13:00:08.940601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:09.188443Z","title":"Revisiting the minimalist approach to offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:09.188443Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:1bbe4065436fd0d1ec4db4e4cd052de41bf4f6abcc953a351cccccf02ad38c52","observation_id":"506f1782-cc61-4490-ae3c-baa7ff54259b","resolution":{"observed_at":"2026-08-04T13:00:09.188443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:09.366372Z","title":"Jump-start reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:09.366372Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:2b5f629af2b3f4d228afc2991b9fd1ce465b39f01f6aac99005cb78ab1acbb18","observation_id":"78036c47-8bf7-4ad0-9557-ded2448a01dc","resolution":{"observed_at":"2026-08-04T13:00:09.366372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.06854","last_updated":"2021-11-27T23:54:27Z","snapshot_observed_at":"2026-08-04T05:39:19.331954Z","submitted_at":"2019-11-15T19:58:42Z","title":"Empirical Study of Off-Policy Policy Evaluation for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.06854","snapshot_observed_at":"2026-08-04T13:00:09.551445Z","title":"Empirical study of off-policy policy evaluation for reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:09.551445Z"},"links":{"cited_paper":"/paper/1911.06854","citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:b19443b6dce6c213331ebf0301f171d7486b0810e16b429a62bc9d81f0b2306d","observation_id":"5f03b118-fe6d-4584-bc95-413a32e2d38a","resolution":{"observed_at":"2026-08-04T13:00:09.551445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:09.798532Z","title":"Fine-tuning reinforcement learning models is secretly a forgetting mitigation problem","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:09.798532Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:8f07605d2d1cb9b6e077d0d0ddf7c80b69414ff5c36c02720d11cb0391f18664","observation_id":"dcb8cee3-b4ea-4d9f-a664-898332447b5b","resolution":{"observed_at":"2026-08-04T13:00:09.798532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:09.968342Z","title":"Policy expansion for bridging offline-to-online reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:09.968342Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:e77aed7eb75a996125686b4b0f9ec3f5fd48a72f733fe10eefda30f8d5cc477b","observation_id":"f83bd745-f59f-48bc-8cb9-c5b98b025e48","resolution":{"observed_at":"2026-08-04T13:00:09.968342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-08-04T13:00:10.173421Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:10.173421Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:ab2daee4720a65dc4d944f533d47aa4689e28ca8dbfe84453e5d4dde2f109776","observation_id":"960fc39a-6c78-45a9-8cd2-88d8b797036e","resolution":{"observed_at":"2026-08-04T13:00:10.173421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:10.349681Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:10.349681Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:5e162205e7ad732eed5e7527420453b9743bdd8e1a4a131a6e28d45428656ae6","observation_id":"bc4c0827-f1c4-4e30-ab56-44fee2f15ec0","resolution":{"observed_at":"2026-08-04T13:00:10.349681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:10.517374Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:10.517374Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:267bd6dfd217246d1e1b514599cf6f87deefadc2ae835201280edcfdb58378f0","observation_id":"e0c5250f-5091-4b8a-8cb0-da5f49b64545","resolution":{"observed_at":"2026-08-04T13:00:10.517374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:00:10.690877Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:10.690877Z"},"links":{"citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:977d4822d91effeb0ce6c2150b04429280013073f82589fbcf3bcc40ef4f2967","observation_id":"d42a8413-8f1b-4bd8-b03b-71a19c49ac2d","resolution":{"observed_at":"2026-08-04T13:00:10.690877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 2 inbound Pith citation observations for arXiv:2510.01460."}