{"as_of":"2026-08-13T04:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:026bcf5d8f67c441b8e1a7c84fda31cb66a5b70a68b173b0e9f8db870713d4bc","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:30:49.187659Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.18855/citation-record","integrity":"/paper/2412.18855/integrity","json":"/paper/2412.18855/citation-record.json","paper":"/paper/2412.18855"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:48.935676Z","title":"Constrained policy optimization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.935676Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:9a16b979fe6c5204987d1c4ab68d932d064ad2739f0f5fa9b62c6afddb7bfde7","observation_id":"3be00b87-80c9-4e0d-83fb-77693bf1b357","resolution":{"observed_at":"2026-08-11T04:30:48.935676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:50.082287Z","title":"Reinforcement learning: Theory and algorithms","venue":null,"work_id":"a83d4d56-1b10-4ca8-8301-60aab3b0f8cb","year":2019},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.941106Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:a43965c54692b8b83236c7f53b1bc4ac435b2b7e96ac472670771704cf30f58d","observation_id":"b8e8779d-b6d3-40c8-8977-23a777fb2748","resolution":{"observed_at":"2026-08-11T04:30:50.087909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:50.066830Z","title":"Reincarnating reinforcement learning: Reusing prior computation to accelerate progress","venue":null,"work_id":"9409c118-6a69-4d9a-ba84-d7090f1850eb","year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.946054Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:f37d44dfdada82426ec6c95010f06d7dbf392ec71c19070ea71702657e24f90b","observation_id":"c1eb6107-27ea-47da-b206-13c9cf8efe86","resolution":{"observed_at":"2026-08-11T04:30:50.071758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.02948","last_updated":"2023-05-31T10:52:56Z","snapshot_observed_at":"2026-08-09T00:12:49.246866Z","submitted_at":"2023-02-06T17:30:22Z","title":"Efficient Online Reinforcement Learning with Offline Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.02948","snapshot_observed_at":"2026-08-11T04:30:48.950682Z","title":"Efficient online reinforcement learning with offline data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.950682Z"},"links":{"cited_paper":"/paper/2302.02948","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:b4c89599ac55d01d42e512b6cf598d149b1709d723a5880256a15bcee7592341","observation_id":"aeba181c-5585-4ce2-88a1-953ce5a8e638","resolution":{"observed_at":"2026-08-11T04:30:48.950682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11802","last_updated":"2022-11-21T19:10:27Z","snapshot_observed_at":"2026-08-10T23:22:20.830362Z","submitted_at":"2022-11-21T19:10:27Z","title":"Improving TD3-BC: Relaxed Policy Constraint for Offline Learning and Stable Online Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11802","snapshot_observed_at":"2026-08-11T04:30:48.955499Z","title":"Improving td3-bc: Relaxed policy constraint for offline learning and stable online fine-tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.955499Z"},"links":{"cited_paper":"/paper/2211.11802","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:265a6742dc917bab2d4cb6e9d63c458436ff98ccc6050a7a5f4263ec377a228a","observation_id":"f57d225d-8fdb-48d5-9a7b-b1e140eff677","resolution":{"observed_at":"2026-08-11T04:30:48.955499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:48.960378Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.960378Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:6283a7d6ead359e9ef8fa46202eecb48398d5d8967226ab97d59499c8d1cb55c","observation_id":"931c0e32-c4c3-48b9-a8da-f1bc7699846c","resolution":{"observed_at":"2026-08-11T04:30:48.960378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.08757","last_updated":"2018-01-26T11:11:18Z","snapshot_observed_at":"2026-08-09T14:33:35.632300Z","submitted_at":"2018-01-26T11:11:18Z","title":"Safe Exploration in Continuous Action Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.08757","snapshot_observed_at":"2026-08-11T04:30:48.965286Z","title":"Safe exploration in continuous action spaces","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.965286Z"},"links":{"cited_paper":"/paper/1801.08757","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:038961e291f1b9d4e987448022ca287c841ec552a5acb831234aae46742f58a0","observation_id":"8d97be98-45b7-48a3-8e26-6d41cd6f76c7","resolution":{"observed_at":"2026-08-11T04:30:48.965286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:50.042176Z","title":"Uncertainty-aware model-based offline reinforcement learning for automated driving","venue":null,"work_id":"7833446f-4f4e-4cab-81cf-63aee31d5164","year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.969948Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:c794b06e1ca1f278f8f34f0932b340849d70019cdd98792a7403da7efb87364f","observation_id":"16a0bb77-79d9-41f5-bf6e-e2a850b4f462","resolution":{"observed_at":"2026-08-11T04:30:50.047352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-11T04:30:48.974180Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.974180Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:cbf3475dc072688ed7107ec3547d9994fe88bc4bc7d77e5702556835cb47a193","observation_id":"1be9be94-cf64-49a2-a916-7783e452b959","resolution":{"observed_at":"2026-08-11T04:30:48.974180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:48.978973Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.978973Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:df8989336a13f3a6ff9815e07b12f6993d40426c07bcfc9ee41c621afa4f6e80","observation_id":"3b822ef4-6f86-4a48-95c5-9a5f7ddfd70f","resolution":{"observed_at":"2026-08-11T04:30:48.978973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:48.983533Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.983533Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:3c8fcdcd64bb35041f71131eada082466117449ede5267202c57239b011ed982","observation_id":"26167c32-88bf-4702-b62e-2c88e1012874","resolution":{"observed_at":"2026-08-11T04:30:48.983533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:48.987827Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.987827Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:b43002d58c518fa207f040ae42e47913c3dcde94e268c8720bbd730fa436ca36","observation_id":"3e884ace-2ae7-4635-b915-da21ba897fbc","resolution":{"observed_at":"2026-08-11T04:30:48.987827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-10T11:32:16.648791Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-08-11T04:30:48.991946Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.991946Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:f8d83e753d85971cdac6d9ee4e79e34cb864f72b342d947a9d6a19c24cb8b956","observation_id":"94ccdcad-0bf9-47a6-ab8c-1e72494dfeba","resolution":{"observed_at":"2026-08-11T04:30:48.991946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.996335Z","title":"Open and real-world human-ai coordination by heterogeneous training with communication","venue":null,"work_id":"4df46a7e-f940-4fa0-8f7f-33564d5d1637","year":2025},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.997192Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:4af06eff036f69a1263010908e65ed5ace9f65390db070e576a7eb382282d7a1","observation_id":"1078a651-dda5-442a-99a1-292e83de04f2","resolution":{"observed_at":"2026-08-11T04:30:50.001318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.001554Z","title":"A simple unified uncertainty-guided framework for offline-to-online reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.001554Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:d20c255a0de7e654aa2a89813492f4ecdcedc3fb916c11bf845c095edf638bcc","observation_id":"791cd18e-9715-4197-8547-41090e436c30","resolution":{"observed_at":"2026-08-11T04:30:49.001554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.005983Z","title":"Reinforcement learning with deep energy-based policies","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.005983Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:50ad45d0f50f5c9649394b08348bf77bca136e2133c43c236c10fac83a0b4f4b","observation_id":"a2a59874-9d4a-42a2-8e17-a87128268627","resolution":{"observed_at":"2026-08-11T04:30:49.005983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.010070Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.010070Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:9c5fc83c90340b6bbf2d5d8b9d34739e0288c8918840b38ac177f42696e6757d","observation_id":"680d33f4-22a6-4f31-8ff5-940f5489d238","resolution":{"observed_at":"2026-08-11T04:30:49.010070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-11T04:30:49.014463Z","title":"Idql: Implicit q-learning as an actor-critic method with diffusion policies.arXiv preprint arXiv:2304.10573, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.014463Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:f71b7553ff7356ec750844a6e47e83fb9a931536d8c64144231c69677678e634","observation_id":"f919f741-e582-43b1-9b2d-b1242342896c","resolution":{"observed_at":"2026-08-11T04:30:49.014463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.964550Z","title":"Uncertainty-driven pessimistic q-ensemble for offline-to- online reinforcement learning","venue":null,"work_id":"a5ff878e-9fdf-43c6-aaac-4c7006536eb1","year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.019462Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:9e114c3c1d3a90346b68e8ede2a0f51bc52228f42b1ad698a2ed34d953bd8ef1","observation_id":"516b2635-e169-418f-987d-e79741e2376e","resolution":{"observed_at":"2026-08-11T04:30:49.969216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.023652Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.023652Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:95b60d185a52cf10261b4e1728b35cb532160416a6cb2dbf0649a786b0a6d9b0","observation_id":"64af4ca2-64c0-40f6-9c16-df69ed7322cc","resolution":{"observed_at":"2026-08-11T04:30:49.023652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.027727Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.027727Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:33f5f58ca440c56fcb6e6273fa373310f2ff48b51369b2eb176caa89ac47f3ae","observation_id":"6746a8bb-fd32-4958-a3e1-2deb673aa3ab","resolution":{"observed_at":"2026-08-11T04:30:49.027727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.930322Z","title":"Batch policy learning under constraints","venue":null,"work_id":"a615919a-8ae7-44a9-bf4e-07f0e9b5e9ef","year":2019},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.031806Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:8352194018b4bff8acd17cde4799c8e4cc7a987e2038b411621f21cd0f507863","observation_id":"17fb3d7f-9744-436b-8fe3-685d92aaf3ba","resolution":{"observed_at":"2026-08-11T04:30:49.935505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.914178Z","title":"Offline-to-online reinforcement learning via balanced replay and pessimistic q-ensemble","venue":null,"work_id":"1b40cd2e-4300-4059-9415-c486dd0d51df","year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.035910Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:a74475a14c03a0cf2cfedf487ca5f6407f62b08779fbe6cb2e71a308cab9f18d","observation_id":"c00cb2d8-d4c6-46e5-b035-6c9dc9e02144","resolution":{"observed_at":"2026-08-11T04:30:49.919106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03351","last_updated":"2024-03-17T04:40:06Z","snapshot_observed_at":"2026-08-11T14:17:12.016727Z","submitted_at":"2023-11-06T18:58:59Z","title":"Uni-O4: Unifying Online and Offline Deep Reinforcement Learning with Multi-Step On-Policy Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03351","snapshot_observed_at":"2026-08-11T04:30:49.039985Z","title":"Uni-o4: Unifying online and offline deep reinforcement learning with multi-step on-policy optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.039985Z"},"links":{"cited_paper":"/paper/2311.03351","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:93fa317c49a133fcded63eb4b1a701f57ca05de4828c02da1bf50f1310f733b9","observation_id":"391ffc41-f4b9-468d-a5cc-564f956456eb","resolution":{"observed_at":"2026-08-11T04:30:49.039985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15669","last_updated":"2023-05-25T02:40:32Z","snapshot_observed_at":"2026-08-10T08:46:46.989104Z","submitted_at":"2023-05-25T02:40:32Z","title":"PROTO: Iterative Policy Regularized Offline-to-Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15669","snapshot_observed_at":"2026-08-11T04:30:49.044417Z","title":"Proto: Iterative policy regularized offline-to-online reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.044417Z"},"links":{"cited_paper":"/paper/2305.15669","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:a2204db25b12cf5e483f564ac5259b5b1013efdf76fdcd5cf18eeef122e6f345","observation_id":"7b857664-28ff-4841-a166-1eed0a315c88","resolution":{"observed_at":"2026-08-11T04:30:49.044417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17396","last_updated":"2023-03-30T14:08:31Z","snapshot_observed_at":"2026-08-10T21:25:14.230217Z","submitted_at":"2023-03-30T14:08:31Z","title":"Finetuning from Offline Reinforcement Learning: Challenges, Trade-offs and Practical Solutions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17396","snapshot_observed_at":"2026-08-11T04:30:49.048977Z","title":"Finetuning from offline reinforcement learning: Challenges, trade-offs and practical solutions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.048977Z"},"links":{"cited_paper":"/paper/2303.17396","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:a43aa55631c8ad9c0b5f426a475eb592c0e3477f9809efafd86052b8405617af","observation_id":"82fd9920-06d9-4eac-9227-6fc5976b813a","resolution":{"observed_at":"2026-08-11T04:30:49.048977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.898544Z","title":"Mildly conservative q-learning for offline reinforcement learning","venue":null,"work_id":"8e662387-bef3-4824-813f-52eb5c48d97e","year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.053729Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:b002b76bc34f4354a152d3fc02006d396fe1f3da95213ae273747d989ef86d26","observation_id":"53a18ba4-5f14-4d3c-8f35-9dd8a1d5391c","resolution":{"observed_at":"2026-08-11T04:30:49.903853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.10070","last_updated":"2022-01-25T03:14:57Z","snapshot_observed_at":"2026-08-04T01:22:29.843414Z","submitted_at":"2022-01-25T03:14:57Z","title":"MOORe: Model-based Offline-to-Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2201.10070","doi":null,"metadata_source":"pith","pith_arxiv_id":"2201.10070","snapshot_observed_at":"2026-08-11T04:30:49.406876Z","title":"MOORe: Model-based Offline-to-Online Reinforcement Learning","venue":"cs.LG","work_id":"49f7d3ac-f43d-4376-878e-8a6f608a3c45","year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.057905Z"},"links":{"cited_paper":"/paper/2201.10070","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:a4365ae876ad60c919fdff8cd119a32fba48c419b06a4e66284cb42142f69625","observation_id":"9dfaeb79-4d21-4164-9f6e-3c6368a1aa84","resolution":{"observed_at":"2026-08-11T04:30:49.411742Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.882601Z","title":"Supported trust region optimization for offline reinforcement learning","venue":null,"work_id":"3ba8f27e-ad50-40c4-a5d9-de904d01e6ed","year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.062641Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:6f60984a988a123376d5312122e7d67b7baa4622130bd033f889698147ff99da","observation_id":"fbd3e492-d978-437d-938e-9749de752dea","resolution":{"observed_at":"2026-08-11T04:30:49.887854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.868160Z","title":"Fine-tuning offline policies with optimistic action selection","venue":null,"work_id":"d8a3ed26-0418-4c0c-bfb2-b0979bb235db","year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.066875Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:db9b31ad558a5df676cf7b2f18256a2ba8539b408ee44f533b2d21f3bcfb16b7","observation_id":"1281f0c8-a005-4ff5-b632-a1173f4816a4","resolution":{"observed_at":"2026-08-11T04:30:49.872845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05723","last_updated":"2024-06-21T13:13:15Z","snapshot_observed_at":"2026-08-11T09:36:49.209529Z","submitted_at":"2023-10-09T13:47:05Z","title":"Planning to Go Out-of-Distribution in Offline-to-Online Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2310.05723","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.05723","snapshot_observed_at":"2026-08-11T04:30:49.385747Z","title":"Planning to Go Out-of-Distribution in Offline-to-Online Reinforcement Learning","venue":"cs.LG","work_id":"daa98473-1124-4e3f-bc53-39d8f560d131","year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.071160Z"},"links":{"cited_paper":"/paper/2310.05723","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:6fcebb1c1cd2944f36da8716d40b476c627aa03f2a7575e5913784e009804ee9","observation_id":"5d037d44-40f3-4ef0-96c3-9441caeb1c8b","resolution":{"observed_at":"2026-08-11T04:30:49.391005Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-11T04:30:49.075601Z","title":"Awac: Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.075601Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:366cd5dc5c7ba825d25787da88dfa3f28a91a31d284a608cc9cfaceba7523ee3","observation_id":"87cd898a-545a-4798-8d34-cfe6b3d63c7c","resolution":{"observed_at":"2026-08-11T04:30:49.075601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05479","last_updated":"2024-01-20T03:51:39Z","snapshot_observed_at":"2026-08-12T19:11:11.408159Z","submitted_at":"2023-03-09T18:31:13Z","title":"Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05479","snapshot_observed_at":"2026-08-11T04:30:49.080017Z","title":"Cal-ql: Calibrated offline rl pre-training for efficient online fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.080017Z"},"links":{"cited_paper":"/paper/2303.05479","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:607fb333138b8d8b52eca4d1cb54ce5fecf40b6a14b0085c251c2d3907b6da1e","observation_id":"2e2f4430-3cb6-4f79-ba2e-f0e4e1694785","resolution":{"observed_at":"2026-08-11T04:30:49.080017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.853656Z","title":"Bridging offline reinforcement learning and imitation learning: A tale of pessimism","venue":null,"work_id":"61527d34-d868-4f21-a41a-113fe1eee8ef","year":2021},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.084656Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:ca2f229240cbd3ef36024b2ddcb3b70e444decf310922de7bbdea9cea1392929","observation_id":"77df57cc-3353-487f-a5cf-429697734043","resolution":{"observed_at":"2026-08-11T04:30:49.858375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.089965Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.089965Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:49cb338ed977403564caa39672fe8aa1e63b78c791a171163cf49cbe2ebe91e0","observation_id":"16c7240c-2801-434c-9ca7-525d0eecf8fa","resolution":{"observed_at":"2026-08-11T04:30:49.089965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-12T21:29:36.308819Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-11T04:30:49.094279Z","title":"High- dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.094279Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:b9212267f23119f6dede4cf8321a70b0c69f7cf29be3dc3efbe48926e53433b3","observation_id":"3f1115b8-aee4-4409-a4d4-0693a3fdc85d","resolution":{"observed_at":"2026-08-11T04:30:49.094279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T04:30:49.098890Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.098890Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:898f396c66c1ba29310791fa25f16ad54402e8fe73fada41a91a6ace792246c6","observation_id":"3b2e1149-fdc4-4d38-8b3e-976e37b5566f","resolution":{"observed_at":"2026-08-11T04:30:49.098890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.826147Z","title":"Sutton and AndrewG","venue":null,"work_id":"62e0e3c0-24a0-470b-84bd-65d3c32ea869","year":2005},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.103172Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:d88223588e06b4f87237f08a2e7170e15102e66c54bd5942c93a91a7c08ba726","observation_id":"88530470-1a24-44bc-9604-bad92fa4e204","resolution":{"observed_at":"2026-08-11T04:30:49.831044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.810970Z","title":"Lever- aging factored action spaces for efficient offline reinforcement learning in healthcare","venue":null,"work_id":"b3d8c86e-3763-4520-8cea-ae0cd04a9b2b","year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.107419Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:823f6783a6882d57ccd36dd864fb883b482ce3510439b5571505600c23209878","observation_id":"601c7bc8-c6a0-41ef-9765-2c427eebd7dc","resolution":{"observed_at":"2026-08-11T04:30:49.815625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.796584Z","title":"CORL: Research-oriented deep offline reinforcement learning library","venue":null,"work_id":"3fdc0368-aa5e-4524-ab72-e4a32d131c99","year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.111884Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:81348a55c7fdbf6315d1e67dcfcf13bab739f3ef10cab1576df92a6a3a94e44c","observation_id":"a778597d-eb97-48f1-a963-2c861bc24650","resolution":{"observed_at":"2026-08-11T04:30:49.801226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.11074","last_updated":"2018-12-26T11:09:40Z","snapshot_observed_at":"2026-08-07T08:33:38.128537Z","submitted_at":"2018-05-28T17:31:11Z","title":"Reward Constrained Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.11074","snapshot_observed_at":"2026-08-11T04:30:49.116005Z","title":"Reward constrained policy optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.116005Z"},"links":{"cited_paper":"/paper/1805.11074","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:b27d1453c480231cb3d781dd4b4d6e9b5f2e277c7346be70f40df3469eb01922","observation_id":"01c0eaf4-3bea-4485-811b-50926caddbbc","resolution":{"observed_at":"2026-08-11T04:30:49.116005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.782177Z","title":"Jump-start reinforcement learning","venue":null,"work_id":"f746b4b3-668b-42f0-9647-c70065e7d34e","year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.120558Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:e033fa20ed7358ca4cfd400b230e24d40ce0321be912ac5f3fbb9b780a82647f","observation_id":"d2f83805-5139-4b0d-a893-8b0679a025e8","resolution":{"observed_at":"2026-08-11T04:30:49.786819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.768189Z","title":"Train once, get a family: State-adaptive balances for offline-to- online reinforcement learning","venue":null,"work_id":"77b0c1b1-0d52-42c7-87c4-246ea337c7d0","year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.125050Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:cd78f199f46cb8355c7a5ef51996bebf47aadba6028df7c3244d3c69a116e861","observation_id":"d77c9109-c886-4784-b58a-52e7e42c26cf","resolution":{"observed_at":"2026-08-11T04:30:49.772852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.753566Z","title":"Supported policy optimization for offline reinforcement learning","venue":null,"work_id":"294d56d3-e34b-4fc9-a90c-41efd9d70959","year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.129229Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:31eb68beadf96432d71e515acb4ade1c7e4ef965bdba95a801244708d76635fa","observation_id":"7cafb6e8-c05c-48d4-ba66-1963ea3253e7","resolution":{"observed_at":"2026-08-11T04:30:49.758387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.133453Z","title":"Policy finetuning: Bridging sample-efficient offline and online reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.133453Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:28e959e8df34c4c4b3c7fefb794edf34f13d2ba9090e97b62a41438841f31401","observation_id":"d7ec5233-1756-45db-b3f8-afee46f24507","resolution":{"observed_at":"2026-08-11T04:30:49.133453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.728444Z","title":"A policy-guided imitation approach for offline reinforcement learning","venue":null,"work_id":"10430595-c81d-4c70-b642-4e2b153836b8","year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.137747Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:88620ffe87d49be3c9eefb3483ceb72b2fbd1f03113eca2fa7257ae116d6d82e","observation_id":"7759f3da-00c4-4d39-b472-4b77da252b4d","resolution":{"observed_at":"2026-08-11T04:30:49.733631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-08-12T12:36:09.064642Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-08-11T04:30:49.142024Z","title":"Offline rl with no ood actions: In-sample learning via implicit value regularization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.142024Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:dea029edadaea6c3252d095c20de3f0acc44052c0d16ce4104310a19d494403c","observation_id":"20d6d736-a044-495b-8099-7d0881f00018","resolution":{"observed_at":"2026-08-11T04:30:49.142024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.713076Z","title":"Actor-critic alignment for offline-to-online reinforcement learning","venue":null,"work_id":"53bd5208-2454-484d-88b5-66fce93d55ae","year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.146683Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:5d73f2b0a274873c60d0e420e3a18c7f29bf8c711da7725ac2a0ecc80b719659","observation_id":"7bafb258-e4a9-481d-8b7f-b1ff5d9a276c","resolution":{"observed_at":"2026-08-11T04:30:49.717995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04411","last_updated":"2023-11-07T16:32:51Z","snapshot_observed_at":"2026-07-06T16:28:51.154391Z","submitted_at":"2023-10-06T17:57:44Z","title":"Understanding, Predicting and Better Resolving Q-Value Divergence in Offline-RL","version":2},"cited_work":{"arxiv_id":"2310.04411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.04411","snapshot_observed_at":"2026-08-11T04:30:49.273788Z","title":"Understanding, Predicting and Better Resolving Q-Value Divergence in Offline-RL","venue":"cs.LG","work_id":"8f885d7b-9cee-4b97-99ee-4ab666d61f2b","year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.151220Z"},"links":{"cited_paper":"/paper/2310.04411","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:17aea06237445cc695d32673ad9f8d6277206de9a26c7698a2e3fb857a382a65","observation_id":"4058ab69-5d44-424e-977b-1bd44d22b625","resolution":{"observed_at":"2026-08-11T04:30:49.280625Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00935","last_updated":"2025-08-28T20:06:01Z","snapshot_observed_at":"2026-08-09T22:12:29.385993Z","submitted_at":"2023-02-02T08:25:12Z","title":"Policy Expansion for Bridging Offline-to-Online Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00935","snapshot_observed_at":"2026-08-11T04:30:49.155903Z","title":"Policy expansion for bridging offline-to-online reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.155903Z"},"links":{"cited_paper":"/paper/2302.00935","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:5dd7781fbbfba7d69cce4751a31f0156db9265b4d54d086b4ced034fb23dd97b","observation_id":"f05126e9-b6dd-412d-9435-c2f8ec460bd6","resolution":{"observed_at":"2026-08-11T04:30:49.155903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06871","last_updated":"2024-07-21T14:49:35Z","snapshot_observed_at":"2026-07-06T15:41:24.976531Z","submitted_at":"2023-06-12T05:10:10Z","title":"ENOTO: Improving Offline-to-Online Reinforcement Learning with Q-Ensembles","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06871","snapshot_observed_at":"2026-08-11T04:30:49.160669Z","title":"Ensemble-based offline-to-online reinforcement learning: From pessimistic learning to optimistic exploration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.160669Z"},"links":{"cited_paper":"/paper/2306.06871","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:4b63cea41fd205b59701ace40e4cab97d57121f6c92c37be324d5421da211459","observation_id":"36075a83-cc30-4203-aa73-eade42be6aea","resolution":{"observed_at":"2026-08-11T04:30:49.160669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13846","last_updated":"2022-10-25T09:08:26Z","snapshot_observed_at":"2026-07-06T14:10:04.619778Z","submitted_at":"2022-10-25T09:08:26Z","title":"Adaptive Behavior Cloning Regularization for Stable Offline-to-Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13846","snapshot_observed_at":"2026-08-11T04:30:49.165225Z","title":"Adaptive behav- ior cloning regularization for stable offline-to-online reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.165225Z"},"links":{"cited_paper":"/paper/2210.13846","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:5c5d8cc55750bc06a9cac1f202c8e677f5a8e1bc0be3c0f2f0e4599c5cd2e38e","observation_id":"f1c5647e-6306-4562-ab2d-7b441ae543d8","resolution":{"observed_at":"2026-08-11T04:30:49.165225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.698154Z","title":"Online decision transformer","venue":null,"work_id":"0e50ac95-4bc4-4410-bba3-9b39e4a9114a","year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.170538Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:51e8c3359afcc880e05e71e573ddef8013dd005f1372ba5cce55912bdf633ed2","observation_id":"652d11f2-dc55-47c1-92c3-2f48f7e03ee6","resolution":{"observed_at":"2026-08-11T04:30:49.702843Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.683386Z","title":"However, our O2SAC still outperforms it with less computational cost during online fine-tuning and less requirements for offline policy","venue":null,"work_id":"7fa8e713-94e6-4fb1-ba30-6dad6c61adff","year":null},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.175429Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:71589a43f73c568cf2c1b1ba9cd491d1b5742e899e44190864e995cf05ed0f74","observation_id":"6a610778-6fdc-45ac-94b5-8d919abe8ac1","resolution":{"observed_at":"2026-08-11T04:30:49.688112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.668254Z","title":"For model-based O2O RL, [31] explores regions with high uncertainty and returns in learned model","venue":null,"work_id":"8b670b91-a898-4014-afe0-ab396ff52c11","year":null},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.182233Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:6dce6a77962a75b7dab622834b7a4c3a9ebcb92edf62f58922f52bba8424fffa","observation_id":"2de3f5ca-53a8-465d-90c2-41cd7ee63c22","resolution":{"observed_at":"2026-08-11T04:30:49.673069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.653162Z","title":"Moreover, [4] find that LayerNorm is favourable for efficient online RL with offline data","venue":null,"work_id":"d57bcd6c-ff3b-4ef6-8adc-61895e11d569","year":null},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.187659Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:d701b165ad9eb748f75bd0cc3cf4625ac332be4edd91d03db45a1742914e29a0","observation_id":"292accf8-fd76-46a6-88f4-c3b9448ede9b","resolution":{"observed_at":"2026-08-11T04:30:49.658434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":3,"verified_fuzzy":22},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2412.18855."}