{"as_of":"2026-08-09T00:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ed39eb2735abfd4193e0478caac9c78eb043715fa0147e4a83030b119a776d09","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:57:46.595010Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T13:11:16.568415Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T13:13:18.063828Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"cited_work":{"arxiv_id":"2505.16856","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16856","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient online rl fine tuning with offline pre-trained policy only","venue":null,"work_id":"b24cc651-a7b8-4bc7-810f-a64eb5ddc666","year":2025},"citing_paper":{"arxiv_id":"2605.18675","last_updated":"2026-05-18T17:15:27Z","snapshot_observed_at":"2026-07-06T23:29:29.105126Z","submitted_at":"2026-05-18T17:15:27Z","title":"COOPO: Cyclic Offline-Online Policy Optimization Algorithm","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T13:11:16.568415Z"},"links":{"cited_paper":"/paper/2505.16856","citing_paper":"/paper/2605.18675"},"observation_digest":"sha256:4f5552651d8b7b936368b06924d6e256d753a88db88131aa99549a4083a242a7","observation_id":"5dc93c48-cbd9-4eda-a6c5-b228f351456b","resolution":{"observed_at":"2026-05-20T13:13:18.065518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16856/citation-record","integrity":"/paper/2505.16856/integrity","json":"/paper/2505.16856/citation-record.json","paper":"/paper/2505.16856"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.15657","last_updated":"2023-07-10T07:25:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-28T18:59:02Z","title":"Is Conditional Generative Modeling all you need for Decision-Making?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15657","snapshot_observed_at":"2026-08-07T14:57:44.563327Z","title":"Is con- ditional generative modeling all you need for decision-making? arXiv preprint arXiv:2211.15657,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:44.563327Z"},"links":{"cited_paper":"/paper/2211.15657","citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:5fc0c26862af603ec122938b979f1646bac055bf1a050452c526d81049f443a1","observation_id":"e7312754-442e-45ba-a88b-ee4ac8fec3f6","resolution":{"observed_at":"2026-08-07T14:57:44.563327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-07T14:57:44.985644Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:44.985644Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:23986f1b7c442ac24f02e478d6c01fee6ecd5dc8f2662519e6c8dca95affc4ba","observation_id":"ddec04fc-0c8f-4096-b3bf-0f0d762108ec","resolution":{"observed_at":"2026-08-07T14:57:44.985644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-07T14:57:45.287992Z","title":"Offline reinforcement learning with fisher divergence critic regularization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:45.287992Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:99394e85fa7d2b9076d098150b9eb9f5cef691be164dbbe8a5a3d1a3b14e848b","observation_id":"fdffa202-d7d7-4237-889c-d54e5cf02b8d","resolution":{"observed_at":"2026-08-07T14:57:45.287992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03426","last_updated":"2020-09-18T01:56:41Z","snapshot_observed_at":"2026-08-02T15:32:07.466568Z","submitted_at":"2018-02-09T19:39:33Z","title":"UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.03426","snapshot_observed_at":"2026-08-07T14:57:45.532496Z","title":"Umap: Uniform manifold approximation and projection for dimension reduction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:45.532496Z"},"links":{"cited_paper":"/paper/1802.03426","citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:6c114509366389e39f10a1a4897b787203461d6c47d99b6ee7fa87980574d9f6","observation_id":"1227962e-e897-4bac-8abd-4895c0763f16","resolution":{"observed_at":"2026-08-07T14:57:45.532496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-07T14:57:45.725844Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:45.725844Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:f25392a3d2b300bb061c9e474e1228b8fde8dd4383cc0c71aae6f34551b92ab7","observation_id":"29cab017-bd44-464d-b574-9ca054a70db0","resolution":{"observed_at":"2026-08-07T14:57:45.725844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-07T14:57:45.828145Z","title":"Behavior regularized offline reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:45.828145Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:494de17ea630d9650d28ac7af92b4291f337d2b0e49ce1671ac0a24b0e9573a3","observation_id":"bd6dce6e-0cd0-42ae-b33a-bf09de606e61","resolution":{"observed_at":"2026-08-07T14:57:45.828145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-07-06T20:09:05.798010Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-08-07T14:57:46.019748Z","title":"Policy decorator: Model-agnostic online refinement for large policy model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:46.019748Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:31d6d2435a21f05633a35abd8520dcea6a0d6819b4fcad437df0401aeda26bc1","observation_id":"1db2435d-d8c6-4259-8446-4e8bf1354ca8","resolution":{"observed_at":"2026-08-07T14:57:46.019748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19805","last_updated":"2024-05-28T07:57:57Z","snapshot_observed_at":"2026-07-06T16:40:39.567420Z","submitted_at":"2023-10-07T00:02:05Z","title":"Improving Offline-to-Online Reinforcement Learning with Q Conditioned State Entropy Exploration","version":4},"cited_work":{"arxiv_id":"2310.19805","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.19805","snapshot_observed_at":"2026-08-07T14:57:46.937870Z","title":"Improving Offline-to-Online Reinforcement Learning with Q Conditioned State Entropy Exploration","venue":"cs.LG","work_id":"8fb24d8f-9f33-4c11-a580-7ef587b2552f","year":2023},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:46.095320Z"},"links":{"cited_paper":"/paper/2310.19805","citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:0c43ef0d1b010020b7a0752b7823bf05837b36e7e02c4bb09c84d7352616bab3","observation_id":"5e013ce3-a10a-471b-aa15-3e97c64c1a33","resolution":{"observed_at":"2026-08-07T14:57:47.046425Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06871","last_updated":"2024-07-21T14:49:35Z","snapshot_observed_at":"2026-07-06T15:41:24.976531Z","submitted_at":"2023-06-12T05:10:10Z","title":"ENOTO: Improving Offline-to-Online Reinforcement Learning with Q-Ensembles","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06871","snapshot_observed_at":"2026-08-07T14:57:46.159807Z","title":"Tony Z Zhao, Vikash Kumar, Sergey Levine, and Chelsea Finn","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:46.159807Z"},"links":{"cited_paper":"/paper/2306.06871","citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:2205165af15aad8be6722b88ff1058f4cf4e5ff9aa41364f978e701cdb5a4508","observation_id":"e68f0f04-9717-4c55-bae4-336e6ffd1a20","resolution":{"observed_at":"2026-08-07T14:57:46.159807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-08-07T14:57:46.275862Z","title":"Imitation learning: Progress, taxonomies and challenges","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:46.275862Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:0f9a982b5c1e544ad932ca64a6fe25ea61150bdbda938d6617652a2bc906e2bf","observation_id":"526a60c2-719a-4d3d-a26a-1709df4352be","resolution":{"observed_at":"2026-08-07T14:57:46.275862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08740","last_updated":"2024-06-02T10:15:53Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:30:03Z","title":"Reinformer: Max-Return Sequence Modeling for Offline RL","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08740","snapshot_observed_at":"2026-08-07T14:57:46.353786Z","title":"Reinformer: Max-return sequence modeling for offline rl","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:46.353786Z"},"links":{"cited_paper":"/paper/2405.08740","citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:e884c48a1cf099d05c99475ee9f32cc787e58fcf6cb62a75b9cd588ab3f32b4c","observation_id":"e9dc4928-078a-4b0a-ae05-ac0a84fe3080","resolution":{"observed_at":"2026-08-07T14:57:46.353786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:48.082492Z","title":"A closely related problem setting is explored in Jump-start reinforcement learning (JSRL) Uchendu et al","venue":null,"work_id":"061c1600-b94d-4cde-9f02-74038b24e3dc","year":2023},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:46.431032Z"},"links":{"citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:2d51703820da9c106287ec49a8f4f54c532aefdb060e8065cf64eed95cb2b61b","observation_id":"1d645912-5e95-4d0f-b754-c3ac3eb5a55b","resolution":{"observed_at":"2026-08-07T14:57:48.185476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:47.915645Z","title":"to retaining offline data, the approach of not retaining offline data generally results in improved average normalized scores, accompanied by increasing variance","venue":null,"work_id":"6005dca0-1ff2-483a-ad57-fdb71bd7a0a0","year":2024},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:46.516116Z"},"links":{"citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:a8d59475cfb5b63057c43138f7583bc2481373f92a8962246dddc13b8f5c7b6f","observation_id":"f813b151-7d58-472b-9a56-6ef2d09bd9b0","resolution":{"observed_at":"2026-08-07T14:57:47.979056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:47.735020Z","title":"In our experiments, the pre-trained policy serves as the policy prior","venue":null,"work_id":"a6081969-e8b0-4396-b118-3c3bb6276764","year":2022},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:46.595010Z"},"links":{"citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:a4a9b718ce9887975aa78ef1b41d1ca3f6981717bc53b8604e65bcba50ca609b","observation_id":"ab389c53-f24d-4b5c-915f-931b0bcaea1b","resolution":{"observed_at":"2026-08-07T14:57:47.831310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:44.662518Z","title":"doi: 10.1016/j.robot.2008.10.024","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:44.662518Z"},"links":{"citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:2e3c1e509a1c4fe6a875e274a8db9cfe2c304cf2ed3b053b4ce04acb3aa9c409","observation_id":"f62dd1c5-efe2-46b8-bf7e-512d6e575192","resolution":{"observed_at":"2026-08-07T14:57:44.662518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-07T14:57:45.643556Z","title":"Awac: Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:45.643556Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:bee461dc726f811a24063cec6b26fb0b53fa9c28f69624644f2ba39fa04b7f0a","observation_id":"fcd94878-eafd-4482-8672-efd02332bc5d","resolution":{"observed_at":"2026-08-07T14:57:45.643556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02484","last_updated":"2023-10-20T05:12:04Z","snapshot_observed_at":"2026-07-06T15:50:41.385379Z","submitted_at":"2023-07-05T17:58:21Z","title":"Elastic Decision Transformer","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02484","snapshot_observed_at":"2026-08-07T14:57:45.913949Z","title":"Elastic decision transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:45.913949Z"},"links":{"cited_paper":"/paper/2307.02484","citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:44a350c28876d9229ac34e2059b9dfec8430a2bd9d59c8db8d23a90208bc8459","observation_id":"344e76bf-c1c8-4503-b413-d65496c998d9","resolution":{"observed_at":"2026-08-07T14:57:45.913949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T14:57:45.169227Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:45.169227Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:dbef774d4c034144673b5363cdeebcff21fdc19bbce1c0dc9f98d087a98f0d15","observation_id":"963ee686-3c8d-4410-a165-50f527e98b0b","resolution":{"observed_at":"2026-08-07T14:57:45.169227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:48.285855Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":"b189349e-7a97-42f1-b900-3aba09fa458f","year":null},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:45.091636Z"},"links":{"citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:9505dc5312c84d36de62ad13ab8e0f19be2a9ff1ea4fb82aeae9324fc3ad2587","observation_id":"89eecea1-fdcd-4137-960e-c7136a72294c","resolution":{"observed_at":"2026-08-07T14:57:48.345158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T14:57:45.414360Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:45.414360Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:11f70f43b7a99bc8dd60c76609c3b59e5b13d6e010a8f88f5e8edc3ba08200e3","observation_id":"20cfc6a2-fa91-4288-86fb-cbf6c81b5c33","resolution":{"observed_at":"2026-08-07T14:57:45.414360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.05982","last_updated":"2021-03-18T03:42:07Z","snapshot_observed_at":"2026-07-06T10:32:46.366651Z","submitted_at":"2021-01-15T06:25:58Z","title":"Randomized Ensembled Double Q-Learning: Learning Fast Without a Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.05982","snapshot_observed_at":"2026-08-07T14:57:44.897231Z","title":"Lili Chen, Kevin Lu, Aravind Rajeswaran, Kimin Lee, Aditya Grover, Misha Laskin, Pieter Abbeel, Aravind Srinivas, and Igor Mordatch","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:44.897231Z"},"links":{"cited_paper":"/paper/2101.05982","citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:d1969f44a6a66b2714a78b19c444c563ede989be27064f2bd07c320d17e59531","observation_id":"ef582d84-4c4b-44e8-9edd-05a8791a980d","resolution":{"observed_at":"2026-08-07T14:57:44.897231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T14:57:44.786459Z","title":"Dongxiang Chen and Ying Wen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:44.786459Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:5f2dedd676e198e074df7cf8418ad2b975cf9c2f6aef0aceaae4fd6790f70f46","observation_id":"28005ef9-f6da-4e9e-82e9-5284e244accf","resolution":{"observed_at":"2026-08-07T14:57:44.786459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 1 inbound Pith citation observation for arXiv:2505.16856."}