{"as_of":"2026-08-08T13:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d61901aa50e9cf7fe4234ffc2305dc5e22b232968df5c5f64a7cac26e3fc73b2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:57:45.725844Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:50:12.306741Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-07T14:57:45.725844Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:45.725844Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:f25392a3d2b300bb061c9e474e1228b8fde8dd4383cc0c71aae6f34551b92ab7","observation_id":"29cab017-bd44-464d-b574-9ca054a70db0","resolution":{"observed_at":"2026-08-07T14:57:45.725844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-07T13:45:00.439564Z","title":"A., Krishnamurthy, A., and Sun, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:00.439564Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:74e3b40a3343a57ec82fe350414ed79c5b346581491b3920f4b179e0bf74d9f1","observation_id":"e7753a3a-af6e-4cb7-ab0c-504b6df18e02","resolution":{"observed_at":"2026-08-07T13:45:00.439564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-07T05:37:46.383535Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-07T05:29:40.963572Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.383535Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:998649d9defe1145ed866aa1cdaad690f9d66b69da559a3cb18b784bb3468eab","observation_id":"0b408ba0-19b1-410c-bd43-e0e121d4bbbf","resolution":{"observed_at":"2026-08-07T05:37:46.383535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2507.07986","last_updated":"2026-04-30T00:00:17Z","snapshot_observed_at":"2026-08-08T11:51:09.954364Z","submitted_at":"2025-07-10T17:57:46Z","title":"EXPO: Stable Reinforcement Learning with Expressive Policies","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T05:09:02.111308Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2507.07986"},"observation_digest":"sha256:5a9af1a18de23416843c8a0228774e30a533818e2e6b4a83de793d5acb7fd55c","observation_id":"3e703aba-876f-44e6-abea-a1f2da435afd","resolution":{"observed_at":"2026-05-19T05:12:05.259804Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-06T18:27:02.465774Z","title":"A., Krishna- murthy, A., and Sun, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08387","last_updated":"2025-07-11T08:00:12Z","snapshot_observed_at":"2026-08-06T18:17:30.456700Z","submitted_at":"2025-07-11T08:00:12Z","title":"Online Pre-Training for Offline-to-Online Reinforcement Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:02.465774Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2507.08387"},"observation_digest":"sha256:1c7b67d21e87bc382cc5f15bdf91cb5496979d72313171b117556032dbb238b4","observation_id":"767f32c3-af73-45db-9a21-063a76a9d3bb","resolution":{"observed_at":"2026-08-06T18:27:02.465774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-06T17:42:59.023990Z","title":"Hybrid rl: Using both offline and online data can make rl efficient","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-07T20:29:46.771527Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":162,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:59.023990Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:56c0e0bb039d9b16450b7a6acf0a946b0cd35c2d5bbc81d47cbacf178d27eae2","observation_id":"526b2c15-4c8c-4ea7-8dee-d7cd56523cfc","resolution":{"observed_at":"2026-08-06T17:42:59.023990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-05T21:34:30.243849Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08413","last_updated":"2025-08-11T19:07:30Z","snapshot_observed_at":"2026-08-07T12:16:45.804784Z","submitted_at":"2025-08-11T19:07:30Z","title":"Decentralized Relaxed Smooth Optimization with Gradient Descent Methods","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-05T21:34:30.243849Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2508.08413"},"observation_digest":"sha256:680e3a348a3f6ca85fffb6120572d6f8d3bd6b5776fa5d33741d318a9fd68eae","observation_id":"54d71233-b41f-407d-9024-bd9fa7794d14","resolution":{"observed_at":"2026-08-05T21:34:30.243849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-04T13:00:08.709075Z","title":"Hybrid rl: Using both offline and online data can make rl efficient","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:08.709075Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:6bee81a5ed59c5335f49fdd644e1c795d12d3227ed7640dfb3890222f4695216","observation_id":"61191bb3-ed59-4c20-bad3-3192f7dd2288","resolution":{"observed_at":"2026-08-04T13:00:08.709075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-04T08:45:50.812731Z","title":"A., Krishnamurthy, A., and Sun, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.19528","last_updated":"2026-06-16T14:16:10Z","snapshot_observed_at":"2026-08-04T08:45:45.421057Z","submitted_at":"2025-10-22T12:32:52Z","title":"Learning Upper Lower Value Envelopes to Shape Online RL: A Principled Approach","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T08:45:50.812731Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2510.19528"},"observation_digest":"sha256:217da45c24f901477ad7b2cbdcb021b6cd41cd4aaeb30e458fbe365bb0d0cc35","observation_id":"f2dc4c0c-1335-4d2d-9833-b78d661542cd","resolution":{"observed_at":"2026-08-04T08:45:50.812731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2510.21060","last_updated":"2026-05-13T01:55:58Z","snapshot_observed_at":"2026-08-08T09:53:07.021031Z","submitted_at":"2025-10-24T00:21:38Z","title":"On the Sample Complexity of Differentially Private Policy Optimization","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T04:43:58.646419Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2510.21060"},"observation_digest":"sha256:8464644f0ce31578c46eac94d8753788f5702ec75069beeb1f0a358803755123","observation_id":"bfaca071-6b06-4792-aa97-c858755680ae","resolution":{"observed_at":"2026-05-18T04:45:54.791452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-03T00:05:19.691967Z","title":"A., Krishnamurthy, A., and Sun, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.12107","last_updated":"2026-06-07T03:40:44Z","snapshot_observed_at":"2026-08-03T19:35:11.911054Z","submitted_at":"2026-02-12T15:59:42Z","title":"On the Complexity of Offline Reinforcement Learning with $Q^\\star$-Approximation and Partial Coverage","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T00:05:19.691967Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2602.12107"},"observation_digest":"sha256:f9449c6b2464a8361b9d9d7889e110bb2440fe020667b1a61c76c20c9be57cf5","observation_id":"5fe5774a-48df-4fd5-a21a-3bdccbd329b0","resolution":{"observed_at":"2026-08-03T00:05:19.691967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2604.04142","last_updated":"2026-04-05T15:00:29Z","snapshot_observed_at":"2026-07-06T22:53:10.816748Z","submitted_at":"2026-04-05T15:00:29Z","title":"OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T16:46:30.674244Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2604.04142"},"observation_digest":"sha256:f5ddb404d11b8e864acb0eaba0a7f325891a6a7e0ed628b292e84027ae5ae5ee","observation_id":"0b234c6c-1aac-4e6c-8ffb-f70253b147a7","resolution":{"observed_at":"2026-05-13T16:48:02.892690Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2604.08958","last_updated":"2026-06-11T05:02:53Z","snapshot_observed_at":"2026-08-01T22:02:36.657096Z","submitted_at":"2026-04-10T04:57:54Z","title":"WOMBET: World Model-Based Experience Transfer for Robust and Sample-efficient Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T18:18:05.636131Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2604.08958"},"observation_digest":"sha256:5fe0c289fd3a2c9dfce0b8928ae5c62b579b8f4619ea784707a9e837232b329c","observation_id":"64a95906-4a9a-49a6-9fd2-4af53865b724","resolution":{"observed_at":"2026-05-11T05:10:54.307546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2604.13966","last_updated":"2026-04-15T15:17:40Z","snapshot_observed_at":"2026-08-08T02:57:57.796032Z","submitted_at":"2026-04-15T15:17:40Z","title":"Provably Efficient Offline-to-Online Value Adaptation with General Function Approximation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T12:55:12.531822Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2604.13966"},"observation_digest":"sha256:23e679029237eb9e22aee28cbe6e4d9456b0a4272b6b89da48cba8aaa0375d3d","observation_id":"2de8b1eb-8296-4ad6-b7c6-3fdafcb22eda","resolution":{"observed_at":"2026-05-10T12:55:24.163245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2604.17919","last_updated":"2026-05-05T15:00:45Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T07:54:36Z","title":"Fisher Decorator: Refining Flow Policy via a Local Transport Map","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T05:28:12.298066Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2604.17919"},"observation_digest":"sha256:5dc426f0c0070a6caa8440df7e5de42d136b266e3407e433063e0f87d8ab6df7","observation_id":"975e4bed-bd57-4f19-abf5-fb3ea33ed49f","resolution":{"observed_at":"2026-05-10T06:51:46.640676Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-09T19:31:38.069592Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:bd829f7249e85537b814b8d4f4026530bf8b127840ceacfe472df1a37068d5e0","observation_id":"49d113e4-ba79-4d98-8959-46d1516a6769","resolution":{"observed_at":"2026-05-11T15:36:12.446351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:0eb11da33242bd0ca4e8f2b3c2058d46fcfb28436c677bc3c82e253c4f32aef9","observation_id":"39a0a6bc-4bbd-43fc-b36f-1e8850532b61","resolution":{"observed_at":"2026-07-01T08:15:32.342064Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2605.05863","last_updated":"2026-05-20T07:46:09Z","snapshot_observed_at":"2026-07-06T23:18:26.864785Z","submitted_at":"2026-05-07T08:32:09Z","title":"SOPE: Stabilizing Off-Policy Evaluation for Online RL with Prior Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T14:54:30.895137Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2605.05863"},"observation_digest":"sha256:733a24d6e511a81207e550931c6621d68613f417cf6850df13f8e7b75a6d335d","observation_id":"0b2b7717-b975-48fe-9716-aed5571caef9","resolution":{"observed_at":"2026-05-11T18:41:08.508849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2605.05863","last_updated":"2026-05-20T07:46:09Z","snapshot_observed_at":"2026-07-06T23:18:26.864785Z","submitted_at":"2026-05-07T08:32:09Z","title":"SOPE: Stabilizing Off-Policy Evaluation for Online RL with Prior Data","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T09:15:11.280343Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2605.05863"},"observation_digest":"sha256:5a2930d3a193bfbe6bd8e5ec3f9b4152364276b47a7efcc7b38d797b8df0c42f","observation_id":"fdc32471-d64f-439d-bd74-0d8826c39e84","resolution":{"observed_at":"2026-05-21T09:19:56.740644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2605.10289","last_updated":"2026-05-14T09:25:47Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T09:50:58Z","title":"Sample-Mean Anchored Thompson Sampling for Offline-to-Online Learning with Distribution Shift","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-12T04:41:20.147645Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2605.10289"},"observation_digest":"sha256:2f4a6041f02ac7b1d89107b9745db3bdb16a887a65972dbd9c36f7ffab971237","observation_id":"796d031f-96a3-44c4-a061-5a62bb85114e","resolution":{"observed_at":"2026-05-12T06:01:24.988012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2605.10289","last_updated":"2026-05-14T09:25:47Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T09:50:58Z","title":"Sample-Mean Anchored Thompson Sampling for Offline-to-Online Learning with Distribution Shift","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-15T05:07:34.344964Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2605.10289"},"observation_digest":"sha256:721024321b9193695edd0bc5bb12bedcb70f671f8d3daf63e48fd2b37abf30ca","observation_id":"fe4e1566-4459-4778-935c-a9e6bb1344db","resolution":{"observed_at":"2026-05-15T05:09:45.449771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2605.14497","last_updated":"2026-05-14T07:35:58Z","snapshot_observed_at":"2026-08-01T11:14:55.109730Z","submitted_at":"2026-05-14T07:35:58Z","title":"ROAD: Adaptive Data Mixing for Offline-to-Online Reinforcement Learning via Bi-Level Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T01:32:42.972836Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2605.14497"},"observation_digest":"sha256:fdee18a7b0274d4f5e316408cab35cd7edf122d9d31d452b6074bbef81003201","observation_id":"fb0c0acb-c715-42a3-90ff-ba797ec27a00","resolution":{"observed_at":"2026-05-15T01:33:27.192556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2605.14779","last_updated":"2026-05-14T12:48:44Z","snapshot_observed_at":"2026-07-06T23:26:09.066863Z","submitted_at":"2026-05-14T12:48:44Z","title":"Peng's Q($\\lambda$) for Conservative Value Estimation in Offline Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T21:45:43.298829Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2605.14779"},"observation_digest":"sha256:95ebb27a31d7ef818e40a1d3321e2dd00753780501cbc1392ad8c8c705d45aab","observation_id":"acb0340c-2a99-43bc-9711-85dba150d4d4","resolution":{"observed_at":"2026-07-01T14:25:45.850150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2605.18675","last_updated":"2026-05-18T17:15:27Z","snapshot_observed_at":"2026-07-06T23:29:29.105126Z","submitted_at":"2026-05-18T17:15:27Z","title":"COOPO: Cyclic Offline-Online Policy Optimization Algorithm","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T13:11:16.568415Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2605.18675"},"observation_digest":"sha256:98c4be07dcbdeb8d237d547ff3c798119922e3b3ed7471aaa3811e794d81b080","observation_id":"634974ff-59c9-40ec-a2f8-321d59b8e1f4","resolution":{"observed_at":"2026-05-20T13:13:18.031118Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2606.18531","last_updated":"2026-06-16T22:55:45Z","snapshot_observed_at":"2026-08-04T10:57:17.249083Z","submitted_at":"2026-06-16T22:55:45Z","title":"When Does Trajectory-Level Supervision Permit Efficient Offline Reinforcement Learning?","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-26T22:06:24.412259Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2606.18531"},"observation_digest":"sha256:f8e191838bc5fe15e8e260fea71de4f24bf5ea92b35992147ef3b78aff63f29e","observation_id":"c40f1fc8-4888-48af-ab4b-b102ebdd2e46","resolution":{"observed_at":"2026-07-03T23:29:02.983617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2606.26006","last_updated":"2026-06-24T16:23:18Z","snapshot_observed_at":"2026-07-07T00:00:21.918469Z","submitted_at":"2026-06-24T16:23:18Z","title":"FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-25T19:29:00.117285Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2606.26006"},"observation_digest":"sha256:6221fc227cc340ff7a65c11c5af9eda870f1771251ea329a22aba000d6e36d65","observation_id":"87b49c29-d6ad-4e76-8c37-c3c35c24bd8a","resolution":{"observed_at":"2026-07-04T20:50:12.308569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2210.06718 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":282,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:b90bf85c473cc7736fc2e003578a667f4e937929283e539feac6d59f40c46b87","observation_id":"c84440eb-076d-4640-b8b7-a7d1d2dbf63f","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-02T08:41:05.419064Z","title":"arXiv preprint arXiv:2210.06718 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":283,"source":"arxiv_source","source_observed_at":"2026-08-02T08:41:05.419064Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:5bf100a1ce1743ae9aab15a1e6579314bfcc6a7ffbcaf0af69a38eeb81d142a3","observation_id":"8aa1f197-80c9-41b7-b6f9-9f1cb3891903","resolution":{"observed_at":"2026-08-02T08:41:05.419064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-01T03:13:35.351631Z","title":"arXiv preprint arXiv:2210.06718 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25207","last_updated":"2026-07-28T02:27:27Z","snapshot_observed_at":"2026-08-04T23:27:33.741677Z","submitted_at":"2026-07-28T02:27:27Z","title":"A Unified Algorithmic Framework for Hybrid Reinforcement Learning in Tabular MDPs with Shifted Transition Dynamics","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T03:13:35.351631Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2607.25207"},"observation_digest":"sha256:87508190c017958374b91a4d08c3f9dd942d39fb92adec0c60144790a595c7a7","observation_id":"3ae795ad-3718-4759-94ea-ce72fd92563d","resolution":{"observed_at":"2026-08-01T03:13:35.351631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2210.06718/citation-record","integrity":"/paper/2210.06718/integrity","json":"/paper/2210.06718/citation-record.json","paper":"/paper/2210.06718"},"outbound":[],"paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 29 inbound Pith citation observations for arXiv:2210.06718."}