{"as_of":"2026-08-20T22:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8b62f4b9c8aa00df84773404b9c18391291b574deead695df2b871720670e8d3","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:28:38.548957Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:23:38.206985Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:59:44.649113Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-08-09T11:54:10.467494Z","title":"S., Gao, T., Sampaio, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02538","last_updated":"2025-05-25T22:15:41Z","snapshot_observed_at":"2026-08-19T21:06:15.352844Z","submitted_at":"2025-02-04T18:04:05Z","title":"Flow Q-Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T11:54:10.467494Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2502.02538"},"observation_digest":"sha256:9425f77d896b7d58800011d007c386ba6a24b379375a541879995cb9d1845782","observation_id":"8c7411f3-fee2-422d-9eaf-f55ce5b57aa2","resolution":{"observed_at":"2026-08-09T11:54:10.467494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-08-08T19:20:33.596522Z","title":"Policy agnostic RL: offline RL and online RL fine-tuning of any class and backbone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05450","last_updated":"2025-04-14T04:53:32Z","snapshot_observed_at":"2026-08-19T23:21:19.328582Z","submitted_at":"2025-02-08T05:01:17Z","title":"ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T19:20:33.596522Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2502.05450"},"observation_digest":"sha256:1e9e53d62407aeb340d7e284078e0618c74e1674ed26f8347d0fac50c93fdcc6","observation_id":"130da234-bcdd-4f93-8ff5-e34a16e1b8b0","resolution":{"observed_at":"2026-08-08T19:20:33.596522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-08-08T13:21:18.339718Z","title":"Policy agnostic rl: Offline rl and online rl fine-tuning of any class and backbone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.339718Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:dc1d23f0e79f7d641e19b6d092b03952a4e707cde38fa8ae38dc04d94d851aaf","observation_id":"4c5de78b-2d75-439a-83d5-9af270e71cc1","resolution":{"observed_at":"2026-08-08T13:21:18.339718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-08-15T22:23:38.206985Z","title":"S., Gao, T., Sampaio, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07395","last_updated":"2025-05-12T09:48:03Z","snapshot_observed_at":"2026-08-16T20:05:19.058376Z","submitted_at":"2025-05-12T09:48:03Z","title":"ReinboT: Amplifying Robot Visual-Language Manipulation with Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T22:23:38.206985Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2505.07395"},"observation_digest":"sha256:6c13369ff61820df6814dcfc00c569c9d296eb95f4f1d5f07906715599525f7f","observation_id":"0ad9fb00-7442-47ff-b970-fb7420bd510e","resolution":{"observed_at":"2026-08-15T22:23:38.206985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-08-07T12:58:50.612205Z","title":"S., Gao, T., Sampaio, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-17T05:26:20.110799Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.612205Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:d7f0235eb338d7b6b898f8cfc6345189257ce84e7d139f2e536befceff7f3650","observation_id":"a5446eea-762d-424c-bc91-e942572d7a78","resolution":{"observed_at":"2026-08-07T12:58:50.612205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-08-07T12:56:28.792421Z","title":"Policy agnostic rl: Offline rl and online rl fine-tuning of any class and backbone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-15T15:01:05.530251Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.792421Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:fdaf4d4098f8a24b9ca9eea50ef701869d172b7ef52f104a732e56a6763dfb07","observation_id":"a7725c5d-50d7-4222-a48e-3c5cdce9f246","resolution":{"observed_at":"2026-08-07T12:56:28.792421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2506.15799","last_updated":"2025-06-25T19:09:52Z","snapshot_observed_at":"2026-08-08T08:13:32.220639Z","submitted_at":"2025-06-18T18:35:57Z","title":"Steering Your Diffusion Policy with Latent Space Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T21:55:46.183007Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2506.15799"},"observation_digest":"sha256:0db5c4b0614d74344a433f9fea8e139959ed9cfef206e42607a93b47d5cf8f34","observation_id":"4335a470-040a-42bf-9ca8-fbf1a0758d2f","resolution":{"observed_at":"2026-05-17T21:55:46.258768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-08-05T10:30:23.611023Z","title":"S.; Gao, T.; Sampaio, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-14T09:41:04.189727Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.611023Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:9738d5889730504e193cdf65b63be011ceb26238c49393ea5cbca8cc34a7749c","observation_id":"cdd8c86c-0b3b-4f1a-af6f-f9b4914be986","resolution":{"observed_at":"2026-08-05T10:30:23.611023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-08-20T22:25:56.255434Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T10:34:59.134604Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2511.14759"},"observation_digest":"sha256:2b544004365a3d5a0d5003f1986c8bf93a8954ba84d362db5956499de00d25d5","observation_id":"609b4a33-52c6-4b10-aecf-d739fcbb9438","resolution":{"observed_at":"2026-05-12T10:34:59.359504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2602.07399","last_updated":"2026-05-22T10:22:29Z","snapshot_observed_at":"2026-08-12T22:22:24.576314Z","submitted_at":"2026-02-07T06:31:53Z","title":"VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-25T07:00:01.741166Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2602.07399"},"observation_digest":"sha256:ce145c45fe62e3810ff4746c89de0c99d352bfb3a58af1cb7703a2840946f4d2","observation_id":"88261a3b-d278-416d-8adc-03952f33d58e","resolution":{"observed_at":"2026-05-25T07:00:26.050159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2603.12243","last_updated":"2026-05-15T22:34:49Z","snapshot_observed_at":"2026-08-15T17:17:41.222361Z","submitted_at":"2026-03-12T17:56:29Z","title":"HandelBot: Real-World Piano Playing via Fast Adaptation of Dexterous Robot Policies","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-15T11:48:13.368844Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2603.12243"},"observation_digest":"sha256:b2f01dc02d79d2a85279fd3bbdd9c2b262c3fea832dc0ef6a6e27f97d8adc75f","observation_id":"6e7b3928-7f87-4e28-8f30-79961d2b7c67","resolution":{"observed_at":"2026-05-15T11:49:58.836520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2603.12243","last_updated":"2026-05-15T22:34:49Z","snapshot_observed_at":"2026-08-15T17:17:41.222361Z","submitted_at":"2026-03-12T17:56:29Z","title":"HandelBot: Real-World Piano Playing via Fast Adaptation of Dexterous Robot Policies","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-21T11:54:57.866685Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2603.12243"},"observation_digest":"sha256:32578474ed6d27e1e1e478c9643e66f268af7d32097585fb3137b99db4a644ee","observation_id":"12e3cd77-d007-4137-8d44-38141bb4cb74","resolution":{"observed_at":"2026-05-21T11:55:04.159093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"S., Gao, T., Sampaio, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-19T14:14:25.412292Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:998a1ed5e3de9544a957900ea9e382faa11dff80bee2e38f4b31c39c61ee9736","observation_id":"00521669-6dec-42f6-945a-8f2473994a8e","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2604.14265","last_updated":"2026-04-15T17:12:56Z","snapshot_observed_at":"2026-08-15T02:53:18.322914Z","submitted_at":"2026-04-15T17:12:56Z","title":"Reinforcement Learning via Value Gradient Flow","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-10T13:18:16.532434Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2604.14265"},"observation_digest":"sha256:b57eab08938d065278ec3d6a51d7ff780a401f78e81ef79d9d1c1c01905b023e","observation_id":"e59a8f7b-b208-4f10-bd55-49962d8816da","resolution":{"observed_at":"2026-05-10T13:20:25.630018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-08-12T15:38:43.672554Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":1},"reference_index":160,"source":"arxiv_source","source_observed_at":"2026-05-08T18:48:56.075160Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:19b28089514079fe472a8b1884bece434bc3e9b5edd497b3b404796e3dfc261a","observation_id":"dd0e3994-6bfe-48ab-98aa-0a0d3fe5c70d","resolution":{"observed_at":"2026-05-09T06:10:42.480995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-08-12T15:38:43.672554Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:d6e5beb306945e3b909e2e9f1422c7b84e227460c537b9f86ea31eb002a07419","observation_id":"c6b3ca7a-5ffb-44a1-9f66-0bf9626af0c8","resolution":{"observed_at":"2026-07-01T00:05:09.674048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2605.07381","last_updated":"2026-05-08T07:35:24Z","snapshot_observed_at":"2026-08-20T17:56:28.297163Z","submitted_at":"2026-05-08T07:35:24Z","title":"Escaping the Diversity Trap in Robotic Manipulation via Anchor-Centric Adaptation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-11T02:25:23.710842Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2605.07381"},"observation_digest":"sha256:d9630168875a5d22656b07a4cfc453ee6d3d40730dc318acb0e1d5b66ea3586d","observation_id":"eaafebcc-fb68-4ffd-9c74-5bdd74bfe522","resolution":{"observed_at":"2026-05-11T02:25:53.258341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2605.07637","last_updated":"2026-05-12T12:34:31Z","snapshot_observed_at":"2026-08-11T15:43:27.522199Z","submitted_at":"2026-05-08T12:05:08Z","title":"Learning to Communicate Locally for Large-Scale Multi-Agent Pathfinding","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-11T02:21:23.325806Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2605.07637"},"observation_digest":"sha256:f3f52cde3329b002d9ecaf1eb5a0946cb7023c7c5ad8885265dad6fb9147216a","observation_id":"f5d912b0-9f41-46d9-acd5-ea7348a7f017","resolution":{"observed_at":"2026-05-11T03:45:56.223208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2605.07637","last_updated":"2026-05-12T12:34:31Z","snapshot_observed_at":"2026-08-11T15:43:27.522199Z","submitted_at":"2026-05-08T12:05:08Z","title":"Learning to Communicate Locally for Large-Scale Multi-Agent Pathfinding","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-13T07:41:12.038619Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2605.07637"},"observation_digest":"sha256:c14f7f3377f4eeec9a3766f52042d578b74c11aa632c267d290addab0ce89db3","observation_id":"06a164a0-6f2d-4115-bdb6-49fcb209186a","resolution":{"observed_at":"2026-05-13T07:42:30.522744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-08-15T04:15:46.059667Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:366cca988b9e753d16e30d403dd4ec912660e7a1d66d64c091eddaffff07c301","observation_id":"a8263df0-2b6d-435c-8b68-aa9a8721d04d","resolution":{"observed_at":"2026-05-13T05:27:18.469693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2605.22376","last_updated":"2026-05-21T12:09:11Z","snapshot_observed_at":"2026-08-14T16:51:23.554857Z","submitted_at":"2026-05-21T12:09:11Z","title":"Target-Aligned Bellman Backup for Cross-domain Offline Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T08:02:27.951445Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2605.22376"},"observation_digest":"sha256:641b3418d97b359786246642d1906a069b347a583777a746237f21c42c986586","observation_id":"72bf615c-edb6-42d7-bd65-6b99f9a55500","resolution":{"observed_at":"2026-05-22T08:04:43.127249Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2605.25477","last_updated":"2026-08-17T22:23:14Z","snapshot_observed_at":"2026-08-20T22:17:48.607264Z","submitted_at":"2026-05-25T06:31:03Z","title":"EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T22:10:08.682307Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2605.25477"},"observation_digest":"sha256:a7ec2ae6c0da4a03e7b08dbd14eed96e619f5fd852ea84dde3127ba959a90b04","observation_id":"7eb4df5d-9408-47fd-b34e-d984144a8237","resolution":{"observed_at":"2026-06-29T22:13:59.959872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2606.10825","last_updated":"2026-06-09T13:09:21Z","snapshot_observed_at":"2026-07-06T23:49:56.404171Z","submitted_at":"2026-06-09T13:09:21Z","title":"MODIP: Efficient Model-Based Optimization for Diffusion Policies","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-27T13:44:19.708550Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2606.10825"},"observation_digest":"sha256:8e39b0f81a07c756f91808e8709532008870f2261acf177a2cd2c2b449e5df78","observation_id":"15bae689-3df4-4612-b061-054739eb52de","resolution":{"observed_at":"2026-07-03T04:37:37.560909Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2606.11087","last_updated":"2026-06-09T16:45:57Z","snapshot_observed_at":"2026-08-15T22:55:45.378662Z","submitted_at":"2026-06-09T16:45:57Z","title":"Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T14:05:01.073951Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2606.11087"},"observation_digest":"sha256:47afcfbcb1fa263680ecb57ae559eb47f18f38b1b84fc07a5ec1cd7a70f3983d","observation_id":"2126534e-497d-41c7-bdb2-2c6513451b7d","resolution":{"observed_at":"2026-07-03T04:17:36.921976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2606.13675","last_updated":"2026-06-11T17:59:45Z","snapshot_observed_at":"2026-07-30T00:58:38.369141Z","submitted_at":"2026-06-11T17:59:45Z","title":"Improving Robotic Generalist Policies via Flow Reversal Steering","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T06:20:19.209180Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2606.13675"},"observation_digest":"sha256:63cc69d18061a62c0c1a4b715a84d5b7c7d724485d7ace91734d841edb15bebe","observation_id":"5e6891cb-20f9-4ec3-972d-18881248cdac","resolution":{"observed_at":"2026-07-03T15:48:35.726202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-14T19:03:44.084753Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:3c7a2e2023add4736dd240d9e8136186f9bc27ea127b5b98ac2e40a73975be63","observation_id":"bf5b6a4e-37b3-4eb4-9983-2349a56664a5","resolution":{"observed_at":"2026-07-03T14:18:22.948665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2606.17551","last_updated":"2026-06-16T05:56:10Z","snapshot_observed_at":"2026-08-13T11:35:51.470095Z","submitted_at":"2026-06-16T05:56:10Z","title":"Reversal Q-Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T02:30:24.951689Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2606.17551"},"observation_digest":"sha256:9682bdc9784d9dd17782e502f2f222633d17d4bcbd908143cefc44a1cef06e6f","observation_id":"d861aa65-49e0-4a40-a343-920ed4c51fe0","resolution":{"observed_at":"2026-07-03T18:38:49.871380Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2606.23640","last_updated":"2026-06-22T17:30:24Z","snapshot_observed_at":"2026-08-02T09:22:48.099895Z","submitted_at":"2026-06-22T17:30:24Z","title":"Learning Process Rewards via Success Visitation Matching for Efficient RL","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-26T09:20:35.062060Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2606.23640"},"observation_digest":"sha256:d07ac4e1df056270ac742215fae44b3349ca4db90755055e200fe2d92894dc94","observation_id":"b93a7f98-09d0-4631-8508-e0dd233a94dc","resolution":{"observed_at":"2026-07-04T09:59:44.650888Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2606.31958","last_updated":"2026-06-30T17:00:33Z","snapshot_observed_at":"2026-07-07T00:05:37.068846Z","submitted_at":"2026-06-30T17:00:33Z","title":"Adapting Generalist Robot Policies with Semantic Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-01T05:09:29.625066Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2606.31958"},"observation_digest":"sha256:3a7c2cc7259e75b0db3ea6595cedb83284b052bb798e1d2aeff0bbf48b101229","observation_id":"9733d33a-8d5b-4d57-9a76-cd74781f6036","resolution":{"observed_at":"2026-07-01T10:45:42.657378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-12T00:12:42.173815Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03751","last_updated":"2026-07-04T07:53:10Z","snapshot_observed_at":"2026-08-16T17:08:47.409427Z","submitted_at":"2026-07-04T07:53:10Z","title":"Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T00:12:42.173815Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2607.03751"},"observation_digest":"sha256:ba5cd3e203e0225f769ec6c529c7dd6db0e576464a15bd709e5fc247d31e4dbc","observation_id":"9f8c20cc-bc8e-4874-bb85-8fbe4589b096","resolution":{"observed_at":"2026-07-12T00:12:42.173815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-08-15T14:18:48.614940Z","title":"Policy agnostic rl: Offline rl and online rl fine-tuning of any class and backbone, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11363","last_updated":"2026-08-11T19:15:26Z","snapshot_observed_at":"2026-08-19T01:26:06.327392Z","submitted_at":"2026-08-11T19:15:26Z","title":"Adaptation of Generalist Robot Policies with Minimal Data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T14:18:48.614940Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2608.11363"},"observation_digest":"sha256:0f72835159bd77f3e2cd5429aaa9463a141e34e3fe88c993553456fb8f6b0af8","observation_id":"ade8d8dd-59e8-4d12-b661-e9019c6d7f85","resolution":{"observed_at":"2026-08-15T14:18:48.614940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.06685/citation-record","integrity":"/paper/2412.06685/integrity","json":"/paper/2412.06685/citation-record.json","paper":"/paper/2412.06685"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:40.669983Z","title":"Abdolmaleki, J","venue":null,"work_id":"2746d3b7-3c87-4f2a-8e53-c1eb508b096c","year":2018},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:37.777772Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:b08b494dce4238fa8011990da40dae928a1823e686efedd1d683387c69b9744b","observation_id":"b3682650-6a4a-4d7c-a290-040be540b661","resolution":{"observed_at":"2026-08-11T19:28:40.762199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11896","last_updated":"2024-06-14T17:49:55Z","snapshot_observed_at":"2026-08-16T13:42:51.892765Z","submitted_at":"2024-06-14T17:49:55Z","title":"DigiRL: Training In-The-Wild Device-Control Agents with Autonomous Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11896","snapshot_observed_at":"2026-08-11T19:28:37.783068Z","title":"Digirl: Training in-the-wild device-control agents with autonomous reinforcement learning.arXiv preprint arXiv:2406.11896, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:37.783068Z"},"links":{"cited_paper":"/paper/2406.11896","citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:144bf4dcbc58c491e12cf158ade6782574322e5517c3b3ab05db40be1bc882b5","observation_id":"57210eb1-0b26-4073-b9cd-de722e8ef3cd","resolution":{"observed_at":"2026-08-11T19:28:37.783068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:37.788366Z","title":"Efficient online reinforcement learning with offline data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:37.788366Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:ff4f158c414e7d177c2cbdcbad42a8afca603ceb128d79c7d3ea303aa8436fd0","observation_id":"3756bff2-2cb0-4f3d-bbd5-ab83f380eccc","resolution":{"observed_at":"2026-08-11T19:28:37.788366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:37.793143Z","title":"Q-transformer: Scalable offline reinforcement learning via autoregressive q-functions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:37.793143Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:80e7fca15d0f5c7d89da3446d913f96d474f016fde863b475fae60671cb3ab10","observation_id":"c640ceba-ea63-478d-9769-dc38c584847c","resolution":{"observed_at":"2026-08-11T19:28:37.793143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05915","last_updated":"2023-10-09T17:58:38Z","snapshot_observed_at":"2026-08-16T14:53:43.494263Z","submitted_at":"2023-10-09T17:58:38Z","title":"FireAct: Toward Language Agent Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05915","snapshot_observed_at":"2026-08-11T19:28:37.798320Z","title":"Fireact: Toward language agent fine-tuning.arXiv preprint arXiv:2310.05915, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:37.798320Z"},"links":{"cited_paper":"/paper/2310.05915","citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:43be55520560f8c117ecddaaacec32c6c50ad36dc1ad5d135d976ac22777fd1b","observation_id":"85351a09-9f2b-4bdf-9146-2437a62c1183","resolution":{"observed_at":"2026-08-11T19:28:37.798320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:40.633056Z","title":"Diffusionpolicy: Visuomotorpolicylearningviaactiondiffusion","venue":null,"work_id":"3067b597-e15f-486a-a647-2c74f2eab54f","year":2023},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:37.803294Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:ba4b0afb9b5bbf9ae8348c1feb01356e0728db1d77b68e42da5e4b9ae0fb3ba8","observation_id":"a9c44608-52ce-4d84-8189-988d0b3f0e39","resolution":{"observed_at":"2026-08-11T19:28:40.638278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:40.344886Z","title":"Bridge data: Boosting generalization of robotic skills with cross-domain datasets.Robotics: Science and Systems, 2022","venue":null,"work_id":"02344f04-ecda-434f-be79-e93df9a9a0aa","year":2022},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:37.808438Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:5104fdd1a29fc7c51b371324ab951bc0c82d8c356b8b14f89398646d7249dc04","observation_id":"7f289261-15e4-4165-a12b-3283755a8f5b","resolution":{"observed_at":"2026-08-11T19:28:40.503358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:40.326780Z","title":"Stop regressing: Training value 16 Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone functions via classification for scalable deep rl","venue":null,"work_id":"c10905bf-a97e-483c-9626-eb74d41475a6","year":null},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:37.813070Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:ace109315029c3334e79a0ad925b855fdf1839c75c6f8907ae851cf809941bbb","observation_id":"cea8ecc9-0983-428c-ba04-b08daa2027e2","resolution":{"observed_at":"2026-08-11T19:28:40.332367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-08-16T08:32:46.407746Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-11T19:28:37.818160Z","title":"D4rl: Datasets for deep data-driven reinforcement learning.arXiv preprint arXiv:2004.07219, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:37.818160Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:886645211d5349c761f7532d8d2d2f458e28f5a29c6f3df73ff3fc00ad5f58d5","observation_id":"fe6e76d3-abec-4f35-a97c-05ea505deb62","resolution":{"observed_at":"2026-08-11T19:28:37.818160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:37.822367Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:37.822367Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:5242d01a81c593f8c575c20bbb1da40d1f0d93ab5f49f55a16cb5f1dd58a226f","observation_id":"4b8af79e-74b6-4c28-8c47-cd9e726ab9b7","resolution":{"observed_at":"2026-08-11T19:28:37.822367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:37.827415Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:37.827415Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:01dd9ea872c2a79a7716cc809192119ac4954305961d078c2aa94a43a2b93ed8","observation_id":"86c6269a-6684-48ff-aac8-9c76364803f2","resolution":{"observed_at":"2026-08-11T19:28:37.827415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:37.832515Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:37.832515Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:6d87b1a175652f760a404169c6f2c0c13a2ada786e75174f01082050eab8aea3","observation_id":"f7603abf-cff8-4374-bcc1-f8de43aa4872","resolution":{"observed_at":"2026-08-11T19:28:37.832515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:40.280454Z","title":"Emaq: Expected- max q-learning operator for simple yet effective offline and online rl","venue":null,"work_id":"a32daa0e-be10-4fe3-b584-206a83e29e33","year":2021},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:37.836857Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:b4cb6efc37f83d1af1a188ee78534da21932a3ff935ac58d02ec2f9b35465c40","observation_id":"33f97c0a-d888-424c-84bd-df3892676277","resolution":{"observed_at":"2026-08-11T19:28:40.285717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:40.264991Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"4e0f998a-a0d6-475f-a7f0-9172e16dac8a","year":2020},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:37.841410Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:8dd3720da3145a85822c74491d1a080d110523391f3dfeb7584023e13bdc9795","observation_id":"dfeb17e4-84a0-4cd7-b97a-b32763da0934","resolution":{"observed_at":"2026-08-11T19:28:40.269847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-11T19:28:37.846301Z","title":"Haarnoja, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:37.846301Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:27d150525bf3dcfe881b7c524af637a507824c00559c784b3cb9a76c84ce9c45","observation_id":"9e049b36-5eb2-4ef9-8322-49db2d15f830","resolution":{"observed_at":"2026-08-11T19:28:37.846301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:37.851080Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:37.851080Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:68d56abf61753281e020cba042c6cf1dc7b40f4db1e2c213dfdc4c6367ce4823","observation_id":"fcd3e3b7-9c83-4ba5-b143-31e20c2cc21c","resolution":{"observed_at":"2026-08-11T19:28:37.851080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-08-14T17:40:51.391072Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-11T19:28:37.855741Z","title":"Idql: Implicit q-learning as an actor-critic method with diffusion policies.arXiv preprint arXiv:2304.10573, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:37.855741Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:53b7f0acf0123bfe63264978311314b57681504598516ebeffeedf3b8d7e5dbc","observation_id":"1419ef9a-d790-446c-9adb-562c0f9be061","resolution":{"observed_at":"2026-08-11T19:28:37.855741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:37.896663Z","title":"Denoising diffusion probabilistic models.Advances in Neural Information Processing Systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:37.896663Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:1897ff078ee6df531fbd7b35fa12d41e01e99770655e67953e63bb9de680acfa","observation_id":"900932f6-9fa5-4bda-80de-f8db9fe56cad","resolution":{"observed_at":"2026-08-11T19:28:37.896663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-20T11:47:17.477107Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T19:28:37.935059Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:37.935059Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:12ac1106e3a3a90c62713eb6094d6ee2978ab46556c32f05073a6b5a47f32b71","observation_id":"8c8718a4-beaf-486d-9b04-86ee4a729b54","resolution":{"observed_at":"2026-08-11T19:28:37.935059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:40.188174Z","title":"Offline reinforcement learning as one big sequence modeling problem","venue":null,"work_id":"98a44ad5-28d3-40f8-8183-8737458a5b45","year":2021},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:37.975759Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:93839a498492c64d3e0b3dc4ad3f5bf0ac0a31bea7e8659d9035c8af08a9e25b","observation_id":"35a0a684-f0c9-47c0-8fd4-84020e7182dc","resolution":{"observed_at":"2026-08-11T19:28:40.213089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:40.121101Z","title":"Qt-opt: Scalable deep reinforcement learning for vision-based robotic manipulation","venue":null,"work_id":"914cee28-58b2-4298-aa3a-8b14969a5de5","year":2018},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.015147Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:e2aa8c296659a6a5f57b691213e6e00581c3d2980feb005594fcdf1522ebe2cd","observation_id":"7ac1b492-06d7-4e66-9575-0adf6385fb92","resolution":{"observed_at":"2026-08-11T19:28:40.126016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-11T19:28:38.085466Z","title":"Openvla: An open-source vision-language- action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.085466Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:9bd8d36d2ddaaa50bdca8e92e412ed4e62c6ce99b671faba3c5898f7af0c62fc","observation_id":"1f6e5670-a8d5-48f2-ac50-1c6e6ab01acf","resolution":{"observed_at":"2026-08-11T19:28:38.085466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:40.105784Z","title":"Adam: A method for stochastic optimization.International Conference on Learning Representations (ICLR), 2015","venue":null,"work_id":"ada924a4-65ee-40f7-9a97-c28282383d5d","year":2015},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.151870Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:58e4c68528f52d11d41339f299aadb93ad20de6df2f623705cf9ab7679b818c9","observation_id":"393c17c9-5904-4e36-bf7a-a34d0973a03f","resolution":{"observed_at":"2026-08-11T19:28:40.110467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:40.090445Z","title":"Offline reinforcement learning with implicit q- learning","venue":null,"work_id":"c3645483-22d2-4fc3-85d5-3f4275e069c2","year":null},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.156808Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:e593381cfed5d5a98481331db048746280725d50313e7b3ad774f56bc055c3a5","observation_id":"6e224e8b-02cc-4e5e-ac33-cc3e93572b68","resolution":{"observed_at":"2026-08-11T19:28:40.095697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:40.072272Z","title":"Kumar, X.B","venue":null,"work_id":"5fc29fea-a28b-463c-9593-08e22c6bdc34","year":2019},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.162001Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:94688aaf54d1fc3098451e244cd8139c43d12a62328294869a67d7f3af06d06b","observation_id":"79359524-3e4b-46fc-b2d5-2a8a0875a164","resolution":{"observed_at":"2026-08-11T19:28:40.077671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:38.166784Z","title":"Conservative q-learning for offline reinforcement learning.Advances in Neural Information Processing Systems, 33:1179–1191, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.166784Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:23a597019464567a765afdf5a01fe853fdc5a2991b7dfc05eb46525efa9de5f4","observation_id":"775538a6-0dc3-460d-9935-cbb9cf9f8c34","resolution":{"observed_at":"2026-08-11T19:28:38.166784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.05178","last_updated":"2023-09-23T23:25:32Z","snapshot_observed_at":"2026-08-20T21:32:59.094560Z","submitted_at":"2022-10-11T06:30:53Z","title":"Pre-Training for Robots: Offline RL Enables Learning New Tasks from a Handful of Trials","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.05178","snapshot_observed_at":"2026-08-11T19:28:38.172066Z","title":"Pre- training for robots: Offline rl enables learning new tasks from a handful of trials.RSS 2023; arXiv:2210.05178, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.172066Z"},"links":{"cited_paper":"/paper/2210.05178","citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:effdfdb6d06734820061563fc538034c8bfc4173bb866959148ae71f0afe6d5f","observation_id":"c8ea5083-aa4e-4af1-98d5-343aae6bfc45","resolution":{"observed_at":"2026-08-11T19:28:38.172066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-11T19:28:38.176724Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.176724Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:ca515c1df38c463b2bc0711797f1865c7ec75ecae2e796ddab233b58c84b2920","observation_id":"e3a74265-7d7d-4d62-b4b4-a1440a509201","resolution":{"observed_at":"2026-08-11T19:28:38.176724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:39.982942Z","title":"Learning multimodal behaviors from scratch with diffusion policy gradient","venue":null,"work_id":"0ea225be-8073-45e2-99c4-27b37158b091","year":2024},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.181708Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:7746770fff7c10caf82004dd7cf1b3ac66345f58447a9c1e1db5b8b8b2aa638e","observation_id":"b542df0b-9d74-405b-a4fb-5849c2da2e5d","resolution":{"observed_at":"2026-08-11T19:28:40.025368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-11T19:28:38.185750Z","title":"Continuous control with deep reinforcement learning.arXiv preprint arXiv:1509.02971, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.185750Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:cc9b0d56814a90553f9c5ed776385c20e00860d9c133f942065cd7c55150240d","observation_id":"6be748c2-c87b-41ba-a477-ed2861044d62","resolution":{"observed_at":"2026-08-11T19:28:38.185750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:39.850824Z","title":"Leveraging exploration in off-policy algorithms via normalizing flows","venue":null,"work_id":"b95f7fcb-6794-4a2d-ac6f-f1d04e4955c9","year":2020},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.190192Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:18d8d1378fa994dfc4f71c651613ebdafcf41b274915f2e9e822132a61522758","observation_id":"ccef55f1-8c98-40b7-8b32-6d2f4de27bbd","resolution":{"observed_at":"2026-08-11T19:28:39.915108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:38.194784Z","title":"Calvin: A benchmark for language-conditioned policy learning for long-horizon robot manipulation tasks.IEEE Robotics and Automation Letters (RA-L), 7(3):7327–7334, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.194784Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:d493dbf1a10727121bb42f681ab2ebefa632dd497537635a712ebdaf7974b5f1","observation_id":"f33dd6af-30ba-42af-b754-8a1c475586e0","resolution":{"observed_at":"2026-08-11T19:28:38.194784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-08-15T03:52:49.245753Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-11T19:28:38.198810Z","title":"Accelerating online reinforcement learning with offline datasets.arXiv preprint arXiv:2006.09359, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.198810Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:8f08c626605f331c8d357b4587ef33be705c9a4aa8c56357878f86f46f8a9c75","observation_id":"81a73538-74a0-4250-8201-8018fa5efa2e","resolution":{"observed_at":"2026-08-11T19:28:38.198810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:39.822588Z","title":"Steering your generalists: Improving robotic foundation models via value guidance.Conference on Robot Learning (CoRL), 2024","venue":null,"work_id":"e16b4164-8ee7-4fdf-8129-5f78f091a574","year":2024},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.203147Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:ad6816666d5eeb489e3a2126ceb3a90bfad8f2fd7189c8f7e5918e95adf8a279","observation_id":"8658d600-0fce-4e4f-9475-4523f84572db","resolution":{"observed_at":"2026-08-11T19:28:39.827158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:39.806286Z","title":"Cal-ql: Calibrated offline rl pre-training for efficient online fine-tuning","venue":null,"work_id":"84ed4156-e617-402f-93af-86e66a0b968b","year":2024},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.207403Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:722af635ecea7b5b91048fc9a5af348879fefc3120c0e2e823e556a9f16a4bac","observation_id":"e0c1692d-7dc3-4467-b535-c87bef76b780","resolution":{"observed_at":"2026-08-11T19:28:39.811700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:39.790062Z","title":"Greedy actor-critic: A new conditional cross-entropy method for policy improvement","venue":null,"work_id":"c0dfadc1-ae2d-4731-9f2e-4114f074ea36","year":null},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.212797Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:d9b86c8211b78cd938e32253260e4bc1aeb37fcdf20f04f2bbc4016716eaa6af","observation_id":"d113f657-f8b1-4641-86b1-34531597c672","resolution":{"observed_at":"2026-08-11T19:28:39.795425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:39.751706Z","title":"Self-imitation learning","venue":null,"work_id":"08c22e91-c508-4b6a-a05b-d551c6a28ea0","year":2018},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.217614Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:1768716a8cc3a2581a364a55c33c30183b15709908b0b707ab663af4c2cdc214","observation_id":"b2e2af66-2abf-4477-8231-f1dd1d53af56","resolution":{"observed_at":"2026-08-11T19:28:39.778973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09329","last_updated":"2024-10-28T23:33:19Z","snapshot_observed_at":"2026-08-16T13:43:14.794834Z","submitted_at":"2024-06-13T17:07:49Z","title":"Is Value Learning Really the Main Bottleneck in Offline RL?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09329","snapshot_observed_at":"2026-08-11T19:28:38.222122Z","title":"Is value learning really the main bottleneck in offline rl?arXiv preprint arXiv:2406.09329, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.222122Z"},"links":{"cited_paper":"/paper/2406.09329","citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:51e4dc2eb49b88370b1c4b24f64e801ba73dbfaa317082ed76b8338168338e52","observation_id":"081fa1d1-61be-4a29-b247-bedcb98d486d","resolution":{"observed_at":"2026-08-11T19:28:38.222122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-20T03:06:00.034814Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-11T19:28:38.226671Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning.arXiv preprint arXiv:1910.00177, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.226671Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:88f114088f95047ec2c4e5a810ee042dcec3d8ad5d546e0f80714fa0dd4662d8","observation_id":"5bc20772-9a24-4b5c-b8bd-184f68796180","resolution":{"observed_at":"2026-08-11T19:28:38.226671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:39.580557Z","title":"Peters and S","venue":null,"work_id":"3c038d25-b031-404b-98a3-f4e721180f67","year":2007},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.230916Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:efa3e5da4483af5e0094ec0617c3ba06fa01a091c2d20d394444e33db1f03618","observation_id":"1d9f211b-d82d-4b83-b548-731c999f232d","resolution":{"observed_at":"2026-08-11T19:28:39.647040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:39.561445Z","title":"Relative entropy policy search","venue":null,"work_id":"51ac22e5-cc15-44d6-9110-0abf98e98819","year":2010},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.235007Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:2f7f6511d16a41990fa9ae0ca59d5b54aee6df9b136e468e402091077cab9e6b","observation_id":"a24d8794-b64c-4072-ac60-d338d34c7b5f","resolution":{"observed_at":"2026-08-11T19:28:39.566816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:39.446132Z","title":"Learning a diffusion model policy from rewards via q-score matching","venue":null,"work_id":"97884e8a-5348-42bd-b1b8-bd78e4b8d041","year":null},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.239427Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:9a231c4292482ed7eb9bb236db142e46620631204683157f41ed9a27b27bfb75","observation_id":"baeddc20-2273-4533-9e6f-f4778a91a6f2","resolution":{"observed_at":"2026-08-11T19:28:39.550340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-11T19:28:38.244395Z","title":"Diffusion policy policy optimization.arXiv preprint arXiv:2409.00588, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.244395Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:7b5a24265fbd234667f5fab1dd99f388ae249836fa5433dace2542ac3fb5c985","observation_id":"56fe718b-1dd6-47f2-9a18-cc015507edaf","resolution":{"observed_at":"2026-08-11T19:28:38.244395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T19:28:38.249232Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.249232Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:45499b04336da315c9ccc80b50d43dc33513dbcb8c75c04b675ea418c30cc5ab","observation_id":"dc0a1f4b-0a67-4d01-a0b4-770a9365f531","resolution":{"observed_at":"2026-08-11T19:28:38.249232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:39.314472Z","title":"Grac: Self- guided and self-regularized actor-critic","venue":null,"work_id":"b5306b09-83a3-474c-9932-54a0be6aaacc","year":2022},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.257838Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:9eab011eefba85ad569f806473aa3b522fb7b0af3df402da81cdd93af5555dd8","observation_id":"79a038d1-d0e9-46fc-adb9-92ee0820caa6","resolution":{"observed_at":"2026-08-11T19:28:39.326396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:39.296301Z","title":"Skill-based model-based reinforcement learning","venue":null,"work_id":"8008080d-2050-4a50-8543-cd2d37518849","year":2023},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.332453Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:fbe4c5f8c2e30d245f9b709d3bffc3db7ec604c1f9e1d8d31b3d7a3465f36e29","observation_id":"221685e3-8468-4755-a020-05eddb470901","resolution":{"observed_at":"2026-08-11T19:28:39.302833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.10605","last_updated":"2019-07-01T21:03:09Z","snapshot_observed_at":"2026-08-14T16:56:57.508089Z","submitted_at":"2019-03-25T21:46:58Z","title":"Q-Learning for Continuous Actions with Cross-Entropy Guided Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.10605","snapshot_observed_at":"2026-08-11T19:28:38.396922Z","title":"Q-learning for continuous actions with cross-entropy guided policies.arXiv preprint arXiv:1903.10605, 2019","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.396922Z"},"links":{"cited_paper":"/paper/1903.10605","citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:45242d9cfa47f90485436b9194fcb6f2940e3f4f4981a67afc94eb8331ca0b76","observation_id":"d14fd665-77f4-409e-8587-75aaf4caee95","resolution":{"observed_at":"2026-08-11T19:28:38.396922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:39.279507Z","title":"Hybrid RL:UsingbothofflineandonlinedatacanmakeRLefficient","venue":null,"work_id":"b0dffd8b-317b-41d7-b167-a3183a3f3124","year":2023},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.459011Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:c56cc767fb755c0f2c4528d9d159ad4927c900780577df837dd936282ded0bd2","observation_id":"a22cd976-2b68-4d26-be2f-644f254f58bc","resolution":{"observed_at":"2026-08-11T19:28:39.284548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:38.501183Z","title":"Second edition, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.501183Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:3bbb9c73c34f41757ff6e853926f44275db8ad3da6d993675c314007d72b4f7c","observation_id":"24994787-2415-4d81-a67c-61527fce5091","resolution":{"observed_at":"2026-08-11T19:28:38.501183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:39.222029Z","title":"Preference fine-tuning of llms should leverage suboptimal, on-policy data","venue":null,"work_id":"4409b91b-bce6-4161-b8dc-247ea0fb0346","year":null},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.505556Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:462ee647a26096f617a4b78d2e73ce8c0bf6d50f6101506180cec8cdad1cba71","observation_id":"b74b0c52-2c29-4f23-813d-c70d0a960b5d","resolution":{"observed_at":"2026-08-11T19:28:39.256265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:38.510594Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.510594Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:785369dd6f7c3fda013950ca5f3dd92a88c54ca5e1319d2e02dfc1dcbc3302f4","observation_id":"ddd37579-adeb-407f-a972-a93d3dffe64c","resolution":{"observed_at":"2026-08-11T19:28:38.510594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:38.515332Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.515332Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:e4da1c0930603975ad43e0dd25356402804c82ac7b6b8513e98114ca7cebbe8e","observation_id":"0b474557-84da-40f9-a582-bb79fa41abf9","resolution":{"observed_at":"2026-08-11T19:28:38.515332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:38.519972Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.519972Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:a123f86278fd6fc60c37e41a3a1e62af9e3397d968518842e6fa9823ffbccc77","observation_id":"61a61b21-4098-445b-a622-ebf21a549ae2","resolution":{"observed_at":"2026-08-11T19:28:38.519972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:39.064613Z","title":"V-former: Offline RL with temporally-extended actions, 2024","venue":null,"work_id":"a9729977-26b8-4daf-90a0-a0351f164042","year":2024},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.524739Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:a2847f055168630aebc097a53960bef3bc5f6f64ebc682aae772befef89cbdaa","observation_id":"5ed0b98b-a5f9-42a4-a95c-3ce9e28b4a5f","resolution":{"observed_at":"2026-08-11T19:28:39.139198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:38.915312Z","title":"Q-learning decision transformer: Leveraging dynamic programming for conditional sequence modelling in offline rl","venue":null,"work_id":"cec309fb-c1e0-4ed2-9630-2a0271fed62a","year":2023},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.529793Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:952fc8b152c3bbe656322d2c81f227a99891a2fa2419ce35fe147f464582f2ad","observation_id":"3a02aeaf-8436-4d36-8fe7-741fe74598f3","resolution":{"observed_at":"2026-08-11T19:28:38.974717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13122","last_updated":"2023-05-22T15:23:41Z","snapshot_observed_at":"2026-08-16T15:31:03.272444Z","submitted_at":"2023-05-22T15:23:41Z","title":"Policy Representation via Diffusion Probability Model for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13122","snapshot_observed_at":"2026-08-11T19:28:38.534595Z","title":"Policy representation via diffusion probability model for reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.534595Z"},"links":{"cited_paper":"/paper/2305.13122","citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:59a33990652bba086382381517875ee1bfaf92f8cd4fd04674d2c4fe69ca9485","observation_id":"88d1e079-8e37-4248-a4c5-d907d1663a40","resolution":{"observed_at":"2026-08-11T19:28:38.534595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:38.898913Z","title":"Mastering visual continuous control: Improved data-augmented reinforcement learning","venue":null,"work_id":"a78ea211-0b06-4c9e-b1d1-e23902bb5879","year":null},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.539705Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:f18ce009afcb0118ad93586c52ee7dee50fea232bdda7f24152761e0ca43947e","observation_id":"98f2ede7-b571-46b7-9152-e41df897f2bd","resolution":{"observed_at":"2026-08-11T19:28:38.904003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:38.881546Z","title":"Autonomous improvement of instruction following skills via foundation models","venue":null,"work_id":"93e855bd-502a-4802-9557-b03a3fa8293c","year":null},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.544436Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:41f87f0564b1bce4c914363284f9e66532798c4882530b4c98e7b59f82edc917","observation_id":"739b6e11-9382-4951-b6b5-b9243dde2068","resolution":{"observed_at":"2026-08-11T19:28:38.887226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:28:38.863615Z","title":"-v0” antmaze datasets from D4RL, but Fu et al.[9] deprecated the “-v0","venue":null,"work_id":"d9424d36-3e5e-4829-aa29-466878df7a59","year":2023},"citing_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T19:28:38.548957Z"},"links":{"citing_paper":"/paper/2412.06685"},"observation_digest":"sha256:4a7c91598cc938afc5090e3ba5e8740ff6ffcf9feaf23bd6f0185f748c50c0d7","observation_id":"d7aaaa09-ce8a-477e-8bb3-68901f58d8f2","resolution":{"observed_at":"2026-08-11T19:28:38.870057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T10:37:46.190216Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 31 inbound Pith citation observations for arXiv:2412.06685."}