{"as_of":"2026-08-23T11:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:93b49423d1fb029b9a82dbb1a4669f4b7b2901ff2b5eb163ddb7c6a2054389e8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:22:49.650714Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T10:58:02.715158Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2311.02198","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-07-03T10:58:02.715158Z","title":"Imitation bootstrapped reinforcement learn- ing.arXiv preprint arXiv:2311.02198","venue":null,"work_id":"a3617785-a57a-4ba3-af3b-a179f510bfea","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:6353cfa91d68fc0d32f157007f31bd11e738a110b0eb313f4c7f5a1507e9e498","observation_id":"e2f0e55a-ef98-4bc1-841c-b4476a8e8720","resolution":{"observed_at":"2026-05-16T08:48:14.893529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-08-12T11:52:46.600129Z","title":"Imitation bootstrapped reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-21T15:04:33.061340Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.600129Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:ab45ba202d14b0e6b805724dce86de6dc98120d0e46905bcf95d80803ecbdbdc","observation_id":"a537d976-ec31-47ec-a8b5-e08437152fc5","resolution":{"observed_at":"2026-08-12T11:52:46.600129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-08-12T11:06:12.881068Z","title":"Imi- tation bootstrapped reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18623","last_updated":"2024-12-14T18:38:03Z","snapshot_observed_at":"2026-08-17T15:33:20.353144Z","submitted_at":"2024-11-27T18:59:52Z","title":"Lift3D Foundation Policy: Lifting 2D Large-Scale Pretrained Models for Robust 3D Robotic Manipulation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:06:12.881068Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2411.18623"},"observation_digest":"sha256:033b89db0be52376486262c5bdb86b6d0cb4e78839ef3ecc4cddcc41cd975fc2","observation_id":"3cf8627a-3638-4ea8-8eb6-cc6aca7ac105","resolution":{"observed_at":"2026-08-12T11:06:12.881068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-08-11T18:35:00.750603Z","title":"Imitation bootstrapped reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-08-15T22:17:56.518829Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:00.750603Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2412.07762"},"observation_digest":"sha256:6f3d4f0e42b442e608fad47700177901c5ff06da430bdbf8c6e89142f086b00b","observation_id":"111cb770-e039-4064-8b19-a495708468b8","resolution":{"observed_at":"2026-08-11T18:35:00.750603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-08-11T16:45:08.226530Z","title":"Imitation bootstrapped reinforcement learning, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09858","last_updated":"2024-12-13T04:57:55Z","snapshot_observed_at":"2026-08-15T17:49:17.818572Z","submitted_at":"2024-12-13T04:57:55Z","title":"RLDG: Robotic Generalist Policy Distillation via Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:08.226530Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2412.09858"},"observation_digest":"sha256:66cee6b0ba966492063036956ee7638db15c8469fa93fdba0d497b90b00c0fba","observation_id":"0dc69b3c-bd94-44e2-bfb6-9bc071348992","resolution":{"observed_at":"2026-08-11T16:45:08.226530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-08-09T11:31:10.676629Z","title":"Imitation bootstrapped reinforcement learn- ing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-17T19:59:44.269774Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.676629Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:908feb6e8258a8ff5a125eaed504d33a2c081a8e40e3e6609a4158a4597e72ad","observation_id":"abd4174c-d514-4e8b-9ee8-4ab1c9174b25","resolution":{"observed_at":"2026-08-09T11:31:10.676629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-08-15T23:29:32.171148Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04619","last_updated":"2025-08-29T14:54:30Z","snapshot_observed_at":"2026-08-17T21:33:27.152159Z","submitted_at":"2025-05-07T17:59:28Z","title":"Merging and Disentangling Views in Visual Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T23:29:32.171148Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2505.04619"},"observation_digest":"sha256:8fede10c029a243411ff1d62ccc47198dfcd40cce58b538b17b06bfcc0e43f77","observation_id":"1514737c-eb75-48f4-9b1b-f28f1245b9dc","resolution":{"observed_at":"2026-08-15T23:29:32.171148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2311.02198","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-07-03T10:58:02.715158Z","title":"Imitation bootstrapped reinforcement learn- ing.arXiv preprint arXiv:2311.02198","venue":null,"work_id":"a3617785-a57a-4ba3-af3b-a179f510bfea","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-08-14T01:02:35.686274Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:10a1d18c3391498b4fb9b4f8bf317846601ce1dbfc623866e0f4fbb5f7e3afed","observation_id":"339b6e10-176d-4ec9-9ae2-d97fa84c9ee7","resolution":{"observed_at":"2026-05-16T12:55:40.322580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-08-07T05:37:46.332349Z","title":"Imitation bootstrapped reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.332349Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:e17ea2b993cc914c8733a6eb8bab75361a26a28b0f6cdb33b8338e9967d9b069","observation_id":"532c19c2-6b0f-4037-997e-8780c6c955fc","resolution":{"observed_at":"2026-08-07T05:37:46.332349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-08-06T19:53:06.280385Z","title":"Imitation bootstrapped reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04452","last_updated":"2025-07-06T16:18:40Z","snapshot_observed_at":"2026-08-17T08:27:08.862765Z","submitted_at":"2025-07-06T16:18:40Z","title":"SimLauncher: Launching Sample-Efficient Real-world Robotic Reinforcement Learning via Simulation Pre-training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:53:06.280385Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2507.04452"},"observation_digest":"sha256:6ff5cac52990e25f4c9721898156df05c64aff86677cb73c9c048506127c6846","observation_id":"f53a35b4-2377-4b1f-95e9-43b7c0f7c9be","resolution":{"observed_at":"2026-08-06T19:53:06.280385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2311.02198","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-07-03T10:58:02.715158Z","title":"Imitation bootstrapped reinforcement learn- ing.arXiv preprint arXiv:2311.02198","venue":null,"work_id":"a3617785-a57a-4ba3-af3b-a179f510bfea","year":2023},"citing_paper":{"arxiv_id":"2509.16615","last_updated":"2026-04-14T09:38:30Z","snapshot_observed_at":"2026-08-15T00:04:12.858839Z","submitted_at":"2025-09-20T10:37:47Z","title":"LLM-Guided Task- and Affordance-Level Exploration in Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T15:19:30.609974Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2509.16615"},"observation_digest":"sha256:e19f026021cb9a9a6f564ee0bcd7988b5be0dc04fc4fc14c5b3917ba374d11c7","observation_id":"b9070ff3-c6e0-4ae7-87e4-127e0e14fd68","resolution":{"observed_at":"2026-05-18T15:21:32.918278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2311.02198","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-07-03T10:58:02.715158Z","title":"Imitation bootstrapped reinforcement learn- ing.arXiv preprint arXiv:2311.02198","venue":null,"work_id":"a3617785-a57a-4ba3-af3b-a179f510bfea","year":2023},"citing_paper":{"arxiv_id":"2510.04280","last_updated":"2026-05-20T20:46:35Z","snapshot_observed_at":"2026-08-14T13:28:15.620632Z","submitted_at":"2025-10-05T16:45:38Z","title":"A KL-regularization Framework for Learning to Plan with Adaptive Priors","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T13:24:41.791067Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2510.04280"},"observation_digest":"sha256:300118f28bfd5eeed496b8d62497d5bf50b680d10df652bdc6ee29d13455128a","observation_id":"d7d1aa64-5345-4c47-b20f-b200552b5bf9","resolution":{"observed_at":"2026-05-22T13:24:53.179560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2311.02198","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-07-03T10:58:02.715158Z","title":"Imitation bootstrapped reinforcement learn- ing.arXiv preprint arXiv:2311.02198","venue":null,"work_id":"a3617785-a57a-4ba3-af3b-a179f510bfea","year":2023},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T03:36:09.272019Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:38d2b76b78921949258fd37f11ddd9d3f56fb97ab3e57956e8dcf404d2a4dfa8","observation_id":"d648f7f7-a01e-4dba-91f0-eff6c569bcae","resolution":{"observed_at":"2026-05-16T03:37:13.937215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-08-03T02:53:15.824747Z","title":"Imitation bootstrapped reinforcement learning.arXiv preprint arXiv:2311.02198, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-14T03:44:45.711934Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:15.824747Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:b9572daa9c3d8038836454b930dc8e0973fddcdf793ab384adcd3201ec3a1f51","observation_id":"91e03d56-ccaa-484a-b157-72e9ca970545","resolution":{"observed_at":"2026-08-03T02:53:15.824747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-07-14T23:46:32.301737Z","title":"Imitation bootstrapped reinforcement learning.arXiv preprint arXiv:2311.02198,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.10263","last_updated":"2026-07-01T06:52:08Z","snapshot_observed_at":"2026-08-17T21:12:13.397798Z","submitted_at":"2026-03-10T22:49:46Z","title":"From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T23:46:32.301737Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2603.10263"},"observation_digest":"sha256:8d80eaf8a555a1f035470fcca40ef02ec69365e57817cd9fdf03eb898c087f8d","observation_id":"b7222a38-b5d0-4a80-96a8-d807dbd9c16b","resolution":{"observed_at":"2026-07-14T23:46:32.301737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2311.02198","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-07-03T10:58:02.715158Z","title":"Imitation bootstrapped reinforcement learn- ing.arXiv preprint arXiv:2311.02198","venue":null,"work_id":"a3617785-a57a-4ba3-af3b-a179f510bfea","year":2023},"citing_paper":{"arxiv_id":"2605.11387","last_updated":"2026-05-12T01:19:09Z","snapshot_observed_at":"2026-08-15T08:22:39.131219Z","submitted_at":"2026-05-12T01:19:09Z","title":"Behavioral Mode Discovery for Fine-tuning Multimodal Generative Policies","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-13T02:16:53.951387Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2605.11387"},"observation_digest":"sha256:c27117831abd27ffb11666d0916aa29be183ea1d3a2c54acbd7e950264775dd0","observation_id":"d6a6fe9f-1b75-483a-a327-c51717606c98","resolution":{"observed_at":"2026-05-13T02:17:06.066093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2311.02198","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-07-03T10:58:02.715158Z","title":"Imitation bootstrapped reinforcement learn- ing.arXiv preprint arXiv:2311.02198","venue":null,"work_id":"a3617785-a57a-4ba3-af3b-a179f510bfea","year":2023},"citing_paper":{"arxiv_id":"2606.10305","last_updated":"2026-06-09T01:46:23Z","snapshot_observed_at":"2026-08-21T11:11:39.157186Z","submitted_at":"2026-06-09T01:46:23Z","title":"SARM2: Multi-Task Stage Aware Reward Modeling for Self Improving Robotic Manipulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T13:23:42.517779Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2606.10305"},"observation_digest":"sha256:50346feffe5fc44409ef599115eb9707ed0ddcfb29fe65e9be423c21d04155a1","observation_id":"8fcaf121-ddac-49bc-994c-ada13c838715","resolution":{"observed_at":"2026-07-03T05:07:39.404633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2311.02198","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-07-03T10:58:02.715158Z","title":"Imitation bootstrapped reinforcement learn- ing.arXiv preprint arXiv:2311.02198","venue":null,"work_id":"a3617785-a57a-4ba3-af3b-a179f510bfea","year":2023},"citing_paper":{"arxiv_id":"2606.12372","last_updated":"2026-06-10T17:38:24Z","snapshot_observed_at":"2026-08-17T00:56:17.136169Z","submitted_at":"2026-06-10T17:38:24Z","title":"UniIntervene: Agentic Intervention for Efficient Real-World Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T09:46:59.746745Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2606.12372"},"observation_digest":"sha256:7dda3c08fcb537241ea62db0f8c49fa79d85ee5ac141dabb60fbd25a37f01725","observation_id":"3913cbef-23f5-4d47-9b38-959db6257d77","resolution":{"observed_at":"2026-07-03T10:58:02.716671Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-07-30T11:06:22.667880Z","title":"Imitation bootstrapped reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-19T15:53:26.918304Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-30T11:06:22.667880Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:d93d9bc7800ad5f5314dbb3ef3c8ad96e07ce787cd7e178aee7090313619aea8","observation_id":"e8fe6da0-3bfe-4e77-89bc-446770c11f6c","resolution":{"observed_at":"2026-07-30T11:06:22.667880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-08-05T04:27:44.027011Z","title":"arXiv preprint arXiv:2311.02198 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-19T15:53:26.918304Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:44.027011Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:4d8eec12f445b842823efe1e4889e320134a41398235edec949bfa99e1a5726b","observation_id":"47dd6549-d3ae-4431-af91-e43b699b93cc","resolution":{"observed_at":"2026-08-05T04:27:44.027011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-08-15T14:18:48.327281Z","title":"Imitation bootstrapped reinforcement learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11363","last_updated":"2026-08-11T19:15:26Z","snapshot_observed_at":"2026-08-19T01:26:06.327392Z","submitted_at":"2026-08-11T19:15:26Z","title":"Adaptation of Generalist Robot Policies with Minimal Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T14:18:48.327281Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2608.11363"},"observation_digest":"sha256:5792eff86924ba2b5be83c2882caa16b860fbb012dc0b47ba8e05f20abda685a","observation_id":"11549360-2aaa-4b05-9814-b85366f6f68e","resolution":{"observed_at":"2026-08-15T14:18:48.327281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-08-16T00:22:49.650714Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12063","last_updated":"2026-08-12T13:48:56Z","snapshot_observed_at":"2026-08-20T23:10:03.710597Z","submitted_at":"2026-08-12T13:48:56Z","title":"Learning Loco-Manipulation From SMPC Demonstrations With Sparse Offline-to-Online RL","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:22:49.650714Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2608.12063"},"observation_digest":"sha256:9a20384674b3ba4f313dae65cb9a5a58127ddb49972688e2d0dbf3230ae98f8f","observation_id":"28489720-f5ca-4c11-92ef-ba55cfc31bec","resolution":{"observed_at":"2026-08-16T00:22:49.650714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.02198/citation-record","integrity":"/paper/2311.02198/integrity","json":"/paper/2311.02198/citation-record.json","paper":"/paper/2311.02198"},"outbound":[],"paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","latest_version":6,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T00:04:57.166891Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 22 inbound Pith citation observations for arXiv:2311.02198."}