{"as_of":"2026-08-23T17:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:74cc3eeece35c9fb49a664e13cb575992574fbe95b77008323aef7e932140217","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T13:01:25.366899Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:24:21.470866Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:29:45.616079Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-08-16T04:24:21.470866Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-19T15:18:17.599907Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.470866Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:b44b4e197b593e9e4b084a66b84fb52ad304a7d291766655c91a820b2da3ae8e","observation_id":"a35557b9-47ce-4cc4-95b6-172f129c4be9","resolution":{"observed_at":"2026-08-16T04:24:21.470866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-08-07T14:57:46.019748Z","title":"Policy decorator: Model-agnostic online refinement for large policy model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-15T11:19:22.435254Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:46.019748Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:32c63b760ca89df2555e3393d6d6612b8f35584856fc79e19b6acec79b3802c3","observation_id":"1db2435d-d8c6-4259-8446-4e8bf1354ca8","resolution":{"observed_at":"2026-08-07T14:57:46.019748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-08-07T00:31:46.173598Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13762","last_updated":"2025-06-16T17:59:48Z","snapshot_observed_at":"2026-08-19T22:31:30.924200Z","submitted_at":"2025-06-16T17:59:48Z","title":"Touch begins where vision ends: Generalizable policies for contact-rich manipulation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:46.173598Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2506.13762"},"observation_digest":"sha256:eed04a517ae1943a122e0b7013d92e1b3c69968dcf8ac465df39e0ff27751f1c","observation_id":"4aceb5ec-e8d9-41e4-afe3-81d0909dd872","resolution":{"observed_at":"2026-08-07T00:31:46.173598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":"2412.13630","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-07-04T10:29:45.616079Z","title":"Policy decorator: Model- agnostic online refinement for large policy model","venue":null,"work_id":"6481a773-21bb-487b-bad8-5c6d5af9cd6c","year":2024},"citing_paper":{"arxiv_id":"2506.15799","last_updated":"2025-06-25T19:09:52Z","snapshot_observed_at":"2026-08-08T08:13:32.220639Z","submitted_at":"2025-06-18T18:35:57Z","title":"Steering Your Diffusion Policy with Latent Space Reinforcement Learning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-17T21:55:46.183007Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2506.15799"},"observation_digest":"sha256:242ae9d8be47c4bb028d6d8fa0b4e1492edc7f9af69b96ba437259e1f43606d7","observation_id":"ede22336-157c-43da-ab6b-86a9365cee86","resolution":{"observed_at":"2026-05-17T21:55:46.247634Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":"2412.13630","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-07-04T10:29:45.616079Z","title":"Policy decorator: Model- agnostic online refinement for large policy model","venue":null,"work_id":"6481a773-21bb-487b-bad8-5c6d5af9cd6c","year":2024},"citing_paper":{"arxiv_id":"2507.07986","last_updated":"2026-04-30T00:00:17Z","snapshot_observed_at":"2026-08-21T14:27:55.752123Z","submitted_at":"2025-07-10T17:57:46Z","title":"EXPO: Stable Reinforcement Learning with Expressive Policies","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T05:09:02.111308Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2507.07986"},"observation_digest":"sha256:48056e14464617a56f86022d04bdb4d93fb1c6c6a6f131c52c2419324ff991e8","observation_id":"bfebf9bf-9bf3-40e5-8603-09c727963f92","resolution":{"observed_at":"2026-05-19T05:12:05.263582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-08-15T17:08:57.846352Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17547","last_updated":"2025-08-24T22:57:16Z","snapshot_observed_at":"2026-08-19T12:20:58.196512Z","submitted_at":"2025-08-24T22:57:16Z","title":"LodeStar: Long-horizon Dexterity via Synthetic Data Augmentation from Human Demonstrations","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-08-15T17:08:57.846352Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2508.17547"},"observation_digest":"sha256:1b7ac3538e8883fd42007185435d0cc1c6cffde4b414b4b79d112534a09ab82b","observation_id":"b73fdf97-579e-41e0-b234-a2c896b84743","resolution":{"observed_at":"2026-08-15T17:08:57.846352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":"2412.13630","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-07-04T10:29:45.616079Z","title":"Policy decorator: Model- agnostic online refinement for large policy model","venue":null,"work_id":"6481a773-21bb-487b-bad8-5c6d5af9cd6c","year":2024},"citing_paper":{"arxiv_id":"2602.10503","last_updated":"2026-05-16T03:35:21Z","snapshot_observed_at":"2026-08-14T23:33:19.116704Z","submitted_at":"2026-02-11T04:05:03Z","title":"Towards Long-Lived Robots: Continual Learning VLA Models via Reinforcement Fine-Tuning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-21T14:07:10.387869Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2602.10503"},"observation_digest":"sha256:7a8d7d57b118e047545aafa14d09865d5ef008caa305ceeda3c3084755999a29","observation_id":"12f079ee-6bef-46af-9d90-a8879cac7c7f","resolution":{"observed_at":"2026-05-21T14:10:13.387889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-07-14T23:46:32.301737Z","title":"Policy decorator: Model-agnostic online refinement for large policy model.arXiv preprint arXiv:2412.13630,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.10263","last_updated":"2026-07-01T06:52:08Z","snapshot_observed_at":"2026-08-17T21:12:13.397798Z","submitted_at":"2026-03-10T22:49:46Z","title":"From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T23:46:32.301737Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2603.10263"},"observation_digest":"sha256:1af6c313421f5c25b80446ba7a9ed3514f2b7c52f48889dced1c2f91161525fa","observation_id":"830346d9-43bd-4595-9c0a-22f5a4151a38","resolution":{"observed_at":"2026-07-14T23:46:32.301737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":"2412.13630","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-07-04T10:29:45.616079Z","title":"Policy decorator: Model- agnostic online refinement for large policy model","venue":null,"work_id":"6481a773-21bb-487b-bad8-5c6d5af9cd6c","year":2024},"citing_paper":{"arxiv_id":"2603.15956","last_updated":"2026-04-20T19:05:45Z","snapshot_observed_at":"2026-08-11T00:29:57.012238Z","submitted_at":"2026-03-16T22:12:48Z","title":"ExpertGen: Scalable Sim-to-Real Expert Policy Learning from Imperfect Behavior Priors","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T09:37:02.168898Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2603.15956"},"observation_digest":"sha256:84dcca502b41a367a0a624cbce7fd15019de4f0df5bc0ff276c1d7a8717df4aa","observation_id":"ddd1c633-f0b9-4142-87b2-06ffe2c4c6ea","resolution":{"observed_at":"2026-05-15T09:39:55.156113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":"2412.13630","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-07-04T10:29:45.616079Z","title":"Policy decorator: Model- agnostic online refinement for large policy model","venue":null,"work_id":"6481a773-21bb-487b-bad8-5c6d5af9cd6c","year":2024},"citing_paper":{"arxiv_id":"2604.17919","last_updated":"2026-05-05T15:00:45Z","snapshot_observed_at":"2026-08-16T19:02:26.124091Z","submitted_at":"2026-04-20T07:54:36Z","title":"Fisher Decorator: Refining Flow Policy via a Local Transport Map","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T05:28:12.298066Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2604.17919"},"observation_digest":"sha256:7b5efec6d9909907f78399d5117c03523bf103f94428dcad693d6f15f487a351","observation_id":"68f58fec-9dc3-4c2f-a0c0-32a3bc0c5986","resolution":{"observed_at":"2026-05-10T06:51:46.620645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":"2412.13630","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-07-04T10:29:45.616079Z","title":"Policy decorator: Model- agnostic online refinement for large policy model","venue":null,"work_id":"6481a773-21bb-487b-bad8-5c6d5af9cd6c","year":2024},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-11T00:21:19.709120Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-08T16:34:18.603134Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:97483db4d77b9d77f57d34944f60c5ced80a023f4a05928c3737d6ef9fe0c435","observation_id":"0d782675-0f10-46d3-97e8-d1ebc68790f4","resolution":{"observed_at":"2026-05-11T18:11:05.045910Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":"2412.13630","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-07-04T10:29:45.616079Z","title":"Policy decorator: Model- agnostic online refinement for large policy model","venue":null,"work_id":"6481a773-21bb-487b-bad8-5c6d5af9cd6c","year":2024},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-11T00:21:19.709120Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:2865ace52cf4b5c02563c0d2a50aabe65164cb1a01b62afd1db799c4fb8db29c","observation_id":"361f3720-953c-4b56-907f-ef6db5555a0c","resolution":{"observed_at":"2026-06-30T23:25:07.000747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":"2412.13630","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-07-04T10:29:45.616079Z","title":"Policy decorator: Model- agnostic online refinement for large policy model","venue":null,"work_id":"6481a773-21bb-487b-bad8-5c6d5af9cd6c","year":2024},"citing_paper":{"arxiv_id":"2605.17486","last_updated":"2026-05-17T14:55:32Z","snapshot_observed_at":"2026-08-15T18:22:20.754813Z","submitted_at":"2026-05-17T14:55:32Z","title":"DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization","version":1},"reference_index":187,"source":"arxiv_source","source_observed_at":"2026-05-20T12:39:50.004269Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2605.17486"},"observation_digest":"sha256:6ad69085af160fa5dd1fed8f728ce1a92ee11c228364d4b8079e813ac00966dc","observation_id":"ef78a9ee-5492-475d-b983-a820646fe8ec","resolution":{"observed_at":"2026-05-20T12:43:17.324262Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":"2412.13630","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-07-04T10:29:45.616079Z","title":"Policy decorator: Model- agnostic online refinement for large policy model","venue":null,"work_id":"6481a773-21bb-487b-bad8-5c6d5af9cd6c","year":2024},"citing_paper":{"arxiv_id":"2606.00269","last_updated":"2026-05-29T18:59:53Z","snapshot_observed_at":"2026-08-07T05:42:13.073316Z","submitted_at":"2026-05-29T18:59:53Z","title":"Closed-Loop Neural Activation Control in Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T22:23:32.953232Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2606.00269"},"observation_digest":"sha256:d73c4886dd15d33fca7451f1984e3161782c569cae213db198a90d08bc43d74e","observation_id":"2f923d3a-0bf9-44d4-a8a3-6771421ce4cc","resolution":{"observed_at":"2026-07-01T19:36:08.209066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":"2412.13630","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-07-04T10:29:45.616079Z","title":"Policy decorator: Model- agnostic online refinement for large policy model","venue":null,"work_id":"6481a773-21bb-487b-bad8-5c6d5af9cd6c","year":2024},"citing_paper":{"arxiv_id":"2606.03385","last_updated":"2026-06-02T09:29:03Z","snapshot_observed_at":"2026-08-14T02:59:37.231666Z","submitted_at":"2026-06-02T09:29:03Z","title":"Grasp-Then-Plan with Failure Attribution: A Closed Two-Stage Framework for Precise and Generalizable Robotic Manipulation","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-06-28T09:37:58.434897Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2606.03385"},"observation_digest":"sha256:da9672d9c961f37dcd3d5b741840cef658dbea32fe13127b8927681cc88d3e87","observation_id":"e8c970f3-c9b0-4aa7-9a49-d86c4558e8ee","resolution":{"observed_at":"2026-07-02T03:56:34.486703Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":"2412.13630","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-07-04T10:29:45.616079Z","title":"Policy decorator: Model- agnostic online refinement for large policy model","venue":null,"work_id":"6481a773-21bb-487b-bad8-5c6d5af9cd6c","year":2024},"citing_paper":{"arxiv_id":"2606.06461","last_updated":"2026-06-04T17:51:12Z","snapshot_observed_at":"2026-08-15T13:49:27.502367Z","submitted_at":"2026-06-04T17:51:12Z","title":"Flow-based Policy Adaptation without Policy Updates","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T01:18:08.001674Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2606.06461"},"observation_digest":"sha256:ef4f8dca3ac0c98f0c6eb0e6d3e528a812937426f680e9945e585ff0da8b8f99","observation_id":"27786b88-2395-4034-a4a5-3b442a5e6a2a","resolution":{"observed_at":"2026-07-02T13:26:59.178158Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":"2412.13630","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-07-04T10:29:45.616079Z","title":"Policy decorator: Model- agnostic online refinement for large policy model","venue":null,"work_id":"6481a773-21bb-487b-bad8-5c6d5af9cd6c","year":2024},"citing_paper":{"arxiv_id":"2606.09630","last_updated":"2026-06-08T15:29:09Z","snapshot_observed_at":"2026-07-06T23:48:58.206424Z","submitted_at":"2026-06-08T15:29:09Z","title":"ReCoVLA: VLM-Guided Reward Compilation for Failure Recovery in Vision-Language-Action Policies","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T16:42:30.970472Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2606.09630"},"observation_digest":"sha256:2e7db90a2be19b7439a05a70358ad3e4eaec4b46739ca2eea61111bb32cf3238","observation_id":"c2759d66-e6e2-41af-8b2a-4f227c3a8fd0","resolution":{"observed_at":"2026-07-03T01:17:30.813776Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":"2412.13630","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-07-04T10:29:45.616079Z","title":"Policy decorator: Model- agnostic online refinement for large policy model","venue":null,"work_id":"6481a773-21bb-487b-bad8-5c6d5af9cd6c","year":2024},"citing_paper":{"arxiv_id":"2606.10825","last_updated":"2026-06-09T13:09:21Z","snapshot_observed_at":"2026-07-06T23:49:56.404171Z","submitted_at":"2026-06-09T13:09:21Z","title":"MODIP: Efficient Model-Based Optimization for Diffusion Policies","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-27T13:44:19.708550Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2606.10825"},"observation_digest":"sha256:5367539448bedfb1da426c2f47dceedb92af492f108217e475f35181622ca30b","observation_id":"76b6f7e1-9290-471f-bdb8-8ec433e0de47","resolution":{"observed_at":"2026-07-03T04:37:37.581918Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":"2412.13630","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-07-04T10:29:45.616079Z","title":"Policy decorator: Model- agnostic online refinement for large policy model","venue":null,"work_id":"6481a773-21bb-487b-bad8-5c6d5af9cd6c","year":2024},"citing_paper":{"arxiv_id":"2606.22860","last_updated":"2026-06-22T05:07:08Z","snapshot_observed_at":"2026-08-15T11:38:28.620103Z","submitted_at":"2026-06-22T05:07:08Z","title":"HiL-ResRL: A Model-Agnostic Finetuning Adapter via Human-in-the-loop Residual Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T08:45:04.483217Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2606.22860"},"observation_digest":"sha256:27a417fa41a46ac6cd35890938027423eb15ac02a437d6c4f49039b2bb7ff08d","observation_id":"b86085e0-62ed-4183-b92e-aab854cfc8c4","resolution":{"observed_at":"2026-07-04T10:29:45.617889Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":"2412.13630","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-07-04T10:29:45.616079Z","title":"Policy decorator: Model- agnostic online refinement for large policy model","venue":null,"work_id":"6481a773-21bb-487b-bad8-5c6d5af9cd6c","year":2024},"citing_paper":{"arxiv_id":"2606.23640","last_updated":"2026-06-22T17:30:24Z","snapshot_observed_at":"2026-08-02T09:22:48.099895Z","submitted_at":"2026-06-22T17:30:24Z","title":"Learning Process Rewards via Success Visitation Matching for Efficient RL","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-26T09:20:35.062060Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2606.23640"},"observation_digest":"sha256:766d1d3e0271fa092cb3841638a38bc53f40da412a4c60981fa2753f4f7873da","observation_id":"bc1f47b7-549c-45f0-8083-09dd79928b23","resolution":{"observed_at":"2026-07-04T09:59:44.575789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":"2412.13630","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-07-04T10:29:45.616079Z","title":"Policy decorator: Model- agnostic online refinement for large policy model","venue":null,"work_id":"6481a773-21bb-487b-bad8-5c6d5af9cd6c","year":2024},"citing_paper":{"arxiv_id":"2606.31958","last_updated":"2026-06-30T17:00:33Z","snapshot_observed_at":"2026-07-07T00:05:37.068846Z","submitted_at":"2026-06-30T17:00:33Z","title":"Adapting Generalist Robot Policies with Semantic Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-01T05:09:29.625066Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2606.31958"},"observation_digest":"sha256:c85d4561a89bfbb67d0c780d91b419291bb4964cfa052fe5559a012a5aa07819","observation_id":"40375bd5-b6b6-4e05-b9bb-b5d83c2a812b","resolution":{"observed_at":"2026-07-01T10:45:42.679466Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:3ff5ed7b68412704223c81cb959b630277b243360364396ccc86130e8be88af6","observation_id":"dd34a979-2de1-4501-af9e-250173936c66","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.13630/citation-record","integrity":"/paper/2412.13630/integrity","json":"/paper/2412.13630/citation-record.json","paper":"/paper/2412.13630"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:01:25.551671Z","title":"Such a noisy gradient can easily cause the policy to deviate significantly from the initial weights","venue":null,"work_id":"17c24eb6-2c27-4738-911f-bd5d977f9506","year":2024},"citing_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T13:01:25.316791Z"},"links":{"citing_paper":"/paper/2412.13630"},"observation_digest":"sha256:b866beda950d0f076dffac7c1620b7ebab90e26409dec1ac958960a1ebc5618a","observation_id":"84083f53-db9e-4e1e-87d2-aefc233d3208","resolution":{"observed_at":"2026-08-11T13:01:25.556226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:01:25.540694Z","title":"As the task horizon increases, the agent’s likelihood of discovering sparse rewards through random exploration diminishes","venue":null,"work_id":"c4c01e22-98b1-40aa-afa5-54a9dbfeb2d3","year":2024},"citing_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T13:01:25.321009Z"},"links":{"citing_paper":"/paper/2412.13630"},"observation_digest":"sha256:dd71a23d013165b1d4a4c4cb52a1bb063e2fdeef4c07853658107fe222afccca","observation_id":"07fda337-93dc-4ebf-a97f-63d872366498","resolution":{"observed_at":"2026-08-11T13:01:25.544744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:01:25.505677Z","title":null,"venue":null,"work_id":"1426dcca-e251-4efc-90f8-31494019cd5d","year":null},"citing_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T13:01:25.334021Z"},"links":{"citing_paper":"/paper/2412.13630"},"observation_digest":"sha256:a48ab5ea3672d9044165c3112668d5d75d8c896eeb1e3f32fb6490f78c080e74","observation_id":"c23fbfca-699f-4f31-96da-4d0a6c6e8fec","resolution":{"observed_at":"2026-08-11T13:01:25.509718Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:01:25.528972Z","title":"Our Cal-QL baseline uses only 25 human demonstrations, ensuring fair comparison with other learning-from-demo baselines that only utilize demonstrations","venue":null,"work_id":"80404784-4023-4e37-b412-6c270bc16828","year":null},"citing_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T13:01:25.325417Z"},"links":{"citing_paper":"/paper/2412.13630"},"observation_digest":"sha256:19732af2e88d6c3429f9389eb0f33645b9da4b7b56736ca14bfe51fc6405404f","observation_id":"a6712a2a-97b4-438c-8f69-cd22fad55102","resolution":{"observed_at":"2026-08-11T13:01:25.533220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:01:25.517281Z","title":null,"venue":null,"work_id":"92c2cd59-387a-486d-a6f5-98fa333bc6fd","year":null},"citing_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T13:01:25.329864Z"},"links":{"citing_paper":"/paper/2412.13630"},"observation_digest":"sha256:51cee7a70bd2fb15bf58991fac1ced227c08f62231e488a2cfc0b77d44e83926","observation_id":"fdfa53e9-1a87-4791-a72c-ae7b238f8d5c","resolution":{"observed_at":"2026-08-11T13:01:25.520845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:01:25.494650Z","title":null,"venue":null,"work_id":"84babef3-0cab-4ecc-9098-b52beae19c7e","year":null},"citing_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T13:01:25.338149Z"},"links":{"citing_paper":"/paper/2412.13630"},"observation_digest":"sha256:ebc9d3defab22e78c62e8f6fd953a62aea3885c7bc006d230e63761c19308837","observation_id":"e603f9ed-1b35-4443-b97d-5e6837ac14a3","resolution":{"observed_at":"2026-08-11T13:01:25.498335Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:01:25.482917Z","title":null,"venue":null,"work_id":"b9a9cfe5-eab1-4b1b-8822-227ec69a1a97","year":null},"citing_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T13:01:25.342115Z"},"links":{"citing_paper":"/paper/2412.13630"},"observation_digest":"sha256:46a30e77f2800f163a204cd5a915728ca3059a82de49950fb1bf79b561c4c961","observation_id":"80f5c9d8-65f6-4c84-8583-5d73d4f75a7f","resolution":{"observed_at":"2026-08-11T13:01:25.486593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:01:25.470902Z","title":"24, we experimented with all the aforementioned Q-function architectures in SAC fine-tuning experiments","venue":null,"work_id":"9014d8f5-dfe5-4e03-95fe-cc7ba3a9671b","year":null},"citing_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T13:01:25.346157Z"},"links":{"citing_paper":"/paper/2412.13630"},"observation_digest":"sha256:c483e82585c73e960d16afa1c8b58244842518611b4c941448987cb91c390200","observation_id":"70b70686-dc1a-46bc-8204-659a2df0a51d","resolution":{"observed_at":"2026-08-11T13:01:25.475035Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:01:25.458278Z","title":"These deviations prevent the agent from receiving success signals necessary for guiding learning (see this video for an example)","venue":null,"work_id":"dd6d02b1-f36a-4c4c-bd9d-19509718743d","year":null},"citing_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T13:01:25.350840Z"},"links":{"citing_paper":"/paper/2412.13630"},"observation_digest":"sha256:f1a445fac6327cc4f70a8271492d0e05c999be203fd7cf8b47a0f8c90b66d1f9","observation_id":"4f2054e0-e763-4dd1-a2b3-c72d04eb99c5","resolution":{"observed_at":"2026-08-11T13:01:25.462819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:01:25.446609Z","title":"two-layer","venue":null,"work_id":"ea37298a-ec01-4320-8148-42cd2ab175fd","year":2024},"citing_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T13:01:25.354703Z"},"links":{"citing_paper":"/paper/2412.13630"},"observation_digest":"sha256:5093206f06330a861a39568db202512e2a0210701f04d9d5f1d56fe02c2f5d9e","observation_id":"caa91bc3-a834-4fe7-840a-04857f344744","resolution":{"observed_at":"2026-08-11T13:01:25.450517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:01:25.422384Z","title":"• The PDF of the Gaussian distribution (orange): fGaussian(x) = N (x; µ3, σ2 3)","venue":null,"work_id":"456215db-c0e6-4205-a1f7-9700caaae790","year":null},"citing_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T13:01:25.362974Z"},"links":{"citing_paper":"/paper/2412.13630"},"observation_digest":"sha256:12a8b85f5bf6ff20e64a4a91ab1f9a95af31616e66cfff82f7ee57422eaf9694","observation_id":"692d356b-0a9c-4913-be21-0068e277ac1f","resolution":{"observed_at":"2026-08-11T13:01:25.427222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:01:25.409185Z","title":"• The parameters used in the plot are: w1 = 0.5, w 2 = 0.5, µ 1 = 0.5, µ 2 = 0.5, µ 3 = 3, σ 1 = 1, σ 2 = 1, σ 3 = 1","venue":null,"work_id":"e52e1aa8-fa71-45e4-93bd-544b429f57ef","year":2018},"citing_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T13:01:25.366899Z"},"links":{"citing_paper":"/paper/2412.13630"},"observation_digest":"sha256:3c7c455feb80bad0d5fdffb1fb81e56dc06cc6bdbec76773726feb322d6dc0ac","observation_id":"f64f459f-cd68-43e2-82cc-c028fe1f6adb","resolution":{"observed_at":"2026-08-11T13:01:25.414446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:01:25.435229Z","title":"However, its online performance is poor, as reported by Ren et al","venue":null,"work_id":"778e1f05-2004-4066-adf0-d3cb7273e3a4","year":2024},"citing_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T13:01:25.358805Z"},"links":{"citing_paper":"/paper/2412.13630"},"observation_digest":"sha256:d31b4afb175674846a0783cb93c739f3e07bc92a6cfa7bbdb474a92781ebe517","observation_id":"cbbb7007-cf81-40fb-923f-353f1240776a","resolution":{"observed_at":"2026-08-11T13:01:25.439210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-08T17:26:38.829859Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-11T13:01:25.310151Z","title":"calibrates","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"reference_index":2066,"source":"pdf_text","source_observed_at":"2026-08-11T13:01:25.310151Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2412.13630"},"observation_digest":"sha256:29140f736e958e267ae908fd722232a05a13b76219d0da6d7a5e51238453e1e8","observation_id":"86cde545-1a7c-4cc1-bb26-0c2e06fa85b8","resolution":{"observed_at":"2026-08-11T13:01:25.310151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 22 inbound Pith citation observations for arXiv:2412.13630."}