{"as_of":"2026-08-04T07:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a51aba4b77a999de9dc4f27674b039e5c54b0f8591bf8c79f0099d42ebd9786","coverage":[{"denominator":114,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T08:48:14.776754Z","state":"measured"},{"denominator":164,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":164,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":64,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:06:51.656450Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T09:59:44.479162Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2412.15689","last_updated":"2026-05-06T21:36:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-20T09:07:36Z","title":"DOLLAR: Few-Step Video Generation via Distillation and Latent Reward Optimization","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-23T06:57:50.897865Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2412.15689"},"observation_digest":"sha256:e8c21ccd7711097b117593e76c723fa6aa142b75988b2a8a7c059ca717ae31aa","observation_id":"ba5ee6c1-f15f-4b12-aa3b-cca09a09d237","resolution":{"observed_at":"2026-05-23T07:02:41.883697Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-14T19:48:48.725800Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2502.05855"},"observation_digest":"sha256:e57311c7c8307c026872bd01957ddf004ba61762210e8402614bc8a2ec9a9336","observation_id":"0c4db814-78d9-41be-9964-269ad20edbc9","resolution":{"observed_at":"2026-05-16T08:48:15.161771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2506.08052","last_updated":"2025-09-29T17:21:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T03:14:04Z","title":"ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T07:36:24.319361Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2506.08052"},"observation_digest":"sha256:5e20e358819ef2fb2ec8ad8dc858769983e6da1c479d84cb36e4c34d71658c84","observation_id":"47bc4938-94c5-4022-aabc-3252f79a485d","resolution":{"observed_at":"2026-05-16T08:48:15.161771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2506.15799","last_updated":"2025-06-25T19:09:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T18:35:57Z","title":"Steering Your Diffusion Policy with Latent Space Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T21:55:46.183007Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2506.15799"},"observation_digest":"sha256:9096c57b416a0341e8e3d79098c418f7ebbe36f2903ad8a780de741340b42dd6","observation_id":"21565e65-1f4c-4528-880f-1c99c744359f","resolution":{"observed_at":"2026-05-17T21:55:46.253261Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2507.07969","last_updated":"2026-05-11T17:12:21Z","snapshot_observed_at":"2026-07-06T21:55:17.277337Z","submitted_at":"2025-07-10T17:48:03Z","title":"Reinforcement Learning with Action Chunking","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-19T05:18:20.960945Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2507.07969"},"observation_digest":"sha256:e7f1d160e443c32b85fff062c92045a7d048a2b6988f6aa032f189b3c258174f","observation_id":"7f6d4f1a-cac3-4bb2-a553-46a2aed6c269","resolution":{"observed_at":"2026-05-19T05:22:06.402197Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2507.07986","last_updated":"2026-04-30T00:00:17Z","snapshot_observed_at":"2026-08-02T06:26:17.199293Z","submitted_at":"2025-07-10T17:57:46Z","title":"EXPO: Stable Reinforcement Learning with Expressive Policies","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T05:09:02.111308Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2507.07986"},"observation_digest":"sha256:69fa13ff9e2af239eac364a802841354cf2501a36c111acb44eddc110280a514","observation_id":"a81dc09f-e3b4-45b2-b9b5-c3f9ace8201b","resolution":{"observed_at":"2026-05-19T05:12:05.270716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2507.12768","last_updated":"2026-05-06T08:19:11Z","snapshot_observed_at":"2026-08-03T01:37:13.706745Z","submitted_at":"2025-07-17T03:48:57Z","title":"AnyPos: Automated Task-Agnostic Actions for Bimanual Manipulation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T03:52:18.984005Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2507.12768"},"observation_digest":"sha256:a62bc52691b6a63749e03fc07150f64e4acc13a181d65c7e80f43ab68637994e","observation_id":"9ff6eb02-3981-4773-ab0e-31de15b9e121","resolution":{"observed_at":"2026-05-19T03:52:57.521038Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2509.22963","last_updated":"2026-05-19T22:38:20Z","snapshot_observed_at":"2026-08-02T17:56:37.590404Z","submitted_at":"2025-09-26T21:53:36Z","title":"Reinforcement Learning with Discrete Diffusion Policies for Combinatorial Action Spaces","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-21T21:14:54.053177Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2509.22963"},"observation_digest":"sha256:1d93b640b09a0ad9b7af4be902852cd9ed15e94c4364bf9b2e55c97ea050bfc9","observation_id":"2826a469-44ff-4c82-a962-29060e3578a4","resolution":{"observed_at":"2026-05-21T21:15:38.728243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-04T07:06:51.656450Z","title":"Diffusion policy policy optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.27048","last_updated":"2026-07-10T16:45:48Z","snapshot_observed_at":"2026-08-04T07:06:47.791270Z","submitted_at":"2025-10-30T23:33:07Z","title":"SpikeATac: A Multimodal Tactile Finger with Taxelized Dynamic Sensing for Dexterous Manipulation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T07:06:51.656450Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2510.27048"},"observation_digest":"sha256:7388f3f49b42ced5f15decf5b6fe5c77a5cd2b130f2599f261b7a79061b21067","observation_id":"2058709a-dd4d-4784-9f40-c6d276648bf0","resolution":{"observed_at":"2026-08-04T07:06:51.656450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2512.02535","last_updated":"2026-04-30T01:12:10Z","snapshot_observed_at":"2026-07-06T22:37:31.360740Z","submitted_at":"2025-12-02T09:00:12Z","title":"AID: Agent Intent from Diffusion for Multi-Agent Informative Path Planning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T02:55:11.396778Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2512.02535"},"observation_digest":"sha256:8ef876bb7af9c6fd68e0e4bc8b8e41871375bc9ba04ef93ff2647345f1c46ba7","observation_id":"578e1ed8-5be0-4d91-ae7e-10add8cfa854","resolution":{"observed_at":"2026-05-17T02:58:55.143134Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-03T19:03:03.126259Z","title":"Ren, Justin Lidard, Lars L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.02581","last_updated":"2026-06-19T14:04:42Z","snapshot_observed_at":"2026-08-04T01:02:06.821031Z","submitted_at":"2025-12-02T09:49:26Z","title":"Training Diffusion Policies via Prior-Mapping Co-Evolution","version":3},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-03T19:03:03.126259Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2512.02581"},"observation_digest":"sha256:5bbaaf0d1be04ed0e4f2359df4ebf70fc90c4e6dc2414c0d8e4b87af4a0617cb","observation_id":"cc1aa7b9-c440-4da9-8d13-fac8edc2e47e","resolution":{"observed_at":"2026-08-03T19:03:03.126259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-03T15:58:43.680884Z","title":"Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, and Björn Ommer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.17951","last_updated":"2026-07-23T12:52:39Z","snapshot_observed_at":"2026-08-03T17:18:54.665255Z","submitted_at":"2025-12-17T02:44:11Z","title":"SuperFlow: Training Flow Matching Models with RL on the Fly","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:43.680884Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2512.17951"},"observation_digest":"sha256:7a3f5f49a4cfad81f79573e29361573eb2e0f871c0cb7a59afbfce62f6aba673","observation_id":"2500e2c8-52eb-424e-b955-b2c9b97629c8","resolution":{"observed_at":"2026-08-03T15:58:43.680884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-03T06:23:16.097203Z","title":"Diffusion policy policy optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22965","last_updated":"2026-06-01T08:53:04Z","snapshot_observed_at":"2026-08-03T18:17:41.775148Z","submitted_at":"2026-01-30T13:27:59Z","title":"Self-Imitated Diffusion Policy for Efficient and Robust Visual Navigation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T06:23:16.097203Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2601.22965"},"observation_digest":"sha256:4eab5db6bfb24a3097c42b8ec6cc75f8525bb4d1ff559a8f104afbc7fa5cb4ac","observation_id":"11ceecf6-5757-4424-bb6f-8d9ac2889b82","resolution":{"observed_at":"2026-08-03T06:23:16.097203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-07-06T22:44:14.347235Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:85f5fd546d87dd5d6fb02beece7e54dfd70256c986e90c50bc03d8bc7a85f024","observation_id":"e9c845c4-cb15-40fc-ac0f-722adfefde5a","resolution":{"observed_at":"2026-05-16T08:48:15.161771Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-02T23:47:58.060371Z","title":"Ren, Justin Lidard, Lars L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12691","last_updated":"2026-06-20T06:22:27Z","snapshot_observed_at":"2026-08-03T14:49:54.047706Z","submitted_at":"2026-02-13T07:46:37Z","title":"ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T23:47:58.060371Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2602.12691"},"observation_digest":"sha256:6eb22d7a7c03c63b4dcf70c71b631804fa68786494a6687379595a2515ed57a6","observation_id":"da956c23-11d5-4ca9-9175-67ddb8e53664","resolution":{"observed_at":"2026-08-02T23:47:58.060371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2602.19974","last_updated":"2026-05-07T22:11:37Z","snapshot_observed_at":"2026-07-06T22:46:45.213871Z","submitted_at":"2026-02-23T15:39:53Z","title":"RL-RIG: A Generative Spatial Reasoner via Intrinsic Reflection","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T20:33:09.627731Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2602.19974"},"observation_digest":"sha256:ac8ae8235be3f593552eb578a9eddbf6e903f22f62a02443ccb231296e76a9cd","observation_id":"f02eaebd-af78-4b47-a2bd-066653aa463b","resolution":{"observed_at":"2026-05-16T08:48:15.161771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2602.22507","last_updated":"2026-05-12T01:27:47Z","snapshot_observed_at":"2026-07-06T22:47:06.893212Z","submitted_at":"2026-02-26T00:54:38Z","title":"Space Syntax-guided Post-training for Residential Floor Plan Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T19:38:24.134463Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2602.22507"},"observation_digest":"sha256:c127d31b2297abaee1ed62d53dd00b89fa8517d8a82492f7f82a58bd0919ada1","observation_id":"314312b9-a112-4e39-acc5-a801b507f8b3","resolution":{"observed_at":"2026-05-16T08:48:15.161771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2603.04333","last_updated":"2026-05-08T20:08:31Z","snapshot_observed_at":"2026-07-31T16:31:42.095039Z","submitted_at":"2026-03-04T17:51:30Z","title":"What Does Flow Matching Bring To TD Learning?","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T16:32:29.432272Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2603.04333"},"observation_digest":"sha256:bfef670e27bd9e53ccda88822e083f4909310a1271905b298f0235592e7a9bfc","observation_id":"fd84c1b8-faff-46d5-8b92-c225d1c16a09","resolution":{"observed_at":"2026-05-16T08:48:15.161771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-14T23:47:45.866615Z","title":"Diffusion policy policy optimization.arXiv preprint arXiv:2409.00588, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.10250","last_updated":"2026-05-24T03:43:13Z","snapshot_observed_at":"2026-07-14T23:47:43.007890Z","submitted_at":"2026-03-10T22:01:13Z","title":"GeMPO: Generalized Measure Matching for Online Diffusion Reinforcement Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T23:47:45.866615Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2603.10250"},"observation_digest":"sha256:5978e08f4934a37e8cbf58c5568a404b637feacc4cc5529d4efe78cf07902886","observation_id":"e2a78e72-78c8-4cad-8e4e-acd0832556f6","resolution":{"observed_at":"2026-07-14T23:47:45.866615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-14T23:46:32.301737Z","title":"Z., Lidard, J., Ankile, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.10263","last_updated":"2026-07-01T06:52:08Z","snapshot_observed_at":"2026-07-14T23:46:28.340932Z","submitted_at":"2026-03-10T22:49:46Z","title":"From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T23:46:32.301737Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2603.10263"},"observation_digest":"sha256:d2743ed5ce885d5959d568c74fa1c9455fde1586a34c0712c159e8f7d9d872f5","observation_id":"5bde7aeb-4605-4e85-85ca-017a64f2e514","resolution":{"observed_at":"2026-07-14T23:46:32.301737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2603.15757","last_updated":"2026-06-19T13:49:25Z","snapshot_observed_at":"2026-08-01T17:19:13.726372Z","submitted_at":"2026-03-16T18:00:19Z","title":"You've Got a Golden Ticket: Improving Generative Robot Policies With A Single Noise Vector","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T09:53:45.151347Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2603.15757"},"observation_digest":"sha256:907b26eba3b2b35971fd36e7b1c790d65b33bd8c580f838998a4b134b9cd1169","observation_id":"1849747a-3200-4c30-b7ed-693d3d74cb5e","resolution":{"observed_at":"2026-05-16T08:48:15.161771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2603.15956","last_updated":"2026-04-20T19:05:45Z","snapshot_observed_at":"2026-07-06T22:49:19.323519Z","submitted_at":"2026-03-16T22:12:48Z","title":"ExpertGen: Scalable Sim-to-Real Expert Policy Learning from Imperfect Behavior Priors","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T09:37:02.168898Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2603.15956"},"observation_digest":"sha256:5bc528e7809a62a0b22ec54a4693340a4faf7fc4268379596ca621b673e60699","observation_id":"8a000a8c-5c2a-4e34-91c8-833fcf93f83e","resolution":{"observed_at":"2026-05-16T08:48:15.161771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2604.03066","last_updated":"2026-04-03T14:40:24Z","snapshot_observed_at":"2026-07-29T22:55:11.051349Z","submitted_at":"2026-04-03T14:40:24Z","title":"Redefining End-of-Life: Intelligent Automation for Electronics Remanufacturing Systems","version":1},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-05-13T19:21:34.849729Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2604.03066"},"observation_digest":"sha256:3bba78ef6e5f8e6523c5d3f0c4518bdbf69f6bfa41827e8c16c90b55a701e87e","observation_id":"8a6824f1-9b00-495e-99b3-66203b1639fc","resolution":{"observed_at":"2026-05-16T08:48:15.161771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2604.10962","last_updated":"2026-04-13T03:56:37Z","snapshot_observed_at":"2026-08-02T07:19:58.094243Z","submitted_at":"2026-04-13T03:56:37Z","title":"ScoRe-Flow: Complete Distributional Control via Score-Based Reinforcement Learning for Flow Matching","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T16:02:36.261596Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2604.10962"},"observation_digest":"sha256:101c2368e917573f9bd09ce43f80fcfc3a18ed5cefbce9455f55ba5a592786c8","observation_id":"2d37fa2e-fa61-4baa-8f87-e7ae3f2b2e0a","resolution":{"observed_at":"2026-05-16T08:48:15.161771Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2604.17887","last_updated":"2026-04-20T06:57:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T06:57:55Z","title":"StableIDM: Stabilizing Inverse Dynamics Model against Manipulator Truncation via Spatio-Temporal Refinement","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T04:41:45.903419Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2604.17887"},"observation_digest":"sha256:931aff8bd8417a2db6c0a805ed620c1417217c072ea01d9273d305677feec84f","observation_id":"c7199917-fcdf-46e4-a5e2-1629a42e72cb","resolution":{"observed_at":"2026-05-16T08:48:15.161771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2604.18839","last_updated":"2026-04-20T21:06:12Z","snapshot_observed_at":"2026-07-06T23:05:35.374092Z","submitted_at":"2026-04-20T21:06:12Z","title":"One Step Forward and K Steps Back: Better Reasoning with Denoising Recursion Models","version":1},"reference_index":209,"source":"arxiv_source","source_observed_at":"2026-05-10T04:56:35.796962Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2604.18839"},"observation_digest":"sha256:88b8ba3c5f2dcecdcd86d4244561a367dec340c8930017abfa4de14eec1b5712","observation_id":"c8fbe686-b202-4159-8dc1-9a27a2657eda","resolution":{"observed_at":"2026-05-16T08:48:15.161771Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":1},"reference_index":171,"source":"arxiv_source","source_observed_at":"2026-05-08T18:48:56.075160Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:de13911906b9d4dcdb237cc51e2001d0a285f1d0ffc91d761482dcc09ff3ab33","observation_id":"9ef6a3d8-ee54-40a8-9c76-ada06fbaa4cc","resolution":{"observed_at":"2026-05-16T08:48:15.161771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:6094a7757ab394a4ea7cbbd3780079dafe4954692c0d462d67f6976ea6cbf355","observation_id":"2af59ee1-3ad0-4010-935a-3ed5a7f4f754","resolution":{"observed_at":"2026-07-01T00:05:09.649912Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2605.04647","last_updated":"2026-05-12T01:59:41Z","snapshot_observed_at":"2026-08-03T05:59:23.145937Z","submitted_at":"2026-05-06T08:52:32Z","title":"ReflectDrive-2: Reinforcement-Learning-Aligned Self-Editing for Discrete Diffusion Driving","version":1},"reference_index":118,"source":"arxiv_source","source_observed_at":"2026-05-08T16:06:47.108382Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2605.04647"},"observation_digest":"sha256:a7fabb7768a4b1706fb68bccb9d600d6170fd02f4a9c910b0f92f001a03fda1b","observation_id":"647b54c2-7905-4e05-a7ef-55c20243046c","resolution":{"observed_at":"2026-05-16T08:48:15.161771Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2605.04647","last_updated":"2026-05-12T01:59:41Z","snapshot_observed_at":"2026-08-03T05:59:23.145937Z","submitted_at":"2026-05-06T08:52:32Z","title":"ReflectDrive-2: Reinforcement-Learning-Aligned Self-Editing for Discrete Diffusion Driving","version":2},"reference_index":118,"source":"arxiv_source","source_observed_at":"2026-05-13T01:48:36.105389Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2605.04647"},"observation_digest":"sha256:d541736db2412183f1ecd289f876f04e036dd77170ec97e636dc13b5ad0aa8dc","observation_id":"ec7fcb19-3c94-4d1e-a239-64f67249a527","resolution":{"observed_at":"2026-05-16T08:48:15.161771Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2605.05812","last_updated":"2026-05-11T14:20:38Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:47:55Z","title":"Long-Horizon Q-Learning: Accurate Value Learning via n-Step Inequalities","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-08T11:20:19.749415Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2605.05812"},"observation_digest":"sha256:8c4dc62b84283150852924042b69a5e98496dce53604b1694ff4a9f2033762b5","observation_id":"24450e5d-774f-45c1-a1a4-5e2f969605ef","resolution":{"observed_at":"2026-05-16T08:48:15.161771Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2605.05812","last_updated":"2026-05-11T14:20:38Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:47:55Z","title":"Long-Horizon Q-Learning: Accurate Value Learning via n-Step Inequalities","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-12T05:05:29.984355Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2605.05812"},"observation_digest":"sha256:9d8764e7bc71e5c5ac13865fe0facb96d753f58041f5b4f0af5b4adf05436b95","observation_id":"ef41667e-d9f4-4a3f-aa51-e30b0168500d","resolution":{"observed_at":"2026-05-16T08:48:15.161771Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2605.07605","last_updated":"2026-05-08T11:30:25Z","snapshot_observed_at":"2026-08-03T11:13:00.050049Z","submitted_at":"2026-05-08T11:30:25Z","title":"BrickCraft: Visuomotor Skill Composition with Situated Manual Guidance for Long-Horizon Interlocking Brick Assembly","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T02:03:59.973863Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2605.07605"},"observation_digest":"sha256:8f75a97118582fcf77c8ee93316aabee53d1e521d288e92aad2812a4ac785e4c","observation_id":"b63fad67-3602-400c-bb82-0aba5003c69d","resolution":{"observed_at":"2026-05-16T08:48:15.161771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2605.12625","last_updated":"2026-05-14T17:58:42Z","snapshot_observed_at":"2026-07-06T23:24:18.302402Z","submitted_at":"2026-05-12T18:10:19Z","title":"Driving Intents Amplify Planning-Oriented Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T20:50:14.602822Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2605.12625"},"observation_digest":"sha256:c05e9a063bb970ee961bc8c84d0090ec01211d41e97ad08e3765d984a38110eb","observation_id":"14a2bfd0-4c76-4480-abf7-888cda1d2df1","resolution":{"observed_at":"2026-05-16T08:48:15.161771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2605.12625","last_updated":"2026-05-14T17:58:42Z","snapshot_observed_at":"2026-07-06T23:24:18.302402Z","submitted_at":"2026-05-12T18:10:19Z","title":"Driving Intents Amplify Planning-Oriented Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T04:58:07.943615Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2605.12625"},"observation_digest":"sha256:d7ffe85e1ceb8a5586fcd6bb650f920b01bc1078754e8cf9691ac81a0f06a078","observation_id":"9f8ad26a-967f-4dd1-b434-c5f8df1f7fd6","resolution":{"observed_at":"2026-05-16T08:48:15.161771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2605.14696","last_updated":"2026-05-14T11:12:23Z","snapshot_observed_at":"2026-08-03T02:39:02.197963Z","submitted_at":"2026-05-14T11:12:23Z","title":"EponaV2: Driving World Model with Comprehensive Future Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-15T05:14:28.714494Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2605.14696"},"observation_digest":"sha256:b4258ad684f0c4723f93854669cf3ddb80514a8b9dbb2047b954a8d243cb4a1b","observation_id":"a866d89e-0557-4c40-bdbd-0ee324810524","resolution":{"observed_at":"2026-05-16T08:48:15.161771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2605.16520","last_updated":"2026-05-15T18:14:38Z","snapshot_observed_at":"2026-08-02T14:37:22.154242Z","submitted_at":"2026-05-15T18:14:38Z","title":"Global Convergence of Sampling-Based Nonconvex Optimization through Diffusion-Style Smoothing","version":1},"reference_index":180,"source":"arxiv_source","source_observed_at":"2026-05-20T20:15:44.030714Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2605.16520"},"observation_digest":"sha256:3c4802dd51578d88072a84effa727a9239873e537f31e093f0b31cd71d1635d2","observation_id":"9bd20706-5a50-47fd-bd4d-6997829c682f","resolution":{"observed_at":"2026-05-20T20:18:59.896329Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2605.17174","last_updated":"2026-05-16T22:18:04Z","snapshot_observed_at":"2026-08-02T13:33:29.826456Z","submitted_at":"2026-05-16T22:18:04Z","title":"Beyond Execution: Static-Analysis Rewards and Hint-Conditioned Diffusion RL for Code Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T14:03:45.869373Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2605.17174"},"observation_digest":"sha256:b46997fa03c92b360b59d12783e54dedfce8cb22a2a4468ebd15b243f19bb4e4","observation_id":"fa0958ed-9273-4c4f-9083-cdd715b9a03c","resolution":{"observed_at":"2026-05-20T14:08:21.214238Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2605.20209","last_updated":"2026-07-18T16:31:33Z","snapshot_observed_at":"2026-08-02T16:17:14.559124Z","submitted_at":"2026-04-15T14:51:32Z","title":"NaP-Control: Navigating Diffusion Prior for Versatile and Fast Character Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:07.291649Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2605.20209"},"observation_digest":"sha256:0a4c421c875b3db88f7ebe7642b6aab5155477c2705861cbdf37cc3455f3c548","observation_id":"9fe43d4b-6039-4d0b-9355-5fb987ec830c","resolution":{"observed_at":"2026-05-21T09:44:05.614347Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-02T16:17:15.396053Z","title":"arXiv preprint arXiv:2409.00588 (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.20209","last_updated":"2026-07-18T16:31:33Z","snapshot_observed_at":"2026-08-02T16:17:14.559124Z","submitted_at":"2026-04-15T14:51:32Z","title":"NaP-Control: Navigating Diffusion Prior for Versatile and Fast Character Control","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T16:17:15.396053Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2605.20209"},"observation_digest":"sha256:5556bbeca76be4a80f1cb526f6f0172bb79b9097053e128421e6148f81631dad","observation_id":"5b537296-f68f-4ea4-8ca3-56e1747d33fc","resolution":{"observed_at":"2026-08-02T16:17:15.396053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2605.22894","last_updated":"2026-05-25T05:33:57Z","snapshot_observed_at":"2026-08-02T23:58:49.168142Z","submitted_at":"2026-05-21T14:17:21Z","title":"SCRIPT: Scalable Diffusion Policy with Multi-stage Training for Language-driven Physics-based Humanoid Control","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-25T02:38:14.542361Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2605.22894"},"observation_digest":"sha256:759aa6fc815189b4d455e8ea920e2c20caa9ec440a8fa863c38fbf3ef0d5ceeb","observation_id":"5a2c95a8-dfaa-4590-bfcb-9822ae1aaf70","resolution":{"observed_at":"2026-05-25T02:40:14.646645Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-02T21:24:36.066827Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:8df1f70ed92d13c662299985322a4804a042682ee914a1383986fe85a2ce5f1b","observation_id":"dfd762db-b4d8-4092-912e-22a5e0bae85f","resolution":{"observed_at":"2026-05-25T05:26:39.040336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2605.27095","last_updated":"2026-06-01T11:46:42Z","snapshot_observed_at":"2026-08-01T16:29:57.408276Z","submitted_at":"2026-05-26T14:38:03Z","title":"Adversarial Dual On-Policy Distillation from Expressive Teacher","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T18:55:23.777484Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2605.27095"},"observation_digest":"sha256:bc5e278c984e0c9b2d0b1e44d9c8e5e389808cd1e6dfdf5c8b3c283682ec87e0","observation_id":"6de1a311-b8a7-4a12-b72a-95fde042912b","resolution":{"observed_at":"2026-06-29T19:03:51.530527Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2605.29398","last_updated":"2026-05-28T05:47:40Z","snapshot_observed_at":"2026-07-06T23:38:51.349968Z","submitted_at":"2026-05-28T05:47:40Z","title":"GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T08:44:53.969301Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2605.29398"},"observation_digest":"sha256:6a7b057482be24f27ef1d2af848510227677f4f3cbb95d7c2b18f64c0a128071","observation_id":"4d781a1a-0f11-459a-bd6b-f7cc45f515cd","resolution":{"observed_at":"2026-06-29T08:53:16.332663Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2605.30056","last_updated":"2026-05-28T15:07:50Z","snapshot_observed_at":"2026-07-06T23:39:24.682426Z","submitted_at":"2026-05-28T15:07:50Z","title":"Sample-Efficient Diffusion-based Reinforcement Learning with Critic Guidance","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T07:21:56.382343Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2605.30056"},"observation_digest":"sha256:3121b34925c8267d3229798f15a9814df4ce649df8398152e9256e86b582c9cc","observation_id":"830c31ec-6ea0-45ac-8b4d-446e12a6f139","resolution":{"observed_at":"2026-06-29T07:23:12.560650Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2606.01151","last_updated":"2026-05-31T10:40:28Z","snapshot_observed_at":"2026-08-03T00:43:42.892584Z","submitted_at":"2026-05-31T10:40:28Z","title":"Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T17:19:36.722892Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2606.01151"},"observation_digest":"sha256:e2c69d86a7b515c9cf139e07840773d061ec61954dd0744b61aa9067f051f90c","observation_id":"af852c71-a5dc-4c63-ac5f-924ee87058f9","resolution":{"observed_at":"2026-06-28T17:22:24.651659Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2606.06049","last_updated":"2026-06-04T11:45:37Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T11:45:37Z","title":"L-SDPPO: Policy Optimization of Spiking Diffusion Policy for Intra-vehicular Robotic Manipulation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T01:35:03.841581Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2606.06049"},"observation_digest":"sha256:b24518daf5a9154f3e800700da604e78b5ad4a18be71c8955b9953b25f169cae","observation_id":"99f79ee2-17f2-4be2-8652-c6e9cc4b1b3b","resolution":{"observed_at":"2026-07-02T13:06:59.104806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2606.06967","last_updated":"2026-06-05T06:54:09Z","snapshot_observed_at":"2026-07-06T23:46:42.693840Z","submitted_at":"2026-06-05T06:54:09Z","title":"GenPO++: Generative Policy Optimization with Jacobian-free Likelihood Ratios","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T22:47:10.062975Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2606.06967"},"observation_digest":"sha256:0ad865743d731603a5c09a2fdf9e1ed60cb1b4be4d8e9a253cb337808e014b5c","observation_id":"1b8fe517-97fc-4df9-83de-54393ea24449","resolution":{"observed_at":"2026-07-02T16:27:08.810763Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2606.11087","last_updated":"2026-06-09T16:45:57Z","snapshot_observed_at":"2026-08-02T20:45:09.177143Z","submitted_at":"2026-06-09T16:45:57Z","title":"Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T14:05:01.073951Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2606.11087"},"observation_digest":"sha256:2c7b6a9a1d0896995a2920434128ba4789ebf5a18f3aca23a6a22dba5320160e","observation_id":"1b3afeba-f5de-4e9c-ba21-a2b48e66f082","resolution":{"observed_at":"2026-07-03T04:17:36.913056Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:b7c16970c50afcdbff4ac382a58f498ccc38928911c471ffb40d8927c4039a74","observation_id":"9f694d9c-246a-488f-b50c-04c35aba46ff","resolution":{"observed_at":"2026-07-03T14:18:22.958694Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-12T13:49:10.591494Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16447","last_updated":"2026-07-09T08:44:02Z","snapshot_observed_at":"2026-08-03T08:58:34.090002Z","submitted_at":"2026-06-15T09:19:34Z","title":"Training and Evaluating Diffusion Policies with Long Context Lengths","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T13:49:10.591494Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2606.16447"},"observation_digest":"sha256:29ed0b09ebf3e7351987535ba908929530a1160773b6a1636ff0858781e55d39","observation_id":"89153b87-9389-418d-a987-6fc42e9c112d","resolution":{"observed_at":"2026-07-12T13:49:10.591494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2606.19656","last_updated":"2026-06-17T23:40:45Z","snapshot_observed_at":"2026-07-31T22:08:01.390171Z","submitted_at":"2026-06-17T23:40:45Z","title":"DF-ExpEnse: Diffusion Filtered Exploration for Sample Efficient Finetuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T20:19:15.766523Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2606.19656"},"observation_digest":"sha256:a2a0de2fdc0d059eab3e952529e4565ab314680bc4afe0f397aa38d5a4959f76","observation_id":"dd56ff9e-6c06-4a90-9f40-1ff194b3a13d","resolution":{"observed_at":"2026-07-04T01:29:22.874635Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2606.23640","last_updated":"2026-06-22T17:30:24Z","snapshot_observed_at":"2026-08-02T09:22:48.099895Z","submitted_at":"2026-06-22T17:30:24Z","title":"Learning Process Rewards via Success Visitation Matching for Efficient RL","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-26T09:20:35.062060Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2606.23640"},"observation_digest":"sha256:504a3d5f8e8f56ecece52f784a3e0ca023ce6d50a0528858d3bdfa1e5d7bb06d","observation_id":"ff475354-aa11-47bc-b37e-f498c9ceca88","resolution":{"observed_at":"2026-07-04T09:59:44.497332Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2606.27475","last_updated":"2026-06-25T18:52:27Z","snapshot_observed_at":"2026-08-02T12:36:42.748876Z","submitted_at":"2026-06-25T18:52:27Z","title":"Support-Constrained RL Enables Real-World Policy Improvement without Real-World Experience","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T01:57:04.293058Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2606.27475"},"observation_digest":"sha256:baa61ec3af34989ad44f54aa3c7cf3ddca59638fd93a5fe8a34ab21519d35269","observation_id":"8dcde12d-1cad-4f93-b565-a567e860bd7c","resolution":{"observed_at":"2026-07-01T18:25:58.752687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2606.29934","last_updated":"2026-06-29T08:10:43Z","snapshot_observed_at":"2026-07-07T00:03:51.213896Z","submitted_at":"2026-06-29T08:10:43Z","title":"RoamFlow: Reinforcement-Aligned One-Step Action MeanFlow Policy for Image-Goal Navigation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T05:46:41.398250Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2606.29934"},"observation_digest":"sha256:e9824d97660bc4c7273e9dc22e4c95136f47facdc68e33e44a01695b3db47fc0","observation_id":"5bd0025f-7a96-4793-96fb-5b517d53088e","resolution":{"observed_at":"2026-06-30T13:44:41.742141Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2607.01111","last_updated":"2026-07-01T16:01:54Z","snapshot_observed_at":"2026-08-02T09:22:45.093831Z","submitted_at":"2026-07-01T16:01:54Z","title":"FAR: Failure-Aware Retry for Test-Time Recovery and Continual Policy Improvement","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-02T11:05:51.857152Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2607.01111"},"observation_digest":"sha256:1417081feb761851ecba3703fa66e4a400e59000ec092e1a0ba3baa908d010d8","observation_id":"f29df593-48d9-405d-b8ed-45309a366282","resolution":{"observed_at":"2026-07-02T11:06:52.397510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2607.02431","last_updated":"2026-07-02T17:00:37Z","snapshot_observed_at":"2026-07-07T00:07:52.110955Z","submitted_at":"2026-07-02T17:00:37Z","title":"WorldSample: Closed-loop Real-robot RL with World Modelling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-03T10:57:40.128651Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2607.02431"},"observation_digest":"sha256:de3bcd3521b26677502f1d5a61562af867be9351f1a95238b721398b3802702b","observation_id":"27ba7173-50ca-4891-b91a-935619f026d8","resolution":{"observed_at":"2026-07-03T10:58:02.429177Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-13T01:56:20.542865Z","title":"Diffusion policy policy optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09590","last_updated":"2026-07-10T16:42:17Z","snapshot_observed_at":"2026-08-03T18:31:14.327577Z","submitted_at":"2026-07-10T16:42:17Z","title":"PAC-ACT: Post-training Actor-Critic for Action Chunking Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T01:56:20.542865Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2607.09590"},"observation_digest":"sha256:ba0f441f3daaf0df4f36a59916a288f96fa5ef1fa10261987ff82a7ee0302cd6","observation_id":"0a61ad18-c644-4b46-b3eb-f0a62b6fc8de","resolution":{"observed_at":"2026-07-13T01:56:20.542865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-14T13:30:25.329162Z","title":"and Lidard, Justin and Ankile, Lars L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10206","last_updated":"2026-07-11T08:33:04Z","snapshot_observed_at":"2026-08-02T00:33:50.127659Z","submitted_at":"2026-07-11T08:33:04Z","title":"Source-Lifted Flow Matching for Intervenable Multimodal Imitation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-14T13:30:25.329162Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2607.10206"},"observation_digest":"sha256:1b3bc5b6e1268cf58a9f72367b0c956359929ce3d13672e2a33fcc369eb73faf","observation_id":"e527f006-6136-4ae1-b4ce-ed5878d95496","resolution":{"observed_at":"2026-07-14T13:30:25.329162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-14T08:30:10.584105Z","title":"Diffusion policy policy optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10892","last_updated":"2026-07-12T19:48:46Z","snapshot_observed_at":"2026-08-02T10:06:23.769338Z","submitted_at":"2026-07-12T19:48:46Z","title":"A Single Diffusion-Policy Controller for Multi-Task Block Pushing with Zero-Shot Sim-to-Real Transfer","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T08:30:10.584105Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2607.10892"},"observation_digest":"sha256:fdbc018c5e6d03f44121bcce9286382c4ef49e662c1b2662cfef781373183524","observation_id":"c643290a-e972-4984-97c1-b0b32927e796","resolution":{"observed_at":"2026-07-14T08:30:10.584105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-01T17:44:57.681794Z","title":"arXiv preprint arXiv:2409.00588 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17560","last_updated":"2026-07-20T05:09:36Z","snapshot_observed_at":"2026-08-01T17:43:44.385008Z","submitted_at":"2026-07-20T05:09:36Z","title":"Reinforcement Learning: From Algorithms To Foundation Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T17:44:57.681794Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2607.17560"},"observation_digest":"sha256:7e961de169fbf961232472c8fb55282996371a58749909b9b2ec08d785a0ccc6","observation_id":"a346701a-1427-4467-94a4-0992f343157d","resolution":{"observed_at":"2026-08-01T17:44:57.681794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-01T04:29:43.203548Z","title":"arXiv preprint arXiv:2409.00588 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22531","last_updated":"2026-07-24T17:59:39Z","snapshot_observed_at":"2026-08-01T04:29:41.388158Z","submitted_at":"2026-07-24T17:59:39Z","title":"Twins: Learn to Predict Unified Representations with Focal Loss","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T04:29:43.203548Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2607.22531"},"observation_digest":"sha256:7b54c5f2837b4aeec7be8598c415aea4139239ec078f89950198a45d8d9c9b6d","observation_id":"61f6c394-e367-4202-bd4d-14ec0c057c0a","resolution":{"observed_at":"2026-08-01T04:29:43.203548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-30T11:06:23.633833Z","title":"Ren, Justin Lidard, Lars L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-07-29T17:59:51Z","snapshot_observed_at":"2026-08-02T22:23:29.874006Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-30T11:06:23.633833Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:4b460da2c4cb11f4cad3543f275bda4c7173cb02ce92d76d4714093d5c28eeb9","observation_id":"a66dba47-35d2-44f2-9e09-d6587bece679","resolution":{"observed_at":"2026-07-30T11:06:23.633833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-03T03:34:04.794445Z","title":"Diffusion policy policy optimization.arXiv preprint arXiv:2409.00588, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-04T06:34:53.377866Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:04.794445Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:51ce2f50785a7325546a155d22eda32b81ed96c86975a3a86216f5151dd14ae6","observation_id":"9f13788d-107f-4628-ba61-208e54ae897a","resolution":{"observed_at":"2026-08-03T03:34:04.794445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2409.00588/citation-record","integrity":"/paper/2409.00588/integrity","json":"/paper/2409.00588/citation-record.json","paper":"/paper/2409.00588"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0b567b9e-aa3b-432f-a0ce-bce4fd59fd26","year":2018},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:13ec2ee1b2f18f922c0f9e520160100a13f4b35af45e6ae309f6ff8a9e73e730","observation_id":"7fc3da64-cce0-4485-b8e8-fcd4bef622ea","resolution":{"observed_at":"2026-05-16T08:48:15.108380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"643a8287-f9b1-4398-9d8e-70d8a00b57b6","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:9e2ea0d9232bb74dad9c8ed895622bdb3bb6219bf30d8e7f2ecf30ccfb25448a","observation_id":"fa2e04cf-b36c-48a7-a144-549378347b5e","resolution":{"observed_at":"2026-05-16T08:48:15.051574Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08050","last_updated":"2021-06-15T11:16:49Z","snapshot_observed_at":"2026-07-06T11:19:25.274029Z","submitted_at":"2021-06-15T11:16:49Z","title":"Residual Reinforcement Learning from Demonstrations","version":1},"cited_work":{"arxiv_id":"2106.08050","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.08050","snapshot_observed_at":"2026-07-03T10:48:02.241185Z","title":"Alakuijala, G","venue":null,"work_id":"eb611dc4-806c-481d-9c04-7a393d30c779","year":2021},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2106.08050","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:8b56586b6d98ca81cfc0b51edf5f11b8a3335d586ebdff720ea21c45a59553f1","observation_id":"e5c6c449-52ec-4354-bb77-d3ac64bdc76d","resolution":{"observed_at":"2026-05-16T08:48:14.827071Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f4632aff-93d3-480a-8cf9-ef09dcd7251d","year":2020},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:3787b2934d22e30d06cff34267332e505d729fbe23fa3bbbeb42a42787d8d989","observation_id":"13205ca0-4611-47f5-b046-f2e730159781","resolution":{"observed_at":"2026-05-16T08:48:15.056278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ankile, A","venue":null,"work_id":"37f59bbe-8c03-49c3-b7af-ec358536c0f6","year":2024},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:230e8ca1c1dc5531957daa63085a91a32b7231961f5dfa63481df2b18525474f","observation_id":"037f6897-8e31-4219-b4ce-3dabb7d8ebd5","resolution":{"observed_at":"2026-05-16T08:48:15.058689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16677","last_updated":"2024-12-12T18:40:16Z","snapshot_observed_at":"2026-07-06T18:50:48.181248Z","submitted_at":"2024-07-23T17:44:54Z","title":"From Imitation to Refinement -- Residual RL for Precise Assembly","version":4},"cited_work":{"arxiv_id":"2407.16677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.16677","snapshot_observed_at":"2026-07-04T06:19:37.586486Z","title":"Ankile, L., Simeonov, A., Shenfeld, I., and Agrawal, P","venue":null,"work_id":"43e937f0-4e9c-467f-a611-aecd53ef07e0","year":2024},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2407.16677","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:d6d3e27d255bc0e86e301c5f22c9027b54cd894b8cf32d5c85606352a20aea9e","observation_id":"74c87f12-a7d2-44d5-a6ae-f284aaa2d218","resolution":{"observed_at":"2026-05-16T08:48:14.831533Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cfb9a133-c0f5-4541-a0ee-07f6dd0f04e1","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:44e6635c5c2172fd0cc7284b61bb8bc478188e54eb9cccd519c696a003de88c7","observation_id":"8e01698d-6a82-40f7-93f7-5329ffdc77dd","resolution":{"observed_at":"2026-05-16T08:48:15.063573Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f0fb7046-9104-41d1-8978-b59fa496ed90","year":2006},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:2dca6bdbf22d8bb28c42664a4f89f81b9e2d59f5f322f925b760a50811865ea2","observation_id":"0f0df64d-6db3-4e5e-b853-a4ace7053ec5","resolution":{"observed_at":"2026-05-16T08:48:15.066058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-01T15:43:51.739518Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2305.13301","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-07-08T19:25:32.506868Z","title":"Training Diffusion Models with Reinforcement Learning","venue":"cs.LG","work_id":"67684dda-3930-452a-b91a-36cbb8e2e219","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:9d3d734d87423458e75341b98521d6c8cb8a7c7fd99ba6756cfae8e980024d6b","observation_id":"89beb46f-a3fd-4a26-a0f2-2e66b5fd0bf5","resolution":{"observed_at":"2026-05-16T08:48:14.835367Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Block, A","venue":null,"work_id":"e02601b9-0cc4-4b2e-b190-de7242cbdbbd","year":2024},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:457b32c37e28936628c2fc1401ad073734b511ea125bf44111136939690d218c","observation_id":"4119c290-68af-456a-8dcf-fd4ca288b698","resolution":{"observed_at":"2026-05-16T08:48:15.070168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":"1606.01540","doi":"10.1109/jssc.2019","metadata_source":"pith","pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"OpenAI Gym","venue":"cs.LG","work_id":"6af98f3f-f074-41ae-a689-7dd7b4b8efde","year":2016},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:c1b06f45ee6b44c8b28f21aa1c31ed857b86fee15969a8ee3a8c73dc5a0e210b","observation_id":"e65f2b57-bd45-499e-ac9d-0847cc47d7c1","resolution":{"observed_at":"2026-05-16T08:48:14.838541Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Brown, B","venue":null,"work_id":"06e0ef9a-bec6-46d7-92db-dff9b542bc5e","year":2020},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:576f8095244c879f5aa3f2534c3622cb3f1dd4ff14b17289373abe13041d4b8e","observation_id":"b0bb4f68-9b28-4ddc-91c5-15129b1e15fe","resolution":{"observed_at":"2026-05-16T08:48:15.074531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bruce, M","venue":null,"work_id":"917c825e-e3c2-44cc-8c59-8137f28cd740","year":2024},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:0e8a85bb29506ed59ddf2749feada11a27b5ea987fba66af86e8f5ed67dfd36f","observation_id":"1c8aa3e9-9d7f-4469-9a53-d60a1890d5ba","resolution":{"observed_at":"2026-05-16T08:48:15.076598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18103","last_updated":"2025-01-08T14:13:23Z","snapshot_observed_at":"2026-07-06T17:51:36.160539Z","submitted_at":"2024-03-26T21:01:41Z","title":"Tutorial on Diffusion Models for Imaging and Vision","version":3},"cited_work":{"arxiv_id":"2403.18103","doi":"10.48550/arxiv.2403.18103","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.18103","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"year =","venue":null,"work_id":"98970f59-0322-4ff3-8176-12a36edb521b","year":2024},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2403.18103","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:124d3bc42142801fa5f2ef1be8e2a0fd411ee495a839db9812d8d0a7978f1cee","observation_id":"62b94b51-a62f-45a8-a2df-08784e9f42be","resolution":{"observed_at":"2026-05-16T08:48:14.841858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01392","last_updated":"2024-12-10T01:32:23Z","snapshot_observed_at":"2026-07-06T18:39:38.415138Z","submitted_at":"2024-07-01T15:43:25Z","title":"Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion","version":4},"cited_work":{"arxiv_id":"2407.01392","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.01392","snapshot_observed_at":"2026-07-10T01:46:41.061392Z","title":"M., Du, Y ., Simchowitz, M., Tedrake, R., and Sitzmann, V","venue":"cs.LG","work_id":"e7d25a8e-cc3d-4006-adb8-b4430c78e47f","year":2024},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2407.01392","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:8d6b96e76116dd0ece73a3e787302d299dda70e5a779248ea5a397c45f0aa979","observation_id":"4f6303ee-95ea-4f23-b7ae-bcb49599f045","resolution":{"observed_at":"2026-05-16T08:48:14.845798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14548","last_updated":"2023-02-28T04:19:48Z","snapshot_observed_at":"2026-07-06T13:57:36.100400Z","submitted_at":"2022-09-29T04:36:23Z","title":"Offline Reinforcement Learning via High-Fidelity Generative Behavior Modeling","version":2},"cited_work":{"arxiv_id":"2209.14548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.14548","snapshot_observed_at":"2026-07-03T04:17:36.926223Z","title":"Offline reinforcement learning via high-fidelity generative behavior modeling","venue":null,"work_id":"2e19c556-b92d-4e8b-b344-376d6dc01524","year":2022},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2209.14548","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:e6dc4294b79e901be787dfbc837395b8ebe91e94aab253f644a649a61016e016","observation_id":"9f6973f3-5d8a-48a4-bcfe-65f9796f460d","resolution":{"observed_at":"2026-05-16T08:48:14.849919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cf09179a-7d3a-4443-9918-fd9bff144f44","year":2022},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:bd886507417d9584b5b6f16e36329997d69fbf6a35c7c95fd5ba3c158a75ccfc","observation_id":"b2db49b4-bb19-4625-8133-0cdf3387f210","resolution":{"observed_at":"2026-05-16T08:48:15.084397Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00987","last_updated":"2023-10-16T05:05:56Z","snapshot_observed_at":"2026-07-06T16:13:38.508734Z","submitted_at":"2023-09-02T16:55:48Z","title":"Sequential Dexterity: Chaining Dexterous Policies for Long-Horizon Manipulation","version":2},"cited_work":{"arxiv_id":"2309.00987","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.00987","snapshot_observed_at":"2026-07-08T06:04:34.678310Z","title":"arXiv preprint arXiv:2309.00987 , year=","venue":"cs.RO","work_id":"c90e23d2-b482-4318-b3f7-eceddf19c9de","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2309.00987","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:c30ecdb4367bc9990fc3586342670dd723c4199731ed833a53d7fb3ce60e8663","observation_id":"2da8068c-b370-4e02-96eb-99988b3b96ab","resolution":{"observed_at":"2026-05-16T08:48:14.853322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fe040555-dd24-4914-a4ac-fa5ceb5db36f","year":2024},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:abad844f212d50d763470e4477907528185fe44f7473c0f73ab3ffa4ddad7d65","observation_id":"3722d88f-12eb-4f8b-a70b-40ebb751f6ad","resolution":{"observed_at":"2026-05-16T08:48:15.088267Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9da3dc94-1d3d-455d-8649-4d13ec0f1162","year":2024},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:905181b459998c1ae4dbec7c1e67709c28bc4cc367c3d364af22850c6cf72129","observation_id":"ce1b9978-aeab-4a09-b4c7-f8e851a084f8","resolution":{"observed_at":"2026-05-16T08:48:15.090407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17400","last_updated":"2024-06-21T16:45:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:01:02Z","title":"Directly Fine-Tuning Diffusion Models on Differentiable Rewards","version":2},"cited_work":{"arxiv_id":"2309.17400","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17400","snapshot_observed_at":"2026-07-09T02:25:55.929003Z","title":"Directly Fine-Tuning Diffusion Models on Differentiable Rewards","venue":"cs.CV","work_id":"cd2b3c6d-1ce2-434e-b114-5567026b9b82","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2309.17400","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:d77f8a7c93c59a95f1edbf082d28d9df78b6aff11cd4eefefb12a02161b7ee69","observation_id":"9388e5ab-fe5b-4e74-859d-4f6db40909d0","resolution":{"observed_at":"2026-05-16T09:11:32.190572Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16984","last_updated":"2024-03-14T19:28:48Z","snapshot_observed_at":"2026-07-06T16:25:17.629653Z","submitted_at":"2023-09-29T05:05:54Z","title":"Consistency Models as a Rich and Efficient Policy Class for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2309.16984","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16984","snapshot_observed_at":"2026-07-03T04:27:36.320586Z","title":"Ding and C","venue":null,"work_id":"68181b9b-bc9b-4590-8080-ca0e95d004f9","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2309.16984","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:bcd37c29b2364485b13b60c7c4c3255a7a070795ad40cfecde9516c985130fd2","observation_id":"b5700202-7739-4162-9ac2-0a8b20910eda","resolution":{"observed_at":"2026-05-16T08:48:14.860719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Engstrom, A","venue":null,"work_id":"8148e322-b753-42d8-a7f7-f9379ec0c88d","year":2019},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:e13498cfc038475e6dd1ca0d415df31a4e9fa16d59054e4c65acf74429c20ac7","observation_id":"b6fd875f-1610-48a3-a25e-5fb03b57d5f1","resolution":{"observed_at":"2026-05-16T08:48:15.096544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13362","last_updated":"2024-09-19T20:42:34Z","snapshot_observed_at":"2026-07-06T14:46:23.137171Z","submitted_at":"2023-01-31T01:37:48Z","title":"Optimizing DDPM Sampling with Shortcut Fine-Tuning","version":4},"cited_work":{"arxiv_id":"2301.13362","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.13362","snapshot_observed_at":"2026-07-04T08:59:43.060142Z","title":"Optimizing ddpm sampling with shortcut fine-tuning.arXiv preprint arXiv:2301.13362","venue":null,"work_id":"cf8257fc-0ade-42ef-afc0-fe742cff11dd","year":2024},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2301.13362","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:52245b8ee4fcd7172da3748158999379679ea6d316b0ade04c33ddad55ae6eea","observation_id":"f64c0a8b-9824-4093-ade5-fc045b372b82","resolution":{"observed_at":"2026-05-16T08:48:14.864965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"89ddf1e8-2945-41f9-a832-cba552573ae2","year":2024},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:f878daf18b5a9531026cdf678c03d496b686856e9fed06c0330d7aa7b1f5df00","observation_id":"aca13e95-0d89-4088-b5cc-eb503d7cb804","resolution":{"observed_at":"2026-05-16T08:48:15.100372Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fefferman, S","venue":null,"work_id":"490258e7-4fea-4e19-8c53-3260f65b7e74","year":2016},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:43d86dee48465712df188c85fd16536507ac1d9f6e480c8fe3cde15eb2b8ac20","observation_id":"bfcfe2a8-0a6f-4dd2-90d5-a339d57c9847","resolution":{"observed_at":"2026-05-16T08:48:15.102333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Florence, L","venue":null,"work_id":"c95abe10-943b-4eb0-b0f5-fab63942b665","year":2019},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:0e26cf3158bd133c0e164f894de5b3aa58f4e336655247a12d0dd38d471811b6","observation_id":"cf9196a7-3b82-43da-b8bf-349fa9112a12","resolution":{"observed_at":"2026-05-16T08:48:15.104451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Florence, C","venue":null,"work_id":"67174ae8-99aa-4ef8-913a-9795a0d1e12d","year":2022},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:aa7d4fc73db8084a685944fc97f940729114f9a160e2447fde56e01d8ea0b7cd","observation_id":"89c55f4c-1d9f-49da-a28c-a0353b44d3fb","resolution":{"observed_at":"2026-05-16T08:48:15.106536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:7a72ece8bc384c5df55586f44748b71914170190ab1d77798d2bffdb09c7ccfe","observation_id":"5a6f5bcd-6534-4829-b82c-b488f681c20d","resolution":{"observed_at":"2026-05-16T08:48:14.822907Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02117","last_updated":"2024-01-04T07:55:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T07:55:53Z","title":"Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation","version":1},"cited_work":{"arxiv_id":"2401.02117","doi":"10.48550/arxiv.2401.02117","metadata_source":"pith","pith_arxiv_id":"2401.02117","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation","venue":"cs.RO","work_id":"5f6ff8ef-ed80-4c00-92c2-361c80bf8448","year":2024},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2401.02117","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:02e7b4566ecf37f69d6e294715a7f0ddbc7513f60898cba661278ae6df678254","observation_id":"c5e61fee-a515-4fbe-acc6-addb25fb0708","resolution":{"observed_at":"2026-05-16T08:48:14.868566Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00695","last_updated":"2022-06-01T18:04:43Z","snapshot_observed_at":"2026-07-06T13:16:32.021229Z","submitted_at":"2022-06-01T18:04:43Z","title":"Know Your Boundaries: The Necessity of Explicit Behavioral Cloning in Offline RL","version":1},"cited_work":{"arxiv_id":"2206.00695","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.00695","snapshot_observed_at":"2026-07-04T08:59:43.304230Z","title":"Goo and S","venue":null,"work_id":"3d58821a-164f-4ec7-8c61-caf3a896a1fb","year":2022},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2206.00695","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:62d3b8bb1b35dd1ec941395564d141fd403b5f86c873af335eed639d648a1fe6","observation_id":"373d9164-a265-41d8-bc18-049d89df86fd","resolution":{"observed_at":"2026-05-16T08:48:14.872015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-07-06T08:32:23.122608Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.11956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-04T13:39:51.078263Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"ad002352-9797-48d1-b2ea-543ce79e8165","year":1910},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:2095fe963bdc28f02281e80df8ee533141d4fb06db78dfd0dc1b20eb34dc7e67","observation_id":"de2072f5-0ece-47fb-96a7-13ab1a87fafa","resolution":{"observed_at":"2026-05-16T08:48:14.875918Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Haarnoja, A","venue":null,"work_id":"3b9dc781-939e-4359-9c67-d82a18a67683","year":2018},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:425197e86e2ceadd2e709c05df1e7af2d9d2588d221891f29ad7e2893fa8ed1b","observation_id":"7ff373f3-343a-4e3b-9590-1721b0eb3a3a","resolution":{"observed_at":"2026-05-16T08:48:15.116187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01497","last_updated":"2023-03-02T18:57:38Z","snapshot_observed_at":"2026-07-30T15:09:59.497278Z","submitted_at":"2023-03-02T18:57:38Z","title":"Teach a Robot to FISH: Versatile Imitation from One Minute of Demonstrations","version":1},"cited_work":{"arxiv_id":"2303.01497","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.01497","snapshot_observed_at":"2026-07-02T23:37:27.693272Z","title":"Haldar, J","venue":null,"work_id":"ab98098d-4098-4ecb-b9f0-2029d13e022d","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2303.01497","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:6e6be16598f251cd1f726167c19c71ec809dbdd7ab4a165a5aca821348f96e86","observation_id":"5e66e647-3eb5-497e-9e62-6408778c974a","resolution":{"observed_at":"2026-05-16T08:48:14.879677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":"2304.10573","doi":"10.1007/978-3-658-09994-7","metadata_source":"pith","pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","venue":"cs.LG","work_id":"913326e6-9ea4-4974-b2d7-ff53984b387f","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:4805015af67e38c168e64c1f7d74e32443dd0e379418d1b5e863c7f10af0c62f","observation_id":"878d79bc-74fd-4246-b73e-ca6f977d5087","resolution":{"observed_at":"2026-05-16T08:48:14.883343Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12821","last_updated":"2023-05-22T08:29:00Z","snapshot_observed_at":"2026-08-01T20:31:21.496677Z","submitted_at":"2023-05-22T08:29:00Z","title":"FurnitureBench: Reproducible Real-World Benchmark for Long-Horizon Complex Manipulation","version":1},"cited_work":{"arxiv_id":"2305.12821","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.12821","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"05f6f9c5-fb2e-4ced-87ce-126b7181a74f","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2305.12821","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:84b4ce12e27fb3657cfcbf4dc7cac751ca88083123ff8373fe80fa7a731ffe35","observation_id":"e5bbb4ca-f2b0-41e3-993f-5cf03bfac378","resolution":{"observed_at":"2026-05-16T08:48:14.886574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hester, M","venue":null,"work_id":"ab4107f5-1875-4c8c-9f3a-07ea6ff240f7","year":2018},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:0473384b9c7995ae1fcb869eb7230af448060d3e7bd7e4a0b5480cf1995dcf6e","observation_id":"d738a798-3bee-4f2a-b78e-a572ec5163a9","resolution":{"observed_at":"2026-05-16T08:48:15.123589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8e15246a-2b64-45df-9bee-2777bfb37a14","year":2020},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:a9d1ea06f7d5f92d086b15ddf0b611f938e664cfc81d6ee6366180d108fef95f","observation_id":"3ef94dfb-c94a-4e4b-831b-9aab0bc0d2f7","resolution":{"observed_at":"2026-05-16T08:48:15.125418Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2210.02303","doi":"10.48550/arxiv.2210.02303","metadata_source":"pith","pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","venue":"cs.CV","work_id":"bb20d241-dc6f-4b0a-b071-fd43a2cbd57f","year":2022},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:44cab28e6f76e8a208304ed4d8fcfcd70f9c2845c4995d15ef5bdb43cc223be0","observation_id":"b1e2ee15-62d4-4ef8-b3cf-6fe58860d580","resolution":{"observed_at":"2026-05-16T08:48:14.889827Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-07-06T16:42:53.513439Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2311.02198","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-07-03T10:58:02.715158Z","title":"Imitation bootstrapped reinforcement learn- ing.arXiv preprint arXiv:2311.02198","venue":null,"work_id":"a3617785-a57a-4ba3-af3b-a179f510bfea","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:6eb1b3aa8415a38c9ccd07d762568044415140634c9e8529e1f9364649eb2afa","observation_id":"e2f0e55a-ef98-4bc1-841c-b4476a8e8720","resolution":{"observed_at":"2026-05-16T08:48:14.893529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Huang, R","venue":null,"work_id":"0ba43d4b-5a3b-48d5-a1a5-97f417bbd77d","year":2022},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:f868c10237e4c5f123ffc0fef2d45e75240e64285dc09513bdc4bf09ff961a30","observation_id":"3e2957bf-5e4d-4657-8beb-0dec2eddcacf","resolution":{"observed_at":"2026-05-16T08:48:15.130870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Huang, L","venue":null,"work_id":"bd1b8952-5247-48aa-af30-f7cce8800269","year":2024},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:b9d586dc88983a65de4afafbd80043835ebeceb2d80102a5b5295840f10d86a2","observation_id":"1b4e7401-0600-4b2d-b788-612d3b0ecee6","resolution":{"observed_at":"2026-05-16T08:48:15.132632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hwangbo, J","venue":null,"work_id":"2bc71199-990a-455e-9685-4b3fbc4ab025","year":2019},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:ae0764f590784396115f662635d1594173d3942a4a78f12d334153007ad73b91","observation_id":"e4769549-a34a-4c94-8cf0-43f9a838bfda","resolution":{"observed_at":"2026-05-16T08:48:15.134367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06356","last_updated":"2024-04-09T14:46:48Z","snapshot_observed_at":"2026-08-04T07:21:52.509781Z","submitted_at":"2024-04-09T14:46:48Z","title":"Policy-Guided Diffusion","version":1},"cited_work":{"arxiv_id":"2404.06356","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.06356","snapshot_observed_at":"2026-07-02T11:46:56.124252Z","title":"Janner, M., Li, Q., and Levine, S","venue":null,"work_id":"f39e3076-ea89-4c9a-991b-6e4d83a0231e","year":2024},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2404.06356","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:58da53e33aaf1a308b0a87f36fdc32f300f9e1dcbabdf339ad1b248863e675b9","observation_id":"207af9cd-d9ab-4bb8-8f6f-30f1af284488","resolution":{"observed_at":"2026-05-16T08:48:14.896638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09991","last_updated":"2022-12-21T01:06:18Z","snapshot_observed_at":"2026-07-06T13:11:57.798513Z","submitted_at":"2022-05-20T07:02:03Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","version":2},"cited_work":{"arxiv_id":"2205.09991","doi":"10.48550/arxiv.2205.09991","metadata_source":"pith","pith_arxiv_id":"2205.09991","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","venue":"cs.LG","work_id":"38b2c635-b754-412a-a8f5-dfcf3e405c95","year":2022},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2205.09991","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:cab6c4fe382d3593036f710f1c2241443d60218f9f6fa7f531d9e512508c0319","observation_id":"19cbe77a-fd06-4feb-a8a4-7841946094ef","resolution":{"observed_at":"2026-05-16T08:48:14.899710Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14606","last_updated":"2024-02-22T14:54:28Z","snapshot_observed_at":"2026-07-06T17:34:03.539565Z","submitted_at":"2024-02-22T14:54:28Z","title":"Towards Diverse Behaviors: A Benchmark for Imitation Learning with Human Demonstrations","version":1},"cited_work":{"arxiv_id":"2402.14606","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14606","snapshot_observed_at":"2026-06-30T07:54:22.177207Z","title":"Towards diverse behaviors: A benchmark for imitation learning with human demonstrations.arXiv preprint arXiv:2402.14606,","venue":null,"work_id":"6b18ae13-ebf7-475d-88d4-655bddb33f13","year":2024},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2402.14606","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:738d91674c3b93095319f4159a1416af9a9d9d6f29408c137b25770bca18b2c7","observation_id":"9c6c5695-e309-4556-879d-e509aa1df0cd","resolution":{"observed_at":"2026-05-16T08:48:14.903087Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f319d28b-545e-4fd0-b1cd-c0f25898672d","year":2024},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:06a3e06d8fe824f4108065bf11f02f5cf122f02368291bb7de484c68b3bffc77","observation_id":"897764b3-e58d-4ce1-82b0-fd7a1eca23ee","resolution":{"observed_at":"2026-05-16T08:48:15.142239Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kaufmann, L","venue":null,"work_id":"f2332223-d0bc-4d3e-a577-247f8a1afcc4","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:b92554da9a205d93159c7f9252540f420961f590762c6358f552eb935a3fe4f5","observation_id":"6fdd6061-686d-4869-a20f-04de5dd0d5d3","resolution":{"observed_at":"2026-05-16T08:48:15.144052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09761","last_updated":"2021-03-30T19:48:38Z","snapshot_observed_at":"2026-07-06T09:57:19.117228Z","submitted_at":"2020-09-21T11:20:38Z","title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","version":3},"cited_work":{"arxiv_id":"2009.09761","doi":"10.48550/arxiv.2009.09761","metadata_source":"pith","pith_arxiv_id":"2009.09761","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","venue":"eess.AS","work_id":"042bbb99-f912-4aa4-aa7a-252c7b6379a8","year":2020},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2009.09761","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:d2fb3d675950091cebb5d1e2a8a22e9b15f24427ba2e47335172f06e8ea929af","observation_id":"a3e21a21-e1bc-4461-82b7-ef25800d6f75","resolution":{"observed_at":"2026-05-16T08:48:14.906115Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03181","last_updated":"2024-06-28T04:15:33Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:19:29Z","title":"Behavior Generation with Latent Actions","version":2},"cited_work":{"arxiv_id":"2403.03181","doi":"10.48550/arxiv.2403.03181","metadata_source":"pith","pith_arxiv_id":"2403.03181","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Behavior generation with latent actions","venue":"cs.LG","work_id":"859887e2-2079-408c-b000-3aad886b3387","year":2024},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2403.03181","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:eea5ee90c1d6b065b32bcf8cc3f86a91e437e0cf55c34bb5f65ade7201a139e0","observation_id":"155b40ea-1331-4e01-91cb-ab31e395b473","resolution":{"observed_at":"2026-05-16T08:48:14.931553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03351","last_updated":"2024-03-17T04:40:06Z","snapshot_observed_at":"2026-07-06T16:43:46.708045Z","submitted_at":"2023-11-06T18:58:59Z","title":"Uni-O4: Unifying Online and Offline Deep Reinforcement Learning with Multi-Step On-Policy Optimization","version":4},"cited_work":{"arxiv_id":"2311.03351","doi":"10.48550/arxiv.2311.03351","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03351","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Uni-o4: Unifying online and offline deep reinforcement learning with multi-step on-policy optimization.arXiv preprint arXiv:2311.03351","venue":null,"work_id":"59faa29f-f5b7-4c5a-bb06-3bc565961e07","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2311.03351","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:bbefedcefd770174d69616261c22e532d44bb19ad2e9aa20a341a0e55d1be916","observation_id":"1356edd8-6914-40d8-9d0b-b7e6692ce847","resolution":{"observed_at":"2026-05-16T08:48:14.935556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.01952","last_updated":"2020-11-05T22:05:53Z","snapshot_observed_at":"2026-08-03T22:00:01.929630Z","submitted_at":"2020-06-02T21:32:58Z","title":"Learning Active Task-Oriented Exploration Policies for Bridging the Sim-to-Real Gap","version":2},"cited_work":{"arxiv_id":"2006.01952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.01952","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Liang, S","venue":null,"work_id":"666e7d3a-e6fe-4a3c-b7a6-ed322cb2403c","year":2006},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2006.01952","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:71cb8bbaa76732aba604f0ffa4ded3ede90747833bc639714ec6de2c05071aff","observation_id":"742849f3-951f-4432-a524-cfd741545fc4","resolution":{"observed_at":"2026-05-16T08:48:14.938657Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01877","last_updated":"2023-05-12T16:23:37Z","snapshot_observed_at":"2026-07-06T14:48:11.014641Z","submitted_at":"2023-02-03T17:28:59Z","title":"AdaptDiffuser: Diffusion Models as Adaptive Self-evolving Planners","version":2},"cited_work":{"arxiv_id":"2302.01877","doi":"10.48550/arxiv.2302.01877","metadata_source":"arxiv_reference","pith_arxiv_id":"2302.01877","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2302.01877 , year=","venue":null,"work_id":"b3b9e762-4713-438a-99ab-8bb8f48c145c","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2302.01877","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:c6f981828382770e2385bbab8e6b59b6e6e983eaa0fab684739eaf115ccbac3c","observation_id":"1b302e06-57de-4a1b-afc3-b4a893556f3f","resolution":{"observed_at":"2026-05-16T08:48:14.941618Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T01:23:49.891399+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T01:23:49.891399+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":"1509.02971","doi":"10.1137/22m1480409","metadata_source":"pith","pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Continuous control with deep reinforcement learning","venue":"cs.LG","work_id":"41a65444-c819-4303-a1f1-b075aa86d40c","year":2015},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:9ff5c72cfc49d799a036ea3243c5a6a52b1ddfb268f7a167b40c32f24617b74e","observation_id":"df6b903f-f4d1-481f-b74c-616082f4f03d","resolution":{"observed_at":"2026-05-16T08:48:14.944595Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"83f51192-7dd2-472f-9651-d5dab3cd90b9","year":2021},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:69491cf8d4876df6bed6756f11c8a68c4a09a4eb1a0efadb31534aee5b38ed09","observation_id":"0982a0eb-cce3-41b3-8c02-48d8a9a31d43","resolution":{"observed_at":"2026-05-16T08:48:15.157444Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"89738a4c-1a02-4c8b-9fa1-6aa9c4737bd5","year":2024},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:8d91d3e0836b45615defba0f9f413bc175f66f9be762c3fb78e32807ff5cb6f7","observation_id":"604884e4-c53e-49c5-9bc8-199d48c873d9","resolution":{"observed_at":"2026-05-16T08:48:15.159249Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16013","last_updated":"2025-03-20T09:13:10Z","snapshot_observed_at":"2026-07-06T17:21:42.659240Z","submitted_at":"2024-01-29T10:01:10Z","title":"SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2401.16013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.16013","snapshot_observed_at":"2026-07-03T15:48:35.804876Z","title":null,"venue":null,"work_id":"b0f887db-62d2-4805-86a8-6f085bef7756","year":2025},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2401.16013","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:16d3410035ae17c5e31212f496fffed9efcd8632d5cb7d1a8f8d5eced9a8c8ca","observation_id":"d991f1a3-6ec4-42a9-b978-4fe163b283cb","resolution":{"observed_at":"2026-05-16T08:48:14.947648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"24522d1a-a82b-41fa-bdeb-68cef5f4b4ec","year":2022},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:b647a9e5d948aca92f16e4e457b5c1b67f89ef03aad74360e0aecfce8d6c9a5e","observation_id":"f0e52589-5d3b-4192-bf35-4835a00ef1d4","resolution":{"observed_at":"2026-05-16T08:48:15.049191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10470","last_updated":"2021-08-25T23:42:59Z","snapshot_observed_at":"2026-07-06T11:40:56.544714Z","submitted_at":"2021-08-24T01:38:11Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","version":2},"cited_work":{"arxiv_id":"2108.10470","doi":"10.48550/arxiv.2108.10470","metadata_source":"pith","pith_arxiv_id":"2108.10470","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","venue":"cs.RO","work_id":"a21210c8-5b8f-429a-accc-fb4ca1efd19d","year":2021},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2108.10470","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:455b2c39a09aa99d58f0d69e512e2c882905486d9f170fb683bd2f4afb59f305","observation_id":"f15a744a-7a90-4d55-bc57-ef1cc7e6f697","resolution":{"observed_at":"2026-05-16T08:48:14.951019Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.03298","last_updated":"2021-09-25T00:37:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-08-06T20:48:30Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","version":2},"cited_work":{"arxiv_id":"2108.03298","doi":"10.48550/arxiv.2108.03298","metadata_source":"pith","pith_arxiv_id":"2108.03298","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","venue":"cs.RO","work_id":"6a4c95c5-540e-4854-946d-c7c8a6c540ba","year":2021},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2108.03298","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:e78fd205bd69de83846db88207ff95236c4f4d5fdbc0dbed6b9cfdcb9f65e14b","observation_id":"fa2403fc-9764-4ae2-89f9-24f751ce7ca1","resolution":{"observed_at":"2026-05-16T08:48:14.954439Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":"2006.09359","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-07-08T22:35:40.693821Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","venue":"cs.LG","work_id":"f0a11265-1acf-4ffc-a822-08bd04b6bddf","year":2020},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:105e5ff8e52f4c1d7ed739f0f05e1bd7358665f7b398507ef0cb00cbcdac5c42","observation_id":"5e7fcb95-9787-46ce-9e07-40e410eec516","resolution":{"observed_at":"2026-05-16T08:48:14.957892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nakamoto, S","venue":null,"work_id":"9381c864-edf5-452c-a86a-99685776c2e3","year":2024},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:fdc80a2ceb638288177ff251ed5a6dd8380f47b16cb79dac79ccf48096be35bf","observation_id":"36a48b8c-c2df-41d0-a54b-62274b621b84","resolution":{"observed_at":"2026-05-16T08:48:15.072228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f01f319d-83ca-457a-8c1c-0f53409a3202","year":2021},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:00fc33c4c6625217a38b6f714b71c0fdd6010d4cd0c00a5f02c40c7a28c016ca","observation_id":"01610e55-c2d7-408b-880e-25024554c854","resolution":{"observed_at":"2026-05-16T08:48:15.078608Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4dc65b33-e8ec-431f-9f4d-f4b82f6b9350","year":2018},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:ccd78c9ae991bf96d345f859e16339645edecd7716bd8258eb8cfae4c8c85b24","observation_id":"b5f3fc1f-9d8f-40ce-a304-bfc341f8a582","resolution":{"observed_at":"2026-05-16T08:48:15.080483Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ouyang, J","venue":null,"work_id":"5c27c576-ec52-43e5-9dad-12d0d64a546b","year":2022},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:33903fab031338711f607077d4d9c49c8bd7c0073458ba3094077c0d9487e186","observation_id":"d16ff11d-0094-492a-b86c-7a6160eb0b50","resolution":{"observed_at":"2026-05-16T08:48:15.082537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10677","last_updated":"2023-03-03T14:18:34Z","snapshot_observed_at":"2026-07-06T14:44:34.387448Z","submitted_at":"2023-01-25T16:31:05Z","title":"Imitating Human Behaviour with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2301.10677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.10677","snapshot_observed_at":"2026-07-04T07:59:40.250520Z","title":"Imitating human behaviour with dif- fusion models","venue":null,"work_id":"1551dccf-8902-46b9-bb62-f0102588de77","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2301.10677","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:b45a59bf166eafadb828531079bad45e02e10e55e07b379c5903ae782794c797","observation_id":"ba3952f7-0862-43f8-a735-ebde9901b913","resolution":{"observed_at":"2026-05-16T08:48:14.960944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1910.00177","doi":"10.48550/arxiv.1910.00177","metadata_source":"pith","pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-07-10T23:07:47.949672Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","venue":"cs.LG","work_id":"ab561983-ab59-4f04-a11e-a467ddde4848","year":2019},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:3bd081e9a3292decbb7acc96db2c8e0e4267445a67ac9bb49e264bd9add2c309","observation_id":"428dd748-3e80-4a20-8a92-146606bf9833","resolution":{"observed_at":"2026-05-16T08:48:14.964693Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cd8050ea-687f-44bb-956c-30f474ab7b22","year":2021},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:76906ed359bd8a555369496d924e7f89776242703c475a4e2ad6d38227c7bced","observation_id":"4a0b17cc-8989-40af-8bca-ee7a3b823343","resolution":{"observed_at":"2026-05-16T08:48:15.094621Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04848","last_updated":"2024-06-03T14:18:29Z","snapshot_observed_at":"2026-07-06T15:40:00.975837Z","submitted_at":"2023-06-08T00:56:33Z","title":"Interpreting and Improving Diffusion Models from an Optimization Perspective","version":4},"cited_work":{"arxiv_id":"2306.04848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.04848","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Permenter and C","venue":null,"work_id":"2b55e0dc-b00f-4cca-b2b2-22a0d0bba93c","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2306.04848","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:ccf4fb3676cb2fe58bbea832c9508e803d7e64004529fb22f88d4c12f93639a5","observation_id":"dc68bc04-70a0-4434-9196-8803b80c98ac","resolution":{"observed_at":"2026-05-16T08:48:14.967950Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Peters and S","venue":null,"work_id":"ea0c05e4-e8d2-4d7d-95b4-7e95bf7cc359","year":2007},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:bf9d44a1eaa43dd13dbec57fed0f979f65aeeaf34a535a3415a7ebc768e04cf0","observation_id":"b8f59e9e-3868-47c6-9d33-74f7baf4762d","resolution":{"observed_at":"2026-05-16T08:48:15.110529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c58e6014-e1cf-4803-b3c0-c5a482470a7a","year":1988},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:bf24f7dbb01f66944ff62cc0528cc637d0d766b9fbc2d9abb34f04ab4c681311","observation_id":"0551ad93-1d15-41f8-acd3-b3b5e711fac2","resolution":{"observed_at":"2026-05-16T08:48:15.112446Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14988","last_updated":"2022-09-29T17:50:40Z","snapshot_observed_at":"2026-07-06T13:57:54.539656Z","submitted_at":"2022-09-29T17:50:40Z","title":"DreamFusion: Text-to-3D using 2D Diffusion","version":1},"cited_work":{"arxiv_id":"2209.14988","doi":"10.48550/arxiv.2209.14988","metadata_source":"pith","pith_arxiv_id":"2209.14988","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"DreamFusion: Text-to-3D using 2D Diffusion","venue":"cs.CV","work_id":"7529df29-9980-4a8a-b55e-307e3c2f357b","year":2022},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2209.14988","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:6f8131089c9f4ade21eb790dec0df2b219244bf20ad699255d303afaf554affd","observation_id":"cd5b7c29-02b9-421b-b43f-410a2df7d7db","resolution":{"observed_at":"2026-05-16T08:48:14.971526Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:01.924447+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:01.924447+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Popova, O","venue":null,"work_id":"b63fdff5-8d93-4cee-a66a-89a7a9caeb18","year":2018},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:2a91b27d1d703f6eae72acaa1b9c8e7f73d4968f0bd3f8a08cf4b086523fac49","observation_id":"5de135df-59cb-4786-8bbe-515a5f0d00fe","resolution":{"observed_at":"2026-05-16T08:48:15.118047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-07-06T17:04:58.670142Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":"2312.11752","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-07-03T04:17:36.937596Z","title":"Learning a","venue":null,"work_id":"cc696d86-62f6-40ba-80af-8cbd54495ef2","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:ed280ef73abfcfed8cbfe606cfffb79a6c1838ee67883167cc86d67d5f20c077","observation_id":"16c179a2-3336-4052-94c8-4f91798adf1a","resolution":{"observed_at":"2026-05-16T08:48:14.975258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Radford, J","venue":null,"work_id":"b3f625cf-4f84-4fad-944a-0740e210500c","year":2021},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:1892773f698f08b57eb58fc355ccd6c2ebaf856c5bf96b242e2a9bd0884b4f8c","observation_id":"5e2d455d-2da9-46c3-9821-d7c39478237f","resolution":{"observed_at":"2026-05-16T08:48:15.121888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.10087","last_updated":"2018-06-26T13:31:37Z","snapshot_observed_at":"2026-07-06T06:01:51.192687Z","submitted_at":"2017-09-28T17:51:13Z","title":"Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations","version":2},"cited_work":{"arxiv_id":"1709.10087","doi":"10.48550/arxiv.1709.10087","metadata_source":"pith","pith_arxiv_id":"1709.10087","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations","venue":"cs.LG","work_id":"e0799bae-989e-4c06-891d-c93b0b32024d","year":2017},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/1709.10087","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:5657f13741dde7848342adebd7f21085f620234e42a8b9331c7b3886ee270dfc","observation_id":"8bc30cf8-4c1a-4898-8881-acc51565a62e","resolution":{"observed_at":"2026-05-16T08:48:14.979202Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b7811388-0f36-4554-8f15-db9dfbf285f5","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:a3491ea2bbab27ec06a827ee5e272f024a90bf92d5466288cde2e6fa00bd17c8","observation_id":"499f6d8e-ba36-4e53-b0db-65f384514ed5","resolution":{"observed_at":"2026-05-16T08:48:15.129159Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02532","last_updated":"2023-06-01T15:18:21Z","snapshot_observed_at":"2026-07-06T15:12:33.847206Z","submitted_at":"2023-04-05T15:52:34Z","title":"Goal-Conditioned Imitation Learning using Score-based Diffusion Policies","version":2},"cited_work":{"arxiv_id":"2304.02532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.02532","snapshot_observed_at":"2026-07-10T16:47:24.457758Z","title":"Goal-conditioned imitation learning using score-based diffusion policies","venue":"cs.LG","work_id":"86c1c03b-102c-427e-9305-055f1a55fe15","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2304.02532","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:c42890fa974f60276b30eeec939792034882ba8a917bb6865dbb8e9610d07727","observation_id":"a3805bbf-4098-4eca-b228-8771291a13d8","resolution":{"observed_at":"2026-05-16T08:48:14.982840Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08533","last_updated":"2024-03-27T09:11:48Z","snapshot_observed_at":"2026-07-06T17:01:21.970309Z","submitted_at":"2023-12-13T21:46:09Z","title":"World Models via Policy-Guided Trajectory Diffusion","version":4},"cited_work":{"arxiv_id":"2312.08533","doi":"10.48550/arxiv.2312.08533","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08533","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Rigter, J","venue":null,"work_id":"e49877ab-0831-442f-9af6-b95e0d035b4d","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2312.08533","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:09db53746e7f3f58d7c42c1ce85d7bd07664f602c42a9a05f58ceab6d4b8cb9d","observation_id":"663e197e-a569-400a-8227-212c98c82aeb","resolution":{"observed_at":"2026-05-16T08:48:14.987049Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T01:24:00.542702+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T01:24:00.542702+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rombach, A","venue":null,"work_id":"9f79f15e-e159-4495-9213-55389bac004b","year":2022},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:d70227a7f4c83d48bb2451dc3726d90e3c8d8bfef07c6c740a43d99671382eaa","observation_id":"45bf2598-3577-4c36-a694-fb57716f0c1c","resolution":{"observed_at":"2026-05-16T08:48:15.140545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ronneberger, P","venue":null,"work_id":"ad4dfcda-23d3-4af3-ac47-36379f1e67e2","year":2015},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:35a8b06fdadb75c7392edf60c54413ba14e1c6f4842abfbee3e65e0123acbdef","observation_id":"191b30f4-1b13-4b29-b0ad-f98b38730f58","resolution":{"observed_at":"2026-05-16T08:48:15.145772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c33459a0-fd19-4612-b7d0-926e4a9d076b","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:ec4070bcdde67db8e4891648068cc48bf4b2229213c66d669af0bad0585b1b6e","observation_id":"c3c90cbb-12ec-40fd-aade-ba21f527cd43","resolution":{"observed_at":"2026-05-16T08:48:15.147724Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07524","last_updated":"2024-11-10T20:34:34Z","snapshot_observed_at":"2026-07-06T18:29:04.294349Z","submitted_at":"2024-06-11T17:51:40Z","title":"Simple and Effective Masked Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2406.07524","doi":"10.48550/arxiv.2406.07524","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.07524","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Simple and effective masked diffusion language models","venue":null,"work_id":"5df1af01-b5ff-4722-96c8-091c22b808b7","year":2024},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2406.07524","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:8f03395b1425a7ddf583cd7986df276c3ff9a7ea63d23683719b72e3b28b0d7c","observation_id":"7e7658b8-5ad6-4b95-98a5-b9ebda3c2b53","resolution":{"observed_at":"2026-05-16T08:48:14.991270Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":"1506.02438","doi":"10.48550/arxiv.1506.02438","metadata_source":"pith","pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-07-11T03:57:46.887146Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","venue":"cs.LG","work_id":"38e3ca94-96f0-4b19-a355-0754931af8be","year":2015},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:5cc42e2ef35117acea223723554e9835b2373ede96061a2a042fa8645fae297b","observation_id":"f69d719f-a5cc-474a-afbd-a2b2ae833406","resolution":{"observed_at":"2026-05-16T08:48:14.995362Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:c2ba57a538402259237e497c05d02145be22e141123789eef007f758fb2995f8","observation_id":"b0ec06c1-2c5b-4209-879e-aa7929218867","resolution":{"observed_at":"2026-05-16T08:48:14.999602Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sohl-Dickstein, E","venue":null,"work_id":"6f5b286a-8645-4250-ac69-fa9c8f87d58c","year":2015},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:1b013510d1fb985a9609c3b7067f95b9acdf61b9ee3e61af1d305a92794de6bb","observation_id":"adeff572-726d-4666-86a6-d6c7e1315a17","resolution":{"observed_at":"2026-05-16T08:48:15.155612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":"2010.02502","doi":"10.48550/arxiv.2010.02502","metadata_source":"pith","pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-07-11T02:47:49.167563Z","title":"Denoising Diffusion Implicit Models","venue":"cs.LG","work_id":"8fa2128b-d18c-405c-ac92-0e669cf89ac0","year":2020},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:9e0152a5a7a8490b5987b0efcab240d52e0d7b1c6ac8826fa3a952b727c16e3a","observation_id":"5da1fee1-02d7-40db-bc17-97e7664aae02","resolution":{"observed_at":"2026-05-16T08:48:15.002755Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":"2011.13456","doi":"10.1088/1748-9326/aae98d","metadata_source":"pith","pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","venue":"cs.LG","work_id":"d9110e53-a5d4-4794-a4c5-a575e91c31ad","year":2020},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:451591f1fc0a1cead2fae7c1cbebc1ceadee0c397d7d68bfe8a6305edcdee35b","observation_id":"4c0fb82d-3ff4-444d-9c07-425a9fa56ca4","resolution":{"observed_at":"2026-05-16T08:48:15.006507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07896","last_updated":"2023-10-11T21:07:14Z","snapshot_observed_at":"2026-07-06T16:31:33.607406Z","submitted_at":"2023-10-11T21:07:14Z","title":"NoMaD: Goal Masked Diffusion Policies for Navigation and Exploration","version":1},"cited_work":{"arxiv_id":"2310.07896","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.07896","snapshot_observed_at":"2026-07-03T15:28:34.025922Z","title":"NoMaD: Goal Masked Diffusion Policies for Navigation and Exploration","venue":null,"work_id":"218ec55b-de9d-4857-8443-be4b45807d82","year":2024},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2310.07896","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:28186896114216c6bf855333768a0741f935082a27b375dbc9383826b707469d","observation_id":"5a73522d-5759-4371-b6b5-48190f546df5","resolution":{"observed_at":"2026-05-16T08:48:15.010016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"be4669b1-08f2-437c-a649-6d34e1b8112a","year":2018},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:9a8bf326672a40c4a78c9df229da1b11b508377e0c4ee852784ab45b267cdee2","observation_id":"356ceedf-4fe0-46fe-8e5f-362fcd95820a","resolution":{"observed_at":"2026-05-16T08:48:15.068163Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c0ee4930-7901-4f07-bb9f-eda95ff4a6d3","year":1999},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:35e3f6c87a2ee1db925054d6e367545b9fd0e915fe8f43a773a98e9b966165b3","observation_id":"713d4dd9-23cf-4335-80dd-543914033f93","resolution":{"observed_at":"2026-05-16T08:48:15.086360Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Todorov, T","venue":null,"work_id":"e888bdd3-88f3-4761-b89c-be47c8a2857c","year":2012},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:390c32b0712afd7bf053e0be457120188f47f2f17e6d11dae8dba58e32f2d617","observation_id":"dfabe98e-6efe-48ad-8eef-0e80dba5264e","resolution":{"observed_at":"2026-05-16T08:48:15.092390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03949","last_updated":"2024-11-24T02:02:33Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:36Z","title":"Reconciling Reality through Simulation: A Real-to-Sim-to-Real Approach for Robust Manipulation","version":3},"cited_work":{"arxiv_id":"2403.03949","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03949","snapshot_observed_at":"2026-07-04T17:29:59.793610Z","title":"Rec- onciling reality through simulation: A real-to-sim-to- real approach for robust manipulation","venue":null,"work_id":"d4ee5882-8029-4561-8cd0-42735b06fb84","year":2024},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2403.03949","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:a82dc6f65da6192e0d8e766ae34e71da627bfd04a4de0f967a458e3d96143d0f","observation_id":"ab7c209e-66ee-42e9-a4df-4d0b04c2c6fb","resolution":{"observed_at":"2026-05-16T08:48:15.014213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vaswani, N","venue":null,"work_id":"4a689817-04e9-4f18-af9f-db364c0d25ea","year":2017},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:f0cb185761fc17fedb7647d42535e948557e415e6ebe6d4b64243affd7ade96a","observation_id":"2e5a19b2-9bcb-4236-9478-35b9fe1b0f1a","resolution":{"observed_at":"2026-05-16T08:48:15.114286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.08817","last_updated":"2018-10-08T13:38:52Z","snapshot_observed_at":"2026-08-02T04:07:03.272158Z","submitted_at":"2017-07-27T11:16:53Z","title":"Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards","version":2},"cited_work":{"arxiv_id":"1707.08817","doi":null,"metadata_source":"pith","pith_arxiv_id":"1707.08817","snapshot_observed_at":"2026-07-10T21:47:36.312721Z","title":"Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards","venue":"cs.AI","work_id":"a4478529-fa6c-4c19-98bd-743c55919fd6","year":2017},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/1707.08817","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:531a9bc21cdbe66d2e1001f6e384308b6fabab05455bec77105ab7d364fe7f01","observation_id":"aba10201-d72d-4a14-8289-7536c0b95c42","resolution":{"observed_at":"2026-05-16T08:48:15.017380Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06599","last_updated":"2023-09-12T20:58:21Z","snapshot_observed_at":"2026-07-06T16:17:43.448660Z","submitted_at":"2023-09-12T20:58:21Z","title":"Reasoning with Latent Diffusion in Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2309.06599","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.06599","snapshot_observed_at":"2026-07-04T06:49:37.796075Z","title":"Venkatraman, S","venue":null,"work_id":"419775bf-2184-4f98-89c5-320e6b146326","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2309.06599","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:d4bce882ee9bbfc0140b24b10c744e959e80c67ac65861d14ca9016a76da8423","observation_id":"90b479d3-48c4-489b-8680-f9d57dab6a0e","resolution":{"observed_at":"2026-05-16T08:48:15.020769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12908","last_updated":"2023-11-21T15:24:05Z","snapshot_observed_at":"2026-07-06T16:50:46.608196Z","submitted_at":"2023-11-21T15:24:05Z","title":"Diffusion Model Alignment Using Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":"2311.12908","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.12908","snapshot_observed_at":"2026-07-09T02:25:55.896149Z","title":"Diffusion model alignment using direct preference optimization.arXiv preprint arXiv:2311.12908","venue":"cs.CV","work_id":"1941def8-837f-49f0-b80c-bb513ed3eeeb","year":2023},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2311.12908","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:e235a47ebf5700cce3e19bfeb97fb4365ca45a96b7ae9b66641a53d1b6749e24","observation_id":"47df5f88-d8fa-4abf-bd93-f6f80394c194","resolution":{"observed_at":"2026-05-16T08:48:15.024198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wang and E","venue":null,"work_id":"e76dc3c0-8886-47cb-8ac0-dcb7931a142e","year":2016},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:ffec8c90009a1b20e35e3b821248728e7ded631967a0bf0006f099b162f6e96f","observation_id":"315847f5-1fdf-4e79-b817-e2a1c2e27614","resolution":{"observed_at":"2026-05-16T08:48:15.138538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02511","last_updated":"2024-12-01T15:55:50Z","snapshot_observed_at":"2026-07-06T17:25:05.974815Z","submitted_at":"2024-02-04T14:51:49Z","title":"PoCo: Policy Composition from and for Heterogeneous Robot Learning","version":3},"cited_work":{"arxiv_id":"2402.02511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.02511","snapshot_observed_at":"2026-07-04T06:49:37.815396Z","title":"Poco: Policy composition from and for heterogeneous robot learning","venue":null,"work_id":"eead1e0d-f300-4fbb-996d-75093f2638e3","year":2024},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2402.02511","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:639b855cd018f92544d2a63fbeced3109a19c291d337ed51d3e25c64d662a8a0","observation_id":"df7a9bab-7142-4db7-b37d-82d3dc65899e","resolution":{"observed_at":"2026-05-16T08:48:15.027836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:969fc1ca5eec6de7c2b1c578a327322651cf3cfa536cb2fdee1a7d01299ba0bf","observation_id":"f6229189-5202-48aa-b716-dfd78823ce01","resolution":{"observed_at":"2026-05-16T08:48:15.032219Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":53,"verified_fuzzy":25},"total_outbound_references":114},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 100 of 114 outbound references and 64 inbound Pith citation observations for arXiv:2409.00588."}