{"as_of":"2026-08-11T13:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3bcf12070a0e6d769b4f99cd2a6ef1ec117550815345ea5fb112fe6603186397","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T07:55:15.678348Z","state":"measured"},{"denominator":112,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":112,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":83,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:43:10.843823Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T06:49:37.744619Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-08T17:26:38.829859Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T00:20:30.936392Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2303.04137"},"observation_digest":"sha256:89b8eca4a94aabe35be261f291ef985cd4b29773a12a6dc3661e408fb4bea60e","observation_id":"7ac80405-8840-4ba6-8fe1-ebe993b28280","resolution":{"observed_at":"2026-05-15T07:55:15.903200Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T13:48:36.369334Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2304.10573"},"observation_digest":"sha256:74c2b0abd26a6804bb0fdd30a4b41dc0dd0b3c31d89b1ff6f048977662a0d422","observation_id":"994dbbe3-6b30-411a-8993-cfe8ece56105","resolution":{"observed_at":"2026-05-15T07:55:15.903200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-09T16:20:23.732146Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T20:16:30.840184Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2305.13301"},"observation_digest":"sha256:4ed7323930ff8f7852412c7fcb08fbbccc98473d8780f4f8768e65eca64d08dc","observation_id":"d8de71e7-39be-44c8-8808-06dfd1f62b5a","resolution":{"observed_at":"2026-05-15T07:55:15.903200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2402.10885","last_updated":"2024-07-25T14:30:22Z","snapshot_observed_at":"2026-07-06T17:31:17.058043Z","submitted_at":"2024-02-16T18:43:02Z","title":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T22:00:04.812281Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2402.10885"},"observation_digest":"sha256:8db30c8dfd4038eb856120cb052d8945320eca02d6caf81c299cf68039317a8d","observation_id":"41b930f7-2c85-4dd0-b1c8-df9ad8499b81","resolution":{"observed_at":"2026-05-17T22:00:04.947744Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:2526f4b8b83eb11eef348f4041e2ac8d7b4bd68d49b4267e677aa31c81e5d676","observation_id":"f6229189-5202-48aa-b716-dfd78823ce01","resolution":{"observed_at":"2026-05-16T08:48:15.032219Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-10T20:43:10.843823Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07468","last_updated":"2025-03-02T16:57:11Z","snapshot_observed_at":"2026-08-10T21:30:51.404603Z","submitted_at":"2025-01-13T16:35:52Z","title":"From Screens to Scenes: A Survey of Embodied AI in Healthcare","version":3},"reference_index":241,"source":"pdf_text","source_observed_at":"2026-08-10T20:43:10.843823Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2501.07468"},"observation_digest":"sha256:32b905a3f31e6ddf74d1fb144e73c061395c6fdf535c51ca316fa69de229bee5","observation_id":"4b3c8da6-746f-438d-8299-8c600536bc31","resolution":{"observed_at":"2026-08-10T20:43:10.843823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-10T18:45:44.828109Z","title":"Diffusion policies as an ex- pressive policy class for offline reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11068","last_updated":"2025-01-19T15:05:03Z","snapshot_observed_at":"2026-08-10T18:37:59.759917Z","submitted_at":"2025-01-19T15:05:03Z","title":"Generative AI-driven Cross-layer Covert Communication: Fundamentals, Framework and Case Study","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T18:45:44.828109Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2501.11068"},"observation_digest":"sha256:b4161c6dce7f75bf1291134b8fce19afcdcde01ebd6f23486a6b4440d82d32df","observation_id":"8852ed3d-2aa6-46b2-95fd-a88ea53872a5","resolution":{"observed_at":"2026-08-10T18:45:44.828109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-10T16:40:59.046141Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12942","last_updated":"2026-06-10T06:14:49Z","snapshot_observed_at":"2026-08-11T01:48:30.136061Z","submitted_at":"2025-01-22T15:13:21Z","title":"Offline Diffusion Policy for Multi-User Delay-Constrained Scheduling","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T16:40:59.046141Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2501.12942"},"observation_digest":"sha256:d92497b2d9bdf4415aacddabc112ef3b0da205b8b6f52a921fe5163e1f51b2a6","observation_id":"aad60dac-a116-4642-b486-1529543fe211","resolution":{"observed_at":"2026-08-10T16:40:59.046141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-09T19:28:42.485934Z","title":"J., and Zhou, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00361","last_updated":"2025-06-30T03:48:44Z","snapshot_observed_at":"2026-08-10T07:59:12.895663Z","submitted_at":"2025-02-01T07:55:06Z","title":"Efficient Online Reinforcement Learning for Diffusion Policy","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T19:28:42.485934Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2502.00361"},"observation_digest":"sha256:0bbc130d1d0d273986b8fafd98db3d4d3c5592bfd347c7dc9c170f4ae2af8465","observation_id":"a0ab7c18-6c95-4044-adfb-205e60997282","resolution":{"observed_at":"2026-08-09T19:28:42.485934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-15T22:00:48.667428Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2503.10631"},"observation_digest":"sha256:9c9fd5c4d0bbb4eeb4f950b26e4de816521cec37edf8a269d01cf1427c607c7a","observation_id":"51d2b1ae-4cd8-4110-8204-3e02e3f2ea1e","resolution":{"observed_at":"2026-05-15T22:00:49.026210Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2503.12575","last_updated":"2026-04-05T16:16:05Z","snapshot_observed_at":"2026-07-06T20:53:31.919637Z","submitted_at":"2025-03-16T17:06:00Z","title":"BalancedDPO: Adaptive Multi-Metric Alignment","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T23:37:55.154902Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2503.12575"},"observation_digest":"sha256:1686d1548a964d3bf7a68f1423d370bc5e1239372b49de2d7e0e464d4e9a7656","observation_id":"fe1bf706-dab6-4486-b4e9-02a2ad4fac05","resolution":{"observed_at":"2026-05-22T23:42:16.576021Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2504.11944","last_updated":"2026-05-13T09:05:56Z","snapshot_observed_at":"2026-07-06T21:10:18.015145Z","submitted_at":"2025-04-16T10:23:44Z","title":"VIPO: Value Function Inconsistency Penalized Offline Reinforcement Learning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T19:34:33.263674Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2504.11944"},"observation_digest":"sha256:711e058415ee1ea10b7d0532478b7ce0b16ac04c36c4b1c5884bb0c4abf966dc","observation_id":"b847c2d6-688b-413d-807f-163f9a42b7f3","resolution":{"observed_at":"2026-05-22T19:35:03.967979Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-07T15:42:50.747484Z","title":"Ziyu Wang, Alexander Novikov, Konrad Zolna, Jost Tobias Springenberg, Scott E","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-09T23:42:37.932619Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:50.747484Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:8705ce3ae6e8eaf7accc77435a79b017571f2f935752eae610c369b6f19d5443","observation_id":"a72f762f-edd0-4573-b06c-85b28c7a4840","resolution":{"observed_at":"2026-08-07T15:42:50.747484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-07T15:26:15.208611Z","title":"Diffusion policies as an expres- sive policy class for offline reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15157","last_updated":"2025-05-21T06:21:50Z","snapshot_observed_at":"2026-08-09T11:49:38.825285Z","submitted_at":"2025-05-21T06:21:50Z","title":"Cascaded Diffusion Models for Neural Motion Planning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:15.208611Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2505.15157"},"observation_digest":"sha256:40e2420adcc6897f0e5270ac951524c5161068a980c540c384989b09582fbd60","observation_id":"25dc2dab-b486-4eed-bb29-3dabaa895e39","resolution":{"observed_at":"2026-08-07T15:26:15.208611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-07T14:14:46.345569Z","title":"J., and Zhou, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-09T00:05:32.443932Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:46.345569Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:0f08914481526430f7ef09de62246158e886dbf0865f01d6e1307ba6caae260a","observation_id":"7a33a587-91c8-495d-a991-4a2389b37c28","resolution":{"observed_at":"2026-08-07T14:14:46.345569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-07T14:20:41.247019Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-10T06:16:03.983360Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.247019Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:135866ea0bd6f14ed0ee9bebf1dcbc7ced2049d1a87fd8ddff0d69d0b6d95707","observation_id":"d52a9e49-a01c-4f4b-9059-477a16ecc566","resolution":{"observed_at":"2026-08-07T14:20:41.247019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2506.05762","last_updated":"2026-05-14T17:01:38Z","snapshot_observed_at":"2026-08-10T21:38:46.569628Z","submitted_at":"2025-06-06T05:41:33Z","title":"BiTrajDiff: Bidirectional Trajectory Generation with Diffusion Models for Offline Reinforcement Learning","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T10:48:28.980868Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2506.05762"},"observation_digest":"sha256:37a37e8b898c91fe86a64db5570202ec87c69cba6b41597dfdc8b787eea3f4fe","observation_id":"77a45f2d-adb8-4921-b993-68bdfb79c047","resolution":{"observed_at":"2026-05-19T10:52:15.290962Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2506.07339","last_updated":"2025-12-05T07:35:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T01:01:59Z","title":"Real-Time Execution of Action Chunking Flow Policies","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-15T14:18:51.613045Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2506.07339"},"observation_digest":"sha256:94455f87a7b6c1282492708ca6b04ad53bd10e6382130160be464f7f8d0f69f4","observation_id":"02e0fc2b-835e-4cf9-bd43-666c636f48ee","resolution":{"observed_at":"2026-05-15T14:18:51.711991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-07T05:15:33.492822Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08644","last_updated":"2025-06-10T09:57:25Z","snapshot_observed_at":"2026-08-09T13:51:01.006782Z","submitted_at":"2025-06-10T09:57:25Z","title":"Semi-gradient DICE for Offline Constrained Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:15:33.492822Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2506.08644"},"observation_digest":"sha256:72c77aab6f3ae25f90901a54fb5b3639318f81d2f51b6eb208241c8187cfb976","observation_id":"fa19f191-2ee8-4b19-baf1-31e256d4836f","resolution":{"observed_at":"2026-08-07T05:15:33.492822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-07T00:23:18.829157Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14317","last_updated":"2025-09-04T05:12:41Z","snapshot_observed_at":"2026-08-09T09:29:00.019872Z","submitted_at":"2025-06-17T08:50:49Z","title":"ClutterDexGrasp: A Sim-to-Real System for General Dexterous Grasping in Cluttered Scenes","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:18.829157Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2506.14317"},"observation_digest":"sha256:21b07ba36b9e4e71d38aedc43c03d8e6526341a0071efe318f6b48f32328480c","observation_id":"39ef6507-02fa-43d7-8977-73111800c368","resolution":{"observed_at":"2026-08-07T00:23:18.829157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2506.15799","last_updated":"2025-06-25T19:09:52Z","snapshot_observed_at":"2026-08-08T08:13:32.220639Z","submitted_at":"2025-06-18T18:35:57Z","title":"Steering Your Diffusion Policy with Latent Space Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T21:55:46.183007Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2506.15799"},"observation_digest":"sha256:a2aa5ece7d826723cd1b979f3e53b5174d763df3421936ce426a3d90b7a28939","observation_id":"dcccf895-d921-48ad-a92c-e13efc3933ca","resolution":{"observed_at":"2026-05-17T21:55:46.434493Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-06T20:38:35.366704Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-08T19:37:07.435991Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:35.366704Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:ca723806dece6447633676e2f85d757f09633759c18db33a040dcb46eba34566","observation_id":"95dc4f19-86d8-4674-8e21-89a853191561","resolution":{"observed_at":"2026-08-06T20:38:35.366704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-06T19:05:23.018513Z","title":"Dif- fusion policies as an expressive policy class for offline rein- forcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06710","last_updated":"2025-07-13T06:32:40Z","snapshot_observed_at":"2026-08-09T21:13:24.500903Z","submitted_at":"2025-07-09T10:08:15Z","title":"Spatial-Temporal Aware Visuomotor Diffusion Policy Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:05:23.018513Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2507.06710"},"observation_digest":"sha256:700acd40332a882895a97e79905c21eb6cd7793a88cadeeb9321afa691d4dc3b","observation_id":"302007d0-04f9-4809-a204-cca0d10cb5ed","resolution":{"observed_at":"2026-08-06T19:05:23.018513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-06T17:47:42.030565Z","title":"Diffusion policies as an expres- sive policy class for offline reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10026","last_updated":"2025-07-14T08:06:58Z","snapshot_observed_at":"2026-08-06T17:39:12.191621Z","submitted_at":"2025-07-14T08:06:58Z","title":"EAT: QoS-Aware Edge-Collaborative AIGC Task Scheduling via Attention-Guided Diffusion Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.030565Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2507.10026"},"observation_digest":"sha256:da1ac37f17ad04b042228a514a8d8337b974b13ff314d33ebde8ca2f5c7a04c6","observation_id":"c4b99743-a20b-49c0-b964-25ec4014ab0e","resolution":{"observed_at":"2026-08-06T17:47:42.030565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-06T05:35:39.646624Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01589","last_updated":"2025-08-03T05:06:26Z","snapshot_observed_at":"2026-08-09T01:25:10.392992Z","submitted_at":"2025-08-03T05:06:26Z","title":"Censored Sampling for Topology Design: Guiding Diffusion with Human Preferences","version":1},"reference_index":163,"source":"pdf_text","source_observed_at":"2026-08-06T05:35:39.646624Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2508.01589"},"observation_digest":"sha256:98197119b5e8138c7dfc05f2c2364af41dd076ebe2422a06efd308c7b7d13cf4","observation_id":"7fdd4f8b-a471-4d08-9208-c889534d5e14","resolution":{"observed_at":"2026-08-06T05:35:39.646624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-05T20:31:54.022841Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10399","last_updated":"2025-08-14T06:56:16Z","snapshot_observed_at":"2026-08-10T16:57:45.636309Z","submitted_at":"2025-08-14T06:56:16Z","title":"Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning","version":1},"reference_index":199,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:54.022841Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2508.10399"},"observation_digest":"sha256:a863aa6223e060bb7675326aa2e613a3d8ae408bca357d307602a0dbc6bab5d2","observation_id":"0fed7347-ea3c-470b-8eb9-868e3a04b80d","resolution":{"observed_at":"2026-08-05T20:31:54.022841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-05T11:23:27.342828Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03550","last_updated":"2025-09-02T23:17:46Z","snapshot_observed_at":"2026-08-07T03:37:21.143694Z","submitted_at":"2025-09-02T23:17:46Z","title":"Diffusion-RL Based Air Traffic Conflict Detection and Resolution Method","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T11:23:27.342828Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2509.03550"},"observation_digest":"sha256:5b7ab13ec39c470c27b1421f8022d2dfc334f87d55b8be778e967251a5a33dc1","observation_id":"cfacb3a9-9f64-4285-b382-e1bf72ae8d2b","resolution":{"observed_at":"2026-08-05T11:23:27.342828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-04T21:12:46.063817Z","title":"re- tracing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08160","last_updated":"2025-09-09T21:41:23Z","snapshot_observed_at":"2026-08-05T03:02:51.114094Z","submitted_at":"2025-09-09T21:41:23Z","title":"Diffusion-Guided Multi-Arm Motion Planning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T21:12:46.063817Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2509.08160"},"observation_digest":"sha256:c6ed3719dff367166518dd58b6389f57c5d08f31c67548ee1e634fd3a8ccc0e2","observation_id":"5dbc7881-a16a-4492-b969-3e1883d7af6d","resolution":{"observed_at":"2026-08-04T21:12:46.063817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-05T10:30:59.227479Z","title":"Diffusion policies as an expres- sive policy class for offline reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.19305","last_updated":"2026-06-02T14:25:30Z","snapshot_observed_at":"2026-08-08T13:19:03.380555Z","submitted_at":"2025-09-04T08:50:31Z","title":"Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T10:30:59.227479Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2509.19305"},"observation_digest":"sha256:8f21e4e5231ba2761a5760defa42ef8d315dfbd870496414a7fdfe42b7d5b72d","observation_id":"6999ea11-2336-4272-bae1-a3bee618d4aa","resolution":{"observed_at":"2026-08-05T10:30:59.227479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2509.22963","last_updated":"2026-05-19T22:38:20Z","snapshot_observed_at":"2026-08-02T17:56:37.590404Z","submitted_at":"2025-09-26T21:53:36Z","title":"Reinforcement Learning with Discrete Diffusion Policies for Combinatorial Action Spaces","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-21T21:14:54.053177Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2509.22963"},"observation_digest":"sha256:3427176b81f8a5a7ce3a6bfd92d9a98e75daafda45a325e4f6ba8f76f0dee4fd","observation_id":"de8e4e58-1c07-4bf5-a5c2-783642e85750","resolution":{"observed_at":"2026-05-21T21:15:38.694878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-04T13:52:11.964736Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning.arXiv preprint arXiv:2208.06193,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24531","last_updated":"2026-06-07T07:47:17Z","snapshot_observed_at":"2026-08-09T07:26:10.392724Z","submitted_at":"2025-09-29T09:45:22Z","title":"Diffusion Bridge or Flow Matching? A Unifying Framework and Comparative Analysis","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T13:52:11.964736Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2509.24531"},"observation_digest":"sha256:822a309dcc00e9594efc1d1b2e643715d382b79f07501ff49e387178e0f87b45","observation_id":"73429f7f-7804-4655-a7d5-d0c0fede7592","resolution":{"observed_at":"2026-08-04T13:52:11.964736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-04T11:01:34.844971Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.07650","last_updated":"2026-05-30T05:26:12Z","snapshot_observed_at":"2026-08-04T11:01:21.243413Z","submitted_at":"2025-10-09T00:57:40Z","title":"Value Flows","version":4},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-04T11:01:34.844971Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2510.07650"},"observation_digest":"sha256:8ff38d763b4ba6eccf26a862419df4972cf1b5f7b7fec6ac21153eaea46a154e","observation_id":"ffa0ba8b-3210-460c-b85b-28cacd99a5f9","resolution":{"observed_at":"2026-08-04T11:01:34.844971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-04T10:44:10.802074Z","title":"Huang Xiao, Michael Herman, Joerg Wagner, Sebastian Ziesche, Jalal Etesami, and Thai Hong Linh","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2510.09222","last_updated":"2026-06-01T11:49:06Z","snapshot_observed_at":"2026-08-07T20:08:20.794829Z","submitted_at":"2025-10-10T10:08:10Z","title":"FM-IRL: Flow-Matching for Reward Modeling and Policy Regularization in Reinforcement Learning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T10:44:10.802074Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2510.09222"},"observation_digest":"sha256:a4bec2cf05fb595ccbbba0fc16629f7e98f414b93aec7d1147c363240c2d55a0","observation_id":"d99e9b3b-e9cc-4c78-b051-75d5b6866443","resolution":{"observed_at":"2026-08-04T10:44:10.802074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-03T06:23:16.060327Z","title":"Diffusion policies as an expres- sive policy class for offline reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.22965","last_updated":"2026-06-01T08:53:04Z","snapshot_observed_at":"2026-08-10T18:27:51.139048Z","submitted_at":"2026-01-30T13:27:59Z","title":"Self-Imitated Diffusion Policy for Efficient and Robust Visual Navigation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T06:23:16.060327Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2601.22965"},"observation_digest":"sha256:6434a1219c6fcd08ca82807867298f12727477fc028de2b8841fca5e859844ef","observation_id":"1c09ee03-1f21-430b-91b2-305a777b62d2","resolution":{"observed_at":"2026-08-03T06:23:16.060327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2602.02924","last_updated":"2026-05-05T18:05:36Z","snapshot_observed_at":"2026-08-10T21:22:41.126910Z","submitted_at":"2026-02-02T23:53:53Z","title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T07:55:31.706717Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2602.02924"},"observation_digest":"sha256:969e0cb04fd67f0da28c7a150ef7641cb6968fd2cff77422eb3eb07873a2f99c","observation_id":"77cd936f-939d-43e5-997f-1270f5770f7f","resolution":{"observed_at":"2026-05-16T07:57:33.085981Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-14T23:47:45.866615Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning.arXiv preprint arXiv:2208.06193, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.10250","last_updated":"2026-05-24T03:43:13Z","snapshot_observed_at":"2026-08-10T03:59:08.325902Z","submitted_at":"2026-03-10T22:01:13Z","title":"GeMPO: Generalized Measure Matching for Online Diffusion Reinforcement Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-14T23:47:45.866615Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2603.10250"},"observation_digest":"sha256:25f249ba5398fdc82d50218b45338f22b6ad362e5746436f0f0bb96e0cfc4a47","observation_id":"859563cd-2542-42ff-8b0b-273bafced1da","resolution":{"observed_at":"2026-07-14T23:47:45.866615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-13T09:47:32.460955Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.04520","last_updated":"2026-06-19T09:22:29Z","snapshot_observed_at":"2026-08-03T23:33:34.507340Z","submitted_at":"2026-04-06T08:31:55Z","title":"Nonreciprocal current induced by dissipation in time-reversal symmetric systems","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T09:47:32.460955Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2604.04520"},"observation_digest":"sha256:d139d2715d6e5e0c88e5efd7ab37d38e2943d1e7004d5c0fe7a358579f92ea2c","observation_id":"5e08b9d1-fae2-483e-9b0d-7efd2bf17d95","resolution":{"observed_at":"2026-07-13T09:47:32.460955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2604.04528","last_updated":"2026-04-06T08:48:10Z","snapshot_observed_at":"2026-08-11T08:11:15.457554Z","submitted_at":"2026-04-06T08:48:10Z","title":"Receding-Horizon Control via Drifting Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T19:41:20.941243Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2604.04528"},"observation_digest":"sha256:26c20fb6c4f8ea18b2840118d6f5ccfd43f95f0e3a395b9d418b1df580e17bbf","observation_id":"1bc11e9b-b40a-4ab6-9298-7ce8b98e8fbe","resolution":{"observed_at":"2026-05-15T07:55:15.903200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2604.08960","last_updated":"2026-04-10T05:04:29Z","snapshot_observed_at":"2026-08-11T10:21:28.735564Z","submitted_at":"2026-04-10T05:04:29Z","title":"Efficient Hierarchical Implicit Flow Q-learning for Offline Goal-conditioned Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T18:12:32.839681Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2604.08960"},"observation_digest":"sha256:5cfd263278d9cb72050fd8dc7680b4d119e1c0e703c036248eaf8e6c58655cac","observation_id":"bb587849-e519-40dd-a030-5b7a873e31e6","resolution":{"observed_at":"2026-05-15T07:55:15.903200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2604.17919","last_updated":"2026-05-05T15:00:45Z","snapshot_observed_at":"2026-08-11T11:05:11.172948Z","submitted_at":"2026-04-20T07:54:36Z","title":"Fisher Decorator: Refining Flow Policy via a Local Transport Map","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T05:28:12.298066Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2604.17919"},"observation_digest":"sha256:fe97a71207f414787ebda5120c16674423f2d43ea0a2e010f697a93652af6276","observation_id":"e270f2cb-8855-4743-b19d-fead74681d6b","resolution":{"observed_at":"2026-05-15T07:55:15.903200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2604.19011","last_updated":"2026-05-28T14:53:23Z","snapshot_observed_at":"2026-07-31T17:39:47.680072Z","submitted_at":"2026-04-21T03:00:52Z","title":"Accelerating trajectory optimization with Sobolev-trained diffusion policies","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T02:41:06.947124Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2604.19011"},"observation_digest":"sha256:4421d685cbd75e8b96b181caa9c38d02a335fb6fa0311fcf2de58775521a861c","observation_id":"11044c6c-895c-406f-9c18-cdd5bf0488d9","resolution":{"observed_at":"2026-05-15T07:55:15.903200Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2604.19730","last_updated":"2026-04-21T17:52:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T17:52:17Z","title":"FASTER: Value-Guided Sampling for Fast RL","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T02:47:36.475845Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2604.19730"},"observation_digest":"sha256:bb995977a67baadf44d9fb3a79b1db6a54b5260b006b0e15c9bf41f50469453b","observation_id":"5047ad81-58a9-4fd8-9e0a-9009460d4c1d","resolution":{"observed_at":"2026-05-15T07:55:15.903200Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.01968","last_updated":"2026-05-03T16:53:29Z","snapshot_observed_at":"2026-08-05T17:06:11.864759Z","submitted_at":"2026-05-03T16:53:29Z","title":"AdamO: A Collapse-Suppressed Optimizer for Offline RL","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-10T14:48:05.166453Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.01968"},"observation_digest":"sha256:a59be87c3bd29a199a2e23784ab0dd600c31c137b0378f9d3fd060e518fa2735","observation_id":"3e25564b-0eb6-4af3-8621-c2d36ed2b7ec","resolution":{"observed_at":"2026-05-15T07:55:15.903200Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.03075","last_updated":"2026-05-04T18:44:19Z","snapshot_observed_at":"2026-07-06T23:16:05.372336Z","submitted_at":"2026-05-04T18:44:19Z","title":"Refining Compositional Diffusion for Reliable Long-Horizon Planning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-08T17:47:58.141126Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.03075"},"observation_digest":"sha256:c2e350886758d2c0834022778c98a405aef15160afb1315f391355726189f3a6","observation_id":"59bea60f-96b3-445c-abce-b49fa4767182","resolution":{"observed_at":"2026-05-15T07:55:15.903200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.08202","last_updated":"2026-05-06T01:21:53Z","snapshot_observed_at":"2026-07-06T23:20:28.875586Z","submitted_at":"2026-05-06T01:21:53Z","title":"Beyond Penalization: Diffusion-based Out-of-Distribution Detection and Selective Regularization in Offline Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-12T02:17:25.783688Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.08202"},"observation_digest":"sha256:d55029f9f4fc8cdf9fc6bd0bc536f0209bfbed4fb434ad13a124c992591a9f28","observation_id":"8f1a1ee9-8cd1-431d-af09-e21b364578dd","resolution":{"observed_at":"2026-05-15T07:55:15.903200Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.08253","last_updated":"2026-06-03T21:28:18Z","snapshot_observed_at":"2026-08-02T18:39:18.875350Z","submitted_at":"2026-05-07T19:05:01Z","title":"Path-Coupled Bellman Flows for Distributional Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-12T02:12:58.528130Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.08253"},"observation_digest":"sha256:0577fe877f62ed0ced45c3bb99dc252d19cbfcc7f7769db93b5df396712a1cca","observation_id":"dcd47bc1-4b30-4ad2-af28-666395e741c6","resolution":{"observed_at":"2026-05-15T07:55:15.903200Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.08268","last_updated":"2026-05-08T03:10:22Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T03:10:22Z","title":"Insider Attacks in Multi-Agent LLM Consensus Systems","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-12T00:52:23.019201Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.08268"},"observation_digest":"sha256:9d4161f564af7e8716184adc95e7c8438c33296568f5141f9bbf149da4ddd75b","observation_id":"9a21c44e-d57a-44f2-833e-9bcb96dd0bf6","resolution":{"observed_at":"2026-05-15T07:55:15.903200Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.09999","last_updated":"2026-05-11T05:21:52Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:21:52Z","title":"Muninn: Your Trajectory Diffusion Model But Faster","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-12T03:49:48.492957Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.09999"},"observation_digest":"sha256:96c51703636c455690ecfabcfac4378b05abd61fd8333996918c2779a2831916","observation_id":"885def38-d9cc-494f-8a51-1aed58f8b554","resolution":{"observed_at":"2026-05-15T07:55:15.903200Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.10909","last_updated":"2026-05-11T17:49:09Z","snapshot_observed_at":"2026-07-06T23:22:47.781940Z","submitted_at":"2026-05-11T17:49:09Z","title":"Revisiting Policy Gradients for Restricted Policy Classes: Escaping Myopic Local Optima with $k$-step Policy Gradients","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T04:02:04.342363Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.10909"},"observation_digest":"sha256:cf30a52f1ba65097ff7eed5c02c5831a452b8b2b24a19ad942ce17b0a0e14ef6","observation_id":"70149c94-010d-4d69-92d4-e50b0a1c2d02","resolution":{"observed_at":"2026-05-15T07:55:15.903200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.11726","last_updated":"2026-05-13T15:38:02Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T08:09:42Z","title":"Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-13T07:03:00.503644Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.11726"},"observation_digest":"sha256:43c40c347a9e40199c73c0dbdef91fb8254af73396028fa8a6c345002cdfffc7","observation_id":"07f84e69-f09e-4bb6-beb1-948d76993f72","resolution":{"observed_at":"2026-05-15T07:55:15.903200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.11726","last_updated":"2026-05-13T15:38:02Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T08:09:42Z","title":"Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-14T21:06:01.667173Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.11726"},"observation_digest":"sha256:2c9ac7712aa07f8a7dcd3dd290d6dfeb7620ada101806ac9cdf86d1d22aecc3f","observation_id":"9ac5a5b9-5dca-4786-8015-9a89c3cd5137","resolution":{"observed_at":"2026-05-15T07:55:15.903200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.12416","last_updated":"2026-05-12T17:12:29Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:12:29Z","title":"Aligning Flow Map Policies with Optimal Q-Guidance","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T05:04:22.603786Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.12416"},"observation_digest":"sha256:0dcb8baa92e5fd9d51e85ae3097aab8cec7a5d1a5970f5883ec9ba686cdd4beb","observation_id":"e1513347-6a38-43d6-a94f-40200bedea25","resolution":{"observed_at":"2026-05-15T07:55:15.903200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.12625","last_updated":"2026-05-14T17:58:42Z","snapshot_observed_at":"2026-07-06T23:24:18.302402Z","submitted_at":"2026-05-12T18:10:19Z","title":"Driving Intents Amplify Planning-Oriented Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T20:50:14.602822Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.12625"},"observation_digest":"sha256:cbc375711d194007d5a8d1d139805ee5c19592d79c30d5c3183e0b1511c66860","observation_id":"6b9ba123-3d86-4eb9-9832-7fe3b741f56e","resolution":{"observed_at":"2026-05-15T07:55:15.903200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.12625","last_updated":"2026-05-14T17:58:42Z","snapshot_observed_at":"2026-07-06T23:24:18.302402Z","submitted_at":"2026-05-12T18:10:19Z","title":"Driving Intents Amplify Planning-Oriented Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T04:58:07.943615Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.12625"},"observation_digest":"sha256:35328b9f332a5d731ebec156c5852362885f8e1ba660ff5063a03e67daf3d9d0","observation_id":"63508570-6442-4507-a77e-63052d1cf11d","resolution":{"observed_at":"2026-05-15T07:55:15.903200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.13013","last_updated":"2026-05-13T05:07:32Z","snapshot_observed_at":"2026-07-06T23:24:37.915639Z","submitted_at":"2026-05-13T05:07:32Z","title":"JEDI: Joint Embedding Diffusion World Model for Online Model-Based Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T19:37:19.404335Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.13013"},"observation_digest":"sha256:44afb3624d9e84cace47648f67c6e14496fa755f59694948ac28ae3615259da8","observation_id":"05e5801a-de5e-48db-bab0-60ccbc6a55e7","resolution":{"observed_at":"2026-05-15T07:55:15.903200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.16054","last_updated":"2026-05-15T15:21:25Z","snapshot_observed_at":"2026-08-03T10:16:57.496693Z","submitted_at":"2026-05-15T15:21:25Z","title":"Ada-Diffuser: Latent-Aware Adaptive Diffusion for Decision-Making","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-20T20:54:31.025488Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.16054"},"observation_digest":"sha256:df02fbf1e59cdea29214de75f7c2991ed50ef8032d5dc532497aca8d5554815a","observation_id":"293975ad-1b8a-429d-b0ab-a73b8e79fe76","resolution":{"observed_at":"2026-05-20T20:59:01.955010Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.16520","last_updated":"2026-05-15T18:14:38Z","snapshot_observed_at":"2026-08-08T04:03:57.471199Z","submitted_at":"2026-05-15T18:14:38Z","title":"Global Convergence of Sampling-Based Nonconvex Optimization through Diffusion-Style Smoothing","version":1},"reference_index":211,"source":"arxiv_source","source_observed_at":"2026-05-20T20:15:44.030714Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.16520"},"observation_digest":"sha256:f7000b3ddd5eb715e3b0ca5388d99897241d28e0de11b4e2a7db162c02cdb8fa","observation_id":"aa53d60e-5d78-4539-89b7-1db658aea058","resolution":{"observed_at":"2026-05-20T20:18:59.888321Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.20036","last_updated":"2026-05-28T20:45:21Z","snapshot_observed_at":"2026-08-02T01:45:52.685856Z","submitted_at":"2026-05-19T15:55:55Z","title":"D$^3$-Subsidy: Online and Sequential Driver Subsidy Decision-Making for Large-Scale Ride-Hailing Market","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T06:49:53.603604Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.20036"},"observation_digest":"sha256:99073a2ef02d2222dd825ce905f63dc21d49aee612601a14bc7919d73311e33b","observation_id":"84d67496-976e-4353-b5ff-c0138c0423d0","resolution":{"observed_at":"2026-05-20T06:53:05.959925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.20036","last_updated":"2026-05-28T20:45:21Z","snapshot_observed_at":"2026-08-02T01:45:52.685856Z","submitted_at":"2026-05-19T15:55:55Z","title":"D$^3$-Subsidy: Online and Sequential Driver Subsidy Decision-Making for Large-Scale Ride-Hailing Market","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T07:25:05.617335Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.20036"},"observation_digest":"sha256:6005a7db53254d1e0d8070326adc856b02a7e551dea0c855331daae7292e96ac","observation_id":"009132cc-b9d1-4aa3-a6f9-141e6376e6db","resolution":{"observed_at":"2026-05-21T07:29:48.459245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.20036","last_updated":"2026-05-28T20:45:21Z","snapshot_observed_at":"2026-08-02T01:45:52.685856Z","submitted_at":"2026-05-19T15:55:55Z","title":"D$^3$-Subsidy: Online and Sequential Driver Subsidy Decision-Making for Large-Scale Ride-Hailing Market","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T09:17:01.418385Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.20036"},"observation_digest":"sha256:a8490c67b416cbf56b9e28a6b9bdb4a02be6402fa4cdea8521d30b897d07a17a","observation_id":"6aa08e93-4571-4600-823f-17b3360c0a25","resolution":{"observed_at":"2026-05-22T09:24:46.740380Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.20036","last_updated":"2026-05-28T20:45:21Z","snapshot_observed_at":"2026-08-02T01:45:52.685856Z","submitted_at":"2026-05-19T15:55:55Z","title":"D$^3$-Subsidy: Online and Sequential Driver Subsidy Decision-Making for Large-Scale Ride-Hailing Market","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T18:21:12.783683Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.20036"},"observation_digest":"sha256:edb0ff84ed490180011109016b03a83801db8cee283f2e6c5b9c077c55a75b17","observation_id":"924b9bc7-efb3-4933-a760-634ac1414df6","resolution":{"observed_at":"2026-07-01T15:05:47.275755Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.21460","last_updated":"2026-05-20T17:49:56Z","snapshot_observed_at":"2026-08-07T17:57:57.997513Z","submitted_at":"2026-05-20T17:49:56Z","title":"HITL-D: Human In The Loop Diffusion Assisted Shared Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T03:23:11.911870Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.21460"},"observation_digest":"sha256:c98a56dd56943c897982b226aed4424dce32492b7228671263bb7ecffc0b4b79","observation_id":"122435b3-554b-42c1-bb11-8cc966680c11","resolution":{"observed_at":"2026-05-21T03:23:55.704702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.24810","last_updated":"2026-05-24T01:44:57Z","snapshot_observed_at":"2026-08-03T02:43:58.048800Z","submitted_at":"2026-05-24T01:44:57Z","title":"Cross-Domain Energy-Guided Diffusion Generation for Off-Dynamics Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-30T11:43:41.884049Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.24810"},"observation_digest":"sha256:e1a0ef3c1e63ca34a7e0bd628a4fb5ea978efb44c91baa3c1b9e5833aaec0fcd","observation_id":"a7380df4-2c16-4cf9-8f26-57ae3abc5f89","resolution":{"observed_at":"2026-06-30T11:44:37.882131Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.25531","last_updated":"2026-05-25T07:37:39Z","snapshot_observed_at":"2026-08-05T10:02:09.642060Z","submitted_at":"2026-05-25T07:37:39Z","title":"From Denoising to Decision Making: A Survey on Diffusion Model-Enabled Deep Reinforcement Learning for Wireless Networks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T20:49:07.030872Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.25531"},"observation_digest":"sha256:8762a44c0ef690aa6dcb1c75e9b04d80da58a73ee8734984cad77c93674586bf","observation_id":"2bf5a61c-7a71-4832-9024-17d25bcc25d7","resolution":{"observed_at":"2026-06-29T20:53:58.363799Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.27095","last_updated":"2026-06-01T11:46:42Z","snapshot_observed_at":"2026-08-06T05:19:12.135756Z","submitted_at":"2026-05-26T14:38:03Z","title":"Adversarial Dual On-Policy Distillation from Expressive Teacher","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T18:55:23.777484Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.27095"},"observation_digest":"sha256:b06e292dc844748e6d8b8e2ff2316a2542a8ebd3c6318e65eb3b2dad2bb2915c","observation_id":"4bfeff70-e09a-4198-909b-9f77015bd300","resolution":{"observed_at":"2026-06-29T19:03:51.521000Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.27877","last_updated":"2026-05-27T02:53:41Z","snapshot_observed_at":"2026-07-06T23:37:31.844094Z","submitted_at":"2026-05-27T02:53:41Z","title":"SPAR: Support-Preserving Action Rectification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T14:34:39.094753Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.27877"},"observation_digest":"sha256:03938eb98ccf2b5ea73911de2cdbea9012641d6e61c0fa017eacd0e454051c18","observation_id":"b015ed9f-d634-4d83-82fd-2e117255cb30","resolution":{"observed_at":"2026-06-29T14:43:30.987653Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2605.29398","last_updated":"2026-05-28T05:47:40Z","snapshot_observed_at":"2026-07-06T23:38:51.349968Z","submitted_at":"2026-05-28T05:47:40Z","title":"GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-29T08:44:53.969301Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2605.29398"},"observation_digest":"sha256:e044ab895b26c35a4568eaea5dbb8e0aed22c7c3c3ce73d8ffb65d6772b0424b","observation_id":"84ca06a8-0ab3-425f-ba8a-52730bbd4995","resolution":{"observed_at":"2026-06-29T08:53:16.322817Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2606.01151","last_updated":"2026-08-08T10:30:40Z","snapshot_observed_at":"2026-08-11T12:17:25.599752Z","submitted_at":"2026-05-31T10:40:28Z","title":"Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T17:19:36.722892Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2606.01151"},"observation_digest":"sha256:08815c61815974a2720d036f0d4b524c534154c84bdf8e9dc799fc8436128056","observation_id":"539834d2-a9e0-4467-8101-85ee296ee714","resolution":{"observed_at":"2026-06-28T17:22:24.656018Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2606.01238","last_updated":"2026-05-31T13:40:47Z","snapshot_observed_at":"2026-08-01T23:35:01.141226Z","submitted_at":"2026-05-31T13:40:47Z","title":"Training-Free Imitation Learning with Closed-Form Diffusion Policies","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T17:07:46.856210Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2606.01238"},"observation_digest":"sha256:a013a1ef2d72b2fb73eb5cf6f17112d1bca05b2203d41b2724e82a78e01f16ea","observation_id":"4fb2eb9f-ba9c-4159-8f73-6a8efce2a0be","resolution":{"observed_at":"2026-06-28T17:12:24.890387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2606.09115","last_updated":"2026-06-08T07:11:03Z","snapshot_observed_at":"2026-08-04T22:59:05.251199Z","submitted_at":"2026-06-08T07:11:03Z","title":"Counterfactual Transport Flows for Offline Conservative Trajectory Refinement","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-27T17:33:35.857240Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2606.09115"},"observation_digest":"sha256:6c62d0a2f90e28c17881c87d4e0302166f0baff6b92f05b66694b39c65d2af02","observation_id":"a357415b-276f-4873-8deb-ec925f3ec93c","resolution":{"observed_at":"2026-07-02T23:57:29.179837Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2606.10613","last_updated":"2026-06-09T09:12:12Z","snapshot_observed_at":"2026-08-04T14:36:44.997787Z","submitted_at":"2026-06-09T09:12:12Z","title":"Fast and Highly Expressive Policy Learning for Offline Reinforcement Learning via Bootstrapped Flow Q-Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T13:57:31.180928Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2606.10613"},"observation_digest":"sha256:28199a57fa8bec97db3c992bf9b65e23ddb6429ee0708db880166bc353eaa7e1","observation_id":"b69f719c-2681-4cba-b14f-b0a96caa8187","resolution":{"observed_at":"2026-07-03T04:27:36.359425Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2606.10825","last_updated":"2026-06-09T13:09:21Z","snapshot_observed_at":"2026-07-06T23:49:56.404171Z","submitted_at":"2026-06-09T13:09:21Z","title":"MODIP: Efficient Model-Based Optimization for Diffusion Policies","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-27T13:44:19.708550Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2606.10825"},"observation_digest":"sha256:4f412351b02fe279e97a683f770bdb4280a89d06b3379a09f2b1fe566a010f0c","observation_id":"06216ae3-c849-4049-811c-d242e4cb7db7","resolution":{"observed_at":"2026-07-03T04:37:37.563763Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2606.11087","last_updated":"2026-06-09T16:45:57Z","snapshot_observed_at":"2026-08-02T20:45:09.177143Z","submitted_at":"2026-06-09T16:45:57Z","title":"Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T14:05:01.073951Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2606.11087"},"observation_digest":"sha256:5492cd18e6196ecaf161183c6e75ab72c3fc8c0bfcddc7873a5115b0e7c96b22","observation_id":"a93d95b9-b1af-49c1-8b5c-4358081e92c1","resolution":{"observed_at":"2026-07-03T04:17:36.916636Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2606.21646","last_updated":"2026-06-19T17:57:09Z","snapshot_observed_at":"2026-08-01T11:35:10.251786Z","submitted_at":"2026-06-19T17:57:09Z","title":"Energy-based Compositional Diffusion Planning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T14:12:33.307261Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2606.21646"},"observation_digest":"sha256:c32ddfad5d650f9be44e036f4e7f1cc470e5fedbe29f38c731d04fab6398f0b0","observation_id":"bffd78e1-b49c-4867-a2fc-b576d1c736b3","resolution":{"observed_at":"2026-07-04T06:49:37.746641Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2606.27766","last_updated":"2026-06-26T06:51:16Z","snapshot_observed_at":"2026-08-05T05:40:05.365084Z","submitted_at":"2026-06-26T06:51:16Z","title":"RS-Diffuser: Risk-Sensitive Diffusion Planning with Distributional Value Guidance","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T05:05:39.828659Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2606.27766"},"observation_digest":"sha256:f90bdece02bbbccbe4fbe60651fd904457f1d3ead7b6654fb6fbf7ddb10271c6","observation_id":"076ee41d-ae43-40d9-b6af-c9cecbb6361b","resolution":{"observed_at":"2026-06-29T18:23:51.477914Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2208.06193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-04T06:49:37.744619Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","venue":"cs.LG","work_id":"dd3fee6a-963f-4e7d-8dd8-b30bd0b76fb5","year":2022},"citing_paper":{"arxiv_id":"2607.02092","last_updated":"2026-07-03T08:21:35Z","snapshot_observed_at":"2026-08-07T17:46:16.883174Z","submitted_at":"2026-07-02T12:30:50Z","title":"Guided Action Flow: Q-Guided Inference for Flow-Matching Vision-Language-Action Policies","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-03T11:50:49.215046Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2607.02092"},"observation_digest":"sha256:ec308fc4b521ad05fb488f5aa859bc52ec7401cfad63dc00d7297259a9d1ebdb","observation_id":"7bc40a06-f596-4293-abb5-ed9fa45284d0","resolution":{"observed_at":"2026-07-03T11:58:05.723569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-12T08:26:59.428524Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02092","last_updated":"2026-07-03T08:21:35Z","snapshot_observed_at":"2026-08-07T17:46:16.883174Z","submitted_at":"2026-07-02T12:30:50Z","title":"Guided Action Flow: Q-Guided Inference for Flow-Matching Vision-Language-Action Policies","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T08:26:59.428524Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2607.02092"},"observation_digest":"sha256:40b56e0440bf68e935a0e79ed6b15cd42ccfdf71ebba9605acd70486a5a9292b","observation_id":"d7d23c51-e4e5-4295-8d10-f1a6f1327b57","resolution":{"observed_at":"2026-07-12T08:26:59.428524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-14T08:30:10.584105Z","title":"Diffusion policies as an expres- sive policy class for offline reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10892","last_updated":"2026-07-12T19:48:46Z","snapshot_observed_at":"2026-08-08T14:33:47.467368Z","submitted_at":"2026-07-12T19:48:46Z","title":"A Single Diffusion-Policy Controller for Multi-Task Block Pushing with Zero-Shot Sim-to-Real Transfer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T08:30:10.584105Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2607.10892"},"observation_digest":"sha256:e84dd4b320603d1a7c4dcee859bdb51c1ec078e6fa1f52dc4db270f4ff434f9b","observation_id":"81ce14fc-6107-400f-9081-925c4e3fc569","resolution":{"observed_at":"2026-07-14T08:30:10.584105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-01T17:45:11.182095Z","title":"arXiv preprint arXiv:2208.06193 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17560","last_updated":"2026-07-20T05:09:36Z","snapshot_observed_at":"2026-08-05T13:38:45.921055Z","submitted_at":"2026-07-20T05:09:36Z","title":"Reinforcement Learning: From Algorithms To Foundation Models","version":1},"reference_index":146,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:11.182095Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2607.17560"},"observation_digest":"sha256:59e0751b4eade3cce3e387a87db84d76bdee421a6827ccfb8d9a45c6c4b1d972","observation_id":"6f34c692-fc82-4357-aaa5-fc1f2bec7ba4","resolution":{"observed_at":"2026-08-01T17:45:11.182095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-07-31T01:24:21.575169Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27422","last_updated":"2026-07-29T19:43:40Z","snapshot_observed_at":"2026-08-09T23:25:40.671878Z","submitted_at":"2026-07-29T19:43:40Z","title":"Good Rankers, Bad Objectives: Bilinear Contrastive Critics under Expressive Policy Search","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-31T01:24:21.575169Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2607.27422"},"observation_digest":"sha256:448b93bf31c691d032d577ca81a3785908a9af140ee6e522b02f71a1661156fe","observation_id":"c2aa95f3-ad94-40d2-b9c8-9cf54e7e21ad","resolution":{"observed_at":"2026-07-31T01:24:21.575169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-04T01:16:04.653728Z","title":"Hunt, and Mingyuan Zhou","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:04.653728Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:289b278610e4091a2c28ef2220569b16fc816d364e6d9ca8d54f7cd7a580209c","observation_id":"65176c4b-f0e2-447f-8ebf-363b34b5ffdf","resolution":{"observed_at":"2026-08-04T01:16:04.653728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-06T00:32:46.484739Z","title":"arXiv preprint arXiv:2208.06193 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01205","last_updated":"2026-08-02T12:42:20Z","snapshot_observed_at":"2026-08-10T01:19:20.004392Z","submitted_at":"2026-08-02T12:42:20Z","title":"ReBRAC-v2: The Return of the King","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-06T00:32:46.484739Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2608.01205"},"observation_digest":"sha256:189664654c09cf7e864ed494ce25ee20e325b18cb5b473acc11810308b9aa719","observation_id":"758f9309-a314-4a46-80c2-a2c53f2a5bbb","resolution":{"observed_at":"2026-08-06T00:32:46.484739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-04T19:45:35.322822Z","title":"Hunt, and Mingyuan Zhou","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01851","last_updated":"2026-08-03T07:58:35Z","snapshot_observed_at":"2026-08-07T23:22:57.641630Z","submitted_at":"2026-08-03T07:58:35Z","title":"Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills","version":1},"reference_index":265,"source":"pdf_text","source_observed_at":"2026-08-04T19:45:35.322822Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2608.01851"},"observation_digest":"sha256:0869fb401c3928cbcccc6fcabcc3a50f6bed99e925d8727c389141bce7ecf7c1","observation_id":"e1af34ed-08b7-4250-b4f4-ba4dc3411141","resolution":{"observed_at":"2026-08-04T19:45:35.322822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2208.06193/citation-record","integrity":"/paper/2208.06193/integrity","json":"/paper/2208.06193/citation-record.json","paper":"/paper/2208.06193"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.15657","last_updated":"2023-07-10T07:25:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-28T18:59:02Z","title":"Is Conditional Generative Modeling all you need for Decision-Making?","version":4},"cited_work":{"arxiv_id":"2211.15657","doi":"10.48550/arxiv.2211.15657","metadata_source":"pith","pith_arxiv_id":"2211.15657","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Conditional Generative Modeling all you need for Decision-Making?","venue":"cs.LG","work_id":"dac365c0-e557-4886-9a1b-179151a66160","year":2022},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"cited_paper":"/paper/2211.15657","citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:f0ab1416218eb2772da03f9847bc5478499994abec3358fdc75a03b8c426f065","observation_id":"eec0bf49-870f-4c19-9509-febcfe95ff3a","resolution":{"observed_at":"2026-05-15T15:35:11.667805Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-11T22:49:28.005241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T22:49:28.005241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:e95dc75cd0c3ac1df2189795162bb35ea4a5ffe632ccc1fc4cd520a5dab265f1","observation_id":"056b3df7-809a-4f66-9d87-30044f2e8677","resolution":{"observed_at":"2026-05-15T07:55:15.719096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":"a9dfa48c-bb2c-42e5-9b2c-49d7cfd660b5","year":2052},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:a2b4be9daa3b16b6c727fa77cdbfaf406be3d2cc1df7631c597ec87279d7889f","observation_id":"09bfa496-0d19-4c70-b90d-196d3cace0d6","resolution":{"observed_at":"2026-05-15T07:55:15.866945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00695","last_updated":"2022-06-01T18:04:43Z","snapshot_observed_at":"2026-08-09T06:15:57.610702Z","submitted_at":"2022-06-01T18:04:43Z","title":"Know Your Boundaries: The Necessity of Explicit Behavioral Cloning in Offline RL","version":1},"cited_work":{"arxiv_id":"2206.00695","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.00695","snapshot_observed_at":"2026-07-04T08:59:43.304230Z","title":"Goo and S","venue":null,"work_id":"3d58821a-164f-4ec7-8c61-caf3a896a1fb","year":2022},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"cited_paper":"/paper/2206.00695","citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:7b190304a0fe4167dbf903fddc4c6325230b7d98753cd57c9a70831091d08fdf","observation_id":"bdef00ee-3763-4b84-87e8-7416d08c579d","resolution":{"observed_at":"2026-05-15T07:55:15.799302Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09991","last_updated":"2022-12-21T01:06:18Z","snapshot_observed_at":"2026-08-06T05:32:02.292779Z","submitted_at":"2022-05-20T07:02:03Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","version":2},"cited_work":{"arxiv_id":"2205.09991","doi":"10.48550/arxiv.2205.09991","metadata_source":"pith","pith_arxiv_id":"2205.09991","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","venue":"cs.LG","work_id":"38b2c635-b754-412a-a8f5-dfcf3e405c95","year":2022},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"cited_paper":"/paper/2205.09991","citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:3499427390391990ee1786e4b7cf7dc6c1c4ea24d7d19153dd42bf018614359a","observation_id":"cbd67746-5e7a-4a00-bc36-45eba698131b","resolution":{"observed_at":"2026-05-15T07:55:15.806639Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:ba890c73276728bac6c54b50933a326ab0cf86977274d6c8c66684825b35fd75","observation_id":"15a2ef3a-8960-4322-b194-f505d72b1254","resolution":{"observed_at":"2026-05-15T07:55:15.813188Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":"2110.06169","doi":"10.48550/arxiv.2110.06169","metadata_source":"pith","pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","venue":"cs.LG","work_id":"4adca4ff-8975-49b3-aee4-2ef7e0f95275","year":2021},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:6bec97772ebe78e4eb2eac1f4de2a63cd2965f65d87924770e298480d7b2c6db","observation_id":"2b680175-38fd-4be1-b83c-e58cf3e1ab98","resolution":{"observed_at":"2026-05-15T07:55:15.820040Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":"1509.02971","doi":"10.1137/22m1480409","metadata_source":"pith","pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Continuous control with deep reinforcement learning","venue":"cs.LG","work_id":"41a65444-c819-4303-a1f1-b075aa86d40c","year":2015},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:f5e0a24a0728ab8253c45b356af217165a70957de0272992cd36e3e43a5daaf8","observation_id":"1176ba35-2a80-4c29-bd9c-e9916b6c243d","resolution":{"observed_at":"2026-05-15T07:55:15.827422Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00927","last_updated":"2022-10-13T12:04:36Z","snapshot_observed_at":"2026-08-03T02:03:48.954468Z","submitted_at":"2022-06-02T08:43:16Z","title":"DPM-Solver: A Fast ODE Solver for Diffusion Probabilistic Model Sampling in Around 10 Steps","version":3},"cited_work":{"arxiv_id":"2206.00927","doi":"10.48550/arxiv.2206.00927","metadata_source":"pith","pith_arxiv_id":"2206.00927","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dpm-solver: A fast ode solver for diﬀusion probabilistic model sampling in around 10 step s","venue":"cs.LG","work_id":"5a71e28c-3c07-4f30-bfe2-17ea2361df24","year":2022},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"cited_paper":"/paper/2206.00927","citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:260edbfedb9a1424871a792347afd69ae4543a821f2d189a4c0763fccb95f43e","observation_id":"e45bf9a9-d0eb-439f-a1f0-a4d5da48ae6a","resolution":{"observed_at":"2026-05-15T07:55:15.834614Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04745","last_updated":"2024-02-21T05:55:48Z","snapshot_observed_at":"2026-08-11T06:56:34.341594Z","submitted_at":"2022-06-09T19:44:35Z","title":"Mildly Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2206.04745","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04745","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mildly conservative Q-learning for offline reinforcement learning","venue":null,"work_id":"afaeafe5-7d71-4c58-8056-374d84dc52b8","year":null},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"cited_paper":"/paper/2206.04745","citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:da3b4d315d24c4b11514e02bdbbcf6f16f7a548abf2cfd00f039c8d251ed75a9","observation_id":"b0c20bb4-f22b-4b12-ae36-fcdfd60e549b","resolution":{"observed_at":"2026-05-15T07:55:15.841431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":"2006.09359","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-07-08T22:35:40.693821Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","venue":"cs.LG","work_id":"f0a11265-1acf-4ffc-a822-08bd04b6bddf","year":2020},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:7e948e3c25fda85559d41b93c72d413e26750ea5faa1641535223a77e3c9ed47","observation_id":"d78308f1-b0aa-4040-94c8-a851a7274406","resolution":{"observed_at":"2026-05-15T07:55:15.851450Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10677","last_updated":"2023-03-03T14:18:34Z","snapshot_observed_at":"2026-08-09T12:35:27.365083Z","submitted_at":"2023-01-25T16:31:05Z","title":"Imitating Human Behaviour with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2301.10677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.10677","snapshot_observed_at":"2026-07-04T07:59:40.250520Z","title":"Imitating human behaviour with dif- fusion models","venue":null,"work_id":"1551dccf-8902-46b9-bb62-f0102588de77","year":2023},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"cited_paper":"/paper/2301.10677","citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:effde1ec3ca1eae5b807281ee393bd408e35c0adb91435cdca04655e12ed3deb","observation_id":"7d877569-8fa1-4044-8954-9e689c3e98b9","resolution":{"observed_at":"2026-05-15T07:55:15.862233Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1910.00177","doi":"10.48550/arxiv.1910.00177","metadata_source":"pith","pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","venue":"cs.LG","work_id":"ab561983-ab59-4f04-a11e-a467ddde4848","year":2019},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:dd245dcae386aa264d3a9c665a013a5ebd14dcc2b5236eeb2a33a0d99bf08a28","observation_id":"7799ebfd-dddb-4a76-b042-45125ebc1b32","resolution":{"observed_at":"2026-05-15T07:55:15.725977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-08-09T18:51:51.917654Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":"2202.00512","doi":"10.48550/arxiv.2202.00512","metadata_source":"pith","pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","venue":"cs.LG","work_id":"fd04f498-ff85-4de3-bcc7-31ef072b2ceb","year":2022},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:ab3465cfc900ed9a2ccc36240f9695b9297077fd1592f73c14e49eb9fba1654b","observation_id":"faa0a6e7-1e72-4713-bff9-ae3ebe15d68e","resolution":{"observed_at":"2026-05-15T07:55:15.733570Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11251","last_updated":"2022-10-11T22:49:49Z","snapshot_observed_at":"2026-08-11T10:27:13.450219Z","submitted_at":"2022-06-22T17:57:08Z","title":"Behavior Transformers: Cloning $k$ modes with one stone","version":2},"cited_work":{"arxiv_id":"2206.11251","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.11251","snapshot_observed_at":"2026-07-01T19:46:10.539883Z","title":"Behavior Transformers: Cloning $k$ modes with one stone, October 2022","venue":null,"work_id":"1986ca6f-5e15-49e1-b8d9-9d14eb344ac6","year":2022},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"cited_paper":"/paper/2206.11251","citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:080c60c68508bef041c0278dd8e0ef72e71e1e466d9470b29414850cdd690db2","observation_id":"f31be01c-a54f-47c6-b36d-7199552fcd00","resolution":{"observed_at":"2026-05-15T07:55:15.742785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.03585","last_updated":"2015-11-18T21:50:51Z","snapshot_observed_at":"2026-07-06T04:11:47.439779Z","submitted_at":"2015-03-12T04:51:37Z","title":"Deep Unsupervised Learning using Nonequilibrium Thermodynamics","version":8},"cited_work":{"arxiv_id":"1503.03585","doi":"10.48550/arxiv.1503.03585","metadata_source":"pith","pith_arxiv_id":"1503.03585","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Unsupervised Learning using Nonequilibrium Thermodynamics","venue":"cs.LG","work_id":"986277c3-5997-4593-942c-17cdec737a72","year":2015},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"cited_paper":"/paper/1503.03585","citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:7e7b9a81f926f03889e990daa336dd2232bfd7b906b5b17c5675fc247b42b5ea","observation_id":"5bfd00f3-66bf-4be0-ab96-8305917d02a9","resolution":{"observed_at":"2026-05-15T07:55:15.750609Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-16T23:21:00.213109+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T23:21:00.213109+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":"2010.02502","doi":"10.48550/arxiv.2010.02502","metadata_source":"pith","pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Implicit Models","venue":"cs.LG","work_id":"8fa2128b-d18c-405c-ac92-0e669cf89ac0","year":2020},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:9f3837aadf0bd9b30d6c0f19c7c26cc274e015f15c4c770a9aef3c7dcc2e4b5a","observation_id":"646bd8c7-3c4e-48c1-b818-bac504da60b7","resolution":{"observed_at":"2026-05-15T07:55:15.757468Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"11 Published as a conference paper at ICLR 2023 Richard S Sutton and Andrew G Barto","venue":null,"work_id":"06350b76-e3be-4faa-a2dd-1a9d0bf53124","year":2023},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:fcffe29fd8c7d6c1cf90dd0f8b4005fc5712467f2092f9b37c1ddfa49d59d3a7","observation_id":"4597c9cd-12bf-4d7e-abd9-a6bef932c18a","resolution":{"observed_at":"2026-05-15T07:55:15.897816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02262","last_updated":"2023-08-25T16:33:42Z","snapshot_observed_at":"2026-08-02T22:32:37.041591Z","submitted_at":"2022-06-05T20:45:01Z","title":"Diffusion-GAN: Training GANs with Diffusion","version":4},"cited_work":{"arxiv_id":"2206.02262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.02262","snapshot_observed_at":"2026-07-09T22:36:36.139066Z","title":"Diffusion-gan: Training gans with diffusion","venue":"cs.LG","work_id":"a2e62cb1-df07-4acd-8f6e-4d0966d48afc","year":2022},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"cited_paper":"/paper/2206.02262","citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:55bbd6af44264b5789744846d79fc13e27e196a088b7d3989e9d9a469395cbc6","observation_id":"dc3e612c-74ac-4adb-ac94-ea72f0493613","resolution":{"observed_at":"2026-05-15T07:55:15.766018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:c0b0fdd16131a0f1ccc5737148e016ad2f3513fa0223728a7aaef85bbcbb04a8","observation_id":"b5d510ac-e9e6-4f65-9da6-a99fdb5cef21","resolution":{"observed_at":"2026-05-15T07:55:15.772701Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.07804","last_updated":"2022-04-04T18:55:28Z","snapshot_observed_at":"2026-08-10T01:50:09.823474Z","submitted_at":"2021-12-15T00:09:38Z","title":"Tackling the Generative Learning Trilemma with Denoising Diffusion GANs","version":2},"cited_work":{"arxiv_id":"2112.07804","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.07804","snapshot_observed_at":"2026-07-04T10:29:45.256333Z","title":"Tackling the generative learning trilemma with denoising diffusion gans.arXiv preprint arXiv:2112.07804","venue":null,"work_id":"65500d8b-7cbe-4e4f-afa8-710307af4af0","year":2021},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"cited_paper":"/paper/2112.07804","citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:76e2779e9e25b4b6b859326f74d4f88123a675c426519fe1d787c7d05756c6fa","observation_id":"0f516002-3b44-48c1-9288-7a306d8a37cb","resolution":{"observed_at":"2026-05-15T07:55:15.782473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09671","last_updated":"2023-09-07T14:08:07Z","snapshot_observed_at":"2026-08-11T10:47:10.367917Z","submitted_at":"2022-02-19T20:18:49Z","title":"Truncated Diffusion Probabilistic Models and Diffusion-based Adversarial Auto-Encoders","version":4},"cited_work":{"arxiv_id":"2202.09671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.09671","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2202.09671 , year=","venue":null,"work_id":"17142529-168d-40be-9f46-baf6a8bdfcd5","year":2022},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"cited_paper":"/paper/2202.09671","citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:d534be494a61cda7f4f09909c20cf9ef742c360248d8250f0191260f1a6e00ce","observation_id":"910a542d-217a-40b8-9616-a742d395493e","resolution":{"observed_at":"2026-05-15T07:55:15.790173Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Actions are again in a real-valued 2D space, a ∈ [−1, 1]2","venue":null,"work_id":"fda3cc14-95a5-48cb-b3e4-30e3ef2a859b","year":2023},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:b3b4701c81677daac81160c2b59445cd773fd126992021161b560e762bdb2a6a","observation_id":"126a36ee-4124-4a85-960c-9631dbc26c36","resolution":{"observed_at":"2026-05-15T07:55:15.884405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For behavior-cloning experiments, we observe that only our diffusion model could recover the orig- inal data distribution while the prior regularization methods fail in some way","venue":null,"work_id":"b1f623bb-4925-4709-9054-58f23e1871d7","year":2023},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:bcc0d54889cd2514e378f324667fc5a851e207a4fffd2c9569b5a0828e73df27","observation_id":"9da335d2-6e26-488f-804a-88b6e6399be4","resolution":{"observed_at":"2026-05-15T07:55:15.888579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"C E XPERIMENTAL DETAILS We train our algorithm with 2000 epochs for Gym tasks and 1000 epochs for the other tasks, where each epoch consists of 1000 gradient steps","venue":null,"work_id":"dcc78b61-2711-4b0d-b212-629a379b811b","year":2000},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:03fbaad8c7701421c814cde5228bf9edc77dc762ed3f64c4c969f6145c4e67e4","observation_id":"6a7801aa-0b8f-42c0-8072-4de1ee3d2fcc","resolution":{"observed_at":"2026-05-15T07:55:15.893643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0a0c1ebc-1a09-402c-a39f-97c6dcd48911","year":2020},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:9be0d9da8d4f18243ed532b8f8f406a848f58b977861e4d399308d5989fd55f4","observation_id":"9398589f-2a9e-43e8-b906-22f24c86974a","resolution":{"observed_at":"2026-05-15T07:55:15.901707Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cc8a8577-c5ac-4ea7-9d5b-2469e723d652","year":2023},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:daca6d470709213018b4965c38d793f4e853f14eb3650963024a0042bc6b3882","observation_id":"6f5da7f8-fb38-4ba8-baee-5e58384533ed","resolution":{"observed_at":"2026-05-15T07:55:15.870971Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We have shown this results in learning better policies in offlineRL","venue":null,"work_id":"9b434004-f189-49e2-ae38-d74aea2d2f01","year":2022},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:8b99f08b91b349317471f17905fea0155d452d084e6823ff4dc12eedcc850eae","observation_id":"395d7135-2397-49e4-ab6b-1f201ea0ddd7","resolution":{"observed_at":"2026-05-15T07:55:15.875344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a923b74a-b926-41e2-9bd6-e7ae83b3ae6f","year":1994},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:cdcd1292091a3578053a326e7863f18a946c99af18fed8199753dfc58f5270d4","observation_id":"9dd233b3-618a-4edb-81c0-2a3e8c99fe04","resolution":{"observed_at":"2026-05-15T07:55:15.879187Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":2,"verified_exact":17,"verified_fuzzy":6},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 83 inbound Pith citation observations for arXiv:2208.06193."}