{"as_of":"2026-08-08T04:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:19f64656a778ae3790757f7349b35a293aab49dfd9824f2e4a6fb8dcf2bfbf78","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:56:30.265947Z","state":"measured"},{"denominator":113,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":113,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":34,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:42:22.223628Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:39:58.122193Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-08-05T14:42:22.223628Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21016","last_updated":"2025-08-28T17:18:31Z","snapshot_observed_at":"2026-08-06T03:08:28.577840Z","submitted_at":"2025-08-28T17:18:31Z","title":"Inference-Time Alignment Control for Diffusion Models with Reinforcement Learning Guidance","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T14:42:22.223628Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2508.21016"},"observation_digest":"sha256:01bb8fc789d2a0e29cc974e393a7cd3ba441f0115b07d7db53d51d36c33358cd","observation_id":"56e107ec-6e8c-4c85-a1b2-0b52646da785","resolution":{"observed_at":"2026-08-05T14:42:22.223628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2509.16117","last_updated":"2026-02-16T17:14:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-19T16:09:33Z","title":"DiffusionNFT: Online Diffusion Reinforcement with Forward Process","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T16:54:30.953199Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2509.16117"},"observation_digest":"sha256:c5d28d13e6da590234571733adfb51afb9d0a8aaea41e22f5ac23b99a1410114","observation_id":"e09793a3-be45-46dd-ab6f-0509b118ac7c","resolution":{"observed_at":"2026-05-13T16:54:30.998401Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T10:34:59.134604Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2511.14759"},"observation_digest":"sha256:d15c3a44b080b0c81fd7292c19d0b25d5cdc6bb501ed79bc57c9361b0ef3555f","observation_id":"c674f213-37de-4d0d-bacb-bec5bad07779","resolution":{"observed_at":"2026-05-12T10:34:59.250729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-08-03T21:06:29.374560Z","title":"Diffusion guidance is a controllable policy improvement operator","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-07T13:59:49.620528Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:29.374560Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:9e237228708d6a82e4e7d36d126721c29e1fe5e418e74289873ed2a73c47aeee","observation_id":"21705f32-f9ce-49ff-a85b-0490e878683c","resolution":{"observed_at":"2026-08-03T21:06:29.374560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-08-03T13:18:29.364170Z","title":"Diffusion guidance is a controllable policy improvement operator.arXiv preprint arXiv:2505.23458,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-03T13:18:24.988636Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:29.364170Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:48b19afaa17e64b9990ce87e3768b16ab7abe350869907f2ce4d5eb557c3498e","observation_id":"cba2875a-4da8-40c8-be8f-2d6167778d44","resolution":{"observed_at":"2026-08-03T13:18:29.364170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2602.11075","last_updated":"2026-04-28T08:51:16Z","snapshot_observed_at":"2026-08-03T04:09:34.408025Z","submitted_at":"2026-02-11T17:43:36Z","title":"RISE: Self-Improving Robot Policy with Compositional World Model","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T02:28:37.997148Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2602.11075"},"observation_digest":"sha256:ab85c52cec876b568f1b0aa44f9f1e5efbcdf101f32e3a1e97b5af4ebfeea4c0","observation_id":"1b108cbb-24e0-4cb4-a360-d36d9a30a11f","resolution":{"observed_at":"2026-05-16T02:30:31.938553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-08-02T23:47:54.752480Z","title":"Diffusion guidance is a controllable policy improvement operator.arXiv preprint, arXiv:2505.23458, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12691","last_updated":"2026-06-20T06:22:27Z","snapshot_observed_at":"2026-08-06T14:37:27.953191Z","submitted_at":"2026-02-13T07:46:37Z","title":"ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T23:47:54.752480Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2602.12691"},"observation_digest":"sha256:c61e64341348dc4b24281180b03de8a21767ab8368341c2d7955a70fb3d3c56a","observation_id":"c50286fe-3ad8-49ce-8090-0f3f49962bf5","resolution":{"observed_at":"2026-08-02T23:47:54.752480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2602.13193","last_updated":"2026-04-06T03:04:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-13T18:57:56Z","title":"Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T22:05:39.797848Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2602.13193"},"observation_digest":"sha256:510fd8c9fb60cdc42871e3785fe96d065a51a13d6fc03c14f64fbb40e2ba38c6","observation_id":"6feff226-b30e-4dc5-ad74-e425c919bf0f","resolution":{"observed_at":"2026-05-15T22:06:43.044814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-14T23:47:45.866615Z","title":"Diffusion guidance is a controllable policy improvement operator.arXiv preprint arXiv:2505.23458, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10250","last_updated":"2026-05-24T03:43:13Z","snapshot_observed_at":"2026-08-06T17:26:04.405292Z","submitted_at":"2026-03-10T22:01:13Z","title":"GeMPO: Generalized Measure Matching for Online Diffusion Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T23:47:45.866615Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2603.10250"},"observation_digest":"sha256:ded7bafade75b0fb4b8bd805364ecaec808433e6a8c7d2f4a2aa643875db0552","observation_id":"9dae9f6f-7c72-481c-868b-5f8291ec48e8","resolution":{"observed_at":"2026-07-14T23:47:45.866615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-14T23:46:32.301737Z","title":"Diffusion guidance is a controllable policy improvement operator","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.10263","last_updated":"2026-07-01T06:52:08Z","snapshot_observed_at":"2026-08-07T08:16:48.418429Z","submitted_at":"2026-03-10T22:49:46Z","title":"From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T23:46:32.301737Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2603.10263"},"observation_digest":"sha256:374efc7850fc34fe5dc5067885ef072fbe599cc09d71f46fb36dd78d73936c6f","observation_id":"54c53f7d-15fd-40a5-b96b-befcb10abac6","resolution":{"observed_at":"2026-07-14T23:46:32.301737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Diffusion guidance is a controllable policy improvement operator,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-07T09:35:56.440371Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:e7cd5f4c0b338a19eeb473eb6814f072e97936fb420692807871e040cbf93a36","observation_id":"99916ee1-1754-44d0-ac18-3fa2ad6c56d5","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2604.08168","last_updated":"2026-04-09T12:28:14Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T12:28:14Z","title":"ViVa: A Video-Generative Value Model for Robot Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T17:12:08.970164Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2604.08168"},"observation_digest":"sha256:7f956d0d92887e509bf889391e55818240adb107ef0937e9a5efcc4969b15e6b","observation_id":"cc3c10a8-86bf-4b35-95a9-20bf1f2df124","resolution":{"observed_at":"2026-05-11T07:25:59.160153Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-13T00:03:53.609175Z","title":"Diffusion guidance is a controllable policy improvement operator.arXiv preprint arXiv:2505.23458, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.08169","last_updated":"2026-07-02T01:38:10Z","snapshot_observed_at":"2026-08-07T08:51:57.871195Z","submitted_at":"2026-04-09T12:28:22Z","title":"Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T00:03:53.609175Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2604.08169"},"observation_digest":"sha256:817babacc8d40beb1a8f935f2a65a367395b694dee30ac6041d61aa586ae8250","observation_id":"b7a92b01-d2b5-4d81-a199-b009fea7e531","resolution":{"observed_at":"2026-07-13T00:03:53.609175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2604.08174","last_updated":"2026-04-09T12:31:43Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T12:31:43Z","title":"Value-Guidance MeanFlow for Offline Multi-Agent Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T16:50:51.653571Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2604.08174"},"observation_digest":"sha256:3328574c644196f3b36a7603f1b74382783ccddd6d104db6ddb579f74015454c","observation_id":"116dcf5c-f634-4dfc-a916-2a6d8186b23f","resolution":{"observed_at":"2026-05-11T08:05:58.896724Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2604.14265","last_updated":"2026-04-15T17:12:56Z","snapshot_observed_at":"2026-07-06T23:02:05.116649Z","submitted_at":"2026-04-15T17:12:56Z","title":"Reinforcement Learning via Value Gradient Flow","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-10T13:18:16.532434Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2604.14265"},"observation_digest":"sha256:6e0a73109e2d0830da5f1e967961ccd3be231cdf00fa8de304dace791557f615","observation_id":"751150a7-56e0-4b66-bdbd-90071755782a","resolution":{"observed_at":"2026-05-10T13:20:25.655050Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2604.15577","last_updated":"2026-04-16T23:13:22Z","snapshot_observed_at":"2026-08-03T19:50:27.280341Z","submitted_at":"2026-04-16T23:13:22Z","title":"Reward Weighted Classifier-Free Guidance as Policy Improvement in Autoregressive Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T10:54:57.732141Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2604.15577"},"observation_digest":"sha256:671c4a5be7a8687fc206d2ef8f9fff2def88751da829e8e207eddd19914a7c89","observation_id":"0b4e3dca-8494-4ee4-a417-c80a3138ea27","resolution":{"observed_at":"2026-05-10T10:55:03.845502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2605.03075","last_updated":"2026-05-04T18:44:19Z","snapshot_observed_at":"2026-07-06T23:16:05.372336Z","submitted_at":"2026-05-04T18:44:19Z","title":"Refining Compositional Diffusion for Reliable Long-Horizon Planning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T17:47:58.141126Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2605.03075"},"observation_digest":"sha256:074b533907f4933cb78ddca0624fdf0896e806de637fc8315f5cd776db8b8e3f","observation_id":"d03a8337-83c4-4fc6-99fc-a10f2e1ca7cb","resolution":{"observed_at":"2026-05-11T17:11:18.920112Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2605.13013","last_updated":"2026-05-13T05:07:32Z","snapshot_observed_at":"2026-07-06T23:24:37.915639Z","submitted_at":"2026-05-13T05:07:32Z","title":"JEDI: Joint Embedding Diffusion World Model for Online Model-Based Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T19:37:19.404335Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2605.13013"},"observation_digest":"sha256:0fa62f197b30f89287eed1170151b73e39b14131be4bd9e6410cdf34af297f28","observation_id":"160a7291-e759-4891-abc5-4bf75cc0c274","resolution":{"observed_at":"2026-05-14T19:37:51.906678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2605.13435","last_updated":"2026-06-22T11:20:01Z","snapshot_observed_at":"2026-08-02T21:35:58.384587Z","submitted_at":"2026-05-13T12:31:02Z","title":"Q-Flow: Stable and Expressive Reinforcement Learning with Flow-Based Policy","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T19:26:19.032362Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2605.13435"},"observation_digest":"sha256:1448b55845d0de9c83bde5e918f98686ec8aa4f838b5f6d2bae47ae4fb52da93","observation_id":"a00fd679-7e6d-4d2a-ac68-b370845d1fa2","resolution":{"observed_at":"2026-05-14T19:27:51.690341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2605.13435","last_updated":"2026-06-22T11:20:01Z","snapshot_observed_at":"2026-08-02T21:35:58.384587Z","submitted_at":"2026-05-13T12:31:02Z","title":"Q-Flow: Stable and Expressive Reinforcement Learning with Flow-Based Policy","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T21:35:14.348849Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2605.13435"},"observation_digest":"sha256:3d8b974066831edfb2e7d3222a265525442d4bd5344eed5b87d0be1b71754e30","observation_id":"5dd19e58-12e4-4496-a756-b80bf09c29d3","resolution":{"observed_at":"2026-07-01T14:25:46.674696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2606.09009","last_updated":"2026-06-08T04:13:38Z","snapshot_observed_at":"2026-08-05T08:14:57.435064Z","submitted_at":"2026-06-08T04:13:38Z","title":"Scaling by Diversified Experience for Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T17:12:50.216492Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2606.09009"},"observation_digest":"sha256:11befae22934e761f01b70724400ba87cc972f305caf90fce63f0b5af5e621fd","observation_id":"2f04b9ec-b5c1-47d0-bfe7-c1b9dbe2fb5f","resolution":{"observed_at":"2026-07-03T00:27:29.703257Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2606.09615","last_updated":"2026-06-08T15:21:45Z","snapshot_observed_at":"2026-08-03T16:03:00.502890Z","submitted_at":"2026-06-08T15:21:45Z","title":"DexPIE: Stable Dexterous Policy Improvement from Real-World Experience","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:22.504175Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2606.09615"},"observation_digest":"sha256:9ad7db7a576839198c1cc65dcd53758d0658cf8eaae98e52ab52eb9c31da493e","observation_id":"52822f58-c9ec-4ed4-8971-7b239830740f","resolution":{"observed_at":"2026-07-03T01:07:30.658025Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2606.11087","last_updated":"2026-06-09T16:45:57Z","snapshot_observed_at":"2026-08-02T20:45:09.177143Z","submitted_at":"2026-06-09T16:45:57Z","title":"Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T14:05:01.073951Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2606.11087"},"observation_digest":"sha256:4db6fc44d2cebf486eaaef46ba302d6263d4115c0be53e779a200b9708b3c543","observation_id":"bf1732f0-4678-40d3-8402-69278e232546","resolution":{"observed_at":"2026-07-03T04:17:36.902987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2606.13675","last_updated":"2026-06-11T17:59:45Z","snapshot_observed_at":"2026-07-30T00:58:38.369141Z","submitted_at":"2026-06-11T17:59:45Z","title":"Improving Robotic Generalist Policies via Flow Reversal Steering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T06:20:19.209180Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2606.13675"},"observation_digest":"sha256:7a3b5aa154181067cea2369ca9f770efc4d36879fad62ba03a865a300e299027","observation_id":"9b5bc7f2-3940-4368-a58f-6b6c11111dbd","resolution":{"observed_at":"2026-07-03T15:48:35.715045Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2606.17551","last_updated":"2026-06-16T05:56:10Z","snapshot_observed_at":"2026-07-06T23:53:07.149182Z","submitted_at":"2026-06-16T05:56:10Z","title":"Reversal Q-Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T02:30:24.951689Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2606.17551"},"observation_digest":"sha256:f6568a88c88601f67bd0489e7cc97474513079617ee5a983cb2ed86df417ce87","observation_id":"ee17dbea-1e62-424d-b08f-aa196c8abe32","resolution":{"observed_at":"2026-07-03T18:38:49.860828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2606.21406","last_updated":"2026-06-19T13:17:27Z","snapshot_observed_at":"2026-08-03T16:52:45.806990Z","submitted_at":"2026-06-19T13:17:27Z","title":"Robot Self-Improvement via Human-Video Dynamics Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-26T14:40:13.855741Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2606.21406"},"observation_digest":"sha256:6da26c231f05cae8e98871746d7d479979259e22808c40fe43ad2b7e436c2e3b","observation_id":"423458cd-c8b6-4838-9d59-e3ce23867c09","resolution":{"observed_at":"2026-07-04T06:19:37.562830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2606.24231","last_updated":"2026-06-23T07:21:36Z","snapshot_observed_at":"2026-07-06T23:58:49.574536Z","submitted_at":"2026-06-23T07:21:36Z","title":"FlowR2A: Learning Reward-to-Action Distribution for Multimodal Driving Planning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T00:19:49.473294Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2606.24231"},"observation_digest":"sha256:9f37d7007b9868851b911e71725c1601b18252d8a923e8f1b8bd988d1e6a3759","observation_id":"4df7f6ef-7196-4271-bc01-16b0a71e1671","resolution":{"observed_at":"2026-07-04T16:39:58.123745Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2606.28939","last_updated":"2026-06-27T14:23:21Z","snapshot_observed_at":"2026-07-07T00:02:57.622708Z","submitted_at":"2026-06-27T14:23:21Z","title":"ReGuide: From Test-Time Guidance to Self-Improving Diffusion Policies","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T09:45:55.963036Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2606.28939"},"observation_digest":"sha256:b5d127956825be424f17b535e6501f07b0233da13558f45d9f5cf3af12bf89a6","observation_id":"ac60c372-34e8-4bca-9091-38a5ec11690e","resolution":{"observed_at":"2026-06-30T12:54:40.533700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2606.29834","last_updated":"2026-06-29T06:19:35Z","snapshot_observed_at":"2026-08-05T12:21:57.329914Z","submitted_at":"2026-06-29T06:19:35Z","title":"STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T06:17:48.731091Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2606.29834"},"observation_digest":"sha256:b3f0f11cad97effc8c82343e27b63db3ee37fb7af73aba6edde34cc994004f19","observation_id":"da2aa04d-e3cb-46c6-a4ee-83dbef6125dd","resolution":{"observed_at":"2026-06-30T06:24:19.474411Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2607.02496","last_updated":"2026-07-02T17:55:39Z","snapshot_observed_at":"2026-08-05T17:58:26.059813Z","submitted_at":"2026-07-02T17:55:39Z","title":"Controllable Sim Agents with Behavior Latents","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-07-03T10:41:09.285743Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2607.02496"},"observation_digest":"sha256:130edaff30b870ef97c8adbb2c5df30a35fde697f76955b455b8b38545954e53","observation_id":"f9f5b974-9bec-4850-9588-93545f270202","resolution":{"observed_at":"2026-07-03T10:48:01.976930Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-12T06:41:57.276146Z","title":"Frans, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02840","last_updated":"2026-07-03T00:23:30Z","snapshot_observed_at":"2026-08-05T03:55:15.314478Z","submitted_at":"2026-07-03T00:23:30Z","title":"TACO: TActile World Model as a Self-COrrector forScalable VLA Post-Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T06:41:57.276146Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2607.02840"},"observation_digest":"sha256:b5bef8e408ac82802366c80dfda624a3258929cd974bbab79951dee578cae5b8","observation_id":"ac80c2fb-d7eb-4c50-935b-3f66ea3d10e2","resolution":{"observed_at":"2026-07-12T06:41:57.276146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Frans, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-06T15:16:44.357534Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:4e968ddf620699956206669125b36ba36939e4225209e41166cd40ee84dd0eed","observation_id":"e2819e81-cf32-47a0-9c56-7434a032f4f6","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-08-01T01:32:27.374609Z","title":"Diffusion guidance is a controllable policy improvement operator.arXiv preprint arXiv:2505.23458, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27782","last_updated":"2026-07-30T07:14:39Z","snapshot_observed_at":"2026-08-07T16:30:55.760479Z","submitted_at":"2026-07-30T07:14:39Z","title":"RedFlow: Redirect Failure into Action-Level Corrections for Flow-matching VLA Policy","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T01:32:27.374609Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2607.27782"},"observation_digest":"sha256:ac8a5bcc99d166484def2ff0bd4f853c8ed740fd063455ebae855341717d8cc4","observation_id":"f08ee7e7-79ca-4e0b-ac81-af9759d37e18","resolution":{"observed_at":"2026-08-01T01:32:27.374609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-08-03T12:23:58.895544Z","title":"frame_index","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29172","last_updated":"2026-07-31T08:50:25Z","snapshot_observed_at":"2026-08-07T19:51:49.393698Z","submitted_at":"2026-07-31T08:50:25Z","title":"CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Closed-Loop Iterative Fine-Tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T12:23:58.895544Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2607.29172"},"observation_digest":"sha256:d9ef6a1e80c76231f7aff7f0f807b769548628b3b6f20e7f8a4f91fd23880bc0","observation_id":"9f3b3865-8852-4d00-93fa-510cccdb0c58","resolution":{"observed_at":"2026-08-03T12:23:58.895544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23458/citation-record","integrity":"/paper/2505.23458/integrity","json":"/paper/2505.23458/citation-record.json","paper":"/paper/2505.23458"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.225725Z","title":"Diffusion policies for out-of-distribution generalization in offline reinforcement learning.IEEE Robotics and Automation Letters (RA-L), 9:3116–3123, 2024","venue":null,"work_id":"7e04ba8d-4686-49b1-94f2-492890222b70","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:24.913040Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:cc2bb9ba98ca582d7fc9e1f519621652e36c209f12a2d1abd936aff15cb8e736","observation_id":"274acc93-49ec-4872-82e3-7fc79ccf1802","resolution":{"observed_at":"2026-08-07T12:56:32.230721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.210945Z","title":"Building normalizing flows with stochastic interpolants","venue":null,"work_id":"669099e6-c6d8-4b53-ab9b-63895cf03d13","year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:24.978487Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:73fc2c5503a34d20299b8173511167ded8daa7abadcf66a18a8aead7cc9b05e9","observation_id":"0e25982c-fdbb-4d15-a09c-5f11796d28ca","resolution":{"observed_at":"2026-08-07T12:56:32.216123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.196668Z","title":"Uncertainty-based offline reinforcement learning with diversified q-ensemble","venue":null,"work_id":"9e18924c-0438-4873-a260-1fa1750ddf59","year":2021},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:25.066955Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:7a20977f70cd9d71806589939bc5d7233ddf55c8b42c8e33fa599e67dd8e6d7a","observation_id":"8c8a5edd-a8ff-4ab6-bfc9-6f2bd24dac69","resolution":{"observed_at":"2026-08-07T12:56:32.201252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.181560Z","title":"Hindsight experience replay","venue":null,"work_id":"4c31d418-b2e9-452b-85b4-5aa235bf1c42","year":2017},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:25.131856Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:5435a3ebb489b848e7904c5a2ba4a8a00b18859772555d43c0d95687ea3cc00f","observation_id":"d631dc44-c4c3-4791-a139-0e2f163d7972","resolution":{"observed_at":"2026-08-07T12:56:32.186004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T12:56:25.208106Z","title":"π0: A vision-language-action flow model for general robot control.ArXiv, abs/2410.24164, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:25.208106Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:e239500b8fd3220ebf181707151a1d8b03487f2a2e4831db8a300985f02dc6b6","observation_id":"9d261bb7-52e2-42b6-9e15-7cd904e73583","resolution":{"observed_at":"2026-08-07T12:56:25.208106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:25.296803Z","title":"Zero-shot robotic manipulation with pretrained image-editing diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:25.296803Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:303544ea38e69e35cb337fbeb5e7cb1544edd6d9fdf5bf85c857be7fa1347d86","observation_id":"58bcf97e-f0ce-4eb1-80b2-b42e8b204c9b","resolution":{"observed_at":"2026-08-07T12:56:25.296803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.156613Z","title":"Whitney, Rajesh Ranganath, and Joan Bruna","venue":null,"work_id":"ba13c2a9-d0fd-4d05-b76b-938d34cd80cd","year":2021},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:25.405048Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:9556cf2f757ea8e631f8ce9a71e00405e94c374f0858b8b4914a2899c9aa42dc","observation_id":"714c8e21-4f4a-42e1-88a9-710d62b6844c","resolution":{"observed_at":"2026-08-07T12:56:32.162096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.141047Z","title":"Offline reinforcement learning via high-fidelity generative behavior modeling","venue":null,"work_id":"de20a51f-06e6-4b13-a223-8aea98412419","year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:25.509248Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:5b9b6d9c887c8ae1bd83586a6e7a6e1d75cf3854fc4718c1920598d9fb0bce7a","observation_id":"c8d9265a-1c4c-48e5-9356-e219f334da01","resolution":{"observed_at":"2026-08-07T12:56:32.145715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.126235Z","title":"Score regularized policy optimization through diffusion behavior","venue":null,"work_id":"e1a1dc40-82c6-46c4-97b9-227ec50eb54b","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:25.589564Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:5bddec50c1b3aea2caf12e5f0042dc3e14ebf9f2cdaae70d7b7dc4937de3815f","observation_id":"74bde7e8-c041-4700-92e2-603a020bc4e2","resolution":{"observed_at":"2026-08-07T12:56:32.131431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.109586Z","title":"Aligning diffusion behaviors with q-functions for efficient continuous control","venue":null,"work_id":"de45a4ac-78f3-4f6d-9435-a44dd85b4073","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:25.704932Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:374a7b473f29172fff43d6b6002a03d5df22f041bff938b27d825c841a3cd1ae","observation_id":"802a466e-2092-4a69-b502-dbd8eef22ece","resolution":{"observed_at":"2026-08-07T12:56:32.115183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.095068Z","title":"Abbeel, A","venue":null,"work_id":"45184e5a-cfb9-4c20-a20d-6e37e9262c52","year":2021},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:25.778783Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:0381c060863296f82933c954c9679c9211a39bafd17edbd928db5ee8eaa48ffe","observation_id":"31dbe662-30bc-4e13-a288-4e83934ed286","resolution":{"observed_at":"2026-08-07T12:56:32.099654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.079988Z","title":"Diffusion policies creating a trust region for offline reinforcement learning","venue":null,"work_id":"8fe32c81-c8b1-4838-ada1-bfd048626195","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:25.891954Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:a99229489b4bbedf2a871e585668395a3f62f1df0c82ea00da8edcdc5f3d82e8","observation_id":"2e5c6a4c-cd75-47ac-a79d-c4ac3e03c3fc","resolution":{"observed_at":"2026-08-07T12:56:32.084718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:25.998739Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:25.998739Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:9f33917648393c3da308498c2ee628ef6c73752f38539f05facf72baf5d4e9be","observation_id":"f99072af-9eb1-449b-aa3c-70647f1bfc58","resolution":{"observed_at":"2026-08-07T12:56:25.998739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.054598Z","title":"da Silva","venue":null,"work_id":"6a5cd901-b668-4967-8ac4-88287a915f0e","year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:26.110964Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:7221769da250e4a71fc8e464161c5efec31d1b6ce5d9753a45e12595f5d0f11f","observation_id":"642ed821-922b-4b5d-a86d-7d811cc1397f","resolution":{"observed_at":"2026-08-07T12:56:32.059739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.038340Z","title":"Using expectation-maximization for reinforcement learning.Neural Computation, 9:271–278, 1997","venue":null,"work_id":"41893996-5256-4680-a45f-f4423f432e1c","year":1997},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:26.195008Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:9cbd30a3b3b422e347e4116214fcfbec5ddc107b955303f428c341338f842793","observation_id":"6660750a-a6d4-4d59-a499-5734479665b2","resolution":{"observed_at":"2026-08-07T12:56:32.044191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.023356Z","title":"Diffusion-based reinforcement learning via q-weighted variational policy optimization","venue":null,"work_id":"22a3706b-77ba-45fc-8b06-7dbe232fed3c","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:26.273415Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:51bf8ec00e50c39797481664863a6f5bd07eeff8ea6cb62a4647a2e013c21816","observation_id":"6baffa69-bd7b-42ef-9032-355ef9e9716a","resolution":{"observed_at":"2026-08-07T12:56:32.028196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.006513Z","title":"Consistency models as a rich and efficient policy class for reinforcement learning","venue":null,"work_id":"88873d75-28c2-4cd5-874c-a53210da9f4c","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:26.379402Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:a31b4f65cfcbb55c6ddcd8eab431f1275b41c7bc3b90381b851a2ec37a5ca850","observation_id":"d2ae4034-f701-45e1-b67f-ce913f910fe1","resolution":{"observed_at":"2026-08-07T12:56:32.012294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.989104Z","title":"Rvs: What is essential for offline rl via supervised learning? InInternational Conference on Learning Representations (ICLR), 2022","venue":null,"work_id":"6e13b3e0-3e8c-42d9-b095-910a66b9e496","year":2022},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:26.455926Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:dbb0d97c80af5acaa0890d64840a67798e7fc9a3be94f4ac313a2faacbbf412a","observation_id":"3dfa2dba-d65f-4a2f-b469-1a53c1577de1","resolution":{"observed_at":"2026-08-07T12:56:31.994233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.973033Z","title":"Imitating past successes can be very suboptimal","venue":null,"work_id":"1d19ce12-4d3e-41d4-a5b5-c7dfb56f3d16","year":2022},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:26.558212Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:2d917aa2c4b2b0b14b514142f75d4de2a6d5a9d3aea805a27c727ed3ea99b501","observation_id":"c051a217-5a4e-4391-aacb-46e6b944f61f","resolution":{"observed_at":"2026-08-07T12:56:31.977730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.956163Z","title":"Contrastive learning as goal-conditioned reinforcement learning","venue":null,"work_id":"d6ea606b-b384-44a9-802a-6431279247f6","year":2022},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:26.631969Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:631bb911e786f9d6a856f5249d0de64b2f09ad3900d21e7d7688dbab41c28726","observation_id":"5256e09e-c9a8-4162-a405-424367c63127","resolution":{"observed_at":"2026-08-07T12:56:31.961567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.940603Z","title":"Diffusion actor-critic: Formulating constrained policy iteration as diffusion noise regression for offline reinforcement learning","venue":null,"work_id":"05f158f0-7edc-4dc3-a088-788f763dda09","year":2025},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:26.695872Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:07908795a6b8e6f89b6a761809afcab6f66808d0bbed7f0f68b00d736d462dfa","observation_id":"ab7d341c-fbe0-4bb5-bcbe-8476cdff4e70","resolution":{"observed_at":"2026-08-07T12:56:31.945632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.926010Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":"2bc2e2dd-19fb-48a3-a29f-03755bed5cb0","year":2021},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:26.785311Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:5cf6cf717fe484eccfc9286698d69c7669e7a6de68cc6887cadf36fa7d88f1e1","observation_id":"69bb8e44-52f8-4eaf-8a65-28adba2ab38f","resolution":{"observed_at":"2026-08-07T12:56:31.930897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:26.868584Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:26.868584Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:f0d994cf46ec4a95642930d5158139382d08310c122cc95667ba1c94e06101e7","observation_id":"8d237293-255e-4cc9-bb01-6abf487dfdd2","resolution":{"observed_at":"2026-08-07T12:56:26.868584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.901576Z","title":"Murphy, and Tim Salimans","venue":null,"work_id":"c72e4feb-5069-43ea-8c3b-2207c3883772","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:26.952030Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:531f49e72f8853b353648dfa08ac1db06caae389b70813924d3b7898ad12d9a2","observation_id":"a683e37b-e065-4cb8-a17c-da924fc5e915","resolution":{"observed_at":"2026-08-07T12:56:31.906617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.886356Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":"31463783-8dc7-485a-9969-0c95e01de61a","year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.012832Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:b7a7bb2f2b6dfde9b84b0c8d382fe7284ce6c59c5549aee43d5b0fd445f495dc","observation_id":"00d8e094-27f7-4188-ae32-abe1b12d04a9","resolution":{"observed_at":"2026-08-07T12:56:31.891327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.870269Z","title":"Learning to reach goals via iterated supervised learning","venue":null,"work_id":"dd1e9324-d321-4473-a1d1-a68568ad329a","year":2021},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.077763Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:2a9cb868d85813810cdd9ea8a97e99a9216c82456110b062cd4fa3afaeb2767a","observation_id":"5a58fd3f-0340-408a-aa74-34bfd3a72932","resolution":{"observed_at":"2026-08-07T12:56:31.875520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.855084Z","title":"Closing the gap between td learning and supervised learning–a generalisation point of view","venue":null,"work_id":"08751c5a-0f80-4157-b5df-5e4dd7d46abf","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.159496Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:d2965fca5c5a4f1c9cb9cc854833a2b93663b88cfbd0c2a4cc461f10748e5df0","observation_id":"f936e271-bb74-451b-9a60-626cda99cec8","resolution":{"observed_at":"2026-08-07T12:56:31.860415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:27.219561Z","title":"Explaining and harnessing adversarial examples","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.219561Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:fba0b038c2553bd21640f5358ade238f438c8dc245064940ea9a19cb1cfed33a","observation_id":"b890cd14-cc24-450f-8c7a-cb04512583e1","resolution":{"observed_at":"2026-08-07T12:56:27.219561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.829517Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"cc496cf6-09c7-457a-ab48-8c613ccef7b0","year":2019},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.306393Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:004d94bab8bf6a9c8e7b710ec5bf43fa5eebde2e13ba724a2ac45d50bbc500bb","observation_id":"0af6ac9e-9dba-4833-81fe-212a580d3a1a","resolution":{"observed_at":"2026-08-07T12:56:31.835362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-07T12:56:27.377097Z","title":"Idql: Implicit q-learning as an actor-critic method with diffusion policies.ArXiv, abs/2304.10573, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.377097Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:720d81daf57f748d35d17397805782d18b12fcd94abe591c114498363a04a726","observation_id":"a609deab-73a5-4a8b-8378-70e300f433dc","resolution":{"observed_at":"2026-08-07T12:56:27.377097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05333","last_updated":"2024-02-28T13:48:09Z","snapshot_observed_at":"2026-07-06T16:29:32.059905Z","submitted_at":"2023-10-09T01:29:17Z","title":"DiffCPS: Diffusion Model based Constrained Policy Search for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05333","snapshot_observed_at":"2026-08-07T12:56:27.429381Z","title":"Diffcps: Diffusion model based constrained policy search for offline reinforcement learning.ArXiv, abs/2310.05333, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.429381Z"},"links":{"cited_paper":"/paper/2310.05333","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:111ab6bf503b236e058039cdbcad5266cc91210a4f9a71b109564ec72c50e45a","observation_id":"d80827a7-1c30-4b8b-b0e5-1a18224f6796","resolution":{"observed_at":"2026-08-07T12:56:27.429381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:27.509049Z","title":"Aligniql: Policy alignment in implicit q-learning through constrained optimization.ArXiv, abs/2405.18187, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.509049Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:dbaf99d872e60d6b1fcd00f1c313cdc9cc12331bd286def12ccbe5356541778b","observation_id":"5b45d15d-891e-4072-840a-4d8ea3a004fd","resolution":{"observed_at":"2026-08-07T12:56:27.509049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-07T12:56:27.600669Z","title":"Gaussian error linear units (gelus).ArXiv, abs/1606.08415, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.600669Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:f8538727ae5388aeae75c9bd5979f53a9ff74797c12d65a25f2f02b785d5fde4","observation_id":"4cdc18df-65ac-4108-9745-750ac70b7148","resolution":{"observed_at":"2026-08-07T12:56:27.600669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T12:56:27.693635Z","title":"Classifier-free diffusion guidance.ArXiv, abs/2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.693635Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:1fd47f0b3b410ac014e6b51134feda399e65567f48b815b805a3992fcf52fb60","observation_id":"53feb01d-6d0a-48da-8d91-cd9763944c6d","resolution":{"observed_at":"2026-08-07T12:56:27.693635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.814169Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"646aa0a1-7e9c-4edc-a23d-b740c064a11e","year":2020},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.756726Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:576a0b4842cc0e4fb158cfcd13368085e2ccd7f0f187e99155f6b43d2f6fd76a","observation_id":"2b83f3ae-92e2-49cb-86b3-f8b5cf6b2d18","resolution":{"observed_at":"2026-08-07T12:56:31.818742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.799400Z","title":"Tenenbaum, and Sergey Levine","venue":null,"work_id":"361cbdfa-7e18-425a-b68b-bab7aad94920","year":2022},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.830267Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:b37124e0b78fffb9b360bd9423da81e9fb07de194d50e68103386fe1d06c464c","observation_id":"79375b08-a493-42d7-b055-4c6e4e25eb82","resolution":{"observed_at":"2026-08-07T12:56:31.803927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.785449Z","title":"Efficient diffusion policies for offline reinforcement learning","venue":null,"work_id":"7563f9fc-0d3d-47fe-93fe-89c519806223","year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.927436Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:82936e933f64f3cfcc17a38dfb215296e00575a2b6f8eec39923d82f992f1387","observation_id":"04dfc25a-5712-416c-ad4c-bb68502e31b6","resolution":{"observed_at":"2026-08-07T12:56:31.790011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:28.003819Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.003819Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:c45a89fd4da79f36b9bbcb8319917ef287407e5e5b4ead77013f9a70e2e3fae8","observation_id":"b0a23421-8d9a-4410-a78f-015dc9ea282a","resolution":{"observed_at":"2026-08-07T12:56:28.003819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.760661Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":"59ece9e1-96f4-4ea3-af2f-06a096cf1ef4","year":2022},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.120329Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:99cac36a552d3828def6a1e1e10681a52b5ade5529103be7d781de63f4943d72","observation_id":"1f1d601c-2551-4ac9-8bc4-695c4a5526b3","resolution":{"observed_at":"2026-08-07T12:56:31.766144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.746174Z","title":"Advantage-conditioned diffusion: Offline rl via generalization.OpenReview, 2023","venue":null,"work_id":"528acd06-7615-4e23-9d8e-f042faded368","year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.181310Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:455a511decf50dd2863f406ee8fb785e66bb3f15ea86a82fe04caaea33dbec0f","observation_id":"19b2c0ff-aedb-4e00-8e0e-01f2ac6f42ab","resolution":{"observed_at":"2026-08-07T12:56:31.751229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-07T16:37:03.741931Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-08-07T12:56:28.274947Z","title":"Reward-conditioned policies.ArXiv, abs/1912.13465, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.274947Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:080f106d08beab349fa322f626bcbf8fb9be7a3abf1a84f122f5d741a687a202","observation_id":"b68cdd13-872c-4b13-9aac-37ecd00af636","resolution":{"observed_at":"2026-08-07T12:56:28.274947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.730853Z","title":"Tucker, and Sergey Levine","venue":null,"work_id":"205a970a-692c-4a1d-a64e-167348e8ee6e","year":2020},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.365220Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:426ab5d9862c4c7a7d47c8c28f7eee5b9549dd3abfb9cd9db256d9e3a233fe46","observation_id":"8ab444d0-758f-4913-84b3-886758f587d9","resolution":{"observed_at":"2026-08-07T12:56:31.736331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.715080Z","title":"Learning multimodal behaviors from scratch with diffusion policy gradient","venue":null,"work_id":"29e0f99b-d980-43af-ab61-12736b134ab7","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.446855Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:c9da600388620506790ea88084d4321a83d19b2469496f3bcbf212f7334202ff","observation_id":"54fb33ee-57a4-4ae5-ba20-ccd08657ac2d","resolution":{"observed_at":"2026-08-07T12:56:31.720162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.700780Z","title":"Lillicrap, Jonathan J","venue":null,"work_id":"7718db31-cd0e-4a75-aa7b-48d63a5018c4","year":2016},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.512443Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:5314e3a7a19731c9adb223cfeff7ab7eb734a844f31caffa19e5043daec79625","observation_id":"f14ddcfc-602d-4fa8-96ae-14e7d2bddbfb","resolution":{"observed_at":"2026-08-07T12:56:31.705213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:28.536332Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.536332Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:a0499f45a7d12884c2331e4c5d7b963073c065b77a7788b0eeac6f712a4701b2","observation_id":"c7778eff-81cd-448d-adc2-3761d12556a8","resolution":{"observed_at":"2026-08-07T12:56:28.536332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06264","last_updated":"2024-12-09T07:22:38Z","snapshot_observed_at":"2026-08-02T09:54:14.339169Z","submitted_at":"2024-12-09T07:22:38Z","title":"Flow Matching Guide and Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06264","snapshot_observed_at":"2026-08-07T12:56:28.549452Z","title":"Flow matching guide and code.arXiv preprint arXiv:2412.06264, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.549452Z"},"links":{"cited_paper":"/paper/2412.06264","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:6e90e101f589bac98bae7e6f9b9af56d08fbffae67a3f43eec76a05000c30de4","observation_id":"40be38c3-64eb-46d2-be15-b5110bc091d2","resolution":{"observed_at":"2026-08-07T12:56:28.549452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:28.554370Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.554370Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:7d5672ab24f989da18c5378b473fd5e411c09bac54172eec39e763c41b95fd3c","observation_id":"c15fd0fc-e658-40a5-9f74-445ad8470372","resolution":{"observed_at":"2026-08-07T12:56:28.554370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.666923Z","title":"Contrastive energy prediction for exact energy-guided diffusion sampling in offline reinforcement learning","venue":null,"work_id":"179417b7-8989-4634-8119-b572ee3f8e2a","year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.574898Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:dfdab77df6c6ae1781dfa368d8cdc3c63f9ba6158a144921f23e6e3996b39ae1","observation_id":"eb4ac65c-1a4a-45fd-89c7-228952e56585","resolution":{"observed_at":"2026-08-07T12:56:31.672148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:28.653436Z","title":"Learning latent plans from play","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.653436Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:17381d6ecfce06381376639b2dd688f3a48600a3b6b51ae1a241248746dc7266","observation_id":"186a8a5e-bffe-49d5-8301-714d5d616d02","resolution":{"observed_at":"2026-08-07T12:56:28.653436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.642982Z","title":"Diffusion-dice: In-sample diffusion guidance for offline reinforcement learning","venue":null,"work_id":"95de46bd-7c5e-4187-b202-88f6083003c9","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.713236Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:3791df2e3fe801a692f014be1bca558747c1c8367850f61f427f2a30ea63f28d","observation_id":"8b39392f-0dca-4393-9244-8e326a2cd847","resolution":{"observed_at":"2026-08-07T12:56:31.647886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-07-06T20:04:01.034597Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-08-07T12:56:28.792421Z","title":"Policy agnostic rl: Offline rl and online rl fine-tuning of any class and backbone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.792421Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:942aace3b6cff0848d7d98e098a9cc7f9240543aaea5fed759857300759624a8","observation_id":"a7725c5d-50d7-4222-a48e-3c5cdce9f246","resolution":{"observed_at":"2026-08-07T12:56:28.792421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.628066Z","title":"Mish: A self regularized non-monotonic activation function","venue":null,"work_id":"e8a7a73b-46f5-4759-b950-3912c5cabd1c","year":2020},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.875496Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:4c8647b0478bf603f154a917ce799b56ad88bfad75bcb9f0bd5b3b219813a482","observation_id":"ad88bfd8-f5c4-412d-b5d6-4f3426b19802","resolution":{"observed_at":"2026-08-07T12:56:31.633448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-07T12:56:28.945562Z","title":"Accelerating online reinforcement learning with offline datasets.ArXiv, abs/2006.09359, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.945562Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:23329c580095fb6ff3f925fbece58fae739088e9ff97f4d006bc76a01a19f52e","observation_id":"dc9e6f52-cd4f-4fc8-b454-080ea9473496","resolution":{"observed_at":"2026-08-07T12:56:28.945562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.612999Z","title":"Anti-exploration by random network distillation","venue":null,"work_id":"4484772b-7ef5-49b8-a217-d54f40f167ab","year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.026219Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:eb1928bf3444746fbde6fdc44d102c8e37f627e2f695f02a362a98e350852d9b","observation_id":"63304ea1-0b86-4062-ae8a-489c57bf65e0","resolution":{"observed_at":"2026-08-07T12:56:31.618102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.597513Z","title":"Is value learning really the main bottleneck in offline rl? InNeural Information Processing Systems (NeurIPS), 2024","venue":null,"work_id":"b3586e73-6fff-4867-aaee-ea0d09f08af3","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.036298Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:a5659c06ce734efc19d53e1ae3bb473ba4b0e5292bcc1cdf8e739c76fb5006bf","observation_id":"aff38423-441a-48b5-a61c-d9a8530723e8","resolution":{"observed_at":"2026-08-07T12:56:31.602591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:29.040779Z","title":"Ogbench: Benchmarking offline goal-conditioned rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.040779Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:ae677e332045620a6118ebbdbf2c278cc91b885dd7b270a58c25c8b33ddb05b2","observation_id":"e8f0d878-ac34-4dda-bbd3-57460468c85f","resolution":{"observed_at":"2026-08-07T12:56:29.040779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.573006Z","title":"Flow q-learning","venue":null,"work_id":"4392b131-286e-4c8c-8d5b-37c156dc4bcf","year":2025},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.065263Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:24b0c75ca15a0dc7b30b36bb74f98fb4f9017e6a523b470ec2718aff3843ca48","observation_id":"47c62e4a-7ec3-413d-b363-d7a933bb5ccd","resolution":{"observed_at":"2026-08-07T12:56:31.577999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-07T12:56:29.148020Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning.ArXiv, abs/1910.00177, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.148020Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:dd735323a04949ccecca6da35ac9a22761e33f3d671b44cb2fd808c0973ef3ad","observation_id":"7c802dd2-e7f0-4e3a-a7c6-b8d2d3ce315d","resolution":{"observed_at":"2026-08-07T12:56:29.148020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.557225Z","title":"Reinforcement learning by reward-weighted regression for operational space control","venue":null,"work_id":"8b2e7b6b-c8cf-420e-a4d2-05ac763ab641","year":2007},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.220323Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:225fd90d829ce137a5f324c239eb12d76b3304420ecab255287b588af4f44cd1","observation_id":"2a6fe649-1620-49cb-9503-9196a9bba391","resolution":{"observed_at":"2026-08-07T12:56:31.562100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.543094Z","title":"Learning a diffusion model policy from rewards via q-score matching","venue":null,"work_id":"d77cd4c0-9a8d-49f0-be80-bd48797f2c2b","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.278182Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:e42dc7915282c9b9a01d1d2dd35de026e25dce46e03ca06699e772e545d47f52","observation_id":"ea3880fc-0749-47e5-bbe3-6c9b3a1ad795","resolution":{"observed_at":"2026-08-07T12:56:31.547890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.530058Z","title":"Diffusion policy policy optimization","venue":null,"work_id":"294c6d9f-cdf4-4648-91fa-212aee244dac","year":2025},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.356106Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:69554c657acbf732b00d6e7576870712d94418626e10647de03084b603b0544a","observation_id":"31f9eb45-0ce3-4031-be9e-a5a4fe774f09","resolution":{"observed_at":"2026-08-07T12:56:31.534055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.515781Z","title":"Trust region policy optimization","venue":null,"work_id":"3cd5cf80-aa31-4d51-a50e-80f4323ef7c9","year":2015},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.437576Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:812e844243d76b46f129839c9be88b49665ca305421d5586781c6badd02b2251","observation_id":"ddb9c88b-0d86-4d36-9e6d-b96d693575d6","resolution":{"observed_at":"2026-08-07T12:56:31.520084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T12:56:29.495573Z","title":"Proximal policy optimization algorithms.ArXiv, abs/1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.495573Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:6f123799f372d860bd7a2fedb7a4f0eebe54069b3d01795989cc4ed8a5fa6a30","observation_id":"5794becc-5d9e-4908-a0c2-dc1fb1b1ee4d","resolution":{"observed_at":"2026-08-07T12:56:29.495573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.501954Z","title":"Sikchi, Qinqing Zheng, Amy Zhang, and Scott Niekum","venue":null,"work_id":"5d9ad2f8-2a8c-4d4b-a581-4d3949d08edd","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.534334Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:bc55f8dd24cce0203ada8326b75ff7d363f34428bc6e289d4c10e14e199cccfd","observation_id":"f63e00e8-fe76-4f37-977e-baef64f090e5","resolution":{"observed_at":"2026-08-07T12:56:31.506492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:29.538385Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.538385Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:c6cd929acfcc63d8b85f7ce7f63916fd6d9013602bda352f0e49a03144e754f8","observation_id":"d8c70b07-4674-4b80-ab56-1f72b7ca04a8","resolution":{"observed_at":"2026-08-07T12:56:29.538385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.479218Z","title":"Generative modeling by estimating gradients of the data distribution","venue":null,"work_id":"6c7c4a60-882d-4934-8dd7-cf03d93c1709","year":2019},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.544585Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:c61842931424c544fd3a2e9bf36b4e01d2ee68da0bf7b582b439adf1548260f0","observation_id":"ae689195-a547-4cfa-a0ef-fcc6fba41660","resolution":{"observed_at":"2026-08-07T12:56:31.483749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.464584Z","title":"Sutton and Andrew G","venue":null,"work_id":"3ea11ea1-1749-41e8-802a-7ec2c4cddac5","year":2005},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.612569Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:674b8d453d69c4f3f784888177f629b9fd3becd41a70278c659f3758757f3bb3","observation_id":"5871684f-043c-42a1-a6d1-2b1e394593d7","resolution":{"observed_at":"2026-08-07T12:56:31.469657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.409808Z","title":"Policy gradient methods for reinforcement learning with function approximation","venue":null,"work_id":"b2d3642d-55f1-4e76-bae5-1d559034c55e","year":1999},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.689334Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:35978797d0e2200e91437a40d1a3321cb07f13b548c8830f438ae8f1c446ca30","observation_id":"6b9578f0-d2a8-466d-8172-62933aaaca77","resolution":{"observed_at":"2026-08-07T12:56:31.442908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:29.760477Z","title":"Revisiting the minimalist approach to offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.760477Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:8aad6c626fefaadc0b57f4095231eaaa502a5d85c142638d50a6b3f780abf299","observation_id":"e82727e7-5032-43ee-9501-5bc00cdd03b7","resolution":{"observed_at":"2026-08-07T12:56:29.760477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.260124Z","title":"Learning one representation to optimize all rewards","venue":null,"work_id":"8ab37364-578b-441d-84b9-9dfbfaef2b38","year":2021},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.799586Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:935c6c1ca945c166c36675fb0060a45a1823ff2e0bd670c79cd7be7cd8fc484d","observation_id":"8204b323-f5b4-4fe3-a956-2fbf79d60459","resolution":{"observed_at":"2026-08-07T12:56:31.328623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.166660Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":"f12a65d6-5792-44f1-b8fa-36d30a6af9fd","year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.858233Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:fc64ccbc8feedb9ac35fcd8bcbc9cad00b643d696bfdd8a074dbd4e6562287e6","observation_id":"44ea1e02-a513-4732-a729-ed5ce1f0510c","resolution":{"observed_at":"2026-08-07T12:56:31.182390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.057368Z","title":"Reed, Bobak Shahriari, Noah Siegel, Josh Merel, Caglar Gulcehre, Nicolas Manfred Otto Heess, and Nando de Freitas","venue":null,"work_id":"3a46c901-ebf2-4b7a-9f0e-4a9df030ce67","year":2020},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.933259Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:2f2a9c03e6b16f9d9c3f977812174ac9f97c69a4d99b60168d7be20e0d2e0e14","observation_id":"594f885e-0130-465b-a3d4-70f16a80e98d","resolution":{"observed_at":"2026-08-07T12:56:31.106882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-07T12:56:29.993903Z","title":"Tucker, and Ofir Nachum","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.993903Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:b039b2a5f0e6aeeb9bd963bcc0471a59e06ce94bb51b0c1258f318d0c4e36e40","observation_id":"e7adf455-ba68-41b8-ab50-8952b9fb234c","resolution":{"observed_at":"2026-08-07T12:56:29.993903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:30.946770Z","title":"Offline rl with no ood actions: In-sample learning via implicit value regularization","venue":null,"work_id":"e1655b32-08b2-4a6d-8fa2-46474c4c17d0","year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:30.055766Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:2914f9a2971075ea4fff575161d53f801cadd857826faeb29ef2bf4b023258f8","observation_id":"afcc1f24-a588-4efc-ba1a-105e0309a826","resolution":{"observed_at":"2026-08-07T12:56:30.997347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:30.816974Z","title":"Q-learning decision transformer: Leveraging dynamic programming for conditional sequence modelling in offline rl","venue":null,"work_id":"3f92eef4-a60b-481c-85b7-ce714c970680","year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:30.064184Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:cf84174923e9d73761d099eb9dc5667fc5b0110e37e0b46764b7d7d9fae287da","observation_id":"481580db-6b44-4321-8133-98cbe73ed38e","resolution":{"observed_at":"2026-08-07T12:56:30.876244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13122","last_updated":"2023-05-22T15:23:41Z","snapshot_observed_at":"2026-08-06T08:45:25.937091Z","submitted_at":"2023-05-22T15:23:41Z","title":"Policy Representation via Diffusion Probability Model for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13122","snapshot_observed_at":"2026-08-07T12:56:30.069061Z","title":"Policy representation via diffusion probability model for reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:30.069061Z"},"links":{"cited_paper":"/paper/2305.13122","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:d3c6bb095d4caba0ecada128f19546ac4cf3685cea21831eecea75f3f6458560","observation_id":"749c8f5a-2bf8-4433-b336-ba5affe8f977","resolution":{"observed_at":"2026-08-07T12:56:30.069061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.13425","last_updated":"2022-04-05T19:24:13Z","snapshot_observed_at":"2026-07-06T12:33:01.613365Z","submitted_at":"2022-01-31T18:39:27Z","title":"Don't Change the Algorithm, Change the Data: Exploratory Data for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.13425","snapshot_observed_at":"2026-08-07T12:56:30.096727Z","title":"Abbeel, Alessandro Lazaric, and Lerrel Pinto","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:30.096727Z"},"links":{"cited_paper":"/paper/2201.13425","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:9e3542468e876984398c377834e8227ca4cbc4b004d289ce01591581eee9014d","observation_id":"062be4fa-d7d1-4753-afa9-7000e4ee3e37","resolution":{"observed_at":"2026-08-07T12:56:30.096727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:30.683902Z","title":"Entropy-regularized diffusion policy with q-ensembles for offline reinforcement learning","venue":null,"work_id":"33972c54-b1ac-4765-859c-bd68f31bc91f","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:30.159233Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:9a4c7b1a8c37f4ba302ef3fa387eb30458ca5a4d4e256019b6a7d5454bad8391","observation_id":"b7214780-13b5-4915-a75a-6de01e8e131c","resolution":{"observed_at":"2026-08-07T12:56:30.703344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:30.667972Z","title":"Energy-weighted flow matching for offline reinforce- ment learning","venue":null,"work_id":"b3f554d9-c0cb-4341-ac55-a4ed021108a8","year":2025},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:30.265947Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:3579032890c61f52e8706fe3671f013c96a1f0dee18d380d709d1d2c80fc1513","observation_id":"fd15f4a3-d5a5-42db-ba9d-5a09e4d6c2c5","resolution":{"observed_at":"2026-08-07T12:56:30.673893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T12:43:26.442115Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":53},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 34 inbound Pith citation observations for arXiv:2505.23458."}