{"as_of":"2026-08-08T09:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8228210d183d50d44f5f5f44da4b96d428badb2890cefd67a70687e57ec9f3c0","coverage":[{"denominator":96,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:20:42.023257Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.20350/citation-record","integrity":"/paper/2505.20350/integrity","json":"/paper/2505.20350/citation-record.json","paper":"/paper/2505.20350"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:35.794468Z","title":"Diffusion policies for out-of-distribution generalization in offline reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:35.794468Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:7f537332e3543df5a0b9e2b8e4acb82b420cc740488baf409af21e215c88e7d6","observation_id":"7bb54068-3566-43d6-9ef6-5368890198c5","resolution":{"observed_at":"2026-08-07T14:20:35.794468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15657","last_updated":"2023-07-10T07:25:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-28T18:59:02Z","title":"Is Conditional Generative Modeling all you need for Decision-Making?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15657","snapshot_observed_at":"2026-08-07T14:20:35.841381Z","title":"Is conditional generative modeling all you need for decision-making? arXiv preprint arXiv:2211.15657, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:35.841381Z"},"links":{"cited_paper":"/paper/2211.15657","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:efe6bb58aaa37bba0ac446c5d65c1273802789aa1612c4118292122b3dd5c9e6","observation_id":"f119d52d-6872-42d2-8739-dad7a8a1e273","resolution":{"observed_at":"2026-08-07T14:20:35.841381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11096","last_updated":"2023-01-30T11:28:55Z","snapshot_observed_at":"2026-08-03T19:19:09.822597Z","submitted_at":"2022-11-20T21:57:10Z","title":"Let Offline RL Flow: Training Conservative Agents in the Latent Space of Normalizing Flows","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11096","snapshot_observed_at":"2026-08-07T14:20:35.925222Z","title":"Let offline rl flow: Training conservative agents in the latent space of normalizing flows","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:35.925222Z"},"links":{"cited_paper":"/paper/2211.11096","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:9837282cb9cbbae2652edd71afd48c747df9141033bac3acf07e2f7d7201ba51","observation_id":"de253d64-9fad-452f-b44c-a5243b4d6ea9","resolution":{"observed_at":"2026-08-07T14:20:35.925222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:35.996839Z","title":"Uncertainty-based offline reinforcement learning with diversified q-ensemble","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:35.996839Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:b16b4411925e96688fc69052081c2c0c4d270bdf29c1d244e2680d54d83bc67a","observation_id":"0f129e7f-1e58-4fca-a9d3-2fb211336e0d","resolution":{"observed_at":"2026-08-07T14:20:35.996839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.05556","last_updated":"2021-03-17T17:22:51Z","snapshot_observed_at":"2026-08-01T17:10:08.501525Z","submitted_at":"2020-08-12T20:06:52Z","title":"Model-Based Offline Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.05556","snapshot_observed_at":"2026-08-07T14:20:36.027635Z","title":"Model-based offline planning","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.027635Z"},"links":{"cited_paper":"/paper/2008.05556","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:b26c8991de875aa12b6f3d9ca5489b671a7be38fbddc129c68e96a34b66eeb4b","observation_id":"b4df2d69-3fe9-4ec9-81b5-adf5c3b19d50","resolution":{"observed_at":"2026-08-07T14:20:36.027635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:36.087639Z","title":"The peano-baker series","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.087639Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:55f03cdb1b9d49b2e064cbeb499431c212369319f6ccd90bf4a73df18e27d0ec","observation_id":"0efb84d6-7b3e-45e6-ad7b-bd796887085b","resolution":{"observed_at":"2026-08-07T14:20:36.087639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.11566","last_updated":"2022-02-23T15:27:16Z","snapshot_observed_at":"2026-08-07T08:10:41.731546Z","submitted_at":"2022-02-23T15:27:16Z","title":"Pessimistic Bootstrapping for Uncertainty-Driven Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.11566","snapshot_observed_at":"2026-08-07T14:20:36.145203Z","title":"Pessimistic bootstrapping for uncertainty-driven offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.145203Z"},"links":{"cited_paper":"/paper/2202.11566","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:c4510582d2422bd00db055ea17db438f33bec367bea53d12022a78977056e387","observation_id":"f669e893-c37a-4c18-aedb-6dc3c9e72cc4","resolution":{"observed_at":"2026-08-07T14:20:36.145203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-01T15:43:51.739518Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-07T14:20:36.208602Z","title":"Training diffusion models with reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.208602Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:fc1fef05ffac991a1cab053511484c4e16d9ce709a2614c8d89fb6e24e7ca289","observation_id":"84d6bdb3-f2f8-4b43-b4c0-e1357b662ae1","resolution":{"observed_at":"2026-08-07T14:20:36.208602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T14:20:36.260626Z","title":"π0: A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.260626Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:3be8ad23a383b0e40dd65a5fa539a2db91032bb243ec7589f4c538e8c2e421e0","observation_id":"348dc640-46d7-4a64-9952-8c7840faa9e3","resolution":{"observed_at":"2026-08-07T14:20:36.260626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14328","last_updated":"2025-02-24T06:26:55Z","snapshot_observed_at":"2026-07-31T17:10:21.044049Z","submitted_at":"2023-08-28T06:15:14Z","title":"Reinforcement Learning for Generative AI: A Survey","version":3},"cited_work":{"arxiv_id":"2308.14328","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.14328","snapshot_observed_at":"2026-08-07T14:20:43.822408Z","title":"Reinforcement Learning for Generative AI: A Survey","venue":"cs.LG","work_id":"adf442df-ff98-454f-9427-4665bc5db4e1","year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.325840Z"},"links":{"cited_paper":"/paper/2308.14328","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:91c4f2a96a850a5821a2dc18182a2ef438e788336689d3c38aa99add9b55a8ef","observation_id":"7bcaa2fe-154a-4da1-8370-bcc01f7a57c5","resolution":{"observed_at":"2026-08-07T14:20:43.903572Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02644","last_updated":"2024-01-05T05:28:40Z","snapshot_observed_at":"2026-08-04T15:37:47.750655Z","submitted_at":"2024-01-05T05:28:40Z","title":"Simple Hierarchical Planning with Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02644","snapshot_observed_at":"2026-08-07T14:20:36.384955Z","title":"Simple hierarchi- cal planning with diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.384955Z"},"links":{"cited_paper":"/paper/2401.02644","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:fba5b0f6c69bd1f9f693f5a010b55f456930b8a67aa717a2658cf846af0c8f67","observation_id":"820a9767-3a44-4d6b-9503-ab3a35904761","resolution":{"observed_at":"2026-08-07T14:20:36.384955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14548","last_updated":"2023-02-28T04:19:48Z","snapshot_observed_at":"2026-07-06T13:57:36.100400Z","submitted_at":"2022-09-29T04:36:23Z","title":"Offline Reinforcement Learning via High-Fidelity Generative Behavior Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14548","snapshot_observed_at":"2026-08-07T14:20:36.514447Z","title":"Offline reinforcement learning via high-fidelity generative behavior modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.514447Z"},"links":{"cited_paper":"/paper/2209.14548","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:7ecd77a54b8277c904e25634e58f4313ac68b248b3901d373e60457a71486b44","observation_id":"ad21c487-7e76-4c69-aab3-0e6db50e2a36","resolution":{"observed_at":"2026-08-07T14:20:36.514447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13777","last_updated":"2024-05-26T00:23:47Z","snapshot_observed_at":"2026-07-06T17:33:25.448648Z","submitted_at":"2024-02-21T12:54:48Z","title":"Deep Generative Models for Offline Policy Learning: Tutorial, Survey, and Perspectives on Future Directions","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13777","snapshot_observed_at":"2026-08-07T14:20:36.669857Z","title":"Deep generative models for offline policy learning: Tutorial, survey, and perspectives on future directions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.669857Z"},"links":{"cited_paper":"/paper/2402.13777","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:828c6cf98c8ba5b9664f645120f348b83b6497e1cdef4bd5efbaa1b037443289","observation_id":"7bbc88ad-efbd-4cf0-9dda-be2de6e039af","resolution":{"observed_at":"2026-08-07T14:20:36.669857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:36.788091Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.788091Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:67782012400a80242d3d0d5ff7f845cc6e0dca11dcd08deb3a1419deaa175149","observation_id":"3c723759-4267-4c73-ac31-05085568bd52","resolution":{"observed_at":"2026-08-07T14:20:36.788091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-03T00:02:57.373313Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-07T14:20:36.878337Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.878337Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:5a6fb308d3ef56f1fdcf4c739ff0aeff554093d9885e26ac349ff8b6748b6058","observation_id":"2278a0db-9356-4ad5-bd8a-7920cd691edf","resolution":{"observed_at":"2026-08-07T14:20:36.878337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08698","last_updated":"2023-07-17T17:57:56Z","snapshot_observed_at":"2026-08-04T12:09:15.933692Z","submitted_at":"2023-07-17T17:57:56Z","title":"Flow Matching in Latent Space","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08698","snapshot_observed_at":"2026-08-07T14:20:36.912260Z","title":"Flow matching in latent space","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.912260Z"},"links":{"cited_paper":"/paper/2307.08698","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:87a6cb0f50c5542d3cb52b21af2032171eaeddaefdd562ff6edac88f78a124b9","observation_id":"db435bce-f951-41d5-9933-609c4375bfae","resolution":{"observed_at":"2026-08-07T14:20:36.912260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:36.964361Z","title":"Fisher flow matching for generative modeling over discrete data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.964361Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:d7dfa508616559ee049206088d4e7e13ac8b50447dd47a9cfd69a49bc776f02e","observation_id":"db110ff5-eb32-42fb-b950-82196006e03a","resolution":{"observed_at":"2026-08-07T14:20:36.964361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16173","last_updated":"2024-12-16T15:42:46Z","snapshot_observed_at":"2026-08-08T00:54:50.275251Z","submitted_at":"2024-05-25T10:45:46Z","title":"Diffusion-based Reinforcement Learning via Q-weighted Variational Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16173","snapshot_observed_at":"2026-08-07T14:20:37.020291Z","title":"Diffusion-based reinforcement learning via q-weighted variational policy optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.020291Z"},"links":{"cited_paper":"/paper/2405.16173","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:0832e8b36248cba5669b4763252c9339da1c815ee6ddca30c9a370c5b47d6cb3","observation_id":"de1150a3-cfae-485b-a4eb-b33f5c0b678b","resolution":{"observed_at":"2026-08-07T14:20:37.020291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15443","last_updated":"2024-10-25T03:36:07Z","snapshot_observed_at":"2026-07-06T17:21:18.265715Z","submitted_at":"2024-01-27T15:30:49Z","title":"DiffuserLite: Towards Real-time Diffusion Planning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15443","snapshot_observed_at":"2026-08-07T14:20:37.065822Z","title":"Diffuserlite: Towards real-time diffusion planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.065822Z"},"links":{"cited_paper":"/paper/2401.15443","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:957db9ea2f651da107fe5c9215bcbc8c7a75963d1d1ca989d820f2f337001e74","observation_id":"738948f2-c8df-4a37-bca2-b4a02c58691d","resolution":{"observed_at":"2026-08-07T14:20:37.065822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:37.130184Z","title":"Probabilistic number theory I: Mean-value theorems, volume 239","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.130184Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:ab9b8339c4ae3f21d83df7ec4bc5ee2bc9ddeaf18301a65414f52f484bf2ee11","observation_id":"96595d25-2083-4c04-a978-81d105de798d","resolution":{"observed_at":"2026-08-07T14:20:37.130184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:37.190416Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.190416Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:818323c30507397942ae4be0d3bd4152ba53b3fff491d1481e3a4d917a0c0d99","observation_id":"25e213c1-9081-4b08-b16a-346397d1a105","resolution":{"observed_at":"2026-08-07T14:20:37.190416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:37.230498Z","title":"A reinforcement learning diffusion decision model for value-based decisions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.230498Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:a4d718159689271322e19ee47634df89f3df5fd9909435b5b8d94b0b47bf3caa","observation_id":"e0ada8b7-b884-46c2-a7b3-cd3f3d362923","resolution":{"observed_at":"2026-08-07T14:20:37.230498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:37.281105Z","title":"Reinforcement learning for generative ai: State of the art, opportunities and open research challenges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.281105Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:fd03820ce88c806a0e6c8f7155fa4e80d18570d5bb1f6410cc7283eb30a38346","observation_id":"4e7cf567-5aba-4e08-8562-5dae2e2047e3","resolution":{"observed_at":"2026-08-07T14:20:37.281105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-07T14:20:37.372971Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.372971Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:079c2ae0d27273c61d533a715e9f1200456c1aaf6f8b7d4ae2a7449d9920d735","observation_id":"9af8a4e9-a85c-4332-b706-7a7bec547408","resolution":{"observed_at":"2026-08-07T14:20:37.372971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:37.438497Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.438497Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:3036670383ef6de3f9d6c486ff01da2421d29923f18a0e840e3a70753ee14f3a","observation_id":"9a03472b-99bd-44ef-9143-fee30503e1db","resolution":{"observed_at":"2026-08-07T14:20:37.438497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:37.510693Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.510693Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:6c738a32da4c1a1730349d6d65ac35b2b9a63d9be6ffc740d90a8b8a7df2f12a","observation_id":"e125cbdf-408d-4e94-88ba-db8bc3189dc0","resolution":{"observed_at":"2026-08-07T14:20:37.510693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.10364","last_updated":"2022-02-04T14:03:07Z","snapshot_observed_at":"2026-07-06T12:10:16.997623Z","submitted_at":"2021-11-19T18:56:13Z","title":"Generalized Decision Transformer for Offline Hindsight Information Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.10364","snapshot_observed_at":"2026-08-07T14:20:37.550897Z","title":"Generalized decision transformer for offline hindsight information matching","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.550897Z"},"links":{"cited_paper":"/paper/2111.10364","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:c1fd2b963a6d335e6d478d5eea9c8efa5379721885489a1518039860c10452f5","observation_id":"d953dd6a-2031-45a3-9913-27c10a576f89","resolution":{"observed_at":"2026-08-07T14:20:37.550897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-07-06T20:32:43.707713Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04778","snapshot_observed_at":"2026-08-07T14:20:37.619351Z","title":"Behavior-regularized diffusion policy optimization for offline reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.619351Z"},"links":{"cited_paper":"/paper/2502.04778","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:aa640b712477c670d27856d161f16e516c6a55dd8c42225ba3ff458777f54e78","observation_id":"2dff5418-ebe0-492d-be11-b3819b4cd23c","resolution":{"observed_at":"2026-08-07T14:20:37.619351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:37.684967Z","title":"Discrete flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.684967Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:dfbac07e6c6029d73e9756b07ffa4059c06f7ab8ecc64a9c4e73536bcb36528e","observation_id":"2206e9e9-7177-4d91-8879-450d1184d261","resolution":{"observed_at":"2026-08-07T14:20:37.684967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:37.741192Z","title":"Offline rl policies should be trained to be adaptive","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.741192Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:6a8f319bda03eada6d25cf2f30c35ab214ea709a617e9b2d755faa3865ab72cb","observation_id":"d631f224-5059-4175-9157-3e54022fb3d9","resolution":{"observed_at":"2026-08-07T14:20:37.741192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:37.793878Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.793878Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:a294f7bfea49b05a0b5ebb0fdfc0ffa82b3d7830a789f397ae17eabf8af1d461","observation_id":"a5047400-14cb-44ea-968e-41a56053beaf","resolution":{"observed_at":"2026-08-07T14:20:37.793878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-07T14:20:37.857764Z","title":"Idql: Implicit q-learning as an actor-critic method with diffusion policies.arXiv preprint arXiv:2304.10573, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.857764Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:3f6ba3c6540b3457930db777444fa1ba159052ca538eb72e7f9bc363fb0ffd89","observation_id":"51eff6bf-9a58-4084-b442-0edb90f51bf6","resolution":{"observed_at":"2026-08-07T14:20:37.857764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:37.931785Z","title":"Diffusion model is an effective planner and data synthesizer for multi-task reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.931785Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:16536f0e7c845c52847cbd3fdb21c31a351e35e3d4c2a4e30232171432ceb005","observation_id":"56f6ab40-9ae6-4d94-a4f1-86474d6ada37","resolution":{"observed_at":"2026-08-07T14:20:37.931785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:37.998904Z","title":"Lectures on Lipschitz analysis","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.998904Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:5b88277f4176ecb5e40d1048b0895ac01433612eea5374b2470ab113d01041bc","observation_id":"45995f37-337d-4382-bcb8-5e9c76826337","resolution":{"observed_at":"2026-08-07T14:20:37.998904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:46.209858Z","title":"Flow++: Improving flow-based generative models with variational dequantization and architecture design","venue":null,"work_id":"16aae5dc-b9db-4c69-a47f-387a5db21f73","year":2019},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.069389Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:0eebb0da32b9de3f56730447e3f8611b158f45c3fd6e7bdab7be00a651381677","observation_id":"a942017a-8f99-480c-bb0a-77b6a401fe28","resolution":{"observed_at":"2026-08-07T14:20:46.278627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04875","last_updated":"2023-06-08T02:12:26Z","snapshot_observed_at":"2026-07-06T15:40:04.846330Z","submitted_at":"2023-06-08T02:12:26Z","title":"Instructed Diffuser with Temporal Condition Guidance for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04875","snapshot_observed_at":"2026-08-07T14:20:38.121882Z","title":"Instructed diffuser with temporal condition guidance for offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.121882Z"},"links":{"cited_paper":"/paper/2306.04875","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:bf5825d793b8014a24359d432c81b62d9363b8996ef8e85f8e342a6d1c04a348","observation_id":"20f550fd-9574-465a-818a-2a7c68710f0b","resolution":{"observed_at":"2026-08-07T14:20:38.121882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.14164","last_updated":"2023-01-20T04:18:43Z","snapshot_observed_at":"2026-08-08T01:06:44.714459Z","submitted_at":"2022-12-29T03:15:59Z","title":"On Transforming Reinforcement Learning by Transformer: The Development Trajectory","version":2},"cited_work":{"arxiv_id":"2212.14164","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.14164","snapshot_observed_at":"2026-08-07T14:20:43.377959Z","title":"On Transforming Reinforcement Learning by Transformer: The Development Trajectory","venue":"cs.LG","work_id":"7656931b-35ed-44bb-8c33-4ffb1094261e","year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.165967Z"},"links":{"cited_paper":"/paper/2212.14164","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:d73d25a3dbb0983918963363874d7fd12d9c87b7066580e9271befd1af328251","observation_id":"a05039dd-c937-4793-acdb-53693627ce24","resolution":{"observed_at":"2026-08-07T14:20:43.445599Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03747","last_updated":"2023-03-07T09:10:34Z","snapshot_observed_at":"2026-08-07T19:04:33.534284Z","submitted_at":"2023-03-07T09:10:34Z","title":"Graph Decision Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03747","snapshot_observed_at":"2026-08-07T14:20:38.225712Z","title":"Graph decision transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.225712Z"},"links":{"cited_paper":"/paper/2303.03747","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:ba1ca3ba305f1621aad8227dec106700e1e8973b4c406f15291f6e4e303262a0","observation_id":"b280403c-910d-4944-adf1-5da6f0f07d93","resolution":{"observed_at":"2026-08-07T14:20:38.225712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:46.067112Z","title":"Adaflow: Imitation learning with variance- adaptive flow-based policies","venue":null,"work_id":"014dfc8f-0c4e-4ce9-9a32-d347d6c61a38","year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.289200Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:cc247ef71f970fc60fed84fb4531f02308d9150708e04eefe6f88438bff7f31f","observation_id":"f3e6866e-bb55-41c4-947e-cd9b8066ff5e","resolution":{"observed_at":"2026-08-07T14:20:46.112420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:45.947992Z","title":"Diffusion models as optimizers for efficient planning in offline rl","venue":null,"work_id":"90ce583e-9738-4fb7-8443-f5be62dcf240","year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.338249Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:6023f195bee30794742ac5742567517d63ccc83f183cf7769b0b7a594852c09e","observation_id":"ede41e49-49ce-4c59-8bfd-0440c2f19fb2","resolution":{"observed_at":"2026-08-07T14:20:46.003051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:45.804921Z","title":"Offline reinforcement learning as one big sequence modeling problem","venue":null,"work_id":"aa27056f-1dd0-43e7-8939-7dd7aa41cacc","year":2021},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.382943Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:9ff307fc33b5ef84287e93cfe757c2071d6ae6dd4301952e07f4098a49f64792","observation_id":"f402d366-30cd-4120-8488-c0978b239947","resolution":{"observed_at":"2026-08-07T14:20:45.883231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09991","last_updated":"2022-12-21T01:06:18Z","snapshot_observed_at":"2026-08-06T05:32:02.292779Z","submitted_at":"2022-05-20T07:02:03Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09991","snapshot_observed_at":"2026-08-07T14:20:38.445055Z","title":"Planning with diffusion for flexible behavior synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.445055Z"},"links":{"cited_paper":"/paper/2205.09991","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:0cadf411f565b33c5e7b1c6cde48618957d5a8aa552af93f915d7835923088c8","observation_id":"cecf9b24-9199-4a7a-a826-8c0511ff1539","resolution":{"observed_at":"2026-08-07T14:20:38.445055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10291","last_updated":"2023-01-24T11:09:30Z","snapshot_observed_at":"2026-08-02T01:40:44.413596Z","submitted_at":"2022-08-22T13:19:02Z","title":"Efficient Planning in a Compact Latent Action Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10291","snapshot_observed_at":"2026-08-07T14:20:38.497294Z","title":"Efficient planning in a compact latent action space","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.497294Z"},"links":{"cited_paper":"/paper/2208.10291","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:33c9b397fbf8517851a3f706bc6f1963bcfa9677422cba691222a4040b18272d","observation_id":"4861505a-1e2d-487c-a132-c445086446ce","resolution":{"observed_at":"2026-08-07T14:20:38.497294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:38.547205Z","title":"Pyramidal flow matching for efficient video generative modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.547205Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:67ad4df21165f01ff3b2a160364901afe6b7d62f882eec1d31a0febf8e777ef4","observation_id":"2d8098ab-c4e2-459f-9614-4cfac6062659","resolution":{"observed_at":"2026-08-07T14:20:38.547205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:45.677681Z","title":"Efficient diffusion policies for offline reinforcement learning","venue":null,"work_id":"a8fda12d-5475-4414-a6e6-151df49b3554","year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.624432Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:b79f2ac6284761a5393d56207f7bb1cb8cda413934b532c20352379d2be4b2d5","observation_id":"eb7e562b-9b99-433e-b89a-5d65b1f14354","resolution":{"observed_at":"2026-08-07T14:20:45.709405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:38.689398Z","title":"Morel: Model-based offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.689398Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:591eb07ee9fe4fcd36c634eab6ea9c515681c5b3d89200462bfb899959972730","observation_id":"147e7268-7bad-41a7-84cd-ca58fb1e5aa2","resolution":{"observed_at":"2026-08-07T14:20:38.689398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-07T14:20:38.742099Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.742099Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:126bdbf8643eda6f4449962e109e0719f21154ac2627f7b10a8175f1caa8fd49","observation_id":"aade2317-0a92-436b-a2d0-33ca8966987f","resolution":{"observed_at":"2026-08-07T14:20:38.742099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:38.799102Z","title":"Stabilizing off- policy q-learning via bootstrapping error reduction","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.799102Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:0fe532c85b0767677b637271d62055ddc69725a54b50782508c5ae4b8fa2afde","observation_id":"bb3f2554-6bce-47e0-a4e2-e4fbd730a15e","resolution":{"observed_at":"2026-08-07T14:20:38.799102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:38.842872Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.842872Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:a218e1f0cb7cc405271952a9ec99f3bb7743667c544a83c1e29bfc4cbf92cf84","observation_id":"913dcc55-4788-431b-bf37-de8794841bb8","resolution":{"observed_at":"2026-08-07T14:20:38.842872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T14:20:38.891334Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.891334Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:81efd98c1f08f9ca5adcee83a74c55cfb4c322d6a4440a72c60b3c13f434f0e1","observation_id":"d507ba1f-1aec-4ef2-b44b-8ca0ebbcad97","resolution":{"observed_at":"2026-08-07T14:20:38.891334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02439","last_updated":"2024-02-22T00:05:12Z","snapshot_observed_at":"2026-07-06T17:25:01.583656Z","submitted_at":"2024-02-04T10:30:23Z","title":"DiffStitch: Boosting Offline Reinforcement Learning with Diffusion-based Trajectory Stitching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02439","snapshot_observed_at":"2026-08-07T14:20:38.939358Z","title":"Diffstitch: Boosting offline reinforcement learning with diffusion-based trajectory stitching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.939358Z"},"links":{"cited_paper":"/paper/2402.02439","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:9bd162d787728f39785a37d079417a1882ef4a766b35a1694d5c147ee50c4b07","observation_id":"4c22e361-d8f6-477d-9dbc-b58ce2e550ac","resolution":{"observed_at":"2026-08-07T14:20:38.939358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:45.492597Z","title":"Learning multimodal behaviors from scratch with diffusion policy gradient","venue":null,"work_id":"1300b4c0-f17e-4801-b8a5-84d9418e5288","year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.995078Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:23cb6f5addcc8c9bc848bc4bd3e44cf64cdfc15a4682ab6ed9e9230db3630e30","observation_id":"1a19bf54-4dc7-4172-b70c-84e0a8517511","resolution":{"observed_at":"2026-08-07T14:20:45.570026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00311","last_updated":"2023-09-30T08:50:49Z","snapshot_observed_at":"2026-08-04T15:28:49.017902Z","submitted_at":"2023-09-30T08:50:49Z","title":"Efficient Planning with Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00311","snapshot_observed_at":"2026-08-07T14:20:39.045014Z","title":"Efficient planning with latent diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.045014Z"},"links":{"cited_paper":"/paper/2310.00311","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:9c61cbf25e4d11b2f182e139db2cec8eba4cbe9705df1f74f6fd046279ea8f8c","observation_id":"65e40278-984b-4041-8211-9b2dc7e9e0a3","resolution":{"observed_at":"2026-08-07T14:20:39.045014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:45.337045Z","title":"Hierarchical diffusion for offline decision making","venue":null,"work_id":"9a1fca48-665b-4600-b6d5-9252e4e7394b","year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.111910Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:f89385edcdde91c454c739a135de1e0664a208714658ca2c5ce86923ac92ceac","observation_id":"38d867f4-4693-4e1b-81ca-6b0a6d249a75","resolution":{"observed_at":"2026-08-07T14:20:45.411100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:39.162569Z","title":"Generative models in decision making: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.162569Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:5362985a9d8e07990575a9330300de571e182aa986941b64099756e6d7ccb174","observation_id":"cfe9aa23-86c1-407b-90fc-015a29e29dcd","resolution":{"observed_at":"2026-08-07T14:20:39.162569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:45.199186Z","title":"Flowvid: Taming imperfect optical flows for consistent video-to-video synthesis","venue":null,"work_id":"b2c0df8e-7af0-48a2-8d83-aec388eb7422","year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.252580Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:a99c40564fbc0b59e6e3f9219b3afa5f3b1226c70f15904604e781738922f808","observation_id":"32e09caf-2a45-4896-9ecb-97a749b894da","resolution":{"observed_at":"2026-08-07T14:20:45.229974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01877","last_updated":"2023-05-12T16:23:37Z","snapshot_observed_at":"2026-08-04T09:42:45.607652Z","submitted_at":"2023-02-03T17:28:59Z","title":"AdaptDiffuser: Diffusion Models as Adaptive Self-evolving Planners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01877","snapshot_observed_at":"2026-08-07T14:20:39.290915Z","title":"Adaptdif- fuser: Diffusion models as adaptive self-evolving planners","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.290915Z"},"links":{"cited_paper":"/paper/2302.01877","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:3e001093cf622d7e911985e8cb054f2f462a9782cfc5d34b6154fdd61fb8461a","observation_id":"f3f5e4cf-2988-4a3b-8c56-6046e29e676e","resolution":{"observed_at":"2026-08-07T14:20:39.290915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.20299","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:43.011283Z","title":"Dataset distillation for offline reinforcement learning","venue":null,"work_id":"c9b054bc-d8b8-47d9-ba94-d201510f2f8c","year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.370378Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:535a2df98e12410fa954ec00cf4132c27d1b6acba7457e4024737159e04d0727","observation_id":"59e99e51-59f7-4256-8a97-fd6895b8c622","resolution":{"observed_at":"2026-08-07T14:20:43.045019Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T14:20:39.454108Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.454108Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:8c1d12dbea985b186f34e65aa0776f0025745c29c02779ea7ac013ade38ac28e","observation_id":"ab098d77-bed5-4008-b1fa-e314f1024513","resolution":{"observed_at":"2026-08-07T14:20:39.454108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06264","last_updated":"2024-12-09T07:22:38Z","snapshot_observed_at":"2026-08-02T09:54:14.339169Z","submitted_at":"2024-12-09T07:22:38Z","title":"Flow Matching Guide and Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06264","snapshot_observed_at":"2026-08-07T14:20:39.518713Z","title":"Flow matching guide and code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.518713Z"},"links":{"cited_paper":"/paper/2412.06264","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:f07abaccb3e67897aae20c41930959540779b101a6965eeda71787f1d5b53f44","observation_id":"b8d5be13-e190-4420-89b9-8fb618ada7a5","resolution":{"observed_at":"2026-08-07T14:20:39.518713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16338","last_updated":"2024-03-25T18:18:40Z","snapshot_observed_at":"2026-07-06T16:38:09.978805Z","submitted_at":"2023-10-25T03:40:50Z","title":"Generative Pre-training for Speech with Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16338","snapshot_observed_at":"2026-08-07T14:20:39.553836Z","title":"Generative pre-training for speech with flow matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.553836Z"},"links":{"cited_paper":"/paper/2310.16338","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:3a2551a5d1e8dd81ebe7a137ece53a4d74bdb61eae90ea22f9305139a83bcb19","observation_id":"9233db61-bb90-43e3-804e-88b4e89d4d0b","resolution":{"observed_at":"2026-08-07T14:20:39.553836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02165","last_updated":"2024-08-04T23:23:48Z","snapshot_observed_at":"2026-07-06T18:56:45.173494Z","submitted_at":"2024-08-04T23:23:48Z","title":"SelfBC: Self Behavior Cloning for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2408.02165","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02165","snapshot_observed_at":"2026-08-07T14:20:42.814210Z","title":"SelfBC: Self Behavior Cloning for Offline Reinforcement Learning","venue":"cs.LG","work_id":"7f2d1565-2bcc-464d-b3a4-f39711d7042a","year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.589213Z"},"links":{"cited_paper":"/paper/2408.02165","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:0957a3db9df2428146b1238f317ee2733c6014b351d16fbd811fb2db4ab69e9e","observation_id":"4f762be6-8ef3-4a64-8971-1ee7b7732092","resolution":{"observed_at":"2026-08-07T14:20:42.862741Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00847","last_updated":"2025-02-12T03:34:29Z","snapshot_observed_at":"2026-07-06T19:25:23.988463Z","submitted_at":"2024-10-01T16:29:59Z","title":"Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00847","snapshot_observed_at":"2026-08-07T14:20:39.668066Z","title":"Uncertainty- aware reward model: Teaching reward models to know what is unknown","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.668066Z"},"links":{"cited_paper":"/paper/2410.00847","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:0e867087bcd503281c73793904b1af66b44befbab0536bf030e9efd8432d3268","observation_id":"bfb96da5-a6e1-454f-9a76-5ed920a99fc4","resolution":{"observed_at":"2026-08-07T14:20:39.668066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:39.718510Z","title":"Contrastive energy prediction for exact energy-guided diffusion sampling in offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.718510Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:625537ae5edfd48c027a9f3dca9f42702a2f0cee8a05d8f8cbbcb0163bb01ec9","observation_id":"5d8b44d6-4635-4d16-b8a7-05a935b8b799","resolution":{"observed_at":"2026-08-07T14:20:39.718510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20109","last_updated":"2024-10-31T06:16:24Z","snapshot_observed_at":"2026-08-05T04:56:42.146574Z","submitted_at":"2024-07-29T15:36:42Z","title":"Diffusion-DICE: In-Sample Diffusion Guidance for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20109","snapshot_observed_at":"2026-08-07T14:20:39.813467Z","title":"Diffusion-dice: In- sample diffusion guidance for offline reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.813467Z"},"links":{"cited_paper":"/paper/2407.20109","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:3184c957015336804bc98150868839ed15b63209cc310d2d54118fc675bb4a60","observation_id":"8ad00c81-8a7f-4c6f-aa43-aa704d9760cd","resolution":{"observed_at":"2026-08-07T14:20:39.813467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-07T14:20:39.855798Z","title":"Awac: Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.855798Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:0e0ab1d51c3e6d527dfbbd1b561977013e76f20cc02ca542d9259ac0427dabec","observation_id":"38f3ad79-c04a-4fb3-9f11-329072bf7a95","resolution":{"observed_at":"2026-08-07T14:20:39.855798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:39.960749Z","title":"Normalizing flows for probabilistic modeling and inference","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.960749Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:5a28859f2d5d7525d0c96c360eecf5d710bd2a36284faf92c11940e61fb41b5d","observation_id":"85234d8d-2dcc-48bf-9bb7-ecccdb2ee88d","resolution":{"observed_at":"2026-08-07T14:20:39.960749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02538","last_updated":"2025-05-25T22:15:41Z","snapshot_observed_at":"2026-08-07T08:16:36.494826Z","submitted_at":"2025-02-04T18:04:05Z","title":"Flow Q-Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02538","snapshot_observed_at":"2026-08-07T14:20:40.029877Z","title":"Flow q-learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.029877Z"},"links":{"cited_paper":"/paper/2502.02538","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:bbff6eb4fd9d5456eccdcaf6b8e58f1f246729bf5d189cef5851931e26b3e25d","observation_id":"c9adb103-e45c-4af9-8025-061ce3b280dd","resolution":{"observed_at":"2026-08-07T14:20:40.029877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-07T14:20:40.119405Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.119405Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:f7a32c6c494c5d4a869b058e0e465681a8dcbb088df2d0de6ba20dbe45e2c445","observation_id":"7573d0f4-41ed-4f64-90d9-6fbf94a9db52","resolution":{"observed_at":"2026-08-07T14:20:40.119405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.10087","last_updated":"2018-06-26T13:31:37Z","snapshot_observed_at":"2026-07-06T06:01:51.192687Z","submitted_at":"2017-09-28T17:51:13Z","title":"Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.10087","snapshot_observed_at":"2026-08-07T14:20:40.163607Z","title":"Learning complex dexterous manipulation with deep reinforcement learning and demonstrations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.163607Z"},"links":{"cited_paper":"/paper/1709.10087","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:7edf4d812a36b319af5982150e72df3cc0d4c8f61cf3a36aa72885349e51069e","observation_id":"b6a752ef-5d03-40be-9253-bb2ee4a3ab12","resolution":{"observed_at":"2026-08-07T14:20:40.163607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15205","last_updated":"2024-12-19T18:59:31Z","snapshot_observed_at":"2026-08-05T21:19:08.972222Z","submitted_at":"2024-12-19T18:59:31Z","title":"FlowAR: Scale-wise Autoregressive Image Generation Meets Flow Matching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15205","snapshot_observed_at":"2026-08-07T14:20:40.249756Z","title":"Flowar: Scale-wise autoregressive image generation meets flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.249756Z"},"links":{"cited_paper":"/paper/2412.15205","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:09fccef82c8e3021e39d1f01622278bf4939723c8fd0ba5827073b03039b26d1","observation_id":"294b33b5-01f2-46d9-8400-56e849367032","resolution":{"observed_at":"2026-08-07T14:20:40.249756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:45.067545Z","title":"Offline reinforcement learning as anti-exploration","venue":null,"work_id":"67a32b81-9533-4a29-a290-8ef84bde1861","year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.346131Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:a812ee1afb18cba99ec3060215771bcd33858aca727c9873fa659f269908646d","observation_id":"e4601625-e387-4bc5-850e-c7d99470c718","resolution":{"observed_at":"2026-08-07T14:20:45.103384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.994496Z","title":"Flow matching imitation learning for multi-support manipulation","venue":null,"work_id":"2400975d-261b-4ec2-9e1a-4d1d307e8ac1","year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.424534Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:e509ee753029031524156df9d557da54fbb7a6e81a7e56c99be54c6dad2dab5d","observation_id":"1359d8ca-070a-490e-b627-436869ba5b16","resolution":{"observed_at":"2026-08-07T14:20:45.033689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06473","last_updated":"2020-02-15T23:46:29Z","snapshot_observed_at":"2026-08-07T00:34:54.498970Z","submitted_at":"2020-02-15T23:46:29Z","title":"Universal Value Density Estimation for Imitation Learning and Goal-Conditioned Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2002.06473","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.06473","snapshot_observed_at":"2026-08-07T14:20:42.594777Z","title":"Universal Value Density Estimation for Imitation Learning and Goal-Conditioned Reinforcement Learning","venue":"cs.LG","work_id":"6986ad8a-5b6c-48df-8bfc-bc0ffb74840b","year":2020},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.480698Z"},"links":{"cited_paper":"/paper/2002.06473","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:8b7b186818e89f04cd7dab99683c0ba06f5189b68ef1904a0b9a7cc8d0fd498f","observation_id":"3dd87819-0a97-400f-b2ca-18147394877c","resolution":{"observed_at":"2026-08-07T14:20:42.624081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.842817Z","title":"Video prediction by modeling videos as continu- ous multi-dimensional processes","venue":null,"work_id":"af1c3808-fed7-4b7f-9631-cfa9c327c1f8","year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.557491Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:a659af2cd550bd5621df9e8bdd7f48d9f8b3b6422c79ce9043bf8467d14133f8","observation_id":"95c2ff49-a3ee-44e9-b473-67f0eae07cd3","resolution":{"observed_at":"2026-08-07T14:20:44.881671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.735519Z","title":"Ensemble reinforcement learning: A survey","venue":null,"work_id":"82dcbab9-7a63-429d-bb03-d4cc79eb6994","year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.620346Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:559609a3efa02225cec810e53629695a816788ce25e7207e5e2bc65b8b0da532","observation_id":"a9556fd5-b4ff-43c3-ac7f-117dbc136841","resolution":{"observed_at":"2026-08-07T14:20:44.775098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.572687Z","title":"Flowllm: Flow matching for material generation with large language models as base distributions","venue":null,"work_id":"2723a894-a488-4b20-9ea2-5e8ca2f3ceea","year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.692841Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:d1c4e1647c70389af7791acd7db93e33aef42cea3ab0a09ebf73ef901f650e53","observation_id":"21c57fae-dcc9-4d7d-b384-60b51ad6ebd2","resolution":{"observed_at":"2026-08-07T14:20:44.668710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:40.739672Z","title":"Reinforcement learning: An introduction, volume 1","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.739672Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:40fc42b215601c420fd1bb82248a6160be19410774d9fab8b3867102eb5969d5","observation_id":"c137d2e6-7826-482f-a691-963b72e1096a","resolution":{"observed_at":"2026-08-07T14:20:40.739672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.465988Z","title":"Imitationflow: Learning deep stable stochastic dynamic systems by normalizing flows","venue":null,"work_id":"436cb629-93d8-41bf-a5ca-f99e04451ea5","year":2020},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.800133Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:3583fe3a95086e1673212715d4a287c881747c4fda6b2f5a64a31bd1dc86d994","observation_id":"f4f26b48-b58e-421b-a12c-173f4c8ed829","resolution":{"observed_at":"2026-08-07T14:20:44.526585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:40.893058Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.893058Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:76dfcc71c5f4e9c0231787c4fef0747ff15f44d19c7320f8dee72d99ce8f3b52","observation_id":"791942d1-952a-4327-8c45-833414bec49b","resolution":{"observed_at":"2026-08-07T14:20:40.893058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.326823Z","title":"Matrix calculus operations and taylor expansions","venue":null,"work_id":"0ad3909d-f6af-43d7-9cad-3ffaf36ff5dc","year":1973},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.012416Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:50bc088bc6c082c471694bacabdaecdb073aadd0d8aacae68d475f1076274208","observation_id":"4141acbe-6d66-4c89-9103-23b54f1a66c8","resolution":{"observed_at":"2026-08-07T14:20:44.377627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08569","last_updated":"2022-10-18T05:05:22Z","snapshot_observed_at":"2026-07-06T13:21:53.571940Z","submitted_at":"2022-06-17T05:57:47Z","title":"Bootstrapped Transformer for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2206.08569","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.08569","snapshot_observed_at":"2026-08-07T14:20:42.505319Z","title":"Bootstrapped Transformer for Offline Reinforcement Learning","venue":"cs.LG","work_id":"3af1ea6e-a9bc-4438-be9a-9b5823ef9d6a","year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.057275Z"},"links":{"cited_paper":"/paper/2206.08569","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:99dbc2a5f0e178680598efd929a1dcc6e0e8a6169778979aecaf78b1eb62e581","observation_id":"4abbb693-68da-4591-a9cf-10b94f6997cf","resolution":{"observed_at":"2026-08-07T14:20:42.534167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18082","last_updated":"2025-05-08T23:56:41Z","snapshot_observed_at":"2026-07-06T19:38:35.617923Z","submitted_at":"2024-10-23T17:59:52Z","title":"Prioritized Generative Replay","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18082","snapshot_observed_at":"2026-08-07T14:20:41.144029Z","title":"Prioritized generative replay","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.144029Z"},"links":{"cited_paper":"/paper/2410.18082","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:a2463e87c4cfa7cf312d3d2ebbe60a17ea4c6ccb7e93ad3bc4327b4fb790d69b","observation_id":"e161bd7c-6c5e-48ef-a647-89c905ddf6f5","resolution":{"observed_at":"2026-08-07T14:20:41.144029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-07T14:20:41.247019Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.247019Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:f88ad024dd543cbb9d2b984865f83df63366cee9d544e6587ec81a774fbb628d","observation_id":"d52a9e49-a01c-4f4b-9059-477a16ecc566","resolution":{"observed_at":"2026-08-07T14:20:41.247019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.261958Z","title":"Q-learning decision transformer: Leveraging dynamic programming for conditional sequence modelling in offline rl","venue":null,"work_id":"f8946b2b-3287-4633-97f6-3750b08b7e96","year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.312573Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:fec63781d00c5ee85cfab28e9401af177fcdb1b010f184b2e9a8cc076eebd4c7","observation_id":"b99e1af5-4281-4452-af04-637c5620b629","resolution":{"observed_at":"2026-08-07T14:20:44.291215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09673","last_updated":"2022-10-07T23:57:50Z","snapshot_observed_at":"2026-08-06T06:26:43.117768Z","submitted_at":"2022-02-19T20:22:04Z","title":"A Behavior Regularized Implicit Policy for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09673","snapshot_observed_at":"2026-08-07T14:20:41.361128Z","title":"A behavior regularized implicit policy for offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.361128Z"},"links":{"cited_paper":"/paper/2202.09673","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:ecb97fbdf43c5aafca04e2a5ac44ce48a157d28cd4fdf12635e92aa3263322f8","observation_id":"432d8a0e-306f-423c-b0bf-dd14ab8a6b5e","resolution":{"observed_at":"2026-08-07T14:20:41.361128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:41.429401Z","title":"Policy-to-language: Train llms to explain decisions with flow-matching generated rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.429401Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:8d023319fbb6cbdbcee5fa5718ccf77119f182111ee2350f3d384e71727bb01a","observation_id":"9bc740fc-e567-476a-b66e-cd6ed73ada50","resolution":{"observed_at":"2026-08-07T14:20:41.429401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.105195Z","title":"Flow to control: Offline reinforcement learning with lossless primitive discovery","venue":null,"work_id":"33eb07ad-11e7-4c61-a3a6-65a1e8eab7c0","year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.499645Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:ada5734e935e024836f03a9929b06c7a28a1c4e588611a028fe957563b828b16","observation_id":"fb0554b1-a476-4222-a6be-78aec2d74647","resolution":{"observed_at":"2026-08-07T14:20:44.222293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:41.575848Z","title":"Mopo: Model-based offline policy optimization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.575848Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:dd6a90ad8244e1cac0f780be9943b19da18fdef9cfbb99b68fefa79ab00881d7","observation_id":"f99fefd8-8556-41f7-a0d0-c7de39ef5974","resolution":{"observed_at":"2026-08-07T14:20:41.575848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:41.631335Z","title":"Combo: Conservative offline model-based policy optimization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.631335Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:30cf919acf4ab0979e70ab6d64edb3b1cc7f816da78229a95927c64e73e42577","observation_id":"1598d88e-dd30-43c9-beef-1edfb68bf0ce","resolution":{"observed_at":"2026-08-07T14:20:41.631335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:41.678599Z","title":"Affordance-based robot manipulation with flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.678599Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:a65477053ebf1ee88c3b00e9df9b1d2f95ffe2ce34e72e7418c1c2dc09320386","observation_id":"57bd9d08-6527-423c-9fec-719af8a1f20a","resolution":{"observed_at":"2026-08-07T14:20:41.678599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12203","last_updated":"2023-01-28T13:57:01Z","snapshot_observed_at":"2026-07-06T14:45:37.517853Z","submitted_at":"2023-01-28T13:57:01Z","title":"SaFormer: A Conditional Sequence Modeling Approach to Offline Safe Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12203","snapshot_observed_at":"2026-08-07T14:20:41.739960Z","title":"Saformer: A conditional sequence modeling approach to offline safe reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.739960Z"},"links":{"cited_paper":"/paper/2301.12203","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:c486ac8786a4cb6bb7f2ef408862032e8c2543f5b471922eb48513db3d323dfd","observation_id":"0840203d-2792-4814-b7b9-6059b49ff997","resolution":{"observed_at":"2026-08-07T14:20:41.739960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04975","last_updated":"2025-03-06T21:10:12Z","snapshot_observed_at":"2026-08-07T17:23:30.914733Z","submitted_at":"2025-03-06T21:10:12Z","title":"Energy-Weighted Flow Matching for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04975","snapshot_observed_at":"2026-08-07T14:20:41.812673Z","title":"Energy-weighted flow matching for offline reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.812673Z"},"links":{"cited_paper":"/paper/2503.04975","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:2c5e30fda9f2bb2060db3a0d33695ac518b729d16808352bde766149c5bf018e","observation_id":"863b8cb8-2f9d-4b82-9b87-409e89188567","resolution":{"observed_at":"2026-08-07T14:20:41.812673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18729","last_updated":"2024-05-29T03:19:59Z","snapshot_observed_at":"2026-07-06T18:21:44.232687Z","submitted_at":"2024-05-29T03:19:59Z","title":"Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2405.18729","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.18729","snapshot_observed_at":"2026-08-07T14:20:42.161826Z","title":"Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning","venue":"cs.LG","work_id":"e97abfb4-32ac-4b92-b836-dd1f6f6cbd8c","year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.895384Z"},"links":{"cited_paper":"/paper/2405.18729","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:6453ca9a0cac68cc51f7c8ee1c8bd57f3de4ef5955f00b40fe8ab5f7681b521b","observation_id":"1319d61f-646e-43b1-acc6-e301f0bad3a3","resolution":{"observed_at":"2026-08-07T14:20:42.215919Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13443","last_updated":"2023-12-07T20:49:03Z","snapshot_observed_at":"2026-07-06T16:51:10.736675Z","submitted_at":"2023-11-22T15:07:59Z","title":"Guided Flows for Generative Modeling and Decision Making","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13443","snapshot_observed_at":"2026-08-07T14:20:41.964655Z","title":"Guided flows for generative modeling and decision making","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.964655Z"},"links":{"cited_paper":"/paper/2311.13443","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:2627641d7173cfdb5a819bc5d420b903f96857c14e3417924d8ce759ba2828b1","observation_id":"edd50545-d00f-4770-bc6e-9e6cce26abe9","resolution":{"observed_at":"2026-08-07T14:20:41.964655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-07T14:20:42.023257Z","title":"uθ(xt, t) ∗ Z pt(x1|xt) ut(xt|x1) pt(xt|x1)p(x1) pt(xt) dx1 # pt(xt)dxtdt (30) = Z t,pt(xt)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:42.023257Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:1d6de9dcb21e868cc367d41415326dc78f66a0947f4a00ca0620d41ad4db90bd","observation_id":"f4db1893-30e5-461d-acef-c364e040e909","resolution":{"observed_at":"2026-08-07T14:20:42.023257Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization"},"reference_resolution":{"displayed":96,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":71,"verified_exact":7,"verified_fuzzy":17},"total_outbound_references":96},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 96 of 96 outbound references and 0 inbound Pith citation observations for arXiv:2505.20350."}