{"as_of":"2026-08-07T18:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1ab30dc987f1e1d24d299ce8b25e70b2613a95dff7339a8ffcaf8009557925dd","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:42:51.385352Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:32:46.531563Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T00:07:27.693869Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.14139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14139","snapshot_observed_at":"2026-07-03T00:07:27.693869Z","title":"2505.14139 , archivePrefix =","venue":null,"work_id":"6e7dd84f-8dc4-4886-ba62-906ef39f8d04","year":2025},"citing_paper":{"arxiv_id":"2605.12622","last_updated":"2026-05-14T17:59:01Z","snapshot_observed_at":"2026-08-02T07:45:26.844246Z","submitted_at":"2026-05-12T18:09:04Z","title":"Action Emergence from Streaming Intent","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-14T20:59:42.456958Z"},"links":{"cited_paper":"/paper/2505.14139","citing_paper":"/paper/2605.12622"},"observation_digest":"sha256:3bac1f97afda5ad4ed060ce2fe595b0c01910a1fa0a2834b246eb15bfcb42e74","observation_id":"e874a85f-4a32-4f77-a3f8-c478d703a54b","resolution":{"observed_at":"2026-05-14T21:02:59.187795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.14139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14139","snapshot_observed_at":"2026-07-03T00:07:27.693869Z","title":"2505.14139 , archivePrefix =","venue":null,"work_id":"6e7dd84f-8dc4-4886-ba62-906ef39f8d04","year":2025},"citing_paper":{"arxiv_id":"2605.12622","last_updated":"2026-05-14T17:59:01Z","snapshot_observed_at":"2026-08-02T07:45:26.844246Z","submitted_at":"2026-05-12T18:09:04Z","title":"Action Emergence from Streaming Intent","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-15T05:13:44.795483Z"},"links":{"cited_paper":"/paper/2505.14139","citing_paper":"/paper/2605.12622"},"observation_digest":"sha256:42479a78b8a319056871ab1e253122f86f12137e1b4e913adc9b16f90776dac6","observation_id":"fe907729-1795-43fd-91f1-a78dfba98a68","resolution":{"observed_at":"2026-05-15T05:15:02.985480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.14139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14139","snapshot_observed_at":"2026-07-03T00:07:27.693869Z","title":"2505.14139 , archivePrefix =","venue":null,"work_id":"6e7dd84f-8dc4-4886-ba62-906ef39f8d04","year":2025},"citing_paper":{"arxiv_id":"2605.12625","last_updated":"2026-05-14T17:58:42Z","snapshot_observed_at":"2026-07-06T23:24:18.302402Z","submitted_at":"2026-05-12T18:10:19Z","title":"Driving Intents Amplify Planning-Oriented Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T20:50:14.602822Z"},"links":{"cited_paper":"/paper/2505.14139","citing_paper":"/paper/2605.12625"},"observation_digest":"sha256:a2c8db1d2dab584f0b4dc548895de5bb74adcb20c2d29299c19d03160682fe7f","observation_id":"62d7a1be-0619-455e-9ff5-92a6f45ac329","resolution":{"observed_at":"2026-05-14T20:52:58.729137Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.14139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14139","snapshot_observed_at":"2026-07-03T00:07:27.693869Z","title":"2505.14139 , archivePrefix =","venue":null,"work_id":"6e7dd84f-8dc4-4886-ba62-906ef39f8d04","year":2025},"citing_paper":{"arxiv_id":"2605.12625","last_updated":"2026-05-14T17:58:42Z","snapshot_observed_at":"2026-07-06T23:24:18.302402Z","submitted_at":"2026-05-12T18:10:19Z","title":"Driving Intents Amplify Planning-Oriented Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T04:58:07.943615Z"},"links":{"cited_paper":"/paper/2505.14139","citing_paper":"/paper/2605.12625"},"observation_digest":"sha256:2d1e8970c080c74083956c8e04f835775f865c9a655488c4dcaace6c3004c3d3","observation_id":"98741778-00e8-48ec-8acf-970f908a4d18","resolution":{"observed_at":"2026-05-15T04:59:45.526358Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.14139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14139","snapshot_observed_at":"2026-07-03T00:07:27.693869Z","title":"2505.14139 , archivePrefix =","venue":null,"work_id":"6e7dd84f-8dc4-4886-ba62-906ef39f8d04","year":2025},"citing_paper":{"arxiv_id":"2606.08602","last_updated":"2026-06-07T12:28:51Z","snapshot_observed_at":"2026-07-06T23:48:07.065806Z","submitted_at":"2026-06-07T12:28:51Z","title":"Reinforcement Learning for Flow-Matching Policies with Density Transport","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T18:55:02.040180Z"},"links":{"cited_paper":"/paper/2505.14139","citing_paper":"/paper/2606.08602"},"observation_digest":"sha256:b254c140a24b58b05b6cc41c9e7a462a1dbff21a473a98f0402db99f238757f3","observation_id":"fd7edf9d-bae1-44d5-bba4-deb47f1c9f52","resolution":{"observed_at":"2026-07-02T22:27:25.812719Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.14139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14139","snapshot_observed_at":"2026-07-03T00:07:27.693869Z","title":"2505.14139 , archivePrefix =","venue":null,"work_id":"6e7dd84f-8dc4-4886-ba62-906ef39f8d04","year":2025},"citing_paper":{"arxiv_id":"2606.09115","last_updated":"2026-06-08T07:11:03Z","snapshot_observed_at":"2026-08-04T22:59:05.251199Z","submitted_at":"2026-06-08T07:11:03Z","title":"Counterfactual Transport Flows for Offline Conservative Trajectory Refinement","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-06-27T17:33:35.857240Z"},"links":{"cited_paper":"/paper/2505.14139","citing_paper":"/paper/2606.09115"},"observation_digest":"sha256:c649f90148868b02d9672a7099b1873ddfdacf4ce6d228114c62f6ec31740ca7","observation_id":"96d8a000-fbb2-4097-9f99-a61a5978c4eb","resolution":{"observed_at":"2026-07-03T00:07:27.695520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14139","snapshot_observed_at":"2026-08-02T02:10:24.308093Z","title":"Flowq: Energy-guided flow poli- cies for offline reinforcement learning.arXiv preprint arXiv:2505.14139, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14424","last_updated":"2026-07-15T23:27:04Z","snapshot_observed_at":"2026-08-07T08:20:39.779359Z","submitted_at":"2026-07-15T23:27:04Z","title":"ConFlow: Constraints-Guided Learning with Flow Matching for Motion Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:24.308093Z"},"links":{"cited_paper":"/paper/2505.14139","citing_paper":"/paper/2607.14424"},"observation_digest":"sha256:fa12252ad1d302a08b29c5255e695b3ad27bf49e8ca99865e1e09b0dfd649962","observation_id":"01131813-7290-4a4f-9c57-d9c6c107e908","resolution":{"observed_at":"2026-08-02T02:10:24.308093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14139","snapshot_observed_at":"2026-08-01T14:19:59.991253Z","title":"Alles, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:59.991253Z"},"links":{"cited_paper":"/paper/2505.14139","citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:309859f46a44c1b3ffa7c3654260307911cb723462cbdbbf090a74f36ac4f745","observation_id":"7a705d2d-e3e4-42e3-aacb-279a33792de1","resolution":{"observed_at":"2026-08-01T14:19:59.991253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14139","snapshot_observed_at":"2026-08-06T00:32:46.531563Z","title":"arXiv preprint arXiv:2505.14139 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01205","last_updated":"2026-08-02T12:42:20Z","snapshot_observed_at":"2026-08-06T23:26:07.173045Z","submitted_at":"2026-08-02T12:42:20Z","title":"ReBRAC-v2: The Return of the King","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-06T00:32:46.531563Z"},"links":{"cited_paper":"/paper/2505.14139","citing_paper":"/paper/2608.01205"},"observation_digest":"sha256:b3e11faa056fc8f8f4b347c6dcbabd5a7ecb71cb6a6f1085e42dc6801a8abbdb","observation_id":"60624e1d-49e3-480b-8fb9-cd732ec8b0e6","resolution":{"observed_at":"2026-08-06T00:32:46.531563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14139/citation-record","integrity":"/paper/2505.14139/integrity","json":"/paper/2505.14139/citation-record.json","paper":"/paper/2505.14139"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:53.119079Z","title":"Figure 5: Normalized return of FlowQ for the D4RL adroit environments using 5 seeds","venue":null,"work_id":"60632545-b8e7-4b92-9828-5aa76446dc8a","year":2025},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.385352Z"},"links":{"citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:792f2a8126ff5f7ae77fc3071c5bc252e58ba58dffe2d985f5310003c6de1fd9","observation_id":"f42ccfc9-013a-4bc6-bd91-727df8aa24da","resolution":{"observed_at":"2026-08-07T15:42:53.191140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-07T15:42:49.306851Z","title":"9 Linjiajie Fang, Ruoxue Liu, Jing Zhang, Wenjia Wang, and Bing-Yi Jing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:49.306851Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:42a2f6ca8876ba953065325349fa3d7defb31c12879bfab12c36e982593cc302","observation_id":"3eb51ae0-f6dd-43b4-8f03-d419b8f68cdf","resolution":{"observed_at":"2026-08-07T15:42:49.306851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20555","last_updated":"2025-02-25T06:33:21Z","snapshot_observed_at":"2026-07-06T18:23:05.893052Z","submitted_at":"2024-05-31T00:41:04Z","title":"Diffusion Actor-Critic: Formulating Constrained Policy Iteration as Diffusion Noise Regression for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20555","snapshot_observed_at":"2026-08-07T15:42:49.396954Z","title":"Justin Fu, Aviral Kumar, Ofir Nachum, George Tucker, and Sergey Levine","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:49.396954Z"},"links":{"cited_paper":"/paper/2405.20555","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:fe221609fea9fcf179fe9d3aba3834947ad5ecf61f2e9268a1a945ab5458fe96","observation_id":"ca30f5ef-759b-47ad-97b6-76f6c65d8374","resolution":{"observed_at":"2026-08-07T15:42:49.396954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:53.288049Z","title":null,"venue":null,"work_id":"c5ba9834-df44-4dc4-b891-1a0ffa84f39a","year":2016},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.250242Z"},"links":{"citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:fcab478bd6056ccdbb0b6e6bd925074039347abde0c46148c0c04f3a9182280a","observation_id":"d918cf25-0e55-4308-86f0-0e6d2bc130c4","resolution":{"observed_at":"2026-08-07T15:42:53.391076Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-07-06T09:30:47.469703Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-07T15:42:49.782023Z","title":"Matthew Thomas Jackson, Michael Tryfan Matthews, Cong Lu, Benjamin Ellis, Shimon Whiteson, and Jakob Foerster","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:49.782023Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:a2fc00e08ee33316acc822ce12a7065a98f434977dd93fdd7dc652db10ac2d48","observation_id":"2bbb50df-d400-456e-8af2-26c74709b86c","resolution":{"observed_at":"2026-08-07T15:42:49.782023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-07T15:42:50.185601Z","title":"Aviral Kumar, Aurick Zhou, George Tucker, and Sergey Levine","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:50.185601Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:d198f50cb3404b45a1551c8110b7cca01e24a082eaa88f748e368596edf25d87","observation_id":"3f9416a0-23a7-464b-9886-546706d16168","resolution":{"observed_at":"2026-08-07T15:42:50.185601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:53.520803Z","title":null,"venue":null,"work_id":"0812dca3-0db5-438f-8b61-d8d0c465e37a","year":2006},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:50.230127Z"},"links":{"citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:7f3418c4c939d3bbe45e2ccd6941fa65e85c56fa41d933f06922f64f0c4882c5","observation_id":"f4f97b07-d29c-440e-9072-8bd97f6c68f0","resolution":{"observed_at":"2026-08-07T15:42:53.607030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T15:42:50.314458Z","title":"Cheng Lu, Yuhao Zhou, Fan Bao, Jianfei Chen, Chongxuan Li, and Jun Zhu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:50.314458Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:a6718d30d63cebb731ec433e6c44341b08bdd73d227feca7832d04b9569a2896","observation_id":"5ab699ca-464f-46fe-a9f0-25cc41be7228","resolution":{"observed_at":"2026-08-07T15:42:50.314458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08681","last_updated":"2020-08-13T05:42:12Z","snapshot_observed_at":"2026-07-06T08:16:16.271286Z","submitted_at":"2019-08-23T06:22:06Z","title":"Mish: A Self Regularized Non-Monotonic Activation Function","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08681","snapshot_observed_at":"2026-08-07T15:42:50.478554Z","title":"Seohong Park, Qiyang Li, and Sergey Levine","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:50.478554Z"},"links":{"cited_paper":"/paper/1908.08681","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:7679d06dac8da7012fe0eb6809e0e71809af74a73b5c5f6acbd89951b3440ab2","observation_id":"ccf2fe4e-d7b2-4ccc-9501-c01f458b10c6","resolution":{"observed_at":"2026-08-07T15:42:50.478554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.11547","last_updated":"2020-12-21T18:28:17Z","snapshot_observed_at":"2026-07-06T10:26:38.510361Z","submitted_at":"2020-12-21T18:28:17Z","title":"Offline Reinforcement Learning from Images with Latent Space Models","version":1},"cited_work":{"arxiv_id":"2012.11547","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.11547","snapshot_observed_at":"2026-08-07T15:42:51.952948Z","title":"Offline Reinforcement Learning from Images with Latent Space Models","venue":"cs.LG","work_id":"dca100c5-6682-40fb-8ade-0cf8e5012b36","year":2020},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:50.697409Z"},"links":{"cited_paper":"/paper/2012.11547","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:bc3a6eff3ccb768b655ef43d1369e252c6159438418ba453233ea4873ef57189","observation_id":"f6a33093-fd25-4670-ac65-277f2c2119fc","resolution":{"observed_at":"2026-08-07T15:42:52.081987Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-07T15:42:50.747484Z","title":"Ziyu Wang, Alexander Novikov, Konrad Zolna, Jost Tobias Springenberg, Scott E","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:50.747484Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:0595b7a157569dd2e898933a3aa78d678fce011b54534f32c5be8e92aacfd12c","observation_id":"a72f762f-edd0-4573-b06c-85b28c7a4840","resolution":{"observed_at":"2026-08-07T15:42:50.747484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15134","last_updated":"2021-09-22T20:12:55Z","snapshot_observed_at":"2026-08-04T07:18:03.195324Z","submitted_at":"2020-06-26T17:50:26Z","title":"Critic Regularized Regression","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15134","snapshot_observed_at":"2026-08-07T15:42:50.880303Z","title":"Tianhe Yu, Garrett Thomas, Lantao Yu, Stefano Ermon, James Zou, Sergey Levine, Chelsea Finn, and Tengyu Ma","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:50.880303Z"},"links":{"cited_paper":"/paper/2006.15134","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:efce42194581111e5f8b663be7f784c2be2300f898c43c16cf250052671c8cf8","observation_id":"17afe07b-bccf-4af8-a79f-d6f9e52682bd","resolution":{"observed_at":"2026-08-07T15:42:50.880303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.13239","last_updated":"2020-11-22T07:04:17Z","snapshot_observed_at":"2026-08-06T03:32:02.156770Z","submitted_at":"2020-05-27T08:46:41Z","title":"MOPO: Model-based Offline Policy Optimization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.13239","snapshot_observed_at":"2026-08-07T15:42:50.991836Z","title":"Shiyuan Zhang, Weitong Zhang, and Quanquan Gu","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:50.991836Z"},"links":{"cited_paper":"/paper/2005.13239","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:b8da34efbab70e1be367956f91f4da171f8bea8937c959c68f9e4577c382c5df","observation_id":"502d693a-a891-43e7-bbff-f76c055b7b81","resolution":{"observed_at":"2026-08-07T15:42:50.991836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13443","last_updated":"2023-12-07T20:49:03Z","snapshot_observed_at":"2026-07-06T16:51:10.736675Z","submitted_at":"2023-11-22T15:07:59Z","title":"Guided Flows for Generative Modeling and Decision Making","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13443","snapshot_observed_at":"2026-08-07T15:42:51.079534Z","title":"Wenxuan Zhou, Sujay Bajracharya, and David Held","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.079534Z"},"links":{"cited_paper":"/paper/2311.13443","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:fc4c5075461211394dc914d8e404ad3ff2cecdf6fe8d15e3615b9531efd69c36","observation_id":"1d271efa-623e-408e-b0e4-e9b8cec62007","resolution":{"observed_at":"2026-08-07T15:42:51.079534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.07213","last_updated":"2020-11-14T03:38:38Z","snapshot_observed_at":"2026-07-06T10:14:29.406348Z","submitted_at":"2020-11-14T03:38:38Z","title":"PLAS: Latent Action Space for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2011.07213","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.07213","snapshot_observed_at":"2026-08-07T15:42:51.547492Z","title":"PLAS: Latent Action Space for Offline Reinforcement Learning","venue":"cs.RO","work_id":"73916af9-f08b-4a61-8911-c35a8efa080f","year":2020},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.181002Z"},"links":{"cited_paper":"/paper/2011.07213","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:78958c8586299155e490493b7661757cf5d5143f8a62c3f87d6c47bf5d7030de","observation_id":"af01259c-5016-4578-a3d6-c356b6d41965","resolution":{"observed_at":"2026-08-07T15:42:51.700274Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-07T15:42:49.723240Z","title":"Jonathan Ho, Ajay Jain, and Pieter Abbeel","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:49.723240Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:702d5f8cd180fdb8a880e3478099fcfc72f2ff7bedb5b65ed0aa5a4bda8daaa4","observation_id":"59abff0a-f10e-4b17-94a5-2c47107fb8ce","resolution":{"observed_at":"2026-08-07T15:42:49.723240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T15:42:50.038962Z","title":"Ilya Kostrikov, Ashvin Nair, and Sergey Levine","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:50.038962Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:46e21eaac29e2faa7f8bcc72b35ab1a8236bf7752cb42bd3e3c15f691c5b8f6c","observation_id":"5b69c49b-924d-46e2-ab2e-3f2b5d10b17d","resolution":{"observed_at":"2026-08-07T15:42:50.038962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-07-06T07:19:45.696706Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-08-07T15:42:49.667242Z","title":"Dan Hendrycks and Kevin Gimpel","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:49.667242Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:a659219ca8230678298c5b7e374f1b20867c307b19d8b8fb74a02aa15b84de85","observation_id":"832ce9c9-889f-4ad2-9cb1-0298b845ddf0","resolution":{"observed_at":"2026-08-07T15:42:49.667242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-07T15:42:49.466319Z","title":"Scott Fujimoto and Shixiang Shane Gu","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:49.466319Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:4f1433f3613057ac7e4b0b79bf570f94ed3b37cca750cb7e0c8b66b3b203438d","observation_id":"6ad074b3-a6f5-4c12-80f5-3bfab2aa636f","resolution":{"observed_at":"2026-08-07T15:42:49.466319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06860","last_updated":"2021-12-03T18:58:09Z","snapshot_observed_at":"2026-07-06T11:18:40.627866Z","submitted_at":"2021-06-12T20:38:59Z","title":"A Minimalist Approach to Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06860","snapshot_observed_at":"2026-08-07T15:42:49.563459Z","title":"Scott Fujimoto, David Meger, and Doina Precup","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:49.563459Z"},"links":{"cited_paper":"/paper/2106.06860","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:12b70629f082db9b3533135312006c12cf51a34aa2fe40508c285782fe72611d","observation_id":"5d26abf5-f678-4528-b515-ff9311f8250f","resolution":{"observed_at":"2026-08-07T15:42:49.563459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00927","last_updated":"2022-10-13T12:04:36Z","snapshot_observed_at":"2026-08-03T02:03:48.954468Z","submitted_at":"2022-06-02T08:43:16Z","title":"DPM-Solver: A Fast ODE Solver for Diffusion Probabilistic Model Sampling in Around 10 Steps","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00927","snapshot_observed_at":"2026-08-07T15:42:50.432520Z","title":"Cheng Lu, Huayu Chen, Jianfei Chen, Hang Su, Chongxuan Li, and Jun Zhu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:50.432520Z"},"links":{"cited_paper":"/paper/2206.00927","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:bfc062077ca531816a744770734c0d477779b1141035a30b5d8a39602d722e46","observation_id":"54ffd1f8-04c3-4452-b03d-54da3fb97846","resolution":{"observed_at":"2026-08-07T15:42:50.432520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20081","last_updated":"2023-10-26T12:25:02Z","snapshot_observed_at":"2026-08-03T10:02:56.003909Z","submitted_at":"2023-05-31T17:55:21Z","title":"Efficient Diffusion Policies for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20081","snapshot_observed_at":"2026-08-07T15:42:49.907562Z","title":"Patrick Kidger and Cristian Garcia","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:49.907562Z"},"links":{"cited_paper":"/paper/2305.20081","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:479cd3ad11fc2f9451721e45341d6a42335e1104e59361d45bb43123ee58437f","observation_id":"f03702ea-474c-4204-8a39-dadc3920baeb","resolution":{"observed_at":"2026-08-07T15:42:49.907562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T15:42:49.234834Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:49.234834Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:af5620c688ecafdff1008fd0297459118012dbeb731b33ee48c3a134a420349d","observation_id":"95aabe8e-02c7-4362-98ad-c9865fc5b5cd","resolution":{"observed_at":"2026-08-07T15:42:49.234834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.04562","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:52.771332Z","title":null,"venue":null,"work_id":"13a89b1b-8c30-48fb-8a7c-1b967f87b231","year":null},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:49.151820Z"},"links":{"citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:b958c3d22afe826e55c412030cfb26ac1764ef0cfba8cde9aed3b86f12073e31","observation_id":"438fe611-de93-454e-8dc2-8f5980d3e5ae","resolution":{"observed_at":"2026-08-07T15:42:52.965404Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T15:37:26.102286Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":3,"verified_fuzzy":1},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 9 inbound Pith citation observations for arXiv:2505.14139."}