{"as_of":"2026-08-18T03:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:63abefc728a722e43598bbc07f58bdb24d35193504f849b9a9417d9e508db455","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T10:58:48.872832Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T23:47:45.866615Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T03:49:31.218132Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.08136","snapshot_observed_at":"2026-07-14T23:47:45.866615Z","title":"Reverse flow matching: A unified frame- work for online reinforcement learning with diffusion and flow policies.arXiv preprint arXiv:2601.08136, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.10250","last_updated":"2026-05-24T03:43:13Z","snapshot_observed_at":"2026-08-14T23:45:17.615269Z","submitted_at":"2026-03-10T22:01:13Z","title":"GeMPO: Generalized Measure Matching for Online Diffusion Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T23:47:45.866615Z"},"links":{"cited_paper":"/paper/2601.08136","citing_paper":"/paper/2603.10250"},"observation_digest":"sha256:75111d9feb2912b1cffb75e30466221044874d07cc4d9c473377ae588b7d5078","observation_id":"bc753560-b09f-462f-b993-e381b25043a7","resolution":{"observed_at":"2026-07-14T23:47:45.866615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.08136","snapshot_observed_at":"2026-07-12T20:04:29.261622Z","title":"Reverse flow match- ing: A unified framework for online reinforcement learn- ing with diffusion and flow policies.arXiv preprint arXiv:2601.08136,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.14698","last_updated":"2026-05-30T05:53:13Z","snapshot_observed_at":"2026-08-13T20:14:56.846451Z","submitted_at":"2026-04-16T06:59:52Z","title":"Mean Flow Policy Optimization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T20:04:29.261622Z"},"links":{"cited_paper":"/paper/2601.08136","citing_paper":"/paper/2604.14698"},"observation_digest":"sha256:4eb0b1886431105e4b802247ee9645db737cacb0cbd54e810a22c78791af8121","observation_id":"241656fa-c536-466f-ac90-5aee52c75cf7","resolution":{"observed_at":"2026-07-12T20:04:29.261622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"cited_work":{"arxiv_id":"2601.08136","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.08136","snapshot_observed_at":"2026-07-04T03:49:31.218132Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","venue":"cs.LG","work_id":"55a15e95-5581-44ac-9476-065ca7324b6a","year":2026},"citing_paper":{"arxiv_id":"2606.19774","last_updated":"2026-06-18T04:14:11Z","snapshot_observed_at":"2026-08-15T22:40:48.602958Z","submitted_at":"2026-06-18T04:14:11Z","title":"Start Right, Arrive Right: Asynchronous Execution via Initial Noise Selection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T17:32:02.560340Z"},"links":{"cited_paper":"/paper/2601.08136","citing_paper":"/paper/2606.19774"},"observation_digest":"sha256:8942ac272cfebdb574e80a9b4fab422d783ad28a21febd1da80ec2d344d76c50","observation_id":"5b1319b1-dc1b-40a1-94fd-5966b4c23068","resolution":{"observed_at":"2026-07-04T03:49:31.220478Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2601.08136/citation-record","integrity":"/paper/2601.08136/integrity","json":"/paper/2601.08136/citation-record.json","paper":"/paper/2601.08136"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:45.251938Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:45.251938Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:a90dc46a1ce4b379d4ba2b9472efa6e190d6e113d7d934ee96d0e1e30e1cc974","observation_id":"833d0adb-47a0-4ea0-924f-c6d48cd7f6a8","resolution":{"observed_at":"2026-08-03T10:58:45.251938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:45.350199Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:45.350199Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:3d9c4ed84350609a80b07ccbfa6039a956dcf4557d1e78dbdef702268102e380","observation_id":"19a4c57e-f037-422a-abe4-36526df3b4e2","resolution":{"observed_at":"2026-08-03T10:58:45.350199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:45.464332Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:45.464332Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:4c0dd105e772ff61b0e8651b0a0225cecc3523a7e2d50c78d93071d80f72ac79","observation_id":"4e80d303-751b-41e2-b78b-62fafacfd02b","resolution":{"observed_at":"2026-08-03T10:58:45.464332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:45.603358Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:45.603358Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:2a0fd1541d30861f5f6256ce5ce49d57a47944ea39c2a88edb5039917e1337ca","observation_id":"e1fb49eb-d8af-498e-a4c3-2fb9c53c1899","resolution":{"observed_at":"2026-08-03T10:58:45.603358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:45.695502Z","title":"Scaling rectified flow transformers for high- resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:45.695502Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:db885d2a2acef59962cd01c76e1fa7e1099ebfe84c8c7a22fa95bf7924951d63","observation_id":"045b5e92-9cf2-4784-9fbe-387c1a6bfcfd","resolution":{"observed_at":"2026-08-03T10:58:45.695502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:45.767045Z","title":"Video diffusion models.Advances in neural information processing systems, 35:8633–8646, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:45.767045Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:ebe2fb643c71089819622426a1c0afe981d9f183e50d797b9a19b7b8d5d1b8a6","observation_id":"93e151d7-96e4-4bbd-b3dd-d75a6ba8f06b","resolution":{"observed_at":"2026-08-03T10:58:45.767045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:45.946573Z","title":"Pyramidal flow matching for efficient video generative modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:45.946573Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:af8f12a908ab635dde96f4f7a8fef426b10370519487e37a479c101273a23a80","observation_id":"b9143424-a43b-469f-b09d-a2d026402b97","resolution":{"observed_at":"2026-08-03T10:58:45.946573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:46.095599Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion.The International Journal of Robotics Research, page 02783649241273668, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:46.095599Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:6e30b8a855246910a01e065379862b6c6a3120c1e291c3fad12f6ccf1110a4a3","observation_id":"639113db-7e08-4421-a2d7-a8fd16c804d4","resolution":{"observed_at":"2026-08-03T10:58:46.095599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:46.179713Z","title":"Fast and robust visuomotor riemannian flow matching policy.IEEE Transactions on robotics, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:46.179713Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:93a60254f049bf07f7de7976bae3dcf9523646f0cf71c9767ed7d59dd255561e","observation_id":"e94d59a0-348d-4f41-adc4-8f0ea1afcd56","resolution":{"observed_at":"2026-08-03T10:58:46.179713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:46.231464Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:46.231464Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:efd729b627e5a7b0391dd0e37cb813175f29018205870a141bbac544ca4b3fe2","observation_id":"68eb1f44-d696-4974-836a-e71e889d719e","resolution":{"observed_at":"2026-08-03T10:58:46.231464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:46.389886Z","title":"Flow q-learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:46.389886Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:4fc43c5faf229ef71659cc61e56a7058b8d48c658f593d589cf8528b0933faf0","observation_id":"feb4117f-b30c-4a73-afba-2f79c66a7dee","resolution":{"observed_at":"2026-08-03T10:58:46.389886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:46.535345Z","title":"Soft actor-critic: Off-policy max- imum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:46.535345Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:51b28e2b8e7c5cdcf73b620c4a96fc6357e2277ec39d444e3de79189f98d541f","observation_id":"d226ec83-7d80-4821-880a-5e848c1e63a7","resolution":{"observed_at":"2026-08-03T10:58:46.535345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:46.670434Z","title":"Efficient online reinforcement learning for diffusion policy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:46.670434Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:144b774d0e6a976a0d8ade99020bb1e4a4f503388a112e7e5e274bedac04483f","observation_id":"3b654983-344a-4ce0-93f1-370d431825f8","resolution":{"observed_at":"2026-08-03T10:58:46.670434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:46.759163Z","title":"Maximum entropy reinforcement learning with diffusion policy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:46.759163Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:ddc8d384daf00525a782fd515a226bd5107b266bc56e5e2140d647e1a57bd7f8","observation_id":"dc75b755-4b91-401d-a5e7-f4889c33db41","resolution":{"observed_at":"2026-08-03T10:58:46.759163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:46.937229Z","title":"Iterated denois- ing energy matching for sampling from boltzmann densities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:46.937229Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:da3f71a25400f31f1e0e3a9ea2216e599cbaa2119fe264c84342167808a1b101","observation_id":"456f27fe-8874-4bef-b35f-d4162c0e4045","resolution":{"observed_at":"2026-08-03T10:58:46.937229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:47.093186Z","title":"Sampling from energy-based policies using diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:47.093186Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:b094b1e3f882b7a99be3c1718643540bc01969bd6f35754f9684f0748561a40d","observation_id":"626e9e36-6abf-4181-b04f-328101049240","resolution":{"observed_at":"2026-08-03T10:58:47.093186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:47.233661Z","title":"Diffusion actor-critic with entropy regulator.Advances in Neural Information Processing Systems, 37:54183–54204, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:47.233661Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:4c2780d9d579513183d2c6790b974c23f0ef3e4dcacdb40238fd1bf4e1d664b5","observation_id":"64495332-ef8c-4b65-a517-7c9423aebd2a","resolution":{"observed_at":"2026-08-03T10:58:47.233661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:47.312614Z","title":"Flow-based policy for online reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:47.312614Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:310714be35cb86e3e2c4e3f7a15299a31ef64b3f07b63fc7a24cb64e4a3aac42","observation_id":"ef793eed-2799-4051-a587-48d3570bd33f","resolution":{"observed_at":"2026-08-03T10:58:47.312614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:47.438409Z","title":"Learning a diffusion model policy from rewards via q-score matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:47.438409Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:f2e5f829f63016608a0a68ecf8e9229443c61fcb3d9ce692cf0e29d1ee1a8049","observation_id":"91e5720d-a937-45ef-ac06-4cd058a0da86","resolution":{"observed_at":"2026-08-03T10:58:47.438409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:47.553359Z","title":"Langevin soft actor-critic: Effi- cient exploration through uncertainty-driven critic learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:47.553359Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:0ecf7e4b6c21402dcfab957faf741b3abaaa6635ea9c2bd6464d52e69391091d","observation_id":"30f9cc1d-de0a-4856-91b4-f44db276e851","resolution":{"observed_at":"2026-08-03T10:58:47.553359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:47.725924Z","title":"Diffusion-based reinforcement learning via q-weighted variational policy optimization.Advances in Neural Information Processing Systems, 37:53945–53968, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:47.725924Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:776fdb40036f8a2478584e6e571bc89b25d156185265dd125d03341ffba532a3","observation_id":"e275e09e-ad33-4679-9fde-a5f33f4f7c5e","resolution":{"observed_at":"2026-08-03T10:58:47.725924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:47.874754Z","title":"Online reward- weighted fine-tuning of flow matching with wasserstein regularization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:47.874754Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:31d44292130a873a76a5ea2094f92ea5975d34a7069a8d61fbfa04ab8e3d3dad","observation_id":"3cec7a6d-f65b-436b-8d96-691b3fb1cba3","resolution":{"observed_at":"2026-08-03T10:58:47.874754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:48.038292Z","title":"Control functionals for monte carlo integration","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:48.038292Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:f2ec0026d535ce33d237ec1dd3e4ffbe85fa1e29680a63bb766c8781c17dc863","observation_id":"d534975d-0181-4ed3-9c0d-a36e8abd9cbb","resolution":{"observed_at":"2026-08-03T10:58:48.038292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:48.137246Z","title":"Measuringsamplequalitywithkernels","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:48.137246Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:149054ea3d1173f33dc7618b634fca1983be415ccc9df0443408f4c7dcabba2c","observation_id":"08f3acb7-afed-46a5-8bd2-ed26d3c9b98e","resolution":{"observed_at":"2026-08-03T10:58:48.137246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:48.308114Z","title":"Importance sampling: a review.Wiley Interdisciplinary Reviews: Computational Statistics, 2(1):54–60, 2010","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:48.308114Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:29d5798fd791c27991e83c1092cbfd9f213014c09a585d71787506695e7748be","observation_id":"90a25998-d82a-45f7-90cc-0976f53cd262","resolution":{"observed_at":"2026-08-03T10:58:48.308114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:48.440171Z","title":"Model-based diffusion for trajectory optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:48.440171Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:4748564d632d05658dadbaa043f32c6f2271b6fa33c015481d3e8afc1689b5f5","observation_id":"4fc221bb-0438-461a-bc41-e29dbabe7eda","resolution":{"observed_at":"2026-08-03T10:58:48.440171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:48.632743Z","title":"Reverse diffusion monte carlo","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:48.632743Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:36d96366f546f485f5eaf3c18fde3910f291c958b5016afcddf678c5ee898ae6","observation_id":"33272ca3-4f45-4821-bffb-ca03d67b300f","resolution":{"observed_at":"2026-08-03T10:58:48.632743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:58:48.771946Z","title":"Stochastic localization via iterative posterior sampling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:48.771946Z"},"links":{"citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:025e6e047e8f5808958955e89a20ae60229b788aab7841415e0fb87ffc7bf2cb","observation_id":"55fc4954-db14-4fb9-a5f1-10e968e96066","resolution":{"observed_at":"2026-08-03T10:58:48.771946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-03T10:58:48.872832Z","title":"Deepmind control suite.arXiv preprint arXiv:1801.00690, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T10:58:48.872832Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2601.08136"},"observation_digest":"sha256:d7a348338889ce3d07b51030fbda162c21f558710ecf9e679f0370994eb2fc0c","observation_id":"93896640-bd77-4dff-b79b-bed03ad9d493","resolution":{"observed_at":"2026-08-03T10:58:48.872832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.08136","last_updated":"2026-06-10T06:51:24Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T18:16:47.747250Z","submitted_at":"2026-01-13T01:58:24Z","title":"Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 3 inbound Pith citation observations for arXiv:2601.08136."}