{"as_of":"2026-08-13T22:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:15573b55e8d9ad56c706c5e18b3cbe70c8abdf9d77069f2611e596a4ff41776d","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T14:38:54.754049Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.21086/citation-record","integrity":"/paper/2606.21086/integrity","json":"/paper/2606.21086/citation-record.json","paper":"/paper/2606.21086"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"Training diffusion models with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:86633e8359cb014cd71b9b646124eb42cdc88c9130f9c8e5a211b04bf07b401c","observation_id":"153dedf5-c742-467b-a315-b743ca2163c5","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":"1606.01540","doi":"10.1109/jssc.2019","metadata_source":"pith","pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"OpenAI Gym","venue":"cs.LG","work_id":"6af98f3f-f074-41ae-a689-7dd7b4b8efde","year":2016},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:9b33ec936f72f4c19d2b5cb349cc00bb97888cec9dfcb3340d46fd34b38e91f0","observation_id":"50b65e5b-237d-4e95-858c-e5905dd97445","resolution":{"observed_at":"2026-07-04T06:19:37.814921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.23675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:59:43.312364Z","title":"One-step flow policy mirror descent","venue":null,"work_id":"6c9ec799-c2dc-4576-820a-543054f0bce2","year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:68dd68970cad28b1284d188d89970af633e2992b057a2c2e7e1e32051bcb464f","observation_id":"13b18639-4339-4ad4-b65f-1a2260f77754","resolution":{"observed_at":"2026-07-04T06:19:37.789323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.05150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:50:11.407198Z","title":"arXiv preprint arXiv:2512.05150 (2025)","venue":null,"work_id":"75fbd212-426d-49ad-8083-64847f401b50","year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:70b37e9ab634cbab754e96092deca77a6a4a8f022e142ca49449fcca17382e22","observation_id":"5f6dda6d-cb91-486e-8a89-5e681b876bd8","resolution":{"observed_at":"2026-07-04T06:19:37.836061Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:c345cb0382632c95ed8dda78d2c52e2b7fa04df56d51c03a0aa5ba8bb92a919b","observation_id":"76f3c65b-336b-406c-89a9-57cbd144d746","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"Online reward-weighted fine-tuning of flow matching with wasserstein regularization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:90db1108911d71cd3ffc093cc5123d3ed9db07eb403804e5ebc12d1547e9ccb8","observation_id":"a7df2820-a089-4f37-a6fa-2b6f2b1f943c","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"One step diffusion via shortcut models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:b904bc1d2450430c2675a4dbd1f0c8388ac8fd417d17c24b723f32a5453abbf8","observation_id":"64e3e799-4485-47e5-bbfe-e7b450331418","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13447","last_updated":"2025-05-19T17:59:42Z","snapshot_observed_at":"2026-08-11T19:20:11.648968Z","submitted_at":"2025-05-19T17:59:42Z","title":"Mean Flows for One-step Generative Modeling","version":1},"cited_work":{"arxiv_id":"2505.13447","doi":"10.48550/arxiv.2505.13447","metadata_source":"pith","pith_arxiv_id":"2505.13447","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mean Flows for One-step Generative Modeling","venue":"cs.LG","work_id":"07a52ad5-0f82-4095-9a66-559b09fea1ae","year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"cited_paper":"/paper/2505.13447","citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:0b5cd1423d666af803169a2508ee7480dd20621a6835763f390b32c882834e91","observation_id":"038c8539-6fd7-4983-8f25-58b9ac8897eb","resolution":{"observed_at":"2026-07-04T06:19:37.832763Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":"2304.10573","doi":"10.1007/978-3-658-09994-7","metadata_source":"pith","pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","venue":"cs.LG","work_id":"913326e6-9ea4-4974-b2d7-ff53984b387f","year":2023},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:09b316121aa5bf272df1b827d06fc32db371c41830c08432095307d4d81b7ccd","observation_id":"9e4ae72e-23fc-45dc-8b06-5b8452332065","resolution":{"observed_at":"2026-07-04T06:19:37.817797Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"Planning with diffusion for flexible behavior synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:667e6d6dd8e260d6046fe392018e031a87d800059a95c7e3880e732bfd7c9b0f","observation_id":"a91c4516-3590-4eed-83d4-eccf89f30088","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"Understanding diffusion objectives as the ELBO with simple data augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:1edadec240ae2c0f75b7bbd09e6f543d68cd89dc881f9d4dca09773649f75bd8","observation_id":"75b20caf-2993-4279-a207-d4861cb1a408","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"Optimal flow matching: Learning straight trajectories in just one step.Advances in Neural Information Processing Systems, 37:104180–104204, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:b8399393d331b01dbbc86c5d15495b2c610446b0cc52d6348aa706e0d9bd4f76","observation_id":"fefffa0b-e388-4dd8-9e8d-9650edeabf4a","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:a0ac6e43113b6f9910e3bec93c1de47d24927e33ccf196486134f58efa978d87","observation_id":"5062f946-8457-42e9-ae6b-1b72b58035e6","resolution":{"observed_at":"2026-07-04T06:19:37.820856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"Reinforcement learning with action chunking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:ed8dcc4d740f5c8c63c2768dc58c9fa25b0e3fdcc70eb58d14c39c309bb2778e","observation_id":"5a345ec3-ef2b-426b-9ec2-7d32e2d34a80","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22475","last_updated":"2026-05-11T21:01:18Z","snapshot_observed_at":"2026-08-06T10:54:16.357063Z","submitted_at":"2025-11-27T14:04:08Z","title":"Adversarial Flow Models","version":3},"cited_work":{"arxiv_id":"2511.22475","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.22475","snapshot_observed_at":"2026-07-04T06:19:37.822223Z","title":"Adversarial Flow Models","venue":"cs.LG","work_id":"01caa442-79da-480b-a79c-f3a83ce96fd9","year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"cited_paper":"/paper/2511.22475","citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:73ba7a626e41e20ecda220930d39262d73707e85b524b143d81c97e58ddc6028","observation_id":"01b8764c-c800-46be-8e57-6579413d1435","resolution":{"observed_at":"2026-07-04T06:19:37.823630Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"Flashaudio: Rectified flow for fast and high-fidelity text-to-audio generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:e3bacc94c4686e240e0af0ddb701c5b23adf4e08360e2cee97c64f771779810f","observation_id":"1e2b05a6-1344-4f61-aa40-ca72085df262","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05470","last_updated":"2025-10-27T09:57:02Z","snapshot_observed_at":"2026-08-13T10:15:00.293616Z","submitted_at":"2025-05-08T17:58:45Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","version":5},"cited_work":{"arxiv_id":"2505.05470","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.05470","snapshot_observed_at":"2026-07-09T02:25:55.898592Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","venue":"cs.CV","work_id":"bf1e8e81-ff31-401a-a5dc-d9c49df168ab","year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"cited_paper":"/paper/2505.05470","citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:902d07ebe9622d02f292b029333986ceb4ed123c21fb135e3a4793116df8c524","observation_id":"375f5fa7-4237-4839-8ba4-d9718f353a55","resolution":{"observed_at":"2026-07-04T06:19:37.826561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:64e10798ade3d3628b701aa308a9c2015b8a16b84b124a975f62019bab397666","observation_id":"9ad47ff5-8d6e-4b39-a634-d060b0b7616f","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.15657","doi":"10.48550/arxiv.2512.15657","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soflow: Solution flow models for one-step generative modeling","venue":"arXiv (Cornell University)","work_id":"c20bab1a-fef5-470a-8a07-5f1f1990b9c8","year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:7a220f45e848d018ae9d30a7da3a8f4b249d562475e25de5eaaec501f1a042da","observation_id":"e2f51742-7901-4ad7-8e80-21c9e1c7ce59","resolution":{"observed_at":"2026-07-04T06:19:37.829853Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"Perpetual humanoid control for real-time simulated avatars","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:e1d22835d57cfbda97fd0076dea322d163e69bf37dde895a3da5f11217853534","observation_id":"d04b7211-6ada-409b-9bc8-1a1bc6a01716","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-07T00:34:57.866937Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.12811","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12811","snapshot_observed_at":"2026-07-04T06:19:37.801846Z","title":"Flow-based policy for online reinforcement learning","venue":null,"work_id":"51816cd1-96b3-4c29-8b2b-90a8c5b8894c","year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"cited_paper":"/paper/2506.12811","citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:c046ab350117b0a9fe97b567de669fdeb150ce6f3213aca2ed81d80bdf767f8c","observation_id":"53d83936-0ddb-46c2-85f7-48147fa6f40b","resolution":{"observed_at":"2026-07-04T06:19:37.803584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"Amass: Archive of motion capture as surface shapes","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:b704b9e99db295b5969f6c3da7025585d8d898efc221ca26ce36527609be2d72","observation_id":"fbf5823d-74e8-4739-bad8-630af31506bc","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10470","last_updated":"2021-08-25T23:42:59Z","snapshot_observed_at":"2026-07-06T11:40:56.544714Z","submitted_at":"2021-08-24T01:38:11Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","version":2},"cited_work":{"arxiv_id":"2108.10470","doi":"10.48550/arxiv.2108.10470","metadata_source":"pith","pith_arxiv_id":"2108.10470","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","venue":"cs.RO","work_id":"a21210c8-5b8f-429a-accc-fb4ca1efd19d","year":2021},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"cited_paper":"/paper/2108.10470","citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:a5b3499ba95e95d9b4127a3b9d46d5598dc4a51313e50636d37d1ab50bcb709d","observation_id":"4b749de0-ba94-4e36-aacc-f50da342d70b","resolution":{"observed_at":"2026-07-04T06:19:37.777231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-13T18:51:47.308476Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:ab3082830be96b99b858432e9fc75e4fd2ae36c24699baf518e307f44825fa30","observation_id":"7ec13d94-630e-4ff1-9b03-e26a0bba8df9","resolution":{"observed_at":"2026-07-04T06:19:37.773920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.13904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:19:37.810356Z","title":"Revisiting diffusion q-learning: From iterative denoising to one-step action generation.arXiv preprint arXiv:2508.13904, 2025","venue":null,"work_id":"daf3afe7-03e9-40bf-a537-0cedba0180e4","year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:2fda01be7fbfc9c993d2db3b14f2f06af915c689043cb60a1cdaf225ee8b7d47","observation_id":"4c8f06f3-ed7a-4deb-a9b5-30df5f880f35","resolution":{"observed_at":"2026-07-04T06:19:37.812060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02538","last_updated":"2025-05-25T22:15:41Z","snapshot_observed_at":"2026-08-12T18:03:00.749482Z","submitted_at":"2025-02-04T18:04:05Z","title":"Flow Q-Learning","version":2},"cited_work":{"arxiv_id":"2502.02538","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.02538","snapshot_observed_at":"2026-07-10T16:47:24.448335Z","title":"Flow Q-learning","venue":"cs.LG","work_id":"aaf75949-519b-45a5-8a13-f387de951d31","year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"cited_paper":"/paper/2502.02538","citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:e4e08a5df699b3c213da3a5dc113c9acfe3393c8bbec7632581912069ae18382","observation_id":"08613148-0952-4708-9915-2ae2cbae0c21","resolution":{"observed_at":"2026-07-04T06:19:37.783136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"Deepmimic: Example- guided deep reinforcement learning of physics-based character skills.ACM Transactions On Graphics (TOG), 37(4):1–14, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:c6abac2263ed6d5c4ce37a337dbbf1657e651e9d4aa2eace3fa58f05e750c7fb","observation_id":"a1de6f13-1dc8-45fc-8ad5-d42af1c431f4","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"Ren, Justin Lidard, Lars Lien Ankile, Anthony Simeonov, Pulkit Agrawal, Anirudha Majumdar, Benjamin Burchfiel, Hongkai Dai, and Max Simchowitz","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:a1a15f6ef3eb1bfd77e8d2f4c92fca126321db65d49f0e0b7b68ef8fdf2edfcf","observation_id":"ceeaffb4-fd4c-4e40-8877-de716c09f116","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:5873569d5a93045228cc12f951dd51553abe16013635049ed9e78cb6298ac41a","observation_id":"91f4000c-f1a2-4591-95d1-e960fe721cd7","resolution":{"observed_at":"2026-07-04T06:19:37.841977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-13T10:18:22.884883Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":"2505.22642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-07-10T17:17:25.644428Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":"cs.RO","work_id":"7a0e4c22-2015-41c5-a8d1-c57f6282eec2","year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:2ce8fd8becd230f53fc0241223bd8c5de1a3f1cbb68128447aaf5a33550081e6","observation_id":"06805b5e-9603-4903-a27a-f86b69aa352e","resolution":{"observed_at":"2026-07-04T06:19:37.839390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"LEARNING STRAIGHT FLOWS BY LEARNING CURVED INTERPOLANTS","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:5385d27c73aeff172b96f75e784b0b5115144d9438161e4496159b29751028c3","observation_id":"91988b64-05fa-4a21-b708-911437f6aa37","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01469","last_updated":"2023-05-31T06:17:10Z","snapshot_observed_at":"2026-08-13T00:53:42.623435Z","submitted_at":"2023-03-02T18:30:16Z","title":"Consistency Models","version":2},"cited_work":{"arxiv_id":"2303.01469","doi":"10.48550/arxiv.2303.01469","metadata_source":"pith","pith_arxiv_id":"2303.01469","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Consistency Models","venue":"cs.LG","work_id":"502bf494-8fcd-434f-828f-0566ab606719","year":2023},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"cited_paper":"/paper/2303.01469","citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:1669cdb15dbd9bc8f0e9b7535791f4445ce00667bb3b7fc96d102a1fdc4447e9","observation_id":"4b31069c-dad3-4663-9237-947231ecf390","resolution":{"observed_at":"2026-07-04T06:19:37.780060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:53:56.48998+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:53:56.48998+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:55e8596b2b45d70b042307c04990809f7ba08325178603a4a47efbda887b75d3","observation_id":"3441e47d-6b81-4f8f-8e82-d5cafed42ffd","resolution":{"observed_at":"2026-07-04T06:19:37.809089Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:50119a3068aacd3bd00fd23e681a9f0da38b20c069c1589fc45d99960a8eeab7","observation_id":"a4ab1a5d-53da-4e13-a3d7-f9830461ec07","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport.Transactions on Machine Learning Research, pages 1–34, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:d914c0e13768a88b13f37c2b60e48ea36cd389e7910465e38d065cdaf9fbd2e5","observation_id":"4110262f-de45-4b89-9d81-b6a91697ebee","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-08-13T22:24:37.672685Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:93046a9d12b72874408ec71468c2170217b5423f6f90a9ce139d7b955769b283","observation_id":"97204582-c02b-4657-9f5a-8b6a64881615","resolution":{"observed_at":"2026-07-04T06:19:37.844684Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"dm_control: Software and tasks for continuous control.Software Impacts, 6:100022, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:8149123a63a8970128deb12c4a4420209373f18245930121862d0cde63b55ac1","observation_id":"f003ed34-9a26-4ed8-9be8-fc989ef3e2ce","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.13035","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:19:37.792447Z","title":"One-step generative policies with q-learning: A reformulation of meanflow","venue":null,"work_id":"b150cf8b-1307-4f0a-9184-5533250a5397","year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:0cb23e98f272a202dc809d2d4d4e98d1b502474a7ca3e1362edb937044286535","observation_id":"17316771-bf50-4577-89d3-77c6a5def3e4","resolution":{"observed_at":"2026-07-04T06:19:37.794249Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:1380993df930d7a99918ee2bb14ca0dafe6ddf7c409508f7710f77e108b3d126","observation_id":"c3ab7fbd-6e3c-42c2-aa25-81289099659f","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"Consistency flow matching: Defining straight flows with velocity consistency.CoRR, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:e1bc455400a76189d5739d90119c79ab770357ae67e5c061f1a1231682c3ef5a","observation_id":"9df66385-a10d-4731-8448-f5b819c8d069","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"One-step diffusion with distribution matching distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:37fd01787e4d0a629ac522f109f2708bd2fbac978b74c8b33248c4f5551849aa","observation_id":"10587744-e089-4d59-bc9c-4d857a1bb446","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08844","last_updated":"2025-02-12T23:30:01Z","snapshot_observed_at":"2026-08-13T09:28:00.561864Z","submitted_at":"2025-02-12T23:30:01Z","title":"MuJoCo Playground","version":1},"cited_work":{"arxiv_id":"2502.08844","doi":"10.48550/arxiv.2502.08844","metadata_source":"pith","pith_arxiv_id":"2502.08844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mujoco playground","venue":"cs.RO","work_id":"0325a224-ac67-49fb-a451-9fb130f682c9","year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"cited_paper":"/paper/2502.08844","citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:2481e252392d141dd19815dcee004e822e4f403e4a1fbb9ca563ef2bacf6d356","observation_id":"f8da729b-4043-4834-9878-f75dc173af1d","resolution":{"observed_at":"2026-07-04T06:19:37.785912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"Energy-weighted flow matching for offline reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:bb5fa78c25f2aca6e10053c95cfaee7a2501ce4b8a36ab03a54d515f989ff271","observation_id":"8703a874-13a4-4644-80db-2f2bb3f3a6e9","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:c6590db8e5f2f7c590eac3119cf2d4b8912357a2de1b36ca61397f48a4f49ab4","observation_id":"d5688efb-3667-4f62-932a-30f6ea6cea5a","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"Reinflow: Fine-tuning flow matching policy with online reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:bead5fff659da74273d155b9745ee965c820565dab1845e8906f4eda55be6ed4","observation_id":"588fc1cb-01a5-45c2-9b97-4d51497f61f8","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.23342","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:19:37.795632Z","title":"Flow straighter and faster: Efficient one- step generative modeling via meanflow on rectified trajecto- ries","venue":null,"work_id":"0ed34bf8-be7b-4fe0-b2cf-cced07b776d8","year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:573682fd00087f3f7bd8afd84484f7e29c0213f066d5a62728dfe5e25b79ce90","observation_id":"319d7846-9c17-4f61-88f1-347c22b9293d","resolution":{"observed_at":"2026-07-04T06:19:37.797579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"SCot: Unifying consistency models and rectified flows via straight-consistent trajectories","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:64159e7dcbdd2b4154a1e9cb8731f37e25dc5a7141c399a3f6aa88946455f229","observation_id":"8fec7bfe-0b14-4603-b969-d73f80255e56","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.19797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:19:37.804917Z","title":"Terminal velocity matching","venue":null,"work_id":"f6b92ac1-ea76-41ea-afd8-801797159f45","year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:31fa0472646f838f3044e4dfae0fabcf7d1de40a348d7b663d320f392bcabf3d","observation_id":"27bffc43-d898-42e9-9516-2d977efbc142","resolution":{"observed_at":"2026-07-04T06:19:37.806531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08175","last_updated":"2025-02-09T10:02:55Z","snapshot_observed_at":"2026-08-12T02:17:35.727956Z","submitted_at":"2024-12-11T08:05:35Z","title":"Analyzing and Mitigating Model Collapse in Rectified Flow Models","version":2},"cited_work":{"arxiv_id":"2412.08175","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08175","snapshot_observed_at":"2026-07-04T06:19:37.798952Z","title":"Analyzing and mitigating model collapse in rectified flow models.arXiv preprint arXiv:2412.08175, 2024","venue":null,"work_id":"b1583d45-9f40-4c98-bb5c-6aaabcebc39b","year":2024},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"cited_paper":"/paper/2412.08175","citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:c23c1be98e2b258fd09cc5b60bf76e264bb75d73f2a0f91c6209ee18d9f8cb8c","observation_id":"b90716fe-637f-40f1-899d-41108441a417","resolution":{"observed_at":"2026-07-04T06:19:37.800693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"Slimflow: Training smaller one-step diffusion models with rectified flow","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:c0eb2deb61822cd7b90af93dba697680f4619026749c5a1ecf1bb8188d343456","observation_id":"f5c04604-e67b-4952-a9a6-65d555ed667f","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:54.754049Z","title":"Di [m] o: Distilling masked diffusion models into one-step generator","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:95ff1cd57ca4f812f2228550195684a6ea9022daaa2417850bd16a130bf19e51","observation_id":"d7028486-6b0c-453b-9fc7-c7d9984c1857","resolution":{"observed_at":"2026-06-26T14:38:54.754049Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":24,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2606.21086."}