{"as_of":"2026-08-11T11:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a9a1fb586e443a099fe43cd72118812a8f0f014e095a68680911dabf309c3e22","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:07:09.738381Z","state":"measured"},{"denominator":121,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":121,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":37,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:50:11.728877Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:19:37.772072Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-08-04T10:44:09.497998Z","title":"Flow matching policy gradients.arXiv preprint arXiv:2507.21053,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09222","last_updated":"2026-06-01T11:49:06Z","snapshot_observed_at":"2026-08-07T20:08:20.794829Z","submitted_at":"2025-10-10T10:08:10Z","title":"FM-IRL: Flow-Matching for Reward Modeling and Policy Regularization in Reinforcement Learning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T10:44:09.497998Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2510.09222"},"observation_digest":"sha256:76bcae1b0f5ce59a64c4f8f829c91eb01d23069299f3b2b2cd8f0e79d0966eb1","observation_id":"05e84f68-da6f-4416-a7fe-69d441ee2b57","resolution":{"observed_at":"2026-08-04T10:44:09.497998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-08-04T10:24:57.490427Z","title":"Flow Matching Policy Gradients,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09976","last_updated":"2026-06-25T14:25:12Z","snapshot_observed_at":"2026-08-10T21:19:26.143305Z","submitted_at":"2025-10-11T03:11:18Z","title":"Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T10:24:57.490427Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2510.09976"},"observation_digest":"sha256:518fc71ca8fc4b16ebf09f8688e0160e46908224fb887f00a2af74625e60b2d3","observation_id":"42306e54-3ee8-4118-a18e-aabd58d51bbb","resolution":{"observed_at":"2026-08-04T10:24:57.490427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-08-03T19:03:03.053275Z","title":"Flow matching policy gradients.arXiv preprint arXiv:2507.21053,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.02581","last_updated":"2026-06-19T14:04:42Z","snapshot_observed_at":"2026-08-09T16:36:44.025897Z","submitted_at":"2025-12-02T09:49:26Z","title":"Training Diffusion Policies via Prior-Mapping Co-Evolution","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T19:03:03.053275Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2512.02581"},"observation_digest":"sha256:cff4b25ce6394e815a007ad6ef900934341aae40c9f81880d3e874e96de8b7b6","observation_id":"813d2a66-f479-4ab2-9210-41d0a7f218b0","resolution":{"observed_at":"2026-08-03T19:03:03.053275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-08-03T02:55:50.559508Z","title":"Flow matching policy gradients","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-11T09:29:32.835401Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.559508Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:11edcb1d7b8ba9a48dc6412a04022298cef3a2b9dd1469a262df1750989f43c9","observation_id":"02cc83af-386b-48db-be1b-38a7ae9bbf7a","resolution":{"observed_at":"2026-08-03T02:55:50.559508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-08-02T23:59:16.138832Z","title":"M., Weber, E., Choi, H., Feng, H., and Kanazawa, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12155","last_updated":"2026-06-29T06:08:55Z","snapshot_observed_at":"2026-08-07T09:48:03.626010Z","submitted_at":"2026-02-12T16:36:33Z","title":"FAIL: Flow Matching Adversarial Imitation Learning for Image Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T23:59:16.138832Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2602.12155"},"observation_digest":"sha256:cd8343f7d2ced20503c2acdca7edf1159f380c2f5dc12aa1b8162049959d81df","observation_id":"6110491d-3f52-421b-9f2f-7a52c6b18727","resolution":{"observed_at":"2026-08-02T23:59:16.138832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-14T23:46:32.301737Z","title":"M., Weber, E., Choi, H., Feng, H., and Kanazawa, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.10263","last_updated":"2026-07-01T06:52:08Z","snapshot_observed_at":"2026-08-07T08:16:48.418429Z","submitted_at":"2026-03-10T22:49:46Z","title":"From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T23:46:32.301737Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2603.10263"},"observation_digest":"sha256:2c4aa785e683109674525dad167a1daf4cc8119006778c638b037d2f8f50cac9","observation_id":"e72ba1c7-d96b-452b-88d1-1d6dfddec020","resolution":{"observed_at":"2026-07-14T23:46:32.301737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-13T13:17:06.175932Z","title":"Flow matching policy gradients,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03531","last_updated":"2026-04-04T00:30:43Z","snapshot_observed_at":"2026-08-08T05:26:58.057935Z","submitted_at":"2026-04-04T00:30:43Z","title":"Genuine pair density wave order on the kagome lattice","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T13:17:06.175932Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2604.03531"},"observation_digest":"sha256:e218a81e51eda79f482293230600811f422c851e3ca98f9c4108f1053bbf54bb","observation_id":"4dbeea93-a4ba-4039-aa29-189b66e09596","resolution":{"observed_at":"2026-07-13T13:17:06.175932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2604.06916","last_updated":"2026-04-08T10:14:47Z","snapshot_observed_at":"2026-07-06T22:55:15.791334Z","submitted_at":"2026-04-08T10:14:47Z","title":"FP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scaling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T18:10:06.994557Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2604.06916"},"observation_digest":"sha256:25f24e47517c460fba1a49cbfde02dbf8d35ef204222c6e1f310c56cc54bfa49","observation_id":"81cc340c-653a-4b55-88ec-34322423e827","resolution":{"observed_at":"2026-05-11T05:21:08.590825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2604.16519","last_updated":"2026-04-15T17:01:10Z","snapshot_observed_at":"2026-08-03T23:47:52.459462Z","submitted_at":"2026-04-15T17:01:10Z","title":"Positive-Only Drifting Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T13:22:55.408035Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2604.16519"},"observation_digest":"sha256:a91d1d353c286ee0d9a7d3c9f8f3e35bc6a5541c9cf32d04c227c75d211e6e7b","observation_id":"e789f086-ded3-4079-b850-39e5af030598","resolution":{"observed_at":"2026-05-10T13:25:26.373715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2604.23380","last_updated":"2026-04-25T17:03:21Z","snapshot_observed_at":"2026-07-06T23:09:38.799345Z","submitted_at":"2026-04-25T17:03:21Z","title":"V-GRPO: Online Reinforcement Learning for Denoising Generative Models Is Easier than You Think","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T08:27:17.629238Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2604.23380"},"observation_digest":"sha256:048459ec0184b1fca4928e8af69c93caa16f1e7967f4e77efc35e7fee1dc23e5","observation_id":"4cd40595-a073-464a-baad-2aefc12f74a9","resolution":{"observed_at":"2026-05-11T20:36:11.462900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":1},"reference_index":161,"source":"arxiv_source","source_observed_at":"2026-05-08T18:48:56.075160Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:17f70f5212468d9418770742d0520b3247f729efb7bdd293fdf8dd869e286250","observation_id":"99dd1daf-654c-4afd-9632-0e9e5074a3c9","resolution":{"observed_at":"2026-05-09T06:10:42.364053Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:a081bbe7d8228e9ba6cba1b670335ba195fd278619eef04772508ffa60fa506d","observation_id":"d1f51504-4b4f-4ca0-9bee-40f1946ef096","resolution":{"observed_at":"2026-07-01T00:05:09.701041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2605.08733","last_updated":"2026-05-09T06:36:32Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T06:36:32Z","title":"Generative Actor-Critic with Soft Bridge Policies","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:08.896356Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2605.08733"},"observation_digest":"sha256:d426443a91025788efe17805fd0ea8c5519b4be4b49a0aae38d286e27bd6560e","observation_id":"7b1ba904-5f14-4f41-a195-a8a8dd17e79b","resolution":{"observed_at":"2026-05-12T06:46:28.323897Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2605.08879","last_updated":"2026-05-19T10:05:30Z","snapshot_observed_at":"2026-08-11T09:12:27.622510Z","submitted_at":"2026-05-09T10:59:03Z","title":"Preserving Foundational Capabilities in Flow-Matching VLAs through Conservative SFT","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T01:31:33.829939Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2605.08879"},"observation_digest":"sha256:20af527085fb6411830fd611e669b2c95f569b87bc77fe5e5076dffd8db247fe","observation_id":"9c0034ed-4c0b-4de1-abd3-a6314507a6c2","resolution":{"observed_at":"2026-05-12T07:56:27.215226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2605.08879","last_updated":"2026-05-19T10:05:30Z","snapshot_observed_at":"2026-08-11T09:12:27.622510Z","submitted_at":"2026-05-09T10:59:03Z","title":"Preserving Foundational Capabilities in Flow-Matching VLAs through Conservative SFT","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T23:08:30.205397Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2605.08879"},"observation_digest":"sha256:0eefb43ccf76709cb5834bebb6f2a36cf487501085366bd42dba1456c882849f","observation_id":"525ed746-329f-4c0b-8e25-a99392d0698d","resolution":{"observed_at":"2026-05-20T23:09:12.123481Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2605.10821","last_updated":"2026-07-16T12:45:34Z","snapshot_observed_at":"2026-08-11T09:53:44.063531Z","submitted_at":"2026-05-11T16:37:34Z","title":"UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:43.222818Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2605.10821"},"observation_digest":"sha256:4780cebc73c5ed31e2f2285a2aa6457f32b7a97d84e2b99af8254dcaf38544eb","observation_id":"9925d1a7-0a26-4370-9f8d-a360209d5528","resolution":{"observed_at":"2026-05-12T06:36:25.470250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-08-02T14:26:02.424496Z","title":"Flow matching policy gradients.arXiv preprint arXiv:2507.21053, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.10821","last_updated":"2026-07-16T12:45:34Z","snapshot_observed_at":"2026-08-11T09:53:44.063531Z","submitted_at":"2026-05-11T16:37:34Z","title":"UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T14:26:02.424496Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2605.10821"},"observation_digest":"sha256:a742f510ebb73154c15a1c2e9c5099a25a763cb4e93902b42bb2e8d407af2562","observation_id":"26ebde54-747a-4775-b632-bda0ab5f1f03","resolution":{"observed_at":"2026-08-02T14:26:02.424496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2605.12379","last_updated":"2026-05-12T16:44:02Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T16:44:02Z","title":"Discrete Flow Matching for Offline-to-Online Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-13T05:48:40.468890Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2605.12379"},"observation_digest":"sha256:6528c2171a32fca82439a1e60fbc6099820338da97fdb410b87cb5dfbd7e122a","observation_id":"011018f0-67a2-453d-8fcf-545ddeb72532","resolution":{"observed_at":"2026-05-13T05:52:22.645847Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2605.12625","last_updated":"2026-05-14T17:58:42Z","snapshot_observed_at":"2026-07-06T23:24:18.302402Z","submitted_at":"2026-05-12T18:10:19Z","title":"Driving Intents Amplify Planning-Oriented Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T20:50:14.602822Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2605.12625"},"observation_digest":"sha256:c0ba1672748b9c3d50e5efa94cb56b30b1c15d15554e98fca39c93ef5a966807","observation_id":"9f39d2f9-dc00-49a1-b84e-4f54eec339d3","resolution":{"observed_at":"2026-05-14T20:52:58.816678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2605.12625","last_updated":"2026-05-14T17:58:42Z","snapshot_observed_at":"2026-07-06T23:24:18.302402Z","submitted_at":"2026-05-12T18:10:19Z","title":"Driving Intents Amplify Planning-Oriented Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T04:58:07.943615Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2605.12625"},"observation_digest":"sha256:0f516c6a26e2068bb3203eacbd747468bd21d185b60b0382ed1e29aebb13b64b","observation_id":"49869b54-f9c1-4f88-acf4-a3fed8f6ad0f","resolution":{"observed_at":"2026-05-15T04:59:45.635819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2605.15458","last_updated":"2026-05-14T22:40:56Z","snapshot_observed_at":"2026-08-01T23:49:14.751351Z","submitted_at":"2026-05-14T22:40:56Z","title":"Video Models Can Reason with Verifiable Rewards","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T15:03:14.894952Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2605.15458"},"observation_digest":"sha256:46ff6b2179ea7a980616b251b898239583dc84f728a30698967a06683ab3223a","observation_id":"bb8ed032-0dba-404a-86d1-d4871142448b","resolution":{"observed_at":"2026-05-19T15:07:37.118524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2605.17295","last_updated":"2026-05-17T07:14:44Z","snapshot_observed_at":"2026-08-05T14:05:32.700721Z","submitted_at":"2026-05-17T07:14:44Z","title":"DISA: Offline Importance Sampling for Distribution-Matching LLM-RL","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-20T15:11:43.235574Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2605.17295"},"observation_digest":"sha256:d55bf578cd4b62ef05a8e6684bbab4f167f24d27145cc9e9c8f31d67b692df46","observation_id":"6a075063-c23c-48ff-97fe-63a7d6b107a0","resolution":{"observed_at":"2026-05-20T15:13:24.894272Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2605.19294","last_updated":"2026-05-19T03:14:11Z","snapshot_observed_at":"2026-08-05T00:30:56.507952Z","submitted_at":"2026-05-19T03:14:11Z","title":"DEFLECT: Delay-Robust Execution via Flow-matching Likelihood-Estimated Counterfactual Tuning for VLA Policies","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T06:03:24.963347Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2605.19294"},"observation_digest":"sha256:3bc0dde5401eb6074a40d8d940e190e2255c5dd0679746d56deeb83907fd3978","observation_id":"23dc9362-165e-4fa4-94e4-ee0bd0bbce84","resolution":{"observed_at":"2026-05-20T06:08:05.161093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2605.27095","last_updated":"2026-06-01T11:46:42Z","snapshot_observed_at":"2026-08-06T05:19:12.135756Z","submitted_at":"2026-05-26T14:38:03Z","title":"Adversarial Dual On-Policy Distillation from Expressive Teacher","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T18:55:23.777484Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2605.27095"},"observation_digest":"sha256:2c77faec1059bf1d66a2e61543ef00893c5f60bc9347e70a0f53eb6223df6021","observation_id":"c6dda188-44b6-40bd-b964-c8790ddc3744","resolution":{"observed_at":"2026-06-29T19:03:51.548209Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2605.27736","last_updated":"2026-05-26T22:20:51Z","snapshot_observed_at":"2026-08-02T16:25:15.479630Z","submitted_at":"2026-05-26T22:20:51Z","title":"Explicit Critic Guidance for Aligning Diffusion Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T18:18:46.456767Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2605.27736"},"observation_digest":"sha256:edd446e7fd4cff2fe767d845b883b299cb108e87ebc7e6a9f14c4faaaa858da5","observation_id":"ba7332b4-aa86-4a3a-93fe-e8b92efd1677","resolution":{"observed_at":"2026-06-29T18:23:50.779099Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2605.29398","last_updated":"2026-05-28T05:47:40Z","snapshot_observed_at":"2026-07-06T23:38:51.349968Z","submitted_at":"2026-05-28T05:47:40Z","title":"GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T08:44:53.969301Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2605.29398"},"observation_digest":"sha256:f4254b126de4a6a837e702359f58ad10c5f7d492da6aa12325f0f0d4cd66dd95","observation_id":"6f5d792f-788b-4217-9a3c-f27b0434a31c","resolution":{"observed_at":"2026-06-29T08:53:16.380720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2605.30056","last_updated":"2026-05-28T15:07:50Z","snapshot_observed_at":"2026-08-07T01:38:25.069332Z","submitted_at":"2026-05-28T15:07:50Z","title":"Sample-Efficient Diffusion-based Reinforcement Learning with Critic Guidance","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T07:21:56.382343Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2605.30056"},"observation_digest":"sha256:8d23590ac78d7519a6a90f696ec8b3f426da46168abf7c71321b5f28747561ad","observation_id":"dfe8937c-42c2-4882-a823-a84fba206635","resolution":{"observed_at":"2026-06-29T07:23:12.574209Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2606.06967","last_updated":"2026-06-05T06:54:09Z","snapshot_observed_at":"2026-07-06T23:46:42.693840Z","submitted_at":"2026-06-05T06:54:09Z","title":"GenPO++: Generative Policy Optimization with Jacobian-free Likelihood Ratios","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T22:47:10.062975Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2606.06967"},"observation_digest":"sha256:1bc4f0d00530dcf030d9e2dd5bec97fc8bd2b4d2af4a2b7875250741f1255b99","observation_id":"0fefc763-7a47-4966-a122-eddd48ef2301","resolution":{"observed_at":"2026-07-02T16:27:08.566580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2606.11087","last_updated":"2026-06-09T16:45:57Z","snapshot_observed_at":"2026-08-02T20:45:09.177143Z","submitted_at":"2026-06-09T16:45:57Z","title":"Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T14:05:01.073951Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2606.11087"},"observation_digest":"sha256:1d6fa31d1f54577b873eae05eb79c4b2ee519aa2796bb85ec77e9d94a90407ca","observation_id":"54dff922-423a-4c63-9fd8-c2dc04662816","resolution":{"observed_at":"2026-07-03T04:17:36.910495Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2606.13795","last_updated":"2026-06-17T17:53:46Z","snapshot_observed_at":"2026-08-02T18:47:04.849043Z","submitted_at":"2026-06-11T18:06:04Z","title":"DiPOD: Diffusion Policy Optimization without Drifting Apart","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T07:06:28.426709Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2606.13795"},"observation_digest":"sha256:24bb4892ac27869e18e87cce5c773711aa02689fe62bac1c7c196ffec5559e62","observation_id":"644ab85c-d687-4f57-9b97-ce1248b4bbbe","resolution":{"observed_at":"2026-07-03T14:18:22.932973Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2606.15516","last_updated":"2026-06-17T19:44:13Z","snapshot_observed_at":"2026-07-06T23:52:32.998232Z","submitted_at":"2026-06-14T00:01:36Z","title":"Transferring Contact, Not Just Motion: Compliant Grasping Across Dexterous Hands","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T04:43:54.248289Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2606.15516"},"observation_digest":"sha256:aad403975a466696c9e132c842ac498fbf7c78b5f26972b65e5fbfae0b67cb70","observation_id":"3084d04a-393b-4e9c-802a-4c0bc3245ad7","resolution":{"observed_at":"2026-07-03T16:58:43.312220Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:9b71b0bd2d056d48285fb68ff78dca7c681d45d7b373e6a67935ebdd108ce1f3","observation_id":"7ec13d94-630e-4ff1-9b03-e26a0bba8df9","resolution":{"observed_at":"2026-07-04T06:19:37.773920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2606.27475","last_updated":"2026-06-25T18:52:27Z","snapshot_observed_at":"2026-08-02T12:36:42.748876Z","submitted_at":"2026-06-25T18:52:27Z","title":"Support-Constrained RL Enables Real-World Policy Improvement without Real-World Experience","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T01:57:04.293058Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2606.27475"},"observation_digest":"sha256:faaa657482a462f213603707e0cbfe98e7b6a78e18af1e4105452c5e7678ff25","observation_id":"ac6772b6-e3e0-4d8e-909f-058b20597375","resolution":{"observed_at":"2026-07-01T18:25:58.769831Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-08-02T01:33:13.452711Z","title":"Flow matching policy gradients,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14643","last_updated":"2026-07-16T07:10:46Z","snapshot_observed_at":"2026-08-03T05:13:44.457321Z","submitted_at":"2026-07-16T07:10:46Z","title":"NavCMPO: Critic-Guided MeanFlow Policy Optimization for Adaptive Navigation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T01:33:13.452711Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2607.14643"},"observation_digest":"sha256:039f9ee005283ab999bde57e2e2008f7868345cea8325b17f24698688b72b578","observation_id":"43635d58-6a0a-4d67-88f2-cebaaff81699","resolution":{"observed_at":"2026-08-02T01:33:13.452711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-08-01T20:30:43.078545Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16602","last_updated":"2026-07-21T07:58:44Z","snapshot_observed_at":"2026-08-10T13:52:37.918911Z","submitted_at":"2026-07-18T02:42:27Z","title":"PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action Exploration","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T20:30:43.078545Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2607.16602"},"observation_digest":"sha256:a2d6c1e389b27da986c30660e12ad44fad84aeb5fe372360a8d23776eb337d37","observation_id":"fe9cea05-9176-457a-a327-ee2baa00f1af","resolution":{"observed_at":"2026-08-01T20:30:43.078545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-08-01T15:26:40.667700Z","title":"McAllister, D.; Ge, S.; Yi, B.; Kim, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26460","last_updated":"2026-07-29T04:22:46Z","snapshot_observed_at":"2026-08-11T02:07:19.398050Z","submitted_at":"2026-07-29T04:22:46Z","title":"RLMM-Flow: A Flow-based Mobile Manipulation Framework with Latent-Space Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T15:26:40.667700Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2607.26460"},"observation_digest":"sha256:42643f57b771df100f1a62c3b42a5d7dde01bbf9ee0afea9c8039a6bd3f31495","observation_id":"dda17a4b-e2c0-45c6-b9ca-5f0cc6d45e4f","resolution":{"observed_at":"2026-08-01T15:26:40.667700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-08-06T20:50:11.728877Z","title":"Flow matching policy gradients,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04612","last_updated":"2026-08-05T09:18:16Z","snapshot_observed_at":"2026-08-11T10:38:10.427360Z","submitted_at":"2026-08-05T09:18:16Z","title":"GASP: GPU-Accelerated Safe Planner for Real-Time Collision-Aware Motion Generation with Latent Trajectory Sampling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:11.728877Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2608.04612"},"observation_digest":"sha256:695f72367051f6a3249b9e98567d63742d62c8942fa3c2360572d5977f60bb1b","observation_id":"5869d352-9738-41ae-8acc-8e07dbfb20cf","resolution":{"observed_at":"2026-08-06T20:50:11.728877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.21053/citation-record","integrity":"/paper/2507.21053/integrity","json":"/paper/2507.21053/citation-record.json","paper":"/paper/2507.21053"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T13:07:09.474916Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.474916Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:be4dd6ea8e4626d51356639c5179be86ea41600e3d4f387ada417a35eecb9f16","observation_id":"7d48a4f4-865f-4fbc-80ec-061b0d8d4127","resolution":{"observed_at":"2026-08-06T13:07:09.474916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:09.479145Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.479145Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:3733551e7c9578deb2325141e71b602de388e688708870551d957f77149d1b89","observation_id":"1cf0b7e5-1090-468e-92ec-5c429fda7fe1","resolution":{"observed_at":"2026-08-06T13:07:09.479145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:09.485898Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.485898Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:037ba38767747414133acd044205334f0f73f1da0ae58225bfd4efdfe5308677","observation_id":"17e532ea-88af-460f-b415-c19b93531e5b","resolution":{"observed_at":"2026-08-06T13:07:09.485898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-10T21:41:31.247717Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T13:07:09.488679Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.488679Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:7ab92527eaaf607dd11729980c6187486aa33c4c608a538eaa581332a8901696","observation_id":"73329125-5b0e-4757-a629-9c0b07f1bb92","resolution":{"observed_at":"2026-08-06T13:07:09.488679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:09.492400Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.492400Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:fe16940a78a7703c692873432d5380ae0a876281d88e5cbbc013cf5073f6b036","observation_id":"080afe53-3d90-4311-80d9-af33d5eb7f3a","resolution":{"observed_at":"2026-08-06T13:07:09.492400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T13:07:09.495265Z","title":"Plumbley","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.495265Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:e0082c7011eff5a981061f005ccb3ceadd91053dcd655c3c808358b08302d337","observation_id":"511d80a0-aa90-46af-93dc-954e0950af30","resolution":{"observed_at":"2026-08-06T13:07:09.495265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09761","last_updated":"2021-03-30T19:48:38Z","snapshot_observed_at":"2026-07-06T09:57:19.117228Z","submitted_at":"2020-09-21T11:20:38Z","title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09761","snapshot_observed_at":"2026-08-06T13:07:09.498444Z","title":"Diffwave: A versatile diffusion model for audio synthesis, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.498444Z"},"links":{"cited_paper":"/paper/2009.09761","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:79340de704c5e28f92de5c8bd67cfc30f3658f11eac284dfcc7996e8d32d853e","observation_id":"9bb4e091-57f8-4c23-8170-c196d80b0b7d","resolution":{"observed_at":"2026-08-06T13:07:09.498444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18506","last_updated":"2025-06-26T15:59:16Z","snapshot_observed_at":"2026-08-07T15:59:08.443646Z","submitted_at":"2025-04-25T17:17:17Z","title":"Action-Minimization Meets Generative Modeling: Efficient Transition Path Sampling with the Onsager-Machlup Functional","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18506","snapshot_observed_at":"2026-08-06T13:07:09.505195Z","title":"Action-minimization meets generative modeling: Efficient transition path sampling with the onsager-machlup functional","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.505195Z"},"links":{"cited_paper":"/paper/2504.18506","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:6b62cf622fdabbd71fd4dfee1221e8543c6904d4af9d2d9ff0e4a0801d5c5ec8","observation_id":"1b9295c3-0ca0-42bb-bc66-3eeb1c3d8dbc","resolution":{"observed_at":"2026-08-06T13:07:09.505195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-06T13:07:09.508045Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.508045Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:c368e45f347a1d1b29dda66ca53f97b7cac5266410a2d0ef0cca27305bc8acff","observation_id":"87d264a7-87e9-4ca4-9188-a11c629ce240","resolution":{"observed_at":"2026-08-06T13:07:09.508045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-06T13:07:09.511165Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.511165Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:659449c80244c165cbb1b9201f9836108377bb2e44049ee58bbb8491904c016a","observation_id":"2e2ad645-3fe4-42bc-8729-bdd904b89985","resolution":{"observed_at":"2026-08-06T13:07:09.511165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-06T13:07:09.513926Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.513926Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:297d0d9471e4c74728180f2fdd17a01304db897bad364cbae94fd5e06cb16e63","observation_id":"859eba96-90f8-4d58-a110-993b68a50282","resolution":{"observed_at":"2026-08-06T13:07:09.513926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08844","last_updated":"2025-02-12T23:30:01Z","snapshot_observed_at":"2026-08-07T23:27:22.713894Z","submitted_at":"2025-02-12T23:30:01Z","title":"MuJoCo Playground","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08844","snapshot_observed_at":"2026-08-06T13:07:09.516529Z","title":"Mujoco playground","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.516529Z"},"links":{"cited_paper":"/paper/2502.08844","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:ed1a29fa05d1506f2bb641462d22f21443245a802d6303b668c18b04a27105a6","observation_id":"91c46414-c837-4d29-8744-b3125bb80fa6","resolution":{"observed_at":"2026-08-06T13:07:09.516529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.643500Z","title":"Sutton, David McAllester, Satinder P","venue":null,"work_id":"03bb1610-9c8e-4450-95df-ed689aa3f6a9","year":1999},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.519371Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:563466aa049c7467c1e1c2f2d6f9393c3f3079b04bd97291a7cf6b14744512fd","observation_id":"21c31ee7-1365-45fa-aa20-5e285033cb70","resolution":{"observed_at":"2026-08-06T13:07:10.647015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.633257Z","title":"Simple statistical gradient-following algorithms for connectionist reinforce- ment learning","venue":null,"work_id":"49cc4b58-de34-40f4-9f29-76a196c3fff6","year":1992},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.522696Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:4bcbf99227734b1bf52c74a427d1fe453f76d774e37f93e6df519d3c3310a735","observation_id":"48973bbe-0726-4fad-833d-1556a987a731","resolution":{"observed_at":"2026-08-06T13:07:10.636777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.623855Z","title":null,"venue":null,"work_id":"70f68895-4e6d-480f-9d74-f896c60984ad","year":2002},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.526084Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:36486d97241c612816053db5cbbea5fac25010f4eff0e8795caab5a2188ae28f","observation_id":"0c314530-806c-4eb5-9392-de4e099117ec","resolution":{"observed_at":"2026-08-06T13:07:10.627228Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.612350Z","title":"Natural actor–critic","venue":null,"work_id":"f0fac6e3-7921-4e52-bfae-e8b225dada77","year":2008},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.529159Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:b785132e971224b34940fe9b8a19ea97425c27ebf7cdfdf579ca36d192f12f47","observation_id":"495be691-4082-452c-aa65-6fa5c7ccfafb","resolution":{"observed_at":"2026-08-06T13:07:10.615614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.600704Z","title":"Trust region policy optimization","venue":null,"work_id":"4d3e836b-c642-4128-a1bb-68f56b873949","year":2015},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.532677Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:22120cd9f19840af37801b48c0b5ab3bc514b63313764a065ac7cf9ce35c9f1b","observation_id":"c942879b-aa84-40dc-8ebe-48948c74ef51","resolution":{"observed_at":"2026-08-06T13:07:10.604985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T13:07:09.535762Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.535762Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:b0d851ea9638121d82085b455826dfa8eeee99ea5923a5bc6c0f2f8259e21fac","observation_id":"186eca33-80ff-48ef-bf90-69f4bacada81","resolution":{"observed_at":"2026-08-06T13:07:09.535762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.590033Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":"3c247115-9d64-46b1-98af-059cbdc9f785","year":1928},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.538837Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:3a71c4bd9801da37c9c9e9f6e683b9c21ee85387dbc1d3c070422a961b34aea2","observation_id":"3ba1e354-460b-4978-8393-5be06c232d93","resolution":{"observed_at":"2026-08-06T13:07:10.592842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.577972Z","title":"Sample efficient actor–critic with experience replay","venue":null,"work_id":"7b5d4600-3418-4c75-8917-8c6a7332c51d","year":2016},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.542629Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:d4cf22ffad3fea13b6b6228894fa1f4a5ef0f11f0c16b6ef8c898e277a5dd5f8","observation_id":"ed193931-a53c-4b6b-a351-c52365a42aea","resolution":{"observed_at":"2026-08-06T13:07:10.581050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T13:07:09.545715Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.545715Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:4cc6c3a6e8f29c8472be5d97dcdbd990ca325e87bc04df2a6ef225535963c067","observation_id":"c982a532-ee28-4f22-a50f-5a19931f6c5e","resolution":{"observed_at":"2026-08-06T13:07:09.545715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.567240Z","title":"Benchmarking deep reinforcement learning for continuous control","venue":null,"work_id":"2993c3e9-2151-4513-b74d-e4cd6a2977f7","year":2016},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.548913Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:8108aeb5aa894e8a151ff45be5458b657ed9eb16ae8651fc82244df7a889543f","observation_id":"779f8cd8-dee5-4ecc-a2e7-4e9df2984d21","resolution":{"observed_at":"2026-08-06T13:07:10.570353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03046","last_updated":"2024-02-05T14:32:00Z","snapshot_observed_at":"2026-08-10T00:58:27.575137Z","submitted_at":"2024-02-05T14:32:00Z","title":"Open RL Benchmark: Comprehensive Tracked Experiments for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03046","snapshot_observed_at":"2026-08-06T13:07:09.551956Z","title":"Open rl benchmark: Comprehensive tracked experiments for reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.551956Z"},"links":{"cited_paper":"/paper/2402.03046","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:9345284c763ff8dc213443b0d01b683ac9dc845356ea3a6530c04190551bd30e","observation_id":"86d4becd-bdb6-4f38-a85a-ec1a24722036","resolution":{"observed_at":"2026-08-06T13:07:09.551956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.557715Z","title":"Learning to walk in minutes using massively parallel deep reinforcement learning","venue":null,"work_id":"5aba0d66-b8dd-4a51-9802-da4f41f533f0","year":2022},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.554808Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:8bae7ede4220e5534bab5f50145109133c9e429d59fbe168866bec4fe476c080","observation_id":"7708fd5f-4d27-4671-9520-997b8c14c45d","resolution":{"observed_at":"2026-08-06T13:07:10.561389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.546827Z","title":"Curiosity-driven learning of joint locomotion and manipulation tasks","venue":null,"work_id":"8185fe45-6b63-4ff1-bb47-e2684312b839","year":null},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.557355Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:f29f0a2e6ab1447bd55dc0fb19229c14b8346be4e7376b97beec5b37291c51ad","observation_id":"e1edfbab-7162-44f1-97f3-925e696e1a8f","resolution":{"observed_at":"2026-08-06T13:07:10.550166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:09.560136Z","title":"Sym- metry considerations for learning task symmetric robot policies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.560136Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:cfee8173a5e4394970e4a63382295aa348b01c433af6fd2a0acf6fa5ac4805c8","observation_id":"c475e2b2-e639-485c-9083-183f583662c2","resolution":{"observed_at":"2026-08-06T13:07:09.560136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03729","last_updated":"2025-08-29T05:22:52Z","snapshot_observed_at":"2026-08-11T00:04:22.977278Z","submitted_at":"2025-05-06T17:57:12Z","title":"Visual Imitation Enables Contextual Humanoid Control","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03729","snapshot_observed_at":"2026-08-06T13:07:09.563148Z","title":"Visual imitation enables contextual humanoid control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.563148Z"},"links":{"cited_paper":"/paper/2505.03729","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:cfd35c670f3b5791fdab018250750c85dd80205baba0b3abdad246c4aacaa26b","observation_id":"3e435712-f0cc-4ace-a2c4-196104c75814","resolution":{"observed_at":"2026-08-06T13:07:09.563148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07113","last_updated":"2019-10-16T00:59:05Z","snapshot_observed_at":"2026-08-02T15:37:37.200292Z","submitted_at":"2019-10-16T00:59:05Z","title":"Solving Rubik's Cube with a Robot Hand","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07113","snapshot_observed_at":"2026-08-06T13:07:09.566118Z","title":"Solving rubik’s cube with a robot hand","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.566118Z"},"links":{"cited_paper":"/paper/1910.07113","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:1fcff9cd39a1a4feeff7daa59322b5bea976a81ea9102d47f44af9fbe5649976","observation_id":"4d984d50-21bc-48ce-b02e-5150c11eec4a","resolution":{"observed_at":"2026-08-06T13:07:09.566118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.536957Z","title":"A system for general in-hand object re-orientation","venue":null,"work_id":"8111bcd3-1e54-4937-9dec-12e5f4326305","year":2021},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.569282Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:ec9370193e1b07e49ba8639e6294dae12ccf570f02c40516d83a838efeec4431","observation_id":"cb9b6c92-0a5f-437c-94b8-78b23ddef145","resolution":{"observed_at":"2026-08-06T13:07:10.540286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:09.572868Z","title":"General in-hand object rotation with vision and touch","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.572868Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:8e49b58bbef76dfcb7ffc65fd44c1aed2956348e2dc0a2213ec24e7920547a03","observation_id":"8dd4c96f-4605-421d-b162-cc0972a884a1","resolution":{"observed_at":"2026-08-06T13:07:09.572868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05439","last_updated":"2025-01-09T18:49:39Z","snapshot_observed_at":"2026-08-10T21:10:43.691721Z","submitted_at":"2025-01-09T18:49:39Z","title":"From Simple to Complex Skills: The Case of In-Hand Object Reorientation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05439","snapshot_observed_at":"2026-08-06T13:07:09.575849Z","title":"From simple to complex skills: The case of in-hand object reorientation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.575849Z"},"links":{"cited_paper":"/paper/2501.05439","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:e3c554dfd4be8c59703f127b263c5bc180319e0546ae007dd35fbd066c242343","observation_id":"19f2bce2-c743-464c-a611-e38be38635cb","resolution":{"observed_at":"2026-08-06T13:07:09.575849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.519460Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"47bc0426-8c6c-457b-8eb8-43edebf4bca2","year":2022},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.579022Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:773eb709c384969a9ba2bbb89c08ed5a8089fd44f8c62cd491dccf85afd5b382","observation_id":"3a61accb-3afc-4990-b998-80ffce8087cf","resolution":{"observed_at":"2026-08-06T13:07:10.522784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03741","last_updated":"2023-02-17T17:00:34Z","snapshot_observed_at":"2026-08-03T14:31:51.401500Z","submitted_at":"2017-06-12T17:23:59Z","title":"Deep reinforcement learning from human preferences","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03741","snapshot_observed_at":"2026-08-06T13:07:09.582589Z","title":"Brown, Miljan Martic, Shane Legg, and Dario Amodei","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.582589Z"},"links":{"cited_paper":"/paper/1706.03741","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:37b4249d0d7b4d6c10de1aecd7e9fd9748000e4d3f3057326204fb0b80d73350","observation_id":"b146a6b7-6b72-4676-aab7-f1e09d02b197","resolution":{"observed_at":"2026-08-06T13:07:09.582589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T13:07:09.585305Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.585305Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:1e469143d282cc0edd9ba6e42b899b3bec2b9cd02270d3b6b0f1010ec77c7a06","observation_id":"cfcbdff0-fef5-443f-91e4-606972a019ad","resolution":{"observed_at":"2026-08-06T13:07:09.585305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-06T13:07:09.588485Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.588485Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:8b70a146a3f68cb454b72b322a05a0f38b954506287e1348edc3ec22d5cfa801","observation_id":"b779c2bb-1bff-4a9e-b9c9-72297ed03027","resolution":{"observed_at":"2026-08-06T13:07:09.588485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.509250Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"ef04efb4-e839-44c5-bd44-7be56978b4c3","year":2020},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.592235Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:da41d48ce2ed16e0d56652b61a47758ca16d94ed10fb9d3f2b65a2d19aaa93aa","observation_id":"b06b7f54-55a3-4150-b4f2-20e4844256e6","resolution":{"observed_at":"2026-08-06T13:07:10.512063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T13:07:09.595323Z","title":"Denoising diffusion implicit models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.595323Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:81eeb36be40e32bbe28883a25f04778b83f1e74925403e0f79f59b10f3463e9d","observation_id":"01d1919f-4302-4b1d-a44d-c47cee24c712","resolution":{"observed_at":"2026-08-06T13:07:09.595323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-06T13:07:09.598137Z","title":"High- resolution image synthesis with latent diffusion models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.598137Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:8196940f09c0b6692c5a5a75d305e90bbdce8339dcbc830a6dbbfbdbc2f047d2","observation_id":"0a6b6828-98b8-461b-9a8a-6c3a8c510549","resolution":{"observed_at":"2026-08-06T13:07:09.598137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.05600","last_updated":"2020-10-10T07:46:19Z","snapshot_observed_at":"2026-08-01T16:44:46.833530Z","submitted_at":"2019-07-12T07:37:26Z","title":"Generative Modeling by Estimating Gradients of the Data Distribution","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.05600","snapshot_observed_at":"2026-08-06T13:07:09.601546Z","title":"Generative modeling by estimating gradients of the data distribution, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.601546Z"},"links":{"cited_paper":"/paper/1907.05600","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:590482177fcc5fb2af93979168331c36e66487347d03764591cca46e6aee6eb4","observation_id":"7fb39a58-50c2-4bed-a7a2-d05067b99914","resolution":{"observed_at":"2026-08-06T13:07:09.601546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03458","last_updated":"2022-06-22T20:22:29Z","snapshot_observed_at":"2026-07-06T12:57:51.108636Z","submitted_at":"2022-04-07T14:08:02Z","title":"Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03458","snapshot_observed_at":"2026-08-06T13:07:09.604328Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.604328Z"},"links":{"cited_paper":"/paper/2204.03458","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:1c0076ce9b5372cf779af5a0a4a2389238a2b92caf80d0b83758431648579554","observation_id":"c3cf78de-b476-405f-97bd-ea912929706c","resolution":{"observed_at":"2026-08-06T13:07:09.604328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-06T13:07:09.607246Z","title":"Make-a-video: Text-to-video generation without text-video data, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.607246Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:357b002450142bff20ada0847530870a024e6f98ff95004746876ea393f438b7","observation_id":"7e4e6e22-3ebc-4df0-9ec2-109cfb748b9a","resolution":{"observed_at":"2026-08-06T13:07:09.607246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-06T13:07:09.610022Z","title":"Kingma, Ben Poole, Mohammad Norouzi, David J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.610022Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:bbe662a4dfbc76d0e4779d72efefbb5dccc04c43f95f35e87d203038d604b9ed","observation_id":"39b0b94b-6eab-4796-b043-c23cc67f78b6","resolution":{"observed_at":"2026-08-06T13:07:09.610022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.06337","last_updated":"2021-08-05T10:06:27Z","snapshot_observed_at":"2026-08-01T08:27:05.131772Z","submitted_at":"2021-05-13T14:47:44Z","title":"Grad-TTS: A Diffusion Probabilistic Model for Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.06337","snapshot_observed_at":"2026-08-06T13:07:09.612846Z","title":"Grad- tts: A diffusion probabilistic model for text-to-speech, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.612846Z"},"links":{"cited_paper":"/paper/2105.06337","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:c1e198259ac92a0f18266c55fcbef6c63a90eabe4388c71930e820ce9cb2ba98","observation_id":"90ec9298-fd08-447f-b4cc-4535480966b8","resolution":{"observed_at":"2026-08-06T13:07:09.612846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09660","last_updated":"2021-06-19T01:47:11Z","snapshot_observed_at":"2026-08-11T01:10:30.784128Z","submitted_at":"2021-06-17T17:09:21Z","title":"WaveGrad 2: Iterative Refinement for Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2106.09660","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.09660","snapshot_observed_at":"2026-08-06T13:07:10.016014Z","title":"WaveGrad 2: Iterative Refinement for Text-to-Speech Synthesis","venue":"eess.AS","work_id":"2f1d61a2-5c3d-451c-9639-a357cc2ff0e2","year":2021},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.615625Z"},"links":{"cited_paper":"/paper/2106.09660","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:545ad3cdb2575a53584ab70cf5a099afb0472c1fba424135e387734079d95b73","observation_id":"29b9bb6b-7f80-42a5-9a3c-dfe1a2e48497","resolution":{"observed_at":"2026-08-06T13:07:10.021511Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T13:07:09.618360Z","title":"π0: A vision-language-action flow model for general robot control, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.618360Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:fa1148cd6df5219ef8a49da462b7447cd6d99e562af2dac55c87f7547fa84dcd","observation_id":"0ce2233f-4dad-46fa-b9aa-660cf115acc1","resolution":{"observed_at":"2026-08-06T13:07:09.618360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-06T13:07:09.621887Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.621887Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:412ae4507513ae51343f427084a008717c59d5b3571d1714450d98ba0f7d819b","observation_id":"2c11213d-6d19-4863-9189-f602f75545ad","resolution":{"observed_at":"2026-08-06T13:07:09.621887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17762","last_updated":"2025-02-28T23:00:23Z","snapshot_observed_at":"2026-08-11T05:07:14.742333Z","submitted_at":"2024-12-23T18:18:07Z","title":"The Superposition of Diffusion Models Using the It\\^o Density Estimator","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17762","snapshot_observed_at":"2026-08-06T13:07:09.624787Z","title":"The superposition of diffusion models using the itô density estimator, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.624787Z"},"links":{"cited_paper":"/paper/2412.17762","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:ce1abe8e0e5a56b013806fdb6f49b61430759afc9568b4238af733540e6f519c","observation_id":"f0cf4abc-8f27-431c-87b8-b8669653bb02","resolution":{"observed_at":"2026-08-06T13:07:09.624787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:09.627522Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.627522Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:2e793cd0250325841a3c7f7a55f81c69fe42419740607767d99bf37b4e597af6","observation_id":"c8264315-8621-46be-883f-c88f7f5f9ec6","resolution":{"observed_at":"2026-08-06T13:07:09.627522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.498812Z","title":"Tenenbaum, Tommi S","venue":null,"work_id":"77f0c17d-b5fb-4b60-a95f-6ad7908757c9","year":2023},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.630454Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:7dcbd875f7b17b3a3ec9b443c23f4b0bbfaa738182be34dbc8a1758afe837217","observation_id":"7b275053-1472-4143-81b3-889ac7bbb763","resolution":{"observed_at":"2026-08-06T13:07:10.502803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09991","last_updated":"2022-12-21T01:06:18Z","snapshot_observed_at":"2026-08-06T05:32:02.292779Z","submitted_at":"2022-05-20T07:02:03Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09991","snapshot_observed_at":"2026-08-06T13:07:09.633971Z","title":"Planning with diffusion for flexible behavior synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.633971Z"},"links":{"cited_paper":"/paper/2205.09991","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:c337b823ca6844d0fbffdad935c3137b24dc93dc0885736cd44ca230dfa155cb","observation_id":"609b7561-f021-4622-8c15-a979737e5a3b","resolution":{"observed_at":"2026-08-06T13:07:09.633971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-08-06T13:07:09.636844Z","title":"Aligning text-to-image models using human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.636844Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:4a1146d81db0a010624c675ab4c0302b61c28b8a43ab9171b14082421c59dfd4","observation_id":"72de1d12-188f-43e4-89f4-c072db53ad94","resolution":{"observed_at":"2026-08-06T13:07:09.636844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-09T16:20:23.732146Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-06T13:07:09.639595Z","title":"Training diffusion models with reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.639595Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:fecf11669397da96f748f035a55155e921ce6c76b8b8bd502509330bab78a132","observation_id":"608e9c56-f9b2-4354-8679-a2ae634a744a","resolution":{"observed_at":"2026-08-06T13:07:09.639595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05470","last_updated":"2025-10-27T09:57:02Z","snapshot_observed_at":"2026-08-06T11:11:00.378627Z","submitted_at":"2025-05-08T17:58:45Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05470","snapshot_observed_at":"2026-08-06T13:07:09.642447Z","title":"Flow-grpo: Training flow matching models via online rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.642447Z"},"links":{"cited_paper":"/paper/2505.05470","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:7f3384119736b180f490d5963d618857fa58ee73ff4e032efcc8a775d2a11cb2","observation_id":"1f94d5fb-f315-478a-91bd-91b0b2591b2b","resolution":{"observed_at":"2026-08-06T13:07:09.642447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-09T16:03:36.260214Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-08-06T13:07:09.645809Z","title":"Learning a diffusion model policy from rewards via q-score matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.645809Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:0a553c275aa3bf4473287c3217b4e61b81c0f0ed2335562a23c75fbd2268870f","observation_id":"307a410a-5ad7-4481-83ff-e91af1ade30c","resolution":{"observed_at":"2026-08-06T13:07:09.645809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-09T01:13:58.186473Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-08-06T13:07:09.649092Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.649092Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:29ff75b8a093fde14140f93633c29a25495b6a74b2b749748960d404faa9b0ff","observation_id":"fbdc4bdc-a63f-468e-84ca-2fba47c89ba3","resolution":{"observed_at":"2026-08-06T13:07:09.649092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.09477","last_updated":"2018-10-22T17:37:07Z","snapshot_observed_at":"2026-07-06T06:25:26.844090Z","submitted_at":"2018-02-26T17:54:49Z","title":"Addressing Function Approximation Error in Actor-Critic Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.09477","snapshot_observed_at":"2026-08-06T13:07:09.652056Z","title":"Addressing function approximation error in actor-critic methods, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.652056Z"},"links":{"cited_paper":"/paper/1802.09477","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:1f1994b2d8524e66c50a06c7b11fbc0ab49633af80433a98ba299c5feb1c82a3","observation_id":"ca47697d-98b3-4c1b-bc21-a3ad36d553dc","resolution":{"observed_at":"2026-08-06T13:07:09.652056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-06T13:07:09.655123Z","title":"Diffusion policy policy optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.655123Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:f37f71e6c864739b66e4a833c6c266998d80571c2946f885794bc39c6f5de948","observation_id":"1e583592-7a90-4ece-af9d-ac27cb444553","resolution":{"observed_at":"2026-08-06T13:07:09.655123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-09T23:04:15.431743Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-06T13:07:09.658297Z","title":"High- dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.658297Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:aaaeab47846b2b44ceb0c8591868401544c11d221a620b8d15551d84fe711069","observation_id":"c4a1389d-374d-4b3d-9fda-68b9f397afd1","resolution":{"observed_at":"2026-08-06T13:07:09.658297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.487837Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":"7a1c2313-7e22-4517-8720-15a9e9cf2d08","year":2022},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.661292Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:6c25b41a776a74ef9c96826f023f064393c9d443e0440c5a809ee2a6b9895764","observation_id":"d3c463ad-121d-4b9b-a546-b3314b3a03b5","resolution":{"observed_at":"2026-08-06T13:07:10.491496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:09.664803Z","title":"Kingma, Tim Salimans, Ben Poole, and Jonathan Ho","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.664803Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:4045f79a1fb73b50ef501dfe0453166d24d32cdb9d55deaacd213b43b0534249","observation_id":"4125040b-071b-4473-86bb-994b4fd49c8d","resolution":{"observed_at":"2026-08-06T13:07:09.664803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00848","last_updated":"2023-09-25T21:44:05Z","snapshot_observed_at":"2026-08-06T02:18:52.379205Z","submitted_at":"2023-03-01T22:36:05Z","title":"Understanding Diffusion Objectives as the ELBO with Simple Data Augmentation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00848","snapshot_observed_at":"2026-08-06T13:07:09.671327Z","title":"Kingma and Ruiqi Gao","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.671327Z"},"links":{"cited_paper":"/paper/2303.00848","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:7986b6c6182bbd5225734516302c30d4c073aa149a2a11ae00871194454daabc","observation_id":"f87efa6e-56a4-4dcd-9361-095d50f425f2","resolution":{"observed_at":"2026-08-06T13:07:09.671327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:09.674640Z","title":"Openai gym, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.674640Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:00aacc8f9156d4ac6ce8d35e900f83bb71f85c39fd0509aebf900de061f33bb0","observation_id":"ea5d47b3-29c3-43b5-aa7a-34dd658b3c87","resolution":{"observed_at":"2026-08-06T13:07:09.674640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-06T13:07:09.677389Z","title":"Gymnasium: A standard interface for reinforcement learning environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.677389Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:d77c2dfc6854a576318759f3d598a8be17047cce965a9b15f4eb8d0725820f30","observation_id":"781d152e-9e66-45d5-ae39-c03650a189a4","resolution":{"observed_at":"2026-08-06T13:07:09.677389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.466192Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"13ce0b24-1fd9-4a46-9cb2-f2d649891627","year":2012},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.680213Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:ac309e9c2bdb3cf7d4aa63d26c6ab3a8a40c1556dde80b9b5e4bbd138cdc56f7","observation_id":"50e52d53-fe43-4d92-8b60-f8f8f4a83b6c","resolution":{"observed_at":"2026-08-06T13:07:10.469608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10470","last_updated":"2021-08-25T23:42:59Z","snapshot_observed_at":"2026-07-06T11:40:56.544714Z","submitted_at":"2021-08-24T01:38:11Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10470","snapshot_observed_at":"2026-08-06T13:07:09.682883Z","title":"Isaac gym: High performance gpu-based physics simulation for robot learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.682883Z"},"links":{"cited_paper":"/paper/2108.10470","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:71110fb0de386ed08a2a1f0f8ec2c9bc8d7358642a62a32fb493431c9ea94f9d","observation_id":"4a7887dd-6be2-40f4-9483-172d05172d79","resolution":{"observed_at":"2026-08-06T13:07:09.682883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.455608Z","title":"Ppo-for-beginners: A simple, well-styled ppo implementation in pytorch","venue":null,"work_id":"7a53a9ad-e866-4c57-8871-ae59d39fca78","year":2020},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.685709Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:7111ddeee582c951ef0c4ee1543d5797ca2b805b102d842c7383db59f99b49f3","observation_id":"24209886-9031-4947-9111-e6fc18d5ca08","resolution":{"observed_at":"2026-08-06T13:07:10.458927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-06T13:07:09.689388Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.689388Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:eca412782ce3beaaafb3e0a3ce09fb98b710464b5729d024ea0f92fb736e6ef1","observation_id":"f4537ca1-3755-46b8-9780-389e03224349","resolution":{"observed_at":"2026-08-06T13:07:09.689388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.444425Z","title":"dm_control: Software and tasks for continuous control","venue":null,"work_id":"ae30397d-8402-4d9b-afca-99951452b8e1","year":2020},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.692647Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:5cc7c6ef906941a0767ecfb24491330bfdf55a7b07f670a92f5b2d28ebd422ee","observation_id":"ecec4bba-2bd5-4fe4-87e7-277aaef169b2","resolution":{"observed_at":"2026-08-06T13:07:10.447525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13281","last_updated":"2021-06-24T19:09:12Z","snapshot_observed_at":"2026-07-06T11:22:55.799017Z","submitted_at":"2021-06-24T19:09:12Z","title":"Brax -- A Differentiable Physics Engine for Large Scale Rigid Body Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.13281","snapshot_observed_at":"2026-08-06T13:07:09.695342Z","title":"Brax–a differentiable physics engine for large scale rigid body simulation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.695342Z"},"links":{"cited_paper":"/paper/2106.13281","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:cf217b20cb282028e069f3a14529ec63618edb1d9b673afc8282951a3fa2840e","observation_id":"f16deb1d-05d3-4830-add6-e7f2cfc7833f","resolution":{"observed_at":"2026-08-06T13:07:09.695342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T13:07:09.698292Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.698292Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:f0a9f0663c0c15541d4d26f212c458c0147a254a176d2696cd9ff2098e73a609","observation_id":"eb7e53cf-ead2-4328-83ba-89932559dc55","resolution":{"observed_at":"2026-08-06T13:07:09.698292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:09.701629Z","title":"Perpetual humanoid control for real-time simulated avatars","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.701629Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:0b514c3c9a0e82b46ac82a2924f2e9e585b62d576ff206e8246b49f21af9c00d","observation_id":"2d1d3ee5-2ff8-4e33-b5b2-6831349903e6","resolution":{"observed_at":"2026-08-06T13:07:09.701629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.428301Z","title":"Deepmimic: Example- guided deep reinforcement learning of physics-based character skills","venue":null,"work_id":"f1622a22-887b-4b94-9739-66f0d56b33f1","year":2018},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.704789Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:c4fee7999eb63dd4dbd34500fdc729da8484473456484dcf21b8f81a7914e838","observation_id":"71d4ce65-67a4-48df-a9cd-22f56efb8c39","resolution":{"observed_at":"2026-08-06T13:07:10.431225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:09.707404Z","title":"Amass: Archive of motion capture as surface shapes","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.707404Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:b87e6911e97768eaf29a856372d4e08e8df60ca2aa9913709955cdbf63bb5bee","observation_id":"5ec79a79-0638-48c3-9eef-cc92b07fefdc","resolution":{"observed_at":"2026-08-06T13:07:09.707404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.411619Z","title":"Maskedmimic: Unified physics-based character control through masked motion inpainting","venue":null,"work_id":"2fd228d1-36d5-4685-bbbd-9e6a1e19f3b3","year":2024},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.709957Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:8b6e77caf5e44f0edce94e85ec14e26a1ae8cb478af68fec9bb65cc59c8e37b6","observation_id":"3f6620e2-326b-4dba-8f1b-6df9e88abedc","resolution":{"observed_at":"2026-08-06T13:07:10.414824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08931","last_updated":"2025-08-30T02:53:56Z","snapshot_observed_at":"2026-08-07T04:56:31.946602Z","submitted_at":"2025-06-10T15:58:29Z","title":"CLONE: Closed-Loop Whole-Body Humanoid Teleoperation for Long-Horizon Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08931","snapshot_observed_at":"2026-08-06T13:07:09.712831Z","title":"Clone: Closed-loop whole-body humanoid teleoperation for long-horizon tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.712831Z"},"links":{"cited_paper":"/paper/2506.08931","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:32efb832efc38f29b7e5eb4195cff81089fac3835ba16102fe7ca6a654199f69","observation_id":"da5426c2-df28-4a30-8564-0ee7fa8871f7","resolution":{"observed_at":"2026-08-06T13:07:09.712831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04582","last_updated":"2024-04-12T03:33:31Z","snapshot_observed_at":"2026-08-06T18:58:28.910044Z","submitted_at":"2023-10-06T20:48:43Z","title":"Universal Humanoid Motion Representations for Physics-Based Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04582","snapshot_observed_at":"2026-08-06T13:07:09.715858Z","title":"Universal humanoid motion representations for physics-based control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.715858Z"},"links":{"cited_paper":"/paper/2310.04582","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:c789046e790f03c803ba9f64c87598cb12900c6be15f2af91f60e78390484c65","observation_id":"fb531a57-4844-48df-be70-a7f9efc57875","resolution":{"observed_at":"2026-08-06T13:07:09.715858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.400959Z","title":"Omnigrasp: Grasping diverse objects with simulated humanoids","venue":null,"work_id":"cbce5f92-3dda-4853-b191-f103df610e29","year":2024},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.718744Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:2c8b55e5b7ff6a98112dfd8198dff4aa1ce0beede472bc1e05eca876000634a9","observation_id":"f15fcd56-9845-4b78-875e-14fbbc5ef57a","resolution":{"observed_at":"2026-08-06T13:07:10.404263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.390546Z","title":"Ai models collapse when trained on recursively generated data","venue":null,"work_id":"ee111bac-c9b1-48de-a1e6-a212c5d1a9cb","year":2024},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.721355Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:e6b8d03eeab3a430f4c7c0dd790db831b9c3b895bf897c09145db3ed54ae0e14","observation_id":"fb6389f7-a526-425c-9733-ba6a960702ba","resolution":{"observed_at":"2026-08-06T13:07:10.394437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17493","last_updated":"2024-04-14T05:20:10Z","snapshot_observed_at":"2026-08-05T16:03:40.517679Z","submitted_at":"2023-05-27T15:10:41Z","title":"The Curse of Recursion: Training on Generated Data Makes Models Forget","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17493","snapshot_observed_at":"2026-08-06T13:07:09.724594Z","title":"The curse of recursion: Training on generated data makes models forget","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.724594Z"},"links":{"cited_paper":"/paper/2305.17493","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:15381c6d09300a7201828441923865a0b5f23654cfb3d20b9d432dbbef24283d","observation_id":"5fcc6f94-7a74-4d85-9d2b-613b187b927d","resolution":{"observed_at":"2026-08-06T13:07:09.724594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.378360Z","title":"Self-consuming generative models go mad","venue":null,"work_id":"8fc937b0-73a2-4066-bf2d-a7bf794f83ae","year":2024},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.727485Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:3642d2b8430806813219e3f74c1746720faae880153e9aefc60e9701ca1c5c3d","observation_id":"9609017e-463f-4320-a755-009de32ace2f","resolution":{"observed_at":"2026-08-06T13:07:10.382354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-08-09T18:51:51.917654Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-06T13:07:09.730024Z","title":"Progressive distillation for fast sampling of diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.730024Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:96d90410dfbda180f5131fab8851a64aec459bab50326d56c630e37b36ae6669","observation_id":"982b49df-d100-47d8-b962-11d9eee2036e","resolution":{"observed_at":"2026-08-06T13:07:09.730024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-06T13:07:09.734008Z","title":"Classifier-free diffusion guidance, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.734008Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:0319853d1eb710f032ae8440853a74b789189b97e375ccd5f305e5e926c331e0","observation_id":"6d70b079-8e59-4e96-bb42-e693d40ef204","resolution":{"observed_at":"2026-08-06T13:07:09.734008Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:10.367437Z","title":"Low CFG scales tend to encourage bluriness while high CFG scales encourage saturation and sharp geometric artifacts","venue":null,"work_id":"978459c1-4106-4807-b65e-ebe735a471da","year":null},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.738381Z"},"links":{"citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:88560855616c9f6586aae0d88cdd27a4d1344a9a08eb5de870964eab435a2a23","observation_id":"cbd8537c-7cdd-4b41-b843-fb363b4b1b1e","resolution":{"observed_at":"2026-08-06T13:07:10.371016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.00630","last_updated":"2023-04-14T00:20:30Z","snapshot_observed_at":"2026-08-10T21:16:03.365645Z","submitted_at":"2021-07-01T17:43:20Z","title":"Variational Diffusion Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.00630","snapshot_observed_at":"2026-08-06T13:07:09.668237Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.668237Z"},"links":{"cited_paper":"/paper/2107.00630","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:cd589acc3f638cd29acdfdbfc706f775b14500b2333839924e698d59b2f6d030","observation_id":"ff534587-8822-4c30-9401-e11a3b7bb46c","resolution":{"observed_at":"2026-08-06T13:07:09.668237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":59,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 37 inbound Pith citation observations for arXiv:2507.21053."}