{"as_of":"2026-08-07T05:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9b4e743fa9bcaeb22338d76b4f4caecf6d7eba24ec090a7e9452222f30c40790","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:47:41.955782Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:24:58.463499Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:17:36.880164Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15073","snapshot_observed_at":"2026-08-04T10:24:58.463499Z","title":"Reinforcement Learning for Flow-Matching Policies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09976","last_updated":"2026-06-25T14:25:12Z","snapshot_observed_at":"2026-08-04T10:24:54.103532Z","submitted_at":"2025-10-11T03:11:18Z","title":"Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T10:24:58.463499Z"},"links":{"cited_paper":"/paper/2507.15073","citing_paper":"/paper/2510.09976"},"observation_digest":"sha256:882a90480bb156914d7b052681b6e52be903886aea6c463b53e7d6ba42b7f2d6","observation_id":"bf0da5b4-75dc-40ec-8ee7-0448eedf1071","resolution":{"observed_at":"2026-08-04T10:24:58.463499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15073","snapshot_observed_at":"2026-07-14T23:46:32.301737Z","title":"Reinforce- ment learning for flow-matching policies.arXiv preprint arXiv:2507.15073,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.10263","last_updated":"2026-07-01T06:52:08Z","snapshot_observed_at":"2026-07-14T23:46:28.340932Z","submitted_at":"2026-03-10T22:49:46Z","title":"From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T23:46:32.301737Z"},"links":{"cited_paper":"/paper/2507.15073","citing_paper":"/paper/2603.10263"},"observation_digest":"sha256:c2f37c35cf6be96be876c6153d01d18757bacbc7349867a1146a0e0e91d55068","observation_id":"0c692d02-33ce-452c-b53d-ba76960fcef3","resolution":{"observed_at":"2026-07-14T23:46:32.301737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15073","snapshot_observed_at":"2026-08-04T05:51:28.959396Z","title":"Reinforcement learning for flow-matching policies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15257","last_updated":"2026-08-02T20:22:57Z","snapshot_observed_at":"2026-08-07T01:05:10.396266Z","submitted_at":"2026-03-16T13:24:58Z","title":"HapticVLA: Contact-Rich Manipulation via Vision-Language-Action Model without Inference-Time Tactile Sensing","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:28.959396Z"},"links":{"cited_paper":"/paper/2507.15073","citing_paper":"/paper/2603.15257"},"observation_digest":"sha256:814780afe1bf1a4d65e41ce9ba6fd753258f8791b581b32b08a228fc4f7814af","observation_id":"9761a3f3-fc2e-4afb-bc34-77176a4f413e","resolution":{"observed_at":"2026-08-04T05:51:28.959396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"cited_work":{"arxiv_id":"2507.15073","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15073","snapshot_observed_at":"2026-07-03T04:17:36.880164Z","title":"Reinforcement learning for flow- matching policies","venue":null,"work_id":"23f7dcd8-f328-4edc-a0cb-96493e341c79","year":2025},"citing_paper":{"arxiv_id":"2605.08879","last_updated":"2026-05-19T10:05:30Z","snapshot_observed_at":"2026-08-01T19:11:57.235558Z","submitted_at":"2026-05-09T10:59:03Z","title":"Preserving Foundational Capabilities in Flow-Matching VLAs through Conservative SFT","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T01:31:33.829939Z"},"links":{"cited_paper":"/paper/2507.15073","citing_paper":"/paper/2605.08879"},"observation_digest":"sha256:74a45b807345b5f6785798601c2cf06566d62a7b04ea8d02fc585ab80e2d66b5","observation_id":"4422a34a-b1f5-46b8-863f-d15820c07ad0","resolution":{"observed_at":"2026-05-12T07:56:27.226180Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"cited_work":{"arxiv_id":"2507.15073","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15073","snapshot_observed_at":"2026-07-03T04:17:36.880164Z","title":"Reinforcement learning for flow- matching policies","venue":null,"work_id":"23f7dcd8-f328-4edc-a0cb-96493e341c79","year":2025},"citing_paper":{"arxiv_id":"2605.08879","last_updated":"2026-05-19T10:05:30Z","snapshot_observed_at":"2026-08-01T19:11:57.235558Z","submitted_at":"2026-05-09T10:59:03Z","title":"Preserving Foundational Capabilities in Flow-Matching VLAs through Conservative SFT","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T23:08:30.205397Z"},"links":{"cited_paper":"/paper/2507.15073","citing_paper":"/paper/2605.08879"},"observation_digest":"sha256:5f3202e7aab067e7a1f260736f3fb6ecc928ab61bdff757220cfadde8b412d02","observation_id":"d6b7d634-4c3b-4b13-8d56-87f054558f5d","resolution":{"observed_at":"2026-05-20T23:09:12.156167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"cited_work":{"arxiv_id":"2507.15073","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15073","snapshot_observed_at":"2026-07-03T04:17:36.880164Z","title":"Reinforcement learning for flow- matching policies","venue":null,"work_id":"23f7dcd8-f328-4edc-a0cb-96493e341c79","year":2025},"citing_paper":{"arxiv_id":"2605.17144","last_updated":"2026-05-16T20:28:21Z","snapshot_observed_at":"2026-08-01T21:39:10.155636Z","submitted_at":"2026-05-16T20:28:21Z","title":"Contrastive Conceptor Activation Steering (COAST): Unlocking Vision-Language-Action Models through Hidden States","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-20T14:30:20.697135Z"},"links":{"cited_paper":"/paper/2507.15073","citing_paper":"/paper/2605.17144"},"observation_digest":"sha256:1d65f3ad541ff3f79388fdab0061758974730894be24c91649da35bdc17c4526","observation_id":"63313854-9e4e-451b-9f58-7dda7d785a68","resolution":{"observed_at":"2026-05-20T14:33:21.515152Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"cited_work":{"arxiv_id":"2507.15073","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15073","snapshot_observed_at":"2026-07-03T04:17:36.880164Z","title":"Reinforcement learning for flow- matching policies","venue":null,"work_id":"23f7dcd8-f328-4edc-a0cb-96493e341c79","year":2025},"citing_paper":{"arxiv_id":"2606.08602","last_updated":"2026-06-07T12:28:51Z","snapshot_observed_at":"2026-07-06T23:48:07.065806Z","submitted_at":"2026-06-07T12:28:51Z","title":"Reinforcement Learning for Flow-Matching Policies with Density Transport","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T18:55:02.040180Z"},"links":{"cited_paper":"/paper/2507.15073","citing_paper":"/paper/2606.08602"},"observation_digest":"sha256:447f0a74319eefde3a6d7512b8df8a0cce70830f2b632a16e174f51b07258069","observation_id":"c33a8b6f-1a78-47fd-b24c-41837581b798","resolution":{"observed_at":"2026-07-02T22:27:25.847672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"cited_work":{"arxiv_id":"2507.15073","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15073","snapshot_observed_at":"2026-07-03T04:17:36.880164Z","title":"Reinforcement learning for flow- matching policies","venue":null,"work_id":"23f7dcd8-f328-4edc-a0cb-96493e341c79","year":2025},"citing_paper":{"arxiv_id":"2606.11087","last_updated":"2026-06-09T16:45:57Z","snapshot_observed_at":"2026-08-02T20:45:09.177143Z","submitted_at":"2026-06-09T16:45:57Z","title":"Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T14:05:01.073951Z"},"links":{"cited_paper":"/paper/2507.15073","citing_paper":"/paper/2606.11087"},"observation_digest":"sha256:d6028f4c31f63aef22f66832b743ec5ee3ad36a419c1b8e040cb4aeb3672601d","observation_id":"602dc178-c7b3-4ce7-9b56-03c9b4368b4f","resolution":{"observed_at":"2026-07-03T04:17:36.881701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15073","snapshot_observed_at":"2026-08-01T15:26:40.805045Z","title":"arXiv:2507.15073","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26460","last_updated":"2026-07-29T04:22:46Z","snapshot_observed_at":"2026-08-01T23:25:31.339058Z","submitted_at":"2026-07-29T04:22:46Z","title":"RLMM-Flow: A Flow-based Mobile Manipulation Framework with Latent-Space Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T15:26:40.805045Z"},"links":{"cited_paper":"/paper/2507.15073","citing_paper":"/paper/2607.26460"},"observation_digest":"sha256:9c3fda8b3822a598424f215dfe89e5ea5b2ed652cec2fd23fd953dec75a659d4","observation_id":"d9c564af-c00c-4da3-b17d-5a062950cf59","resolution":{"observed_at":"2026-08-01T15:26:40.805045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.15073/citation-record","integrity":"/paper/2507.15073/integrity","json":"/paper/2507.15073/citation-record.json","paper":"/paper/2507.15073"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-01T15:43:51.739518Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-06T15:47:40.641859Z","title":"Training diffusion models with reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:40.641859Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:74d040a15c704c6fdac9c9b3af8290c578b0c523294910e28a7eaf024a300922","observation_id":"7f832cbb-2e48-488e-b47e-e50bb117805e","resolution":{"observed_at":"2026-08-06T15:47:40.641859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-06T15:47:40.918955Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:40.918955Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:7a3d17e58b357a66a8a5329188a04f719f1efe183e162901830411ac4bd30d7d","observation_id":"efe58cf4-e773-4d57-a944-838414a31da3","resolution":{"observed_at":"2026-08-06T15:47:40.918955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08861","last_updated":"2025-01-07T18:12:27Z","snapshot_observed_at":"2026-07-06T19:15:00.165369Z","submitted_at":"2024-09-13T14:22:14Z","title":"Adjoint Matching: Fine-tuning Flow and Diffusion Generative Models with Memoryless Stochastic Optimal Control","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08861","snapshot_observed_at":"2026-08-06T15:47:41.260048Z","title":"Adjoint matching: Fine-tuning flow and diffusion generative models with memoryless stochastic optimal control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.260048Z"},"links":{"cited_paper":"/paper/2409.08861","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:ae4bdd9d3d990a4ce49481e0cf4bc2fb94c6aae092445e00b26be453d7ef2871","observation_id":"c84c4e0b-78e2-4fe5-a352-f92aaf9c9d54","resolution":{"observed_at":"2026-08-06T15:47:41.260048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-06T15:47:41.400153Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.400153Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:1cc3670f9bfca117abbd983b6ec73dcbf6ec262537c2ed0ba3a06c240914f593","observation_id":"01624f29-4bef-4cc2-b6d5-324553a162f0","resolution":{"observed_at":"2026-08-06T15:47:41.400153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-06T15:47:41.517438Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.517438Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:f72a7c071753868dea86477a8cd348b0c17f506260017d1ed5724c54e3621621","observation_id":"6c4e6d43-e587-4005-806b-3c8e424a3f01","resolution":{"observed_at":"2026-08-06T15:47:41.517438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-06T15:47:41.632681Z","title":"Jiajun Fan, Shuaike Shen, Chaoran Cheng, Yuxin Chen, Chumeng Liang, and Ge Liu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.632681Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:e3680e324987a45241d60f335b98f4c14a6ae4e206271d5a6c5cb3edc70ecd64","observation_id":"9f0cfd26-cbb5-444f-8159-a30454f40814","resolution":{"observed_at":"2026-08-06T15:47:41.632681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12579","last_updated":"2025-06-07T04:16:28Z","snapshot_observed_at":"2026-07-06T20:38:25.164930Z","submitted_at":"2025-02-18T06:31:08Z","title":"CHATS: Combining Human-Aligned Optimization and Test-Time Sampling for Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12579","snapshot_observed_at":"2026-08-06T15:47:41.749121Z","title":"Chats: Combining human-aligned optimization and test-time sampling for text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.749121Z"},"links":{"cited_paper":"/paper/2502.12579","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:1394baf586338bedcb9a5a33f13d1dca4b0f03cf6d4f985e1beb0fb059a8a600","observation_id":"acbc030e-251d-44f7-9aeb-f18fdd388352","resolution":{"observed_at":"2026-08-06T15:47:41.749121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09991","last_updated":"2022-12-21T01:06:18Z","snapshot_observed_at":"2026-08-06T05:32:02.292779Z","submitted_at":"2022-05-20T07:02:03Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09991","snapshot_observed_at":"2026-08-06T15:47:41.901307Z","title":"Planning with diffusion for flexible behavior synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.901307Z"},"links":{"cited_paper":"/paper/2205.09991","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:2f873a4b614352e6fb3c6bd530c7726525f52cab73f0b392fadf5aca3b4d40cb","observation_id":"db182ae3-bb80-4e1a-9a23-eac3251d5bc3","resolution":{"observed_at":"2026-08-06T15:47:41.901307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T15:47:41.908301Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.908301Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:25fdefcad25b6538611fd2bdc9304a43ea279627cb1f85dbf09677cd96772293","observation_id":"eb367f21-c9e2-43ae-8730-ddcaf01d5f89","resolution":{"observed_at":"2026-08-06T15:47:41.908301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17418","last_updated":"2025-03-19T03:55:48Z","snapshot_observed_at":"2026-07-06T18:20:44.070255Z","submitted_at":"2024-05-27T17:58:48Z","title":"A Self-Correcting Vision-Language-Action Model for Fast and Slow System Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17418","snapshot_observed_at":"2026-08-06T15:47:41.911320Z","title":"A self-correcting vision-language- action model for fast and slow system manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.911320Z"},"links":{"cited_paper":"/paper/2405.17418","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:abdb3854e27bb93c2e386555351e82e5fccfae5896c3dbfe99f096e11b22b253","observation_id":"5c472cac-20d5-4e4e-a927-03706a803155","resolution":{"observed_at":"2026-08-06T15:47:41.911320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-06T15:47:41.914645Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.914645Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:1d703dbcecbf4e959ae6914c83d38f6d903f05898ff79a43b452856e427284d4","observation_id":"79b4e05b-730d-46b6-a826-5e32e755241e","resolution":{"observed_at":"2026-08-06T15:47:41.914645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06264","last_updated":"2024-12-09T07:22:38Z","snapshot_observed_at":"2026-08-02T09:54:14.339169Z","submitted_at":"2024-12-09T07:22:38Z","title":"Flow Matching Guide and Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06264","snapshot_observed_at":"2026-08-06T15:47:41.918358Z","title":"Jie Liu, Gongye Liu, Jiajun Liang, Ziyang Yuan, Xiaokun Liu, Mingwu Zheng, Xiele Wu, Qiulin Wang, Wenyu Qin, Menghan Xia, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.918358Z"},"links":{"cited_paper":"/paper/2412.06264","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:f10f7ffe94d09c2b8dc22278451c53bb3c998748428cfcbe8f3dab90c2ae28e6","observation_id":"1c40ee75-4e41-4c6f-9e8c-ad3e2558d1ec","resolution":{"observed_at":"2026-08-06T15:47:41.918358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05153","last_updated":"2025-05-05T16:26:30Z","snapshot_observed_at":"2026-08-03T18:16:02.124743Z","submitted_at":"2025-03-07T05:22:52Z","title":"Generative Trajectory Stitching through Diffusion Composition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05153","snapshot_observed_at":"2026-08-06T15:47:41.921914Z","title":"Generative trajectory stitching through diffusion composition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.921914Z"},"links":{"cited_paper":"/paper/2503.05153","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:aa68ce6f0e182a2adf3da482a59e0afa4f7b86f13a9fca030f8987be5269cb1a","observation_id":"17a60899-bc3c-4287-b812-d2c81ae6ff18","resolution":{"observed_at":"2026-08-06T15:47:41.921914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:47:41.925766Z","title":"Grounding multimodal llms to embodied agents that ask for help with reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.925766Z"},"links":{"citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:dd2507777f0185d76e48e08018661a97d7abfa02996f70c65f7a8d2b95d88ec2","observation_id":"4054e499-7d5e-443d-8403-71c41592b2c5","resolution":{"observed_at":"2026-08-06T15:47:41.925766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-06T15:47:41.929342Z","title":"Diffusion policy policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.929342Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:3d6ed6f9a759b7985d974bedd647623ef6971b9429a8f5ad42b7056a91648a94","observation_id":"70218636-21da-4b21-bfea-bff1a54fb854","resolution":{"observed_at":"2026-08-06T15:47:41.929342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T15:47:41.932555Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.932555Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:bbc0a7123281dd020739dfb0b6a152ab01d16e1746ff7203c81b574734593f42","observation_id":"c3340881-7e64-42c4-993f-d772d72dc46e","resolution":{"observed_at":"2026-08-06T15:47:41.932555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-08-06T15:47:41.939393Z","title":"Smolvla: A vision- language-action model for affordable and efficient robotics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.939393Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:20a747da33fba528c49ab8ccc4950765e7c42178d6e69024deb2e73cae8f9463","observation_id":"9fdc379b-bbd8-44a5-aba5-95705e5f7cdb","resolution":{"observed_at":"2026-08-06T15:47:41.939393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08448","last_updated":"2024-05-14T09:12:30Z","snapshot_observed_at":"2026-08-05T00:57:12.421643Z","submitted_at":"2024-05-14T09:12:30Z","title":"Understanding the performance gap between online and offline alignment algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08448","snapshot_observed_at":"2026-08-06T15:47:41.942955Z","title":"Understanding the perfor- mance gap between online and offline alignment algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.942955Z"},"links":{"cited_paper":"/paper/2405.08448","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:59d1d4e706de397d4d0c6a08374d6ad3b85354a08457c70b3eab3d64f71cd581","observation_id":"4c22ff31-ea36-4d63-ada6-f96c2174257a","resolution":{"observed_at":"2026-08-06T15:47:41.942955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-07-31T14:51:03.625964Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07818","snapshot_observed_at":"2026-08-06T15:47:41.947500Z","title":"Dancegrpo: Unleashing grpo on visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.947500Z"},"links":{"cited_paper":"/paper/2505.07818","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:2756753a818ef6a22e447847ab084a6110ae2510edc880af77614e8ba9955d10","observation_id":"af23b2b7-c6d2-49f7-971e-1fa979cc42cb","resolution":{"observed_at":"2026-08-06T15:47:41.947500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:47:42.385019Z","title":"We start by collecting 30, 000 demonstration trajectories from πD","venue":null,"work_id":"cb29a416-a429-4dd3-83c3-134f0c0eb8fa","year":2024},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.951925Z"},"links":{"citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:3bc33ae2e2f19001a51a8ffbe40db7541688bad2b60b7399378dab0179e3884c","observation_id":"a5e5b0ef-f4a5-45b9-9a80-0e5e981565f9","resolution":{"observed_at":"2026-08-06T15:47:42.388467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:47:42.371664Z","title":"To generate samples, we use Euler integration with 4 steps","venue":null,"work_id":"7b8a47e4-cd69-4010-b61e-6d7412956fb2","year":2023},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.955782Z"},"links":{"citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:80c661856587c342f8aeb45652af50db544ae396a0180f93299cd536481e19fd","observation_id":"b9d8e59c-968e-445c-a9d5-e857999a8adf","resolution":{"observed_at":"2026-08-06T15:47:42.377747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T15:47:41.936108Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.936108Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:8e11d3738e6f053ab3b140f29f75daab7ba7df1785e00c01755fca4be5306358","observation_id":"dec882b2-9fe1-4f14-86ff-b35940099ed7","resolution":{"observed_at":"2026-08-06T15:47:41.936108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20313","last_updated":"2024-12-11T15:42:13Z","snapshot_observed_at":"2026-08-04T08:56:57.976209Z","submitted_at":"2024-05-30T17:53:50Z","title":"Sequence-Augmented SE(3)-Flow Matching For Conditional Protein Backbone Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20313","snapshot_observed_at":"2026-08-06T15:47:41.896245Z","title":"Sequence-augmented se (3)-flow matching for conditional protein backbone generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.896245Z"},"links":{"cited_paper":"/paper/2405.20313","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:5d8d3d316fec088b9936bd7bd6fe8b0979c69c87b7656f5e18c75f29d7260f14","observation_id":"26c3e4af-5f70-4080-ad3c-c67e36c79162","resolution":{"observed_at":"2026-08-06T15:47:41.896245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05833","last_updated":"2025-08-04T16:25:44Z","snapshot_observed_at":"2026-07-06T20:48:50.817786Z","submitted_at":"2025-03-06T12:52:11Z","title":"Refined Policy Distillation: From VLA Generalists to RL Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05833","snapshot_observed_at":"2026-08-06T15:47:41.904894Z","title":"Refined policy distillation: From vla generalists to rl experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.904894Z"},"links":{"cited_paper":"/paper/2503.05833","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:09da0155c3459558ae490428e67115dcf2162c3247b754813fa9ab6de605440c","observation_id":"abb0bb71-57f2-43ce-9940-7aa8cc843015","resolution":{"observed_at":"2026-08-06T15:47:41.904894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02644","last_updated":"2024-01-05T05:28:40Z","snapshot_observed_at":"2026-08-04T15:37:47.750655Z","submitted_at":"2024-01-05T05:28:40Z","title":"Simple Hierarchical Planning with Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02644","snapshot_observed_at":"2026-08-06T15:47:41.128597Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.128597Z"},"links":{"cited_paper":"/paper/2401.02644","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:725a69f3ee9cbcfda55aab10dd1728267661ea822b4cefcd283d2d84069cc5be","observation_id":"d2fc7afe-b7ad-4a44-b7ec-7a1ceb508c48","resolution":{"observed_at":"2026-08-06T15:47:41.128597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T15:47:40.788104Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:40.788104Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:ab11047fbb16cf5349ce6e0c9cd5aaa04cbb4665dd4656101084f95f4352c08e","observation_id":"c0d62655-327a-46d1-aaca-c7d260a4f923","resolution":{"observed_at":"2026-08-06T15:47:40.788104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T15:47:41.831875Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:41.831875Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:2e9f25aeab937dc0ce88faa2a9450a97643f2946a2710ba58f6f6392bd2860cd","observation_id":"ee54109a-fd62-43ca-b7d4-536076fd702d","resolution":{"observed_at":"2026-08-06T15:47:41.831875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 9 inbound Pith citation observations for arXiv:2507.15073."}