{"as_of":"2026-08-07T16:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b3ed2015d1ee2034c9904d239ba9c0f94a3fb2c2da5964fa8050f7ca33a228b","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T13:27:50.031781Z","state":"measured"},{"denominator":148,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":148,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":89,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:42:14.452986Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T03:05:55.323624Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":277,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:c966c661421993d7fcf0d78f5c9e52e2ff4d55e46c63ce8373b93c33d94544c5","observation_id":"8868ede2-1a2b-4b50-80fc-f0d65d767f45","resolution":{"observed_at":"2026-05-18T00:02:24.718091Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2509.23352","last_updated":"2026-05-15T10:34:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-27T14:59:31Z","title":"Dynamic-TreeRPO: Breaking the Independent Trajectory Bottleneck with Structured Sampling","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T21:30:24.268903Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2509.23352"},"observation_digest":"sha256:4ac446b565102c160fcafca29f2723fd3fdbb371c9a4f7f80876f43ddaab13c4","observation_id":"cd369139-8524-440d-b00a-1c51216cf953","resolution":{"observed_at":"2026-05-21T21:30:39.200519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2509.23951","last_updated":"2026-06-26T07:53:46Z","snapshot_observed_at":"2026-08-04T14:42:12.962842Z","submitted_at":"2025-09-28T16:14:10Z","title":"HunyuanImage 3.0 Technical Report","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T02:02:32.806844Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2509.23951"},"observation_digest":"sha256:6cc9d04d3b887ffe5fc024d3b03a5070e71e051ed93056b756a8edfdc192fec8","observation_id":"9245787c-c16d-41c4-8bd6-20dbe174cbb2","resolution":{"observed_at":"2026-05-16T02:02:32.872717Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-08-04T14:42:14.452986Z","title":"Mixgrpo: Unlocking flow-based grpo efficiency with mixed ode-sde.arXiv preprint arXiv:2507.21802, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.23951","last_updated":"2026-06-26T07:53:46Z","snapshot_observed_at":"2026-08-04T14:42:12.962842Z","submitted_at":"2025-09-28T16:14:10Z","title":"HunyuanImage 3.0 Technical Report","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T14:42:14.452986Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2509.23951"},"observation_digest":"sha256:42e604cbbebfda985e8b5ea1ac94d0cae37eae4129b6e691f32f6fc8cba81fc2","observation_id":"a398429a-adbb-4bf3-9d43-b4c12e721b91","resolution":{"observed_at":"2026-08-04T14:42:14.452986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2510.21583","last_updated":"2026-05-20T09:16:04Z","snapshot_observed_at":"2026-07-06T22:33:58.663508Z","submitted_at":"2025-10-24T15:50:36Z","title":"Principled RL for Flow Matching Emerges from the Chunk-level Policy Optimization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T19:47:48.545820Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2510.21583"},"observation_digest":"sha256:83e1c5cb8ec65081489d24c0a8f912b6441b5b3101ce9906deea3e04febc5632","observation_id":"a334ff87-f36a-48ed-88b5-8e58dd71a754","resolution":{"observed_at":"2026-05-21T19:50:33.861376Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2511.18719","last_updated":"2026-05-15T07:47:36Z","snapshot_observed_at":"2026-07-06T22:36:44.887709Z","submitted_at":"2025-11-24T03:21:17Z","title":"Seeing What Matters: Visual Preference Policy Optimization for Visual Generation","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T18:42:29.327151Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2511.18719"},"observation_digest":"sha256:628b0d107d69e0db2653a10557dbc1f563e9398004d6f3340d036641dc6ab58d","observation_id":"3e628352-3919-484a-8e72-2c47f290b740","resolution":{"observed_at":"2026-05-21T18:44:18.933610Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:29fc4460c9a1cf325c9d17e7b4aa89dc1d5b988c47ef7525ed34d9c6eb9e22a9","observation_id":"a53b66a3-d14b-4c2e-9068-81b22b044828","resolution":{"observed_at":"2026-05-15T02:31:35.086217Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-08-03T20:36:06.500523Z","title":"Mixgrpo: Unlocking flow- based grpo efficiency with mixed ode-sde.arXiv preprint arXiv:2507.21802, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-06T15:45:56.386642Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:06.500523Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:524551c1ba1db7f7cd086392565e96726b6a7633b096bba03c65b8a7b5034245","observation_id":"5db676d6-2ab4-4175-bdba-39f7c6d3850f","resolution":{"observed_at":"2026-08-03T20:36:06.500523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-08-03T03:58:49.354792Z","title":"Mixgrpo: Unlocking flow-based grpo efficiency with mixed ode-sde.arXiv preprint arXiv:2507.21802,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:49.354792Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:9b8e91b779bcbc24eb22d512ea5ce537393ce12062939ffcd406048315e523c2","observation_id":"cde24e99-d1f6-4383-bea0-86b457ff8e3d","resolution":{"observed_at":"2026-08-03T03:58:49.354792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-08-02T19:14:08.102419Z","title":"org/abs/2507.2180210","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.03143","last_updated":"2026-06-28T07:21:56Z","snapshot_observed_at":"2026-08-07T08:56:16.763487Z","submitted_at":"2026-03-03T16:31:10Z","title":"Edit in 2D, Verify in 3D: Reinforcement Learning for Multi-view Consistent Scene Editing","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T19:14:08.102419Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2603.03143"},"observation_digest":"sha256:4d32e6311ce99bae2d815e7bcb56acee0c2233c3f1f3dc3512c2661e665f3c2e","observation_id":"3debb3f2-0a17-447f-868d-d5c1937d0c32","resolution":{"observed_at":"2026-08-02T19:14:08.102419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-08-02T18:25:55.487831Z","title":"Mixgrpo: Unlocking flow-based grpo efficiency with mixed ode-sde.arXiv preprint arXiv:2507.21802, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-07T15:25:42.104111Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:55.487831Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:7a45a28c2fea85874a747687adaa8ff1137d2306e0dbd9e77be6cafce10417d8","observation_id":"b53cd30e-aeaf-490c-a020-e02ce5c46acd","resolution":{"observed_at":"2026-08-02T18:25:55.487831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-13T23:09:50.674516Z","title":"arXiv preprint arXiv:2507.21802 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.17461","last_updated":"2026-06-29T18:39:41Z","snapshot_observed_at":"2026-08-01T14:43:22.307571Z","submitted_at":"2026-03-18T08:07:01Z","title":"AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T23:09:50.674516Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2603.17461"},"observation_digest":"sha256:040ac54e594c47569e056e84f8d1ffdbe4fc0386dd69480b77d49116d0554c97","observation_id":"6a73b0f2-fc5c-481e-929e-63ce7e7e413e","resolution":{"observed_at":"2026-07-13T23:09:50.674516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2603.21743","last_updated":"2026-05-20T19:52:16Z","snapshot_observed_at":"2026-07-06T22:50:05.914888Z","submitted_at":"2026-03-23T09:33:18Z","title":"CellFluxRL: Biologically-Constrained Virtual Cell Modeling via Reinforcement Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T01:05:45.781048Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2603.21743"},"observation_digest":"sha256:92313f0b1a773b7b401aa2bc42772c1b7829b79d2bc0dbd8a80fa19f564b705f","observation_id":"72b55ceb-f0de-40cf-ad23-fbfb41e5554c","resolution":{"observed_at":"2026-05-15T01:08:25.877291Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2603.21743","last_updated":"2026-05-20T19:52:16Z","snapshot_observed_at":"2026-07-06T22:50:05.914888Z","submitted_at":"2026-03-23T09:33:18Z","title":"CellFluxRL: Biologically-Constrained Virtual Cell Modeling via Reinforcement Learning","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T10:41:37.140709Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2603.21743"},"observation_digest":"sha256:6244ee5aa313392e3839f8c188c3df0f379fbfe9ae8832538ceb3c1e6b3710fb","observation_id":"8806594b-59f8-4b3f-bcaa-ac4c1f1187f3","resolution":{"observed_at":"2026-05-22T10:44:47.566144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2603.24589","last_updated":"2026-07-03T09:25:13Z","snapshot_observed_at":"2026-07-13T18:44:48.026473Z","submitted_at":"2026-03-25T17:58:11Z","title":"YingMusic-Singer: Controllable Singing Voice Synthesis with Flexible Lyric Manipulation and Annotation-free Melody Guidance","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T00:21:26.758816Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2603.24589"},"observation_digest":"sha256:a6966da2a6962fe6b964648f430906029cf4464f77daa27b236f36a18cebeb8b","observation_id":"058c0b06-edd5-4b43-bf49-2860a935b513","resolution":{"observed_at":"2026-05-15T00:23:22.732115Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-13T18:44:48.222670Z","title":"Mixgrpo: Unlocking flow-based GRPO efficiency with mixed ODE-SDE,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24589","last_updated":"2026-07-03T09:25:13Z","snapshot_observed_at":"2026-07-13T18:44:48.026473Z","submitted_at":"2026-03-25T17:58:11Z","title":"YingMusic-Singer: Controllable Singing Voice Synthesis with Flexible Lyric Manipulation and Annotation-free Melody Guidance","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T18:44:48.222670Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2603.24589"},"observation_digest":"sha256:0c41b5f635d668522645d32aa535d42bc10716a5fcb64b82bc90bfc920b994e8","observation_id":"2769c7b5-5aa3-4a4e-a357-fdf1b99b5d2c","resolution":{"observed_at":"2026-07-13T18:44:48.222670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2604.04142","last_updated":"2026-04-05T15:00:29Z","snapshot_observed_at":"2026-07-06T22:53:10.816748Z","submitted_at":"2026-04-05T15:00:29Z","title":"OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T16:46:30.674244Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2604.04142"},"observation_digest":"sha256:3f6ca450ad5378ebf422680f2a35774022c928002dc37cb8198f29f43329e680","observation_id":"aefb9526-ba03-48b6-b838-d3c4a1c12c5f","resolution":{"observed_at":"2026-05-13T16:48:02.901980Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2604.06916","last_updated":"2026-04-08T10:14:47Z","snapshot_observed_at":"2026-07-06T22:55:15.791334Z","submitted_at":"2026-04-08T10:14:47Z","title":"FP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scaling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T18:10:06.994557Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2604.06916"},"observation_digest":"sha256:48073d8529d5ca5ab6fce7a3c203900f392bb9556f6eb1c01517b0a8b333dbbe","observation_id":"d6128819-ff9e-4a21-872c-b4bddfb0b596","resolution":{"observed_at":"2026-05-13T13:27:50.191417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2604.06966","last_updated":"2026-04-08T11:30:35Z","snapshot_observed_at":"2026-08-02T04:51:58.286670Z","submitted_at":"2026-04-08T11:30:35Z","title":"MAR-GRPO: Stabilized GRPO for AR-diffusion Hybrid Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T18:00:50.105629Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2604.06966"},"observation_digest":"sha256:a61391ce9cc45265379e638d6785d5e1ad0a349964314cc5e4f19843b2e43585","observation_id":"b1195fd9-08fd-4bf0-bb35-39b6fc714e87","resolution":{"observed_at":"2026-05-13T13:27:50.191417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2604.09386","last_updated":"2026-04-10T14:58:15Z","snapshot_observed_at":"2026-08-03T22:46:03.667340Z","submitted_at":"2026-04-10T14:58:15Z","title":"Region-Constrained Group Relative Policy Optimization for Flow-Based Image Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T16:56:09.398673Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2604.09386"},"observation_digest":"sha256:fe29fd4263f51194c8700a9448a280390cb601af58f7ea3ad1548750250593d4","observation_id":"4657ff26-0101-4a86-8ad3-22f841af5385","resolution":{"observed_at":"2026-05-13T13:27:50.191417Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2604.14910","last_updated":"2026-04-27T07:40:23Z","snapshot_observed_at":"2026-07-06T23:02:36.062162Z","submitted_at":"2026-04-16T11:52:11Z","title":"Reward-Aware Trajectory Shaping for Few-step Visual Generation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T11:43:55.499474Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2604.14910"},"observation_digest":"sha256:04a167f4e945bb1fde7985a743db745eceb0e454de2dc2d74c39a600da92b73f","observation_id":"b77e20c1-86dd-4a3d-9708-aaa4beea0bd4","resolution":{"observed_at":"2026-05-13T13:27:50.191417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2604.15311","last_updated":"2026-05-03T11:22:04Z","snapshot_observed_at":"2026-07-06T23:02:53.677687Z","submitted_at":"2026-04-16T17:59:56Z","title":"LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T11:23:28.424453Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2604.15311"},"observation_digest":"sha256:47f939e4b510f4c5c608ae1b26b7f6ae4666c5b5626a8a2a02f29c53b7ce99e0","observation_id":"2f7709ec-8759-42de-b918-7f75fbf299da","resolution":{"observed_at":"2026-05-13T13:27:50.191417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2604.17415","last_updated":"2026-05-30T13:03:36Z","snapshot_observed_at":"2026-07-06T23:04:32.734175Z","submitted_at":"2026-04-19T12:47:52Z","title":"Reward Score Matching: Unifying Reward-based Fine-tuning for Flow and Diffusion Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T05:34:01.064008Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2604.17415"},"observation_digest":"sha256:7fd96459694764668646de72c74631a5cf2b4e454215d92a497ad2d86bcad32f","observation_id":"c6338d41-723b-47c8-84b2-19ed48105d2e","resolution":{"observed_at":"2026-05-13T13:27:50.191417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2604.17415","last_updated":"2026-05-30T13:03:36Z","snapshot_observed_at":"2026-07-06T23:04:32.734175Z","submitted_at":"2026-04-19T12:47:52Z","title":"Reward Score Matching: Unifying Reward-based Fine-tuning for Flow and Diffusion Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-05T17:45:49.335925Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2604.17415"},"observation_digest":"sha256:92e45c9f3e100702b4b64ae425d27fa5490e2de111b447754c65aad7fe23e8d1","observation_id":"7977d59e-bc2c-48ea-9515-d235b0431179","resolution":{"observed_at":"2026-07-05T17:51:14.864977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2604.18518","last_updated":"2026-05-28T03:18:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:16:50Z","title":"UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T05:32:54.235578Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2604.18518"},"observation_digest":"sha256:2fd8bc1f99f9b2130facf3e83aaf6281036dc3b1328368ecc09ee01e69d01b50","observation_id":"88b04ae8-eea4-4a3f-ad7b-760a37799735","resolution":{"observed_at":"2026-05-13T13:27:50.191417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2604.18518","last_updated":"2026-05-28T03:18:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:16:50Z","title":"UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-05T11:32:38.636335Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2604.18518"},"observation_digest":"sha256:f4d04dbfc2b584dbb7b6ac629d68d1191fa890fe6f5ae297dd46e79afe5ca345","observation_id":"b81c3fca-2bca-4437-979b-38122cd35747","resolution":{"observed_at":"2026-07-05T11:41:02.741472Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2604.19009","last_updated":"2026-04-21T02:57:13Z","snapshot_observed_at":"2026-07-06T23:05:44.499005Z","submitted_at":"2026-04-21T02:57:13Z","title":"Guiding Distribution Matching Distillation with Gradient-Based Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:35.600729Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2604.19009"},"observation_digest":"sha256:8c4175752067a97751bd95751cb7930591c37a58add64223349a36340b2d3622","observation_id":"e3c64190-649a-461e-bfc7-1c22d6f3af1d","resolution":{"observed_at":"2026-05-13T13:27:50.191417Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2604.19234","last_updated":"2026-04-27T09:55:01Z","snapshot_observed_at":"2026-07-06T23:05:53.378585Z","submitted_at":"2026-04-21T08:37:13Z","title":"Learning to Credit the Right Steps: Objective-aware Process Optimization for Visual Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:26.580964Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2604.19234"},"observation_digest":"sha256:54746769b3ff7d2303be9d0b8536e9b01ea8237e2603fd8d5855b691473ef01e","observation_id":"90700c28-8da6-4ce7-a47a-60532904e19c","resolution":{"observed_at":"2026-05-13T13:27:50.191417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2604.20816","last_updated":"2026-04-22T17:44:56Z","snapshot_observed_at":"2026-07-06T23:07:31.559812Z","submitted_at":"2026-04-22T17:44:56Z","title":"ParetoSlider: Diffusion Models Post-Training for Continuous Reward Control","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T00:20:07.566207Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2604.20816"},"observation_digest":"sha256:9d552313a0988670c77a479e0b83fb284530b09bb1e2396de518b6ce475a87ba","observation_id":"bba641cb-c427-41bf-9519-cd9c2fdfe80a","resolution":{"observed_at":"2026-05-13T13:27:50.191417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2604.23380","last_updated":"2026-04-25T17:03:21Z","snapshot_observed_at":"2026-07-06T23:09:38.799345Z","submitted_at":"2026-04-25T17:03:21Z","title":"V-GRPO: Online Reinforcement Learning for Denoising Generative Models Is Easier than You Think","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T08:27:17.629238Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2604.23380"},"observation_digest":"sha256:3a244ea925bd87c4c62ca039b1997910d47092c2d62bc54f52c47e23bd686772","observation_id":"bfd9da75-e88f-4a31-adab-0d2c1ca98e54","resolution":{"observed_at":"2026-05-13T13:27:50.191417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2604.24171","last_updated":"2026-04-27T08:29:52Z","snapshot_observed_at":"2026-07-06T23:10:16.426836Z","submitted_at":"2026-04-27T08:29:52Z","title":"POCA: Pareto-Optimal Curriculum Alignment for Visual Text Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T04:37:41.629935Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2604.24171"},"observation_digest":"sha256:c9228f56442c601ceafa17bdfcd5b0a96f11d9479cd4ae7f1ffbfb014cec7dda","observation_id":"3f1a5258-6228-419a-84c8-3d07a7c769f9","resolution":{"observed_at":"2026-05-13T13:27:50.191417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2604.25427","last_updated":"2026-04-28T09:34:51Z","snapshot_observed_at":"2026-07-06T23:11:16.247497Z","submitted_at":"2026-04-28T09:34:51Z","title":"A Systematic Post-Train Framework for Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-07T16:58:33.014401Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2604.25427"},"observation_digest":"sha256:0f2a3e5c5242c9749b01356aefe2d62341229566d04b5a45a87f4966060b53f8","observation_id":"736447ae-cdb4-46ed-abd0-37fdbfa90f61","resolution":{"observed_at":"2026-05-13T13:27:50.191417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.06583","last_updated":"2026-05-07T17:12:47Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:12:47Z","title":"Improved techniques for fine-tuning flow models via adjoint matching: a deterministic control pipeline","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T09:45:00.759474Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.06583"},"observation_digest":"sha256:ded350dbdd897556bdaa86cd25bc334655a5022ce60823d073b3cd79a5e34067","observation_id":"a338c0d7-c605-4c99-b51b-1e3dca32e9af","resolution":{"observed_at":"2026-05-13T13:27:50.191417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.07503","last_updated":"2026-05-08T09:37:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T09:37:46Z","title":"Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T01:58:25.291448Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.07503"},"observation_digest":"sha256:f62697d41bfc2c110d527ff9607687d556b21a81f8c3df2b37fc766085e2845e","observation_id":"bcdb6f22-f8a1-47fe-9494-6e1a8e4d7ab4","resolution":{"observed_at":"2026-05-13T13:27:50.191417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.07861","last_updated":"2026-07-30T09:16:55Z","snapshot_observed_at":"2026-08-02T23:16:55.077063Z","submitted_at":"2026-05-08T15:21:43Z","title":"From Synthetic to Real: Toward Identity-Consistent Makeup Transfer with Synthetic and Real Data","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-11T02:22:55.682373Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.07861"},"observation_digest":"sha256:795ec96404ace365d870e729e2e1c469f662e8aacfa3774d99ed32f63ceb53a3","observation_id":"8fc19dc2-52cf-42ed-bf8a-91bfd7807841","resolution":{"observed_at":"2026-05-13T13:27:50.191417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-08-02T14:39:01.164974Z","title":"Mixgrpo: Unlocking flow-based grpo efficiency with mixed ode-sde,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.07861","last_updated":"2026-07-30T09:16:55Z","snapshot_observed_at":"2026-08-02T23:16:55.077063Z","submitted_at":"2026-05-08T15:21:43Z","title":"From Synthetic to Real: Toward Identity-Consistent Makeup Transfer with Synthetic and Real Data","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:01.164974Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.07861"},"observation_digest":"sha256:d593b867b73b5f68310c157adbae1b2a44eaae16069c24a323dc113a2118d605","observation_id":"93266165-4672-47ae-b828-907094e9e052","resolution":{"observed_at":"2026-08-02T14:39:01.164974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.08063","last_updated":"2026-05-24T05:25:48Z","snapshot_observed_at":"2026-08-02T18:58:31.704300Z","submitted_at":"2026-05-08T17:50:15Z","title":"Flow-OPD: On-Policy Distillation for Flow Matching Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T02:04:16.335479Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.08063"},"observation_digest":"sha256:5e8d06ac50d449e0a7cf1108fbff0df834e4dd2bd71f20ed96114bfa8d18af95","observation_id":"d57b77dc-2fd1-4040-9b6e-0da1eb9e5bc7","resolution":{"observed_at":"2026-05-13T13:27:50.191417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.08063","last_updated":"2026-05-24T05:25:48Z","snapshot_observed_at":"2026-08-02T18:58:31.704300Z","submitted_at":"2026-05-08T17:50:15Z","title":"Flow-OPD: On-Policy Distillation for Flow Matching Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T01:17:08.955601Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.08063"},"observation_digest":"sha256:83e7e20430f95f9f7902ebb191ff66370b128eaf9d3f94e08137be400300faa2","observation_id":"2c9671d1-f1f9-4855-a4e7-cdf8b1d98f26","resolution":{"observed_at":"2026-05-13T13:27:50.191417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.08063","last_updated":"2026-05-24T05:25:48Z","snapshot_observed_at":"2026-08-02T18:58:31.704300Z","submitted_at":"2026-05-08T17:50:15Z","title":"Flow-OPD: On-Policy Distillation for Flow Matching Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T05:52:26.736304Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.08063"},"observation_digest":"sha256:e379d912432df12d6405050e45fbced82bf0402eeffb5a6aa40b3d09cd10c0e6","observation_id":"5597444f-8c92-4e6a-b515-67b915947f29","resolution":{"observed_at":"2026-05-15T05:55:05.190840Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.08063","last_updated":"2026-05-24T05:25:48Z","snapshot_observed_at":"2026-08-02T18:58:31.704300Z","submitted_at":"2026-05-08T17:50:15Z","title":"Flow-OPD: On-Policy Distillation for Flow Matching Models","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T22:39:32.496303Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.08063"},"observation_digest":"sha256:d45c38c58cc04b5ba4b6249383bf34384b44c36940049810f87735b97c946ce0","observation_id":"6c153ea5-bd1d-4d84-b42e-757fcff11932","resolution":{"observed_at":"2026-05-20T22:43:51.732869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.08063","last_updated":"2026-05-24T05:25:48Z","snapshot_observed_at":"2026-08-02T18:58:31.704300Z","submitted_at":"2026-05-08T17:50:15Z","title":"Flow-OPD: On-Policy Distillation for Flow Matching Models","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T23:02:29.120150Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.08063"},"observation_digest":"sha256:3aa4ec5dea85e83c0bbb8c1a411142ad08b38cae0eefde03579863a6f6f87770","observation_id":"468b2dac-b30a-4bec-88eb-4ca16c29c1ce","resolution":{"observed_at":"2026-06-30T23:05:07.197061Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.10937","last_updated":"2026-05-11T17:59:25Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-11T17:59:25Z","title":"Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-12T03:33:40.994346Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.10937"},"observation_digest":"sha256:388c70a0d19cf9d53d7ab5f6e1a5bd0e4dbded805fad55bcfb8d56d863484e50","observation_id":"ce58009f-87c4-4e77-8b9a-01e38797136e","resolution":{"observed_at":"2026-05-13T13:27:50.191417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.10983","last_updated":"2026-05-13T08:00:49Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-09T04:41:02Z","title":"TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T07:36:16.811765Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.10983"},"observation_digest":"sha256:b9211a503ce1ab1b763c925bcdd088d932ace16483101e558ff7640eb76d3129","observation_id":"f9cf8ee5-bc33-4dcd-afc6-d767ea10d7d3","resolution":{"observed_at":"2026-05-13T13:27:50.191417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.10983","last_updated":"2026-05-13T08:00:49Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-09T04:41:02Z","title":"TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T22:01:21.695270Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.10983"},"observation_digest":"sha256:146d2faa937e461eaba346398c9884c5e25dec90e98b6ff898a21367d171ead9","observation_id":"73ca1cca-241d-4049-b55e-7618a2156398","resolution":{"observed_at":"2026-05-14T22:03:02.895835Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.12112","last_updated":"2026-05-12T13:29:10Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T13:29:10Z","title":"When Policy Entropy Constraint Fails: Preserving Diversity in Flow-based RLHF via Perceptual Entropy","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T05:50:13.653022Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.12112"},"observation_digest":"sha256:4f7aadfb5a7000ce9dcf64237f2abc5420408f0db93628e3d29c967e729cd7e9","observation_id":"5f30d301-1923-4535-a409-a8a487eebc22","resolution":{"observed_at":"2026-05-13T13:27:50.191417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-12T16:57:23.214654Z","title":"Mixgrpo: Unlocking flow-based grpo efficiency with mixed ode-sde.arXiv preprint arXiv:2507.21802,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.12479","last_updated":"2026-07-06T08:55:19Z","snapshot_observed_at":"2026-07-12T16:57:22.059952Z","submitted_at":"2026-05-12T17:56:29Z","title":"Cutting rules in strong field QED with application to trident pair production","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T16:57:23.214654Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.12479"},"observation_digest":"sha256:51af7fdd1f8d94a9024d2ce3decca5304630ee7b6195ac18d12c63c32af9d507","observation_id":"32ae3a70-7185-4e87-a0fc-c041f32ff129","resolution":{"observed_at":"2026-07-12T16:57:23.214654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.12480","last_updated":"2026-05-12T17:56:59Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:56:59Z","title":"OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T06:16:20.612291Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.12480"},"observation_digest":"sha256:cc92f4984d5fdbe45825054716ff9f046727575c366ab57bd71f17d6dbae921a","observation_id":"855ab3cb-01ab-4590-87a2-c7f8f7a414ae","resolution":{"observed_at":"2026-05-13T13:27:50.191417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.14274","last_updated":"2026-05-14T02:18:58Z","snapshot_observed_at":"2026-08-02T20:54:21.208623Z","submitted_at":"2026-05-14T02:18:58Z","title":"CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T02:42:08.454469Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.14274"},"observation_digest":"sha256:1c1aa719136051915c5889645ebf34942e8942698d94d8b0f630c7447b2b0ec6","observation_id":"468f52a0-de5f-4cb4-b2c3-dccf3828645c","resolution":{"observed_at":"2026-05-15T02:43:33.349146Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.15055","last_updated":"2026-05-14T16:49:09Z","snapshot_observed_at":"2026-08-01T03:43:04.469611Z","submitted_at":"2026-05-14T16:49:09Z","title":"DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T21:20:23.420424Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.15055"},"observation_digest":"sha256:03d340964b250b4d09dac698bfff668232f7054345a3e60c0fb7616d045c42b2","observation_id":"55647549-b283-424b-9c35-f1bfbd389a0b","resolution":{"observed_at":"2026-07-01T14:25:46.847896Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.15803","last_updated":"2026-05-15T09:56:40Z","snapshot_observed_at":"2026-07-06T23:27:01.213106Z","submitted_at":"2026-05-15T09:56:40Z","title":"Embedding-perturbed Exploration Preference Optimization for Flow Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T18:33:52.933672Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.15803"},"observation_digest":"sha256:c6714ee89c44b7ba83ffcd921c58c3c2cefc1301876497886be9c4a1c1f31bee","observation_id":"d70f820d-e498-43bc-a274-9d435c689212","resolution":{"observed_at":"2026-05-20T18:38:53.005025Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.15980","last_updated":"2026-06-16T09:11:40Z","snapshot_observed_at":"2026-08-02T13:28:26.201564Z","submitted_at":"2026-05-15T14:13:39Z","title":"Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T18:28:06.253200Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.15980"},"observation_digest":"sha256:0d4660af84403fd1b512ce68ad164740af939d16d797b65962e62ef79ab370e6","observation_id":"efb5db7c-1705-4114-aaba-935d92d56471","resolution":{"observed_at":"2026-05-20T18:28:52.878331Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.15980","last_updated":"2026-06-16T09:11:40Z","snapshot_observed_at":"2026-08-02T13:28:26.201564Z","submitted_at":"2026-05-15T14:13:39Z","title":"Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T19:37:18.563704Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.15980"},"observation_digest":"sha256:de1d1bbe04e3ed308b33437d7a86a3801270e83c5fac304b56e92967b1d09469","observation_id":"a05b6ca9-d166-4486-bcb5-78a9f618a840","resolution":{"observed_at":"2026-06-30T19:45:00.963959Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.16951","last_updated":"2026-05-16T12:05:39Z","snapshot_observed_at":"2026-08-02T16:28:04.937142Z","submitted_at":"2026-05-16T12:05:39Z","title":"Edit-GRPO: A Locality-Preserving Policy Optimization Framework for Image Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T20:44:54.356658Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.16951"},"observation_digest":"sha256:5094b2d6bddb20a01a90db4530bd9bab79f4f9369445563d43ad4118a23e63b7","observation_id":"9cc0f2aa-b08e-4eae-a45c-7badd3bee755","resolution":{"observed_at":"2026-05-19T20:47:45.812492Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.18365","last_updated":"2026-05-18T13:17:08Z","snapshot_observed_at":"2026-08-02T07:31:08.555715Z","submitted_at":"2026-05-18T13:17:08Z","title":"GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T11:06:09.367559Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.18365"},"observation_digest":"sha256:fa251287bd195a2ec581bb073208899a74aeffc83b3e8c0f88fe2f12292f14e7","observation_id":"63515aaa-78d0-4b25-a5ce-13a7999f49db","resolution":{"observed_at":"2026-05-20T11:08:13.618209Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.19839","last_updated":"2026-06-04T12:21:01Z","snapshot_observed_at":"2026-07-06T23:30:30.141040Z","submitted_at":"2026-05-19T13:35:11Z","title":"When Preference Labels Fall Short: Aligning Diffusion Models from Real Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T06:13:01.821585Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.19839"},"observation_digest":"sha256:b6d47c0478028ca303437f4c95e2c8e5b7aceb167a619ad0d57cf45f9c29144f","observation_id":"ba26cc4b-fcee-4cf5-b73b-35389681885b","resolution":{"observed_at":"2026-05-20T06:13:05.210482Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.19839","last_updated":"2026-06-04T12:21:01Z","snapshot_observed_at":"2026-07-06T23:30:30.141040Z","submitted_at":"2026-05-19T13:35:11Z","title":"When Preference Labels Fall Short: Aligning Diffusion Models from Real Data","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T18:12:11.972394Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.19839"},"observation_digest":"sha256:74e1bfa6661d6866ab169a763be6cd4fb6ed59394b0d245c2c367f6697f7d388","observation_id":"f8a0a477-8269-4383-a70f-699545078023","resolution":{"observed_at":"2026-06-30T18:14:59.853209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.21573","last_updated":"2026-05-20T17:59:58Z","snapshot_observed_at":"2026-08-02T08:45:09.575827Z","submitted_at":"2026-05-20T17:59:58Z","title":"Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-22T09:34:14.596976Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.21573"},"observation_digest":"sha256:b6ddb07b5271caa5d3166df0f672f4f6b8c535cb9a7e1aa18ebc971587cf11e8","observation_id":"1752c659-afff-4df8-939c-1aec8eda54e4","resolution":{"observed_at":"2026-05-22T09:34:46.735661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.23522","last_updated":"2026-05-22T11:37:22Z","snapshot_observed_at":"2026-08-06T01:21:06.575636Z","submitted_at":"2026-05-22T11:37:22Z","title":"Precise: SDE-Consistent Stochastic Sampling for RL Post-Training of Flow-Matching Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T05:05:09.178674Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.23522"},"observation_digest":"sha256:1cde3c5269148ea72a112af35bf085f914320eba70c5396b90b4cd4b3d54f722","observation_id":"df2e6ac4-d499-4423-8150-6227bcdf5474","resolution":{"observed_at":"2026-05-25T05:05:22.231265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.23903","last_updated":"2026-05-22T17:59:43Z","snapshot_observed_at":"2026-07-06T23:34:03.934151Z","submitted_at":"2026-05-22T17:59:43Z","title":"Geo-Align: Video Generation Alignment via Metric Geometry Reward","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-25T04:15:58.667672Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.23903"},"observation_digest":"sha256:14a7dcca4f89f97c54eb63b76d0bdcabee6f986c0778c1316598c989f46f069d","observation_id":"c528e01b-bc56-4c96-a91f-4d0b9bd8f1ff","resolution":{"observed_at":"2026-05-25T04:16:35.919678Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.25661","last_updated":"2026-06-24T00:40:46Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:11:32Z","title":"DRM: Diffusion-based Reward Model With Step-wise Guidance","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T22:12:39.225557Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.25661"},"observation_digest":"sha256:61fe9b2fa12d0bf773630d5f04416998526b650301a81951a91e9652b0efce69","observation_id":"cd05b501-623e-4bdb-a0c9-479db4f63265","resolution":{"observed_at":"2026-06-29T22:13:59.368093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.26013","last_updated":"2026-05-25T16:32:14Z","snapshot_observed_at":"2026-08-02T15:05:50.635281Z","submitted_at":"2026-05-25T16:32:14Z","title":"AdvantageFlow: Advantage-Weighted Least Squares for RL in Flow Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T22:44:25.152451Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.26013"},"observation_digest":"sha256:0b3438feee8c3d948ae89e49fb75bb8ff6934366a0184bcabd4828f3247511f4","observation_id":"b4459e72-fced-4a42-a3fc-3296ee2c0b17","resolution":{"observed_at":"2026-06-29T22:54:01.609833Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.26108","last_updated":"2026-06-06T16:11:19Z","snapshot_observed_at":"2026-08-02T21:36:48.643552Z","submitted_at":"2026-05-25T17:59:21Z","title":"Reinforcing Few-step Generators via Reward-Tilted Distribution Matching","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T22:21:06.005125Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.26108"},"observation_digest":"sha256:1e6a77cbf29f76e1c971ed9781de04f087b3904313f56198f24c8a88cc0b26e9","observation_id":"bd0106ab-4678-4d3f-8003-e469bb976eaa","resolution":{"observed_at":"2026-06-29T22:24:00.289147Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.27736","last_updated":"2026-05-26T22:20:51Z","snapshot_observed_at":"2026-08-02T16:25:15.479630Z","submitted_at":"2026-05-26T22:20:51Z","title":"Explicit Critic Guidance for Aligning Diffusion Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T18:18:46.456767Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.27736"},"observation_digest":"sha256:1af64da3ccb720447fba2591d0ad9f74f176ae659c07f330940e3f46142361e8","observation_id":"a0129766-898d-45d3-8dfc-f094de0ae7c7","resolution":{"observed_at":"2026-06-29T18:23:50.784073Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2605.28691","last_updated":"2026-05-27T16:19:45Z","snapshot_observed_at":"2026-07-06T23:38:14.056361Z","submitted_at":"2026-05-27T16:19:45Z","title":"OSP-Next: Efficient High-Quality Video Generation with Sparse Sequence Parallelism, HiF8 Quantization, and Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T13:06:02.201607Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2605.28691"},"observation_digest":"sha256:6ea2df149111f4700281eed275c9d2bfb78306eb40cdf2aedf32ce1b1914e9d8","observation_id":"2d926ce6-48ee-481b-9013-ece376fcfbb9","resolution":{"observed_at":"2026-06-29T13:13:27.508475Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2606.01636","last_updated":"2026-06-01T03:41:04Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T03:41:04Z","title":"Pave-GRPO: Beyond Instantaneous Guidance through Principled Average Velocity Decomposition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T15:33:30.182150Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2606.01636"},"observation_digest":"sha256:f2d8bb22801ff9cf926fc3159d39cbdaacaa55ca85e5f54953b58131c8a1a376","observation_id":"37a9e35d-a975-4f49-bfbc-c02194b2263b","resolution":{"observed_at":"2026-07-01T22:16:16.516711Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2606.01985","last_updated":"2026-06-01T09:46:10Z","snapshot_observed_at":"2026-08-05T13:43:57.622962Z","submitted_at":"2026-06-01T09:46:10Z","title":"MT-EditFlow: Reinforcement Learning for Multi-Turn Image Editing with Flow Matching","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T15:07:29.897089Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2606.01985"},"observation_digest":"sha256:8d502c5b9660674c74e1201c06c3eb71ed2e85da9e32ee3bc599e1eab5bc95d1","observation_id":"437e2a9d-64fa-4988-af77-6536d4439b9e","resolution":{"observed_at":"2026-07-01T22:46:18.571746Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2606.06828","last_updated":"2026-06-05T02:07:08Z","snapshot_observed_at":"2026-08-04T19:25:01.419366Z","submitted_at":"2026-06-05T02:07:08Z","title":"AdaGRPO: A Capability-Aware Adaptive Enhancement for Flow-based GRPO","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T22:54:21.740892Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2606.06828"},"observation_digest":"sha256:44bfa2e6116bad1eca6fe69b380b8847ed1ee329caec48e2a7b3103ded91a8ad","observation_id":"a72b6175-15ee-47cc-90b7-7df0a9ad454c","resolution":{"observed_at":"2026-07-02T16:17:08.889278Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2606.11025","last_updated":"2026-06-27T07:44:26Z","snapshot_observed_at":"2026-08-01T15:53:07.919626Z","submitted_at":"2026-06-09T15:59:57Z","title":"Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T14:20:02.171646Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2606.11025"},"observation_digest":"sha256:0bed2e225ba77fa02a82fca8333c3b8c291b61a7be8b516644196c1e70443b3e","observation_id":"0e5f2a0e-f460-406a-97ab-d3c6796ba186","resolution":{"observed_at":"2026-07-03T03:57:38.720346Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2606.11025","last_updated":"2026-06-27T07:44:26Z","snapshot_observed_at":"2026-08-01T15:53:07.919626Z","submitted_at":"2026-06-09T15:59:57Z","title":"Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T10:52:23.199230Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2606.11025"},"observation_digest":"sha256:652294666e1cd8b24d18fb3f1e3588a10740733ec7b9b07ea18814ef718e1d0a","observation_id":"61854866-0511-4415-a68f-919c5c15d9ac","resolution":{"observed_at":"2026-06-30T10:54:36.260111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2606.11075","last_updated":"2026-06-09T16:36:54Z","snapshot_observed_at":"2026-08-04T12:50:25.323212Z","submitted_at":"2026-06-09T16:36:54Z","title":"Exploring the Design Space of Reward Backpropagation for Flow Matching","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-27T14:10:05.247255Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2606.11075"},"observation_digest":"sha256:0a3200fcf56d2f98cba9e7e3ee911cbbb3e7f2300188417ab3a1c98f87eb37da","observation_id":"609fe4fd-6705-4c20-9a2e-e2f9d73ebfe8","resolution":{"observed_at":"2026-07-03T04:07:36.933061Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2606.12072","last_updated":"2026-06-10T13:40:19Z","snapshot_observed_at":"2026-08-02T21:32:50.432496Z","submitted_at":"2026-06-10T13:40:19Z","title":"World Model Self-Distillation: Training World Models to Solve General Tasks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T10:16:35.511426Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2606.12072"},"observation_digest":"sha256:ca81ae1153deec2d74c701d9a118dafcf7117f4fb362c6deb54f82df7c62a2dd","observation_id":"48ba4b77-2f01-49bd-af98-c50553121878","resolution":{"observed_at":"2026-07-03T10:07:55.841847Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2606.18066","last_updated":"2026-06-27T17:15:25Z","snapshot_observed_at":"2026-08-06T02:24:45.543228Z","submitted_at":"2026-06-16T15:38:44Z","title":"NoiseTilt: Noise-Tilted Reverse Kernels for Diffusion Reward Alignment","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:38.142556Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2606.18066"},"observation_digest":"sha256:4f2b73830b1468ab9ecf7d287cf7e324b51f9b20966e61ffabf06b14a5be4c52","observation_id":"70a60581-f4d6-40d4-a357-69d25c55e494","resolution":{"observed_at":"2026-07-03T20:18:57.221211Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2606.18066","last_updated":"2026-06-27T17:15:25Z","snapshot_observed_at":"2026-08-06T02:24:45.543228Z","submitted_at":"2026-06-16T15:38:44Z","title":"NoiseTilt: Noise-Tilted Reverse Kernels for Diffusion Reward Alignment","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T10:50:59.642305Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2606.18066"},"observation_digest":"sha256:157bf17575048344f47ff4fafad16739cb95277f4229518ba5522a682e1e8797","observation_id":"cad39056-3b68-460c-baba-dbdddb955a15","resolution":{"observed_at":"2026-06-30T10:54:36.441526Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2606.19103","last_updated":"2026-06-17T14:16:47Z","snapshot_observed_at":"2026-08-01T15:51:00.577428Z","submitted_at":"2026-06-17T14:16:47Z","title":"ProductConsistency: Improving Product Identity Preservation in Instruction-Based Image Editing via SFT and RL","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T21:17:04.368521Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2606.19103"},"observation_digest":"sha256:3a4532687fb677ecb5bd83aa663cdeb780d2d141e8a5c3899b2c095a0bec5026","observation_id":"9fae1f0b-4bcc-49b0-9fd9-b6bee223b777","resolution":{"observed_at":"2026-07-04T00:19:13.588700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:69e52c40d06dee6a18a0c3b161a85087143d031c0f09fe70d8b9dfb35ec16507","observation_id":"5062f946-8457-42e9-ae6b-1b72b58035e6","resolution":{"observed_at":"2026-07-04T06:19:37.820856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2606.23190","last_updated":"2026-07-08T11:35:21Z","snapshot_observed_at":"2026-08-01T13:42:52.335393Z","submitted_at":"2026-06-22T11:37:45Z","title":"FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T07:02:36.499424Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2606.23190"},"observation_digest":"sha256:b09498eae46772ffa90286134c2c2a0e52c8975295375e101b294ea12881a1a2","observation_id":"5624ce66-2b0c-4222-982d-456237860547","resolution":{"observed_at":"2026-07-04T12:19:49.613140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-12T12:44:20.831164Z","title":"Mixgrpo: Unlocking flow-based grpo efficiency with mixed ode- sde,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.23190","last_updated":"2026-07-08T11:35:21Z","snapshot_observed_at":"2026-08-01T13:42:52.335393Z","submitted_at":"2026-06-22T11:37:45Z","title":"FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T12:44:20.831164Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2606.23190"},"observation_digest":"sha256:8958b7af7a7b3154ee3b82a2efcb418e7f810c0a061cc68909925a12838de691","observation_id":"76eea894-a3c4-41fc-a8b5-5126fd13f79d","resolution":{"observed_at":"2026-07-12T12:44:20.831164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2606.23950","last_updated":"2026-06-22T21:22:42Z","snapshot_observed_at":"2026-08-03T10:32:13.705652Z","submitted_at":"2026-06-22T21:22:42Z","title":"DivRL: Disentangled Self-Similarity Rewards for Diverse Subject-Driven Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T08:37:11.052296Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2606.23950"},"observation_digest":"sha256:0e54c9e345a067695df6e87117d36bffa356cfb3c1355f7cbec382416817ade8","observation_id":"a2707351-81d3-434d-8039-c8d1d9778a81","resolution":{"observed_at":"2026-07-04T10:39:45.613142Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2606.24888","last_updated":"2026-06-23T17:59:55Z","snapshot_observed_at":"2026-07-06T23:59:23.407216Z","submitted_at":"2026-06-23T17:59:55Z","title":"DiffusionBench: On Holistic Evaluation of Diffusion Transformers","version":1},"reference_index":200,"source":"arxiv_source","source_observed_at":"2026-06-26T00:06:11.951205Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2606.24888"},"observation_digest":"sha256:6aceaba58283c2e5349606c71326810709b8fd1507e43848adbc0070644b8b08","observation_id":"e3627ee1-7ffe-420d-aa21-474501174cef","resolution":{"observed_at":"2026-07-04T16:59:58.067786Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2606.27752","last_updated":"2026-06-26T06:15:04Z","snapshot_observed_at":"2026-07-07T00:01:54.432346Z","submitted_at":"2026-06-26T06:15:04Z","title":"PerturbCellRL: Verifier-Guided Reinforcement Learning for Single-Cell Perturbation Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T05:11:09.189141Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2606.27752"},"observation_digest":"sha256:8c028f9da3dec7991b4d4f0a1bda19f8e03364a07a08f1278ed75b6606720e62","observation_id":"b9e3b56f-6cd3-4e37-bcec-ca53fad28eb4","resolution":{"observed_at":"2026-06-29T18:13:49.499985Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2606.28016","last_updated":"2026-07-02T07:14:50Z","snapshot_observed_at":"2026-07-07T00:02:09.217954Z","submitted_at":"2026-06-26T12:19:28Z","title":"TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T04:46:48.414652Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2606.28016"},"observation_digest":"sha256:bbd93dbe55d85701ff5b5d8e977deb5ec169425bc5d2a63ba049802315dd36e9","observation_id":"1fc2db18-0be0-43bf-964d-710ba3fadc86","resolution":{"observed_at":"2026-06-29T19:13:53.597642Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2606.28016","last_updated":"2026-07-02T07:14:50Z","snapshot_observed_at":"2026-07-07T00:02:09.217954Z","submitted_at":"2026-06-26T12:19:28Z","title":"TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-03T22:38:33.557109Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2606.28016"},"observation_digest":"sha256:4cd4e5978730999b22a1a4a83435ae3cb7417aa2aa330119e828fb10f0e38cc5","observation_id":"6ab7d8e5-3320-4773-a77c-4dec285beb5d","resolution":{"observed_at":"2026-07-03T22:39:01.000105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2606.29820","last_updated":"2026-06-29T05:57:33Z","snapshot_observed_at":"2026-08-02T04:45:58.960142Z","submitted_at":"2026-06-29T05:57:33Z","title":"Dual-Flow Reinforcement Learning with State-Aware Exploration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T07:16:11.130271Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2606.29820"},"observation_digest":"sha256:b5453db41e3b838b5f0819717db1a3d35ec5ce4f6cb4f9a371da62fdd50bc7a8","observation_id":"d3310fa1-5aeb-4d6b-936a-80a7e48e8dd3","resolution":{"observed_at":"2026-06-30T07:24:21.809233Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2606.30376","last_updated":"2026-06-29T14:37:36Z","snapshot_observed_at":"2026-08-07T13:52:35.062571Z","submitted_at":"2026-06-29T14:37:36Z","title":"FlowAWR: Online Adaptive Flow Reinforcement via Advantage-Weighted Rectification","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T07:10:44.244790Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2606.30376"},"observation_digest":"sha256:9a92144357f28822098aa9623e20d06f36d3e96144e17430b9eb8577b4fad216","observation_id":"76415a70-29e8-403c-af69-5e4bde012122","resolution":{"observed_at":"2026-06-30T07:14:20.929455Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2607.00535","last_updated":"2026-07-01T07:25:11Z","snapshot_observed_at":"2026-08-06T03:17:20.582756Z","submitted_at":"2026-07-01T07:25:11Z","title":"Flow-Map GRPO: Reinforcement Learning for Few-Step Flow-Map Generators via Anchored Stochastic Composition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-02T16:04:19.371174Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2607.00535"},"observation_digest":"sha256:41a4b5aadb46cc46a97e4b494d940215d93465ee79019347a06dfe6be49ddfb4","observation_id":"8eb68b51-b172-464a-badd-d9190ae1d604","resolution":{"observed_at":"2026-07-02T16:07:08.231157Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2607.02291","last_updated":"2026-07-02T15:08:56Z","snapshot_observed_at":"2026-08-07T15:44:37.020127Z","submitted_at":"2026-07-02T15:08:56Z","title":"Optimizing Visual Generative Models via Distribution-wise Rewards","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-03T16:39:12.711424Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2607.02291"},"observation_digest":"sha256:122add94ed24c8b522cb002d590bd27142b1a413e8bdc6dc103793e7cf70f661","observation_id":"12a2d7a1-f1aa-40e8-8727-6e7ffa67f43f","resolution":{"observed_at":"2026-07-03T16:48:39.749308Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:94f9cbd60c5fc28928fef1eede052ea7acad09ff7e713875af71790e40c4cde1","observation_id":"eeef1473-3eaf-4837-88a0-1ef8999344ec","resolution":{"observed_at":"2026-07-09T03:05:55.325140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-08-01T18:56:58.829878Z","title":"Mixgrpo: Unlocking flow-based grpo efficiency with mixed ode-sde.arXiv preprint arXiv:2507.21802, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-07T11:54:07.268424Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:58.829878Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:10406ae6cd78fe34344bd122b263b531b802eeec6b6de3e238c0a5931b044e1b","observation_id":"9a09be2e-4f18-419a-82e3-e1b14bb4f540","resolution":{"observed_at":"2026-08-01T18:56:58.829878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-08-01T17:41:00.353583Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17572","last_updated":"2026-07-25T08:59:31Z","snapshot_observed_at":"2026-08-03T13:23:48.122079Z","submitted_at":"2026-07-20T05:30:40Z","title":"JAGG: Jacobian-Aggregated Group Gradient for Efficient GRPO Training of Diffusion Models","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-01T17:41:00.353583Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2607.17572"},"observation_digest":"sha256:8d1599aaf0fdce7e8246cdc7b903c24d3b0d526d30cfb42d526906f893869a52","observation_id":"d44aa620-02de-4478-9c35-374604cc2efd","resolution":{"observed_at":"2026-08-01T17:41:00.353583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.21802/citation-record","integrity":"/paper/2507.21802/integrity","json":"/paper/2507.21802/citation-record.json","paper":"/paper/2507.21802"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08797","last_updated":"2025-10-09T00:43:44Z","snapshot_observed_at":"2026-07-06T15:03:52.079498Z","submitted_at":"2023-03-15T17:43:42Z","title":"Stochastic Interpolants: A Unifying Framework for Flows and Diffusions","version":4},"cited_work":{"arxiv_id":"2303.08797","doi":"10.48550/arxiv.2303.08797","metadata_source":"pith","pith_arxiv_id":"2303.08797","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stochastic Interpolants: A Unifying Framework for Flows and Diffusions","venue":"cs.LG","work_id":"c2c7dd8f-fbfb-4591-89ec-9a3a0e6744bd","year":2023},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"cited_paper":"/paper/2303.08797","citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:a13fb14d15833acee6f4486f68683328f1afd227091475f29f7e70143ab3bf6a","observation_id":"a6e645e7-5263-405f-afda-4269c5cfde73","resolution":{"observed_at":"2026-05-13T13:27:50.123522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Discount factor as a regularizer in reinforcement learning","venue":null,"work_id":"22ba94d3-5dfb-4fd8-baad-81770eea38db","year":2020},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:39b567c953e09bda7677a695361400a9bb8e6903019789cd86b22f6cecac253d","observation_id":"68d8ec45-ae93-4df7-9ce5-0aba8080296b","resolution":{"observed_at":"2026-05-13T13:27:50.152526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-01T15:43:51.739518Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2305.13301","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-07-08T19:25:32.506868Z","title":"Training Diffusion Models with Reinforcement Learning","venue":"cs.LG","work_id":"67684dda-3930-452a-b91a-36cbb8e2e219","year":2023},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:43e849f87df90f56acca7a29986134e07cbcb2edbc03b293eebf910563607308","observation_id":"ab25c8a0-027a-4ba0-b7c7-66fa228ce327","resolution":{"observed_at":"2026-05-13T13:27:50.100880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T09:16:07.203676Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"a92e35c5-be55-4ec3-80cd-8bf130aa79ac","year":null},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:edd700bb8fb85f7dd2452bb0b44f29452865dd8058a02a2725cea8b45d72f0d6","observation_id":"9e45b561-18ee-4719-b1f5-419c6aa564c8","resolution":{"observed_at":"2026-05-13T13:27:50.154396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13362","last_updated":"2024-09-19T20:42:34Z","snapshot_observed_at":"2026-08-06T14:39:49.972834Z","submitted_at":"2023-01-31T01:37:48Z","title":"Optimizing DDPM Sampling with Shortcut Fine-Tuning","version":4},"cited_work":{"arxiv_id":"2301.13362","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.13362","snapshot_observed_at":"2026-07-04T08:59:43.060142Z","title":"Optimizing ddpm sampling with shortcut fine-tuning.arXiv preprint arXiv:2301.13362","venue":null,"work_id":"cf8257fc-0ade-42ef-afc0-fe742cff11dd","year":2024},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"cited_paper":"/paper/2301.13362","citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:cf3d87300c42325176c6c9e5aee89f4fe9965b662ef1a2cad16313919e2b30b3","observation_id":"9fcc7767-544d-4831-bc52-de7205cd323a","resolution":{"observed_at":"2026-05-13T13:27:50.075708Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dpok: Reinforcement learning for fine-tuning text-to-image diffu- sion models.Advances in Neural Information Processing Systems, 36:79858–79885","venue":null,"work_id":"ef0f185c-2738-4305-962e-1ad0754c499a","year":2023},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:230c483a899147ecd13beb80f893f4ade680e79b341cc4e25f10ff338eadb562","observation_id":"9b3836f6-0050-4b5a-a985-4c8975a6be23","resolution":{"observed_at":"2026-05-13T13:27:50.156549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Murphy, and Tim Salimans","venue":null,"work_id":"eaad5692-c04c-42aa-85e0-966e9188fda5","year":2024},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:3b38a4c937b2f8b1bfbbd8c3e0c3ea34a230a06f696a3b9cbc0e9db3d2eb36a3","observation_id":"e6eb13b6-122a-4bba-ae32-163f0b45b68b","resolution":{"observed_at":"2026-05-13T13:27:50.158107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T06:40:46.077319Z","title":"Denoising dif- fusion probabilistic models.Advances in neural information processing systems, 33:6840–6851","venue":null,"work_id":"dc33f537-ecd6-42b5-a2ea-20dc21570779","year":2020},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:735384faaab7bd9d5483eacca5b03e5d222b830e35785994c0dfbb6f4eb33c1f","observation_id":"d0b89f61-0c5c-47b7-b0e6-93fd71225cee","resolution":{"observed_at":"2026-05-13T13:27:50.159961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3","venue":null,"work_id":"0bda7a5d-b170-43a9-937c-0eec954614a0","year":2022},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:90eceb91f5e501fd9a2515b50cc62caa33b09a9ef26c41cfcec1c62662715591","observation_id":"13f1ca0b-fe66-427b-9e49-ab08d0e12a3c","resolution":{"observed_at":"2026-05-13T13:27:50.161597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the role of discount factor in offline reinforcement learn- ing","venue":null,"work_id":"7f101735-1ad1-42d6-8a50-5c93a74749cf","year":2022},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:4c1febc9fb693b781811fee288602c049be0cfe0f8cac2a41a6b20285980775a","observation_id":"01590baa-ad40-4044-a802-d4b4ffc91cfe","resolution":{"observed_at":"2026-05-13T13:27:50.163557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Muon: An optimizer for hidden layers in neural networks","venue":null,"work_id":"86d5671e-ca5f-4733-b243-e01b7038e209","year":2024},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:54538ce4f26dadfae10f5abd60fb8e22935a03ff7f8160b5887cdd779fff0d62","observation_id":"7802b059-b72e-454c-9e67-8e9c86a27f21","resolution":{"observed_at":"2026-05-13T13:27:50.165632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Elucidating the design space of diffusion-based generative models.Advances in neural information processing systems, 35:26565–26577","venue":null,"work_id":"5f8fc69e-4965-453c-a1cd-d2352276ca9d","year":2022},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:c6d1d9cd693da686a5f47d8732bd7fa9d7ee3cea84e6f7f9c51269dd7b651971","observation_id":"44cef111-8c63-4cee-bda8-972882025dd2","resolution":{"observed_at":"2026-05-13T13:27:50.167439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation","venue":null,"work_id":"11761d92-7443-4f0c-a8ed-10bedef5d5d3","year":2023},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:01b4f98313cf2dc52c7075595efe9dca04060e1bd8457499df6e71375f903004","observation_id":"02e805f8-7857-48f4-9d6e-eec3f99e65e3","resolution":{"observed_at":"2026-05-13T13:27:50.169322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flux.https://github.com/ black-forest-labs/flux","venue":null,"work_id":"1edac7e6-fbbd-48be-bf40-7d25d47a006a","year":2024},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:b66315ff53db330f681bd4d5d77fc20ccd03914b10408f8d9c8d95e196cd3311","observation_id":"c0f2589a-66b5-43d3-9a22-5e409fac795c","resolution":{"observed_at":"2026-05-13T13:27:50.171071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":"2302.12192","doi":"10.48550/arxiv.2302.12192","metadata_source":"pith","pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Aligning Text-to-Image Models using Human Feedback","venue":"cs.LG","work_id":"39a08cdc-3986-4994-baf0-91e8ddf1b855","year":2023},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:96696e3964179b660ce18b7d85d3c4f2623db67e7a6db2c9890e9ac448d2f54f","observation_id":"f71c6218-2be7-42b8-a2f0-96400e795153","resolution":{"observed_at":"2026-05-14T20:39:15.590122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aes- thetic post-training diffusion models from generic prefer- ences with step-by-step preference optimization","venue":null,"work_id":"e4b58ed1-ff66-4460-9707-6598f9a04d83","year":2025},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:4bbbd2ac67b5e0447118ff19aa1e06c28d6ddd7ddb1c5edcd0fd5543c8b96d55","observation_id":"a8026d3a-7ea5-4952-86c1-209faa2ec33f","resolution":{"observed_at":"2026-05-13T13:27:50.172848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:cd7025c56d321aae0aa35ff542215da1f44df9b5d418e6b835068f078727f0d1","observation_id":"e68b3415-a2e0-496a-ae47-3e278e920962","resolution":{"observed_at":"2026-05-13T13:27:50.084181Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05470","last_updated":"2025-10-27T09:57:02Z","snapshot_observed_at":"2026-08-06T11:11:00.378627Z","submitted_at":"2025-05-08T17:58:45Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","version":5},"cited_work":{"arxiv_id":"2505.05470","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.05470","snapshot_observed_at":"2026-07-09T02:25:55.898592Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","venue":"cs.CV","work_id":"bf1e8e81-ff31-401a-a5dc-d9c49df168ab","year":2025},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"cited_paper":"/paper/2505.05470","citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:371f7d82083e4d25f58554c179ed9187b343ecc66032e63f7e0318e7b7a654c3","observation_id":"5bcd5663-6cd7-4c61-948b-8f4f6f33f526","resolution":{"observed_at":"2026-05-13T13:27:50.089562Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13918","last_updated":"2025-10-27T08:22:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-23T18:55:41Z","title":"Improving Video Generation with Human Feedback","version":2},"cited_work":{"arxiv_id":"2501.13918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.13918","snapshot_observed_at":"2026-07-04T13:19:51.115512Z","title":"Improving Video Generation with Human Feedback","venue":"cs.CV","work_id":"cfe4c01d-1cf7-4a00-ba86-06d583ca2cff","year":2025},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"cited_paper":"/paper/2501.13918","citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:58c65bb7acd2c5f4ad0114a4d5d1b98eac3d7fb0f5f3f2cb8dd87b3d08ef31e6","observation_id":"a7e2b88a-e714-48b1-8b17-154a4680fed5","resolution":{"observed_at":"2026-05-13T15:30:03.116566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":"2209.03003","doi":"10.48550/arxiv.2209.03003","metadata_source":"pith","pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","venue":"cs.LG","work_id":"a1989e1b-d66d-4533-be3a-fb9c5fd62290","year":2022},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:b32c144805e41e43852220c0a769d91ee21e0bffab8b0167ecdf3bb36da4eea9","observation_id":"56a82ff0-842a-45c4-9364-a2eca16dc7ee","resolution":{"observed_at":"2026-05-13T13:27:50.095685Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T22:49:29.244251+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T22:49:29.244251+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:5b3f152f286d267b2622a05335d38fe89c0ab969fdf2a72dcdf5e598506f2eb0","observation_id":"08338e1e-cf23-4266-9b4b-ab7decdcb2e6","resolution":{"observed_at":"2026-05-13T13:27:50.098208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps.Advances in Neural Information Processing Systems, 35:5775–5787","venue":null,"work_id":"e57a13f4-4720-4a41-b11f-f4bba1d8b83e","year":null},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:f579d734a9b1e81d32b419073650ab16dd6174f0c466ed7052bae1bda85c1042","observation_id":"bd3371fa-7d6f-432a-becc-3febbbf189ab","resolution":{"observed_at":"2026-05-13T13:27:50.174992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01095","last_updated":"2025-05-19T07:56:56Z","snapshot_observed_at":"2026-07-29T20:17:21.488997Z","submitted_at":"2022-11-02T13:14:30Z","title":"DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":"2211.01095","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01095","snapshot_observed_at":"2026-07-11T01:57:50.075044Z","title":"DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models","venue":"cs.LG","work_id":"a7e16614-fbfc-45d6-8fb6-714035cb707c","year":2022},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"cited_paper":"/paper/2211.01095","citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:f4238ae187a6525357a87f4ff57f62211ca7740d42408f9ebe33db99e1d0e3b5","observation_id":"69152a4d-ba6f-4b73-88b5-c0a5b3cc97f8","resolution":{"observed_at":"2026-05-16T07:54:11.877839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hpsv3: Towards wide-spectrum human preference score","venue":null,"work_id":"cbbd6378-e778-4696-b04d-73841bf68b80","year":null},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:82982eab9bd38de759fb7dc244fc848d2db4fca574c072150951599f5b43673b","observation_id":"57c13cb5-538d-4f6d-9f2d-53728ea26d6a","resolution":{"observed_at":"2026-05-13T13:27:50.176708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward hacking behavior can generalize across tasks—ai alignment forum","venue":null,"work_id":"d0a1bc81-0a3c-4b47-8a79-32e93e519818","year":2024},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:ddc826b25d64339357caed3d3c2278c082ac12cc53c2407801fdb3d40f36d0f2","observation_id":"bac5c7bc-42b5-42cc-a21f-5ea0ab4b7120","resolution":{"observed_at":"2026-05-13T13:27:50.178438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stochastic differential equations","venue":null,"work_id":"f9320409-a74c-4917-8d3e-5a3c8a6ea248","year":2003},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:b99ce7cdf2b9374b2cf001e30ec3773c5a8d093bc94d4dcd992fe6035c6f15c0","observation_id":"1539f7b2-1a2f-469e-bf57-d1dbd7a65d11","resolution":{"observed_at":"2026-05-13T13:27:50.180067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback.Ad- vances in neural information processing systems, 35:27730– 27744","venue":null,"work_id":"75beffa9-4586-4781-8be7-ab3b63f3caa2","year":2022},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:6ee7652e06614d5c9c00179708c18eace92f6bb333067cfd60b325a8c12c0dd1","observation_id":"2d55c5fc-224f-42b9-a012-97c979ab902d","resolution":{"observed_at":"2026-05-13T13:27:50.181876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking the discount factor in reinforcement learning: A decision theoretic approach","venue":null,"work_id":"4be53285-78f8-4f43-bd57-7e26a55e4e23","year":2019},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:e47f4799cb51183134ebc0b63e1948503f0c60b5d0fb5411205411c736d2963a","observation_id":"1cef30f6-08f4-453e-80ea-e904bd6b59e4","resolution":{"observed_at":"2026-05-13T13:27:50.183701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"09418843-bc8b-47c2-be32-d889d823b181","year":2021},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:d1e026d88a8ec66ba58c0a03fac02f90d91ff6f35cfe37fc7ec6595392227d2f","observation_id":"1be115c9-f082-4ce1-b519-cbb91234fd68","resolution":{"observed_at":"2026-05-13T13:27:50.185632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Springer","venue":null,"work_id":"f0ff0a62-6c3c-4211-b778-7d39fc28ce1c","year":1996},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:b80d79e2bbce6b5d751bac74a47b94ed54a3d5a4a8b8769a5165c04da8f38b1d","observation_id":"5190fe21-3b18-430d-938c-4dea76ad2816","resolution":{"observed_at":"2026-05-13T13:27:50.187402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"873de0dd-8406-4260-ada8-f3c47176133c","year":2022},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:0f24ad403a2341b3eea4a01ba24a3fa9202749e4a3cf126794c396957b4dc77a","observation_id":"bb6058f2-cf9f-4daf-a806-cda332d2e49e","resolution":{"observed_at":"2026-05-13T13:27:50.189065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-07-06T12:33:23.843893Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":"2202.00512","doi":"10.48550/arxiv.2202.00512","metadata_source":"pith","pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","venue":"cs.LG","work_id":"fd04f498-ff85-4de3-bcc7-31ef072b2ceb","year":2022},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:acb497b58fccb6cbffe1f41a3f443127e19d788561ab9c81293cf9105662d07a","observation_id":"4fabe8d6-152b-4079-b166-4af97248795c","resolution":{"observed_at":"2026-05-13T13:27:50.107271Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:49b1974fb97295745a1d1cce66a0667997be5b2f1cd966dbe2c47ea54ef9d6fc","observation_id":"5b2e0eaf-324d-406c-8563-d5df48d7859f","resolution":{"observed_at":"2026-05-13T13:27:50.110053Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:ff8e712a0040e455905ce9ebae6914d453b565307a385a3d6fad51c75f081858","observation_id":"79b08765-5bbd-4c67-8f7e-e078500d19f6","resolution":{"observed_at":"2026-05-13T13:27:50.112867Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":"2010.02502","doi":"10.48550/arxiv.2010.02502","metadata_source":"pith","pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Implicit Models","venue":"cs.LG","work_id":"8fa2128b-d18c-405c-ac92-0e669cf89ac0","year":2020},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:6421f485f1f5b2dd1a0100880199fadeece01f53ded772220f3b78988a2d0f03","observation_id":"ddab1155-8cac-45b3-9b25-31fd705afceb","resolution":{"observed_at":"2026-05-13T13:27:50.115280Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":"2011.13456","doi":"10.1088/1748-9326/aae98d","metadata_source":"pith","pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","venue":"cs.LG","work_id":"d9110e53-a5d4-4794-a4c5-a575e91c31ad","year":2020},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:7670bbbbbf1955a96fbb009859be61d065354ec4b916b50900cccc5463528834","observation_id":"ba742b2c-17a6-4821-91f3-907da8cd859d","resolution":{"observed_at":"2026-05-13T13:27:50.118466Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hunyuanvideo 1.5 technical report","venue":null,"work_id":"f60f088d-2e79-4c8e-957f-84ef79d59a46","year":2025},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:b9ecca3327f841d0d69205a78f3d6e9f02010dbbdbcc5d3a7c6365c16379146e","observation_id":"f281d133-e530-455f-b482-af198a50448d","resolution":{"observed_at":"2026-05-13T13:27:50.190802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T14:49:20.251890Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":"2505.17017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-07-03T20:18:57.820556Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":"b4b8af2b-875c-4eef-8139-d2217eb87e57","year":2025},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:655600def0232e181538059747d47d12b9f199d2cc46a3cd0cc4716cc3e2d7b9","observation_id":"f6720920-3ec0-48c8-ae9e-3d68f885258f","resolution":{"observed_at":"2026-05-13T13:27:50.062590Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion model align- ment using direct preference optimization","venue":null,"work_id":"0522e84c-2a0e-4947-9a62-e115f2ab1702","year":2024},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:6cce47a30bb14d0a2302051d96117ef8ebdec55f583228df5b9990325d983068","observation_id":"b1c37ea5-0fd9-4777-8225-44f2c5a59d27","resolution":{"observed_at":"2026-05-13T13:27:50.125663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.05952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.300508Z","title":"Coefficients-preserving sampling for reinforcement learning with flow matching.arXiv preprint arXiv:2509.05952","venue":null,"work_id":"3bc58f2f-e4be-4ee5-804f-29ffd6dfdb30","year":2025},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:d6e8924e81d2e0595f17cd0cbeb443ffefa7804ed65fbf4de33c38e441e239dc","observation_id":"d0d7be2e-637a-4acb-b18b-4f9005da4c64","resolution":{"observed_at":"2026-05-13T13:27:50.069638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05236","last_updated":"2026-02-25T13:17:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T08:36:05Z","title":"Unified Reward Model for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2503.05236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.05236","snapshot_observed_at":"2026-07-04T16:59:58.010213Z","title":"Unified Reward Model for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"bf9fcf9a-1781-4008-960e-2bec1a717e4e","year":2025},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"cited_paper":"/paper/2503.05236","citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:e267464d2aad4c74d5e6f194428371ea740060c545b77d2a8c1a4fdf45fae2d2","observation_id":"f232023b-6c13-46b4-9a5b-7626c418d429","resolution":{"observed_at":"2026-05-14T00:44:31.060111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward hacking in reinforcement learning.lil- ianweng.github.io","venue":null,"work_id":"fc6aafa7-4b9e-4722-91ac-02309876a5da","year":2024},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:f971bcc7cdfdb70f8abe3353f329af116d7c6249ae8520d27dab95e527278ff8","observation_id":"56045798-c251-4190-9854-cecb6b809622","resolution":{"observed_at":"2026-05-13T13:27:50.127551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08826","last_updated":"2025-09-10T17:59:31Z","snapshot_observed_at":"2026-08-07T13:58:40.131270Z","submitted_at":"2025-09-10T17:59:31Z","title":"RewardDance: Reward Scaling in Visual Generation","version":1},"cited_work":{"arxiv_id":"2509.08826","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08826","snapshot_observed_at":"2026-07-04T10:39:45.924030Z","title":"Rewarddance: Reward scaling in visual generation","venue":null,"work_id":"eb1c8722-7fb8-4284-9c9d-37b91aa2cebf","year":2025},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"cited_paper":"/paper/2509.08826","citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:33b6571595de5f567d7325d307c175454d4aa669aa8b602c0d1658720ab1885c","observation_id":"aa41ecd4-f187-471c-8c5d-4737894c39c5","resolution":{"observed_at":"2026-05-13T13:27:50.078729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":"2306.09341","doi":"10.48550/arxiv.2306.09341","metadata_source":"pith","pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","venue":"cs.CV","work_id":"40702548-f094-4c67-a5db-a62f426f852e","year":2023},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:b443d1d54d309dbcc4436d35a8866610fc2140433ee57fc50658c7f2f5e57318","observation_id":"f15c3b90-4822-4e3d-8280-d9a7e5301ab8","resolution":{"observed_at":"2026-05-13T13:27:50.081665Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagere- ward: Learning and evaluating human preferences for text- to-image generation.Advances in Neural Information Pro- cessing Systems, 36:15903–15935","venue":null,"work_id":"0e022c45-e6c8-4104-bd45-a333a2607861","year":2023},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:20c3dc7f5854e709995500b264c291c556cf03bf16a057038b9158b03879b0fd","observation_id":"a3aafaa2-2b7b-412b-bb95-778be32df14c","resolution":{"observed_at":"2026-05-13T13:27:50.129615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-07-31T14:51:03.625964Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"cited_work":{"arxiv_id":"2505.07818","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07818","snapshot_observed_at":"2026-07-09T03:05:55.316091Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","venue":"cs.CV","work_id":"7404dd36-8f9c-478f-b089-ef9f8189c711","year":2025},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"cited_paper":"/paper/2505.07818","citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:697536308d0bf6c97606bf7ec5b04e47c85be35eb48d6e60408f3575377f5783","observation_id":"b523e086-e4e2-4522-80f8-1bcec5691206","resolution":{"observed_at":"2026-05-13T13:27:50.087125Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Discussion on flow-grpo issue 7","venue":null,"work_id":"6f3e741d-1403-4d46-98ed-fec496816c62","year":2025},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:b9bf16d7e8259327d78cddaab0bc24789268eee2a541cf726bacb785d5e434fc","observation_id":"d60bd1e5-c1e0-42d3-a2d0-5cc42091e832","resolution":{"observed_at":"2026-05-13T13:27:50.131677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.739125Z","title":"One-step diffusion with distribution matching distillation","venue":null,"work_id":"6ecfda6c-4de6-4aa0-b411-9500fcf979b1","year":2024},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:dbd33340b99a7ae2c4e6a6abfaa2a4efd529d6f102160cf09547295f0f5dcd8a","observation_id":"00afcc67-13fa-46d3-a932-a552faefd466","resolution":{"observed_at":"2026-05-13T13:27:50.133598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-play fine-tuning of diffusion models for text-to-image generation.Advances in Neural Information Processing Sys- tems, 37:73366–73398","venue":null,"work_id":"7ce28871-5fb6-478e-af71-f8b24dec65cc","year":2024},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:3e2149ab60b1bfac93e6165eb4c08356e6857088734232f5f641caecb835dffa","observation_id":"42ca2359-5bf1-43c3-9a3d-057d3c58c765","resolution":{"observed_at":"2026-05-13T13:27:50.135487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unipc: A unified predictor-corrector framework for fast sampling of diffusion models.Advances in Neural Information Processing Systems, 36:49842–49869","venue":null,"work_id":"f95c69b7-4099-44f9-80da-78f8568e5266","year":2023},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:5e9c9668e9caac5ab7a4adc0aa468edde6e42a6436d08d85cb66b1c07f555a09","observation_id":"c12589b4-64f3-4f19-a2dd-c1c6407e1ad4","resolution":{"observed_at":"2026-05-13T13:27:50.137623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dpm- solver-v3: Improved diffusion ode solver with empirical model statistics","venue":null,"work_id":"7888320a-9e59-4463-8925-0b01046e620e","year":2023},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:746f106e595fed599fb297c63a44cccc02ba751348e83274c4c2bee8cb70f7df","observation_id":"1b81e192-be19-4181-9d68-9bb09547c4ed","resolution":{"observed_at":"2026-05-13T13:27:50.139412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.01528","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T17:56:25.568577Z","title":"Drivinggen: A comprehensive benchmark for generative video world models in autonomous driving.arXiv preprint arXiv:2601.01528","venue":null,"work_id":"e93fd55e-0610-4b4d-8497-671654903083","year":2026},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:eb1194217ced3be85cf2c24a71867c43252f0d75e0ea087fec65b7fe713e9616","observation_id":"ac18995e-0f18-415e-8f98-746c89367d39","resolution":{"observed_at":"2026-05-13T13:27:50.104527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(7) has the same convergence as Eq","venue":null,"work_id":"da2926c9-af4a-4f9b-b76c-a40fa9317b69","year":null},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:ff513e9c1c76fb71ad7158ff86552da437701a75f26e8ed8f117dfc8721d2e6b","observation_id":"82c93157-c4d1-4944-a924-e379b49fb646","resolution":{"observed_at":"2026-05-13T13:27:50.141448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We denote the discrete time steps by an index i∈ {0,1","venue":null,"work_id":"c9dca833-15b6-41a5-98cf-e9c82ffbcbd7","year":null},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:3e7752a3e5c95c332e10d76aff4717c58cee1d3c9e9a11ccead744c248e4e3c5","observation_id":"b047cdc8-b596-44ab-8bfc-8596ca35bb50","resolution":{"observed_at":"2026-05-13T13:27:50.143652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"be9deb5e-3a31-43e0-a26a-ea5c553f36a3","year":null},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:bf75f3a2fc6178712404363d72d8b3da3b50547ef21af68b59170850ef197a7d","observation_id":"77cf1c3d-6c5e-4b67-ac12-9dcf247e591d","resolution":{"observed_at":"2026-05-13T13:27:50.145255Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"514e3583-fcbc-498d-a023-688dcfde5dcd","year":null},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:af6382be7fbc0439b0aa824c0073d84dcc4a725d5a75f7b64d3f1aa16074943c","observation_id":"8799ed57-928a-4b13-b04d-09ecfcfa136d","resolution":{"observed_at":"2026-05-13T13:27:50.147017Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We established two reciprocal settings to evaluate both in-domain (ID) and out-of-domain (OOD) performance","venue":null,"work_id":"2a4e8364-8b5c-4cd1-b8c9-b5c28dea1c52","year":null},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:bf58ff18548cf47c47e4320ea6c05a0db14c9d033275393817aa373a81b4de1a","observation_id":"360e075c-a856-46e1-bd30-fa0574ac969f","resolution":{"observed_at":"2026-05-13T13:27:50.148841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3660.2381","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"50283d4d-b9a0-4b85-adb9-293fb485164f","year":null},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:8e4f14e856eeb2fbef2339fb5053288893811895f27dc8d96d76987dc598aea3","observation_id":"3b000dbf-fad0-443b-bc8b-4c528505c820","resolution":{"observed_at":"2026-05-13T13:27:50.121066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PROMPT: 16-year-old teenager wearing a white bear-ear hat with a smirk on their face","venue":null,"work_id":"8af84e1d-ec16-4d58-943e-5e55986924f1","year":null},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:568e8b120821f202722042c4feeb18f68a616e3665a3e9c3048450abba7f574e","observation_id":"63ddb5cc-a635-437f-999b-d36468793732","resolution":{"observed_at":"2026-05-13T13:27:50.150581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","latest_version":6,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":23,"verified_fuzzy":34},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 89 inbound Pith citation observations for arXiv:2507.21802."}