{"as_of":"2026-08-11T09:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c0fe8dc45e08f2ce3eaf872a659b4a4c41bc8263f5562f32206435b8070cd1b4","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T22:03:10.367971Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T20:38:28.328436Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T04:17:36.942540Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"cited_work":{"arxiv_id":"2603.12893","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.12893","snapshot_observed_at":"2026-07-03T04:17:36.942540Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","venue":"cs.CV","work_id":"34a98e68-d13b-4a3c-ae44-bcc85c034c5b","year":2026},"citing_paper":{"arxiv_id":"2605.15190","last_updated":"2026-05-14T17:59:30Z","snapshot_observed_at":"2026-08-03T08:24:27.614764Z","submitted_at":"2026-05-14T17:59:30Z","title":"RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-30T20:38:28.328436Z"},"links":{"cited_paper":"/paper/2603.12893","citing_paper":"/paper/2605.15190"},"observation_digest":"sha256:cffc578ef919b4addce25344ff15ebf33c527c54461a0a238805f22f52dd6bc7","observation_id":"d6dc629b-76e2-4f3e-8aac-2d2a8f9f72cd","resolution":{"observed_at":"2026-07-01T14:35:47.194282Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"cited_work":{"arxiv_id":"2603.12893","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.12893","snapshot_observed_at":"2026-07-03T04:17:36.942540Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","venue":"cs.CV","work_id":"34a98e68-d13b-4a3c-ae44-bcc85c034c5b","year":2026},"citing_paper":{"arxiv_id":"2606.11087","last_updated":"2026-06-09T16:45:57Z","snapshot_observed_at":"2026-08-02T20:45:09.177143Z","submitted_at":"2026-06-09T16:45:57Z","title":"Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T14:05:01.073951Z"},"links":{"cited_paper":"/paper/2603.12893","citing_paper":"/paper/2606.11087"},"observation_digest":"sha256:678a795a1233ac07c5a8ea0c842cb164a0bed45c6bd256b50c9ae5a943094496","observation_id":"1ab9285b-9fb1-48d0-8866-fc55328a2cd3","resolution":{"observed_at":"2026-07-03T04:17:36.943719Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.12893/citation-record","integrity":"/paper/2603.12893/integrity","json":"/paper/2603.12893/citation-record.json","paper":"/paper/2603.12893"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08797","last_updated":"2025-10-09T00:43:44Z","snapshot_observed_at":"2026-07-06T15:03:52.079498Z","submitted_at":"2023-03-15T17:43:42Z","title":"Stochastic Interpolants: A Unifying Framework for Flows and Diffusions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08797","snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Stochastic interpolants: A unifying framework for flows and diffusions.CoRR, abs/2303.08797, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"cited_paper":"/paper/2303.08797","citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:fba761f98a3741cd4662bb28735766961c1056291a871e245367fffffc58303a","observation_id":"df89649d-d771-428e-9174-b4a7615e87af","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Albergo and Eric Vanden-Eijnden","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:c278c9a93830e04fa1d9a0337f6c15ee590b0a9eb382b36778fe58933a3c7f81","observation_id":"10093cc1-6f88-4656-8e0b-f1a2254d206f","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Concrete problems in AI safety.CoRR, abs/1606.06565, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:5e59ca71c994bf0b675882466ebaed16183733ca2b7929823c8919fd56e0b01a","observation_id":"8a773175-9372-4c7e-9f34-472adb41df24","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Ascher and Linda R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:d01deaf8635945e5a1982da08695133617099ecb81a00b0a0378cb239f7daf01","observation_id":"5e1f61f6-e5c6-424d-81c9-895c5f4f8aaf","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Flow network based generative models for non-iterative diverse candidate generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:5118e468e4847a008a0ea9544252fec6d97c3b18e55bb366fc3168c4de61048a","observation_id":"03215930-610a-412c-be0b-31527cd48692","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Training diffusion models with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:2cb92d9f41ef675bfd9c0b13a919d917fef25333af23148ab9bf33520d32b7e4","observation_id":"4a817c6c-77e8-4225-8a6c-5fe12bf9f4a3","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"OneIG-Bench: Omni-dimensional nuanced evaluation for image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:3bdcf86cb48ef62bf6e155bcf7b386a08c8b7288e616ce91ec7fb134d914883d","observation_id":"50a429a2-8fe6-4bb7-bb10-101651f78fb6","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Chen, Yaron Vaxman, Elad Ben Baruch, David Asulin, Aviad Moreshet, Kuo-Chin Lien, Misha Sra, and Pradeep Sen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:22545e2d258e3dc034262dfcdec00c9800d84ef0f608257142f70f7c766a84f0","observation_id":"90ba2d62-a540-4d2a-a868-78a6b2e723e1","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"ILVR: Conditioning method for denoising diffusion probabilistic models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:1bbfcda0d9e803f91479ec63fcf31145573e73d25d12fcb4aa3b9240e8ac892d","observation_id":"2afce917-308f-40e6-99c7-bef4973d110d","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:3ef2bdd87d77113235c1e8cac148989e9292a093e93c085c8632508248ac5dc9","observation_id":"a88fd9cf-5e26-4315-bab8-d254eb783a49","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Inversion by direct iteration: An alternative to denoising diffusion for image restoration.TMLR, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:1d3eda197589e7b9499679a4fd3481fa85d306136cc8d674a882a5cd843ab245","observation_id":"03cec0de-d364-4b96-83da-ae48b7af36c6","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:ca8ff4ffbb30d9c29cde61b74602105c581a643de39a7f57aa78350b14f955b0","observation_id":"95e9f63d-fc62-4eed-8457-73eaa4dff997","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"RAFT: Reward ranked finetuning for generative foundation model alignment.TMLR, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:5551f89ee3674448c1a7b44602e93d41887dea015f972551e80a8586d7194c97","observation_id":"89d2936b-b7de-47a5-aded-b3ca594984c2","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:7238ee2fb8fc22b58a8e6a5771b26780db319633dc1ca78181a2bb0686aa4108","observation_id":"5d32ab0b-b5e2-4706-a120-39ddba554a0b","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Online reward-weighted fine-tuning of flow matching with Wasserstein regularization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:626b55684868b3331129f0be96d638b6b926e1a9a5018e8876c4ac0a18620b31","observation_id":"6db57836-1380-45eb-a399-10e51ad95142","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"DPOK: Reinforcement learning for fine-tuning text-to-image diffu- sion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:07c16eb043830d64e6087abc1892fc4365e0d185e532f0a7b17c66d23daad666","observation_id":"2ff162c4-2d2d-4536-972a-0f64651e2526","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"DreamSim: Learning new dimensions of human visual similarity using synthetic data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:72798608e263e7cb890edb6baa2c08edfb17d69f537accb34e12a7f80798dc02","observation_id":"8d3595b3-afb1-4092-8b38-f5fe06160bb9","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Gradient guidance for diffusion models: An optimization perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:a4714a416df63fe8b74d3743fbf4aca1e1fd208aba9fe6f87ecb5db891ae0d1e","observation_id":"d96c2e77-9204-42db-9abe-c34bcd9d82aa","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Iterative α-(de)blending: A minimalist deterministic diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:81d5aacd4161c18f208e05ea78b763c7d545f76569f02d1dee453ddd40bd65e6","observation_id":"97d210b8-c37a-420a-bba7-bc882ad59551","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Classifier-free diffusion guid- ance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:dc201e3dff759eeeff721244df6d1aede771c3f2e8ddad0143e4f08cdaef0865","observation_id":"9f9ef5af-191c-4ece-b011-fc30f516b78d","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:9be76f5d768e628ff1169a772c1027bbd3ac4d9626f2d5b2bc040a015b823e20","observation_id":"fd7d01f8-a4ac-42b8-970a-d90ec6adab52","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:281fdc860ee4b9ffec85f90be70b641e8d5ed4d9c06908afd6f2309e76afd5e8","observation_id":"a294e3fa-fbb2-4553-a981-1c932f55914f","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Reward fine-tuning two-step diffusion models via learning differentiable latent-space surrogate reward","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:d12dab38fb4d60422f05342e50f22cd5892d5c03963e753d19024507495e2830","observation_id":"1ddfbd59-f690-410a-b79e-bb098edf4e43","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:06a48b75c1e84faa5f85211bc1290a36ddc49c5fc5abd55a501807deb67c1fec","observation_id":"da4b4f96-2697-4c8d-b7e3-951277b878d3","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Understanding DDPM latent codes through optimal transport","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:5db4425abd6489f6dff3ab46bc89bd9f447ddc3e3414adb2877f7b4e4bcaa54b","observation_id":"21b1c436-b7bd-4543-a490-7d28acb84083","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Dif- fusionCLIP: Text-guided diffusion models for robust image manipulation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:4d66a86bccd7fd811a5117f5624e5581424f70976f18fbfdc619349168480e62","observation_id":"fbced906-46ab-4ee6-b137-19fe9346a5df","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Pick-a-Pic: An open dataset of user preferences for text-to-image genera- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:8f3e6cfc13ae70042964ab47085179bc60cc9f2f35f8adb0dff07cac08c1c5f5","observation_id":"2edaf55d-7485-4660-8390-f5c24a3c2678","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"The flow map of the Fokker–Planck equation does not provide optimal trans- port.Appl","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:2051e58f717ec651bd6902ae2e1308643c1bebf0ede1669f877a4dfcb3f6fbec","observation_id":"57bc139c-3a38-4f0c-a407-578414dc2e5a","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Aligning text-to-image models using human feedback.CoRR, abs/2302.12192, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:92ffb95501c0a6ee8a3ab2371cefaa838325111d414f687c4d9eea48d41e5f9b","observation_id":"ea3083ad-3013-4409-861b-c868138c8dc2","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00909","last_updated":"2018-05-20T20:03:59Z","snapshot_observed_at":"2026-08-08T20:31:18.897748Z","submitted_at":"2018-05-02T17:11:20Z","title":"Reinforcement Learning and Control as Probabilistic Inference: Tutorial and Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00909","snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Reinforcement learning and control as proba- bilistic inference: Tutorial and review.CoRR, abs/1805.00909,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"cited_paper":"/paper/1805.00909","citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:95d0965ffcce52e09bf6a7a45fd6337fbe4028f0a18b76f6a38133b7da91f2ba","observation_id":"fab0d1aa-bc9a-40fb-80f5-fe567e288a7a","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Eval- uating text-to-visual generation with image-to-text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:f41520e6ff38f67e39230833bfd5ea6d81877a0133b7ff36575d9535d0553953","observation_id":"890d1674-7098-4c24-8056-0e02add15924","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:dd54c8dc9024e13d8cce0d01778f0fa080f9d52704d2bff76d841dcee8cd8f20","observation_id":"59c1d1de-1c30-458a-9448-b0f75d78b0e6","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Kwok, Sumi Helal, and Zeke Xie","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:aa239aa9055e24471d9bf2eb8cf6ae54e80d1938fc43e5963a288f7e15b9898f","observation_id":"5a42c165-df84-4fa5-93cd-44e6b1028c5c","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Flow-GRPO: Training flow matching models via online RL","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:8053c32bb33ef87b5684e0778d616580aab6409b66abcb85ab2d178dbcb166d4","observation_id":"de898c8e-2a76-4183-82ce-44a7eb7f8616","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:adda7f846214abf22d4c1248bd12abd4ff780486683eef542467f1ff0fc18b0e","observation_id":"5aa6bacb-5471-4c1a-a5f0-876d5c8a1cf3","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Xiao, Weiyang Liu, Yoshua Bengio, and Dinghuai Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:7b391f06b88b62ff09d652f233f986a5b97e3953294c2a4697c635e9c6e1e979","observation_id":"239459d1-3bbe-45ee-80de-363a02504997","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:223793e2da9398c5c376257e072f89870883752119266425cf2887cc42c84b3e","observation_id":"62d93d67-9652-4a1e-bbaf-f13dd1a88ebb","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Dual-process image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:11368e903c8c0cd3b0fdc42879955279f058c00be63dd325f0c7423bc54c9660","observation_id":"3ac87837-35e0-4b97-aed7-454a0d323bbd","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Flow matching policy gradients","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:aa960ec2e1ab32d15b560d9af65be45d44fd2ac7a00e75625b22336a943e22b8","observation_id":"f8da4d78-202d-4132-9495-cefd97ccfda6","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"SDEdit: Guided image synthesis and editing with stochastic differential equations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:acacd7b5568e79e70194d48a694ec6200b84ab804d45cb3e997000d1347db2d3","observation_id":"96149dc8-9af5-4643-86c8-8296b1a229fb","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Bridging the gap between value and policy based reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:da6b2f9481c8fa2e8590f6d2cadf11cdd02c8c28c0ba19bd4ad9fc093c589bb3","observation_id":"1e51a865-7793-4b86-95ce-add2d17b269e","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"WebGPT: Browser-assisted question-answering with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:c646a4fa0bb1d6de13fac34ab8eb31654f2ba37663e0b41d06ef2b29df2d6f77","observation_id":"193a33bc-dbfc-42b0-92df-c49bd6753b13","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:49c2c2d004f9db7dda60879a7d2da0b62bb27a58c0d1037d1553a4b40132e701","observation_id":"0d178709-b4f8-44b7-a8ae-f357b89d32a2","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Flow Q- learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:c6b453becabb0645cfb654fd2f1fe74fe0962e439160d8e9ac06438eef0d3cc4","observation_id":"2f1bf9a3-9c29-4db3-b812-6f27c009acc9","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Reinforcement learning by reward-weighted regression for operational space control","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:ae0a16175b6dd06b25f7e76db81df2a5b0ce00e72d901c4f9c61d2af0c15a547","observation_id":"9c17c4f6-5759-484a-a772-3a62675a0bf3","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Learning a diffusion model policy from rewards via Q-score matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:b137ffd94e323aa6f92e47660af671d590d39951fe80ba9a3ca9139a8b603517","observation_id":"c9138516-452f-48a6-a758-1c4271c58a25","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:74f1901444956ea09516a070967074eff5e040c6f4976951e8a52015e58cc353","observation_id":"18f5b110-4262-48a7-af33-628028bcbd19","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"co/openai/clip-vit-large-patch14","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:e068b156e64112d24e22151ba9fad01dcef4b0a9398d9682e2904280d57398f1","observation_id":"2c524408-3fff-4c39-82b3-019da6536d9f","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:72096fbe110b48c685d1d2ee593bfc48cf263736a5eff589f6c825ab85dce930","observation_id":"80dd83a1-60c5-4da8-9fba-7995d2bf2007","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"The cross-entropy method for combina- torial and continuous optimization.Method","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:008a4431bce6b12de6bf002bb5dd8ceb77f0151ce57044d65dc2e73d658c4aa6","observation_id":"63ce22b6-ee54-452c-bd5b-c9b3d0fb5437","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Birkhäuser, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:8c3fd4849ffd8e135e3c8231c7790f27f244d76d20940ffeaa5fe38366dbb1cf","observation_id":"ba92b2e0-e54f-4902-b4db-2d01f14f4b42","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Proximal policy optimization algo- rithms.CoRR, abs/1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:376dda42a5228fafcce56f7542d272e7482662ac46b8efdcb8a111622265e68b","observation_id":"94ada230-4a1e-486d-9a6f-b08fb04fe3fe","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:64fa067bdf80ff9fac4930cdb3bc533c5686ab422a617bc9fbd81ecdaa2f9492","observation_id":"3414cd60-74b5-4fc2-b153-9ec23321299e","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:a2d76d2a71e353b0a5807ed2613310f7071ea7b9f418c790c70ff94da83075e6","observation_id":"8d1a233f-f761-44b8-ae84-f63cf433f5e6","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Loss-guided diffusion models for plug-and-play con- trollable generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:c6e2e6106367b426f3debb8292d771ff34f497f816b241cf9b7573b27cc2a50d","observation_id":"3c3e5a40-7c0f-4e5d-a020-a946c7c69dca","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Generative modeling by estimating gradients of the data distribution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:840cee9a217faddf28393ec08d36b50f65ebd8737c48cba174ab45f22bafadc9","observation_id":"765e5280-9f67-416f-93e0-0c60d3f1fa66","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Kingma, Ab- hishek Kumar, Stefano Ermon, and Ben Poole","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:0625c07f443b9f21a038efb78f52e2eae97b98506fd2a292978d466c80576361","observation_id":"100ca1cd-917f-4d5e-91ec-90156c440359","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13734","last_updated":"2024-07-18T17:35:32Z","snapshot_observed_at":"2026-08-06T07:20:04.001733Z","submitted_at":"2024-07-18T17:35:32Z","title":"Understanding Reinforcement Learning-Based Fine-Tuning of Diffusion Models: A Tutorial and Review","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13734","snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Understanding reinforcement learning-based fine-tuning of diffusion models: A tutorial and review.CoRR, abs/2407.13734, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"cited_paper":"/paper/2407.13734","citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:594158587f0537170db428fd4487273dabd3403bddb2b8d36152fbde0b0b44ee","observation_id":"193a9dbb-e70c-4103-a5f6-eb03ad00ab0e","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Diffusion model align- ment using direct preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:418401f29ac092ad7a1144d2899dc3acef58a2cc10d883cd950f899c35e2fb0b","observation_id":"54caf120-9198-46fa-bdc5-308984419f4a","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Qwen2-VL: Enhancing vision-language model’s percep- tion of the world at any resolution.CoRR, abs/2409.12191,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:182f83392954e6aed9812ae7f4e61690abcb84aea65180a44f9b346b644db49c","observation_id":"b039da8c-f9fb-48e8-95d0-2231a6417c53","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:04d0828d897af0675a3365e73afd0ec6b0975c49bb8f0549176a1b7cd4fe0e8f","observation_id":"6cbba29c-164e-45f6-a308-65fed8b64b8e","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:6e933216afa0ea2b4b7ee4a03ea935d4926d2bb07325ae3db8db505dff82cc0b","observation_id":"9bac1c88-225d-44f8-a00e-e341ca045f45","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-08-11T00:30:13.593181Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis.CoRR, abs/2306.09341, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:bc172b3648d8eee8dcfe990e026ddca758739a051c44f3310c6e4ca609f3bde8","observation_id":"2e8acc0d-a2c0-487f-9472-ea0c9e41e453","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Deep reward supervisions for tuning text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:9614ded468c51ae07858bb7b21b172a184747ff70edb371239313071294908ce","observation_id":"bf2c807b-d702-433f-be21-a1aa9de992e0","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Simple policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:3a2b570d5346b1bfb5f2376ba9c3e15a9937e9520f80999842c998246e990e25","observation_id":"f6bf4148-b02d-4fae-82e4-a3f939e85612","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"ImageReward: Learning and evaluating human preferences for text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:aa85d672fd6fc58bb816c48452c005786f0788fc860bd1bac3a9bc8ddfcbc027","observation_id":"80da336e-ad3e-4fa7-83ea-21c16683d652","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Advantage weighted matching: Aligning RL with pretraining in diffusion models.CoRR, abs/2509.25050,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:5002a318e9b6641db659ab2e5baa3b36064bca9972b094740640174bc6e1f9ad","observation_id":"f50656bf-e991-4def-a11b-8d59b1b6fb9c","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-08-10T06:20:33.458844Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07818","snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"DanceGRPO: Unleashing GRPO on visual generation.CoRR, abs/2505.07818, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"cited_paper":"/paper/2505.07818","citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:93a09254c09f43badfb16f3a2e78db24ab7d6a9fb0611d31d0bb4eea8a5f728a","observation_id":"0d07fead-3202-40a1-98f1-d21c77790297","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Good- man","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:3195de0aaba81638b032d41d8b60775138bde85724f787f1c2a5665c84e8fb8a","observation_id":"a4dee3f3-4c05-4f72-89f0-a42d5dabdfff","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"Does this image match the caption","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:6647796ad7ff544bb19ea664b1f56e2ca23ebc1d5ae57dd58fa4b389a444641e","observation_id":"27dd3634-e9d4-4b42-a15e-1f145997df34","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:c86c41260b361afbc64a34eaa876dc5f1d9c0a711390bfe5c40104bfb5051ea1","observation_id":"aeedd373-5203-434e-b11a-65a22e470d58","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:a0e65e949225aaf59179f94a3961fa69cbdf5ebdb3f0534b875cba902efaf54e","observation_id":"b3ebed2b-7982-486e-94e0-809426fdbe33","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:0950e5dde87bec83e13e48f30a13ebd903d8d46965a340448ec11f1749c725e4","observation_id":"02f6a081-4af7-4710-8e94-06db6514ce52","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:368440edb63048cd94cd267120bac8b8b21c30a29a78325248bd42724e1ddeed","observation_id":"b04716c9-e8ce-47b8-869d-b62aa92dd355","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:b57a252a7cbdeced95874e04858befa1c80ab58d0de57bd64269dc8acbd2878e","observation_id":"02abbdaa-7d45-49b6-a41d-16de4d56fe81","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:03:10.367971Z","title":"fleshed out","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-14T22:03:10.367971Z"},"links":{"citing_paper":"/paper/2603.12893"},"observation_digest":"sha256:68173dddac36fedcd7b6ef14ddddf0a8eba1b4ace11f51684d95b36009d02c75","observation_id":"88ed38df-319e-4d2c-a716-50a6ea6eb19c","resolution":{"observed_at":"2026-07-14T22:03:10.367971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.12893","last_updated":"2026-06-30T07:59:45Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T07:52:15.887850Z","submitted_at":"2026-03-13T10:54:09Z","title":"Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":76,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 2 inbound Pith citation observations for arXiv:2603.12893."}