{"as_of":"2026-08-23T23:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8e6e11e8fcab84a15fd308f1842a9840809168865af2c5a3fc14696b3a2f8dc7","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:14:40.804899Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T06:48:22.594002Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T06:54:20.717150Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"cited_work":{"arxiv_id":"2505.22407","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22407","snapshot_observed_at":"2026-06-30T06:54:20.717150Z","title":"Self-reflective reinforcement learning for diffusion-based image reasoning generation","venue":null,"work_id":"627efa6f-596e-48d6-9b96-297a00c6df47","year":2025},"citing_paper":{"arxiv_id":"2603.22844","last_updated":"2026-05-05T16:08:42Z","snapshot_observed_at":"2026-08-19T15:31:50.900989Z","submitted_at":"2026-03-24T06:32:12Z","title":"PhySe-RPO: Physics and Semantics Guided Relative Policy Optimization for Diffusion-Based Surgical Smoke Removal","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T01:22:42.691009Z"},"links":{"cited_paper":"/paper/2505.22407","citing_paper":"/paper/2603.22844"},"observation_digest":"sha256:d6608447d9ceb8113d48bcebe7553cf00ecd96530eb9fde2c111642fce5a453b","observation_id":"73b3aa69-9359-4333-b413-c160689654f6","resolution":{"observed_at":"2026-05-15T01:23:26.843935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"cited_work":{"arxiv_id":"2505.22407","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22407","snapshot_observed_at":"2026-06-30T06:54:20.717150Z","title":"Self-reflective reinforcement learning for diffusion-based image reasoning generation","venue":null,"work_id":"627efa6f-596e-48d6-9b96-297a00c6df47","year":2025},"citing_paper":{"arxiv_id":"2606.30124","last_updated":"2026-06-29T10:59:10Z","snapshot_observed_at":"2026-08-14T20:48:54.800865Z","submitted_at":"2026-06-29T10:59:10Z","title":"SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T06:48:22.594002Z"},"links":{"cited_paper":"/paper/2505.22407","citing_paper":"/paper/2606.30124"},"observation_digest":"sha256:625893fe3be104d33af09e62738c68ff82808a7d5375d75b18fff8ee7ac1513b","observation_id":"9f67a3ed-2d02-4a85-a412-eef603e7f8c6","resolution":{"observed_at":"2026-06-30T06:54:20.718579Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22407/citation-record","integrity":"/paper/2505.22407/integrity","json":"/paper/2505.22407/citation-record.json","paper":"/paper/2505.22407"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:43.985733Z","title":"Zigzag diffusion sampling: Diffusion models can self-improve via self-reflection","venue":null,"work_id":"ff2b4d49-6474-4c8a-8302-166e6aceef87","year":2024},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:35.731414Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:2e8fc9388cfca6117cc3319234c0fd0cf74102cf22b6c67893c377af9a49b72e","observation_id":"f6fde169-af7e-4700-a582-7808db30ccde","resolution":{"observed_at":"2026-08-07T13:14:44.028809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-09T16:20:23.732146Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-07T13:14:35.800984Z","title":"Training diffusion models with reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:35.800984Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:586b8316159ec8074b13ebe208a80fb99845a6e1140a8e65ee79e24da2067f3f","observation_id":"ca14f579-df4b-438a-bd57-353d058f03c2","resolution":{"observed_at":"2026-08-07T13:14:35.800984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09000","last_updated":"2024-08-23T17:21:35Z","snapshot_observed_at":"2026-08-20T20:01:39.152895Z","submitted_at":"2024-08-16T20:00:55Z","title":"Classifier-Free Guidance is a Predictor-Corrector","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09000","snapshot_observed_at":"2026-08-07T13:14:35.909339Z","title":"Classifier-free guidance is a predictor-corrector","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:35.909339Z"},"links":{"cited_paper":"/paper/2408.09000","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:49bb16b95fa179cbbd0f89a564899377894b758f2ada5ff077ff8596d3deaaf4","observation_id":"cfa2bbd6-6718-4fdd-8462-a07bbb3a5212","resolution":{"observed_at":"2026-08-07T13:14:35.909339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08070","last_updated":"2024-09-12T04:39:16Z","snapshot_observed_at":"2026-08-16T13:43:49.389556Z","submitted_at":"2024-06-12T10:40:10Z","title":"CFG++: Manifold-constrained Classifier Free Guidance for Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08070","snapshot_observed_at":"2026-08-07T13:14:36.001503Z","title":"Cfg++: Manifold-constrained classifier free guidance for diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:36.001503Z"},"links":{"cited_paper":"/paper/2406.08070","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:cb91aee4f2064252314cd6f3936f6ec54f1c03e9d0539ac8bb3158675b43f6ea","observation_id":"e5fe4d46-9394-48c6-8177-0d375d56278b","resolution":{"observed_at":"2026-08-07T13:14:36.001503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:43.841390Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":"7a45b7fa-3738-49b0-8ccf-9b68e6a83147","year":2021},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:36.068882Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:acf6796b8a6120b5f5186c1395f3b150585f8c1079cacc8aabc5125ee167d849","observation_id":"c40710e8-c209-4dea-b5e9-db4c45dd91fe","resolution":{"observed_at":"2026-08-07T13:14:43.912931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:36.161560Z","title":"Dpok: Reinforcement learning for fine-tuning text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:36.161560Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:ef71b3a2d7cde4fd30486b804088261e53bae73dfb4e3dfbcdb6f3cba02d5c4d","observation_id":"e555c5d5-62c2-432d-a501-af03b7e914f2","resolution":{"observed_at":"2026-08-07T13:14:36.161560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:14:36.266291Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:36.266291Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:115c7fb30ebd0bbe2b78cf697fc8577db4dd8a208516ab664ca7f22121da12a7","observation_id":"f2610df7-e148-4d3a-8b44-440e1ea0b322","resolution":{"observed_at":"2026-08-07T13:14:36.266291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-08-19T17:50:55.743272Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-08-07T13:14:36.335219Z","title":"Can we generate images with cot? let’s verify and reinforce image generation step by step","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:36.335219Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:fd3e90a638d21af49fa4716c2fb9d36a2df13d9e015b03f996245014a8bfb544","observation_id":"5c976fdc-86e1-4356-bcef-5e81b52d8b8e","resolution":{"observed_at":"2026-08-07T13:14:36.335219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:43.648518Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":"51ba32a9-44b7-4500-ba8c-de9f69ca1bd6","year":2021},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:36.408772Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:44534fb35ab1083829b27b7a44146c08c65ba98e8226b37f3be0ff58f44936f4","observation_id":"f7024dc9-fc5a-44e5-8106-cdc8a325c99b","resolution":{"observed_at":"2026-08-07T13:14:43.734974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:43.502912Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"491ee61c-6ef3-4a59-834a-1a5d9303e1db","year":2020},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:36.504535Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:2908deb7743131309f57191455fcc88c7bf42dffae0266b2dc4c4222f1ae758f","observation_id":"6c410219-ad8a-4515-a060-c19d741ce021","resolution":{"observed_at":"2026-08-07T13:14:43.572576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T13:14:36.605135Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:36.605135Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:a0150b2947416a14d7656f5a78a164163bdb3f1919276ba0808a09740c549815","observation_id":"834280df-b54e-4ae2-801d-0bb595a98657","resolution":{"observed_at":"2026-08-07T13:14:36.605135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:36.654226Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:36.654226Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:9f6f8f421a772bd7d49d2958f14b0610b037409f76806bed305e699378cee8d5","observation_id":"296c2ea8-6898-4f7d-be60-3a067f787c90","resolution":{"observed_at":"2026-08-07T13:14:36.654226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11240","last_updated":"2025-03-27T02:34:59Z","snapshot_observed_at":"2026-08-18T03:21:38.508314Z","submitted_at":"2025-03-14T09:45:19Z","title":"Towards Better Alignment: Training Diffusion Models with Reinforcement Learning Against Sparse Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11240","snapshot_observed_at":"2026-08-07T13:14:36.702908Z","title":"Towards better alignment: Training diffusion models with reinforcement learning against sparse rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:36.702908Z"},"links":{"cited_paper":"/paper/2503.11240","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:b3479b4b0b4c72dc5f93403b12597547a81b0bcee92dade8d8fa6ff688f120b2","observation_id":"2f56465a-12dc-4f28-b8bd-a4ab21f0db97","resolution":{"observed_at":"2026-08-07T13:14:36.702908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:43.321754Z","title":"T2i-compbench: A compre- hensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":"5aae4d57-baa6-477a-b5fb-69a7a159088e","year":2023},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:36.753773Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:806c19645f07d4b0b2df78edda483ca5e4780a8f0ebd21642e13d50ebafaca64","observation_id":"91de3f19-1a8b-407e-8ca1-750ea6eabe4c","resolution":{"observed_at":"2026-08-07T13:14:43.388118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-16T02:03:48.252223Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T13:14:36.836605Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:36.836605Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:f3cc2a0060fa1ddc9f8c29f2d9a8e268f77bc654e5f7e71df9c5f03d8ff5f60b","observation_id":"dfe6acf5-f78b-4609-a4ea-dd4ea40f4c80","resolution":{"observed_at":"2026-08-07T13:14:36.836605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-07T13:14:36.892977Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:36.892977Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:16482169fab2163974b28ae6df2d982c844c46ac93fd8a8f46c96362a2a3b6bc","observation_id":"7d8bc513-568e-41da-a2ab-26aa2a646ccc","resolution":{"observed_at":"2026-08-07T13:14:36.892977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T13:14:36.969767Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:36.969767Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:740de33add66c96a94e46e234133a9f465cc22f81362a7ee2baf3b45861bdbbd","observation_id":"c603f89f-3e49-4c14-994e-355ff7cd782b","resolution":{"observed_at":"2026-08-07T13:14:36.969767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T13:14:37.048426Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:37.048426Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:87667d7110c1aa118026a4e110ce3df84887706bd0499f22ebd031ed4637229f","observation_id":"70be1ff4-c214-452e-86f3-1b30673fd983","resolution":{"observed_at":"2026-08-07T13:14:37.048426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T13:14:37.116714Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:37.116714Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:3921ed43218062881215a8dcf1308e2e741e5fc5a3685e1c26e438960d0ad316","observation_id":"bc9aabb2-77ec-4fab-8070-06fbb54d625d","resolution":{"observed_at":"2026-08-07T13:14:37.116714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-07T13:14:37.175516Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:37.175516Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:a94b994fbedc8de9d43f4435b74f50938840351a934f7ba729114320d76bcee3","observation_id":"de49025f-2bac-4931-abef-4fb98952154d","resolution":{"observed_at":"2026-08-07T13:14:37.175516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:43.095417Z","title":"Comat: Aligning text-to-image diffusion model with image-to-text concept matching","venue":null,"work_id":"f970d68e-7c14-4bd3-a70f-cc53175adcfd","year":2024},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:37.240513Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:baf11c31f85976b06c374540481c74278bd68ced0493fd6f12cc4cc0c7c0a38b","observation_id":"27c24742-3893-4051-b3fb-bb599c4331a6","resolution":{"observed_at":"2026-08-07T13:14:43.147214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-07T13:14:37.308207Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:37.308207Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:1d85c159c24dfad59470826f77679fed7b4a5c2035e3f30191aeb45a3bbe7abc","observation_id":"e13b0d27-6df3-4901-8c5d-bd1ed2145f42","resolution":{"observed_at":"2026-08-07T13:14:37.308207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T13:14:37.412079Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:37.412079Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:fc06b15eaef0df629de40bb0330a965215fbad32db332c5c827bed16566a25f1","observation_id":"32c73ff5-995f-403b-b215-d0c419f8054b","resolution":{"observed_at":"2026-08-07T13:14:37.412079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:37.494543Z","title":"Self-guidance: Boosting flow and diffusion generation on their own","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:37.494543Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:21a08415c043d705049ed9b05cbefb82a5dc85e8ae227badcbab92ef6b556e67","observation_id":"b6a50d33-cad9-4fe5-a264-4bde9dc4bcc9","resolution":{"observed_at":"2026-08-07T13:14:37.494543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:37.595230Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:37.595230Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:e73309e14b8bd3ea25e5cf63d14afeaa77b4be87401f653388732e2328be0752","observation_id":"e6bc85d6-75ab-4565-858f-95db38b7b80f","resolution":{"observed_at":"2026-08-07T13:14:37.595230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:37.744986Z","title":"Evaluating text-to-visual generation with image-to-text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:37.744986Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:48bf70073d0d10668c951fd60c542d50620587944df1e9420af064af372bb14b","observation_id":"ad948183-a4a9-4956-87d7-7d5b19eb05d7","resolution":{"observed_at":"2026-08-07T13:14:37.744986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:42.895160Z","title":"Mathvista: Evaluating math reasoning in visual contexts with gpt-4v, bard, and other large multimodal models","venue":null,"work_id":"d753bf09-42d0-412a-bf2f-563e9f9fa973","year":2023},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:37.928806Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:7aaf72585e20c4eae84f9e2968037e290237b495765d2662dda53d31ee28731e","observation_id":"c4045779-23eb-4e1b-8330-a2841ece0349","resolution":{"observed_at":"2026-08-07T13:14:42.966927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:42.734595Z","title":"Safe-sd: Safe and traceable stable diffusion with text prompt trigger for invisible generative watermarking","venue":null,"work_id":"a191f565-405e-4157-815b-0e96b9e3d0f1","year":2024},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:38.061634Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:222e56eee991df6684ff6274073e2dd5749a15ec0693a865d5bc2758eee6eb1c","observation_id":"faa24b4c-db28-4867-9ec0-af782506e98f","resolution":{"observed_at":"2026-08-07T13:14:42.798406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:42.608764Z","title":"Adapedit: Spatio-temporal guided adaptive edit- ing algorithm for text-based continuity-sensitive image editing","venue":null,"work_id":"0fb8f3a9-2a6a-4e05-a690-7eebbd8956a8","year":2024},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:38.205087Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:f00e89292fe678f5cd6b7ee80d6abe95162fcc0c6d2bd403f51aa195b0c5109b","observation_id":"6d716ce0-ca9e-45d1-8636-546e8ecbb4d3","resolution":{"observed_at":"2026-08-07T13:14:42.664263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:42.483573Z","title":"Efficient diffusion models: A comprehensive survey from principles to practices","venue":null,"work_id":"b931310c-d3d4-496f-9e91-7ab330fb000c","year":2025},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:38.295759Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:3cd1d4427882d626497f8d05d6ea4b01717f6824a141a8373c04ac9f63010b42","observation_id":"ed61938a-564b-451c-b8cb-ac36a50f6d9b","resolution":{"observed_at":"2026-08-07T13:14:42.538625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:42.285665Z","title":"Neural residual diffusion models for deep scalable vision generation","venue":null,"work_id":"e1cfcf0c-bf6e-4559-8b6b-4e2c7febd805","year":2024},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:38.409598Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:8c95cfbf7c702a9875f9b26aa9812055791a523957583044d53f15ce63aa6624","observation_id":"d4276eef-19aa-4740-b401-e7db943cda28","resolution":{"observed_at":"2026-08-07T13:14:42.377111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:42.080053Z","title":"Tango 2: Aligning diffusion-based text-to-audio generations through direct pref- erence optimization","venue":null,"work_id":"7e10192e-bb27-49f1-a556-b79574890dbc","year":2024},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:38.526726Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:3a834cfbf879995f53c60b01accc8f610f968af1ae7a26c04151587220516a08","observation_id":"88802fe1-a30f-4401-af65-d8d1125fc814","resolution":{"observed_at":"2026-08-07T13:14:42.175319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-13T20:16:31.803514Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-07T13:14:38.675264Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:38.675264Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:ceb421244affae2bffe478be831ea729e06bf31d53ea3c29834bf8e1fb0fa3f1","observation_id":"f742ecaa-95e6-4f7e-82b8-cf6ee68f3543","resolution":{"observed_at":"2026-08-07T13:14:38.675264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:38.844685Z","title":"Distributed repre- sentations of words and phrases and their compositionality","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:38.844685Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:9aec274868b669b3042267995259e1741ac1c1d9e9950da527a6d2a5d6bf050f","observation_id":"f0e6ceaa-bf47-4cff-99e4-2a84b287ca17","resolution":{"observed_at":"2026-08-07T13:14:38.844685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:38.995193Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:38.995193Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:5808d9de15e493a00edeb6f6ccb887cc09b57e7ad4e8aa683dfea75d2e74743a","observation_id":"f9ef6d1e-64ad-4a6e-b9f0-92f232a50eaf","resolution":{"observed_at":"2026-08-07T13:14:38.995193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:41.905533Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":"2c4dfde1-e435-474a-a1a9-bf111363318e","year":2021},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:39.095830Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:cd0b84ff9bca150514c0234ca8a70d6d2a407d8ecbe053049c14851919998577","observation_id":"77446939-94d6-4bea-b600-440839fff4de","resolution":{"observed_at":"2026-08-07T13:14:41.962454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:39.186301Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:39.186301Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:acbfc8c82c76c9ce764f581453edbfc39ae52ca5126f1e1a635bb151dc91ef77","observation_id":"76fc94be-95e0-4267-9391-982dc4876959","resolution":{"observed_at":"2026-08-07T13:14:39.186301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T13:14:39.254777Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:39.254777Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:e6d5892e4772a8b79cba0395c75bf95fa4d55f430a3dce47dfb5e3c9b6648ca6","observation_id":"83b31cbd-0ea1-4f81-920d-773dafdb0372","resolution":{"observed_at":"2026-08-07T13:14:39.254777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:39.324405Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:39.324405Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:ccfe447fde951b746cd81f4bfabc55e2a3bb8ee97d9b0ced2eeb458b05cbbd5a","observation_id":"4e341893-94e0-4f04-babb-c2499123286c","resolution":{"observed_at":"2026-08-07T13:14:39.324405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T13:14:39.405324Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:39.405324Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:3b36fa2b243c3a7aa7a8742dbd41423edddd6a2b02ed27d06e90fcdbd713e0fe","observation_id":"4e65a1c9-ed90-4155-b3ad-7e109fdd3828","resolution":{"observed_at":"2026-08-07T13:14:39.405324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:41.699460Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"38deb36e-71ea-4683-9107-8c36d0f4d141","year":2021},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:39.477312Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:5c7c4655b80215aded7ef6696ce9e224f0f2eb5dbf02f23841809576c01ab020","observation_id":"5ecf334e-7b58-44d4-bd9d-58e3e89ac77a","resolution":{"observed_at":"2026-08-07T13:14:41.799680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-07T13:14:39.549749Z","title":"Diffusion policy policy optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:39.549749Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:d7dae727d9777889f8252f397fb73a9fa24cc28c50b4f94e1f04a50818775931","observation_id":"8d1756b8-b1ca-4500-b4f8-a368b9a9ba49","resolution":{"observed_at":"2026-08-07T13:14:39.549749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:41.468793Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":"5ac152d8-14a3-46a7-b9a5-b4e25083d4fd","year":2022},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:39.636798Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:e09f0f57c16d713a399675971246927e36a887604c6445e5f033e52116e6b642","observation_id":"68e38e57-0987-4352-b4e9-61d6d84a933a","resolution":{"observed_at":"2026-08-07T13:14:41.593353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:39.732829Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:39.732829Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:a7611abf3eae4a9d54e9d6c7281764a2c369004b6677065325da4bedf367f298","observation_id":"a0694195-f0a0-4806-9c47-e8ab32a0a060","resolution":{"observed_at":"2026-08-07T13:14:39.732829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:39.827414Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:39.827414Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:fec4f01372121ee2d3005e5fdd5f8f7ae566084aae8a43afba35d3084cac0943","observation_id":"050f1d26-ba59-420c-bf2b-07480cf2fb4b","resolution":{"observed_at":"2026-08-07T13:14:39.827414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T13:14:39.919103Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:39.919103Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:a089f65c4f47b6d4122c52926da08fc1be676da922ec116d17f7ee1da8c67f17","observation_id":"a3211193-3497-4e07-9a36-fcb9df839135","resolution":{"observed_at":"2026-08-07T13:14:39.919103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T13:14:40.000804Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:40.000804Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:2f2900d863ad9dd0fb5996c5210deaae81503a35674bc6e8b472ad7f8d11c446","observation_id":"b682c2f2-253f-41a1-8080-efbe1d277c85","resolution":{"observed_at":"2026-08-07T13:14:40.000804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T13:14:40.080313Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:40.080313Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:667a771b52217cc09d023ce4de81075a46c068b45a28f93dc1e0d0eb31aa4d1d","observation_id":"40060867-a8ae-49fe-a4b7-06e35f94dc2e","resolution":{"observed_at":"2026-08-07T13:14:40.080313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:40.176636Z","title":"Improved techniques for training score-based generative models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:40.176636Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:c23a764a29073406e4ca3d227827d41c34ea2db57ea9aa39f2dd3f218657ad70","observation_id":"9446586b-297f-4336-a0f4-8d1a0d842a6b","resolution":{"observed_at":"2026-08-07T13:14:40.176636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:40.261096Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:40.261096Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:ac9e530e7a8181a859de77ef3d2995ab0c7f8721020eaecfcca15d9d6f7f70e9","observation_id":"1a632d7a-6456-4f3b-98a1-810a5c8d252b","resolution":{"observed_at":"2026-08-07T13:14:40.261096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:40.353920Z","title":"Diffusion model alignment using direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:40.353920Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:26989267d2278c6c67babc13085b4eab2177e75be32f89af07ae1077cdcb0f8f","observation_id":"bfd88cf5-b69b-4bec-9af4-5c9273eda00a","resolution":{"observed_at":"2026-08-07T13:14:40.353920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:40.452609Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:40.452609Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:b4f1de1e3d9662d7b8709741b70d8a0417ce0332cf94c6f04363358712f63b27","observation_id":"882337fd-89ec-4a4f-b32e-a5f1be4760e4","resolution":{"observed_at":"2026-08-07T13:14:40.452609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:40.550241Z","title":"Imagereward: Learning and evaluating human preferences for text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:40.550241Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:fc43e9d4632e50dce9f3a5206500446817b6a9dc5d4e1eccc948fe92f3dc3f43","observation_id":"4e08eec1-e687-4255-9f91-1b3e39b2fa56","resolution":{"observed_at":"2026-08-07T13:14:40.550241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-15T09:44:57.157415Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-07T13:14:40.632581Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:40.632581Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:da0fc93188c687e6d8a73db810d3277eeb38d8d8e9dc091941aeb4a69bda840e","observation_id":"713d3c16-d252-438b-8332-21d5996fef51","resolution":{"observed_at":"2026-08-07T13:14:40.632581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:40.725225Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:40.725225Z"},"links":{"citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:4c36b5c9a752083338f9c9264d3e5227869e2d4f430fdc6ed403b2179a7516ad","observation_id":"cca660ca-aa69-4a7f-b5de-f35d47b1681e","resolution":{"observed_at":"2026-08-07T13:14:40.725225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08739","last_updated":"2024-11-01T22:14:24Z","snapshot_observed_at":"2026-08-16T13:34:58.849974Z","submitted_at":"2024-07-11T17:59:47Z","title":"MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08739","snapshot_observed_at":"2026-08-07T13:14:40.804899Z","title":"a(n) [animal] [activity]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:40.804899Z"},"links":{"cited_paper":"/paper/2407.08739","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:1b2e292c9dca65630c55c7b32a8c0eff4ea4027c2bee2e1725399052bf2d1281","observation_id":"5a67142b-43ef-49a4-a05e-f83c9a3c7073","resolution":{"observed_at":"2026-08-07T13:14:40.804899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 2 inbound Pith citation observations for arXiv:2505.22407."}