{"as_of":"2026-08-07T23:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f84e49243e62856b25b64641abbdb350445f7e96f62fb578239b1af92cd00a72","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:25:26.232105Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:18:33.490433Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:03:13.983158Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19196","snapshot_observed_at":"2026-08-07T12:18:33.490433Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24787","last_updated":"2025-05-30T16:48:14Z","snapshot_observed_at":"2026-08-07T15:30:21.145991Z","submitted_at":"2025-05-30T16:48:14Z","title":"Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:33.490433Z"},"links":{"cited_paper":"/paper/2505.19196","citing_paper":"/paper/2505.24787"},"observation_digest":"sha256:cc2babcee479cc0e1d5ecfeb5cbc0bd9d83120a87b4052b66fc44cc9e936bf20","observation_id":"45e9e2b8-63b4-4484-a920-a61a0bdab5c2","resolution":{"observed_at":"2026-08-07T12:18:33.490433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19196","snapshot_observed_at":"2026-07-14T21:09:36.040879Z","title":"arXiv preprint arXiv:2505.19196 (2025) 3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14526","last_updated":"2026-06-28T22:57:12Z","snapshot_observed_at":"2026-08-02T01:05:20.949344Z","submitted_at":"2026-03-15T18:07:29Z","title":"LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T21:09:36.040879Z"},"links":{"cited_paper":"/paper/2505.19196","citing_paper":"/paper/2603.14526"},"observation_digest":"sha256:c05ee7cfddd40de035839587d2e0a02aee03dafe86ad66c4680293bb91b5319b","observation_id":"fb275552-9d13-432f-8f4c-003c320e670b","resolution":{"observed_at":"2026-07-14T21:09:36.040879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"cited_work":{"arxiv_id":"2505.19196","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19196","snapshot_observed_at":"2026-06-29T08:03:13.983158Z","title":"Step-level reward for free in rl-based t2i diffusion model fine-tuning","venue":null,"work_id":"cf021125-1fd3-49b4-9144-9fefbe53e155","year":2025},"citing_paper":{"arxiv_id":"2604.15311","last_updated":"2026-05-03T11:22:04Z","snapshot_observed_at":"2026-07-06T23:02:53.677687Z","submitted_at":"2026-04-16T17:59:56Z","title":"LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T11:23:28.424453Z"},"links":{"cited_paper":"/paper/2505.19196","citing_paper":"/paper/2604.15311"},"observation_digest":"sha256:69dcfc9b5e2b64f9c986f67ac79d7469743efe9ffc158be6208864d91429cbde","observation_id":"71e0a791-1444-4142-a587-66be70140e9f","resolution":{"observed_at":"2026-05-10T11:25:18.786800Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"cited_work":{"arxiv_id":"2505.19196","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19196","snapshot_observed_at":"2026-06-29T08:03:13.983158Z","title":"Step-level reward for free in rl-based t2i diffusion model fine-tuning","venue":null,"work_id":"cf021125-1fd3-49b4-9144-9fefbe53e155","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2505.19196","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:89436cde4edf13e69da220bfb0be4d4b66b6f0ba135bb3be55df87726b90a898","observation_id":"e2f44700-b3bf-4fee-b294-a22df8a5e414","resolution":{"observed_at":"2026-06-29T08:03:13.984555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19196/citation-record","integrity":"/paper/2505.19196/integrity","json":"/paper/2505.19196/citation-record.json","paper":"/paper/2505.19196"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.819886Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics,","venue":null,"work_id":"b9242752-5dda-4042-8e1c-22b10f98dc97","year":2015},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.059212Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:8710c19be5dd82e9f47a78c207e259a13651468fec81bea778475f4f52d7c4df","observation_id":"4a59cfb8-d6c1-4a4a-98d1-7b9a0c718506","resolution":{"observed_at":"2026-08-07T14:25:26.824017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.062747Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.062747Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:852d828d2958172ffede354d9e799afa2d2437d92fcbe8ed238b6c20c6686275","observation_id":"b9b42b1d-c934-4fe3-a11f-9245bc2f86dc","resolution":{"observed_at":"2026-08-07T14:25:26.062747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T14:25:26.066590Z","title":"Denoising diffusion implicit models,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.066590Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:5d39099ae21b5a5a94a6daf5a7c09cf2b6956344179e84e2484c5c4c9e50c5a4","observation_id":"f9f7afaf-0e9b-44a9-8d97-aa9f714e2f5e","resolution":{"observed_at":"2026-08-07T14:25:26.066590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00948","last_updated":"2025-03-02T16:06:16Z","snapshot_observed_at":"2026-08-07T17:35:41.861576Z","submitted_at":"2025-03-02T16:06:16Z","title":"Extrapolating and Decoupling Image-to-Video Generation Models: Motion Modeling is Easier Than You Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00948","snapshot_observed_at":"2026-08-07T14:25:26.069859Z","title":"Extrapolating and decoupling image- to-video generation models: Motion modeling is easier than you think,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.069859Z"},"links":{"cited_paper":"/paper/2503.00948","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:7053d5349932bafa91d3cdc8a4157b9ebdfb5c598ae6a9bf514f6dc132dcb0e7","observation_id":"616f4244-65ae-41b0-af70-5fc41b127016","resolution":{"observed_at":"2026-08-07T14:25:26.069859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1406.2661","last_updated":"2014-06-10T18:58:17Z","snapshot_observed_at":"2026-07-06T03:46:00.791740Z","submitted_at":"2014-06-10T18:58:17Z","title":"Generative Adversarial Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.2661","snapshot_observed_at":"2026-08-07T14:25:26.072893Z","title":"Generative adversarial networks,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.072893Z"},"links":{"cited_paper":"/paper/1406.2661","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:b0b767baf84091b53efbf80c0d8dfa0226d834a5999c607ccce1e178472872e0","observation_id":"c9ba1b6e-ed7a-4f4a-8446-0f66494ba7c5","resolution":{"observed_at":"2026-08-07T14:25:26.072893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.804721Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"60e6b83a-ed95-4a45-9b40-99ff55bb678b","year":2021},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.076062Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:e20e970672ddadd62b40a6d8c8c52b1a16c7805a9c98bd11d19f98622ad73d3d","observation_id":"36fc2aa5-ff92-4347-bb87-46614c818290","resolution":{"observed_at":"2026-08-07T14:25:26.808598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.794563Z","title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":"bc958435-2544-4baf-a00e-75607fbc0e91","year":2022},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.079004Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:3544bce807eb8b2ca92c8a667594edddb87f2511919afcca0a6ae822b97f409c","observation_id":"a8cf128a-03e1-4295-ba87-01beadc4c0b3","resolution":{"observed_at":"2026-08-07T14:25:26.797986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.784417Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":"21e5c18f-9874-48ce-8a3f-20643db472b9","year":2020},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.081959Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:477199b7f74fd1090bdf0c2afe890b068899aaa003245fe2898e735dcbf53dac","observation_id":"c2c730e0-bca1-4d26-9780-15e0f95475fe","resolution":{"observed_at":"2026-08-07T14:25:26.788543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1405.0312","last_updated":"2015-02-21T01:48:49Z","snapshot_observed_at":"2026-07-06T03:42:37.507458Z","submitted_at":"2014-05-01T21:43:32Z","title":"Microsoft COCO: Common Objects in Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.0312","snapshot_observed_at":"2026-08-07T14:25:26.084718Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.084718Z"},"links":{"cited_paper":"/paper/1405.0312","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:94aed37902a4d91d9d559216bef093698fca6c512683dceff458565dca64bfa1","observation_id":"31e3e112-8969-48c6-af7e-3303037df51c","resolution":{"observed_at":"2026-08-07T14:25:26.084718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.087407Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.087407Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:c2868ab291ee4436fbffe89fc2316dfc8cdee128f44335da760b27b25c8ac319","observation_id":"5035b145-6b7c-4329-8388-b38f41b8f4b9","resolution":{"observed_at":"2026-08-07T14:25:26.087407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.770441Z","title":"High-resolution image synthe- sis with latent diffusion models,","venue":null,"work_id":"7fbf0ca2-9273-4e51-9628-5fa012a7e654","year":2022},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.091066Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:5b13e587e6b5764a456812bb51a77b7c97cf95690ef1b874ca94c76c48276e56","observation_id":"f5969777-9350-40a4-a3bd-dc39466c7730","resolution":{"observed_at":"2026-08-07T14:25:26.773507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.761574Z","title":"Improving image generation with better captions,","venue":null,"work_id":"546cb329-3f37-4127-a54d-29f174634aee","year":2023},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.093961Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:c59b8e9d6e245addf8da75ca8a869adca2c79ad2d8fda4c93794bc3ac5a58b0a","observation_id":"54a42102-2d77-47b5-891a-c44c17bdd6c9","resolution":{"observed_at":"2026-08-07T14:25:26.764568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.751898Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models,","venue":null,"work_id":"8ff211ae-0d57-4dcd-8d2b-49e4566d09bb","year":2022},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.096690Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:c891b4472b7a77a5f594a3d8bfa0c9532c31a769c616a5b75914dda082e37582","observation_id":"f7a42b79-f648-40cd-9bd7-d5abb12dc7c7","resolution":{"observed_at":"2026-08-07T14:25:26.756226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.742834Z","title":"Training-free structured diffusion guidance for compositional text-to-image synthesis,","venue":null,"work_id":"7457c7d7-2c63-4dd2-8d58-124f5d1444d5","year":2023},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.099271Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:b24119797e4981ebb323569c4b520cf54d8115674dc893580edade473eb93564","observation_id":"73f0cfd5-16ce-492f-b66b-8a3922494028","resolution":{"observed_at":"2026-08-07T14:25:26.746068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11897","last_updated":"2023-08-17T21:45:52Z","snapshot_observed_at":"2026-07-06T15:06:11.896701Z","submitted_at":"2023-03-21T14:41:02Z","title":"TIFA: Accurate and Interpretable Text-to-Image Faithfulness Evaluation with Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11897","snapshot_observed_at":"2026-08-07T14:25:26.101775Z","title":"Tifa: Accurate and interpretable text-to-image faithfulness evaluation with question answering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.101775Z"},"links":{"cited_paper":"/paper/2303.11897","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:a661cd53f5b991db7f5bd2eaf75d9117718b257366ecc18e209e7c1f744308e3","observation_id":"ac972a64-6cde-41a2-b6f0-db927337c602","resolution":{"observed_at":"2026-08-07T14:25:26.101775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-07T14:25:26.104634Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.104634Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:c1b77c4d0b0acef70e7cef0e1f0c1170e43817461ec1fea44c16311e7c0c2f42","observation_id":"83dfc91e-b25e-4b5a-997d-134f4b12d7c2","resolution":{"observed_at":"2026-08-07T14:25:26.104634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.733988Z","title":"Imagereward: learning and evaluating human preferences for text-to-image generation,","venue":null,"work_id":"cd864458-6919-457b-a750-3447d49f6a2d","year":2023},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.107547Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:68fcd211b74d94f4b67ba20cb341e413506319114d4ea704a71099257ddd5460","observation_id":"d9ec2f17-2af9-4049-87ef-f4529c2dd380","resolution":{"observed_at":"2026-08-07T14:25:26.737462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.725011Z","title":"Pick-a-pic: an open dataset of user preferences for text-to-image generation,","venue":null,"work_id":"4f07d1cc-3217-4fc4-b332-95845d541b9e","year":2023},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.110441Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:a5cdf3ffa337e5a3f62c65892b15540b6ab8c5ffea1ce2db996b24db4041a0ec","observation_id":"b4ae061a-1de1-4a54-b92f-fc9145c7f647","resolution":{"observed_at":"2026-08-07T14:25:26.728358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08617","last_updated":"2025-07-09T14:53:06Z","snapshot_observed_at":"2026-08-07T19:52:19.808797Z","submitted_at":"2025-05-13T14:35:51Z","title":"OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08617","snapshot_observed_at":"2026-08-07T14:25:26.112892Z","title":"Openthinkimg: Learning to think with images via visual tool reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.112892Z"},"links":{"cited_paper":"/paper/2505.08617","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:44a6f716de6a63468b028779cf3a163d8eb055f977f9bdbc7a46471b08f2d17c","observation_id":"9c0f8328-a04a-43ae-9372-84076f1c2057","resolution":{"observed_at":"2026-08-07T14:25:26.112892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.716147Z","title":"Dpok: reinforcement learning for fine-tuning text-to-image diffusion models,","venue":null,"work_id":"ad3dafb9-3664-4be0-adbc-317b79cefec6","year":2023},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.115498Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:60bfa633914f1c5ecf00c0ca2a03cde99cfd830ddb00a0752c4c3f0bfa2f4fbd","observation_id":"ffc72921-f5e6-4523-9723-d23778d31cd0","resolution":{"observed_at":"2026-08-07T14:25:26.719666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-01T15:43:51.739518Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-07T14:25:26.118205Z","title":"Training diffusion models with reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.118205Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:1cdd323c42cad8a996f376da42aae6d645e83b1fe2bdcddf3a9af1c0824327ac","observation_id":"a49943ae-083e-4f04-924f-c5f98e89a191","resolution":{"observed_at":"2026-08-07T14:25:26.118205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:25:26.120984Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.120984Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:4710f3195a1a7b2f2d196ce68b0a713221335dc3622175d88d3c0f067f2676fb","observation_id":"3d82d039-20cc-42ab-9944-ced4ffa73f96","resolution":{"observed_at":"2026-08-07T14:25:26.120984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.707293Z","title":"Direct prefer- ence optimization: Your language model is secretly a reward model,","venue":null,"work_id":"21fb827c-9a3a-4998-b669-e33dc11d45d1","year":2023},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.123805Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:e71d37e6afbaf73607d345cf43c2318497613159cdaf0bb98af4fa0a90878853","observation_id":"f5d1d4d8-172b-4707-b6b7-55870db39f66","resolution":{"observed_at":"2026-08-07T14:25:26.710368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.697553Z","title":"Stimulating diffusion model for image denoising via adaptive embedding and ensembling,","venue":null,"work_id":"29619d84-12a8-4070-a6da-64b00bcff25a","year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.126311Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:170698d511569db305648b3037a1e00805e6e54c847a51f0addb567a51480d1a","observation_id":"0af8666d-0e7e-4f19-a634-d622111e675f","resolution":{"observed_at":"2026-08-07T14:25:26.701020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.687375Z","title":"Blue noise for diffusion models,","venue":null,"work_id":"f6c68a5a-4663-431e-9ce1-5106550ce9d0","year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.129059Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:6a36cd6f775d9c22bc423ada4511527128766bd7048d9fb9d3b9f8a64b360b97","observation_id":"baa652e8-00ce-48a7-bf95-b584a9bdb855","resolution":{"observed_at":"2026-08-07T14:25:26.691274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17870","last_updated":"2024-03-26T16:57:55Z","snapshot_observed_at":"2026-08-07T05:21:44.237421Z","submitted_at":"2024-03-26T16:57:55Z","title":"Boosting Diffusion Models with Moving Average Sampling in Frequency Domain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17870","snapshot_observed_at":"2026-08-07T14:25:26.132556Z","title":"Boosting diffusion models with moving average sampling in frequency domain,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.132556Z"},"links":{"cited_paper":"/paper/2403.17870","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:88dd2b03b55aa8476cd0e44eed7f57af948068322a8e1df59b6f6f5dc73afeab","observation_id":"7a764e69-28ab-4476-bac1-3702711a3a7c","resolution":{"observed_at":"2026-08-07T14:25:26.132556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02154","last_updated":"2025-05-29T04:20:04Z","snapshot_observed_at":"2026-08-07T16:13:25.977062Z","submitted_at":"2025-04-02T22:03:11Z","title":"FreSca: Scaling in Frequency Space Enhances Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02154","snapshot_observed_at":"2026-08-07T14:25:26.136256Z","title":"Fresca: Unveiling the scaling space in diffusion models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.136256Z"},"links":{"cited_paper":"/paper/2504.02154","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:a182eeed51ddb77ff313ed1a03c37f7a939ff62e356f348b5002402c576650b4","observation_id":"80e01d5d-5291-4403-a1f0-853487a63e6a","resolution":{"observed_at":"2026-08-07T14:25:26.136256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.678426Z","title":"A dense reward view on aligning text-to-image diffusion with preference,","venue":null,"work_id":"42e7bcb3-5186-46ea-8738-b14449c560e2","year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.139255Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:54dd3793b1c5003ff9e0d9082b63f9751c45766c2dc46da11d2b1597c980be29","observation_id":"293a2962-4691-4cb0-bce0-88f8b86fb19b","resolution":{"observed_at":"2026-08-07T14:25:26.682210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.669387Z","title":"Confronting reward overoptimization for diffusion models: A perspective of inductive and primacy biases,","venue":null,"work_id":"a0c1d197-6a89-4055-a37f-16bef0857b92","year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.141926Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:5e7d7c2a9d9df636ebe4843d55fb090040cce33c91bd087358540dce0ab2e186","observation_id":"1f77c922-b895-41d0-a9a4-06d761f17ebe","resolution":{"observed_at":"2026-08-07T14:25:26.672920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04314","last_updated":"2025-03-25T17:06:27Z","snapshot_observed_at":"2026-08-06T20:07:18.681767Z","submitted_at":"2024-06-06T17:57:09Z","title":"Aesthetic Post-Training Diffusion Models from Generic Preferences with Step-by-step Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04314","snapshot_observed_at":"2026-08-07T14:25:26.144841Z","title":"Aesthetic post-training diffusion models from generic preferences with step-by-step preference optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.144841Z"},"links":{"cited_paper":"/paper/2406.04314","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:2cf49e8394cdc8904dcdcd1daf05ac51e4b80eb5a3e05702a1b0f64d94584168","observation_id":"7ddc2152-916d-4b1e-b35e-103cb7023a17","resolution":{"observed_at":"2026-08-07T14:25:26.144841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.659246Z","title":"Diffusion models beat gans on image synthesis,","venue":null,"work_id":"2a8f0b5e-05b5-4b54-815e-035a50a67c9d","year":2021},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.147939Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:409f464d82e050e78b6b196185bc8c91b9f25ce9470ca686461c1b3bbae872ca","observation_id":"11dccaa8-3582-4b83-b462-f53b6771e70d","resolution":{"observed_at":"2026-08-07T14:25:26.663616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T14:25:26.150649Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.150649Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:80208a6e9da99ac15d22b4c45d1b122a07345b87e6a73a3e73e03284912f6060","observation_id":"186e990f-a787-4d59-ab3d-7b884ffe7fd5","resolution":{"observed_at":"2026-08-07T14:25:26.150649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-08-07T14:25:26.154161Z","title":"Aligning text-to-image models using human feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.154161Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:9d7b3149c6d6dbcbd25f5e2f715c78e4f01ac1e62d732c866dcd5e4339ca9588","observation_id":"edd2dd8b-19b6-4ce7-bea8-43db8f0eb1bd","resolution":{"observed_at":"2026-08-07T14:25:26.154161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-07T14:25:26.158191Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.158191Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:eb61399b5e39605e0a0af17e67073fa1234d93b96febdd76292493f20714700f","observation_id":"7795060c-6414-4eb9-821b-c97d09fe8840","resolution":{"observed_at":"2026-08-07T14:25:26.158191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.650087Z","title":"Optimizing ddpm sampling with shortcut fine-tuning,","venue":null,"work_id":"7f51ecdf-09f0-4cba-abf6-219ffcf1a606","year":2023},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.161300Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:1e0db4bb642a1abef76d202e2a3c6b5b50c84e20f05f2bf56934f9dbdda736c6","observation_id":"03783dd0-c41f-4932-9fd6-780499cd33e4","resolution":{"observed_at":"2026-08-07T14:25:26.653284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.641163Z","title":"Deep reward supervisions for tuning text-to-image diffusion models,","venue":null,"work_id":"1895c17f-374c-43b6-b144-dcb750103417","year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.164256Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:eb86cd6ee2e44f78bf96e3f000b50c5768dab9828f857745b459c43e234fc35c","observation_id":"44e5fb01-4654-4a95-ae6e-54baca475030","resolution":{"observed_at":"2026-08-07T14:25:26.644330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.555263Z","title":"Using human feedback to fine-tune diffusion models without any reward model,","venue":null,"work_id":"224834b3-c31c-4170-be18-f8361ef3e219","year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.167113Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:f1b5f5201413e99000503de5df0a2844051d1ce4b09060bc2e938825b357f2de","observation_id":"44045a80-0c4d-4cde-b168-b89721392dd0","resolution":{"observed_at":"2026-08-07T14:25:26.634403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.546376Z","title":"Diffusion model alignment using direct preference optimization,","venue":null,"work_id":"9301dde6-a7ac-4133-a9eb-9c074107480e","year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.170322Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:6598ec63325477a65de8dfd1862251cbeaba1d473e354f135c0d35c6aace5335","observation_id":"4e8fbaae-74bc-41a7-8ce7-76a0602f52ed","resolution":{"observed_at":"2026-08-07T14:25:26.549875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.536427Z","title":"Steps toward artificial intelligence,","venue":null,"work_id":"3e160398-59ac-416e-a8d9-5bc12525a68d","year":1961},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.173109Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:c4ecc13685bafa0c3c76538be8c564b29a08acbb282985ef4540cdd93e906aa3","observation_id":"357d6f4e-48c6-430d-9274-161ff9e8f422","resolution":{"observed_at":"2026-08-07T14:25:26.540929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.526975Z","title":"Temporal credit assignment in reinforcement learning,","venue":null,"work_id":"7c3e48e6-cf6f-47bc-9e1b-8c7143a5d3c7","year":1984},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.176690Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:4ec3e9934f413327dd35f0e9945357c553b01a28913f85f947e6db064a2387a7","observation_id":"d0ad225d-b9e1-4768-80e0-10a61a269b37","resolution":{"observed_at":"2026-08-07T14:25:26.530218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.516285Z","title":"Learning guidance rewards with trajectory-space smooth- ing,","venue":null,"work_id":"2ea411a8-53af-4f0f-9fc5-7a44e0a50f53","year":2020},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.179657Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:68744a4499538f6d5aaedb347ef03a92ab1313d40be3b797fccb9f4e49b58f0b","observation_id":"65d6c08a-74bd-40f4-9270-b8aac917d6a7","resolution":{"observed_at":"2026-08-07T14:25:26.520203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.507487Z","title":"Harutyunyan, W","venue":null,"work_id":"093519b0-d935-4d26-9669-5491554680ec","year":2019},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.182674Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:ff001bcbcbb17c57ed8b8233a4cf0c520f0d0202e7a582a77c740b2fa48c45b0","observation_id":"33f72736-f8f7-4112-a81b-668036b499ca","resolution":{"observed_at":"2026-08-07T14:25:26.510627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.498828Z","title":"Policy invariance under reward transformations: Theory and application to reward shaping,","venue":null,"work_id":"edef69bf-187e-4ad0-9424-f54f659a98dd","year":1999},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.185401Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:d03b45f66fe6b32bf816c90abfed80d950c0324c87e9f38d5f82aba9af3eb110","observation_id":"3724d282-7afc-42bc-aa97-5da828ff567a","resolution":{"observed_at":"2026-08-07T14:25:26.502040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-07T14:25:26.188530Z","title":"Text2reward: Reward shaping with language models for reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.188530Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:809ee937021b2568bc81ff83cacf1ba6362dac4107d4bd77485432b39535ab6b","observation_id":"d0a81003-26d7-43ce-ba62-ae59e4f1d1e5","resolution":{"observed_at":"2026-08-07T14:25:26.188530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.489938Z","title":"DPO meets PPO: Reinforced token optimization for RLHF,","venue":null,"work_id":"2e07e247-2aef-484a-8b7c-cbca9539a7aa","year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.192604Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:e8d8afeef025b02d3cb4d540d23df8d88457b7faab451e5b009e893bfba4ecba","observation_id":"c99752e1-3a18-426a-8a2b-ebd7f2dcc812","resolution":{"observed_at":"2026-08-07T14:25:26.493068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.480745Z","title":"R3HF: Reward redistribution for enhancing reinforcement learning from human feedback,","venue":null,"work_id":"82701771-70c2-4e73-998b-85cdbe6f9c35","year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.195874Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:852262d575d16655411f247cc3582e358fea0d6445dada7173bc11a3efc487c1","observation_id":"7a6199c3-bf2b-4c68-ba3a-3e3b22308795","resolution":{"observed_at":"2026-08-07T14:25:26.484041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.470205Z","title":"Dense reward for free in reinforcement learning from human feedback,","venue":null,"work_id":"2e975183-4474-4250-b42f-92860c017c04","year":null},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.198621Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:2abed70e1484f346d92ab938dc80bbabfb30f2647094646180e3a67c84f6c9a7","observation_id":"9469099a-82cb-40f7-a438-e3935c0b55f9","resolution":{"observed_at":"2026-08-07T14:25:26.474408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.450324Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning,","venue":null,"work_id":"a4388909-843b-41cf-be67-f73c79ef6230","year":2004},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.204535Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:1f326890093933d422d2b4903fe8efb945e24eba7f754ed5e37d59bd2da2fed5","observation_id":"1be93a43-71a6-4aa1-8b09-4246ea680c60","resolution":{"observed_at":"2026-08-07T14:25:26.453992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T14:25:26.207681Z","title":"Auto-encoding variational bayes,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.207681Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:df6b53152230a19249679febb56af770a28f1bf84416cad4dad05f046af8d509","observation_id":"69347cfb-4e3b-468c-9ed9-27beddb7a661","resolution":{"observed_at":"2026-08-07T14:25:26.207681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.440501Z","title":"Emerging properties in self-supervised vision transformers,","venue":null,"work_id":"bb39c061-9794-4cd4-a4ad-1215479851a0","year":2021},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.210873Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:2796a9cccff2a34d0ebc07ef1186442b9cfee65c2bf938acbb935f2e87b5c78f","observation_id":"f6951719-dd51-470b-898e-5a1b0c4726a2","resolution":{"observed_at":"2026-08-07T14:25:26.444511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14580","last_updated":"2024-12-19T07:00:03Z","snapshot_observed_at":"2026-08-05T09:39:52.232873Z","submitted_at":"2024-12-19T07:00:03Z","title":"DiffSim: Taming Diffusion Models for Evaluating Visual Similarity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14580","snapshot_observed_at":"2026-08-07T14:25:26.214334Z","title":"Diffsim: Taming diffusion models for evaluating visual similarity,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.214334Z"},"links":{"cited_paper":"/paper/2412.14580","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:7a2aab0dc29523211d5281ce276f3a65e80fc02f22c03236921e25abc04cc89f","observation_id":"dabf1354-2074-4903-b190-7c30f48f6d6d","resolution":{"observed_at":"2026-08-07T14:25:26.214334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.217670Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.217670Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:759dbe9b56880b82c8dafb6a4ba069b20e7f9284dc634d515c4723030f73c0e6","observation_id":"92df4940-22bb-4894-8c43-65ab8291f10c","resolution":{"observed_at":"2026-08-07T14:25:26.217670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.426082Z","title":"Policy gradient methods for rein- forcement learning with function approximation,","venue":null,"work_id":"9038f4ec-7ab6-4bf7-a166-0c7140ade5c9","year":1999},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.220474Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:edc18da89a8b7b1eadcc1e870166cda9f2470b02ab0e5adb61670881e846aff3","observation_id":"1762ec38-ef64-4b33-9f98-a3eb686a4f25","resolution":{"observed_at":"2026-08-07T14:25:26.429414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04597","last_updated":"2015-05-18T11:28:37Z","snapshot_observed_at":"2026-08-06T11:05:16.105361Z","submitted_at":"2015-05-18T11:28:37Z","title":"U-Net: Convolutional Networks for Biomedical Image Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04597","snapshot_observed_at":"2026-08-07T14:25:26.224156Z","title":"U-net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.224156Z"},"links":{"cited_paper":"/paper/1505.04597","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:0f16c786f4f4a6cdf6d9e3d100d0fb3ca92367392a2def0b9fe70abe156971ef","observation_id":"f8186217-4635-4ead-9ac7-55d49981bf93","resolution":{"observed_at":"2026-08-07T14:25:26.224156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.415016Z","title":"Training deep nets with sublinear memory cost,","venue":null,"work_id":"bb847c62-7233-4ef5-b69a-7303d0e1488b","year":null},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.229122Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:03703b8f8609be92b0341213e1eeb07e827c701e445d411a4db9158f477700a6","observation_id":"e00ca729-7998-4e5e-9493-2baae7aac08c","resolution":{"observed_at":"2026-08-07T14:25:26.419888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-04T13:01:58.606241Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-07T14:25:26.232105Z","title":"in\" while others do not for prompt","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.232105Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:c932978d869caad8d60041204a871ecf4d350a2def51668a607cfa4ed692f49b","observation_id":"f5acd2f4-921b-43af-b595-29fdb03e2953","resolution":{"observed_at":"2026-08-07T14:25:26.232105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.460085Z","title":"Available: https://openreview.net/forum?id=eyxVRMrZ4m","venue":null,"work_id":"0fe83757-cde8-4591-a250-508c6ae4bc42","year":null},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.201653Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:1db620486344b5e5f928dc2d7416dd566afc1bc24895268d5b87f4c0db343dd6","observation_id":"eb825529-10da-4a0b-bf1e-6db2928fdaf5","resolution":{"observed_at":"2026-08-07T14:25:26.463485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 4 inbound Pith citation observations for arXiv:2505.19196."}