{"as_of":"2026-08-14T08:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6958260c1d086dfff0ace0e8a9c49a08d96af8135b4ca6691f42fc49da0e5062","coverage":[{"denominator":92,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:58:39.053842Z","state":"measured"},{"denominator":94,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":94,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:18:52.995998Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T02:25:55.861273Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15247","snapshot_observed_at":"2026-08-07T15:18:52.995998Z","title":"org/abs/2411.15247","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-09T17:44:56.423478Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:52.995998Z"},"links":{"cited_paper":"/paper/2411.15247","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:b2c142e7020c06ac9359adb4f2ac2fd4722328f3e54618d652de4c5d99e269f7","observation_id":"007c5f7c-0714-4c6f-bc71-fb2220e2149c","resolution":{"observed_at":"2026-08-07T15:18:52.995998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"cited_work":{"arxiv_id":"2411.15247","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.15247","snapshot_observed_at":"2026-07-09T02:25:55.861273Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","venue":"cs.LG","work_id":"c44c00d6-65dc-4294-a21c-101049ad6ae8","year":2024},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-08-14T08:28:46.827687Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2411.15247","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:000b37feef5e3459f49382fd28379ae331b1e77b153a508dd01e5f7a3c835ba3","observation_id":"f0d7ae0d-6bd3-4e43-b65f-4847ff0c983d","resolution":{"observed_at":"2026-07-09T02:25:55.862799Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.15247/citation-record","integrity":"/paper/2411.15247/integrity","json":"/paper/2411.15247/citation-record.json","paper":"/paper/2411.15247"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T14:58:37.165678Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.165678Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:c736d51f6b15d0a29786fadadea04ef92818379c45fde344f088fcdde318e2e4","observation_id":"4956b212-383f-4879-a6de-c4039a1d6f2f","resolution":{"observed_at":"2026-08-12T14:58:37.165678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-09T16:20:23.732146Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-12T14:58:37.254783Z","title":"Training diffusion models with reinforce- ment learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.254783Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:07f0d3ee39718e67d1cdf44c198f709a863c6b4547b04b06a9b7866ee581f0cf","observation_id":"33e0345a-05c6-4dd6-9f27-b05b6d98d40a","resolution":{"observed_at":"2026-08-12T14:58:37.254783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:37.260595Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.260595Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:bef57008c54f91a7b6fcadecb4cf7e715c7ee5201a7caaca55b2981e3818e477","observation_id":"53ef57c1-d77f-42c6-9d61-cb2236dc3379","resolution":{"observed_at":"2026-08-12T14:58:37.260595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:37.264757Z","title":"Find: Fine- tuning initial noise distribution with policy optimization for diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.264757Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:965f4c628fef263ed8b79d3a3af27984b344d170d6a89fc4bc9323dc6f87e3ae","observation_id":"04a93791-d50c-4285-9cee-48a4c7d2d15b","resolution":{"observed_at":"2026-08-12T14:58:37.264757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:37.270609Z","title":"Diffusion policy: Visuomotor policy learning via action dif- fusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.270609Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:8e1d7a20dabd9a191810ecf4324e3b72e6c8458ac8258893466980e7d276bcd7","observation_id":"063509e9-44c3-4c28-9e40-c6c08a4b074d","resolution":{"observed_at":"2026-08-12T14:58:37.270609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03958","last_updated":"2024-10-04T09:40:05Z","snapshot_observed_at":"2026-08-13T00:13:30.562971Z","submitted_at":"2024-05-07T02:45:28Z","title":"Simple Drop-in LoRA Conditioning on Attention Layers Will Improve Your Diffusion Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03958","snapshot_observed_at":"2026-08-12T14:58:37.276018Z","title":"Simple drop-in lora condition- ing on attention layers will improve your diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.276018Z"},"links":{"cited_paper":"/paper/2405.03958","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:259282f67e0f679c19b8c92d6e376420686f70c9f7bd36817fb8c2176e322f8f","observation_id":"a784ceb9-4a1a-4439-9f82-86125c1e4242","resolution":{"observed_at":"2026-08-12T14:58:37.276018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17400","last_updated":"2024-06-21T16:45:11Z","snapshot_observed_at":"2026-08-06T10:08:54.816113Z","submitted_at":"2023-09-29T17:01:02Z","title":"Directly Fine-Tuning Diffusion Models on Differentiable Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17400","snapshot_observed_at":"2026-08-12T14:58:37.281239Z","title":"Directly fine-tuning diffusion models on differentiable re- wards","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.281239Z"},"links":{"cited_paper":"/paper/2309.17400","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:9f3ddb424dfe175e4fdc4b067cca9309ad141a7b19aec39c7532773542a13e11","observation_id":"4b9c41bb-c5f3-43a0-bac4-4a9d78235435","resolution":{"observed_at":"2026-08-12T14:58:37.281239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:37.285877Z","title":"Prdp: Proximal reward difference prediction for large-scale reward finetuning of diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.285877Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:e4e7db2cac4c52d93eb8f29051947e9dbb3c25de1e23cfcd3ab697781efa8902","observation_id":"b116dddd-8813-4d67-950a-98999f5a3685","resolution":{"observed_at":"2026-08-12T14:58:37.285877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-12T14:58:37.340489Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.340489Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:b0566dac8444b8ba500b838b3074aef76b23420d25d69bc391c2f32e5c330d3f","observation_id":"ac517b83-c32f-413f-a180-cb050211f455","resolution":{"observed_at":"2026-08-12T14:58:37.340489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:37.425048Z","title":"Sigmoid- weighted linear units for neural network function approxima- tion in reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.425048Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:0a42010d960bc4b23bcaed5fcdcb40e92b57ce96c698b7dc55f0265d476c069b","observation_id":"6334cba3-c85c-43e0-9acc-8226be16a26f","resolution":{"observed_at":"2026-08-12T14:58:37.425048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13362","last_updated":"2024-09-19T20:42:34Z","snapshot_observed_at":"2026-08-13T12:54:43.328196Z","submitted_at":"2023-01-31T01:37:48Z","title":"Optimizing DDPM Sampling with Shortcut Fine-Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13362","snapshot_observed_at":"2026-08-12T14:58:37.430341Z","title":"Optimizing ddpm sampling with shortcut fine-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.430341Z"},"links":{"cited_paper":"/paper/2301.13362","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:cb25b96a4fa2d35f3ff97e28d550173fe2ce941c5b63c3ec156335a002f97763","observation_id":"fc6cd460-0221-4b79-904b-ce95655e2ce3","resolution":{"observed_at":"2026-08-12T14:58:37.430341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:37.435441Z","title":"Dpok: Reinforcement learning for fine-tuning text-to-image diffu- sion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.435441Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:d3a5aa8492918e7279e76af6c500b26e491c1baf7ab8abc6a02f3e80e2ca4b6f","observation_id":"08a8f9e5-b91f-4ca4-b9b6-813c58c87cb3","resolution":{"observed_at":"2026-08-12T14:58:37.435441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:37.440234Z","title":"Re- inforcement learning for fine-tuning text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.440234Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:01dc65a2cd2241472007c9854cf7fa7f16be07b853a0ee20e01e63579aa3788d","observation_id":"5ffd2d40-18c7-496a-a45b-9d4805ca6c59","resolution":{"observed_at":"2026-08-12T14:58:37.440234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01412","last_updated":"2021-04-29T16:44:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-03T19:02:10Z","title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.01412","snapshot_observed_at":"2026-08-12T14:58:37.444599Z","title":"Sharpness-aware minimization for efficiently improving generalization","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.444599Z"},"links":{"cited_paper":"/paper/2010.01412","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:fc565f1bc33175a1ab1cc8a76d2e4d1f972a16f95dff333c03d92179d0491715","observation_id":"c13d1e4a-0978-4357-9cea-4209d18f30d4","resolution":{"observed_at":"2026-08-12T14:58:37.444599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:37.449419Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.449419Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:581850c533acd62998e6810800042b86c22859d838ed6faadebd6feb46a86d87","observation_id":"fb2a3cc9-bdf1-43e2-a0d2-b26849d51e96","resolution":{"observed_at":"2026-08-12T14:58:37.449419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02857","last_updated":"2022-03-06T02:28:46Z","snapshot_observed_at":"2026-08-13T16:28:54.936433Z","submitted_at":"2022-03-06T02:28:46Z","title":"Leveraging Reward Gradients For Reinforcement Learning in Differentiable Physics Simulations","version":1},"cited_work":{"arxiv_id":"2203.02857","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.02857","snapshot_observed_at":"2026-08-12T14:58:39.594052Z","title":"Leveraging Reward Gradients For Reinforcement Learning in Differentiable Physics Simulations","venue":"cs.LG","work_id":"06bc21eb-5348-476c-b09c-89a6005179ac","year":2022},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.452939Z"},"links":{"cited_paper":"/paper/2203.02857","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:4a037c8e4d4e4932b71ce135f72ada701403158e93a705f4f1cdea98a78172da","observation_id":"62f168b6-b1ef-42f5-8e7f-0620b8f304d5","resolution":{"observed_at":"2026-08-12T14:58:39.686805Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:37.498734Z","title":"Jaddipal, Harish Prabhala, Sayak Paul, and Patrick V on Platen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.498734Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:09c6f39754f5761af8c460e3c113afc742bc43874099101c5c86ad722c85acfe","observation_id":"37b759e8-fd66-4f24-91f1-77e73517f37f","resolution":{"observed_at":"2026-08-12T14:58:37.498734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:37.544943Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.544943Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:0fc8d4e08ac251284eb7a5596cc25e17e6359527cf7845a0f09c7a2032cec4a0","observation_id":"aa30f412-c213-4817-ad9e-4387695947ad","resolution":{"observed_at":"2026-08-12T14:58:37.544943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:37.573843Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.573843Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:a290988ff428e879f98eb1866a8f972d2d72218780021c768a0c70feca5b3f8e","observation_id":"de9cc2bb-282c-4362-8563-82a79859099e","resolution":{"observed_at":"2026-08-12T14:58:37.573843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-12T14:58:37.577464Z","title":"Gritsenko, Diederik P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.577464Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:5832db1bac375891810c3ad6d98ec3cf6b1d930249df049851bafefb0363edb5","observation_id":"807388fc-c788-4a6a-b8c3-5edeaefc7d63","resolution":{"observed_at":"2026-08-12T14:58:37.577464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:37.582096Z","title":"Video dif- fusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.582096Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:4753adbae0cdd96106043fb0077f57f0e2dbe51ccd9a7398448b1f639f69327d","observation_id":"970fb646-cd2f-4464-991d-f502e130a120","resolution":{"observed_at":"2026-08-12T14:58:37.582096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T14:58:37.585864Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.585864Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:1b640f059ad8ed2802146a98bda118246ce998f24995ca9b1fb6307811bfc038","observation_id":"d35f34fe-097d-462e-af24-155bc43b102f","resolution":{"observed_at":"2026-08-12T14:58:37.585864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00935","last_updated":"2020-02-14T06:21:07Z","snapshot_observed_at":"2026-08-10T19:25:02.021953Z","submitted_at":"2019-10-01T05:00:26Z","title":"DiffTaichi: Differentiable Programming for Physical Simulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00935","snapshot_observed_at":"2026-08-12T14:58:37.590791Z","title":"Difftaichi: Differentiable programming for physical simulation","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.590791Z"},"links":{"cited_paper":"/paper/1910.00935","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:bba932d11dea48710e2c9f318b5fc72985aac26f0756f911f3adc0b1d2fff597","observation_id":"dc3c9d5a-c480-49d6-8401-93bfda62b158","resolution":{"observed_at":"2026-08-12T14:58:37.590791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:41.168738Z","title":"T2i-compbench: A comprehensive bench- mark for open-world compositional text-to-image genera- tion","venue":null,"work_id":"4ad8fbf5-364b-40fb-83de-33ebae8c8ee9","year":2023},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.595009Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:c69cc93b65c7bec51e098c354580dd3d1308a3ebdd480c50f6af19709a3df95d","observation_id":"b1c2fbee-8da1-49c6-8f14-3823f451c2b1","resolution":{"observed_at":"2026-08-12T14:58:41.174323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03311","last_updated":"2021-04-07T17:59:23Z","snapshot_observed_at":"2026-08-14T06:18:01.936236Z","submitted_at":"2021-04-07T17:59:23Z","title":"PlasticineLab: A Soft-Body Manipulation Benchmark with Differentiable Physics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.03311","snapshot_observed_at":"2026-08-12T14:58:37.599067Z","title":"Plasticinelab: A soft-body manipulation benchmark with differentiable physics","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.599067Z"},"links":{"cited_paper":"/paper/2104.03311","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:efff13fd5373ce0020b52ab0d62cc0657f8d363b59df8b16a064617c01d47fdb","observation_id":"70dbd66f-473a-4e3b-bf99-3a13252ab521","resolution":{"observed_at":"2026-08-12T14:58:37.599067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09991","last_updated":"2022-12-21T01:06:18Z","snapshot_observed_at":"2026-08-06T05:32:02.292779Z","submitted_at":"2022-05-20T07:02:03Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09991","snapshot_observed_at":"2026-08-12T14:58:37.603470Z","title":"Planning with diffusion for flexible behavior synthe- sis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.603470Z"},"links":{"cited_paper":"/paper/2205.09991","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:b16f5302ede66601d53fb58c89d5f86bf01f1124bc8a2bfd4c372cb8982f5fb0","observation_id":"4f6d658b-eef8-416e-bbb6-1dae83dc9999","resolution":{"observed_at":"2026-08-12T14:58:37.603470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:41.092840Z","title":"Information-theoretic local minima characterization and regularization","venue":null,"work_id":"7f104fb0-27d9-4cd6-a0b5-3936d6661ee4","year":2020},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.667754Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:ce28239f284153efed726bf8ada4142d1fc0864fc2c1f7d6c0d9c18d031a7d0b","observation_id":"2c9eb66b-3a40-436a-a6f1-9068939ced38","resolution":{"observed_at":"2026-08-12T14:58:41.154802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:41.074160Z","title":"Semantically robust unpaired image translation for data with unmatched seman- tics statistics","venue":null,"work_id":"7e912d74-4102-4e6c-a89f-fc30085efc96","year":2021},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.730659Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:c096f27282e8b4a19ff856c00f787c02cab5077fdf50e93f9b6dcbe676eaf8f2","observation_id":"3f12abb2-e6e3-49ec-9729-75ed3d84c804","resolution":{"observed_at":"2026-08-12T14:58:41.079668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:41.058448Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation","venue":null,"work_id":"c4dee6e5-0bc4-48b5-bbd3-5b67c2f17913","year":2023},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.736118Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:4711c78992b5a44c88aeaaf60a838baaa431eb012a847ccf47c1d7041798beb6","observation_id":"44def105-7c7f-453e-b089-2ac9bf6abd7c","resolution":{"observed_at":"2026-08-12T14:58:41.063550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:41.016649Z","title":"Actor-critic algorithms","venue":null,"work_id":"2e32dd0e-219a-4b14-adc1-94ab435b03f2","year":1999},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.739278Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:228308bc4fa88ee53a98a19d21cad9cdc356bc7233aef3a114426b5488c0781d","observation_id":"54ec5eb8-ed05-4cfd-bef9-bbe3ad5d93d2","resolution":{"observed_at":"2026-08-12T14:58:41.044781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09761","last_updated":"2021-03-30T19:48:38Z","snapshot_observed_at":"2026-07-06T09:57:19.117228Z","submitted_at":"2020-09-21T11:20:38Z","title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09761","snapshot_observed_at":"2026-08-12T14:58:37.743456Z","title":"Diffwave: A versatile diffusion model for audio synthesis","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.743456Z"},"links":{"cited_paper":"/paper/2009.09761","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:e3f8a299bbd866a38afcba8fe2d07ff335300b983a031c0c453a741c8ddbe64f","observation_id":"26eca7f6-7cc3-4f95-8026-49c23f3786cc","resolution":{"observed_at":"2026-08-12T14:58:37.743456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:40.944314Z","title":"Plastic: Improving input and label plasticity for sample efficient reinforcement learning","venue":null,"work_id":"31eabcd8-1d8c-47a7-be65-09a40353db69","year":2024},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.747834Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:72c800f9b0e93523020e395c162d85414c306421576e6cdb252cf627464a5d71","observation_id":"f1219b57-2b0d-4b59-8ec6-774889cc45dc","resolution":{"observed_at":"2026-08-12T14:58:40.948683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-08-12T14:58:37.751775Z","title":"Aligning text- to-image models using human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.751775Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:3e19cbe4c8b7ddd1e9974e4ad41ba4635b45f2df03df9c33773c0a31275483d5","observation_id":"ed217d12-bf78-42c3-8444-ca800a329ca1","resolution":{"observed_at":"2026-08-12T14:58:37.751775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:37.756335Z","title":"Playground v2.5: Three insights towards enhancing aesthetic quality in text-to-image genera- tion, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.756335Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:894da021dff145e45fc97cb5e9ac1b1ca5e4cc80036951e819316e13a8b9a677","observation_id":"426e77d0-439d-4010-a3df-788bb5992f8b","resolution":{"observed_at":"2026-08-12T14:58:37.756335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:40.923639Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"56c39b83-7fa8-4a15-85c7-15dce7a8eb3b","year":2022},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.760623Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:066216a46156e71f996c759fa8a765db7d8db1eaffce915863b48ef7be827496","observation_id":"1e952901-1710-4100-8cb8-c7fb0d04e1f6","resolution":{"observed_at":"2026-08-12T14:58:40.928222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11027","last_updated":"2024-10-07T18:47:47Z","snapshot_observed_at":"2026-08-13T00:52:43.939424Z","submitted_at":"2024-03-16T22:14:56Z","title":"Reward Guided Latent Consistency Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11027","snapshot_observed_at":"2026-08-12T14:58:37.764278Z","title":"Reward guided latent consistency distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.764278Z"},"links":{"cited_paper":"/paper/2403.11027","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:f55ae73c34c0edf88ef61372b7052899907ceb89386b4e94b36df02c8b21d8fd","observation_id":"833795ae-5fb0-4cce-b0a2-10acf5df95b5","resolution":{"observed_at":"2026-08-12T14:58:37.764278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04314","last_updated":"2025-03-25T17:06:27Z","snapshot_observed_at":"2026-08-12T23:48:30.414248Z","submitted_at":"2024-06-06T17:57:09Z","title":"Aesthetic Post-Training Diffusion Models from Generic Preferences with Step-by-step Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04314","snapshot_observed_at":"2026-08-12T14:58:37.860285Z","title":"Step-aware prefer- ence optimization: Aligning preference with denoising per- formance at each step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.860285Z"},"links":{"cited_paper":"/paper/2406.04314","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:d0a06e1730b310b2d602ca73914c47b72af6f42c4d3ac730802d0a23e98e2bf4","observation_id":"69395d4b-3ae2-4f8f-8009-49bc795e32c9","resolution":{"observed_at":"2026-08-12T14:58:37.860285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13929","last_updated":"2024-03-02T09:09:32Z","snapshot_observed_at":"2026-08-12T13:08:43.602176Z","submitted_at":"2024-02-21T16:51:05Z","title":"SDXL-Lightning: Progressive Adversarial Diffusion Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13929","snapshot_observed_at":"2026-08-12T14:58:37.880626Z","title":"Sdxl- lightning: Progressive adversarial diffusion distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.880626Z"},"links":{"cited_paper":"/paper/2402.13929","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:65c0111259efa2a7170ddc8258850d0902a5008b6d80b41e1b4cd2620e3117a7","observation_id":"94da24d4-dcce-44aa-8fd0-74a001d3e454","resolution":{"observed_at":"2026-08-12T14:58:37.880626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-12T14:58:37.885324Z","title":"Flow matching for generative mod- eling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.885324Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:2f8c290a8deb56a77fc67173d94a58cc1495acdf74ce09a7a536f8235bdff22b","observation_id":"12587c89-f915-47dd-ac5b-a89e8d3487ff","resolution":{"observed_at":"2026-08-12T14:58:37.885324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-13T12:55:40.566213Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-12T14:58:37.890049Z","title":"Audi- oldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.890049Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:2d2237e0c5798092ccd12348f96b4919f58df47051c72417b26bb2b232c1909a","observation_id":"e2cb3db2-d51c-4d46-afbd-935e7d0320cf","resolution":{"observed_at":"2026-08-12T14:58:37.890049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-12T14:58:37.894793Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.894793Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:9d44c55deafc8be280a0b2b80fc0edd6c6235380b5be639ecbb1fa0208c5c217","observation_id":"91c8a2b3-df27-4d2a-a253-fe2e6695f84f","resolution":{"observed_at":"2026-08-12T14:58:37.894793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:40.884248Z","title":"Instaflow: One step is enough for high-quality diffusion- based text-to-image generation","venue":null,"work_id":"ae2cabbf-2cf7-46af-a5fb-c377df723a6a","year":2023},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:37.929205Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:8c346395e59f049c84e8c8c58337369dda36dabe44b47417f0a149d26043a9ff","observation_id":"893a082c-8042-4fcb-b202-2371cf8a315a","resolution":{"observed_at":"2026-08-12T14:58:40.913563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:38.001579Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.001579Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:1acf414509bd8f31a0312974ddd419a502052ff682fe86abbd1c0ff738ff1745","observation_id":"52adc6f8-adda-49de-8ee4-42dd6a15c882","resolution":{"observed_at":"2026-08-12T14:58:38.001579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:40.815119Z","title":"Llmscore: Unveiling the power of large language models in text-to-image synthesis evaluation","venue":null,"work_id":"aef20a9b-ef15-443c-87b6-f041c19818f1","year":2024},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.006469Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:2ccc1807ce850e01cc91647b194b08eee13014dd993b38bdd56fcb999e371036","observation_id":"22933794-341a-4fcb-a0b0-a6cc7baf5143","resolution":{"observed_at":"2026-08-12T14:58:40.819551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04378","snapshot_observed_at":"2026-08-12T14:58:38.012133Z","title":"Latent consistency models: Synthesizing high- resolution images with few-step inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.012133Z"},"links":{"cited_paper":"/paper/2310.04378","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:da30d038f246da8c8d9fca9c83df42d4e9ff9d7a963a2aebbe0231161e0cf5d7","observation_id":"67dae9df-1169-4987-abbb-677a4c81486a","resolution":{"observed_at":"2026-08-12T14:58:38.012133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03190","last_updated":"2025-03-03T04:11:46Z","snapshot_observed_at":"2026-08-12T22:31:00.692772Z","submitted_at":"2024-10-04T07:05:16Z","title":"Tuning Timestep-Distilled Diffusion Model Using Pairwise Sample Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03190","snapshot_observed_at":"2026-08-12T14:58:38.016938Z","title":"Tuning timestep- distilled diffusion model using pairwise sample optimiza- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.016938Z"},"links":{"cited_paper":"/paper/2410.03190","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:8846ab4c62f3144348d220a1099abb603a921376659c63e4b46a7deab9709f7e","observation_id":"55790ba6-705b-4cae-bdca-178e57af356e","resolution":{"observed_at":"2026-08-12T14:58:38.016938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-14T03:19:40.736445Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-12T14:58:38.021176Z","title":"Playing atari with deep reinforcement learning","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.021176Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:06aca4fba334a02c8d67c1092c3753206b7780bd26f643662c9a6178400afd73","observation_id":"0a2114c3-789c-489d-9a83-280487036bac","resolution":{"observed_at":"2026-08-12T14:58:38.021176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03673","last_updated":"2024-06-22T08:07:39Z","snapshot_observed_at":"2026-08-13T19:45:56.138305Z","submitted_at":"2024-03-25T15:40:22Z","title":"RL for Consistency Models: Faster Reward Guided Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03673","snapshot_observed_at":"2026-08-12T14:58:38.026333Z","title":"Rl for consistency models: Faster reward guided text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.026333Z"},"links":{"cited_paper":"/paper/2404.03673","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:18afb2640cefc1bbf0d226663caafdb3bbd80a9a623dbb068588fb7647fdef0e","observation_id":"7dc0934f-7e35-46b6-a7a3-7fc7ada010c4","resolution":{"observed_at":"2026-08-12T14:58:38.026333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:40.801500Z","title":"Reinforcement learning by reward-weighted regression for operational space control","venue":null,"work_id":"176aa69b-87ea-4b09-a8ae-c0131017f2a3","year":2007},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.031541Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:87034d8b45ffe1c810d8f168f5ca2e37daf118a776eca8525c6ad3d71a25e6dd","observation_id":"1b9d41a1-f757-4a60-a84a-8fa0cf4895b5","resolution":{"observed_at":"2026-08-12T14:58:40.805671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-12T14:58:38.081157Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.081157Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:8255de9b60f7a509cadbe67b84e5878e427ce2d790a5cf2a8945a23ad53d0e34","observation_id":"eb00e920-4117-47c6-b4d9-4ab0d21b34bc","resolution":{"observed_at":"2026-08-12T14:58:38.081157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14988","last_updated":"2022-09-29T17:50:40Z","snapshot_observed_at":"2026-07-06T13:57:54.539656Z","submitted_at":"2022-09-29T17:50:40Z","title":"DreamFusion: Text-to-3D using 2D Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14988","snapshot_observed_at":"2026-08-12T14:58:38.125132Z","title":"Barron, and Ben Milden- hall","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.125132Z"},"links":{"cited_paper":"/paper/2209.14988","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:55b6f956738464e28b08a7d7b22274b4ff3be12dbfa48fba662583f474669d8d","observation_id":"2449c923-6564-4ff5-aba9-913a2621f1b0","resolution":{"observed_at":"2026-08-12T14:58:38.125132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03739","last_updated":"2024-11-07T03:54:22Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:18Z","title":"Aligning Text-to-Image Diffusion Models with Reward Backpropagation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03739","snapshot_observed_at":"2026-08-12T14:58:38.129779Z","title":"Aligning text-to-image diffusion models with reward backpropagation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.129779Z"},"links":{"cited_paper":"/paper/2310.03739","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:138dedacd283da93fb3d06df6c6aa753016bb82b72419b6f568a0c7556f5fb86","observation_id":"68159ef7-af13-4390-b128-ad85df3132b3","resolution":{"observed_at":"2026-08-12T14:58:38.129779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:40.783571Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"ffcd8c5e-d0a6-4b1c-92e2-b323e31da1ad","year":2021},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.133728Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:e2308e22f4f4f9b9f065f9752281616ec8b4729290346b039300c48ccfab943b","observation_id":"04f259d4-dd69-478b-a65e-3d8d5242cd90","resolution":{"observed_at":"2026-08-12T14:58:40.793186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:40.724749Z","title":"Direct preference optimization: Your language model is secretly a 10 reward model","venue":null,"work_id":"31786523-bc9d-4d90-960b-2b0f1ad63795","year":2024},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.137794Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:88bc623eaac96c350f1c85c268027f5dd3179c5a8ef65303d455804201b32807","observation_id":"db6d2560-42bb-4d7b-b08d-fba700087d6a","resolution":{"observed_at":"2026-08-12T14:58:40.769901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:38.143088Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.143088Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:9847848f4d25d2f4a80967be8b0f4903c10d53ca181e15661e67ac0607670c24","observation_id":"740b5d42-5f45-4e04-9d98-b7942b49e40f","resolution":{"observed_at":"2026-08-12T14:58:38.143088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-12T14:58:38.147785Z","title":"Hierarchical text-conditional image gener- ation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.147785Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:ab5d62022947876c62c8cd984adbab33e91ca03064914590766823302bc5bb4c","observation_id":"116e231f-ab18-4281-b566-b42848688ee3","resolution":{"observed_at":"2026-08-12T14:58:38.147785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:38.152052Z","title":"Blattmann, Dominik Lorenz, Patrick Esser, and Bj ¨orn Ommer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.152052Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:04352596b26860300aed9b6242068e0fc02daf8c00682b848e630c54f6ba98b0","observation_id":"a84af830-1ccd-42b1-b4a1-78ea3bd01d05","resolution":{"observed_at":"2026-08-12T14:58:38.152052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:38.156205Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.156205Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:cc6782e6a1e857d41942f79f541cc7bcc0a85f5d396b66f7324d6f51eabc5a61","observation_id":"7f97ebbf-52cd-40c9-912d-d5bd3eeab4e8","resolution":{"observed_at":"2026-08-12T14:58:38.156205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:38.196095Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.196095Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:f10a5b89b94c0a42689074cbb73e82725aeeda32abd0703b0bf7eb4fcdae3d9e","observation_id":"f8138986-6bf7-4ab4-824d-6e294cf4f68f","resolution":{"observed_at":"2026-08-12T14:58:38.196095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-08-12T01:14:44.484432Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-12T14:58:38.238991Z","title":"Progressive distillation for fast sampling of diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.238991Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:5393236c57844aaea2e2217f74fb88d45dd051a15b1c84d397ebcbc3ef16437c","observation_id":"c1fe4571-3ae4-4759-82c0-3580cfde86f0","resolution":{"observed_at":"2026-08-12T14:58:38.238991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17042","last_updated":"2023-11-28T18:53:24Z","snapshot_observed_at":"2026-08-13T05:15:07.708515Z","submitted_at":"2023-11-28T18:53:24Z","title":"Adversarial Diffusion Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17042","snapshot_observed_at":"2026-08-12T14:58:38.242470Z","title":"Adversarial diffusion distillation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.242470Z"},"links":{"cited_paper":"/paper/2311.17042","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:8eb8ffbd45a03b3be76adbadf1d0d815aa5fed1745c7f3e20c34e53a59feaf8e","observation_id":"980a99a2-8562-4d42-a2bf-3f5a99c467aa","resolution":{"observed_at":"2026-08-12T14:58:38.242470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:38.247556Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.247556Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:e7f4460411fc5ac79889c5de0597e696a9e088b005eeaf6fe107ee63c6ffba79","observation_id":"08982988-cccc-4d77-b933-3f9c5fc5145f","resolution":{"observed_at":"2026-08-12T14:58:38.247556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-12T21:29:36.308819Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-12T14:58:38.251197Z","title":"High-dimensional continuous con- trol using generalized advantage estimation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.251197Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:5e4035e3c94edf6c7b75dd07734c44d9ba72dbe86689962cd159e66ef3b396b4","observation_id":"6623e559-72de-4988-8609-2a87407d092d","resolution":{"observed_at":"2026-08-12T14:58:38.251197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T14:58:38.255785Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.255785Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:08c106d8022ad0c96593afd9cba70a2c20c96a1241d1e86cda75161e6e0f6363","observation_id":"d36fd569-e27d-4fe6-b63a-699e9472fe01","resolution":{"observed_at":"2026-08-12T14:58:38.255785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:40.648523Z","title":"Defining and characterizing reward gam- ing","venue":null,"work_id":"8a281de9-24ef-4cd9-9b8c-4e27f07e393f","year":2022},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.260740Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:f22499ed8e0486ceecbdb9f0e0920a57c09efcc2506d55c50b20b52306008ecc","observation_id":"fa9157f3-50dd-4f0b-be06-dde56a0dcffe","resolution":{"observed_at":"2026-08-12T14:58:40.672194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:40.530281Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"4659b613-6aa9-4311-b62b-2b755f079746","year":2015},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.265143Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:765bd04171a2be9ccf2a560a5ab0771d7470467d9d13b456c87b62c9df9b1660","observation_id":"9aa05414-3768-4d14-a3b0-7dbcf81345e0","resolution":{"observed_at":"2026-08-12T14:58:40.583396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-12T14:58:38.328207Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.328207Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:81139d1e7d602e38caea9d09eb7907c1d0e211b59a4353794e7021a373883787","observation_id":"8605e395-a1dd-47d0-9ea7-f61f77fa2d01","resolution":{"observed_at":"2026-08-12T14:58:38.328207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:38.334086Z","title":"Generative modeling by esti- mating gradients of the data distribution","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.334086Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:8533b926a7fe0fc3aa95ac85be49139decb11b256022c6ab9621006709411583","observation_id":"ab735257-0d42-42a1-9901-6451a7269602","resolution":{"observed_at":"2026-08-12T14:58:38.334086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-12T14:58:38.338060Z","title":"Score-based generative modeling through stochastic differential equa- tions","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.338060Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:646e3e325ea41c0838869b5f7a8204856831ebbe5498ecc16e058de4aecd1c73","observation_id":"002e913c-ce96-4f55-8834-a5a1dbf00c85","resolution":{"observed_at":"2026-08-12T14:58:38.338060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01469","last_updated":"2023-05-31T06:17:10Z","snapshot_observed_at":"2026-08-14T04:45:59.072029Z","submitted_at":"2023-03-02T18:30:16Z","title":"Consistency Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01469","snapshot_observed_at":"2026-08-12T14:58:38.342717Z","title":"Consistency models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.342717Z"},"links":{"cited_paper":"/paper/2303.01469","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:30280e05b1465f03b8dd40e9cee526acacd2dad84bc9fe38c7b91b772cc9e702","observation_id":"8c766e8d-85f8-417c-98b8-21bd2df53122","resolution":{"observed_at":"2026-08-12T14:58:38.342717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:40.509122Z","title":"Learning to predict by the methods of temporal differences","venue":null,"work_id":"aa097197-25b6-4c26-b84f-310586697835","year":1988},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.367940Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:e5ec3eec32d204c8d8ef8069574b2582ea52b07afc3eb0292d2f4a9531485288","observation_id":"c638806f-4d08-43eb-8dad-f36c3ddba8c2","resolution":{"observed_at":"2026-08-12T14:58:40.513510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:40.496264Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":"7949a050-cb99-4e4e-9291-925153ebe880","year":2018},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.473694Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:d861ef9a215d3cf2e62e733fd9877a4c932d28dab96a2fd7e649adb9cdfaefb6","observation_id":"865461fe-4248-4167-9106-cba6d4133969","resolution":{"observed_at":"2026-08-12T14:58:40.500839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:40.393485Z","title":"Policy gradient methods for reinforcement learning with function approximation","venue":null,"work_id":"2f656b67-dda8-4dc3-bd01-b0e184d2f592","year":1999},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.483350Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:7c749ef516de7c9862b2a782f34af2a35b2326be11a3e65f2ebfb0566502ddb7","observation_id":"0b139d73-91ad-4186-808e-8078d7e0a4b4","resolution":{"observed_at":"2026-08-12T14:58:40.438897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:40.356562Z","title":"Evalalign: Supervised fine- tuning multimodal llms with human-aligned data for evalu- ating text-to-image models","venue":null,"work_id":"cd1e2788-5644-4c0b-84b7-0810f1696a51","year":2024},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.488743Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:10dbb589457d83dff1259ae96e07483e3c8dbdca76ac1bd4fa9fe42473eb15a8","observation_id":"6119596e-7044-47ad-96c7-16f6026bfc4c","resolution":{"observed_at":"2026-08-12T14:58:40.377421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13734","last_updated":"2024-07-18T17:35:32Z","snapshot_observed_at":"2026-08-12T23:19:15.417284Z","submitted_at":"2024-07-18T17:35:32Z","title":"Understanding Reinforcement Learning-Based Fine-Tuning of Diffusion Models: A Tutorial and Review","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13734","snapshot_observed_at":"2026-08-12T14:58:38.494080Z","title":"Understanding reinforcement learning-based fine-tuning of diffusion models: A tutorial and review","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.494080Z"},"links":{"cited_paper":"/paper/2407.13734","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:b0ff270ee0132ff82ba1b524ecf2ff34ee43dffb58b2652fcde98f6c8ef3cd2b","observation_id":"1d12d40f-703f-492b-b32d-5c528e7b1993","resolution":{"observed_at":"2026-08-12T14:58:38.494080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:40.299564Z","title":"Diffusion model align- ment using direct preference optimization","venue":null,"work_id":"5cd07970-02ae-4295-bb24-c407a7591bc9","year":2024},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.605096Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:cf0f8a90f8850d211df77659e492b439c3370eaf00441735c329ee1e2486800d","observation_id":"efbe9370-c42f-40eb-9a2c-c4c4aef6c2b8","resolution":{"observed_at":"2026-08-12T14:58:40.304331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14896","last_updated":"2023-07-06T11:53:19Z","snapshot_observed_at":"2026-08-13T13:55:48.903163Z","submitted_at":"2022-10-26T17:54:20Z","title":"DiffusionDB: A Large-scale Prompt Gallery Dataset for Text-to-Image Generative Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14896","snapshot_observed_at":"2026-08-12T14:58:38.669172Z","title":"Diffu- siondb: A large-scale prompt gallery dataset for text-to- image generative models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.669172Z"},"links":{"cited_paper":"/paper/2210.14896","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:cbeaccb81cf6343227274122442469b6e8394a80e5ac656af8b092c83e7c76ff","observation_id":"63f6d466-fee8-4295-9b02-48f90abdf1fe","resolution":{"observed_at":"2026-08-12T14:58:38.669172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:40.272031Z","title":"Q-learning","venue":null,"work_id":"2bc8d597-c2ec-4ecf-8450-a6e4fcdd7f45","year":1992},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.674571Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:cd6f68fb76d334e06636c079e6cc5bf4b1377390422f5cb0fd214a4341a5ad69","observation_id":"33b71460-13dd-45a0-8353-38374dca330c","resolution":{"observed_at":"2026-08-12T14:58:40.287884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14420","last_updated":"2023-08-22T12:26:07Z","snapshot_observed_at":"2026-08-13T12:17:15.906420Z","submitted_at":"2023-03-25T10:09:03Z","title":"Human Preference Score: Better Aligning Text-to-Image Models with Human Preference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14420","snapshot_observed_at":"2026-08-12T14:58:38.679787Z","title":"Better aligning text-to-image models with human preference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.679787Z"},"links":{"cited_paper":"/paper/2303.14420","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:9a075c2b0d2e60908a96e8fd273429eefc8f9d2ab35fcda7fe208c6f0e4a059c","observation_id":"23d2f4da-3bfe-4bab-86d1-dc457a15ee92","resolution":{"observed_at":"2026-08-12T14:58:38.679787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:40.238173Z","title":"Human preference score: Better aligning text- to-image models with human preference","venue":null,"work_id":"260cdf42-46bc-4cab-bd37-bb0cce9b3a40","year":2023},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.683706Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:71a97c8dbaa2727e351e48f6356e9fe033b7a12bdd240c5e1232f4e9c191772a","observation_id":"64ac4e93-5edc-4d61-b771-01cc32bbd108","resolution":{"observed_at":"2026-08-12T14:58:40.242627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00760","last_updated":"2024-05-01T15:26:14Z","snapshot_observed_at":"2026-08-13T00:17:34.790360Z","submitted_at":"2024-05-01T15:26:14Z","title":"Deep Reward Supervisions for Tuning Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00760","snapshot_observed_at":"2026-08-12T14:58:38.749807Z","title":"Deep reward supervisions for tuning text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.749807Z"},"links":{"cited_paper":"/paper/2405.00760","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:3e803acf3c59c3c81395abe086e05dbeaff60a8e0a689fa2face77ea1964be7d","observation_id":"5307d521-1177-4f78-9caf-38f6c701cc11","resolution":{"observed_at":"2026-08-12T14:58:38.749807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:38.765301Z","title":"Group normalization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.765301Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:ecc5c7f8d99671c229a39cf0fbb607d17297a25c54ad560b3c5da4c94838f0cc","observation_id":"db15eef3-f273-453d-8e5f-b9c4f2b97d82","resolution":{"observed_at":"2026-08-12T14:58:38.765301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:40.124762Z","title":"Florence-2: Advancing a unified representation for a variety 11 of vision tasks","venue":null,"work_id":"45b1befb-d225-4a24-8075-cece6174a1dd","year":2024},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.769440Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:4890e38e05eabd34582966974662f3f67abda1e6740d67c11bcb317181b9a820","observation_id":"df6f2117-8297-4a6c-8d00-aa36262364f2","resolution":{"observed_at":"2026-08-12T14:58:40.177810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:40.108818Z","title":"Imagere- ward: Learning and evaluating human preferences for text- to-image generation","venue":null,"work_id":"fef78b8b-a587-4a65-9004-d5cca9759fd2","year":2024},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.773679Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:7c618b4d0ab579a2744dc63fa947ea9fbbabb0a317ad3e2ffce148e3188581a0","observation_id":"a9a38e18-66b3-494c-95d4-5496f81f5525","resolution":{"observed_at":"2026-08-12T14:58:40.113535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:40.038064Z","title":"Using human feedback to fine-tune diffusion models without any reward model","venue":null,"work_id":"8e7d83b3-86ec-4808-9eed-18ef7b2834d8","year":2024},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.777753Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:924dd1168f44378a8ff6f1f431e93d94f1ebe3e08476a35b35627c0f6ab216a2","observation_id":"f3520083-701d-46da-bfa3-fc2aae3aa855","resolution":{"observed_at":"2026-08-12T14:58:40.098996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06978","last_updated":"2022-10-12T08:25:31Z","snapshot_observed_at":"2026-08-13T14:07:41.298436Z","submitted_at":"2022-10-12T08:25:31Z","title":"LION: Latent Point Diffusion Models for 3D Shape Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06978","snapshot_observed_at":"2026-08-12T14:58:38.838499Z","title":"Lion: La- tent point diffusion models for 3d shape generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.838499Z"},"links":{"cited_paper":"/paper/2210.06978","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:fe196fdfafcfcb473a743374090e97b5fbad38b7c96d28b56070d5cda235ed7d","observation_id":"249e130b-fb6d-4d7a-9c99-f83594cd159c","resolution":{"observed_at":"2026-08-12T14:58:38.838499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05595","last_updated":"2024-11-26T12:12:50Z","snapshot_observed_at":"2026-08-13T00:34:54.465360Z","submitted_at":"2024-04-08T15:14:20Z","title":"UniFL: Improve Latent Diffusion Model via Unified Feedback Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05595","snapshot_observed_at":"2026-08-12T14:58:38.963875Z","title":"Unifl: Improve stable diffusion via unified feedback learn- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.963875Z"},"links":{"cited_paper":"/paper/2404.05595","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:71d105750935d395dfd9b1bfb614679e6a0e9cfa4a0e1f5d4f3d6cad49fd690e","observation_id":"98d14ea4-6a43-473b-b6c7-a6bdf01c18dc","resolution":{"observed_at":"2026-08-12T14:58:38.963875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-12T14:58:38.969899Z","title":"Bertscore: Evaluating text genera- tion with bert","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.969899Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:95605a5c779375ccd057153175bd42b87c04eed610dd20fdc375d9b0cf9a944d","observation_id":"26e3d646-eca1-4992-9bad-a0a625236a02","resolution":{"observed_at":"2026-08-12T14:58:38.969899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:39.968177Z","title":null,"venue":null,"work_id":"24710a2e-eaef-4a9c-9ee1-d89bbb3fdb49","year":null},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:38.974783Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:e044766d19f4d78316e322bb7cd193b76fe5104ddc3cbe204c0c6998b4ff001e","observation_id":"f633b17b-17db-446c-acbf-441bcae44a79","resolution":{"observed_at":"2026-08-12T14:58:40.026129Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:39.955246Z","title":null,"venue":null,"work_id":"a53bb2a9-3cc0-459e-bed5-fa711ecc63dc","year":null},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:39.015535Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:da093e59a1c7f42a363bb1d821215b5a9c6acf74b7b51a11124b41f0de67621e","observation_id":"fab0be03-741d-4961-a996-eb993af0463f","resolution":{"observed_at":"2026-08-12T14:58:39.959550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:39.809450Z","title":"Specifically, we use the CLIP-ViT-L/14 from the original CLIP paper and a similar BLIP model fine-tuned for VQA tasks (ViT-L for the vision backbone)","venue":null,"work_id":"8a61601c-9530-446b-9793-af9cd6a258b0","year":null},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:39.048475Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:60cb8590800ab285d912a5de22be3ac26ff5acc45ed57c744b14f1812a260dcc","observation_id":"6aed4586-243c-4a3e-8458-e75abd49783c","resolution":{"observed_at":"2026-08-12T14:58:39.906904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:39.794199Z","title":"Note that, SDXL-Turbo mainly focuses on image generation of 5122 pixels and SDXL-Lightning only supports≥ 2 step generation","venue":null,"work_id":"106a6ae4-2929-4bfe-9daa-62a54acb55e6","year":null},"citing_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:39.053842Z"},"links":{"citing_paper":"/paper/2411.15247"},"observation_digest":"sha256:3d2c2bf40c2f56559242ab7704dd12e75d6b410ff42de4a323999b0e7ce1d62e","observation_id":"f866bc04-e632-4dd5-85a4-f3710fb780c6","resolution":{"observed_at":"2026-08-12T14:58:39.799251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T06:10:56.301763Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward"},"reference_resolution":{"displayed":92,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":92},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 2 inbound Pith citation observations for arXiv:2411.15247."}