Pith. sign in

Paper Citation Record · LEDGER

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward

As of 14 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 2 inbound Pith citation observations for arXiv:2411.15247.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2411.15247 v3

Coverage vector

measured 92 of 92 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-12T14:58:39.053842Z

measured 94 of 94 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-13T06:32:02.005865+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:18:52.995998Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-09T02:25:55.861273Z

Reference resolution

92 of 92 outbound references displayed

  • verified exact1
  • verified fuzzy26
  • unresolved65
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 4956b212-383f-4879-a6de-c4039a1d6f2f · outbound

This paper cites GPT-4 Technical Report.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.165678Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.165678Z digest=sha256:c736d51f6b15d0a29786fadadea04ef92818379c45fde344f088fcdde318e2e4

Observation 33e0345a-05c6-4dd6-9f27-b05b6d98d40a · outbound

This paper cites Training Diffusion Models with Reinforcement Learning.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Training Diffusion Models with Reinforcement Learning

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.254783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.254783Z digest=sha256:07f0d3ee39718e67d1cdf44c198f709a863c6b4547b04b06a9b7866ee581f0cf

Observation 53ef57c1-d77f-42c6-9d61-cb2236dc3379 · outbound

This paper cites an unresolved cited work.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.260595Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.260595Z digest=sha256:bef57008c54f91a7b6fcadecb4cf7e715c7ee5201a7caaca55b2981e3818e477

Observation 04a93791-d50c-4285-9cee-48a4c7d2d15b · outbound

This paper cites Find: Fine- tuning initial noise distribution with policy optimization for diffusion models.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Find: Fine- tuning initial noise distribution with policy optimization for diffusion models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.264757Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.264757Z digest=sha256:965f4c628fef263ed8b79d3a3af27984b344d170d6a89fc4bc9323dc6f87e3ae

Observation 063509e9-44c3-4c28-9e40-c6c08a4b074d · outbound

This paper cites Diffusion policy: Visuomotor policy learning via action dif- fusion.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Diffusion policy: Visuomotor policy learning via action dif- fusion

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.270609Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.270609Z digest=sha256:8e1d7a20dabd9a191810ecf4324e3b72e6c8458ac8258893466980e7d276bcd7

Observation a784ceb9-4a1a-4439-9f82-86125c1e4242 · outbound

This paper cites Simple Drop-in LoRA Conditioning on Attention Layers Will Improve Your Diffusion Model.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Simple Drop-in LoRA Conditioning on Attention Layers Will Improve Your Diffusion Model

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.276018Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.276018Z digest=sha256:259282f67e0f679c19b8c92d6e376420686f70c9f7bd36817fb8c2176e322f8f

Observation 4b9c41bb-c5f3-43a0-bac4-4a9d78235435 · outbound

This paper cites Directly Fine-Tuning Diffusion Models on Differentiable Rewards.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Directly Fine-Tuning Diffusion Models on Differentiable Rewards

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.281239Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.281239Z digest=sha256:9f3ddb424dfe175e4fdc4b067cca9309ad141a7b19aec39c7532773542a13e11

Observation b116dddd-8813-4d67-950a-98999f5a3685 · outbound

This paper cites Prdp: Proximal reward difference prediction for large-scale reward finetuning of diffusion models.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Prdp: Proximal reward difference prediction for large-scale reward finetuning of diffusion models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.285877Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.285877Z digest=sha256:e4e7db2cac4c52d93eb8f29051947e9dbb3c25de1e23cfcd3ab697781efa8902

Observation ac517b83-c32f-413f-a180-cb050211f455 · outbound

This paper cites RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.340489Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.340489Z digest=sha256:b0566dac8444b8ba500b838b3074aef76b23420d25d69bc391c2f32e5c330d3f

Observation 6334cba3-c85c-43e0-9acc-8226be16a26f · outbound

This paper cites Sigmoid- weighted linear units for neural network function approxima- tion in reinforcement learning.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Sigmoid- weighted linear units for neural network function approxima- tion in reinforcement learning

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.425048Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.425048Z digest=sha256:0a42010d960bc4b23bcaed5fcdcb40e92b57ce96c698b7dc55f0265d476c069b

Observation fc6cd460-0221-4b79-904b-ce95655e2ce3 · outbound

This paper cites Optimizing DDPM Sampling with Shortcut Fine-Tuning.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Optimizing DDPM Sampling with Shortcut Fine-Tuning

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.430341Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.430341Z digest=sha256:cb25b96a4fa2d35f3ff97e28d550173fe2ce941c5b63c3ec156335a002f97763

Observation 08a8f9e5-b91f-4ca4-b9b6-813c58c87cb3 · outbound

This paper cites Dpok: Reinforcement learning for fine-tuning text-to-image diffu- sion models.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Dpok: Reinforcement learning for fine-tuning text-to-image diffu- sion models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.435441Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.435441Z digest=sha256:d3a5aa8492918e7279e76af6c500b26e491c1baf7ab8abc6a02f3e80e2ca4b6f

Observation 5ffd2d40-18c7-496a-a45b-9d4805ca6c59 · outbound

This paper cites Re- inforcement learning for fine-tuning text-to-image diffusion models.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Re- inforcement learning for fine-tuning text-to-image diffusion models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.440234Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.440234Z digest=sha256:01dc65a2cd2241472007c9854cf7fa7f16be07b853a0ee20e01e63579aa3788d

Observation c13d1e4a-0978-4357-9cea-4209d18f30d4 · outbound

This paper cites Sharpness-Aware Minimization for Efficiently Improving Generalization.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Sharpness-Aware Minimization for Efficiently Improving Generalization

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.444599Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.444599Z digest=sha256:fc565f1bc33175a1ab1cc8a76d2e4d1f972a16f95dff333c03d92179d0491715

Observation fb2a3cc9-bdf1-43e2-a0d2-b26849d51e96 · outbound

This paper cites Scaling laws for reward model overoptimization.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Scaling laws for reward model overoptimization

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.449419Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.449419Z digest=sha256:581850c533acd62998e6810800042b86c22859d838ed6faadebd6feb46a86d87

Observation 62f168b6-b1ef-42f5-8e7f-0620b8f304d5 · outbound

This paper cites Leveraging Reward Gradients For Reinforcement Learning in Differentiable Physics Simulations.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Leveraging Reward Gradients For Reinforcement Learning in Differentiable Physics Simulations

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-08-12T14:58:39.686805Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:37.452939Z digest=sha256:05c514385a77ef34f8b1a2d83af333628ff667a4fd7cc7246a57d93d7065b47a

Observation 37b759e8-fd66-4f24-91f1-77e73517f37f · outbound

This paper cites Jaddipal, Harish Prabhala, Sayak Paul, and Patrick V on Platen.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Jaddipal, Harish Prabhala, Sayak Paul, and Patrick V on Platen

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.498734Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.498734Z digest=sha256:09c6f39754f5761af8c460e3c113afc742bc43874099101c5c86ad722c85acfe

Observation aa30f412-c213-4817-ad9e-4387695947ad · outbound

This paper cites Gans trained by a two time-scale update rule converge to a local nash equilib- rium.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Gans trained by a two time-scale update rule converge to a local nash equilib- rium

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.544943Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.544943Z digest=sha256:0fc8d4e08ac251284eb7a5596cc25e17e6359527cf7845a0f09c7a2032cec4a0

Observation de9cc2bb-282c-4362-8563-82a79859099e · outbound

This paper cites Denoising dif- fusion probabilistic models.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Denoising dif- fusion probabilistic models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.573843Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.573843Z digest=sha256:a290988ff428e879f98eb1866a8f972d2d72218780021c768a0c70feca5b3f8e

Observation 807388fc-c788-4a6a-b8c3-5edeaefc7d63 · outbound

This paper cites Imagen Video: High Definition Video Generation with Diffusion Models.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Imagen Video: High Definition Video Generation with Diffusion Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.577464Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.577464Z digest=sha256:5832db1bac375891810c3ad6d98ec3cf6b1d930249df049851bafefb0363edb5

Observation 970fb646-cd2f-4464-991d-f502e130a120 · outbound

This paper cites Video dif- fusion models.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Video dif- fusion models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.582096Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.582096Z digest=sha256:4753adbae0cdd96106043fb0077f57f0e2dbe51ccd9a7398448b1f639f69327d

Observation d35f34fe-097d-462e-af24-155bc43b102f · outbound

This paper cites LoRA: Low-Rank Adaptation of Large Language Models.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward LoRA: Low-Rank Adaptation of Large Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.585864Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.585864Z digest=sha256:1b640f059ad8ed2802146a98bda118246ce998f24995ca9b1fb6307811bfc038

Observation dc3c9d5a-c480-49d6-8401-93bfda62b158 · outbound

This paper cites DiffTaichi: Differentiable Programming for Physical Simulation.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward DiffTaichi: Differentiable Programming for Physical Simulation

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.590791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.590791Z digest=sha256:bba932d11dea48710e2c9f318b5fc72985aac26f0756f911f3adc0b1d2fff597

Observation b1c2fbee-8da1-49c6-8f14-3823f451c2b1 · outbound

This paper cites T2i-compbench: A comprehensive bench- mark for open-world compositional text-to-image genera- tion.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward T2i-compbench: A comprehensive bench- mark for open-world compositional text-to-image genera- tion

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:41.174323Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:37.595009Z digest=sha256:078bc1d87f8d597efdcc214d7c149823255bffd6451278e3f079600b9442b94c

Observation 70dbd66f-473a-4e3b-bf99-3a13252ab521 · outbound

This paper cites PlasticineLab: A Soft-Body Manipulation Benchmark with Differentiable Physics.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward PlasticineLab: A Soft-Body Manipulation Benchmark with Differentiable Physics

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.599067Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.599067Z digest=sha256:efff13fd5373ce0020b52ab0d62cc0657f8d363b59df8b16a064617c01d47fdb

Observation 4f6d658b-eef8-416e-bbb6-1dae83dc9999 · outbound

This paper cites Planning with Diffusion for Flexible Behavior Synthesis.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Planning with Diffusion for Flexible Behavior Synthesis

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.603470Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.603470Z digest=sha256:b16f5302ede66601d53fb58c89d5f86bf01f1124bc8a2bfd4c372cb8982f5fb0

Observation 2c9eb66b-3a40-436a-a6f1-9068939ced38 · outbound

This paper cites Information-theoretic local minima characterization and regularization.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Information-theoretic local minima characterization and regularization

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:41.154802Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:37.667754Z digest=sha256:a965f09fa0e8d9ab9b4d517fbd867bc7bb1e67a22cb2e7fb6801d1a0ef852981

Observation 3f12abb2-e6e3-49ec-9729-75ed3d84c804 · outbound

This paper cites Semantically robust unpaired image translation for data with unmatched seman- tics statistics.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Semantically robust unpaired image translation for data with unmatched seman- tics statistics

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:41.079668Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:37.730659Z digest=sha256:094f8ca74fe53b468d0cfb84f10644786f621a6f2df62b357c8cf434077abae8

Observation 44def105-7c7f-453e-b089-2ac9bf6abd7c · outbound

This paper cites Pick-a-pic: An open dataset of user preferences for text-to-image generation.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Pick-a-pic: An open dataset of user preferences for text-to-image generation

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:41.063550Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:37.736118Z digest=sha256:d142b97c6c295ec5d2f6c249baa5ef6a14c66fc65bb1506ac21e1e83780f8330

Observation 54ec5eb8-ed05-4cfd-bef9-bbe3ad5d93d2 · outbound

This paper cites Actor-critic algorithms.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Actor-critic algorithms

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:41.044781Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:37.739278Z digest=sha256:b59ffba289955109941ba0097107b8302e53d7e0ace8c7854ce4975bc80f8c35

Observation 26eca7f6-7cc3-4f95-8026-49c23f3786cc · outbound

This paper cites DiffWave: A Versatile Diffusion Model for Audio Synthesis.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward DiffWave: A Versatile Diffusion Model for Audio Synthesis

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.743456Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.743456Z digest=sha256:e3f8a299bbd866a38afcba8fe2d07ff335300b983a031c0c453a741c8ddbe64f

Observation f1219b57-2b0d-4b59-8ec6-774889cc45dc · outbound

This paper cites Plastic: Improving input and label plasticity for sample efficient reinforcement learning.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Plastic: Improving input and label plasticity for sample efficient reinforcement learning

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:40.948683Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:37.747834Z digest=sha256:1dc9b69e259f1537905330397695bb52388ad8e51ebbba132b66f2f7d459d837

Observation ed217d12-bf78-42c3-8444-ca800a329ca1 · outbound

This paper cites Aligning Text-to-Image Models using Human Feedback.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Aligning Text-to-Image Models using Human Feedback

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.751775Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.751775Z digest=sha256:3e19cbe4c8b7ddd1e9974e4ad41ba4635b45f2df03df9c33773c0a31275483d5

Observation 426e77d0-439d-4010-a3df-788bb5992f8b · outbound

This paper cites Playground v2.5: Three insights towards enhancing aesthetic quality in text-to-image genera- tion, 2024.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Playground v2.5: Three insights towards enhancing aesthetic quality in text-to-image genera- tion, 2024

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.756335Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.756335Z digest=sha256:894da021dff145e45fc97cb5e9ac1b1ca5e4cc80036951e819316e13a8b9a677

Observation 1e952901-1710-4100-8cb8-c7fb0d04e1f6 · outbound

This paper cites Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:40.928222Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:37.760623Z digest=sha256:4cc42019e4899d0b99ba5a1381f169fa918d31b080643d2b92640d455658837e

Observation 833795ae-5fb0-4cce-b0a2-10acf5df95b5 · outbound

This paper cites Reward Guided Latent Consistency Distillation.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Reward Guided Latent Consistency Distillation

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.764278Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.764278Z digest=sha256:f55ae73c34c0edf88ef61372b7052899907ceb89386b4e94b36df02c8b21d8fd

Observation 69395d4b-3ae2-4f8f-8009-49bc795e32c9 · outbound

This paper cites Aesthetic Post-Training Diffusion Models from Generic Preferences with Step-by-step Preference Optimization.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Aesthetic Post-Training Diffusion Models from Generic Preferences with Step-by-step Preference Optimization

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.860285Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.860285Z digest=sha256:d0a06e1730b310b2d602ca73914c47b72af6f42c4d3ac730802d0a23e98e2bf4

Observation 94da24d4-dcce-44aa-8fd0-74a001d3e454 · outbound

This paper cites SDXL-Lightning: Progressive Adversarial Diffusion Distillation.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward SDXL-Lightning: Progressive Adversarial Diffusion Distillation

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.880626Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.880626Z digest=sha256:65c0111259efa2a7170ddc8258850d0902a5008b6d80b41e1b4cd2620e3117a7

Observation 12587c89-f915-47dd-ac5b-a89e8d3487ff · outbound

This paper cites Flow Matching for Generative Modeling.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Flow Matching for Generative Modeling

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.885324Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.885324Z digest=sha256:2f8c290a8deb56a77fc67173d94a58cc1495acdf74ce09a7a536f8235bdff22b

Observation e2cb3db2-d51c-4d46-afbd-935e7d0320cf · outbound

This paper cites AudioLDM: Text-to-Audio Generation with Latent Diffusion Models.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward AudioLDM: Text-to-Audio Generation with Latent Diffusion Models

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.890049Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.890049Z digest=sha256:2d2237e0c5798092ccd12348f96b4919f58df47051c72417b26bb2b232c1909a

Observation 91c8a2b3-df27-4d2a-a253-fe2e6695f84f · outbound

This paper cites Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:37.894793Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:37.894793Z digest=sha256:9d44c55deafc8be280a0b2b80fc0edd6c6235380b5be639ecbb1fa0208c5c217

Observation 893a082c-8042-4fcb-b202-2371cf8a315a · outbound

This paper cites Instaflow: One step is enough for high-quality diffusion- based text-to-image generation.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Instaflow: One step is enough for high-quality diffusion- based text-to-image generation

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:40.913563Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:37.929205Z digest=sha256:79d7bfff992dbe34fc87e49b8214b3ec7a0a28b8c7bbcccab600991425d2aaf5

Observation 52adc6f8-adda-49de-8ee4-42dd6a15c882 · outbound

This paper cites Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.001579Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.001579Z digest=sha256:1acf414509bd8f31a0312974ddd419a502052ff682fe86abbd1c0ff738ff1745

Observation 22933794-341a-4fcb-a0b0-a6cc7baf5143 · outbound

This paper cites Llmscore: Unveiling the power of large language models in text-to-image synthesis evaluation.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Llmscore: Unveiling the power of large language models in text-to-image synthesis evaluation

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:40.819551Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:38.006469Z digest=sha256:d4dcf3b9590974319e0b181e9aeeb5fb42858426303efe54cb3519a99ad8ca26

Observation 67dae9df-1169-4987-abbb-677a4c81486a · outbound

This paper cites Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.012133Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.012133Z digest=sha256:da30d038f246da8c8d9fca9c83df42d4e9ff9d7a963a2aebbe0231161e0cf5d7

Observation 55790ba6-705b-4cae-bdca-178e57af356e · outbound

This paper cites Tuning Timestep-Distilled Diffusion Model Using Pairwise Sample Optimization.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Tuning Timestep-Distilled Diffusion Model Using Pairwise Sample Optimization

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.016938Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.016938Z digest=sha256:8846ab4c62f3144348d220a1099abb603a921376659c63e4b46a7deab9709f7e

Observation 0a2114c3-789c-489d-9a83-280487036bac · outbound

This paper cites Playing Atari with Deep Reinforcement Learning.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Playing Atari with Deep Reinforcement Learning

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.021176Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.021176Z digest=sha256:06aca4fba334a02c8d67c1092c3753206b7780bd26f643662c9a6178400afd73

Observation 7dc0934f-7e35-46b6-a7a3-7fc7ada010c4 · outbound

This paper cites RL for Consistency Models: Faster Reward Guided Text-to-Image Generation.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward RL for Consistency Models: Faster Reward Guided Text-to-Image Generation

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.026333Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.026333Z digest=sha256:18afb2640cefc1bbf0d226663caafdb3bbd80a9a623dbb068588fb7647fdef0e

Observation 1b9d41a1-f757-4a60-a84a-8fa0cf4895b5 · outbound

This paper cites Reinforcement learning by reward-weighted regression for operational space control.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Reinforcement learning by reward-weighted regression for operational space control

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:40.805671Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:38.031541Z digest=sha256:8b25eab278dcbde1fce75a68bb5ca5b2a3ae533c1a41af9c1196df809ea2adc7

Observation eb00e920-4117-47c6-b4d9-4ab0d21b34bc · outbound

This paper cites SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.081157Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.081157Z digest=sha256:8255de9b60f7a509cadbe67b84e5878e427ce2d790a5cf2a8945a23ad53d0e34

Observation 2449c923-6564-4ff5-aba9-913a2621f1b0 · outbound

This paper cites DreamFusion: Text-to-3D using 2D Diffusion.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward DreamFusion: Text-to-3D using 2D Diffusion

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.125132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.125132Z digest=sha256:55b6f956738464e28b08a7d7b22274b4ff3be12dbfa48fba662583f474669d8d

Observation 68159ef7-af13-4390-b128-ad85df3132b3 · outbound

This paper cites Aligning Text-to-Image Diffusion Models with Reward Backpropagation.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Aligning Text-to-Image Diffusion Models with Reward Backpropagation

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.129779Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.129779Z digest=sha256:138dedacd283da93fb3d06df6c6aa753016bb82b72419b6f568a0c7556f5fb86

Observation 04f259d4-dd69-478b-a65e-3d8d5242cd90 · outbound

This paper cites Learning transferable visual models from natural language supervi- sion.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Learning transferable visual models from natural language supervi- sion

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:40.793186Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:38.133728Z digest=sha256:fd6676ffff2bd26e2a1a19aa0c3d84db954cc32bdff1e924939b2d74031828a1

Observation db6d2560-42bb-4d7b-b08d-fba700087d6a · outbound

This paper cites Direct preference optimization: Your language model is secretly a 10 reward model.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Direct preference optimization: Your language model is secretly a 10 reward model

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:40.769901Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:38.137794Z digest=sha256:96cd903b0ec58ccd40e9c3feab58f9bd44885b3223205ca0384cee37e4a88677

Observation 740b5d42-5f45-4e04-9d98-b7942b49e40f · outbound

This paper cites Zero-shot text-to-image generation.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Zero-shot text-to-image generation

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.143088Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.143088Z digest=sha256:9847848f4d25d2f4a80967be8b0f4903c10d53ca181e15661e67ac0607670c24

Observation 116e231f-ab18-4281-b566-b42848688ee3 · outbound

This paper cites Hierarchical Text-Conditional Image Generation with CLIP Latents.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Hierarchical Text-Conditional Image Generation with CLIP Latents

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.147785Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.147785Z digest=sha256:ab5d62022947876c62c8cd984adbab33e91ca03064914590766823302bc5bb4c

Observation a84af830-1ccd-42b1-b4a1-78ea3bd01d05 · outbound

This paper cites Blattmann, Dominik Lorenz, Patrick Esser, and Bj ¨orn Ommer.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Blattmann, Dominik Lorenz, Patrick Esser, and Bj ¨orn Ommer

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.152052Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.152052Z digest=sha256:04352596b26860300aed9b6242068e0fc02daf8c00682b848e630c54f6ba98b0

Observation 7f97ebbf-52cd-40c9-912d-d5bd3eeab4e8 · outbound

This paper cites High-resolution image synthesis with latent diffusion models.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward High-resolution image synthesis with latent diffusion models

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.156205Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.156205Z digest=sha256:cc6782e6a1e857d41942f79f541cc7bcc0a85f5d396b66f7324d6f51eabc5a61

Observation f8138986-6bf7-4ab4-824d-6e294cf4f68f · outbound

This paper cites Photorealistic text-to-image diffusion models with deep language understanding.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Photorealistic text-to-image diffusion models with deep language understanding

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.196095Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.196095Z digest=sha256:f10a5b89b94c0a42689074cbb73e82725aeeda32abd0703b0bf7eb4fcdae3d9e

Observation c1fe4571-3ae4-4759-82c0-3580cfde86f0 · outbound

This paper cites Progressive Distillation for Fast Sampling of Diffusion Models.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Progressive Distillation for Fast Sampling of Diffusion Models

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.238991Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.238991Z digest=sha256:5393236c57844aaea2e2217f74fb88d45dd051a15b1c84d397ebcbc3ef16437c

Observation 980a99a2-8562-4d42-a2bf-3f5a99c467aa · outbound

This paper cites Adversarial Diffusion Distillation.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Adversarial Diffusion Distillation

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.242470Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.242470Z digest=sha256:8eb8ffbd45a03b3be76adbadf1d0d815aa5fed1745c7f3e20c34e53a59feaf8e

Observation 08982988-cccc-4d77-b933-3f9c5fc5145f · outbound

This paper cites Laion-5b: An open large-scale dataset for training next generation image-text models.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Laion-5b: An open large-scale dataset for training next generation image-text models

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.247556Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.247556Z digest=sha256:e7f4460411fc5ac79889c5de0597e696a9e088b005eeaf6fe107ee63c6ffba79

Observation 6623e559-72de-4988-8609-2a87407d092d · outbound

This paper cites High-Dimensional Continuous Control Using Generalized Advantage Estimation.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward High-Dimensional Continuous Control Using Generalized Advantage Estimation

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.251197Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.251197Z digest=sha256:5e4035e3c94edf6c7b75dd07734c44d9ba72dbe86689962cd159e66ef3b396b4

Observation d36fd569-e27d-4fe6-b63a-699e9472fe01 · outbound

This paper cites Proximal Policy Optimization Algorithms.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Proximal Policy Optimization Algorithms

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.255785Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.255785Z digest=sha256:08c106d8022ad0c96593afd9cba70a2c20c96a1241d1e86cda75161e6e0f6363

Observation fa9157f3-50dd-4f0b-be06-dde56a0dcffe · outbound

This paper cites Defining and characterizing reward gam- ing.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Defining and characterizing reward gam- ing

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:40.672194Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:38.260740Z digest=sha256:65429371508784fd5ae2d85e35b470fdc9c0af85589cda197150839ff220ec9c

Observation 9aa05414-3768-4d14-a3b0-7dbcf81345e0 · outbound

This paper cites Deep unsupervised learning using nonequilibrium thermodynamics.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Deep unsupervised learning using nonequilibrium thermodynamics

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:40.583396Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:38.265143Z digest=sha256:86bfd5ec57791f1324dc7e4277031d595ba8139d96e4b6c318f4aa91f55d1cf1

Observation 8605e395-a1dd-47d0-9ea7-f61f77fa2d01 · outbound

This paper cites Denoising Diffusion Implicit Models.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Denoising Diffusion Implicit Models

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.328207Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.328207Z digest=sha256:81139d1e7d602e38caea9d09eb7907c1d0e211b59a4353794e7021a373883787

Observation ab735257-0d42-42a1-9901-6451a7269602 · outbound

This paper cites Generative modeling by esti- mating gradients of the data distribution.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Generative modeling by esti- mating gradients of the data distribution

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.334086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.334086Z digest=sha256:8533b926a7fe0fc3aa95ac85be49139decb11b256022c6ab9621006709411583

Observation 002e913c-ce96-4f55-8834-a5a1dbf00c85 · outbound

This paper cites Score-Based Generative Modeling through Stochastic Differential Equations.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Score-Based Generative Modeling through Stochastic Differential Equations

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.338060Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.338060Z digest=sha256:646e3e325ea41c0838869b5f7a8204856831ebbe5498ecc16e058de4aecd1c73

Observation 8c766e8d-85f8-417c-98b8-21bd2df53122 · outbound

This paper cites Consistency Models.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Consistency Models

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.342717Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.342717Z digest=sha256:30280e05b1465f03b8dd40e9cee526acacd2dad84bc9fe38c7b91b772cc9e702

Observation c638806f-4d08-43eb-8dad-f36c3ddba8c2 · outbound

This paper cites Learning to predict by the methods of temporal differences.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Learning to predict by the methods of temporal differences

Reference 71

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:40.513510Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:38.367940Z digest=sha256:4030e360fa3a695ec8c98d654d8d39f2ea96bdb191fee3cb9deee181763ac798

Observation 865461fe-4248-4167-9106-cba6d4133969 · outbound

This paper cites Reinforcement learning: An introduction.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Reinforcement learning: An introduction

Reference 72

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:40.500839Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:38.473694Z digest=sha256:7b9d609220510f1220693cf9f8ea4893a78a2dce1c19aa275d1614b84905d1fa

Observation 0b139d73-91ad-4186-808e-8078d7e0a4b4 · outbound

This paper cites Policy gradient methods for reinforcement learning with function approximation.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Policy gradient methods for reinforcement learning with function approximation

Reference 73

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:40.438897Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:38.483350Z digest=sha256:282862e7e6fbb85e7978db1f02706a24f02479026cf9be9233080c1ff3ee1eeb

Observation 6119596e-7044-47ad-96c7-16f6026bfc4c · outbound

This paper cites Evalalign: Supervised fine- tuning multimodal llms with human-aligned data for evalu- ating text-to-image models.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Evalalign: Supervised fine- tuning multimodal llms with human-aligned data for evalu- ating text-to-image models

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:40.377421Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:38.488743Z digest=sha256:08a1089068f29e25394713afaac9983554a8c0f6acb91ed9a7e1ec704a290f81

Observation 1d12d40f-703f-492b-b32d-5c528e7b1993 · outbound

This paper cites Understanding Reinforcement Learning-Based Fine-Tuning of Diffusion Models: A Tutorial and Review.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Understanding Reinforcement Learning-Based Fine-Tuning of Diffusion Models: A Tutorial and Review

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.494080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.494080Z digest=sha256:b0ff270ee0132ff82ba1b524ecf2ff34ee43dffb58b2652fcde98f6c8ef3cd2b

Observation efbe9370-c42f-40eb-9a2c-c4c4aef6c2b8 · outbound

This paper cites Diffusion model align- ment using direct preference optimization.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Diffusion model align- ment using direct preference optimization

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:40.304331Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:38.605096Z digest=sha256:48468243f1b7d77d78869732f5ce85443950ff44fb0f5727bee80b22574f052e

Observation 63f6d466-fee8-4295-9b02-48f90abdf1fe · outbound

This paper cites DiffusionDB: A Large-scale Prompt Gallery Dataset for Text-to-Image Generative Models.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward DiffusionDB: A Large-scale Prompt Gallery Dataset for Text-to-Image Generative Models

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.669172Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.669172Z digest=sha256:cbeaccb81cf6343227274122442469b6e8394a80e5ac656af8b092c83e7c76ff

Observation 33b71460-13dd-45a0-8353-38374dca330c · outbound

This paper cites Q-learning.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Q-learning

Reference 78

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:40.287884Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:38.674571Z digest=sha256:b1bd395007ef0e63e81e2ca90e5a52fe00b03d831a5088765e5dcb5871b972b7

Observation 23d2f4da-3bfe-4bab-86d1-dc457a15ee92 · outbound

This paper cites Human Preference Score: Better Aligning Text-to-Image Models with Human Preference.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Human Preference Score: Better Aligning Text-to-Image Models with Human Preference

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.679787Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.679787Z digest=sha256:9a075c2b0d2e60908a96e8fd273429eefc8f9d2ab35fcda7fe208c6f0e4a059c

Observation 64ac4e93-5edc-4d61-b771-01cc32bbd108 · outbound

This paper cites Human preference score: Better aligning text- to-image models with human preference.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Human preference score: Better aligning text- to-image models with human preference

Reference 80

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:40.242627Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:38.683706Z digest=sha256:034501d3ab7bf0289e7861dca237e504dc8791f15e467bbba3d561b7fefe6790

Observation 5307d521-1177-4f78-9caf-38f6c701cc11 · outbound

This paper cites Deep Reward Supervisions for Tuning Text-to-Image Diffusion Models.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Deep Reward Supervisions for Tuning Text-to-Image Diffusion Models

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.749807Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.749807Z digest=sha256:3e803acf3c59c3c81395abe086e05dbeaff60a8e0a689fa2face77ea1964be7d

Observation db15eef3-f273-453d-8e5f-b9c4f2b97d82 · outbound

This paper cites Group normalization.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Group normalization

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.765301Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.765301Z digest=sha256:ecc5c7f8d99671c229a39cf0fbb607d17297a25c54ad560b3c5da4c94838f0cc

Observation df6f2117-8297-4a6c-8d00-aa36262364f2 · outbound

This paper cites Florence-2: Advancing a unified representation for a variety 11 of vision tasks.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Florence-2: Advancing a unified representation for a variety 11 of vision tasks

Reference 83

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:40.177810Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:38.769440Z digest=sha256:7fb813df0c7b5da4cd7c501e402822d4222ef4dabfd10e4c00ea5848d5ea36a4

Observation a9a38e18-66b3-494c-95d4-5496f81f5525 · outbound

This paper cites Imagere- ward: Learning and evaluating human preferences for text- to-image generation.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Imagere- ward: Learning and evaluating human preferences for text- to-image generation

Reference 84

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:40.113535Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:38.773679Z digest=sha256:6ee57573b06e5bbc891e4b5d01ec263ab604176a284239cf3089939ef110966b

Observation f3520083-701d-46da-bfa3-fc2aae3aa855 · outbound

This paper cites Using human feedback to fine-tune diffusion models without any reward model.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Using human feedback to fine-tune diffusion models without any reward model

Reference 85

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:40.098996Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:38.777753Z digest=sha256:ee6650e10b0fe088bc142eabde91c45bf8e37613a3bff916c8c1f21337659a6f

Observation 249e130b-fb6d-4d7a-9c99-f83594cd159c · outbound

This paper cites LION: Latent Point Diffusion Models for 3D Shape Generation.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward LION: Latent Point Diffusion Models for 3D Shape Generation

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.838499Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.838499Z digest=sha256:fe196fdfafcfcb473a743374090e97b5fbad38b7c96d28b56070d5cda235ed7d

Observation 98d14ea4-6a43-473b-b6c7-a6bdf01c18dc · outbound

This paper cites UniFL: Improve Latent Diffusion Model via Unified Feedback Learning.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward UniFL: Improve Latent Diffusion Model via Unified Feedback Learning

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.963875Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.963875Z digest=sha256:71d105750935d395dfd9b1bfb614679e6a0e9cfa4a0e1f5d4f3d6cad49fd690e

Observation 26e3d646-eca1-4992-9bad-a0a625236a02 · outbound

This paper cites BERTScore: Evaluating Text Generation with BERT.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward BERTScore: Evaluating Text Generation with BERT

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-12T14:58:38.969899Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:58:38.969899Z digest=sha256:95605a5c779375ccd057153175bd42b87c04eed610dd20fdc375d9b0cf9a944d

Observation f633b17b-17db-446c-acbf-441bcae44a79 · outbound

This paper cites an unresolved cited work.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Unresolved cited work

Reference 89

Resolution
unresolved
raw_fallback, observed 2026-08-12T14:58:40.026129Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:38.974783Z digest=sha256:0be8a28f89d9f86e3decd0e59f0da48824a1475f927a4e15ff12421f7c3d5cff

Observation fab0be03-741d-4961-a996-eb993af0463f · outbound

This paper cites an unresolved cited work.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Unresolved cited work

Reference 90

Resolution
unresolved
raw_fallback, observed 2026-08-12T14:58:39.959550Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:39.015535Z digest=sha256:014611db2a606c03d13edc3637dd58fa70d0d78b15d713145e8f16ffa221828c

Observation 6aed4586-243c-4a3e-8458-e75abd49783c · outbound

This paper cites Specifically, we use the CLIP-ViT-L/14 from the original CLIP paper and a similar BLIP model fine-tuned for VQA tasks (ViT-L for the vision backbone).

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Specifically, we use the CLIP-ViT-L/14 from the original CLIP paper and a similar BLIP model fine-tuned for VQA tasks (ViT-L for the vision backbone)

Reference 91

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:39.906904Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:39.048475Z digest=sha256:02780db66004bf4c62ccbb025cb7a22984cb3aac27f0a7bf4cea6ec630e5b16e

Observation f866bc04-e632-4dd5-85a4-f3710fb780c6 · outbound

This paper cites Note that, SDXL-Turbo mainly focuses on image generation of 5122 pixels and SDXL-Lightning only supports≥ 2 step generation.

Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward Note that, SDXL-Turbo mainly focuses on image generation of 5122 pixels and SDXL-Lightning only supports≥ 2 step generation

Reference 92

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T14:58:39.799251Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T14:58:39.053842Z digest=sha256:339d9af9c101850907aa92df5121e2b56dd83ab22dcbc4a26128fbabd6d9d394

Pith citing papers

Observation 007c5f7c-0714-4c6f-bc71-fb2220e2149c · inbound

VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL cites this paper.

VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T15:18:52.995998Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:18:52.995998Z digest=sha256:b2c142e7020c06ac9359adb4f2ac2fd4722328f3e54618d652de4c5d99e269f7

Observation f0d7ae0d-6bd3-4e43-b65f-4847ff0c983d · inbound

Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF cites this paper.

Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward

Reference 17

Resolution
verified exact
local_arxiv, observed 2026-07-09T02:25:55.862799Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-07-09T02:17:20.589485Z digest=sha256:aa7bd3b0e8f874ec4e4e061d56ae4c0b9151f756afeb89079f4ae46a8863fb5f