{"as_of":"2026-08-08T04:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e4c3f05cab7824f507e8bff71e9e7b371d9bf70068ac9a7f6ab322581f692352","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:18:56.930347Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T11:23:28.424453Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T11:25:18.912960Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"cited_work":{"arxiv_id":"2505.15791","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15791","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vard: Efficient and dense fine-tuning for diffusion models with value-based rl","venue":null,"work_id":"2450f629-559d-4b1c-ba76-1b898403c088","year":2025},"citing_paper":{"arxiv_id":"2604.15311","last_updated":"2026-05-03T11:22:04Z","snapshot_observed_at":"2026-07-06T23:02:53.677687Z","submitted_at":"2026-04-16T17:59:56Z","title":"LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T11:23:28.424453Z"},"links":{"cited_paper":"/paper/2505.15791","citing_paper":"/paper/2604.15311"},"observation_digest":"sha256:4f19cd47c1d9a09d16150af3bc60c88d360de37a3eb8f95a9b958ba8924d25ac","observation_id":"ba09d5f4-eef9-4d98-8718-36e276d1a124","resolution":{"observed_at":"2026-05-10T11:25:18.915785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15791/citation-record","integrity":"/paper/2505.15791/integrity","json":"/paper/2505.15791/citation-record.json","paper":"/paper/2505.15791"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:59.034753Z","title":"Atom level enzyme active site scaffolding using rfdiffusion2","venue":null,"work_id":"edc48c3f-f941-43d4-8c76-e9d3a5cbadd0","year":2025},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:52.040527Z"},"links":{"citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:2c9f6d801743746729ed6c4df55046e119fb2eb727405816fc4d13f57267ff7a","observation_id":"fa398351-ccc8-4599-a4fd-834ab65439bc","resolution":{"observed_at":"2026-08-07T15:18:59.113875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15489","last_updated":"2024-05-24T12:11:41Z","snapshot_observed_at":"2026-07-06T18:19:17.573250Z","submitted_at":"2024-05-24T12:11:41Z","title":"Out of Many, One: Designing and Scaffolding Proteins at the Scale of the Structural Universe with Genie 2","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15489","snapshot_observed_at":"2026-08-07T15:18:53.460195Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:53.460195Z"},"links":{"cited_paper":"/paper/2405.15489","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:636a6328555d56b72952e2cf832e329c0211018731b06b17b11d8bf1e6c8f357","observation_id":"d2c7f045-5afd-4730-9113-14e3e8151be9","resolution":{"observed_at":"2026-08-07T15:18:53.460195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:58.216130Z","title":"As referenced in the main text, Table 1 includes metrics from the DRaFT [Clark et al., 2023] and PRDP [Deng et al., 2024] papers","venue":null,"work_id":"5551f9bb-560b-41c7-b3f8-f8e9fe758973","year":2023},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:56.835558Z"},"links":{"citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:12bb3b45663e15d505bb8c771bb1ecececc299033a4dad29d0336d78db23bfa6","observation_id":"5cf8b26f-86a2-47e3-979f-ef5b74fc1802","resolution":{"observed_at":"2026-08-07T15:18:58.325029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08933","last_updated":"2023-02-14T06:45:49Z","snapshot_observed_at":"2026-07-06T14:06:34.310083Z","submitted_at":"2022-10-17T10:49:08Z","title":"DiffuSeq: Sequence to Sequence Text Generation with Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08933","snapshot_observed_at":"2026-08-07T15:18:52.512770Z","title":"Diffuseq: Sequence to sequence text generation with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:52.512770Z"},"links":{"cited_paper":"/paper/2210.08933","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:59a43b66c1e5f7d1e72e16858af51a0a86965622047588a0e6b6841081d0532f","observation_id":"74c7321d-08c8-4c1b-aee3-a557fbd4b929","resolution":{"observed_at":"2026-08-07T15:18:52.512770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09281","last_updated":"2019-11-11T14:18:31Z","snapshot_observed_at":"2026-07-06T08:31:00.030545Z","submitted_at":"2019-10-21T12:06:28Z","title":"Dealing with Sparse Rewards in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.09281","snapshot_observed_at":"2026-08-07T15:18:52.713790Z","title":"Dealing with sparse rewards in reinforcement learning.arXiv preprint arXiv:1910.09281,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:52.713790Z"},"links":{"cited_paper":"/paper/1910.09281","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:1c891ff59b947567a1226b6d27d7ec77143bb6edaaf8af8b85b7b3625b9b6faa","observation_id":"3dcc38c7-143c-4d6c-9845-a260871e95c9","resolution":{"observed_at":"2026-08-07T15:18:52.713790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20313","last_updated":"2024-12-11T15:42:13Z","snapshot_observed_at":"2026-08-04T08:56:57.976209Z","submitted_at":"2024-05-30T17:53:50Z","title":"Sequence-Augmented SE(3)-Flow Matching For Conditional Protein Backbone Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20313","snapshot_observed_at":"2026-08-07T15:18:52.921055Z","title":"Sequence-augmented se (3)-flow matching for conditional protein backbone generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:52.921055Z"},"links":{"cited_paper":"/paper/2405.20313","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:481e8e4a443a2c43ebc326e6a1addadde0a39af193fbd2dad74e980fd39ca135","observation_id":"7fb24f74-efbe-459a-ac1b-38278052559d","resolution":{"observed_at":"2026-08-07T15:18:52.921055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-07-06T19:55:42.238611Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15247","snapshot_observed_at":"2026-08-07T15:18:52.995998Z","title":"org/abs/2411.15247","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:52.995998Z"},"links":{"cited_paper":"/paper/2411.15247","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:3f308a9f5d08f864646aa0267a7711d985868cd6ecab701200714c1c346a7dfb","observation_id":"007c5f7c-0714-4c6f-bc71-fb2220e2149c","resolution":{"observed_at":"2026-08-07T15:18:52.995998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-08-07T15:18:53.080608Z","title":"Aligning text-to-image models using human feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:53.080608Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:7d75ed5ec28f014af21c27495cf76137537144e899df8c703898b40d4a3364f8","observation_id":"4c3004c2-7ed9-498e-b5a0-46ebcdb07874","resolution":{"observed_at":"2026-08-07T15:18:53.080608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T15:18:53.255145Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:53.255145Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:a65a168c1efbd878dd53bd5089c3bd76858c30790af620c9b98e92e9321c6ffc","observation_id":"d3fe9064-24ba-441b-ba91-6e7565fbe53c","resolution":{"observed_at":"2026-08-07T15:18:53.255145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08252","last_updated":"2024-10-25T02:50:44Z","snapshot_observed_at":"2026-07-06T19:01:10.268051Z","submitted_at":"2024-08-15T16:47:59Z","title":"Derivative-Free Guidance in Continuous and Discrete Diffusion Models with Soft Value-Based Decoding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08252","snapshot_observed_at":"2026-08-07T15:18:53.356102Z","title":"Derivative-free guidance in continuous and discrete diffusion models with soft value-based decoding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:53.356102Z"},"links":{"cited_paper":"/paper/2408.08252","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:038fe350c4969d887a4e0b5b1618629407efa6ad1b3cca7cc58b41087bced337","observation_id":"778a4dbe-3938-45a6-b3fb-84e31e2ff8b8","resolution":{"observed_at":"2026-08-07T15:18:53.356102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T15:18:53.574219Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:53.574219Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:517607d349abf93b3c3222f06d541a04fe00b842242c341729cc03e336a5cc5c","observation_id":"60b756a9-3543-4b66-b7a4-8eb2db9f1a9d","resolution":{"observed_at":"2026-08-07T15:18:53.574219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-07T15:18:53.950021Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:53.950021Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:c0ce288a95205f69e573accf27fbbf94c1701c9b650153615a14848aa2897b6c","observation_id":"4c18afcc-799a-43ef-be36-8678337ee544","resolution":{"observed_at":"2026-08-07T15:18:53.950021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T15:18:54.458034Z","title":"Ilya Loshchilov and Frank Hutter","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:54.458034Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:90904da769819e3deb8a9a10276dbd920703770d98631a2392b65d7db911ac40","observation_id":"51d5e71b-3704-4152-86e4-ff4274939898","resolution":{"observed_at":"2026-08-07T15:18:54.458034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-07-06T20:34:11.407726Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-07T15:18:54.669121Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:54.669121Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:14b1ecf1f83ecee08a8a8793cdde3a1ecbf7f10d01e5b9804bc2d8da22ee04aa","observation_id":"6a317298-8807-4244-bf64-974ce588f354","resolution":{"observed_at":"2026-08-07T15:18:54.669121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01857","last_updated":"2024-06-05T09:00:36Z","snapshot_observed_at":"2026-07-06T17:39:03.755444Z","submitted_at":"2024-03-04T09:13:14Z","title":"Reward Model Learning vs. Direct Policy Optimization: A Comparative Analysis of Learning from Human Preferences","version":2},"cited_work":{"arxiv_id":"2403.01857","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.01857","snapshot_observed_at":"2026-08-07T15:18:57.412066Z","title":"Reward Model Learning vs. Direct Policy Optimization: A Comparative Analysis of Learning from Human Preferences","venue":"cs.LG","work_id":"2a3b067c-af97-496a-955c-f5d3f267f262","year":2024},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:54.854896Z"},"links":{"cited_paper":"/paper/2403.01857","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:ed2b5f0b917ac4e146872c9484a482129f747983c711b6da98fc315fc6cc5e3a","observation_id":"927be3ae-e2e6-4ebf-9010-bb91d10dafed","resolution":{"observed_at":"2026-08-07T15:18:57.467666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T15:18:54.989604Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:54.989604Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:eaf619fd78e115ba8582d38e187d3704ace5ed525c89cba72fd1e6e3bb080bd4","observation_id":"b9ee0a31-7f21-4c32-99d2-569451a1693a","resolution":{"observed_at":"2026-08-07T15:18:54.989604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14772","last_updated":"2023-05-24T18:17:17Z","snapshot_observed_at":"2026-08-04T22:11:01.572110Z","submitted_at":"2023-04-28T11:33:08Z","title":"Multisample Flow Matching: Straightening Flows with Minibatch Couplings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14772","snapshot_observed_at":"2026-08-07T15:18:55.121823Z","title":"Multisample flow matching: Straightening flows with minibatch couplings","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:55.121823Z"},"links":{"cited_paper":"/paper/2304.14772","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:d3fd644d6d8d1e1ecab1e09538281c7075592de9bff7b3079db8ba5267a9ec10","observation_id":"9bd3559c-88e7-4184-bfb8-9c50e89dee06","resolution":{"observed_at":"2026-08-07T15:18:55.121823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T15:18:55.223435Z","title":"John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, and Oleg Klimov","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:55.223435Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:4683dd74f3d01c11ce277b1c57308a9c0a48f5ec18f54fa47042838d8c2056e5","observation_id":"99439a9f-a924-4e2a-87d4-1a291c60782e","resolution":{"observed_at":"2026-08-07T15:18:55.223435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-07T15:18:55.607841Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:55.607841Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:b778a01693e52985f7ec20b403f5e5c278eac2a93b40f6ab64e333ddfabcee76","observation_id":"b04cb345-3e1d-490c-a74b-3109af4dde62","resolution":{"observed_at":"2026-08-07T15:18:55.607841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18567","last_updated":"2024-10-16T16:26:16Z","snapshot_observed_at":"2026-08-05T08:03:00.174587Z","submitted_at":"2024-02-28T18:57:56Z","title":"Diffusion Language Models Are Versatile Protein Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18567","snapshot_observed_at":"2026-08-07T15:18:55.707487Z","title":"Diffusion language models are versatile protein learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:55.707487Z"},"links":{"cited_paper":"/paper/2402.18567","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:60569abd8ec189c1ac261664a614de34c2ebaf84bf8510bcda9c745ded3cb361","observation_id":"4bce29fa-00c9-40b7-b738-d00b81ff2a79","resolution":{"observed_at":"2026-08-07T15:18:55.707487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06481","last_updated":"2025-01-11T08:16:30Z","snapshot_observed_at":"2026-08-03T16:21:17.110013Z","submitted_at":"2025-01-11T08:16:30Z","title":"Focus-N-Fix: Region-Aware Fine-Tuning for Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06481","snapshot_observed_at":"2026-08-07T15:18:55.773131Z","title":"Focus-n-fix: Region-aware fine-tuning for text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:55.773131Z"},"links":{"cited_paper":"/paper/2501.06481","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:3bbf89fd913db64a6549deae02253120e5db14fa35e2f755d130bd824b7514d0","observation_id":"1fcef7d8-965e-4abc-b44a-e5aa6c130d7f","resolution":{"observed_at":"2026-08-07T15:18:55.773131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21059","last_updated":"2026-01-05T02:39:01Z","snapshot_observed_at":"2026-08-03T02:30:08.318253Z","submitted_at":"2024-12-30T16:24:09Z","title":"VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21059","snapshot_observed_at":"2026-08-07T15:18:55.855992Z","title":"Visionreward: Fine-grained multi-dimensional human preference learning for image and video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:55.855992Z"},"links":{"cited_paper":"/paper/2412.21059","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:cd147fef63551437c8cf880132370691518e677801d919366dbbdea55d30371e","observation_id":"0aa61977-60da-48fe-9f63-653bd8dbc57c","resolution":{"observed_at":"2026-08-07T15:18:55.855992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.02277","last_updated":"2023-05-22T20:51:32Z","snapshot_observed_at":"2026-07-06T14:48:25.973457Z","submitted_at":"2023-02-05T01:47:02Z","title":"SE(3) diffusion model with application to protein backbone generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.02277","snapshot_observed_at":"2026-08-07T15:18:56.049830Z","title":"Se (3) diffusion model with application to protein backbone generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:56.049830Z"},"links":{"cited_paper":"/paper/2302.02277","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:ae682e8f3b75d8e09a6edea119629b35577083e546521da5bf6876e031db469d","observation_id":"e1e16925-1af0-4627-bc8c-5cfc916a002e","resolution":{"observed_at":"2026-08-07T15:18:56.049830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07132","last_updated":"2023-04-14T13:51:26Z","snapshot_observed_at":"2026-07-06T15:15:46.356210Z","submitted_at":"2023-04-14T13:51:26Z","title":"Towards Controllable Diffusion Models via Reward-Guided Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07132","snapshot_observed_at":"2026-08-07T15:18:56.162933Z","title":"Towards controllable diffusion models via reward-guided exploration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:56.162933Z"},"links":{"cited_paper":"/paper/2304.07132","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:de48bd1e6fd5f1495b02d9d16d7fc2fca4dbe5c27c80bef9df869843bedba4e8","observation_id":"4316b84d-e748-4dfb-876f-d098d52ab0f4","resolution":{"observed_at":"2026-08-07T15:18:56.162933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:56.295167Z","title":"Large-scale reinforcement learning for diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:56.295167Z"},"links":{"citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:37a55f72dd33951b572ad389a8f035e162ac0c6ceaf7b987c84701ce57948cdc","observation_id":"0740abd3-2e50-41dd-81ff-a55d42b6508d","resolution":{"observed_at":"2026-08-07T15:18:56.295167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11312","last_updated":"2023-02-22T11:49:12Z","snapshot_observed_at":"2026-08-04T08:55:37.127470Z","submitted_at":"2023-02-22T11:49:12Z","title":"Behavior Proximal Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11312","snapshot_observed_at":"2026-08-07T15:18:56.424024Z","title":"Behavior proximal policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:56.424024Z"},"links":{"cited_paper":"/paper/2302.11312","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:68de992859ba2454c2992487d971f0ee36e7b93723b256fc029c59c543296c1f","observation_id":"5068b278-5f7a-45ef-94e6-75e76d93dd16","resolution":{"observed_at":"2026-08-07T15:18:56.424024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:58.824931Z","title":null,"venue":null,"work_id":"7c09a603-31d2-4f16-ab92-a54c34fe81b5","year":2021},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:56.551973Z"},"links":{"citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:4560e5991e007e4506e1b474661aadb32d1028d11f916142ce4486d84fa584b0","observation_id":"ecf48c83-7fc8-4538-8f51-18b38d8930e7","resolution":{"observed_at":"2026-08-07T15:18:58.916493Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:58.642598Z","title":"Given these components, the flow matching objective for SO(3) can be formulated as: LSO(3)(θ) = Et∼U (0,1),q(R0,R1),Rt∼ρt(Rt|R0,R1) ∥vθ(t, Rt) − ut(Rt|R0, R1)∥2 SO(3)","venue":null,"work_id":"54a11f12-1547-4ea3-80e3-e5feef162722","year":2023},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:56.676501Z"},"links":{"citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:68e43f16ceb7aa5c79aa8b91f01eb31342dd97ca2c6f0e85e67427f92cc5edf6","observation_id":"0a16a69d-6f85-4532-9735-27775c67e570","resolution":{"observed_at":"2026-08-07T15:18:58.731174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:58.431994Z","title":null,"venue":null,"work_id":"24d5b598-2a66-44ab-b95e-da8c777345c4","year":2023},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:56.765412Z"},"links":{"citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:ef5fa34785e61408e884d9145f4f52f15451c54f4cc51735a687db1fc8ddd994","observation_id":"c4c3a304-8b95-48f8-aed2-2517f9ea6ec9","resolution":{"observed_at":"2026-08-07T15:18:58.520325Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:57.970470Z","title":"Color intensity correlates with η magnitude (darker corresponds to higher values)","venue":null,"work_id":"6e860070-8d64-4d7a-98ce-9ff25407b690","year":1956},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:56.930347Z"},"links":{"citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:0643eceb9472e7ad0e67154b3c41d81495ab8b34dbcbd5fb8bff41230cf64bf0","observation_id":"2c4718b8-dab6-4b0d-8d7b-384c6c591733","resolution":{"observed_at":"2026-08-07T15:18:58.060287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15194","last_updated":"2024-02-28T09:21:46Z","snapshot_observed_at":"2026-07-06T17:34:28.430476Z","submitted_at":"2024-02-23T08:54:42Z","title":"Fine-Tuning of Continuous-Time Diffusion Models as Entropy-Regularized Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15194","snapshot_observed_at":"2026-08-07T15:18:55.480756Z","title":"Fine-tuning of continuous-time diffusion models as entropy-regularized control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:55.480756Z"},"links":{"cited_paper":"/paper/2402.15194","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:0e5940055efc83dd6afb1292d8fc7026a4606ff70f65ce11553ab6c0bd098ba0","observation_id":"638dc0d6-b238-4d53-9b57-91a7984e2bad","resolution":{"observed_at":"2026-08-07T15:18:55.480756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T15:18:55.353442Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:55.353442Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:b1f1cc23b26f65e631296ccddf8592b8e6d00e02dff73db2ffe21c27222c4747","observation_id":"abeef27b-e5a6-4091-b5d6-461eee88ee95","resolution":{"observed_at":"2026-08-07T15:18:55.353442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-07T15:18:54.567472Z","title":"Improve mathematical reasoning in language models by automated process supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:54.567472Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:73a90321d9dc751af2a9290a06dbd32ed07de47d2c577ba718b189ebbca742b6","observation_id":"76dcb53b-f88c-45c0-953d-50265d3b067d","resolution":{"observed_at":"2026-08-07T15:18:54.567472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06000","last_updated":"2024-12-08T17:19:48Z","snapshot_observed_at":"2026-07-06T20:03:29.510169Z","submitted_at":"2024-12-08T17:19:48Z","title":"Does RLHF Scale? Exploring the Impacts From Data, Model, and Method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06000","snapshot_observed_at":"2026-08-07T15:18:52.823260Z","title":"Does rlhf scale? exploring the impacts from data, model, and method","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:52.823260Z"},"links":{"cited_paper":"/paper/2412.06000","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:bce2acf64d585ad5ad98f48ce3d9dd27aff5ba6a13095ca26e973f9fb8da62fd","observation_id":"dc7ce98c-5562-40c5-9f55-55aaeec638a8","resolution":{"observed_at":"2026-08-07T15:18:52.823260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:18:52.576998Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:52.576998Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:5e261ddcd6a7e23bdbe57e53f9150a629f7e74b3ba13f2dbe8fa173c372befe5","observation_id":"a25b8486-174e-4f1d-8625-e5328860af49","resolution":{"observed_at":"2026-08-07T15:18:52.576998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02391","last_updated":"2024-04-11T16:29:12Z","snapshot_observed_at":"2026-07-06T16:27:22.878185Z","submitted_at":"2023-10-03T19:24:24Z","title":"SE(3)-Stochastic Flow Matching for Protein Backbone Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02391","snapshot_observed_at":"2026-08-07T15:18:52.310087Z","title":"Se (3)-stochastic flow matching for protein backbone generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:52.310087Z"},"links":{"cited_paper":"/paper/2310.02391","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:a364eac317bfcc6b7d67fcbd1665e87d26cadf793af6e65d19192902af3478c7","observation_id":"e4f6683b-e3f5-4300-b6ec-303fcbf2bcc3","resolution":{"observed_at":"2026-08-07T15:18:52.310087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08861","last_updated":"2025-01-07T18:12:27Z","snapshot_observed_at":"2026-08-07T18:29:43.318422Z","submitted_at":"2024-09-13T14:22:14Z","title":"Adjoint Matching: Fine-tuning Flow and Diffusion Generative Models with Memoryless Stochastic Optimal Control","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08861","snapshot_observed_at":"2026-08-07T15:18:52.419212Z","title":"Adjoint matching: Fine-tuning flow and diffusion generative models with memoryless stochastic optimal control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:52.419212Z"},"links":{"cited_paper":"/paper/2409.08861","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:d384070fd1e9eaa5fcf16d0db0e9e649080db4fb4825d73f33eb36728153a4da","observation_id":"78702dee-54bf-4302-adf0-977392a625cb","resolution":{"observed_at":"2026-08-07T15:18:52.419212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-01T15:43:51.739518Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-07T15:18:52.161793Z","title":"Training diffusion models with reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:52.161793Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:1b69effd31552422ef7d1d033121d9979f79929c41acda13f2aee401bd37bfdc","observation_id":"a473a493-0b83-4763-8618-ad6be55cebf8","resolution":{"observed_at":"2026-08-07T15:18:52.161793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T04:54:33.756332Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 1 inbound Pith citation observation for arXiv:2505.15791."}