{"as_of":"2026-08-07T21:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:410c5f053ed178495bde1cc9a67683592dd24220d5f380ae1815a54fa2f90a91","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T02:17:20.589485Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.07693/citation-record","integrity":"/paper/2607.07693/integrity","json":"/paper/2607.07693/citation-record.json","paper":"/paper/2607.07693"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1707.01495","last_updated":"2018-02-23T10:04:20Z","snapshot_observed_at":"2026-08-05T02:06:43.683268Z","submitted_at":"2017-07-05T17:55:53Z","title":"Hindsight Experience Replay","version":3},"cited_work":{"arxiv_id":"1707.01495","doi":null,"metadata_source":"pith","pith_arxiv_id":"1707.01495","snapshot_observed_at":"2026-07-09T02:25:55.908762Z","title":"Hindsight Experience Replay","venue":"cs.LG","work_id":"a7ba78be-3bef-4f48-b954-7a5dfbc0d5b6","year":2017},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/1707.01495","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:563cdf73f68607551694012fded27e92f0f23e3d10d27ae8b7a3596c181042ab","observation_id":"1fe76140-f202-44d1-b07d-16bf1467641a","resolution":{"observed_at":"2026-07-09T02:25:55.909974Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:25:56.025559Z","title":"133011, 3, 7, 8, 12","venue":null,"work_id":"afd299e8-200d-44af-9d9f-4ba2de87a34d","year":2024},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:a1ba5ae9c0b954cedb1805d99b0086faa207c4343acfc19149dcf854c2229d6d","observation_id":"e304a2af-3e64-4c16-9c44-bb570395a8ca","resolution":{"observed_at":"2026-07-09T02:25:56.026565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15176","last_updated":"2025-04-21T15:35:48Z","snapshot_observed_at":"2026-08-07T16:00:33.150121Z","submitted_at":"2025-04-21T15:35:48Z","title":"DSPO: Direct Semantic Preference Optimization for Real-World Image Super-Resolution","version":1},"cited_work":{"arxiv_id":"2504.15176","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.15176","snapshot_observed_at":"2026-07-09T02:25:55.843755Z","title":"Dspo: Direct semantic pref- erence optimization for real-world image super-resolution","venue":"cs.CV","work_id":"aeb6b8ad-959d-4007-9d58-769e7fe56fdc","year":2025},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2504.15176","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:cf2e4ded77cc6545c975428bcd1db0ed877dc13ea512a8f2640de3ce2d7e4a0b","observation_id":"ad5a402c-9aaa-462e-bb2b-1a204b96b0e6","resolution":{"observed_at":"2026-07-09T02:25:55.845525Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02743","last_updated":"2025-02-14T23:02:03Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:55:13Z","title":"MA-RLHF: Reinforcement Learning from Human Feedback with Macro Actions","version":2},"cited_work":{"arxiv_id":"2410.02743","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02743","snapshot_observed_at":"2026-07-09T02:25:55.874788Z","title":"Ma-rlhf: Rein- forcement learning from human feedback with macro actions","venue":"cs.CL","work_id":"540f12d3-dda0-468d-8fd7-cdc6045a72d7","year":2024},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2410.02743","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:51bad89188c82dccbd293ac76145ea0566be7853c9cde6fb3ca550f9530c3e42","observation_id":"faf7892d-89e3-4a22-8b06-16ddceeab3c7","resolution":{"observed_at":"2026-07-09T02:25:55.876895Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:25:56.015450Z","title":"In: Proceedings of Robotics: Science and Systems (RSS) (2023) 2","venue":null,"work_id":"47a5a165-f393-4931-a1a3-3b5c8e072128","year":2023},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:f933afb36176c5c5cc09cc6524af53d22ab74b2a78148cb4f8fa3d9503f9972f","observation_id":"2fc94259-9502-4c79-8de2-e8f5b0dec446","resolution":{"observed_at":"2026-07-09T02:25:56.016587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03741","last_updated":"2023-02-17T17:00:34Z","snapshot_observed_at":"2026-08-03T14:31:51.401500Z","submitted_at":"2017-06-12T17:23:59Z","title":"Deep reinforcement learning from human preferences","version":4},"cited_work":{"arxiv_id":"1706.03741","doi":"10.48550/arxiv.1706.03741","metadata_source":"pith","pith_arxiv_id":"1706.03741","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep reinforcement learning from human preferences","venue":"stat.ML","work_id":"95b596b9-4880-42ad-ac79-570a3a8a9dee","year":2017},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/1706.03741","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:33d944debcc60fc03a8d924ba3f7818a6636c151e34a59c6013693d050149f34","observation_id":"20f0dcde-2523-43e2-83b4-599e538aedfd","resolution":{"observed_at":"2026-07-09T02:25:55.932859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17400","last_updated":"2024-06-21T16:45:11Z","snapshot_observed_at":"2026-08-06T10:08:54.816113Z","submitted_at":"2023-09-29T17:01:02Z","title":"Directly Fine-Tuning Diffusion Models on Differentiable Rewards","version":2},"cited_work":{"arxiv_id":"2309.17400","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17400","snapshot_observed_at":"2026-07-09T02:25:55.929003Z","title":"Directly Fine-Tuning Diffusion Models on Differentiable Rewards","venue":"cs.CV","work_id":"cd2b3c6d-1ce2-434e-b114-5567026b9b82","year":2023},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2309.17400","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:9cff576734d438535c07786f34cfb8280c4dd688ce426bfcfb902b3f61daecf0","observation_id":"1c41d852-001c-4642-8b42-97bc12a136e5","resolution":{"observed_at":"2026-07-09T02:25:55.930343Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16381","last_updated":"2023-11-01T04:48:26Z","snapshot_observed_at":"2026-07-06T15:33:34.832607Z","submitted_at":"2023-05-25T17:35:38Z","title":"DPOK: Reinforcement Learning for Fine-tuning Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":"2305.16381","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16381","snapshot_observed_at":"2026-07-09T02:25:55.946039Z","title":"DPOK: Reinforcement Learning for Fine- tuning Text-to-Image Diffusion Models, November 2023","venue":"cs.LG","work_id":"1d38a8c4-8e69-46d9-8bb5-65113d5cb501","year":2023},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2305.16381","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:4f1ad0dd9b33b05f1a2bc27ade88848a5d3d8f383b99130274eba1309ceec106","observation_id":"ec6b81b7-a673-4974-8039-af0e933faa18","resolution":{"observed_at":"2026-07-09T02:25:55.947272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":"1801.01290","doi":"10.48550/arxiv.1801.01290","metadata_source":"pith","pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","venue":"cs.LG","work_id":"6674e5db-4e1c-49c0-b598-c108a0ecadb6","year":2018},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:f8c841c83af1b38011a185b8f3dced76d4b804159a2ff72b85db6c76def9c407","observation_id":"325b6d17-b4e2-4aa9-89b5-3c411dbdab38","resolution":{"observed_at":"2026-07-09T02:25:55.912565Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04324","last_updated":"2025-10-15T06:35:29Z","snapshot_observed_at":"2026-07-06T22:08:40.965707Z","submitted_at":"2025-08-06T11:10:39Z","title":"TempFlow-GRPO: When Timing Matters for GRPO in Flow Models","version":4},"cited_work":{"arxiv_id":"2508.04324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.04324","snapshot_observed_at":"2026-07-09T03:05:55.312048Z","title":"TempFlow-GRPO: When Timing Matters for GRPO in Flow Models","venue":"cs.CV","work_id":"fecc731c-f8a2-4f00-ab1b-51b87a133726","year":2025},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2508.04324","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:faa9d3a5f21fba95269a3b616ab74034d71b2dfadbcc39cc97ffa14f9c3a4e9a","observation_id":"4bd34cc9-7b99-4330-b53a-b71af152eced","resolution":{"observed_at":"2026-07-09T02:25:55.870955Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":"2104.08718","doi":"10.48550/arxiv.2104.08718","metadata_source":"pith","pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","venue":"cs.CV","work_id":"2dd7e0b7-c69c-4976-a406-12d4f5b18d14","year":2021},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:7e81eea1c118cc4485e55ea1fa123f1f91c132291c8446a5c4ac5baa91d5165f","observation_id":"d3bf136e-8151-4f30-b16e-adef5d24e515","resolution":{"observed_at":"2026-07-09T02:25:55.831004Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-07-06T09:30:47.469703Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":"2006.11239","doi":"10.48550/arxiv.2006.11239","metadata_source":"pith","pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Probabilistic Models","venue":"cs.LG","work_id":"dc023f4e-7c79-471c-b713-deeb559ba010","year":2020},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:c24f50f1a109f02bee2dd2f810103c408a9d4d8169d0c12ac2dc00905b808887","observation_id":"c31117ed-4527-44e5-95a5-b99a77ec8b08","resolution":{"observed_at":"2026-07-09T02:25:55.937670Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:06.511104+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:06.511104+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2106.09685","doi":"10.4088/pcc.v03n0609","metadata_source":"pith","pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":"cs.CL","work_id":"0426219a-789e-4964-adc8-a04538510818","year":2021},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:09ad133ce7706e7fb50e5af7c264cf3f8e4d3a62a3cf542a44d9f5ba9d802528","observation_id":"f375009b-90de-4073-8196-d8853fcb7f82","resolution":{"observed_at":"2026-07-09T02:25:55.865485Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11240","last_updated":"2025-03-27T02:34:59Z","snapshot_observed_at":"2026-08-07T17:04:30.550213Z","submitted_at":"2025-03-14T09:45:19Z","title":"Towards Better Alignment: Training Diffusion Models with Reinforcement Learning Against Sparse Rewards","version":2},"cited_work":{"arxiv_id":"2503.11240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.11240","snapshot_observed_at":"2026-07-09T02:25:55.901105Z","title":"Towards better alignment: Training diffusion models with reinforcement learning against sparse rewards.arXiv preprint arXiv:2503.11240, 2025a","venue":"cs.CV","work_id":"fb1f30d6-d9b9-45c4-a3f2-f98a969de9ae","year":2025},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2503.11240","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:b4794ad05dde67bf3e8f2e7e12d362bbbd2ac3479918fa009ca1c4c95c7fe52e","observation_id":"9fd710a6-780b-4245-bb15-a54709896175","resolution":{"observed_at":"2026-07-09T02:25:55.902473Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03177","last_updated":"2025-06-27T14:24:28Z","snapshot_observed_at":"2026-08-03T11:51:31.460893Z","submitted_at":"2024-12-04T09:59:43Z","title":"PatchDPO: Patch-level DPO for Finetuning-free Personalized Image Generation","version":2},"cited_work":{"arxiv_id":"2412.03177","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03177","snapshot_observed_at":"2026-07-09T02:25:55.838115Z","title":"Patchdpo: Patch-level dpo for finetuning- free personalized image generation.arXiv preprint arXiv:2412.03177","venue":"cs.CV","work_id":"682e7fc7-94f2-4f15-aadc-12712e612a08","year":2024},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2412.03177","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:7c7b1b6bd418ef0a608ec438ac198130017802dc2923b1d947a2b11a65090e13","observation_id":"4c63c6ed-0eac-4cfe-9f67-2f0f138a3667","resolution":{"observed_at":"2026-07-09T02:25:55.839812Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06079","last_updated":"2025-05-09T14:22:43Z","snapshot_observed_at":"2026-08-07T15:48:26.404805Z","submitted_at":"2025-05-09T14:22:43Z","title":"TREND: Tri-teaching for Robust Preference-based Reinforcement Learning with Demonstrations","version":1},"cited_work":{"arxiv_id":"2505.06079","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.06079","snapshot_observed_at":"2026-07-09T02:25:55.886294Z","title":"TREND: Tri-teaching for Robust Preference-based Reinforcement Learning with Demonstrations","venue":"cs.RO","work_id":"e1fe29fd-fb9b-4d0a-8ca4-07e3e88a567b","year":2025},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2505.06079","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:3a88065ce195de30222e81d5a07770451a26d45e780de87ad4ef2adda3d328fa","observation_id":"1ce6d9bd-f0e1-424a-8712-342fe507c107","resolution":{"observed_at":"2026-07-09T02:25:55.887521Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-07-06T19:55:42.238611Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"cited_work":{"arxiv_id":"2411.15247","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.15247","snapshot_observed_at":"2026-07-09T02:25:55.861273Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","venue":"cs.LG","work_id":"c44c00d6-65dc-4294-a21c-101049ad6ae8","year":2024},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2411.15247","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:f8ba45940fab49e1fc40a072fc3d501608f9bf87ad568ba033b74c3c7931bbf3","observation_id":"f0d7ae0d-6bd3-4e43-b65f-4847ff0c983d","resolution":{"observed_at":"2026-07-09T02:25:55.862799Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.06040","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:25:55.893505Z","title":"Branchgrpo: Stable and efficient grpo with structured branching in diffusion models","venue":null,"work_id":"4b5ca02b-b12f-4ca1-88b1-99007b8f9528","year":2025},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:ad26d36e982b4a0f8b64b7e1539e1445395055cf3be4a19284b7c23ad2257702","observation_id":"c1b1dd6e-26fd-4bf5-aedf-6fd2ee8daacf","resolution":{"observed_at":"2026-07-09T02:25:55.895022Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:25:56.027098Z","title":null,"venue":null,"work_id":"134e390d-82f7-4c82-a9ba-9c2072a734bc","year":2021},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:915006f9ff0c7fb10d8b876e196b1ef9e2ac845205c09d28fe14de6367a120cf","observation_id":"95e0288b-a9ed-4d78-9dfc-95742979b630","resolution":{"observed_at":"2026-07-09T02:25:56.028280Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":"1509.02971","doi":"10.1137/22m1480409","metadata_source":"pith","pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Continuous control with deep reinforcement learning","venue":"cs.LG","work_id":"41a65444-c819-4303-a1f1-b075aa86d40c","year":2015},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:adb43f7c07754c01545e362c646758051d213dd9b2bc44708b7e3e92dde9ee68","observation_id":"527924e1-c108-4dd9-a2b5-9f871f963f3b","resolution":{"observed_at":"2026-07-09T02:25:55.935385Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05470","last_updated":"2025-10-27T09:57:02Z","snapshot_observed_at":"2026-08-06T11:11:00.378627Z","submitted_at":"2025-05-08T17:58:45Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","version":5},"cited_work":{"arxiv_id":"2505.05470","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.05470","snapshot_observed_at":"2026-07-09T02:25:55.898592Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","venue":"cs.CV","work_id":"bf1e8e81-ff31-401a-a5dc-d9c49df168ab","year":2025},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2505.05470","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:6ff98b845154849209ea8e8412a591a298935642a501e00162bc34dd52fcac59","observation_id":"372b9069-a4e0-49ee-8396-2bfb6cae3fe0","resolution":{"observed_at":"2026-07-09T02:25:55.899907Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06614","last_updated":"2023-10-27T01:02:22Z","snapshot_observed_at":"2026-08-06T23:42:26.791764Z","submitted_at":"2023-03-12T09:10:45Z","title":"Synthetic Experience Replay","version":4},"cited_work":{"arxiv_id":"2303.06614","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.06614","snapshot_observed_at":"2026-07-09T02:25:55.941433Z","title":"Synthetic Experience Replay","venue":"cs.LG","work_id":"0e4b7acf-c5a3-4de3-af30-d3e418c5fb47","year":2023},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2303.06614","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:64ccdf8461f15a072fc5bb14e4127cd6899ee0369803b2924dac8b052f6bf4a0","observation_id":"35f1aebb-ca82-444f-8f49-795842f1c964","resolution":{"observed_at":"2026-07-09T02:25:55.942485Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01955","last_updated":"2025-06-02T17:59:56Z","snapshot_observed_at":"2026-08-07T11:28:16.316391Z","submitted_at":"2025-06-02T17:59:56Z","title":"Dual-Process Image Generation","version":1},"cited_work":{"arxiv_id":"2506.01955","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01955","snapshot_observed_at":"2026-07-09T02:25:55.903637Z","title":"arXiv preprint arXiv:2506.01955 , year=","venue":"cs.CV","work_id":"2aa0cc3e-3927-43b6-baa3-2fb415997519","year":2025},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2506.01955","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:d00b1dda64e26ceb06e7515a7c65aee033e44fe38a1dc6bca37c625cc7de4374","observation_id":"82a6cc54-75ae-400f-aa8f-12b51ae1a4d5","resolution":{"observed_at":"2026-07-09T02:25:55.904789Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1312.56022","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:25:55.841045Z","title":null,"venue":null,"work_id":"cd981f84-9cbf-4320-8c20-3df5cd2c30fc","year":2013},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:7f2079ad91924df3db825ac03d8c2e10d73ca6929f365cad082bfedd5d625d21","observation_id":"db1ce687-aace-4e05-8e87-077bb8278092","resolution":{"observed_at":"2026-07-09T02:25:55.842469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17921","last_updated":"2024-09-24T17:59:50Z","snapshot_observed_at":"2026-07-31T08:36:12.896702Z","submitted_at":"2023-11-29T18:59:59Z","title":"Do text-free diffusion models learn discriminative visual representations?","version":3},"cited_work":{"arxiv_id":"2311.17921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.17921","snapshot_observed_at":"2026-07-09T02:25:55.913742Z","title":"Do text-free diffusion models learn discriminative visual representations?","venue":"cs.CV","work_id":"88ce5812-ca88-45b9-ac39-4c46a2f2d035","year":2023},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2311.17921","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:fee2384ac53938dc99c5cf9b28ca817bed1170e8b1bb8a508f310f18dcbca0f1","observation_id":"c9c3d08e-3131-45c3-820c-7cceeb301579","resolution":{"observed_at":"2026-07-09T02:25:55.914949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:0c8bceccf90c5666d0f994e5d2ede1f54716f17f24c871561d93c811f92899de","observation_id":"c79984dd-eab4-4ca8-8b7e-107df3a0cbd1","resolution":{"observed_at":"2026-07-09T02:25:55.857250Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":"2203.02155","doi":"10.1007/s00354-022-00198-8","metadata_source":"pith","pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training language models to follow instructions with human feedback","venue":"cs.CL","work_id":"52aff42f-4fa9-4fcf-bdb3-1459b9bebf65","year":2022},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:7e65017dd4e337617d2028d9e7a16a55bb5ef2df08caa0eae244056dd4afe076","observation_id":"7c6223df-d4d5-4464-85ea-da6e1faa76cd","resolution":{"observed_at":"2026-07-09T02:25:55.940191Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3496.127359","doi":"10.1145/1273496.1273590","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning by reward-weighted regression for operational space control","venue":null,"work_id":"f0261e59-e0ca-4feb-bb84-463ef8261919","year":2007},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:18b9e2f0e6c9b347e6f9162a6465393ab57f3040e4f9a98870a10e25facec200","observation_id":"f0b870ad-7af4-42ae-b76e-37848e72aaf4","resolution":{"observed_at":"2026-07-09T02:25:55.802879Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-17T00:20:41.250113+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T00:20:41.250113+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.14094","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T19:57:34.156285Z","title":"Hard examples are all you need: Maximizing grpo post-training under annotation budgets","venue":null,"work_id":"93a1e3bf-eaca-49cf-95a6-3a1811f39e7f","year":2025},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:5e52ae76a620563c35e19559ee736893ef6c8f1e9e1f87ff1447f81aca3fd309","observation_id":"6a2bf9f6-84dc-4e57-9ede-0145bc00a5dc","resolution":{"observed_at":"2026-07-09T02:25:55.907595Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08737","last_updated":"2024-07-11T17:59:45Z","snapshot_observed_at":"2026-07-06T18:45:01.801741Z","submitted_at":"2024-07-11T17:59:45Z","title":"Video Diffusion Alignment via Reward Gradients","version":1},"cited_work":{"arxiv_id":"2407.08737","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.08737","snapshot_observed_at":"2026-07-09T02:25:55.920956Z","title":"Video diffusion alignment via reward gradients","venue":"cs.CV","work_id":"04c1f131-6850-482c-af3e-1e6310b65297","year":2024},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2407.08737","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:bc1c143199d96bfc86a45038fd3efbc65e39cc6c48f14dd44558077f568ab50c","observation_id":"2f03f31d-7a68-4176-a776-c54ed1bf771c","resolution":{"observed_at":"2026-07-09T02:25:55.922322Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":"2305.18290","doi":"10.48550/arxiv.2305.18290","metadata_source":"pith","pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","venue":"cs.LG","work_id":"62105b61-411f-46e5-970a-bd322c6adbbc","year":2023},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:c5056c3bffead73cca7622d962dd60a2b135643f69737cf73c9b0fe2b9c0318c","observation_id":"eac7afe5-338e-4119-b7d7-9c0af4a5c505","resolution":{"observed_at":"2026-07-09T02:25:55.882647Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T21:08:26.462363+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.462363+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.462363+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:25:56.023925Z","title":null,"venue":null,"work_id":"17e3c5b7-f5ac-49a8-a382-4a7b0f7eb08e","year":2024},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:8ce25daa7c16ea36bba4cc34858fce41609ccf1307a0c566d63e526586202baf","observation_id":"dc409362-ad24-4ba8-be55-e43b05569ebd","resolution":{"observed_at":"2026-07-09T02:25:56.024965Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:25:56.022122Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pat- tern Recognition (CVPR) (2022) 7","venue":null,"work_id":"f9c18f61-2c6c-4c6d-ab89-346aa544939e","year":2022},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:42a31fe49b2e262fb761452801739f9c1e5e132bb63b0836b833c3492b0268ab","observation_id":"bc044944-4a3d-43b5-a8ea-32f03a7eb92a","resolution":{"observed_at":"2026-07-09T02:25:56.023336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-07-06T04:37:00.543211Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":"1511.05952","doi":"10.48550/arxiv.1511.05952","metadata_source":"pith","pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prioritized Experience Replay","venue":"cs.LG","work_id":"927187c1-c50e-4ca7-b0fa-55589957731f","year":2015},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:929030a6aa395701a02906f222fc398c34ec321f91d7cc233dee4e9d9fb7e038","observation_id":"07e2a8de-2d17-4a3e-a807-cd8bff3b5774","resolution":{"observed_at":"2026-07-09T02:25:55.880064Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:25:56.020552Z","title":null,"venue":null,"work_id":"f51ad3d1-a35f-4df9-8f5b-b7748dec58a0","year":2022},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:3d8297099dac96b1a8dcac7cb729fa2e241f2bd920ead50d4df2b76adcb34c4e","observation_id":"9147be8d-01af-4b19-ae1d-93fede2baa8f","resolution":{"observed_at":"2026-07-09T02:25:56.021586Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-07-06T04:09:39.172428Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":"1502.05477","doi":"10.48550/arxiv.1502.05477","metadata_source":"pith","pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Trust Region Policy Optimization","venue":"cs.LG","work_id":"8660ac94-3f8e-474f-967f-98304c415ed7","year":2015},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:1ccc0c87c73b04fed52f8c9f56e9fe2cb0fa758ae42cf8fd49f128a3cb957aa1","observation_id":"2b0dea72-f54f-49a0-9830-0a0fdc3f8114","resolution":{"observed_at":"2026-07-09T02:25:55.927244Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:2060ea4367c07054801a152aa810bc33e90b28d7074ce38206ee179e294b7f65","observation_id":"d64aa1d4-622c-4a35-a9b3-e0c503653fdc","resolution":{"observed_at":"2026-07-09T02:25:55.836731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:8f3b4b3f20544b3b7fba6d7c233920a28d24145b6a923d9d79921ede989f7ac0","observation_id":"48fe61e6-bdc9-4fd8-892c-99ccbf491efe","resolution":{"observed_at":"2026-07-09T02:25:55.854539Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04259","last_updated":"2025-09-04T14:38:08Z","snapshot_observed_at":"2026-08-07T12:32:15.780660Z","submitted_at":"2025-09-04T14:38:08Z","title":"RL's Razor: Why Online Reinforcement Learning Forgets Less","version":1},"cited_work":{"arxiv_id":"2509.04259","doi":"10.48550/arxiv.2509.04259","metadata_source":"pith","pith_arxiv_id":"2509.04259","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RL's Razor: Why Online Reinforcement Learning Forgets Less","venue":"cs.LG","work_id":"0bbcff83-fc2f-439d-a988-e38a72205dd5","year":2025},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2509.04259","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:64c6813c2264ad77682857519573073fb6f697905f288818fbc1f00edeb1b7be","observation_id":"32a72b49-ff3e-48c1-b5b7-a46db07da39d","resolution":{"observed_at":"2026-07-09T02:25:55.889858Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.03540","last_updated":"2016-04-12T19:44:13Z","snapshot_observed_at":"2026-08-04T14:18:13.162404Z","submitted_at":"2016-04-12T19:44:13Z","title":"Training Region-based Object Detectors with Online Hard Example Mining","version":1},"cited_work":{"arxiv_id":"1604.03540","doi":null,"metadata_source":"pith","pith_arxiv_id":"1604.03540","snapshot_observed_at":"2026-07-09T02:25:55.846849Z","title":"Training Region-based Object Detectors with Online Hard Example Mining","venue":"cs.CV","work_id":"f458eab3-7525-42ed-abff-b7e498f265f9","year":2016},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/1604.03540","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:503e85dc57c4d904a0b84aa0a955e61d4467dfee9ebd436c6c57ccfa432b79a5","observation_id":"a55cffbf-3e07-48f3-be56-bef4b0ec943e","resolution":{"observed_at":"2026-07-09T02:25:55.848620Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.03585","last_updated":"2015-11-18T21:50:51Z","snapshot_observed_at":"2026-07-06T04:11:47.439779Z","submitted_at":"2015-03-12T04:51:37Z","title":"Deep Unsupervised Learning using Nonequilibrium Thermodynamics","version":8},"cited_work":{"arxiv_id":"1503.03585","doi":"10.48550/arxiv.1503.03585","metadata_source":"pith","pith_arxiv_id":"1503.03585","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Unsupervised Learning using Nonequilibrium Thermodynamics","venue":"cs.LG","work_id":"986277c3-5997-4593-942c-17cdec737a72","year":2015},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/1503.03585","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:1b6483ea56f36288aafa49b4a51946fe767ba0ed4ee57e232e45f14eeff23380","observation_id":"eaece74c-41df-4db0-a57e-c698a7874e27","resolution":{"observed_at":"2026-07-09T02:25:55.834022Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-16T23:21:00.213109+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T23:21:00.213109+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":"2010.02502","doi":"10.48550/arxiv.2010.02502","metadata_source":"pith","pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Implicit Models","venue":"cs.LG","work_id":"8fa2128b-d18c-405c-ac92-0e669cf89ac0","year":2020},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:4c0268ea2687fe00f89183853a69e82699bbac31b371321253bfcb18c51e6e19","observation_id":"d7dd12aa-10d5-4484-a49e-bcbdb5baa0e4","resolution":{"observed_at":"2026-07-09T02:25:55.885077Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1998.712192","doi":"10.1109/tnn.1998.712192","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MIT press, ??? (2018)","venue":"IEEE Transactions on Neural Networks","work_id":"54d27712-81f4-4312-83f9-32fee26ac9f9","year":1998},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:a0a71dfe92ab9e11eb817b96c78feb9951696ea4228bca322ca855ce583f0cc0","observation_id":"dd3d5b43-cf21-4969-a33b-b6cf14d54ed2","resolution":{"observed_at":"2026-07-09T02:25:55.796181Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-17T00:20:41.635102+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T00:20:41.635102+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12908","last_updated":"2023-11-21T15:24:05Z","snapshot_observed_at":"2026-07-06T16:50:46.608196Z","submitted_at":"2023-11-21T15:24:05Z","title":"Diffusion Model Alignment Using Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":"2311.12908","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.12908","snapshot_observed_at":"2026-07-09T02:25:55.896149Z","title":"Diffusion model alignment using direct preference optimization.arXiv preprint arXiv:2311.12908","venue":"cs.CV","work_id":"1941def8-837f-49f0-b80c-bb513ed3eeeb","year":2023},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2311.12908","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:1a3ef491b03a1ec21d46f3bbfb668b4aee053f7575771a4bde193afc65220fb4","observation_id":"050d4b37-ae3a-4772-964a-9aaec3a18bbc","resolution":{"observed_at":"2026-07-09T02:25:55.897454Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:25:56.018929Z","title":null,"venue":null,"work_id":"0fc7cbde-c725-4f2c-b458-ec404c2ef504","year":2024},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:5550bc7f56543b501568a36288d64a945baf67ab25e8843dd2c72c59466dba01","observation_id":"a8fd6701-d236-4a4f-8fdc-070b8d29c6bc","resolution":{"observed_at":"2026-07-09T02:25:56.019952Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":"2306.09341","doi":"10.48550/arxiv.2306.09341","metadata_source":"pith","pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","venue":"cs.CV","work_id":"40702548-f094-4c67-a5db-a62f426f852e","year":2023},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:a5302a250b59f391d2098ee1285eb439603fa29d9c870b62261fadee3224bdc4","observation_id":"c706126f-6539-4203-845b-a6a06bf6d52d","resolution":{"observed_at":"2026-07-09T02:25:55.892309Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01657","last_updated":"2025-09-01T17:58:41Z","snapshot_observed_at":"2026-08-07T08:27:37.389380Z","submitted_at":"2025-09-01T17:58:41Z","title":"Data Retrieval with Importance Weights for Few-Shot Imitation Learning","version":1},"cited_work":{"arxiv_id":"2509.01657","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.01657","snapshot_observed_at":"2026-07-09T02:25:55.866741Z","title":"Data Retrieval with Importance Weights for Few-Shot Imitation Learning","venue":"cs.RO","work_id":"3d9d9063-43da-4194-9efa-23eba20ffa66","year":2025},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2509.01657","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:c50b5e61574fee14658fa4b122e3ca68554b6bdfc648f22d9cef4e9f141f8b00","observation_id":"f6805c19-0029-42c5-a7f3-160d2e405fc9","resolution":{"observed_at":"2026-07-09T02:25:55.868395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06481","last_updated":"2025-01-11T08:16:30Z","snapshot_observed_at":"2026-08-03T16:21:17.110013Z","submitted_at":"2025-01-11T08:16:30Z","title":"Focus-N-Fix: Region-Aware Fine-Tuning for Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2501.06481","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.06481","snapshot_observed_at":"2026-07-09T02:25:55.943626Z","title":"Focus-N-Fix: Region-Aware Fine-Tuning for Text-to-Image Generation","venue":"cs.CV","work_id":"9325cacc-33c2-4ab9-aaa1-ade2edae4b31","year":2025},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2501.06481","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:d9ea1c0b3a9006a15d67e9d1171b5c6a73167672b4e000bde478c82fc198243b","observation_id":"574c806b-1fe1-47ff-bf13-81f284638c4b","resolution":{"observed_at":"2026-07-09T02:25:55.944838Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:25:56.017160Z","title":"Advances in Neural Information Processing Systems 36, 15903–15935 (2023) 7","venue":null,"work_id":"9a30f317-58ac-4984-9d3f-263cb891e8ec","year":2023},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:0dc05ef8bd61f7fa3679bc515e3f7cb7b6f6b19d5796f9a87095d0a619966f43","observation_id":"b28ff67b-39ac-4803-bf5e-ec10c7a3ce4c","resolution":{"observed_at":"2026-07-09T02:25:56.018386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-07-31T14:51:03.625964Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"cited_work":{"arxiv_id":"2505.07818","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07818","snapshot_observed_at":"2026-07-09T03:05:55.316091Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","venue":"cs.CV","work_id":"7404dd36-8f9c-478f-b089-ef9f8189c711","year":2025},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2505.07818","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:b57fa3a473bc4e7a2e6c49a4151087d1b6b8422ec92d08c876cb32d40e415564","observation_id":"eabf51b1-b9d6-42ce-81ef-a31b19df1a97","resolution":{"observed_at":"2026-07-09T02:25:55.860040Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06559","last_updated":"2024-07-16T15:54:22Z","snapshot_observed_at":"2026-07-06T17:28:06.332906Z","submitted_at":"2024-02-09T17:18:33Z","title":"Diffusion-ES: Gradient-free Planning with Diffusion for Autonomous Driving and Zero-Shot Instruction Following","version":2},"cited_work":{"arxiv_id":"2402.06559","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.06559","snapshot_observed_at":"2026-07-09T02:25:55.923558Z","title":"Diffusion-ES: Gradient-free Planning with Diffusion for Autonomous Driving and Zero-Shot Instruction Following","venue":"cs.LG","work_id":"28579ee1-d825-47aa-ada0-968252339f7f","year":2024},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2402.06559","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:2f880d61371f02e10b18fd3e13f96032c928d973bb3dcacc8c10a43214c0df81","observation_id":"a27aef16-94fb-4308-9dee-1966183073fe","resolution":{"observed_at":"2026-07-09T02:25:55.924899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13231","last_updated":"2024-03-23T05:23:00Z","snapshot_observed_at":"2026-07-06T16:50:58.750467Z","submitted_at":"2023-11-22T08:42:46Z","title":"Using Human Feedback to Fine-tune Diffusion Models without Any Reward Model","version":3},"cited_work":{"arxiv_id":"2311.13231","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.13231","snapshot_observed_at":"2026-07-09T02:25:55.918539Z","title":"Using human feedback to fine-tune diffusion models without any reward model","venue":"cs.LG","work_id":"b22e8a82-c93b-4664-aaa4-79183b4c516a","year":2023},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2311.13231","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:0019104f53417889a7588a26059d441f2af2e5294d19c014ca57e3acef699b8e","observation_id":"3bb1a0b2-44cd-4107-b72b-b8c9908e4275","resolution":{"observed_at":"2026-07-09T02:25:55.919756Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21893","last_updated":"2026-05-18T14:50:11Z","snapshot_observed_at":"2026-07-06T21:31:54.566899Z","submitted_at":"2025-05-28T02:11:56Z","title":"SIPO: Stabilized and Improved Preference Optimization for Aligning Diffusion Models","version":3},"cited_work":{"arxiv_id":"2505.21893","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21893","snapshot_observed_at":"2026-07-09T02:25:55.850038Z","title":"SIPO: Stabilized and Improved Preference Optimization for Aligning Diffusion Models","venue":"cs.LG","work_id":"40c34541-b173-416d-b059-7ed7fa803e6c","year":2025},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/2505.21893","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:d557bfb00b29c40be4267aa38f7f327ad80c91d565418a4648ff86f90b04926c","observation_id":"b31d0fa8-79a1-408e-aa28-05728b57cc10","resolution":{"observed_at":"2026-07-09T02:25:55.851618Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.01363","last_updated":"2020-05-24T07:57:13Z","snapshot_observed_at":"2026-08-07T01:32:13.687656Z","submitted_at":"2018-10-02T16:42:35Z","title":"Energy-Based Hindsight Experience Prioritization","version":5},"cited_work":{"arxiv_id":"1810.01363","doi":null,"metadata_source":"pith","pith_arxiv_id":"1810.01363","snapshot_observed_at":"2026-07-09T02:25:55.916116Z","title":"Energy-Based Hindsight Experience Prioritization","venue":"cs.LG","work_id":"b9ebbb44-139e-4945-8907-86f3445dd55f","year":2018},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"cited_paper":"/paper/1810.01363","citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:46cbdb4c720a6c9e6838cb4c39acd419233f4be0352fe0b549452e81127043c7","observation_id":"7cb99871-101a-4543-9a56-60f6cd2d3c6a","resolution":{"observed_at":"2026-07-09T02:25:55.917249Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.01982","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:25:55.872061Z","title":"arXiv preprint arXiv:2510.01982 (2025) 3","venue":null,"work_id":"26633baf-4d31-443e-975e-2112fdfe7607","year":2025},"citing_paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-09T02:17:20.589485Z"},"links":{"citing_paper":"/paper/2607.07693"},"observation_digest":"sha256:d5077a5a88e4b6297f67e4cab5287b219446ade95aa864863e8a230f60fa533a","observation_id":"6054a268-b56d-4914-810b-d30d2848c609","resolution":{"observed_at":"2026-07-09T02:25:55.873580Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07693","last_updated":"2026-07-08T17:49:49Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-11T23:20:20.911100Z","submitted_at":"2026-07-08T17:49:49Z","title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":12,"parse_uncertain":0,"unresolved":4,"verified_exact":35,"verified_fuzzy":4},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2607.07693."}