{"as_of":"2026-08-14T07:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9f0eed312b5756807ac93ef226734206008c15eef9f471c960e132be3fcb0599","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:21:18.692660Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09233/citation-record","integrity":"/paper/2608.09233/integrity","json":"/paper/2608.09233/citation-record.json","paper":"/paper/2608.09233"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:18.549161Z","title":"On-policy distillation of language models: Learning from self- generated mistakes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:18.549161Z"},"links":{"citing_paper":"/paper/2608.09233"},"observation_digest":"sha256:e6b05c5f357ae305b32a5069b04b38a441418dd866a2941d2a75f1b6facc9134","observation_id":"b53adc8a-7194-47cb-b915-de8dffa0db40","resolution":{"observed_at":"2026-08-14T04:21:18.549161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:18.686838Z","title":"This assumption holds when the reference retains the generative structure of the teacher","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:18.686838Z"},"links":{"citing_paper":"/paper/2608.09233"},"observation_digest":"sha256:646cfb4e5e5fb0841428ca64d2f282d3f30d388d1fbc8c27d1ec406d34f69f17","observation_id":"8e9618e8-e45a-4153-a581-5b944af12ad7","resolution":{"observed_at":"2026-08-14T04:21:18.686838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:18.576091Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:18.576091Z"},"links":{"citing_paper":"/paper/2608.09233"},"observation_digest":"sha256:797afed3bfa4fd9ce0ffe132414b7d74c2bd70305fbe1d11349e7550a4bf1316","observation_id":"dff56b0c-3f48-4263-a49b-bf09a4c0d78f","resolution":{"observed_at":"2026-08-14T04:21:18.576091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:18.581807Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:18.581807Z"},"links":{"citing_paper":"/paper/2608.09233"},"observation_digest":"sha256:24e2f9c886b6f057b3a9f54d1f737b3d0272d96faba99a17159ab641b9e992ca","observation_id":"871ea55d-080b-4a2b-bda6-e6f170855adf","resolution":{"observed_at":"2026-08-14T04:21:18.581807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-08-14T04:21:18.589194Z","title":"Chaoyu Li, Xiaoyi Gu, Yogesh Kulkarni, Eun Woo Im, Mohammadmahdi Honarmand, Zeyu Wang, Juntong Song, Fei Du, Xilin Jiang, Kexin Zheng, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:18.589194Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2608.09233"},"observation_digest":"sha256:5a0cd6c6c0fca53be73434d52a4b90171548d8974ba54fab08c66ce1d985b7e9","observation_id":"f12de540-6bce-4f32-a3f9-14c0e9064c13","resolution":{"observed_at":"2026-08-14T04:21:18.589194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15055","last_updated":"2026-05-14T16:49:09Z","snapshot_observed_at":"2026-08-09T08:30:11.806142Z","submitted_at":"2026-05-14T16:49:09Z","title":"DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15055","snapshot_observed_at":"2026-08-14T04:21:18.601508Z","title":"Diffusionopd: A unified perspective of on-policy distillation in diffusion models.arXiv preprint arXiv:2605.15055, 2026b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:18.601508Z"},"links":{"cited_paper":"/paper/2605.15055","citing_paper":"/paper/2608.09233"},"observation_digest":"sha256:c746c9fefefa6dd8bd920ce942bfdf75ff1e3ad916120bd6572f46dfa8b627f8","observation_id":"8d26f722-cc04-4b70-bcb8-c86967594795","resolution":{"observed_at":"2026-08-14T04:21:18.601508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00626","last_updated":"2026-06-18T17:00:51Z","snapshot_observed_at":"2026-08-13T15:44:43.257202Z","submitted_at":"2026-04-01T08:32:34Z","title":"A Survey of On-Policy Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.00626","snapshot_observed_at":"2026-08-14T04:21:18.618916Z","title":"A survey of on-policy distillation for large language models.arXiv preprint arXiv:2604.00626,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:18.618916Z"},"links":{"cited_paper":"/paper/2604.00626","citing_paper":"/paper/2608.09233"},"observation_digest":"sha256:c57fe488581af5b8fb1ba4783f59cafb25d8b976fb466d0615789876abec3b3a","observation_id":"6e584862-7def-4b80-8d47-65a80e1974aa","resolution":{"observed_at":"2026-08-14T04:21:18.618916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-14T04:21:18.626818Z","title":"Score-based generative modeling through stochastic differential equations.arXiv preprint arXiv:2011.13456,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:18.626818Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2608.09233"},"observation_digest":"sha256:64dd09a901d99d31b9e057d764f524dd124cd1e081ed9c7dc9a848bd300c376b","observation_id":"88064e9d-f93c-48c5-aa3c-1d667f805e35","resolution":{"observed_at":"2026-08-14T04:21:18.626818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:18.633085Z","title":"Human preference score: Better aligning text-to-image models with human preference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:18.633085Z"},"links":{"citing_paper":"/paper/2608.09233"},"observation_digest":"sha256:5b1d3231577c3ca054ad86041c8eacb3d252d361644116036374a0f845855fd7","observation_id":"ef18b106-34bd-434a-a8c3-7a14f8096625","resolution":{"observed_at":"2026-08-14T04:21:18.633085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:18.639276Z","title":"Advantage weighted matching: Aligning rl with pretraining in diffusion models.arXiv preprint arXiv:2509.25050, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:18.639276Z"},"links":{"citing_paper":"/paper/2608.09233"},"observation_digest":"sha256:50fb8e2212eba145015249f67718f5897b156da367b2e6a216f3baa3414fd3af","observation_id":"bc150ef9-d797-42d6-9e97-01e2a0ec1397","resolution":{"observed_at":"2026-08-14T04:21:18.639276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06507","last_updated":"2026-05-07T16:20:42Z","snapshot_observed_at":"2026-07-29T20:40:54.700221Z","submitted_at":"2026-05-07T16:20:42Z","title":"MARBLE: Multi-Aspect Reward Balance for Diffusion RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06507","snapshot_observed_at":"2026-08-14T04:21:18.650967Z","title":"Marble: Multi- aspect reward balance for diffusion rl.arXiv preprint arXiv:2605.06507,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:18.650967Z"},"links":{"cited_paper":"/paper/2605.06507","citing_paper":"/paper/2608.09233"},"observation_digest":"sha256:4652a4418effc7ba4dfd59e293b728a07e802cb0647cb660d7390d683e31322b","observation_id":"3414ba7c-934f-413f-b6ef-4f95412ac212","resolution":{"observed_at":"2026-08-14T04:21:18.650967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16117","last_updated":"2026-02-16T17:14:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-19T16:09:33Z","title":"DiffusionNFT: Online Diffusion Reinforcement with Forward Process","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.16117","snapshot_observed_at":"2026-08-14T04:21:18.656756Z","title":"Model extrapolation expedites alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:18.656756Z"},"links":{"cited_paper":"/paper/2509.16117","citing_paper":"/paper/2608.09233"},"observation_digest":"sha256:a7a44a9b681d9413b574018bc2ac4a942cb23b0f8e2efd233304c75404e657c9","observation_id":"cd7f346d-f83b-4952-9a43-5986c3609a0a","resolution":{"observed_at":"2026-08-14T04:21:18.656756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:18.662779Z","title":"TheAesthetics teacheris also trained using GRPO-Guard and optimizes the equally weighted reward of PickScore, ClipScore and HPSv2.1","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:18.662779Z"},"links":{"citing_paper":"/paper/2608.09233"},"observation_digest":"sha256:5b120a3c3bc2cb8b511292cb4904c12c7882fee43225242f890ed9bee1f933c0","observation_id":"28347477-08a7-4ad9-bde6-9500e58816ca","resolution":{"observed_at":"2026-08-14T04:21:18.662779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:18.667435Z","title":"21 Preprint","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:18.667435Z"},"links":{"citing_paper":"/paper/2608.09233"},"observation_digest":"sha256:36d71efcfe59aa01b1aea2d5ae007b20de878858bcf01d0bfd7d7b5d5e5f5802","observation_id":"631f4cca-a4ff-4088-b6b0-595883e45533","resolution":{"observed_at":"2026-08-14T04:21:18.667435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:18.673030Z","title":"It is also used only for out-of-domain evaluation","venue":null,"work_id":null,"year":1939},"citing_paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:18.673030Z"},"links":{"citing_paper":"/paper/2608.09233"},"observation_digest":"sha256:715c6e261d0b23e90ac1a61d528518573d477139afd71fa43ebb737ecd4ec150","observation_id":"0bfb08bd-56fb-4982-9aa9-04d94b6edac4","resolution":{"observed_at":"2026-08-14T04:21:18.673030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:18.692660Z","title":"HELLO\" pinned to a denim jacket, close-up macro shot. A cinematic neon-lit ramen shop at night in the rain, a glowing sign reading","venue":null,"work_id":null,"year":1962},"citing_paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:18.692660Z"},"links":{"citing_paper":"/paper/2608.09233"},"observation_digest":"sha256:cab6929f28fda92bb3534747f12cb38cccb2d2686a0b2b5231a8b2a76017afdd","observation_id":"cc1825ff-5513-4b52-805c-d8fb3a72ad4d","resolution":{"observed_at":"2026-08-14T04:21:18.692660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18740","last_updated":"2026-06-02T16:34:00Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:57:04Z","title":"Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18740","snapshot_observed_at":"2026-08-14T04:21:18.645263Z","title":"Vision-opd: Learning to see fine details for multimodal llms via on-policy self-distillation.arXiv preprint arXiv:2605.18740,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:18.645263Z"},"links":{"cited_paper":"/paper/2605.18740","citing_paper":"/paper/2608.09233"},"observation_digest":"sha256:4236de3f7d16eda8bea6d5d007dfc1e4408ef01c4f7a2348723c9038c100eb74","observation_id":"3db67aa1-53c4-4740-847d-d2230976a7a2","resolution":{"observed_at":"2026-08-14T04:21:18.645263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-14T04:21:18.613208Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:18.613208Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.09233"},"observation_digest":"sha256:ee8963c365803d49d1c3aa2839a5337842bcd989a821635c49a7e5972febb49c","observation_id":"38d8d053-7fc9-4e22-a754-3e585935b85b","resolution":{"observed_at":"2026-08-14T04:21:18.613208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.08063","last_updated":"2026-05-24T05:25:48Z","snapshot_observed_at":"2026-08-12T21:53:38.412397Z","submitted_at":"2026-05-08T17:50:15Z","title":"Flow-OPD: On-Policy Distillation for Flow Matching Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.08063","snapshot_observed_at":"2026-08-14T04:21:18.569416Z","title":"Flow-opd: On-policy distillation for flow matching models.arXiv preprint arXiv:2605.08063,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:18.569416Z"},"links":{"cited_paper":"/paper/2605.08063","citing_paper":"/paper/2608.09233"},"observation_digest":"sha256:379f7b1d10f78f22c21bfd1ea1264000840b47932446d9459b89c05741b693bd","observation_id":"0030beb2-0a35-47d4-b386-d5916796c3cb","resolution":{"observed_at":"2026-08-14T04:21:18.569416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:18.555512Z","title":"Training diffusion models with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:18.555512Z"},"links":{"citing_paper":"/paper/2608.09233"},"observation_digest":"sha256:956caf4ab283a79760e926a54b13fe5f4e4414d7a1aad6164dbc3cd04ae27467","observation_id":"5bae30a2-36d4-424b-8ec7-223bf77b82b9","resolution":{"observed_at":"2026-08-14T04:21:18.555512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:18.562506Z","title":"Directly fine-tuning diffusion models on differentiable rewards","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:18.562506Z"},"links":{"citing_paper":"/paper/2608.09233"},"observation_digest":"sha256:9e85f397386d6d748e0285243cfc1e1e51ec78265f640db8bebb4049cfe3e4fe","observation_id":"b7a3437b-4a5b-472f-a96b-c44b581871b0","resolution":{"observed_at":"2026-08-14T04:21:18.562506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03739","last_updated":"2024-11-07T03:54:22Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:18Z","title":"Aligning Text-to-Image Diffusion Models with Reward Backpropagation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03739","snapshot_observed_at":"2026-08-14T04:21:18.607332Z","title":"Aligning text-to- image diffusion models with reward backpropagation.arXiv preprint arXiv:2310.03739,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:18.607332Z"},"links":{"cited_paper":"/paper/2310.03739","citing_paper":"/paper/2608.09233"},"observation_digest":"sha256:836859f0b44084ad9369f779e8d1a7d80174ebb1f09ae4201cf40a75b5526b4b","observation_id":"3b4a449f-5260-4215-a753-a7fa3f8912fe","resolution":{"observed_at":"2026-08-14T04:21:18.607332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09233","last_updated":"2026-08-13T04:14:38Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T07:16:38.627649Z","submitted_at":"2026-08-10T07:55:57Z","title":"DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2608.09233."}