{"as_of":"2026-08-09T12:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c111698f8df8764061c55d0b99af5c3e39717bb49ca5fd18e4df8c42bec0e1be","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T05:54:32.517155Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05600/citation-record","integrity":"/paper/2608.05600/integrity","json":"/paper/2608.05600/citation-record.json","paper":"/paper/2608.05600"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:33.552569Z","title":"gummy bear zone","venue":null,"work_id":"00ec9c49-268b-459e-ae91-38b5c749c844","year":2001},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.517155Z"},"links":{"citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:d0ffa0610092fe1e0aa88e0fbf3093e1b7bf4b7816b945afdb1be9648b830cf9","observation_id":"74a6c8e8-bd8b-4f2a-982b-e23e62c00a24","resolution":{"observed_at":"2026-08-08T05:54:33.556213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:32.442334Z","title":"Densegrpo: From sparse to dense reward for flow matching model alignment.arXiv preprint arXiv:2601.20218,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.442334Z"},"links":{"citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:10ae2ca532368aaff5638afc73ec8fe14e0f80366f3efc862074ce846e4777d8","observation_id":"78cdb6ac-7061-47d1-9ffd-515270f00c1b","resolution":{"observed_at":"2026-08-08T05:54:32.442334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-08-08T05:54:32.463629Z","title":"Aligning text-to-image models using human feedback.arXiv preprint arXiv:2302.12192,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.463629Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:5f0230178fa09943dc43d29fb21791a7d875fee05bd737e9ee65738b10bb48ba","observation_id":"2fbb39f5-cce6-4cdc-a516-4e2205c87a32","resolution":{"observed_at":"2026-08-08T05:54:32.463629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-08-08T05:54:32.466927Z","title":"Mixgrpo: Unlocking flow-based grpo efficiency with mixed ode-sde.arXiv preprint arXiv:2507.21802,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.466927Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:ad1fda0b1f3ca841268cedc1f2f449b636daa4d7c788cb9661c44c9b7cd452b5","observation_id":"450e6ffc-4d27-4f86-a1e8-d3b8f04101f0","resolution":{"observed_at":"2026-08-08T05:54:32.466927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.29526","last_updated":"2026-06-28T17:40:02Z","snapshot_observed_at":"2026-08-07T14:47:08.995838Z","submitted_at":"2026-06-28T17:40:02Z","title":"The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2606.29526","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.29526","snapshot_observed_at":"2026-08-08T05:54:33.173651Z","title":"The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning","venue":"cs.LG","work_id":"baca503c-8ec7-461d-a8bf-f1da7fa36006","year":2026},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.470552Z"},"links":{"cited_paper":"/paper/2606.29526","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:12334f0afe7f0126700711801e1262c3a7a9db14f6ec7a5febfabda97d4b56ad","observation_id":"39601ea0-7e1a-4235-846f-40869afebf2c","resolution":{"observed_at":"2026-08-08T05:54:33.179122Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-08T05:54:32.473890Z","title":"Flow matching for generative modeling.arXiv preprint arXiv:2210.02747,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.473890Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:f97870ebbc785106053caf8b5000f78e141e368da665e38af7d8b12d7f1a87ff","observation_id":"d6aae682-450c-4d2e-ba33-86b016b218f8","resolution":{"observed_at":"2026-08-08T05:54:32.473890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-08T05:54:32.477285Z","title":"Flow-grpo: Training flow matching models via online rl.Ad- vances in neural information processing systems, 38:40783–40818, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.477285Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:b0caa8355a92daa1486292f51bccc1c514c421d63241af295a52bf8d667a8f6a","observation_id":"4a6fcdf9-3da1-4cfb-be82-b81ba54369fa","resolution":{"observed_at":"2026-08-08T05:54:32.477285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:32.480506Z","title":"De- feating the training-inference mismatch via fp16.arXiv preprint arXiv:2510.26788,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.480506Z"},"links":{"citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:66b0ec657385c2badcb73d9d3c0eee120a1d5a1ed820d0c58c09aeb663a2abc2","observation_id":"a895c95e-2f21-4848-8a64-1fc62b7c9d19","resolution":{"observed_at":"2026-08-08T05:54:32.480506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18150","last_updated":"2026-04-10T15:41:56Z","snapshot_observed_at":"2026-08-02T16:35:13.446446Z","submitted_at":"2026-01-26T05:12:05Z","title":"FP8-RL: A Practical and Stable Low-Precision Stack for LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18150","snapshot_observed_at":"2026-08-08T05:54:32.483595Z","title":"Fp8-rl: A practical and stable low-precision stack for llm reinforcement learning.arXiv preprint arXiv:2601.18150,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.483595Z"},"links":{"cited_paper":"/paper/2601.18150","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:38424c9b6fbcd4bbbcf07b9452904ec23a66e14e8cc2a12b598ab562490b187b","observation_id":"01be9f98-9d40-457e-a09f-925b05f97ef0","resolution":{"observed_at":"2026-08-08T05:54:32.483595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-08T05:54:32.486891Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020a","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.486891Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:fc4557f9f1f967ad7acb11b7a00bb526678d1d436f8ea8f44a041b5aab40129b","observation_id":"df2b5a68-f02e-4db3-8dcd-f24c8368982e","resolution":{"observed_at":"2026-08-08T05:54:32.486891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-08T05:54:32.490246Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.490246Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:f3b8ced0f85e2481fb2909f5ba9934ba127b26d293f7222a90d0d9bb1de15d4b","observation_id":"ffec1e08-447d-4820-9eec-013ba5787803","resolution":{"observed_at":"2026-08-08T05:54:32.490246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:32.493575Z","title":"Coefficients-preserving sampling for reinforcement learning with flow matching.arXiv preprint arXiv:2509.05952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.493575Z"},"links":{"citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:3270d5f4a1fdabfeb97225c14c0da2e30f437e32d573186cea6dc527f837f5b1","observation_id":"b1c50b50-82fb-400b-8672-fe18ad1f0ac3","resolution":{"observed_at":"2026-08-08T05:54:32.493575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-08T05:54:32.497114Z","title":"No more train-inference mismatch: Bitwise consistent on-policy reinforcement learning with vllm and torchtitan","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.497114Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:b3871ff3b191cacf9cada531be1c4b25cf641753bce2c582223c16cafecf0315","observation_id":"b1244178-d0ff-4c5a-ba0b-e271f9ac3452","resolution":{"observed_at":"2026-08-08T05:54:32.497114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:32.500748Z","title":"Human preference score: Better aligning text-to-image models with human preference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.500748Z"},"links":{"citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:7a6755b23553c826261852f2bb532bf548296d6ffe61aab5792f9e25cf256b2f","observation_id":"4770d7fa-9cce-4846-bb3b-8e84ac3e9d15","resolution":{"observed_at":"2026-08-08T05:54:32.500748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-07-31T14:51:03.625964Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07818","snapshot_observed_at":"2026-08-08T05:54:32.503814Z","title":"Dancegrpo: Unleashing grpo on visual generation.arXiv preprint arXiv:2505.07818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.503814Z"},"links":{"cited_paper":"/paper/2505.07818","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:e13d90327a5f59c601f01a3edf11ba7dfbfaeca0c3357d1278601b256f8d9a13","observation_id":"e0be788b-bf4b-4f9e-9ba9-d24a224a7464","resolution":{"observed_at":"2026-08-08T05:54:32.503814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:33.562668Z","title":"Your efficient rl framework secretly brings you off-policy rl training, august 2025.URL https://fengyao","venue":null,"work_id":"72f49304-93c9-4270-baa2-5b3bbca67fa8","year":2025},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.507119Z"},"links":{"citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:4df6529db40c7d54e569ca2a741114773c7e9625b835dacb3ec893cf8c007215","observation_id":"fbb1a55c-c91a-40e9-b85b-18c7e94a1d49","resolution":{"observed_at":"2026-08-08T05:54:33.566447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16117","last_updated":"2026-02-16T17:14:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-19T16:09:33Z","title":"DiffusionNFT: Online Diffusion Reinforcement with Forward Process","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.16117","snapshot_observed_at":"2026-08-08T05:54:32.510791Z","title":"Diffusionnft: Online diffusion reinforcement with forward process.arXiv preprint arXiv:2509.16117,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.510791Z"},"links":{"cited_paper":"/paper/2509.16117","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:90e89b9a0db8c2c310865b8138880150ad5bb117a0a08ca576d79acdaa667552","observation_id":"2ccab37e-fedb-4b16-9eb7-fd2b44e3b0df","resolution":{"observed_at":"2026-08-08T05:54:32.510791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:32.514207Z","title":"Manifold-aware exploration for reinforcement learning in video generation.arXiv preprint arXiv:2603.21872,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.514207Z"},"links":{"citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:ff601227293c5d9d3dad654d48616bb4151308f6629d6b398a254b2ed58bda74","observation_id":"01ea36d9-80b1-401b-84a9-299eca4b0bae","resolution":{"observed_at":"2026-08-08T05:54:32.514207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:32.430935Z","title":"Training diffusion models with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.430935Z"},"links":{"citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:e6e630addb9fba476b0aed667d20b05f83c5f6a2907d0c443c07f45f09206851","observation_id":"6d317bed-9a7a-45c7-b002-0db3326cc03c","resolution":{"observed_at":"2026-08-08T05:54:32.430935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-08T05:54:32.459894Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.459894Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:17f331918c0b3e6b7abcfde3716c0cd04760912e72f00c4655fb16f562803ca5","observation_id":"566e7546-1251-4838-9300-bbc11ddd74d9","resolution":{"observed_at":"2026-08-08T05:54:32.459894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:32.445788Z","title":"Treegrpo: Tree-advantage grpo for online rl post-training of diffusion models.arXiv preprint arXiv:2512.08153,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.445788Z"},"links":{"citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:92a8402c801458648dc6cef12851100bd774cdb3a1d744d45eafc319489d1a32","observation_id":"16dac972-a554-4a30-9948-9036c2d111f4","resolution":{"observed_at":"2026-08-08T05:54:32.445788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:32.438659Z","title":"Directly fine-tuning diffusion models on differentiable rewards","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.438659Z"},"links":{"citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:d79db63b79dcebfcbd8ea7cdd7f6b023cdd84dc9fdbc0c8c7c73e19d8f458cc1","observation_id":"5c179457-288b-4b1c-a484-f93c36261d2e","resolution":{"observed_at":"2026-08-08T05:54:32.438659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14743","last_updated":"2024-10-15T19:37:51Z","snapshot_observed_at":"2026-08-04T04:06:24.551238Z","submitted_at":"2024-04-23T04:51:02Z","title":"Gradient Guidance for Diffusion Models: An Optimization Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14743","snapshot_observed_at":"2026-08-08T05:54:32.453132Z","title":"Gradient guidance for diffusion models: An optimization perspective.arXiv preprint arXiv:2404.14743,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.453132Z"},"links":{"cited_paper":"/paper/2404.14743","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:1dca9728a55d4ce8822a9dd13c105d0873a52717c611864f43e4b2781168f54b","observation_id":"8f03720c-298e-4372-b1a4-20b858522778","resolution":{"observed_at":"2026-08-08T05:54:32.453132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14687","last_updated":"2024-05-20T04:23:45Z","snapshot_observed_at":"2026-08-03T03:59:22.374270Z","submitted_at":"2022-09-29T11:12:27Z","title":"Diffusion Posterior Sampling for General Noisy Inverse Problems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14687","snapshot_observed_at":"2026-08-08T05:54:32.434813Z","title":"Diffusion posterior sampling for general noisy inverse problems.arXiv preprint arXiv:2209.14687,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.434813Z"},"links":{"cited_paper":"/paper/2209.14687","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:25a5be81b1b6b122b02a2f275d34efb15a51b2a9b7d6efa46fa8a5ff30bd8da3","observation_id":"e3072153-392b-4d9c-9309-5c258da56e75","resolution":{"observed_at":"2026-08-08T05:54:32.434813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-08T05:54:32.449343Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment.arXiv preprint arXiv:2304.06767,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.449343Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:a3c4e70cdf3eefcdff3517b1e21e9e0e730b90c1bcbe3804cd40d328141d5cd2","observation_id":"25164c7e-f160-4a02-9bfe-9ea5ab4f88b4","resolution":{"observed_at":"2026-08-08T05:54:32.449343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:32.456777Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.456777Z"},"links":{"citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:0bbba8684c4622e41fc1a783add93cb39bda5917597726604e531678a60ae7eb","observation_id":"357a86b0-f2f5-4465-b63e-091143c5efd5","resolution":{"observed_at":"2026-08-08T05:54:32.456777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T11:11:51.249979Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2608.05600."}