{"as_of":"2026-08-08T18:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0be42b2d4463c6e4e01086d2a0176f6e5328686a9c8fe46945f7a71ad5fa904d","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:58:50.730090Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T20:38:28.328436Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T14:35:47.308416Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"cited_work":{"arxiv_id":"2602.06422","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.06422","snapshot_observed_at":"2026-07-07T03:18:12.085101Z","title":"Alleviating sparse rewards by modeling step-wise and long-term sampling effects in flow-based grpo.arXiv preprint arXiv:2602.06422, 2026","venue":null,"work_id":"87ffc566-e1fe-479a-a55b-74e845bf3042","year":2026},"citing_paper":{"arxiv_id":"2605.15190","last_updated":"2026-05-14T17:59:30Z","snapshot_observed_at":"2026-08-03T08:24:27.614764Z","submitted_at":"2026-05-14T17:59:30Z","title":"RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-06-30T20:38:28.328436Z"},"links":{"cited_paper":"/paper/2602.06422","citing_paper":"/paper/2605.15190"},"observation_digest":"sha256:879ab65943016f2545794ae567e2ab414d8136f78c90d0fd93399c0915f89d24","observation_id":"72c1ca81-5a6e-46b9-912c-239b718f6730","resolution":{"observed_at":"2026-07-07T03:18:12.085101Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.06422/citation-record","integrity":"/paper/2602.06422/integrity","json":"/paper/2602.06422/citation-record.json","paper":"/paper/2602.06422"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-01T15:43:51.739518Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-03T03:58:48.478031Z","title":"Training diffusion models with reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:48.478031Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:e2544dbff9672086f827ddc0af296e627a846c10dc140fe7271b428a78548f1d","observation_id":"cd4823fd-3f9a-4bc0-8804-05f6c0a19a57","resolution":{"observed_at":"2026-08-03T03:58:48.478031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:58:50.730090Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:50.730090Z"},"links":{"citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:2905bd87ea05479eea5d108a9e143687be4498290ba785847c6b90de05c9c305","observation_id":"97819a72-f58a-435f-a44d-2f374c6a8b0a","resolution":{"observed_at":"2026-08-03T03:58:50.730090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07703","last_updated":"2025-03-10T17:58:33Z","snapshot_observed_at":"2026-07-06T20:50:09.622181Z","submitted_at":"2025-03-10T17:58:33Z","title":"Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07703","snapshot_observed_at":"2026-08-03T03:58:48.835551Z","title":"Seedream 2.0: A native chinese-english bilingual image generation foundation model.arXiv preprint arXiv:2503.07703,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:48.835551Z"},"links":{"cited_paper":"/paper/2503.07703","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:9d6fdb706f3b738790d5daa1724e90ee0d020bb4fe08e089e7fe76109c5a51f7","observation_id":"2e78b1ca-bb65-4826-9c13-564fee38b66d","resolution":{"observed_at":"2026-08-03T03:58:48.835551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T03:58:48.943935Z","title":"Deepseek-r1: In- centivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:48.943935Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:d0441456441c4f337ab88c6f7c4dfef64f632caf45c7e8be6300b6fd48b45f62","observation_id":"90896383-cba7-480c-8ca7-4346902e1dca","resolution":{"observed_at":"2026-08-03T03:58:48.943935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04324","last_updated":"2025-10-15T06:35:29Z","snapshot_observed_at":"2026-07-06T22:08:40.965707Z","submitted_at":"2025-08-06T11:10:39Z","title":"TempFlow-GRPO: When Timing Matters for GRPO in Flow Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.04324","snapshot_observed_at":"2026-08-03T03:58:49.067234Z","title":"Tempflow-grpo: When timing matters for grpo in flow models.arXiv preprint arXiv:2508.04324,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:49.067234Z"},"links":{"cited_paper":"/paper/2508.04324","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:8b10c4babce3cdf4f4cda5ad16245e5d800e0f42e2b25975771e43fd22a0ed86","observation_id":"f2b5f785-2e51-4051-a603-adbd2bd6ba1d","resolution":{"observed_at":"2026-08-03T03:58:49.067234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:58:50.688606Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:50.688606Z"},"links":{"citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:2e1b69987988de94fa1e054197304490367ea8d1f3d494ce9390e076bfceffe7","observation_id":"5be4e67f-1567-4acd-9a94-175afaf311c8","resolution":{"observed_at":"2026-08-03T03:58:50.688606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-08-03T03:58:49.354792Z","title":"Mixgrpo: Unlocking flow-based grpo efficiency with mixed ode-sde.arXiv preprint arXiv:2507.21802,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:49.354792Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:9b8e91b779bcbc24eb22d512ea5ce537393ce12062939ffcd406048315e523c2","observation_id":"cde24e99-d1f6-4383-bea0-86b457ff8e3d","resolution":{"observed_at":"2026-08-03T03:58:49.354792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-03T03:58:49.455396Z","title":"T., Ben-Hamu, H., Nickel, M., and Le, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:49.455396Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:3ebd8487174f4bd7eb65e04e7429585a4ef4d1276ad86de5a04793f934591e6b","observation_id":"d3bd812a-b04d-4bc6-ae04-74353ab868a8","resolution":{"observed_at":"2026-08-03T03:58:49.455396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05470","last_updated":"2025-10-27T09:57:02Z","snapshot_observed_at":"2026-08-06T11:11:00.378627Z","submitted_at":"2025-05-08T17:58:45Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05470","snapshot_observed_at":"2026-08-03T03:58:49.630032Z","title":"Flow-grpo: Training flow matching models via online rl.arXiv preprint arXiv:2505.05470,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:49.630032Z"},"links":{"cited_paper":"/paper/2505.05470","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:82d2106f17b3eb9d28509dc086c6e98cced1eac63ea7b49dcd724f21c51379f9","observation_id":"d961a994-2c86-4e5e-9bca-f7390645d529","resolution":{"observed_at":"2026-08-03T03:58:49.630032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-03T03:58:49.747831Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:49.747831Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:7adc317ac7dff5485b83de6ec6f2284b8f58d91ce57ffce70e18c453af15e437","observation_id":"6e4b85ed-65c1-4eec-8794-4dff5e214a8d","resolution":{"observed_at":"2026-08-03T03:58:49.747831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:58:50.127534Z","title":"Grpo-guard: Mitigating implicit over-optimization in flow matching via regulated clipping.arXiv preprint arXiv:2510.22319, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:50.127534Z"},"links":{"citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:17947d3acda5c4b35f6a35e7d049e3d9c4c8e9a54af020767cb3a59f365e5f3e","observation_id":"639bd713-4120-44cb-adc5-b7d95bd6d50b","resolution":{"observed_at":"2026-08-03T03:58:50.127534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-07-31T14:51:03.625964Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07818","snapshot_observed_at":"2026-08-03T03:58:50.281427Z","title":"Dancegrpo: Unleashing grpo on visual generation.arXiv preprint arXiv:2505.07818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:50.281427Z"},"links":{"cited_paper":"/paper/2505.07818","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:5c51dcae1545ebe86ada874614a5b669f495bc4c99b7df5cea0004073e735843","observation_id":"a50eaa08-f5fb-4fdf-bef9-62c3a9ba542a","resolution":{"observed_at":"2026-08-03T03:58:50.281427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-03T03:58:50.427811Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:50.427811Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:8efbe86d8913ccccc170dbdeb5bba6304ac2c6dffc9681510d88acbc8d6c590d","observation_id":"33790b14-018f-4f69-ada6-8934bee8ee34","resolution":{"observed_at":"2026-08-03T03:58:50.427811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-03T03:58:50.564346Z","title":"Group sequence policy optimization.arXiv preprint arXiv:2507.18071,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:50.564346Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:239c58bbba64ca99079fdebb7695557411b5ed43c68b81ed8cb2f920ffde54a3","observation_id":"9f97412d-913d-4f1d-a1f2-cb5ea11b10c7","resolution":{"observed_at":"2026-08-03T03:58:50.564346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T03:58:50.055891Z","title":"Deepseekmath: Push- ing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:50.055891Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:3a26e0549e845e9491e165eca24a2d2cbf3a5f6ea9a9c595433483ff5d800f9c","observation_id":"5fe96f48-1dd4-4a36-9acf-bbd97a657803","resolution":{"observed_at":"2026-08-03T03:58:50.055891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-03T03:58:49.865910Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:49.865910Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:41bfffed9a94994b6633a33cf5e0417e6a8986a56234e60b5fb8e15d47293fe6","observation_id":"cdac7abf-3952-4199-803f-d6e647d6d7c0","resolution":{"observed_at":"2026-08-03T03:58:49.865910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-03T03:58:49.120237Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:49.120237Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:07affb29fbb17a932bd51f7c6ce78118fb12061996012a5f310b082b59be89bb","observation_id":"9b7e307a-80b3-4b1a-b673-c4319ec040da","resolution":{"observed_at":"2026-08-03T03:58:49.120237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05595","last_updated":"2025-07-08T02:14:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T02:14:10Z","title":"PaddleOCR 3.0 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05595","snapshot_observed_at":"2026-08-03T03:58:48.541300Z","title":"Paddleocr 3.0 technical report.arXiv preprint arXiv:2507.05595,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:48.541300Z"},"links":{"cited_paper":"/paper/2507.05595","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:9a4fa75f06cc624fcc7079801f7865d8c33b09763e7c56b2fcc0a1c9cd56aa6d","observation_id":"c77a963d-838a-47de-9571-b24da31e2d72","resolution":{"observed_at":"2026-08-03T03:58:48.541300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02507","last_updated":"2024-12-19T10:43:11Z","snapshot_observed_at":"2026-07-06T18:25:18.469656Z","submitted_at":"2024-06-04T17:25:59Z","title":"Guiding a Diffusion Model with a Bad Version of Itself","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02507","snapshot_observed_at":"2026-08-03T03:58:49.195604Z","title":"Kirstain, Y ., Polyak, A., Singer, U., Matiana, S., Penna, J., and Levy, O","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:49.195604Z"},"links":{"cited_paper":"/paper/2406.02507","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:f7d846d673f076650ed05e810f6d15de69e68b19d5d8fc2db2a1c9745b6d2a63","observation_id":"777f14c1-41b3-445c-ac38-471d792bea4d","resolution":{"observed_at":"2026-08-03T03:58:49.195604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:58:48.719811Z","title":"Densegrpo: From sparse to dense re- ward for flow matching model alignment.arXiv preprint arXiv:2601.20218,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:48.719811Z"},"links":{"citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:07d541104dd1b28d003ee97be41d16af100512e4f930c35336ceef622287ab1d","observation_id":"89b3d90f-74de-4370-8b2b-36f1f8542440","resolution":{"observed_at":"2026-08-03T03:58:48.719811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T15:45:57.065916Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 1 inbound Pith citation observation for arXiv:2602.06422."}