{"as_of":"2026-08-23T17:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:776cd04883f0987bad08844c9125e05b198725c84de3fb9ed0ea03322f09ac8a","coverage":[{"denominator":103,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T06:25:56.310135Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T08:35:16.435272Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T12:58:08.764089Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"cited_work":{"arxiv_id":"2601.12784","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.12784","snapshot_observed_at":"2026-08-04T02:39:57.610477Z","title":"Unleashing effi- cient asynchronous rl post-training via staleness-constrained rollout coordination, 2026.https://arxiv.org/abs/2601.12784","venue":null,"work_id":"91d6b91b-d00c-47c6-be93-c4a30dd8f6f5","year":2026},"citing_paper":{"arxiv_id":"2606.11867","last_updated":"2026-06-10T09:42:11Z","snapshot_observed_at":"2026-08-14T16:02:38.952970Z","submitted_at":"2026-06-10T09:42:11Z","title":"Harnessing Routing Foresight for Micro-step-level MoE load balancing in RL Post-training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T08:35:16.435272Z"},"links":{"cited_paper":"/paper/2601.12784","citing_paper":"/paper/2606.11867"},"observation_digest":"sha256:37cc8b3d45e7d21fd7816d88531ef15fd30ee6ccb0b5206fc426b6df633188c2","observation_id":"df03747c-978f-42c3-b4cc-e1521ed2cd38","resolution":{"observed_at":"2026-08-04T02:39:57.610477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2601.12784/citation-record","integrity":"/paper/2601.12784/integrity","json":"/paper/2601.12784/citation-record.json","paper":"/paper/2601.12784"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:45.902248Z","title":"Taming Throughput-Latency tradeoff in LLM inference with Sarathi-Serve","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:45.902248Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:3c44c68425a1fe917b5a529cc8ec9c720e049667b48058086d7aa966c82a6142","observation_id":"8b8c4b7e-93e3-48ba-b5b7-468fa1717476","resolution":{"observed_at":"2026-08-04T06:25:45.902248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18058","last_updated":"2024-01-31T18:29:39Z","snapshot_observed_at":"2026-08-16T14:22:46.159588Z","submitted_at":"2024-01-31T18:29:39Z","title":"LongAlign: A Recipe for Long Context Alignment of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18058","snapshot_observed_at":"2026-08-04T06:25:46.082302Z","title":"Longalign: A recipe for long context alignment of large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:46.082302Z"},"links":{"cited_paper":"/paper/2401.18058","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:421d29aa0af534ef4ea68b4129575675515247e688085b898cd40f52faf45a72","observation_id":"907c093c-b1ae-4d7f-8fc0-47545e2e0262","resolution":{"observed_at":"2026-08-04T06:25:46.082302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:46.235143Z","title":"A survey on mixture of experts in large language models.IEEE Transactions on Knowledge and Data Engineering, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:46.235143Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:c6e2fb6f795d3d9cc82715fba1e63e9e95f0bbe1fe1d022a2cc9672fd7c2c53a","observation_id":"50e8d2b0-f64a-4992-97c6-e3d020b4a30e","resolution":{"observed_at":"2026-08-04T06:25:46.235143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:46.402975Z","title":"Respec: Towards optimizing speculative decoding in reinforcement learning systems, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:46.402975Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:f7d1f11538d2cd06485a7f5e00ff19447630c0e11e541bf35ac3cc0e89648eea","observation_id":"5f8c24d9-c3b9-4544-8674-9d055a58ceda","resolution":{"observed_at":"2026-08-04T06:25:46.402975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:46.529447Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:46.529447Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:263559bd756fa757e49e4ee64945db664a4bddba034feedfeb77c15ee5c5ded2","observation_id":"d972a8dc-1106-4639-b004-12dd92cb13a4","resolution":{"observed_at":"2026-08-04T06:25:46.529447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19766","last_updated":"2025-07-26T03:42:33Z","snapshot_observed_at":"2026-08-15T23:25:22.033274Z","submitted_at":"2025-07-26T03:42:33Z","title":"UloRL:An Ultra-Long Output Reinforcement Learning Approach for Advancing Large Language Models' Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19766","snapshot_observed_at":"2026-08-04T06:25:46.677712Z","title":"Ulorl:an ultra-long output reinforcement learning approach for advancing large language models’ reasoning abilities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:46.677712Z"},"links":{"cited_paper":"/paper/2507.19766","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:b3603ff4e54cb233b182069efc955558b8a5a578ccfb8d466ab6aa07cacaca32","observation_id":"aa62aa5c-4434-43ff-90ea-d3e69ecc663c","resolution":{"observed_at":"2026-08-04T06:25:46.677712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:46.835994Z","title":"Advances in importance sampling.Wiley Stat- sRef: Statistics Reference Online, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:46.835994Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:8f5da91e7c144343ebe851ddca90415ec2b8f0d2c8e023f642a15bb4b8014886","observation_id":"225f3113-8c15-4110-8143-e0388d866bc8","resolution":{"observed_at":"2026-08-04T06:25:46.835994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:47.009776Z","title":"Aime24 dataset, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:47.009776Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:d7abc3f144e6af620eb2be20aab03aa1a019480312f482c1729158386cd66766","observation_id":"fc8debaf-3b4e-4486-a0b3-32dd89500f20","resolution":{"observed_at":"2026-08-04T06:25:47.009776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:47.120583Z","title":"Dapo-math-17k dataset, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:47.120583Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:1fe2ce3e9b9f1c316915c2f1ee26b70453ec74daf756a0d4b2888380544dd076","observation_id":"a17c8c52-63a4-41c4-aa48-bff89400eafb","resolution":{"observed_at":"2026-08-04T06:25:47.120583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-04T06:25:47.347729Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:47.347729Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:4d9c39998c9cd764913c2a6f256c9415db8e95da416e4ab732eae85543578dbb","observation_id":"7d2d5ef5-381b-41af-b18b-44f0ae5fc23f","resolution":{"observed_at":"2026-08-04T06:25:47.347729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:47.508488Z","title":"Apt-serve: Adaptive request scheduling on hybrid cache for scalable llm inference serving.Proc","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:47.508488Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:c37a663293e21e365549d490b3ed294a0cf9c7bb3ca2da65d9634ae66aeffc0b","observation_id":"38d80a14-fb98-42a9-96b4-219a77a70d4f","resolution":{"observed_at":"2026-08-04T06:25:47.508488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:47.514874Z","title":"Rollpacker: Mitigating long-tail rollouts for fast, synchronous rl post-training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:47.514874Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:6dcff17cb045cd90791318163f5c563b5fb6977d3a9283d23b70d1e210a6c741","observation_id":"6dc25872-f2f3-4214-a7fe-0dfde2e71a0a","resolution":{"observed_at":"2026-08-04T06:25:47.514874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:47.520984Z","title":"Enabling parallelism hot switching for efficient training of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:47.520984Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:7c4f1a16b7d2925af0c08947a3d61b1a66abd5dd3ddb98af0c9059c9517c7a29","observation_id":"6a730f45-6758-40d8-a961-4c2314fea167","resolution":{"observed_at":"2026-08-04T06:25:47.520984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-24866-5_27","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Search and score-based waterfall auction optimization","venue":"Lecture notes in computer science","work_id":"7cd62023-3654-4300-8d16-957b364c3bd9","year":2022},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:47.562419Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:75435e8556bc47d90deb68ff9875b94e744a8cc969c17bda871b541982fb6058","observation_id":"5eebe9cf-6b28-48fb-8597-d82a73133610","resolution":{"observed_at":"2026-08-04T06:28:25.768871Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-13T08:22:12.599337Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-04T06:25:47.686864Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:47.686864Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:4246537524a047c84c9665fc7171328fa28005fb18c0f97e5b11dd0e071647ea","observation_id":"b50643ea-e6e5-4f20-be01-0a8656750e66","resolution":{"observed_at":"2026-08-04T06:25:47.686864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18588","last_updated":"2025-08-26T01:42:46Z","snapshot_observed_at":"2026-08-15T22:53:41.767148Z","submitted_at":"2025-08-26T01:42:46Z","title":"History Rhymes: Accelerating LLM Reinforcement Learning with RhymeRL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18588","snapshot_observed_at":"2026-08-04T06:25:47.766365Z","title":"History rhymes: Accelerating llm reinforcement learning with rhymerl, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:47.766365Z"},"links":{"cited_paper":"/paper/2508.18588","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:9a9d066bc88fb9e21f31e3dcdebd1b65d50953f9c223aa2b9f8f7b5af05d2fde","observation_id":"a46dc5c9-5719-4b7b-b5d7-0787bff3f378","resolution":{"observed_at":"2026-08-04T06:25:47.766365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:47.924312Z","title":"Verl recipe: Fully async policy trainer, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:47.924312Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:cad8e5d7ec9988132ba0cc811191bb14cfe3003bc858b0eb134c552eb5e887dc","observation_id":"cfdb1be1-1e9b-42bd-baf7-83a32845d875","resolution":{"observed_at":"2026-08-04T06:25:47.924312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:48.129022Z","title":"Verl recipe: One step off policy async trainer,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:48.129022Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:9c85d7cb9b468e49dea795bbce89934895d25c1d139db1e5f6686f06651c7782","observation_id":"1d2fe562-2015-4b76-b712-e7ba8f7aa53f","resolution":{"observed_at":"2026-08-04T06:25:48.129022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-08-21T13:23:40.871665Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-04T06:25:48.406504Z","title":"Openrlhf: An easy-to-use, scalable and high-performance rlhf framework, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:48.406504Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:1a293cde67917650315d3c526fc3cb0e6e7de5fb01253c53f57006e7897b9eba","observation_id":"e53b63b9-fc9c-4724-8b3f-55c1464a02da","resolution":{"observed_at":"2026-08-04T06:25:48.406504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:48.539167Z","title":"Demystifying nccl: An in-depth analysis of gpu communication protocols and algorithms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:48.539167Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:f0da3dada228401240dc35f548754abbc4d2fb3af5209ce255a3fb740caec756","observation_id":"eb9fcff0-e087-408a-94f2-21c73d46cd85","resolution":{"observed_at":"2026-08-04T06:25:48.539167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:48.677239Z","title":"Qerl: Beyond efficiency – quantization-enhanced reinforcement learning for llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:48.677239Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:cd99830233d1dc9b2241c9f62199ebfccab7011e5a1ecf9848a0e252acebe875","observation_id":"9941557c-3dd0-4160-addf-4dd5e4369839","resolution":{"observed_at":"2026-08-04T06:25:48.677239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:48.849801Z","title":"Le, and Yonghui Chen","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:48.849801Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:2bb1de2c2ec2e3b417a1ef7257574abec406b055aec81dfb69d79f3922e12e14","observation_id":"0e7f2b6d-022e-405e-be6b-acbfa248bba4","resolution":{"observed_at":"2026-08-04T06:25:48.849801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:49.004334Z","title":"System optimizations for enabling training of extreme long sequence transformer models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:49.004334Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:6946f5655ece4dbb175259c2912dc46cde49f8c2eeafebbdc57f0cbf43ecc40b","observation_id":"1ad5ed8c-dd73-47b6-a113-3f07a8738e18","resolution":{"observed_at":"2026-08-04T06:25:49.004334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:49.171345Z","title":"Dynapipe: Optimizing multi-task training through dynamic pipelines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:49.171345Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:91cd489b06c52dbc65dc11ebe284cc3a5703a160e94c7a008337421fced53258","observation_id":"b10af087-2781-4102-9693-97c692522776","resolution":{"observed_at":"2026-08-04T06:25:49.171345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-08-18T16:44:13.851821Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-08-04T06:25:49.318391Z","title":"Dhillon, David Brandfonbrener, and Rishabh Agarwal","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:49.318391Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:b3c54bcfc6c6713faaac3720df205dbb7300cfacfc1fadea592078c0ab33e8e3","observation_id":"60fdfe69-e7a5-42ec-929f-df86bb10a6d7","resolution":{"observed_at":"2026-08-04T06:25:49.318391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09404","last_updated":"2019-04-20T05:11:56Z","snapshot_observed_at":"2026-08-16T05:25:06.726651Z","submitted_at":"2019-04-20T05:11:56Z","title":"Waterfall Bandits: Learning to Sell Ads Online","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09404","snapshot_observed_at":"2026-08-04T06:25:49.508315Z","title":"Muthukrishnan, Zheng Wen, and Yikun Xian","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:49.508315Z"},"links":{"cited_paper":"/paper/1904.09404","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:effad3a2de485bf8ef0af8b38f01096b184af8637de629c1eae6e55d1714f9a0","observation_id":"759b0824-ebb4-4f4c-91be-fca8c99cb1c3","resolution":{"observed_at":"2026-08-04T06:25:49.508315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:49.682524Z","title":"Efficient mem- ory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:49.682524Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:a2533535c7b8e7e95fc3fe6dc577c6aa2f7ff185a3109d6fda66e9cb6730cbfe","observation_id":"9ed6135a-d992-47f3-a2ab-9d8f18e04021","resolution":{"observed_at":"2026-08-04T06:25:49.682524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:49.806586Z","title":"Puzzle: efficiently aligning large language models through light-weight context switch","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:49.806586Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:1cb6bcfa4b6ea8bbe8f1e00f09a63f134b42e62a9721f62f0fe6f5a6d31a470d","observation_id":"b6776c5a-93e5-464a-bd42-290c099a750b","resolution":{"observed_at":"2026-08-04T06:25:49.806586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:49.925465Z","title":"{GS}hard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:49.925465Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:34d31090574b14f2444bfee084ab60eb00fc0a460ce86ddcfec5452b56dab976","observation_id":"971c45f1-5afc-4bae-9e6d-b00f6c7c220c","resolution":{"observed_at":"2026-08-04T06:25:49.925465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:50.012227Z","title":"Fast inference from transform- ers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:50.012227Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:7a330bca65c06b89016c0019c4443320dcedcb2959297f6d73125c5898a1feb3","observation_id":"bdefbd6a-bae6-493f-aeee-3cce72f33190","resolution":{"observed_at":"2026-08-04T06:25:50.012227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:50.100852Z","title":"Hetu v2: A general and scalable deep learning system with hierarchical and heterogeneous single program multiple data annotations,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:50.100852Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:0f21535e31b83b69fd6b88a5c53e296be5c81272a0ab3db1ef7d9ce0992ae0f5","observation_id":"b38a508e-bf0e-42df-b69c-a927050b39e0","resolution":{"observed_at":"2026-08-04T06:25:50.100852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3725322","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Malleus: Straggler-resilient hybrid parallel training of large-scale models via malleable data and model parallelization.Proc","venue":"Proceedings of the ACM on Management of Data","work_id":"475c1614-b58a-4d00-b5d5-ba6d5fddbe56","year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:50.255157Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:19be5cc5dee07c9fe70cf5b18f517d537d0a18057a59925f3d0f8c656a2b5927","observation_id":"42e09a2b-fdf6-4be4-91ec-89f98a815f44","resolution":{"observed_at":"2026-08-04T06:28:25.646537Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:50.348565Z","title":"Hydraulis: Balancing large transformer model training via co-designing parallel strategies and data assignment.Proc","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:50.348565Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:8ae249552754cd1f9b693fee70073b8311789db59ad7ba06e22cd567ef59949b","observation_id":"24802f64-f13b-4f1c-8a60-73b766f0c820","resolution":{"observed_at":"2026-08-04T06:25:50.348565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20490","last_updated":"2026-07-01T15:34:59Z","snapshot_observed_at":"2026-08-23T09:14:53.307512Z","submitted_at":"2025-04-29T07:27:54Z","title":"Hetu v2: A General and Scalable Deep Learning System with Hierarchical and Heterogeneous Single Program Multiple Data Annotations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20490","snapshot_observed_at":"2026-08-04T06:25:50.166691Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:50.166691Z"},"links":{"cited_paper":"/paper/2504.20490","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:49069504a2a72d947034ceba8fc74831450aa6f15c904eaf246582c995319437","observation_id":"4e5f30a5-0322-405c-a3e0-dd3bf5e9586a","resolution":{"observed_at":"2026-08-04T06:25:50.166691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:50.509055Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:50.509055Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:67b358537b1e0a406878d7b0438172a87507952f38a0ed63d980a508ba429f48","observation_id":"562a772b-9e7f-402d-a5e7-21576d326cad","resolution":{"observed_at":"2026-08-04T06:25:50.509055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:50.724092Z","title":"Lobra: Multi-tenant fine-tuning over heterogeneous data.Proc","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:50.724092Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:e5fc9f1b49657e49a9502fb59279e9fc84358d5f9dd7c939ede1893e1dc76e8e","observation_id":"4c74e100-221f-47cc-a6b4-c7d9d0dcc07e","resolution":{"observed_at":"2026-08-04T06:25:50.724092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:50.415563Z","title":"Hotprefix: Hotness-aware kv cache scheduling for efficient prefix sharing in llm inference systems.Proc","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:50.415563Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:12f2d5cb368fdbf2077380b95f5fae4ed7a1307eb2296966448f82b5423e094e","observation_id":"f253949f-05d5-43be-a2bf-d406335d44d2","resolution":{"observed_at":"2026-08-04T06:25:50.415563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:50.889465Z","title":"Ringattention with blockwise trans- formers for near-infinite context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:50.889465Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:a1b755a7671b2c38a0f636fabf3d3f0e92dd11b71d3f4e647dd2d4c71ce912cc","observation_id":"da905cd3-48b8-4494-8335-61b8e644890f","resolution":{"observed_at":"2026-08-04T06:25:50.889465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:50.606722Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:50.606722Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:8078f80f43f9b86e9d870af90a31953ea71c243bf5bfc7142c9ac7e926d70ab5","observation_id":"650fdb5a-4bf4-43ef-8ddd-ce6476a26ee5","resolution":{"observed_at":"2026-08-04T06:25:50.606722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:51.048688Z","title":"Flashrl: 8bit rollouts, full power rl, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:51.048688Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:dc34e37744bbb71121392ac93a2b86987fce4165515143a4d8a0a0a2f48eb114","observation_id":"920e84a1-2abf-46e8-a3ce-4ba31dab7334","resolution":{"observed_at":"2026-08-04T06:25:51.048688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:50.785172Z","title":"Spec-rl: Accelerating on-policy reinforce- ment learning with speculative rollouts, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:50.785172Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:fe23694e4da12c0f48ee9cc08c147fec4f313dd97b156e2f13b5c51210a127c8","observation_id":"854ae4ba-1565-41a9-88c3-8bfcbaff2279","resolution":{"observed_at":"2026-08-04T06:25:50.785172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:51.207314Z","title":"Deepcoder: A fully open-source 14b coder at o3- mini level, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:51.207314Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:ad2c7e9817893c9c16a4fa228eb61a28101399333e324974df43d07cbaeb5cfe","observation_id":"4562a217-4d99-4aab-ba01-2804c3aa3179","resolution":{"observed_at":"2026-08-04T06:25:51.207314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:50.976916Z","title":"When speed kills stability: Demystifying rl collapse from the inference- training mismatch, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:50.976916Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:478d31f65ccd24ebcadb18ae6db8ff7e85f6b5261d254b9fa3384b3656f9d76f","observation_id":"13681cab-9ead-46f5-9a41-d593f8293177","resolution":{"observed_at":"2026-08-04T06:25:50.976916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.14778/3570690","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:28:25.352865Z","title":"Galvatron: Efficient transformer training over multiple gpus using automatic parallelism.Proc","venue":null,"work_id":"1f4e6768-80c5-4d33-85ca-20996ff62720","year":2022},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:51.364088Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:9ccdfeccb02a1c248036fe2ff3b8dadd9393d20e8f7c53a82cd561fd351acb86","observation_id":"8f33d82f-ada1-4c8e-a12b-351bb4ddaf7a","resolution":{"observed_at":"2026-08-04T06:28:25.468395Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:51.130997Z","title":"Part ii: Roll flash – accelerating rlvr and agentic training with asynchrony, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:51.130997Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:206422d739caf6ed3953571f872a2da770b76bcf75eb7628de10a332b7e11066","observation_id":"d6481e17-341b-4ad4-8d04-d40f5bc6e55f","resolution":{"observed_at":"2026-08-04T06:25:51.130997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:51.491354Z","title":"Devanur, Gregory R","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:51.491354Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:c4ca8f7da27d7f281508b5e98e32517c5b2c9addd2506c9ee43ae3ae49034db1","observation_id":"96516336-859e-4d2d-9fca-43c12dca1d7b","resolution":{"observed_at":"2026-08-04T06:25:51.491354Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:51.286478Z","title":"Real: Efficient RLHF training of large language models with parameter reallocation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:51.286478Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:90cada3bab5d5032a4d75cdab5aeae2014a019b46d8222d36d8a2fc1cd12af79","observation_id":"82e09f00-0196-4482-8a9a-f59041cd9a3a","resolution":{"observed_at":"2026-08-04T06:25:51.286478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18252","last_updated":"2025-04-26T08:33:32Z","snapshot_observed_at":"2026-08-16T14:31:19.921863Z","submitted_at":"2024-10-23T19:59:50Z","title":"Asynchronous RLHF: Faster and More Efficient Off-Policy RL for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18252","snapshot_observed_at":"2026-08-04T06:25:51.694220Z","title":"Asynchronous rlhf: Faster and more efficient off-policy rl for language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:51.694220Z"},"links":{"cited_paper":"/paper/2410.18252","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:0116dc18a081c7de750e7b6355c02921c83b31b6f81bdb0958d20c96b38aa236","observation_id":"29d17927-1ebc-4160-a6e4-eacac569bc0b","resolution":{"observed_at":"2026-08-04T06:25:51.694220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:51.422548Z","title":"A comprehensive survey of mixture-of-experts: Algo- rithms, theory, and applications, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:51.422548Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:eeac78c6e9e114a1472ae33a9d345be7f1225a2ebbfebca583d808c5836dd426","observation_id":"412432b0-32ad-419b-b4b4-7f8657f4e42d","resolution":{"observed_at":"2026-08-04T06:25:51.422548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:51.842717Z","title":"Nvidia inference xfer library (nixl), 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:51.842717Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:e317cf31bee337d31130cb66d0797890163d3ec301396f57be031000880296f6","observation_id":"cbcafe16-774f-4030-a824-b49b56b8e2e4","resolution":{"observed_at":"2026-08-04T06:25:51.842717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:51.562805Z","title":"Effi- cient large-scale language model training on gpu clusters using megatron-lm","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:51.562805Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:92a4b42ee2f4d5be75624243e1b3be078bc80a572c2d2298048ef04c1a13d618","observation_id":"cd67b4a5-c2d9-4d92-8846-b060a70a52be","resolution":{"observed_at":"2026-08-04T06:25:51.562805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:52.126406Z","title":"Unified communication x, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:52.126406Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:c40676bb84dbcb7d182e88b9df994140bfa8efa350c9ef738eed6d2073e28571","observation_id":"3e190654-6ff3-499f-9558-835da6982878","resolution":{"observed_at":"2026-08-04T06:25:52.126406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:51.767667Z","title":"Nvidia collective communication library (nccl) documentation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:51.767667Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:2e5b886bb0204b5129a95e49c75c4641405523ce4d31c9ae9068b36353a70953","observation_id":"4c1d3651-d1eb-47b4-b34e-246125ea5d41","resolution":{"observed_at":"2026-08-04T06:25:51.767667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14617","last_updated":"2026-04-03T12:47:37Z","snapshot_observed_at":"2026-08-20T12:38:06.758101Z","submitted_at":"2025-11-18T16:12:21Z","title":"Seer: Online Context Learning for Fast Synchronous LLM Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14617","snapshot_observed_at":"2026-08-04T06:25:52.278491Z","title":"Seer: Online context learning for fast synchronous llm reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:52.278491Z"},"links":{"cited_paper":"/paper/2511.14617","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:ab5f8a8135ff54815a8c2d8701e8714903f4fca83a1c741165e31a571fc48647","observation_id":"2db48e94-488e-49d9-9b9f-5b2deaf7f653","resolution":{"observed_at":"2026-08-04T06:25:52.278491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:51.950676Z","title":"Openai o1 system card,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:51.950676Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:4593ea569c5f6473c57ad75f02fd09b9c9add197837abe75e03784f8efabc822","observation_id":"eddd806c-6695-4a0f-96ee-c77cc7de796b","resolution":{"observed_at":"2026-08-04T06:25:51.950676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-04T06:25:52.052018Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:52.052018Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:95296e627f87d759fc92942e793687e31f1f6d263b3dd98f3bcf315dfce0daf2","observation_id":"cac33af7-6f70-45f9-936c-7400690331c7","resolution":{"observed_at":"2026-08-04T06:25:52.052018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:52.582254Z","title":"Rosberg and I","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:52.582254Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:9fc6cf12a624f136f5609a8f37d8a29ea3b64efcaec263a899c9e630a2c06101","observation_id":"f84817e8-d325-4fd4-82d0-f84b5d17d5c5","resolution":{"observed_at":"2026-08-04T06:25:52.582254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:52.209334Z","title":"Multi-step reasoning with large language models, a survey.ACM Comput","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:52.209334Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:8115059da2878d35837388120b64349dfa483379711d29a946213fe7b76490f9","observation_id":"9b11963d-20af-4e91-87d2-9c703e6a8a05","resolution":{"observed_at":"2026-08-04T06:25:52.209334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T06:25:52.769791Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:52.769791Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:9430e4bdefae725e6c06233a860fa3e691a271d2dd4edda3343d0acfa29610d4","observation_id":"84380506-18cc-4997-8e56-5b6a75f96676","resolution":{"observed_at":"2026-08-04T06:25:52.769791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:52.382715Z","title":"Qwen2.5 technical report,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:52.382715Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:4a73e77cec07edb36018b0e56f00addc6eb8a5fdc28c98ea20ec8b7209196b69","observation_id":"b0dba959-26dd-4795-9aba-fde77b0fd286","resolution":{"observed_at":"2026-08-04T06:25:52.382715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-04T06:25:52.466334Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:52.466334Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:3860b500b38a9a17b9453ccbdf145bffc4f7835299dcb19132785131404c8f04","observation_id":"b00ef343-ed7e-4553-bf8f-68de283ebfeb","resolution":{"observed_at":"2026-08-04T06:25:52.466334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-04T06:25:52.512470Z","title":"Zero: Memory optimizations toward training trillion parameter models, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:52.512470Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:350fc70264ccd962dce82ae3463adc2be56988b252b02ea5c80498ccb44dcd23","observation_id":"61360b29-568e-4bbf-83af-e58566a5617d","resolution":{"observed_at":"2026-08-04T06:25:52.512470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:53.226125Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:53.226125Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:1453afca60d15f82c2ccdc16dd29b4b033cbad63f03bf8d5fa2366ea325aa969","observation_id":"0c014a9e-22d8-49ff-9bbb-972a2e8c9436","resolution":{"observed_at":"2026-08-04T06:25:53.226125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:52.665305Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:52.665305Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:0061d47de836739216fabd69d8b9b099ca7ef638ba375007972d920b366c0b06","observation_id":"6ff19108-eee3-4297-a4dd-95b62144ea25","resolution":{"observed_at":"2026-08-04T06:25:52.665305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25300","last_updated":"2026-04-17T17:19:41Z","snapshot_observed_at":"2026-08-18T01:41:44.518147Z","submitted_at":"2025-09-29T17:10:35Z","title":"Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.25300","snapshot_observed_at":"2026-08-04T06:25:53.415049Z","title":"Scaling behaviors of llm reinforcement learning post-training: An empirical study in mathematical reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:53.415049Z"},"links":{"cited_paper":"/paper/2509.25300","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:bc860c381930996ed6537f1c597c571a241fac95011676ae11dac4231482096d","observation_id":"79d20292-6995-4f4a-918c-5155b8232b6f","resolution":{"observed_at":"2026-08-04T06:25:53.415049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:52.897121Z","title":"Beat the long tail: Distribution-aware speculative decoding for rl training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:52.897121Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:9249ed5ee1e0d46f32f69dc20d6ba57737d892fc27d68c0ec46b7dfcabed92da","observation_id":"e695934d-434f-4b28-a7b5-a0305e3a12f5","resolution":{"observed_at":"2026-08-04T06:25:52.897121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T06:25:52.994986Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:52.994986Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:1870b11df0c89fd6cf30f2cc899895794960fc51c142c8164a53e4baeef8b3dc","observation_id":"955ac5a8-e82a-44c4-b9c0-288a9f769fd6","resolution":{"observed_at":"2026-08-04T06:25:52.994986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:53.075946Z","title":"Laminar: A scalable asynchronous rl post-training framework, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:53.075946Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:d1c3bc92e039d6c0bffb8bb1030d1f58e33e9e3c96f55b856c8f76f19b533954","observation_id":"07b5031f-76a9-4ff2-908e-fb6a77d7e4ae","resolution":{"observed_at":"2026-08-04T06:25:53.075946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:53.844641Z","title":"A survey on large language models for mathematical reasoning.ACM Comput","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:53.844641Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:0e6fc02c66f7e19770087e16949fb9f4f7c6878926464a7212d9e1e38c94e386","observation_id":"d97d48ad-1e62-438c-90d9-480af97718d7","resolution":{"observed_at":"2026-08-04T06:25:53.844641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-04T06:25:53.315719Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:53.315719Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:4b7b590acca436d74d8ff8497c3d2476d72dedc60ec313046617f6ccd8b78b90","observation_id":"4612ab4b-409e-436f-918f-638a801a6d25","resolution":{"observed_at":"2026-08-04T06:25:53.315719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:54.057071Z","title":"Improving automatic parallel training via balanced memory workload optimization.IEEE Transactions on Knowledge and Data Engineering, August 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:54.057071Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:86209ee86ff9374ff6f43ecdd535ff02188cc3df44d194fb2080fcdfef227f42","observation_id":"50fb9431-bd93-4066-b33a-9e69d465bb74","resolution":{"observed_at":"2026-08-04T06:25:54.057071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-08-16T14:37:33.548231Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-04T06:25:53.541884Z","title":"Kimi k2: Open agentic intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:53.541884Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:cb6000f2f6b0c808ea27087dc0091b1e454d8bf4ea97130b928cea21561d7bbb","observation_id":"28c2d01e-1ce4-4c4e-b6e8-1786e2da8467","resolution":{"observed_at":"2026-08-04T06:25:53.541884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-04T06:25:53.654690Z","title":"Kimi k1.5: Scaling reinforcement learning with llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:53.654690Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:cb6f39644f5f31af21761e5215844fd96d0e80ec9546881101b4153a60f856ab","observation_id":"d5bdd606-2987-4e21-b619-42fbc18bb306","resolution":{"observed_at":"2026-08-04T06:25:53.654690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:53.746745Z","title":"Tokdar and Robert E","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:53.746745Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:1f6c31fa4eafa733d687780dea8fe5deb1292d4afebd7503df5e4cfb6846edc1","observation_id":"17f4edf4-c35e-4fa6-8617-3f4c431f76c1","resolution":{"observed_at":"2026-08-04T06:25:53.746745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:54.456232Z","title":"Loongserve: Efficiently serving long-context large language models with elastic sequence parallelism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:54.456232Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:07a8d01ade599e80195ad8e27929a031c6fe8da45b725e95ac6daaff73930a69","observation_id":"2ad77e30-4bf1-42a9-8208-ebeed40cd770","resolution":{"observed_at":"2026-08-04T06:25:54.456232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-13T17:30:05.303052Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-08-04T06:25:53.985066Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:53.985066Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:ccaa3c36ea02e0d54872485c500bfa59c2ec974577cc6c78c61d65da867884fd","observation_id":"1acb3228-e099-4eb7-9fee-cabf3f8bd5a7","resolution":{"observed_at":"2026-08-04T06:25:53.985066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11819","last_updated":"2024-10-14T11:57:00Z","snapshot_observed_at":"2026-08-17T11:52:32.799179Z","submitted_at":"2023-12-19T03:24:55Z","title":"An Adaptive Placement and Parallelism Framework for Accelerating RLHF Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11819","snapshot_observed_at":"2026-08-04T06:25:54.634282Z","title":"An adaptive placement and parallelism framework for accelerating rlhf training, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:54.634282Z"},"links":{"cited_paper":"/paper/2312.11819","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:5e49816901db4c184075e378a127137cd1c44d28e18fc74c8cfb61cd7d5980bf","observation_id":"1ea59b38-0d3e-4802-8a51-36cf7a286158","resolution":{"observed_at":"2026-08-04T06:25:54.634282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:54.151703Z","title":"Flexsp: Accelerating large language model training via flexible sequence parallelism","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:54.151703Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:9a2ed3c8e4d2107ad3a3576a653436a3edaef585814bd22b2660f51729b14a96","observation_id":"2a1928ea-f039-40a9-85ac-a0841bbe5f13","resolution":{"observed_at":"2026-08-04T06:25:54.151703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-15T06:47:01.322120Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-04T06:25:54.268990Z","title":"Re- inforcement learning with verifiable rewards implicitly incentivizes correct reasoning in base llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:54.268990Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:90e8013e53e20823f3dc60f0eae0b3f3da8be6b6c748e1bf35f0c8b834ef381c","observation_id":"0fca62d3-9fac-4363-924b-df5ea3a77cc7","resolution":{"observed_at":"2026-08-04T06:25:54.268990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3771738","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The multiqueue: A simple and fast relaxed concurrent priority queue.ACM Trans","venue":"ACM Transactions on Parallel Computing","work_id":"7b804cfa-e969-423c-a155-c34b6c610d5e","year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:54.359978Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:65245fd7ee81fbf2193d7aff6626988e0861045ca7815e6165ad0fef8765072b","observation_id":"e4c14c07-922f-412e-ac39-730f9a9a07cc","resolution":{"observed_at":"2026-08-04T06:28:25.315086Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:54.987759Z","title":"Flashinfer: Efficient and customizable attention engine for LLM inference serving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:54.987759Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:a21a179970862ec99b62468e4a00925f8f0042538c84be46fcfd8fe2f28ac3b6","observation_id":"eec37935-3da4-49bb-a1f5-921389fd9f31","resolution":{"observed_at":"2026-08-04T06:25:54.987759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-13T20:34:22.010534Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24034","snapshot_observed_at":"2026-08-04T06:25:54.516468Z","title":"Llamarl: A distributed asynchronous reinforcement learning framework for efficient large-scale llm training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:54.516468Z"},"links":{"cited_paper":"/paper/2505.24034","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:bb7e131ef28044b75ad6e79c22fe4ac8215b7860d5771c149efea9a2143a423d","observation_id":"4e20ecf2-a14a-4eec-9edc-ab8728858d75","resolution":{"observed_at":"2026-08-04T06:25:54.516468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:55.133042Z","title":"Does reinforcement learning really incentivize reasoning capacity in LLMs beyond the base model? In2nd AI for Math Workshop @ ICML 2025, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:55.133042Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:63c435453ef7a36d3af982e9624b5edd009682f0ee62273fbc46ab14c7b1a4b4","observation_id":"5835fd35-7ffa-4c75-9c17-5d29d42d2d18","resolution":{"observed_at":"2026-08-04T06:25:55.133042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T06:25:54.718668Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:54.718668Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:b616aaf8d89b21e76fdf067517adc49c92641c78604c9d9468a1d2c9ba0990b8","observation_id":"02adb91b-d507-43bf-aba5-8937b5c69b74","resolution":{"observed_at":"2026-08-04T06:25:54.718668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:54.811385Z","title":"Survey on knowledge distillation for large language models: Methods, evaluation, and application.ACM Trans","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:54.811385Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:9e117cf5260d37696ce6fc944e972becf0a245c4dc2bc4e229ce8ff5472c0ca1","observation_id":"4fbb9027-e47f-40b2-bf72-933a041c3656","resolution":{"observed_at":"2026-08-04T06:25:54.811385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:54.901122Z","title":"Your efficient rl framework secretly brings you off-policy rl training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:54.901122Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:b9bc45ba1fc84ddbad38699c24c0576c61ca13464c78e5210c3fa7e5bcb98e7f","observation_id":"78a1a2b6-cff0-4e93-9370-d5d938d93c0c","resolution":{"observed_at":"2026-08-04T06:25:54.901122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:55.483112Z","title":"Small leak can sink a great ship–boost rl training on moe with icepop!, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:55.483112Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:0d67c9371fccdca2b7c7e7fc447b4b54cc6de2d1696e5f1921be8f8f6f0e92fd","observation_id":"6811364e-e69c-4297-bf0e-ee924a2a275b","resolution":{"observed_at":"2026-08-04T06:25:55.483112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-04T06:25:55.044439Z","title":"Dapo: An open- source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:55.044439Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:207f2d3e693555ca8af5305dda106ce8ee67e5f918f3b90622ced9803509989a","observation_id":"bdd10f48-5fa4-4737-a8bd-bbd3f600476f","resolution":{"observed_at":"2026-08-04T06:25:55.044439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:55.712023Z","title":"Stabilizing reinforcement learning with llms: Formulation and practices, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:55.712023Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:1d1d49ee5ee43bae7c72dcd3e69309c890ebfd2ef63391a5b22cb91655022029","observation_id":"425d4484-cecb-4b70-9866-6173253b653c","resolution":{"observed_at":"2026-08-04T06:25:55.712023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:55.249282Z","title":"Pqcache: Product quantization-based kvcache for long context llm inference.Proc","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:55.249282Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:273e9180772b5773b8f816689c9e316164895603bb3db195e3b85579af836d98","observation_id":"243bd583-69b6-4d5b-b20a-d6b730dd79ba","resolution":{"observed_at":"2026-08-04T06:25:55.249282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08827","snapshot_observed_at":"2026-08-04T06:25:55.329841Z","title":"A survey of reinforcement learning for large reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:55.329841Z"},"links":{"cited_paper":"/paper/2509.08827","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:fc2b371ed3ce7961c6adee314a15b1c0e812d5536c7159d903f958e7447d22a5","observation_id":"b0f89fda-f521-49ad-a589-cecfaddff8b7","resolution":{"observed_at":"2026-08-04T06:25:55.329841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:55.423450Z","title":"SortedRL: Accelerating RL training for LLMs through online length-aware scheduling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:55.423450Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:bbe72e1d0704e66a7fca74f6943b6512786009cad445042ee41fe345707b51bc","observation_id":"9bfca4bf-a9f5-4f54-8a30-aea5556b1d13","resolution":{"observed_at":"2026-08-04T06:25:55.423450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:56.071060Z","title":"Distserve: disaggregating prefill and decoding for goodput-optimized large language model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:56.071060Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:a63a68f114a80d15bfaa001a922ad7ae2372b9a03d183e98c72eef1bee0bcd02","observation_id":"8449252e-88cc-4f8c-a898-5018835a4ac2","resolution":{"observed_at":"2026-08-04T06:25:56.071060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.14778/3611540.3","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:28:25.061363Z","title":"Pytorch fsdp: Experiences on scaling fully sharded data parallel.Proc","venue":null,"work_id":"0892a617-ae05-4dea-8ffa-b9fde647c789","year":2023},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:55.629911Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:6e04a998c0f21c4d2eab8b757ecb8657860a5d9cf5441dcb258cb35724d8b096","observation_id":"38a0cd2c-1b2a-4242-823b-8d1da3555989","resolution":{"observed_at":"2026-08-04T06:28:25.140551Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:56.265063Z","title":"Optimizing rlhf training for large language models with stage fusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:56.265063Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:32c313f3be19b9269209fc01e24018853e9b4ad529a53fd0f6b9401911e60498","observation_id":"c447d8ad-1637-49c6-8bfc-04edd57a3944","resolution":{"observed_at":"2026-08-04T06:25:56.265063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-21T02:04:30.074424Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-04T06:25:55.821502Z","title":"Group sequence policy optimization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:55.821502Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:8cd4ea1928c3a4c1bd50becbbf5c5f9a0a448daffbab248ddda9c4a916554c86","observation_id":"5f7de689-6ae7-496a-a0ec-3fba33b4d0e7","resolution":{"observed_at":"2026-08-04T06:25:55.821502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:55.909032Z","title":"Prosperity before collapse: How far can off-policy rl reach with stale data on llms?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:55.909032Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:e27369428d7e086a6fd7eedd1c6890a8757cc1836f885e8cb9f2a0cd036b1f13","observation_id":"e76a52d9-9bc9-4be7-b84f-d0dd6b5f1783","resolution":{"observed_at":"2026-08-04T06:25:55.909032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:55.987217Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:55.987217Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:7a5e789a30d773d5da925c2a71c57bd809be5e829e1e437e3381c7d01c673e06","observation_id":"5fc58b4c-c25b-4b5f-90bd-1a1a04a51e7e","resolution":{"observed_at":"2026-08-04T06:25:55.987217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15930","last_updated":"2025-04-22T14:19:06Z","snapshot_observed_at":"2026-08-20T01:49:19.844891Z","submitted_at":"2025-04-22T14:19:06Z","title":"StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15930","snapshot_observed_at":"2026-08-04T06:25:56.161461Z","title":"Streamrl: Scalable, heterogeneous, and elastic rl for llms with disaggregated stream generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:56.161461Z"},"links":{"cited_paper":"/paper/2504.15930","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:7ff34a86cf89513243b6739c05179cd044bcf4999bd4a7e9b20ef7bcdfc565c0","observation_id":"940e6faa-2206-42ea-b86d-21bf3ee3ce7c","resolution":{"observed_at":"2026-08-04T06:25:56.161461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:25:56.310135Z","title":"April: Active partial rollouts in reinforcement learning to tame long-tail generation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:56.310135Z"},"links":{"citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:cdfaebf2f906f28a023d88da933812d3b9ab630e62d1220251a9b5894f0ea2e6","observation_id":"227b2cd2-da42-4d57-82fe-30fc210e4840","resolution":{"observed_at":"2026-08-04T06:25:56.310135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","latest_version":2,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":94,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":103},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 100 of 103 outbound references and 1 inbound Pith citation observation for arXiv:2601.12784."}