{"as_of":"2026-08-05T01:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3069588e0df002f4b836180591572bfa2318ffaabd5b6eb9b9dd0ff71e442413","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T14:36:34.322864Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.18722/citation-record","integrity":"/paper/2607.18722/integrity","json":"/paper/2607.18722/citation-record.json","paper":"/paper/2607.18722"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:36:31.831428Z","title":"Staleness in fully asynchronous RL.https://appliedcompute","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-01T14:36:30.262194Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:31.831428Z"},"links":{"citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:f909c417836551892ff173a753af9731758ccdb0030f12a2be80a01571fb5a42","observation_id":"e6413e05-596f-4d37-be35-57411ae27a57","resolution":{"observed_at":"2026-08-01T14:36:31.831428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-07-06T22:39:08.850289Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-08-01T14:36:31.937887Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-01T14:36:30.262194Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:31.937887Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:32be9917f5f72fe76e67563d642b34fda21ab6a199e62bcee16aadecf11ee17c","observation_id":"b6cb9c57-9e63-4c53-bf68-528e5929e1b8","resolution":{"observed_at":"2026-08-01T14:36:31.937887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:36:32.058621Z","title":"Kpop: Taming training–inference mismatch in reinforcement learning with adaptive masking regions, May 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-01T14:36:30.262194Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:32.058621Z"},"links":{"citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:aaa957d761c4cf589b93c7b4ea6cdda708369b28d04d5b4eea3d62838c6e9264","observation_id":"b8b5cc90-592b-426c-b6ce-460b27712920","resolution":{"observed_at":"2026-08-01T14:36:32.058621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.07508","last_updated":"2026-07-08T15:02:19Z","snapshot_observed_at":"2026-07-11T23:20:10.575456Z","submitted_at":"2026-07-08T15:02:19Z","title":"Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.07508","snapshot_observed_at":"2026-08-01T14:36:32.203143Z","title":"Single-rollout asynchronous optimization for agentic reinforcement learning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-01T14:36:30.262194Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:32.203143Z"},"links":{"cited_paper":"/paper/2607.07508","citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:440dea7c1a6b76627e19d22234632d5f23700a4d6513ef6b71a3a7942821c728","observation_id":"884b4557-7dad-476e-b828-55a4aa438cee","resolution":{"observed_at":"2026-08-01T14:36:32.203143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:36:32.304147Z","title":"Stabilizing rlvr via token-level gradient diagnosis and layerwise clipping, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-01T14:36:30.262194Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:32.304147Z"},"links":{"citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:40f2adb821262b706e439ccf85cd860c574c2adb829a8f08ef00948283190a35","observation_id":"64398b4c-f0f4-4f83-89fe-d0e1a2fdda98","resolution":{"observed_at":"2026-08-01T14:36:32.304147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:36:32.449198Z","title":"Approximately optimal approximate reinforcement learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-01T14:36:30.262194Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:32.449198Z"},"links":{"citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:56d3a88362fdaf39f6c32aeedbd11fd40d47ef7868423498555fdcff8b701fa2","observation_id":"a46f3cb1-3564-4238-98fa-791a20249e55","resolution":{"observed_at":"2026-08-01T14:36:32.449198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:36:32.634733Z","title":"Stabilizing MoE reinforcement learning by aligning training and inference routers.arXiv preprint arXiv:2510.11370, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-01T14:36:30.262194Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:32.634733Z"},"links":{"citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:4830725282721b43535d6692ceea660890b6b1d680cfe9a0b7d1384bb5d5cfc1","observation_id":"2cae68bc-4ccf-4684-b76f-fa09566df595","resolution":{"observed_at":"2026-08-01T14:36:32.634733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:36:32.845639Z","title":"Rethinking the trust region in LLM reinforcement learning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-01T14:36:30.262194Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:32.845639Z"},"links":{"citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:7b6716b9fc38759f61926449958203c7d5275c42855aadbe1109af72cfef45fe","observation_id":"3c811da1-d109-4b48-9278-e72bb60c6bfb","resolution":{"observed_at":"2026-08-01T14:36:32.845639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-07-06T04:09:39.172428Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-01T14:36:32.958394Z","title":"Jordan, and Pieter Abbeel","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-01T14:36:30.262194Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:32.958394Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:506c1be2acc3ea6d54bcbe5c5bb4dfa3a08c9da0375c97cfab93bec136a9fed3","observation_id":"738ca189-9408-4045-8f74-1be796585e9f","resolution":{"observed_at":"2026-08-01T14:36:32.958394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-01T14:36:33.084469Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-01T14:36:30.262194Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:33.084469Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:7bec03ef7406913c1cbd38d9d794cd315c9fe3c88d12aadaba98f431bfb1fd3b","observation_id":"beec5b53-d5e2-4e73-ba9e-d12b235f85f8","resolution":{"observed_at":"2026-08-01T14:36:33.084469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T14:36:33.192530Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-01T14:36:30.262194Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:33.192530Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:5d4be40c337f80cfb6b5b2a5cf8475a80c39572f3f3e917ab141a2f26b418136","observation_id":"0d9e1a7f-c816-4895-ab79-cb4bbabb0842","resolution":{"observed_at":"2026-08-01T14:36:33.192530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-01T14:36:33.391991Z","title":"Megatron-LM: Training multi-billion parameter language models using model parallelism.arXiv preprint arXiv:1909.08053, 2019","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-01T14:36:30.262194Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:33.391991Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:95a5370467930da24ac80f54f825ffa419264031e17640e587afe86241976b7c","observation_id":"be9955a2-bf4f-4a54-a983-4bc8373cd7d4","resolution":{"observed_at":"2026-08-01T14:36:33.391991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T14:36:33.544666Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-01T14:36:30.262194Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:33.544666Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:aaeb5c7a746439cbcced0d95bfc88ebbb655cae1834ac8de8705883c5e2b2a0d","observation_id":"5d1bd3b8-31c6-4612-af43-5d8203e0db37","resolution":{"observed_at":"2026-08-01T14:36:33.544666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09821","last_updated":"2026-06-08T17:58:23Z","snapshot_observed_at":"2026-08-04T00:33:50.765601Z","submitted_at":"2026-06-08T17:58:23Z","title":"Rethinking the Divergence Regularization in LLM RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09821","snapshot_observed_at":"2026-08-01T14:36:33.642069Z","title":"Rethinking the divergence regularization in llm rl.arXiv preprint arXiv:2606.09821, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-01T14:36:30.262194Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:33.642069Z"},"links":{"cited_paper":"/paper/2606.09821","citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:31872f5fb8e61d2d74864ab302d23bcf1f70faa89fac3a21cc829b19359500d6","observation_id":"b288e0a7-fbd5-4981-9ec2-f356ff9bcba6","resolution":{"observed_at":"2026-08-01T14:36:33.642069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:36:33.791105Z","title":"DAPO: An open-source LLM reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-01T14:36:30.262194Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:33.791105Z"},"links":{"citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:2dbf5a9654f184820562b1f84450ec8d7358f71cf8ce13a8c108aa63735d8545","observation_id":"2da0c69c-9f37-48ac-9d82-5b7cfe2ab2e5","resolution":{"observed_at":"2026-08-01T14:36:33.791105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:36:33.909133Z","title":"Small leak can sink a great ship–boost rl training on moe with icepop!, Sep 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-01T14:36:30.262194Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:33.909133Z"},"links":{"citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:2366a16048386183dc4f3e52da88cb76363a8cead86cc52040243bbfdfe96a75","observation_id":"1e6148d5-599a-405e-8982-b49caa7c7880","resolution":{"observed_at":"2026-08-01T14:36:33.909133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:36:33.995325Z","title":"Stabilizing reinforcement learning with llms: Formulation and practices, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-01T14:36:30.262194Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:33.995325Z"},"links":{"citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:39b9d2756e98ab0c189a57748492d491e968099dc58035d4fa0589dc51fa2342","observation_id":"12399fa0-bf49-48f4-9c37-add1d4c02137","resolution":{"observed_at":"2026-08-01T14:36:33.995325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-01T14:36:34.082604Z","title":"Group sequence policy optimization.arXiv preprint arXiv:2507.18071, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-01T14:36:30.262194Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:34.082604Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:6ff1fd8ae91bc9bd8c9769957d0fe3586a1fecee48c76e36d93848e66529bc1f","observation_id":"21e3219c-4068-4cba-a11e-089608d7fb36","resolution":{"observed_at":"2026-08-01T14:36:34.082604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-01T14:36:34.155714Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-01T14:36:30.262194Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:34.155714Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:39a869492b67090d221bff36df644ea3cb7f3ddc37238983db5a5935c11a4810","observation_id":"b8d1cb8a-44e8-445d-8086-f3b1bc2763ca","resolution":{"observed_at":"2026-08-01T14:36:34.155714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:36:34.238953Z","title":"X yt µ(yt |s t) π(yt |s t) µ(yt |s t) −1 # = 2ξ TX t=1 Est∼µ h 2DTV(µ(· |st)∥π(· |st)) i = 4ξE y∼µ","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-01T14:36:30.262194Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:34.238953Z"},"links":{"citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:7ca5c2ef57a4e7e19a821c3a406df6ac4fc70f5c78933d9b34ac13484e3bdde0","observation_id":"b3d1f6f7-a2c5-44b6-a836-00045af49020","resolution":{"observed_at":"2026-08-01T14:36:34.238953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:36:34.322864Z","title":"This is consistent with a sampledDTV gate improving stability on the reported stack, but it does not explain the remaining gap toSAT-GSPO w/ R3 or even toSAT-GRPO w/ R3","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-01T14:36:30.262194Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:34.322864Z"},"links":{"citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:1fe93347bcaa851317623c99e330cd13d27c2b28ca3bf5da11ca9fa001b25247","observation_id":"fd5ebb47-0db7-44c1-b13d-b11f3608725d","resolution":{"observed_at":"2026-08-01T14:36:34.322864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-01T14:36:30.262194Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2607.18722."}