{"as_of":"2026-08-05T20:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:98672e1f25954ac35de90d9f65eeae0f41ad501d2f386fc1fe42531199883b16","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:23:30.344213Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.10481/citation-record","integrity":"/paper/2607.10481/integrity","json":"/paper/2607.10481/citation-record.json","paper":"/paper/2607.10481"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-02T07:23:23.928177Z","title":"arXiv preprint arXiv:2412.16720 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:23.928177Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:3643b426849327db33f21380da8f0f28f5e26089220623bf4cd55ad646a95b35","observation_id":"0e4e57c1-b755-49ca-a60a-fa13eeb3b440","resolution":{"observed_at":"2026-08-02T07:23:23.928177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:24.006590Z","title":"Nature , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.006590Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:11dd8454239892cdd371e339d58c3261f6e6a1e3f7c2e40936e07d47f64751dc","observation_id":"450c0916-6b95-4f93-9157-9fdf49aee130","resolution":{"observed_at":"2026-08-02T07:23:24.006590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-07-31T23:49:25.878472Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-02T07:23:24.088146Z","title":"2: Pushing the frontier of open large language models , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.088146Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:ab1b94b471865d2fc8c52db457a133e0fd3006b9aa47450b70fa805ffd4cd220","observation_id":"e10c48c1-b611-4d29-88b3-ecf63eb507da","resolution":{"observed_at":"2026-08-02T07:23:24.088146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-02T07:23:24.173789Z","title":"arXiv preprint arXiv:2507.06261 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.173789Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:8997dab75f25f4e8e3a661b8228598ba142a34550e635a25ef69913d89eccb01","observation_id":"b2340d31-664f-444e-90bb-5f6515277157","resolution":{"observed_at":"2026-08-02T07:23:24.173789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T07:23:24.240938Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.240938Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:32c1a6948761d73e16c8b0a767375706648fbec4d8fea945f6904922ca40c978","observation_id":"64a91aa6-9641-4b7c-8eed-7f521c90c960","resolution":{"observed_at":"2026-08-02T07:23:24.240938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-02T07:23:24.296105Z","title":"5: Scaling reinforcement learning with llms , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.296105Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:c4de14445f076abf3319ba9ffccb5100792c3f988ae60a8816a9f877b76f6672","observation_id":"360b6a8f-6196-442f-b298-6d016242c44c","resolution":{"observed_at":"2026-08-02T07:23:24.296105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:24.367087Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.367087Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:f8b84a1ac5c1c16b71e4d46bc2b1d21159c24ed8d568f29862c1565ffa91d438","observation_id":"e7e73dca-5877-4ff9-be43-1fb21fe231ba","resolution":{"observed_at":"2026-08-02T07:23:24.367087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-02T07:23:24.456293Z","title":"arXiv preprint arXiv:2411.15124 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.456293Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:ecacd511142d6a05e27e652be5ab890859a5a7020fc1ebde37b2d19e7bfc6b78","observation_id":"104fd3d2-3d38-4978-896d-7c756d512d2f","resolution":{"observed_at":"2026-08-02T07:23:24.456293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-02T07:23:24.544737Z","title":"arXiv preprint arXiv:2503.24290 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.544737Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:8f0849c2da935a45250e52a14ea1c868990e606c53c941656e737b37ffa05ac7","observation_id":"ac960a03-5beb-4333-ae8a-a92078c66deb","resolution":{"observed_at":"2026-08-02T07:23:24.544737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T07:23:24.608784Z","title":"arXiv preprint arXiv:1707.06347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.608784Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:2505edaba66e6dfd17371d018c49934ed421d66a16765d9bc5244cd5dbc763ce","observation_id":"cd2cf552-6097-47ec-87ef-e3049d793cd4","resolution":{"observed_at":"2026-08-02T07:23:24.608784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:24.718817Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.718817Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:e554f49dbea9fe6b3a7909fa608f63e0f1cb1a908ceaa7f9c9aaaf30470645db","observation_id":"986de566-4ebb-4d99-add4-7fd0c747c883","resolution":{"observed_at":"2026-08-02T07:23:24.718817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-02T07:23:24.802584Z","title":"arXiv preprint arXiv:1506.02438 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.802584Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:147a7eda037bafb59feea29a55e96f003f2c15677608f623d00d2f2428daef86","observation_id":"1def997a-e4da-48fa-b1cd-a2048e2d81e7","resolution":{"observed_at":"2026-08-02T07:23:24.802584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T07:23:24.906088Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.906088Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:732f3cf0c5c2c6af130f7776efa13d9eb729559486f5978bbfc9d5d4ec487727","observation_id":"bf3897f7-3cf1-4dd2-8641-827a86680b12","resolution":{"observed_at":"2026-08-02T07:23:24.906088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-02T07:23:24.982944Z","title":"arXiv preprint arXiv:2503.14476 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.982944Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:48066240bb13b457e5d8b5f647bca5a4501cf9da5b93066e25a2700a003d7e24","observation_id":"9dca93f1-90c3-4970-bf38-5bce292e677c","resolution":{"observed_at":"2026-08-02T07:23:24.982944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-02T07:23:25.052567Z","title":"arXiv preprint arXiv:2503.20783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:25.052567Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:a481a5ba87da213d82a4e436b7a855c33bc0628b34986a76a3e56173a3e9ca4a","observation_id":"d398004d-dca2-4410-b88d-32b70387c35b","resolution":{"observed_at":"2026-08-02T07:23:25.052567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:25.055939Z","title":"arXiv preprint arXiv:2507.20673 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:25.055939Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:0a0c012f737e7b28cff4a5374375c3989668fb0f948338b69ca6069b83c67d82","observation_id":"56514245-048e-4c88-a373-e180751db1be","resolution":{"observed_at":"2026-08-02T07:23:25.055939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:25.058589Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:25.058589Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:bdfeebb9122fad649eb8771717be76082242d2653224a168e24d98ff709d836a","observation_id":"8522327a-21c8-42ba-924a-983938f2330c","resolution":{"observed_at":"2026-08-02T07:23:25.058589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-02T07:23:25.134121Z","title":"arXiv preprint arXiv:2507.18071 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:25.134121Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:0d29cf2774b3c4f3e0dc725740ea09b808b4c8c3457bb10a4339e6401c974691","observation_id":"786d679e-0833-4e47-a0a1-ed845b8e4855","resolution":{"observed_at":"2026-08-02T07:23:25.134121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:25.298585Z","title":"Your Efficient RL Framework Secretly Brings You Off-Policy RL Training , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:25.298585Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:7e6b436bb38efa2c824bf7a6517c8012b9a2f9f9d0069fd9f99605543328ca8c","observation_id":"1de4cc21-8ae0-4c05-b957-4778999137c0","resolution":{"observed_at":"2026-08-02T07:23:25.298585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:25.446955Z","title":"When Speed Kills Stability: Demystifying","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:25.446955Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:3e52ca2de83bde47b2c0915e21a23f27a63ba02e87086d1208dab62e655ad6eb","observation_id":"e4c92e99-8e6f-4e18-a5d5-b5e39c27a706","resolution":{"observed_at":"2026-08-02T07:23:25.446955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:25.588238Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:25.588238Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:7aa5819930ad74bf4d4acb9bcde822eea1aa4d46e20fa9d7827b077004c37f30","observation_id":"8aaa4bc6-f4aa-421c-9d84-a588d0c4a3fb","resolution":{"observed_at":"2026-08-02T07:23:25.588238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:25.770620Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:25.770620Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:90854d4e7e6931001f0dd1ecd105d26613624917f436946f6d387578fadf43ac","observation_id":"c7960eeb-f82d-4099-8439-dedf72049e49","resolution":{"observed_at":"2026-08-02T07:23:25.770620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:25.894447Z","title":"Small Leak Can Sink a Great Ship--Boost RL Training on MoE with IcePop! , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:25.894447Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:302ae13fda1427b37c065ebe0f3306f1a33df48d0cf6357c507e1d671f5d3311","observation_id":"4d271953-69c3-468e-ae90-1b7a0bc3e4af","resolution":{"observed_at":"2026-08-02T07:23:25.894447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:26.043996Z","title":"Reward Hacking in Reinforcement Learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:26.043996Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:3b664fa8f6def5254e4afac18e8dd0b3b3fe7a26415332bc630af7b03c9cb41f","observation_id":"2bbb3002-cd38-4609-962a-455a163933af","resolution":{"observed_at":"2026-08-02T07:23:26.043996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:26.169322Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:26.169322Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:e2837cca3e66f3d49e2fb3f14a60a405acc4c3b864c4994f09a185b349fcab53","observation_id":"ce7b66e2-fe00-47f2-9e65-f8d5409ac127","resolution":{"observed_at":"2026-08-02T07:23:26.169322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:26.324565Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:26.324565Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:229e877febe55a139c6a0942fbdd4e69a22f94ef5dd85c8b0fc46b4a4a2fe019","observation_id":"5181479d-b2d4-4764-b6a3-63147c4bdc3e","resolution":{"observed_at":"2026-08-02T07:23:26.324565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:26.485479Z","title":"arXiv preprint arXiv:2510.22543 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:26.485479Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:0eceb88b94c7a15c39a635f755750745daff61e6ed067b0b1d0f9596f8798dc7","observation_id":"75e1e575-ceae-4910-b4be-8f1b294b5501","resolution":{"observed_at":"2026-08-02T07:23:26.485479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04664","last_updated":"2025-09-04T21:26:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-04T21:26:31Z","title":"Why Language Models Hallucinate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04664","snapshot_observed_at":"2026-08-02T07:23:26.610302Z","title":"arXiv preprint arXiv:2509.04664 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:26.610302Z"},"links":{"cited_paper":"/paper/2509.04664","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:e4b4157291ef9dd9c232d1ae565bcc28e2a6d844f78949a7d81be71c46bc652d","observation_id":"f6ee98a5-88fd-4b88-afd1-bd1fff59d1b6","resolution":{"observed_at":"2026-08-02T07:23:26.610302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:26.753190Z","title":"arXiv preprint arXiv:2509.09177 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:26.753190Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:61c9885dc8a0276435a4ea1d81999b72503c53ef9118762bb178e463ce9f3ba8","observation_id":"644ec384-f034-42a5-b532-3af159802735","resolution":{"observed_at":"2026-08-02T07:23:26.753190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:26.879211Z","title":"arXiv preprint arXiv:2508.17850 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:26.879211Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:54761893d1c200282743d232f668057f4a7049d29dbb55957ad3b93fdf6a80da","observation_id":"a1f20914-edae-452f-bf14-017970f5e5bf","resolution":{"observed_at":"2026-08-02T07:23:26.879211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:27.022813Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:27.022813Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:f0644ad347d197b32279dfe64b3d8250b87b637cf14147d22267be1b9eabfa96","observation_id":"c05e314c-dd90-4047-aaac-b1b841762423","resolution":{"observed_at":"2026-08-02T07:23:27.022813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:27.135881Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:27.135881Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:557abd3f6924a224888d51ae9ee55a55d16c388b6ed60b5e35d132d60292a0b3","observation_id":"0a741d53-da2c-4f08-9894-e3d11f428091","resolution":{"observed_at":"2026-08-02T07:23:27.135881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09477","last_updated":"2025-06-11T07:43:33Z","snapshot_observed_at":"2026-07-06T21:40:17.050453Z","submitted_at":"2025-06-11T07:43:33Z","title":"On a few pitfalls in KL divergence gradient estimation for RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09477","snapshot_observed_at":"2026-08-02T07:23:27.338911Z","title":"arXiv preprint arXiv:2506.09477 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:27.338911Z"},"links":{"cited_paper":"/paper/2506.09477","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:603b66e0f0fb01e476b173f252152815cc2960c0fcb9eaee5e658521ee3b0220","observation_id":"52d4cd12-08db-4a46-9185-101a8416eb73","resolution":{"observed_at":"2026-08-02T07:23:27.338911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:27.495012Z","title":"arXiv preprint arXiv:2512.21852 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:27.495012Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:a8a0ac1ac9986fb931dd5df165691c726c5c071b292371de1a087a5133c2d8d4","observation_id":"8268c740-42ef-4ac1-8371-7bfda21e2a1e","resolution":{"observed_at":"2026-08-02T07:23:27.495012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:27.584045Z","title":"arXiv preprint arXiv:2510.20817 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:27.584045Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:22df3111cfc43ec87ba21d80dbe2460b3aeffcd75a99dfbe67ce3dfbd3b4f9ad","observation_id":"2250deb4-8107-49ac-9686-a8c2265794d8","resolution":{"observed_at":"2026-08-02T07:23:27.584045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:27.635901Z","title":"Beyond Reverse","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:27.635901Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:062d87542403c9c1f06f364dcb8164a7aaaddf13ff14e1181d9ff22f699e9da3","observation_id":"791ae013-e99d-4e5c-9fe0-14095100ee33","resolution":{"observed_at":"2026-08-02T07:23:27.635901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:27.740294Z","title":"First Conference on Language Modeling , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:27.740294Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:3caf0f88d50c3dbf5dc11235581903db24a7f0b44295436fdefe40a727ff5da6","observation_id":"2a94f418-4dc3-47e1-900f-7c6878ac2504","resolution":{"observed_at":"2026-08-02T07:23:27.740294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:27.805767Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:27.805767Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:5c24d7a49227f33774a3befd22e1d9d0fed878efee811fb680a998bc026bd1d9","observation_id":"4e73d123-5477-4d87-b305-e231911add6d","resolution":{"observed_at":"2026-08-02T07:23:27.805767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:27.878462Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:27.878462Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:3e121bc9141d67911f9dcae270aabcdcebdef14a0889072544df7a145c9df9f1","observation_id":"bf03e8f2-4be6-42ff-8570-0a3750bf6877","resolution":{"observed_at":"2026-08-02T07:23:27.878462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:27.968153Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:27.968153Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:bdd6a43840e2dbea3a6b766d122bdd4c890df0c4ebeebae8b985bc9f210154ea","observation_id":"0af955a8-16ca-4abe-8d0d-10a7dafbf55a","resolution":{"observed_at":"2026-08-02T07:23:27.968153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-02T07:23:28.043198Z","title":"arXiv preprint arXiv:2505.22617 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.043198Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:30e8df4dceaba63eda7e317cc08322d62d59d2d7f59b88e1481d99f1d9e88d81","observation_id":"7d932ad8-5103-4abf-8d8e-3a68b7e1d25b","resolution":{"observed_at":"2026-08-02T07:23:28.043198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:28.120890Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.120890Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:70d85a5f054497f4db3eb6a7b94656a6aad8f88136229aa47e88c66882783940","observation_id":"a6f435ce-a6d7-4e87-9064-dc2720359b4f","resolution":{"observed_at":"2026-08-02T07:23:28.120890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:28.195301Z","title":"2023 , cdate=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.195301Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:328e8bee68d848802c21554fb885802ed56c7867eebf7acf446e6147dcb1563c","observation_id":"12a94e09-3547-486a-90a6-3ad997509fb6","resolution":{"observed_at":"2026-08-02T07:23:28.195301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-02T07:23:28.266130Z","title":"arXiv preprint arXiv:1909.08053 , year=","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.266130Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:9614e7e17330b88c6f904ca917f091d20d493ab2000a234c2e7c895709d875de","observation_id":"cfdfc1eb-6ad9-477e-8379-337302f35f1e","resolution":{"observed_at":"2026-08-02T07:23:28.266130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-02T07:23:28.362049Z","title":"arXiv preprint arXiv:2504.14945 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.362049Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:2270c4bb42a43c8d51754dc411a36dce833f255f3df3b84921fb38da5a7ae022","observation_id":"53f87756-ad26-448a-93e4-ff1191eadeb9","resolution":{"observed_at":"2026-08-02T07:23:28.362049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:28.452592Z","title":"arXiv preprint arXiv:2506.07527 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.452592Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:ccb33cff7760f1badae964316bda87926cbc39b134bdf680eea4167e55137c51","observation_id":"7de04c6c-5efd-4ba3-ab2a-02f49bb48455","resolution":{"observed_at":"2026-08-02T07:23:28.452592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-07-06T21:47:01.972372Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-02T07:23:28.545828Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.545828Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:aa388911c219788934ebd6fb40b0dc7c9e17d9bd2863791add21bf5dfb26b7da","observation_id":"e7b7907b-ccc5-4b9b-be3f-b7943ba9f25f","resolution":{"observed_at":"2026-08-02T07:23:28.545828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:28.622105Z","title":"arXiv preprint arXiv:2509.04419 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.622105Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:324533e705d50adff7067941c85f8797c9d72abde587e96e6a674c2079ff9bdb","observation_id":"ebad1479-c453-443e-9776-30c06c72f2f6","resolution":{"observed_at":"2026-08-02T07:23:28.622105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09340","last_updated":"2025-06-11T02:44:10Z","snapshot_observed_at":"2026-07-06T21:40:07.249021Z","submitted_at":"2025-06-11T02:44:10Z","title":"RePO: Replay-Enhanced Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09340","snapshot_observed_at":"2026-08-02T07:23:28.717603Z","title":"arXiv preprint arXiv:2506.09340 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.717603Z"},"links":{"cited_paper":"/paper/2506.09340","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:cba275fbff85096708b932078f0738b59c8984185d01ffe51ee0fc365a397ae8","observation_id":"35b8c770-1527-4917-8fb3-60869d0916a8","resolution":{"observed_at":"2026-08-02T07:23:28.717603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-07-06T21:54:29.624793Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-08-02T07:23:28.818300Z","title":"arXiv preprint arXiv:2507.06892 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.818300Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:1c51cd50dbbd711bb3c309a4e941af764da19f69e0cd8a68f84e596f36d305e3","observation_id":"a6ba5694-badf-4fad-8793-20ff8e40f96b","resolution":{"observed_at":"2026-08-02T07:23:28.818300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:28.913789Z","title":"arXiv preprint arXiv:2510.02245 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.913789Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:03e10f1e3fb79de7dc8f3331f6225f6b97b92fe01b465008094c9e98b768efc1","observation_id":"eb6a0f3c-58e8-49d2-94f5-7c88251d8adf","resolution":{"observed_at":"2026-08-02T07:23:28.913789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-01T02:52:13.412687Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07451","snapshot_observed_at":"2026-08-02T07:23:29.013207Z","title":"arXiv preprint arXiv:2507.07451 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:29.013207Z"},"links":{"cited_paper":"/paper/2507.07451","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:763be778e48143744569e799475abae15a83c5c90fab3c0c07d469f800a58041","observation_id":"e769e426-7214-4d05-bd84-4105242bdd2e","resolution":{"observed_at":"2026-08-02T07:23:29.013207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04140","last_updated":"2026-07-01T03:04:05Z","snapshot_observed_at":"2026-08-04T11:33:53.462174Z","submitted_at":"2025-10-05T10:38:55Z","title":"Selective Expert Guidance for Effective and Diverse Exploration in Reinforcement Learning of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04140","snapshot_observed_at":"2026-08-02T07:23:29.108343Z","title":"arXiv preprint arXiv:2510.04140 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:29.108343Z"},"links":{"cited_paper":"/paper/2510.04140","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:908e21197a01f750ec2d1566ef329c4edcfb5588b13b5be7536a1087fd9940a1","observation_id":"f7fe8cac-6531-4408-99c4-1bd10dd168f0","resolution":{"observed_at":"2026-08-02T07:23:29.108343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:29.154734Z","title":"arXiv preprint arXiv:2510.03865 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:29.154734Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:f5a3ea4f7301e27e64da0c38464c7da33c4e46df8dfdeeefd36f86d0e4762ee1","observation_id":"8577ebe5-249b-4800-bb18-c975f86e57a1","resolution":{"observed_at":"2026-08-02T07:23:29.154734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:29.245333Z","title":"arXiv preprint arXiv:2509.07430 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:29.245333Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:0e8ada96de5323531458c34ab0404760b33518e70812eff8f71992ce3a90db71","observation_id":"44e25a45-8a51-4105-a098-e97129606755","resolution":{"observed_at":"2026-08-02T07:23:29.245333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:29.404192Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:29.404192Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:2ab5d62fc85134345d131ff1e942cfe2b7070b3ff82cb396d7ea645de91964fb","observation_id":"dd617188-aaca-41c7-8cff-f6e816320646","resolution":{"observed_at":"2026-08-02T07:23:29.404192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.02780","snapshot_observed_at":"2026-08-02T07:23:29.526424Z","title":"arXiv preprint arXiv:2601.02780 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:29.526424Z"},"links":{"cited_paper":"/paper/2601.02780","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:5e0bbd12ef11b8d3a4710b7986d5d21d39da16ac0b873b087636ef2dbd80b02f","observation_id":"9b022685-e7d2-4fbb-aa66-842bfd501e22","resolution":{"observed_at":"2026-08-02T07:23:29.526424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:29.693770Z","title":"arXiv preprint arXiv:2603.22117 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:29.693770Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:b487ce05bc7eb21f90b2c6b579dc1133a2c217d473e95e55bb39615393e0a75a","observation_id":"28cdf359-2843-4333-b14d-b21f1a92d30f","resolution":{"observed_at":"2026-08-02T07:23:29.693770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:29.817926Z","title":"arXiv preprint arXiv:2603.19835 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:29.817926Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:d8df0870c1586a417f6ebd06fcb2b7d8f2c50b97f3ea3e938a61be0a63b8d98b","observation_id":"682775fd-3a03-44a7-aa4c-dab4e66ddea5","resolution":{"observed_at":"2026-08-02T07:23:29.817926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:29.943795Z","title":"arXiv preprint arXiv:2603.22446 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:29.943795Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:ba0583b650a243e5ad3d47b248badc2a0eacc19a63811f2bad17fd76fc1fbee6","observation_id":"06234128-6f8c-46a4-a1cf-4929522df424","resolution":{"observed_at":"2026-08-02T07:23:29.943795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.30420","snapshot_observed_at":"2026-08-02T07:23:30.079906Z","title":"arXiv preprint arXiv:2606.30420 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:30.079906Z"},"links":{"cited_paper":"/paper/2606.30420","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:eaf6019037c7eda414e36b27d49b99d3b7d91ab5d423985e3959706336c30997","observation_id":"79e6168e-577f-4be5-ba8a-bb1cfab2dcca","resolution":{"observed_at":"2026-08-02T07:23:30.079906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.22156","snapshot_observed_at":"2026-08-02T07:23:30.215870Z","title":"arXiv preprint arXiv:2605.22156 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:30.215870Z"},"links":{"cited_paper":"/paper/2605.22156","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:4ff8b299fefd96f258105874e74576bcf5d917b59542d1ca58ad5b3e1d5f327c","observation_id":"9b5031bc-8e80-4294-bedd-c73a5983a727","resolution":{"observed_at":"2026-08-02T07:23:30.215870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-08-02T07:15:58.729767Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.22703","snapshot_observed_at":"2026-08-02T07:23:30.344213Z","title":"arXiv preprint arXiv:2605.22703 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:30.344213Z"},"links":{"cited_paper":"/paper/2605.22703","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:bdebf3b5c63e31f369b07230e13a699066bebd70a2492dda66160ba36267bd3c","observation_id":"50e9359a-fb92-42cc-a5c2-a388db996a82","resolution":{"observed_at":"2026-08-02T07:23:30.344213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2607.10481."}