{"as_of":"2026-08-16T07:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ce8ad772d26e72b1132109022d6feebb91755bee68a73165c4baad51fc45804e","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:45:52.887305Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.02522/citation-record","integrity":"/paper/2509.02522/integrity","json":"/paper/2509.02522/citation-record.json","paper":"/paper/2509.02522"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-15T16:45:52.790406Z","title":"Back to basics: Revisiting reinforce style optimization for learn- ing from human feedback in llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.790406Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:f58b16141bdef3889e80932a0181c31598e88f5da518433a753299fe4d0502a8","observation_id":"9a760af3-2a8c-4e3d-859e-b9fa0da584e9","resolution":{"observed_at":"2026-08-15T16:45:52.790406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-15T16:45:52.804111Z","title":"Process reinforcement through implicit rewards","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.804111Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:973e298c8069281c7ef64b93d85a46435bf2edc2d68b4f7638f810553d2b6fd0","observation_id":"4e41b69c-3b9d-4edd-bcb6-530852def8de","resolution":{"observed_at":"2026-08-15T16:45:52.804111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T16:45:52.808234Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.808234Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:a0f0d4dd20a67b31de886857f00148a1ecfb9afa78136c084ca0a1dc33311061","observation_id":"934bb97d-16b7-4811-afd0-f5fbb08a86e6","resolution":{"observed_at":"2026-08-15T16:45:52.808234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-16T04:57:30.418363Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-15T16:45:52.812942Z","title":"Reinforce++: An efficient rlhf algorithm with robustness to both prompt and reward models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.812942Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:afb29b48b5dffd333833fa222d1aee65b607908a0857d347e27c80be843c0df3","observation_id":"768f506d-3948-4e7f-bb26-68c93c54b937","resolution":{"observed_at":"2026-08-15T16:45:52.812942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-15T16:45:52.817433Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.817433Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:c6861c6ee0c9cc509f94e4651328d03742c039d9b6ec39fedafe16ba0e64a58c","observation_id":"6af9588c-b213-4a22-a3e6-78da12653897","resolution":{"observed_at":"2026-08-15T16:45:52.817433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-15T16:45:52.833521Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.833521Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:d962d8c714c25481b8975357d16584788df43f1bc2c71971e83041c8f6dfb7d7","observation_id":"7031dc5b-c461-444e-a4c3-f9889dbcefcb","resolution":{"observed_at":"2026-08-15T16:45:52.833521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12853","last_updated":"2025-02-18T13:40:22Z","snapshot_observed_at":"2026-08-15T17:59:08.664720Z","submitted_at":"2025-02-18T13:40:22Z","title":"S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12853","snapshot_observed_at":"2026-08-15T16:45:52.837578Z","title":"Ruotian Ma, Peisong Wang, Cheng Liu, Xingyan Liu, Jiaqi Chen, Bang Zhang, Xin Zhou, Nan Du, and Jia Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.837578Z"},"links":{"cited_paper":"/paper/2502.12853","citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:c12382a066deaac5ea5ccd7aa10abd56ed9647c2af3ca1891e5068e50b237896","observation_id":"9cb7f441-157c-410b-abca-fe9d2c731113","resolution":{"observed_at":"2026-08-15T16:45:52.837578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T16:45:52.841825Z","title":"Qwen-Team","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.841825Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:87679abac02a2214646d0a44bed8afde8eb21a421175ec5aa9909744c53b903e","observation_id":"6f514de6-b79c-4917-a74c-c10e0cf8eec0","resolution":{"observed_at":"2026-08-15T16:45:52.841825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T16:45:52.845717Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.845717Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:6406cf0a2c4d1f713c269b6acff54024e45b7c03120fc88f2c9b2752213e37cc","observation_id":"1265fb87-c9d8-41ed-9062-e64f80621dd1","resolution":{"observed_at":"2026-08-15T16:45:52.845717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-15T16:45:52.853063Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.853063Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:521ca1487821bec0e47b419eca4884b5eb8d82cf3e5b2abebcdceb0aa8792c8b","observation_id":"2e52fec5-6cef-4b89-bf40-61ad9bc8284f","resolution":{"observed_at":"2026-08-15T16:45:52.853063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-15T16:45:52.856659Z","title":"org/abs/2501.12599,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.856659Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:b45b8334f2f3f55c2c2e1292db8389a417775ad967fb20062e097df838ae370f","observation_id":"d8f95830-1523-4e2f-b223-1e20f2851fe1","resolution":{"observed_at":"2026-08-15T16:45:52.856659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-15T16:45:52.860369Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.860369Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:4103363bf8dc893f2cd6b40673c25ce8cd08dd666fc2c8a5c614a5dd14b23130","observation_id":"4e04719c-3cbf-4f4d-8cd9-ca2ab3fdb627","resolution":{"observed_at":"2026-08-15T16:45:52.860369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-14T16:01:52.772456Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-15T16:45:52.864217Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.864217Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:cec793f8d571c33fe4096304c11b1405df804d5dff35bb6cbaf28dcfc9edbea3","observation_id":"1fc4e330-70d5-43b0-801c-1c79e25d8c84","resolution":{"observed_at":"2026-08-15T16:45:52.864217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19590","last_updated":"2026-05-16T23:13:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T07:01:06Z","title":"Learning to Reason without External Rewards","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19590","snapshot_observed_at":"2026-08-15T16:45:52.868179Z","title":"Learning to reason without external rewards","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.868179Z"},"links":{"cited_paper":"/paper/2505.19590","citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:1b7a1b3f3d723fc5fd2ee11d845c2dc96fdf50a985862ae847bff3d1e8543691","observation_id":"93ce47fd-f543-4faa-a1b0-0f6923e9e6ca","resolution":{"observed_at":"2026-08-15T16:45:52.868179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-08-15T13:55:17.887932Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-15T16:45:52.872126Z","title":"Ttrl: Test-time reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.872126Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:8393ce75fd171fa0e9fe78399388adb836b92e3ac0fac65fca16daf6cef826ad","observation_id":"93124b95-4a0d-43c4-bd28-d6a928a984d3","resolution":{"observed_at":"2026-08-15T16:45:52.872126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:45:53.174819Z","title":"enumerate","venue":null,"work_id":"4eceaad6-413e-438d-a2eb-f7426f4d33e9","year":2024},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.875823Z"},"links":{"citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:1c523cca7b20afb4af5fcf7a07191d88c96268fff73d35e2987fa22d3e33a2fc","observation_id":"cdbee296-90bd-44a3-b8d5-efadb5dd55dc","resolution":{"observed_at":"2026-08-15T16:45:53.178524Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:45:53.149707Z","title":"Underlined numbers indicate the second best","venue":null,"work_id":"ef718169-429c-48c0-bf60-d494835df0a3","year":2025},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.883696Z"},"links":{"citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:e776dd2180bae59cc7b491e3dfc2f524ba36db68498507e19c7359785e580ca2","observation_id":"b8f6a080-9342-4718-a2d2-efeb014351ca","resolution":{"observed_at":"2026-08-15T16:45:53.153625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:45:53.136000Z","title":"Underlined numbers indicate the second best","venue":null,"work_id":"f0dbd6ed-908e-4592-8ea4-c3c8cf52badc","year":2025},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.887305Z"},"links":{"citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:e60b27ef676b8fddd16694382362b651cdef93c0e74489dab8742d46b6b32527","observation_id":"74585305-0a13-4ba2-b65c-9952860ec6b8","resolution":{"observed_at":"2026-08-15T16:45:53.141723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:45:53.161747Z","title":"Underlined numbers indicate the second best","venue":null,"work_id":"922bdd51-6434-4b35-bb53-9427ac131b23","year":2024},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":500,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.880121Z"},"links":{"citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:75b0fbe713482487c14cfc72ea0351dbd4a9ad34a5dab274c2ae6059a39e9e10","observation_id":"5f5adc9b-572e-43e6-b146-a9ba472389d6","resolution":{"observed_at":"2026-08-15T16:45:53.166668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:45:52.825621Z","title":"Wouter Kool, Herke van Hoof, and Max Welling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.825621Z"},"links":{"citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:29abac4683aaea48b3f69f2fb6a59dae7ba9f2ef2a44555ca0d8a02d144d1a2c","observation_id":"f599a921-8fb9-4d05-b1db-86aea98e227b","resolution":{"observed_at":"2026-08-15T16:45:52.825621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T16:45:52.849575Z","title":"Deepseekmath: Pushing the limits of mathemati- cal reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.849575Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:be32354d91b49394202d07b1381f59456b7e7ff14649ab0fb66f6e9a8f4fe800","observation_id":"4df44f2e-6bf6-4d89-90b8-86d56281d834","resolution":{"observed_at":"2026-08-15T16:45:52.849575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T16:45:52.795338Z","title":"Xiangxiang Chu, Hailang Huang, Xiao Zhang, Fei Wei, and Yong Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.795338Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:d1d547da1f91c57120e4ef6abf89ca5cd9b96fa4e5ed22cf2e169419c430f9c5","observation_id":"c0491cae-4d10-4eea-988a-cd8bb5fc6090","resolution":{"observed_at":"2026-08-15T16:45:52.795338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-15T16:45:52.829268Z","title":"Tulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.829268Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:1b61f341a27c8f35e116832f1d58e5958bbf3bd3e760b8cdb8392ea835100433","observation_id":"f4e868fc-b52f-4577-9da7-f280c4629213","resolution":{"observed_at":"2026-08-15T16:45:52.829268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-15T16:45:52.821880Z","title":"Vineppo: Refining credit assignment in rl training of llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.821880Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:f5dbaf4f65f46c488453d47116b124b55f7378067f44297cca56b74677146013","observation_id":"b07b515e-c171-45cd-8835-0d1c08964fb0","resolution":{"observed_at":"2026-08-15T16:45:52.821880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-15T16:45:52.799417Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capa- bilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.799417Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:8adc20aad0f2c2f95287d21a7a5a3e676b71d346a1e1ea2cae60f37630da8092","observation_id":"bae7135e-7c4d-4b15-86c9-6aab06d8faeb","resolution":{"observed_at":"2026-08-15T16:45:52.799417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2509.02522."}