{"as_of":"2026-08-10T07:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e7918612fdaacabe6b409e48fb7bbfb8f411cb61b714ceacd449469d64d64cdc","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T10:01:26.786756Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.11960/citation-record","integrity":"/paper/2601.11960/integrity","json":"/paper/2601.11960/citation-record.json","paper":"/paper/2601.11960"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:01:23.124399Z","title":"Bellemare, Sriram Srinivasan, Georg Ostrovski, Tom Schaul, David Saxton, and R \\' e mi Munos","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:23.124399Z"},"links":{"citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:546adfaef983aa73fdcd0b98015cb61d479d7c065b596066cf456350afee97ea","observation_id":"de93cd5b-a255-4ae4-b4af-eb7e298cce7c","resolution":{"observed_at":"2026-08-03T10:01:23.124399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-07-06T21:43:45.343005Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-03T10:01:23.184597Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:23.184597Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:affcff7d09937a20770608c8cdbb026d78a3f6d4ba9cd181c565daa4be532332","observation_id":"df6e4778-5269-45c0-88f6-44e35b543106","resolution":{"observed_at":"2026-08-03T10:01:23.184597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:01:23.323839Z","title":"Christiano, Jan Leike, Tom B","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:23.323839Z"},"links":{"citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:c9d5fcfdb93428cc5dcd981cd57061b0d7846335e327143d79319bc2c1f36a0b","observation_id":"83810eff-5631-467e-9a1c-b3d5faa660be","resolution":{"observed_at":"2026-08-03T10:01:23.323839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-03T10:01:23.465502Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:23.465502Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:853a1dbcebfa244fc6000eefe54899c43878841f5883490e8d74fe1aab523b98","observation_id":"e4f750a5-f8d4-4b08-a41a-cae44bc892b2","resolution":{"observed_at":"2026-08-03T10:01:23.465502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:01:23.598386Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:23.598386Z"},"links":{"citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:fbc6ede7d428f208ed368a8a632323bb2363348b93845a153107d6b864ccced2","observation_id":"2a4df2cc-5786-4c62-8279-14453832d4d8","resolution":{"observed_at":"2026-08-03T10:01:23.598386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-07T08:20:32.332400Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-03T10:01:23.711845Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:23.711845Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:4b5c82ba180204c3e32491652a0de7cfc131d85b6ce12af75ba18c0a2b9b3455","observation_id":"08bdac19-a887-43f9-8756-62dddc72b42e","resolution":{"observed_at":"2026-08-03T10:01:23.711845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T10:01:23.793563Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:23.793563Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:ce5cc9467f23a7f05bfd1ba5d6b015306d3787f621499309f33718e17710749a","observation_id":"fe7394cb-3bf2-42cc-95bf-a360fdece666","resolution":{"observed_at":"2026-08-03T10:01:23.793563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-03T10:01:23.977634Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:23.977634Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:eb0a5774e986cb16df48ec680774d8b8e26388f4a223c89f1e83492c3a05e8cb","observation_id":"a3718b81-1ec8-407e-83b2-b33a2b6ebd14","resolution":{"observed_at":"2026-08-03T10:01:23.977634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:01:24.108061Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:24.108061Z"},"links":{"citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:839e4dcf79d00fe123d0e29d3056124ddc6bdba8533a745e2c399dfa376f1b62","observation_id":"4359e8d4-22d2-4f64-ae2b-4eb44359f6ea","resolution":{"observed_at":"2026-08-03T10:01:24.108061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:01:24.165526Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:24.165526Z"},"links":{"citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:70371a0d481d5e325663e7aeef514b360aa2c8c1c0634cfd9f19605fdb721010","observation_id":"6ddb480e-8dd8-4ffb-9799-f6aab7625168","resolution":{"observed_at":"2026-08-03T10:01:24.165526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:01:24.235859Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:24.235859Z"},"links":{"citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:afb912696681a1e2ec7c6028000722b7a2a75e6cd6cdff2f44788044c9eb5ae0","observation_id":"896f061b-00f4-4a0e-95e1-d87943c4a162","resolution":{"observed_at":"2026-08-03T10:01:24.235859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-03T10:01:24.289678Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:24.289678Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:1a5e97885023f7b09b57a430bf8456c2f464c467fbc88fcb77096c9ba46f37d9","observation_id":"ecc0eea7-c38b-4c39-be4b-8c2c7c7efa47","resolution":{"observed_at":"2026-08-03T10:01:24.289678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-03T10:01:24.361961Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:24.361961Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:549b56c5f27af07e282e9a5be66ffeeef6521b7e9eb41ca50593cce19e5ce380","observation_id":"7cefa712-b75c-4fbc-ab67-0b56b131c00d","resolution":{"observed_at":"2026-08-03T10:01:24.361961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:01:24.418088Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:24.418088Z"},"links":{"citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:bdf2d89d641d4ad84266d55683db20748a4e3bab0a6f0a9185cb9d5126d95696","observation_id":"77d9dbf8-a841-4e7d-ba04-9821845fcff6","resolution":{"observed_at":"2026-08-03T10:01:24.418088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:01:24.482177Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:24.482177Z"},"links":{"citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:a53d978d702712997200dd95f1d9f0990d5eedfac33119faf568b38d9c7af68c","observation_id":"1e5abbef-0fb4-472b-920e-6c71c43a1b5f","resolution":{"observed_at":"2026-08-03T10:01:24.482177Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:01:24.583677Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:24.583677Z"},"links":{"citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:1a4ae4193978e87ade19dc74e926393e46107f82a256da08388020830d5c1935","observation_id":"26f60728-75b5-4ae3-aa3c-b533ba7f0d97","resolution":{"observed_at":"2026-08-03T10:01:24.583677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:01:24.703473Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:24.703473Z"},"links":{"citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:f5acb14d783c5e1a8697e1b5a091a84628cfbb0a158f0177a66ccda48918ce28","observation_id":"e03b6bc5-cfe7-43a8-b400-aeb42e093ad6","resolution":{"observed_at":"2026-08-03T10:01:24.703473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:01:24.827479Z","title":"Park, Junsu Kim, Gyeongman Kim, Jinyoung Jo, Sean Choi, Jaewoong Cho, and Ernest K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:24.827479Z"},"links":{"citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:7d55594e74a48a1a519b740f16867df2a14fc05459a5f0aede04ebe5cef0d837","observation_id":"31f5a61a-9a6b-4c37-9878-502cfd63b686","resolution":{"observed_at":"2026-08-03T10:01:24.827479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-03T10:01:24.966307Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:24.966307Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:4470f73884cb50f03b041169502b1ab79fba16d68c7b9af1e42c3705a573032d","observation_id":"072e22b8-610e-4e70-9e52-1140402e5bdd","resolution":{"observed_at":"2026-08-03T10:01:24.966307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-03T10:01:25.049961Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:25.049961Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:053c874b59711454b2bd1e5646475407524bbc85e4ef9c10573545544d5b9e4a","observation_id":"73f7241f-5bfc-422f-b655-5e7e3e9525d8","resolution":{"observed_at":"2026-08-03T10:01:25.049961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T10:01:25.107146Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:25.107146Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:42d801c70539102ab5fb3ee8117010d8019badbbac27f43111d6889fd3127bb4","observation_id":"0e73d007-56cc-40a1-ab2c-bab8052de6f1","resolution":{"observed_at":"2026-08-03T10:01:25.107146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:01:25.159166Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:25.159166Z"},"links":{"citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:2785bf0c11a7f2329bd8d66dcaf437043763e3a409d45d216de4c0592333e25f","observation_id":"123152b8-da22-41d5-a73c-f9116eb03e7f","resolution":{"observed_at":"2026-08-03T10:01:25.159166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:01:25.225411Z","title":"Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, Dario Amodei, and Paul F","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:25.225411Z"},"links":{"citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:cc4efda0e33960ba7214e2c4f8ba3ddb01adbac08d23a6d44f5d0ecf56e497ec","observation_id":"f259c5e4-0b05-431d-b06d-860e347777f2","resolution":{"observed_at":"2026-08-03T10:01:25.225411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:01:25.350439Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:25.350439Z"},"links":{"citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:3021f93a7c7d15a68a724d2d22f6e859583721a027eaae1297201cb878a8ebe5","observation_id":"507e3a6b-9f24-490b-b33b-6d11de912508","resolution":{"observed_at":"2026-08-03T10:01:25.350439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:01:25.453248Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:25.453248Z"},"links":{"citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:4a7c9692ae1d670a5f77c7d8db54645f6d6866f61778a09332d8ad4965a874bf","observation_id":"6e54eb95-f327-4220-9e32-1e2f4eafbb16","resolution":{"observed_at":"2026-08-03T10:01:25.453248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09501","last_updated":"2025-05-27T03:22:35Z","snapshot_observed_at":"2026-08-07T17:09:42.953110Z","submitted_at":"2025-03-12T16:05:31Z","title":"ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09501","snapshot_observed_at":"2026-08-03T10:01:25.490489Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:25.490489Z"},"links":{"cited_paper":"/paper/2503.09501","citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:dd1a952b352ae8f26877c7fbcda6ff84b5c63e211752d4110fab2f4707219c77","observation_id":"03613c47-f757-4d02-85a3-20eb907510f6","resolution":{"observed_at":"2026-08-03T10:01:25.490489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06700","last_updated":"2024-06-06T12:29:23Z","snapshot_observed_at":"2026-07-06T17:28:10.554625Z","submitted_at":"2024-02-09T07:45:26Z","title":"Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06700","snapshot_observed_at":"2026-08-03T10:01:25.614727Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:25.614727Z"},"links":{"cited_paper":"/paper/2402.06700","citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:5ad213f62f6071f695144f4b6f6bd44cf9f4a18ed446298e98ff08fa579ed2e9","observation_id":"31b0c102-880e-4755-bbaa-8d84bca1bb8a","resolution":{"observed_at":"2026-08-03T10:01:25.614727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:01:25.745607Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:25.745607Z"},"links":{"citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:f8a97d1a52b2751c07779d38ef80c3ab1f08a2cc3a61b58366665c16b22e2097","observation_id":"dd69d07a-9e81-4deb-8017-5450a211bc63","resolution":{"observed_at":"2026-08-03T10:01:25.745607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:01:25.860954Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:25.860954Z"},"links":{"citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:4e1ffc216db5c34656253233a944090f507c1bd371c657e3cb2a9980a2619bdd","observation_id":"68a64716-ac48-493d-98da-ceb42c2f96f6","resolution":{"observed_at":"2026-08-03T10:01:25.860954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:01:25.980371Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:25.980371Z"},"links":{"citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:bcb58fc227e808a4f5f4cfcae9399ea13315666db70745bd88eea46b1da63215","observation_id":"d1989704-4b62-4235-ab9d-3fb24ae7f43d","resolution":{"observed_at":"2026-08-03T10:01:25.980371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:01:26.120049Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:26.120049Z"},"links":{"citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:9f40ddb8871008a178528db36d3e9bc1300bdfdf2d2ce93b351e3fb0505b0f38","observation_id":"924bd161-e955-4f97-9a89-d39d01e7d3bb","resolution":{"observed_at":"2026-08-03T10:01:26.120049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T10:01:26.286249Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:26.286249Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:4869611b08070fde8fd452f6c0dab11813ee31a5fe8598c228f36b83589d7fa7","observation_id":"ef88384c-f0aa-4c12-8df2-2224cc34eff7","resolution":{"observed_at":"2026-08-03T10:01:26.286249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-03T10:01:26.427526Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:26.427526Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:58ad0b9bcfab56109cacbca615c5d3174c4ffa3b4c0dbb19a9d72a96f88b496c","observation_id":"eb28cef4-4463-444b-999f-a9bd72234041","resolution":{"observed_at":"2026-08-03T10:01:26.427526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:01:26.544678Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:26.544678Z"},"links":{"citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:92e8d3856424697f9e24da0d34ade20c65d2e8576c6c092901f80a96a33f96be","observation_id":"4b43a749-ca41-4c1a-841d-7204f0597a61","resolution":{"observed_at":"2026-08-03T10:01:26.544678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:01:26.631117Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:26.631117Z"},"links":{"citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:ec77bf8c4d2bef7ca75bf14ae43c0de7fcd741edc4674efb9128e9091c1a0aa3","observation_id":"69cc710c-9a75-43bd-8724-32f641e3ce03","resolution":{"observed_at":"2026-08-03T10:01:26.631117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:01:26.786756Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T10:01:26.786756Z"},"links":{"citing_paper":"/paper/2601.11960"},"observation_digest":"sha256:a45fd4136fa6aff97293bf993fa3dba006af7a985097db77c39b22cfc4915542","observation_id":"fe36e1f0-98b3-4da3-a948-14f4ff5733e9","resolution":{"observed_at":"2026-08-03T10:01:26.786756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.11960","last_updated":"2026-07-03T10:46:25Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T11:48:33.572679Z","submitted_at":"2026-01-17T08:30:50Z","title":"R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2601.11960."}