{"as_of":"2026-08-09T03:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:73ab45cfea80b0e20562e903df9b9f853346b79cd0ec9a13c9525763308f06eb","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T13:44:42.889956Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02149/citation-record","integrity":"/paper/2608.02149/integrity","json":"/paper/2608.02149/citation-record.json","paper":"/paper/2608.02149"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T13:44:40.090481Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:40.090481Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:42b64c6fdb0e2696fd38d37b8c57835b48b3d4a511464b31d23dd02b0d27c5d0","observation_id":"0d5209f4-e2fb-458e-992f-b0a770131b5b","resolution":{"observed_at":"2026-08-04T13:44:40.090481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:44:40.125359Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:40.125359Z"},"links":{"citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:e0b18bcb9f7ee335d407c59d3309d5d38755a3f838545da7f1cb8975eff64107","observation_id":"6d2b32d9-87b1-4bba-84ed-fc3f4ef25269","resolution":{"observed_at":"2026-08-04T13:44:40.125359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-07T12:11:52.874985Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-04T13:44:40.174330Z","title":"arXiv preprint arXiv:2508.10751 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:40.174330Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:a7bb0fb3767b60e66ab1bd59eb809f4f8206b48e643b75b7a0d7078784c1911a","observation_id":"53186b75-65a6-4686-bc35-4da457bbb35e","resolution":{"observed_at":"2026-08-04T13:44:40.174330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:44:40.218780Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:40.218780Z"},"links":{"citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:43c59f8abccddeb5c80f8d7778622ecd1e48f4f760c9fb5464307376bf5c562b","observation_id":"90afc498-6351-41c4-9777-6ca0d0fdedbd","resolution":{"observed_at":"2026-08-04T13:44:40.218780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14807","last_updated":"2026-06-16T08:24:10Z","snapshot_observed_at":"2026-08-06T05:26:40.214370Z","submitted_at":"2025-10-16T15:40:49Z","title":"Beyond the Sampled Token: Preserving Candidate Support in RLVR","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14807","snapshot_observed_at":"2026-08-04T13:44:40.295338Z","title":"arXiv preprint arXiv:2510.14807 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:40.295338Z"},"links":{"cited_paper":"/paper/2510.14807","citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:53b045d4e50e1284b171799a1d2e41488fd9a52c6d3e7726fef185702cc57185","observation_id":"323d704e-600f-4940-865d-198f5a908e14","resolution":{"observed_at":"2026-08-04T13:44:40.295338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:44:40.372508Z","title":"Machine learning , volume=","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:40.372508Z"},"links":{"citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:c64ea636c757ee9ad348d3348e79088dec61600cb5a11f0325349fa766bf2a28","observation_id":"729733ae-9987-4e8c-aca0-688845e6a566","resolution":{"observed_at":"2026-08-04T13:44:40.372508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:44:40.376806Z","title":"arXiv preprint arXiv:2602.02710 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:40.376806Z"},"links":{"citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:a1159b459afb1fdbedf0c270aa706753ab8e96a3f6003e9378627da2e055842a","observation_id":"ce21e18e-e14c-41af-a3f4-b49e12f096d5","resolution":{"observed_at":"2026-08-04T13:44:40.376806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T13:44:40.380372Z","title":"arXiv preprint arXiv:1707.06347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:40.380372Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:7799042ffd3d1bc5f0c1347467f17be43f1eb4344d7db4033787e7784416f669","observation_id":"8ab93098-64be-4742-aa57-a9f4fd05c4fd","resolution":{"observed_at":"2026-08-04T13:44:40.380372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:44:40.424271Z","title":"Transactions of the American Mathematical Society , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:40.424271Z"},"links":{"citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:f6d5a7b16835c3e624362d76c78a96050ff4546387e2b0620c7b8f632e933d2c","observation_id":"1dbc430a-0bee-4cfc-8b31-1a00ca4d3f7d","resolution":{"observed_at":"2026-08-04T13:44:40.424271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:44:40.546665Z","title":"Statistics & probability letters , volume=","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:40.546665Z"},"links":{"citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:e6c6d01d8a5739154c697cf237b89ce124cba65bed9fa75632b0e0028fed45de","observation_id":"a75913b7-3fc9-4ce1-ba32-f567b45c445b","resolution":{"observed_at":"2026-08-04T13:44:40.546665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:44:40.655152Z","title":"Canadian Journal of Mathematics , volume=","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:40.655152Z"},"links":{"citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:ef9d5d2f4b4403ca6c272963cd24bd10510d038e9948500e2884540f0df108e8","observation_id":"867b1ec8-7068-4172-a7ee-f67adb1efc2b","resolution":{"observed_at":"2026-08-04T13:44:40.655152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:44:40.813207Z","title":"arXiv preprint arXiv:2601.18779 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:40.813207Z"},"links":{"citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:a2ee7c57887309172708f079fa0a11c0374037b089ec1b7ca85dd71d26de3f95","observation_id":"9f0d7f77-bff0-4442-9fec-17be97ef1551","resolution":{"observed_at":"2026-08-04T13:44:40.813207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:44:40.932110Z","title":"arXiv preprint arXiv:2602.21189 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:40.932110Z"},"links":{"citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:e1abc5ce600aba48feb65bef78a1494b45d7636a4a6e0d386ee1256d44d36033","observation_id":"451ef461-c10a-47a3-8426-8130383d516c","resolution":{"observed_at":"2026-08-04T13:44:40.932110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T13:44:41.090156Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:41.090156Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:7daa32aecbfe2286683665e85430d48ac15c1ca986151146856947473500b04f","observation_id":"22a0bc3d-0cdd-49bb-a5aa-83258e00ca71","resolution":{"observed_at":"2026-08-04T13:44:41.090156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:44:41.231524Z","title":"Proceedings of the Twentieth European Conference on Computer Systems , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:41.231524Z"},"links":{"citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:9a97d6772b0c32d21b1e23360e6545439aa7d587c003bce9afe1c0fb6a49f1a7","observation_id":"511f50f6-471c-4206-bb31-8a581321acdf","resolution":{"observed_at":"2026-08-04T13:44:41.231524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-04T13:44:41.310367Z","title":"arXiv preprint arXiv:2103.03874 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:41.310367Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:d2ccee0f0426437ecf53327cb2c6ce0406eeaf497e25e10f1b42815610aba670","observation_id":"ed68086f-f966-48d3-8a3f-f15ffe3fafd5","resolution":{"observed_at":"2026-08-04T13:44:41.310367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:44:41.515791Z","title":"2025 , howpublished =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:41.515791Z"},"links":{"citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:3f4f981b14c6cf7a6f3cb4b2f4f7a7a6113d5be18cce42bf9cd7f25742900810","observation_id":"c376b6d3-0b92-41b0-a44d-bc5e95ab786f","resolution":{"observed_at":"2026-08-04T13:44:41.515791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19461","snapshot_observed_at":"2026-08-04T13:44:41.612646Z","title":"arXiv preprint arXiv:2605.19461 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:41.612646Z"},"links":{"cited_paper":"/paper/2605.19461","citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:0f558c04799bd3520eccd355cf203ec4c2b5d4b10e0331aea7e33778f54c8b8f","observation_id":"50d1c619-e285-4906-a690-0e82a7612cc1","resolution":{"observed_at":"2026-08-04T13:44:41.612646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:44:41.707471Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:41.707471Z"},"links":{"citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:7c8abffe5fe8d17db8d492c85c04fc0bcbd9d3df9daf2ff3dd0fe81d69121405","observation_id":"e18ef7a0-5499-4bff-8516-6b38465b8313","resolution":{"observed_at":"2026-08-04T13:44:41.707471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00674","last_updated":"2026-05-15T17:10:37Z","snapshot_observed_at":"2026-07-06T23:14:01.852096Z","submitted_at":"2026-05-01T13:56:34Z","title":"Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.00674","snapshot_observed_at":"2026-08-04T13:44:41.794435Z","title":"arXiv preprint arXiv:2605.00674 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:41.794435Z"},"links":{"cited_paper":"/paper/2605.00674","citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:62a456975447a8996adc7832621a0d57d31ff469fb4f54dc0905f3f42701e1b0","observation_id":"eb3425a5-3729-4f41-a508-4b9dfa134d56","resolution":{"observed_at":"2026-08-04T13:44:41.794435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-04T13:44:41.925937Z","title":"arXiv preprint arXiv:2411.15124 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:41.925937Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:afb8ecfca5c55e2c3d679f14d14ce49294d76536864e6701734e37b2d6bca520","observation_id":"dd81640a-f32f-4349-8699-8fd4c34fdef8","resolution":{"observed_at":"2026-08-04T13:44:41.925937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T13:44:42.094603Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:42.094603Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:24d9de373f55efa112ad625b845ea22b12630969ba3fed477d7b0b03eebd7165","observation_id":"76bb9b35-0e89-426d-aa2d-8445e1964eca","resolution":{"observed_at":"2026-08-04T13:44:42.094603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-07-10T23:18:22.383935Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.06223","snapshot_observed_at":"2026-08-04T13:44:42.254343Z","title":"arXiv preprint arXiv:2607.06223 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:42.254343Z"},"links":{"cited_paper":"/paper/2607.06223","citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:acf25a6b04257ad24dfd82beda444b66c8cb6cfcb3f73e5595084e92c176cb78","observation_id":"601c01fc-f827-46be-80ab-f4ef28a8bd95","resolution":{"observed_at":"2026-08-04T13:44:42.254343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:44:42.441366Z","title":"arXiv preprint arXiv:2509.25133 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:42.441366Z"},"links":{"citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:38e2b25486e604363afb0f404cc7f8da54c18503af05ea4ac4b10a57738d6e3d","observation_id":"c5e6ef5a-aab2-45de-8d24-68d3f06d044f","resolution":{"observed_at":"2026-08-04T13:44:42.441366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:44:42.515466Z","title":"Findings of the Association for Computational Linguistics: ACL 2026 , pages=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:42.515466Z"},"links":{"citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:c80bedd86204f28c47552c0c25c4199e76ca7843c7d5fbeed1057798b45970ea","observation_id":"1616428c-6970-468b-a01c-d481697f6cfd","resolution":{"observed_at":"2026-08-04T13:44:42.515466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:44:42.573566Z","title":"arXiv preprint arXiv:2509.15207 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:42.573566Z"},"links":{"citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:ac84a2146ee8d377256186b7cab6915700fae1492c6791d2b5532d4240647bfa","observation_id":"33f4a1b7-835d-41e6-a3a1-1ad31fd9f8fa","resolution":{"observed_at":"2026-08-04T13:44:42.573566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:44:42.659322Z","title":"arXiv preprint arXiv:2509.26209 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:42.659322Z"},"links":{"citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:3e2a6d69494cf6d7439267b5e61f6d63fbfa9dc8a245da708531d2f78d3fa536","observation_id":"ab809372-8108-4b96-a612-56dd41d4016c","resolution":{"observed_at":"2026-08-04T13:44:42.659322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17445","last_updated":"2025-08-24T16:52:37Z","snapshot_observed_at":"2026-08-05T16:50:00.721840Z","submitted_at":"2025-08-24T16:52:37Z","title":"TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17445","snapshot_observed_at":"2026-08-04T13:44:42.721995Z","title":"arXiv preprint arXiv:2508.17445 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:42.721995Z"},"links":{"cited_paper":"/paper/2508.17445","citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:2d919302bfb6ee5907123fe4f05e55f082eb90c32d1209051528b8e05cd1c224","observation_id":"f465618d-2642-4c03-99f4-85b6e8c5f630","resolution":{"observed_at":"2026-08-04T13:44:42.721995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:44:42.764654Z","title":"Springer Series in Statistics ( , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:42.764654Z"},"links":{"citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:7fd10a73e081fd9a98ac930f7a55aa41e91cb9b7a8abf7e6ab65264f15f61df2","observation_id":"74c03c94-b637-4681-8f32-77dc7cceaec1","resolution":{"observed_at":"2026-08-04T13:44:42.764654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:44:42.817011Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:42.817011Z"},"links":{"citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:612fd5040bf4c0ba7082b5e8eb01949373e83db6f64f9cc50af124cb7c18cd5f","observation_id":"d97f1f9c-884e-43d8-b2bb-2ee87fa170d5","resolution":{"observed_at":"2026-08-04T13:44:42.817011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-08T15:29:26.223468Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-04T13:44:42.889956Z","title":"arXiv preprint arXiv:1506.02438 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:42.889956Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:0879cce28e6184419dbaf8535d9febf1678f9aa01fd93a1588669cc79aead333","observation_id":"d3f7cfcf-88a9-4fe6-9cbb-5f4d42b469ec","resolution":{"observed_at":"2026-08-04T13:44:42.889956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T06:33:22.275227Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2608.02149."}